PDF у текст — таблиця втрат полів і шарів
PDF у текст: що губиться при витяганні шару. Таблиця «поле → що буде в TXT», колонки, колонтитули, скан і чому це вже не Word і не Excel онлайн.
PDF у текст губить усе, що не є гліфом з координатами. Витяг читає текстовий шар PDF.js, збирає рядки за Y і пише UTF-8. Немає стилів, немає гарантованих колонок, немає картинок. Це довідник втрат, не «як відкрити PDF». Для скриптів дивіться сусідню сторінку PDF у текст для скриптів.
- Відкрийте PDF і спробуйте виділити слово — якщо не виділяється, у TXT не буде речень.
- Витягніть шар через PDF у текст і звірте з екраном оригіналу.
- Якщо потрібна таблиця — PDF у Excel; якщо абзаци — PDF у Word.
Таблиця втрат: поле → що буде в TXT #
| У PDF | У TXT | Чому |
|---|---|---|
| Звичайний рядок тексту | Рядок, порядок згори вниз | Координата Y |
| Дві колонки на сторінці | Часто змішані рядки | Немає поняття «колонка» |
| Таблиця з лініями | Текст клітинок у рядках | Лінії ігноруються |
| Колонтитул / номер сторінки | Повторюється на кожній сторінці | Це теж гліфи |
| Жирний, кегль, колір | Зникає | TXT не має стилів |
| Картинка, підпис на скані | Порожньо | Немає шару |
| Векторний логотип | Порожньо | Не текст |
| Форма, анотація, коментар | Зазвичай немає | Інший об’єкт PDF |
| Порядок «спочатку права колонка» | Як у content stream | Автор PDF так намалював |
| М’який перенос / розбитий рядок | Може склеїтися або розірватися | Допуск rowTol |
Парсер враховує порожні елементи PDF.js як шпації між колонками — інакше «Київ» + «2024» злипнеться. Це унікальна поведінка нашого збору рядків, не «магія хмари».
Скан: сканований PDF і OCR. Word зберігає більше структури, але теж здогадується: PDF у Word.
Що формат TXT принципово не вміє #
Не вміє сторінок, не вміє гіперпосилань як об’єктів, не вміє вкладених файлів, не вміє цифрового підпису. Витяг не є копією юридичного PDF: це чорновик для пошуку. Не відправляйте TXT замість підписаного оригіналу.
Якщо в шарі лежить прихований текст за білою плашкою, він може потрапити у TXT. Обрізання CropBox його не викидає. Для конфіденційного — растеризуйте видиме в PDF у PNG і збирайте заново.
Коли витяг бреше «все добре» #
Файл з нестандартним ToUnicode дає квадратики або чужу кирилицю — символи «є», але не ті. Тоді проміжний TXT усе одно шкідливий: ви понесете помилку в скрипт. Перевірте прізвища очима.
Часті запитання
Чому з PDF зникли колонки в тексті?
Бо TXT — один потік. Колонки в PDF — це лише близькі X. Для колонок беріть Excel-конвертер.
Чи потрапляють колонтитули в TXT?
Так, якщо вони в текстовому шарі. Видаліть їх пошуком-заміною або витягніть лише потрібні сторінки спочатку.
Чому файл порожній, хоча я бачу текст?
Ви бачите картинку сторінки. Шару немає. Потрібен OCR, якого тут немає.
Чи можна відновити PDF з TXT?
Ні як оригінал. З тексту можна зібрати новий документ у [текст у PDF](/instrumenty/tekst-v-pdf/) — це вже інший файл без підпису й верстки.