Сканований PDF і OCR: чому текст не виділяється
Чому в сканованому PDF не виділяється текст, як відрізнити скан від звичайного документа і які є варіанти OCR-розпізнавання українською мовою.
ЧитатиЗавантажте дві версії документа — інструмент зіставить їх за текстом і покаже посторінково, які рядки додані, які видалені, а які змінені. Обидва файли лишаються на вашому пристрої.
Перетягніть два PDF для порівняння
Обрати файлиперший файл — стара версія, другий — нова; порядок змінюється перетягуванням
Інструмент витягує текстовий шар з обох документів і зіставляє його рядок за рядком. Результат — три типи відмінностей: рядок з’явився у новій версії, рядок зник, рядок змінився. Кожна відмінність прив’язана до сторінки, тож ви одразу знаєте, куди дивитися в оригіналі.
Найчастіше це потрібно з договорами. Контрагент повернув «ту саму» редакцію з правками, які ніхто не виділив кольором і не описав у листі. Вичитувати сорок сторінок удруге — година уваги; побачити п’ять змінених рядків — хвилина.
Так само зручно з кошторисами, технічними завданнями, положеннями й регламентами, які оновлюються щокварталу. Якщо потрібне не порівняння, а просто чистий текст документа, візьміть PDF у текст.
Це порівняння тексту, а не зображення сторінки. Ось що лишиться непоміченим:
| Тип відмінності | Чи побачить інструмент |
|---|---|
| Змінене слово, речення, абзац | Так |
| Доданий або видалений пункт | Так |
| Текст усередині таблиці | Так, але порядок клітинок може відрізнятися від візуального |
| Інший шрифт, кегль, колір, накреслення | Ні |
| Зсунуті відступи, інші поля, новий розрив сторінки | Ні |
| Замінені логотип, печатка, підпис, фотографія | Ні |
| Скан без текстового шару | Ні |
Іншими словами, інструмент відповідає на питання «що написано інакше», а не «що виглядає інакше». Візуальні відмінності в оформленні доведеться шукати очима — наприклад, відкривши обидві версії поруч у переглядачі PDF.
Усередині сканованого документа тексту немає — там лежить зображення аркуша. Для комп’ютера це набір пікселів, у якому немає ані слів, ані рядків. Тому порівняння поверне порожній результат навіть тоді, коли очима видно повну сторінку тексту.
Перевірити просто: відкрийте PDF і спробуйте виділити мишкою будь-який рядок. Виділяється й копіюється — текстовий шар є, порівняння спрацює. Не виділяється — перед вами скан.
Щоб зі скана отримати текст, потрібне оптичне розпізнавання (OCR), і ми його не виконуємо. Варіанти описані у статті про сканований PDF і OCR. Після розпізнавання документ порівнюється як звичайний текстовий.
Ні. У сканах немає текстового шару, а розпізнавання (OCR) ми не робимо. Документ спершу треба розпізнати сторонніми засобами й лише потім порівнювати.
Він зіставляє текст, а не картинку сторінки. Змінений шрифт, колір, відступи чи інший логотип для нього виглядають однаково, бо самі слова не змінилися.
Відкрийте документ і спробуйте виділити рядок мишкою. Якщо текст виділяється й копіюється — шар є.
Текст із клітинок порівнюється, але порядок читання в PDF не завжди збігається з візуальним. У складних таблицях результат варто перевірити очима.
Ні. Обидва файли читаються у вашому браузері, зіставлення виконується локально. Це важливо для договорів і кошторисів із комерційними умовами.
Кілька сотень сторінок опрацьовуються нормально, хоча витягування тексту займе кілька секунд. Дуже великі файли краще порівнювати частинами.
Усе поруч — переходьте, не втрачаючи часу на пошук.
Практичні інструкції з нашого блогу.
Чому в сканованому PDF не виділяється текст, як відрізнити скан від звичайного документа і які є варіанти OCR-розпізнавання українською мовою.
ЧитатиЧи безпечно завантажувати документи на онлайн-сервіси: які ризики реальні, як читати політику конфіденційності та коли обробка в браузері рятує.
ЧитатиЩо таке метадані PDF, які дані про вас зберігає файл і як їх переглянути, відредагувати чи видалити перед надсиланням документа стороннім людям.
ЧитатиТе, що зазвичай шукають поруч із цим інструментом.