Конверт Майстер

Сканований PDF і OCR: чому текст не виділяється

Чому в сканованому PDF не виділяється текст, як відрізнити скан від звичайного документа і які є варіанти OCR-розпізнавання українською мовою.

Ви відкриваєте PDF, бачите на екрані текст, ведете по ньому мишею — і замість підсвіченого слова отримуєте синій прямокутник на всю сторінку. Або взагалі нічого. Це не збій переглядача й не захист документа: перед вами сканований PDF, у якому тексту фізично немає. Розберемося, звідки такі файли беруться, як їх відрізнити за п'ять секунд і що реально можна зробити.

Два зовсім різні файли з однаковим розширенням #

Розширення .pdf нічого не говорить про вміст. Під ним ховаються дві принципово різні речі.

Текстовий PDF народжується з електронного документа: ви натиснули «Зберегти як PDF» у Word, експортували звіт із бухгалтерської програми, роздрукували сторінку у віртуальний принтер. Усередині лежать справжні символи з координатами й вбудованими шрифтами. Такий файл можна шукати, копіювати, конвертувати.

Сканований PDF — це фотографія паперу. Апарат зробив знімок аркуша, поклав його на сторінку PDF і на цьому все. З погляду комп'ютера там немає ані літер, ані слів: є мільйони пікселів різного кольору. Людина бачить текст, програма — картинку.

Різниця не косметична. Практично все, що ви хочете зробити з документом — знайти в ньому слово, скопіювати абзац, витягти таблицю, перекласти, перевірити на плагіат — вимагає текстового шару. Немає шару — немає операції.

Тест на п'ять секунд #

Найшвидший спосіб визначити тип файлу:

  1. Відкрийте документ у переглядачі PDF.
  2. Спробуйте виділити мишею одне слово посеред абзацу.
  3. Якщо слово підсвітилося акуратно по контуру — це текстовий PDF.
  4. Якщо виділився прямокутник на пів сторінки або нічого не сталося — це скан.
  5. Для контролю натисніть Ctrl+F і пошукайте слово, яке точно є в документі. Нічого не знайшлося — підтверджено, скан.

Є ще один надійний спосіб — спробувати витягти текст з документа. Якщо на виході порожньо або кілька випадкових символів, текстового шару немає. Це, до речі, найчесніша діагностика: інструмент дістає рівно те, що є всередині файлу, без домальовування.

Змішані документи трапляються часто: перші сторінки набрані на комп'ютері, а остання — вклеєний скан підписаної сторінки з печаткою. Тоді пошук працює по частині документа, і це збиває з пантелику. Перевіряйте саме ту сторінку, яка вам потрібна.

Звідки беруться скановані PDF #

Найтиповіші джерела:

  • офісні багатофункціональні пристрої — сканують у PDF за замовчуванням без розпізнавання;
  • фотографії документів із телефона, зібрані в PDF;
  • архівні матеріали — оцифровані справи, старі накази, витяги;
  • факси й документи, роздруковані та відскановані наново заради підпису й печатки;
  • захисні експорти — коли відправник свідомо перетворює сторінки на зображення, щоб текст не можна було легко скопіювати.

Останній пункт пояснює, чому іноді документ від контрагента виглядає ідеально рівним, як електронний, але текст усе одно не виділяється. Це не скан у прямому сенсі — сторінки просто відмальовані як картинки.

Що таке OCR і чому це окрема технологія #

OCR (optical character recognition, оптичне розпізнавання символів) — це аналіз зображення, під час якого програма знаходить на картинці форми, схожі на літери, і зіставляє їх із символами алфавіту. На виході з'являється текст, який можна накласти на скан невидимим шаром: візуально документ не змінюється, але пошук і копіювання починають працювати.

Це складне завдання, ніяк не пов'язане з обробкою PDF як такого. Розпізнавачу потрібні натреновані мовні моделі, словники, правила для кожної мови окремо. Українська з її апострофами, літерами «і», «ї», «є», «ґ» та схожими за формою символами потребує окремої моделі — інакше «и» перетворюється на «н», а «ї» на «і».

Тому важливо розуміти: OCR ніколи не дає стовідсоткової точності. Якісний скан друкованого тексту розпізнається з точністю 98–99%, що звучить чудово, поки не порахувати: на сторінці в 2000 символів це 20–40 помилок. У номері рахунку чи сумі одна така помилка коштує дорого.

Що псує розпізнавання найбільше:

  • низька роздільна здатність — менш ніж 200 dpi, а для дрібного шрифту й 300 замало;
  • перекошений аркуш — навіть нахил на 2–3 градуси помітно знижує точність;
  • тіні, бліки й нерівне освітлення на фотографіях;
  • рукописний текст — розпізнається погано, а український почерк особливо;
  • печатки й підписи поверх тексту;
  • таблиці зі складною структурою — цифри розпізнаються, структура губиться;
  • сірий або жовтуватий фон старого паперу.

Чим розпізнати текст #

Наш сайт OCR не виконує — це чесна відповідь, а не скромність. Усі наші інструменти працюють локально у браузері, а повноцінне розпізнавання з мовними моделями там не помістилося б. Тому ось перелік того, чим це реально роблять.

ІнструментУкраїнськаВартістьОсобливості
Google DocsТакБезкоштовноЗавантажте PDF на Google Диск і відкрийте його через «Google Документи» — текст розпізнається автоматично. Верстка не зберігається. Файл потрапляє в хмару
Adobe Acrobat ProТакПідпискаНайкраще зберігає оформлення й таблиці, робить скан пошуковим без зміни вигляду
ABBYY FineReaderТак, дуже добреПлатноІсторично сильний на кирилиці, найкраще працює з таблицями й багатоколонковою версткою
TesseractТак, з мовним пакетом ukrБезкоштовно, відкритий кодЗапускається локально з командного рядка, нічого нікуди не надсилає. Потрібні технічні навички
Вбудований сканер iOS / Google ДискЧастковоБезкоштовноЗручно для одиничних сторінок прямо з телефона

Коротка порада щодо вибору: для разового документа без секретів найпростіший шлях — Google Docs. Для регулярної роботи з договорами та звітами виправдовується Acrobat або FineReader. Якщо документи конфіденційні й не мають залишати ваш комп'ютер, єдиний безкоштовний варіант — Tesseract локально.

Перш ніж вивантажувати документ у хмарний сервіс розпізнавання, подумайте, що в ньому написано. Медична виписка, паспорт, договір із сумами — це саме той випадок, коли зручність не варта ризику. Про що варто питати онлайн-сервіси, ми писали в матеріалі про безпеку документів онлайн.

Що можна зробити зі сканом без розпізнавання #

Скан — не безнадійний файл. Без OCR із ним усе одно доступно чимало:

  • переглядати, гортати, друкувати — тут різниці немає взагалі;
  • видаляти, повертати й переставляти сторінки — операції зі сторінками не залежать від наявності тексту;
  • об'єднувати кілька сканів в один документ або, навпаки, розділяти;
  • стискати — скани важать багато, і зменшити їх зазвичай вдається суттєво, про це є розбір як стиснути PDF;
  • зберігати сторінки як зображення через PDF в JPG, якщо їх треба кудись вставити;
  • додавати водяний знак і нумерацію сторінок.

Чого зі сканом зробити не вийде принципово: знайти слово пошуком, скопіювати абзац, отримати редагований Word-документ або таблицю в Excel. Усі ці операції беруть дані з текстового шару, а його немає.

Як не створювати скани там, де можна без них #

Найкраще розпізнавання — те, якого не довелося робити.

  • Просіть електронний оригінал. У 90% випадків у відправника він є: документ спочатку набирали в Word чи в обліковій системі, і лише потім роздрукували й відсканували.
  • Не роздруковуйте заради підпису. Якщо потрібен саме юридично значущий підпис, електронний варіант зберігає документ текстовим.
  • Скануйте одразу з розпізнаванням, якщо ваш офісний апарат це вміє — у налаштуваннях зазвичай є пункт «Searchable PDF».
  • Знімайте акуратно, коли іншого виходу немає: рівно, при денному світлі, без тіней. Практичні поради зібрані в матеріалі про те, як зробити PDF з фотографій.
  • Ставте 300 dpi для сканування текстових документів. 150 достатньо для перегляду, але для подальшого розпізнавання замало.

Часті запитання

Чому в PDF не виділяється текст мишею?

Тому що документ складається із зображень сторінок, а не з символів. Так буває, коли файл отримали зі сканера, зробили з фотографій або свідомо експортували сторінки як картинки. Виділяти в такому файлі просто нічого.

Як зрозуміти, чи мій PDF сканований?

Спробуйте виділити слово мишею й пошукати щось у документі через Ctrl+F. Якщо виділяється прямокутник на всю сторінку, а пошук нічого не знаходить — це скан. Той самий висновок дає спроба витягти з файлу текст: результат буде порожнім.

Чи можна розпізнати текст у PDF безкоштовно?

Так. Найдоступніший спосіб — завантажити файл на Google Диск і відкрити його через Google Документи: текст розпізнається автоматично, зокрема українською. Для локального розпізнавання без передавання файлів існує безкоштовний Tesseract із мовним пакетом `ukr`.

Наскільки точно розпізнається українська мова?

Для чіткого друкованого тексту сучасні системи дають 98–99% точності, тобто кілька десятків помилок на сторінку. Найчастіше плутаються схожі за формою літери, апострофи та закінчення, тому розпізнаний текст обов'язково треба вичитувати — особливо цифри й прізвища.

Чому ваш сайт не робить OCR?

Тому що всі наші інструменти працюють локально у браузері, а повноцінне розпізнавання потребує великих мовних моделей і серверних потужностей. Ми свідомо не додаємо функцію, яка змусила б вивантажувати ваші документи на сервер.

Чи можна витягти таблицю зі сканованого PDF?

Не безпосередньо. Спершу документ потрібно пропустити через розпізнавання, і навіть тоді структура таблиці часто губиться — цифри розпізнаються, а поділ на стовпці ні. Найкраще з таблицями на сканах справляються спеціалізовані платні програми.

PDF у текст — спробуйте просто зараз

Дістати чистий текст із документа для копіювання чи подальшої обробки. Файл не завантажується на сервер, реєстрація не потрібна.

Відкрити інструмент

Схожі статті

Практичні інструкції з нашого блогу.