Автоматизация30 сентября · MakeBiz · 6 минут

Распознавание текста документов: зачем нужен текстовый слой

Распознавание превращает картинку документа в текст, по которому работает поиск. Разбираем, что такое текстовый слой, что он даёт архиву договоров и счетов и в какой момент одного текста перестаёт хватать.

Распознавание текста документов это получение из изображения документа букв и цифр, которые компьютер умеет читать. Результат называют текстовым слоем: документ выглядит по-прежнему, но внутри у него появляется текст, по которому работают поиск и копирование.

Приходят за этим чаще всего по одной причине: в компании лежит архив сканов, и найти в нём нужный договор можно только по имени файла или по памяти сотрудника.

Что такое текстовый слой

Скан или фотография это картинка. Для компьютера в ней нет ни слов, ни цифр, только точки разного цвета. Текстовый слой это невидимая текстовая копия содержимого, которую распознавание кладёт поверх картинки.

Внешне документ не меняется, меняется то, что с ним можно делать: искать, выделять, копировать, отдавать другим программам.

У части PDF текстовый слой есть с рождения: файл выгружен из Word или из учётной системы. У сканов и фотографий его нет никогда, и появляется он только после распознавания.

Что документ умеет до и после распознавания

Разница видна не в том, как документ выглядит, а в том, какие действия с ним становятся возможны.

ЗадачаСкан без текстового слояПосле распознавания
Найти документ по слову из текстаТолько перебором глазамиОбычный поиск по папке или по системе
Скопировать реквизиты или номер счётаПерепечатать рукамиВыделить и скопировать
Проверить, есть ли в договоре пунктОткрыть и прочитать целикомПоиск внутри документа
Передать документ другой программеТолько как картинкуКак текст, с которым она работает
Прочитать документ голосом, сделать доступным незрячему сотрудникуНевозможноРаботает штатными средствами

Главное в этой таблице то, чего в ней нет: сравнения документов между собой и подсчётов. Текстовый слой делает документ читаемым, но не превращает его содержимое в данные.

Покажем, что достанется из ваших документов
Пришлите пачку реальных документов: разберём их и покажем, что получится на выходе. Дальше посчитаем подключение под ваш объём.

Поиск по архиву: ради чего это обычно делают

Типичная картина: несколько тысяч сканов в сетевой папке, имена вида scan_0142.pdf и один человек, который помнит, где что лежит. Пока он на месте, архив работает.

После распознавания архив ищется по содержимому: по названию контрагента, по номеру счёта, по фразе из договора. Поиск перестаёт зависеть от того, как назвали файл.

Второй эффект тише, но заметнее в деньгах: документы перестают теряться. Если документ находится поиском, его не сканируют второй раз и не запрашивают у контрагента заново.

Проверка, нужен ли вам текстовый слой: попробуйте найти в своём архиве договор, зная только фамилию подписанта. Если это заняло больше минуты, ищет не система, а сотрудник.

Три случая, в которых непрозрачный архив стоит денег

Поиск по архиву выглядит удобством, пока не наступает один из трёх моментов.

Первый: документ запрашивают у контрагента повторно. Он лежит в архиве, но быстрее попросить ещё раз, чем искать. Это стоит времени двух компаний и выглядит со стороны как беспорядок.

Второй: проверка или аудит. Нужно поднять пачку документов по конкретному контрагенту за период. Без поиска по содержимому это работа на дни, и делает её человек, у которого была другая задача.

Третий: спор по договору. Вопрос звучит как «что у нас записано про сроки поставки в договорах с этим поставщиком», а ответ лежит внутри сканов, которые никто не читает целиком.

Во всех трёх случаях распознавание не ускоряет работу, а делает её возможной силами одного человека за минуты вместо дней.

Где распознанного текста перестаёт хватать

Текст это сплошная лента символов. Программа видит в счёте число 148 200, но не знает, цена это, сумма НДС или номер договора. Никакой поиск этого не решает.

Поэтому задачи вроде «сравнить предложения поставщиков» или «перенести первичку в учёт» одним распознаванием текста не закрываются: там нужен следующий шаг, извлечение полей. Про эти ступени и про то, где каждая окупается, мы написали отдельно в статье о распознавании документов.

Практическое следствие простое. Покупаете распознавание ради поиска по архиву: текстового слоя достаточно. Покупаете, чтобы убрать ручной перенос цифр: одного текста будет мало.

От чего зависит качество текстового слоя

На один и тот же документ можно получить чистый текст и кашу из символов. Разница почти всегда в исходнике: разрешение скана, свет, угол съёмки, сгибы, печать поверх букв.

Отдельная беда это вёрстка: мелкий шрифт, две колонки, текст внутри таблицы, водяной знак поверх строк. Здесь ошибается и хорошая система, просто реже.

Что именно происходит внутри и почему кривой скан ломает результат, разбираем в статье об оптическом распознавании документа. Сам класс технологий и его границы — в статье про OCR.

Как выстроить архив, по которому ищется

Распознать старое разом мало: без порядка на входе через полгода рядом со старым архивом вырастет новый, такой же непрозрачный.

  1. Соберите входящий поток в одно место. Иначе распознанным окажется архив, а свежие документы снова разъедутся по почте и мессенджерам.
  2. Старое распознайте разом, новое ставьте на поток. Распознавание на входе дешевле, чем разбор завала раз в год.
  3. Проверьте, где живёт поиск: в проводнике, в CRM, в учётной системе. Текстовый слой бесполезен, если искать по нему некому.
  4. Договоритесь, какие типы документов вообще не нужно хранить. Это единственный способ уменьшить архив, а не только ускорить поиск.
  5. Решите заранее, что делать с документами, которые не распознались. Нужен видимый список таких файлов, а не тишина.

Дальше начинается вопрос, что делать с распознанным: оставить как есть для поиска или доставать из документов поля и работать с ними как с данными. Второе мы делаем в IntDoc: он читает документ построчно, вытягивает цену, срок, наличие, номенклатуру и условия, приводит предложения поставщиков к единому виду и выгружает результат в Excel, CRM и Битрикс24.

Коротко

Вопросы и ответы

Что такое распознавание текста документов?

Это перевод изображения документа в текст: система находит на скане или фотографии буквы и цифры и складывает их в слова и строки. Результат обычно сохраняют текстовым слоем внутри того же PDF, поэтому документ выглядит как раньше, но по нему работает поиск, выделение и копирование.

Чем текстовый слой отличается от обычного текста в файле?

Ничем по сути и многим по происхождению. В файле, выгруженном из Word или из учётной системы, текст есть изначально и он точный. Текстовый слой получен распознаванием картинки, поэтому в нём возможны ошибки: похожие символы система может перепутать. Для поиска это чаще всего не мешает, для переноса цифр в учёт результат стоит проверять.

Можно ли искать по сканам без распознавания?

Только по имени файла, дате и папке, в которой он лежит. Внутрь картинки поиск не заглядывает, потому что для компьютера там нет текста. Именно поэтому архивы сканов обычно держатся на одном человеке, который помнит структуру папок.

Распознавание меняет сам документ?

Изображение остаётся прежним, к нему добавляется невидимая текстовая копия. Юридически это тот же скан: распознавание не заменяет оригинал и не делает копию заверенной. Если исходник нужен в неизменном виде, он таким и останется.

Хватит ли распознанного текста, чтобы перенести данные в учётную систему?

Нет. Текст это лента символов без смысла: система видит число, но не знает, цена это, сумма налога или номер документа. Чтобы данные попали в учёт без перепечатки, поверх распознавания нужен шаг извлечения полей, когда каждому значению присваивается его роль.

Что делать с документами, которые распознались плохо?

Сначала посмотреть на исходник: чаще дело в нём, а не в системе. Пережатая фотография под углом и ровный скан дают разный результат на одном и том же документе. Хорошая система показывает, в каких местах она не уверена, и такие документы имеет смысл пересканировать или проверить вручную, а не оставлять в общем потоке молча.

← Все статьи