Распознавание текста документов это получение из изображения документа букв и цифр, которые компьютер умеет читать. Результат называют текстовым слоем: документ выглядит по-прежнему, но внутри у него появляется текст, по которому работают поиск и копирование.
Приходят за этим чаще всего по одной причине: в компании лежит архив сканов, и найти в нём нужный договор можно только по имени файла или по памяти сотрудника.
Что такое текстовый слой
Скан или фотография это картинка. Для компьютера в ней нет ни слов, ни цифр, только точки разного цвета. Текстовый слой это невидимая текстовая копия содержимого, которую распознавание кладёт поверх картинки.
Внешне документ не меняется, меняется то, что с ним можно делать: искать, выделять, копировать, отдавать другим программам.
У части PDF текстовый слой есть с рождения: файл выгружен из Word или из учётной системы. У сканов и фотографий его нет никогда, и появляется он только после распознавания.
Что документ умеет до и после распознавания
Разница видна не в том, как документ выглядит, а в том, какие действия с ним становятся возможны.
| Задача | Скан без текстового слоя | После распознавания |
|---|---|---|
| Найти документ по слову из текста | Только перебором глазами | Обычный поиск по папке или по системе |
| Скопировать реквизиты или номер счёта | Перепечатать руками | Выделить и скопировать |
| Проверить, есть ли в договоре пункт | Открыть и прочитать целиком | Поиск внутри документа |
| Передать документ другой программе | Только как картинку | Как текст, с которым она работает |
| Прочитать документ голосом, сделать доступным незрячему сотруднику | Невозможно | Работает штатными средствами |
Главное в этой таблице то, чего в ней нет: сравнения документов между собой и подсчётов. Текстовый слой делает документ читаемым, но не превращает его содержимое в данные.
Поиск по архиву: ради чего это обычно делают
Типичная картина: несколько тысяч сканов в сетевой папке, имена вида scan_0142.pdf и один человек, который помнит, где что лежит. Пока он на месте, архив работает.
После распознавания архив ищется по содержимому: по названию контрагента, по номеру счёта, по фразе из договора. Поиск перестаёт зависеть от того, как назвали файл.
Второй эффект тише, но заметнее в деньгах: документы перестают теряться. Если документ находится поиском, его не сканируют второй раз и не запрашивают у контрагента заново.
Проверка, нужен ли вам текстовый слой: попробуйте найти в своём архиве договор, зная только фамилию подписанта. Если это заняло больше минуты, ищет не система, а сотрудник.
Три случая, в которых непрозрачный архив стоит денег
Поиск по архиву выглядит удобством, пока не наступает один из трёх моментов.
Первый: документ запрашивают у контрагента повторно. Он лежит в архиве, но быстрее попросить ещё раз, чем искать. Это стоит времени двух компаний и выглядит со стороны как беспорядок.
Второй: проверка или аудит. Нужно поднять пачку документов по конкретному контрагенту за период. Без поиска по содержимому это работа на дни, и делает её человек, у которого была другая задача.
Третий: спор по договору. Вопрос звучит как «что у нас записано про сроки поставки в договорах с этим поставщиком», а ответ лежит внутри сканов, которые никто не читает целиком.
Во всех трёх случаях распознавание не ускоряет работу, а делает её возможной силами одного человека за минуты вместо дней.
Где распознанного текста перестаёт хватать
Текст это сплошная лента символов. Программа видит в счёте число 148 200, но не знает, цена это, сумма НДС или номер договора. Никакой поиск этого не решает.
Поэтому задачи вроде «сравнить предложения поставщиков» или «перенести первичку в учёт» одним распознаванием текста не закрываются: там нужен следующий шаг, извлечение полей. Про эти ступени и про то, где каждая окупается, мы написали отдельно в статье о распознавании документов.
Практическое следствие простое. Покупаете распознавание ради поиска по архиву: текстового слоя достаточно. Покупаете, чтобы убрать ручной перенос цифр: одного текста будет мало.
От чего зависит качество текстового слоя
На один и тот же документ можно получить чистый текст и кашу из символов. Разница почти всегда в исходнике: разрешение скана, свет, угол съёмки, сгибы, печать поверх букв.
Отдельная беда это вёрстка: мелкий шрифт, две колонки, текст внутри таблицы, водяной знак поверх строк. Здесь ошибается и хорошая система, просто реже.
Что именно происходит внутри и почему кривой скан ломает результат, разбираем в статье об оптическом распознавании документа. Сам класс технологий и его границы — в статье про OCR.
Как выстроить архив, по которому ищется
Распознать старое разом мало: без порядка на входе через полгода рядом со старым архивом вырастет новый, такой же непрозрачный.
- Соберите входящий поток в одно место. Иначе распознанным окажется архив, а свежие документы снова разъедутся по почте и мессенджерам.
- Старое распознайте разом, новое ставьте на поток. Распознавание на входе дешевле, чем разбор завала раз в год.
- Проверьте, где живёт поиск: в проводнике, в CRM, в учётной системе. Текстовый слой бесполезен, если искать по нему некому.
- Договоритесь, какие типы документов вообще не нужно хранить. Это единственный способ уменьшить архив, а не только ускорить поиск.
- Решите заранее, что делать с документами, которые не распознались. Нужен видимый список таких файлов, а не тишина.
Дальше начинается вопрос, что делать с распознанным: оставить как есть для поиска или доставать из документов поля и работать с ними как с данными. Второе мы делаем в IntDoc: он читает документ построчно, вытягивает цену, срок, наличие, номенклатуру и условия, приводит предложения поставщиков к единому виду и выгружает результат в Excel, CRM и Битрикс24.