Распознавание документов это перевод документа в структурированные данные. Система читает PDF, скан или фотографию и достаёт из неё отдельные поля: цену, срок поставки, номенклатуру, реквизиты. Результат не картинка и не сплошной текст, а значения, с которыми дальше работает программа.
Разница между «текст распознан» и «поля извлечены» и решает, окупится проект или нет. В первом случае сотрудник по-прежнему переносит цифры руками, просто с экрана, а не с бумаги. Во втором данные сразу попадают в таблицу сравнения или в учётную систему.
Три ступени: скан, текст, поля
Их часто называют одним словом, хотя это три разные задачи.
| Ступень | Что на выходе | Чего ещё нельзя |
|---|---|---|
| Сканирование | Изображение документа | Найти в нём слово, сравнить с другим документом |
| Распознавание текста | Буквы и цифры, по которым работает поиск | Посчитать: где цена, а где номер счёта, программа не знает |
| Извлечение данных | Поля: цена, срок, позиция номенклатуры | Ничего: с этим уже работает закупщик или бухгалтер |
Когда в компании говорят «нам нужно распознавание», почти всегда имеют в виду третью ступень. А покупают иногда вторую, и потом удивляются, что рутины меньше не стало.
Проверочный вопрос к любому сервису: что окажется на выходе. Файл с текстом или строки с полями, которые можно сравнить между собой и выгрузить дальше.
Какие документы читаются
В работе редко бывает один аккуратный формат. Поставщики присылают что придётся, и система должна принимать поток как есть.
IntDoc работает с PDF, сканами, фотографиями с телефона, документами Word и Excel, письмами, прайс-листами, счетами и коммерческими предложениями.
Качество исходника на результат влияет: ровный скан читается увереннее, чем снимок под углом в плохом свете. Но снимок тоже разбирается, и это важнее, чем кажется: в реальной переписке фото документа встречается чаще, чем подписанный PDF.
Какие поля достаются из документа
Набор полей зависит от того, ради чего вы читаете документ. Для сравнения поставщиков IntDoc вытягивает построчно:
- цену и валюту;
- срок поставки;
- наличие на складе;
- номенклатуру и позиции;
- условия оплаты;
- гарантию и сервис;
- реквизиты поставщика;
- скидки и спецусловия.
Это и есть та часть, на которой обычно сидит человек с Excel и тремя открытыми вкладками. Она же чаще всего ломается: при переносе руками легко ошибиться в цифре или пропустить сноску про спецусловия.
Где распознавание окупается быстрее всего
Закупки. Самый очевидный случай: предложения приходят в разных форматах, а сравнивать их надо по одним и тем же критериям. Часы закупщика уходят на сведение таблицы, а не на переговоры с поставщиком.
Бухгалтерия и первичка. Поток однотипных документов, где важна точность переноса и скорость закрытия периода. Здесь выигрыш считается прямо в часах на обработку пачки.
Тендеры. Много документов, жёсткие сроки, необходимость обосновать выбор. Аудиторский след по решению становится отдельной ценностью: видно, на каком основании выбрали поставщика.
Общее у всех трёх случаев одно: документов много, они однотипные, и от скорости их обработки зависит деньги или срок.
Распознать мало: данные должны куда-то попасть
Самая частая ошибка при внедрении: сервис распознаёт документы, а дальше сотрудник всё равно копирует результат в свою таблицу. Экономия при этом измеряется минутами и быстро съедается новым шагом в процессе.
Поэтому IntDoc не заканчивается распознаванием. Предложения приводятся к единому виду, сравниваются по цене, сроку и наличию, и система показывает лучшее с обоснованием выбора.
Результат выгружается в Excel, в CRM и в Битрикс24, а история сравнений остаётся внутри: к прошлому решению можно вернуться и увидеть, из чего выбирали.
Как выбрать сервис распознавания документов
Мы бы смотрели на пять вещей, и цена среди них не первая.
- Что на выходе. Текст или поля. Вопрос из начала статьи, который отсеивает половину вариантов.
- Какие форматы принимает. Если фотографии с телефона не читаются, поток документов всё равно разделится на два, и часть останется ручной.
- Куда уезжают данные. Готовая выгрузка в вашу CRM или учётную систему против «скачайте файл и загрузите сами».
- Что происходит с ошибкой. Видно ли, какое поле система не поняла, и можно ли поправить его на месте, не переделывая документ целиком.
- Как считается стоимость. За документ, за поле, за пользователя. От этого зависит, вырастет ли счёт вместе с потоком документов.
Проверять всё это лучше не по описанию на сайте, а на своих документах. Мы начинаем знакомство с демо на реальных предложениях поставщиков, потому что на чужих примерах любая система выглядит хорошо.
Чего распознавание не делает
Оно не принимает решение за закупщика. Система достаёт поля, сравнивает предложения и показывает лучшее с обоснованием, но выбор поставщика и ответственность за него остаются за человеком.
Оно не отменяет проверку. В первые недели спорные места в документе разумно сверять глазами: так вы заодно видите, на каких типах документов система уверена, а где ей стоит помочь.
И оно не чинит процесс, которого нет. Если предложения поставщиков нигде не хранятся, а решение принимается в переписке, распознавание ускорит один шаг, но порядка в закупках само по себе не появится. С этого честнее и начинать разговор.