OCR (Optical Character Recognition, оптическое распознавание символов) это технология, которая находит на изображении документа буквы и цифры и превращает их в текст. Одна задача, ничего сверх неё.
Путаница начинается там, где от OCR ждут результата целиком: чтобы система «поняла» счёт и положила сумму в нужную ячейку. Это делает не OCR, а то, что над ним надстроено.
Что OCR делает сам
- находит на странице области с текстом;
- читает печатные символы и складывает их в слова и строки;
- сохраняет результат текстом или PDF с текстовым слоем, то есть невидимой текстовой копией поверх картинки;
- отдаёт координаты каждого слова на странице;
- для каждого прочитанного слова считает уверенность: насколько система в нём не сомневается.
Этого достаточно, чтобы документ начал искаться по содержимому. Что текстовый слой даёт архиву договоров и счетов, разбираем в статье о распознавании текста документов.
Где у технологии граница
Границу проще увидеть через ожидания, с которыми к OCR обычно приходят.
| Чего ждут от OCR | Что на самом деле | Чем закрывается |
|---|---|---|
| Прочитать рукописную пометку на счёте | Классический OCR читает печатные символы, рукописные ему чужие | ICR, распознавание рукописного текста |
| Понять, что 148 200 это сумма без НДС | OCR отдаёт число и его место на странице, смысла у числа нет | Извлечение полей, модели Document AI |
| Сохранить таблицу таблицей | Строки читаются, но границы ячеек восстанавливаются отдельно | Анализ структуры страницы |
| Отличить счёт от акта | Тип документа OCR не определяет | Классификация документов |
| Гарантировать ноль ошибок | Ошибки есть всегда, вопрос в их количестве и в том, видно ли их | Проверка по словарям и справочникам, порог уверенности |
Ни одна строка правого столбца не является OCR. Это соседние технологии, которые к нему приставляют. Чем они отличаются друг от друга и что когда нужно, разбираем в обзоре технологий распознавания документов.
Чем OCR дополняют на практике
В рабочем сервисе распознавание текста стоит в середине цепочки. До него и после него есть ещё четыре шага, и именно они делают результат применимым.
- Анализ структуры страницы. Прежде чем читать, надо понять, где на листе шапка, где таблица позиций, где подпись. Без этого шага текст из двух колонок склеивается в одну ленту.
- Классификация документа. Система определяет, что перед ней: счёт, акт, коммерческое предложение или письмо. От типа зависит, какие поля искать дальше.
- Извлечение полей. Из текста достаются значения: цена, срок, реквизиты, позиции номенклатуры. Здесь работает Document AI, модели, обученные понимать не отдельные символы, а документ.
- Проверка. ИНН сверяется с контрольной суммой, дата с календарём, сумма цифрами с суммой прописью. Часть ошибок отлавливается до того, как их увидит человек.
Сервисы, которые продают «распознавание», отличаются друг от друга в основном этими четырьмя шагами, а не качеством самого чтения символов. Само чтение давно стало общедоступной частью.
Где OCR уже работает, даже если вы его не покупали
Технология перестала быть отдельным продуктом и разошлась по обычным инструментам: многофункциональные устройства умеют сохранять скан сразу с текстовым слоем, телефон выделяет текст прямо на фотографии, почтовые сервисы ищут по вложениям.
Отсюда частый вопрос на старте: зачем платить, если распознавание уже есть. Ответ в том, за что вы платите. Встроенный OCR даёт текст одного документа в руках одного сотрудника. Сервис даёт поток: документы приходят, разбираются, проверяются и уезжают дальше без участия человека.
Проверить это на себе просто. Если распознанный текст всё равно кто-то копирует руками в таблицу, вы пользуетесь первым вариантом, каким бы дорогим ни был инструмент.
Когда OCR достаточно, а когда нет
Ответ зависит не от объёма документов, а от того, кто читает результат: человек или программа.
- Достаточно: нужно сделать архив искомым; документы читает сотрудник, а не система; нужно скопировать текст, а не посчитать его.
- Недостаточно: данные должны попадать в учётную систему без перепечатки; документы надо сравнивать между собой; в потоке разные типы документов вперемешку; на основании результата принимается решение, которое придётся обосновать.
Ошибка при выборе почти всегда одна и та же: покупают распознавание текста, а ждут исчезновения ручной работы. Текст без разложенных полей ручную работу переносит с бумаги на экран, а не убирает.
Сколько ошибок это нормально
Честный ответ: зависит от ваших документов, и узнать это можно только на них. На ровной печатной странице ошибок почти не бывает, на фотографии мятого счёта под углом их будет много, и обе цифры правдивы.
Поэтому сравнивать OCR по проценту точности из презентации бессмысленно. Полезнее два других вопроса: видно ли, в каком месте система не уверена, и можно ли поправить поле, не переделывая документ заново. Как из пикселей получаются символы и почему качество исходника решает, разбираем в статье об оптическом распознавании документа.
Что происходит с документом дальше
В IntDoc распознавание это первый шаг, а не продукт. Документ читается построчно, включая сканы и фотографии с телефона, из него вытягиваются цена и валюта, срок поставки, наличие, номенклатура, условия оплаты, гарантия, реквизиты и скидки.
Дальше предложения приводятся к единому виду и сравниваются по цене, сроку и наличию, а лучшее показывается с обоснованием выбора. Результат выгружается в Excel, в CRM и в Битрикс24, история сравнений остаётся внутри.
Подключение считается под объём документов: уровней три, от первого небольшого потока предложений до крупных закупок и тендеров. Начинаем с демо на ваших документах, потому что на чужих примерах любая технология выглядит убедительно.