Автоматизация30 сентября · MakeBiz · 6 минут

OCR распознавание документов: что умеет и где граница

OCR переводит изображение документа в текст. Разбираем, что входит в эту технологию, чего от неё ждать не стоит и какие надстройки превращают распознанный документ в рабочие данные.

OCR (Optical Character Recognition, оптическое распознавание символов) это технология, которая находит на изображении документа буквы и цифры и превращает их в текст. Одна задача, ничего сверх неё.

Путаница начинается там, где от OCR ждут результата целиком: чтобы система «поняла» счёт и положила сумму в нужную ячейку. Это делает не OCR, а то, что над ним надстроено.

Что OCR делает сам

  • находит на странице области с текстом;
  • читает печатные символы и складывает их в слова и строки;
  • сохраняет результат текстом или PDF с текстовым слоем, то есть невидимой текстовой копией поверх картинки;
  • отдаёт координаты каждого слова на странице;
  • для каждого прочитанного слова считает уверенность: насколько система в нём не сомневается.

Этого достаточно, чтобы документ начал искаться по содержимому. Что текстовый слой даёт архиву договоров и счетов, разбираем в статье о распознавании текста документов.

Где у технологии граница

Границу проще увидеть через ожидания, с которыми к OCR обычно приходят.

Чего ждут от OCRЧто на самом делеЧем закрывается
Прочитать рукописную пометку на счётеКлассический OCR читает печатные символы, рукописные ему чужиеICR, распознавание рукописного текста
Понять, что 148 200 это сумма без НДСOCR отдаёт число и его место на странице, смысла у числа нетИзвлечение полей, модели Document AI
Сохранить таблицу таблицейСтроки читаются, но границы ячеек восстанавливаются отдельноАнализ структуры страницы
Отличить счёт от актаТип документа OCR не определяетКлассификация документов
Гарантировать ноль ошибокОшибки есть всегда, вопрос в их количестве и в том, видно ли ихПроверка по словарям и справочникам, порог уверенности

Ни одна строка правого столбца не является OCR. Это соседние технологии, которые к нему приставляют. Чем они отличаются друг от друга и что когда нужно, разбираем в обзоре технологий распознавания документов.

Проверим OCR на ваших документах
Возьмём пачку реальных счетов или предложений поставщиков и покажем, что система из них достаёт. Дальше посчитаем подключение под ваш объём.

Чем OCR дополняют на практике

В рабочем сервисе распознавание текста стоит в середине цепочки. До него и после него есть ещё четыре шага, и именно они делают результат применимым.

  • Анализ структуры страницы. Прежде чем читать, надо понять, где на листе шапка, где таблица позиций, где подпись. Без этого шага текст из двух колонок склеивается в одну ленту.
  • Классификация документа. Система определяет, что перед ней: счёт, акт, коммерческое предложение или письмо. От типа зависит, какие поля искать дальше.
  • Извлечение полей. Из текста достаются значения: цена, срок, реквизиты, позиции номенклатуры. Здесь работает Document AI, модели, обученные понимать не отдельные символы, а документ.
  • Проверка. ИНН сверяется с контрольной суммой, дата с календарём, сумма цифрами с суммой прописью. Часть ошибок отлавливается до того, как их увидит человек.

Сервисы, которые продают «распознавание», отличаются друг от друга в основном этими четырьмя шагами, а не качеством самого чтения символов. Само чтение давно стало общедоступной частью.

Где OCR уже работает, даже если вы его не покупали

Технология перестала быть отдельным продуктом и разошлась по обычным инструментам: многофункциональные устройства умеют сохранять скан сразу с текстовым слоем, телефон выделяет текст прямо на фотографии, почтовые сервисы ищут по вложениям.

Отсюда частый вопрос на старте: зачем платить, если распознавание уже есть. Ответ в том, за что вы платите. Встроенный OCR даёт текст одного документа в руках одного сотрудника. Сервис даёт поток: документы приходят, разбираются, проверяются и уезжают дальше без участия человека.

Проверить это на себе просто. Если распознанный текст всё равно кто-то копирует руками в таблицу, вы пользуетесь первым вариантом, каким бы дорогим ни был инструмент.

Когда OCR достаточно, а когда нет

Ответ зависит не от объёма документов, а от того, кто читает результат: человек или программа.

  • Достаточно: нужно сделать архив искомым; документы читает сотрудник, а не система; нужно скопировать текст, а не посчитать его.
  • Недостаточно: данные должны попадать в учётную систему без перепечатки; документы надо сравнивать между собой; в потоке разные типы документов вперемешку; на основании результата принимается решение, которое придётся обосновать.

Ошибка при выборе почти всегда одна и та же: покупают распознавание текста, а ждут исчезновения ручной работы. Текст без разложенных полей ручную работу переносит с бумаги на экран, а не убирает.

Сколько ошибок это нормально

Честный ответ: зависит от ваших документов, и узнать это можно только на них. На ровной печатной странице ошибок почти не бывает, на фотографии мятого счёта под углом их будет много, и обе цифры правдивы.

Поэтому сравнивать OCR по проценту точности из презентации бессмысленно. Полезнее два других вопроса: видно ли, в каком месте система не уверена, и можно ли поправить поле, не переделывая документ заново. Как из пикселей получаются символы и почему качество исходника решает, разбираем в статье об оптическом распознавании документа.

Что происходит с документом дальше

В IntDoc распознавание это первый шаг, а не продукт. Документ читается построчно, включая сканы и фотографии с телефона, из него вытягиваются цена и валюта, срок поставки, наличие, номенклатура, условия оплаты, гарантия, реквизиты и скидки.

Дальше предложения приводятся к единому виду и сравниваются по цене, сроку и наличию, а лучшее показывается с обоснованием выбора. Результат выгружается в Excel, в CRM и в Битрикс24, история сравнений остаётся внутри.

Подключение считается под объём документов: уровней три, от первого небольшого потока предложений до крупных закупок и тендеров. Начинаем с демо на ваших документах, потому что на чужих примерах любая технология выглядит убедительно.

Коротко

Вопросы и ответы

Что такое OCR простыми словами?

OCR это оптическое распознавание символов: технология, которая смотрит на картинку документа и находит в ней буквы и цифры. На входе скан, фотография или PDF без текста, на выходе текст, по которому работает поиск и копирование. Смысла в этом тексте для программы пока нет: она знает, какие символы написаны, но не знает, что они означают.

Чем OCR отличается от распознавания документов?

OCR это технология внутри, распознавание документов это задача целиком. В задачу кроме чтения символов входят разбор структуры страницы, определение типа документа, извлечение полей и проверка результата. OCR закрывает только первый кусок, поэтому сервис, который умеет одно распознавание текста, решает вашу задачу частично.

Читает ли OCR рукописный текст?

Классический OCR рассчитан на печатные символы. Рукописный и рукопечатный текст читает ICR, интеллектуальное распознавание символов: оно обучено на множестве вариантов написания одной и той же буквы, а не сверяется с одним эталоном. На практике ICR применяют к отдельным полям бланка, а не ко всему документу: рукописный текст свободной формы остаётся трудным.

Работает ли OCR с фотографиями с телефона?

Да, и в реальном потоке документов фотографии встречаются часто. Результат при этом хуже, чем на ровном скане: снимок под углом приходится выпрямлять, неровный свет после перевода в чёрно-белое даёт пятна. IntDoc рассчитан на такой поток и читает документ построчно в том числе со сканов и фото с телефона.

Нужен ли OCR, если документы приходят в PDF?

Смотря какой это PDF. Файл, выгруженный из учётной системы или из Word, уже содержит текст, и распознавать в нём нечего. PDF, собранный из сканов, внутри остаётся картинкой, и без OCR поиск по нему не работает. Отличить одно от другого просто: попробуйте выделить в документе слово мышкой.

Какая точность у OCR?

Точность зависит не от системы, а от документов: одна и та же система даёт разный результат на чистой печатной странице и на фотографии мятого счёта. Поэтому цифра из презентации ничего не говорит о вашем потоке. Смотреть стоит на другое: показывает ли система, где она не уверена, и как исправляется ошибка.

← Все статьи