Автоматизация30 сентября · MakeBiz · 7 минут

Программа распознавания документов: классы и критерии выбора

Программы распознавания делятся на три класса, и отличаются они не столько качеством чтения, сколько тем, где лежат ваши документы, кто обслуживает программу и как быстро её можно запустить. Разбираем классы и критерии выбора.

Программы распознавания документов бывают настольные, серверные и облачные. Разница между ними проходит не по функциям чтения: документ прочитают все три. Разница в том, где работает программа, кто её обслуживает и кому доступен результат.

Поэтому выбор начинается не с вопроса «какая лучше распознаёт», а с вопроса «кто и в каком объёме будет этим пользоваться».

Три класса программ

КлассГде работаетКому подходитО чём спросить заранее
НастольнаяНа компьютере сотрудникаОдин человек, десятки документов в месяц, разовые задачиЧто будет, когда сотрудник в отпуске; как результат попадёт к остальным
СервернаяНа вашем сервере, внутри вашего контураПоток от нескольких отделов, требование держать документы внутриКто администрирует и обновляет, какая нагрузка ложится на ИТ, что с резервным копированием
ОблачнаяУ поставщика сервисаБыстрый старт, поток, который меняется по сезону, распределённая командаГде хранятся документы, как раздаются доступы, как забрать свои данные при уходе

Граница здесь не в качестве. Настольная программа обрабатывает документ не хуже серверной, просто обрабатывает его для одного человека, и всё, что дальше, снова делается руками.

Шесть критериев, по которым сравнивать

  1. Что на выходе. Текст или поля. Программа, которая отдаёт распознанный текст, даёт поиск по архиву, но не даёт таблицу сравнения: она не знает, где здесь цена, а где номер счёта.
  2. Видно ли неуверенность. Показывает ли программа, какое поле она прочитала спорно, и можно ли поправить его на месте, не переделывая документ.
  3. Принимает ли поток как есть. Поставщики присылают что придётся, и разные виды файлов ведут себя по-разному: подробнее об этом в статье распознавание документов PDF.
  4. Куда уезжают данные. Готовая выгрузка в вашу систему против «скачайте файл и загрузите сами». Второй вариант возвращает ручную работу на последнем шаге.
  5. Работает ли с пачкой. Одно дело обработать файл, другое принять двадцать документов, разделить их и показать результат одной таблицей.
  6. Остаётся ли история. Можно ли вернуться к прошлому решению и увидеть, из чего выбирали. Для закупок и тендеров это отдельная ценность, потому что выбор надо обосновывать.
Посмотрим, подойдёт ли IntDoc вам
Возьмём двадцать ваших последних предложений от поставщиков, разберём их и покажем сравнение. Дальше посчитаем подключение под ваш объём.

Программа или сервис: разница не в словах

Программу вы устанавливаете, обновляете и обслуживаете сами, а сервис подключаете. Для потока это разные затраты и разная скорость запуска.

Программа выигрывает там, где документы не должны покидать контур и где есть кому её администрировать. Сервис выигрывает там, где поток надо запустить быстро и где объём непредсказуем.

Худший вариант это серверная программа без администратора: она превращается в установленный однажды и незаметно устаревший инструмент, которым перестают пользоваться.

Практичный способ выбрать: возьмите двадцать последних документов, какие пришли, ничего не отбирая, и прогоните через каждый вариант. Побеждает не тот, кто лучше читает ровный образец из демонстрации, а тот, кто меньше спотыкается на вашей обычной пачке.

Три ошибки при выборе

Выбор по списку форматов. Список у всех примерно одинаковый, и он ничего не говорит о результате. Вопрос не «читает ли PDF», а что получится на выходе: строка текста или поле «цена» с числом.

Выбор до того, как описан маршрут документа. Программа, купленная раньше, чем понятно, откуда документы приходят и куда должны уехать данные, обычно решает не ту задачу, которая мешала. Сначала поток: об этом статья сканирование документов и распознавание текста.

Выбор одной программы на все задачи сразу. Архив договоров, первичка в бухгалтерии и сравнение поставщиков это три разные задачи с разными выходными данными. Универсальный инструмент закрывает каждую наполовину.

Что программа не сделает

Она не примет решение и не отменит проверку. Поля достанет, спорные места покажет, но выбор поставщика и ответственность за него остаются за человеком.

И она не починит процесс, которого нет. Если предложения нигде не хранятся, а решение принимается в переписке, программа ускорит один шаг, но порядка в закупках сама по себе не появится.

Где в этом ряду IntDoc

IntDoc это не универсальный распознаватель, а инструмент под одну задачу: сравнить поставщиков и обосновать выбор. Документ читается построчно, из него вытягиваются цена и валюта, срок поставки, наличие, номенклатура, условия оплаты, гарантия, реквизиты и спецусловия.

Дальше предложения приводятся к единому виду, сравниваются по цене, сроку и наличию, лучшее показывается с обоснованием, а результат выгружается в Excel, в CRM и в Битрикс24. История сравнений остаётся внутри. Из чего вообще складывается обработка документа, написано в статье распознавание документов.

Подключение идёт тремя уровнями: Старт для первого небольшого потока, Команда для отдела закупок с регулярным потоком документов, Масштаб для крупных закупок и тендеров. Стоимость считается под ваш объём поставщиков и документов, и начинаем мы с демо на реальных предложениях.

Коротко

Вопросы и ответы

Какие бывают программы распознавания документов?

Три класса: настольные, серверные и облачные. Настольная работает на компьютере сотрудника и подходит для разовых задач и десятков документов в месяц. Серверная работает внутри вашего контура и нужна, когда поток идёт от нескольких отделов или документы не должны уходить наружу. Облачная подключается быстро и удобна при меняющемся объёме.

Чем облачная программа отличается от серверной?

Местом, где лежат документы, и тем, кто обслуживает программу. Серверная стоит в вашем контуре, значит документы не уходят наружу, но нужен администратор, обновления и резервное копирование. Облачная запускается быстро и не нагружает ИТ, но заранее стоит выяснить, где хранятся файлы, как раздаются доступы и как забрать свои данные при уходе.

Нужна ли отдельная программа, если документов немного?

Если документов действительно десятки в месяц и работает с ними один человек, настольного инструмента хватит. Считать стоит не документы, а количество людей, которым нужен результат. Как только таблицу сравнения ждут трое, настольная программа становится узким местом: результат у одного сотрудника на компьютере, а остальные его переспрашивают.

По каким критериям сравнивать программы?

Мы бы смотрели на шесть вещей: что на выходе, текст или поля; видно ли, где программа не уверена; принимает ли она поток как есть; куда уезжают данные; работает ли с пачкой документов, а не с одним файлом; остаётся ли история решений. Список форматов при этом почти не помогает: он у всех похожий и ничего не говорит о результате.

Заменит ли программа распознавания сотрудника?

Нет, она снимает с него перенос данных. Программа достаёт поля, показывает спорные места и собирает сравнение, но выбор поставщика и ответственность за него остаются за человеком, а спорные значения в первые недели разумно перепроверять глазами. Экономится не должность, а часы, которые уходили на сведение таблицы в Excel.

Как проверить программу перед покупкой?

На своих документах и на обычной пачке, а не на подобранном образце. Возьмите двадцать последних входящих, ничего не отбирая, и прогоните через каждый вариант. Смотреть надо не на процент прочитанного, а на то, сколько значений пришлось поправить руками и было ли понятно, какие именно значения проверять.

← Все статьи