Программы распознавания документов бывают настольные, серверные и облачные. Разница между ними проходит не по функциям чтения: документ прочитают все три. Разница в том, где работает программа, кто её обслуживает и кому доступен результат.
Поэтому выбор начинается не с вопроса «какая лучше распознаёт», а с вопроса «кто и в каком объёме будет этим пользоваться».
Три класса программ
| Класс | Где работает | Кому подходит | О чём спросить заранее |
|---|---|---|---|
| Настольная | На компьютере сотрудника | Один человек, десятки документов в месяц, разовые задачи | Что будет, когда сотрудник в отпуске; как результат попадёт к остальным |
| Серверная | На вашем сервере, внутри вашего контура | Поток от нескольких отделов, требование держать документы внутри | Кто администрирует и обновляет, какая нагрузка ложится на ИТ, что с резервным копированием |
| Облачная | У поставщика сервиса | Быстрый старт, поток, который меняется по сезону, распределённая команда | Где хранятся документы, как раздаются доступы, как забрать свои данные при уходе |
Граница здесь не в качестве. Настольная программа обрабатывает документ не хуже серверной, просто обрабатывает его для одного человека, и всё, что дальше, снова делается руками.
Шесть критериев, по которым сравнивать
- Что на выходе. Текст или поля. Программа, которая отдаёт распознанный текст, даёт поиск по архиву, но не даёт таблицу сравнения: она не знает, где здесь цена, а где номер счёта.
- Видно ли неуверенность. Показывает ли программа, какое поле она прочитала спорно, и можно ли поправить его на месте, не переделывая документ.
- Принимает ли поток как есть. Поставщики присылают что придётся, и разные виды файлов ведут себя по-разному: подробнее об этом в статье распознавание документов PDF.
- Куда уезжают данные. Готовая выгрузка в вашу систему против «скачайте файл и загрузите сами». Второй вариант возвращает ручную работу на последнем шаге.
- Работает ли с пачкой. Одно дело обработать файл, другое принять двадцать документов, разделить их и показать результат одной таблицей.
- Остаётся ли история. Можно ли вернуться к прошлому решению и увидеть, из чего выбирали. Для закупок и тендеров это отдельная ценность, потому что выбор надо обосновывать.
Программа или сервис: разница не в словах
Программу вы устанавливаете, обновляете и обслуживаете сами, а сервис подключаете. Для потока это разные затраты и разная скорость запуска.
Программа выигрывает там, где документы не должны покидать контур и где есть кому её администрировать. Сервис выигрывает там, где поток надо запустить быстро и где объём непредсказуем.
Худший вариант это серверная программа без администратора: она превращается в установленный однажды и незаметно устаревший инструмент, которым перестают пользоваться.
Практичный способ выбрать: возьмите двадцать последних документов, какие пришли, ничего не отбирая, и прогоните через каждый вариант. Побеждает не тот, кто лучше читает ровный образец из демонстрации, а тот, кто меньше спотыкается на вашей обычной пачке.
Три ошибки при выборе
Выбор по списку форматов. Список у всех примерно одинаковый, и он ничего не говорит о результате. Вопрос не «читает ли PDF», а что получится на выходе: строка текста или поле «цена» с числом.
Выбор до того, как описан маршрут документа. Программа, купленная раньше, чем понятно, откуда документы приходят и куда должны уехать данные, обычно решает не ту задачу, которая мешала. Сначала поток: об этом статья сканирование документов и распознавание текста.
Выбор одной программы на все задачи сразу. Архив договоров, первичка в бухгалтерии и сравнение поставщиков это три разные задачи с разными выходными данными. Универсальный инструмент закрывает каждую наполовину.
Что программа не сделает
Она не примет решение и не отменит проверку. Поля достанет, спорные места покажет, но выбор поставщика и ответственность за него остаются за человеком.
И она не починит процесс, которого нет. Если предложения нигде не хранятся, а решение принимается в переписке, программа ускорит один шаг, но порядка в закупках сама по себе не появится.
Где в этом ряду IntDoc
IntDoc это не универсальный распознаватель, а инструмент под одну задачу: сравнить поставщиков и обосновать выбор. Документ читается построчно, из него вытягиваются цена и валюта, срок поставки, наличие, номенклатура, условия оплаты, гарантия, реквизиты и спецусловия.
Дальше предложения приводятся к единому виду, сравниваются по цене, сроку и наличию, лучшее показывается с обоснованием, а результат выгружается в Excel, в CRM и в Битрикс24. История сравнений остаётся внутри. Из чего вообще складывается обработка документа, написано в статье распознавание документов.
Подключение идёт тремя уровнями: Старт для первого небольшого потока, Команда для отдела закупок с регулярным потоком документов, Масштаб для крупных закупок и тендеров. Стоимость считается под ваш объём поставщиков и документов, и начинаем мы с демо на реальных предложениях.