Сканер и распознавание сами по себе не дают результата: они дают файлы и текст. Результат появляется, когда у документа есть маршрут от точки приёма до строки в учётной системе, и на каждом шаге понятно, кто отвечает.
Поэтому начинать стоит не с выбора техники, а с описания потока. Обычно на этом шаге и выясняется, что бумаги в компании меньше, чем казалось, а узкое место совсем не в сканере.
Поток по шагам и где он обычно рвётся
| Шаг | Кто делает | Что на выходе | Где обычно ломается |
|---|---|---|---|
| Приём | Секретарь, менеджер, курьерская доставка | Пачка бумаги и входящих писем | Документ лежит в лотке, пока о нём не вспомнят |
| Сканирование | Сотрудник на МФУ или потоковом сканере | Файлы изображений | Каждый сканирует со своими настройками |
| Разделение пачки | Оператор или разделительные листы | Один файл это один документ | Счёт и спецификация уезжают одним файлом |
| Именование и хранение | Сотрудник или сам сканер | Файл в общей папке или в почте | Файл «скан1» в личной папке на рабочем столе |
| Распознавание | Программа | Текст, а лучше сразу поля | Результат остаётся внутри программы |
| Передача данных | Интеграция или выгрузка | Строки в учётной системе или в таблице сравнения | Данные переносят руками, и экономия исчезает |
| Оригинал | Архив | Коробка с описью и ссылкой на файл | Бумагу ищут по памяти |
Полезно пройти эту таблицу по своей компании и отметить шаги, у которых нет ответственного. Обычно их два или три, и именно там стоит очередь.
Бумага это не единственная точка входа
Если поток строится вокруг сканера, часть источников остаётся ручной. В большинстве компаний документы приходят из четырёх мест сразу.
- Бумага. Курьер, почта, документы с подписью и печатью.
- Электронная почта. Вложения в переписке с поставщиком, чаще всего именно здесь лежит основной поток.
- Мессенджеры. Снимки и файлы от менеджеров поставщика, доезжают пересжатыми.
- Личные кабинеты и порталы поставщиков. Выгрузки, которые скачивают руками.
Сканирование закрывает только первый источник. Поэтому в описании потока имеет смысл сразу закладывать общую точку сбора: папку или почтовый ящик, куда попадают документы из всех четырёх мест.
Оборудование: что действительно решает
Главный параметр не скорость страниц в минуту, а то, куда сканер умеет складывать результат. Если он умеет только «на флешку», поток упрётся в человека, который её носит.
- Потоковый сканер с автоподатчиком. Нужен там, где бумага идёт пачками каждый день: двусторонний проход, разделение по штрихкоду, отправка в сетевую папку.
- МФУ на этаже. Хватает, когда бумаги десятки листов в день. Важнее скорости профиль сканирования с готовыми настройками и кнопка отправки в нужную папку.
- Планшетный сканер. Для сшитых дел, ветхой бумаги и документов, которые нельзя прогонять через автоподатчик.
- Телефон. Рабочий вариант для выездных и разовых случаев, но как основной инструмент даёт самый капризный поток.
Настройки задаются один раз профилем на устройстве, а не выбираются каждый раз сотрудником. Что именно они меняют в чтении, подробно разобрано в статье распознавание сканов документов.
Разделение пачки: шаг, который забывают
Автоподатчик прогоняет двадцать листов и отдаёт один файл на двадцать страниц. Внутри при этом лежат четыре разных документа от трёх поставщиков.
Разделяют пачку двумя способами: разделительными листами со штрихкодом между документами или правилом «одна закладка в автоподатчик это один документ». Первый способ быстрее на больших объёмах, второй не требует ничего, кроме дисциплины.
Проверка потока на один вопрос: сколько раз документ трогает человек от приёма до строки в учётной системе. Каждое прикосновение это место, где поток встаёт, когда человек в отпуске.
Где заканчивается распознавание текста
Распознанный текст это ещё не данные. Он даёт поиск по архиву: документ находится по слову, по номеру, по названию поставщика. Но сравнить два предложения между собой по нему нельзя, потому что программа не знает, где здесь цена, а где номер счёта.
Поэтому в потоке имеет смысл ставить не распознавание текста, а извлечение полей. Ступени обработки и разница между ними разобраны в головной статье распознавание документов.
IntDoc вытягивает из документа цену и валюту, срок поставки, наличие, номенклатуру, условия оплаты, гарантию, реквизиты и спецусловия, приводит предложения к единому виду, сравнивает их и выгружает результат в Excel, в CRM и в Битрикс24.
С чего начать, если потока пока нет
- Две недели записывать, откуда приходят документы и сколько их. Не по ощущениям, а списком.
- Взять один тип документа, обычно это счета или коммерческие предложения, и описать его маршрут целиком.
- Закрыть шаги без ответственного и настроить один профиль сканирования на всех.
- И только потом выбирать программу под описанный маршрут: классы программ и критерии выбора разобраны в статье программа распознавания документов.
Порядок именно такой. Программа, выбранная до описания маршрута, обычно решает не ту задачу, которая мешала.