Автоматизация30 сентября · MakeBiz · 7 минут

Сканирование документов и распознавание текста: как выстроить поток

Связка работает не тогда, когда куплен хороший сканер, а тогда, когда у документа есть маршрут: откуда он приходит, кто его оцифровывает, куда падает файл и что происходит с данными дальше. Разбираем поток по шагам.

Сканер и распознавание сами по себе не дают результата: они дают файлы и текст. Результат появляется, когда у документа есть маршрут от точки приёма до строки в учётной системе, и на каждом шаге понятно, кто отвечает.

Поэтому начинать стоит не с выбора техники, а с описания потока. Обычно на этом шаге и выясняется, что бумаги в компании меньше, чем казалось, а узкое место совсем не в сканере.

Поток по шагам и где он обычно рвётся

ШагКто делаетЧто на выходеГде обычно ломается
ПриёмСекретарь, менеджер, курьерская доставкаПачка бумаги и входящих писемДокумент лежит в лотке, пока о нём не вспомнят
СканированиеСотрудник на МФУ или потоковом сканереФайлы изображенийКаждый сканирует со своими настройками
Разделение пачкиОператор или разделительные листыОдин файл это один документСчёт и спецификация уезжают одним файлом
Именование и хранениеСотрудник или сам сканерФайл в общей папке или в почтеФайл «скан1» в личной папке на рабочем столе
РаспознаваниеПрограммаТекст, а лучше сразу поляРезультат остаётся внутри программы
Передача данныхИнтеграция или выгрузкаСтроки в учётной системе или в таблице сравненияДанные переносят руками, и экономия исчезает
ОригиналАрхивКоробка с описью и ссылкой на файлБумагу ищут по памяти

Полезно пройти эту таблицу по своей компании и отметить шаги, у которых нет ответственного. Обычно их два или три, и именно там стоит очередь.

Бумага это не единственная точка входа

Если поток строится вокруг сканера, часть источников остаётся ручной. В большинстве компаний документы приходят из четырёх мест сразу.

  • Бумага. Курьер, почта, документы с подписью и печатью.
  • Электронная почта. Вложения в переписке с поставщиком, чаще всего именно здесь лежит основной поток.
  • Мессенджеры. Снимки и файлы от менеджеров поставщика, доезжают пересжатыми.
  • Личные кабинеты и порталы поставщиков. Выгрузки, которые скачивают руками.

Сканирование закрывает только первый источник. Поэтому в описании потока имеет смысл сразу закладывать общую точку сбора: папку или почтовый ящик, куда попадают документы из всех четырёх мест.

Разберём ваш поток документов
Посмотрим, откуда документы приходят и где встают, и покажем на ваших реальных предложениях, что из этого закрывается автоматически.

Оборудование: что действительно решает

Главный параметр не скорость страниц в минуту, а то, куда сканер умеет складывать результат. Если он умеет только «на флешку», поток упрётся в человека, который её носит.

  • Потоковый сканер с автоподатчиком. Нужен там, где бумага идёт пачками каждый день: двусторонний проход, разделение по штрихкоду, отправка в сетевую папку.
  • МФУ на этаже. Хватает, когда бумаги десятки листов в день. Важнее скорости профиль сканирования с готовыми настройками и кнопка отправки в нужную папку.
  • Планшетный сканер. Для сшитых дел, ветхой бумаги и документов, которые нельзя прогонять через автоподатчик.
  • Телефон. Рабочий вариант для выездных и разовых случаев, но как основной инструмент даёт самый капризный поток.

Настройки задаются один раз профилем на устройстве, а не выбираются каждый раз сотрудником. Что именно они меняют в чтении, подробно разобрано в статье распознавание сканов документов.

Разделение пачки: шаг, который забывают

Автоподатчик прогоняет двадцать листов и отдаёт один файл на двадцать страниц. Внутри при этом лежат четыре разных документа от трёх поставщиков.

Разделяют пачку двумя способами: разделительными листами со штрихкодом между документами или правилом «одна закладка в автоподатчик это один документ». Первый способ быстрее на больших объёмах, второй не требует ничего, кроме дисциплины.

Проверка потока на один вопрос: сколько раз документ трогает человек от приёма до строки в учётной системе. Каждое прикосновение это место, где поток встаёт, когда человек в отпуске.

Где заканчивается распознавание текста

Распознанный текст это ещё не данные. Он даёт поиск по архиву: документ находится по слову, по номеру, по названию поставщика. Но сравнить два предложения между собой по нему нельзя, потому что программа не знает, где здесь цена, а где номер счёта.

Поэтому в потоке имеет смысл ставить не распознавание текста, а извлечение полей. Ступени обработки и разница между ними разобраны в головной статье распознавание документов.

IntDoc вытягивает из документа цену и валюту, срок поставки, наличие, номенклатуру, условия оплаты, гарантию, реквизиты и спецусловия, приводит предложения к единому виду, сравнивает их и выгружает результат в Excel, в CRM и в Битрикс24.

С чего начать, если потока пока нет

  1. Две недели записывать, откуда приходят документы и сколько их. Не по ощущениям, а списком.
  2. Взять один тип документа, обычно это счета или коммерческие предложения, и описать его маршрут целиком.
  3. Закрыть шаги без ответственного и настроить один профиль сканирования на всех.
  4. И только потом выбирать программу под описанный маршрут: классы программ и критерии выбора разобраны в статье программа распознавания документов.

Порядок именно такой. Программа, выбранная до описания маршрута, обычно решает не ту задачу, которая мешала.

Коротко

Вопросы и ответы

С чего начать связку сканирования и распознавания?

С описания маршрута документа, а не с покупки техники. Две недели фиксируйте, откуда приходят документы и сколько их, затем возьмите один тип, обычно счета или коммерческие предложения, и распишите его путь от приёма до строки в учётной системе. Шаги без ответственного и есть те места, где поток стоит.

Какой сканер нужен для потока документов?

Зависит от объёма, но решает не скорость страниц в минуту, а то, куда сканер умеет складывать результат. Потоковый сканер с автоподатчиком и отправкой в сетевую папку нужен, когда бумага идёт пачками ежедневно. МФУ на этаже хватает при десятках листов в день. Планшетный нужен для сшитых дел и ветхой бумаги.

Обязательно ли сканировать, если документы приходят по почте?

Нет, и это частая ошибка при постановке процесса. Документы приходят из четырёх мест: бумага, электронная почта, мессенджеры и личные кабинеты поставщиков. Сканирование закрывает только первое. Поэтому в потоке нужна общая точка сбора, папка или ящик, куда попадают файлы из всех источников, а не только со сканера.

Как разделять пачку на отдельные документы?

Либо разделительными листами со штрихкодом между документами, либо правилом «одна закладка в автоподатчик это один документ». Первый способ быстрее на больших объёмах, второй не требует ничего, кроме дисциплины. Без разделения автоподатчик отдаёт один файл на двадцать страниц, внутри которого лежат четыре разных документа.

Куда должны попадать распознанные данные?

Туда, где принимается решение: в таблицу сравнения поставщиков или в учётную систему. Если сотрудник переносит результат распознавания руками в свой файл, экономия измеряется минутами и съедается новым шагом. IntDoc выгружает результат в Excel, в CRM и в Битрикс24 и хранит историю сравнений.

Что делать с бумажными оригиналами после сканирования?

Оригинал никуда не девается: у части документов есть сроки хранения, и юридическую силу даёт именно бумага. Разумный порядок это коробка с описью и ссылка на файл, чтобы оригинал искался по тому же номеру, что и скан. Смысл оцифровки не в том, чтобы выбросить бумагу, а в том, чтобы перестать в неё лазить каждый день.

← Все статьи