Перейти к содержимому
Nyoka

Как автоматизировать обработку документов:от скана до поля в системе

Документы12 мая 20269 мин

Как устроен конвейер обработки документов: распознавание, извлечение полей, проверка и передача в учётную систему. Что определяет качество и стоимость.

скан или PDFИЗВЛЕЧЕНОномерА-1042сумма184 200 ₽срок14 днейв системучеловекуспорное поле не проходит молча

Ввод документов вручную — одна из немногих задач, где эффект от автоматизации виден почти сразу и считается без споров. При этом проекты здесь регулярно проваливаются, и почти всегда по одной причине: распознавание считают всей задачей, тогда как это только первый шаг из пяти. Разберём конвейер целиком.

Пять шагов, из которых состоит задача

Шаг первый: приведение изображения в порядок

Фотография под углом, блики, тени, мятая бумага, сшитые страницы. До распознавания изображение выравнивают, чистят и разделяют на страницы. Этот шаг незаметен, но именно он определяет качество всего дальнейшего — на плохом входе точный распознаватель бесполезен.

Шаг второй: распознавание текста

Превращение изображения в текст с координатами. Технически это самая зрелая часть конвейера: на печатном тексте современные распознаватели работают хорошо. Проблемы начинаются на рукописном вводе, печатях поверх текста и таблицах со сложной структурой.

Шаг третий: извлечение полей

Самая содержательная часть. Из текста надо понять, что здесь номер договора, что дата, что сумма, а что реквизиты контрагента. Именно здесь ломаются решения на жёстких шаблонах: у каждого контрагента свой бланк, и координатный подход умирает на первой же новой форме.

Шаг четвёртый: проверка

Извлечённое проверяется на непротиворечивость: сумма прописью совпадает с цифрами, ИНН проходит контроль, дата не из будущего, позиции складываются в итог. Этот шаг ловит большую часть ошибок распознавания программно, до человека.

Шаг пятый: передача в систему и маршрут спорного

Уверенно распознанное уходит в учётную систему автоматически. Спорное попадает оператору вместе с фрагментом изображения — чтобы проверка занимала секунды, а не требовала открывать документ заново.

Пропуск четвёртого и пятого шагов — самая частая причина, по которой внедрение не приживается. Без проверки и внятного маршрута спорных случаев система выглядит ненадёжной, и люди возвращаются к ручному вводу — тихо и необратимо.

Что определяет качество

Реалистичность обучающих данных

Если систему настраивали на чистых PDF, а в эксплуатацию пойдут фотографии с телефона, цифры пилота не повторятся. Мы на диагностике просим обычную выборку за месяц, включая худшие экземпляры, — расхождение между отобранными образцами и реальным потоком регулярно оказывается драматическим.

Разнообразие форм

Двести документов от двадцати контрагентов дают лучший результат, чем пятьсот от одного. В нашем проекте по оценке дипломов работа шла с документами сорока стран — именно разнообразие выборки позволило системе не ломаться на формах, которых она не видела.

Настройка порога уверенности

Порог — это ручка, которой регулируется соотношение автоматики и ручной проверки. Низкий порог даёт больше автоматики и больше ошибок; высокий — наоборот. Правильное положение определяется ценой ошибки в вашем процессе, и настраивается оно по деньгам, а не по симметричной метрике.

Реалистичные ожидания по цифрам

В нашем проекте обработки документов об образовании конвейер дал обработку за пятнадцать минут вместо двух-трёх дней, снижение ошибок на 90% и рост пропускной способности в десять раз. Это результат на конкретном типе документов с конкретным качеством сканов.

Переносить эти цифры на свой поток не нужно — они зависят от типа документов и качества входа. Что переносится, так это структура ожиданий: полной автоматизации не будет, часть документов всегда пойдёт человеку, и эффект считается по доле, которая проходит без него.

Где решение обычно даёт больше всего

  • Там, где есть выраженный пик. Если в сезон нанимают временных сотрудников, экономится их фонд целиком — это часто крупнее, чем экономия на постоянном штате.
  • Там, где ошибка стоит дорого. Неверная сумма в накладной — это спор с контрагентом, а не внутренняя правка.
  • Там, где ввод задерживает процесс. Если документ ждёт очереди на ввод три дня, автоматизация ускоряет не ввод, а весь процесс за ним.
  • Там, где объём растёт. Ручной ввод масштабируется наймом, автоматический — почти бесплатно.

Чего делать не стоит

  1. Начинать со всех типов документов сразу. Возьмите один самый массовый, доведите до результата, потом расширяйте — инфраструктура уже будет готова.
  2. Строить решение на координатных шаблонах. Работает до первой новой формы, а формы меняются постоянно.
  3. Обещать стопроцентную автоматизацию. Её не будет, и обещание разрушит доверие к системе быстрее, чем ошибки.
  4. Отправлять всё распознанное в систему без проверки. Одна неверная сумма, дошедшая до контрагента, обходится дороже месяца ручного ввода.
  5. Мерить качество на отобранных образцах. Мерить надо на том, что реально приходит.

Как оценить задачу за две недели

Берётся реальная выборка документов за месяц — вся, без отбора. Собирается прототип конвейера, и считаются две цифры: доля полей, извлечённых уверенно и верно, и доля документов, прошедших целиком без участия человека. Вторая цифра и есть основа расчёта окупаемости.

Дальше арифметика простая: сколько времени сейчас уходит на документ, сколько останется на проверку спорного, во что это превращается на вашем месячном объёме и на пике. Если разница не окупает проект — это выясняется до пилота, а не после внедрения.

Типы документов и их реальная сложность

Оценить проект «на глаз» мешает то, что документы сильно различаются по трудности, а выглядят одинаково — все они листы бумаги. Полезно понимать градацию заранее.

Простые: структурированные машинные документы

Счета, накладные, платёжные документы в электронном виде или качественные PDF. Текст извлекается напрямую, структура предсказуема. Здесь достижима высокая доля автоматической обработки, и проект окупается быстрее всего.

Средние: сканы печатных документов

Договоры, акты, справки. Качество зависит от сканера и аккуратности: перекос, тени, печати поверх текста. Распознавание работает хорошо, основная работа приходится на извлечение полей из разнородных форм.

Сложные: фотографии и рукописный ввод

Снимки с телефона, документы с рукописными пометками, старые бланки. Здесь заметная доля уйдёт человеку — и это не провал, а нормальный результат. Задача проекта не убрать людей полностью, а сократить их долю с ста процентов до разумной.

Отдельно: таблицы и многостраничные приложения

Спецификации, сметы, приложения с позициями. Сложность не в распознавании, а в восстановлении структуры: какая ячейка к какому столбцу относится, продолжается ли таблица на следующей странице. Это отдельная работа, и её надо оценивать отдельно.

Как устроена проверка

Шаг, который отличает работающее решение от демонстрации. Проверок бывает три вида, и работают они вместе.

  1. Формальная: соответствует ли значение ожидаемому виду. Дата — это дата, ИНН проходит контрольную сумму, сумма — число с двумя знаками. Ловит грубые ошибки распознавания мгновенно и бесплатно.
  2. Внутренняя непротиворечивость: сумма прописью совпадает с цифрами, позиции складываются в итог, НДС соответствует ставке. Ловит подмену цифры — самую опасную ошибку, потому что глазами она не видна.
  3. Внешняя сверка: контрагент есть в справочнике, договор существует, номенклатура находится в каталоге. Ловит ошибки в наименованиях и заодно сразу связывает документ с учётными данными.

Всё, что не прошло проверку, отправляется человеку с подсветкой конкретного поля и фрагментом изображения рядом. Это принципиально: оператор должен видеть, что распозналось и как выглядит оригинал в этом месте, — тогда проверка занимает секунды.

Полезная метрика для приёмки: не «точность распознавания», а среднее время обработки документа человеком после внедрения. Она учитывает всё сразу — и качество распознавания, и удобство интерфейса проверки, и долю спорного. Именно её и надо сравнивать с временем ручного ввода.

Интеграция с учётной системой

Часть, которую регулярно недооценивают. Распознать документ — половина дела; результат должен попасть в систему так, чтобы им можно было пользоваться.

  • Сопоставление с существующими сущностями: контрагент, договор, номенклатура. Названия в документе и в системе различаются, и нужен механизм сведения — та же задача, что мы решали при сопоставлении номенклатур в металлургии.
  • Обработка дублей: тот же документ пришёл дважды, в другом формате или с исправлением. Без этого в системе накапливаются двойники.
  • Привязка оригинала: к записи должен прикрепляться исходный файл, иначе при спорной ситуации нечего смотреть.
  • Поведение при недоступности системы: документ не должен потеряться, пока учётная система на обслуживании.

Порядок внедрения

  1. Один самый массовый тип документа. Не самый сложный и не самый заметный — самый частый.
  2. Прототип на реальной выборке за месяц, включая плохие экземпляры. Замер двух цифр: доля верно извлечённых полей и доля документов без вмешательства человека.
  3. Пилот на ограниченном потоке с параллельной ручной обработкой. Расхождения — материал для настройки порогов.
  4. Переключение с сохранением выборочного контроля: проверять не всё, но регулярно.
  5. Расширение на следующие типы документов. Второй тип идёт втрое быстрее первого: конвейер, интеграция и процесс проверки уже есть.

Как считать эффект и что обещать заказчику внутри

Проекты обработки документов легко продать внутри компании и легко разочаровать, потому что ожидания формулируются в неверных единицах.

Неправильная формулировка: «система будет распознавать документы с точностью 95%». Она ничего не говорит о работе людей и при этом создаёт впечатление, что 95% документов пройдут сами. На деле документ состоит из десятка полей, и если каждое распознаётся с точностью 95%, вероятность того, что весь документ пройдёт без единой ошибки, существенно ниже.

Правильная формулировка: «доля документов, обработанных без участия человека, составит столько-то процентов, а среднее время обработки оставшихся сократится с такого-то до такого-то». Обе величины измеримы, обе напрямую переводятся в деньги, и обе честно отражают, что люди никуда не денутся.

Полезно также заранее договориться о том, как будет измеряться результат после внедрения: на какой выборке, с какой периодичностью и кто считает. Проекты автоматизации документооборота часто заканчиваются спором о том, стало ли лучше, — и выигрывает его тот, кто заранее зафиксировал метрику и способ её измерения.

Что делать с исправлениями операторов

Каждое исправление, внесённое человеком в распознанный документ, — это готовый размеченный пример. Компании, которые это осознают, получают постоянно улучшающуюся систему бесплатно; те, кто не осознаёт, теряют самый ценный ресурс проекта.

Технически всё просто: логировать надо не только итоговое значение, но и то, что предложила система, что исправил человек и в каком месте документа это было. Через несколько месяцев эксплуатации накапливается выборка ровно тех случаев, где модель ошибается, — то есть самая полезная выборка из возможных.

Дальше эти данные используются двумя способами. Первый — периодическое дообучение: модель учится именно на своих ошибках, а не на случайных примерах. Второй — анализ: если исправления концентрируются на одном поле или одном типе документа, это указывает не на общую слабость модели, а на конкретную проблему, которую можно решить точечно.

Отдельная польза — метрика. Доля документов, потребовавших исправления, и среднее число исправленных полей на документ показывают качество системы честнее любых лабораторных замеров, потому что считаются на реальном потоке и обновляются каждый день.

Коротко

  • Распознавание — только один из пяти шагов; проваливаются проекты обычно на проверке и маршруте спорных случаев.
  • Координатные шаблоны не работают: поля должны извлекаться по смыслу.
  • Качество определяется реалистичностью и разнообразием обучающей выборки, а не объёмом.
  • Полной автоматизации не бывает — эффект считается по доле документов, прошедших без человека.
  • Наибольшую выгоду решение даёт там, где есть сезонный пик или дорогая ошибка.

Нужно решение, а не эксперимент?

Разберём вашу задачу и предложим план — услуга «OCR и обработка документов».

Подробнее

Разберём вашу задачу

Статья даёт общую картину по теме «Документы», а ваш случай всегда конкретнее. Пришлите описание процесса — вернёмся с оценкой и планом.