Ввод документов вручную — одна из немногих задач, где эффект от автоматизации виден почти сразу и считается без споров. При этом проекты здесь регулярно проваливаются, и почти всегда по одной причине: распознавание считают всей задачей, тогда как это только первый шаг из пяти. Разберём конвейер целиком.
Пять шагов, из которых состоит задача
Шаг первый: приведение изображения в порядок
Фотография под углом, блики, тени, мятая бумага, сшитые страницы. До распознавания изображение выравнивают, чистят и разделяют на страницы. Этот шаг незаметен, но именно он определяет качество всего дальнейшего — на плохом входе точный распознаватель бесполезен.
Шаг второй: распознавание текста
Превращение изображения в текст с координатами. Технически это самая зрелая часть конвейера: на печатном тексте современные распознаватели работают хорошо. Проблемы начинаются на рукописном вводе, печатях поверх текста и таблицах со сложной структурой.
Шаг третий: извлечение полей
Самая содержательная часть. Из текста надо понять, что здесь номер договора, что дата, что сумма, а что реквизиты контрагента. Именно здесь ломаются решения на жёстких шаблонах: у каждого контрагента свой бланк, и координатный подход умирает на первой же новой форме.
Шаг четвёртый: проверка
Извлечённое проверяется на непротиворечивость: сумма прописью совпадает с цифрами, ИНН проходит контроль, дата не из будущего, позиции складываются в итог. Этот шаг ловит большую часть ошибок распознавания программно, до человека.
Шаг пятый: передача в систему и маршрут спорного
Уверенно распознанное уходит в учётную систему автоматически. Спорное попадает оператору вместе с фрагментом изображения — чтобы проверка занимала секунды, а не требовала открывать документ заново.
Пропуск четвёртого и пятого шагов — самая частая причина, по которой внедрение не приживается. Без проверки и внятного маршрута спорных случаев система выглядит ненадёжной, и люди возвращаются к ручному вводу — тихо и необратимо.
Что определяет качество
Реалистичность обучающих данных
Если систему настраивали на чистых PDF, а в эксплуатацию пойдут фотографии с телефона, цифры пилота не повторятся. Мы на диагностике просим обычную выборку за месяц, включая худшие экземпляры, — расхождение между отобранными образцами и реальным потоком регулярно оказывается драматическим.
Разнообразие форм
Двести документов от двадцати контрагентов дают лучший результат, чем пятьсот от одного. В нашем проекте по оценке дипломов работа шла с документами сорока стран — именно разнообразие выборки позволило системе не ломаться на формах, которых она не видела.
Настройка порога уверенности
Порог — это ручка, которой регулируется соотношение автоматики и ручной проверки. Низкий порог даёт больше автоматики и больше ошибок; высокий — наоборот. Правильное положение определяется ценой ошибки в вашем процессе, и настраивается оно по деньгам, а не по симметричной метрике.
Реалистичные ожидания по цифрам
В нашем проекте обработки документов об образовании конвейер дал обработку за пятнадцать минут вместо двух-трёх дней, снижение ошибок на 90% и рост пропускной способности в десять раз. Это результат на конкретном типе документов с конкретным качеством сканов.
Переносить эти цифры на свой поток не нужно — они зависят от типа документов и качества входа. Что переносится, так это структура ожиданий: полной автоматизации не будет, часть документов всегда пойдёт человеку, и эффект считается по доле, которая проходит без него.
Где решение обычно даёт больше всего
- Там, где есть выраженный пик. Если в сезон нанимают временных сотрудников, экономится их фонд целиком — это часто крупнее, чем экономия на постоянном штате.
- Там, где ошибка стоит дорого. Неверная сумма в накладной — это спор с контрагентом, а не внутренняя правка.
- Там, где ввод задерживает процесс. Если документ ждёт очереди на ввод три дня, автоматизация ускоряет не ввод, а весь процесс за ним.
- Там, где объём растёт. Ручной ввод масштабируется наймом, автоматический — почти бесплатно.
Чего делать не стоит
- Начинать со всех типов документов сразу. Возьмите один самый массовый, доведите до результата, потом расширяйте — инфраструктура уже будет готова.
- Строить решение на координатных шаблонах. Работает до первой новой формы, а формы меняются постоянно.
- Обещать стопроцентную автоматизацию. Её не будет, и обещание разрушит доверие к системе быстрее, чем ошибки.
- Отправлять всё распознанное в систему без проверки. Одна неверная сумма, дошедшая до контрагента, обходится дороже месяца ручного ввода.
- Мерить качество на отобранных образцах. Мерить надо на том, что реально приходит.
Как оценить задачу за две недели
Берётся реальная выборка документов за месяц — вся, без отбора. Собирается прототип конвейера, и считаются две цифры: доля полей, извлечённых уверенно и верно, и доля документов, прошедших целиком без участия человека. Вторая цифра и есть основа расчёта окупаемости.
Дальше арифметика простая: сколько времени сейчас уходит на документ, сколько останется на проверку спорного, во что это превращается на вашем месячном объёме и на пике. Если разница не окупает проект — это выясняется до пилота, а не после внедрения.
Типы документов и их реальная сложность
Оценить проект «на глаз» мешает то, что документы сильно различаются по трудности, а выглядят одинаково — все они листы бумаги. Полезно понимать градацию заранее.
Простые: структурированные машинные документы
Счета, накладные, платёжные документы в электронном виде или качественные PDF. Текст извлекается напрямую, структура предсказуема. Здесь достижима высокая доля автоматической обработки, и проект окупается быстрее всего.
Средние: сканы печатных документов
Договоры, акты, справки. Качество зависит от сканера и аккуратности: перекос, тени, печати поверх текста. Распознавание работает хорошо, основная работа приходится на извлечение полей из разнородных форм.
Сложные: фотографии и рукописный ввод
Снимки с телефона, документы с рукописными пометками, старые бланки. Здесь заметная доля уйдёт человеку — и это не провал, а нормальный результат. Задача проекта не убрать людей полностью, а сократить их долю с ста процентов до разумной.
Отдельно: таблицы и многостраничные приложения
Спецификации, сметы, приложения с позициями. Сложность не в распознавании, а в восстановлении структуры: какая ячейка к какому столбцу относится, продолжается ли таблица на следующей странице. Это отдельная работа, и её надо оценивать отдельно.
Как устроена проверка
Шаг, который отличает работающее решение от демонстрации. Проверок бывает три вида, и работают они вместе.
- Формальная: соответствует ли значение ожидаемому виду. Дата — это дата, ИНН проходит контрольную сумму, сумма — число с двумя знаками. Ловит грубые ошибки распознавания мгновенно и бесплатно.
- Внутренняя непротиворечивость: сумма прописью совпадает с цифрами, позиции складываются в итог, НДС соответствует ставке. Ловит подмену цифры — самую опасную ошибку, потому что глазами она не видна.
- Внешняя сверка: контрагент есть в справочнике, договор существует, номенклатура находится в каталоге. Ловит ошибки в наименованиях и заодно сразу связывает документ с учётными данными.
Всё, что не прошло проверку, отправляется человеку с подсветкой конкретного поля и фрагментом изображения рядом. Это принципиально: оператор должен видеть, что распозналось и как выглядит оригинал в этом месте, — тогда проверка занимает секунды.
Полезная метрика для приёмки: не «точность распознавания», а среднее время обработки документа человеком после внедрения. Она учитывает всё сразу — и качество распознавания, и удобство интерфейса проверки, и долю спорного. Именно её и надо сравнивать с временем ручного ввода.
Интеграция с учётной системой
Часть, которую регулярно недооценивают. Распознать документ — половина дела; результат должен попасть в систему так, чтобы им можно было пользоваться.
- Сопоставление с существующими сущностями: контрагент, договор, номенклатура. Названия в документе и в системе различаются, и нужен механизм сведения — та же задача, что мы решали при сопоставлении номенклатур в металлургии.
- Обработка дублей: тот же документ пришёл дважды, в другом формате или с исправлением. Без этого в системе накапливаются двойники.
- Привязка оригинала: к записи должен прикрепляться исходный файл, иначе при спорной ситуации нечего смотреть.
- Поведение при недоступности системы: документ не должен потеряться, пока учётная система на обслуживании.
Порядок внедрения
- Один самый массовый тип документа. Не самый сложный и не самый заметный — самый частый.
- Прототип на реальной выборке за месяц, включая плохие экземпляры. Замер двух цифр: доля верно извлечённых полей и доля документов без вмешательства человека.
- Пилот на ограниченном потоке с параллельной ручной обработкой. Расхождения — материал для настройки порогов.
- Переключение с сохранением выборочного контроля: проверять не всё, но регулярно.
- Расширение на следующие типы документов. Второй тип идёт втрое быстрее первого: конвейер, интеграция и процесс проверки уже есть.
Как считать эффект и что обещать заказчику внутри
Проекты обработки документов легко продать внутри компании и легко разочаровать, потому что ожидания формулируются в неверных единицах.
Неправильная формулировка: «система будет распознавать документы с точностью 95%». Она ничего не говорит о работе людей и при этом создаёт впечатление, что 95% документов пройдут сами. На деле документ состоит из десятка полей, и если каждое распознаётся с точностью 95%, вероятность того, что весь документ пройдёт без единой ошибки, существенно ниже.
Правильная формулировка: «доля документов, обработанных без участия человека, составит столько-то процентов, а среднее время обработки оставшихся сократится с такого-то до такого-то». Обе величины измеримы, обе напрямую переводятся в деньги, и обе честно отражают, что люди никуда не денутся.
Полезно также заранее договориться о том, как будет измеряться результат после внедрения: на какой выборке, с какой периодичностью и кто считает. Проекты автоматизации документооборота часто заканчиваются спором о том, стало ли лучше, — и выигрывает его тот, кто заранее зафиксировал метрику и способ её измерения.
Что делать с исправлениями операторов
Каждое исправление, внесённое человеком в распознанный документ, — это готовый размеченный пример. Компании, которые это осознают, получают постоянно улучшающуюся систему бесплатно; те, кто не осознаёт, теряют самый ценный ресурс проекта.
Технически всё просто: логировать надо не только итоговое значение, но и то, что предложила система, что исправил человек и в каком месте документа это было. Через несколько месяцев эксплуатации накапливается выборка ровно тех случаев, где модель ошибается, — то есть самая полезная выборка из возможных.
Дальше эти данные используются двумя способами. Первый — периодическое дообучение: модель учится именно на своих ошибках, а не на случайных примерах. Второй — анализ: если исправления концентрируются на одном поле или одном типе документа, это указывает не на общую слабость модели, а на конкретную проблему, которую можно решить точечно.
Отдельная польза — метрика. Доля документов, потребовавших исправления, и среднее число исправленных полей на документ показывают качество системы честнее любых лабораторных замеров, потому что считаются на реальном потоке и обновляются каждый день.
Коротко
- Распознавание — только один из пяти шагов; проваливаются проекты обычно на проверке и маршруте спорных случаев.
- Координатные шаблоны не работают: поля должны извлекаться по смыслу.
- Качество определяется реалистичностью и разнообразием обучающей выборки, а не объёмом.
- Полной автоматизации не бывает — эффект считается по доле документов, прошедших без человека.
- Наибольшую выгоду решение даёт там, где есть сезонный пик или дорогая ошибка.