Перейти к содержимому
Nyoka

Распознаваниеи обработка документов

Скан, фото или PDF на входе — проверенные поля в CRM, ERP и учётной системе на выходе, без ручного ввода.

скан или PDFИЗВЛЕЧЕНОномерА-1042сумма184 200 ₽срок14 днейв системучеловекуспорное поле не проходит молча

Когда это нужно

  • Операторы вручную переносят счета, накладные и договоры в учётную систему — медленно и с опечатками.

  • Каждый день приходят сотни сканов, фото и PDF — от разных поставщиков, в разных форматах бланков.

  • Документы сфотографированы криво, с печатями, рукописными пометками и таблицами — коробочное OCR не справляется.

  • В документах персональные данные, отправлять их в облачные сервисы распознавания нельзя.

Что меняетсяв вашей работе

Данные без ручного ввода

Система распознаёт документ и заносит поля в CRM, ERP или учётную систему — операторы не перебивают суммы, реквизиты и даты с бумаги вручную.

Работа с плохими сканами

Распознаём кривые фото, слабые сканы, печати, таблицы и рукописный текст — там, где обычное OCR пасует.

Проверка перед записью

Извлечённые поля проверяются по форматам и справочникам; сомнительные значения уходят на подтверждение оператору, а не в базу.

Данные не покидают контур

Разворачиваем on-premise — сканы паспортов, договоров и анкет остаются в вашем периметре, по 152-ФЗ.

Что под капотом

Достаточно деталей, чтобы техническому руководителю было понятно, как мы решаем задачу.

Предобработка и OCR
Выравнивание, чистка и бинаризация кривых сканов, затем OCR (PaddleOCR, Tesseract, TrOCR для рукописного) и разбор структуры страницы.
Классификация и извлечение
Определяем тип документа, извлекаем поля и таблицы: layout-модели (LayoutLMv3, Donut) и LLM со структурированным выводом; данные пишутся в CRM, ERP и учётные системы по API.
Валидация и контроль
Проверка полей по форматам и справочникам (ИНН, КПП, даты, суммы), контроль по уверенности распознавания; всё ниже порога уходит оператору.
Модели и развёртывание
OCR-движки, layout-модели и LLM разворачиваем в вашем контуре (Docker/Kubernetes, при необходимости без доступа в интернет); отечественные облачные GigaChat и YandexGPT подключаем для сложных полей там, где это допускает регламент.

Частые вопросы.Короткие ответы.

Готовые облачные сервисы работают по фиксированным шаблонам и требуют отправки документов наружу. Мы настраиваем извлечение под ваши типы документов, разворачиваем в вашем контуре и пишем данные прямо в CRM, ERP или учётную систему — без ручного экспорта и стороннего облака.

Да. Система работает on-premise, в вашем периметре: сканы паспортов, договоров и анкет не покидают контур. Доступ по ролям, логирование операций, соответствие 152-ФЗ.

Зависит от качества исходников. Кривые фото и слабые сканы выравниваем и чистим до распознавания, для рукописного — отдельные модели. Точность замеряем на вашей выборке; поля с низкой уверенностью уходят оператору на проверку, а не в базу.

Пилот на одном-двух типах документов — от 600 тыс. ₽ за 2–4 недели: настройка извлечения, интеграция с одной системой (CRM, ERP или учётной), замер точности на вашей выборке. Дальнейшие типы документов и интеграции оцениваем по итогам пилота, точную смету — после разбора ваших образцов.

Посчитаем, что это даст у вас

Опишите процесс — вернёмся с планом прототипа, сроком и вилкой по направлению «OCR и обработка документов». Если задача решается проще, скажем и об этом.