Skip to content
Продуктовая розничная сеть, ЕС и США (под NDA) · Ритейл · Финансы

Document AI, который читает 1 300 накладных от поставщиков в день

Сканы и фото накладных, счетов и актов проходят через мультимодальную модель, которая извлекает типизированные поля с оценкой уверенности по каждому, сверяет их со справочниками поставщиков и договоров и передаёт в ERP. К человеку попадают только документы с низкой уверенностью — примерно каждый девятый.

Длительность
4 месяца до продакшена
Опубликовано
26 августа 2026
Стек
PythonPyTorchMultimodal LLMPostgreSQLRabbitMQVueERP APIDocker

88%

документов без участия человека

−6,5 ч

ручного ввода экономится ежедневно

98.6%

точность сумм и налоговых номеров

38 с

средняя проверка спорного документа

С чего всё началось?

Отправная точка — бухгалтерия, перепечатывающая больше 200 документов от поставщиков в день: сканы счетов, фотографии накладных и акты на трёх языках, по десятку раскладок у каждого поставщика. При примерно двух минутах на документ это больше шести человеко-часов чистой перепечатки в день плюс неизбежные опечатки в суммах и налоговых номерах. Картина типичная: ежегодное исследование Ardent Partners «State of ePayables» (2024) сообщает, что значительная доля счетов по-прежнему приходит в бумаге или PDF, а ручная обработка обходится в разы дороже автоматизированной в расчёте на счёт.

В реестре ИИ-инициатив Glanit кейс получил 4/5 по готовности данных: документы есть, тестовый контур ERP доступен, 200 эталонных документов с проверенными значениями полей можно подготовить за неделю. Он вошёл в первую волну пилотов.

Какую задачу нужно было решить?

Задача была не «распознать текст», а «никогда не провести неверную сумму». Классический OCR распознаёт символы; он не понимает, что «Итого» у одного поставщика стоит в правой нижней таблице, а у другого — строкой в подвале. Шаблонное извлечение ломается каждый раз, когда поставщик меняет формат, — поэтому Gartner (2023) описывает движение рынка от шаблонного OCR к интеллектуальной обработке документов, сочетающей layout-модели и языковые модели. Для финансистов настоящее требование сделало оценку уверенности и дизайн ручной проверки не менее важными, чем сама модель извлечения.

Извлечение с оценкой уверенности по каждому полю

Оператор видит скан и извлечённые поля рядом. Зелёные поля выше порога автопроводки, жёлтые требуют клика. Позиции сверяются с итогами до того, как что-либо попадёт в ERP.

Интерфейс Document AI: скан счёта с подсвеченными областями рядом с извлечёнными полями, шкалами уверенности и сверенными позициями
Экран проверки: подсвеченные области источника, типизированные поля с уверенностью, сопоставление со справочником поставщиков и сверка позиций.

Как это было построено?

Решение построено как пайплайн на очередях: приём и нормализация изображений, мультимодальная модель, возвращающая типизированные поля с уверенностью по каждому полю, сверка с мастер-данными, очередь ручной проверки для всего ниже порога и проводка в ERP с приложенным сканом. Человек в контуре — по дизайну, а не как запасной вариант: глобальный опрос Deloitte по интеллектуальной автоматизации (2022) показал, что большинство организаций, внедряющих автоматизацию, по-прежнему сочетают её с проверкой человеком, а допуск финансистов на ошибочную проводку был нулевым.

  • Приём. Документы приходят с сетевых сканеров, из почтового ящика и общей папки; очередь нормализует изображения (выравнивание, коррекция перспективы для фото с телефона, разбиение на страницы).
  • Понимание, а не просто OCR. Мультимодальная модель читает документ целиком и возвращает контрагента, налоговый номер, номер, дату, нетто/НДС/брутто и позиции структурированным JSON с уверенностью по каждому полю и областью-источником на странице.
  • Сверка. Извлечённые значения сопоставляются со справочником поставщиков, договорами и заказами; позиции должны сходиться с итогами. Документ, не прошедший любую проверку, уходит на ревью с подсветкой нарушенного правила.
  • Очередь проверки. Скан и предзаполненные поля рядом; оператор подтверждает или исправляет. Каждое исправление сохраняется как обучающие данные.
  • Проводка в ERP. Подтверждённые документы проводятся через API ERP с приложенным сканом; у каждого документа полный аудиторский след от приёма до проводки.

Шаблонный OCR против мультимодального извлечения: что меняется?

Таблица показывает, почему проект не начали с шаблонного OCR. Шаблоны работают, когда раскладок мало и они стабильны; здесь у каждого поставщика был десяток раскладок, и они менялись. Мультимодальная модель читает страницу целиком, поэтому новая раскладка — это новый пример, а не новый шаблон, и она возвращает уверенность по каждому полю, что и делает возможным порог проверки.

Шаблонный OCR против мультимодального понимания документов
КритерийШаблонный OCRМультимодальная модель + сверка
Новая раскладка поставщикаНастроить шаблонРаботает сразу, улучшается на исправлениях
Фото с телефонаНе работает без идеального выравниванияКоррекция перспективы + модель читает контекст
Уверенность по полюНетДа, управляет порогом проверки
ПозицииХрупкие табличные правилаИзвлекаются и сверяются с итогами
Риск неверной суммыТихие ошибкиНарушения правил уходят человеку
Доля без участия человека здесьНе достигнута в раннем пробном запуске88% через двенадцать месяцев
Шаблонный OCR против мультимодального понимания документов

Результаты

Доля документов без участия человека стартовала с 58% при запуске и росла месяц за месяцем по мере дообучения модели на исправлениях операторов. Точность полей измеряется на ежемесячной аудиторской выборке против ERP.

Доля документов без участия человека по месяцам
0%25%50%75%100%М1 — Без участия человека: 58%М1М2 — Без участия человека: 66%М2М3 — Без участия человека: 71%М3М4 — Без участия человека: 76%М4М5 — Без участия человека: 79%М5М6 — Без участия человека: 82%М6М7 — Без участия человека: 84%М7М8 — Без участия человека: 85%М8М9 — Без участия человека: 86%М9М10 — Без участия человека: 87%М10М11 — Без участия человека: 87%М11М12 — Без участия человека: 88%М12
Data table
Без участия человека
М158%
М266%
М371%
М476%
М579%
М682%
М784%
М885%
М986%
М1087%
М1187%
М1288%
Точность полей на аудиторской выборке
Сумма бруттоСумма брутто: 99.1%99.1%Налоговый номерНалоговый номер: 98.6%98.6%Номер счётаНомер счёта: 98.4%98.4%ДатаДата: 98.2%98.2%Сумма неттоСумма нетто: 97.9%97.9%Номер заказаНомер заказа: 95.8%95.8%ПозицииПозиции: 94.7%94.7%

Номер заказа — самое сложное поле: часто написан от руки или отсутствует.

Data table
Точность
Сумма брутто99.1%
Налоговый номер98.6%
Номер счёта98.4%
Дата98.2%
Сумма нетто97.9%
Номер заказа95.8%
Позиции94.7%

Очередь проверки

Двенадцать процентов документов по-прежнему доходят до человека — но проверка теперь занимает 38 секунд вместо двух минут набора, потому что оператор подтверждает, а не перепечатывает.

Дашборд очереди проверки с дневными показателями и графиком роста доли автоматической обработки за 12 месяцев
Операционный экран: документов в день, доля автоматической обработки, доля на проверке и время обработки.

Стек

Воркеры на Python поверх RabbitMQ; мультимодальная LLM для понимания документа и дообученная layout-модель для детекции областей; PostgreSQL для документов, полей и аудита; интерфейс проверки на Vue; интеграция с ERP через API вендора. Работает в Docker в инфраструктуре клиента; документы обрабатываются внутри корпоративного периметра, а внешние модельные API для содержимого счетов не используются.

Кому подходит этот подход?

Подход подходит любой финансовой, логистической или страховой команде с большим потоком документов в разных раскладках: счета, накладные, таможенные декларации, страховые заявления, кредитные заявки. Паттерн всегда один: извлечь с оценкой уверенности, сверить с тем, что уже известно, и оставить людям только исключения. Регуляторное направление то же: структурированные электронные счета обязательны в госзакупках ЕС с Директивы 2014/55/EU, а пакет VAT in the Digital Age, принятый в 2025 году, в ближайшие годы распространяет цифровую отчётность на трансграничные B2B-счета, так что пайплайн, уже выдающий типизированные и сверенные данные, — шаг в эту сторону, а не временная заплатка.

Частые вопросы

Услуги, стоящие за этим кейсом

Ещё кейсы

ИИ-ассистенты по регламентам для продуктовой сети с 30 000 сотрудников

Три RAG-ассистента на одной платформе — для коммерческой функции, директоров магазинов (голосом, прямо из торгового зала) и HR — отвечают на вопросы по корпоративным регламентам со ссылкой на конкретный пункт или честно говорят, что ответа нет, — и сотрудники перестают звонить в офис по типовым вопросам.

  • Ритейл
  • Python
  • LangChain
  • PostgreSQL + pgvector

Catalogue AI: классификация новых SKU и очистка 182 000 карточек товаров

Две модели на товарном каталоге продуктовой сети: одна предлагает код классификации и категорию для каждой новинки с вероятностями top-3, другая находит дубликаты карточек семантически. Категорийные менеджеры подтверждают одним кликом вместо ручного поиска по классификатору; каждое подтверждение идёт в дообучение.

  • Ритейл · Мастер-данные
  • Python
  • scikit-learn
  • Sentence Transformers

Голос покупателя: 12 источников отзывов, один поток с ИИ-классификацией

Отзывы с карт, из магазинов приложений, соцсетей, горячей линии и книги замечаний стекаются в одну систему, которая классифицирует каждый по теме, тональности, магазину и критичности, эскалирует критичные ответственному за минуты и даёт руководству живую картину по каждому магазину вместо ежемесячной сводки.

  • Ритейл · Клиентский опыт
  • Python
  • Transformers
  • PostgreSQL

Обсудить ваш проект