Document AI, который читает 1 300 накладных от поставщиков в день
Сканы и фото накладных, счетов и актов проходят через мультимодальную модель, которая извлекает типизированные поля с оценкой уверенности по каждому, сверяет их со справочниками поставщиков и договоров и передаёт в ERP. К человеку попадают только документы с низкой уверенностью — примерно каждый девятый.
- Длительность
- 4 месяца до продакшена
- Опубликовано
- 26 августа 2026
- Стек
- PythonPyTorchMultimodal LLMPostgreSQLRabbitMQVueERP APIDocker
88%
документов без участия человека
−6,5 ч
ручного ввода экономится ежедневно
98.6%
точность сумм и налоговых номеров
38 с
средняя проверка спорного документа
С чего всё началось?
Отправная точка — бухгалтерия, перепечатывающая больше 200 документов от поставщиков в день: сканы счетов, фотографии накладных и акты на трёх языках, по десятку раскладок у каждого поставщика. При примерно двух минутах на документ это больше шести человеко-часов чистой перепечатки в день плюс неизбежные опечатки в суммах и налоговых номерах. Картина типичная: ежегодное исследование Ardent Partners «State of ePayables» (2024) сообщает, что значительная доля счетов по-прежнему приходит в бумаге или PDF, а ручная обработка обходится в разы дороже автоматизированной в расчёте на счёт.
В реестре ИИ-инициатив Glanit кейс получил 4/5 по готовности данных: документы есть, тестовый контур ERP доступен, 200 эталонных документов с проверенными значениями полей можно подготовить за неделю. Он вошёл в первую волну пилотов.
Какую задачу нужно было решить?
Задача была не «распознать текст», а «никогда не провести неверную сумму». Классический OCR распознаёт символы; он не понимает, что «Итого» у одного поставщика стоит в правой нижней таблице, а у другого — строкой в подвале. Шаблонное извлечение ломается каждый раз, когда поставщик меняет формат, — поэтому Gartner (2023) описывает движение рынка от шаблонного OCR к интеллектуальной обработке документов, сочетающей layout-модели и языковые модели. Для финансистов настоящее требование сделало оценку уверенности и дизайн ручной проверки не менее важными, чем сама модель извлечения.
Извлечение с оценкой уверенности по каждому полю
Оператор видит скан и извлечённые поля рядом. Зелёные поля выше порога автопроводки, жёлтые требуют клика. Позиции сверяются с итогами до того, как что-либо попадёт в ERP.
Как это было построено?
Решение построено как пайплайн на очередях: приём и нормализация изображений, мультимодальная модель, возвращающая типизированные поля с уверенностью по каждому полю, сверка с мастер-данными, очередь ручной проверки для всего ниже порога и проводка в ERP с приложенным сканом. Человек в контуре — по дизайну, а не как запасной вариант: глобальный опрос Deloitte по интеллектуальной автоматизации (2022) показал, что большинство организаций, внедряющих автоматизацию, по-прежнему сочетают её с проверкой человеком, а допуск финансистов на ошибочную проводку был нулевым.
- Приём. Документы приходят с сетевых сканеров, из почтового ящика и общей папки; очередь нормализует изображения (выравнивание, коррекция перспективы для фото с телефона, разбиение на страницы).
- Понимание, а не просто OCR. Мультимодальная модель читает документ целиком и возвращает контрагента, налоговый номер, номер, дату, нетто/НДС/брутто и позиции структурированным JSON с уверенностью по каждому полю и областью-источником на странице.
- Сверка. Извлечённые значения сопоставляются со справочником поставщиков, договорами и заказами; позиции должны сходиться с итогами. Документ, не прошедший любую проверку, уходит на ревью с подсветкой нарушенного правила.
- Очередь проверки. Скан и предзаполненные поля рядом; оператор подтверждает или исправляет. Каждое исправление сохраняется как обучающие данные.
- Проводка в ERP. Подтверждённые документы проводятся через API ERP с приложенным сканом; у каждого документа полный аудиторский след от приёма до проводки.
Шаблонный OCR против мультимодального извлечения: что меняется?
Таблица показывает, почему проект не начали с шаблонного OCR. Шаблоны работают, когда раскладок мало и они стабильны; здесь у каждого поставщика был десяток раскладок, и они менялись. Мультимодальная модель читает страницу целиком, поэтому новая раскладка — это новый пример, а не новый шаблон, и она возвращает уверенность по каждому полю, что и делает возможным порог проверки.
| Критерий | Шаблонный OCR | Мультимодальная модель + сверка |
|---|---|---|
| Новая раскладка поставщика | Настроить шаблон | Работает сразу, улучшается на исправлениях |
| Фото с телефона | Не работает без идеального выравнивания | Коррекция перспективы + модель читает контекст |
| Уверенность по полю | Нет | Да, управляет порогом проверки |
| Позиции | Хрупкие табличные правила | Извлекаются и сверяются с итогами |
| Риск неверной суммы | Тихие ошибки | Нарушения правил уходят человеку |
| Доля без участия человека здесь | Не достигнута в раннем пробном запуске | 88% через двенадцать месяцев |
Результаты
Доля документов без участия человека стартовала с 58% при запуске и росла месяц за месяцем по мере дообучения модели на исправлениях операторов. Точность полей измеряется на ежемесячной аудиторской выборке против ERP.
Data table
| Без участия человека | |
|---|---|
| М1 | 58% |
| М2 | 66% |
| М3 | 71% |
| М4 | 76% |
| М5 | 79% |
| М6 | 82% |
| М7 | 84% |
| М8 | 85% |
| М9 | 86% |
| М10 | 87% |
| М11 | 87% |
| М12 | 88% |
Номер заказа — самое сложное поле: часто написан от руки или отсутствует.
Data table
| Точность | |
|---|---|
| Сумма брутто | 99.1% |
| Налоговый номер | 98.6% |
| Номер счёта | 98.4% |
| Дата | 98.2% |
| Сумма нетто | 97.9% |
| Номер заказа | 95.8% |
| Позиции | 94.7% |
Очередь проверки
Двенадцать процентов документов по-прежнему доходят до человека — но проверка теперь занимает 38 секунд вместо двух минут набора, потому что оператор подтверждает, а не перепечатывает.
Стек
Воркеры на Python поверх RabbitMQ; мультимодальная LLM для понимания документа и дообученная layout-модель для детекции областей; PostgreSQL для документов, полей и аудита; интерфейс проверки на Vue; интеграция с ERP через API вендора. Работает в Docker в инфраструктуре клиента; документы обрабатываются внутри корпоративного периметра, а внешние модельные API для содержимого счетов не используются.
Кому подходит этот подход?
Подход подходит любой финансовой, логистической или страховой команде с большим потоком документов в разных раскладках: счета, накладные, таможенные декларации, страховые заявления, кредитные заявки. Паттерн всегда один: извлечь с оценкой уверенности, сверить с тем, что уже известно, и оставить людям только исключения. Регуляторное направление то же: структурированные электронные счета обязательны в госзакупках ЕС с Директивы 2014/55/EU, а пакет VAT in the Digital Age, принятый в 2025 году, в ближайшие годы распространяет цифровую отчётность на трансграничные B2B-счета, так что пайплайн, уже выдающий типизированные и сверенные данные, — шаг в эту сторону, а не временная заплатка.
Частые вопросы
Услуги, стоящие за этим кейсом
Услуги
ИИ и машинное обучение
ИИ-агенты, LLM-пайплайны с поиском, прогнозирование, компьютерное зрение и Document AI — встроенные в ваш продукт и измеренные цифрами «до/после».
ИИ и машинное обучение
Бесплатный инструмент для автоматизации общения в бизнесе
Обзор проекта как открытого решения для создания ИИ-чатбота с поддержкой Grok, Gemini и ChatGPT, преимущества для бизнеса в Беларуси (экономия на поддержке, автоматизация 24/7), акцент на бесплатность сервера при использовании API-ключей.
ИИ и машинное обучение
Как работают ИИ-агенты: архитектура продакшн-агента
ИИ-агент — это не чат-бот с длинным промптом. Это система: модель для рассуждений, обёрнутая в восприятие, память, инструменты, оркестрацию и мониторинг. Мы строим агентов для клиентов и для собственных продуктов — вот архитектура, которая за ними стоит.
Ещё кейсы
ИИ-ассистенты по регламентам для продуктовой сети с 30 000 сотрудников
Три RAG-ассистента на одной платформе — для коммерческой функции, директоров магазинов (голосом, прямо из торгового зала) и HR — отвечают на вопросы по корпоративным регламентам со ссылкой на конкретный пункт или честно говорят, что ответа нет, — и сотрудники перестают звонить в офис по типовым вопросам.
- Ритейл
- Python
- LangChain
- PostgreSQL + pgvector
Catalogue AI: классификация новых SKU и очистка 182 000 карточек товаров
Две модели на товарном каталоге продуктовой сети: одна предлагает код классификации и категорию для каждой новинки с вероятностями top-3, другая находит дубликаты карточек семантически. Категорийные менеджеры подтверждают одним кликом вместо ручного поиска по классификатору; каждое подтверждение идёт в дообучение.
- Ритейл · Мастер-данные
- Python
- scikit-learn
- Sentence Transformers
Голос покупателя: 12 источников отзывов, один поток с ИИ-классификацией
Отзывы с карт, из магазинов приложений, соцсетей, горячей линии и книги замечаний стекаются в одну систему, которая классифицирует каждый по теме, тональности, магазину и критичности, эскалирует критичные ответственному за минуты и даёт руководству живую картину по каждому магазину вместо ежемесячной сводки.
- Ритейл · Клиентский опыт
- Python
- Transformers
- PostgreSQL