Catalogue AI: классификация новых SKU и очистка 182 000 карточек товаров
Две модели на товарном каталоге продуктовой сети: одна предлагает код классификации и категорию для каждой новинки с вероятностями top-3, другая находит дубликаты карточек семантически. Категорийные менеджеры подтверждают одним кликом вместо ручного поиска по классификатору; каждое подтверждение идёт в дообучение.
- Длительность
- 6 недель до первых результатов, 4 месяца всего
- Опубликовано
- 26 августа 2026
- Стек
- Pythonscikit-learnSentence TransformersFAISSPostgreSQLFastAPIVueAirflow
−78%
времени на классификацию новинки
91%
точность top-1 через полгода
1 903
групп дубликатов в первом прогоне
5/5
готовность данных — без подготовки
С чего всё началось?
Отправная точка — каталог из 182 000 карточек, который наполняют сотни поставщиков и ведут десятки категорийных менеджеров в нескольких странах, где каждую новинку классифицировали вручную. Поиск нужного кода в классификаторе из примерно 1 400 листовых категорий занимал около пяти минут на позицию, а разные менеджеры трактовали классификатор по-разному, и каталог «расползался». Цена такого дрейфа типична: по оценке Gartner (2021), низкое качество данных обходится организациям в среднем в 12,9 млн долларов в год, а исследование HBR (2017) показало, что лишь около 3% данных компаний соответствуют базовым стандартам качества.
Каталог был полон дубликатов: один товар, заведённый дважды с разным написанием, раздваивал аналитику продаж, удваивал остатки и показывал покупателю одну и ту же позицию дважды.
Обе инициативы получили 5/5 по готовности данных в реестре Glanit — десятки тысяч исторически классифицированных SKU с описаниями и атрибутами уже были в системе, — поэтому они стали треком «быстрых побед» параллельно первой волне пилотов.
Какую задачу нужно было решить?
Две задачи одновременно: классифицировать каждую новинку в одну из примерно 1 400 листовых категорий и находить дубликаты карточек, которые точное сравнение строк не видит. Классификация — большая многоклассовая задача с длинным хвостом, мультиязычными описаниями и неконсистентными атрибутами поставщиков. Дубликаты отличаются порядком слов, единицами измерения, сокращениями и языком, поэтому сравнение названий почти ничего не находит; даже общий штрихкод GS1 (GTIN) ловит лишь ту часть дубликатов, где поставщики корректно заполнили поле. Обе модели должны были встроиться в существующий процесс заведения товара без нового инструмента, и человек всегда подтверждает.
Top-3 подсказки прямо в форме заведения
Категорийный менеджер видит три ранжированных варианта с вероятностями и подтверждает одной клавишей. Исправления возвращаются в обучающую выборку той же ночью.
Как это было построено?
Решение построено как две модели за одним интерфейсом подтверждения: классификатор, возвращающий top-3 кода категорий с калиброванными вероятностями, и поиск дубликатов, который семантически эмбеддит каждую карточку и ищет ближайших соседей. Приближённый поиск соседей — стандартный способ быстро сравнивать сотни тысяч эмбеддингов; библиотека FAISS, использованная здесь, опубликована исследователями Meta в 2017 году и остаётся эталонной реализацией. Каждое подтверждение человека идёт в еженедельное переобучение.
- Классификатор. Градиентный бустинг поверх текстовых эмбеддингов (мультиязычные sentence transformers) и структурных атрибутов (состав, бренд, единица, хранение), обученный на истории присвоенных кодов. Порог уверенности решает, предвыбран ли top-1 или менеджер выбирает сам.
- Поиск дубликатов. Карточки эмбеддятся (название + атрибуты + штрихкод + описание); FAISS даёт пары-кандидаты, парная модель их оценивает, кандидаты группируются и ранжируются. Пары с одинаковым EAN показываются первыми как достоверные дубликаты.
- Интерфейс подтверждения. Экран слияния показывает обе карточки с полнотой атрибутов и покрытием остатками, предлагает, какую оставить, и фиксирует решение. Регулярные прогоны ловят новые дубликаты по мере заведения.
- Петля дообучения. Подтверждения и исправления собираются ежедневно; классификатор переобучается еженедельно (Airflow) с автоматическим порогом точности перед выкладкой.
Правила против обученных моделей: что находит дубликаты и категории?
Таблица сравнивает подход на правилах, который клиент пробовал раньше (ключевые слова и точное совпадение), с обученными моделями, которые его заменили. Правила прозрачны, но хрупки: на каждое новое написание у поставщика нужно новое правило. Обученные модели дороже в запуске и требуют размеченной истории, зато обобщаются на написания и языки, для которых никто не писал правил.
| Критерий | Правила и точное совпадение | Обученные модели (этот проект) |
|---|---|---|
| Запуск | Быстро, без обучающих данных | Нужна размеченная история (здесь: десятки тысяч SKU) |
| Новые поставщики и написания | Новое правило на каждый случай | Обобщение через эмбеддинги |
| Мультиязычные названия | Отдельные правила на язык | Одна мультиязычная модель |
| Полнота поиска дубликатов | Только та же строка или штрихкод | Семантические соседи плюс штрихкод |
| Объяснимость | Полная | Top-3 с вероятностями, бейджи-доказательства |
| Сопровождение | Набор правил растёт бесконечно | Еженедельное переобучение на подтверждениях |
Результаты
Точность измеряется на позициях, которые категорийные менеджеры реально подтвердили — честная метрика, — и росла каждую неделю по мере того, как исправления попадали в обучение.
- Top-1
- Top-3
Data table
| Top-1 | Top-3 | |
|---|---|---|
| Н1 | 79% | 93% |
| Н4 | 84% | 96% |
| Н8 | 87% | 97% |
| Н12 | 89% | 98% |
| Н16 | 90% | 98% |
| Н20 | 91% | 99% |
| Н24 | 92% | 99% |
Data table
| Групп | |
|---|---|
| Напитки | 412 |
| Молочные | 318 |
| Хозтовары | 296 |
| Снеки | 244 |
| Заморозка | 203 |
| Выпечка | 176 |
| Уход | 154 |
| Прочее | 100 |
Проверка слияния
Категорийные менеджеры обрабатывают группы дубликатов в отдельной очереди; большинство решений занимают секунды, потому что доказательства — тот же EAN, полнота атрибутов, где лежит остаток — на экране.
Стек
Стек целиком на Python: scikit-learn и LightGBM для классификатора, Sentence Transformers для мультиязычных эмбеддингов, FAISS для приближённого поиска соседей, инференс-сервисы на FastAPI, PostgreSQL для карточек и решений, Airflow для еженедельного переобучения и регулярных прогонов дубликатов. Интерфейс подтверждения на Vue встроен в существующий инструмент заведения товара через его API, так что категорийные менеджеры не покидают экран, которым уже пользуются.
Кому подходит этот подход?
Подход подходит любой компании, чьи мастер-данные ведут люди, а наполняют многие поставщики: продуктовый и DIY-ритейл, аптечные сети, дистрибьюторы запчастей, маркетплейсы. Чистые мастер-данные — фундамент, на котором стоит половина ИИ-дорожной карты: прогноз спроса, подбор замен при out-of-stock и conversational BI зависят от одной карточки на товар. McKinsey (2023) оценивает годовой эффект генеративного ИИ в ритейле примерно в 400–660 млрд долларов, и большая часть этой ценности предполагает чистые данные каталога. Регулирование ведёт туда же: Регламент ЕС об экодизайне (2024) вводит цифровой паспорт продукта, который потребует согласованных идентификаторов и атрибутов по каждому товару.
Это проект, с которого мы рекомендуем начинать, когда данные готовы, а бизнесу нужен видимый результат за недели.
Частые вопросы
Услуги, стоящие за этим кейсом
Услуги
ИИ и машинное обучение
ИИ-агенты, LLM-пайплайны с поиском, прогнозирование, компьютерное зрение и Document AI — встроенные в ваш продукт и измеренные цифрами «до/после».
ИИ и машинное обучение
Бесплатный инструмент для автоматизации общения в бизнесе
Обзор проекта как открытого решения для создания ИИ-чатбота с поддержкой Grok, Gemini и ChatGPT, преимущества для бизнеса в Беларуси (экономия на поддержке, автоматизация 24/7), акцент на бесплатность сервера при использовании API-ключей.
ИИ и машинное обучение
Как работают ИИ-агенты: архитектура продакшн-агента
ИИ-агент — это не чат-бот с длинным промптом. Это система: модель для рассуждений, обёрнутая в восприятие, память, инструменты, оркестрацию и мониторинг. Мы строим агентов для клиентов и для собственных продуктов — вот архитектура, которая за ними стоит.
Ещё кейсы
ИИ-ассистенты по регламентам для продуктовой сети с 30 000 сотрудников
Три RAG-ассистента на одной платформе — для коммерческой функции, директоров магазинов (голосом, прямо из торгового зала) и HR — отвечают на вопросы по корпоративным регламентам со ссылкой на конкретный пункт или честно говорят, что ответа нет, — и сотрудники перестают звонить в офис по типовым вопросам.
- Ритейл
- Python
- LangChain
- PostgreSQL + pgvector
Document AI, который читает 1 300 накладных от поставщиков в день
Сканы и фото накладных, счетов и актов проходят через мультимодальную модель, которая извлекает типизированные поля с оценкой уверенности по каждому, сверяет их со справочниками поставщиков и договоров и передаёт в ERP. К человеку попадают только документы с низкой уверенностью — примерно каждый девятый.
- Ритейл · Финансы
- Python
- PyTorch
- Multimodal LLM
Голос покупателя: 12 источников отзывов, один поток с ИИ-классификацией
Отзывы с карт, из магазинов приложений, соцсетей, горячей линии и книги замечаний стекаются в одну систему, которая классифицирует каждый по теме, тональности, магазину и критичности, эскалирует критичные ответственному за минуты и даёт руководству живую картину по каждому магазину вместо ежемесячной сводки.
- Ритейл · Клиентский опыт
- Python
- Transformers
- PostgreSQL