Skip to content
Продуктовая розничная сеть, ЕС и США (под NDA) · Ритейл · Мастер-данные

Catalogue AI: классификация новых SKU и очистка 182 000 карточек товаров

Две модели на товарном каталоге продуктовой сети: одна предлагает код классификации и категорию для каждой новинки с вероятностями top-3, другая находит дубликаты карточек семантически. Категорийные менеджеры подтверждают одним кликом вместо ручного поиска по классификатору; каждое подтверждение идёт в дообучение.

Длительность
6 недель до первых результатов, 4 месяца всего
Опубликовано
26 августа 2026
Стек
Pythonscikit-learnSentence TransformersFAISSPostgreSQLFastAPIVueAirflow

−78%

времени на классификацию новинки

91%

точность top-1 через полгода

1 903

групп дубликатов в первом прогоне

5/5

готовность данных — без подготовки

С чего всё началось?

Отправная точка — каталог из 182 000 карточек, который наполняют сотни поставщиков и ведут десятки категорийных менеджеров в нескольких странах, где каждую новинку классифицировали вручную. Поиск нужного кода в классификаторе из примерно 1 400 листовых категорий занимал около пяти минут на позицию, а разные менеджеры трактовали классификатор по-разному, и каталог «расползался». Цена такого дрейфа типична: по оценке Gartner (2021), низкое качество данных обходится организациям в среднем в 12,9 млн долларов в год, а исследование HBR (2017) показало, что лишь около 3% данных компаний соответствуют базовым стандартам качества.

Каталог был полон дубликатов: один товар, заведённый дважды с разным написанием, раздваивал аналитику продаж, удваивал остатки и показывал покупателю одну и ту же позицию дважды.

Обе инициативы получили 5/5 по готовности данных в реестре Glanit — десятки тысяч исторически классифицированных SKU с описаниями и атрибутами уже были в системе, — поэтому они стали треком «быстрых побед» параллельно первой волне пилотов.

Какую задачу нужно было решить?

Две задачи одновременно: классифицировать каждую новинку в одну из примерно 1 400 листовых категорий и находить дубликаты карточек, которые точное сравнение строк не видит. Классификация — большая многоклассовая задача с длинным хвостом, мультиязычными описаниями и неконсистентными атрибутами поставщиков. Дубликаты отличаются порядком слов, единицами измерения, сокращениями и языком, поэтому сравнение названий почти ничего не находит; даже общий штрихкод GS1 (GTIN) ловит лишь ту часть дубликатов, где поставщики корректно заполнили поле. Обе модели должны были встроиться в существующий процесс заведения товара без нового инструмента, и человек всегда подтверждает.

Top-3 подсказки прямо в форме заведения

Категорийный менеджер видит три ранжированных варианта с вероятностями и подтверждает одной клавишей. Исправления возвращаются в обучающую выборку той же ночью.

Интерфейс Catalogue AI: новинка с тремя предложенными категориями и вероятностями, график точности и список кандидатов-дубликатов
Экран новинки с классификацией top-3, недельной точностью на подтверждённых позициях и ранжированными кандидатами-дубликатами.

Как это было построено?

Решение построено как две модели за одним интерфейсом подтверждения: классификатор, возвращающий top-3 кода категорий с калиброванными вероятностями, и поиск дубликатов, который семантически эмбеддит каждую карточку и ищет ближайших соседей. Приближённый поиск соседей — стандартный способ быстро сравнивать сотни тысяч эмбеддингов; библиотека FAISS, использованная здесь, опубликована исследователями Meta в 2017 году и остаётся эталонной реализацией. Каждое подтверждение человека идёт в еженедельное переобучение.

  • Классификатор. Градиентный бустинг поверх текстовых эмбеддингов (мультиязычные sentence transformers) и структурных атрибутов (состав, бренд, единица, хранение), обученный на истории присвоенных кодов. Порог уверенности решает, предвыбран ли top-1 или менеджер выбирает сам.
  • Поиск дубликатов. Карточки эмбеддятся (название + атрибуты + штрихкод + описание); FAISS даёт пары-кандидаты, парная модель их оценивает, кандидаты группируются и ранжируются. Пары с одинаковым EAN показываются первыми как достоверные дубликаты.
  • Интерфейс подтверждения. Экран слияния показывает обе карточки с полнотой атрибутов и покрытием остатками, предлагает, какую оставить, и фиксирует решение. Регулярные прогоны ловят новые дубликаты по мере заведения.
  • Петля дообучения. Подтверждения и исправления собираются ежедневно; классификатор переобучается еженедельно (Airflow) с автоматическим порогом точности перед выкладкой.

Правила против обученных моделей: что находит дубликаты и категории?

Таблица сравнивает подход на правилах, который клиент пробовал раньше (ключевые слова и точное совпадение), с обученными моделями, которые его заменили. Правила прозрачны, но хрупки: на каждое новое написание у поставщика нужно новое правило. Обученные модели дороже в запуске и требуют размеченной истории, зато обобщаются на написания и языки, для которых никто не писал правил.

Правила против обученных моделей в классификации и поиске дубликатов
КритерийПравила и точное совпадениеОбученные модели (этот проект)
ЗапускБыстро, без обучающих данныхНужна размеченная история (здесь: десятки тысяч SKU)
Новые поставщики и написанияНовое правило на каждый случайОбобщение через эмбеддинги
Мультиязычные названияОтдельные правила на языкОдна мультиязычная модель
Полнота поиска дубликатовТолько та же строка или штрихкодСемантические соседи плюс штрихкод
ОбъяснимостьПолнаяTop-3 с вероятностями, бейджи-доказательства
СопровождениеНабор правил растёт бесконечноЕженедельное переобучение на подтверждениях
Правила против обученных моделей в классификации и поиске дубликатов

Результаты

Точность измеряется на позициях, которые категорийные менеджеры реально подтвердили — честная метрика, — и росла каждую неделю по мере того, как исправления попадали в обучение.

Точность классификации на подтверждённых позициях
  • Top-1
  • Top-3
0%25%50%75%100%Н1Н4Н8Н12Н16Н20Н24Н1 — Top-1: 79%Н4 — Top-1: 84%Н8 — Top-1: 87%Н12 — Top-1: 89%Н16 — Top-1: 90%Н20 — Top-1: 91%Н24 — Top-1: 92%92%Н1 — Top-3: 93%Н4 — Top-3: 96%Н8 — Top-3: 97%Н12 — Top-3: 98%Н16 — Top-3: 98%Н20 — Top-3: 99%Н24 — Top-3: 99%99%
Data table
Top-1Top-3
Н179%93%
Н484%96%
Н887%97%
Н1289%98%
Н1690%98%
Н2091%99%
Н2492%99%
Группы дубликатов по категориям, первый полный прогон
НапиткиНапитки: 412412МолочныеМолочные: 318318ХозтоварыХозтовары: 296296СнекиСнеки: 244244ЗаморозкаЗаморозка: 203203ВыпечкаВыпечка: 176176УходУход: 154154ПрочееПрочее: 100100
Data table
Групп
Напитки412
Молочные318
Хозтовары296
Снеки244
Заморозка203
Выпечка176
Уход154
Прочее100

Проверка слияния

Категорийные менеджеры обрабатывают группы дубликатов в отдельной очереди; большинство решений занимают секунды, потому что доказательства — тот же EAN, полнота атрибутов, где лежит остаток — на экране.

Экран проверки дубликатов с двумя карточками товара и счётчиками слитых, оставленных и ожидающих решений
Проверка слияния: карточки рядом, бейджи с доказательствами и решения за неделю.

Стек

Стек целиком на Python: scikit-learn и LightGBM для классификатора, Sentence Transformers для мультиязычных эмбеддингов, FAISS для приближённого поиска соседей, инференс-сервисы на FastAPI, PostgreSQL для карточек и решений, Airflow для еженедельного переобучения и регулярных прогонов дубликатов. Интерфейс подтверждения на Vue встроен в существующий инструмент заведения товара через его API, так что категорийные менеджеры не покидают экран, которым уже пользуются.

Кому подходит этот подход?

Подход подходит любой компании, чьи мастер-данные ведут люди, а наполняют многие поставщики: продуктовый и DIY-ритейл, аптечные сети, дистрибьюторы запчастей, маркетплейсы. Чистые мастер-данные — фундамент, на котором стоит половина ИИ-дорожной карты: прогноз спроса, подбор замен при out-of-stock и conversational BI зависят от одной карточки на товар. McKinsey (2023) оценивает годовой эффект генеративного ИИ в ритейле примерно в 400–660 млрд долларов, и большая часть этой ценности предполагает чистые данные каталога. Регулирование ведёт туда же: Регламент ЕС об экодизайне (2024) вводит цифровой паспорт продукта, который потребует согласованных идентификаторов и атрибутов по каждому товару.

Это проект, с которого мы рекомендуем начинать, когда данные готовы, а бизнесу нужен видимый результат за недели.

Частые вопросы

Услуги, стоящие за этим кейсом

Ещё кейсы

ИИ-ассистенты по регламентам для продуктовой сети с 30 000 сотрудников

Три RAG-ассистента на одной платформе — для коммерческой функции, директоров магазинов (голосом, прямо из торгового зала) и HR — отвечают на вопросы по корпоративным регламентам со ссылкой на конкретный пункт или честно говорят, что ответа нет, — и сотрудники перестают звонить в офис по типовым вопросам.

  • Ритейл
  • Python
  • LangChain
  • PostgreSQL + pgvector

Document AI, который читает 1 300 накладных от поставщиков в день

Сканы и фото накладных, счетов и актов проходят через мультимодальную модель, которая извлекает типизированные поля с оценкой уверенности по каждому, сверяет их со справочниками поставщиков и договоров и передаёт в ERP. К человеку попадают только документы с низкой уверенностью — примерно каждый девятый.

  • Ритейл · Финансы
  • Python
  • PyTorch
  • Multimodal LLM

Голос покупателя: 12 источников отзывов, один поток с ИИ-классификацией

Отзывы с карт, из магазинов приложений, соцсетей, горячей линии и книги замечаний стекаются в одну систему, которая классифицирует каждый по теме, тональности, магазину и критичности, эскалирует критичные ответственному за минуты и даёт руководству живую картину по каждому магазину вместо ежемесячной сводки.

  • Ритейл · Клиентский опыт
  • Python
  • Transformers
  • PostgreSQL

Обсудить ваш проект