Skip to content

ИИ и машинное обучение·4 мин чтения

RAG в продакшене: чек-лист, который мы проходим перед запуском

RAG демонстрируется за день и ломается через месяц. Двенадцать проверок — данные, поиск, генерация, эксплуатация, — которые отличают пилот от системы, на которую полагаются люди.

Анатолий НовогродскийОснователь и CEO, GlanitОпубликовано 13 августа 2026 · Обновлено 27 августа 2026

Что такое RAG и почему RAG-пилоты буксуют?

Retrieval-augmented generation (RAG) индексирует ваши документы и позволяет языковой модели отвечать на вопросы фрагментами, найденными в них, так что ответы опираются на ваши данные, а не на память модели. Это самая распространённая форма LLM-проекта, и пилоты буксуют по предсказуемой причине: демо занимает полдня, а потом приходят реальные пользователи с реальными вопросами, индекс устаревает, ответы ссылаются на неверную версию политики, и доверие испаряется. Почти каждый отказ, который мы видели, сводится к пропуску одной из двенадцати проверок ниже. Сам метод давно устоялся: оригинальная работа показала, что поиск плюс генерация обходят одиночную модель на задачах, требующих знаний (Lewis et al., 2020).

RAG или дообучение: что нужно вам?

Используйте RAG, когда модель должна отвечать по документам, которые меняются и на которые нужно ссылаться; используйте дообучение, когда нужен устойчивый стиль, формат или предметная лексика, которых промптами не добиться. Это не соперники — многие продакшн-системы дообучают маленькую модель ради формата и используют RAG ради фактов, — но для задачи «отвечать на вопросы по нашим документам» RAG выбирают по умолчанию: его дешевле обновлять, и у каждого ответа есть источник.

RAG и дообучение для корпоративных знаний
КритерийRAGДообучение
Лучше всего дляФакты из меняющихся документов, ссылки на источникиСтиль, формат, предметная лексика, узкие задачи
Обновление знанийПереиндексировать документ (минуты)Переобучить (дни) и заново оценить
Контроль доступаACL на документ при запросеНет: всё обученное доступно всем
ПрослеживаемостьКаждый ответ ссылается на фрагментИсточника нет; модель «просто знает»
Начальные усилияПайплайн загрузки, индекс, оценкиРазмеченный датасет, обучающие запуски, оценки
Типичный отказПлохой поиск, устаревший индексПереобучение, забывание, устаревшие факты
RAG и дообучение для корпоративных знанийДлинный контекст в промпте — третий вариант для маленьких статичных корпусов; он перестаёт быть экономичным, когда корпус перерастает контекстное окно.

Как подготовить данные?

Дайте каждому индексируемому источнику владельца и график обновления, сохраняйте структуру документа при извлечении, снабжайте каждый фрагмент метаданными и зеркальте контроль доступа исходной системы в индексе. Проблемы данных вызывают больше отказов RAG, чем проблемы модели: фрагмент, режущий таблицу пополам, даёт уверенный неверный ответ, а документ без уровня доступа утекает не тому пользователю. OWASP выделяет слабости векторного поиска — когда поиск возвращает документы, которых пользователь не должен видеть, — как отдельный риск Top 10 в редакции 2025 года (OWASP, 2025).

  • Один владелец на источник. У каждой индексируемой коллекции есть человек, отвечающий за её точность, и график обновления.
  • Структура сохранена. Таблицы, заголовки и списки переживают извлечение; фрагмент никогда не режет таблицу пополам.
  • Метаданные на каждом фрагменте. Источник, дата, версия, уровень доступа — чтобы поиск мог фильтровать, а ответ — ссылаться.
  • Контроль доступа отзеркален. Если пользователь не может открыть документ, поиск не должен его возвращать. Проверяйте это явно.

Как сделать поиск надёжным?

Совмещайте поиск по ключевым словам и векторам, переранжируйте широкий набор кандидатов до нескольких фрагментов, измеряйте качество поиска на отдельном размеченном наборе и постройте явный путь «не знаю» для случаев, когда ничего релевантного не найдено. Именно в поиске выигрывается или проигрывается большая часть качества, и измерить его дёшево: сотня вопросов с правильными фрагментами даёт число полноты, которое можно отслеживать независимо от модели. Гибридный поиск и переранжирование — два изменения, которые чаще всего сдвигают это число.

  • Гибридный поиск. Ключевые слова плюс векторы; коды и названия товаров находятся точным совпадением, понятия — эмбеддингом.
  • Переранжирование. Достать 30, переранжировать до 5. Дёшево и один из самых больших выигрышей в качестве.
  • Качество поиска измеряется отдельно. Размеченный набор «вопрос → правильные фрагменты», полнота отслеживается отдельно от качества ответа.
  • Путь «не знаю». Когда ничего релевантного не найдено, система говорит об этом, а не импровизирует.

Как удержать генерацию честной?

Требуйте ссылку на источник для каждого утверждения, прогоняйте набор реальных вопросов при каждом изменении промпта, модели или индекса, ставьте ограничители на вывод и выбирайте модель по числам на этом наборе, а не по демо. Уверенные неверные ответы — отказ, который пользователи запоминают; OWASP называет это дезинформацией и включает в Top 10 для LLM-приложений (OWASP, 2025). Профиль NIST по генеративному ИИ называет конфабуляцию среди рисков, которые организации должны измерять, и рекомендует оценку на репрезентативных входах до развёртывания (NIST, 2024).

  • Ссылки обязательны. Каждое утверждение ссылается на фрагмент, из которого взято; ответы без опоры блокируются.
  • Набор для оценки из реальных вопросов. 100–300 случаев с ожидаемыми ответами, прогоняемых при каждом изменении промпта, модели или индекса.
  • Ограничители на вывод. Проверки персональных данных, политик и тона до того, как ответ покинет систему.
  • Выбор модели по числам. Сравните две-три модели на наборе для оценки по качеству, задержке и стоимости — не по демо.

Как эксплуатировать RAG после запуска?

Трассируйте каждый запрос, еженедельно возвращайте исправления пользователей в набор для оценки, поднимайте алерт, когда документ изменился в источнике, но не переиндексирован, и выводите стоимость ответа на дашборд, который читает бизнес. Эти четыре эксплуатационные проверки и превращают пилот в систему, на которую полагаются люди, потому что ловят дрейф раньше пользователей. Именно здесь большинство организаций и проседают: по данным McKinsey, лишь меньшинство компаний выстроили практики отслеживания чётко определённых KPI для решений на генеративном ИИ (McKinsey, 2025).

  • Трассировка. Каждый запрос сохраняет вопрос, найденные фрагменты, промпт, ответ, токены и задержку.
  • Петля обратной связи. «Большие пальцы вниз» и исправления людей еженедельно попадают в набор для оценки.
  • Алерты свежести индекса. Документ, обновлённый в источнике, но не переиндексированный по графику, вызывает алерт.
  • Стоимость ответа на дашборде, который читает бизнес.

Пройдите все двенадцать до запуска — и RAG станет скучным, а это ровно то, что нужно. Наш кейс ритейл-ассистента показывает, какие цифры это даёт; чтобы обсудить ваши документы, начните с пилота.

Ещё статьи

ИИ и машинное обучение ·

Почему гибридный поиск обошел чистые эмбеддинги в нашем пайплайне Invoice AI

Чистые плотные эмбеддинги не справились с буквенно-цифровыми серийными номерами в нашем пайплайне Invoice AI. Объединение полнотекстового поиска PostgreSQL tsvector с косинусным расстоянием pgvector подняло точность совпадений top-1 с 61,4% до 94,8%.

6 мин чтения

ИИ и машинное обучение ·

Почему pgvector заменил Qdrant в нашем пайплайне Feedback AI

Мы перенесли 5 миллионов векторных эмбеддингов из кластера Qdrant в PostgreSQL 16 с pgvector 0.7. Рассказываем, как сократили накладные расходы на инфраструктуру, сохранив задержку поиска в пределах 50 мс.

5 мин чтения

ИИ и машинное обучение ·

Как работают ИИ-агенты: архитектура продакшн-агента

Агент — это модель, обёрнутая в восприятие, память, инструменты, оркестрацию и мониторинг. Практический разбор шести слоёв: что ломается в каждом и что мы с этим делаем.

5 мин чтения