Что такое RAG и почему RAG-пилоты буксуют?
Retrieval-augmented generation (RAG) индексирует ваши документы и позволяет языковой модели отвечать на вопросы фрагментами, найденными в них, так что ответы опираются на ваши данные, а не на память модели. Это самая распространённая форма LLM-проекта, и пилоты буксуют по предсказуемой причине: демо занимает полдня, а потом приходят реальные пользователи с реальными вопросами, индекс устаревает, ответы ссылаются на неверную версию политики, и доверие испаряется. Почти каждый отказ, который мы видели, сводится к пропуску одной из двенадцати проверок ниже. Сам метод давно устоялся: оригинальная работа показала, что поиск плюс генерация обходят одиночную модель на задачах, требующих знаний (Lewis et al., 2020).
RAG или дообучение: что нужно вам?
Используйте RAG, когда модель должна отвечать по документам, которые меняются и на которые нужно ссылаться; используйте дообучение, когда нужен устойчивый стиль, формат или предметная лексика, которых промптами не добиться. Это не соперники — многие продакшн-системы дообучают маленькую модель ради формата и используют RAG ради фактов, — но для задачи «отвечать на вопросы по нашим документам» RAG выбирают по умолчанию: его дешевле обновлять, и у каждого ответа есть источник.
| Критерий | RAG | Дообучение |
|---|---|---|
| Лучше всего для | Факты из меняющихся документов, ссылки на источники | Стиль, формат, предметная лексика, узкие задачи |
| Обновление знаний | Переиндексировать документ (минуты) | Переобучить (дни) и заново оценить |
| Контроль доступа | ACL на документ при запросе | Нет: всё обученное доступно всем |
| Прослеживаемость | Каждый ответ ссылается на фрагмент | Источника нет; модель «просто знает» |
| Начальные усилия | Пайплайн загрузки, индекс, оценки | Размеченный датасет, обучающие запуски, оценки |
| Типичный отказ | Плохой поиск, устаревший индекс | Переобучение, забывание, устаревшие факты |
Как подготовить данные?
Дайте каждому индексируемому источнику владельца и график обновления, сохраняйте структуру документа при извлечении, снабжайте каждый фрагмент метаданными и зеркальте контроль доступа исходной системы в индексе. Проблемы данных вызывают больше отказов RAG, чем проблемы модели: фрагмент, режущий таблицу пополам, даёт уверенный неверный ответ, а документ без уровня доступа утекает не тому пользователю. OWASP выделяет слабости векторного поиска — когда поиск возвращает документы, которых пользователь не должен видеть, — как отдельный риск Top 10 в редакции 2025 года (OWASP, 2025).
- Один владелец на источник. У каждой индексируемой коллекции есть человек, отвечающий за её точность, и график обновления.
- Структура сохранена. Таблицы, заголовки и списки переживают извлечение; фрагмент никогда не режет таблицу пополам.
- Метаданные на каждом фрагменте. Источник, дата, версия, уровень доступа — чтобы поиск мог фильтровать, а ответ — ссылаться.
- Контроль доступа отзеркален. Если пользователь не может открыть документ, поиск не должен его возвращать. Проверяйте это явно.
Как сделать поиск надёжным?
Совмещайте поиск по ключевым словам и векторам, переранжируйте широкий набор кандидатов до нескольких фрагментов, измеряйте качество поиска на отдельном размеченном наборе и постройте явный путь «не знаю» для случаев, когда ничего релевантного не найдено. Именно в поиске выигрывается или проигрывается большая часть качества, и измерить его дёшево: сотня вопросов с правильными фрагментами даёт число полноты, которое можно отслеживать независимо от модели. Гибридный поиск и переранжирование — два изменения, которые чаще всего сдвигают это число.
- Гибридный поиск. Ключевые слова плюс векторы; коды и названия товаров находятся точным совпадением, понятия — эмбеддингом.
- Переранжирование. Достать 30, переранжировать до 5. Дёшево и один из самых больших выигрышей в качестве.
- Качество поиска измеряется отдельно. Размеченный набор «вопрос → правильные фрагменты», полнота отслеживается отдельно от качества ответа.
- Путь «не знаю». Когда ничего релевантного не найдено, система говорит об этом, а не импровизирует.
Как удержать генерацию честной?
Требуйте ссылку на источник для каждого утверждения, прогоняйте набор реальных вопросов при каждом изменении промпта, модели или индекса, ставьте ограничители на вывод и выбирайте модель по числам на этом наборе, а не по демо. Уверенные неверные ответы — отказ, который пользователи запоминают; OWASP называет это дезинформацией и включает в Top 10 для LLM-приложений (OWASP, 2025). Профиль NIST по генеративному ИИ называет конфабуляцию среди рисков, которые организации должны измерять, и рекомендует оценку на репрезентативных входах до развёртывания (NIST, 2024).
- Ссылки обязательны. Каждое утверждение ссылается на фрагмент, из которого взято; ответы без опоры блокируются.
- Набор для оценки из реальных вопросов. 100–300 случаев с ожидаемыми ответами, прогоняемых при каждом изменении промпта, модели или индекса.
- Ограничители на вывод. Проверки персональных данных, политик и тона до того, как ответ покинет систему.
- Выбор модели по числам. Сравните две-три модели на наборе для оценки по качеству, задержке и стоимости — не по демо.
Как эксплуатировать RAG после запуска?
Трассируйте каждый запрос, еженедельно возвращайте исправления пользователей в набор для оценки, поднимайте алерт, когда документ изменился в источнике, но не переиндексирован, и выводите стоимость ответа на дашборд, который читает бизнес. Эти четыре эксплуатационные проверки и превращают пилот в систему, на которую полагаются люди, потому что ловят дрейф раньше пользователей. Именно здесь большинство организаций и проседают: по данным McKinsey, лишь меньшинство компаний выстроили практики отслеживания чётко определённых KPI для решений на генеративном ИИ (McKinsey, 2025).
- Трассировка. Каждый запрос сохраняет вопрос, найденные фрагменты, промпт, ответ, токены и задержку.
- Петля обратной связи. «Большие пальцы вниз» и исправления людей еженедельно попадают в набор для оценки.
- Алерты свежести индекса. Документ, обновлённый в источнике, но не переиндексированный по графику, вызывает алерт.
- Стоимость ответа на дашборде, который читает бизнес.
Пройдите все двенадцать до запуска — и RAG станет скучным, а это ровно то, что нужно. Наш кейс ритейл-ассистента показывает, какие цифры это даёт; чтобы обсудить ваши документы, начните с пилота.