Что такое OWASP Top 10 для LLM-приложений и почему это отдельный список?
OWASP Top 10 для LLM-приложений — ранжированный список десяти самых значимых рисков безопасности в системах на больших языковых моделях; его ведёт OWASP Gen AI Security Project, последняя редакция — 2025 года. Он существует отдельно от классического веб-Top 10, потому что LLM-приложение обрабатывает недоверенный язык, а язык может нести инструкции. Добавьте инструменты (база, почта, платежи) и поиск по приватным документам — и получите отказы, которых нет ни в одном чек-листе по SQL-инъекциям. Редакция 2025 года добавила избыточные полномочия, утечку системного промпта, слабости векторного поиска и дезинформацию — по тому, что реально ломалось в развёртываниях (OWASP, 2025).
Классическая инъекция и prompt injection: что меняется?
У SQL-инъекции и prompt injection общая причина — данные, которые интерпретируются как инструкции, — но защита различается. У SQL-инъекции есть полное исправление: параметризованные запросы. У prompt injection полного исправления нет, потому что модель не может надёжно отличить инструкцию от содержимого, поэтому защита смещается к ограничению того, чего может добиться внедрённая инструкция. Таблица показывает этот сдвиг; именно поэтому остальной список в основном про права и обработку вывода.
| Критерий | Классическая инъекция (SQL, команды) | Prompt injection |
|---|---|---|
| Где входит | Поля форм, параметры URL, заголовки | Сообщения пользователя, найденные документы, вывод инструментов, веб-страницы |
| Почему работает | Парсер смешивает код и данные | Модель смешивает инструкции и содержимое по замыслу |
| Есть полное исправление? | Да: параметризованные запросы, экранирование | Нет: только многослойное снижение риска |
| Основная защита | Исправить границу парсера | Ограничить, что модель может сделать, и проверить, что она сделала |
| Обнаружение | Сигнатуры WAF, статический анализ | Наборы атак в CI, проверки вывода, одобрение человеком |
| Радиус поражения | Одна база или хост | Каждый инструмент и документ, доступный агенту |
Как каждый из десяти проявляется в реальной системе и в чём исправление?
Каждый пункт ниже — конкретный отказ, который мы видели в чат-боте, RAG-системе или агенте, в паре с исправлением, которое применяем в продакшене. Порядок — OWASP; на практике первый, шестой и восьмой дают большинство инцидентов с реальным ущербом, потому что именно они превращают неверный ответ в неверное действие или утёкший документ. Экономика утечек оправдывает исправления: по оценке IBM, средняя глобальная стоимость утечки данных в 2024 году составила 4,88 млн долларов США (IBM, 2024).
- 1. Prompt injection. Пользователь или документ, который читает модель, велит ей забыть инструкции. Опасна косвенная инъекция: письмо, веб-страница, PDF в базе знаний. Исправление: разделять инструкции и данные, считать всё найденное недоверенным, требовать подтверждения действий, гонять набор инъекций при каждом изменении.
- 2. Раскрытие чувствительной информации. Модель повторяет персональные данные, секреты или данные другого клиента. Исправление: минимизировать, что доходит до модели, авторизовать на этапе поиска, чистить логи.
- 3. Цепочка поставок. Сторонние модели, адаптеры, датасеты, плагины неизвестного происхождения. Исправление: инвентаризация, подписанные артефакты, зафиксированные версии, оценка перед заменой.
- 4. Отравление данных и модели. Кто-то подкладывает контент, меняющий ответы. Исправление: контролировать, кто пишет в базу знаний, проверять загрузку, следить за дрейфом ответов.
- 5. Небезопасная обработка вывода. Вывод модели попадает в SQL, shell, HTML или браузер без экранирования. Исправление: считать вывод пользовательским вводом — параметризовать, экранировать, изолировать.
- 6. Избыточные полномочия. У агента больше инструментов, прав и автономии, чем нужно. Исправление: инструменты с минимальными правами, ограниченные учётные данные, человек в контуре для необратимых действий.
- 7. Утечка системного промпта. Ваши инструкции — и секреты, которые некоторые команды в них кладут, — извлекаемы. Исправление: считать промпт публичным; секреты и авторизацию держать вне его.
- 8. Слабости векторного поиска. RAG возвращает документы, которых пользователь не должен видеть, или эмбеддинги обращаются в текст. Исправление: ACL на документ применяются в запросе, а не после; изоляция тенантов.
- 9. Дезинформация. Уверенные неверные ответы с бизнес-последствиями. Исправление: обоснование с источниками, наборы для оценки, оговорки там, где ставки реальны.
- 10. Неограниченное потребление. Потоки токенов, рекурсивные циклы инструментов, denial of wallet. Исправление: лимиты частоты, бюджеты на пользователя и на запуск, обнаружение циклов.
Как тестировать LLM-приложение по этому списку?
Тестируйте в два слоя: автоматический набор промптов — инъекции, jailbreak, извлечение, злоупотребление, — который запускается в CI как юнит-тесты, и ручная фаза, где инженеры, понимающие инструменты за агентом, пробуют их связать. Автоматический слой ловит регрессии при каждом изменении промпта или модели; ручной находит пути, которые генератор не придумает, — например, прочитать отравленный тикет, а затем через доступ к CRM слить данные. Ручные находки становятся новыми автоматическими кейсами, и набор растёт вместе с системой. MITRE ATLAS даёт публичный каталог техник атак на ИИ-системы — хорошее зерно для такого набора (MITRE, 2024).
Именно это делает наша оценка безопасности ИИ и LLM; те же инженеры строят наши продакшен-ИИ-системы — поэтому исправления практичные, а не теоретические.
Кому это важно и чего ждут регуляторы?
Любой команде, которая подключает модель к приватным данным или инструментам, нужно пройти по списку — это большинство чат-ботов с базой знаний и каждый агент. Регуляторы сходятся на тех же мерах: AI Act ЕС (Регламент 2024/1689) требует от поставщиков моделей общего назначения и операторов высокорисковых систем управлять рисками кибербезопасности и документировать их (EU, 2024), а профиль NIST по генеративному ИИ называет prompt injection, утечку данных и конфабуляцию среди рисков, которые организации должны измерять и контролировать (NIST, 2024). Список OWASP — практический мост между этими обязательствами и планом тестирования.