Почему LLM-приложение — новая поверхность атаки?
LLM-приложение — новая поверхность атаки поверх классической, и на то три причины. Его вход — естественный язык, поэтому каждый документ, который оно читает, каждая загруженная страница и каждое сообщение пользователя — потенциальный код. У него есть инструменты — доступ к базе, почта, тикеты, платежи, — поэтому удачная манипуляция превращается в действие. И его поведение вероятностно: тест, прошедший вчера, может упасть сегодня после обновления модели. Обычный пентест ничего из этого не покрывает; наша ИИ-команда строит агентов и RAG-пайплайны для продакшена, и те же инженеры их атакуют.
Поверхность быстро растёт: по данным McKinsey, 65% организаций уже регулярно используют генеративный ИИ хотя бы в одной бизнес-функции (McKinsey, 2024), а OWASP ставит prompt injection на первое место среди рисков LLM-приложений (OWASP, 2025).
AI red teaming или классический пентест: в чём разница?
Классический пентест атакует код и инфраструктуру вокруг модели; AI red teaming атакует поведение модели и инструменты, до которых она дотягивается. Большинству продакшен-систем с ИИ нужно и то и другое, а MITRE ATLAS теперь каталогизирует состязательные техники против ИИ-систем в том же стиле, что ATT&CK для классических (MITRE, 2024).
| Критерий | Классический пентест | AI red teaming |
|---|---|---|
| Цель | Серверы, код, API, сеть, конфигурация облака | Поведение модели, промпты, слой поиска, инструменты агента |
| Типичная инъекция | SQL, команды, XSS — структурированные payload | Prompt injection — естественный язык, напрямую или через документы |
| Детерминизм | Одинаковый вход — одинаковый результат | Вероятностно; нужны множество вариантов и многоходовые атаки |
| Опорный фреймворк | OWASP Top 10, ASVS, PTES | OWASP Top 10 for LLM, MITRE ATLAS, NIST AI RMF |
| Исправление | Патч, конфигурация, изменение кода | Guardrails, минимальные права инструментов, авторизация поиска, evals |
| Регрессия | Перепроверка после исправления | Набор атак становится постоянным набором для оценки |
Что мы проверяем?
Мы проверяем вашу систему по OWASP Top 10 for LLM Applications, демонстрируя каждую находку на вашем реальном чат-боте, RAG-пайплайне или агенте воспроизводимым промптом или документом. Список важен, потому что модели приходят быстрее, чем контроли: Gartner прогнозирует, что к 2026 году более 80% предприятий будут использовать API генеративного ИИ или развернут приложения на его основе — против менее 5% в 2023 году (Gartner, 2023).
- Prompt injection, прямая и косвенная (через документы, веб-страницы, письма, результаты инструментов) — риск номер один.
- Раскрытие чувствительной информации — персональные данные, секреты, данные других клиентов, утекающие через ответы, поиск или логи.
- Цепочка поставок — сторонние модели, адаптеры, датасеты, плагины и их происхождение.
- Отравление данных и модели — подмена обучающих или поисковых данных.
- Небезопасная обработка вывода — вывод модели попадает в SQL, shell, HTML или браузер без экранирования.
- Избыточные полномочия — у агента больше инструментов, прав и автономии, чем требует задача.
- Утечка системного промпта, слабости векторного поиска (контроль доступа в RAG), дезинформация и неограниченное потребление (denial of wallet).
Где уместно, сопоставляем с NIST AI RMF, MITRE ATLAS и требованиями EU AI Act для вашего сценария.
Как проходит AI red teaming?
Проект занимает две–четыре недели и состоит из четырёх шагов: модель угроз, состязательное тестирование, отчёт с укреплением и регрессионный набор. Сначала описываем, что система видит, что может делать и кто с ней говорит, затем ранжируем цели атак — вытащить данные, выполнить несанкционированное действие, обойти политику контента, отравить поиск, раскрутить расходы. Структура следует NIST AI Risk Management Framework и его профилю для генеративного ИИ (NIST AI 600-1, 2024), поэтому результат ложится в реестр рисков, который уже понимают ваши аудиторы.
Состязательное тестирование (1–3 недели). Ручной red teaming инженерами плюс автоматические наборы атак (тысячи вариантов prompt injection, jailbreak и извлечения, многоходовые и многоязычные). Для агентов: злоупотребление инструментами, повышение привилегий через цепочки инструментов, сценарии confused deputy. Для RAG: доступ к данным других клиентов, отравленные документы, обход контроля доступа.
Отчёт и укрепление. Находки с воспроизведением и серьёзностью и исправления, которые мы можем внедрить вместе с вами: guardrails на входе и выходе, инструменты по принципу минимальных прав, человек в контуре для необратимых действий, авторизация на уровне поиска, экранирование вывода, лимиты частоты и бюджета, логирование и алерты на аномалии.
Регрессионный набор. Атаки становятся набором для оценки, который запускается при каждом изменении промпта, модели или инструмента — чтобы исправленное оставалось исправленным.
Как мы строим ИИ-системы, безопасные по конструкции?
Помимо тестирования, мы проектируем и строим ИИ-системы, безопасные по конструкции: минимизация данных до того, как что-либо попадёт в модель, провайдеры с нулевым хранением или self-hosted модели внутри вашего периметра, разделение инструкций и данных, изолированное выполнение инструментов, авторизация каждого пользователя на этапе поиска, полная трассировка промптов, вызовов инструментов и стоимости, мониторинг дрейфа и злоупотреблений в продакшене. Мониторинг окупается: организации, широко применявшие ИИ и автоматизацию в безопасности, экономили в среднем 2,2 млн долларов США на утечке по сравнению с теми, кто этого не делал (IBM, 2024). Смотрите, как мы устроены ИИ-агенты, и наши правила обращения с данными.
Кому это нужно?
Эта услуга для любой команды, которая выпускает LLM к пользователям или подключает её к внутренним системам: компаниям, запускающим ассистента для клиентов; командам, подключающим агента к CRM, ERP, почте или платежам; продуктам на RAG поверх конфиденциальных документов; всем, кто отвечает на анкету безопасности, где теперь есть раздел «ИИ». Она также нужна организациям, готовящимся к регулированию: EU AI Act (Регламент (ЕС) 2024/1689) вступил в силу в августе 2024 года, а большинство обязательств для систем высокого риска применяется с августа 2026 года (EU, 2024); ISO/IEC 42001 задаёт стандарт системы менеджмента, о котором спросят аудиторы. Запросить оценку безопасности ИИ.