Skip to content

Кибербезопасность и безопасность ИИ

Безопасность ИИ и LLM: red teaming и оценка

Проверка безопасности чат-ботов, RAG-систем и ИИ-агентов по OWASP Top 10 for LLM Applications — prompt injection, утечки данных, избыточные полномочия, цепочка поставок — плюс защитные механизмы и мониторинг, которые держат в продакшене.

Почему LLM-приложение — новая поверхность атаки?

LLM-приложение — новая поверхность атаки поверх классической, и на то три причины. Его вход — естественный язык, поэтому каждый документ, который оно читает, каждая загруженная страница и каждое сообщение пользователя — потенциальный код. У него есть инструменты — доступ к базе, почта, тикеты, платежи, — поэтому удачная манипуляция превращается в действие. И его поведение вероятностно: тест, прошедший вчера, может упасть сегодня после обновления модели. Обычный пентест ничего из этого не покрывает; наша ИИ-команда строит агентов и RAG-пайплайны для продакшена, и те же инженеры их атакуют.

Поверхность быстро растёт: по данным McKinsey, 65% организаций уже регулярно используют генеративный ИИ хотя бы в одной бизнес-функции (McKinsey, 2024), а OWASP ставит prompt injection на первое место среди рисков LLM-приложений (OWASP, 2025).

AI red teaming или классический пентест: в чём разница?

Классический пентест атакует код и инфраструктуру вокруг модели; AI red teaming атакует поведение модели и инструменты, до которых она дотягивается. Большинству продакшен-систем с ИИ нужно и то и другое, а MITRE ATLAS теперь каталогизирует состязательные техники против ИИ-систем в том же стиле, что ATT&CK для классических (MITRE, 2024).

Сравнение классического пентеста и AI red teaming
КритерийКлассический пентестAI red teaming
ЦельСерверы, код, API, сеть, конфигурация облакаПоведение модели, промпты, слой поиска, инструменты агента
Типичная инъекцияSQL, команды, XSS — структурированные payloadPrompt injection — естественный язык, напрямую или через документы
ДетерминизмОдинаковый вход — одинаковый результатВероятностно; нужны множество вариантов и многоходовые атаки
Опорный фреймворкOWASP Top 10, ASVS, PTESOWASP Top 10 for LLM, MITRE ATLAS, NIST AI RMF
ИсправлениеПатч, конфигурация, изменение кодаGuardrails, минимальные права инструментов, авторизация поиска, evals
РегрессияПерепроверка после исправленияНабор атак становится постоянным набором для оценки
Сравнение классического пентеста и AI red teaming

Что мы проверяем?

Мы проверяем вашу систему по OWASP Top 10 for LLM Applications, демонстрируя каждую находку на вашем реальном чат-боте, RAG-пайплайне или агенте воспроизводимым промптом или документом. Список важен, потому что модели приходят быстрее, чем контроли: Gartner прогнозирует, что к 2026 году более 80% предприятий будут использовать API генеративного ИИ или развернут приложения на его основе — против менее 5% в 2023 году (Gartner, 2023).

  • Prompt injection, прямая и косвенная (через документы, веб-страницы, письма, результаты инструментов) — риск номер один.
  • Раскрытие чувствительной информации — персональные данные, секреты, данные других клиентов, утекающие через ответы, поиск или логи.
  • Цепочка поставок — сторонние модели, адаптеры, датасеты, плагины и их происхождение.
  • Отравление данных и модели — подмена обучающих или поисковых данных.
  • Небезопасная обработка вывода — вывод модели попадает в SQL, shell, HTML или браузер без экранирования.
  • Избыточные полномочия — у агента больше инструментов, прав и автономии, чем требует задача.
  • Утечка системного промпта, слабости векторного поиска (контроль доступа в RAG), дезинформация и неограниченное потребление (denial of wallet).

Где уместно, сопоставляем с NIST AI RMF, MITRE ATLAS и требованиями EU AI Act для вашего сценария.

Как проходит AI red teaming?

Проект занимает две–четыре недели и состоит из четырёх шагов: модель угроз, состязательное тестирование, отчёт с укреплением и регрессионный набор. Сначала описываем, что система видит, что может делать и кто с ней говорит, затем ранжируем цели атак — вытащить данные, выполнить несанкционированное действие, обойти политику контента, отравить поиск, раскрутить расходы. Структура следует NIST AI Risk Management Framework и его профилю для генеративного ИИ (NIST AI 600-1, 2024), поэтому результат ложится в реестр рисков, который уже понимают ваши аудиторы.

Состязательное тестирование (1–3 недели). Ручной red teaming инженерами плюс автоматические наборы атак (тысячи вариантов prompt injection, jailbreak и извлечения, многоходовые и многоязычные). Для агентов: злоупотребление инструментами, повышение привилегий через цепочки инструментов, сценарии confused deputy. Для RAG: доступ к данным других клиентов, отравленные документы, обход контроля доступа.

Отчёт и укрепление. Находки с воспроизведением и серьёзностью и исправления, которые мы можем внедрить вместе с вами: guardrails на входе и выходе, инструменты по принципу минимальных прав, человек в контуре для необратимых действий, авторизация на уровне поиска, экранирование вывода, лимиты частоты и бюджета, логирование и алерты на аномалии.

Регрессионный набор. Атаки становятся набором для оценки, который запускается при каждом изменении промпта, модели или инструмента — чтобы исправленное оставалось исправленным.

Как мы строим ИИ-системы, безопасные по конструкции?

Помимо тестирования, мы проектируем и строим ИИ-системы, безопасные по конструкции: минимизация данных до того, как что-либо попадёт в модель, провайдеры с нулевым хранением или self-hosted модели внутри вашего периметра, разделение инструкций и данных, изолированное выполнение инструментов, авторизация каждого пользователя на этапе поиска, полная трассировка промптов, вызовов инструментов и стоимости, мониторинг дрейфа и злоупотреблений в продакшене. Мониторинг окупается: организации, широко применявшие ИИ и автоматизацию в безопасности, экономили в среднем 2,2 млн долларов США на утечке по сравнению с теми, кто этого не делал (IBM, 2024). Смотрите, как мы устроены ИИ-агенты, и наши правила обращения с данными.

Кому это нужно?

Эта услуга для любой команды, которая выпускает LLM к пользователям или подключает её к внутренним системам: компаниям, запускающим ассистента для клиентов; командам, подключающим агента к CRM, ERP, почте или платежам; продуктам на RAG поверх конфиденциальных документов; всем, кто отвечает на анкету безопасности, где теперь есть раздел «ИИ». Она также нужна организациям, готовящимся к регулированию: EU AI Act (Регламент (ЕС) 2024/1689) вступил в силу в августе 2024 года, а большинство обязательств для систем высокого риска применяется с августа 2026 года (EU, 2024); ISO/IEC 42001 задаёт стандарт системы менеджмента, о котором спросят аудиторы. Запросить оценку безопасности ИИ.

Частые вопросы

Кейсы

Связанные кейсы

Erudil: ИИ-движок, оценивающий вероятность каждого исхода матча

Собственный продукт. Вероятностный движок превращает данные матча в матрицы вероятностей исходов, сверяет их с котировками букмекеров и публикует неизменяемую историю каждого прогноза — и выигрышей, и проигрышей.

  • Спортивная аналитика
  • Python
  • PyTorch
  • PostgreSQL

ИИ-ассистенты по регламентам для продуктовой сети с 30 000 сотрудников

Три RAG-ассистента на одной платформе — для коммерческой функции, директоров магазинов (голосом, прямо из торгового зала) и HR — отвечают на вопросы по корпоративным регламентам со ссылкой на конкретный пункт или честно говорят, что ответа нет, — и сотрудники перестают звонить в офис по типовым вопросам.

  • Ритейл
  • Python
  • LangChain
  • PostgreSQL + pgvector

Document AI, который читает 1 300 накладных от поставщиков в день

Сканы и фото накладных, счетов и актов проходят через мультимодальную модель, которая извлекает типизированные поля с оценкой уверенности по каждому, сверяет их со справочниками поставщиков и договоров и передаёт в ERP. К человеку попадают только документы с низкой уверенностью — примерно каждый девятый.

  • Ритейл · Финансы
  • Python
  • PyTorch
  • Multimodal LLM

Статьи

Связанные статьи

Безопасность

OWASP Top 10 для LLM-приложений — для тех, кто их выпускает

Список 2025 года называет десять способов атаковать LLM-приложение. Как каждый выглядит в реальном чат-боте, RAG-системе или агенте — и какое исправление мы применяем в продакшене.

Безопасность

Пентест или сканирование уязвимостей: что заказывать и когда

Клиенты просят «пентест» и часто имеют в виду сканирование; подрядчики продают сканирование и называют его пентестом. Что есть что на самом деле, сколько это стоит по времени и какое расписание работает для продуктовой команды.

Безопасность

Безопасность ИИ-агентов в продакшене: семь контролей, которые мы не пропускаем

Агент, который читает вашу CRM и отправляет письма, — это сотрудник без здравого смысла и с бесконечным терпением к хорошо написанной атаке. Контроли, с которыми мы подключаем агентов к реальным системам и спокойно спим.