Skip to content

Безопасность·3 мин чтения

Безопасность ИИ-агентов в продакшене: семь контролей, которые мы не пропускаем

Агент, который читает вашу CRM и отправляет письма, — это сотрудник без здравого смысла и с бесконечным терпением к хорошо написанной атаке. Контроли, с которыми мы подключаем агентов к реальным системам и спокойно спим.

Анатолий НовогродскийОснователь и CEO, GlanitОпубликовано 6 августа 2026 · Обновлено 27 августа 2026

Что делает ИИ-агента опасным: инструменты, а не модель?

Риск в ИИ-агенте исходит от его инструментов, а не от модели: чат-бот, который только разговаривает, может вас опозорить, а агент, который обновляет записи, отправляет письма, переводит деньги или выполняет код, может навредить. В каждой истории с prompt injection и реальным ущербом есть агент с инструментами, которые ему были не нужны, и никого, кто проверял бы, что он сделал. Поэтому контроли ниже — про инструменты: до чего агент дотягивается, что делает необратимо и кто это видит. OWASP называет этот класс отказов прямо: «избыточные полномочия» — отдельный пункт Top 10, а prompt injection — способ заставить агента злоупотребить инструментами — стоит на первом месте (OWASP, 2025).

Какие это семь контролей?

Семь контролей — это инструменты с минимальными правами, авторизация на уровне данных, разделение инструкций и данных, одобрение человеком необратимых действий, изолированное выполнение, бюджеты с обнаружением циклов и полная трассировка с набором атак. Ни один не экзотичен; вместе они ограничивают, чего может добиться скомпрометированный или запутавшийся агент, и гарантируют, что кто-то это увидит. Это те же принципы, которые NIST AI Risk Management Framework относит к функции «manage» — минимальные права, человеческий надзор и мониторинг развёрнутых систем (NIST, 2023).

  • 1. Инструменты с минимальными правами. Каждый инструмент делает одну узкую вещь с ограниченными учётными данными: «прочитать заказы этого клиента», а не «SQL-доступ к базе заказов». У агента никогда нет админских ключей.
  • 2. Авторизация на уровне данных. Права пользователя применяются внутри инструмента и поискового запроса — а не просьбой к модели быть осторожной.
  • 3. Инструкции отделены от данных. Найденные документы, вывод инструментов и сообщения пользователя помечены как данные; модели сказано, а тесты проверяют, что инструкции внутри них игнорируются.
  • 4. Одобрение человеком необратимых действий. Внешние письма, платежи, удаления, изменения договоров: агент предлагает, человек подтверждает — с полным контекстом того, что произойдёт.
  • 5. Изолированное выполнение. Инструменты кода, shell и браузера работают в изолированной среде без сети к внутренним системам, с лимитом времени и бюджетом.
  • 6. Бюджеты и обнаружение циклов. Токены, вызовы инструментов и стоимость ограничены на запуск и на пользователя; повторяющиеся одинаковые вызовы останавливают запуск и будят дежурного.
  • 7. Полная трассировка и набор для оценки. Каждый промпт, вызов инструмента, вывод и стоимость логируются; набор атак запускается при каждом изменении промпта, модели или инструмента, вместе с оценками качества.

Какой контроль останавливает какую атаку?

Каждый контроль отвечает на конкретный способ, которым агент идёт не туда, и таблица их сопоставляет. Prompt injection — точка входа для большинства строк, поэтому одного контроля недостаточно: саму инъекцию полностью предотвратить нельзя, так что контроли ограничивают, чего может добиться успешная инъекция. Правая колонка — пункт OWASP LLM Top 10, который закрывает каждый контроль (OWASP, 2025).

Контроли безопасности агентов и угрозы
КонтрольКакую угрозу ограничиваетПункт OWASP LLM Top 10
Инструменты с минимальными правамиАгент дотягивается до данных или действий, которые задаче не нужныLLM06 Избыточные полномочия
Авторизация на уровне данныхОдин пользователь видит записи другого пользователя или тенантаLLM02 Раскрытие чувствительной информации, LLM08 Слабости векторного поиска
Инструкции отделены от данныхОтравленный документ или письмо управляет агентомLLM01 Prompt injection
Одобрение человеком необратимых действийНеверный платёж, удаление или исходящее сообщениеLLM06 Избыточные полномочия
Изолированное выполнениеСгенерированный код добирается до внутренней сети или хостаLLM05 Небезопасная обработка вывода
Бюджеты и обнаружение цикловНеконтролируемая стоимость, рекурсивные циклы инструментовLLM10 Неограниченное потребление
Трассировка и набор атакРегрессии, которых никто не замечает, пока не заметит клиентВсе: обнаружение и доказательства
Контроли безопасности агентов и угрозы

Как эти контроли ложатся на архитектуру агента?

Контроли ложатся на шесть слоёв, описанных в статье Как работают ИИ-агенты: восприятие и память получают контроли данных, инструменты и оркестрация — контроли прав и одобрений, рефлексия и мониторинг — трассировку и набор атак. Иначе говоря, безопасность — не слой, прикрученный в конце: каждый архитектурный слой владеет одним-двумя из семи. Всё это пропускается, когда команда выкатывает демо в продакшен, и цена этого разрыва измерима: по данным IBM, организации с широким применением ИИ и автоматизации в безопасности выявляли и локализовали утечки быстрее и дешевле, чем остальные (IBM, 2024). MITRE ATLAS — полезный публичный каталог техник атак, которые должен покрывать набор атак (MITRE, 2024).

Кто должен проверять агента и когда?

Любой агент с правом записи в бизнес-систему должен проверяться по этим контролям до запуска и после каждого изменения его инструментов, а внешняя проверка оправдана, как только агент касается клиентов, денег или персональных данных. Внутренние команды стабильно недооценивают две вещи: как далеко внедрённая инструкция может пройти по цепочке выданных инструментов и как тихо обновление модели меняет поведение. Регулирование движется туда же: AI Act ЕС (Регламент 2024/1689) требует управления рисками, логирования и человеческого надзора для высокорисковых ИИ-систем (EU, 2024). Если нужен взгляд со стороны на агента до или после запуска — это наша оценка безопасности ИИ и LLM.

Ещё статьи

Безопасность ·

OWASP Top 10 для LLM-приложений — для тех, кто их выпускает

Список 2025 года называет десять способов атаковать LLM-приложение. Как каждый выглядит в реальном чат-боте, RAG-системе или агенте — и какое исправление мы применяем в продакшене.

4 мин чтения

Безопасность ·

Пентест или сканирование уязвимостей: что заказывать и когда

Клиенты просят «пентест» и часто имеют в виду сканирование; подрядчики продают сканирование и называют его пентестом. Что есть что на самом деле, сколько это стоит по времени и какое расписание работает для продуктовой команды.

4 мин чтения

ИИ и машинное обучение ·

Почему гибридный поиск обошел чистые эмбеддинги в нашем пайплайне Invoice AI

Чистые плотные эмбеддинги не справились с буквенно-цифровыми серийными номерами в нашем пайплайне Invoice AI. Объединение полнотекстового поиска PostgreSQL tsvector с косинусным расстоянием pgvector подняло точность совпадений top-1 с 61,4% до 94,8%.

6 мин чтения