Что делает ИИ-агента опасным: инструменты, а не модель?
Риск в ИИ-агенте исходит от его инструментов, а не от модели: чат-бот, который только разговаривает, может вас опозорить, а агент, который обновляет записи, отправляет письма, переводит деньги или выполняет код, может навредить. В каждой истории с prompt injection и реальным ущербом есть агент с инструментами, которые ему были не нужны, и никого, кто проверял бы, что он сделал. Поэтому контроли ниже — про инструменты: до чего агент дотягивается, что делает необратимо и кто это видит. OWASP называет этот класс отказов прямо: «избыточные полномочия» — отдельный пункт Top 10, а prompt injection — способ заставить агента злоупотребить инструментами — стоит на первом месте (OWASP, 2025).
Какие это семь контролей?
Семь контролей — это инструменты с минимальными правами, авторизация на уровне данных, разделение инструкций и данных, одобрение человеком необратимых действий, изолированное выполнение, бюджеты с обнаружением циклов и полная трассировка с набором атак. Ни один не экзотичен; вместе они ограничивают, чего может добиться скомпрометированный или запутавшийся агент, и гарантируют, что кто-то это увидит. Это те же принципы, которые NIST AI Risk Management Framework относит к функции «manage» — минимальные права, человеческий надзор и мониторинг развёрнутых систем (NIST, 2023).
- 1. Инструменты с минимальными правами. Каждый инструмент делает одну узкую вещь с ограниченными учётными данными: «прочитать заказы этого клиента», а не «SQL-доступ к базе заказов». У агента никогда нет админских ключей.
- 2. Авторизация на уровне данных. Права пользователя применяются внутри инструмента и поискового запроса — а не просьбой к модели быть осторожной.
- 3. Инструкции отделены от данных. Найденные документы, вывод инструментов и сообщения пользователя помечены как данные; модели сказано, а тесты проверяют, что инструкции внутри них игнорируются.
- 4. Одобрение человеком необратимых действий. Внешние письма, платежи, удаления, изменения договоров: агент предлагает, человек подтверждает — с полным контекстом того, что произойдёт.
- 5. Изолированное выполнение. Инструменты кода, shell и браузера работают в изолированной среде без сети к внутренним системам, с лимитом времени и бюджетом.
- 6. Бюджеты и обнаружение циклов. Токены, вызовы инструментов и стоимость ограничены на запуск и на пользователя; повторяющиеся одинаковые вызовы останавливают запуск и будят дежурного.
- 7. Полная трассировка и набор для оценки. Каждый промпт, вызов инструмента, вывод и стоимость логируются; набор атак запускается при каждом изменении промпта, модели или инструмента, вместе с оценками качества.
Как эти контроли ложатся на архитектуру агента?
Контроли ложатся на шесть слоёв, описанных в статье Как работают ИИ-агенты: восприятие и память получают контроли данных, инструменты и оркестрация — контроли прав и одобрений, рефлексия и мониторинг — трассировку и набор атак. Иначе говоря, безопасность — не слой, прикрученный в конце: каждый архитектурный слой владеет одним-двумя из семи. Всё это пропускается, когда команда выкатывает демо в продакшен, и цена этого разрыва измерима: по данным IBM, организации с широким применением ИИ и автоматизации в безопасности выявляли и локализовали утечки быстрее и дешевле, чем остальные (IBM, 2024). MITRE ATLAS — полезный публичный каталог техник атак, которые должен покрывать набор атак (MITRE, 2024).
Кто должен проверять агента и когда?
Любой агент с правом записи в бизнес-систему должен проверяться по этим контролям до запуска и после каждого изменения его инструментов, а внешняя проверка оправдана, как только агент касается клиентов, денег или персональных данных. Внутренние команды стабильно недооценивают две вещи: как далеко внедрённая инструкция может пройти по цепочке выданных инструментов и как тихо обновление модели меняет поведение. Регулирование движется туда же: AI Act ЕС (Регламент 2024/1689) требует управления рисками, логирования и человеческого надзора для высокорисковых ИИ-систем (EU, 2024). Если нужен взгляд со стороны на агента до или после запуска — это наша оценка безопасности ИИ и LLM.