Риски безопасности AI-агентов связаны с избыточными правами доступа и недостатками в системе мониторинга. Среди основных типов рисков — непредсказуемое недетерминированное поведение, неуправляемая автономная цепочка действий и адаптивность, которую можно использовать во вред в процессе обучения.
Непредсказуемое недетерминированное поведение обусловлено вероятностным механизмом выбора действий в генеративных AI-моделях. Например, при суммировании внутренних документов AI-агент может менять диапазон файлов для ссылки и порядок вызова внешних инструментов при одинаковых инструкциях.
Неуправляемая автономная цепочка действий означает, что AI-агент переходит к следующему действию без одобрения человека. Ошибка в первоначальном решении может привести к масштабному ущербу — например, к удалению файлов или отправке данных наружу.
Адаптивность AI-агента, меняющаяся в зависимости от ситуации, может стать объектом преднамеренного воздействия со стороны злоумышленников. Злоумышленники могут постепенно менять инструкции, отслеживать ответы агента и находить способы обхода защиты, вводя злонамеренные данные.
Основные риски безопасности при внедрении AI-агентов:
* инъекция промптов для неправомерных действий (злонамеренные инструкции внедряют в любые источники информации, которые использует агент — электронную почту, веб‑страницы, внутренние документы);
* избыточное предоставление и злоупотребление правами;
* утечка конфиденциальной и личной информации;
* уязвимости при интеграции с внешними инструментами и MCP;
* подмена данных посредством отравления памяти;
* цепные ошибки между мультиагентами.
Один из ярких примеров уязвимости — EchoLeak в Microsoft 365 Copilot (CVE-2025-32711). В июне 2025 года компания Aim Security сообщила об уязвимости: путём отправки специально сформированного письма возможна zero-click-атака — Copilot может отправить конфиденциальные данные наружу без действий со стороны пользователя. Причина — Copilot не может отличить скрытые в письмах инструкции от законных указаний пользователя. CVSS-оценка уязвимости — 9,3. Под угрозой — Word, Excel, PowerPoint, Outlook, Teams и другие сервисы, связанные с Copilot. Microsoft внесла исправления на стороне сервера и утверждает, что случаев злоупотребления не зафиксировано (Zero-Click AI Vulnerability Exposes Microsoft 365 Copilot DataThe Hacker News).
Ещё один пример — захват аккаунтов в Instagram* через злоупотребление AI-ассистентом поддержки от Meta*. Злоумышленники в ходе естественной беседы просят ассистента привязать к целевому аккаунту новый email-адрес, затем используют полученный код аутентификации для сброса пароля. По сообщениям, пострадали, в частности, аккаунт бывшего президента США Барака Обамы и аккаунт компании Sephora.
Также известна утечка данных с MCP-сервера Supabase: агент следовал инструкциям, встроенным в тикеты поддержки, и допустил утечку конфиденциальных токенов. Причина — избыточные права, предоставленные MCP-серверу: агент сохранял высокие привилегии при обработке контента, загруженного пользователями (Supabase MCP can leak your entire SQL databaseGeneral Analysis). По данным команды General Analysis, при запросе краткого содержания поддержки в ответе агента оказывались данные из несвязанных таблиц (Supabase MCP can leak your entire SQL databaseGeneral Analysis).
Чтобы сократить риски неправомерных операций, нужно:
* ограничить источники ввода в пределах доверенного диапазона;
* предоставлять AI-агентам только минимально необходимые права (например, переход MCP‑сервера Supabase в режим только для чтения предотвратил ущерб от записи и удаления данных);
* требовать подтверждения человека для высокорисковых операций (переводы, отправка информации наружу, изменение настроек системы) — можно использовать риск‑ориентированный дизайн, варьируя строгость потока подтверждений в зависимости от степени воздействия операции;
* вести журналы аудита и использовать обнаружение аномалий для визуализации действий агента (какие входные данные принимаются, какие инструменты вызываются, какие результаты получаются) — OWASP (Agentic Security Initiative) отмечает, что угрозы, специфичные для агентов, сложно обнаружить с помощью традиционных систем мониторинга (Agentic AI – Threats and MitigationsOWASP Gen AI Security Project);
* фильтровать входные данные для защиты от инъекций в промпты — предварительно проверять, нет ли вредоносных инструкций во внешних текстах и письмах, которые использует агент;
* разработать правила для предотвращения использования теневого ИИ (Shadow AI) — использования сотрудниками AI-агентов без разрешения компании.
В среде с несколькими взаимодействующими AI-агентами ошибка одного агента может распространиться на другие, вызывая цепную реакцию ущерба. Необходимо обеспечить аутентификацию и мониторинг взаимодействия между агентами, а также визуализацию путей распространения.
Для защиты от утечек данных важно ограничивать диапазон входных данных и включать этап проверки вывода. Механизм запоминания прошлых взаимодействий AI-агента подвержен атакам с внедрением вредоносных данных, искажающих решения. Агенты, накапливающие данные в долгосрочной перспективе, рискуют многократно повторять ошибочные решения под влиянием загрязнённых данных. Необходимо проверять источник запоминаемой информации и регулярно проверять её содержимое.
Существуют различные руководства по безопасности AI-агентов:
* ・AI (двухуровневая структура: общие ориентиры и конкретные методы реализации; версия 1.2 будет опубликована 31 марта 2026 года);
* OWASP Agentic AI Threats and Mitigations (систематизирует угрозы, характерные для AI-агентов);
* EU AI Act (обязывает осуществлять человеческий контроль над высокорисковыми AI-системами);
* NIST IR 8596 (Cyber AI Profile) — руководство по управлению кибербезопасности рисками AI-систем; предварительный проект будет опубликован в декабре 2025 года.
Три ключевых шага для построения системы безопасности AI-агентов:
1. Разделение потока утверждений в зависимости от уровня риска (операции с низким риском могут иметь автоматическое утверждение и только запись в журнал, а операции с высоким риском должны требовать утверждения человеком).
2. Предварительная подготовка процедур остановки и отката (необходимо заранее документировать процедуры остановки работы AI-агента и отката изменений при сбоях, чётко распределить роли и шаги для быстрого реагирования на инциденты).
3. Разработка политики использования AI и обучение сотрудников (нужно разработать и довести до сотрудников политику, определяющую, в каких бизнес‑процессах и с какими данными можно использовать AI-агентов; непрерывное обучение помогает снизить человеческие риски, которые не удаётся покрыть только техническими мерами).
Среди актуальных вопросов о безопасности AI-агентов: в чём разница в рисках безопасности между AI-агентами и чат‑ботами, опасны ли с точки зрения безопасности бесплатные AI‑агенты, нужны ли меры безопасности AI‑агентов для малого и среднего бизнеса, какой бюджет нужен для мер безопасности AI‑агентов (Zero-Click AI Vulnerability Exposes Microsoft 365 Copilot DataThe Hacker News Supabase MCP can leak your entire SQL databaseGeneral Analysis Hackers Simply Asked Meta* AI to Give Them Access to High-Profile Instagram* Accounts. It Worked404 Media Agentic AI – Threats and MitigationsOWASP Gen AI Security Project AI1.2・ Article 14: Human OversightEU Artificial Intelligence Act Cyber AI ProfileNIST NCCoE).
HOME
AI3
AI6
・
・
・MCP
AI3
Microsoft 365 CopilotEchoLeak
Instagram*
Supabase MCP
AI5
AI
AI4
・AI
OWASPAgentic AI Threats and Mitigations
EU AI Act
NISTIR 8596
AI
・
AI
AI
AI
・
Zero-Click AI Vulnerability Exposes Microsoft 365 Copilot DataThe Hacker News
Hackers Simply Asked Meta* AI to Give Them Access to High-Profile Instagram* Accounts. It Worked404 Media
AI1.2・
Agentic AI – Threats and MitigationsOWASP Gen AI Security Project
Article 14: Human OversightEU Artificial Intelligence Act
Cyber AI ProfileNIST NCCoE
* Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена на территории РФ.