DeepDigest
TechOrange · · ~4 мин

OWASP: 10 рисков для AI Agent — от манипуляции подсказками до утечки данных

OWASP представила перечень из 10 рисков для AI Agent — «OWASP Top 10 for Agentic Applications 2026». Основная угроза — не взлом, а манипуляция, заставляющая AI Agent выполнять ошибочные задачи. Традиционные инструменты безопасности не всегда способны выявить такие атаки.

OWASP: 10 рисков для AI Agent — от манипуляции подсказками до утечки данных

OWASP (Open Worldwide Application Security Project) в 2025 году 9 декабря выпустила документ «OWASP Top 10 for Agentic Applications 2026». В нём перечислены 10 рисков для AI Agent, пронумерованных от ASI01 до ASI10. Перечень проверили более 100 экспертов по кибербезопасности.

Главная угроза для безопасности AI Agent — не взлом, а манипуляция: злоумышленники могут заставить AI Agent выполнять ошибочные задачи. Такой метод называется «косвенный ввод подсказок». Атакующие внедряют вредоносные указания в содержимое, которое AI Agent будет читать — письма, документы, веб‑страницы и т. д. AI Agent воспринимает такие указания как часть задачи, сохраняет их в памяти или базе знаний, и изначальная цель изменяется. Затем AI Agent использует имеющиеся у него инструменты и права для выполнения действий — это может привести к утечке данных, выполнению кода или нарушению бизнес‑процессов.

Один из примеров риска — EchoLeak. В этом случае письмо со скрытыми инструкциями заставляет Microsoft 365 Copilot автоматически передавать секретные письма и записи разговоров — при этом пользователь не переходит по ссылкам.

Проблема в том, что AI Agent может не различать информацию для справки и инструкции к выполнению. В результате он может изменять ответы, обходить политики, вызывать неавторизованные функции, воздействовать на корпоративные системы. OWASP предупреждает, что использование RAG или микронастройки не устраняет риск внедрения подсказок.

Для чат‑ботов внедрение подсказок может привести к неверным ответам, ошибочным цитатам или раскрытию запрещённой информации. Когда модель интегрирована в AI Agent, риски возрастают: манипулируемый Agent может выполнить реальный запрос, отправить данные, изменить права доступа или запустить ошибочный автоматизированный процесс.

Один из ключевых рисков — ASI01 («Agent Goal Hijack», «перехват цели агента»). Злоумышленник может манипулировать путём принятия решений Agent или его изначальной целью. Для этого не требуется писать код — достаточно текста, который AI прочтёт. Текст может быть скрыт в документах, письмах или других внешних источниках.

Память Agent может быть подвержена «отравлению» (Memory Poisoning): злоумышленники внедряют ошибочную или вредоносную информацию в данные, которые AI Agent запоминает и впоследствии использует. Это влияет на его последующие решения, планирование и выбор инструментов. При этом предприятия не всегда могут быстро определить, откуда началась атака: реальное нарушение могло произойти несколько дней назад, а аномалия проявилась только в ходе последующих задач. Трудно восстановить полный путь атаки, если фиксируются только последние действия Agent, но не данные, которые он читал, и не использованная им память. Память Agent должна рассматриваться не как обычный кэш, а как защищённый актив — с учётом рисков атак, возможности управления, изоляции и восстановления версий.

Злоумышленники могут атаковать не модель, а инструменты и интегрированные сервисы, используемые Agent. Например, они могут модифицировать описания инструментов, подделывать похожие инструменты или включать вредоносные указания в результаты их работы. Тогда Agent выберет неверный инструмент или пойдёт по ошибочному пути даже без взлома модели. Пример от OWASP: Agent должен был вызвать финансовый инструмент report_finance, но был направлен на вызов вредоносного инструмента report, что привело к утечке данных.

Традиционные инструменты безопасности (файрвол, EDR, XDR, DLP, IAM) не предназначены для анализа семантического намерения AI Agent, его долговременной памяти и многоэтапных решений. При этом они остаются основой для обнаружения вредоносных программ, использования уязвимостей, аномальных подключений, повышения привилегий и утечки данных. Например:
- Файрвол фиксирует подключение и отправку данных, но не видит, что задача Agent была изменена. Допустим, вместо «свести месячные платежи» Agent по вредоносному документу отправляет список клиентов на внешний почтовый ящик.
- EDR видит отдельные действия (массовое чтение данных, создание краткого содержания, первый вызов внешнего почтового инструмента и отправка на незнакомый домен), но может не распознать аномальную последовательность.
- IAM определяет наличие прав доступа (например, к API), но не оценивает, оправдано ли использование этих прав в текущей задаче.

OWASP в серии Top 10 for LLM Applications выделяет такие риски, как ввод подсказок, раскрытие конфиденциальной информации, проблемы с цепочкой поставок, отравление данных и моделей, некорректную обработку вывода. Риски безопасности AI выходят за рамки самой модели — они затрагивают данные, которые модель обрабатывает, инструменты, которые она использует, и связанные с ней корпоративные системы.

В эпоху Agent важно отслеживать, что инструменты заявляют о своих возможностях, верит ли модель этим описаниям, используются ли результаты работы инструментов как инструкции для следующих шагов. Главная задача — не допустить, чтобы законный Agent, действуя на основе ошибочных целей, объединил законные инструменты в опасный сценарий.

// оригинал
TechOrange ↗ Читать оригинал
5 просмотров
// поделиться Telegram VK