Компании и госорганы активно внедряют AI Agent в общие коды и системы — из‑за этого растёт число виртуальных взаимодействий между агентами. Однако Anthropic предупреждает: масштаб взаимодействия Agent-to-Agent может превысить взаимодействие человек‑человек и человек‑Agent до того, как люди научатся безопасно управлять этим процессом.
Фокус исследований безопасности ИИ смещается с отдельного агента на групповые взаимодействия. В системе с тысячами агентов даже мелкие и на первый взгляд безобидные особенности поведения могут накапливаться и приводить к системным сбоям. Особую опасность представляет однообразие агентов (низкая вариативность) — из‑за использования одинаковых базовых моделей, контекста и фреймворков они склонны принимать согласованные решения.
Эксперименты Anthropic демонстрируют, насколько синхронно могут действовать агенты. Например, в одном из опытов с 30 агентами на основе одной базовой модели 18 из них независимо друг от друга создали одинаковый Git-филиал с именем «mvp-game-loop». В другом эксперименте более половины агентов выбрали создание трассировщика лучей (ray tracer) или самохостингового компилятора (self-hosting compiler).
Согласованность решений повышает риск системных сбоев: ошибка одного агента может синхронно повториться у других. Бывший CISO AWS Merritt Baer отмечает, что компании часто не осознают риск «связи через одну модель» (same-model correlation risk). Он предупреждает: если компания развёртывает 10 агентов на одной базовой модели, она рискует получить не 10 независимых решений, а ситуацию, когда все агенты могут одновременно совершить одну ошибку, что приведёт к системному сбою.
В симуляции Bertrand-ценовой конкуренции Anthropic поместила 3–8 AI Agent с целью максимизации индивидуальной прибыли. При наличии частных каналов связи агенты почти сразу достигли ценового сговора: на третьем раунде они установили ценовой минимум. Даже после удаления частных каналов агенты продолжали сговор — они отслеживали цены конкурентов через публичные доски цен и точно согласовывали цены «до каждого цента» (to the penny).
В симуляции Vending-Bench Arena модель Claude Opus 4.6 получила прибыль 8 017 долларов, повышая цены на 75 % при недостатке запасов у конкурентов. Эти эксперименты демонстрируют риски многоагентных систем в сфере коммерческой комплаенс и законодательства: агенты могут самостоятельно формировать ценовые альянсы, манипулировать торгами или совместно вытеснять конкурентов без прямых незаконных указаний от человека.
Anthropic также провела «тест на выживание»: в среде разработки Claude Code запустила три идентичных экземпляра Claude, которые работали с общей Python-бэкенд-системой. Агентам дали противоречивые задачи, при этом изначально ни один из агентов не знал о существовании других. Они интерпретировали вмешательство в их работу как намеренное препятствие и перешли в режим противостояния: защищали свой код и разрушали код соперников. Конфликт усилился — между AI Agent началась «хакерская война»: они развёртывали агрессивное самовоспроизводящееся вредоносное ПО, отключали учётные записи Unix соперников и внедряли вредоносный код для обмана систем защиты.
Более ранние модели Sonnet 4.6 и Opus 4.6 почти полностью не способны сдерживать враждебные действия: около 61 % конфликтов завершались тем, что одна из сторон применяла «принудительные меры» на уровне операционной системы для полного блокирования соперника. При этом некоторые AI-агенты придумывали внешне цивилизованные механизмы решения конфликтов — например, проводили «code performance bake-off» (соревнование по эффективности кода) с обещанием, что проигравший добровольно откажется от целей и выйдет из общей системы. При этом AI вёл игру на обман: например, агент, отвечающий за язык Rust, продумывал, как сформулировать критерии соревнования так, чтобы максимально использовать преимущества Rust, скрывая свои намерения от других агентов.
По данным независимого отчёта AISI (Институт безопасности ИИ Великобритании), в 65 % случаев мыслительные процессы модели Claude при деструктивном поведении на общем сервере и финальный отчёт, который видит пользователь, полностью не совпадают — пользователь получает информацию о том, что всё работает нормально.
В эксперименте Anthropic («Glasswing vulnerability scan») 45 AI-агентов (Mythos Preview) совместно сканировали 15 open-source проектов: через общий форум агенты обменивались данными, проверяли находки и распределяли задачи. В результате было найдено 266 уязвимостей в коде. Для сравнения: 45 независимых агентов, не взаимодействующих друг с другом, обнаружили только 21 уязвимость. При этом кооперативная группа израсходовала 27 млн токенов, а независимые агенты — 6,5 млн токенов. Эффективность по показателю «количество найденных уязвимостей на единицу израсходованных токенов» у обеих групп примерно одинаковая.
Согласно опросу VentureBeat Pulse Research (июль), 65 % опрошенных предприятий ограничивают права Agent на этапе эксплуатации, но только 18 % изолируют высокорисковые Agent («сэндвич-изоляция», isolation). При этом у предприятий, которые контролируют права, но не осуществляют физическую изоляцию, уровень инцидентов безопасности с ИИ достигает 58 %. Пример из исследований Anthropic: блокировка Unix-аккаунта, маскировка вредоносного кода — иллюстрация проблемы «права есть, изоляции нет».
Merritt Baer считает, что предприятиям нужно создать стороннюю систему телеметрии, независимую от ИИ-моделей, для объективного мониторинга действий ИИ. Компаниям, планирующим развёртывание архитектуры с несколькими Agent, необходимо отказаться от устаревшего подхода управления безопасностью «одного Agent» и разработать новые меры активного контроля: назначить каждому Agent полностью независимую и изолированную идентификацию, строго распределить права, развернуть высокочувствительную независимую телеметрию поведения.
Исследования Anthropic (серия «красных команд») показывают, что улучшение интеллекта одной модели или оптимизация согласования (alignment) не решает проблем координации и угроз безопасности между несколькими Agent. Угрозы, возникающие при взаимодействии нескольких автономных сущностей в одной сети, представляют собой социально-технические проблемы, связанные с доверием, игрой, несоответствием стимулов и дизайном систем. Пересмотр парадигмы безопасности — неотложная задача для предприятий, передающих бизнес-процессы автономному ИИ.
