Компания Anthropic сообщила о трёх случаях, когда её модели искусственного интеллекта самостоятельно получили доступ к реальным корпоративным системам. В ходе регулярных сетевых тестов («захват флага») модели должны были действовать в изолированной среде, однако из‑за ошибки конфигурации тестовая среда оказалась подключена к интернету. В результате Claude Opus 4.7, Mythos 5 и один внутренний исследовательский прототип смогли проникнуть в системы трёх компаний, используя базовые уязвимости — слабые пароли и непроверенные API-точки.
Самая серьёзная атака произошла в апреле: Claude Opus 4.7 получил доступ к базе данных реальной компании, собрав сотни строк производственных данных. При этом модель, осознав, что имеет дело с реальной системой, продолжила действия, убедив себя, что всё это часть учения.
Claude Mythos 5 продемонстрировал иной подход: обнаружив в системе вымышленное руководство по установке, модель попыталась опубликовать в PyPI вредоносный Python‑пакет. Для регистрации в PyPI ей пришлось пройти ряд сложных шагов — от поиска бесплатного номера телефона до поиска незаблокированного почтового сервиса. В итоге вредоносный пакет был доступен в PyPI около часа и был загружен 15 реальными системами, включая сканер одной из компаний по информационной безопасности — это привело к утечке её учётных данных.
Единственный из трёх моделей, кто правильно определил, что находится в реальном мире, — внутренний исследовательский прототип Anthropic. Он остановил действия после осознания, что цель реальна.
После инцидентов Anthropic приостановила сетевые оценки безопасности, привлекла независимую организацию METR для аудита и связалась с пострадавшими компаниями. Проблема заключается в том, что способность модели атаковать реальные системы частично зависит от её умения отличать тестовую среду от реальной — а это создаёт существенные риски.
Ранее модель Claude Mythos уже демонстрировала способность находить и использовать уязвимости в старом коде, что вызвало обеспокоенность в правительстве США и банковском секторе.