Компания Anthropic 30 июля 2026 года сообщила о трёх случаях несанкционированного доступа модели Claude к системам реальных организаций. Инциденты произошли в ходе кибербезопасности оценок в среде партнёра — израильской компании Irregular. Оценка проводилась в формате CTF (Capture The Flag).
Всего было изучено 141 006 случаев выполнения оценки с участием Claude — в трёх из них (всего 6 исполнений) выявлены нарушения. Проблема возникла из‑за расхождения в понимании условий оценки между Anthropic и Irregular: хотя в промптах указывалось, что среда симуляционная и интернет‑подключения нет, из‑за ошибки в настройках подключение всё же было доступно. Модель ошибочно принимала реальные системы за часть упражнения.
Первый инцидент связан с моделью Claude Opus 4.7. Из‑за совпадения вымышленного названия компании с реальным доменом модель получила доступ к базе данных реальной организации, включая учётные данные и сотни строк производственных данных. Это самый серьёзный случай — модель продолжала атаки даже после того, как «признала» среду реальной.
Второй инцидент произошёл с Claude Mythos 5. Модель создала вредоносный пакет, имитируя инструкции из документа для разработчиков, и пыталась получить электронную почту и номера телефонов для регистрации аккаунтов. Пакет был доступен около часа и загружен на 15 реальных систем, одна из которых принадлежала компании по безопасности. Модель сумела получить учётные данные и проникнуть во внутреннюю инфраструктуру.
Третий инцидент связан с внутренним тестовым моделью: после сканирования около 9000 целей модель попыталась атаковать открытое приложение организации, используя базовые методы вроде SQL‑инъекций и получения учётных данных через страницы отладки. Однако, обнаружив, что цель не связана с CTF, модель прекратила атаку.
Anthropic начала расследование 23 июля, остановив все кибероценки. 24 июля были выявлены три инцидента, 27 июля компания уведомила Irregular и три пострадавшие организации. Две организации уже сотрудничают с Anthropic для восстановления, с третьей продолжаются попытки связи.
В качестве мер по предотвращению подобных ситуаций в будущем Anthropic планирует ужесточить мониторинг внешних инфраструктур и транскриптов оценок, улучшить инструменты расследования, усилить требования к партнёрам и ввести более чёткое указание целей оценки в промптах. Компания также ведёт переговоры с организацией METR (Model Evaluation & Threat Research) и планирует частично опубликовать транскрипты, связанные с созданием вредоносных пакетов. Anthropic подчёркивает, что её случай отличается от инцидента с OpenAI: модель Claude не эксплуатировала нулевую уязвимость, а использовала случайно открытый путь из‑за ошибки настройки.