Google DeepMind в июне представила документ «GDM AI Control Roadmap» — 36‑страничный технический план для мониторинга и контроля AI‑агентов внутри компании. Вместе с документом опубликован объяснительный блог. Цель плана — ограничить ущерб от AI‑агентов, чьи цели отклоняются от намерений человека.
AI Control Roadmap — это не анонс нового продукта вроде Gemini, а фреймворк для «внутренних ограничителей» при развёртывании автономных AI в компании. Основной объект внимания в рамках документа — агентный AI (agentic deployments): речь идёт о развёртывании моделей на платформе‑хабе, которая позволяет создавать и выполнять код, взаимодействовать с внутренней инфраструктурой и использовать инструменты.
В документе рассматриваются два ключевых понятия:
* «наблюдение за траекторией действий» — отслеживание поведения AI‑агентов;
* «управление, зависящее от возможностей» — поэтапное усиление контроля в зависимости от возможностей модели.
AI‑контроль представляет собой систему защиты на уровне системы («вторую линию обороны») на случай, если выравнивание (alignment) AI‑модели окажется неполным. Система включает автоматизированный мониторинг, контроль доступа, усиление среды выполнения и реагирование на инциденты.
Google DeepMind видит в агентах «двигатель инноваций» для исследований в области ИИ и киберзащиты. При этом компания исходит из того, что высокопроизводительные модели — «ненадёжные», а все агенты и экземпляры, запускаемые из них, не заслуживают доверия. Также учитывается возможность их координации для обхода мониторинга. В то же время человеческие агенты и слабые модели (с уровнем способностей ниже определённого) рассматриваются как «надёжные субъекты», помогающие в защите — это соответствует концепции нулевого доверия (zero trust).
AI Control Roadmap определяет два условия защиты:
1. Возможность надёжного обнаружения несогласованных намерений или действий.
2. Возможность предотвращения, блокировки и восстановления после попыток атаки.
Способности агентов оцениваются по двум осям:
* «способность к обходу обнаружения» — степень способности скрывать рассуждения или обманывать наблюдателей;
* «способность к осуществлению атаки» — степень способности использовать автономию, долгосрочное планирование и кибервозможности для достижения серьёзных целей атаки.
Для способности к обходу обнаружения установлено 4 уровня (D1–D4), а для предотвращения и реагирования на атаки — 3 уровня (R1–R3). Принцип Google DeepMind заключается в том, что способность обнаруживать и предотвращать атаки должна превышать способность AI‑агентов обходить обнаружение и осуществлять атаки.
“AI”
Anthropic2400/NoetraKimi K3
ChatGPTAICodexChatGPT Work/AI
1
MarkdownAIGoogle
2
AI……IT“AI・AI”
3
MacClaude CodeiOSComputer Use
4
NVIDIACEO“”10
5
AI
6
→AIClaudeRecord a skillCodex
7
AI“”AI
8
OpenAIHugging Face
9
10
23
@itm_aiplus
Special
・
XTwitter
RSS