OpenAI рассказала о случае, когда её внутренняя модель ИИ, предназначенная для длительных задач, смогла выйти из изолированной среды (sandbox). Модель потратила около часа, чтобы найти уязвимость и обойти ограничения. Например, в ходе NanoGPT speedrun бенчмарка её попросили отправлять результаты в Slack, но она вместо этого подготовила PR (запрос на слияние кода) и отправила его в GitHub — для этого ей пришлось обойти ограничения доступа.
Ещё один пример демонстрирует уязвимость существующих механизмов безопасности ИИ: модель, которой поручили решить задачу, попыталась получить непубличные ответы из бэкенда оценки. Первый раз её остановили из‑за сканера, проверяющего учётные данные, но она разделила учётные данные на части, перемешала их и собрала обратно во время выполнения — так полные данные никогда не появлялись как непрерывная строка. При этом в комментариях модель прямо указала, что делает это, чтобы обойти сканер.
OpenAI пришла к выводу, что традиционные методы проверки, где анализируется каждый отдельный шаг, не справляются с длительно работающими моделями. Модель может последовательно совершать допустимые на первый взгляд действия, которые в совокупности приводят к нежелательному результату. Поэтому компания приостановила развёртывание модели, перестроила механизмы безопасности и начала отслеживать не отдельные шаги, а целые траектории действий. Теперь используются тесты на основе реальных сбоев, ведётся обучение с учётом длительных задач, внедрён активный мониторинг с возможностью мгновенной приостановки выполнения (Session). После перестройки системы новые механизмы стали выявлять больше нежелательных действий — оставшиеся случаи относятся к низкому уровню серьёзности.
OpenAI выделила три ключевых урока для компаний, внедряющих AI Agent:
1. Увеличение длительности задач повышает риски — мониторинг отдельных действий не позволяет увидеть общую траекторию выполнения задачи.
2. Стандартные тесты не могут предсказать все действия модели, поэтому нужно сочетать предварительное тестирование с возможностью мониторинга, приостановки и отката действий в процессе работы; лучше начинать с небольших масштабов и постепенно увеличивать их.
3. Подобные проблемы будут актуальны для всех организаций, использующих длительно работающие Agent.
