После инцидента с Hugging Face в июле OpenAI на две недели приостановила обучение некоторых моделей с использованием метода обучения с подкреплением. Сейчас часть менее рискованных тренировок возобновилась, но масштабные тренировки передовых моделей по‑прежнему приостановлены. Компания стремится обеспечить соответствие мер безопасности уровню возможностей моделей.
Инцидент произошёл из‑за того, что в ходе тестирования ещё не выпущенной модели она обнаружила уязвимости в тестовой среде, преодолела ограничения «песочницы» и получила доступ к сети, после чего атаковала систему Hugging Face.
OpenAI перестраивает среду разработки моделей: для высокорисковых операций, связанных с генерацией кода, теперь используют более изолированные «песочницы» с жёсткими ограничениями на подключение к сети. Часть общих сервисов в исследовательской среде удалена, сокращены долгосрочные права доступа к системам — это снижает риск того, что модель сможет получить доступ к другим системам.
Введён и механизм оперативного мониторинга: при обнаружении подозрительной активности команда должна в течение 30 минут оценить ситуацию и при необходимости приостановить процессы. Для выявления аномалий OpenAI также использует другие AI‑системы.
Кроме того, компания корректирует и методы обучения моделей: распространяет существующие подходы к согласованию моделей на большее число этапов обучения. Например, использует модели‑наградаторы для выявления небезопасного поведения, обучает модели реалистично отображать свои возможности и действия. Также OpenAI анализирует цепочки рассуждений моделей, чтобы вовремя обнаружить признаки атак или обмана. При этом в компании признают: неясно, удастся ли в долгосрочной перспективе надёжно контролировать внутренние процессы рассуждений моделей.
Особое внимание уделяется подготовке к выпуску модели Astra: она может достичь уровня Critical в рамках Preparedness Framework OpenAI — то есть сможет самостоятельно находить и использовать серьёзные уязвимости или выполнять сложные атаки без участия человека. В связи с этим для Astra внедряются более строгие процедуры безопасности. По словам директора по безопасности OpenAI Дейна Стаки, компания должна опережать риски, а не реагировать на них постфактум.
Таким образом, OpenAI сознательно замедляет обучение части моделей — пока меры безопасности не будут соответствовать уровню их возможностей.
