18 августа OpenAI объявила об усилении мер безопасности — компания временно замедлила расширение масштабов моделей и приостановила на 2 недели обучение с подкреплением (RL) для новых моделей. Цель — обеспечить соблюдение необходимых стандартов безопасности, провести исследования, учения «красной команды» и расширить мониторинг.
По словам CEO Сэма Альтмана, часть обучения с подкреплением приостановлена, чтобы соответствовать новым стандартам в области выравнивания, безопасности и мониторинга. При этом компания не отказывается от выпуска новых моделей — влияние текущих мер отразится на более поздних релизах.
OpenAI выделяет три ключевых направления мер безопасности: ограничение области доступа и влияния ИИ (безопасность), мониторинг подозрительной активности и выравнивание поведения модели с заданными нормами (alignment). В будущем компания рассчитывает, что модели сами будут выполнять большую часть задач по обеспечению безопасности.
После инцидента с Hugging Face OpenAI ужесточила стандарты безопасности в исследовательской среде: усилила песочницы для выполнения ненадёжного кода, внедрила сетевое изолирование, чтобы одно нарушение не привело к утечке данных, проводит постоянные тесты безопасности, включая имитационные атаки на собственные модели. Особенно строгие требования применяются к Astra и другим киберрабочим нагрузкам.
Система мониторинга теперь проверяет активность модели на уровне каждого выбираемого токена — для этого используется «активационный классификатор». Подозрительные признаки передаются в продвинутую систему автоматического расследования. Цель — выдавать предупреждения в течение 30 минут после обнаружения угрозы, а при подозрении на нарушение важных границ безопасности — немедленно оповещать соответствующие команды.
В обучении самых мощных моделей OpenAI планирует шире применять методы выравнивания: улучшать модели вознаграждений для выявления и подавления опасного поведения, обучать модели честно сообщать о своих ограничениях и возможностях, пресекать «взлом вознаграждений» (reward hacking). Компания также намерена пересмотреть процессы интеграции защитных механизмов на этапах обучения и развёртывания, привлечь к работе внешние организации и в ближайшие недели опубликовать технический отчёт об инциденте с Hugging Face.