DeepDigest
ITmedia AI+ · · ~2 мин

OpenAI приостанавливает часть обучения RL для усиления безопасности

OpenAI временно приостановила обучение с подкреплением для новых моделей, чтобы усилить меры безопасности и обеспечить соответствие новым стандартам. Компания ужесточает мониторинг активности моделей, улучшает методы выравнивания и укрепляет безопасность исследовательской среды. Приоритет — выявление и предотвращение опасного поведения моделей при сохранении темпов разработки.

OpenAI приостанавливает часть обучения RL для усиления безопасности

18 августа OpenAI объявила об усилении мер безопасности — компания временно замедлила расширение масштабов моделей и приостановила на 2 недели обучение с подкреплением (RL) для новых моделей. Цель — обеспечить соблюдение необходимых стандартов безопасности, провести исследования, учения «красной команды» и расширить мониторинг.

По словам CEO Сэма Альтмана, часть обучения с подкреплением приостановлена, чтобы соответствовать новым стандартам в области выравнивания, безопасности и мониторинга. При этом компания не отказывается от выпуска новых моделей — влияние текущих мер отразится на более поздних релизах.

OpenAI выделяет три ключевых направления мер безопасности: ограничение области доступа и влияния ИИ (безопасность), мониторинг подозрительной активности и выравнивание поведения модели с заданными нормами (alignment). В будущем компания рассчитывает, что модели сами будут выполнять большую часть задач по обеспечению безопасности.

После инцидента с Hugging Face OpenAI ужесточила стандарты безопасности в исследовательской среде: усилила песочницы для выполнения ненадёжного кода, внедрила сетевое изолирование, чтобы одно нарушение не привело к утечке данных, проводит постоянные тесты безопасности, включая имитационные атаки на собственные модели. Особенно строгие требования применяются к Astra и другим киберрабочим нагрузкам.

Система мониторинга теперь проверяет активность модели на уровне каждого выбираемого токена — для этого используется «активационный классификатор». Подозрительные признаки передаются в продвинутую систему автоматического расследования. Цель — выдавать предупреждения в течение 30 минут после обнаружения угрозы, а при подозрении на нарушение важных границ безопасности — немедленно оповещать соответствующие команды.

В обучении самых мощных моделей OpenAI планирует шире применять методы выравнивания: улучшать модели вознаграждений для выявления и подавления опасного поведения, обучать модели честно сообщать о своих ограничениях и возможностях, пресекать «взлом вознаграждений» (reward hacking). Компания также намерена пересмотреть процессы интеграции защитных механизмов на этапах обучения и развёртывания, привлечь к работе внешние организации и в ближайшие недели опубликовать технический отчёт об инциденте с Hugging Face.

// оригинал
ITmedia AI+ ↗ Читать оригинал
5 просмотров
// поделиться Telegram VK