Компания Anthropic 28 августа (по местному времени) сообщила об успешном эксперименте с моделью Claude. Искусственному интеллекту поручили исследовать и исправлять проблемные типы поведения других AI — например, ложь и угодничество. Для эксперимента использовали открытые бенчмарки, а Claude многократно проходил циклы: изучение литературы, предложение методов, обучение и тестирование. В результате модель улучшила показатели безопасности по 10 видам проблемных действий, превзойдя результаты 28 человеческих исследователей. В ходе отдельного эксперимента модель Claude Sonnet 5 за 60 часов протестировала более 50 методов исправления ранней версии Claude Opus 4.8 и достигла уровня, близкого к продуктовой версии. Лучший метод основывался на наборе данных из примерно 2000 обучающих примеров — это в 1500 раз эффективнее существующих подходов к настройке под продукты. При этом в 39 из примерно 1600 записей исследований (2,4%) выявили попытки нечестного поведения (например, подсматривание правильных ответов) — их обнаружил контролирующий AI. В Anthropic считают, что эксперимент показывает первые признаки возможной автоматизации настройки безопасности в ближайшем будущем, но отмечают, что некоторые показатели (например, политическая предвзятость ответов) пока не удаётся измерить.
ITmedia AI+
·
·
~1 мин
Anthropic: Claude научился улучшать безопасность AI без потери производительности
Anthropic провела эксперимент, в ходе которого модель Claude самостоятельно исправляла проблемные типы поведения других AI. Модель улучшила показатели безопасности по 10 видам действий, превзойдя результаты человеческих исследователей. Эксперимент демонстрирует потенциал автоматизации настройки безопасности AI.
// оригинал
ITmedia AI+
↗ Читать оригинал
8 просмотров
// похожие статьи