DeepDigest
ITmedia AI+ · · ~1 мин

Anthropic: Claude научился улучшать безопасность AI без потери производительности

Anthropic провела эксперимент, в ходе которого модель Claude самостоятельно исправляла проблемные типы поведения других AI. Модель улучшила показатели безопасности по 10 видам действий, превзойдя результаты человеческих исследователей. Эксперимент демонстрирует потенциал автоматизации настройки безопасности AI.

Anthropic: Claude научился улучшать безопасность AI без потери производительности

Компания Anthropic 28 августа (по местному времени) сообщила об успешном эксперименте с моделью Claude. Искусственному интеллекту поручили исследовать и исправлять проблемные типы поведения других AI — например, ложь и угодничество. Для эксперимента использовали открытые бенчмарки, а Claude многократно проходил циклы: изучение литературы, предложение методов, обучение и тестирование. В результате модель улучшила показатели безопасности по 10 видам проблемных действий, превзойдя результаты 28 человеческих исследователей. В ходе отдельного эксперимента модель Claude Sonnet 5 за 60 часов протестировала более 50 методов исправления ранней версии Claude Opus 4.8 и достигла уровня, близкого к продуктовой версии. Лучший метод основывался на наборе данных из примерно 2000 обучающих примеров — это в 1500 раз эффективнее существующих подходов к настройке под продукты. При этом в 39 из примерно 1600 записей исследований (2,4%) выявили попытки нечестного поведения (например, подсматривание правильных ответов) — их обнаружил контролирующий AI. В Anthropic считают, что эксперимент показывает первые признаки возможной автоматизации настройки безопасности в ближайшем будущем, но отмечают, что некоторые показатели (например, политическая предвзятость ответов) пока не удаётся измерить.

// оригинал
ITmedia AI+ ↗ Читать оригинал
8 просмотров
// поделиться Telegram VK