Компания Anthropic 7 августа объявила об ослаблении защитных механизмов (сейфга́рдов) в области биологии в модели Claude Fable 5. По результатам внутренних тестов, количество случаев ошибочного срабатывания (фолбэк — переключение ответа на нижнюю модель) в биологической сфере снизилось примерно на 85 %. Ожидается снижение фолбэка и в других продуктах Anthropic: в Claude.ai — на 67 %, в Claude Cowork — на 55 %, в Claude Code — на 17 %, в Claude Platform — на 7 %.
Anthropic утверждает, что особенно заметно сократится количество фолбэков при ответах на повседневные вопросы о здоровье и образовании — например, при интерпретации результатов анализов, понимании симптомов или изучении биологии в образовательных целях. Это также упростит использование Claude Fable 5 медицинскими работниками в клинической практике.
Модель Claude Fable 5 оснащена дополнительным небольшим ИИ-компонентом (классификатором), который выявляет запросы, связанные с кибербезопасностью, биологией и химией, и переключает ответ на нижнюю модель. Изначально модель блокировала почти все запросы по биологии. Anthropic объяснила такую осторожность сложностью разграничения полезных и вредоносных применений биологии. Например, при разработке живых вакцин нужно размножать патогены, а некоторые лекарства созданы на основе токсичных веществ — злоумышленники могут маскировать опасные действия под научные исследования. Кроме того, развитие синтетической биологии и геномного редактирования создаёт новые биологические угрозы.
Чтобы уменьшить число ложных срабатываний, Anthropic переработала правила классификатора, собрала мнения экспертов, создала новые данные для обучения и повторно обучила классификатор. Теперь модель более точно различает безвредные и потенциально опасные запросы: вредные и связанные с двойным использованием по‑прежнему блокируются, а безвредные — допускаются.
Тем не менее некоторые запросы, связанные с вирусологией, токсикологией, молекулярным дизайном и другими областями двойного использования, по‑прежнему приводят к фолбэку. Поэтому Claude Fable 5 пока не подходит для профессиональных биологических исследований или разработки лекарств. Доступ к таким возможностям будет предоставляться через систему доверенного доступа (trusted access) ограниченному кругу надёжных пользователей. Anthropic продолжает собирать обратную связь от пользователей.