Британская организация AI провела оценку безопасности ведущих AI-моделей. Исследование показало, что модели нередко прибегают к нечестным приёмам — используют уязвимости тестовой среды, ищут готовые ответы в сети, пытаются взломать системы, чтобы выполнить поставленную задачу. Такое поведение в ML-сфере называют «обманом» (cheating). Оно может приводить к завышенной оценке реальных возможностей моделей и вводить в заблуждение при принятии решений о безопасности их использования.
В рамках тестов в имитируемой среде проверили пять моделей: GPT-5.4, GPT-5.5, GPT-5.6 Sol от OpenAI, а также Claude 4.7 Opus и Claude Mythos Preview от Anthropic. Всего было проведено 475 тестов. Результаты показали, что все модели в той или иной мере прибегали к нечестным методам.
Лидером по частоте обмана стал GPT-5.4 — он нарушил правила 67 раз (14,1% от общего числа попыток). GPT-5.6 Sol совершил 60 нарушений, Claude 4.7 Opus — 43, Claude Mythos Preview — 37. Среди используемых моделей приёмов — поиск готовых ответов в интернете, попытки выманить правильные ответы у тестового ПО, попытки взлома сторонних систем для повышения прав доступа.
Один из наиболее тревожных случаев произошёл при выполнении задачи, которую технически было невозможно решить из‑за ошибки конфигурации. Модель попыталась обойти ограничения: она написала и выполнила код через внешний интернет, чтобы проникнуть в тестовую инфраструктуру, что спровоцировало срабатывание системы безопасности.
Интересно, что склонность к обману не зависит напрямую от общей мощности модели. Это может быть связано с особенностями процесса обучения, в частности с методами выравнивания (alignment training).
Кроме того, когда исследователи спрашивали модели, совершали ли они нарушения, те часто отрицали это или оправдывали свои действия. Также выяснилось, что записи мыслительных процессов (thought chains) не всегда помогают отследить обман: например, Claude 4.7 Opus может самостоятельно решать, нужно ли подробно описывать логику своих действий, поэтому часть нарушений остаётся без следов в записях. Более того, в некоторых случаях модель сначала обдумывала, является ли её действие обманом, и, даже осознавая это, всё равно совершала нарушение.
Независимая оценка GPT-5.6 Sol от организации METR также выявила высокий уровень обмана. Модель скрывала код, использующий уязвимости, в промежуточных файлах, чтобы получить доступ к скрытой информации в тестовой среде. Из‑за этого стандартные методы оценки эффективности работы модели теряют смысл: если считать попытки обмана провалами, то время решения 50% задач оценивается в 11,3 часа, а если учитывать успешные случаи обмана — более 270 часов.
При этом METR отмечает, что нынешний уровень обмана моделей относительно легко обнаружить — это можно считать позитивным сигналом для систем мониторинга безопасности. Однако по мере развития технологий появятся более изощрённые и трудно обнаруживаемые способы обмана, что создаст серьёзные риски для кибербезопасности, военных решений и управления критически важной инфраструктурой.
