Развитие искусственного интеллекта идёт в сторону создания автономных исследователей. Одним из инструментов оценки их способностей стал бенчмарк DiG-bench (Discovery in Games) — набор из 70 игр, которые помогают оценить, насколько системы ИИ способны выявлять неписаные правила среды через исследование и любопытство.
Каждая игра в DiG-bench представляет собой замкнутый миниатюрный мир со своими законами. При этом правила и цель скрыты от игрока — их нужно раскрыть через взаимодействие. Особенности игр:
* ориентированы на языковые модели;
* достаточно короткие, чтобы все следы помещались в контекстное окно современных передовых моделей;
* созданы экспертами-людьми;
* большинство игр закрыты, чтобы системы ИИ не могли на них обучаться;
* все игры пройдены хотя бы одним человеком (при этом игроки отмечали их сложность);
* для прохождения требуются разные навыки и стратегии;
* есть режим экспериментирования, позволяющий свободно взаимодействовать с играми без строгого ограничения количества действий.
Бенчмарк разделён на 7 уровней сложности: от самого простого (уровень 1) до самого сложного (уровень 7). Публично выпущено 21 игра, остальные пока скрыты. В большинстве игр несколько уровней, а количество доступных игроку действий на каждом шаге — от 2 до 34.
В тестировании участвовали разные модели ИИ. Лучшие результаты показали Opus 5 и Fable 5 с Claude Code, за ними следует GPT-5.5. Только Opus 5 и Fable 5 смогли выполнить задачи (0.2) на уровне 7. Opus 5, GPT-5.5 и Kimi K3 смогли выполнить некоторые задачи на уровне 6 при доступе к harness (например, Claude Code). GLM-5.2 и Gemini 3.1 Pro смогли пройти некоторые уровни на уровне 4.
Тесты типа DiG-bench призваны выделить предпосылку для творчества — способность автономно обнаруживать полезные недокументированные особенности в новых ситуациях. Сейчас передовые модели уже способны на впечатляющие открытия, но всё ещё уступают людям: например, показатель успеха в 20 % на Tier 7 значительно ниже, чем 100 % у людей. Прогнозируется, что паритет с человеком на DiG-bench может быть достигнут к середине 2027 года, после чего можно ожидать активного развития рекурсивного самосовершенствования.
Авторы исследования — Thinking About Thinking, Оксфордский университет, Принстонский университет, Университет науки и технологий короля Абдаллы, Swiss AI Lab, Inria, MIT. Один из авторов — Юрген Шмидхубер.
Помимо DiG-bench, в сфере ИИ появляются и другие интересные разработки. Например, компания Paradigm Research выпустила браузерную игру, которая симулирует управление компанией по созданию ИИ‑систем, способных к рекурсивному самосовершенствованию. Игра помогает понять, как взаимодействуют разные компоненты исследований в области ИИ: например, как балансировать инвестиции в исследователей и вычислительные ресурсы, когда и как лицензировать данные.
Компания Inherent создала модель ИИ‑учёного Faraday (27B), которая может развивать «вкус» в исследованиях. Faraday использует кодирующий агент OpenAI Codex и дообучена на базе Qwen‑3.6‑27B. Для обучения и оценки системы собран набор данных Replica — 100 статей по ML и ИИ в науке, опубликованных в 1990–2026 годах. Данные преобразованы в 310 задач на воспроизведение: из статей удалены отдельные результаты, и проверяется, насколько хорошо ИИ‑системы могут автономно проводить эксперименты для заполнения пропусков.
Faraday с Codex превосходит Opus 4.8 и GPT‑5.5 в некоторых задачах воспроизведения: на 73 % задач по ML в распределении и на 60 % задач по ИИ в науке во внешней выборке. Отмечается общий рост производительности по сравнению с базовой моделью Qwen как в обучающих, так и в тестовых задачах.
Навыки Faraday (определение объекта исследования, планирование экспериментов в рамках бюджета, оценка воспроизводимости) в сочетании с развитием передовых моделей кодирования могут позволить системе продвигать передовые технологии, проектируя собственные эксперименты. Предполагается, что один посттренированный внешний агент сможет отслеживать развитие технологий по мере выхода новых моделей.
Марк Цукерберг в эссе «The Future is for Everyone» предлагает массово распространить возможности ИИ среди всех жителей планеты, чтобы избежать концентрации власти у ограниченного числа игроков. Его философия основана на расширении возможностей личности как источнике процветания, изобретении как основной цели суперинтеллекта и балансе власти как основе безопасности. Цели и убеждения Meta* включают:
* обеспечение каждого высокофункциональным персональным агентом, который понимает цели и интересы пользователя;
* предоставление инструментов для воплощения идей и создания бизнеса;
* наличие персонализированного репетитора и наставника с PhD по каждому предмету;
* доступ всех людей к научным достижениям и возможность вносить вклад в научный прогресс;
* бесплатный или доступный по цене доступ к этим инструментам.
При этом возникает сложный вопрос: будет ли система, способная к сверхчеловеческим изобретениям, работать исключительно в интересах расширения возможностей людей, менее способных к изобретениям? Цукерберг полагает, что распространение таких систем приведёт к антихрупкому балансу сил между людьми и корпорациями, оснащёнными суперинтеллектом.
* Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена на территории РФ.