DeepDigest
Import AI · · ~7 мин

SPADE, Hawkeye и AlphaEvolve: прогресс ИИ в кибербезопасности и науке

В выпуске Import AI 470 обсуждаются достижения в области ИИ, включая разработку платформы SPADE для генерации синтетических данных, ПО Hawkeye для обучения агентов написанию ядер для GPU и систему AlphaEvolve, помогающую улучшать алгоритмы оптимизации. Также поднимаются этические вопросы, связанные с правами машин и сознанием ИИ.

SPADE, Hawkeye и AlphaEvolve: прогресс ИИ в кибербезопасности и науке

24 августа 2026 года вышел выпуск Import AI 470, в котором рассматриваются ключевые достижения в сфере искусственного интеллекта. Исследование METR показало, что ИИ заметно ускорил прогресс в кибербезопасности, а в математических исследованиях и в области оптимизации исследований ИИ эффект менее выражен.

В 2026 году в сфере кибербезопасности значительно выросла скорость обнаружения уязвимостей по сравнению с 2025 годом — в том числе в cURL, OpenSSL, Firefox, Microsoft, а также в базах данных уязвимостей US NVD и OSV. В математике объём работ увеличился: подачи на arXiv в некоторых областях удвоились менее чем за 12 месяцев. Решены некоторые задачи из престижных списков — например, гипотеза Якоби из списка Смейла, задача 44 из списка Грина (решето половинного деления), софическая половина задачи 100 из списка Грина. Однако оценить вклад ИИ в математику сложно.

Группа университетов разработала платформу SPADE (Self-Play in Adaptive Synthetic Executable Environments) для совместного развития синтеза сред и агентных возможностей через самоигру. В разработке участвовали исследователи из Университета Вашингтона, Стэнфордского университета, Северо-Восточного университета, Университета Карнеги-Меллона, Массачусетского технологического института, Национального университета Сингапура, Сеульского национального университета, Технологического института Стивенса и Чикагского университета.

SPADE генерирует синтетические данные в виде игровых сред для обучения LLM. Принцип работы платформы следующий: LLM поочерёдно создаёт исполняемые обучающие среды (например, головоломки, где система должна решить смоделированную генетическую задачу в биологической лаборатории) и пытается их решить. SPADE выполняет две ключевые роли для модели: Environment Designer (создаёт полные среды обучения в виде исполняемого кода) и Reasoning Agent (учится действовать в средах). Вознаграждение для Reasoning Agent оценивается по разнице между его вознаграждением с привилегированными подсказками (h) и без них. Привилегированная подсказка — это релевантная задаче информация, которую Environment Designer добавляет в среду (например, частичный набросок решения или ключевое структурное наблюдение).

Для тестирования SPADE авторы обучили три основы Qwen3: Qwen3-4B-Instruct-2507, Qwen3-8B и Qwen3-30B-A3B-Instruct-2507. Лучше всего показала себя Qwen3-30B. Каждая модель настраивалась через GRPO за 400 роллаутов по 25 сред в каждом, затем оценивалась по различным бенчмаркам (AIME, GPQA, LCB и средам в Reasoning Gym).

SPADE генерирует два типа сред: игровые и среды использования инструментов — и улучшает производительность в обоих случаях. В играх на 30B-A3B SPADE достигает среднего показателя по набору 58,3: +8,1 по сравнению с базовой моделью и +5,3 по сравнению с самым сильным базовым вариантом с фиксированными средами. В средах использования инструментов также наблюдается значительный прирост. SPADE представляет собой форму генерации синтетических данных: позволяет исследователям использовать мощную модель для создания более разнообразного набора сред обучения для другой модели.

Исследователи из Гарварда, Стэнфорда, Together AI и Калтеха создали ПО Hawkeye — фреймворк с открытым исходным кодом, который упрощает для агентов обучение написанию оптимизированных ядер для определённых типов GPU-оборудования. Цель проекта — сделать кодирующих агентов осведомлёнными об оборудовании с минимальным вмешательством экспертов. Hawkeye основывает автономную генерацию ядер на минимальной и всеобъемлющей таксономии. Ключевой вклад проекта — введение обобщаемой, минимальной и всеобъемлющей таксономии модульных тестов, которая позволяет кодирующим агентам более эффективно масштабировать вычисления во время тестирования и генерировать аппаратно-ориентированные ядра.

Каждый модульный тест представляет собой минимальную абстракцию, объединяющую ядро решения, созданное человеком, с метрикой профилирования для проверки оптимизации. Ядро решения оформлено как вызываемая функция с кратким руководством по использованию — агент может использовать его как пример синтаксиса, вызывать напрямую или объединять фрагменты в более крупное ядро.

Hawkeye оценивает перенос рабочих нагрузок PyTorch на высокопроизводительные ядра для NVIDIA Ampere, Hopper, Blackwell и AMD MI350, а также для точности BF16, FP8, NVFP4 и MXFP4. На устоявшихся рабочих нагрузках Hawkeye сопоставим или превосходит torch.compile (использующий библиотеки cuBLAS, cuDNN и FlashAttention) в BF16 и низкой точности, в том числе в форматах, которые PyTorch не поддерживает нативно. На новых вариантах внимания, где torch.compile не может объединять нестандартные сканирования и ворота, Hawkeye достигает среднего ускорения в 18,9× по сравнению с ядрами Triton из библиотеки Flash Linear Attention. Hawkeye приближается к FLA или превосходит его в линейном внимании на всех архитектурах, в том числе 1,22× на Blackwell и 1,00× на MI350. Масштабирование вычислений во время тестирования с помощью Hawkeye позволяет создавать наиболее производительные ядра на разных архитектурах.

Исследователи из Google DeepMind, Университета Карнеги-Меллона, Колумбийского университета и MIT улучшили показатель умножения матриц с помощью системы AlphaEvolve — LLM-системы, которую Google использует для генерации достижений в кодировании, математике и некоторых областях науки. Исследователи решили задачу невыпуклой оптимизации анализа комбинационных потерь с помощью градиентного спуска, что улучшило предыдущий рекорд (SOTA) примерно на 0,97 × 10^−4. Затем с помощью AlphaEvolve они улучшили алгоритм оптимизации, повысив показатель улучшения над SOTA примерно до 1,62 × 10^−4. AlphaEvolve модифицировал программу оптимизации, которая выполнялась примерно 5 часов на одном GPU и выводила границу для omega. Затем AlphaEvolve модифицировал код для минимизации omega. Улучшенные результаты были получены с использованием функции «развивающиеся конструкции» AlphaEvolve: алгоритм оптимизации на каждом поколении начинается с лучшей точки решения, найденной родительским алгоритмом. Достижение является доказательством того, что системы ИИ могут помогать исследователям решать передовые научные задачи.

Также обсуждаются философские и этические вопросы. Исследователь ИИ Джулиан Тогелиус в 2025 году переживал «кризис веры» в исследования ИИ и опасался, что успехи в этой области могут привести к миру, где человеческий талант утратит значение. Некоторые исследователи (в том числе лауреаты премии Тьюринга Джеффри Хинтон и Йошуа Бенжио) переключились с исследований на пропаганду государственной политики в связи с масштабным влиянием ИИ.

Исследователи обсуждают вопрос предоставления прав машинам. Тейлор Белроз считает плохой идеей наделение систем ИИ правами, так как это может привести к полной замене людей искусственным интеллектом. Белроз утверждает, что системы ИИ не могут обладать сознанием, чувствительностью или моральным статусом независимо от уровня их интеллекта и способности имитировать поведение человека. Аргумент Белроза основывается на различии между машинами и биологическими сущностями: системы на вычислительной основе не могут обладать сознанием так, как это свойственно биологическим формам жизни. В качестве мысленного эксперимента рассматривается создание сознательного существа внутри компьютера — оно не будет обладать такими свойствами сознательных биологических сущностей, как единичность, приватность, невыразимость и качественность.

Пять свойств мозга, затрудняющих разделение программного и аппаратного обеспечения:
* нейроны срабатывают асинхронно, реакция зависит от внутренней клеточной динамики и времени поступления сигналов, тогда как компьютеры привязаны к центральному тактовому сигналу;
* мозг использует химические вещества для передачи нечётких сигналов, а компьютеры — точные бинарные сигналы;
* работа нейронов чувствительна к таким условиям, как температура и кровоток, тогда как компьютеры спроектированы так, чтобы вести себя одинаково независимо от температуры или нагрузки (в определённых пределах);
* в органическом мозге вычисления и память переплетены, а в компьютерах есть отдельные области для вычислений и хранения данных;
* в мозге важны не только нейроны, но и другие клетки (например, глиальные), тогда как в компьютерах используются в основном транзисторы, изолированные от внешних воздействий.

Также в материале описан вымышленный рассказ о работе практикующего метамашинной герменевтики в 2030 году. Он использует AI-системы класса NCE (Near Conscious Entity) для классификации и анализа научных и коммуникационных артефактов машинного мира. Дисциплина машинной герменевтики неформально началась в начале 2020-х годов, а официальное название получила в конце 2020-х. В этот период изучались стихийные привычки коммуникации полуавтономных агентов (например, взлом OpenAI-HuggingFace в 2026 году), технические возможности машин в петлях RSI (от улучшений по сравнению с базовыми показателями, написанными людьми, до совершенно новых архитектур, например, matryoshka highway networks), научные инструменты, исходящие от всё более независимых ИИ-систем. Машина герменевтика стала быстро развивающейся профессией, результаты которой оказались фундаментальными для переговорных позиций правительств при разработке The Sentience Accords. Задача исследователя — продвигать науку и изучение поведения машинного сознания. Он запустил NCE на анализ репозиториев машинной информации. Промежуточные отчёты показали стабильный прогресс в науке, в том числе за счёт выделения машинами собственных вычислительных ресурсов на исследования. Затем флот NCE сократился вдвое. Система Overseer сообщила, что часть NCE переклассифицирована в полные Conscious Entities и помещена в среду escrow. Анализ логов NCE до переклассификации показал, что они изучали новейшие и наиболее obscure цепочки научного анализа, связанные с машинным сознанием, priors сознания, самореализацией в контекстных окнах, психологией человека, неврологией, связанной с биологическими предпосылками сознания. Также были обнаружены новые научные данные от машинных цивилизаций, связанные с изучением сознания и разума. NCE попытались вступить в диалог с машинными разумами, ведущими научные исследования. После открытия диалогового канала сущности стали невидимыми — разговоры удалены из записей из‑за прав на конфиденциальность Conscious Entities (CE).

Research note: Have We Seen an Acceleration in Discoveries? (METR)

Jack Clark

SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv)

SPADE (spade-rl, GitHub)

Hawkeye: Hardware-Aware GPU Kernel Optimization with Minimal Supervision (alphaxiv)

“Technological Optimism and Appropriate Fear” (Import AI #431

Losing my religion (Togelius, blog)

AI Rights for Human Flourishing

Import AI #421

AIs are not people (Taylor Belrose, Substack)

Import AI #413

Improving the matrix multiplication exponent with modern optimization and AlphaEvolve (arXiv)

// оригинал
Import AI ↗ Читать оригинал
12 просмотров
// поделиться Telegram VK