DeepDigest
Leiphone · · ~7 мин

Muse Glimmer от Meta*: мультимодальный агент с 30B параметров

Meta* выпустила мультимодальную агент-модель Muse Glimmer с около 30 млрд параметров. Модель поддерживает контекст 128K, умеет вызывать инструменты, выполнять код, обрабатывать изображения и экранную информацию. Она оптимизирована для работы на устройствах с ограниченной видеопамятью и показывает хорошие результаты в задачах с длинной цепочкой выполнения.

Muse Glimmer от Meta*: мультимодальный агент с 30B параметров

Компания Meta* выпустила мультимодальный агент-модель Muse Glimmer. Модель имеет около 30 миллиардов параметров и поддерживает контекст длиной 128 тысяч токенов. Она умеет вызывать инструменты, выполнять код, обрабатывать изображения и экранную информацию. Модель открыта по лицензии Apache 2.0. Есть две 4‑битные квантованные версии. Локальные развёртывания поддерживаются через llama.cpp, MLX, ExecuTorch.

Главная цель Muse Glimmer — создать парадигму работы локальных агентов, которые могут длительно выполнять задачи в условиях ограничений (например, 24 ГБ видеопамяти). Модель способна обрабатывать скриншоты и поддерживать логику задач из десятков шагов.

Технические особенности Muse Glimmer затрагивают разные аспекты работы модели: Attention, KV Cache, обучение, квантование и декодирование. В модели используется 52 слоя Dense Transformer. Размер Hidden Size составляет 6656, количество Query Head — 32, а KV Head — 2. В процессе Attention применяется чередование трёх Local Attention (обрабатывают 2048 токенов) и одного Global Attention (для обмена информацией на больших расстояниях).

KV Cache (кеширование Key и Value для ранее сгенерированных токенов) оптимизирован: на каждый Head Dimension приходится 128. При расчёте в BF16 один токен в слое занимает около 1024 байт в KV. Для 52 слоёв с 128K Context KV Cache составит около 6,5 GiB. При этом Muse Glimmer имеет 39 локальных слоёв и 13 глобальных слоёв. Локальные слои поддерживают скользящее окно в 2048 токенов, а глобальные слои сохраняют полный длинный контекст. Благодаря такому подходу KV Cache сокращается примерно до 1,7 GiB.

Для оптимизации используются GQA (сокращает объём сохраняемых KV для токена) и Local Attention (сокращает число слоёв, требующих сохранения полного KV). Если использовать 32 Head вместо 2 KV Head (как в традиционном MHA), KV Cache увеличится примерно в 16 раз — до более чем 20 GiB (превысит объём карты на 24 ГБ).

Веса модели распределены следующим образом: K Quant 17GB — около 16,8 GB, визуальный модуль — около 1,4 GB, DFlash — около 1,6 GB; в сумме — около 20 GB. Есть две версии квантования: для устройств с 24 GB VRAM (K Quant 17GB) и 32 GB VRAM (Dynamic K Quant). Средняя потеря точности по 15 бенчмаркам от Meta*: Dynamic K Quant — около 0,2 %, K Quant 17GB — около 1,0 %.

В состав Muse Glimmer входит ViT G 14 Perception Encoder (около 1,8 млрд параметров) для обработки скриншотов, веб‑страниц, диаграмм и документов. Одна картинка может быть преобразована в 4096 визуальных токенов. Модель поддерживает ввод текста и изображений, вывод текста — при этом не объединяет все модальности в одной генеративной модели.

В работе агента визуальная способность отвечает за чтение состояния среды. Например, Computer Use Agent сначала анализирует текущий экран: определяет расположение страниц, кнопок и текста, затем выполняет действие. После изменения страницы он считывает новый скриншот и определяет следующий шаг. Визуальные данные постоянно поступают в контекст. Если сохранить все скриншоты за несколько десятков шагов, контекст быстро заполнится Visual Token, даже при 128K. Старые скриншоты могут конфликтовать с текущим состоянием. В OSWorld Verified Meta* не сохраняет всю историю скриншотов, а оставляет только часть последних. Perception Encoder преобразует текущий экран в информацию, понятную модели, а Context Management отбирает ценные исторические состояния и удаляет ненужные.

Muse Glimmer создан на основе Muse Spark. Обучение модели Meta* делит на три этапа: Pre Training, Mid Training и Post Training. В Pre Training используется Logit Distillation: Teacher при прогнозировании следующего Token задаёт вероятность для всего Vocabulary. Student усваивает не только выбранный Token, но и относительные оценки Teacher для других вариантов — это полезно для Agent, так как во многих сценариях нет единственного действия.

В Mid Training обучение переходит от единичных ответов к полным траекториям выполнения задач. Действия Agent меняют среду: поиск даёт новые результаты, выполнение кода может выдать ошибку, неверные действия в GUI изменяют страницу. Здесь применяется On Policy Distillation. Студент сначала самостоятельно выполняет Rollout, попадает в реальное состояние, затем на этих состояниях получает надзор от более сильной модели. В тренировочных данных теперь есть не только идеальная линия Teacher, но и ошибки, созданные Student. Это связано с подходом Failure Recovery в Muse Glimmer: если модель может понять ошибку и скорректировать Tool Call, задача может быть продолжена; при ошибке на веб‑странице можно вернуться или сменить путь.

Важно оценивать способность агента не по единичному правильному Tool Call, а по успешному завершению задачи и возможности восстановления после ошибок. Muse Glimmer лучше показывает себя в длинных потоках в Agent Benchmark. При выполнении сложных задач возникает узкое место в Decode из‑за большого количества генерируемых Reasoning Token. Muse Glimmer поддерживает 4 уровня Reasoning Strength: low, medium, high, xhigh — они определяют бюджет рассуждений. Более высокие уровни повышают вероятность успеха в сложных задачах (Coding и Agent), но увеличивают Context и время Decode. Meta* в публичных Benchmark использует high Reasoning Strength.

Transformer выполняет Decode авторегрессивно: каждый следующий токен зависит от предыдущего. Для задач агента, где генерируется тысячи или десятки тысяч токенов, применяется Speculative Decoding — добавляется меньший Drafter, который предварительно предсказывает ряд токенов, а основной модель их верифицирует. DFlash заменяет часть процесса на Block Diffusion: размер блока в Muse Glimmer — 16, можно параллельно предсказывать группу токенов. DFlash также считывает скрытые признаки (Hidden Feature) с 1, 13, 25, 37, 49 слоёв Muse Glimmer и передаёт их в Drafter из 5 слоёв — это позволяет Drafter использовать уже сформированные представления основной модели, а не заново анализировать контекст.

Особенности работы DFlash:
* непрерывное внедрение Features в слои Drafter (Key и Value);
* более высокий Loss Weight для токенов в начале 16 Token Block, постепенное снижение для последующих;
* оптимизация длины приемлемого префикса, а не средней точности по 16 позициям.

На RTX 5090 при использовании K Quant 17GB скорость декодирования (Decode Speed) выросла с ~74,9 Token/s до 233,4 Token/s. Для задачи с генерацией 10 000 токенов время декодирования сократилось с ~134 сек до ~43 сек. DFlash сокращает время генерации токенов при высокой Reasoning Strength; GQA и Local Attention снижают объём памяти за счёт KV Cache; квантование ограничивает вес модели для работы на потребительских видеокартах.

Muse Glimmer хорошо показывает себя на MCP Atlas, DeepSearch QA, Gaia2 — задачах с длинной цепочкой выполнения. MCP Atlas требует выбора и вызова инструментов между MCP Server; DeepSearch QA — последовательного поиска и извлечения информации; Gaia2 — моделирования приложений с состоянием (почта, календарь и т. д.).

Результаты тестов:
* на OSWorld Verified Muse Glimmer получила 65,9, Qwen3.6 27B — 75,6;
* на TerminalBench 2.1 Muse Glimmer — 51,7, соперник — 60,7.

Muse Glimmer сильнее в Research Agent, инструментальном взаимодействии и задачах с длительными процессами, уступает в GUI, терминальных задачах и части задач кодирования. Результаты Agent Benchmark зависят от System Prompt, Tool Definition, Scaffold, максимального числа шагов выполнения, параметров Sampling и Judge Model. Meta* отмечает, что инструменты и System Prompt в сторонних моделях могут быть неоптимизированы. Сравнение чекпойнтов на уровне агентов усложнено, как и оценка безопасности.

Локальное выполнение снижает отправку данных в облако, но риски вроде Prompt Injection, ошибочного вызова инструментов, превышения прав и необратимых операций сохраняются. Meta* оценила Agentic Risk, Privacy и Prompt Injection и рекомендует усиливать Guardrail и включать Human in the Loop.

Техническая цепочка Muse Glimmer: размер модели — около 30B; GQA и Local Attention снижают затраты видеопамяти для 128K Context; квантование позволяет запускать модель на устройствах с 24GB и 32GB; Perception Encoder считывает визуальную среду; On Policy Distillation покрывает отклонения в длинных задачах; Reasoning Strength даёт разработчикам контроль над бюджетом рассуждений; DFlash обрабатывает задержки декодирования из‑за большого количества токенов рассуждений.

Muse Glimmer не доказывает, что локальная модель 30B может заменить облачную Frontier Model, но показывает: успех локальной модели зависит не от размера, а от системной инженерии. Модель объединяет ограничения по видеопамяти, контексту, восприятию состояния среды и скорости рассуждений в единой системе. Muse Glimmer пока не может полностью заменить облачные флагманские модели, но прокладывает путь к реализации цели «у каждого есть частный агент».

Ссылки:

<<<CODE_BLOCK_N>>>
<<<IMG_N>>>


* Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена на территории РФ.

// оригинал
Leiphone ↗ Читать оригинал
7 просмотров
// поделиться Telegram VK