DeepDigest
Leiphone · · ~5 мин

Kimi K3: новая архитектура с улучшенным масштабированием

Kimi K3 — модель с интеграцией архитектуры, обучения и Agent infra в единую систему. Она решает проблемы масштабирования за счёт новых технологий (KDA, AttnRes, Stable LatentMoE) и демонстрирует высокую эффективность в программировании, поиске и профессиональных задачах. Модель имеет мультимодальный дизайн и замкнутый цикл обучения.

Kimi K3: новая архитектура с улучшенным масштабированием

Компания Kimi выпустила технический отчёт о модели Kimi K3 — документ занимает 47 страниц, дата публикации — 28 июля 2026 года. Ключевая особенность модели — интеграция архитектуры, обучения и Agent infra в единую систему.

Kimi K3 обладает внушительными параметрами: всего 2,8 трлн параметров, из которых активировано 104 млрд; контекст модели составляет 1 млн токенов. Модель решает ряд проблем масштабирования, включая рост размера модели и длины контекста, раздувание KV Cache, смешивание информации в глубоких сетях, сложности с маршрутизацией и нагрузкой при увеличении числа экспертов, а также замедление обучения из‑за медленных задач в RL.

В основе работы Kimi K3 — три ключевых изменения в архитектуре. Для работы с последовательностью применяется Kimi Delta Attention (KDA). Эта технология использует фиксированный размер рекурсивного состояния для сохранения истории: модель обновляет сжатую память, а не хранит каждый токен полностью. В каждом модуле Kimi K3 реализовано 3 слоя KDA и 1 слой Gated MLA, в конце модели сохранён глобальный механизм внимания. KDA отвечает за недорогое обновление долгосрочного состояния, а MLA — за периодическую проверку полного контекста.

Ещё одно нововведение — AttnRes (Attention Residuals). В отличие от обычных остаточных соединений, которые сохраняют только окончательную версию, AttnRes сохраняет несколько промежуточных версий. Эти версии последующие слои могут повторно использовать при необходимости. Такой подход похож на переход от RNN к Transformer: если RNN сжимает все исторические токены в одно состояние, а Transformer позволяет текущему токену напрямую считывать разные исторические позиции, то AttnRes переносит механизм выбора с измерения последовательности на глубину сети.

Для контроля затрат памяти и связи Kimi K3 группирует слои в блоки (примерно по 12 слоёв), после чего выбирает представления разных блоков. Модель может повторно использовать информацию разной глубины, но только на уровне группы слоёв, а не отдельного слоя. В AttnRes используются в основном псевдозапросы, полученные в процессе обучения каждого слоя, а не динамически генерируемые текущим токеном, как в стандартном внимании.

Модель также применяет LatentMoE: сначала сжимает 7168‑мерное скрытое состояние до 3584‑мерного, чтобы эксперты‑маршрутизаторы выполняли вычисления в более узком пространстве, а затем возвращает его к полной размерности. Это позволяет увеличить общее число экспертов и количество экспертов, активируемых для каждого токена, не увеличивая объём коммуникации пропорционально полной размерности скрытого состояния. После агрегации экспертов применяется RMSNorm, а SwiGLU заменён на SiTU-GLU — плавный ограничительный механизм, который при нормальных значениях сохраняет характеристики SwiGLU, а при слишком больших значениях ограничивает рост, снижая риск переполнения при низкоточной тренировке.

Kimi K3 предлагает и новые подходы к маршрутизации. Например, Quantile Balancing оценивает необходимое смещение для каждого эксперта на основе квантилей баллов маршрутизации всей партии, пересчитывая «линию приёма» на основе текущего распределения. MoonEP создаёт динамические копии популярных экспертов, чтобы разные устройства получали одинаковое количество токенов: Quantile Balancing отвечает за маршрутизацию на уровне алгоритма, MoonEP — за выполнение на уровне оборудования.

Архитектура Kimi K3 включает:
- KDA (сжатие состояния последовательности);
- AttnRes (повторный вызов глубинной информации);
- Stable LatentMoE (сжатие связи экспертов).

Эти компоненты решают проблемы потока информации после изменения длины, глубины и ширины модели. Кроме того, Kimi K3 использует partial rollout: обновляет модель на основе частично завершённых траекторий, приостанавливая незавершённые. Для решения проблемы устаревания данных применяется потоконое регулирование, ограничивающее изменение стратегии при каждом обновлении.

AgentENV в Kimi K3 использует Firecracker microVM для поддержки приостановки, восстановления, копирования и создания снимков состояния. Это позволяет сохранять и восстанавливать состояние внешней среды и задач. В ходе обучения и оценки создано более 5100 млн sandbox. Они могут приостанавливаться во время ожидания модели, экономя CPU и память, и быстро восстанавливаться после генерации следующего шага моделью. Это позволяет многократно приостанавливать и продолжать траектории Agent, реализуя долгосрочные задачи в обучении с подкреплением.

Модель демонстрирует впечатляющие результаты в оптимизации различных ядер. Например:
- в задаче оптимизации AttnRes Kernel за десятки часов Kimi K3 повышает ускорение относительно FLA Triton до 59,7 %;
- в задаче оптимизации DSA Kernel за почти 24 часа достигает ускорения относительно FLA Triton на 55,1 % (у Claude Fable 5 — 57,3 %);
- в задаче оптимизации MLA Kernel после нескольких циклов написания, тестирования и корректировки повышает производительность до 518 TFLOPS;
- в задаче оптимизации KDA-GPGPU Kernel в течение более 20 часов повышает ускорение относительно FLA Triton до 73,6 %.

Kimi K3 имеет мультимодальный дизайн. Его визуальный кодировщик MoonViT-V2 обучается с нуля, без предварительной инициализации с помощью SigLIP и других моделей. Эксперименты показывают, что MoonViT-V2 стабильнее при совместном обучении и достигает уровня производительности, близкого к моделям с предобученным инициализатором. Многомодальные данные Kimi K3 включают пары кода и результатов рендеринга (веб-страницы, SVG, игры, 3D-активы, CAD-графики). Модель может написать код, запустить его, посмотреть скриншот и скорректировать результат на основе увиденного. Визуальный компонент выступает в роли канала обратной связи для Agent.

Kimi K3 формирует замкнутый цикл обучения: сохраняет состояние задачи, выполняет инструменты, наблюдает за результатами и корректирует действия на основе обратной связи. Модель демонстрирует примерно в 2,5 раза более высокую общую эффективность масштабирования по сравнению с Kimi K2 (в рамках полученной scaling law). Параметры Kimi K3: общее число параметров — с ~1,04T до 2,78T; активированные параметры — с 32,6B до 104,2B; число слоёв — с 61 до 93.

Kimi K3 особенно хорош в программировании, поиске, профессиональных рабочих процессах и длинных вызовах инструментов. При этом модель выполняет больше шагов, использует больше выходных токенов, тратит больше времени на проверку и корректировку результатов. В оценках используются Kimi Code, Claude Code, Codex и другие Agent Harness, часть данных — из внутренних наборов. Результаты отражают эффективность «модели плюс инструментальная система», а не характеристики «чистой» модели.

Подробнее можно узнать по ссылке

// оригинал
Leiphone ↗ Читать оригинал
6 просмотров
// поделиться Telegram VK