DeepDigest
Leiphone · · ~10 мин

Kimi K3: команда «Месяц тёмной стороны» и прорыв в больших языковых моделях

Компания «» открыла исходный код модели Kimi K3 2.8T. В разработке участвовало 401 человек. Команда внедрила ряд инновационных технологий, включая архитектуру Mooncake на основе KVCache, механизм MoBA и другие решения для повышения эффективности обработки длинных текстов и мультимодальных данных. Модель демонстрирует высокую производительность при сниженных затратах.

Kimi K3: команда «Месяц тёмной стороны» и прорыв в больших языковых моделях

27 июля компания «» («Месяц тёмная сторона») полностью открыла исходный код модели Kimi K3 2.8T. В разработке Kimi K3 участвовало 401 человек. Текущая оценка «» — 315 млрд долларов (около 2100 млрд юаней). В компании около 300 сотрудников, средний возраст — менее 30 лет, 80 % — мужчины. Каждый сотрудник в среднем «несёт» оценку в 7 млрд юаней. В компании 5 основателей, каждый напрямую взаимодействует с 40–50 сотрудниками. Структура организации плоская — без должностей, KPI и ведомственных барьеров.

Ян Чжилин , один из ключевых фигур, любитель рок-музыки, назвал залы заседаний в честь групп Rolling Stones, Nirvana, Radiohead, а членские пакеты Kimi — с использованием музыкальных терминов (Adagio, Allegro). В начале 2025 года на совещании один из сотрудников выдвинул радикальное предложение, и Ян Чжилин отреагировал ещё радикальнее — решил отказаться от K1 и перейти к работе над K2.

Среди ключевых разработчиков Kimi K3 — Чжоу Синьюй , один из соучредителей «» и руководитель команды алгоритмов. Ранее он работал в Kuangshi над производством алгоритмов и исследованиями мобильных моделей, совместно с Чжан Сянъюй был основным автором ShuffleNet. Специализация Чжоу Синьюя — масштабирование алгоритмов для больших моделей: преобразование передовых лабораторных алгоритмов в системы массового производства с высокой эффективностью и низкой стоимостью.

Удынь Синь — один из соучредителей «», эксперт в области ИИ, специалист по глубокому обучению, компьютерному зрению (CV) и базовым архитектурам больших языковых моделей (LLM). Он окончил факультет компьютерных наук Университета Цинхуа, затем учился в Университете Карнеги-Меллона (CMU). Работал инженером-исследователем в лаборатории Meta* AI (FAIR), где внёс вклад в ряд ключевых технологий в области компьютерного зрения. Является одним из основных создателей и разработчиков Detectron2 — проекта, ставшего базовой платформой для тысяч проектов в области визуального моделирования и обнаружения объектов. В 2018 году совместно с Хэ Каймином опубликовал работу о Group Normalization, которая была номинирована на премию ECCV 2018 (Best Paper Honorable Mention). Участвовал в разработке MoCo v1. В «» участвует в оптимизации архитектуры и эффективности обучения больших моделей, представлял вклад Kimi в глобальную открытую инфраструктуру на всемирном съезде разработчиков PyTorch. Разобрал на AMA в Reddit преимущества гибридной архитектуры Kimi K3 KDA в сочетании с NoPE MLA — подтвердил, что такая архитектура экономит вычислительные ресурсы и работает быстрее в предварительном обучении и обучении с подкреплением.

Чжан Юйтао — один из соучредителей и CTO «». Внёс значительный вклад в эволюцию Kimi в части обработки длинных текстов, сложных рассуждений и выполнения задач Agent. До прихода в «» добился ряда отраслевых достижений в области графов знаний и объединения гетерогенных данных. Руководил разработкой аналитической платформы больших данных AMiner — платформы, которая сейчас обслуживает миллионы учёных по всему миру. На техническом саммите в июле 2026 года обозначил три этапа инженерной эволюции отрасли: 2023 год — эпоха Prompt («как задавать вопросы»), 2024 год — эпоха Context («предоставление достаточного объёма информации»), 2026 год — этап Harness. Сейчас руководит командой по решению задачи построения среды выполнения, при которой AI может самостоятельно исправлять ошибки (Agent).

Сюй Синьжань — заместитель директора по инженерным вопросам и руководитель инфраструктуры AI в Moonshot AI. Вместе с командой разработал архитектуру вывода Mooncake для Kimi на основе KV Cache — решение позволило разделить этапы Prefill и Decode и снизить нагрузку на память и I/O при работе с очень длинными контекстами; работа получила награду за лучшую статью на FAST 2025. Один из ключевых авторов механизма MoBA (смешанное блоковое внимание) — за счёт разделения внимания на уровне блоков удалось существенно снизить затраты и повысить эффективность для Kimi. Участвовал в разработке открытого проекта Moonlight и его оптимизатора Muon: применение матричной ортогонализации вместо AdamW снизило затраты вычислительных ресурсов при распределённом обучении моделей с триллионами параметров. Выступал на GOSIM China.

Хэ Вэйжань — руководитель системы вывода Moonshot AI, основной автор лучшей статьи на FAST 2025, ключевой технический специалист по внедрению архитектуры вывода длинных текстов Kimi. Его имя фигурирует в статьях по шести поколениям технических решений: от Kimi k1.5, Kimi-VL, K2 до Kimi Linear, Kimi-Audio, а также по MoBA, Muon, AttnRes. Цель работ — повышение эффективности за счёт системного проектирования.

KVCache разделённая архитектура Mooncake позволяет увеличить нагрузку на запросы Kimi более чем на 75 % без изменения масштаба вычислительных ресурсов за счёт глобального повторного использования кэша и детализированной маршрутизации. В 2024 году на конференции QCon сообщили, что благодаря этой архитектуре и оптимизации единичная стоимость кластера рассуждений Kimi за год снизилась более чем в 20 раз. В феврале 2025 года статья о Mooncake получила премию Эрика Ридела за лучшую статью на конференции FAST — одну из высших наград в области систем хранения данных. Архитектура уже стабильно работает в производственной среде Kimi на тысячах узлов, ежедневно обрабатывая сотни миллиардов токенов пользовательских запросов.

Команда внесла официальное решение для совместимости в сообщество vLLM для решения проблемы отказа традиционного префиксного кэша в гибридной архитектуре KDA+MLA. Для запросов длиной в миллион токенов используется стратегия маршрутизации с учётом кэша для максимизации эффективности повторного использования кэша. Стоимость рассуждений K3 составляет 38 % от стоимости Claude Fable 5.

Ду Юйлунь отвечает в «Лунной тени» за предварительное обучение (Pretraining) и масштабирование (Scaling). Является соавтором статей «Attention Residuals», «MoBA (смешанное блоковое внимание)» и «Muon is Scalable for LLM Training». Его работа направлена на разделение внимания на уровне блоков и реструктуризацию потока обучения для решения проблемы затухания сигналов в сверхглубоких сетях и повышения эффективности распределённого обучения моделей размером в триллион.

Чжан Юй — главный архитектор в «Лунной тени», специализируется на разработке эффективных, масштабируемых и аппаратно-совместимых архитектур для больших языковых моделей. Модель Kimi Linear впервые применила линейное внимание для сверхдлинных контекстов, обеспечив значительный рост эффективности.

Лэй Гокунь — один из самых продуктивных исследователей в команде Kimi, автор более десяти статей. Создал один из крупнейших в мире наборов данных для машинного чтения — RACE (на основе китайских экзаменационных заданий по английскому). Его статья «Explicit factor models for explainable recommendation» получила в 2024 году награду SIGIR Time-Tested Award.

Го Хайцин (Haiqing Guo) — один из первых ключевых разработчиков в команде Kimi, участвовал в разработке Kimi k1.5, Kimi K2, Kimi K3, в создании архитектуры AttnRes (один из двух ключевых инновационных элементов Kimi K3).

Чэнь Гуанъюй — самый молодой исследователь в «Месяц в тени», родился в 2009 году, в 17 лет привлёк внимание Илона Маска (Elon Musk), который в X выразил восхищение его работой.

Дуо Аньан — один из ключевых разработчиков мультимодальной системы «», соавтор работы «Attention Residuals» для Kimi K3. Механизм Attention Residuals повысил эффективность масштабирования моделей в 1,25 раза. Год назад Дуо Аньан не знал, что такое Transformer; через 7 недель после того, как его заметила стартап-компания из Силиконовой долины, он вошёл в основную исследовательскую группу Kimi. В первую неделю работы выиграл Kimi 48-часовой хакатон. В 2025 году выпустил в открытом доступе мультимодальную модель Kimi-VL, разработал кодировщик MoonViT, поддерживающий ввод с сверхвысоким разрешением и контекст длиной 128K — это позволило Kimi понимать мультимодальные длинные тексты (длинные видео и документы).

Боуэн Ку (Bowen Qu / Brian Qu) работает в команде по пост-обучению моделей. Занимается многомодальными большими моделями: многомодальным усиленным обучением, визуально-языковыми моделями, AI-агентами, оценкой качества AIGC-контента. Участвовал в проекте Kimi-K2.5 (параметры: 1T, активированные параметры: 32B) — многомодальном AI-агенте от «Месяц тёмной стороны».

Лу Эньчжэ (Lu Enzhe) — один из ключевых создателей эффективной вычислительной системы Kimi. В феврале 2025 года в качестве первого автора опубликовал работу о механизме смешанного блочного внимания MoBA: перенёс идею выбора экспертов из MoE в слой внимания — модель при обработке запросов использует только релевантные блоки контекста. При 95 % разреженности результат сопоставим с полным вниманием; ускорение: в 6,5 раз для миллиона токенов, в 16 раз для десяти миллионов токенов. Статья конкурировала с работой DeepSeek NSA, была принята в NeurIPS 2025 как Spotlight-статья, а до этого год использовалась в производственной среде Kimi.

Ван Хужи — исследователь в Moonshot AI (компания «Месяц — тёмная сторона»), один из наиболее часто упоминаемых авторов в технических отчётах серии Kimi. Его имя фигурирует в технических документах компании с января 2025 года (k1.5) до июля 2026 года (Kimi K3). Охватывает такие направления, как визуал, аудио, архитектура внимания, оптимизаторы обучения, флагманские модели, система управления рисками в ИИ.

Мао Шаогуан — ключевой специалист по технической линии Kimi Agent, участвовал в разработке четырёх поколений флагманских продуктов: K2, K2‑Thinking, K2.5, K3. Участвовал в поставке первого Agent-продукта Kimi — Kimi Researcher: обучение через эндо-энд-форс-реинфорсмент-лёрнинг, среднее выполнение задачи — 23 шага, сканирование 206 веб-страниц, генерация отчётов с нормативными ссылками, результат на HLE — 26,9 % (рекорд на тот момент).

Цинь Жоюй (Ruoyu Qin) — аспирант лаборатории MADSys в университете Цинхуа, изучает высокоэффективные системы машинного обучения. Совместно с командой Moonshadow разработал Mooncake — архитектуру вывода на основе KVCache: разделяет этапы Prefill и Decode на отдельные кластеры, объединяет незадействованные ресурсы GPU-кластера (CPU, память, SSD) в распределённый пул кэша. Mooncake получил премию Erik Riedel за лучшую статью на конференции FAST 2025. Цинь Жоюй — первый автор статьи Seer, принятой на OSDI 2026: решает проблемы производительности rollout через разделение rollout, контекстно-зависимое планирование и технику группового спекулятивного декодирования, повышает пропускную способность rollout в 2,04 раза, снижает задержки в длинных хвостах на 72–94 %.

Юань Эньмин — ключевой член команды Kimi («Месяц тёмная сторона»), работает в областях вычислительной биологии, рекомендательных систем и больших моделей. Участвовал в технической итерации нескольких поколений основных моделей Kimi.

Сюй Вэйсинь — исследователь в Moonshot AI («Месяц тёмная стороны»), его исследования охватывают базовую архитектуру больших моделей, эффективные механизмы обучения и оптимизацию механизма внимания. Глубоко участвовал в разработке нескольких поколений основных моделей Kimi и базовых технологий, его публично заявленные проекты охватывают полный цикл итерации продукта от k1.5 до K3.

Ду Чэньчжуан — ключевой исследователь «» (отвечает за обучение с подкреплением и расширение возможностей вывода). Участвовал в статье Kimi k1.5: Scaling Reinforcement Learning with LLMs, в отчётах по Kimi K2 и K2.5, в разработке Kimi-VL (улучшение восприятия сложных изображений, диаграмм и визуальной информации реального мира и мультимодального глубокого вывода).

Яньру Чен — ключевой исследователь «» («Месяц тёмной стороны»), специализируется на базовой архитектуре больших моделей, технологиях длинных текстов, оптимизации вычислительной мощности и мультимодальных инженерных решениях. Соавтор статьи «Attention Residuals», участвовал в перестройке потока информации в глубоких направлениях больших моделей, решил проблемы низкой эффективности обучения сверхглубоких сетей и блокировки потока информации. Соавтор MoBA (смешанного блокового внимания), руководил разработкой базовых механизмов Kimi, решил проблему чрезмерного потребления вычислительной мощности при работе с супердлинным контекстом в миллионах токенов на этапах предобучения и вывода.

Лю Шаовей — ключевой сотрудник лаборатории MADSys в Университете Цинхуа, ведущий эксперт команды базовой инфраструктуры «». Отвечает за низкозатратный вывод триллионных моделей, нативное квантование и проектирование топологии крупномасштабных распределённых вычислений. На Reddit LocalLLaMA опубликовал технический разбор «Kimi infra team: Quantization is not a compromise, it's the next paradigm», раскрывающий нативное квантование INT4 в моделях Kimi K2 и K2.5.

Чэнь Гуандуо — ключевой исследователь команды Infra в «». Разработал и опубликовал Oasis — предложил оптимальный непересекающийся фильтр обучения с разделением, который решает проблему узкого места индекса при масштабных запросах к базе данных. Опубликовал Gar — метод «генерации и сортировки», который значительно повысил точность преобразования сложных намерений человека в SQL-запросы (Text-to-SQL). В марте 2025 года присоединился к (Юэ Чжи Ань Мянь) в качестве ключевой силы команды Infra. Является одним из основных авторов моделей Kimi K2 и Kimi K2.5. Опубликовал статью Ce-lora с методом высокоэффективной микронастройки LoRA — технология снижает потребление видеопамяти и вычислительные затраты при микронастройке параметров больших моделей, увеличивает пропускную способность обучения на уровне Infra. Участвовал в разработке и опубликовал архитектуру Kimi Linear — линейная архитектура внимания, которая существенно снижает сложность вычислений для длинных текстов, сокращает использование KV Cache до 75 %, обеспечивает 6-кратное увеличение пропускной способности декодирования при длине текста в миллион символов. Является одним из соавторов Attention Residuals.

Ссылка на технический отчёт: Ресурс «» (:) предлагает ознакомиться с материалами мировых AI-конференций: выступлениями экспертов, полными отчётами о конференциях, разбором популярных статей, интервью с новыми учёными.


* Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена на территории РФ.

// оригинал
Leiphone ↗ Читать оригинал
6 просмотров
// поделиться Telegram VK