DeepDigest
Leiphone · · ~5 мин

Kimi K3 от Moonshot: прорыв в создании визуальных эффектов на фронтенде

Модель K3 от Moonshot стала первой открытой моделью размером 2,8T. Она включает инновации KDA и AttnRes, которые оптимизируют вывод и обучение. Модель использовалась для создания впечатляющего визуального эффекта «спиральной капсулы» на фронтенде с затратами всего 129 юаней.

Kimi K3 от Moonshot: прорыв в создании визуальных эффектов на фронтенде

Компания Moonshot выпустила первую открытую модель размером 2,8T — K3. Её оценка составляет около 200 млрд долларов, за полгода компания привлекла 39 млрд долларов. Ядро команды насчитывает около 80 человек.

K3 — значимый шаг в доступности мощных моделей: ранее модели такого размера были доступны только внутри крупных компаний. Максимальный открытый размер модели до K3 составлял 1T (предыдущий рекорд — K2). Теперь исследователи могут изучать K3, а разработчики — дорабатывать и использовать её в продуктах без дополнительных согласований и платежей.

Ключевые инновации K3 — KDA (Kimi Delta Attention) и AttnRes. KDA ограничивает обращение к исходному тексту: в основном используется краткая сводка, а не весь текст. В архитектуре применяется соотношение 3:1 — три слоя с линейным вниманием и один с полным вниманием. В модели размером 48B KV cache снижается до 75%, а скорость декодирования при длине в 1 млн токенов увеличивается в 6 раз.

AttnRes (внимание с остаточными связями) заменяет стандартный подход с фиксированным весом 1 для суммирования выходов слоёв. Для каждого слоя вводится собственный «редактор», который на основе обучения определяет, какую информацию брать из предыдущих слоёв. На обучении в 1,4T токенов AttnRes достигает результатов, сопоставимых с базовой линией, использующей на 1,25 больше вычислительных ресурсов. Эффективность обучения повышается примерно на 25%.

Требования к развёртыванию K3 — 64 и более ускорительных карт в supernode. Цена API для K3: 3 доллара за ввод, 15 долларов за вывод на миллион токенов. Для сравнения: для K2.7 цена составляла 0,95 доллара за ввод и 4 доллара за вывод.

В архитектуре K3 применяется логика плотности через ограничения: 2,8 трлн параметров, при этом каждый раз активируется 16 из 896 экспертов. С этапа пост-тренировки используются MXFP4 для весов и MXFP8 для активаций в рамках квантования.

Модель K3 использовалась для создания визуального эффекта «» (спиральной капсулы из «Наруто»). Затраты на проект составили 129 юаней (около 19 долларов). Проект прошёл 26 итераций, в ходе которых были исправлены различные ошибки — например, проблемы с поведением сферы, зацикливанием звуковой обратной связи, неправильным позиционированием при обрезке портрета и др.

Для эффекта втягивания текста в шар в проекте K3 реализованы следующие шаги:
1. Текст на странице автоматически разбивается на отдельные символы с помощью TreeWalker, каждый символ помещается в отдельный span (при этом пропускаются теги <rt> — японские знаки произношения).
2. Каждый символ разбивается на случайные фрагменты с помощью рекурсивного полуплоскостного разрезания: clipHalf определяет положение вершин многоугольника относительно линии разреза, shardPolys выбирает для дальнейшего разрезания самую большую по площади часть. В итоге получается набор непрерывных непересекающихся случайных многоугольников, которые применяются к DOM через CSS clip‑path.
3. Для наклонно расположенных слов при разбиении и клонировании фрагментов учитывается вращение элементов: последовательно считываются углы вращения из CSS matrix всех родительских элементов и компенсируются при клонировании фрагментов.

В проекте одновременно анимируются 4 типа элементов: фрагменты текста, листья, воздушные потоки от шара, пыль в окружающей среде. Все они используют единую формулу потока: один член циркуляции определяет скорость вращения вокруг шара, другой радиальный член — скорость втягивания внутрь. Оба параметра уменьшаются с расстоянием — чем ближе к шару, тем быстрее вращение и сильнее втягивание. При этом каждый элемент имеет собственный коэффициент, из‑за чего их поведение различается.

При движении фрагменты растягиваются в направлении движения: сначала поворачиваются в сторону скорости, растягиваются в этом направлении и сплющиваются в перпендикулярном, затем возвращаются в исходное состояние. Это метод создания эффекта размытия при движении — чем выше скорость, тем сильнее растяжение.

21 июля в 20:24 (версия a049a36) внесены изменения для повышения реалистичности движения шара — выбран подход «турбулентный воздушный поток с физической реконструкцией»: турбулентность преобразована из визуального симуляционного в реально управляемый полем скорости. Функция текстового втягивания была придумана на следующий день и реализована с первой попытки. Благодаря преобразованию турбулентности в физическое поле фрагменты, листья и воздушные потоки могут использовать единую систему потоков.

В официальной документации указано: при многоэтапных диалогах и вызовах инструментов необходимо полностью передавать обратно API‑ответ assistant message, включая reasoning_content, иначе качество может резко колебаться. При переключении между моделями также могут возникать проблемы.

На тесте Terminal-Bench 2.1 официальный результат Moonshot — 88.3 (Kimi Code), при повторном тестировании в единой среде Artificial Analysis результат K3 — 85.0. Разница в 3,3 балла может быть связана с различиями в среде Harness и способами обработки истории размышлений в разных каркасах.

Проект реализовал полный трёхстадийный автомат: статичное состояние, втягивание, возвращение в исходное состояние (index.html, стр. 1419, в сочетании со стр. 1432 stepReturn). После отпускания одновременно происходят:
* возвращение фрагментов к исходному месту с затуханием по кривой замедления;
* упругое возвращение деформированных, но не разрушенных элементов;
* повторное затухание и объединение элементов, поглощённых шаром.

После завершения состояние обнуляется, страница возвращается к исходному виду.

В процессе разработки проекта было удалено 6 версий. Произведены микронастройки: предел объёма увеличен с 2,4 до 2,9 раз, структура изменена на трёхслойную (ядро, средний слой, тонкая оболочка), внешний слой оболочки утончён. K3 демонстрирует способность удалять элементы (например, белую вспышку, световой круг, утончать слой оболочки) без повреждения ядра системы.

Подход K3 к визуальному представлению (увеличение внешнего размера при сокращении внутреннего ядра и утончении оболочки) соответствует человеческим эстетическим и перцептивным ожиданиям, в отличие от типичного подхода добавления визуальных эффектов (свет, кольца, вспышки, частицы).

Рассматриваются ограничения в реализации визуальных эффектов на фронтенде: эпоха Flash (закрытый плагин с таймлайном и кадрами) и эпоха CSS‑анимаций (transition, @keyframes, transform с поддержкой браузера и GPU‑ускорением, но ограничением только на интерполяцию). Основная сложность — достижение согласованности эффектов: разные анимации (вращение частиц, полёт листьев, движение текста) не должны выглядеть разрозненно — все элементы должны подчиняться единому физическому полю.

В проекте использовались модели K3 и Fable 5. Ключевые факторы успеха — не сложность промпта, а чёткое понимание пользователем своих целей и управление моделью.

Проект доступен по ссылке:

Можно переключать состояние «спиральных капсул» с помощью цифр 123. Доступ к материалам глобальных AI‑конференций: выступления экспертов, полные тексты докладов, разборы популярных статей, интервью с научными новичками. Для доступа нужно отсканировать QR‑код или нажать «чтение оригинала» и подписаться на раздел.

В официальных бенчмарках K3 используются ограниченные по производительности H20 от Nvidia. Модели были открыты за 8–9 месяцев до K3, с публикацией статей и кода, проверка выполнена на модели 48B (Kimi 48B на Hugging Face).

<<<CODE_BLOCK_N>>>
<<<IMG_N>>>

// оригинал
Leiphone ↗ Читать оригинал
5 просмотров
// поделиться Telegram VK