DeepDigest
Leiphone · · ~4 мин

GLM-5.3-Flash и Kimi K3: конкуренция моделей и линейное внимание

Китайские модели GLM-5.3-Flash и Kimi K3 демонстрируют технологическое сближение в обработке длинных текстов. Обе используют линейное внимание KDA с параметром gate_lower_bound = –5 для стабильности обучения. Конкуренция в сфере больших моделей смещается в сторону оптимизации операторов и числовых границ.

LLM
GLM-5.3-Flash и Kimi K3: конкуренция моделей и линейное внимание

В сфере больших языковых моделей наблюдается острая конкуренция — компании оптимизируют вычислительные операторы, числовые границы и детали обучения. Особенно ярко это проявляется на примере китайских моделей «» и «Kimi».

Китайская модель GLM-5.3-Flash от компании « AI» в первый день запуска заняла первое место в рейтинге вызовов OpenRouter. В основе модели — гибридная архитектура: она объединяет механизм разреженного внимания NSA от DeepSeek, механизм линейного внимания от Kimi и технологию mHC от DeepSeek.

Исследователь Чэнь Гуанъюй из «» провёл сравнение кода Kimi K3 и GLM-5.3-Flash. Он обнаружил, что обе модели используют линейное внимание KDA и имеют одинаковый параметр gatelowerbound (–5).

Линейное внимание KDA отличается от других подходов тем, что не сохраняет полный буфер KV. Вместо этого оно использует матрицу фиксированного размера для сжатия исторической информации. Компонент «забывающие ворота» (gate) контролирует уменьшение старой информации — благодаря этому объём используемой видеопамяти остаётся постоянным, независимо от длины входящего текста.

Параметр –5 в KDA играет ключевую роль: он обеспечивает «длинную память» и стабильность обучения. Выбор этого значения не случаен — он обусловлен узким диапазоном стабильных числовых значений в линейном внимании. Даже разные команды в итоге приходят к одному и тому же значению.

При увеличении длины контекста из‑за множества умножений значения либо стремятся к нулю, либо бесконтрольно растут. Это может привести к ошибке NaN и сбою обучения. Для решения этой проблемы Ян Сунлин из Harvard предложил модель GLA (Gate Linear Attention) с концепцией ограничения «нижнего предела» для затухания состояния — чтобы не допускать приближения значений к 0.

Команда «Месяц тёмной стороны» (Kimi) на основе GLA разработала архитектуру KDA. Их цель — работать с контекстом в 1 000 000 слов. Однако на практике они столкнулись с физическими ограничениями чипов. В крупномасштабном предобучении обычно используют fp16 или bf16. Их динамический диапазон слишком узок для многократных умножений в линейном внимании — это провоцирует ошибки NaN и потери вычислительных ресурсов.

Команда Kimi установила gatelowerbound = -5 в своём ядре FlashKDA CUDA. После активации это соответствует примерно 0,67 % сохранения старой информации. Даже если модель «забывает» часть данных, 0,67 % информации всё равно остаётся сохранённой.

Значение –5 было найдено эмпирическим путём. Исследования показали, что при значении –3 (≈5 % сохранения) возникает перегрузка сети, взрыв градиентов или путаница контекста. А при –8 (≈0,03 % сохранения) модель демонстрирует сильную «амнезию» и теряет ключевые данные в длинных текстах.

В Kimi K3 используется гибридная архитектура: линейное внимание для сжатия памяти в длинном контексте и Softmax-внимание для сложной логики. Значение gatelowerbound = –5 заложено в модель изначально — оно стало результатом тысяч экспериментов при предобучении на тысячах GPU. Эти детали описаны в публичном техническом отчёте.

В конфигурации GLM-5.3 Flash от «Чжипу» тоже используется gatelowerbound = –5. По предположению Чэнь Гуанъюя, это может быть «внедрением на лету» — продуманной инженерной стратегией. На позднем этапе предобучения можно добавить ограничивающие условия, а затем продолжить обучение на сниженной скорости без сброса весов. Такой подход позволяет модели быстро соответствовать проверенным отраслевым практикам и экономить вычислительные ресурсы.

Разработчик Oliver Sieberling считает, что подобные изменения являются «неинвазивными». Добавление нижнего предела ограничивает экстремальные значения, но не меняет цели обучения модели. Это скорее защитный механизм.

Однако есть и риски. Например, риск скрытого смещения распределения. После миллионов шагов предобучения у модели формируется поведение, допускающее очень низкие значения «забывающих ворот». Внезапное установление нижнего предела меняет базовые правила работы. Это может привести к «хроническому отравлению» (накоплению остаточной информации) в сценариях с очень длинными текстами (более 500 тыс. слов) и вызвать логические ошибки.

DeepSeek пошёл другим путём. Компания не использует схему управления с параметром –5 на основе Delta Rule. Вместо этого она развивает собственные технологии: MLA (смешанное скрытое внимание) и NSA (нативное разреженное внимание). DeepSeek применяет низкоранговое сжатие и оптимизацию аппаратных операторов, чтобы обеспечить числовую стабильность длинных последовательностей.

В эпоху моделей с расширенным выводом (после появления o1 и DeepSeek-R1) модели генерируют десятки тысяч токенов «цепочки размышлений» (CoT). При использовании традиционного Transformer с квадратичным ростом затрат на вычисления возникают проблемы с памятью. Те, кто сможет обеспечить качество работы с длинными текстами при линейных затратах, получат максимальную прибыль в эпоху рассуждений.

Параметрическое «столкновение» — не доказательство копирования, а следствие технологического сближения в ходе продвижения в сложные технические области. Конкуренция среди компаний с большими моделями смещается на оптимизацию операторов, числовые границы, детали обучения. Помимо борьбы за параметры, идут сражения за вкус, эффективность, инновации — признак зрелости отрасли. Лучшие практики, прошедшие проверку в кластерах из множества видеокарт, быстро становятся отраслевой инфраструктурой. Китайские большие модели быстро приближаются к ведущим закрытым моделям мира в обработке длинных текстов и сверхдешёвом выводе. В условиях экстремального давления на вычислительные мощности ведущие китайские специалисты быстро приходят к единым решениям, постоянно приближаясь к физическим пределам.

Ссылки:

<<<CODE_BLOCK_N>>>
<<<IMG_N>>>

// оригинал
Leiphone ↗ Читать оригинал
9 просмотров
// поделиться Telegram VK