На конференции IJCAI 2026 исследователь из ETH Zürich Цинь Хаотун представил доклад «Extreme Quantization for Efficient LLMs». Он затронул проблему внедрения больших языковых моделей (LLM) в малые устройства — например, в мобильные телефоны, автомобили, роботы и медицинские приборы. Основная трудность заключается в значительном разрыве между вычислительными возможностями больших моделей и ёмкостью аппаратной памяти — он достигает 20 раз.
Цинь Хаотун и его команда считают, что полагаться на закон Мура или выпуск новых чипов для решения проблемы бесперспективно. Вместо этого нужно менять способ представления данных в моделях. Исследователи предложили метод посттренировочной квантизации (PTQ) — сжатие больших LLM до 1 и 2 бит без повторного обучения. Команда уже известна работами BiLLM и SqueezeLLM.
Команда Цинь Хаотуна преодолела проблему резкого ухудшения качества модели при квантизации ниже 3 бит. Исследователи выявили две важные закономерности в весах больших моделей:
* большинство весов имеют колоколообразное распределение (большая часть сосредоточена около нуля, а хвост очень тонкий);
* чувствительность весов имеет «эффект длинного хвоста» — большая часть чувствительности сосредоточена в малой части «ключевых весов».
Метод BiLLM (2024) использует подход раздельной обработки. Сначала выделяются и сохраняются чувствительные характеристики. При этом обнаружено, что чувствительность имеет «наследственность» в слоях сети — она сосредоточена в небольшом числе каналов (Channels). Это позволяет сохранить Top-1 структурированные веса почти без дополнительного объёма памяти.
С помощью BiLLM за полчаса на одной видеокарте удалось выделить ключевые веса и квантизировать остальные до 1 бита — модель сохранила способность вести диалог. Для весов, соответствующих «колоколообразному распределению», вводится порог: веса делятся на две группы, для каждой из которых применяются отдельные стандарты квантования и коэффициенты масштабирования (Scale). Порог подбирается так, чтобы минимизировать ошибку квантования. В результате модель в среднем сжимается до ~1,08 бита на вес. Например, LLaMA-2 70B на WikiText-2 достигает перплексии 8,41. Для сравнения: ранние методы вроде GPTQ при 2 битах имеют перплексию выше 100. При сжатии до 1 бита модель остаётся работоспособной — генерирует связный и релевантный текст.
SqueezeLLM решает задачу оптимального распределения битов при фиксированном среднем числе битов (например, 2 бита). Традиционные подходы к 2‑битному квантованию имеют недостатки: «равномерная точность» даёт перплексию на GPU выше 150, а «мелкозернистое смешанное точность» требует дополнительных битмапов и нарушает механизмы чтения памяти. Решение SqueezeLLM — динамическое распределение битов группами по 128 весов. Такой подход обеспечивает эффективность вычислений на аппаратном уровне и точность выявления важных данных.
В SqueezeLLM реализованы два уровня обработки:
* межгрупповое распределение: группы сортируются по чувствительности, наиболее важным группам присваивается 1 бит, а у наименее важных бит изымается — среднее значение сохраняется на уровне 2 бит;
* внутригрупповая калибровка: калибровка на основе взвешенной чувствительности для сохранения критически важных весов.
На тесте WikiText при квантовании LLaMA 7B до 2 бит базовые методы (например, GPTQ) показывают перплексию на уровне сотен, а SqueezeLLM возвращает перплексию в нормальный диапазон. Кроме того, SqueezeLLM сохраняет высокую точность в тестах с визуальными языковыми моделями (VLM), в то время как 2‑битные GPTQ и AWQ выдают только бессмысленный текст.
Квантование позволяет значительно сократить объём памяти, занимаемый весами больших моделей:
* в формате FP16 модель LLaMA 7B занимает около 14 ГБ;
* при 4 битах объём сокращается до 3,3 ГБ;
* при 1 бите — до ~1 ГБ.
Три стандартных формата данных для квантования:
* равномерное квантование (например, INT4);
* неравномерное квантование (например, NF4);
* крайне низкобитное квантование (например, 1-bit).
При этом сохраняются серьёзные проблемы. Цинь Хаотун обозначил три главные проблемы при квантизации ниже 2 бит:
1. Скрытое повреждение сложных логических инструкций.
2. Отсутствие в аппаратуре нативных путей для работы с крайне низкой разрядностью.
3. Сложности с квантизацией больших активационных значений и KV Cache.
Три нерешённые задачи в области квантования:
1. Скрытые потери качества при генерации ниже 2 бит (в задачах следования инструкциям и выравнивания длинных текстов).
2. Отсутствие нативной поддержки INT2 или 1 бита в современных GPU.
3. Квантование активаций и KV Cache при сохранении точности.
PTQ сталкивается с проблемой падения точности: при 8 и 4 битах работает приемлемо, при 3 битах начинаются потери производительности, при 2 битах наблюдается «обвальное падение» (значение перплексии вырастает до сотен и тысяч), при 1 бите модель практически неработоспособна. Подход PTQ не требует обновления градиентов, достаточно небольшого набора данных для калибровки. На одной GPU сжатие можно выполнить за 30–60 минут.
К 2030 году рынок LLM достигнет 35 млрд долларов. Основная проблема — высокая вычислительная стоимость запуска моделей на мобильных устройствах, автомобилях, роботах и медицинских приборах. Количество статей по квантованию выросло с более чем 100 в 2010 году до более чем 3000 в текущем году.
Код работ полностью открыт. Создана группа для участников IJCAI 2026. В группе доступны информация о конференции (дедлайны подачи материалов, требования к формату, ход рецензирования), общение с коллегами, актуальные исследования и направления, поддержка во время конференции (навигация по месту проведения, обсуждение сессий и Keynote, сбор материалов с постеров, организация встреч). Чтобы вступить в группу, нужно отсканировать QR-код или добавить в контакты WeChat Qvv0909777, указав в примечании: IJCAI + учреждение/вуз + фамилия + направление. Также доступен спецпроект на платформе «» (WeChat:) с материалами с ведущих AI-конференций: презентации докладов, полные тексты, разборы статей, интервью с учёными. Чтобы подписаться на спецпроект, нужно отсканировать QR-код или нажать «».
<<<CODE_BLOCK_N>>>
<<<IMG_N>>>