DeepDigest
Leiphone · · ~5 мин

Qwen3.8-27B от Alibaba: тестирование производительности и работы с Agent

Alibaba выпустила модель Qwen3.8-27B с открытым исходным кодом. Тестирование показало высокую производительность модели, однако выявлены проблемы с адаптацией Agent. Модель подходит для задач, где важны качество, контролируемость и приватность, но требует строгого ограничения токенов и шагов выполнения.

Qwen3.8-27B от Alibaba: тестирование производительности и работы с Agent

Компания Alibaba 14 августа 2026 года открыла исходный код модели Qwen3.8-27B. Модель имеет следующие характеристики: 27B dense, лицензия Apache 2.0, исходный контекст — 262K токенов с возможностью расширения до 1 млн, поддержка визуального понимания, по умолчанию включён режим мышления. После низкобитной квантизации модель может быть сжата до нескольких десятков ГБ в формате GGUF.

Тестирование модели проводилось на сервере с A100 GPU и охватывало три аспекта: стандартное развёртывание, квантованное развёртывание и сценарии работы с Agent. В рамках стандартного развёртывания сравнивались фреймворки vLLM, SGLang и Llama.cpp. Использовались задачи A1–A7 — комбинация логических задач, проверки временных последовательностей, логического вывода по таблицам, следования точным инструкциям на китайском, непринуждённого диалога, написания новостей и анализа результатов экспериментов.

Результаты стандартного развёртывания оказались следующими:
* vLLM показал наиболее стабильные результаты (14/14 по 7 задачам);
* SGLang и Llama.cpp не допустили ошибок в направлении, но выявили проблемы с выполнением ограничений (например, SGLang неполно проанализировал разные стандарты в задаче A3, а в задаче A4 ответ не соответствовал требуемому диапазону в 18–28 иероглифов);
* Llama.cpp отличается низким порогом входа.

В группе квантованного развёртывания использовался фреймворк Llama.cpp, тестировались версии от 2 до 16 бит. Изучались размер файлов весов модели, скорость генерации и качество ответов. По качеству:
* 3bit, 4bit, 5bit и 6bit — 14/14 на 7 задачах;
* 2bit и 8bit — 13/14 (ошибки в A2 — проверка временной шкалы);
* 16bit — 13/14 (ошибка в A6 — контроль объёма текста).

По скорости квантования:
* 2bit (IQ2_XXS) — 47,89 token/s;
* 3bit — 44,68 token/s;
* 4bit — 39,45 token/s;
* 5bit — 36,11 token/s;
* 6bit — 33,12 token/s;
* 8bit — 30,79 token/s;
* 16bit — 23,50 token/s.

По использованию видеопамяти при квантовании:
* 2bit — около 13,8–14,1 GB;
* 3bit — около 15 GB;
* 4bit — около 17 GB;
* 5bit — около 19 GB;
* 6bit — около 20 GB;
* 8bit — около 23 GB;
* 16bit — около 34 GB.

При стандартном развёртывании vLLM и SGLang показали среднюю пропускную способность более 40 токенов/с: vLLM — 41,77 token/s, SGLang — 40,06 token/s, Llama.cpp — 23,50 token/s. При этом vLLM на двух A100 использует около 39,3 GB видеопамяти, GPU-использование — 100%; SGLang — 38–40 GB, GPU-использование около 98%; Llama.cpp — около 34 GB, GPU-использование 46–53%.

В сценарии работы с Agent модель интегрировали с DeepSeek Harness, добавили задачи A8 (обзор статей) и A9 (генерация 3D‑сайтов). Фиксировались показатели: процент выполнения задач, оценка качества, потребление токенов, количество запросов, общее время выполнения.

Qwen3.8-27B получил 18/18 (100%) в агент‑тесте на DeepSeek Harness, тогда как DeepSeek-V4-Flash-0731-Q4 — 14/18 (77,78%). При этом DeepSeek быстрее, но менее стабилен в задачах, требующих строгой проверки. Qwen даёт более сдержанные ответы, особенно в вопросах таблиц, границ фактов и причинно-следственных связей в экспериментах.

В задаче A9 обе модели должны были сгенерировать 3D‑сайт « · ». Qwen создал страницу с основными элементами (озеро Куньмин, гора Ваньшоу, павильон Фусян, мост, кнопки навигации, переключение дневного и сумеречного освещения), поддерживает перетаскивание, вращение, масштабирование колёсиком мыши, переключение камер. DeepSeek сохранил заголовок, кнопки достопримечательностей и интерактивные подсказки, но основная область пуста, основные элементы парка не визуализированы.

Затраты при выполнении 9 Agent‑задач Qwen3.8-27B:
* 13 995 350 токенов (входных — 13 718 510, выходных — 276 840);
* 197 запросов;
* 22 564,37 секунды (около 6 часов 17 минут).

На создание 3D‑сайта ушло 11 533 959 токенов. При этом DeepSeek израсходовал 956 630 токенов (входных — 927 401, выходных — 29 229), общее время — 1 343,75 сек (около 22 мин), количество запросов — 87.

Qwen превышает DeepSeek по общему количеству токенов в 14,6 раза, по общему времени — в 16,8 раза, по выходным токенам — в 9,5 раза. В задаче A9 Qwen расходует 11 533 959 token, 124 запроса LLM и 18 639,20 секунды; DeepSeek на ту же задачу — 161 019 token, 15 запросов и 540,95 секунды.

Среди проблем Qwen3.8-27B можно выделить:
* излишнюю сложность разбиения сложных задач;
* слишком амбициозные цели на каждом шаге;
* многократное повторение контекста, из‑за чего много времени тратится впустую.

Модель должна уметь разбивать задачу на мелкие части, распознавать бесконечные циклы и своевременно останавливать простаивание, иначе растут затраты времени и вычислительных ресурсов. Qwen3.8-27B подходит для развёртывания в Agent, но нужно ограничивать сценарии применения. Для достижения высокой пропускной способности и использования GPU лучше подходят vLLM и SGLang; Llama.cpp предпочтительнее, если важны простота использования, поддержка квантованных версий и совместимость с локальным оборудованием.

Оптимальный баланс между размером файла, скоростью и качеством достигается при квантовании от 3 до 6 бит; 2 бита — самый быстрый и экономный вариант, но имеет ограничения; 8 и 16 бит не гарантируют отсутствия проблем.

Qwen3.8-27B (лицензия Apache 2.0) может конкурировать с Claude Opus 4.6 Max, в отдельных тестах превосходит его. Улучшения Qwen3.8-27B по сравнению с Qwen3.6-27B заметны в задачах, приближённых к реальному рабочему процессу: Terminal Bench 2.1, SWE-bench Pro, NL2Repo-Bench, DeepSWE и QwenSWEBench. Повышения в CoWorkBench, JobBench и Agents' Last Exam объясняют, почему Qwen3.8-27B в сценариях Agent стремится довести задачу до конца. IFBench вырос с 69,1 до 79,5 — это говорит о сильных базовых возможностях в соблюдении форматов, границ и сложных ограничений. Показатели GPQA Diamond, HLE, OSWorld-Verified, WebArena-Verified, AndroidWorld, MathVision, OmniDocBench, RealWorldQA подтверждают сохранение Qwen3.8-27B сильных способностей в научном рассуждении, обработке знаний, визуальном понимании и работе с компьютером.

Qwen3.8-27B позиционируется как локальный открытый модель для coding, professional work, research и long-horizon agentic tasks. Однако модель не обязательно подходит в качестве основы для Agent — требуется анализ данных после подключения к DeepSeek Harness. Qwen3.8-27B — мощный открытый базовый компонент, требующий инженерных ограничений; оптимально использовать в сценариях, где важны качество, контролируемость и приватность.

<<<CODE_BLOCK_N>>>
<<<IMG_N>>>

// оригинал
Leiphone ↗ Читать оригинал
7 просмотров
// поделиться Telegram VK