DeepDigest
Leiphone · · ~5 мин

Qwen 3.8-Max: способность к долгосрочным задачам превосходит GPT-5.6

Модель Qwen 3.8-Max от Alibaba демонстрирует высокую завершённость проектов, но работает медленнее GPT-5.6. Она ориентирована на сложные долгосрочные задачи и способна самостоятельно выполнять полный рабочий цикл. В ходе тестирования модель успешно решала задачи по созданию 3D-сайтов и симуляции, однако столкнулась с проблемами производительности и исчерпанием квот.

Qwen 3.8-Max: способность к долгосрочным задачам превосходит GPT-5.6

3 августа 2026 года компания Alibaba официально выпустила модель Qwen 3.8-Max. Модель имеет 2,4 трлн общих параметров, около 950 млрд активированных параметров, контекст в 1 млн токенов. Qwen 3.8-Max поддерживает текстовые, кодовые и визуальные задачи. Планируется открытие весов Max и малой модели 27B.

В сравнении с GPT-5.6 модель Qwen 3.8-Max показывает более детальные результаты, однако уступает в эффективности. GPT остаётся предпочтительным выбором для быстрой итерации и создания дешёвых прототипов, тогда как Qwen 3.8-Max лучше подходит для сценариев, где требуется максимальная производительность вне зависимости от стоимости.

Ключевая особенность Qwen 3.8-Max — возможности long-term Agent. Модель способна в реальной среде вызывать инструменты, получать обратную связь, проверять результаты и продолжать доработки для завершения сложных задач. Она обучается в «реальном окружении RL»: читает проекты, вызывает инструменты, выполняет код, наблюдает за страницами, получает результаты тестов и корректирует действия на основе обратной связи. Цель обучения — научить модель выполнять полный рабочий цикл: планировать задачи, действовать, проверять результаты, выявлять проблемы и определять следующий шаг.

Qwen 3.8-Max опубликовал три компонента тренировочного процесса:
* развязывание среды (разделение задачи, рабочего пространства и Agent Harness на три независимых для расширения измерения);
* унифицированная система вознаграждений (единый механизм оценки: выполнение кода, соответствие текста требованиям, корректность визуальных результатов, разумность действий агента);
* онлайн‑баланс данных (динамическое выравнивание тренировочных данных по типам задач, сложности, рабочему пространству и Harness).

Примеры применения модели разнообразны: создание проекта oh‑my‑cli с нуля, 10‑дневное долгосрочное автоматическое программирование, 16‑дневная самостоятельная разработка, 125‑часовое воспроизведение научных работ, сотни раундов оптимизации чипов.

Для проверки способности к долгосрочному действию Qwen3.8-Max подключили через Qwen Code к локальной среде разработки — модель может считывать файлы, изменять проекты, выполнять команды и проверять результаты.

Одним из тестовых заданий стало создание с нуля интерактивного 3D‑сайта, демонстрирующего эволюцию больших языковых моделей. Требовалось использовать React, Vite и Three.js: представить разные компании‑разработчики моделей в виде галактики во вселенной, а прошлые модели — в виде планет на орбитах. Пользователь должен был иметь возможность вращать и масштабировать сцену, кликать по моделям для просмотра данных, отслеживать эволюцию моделей по временной шкале и использовать поиск для быстрого нахождения целей. Запрещено было использовать статические изображения, CSS‑псевдо‑3D или обычные круглые карточки вместо 3D‑сцены.

Проект был построен на WebGL, создан трёхмерный сценарий. Участвуют OpenAI, Anthropic, Google, Alibaba Qwen, DeepSeek, Moonshot AI/Kimi — 6 «галактик», 28 моделей распределены по орбитам. Реализованы: вращение и масштабирование, поиск моделей, фокусировка узлов, показ архивов, фильтрация по временной шкале (2022—2026). При смене временного периода меняется количество моделей в сцене, архивная панель синхронизируется с выбором.

Однако в ходе тестирования были выявлены проблемы:
* визуальные дефекты (низкое качество моделей в некоторых ракурсах, белые квадраты в сцене, отсутствие обратной связи при клике на основной шар);
* UI‑проблемы (наложение меток в плотных областях, крупные планеты занимают большую часть экрана при приближении, обрезка краевых меток);
* ограниченные вариации материалов планет.

Также обнаружены технические проблемы: размер JavaScript‑файла около 1 MB, предупреждение Vite о размере пакета; в автоматическом тестировании — жёсткое кодирование адреса страницы и количества моделей.

Проведено сравнение Qwen3.8-Max и ChatGPT 5.6 при итерации проекта. Модели получили одинаковые код и требования. Задачи включали оптимизацию 3D‑визуализации и атмосферы, добавление данных о новейших моделях, улучшение поиска и взаимодействия с временной шкалой, добавление функций «возврат к панораме», подсветка при поиске в полёте, углублённый архив.

GPT-5.6 выполнил задачу за 37 минут, расход Codex — около 6 %. Приоритет был отдан функциональности, результат — работающий MVP без детальной проработки. Qwen 3.8-Max уделил много времени доработке материалов шаров, калибровке световых эффектов и плавности перемещения камеры.

Во второй итерации Qwen Code работал 3 часа 29 минут, сделал 195 запросов к модели, обработал около 16,64 млн входных токенов и 21,6 тыс. выходных токенов. При этом около 14,75 млн входных токенов попали в кэш (коэффициент кэширования — 88,6 %). Задача была прервана из‑за исчерпания квоты (ошибка 429 insufficient_quota). Использовано около 21,86 тыс. токенов из 1 млн доступного контекста (21,9 %).

Независимый разработчик Thomas Wiegold при тестировании Qwen 3.8-Max на четырёх фиксированных задачах выявил, что это самая медленная модель. В ходе работы над ключевой функцией задачи по симуляции покера было выполнено около 20 минут работы, затем модель потратила около часа на корректировку поведения персонажей. Qwen оценён как «высокое качество, но низкая скорость».

«Чрезмерное мышление» включает два типа затрат: на этапе логического вывода (избыточный анализ, проверка и корректировка токенов) и на этапе выполнения Agent (повторное чтение файлов, вызов инструментов, тестирование и возврат результатов). Тест подтвердил значительные затраты на этапе выполнения Agent; невозможно точно определить долю затрат, приходящихся на модель и на стратегию задач Qwen Code.

Али распределяет роли между моделями и продуктами: Max отвечает за передовые возможности, малые модели — за расширение внедрения разработчиками, Qwen Code и — за выполнение конкретных задач, Алиюнь (Aliyun) — за API, развёртывание и корпоративную поставку. 3 августа и Qwen3.8-Max официально стали доступны. Али хочет, чтобы Max работал с кодом, документами, таблицами, веб‑страницами и корпоративными базами знаний. При внедрении в корпоративные процессы возникают проблемы с затратами токенов, задержками поставок и затратами на ручную проверку. Max в системе Али отвечает за верхний предел возможностей всей системы Qwen. Задачи расширения берут на себя малые модели, агенты и возможности корпоративной поставки от Алиюнь. Цель Али — превратить Qwen в базовую платформу Agent для разработки, офиса и корпоративных услуг. Масштабируемая ценность Max зависит от того, сможет ли его потенциал интегрироваться в рабочие процессы через внешние исполнительные системы.

Таким образом, Qwen 3.8-Max демонстрирует способность доводить сложные проекты до высокого уровня выполнения, но должен доказать возможность сокращения малоэффективных циклов в рамках контролируемого бюджета. Модель ориентирована на результат, в отличие от GPT-5.6, который ориентирован на эффективность. Такой подход может быть решением для высокобюджетных и сложных сценариев (например, масштабный рефакторинг кода, оптимизация на уровне чипа).

<<<CODE_BLOCK_N>>>
<<<IMG_N>>>

// оригинал
Leiphone ↗ Читать оригинал
9 просмотров
// поделиться Telegram VK