DeepDigest
Leiphone · · ~2 мин

GLM-5.3-Flash от Чжиспо: мультимодальная модель с поддержкой отечественного оборудования

Чжиспо представила мультимодальную модель GLM-5.3-Flash с 320 млрд параметров. Модель показала высокие результаты в рейтинге AA, сравнявшись с Claude Opus 4.8. При поддержке оборудования «Шангтан» и отечественных чипов модель демонстрирует высокую производительность и низкую стоимость использования.

LLM
GLM-5.3-Flash от Чжиспо: мультимодальная модель с поддержкой отечественного оборудования

26 августа состоялась официальная презентация и открытый релиз модели GLM-5.3-Flash (320B-A18B) от Чжиспо — первого в серии GLM-5 мультимодального модели. Модель имеет 320 млрд параметров и превосходит GLM-5.2. В рейтинге Artificial Analysis Intelligence Index (AA) она набрала 57 баллов, оказавшись в числе передовых моделей и сравнявшись по оценке с Claude Opus 4.8 от Anthropic.

GLM-5.3-Flash разработана с акцентом на низкую стоимость: используя 30 трлн токенов мультимодальных данных для предварительного обучения, модель демонстрирует высокую производительность при меньших вычислительных затратах. В работе модели задействована отечественная гетерогенная технология смешанного вывода — её поддерживает оборудование компании «Шангтан».

До официального релиза модель под именем Ox-Alpha (в китайском сообществе — «Нюлай») прошла масштабное тестирование на OpenCode и OpenRouter: количество вызовов токенов достигло 62 трлн, причём все запросы обслуживались на отечественных чипах. По сравнению с базовой конфигурацией в той же аппаратной среде производительность GLM-5.3-Flash выросла втрое, а эффективность оборудования и стоимость одного токена приблизились к уровню решений на базе GPU от NVIDIA.

«Шангтан» развивает систему, включающую модель, «фабрику токенов» и систему управления интеллектуальными агентами. «Фабрика токенов» объединяет различные чипы, кластеры, источники энергии и точки поставки, обеспечивая производство токенов высокого качества при низкой стоимости. Благодаря оптимизации, общая эффективность вывода достигла 1,25 от уровня NVIDIA H‑серии, а при тех же затратах объём производства токенов увеличился примерно в 2,5 раза по сравнению с гомогенными решениями.

В июле средний объём услуг по токенам достиг 2,42 трлн в день. Ожидается, что к концу 2026 года этот показатель превысит 10 трлн в день, а общий объём токенов за год вырастет в 25 раз. «Шангтан» продолжает развивать инфраструктуру на основе отечественного оборудования, стремясь сделать отечественную вычислительную мощность доступной для широкого применения в промышленности.

// оригинал
Leiphone ↗ Читать оригинал
5 просмотров
// поделиться Telegram VK