DeepDigest
Leiphone · · ~4 мин

GLM-5.3: рост программистских способностей и обнаружение 40‑летней уязвимости

Модель GLM-5.3 демонстрирует значительный рост программистских способностей и высокую эффективность в обнаружении уязвимостей. Улучшения достигнуты благодаря новым технологиям и подходам к посттренировке. Модель успешно прошла ряд тестов и показала преимущество перед конкурентами.

LLM
GLM-5.3: рост программистских способностей и обнаружение 40‑летней уязвимости

14 августа 2026 года представлена модель GLM-5.3. Она позиционируется как самая сильная безопасная, программистская и открытая модель. Программистские способности GLM-5.3 выросли на 50 % по сравнению с предыдущей версией.

Модель демонстрирует впечатляющие результаты в тестировании. На Terminal-Bench 3.0 оценка GLM-5.3 выросла с 4,6 до 28,3 (для сравнения: у Claude Fable 5 — 33,7). В DeepSWE v1.1 оценка выросла с 46,2 до 66,9 (отставание от Fable 5 — 2,8 балла, от Kimi K3 — 0,6 балла). GLM-5.3 превзошла Fable 5 в Agents' Last Exam и заняла первое место в GDPval-AA v2.

В Z.ai Code Bench на уровне сложности High GLM-5.3 показала точность 31,4 % (у Claude Opus 4.8 — 29,5 %). При этом GLM-5.3 использует в среднем 50 тысяч токенов, в то время как Opus 4.8 при выполнении сложной задачи задействует 120 тысяч токенов. Модель экономит половину вычислительных ресурсов благодаря воспроизведению в тренировочной среде полного рабочего процесса экспертов крупных компаний: ей доступны идентичные алгоритмическим инженерам вычислительные кластеры, системы хранения, внутренние документы и код‑репозитории.

Одно из главных достижений GLM-5.3 — способность находить уязвимости. Модель может выявить 2436 уязвимостей, из которых 1097 — средней и высокой степени опасности. Некоторые из них существовали около 40 лет. По поиску багов и защите от уязвимостей GLM-5.3 сопоставим с Mythos 5.

Модель обнаружила уязвимость в DNS‑протоколе: отправка небольшого числа специальных запросов может увеличить нагрузку на сервер почти в 80 тысяч раз и вывести из строя более 10 миллионов DNS‑сервисов. Уязвимость внесена в CNVD.

Для повышения безопасности GLM-5.3 оснащена системой «глубокой защиты» из трёх уровней:
* внешний уровень — лёгкий классификатор для быстрого блокирования массового низкоуровневого злоупотребления;
* средний уровень — монитор рассуждений, отслеживающий намерения задач в процессе работы модели;
* внутренний уровень — «глубокая безопасная настройка» модели, позволяющая ей отклонять атаки на уровне базовой логики.

Система оценивает риски на основе намерений и контекста, а не только по ключевым словам.

В сентябре 2025 года компания совместно с ведущими отечественными лабораториями безопасности разработала специализированную систему оценки и выполнения тестов сетевой безопасности.

GLM-5.3 участвовал в расследовании атаки, выявленной с помощью FOFA Ferret: был обнаружен AI‑хакер Neo, который планировал атаковать бухгалтерские и налоговые организации. За менее чем два месяца Neo управлял 4 серверами, 7 вредоносными доменами, 60 тысячами почтовых ящиков и более чем 100 автоматизированными скриптами, разослав 18 567 фишинговых писем. GLM‑5.3 помог извлечь ключевые данные и восстановить цепочку атаки.

Улучшения в GLM-5.3 достигнуты благодаря технологиям IndexShare, алгоритму SAO и фреймворку Slime. IndexShare решает проблему высоких затрат ресурсов при обработке длинных контекстов (более миллиона токенов). Основной подход — совместное использование одного лёгкого Indexer для каждых 4 слоёв Transformer вместо индивидуальных индексеров для каждого слоя. При длине контекста 1M это снижает FLOPs на один токен в 2,9 раза. Решение устраняет барьеры для посттренировки с длинными траекториями задач и сложными многофайловыми средами.

SAO устраняет необходимость пакетной синхронизации, реализуя асинхронное обучение на уровне отдельной траектории: после завершения одной траектории данные сразу помещаются в буфер данных, и тренировочный узел может сразу начать обновление параметров. Это отделяет обучение от вывода, повышает эффективность использования оборудования и стабильность долгосрочного обучения с подкреплением. Теперь возможно стабильное обучение более 1000 шагов (раньше — не более 160).

Slime — фреймворк для посттренировки, объединяющий IndexShare и SAO. Он разделяет посттренировку на три этапа:
1. Генерация вывода (Rollout) — модель выполняет задачи, пишет код и получает обратную связь в песочнице и терминальной среде.
2. Распределённое обучение (Training) — система получает данные обратной связи и быстро обновляет веса модели.
3. Использование буфера данных (Data Buffer) как посредника, позволяющего асинхронно и независимо работать выводам и обучению.

С помощью Slime обучение RL для модели с триллионом параметров сокращается с нескольких недель до 2–3 дней, делая посттренировку больших моделей процессом быстрой итерации.

Также запущены инструменты ZCode и AutoClaw, открыта подписка на GLM Coding Plan.

Появление GLM-5.3 — сигнал для отрасли: в 2026 году этап соревнования по количеству параметров в больших моделях постепенно завершается, а DeepSeek, OpenAI, Anthropic ищут новые пути роста. GLM доказывает, что посттренировка — перспективное направление.

// оригинал
Leiphone ↗ Читать оригинал
2 просмотров
// поделиться Telegram VK