DeepDigest
Leiphone · · ~4 мин

Huawei на IJCAI 2026: переход к плотности проектирования в AI

Huawei представила на IJCAI 2026 ряд технических решений, отражающих переход от «плотности масштаба» к «плотности проектирования» в AI. Среди разработок — увеличение масштаба иерархического ViT до 30 млрд параметров, метод LFS для оптимизации обработки видео и фреймворк RaMod для улучшения работы больших языковых моделей. Метод перевода речи с переключением кодов превзошёл существующие решения.

Huawei на IJCAI 2026: переход к плотности проектирования в AI

Huawei представила обзор статей на IJCAI 2026, подчеркнув переход от «плотности масштаба» к «плотности проектирования» в развитии искусственного интеллекта. Автор обзора — Цунмо, дата публикации — 6 августа 2026 года.

Конференция IJCAI-ECAI 2026 пройдёт с 15 по 21 августа 2026 года в немецком Бремене. В условиях высоких AI-вычислительных затрат и исчерпания выгоды от простого наращивания масштаба параметров акцент смещается в сторону более экономного использования ресурсов.

Huawei представила на IJCAI 2026 4 статьи с техническими решениями. Одно из достижений — работа «Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters». В ней удалось увеличить предел масштаба иерархического ViT с 2 млрд до 30 млрд параметров. Для этого команда Huawei разработала архитектурный дизайн Efficient Hierarchical ViT, который сохраняет способность к извлечению многомасштабных признаков и обеспечивает эффективность вычислений. Были обучены плотные модели с количеством параметров от 200 млн до 5 млрд, внедрена вариация SMoE (разреженный смешанный эксперт) и применена двухэтапная схема обучения:

  • на первом этапе — самоконтролируемое предварительное обучение MAE на ImageNet-21K;
  • на втором — передача знаний из нескольких передовых общих базовых моделей на наборе данных из 27 млн изображений.

В линейном тестировании ImageNet-1K MoE-модель EHV-5B-MoE (30 млрд параметров) при активации 6,7 млрд параметров достигла точности 89,0%, превзойдя модель EVA-CLIP-18B. Модель показала хорошие результаты в классификации изображений, анализе видео и задачах плотного прогнозирования.

Ещё одно направление работы — оптимизация обработки видео в Video-LLM. Существующие модели используют равномерную выборку кадров, но ключевые события в видео распределены неравномерно: важные действия могут быть пропущены, а статичные сцены избыточно кодируются. Команда Huawei AI предложила метод LFS (Learnable Frame Selector) — обучаемый селектор кадров. Его суть в том, что модель самостоятельно определяет важные для описания видео кадры. Ключевые элементы LFS:

  • обучение сети оценки для присвоения кадрам оценки «важности события»;
  • выбор кадров по сегментам (видео делится на временные отрезки, в каждом выбирается наиболее важный кадр);
  • особый способ обучения: выбранные LFS кадры передаются замороженной Video-LLM для генерации описания; полученное описание сравнивается с эталонным, вычисляется потеря, параметры селектора обновляются через обратное распространение ошибки.

Команда создала новый бенчмарк ICH-CC на основе реальных коммерческих сцен из китайской кухни (например, кухня ресторана, уроки приготовления пищи), с описаниями и вопросами, составленными вручную. Эксперименты показали, что версии моделей с LFS стабильно превосходят базовые модели на разных бенчмарках. Подробнее с методом можно ознакомиться по ссылке:

Также Huawei Cloud совместно с вузами предложила фреймворк RaMod (Representation-Aware Modularity) для обеспечения кросс-задачной обобщающей способности больших языковых моделей (LLMs). Текущий подход с per-token динамическим маршрутизатором требует больших вычислительных ресурсов и объёма видеопамяти. Альтернатива — ReFT (представление микронастройки), но у него есть недостатки: неоднозначность семантики токенов, отсутствие механизма самонаведения для новых задач. RaMod включает:

  • двумодульное представление и микронастройку параметров (в отличие от ReFT, RaMod выбирает подмножество скрытых представлений из промежуточных слоёв для модульного вмешательства);
  • асинхронный планировщик (механизм активного планирования распределения видеопамяти — выделяет память под необходимые вмешательства и освобождает её после использования, минимизируя затраты на хранение).

Эксперименты показали, что RaMod сокращает дополнительное время предварительного заполнения на 83%, уменьшает задержку генерации на 100%, снижает использование видеопамяти на 79%.

Ещё одна задача — перевод речи с переключением кодов (Code-Switching, CS), которая требует перевода речи, содержащей несколько языков, на целевой язык. Сложность заключается в семантическом моделировании и нехватке данных CS. Команда Huawei Translation Service Center совместно с Сямыньским университетом и Университетом Макао предложила новый подход: создать для каждого языка отдельную «команду экспертов» для семантического моделирования, затем объединить представления. В методе используются:

  • MoE (смешанный эксперт) речевой проектор: назначает для каждого языка отдельную группу «экспертов» для моделирования детальных речевых характеристик, а маршрутизация автоматически направляет характеристики речи в соответствующую группу;
  • многоэтапная схема обучения, включающая:
    • предварительное обучение проектора для каждого языка на данных автоматического распознавания речи (ASR);
    • сборку проекторов в структуру MoE с совместной оптимизацией при помощи языково-специфичного потери и потери балансировки нагрузки;
    • переход от данных ASR к одноязычным данным речевого перевода (ST) с использованием переходной потери;
    • переход от данных ST к данным межъязыкового речевого перевода (CS).

Метод превзошёл модели Whisper, SeamlessM4T, LLaST на четырёх тестовых наборах Fisher и NTUML2021. Показатель BLEU достиг 39,52, COMET — 81,33. Метод эффективен в сценариях с ограниченным числом языков и контролируемым качеством данных, но его масштабируемость для систем с десятками языков требует дополнительного подтверждения.

Конференц-портал предоставляет информацию о дедлайнах, форматах и ходе рецензирования, площадку для общения коллег, доступ к передовым исследованиям и материалам по теме конференции, а также поддержку на месте проведения. Для присоединения к группе нужно отсканировать QR-код или добавить в WeChat Qvv0909777, указав в примечании: IJCAI + организация/учебное заведение + ФИО + направление. Доступ к материалам (презентации, полные тексты докладов, анализ статей, интервью с учёными) — через QR-код или по ссылке «чтение оригинала».

// оригинал
Leiphone ↗ Читать оригинал
4 просмотров
// поделиться Telegram VK