DeepDigest
Leiphone · · ~5 мин

Seed 2.1 Pro: стратегия ByteDance в гонке за лидерство в ИИ

Чжан Имин из ByteDance отказывается от метода дистилляции для развития моделей ИИ, предпочитая обучение с нуля. Компания инвестирует 200 млрд юаней в центры вычислений и стремится к лидерству за счёт увеличения масштаба и качества данных. Исследования подтверждают риски использования синтетических данных для обучения моделей.

Seed 2.1 Pro: стратегия ByteDance в гонке за лидерство в ИИ

Чжан Имин, основатель ByteDance, придерживается долгосрочной стратегии развития моделей ИИ и отвергает метод дистилляции (Distillation) для быстрого улучшения больших языковых моделей. Он считает, что компания должна жертвовать краткосрочными выгодами ради достижения лидерских позиций в будущем.

В последнем рейтинге Artificial Analysis китайские модели занимают почти половину топ‑10: Kimi K3 Max — 2‑е место, Qwen 3.8 Max (Ali) — 4‑е, GLM 5.2 Max (Zhipu) — 7‑е, DeepSeek V4 Flash — 8‑е. При этом Seed 2.1 Pro (ByteDance) находится на 21‑м месте.

Внутри ByteDance минимум три раза обсуждали возможность использования дистилляции. В январе 2025 года после выхода DeepSeek‑R1 исследователи Seed предложили использовать этот метод, но Чжан Имин отказался. Он хочет, чтобы Seed «учился мыслить», а не имитировал R1. После развёртывания чипов Nvidia Blackwell разрыв в вычислительной мощности между ByteDance и конкурентами усилился: последние получили новейшие решения, а ByteDance продолжает использовать чипы H20. Несмотря на призывы к дистилляции, Чжан Имин решил инвестировать 200 млрд юаней в строительство центров вычислений в Улане и Хуайлае.

ByteDance обладает значительным объёмом оригинальных данных: более 80 млн коротких видео в день в Douyin, сотни миллионов единиц контента в Toutiao, TikTok охватывает более 150 стран и регионов. Очистка и обработка петабайтных объёмов реальных данных (видео, текста, комментариев, данных об интеракциях) сложнее, чем использование синтетических данных, но только реальные данные позволяют сохранить распределение реального мира, включая его необычные и непредсказуемые аспекты.

Исследования подтверждают риски использования синтетических данных. В июле 2024 года исследование институтов Оксфорда и Кембриджа, опубликованное в Nature, показало, что многократное обучение модели на данных, сгенерированных ИИ, приводит к исчезновению информации из «хвоста» исходного распределения данных. Это ухудшает способности модели. Исследование Meta*, представленное на ICLR 2025, подтвердило: даже 0,1 % синтетических данных в обучающем наборе может спровоцировать «сжатие» модели, причём эффект усиливается с ростом количества параметров.

«Хвост» распределения данных включает редкие сценарии, нестандартные вопросы, диалекты, жаргон и узкоспециализированные знания — именно эти данные определяют предел возможностей модели в решении неизвестных задач. Данные, сгенерированные ИИ, сглаживают «хвост», оставляя только наиболее вероятные ответы, из‑за чего модель становится более ограниченной в своих возможностях.

Важный аспект работы модели — её «словарь» : он определяет, на какие базовые единицы модель разбивает текст и какое векторное представление им соответствует. Использование чужого словаря означает принятие чужих языковых предпочтений и гранулированности восприятия. Например, Llama имеет оптимизированный под английский язык словарь, из‑за чего при обработке китайских идиом, интернет-мемов и сокращений текст разбивается на отдельные иероглифы — это снижает эффективность рассуждений, повышает затраты и нарушает семантические связи.

Seedance 2.0 от ByteDance реализует исходную синхронизацию аудио и видео при генерации видео: поддерживает видео длиной 60 секунд с разрешением 2K и выравнивание губной артикуляции на 8 языках. Это возможно благодаря атомному сопоставлению текста, видеокадров и аудиосигналов в едином векторном пространстве.

Обучение модели MoE с более чем 200B параметров требует мощной инженерной базы. Ключевой показатель в крупномасштабном предварительном обучении — MTBF (среднее время между отказами). Длительный цикл обучения (месяцы) с использованием десятков тысяч GPU подвержен риску прерывания из‑за ошибок в памяти, сбоев связи или переполнения точности. При среднем времени безотказной работы одной GPU в 100 тыс. часов кластер из 10 тыс. карт будет сталкиваться с аппаратными сбоями в среднем каждые 10 часов. Для крупномасштабного обучения с нуля нужны мгновенное обнаружение сбоев, точное восстановление с контрольных точек и комплексная отказоустойчивость.

Из‑за ограничений США на экспорт чипов ByteDance не может использовать новейшие чипы Blackwell от Nvidia, применяя вместо них чипы H20 с более низкой эффективностью обучения на одной карте. Чтобы компенсировать отставание, компания увеличивает размер кластера, повышает эффективность использования ресурсов и оптимизирует инженерные решения. Тренировочные кластеры ByteDance развёрнуты в нескольких центрах обработки данных: во Внутренней Монголии (Улаанчабу), Шаньси (Датун), Хэбэй (Хуайлай), Чжанбэй, Аньхой (Уху). Создана распределённая вычислительная сеть с десятками тысяч карт.

Капитальные затраты ByteDance на AI-инфраструктуру к 2026 году увеличены до более чем 200 млрд юаней. Снижение чистой прибыли связано с крупными инвестициями в закупку вычислительных мощностей и строительство дата‑центров в III–IV кварталах. Чжан Имин направляет половину своих усилий на команду Seed.

ByteDance инвестирует средства в создание комплексной инженерной системы для масштабных тренировок моделей — от оптимизации базовых операторов и планирования связи в кластерах до восстановления после сбоев при тренировке и управления ресурсами вычислительной мощности. Система должна обеспечить тренировку моделей с триллионами параметров с нуля.

По данным «Financial Times», ByteDance обсуждает тренировку модели с 10 трлн параметров — это больше, чем у Qwen 3.8-Max (2,4 трлн параметров) от Alibaba и K3 («») (2,8 трлн параметров). Проект на ранней стадии, его возглавляют Сян Лян (Seed Foundation) и Шэнь Кэ (ответственный за данные для предварительного обучения), окончательное решение о выпуске ещё не принято.

Стратегия ByteDance — не догонять конкурентов по размеру параметров, а резко увеличить масштаб и за счёт этого добиться лидерства. Рост числа параметров при достаточном качестве данных и эффективности тренировки ведёт к предсказуемому росту возможностей модели. Однако увеличение масштаба параметров ведёт к экспоненциальному росту сложности тренировки — возникают проблемы с обеспечением данных, стабильностью вычислительной мощности, сложностью согласования и стоимостью рассуждений.

На проект уже потрачено 200 млрд капитала, прибыль снизилась на 70 %, основатель тратит на него половину своих усилий. Чжан Имин на конференции призвал стремиться к пределу интеллекта и ожидать, что модель Seed войдёт в первую мировую группу. Техническая суверенность и возможность участвовать в определении предела интеллекта — это награда за более трудный путь.

Кроме того, в апреле 2023 года в ByteDance официально запретили включать данные, сгенерированные GPT, в обучающие наборы. С 2026 года Anthropic обвиняет Minimax, , DeepSeek, в том, что они «сжимают» их модели. Anthropic сама неоднократно обвинялась в сжатии моделей OpenAI и использовании пиратских книжных данных для обучения. DeepSeek обвинён OpenAI в дистилляции. В США модельные данные, похищенные в целях безопасности, включены в сферу национальной безопасности. Выбор ByteDance приобретает стратегический смысл заблаговременного снижения рисков: полностью собственная разработка модели позволяет избежать споров об интеллектуальной собственности и проблем с соответствием требованиям. В ближайшие 3 года окно технологических парадигм больших моделей резко сужается. Выбор технической траектории ведущими игроками сегодня определит конкурентный ландшафт на ближайшие десять лет и дольше.

<<<CODE_BLOCK_N>>>
<<<IMG_N>>>


* Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена на территории РФ.

// оригинал
Leiphone ↗ Читать оригинал
5 просмотров
// поделиться Telegram VK