В июле 2026 года в Шанхае прошла конференция WAIC, которая обозначила смену фокуса в индустрии искусственного интеллекта. Если раньше основное внимание уделялось GPU, килокартам и их производительности, то теперь акцент сместился на стабильное и недорогое массовое производство Token и их использование для поддержки работы Agent и AI‑приложений.
Статистика подтверждает изменения: в 2025 году объём вызовов Token вырос в 300 раз по сравнению с предыдущим годом. Например, годовой доход компании «» увеличился с ожидаемых 700 млн до 10 млрд долларов — и основной рост связан с масштабными вызовами при выводе результатов (инференсе). По оценке Gartner, инференс уже занимает более 65 % расходов предприятий на AI‑вычисления.
Эксперты считают, что в 2026 году начинается масштабная коммерциализация AI, а инференс станет основным направлением потребления вычислительных мощностей. Если раньше потребности отрасли в вычислительных мощностях примерно поровну распределялись между обучением и выводом результатов, то сейчас спрос на инференс стал доминирующим — это связано с внедрением AI Coding и автономных интеллектуальных приложений.
Agent меняет вектор развития AI: вместо создания контента он выполняет задачи, задействуя несколько моделей и инструментов. Это многократно увеличивает потребление Token по сравнению с обычными диалогами. Основатель и CEO PPIO считает, что в будущем основным потребителем Token станут Agent: 99 % Token будет потребляться ими, а не людьми.
Ключевой принцип отрасли — «эффективность как приоритет». AI Infra переходит от конкуренции за ресурсы к конкуренции за системную эффективность. Эффективность конкуренции делится на три уровня:
* вычислительная эффективность — увеличение полезных вычислений на том же оборудовании за счёт оптимизации чипов, сети, фреймворков вывода, моделей и архитектуры системы;
* ресурсная эффективность — вовлечение в производство ранее неиспользуемых или недостаточно загруженных вычислительных мощностей за счёт гибкого распределения, объединения разнородных ресурсов и межрегионального взаимодействия;
* энергетическая эффективность — согласование вычислительных задач с энергетическими условиями для снижения стоимости токена.
На конференции обсуждались концепции AI‑фабрики и Token‑фабрики. По мнению экспертов, эти понятия не противоположны, а дополняют друг друга. AI‑фабрика включает в себя блоки вывода и обучения, являясь полным носителем системы производства токенов. Token‑фабрика сосредоточена на масштабируемом предоставлении услуг, преобразуя вычислительные мощности в стандартизированную производительность токенов. Чэнь Цзянь отмечает, что долгосрочно доля вычислительных мощностей для обучения сократится примерно до 10 %, доля мощностей для исследований — до 5 %, а более 85 % мощностей будет относиться к Token‑фабрике вывода.
Участники рынка Token‑фабрик делятся на три категории:
1. Поставщики услуг вычислений с большими аппаратными запасами и возможностями оптимизации всей цепочки. Они обладают кластерами с тысячами GPU, многолетним опытом оптимизации, могут обеспечить в 10 раз более высокую TPS и пропускную способность на единицу Token по сравнению с мелкими игроками. Недостаток — высокие затраты на закупку оборудования и строительство ЦОДов, длительный цикл расширения.
2. Производители собственных больших моделей, создающие кластеры для логического вывода. Их преимущество — высокая совместимость ПО и оборудования под собственные модели. Недостаток — аппаратные запасы ориентированы только на собственные нужды, нет возможности масштабировать обслуживание сторонних запросов на Token.
3. Мелкие поставщики услуг вычислений и стартапы. Их преимущество — гибкость и возможность выполнения краткосрочных индивидуальных заказов. Недостатки — отсутствие стабильных крупных заказов, нехватка каналов для закупки больших партий GPU, слабые возможности оптимизации нижнего уровня и производительности (разрыв в эффективности производства Token с лидерами рынка — в 10 раз).
Компания Параллельная технология на WAIC представила результаты внедрения полностекового сервиса вычислений, подчеркнув переход от конкуренции за размер кластеров к эффективному, стабильному и экономичному производству токенов. К 2025 году планируется внедрение первого в стране кластера из 2000 карт B200 и кластера из 10 000 карт 5090; в этом году уже внедрены два крупномасштабных кластера вычислений. Добавлены две основные бизнес‑линии: масштабируемые сервисы вычислений для логического вывода и стандартизированный MaaS‑сервис Token‑фабрики, охватывающие сценарии AI Coding, преобразования текста в видео и автономного интеллекта.
PPIO представила два ключевых продукта: интеллектуальную Token‑фабрику и первый в стране продукт интеллектуального шлюза моделей — центр интеллектуального планирования для AI Agent. Шлюз использует гибридные модели для принятия ключевых решений, автоматически направляет простые задачи в облегчённые модели, обеспечивая выполнение задач агентом с минимальными затратами Token и максимальной интеллектуальной производительностью.
«» на WAIC представила результаты, связанные с «определённым путём от производства Token до его применения», включая результаты масштабируемого внедрения интеллектуальной инфраструктуры, обновлённые возможности платформы распределения вычислительных мощностей CloudOS и платформы интеллектуального распределения и эксплуатации Maas. «» придерживается нейтральной позиции в облаке: не работает с моделями, данными клиентов и чипами.
Бода дата на WAIC демонстрирует свои возможности в сфере AI‑инфраструктуры: вычислительные центры, AI‑вычисления, AI‑сети, ресурсная сеть в стране и за рубежом. Цель — представить комплексное решение по AI‑инфраструктуре (от проектирования и строительства до сетевого взаимодействия и обслуживания).
Гунцзи технологии на WAIC представляют концепцию «,»: объединение IDC, неиспользуемых вычислительных мощностей в корпоративных парках, GPU в интернет‑кафе, автомобильных вычислений. Используется платформа распределения вычислительных мощностей по типу электросети: с одной стороны — разные источники вычислительных мощностей, с другой — запросы на обучение моделей, вывод, Agent; осуществляется межрегиональное и межкластерное распределение.
9zhang Yunji на WAIC продемонстрировала микро‑AI‑фабрику, охватывающую весь путь от планирования вычислительных мощностей до доставки Token. Alaya NeW Cloud предлагает интеллектуальное планирование очереди, управление квотами ресурсов, набор инструментов разработки.
Будущие конкурентоспособные AI Infra должны обладать тремя способностями: гетерогенностью ресурсов, эластичностью поставок, интеллектуальным планированием. Проблемы — стандартизация гетерогенных ресурсов, межрегиональные сети, безопасность данных, стабильность, эффективность планирования.
В индустрии ИИ формируется новое общее понимание: выход токенов заменяет количество GPU как новый критерий, эффективность — новый фокус вместо масштаба. Компании AI Infra нацеливаются на то, чтобы сделать ИИ измеримой, поставляемой и надёжной производительной силой.
<<<CODE_BLOCK_N>>>
<<<IMG_N>>>