В последние годы в сфере искусственного интеллекта наблюдается сдвиг: компании переходят от простого обучения моделей к созданию собственных вычислительных мощностей. Почти все крупные игроки — от OpenAI до Meta*, Google и Amazon — борются за доступ к вычислительным ресурсам, прежде всего к GPU от NVIDIA. Дело в том, что скорость развития ИИ-технологий во многом зависит не только от алгоритмов и данных, но и от физической инфраструктуры: центров обработки данных, энергоснабжения и оборудования.
Крупные компании начинают заранее планировать и создавать вычислительные мощности, чтобы не отставать от темпов развития моделей. Например, OpenAI развивает проект Stargate (первый этап — от 1 ГВт, в целом планируется несколько ГВт), xAI строит в Мемфисе Colossus (около 2 ГВт), Meta* нацеливается на 5 ГВт в рамках проекта Hyperion, Anthropic через сотрудничество с Amazon закрепила за собой около 5 ГВт вычислительных мощностей, а Google давно опирается на собственные TPU.
Китайская компания «Чжи Спе» (Zhi Spe) завершила строительство центра обработки данных мощностью 1 ГВт — он полностью построен на китайских чипах и будет использоваться для обучения моделей. Это событие можно рассматривать не просто как новость о продвижении отечественных чипов, а как сигнал о том, что компании, работающие с большими моделями, превращаются из потребителей вычислительных мощностей в создателей инфраструктуры.
При этом разные компании выбирают разные подходы: кто‑то строит собственные комплексы, кто‑то тесно сотрудничает с облачными провайдерами, кто‑то разрабатывает собственные чипы. При создании собственных центров обработки данных компании сталкиваются с новыми вызовами: нужно решать вопросы с подключением к энергосетям, строительством, обслуживанием оборудования и финансированием. Инфраструктурные фонды, энергетические компании, девелоперы и источники долгосрочного финансирования начинают вовлекаться в цепочку создания стоимости в индустрии больших моделей.
Особенность проекта «Чжи Спе» в том, что он целиком опирается на китайскую систему чипов. Это усложняет задачу: нужно адаптировать серверы, наладить взаимодействие между чипами, обеспечить совместимость компиляторов и фреймворков для обучения, продумать восстановление после сбоев. В отличие от экосистемы NVIDIA с её CUDA и многолетней инженерной базой, «Чжи Спе» приходится не просто расширять существующую инфраструктуру, но и участвовать в её создании.
Эффективность нового центра будет зависеть от того, насколько стабильно он сможет поддерживать масштабные тренировки, насколько высок будет уровень его использования и удастся ли сократить цикл итераций для моделей серии GLM.
* Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена на территории РФ.