DeepDigest
Leiphone · · ~4 мин

AMD и Taalas: специализация AI‑чипов и перспективы многочиповых систем

AMD приобрела канадскую компанию Taalas, специализирующуюся на AI‑инференс‑чипах. Taalas создаёт чипы под конкретные модели ИИ, фиксируя в аппаратной части веса моделей и часть потоков данных. Ключевой вызов для отрасли — разработка многочиповых систем для масштабирования моделей и решение связанных с этим системных проблем.

AMD и Taalas: специализация AI‑чипов и перспективы многочиповых систем

6 августа 2026 года AMD объявила о покупке канадской компании Taalas, которая специализируется на AI‑инференс‑чипах. После завершения сделки AMD планирует интегрировать технологии Taalas в свою дорожную карту ускорителей и совместно с Instinct GPU разрабатывать системные решения.

Taalas создаёт чипы не для общего инференса, а под конкретную модель: в аппаратной части фиксируются веса модели и часть потоков данных. Например, первый чип HC1 при работе с Llama 3.1 8B обеспечивает скорость генерации около 17 тыс. токенов/с на одного пользователя.

Основатель Taalas Любиша Байич считает, что распространению ИИ мешают высокая стоимость инференса и недостаточная скорость отклика. Для окупаемости специализированного чипа модель должна генерировать большой объём постоянных запросов. Так, DeepSeek V4 Flash за примерно 10 дней работы на платформе OpenRouter обработала около 8,99 трлн токенов, а GPT‑5‑Codex от OpenAI за три недели обработал свыше 40 трлн токенов.

При этом остаётся вопрос, сколько из этих токенов смогут работать на уже зафиксированном в чипе модели — ведь модели продолжают развиваться. Taalas отмечает, что для части моделей зарезервировано пространство для корректировки.

Эксперт Ян Сяо подчёркивает, что важно понимать, что именно меняется в модели при итерациях — архитектура, параметры или уровень возможностей. Для уже внедрённых в бизнес моделей нужно оценить, действительно ли задачи требуют их обновления. Например, для автоматизации простых задач (заказ еды, бронирование встреч) не всегда нужен самый мощный модель. Часто обновления версий моделей не влекут изменения базовой архитектуры — обычно речь идёт о повышении отдельных показателей. Для ряда бизнес‑задач текущих версий моделей достаточно, а новые функции не обеспечат достаточной коммерческой ценности, чтобы оправдать затраты на миграцию и повторную валидацию.

Аппаратная фиксация модели не означает, что чип может выполнять только одну задачу: большие модели обладают хорошей обобщающей способностью, хотя и теряют гибкость переключения между моделями.

Taalas планирует перейти от малых моделей (например, Llama 3.1 8B) к средним и передовым моделям для логического вывода. При этом для изменений, не затрагивающих базовую модель, HC1 не требует создания нового чипа: в нём часть модели и весов зафиксирована, но сохранена программируемая SRAM для KV Cache, возможна микронастройка модели с помощью LoRA (Low‑Rank Adaptation). Длина обрабатываемой информации может динамически корректироваться (при увеличении длины контекста требуется больше пространства KV Cache). Если же изменения затрагивают базовую модель, требуется перепроектирование чипа.

Taalas использует подход структурированного ASIC: большая часть аппаратного обеспечения фиксирована, кастомизация под конкретную модель сосредоточена в нескольких слоях производства. Веса модели преобразуются в металлические соединения, определённые при производстве чипа (по аналогии с Mask ROM). Компания заявляет, что может внедрить новые веса модели и соответствующие потоки данных в чип, изменив только два слоя масок, — это позволяет сократить цикл кастомизации примерно до двух месяцев.

С момента основания компании до презентации первого продукта прошло более двух лет — основное время ушло на создание аппаратной базы, инструментальной цепочки и полного процесса. После запуска платформы работа над конкретными моделями ускорится.

В Китае также ведутся исследования в области аппаратной фиксации моделей. Институт вычислительной техники Китайской академии наук и компания «Ульри» предложили HNLPU (Hardwired‑Neurons Language Processing Unit), а компания Sytrix объявила о создании китайского AI‑чипа для логического вывода, сопоставимого с Taalas.

Следующая задача для Taalas — определить, какой размер модели может быть размещён на одном чипе. В планах для HC2 — увеличить масштаб модели с 8B до 20B на одном чипе.

По мнению эксперта по ПО для AI‑чипов Ван Жана, площадь чипа HC1 близка к пределу: для добавления большего количества параметров потребуется использовать формат данных с более низкой точностью и перенести часть SRAM на отдельный чип. При расширении модели до уровня сотен B один чип будет недостаточен — потребуется многочиповая система.

При разделении модели на несколько чипов возникают системные проблемы: как разделить вычислительные задачи и передать данные между чипами. Ван Жан считает, что между чипами нужно передавать преимущественно промежуточные результаты вычислений (а не многократно перемещать полный набор весов модели), поэтому объём данных может быть меньше, чем в традиционных GPU‑системах.

Среди сложностей многочиповых систем — простой части чипов при недостаточном количестве запросов, риск замедления всей системы при выходе из строя одного из чипов, нехватка ёмкости SRAM для сохранения KV Cache. Ян Сяо считает, что связь между чипами не обязательно станет главным узким местом в краткосрочной перспективе: если грамотно разделить модель в соответствии с её структурой (когда разные чипы отвечают за разные части), можно контролировать нагрузку на связь, избегая многократного перемещения полных весов.

AMD заинтересована в Taalas: по мере перехода Taalas от одночиповой к многочиповой системе возрастают значимость инженерных ресурсов AMD, возможностей по сборке систем и преимуществ в цепочке поставок. Сделка важна не столько добавлением нового чипа для вывода в портфель AMD, сколько дальнейшим продвижением специализации AI‑чипов.

Цзян Яо сравнивает логику введения Groq LPU компанией NVIDIA с добавлением «Ferrari» к уже имеющемуся «массовому» решению. Приобретение Taalas AMD сравнимо с покупкой «трактора» — узкоспециализированного, но с акцентом на низкую стоимость и высокую эффективность. Вопрос в том, появится ли в индустрии ИИ достаточно стабильных моделей с большим объёмом запросов — иначе даже мощный «трактор» не будет востребован.

// оригинал
Leiphone ↗ Читать оригинал
7 просмотров
// поделиться Telegram VK