NVIDIA 11 августа выпустила модель Nemotron 3.5 Lightning — лёгкую открытую модель для AI-агентов. Её можно бесплатно скачать, использовать, модифицировать и запускать на ПК с одной GPU. Модель ориентирована на длительные рабочие нагрузки AI Agent, использует архитектуру Mixture-of-Experts (MoE). Общее число параметров — около 316 млрд, при этом при каждом выводе задействуется около 36 млрд параметров. NVIDIA заявляет, что скорость генерации токенов в Lightning может быть в 4 раза выше, а скорость выполнения полных задач AI Agent — выше примерно на 30 %.
Компания не останавливается на достигнутом и разрабатывает новое поколение моделей — Nemotron 4. Ожидается, что Nemotron 4 будет иметь не менее 1 трлн параметров — примерно в два раза больше, чем у выпущенного в июне Nemotron 3 Ultra. Часть данных для предварительного обучения и архитектура Nemotron 4 уже определены, но окончательные спецификации и дата выпуска пока не установлены, финальное обучение ещё не проведено. По оценкам сотрудников, модель может быть готова к глубокой осени этого года, но возможен и более поздний срок.
Цель NVIDIA — стимулировать внедрение ИИ в стартапах и крупных традиционных компаниях с помощью качественных и относительно недорогих моделей. Это должно увеличить спрос на GPU. При этом часть спроса на GPU от NVIDIA приходится на передовые AI‑лаборатории и облачных провайдеров: OpenAI, Microsoft, SpaceX. Некоторые из этих компаний разрабатывают собственные AI‑чипы.
Объём инвестиций NVIDIA в OpenAI достиг 300 млрд долларов. К апрелю текущего года долгосрочные обязательства NVIDIA по облачным сервисам увеличились до 280 млрд долларов (примерно в три раза по сравнению с прошлым годом); договоры действуют до начала 2031 года. Часть мощностей используется для разработки моделей и других исследований. NVIDIA получает часть тренировочных мощностей, арендуя серверы с ИИ у облачных провайдеров, купивших её чипы.
NVIDIA инвестировала в OpenAI, Reflection AI, Thinking Machines Lab и другие американские AI‑компании. Через Nemotron компания объединяет несколько моделей и AI‑компаний для совместной разработки. Участники альянса (Reflection, Cursor, Thinking Machines, Mistral) предоставляют данные для обучения, помогают с оценкой моделей и предлагают идеи. Prime Intellect предоставил для обучения Nemotron 300 тыс. симуляционных сред. Cognition обсуждала с NVIDIA предоставление данных с кодом.
NVIDIA рассматривает AI‑агентов как «систему моделей»: разные по размеру и возможностям модели совместно выполняют работу, а не одна самая мощная модель выполняет все задачи. Например, продвинутые модели могут заниматься планированием и сложными рассуждениями, а малые — проверкой кода, вызовом инструментов, мониторингом оповещений о безопасности, решением бухгалтерских задач и т. д.
Кроме того, NVIDIA выпустила открытую библиотеку маршрутизации моделей NeMo Switchyard. Она автоматически направляет запросы к подходящей модели (среди открытых, проприетарных и собственных моделей NVIDIA). Разработчики могут настраивать стратегию маршрутизации с учётом качества, задержки и стоимости. По внутренним тестам NVIDIA, NeMo Switchyard позволяет снизить стоимость задач до примерно трети от стоимости при использовании Opus 4.8 (при сохранении точности продвинутой модели). Компания Cognition интегрировала поэтапный маршрутизатор Switchyard в внутреннюю версию Devin Desktop от NVIDIA; тестирование показало снижение средней стоимости на 28 % при сохранении производительности, близкой к продвинутым моделям.
По мнению главы платформы оценки моделей Arena Анастасиоса Ангелопулоса, NVIDIA может получить выгоду независимо от того, какая компания создаст выдающуюся открытую модель. Хуан Жэньсюнь (Huang Renxun) выступает за открытые весовые модели — они способствуют конкуренции, снижению цен, безопасности и инновациям. Bryan Catanzaro (NVIDIA) назвал инвестиции в Nemotron «важными для будущего» компании.
При этом новое поколение Nemotron 4 не сможет напрямую превзойти топовые модели OpenAI и Anthropic. Nemotron 3 Ultra отстаёт от ведущих открытых моделей Китая и не входит в топ‑40 мировых моделей. NVIDIA фокусируется не на звании «разработчика сильнейшей модели», а на развитии экосистемы открытого ПО за счёт инвестиций в открытые модели и инструменты маршрутизации. Рост числа компаний, использующих ИИ, приведёт к увеличению спроса на GPU‑вычисления NVIDIA. Gemini ARR составляет 120 млрд долларов, потенциал GCP+TPU приближается к 2000 млрд. Google смещает фокус в бизнесе ИИ.
