SpaceXAI представила модель Grok 4.6. По оценке Artificial Analysis, она получила 61 балл в Intelligence Index — на 5 баллов больше, чем Grok 4.5 High. Модель занимает третье место в мире после Anthropic Claude Opus 5 и Fable 5, превосходя Kimi K3 (Moonshot AI) и сравниваясь с GPT-5.6 Sol Max (OpenAI).
Главное новшество Grok 4.6 — акцент на long-running agents, разработку ПО и интеллектуальную работу. Модель способна длительно выполнять сложные задачи: поддерживать состояние задачи, работать с незнакомыми темами, анализировать информацию, просматривать большие репозитории кода, превращать идеи продуктов в работающие приложения.
Для обучения Grok 4.6 SpaceXAI создала новые данные для микронастройки. Они охватывают разные уровни рассуждений, среды выполнения Agent, STEM, программную инженерию и интеллектуальную работу. Обучение с подкреплением затрагивает разработку ПО, интеллектуальную работу, оптимизацию ядра, веб‑разработку и CAD.
Результаты тестов демонстрируют прогресс модели. В APEX-Agents (тест на способность AI Agent выполнять профессиональные задачи с помощью инструментов) Grok 4.6 показала рост с 47,1 % до 57,5 %, превысив GPT-5.6 Sol Max (56,7 %), но уступив Fable 5 Max (59,2 %). В AA-Briefcase (оценка способности Agent выполнять длительные профессиональные задачи с использованием инструментов) Grok 4.6 достигла Elo‑балла 1 577 — выше, чем у GPT‑5.6 Sol Max (1 502), и чуть выше, чем у Fable 5 Max (1 574). В Terminal‑Bench v3.0 (тест на выполнение технических задач в терминале) модель выросла с 15,7 % до 26 %, однако отстаёт от GPT‑5.6 Sol Max (34,6 %) и Fable 5 Max (34,1 %).
По данным Artificial Analysis, в AA‑Briefcase Grok 4.6 в среднем проходит 53 раунда и расходует около 5 млрд input tokens. Для сравнения: Claude Opus 5 Max проходит около 103 раундов и использует 20 млрд input tokens.
Стоимость API Grok 4.6 выглядит конкурентно. При prompt менее 200 тыс. Token цена составляет 2 доллара за млн input Token и 6 долларов за млн output Token. Это меньше половины цены GPT-5.6 Sol в стандартном режиме и ниже, чем у Claude Opus 5. При достижении prompt в 200 тыс. Token ставки повышаются: input — с 2 до 4 долларов за млн Token, cached input — с 0,5 до 1 доллара, output — с 6 до 12 долларов; повышенные ставки применяются ко всем Token в запросе.
Стоимость выполнения одной задачи с помощью Grok 4.6 — около 0,84 доллара. Модель включена в Pareto frontier Intelligence vs. Cost per Task. При этом Grok 4.5, OpenAI GPT-5.6 Luna, Z.ai GLM-5.2 и Meta* Muse Spark 1.2 имеют более высокую эффективность затрат на задачи.
Grok 4.6 поддерживает контекстное окно до 500 тыс. Token. VentureBeat подчёркивает: для оценки затрат на работу агента важнее стоимость выполнения workflow, а не стоимость генерации 1 млн Token. При переходе к длительным задачам стоимость AI Agent сложнее рассчитать — одна задача может включать поиск данных, чтение документов, рассуждения, вызов инструментов, проверку результата и повторные действия. Даже при одинаковой цене за токен итоговая стоимость может различаться из‑за разного количества раундов выполнения задачи.
Источники данных: SpaceXAI, Artificial Analysis, VentureBeat.

* Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена на территории РФ.