DeepDigest
TechOrange · · ~2 мин

Databricks: стоимость задачи важнее цены за токен в AI-моделях

Databricks показала, что низкая цена за токен в AI-моделях не гарантирует низкую стоимость выполнения задачи. Эффективность и затраты зависят от ряда факторов, включая Harness-фреймворки и объём контекста (токенов), передаваемого модели. Компания разрабатывает инструмент Omnigent для оптимизации работы с разными AI-агентами.

Databricks: стоимость задачи важнее цены за токен в AI-моделях

Компания Databricks разработала собственный инструмент для бенчмаркинга, чтобы оценить соотношение цены и производительности различных AI-моделей. Как отметил технический директор Databricks Matei Zaharia, тест позволяет избежать искажений, характерных для аналогичных бенчмарков вроде SWE-Bench (когда модель использует заранее известный набор задач).

В ходе тестирования Databricks выяснила, что некоторые открытые модели (например, Z.ai GLM 5.2) по производительности сопоставимы с передовыми решениями вроде Anthropic Claude Opus 4.8. При этом стоимость выполнения задачи для GLM 5.2 составляет 1,28 доллара, а для Opus 4.8 — 1,94 доллара.

Databricks подчёркивает: низкая цена за токен не гарантирует низкую стоимость выполнения задачи. Например, Claude Sonnet 5 имеет меньшую цену за токен по сравнению с Opus 4.8 (примерно в 1,7 раза дешевле), но итоговая стоимость задачи для Sonnet 5 достигает 2,09 доллара против 1,94 доллара у Opus 4.8. Причина в том, что Sonnet 5 успешнее выполняет задачи лишь в 81 % случаев, тогда как Opus 4.8 — в 87 %. Из‑за этого Sonnet 5 тратит больше токенов на достижение нужного результата.

Исследования учёных из Стэнфордского университета и Калифорнийского университета подтверждают выводы Databricks: около трети популярных AI-моделей с низкой ценой за токен в итоге оказываются дороже в выполнении задач. Например, Google Gemini 3 Flash стоит на 80 % дешевле OpenAI GPT-5.4 за токен, но общая стоимость выполнения задач у Gemini 3 Flash на 38 % выше.

Значительное влияние на стоимость и эффективность оказывает Harness-фреймворк — инструмент, который передаёт задачи пользователя AI-модели, координирует работу различных инструментов и возвращает результат. Так, Pi Coding Agent требует вдвое меньше затрат по сравнению с другими Harness-фреймворками при сопоставимом уровне успеха выполнения задач. Разница объясняется объёмом контекста (количества токенов), передаваемого модели. Например, при использовании Claude Code в качестве Harness-фреймворка для Opus 4.8 требуется 742 000 токенов на задачу, а Pi Coding Agent — всего 236 999 токенов. Для OpenAI Codex разница также существенна: 1 235 000 токенов против 665 000 у Pi Coding Agent.

Для решения проблемы Databricks разрабатывает инструмент Omnigent — универсальный фреймворк для интеграции и переключения между различными AI-агентами по написанию кода. Он поддерживает Claude Code, OpenAI Codex и Pi Coding Agent: пользователи могут менять или комбинировать Harness-фреймворки без переписывания кода, управляя ими через правила и механизмы песочницы.

// оригинал
TechOrange ↗ Читать оригинал
6 просмотров
// поделиться Telegram VK