DeepDigest
TechOrange · · ~3 мин

Uber: как управлять затратами на AI-агентов

Uber израсходовала годовой бюджет на AI-инструменты за первые 4 месяца, но смогла стабилизировать расходы. Компания внедрила ряд мер по оптимизации затрат — от подбора моделей до разделения ролей между агентами. Для контроля расходов используются специальные инструменты и дашборды.

LLM
Uber: как управлять затратами на AI-агентов

За первые 4 месяца Uber израсходовала годовой бюджет на инструменты AI coding. С февраля по август 2024 года компания столкнулась с бурным ростом использования AI-агентов: количество запросов Agent в неделю выросло в 9,4 раза, а число активных пользователей — в 7 раз. Более 70 % запросов на слияние кода (pull request, PR) включали участие Agent.

При этом общие расходы на AI с апреля остаются стабильными. Компания добилась существенной экономии: при использовании одной модели стоимость 1000 запросов снизилась почти на 34 %, а стоимость одного сеанса (session) — на 52 % по сравнению с июньским максимумом.

Чтобы оптимизировать расходы, Uber провела глубокий анализ затрат по разным компонентам — от количества пользователей и сеансов до числа токенов в запросах и цены за токен. На основе этого анализа компания разработала ряд мер.

Во-первых, Uber проводит регулярные бенчмарк‑тесты, оценивая стоимость, качество и надёжность выполнения задач разными моделями, и подбирает оптимальные решения под конкретные задачи — это позволяет снижать стоимость токена. Во-вторых, компания внедрила разделение ролей между главным агентом (main agent) и подчинёнными агентами (subagent): main agent отвечает за понимание задачи, её разбиение и проверку результатов, а subagent выполняет чётко определённые небольшие задачи, используя менее мощные и дешёвые модели. В‑третьих, Uber сократила количество токенов в каждом запросе к модели, исключив избыточный контекст — предыдущие диалоги, код, информацию об инструментах и результаты выполнения задач.

Компания скорректировала ряд параметров работы с моделями: context, интенсивность рассуждений, prompt cache и способ загрузки инструментов. При поддержке моделей до 1 млн токенов Uber по умолчанию сжимает данные при примерно 400 тыс. токенов, а также изменила время сохранения в prompt cache.

MCP Gateway Uber соединяет более 1000 MCP server. Раньше при установке более 100 инструментов их schema могла занимать 50–70 тыс. токенов до вопроса пользователя. Теперь Uber загружает инструменты только по необходимости — по поиску.

Ещё одно новшество — code-mode: модель создаёт фрагмент Python‑кода, который выполняет SQL‑запросы, проверяет статус выполнения и получает результаты, после чего в модель возвращается только итог. Тестирование простых SQL‑задач показало снижение использования токенов на 55–71 %, а для массовых пакетных задач — более чем на 90 %.

Uber также создала AI Context Graph, который объединяет более 30 внутренних систем — сервисы, команды, записи об авариях, PR, документы по архитектуре, развёртывание и наборы данных. Благодаря AI Context Graph агент находит нужные данные за 38 секунд, тогда как без него на это уходило более 20 минут (с запуском 2 subagent, 3 ошибками и неверным ответом).

Для контроля расходов компания внедрила ряд инструментов. В инструментах разработки теперь отображается текущая стоимость сессии и общие расходы между инструментами Agent. Пользователи получают уведомления в Slack при достижении 50 %, 80 % и 100 % от ожидаемых расходов — для увеличения лимита требуется одобрение руководителя. В строке состояния среды выполнения Agent добавлен счётчик текущих затрат, который позволяет просматривать расходы в одной среде и суммарные по всем средам.

Кроме того, Uber создала Session Analysis Dashboard. Он помогает выявлять 16 типов типичных растрат и предлагать способы их устранения — например, использование слишком мощных моделей для простых задач, постоянное сохранение MCP‑ответов в контексте с повторным начислением платы или повторная загрузка полного содержимого после истечения срока действия prompt cache.

В планах Uber — связать оценку затрат с реальными результатами: рассчитать затраты AI на каждый объединённый PR, проверку кода, обработку оповещений и одновременно проверить качество. При расширении использования агентов управление затратами будет переходить от стоимости модели к расчёту необходимого количества токенов и запросов к модели для выполнения задачи.

// оригинал
TechOrange ↗ Читать оригинал
3 просмотров
// поделиться Telegram VK