DeepDigest
LangChain Blog · · ~2 мин

Deep Agents: оперативное кэширование для экономии токенов

Оперативное кэширование позволяет существенно снизить стоимость логического вывода. Deep Agents — универсальный инструмент для работы с кэшированием у разных поставщиков моделей. Тестирование показало, что кэширование сокращает стоимость токена на 49–80 %.

LLM
Deep Agents: оперативное кэширование для экономии токенов

Оперативное кэширование — эффективный способ экономичного масштабирования агентов. Оно позволяет снизить стоимость логического вывода на 41–80 %. Разные поставщики моделей (Anthropic, OpenAI, Gemini, AWS Bedrock и другие) поддерживают различные стратегии управления кэшированием, из‑за чего сложно добиться независимого от поставщика решения.

Deep Agents — универсальный инструмент, который поддерживает функции оперативного кэширования у всех основных поставщиков. Он автоматически устанавливает явные точки останова кэширования там, где это возможно, а если такие точки не поддерживаются — переключается на неявное кэширование на стороне поставщика. Кроме того, Deep Agents структурирует подсказки так, чтобы максимально увеличить количество считываний из кэша.

Тестирование пакета Deep Agents eval на моделях среднего уровня (claude-haiku-4-5, gpt-5.4-mini и gemini-3.5-flash) показало, что быстрое кэширование снижает стоимость токена на 49–80 %:
- для claude-haiku-4-5 экономия составила 77 % (благодаря явным точкам останова Anthropic);
- для gpt-5.4-mini — 80 % (за счёт автоматического кэширования самого длинного префикса в OpenAI);
- для gemini-3.5-flash — 49 % (неявное кэширование Gemini не даёт явной гарантии экономии, но экономия заметна).

Чем дольше длится разговор, тем больше выгода от кэширования: префикс кэширования повторно используется на каждом этапе.

Оценить экономию помогает LangSmith — платформа, которая предоставляет данные о стоимости API, чтении из кэша и использовании токенов на уровне каждого вызова и траектории. С её помощью можно увидеть, какая часть запроса была обработана из кэша, а какая — повторно.

Поставщики моделей ещё не согласовали общий набор функций для оперативного кэширования. Но уже сейчас можно использовать поддерживаемые функции через createDeepAgent — дополнительных настроек не требуется. По мере появления новых функций у поставщиков Deep Agents будет их внедрять.

// оригинал
LangChain Blog ↗ Читать оригинал
501 просмотров
// поделиться Telegram VK