Оперативное кэширование — эффективный способ экономичного масштабирования агентов. Оно позволяет снизить стоимость логического вывода на 41–80 %. Разные поставщики моделей (Anthropic, OpenAI, Gemini, AWS Bedrock и другие) поддерживают различные стратегии управления кэшированием, из‑за чего сложно добиться независимого от поставщика решения.
Deep Agents — универсальный инструмент, который поддерживает функции оперативного кэширования у всех основных поставщиков. Он автоматически устанавливает явные точки останова кэширования там, где это возможно, а если такие точки не поддерживаются — переключается на неявное кэширование на стороне поставщика. Кроме того, Deep Agents структурирует подсказки так, чтобы максимально увеличить количество считываний из кэша.
Тестирование пакета Deep Agents eval на моделях среднего уровня (claude-haiku-4-5, gpt-5.4-mini и gemini-3.5-flash) показало, что быстрое кэширование снижает стоимость токена на 49–80 %:
- для claude-haiku-4-5 экономия составила 77 % (благодаря явным точкам останова Anthropic);
- для gpt-5.4-mini — 80 % (за счёт автоматического кэширования самого длинного префикса в OpenAI);
- для gemini-3.5-flash — 49 % (неявное кэширование Gemini не даёт явной гарантии экономии, но экономия заметна).
Чем дольше длится разговор, тем больше выгода от кэширования: префикс кэширования повторно используется на каждом этапе.
Оценить экономию помогает LangSmith — платформа, которая предоставляет данные о стоимости API, чтении из кэша и использовании токенов на уровне каждого вызова и траектории. С её помощью можно увидеть, какая часть запроса была обработана из кэша, а какая — повторно.
Поставщики моделей ещё не согласовали общий набор функций для оперативного кэширования. Но уже сейчас можно использовать поддерживаемые функции через createDeepAgent — дополнительных настроек не требуется. По мере появления новых функций у поставщиков Deep Agents будет их внедрять.