Разработчики часто сталкиваются с необходимостью ускорить работу AI-агентов и снизить затраты на их использование. Есть несколько основных способов решения этой задачи.
Сначала важно выявить источник задержки — это может быть один крупный запрос к LLM или множество мелких, которые в сумме создают проблему. Для диагностики полезно использовать инструменты вроде LangSmith: они дают полную картину взаимодействий агента и позволяют отследить задержку на каждом этапе. Недавно в таких инструментах появилась функция «waterfall view» — она помогает быстро понять, какие шаги сильнее всего влияют на общую задержку.
Один из неочевидных способов снизить влияние задержки — изменить UX. Например, можно реализовать потоковую передачу результатов: вместо того чтобы ждать полного ответа, пользователь видит данные по мере их поступления. Это даёт понять, что система работает, и снижает вероятность того, что пользователь покинет страницу. Кроме финального ответа можно стримить промежуточные шаги — например, план действий агента, результаты поиска или токены размышлений. Другой вариант — запускать агентов в фоновом режиме: пользователь не видит время выполнения, а получает уведомление только в случае проблем.
Также стоит сократить количество запросов к LLM. Многие агенты сочетают вызовы LLM с кодом — такой гибридный подход лежит в основе LangGraph. Часто путь разработки агента выглядит так: один вызов LLM → ReAct-агент → мультиагентная система → LangGraph. Мультиагентные системы, хоть и удобны, но неэффективны: они делают много запросов к LLM и не оптимизированы под конкретные задачи. LangGraph же позволяет точно задать правила взаимодействия между агентами — это сокращает число вызовов и делает систему быстрее и дешевле.
Чтобы ускорить сами запросы к LLM, можно использовать более быстрые модели (например, Gemini Flash от Google, небольшие модели от OpenAI и Anthropic) либо уменьшить объём контекста. Время ответа LLM зависит от длины входных данных — поэтому, если сократить объём информации в запросе, ответ придёт быстрее. Наконец, в некоторых случаях имеет смысл выполнять запросы к LLM параллельно — например, параллельно проверять правила и генерировать ответ, извлекать данные из нескольких документов или вызывать несколько моделей и комбинировать их результаты.
В конечном счёте ускорение AI-агента — это поиск баланса между производительностью, стоимостью и функциональностью. Важно сначала выявить узкие места, а затем выборочно применять описанные техники с учётом специфики задачи.
Go back to blog
Create agents
LangSmith
Perplexity does a fantastic job at this
companies like Replit, Uber, LinkedIn and Klarna are adopting it