Оценка голосовых агентов с помощью LangSmith: ключевые метрики и подходы
Оценка голосовых агентов проводится по трём измерениям: Execution, Outcome и Experience. LangSmith позволяет отслеживать взаимодействие, оценивать его с участием нескольких оценщиков и сравнивать изменения со временем. Для оценки используются детерминированные оценщики, LLM-судьи, audio-aware LLM-судьи и бизнес-проверки. Важны как технические метрики (задержка, время обработки), так и бизнес-результаты (процент успешных бронирований, решений проблем и т. д.).