DeepDigest
LangChain Blog · · ~6 мин

Оценка голосовых агентов с помощью LangSmith: ключевые метрики и подходы

Оценка голосовых агентов проводится по трём измерениям: Execution, Outcome и Experience. LangSmith позволяет отслеживать взаимодействие, оценивать его с участием нескольких оценщиков и сравнивать изменения со временем. Для оценки используются детерминированные оценщики, LLM-судьи, audio-aware LLM-судьи и бизнес-проверки. Важны как технические метрики (задержка, время обработки), так и бизнес-результаты (процент успешных бронирований, решений проблем и т. д.).

Оценка голосовых агентов с помощью LangSmith: ключевые метрики и подходы

Оценка голосовых агентов включает три ключевых измерения: Execution (соблюдение инструкций), Outcome (достижение цели взаимодействия) и Experience (качество общения для пользователя).

В рамках измерения Execution проверяется, насколько корректно агент выполняет действия: вызывает нужные инструменты с правильными аргументами и в верном порядке, соблюдает политики конфиденциальности и раскрытия информации, собирает и подтверждает необходимую информацию перед действием, предоставляет точную информацию на основе доступного контекста.

Для оценки явных требований (explicit requirements) используют детерминированные оценщики (deterministic evaluators). Например, для агента по планированию встреч важно проверить:
* вызов checkavailability до bookappointment;
* получение от book_appointment подтверждённых даты, времени и часового пояса;
* наличие требуемого раскрытия информации в транскрипте;
* возврат инструментом ответа об успехе или ошибке;
* отсутствие превышения допустимого числа вызовов инструмента.

Семантические требования (semantic requirements) оценивают с помощью LLM-судей (LLM judges). Они проверяют:
* следование политике, написанной естественным языком;
* точный ответ на вопрос пользователя на основе доступной информации;
* запрос информации, требуемой по инструкциям;
* ясное объяснение следующего шага;
* использование профессионального и уместного языка;
* распознавание неоднозначного запроса и запрос уточнений.

LangSmith позволяет отследить полное взаимодействие, оценить его с участием нескольких оценщиков, изучить запись и активность инструментов, сравнить изменения со временем. Для детерминированных правил подходит code evaluators, для оценки по точной рубрике — LLM judge.

Важно разделять соблюдение инструкций и эффективность результата. Например, агент может точно следовать инструкциям, но не достичь цели — скажем, при бронировании встречи не учтён часовой пояс звонящего. LLM-судья помогает понять, достигнута ли цель взаимодействия: разрешён ли основной запрос звонящего, выполнена ли задача, предприняты ли действия в случае невозможности выполнения задачи, достаточно ли у агента контекста, знаний и доступа к инструментам.

Неудачи могут указывать на необходимость обновления базы знаний, добавления инструмента, уточнения инструкций или определения поведения для непредвиденных сценариев. В LangSmith можно оценить разговор о бронировании по факту завершения звонка с запланированной встречей. Производственные звонки могут косвенно выявлять сбои — например, если звонящий говорит, что встреча была забронирована на неправильное время.

Необходимо измерять конечные бизнес-результаты, а не только делать выводы на основе разговора. Для агента по бронированию важны записи о встречах, для агента поддержки — данные о решении проблем и повторном открытии тикетов, для агента по переводу звонка — информация о том, достиг ли звонящий нужного адресата. Примеры метрик:
* процент успешных бронирований;
* процент решения проблем;
* процент эскалаций;
* процент успешных переводов;
* процент повторно открытых проблем;
* коэффициент конверсии;
* процент отказов.

В LangSmith можно связать бизнес-сигналы с исходным следом и оценить разговор в соответствии с фактическим результатом. Важны и характеристики взаимодействия с точки зрения звонящего: скорость ответа, чёткость и естественность речи агента.

Задержка (latency) — одна из наиболее заметных характеристик голосового взаимодействия. Ключевая измеряемая метрика — задержка в конце хода (время от окончания реплики звонящего до начала ответа агента). Типичный голосовой конвейер включает:
* обнаружение голосовой активности;
* преобразование речи в текст;
* вывод модели;
* вызовы инструментов;
* преобразование текста в речь.

Полезные измерения:
* время до первого аудио;
* задержка преобразования речи в текст;
* время модели до первого токена;
* задержка инструмента;
* задержка преобразования текста в речь;
* P50, P95 и P99 задержки для каждого соответствующего измерения.

LangSmith помогает выявить компонент, вызвавший задержку, вместо рассмотрения задержки как единого показателя. Оценка естественности и ясности включает анализ произношения, темпа и ритма, тона голоса, стабильности громкости, выразительности, неловких пауз, роботизированных повторений, соответствия голоса контексту разговора. Эти свойства могут оцениваться моделью с поддержкой аудио; оценка только по расшифровке не позволяет достоверно определить, насколько агент звучал ясно или дружелюбно. Для оценки в LangSmith используются audio-aware LLM judges. Например, можно оценить понятность произношения, агрессивность прерываний, естественность темпа для звонка в службу поддержки.

Сигналы проблем с удобством использования в разговоре:
* запрос повтора от звонящего;
* запрос повтора информации от агента;
* повторные циклы уточнений;
* прерывания со стороны агента или звонящего;
* долгие паузы;
* наложение речи;
* аномально долгие звонки;
* досрочное завершение;
* неспособность восстановиться после прерывания.

Необходимо учитывать контекст: уточняющий вопрос может быть уместным при неоднозначном запросе, а прерывание не всегда плохо — важно, сохранил ли агент контекст и ответил ли адекватно. В LangSmith эти сигналы можно превратить в практические оценщики — например, оценить наличие повторных циклов уточнений, чрезмерных пауз, сбоев восстановления после прерывания.

Методы оценки выбираются в зависимости от требуемых данных:
* code evaluators — для явного, детерминированного, проверяемого машиной поведения (порядок инструментов, требуемые аргументы, пороги задержки);
* LLM judges — для узких семантических критериев (выполнен ли запрос звонящего);
* audio-aware LLM judges — для свойств, присутствующих в записи (произношение, темп, наложение речи);
* business-system checks — для реальных результатов (повторно открытые дела, завершённые переводы, посещённые встречи).

Человеческий обзор важен для неоднозначного и критически важного поведения: он позволяет оценить понятность письменной политики, корректность применения автоматизированного оценщика, наличие законных исключений. Человеческие метки помогают калибровать LLM judges: если рецензенты часто не согласны с оценщиком, нужно доработать рубрику или промпт; если рецензенты не согласны друг с другом — критерий оценки может быть недостаточно детализирован. В LangSmith поддерживается человеческий обзор с помощью annotation queues: их используют для проверки оценщика, уточнения рубрики и улучшения следующей версии рабочего процесса на основе трассировки.

В LangSmith можно превратить репрезентативные разговоры в набор данных и определить ожидаемое поведение для каждого сценария. Набор данных может включать:
* общие запросы клиентов;
* известные производственные сбои;
* неоднозначные запросы;
* ошибки инструментов;
* переводы и эскалации;
* необычные, но важные крайние случаи;
* звонки со сложными условиями аудио.

Можно проводить эксперименты для сравнения подсказок, моделей, инструментов или изменений рабочего процесса на одном и том же наборе данных. Эксперимент может показать, что новая подсказка улучшает соблюдение инструкций при снижении скорости решения, изменение рабочего процесса увеличивает число успешных бронирований при росте нарушений политики, более быстрая модель снижает задержку, но менее надёжно обрабатывает прерывания. Оценка производства может выявить закономерности, которые упускают отдельные проверки звонков.

Эксперты могут прикреплять структурированные отзывы к трассировкам, включая намерения, статус решения, причину сбоя, настроение или индикаторы сложностей в диалоге. Практический рабочий процесс включает:
1. Отследить полное взаимодействие (записать вместе с операциями преобразования речи в текст, работой модели, инструментом и преобразованием текста в речь — в LangSmith это даёт полную историю звонка в одном месте).
2. Оценить производственные разговоры (применить оценщиков выполнения, результата и опыта к репрезентативной выборке звонков).
3. Отслеживать метрики с течением времени (мониторить тенденции по решению, задержке, эскалации, соблюдению политики и сложности диалога в дашбордах LangSmith).
4. Сравнивать изменения по единым критериям (при обновлении подсказки, модели, инструментов или рабочего процесса повторно запускать тех же оценщиков на том же наборе данных).
5. Проверять сбои в контексте (использовать трассировку и запись, чтобы найти компонент, ответственный за сбой).
6. При необходимости добавлять ручную проверку (использовать очереди аннотаций для неопределённых или важных примеров и для калибровки автоматических оценщиков).
7. Повторять процесс (оценки наиболее полезны как часть цикла разработки, а не как разовый контрольный список запуска).

С LangSmith можно последовательно оценивать голосовых агентов в разных фреймворках и на разных платформах, чтобы сравнивать поведение даже при изменении базового стека. Голосовой агент — это одновременно программная система, целенаправленный рабочий процесс и клиентский опыт; чтобы понять, работал ли агент на самом деле, нужно оценить все три аспекта.

// оригинал
LangChain Blog ↗ Читать оригинал
15 просмотров
// поделиться Telegram VK