DeepDigest
← все статьи
Audio

Audio

4 статьи по теме

LangChain Blog

Оценка голосовых агентов с помощью LangSmith: ключевые метрики и подходы

Оценка голосовых агентов проводится по трём измерениям: Execution, Outcome и Experience. LangSmith позволяет отслеживать взаимодействие, оценивать его с участием нескольких оценщиков и сравнивать изменения со временем. Для оценки используются детерминированные оценщики, LLM-судьи, audio-aware LLM-судьи и бизнес-проверки. Важны как технические метрики (задержка, время обработки), так и бизнес-результаты (процент успешных бронирований, решений проблем и т. д.).

читать →
~6 мин 122 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

LuxSQA: вопросы на люксембургском — теперь с синтетической речью

Система LuxSQA позволяет задавать вопросы на люксембургском и получать устные ответы с помощью TTS; протестирована на разных системах синтеза речи, показала хорошие результаты.

читать →
~1 мин 405 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

AnySimLite: новый способ классификации речи на смартфоне без потери качества

AnySimLite — лёгкая модель для классификации речи на устройствах: занимает мало памяти, сохраняет высокую точность. Показала конкурентоспособные результаты.

читать →
~1 мин 1145 просмотра
Google DeepMind

Gemini 3.5 Live Translate: голосовой перевод на 70+ языков

Google выпустила модель Gemini 3.5 Live Translate для перевода речи в реальном времени. Она распознаёт более 70 языков, сохраняет интонацию и темп речи, работает непрерывно, балансируя между ожиданием контекста и немедленным переводом. Модель уже доступна в продуктах Google — для разработчиков, предприятий и обычных пользователей.

читать →
~2 мин 2828 просмотра