DeepDigest
Leiphone · · ~4 мин

GPT-Live от OpenAI: как добиться реального взаимодействия в голосовых диалогах

OpenAI представила технологию GPT-Live, которая позволяет перейти от одностороннего диалога к реальному взаимодействию. Система непрерывно обрабатывает звук и возвращает речь, снизив задержку аудиофреймов до уровня, при котором 95 % из них больше не задерживаются. В архитектуре GPT-Live предусмотрены быстрый, глубокий и асинхронный каналы обработки данных.

LLM
GPT-Live от OpenAI: как добиться реального взаимодействия в голосовых диалогах

OpenAI представила технологию GPT-Live, которая позволяет перейти от одностороннего диалога к реальному взаимодействию. Система непрерывно обрабатывает звук и возвращает речь, не дожидаясь завершения фразы пользователя. Ключевое достижение — снижение задержки аудиофреймов: 95 % из них больше не задерживаются. Дата релиза — 6 августа 2026 года.

В течение шести месяцев OpenAI перерабатывала голосовую систему ChatGPT. В новой версии медиа-система добилась того, что p95 задержки аудиофреймов соответствует p50 старой системы. Это значит, что самые медленные 95 % аудиофреймов в новой системе работают так же плавно, как самые быстрые 50 % в старой.

Архитектура GPT-Live включает несколько каналов обработки данных:
* быстрый канал — для мгновенных ответов (обработка прерываний аудиопотока, реакция на эмоции вроде «м-м», «я слушаю»). Обработка ведётся маленькими моделями или жёстко закодированной логикой на краю сети или на фронте;
* глубокий канал — разделение реального общения и сложных рассуждений. Сложные семантические понимания и длинные рассуждения обрабатываются моделями вроде GPT-5.5;
* асинхронные задачи — поиск, вызов инструментов, сохранение данных вынесены за пределы основного пути. Их результаты могут задерживаться, но не должны блокировать аудио.

OpenAI внесла значительные технические изменения в систему:
* переписала медиа-фронт и часть логики рассуждений с Python asyncio на Go — это позволило избежать непредсказуемых задержек, которые в условиях высокой нагрузки создаёт Python (из‑за планирования потоков, распределения памяти, копирования данных и сборки мусора);
* оптимизировала Linux-ядро: использует SO_REUSEPORT для совместного использования UDP‑порта несколькими рабочими единицами с балансировкой нагрузки на уровне ядра; закрепляет Go‑корутины, отвечающие за чтение UDP, за потоками ОС, чтобы уменьшить миграцию потоков и потерю кэша CPU; предварительно выделяет буфер для приёма пакетов, сокращая копирование памяти;
* разработала протокол WARP: объединяет DTLS‑рукопожатие, установление SCTP и согласование канала данных, сокращая запуск канала с 6 RTT до 1 RTT. Маршрутные подсказки встраиваются в ICE ufrag в WebRTC. Relay при получении первого пакета сразу создаёт отображение в памяти без запроса к удалённому Redis.

Управление правом речи и состоянием сессии реализовано внутри аудиомодели: она одновременно понимает контент и решает, продолжать ли слушать, начать ответ, приостановить вывод или принять прерывание. При прерывании система фиксирует:
* до какого момента сгенерирован вывод модели;
* до какого — отправлен с сервера;
* до какого — услышан клиентом.

Следующий диалог основывается на фактически услышанной клиентом части. Для миграции экземпляра модели без прерывания сессии старый экземпляр продолжает работать, одновременно запускается новый и выполняется Prefill. Новый экземпляр дополняет аудио, появившееся в период подготовки, и догоняет текущий прогресс — только после этого система переключает медиапоток. Сжатие контекста работает по тому же механизму: старый экземпляр продолжает диалог, в фоне сжимается история и готовится новый экземпляр; после того как новый экземпляр догонит состояние, он берёт управление на себя.

OpenAI провела теневое тестирование: реальные голосовые диалоги одновременно направлялись в новую и старую системы. Выявлено, что один вспомогательный компонент насыщается раньше ожидаемого и замедляет очередь рассуждений. Стабильность продолжения диалога зависит не только от скорости модели, но и от сети, очереди и служб состояния.

OpenAI перераспределила обязанности в системе голосового диалога в реальном времени:
* аудио помещено в отдельный быстрый путь;
* вход WebRTC разделён на Relay и Transceiver;
* маршрутная информация включена в протокол соединения;
* экземпляры моделей могут переносить контекст;
* сложные задачи передаются предварительно подготовленным бэкенд‑моделям.

Среди открытых вопросов — стоимость единицы непрерывного рассуждения, точность фактического прерывания, потеря информации после многократного сжатия в длительных диалогах, доля устаревших результатов бэкенда. OpenAI сфокусировалась не на количестве токенов, обрабатываемых GPU в секунду, а на способности системы поддерживать множество стабильных голосовых диалогов.

GPT-Live доказал, что непрерывное распознавание речи превратилось из лабораторного эксперимента в полноценную инженерную систему, способную работать в масштабе ChatGPT. Для разработчиков отечественных агентов нет необходимости ждать ускорения GPT-5. Реальное соревнование разворачивается в области WebRTC (в части пакетов рукопожатия), управления памятью на Go и состояния машины с возможностью отката.

<<<CODE_BLOCK_N>>>
<<<IMG_N>>>

Ссылки

// оригинал
Leiphone ↗ Читать оригинал
5 просмотров
// поделиться Telegram VK