오픈AI(OpenAI)는 실시간 음성 AI ‘GPT‑Live’의 음성 처리 시스템을 6개월 만에 설계·개편했다고 8월 3일 공개했다. 오픈AI는 기존 음성 AI가 화자 차례를 가늠하는 ‘턴 디텍터’에 의존해 너무 일찍 판단하면 사용자가 잘리고, 너무 늦으면 응답이 느려지는 문제가 있었다고 설명했다. 이어 GPT‑Live는 턴 디텍터를 오디오 경로에서 제거하고, 음성 모델이 동시에 듣고 말하는 풀듀플렉스 방식으로 대화를 더 즉각적이고 자연스럽게 만든다고 밝혔다. 또한 저지연을 목표로 새 시스템 아키텍처를 적용해 입력 오디오는 음성 모델로 스트리밍하고, 발화 출력도 다시 사용자를 향해 스트리밍하는 구조를 구현했다고 했다. 오픈AI는 대화 흐름은 별도 비동기 경로에서 추론과 도구 사용 등을 위임하며, 미디어 루프가 끊기지 않도록 클라이언트에서 추론 스택까지 신뢰성 있는 오디오 전송 문제를 다뤘다고 덧붙였다.