일레븐랩스(ElevenLabs)가 지시를 더 정확히 따르고 긴 제작물에서도 음성을 일관되게 유지하는 음성 생성 모델 일레븐 v4(Eleven v4)와 실시간용 터보(Turbo) 버전을 출시했다. IT 전문 매체 더디코더는 9월 29일 두 모델이 현재 서비스와 API에서 이용 가능하다고 보도했다.
감정 표현·발음 제어 강화
일레븐 v4는 웃음과 속삭임, 문을 쾅 닫는 소리 등 음성·효과 지시를 이전 모델보다 충실하게 구현한다. 일레븐랩스는 새 아키텍처가 대본의 어조와 속도, 문맥을 분석해 태그나 평범한 문장으로 입력한 연출 지시를 반영한다고 설명했다. 이름과 전문 용어는 발음대로 표기해 조정할 수 있으며, 발음 제어 기능도 더 안정적으로 작동한다는 것이다.
한 번에 처리할 수 있는 분량은 최대 1만자, 음성으로 약 10분이다. 오디오북처럼 더 긴 작업은 여러 구간으로 나눠 생성하지만, 구간이 바뀌어도 말의 속도와 전달 방식이 이어지도록 설계됐다. 대화에서는 각 문장을 따로 처리하는 대신 장면 전체의 맥락에 맞춰 화자가 응답한다. 사용자가 특정 대사를 여러 번 다시 생성하더라도 등장인물과 내레이터의 목소리를 일정하게 유지하는 것이 목표다.
실시간 생성 속도와 가격
터보는 고객 상담 통화나 게임 캐릭터 등 실시간 음성 에이전트를 겨냥했다. 일레븐랩스 자체 시험에서 터보는 음성 출력을 약 150밀리초 만에 시작했다. 카르테시아(Cartesia) 소닉 3.6(Sonic 3.6)은 262밀리초, 오픈AI(OpenAI)의 GPT-4o 미니 TTS는 814밀리초가 걸렸다. 일레븐랩스는 음성 에이전트 플랫폼 일레븐에이전츠(ElevenAgents)와 함께 터보를 최적화했다.
일레븐 v4는 90개가 넘는 언어를 지원한다. 이전 일레븐 v3의 약 70개 언어보다 늘었으며, 복제한 목소리로 다른 언어를 말할 때 원래 언어의 억양으로 돌아가는 현상도 줄이는 것을 목표로 한다. v3에서 지원되지 않았던 프로페셔널 보이스 클론도 다시 사용할 수 있고, 인스턴트 보이스 클론은 10초 분량의 음성만 있으면 만들 수 있다. 아티피셜 애널리시스(Artificial Analysis)의 발음 평가 점수는 v4가 91.7%로 v3의 85.6%보다 높았다. 블라인드 테스트에서는 응답자 약 4분의 3이 카르테시아, 인월드(Inworld), 구글(Google) 모델보다 v4를 선호했다.
일반 API 요금은 문자 100만자당 v4가 80달러, 터보가 40달러다. 10월 12일까지는 각각 22달러와 11달러로 낮아진다. 월 22달러 크리에이터 요금제 이상 이용자는 2주 동안 일레븐크리에이티브(ElevenCreative)에서 추가 비용 없이 v4를 쓸 수 있으며, 사용량은 월간 크레딧의 두 배로 제한된다. 두 모델은 일레븐에이전츠와 일레븐크리에이티브, API에서 제공된다. 회사는 성우가 음성 복제본을 라이브러리에 등록하고 유료 이용자가 사용할 때 수익을 얻는 방식도 운영하고 있어, 새 모델을 더빙 등 다국어 제작에 활용할 수 있다고 소개했다.