구글(Google)이 맞춤형 음성과 장면별 대사를 만들 수 있는 제미나이 3.8 플래시 TTS(Gemini 3.8 Flash TTS)와 제미나이 3.8 플래시-라이트 TTS(Gemini 3.8 Flash-Lite TTS)를 출시했다. 구글은 9월 24일 공식 블로그에서 두 모델을 공개하고 구글 AI 스튜디오, 제미나이 API, 제미나이 엔터프라이즈, 제미나이 노트북, 구글 비즈에서 제공한다고 밝혔다.
제미나이 3.8 TTS의 음성 생성 기능
제미나이 3.8 플래시 TTS는 기존 30개 음성에서 벗어나 사용자가 새로운 캐릭터 음성을 직접 설계할 수 있도록 했다. 억양과 감정의 강도, 말투와 전달 방식 등을 지정해 오디오북·게임·팟캐스트에 맞는 음성을 만들 수 있으며, 멜버른 출신의 고에너지 DJ, 가늘고 단조로운 로봇, 일본 용 등의 음성 사례가 소개됐다. 자연어 프롬프트만으로 새로운 음성 정체성을 만들거나 자신의 음성을 복제하는 기능도 지원한다.
두 모델은 음성을 고른 뒤 대사별 전달 방식까지 조정할 수 있다. 대본 편집기에서는 두 화자의 대화를 구성하고 각 대사의 감정과 속도, 발화 순서, 자연스러운 주고받기를 지정할 수 있다. 구글은 제미나이 3.8 플래시 TTS가 휴메 AI의 보이스 디자인 벤치마크에서 종합 1위(71.4), 억양 모델링 부문 1위(60.8)를 기록했다고 설명했다. 휴메 AI 종합 품질 지수에서는 제미나이 3.8 플래시 TTS와 플래시-라이트 TTS가 각각 1위와 2위에 올랐으며, 긴 형식 콘텐츠와 두 화자 대본 제어에서 제미나이 3.1 플래시 TTS보다 개선됐다는 것이다.
다국어 지원과 음성 안전장치
블라인드 방식의 보이스 아레나 평가에서는 일본어, 브라질 포르투갈어, 베트남어, 현대 표준 아랍어, 멕시코 스페인어, 힌디어 등 주요 언어에서 두 모델이 경쟁 모델과 비교해 상위권을 차지했다. 100개가 넘는 언어를 지원해 개발자와 기업이 여러 지역을 대상으로 음성 서비스를 구축할 수 있도록 했고, 아고라·라이브킷·피스캣·벌셀 등 개발자 플랫폼은 제미나이 API를 이용해 개발자가 고성능 음성 생성 경험을 쉽게 구축하고 배포할 수 있도록 한다. 피그마, 헤이젠, 링구아나, 원더크래프트, 99.co, 올랑도 최신 TTS 모델을 미디어 더빙과 지역별 억양 현지화, 대화형 음성 에이전트에 통합하고 있다.
음성 복제에는 음성 소유자가 직접 녹음한 동의 확인 파일이 필요하며, 참조 화자와 일치하는지 검증한 뒤 음성을 생성하도록 설계됐다. 제미나이 오디오 모델이 만드는 모든 음원에는 사람이 알아채기 어려운 워터마크 신스ID가 삽입돼 AI 생성 음성을 식별할 수 있다. 새 기능은 출시 당일부터 구글 AI 스튜디오에서 이용할 수 있고, 두 TTS 모델의 순차적 배포도 이날 시작됐다. 구글은 이번 모델이 제미나이 오디오 제품군의 3.5 라이브 트랜슬레이트, 3.5 트랜스크라이브, 3.8 라이브, 3.8 라이브 익스텐디드 싱킹을 잇는다고 설명했다.