수노, 대본·설명으로 음성·배경음악 만드는 스피치 공개 베타 선보여

수노(Suno)가 대본이나 설명을 바탕으로 음성과 배경음악을 함께 생성하는 ‘스피치’ 기능을 공개 베타로 선보였다. 이 기능은 웹과 모바일에서 이용할 수 있으며, IT 전문 매체 더버지(The Verge)는 10월 2일 이같이 보도했다.

대본·설명으로 음성 생성

스피치는 음성과 음악을 하나의 오디오 트랙으로 함께 만드는 기능이다. 수노 최고제품책임자 잭 브로디(Jack Brody)는 발표에서 음악이 회사의 중심으로 남겠지만 인간 표현의 다른 형태로도 영역을 넓히려 한다며, 스피치가 음성과 음악을 하나의 트랙으로 생성하는 첫 오디오 모델이라고 설명했다.

이용자는 수노의 ‘만들기(Create)’ 탭에서 스피치 기능을 선택하면 된다. ‘심플’ 모드에서는 “선원들을 독려하는 해적 선장”처럼 만들고 싶은 음성을 설명하는 문구를 입력한다. 이미 대사가 정해져 있다면 ‘어드밴스드’ 모드에서 직접 대본을 넣을 수 있다. 고급 설정에서는 AI 음성의 성별과 말하기 스타일, 생성 결과의 다양성 정도를 조정할 수 있으며, 한 번에 만들 수 있는 음성 길이는 최대 약 8분이다.

배경음악은 선택 사항이다. 음악 없이 음성만 필요하면 설정에서 배경음악을 끌 수 있고, 시를 낭독할 때 차분한 반주를 더하거나 극적인 내레이션·응원 연설에 활기찬 음악을 붙이는 식으로 활용할 수 있다. 따라서 대본을 입력해 음성 파일만 만드는 일반적인 텍스트 음성 변환과 달리, 말의 분위기에 어울리는 음악을 같은 트랙에 구성하는 것이 수노가 내세운 특징이다.

기존 음성 생성 도구와 차이

AI 음성 합성 시장에는 이미 여러 서비스가 있다. 딥마인드(DeepMind)는 10년 동안 딥러닝 기반 음성 합성을 연구해 왔고, 어도비(Adobe)는 텍스트 음성 변환 도구를 제공한다. 2023년 출시된 일레븐랩스(ElevenLabs)도 음성 생성 플랫폼으로 널리 알려져 있다고 더버지는 전했다. 이들 사례와 비교할 때 수노의 공개 베타는 음악 생성 기능을 음성 제작과 결합했다는 점에 초점을 맞춘다.

수노는 기능이 아직 완성 단계가 아니라고 인정했으며, 이용자 의견을 반영해 계속 개선하겠다고 밝혔다. 브로디는 베타가 실제로 베타 단계라며 영국식 억양이 호주식 억양으로 바뀌었다 돌아오거나 극적인 멈춤이 지나치게 극적일 수 있다고 말했다. 공개 베타의 구체적인 종료 시점이나 유료 전환 일정, 가격은 원문에 제시되지 않았다.

RELATED ARTICLES