AI 음악 생성 서비스 수노(Suno)가 말소리와 어울리는 배경음악을 한 트랙으로 만드는 베타 기능 ‘스피치(Speech)’를 선보였다. 더디코더(The Decoder)는 10월 3일 수노가 사용자가 입력한 글과 원하는 목소리·음악 스타일을 바탕으로 음성 오디오를 생성하는 기능을 추가했다고 보도했다.
입력한 글에 목소리와 음악을 결합
이용자는 아이디어를 적거나 완성된 글을 입력한 뒤, 어떤 목소리와 음악 분위기를 원하는지 설명하면 된다. 수노 모델은 입력 내용을 말소리로 만들고 그에 맞는 배경음악을 생성해 하나의 오디오 트랙으로 제공한다. AI 음악 생성기로 잘 알려진 수노에 음성 콘텐츠 제작 기능이 더해진 셈이다. 수노는 시와 명상 콘텐츠, 잠자리에서 들려주는 이야기 등을 활용 사례로 제시했다.
기능을 사용하려면 글의 내용뿐 아니라 목소리와 음악 스타일도 입력해야 한다. 다만 원문에는 목소리나 음악 스타일을 지정하는 세부 설정 항목, 생성 가능한 길이, 파일 형식 등은 공개되지 않았다. 수노는 모델이 글의 의미를 어떤 방식으로 해석해 음성과 음악을 맞추는지, 두 요소를 별도로 조정할 수 있는지도 설명하지 않았다. 현재 알려진 것은 입력한 텍스트와 스타일 설명을 바탕으로 음성과 배경음악을 함께 생성한다는 점이다.
베타 오류와 저작권 논란
수노 제품 책임자 잭 브로디(Jack Brody)는 스피치를 소규모 이용자 그룹과 한 달간 시험했다고 밝혔다. 베타 버전인 만큼 오류가 남아 있으며, 영국식 억양을 지정해도 때때로 호주식 억양처럼 들리는 사례가 있다고 수노는 설명했다. 회사가 시험 기간이나 참여 인원, 오류 수정 일정 등 구체적인 내용을 공개한 것은 아니다.
음악 생성 AI의 학습 데이터와 저작권 문제도 이번 기능을 둘러싼 쟁점이다. 수노는 스피치 모델을 어떤 데이터로 학습했는지 밝히지 않았다. AI 음악 생성기가 저작권 침해 가능성으로 비판받는 상황에서 학습 데이터에 대한 설명이 나오지 않은 것이다. 주요 음반사들은 이미 수노를 상대로 소송을 제기했으며, 최근 뮌헨 법원은 저작권 데이터를 사용한 근거로 공정 이용을 인정하지 않고 수노에 불리한 판단을 내렸다.
스피치의 정식 출시 시점이나 이용 요금, 베타 종료 일정은 공개되지 않았다. 수노가 제시한 사용 예시는 시와 명상, 잠자리 이야기이며, 현재 베타에는 억양이 의도와 다르게 생성되는 문제가 남아 있다. 따라서 이번 발표에서 확인된 변화는 텍스트 기반 음성과 배경음악을 한 번에 만드는 기능의 추가다. 모델 학습 방식이나 저작권 관련 설명, 향후 제공 계획은 이번 보도 내용에 포함되지 않았다.