모듈레이트, 음성 AI 모델 제공 위해 2500만달러 유치

음성 AI 스타트업 모듈레이트(Modulate)가 음성 기반 AI 모델을 더 많은 개발자에게 제공하기 위해 2500만달러를 유치했다. IT 전문 매체 실리콘앵글은 모듈레이트가 9월 28일 신규 투자 유치를 발표했다고 보도했다.

음성 원본에서 감정·딥페이크 판별

모듈레이트의 모델은 대화 내용을 글로 옮긴 전사문이 아니라 음성 원본을 분석한다. 말투와 감정, 의도를 신호로 읽고 목소리가 딥페이크인지도 탐지한다. 이 분석을 조합해 사기 시도를 가려내거나 음성 AI 에이전트와 통화하는 이용자가 인내심을 잃는 상황을 포착할 수 있으며, 일부 분석은 대화가 진행되는 동안 실시간으로 이뤄진다.

핵심 플랫폼은 벨마(Velma)다. 기반 기술인 앙상블 리스닝 모델(Ensemble Listening Model)은 작업에 따라 100개가 넘는 소형 특화 음성 모델 중 필요한 모델을 골라 결과를 결합한다. 회사는 같은 음성을 대형 모델 하나로 처리하는 방식보다 이 구조가 최대 1000배 효율적이라고 설명했다. 다만 효율 비교의 구체적인 측정 기준은 기사에 제시되지 않았다.

게임 음성 채팅에서 의료·AI 에이전트로

모듈레이트는 온라인 게임 음성 채팅 관리 분야에서 출발했다. 현재도 소셜·게임 플랫폼에서 괴롭힘과 아동 대상 그루밍을 찾아내는 데 모델을 활용하며, 의료기관은 직원 목소리를 흉내 낸 딥페이크 전화 발신자를 걸러내는 데 쓴다. 최근에는 음성 AI 에이전트를 운영하는 고객들이 에이전트의 성능을 점검하는 용도로도 도입하고 있다.

모델은 한 달에 1000만시간이 넘는 음성을 처리하고 있으며, 누적 처리량은 최근 6억시간을 넘어섰다고 회사는 밝혔다. 허깅페이스(Hugging Face) 순위표에서도 성과를 냈다. 전사 모델은 7월 오픈 ASR 리더보드(Open ASR Leaderboard) 1위에 올랐고, 3월 출시한 벨마 딥페이크 디텍트(Velma Deepfake Detect)는 스피치 딥페이크 아레나(Speech Deepfake Arena)에서 선두를 기록했다. 공개 벤치마크 데이터 기준 딥페이크 모델의 정확도는 98.9%라고 회사는 설명했다.

공동 창업자이자 최고경영자(CEO)인 카터 허프먼(Carter Huffman)은 음성이 AI의 주요 인터페이스로 부상하면서 전사문만으로 해결할 수 없는 문제가 생긴다고 말했다. 개발자가 새 음성 서비스를 만들 때마다 음성 분석 기능을 다시 구축하지 않도록 하는 것이 투자금 사용 목적 중 하나라는 설명이다. 회사는 소프트웨어 개발 키트와 API, 특정 산업에 맞춘 모델을 준비하고 있으며 연구·엔지니어링·개발자 지원 인력을 늘릴 계획이다.

투자 라운드는 퓨처벤처스(Future Ventures)가 주도했고 기존 투자자인 하이퍼플레인(Hyperplane)과 라케스타(Lakestar)가 참여했다. 하이퍼플레인은 200만달러 규모의 시드 투자에, 라케스타는 2022년 3000만달러 규모 시리즈A 투자에 참여했다. 이번 투자를 포함해 모듈레이트가 유치한 누적 투자액은 6000만달러다. 현재 기존 API에서 제공하는 일괄 전사 서비스 가격은 시간당 3센트다. 퓨처벤처스 공동 창업자 스티브 저벳슨(Steve Jurvetson)은 음성 AI 기술 수요가 게임을 넘어 AI 에이전트와 보안 분야로 넓어지고 있다고 평가했다.

RELATED ARTICLES