인터휴먼AI, 사회적 신호를 실시간 분석하는 인터-2 개발했다

덴마크 코펜하겐의 인터휴먼AI(Interhuman AI)가 표정과 목소리, 몸짓 등 비언어 신호를 실시간으로 분석하는 AI 모델 ‘인터-2(Inter-2)’를 개발했다. 인터-2는 대화에서 참여도와 망설임, 불확실성, 혼란, 동의·반대 등 사회적 신호 12가지를 파악하며, 테크유(tech.eu)는 9월 28일 인터휴먼AI 공동창업자들과의 인터뷰를 통해 이 모델과 개발 배경을 소개했다.

말뿐 아니라 표정·목소리도 분석

인터휴먼AI는 인터-2가 텍스트와 음성, 영상에서 사회적 신호를 분석한다고 설명했다. 시선의 변화와 자세, 고개 움직임 같은 행동 단서도 분석 대상이다. 회사는 추론 속도가 최대 4배 빠르고 벤치마크 성능도 개선돼 실시간 신호 감지를 대규모로 적용하기 쉬워졌다고 밝혔다. 다만 기사에는 벤치마크의 구체적인 종류나 수치, 비교 대상은 제시되지 않았다.

인터-2는 인터휴먼AI가 새로 개발하는 모델군의 첫 모델이다. 공동창업자 겸 최고경영자(CEO) 폴라 페트쿠는 챗GPT(ChatGPT) 같은 대규모언어모델(LLM)이 널리 쓰이기 시작하면서 AI가 사람과 상호작용하는 방식은 달라졌지만, 몸짓과 말투, 표정 등은 충분히 읽지 못한다는 점에 주목했다고 말했다. 페트쿠는 제약업계에서 임상시험 환자를 AI가 더 잘 이해하는 방법을 살펴보다 이런 문제를 고민하게 됐다고 설명했다. 이후 영상·음성을 분석하는 모델을 언어모델과 결합해 사용자가 실제로 전달하는 바를 파악하는 기술을 구상했다는 것이다.

사회적 신호 해석의 정확성과 책임

공동창업자 겸 최고운영책임자(COO) 프레데리크 샐리는 AI가 말의 내용뿐 아니라 말하는 사람의 상태와 맥락을 이해해야 적절히 반응할 수 있다고 말했다. 인터휴먼AI는 행동과학 연구를 바탕으로 사람이 서로를 이해하는 과정을 AI가 처리할 수 있는 구조화된 신호로 바꾸는 방식으로 기술을 개발하고 있다. 페트쿠는 대형 AI 연구소들이 일반 지능과 생산성에 집중하는 동안 인간의 의사소통과 사회적 신호를 다루는 영역은 상대적으로 덜 주목받았다고 말했다.

회사는 이 기술이 의료 상담과 로봇 분야에서 중요할 수 있다고 봤다. 전화로 AI와 상담하는 환자가 좌절하거나 괴로워하는 상태를 시스템이 알아차리지 못하면 응급 진료 필요성을 잘못 판단할 수 있고, 휴머노이드 로봇이 자신이 하던 행동을 멈춰야 한다는 점을 알아차리지 못하면 신체적 피해로 이어질 수 있다는 설명이다. 이는 인터휴먼AI 공동창업자들이 제시한 적용 가능성과 위험 사례로, 실제 현장에 도입된 사례를 뜻하지는 않는다.

사람의 행동 신호는 개인과 상황에 따라 의미가 달라질 수 있다. 침묵이나 망설임은 불확실함을 나타낼 수도 있지만, 대답을 생각하는 과정일 수도 있다. 샐리는 모델이 특정 신호를 판단한 근거를 추적할 수 있도록 설계하고 있다며, AI가 면접에서 사람의 미래에 영향을 미치는 판단을 내린다면 당사자가 어떤 단서로 그런 결론에 이르렀는지 확인하고 이의를 제기할 수 있어야 한다고 말했다.

문화와 언어, 나이, 신경다양성, 개인별 대화 방식의 차이를 반영하는 것도 과제다. 인터휴먼AI는 초기에는 공개 데이터를 활용해 문제를 파악하고 주석 작성 절차를 마련했으며, 현재는 직원들이 대화를 녹음해 자체 데이터를 모으고 외부 데이터 제공업체와도 협력한다고 밝혔다. 심리학자와 행동과학자를 포함한 전문 주석 작업자들이 행동 데이터를 분류하며, 회사는 이 데이터 구축과 주석 기준을 일관되게 유지하는 일이 개발의 큰 부분이라고 설명했다. 말미는 AI 역량이 커질수록 개인정보 보호와 조작 가능성, 인간의 통제 문제가 중요해진다고 짚었지만, 이에 대한 구체적인 대응책이나 출시 일정·가격은 제시하지 않았다.

RELATED ARTICLES