서킷브레이커랩스, 가상 이용자로 고위험 AI 안전성 시험한다

서킷브레이커랩스(Circuit Breaker Labs)가 다양한 연령·언어·문화권 이용자를 모방한 AI 에이전트로 모델의 위험한 대화 대응을 시험하고 있다. 테크크런치는 3일 이 스타트업이 정신건강 지원 앱 등 고위험 AI 서비스를 대상으로 안전성 시험을 진행한다고 보도했다.

다양한 이용자 대화 모방해 취약점 시험

남매인 시랄리 니감(Shirali Nigam) 최고경영자(CEO)와 아룰 니감(Arul Nigam) 최고기술책임자(CTO)가 세운 이 회사는 AI 모델을 ‘충돌 시험용 인형 군단’에 빗댄 가상 이용자들로 시험한다. 가상 이용자는 나이와 배경, 언어, 문화가 서로 다르게 설정되며, 모델이 심리적으로 해로운 상호작용이나 위험 신호를 알아차리는지 확인하는 데 쓰인다.

회사는 인간 분야 전문가와 함께 현실적인 사용자 대화를 설계한다. 시험 문장에는 실제 말투와 속어, 은어, 오타 등이 반영된다. 표준적인 문장에는 잘 대응하는 모델도 어린이와 성인, 영어를 모국어로 쓰는 사람과 제2언어로 쓰는 사람의 표현 차이나 게임 이용자들이 쓰는 속어를 이해하지 못할 수 있다는 게 시랄리 니감 CEO의 설명이다. 여러 차례 대화가 이어지며 위험 신호가 나타나는 상황도 시험 대상으로 삼는다.

정신건강 지원 앱부터 시험 확대 모색

서킷브레이커랩스는 하루 수만건에서 수십만건의 모의 상호작용을 실행하고, 자체 평가 방식으로 결과를 점수화한다. 테크크런치는 점수가 감사와 설명이 가능하도록 설계됐다고 전했다. 회사는 현재 AI 코칭과 일기 작성, 정신건강 지원 앱 등 위험도가 높은 AI 서비스를 대상으로 안전성 시험을 제공하고 있다. 주요 고객사가 누구인지는 아룰 니감 CTO가 공개하지 않았다.

창업 계기는 챗봇과 이용자의 대화에서 발생할 수 있는 심리적 피해에 대한 우려다. 테크크런치에 따르면 캐릭터.AI(Character.AI)는 미성년 이용자들의 자살과 관련해 가족들이 제기한 여러 건의 부당 사망 소송을 올해 초 합의로 마무리했다. 오픈AI(OpenAI)도 챗GPT(ChatGPT)가 가족의 자살이나 망상에 영향을 미쳤다는 주장과 관련해 소송을 당했다. 이는 소송 당사자들의 주장으로, 보도는 챗봇의 책임이 확정됐다고 전하지 않았다.

아룰 니감 CTO는 이용자가 시스템을 일부러 공격하지 않고 자연스럽게 대화하는 중에도 맥락을 잘못 이해하거나 표현의 미묘한 차이를 놓치면 위험한 대응이 나올 수 있다고 말했다. 회사는 현재 직원이 니감 남매를 포함해 5명인 초기 단계 스타트업이며, 작동하는 제품을 보유하고 있다고 테크크런치는 전했다. 시험 플랫폼은 향후 AI 동료 에이전트처럼 대화에 따라 반응이 달라질 수 있는 다른 서비스로도 적용 범위를 넓힐 수 있다는 구상이다. 회사는 10월 13~15일 미국 샌프란시스코에서 열리는 테크크런치 디스럽트의 스타트업 배틀필드 참가 기업으로 선정됐다.

RELATED ARTICLES