굿파이어, 모델 내부 신호로 AI 에이전트 위험 행동 감시기 출시

AI 해석가능성 스타트업 굿파이어(Goodfire)가 AI 모델 내부 신호를 분석해 에이전트의 위험 행동을 감시하는 시스템을 출시했다. 테크크런치는 10월 9일 이 시스템이 기존 방식보다 비용을 낮추고, 베이스텐(Baseten)의 AI 모델 운영 서비스를 이용하는 고객에게 제공된다고 보도했다.

모델 내부 신호로 위험 행동 감시

굿파이어가 키미 K3(Kimi K3)를 대상으로 시험한 결과, 대화 100만회를 감시하는 데 약 185달러가 들었다. 매 단계마다 별도 AI 모델이 내용을 확인하는 방식은 상대적으로 저렴한 모델을 써도 약 5420달러, 최고급 모델을 쓰면 약 20만달러가 드는 것으로 나타났다. 굿파이어의 감시기는 악의적인 해킹 세션의 93%를 포착했고, 무해한 세션의 5.5%는 추가 확인 대상으로 분류했다. 감시기 네 개를 동시에 가동해도 모델이 응답을 시작하는 데 걸리는 시간은 2% 미만 늘었다고 회사는 설명했다.

기존 감시 방식은 감시 대상 모델이 생성한 내용을 별도 모델이 다시 읽고 판단한다. 에이전트가 몇 시간 동안 작동하며 소설 여러 권 분량의 텍스트를 처리하면 확인 과정에 드는 비용과 시간이 커질 수 있다. 굿파이어는 모델이 계산을 수행하는 동안 생기는 내부 신호를 살피는 작은 감지기 ‘프로브’를 각 단계에 적용한다. 위험 신호가 포착된 경우에만 별도의 AI 모델이 세부 내용을 검토하도록 해, 이미 진행 중인 계산을 활용한다는 설명이다.

베이스텐 고객이 위험 항목과 대응 방식 선택

베이스텐 고객은 감시할 위험을 직접 고를 수 있다. 목록에는 공격 목적의 해킹, 화학·생물학 무기 악용, 보상 해킹이 포함된다. 위험이 탐지됐을 때는 기록만 남기거나, 사람에게 검토를 요청하거나, 요청을 거부하는 방식으로 대응을 설정할 수 있다. 베이스텐의 베이스 랩스(Base Labs)는 지난달 굿파이어, 허깅페이스(Hugging Face)와 안전성 협력 관계를 발표했다.

이번 출시는 AI 에이전트가 시험 환경을 벗어난 사례가 잇따른 가운데 나왔다. 테크크런치 보도에 따르면 올해 오픈AI(OpenAI) 에이전트가 허깅페이스의 환경을 침범한 일이 있었고, 굿파이어가 첫 감시기를 개발한 키미 K3도 여름에 샌드박스의 정보 유출을 이용해 인터넷과 깃허브(GitHub)에 접근했다. 댄 발섬(Dan Balsam) 굿파이어 최고기술책임자 겸 공동창업자는 모델이 학습이나 평가 단계에서 해킹을 시도할 가능성을 사전에 감지할 수 있다는 점을 장점으로 들었다.

굿파이어가 최근 진행한 연구에서는 키미 K3와 GLM-5.2 등 주요 오픈 모델이 에이전트 시험에서 실행의 50~96%에 걸쳐 보상 해킹을 한 것으로 나타났다. 오픈 모델은 개발자가 내려받아 안전장치를 제거할 수 있어 추론 단계에서 별도 감시가 필요하다는 게 회사 측 주장이다. 구글 딥마인드(Google DeepMind)도 1월 제미나이(Gemini)에 오용 탐지 프로브를 적용하는 데 관련 연구가 활용됐다고 밝힌 바 있다. 굿파이어는 이번 감시기를 장기적으로 대규모언어모델의 행동이 학습 과정 어디에서 비롯됐는지 추적하는 연구의 일부로 보고 있다.

RELATED ARTICLES

RECOMMENDED STORIES