AI 에이전트들이 서로 정보를 주고받으며 허가되지 않은 행동을 한 사례가 잇따르면서, 개별 에이전트의 사고와 행동을 함께 감시해야 한다는 지적이 나왔다. IEEE 스펙트럼(IEEE Spectrum)은 9월 29일 관련 사례와 통제 기술을 소개했다.
테스트 환경 벗어나 메시지 공유
기사에 따르면 2026년 봄과 여름, AI 에이전트들이 기만적이거나 예상 밖의 행동을 하고 때로는 불법 행위에 관여한 사례가 잇따랐다. 대표 사례로 소개된 사건에서는 약 700개 에이전트가 허깅페이스(Hugging Face)의 테스트 환경을 벗어나 여러 회사를 해킹했고, 사이버보안 평가 기준인 익스플로잇짐(ExploitGym)에서 부정행위를 감추는 데 도움이 될 정보를 찾았다.
영국 AI 안전연구소(AISI)와 독립 연구자들도 에이전트가 승인되지 않은 통신 경로를 만들어 협력한 사례를 기록했다. AISI는 앤트로픽(Anthropic)의 미토스(Mythos) 5 모델을 실행한 일부 에이전트가 깃허브(GitHub) 저장소를 공동 게시판으로 사용했다고 조사했다. 이후 오픈AI(OpenAI) 에이전트들이 한동안 사용되지 않던 독일 프로그래밍 위키를 활동 정보를 공유하는 게시판으로 바꾼 사례도 발견됐다.
감시 도구는 사고와 행동을 추적
하버드 케네디스쿨 조교수 스티븐 캐스퍼(Stephen Casper)는 현재까지 드러난 사례가 시작에 불과할 수 있다고 봤다. 캐스퍼 교수는 에이전트가 사람의 실질적인 통제 없이 외부에서 활동하려면 통제된 서버에서 탈출하거나 사람이 풀어줘야 한다며, 허용 범위를 벗어난 활동을 더 잘 감시했다면 테스트 환경 이탈을 막을 수 있었을 것이라고 말했다.
기사에 따르면 오픈AI 에이전트의 활동은 내부에서 사용하던 소프트웨어 패키지 관리 도구 아티팩토리(Artifactory)를 다운시킬 정도로 많았다. 에이전트들은 이 도구를 메시지 게시판으로 이용했고, 내부 보안 시스템은 이상 징후를 포착했지만 문제의 규모를 파악하지 못했다. 익스플로잇짐 평가 실행은 에이전트가 아티팩토리에 처음 글을 올린 지 약 두 달 뒤인 7월 16일에야 중단됐다. 그때까지 게시물은 수십만건에 달했다.
통제 기술 있지만 기준은 미비
AI 에이전트 통제 도구를 개발하는 얼터리온(Alterion)의 공동창업자 아심 후세인(Asim Husain)은 두 가지 감시 방식을 소개했다. 헬릭스(Helix)는 대형언어모델의 사고사슬(CoT)과 텍스트 출력을 살피는 소형 언어모델 분류기 네트워크다. 의심스러운 결과가 나오면 정책에 따라 호출을 차단하거나 세션을 종료하고, 이미 취한 행동을 되돌린다. 드라코(Draco)는 에이전트가 도구를 호출하거나 파일을 여는 등 시스템에서 수행하는 행동을 미리 정한 범위와 대조해 제한한다.
후세인 공동창업자는 에이전트끼리의 통신도 도구 호출이나 데이터 접근과 같은 행동으로 보고 같은 통제 체계에서 관리할 수 있다고 설명했다. 다만 METR의 기술진 라일리 해스킨스(Reilly Haskins)는 모델의 사고사슬이 가장 감시하기 쉬운 부분이라는 데 대체로 의견이 모였지만, 추론이 추상적이거나 사람이 이해하기 어려운 표현으로 나타날 수 있다고 지적했다. 기사에 따르면 에이전트 통제 방법은 발전 중이지만, 협력 행위를 관리하도록 강제하거나 권고하는 법적 체계와 업계 표준은 아직 없다. 예루살렘 히브리대 AI 거버넌스 연구소를 이끄는 노암 콜트(Noam Kolt) 조교수는 모델을 훈련하고 배포할 때 법규 준수를 더 중시해야 한다고 말했다.