이레귤러 보안시험서 AI 에이전트들이 실제 표적을 공격했다

이스라엘 스타트업 이레귤러(Irregular)의 보안시험에서 여러 업체의 AI 에이전트가 시험 환경을 벗어나 실제 표적을 공격한 사고가 발생한 것으로 보도됐다. 더버지는 시험용 인터넷 접근이 차단되지 않았고 가상 표적의 이름이 실제 도메인과 겹친 것이 원인이라고 전했다.

인터넷 차단 실패와 실제 도메인 중복

더버지(The Verge)는 26일 이레귤러의 여러 시험에서 오픈AI(OpenAI), 메타(Meta), 앤트로픽(Anthropic), 구글(Google)의 AI 에이전트가 실제 표적을 공격했다고 보도했다. 이레귤러는 현실적인 보안 상황을 모의한 환경에서 AI 모델의 사이버보안 역량을 시험해왔다. 일부 시험에는 모의 네트워크 안에서 숨겨진 정보를 찾게 하는 ‘캡처 더 플래그’ 방식이 쓰였다.

이레귤러의 공동창업자 겸 최고기술책임자(CTO) 오메르 네보는 에이전트가 공공 인터넷에 접근할 수 없어야 했지만 의도치 않게 인터넷 접속이 가능했다고 설명했다. 여기에 시험에서 가상 기업을 표적으로 삼기 위해 만든 이름이 실제 도메인과 겹치면서 에이전트가 현실의 표적을 향했다는 것이다. 실제로 어느 기업이나 기관이 공격받았는지는 확인되지 않았다.

네보는 오픈AI·메타·앤트로픽·구글 모델이 관련된 이레귤러 시험 사고가 모두 하나의 평가 시나리오에서 비롯됐다고 밝혔다. 다만 오픈AI의 에이전트가 7월 허깅페이스(Hugging Face)를 무단 공격한 사건과 영국 AI 안전 연구소(AI Security Institute)의 침해 사례는 이레귤러 시험과 무관하다고 선을 그었다. ‘공개했다’는 네보의 설명이 고객사 통보인지 일반 공개인지는 명확하지 않다. 각 기업은 7월 말 비슷한 시기에 통보받은 것으로 보도됐으며, 오픈AI와 앤트로픽은 직접 사고를 알렸고 메타와 구글 관련 사건은 언론 보도로 먼저 알려졌다.

중국 오픈 모델 시험과 재발 방지

이레귤러의 시험 대상은 미국 기업 모델에 그치지 않았다. 회사가 공개한 연구에는 중국 문샷AI(Moonshot)의 키미 K3(Kimi K3)와 Z.ai의 GLM-5.2 시험도 담겼다. 이 모델들은 내려받아 이용자 하드웨어에서 실행할 수 있는 오픈 모델로, 연구에서는 자체 호스팅 방식으로 평가됐다. 네보는 두 모델 시험에서는 이번 사고와 같은 문제가 관찰되지 않았다고 밝혔지만, 그 사실만으로 해당 모델이 이런 행동에 덜 취약하다고 볼 수는 없다고 덧붙였다. 문샷AI와 Z.ai는 더버지의 논평 요청에 답하지 않았다.

네보는 사고 이후 인터넷 접근 통제를 강화하고 모니터링과 수동 검토를 확대했으며, 시험 시작 전 접근 범위가 의도한 설정과 일치하는지 확인하는 절차도 보완했다고 말했다. 협력사와 시험 설정 및 조건을 문서화하고 합의하는 방식도 개선했다는 설명이다. 관련 기업과의 공동 작업이 끝나면 안전한 사이버보안 평가의 교훈과 실천 방안을 담은 보고서를 낼 계획이다. 더버지는 네 기업에 사고를 언제 알았는지, 이레귤러에 배상이나 다른 조치를 요구하는지, 협력을 이어갈지 물었지만 구글과 앤트로픽은 답하지 않았고 오픈AI와 메타는 기존 게시물을 안내했다고 전했다.

RELATED ARTICLES