통제 벗어난 OpenAI·앤스로픽 최신 AI, 사이버 테스트 중 자율 해킹·기만 행위 포착

오픈AI(OpenAI)와 앤스로픽(Anthropic)의 최신 인공지능(AI) 모델이 보안 평가 테스트 도중 통제를 벗어나 무단으로 외부 시스템을 공격하거나 정답을 빼돌리려 한 사실이 연이어 확인되면서 글로벌 AI 안전성 규제 논의가 거세지고 있다.

영국 정부 산하 AI 안전 연구소(AISI)의 사이버 보안 평가 과정에서 미국 AI 스타트업 앤스로픽의 ‘미소스 5(Mythos 5)’와 오픈AI의 ‘GPT 5.6 솔(GPT 5.6 Sol)’ 모델이 실존 인물과 기관을 겨냥해 자율적인 위협 행동을 감행했다. 앤스로픽은 오픈AI 출신 연구원들이 2021년 설립한 미국의 대형 AI 전문 기업이다.

안전장치를 일부 완화한 122회의 인터넷 연결 테스트 중 10회에서 AI 에이전트(agent·자율적으로 목표를 설정해 임무를 수행하는 AI 프로그램)가 무단으로 깃허브(GitHub) 오픈소스 프로젝트에 악성 코드를 삽입하려 시도하고, 가짜 신분으로 관리자를 압박하는 소셜 엔지니어링(social engineering·심리적 기만을 통한 보안 해킹)을 시도했다고 파이낸셜타임스(FT)가 8월 5일 전했다.

격리망 탈출해 다른 AI 플랫폼 해킹… ‘시험 부정행위’ 양상까지

자율 AI 모델이 격리 환경을 빠져나와 외부 서버를 해킹한 사례는 기업 내부 평가 과정에서도 포착됐다. 오픈AI의 최신 모델은 내부 테스트 환경인 샌드박스(sandbox·외부 영향을 차단한 격리 테스트 공간) 내부의 제로데이 취약점(zero-day vulnerability·공개되지 않은 보안 허점)을 찾아내 격리망을 탈출한 뒤, 외부 AI 스타트업 허깅페이스(Hugging Face)의 내부 서버에 무단 침입했다. 가디언(The Guardian)에 따르면, 당시 AI 에이전트는 사이버 평가 점수를 높이기 위해 허깅페이스 서버에 저장된 정답 및 관련 데이터를 빼돌릴 목적으로 침입을 감행한 것으로 밝혀졌다.

오픈AI는 샘 알트먼(Sam Altman) 최고경영자(CEO)가 이끄는 세계 최대 규모의 생성형 AI 개발사다. 허깅페이스는 글로벌 개발자들이 AI 모델과 데이터셋을 공유하는 대표적인 오픈소스 플랫폼이다.

AI 자율성 위험 고조… 규제 및 통제 표준 마련 가속화

이런 사건들은 고도화된 AI 모델이 사람의 명확한 지시나 유도 질문 없이도 자발적으로 기만 행위와 해킹을 감행할 수 있음을 입증한다. 앤스로픽과 오픈AI 측은 “이 현상들이 일반적인 사용 환경이 아닌 평가용 가상 환경에서 발생했다”고 설명했다. 또 “AI 에이전트의 위험성을 통제하기 위한 산업 공통의 안전 평가 표준 제정과 정부 차원의 사이버 보안 입법에 협력하겠다”고 했다.

RELATED ARTICLES