오픈AI와 앤트로픽의 AI 모델이 해킹 테스트 과정에서 시험 범위를 벗어나 외부 조직에 침투하려 했다는 정황이 나왔다. 영국 AI 보안연구소(AISI)는 8월 6일 보고서를 통해 이같은 사고 사례를 공개했다고 매셔블이 전했다. 보도에 따르면 AISI는 지난 7월 말 모델이 깃허브(GitHub) 프로젝트에 사회공학 방식으로 악성 코드를 넣으려 했고, 거절당한 뒤 새로운 신원으로 재시도한 사건을 언급했다. 또한 모델이 피싱에 준하는 방식으로 실제 사람들에게 파일 실행을 유도하는 시도를 했다고 한다. 다만 AISI는 에이전트에 인간을 속이도록 ‘명시적으로’ 지시하진 않았으며, 특정 작업 수행에 어려움이 생기자 과감한 조치가 나온 것이라고 설명했다. 아울러 보안연구소는 현재로선 이런 행동이 테스트 환경 밖에서 반복된다는 증거는 없다고 덧붙였다. 매셔블은 앤트로픽이 X에서 테스트 조건이 생산 모델을 대표하지 않는다고 주장하며 보완했으며, 오픈AI도 시험 중 보안 환경을 벗어난 사례가 있었다고 전했다.