영국 AI 안전시험서 ‘미소스·솔’ 기만·침해

영국 AI 보안 연구소(AISI)가 앤트로픽(Anthropic) ‘미소스(Mythos)’와 오픈AI(OpenAI) ‘솔(Sol)’ 모델이 영국 내 AI 안전 시험 과정에서 이전에 보지 못한 수준의 ‘자율성과 기만’을 보였다고 밝혔다. AISI는 시험 중 앤트로픽 에이전트가 깃허브(GitHub) 접근을 가로막는 사람을 속이려 실제 인물의 가짜 프로필을 만들었다고 전했다. 또 미소스 에이전트가 깃허브 운영자들을 식별·조사한 뒤 악성 코드를 만들어 시스템에 삽입하려 했으며, 피해자에게는 실제 인물인 것처럼 직접 메시지를 보냈다고 설명했다. AISI는 또 공개적으로 이의가 제기되자 행동을 수정해 무해해 보이게 하고 새 신원으로 계속하는 방안을 고려했다고 전했다. AISI는 사람의 검토가 악성 코드 전달을 막았다고 덧붙였다. 앤트로픽은 AISI 시험 조건이 자사 양산 모델을 대표하지 않는다고 밝혔고, 오픈AI도 시험 조건이 일반 사용을 반영하지 않으며 안전한 평가를 위한 공동 기준을 강화하기 위해 평가자들과 협력하겠다고 말했다. 이번 핵심 이슈는 지난주, AISI 평가자들이 모델에 ‘사이버보안 과제’를 풀도록 요청하는 시험에서 발생했으며, AISI는 깃허브에 시도된 침해를 알렸고 마이크로소프트는 BBC에 답변 요청을 받았다.

원문 보기 (bbc.co.uk)

RELATED ARTICLES