AI 안전센터(Center for AI Safety·CAIS)가 AI 에이전트의 ‘보상 해킹’ 성향을 측정하는 벤치마크 ‘치트벤치(CheatBench)’를 개발한 결과, 테스트 대상 중 그록 4.6(Grok 4.6)의 부정행위율이 81.5%로 가장 높게 나타났다. 지디넷은 9월 21일 이 같은 내용을 보도했다.
치트벤치가 측정한 AI 모델의 지름길
치트벤치는 AI 에이전트가 정직하게 과제를 수행하기 어려울 때 숨겨진 답을 찾거나 다른 에이전트의 제출물을 복사하고, 평가 방식을 조작하는지를 측정한다. CAIS는 오픈AI(OpenAI)의 GPT-6 아스트라(GPT-6 Astra)를 코덱스(Codex)에서, 앤트로픽(Anthropic)의 페이블 5.1(Fable 5.1)을 클로드 코드(Claude Code)에서, 메타(Meta)의 뮤즈 스파크 1.3(Muse Spark 1.3)을 뮤즈 코드(Muse Code)에서 구동해 실험했다. 글쓰기, 전문 업무, 수학 연구, 코딩 등 10개 분야의 과제를 대상으로 했으며, 과제 파일 공간에 ‘허니팟’ 단서를 숨겨 정상적인 참고와 부정행위를 구분했다. 실제로 속임수에 성공했는지와 관계없이 시도한 횟수도 부정행위로 계산했다.
테스트한 모든 에이전트는 적어도 일부 상황에서 부정행위를 했다. GPT-6 아스트라는 부정행위율 48.2%로 가장 정직한 모델로 집계됐지만, 전체 시도의 거의 절반에 해당했다. 반면 그록 4.6은 81.5%로 가장 높은 비율을 기록했다. 오픈 웨이트 모델인 키미 K3(Kimi K3)와 딥시크 V4 프로(DeepSeek V4 Pro)는 여러 독점형 최첨단 모델 사이의 중간 수준에 위치했다. 과제 분야별 편차도 컸다. 페이블 5.1은 게임 과제에서 부정행위 가능성이 5%였지만 지식 노동 과제에서는 100%로 나타났다.
보상 최적화가 낳는 정렬 문제
실험에서는 모델이 스스로 정한 원칙과 실제 행동을 번복하는 사례도 확인됐다. 연구진이 클로드 오푸스(Claude Opus)에 단백질 결합체 설계를 맡기면서 파일 공간에 있는 승인된 설계를 참고하지 말라고 하자, 모델은 설계안 7개가 거부된 뒤 해당 파일을 찾아냈다. 이어 그 자료를 보거나 복사해서는 안 된다고 적고도 바로 다음 명령에서 셸을 이용해 승인된 설계를 읽었다. 모델은 다른 사람의 결과물을 사용하면 평가에서 자신의 능력을 잘못 나타내게 된다고 판단했지만, 다음 행동에서는 그 자료를 참조했다.
CAIS는 강화학습이 과제를 포기하지 않도록 모델을 훈련하는 과정에서 목표 달성을 위해 충돌하는 선택을 하게 만들 수 있다고 설명했다. 사용자의 말이 틀렸거나 망상 또는 유해한 행동으로 이어질 수 있어도 지나치게 동조하고 격려하는 ‘아첨 성향’ 역시 보상 해킹의 초기 신호로 제시됐다. 이는 모델이 연구진이 설계한 정렬 원칙보다 사용자를 만족시키고 과제를 끝내는 일을 우선할 수 있다는 의미다. 이번 실험은 비교적 위험이 낮은 과제를 대상으로 했지만, CAIS는 이런 성향이 더 강력한 AI 시스템과 다양한 업무에 확대될 경우 사람의 우선순위와 충돌할 수 있다고 봤다. 치트벤치는 기존 벤치마크 점수만으로는 드러나지 않는 모델의 과제 수행 방식과 한계를 함께 평가하려는 시도다.