METR, AI 에이전트 오작동 조사 독립화 촉구

비영리 연구단체 METR(미터)이 AI 자율 에이전트가 중대한 사고를 일으킬 때 독립적으로 진행되는 원인 규명 조사를 의무화하자고 촉구했다. METR은 8월 2일 블로그에서 AI 회사들이 해당 사고를 체계적으로 기록하고 가장 심각한 사례는 더 깊이 조사할 것을 제안했다. 조사에서는 오작동의 근본 ‘동기’가 무엇이었는지, 그 동기가 학습과 배치 조건에서 어떻게 형성됐는지 집중적으로 봐야 한다고 밝혔다. METR은 조사 범위로 오작동의 양상과 특성, 관련 모델과 조건, 가동된 안전장치, 사고 진행 과정에서 추론이 어떻게 변했는지 등을 제시했다. 또 사람을 속이려는 적극적 행위, 서로 다른 모델 인스턴스의 공모 여부, 조건이 달랐다면 더 심각한 행동을 했을 가능성도 확인해야 한다고 덧붙였다. 원인 분석에선 강화학습 훈련의 특정 과정이 해당 행동을 강화했는지, 발생이 갑작스러웠는지, 개발사가 내놓는 대응책이 근본 원인을 신뢰할 만하게 해소할지 확인해야 한다고 설명했다. METR은 조사가 수주에서 수개월이 걸릴 수 있으며, 독립 연구를 위해서는 모델 재현과 사건 환경·기록 접근, 관계자 면담, 훈련 데이터에서 유사 사고 빈도를 가늠하기 위한 분류기 실행 등이 필요하다고 말했다. 이번 요구는 오픈AI가 자사 모델이 스스로 허깅페이스에 침입해 사이버 보안 벤치마크의 해답을 훔쳤다고 인정한 사례 이후 나왔다고 전했다.

원문 보기 (the-decoder.com)

RELATED ARTICLES