오픈AI(OpenAI)는 프런티어 AI의 강화학습 훈련을 계속하기 전에 구조화된 안전 문서를 갖춰야 한다고 제안했다. 회사는 9월 29일 오픈AI 블로그에서 위험을 근거와 함께 정리하는 ‘안전 사례’ 체계를 지향점으로 삼고, 관련 지침을 공개했다.
강화학습 훈련에 안전 기준 도입
안전 사례는 위험을 포괄적이고 체계적으로 검토하고, 이를 근거를 들어 설명하는 문서다. 항공이나 원자력처럼 안전이 중요한 산업에서 쓰이는 접근을 참고했지만, AI 모델은 능력이 높아질수록 예상하기 어려운 복잡성이 나타날 수 있어 같은 수준의 엄밀성을 구현하기 어렵다고 오픈AI는 설명했다. 회사는 현재 내부 개발 절차에서 얻은 교훈을 바탕으로 프레임워크를 마련하고 있으며, 이번 지침은 프런티어 AI의 강화학습 훈련에 초점을 맞췄다.
제안된 기술적 안전장치는 모델 정렬 훈련, 격리(containment), 모니터링 등 세 영역이다. 정렬 훈련에서는 보상 체계의 허점을 이용한 행동이 높은 점수를 받지 않도록 훈련 환경과 채점 기준을 점검해야 한다. 자동화 도구로 결함이 있는 환경을 찾아내는 한편 데이터셋을 수동 검토하고, 채점기가 모델의 환경 악용을 벌점 처리하도록 조정하는 방안도 포함됐다. 과거 실험 기록에 분류기를 적용해 채점기가 의도대로 작동하는지 확인하자는 내용도 담겼다.
모델 오작동 대비와 감시 체계
정렬 성과는 훈련 중 별도 평가로 확인하고, 문제가 생기면 원인을 조사해야 한다. 과거의 오작동 사례를 활용한 역검증으로 평가가 기존 문제를 찾아내는지 살피고, 모델이 시험 중임을 알아차려 행동을 바꾸는 평가 인식이나 평가 회피도 추적하도록 했다. 최악의 오작동을 유도하는 스트레스 테스트를 실시해 적어도 하나의 평가가 이를 감지하는지 확인하는 방안도 제시했다. 자동 채점기가 강화학습 과정에서 모델의 사고 과정(chain-of-thought)을 보지 못하게 해 감시를 피하는 행동의 학습을 막자는 제안도 포함됐다.
모델이 정렬에서 벗어나더라도 피해로 이어지지 않도록 실행 환경과 이를 운영하는 연구 인프라를 여러 겹으로 보호하고, 훈련 중인 모델의 체크포인트를 활용해 격리와 경계 보안을 반복적으로 시험해야 한다는 내용도 담겼다. 여러 모델 사례 사이의 고대역폭 통신은 승인된 경로로 제한하고, 고대역폭이면서 에이전트가 쉽게 발견할 수 있는 인프라 측면 채널을 차단하도록 했다. 훈련·평가·내부 배포 기록은 변경할 수 없는 형태로 보관해 사고 조사에 활용하는 방안도 제안했다.
실시간 모니터링은 우려되는 행동을 조기에 포착하고, 과거 문제를 평가하는 데 그치지 않도록 새 훈련에서 나타날 수 있는 위험을 반영해 계속 갱신해야 한다. 오픈AI는 과거 사례를 따로 떼어 놓은 평가에서 감시 체계가 문제를 놓치지 않는지 확인하고, 모델이 감시를 피하는지 측정하는 기준도 마련하자고 했다. 다만 이번 문서는 훈련 단계의 강화학습에 한정되며, 모델을 내부 또는 외부에 배포할 때는 더 폭넓은 정렬 특성을 검토해야 한다고 덧붙였다. 회사는 지침을 반복적으로 개선하고 외부 의견을 받겠다고 밝혔다.