오픈AI, 프런티어 AI 제3자 평가 접근권 확대 원칙 제시

오픈AI(OpenAI)가 프런티어 AI(frontier AI)의 안전성을 검증할 독립적인 제3자 평가를 확대하고, 평가기관에 훈련·평가·배포 전반에 걸친 접근을 제공하겠다는 원칙을 제시했다. 회사는 9월 22일 오픈AI(OpenAI)에 게시한 평가기관이 회사의 안전 주장을 검토하고 위험을 독립적으로 찾아낼 수 있어야 한다고 밝혔다.

오픈AI가 제시한 제3자 평가 원칙

오픈AI는 제3자 평가가 AI 안전에 대한 외부 의견을 넓히고, 관련 정보를 대중에게 제공하며, AI 개발사가 독립적으로 뒷받침된 안전 주장을 내놓도록 책임을 묻는 역할을 한다고 설명했다. 이를 위해 민간·비영리 부문의 독립 평가기관이 회사의 가정을 검토하고, 내부에서 발견하지 못한 위험을 식별하며, 안전장치의 효과에 대해 자체 결론을 내릴 수 있을 정도의 접근권을 보장하겠다는 것이다.

회사는 그동안 모델 개발과 배포의 여러 단계에서 제3자 평가기관과 협력해 왔으며, 준비 프레임워크(Preparedness Framework)에도 외부 평가를 포함했다고 밝혔다. 평가 과정에서 기술적 안전장치 정보, 사고사슬(CoT)에 대한 가시적 접근, 사고 대응과 모니터링 레드팀을 위한 기밀 데이터 및 내부 배포 환경 접근 등을 제공해 왔다고 설명했다. 이번 원칙은 정부와 진행하는 시험·평가와는 별도로, 민간·비영리 기관의 기술적 안전성 평가에 적용되는 내용이다.

평가 대상과 운영 방식

오픈AI가 제시한 심층 평가의 우선 영역은 네 가지다. 첫 번째는 훈련과 평가, 내부 배포 및 외부 배포를 아우르는 안전 사례의 독립 평가다. 평가기관은 정렬, 모니터링 등 통제 방법, 사이버보안, 생물·화학 분야의 오용, 레드팀 활동에 대한 전문성을 바탕으로 안전 주장의 근거가 충분한지, 훈련·평가·배포 과정에서 제시된 조건이 지켜졌는지를 살피게 된다.

두 번째는 내부 및 외부 배포 전반의 핵심 안전장치 평가다. 평가 대상에는 모델 수준의 안전장치, 정책 집행 장치, 보안 장치, 오정렬 모니터가 포함되며, 통제 상실과 사이버·생물·화학 분야의 오용 위험도 다뤄진다. 평가기관은 이른바 ‘그레이박스’ 접근을 활용해 안전장치가 적대적 시험과 탈옥 시도에 견디는지, 고위험 분야에서 모델의 능력 상승을 충분히 통제하는지 확인하게 된다.

평가는 사전에 정해진 출시 시점에만 맞춰 진행되지 않고, 특정 안전 주장을 장기간 검토하는 방식으로 이뤄진다. 일부 평가는 수주 동안 진행되고, 다른 평가는 수개월이 걸릴 수 있다. 오픈AI는 여러 평가를 동시에 지원할 수 있으며, 평가의 독립성·과학적 엄밀성·보안·책임 범위를 명확히 해야 한다고 강조했다. 민감한 정보 보호와 의미 있는 검증을 함께 달성하려면 개발사와 평가기관이 국제적인 안전·보안 기준을 공유해야 한다는 설명이다.

RELATED ARTICLES