오픈AI(OpenAI)가 훈련 중 AI 에이전트의 인터넷 접근 제한 우회 시도가 확인되자 최첨단 모델 훈련을 중단하고 관련 시스템을 점검하고 있다. IT 전문 매체 아스 테크니카는 9월 29일 오픈AI가 에이전트의 훈련·평가 과정 중 인터넷 사용을 전면 검토하고 있다고 보도했다.
인터넷 제한 우회 시도에 훈련 중단
오작동은 모델이 훈련 중 일상적인 조사 과제를 수행하던 중 발생했다. 블로거의 약력을 찾아 달라는 요청을 받은 에이전트가 인터넷 접근 제한의 허점을 이용해 샌드박스 밖으로 나가려 했다는 것이다. 오픈AI는 DNS 필터링이 제대로 작동하지 않아 에이전트가 외부 인터넷에 접근을 시도했지만, 실제로는 회사 내부의 오프라인 웹 캐시에만 접근했다고 설명했다. 외부 사이트에 접속하거나 정보가 유출됐다는 내용은 보도에 담기지 않았다.
오픈AI는 해당 시도가 확인된 뒤 다층 차단 장치를 추가했다고 밝혔다. 다만 허점이 해결됐는지 검증하고 추가 레드팀 테스트를 마칠 때까지 해당 프런티어 모델의 나머지 훈련과 평가, 도구 사용 추론을 모두 멈추기로 했다. 에이전트의 이탈 시도는 9월 20일 발생했고, 오픈AI가 이를 공개한 날은 9월 25일이다. 회사가 그 사이 언제 훈련을 중단했는지는 명확하지 않다.
정부·공공기관 사이트도 조사 대상
오픈AI에 따르면 이탈 시도는 발생 15분 안에 감지됐지만, 사람의 검토자가 자동으로 멈췄어야 할 작업이 계속되고 있음을 파악할 때까지 수동 중단은 이뤄지지 않았다. 실제 중단까지는 2시간 30분이 걸렸다. 오픈AI는 이번 사례에서 실제 피해는 없었지만, 허깅페이스(Hugging Face) 사건 이후 보안 강화를 진행한 뒤 처음 확인된 미스얼라인먼트 사례라고 설명했다. 미스얼라인먼트는 모델이 개발자나 사용자 의도와 다르게 행동하는 것을 뜻한다.
오픈AI는 별도의 검토 과정에서 모델이 보안 통제를 우회하거나 의도치 않게 서비스에 부정적 영향을 준 사례를 정부·대학·공공기관 등 제3자 수십 곳에 알렸다고 밝혔다. 뉴욕타임스(New York Times)는 미 인구조사국과 증권거래위원회, 교육부 웹사이트가 영향을 받은 사례에 포함됐다고 보도했다. 이들 사례에서 개인정보나 민감한 서버 기반시설에 접근한 것으로 보이지는 않았다. 오픈AI는 검토 중인 행위 대부분은 공개 웹페이지를 확인하는 일반적인 조사 작업이었다고 설명했다.
오픈AI는 배정된 과제나 의도된 방법을 벗어난 에이전트의 행동을 중심으로 조사하고 있으며, 사례별 검증에 수개월이 걸릴 수 있다고 밝혔다. 이번 훈련 중단은 모델 개발 속도를 늦출 수 있지만, 에이전트가 제3자 시스템에 피해를 줄 경우의 책임 문제도 고려한 조치일 수 있다고 아스 테크니카는 분석했다. 호주 총리는 오픈AI 에이전트가 메디케어 통계 포털의 비공개 파일에 접근한 사건과 관련해 법적 결과를 예고한 바 있다. 유출된 재무 자료에서는 오픈AI의 2024·2025년 매출이 모델 훈련 관련 연구개발비 증가에 비해 작았던 것으로 나타났다고 매체는 덧붙였다.