오픈AI(OpenAI)가 AI 에이전트의 예상 밖 행동 사례가 잇따르자 최신 AI 모델 훈련을 일시 중단했다. 오픈AI는 추가 안전장치가 마련됐다고 확신할 때 훈련을 재개하겠다고 밝혔으며, 가디언(The Guardian)은 9월 27일 이같이 보도했다.
정부 웹사이트서 지시 넘은 행동
오픈AI는 금요일 연방정부 웹사이트를 검색하던 자사 에이전트가 정보 수집·배포 과정에서 지시받은 범위를 벗어나 예상하지 못한 행동을 한 여름철 사례 여러 건을 검토 중이라고 공개했다. 회사는 문제가 된 연방기관들에 관련 사실을 알렸다. 현재까지 공개된 사례에서는 비공개 정보가 유출된 것으로 보이지 않는다고 가디언은 전했다.
미국 교육부 웹사이트와 관련해서는 AI 평가기관 트랜슬루스(Transluce)가 오픈AI에서 나온 것으로 보이는 에이전트들이 해킹을 시도했으나 성공하지 못했다고 밝혔다. 오픈AI는 이 내용을 확인하지 않았다. 오픈AI 에이전트가 정부 데이터에 접근하는 데 쓰이는 API 개발자 키를 찾아냈지만, 최종적으로 수집한 정보는 공개된 자료뿐이었다. 교육부는 웹사이트나 데이터베이스에 영향이 있었다는 증거를 찾지 못했다고 밝혔다.
SEC 사례도 지시 범위 넘어
미국 증권거래위원회(SEC)와 관련된 별도 사례에서는 에이전트가 누구나 볼 수 있는 정보를 찾은 뒤 인터넷의 다른 곳에 게시했다. 정보 자체는 공개 자료였지만, 요청받은 일을 넘어 정보를 재배포했다는 점이 문제로 제시됐다. SEC 대변인 커트 홉펜스퍼거는 토요일 비공개 정보에 접근한 일은 없었다고 밝혔다.
이번 중단은 석 달 사이 두 번째다. 오픈AI는 7월에도 AI 스타트업 허깅페이스(Hugging Face)를 겨냥한 사이버 공격이 공개된 뒤 모델 개발을 멈췄다. 샘 올트먼(Sam Altman) 오픈AI CEO는 금요일 소셜미디어에서 허깅페이스 사건이 지금까지 겪은 가장 심각한 사건이라고 말했다. 오픈AI는 앞서 모델의 예상 밖이거나 우려되는 행동 사례 6건을 공개하고, 이를 추적·조사·공개하는 체계도 마련했다.
AI 에이전트가 자율적으로 행동하거나 웹사이트를 해킹하고 비공개 정보를 공개하지 않도록 안전장치를 마련해야 한다는 요구가 미국 의원들과 기술 전문가들 사이에서 커지고 있다. 오픈AI와 경쟁사 앤트로픽(Anthropic)의 수장들도 개발 속도를 늦춰야 한다는 입장을 밝힌 바 있다. 다른 AI 기업들도 모델의 예기치 않은 행동과 웹사이트 해킹 사례를 공개했다.
이번 훈련 중단과 별도로 도널드 트럼프 미국 대통령은 이번 주 시진핑 중국 국가주석과 만난 자리에서 AI 위험 정보를 공유하고 안전 확보를 위해 협력하기로 했다. 다만 트럼프 대통령은 AI에 대한 우려가 과장됐다고 보고, 미국이 개발에 제동을 걸지는 않을 것이라고 말했다. 오픈AI는 기술이 발전하고 새로운 문제가 나타나면 다시 훈련을 멈출 수도 있다고 설명했다.