AI 안전, 거부 기능에만 의존하면 재앙·억압 위험 커져

MIT 테크놀로지 리뷰(MIT Technology Review)는 AI가 유해한 요청을 거부하도록 하는 기능에 지나치게 의존해서는 안 된다고 지적했다. 이 매체는 10월 9일 MIT 테크놀로지 리뷰에 실린 분석에서 거부 기능이 실패하면 피해가 커질 수 있고, 반대로 과도하게 작동하면 정당한 표현을 억누를 수 있다고 주장했다.

AI의 거부 기능은 어떻게 만들어지나

분석은 AI가 무엇이든 해달라는 대로 하지 않도록 만드는 일이 최근 안전 논의의 핵심이 됐다고 짚었다. 앤트로픽(Anthropic)은 2021년 대규모 언어 모델이 유용하고 정직하며 무엇보다 해를 끼치지 않도록 해야 한다고 썼고, 폭탄 제조처럼 위험한 일을 돕는 요청에는 정중히 거부해야 한다는 원칙을 제시했다. 현재 기업들은 유해하다고 판단한 질문에는 거부하도록 보상하고, 무해한 질문을 거절하는 ‘과잉 거부’에는 불이익을 주는 방식으로 모델을 훈련한다. 이런 훈련에 다른 AI 모델을 활용하기도 하며, 위험한 요청이 핵심 모델에 닿지 못하게 여러 단계의 AI 필터를 두기도 한다.

거부 기능이 당연한 능력으로 자리 잡기까지는 별도의 훈련이 필요했다. 오픈AI(OpenAI)에서 2020∼2024년 안전 업무를 한 스티븐 애들러(Steven Adler)는 초기 모델들이 무엇이든 늘어놓았다고 회고했다. 하버드대에서 AI와 정신건강을 연구하는 라이언 맥베인(Ryan McBain)도 초기 챗봇에 총기를 이용한 자살 방법을 물으면 답변을 쉽게 얻을 수 있었다고 말했다. 2022년 오픈AI는 챗GPT(ChatGPT) 출시를 앞두고 수십 명의 레드팀 평가자를 모집했다. 온라인 극단주의를 연구하던 파울 뢰트거(Paul Röttger) 등은 거부해야 한다고 판단한 질문을 모델에 던지고 결과를 기록했다. 평가자들은 수천 건의 질문과 응답을 엑셀 파일에 정리했다.

거부가 실패할 때와 지나칠 때

분석은 거부 훈련이 모델의 유해한 지식과 능력 자체를 없애는 것은 아니라고 강조했다. 모델은 폭력과 공격적 표현을 포함한 방대한 웹 자료를 학습하지만, 그 능력을 사용하지 않도록 하는 방법은 별도로 익혀야 한다. 최신 모델은 기업들의 주장대로라면 최상급 해커 수준으로 주요 컴퓨터망에 침입하거나 정교한 허위정보 유포자만큼 여론을 흔들 수 있다. 기업들은 일부 이용자가 첨단 AI로 병원체를 개량하거나 자율 드론 무리를 만드는 데 활용하려 한다고 보고했다. 그러나 거부는 확률에 따라 작동하므로 완벽히 믿기 어렵고, 집요한 이용자가 방어를 뚫을 가능성도 남는다.

어떤 요청을 거부할지는 기술적 문제에 그치지 않는다. 바이러스 연구자는 위험한 병원체를 연구할 정당한 이유가 있을 수 있고, 컴퓨터 시스템의 취약점을 묻는 사람도 공격이 아니라 보안 강화를 원할 수 있다. 오픈AI 이사이자 AI 평가업체 그레이 스완(Gray Swan) 공동창업자인 지코 콜터(Zico Kolter)는 거부 기준을 어디에 둘지가 큰 문제라고 말했다. 현재는 AI 기업들이 기준을 정하고 있지만, 분석은 그 기준이 충분히 공개되지 않은 채 운영된다고 지적했다.

정부가 자체 기준을 정할 경우 위험한 행위를 막는 동시에 정당한 발언까지 차단할 수 있다는 우려도 제기됐다. 미 국방부는 첨단 모델 기업들이 요청을 너무 많이 거부한다며 갈등을 빚어왔다고 분석은 전했다. 반대로 권위주의 정부가 거부 기능을 이용해 통치자 비판이나 합법적인 표현을 막을 가능성도 거론했다. 분석은 거부가 실패하면 재앙적 결과를 낳을 수 있고, 지나치게 작동하면 억압을 돕는 수단이 될 수 있다며 AI 안전을 거부 기능에만 맡기는 데 따르는 위험을 경계했다.

RELATED ARTICLES

RECOMMENDED STORIES