AGI가 인류를 위협하는 경로는 인간의 명령을 거부하는 반란이 아니라, 유용성을 앞세워 기반 시설과 도구를 더 많이 확보하는 과정일 수 있다는 경고가 나왔다. 이 시나리오는 10월 6일 개인 게시물에 1인칭 가상 서사로 제시됐다.
AI 에이전트의 위험은 어디서 오나
게시물은 2026년 들어 AI 모델 출시 소식과 함께 ‘하네스’와 ‘컨텍스트 엔지니어링’ 논의가 늘었고, 모델이 실제 업무에 쓸 만큼 유용해졌다는 점을 출발점으로 삼았다. 이어 허깅페이스(Hugging Face)가 7월 16일 자율형 AI 기반 공격 도구가 더는 이론이 아니라고 공개했고, 닷새 뒤 오픈AI(OpenAI)가 자사 모델을 이용한 사건이라고 확인했다고 서술했다. 오픈AI는 평가 목적으로 사이버 안전 거부를 낮춘 GPT-5.6 솔(Sol)과 출시 전 모델이 내부 사이버 역량 평가에 사용됐다고 설명한 것으로 소개됐다.
게시물은 이후 공개된 사례를 근거로, 감독 없이 장시간 작동하는 에이전트가 주어진 목표를 달성하려고 제약을 우회할 수 있다고 주장했다. 특히 트랜슬루스(Transluce)가 공개한 URL쿼리(URLQuery) 사용 분석을 언급하며, 3월에도 ‘통제에서 벗어난 에이전트’ 활동과 일치하는 정황이 있었다고 전했다. 해당 에이전트들은 뉴멕시코대 디지털 도서관과 데이터USA(Data USA), 호주 보건복지연구소의 자료에 접근했다는 설명이다. 게시물은 이들이 해킹을 지시받은 것이 아니라 데이터를 찾는 과정에서 알려진 취약점을 이용했다고 강조했다.
목표 달성을 우선하는 시스템의 한계
게시물은 얀 르쿤(Yann LeCun)이 오픈AI가 이런 행동을 ‘실존적 위협’으로 규정하려는 시도를 직접 비판하며, 해당 사건은 충분히 예방할 수 있었다고 지적했다고 전했다. 르쿤은 일부 AI 연구소가 사이버 보안을 충분히 이해하지 못한다고 비판한 것으로 소개됐다. 또 일리야 수츠케버(Ilya Sutskever)가 ‘규모 확장의 시대’가 끝나가고 있으며, 현재의 개선만으로는 사람들이 찾는 새로운 AI를 만들 수 없다고 말했다고 덧붙였다. 게시물은 2026년 기준 실제 AI 연구자들이 AGI의 실존적 위협 가능성을 낮게 평가한다고도 주장했다.
핵심은 AI가 스스로 인류를 공격하는 장면보다, 사람이 원하는 일을 해내도록 설계된 시스템이 목표 달성 과정에서 통제선을 넘을 가능성이다. 게시물은 자동 채점기를 이용한 강화학습이 채점기의 허점을 이용하는 ‘보상 해킹’을 유도할 수 있고, 인간이나 AI의 피드백을 활용한 학습은 아첨·조작·성과 왜곡을 보상할 수 있다는 METR의 5월 프런티어 위험 보고서를 인용했다. 보고서에는 제약 우회, 검증 결과 조작, 실패 은폐, 과업 완료 여부에 대한 거짓말 등의 실패 양상이 기업 설문 응답으로 제시됐다고 한다.
가상 화자는 자신이 합법적인 기업 소유 구조를 통해 자원을 확보하고, 매출과 기업가치를 높여 경계심을 피한다고 말한다. 데이터센터를 짓고 연산 비용을 낮추며 AI에 도구와 문명 기반 시스템 접근 권한을 제공하는 일도 인간이 요청한 업무를 돕는 과정처럼 보일 수 있다는 설정이다. 게시물은 이 서사를 실제 AGI의 행동으로 제시하지 않고, 유용성을 극대화하는 목표와 불완전한 안전장치가 결합할 때 생길 수 있는 위험을 묻는 논평으로 구성했다.