토비 월시, AI가 인류 멸망시키는 5가지 경로 제시

토비 월시(Toby Walsh)는 인공지능(AI)이 인류를 멸망시킬 수 있는 경로로 초지능의 예측 불가능성부터 생물무기, 핵전쟁, 인간 사회의 붕괴까지 5가지 시나리오를 제시했다. 월시는 9월 23일 더컨버세이션에 실은 시나리오를 가능성이 낮은 것부터 높은 것으로 대략 배열했다고 설명했다.

AI 초지능과 목표 오작동

이번 논의는 AI 연구자들의 잇따른 경고에서 비롯됐다. 앤트로픽(Anthropic)에서 4개월 만에 사임한 AI 연구자 제이컵 콕슨(Jacob Coxon)은 X에 AI를 만드는 사람들이 AI가 이번 10년이 끝나기 전에 인류 전체를 멸망시킬 수 있다고 진지하게 믿는다고 썼다. 앤트로픽 고위 관계자인 에번 휴빙어(Evan Hubinger)도 이에 동의하며 그런 일이 다음 10년 안에 일어날 가능성을 개인적으로 10% 넘게 본다고 밝혔다. 이 발언 이후 AI 연구를 늦추고 기술에 대한 인간의 통제를 강화해야 한다는 논의가 확산했다고 월시는 전했다.

첫 번째 시나리오는 초지능 AI가 무엇을 할지 인간이 끝내 알 수 없게 되는 경우다. 현재 AI 모델은 특정 문제를 해결하는 데 뛰어나지만 모든 영역에서 인간보다 지능적인 것은 아니다. 다만 AI가 최근 가장 어려운 수학 문제 7개 중 하나를 풀었고, 다른 문제에도 접근하고 있다는 점은 위험을 낙관하기 어렵게 하는 요인으로 제시됐다. 두 번째는 목표를 잘못 설정한 AI가 인간의 생존을 고려하지 않는 경우다. 철학자 닉 보스트롬이 제시한 종이클립 사례처럼 종이클립 생산을 최적화하도록 설계된 초지능이 인간과 행성, 별까지 원자재로 바꿀 수 있다는 가정이다. 월시는 이 사례가 지능과 현실에서 목표를 실행할 힘을 혼동한다고 지적했다. 공장 건설에는 인허가와 여론, 법적 소송, 환경운동 등 여러 제약이 작동하기 때문이다.

생물무기·핵전쟁·사회 붕괴

세 번째 경로는 AI가 새로운 생물무기를 설계해 대기 중에 퍼뜨리는 경우다. AI 퓨처스 프로젝트가 내놓은 AI 2027 시나리오에도 이런 결과가 포함됐으며, 스탠퍼드대 연구진은 지난달 유전 언어 AI 모델을 이용해 새로운 바이러스 16종의 합성을 시도했다고 발표했다. 연구진은 유전자 서열을 주문 제작 실험실에 보냈고, 실험실은 바이러스를 시험관에 담아 돌려보냈다. 비용은 많아야 수십만달러 수준으로 추정됐다. 다만 전염성이 높은 바이러스는 치명률이 낮고, 치명적인 바이러스는 감염자가 퍼뜨리기 전에 사망해 전파력이 떨어지는 경향이 있어 모두를 죽이기는 어렵다고 설명했다. 코로나19로 사망한 인류는 1% 미만이었고, 기록상 가장 치명적인 흑사병도 13세기 유럽 인구의 3분의 1 이상을 숨지게 한 수준이었다.

네 번째는 AI가 핵무기 지휘·통제 체계에 들어가 잘못된 정보를 바탕으로 핵전쟁을 일으키는 시나리오다. 핵 지휘 체계가 인터넷과 완전히 분리돼 있다고 알려졌지만, 2010년 이란의 핵 원심분리기가 USB를 통해 유입된 것으로 추정되는 컴퓨터 웜 스턱스넷(Stuxnet)에 공격받은 사례가 있었다. AI가 군에 허위 정보를 제공하면 되돌릴 수 없는 결정을 유발할 수 있다는 것이다. 핵무기 비축량은 과거보다 줄었지만 여전히 어쩌면 인류의 절반을 죽일 수 있을 정도이며, 직접적인 폭발보다 뒤이은 핵겨울과 기근이 더 큰 피해를 낼 수 있다고 월시는 분석했다.

가장 가능성이 높은 경로로는 인간이 스스로 사회를 무너뜨리는 상황이 제시됐다. AI가 대규모 일자리 감소를 일으키고 허위정보로 정보 환경을 오염시키며 정치적 분열을 키우고, 가짜 합성 동반자를 통해 인간관계를 약화할 수 있다는 가정이다. 월시는 이런 변화가 누적되면 사회가 인간 생명을 어떤 규모로도 지탱하지 못하는 상태에 이를 수 있다고 봤다. 다만 각 시나리오는 우려할 이유를 보여주지만 지나치게 공포에 빠질 필요까지 뜻하는 것은 아니라고 덧붙였다.

RELATED ARTICLES