AI 아타락소스, 수천달러 훈련으로 스트라테고 최강자 꺾어

카네기멜런대(Carnegie Mellon University)·MIT·뉴욕대(New York University)·스탠퍼드대(Stanford University) 연구진이 개발한 AI 아타락소스(Ataraxos)가 스트라테고 최강자로 꼽히는 핌 니메이어(Pim Niemeijer)와 온라인 대국 20판을 벌여 15승 1패 4무를 기록했다. 아스 테크니카는 10월 2일 연구진이 16개 GPU와 수천달러의 비용으로 AI를 훈련했다고 보도했다.

아타락소스, 세계 챔피언과 20판 대국

니메이어는 세계선수권에서 네 차례 우승하고 600주 넘게 세계 랭킹 1위를 지킨 선수다. 그는 3주 동안 아타락소스와 대국하며 AI를 이길 때마다 100달러를 받기로 했지만, 단 한 판만 이겼다. 연구진은 2025년 스트라테고 세계선수권대회에서 참가자들이 AI에 도전한 40판에서도 아타락소스가 38승을 거뒀다고 전했다.

스트라테고는 각자 계급이 다른 말 40개와 폭탄, 깃발을 배치해 상대의 깃발을 잡는 게임이다. 각 말의 위치는 보이지만 정체는 전투가 벌어져야 드러난다. 가능한 말 배치는 10의 30제곱을 넘을 정도로 많고, 한 판이 2000수까지 이어지기도 한다. 포커와 달리 숨겨진 정보의 규모가 크고 게임도 길어, 상대의 패를 추정하면서 허세와 대응을 조절해야 한다.

숨은 정보를 추정하고 수를 앞서 읽어

아타락소스는 앞서 딥마인드(DeepMind)가 개발한 딥내시(DeepNash)처럼 스스로 대국하며 학습했다. 연구진은 총 1억6300만 판의 자가 대국에서 승리로 이어진 수는 더 자주 선택하고 패배를 부른 수는 줄이는 방식으로 훈련했다. 다만 숨은 정보가 있는 게임에서는 학습 과정이 같은 전략을 오가는 문제가 생길 수 있어, 초반에는 전략을 크게 바꾸고 후반에는 변화 폭을 줄였다.

핵심 차이는 매 수를 두기 전에 여러 가능성을 따져보는 탐색 기능이다. 딥마인드는 가능한 말 배치가 너무 많아 이를 구현하지 못했지만, 아타락소스는 상대의 움직임을 토대로 숨겨진 말을 추정하는 별도의 신경망을 사용했다. 모든 배치를 살펴보는 대신 그럴듯한 경우를 뽑아 후보 수를 시험하고 결과가 좋은 수를 고른다. MIT의 컴퓨터과학자 가브리엘레 파리나는 이 방식으로 인간이 아는 비밀을 의식해 피하는 수와 달리, AI는 약점이 드러나지 않도록 행동할 수 있다고 설명했다.

딥내시보다 낮은 훈련 비용

아타락소스는 불리한 상황에서도 무리한 승부수를 두기보다 천천히 승률을 끌어올리는 경향을 보였다. 뉴욕대 연구자 유진 비니츠키는 AI가 승리 가능성이 2%로 추정되는 상황에서도 침착하게 역전을 노리는 모습을 확인했다고 말했다. 연구진은 AI의 플레이가 대회 참가자들의 전략에도 영향을 줬으며, 폭탄 두 개만으로 깃발을 지키는 배치가 주목받았다고 전했다.

비용도 기존 시스템과 차이를 보였다. 딥내시는 구글(Google)의 전용 칩 1024개로 2~3개월 훈련됐으며, 연구진은 2025년 가격 기준 비용을 300만~450만달러로 추산했다. 아타락소스의 훈련에는 GPU 16개와 수천달러가 들었다. 다만 한 판의 승패에는 무작위 배치에 따른 운도 작용해 완벽한 전략도 질 수 있다고 파리나는 설명했다.

RELATED ARTICLES