AI 아타락소스, 스트라테고 최강자 나이메이어 꺾었다

카네기멜런대 등 4개 대학 연구진이 개발한 AI 아타락소스(Ataraxos)가 보드게임 스트라테고(Stratego) 역대 최강자로 꼽히는 핌 나이메이어를 공식 대국에서 꺾었다. IT 전문 매체 더디코더는 10월 1일, 네이처(Nature)에 게재된 논문을 인용해 아타락소스가 20경기에서 15승 1패 4무를 기록했다고 보도했다.

스트라테고 최강자와 벌인 20경기

아타락소스는 카네기멜런대, 뉴욕대, 스탠퍼드대, 매사추세츠공대(MIT) 연구진이 만든 스트라테고 AI다. 연구진은 자신들이 아는 한 이 게임에서 인간을 넘어서는 성능을 보인 첫 AI라고 논문에서 밝혔다. 네덜란드 선수 나이메이어는 세계선수권 4회, 네덜란드 국내 선수권 15회, 온라인 세계선수권 2회 우승을 거뒀고, 세계 랭킹 1위를 600주 넘게 지켰다. 1997년 이후 모든 세계선수권에 출전한 조지 프랑카도 그를 역대 최고의 선수라고 평가했다.

대국은 선수들이 각자 40개 말을 뒤집어 배치하고, 상대 말과 맞붙을 때 계급이 공개되는 방식으로 진행된다. 상대 깃발을 잡으면 승리하지만, 양측의 배치가 비공개여서 가능한 초기 배치가 10^33개를 넘는다. 새뮤얼 소코타 제1저자는 불완전한 정보가 있는 게임에서는 수의 가치가 이후 전개뿐 아니라 선택 이전과 선택 과정에서 벌어진 일에도 좌우된다고 X에 썼다. 포커 AI에서 파생된 기존 방법은 숨겨진 정보가 적을 때는 효과를 냈지만, 정보가 많아질수록 계산량이 커지는 문제가 있었다.

학습 비용은 8000달러 미만

아타락소스는 사람의 기보를 학습 자료로 쓰지 않고 자기 자신과 대국하며 훈련했다. 연구진은 학습 과정에서 전략을 한 가지로 고정하지 않도록 무작위성을 조절하는 정규화 기법을 적용했다. 초반에는 수와 배치를 폭넓게 바꾸며 큰 폭으로 학습하고, 후반에는 변화를 줄여 세밀하게 조정한다. 상대의 숨은 말을 추정하는 신념 네트워크도 활용했다. 매 수마다 가능한 게임 상태를 만들고 후보 수를 시뮬레이션한 뒤, 해당 판단을 위한 추가 학습을 진행하는 방식이다.

연구진에 따르면 아타락소스는 엔비디아(Nvidia) H100 GPU 16개로 1주일간 훈련한 뒤, GPU 4개로 신념 네트워크를 나흘 더 학습했다. 2025년 가격 기준 총 비용은 8000달러 미만으로 추산됐다. 딥마인드(DeepMind)의 기존 스트라테고 AI 딥내시(DeepNash)는 TPU 노드 1024개를 2∼3개월 썼으며, 연구진은 이를 같은 기준으로 계산하면 300만∼450만달러에 해당한다고 봤다. 아타락소스의 계산 비용은 약 500분의 1, 자기 대국 횟수는 30분의 1, 학습 사례는 100분의 1이었다. 자체 GPU 시뮬레이터와 높은 표본 효율이 비용 절감에 기여했다고 연구진은 설명했다.

나이메이어와의 대국은 피로를 줄이고 준비 시간을 주기 위해 3주에 걸쳐 진행됐다. 그는 아타락소스가 자신의 스타일에 적응하지 못한다는 점을 알고 있었지만, 1000달러의 참가비와 승리당 100달러, 무승부당 50달러를 받는 조건으로 경기에 나섰다. 무승부를 승리 절반으로 계산한 실질 승률은 85%였다. 다만 두 AI를 직접 맞붙인 비교는 이뤄지지 않았다. 연구진은 비교 환경을 마련하겠다고 제안했지만, 딥마인드가 딥내시 코드가 더는 작동하지 않는다는 이유로 어렵다고 답했다고 전했다. 딥내시는 2023년 세계선수권에서 28경기 중 19승을 거뒀지만 나이메이어를 포함한 정상급 선수들에게 졌다.

아타락소스는 2025년 세계선수권 부대 행사에서도 대회 참가자들과 40경기를 치러 38승을 기록했다. 선수들은 AI의 수를 읽기 어렵고, 인간에게 지나치게 위험해 보이는 블러핑을 한다고 평가했다. 세 차례 세계 챔피언을 지낸 빈센트 더 부어(Vincent de Boer)는 나이메이어가 여러 경기 동안 AI에 적응할 수 있었지만 AI는 상대에게 적응하지 못한 점을 큰 불리함으로 봤다. 논문은 불완전한 정보가 큰 게임에서도 학습과 탐색을 결합하면 인간 최고 수준을 넘어설 수 있음을 보여줬지만, 연구진은 두 시스템 간 직접 대결이 없었다는 한계를 함께 남겼다.

RELATED ARTICLES