핵심 요약
AI 전문가와 슈퍼예측가의 지난 4년간 예측 기록을 채점한 결과, 벤치마크 점수는 거의 예외 없이 실제 발전 속도를 얕잡아본 것으로 드러났다. 반면 로보택시 상용화와 생물학 실험실 보조처럼 물리적 현실과 결합해야 하는 문항은 당초 기대보다 훨씬 더딘 속도를 보이며 예측치를 크게 밑돌았다.
예측연구소(Forecasting Research Institute, FRI)가 9월 23일 발표한 「AI 발전 예측은 지금까지 얼마나 정확했나」(How Accurate Have AI Progress Forecasts Been So Far?) 보고서가 바로 그 공식 채점표다. 조시 로젠버그(Josh Rosenberg)를 비롯한 4인의 연구진은 이번 분석을 예측 정확도에 관한 ‘중간 점검'(interim update)이자 향후 이어질 정기 연재의 첫 편으로 규정했다. 채점 대상에는 도메인 전문가뿐 아니라 일반인 확률 전문가 집단인 슈퍼예측가도 함께 포함됐다.
예측 토너먼트에서 오랜 기간 꾸준히 상위권 적중률을 기록한 일반인 분석가를 ‘슈퍼예측가(superforecaster)’라고 부른다. AI 파운데이션 모델을 직접 개발하지는 않지만 정밀한 확률 추론 능력을 검증받은 집단이다. 이번 검증 작업은 과거 일기예보의 예측 적중률을 실제 이듬해 관측된 기상 데이터로 정밀 대조하는 과정과 맞닿아 있다.
4년의 예측 데이터와 339명 패널… 채점표의 설계 방식
FRI는 2022년 중반부터 2026년 8월까지 자체 수행한 연구 6건에서 축적된 예측치를 실제 관측치와 정면으로 대조했다. 가장 핵심적인 데이터 원천은 동일한 전문가 집단에게 매달 질문을 던지는 3년 주기 종단 패널인 LEAP(Longitudinal Expert AI Panel)다. 2025년 중반 출범한 이 패널에는 컴퓨터과학자 76명, AI 업계 종사자 76명, 경제학자 68명, 정책 연구자 119명 등 전문가 339명과 슈퍼예측가, 일반인 통제군이 참여하고 있다.
가장 오래된 비교군은 2022년 중반 개최된 실존 위험 설득 토너먼트(XPT)의 데이터다. 여기에 특정 영역을 깊이 파고든 AI 생물학적 위험 연구와 AI 경제 효과 예측 연구, 사이버 보안 파일럿 및 실험실 실험 결과가 종합 채점표에 반영됐다.
채점은 크게 세 갈래 방식으로 진행됐다. 공식 마감 시점이 지난 문항은 실제 결과값과 직접 대조했고, 공식 마감 이전이라도 현재 관측값이 당초 예측치를 이미 넘어선 문항은 ‘과소평가’로 조기 판정했다. 현재 시점에서 실제 관측값조차 집계되지 않은 미래 문항은 GPT-5.5에게 과거 데이터의 기울기를 바탕으로 미래 선을 그대로 이어 붙이게 하는 ‘단순 추세 연장’ 방식으로 가채점했다. 최종 시험 전에 중간 성적으로 미리 채점표를 매긴 구조다.
FRI는 채점 결과를 기술 역량, 도입·확산, 파급효과, 지정학·거버넌스의 4개 축으로 분류했다. 이 가운데 데이터의 방향성이 가장 극명하게 갈린 영역은 기술 역량과 도입·확산 두 분야였다.
수학 올림피아드부터 코딩까지… 벤치마크를 앞지른 추론 가속
가장 극적인 결과는 AI 수학 실력의 상징인 국제수학올림피아드(IMO) 금메달에서 나타났다. 2022년 XPT 조사 당시 전문가들은 AI의 IMO 금메달 달성 시점을 2030년, 슈퍼예측가들은 2035년으로 내다봤다. 그러나 실제 금메달은 2025년 7월에 공식 발표되며 전문가 전망보다 5년, 슈퍼예측가보다 무려 10년 앞섰다. XPT가 다룬 4대 벤치마크 전체에서도 동일한 그림이 그려졌다.
“슈퍼예측가들이 4대 AI 벤치마크의 실제 관측 결과에 부여했던 사전 발생 확률은 평균 9.7%에 불과했다. 도메인 전문가의 확률 부여값 역시 24.6%에 그쳤다.”
— FRI 중간 점검 보고서 중
2022년의 예측은 챗GPT(ChatGPT) 출시 이전에 그려진 청사진이었던 만큼 예상이 빗나갈 여지가 있었다. 그러나 심층 추론 모델이 본격적으로 자리 잡은 2025년 중반 이후 측정된 LEAP 패널의 예측치조차 현실의 가파른 진보를 따라잡지 못했다. FRI 공개 대조표에 기록된 핵심 문항별 격차는 다음과 같다.
LiveCodeBench Pro에서는 공식 평가 마감을 7개월 앞둔 시점에 이미 예측치의 4배에 가까운 53.8%가 나왔다. 사람 기준으로 몇 시간 걸리는 복합 작업을 AI가 80% 확률로 끝내는지 재는 METR 시간 지평 지표 역시 가파른 상승 곡선을 그렸다. 앤트로픽(Anthropic)이 2026년 5월 8일 선보인 미소스(Mythos) 프리뷰가 3시간 6분을 기록하며 연말 예측치에 이미 바짝 다가섰다. 다만 중국 모델의 2026년 말 Epoch 역량 지수(ECI) 예측 등 하드웨어 물리 제약이 걸린 지표는 대체로 예측 궤도에 부합하는 흐름을 보였다.
보고서 작성 막바지에는 더욱 중대한 소식이 전해졌다. LEAP 패널은 2027년 말까지 AI가 수학 7대 밀레니엄 난제 중 하나를 해결할 확률을 전문가 10%, 슈퍼예측가 5.4%로 극히 낮게 책정한 바 있다.
“보고서를 작성하는 도중, 오픈AI(OpenAI)가 GPT-6 아스트라(Astra)를 뛰어넘는 강력한 내부 모델을 활용해 밀레니엄 난제 중 하나인 나비에-스토크스(Navier-Stokes) 방정식을 해결했을 가능성이 높다는 소식이 전해졌다.”
— FRI 보고서 중
수학계의 공식적인 동료 평가와 검증이 완료되지 않은 만큼 FRI는 이 사안을 공식 해결 판정으로 확정 짓지는 않았으나, 추론 능력의 진폭이 전문가들의 상상을 초월하고 있음을 시사하는 대목이다.
경제학자 예측의 6배… 폭발하는 AI 연환산 매출
도입 및 확산 영역에서의 과소평가는 자본 시장 지표에서 가장 극명하게 분출됐다. 2025년 10월부터 2026년 2월까지 진행된 경제 효과 예측 연구는 2026년 말 기준 가장 큰 연간 반복 매출(ARR)을 올릴 AI 기업의 매출액을 물었다. 연간 반복 매출은 직전 한 달 매출에 12를 곱해 계산하는 대표적인 성장 지표다.
당시 집계된 전망치 중앙값은 AI 전문가 200억달러(약 27조원), 경제학자 160억달러(약 22조원), 슈퍼예측가 250억달러(약 34조원)였다. 그러나 9월 22일 기준 보도된 앤트로픽의 연환산 매출은 1000억달러(약 136조원)로, 경제학자 그룹 예측의 6배를 가볍게 넘어섰다. 뉴욕타임스(The New York Times) 보도에 따르면 이는 불과 두 달 전보다 50% 급증한 연환산 성장 속도(Run-rate)다. 동네 가게의 첫해 매출을 점치는 사이 가게가 백화점으로 변해버린 격이다.
양대 프런티어 기업의 합산 실적도 당초 기대를 훌쩍 뛰어넘었다. LEAP 패널은 2026년 말 앤트로픽과 오픈AI의 합산 연환산 매출을 전문가 700억달러(약 95조원), 슈퍼예측가 900억달러(약 122조원)로 내다봤다. 그러나 현재 오픈AI(400억달러)와 앤트로픽(1000억달러)의 합산 규모는 이미 약 1400억달러(약 190조원)에 도달해 당초 예측치를 1.5~2배 웃돌고 있다.
실제 업무 현장의 도입률 역시 예측치를 앞섰다. 2025년 미국 전체 근로시간 중 생성형 AI의 지원을 받은 업무 비중은 전문가(4%)와 슈퍼예측가(3.6%) 모두 보수적으로 보았으나, 실제 관측치는 5.7%로 집계됐다.
모델 훈련에 쏟아붓는 자본의 규모도 예상을 훌쩍 뛰어넘었다. 2030년까지 단일 AI 모델의 최고 학습 비용에 대해 전문가는 1억8000만달러(약 2440억원), 슈퍼예측가는 1억달러(약 1360억원)를 전망했다. 그러나 일론 머스크가 이끄는 xAI의 그록(Grok) 4 단일 모델 학습 비용만으로 이미 약 3억8800만달러(약 5270억원)가 투입된 것으로 추정된다. 반면 발전소 인프라나 대규모 데이터센터처럼 물리적 설비 확충이 필요한 자원 지표는 기존 예측 궤도와 대체로 비슷하게 흘러가고 있다. 발전소와 데이터센터 건물은 소프트웨어 모델처럼 한 달 만에 두 배로 늘어날 수 없기 때문이다.
로보택시와 습식 실험실… 물리 세계에서 마주한 마찰력
소프트웨어 생태계를 벗어나 AI가 물리적 현실과 상호작용해야 하는 문항에서는 예측의 오차 방향이 180도 역전됐다. LEAP 패널은 2027년 한 해 동안 미국 차량호출 서비스 중 자율주행차가 담당할 운행 비중을 조사했다. 당시 전문가 중앙값은 7.3%, 슈퍼예측가는 2%를 제시했다. 현재 GPT-5.5가 기존 흐름을 그대로 이어 붙여 추정한 값은 2.5%에 머물고 있다.
자율주행 알고리즘의 주행 실력만으로는 로보택시가 도심 도로를 가득 채울 수 없다. 특수 차량의 대량 양산 설비, 지자체별 운행 인가 허가, 사고 책임 소재를 규정할 보험 체계가 물리적 시간표에 맞춰 순차적으로 결합해야 하기 때문이다. FRI는 전문가 집단의 7.3% 전망치가 상당한 수준의 과대평가로 귀결될 가능성이 높다고 분석했다.
더 선명한 반례는 실험실 현장에서 드러났다. FRI가 별도로 집행한 무작위 대조 실험(RCT)에서는 이공계 학부생 153명에게 8주간 세포 배양, 분자 클로닝, 바이러스 생산 과제를 맡겼다. 인터넷 검색만 쓴 대조군의 3대 과제 완수율은 6.6%, 최신 LLM을 함께 쓴 실험군의 완수율은 5.2%에 그쳤다. 두 집단의 차이는 통계적으로 유의미하지 않았으며, 최첨단 AI가 비전문가의 물리적 실험 성공률을 끌어올린 흔적은 찾아볼 수 없었다.
사전 예측치는 현실보다 터무니없이 높았다. LLM 실험군의 과제 완수율에 대해 바이러스학 전문가는 40%, 바이오보안 전문가는 22.5%, 슈퍼예측가는 16.2%의 높은 수치를 점쳤다.
“예측자 중앙값은 LLM 지원 없이 인터넷만 사용한 대조군이 3대 핵심 실험 과제를 완수할 확률(예측 12% vs 실제 7%)부터 이미 과대평가하고 있었다.”
— FRI 무작위 대조 실험(RCT) 보고서 중
바이러스 지식 문제 해결 벤치마크(VCT)에서 AI는 2025년 4월 이미 최상위 연구진 수준에 도달했으나, 연구자의 손을 거쳐야 하는 실제 실험 현장에서는 보조 효과가 작동하지 않았다. 완벽한 요리책을 암기했다고 해서 칼질과 불 조절이 하루아침에 체득되지 않는 이치와 같다.
전문가 대 슈퍼예측가… 영역별로 엇갈린 적중률
평가 문항의 성격에 따라 두 집단의 판정승은 뚜렷하게 갈렸다. 가상공간의 알고리즘 역량과 기술 진보 문항에서는 도메인 전문가가 실제에 더 근접했던 반면, 현실 세계의 복잡한 마찰력이 개입하는 문항에서는 슈퍼예측가가 더 정밀한 통찰을 입증했다.
실제로 4대 벤치마크 적중 확률(24.6% vs 9.7%)과 IMO 금메달 시점(2030년 vs 2035년)에서는 전문가 집단이 앞섰다. 반면 자율주행 시장 침투율(2% vs 7.3%)과 실험실 과제 완수율(16.2% vs 22.5%)에서는 보수적 기준선을 유지한 슈퍼예측가의 판정승이었다. 신중함은 기술의 날씨가 급변하는 날엔 약점이었지만, 현실이 들뜬 날엔 강점으로 작용했다. AI 최고 기업 매출 예측에서도 슈퍼예측가의 250억달러 전망이 전문가의 200억달러보다 실제치에 더 가까웠으며, 가장 낮게 본 집단은 경제학자(160억달러)였다. 반면 실험실 문항에서 가장 크게 빗나간 쪽은 바이러스학자였다. 자기 분야를 깊이 아는 만큼 AI가 연구를 도울 여지 또한 지나치게 낙관했을 가능성이 크다.
예측자들 역시 누적된 오차 데이터를 바탕으로 전망치를 빠르게 수정하고 있다. 기술의 문명사적 파급력을 지진 규모처럼 10단계로 계량화하는 ‘기술 리히터 척도(Technological Richter Scale, TRS)’에 그 궤적이 고스란히 반영됐다. TRS 8단계는 전기 상용화에 비견되는 ‘세기의 기술’, 9단계는 농경의 시작과 맞먹는 ‘천년의 기술’을 의미한다.
LEAP 8차 조사(2026년 5월)에서 1차와 8차에 모두 응답한 동일 패널의 TRS 평균값은 전문가 집단이 7.86에서 8.06으로, 슈퍼예측가 집단이 7.50에서 7.89로 동반 상승했다. 응답자들은 FrontierMath와 METR 지표의 폭발적인 상승세를 전망치 상향의 직접적인 이유로 꼽았다. 2040년까지 AI가 8단계에 도달할 확률은 전문가 35%, 슈퍼예측가 34%로 집계됐다. 예측자들 역시 현실을 학습하고 있으나 기술의 가속 페달보다는 늘 한 박자 늦게 움직이고 있다.
“예측자들은 가상공간에서는 기술의 가속도를 과소평가했고, 물리적 현실에서는 마찰력의 크기를 간과했다.”
디지털 가속과 물리적 마찰… 예측 궤적을 가른 결정적 분기점
FRI는 보고서에서 도입·확산 영역의 결과를 단순 ‘혼재(mixed)’로 정리했다. 그러나 데이터가 현실 산업과 맞닿는 물리적 경로를 기준으로 재구조화하면 오차의 원인과 분기점이 명확해진다.
소프트웨어와 가상 생태계 내부에서 완결되는 지표는 한결같이 예측 속도를 추월했다. 벤치마크 점수와 기업 매출, 근로시간 침투율이 모두 대표적인 사례다. 새로운 파운데이션 모델이 공개되는 즉시 클라우드 API와 앱 인터페이스를 통해 한계비용 없이 전 세계 시장에 실시간으로 배포되기 때문이다.
반면 특수 하드웨어, 공장 제조 설비, 규제 인허가, 인간의 물리적 숙련도를 거쳐야 하는 지표는 예측보다 확연히 느렸다. 로보택시의 시장 점유율과 생물학 습식 실험 성공률이 대표적이다. 아무리 뛰어난 지능을 갖춘 모델이 등장하더라도 현실의 확산 속도는 완성차 공장의 생산 능력, 도시별 규제 장벽, 연구자의 물리적 손기술이라는 마찰력에 종속된다.
과소평가 편향과 ‘AI의 AI 채점’… 중간 채점표의 한계
이번 중간 채점표가 지닌 본질적인 한계는 FRI 연구진 스스로도 인정하고 있다.
“우리의 평가 방법론은 AI 발전의 과대평가보다 과소평가를 더 쉽게 포착하도록 구조적으로 편향되어 있다.”
— FRI 평가 방법론 보고서 중
과소평가는 공식 마감 기한 이전이라도 실제 관측치가 당초 목표치를 넘어서는 순간 조기에 확정된다. 반면 과대평가는 정해진 마감 시점이 모두 지나고 나서야 비로소 결승선을 넘지 못했음을 증명할 수 있다. 현재 공개된 채점표에 유독 과소평가 문항이 압도적으로 많은 이유 중 상당 부분은 이 같은 시점의 비대칭성에서 비롯된다.
“과소평가는 결승선에 도달하기 전에 조기 확인되지만, 과대평가는 결승선을 통과해야만 비로소 확정된다.”
평가 문항이 정량적 벤치마크에 편중된 점도 짚어봐야 한다. 거시 경제성장률, 고용 시장의 대규모 대체, AI로 인한 팬데믹 발생 여부와 같은 거시 사회적 파급효과 문항은 대부분 공식 마감이 한참 남아 있어 평가할 근거가 절대적으로 부족하다. 몇 안 되는 단기 사회적 인식 문항의 경우, AI를 부정적으로 인식하는 미국인 비율(예측 33% vs 실제 32.9%)처럼 실제 결과와 소수점 단위까지 일치했다.
수치 자체의 성격도 가려볼 대목이다. 앤트로픽의 1000억달러 매출은 언론이 추정한 연환산 속도일 뿐 회사가 공식 확정한 재무제표 수치가 아니다. 연간 반복 매출은 특정 한 달의 실적에 따라 수치가 크게 출렁인다. 나아가 공식 마감이 끝나지 않은 미래 문항의 상당수를 GPT-5.5가 과거 데이터를 바탕으로 선을 단순히 이어 붙여 추정한 값에 기대어 가채점했다는 점 역시 한계로 꼽힌다. AI의 미래 예측이 맞았는지를 검증하는 채점표에서, 정작 아직 오지 않은 미래의 채점 기준선조차 또 다른 AI가 임의로 이어 그린 추세선에 맡겨버린 순환 논증의 덫이다. 실험실 연구 역시 2025년 시점의 초기 모델과 비전문가 153명을 대상으로 진행됐으므로, 최신 모델이나 고도로 숙련된 연구진에게도 동일한 결과가 나온다고 단언할 수는 없다.
물리적 현실의 마찰력이 영구 불변의 벽은 아니다. 규제 빗장이 일거에 풀리거나 전용 생산 설비가 궤도에 오르는 순간 자율주행과 로보틱스 역시 지수함수적 확산 단계로 진입할 수 있다. 이번 FRI 보고서는 장기 연재의 첫 번째 중간 점검일 뿐이며, 로보택시를 비롯한 실전 채점표의 최종 답안지는 2027년 말이 되어야 온전히 회수된다.