오픈AI, 수학 난제 372개 다룬 논문 722편 공개해 검증 논란

오픈AI(OpenAI)가 미공개 AI 모델을 주로 활용해 수학 난제 372개를 다룬 논문 722편을 공개했지만, 일부 논문이 철회·수정되면서 결과의 신뢰성과 검증 절차를 둘러싼 논란이 커지고 있다. 더컨버세이션은 10월 9일 분석에서 이번 공개가 수학계에 큰 파장을 일으켰으며, 전문가 검토가 결과의 타당성을 가릴 것이라고 짚었다.

722편 논문에 담긴 수학 난제 결과

논문들은 대수학과 기하학부터 이론 컴퓨터과학까지 다양한 분야의 미해결 문제 372개를 다룬다. 오픈AI는 결과 공개가 수학의 발전을 돕기 위한 것이라고 설명했지만, 리만 가설과 버치·스위너턴다이어 추측 등 오랜 난제에 대한 성과를 주장한 논문도 포함돼 있다. 이 두 문제는 밀레니엄 난제 7개 중 하나씩으로, 해결될 경우 각각 100만달러의 상금이 걸려 있다. 다만 논문에 담긴 주장이 실제 증명으로 인정받았다는 뜻은 아니다.

공개 규모와 방식은 ‘수학계에 쏟아진 논문 더미’라는 반응을 낳았다. 분석에 따르면 한 수학자는 자신이 좋아하는 문제의 논문을 읽어봤지만 내용을 이해하기 어려웠다고 전했다. 챗GPT(ChatGPT)의 GPT-5.6 솔(GPT-5.6 Sol)도 질문에 답하면서 주요 결과 중 적어도 하나를 ‘심각한 환각’으로 평가하고, 전문가의 전면 검토 없이 증명으로 인용하거나 제출해서는 안 된다고 판단했다. 일부 성과가 중요할 가능성과 논문이 전문가에게 읽히고 검증될 수 있는지는 별개의 문제라는 지적이다.

철회·수정과 검증 절차가 관건

오픈AI는 지난 9월 나비에-스토크스 문제의 한 사례에 대한 해법이라고 주장한 결과를 발표한 뒤에도 논란을 겪었다. 해당 문제는 밀레니엄 난제 중 하나다. 이 문제를 연구해온 수학자 트리스탄 버크마스터와 르벤트 알포게는 오픈AI가 자신들의 데이터에 접근하고 아이디어를 활용한 뒤 약 1500만달러 규모의 컴퓨팅 자원을 투입해 해법을 찾았다고 주장했으며, 오픈AI는 이를 부인했다. 더컨버세이션은 이번 대규모 공개가 앞선 논란에서 관심을 돌리려는 것일 가능성도 제기했지만, 공개 목적을 단정하지는 않았다.

AI의 수학 연구 능력은 범용인공지능(AGI) 논의와도 맞물린다. 추상 수학은 복잡한 논증으로 명제의 참과 거짓을 증명하는 분야인 만큼, 연구 수준의 수학 문제를 푸는 모델은 AI가 인간의 여러 인지 과제를 넘어설 수 있다는 기대를 뒷받침하는 사례로 제시될 수 있다. 분석은 이런 점이 기업공개(IPO)를 계획하는 오픈AI에 도움이 될 가능성도 언급했다. 회사가 최대 1조4000억달러의 기업가치를 목표로 한다는 보도가 있지만, 이는 이번 논문 공개로 확인된 가치나 성과를 뜻하지 않는다.

논문 세 편은 기초적인 오류로 철회됐고, 결과를 무효로 만드는 실수가 발견된 여러 편은 수정됐다. 이는 공개 전 검증이 충분했는지 의문을 낳는다. 수학계에서는 전문가 동료 심사를 거쳐 결과의 정확성을 확인하는 방식이 오랫동안 기준이 돼 왔으며, 기술적인 논문은 심사에 수년이 걸리기도 한다. 따라서 이번 결과도 전문가들이 충분히 살핀 뒤에야 평가가 가능하다는 게 분석의 결론이다.

오픈AI는 논문의 주요 결과 가운데 300개를 정리 증명 소프트웨어 린(Lean)으로 형식화했다고 주장한다. 린은 공리와 기본 원리에서 출발해 논리 전개를 단계별로 기계가 확인하도록 하는 시스템이다. AI가 수학 결과를 기계 검증 가능한 증명으로 자동 변환하는 ‘자동 형식화’도 진행되고 있지만, 형식화 자체가 올바르게 구현되지 않을 수 있고 AI가 만든 형식화에서 문제가 발견된 전례도 있다. 이번 형식화를 수학계가 받아들일지는 아직 불분명하며, 결국 논문과 증명 모두 전문가의 검토를 거쳐야 한다.

RELATED ARTICLES

RECOMMENDED STORIES