머코어(Mercor)의 연구에서 AI 모델이 정형화된 장부 처리 과제에서 공인회계사보다 빠르고 정확했지만, 장부 마감에는 사람의 감독이 필요한 것으로 나타났다. IT 전문 매체 더디코더는 10월 2일 머코어의 연구 결과를 보도했다.
회계 과제 성적은 18개월 새 급상승
연구에는 평균 경력 5년 6개월인 공인회계사(CPA) 12명이 참여했다. 이들은 에이펙스 회계 벤치마크(APEX Accounting Benchmark)의 단순화된 과제를 수행했고, AI 모델은 이 과제에서 회계사보다 빠르고 정확하며 비용도 훨씬 적게 드는 것으로 평가됐다. 18개월 전에는 최고 성능 모델의 점수가 회계사 평균인 약 37%에도 미치지 못했지만, 현재 모델들은 같은 과제를 거의 완벽하게 해결했다는 게 연구 결과다.
다만 이 실험은 전체 벤치마크가 아니라 일부 과제를 단순화해 평가했다. 전체 에이펙스 벤치마크는 가상 회사 10곳을 대상으로 한 과제 160개로 구성됐다. 평균 경력 11년인 전문가 40여명이 개발에 참여했으며, 단순한 장부 처리 과제의 성과와 전체 회계 업무 능력을 같은 것으로 볼 수는 없다.
전체 장부 마감에는 여전히 사람 필요
전체 벤치마크에서 채점 기준 충족률은 클로드 오푸스 5.5(Claude Opus 5.5)가 61.8%로 가장 높았고, 페이블 5.1(Fable 5.1)이 61%, GPT-6 아스트라(GPT-6 Astra)가 57.9%로 뒤를 이었다. 이 수치는 채점 기준 충족률이며 과제 전체를 완수한 비율과는 다르다. 연구에 따르면 전체 과제 중 거의 60%는 어떤 모델도 완전히 해결하지 못했다.
머코어는 이번 과제가 세부 정보를 찾아내고 지시를 정확히 따르는 AI의 강점을 집중적으로 측정했다고 설명했다. 반면 고객과 대화하거나 동료와 업무를 조율하는 일, 여러 해에 걸쳐 쌓은 맥락을 활용하는 업무는 평가에서 빠졌다. 따라서 벤치마크에서 높은 점수를 얻었더라도 실제 회계 업무 전반을 독립적으로 수행하거나 장부를 마감할 수 있다는 뜻은 아니다.
머코어는 이런 업무 요소를 근거로 회계사를 대체할 수는 없다고 봤다. 다만 회계 업계 전반에서 생산성 향상이 크게 나타날 것으로 예상했다. 연구는 정형화된 회계 과제에서 AI가 보인 성과와 함께, 업무 범위가 넓어질수록 사람의 검토와 감독이 필요하다는 한계를 제시했다.