AI 벤치마크 성능 달성 비용, 분기 평균 47% 낮아졌다

에폭AI(Epoch AI)는 AI 벤치마크에서 일정 성능을 내는 비용이 2023년 이후 분기 평균 47%씩 낮아졌다고 분석했다. IT 전문 매체 더디코더는 9월 25일 에폭AI 분석과 MIT 연구 결과를 소개했다.

같은 성능을 내는 비용은 얼마나 줄었나

에폭AI가 제시한 분기 평균 47% 하락은 연간 약 13배 비용 절감에 해당한다. 이 수치는 정해진 벤치마크 점수에 도달하는 데 필요한 모델 이용 가격을 비교한 것으로, 알고리즘 자체의 효율 향상이나 실제 업무의 생산성 비용을 뜻하지는 않는다. 에폭AI는 수학·과학·논리 퍼즐을 아우르는 벤치마크 5개를 분석했으며, 표본이 제한적이라 결과를 ‘가용한 최선의 자료에 근거한 합리적이지만 대략적인 측정’이라고 설명했다.

에폭AI는 오픈AI(OpenAI)의 o3를 사례로 들었다. 2025년 초 o3는 박사급 과학 문제를 평가하는 GPQA 다이아몬드(GPQA Diamond)에서 75%를 기록하는 데 문제당 약 30센트가 들었지만, 18개월 뒤에는 같은 점수를 내는 GPT-5.6 계열 모델의 비용이 0.04센트로 내려갔다. 에폭AI의 계산으로는 원래 비용의 725분의 1이다. 다만 며칠 전 더 저렴한 GPT-6 솔(Sol)과 루나(Luna) 모델이 출시돼 격차가 더 커졌을 가능성이 있다고 더디코더는 전했다.

MIT 연구진은 아티피셜 애널리시스(Artificial Analysis)의 2024년 4월부터 2025년 11월까지 가격 자료를 활용해 더 많은 모델을 비교했다. 이들은 벤치마크 성능을 맞추는 비용이 연간 5~10배 줄었다고 추산했으며, 하드웨어 가격 하락과 업체 간 가격 경쟁 효과를 걷어내면 알고리즘 효율 향상은 연간 약 3배로 계산된다고 밝혔다. 에폭AI의 연간 13배 추산과 차이가 나는 이유는 분석에 하드웨어와 경쟁에 따른 가격 인하가 포함됐기 때문이다.

낮아진 가격이 곧 효율 향상은 아니다

MIT 연구진은 성능 향상의 일부가 문제를 풀 때 더 많은 연산을 쓰는 데서 비롯된다고 지적했다. 추론형 모델은 어려운 문제에 더 많은 계산 자원을 투입할 수 있어 토큰당 가격이 낮아져도 정답 하나를 얻는 비용은 오를 수 있다. 따라서 지난해 최고 성능과 같은 수준을 더 싸게 구현하는 것과 현재 가장 성능이 높은 모델을 한 번 실행하는 비용은 별개로 봐야 한다. 코딩·수학 평가에서도 연산량 증가가 성능 향상에 영향을 주는 양상이 나타났다.

벤치마크 점수만으로 실제 업무 능력이나 효율을 판단하기 어렵다는 점도 두 연구의 쟁점이다. 잘 알려진 시험에 맞춰 모델을 최적화하면 점수는 높아져도 실제 활용 성과로 이어지지 않을 수 있다. 에폭AI는 이를 살피기 위해 게임 규칙을 공개하지 않은 ‘미스터리 게임 퍼즐’을 포함했는데, 해당 시험에서 비용 하락 폭은 가장 작았다. 다만 이는 시험 형식이나 자료의 변동성 때문일 수도 있어 원인을 단정할 수는 없다.

모델을 고를 때는 가격 외에도 정확도, 응답 지연, 처리 가능한 문맥 길이, 출력 속도를 함께 따져야 한다. 실시간 챗봇에는 지연이 긴 저가 모델이 맞지 않을 수 있고, 자동화 작업에서는 추론형 모델이 너무 느릴 수 있다. 반대로 비싼 모델이라도 정답률이 높아 재시도 횟수를 줄이면 전체 비용을 낮출 수 있다. 이런 요소는 단순한 토큰당 가격 비교만으로는 드러나지 않는다.

RELATED ARTICLES