핵심 요약
개발자들이 AI 모델을 골라 쓰는 중개 서비스 오픈라우터(OpenRouter)에서 오픈웨이트 모델이 토큰의 3분의 2를 처리했다. 하지만 이용료는 4분의 1만 받았다. 나머지 4분의 3은 클로드(Claude)와 GPT 같은 폐쇄형 모델에 돌아갔다.
오픈라우터 랭킹 페이지의 9월 20~26일 7일치 원자료를 전수 분석한 결과다. 이 기간 오픈라우터를 거친 토큰은 142조6500억개, API 호출 요청은 65억7000만건에 달했으며 이용료는 2294만달러(약 311억원)가 청구됐다. 이 방대한 물동량 가운데 오픈웨이트 모델은 전체 토큰의 66.8%를 처리하고도 청구액 점유율은 27.2%에 머물렀다.
학습을 마친 매개변수 가중치 파일을 누구나 내려받아 직접 구동할 수 있게 공개한 모델을 오픈웨이트(Open-weights)라고 부른다. 반대로 빅테크 개발사가 가중치를 독점한 채 자체 API로만 판매하는 모델이 폐쇄형이다. AI가 텍스트를 읽고 생성하는 최소 연산 단위는 토큰(Token)이며, 한국어 한 글자는 통상 토큰 1~2개로 환산된다.
오픈라우터가 집계하는 세 가지 잣대
오픈라우터는 API 키 하나로 수백 개 모델을 유연하게 교체하며 호출할 수 있게 해주는 중개 플랫폼이다. 오픈라우터 랭킹 페이지는 “수백만 개발자가 오픈라우터 API로 처리한 토큰”으로 모델 순위를 매긴다. 입력과 출력 토큰을 모두 합산하며, 이용자가 비공개로 설정한 요청은 집계 단계에서 제외된다.
같은 페이지에는 성격이 다른 세 가지 지표가 혼재되어 있다. 모델 순위표는 토큰 처리량을 기준으로 삼지만 개발사별 점유율 그래프는 요청 건수를 센다. 공식 페이지 가이드는 이 차이를 직접 명시하고 있다.
“상위 모델(Top Models) 차트와 LLM 리더보드는 처리한 토큰량으로, 시장 점유율(Market Share) 차트는 API 요청 건수로 순위를 매긴다. 어느 지표도 순수 이용자 수나 지출 규모를 직접 측정하지는 않는다.”
— 오픈라우터 공식 랭킹 가이드 중
토큰이 고속도로 위의 물동량이라면, 요청은 주문서의 접수 건수다.
여기에 원자료에 함께 기록된 과금액 데이터를 결합하면 비로소 돈의 실제 흐름이 드러난다. 이 수치는 오픈라우터 크레딧 API에서 ‘사용한 크레딧 총액’을 뜻하는 필드값으로, 모델 개발사의 자체 매출이 아니라 오픈라우터가 이용자에게 청구한 실질 이용료를 의미한다.
오픈웨이트 여부는 허깅페이스(Hugging Face) 등 오픈 플랫폼에 해당 모델의 가중치가 공개되어 누구나 내려받을 수 있는지로 판별했다. 개발사를 밝히지 않은 익명 스텔스 모델은 따로 분리 집계했으며, 어느 쪽으로도 분류되지 않은 잔여 토큰은 0.1% 미만에 그쳤다.
상위 10대 모델 중 8개 장악한 오픈웨이트
7일간 토큰을 가장 많이 처리한 모델은 딥시크(DeepSeek)의 딥시크 V4.1 플래시였다. 18조6300억토큰으로 전체의 13.1%를 차지했고, Z.ai(구 지푸AI)의 GLM 5.3 플래시가 17조8100억토큰(12.5%)으로 뒤를 바짝 쫓았다. 폐쇄형 가운데 가장 높은 자리는 5위에 오른 오픈AI(OpenAI)의 GPT-5.6 루나(Luna)였다.
| 순위 | 모델 | 개발사 | 구분 | 토큰 | 점유율 | 이용료 |
|---|---|---|---|---|---|---|
| 1 | 딥시크 V4.1 플래시 | 딥시크 | 오픈웨이트 | 18조6300억 | 13.1% | 66만9000달러 |
| 2 | GLM 5.3 플래시 | Z.ai | 오픈웨이트 | 17조8100억 | 12.5% | 88만7000달러 |
| 3 | Hy4 프리뷰 | 텐센트 | 오픈웨이트 | 10조6100억 | 7.4% | 9만2000달러 |
| 4 | 스페이스 버니 알파 | 미공개 | 스텔스 | 9조8700억 | 6.9% | 1362달러 |
| 5 | GPT-5.6 루나 | 오픈AI | 폐쇄형 | 8조6200억 | 6% | 35만8000달러 |
| 6 | 딥시크 V4 플래시 0731 | 딥시크 | 오픈웨이트 | 8조1000억 | 5.7% | 40만1000달러 |
| 7 | 네모트론 3 울트라(무료) | 엔비디아 | 오픈웨이트 | 5조4400억 | 3.8% | 140달러 |
| 8 | 미모 V2.6 플래시 | 샤오미 | 오픈웨이트 | 4조2800억 | 3% | 1만4000달러 |
| 9 | 미모 V2.5 | 샤오미 | 오픈웨이트 | 3조5000억 | 2.5% | 1만2000달러 |
| 10 | 딥시크 V4 플래시 0423 | 딥시크 | 오픈웨이트 | 3조3700억 | 2.4% | 21만3000달러 |
상위 10개 모델 중 폐쇄형은 GPT-5.6 루나 하나뿐이다. 딥시크 V4.1 플래시와 GLM 5.3 플래시, 텐센트(Tencent) Hy4 프리뷰는 모두 허깅페이스에 가중치가 등록되어 있다. 8·9위 샤오미(Xiaomi) 미모까지 합산하면 상위 10개 중 7개가 중국계 테크 기업 모델이다.
4위 스페이스 버니 알파는 정체가 철저히 가려져 있다. 오픈라우터는 스페이스 버니 알파 안내 페이지에서 이 모델을 “미리보기 기간 익명으로 남기로 한 제3자 제공사”가 개발하고 호스팅한다고 명시했다. 9월 23일 무료 프로모션으로 풀린 직후 나흘 만에 9조8700억토큰을 흡수했다.
1년 만에 점유율 3분의 1에서 3분의 2로 수직 상승
불과 1년 전만 해도 판도는 정반대였다. 오픈라우터와 벤처캐피털 앤드리슨 호로위츠(a16z)가 2025년 12월 공동 발간한 인공지능 현황(State of AI) 보고서는 오픈소스 모델이 “2025년 말 전체 사용량의 약 3분의 1에 도달했다”고 분석했다. 당시 보고서에서 중국계 오픈소스 모델이 차지한 비중은 1년 평균 주간 토큰의 약 13% 수준이었다.
그러나 현재 그 비중은 3분의 2(66.8%)로 두 배 가까이 수직 상승했다. 최근 30일(8월 28일~9월 26일)로 집계 범위를 넓혀도 오픈웨이트의 토큰 점유율은 69.6%에 달했다. 1년간의 개발사별 주간 토큰 원자료를 이어 붙이면 지형 변화의 궤적은 한층 선명해진다.
| 주 시작일 | 주간 총 토큰 | 미국 4사 | 중국 개발사 | 앤트로픽 | 딥시크 |
|---|---|---|---|---|---|
| 2025년 9월 29일 | 5조4000억 | 77.9% | 15.9% | 13.7% | 9.9% |
| 2026년 3월 2일 | 14조8000억 | 53.9% | 35.3% | 15.9% | 7.1% |
| 2026년 6월 1일 | 36조1000억 | 34.5% | 47.4% | 14.6% | 18.7% |
| 2026년 9월 14일 | 128조9000억 | 22.1% | 59.5% | 3.6% | 25.7% |
미국 4사는 오픈AI·앤트로픽·구글(Google)·xAI를 묶은 값이다. 다만 원자료는 매주 상위 9개 개발사만 실명 표기하고 나머지를 기타로 분류하므로, 두 그룹의 합계는 실제보다 보수적으로 잡힌 하한선이다.
주간 토큰 총량은 1년 새 23.9배로 폭발했고, 늘어난 물량의 대부분을 오픈웨이트 모델이 흡수했다. 1년 전 주간 토큰의 3분의 1을 차지하던 xAI는 올해 3월부터 상위 9개 명단에서 자취를 감췄다.
앤트로픽(Anthropic)의 점유율이 1년 새 10%p 넘게 하락한 것도 동일한 맥락에서 해석된다. 앤트로픽의 주간 토큰 처리량은 같은 기간 7400억개에서 4조6400억개로 6배 넘게 성장했다. 전체 시장 판이 24배로 팽창하는 동안 6배 성장에 머물며 점유율이 희석된 결과다. 다만 7월 첫 주 7조2000억개를 정점으로 최근 두 달 사이 36% 감소한 추세 역시 원자료에 고스란히 반영되어 있다.
토큰 3.6%의 클로드가 이용료 1위를 거머쥔 배경
정산된 과금액으로 기준을 전환하면 판도는 정반대로 뒤집힌다. 같은 7일간 이용료를 가장 많이 거둬들인 개발사는 앤트로픽이었다. 토큰 처리량은 3.6%에 불과했으나, 청구 이용료는 전체의 28.6%를 독식했다. 30일 누적으로 넓혀도 앤트로픽은 토큰 4%로 이용료의 27.9%를 가져갔다. 이 기간 오픈라우터가 사용자에게 청구한 총이용료는 9543만달러(약 1292억원)에 달했다.
| 개발사 | 토큰 | 요청 | 이용료 |
|---|---|---|---|
| 앤트로픽 | 3.6% | 2.2% | 28.6% |
| 오픈AI | 12.5% | 17.6% | 26.3% |
| 구글 | 4.9% | 17.6% | 12.6% |
| Z.ai | 16% | 7.9% | 11.4% |
| 딥시크 | 22.8% | 20.3% | 8% |
| 문샷AI | 1.2% | 0.6% | 4.5% |
딥시크는 정반대의 궤적을 그린다. 토큰 처리량은 22.8%로 압도적 1위였으나, 청구 이용료 점유율은 8%에 머물렀다. 개별 모델 단위로 내려가면 격차는 더욱 극단적으로 벌어진다. 이용료 1위는 오픈AI의 GPT-6 아스트라(Astra)로 230만9000달러(약 31억원)를 기록했으나, 이 모델이 처리한 토큰은 전체의 0.74%에 그쳤다. 2위 클로드 오푸스 5(Claude Opus 5) 역시 전체의 0.69%에 불과한 토큰으로 146만2000달러(약 20억원)를 청구했다.
“줄은 오픈웨이트 모델 앞에 길게 늘어섰지만, 실제 계산대는 클로드와 GPT 같은 폐쇄형 모델 앞에서 쉼 없이 돌아갔다.”
토큰 12.5%를 처리한 GLM 5.3 플래시의 이용료는 88만7000달러로, 토큰 1%를 소화한 클로드 소넷 5(Claude Sonnet 5, 89만5000달러)와 거의 일치한다. 줄은 오픈웨이트 모델 앞에 길게 늘어섰지만, 실제 계산대는 폐쇄형 모델 앞에서 쉼 없이 돌아간 격이다.
오픈웨이트라고 해서 예외 없이 헐값에 팔리는 것은 아니었다. 문샷AI(Moonshot)의 키미(Kimi) K3는 1조3600억토큰으로 90만5000달러를 거둬들여 100만토큰당 0.66달러를 기록했다. 이는 폐쇄형 모델 평균치보다 비싼 단가다. Z.ai의 상위 모델 GLM-5.3 역시 2조8900억토큰에 94만8000달러를 받아 모델별 이용료 6위에 올랐다.
결국 단가를 가른 결정적 요인은 오픈웨이트냐 폐쇄형이냐는 형식보다, 초경량 고속 추론을 뜻하는 ‘플래시(Flash)’ 등급 여부였다.
API 요청 건수로 측정하면 또 다른 단면이 나타난다. 오픈웨이트와 폐쇄형이 각각 51.2%와 47.1%로 요청 건수를 양분했다. 구글은 토큰 점유율이 4.9%에 불과했으나 요청 점유율은 17.6%에 달했는데, 이는 제미나이(Gemini) 2.5 플래시 라이트 단일 모델에만 2억7716만건의 요청이 집중된 결과다. 짧은 질의를 빈번하게 전송하는 가벼운 태스크에 고속 경량 제미나이가 집중 투입된 것으로 풀이된다.
6.8배 단가 격차를 만든 다중 호스팅과 프롬프트 캐싱
100만토큰당 실질 청구 단가로 환산하면 오픈웨이트는 0.066달러(약 89원), 폐쇄형은 0.446달러(약 604원)로 약 6.8배의 단가 차이를 보였다.
가격이 이토록 벌어지는 구조적 원인은 모델 세부 페이지에서 즉각 확인된다. 딥시크 V4.1 플래시는 딥시크 본사를 포함해 총 26곳의 독립 추론 공급업체가 동일한 모델을 올려두고 치열한 단가 경쟁을 벌인다. 입력 100만토큰당 호가가 최저 0.035달러에서 최고 0.375달러까지 10배 넘게 벌어져 있으며, 딥시크 본사가 수주한 물량은 일일 토큰의 14.9%에 그쳤다. 반면 클로드 오푸스 5는 앤트로픽과 아마존(Amazon)·구글·마이크로소프트(Microsoft) 클라우드가 서비스하지만, 표준 요금은 모두 입력 100만토큰당 5달러로 단일화되어 있다. 가중치가 전면 공개되면 누구나 호스팅 사업자로 뛰어들 수 있고, 공급자가 늘어날수록 단가는 자연히 하락 압력을 받는다.
실제 이용 형태 역시 초저가 모델에 극단적으로 편중되어 있다. 7일간 처리된 토큰의 무려 97.5%가 입력 토큰이었으며, Z.ai의 GLM 5.3 플래시는 입력 17조5900억토큰 대비 출력이 2200억토큰에 불과했다.
자율 AI 에이전트는 단 한 줄의 판단을 끌어내기 위해 매번 방대한 코드베이스와 시스템 프롬프트가 담긴 두꺼운 서류철을 통째로 모델에 밀어 넣는다.
이처럼 동일한 문맥이 기계적으로 반복 유입되면서, 저장된 입력을 재활용하는 ‘프롬프트 캐싱’이 단가를 극적으로 깎아내린다. 딥시크 V4.1 플래시를 호스팅하는 업체들의 캐시 적중률은 대부분 90% 안팎에 달하며, 이용자가 실제로 지불한 입력 단가의 가중평균은 100만토큰당 0.024달러까지 급락했다. 오픈라우터는 가격 정책 안내에서 “캐싱과 대량 할인 때문에 실제 결제 단가는 공시 가격보다 한참 낮은 경우가 대부분”이라고 설명했다.
9월 26일 오픈라우터 애플리케이션 사용량 순위도 이를 명확히 뒷받침한다. 1위 에이전트 프레임워크인 ‘헤르메스 에이전트(Hermes Agent)’가 1조7000억토큰, 코딩 에이전트 ‘클라인(Cline)’이 8674억토큰, ‘킬로 코드(Kilo Code)’가 7931억토큰, ‘클로드 코드(Claude Code)’가 7602억토큰을 소모했다. 모두 코드를 직접 작성하고 외부 도구를 자율 호출하는 에이전트 시스템으로, 방대한 파일 문맥을 수십 번씩 반복 입력하는 작업에 값비싼 폐쇄형 플래그십을 투입할 경제적 유인이 적기 때문이다.
여기에 무과금 트래픽도 대거 섞여 있다. 무료로 배포된 모델 변형이 전체 토큰의 7.7%를 차지했으며, 엔비디아(Nvidia) 네모트론 3 울트라 무료 버전은 5조4400억토큰을 소화하고도 청구액은 140달러에 불과했다. 앞서 살펴본 무료 스텔스 모델까지 합산하면 전체 유통 토큰의 14.6%가 사실상 비용 청구 없이 처리된 것으로 집계된다.
오픈웨이트 천하인가… 중개 플랫폼 지표의 한계와 실질 시장
오픈라우터의 수치만으로 오픈웨이트 진영이 전체 시장을 장악했다고 결론내리기는 어렵다. 오픈라우터는 글로벌 AI 생태계의 한 축일 뿐, 시장 전체를 대변하는 단일 창구가 아니기 때문이다. 구글은 2026년 2분기 실적 발표에서 “자사 퍼스트파티 모델 API가 분당 약 220억토큰을 처리하고 있다”고 밝혔다. 이를 주 단위로 단순 환산하면 약 221조8000억토큰으로, 같은 한 주간 오픈라우터 전체를 거쳐 간 142조6500억토큰을 훌쩍 뛰어넘는다. 이처럼 거대한 자체 인프라를 지닌 구글이 오픈라우터에서 차지하는 토큰 비중은 4.9%에 불과하다.
기업들의 실제 엔터프라이즈 결제 데이터로 눈을 돌리면 괴리는 더욱 벌어진다. 미국 기업 법인카드 결제 데이터를 추적하는 램프(Ramp)의 AI 인덱스 9월호에 따르면, 오픈소스 모델을 도입한 곳은 “AI 지출 기업의 6.4%, 전체 기업의 3.6%”에 그쳤다. 오픈라우터에서 관측되는 ‘토큰 점유율 3분의 2’와 기업 현장의 ‘도입률 3.6%’ 사이에는 메우기 힘든 간극이 존재한다. 또한 오픈라우터 공식 데이터 문서가 경고하듯, 개발사마다 토큰을 쪼개는 토크나이저 알고리즘이 달라 서로 다른 제공사의 토큰 숫자를 1:1로 단순 평면 비교하는 데도 근본적 한계가 따른다.
그럼에도 불구하고 시장의 무게중심이 이동한 것은 부인할 수 없는 사실이다. 1년 새 24배로 폭발한 신규 토큰 수요의 대부분을 오픈웨이트가 흡수했으며, 대규모 연산을 저렴하게 쏟아부어야 하는 에이전트 인프라 환경에서 개발자들의 기본 선택지는 이미 오픈웨이트로 기울었다. 반면 복잡한 비즈니스 로직과 결정적 추론을 책임져야 하는 고부가가치 연산의 자리는 여전히 클로드와 GPT 같은 폐쇄형 프론티어 모델들이 굳건히 지키고 있다.
오픈라우터 역시 랭킹 페이지 가이드 말미에 이 숫자를 해석하는 유의점을 분명히 남겨두었다.
“토큰 총량이 많다는 것은 해당 모델이 얼마나 자주 호출되었는지를 보여줄 뿐, 어떤 작업에 가장 우수한 모델인지를 증명하지는 않는다.”
— 오픈라우터 공식 랭킹 가이드 중