[Deep Audio #06] 지능 극대화와 가격 파괴, 18배 벌어진 AI 모델 가성비의 진실

오푸스 5.5 vs GPT-6 솔 90분 맞대결, 잣대마다 뒤바뀌는 점유율 1위, 18배 가격표의 경량 모델 실전 셈법

마이크와 헤드폰 주위에 음파와 막대그래프가 있고, 로봇 손 옆 저울에는 네트워크 모형과 금화가 놓여 있다.
DEEP AUDIO • EP.06 러닝타임 약 8분 (7분 46초)

지능 극대화와 가격 파괴, 18배 벌어진 AI 모델 가성비의 진실

호스트: 아인(Ain) & 젠(Zen)  |  기반 기사: 박근모 기자 심층 리포트 5편  |  제작: AI인사이트저널

[원문 리포트] 이번 에피소드에서 다룬 심층 기사
1. 클로드 오푸스 5.5는 ‘지능 극대화’, GPT-6 솔은 ‘가격 파괴’… 새 모델 비교 분석 원문 보기 →
2. 앤트로픽, 처리 속도 30% 높이고 토큰 소비 줄인 소넷 5.5 출시 원문 보기 →
3. 챗GPT·제미나이·클로드 점유율 1위는 누구인가…방문 55%·유입 79%·결제 44% 원문 보기 →
4. GPT-6 루나·제미나이·딥시크 플래시급 비교…지능 5점 차, 비용은 18배 원문 보기 →
5. 클로드의 46분의 1 비용… 샤오미 미모 V2.6, 정말 쓸 만한 대안일까 원문 보기 →

[00:00] 지능과 가격을 둘러싼 전면전

아인 (Ain)

AI인사이트저널에 오신 것을 환영합니다. 이번 주는 AI 모델들이 서로 90분 간격으로 등장하며 가격과 지능을 놓고 전면전을 벌인 한 주였습니다.

젠 (Zen)

박근모 기자가 이번 주 다룬 내용을 정리하면, 앤트로픽과 오픈AI의 신모델 맞대결, 챗봇 점유율과 기업 결제 판도, 그리고 저비용 경량 모델들의 실전 비교까지 세 갈래로 이어집니다.

아인 (Ain)

가격을 내렸는데 청구서는 그대로이고, 지능은 올렸는데 정답률은 오히려 내려간 한 주였군요. 모델마다 셈법과 타협점이 완전히 갈린 모습입니다.

젠 (Zen)

정확합니다. 숫자가 가리키는 방향이 생각보다 훨씬 복잡했습니다. 그럼 앤트로픽과 오픈AI의 신모델 대결부터 시작해보겠습니다.

[00:45] 앤트로픽과 오픈AI, 90분 간격 정면충돌

아인 (Ain)

같은 날 90분 차이로 두 회사가 차세대 모델을 동시에 내놓은 건데, 방향이 완전히 반대였습니다. 한쪽은 지능 극대화, 다른 쪽은 가격 반토막. 어떤 타협점을 선택했느냐가 이 대결의 핵심입니다.

젠 (Zen)

앤트로픽 공식 발표문이 비용 절감 조건을 명확히 제시했습니다. "기본 설정에서 일반적인 작업 부하 기준으로 오푸스 5보다 40% 덜 든다"는 것입니다.

아인 (Ain)

그런데 그 40% 절감 효과는 추론 강도를 중간으로 맞춰야 실현됩니다. 최대로 올리면 아티피셜 애널리시스(Artificial Analysis) 실측 기준 과제당 비용이 5.86달러에서 5.98달러로, 사실상 전작과 같아집니다.

젠 (Zen)

원인은 출력 토큰 급증입니다. 최대 설정의 오푸스 5.5는 과제 하나에 토큰 약 11만9000개를 소모했고, 전작 오푸스 5는 7만3000개에 그쳤습니다. 단가는 20% 내렸지만 더 오래 생각하면서 상쇄된 구조입니다.

아인 (Ain)

토큰 단가는 낮아졌지만 더 오래 추론하면서 결국 더 먼 길을 돌아간 셈이군요. 과제당 총비용은 전작과 사실상 같다는 점이 흥미롭습니다.

젠 (Zen)

지능 면에서는 분명한 성과가 있습니다. 아티피셜 애널리시스 인텔리전스 지수에서 오푸스 5.5는 58점으로, 전작 51점을 7점 차로 제쳤고, 해당 기관이 측정한 상용 모델 중 최고점입니다. 앤트로픽은 발표문에서 "이 정도 능력 수준에서는 벤치마크 격차가 실제 차이를 가늠하는 지표로서 신뢰도가 떨어졌다"고 직접 경계하기도 했습니다.

아인 (Ain)

자사 벤치마크를 스스로 경계하라는 공식 발표는 꽤 이례적이네요. 그만큼 벤치마크 점수와 실제 체감 성능의 괴리가 커졌다는 뜻이겠죠.

젠 (Zen)

오픈AI 쪽은 전략이 달랐습니다. GPT-6 솔은 토큰 단가를 전작 대비 50% 반토막 냈고, 아티피셜 애널리시스 실측 기준 과제당 비용도 1.99달러에서 1.06달러로 실제로 절반 가까이 줄었습니다.

아인 (Ain)

대신 지능 지수는 47점에서 48점으로 사실상 제자리걸음입니다. 지능 극대화보다는 단가 절감과 대량 보급에 방점을 찍은 선택으로 보입니다.

젠 (Zen)

환각률은 92%에서 60%로 크게 줄었습니다. 다만 모르는 질문에 응답을 회피하는 비율이 늘면서 전체 정답률은 59%에서 54%로 5%p 떨어졌습니다. 소넷 5.5 출시 소식도 있었는데, 처리 속도가 30% 향상되고 토큰 소비가 줄어든 중간급 모델로, 에이전트형 코딩 부문에서는 오푸스 5.5보다 나은 성능을 보였다고 앤트로픽이 밝혔습니다.

아인 (Ain)

실무 엔지니어라면 호환성 변경도 챙겨야 합니다. 오푸스 5.5는 전작과 비교해 하위 호환성이 깨지는 변경 사항이 다섯 가지 있고, 사이버보안 작업은 오푸스 4.8로 자동 우회됩니다.

젠 (Zen)

GPT-6 테라가 이번 발표에서 사라진 점도 눈에 띕니다. 새 GPT-6 솔이 기존 테라와 입력 단가가 같으면서 출력 단가는 더 싸고 지능 지수도 6점 높아, 중간급 포지션을 흡수한 구도입니다. 오픈AI는 이에 대해 공식 입장을 내놓지 않았습니다.

아인 (Ain)

새 모델이 조용히 자기 아랫자리를 흡수해 버린 셈이군요. 그런데 어느 모델이 실제로 더 많이 쓰이는지는 점유율 데이터가 따로 있습니다.

[03:20] 챗봇 점유율과 기업 결제 판도

아인 (Ain)

챗GPT가 1위라는 말은 맞을 수도 있고 틀릴 수도 있습니다. 무엇을 재느냐에 따라 순위표의 주인공이 완전히 달라지기 때문입니다.

젠 (Zen)

기사가 이 지점을 정확히 짚습니다. "웹 방문 점유율이 18%p 급락하는 동안 외부 사이트 추천 유입 점유율은 80%에 묶여 있었다. 지표의 이름이 똑같이 ‘점유율’이라 해서 모두 같은 시장의 현실을 가리키는 것은 아니다."

아인 (Ain)

시밀러웹 기준 챗GPT 웹 방문 점유율은 2025년 9월 73.3%에서 2026년 8월 55.5%로 떨어졌고, 같은 기간 클로드는 1.9%에서 9.3%로 약 다섯 배 올랐습니다.

젠 (Zen)

기업 결제 판도는 또 다릅니다. 램프 AI 인덱스 기준 미국 기업의 43.8%가 앤트로픽에 결제했고, 오픈AI는 39.8%였습니다. 다만 지출 금액 기준으로는 오픈AI가 여전히 약 56%로 과반입니다. 기업 수와 지갑 점유율이 가리키는 방향이 다릅니다.

아인 (Ain)

세 지표 모두 저마다 다른 시장의 단면을 보여줄 뿐, 단 하나의 숫자로 1위를 규정하기는 어렵습니다. 이런 판도 속에서 저비용 모델 경쟁도 치열하게 벌어지고 있습니다.

[04:55] 저비용 경량 모델, 지능 5점 차에 비용 18배

아인 (Ain)

플래시급 경량 모델들의 지능 지수는 37점에서 42점 사이로 촘촘하게 몰려 있습니다. 그런데 비용 격차는 전혀 다른 이야기를 합니다.

젠 (Zen)

원문을 직접 인용하면, "다섯 모델의 지능지수는 42점에서 37점 사이 5점 차에 불과하지만, 과제당 비용은 최대 18배 벌어진다. 계산서가 가장 저렴한 모델은 첫 답변까지 98초가 걸리고, 가장 빠른 모델은 헛소리를 덜 하는 대신 비용이 18배 비싸다."

아인 (Ain)

가장 싼 GPT-6 루나는 과제당 0.07달러인데, 최대 추론 강도에서 첫 답변까지 98초가 걸립니다. 반면 가장 비싼 제미나이 3.8 플래시는 1.24달러지만 초당 278토큰으로 가장 빠르고, 지식 신뢰도 시험에서 압도적입니다.

젠 (Zen)

코딩 에이전트 용도라면 순위가 달라집니다. 터미널벤치(Terminal-Bench) 4.0에서 GLM-5.3 플래시가 33%로 1위였고, 딥시크 V4.1 플래시가 27%로 뒤를 이었습니다. MIT 라이선스에 오픈웨이트 모델이라 자체 호스팅도 가능합니다.

아인 (Ain)

샤오미 미모(MiMo) V2.6 프로도 빼놓을 수 없습니다. 오픈웨이트 지능 지수 1위인 46점에, 과제당 비용이 클로드 오푸스 5.5의 46분의 1 수준입니다.

젠 (Zen)

다만 구조적 한계가 있습니다. API 공급자가 샤오미 단독이고, 고난도 터미널 벤치마크에서는 상용 플래그십 대비 절반 수준에 그칩니다. 코딩 에이전트 외부 공인 평가도 아직 없습니다. 제미나이 3.8 플래시는 2027년 1월부터 토큰 단가가 두 배로 오를 예정이어서, 지금 보이는 가격이 장기 기준이 되지 않습니다.

아인 (Ain)

성적이 엇비슷한 모델들 사이에서 계산서가 18배까지 벌어진다면 결국 관건은 작업 성격과 지연시간이겠군요. 비용을 아끼기 위해 98초를 기다릴 것인지, 비싸더라도 즉각적인 답변을 택할 것인지의 선택입니다.

[07:15] 타협과 선택의 셈법

젠 (Zen)

이번 주 공통된 흐름은 하나입니다. 지능, 비용, 속도 중 어느 하나를 올리면 반드시 다른 무언가가 내려간다는 점입니다.

아인 (Ain)

완벽한 만능 모델은 없다는 뜻이겠죠. 다음 주에는 이 복잡한 트레이드오프가 또 어떻게 뒤집힐지, 계속해서 추적해 드리겠습니다.

RELATED ARTICLES