핵심 요약
앤트로픽(Anthropic)과 오픈AI(OpenAI)가 불과 90분 간격으로 차세대 주력 모델을 쏟아내며 정면충돌했다. 앤트로픽은 프런티어 지능을 극대화한 클로드 오푸스(Claude Opus) 5.5를, 오픈AI는 가격을 절반으로 깎아낸 GPT-6 솔(Sol)과 루나(Luna)를 맞불로 놓았다. 두 회사 모두 “전작보다 더 싸고 더 똑똑해졌다”고 공언했으나, 벤치마크 실측치와 실제 워크로드 청구서가 가리키는 현실은 엇갈렸다. 오푸스는 더 깊이 생각하느라 토큰이 폭증해 실질 청구액이 묶였고, 솔은 가격을 반토막 낸 대신 모르는 문제에 입을 닫으며 정답률이 후퇴했다.
같은 날 시장에 진입했지만 양사가 선택한 타협점(Trade-off)은 정반대다. 한쪽은 단가 인하를 20%로 억제하는 대신 지능 최고점을 뚫었고, 다른 한쪽은 지능 지수를 동결한 채 대대적인 가격 파괴를 단행했다. 양대 진영의 차세대 3종 모델을 직전 세대와 동일한 눈금에 올려두고 토큰 단가, 과제당 실질 완수 비용, 벤치마크 지능의 명암을 짚었다.
90분 차이로 갈린 승부수… 양대 진영의 라인업 재편
오푸스 5.5는 앤트로픽의 새 5.5 제품군 가운데 첫 주자로 선보인 플래그십 모델이다. 앤트로픽은 공식 발표문을 통해 소넷(Sonnet) 5.5와 하이쿠(Haiku) 5.5가 몇 주 안에 뒤따를 것이라고 밝혔다. 오푸스 5.5는 자체 API뿐 아니라 아마존웹서비스(AWS), 구글(Google) 클라우드, 마이크로소프트(Microsoft) 애저에 같은 날 배포됐다. 프로·맥스·팀 요금제의 5시간 사용 한도도 함께 확대됐다.
오픈AI 쪽은 라인업 체계가 3단계로 재편됐다. 9월 3일 선공개된 최상위 GPT-6 아스트라(Astra) 아래에 중량급 솔과 초경량 루나가 배치된 구조다. 오픈AI는 공식 발표를 통해 두 모델을 챗GPT(ChatGPT) 워크와 코덱스(Codex) 내 주요 유료 요금제(플러스·프로·비즈니스·엔터프라이즈·에듀)에 우선 적용했다. 무료 및 고(Go) 요금제는 데스크톱 앱에서 루나만 쓸 수 있으며, 웹 일반 채팅 화면에는 아직 두 모델 모두 들어오지 않았다.
| 모델 | API 모델명 | 입력 / 출력(100만토큰당) | 컨텍스트 | 지식 컷오프 |
|---|---|---|---|---|
| 클로드 오푸스 5.5 | claude-opus-5-5 | 4달러 / 20달러 | 100만 | 2026년 6월 |
| GPT-6 솔 | gpt-6-sol | 2달러 / 10달러 | 105만 | 2026년 4월 20일 |
| GPT-6 루나 | gpt-6-luna | 0.1달러 / 0.5달러 | 105만 | 2026년 5월 18일 |
상세 사양은 앤트로픽 개발자 문서와 오픈AI의 솔 및 루나 모델 페이지를 기준으로 정리했다. 한 번의 요청으로 생성 가능한 최대 출력량은 세 모델 모두 12만8000토큰이다.
클로드 오푸스 5.5는 오푸스 5보다 얼마나 싸졌나
토큰 단가는 입력과 출력 모두 20% 내렸으며, 인하 폭이 가장 큰 구간은 프롬프트 캐시 읽기다. 앞서 처리된 긴 문맥을 재참조할 때 부과되는 비용으로, 기존 0.5달러에서 0.2달러로 60% 깎였다.
| 100만토큰당 | 오푸스 5 | 오푸스 5.5 | 변화 |
|---|---|---|---|
| 입력 | 5달러 | 4달러 | -20% |
| 출력 | 25달러 | 20달러 | -20% |
| 캐시 읽기 | 0.5달러 | 0.2달러 | -60% |
| 캐시 쓰기(5분) | 6.25달러 | 5달러 | -20% |
캐시 할인 폭을 공격적으로 키운 데는 뚜렷한 배경이 있다. 앤트로픽은 공식 기술 블로그에서 캐시 읽기가 에이전트와 코딩 작업 비용의 대부분을 차지한다고 설명했다. 자율 코딩 에이전트는 동일한 거대 코드베이스를 수십 번 반복 호출하기 때문에, 재참조 단가를 낮추는 것이 이용자의 실질 청구서를 줄이는 핵심 요인이 된다.
앤트로픽이 전면에 내세운 총비용 절감 수치는 40%다. 다만 공식 발표문은 여기에 명확한 전제 조건을 달았다.
“기본 설정에서 일반적인 작업 부하 기준으로 오푸스 5보다 40% 덜 든다.”
“at default settings it will cost 40% less than Opus 5 on typical workloads”
여기서 기본 설정은 추론 강도(effort)가 중간(medium)으로 지정된 상태를 뜻한다. 추론 강도는 최종 답변을 내놓기 전 모델이 사고하는 시간과 깊이를 제어하는 매개변수로, 오푸스 5.5에는 낮음부터 최대(max)까지 5단계 조절 노브가 마련됐다.
추론 강도를 최대로 끌어올리면 비용 셈법은 완전히 달라진다. 독립 AI 평가기관 아티피셜 애널리시스(Artificial Analysis)의 과제당 비용 측정치(최대 추론 설정 기준)를 보면 오푸스 5.5가 5.98달러(약 8200원), 오푸스 5가 5.86달러로 나타났다. 단가를 20% 인하했음에도 과제 하나를 완수하는 데 들어간 실질 비용은 전작과 거의 동일하다. 평가기관은 심층 분석 보고서에서 그 원인을 급증한 추론 토큰량에서 찾았다. 최대 설정의 오푸스 5.5는 과제 하나에 출력 토큰을 약 11만9000개 소모한 반면, 오푸스 5는 약 7만3000개에 그쳤다. 택시 기본요금은 내렸지만 더 먼 길로 우회하면서 최종 요금은 전작과 동일한 수준으로 귀결된 구조다.
“단가는 20% 내렸지만 더 오래 생각하느라 토큰을 1.6배 소비하면서 최종 청구액은 전작과 같아졌고, 오픈AI는 가격을 절반으로 잘랐지만 모르는 문제를 비워두느라 정답률이 5%p 떨어졌다.”
신속한 응답을 원하는 기업 사용자를 위해 패스트 모드도 신설됐다. 응답 속도를 최대 2.5배까지 가속하는 대신 입력 8달러, 출력 40달러의 프리미엄 단가가 적용된다.
클로드 오푸스 5.5는 오푸스 5보다 얼마나 나아졌나
벤치마크 성능은 앤트로픽 자체 테스트의 전 항목에서 뚜렷한 상승 곡선을 그렸다. 아래는 앤트로픽 발표문에 수록된 세부 비교 지표다.
| 벤치마크 | 오푸스 5 | 오푸스 5.5 | 차이 |
|---|---|---|---|
| Terminal-Bench 4.0 | 52.3% | 66.4% | +14.1%p |
| FrontierCode v1.1 | 48% | 54.4% | +6.4%p |
| CursorBench 4.0 | 46.6% | 57.8% | +11.2%p |
| GDPval-AA v2.1(Elo) | 1708 | 1846 | +138 |
| AutomationBench | 26.9% | 40% | +13.1%p |
| Humanity’s Last Exam(도구 사용) | 63.6% | 67.7% | +4.1%p |
| Terminal-Bench-Science 0.1 | 29% | 58.7% | +29.7%p |
| OSWorld 2.0 | 74% | 81.8% | +7.8%p |
가장 큰 격차를 보인 지표는 터미널 명령줄 환경에서 과학 연구 과제를 수행하는 Terminal-Bench-Science로, 점수가 29%에서 58.7%로 두 배 폭증했다. 다만 표에 수록된 수치에는 환경적 단서가 따른다. 오푸스 5.5는 대부분 최대 추론 설정으로 측정됐으며, Terminal-Bench 4.0만 한 단계 아래인 xhigh 값이 반영됐다. 측정 도중 안전장치 개입 시 사이버보안 과제에서는 구형 오푸스 4.8이, 생물학 과제에서는 오푸스 5가 대체 응답하여 실제 잠재력보다 점수가 보수적으로 집계됐을 가능성도 함께 언급됐다.
외부 독립 평가 결과도 일치한다. 아티피셜 애널리시스 인텔리전스 지수(Intelligence Index) v4.3.2에서 오푸스 5.5는 58점을 기록하며 오푸스 5(51점)를 7점 차로 제쳤다. 업무 자동화와 코딩, 전문 지식 등 10개 시험을 종합한 결과로, 58점은 해당 평가기관이 지금까지 측정한 상용 모델 중 최고점이다. 실제 기업 적용 사례에서도 격차가 확인됐다. 한 얼리 테스터가 20만 줄 규모의 코드베이스를 전수 감사하고 리팩토링하는 데 오푸스 5.5는 3시간 미만이 소요된 반면, 오푸스 5는 20시간 이상 걸리며 토큰을 2.5배 더 소모했다. 물론 기업 선별 사례라는 점은 감안해야 한다.
주목할 부분은 앤트로픽 스스로 발표문에서 벤치마크 수치에 대한 맹신을 경계했다는 점이다.
“이 정도 능력 수준에서는 벤치마크 격차가 실제 차이를 가늠하는 지표로서 신뢰도가 떨어졌다.”
“at these levels of capability we’ve found that benchmark margins have become a less reliable guide to real-world differences.”
실무 환경에서 모델을 교체하려는 엔지니어라면 성적표보다 호환성 변경 내역을 먼저 확인해야 한다. 앤트로픽 개발자 문서에 따르면 전작인 오푸스 5와 비교해 하위 호환성이 깨지는 변경 사항이 5가지 존재한다. △적응형 사고 기능을 끌 수 없고 △도구 호출 강제 시 에러가 반환되며 △구형 컴퓨터 제어 도구(computer_20251124)를 지원하지 않는 점 등이다. 기존 파이프라인에서 모델 식별자만 교체할 경우 런타임 오류가 발생할 수 있다. 아울러 보안 영역에서도 변화가 있다. 오푸스 5.5는 오푸스 계열 최초로 상위 기종인 클로드 페이블(Claude Fable) 5.1 수준의 엄격한 안전장치가 적용되어, 대다수 사이버보안 실무 작업은 오푸스 4.8로 자동 우회된다.
GPT-6 솔·루나는 GPT-5.6보다 얼마나 싸졌나
오픈AI는 차세대 라인업인 GPT-6 솔과 루나의 토큰 단가를 직전 세대 대비 일괄 50% 반토막 냈다. 공격적인 가격 파괴를 통해 대규모 서비스 도입 장벽을 단숨에 낮추겠다는 의도다.
| 100만토큰당 | GPT-5.6 솔 | GPT-6 솔 | GPT-5.6 루나 | GPT-6 루나 |
|---|---|---|---|---|
| 입력 | 4달러 | 2달러 | 0.2달러 | 0.1달러 |
| 캐시 입력 | 0.4달러 | 0.2달러 | 0.02달러 | 0.01달러 |
| 출력 | 20달러 | 10달러 | 1.2달러 | 0.5달러 |
다만 가격 비교 기준은 엄밀히 짚어볼 필요가 있다. 오픈AI는 공식 발표에서 이번 50% 인하가 GPT-5.6의 프로모션 가격 대비라고 명시했다. GPT-5.6 솔 개발자 문서에는 해당 프로모션 가격이 적어도 11월 21일까지 유지된다고 명기되어 있으나, 프로모션 종료 후 정상 정가는 공개되지 않았다.
과제당 실질 완수 비용 역시 절반 수준으로 경감됐다. 아티피셜 애널리시스 실측 결과에 따르면 최대 추론 설정 기준 솔은 1.99달러에서 1.06달러(약 1500원)로, 루나는 0.18달러에서 0.07달러로 대폭 감소했다. 토큰 소비를 줄여서 싸진 것이 아니다. 과제당 출력 토큰은 솔이 2만9000개에서 3만1000개로, 루나가 4만1000개에서 5만1000개로 오히려 증가했으므로, 실질 비용 절감은 순수하게 토큰 단가 인하 효과에서 비롯됐다.
프롬프트 캐싱 메커니즘도 개선됐다. 발표문에 따르면 GPT-6는 기본 캐시 적중률이 한층 향상됐으며, 세션 진행 중 추론 강도를 변경하거나 외부 도구를 온·오프하더라도 선행 문맥 캐시가 무효화되지 않는다. 응답 속도도 빨라져 초당 출력 토큰이 GPT-5.6 솔(84.2개) 대비 GPT-6 솔(115개)로 약 37% 향상됐다.
GPT-6 솔·루나는 GPT-5.6보다 얼마나 나아졌나
반면 종합 지능 지수는 사실상 제자리에 머물렀다. 인텔리전스 지수에서 솔은 47점에서 48점으로 1점 상승에 그쳤고, 루나는 37점 그대로 동결됐다. 독립 평가기관의 총평도 이를 명확히 짚었다.
“인텔리전스 지수와 코딩 에이전트 지수 점수는 GPT-5.6과 같은 수준에 머물렀고, 어떤 평가에서는 나아지고 어떤 평가에서는 뒷걸음질했다.”
“Intelligence Index and Coding Agent Index scores remain level with GPT-5.6, with progress in some evaluations and regressions in others”
가장 극적인 변화는 환각 지표에서 나타났다. 최대 설정에서 솔의 환각률은 92%에서 60%로, 루나는 93%에서 77%로 급감했다. 여기서 환각률은 모르는 문항에 대해 답을 공란으로 두지 않고 거짓 정보를 지어낸 비율을 의미한다. 감소 메커니즘을 뜯어보면 모델의 성향 변화가 드러난다. 전작이 99% 문항에 무조건 응답했던 것과 달리 신형 솔은 83%에만 응답했다. 그 결과 오답 빈도는 4분의 1가량 줄었지만 전체 정답률도 59%에서 54%로 5%p 떨어졌다. 무리하게 오답을 내놓기보다 모르는 문제는 답안을 비워두는 수험생처럼 행동 양식이 바뀐 결과다.
일부 실무 지표에서는 성능 후퇴도 관측됐다. 44개 직종 실무 과제를 검증하는 GDPval-AA 벤치마크에서 솔은 Elo 점수가 약 100점, 루나는 약 75점 하락했다. 평가기관은 답변 길이가 짧아지면서 지시문에 포함된 세부 요구 사항을 누락한 데 따른 영향으로 분석했다. 코딩 영역은 모델별로 엇갈렸다. 코딩 에이전트 지수 v1.5에서 솔은 55점에서 57점으로 소폭 상승한 반면 루나는 43점에서 41점으로 하락했다. 해당 지수는 단독 모델이 아닌 오픈AI 코덱스 런타임 결합 환경에서 측정한 값이다.
오픈AI가 자체 공개한 전작 비교 수치로는 업무 자동화 시험 AutomationBench에서 높음(high) 설정 루나가 전작 대비 5.4%p 높은 점수를 58% 절감된 비용으로 기록했다. 최대 설정 루나는 OSWorld 2.0에서 중간 설정 GPT-5.6 솔을 10분의 1 비용으로 앞질렀다. 사실성 평가에서 솔의 에러율이 전작의 절반 수준으로 집계됐으나, 오픈AI는 사용자가 직접 오류를 신고한 대화 로그만을 모은 데이터셋이어서 일반적 활용 패턴을 대변하지 않는다는 단서를 덧붙였다.
안전성 관련 기술 보고서는 아직 불투명하다. 발표문에 포함된 시스템 카드 링크를 클릭하면 9월 3일 공개된 GPT-6 아스트라의 시스템 카드로 연결되며, 오픈AI 배포 안전 허브에는 23일 기준 솔과 루나만을 위한 단독 기술 문서가 등재되지 않았다.
두 회사가 같이 고친 말투
흥미롭게도 양대 AI 진영이 공통적으로 집중 개선한 영역이 바로 답변의 ‘말투와 응답 스타일’이다.
앤트로픽은 오푸스 5.5 공식 발표에서 난해한 전문용어 남발을 억제하고 가장 핵심적인 정보를 첫머리에 배치하도록 튜닝했다고 밝혔다. 오푸스 5 사용자 피드백 중 가장 빈번했던 불만을 반영한 결과다. 오픈AI 역시 솔과 루나가 한층 명료해지고 장황한 수사가 줄어 답변 길이가 간결해졌다고 밝히며 동일 질의에 대한 전작과 신작의 응답 차이를 나란히 공개했다.
앤트로픽은 응답 스타일 개선의 철학적 이유도 덧붙였다. 장시간 이어지는 복합 워크플로우일수록 인간 운영자가 중간 추론 과정을 직관적으로 추적하고 검증할 수 있어야 하며, 따라서 불필요한 사족을 배제하는 말투 개선이 실질적 운영 안전성을 높인다는 설명이다. 반면 오픈AI의 경우 응답이 지나치게 축약되면서 실무 벤치마크(GDPval-AA)에서 요구 항목 누락으로 점수가 깎이는 상반된 부작용을 낳았다.
GPT-6 테라는 왜 나오지 않았나
GPT-5.6 세대는 3개 티어로 출격했다. 오픈AI는 7월 시스템 카드에서 솔을 플래그십, 테라(Terra)를 가성비 중심 선택지, 루나를 초고속 경량 모델로 정의했다. 그러나 이번 GPT-6 발표문에서는 테라라는 명칭이 완전히 자취를 감췄다. 가격과 성능 체계를 겹쳐 보면 빈자리의 이유가 유추된다.
| 모델 | 입력 / 출력(100만토큰당) | 인텔리전스 지수 |
|---|---|---|
| GPT-5.6 테라 | 2달러 / 12달러 | 42 |
| GPT-6 솔 | 2달러 / 10달러 | 48 |
| GPT-6 루나 | 0.1달러 / 0.5달러 | 37 |
GPT-5.6 테라는 이전 GPT-5 계열의 미니(mini) 포지션을 계승했던 모델이다. 새로 공개된 솔은 기존 테라와 입력 단가가 동일하면서 출력 단가는 오히려 더 저렴하고, 인텔리전스 지수는 테라(42점)보다 6점 높다. 토큰 가격이 절반으로 내려온 상위 모델 솔이 뛰어난 가성비와 지능을 앞세워 한 칸 아래 중간급 포지션까지 완벽히 흡수한 구도다.
오픈AI는 이 라인업 공백에 대해 구체적인 입장을 내놓지 않았다. 9월 11일 오픈AI 공식 개발자 포럼에 GPT-6 테라 출시 여부를 묻는 스레드가 등록됐으나 23일까지 사측 답변은 전무하다. GPT-5.6 테라 개발자 문서에도 공식 서비스 종료(Deprecation) 일정은 명시되지 않았다. 중간 등급을 영구 폐지하고 2단 체제로 통합한 것인지, 시차를 두고 별도 공개할지는 미지수다.
클로드 오푸스 5.5와 GPT-6 솔은 어디서 갈리나
두 신작을 제조사 공식 발표 자료만으로 직접 1:1 비교하는 것은 불가능하다. 양사 모두 상대방의 미공개 신모델을 대조군으로 삼지 못했기 때문이다. 오픈AI 발표문의 벤치마크 상대는 구형 오푸스 5와 페이블 5.1이었고, 앤트로픽 발표문은 GPT-5.6 솔과 GPT-6 아스트라를 비교군에 올렸다. 불과 90분 차이로 시장에 나온 탓에 상대의 최신 성적표를 반영할 물리적 시간이 없었다.
동일 모델의 측정치가 양사 자료에서 엇갈리는 현상도 주의해야 한다. OSWorld 2.0에서 구형 오푸스 5의 점수는 오픈AI 발표 자료에서 60.3%였으나, 앤트로픽 발표 자료에서는 74%로 표기됐다. 오픈AI는 중간 추론 설정값을 인용한 반면 앤트로픽은 최대 설정으로 측정했기 때문이며, 두 회사 발표문의 숫자를 동일선상에서 단순 병합해서는 안 된다.
현재 시점에서 유일하게 유효한 객관적 기준선은 아티피셜 애널리시스의 통합 인덱스다. 23일 조회 기준 인텔리전스 지수 v4.3.2와 최대 추론 설정 기준 과제당 완수 비용은 다음과 같다.
| 모델 | 인텔리전스 지수 | 과제당 비용 |
|---|---|---|
| 클로드 오푸스 5.5 | 58 | 5.98달러 |
| GPT-6 아스트라 | 53 | 3.26달러 |
| 클로드 페이블 5.1 | 53 | 7.63달러 |
| 클로드 오푸스 5 | 51 | 5.86달러 |
| GPT-6 솔 | 48 | 1.06달러 |
| GPT-5.6 솔 | 47 | 1.99달러 |
| GPT-6 루나 | 37 | 0.07달러 |
| GPT-5.6 루나 | 37 | 0.18달러 |
오푸스 5.5는 GPT-6 솔보다 지능 지수가 10점 높고, 과제당 완수 비용은 약 5.6배 비싸다. 단순 토큰 단가 차이는 2배에 불과하지만 실제 청구액이 5.6배까지 벌어지는 이유는 오푸스 5.5가 복합 과제에서 훨씬 많은 심층 추론 토큰을 동원하기 때문이다. 최상위 플래그십인 GPT-6 아스트라와 클로드 페이블 5.1 역시 53점 동점으로 동일한 잣대에서 평가됐다. 코딩 에이전트 지수의 경우 GPT-6 솔은 등재됐으나 오푸스 5.5는 23일 기준 데이터가 집계되지 않았다.
전작 대비 변화 한눈에
| 항목 | 오푸스 5 → 5.5 | 솔 5.6 → GPT-6 솔 | 루나 5.6 → GPT-6 루나 |
|---|---|---|---|
| 토큰 단가 | -20% | -50% | 입력 -50%, 출력 -58% |
| 과제당 비용(최대 설정) | 5.86 → 5.98달러 | 1.99 → 1.06달러 | 0.18 → 0.07달러 |
| 인텔리전스 지수 | 51 → 58 | 47 → 48 | 37 → 37 |
| 크게 나아진 곳 | 에이전트 코딩, 업무 자동화 | 환각률 92 → 60% | 환각률 93 → 77% |
| 주의할 점 | 사이버보안 작업은 오푸스 4.8로 전환, 호환성 변경 | 정답률 -5%p, GDPval-AA 약 -100 Elo | 코딩 에이전트 지수 -2, GDPval-AA 약 -75 Elo |
같은 날 90분 간격으로 등장한 두 신모델은 완전히 상반된 혁신 방향을 택했다. 앤트로픽은 단가 인하를 20% 수준으로 통제하는 대신 종합 지능을 7점 끌어올려 프런티어 역량을 확장했고, 오픈AI는 지능 지수를 유지한 채 단가를 50% 반토막 내며 압도적인 가성비를 앞세웠다. 선택의 기준 역시 명확하다. 오푸스 5.5는 최대 추론 설정 시 과제당 비용이 전작과 동일하므로 기본 설정으로 낮춰야 40% 비용 절감이 실현되며, GPT-6 솔은 어떤 설정에서도 가격이 저렴하지만 모르는 질문에 응답을 회피하는 성향이 강해졌다.
신형 솔과 루나가 챗GPT 일반 웹 채팅에 적용되는 일정은 아직 확정되지 않았다. 테라의 빈자리가 영구적인 통합 체제로 굳어질지 여부 역시 오픈AI는 공식적으로 밝히지 않았다.