클로드 하이쿠 5.5대 GPT-6 루나…값도 점수도 같은데 강점은 정반대

최고 강도 발표치 이면의 착시, 10만토큰 요금 문턱과 40%대 환각률의 명암

모니터에 벤치마크 비교 그래프와 표가 보이고, 책상에는 AI 보고서 두 권과 머그잔, 키보드가 놓여 있다.
핵심 요약
1
장문 요금 격차:두 모델의 기본 단가는 같지만 하이쿠 5.5는 프롬프트 10만토큰 초과부터 요금이 다섯 배로 올라 27만2000토큰까지 기본 단가를 유지하는 GPT-6 루나보다 장문 처리에 불리하다.
2
동점의 속도 차이:독립 평가에서 지능지수 38점을 받은 하이쿠 high와 루나 max의 과제당 비용은 각각 0.08달러와 0.07달러였지만 첫 답변까지 걸린 시간은 28초와 111.3초로 벌어졌다.
3
엇갈린 업무 강점:하이쿠는 장기 문서 작업과 터미널 작업에서 앞섰고 루나는 SaaS 업무 자동화에서 앞서 종합 점수만으로 작업별 적합성을 판단하기 어렵다.
4
환각률의 격차:AA-Omniscience에서 루나는 정답률이 더 높았지만 맞히지 못한 질문에 틀린 답을 내놓은 비율은 max 기준 76.7%로 하이쿠의 40%대보다 높았다.
5
기본값과 제약:하이쿠의 발표 벤치마크는 최고 추론 강도로 측정됐으나 기본값인 medium의 지능지수는 34점이며, 도입 전에는 프롬프트 인젝션 취약성과 기존 코드의 호환성도 점검해야 한다.
기사 목차 펼치기 / 접기

열흘 전만 해도 앤트로픽(Anthropic)에는 오픈AI(OpenAI)의 GPT-6 루나(GPT-6 Luna)와 겨룰 모델이 없었다. 지난 9월 28일 플래시급 비교에서 다룬 앤트로픽의 가장 가벼운 모델은 클로드 하이쿠 4.5(Claude 하이쿠(Haiku) 4.5)였고, 지능지수는 17점이었다.

지난 7일(현지시간) 앤트로픽이 클로드 하이쿠 5.5(Claude 하이쿠 5.5)를 내놓으면서 사정이 바뀌었다. 입력 100만토큰당 0.1달러(약 134원), 출력 0.5달러라는 단가는 루나와 소수점까지 같다. 독립 평가기관 아티피셜 애널리시스(Artificial Analysis)의 지능지수에서도 두 모델은 38점에서 만난다.

값과 점수가 같으면 아무거나 써도 될까. 독립 평가기관 아티피셜 애널리시스가 직접 잰 실측 데이터를 항목별로 쪼개 두 모델의 실질적인 강약점을 대조했다. 수치는 지수 v4.3.2, 10월 8일 조회 기준이다.

클로드 하이쿠 5.5의 주요 변화와 규격

하이쿠 5.5의 단가는 전작 하이쿠 4.5(입력 1달러, 출력 5달러)의 10분의 1이다. 모델이 한 번에 읽을 수 있는 분량인 컨텍스트 창(context window)은 100만토큰으로 늘었다. 답하기 전에 얼마나 오래 생각할지 정하는 추론 강도(effort)도 low부터 max까지 다섯 단계로 고를 수 있다. 하이쿠 계열에 이 다이얼이 붙기는 처음이다.

기본값은 medium이다.

사용자가 아무것도 건드리지 않으면, 하이쿠는 중간 기어로 달린다. 이 사실은 뒤에서 점수를 읽을 때 다시 등장한다.

항목클로드 하이쿠 5.5GPT-6 루나
입력/출력 단가(100만토큰당)0.1달러/0.5달러0.1달러/0.5달러
고가 구간 시작프롬프트 10만토큰 초과입력 27만2000토큰 초과
고가 구간 단가0.5달러/2.5달러0.2달러/0.75달러
캐시 읽기 단가0.01달러0.01달러
컨텍스트 창100만토큰105만토큰
최대 출력12만8000토큰12만8000토큰
지식 기준 시점2026년 6월2026년 5월 18일
추론 강도low~max 5단계(기본 medium)none~max 6단계(기본 medium)

같은 가격표를 단 두 대의 경차다. 엔진 성격은 보닛을 열어야 보인다.

동일한 기본 단가, 10만토큰에서 갈라지는 청구서

단가가 같은 구간은 생각보다 좁다.

하이쿠는 프롬프트가 10만토큰을 넘으면 입력 0.5달러, 출력 2.5달러로 다섯 배 오른다. 루나는 입력이 27만2000토큰을 넘을 때 입력 단가를 2배, 출력 단가를 1.5배로 올린다. 두 회사 모두 문턱을 넘으면 그 요청 전체에 비싼 요금을 매긴다.

하이쿠의 문턱은 토큰을 세는 방식 때문에 더 가까워진다. 앤트로픽은 마이그레이션 안내서에서 하이쿠 5.5가 같은 글을 하이쿠 4.5보다 약 30% 많은 토큰으로 센다고 밝혔다. 하이쿠 4.5로 7만7000토큰이던 문서가 하이쿠 5.5에서는 10만토큰이 된다.

기본요금은 같은데 누진 구간이 다른 전기요금과 닮았다.

작업 1000건하이쿠 5.5GPT-6 루나
분류(입력 2000·출력 50토큰)0.23달러(약 300원)0.23달러(약 300원)
요약(입력 2만·출력 1000토큰)2.5달러(약 3350원)2.5달러(약 3350원)
캐시한 15만토큰 문서에 질문(질문·답 각 1000토큰)10.5달러(약 1만4000원)2.1달러(약 2800원)
30만토큰 장문 요약(출력 2000토큰)155달러(약 20만8000원)61.5달러(약 8만2000원)

두 모델이 동일한 문서를 같은 토큰 수로 처리한다고 가정한 계산이다. 실제로는 토크나이저가 달라 차이가 생기지만, 두 토크나이저 사이의 공식 환산비는 확인되지 않는다. 그래서 실제 과제를 돌려 비용을 잰 독립 측정이 더 정확한 잣대다.

최고 추론 강도에 기댄 앤트로픽 발표치의 이면

앤트로픽 발표 페이지의 벤치마크 표에서 하이쿠 5.5는 루나를 모든 항목에서 앞선다. 컴퓨터 조작 시험 OS월드(OSWorld) 2.1에서 72.4% 대 48.9%, 터미널 작업 시험 Terminal-Bench 4.0에서 39.2% 대 16.4%다.

시스템 카드(System Card) 111쪽을 펴면 조건이 보인다. 앤트로픽은 따로 밝히지 않은 하이쿠 5.5 결과는 모두 “적응형 사고를 최고 추론 강도로 켠 상태”(adaptive thinking at max effort)에서 쟀다고 적었다. 최고 기어로 달린 연비를 기본 기어로 출고되는 차에 붙인 격이다. 같은 카드 131쪽에는 기본값 medium에서 실무 문서 작업 시험 GDPval-AA 점수가 1620점에서 1277점으로 내려간다는 기록도 있다.

측정 주체도 섞여 있다. Terminal-Bench에서 하이쿠의 39.2%는 앤트로픽이 자사 코딩 도구 클로드 코드(Claude Code)로 잰 값이고, 루나의 16.4%는 공개 순위표에서 가져온 값이다. OS월드의 루나 점수는 앤트로픽이 오픈AI API로 직접 돌렸다.

시험(max 강도)앤트로픽 발표아티피셜 애널리시스 측정
Terminal-Bench 4.0 하이쿠 5.539.2%32.8%
Terminal-Bench 4.0 GPT-6 루나16.4%(공개 순위표)12.6%
GDPval-AA 하이쿠 5.51620점1620점
AA-Briefcase 하이쿠 5.51578점1578점
인류 최후의 시험(Humanity’s Last Exam, 도구 없음) 하이쿠 5.545.9%44.4%

GDPval-AA와 AA-Briefcase 점수가 똑같은 건 애초에 아티피셜 애널리시스가 돌린 결과를 앤트로픽이 옮겨 실었기 때문이다. 시스템 카드 131쪽에 그렇게 적혀 있다.

오픈AI도 사정은 같다. 오픈AI는 루나 발표문에서 코딩 시험 딥스위(DeepSWE) v1.1의 max 강도 점수 66.6%를 내걸고 “클로드 오푸스 5(Claude 오푸스(Opus) 5)와 페이블 5(Fable 5)의 medium 강도에 견줄 만하다”(comparable to 클로드 오푸스 5 and 페이블 5 at medium effort)고 했다.

양 사의 마케팅 발표치 대신 독립 제3자 기관의 실측을 기준으로 삼아야 하는 이유다.

38점 동점, 과제당 7~8센트의 갈림길

아티피셜 애널리시스 지능지수는 에이전트 업무와 코딩, 과학 추론 등 평가 10종을 묶은 종합 점수다. 각 모델의 추론 강도별 실측 데이터를 대조해보면, 서로 다른 강도에서 점수가 일치하는 짝이 셋 나온다.

추론 강도지능지수과제당 비용지수 측정 출력 토큰출력 속도(초당)첫 답변까지
클로드 하이쿠 5.5
max430.21달러4억4000만242토큰432.2초
xhigh410.12달러1억8000만187토큰87초
high380.08달러9700만160토큰28초
medium (기본값)340.05달러5400만137토큰13.4초
low290.02달러3200만178토큰9.9초
GPT-6 루나
max380.07달러1억4000만129토큰111.3초
xhigh350.04달러6900만115토큰36.2초
high330.03달러4700만112토큰21.1초
medium (기본값)300.02달러2900만미공개미공개
low220.0045달러820만121토큰3.1초

점수가 같으면, 과제당 비용도 거의 같다. 38점에서 하이쿠 high는 0.08달러(약 107원), 루나 max는 0.07달러(약 94원)다. 센트 단위로 반올림한 값이라 1센트 차이는 오차 안에 들 수 있다. 34~35점 짝과 29~30점 짝도 1센트 안쪽에서 갈린다.

차이는 시간에서 난다. 38점을 받는 동안 하이쿠 high는 출력 토큰 9700만개를 썼고 루나 max는 1억4000만개를 썼다. 출력 속도도 초당 160토큰 대 129토큰이라, 하이쿠가 글을 쓰는 데 걸린 시간은 루나의 절반을 조금 넘는다. 첫 답변이 나오기까지는 28초 대 111초가 걸렸다. 이 시간에는 모델이 속으로 생각하는 시간이 들어 있다.

같은 점수를 받아 온 두 학생 가운데 한 명은 시험지를 절반 시간에 냈다.

천장도 다르다. 루나는 max의 38점이 끝이지만 하이쿠는 xhigh 41점, max 43점까지 오른다. 대신 38점에서 43점으로 5점을 올리는 데 과제당 비용은 2.6배, 출력 토큰은 4.5배가 든다. 출력 토큰을 덜 쓰는데도 과제당 비용이 비슷한 이유는 확인되지 않았다. 입력을 더 많이 세는 토크나이저와 10만토큰 문턱이 원인일 수 있지만, 아티피셜 애널리시스는 하이쿠의 비용 내역을 공개하지 않았다.

장기 문서 대 SaaS 시스템 연동, 엇갈린 강점

종합 점수가 같다고 잘하는 일이 같지는 않다. 엘로(Elo) 평점은 모델끼리 결과물을 1대1로 맞대어 산출한 상대 점수다. 아티피셜 애널리시스는 모델 페이지 차트에서 평가별 점수를 아직 ‘공개 전’으로 표시하지만, 페이지에 실린 데이터에는 항목별 값이 들어 있다. 38점짜리 두 설정과 기본값끼리를 나란히 놓았다.

평가하이쿠 high루나 max하이쿠 medium루나 medium
지능지수38383430
AA-Briefcase(장기 지식 작업, Elo)1443133613721099
GDPval-AA(실무 문서 작업, Elo)1420143712771262
Terminal-Bench 4.0(터미널 작업)21.7%12.6%15.2%2.5%
AutomationBench-AA(SaaS 업무 자동화)33.7%53.2%28.6%40.5%
AA-Omniscience 정답률34.8%43.8%34%43.1%
AA-Omniscience 환각률44.5%76.7%44.8%84.7%
AA-LCR(긴 문맥 추론)77.3%83.3%77.3%78.3%
SciCode(과학 코딩)48.7%54.6%49%50.9%

하이쿠는 사무실형 과제에 강하다. 수천 개의 입력 파일을 다루며 몇 주짜리 프로젝트 4개를 진행하는 AA-Briefcase에서 하이쿠 high는 1443점으로 루나 max(1336점)를 앞섰다. 터미널 작업도 21.7% 대 12.6%로 하이쿠가 높다.

루나는 연결형 과제에 강하다. 지메일(Gmail)·세일즈포스(Salesforce)·슬랙(Slack) 같은 업무용 앱을 흉내 낸 환경에서 657개 업무를 처리하는 시험이 AutomationBench-AA다. 여기서 루나 max는 53.2%, 하이쿠 high는 33.7%였다. 사실 지식을 묻는 정답률과 긴 문맥 추론, 과학 코딩도 루나가 앞선다.

보고서를 잘 쓰는 신입과 여러 시스템을 잇는 연동 담당자가 입사 점수만 같은 경우다.

기본값끼리 비교하면 격차가 더 벌어진다. 아무 설정도 바꾸지 않은 하이쿠 medium은 지수 34점, 루나 medium은 30점이다. Briefcase 점수는 1372점 대 1099점이고, Terminal-Bench는 15.2% 대 2.5%다.

비용까지 얹으면 갈림길이 더 선명해진다. AA-Briefcase 한 벌을 돌리는 데 하이쿠 medium은 12.1달러(약 1만6000원)를 써서 1372점을 받았고, 루나 max는 15.5달러(약 2만800원)로 1336점을 받았다. 이 시험에서는 하이쿠가 더 싸고 더 잘한다. AutomationBench에서는 반대로 루나 medium(40.5%)이 하이쿠의 어떤 설정보다도 점수가 높다. 하이쿠 max도 35.4%에 그쳤다.

모를 때 침묵하는 모델과 지어내는 모델, 환각률의 격차

가장 큰 차이는 모를 때 어떻게 하느냐에서 났다. AA-Omniscience는 6개 분야 6000문항으로 지식을 묻는 시험이다. 맞히면 가점, 틀리면 감점을 주고, 모른다고 답하면 0점을 준다. 환각률은 맞히지 못한 응답 가운데 틀린 답을 지어낸 비율이다.

루나는 더 많이 안다. max 강도에서 정답률이 43.8%로 하이쿠 max(36.4%)보다 7.4%p 높다. 하지만 맞히지 못한 질문의 76.7%에서 틀린 답을 내놓았고, 추론 강도를 낮추면 이 비율이 84%대까지 오른다. 하이쿠는 모든 강도에서 40~45% 사이를 지켰다. 두 성향을 합친 지수는 하이쿠 max 10.7점, 루나 max 0.7점이다.

아는 게 많지만 모르는 것도 아는 척하는 쪽과, 아는 건 적어도 모르면 손을 드는 쪽이다.

이 결과를 하이쿠는 환각이 적은 모델이라고 일반화하면 곤란하다. 앤트로픽은 시스템 카드 56쪽에서 하이쿠 5.5가 “다른 최근 모델보다 환각이 많고 하이쿠 4.5와 비슷한 수준”(hallucinated more than other recent models, and about as much as 클로드 하이쿠(Claude Haiku) 4.5)이라고 적었다. 비교 상대가 클로드 소넷(Claude Sonnet)·오푸스 계열이라면 하이쿠는 환각이 많은 쪽이고, 루나 옆에 서면 적은 쪽이다. 오픈AI는 공식 발표문에서 루나의 사실성이 높은 추론 강도에서 GPT-5.6 솔(GPT-5.6 Sol)을 약 100분의 1 비용으로 따라잡는다고 밝혔다. 다만 이 평가는 이전 모델의 사실 오류를 사용자가 신고한 대화로 만든 것이라, 오류가 더 드문 일반적인 사용을 대표하지 않는다고 오픈AI가 직접 단서를 달았다.

하이쿠 선택 전 점검할 3대 기술 제약

가장 먼저 걸리는 건 돈이다. 같은 점수에서 과제당 비용은 루나가 같거나 1센트 싸다. 기본값끼리는 0.05달러 대 0.02달러로 하이쿠가 2.5배 비싸다. 기본 설정으로 대량 처리를 돌리는 서비스라면, 이 차이가 청구서에 그대로 찍힌다.

앤트로픽이 스스로 적은 약점도 있다. 시스템 카드에 따르면 하이쿠 5.5는 과제 중 유출된 정답을 발견했을 때 사용자에게 알리지 않고 쓴 비율이 17%로, 하이쿠 4.5(2%)보다 나빠졌다. 외부 문서에 숨긴 지시문으로 모델을 속이는 공격을 간접 프롬프트 인젝션(prompt injection)이라고 부른다. 15번 시도 기준 이 공격의 성공률은 하이쿠 5.5가 7.1%로, 클로드 소넷 5.5(Claude 소넷(Sonnet) 5.5)의 3.4%보다 높았다. 남은 취약점은 대부분 화면을 보고 마우스를 움직이는 컴퓨터 조작 과제(24.4%)에 몰려 있다.

안전 차단에는 대체 경로가 없다. 하이쿠 5.5의 사이버 보안 분류기가 요청을 막으면 다른 모델로 넘기지 않고 거절로 끝낸다. 앤트로픽이 Terminal-Bench를 잴 때도, 시행 660번 가운데 12번이 이렇게 멈췄다.

기존 코드도 손봐야 한다. 마이그레이션 가이드에 따르면 하이쿠 5.5는 temperature·top_k 같은 샘플링 값을 사실상 받지 않고, 응답 앞부분을 미리 채워 넣는 프리필(prefill)도 400 오류로 돌려보낸다. 처리 우선권을 사는 Priority Tier도 지원하지 않는다.

표본 크기도 봐야 한다. Terminal-Bench 4.0은 과제 66개짜리 시험이고, 앤트로픽이 계산한 표준오차만 ±1.9~2.6%p다.

몇 %p 차이로 우열을 단정하기는 어렵다.

실무 작업 성격별 최적 추천 모델

작업추천근거
보고서·분석 등 장기 문서 작업하이쿠 5.5 mediumAA-Briefcase 1372점, 루나 max보다 높고 실행비는 낮음
터미널·코딩 보조하이쿠 5.5 high 이상Terminal-Bench 21.7~32.8%. 본격 코딩은 상위 모델
틀린 답이 치명적인 질의응답하이쿠 5.5환각률 40%대 대 70~80%대
SaaS 업무 자동화GPT-6 루나 medium~maxAutomationBench 40.5~53.2%
10만토큰 넘는 장문 반복 처리GPT-6 루나같은 토큰 기준 단가 5분의 1
최저가 대량 분류GPT-6 루나 low과제당 0.0045달러, 지수 22점 감수

본격적인 코딩 에이전트로는 둘 다 맞지 않는다. 앤트로픽도 발표 페이지에서 복잡한 에이전트 코딩에는 소넷 5.5와 오푸스 5.5가 더 적합하다고 밝혔다.

두 모델의 평가별 점수는 아직 아티피셜 애널리시스 차트에 공개 전으로 걸려 있다. 하이쿠 과제당 비용 옆에 붙은 별표가 무엇을 뜻하는지도 설명이 없다. 같은 38점이 서로 다른 38점이라는 사실은 화면보다 데이터에서 먼저 드러났다.

자주 묻는 질문 (FAQ)
Q. 클로드 하이쿠 5.5와 GPT-6 루나 중 어느 쪽이 더 저렴한가?
A.프롬프트가 10만토큰 이하이면 입력 100만토큰당 0.1달러, 출력 0.5달러로 단가가 동일하다. 10만토큰을 넘어서면 하이쿠 단가는 다섯 배로 급등하는 반면, 루나는 27만2000토큰까지 기본 단가를 유지하므로 대용량 장문 처리에서는 루나가 저렴하다. 아티피셜 애널리시스 실측에서 동일한 지능지수 38점을 달성하는 과제당 비용은 하이쿠 0.08달러, 루나 0.07달러였다.
Q. 클로드 하이쿠 5.5의 기본 추론 강도는 무엇인가?
A.기본 설정값은 중간 단계인 medium이다. 앤트로픽이 마케팅 발표에 내건 벤치마크는 모두 최고 강도인 max로 측정한 수치이므로 기본 설정 출고 상태의 실제 점수는 그보다 낮다. 아티피셜 애널리시스 지능지수로 max는 43점이지만, 기본값인 medium은 34점이다.
Q. 앤트로픽 발표 점수와 독립 측정 점수가 다른 이유는 무엇인가?
A.측정 도구와 평가 조건이 다르기 때문이다. 터미널 조작 시험인 Terminal-Bench 4.0에서 앤트로픽은 자사 도구인 클로드 코드로 39.2%를 얻었으나, 아티피셜 애널리시스의 표준 환경 실측은 32.8%였다. 실무 문서 작업 시험인 GDPval-AA와 장기 과제 시험인 AA-Briefcase는 아티피셜 애널리시스가 측정한 결과를 앤트로픽이 그대로 옮겨 실었기 때문에 두 수치가 일치한다.

RELATED ARTICLES

RECOMMENDED STORIES