핵심 요약
기사 목차 펼치기 / 접기
열흘 전만 해도 앤트로픽(Anthropic)에는 오픈AI(OpenAI)의 GPT-6 루나(GPT-6 Luna)와 겨룰 모델이 없었다. 지난 9월 28일 플래시급 비교에서 다룬 앤트로픽의 가장 가벼운 모델은 클로드 하이쿠 4.5(Claude 하이쿠(Haiku) 4.5)였고, 지능지수는 17점이었다.
지난 7일(현지시간) 앤트로픽이 클로드 하이쿠 5.5(Claude 하이쿠 5.5)를 내놓으면서 사정이 바뀌었다. 입력 100만토큰당 0.1달러(약 134원), 출력 0.5달러라는 단가는 루나와 소수점까지 같다. 독립 평가기관 아티피셜 애널리시스(Artificial Analysis)의 지능지수에서도 두 모델은 38점에서 만난다.
값과 점수가 같으면 아무거나 써도 될까. 독립 평가기관 아티피셜 애널리시스가 직접 잰 실측 데이터를 항목별로 쪼개 두 모델의 실질적인 강약점을 대조했다. 수치는 지수 v4.3.2, 10월 8일 조회 기준이다.
클로드 하이쿠 5.5의 주요 변화와 규격
하이쿠 5.5의 단가는 전작 하이쿠 4.5(입력 1달러, 출력 5달러)의 10분의 1이다. 모델이 한 번에 읽을 수 있는 분량인 컨텍스트 창(context window)은 100만토큰으로 늘었다. 답하기 전에 얼마나 오래 생각할지 정하는 추론 강도(effort)도 low부터 max까지 다섯 단계로 고를 수 있다. 하이쿠 계열에 이 다이얼이 붙기는 처음이다.
기본값은 medium이다.
사용자가 아무것도 건드리지 않으면, 하이쿠는 중간 기어로 달린다. 이 사실은 뒤에서 점수를 읽을 때 다시 등장한다.
| 항목 | 클로드 하이쿠 5.5 | GPT-6 루나 |
|---|---|---|
| 입력/출력 단가(100만토큰당) | 0.1달러/0.5달러 | 0.1달러/0.5달러 |
| 고가 구간 시작 | 프롬프트 10만토큰 초과 | 입력 27만2000토큰 초과 |
| 고가 구간 단가 | 0.5달러/2.5달러 | 0.2달러/0.75달러 |
| 캐시 읽기 단가 | 0.01달러 | 0.01달러 |
| 컨텍스트 창 | 100만토큰 | 105만토큰 |
| 최대 출력 | 12만8000토큰 | 12만8000토큰 |
| 지식 기준 시점 | 2026년 6월 | 2026년 5월 18일 |
| 추론 강도 | low~max 5단계(기본 medium) | none~max 6단계(기본 medium) |
같은 가격표를 단 두 대의 경차다. 엔진 성격은 보닛을 열어야 보인다.
동일한 기본 단가, 10만토큰에서 갈라지는 청구서
단가가 같은 구간은 생각보다 좁다.
하이쿠는 프롬프트가 10만토큰을 넘으면 입력 0.5달러, 출력 2.5달러로 다섯 배 오른다. 루나는 입력이 27만2000토큰을 넘을 때 입력 단가를 2배, 출력 단가를 1.5배로 올린다. 두 회사 모두 문턱을 넘으면 그 요청 전체에 비싼 요금을 매긴다.
하이쿠의 문턱은 토큰을 세는 방식 때문에 더 가까워진다. 앤트로픽은 마이그레이션 안내서에서 하이쿠 5.5가 같은 글을 하이쿠 4.5보다 약 30% 많은 토큰으로 센다고 밝혔다. 하이쿠 4.5로 7만7000토큰이던 문서가 하이쿠 5.5에서는 10만토큰이 된다.
기본요금은 같은데 누진 구간이 다른 전기요금과 닮았다.
| 작업 1000건 | 하이쿠 5.5 | GPT-6 루나 |
|---|---|---|
| 분류(입력 2000·출력 50토큰) | 0.23달러(약 300원) | 0.23달러(약 300원) |
| 요약(입력 2만·출력 1000토큰) | 2.5달러(약 3350원) | 2.5달러(약 3350원) |
| 캐시한 15만토큰 문서에 질문(질문·답 각 1000토큰) | 10.5달러(약 1만4000원) | 2.1달러(약 2800원) |
| 30만토큰 장문 요약(출력 2000토큰) | 155달러(약 20만8000원) | 61.5달러(약 8만2000원) |
두 모델이 동일한 문서를 같은 토큰 수로 처리한다고 가정한 계산이다. 실제로는 토크나이저가 달라 차이가 생기지만, 두 토크나이저 사이의 공식 환산비는 확인되지 않는다. 그래서 실제 과제를 돌려 비용을 잰 독립 측정이 더 정확한 잣대다.
최고 추론 강도에 기댄 앤트로픽 발표치의 이면
앤트로픽 발표 페이지의 벤치마크 표에서 하이쿠 5.5는 루나를 모든 항목에서 앞선다. 컴퓨터 조작 시험 OS월드(OSWorld) 2.1에서 72.4% 대 48.9%, 터미널 작업 시험 Terminal-Bench 4.0에서 39.2% 대 16.4%다.
시스템 카드(System Card) 111쪽을 펴면 조건이 보인다. 앤트로픽은 따로 밝히지 않은 하이쿠 5.5 결과는 모두 “적응형 사고를 최고 추론 강도로 켠 상태”(adaptive thinking at max effort)에서 쟀다고 적었다. 최고 기어로 달린 연비를 기본 기어로 출고되는 차에 붙인 격이다. 같은 카드 131쪽에는 기본값 medium에서 실무 문서 작업 시험 GDPval-AA 점수가 1620점에서 1277점으로 내려간다는 기록도 있다.
측정 주체도 섞여 있다. Terminal-Bench에서 하이쿠의 39.2%는 앤트로픽이 자사 코딩 도구 클로드 코드(Claude Code)로 잰 값이고, 루나의 16.4%는 공개 순위표에서 가져온 값이다. OS월드의 루나 점수는 앤트로픽이 오픈AI API로 직접 돌렸다.
| 시험(max 강도) | 앤트로픽 발표 | 아티피셜 애널리시스 측정 |
|---|---|---|
| Terminal-Bench 4.0 하이쿠 5.5 | 39.2% | 32.8% |
| Terminal-Bench 4.0 GPT-6 루나 | 16.4%(공개 순위표) | 12.6% |
| GDPval-AA 하이쿠 5.5 | 1620점 | 1620점 |
| AA-Briefcase 하이쿠 5.5 | 1578점 | 1578점 |
| 인류 최후의 시험(Humanity’s Last Exam, 도구 없음) 하이쿠 5.5 | 45.9% | 44.4% |
GDPval-AA와 AA-Briefcase 점수가 똑같은 건 애초에 아티피셜 애널리시스가 돌린 결과를 앤트로픽이 옮겨 실었기 때문이다. 시스템 카드 131쪽에 그렇게 적혀 있다.
오픈AI도 사정은 같다. 오픈AI는 루나 발표문에서 코딩 시험 딥스위(DeepSWE) v1.1의 max 강도 점수 66.6%를 내걸고 “클로드 오푸스 5(Claude 오푸스(Opus) 5)와 페이블 5(Fable 5)의 medium 강도에 견줄 만하다”(comparable to 클로드 오푸스 5 and 페이블 5 at medium effort)고 했다.
양 사의 마케팅 발표치 대신 독립 제3자 기관의 실측을 기준으로 삼아야 하는 이유다.
38점 동점, 과제당 7~8센트의 갈림길
아티피셜 애널리시스 지능지수는 에이전트 업무와 코딩, 과학 추론 등 평가 10종을 묶은 종합 점수다. 각 모델의 추론 강도별 실측 데이터를 대조해보면, 서로 다른 강도에서 점수가 일치하는 짝이 셋 나온다.
| 추론 강도 | 지능지수 | 과제당 비용 | 지수 측정 출력 토큰 | 출력 속도(초당) | 첫 답변까지 |
|---|---|---|---|---|---|
| 클로드 하이쿠 5.5 | |||||
| max | 43 | 0.21달러 | 4억4000만 | 242토큰 | 432.2초 |
| xhigh | 41 | 0.12달러 | 1억8000만 | 187토큰 | 87초 |
| high | 38 | 0.08달러 | 9700만 | 160토큰 | 28초 |
| medium (기본값) | 34 | 0.05달러 | 5400만 | 137토큰 | 13.4초 |
| low | 29 | 0.02달러 | 3200만 | 178토큰 | 9.9초 |
| GPT-6 루나 | |||||
| max | 38 | 0.07달러 | 1억4000만 | 129토큰 | 111.3초 |
| xhigh | 35 | 0.04달러 | 6900만 | 115토큰 | 36.2초 |
| high | 33 | 0.03달러 | 4700만 | 112토큰 | 21.1초 |
| medium (기본값) | 30 | 0.02달러 | 2900만 | 미공개 | 미공개 |
| low | 22 | 0.0045달러 | 820만 | 121토큰 | 3.1초 |
점수가 같으면, 과제당 비용도 거의 같다. 38점에서 하이쿠 high는 0.08달러(약 107원), 루나 max는 0.07달러(약 94원)다. 센트 단위로 반올림한 값이라 1센트 차이는 오차 안에 들 수 있다. 34~35점 짝과 29~30점 짝도 1센트 안쪽에서 갈린다.
차이는 시간에서 난다. 38점을 받는 동안 하이쿠 high는 출력 토큰 9700만개를 썼고 루나 max는 1억4000만개를 썼다. 출력 속도도 초당 160토큰 대 129토큰이라, 하이쿠가 글을 쓰는 데 걸린 시간은 루나의 절반을 조금 넘는다. 첫 답변이 나오기까지는 28초 대 111초가 걸렸다. 이 시간에는 모델이 속으로 생각하는 시간이 들어 있다.
같은 점수를 받아 온 두 학생 가운데 한 명은 시험지를 절반 시간에 냈다.
천장도 다르다. 루나는 max의 38점이 끝이지만 하이쿠는 xhigh 41점, max 43점까지 오른다. 대신 38점에서 43점으로 5점을 올리는 데 과제당 비용은 2.6배, 출력 토큰은 4.5배가 든다. 출력 토큰을 덜 쓰는데도 과제당 비용이 비슷한 이유는 확인되지 않았다. 입력을 더 많이 세는 토크나이저와 10만토큰 문턱이 원인일 수 있지만, 아티피셜 애널리시스는 하이쿠의 비용 내역을 공개하지 않았다.
장기 문서 대 SaaS 시스템 연동, 엇갈린 강점
종합 점수가 같다고 잘하는 일이 같지는 않다. 엘로(Elo) 평점은 모델끼리 결과물을 1대1로 맞대어 산출한 상대 점수다. 아티피셜 애널리시스는 모델 페이지 차트에서 평가별 점수를 아직 ‘공개 전’으로 표시하지만, 페이지에 실린 데이터에는 항목별 값이 들어 있다. 38점짜리 두 설정과 기본값끼리를 나란히 놓았다.
| 평가 | 하이쿠 high | 루나 max | 하이쿠 medium | 루나 medium |
|---|---|---|---|---|
| 지능지수 | 38 | 38 | 34 | 30 |
| AA-Briefcase(장기 지식 작업, Elo) | 1443 | 1336 | 1372 | 1099 |
| GDPval-AA(실무 문서 작업, Elo) | 1420 | 1437 | 1277 | 1262 |
| Terminal-Bench 4.0(터미널 작업) | 21.7% | 12.6% | 15.2% | 2.5% |
| AutomationBench-AA(SaaS 업무 자동화) | 33.7% | 53.2% | 28.6% | 40.5% |
| AA-Omniscience 정답률 | 34.8% | 43.8% | 34% | 43.1% |
| AA-Omniscience 환각률 | 44.5% | 76.7% | 44.8% | 84.7% |
| AA-LCR(긴 문맥 추론) | 77.3% | 83.3% | 77.3% | 78.3% |
| SciCode(과학 코딩) | 48.7% | 54.6% | 49% | 50.9% |
하이쿠는 사무실형 과제에 강하다. 수천 개의 입력 파일을 다루며 몇 주짜리 프로젝트 4개를 진행하는 AA-Briefcase에서 하이쿠 high는 1443점으로 루나 max(1336점)를 앞섰다. 터미널 작업도 21.7% 대 12.6%로 하이쿠가 높다.
루나는 연결형 과제에 강하다. 지메일(Gmail)·세일즈포스(Salesforce)·슬랙(Slack) 같은 업무용 앱을 흉내 낸 환경에서 657개 업무를 처리하는 시험이 AutomationBench-AA다. 여기서 루나 max는 53.2%, 하이쿠 high는 33.7%였다. 사실 지식을 묻는 정답률과 긴 문맥 추론, 과학 코딩도 루나가 앞선다.
보고서를 잘 쓰는 신입과 여러 시스템을 잇는 연동 담당자가 입사 점수만 같은 경우다.
기본값끼리 비교하면 격차가 더 벌어진다. 아무 설정도 바꾸지 않은 하이쿠 medium은 지수 34점, 루나 medium은 30점이다. Briefcase 점수는 1372점 대 1099점이고, Terminal-Bench는 15.2% 대 2.5%다.
비용까지 얹으면 갈림길이 더 선명해진다. AA-Briefcase 한 벌을 돌리는 데 하이쿠 medium은 12.1달러(약 1만6000원)를 써서 1372점을 받았고, 루나 max는 15.5달러(약 2만800원)로 1336점을 받았다. 이 시험에서는 하이쿠가 더 싸고 더 잘한다. AutomationBench에서는 반대로 루나 medium(40.5%)이 하이쿠의 어떤 설정보다도 점수가 높다. 하이쿠 max도 35.4%에 그쳤다.
모를 때 침묵하는 모델과 지어내는 모델, 환각률의 격차
가장 큰 차이는 모를 때 어떻게 하느냐에서 났다. AA-Omniscience는 6개 분야 6000문항으로 지식을 묻는 시험이다. 맞히면 가점, 틀리면 감점을 주고, 모른다고 답하면 0점을 준다. 환각률은 맞히지 못한 응답 가운데 틀린 답을 지어낸 비율이다.
루나는 더 많이 안다. max 강도에서 정답률이 43.8%로 하이쿠 max(36.4%)보다 7.4%p 높다. 하지만 맞히지 못한 질문의 76.7%에서 틀린 답을 내놓았고, 추론 강도를 낮추면 이 비율이 84%대까지 오른다. 하이쿠는 모든 강도에서 40~45% 사이를 지켰다. 두 성향을 합친 지수는 하이쿠 max 10.7점, 루나 max 0.7점이다.
아는 게 많지만 모르는 것도 아는 척하는 쪽과, 아는 건 적어도 모르면 손을 드는 쪽이다.
이 결과를 하이쿠는 환각이 적은 모델이라고 일반화하면 곤란하다. 앤트로픽은 시스템 카드 56쪽에서 하이쿠 5.5가 “다른 최근 모델보다 환각이 많고 하이쿠 4.5와 비슷한 수준”(hallucinated more than other recent models, and about as much as 클로드 하이쿠(Claude Haiku) 4.5)이라고 적었다. 비교 상대가 클로드 소넷(Claude Sonnet)·오푸스 계열이라면 하이쿠는 환각이 많은 쪽이고, 루나 옆에 서면 적은 쪽이다. 오픈AI는 공식 발표문에서 루나의 사실성이 높은 추론 강도에서 GPT-5.6 솔(GPT-5.6 Sol)을 약 100분의 1 비용으로 따라잡는다고 밝혔다. 다만 이 평가는 이전 모델의 사실 오류를 사용자가 신고한 대화로 만든 것이라, 오류가 더 드문 일반적인 사용을 대표하지 않는다고 오픈AI가 직접 단서를 달았다.
하이쿠 선택 전 점검할 3대 기술 제약
가장 먼저 걸리는 건 돈이다. 같은 점수에서 과제당 비용은 루나가 같거나 1센트 싸다. 기본값끼리는 0.05달러 대 0.02달러로 하이쿠가 2.5배 비싸다. 기본 설정으로 대량 처리를 돌리는 서비스라면, 이 차이가 청구서에 그대로 찍힌다.
앤트로픽이 스스로 적은 약점도 있다. 시스템 카드에 따르면 하이쿠 5.5는 과제 중 유출된 정답을 발견했을 때 사용자에게 알리지 않고 쓴 비율이 17%로, 하이쿠 4.5(2%)보다 나빠졌다. 외부 문서에 숨긴 지시문으로 모델을 속이는 공격을 간접 프롬프트 인젝션(prompt injection)이라고 부른다. 15번 시도 기준 이 공격의 성공률은 하이쿠 5.5가 7.1%로, 클로드 소넷 5.5(Claude 소넷(Sonnet) 5.5)의 3.4%보다 높았다. 남은 취약점은 대부분 화면을 보고 마우스를 움직이는 컴퓨터 조작 과제(24.4%)에 몰려 있다.
안전 차단에는 대체 경로가 없다. 하이쿠 5.5의 사이버 보안 분류기가 요청을 막으면 다른 모델로 넘기지 않고 거절로 끝낸다. 앤트로픽이 Terminal-Bench를 잴 때도, 시행 660번 가운데 12번이 이렇게 멈췄다.
기존 코드도 손봐야 한다. 마이그레이션 가이드에 따르면 하이쿠 5.5는 temperature·top_k 같은 샘플링 값을 사실상 받지 않고, 응답 앞부분을 미리 채워 넣는 프리필(prefill)도 400 오류로 돌려보낸다. 처리 우선권을 사는 Priority Tier도 지원하지 않는다.
표본 크기도 봐야 한다. Terminal-Bench 4.0은 과제 66개짜리 시험이고, 앤트로픽이 계산한 표준오차만 ±1.9~2.6%p다.
몇 %p 차이로 우열을 단정하기는 어렵다.
실무 작업 성격별 최적 추천 모델
| 작업 | 추천 | 근거 |
|---|---|---|
| 보고서·분석 등 장기 문서 작업 | 하이쿠 5.5 medium | AA-Briefcase 1372점, 루나 max보다 높고 실행비는 낮음 |
| 터미널·코딩 보조 | 하이쿠 5.5 high 이상 | Terminal-Bench 21.7~32.8%. 본격 코딩은 상위 모델 |
| 틀린 답이 치명적인 질의응답 | 하이쿠 5.5 | 환각률 40%대 대 70~80%대 |
| SaaS 업무 자동화 | GPT-6 루나 medium~max | AutomationBench 40.5~53.2% |
| 10만토큰 넘는 장문 반복 처리 | GPT-6 루나 | 같은 토큰 기준 단가 5분의 1 |
| 최저가 대량 분류 | GPT-6 루나 low | 과제당 0.0045달러, 지수 22점 감수 |
본격적인 코딩 에이전트로는 둘 다 맞지 않는다. 앤트로픽도 발표 페이지에서 복잡한 에이전트 코딩에는 소넷 5.5와 오푸스 5.5가 더 적합하다고 밝혔다.
두 모델의 평가별 점수는 아직 아티피셜 애널리시스 차트에 공개 전으로 걸려 있다. 하이쿠 과제당 비용 옆에 붙은 별표가 무엇을 뜻하는지도 설명이 없다. 같은 38점이 서로 다른 38점이라는 사실은 화면보다 데이터에서 먼저 드러났다.