AI 모델 선택은 이제 어느 회사가 1위인지로 끝나지 않는다.
최고 성능 모델은 대체로 비싸고 느리다. 반대로 가장 싼 모델은 어려운 판단에서 재작업을 부를 수 있다. 결국 중요한 것은 한 모델을 고르는 일이 아니라, 업무 난도와 처리량에 맞춰 모델을 나누는 일이다.
아티피셜 애널리시스(Artificial Analysis)의 인텔리전스 지수(Intelligence Index) V4.1.1은 실제 업무, 에이전트 도구 사용, 코딩, 과학 추론, 지식 정확성, 긴 문맥 처리 등 9개 평가를 종합한다. 아래 비교는 이 지표와 각 모델의 속도·가격 데이터를 바탕으로 했다.
먼저 결론: AI 모델은 다섯 역할로 나눠야 한다
- 최고급 판단과 최종 검토: 클로드 오푸스 5, GPT-5.6 솔(Sol)
- 고급 실무의 기본 모델: GPT-5.6 테라(Terra), 제미나이 3.6 플래시
- 빠른 대화와 일반 업무: 클로드 소네트 5 비추론형, 제미나이 3.6 플래시
- 대량 처리와 비용 절감: 딥시크 V4 플래시, 딥시크 V4 프로 0813
- 고성능 오픈웨이트·자체 운영 전략: 키미 K3
이 기준을 적용하면 질문도 달라진다. “어느 모델이 가장 좋은가”보다 “이 업무에 최고급 추론이 필요한가, 빠른 응답이 필요한가, 비용이 더 중요한가”를 먼저 따져야 한다.
숫자부터 비교해 보자
아래 가격은 입력·출력 100만 토큰당 기준이다. 실제 비용은 입력 길이, 답변 길이, 캐시, 추론 강도에 따라 달라진다. 단가만으로 월 비용을 확정할 수는 없지만, 모델마다 어떤 비용 구조를 가졌는지는 비교할 수 있다.
| 모델 | 지능 | 속도 | 가격 | 권장 업무 |
|---|---|---|---|---|
| 클로드 오푸스 5 최대 추론 | 63 | 54.1 토큰/초 | $5 / $25 | 최고급 판단·최종 검토 |
| GPT-5.6 솔 최대 추론 | 61 | 61.7 토큰/초 | $5 / $30 | 복잡한 코딩·에이전트 |
| 키미 K3 최대 추론 | 60 | 40.8 토큰/초 | $3 / $15 | 고성능 오픈웨이트 |
| GPT-5.6 테라 최대 추론 | 57 | 118.6 토큰/초 | $2 / $12 | 고급 실무의 균형 |
| 클로드 소네트 5 최대 추론 | 55 | 71.4 토큰/초 | $2 / $10 | 특정 고난도 작업 |
| 딥시크 V4 프로 0813 최대 추론 | 53 | 83.2 토큰/초 | $0.435 / $0.87 | 저비용 고급 텍스트 작업 |
| 제미나이 3.6 플래시 높은 추론 | 52 | 234 토큰/초 | $1.5 / $7.5 | 빠른 멀티모달 실무 |
| 딥시크 V4 플래시 최대 추론 | 40 | 118.2 토큰/초 | $0.14 / $0.28 | 초저비용 대량 처리 |
표만 봐도 차이가 뚜렷하다. 종합 점수 63점의 오푸스 5가 가장 뛰어나지만, 가장 빠른 모델은 아니다. 제미나이 3.6 플래시는 52점이지만 오푸스 5보다 약 4배 빠르다. 딥시크 V4 플래시는 최고급 모델보다 점수는 낮아도 출력 가격이 매우 낮다.
성능 10점 차이와 비용 10배 차이는 같은 기준으로 판단할 수 없다.
가장 어려운 일에는 클로드 오푸스 5와 GPT-5.6 솔
중요한 의사결정 문서, 복잡한 기술 설계, 여러 자료를 엮어 판단해야 하는 업무에는 최고급 모델이 필요하다.
클로드 오푸스 5는 인텔리전스 지수(Intelligence Index) 63점으로 비교 대상 가운데 가장 높다. 텍스트와 이미지 입력을 지원하고 최대 100만 토큰의 긴 문맥을 다룬다. 다만 초당 54.1토큰으로 느린 편이며, 입력·출력 가격도 $5/$25로 높다.
오푸스 5는 다음과 같은 업무에 쓰는 편이 낫다.
- 투자·사업·법무 문서의 논리 검토
- 여러 보고서를 읽은 뒤의 최종 의사결정 메모
- 오류가 나면 비용이 큰 코드나 시스템 설계의 최종 리뷰
- 사람이 결과를 거의 그대로 사용해야 하는 고품질 산출물
GPT-5.6 솔은 61점으로 오푸스 5에 바짝 붙고, 속도는 조금 더 빠르다. 아티피셜 애널리시스의 코딩 에이전트 평가에서는 솔이 코덱스(Codex) 환경에서 강점을 보였다.
최종 판단에는 오푸스 5가, 실제 개발·도구 사용·다단계 작업에는 GPT-5.6 솔이 더 자연스럽다. 지능 점수만 보고 고르기보다 업무의 형태를 함께 봐야 한다.
대부분의 고급 실무에는 GPT-5.6 테라와 제미나이 3.6 플래시
실무에서 가장 중요한 구간은 최고급 모델과 저가 모델 사이에 있다. 매번 오푸스 5를 쓸 수는 없지만, 답변 품질도 포기하기 어려운 영역이다.
GPT-5.6 테라는 이 구간에서 강력하다. 지능 점수는 57점으로 솔보다 낮지만, 출력 속도는 초당 118.6토큰으로 거의 두 배 빠르다. 가격도 입력 $2, 출력 $12로 솔보다 낮다. 텍스트와 이미지 입력, 100만 토큰 문맥도 지원한다.
테라는 사내 문서 분석과 보고서 초안, 일반적인 코드 작성·수정, 리서치 결과 정리, 이미지와 텍스트가 섞인 업무 자료 해석에 기본값으로 쓰기 좋다. 여러 사람이 반복해서 쓰는 내부 AI 도구에도 잘 맞는다.
제미나이 3.6 플래시는 성격이 다르다. 지능 점수는 52점이지만 초당 234토큰으로 비교군에서 가장 빠르다. 텍스트·이미지뿐 아니라 음성·영상 입력도 지원하며, 가격은 입력 $1.5, 출력 $7.5다.
사용자를 기다리게 할 수 없는 고객용 서비스, 회의 녹음·이미지·영상까지 함께 다루는 업무, 빠른 초안 작성과 즉시 피드백에는 제미나이 3.6 플래시가 더 적합하다. 테라가 생각의 깊이와 실무 완성도에 강하다면, 제미나이 플래시는 속도와 멀티모달 처리에 강하다.
클로드 소네트 5는 추론 강도를 낮춰 쓰는 편이 낫다
클로드 소네트 5는 같은 이름 아래에서도 설정에 따라 성격이 크게 달라진다.
클로드 소네트 5 최대 추론 설정은 지능 55점, 초당 71.4토큰, 입력·출력 $2/$10이다. 숫자만 보면 테라와 경쟁할 만하다. 그러나 평가에서 사용한 출력 토큰은 3억 개로, 테라의 9600만 개와 제미나이 플래시의 5900만 개보다 많다.
어려운 문제에는 쓸 만하지만, 일상 업무에 계속 쓰면 답이 길어지고 비용과 시간이 늘어날 수 있다.
반대로 비추론형 클로드 소네트 5는 지능 42점, 초당 약 63토큰, 입력·출력 $2/$10이며 첫 응답 시간도 짧다. 텍스트와 이미지 입력, 100만 토큰 문맥을 지원한다.
비추론형은 고객 응대, 문서 초안, 빠른 질의응답, 이미지 설명에 맞는다. 최대 추론형은 복잡한 분석이 꼭 필요하지만 오푸스 5까지는 필요 없는 일부 업무에 한정하는 편이 효율적이다.
비용 구조를 바꾸는 딥시크 V4 프로와 V4 플래시
딥시크 계열은 단순히 조금 싼 모델이 아니다. AI를 대량으로 쓰는 서비스의 비용 구조를 바꿀 수 있는 모델이다.
딥시크 V4 프로 0813은 지능 53점, 초당 83.2토큰, 입력·출력 $0.435/$0.87이다. 제미나이 플래시와 지능 점수 차이는 작지만, 텍스트 기준 단가는 훨씬 낮다. 다만 이미지 입력은 지원하지 않는다.
대량 뉴스·문서 요약, 검색 결과 정리와 1차 분석, 고객 문의 분류와 답변 초안, 사람이 최종 검수하는 콘텐츠 생산에 적합하다. 비용 한도 안에서 AI 사용량을 늘려야 하는 서비스에도 쓸 만하다.
딥시크 V4 플래시는 더 극단적이다. 최대 추론 설정 기준 지능 점수는 40점이지만, 출력 속도는 초당 118.2토큰, 가격은 입력·출력 $0.14/$0.28이다.
플래시는 짧은 요약, 분류, 태깅, 대량 문장 생성과 메타데이터 작성, 내부 검색 결과 정리에 잘 맞는다. 다만 최대 추론 설정은 내부적으로 많은 토큰을 사용할 수 있다. 단가가 낮다고 해서 모든 어려운 업무를 맡길 수 있는 것은 아니다. 플래시는 빠른 1차 처리, 프로는 저비용 고급 텍스트 분석에 더 어울린다.
키미 K3는 가성비 모델이 아니다
키미 K3는 오픈웨이트 모델이지만 인텔리전스 지수 60점이다. GPT-5.6 솔의 61점에 거의 닿는 성능이다. 텍스트와 이미지 입력, 약 100만 토큰 문맥도 지원한다.
하지만 가격은 입력 $3, 출력 $15이고 속도는 초당 40.8토큰이다. 아티피셜 애널리시스도 비슷한 규모의 오픈웨이트 모델과 비교하면 느리고 비싼 편이라고 평가한다.
키미 K3를 저렴한 대안으로 소개하면 안 된다. 고성능 오픈웨이트 모델을 원하는 조직, 자체 호스팅 또는 특정 벤더 의존도 완화를 검토하는 팀, 긴 사내 문서와 대형 코드베이스를 분석하는 환경에 맞는 모델이다. 모델 가중치 접근성과 최고급 성능을 함께 원하는 경우에 검토할 만하다.
실제 운영은 한 모델로 끝내지 않는 편이 낫다
현실적인 운영 구조는 다음과 같다.
- 딥시크 V4 플래시로 분류, 요약, 초안, 검색 정리를 처리한다.
- 딥시크 V4 프로 0813 또는 제미나이 3.6 플래시로 일반적인 분석과 서비스 응답을 맡긴다.
- GPT-5.6 테라로 고급 문서·코드·리서치 업무를 처리한다.
- GPT-5.6 솔과 클로드 오푸스 5는 정말 어려운 코드 작업, 최종 판단, 고위험 결과물에 쓴다.
- 자체 운영과 오픈웨이트 전략이 필요할 때만 키미 K3를 별도 검토한다.
싸고 빠른 모델이 대부분의 일을 처리하고, 어려운 일부 요청만 고급 모델로 올리는 방식이다. 이 구조라면 비용을 통제하면서도 품질을 포기하지 않을 수 있다.
순위보다 중요한 것
인텔리전스 지수는 좋은 출발점이지만 한국어 문체, 사내 용어, 특정 업종 지식, 고객 질문의 특성까지 보장하지는 않는다. 아티피셜 애널리시스도 사용 사례에 따라 관련 있는 평가가 달라질 수 있다고 안내한다.
최종 도입 전에는 실제 문서·코드·고객 문의 30~50건을 준비해 후보 모델에 같은 작업을 시켜 보는 편이 좋다. 비교할 것은 네 가지다.
- 결과를 사람이 얼마나 고쳐야 하는가
- 답이 나오기까지 얼마나 기다려야 하는가
- 요청 한 건당 실제 비용은 얼마인가
- 실패했을 때 재작업 비용은 얼마나 되는가
종합 1위는 클로드 오푸스 5다. 그러나 대부분의 조직에서 기본값으로 쓰기 좋은 모델은 GPT-5.6 테라 또는 제미나이 3.6 플래시일 가능성이 높다. 대량 처리에는 딥시크 V4 플래시와 V4 프로가, 고성능 오픈웨이트 전략에는 키미 K3가 맞는다.
좋은 AI 선택은 최고 점수를 고르는 일이 아니다. 각 업무에 필요한 수준의 지능을 가장 효율적으로 배치하는 일이다.
자주 묻는 질문
Q1. 인텔리전스 지수 1위인 AI 모델은 무엇인가?
A. 클로드 오푸스 5가 인텔리전스 지수 63점으로 비교 대상 가운데 가장 높다. 다만 초당 54.1토큰으로 느린 편이고 입력·출력 가격은 $5/$25다.
Q2. 가장 빠른 AI 모델은 무엇인가?
A. 제미나이 3.6 플래시가 초당 234토큰으로 비교군에서 가장 빠르다. 텍스트·이미지·음성·영상 입력을 지원하며 입력·출력 가격은 $1.5/$7.5다.
Q3. 대량 처리와 비용 절감에 적합한 AI 모델은 무엇인가?
A. 딥시크 V4 플래시가 대량 처리와 비용 절감에 적합하다. 최대 추론 설정에서 지능 점수는 40점, 출력 속도는 초당 118.2토큰, 입력·출력 가격은 $0.14/$0.28이다.