제미나이 4 아르곤은 무엇인가…머리는 좋아졌는데 손은 아직 서툴다

100만토큰 입출력과 지식 노동 벤치마크 석권, 터미널 자율 조작 꼴찌와 프런트엔드 취약성 노출, 사이버 방어 조직 한정 배포로 실전 안전성 검증 착수

서버 장비 앞 모니터에 구글 제미나이 성능 평가 그래프가 표시되고, 책상에는 문서가 놓여 있으며 뒤에 한 남성이 서 있다.
핵심 요약
1
공식 평가 우위:제미나이 4 아르곤은 구글이 제시한 19개 비교 항목 중 14개에서 1위 또는 공동 1위를 기록했고, 25만6000토큰 이상 장문맥 시험에서도 선두에 올랐다.
2
터미널 실행 약세:아르곤은 Terminal-bench 4.0에서 57.4%로 비교 대상 4개 모델 중 최하위였고, 실전 소프트웨어 수정 과제인 FrontierSWE v2에서는 GPT-6 아스트라보다 10.5%p 낮았다.
3
독립 평가 격차:아티피셜 애널리시스의 지능지수에서 아르곤은 아스트라와 같은 53점으로 클로드 오푸스 5.5보다 5점 낮았으며, 구글의 공식 비교표에는 제조사별 발표치와 서로 다른 시험 조건이 혼재한다.
4
정가 전환 부담:아르곤의 과제당 비용은 도입 할인가 기준 1.99달러지만 토큰 사용량이 같다면 정가 전환 후 약 3.98달러로 올라 아스트라의 3.26달러를 웃돌 수 있다.
5
보안 조직 우선:구글은 신원 검증을 마친 사이버 방어 조직에 아르곤을 먼저 제공했으며, 일반 개발자와 소비자에게 언제 개방할지는 밝히지 않았다.

구글(Google)이 지난 30일(현지시각) 새 최상위 모델 제미나이 4 아르곤(Gemini 4 Argon)을 전격 공개했다. 구글이 제시한 19개 공식 비교 항목 중 14개에서 1위이거나 공동 1위를 차지했다. 하지만 구글 생태계 밖에서 이 모델을 즉시 실전에 도입할 수 있는 대상은 현재로선 사이버 보안 방어 조직에 국한된다.

공식 비교표만 보면 구글이 프론티어 AI 경쟁에서 확고한 선두를 탈환한 형국이지만, 독립 벤치마크 지표와 구글 내부 임직원의 평가는 전혀 다른 현실을 가리키고 있다.

제미나이 4 아르곤 핵심 스펙 및 실전 지표 분석
구글 딥마인드·아티피셜 애널리시스 공식 집계 (2026년 10월 1일 기준)
지식 노동·장문맥
100만토큰 입출력
19개 중 14개 1위
출력 한도를 100만토큰으로 16배 확장하고 25만6000토큰 이상 초장문맥 시험(GraphWalks 84.2%)과 영상 분석(LVBench 91.7%)에서 선두를 차지함.
자율 실행 병목
터미널 에이전트 조작
터미널 벤치 꼴찌 57.4%
소프트웨어 엔지니어링 과제(FrontierSWE 55%)에서 아스트라 대비 10.5%p 열세를 보이며 멀티턴 터미널 실행 과제에서 비교 4개 모델 중 최하위를 기록함.
도입 가격 구조
출시 할인가 vs 토큰 소모
입력 2달러·출력 10달러
도입가는 아스트라의 5분의 1 수준이나 과제당 토큰 소비가 2.3배에 달해 정가 전환 시 과제당 비용이 3.98달러로 역전될 가능성이 상존함.
[핵심 시사점] 압도적인 장문맥 추론력으로 방대한 서류와 지식 노동 분석을 평정했으나 자율 에이전트 실행력의 한계가 명확하여, 사이버 방어 조직 검증을 거치는 신중한 단계별 배포 경로를 선택함.

구글이 ‘프로’를 건너뛰고 내놓은 모델

이름부터 이례적이다. 구글은 지금까지 제미나이 뒤에 버전 번호와 프로(Pro)·플래시(Flash) 같은 성능 등급을 부여해 왔다. 직전 최상위 모델은 지난 2월 19일 선보인 제미나이 3.1 프로 프리뷰(Gemini 3.1 Pro Preview)였다. 하지만 이번 모델에는 등급 대신 원소명인 ‘아르곤(Argon)’이 단독 명명됐다.

구글은 브랜딩 변경 이유를 공식적으로 밝히지 않았다. IT 전문 매체 9to5구글(9to5Google)은 아르곤이 새로운 명명 체계를 정립했다고 전했으며, 기술 매체 더뉴스택(The New Stack)은 구글이 지난 5월 I/O 개발자 회의에서 예고했던 차세대 프로 모델이 사실상 아르곤으로 구체화됐다고 짚었다. 학년을 적던 명찰에 별명을 붙인 격이지만, 여름 내내 기대를 모았던 제미나이 3.5 프로는 끝내 출시되지 않았고 구글은 그사이 플래시 모델을 3.7과 3.8로 연달아 투입했다.

구글 딥마인드(Google DeepMind) 수석부사장 겸 최고 AI 설계자인 코라이 카부쿠오글루(Koray Kavukcuoglu)는 지난주 한 행사에서 제미나이 4를 “가능한 한 빨리(as soon as possible)” 선보이겠다고 공언했다. 실제 공개는 그 발언 이후 불과 며칠 만에 이뤄졌다.

하드웨어 및 아키텍처 사양에서 가장 극적인 변화는 단일 출력 한도다. 구글은 단일 요청에서 모델이 출력할 수 있는 토큰 상한을 6만4000토큰에서 100만토큰으로 약 16배 대폭 확장했다. 한 번의 호출로 원고지 16묶음에 달하는 방대한 결과물을 중간 끊김 없이 완결해 낼 수 있는 규모다.

독립 벤치마크 기관인 아티피셜 애널리시스(Artificial Analysis) 집계 기준 입력 컨텍스트 윈도 역시 100만토큰에 달한다. 구글은 단일 워크플로우 안에서 모델이 수십만토큰을 생성하며 자가 검증과 심층 추론을 이어갈 충분한 작업 공간을 확보했다고 설명했다.

구글이 내놓은 성적표

구글은 공식 블로그를 통해 19개 지표로 구성된 종합 비교표를 공개했다. 벤치마크 비교 대상은 오픈AI(OpenAI)의 GPT-6 아스트라(GPT-6 Astra), 앤트로픽(Anthropic)의 클로드 페이블 5.1(Claude Fable 5.1)과 클로드 오푸스 5.5(Claude Opus 5.5)다.

영역시험아르곤아스트라페이블 5.1오푸스 5.5
지식노동Vals Index68.9%63.1%65.8%67%
지식노동AutomationBench51.3%41.4%31.4%42.5%
지식노동Vals Finance Agent v265.4%53.5%58.9%58.6%
지식노동Harvey’s Legal Agent19.6%5.4%6.7%3.8%
에이전트 코딩DeepSWE v1.177.9%74.1%67.4%74.2%
에이전트 코딩FrontierSWE v255%65.5%56.3%62.3%
에이전트 코딩Vibe Code Bench91.9%89.6%90.3%90.3%
에이전트 코딩Terminal-bench 4.057.4%58.2%57.9%66.4%
ML 엔지니어링PostTrainBench45.3%44.3%40.2%49.3%
과학·수학Terminal-Bench Science 0.157.6%68.1%52.6%63.3%
과학·수학LABBench 288.8%85.4%68.6%73.1%
과학·수학RiemannBench76%72%65.6%69.6%
장문맥GraphWalks 12만8000토큰 이하99.7%98.7%91.4%90.6%
장문맥GraphWalks 25만6000~100만토큰84.2%71.8%65%66.8%
컴퓨터 사용Agent’s Last Exam39.5%34.2%미공개38.2%
컴퓨터 사용OSWorld-2.0 오프라인 세트69.2%72.6%미공개미공개
멀티모달Chartography71.6%71%46.2%66.3%
멀티모달LVBench91.7%87.5%79.7%83.7%
사이버보안CWE-bench v168%68%58%67%

아르곤이 단독 1위에 오른 지표는 13개, 공동 1위는 1개다. 기술 전문 매체 벤처비트(VentureBeat)는 장문맥 시험인 GraphWalks를 단일 과제로 묶어 18개 중 13개 부문 선두로 산출했다. 어느 방식으로 환산하든 전체 항목의 3분의 2 이상을 아르곤이 독점한 결과다. 물론 시험 과목을 선별하고 평가표를 구성한 주체 역시 구글이다.

가장 두드러진 격차를 보인 영역은 법률 실무 과제다. 하비(Harvey)의 법률 에이전트 시험에서 아르곤은 19.6%를 기록해 아스트라(5.4%)와 오푸스 5.5(3.8%)를 압도했다. 다만 1위 점수조차 20%를 밑돌아 전교 1등의 타이틀과 실전 역량 사이의 괴리가 두드러진다. 경쟁사 대비 상대적 우위는 확연하지만 실제 현업 법률 업무를 독자 위임할 완성도로 해석하기에는 무리가 따른다.

제미나이 4 아르곤과 GPT-6 아스트라는 어디서 갈리나

아르곤이 독보적 우위를 확인한 지점은 방대한 비정형 문서를 독해하고 구조화하는 지식 노동이다. 금융·법률·업무 자동화 시험 4종을 모조리 석권했다. 특히 초장문맥 처리에서 격차가 가장 크게 벌어졌다. 25만6000~100만토큰 구간 GraphWalks에서 아르곤은 84.2%를 기록해 아스트라의 71.8%를 12.4%p 차로 따돌렸다. 고화질 장편 영상을 정밀 분석하는 LVBench(91.7%)와 복합 분자생물학 과제인 LABBench 2(88.8%)에서도 아르곤이 선두를 굳혔다.

반면 구글이 패배한 영역은 5개에 달한다. 이들 과제의 공통점은 모델이 터미널 CLI 환경이나 운영체제 GUI 화면에 직접 진입해 자율 명령을 연속 실행해야 하는 인터랙션 작업이라는 점이다. 실전 소프트웨어 리포지터리를 다루는 FrontierSWE v2에서 아르곤은 아스트라에 10.5%p 뒤처졌다. 터미널 기반 과학 연구 환경을 시험하는 Terminal-Bench Science와 데스크톱 GUI 제어 과제인 OSWorld-2.0 역시 아스트라가 우위를 점했다. 모델 사후 학습 과제인 PostTrainBench는 오푸스 5.5가 1위를 가져갔다.

가장 뼈아픈 수치는 Terminal-bench 4.0이다. 명령줄 환경에서 복잡한 개발 의존성을 해결하며 다단계 작업을 완결 짓는 시험인데, 아르곤은 57.4%에 그쳐 비교 대상 4개 프론티어 모델 중 최하위로 밀려났다. 1위 오푸스 5.5(66.4%)와는 9%p의 현격한 격차가 벌어졌고, 아스트라(58.2%)와 페이블 5.1(57.9%)에도 미치지 못했다.

보고서는 유려하게 작성하지만 정작 전산실과 서버실에 진입하면 손이 서툴러지는 신입 엔지니어와 다를 바 없는 모습이다.

“문서를 분석하고 전략을 짜는 지식 노동에서는 압도적 선두를 굳혔지만, 컴퓨터 화면과 터미널에 들어가 직접 시스템을 고치는 자율 실행 영역에서는 여전히 손이 서툴다.”

물론 실행 과제 전반이 취약한 것은 아니다. 정형화된 소프트웨어 엔지니어링 문제를 다루는 DeepSWE v1.1에서는 77.9%로 단독 1위에 올랐고, 컴퓨터 제어 과제인 Agent’s Last Exam에서도 39.5%로 선두를 기록했다. 결국 동일한 자율 작업이라도 평가 잣대에 따라 희비가 갈렸으며, 에이전트가 터미널 셸에서 장시간 오류를 수정하며 세션을 유지해야 하는 환경일수록 아르곤의 순위는 급격히 하락했다.

표 밑에 깔린 조건

공식 성적표의 모든 지표가 동일한 출발선에서 측정된 것은 아니다. 구글이 병행 배포한 평가 방법론 기술 문서를 살펴보면 측정 조건의 불균형이 적시돼 있다.

우선 경쟁사 모델 점수의 출처다. 구글은 백서 각주에서 “별도 표기가 없는 한 제미나이 이외 모델의 결과값은 각 제조사가 자체 공표한 수치를 인용했다”고 명시했다. 구글이 동일 테스트베드에서 직접 교차 검증했다고 밝힌 시험은 DeepSWE와 Terminal-Bench, LVBench 등 9종에 불과하다. 나머지 과제는 경쟁사의 마케팅 수치를 그대로 옮겨온 수준이다.

시험 환경도 비대칭적이다. 영상 이해 시험인 LVBench에서 제미나이는 초당 1프레임(1 FPS)의 고밀도 스트림을 입력받은 반면, 아스트라는 800프레임, 페이블 5.1은 300프레임, 오푸스 5.5는 600프레임의 정지 이미지만 제공받았다. 동일한 장편 영화를 두고 누구는 연속 영상을 보고 풀고, 누구는 띄엄띄엄 스틸컷만 보고 시험을 치른 구조다. 또한 OSWorld-2.0은 전수 벤치마크가 아닌 오프라인 하위 세트에서 3회 반복 시행 중 최고점을 취합했고, Terminal-Bench Science는 제한시간을 6배 연장해 측정했으며, 아르곤은 모든 시험에서 최상위 추론(High Reasoning) 옵션으로 가동됐다.

이 때문에 구글 내부에서도 실전 효용성에 대한 의구심이 터져 나왔다. 미국 경제 전문 통신 블룸버그(Bloomberg)는 모델 공개 당일 구글 사내 엔지니어들 사이에서 아르곤의 실전 완성도를 둘러싼 회의론이 제기됐다고 전했다. 내부 개발자들은 벤치마크 숫자와 달리 프로덕션 환경에 투입하면 응답 일관성이 떨어지고, 특히 복잡한 코딩 수정과 웹 프런트엔드 디자인 구현에서 한계가 뚜렷하다고 지적했다. 이에 대해 구글은 “제미나이 4가 코딩 같은 영역에서 성능이 떨어진다고 단정하는 것은 사실과 다르다”며 공식 반박에 나섰다.

사내 회의론 보도 직후 알파벳(Alphabet) 주가는 장중 2% 넘게 상승했던 폭을 대부분 반납하고 0.5% 상승 마감에 그쳤다. 화려한 성적표와 현장 실무진의 괴리가 시장에 즉각적인 긴장감을 불어넣은 순간이다.

바깥 채점표는 어떻게 매겼나

벤더의 손을 타지 않은 독립 평가 기관의 채점표는 사뭇 다른 결을 드러냈다. 모델 성능을 독립 측정하는 아티피셜 애널리시스의 지능지수(v4.3.2, 10월 1일 조회 기준)에서 아르곤은 53점을 획득했다. GPT-6 아스트라, 클로드 페이블 5.1과 완벽한 동점이며, 클로드 오푸스 5.5(58점)보다는 5점 뒤처진 수치다. 제조사 자체 성적표와 외부 모의고사 점수가 확연히 엇갈린 결과다.

모델지능지수과제당 비용
클로드 오푸스 5.5585.98달러(약 8100원)
제미나이 4 아르곤531.99달러(약 2700원)
GPT-6 아스트라533.26달러(약 4400원)
클로드 페이블 5.1537.63달러(약 1만300원)

AI 전문 외신 더디코더(The Decoder)가 전한 아티피셜 애널리시스 세부 집계에서도 이 같은 차이가 확인된다. 아르곤은 직전 최상위 모델인 제미나이 3.1 프로 프리뷰 대비 23점 상승했다. 하지만 동일 지표에서 앤트로픽의 클로드 소넷 5.5(Claude Sonnet 5.5) 역시 56점을 기록하며 아르곤을 상회했다. 구글이 자체 비교표에서 앤트로픽 진영을 완벽히 압도했다고 발표한 것과는 확연히 대비되는 수치다.

해답을 도출하기 위해 소비하는 토큰 분량도 상당한 격차를 보였다. 아티피셜 애널리시스 실측 결과 아르곤은 단일 과제를 완결하는 데 평균 6만2000토큰을 생성한 반면, 아스트라는 2만7000토큰을 소비했다. 동일한 과제 점수를 받아들면서 답안지를 2.3배나 길게 채워 넣은 구조다.

해당 지수의 평가 기준 조정 과정은 아티피셜 애널리시스 변경 기록에 등재돼 있다. 지난 9월 GPT-6 아스트라 출시 당시 확인된 것처럼, 모델 공개 직후의 벤치마크 지표는 측정 지표 개편에 따라 수시로 변동한다.

사용자 블라인드 평가로 모델 순위를 매기는 아레나(Arena) 공식 집계에서는 또 다른 양상이 나타났다. 아레나 집계 결과 아르곤은 텍스트 부문에서 1525점으로 1위에 오른 반면, 웹 개발 부문에서는 1679점으로 8위에 머물렀다. 텍스트 응답 완성도에서는 최선두권을 입증했으나, 실제 웹 화면과 인터페이스를 구현하는 프런트엔드 역량에서는 선두 그룹과 상당한 격차를 보였다. 블룸버그가 보도한 구글 내부 직원들의 프런트엔드 취약성 지적과 정확히 일치하는 결과다.

값은 3.1 프로의 두 배, 아스트라의 5분의 1

API 요금 체계는 2단계로 책정됐다. 구글은 초기 프로모션 기간 동안 입력 100만토큰당 2달러(약 2700원), 출력 100만토큰당 10달러(약 1만3500원)를 부과한다. 프로모션이 종료되면 정가인 입력 4달러(약 5400원), 출력 20달러(약 2만7000원)로 인상된다. 캐시에 저장된 컨텍스트는 입력 단가에서 95%가 감면된다. 구글은 이 도입 할인이 언제까지 유지되는지 종료 시점을 명시하지 않았다.

모델입력 100만토큰출력 100만토큰
제미나이 4 아르곤 도입가2달러10달러
제미나이 4 아르곤 정가4달러20달러
제미나이 3.1 프로 프리뷰2달러12달러
GPT-6 아스트라10달러50달러

공식 요금표상 제미나이 3.1 프로 프리뷰는 20만토큰 이하 요청 기준 입력 2달러, 출력 12달러다. 아르곤 정가는 기존 대비 입력이 2배, 출력이 약 1.7배 높아진 수준이다. 반면 GPT-6 아스트라는 입력 10달러, 출력 50달러에 달해, 도입 할인가 기준 아르곤은 아스트라 요금의 5분의 1에 불과하다.

개업 프로모션 할인 스티커가 정가표 위에 덧붙여진 구조다. 할인이 종료되는 순간 정밀한 비용 계산서가 요구된다. 아르곤의 과제당 비용 1.99달러는 도입 할인가 기준이다. 입력과 출력, 캐시 단가가 일제히 두 배로 뛰기 때문에 토큰 사용량이 일정하다면 과제당 비용은 약 3.98달러(약 5400원)로 상승해 아스트라의 3.26달러를 추월한다. 경쟁 모델 대비 토큰을 2.3배 많이 소모하는 추론 습관이 정가 체제에서는 고스란히 기업의 재정적 부담으로 전이된다.

사이버 가드레일을 끈 채 먼저 나간 이유

아르곤의 최초 실전 도입처는 사이버 보안 방어 진영이다. 구글은 보안 협력 체계인 페어윈드 프로그램(Fairwind Program)을 통해 신원 검증을 통과한 방어 조직에 먼저 모델 접근 권한을 부여했다. 대상은 각국 정부 및 정보보호 당국, 의료·통신·에너지·금융 등 국가 핵심 기반시설 운영사, 주요 테크 플랫폼이다. 이들 기관은 피싱 저항성을 지닌 다중 인증(MFA)과 이용자 단위 접근 통제 체계를 필수로 갖춰야 한다.

기술 매체 실리콘앵글(SiliconANGLE) 집계에 따르면 이 프로그램은 지난 9월 3일 경량 모델인 제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber)로 가동을 시작했다. 이후 크라우드스트라이크(CrowdStrike)와 팔로알토네트웍스(Palo Alto Networks)를 포함한 650개 이상의 핵심 방어 기관이 합류했으며, 이번에 아르곤이 그 뒤를 잇게 됐다.

구글은 이들 신뢰 기관에 사이버 안전 가드레일을 완전히 해제한 원형 모델을 제공한다며 공식 입장을 분명히 했다.

“신뢰할 수 있는 방어 조직과 구글 내부 팀에는 사이버 가드레일 없이 아르곤을 배포해, 최전선 수준의 사이버 방어 능력을 온전히 활용할 수 있게 하겠다.”

— 구글 딥마인드 공식 발표문 중

실전 방어 성과도 가시화됐다. 글로벌 클라우드 보안 기업 위즈(Wiz)는 아르곤을 활용해 전 세계 의료기관이 사용하는 핵심 소프트웨어에서 환자 민감 정보가 유출될 수 있는 치명적 취약점을 사전에 포착해 조치했다고 구글은 밝혔다. 보안 취약점을 식별하고 해결하는 CWE-bench v1에서 아르곤은 68%로 아스트라와 공동 1위를 기록했다. 웹페이지에 숨겨진 악의적 지시문으로 모델을 탈취하는 간접 프롬프트 주입(Gray Swan IPI) 테스트에서 아르곤의 공격 성공률은 0.7%에 불과했다. 아스트라가 8.5%, 오푸스 5.5가 1%를 기록한 것과 비교하면 방어막의 완성도가 한층 견고하다.

일반 시장 배포는 단계적 절차를 밟는다. 구글은 미국 연방정부의 자발적 사전 접근 프로세스에 참여하고 있으며, 첨단 AI 모델이 사이버 공격이나 무기 개발에 악용되지 않도록 내부 활성값 감시(Internal Activation Monitoring) 기술을 고도화하고 있다. 모델 내부의 추론 흐름과 이상 징후를 실시간 감지해 위험 동작이 포착되면 즉각 실행을 차단하는 통제 기제다.

오픈AI 역시 아스트라의 고위험 사이버 공격 역량을 기업 테스터 대상 프로그램인 데이브레이크(Daybreak)에만 선별 개방했다. 초고성능 프론티어 모델의 양날의 검 역량을 방어 진영에 선제 제공한다는 테크 업계의 암묵적 규범이 같은 달에 거듭 확인됐다.

지금 쓸 수 있나

일반 이용자의 즉각적인 접근은 불가능하다. 구글은 유료 엔터프라이즈 API 고객과 구글 AI 울트라(Google AI Ultra) 구독자를 대상으로 접근 권한을 순차 개방한 뒤, 점진적으로 일반 개발자와 소비자로 대상을 넓히겠다고 예고했다. 명확한 일반 배포 일정은 제시되지 않았으며, 10월 1일 현재 공식 제미나이 API 가격표에도 아르곤 항목은 등재되지 않았다.

가장 적극적인 실전 검증자는 구글 자신이다. 구글은 아르곤 에이전트가 사내 대규모 C·C++ 코드베이스를 메모리 안전 언어인 러스트(Rust)로 자동 이식하는 작업을 주도하고 있다고 밝혔다. 수만 줄 규모의 오픈소스 라이브러리부터 80만 줄에 달하는 퓨시아(Fuchsia) 운영체제의 지르콘(Zircon) 마이크로커널에 이르기까지 광범위한 리팩토링이 진행됐다. 특히 오픈소스 영상 디코더 libgav1에서는 3만2000줄에 달하는 저수준 가속 어셈블리 코드를 재작성해, 기존 러스트 변환판 대비 2.7배 빠른 속도를 구현하면서 메모리 취약점을 원천 차단했다. 데이터센터 전반의 메모리 할당 최적화를 통해 300TiB(테비바이트) 이상의 여유 메모리를 확보한 사례도 제시됐다. 외부 공급에 앞서 자사 핵심 인프라 정비에 먼저 투입해 실질적 효용성을 검증했다.

구글 자체 비교표의 1위 독식과 외부 독립 지표의 동점, 그리고 사내 엔지니어들의 실전 회의론 사이에서 최종적인 진실은 일반 사용자들이 광범위하게 검증에 나서는 시점에 판가름 날 전망이다. 구글은 블룸버그의 사내 회의론 보도를 일축하며 카부쿠오글루 최고 AI 설계자의 결의에 찬 발언을 거듭 내세웠다.

“나는 개발팀을 전적으로 신뢰한다. 우리가 기술 최전선에 언제나 자리하리라는 점은 내게 확고한 사실이다.”

— 코라이 카부쿠오글루 구글 딥마인드 최고 AI 설계자
자주 묻는 질문 (FAQ)
Q. 제미나이 4 아르곤은 프로 모델의 후속인가?
A.공식 등급명은 명시되지 않았다. 구글은 기존의 프로나 플래시 같은 등급 대신 아르곤이라는 원소명을 단독 부여했으며 명명 배경은 공개하지 않았다. 다만 직전 최상위 모델이 제미나이 3.1 프로 프리뷰였고, 책정 가격과 모델 규모가 플래시 계열과 뚜렷이 구분되므로 사실상 프로 계열의 직계 후속작으로 평가된다.
Q. 구글이 발표한 벤치마크 1위 지표는 객관적인가?
A.공개된 수치는 구글의 공식 평가 방법론에 따른 결과다. 다만 비교 대상 모델 점수의 상당수는 각 제조사의 자체 발표치를 그대로 차용했으며, 과제별 입력 프레임 수와 제한시간 등 실행 조건이 비대칭적으로 설계됐다. 독립 측정 기관인 아티피셜 애널리시스 지능지수에서는 GPT-6 아스트라와 동점(53점)을 기록했고 클로드 오푸스 5.5보다는 5점 낮은 평가를 받았다.
Q. 일반 개발자와 기업은 언제부터 이용할 수 있는가?
A.구체적인 공개 일정은 발표되지 않았다. 구글은 보안 검증을 마친 페어윈드 프로그램 참여 방어 조직에 선제 배포했으며, 향후 유료 API 고객과 구글 AI 울트라 구독자에게 순차적으로 개방할 방침이다. 일반 개발자와 무료 이용자를 위한 전면 개방 시점은 미정이다.

RELATED ARTICLES