구글, 제미나이 4 아르곤 공개해 사이버 방어 담당자에 우선 제공

구글(Google)이 프런티어 AI 모델 제미나이 4 아르곤(Gemini 4 Argon)을 공개하고 신뢰할 수 있는 사이버 방어 담당자에게 우선 제공하기 시작했다. 구글은 10월 1일 공식 블로그에서 복잡한 소프트웨어 개발과 기업 업무, 사이버 보안에 특화한 모델이라고 설명했다.

코딩·기업 업무 평가서 성능 공개

구글에 따르면 아르곤은 내부 업무에 이미 활용되고 있으며, 구글 직원 수천명이 전문 코딩 작업과 심층 조사, 글쓰기에서 강점을 확인했다. 일상적인 오류 수정뿐 아니라 대규모 코인베이스(codebase) 전환과 알고리즘 설계에도 쓰이고 있다는 설명이다. 실제 소프트웨어 엔지니어링의 장기 과제를 평가하는 딥SWE(DeepSWE) v1.1에서 77.9%를 기록해 최고 성능을 보였다고 구글은 밝혔다.

금융·코딩·법률·세무 업무의 경제적 영향을 평가하는 밸스 인덱스(Vals Index)에서도 선두를 차지했다고 구글은 설명했다. 다단계 금융 조사 평가인 밸스 파이낸스 에이전트 v2(Vals Finance Agent v2)와 하비 법률 에이전트 벤치마크(Harvey’s Legal Agent Benchmark)에서도 높은 성능을 보였다는 것이다. 기업 업무를 처음부터 끝까지 수행하는 능력을 재는 자동화벤치(AutomationBench)에서는 51.3점으로 1위에 올랐다.

아르곤은 시각적 이해가 필요한 지식 업무에도 강점을 보인다. 구글은 차트 분석과 장시간 영상 속 정보 파악, 여러 문서를 바탕으로 한 작업 수행을 모델의 강점으로 들었다. 장시간 영상 이해 능력을 평가하는 엘브이벤치(LVBench)에서는 91.7점을 기록해 최고 성능을 냈다고 밝혔다. 복잡한 작업을 여러 단계에 걸쳐 이어가는 능력을 뒷받침하기 위해 출력 한도도 기존 6만4000토큰에서 100만토큰으로 늘렸다.

사이버 방어 담당자부터 단계적 제공

구글은 아르곤이 소프트웨어 취약점을 자율적으로 찾아내고 검증한 뒤 수정할 수 있도록 훈련했다고 밝혔다. 사이버 보안업체 위즈(Wiz)는 중요 공공 인프라의 고위험 보안 문제를 찾아 무료로 조치하는 ‘스캔 포 굿’(Scan for Good) 프로그램에서 아르곤을 활용하고 있다. 초기 시험에서 병원들이 사용하는 의료 소프트웨어의 민감한 개인정보를 노출할 수 있는 중대한 취약점을 찾아냈으며, 이전 프런티어 모델은 이를 발견하지 못했다고 구글은 전했다.

취약점 수정 능력 평가인 씨더블유이 벤치 v1(CWE-bench v1)에서는 68%를 얻어 공동 1위를 기록했다. 다만 구글은 모델을 한꺼번에 널리 공개하지 않고, 신뢰할 수 있는 사이버 방어 담당자에게 먼저 배포하며 안전장치를 점검하고 있다. 미국 정부의 출시 전 모델 접근 관련 자율 절차에도 참여 중이며, 초기 평가자의 의견을 반영해 안전장치를 보완한 뒤 개발자와 기업, 일반 이용자로 제공 범위를 넓힐 계획이다.

구글은 악용 방지를 위해 유해한 사이버 공격이나 화학·생물·방사능·핵 관련 요청을 거부하도록 설계했다고 밝혔다. 정당한 이중용도 연구는 허용하면서 악용 징후를 살피는 내부 활성값 모니터링 기법도 개선하고, 내부·외부 레드팀의 수동·자동 공격 시험을 거쳤다는 설명이다. 간접 프롬프트 인젝션(prompt injection) 공격에 대한 방어도 강화해 관련 평가에서 높은 강건성을 보였다고 덧붙였다. 출시 초기 가격은 입력 토큰 100만개당 2달러, 출력 토큰 100만개당 10달러이며, 캐시된 입력 토큰은 입력 가격에서 95% 할인된다. 구글은 개발자·기업·소비자 대상 확대 일정을 구체적으로 제시하지 않고 가능한 한 빠르게 제공하겠다고 밝혔다.

RELATED ARTICLES