xAI(xAI)가 코딩과 전문 지식 업무를 겨냥한 AI 모델 그록 4.7(Grok 4.7)을 출시했다. 회사는 22일 자사 웹사이트를 통해 그록 4.7이 어려운 과제를 더 오래 처리하고 자체 결과 검증 능력을 강화했으며, 입력 토큰 100만개당 2달러부터 이용할 수 있다고 밝혔다.
그록 4.7의 코딩·지식 업무 성능
그록 4.7은 코딩 작업과 지식 기반 업무를 위해 개발된 모델로, 어려운 과제를 더 오래 처리하고 작업 결과를 보다 꼼꼼하게 확인하도록 훈련됐다. xAI는 긴 코딩 작업을 평가하는 커서(Cursor)벤치 4.0에서 그록 4.7이 가격 대비 성능 부문에서 최상위권에 해당한다고 설명했다. 이는 회사가 제시한 평가 결과로, 그록 4.7이 비슷한 급의 모델보다 두 배 빠른 속도와 절반 수준의 가격 경쟁력을 갖췄다는 설명도 함께 제시됐다.
기존 그록 4.6과 비교해 더 큰 기반 모델을 사용했으며, 여러 시간 이어지는 문제에 더 높은 비중을 둔 어려운 과제 조합으로 강화학습을 더 길게 진행했다. 긴 문맥을 관리하고 자신의 답변을 검증하는 능력도 개선됐다는 것이다. 그록 봇 하네스(Grok Bot harness)를 기본적으로 이해하도록 학습해 대화형 작업과 일반 지식 업무에 대응하는 방식도 보완했다. 문서와 프레젠테이션 작성 성능은 전문직 업무를 평가하는 GDPval과 AA 브리프케이스에서 그록 4.6보다 향상됐고, 다른 프런티어 모델과 비슷한 수준을 보였다고 회사는 밝혔다.
안전장치와 이용 방법
그록 4.7에는 새로운 안전장치 체계가 적용됐다. xAI는 자체 시험에서 거부 응답과 탈옥 공격 대응력이 가장 강한 모델이라고 주장했으며, 사이버보안과 생물학처럼 정상적인 활용과 위험한 활용이 함께 가능한 분야에서 정상적인 작업에서의 유용성과 위험한 작업에 대한 안전한 거부 모두에서 앞선다고 설명했다. 래치바이오의 생물안전 평가에서는 62.4%의 점수를 기록해 해당 벤치마크에서 가장 높은 성능을 보였다고 덧붙였다.
사이버보안 분야에서는 위험하거나 악의적인 작업을 평가하는 해커벤치 v0.3에서 위험성이 있는 이중용도 프롬프트의 3.3%만 허용하면서도 정상적인 보안 작업은 드물게 차단했다고 xAI는 밝혔다. 회사는 방어 연구를 위해 일부 사이버보안 파트너에게 그록 4.7의 레드팀 기능을 초대 전용으로 제공하기 시작했다. 모델은 현재 커서와 그록 빌드(Grok Build), 그록 API에서 이용할 수 있으며, 제3자 코딩 하네스와 모델 라우터, 클라우드 플랫폼을 통해서도 제공된다.
가격은 입력 토큰 100만개당 2달러, 출력 토큰 100만개당 6달러부터 시작한다. 출력 속도를 두 배로 높인 빠른 변형 모델도 제공되지만 가격은 두 배다. xAI는 그록 4.7이 그록 4.6과 같은 가격과 속도로 서비스된다고 설명하면서, 비교 대상 모델과 견줘서는 두 배 빠르고 절반 가격이라고 밝혔다. 다만 이 같은 가격 대비 성능과 안전성 평가는 회사가 제시한 자체 또는 외부 벤치마크 결과에 기반한 설명이다.