머큐리 2.5(Mercury 2.5)가 초당 770토큰을 생성하는 것으로 제시됐다. 아티피셜 애널리시스(Artificial Analysis)는 9월 24일 공개한 모델 페이지에서 이 수치를 소개했다.
인텔리전스 지수 평가도 업데이트
페이지는 아티피셜 애널리시스 인텔리전스 지수(Intelligence Index) 버전 4.3.2가 10개 평가를 반영한다고 설명했다. 평가 항목은 AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1이다.
지수는 모델의 전반적인 성능뿐 아니라 에이전트형(agentic) 지식 업무와 실제 업무, SaaS 작업 흐름, 코딩·터미널 사용, 전문 문서 추론, 물리 추론, 의료 분야의 긴 문맥 추론 등 세부 역량을 평가한다. 페이지는 특정 용도의 모델을 고를 때 해당 용도와 관련된 개별 평가 결과가 더 적합할 수 있다고 안내했다.
속도와 능력 평가는 별도 지표
AA-Briefcase v1.1은 에이전트형 지식 업무 벤치마크다. 루브릭 통과율, 분석 품질, 프레젠테이션 품질을 종합해 엘로(Elo) 점수로 나타내며, 루브릭 성능도 가상 일대일 비교를 통해 엘로 점수에 반영한다.
AA-Omniscience 지수는 지식의 신뢰도와 환각을 평가한다. 정답에는 점수를 주고 환각에는 감점을 적용하며, 답변을 거부한 경우에는 감점하지 않는다. 점수 범위는 -100부터 100까지로, 0은 정답과 오답이 같은 수준이며 음수는 오답이 정답보다 많다는 뜻이다. 페이지는 모델별 지능 평가와 함께 인텔리전스 지수 과제당 비용, 과제 수행에 쓰인 출력 토큰 수도 비교 항목으로 제시했다.
초당 770토큰은 페이지 제목에 제시된 머큐리 2.5의 생성 속도다. 제공된 페이지 내용에는 이 속도의 측정 조건이나 다른 모델과의 비교 결과, 머큐리 2.5의 인텔리전스 지수 점수와 가격·출시 일정은 별도로 나오지 않았다.