오픈AI가 ARC-AGI-3 벤치마크에서 GPT-5.6 솔(GPT-5.6 Sol) 성적이 API 설정 2가지를 켠 뒤 3배로 올랐다고 밝혔다. 오픈AI는 7월 30일 웹사이트에 공개한 설명에서 공식 하네스에서는 13.3%였던 점수가 자사 조건을 적용한 뒤 38.3%로 올랐다고 전했다. 오픈AI는 두 설정이 챗GPT(ChatGPT)와 코덱스(Codex)에서 쓰는 ‘추론 유지’와 ‘컴팩션’이라고 설명했다. 공식 하네스(공개용)에서는 GPT-5.6 솔이 ARC-AGI-3 퍼블릭 세트에서 13.3%를 기록했지만, 추론 유지·컴팩션을 켠 자사 하네스에서는 38.3%로 뛰었다는 것이다. 또 오픈AI는 출력 토큰도 퍼블릭 과제 기준으로 6배 줄었다고 덧붙였다. 회사는 ARC-AGI-3 하네스가 매 행동 뒤 비공개 추론을 폐기하고, 롤링 절단으로 이전 행동이 보이지 않게 만들어 성적 하락을 낳았다고 밝혔다.