국제 수학 문제를 푸는 등 ‘대형 추론 모델’(LRM)이 성과를 내는 동시에, 생성되는 ‘생각의 연쇄(체인 오브 소트)’가 실제 추론 과정을 정확히 보여주지 못한다는 지적이 이어지고 있다. 양자매거진(Quanta Magazine)은 8월 1일자 ‘Celsius Pictor for Quanta Magazine’ 관련 글에서, 추론은 중간 단계가 논리적으로 이어져 결론에 이른다는 방식으로 정의된다고 소개했다. 글은 다만 이런 중간 텍스트가 모델 내부 작동을 ‘충실하게’ 반영하는지에 대해선 의문이 커지고 있다고 밝혔다. 애플 연구진이 “생각의 환상”을 주장하며 조건이 단순해도 정확도가 붕괴할 수 있다고 지적한 뒤, 2025년에는 개러스 마커스와 어니스트 데이비스가 올림피아드 성과 등을 예로 “진짜 추론”을 의심할 이유가 무엇인지 반문했다고 전했다. 이어 산타페 연구소 연구를 근거로, LRM이 ‘표면 수준의 지름길’로 벤치마크를 통과할 수 있다는 결과가 나왔다고 설명했다. 글은 또한 2025년 아리조나주립대 연구자 수브바라오 캄바함파티가 “중간 토큰”을 틀린 내용으로 완전히 바꿔도 성능이 크게 떨어지지 않았다는 실험 결과를 언급했다. 그러면서 모델을 ‘정답 추론 흔적’으로만 학습해도 가끔은 비정상적인 기록을 생성할 수 있고, 정답을 내더라도 생성 텍스트가 그 과정의 정확한 보고가 아닐 수 있다고 덧붙였다.