클로드 하이쿠 5.5대 GPT-6 루나…값도 점수도 같은데 강점은 정반대
단가도 아티피셜 애널리시스 지능지수도 같은 클로드 하이쿠 5.5와 GPT-6 루나를 평가 항목별로 쪼갰다. 하이쿠는 장기 문서 작업·터미널 작업·낮은 환각률에서, 루나는 SaaS 업무 자동화·지식 정답률·긴 문맥에서…
태그
기사 13건
단가도 아티피셜 애널리시스 지능지수도 같은 클로드 하이쿠 5.5와 GPT-6 루나를 평가 항목별로 쪼갰다. 하이쿠는 장기 문서 작업·터미널 작업·낮은 환각률에서, 루나는 SaaS 업무 자동화·지식 정답률·긴 문맥에서…
제브(Jev) 공개 일주일 만에 허깅페이스에 복제판 저장소가 77개 올라왔다. 제브는 구조상 따라 만들기 어렵지 않았고, 제브가 채워주지 않는 수요가 곳곳에 있었다. 다만 추론과 지식에서는 아직…
클로드 소넷 5.5는 토큰 단가가 오푸스 5.5의 절반이지만 같은 점수를 내는 데 든 돈은 2.2배였다. 두 모델은 이기는 과목이 다르고, 과제당 비용은 추론 강도 설정이…
구글이 공개한 제미나이 4 아르곤은 문서·장문맥 과제에서 앞섰지만 터미널·화면 조작 과제에서는 기복을 보였다. 독립 평가에선 GPT-6 아스트라와 동점이고, 일반 공개 날짜는 아직 없다.
GPT-6 루나 합류로 플래시급 AI 5종의 지능지수는 42~37점 5점 차에 불과하지만 과제당 비용은 18배 벌어졌다. 루나는 가장 저렴하지만 첫 답까지 98초, 터미널 코딩 시험은 GLM-5.3…
예측연구소(FRI)가 지난 4년간 AI 전문가와 슈퍼예측가의 예측을 채점했다. 수학 벤치마크와 기업 매출은 예측을 5~10년 앞섰지만, 로보택시와 생물학 실험처럼 현실의 마찰을 거쳐야 하는 문항은 기대를 크게…
앤트로픽 클로드 오푸스 5.5와 오픈AI GPT-6 솔·루나를 직전 세대와 나란히 비교했다. 오푸스 5.5는 지능지수를 58점까지 끌어올렸으나 추론 토큰 증가로 과제당 실질 비용(5.98달러)이 제자리에 머물렀고, 솔은…
샤오미 미모 V2.6 프로가 아티피셜 애널리시스 46점으로 글로벌 오픈웨이트 1위에 올랐다. 과제당 0.13달러로 클로드 오푸스 5.5 대비 46분의 1 수준이다. 상업적 제약 없는 MIT 라이선스와…
챗GPT 개발을 주도했던 연구자가 자기회귀 생성을 전면 포기했다. 타입세이프AI가 공개한 Jev는 문장 대신 사전 한정된 선택지 위 확률분포를 반환한다. 마케팅 수치로는 193배 빠르다고 공표했으나 제3자…
지능 지수는 1.3배 차이인데 과제당 비용은 28배 벌어진다. 9월 열흘 사이 쏟아진 프런티어 2종(GPT-6·클로드)과 고속 추론 2종(제미나이·딥시크)을 동일한 기준선 위에 올려놓고, 어느 작업에 무엇을 배치해야…