GPT-6 아스트라, 가구 조립 벤치마크서 80% 기록

오픈AI(OpenAI)의 GPT-6 아스트라(GPT-6 Astra)가 가구 조립 과정의 오류를 찾는 벤치마크에서 80%의 점수를 기록했다. 더디코더는 9월 26일 이 같은 성능 비교 결과를 보도했다.

가구 조립 사진으로 오류 판별

에포크AI(Epoch AI)의 가구 조립 벤치마크(Furniture Assembly Benchmark·FAB)는 이케아(IKEA) 가구 3종을 조립하는 장면을 촬영해 모델의 시각적 판단 능력을 시험한다. 조립 사진에는 일부러 오류를 넣고, 모델은 사진과 조립 설명서를 비교해 잘못된 부분을 찾아낸 뒤 어떤 문제가 생겼는지 설명한다. 단순히 사진 속 물체를 알아보는 데 그치지 않고, 설명서에 나온 조립 과정과 실제 결과를 대조해야 하는 방식이다.

벤치마크에서 GPT-6 아스트라는 사진 한 장을 처리하는 데 3분을 쓰고 80%를 기록했다. 클로드 페이블 5.1(Claude Fable 5.1)은 70%, 클로드 오푸스 5(Claude Opus 5)는 61%였다. 앞서 2025년 11월에는 클로드 오푸스 4.5(Claude Opus 4.5)가 28%로 가장 높은 점수를 냈다. 당시 최고 점수와 비교하면 10개월 뒤 선두 모델의 벤치마크 점수가 크게 높아진 셈이다. 다만 이 점수는 해당 시험에서의 성적이며, 모든 가구나 실제 조립 환경에서 같은 성능을 낸다는 뜻은 아니다.

실시간 안내는 아직 어려워

사진 한 장을 분석하는 데 3분이 걸리는 만큼, 현재 성능으로는 조립 중인 사람에게 실시간으로 오류를 알려주는 용도에 적합하지 않다. 조립 과정에서 사진을 찍고 모델의 답을 기다린 뒤 다음 작업으로 넘어가는 방식이라면 즉각적인 안내가 어렵다는 의미다. GPT-6 아스트라는 시각 정보를 활용하는 로봇 작업에서도 뛰어난 성능을 보였다. 가구 조립 오류를 찾는 능력과 로봇의 시각 작업 수행 능력이 함께 주목받는 배경이다.

연구진은 기술이 발전하면 자동차 수리나 가전제품 수리에도 도움을 줄 수 있다고 내다봤다. 현재 벤치마크는 이케아 가구 3종을 대상으로 하지만, 사진과 설명서를 대조해 잘못된 작업을 찾아내는 방식은 다른 수리 상황으로 확장될 가능성이 있다는 취지다. 다만 실제 적용 시점이나 구체적인 제품·서비스 계획은 제시되지 않았다.

중국의 오픈 웨이트 모델인 키미 K3(Kimi K3) 등은 선두 모델보다 최소 7개월 뒤처진 것으로 평가됐다. 모델 간 격차와 성능 향상은 시각 기반 작업에서 AI의 진전이 이어지고 있음을 보여주지만, 점수만으로 실제 현장의 신뢰성이나 작업 안전성을 판단하기는 어렵다. 이번 결과는 조립 오류를 설명하는 능력이 개선됐다는 점과 함께, 처리 시간 단축이 실시간 활용을 위한 과제로 남아 있음을 드러낸다.

RELATED ARTICLES