연구진, 사진을 편집 가능한 3D 장면으로 바꾸는 코딩 에이전트 개발

메릴랜드대(University of Maryland)와 AWS 연구진이 사진 한 장을 편집 가능한 3D 장면으로 바꾸는 코딩 에이전트를 개발하고, 기하 정확도와 자기평가에 한계가 있음을 확인했다. 연구 내용은 더디코더가 10월 3일 보도했다.

사진 한 장을 실행 가능한 3D 장면으로

연구진의 프로젝트 ‘LEGO-Anything’은 이미지에서 코드를 만드는 ‘Image-to-Code’ 방식으로 작동한다. 코딩 에이전트가 사진을 바탕으로 3D 소프트웨어 블렌더(Blender)에서 실행할 프로그램을 작성한 뒤, 결과물을 확인하고 코드를 수정하는 과정을 반복한다. 한 번에 장면을 생성하는 대신 단계적으로 다듬으며, 완성된 결과는 실행·점검·수정할 수 있는 프로그램 형태다. 물체와 기하 구조, 배치, 카메라 위치가 코드에 명시돼 장면을 편집하거나 분석 작업에 활용할 수 있다.

성능을 측정하기 위해 연구진은 LEGO-Bench를 만들었다. 실내·실외 장면 104개에서 만든 이미지 208장과 등록된 에셋 443개로 구성됐다. 실제 사진은 정확한 3D 정답 자료가 없고 단순한 합성 장면은 현실감이 떨어진다는 점을 고려해, 전문적으로 구축한 시뮬레이터 장면을 렌더링해 평가 자료로 삼았다. 장면의 실제 기하 구조와 깊이, 물체 배치는 숨겨 정답으로 두고, 장면 유효성·기하 재구성 정확도·원본과의 시각적 유사도를 평가했다.

기하 정확도와 자기평가가 걸림돌

시험한 GPT 구성 6종은 거의 매번 작동하는 장면을 만들었지만 정확도 차이는 컸다. 가장 높은 점수를 받은 GPT-6 아스트라(GPT-6 Astra)는 실내 장면에서 53.4%, 실외에서 39.6%를 기록했고, 성능이 낮은 구성은 약 15%에 그쳤다. 장면이 복잡해질수록 정확도는 떨어졌으며 실외 장면이 실내보다 어려웠다. 추론에 더 많은 예산을 배정하자 GPT-6 계열의 성능이 개선됐고, 아스트라의 사무실 장면 점수는 32.3%에서 61.8%로 올랐다.

연구진은 에이전트의 작업 과정을 분석해 처음부터 부정확한 결과를 내거나, 수정 과정에서 앞서 개선한 부분을 되돌리는 문제를 확인했다. 두 장면 중 원본과 더 가까운 것을 고르게 하는 평가에서도 기하 판단은 우연히 맞히는 수준에 가깝거나 그보다 낮았다. 자기 장면이 나아졌는지 에이전트 스스로 안정적으로 판별하기 어렵다는 의미다. 이에 연구진은 모델의 주관적 판단보다 구체적인 측정값을 바탕으로 결과를 다듬어야 한다고 봤다.

이를 반영해 별도 학습 없이 작동하는 확장 기능 LEGO-Plugin도 개발했다. 기준 장면을 원본 이미지에 맞춰 설정하고, 신뢰하기 어려운 자기평가 대신 측정값을 활용하며, 수정 중 이미 맞게 만들어진 부분이 퇴보하는 것을 막는다. 이 기능은 시험한 6개 모델 모두의 성능을 높였고, 약한 에이전트에서 개선 폭이 가장 커 최대 62.7%에 달했다. 이미 성능이 높았던 모델의 상승 폭은 약 2%포인트였다.

복원한 장면은 물체 탐지와 분할, 깊이 추정에도 활용할 수 있지만 전문 모델과의 성능 격차는 남아 있었다. 물체 탐지 결과는 전용 모델 DINO의 성능 약 절반 수준이었고, 분할과 깊이 추정은 각각 SAM 3, Depth Anything 3와 차이가 더 컸다. 연구진은 코딩 에이전트가 만든 실행 가능한 장면이 활용 가능성을 보였지만 충실한 3D 재구성에는 아직 정확도가 부족하다고 평가했다.

RELATED ARTICLES