소규모 연구실이 고가의 대규모 GPU 없이도 개인용 하드웨어에서 프런티어 AI와 자율 연구 시스템을 구동할 수 있다는 주장이 나왔다. 해외 AI 연구 해외 AI 연구 블로그는 9월 22일 공개한 오픈소스 주간 프로젝트의 목표와 주요 성과를 소개했다. 대학 연구실이 보유 자원의 한계를 오히려 연구 방식의 혁신으로 전환할 수 있다고 설명했다.
오픈소스 생태계로 확장하는 AI 연구
이번 프로젝트는 개별 논문이나 단일 모델이 아니라 서로의 활용도를 높이는 여러 오픈소스 구성요소를 하나의 생태계로 묶는 데 초점을 맞췄다. 대상은 추론 서비스 프레임워크, 에이전트 하네스(harness), 두 기술을 결합한 자율 연구 시스템, 분야별 강화학습 환경 구축 방법이다. 연구팀은 사용자가 복잡한 기술 세부사항을 직접 다루지 않아도 되도록 설계해야 진정한 오픈소스가 된다고 봤다. 필요한 자원은 GPU 두 장이나 맥북 한 대로도 확보할 수 있지만, 전문 지식의 장벽은 소프트웨어 설계로 낮춰야 한다는 설명이다.
핵심 사례는 에이전트 하네스다. 사용자가 CUDA 커널을 포함한 추론 프레임워크 저장소와 최적화 목표를 지정하면, 에이전트가 별도의 중간 피드백 없이 장시간 작업을 이어가며 코드를 개선한다. 이 방식으로 맥과 Metal용 구현을 다듬은 결과, Qwen 3.6 35B-A3B 모델을 1.5비트 가중치로 양자화해 초당 450토큰을 처리했다고 전했다. 일반적인 반정밀도 모델이 가중치당 16비트를 사용하는 것과 비교하면 메모리 사용량은 약 10분의 1로 줄어든다는 것이다.
24GB GPU에서 1250억개 모델 구동
이 프레임워크를 사용하면 기존에 인기 있던 270억개 매개변수의 Qwen 3.8보다 큰 1250억개 매개변수 규모의 Qwen 3.8 플래시 넥스트(Flash Next)를 24GB GPU 한 장에서 실행할 수 있다고 주장했다. AMD 스트릭스(Strix), 엔비디아 DGX 스파크(DGX Spark), 128GB 메모리를 탑재한 맥북에서는 5500억개 매개변수의 딥시크 V4.1(DeepSeek V4.1)도 구동할 수 있다고 덧붙였다. 긴 문맥을 처리할 때 필요한 압축과 문맥 관리도 자동화해 추론 속도를 유지하도록 했다는 설명이다.
연구팀은 이 구성요소들을 결합해 자율 연구 시스템도 구축했다. 글에 따르면 새 정보 검색 기술은 지금까지 본 적 없는 정밀도를 보였으며, 해당 시스템은 프런티어 AI 연구소의 딥리서치 시스템과 사카나 AI의 시스템, 구글의 사이언티스트원(ScientistOne)보다 자율 연구 결과가 우수했다. 다만 이는 외부 검증 결과가 아니라 해당 프로젝트를 소개한 글의 평가다. 에이전트를 활용하면 과거 1년가량 걸리던 엔지니어링과 실험을 수주 또는 수일 안에 수행할 수 있어 연구의 단위가 논문에서 연결된 생태계로 옮겨가고 있다고 진단했다.
향후 공개 범위와 구체적인 배포 일정, 가격 정책은 제시되지 않았다. 프로젝트 측은 오픈소스 주간을 통해 소규모 연구실이 수행할 수 있는 자율 연구, 효율적인 테스트 시점 확장, 클로드 코드(Claude Code)나 코덱스(Codex)보다 효율적인 자동 압축 기능을 보여주겠다고 밝혔다. 대학 연구실이 대형 연구소와 같은 GPU 규모를 확보하지 못하더라도 저비용 모델 실행과 사용성 개선을 통해 새로운 연구 생태계를 만들 수 있다는 것이 이번 글의 핵심 주장이다.