코어위브(CoreWeave)가 엔비디아(Nvidia)·유닷컴(You.com)과 검색 도구를 활용해 네모트론 3.5 라이트닝(Nemotron 3.5 Lightning)을 8시간 만에 후학습하고, 반복 학습 과정의 GPU 활용률을 높이기 위한 인프라를 공개했다. IT 전문 매체 실리콘앵글은 10월 7일 코어위브와 유닷컴 관계자들이 풀리 커넥티드 행사에서 이 같은 기술과 에이전트 개발 방향을 논의했다고 보도했다.
코어위브, 모델 배포·평가·개선 연결
코어위브가 발표한 ‘코어위브 포지(CoreWeave Forge)’는 모델 배포와 평가, 개선 과정을 연결하는 AI 클라우드 플랫폼이다. 이 플랫폼의 강화학습 기능인 ‘RL 롤아웃(RL Rollouts)’은 현재 미리보기 단계로, 학습용 응답을 생성하고 모델을 갱신하는 과정을 반복하도록 지원한다. 기업들이 AI 에이전트를 지속적으로 개선하는 상황에서 학습 단계 사이의 지연을 줄이면 개선 작업을 원활하게 이어가는 데 도움이 된다.
후학습 과정에서 GPU가 다음 학습 작업을 기다리는 시간을 줄이려면 데이터 이동과 모델 가중치 로딩을 효율화해야 한다. 샌더스는 이전에는 매번 객체 스토리지에서 가중치를 불러왔지만, 코어위브는 가까운 다른 서버에서 가중치를 가져와 새 학습을 빠르게 시작하는 방식을 마련했다고 말했다. 코어위브 AI 객체 스토리지는 리전 간 쓰기도 지원해, 후학습 작업의 결과를 다른 작업이 활용할 수 있도록 했다. 코어위브는 데이터를 GPU에 빠르게 전달하기 위한 저장 인프라를 구축했다고 설명했다.
유닷컴 검색 도구로 에이전트 후학습
자체 웹 색인을 운영하는 유닷컴은 코어위브 파트너 네트워크에 합류해 AI 에이전트에 검색 기능을 제공하고 있다. 양사는 엔비디아와 협력해 유닷컴의 웹 검색 도구를 적용한 상태로 네모트론 3.5 라이트닝을 RL 롤아웃으로 후학습했고, 작업은 8시간 만에 끝났다. 유닷컴 최고제품책임자 사우라브 샤르마(Saurabh Sharma)는 모델의 지능이 높아지는 것만으로는 에이전트의 성공을 보장할 수 없으며, 도구를 활용하는 능력이 성능을 좌우한다고 말했다.
샤르마는 고객들이 더 높은 정확도와 낮은 총소유비용으로 작업을 수행할 수 있다고 전했다. 또 후학습을 8시간 안에 마칠 수 있다면 이런 작업이 일부 최첨단 AI 연구소만의 영역에 머물지 않을 것이라고 말했다. 다만 보도에는 정확도 향상 폭이나 비용 절감액, GPU 활용률의 구체적인 수치는 제시되지 않았다. 따라서 8시간이라는 결과는 공개됐지만, 기존 방식과의 정량 비교는 확인되지 않는다.
코어위브는 RL 롤아웃을 현재 미리보기로 제공한다고 밝혔으며, 정식 출시 시점이나 가격은 보도에 나오지 않았다. 행사 인터뷰에서는 모델을 반복 개선하는 작업에서 가중치 로딩과 데이터 이동을 줄이는 인프라가 함께 다뤄졌다. 실리콘앵글은 해당 행사의 큐브(theCUBE) 중계가 유료 미디어 파트너십에 따라 진행됐으며, 코어위브 등 후원사는 콘텐츠 편집권을 갖지 않았다고 공개했다.