코어위브(CoreWeave)가 코어위브 클라우드에서 엔비디아(Nvidia) 베라 루빈 NVL72를 업계 최초로 초기 가동·검증하고 AI 추론과 에이전트형(agentic) AI를 겨냥한 풀스택 클라우드 전략을 강화하고 있다. IT 전문 매체 실리콘앵글은 9월 26일 코어위브의 검증과 AI 인프라 사업 방향을 보도했다.
추론 시대 겨냥한 풀스택 인프라
기업의 AI 활용 중심이 모델 학습에서 추론으로 옮겨가면서 코어위브 같은 AI 특화 클라우드 사업자들이 맞춤형 인프라를 제공하고 있다. 코어위브는 엔비디아의 베라 루빈 NVL72를 자사 클라우드에서 처음으로 가동하고 검증했다고 밝혔다. 더큐브리서치 조사에서는 기업의 86%가 컴퓨팅 자원보다 데이터 통합을 우선순위로 꼽았다. AI 성능을 높이려면 가속기뿐 아니라 데이터와 소프트웨어, 운영 체계를 함께 갖춰야 한다는 설명이다.
더큐브리서치의 폴 나샤와티 수석 애널리스트는 기업의 과제가 GPU 용량 확보를 넘어 AI 애플리케이션의 전 생애주기를 뒷받침할 통합 기반을 마련하는 데 있다고 진단했다. 같은 조사에서 약 30%의 조직은 AI 실험과 실제 운영 사이에 준비도 격차를 겪고, AI 시범사업의 약 88%가 운영 단계에 도달하지 못하는 것으로 나타났다. 코어위브는 엔비디아의 풀스택 플랫폼과 결합해 컴퓨팅 성능, 데이터 이동, 인프라 관리와 개발자의 운영 도구를 한데 제공함으로써 이런 격차를 줄이려 한다.
토큰 비용 낮추고 에이전트형 AI 지원
베라 루빈 플랫폼의 상업적 효과로는 토큰 비용 절감이 거론된다. 더큐브리서치 분석에 따르면 새 시스템의 100만토큰당 비용은 엔비디아의 이전 제품 대비 10분의 1 수준이다. 다만 비용 하락이 기업의 지출만 줄이는 데 그치지 않고 AI 이용을 늘려 시장을 키울 가능성도 있다고 분석했다. 코어위브는 높은 자원 활용률과 빠른 용량 확보, 토큰 비용 측면의 이점을 내세우며 범용 클라우드와 차별화를 시도하고 있다.
코어위브의 진 잉글리시 최고마케팅책임자는 고객들이 다른 서비스를 이용한 뒤 필요한 안정성을 얻지 못해 자사로 온다고 말했다. 피터 살란키 최고기술책임자는 추론을 여러 전문 단계로 나누는 구상을 제시했다. 먼저 작은 모델이 질문을 처리하고 더 복잡한 작업은 큰 모델이 맡으면 성능과 비용의 균형을 맞출 수 있다는 설명이다. 엔비디아의 디온 해리스 가속컴퓨팅 제품 마케팅 담당 수석 이사는 에이전트형 AI가 단일 추론을 넘어 계획을 세우고 하위 에이전트와 기술을 활용해 실제 작업을 수행하는 방식이라고 설명했다. 이 과정에는 안전한 코드 배포를 위한 GPU와 CPU의 결합도 필요하다.
코어위브는 9월 30일부터 10월 1일까지 미국 샌프란시스코에서 열리는 ‘풀리 커넥티드’ 행사에서 자사와 생태계 파트너들의 인프라 관련 논의를 이어갈 예정이다. 나샤와티 애널리스트는 에이전트형 AI와 추론이 확대될수록 기업은 배포 규모뿐 아니라 관측 가능성, 보안, 거버넌스, 비용 관리까지 애플리케이션 전 과정에서 지원하는 인프라를 필요로 한다고 말했다. 코어위브의 베라 루빈 검증은 단일 구성요소보다 운영 단계에 맞춘 통합 AI 시스템으로 업계가 이동하고 있다는 사례로 제시됐다.