엔비디아의 이언 벅(Ian Buck) 부사장은 AI 데이터센터의 경제성이 전력당 토큰 처리량에 달려 있으며, 블랙웰(Blackwell)에서 와트당 토큰 효율을 30배 높였다고 말했다. 실리콘앵글(SiliconANGLE)은 2일 벅 부사장이 ‘퓨얼리 커넥티드’ 행사에서 진행한 인터뷰를 보도했다.
AI 공장 경제성, 칩에서 시스템으로
벅 부사장은 AI 시스템이 여러 모델과 데이터베이스, 도구를 함께 쓰는 에이전트형(agentic) 작업으로 확장되면서 개별 GPU 성능만으로는 데이터센터의 경제성을 설명하기 어렵다고 말했다. 네트워크와 저장장치, 프로세서, 소프트웨어가 하나의 컴퓨팅 시스템처럼 작동해야 하며, 전력 단위당 유용한 결과를 더 많이 내는 것이 중요하다는 설명이다. (실리콘앵글은) 벅 부사장이 더큐브(theCUBE)의 데이브 밸런테와 존 퍼리어와 나눈 인터뷰를 전했다.
AI 공장의 상업적 산출물은 배포된 모델이 요청을 처리해 만들어내는 토큰이며, 이 과정인 추론이 매출과 연결된다고 벅 부사장은 설명했다. 다만 추론이 학습을 대체하는 것은 아니다. 기업은 데이터와 시장 상황이 달라지면 모델을 계속 다듬고 정렬하며 새 데이터를 반영하고, 강화학습과 온라인 정렬도 이어간다는 것이다. 그는 토큰을 단순한 IT 비용이 아니라 수익을 만들고 생산적으로 쓰이는 자산에 비유했다.
전력 한계가 추론 설계 좌우
벅 부사장은 데이터센터가 구축할 수 있는 컴퓨팅 인프라의 한계는 전력 용량이라고 말했다. 이에 따라 전력 1와트당 처리하는 토큰 수가 핵심 지표가 되며, 엔비디아는 GPU 세대가 바뀔 때마다 와트당 토큰 효율을 10배 이상 높인다고 설명했다. 블랙웰에서는 최종적으로 와트당 토큰 효율이 30배 개선됐다고 주장했다.
응답 속도가 중요한 작업에는 처리량뿐 아니라 사용자별 토큰 생성 속도도 중요해진다. 벅 부사장은 엔비디아의 그록 3 LPX(Groq 3 LPX) 추론 가속기를 베라 루빈(Vera Rubin) 플랫폼에 더하면 빠른 추론이 필요한 작업에서 토큰 속도를 높일 수 있다고 말했다. 실시간성이 필요한 핀테크 분야 등에서 이런 구성에 관심이 있다고 덧붙였다.
코어위브(CoreWeave)는 고객이 시스템 구성을 직접 선택하거나 처리량과 토큰 속도의 균형을 맞추는 상위 추론 서비스를 이용하도록 지원한다고 벅 부사장은 설명했다. 그는 선택지가 복잡해질수록 파트너 생태계가 중요하다고 말했다. 인터뷰에서는 제품 가격이나 구체적인 출시 일정은 제시되지 않았다.