세레브라스·AMD, 분리형 AI 추론 구축…프리필은 5배 전력 대비 토큰

세레브라스와 AMD가 초저지연 분리형 AI 추론(disaggregated AI inference) 솔루션을 구축하기 위한 파트너십을 발표했다. 세레브라스 최고마케팅책임자 줄리 최(Julie Choi)에 따르면, “AMD의 헬리오스(Helios) 랙스케일 아키텍처로 프리필(prefill) 구간을 담당하고, 세레브라스(Cerebras) 웨이퍼-스케일 엔진(Wafer-Scale Engine)으로 디코드(decode) 구간의 지연을 낮춘다”고 전했다. 세레브라스 최고마케팅책임자 줄리 최(Julie Choi)는 이 조합이 전력 소모 대비 초당 토큰이 기존 대비 5배 높다고 설명했다. 또 올해 말 세레브라스는 자사 데이터센터에 AMD 헬리오스 시스템을 도입해 프리필 계층에 적용할 계획이다. 최 책임자는 디코드 병목이 메모리 대역폭에 의해 제한된다며, 웨이퍼-스케일 엔진이 경쟁 엔비디아(Nvidia) GPU 대비 메모리 대역폭이 약 2000배라고 말했다.

원문 보기 (siliconangle.com)

RELATED ARTICLES