세레브라스와 AMD가 초저지연 분리형 AI 추론(disaggregated AI inference) 솔루션을 구축하기 위한 파트너십을 발표했다. 세레브라스 최고마케팅책임자 줄리 최(Julie Choi)에 따르면, “AMD의 헬리오스(Helios) 랙스케일 아키텍처로 프리필(prefill) 구간을 담당하고, 세레브라스(Cerebras) 웨이퍼-스케일 엔진(Wafer-Scale Engine)으로 디코드(decode) 구간의 지연을 낮춘다”고 전했다. 세레브라스 최고마케팅책임자 줄리 최(Julie Choi)는 이 조합이 전력 소모 대비 초당 토큰이 기존 대비 5배 높다고 설명했다. 또 올해 말 세레브라스는 자사 데이터센터에 AMD 헬리오스 시스템을 도입해 프리필 계층에 적용할 계획이다. 최 책임자는 디코드 병목이 메모리 대역폭에 의해 제한된다며, 웨이퍼-스케일 엔진이 경쟁 엔비디아(Nvidia) GPU 대비 메모리 대역폭이 약 2000배라고 말했다.