오픈AI 울트라패스트는 어느 칩에서 도나…”엔비디아 GPU” 한마디에 세레브라스 흔들렸다

세미애널리시스의 엔비디아 지목, 세레브라스 주가 7% 급락, 오픈AI 침묵 속 엇갈린 발표문

작업대에 금색 회로 패턴 패널과 엔비디아 칩이 장착된 기판이 있고, 뒤에서 방진복 입은 작업자가 장비를 조작한다.
핵심 요약
1
울트라패스트 출시:오픈AI는 GPT-6 아스트라에 울트라패스트를 적용했으며, 코덱스 기준 최대 8배 빠른 초당 300토큰의 속도를 제시했다.
2
높아진 이용 비용:울트라패스트의 입력 토큰 가격은 표준의 6배이며, 코덱스와 챗GPT 워크에서 이용하려면 월 500달러의 Pro 500 요금제가 필요하다.
3
세레브라스 기반 전례:오픈AI는 8월 GPT-5.6 솔의 울트라패스트 프리뷰가 세레브라스로 구동되며 초당 최대 750개의 출력 토큰을 생성한다고 발표했다.
4
엔비디아 구동 논란:세미애널리시스는 GPT-6.1 솔 울트라패스트가 엔비디아 GPU에서 구동된다고 주장했지만 근거를 공개하지 않았고, 해당 모델은 영문 공식 발표 기준 아직 출시 전이다.
5
주가 급락과 미확인 칩:세레브라스 주가는 장 초반 7% 급락했지만, 오픈AI는 정식 출시된 GPT-6 아스트라 울트라패스트의 구동 칩을 공식적으로 밝히지 않았다.

오픈AI(OpenAI)의 새 속도 등급 울트라패스트(Ultrafast)가 어느 칩에서 구동되는지를 둘러싸고 업계의 진실 공방이 벌어졌다. 반도체 전문 분석업체 세미애널리시스(SemiAnalysis)가 세레브라스(Cerebras)가 아니라 엔비디아(Nvidia) GPU라고 주장하면서다. 세레브라스 주가는 장 초반 7% 급락했다. 오픈AI는 일체 침묵을 지키고 있다.

발단은 현지시간 29일 열린 데브데이(DevDay) 2026이다. 오픈AI는 공식 X 계정을 통해 새로운 속도 등급인 울트라패스트를 GPT-6 아스트라(GPT-6 Astra)에 우선 적용하고, GPT-6.1 솔(GPT-6.1 Sol)에는 곧 적용할 방침이라고 공식 발표했다. 일본 IT 전문 매체 기가진(GIGAZINE)에 따르면 속도는 코덱스(Codex) 기준 최대 8배, 초당 300토큰이다. 입력 토큰 가격은 표준의 6배로 뛴다. 코덱스와 챗GPT 워크(ChatGPT Work)에서 쓰려면 새로 나온 월 500달러(약 68만원)짜리 Pro 500 요금제에 가입해야 한다. 발표문 어디에도 칩 이름은 없었다.

8월엔 분명히 세레브라스였다

두 달 전에는 달랐다. 오픈AI는 8월 13일 GPT-5.6 솔 모델로 울트라패스트를 미리 공개하며 세레브라스를 직접 거명했다.

“세레브라스가 구동하는 울트라패스트는 초당 최대 750개의 출력 토큰을 생성한다.”

— 오픈AI 8월 13일 울트라패스트 공식 프리뷰 발표문 중

세레브라스도 같은 날 공식 블로그에서 웨이퍼 한 장 크기 칩에 SRAM 44GB를 올린 구조를 속도의 비결로 꼽았다. 모델 가중치를 칩 바깥 메모리에서 끌어오지 않으니 한 사람에게 토큰을 빨리 뽑아줄 수 있다는 설명이다. 양사 간에는 대규모 공급 계약도 체결돼 있다. 미국 투자은행 웨드부시(Wedbush)에 따르면 오픈AI는 2028년까지 세레브라스 설비 750MW(메가와트) 규모를 사용하는 장기 계약을 맺은 상태다.

그래서 데브데이 직후엔 세레브라스를 당연시하는 반응이 많았다. AI 분석가 처비(Chubby)는 자신의 X를 통해 “세레브라스가 결실을 맺었다(Cerebras paid off!)”라며 세레브라스의 승리를 당연시했다. 다만 걸리는 것은 숫자였다. 속도가 초당 750토큰에서 300토큰으로 내려앉았기 때문이다.

먼저 고개를 갸웃한 애널리스트

첫 의문은 발표 직후 제기됐다. 시장조사업체 크리에이티브 스트래티지스(Creative Strategies)의 수석 애널리스트 맥스 와인바흐(Max Weinbach)는 자신의 공식 X 계정을 통해 “GPT-6 아스트라 울트라패스트의 초당 300토큰 속도는 세레브라스 특성과 맞지 않는다”며 배치를 낮춘 엔비디아 GB300이나 오픈AI 자체 칩 할라페뇨일 가능성을 가장 먼저 제기했다.

GB300은 엔비디아의 현행 데이터센터용 GPU 시스템이다. 할라페뇨(Jalapeño)는 오픈AI가 브로드컴(Broadcom)과 함께 개발 중인 자체 추론 전용 칩으로, 지난 8월 25일 첫 벤치마크 결과가 공개됐다. 오픈AI는 연내 자사 데이터센터 배치를 시작하겠다고 공언했다.

댓글은 곧바로 갈렸다. 한 이용자는 “틀림없이 세레브라스다. GB300 클러스터로는 이 사용자당 처리량이 안 나온다”고 반박했다. 다른 이용자는 아스트라가 세레브라스가 초당 1800토큰을 자랑하는 모델들보다 훨씬 크다고 짚었다. 오픈AI 이용자 규모를 감당하려고 속도를 일부러 조였을 수 있다는 풀이도 붙었다.

세미애널리시스의 경보

몇 시간 뒤 반도체 전문 분석업체 세미애널리시스가 판을 키웠다. 한국시간 30일 오전 7시 세미애널리시스는 공식 X 계정을 통해 “최신 GPT-6.1 솔 울트라패스트는 세레브라스가 아니라 엔비디아 GPU에서 낮은 배치 크기로 구동 중”이라는 긴급 경보를 띄웠다. 이 게시물은 반나절 만에 조회수 63만회를 돌파하며 시장을 뒤흔들었다.

근거는 붙이지 않았다. 엔비디아 AI(NVIDIA AI) 공식 계정은 눈동자 이모지 하나만 달았다.

배치를 작게 잡으면 GPU 한 벌이 동시에 받는 요청이 줄고, 한 사람당 속도는 빨라진다. 대신 같은 장비로 받을 수 있는 손님이 준다. 한 댓글은 “낮은 배치 크기라니, 그렇게 비싸게 받을 수밖에 없다”고 달았다. 이 이용자는 자신이 추적하는 업체들의 GPU 임대료가 7월 말 이후 23% 올랐다는 주장도 덧붙였다.

이 주장이 가볍게 넘겨지지 않은 이유가 있다. 세미애널리시스는 오픈AI 연구실에서 엔지니어들과 함께 할라페뇨 벤치마크를 직접 측정한 기관이다. 오픈AI의 칩 사정과 인프라 구조를 가장 가까이서 들여다본 곳이라는 의미다.

국경을 넘은 갑론을박

기술적 논쟁은 글로벌 개발자 커뮤니티로 번졌다. 일본의 테크 분석가 파우로(paurooteri)는 자신의 X를 통해 “세레브라스의 독무대였던 메모리 대역폭 한계를 엔비디아 GPU가 어떻게 해결했는지 의문”이라고 되물었다.

중국 유력 개발자 커뮤니티 리눅스두(Linux.do)에서도 날 선 공방이 이어졌다. 엔비디아 편에 선 진영은 칩 한 장의 메모리가 40GB 남짓이라 큰 모델은 여러 장에 나눠야 하고 칩 간 통신(Interconnect)은 엔비디아가 앞선다고 봤다. 세레브라스 프리뷰 발표가 엔비디아와의 단가 협상용 카드에 불과했다는 관측과 함께 “데브데이에서 샘 올트먼이 세레브라스를 단 한 번도 언급하지 않았다”는 점도 거론됐다.

반대편도 물러서지 않았다. 800B 활성 파라미터 같은 거대 모델 가정 자체가 무리라는 반박이 나왔다. 세레브라스 CS-4 홍보 자료로 역산하면 GPT-5.6 솔의 활성 파라미터는 480억~500억개 수준이라는 계산도 올라왔다. 그렇다면 세레브라스의 칩 간 통신도 꽤 강한 것 같다는 댓글이 뒤따랐다.

주가가 먼저 반응했다

금융 시장은 사실 확인을 기다려주지 않았다. 금융 전문 매체 인베스팅닷컴(Investing.com)에 따르면 30일(현지시간) 세레브라스 주가는 장 초반 7% 급락했다. 세레브라스 측이 오픈AI 인프라 로드맵에서의 역할을 시인도 부인도 하지 않은 점이 불안감을 키웠다. 미국 경제지 배런스(Barron’s) 역시 오픈AI에 대한 과도한 의존도를 지목하며 주가 하락 배경을 보도했다.

세레브라스는 지난 5월 나스닥에 상장했다. 750MW 규모 계약은 이 회사의 성장 스토리 한가운데 자리 잡고 있다. 오픈AI 최신 모델이 경쟁 칩으로 구동되고 있다는 의혹 한마디에 주가가 크게 출렁인 배경이다.

오픈AI 울트라패스트 구동 칩 3대 후보 아키텍처 비교
공식 발표 및 세미애널리시스 분석 종합
[웨이퍼 엔진]
세레브라스 CS-4
초당 750토큰
단일 웨이퍼 44GB 온칩 SRAM 기반 극초저지연 구현. 단 대형 모델 다중 칩 확장 시 인터커넥트 병목 가능성 상존함.
[저배치 클러스터]
엔비디아 B200 8-GPU
초당 340토큰
배치 크기 축소와 TileRT 소프트웨어로 초고속 반응 구현. 대신 동시 수용량 감소로 GPU 임대 비용 급등함.
[자체 전용 칩]
오픈AI 할라페뇨
연내 사내 배치
브로드컴 협력 추론 전용 ASIC. 8월 첫 벤치마크 공개 후 엔비디아 의존도 완화 및 장기 비용 통제 수단으로 개발 중임.
[핵심 시사점] 데브데이 발표문에서 세레브라스 명칭이 삭제된 것은 단일 하드웨어 종속을 탈피하고 멀티 벤더 간 가격 경쟁을 유도하려는 오픈AI의 인프라 전략 변화를 시사함.

그러면 엔비디아가 맞나

아직은 카더라 수준이다.

의혹이 제기된 분석 대상부터 어긋나 있다. 와인바흐가 의문을 제기한 모델은 당일 즉시 활성화된 아스트라다. 반면 세미애널리시스가 지목한 GPT-6.1 솔 울트라패스트는 오픈AI의 영문 공식 발표문 기준으로 “며칠 안에(In the coming days)” 출시될 예정이다. 실제 개발자 API 공식 문서에도 울트라패스트 지원 모델로는 GPT-6 아스트라와 GPT-5.6 솔만 등재돼 있다.

혼선을 키운 건 오픈AI 자신이다. 같은 발표문의 한국어판과 일본어판은 GPT-6.1 솔 울트라패스트를 “출시합니다”라고 적었다. 영문판에는 없는 “세계에서 가장 빠른 프런티어 모델”이라는 문구와 월 500달러 요금제 안내도 들어 있다. 영문판과 번역판이 서로 다른 내용을 싣고 있는 셈이다.

정황 증거는 양쪽에 모두 존재한다. 세미애널리시스는 지난 8월 10일 자체 심층 분석 뉴스레터에서 엔비디아 B200 8장 노드가 추론 소프트웨어 TileRT를 통해 사용자당 초당 340토큰을 냈다고 보고했다. 초당 300토큰은 GPU 클러스터로도 충분히 도달 가능한 수치다. 반면 세미애널리시스는 같은 글에서 “세레브라스는 70B 밀집 모델을 스케줄링 방식과 무관하게 8-GPU 노드가 결코 닿을 수 없는 속도로 서비스한다”며 세레브라스의 독보적 성능 우위도 함께 인정했다.

리처드 호(Richard Ho) 오픈AI 하드웨어 부문 부사장은 자체 칩 할라페뇨 공개 직후 블룸버그(Bloomberg)와의 인터뷰에서 “엔비디아는 대단히 훌륭한 파트너이며, 우리는 앞으로도 엔비디아 칩이 대량으로 필요하다”고 강조한 바 있다.

“8월의 발표문에는 세레브라스가 적혀 있었다. 9월의 발표문에는 그 이름이 없다.”
자주 묻는 질문 (FAQ)
Q. 울트라패스트는 실제 어떤 칩에서 구동되는가?
A.오픈AI가 공식적으로 인정한 것은 8월 GPT-5.6 솔 프리뷰가 세레브라스 기반이라는 점뿐이다. 9월 데브데이에서 정식 서비스로 공개된 GPT-6 아스트라 울트라패스트의 실제 구동 칩은 아직 공식 발표되지 않았다. 엔비디아 GPU 기반이라는 주장은 세미애널리시스의 관측이며 구체적 실증 근거는 미공개 상태다.
Q. GPT-6.1 솔 울트라패스트는 현재 바로 이용할 수 있는가?
A.오픈AI 공식 X 계정과 영문 발표문 기준으로는 며칠 안에(In the coming days) 순차 제공될 예정이다. 실제 API 문서의 지원 모델 목록에도 아직 등재되지 않았다. 한국어판 발표문에 출시 완료로 안내된 것은 영문 원문과 번역본 간의 일시적 공지 차이로 확인된다.
Q. 울트라패스트와 기존 Fast 모드는 구체적으로 무엇이 다른가?
A.두 등급 모두 추가 비용을 지불하고 지연 시간을 대폭 단축하는 프리미엄 티어다. 다만 울트라패스트는 표준 대비 최대 8배 빠른 초당 300토큰 이상의 성능을 목표로 설계된 최상위 속도 등급이다. 현재 데이터 처리 리전은 미국과 글로벌 엔드포인트에 한정되며 유럽 등 기타 지역은 지원 대상에서 제외된다.

RELATED ARTICLES