Cerebras — Faster Tokens Please

Myron Xie · SemiAnalysis · 2026년 5월 13일, 18:18 · ⏱ 52 분 소요  | Substack에서 읽기 ↗
요약
Cerebras의 웨이퍼 스케일 SRAM 아키텍처는 온칩 SRAM에 실리콘의 50%를 할당하여 초당 수천 개 토큰의 타의 추종을 불허하는 추론 속도를 제공하므로 빠른 토큰 프리미엄 티어에 이상적입니다. OpenAI 750MW 거래는 이 접근 방식을 검증하지만, 아키텍처는 SRAM 스케일링이 5nm 이후 평평하고, 오프웨이퍼 I/O 대역폭이 150GB/s에 불과하며(Nvidia보다 130배 덜 조밀함), 제한된 44GB SRAM으로 인해 약 1,200억 개 이상의 매개변수 모델에 파이프라인 병렬 처리가 필요하다는 엄격한 제약에 직면합니다. 시장 측면에서 이는 Cerebras가 낮은 배치, 높은 속도 추론에서 틈새 시장이지만 검증된 플레이어임을 의미하는 반면, HBM 기반 GPU(Nvidia, AMD)는 대규모 모델 처리량과 긴 컨텍스트 에이전트 워크로드에 여전히 필요합니다.
  • Cerebras WSE-3는 21PB/s 대역폭의 44GB SRAM을 보유하지만, SRAM 용량은 WSE-2에서 WSE-3로(40GB에서 44GB) 10%만 증가한 반면 로직 트랜지스터는 50% 증가했습니다.
  • 오프웨이퍼 대역폭은 전체 웨이퍼에 대해 150GB/s(1.2Tbps)에 불과한 반면, 단일 Blackwell GPU는 NVLink5를 통해 900GB/s입니다. 해안선 I/O 밀도는 에지 mm당 0.17GB/s인 반면 Nvidia는 약 22GB/s/mm입니다.
  • OpenAI 거래에는 6% 금리의 10억 달러 운전자본 대출, 750MW 컴퓨팅 약정(2GW로 확장 가능), 0.00001달러에 3,340만 주에 대한 워런트가 포함됩니다. 워런트는 주당 82.02달러로 평가되어 잠재적 27억 4천만 달러의 반대 수익을 의미합니다.
  • Cerebras는 공개 클라우드(GPT-OSS)에서 최대 1,200억 개 매개변수 모델만 서비스하며, 128K 컨텍스트 창을 제공합니다. 실제 에이전트 추적은 P50 ISL이 96.3K 토큰이고 요청의 50%가 128K를 초과함을 보여줍니다.
  • 각 CS-3 시스템의 BOM은 약 450,000달러(메모리 가격 인상 후)이며, TSMC 웨이퍼는 약 20,000달러이지만 Vicor 전력 공급 및 맞춤형 냉각 각각은 거의 그 비용과 맞먹습니다.
  • Cerebras의 최적 연산 강도는 0.74(FP16/int8)로 낮은 배치 디코드 커널에 이상적입니다. Nvidia의 HBM 기반 GPU는 연산 강도가 1000을 초과하여 대규모 배치 처리량에 더 적합합니다.
  • WSE-3는 TSMC N5에서 제조되며 3nm가 아닙니다. 차세대 CS-4는 동일한 N5 웨이퍼를 사용하여 더 높은 전력/클럭을 제공하지만 SRAM 스케일링이 5nm 이후 중단되어 SRAM 증가는 없습니다.
  • Cerebras는 I/O 및 메모리 한계를 해결하기 위해 포토닉 트랜시버 웨이퍼(Ranovus와 함께)와 DRAM 웨이퍼를 하이브리드 본딩할 계획이지만, 일정과 열기계적 과제는 아직 해결되지 않았습니다.
읽는 시간 52 분
길이 52,765 자
카테고리 finance
아이디어
Myron Xie Substack 작가, SemiAnalysis
Cerebras는 TSMC에서 WSE-3(N5 공정)용 웨이퍼 주문을 램핑 중이며, 기사에서는 '수요 급증이 이미 TSMC의 웨이퍼 로딩에서 확인 가능하며, 이는 연중 분기마다 크게 증가하여 mee'라고 밝힙니다.
Cerebras는 TSMC에서 WSE-3(N5 공정)용 웨이퍼 주문을 램핑 중이며, 기사에서는 '수요 급증이 이미 TSMC의 웨이퍼 로딩에서 확인 가능하며, 이는 연중 분기마다 크게 증가하여 OpenAI의 배포 요구를 충족시킨다'고 밝힙니다. 각 웨이퍼 비용은 약 $20K이지만 배치당 맞춤형 마스크가 필요하여 TSMC의 매출에 추가됩니다. 위험: Cerebras는 단일 고객이며, 웨이퍼 물량은 Nvidia/AMD에 비해 적지만 성장 중입니다.
Myron Xie Substack 작가, SemiAnalysis
Vicor는 각 WSE-3 엔진 블록에 맞춤형 전력 공급 모듈을 공급하며, 84개의 Vicor 파워 브릭을 통해 25kW를 전달합니다. 기사에서는 '각 WSE의 VICR 콘텐츠는 TSMC의 콘텐츠와 크게 다르지 않다'고 밝히며, m
Vicor는 각 WSE-3 엔진 블록에 맞춤형 전력 공급 모듈을 공급하며, 84개의 Vicor 파워 브릭을 통해 25kW를 전달합니다. 기사에서는 '각 WSE의 VICR 콘텐츠는 TSMC의 콘텐츠와 크게 다르지 않다'고 밝히며, Vicor는 주요 BOM 기여자입니다. Cerebras의 램핑은 Vicor에 직접적인 혜택을 줍니다. 위험: 고객 집중도; Vicor의 매출은 Cerebras의 출하량에 크게 의존하며, OpenAI 거래의 지연 또는 취소는 Vicor에 타격을 줍니다.
Myron Xie Substack 작가, SemiAnalysis
Trane Technologies(TT)가 Cerebras의 주요 냉각 파트너인 LiquidStack을 인수했습니다. 기사에 따르면 LiquidStack은 CS-3의 높은 유량(약 4 LPM/kW 대 엔비디아의 약 1 LPM/kW)에 맞춰진 L2L 단상 CDU를 개발했습니다.
Trane Technologies(TT)가 Cerebras의 주요 냉각 파트너인 LiquidStack을 인수했습니다. 기사에 따르면 LiquidStack은 CS-3의 높은 유량(약 4 LPM/kW 대 엔비디아의 약 1.5 LPM/kW)에 맞춰진 L2L 단상 CDU를 개발했습니다. Cerebras가 수천 대의 CS-3 시스템을 배포함에 따라 TT의 냉각 인프라 수요가 증가합니다. 리스크: Cerebras의 차세대 CS-4는 유량을 1.5–1.7 LPM/kW로 낮추는 것을 목표로 하여, 단위당 냉각 수익을 줄일 수 있습니다.
Myron Xie Substack 작가, SemiAnalysis
해당 기사는 AMD의 자본 배분을 비판합니다: 'AMD는 지난 분기 약 2억 2100만 달러의 자사주 매입을 했지만 내부적으로 여러 AMD 내부 팀은 여전히 상호 연결된 GPU 클러스터 개발이 부족합니다.' T
해당 기사는 AMD의 자본 배분을 비판합니다: 'AMD는 지난 분기 약 2억 2100만 달러의 자사주 매입을 했지만 내부적으로 여러 AMD 내부 팀은 여전히 상호 연결된 GPU 클러스터 개발이 부족합니다.' 이는 AMD가 추론 및 학습 클러스터에 중요한 네트워킹/스케일업 패브릭에 대한 투자가 부족함을 시사합니다. 리스크: AMD는 다른 경로를 통해 성공할 수 있으며, 비판은 내부 GPU 클러스터 부족에 대한 한 가지 일화에 근거합니다.
Myron Xie Substack 작가, SemiAnalysis
해당 기사는 Cerebras와 엔비디아 GPU를 광범위하게 비교하며, 긴 컨텍스트의 대형 모델(예: DeepSeek V4)의 경우 엔비디아의 HBM 기반 시스템(GB300 NVL72)이 훨씬 더 많은 용량을 제공한다고 보여줍니다(2
해당 기사는 Cerebras와 엔비디아 GPU를 광범위하게 비교하며, 긴 컨텍스트의 대형 모델(예: DeepSeek V4)의 경우 엔비디아의 HBM 기반 시스템(GB300 NVL72)이 랙당 20TB HBM 대 웨이퍼당 44GB SRAM으로 훨씬 더 많은 용량을 제공하며 처리량에 필수적이라고 보여줍니다. Cerebras의 한계는 주류 추론에서 엔비디아의 지배력을 강화합니다. 리스크: Cerebras와 Groq가 고속 프리미엄 티어를 개척하여 해당 부문에서 엔비디아의 가격 결정력을 약화시킬 수 있습니다.
더 보기 SemiAnalysis

This newsletter, published May 13, 2026, features Myron Xie discussing TSM, VICR, TT, AMD, NVDA. 5 trade ideas extracted by AI with direction and confidence scoring.

Speakers: Myron Xie  · Tickers: TSM, VICR, TT, AMD, NVDA