Jordan Nanos
· SemiAnalysis
· 2026년 4월 20일, 14:21
· ⏱ 51 분 소요
| Substack에서 읽기 ↗
요약
기사는 GPU 클러스터의 총소유비용(TCO)이 GPU 시간당 가격을 훨씬 넘어서며, 신뢰성, 지원, 스토리지, 네트워킹, 내결함성 등이 동일한 GPU 가격에서도 5-15%의 TCO 차이를 만든다고 주장. 골드 등급 네오클라우드(Nebius, Fluidstack, Crusoe)는 TCO에서 하이퍼스케일러 및 실버 등급 제공업체를 능가하며, 표면 GPU 가격에만 집중하는 구매자는 숨겨진 비용으로 인해 청구서가 10-60% 증가할 수 있음.
•SemiAnalysis는 GPU 가격 외에 8가지 TCO 구성요소를 정의: 스토리지, 네트워킹, 제어 플레인, 지원, 양호 처리율(goodput), 설정 비용, 디버깅 비용, 비GPU 컴퓨팅.
•골드 등급 제공업체(Nebius, Fluidstack, Crusoe)는 GPU 가격이 동일할 때 하이퍼스케일러 및 실버 등급 네오클라우드보다 TCO가 5-15% 낮으며, 이는 더 나은 지원, 핫 스페어 풀, 낮은 설정/디버깅 비용 덕분.
•대규모 LLM 사전 학습 시나리오(5,184 GB300 GPU, 3년 계약)에서 골드 등급 TCO는 1x, 하이퍼스케일러 1.10x, 실버 등급 1.15x이며, 주요 동인은 하이퍼스케일러의 지원 비용 및 EFA 튜닝 시간, 실버 등급의 양호 처리율 손실.
•멀티모달 RL 연구(2,048 B200 GPU)에서 하이퍼스케일러 GPU 가격은 29% 더 높아(50백분위수 대 25백분위수), 골드 등급 대비 TCO 프리미엄이 61%; 실버 등급은 스토리지 및 디버깅 비용으로 인해 15%만 더 높음.
•추론 엔드포인트(512 H200 GPU)의 경우, 사실상 모든 TCO 차이는 GPU 가격에서 비롯 — 하이퍼스케일러가 59% 더 비싸며, 골드와 실버는 내결함성 서빙 프레임워크로 인해 동일 GPU 가격에서 거의 동일.
•내결함성 훈련 프레임워크(TorchFT, AWS HyperPod Checkpointless, Clockwork TorchPass)는 각각 성능, 메모리 또는 유휴 노드 비용에서 트레이드오프가 있으며, 1k GPU 이상 확장에 중요.
•NVIDIA 참조 아키텍처를 따르는 제공업체들 사이에서도 클러스터 품질은 다양함 — 컬렉티브 바운드 워크로드에서 인터커넥트 튜닝 및 신뢰성으로 인한 성능 차이 발생.
•SemiAnalysis는 Core42, BitDeer, FPT Smart Cloud, Ori를 ClusterMAX 등급에 추가, Core42는 강력한 지원을 보였지만 AMD/Broadcom NIC 호환성 문제, FPT와 Ori는 보안 설정 오류(PKey/SAKey)로 플래그 지정.
Nebius는 Fluidstack 및 Crusoe와 함께 골드 등급 제공업체로 명시적으로 언급됩니다. 기사는 골드 등급 제공업체가 TCO가 silver-tier o보다 5-15% 낮기 때문에 가격 프리미엄을 적용한다고 말합니다.
Nebius는 Fluidstack 및 Crusoe와 함께 골드 등급 제공업체로 명시적으로 언급됩니다. 기사는 골드 등급 제공업체가 동일 GPU 가격에서 실버 등급 또는 하이퍼스케일러보다 TCO가 5-15% 낮기 때문에 가격 프리미엄을 적용한다고 밝히며, 이는 GPU 클라우드 시장에서 NBIS의 우수한 제품과 경쟁 우위를 입증합니다.
위험: Nebius는 소규모 업체이며, 그 성장은 지속적인 자본 가용성과 Blackwell 클러스터 확장에 달려 있습니다. 가격 데이터는 2025년 8월 기준이며 시장 역학은 변화하고 있습니다.
기사의 모든 클러스터 시나리오와 제공업체는 NVIDIA GPU(Blackwell, H200, B200, GB300)를 사용합니다. 기사는 막대한 수요를 수치로 제시합니다: '유니콘 스타트업은 수천 개의 GPU를 보유하고 있으며' 그리고 '기업들은 spen
기사의 모든 클러스터 시나리오와 제공업체는 NVIDIA GPU(Blackwell, H200, B200, GB300)를 사용합니다. 기사는 막대한 수요를 수치로 제시합니다: '유니콘 스타트업은 수천 개의 GPU를 보유하고 있으며' 그리고 '기업들은 초기 자금의 80% 이상을 GPU에 사용합니다'. TCO에 대한 상세 분석은 NVIDIA 하드웨어를 표준으로 가정하며, 맞춤형 ASIC의 경쟁 압력에도 불구하고 AI 학습 및 추론 시장에서 NVIDIA의 지배력을 강화합니다.
위험: 또한 기사는 Core42와 같은 제공업체가 AMD MI300X를 사용하고, 네트워킹 차이(InfiniBand vs EFA)가 성능에 영향을 미친다는 점을 지적하며, AMD나 맞춤형 칩이 영향력을 확대할 경우 장기적 위협이 될 수 있습니다.
기사는 AWS를 주요 하이퍼스케일러 예시로 사용하며 여러 단점을 강조합니다: 더 높은 GPU 가격(50번째-75번째 백분위수), 추가 비용이 필요한 낮은 기본 스토리지 성능, signific
기사는 AWS를 주요 하이퍼스케일러 예시로 사용하며 여러 단점을 강조합니다: 더 높은 GPU 가격(50번째-75번째 백분위수), 추가 비용이 필요한 낮은 기본 스토리지 성능, EFA 튜닝을 위한 상당한 설정 시간(몇 주에서 몇 개월), 별도의 지원 비용(청구 금액의 3-10%), 그리고 오케스트레이션 프리미엄(예: SageMaker vs EC2). 대규모 LLM 사전 학습 시나리오에서 이러한 요소는 골드 등급 대비 TCO에 10%를 추가합니다. 강화학습 연구에서는 더 높은 GPU 가격으로 인해 61% 프리미엄이 발생합니다. 이는 AWS AI 클라우드 오퍼링이 마진 압박과 고객의 네오클라우드 이탈 위험에 직면해 있음을 시사합니다.
위험: 대기업은 여전히 규정 준수, 생태계 및 장기 계약을 위해 AWS를 선호할 수 있습니다. 기사의 가정(예: 내결함성 코드 없음)은 모든 고객에게 적용되지 않을 수 있습니다.
This newsletter, published April 20, 2026,
features Jordan Nanos
discussing NBIS, NVDA, AMZN.
3 trade ideas extracted by AI with direction and confidence scoring.