Ep. 017 - DeepSeek V4 and Huawei Ascend NPU Performance (InferenceX)

YouTube에서 보기 ↗  |  2026년 7월 1일, 22:30  |  35:21  |  SemiAnalysis Weekly
발언자
Bryan Shan — Substack 작가, SemiAnalysis
Kimbo — Analyst
The SemiAnalysis 팟캐스트가 DeepSeek V4의 아키텍처 혁신(sparse attention, Mega MoE, 1M 컨텍스트 길이)과 NVIDIA, AMD, Huawei 하드웨어에서 데이제로 런타임 성능을 달성하기 위한 수주에 걸친 엔지니어링 작업을 분석합니다. 논의는 커널 수준 최적화, vLLM 대 SGLang 경쟁, 그리고 Huawei의 Ascend NPU가 실행 가능한 AI 추론 플랫폼이 되고 있다는 새로운 증거를 다룹니다. - DeepSeek V4는 압축 sparse attention과 Mega MoE를 도입하여 KV 캐시 필요량을 약 100배 줄이고 1M 컨텍스트 길이를 가능하게 합니다. - 새로운 모델 아키텍처에 대한 데이제로 지원은 추론 런타임 전반에 걸친 광범위한 작업을 필요로 하며, NVIDIA는 처음에 새로운 MHC 차원에서 문제를 겪었습니다. - AMD의 추론 처리량은 FP4 지원, 커널 재작성, 그리고 수주에 걸쳐 누적된 단계별 최적화를 통해 눈에 띄게 개선되었습니다. - Huawei의 Ascend NPU는 오픈소스 CANN 코드, 우수한 문서, 그리고 빠른 커뮤니티 주도 최적화를 통해 DeepSeek V4 추론에서 유의미한 성능을 입증했습니다. - vLLM과 SGLang 간의 경쟁은 기능 개발 속도와 혁신을 가속화하지만, 개발 노력의 분산도 초래합니다. - 팀은 고정 길이 벤치마크를 넘어 실제 Claude 코드 트레이스와 고급 분리 기술을 사용하는 에이전트 워크로드로 전환할 계획입니다.
다음