Kimi K3, The Manos, The Mythos, The Legendos

Kimbo Chen · SemiAnalysis · 2026년 8월 3일, 19:42 · ⏱ 28 분 소요  | Substack에서 읽기 ↗
요약
Kimi K3의 프론티어 성능은 단일 혁신이 아닌 KDA 압축 선형 어텐션, 어텐션-오버-뎁스(attention-over-depth) 잔차, Stable LatentMoE의 결합에서 비롯됨. 기사는 이러한 기술과 서빙에 미치는 영향을 설명함. 시장 관점에서는 Nvidia B300이 프론티어 오픈 웨이트 추론을 위한 단일 노드 플랫폼으로 유효함을 검증하지만, KV 캐시/HBM 용량이 운영상의 병목 현상임을 보여주며, 이는 메모리 용량과 분산 서빙에 계속 주목해야 함을 시사함.
  • Kimi K3는 KDA 선형 어텐션과 MLA 풀 어텐션을 3:1 비율로 사용하며, KDA는 위치 인식 연산자로서 RoPE를 대체함.
  • FlashKDA의 KDA 재귀는 프리필(prefill) 시 O(T·D²), 헤드당 디코드 시 O(D²)이며, 커널 수준 메모리 액세스는 약 O(TC + TD + D²)로 시퀀스 길이에 관계없이 디코드가 일정함.
  • Stable LatentMoE는 전문가 입력 차원을 K2의 7168에서 3584로 절반으로 줄여, MoE 통신량을 늘리지 않고도 활성 전문가를 8개에서 16개로 두 배 늘림.
  • Quantile Balancing은 정렬된 마진의 (1-k/n) 분위수에서 다음 배치의 라우터 편향을 설정하여, 보조 손실(aux-loss) 및 하이퍼파라미터 튜닝을 제거함.
  • 블록 전반의 어텐션 잔차는 표준 잔차 연결 대비 1.25배의 연산 효율과 낮은 검증 손실을 제공하며, 단계 간 캐싱(cross-stage caching)은 파이프라인 병렬 처리 오버헤드를 약 4%로 유지함.
  • Nvidia B300에서 Kimi K3는 1개 노드에 적합하며 '서빙이 원활함'; B200은 파이프라인 병렬 처리가 필요하며 DSpark 추론적 디코딩은 PP와 호환되지 않음.
  • Kimi K3는 OpenRouter에서 입력 $3/M, 출력 $15/M의 최저가로 제공됨; 에이전트 트레이스 리플레이 결과 65턴에 걸쳐 턴당 중앙값 기준 입력 142k 토큰, 출력 444 토큰을 기록함.
  • B300 HBM은 가중치 제외 시 약 3.25M 토큰의 KV 캐시만 보유함; 동시성 8을 초과하면 캐시 적중률이 이론적 수치인 95% 대비 10% 미만으로 급락하여 처리량이 저하됨.
읽는 시간 28 분
길이 28,549 자
카테고리 finance
아이디어
Kimbo Chen Substack 작가, SemiAnalysis
기사의 InferenceX 벤치마크에 따르면 'B300의 경우 모델이 1개 노드에 적합하며 서빙이 원활하다'고 한 반면, B200은 파이프라인 병렬 처리가 필요하며 'DSpark 또한 PP와 작동하지 않음'을 시사함. 이는 프론티어 오픈 웨이트 모델 서빙을 위한 레퍼런스 플랫폼으로서 Nvidia의 최신 GPU를 검증하는 것임.
기사의 InferenceX 벤치마크에 따르면 'B300의 경우 모델이 1개 노드에 적합하며 서빙이 원활하다'고 한 반면, B200은 파이프라인 병렬 처리가 필요하며 'DSpark 또한 PP와 작동하지 않음'을 시사함. 이는 HBM 용량 제한은 여전하지만, 프론티어 오픈 웨이트 모델 서빙을 위한 레퍼런스 플랫폼으로서 Nvidia의 최신 GPU를 검증하는 것임. 리스크: B300 HBM은 약 3.25M 토큰의 KV 캐시만 보유함; 동시성(concurrency)이 8을 초과하면 캐시 적중률이 10% 미만으로 떨어지므로, 고동시성 서빙은 여전히 제약이 있음.
Kimbo Chen Substack 작가, SemiAnalysis
해당 기사는 'Nvidia와 AMD 모두 vLLM에서 Day 0 레시피를 확보했으며, DRAM 오프로드 및 DSpark 추론적 디코딩을 자랑한다'고 언급함. 이는 프론티어 오픈 웨이트 모델 추론을 위한 AMD의 생태계 격차를 좁히는 소프트웨어 준비성 검증임.
해당 기사는 'Nvidia와 AMD 모두 vLLM에서 Day 0 레시피를 확보했으며, DRAM 오프로드 및 DSpark 추론적 디코딩을 자랑한다'고 언급함. 이는 프론티어 오픈 웨이트 모델 추론을 위한 AMD의 생태계 격차를 좁히는 소프트웨어 준비성 검증임. 리스크: AMD에 대한 처리량 벤치마크가 제공되지 않았으므로, Day 0 호환성이 경쟁력 있는 서빙 성능을 입증하는 것은 아님.
더 보기 SemiAnalysis

This newsletter, published August 03, 2026, features Kimbo Chen discussing NVDA, AMD. 2 trade ideas extracted by AI with direction and confidence scoring.

Speakers: Kimbo Chen  · Tickers: NVDA, AMD