Ultra-High Interactivity on NVIDIA GPUs? - TileRT InferenceX

Bryan Shan · SemiAnalysis · 2026년 8월 10일, 04:51 · ⏱ 24 분 소요  | Substack에서 읽기 ↗
요약
이 기사는 TileRT 소프트웨어가 표준 NVIDIA GPU에서 초고인터랙티브(저지연) 추론을 가능하게 한다고 주장한다. 이 영역은 이전에 Cerebras 및 Groq와 같은 특수 ASIC이 지배하던 분야였다. 디코드 그래프를 정적으로 컴파일하여 지속형 커널(persistent kernel)로 만들면, TileRT는 클라우드 제공업체가 기존 GPU 플릿에서 고속 티어를 동적으로 프로비저닝할 수 있게 하여, 하드웨어 대체성(hardware fungibility)이 없는 특수 목적 추론 칩의 TAM(총가용시장)에 심각한 위협이 된다.
  • 프리미엄 AI '패스트 모드'는 초저지연을 요구하므로, 프런티어 연구소들은 표준 GPU 대신 Cerebras 및 NVIDIA Groq LPU 같은 특수 추론 시스템을 평가하고 있다.
  • 기존 GPU 프로그래밍 모델은 커널 설정 및 해제 오버헤드로 인해, 토큰 생성이 서브밀리초 범위에 가까워질수록 지연 시간이 지배적이 된다.
  • TileRT는 디코드 그래프 전체를 NVIDIA GPU의 단일 지속형 커널로 정적으로 컴파일하여 커널을 실행 단위로 없앰으로써 이 문제를 해결한다.
  • InferenceX GLM5 FP8 744B 벤치마크에서 단일 B200 디코드 서버의 TileRT는 사용자당 초당 최대 500토큰에 도달했으며, GB300 NVL72의 기존 엔진보다 약 3배 빠르다.
  • TileRT는 총 처리량보다 사용자당 속도를 선택한다. 8K/1K에서 GB300 FP4+MTP는 GPU당 초당 총 240토큰을 제공하는 반면, TileRT는 GPU당 초당 총 160.4토큰을 제공한다.
  • 분리(disaggregated) 아키텍처를 사용하면 vLLM과 같은 처리량 최적화 엔진이 프리필을 처리하고 TileRT가 지연 시간에 민감한 디코드를 처리하므로, 두 엔진이 동일한 GPU 풀을 공유할 수 있다.
  • TileRT의 종단 간 디코드 꼬리 지연 시간은 3.01초로, 최고의 NVFP4 + MTP 경쟁 제품의 6.54초 및 AMD MI355X의 18.18초와 비교된다.
  • TileRT의 소프트웨어 중심 접근 방식은 제공업체가 기존 GPU 용량을 동적으로 재할당할 수 있게 하여, ASIC의 고정 하드웨어 모델에 구조적 위협을 제기한다.
읽는 시간 24 분
길이 24,411 자
카테고리 finance
아이디어
Bryan Shan Substack 작가, SemiAnalysis
TileRT 소프트웨어는 표준 NVIDIA GPU(예: B200)에서 초저지연 기능을 제공하여, 고객에게 hi 사이의 대체 가능성을 제공함으로써 특수 추론 칩에 대한 NVIDIA의 해자를 방어합니다.
TileRT 소프트웨어는 표준 NVIDIA GPU(예: B200)에서 초저지연 기능을 제공하여, 고처리량 프리필과 저지연 디코드 워크로드 간의 대체 가능성을 고객에게 제공함으로써 특수 추론 칩에 대한 NVIDIA의 해자를 방어합니다. 리스크: TileRT의 정적 AOT 컴파일은 새로운 아키텍처마다 상당한 엔지니어링 노력이 필요하여, 일반화된 엔진에 비해 모델 카탈로그를 제한하고 배포를 늦춥니다.
Bryan Shan Substack 작가, SemiAnalysis
이 기사는 AMD 현재 스택의 초저지연 시나리오에서 큰 성능 격차를 강조하며, MI355X 디코드 테일이 NVIDIA의 TileRT 3.01초와 비교해 18.18초였다고 언급합니다.
이 기사는 AMD 현재 스택의 초저지연 시나리오에서 큰 성능 격차를 강조하며, MI355X 디코드 테일이 NVIDIA의 TileRT 3.01초와 비교해 18.18초였다고 언급합니다. 리스크: AMD는 올해 InferenceX에 MI455X UALoE72 수치를 제출하겠다고 약속했으며, 이는 상당한 아키텍처 또는 소프트웨어 개선을 보여줄 수 있습니다.
더 보기 SemiAnalysis

This newsletter, published August 10, 2026, features Bryan Shan discussing NVDA, AMD. 2 trade ideas extracted by AI with direction and confidence scoring.

Speakers: Bryan Shan  · Tickers: NVDA, AMD