Hot Chips: OpenAI Jalapeno Presentation

Tae Kim · Key Context by Tae Kim · 2026년 9월 1일, 04:16 · ⏱ 6 분 소요  | Substack에서 읽기 ↗
요약
OpenAI는 메모리 슬라이스 아키텍처와 AI 생성 커널을 사용하여 기존 가속기보다 훨씬 높은 토큰 처리량과 낮은 지연 시간을 제공하는 자체 맞춤형 LLM 추론 칩인 Jalapeno를 구축하고 실험실 테스트를 마쳤습니다. 이는 범용 GPU만이 프론티어 AI 추론을 위한 유일한 경로라는 가정에 도전하며, OpenAI의 명시된 하드웨어 파트너인 Broadcom과 Celestica로 가치를 이동시키는 한편, 대형 AI 연구소들이 실리콘 수직 계열화를 지속할 경우 NVIDIA에 대한 장기적인 수요 리스크를 시사합니다.
  • OpenAI의 Jalapeno 칩은 실재하며 실험실 단계에 있습니다. 지원해야 할 레거시 아키텍처가 없는 백지상태에서 시작했기 때문에 전체 RTL 실행이 9개월 만에 완료되었습니다.
  • OSS 추론 워크로드의 경우, 이 칩은 사용자당 초당 거의 1500 토큰을 처리하며, Ravi는 'HBM은 병목 현상이 아니다'라고 언급하며 현재 가장 높은 처리량을 가진 제품보다 지연 시간이 4배 낮다고 주장했습니다.
  • DeepSeek 워크로드에서는 사용자당 초당 700 토큰을 처리하며 지연 시간은 5배 낮습니다. 회사 측은 '모델이 클수록 이점도 커진다'고 밝혔습니다.
  • Jalapeno는 모든 코어가 자체 HBM 슬라이스에 대한 로컬 뷰를 갖는 메모리 슬라이스 아키텍처를 사용하여, 글로벌 메모리 서브시스템의 경합을 제거하고 데이터를 연산 장치 가까이에 유지합니다.
  • OpenAI는 Sol 및 Astra와 같은 프론티어 LLM이 이 공간 아키텍처를 위한 커널 작성에 매우 능숙하며, 종종 전문가가 튜닝한 커널보다 더 높은 성능을 끌어낸다고 말합니다.
  • 이 칩은 실험실에서 1.7 GHz, POR(Plan of Record) 기준 1.8 GHz로 작동하며 표준 셀 방식을 사용합니다. OpenAI는 Broadcom과 Celestica를 핵심 파트너로 지목했으며, 2세대 칩은 이미 개발 중으로 수개월 내 테이프아웃을 앞두고 있습니다.
읽는 시간 6 분
길이 6,336 자
카테고리 finance
아이디어
Tae Kim Barron's 선임 작가; The Nvidia Way 저자
Richard Ho는 Jalapeno를 제공하는 핵심 파트너로 'Broadcom과 Celestica에 큰 감사를 표한다'고 언급했으며, Q&A를 통해 기존 인터페이스 IP가 Broadcom의 생태계에서 비롯되었음을 확인했습니다. 이는
Richard Ho는 Jalapeno를 제공하는 핵심 파트너로 'Broadcom과 Celestica에 큰 감사를 표한다'고 언급했으며, Q&A를 통해 기존 인터페이스 IP가 Broadcom의 생태계에서 비롯되었음을 확인했습니다. 이는 맞춤형 AI 실리콘 설계 및 네트워킹 IP 분야에서 Broadcom의 지속적인 역할을 시사합니다. 리스크: 맞춤형 ASIC 매출은 변동성이 크고 OpenAI의 프로그램 일정과 연동되어 있습니다. 다른 ASIC 설계 업체들과의 경쟁 및 잠재적인 사내 역량 확대는 Broadcom의 점유율을 제한할 수 있습니다.
Tae Kim Barron's 선임 작가; The Nvidia Way 저자
Celestica는 OpenAI에 의해 Jalapeno 하드웨어 역량을 제공하는 Broadcom과 함께 핵심 파트너로 명시되었으며, 이는 OpenAI의 자체 AI 시스템 제조 확
Celestica는 OpenAI에 의해 Jalapeno 하드웨어 역량을 제공하는 Broadcom과 함께 핵심 파트너로 명시되었으며, 이는 OpenAI의 자체 AI 시스템 제조 확대에 대한 직접적인 노출을 의미합니다. 리스크: Jalapeno의 생산 확대가 예상보다 느려지거나, OpenAI가 제조를 내재화하거나 다른 공급업체로 전환할 경우, 이 프로그램에서 발생하는 Celestica의 매출 기여도가 기대에 미치지 못할 수 있습니다.
Tae Kim Barron's 선임 작가; The Nvidia Way 저자
해당 기사는 Jalapeno가 LLM 추론에서 '4배 낮은 지연 시간'과 '5배 낮은 지연 시간'을 제공하며, '모델이 클수록 이점도 커진다'고 주장합니다. 이는 OpenAI의 자체 실리콘이
해당 기사는 Jalapeno가 LLM 추론에서 '4배 낮은 지연 시간'과 '5배 낮은 지연 시간'을 제공하며, '모델이 클수록 이점도 커진다'고 주장합니다. 이는 OpenAI의 자체 실리콘이 상용 GPU 추론을 대체하고 장기적으로 OpenAI의 인프라 비용을 절감하기 위해 설계되었음을 시사합니다. 리스크: 학습 및 엔터프라이즈 추론 분야에서 NVIDIA의 지배력은 여전히 강력하며, OpenAI는 여전히 학습을 위해 NVIDIA에 의존하고 있습니다. 자체 추론 칩은 단기적으로 시장의 일부에만 영향을 미칠 수 있습니다.
더 보기 Key Context by Tae Kim

This newsletter, published September 01, 2026, features Tae Kim discussing AVGO, CLS, NVDA. 3 trade ideas extracted by AI with direction and confidence scoring.

Speakers: Tae Kim  · Tickers: AVGO, CLS, NVDA