Citrini
· Citrini Research
· 2026년 6월 8일, 13:06
· ⏱ 10 분 소요
| Substack에서 읽기 ↗
요약
AI 산업은 '토큰 패닉'에 진입하고 있는데, 에이전트와 추론 모델의 폭발적 토큰 사용으로 고객 비용이 급등하여 기업들의 반발과 사용량 기반 과금, 오픈소스 대안, 효율성 최적화로의 전환이 일어나고 있다. 이는 AI 트레이드가 순수 인프라 지출에서 효율적 모델 제공자 및 로컬 추론과 같은 비용 의식적 승자로 순환하고, 프런티어 연구소는 지속적인 매출 성장에도 불구하고 가격 압력에 직면함을 의미한다.
•Uber는 단 4개월 만에 2026년 전체 AI 예산을 소진하여 토큰 소비로 인한 기업 비용 초과를 예시했다.
•Anthropic의 ARR은 2026년 초 이후 5배 증가하여 5월에 450억 달러에 달했지만, CEO는 최근에야 비용이 '거대한 이슈'가 되었다고 인정했다.
•Deepseek V4 Pro와 V4 Flash는 Opus 4.8 및 GPT 5.5보다 10~25배 저렴하며, Deepseek는 처리된 토큰에서 OpenRouter에서 Anthropic을 추월했다.
•Cursor는 xAI 컴퓨팅으로 사후 훈련된 코딩 모델을 출시했는데, 이는 Moonshot의 중국 오픈소스 기반을 사용하여 작업당 10배 낮은 비용으로 GPT-5.5 및 Opus 4.7과 비교 가능하다.
•OpenAI, Google, GitHub Copilot은 모두 2026년 4월에서 6월 사이에 사용량 기반 과금으로 전환하여 무제한 소비 가격을 종료했다.
•Nvidia는 로컬 배포 및 특화된 에이전트 용도에 최적화된 소형 버전을 포함한 Nemotron 오픈소스 모델 제품군을 출시했다.
해당 기사는 엔비디아가 '고급 범용 모델뿐만 아니라 로컬 배포에 최적화된 고효율 소형 버전을 포함하는 최신 Nemotron 제품군'을 출시했다고 명시했습니다 —
해당 기사는 엔비디아가 '고급 범용 모델뿐만 아니라 로컬 배포에 최적화된 고효율 소형 버전을 포함하는 최신 Nemotron 제품군'을 출시했다고 명시했습니다. 이는 엔비디아의 하드웨어 지배력을 잠식하지 않으면서 소프트웨어 생태계를 확장할 수 있는 비용 효율적인 오픈 소스 추론이라는 새로운 테마와 일치합니다.
리스크: 고객이 더 저렴한 추론을 선택할 경우 오픈 소스 모델이 고가 엔비디아 GPU에 대한 수요를 줄일 수 있으나, 엔비디아의 하드웨어는 여전히 학습 및 대부분의 프런티어 추론을 위한 중추입니다.