NVIDIA 200억 달러 베팅: Groq 3 LPX가 AI 추론을 어떻게 바꾸는가
10년대 최대 AI 인프라 거래 중 하나의 실리콘 스토리——그리고 이종 추론이 이제 중심 무대에 선 이유.

실리콘 밸리를 충격에 빠뜨린 거래
2025년 12월 말 NVIDIA는 AI 추론 기업 Groq를 약 200억 달러 규모의 acquihire(인재 확보형 인수)로 완료했으며, 엔지니어링 조직 대부분을 사내로 편입하고 LPU(Language Processing Unit) 데이터플로 엔진 기술을 라이선스했습니다. 이 구조는 더 길어지고 더 큰 규제 관심을 끌 수 있는 전통적 인수 내러티브를 피했습니다. 움직임은 빠르고, 타겟팅되었으며, 명백히 긴급했습니다.
그 후 수개월간 NVIDIA는 전략적 근거에 대해 공개적으로 거의 말하지 않았습니다. 하지만 샌호세 GTC 2026에서 상황이 바뀌었습니다. Jensen Huang이 NVIDIA Groq 3 LPX——그 거래에 명확히 뿌리를 둔 첫 제품 라인——을 소개했으며, 이제 NVIDIA Vera Rubin 플랫폼에서 일급 시민으로 포지셔닝됩니다. Groq가 왜 중요했는지에 대한 질문은 헤드라인이 아니라 아키텍처 답으로 읽히기 시작했습니다.
Groq란 누구인가 — LPU란?
Google의 첫 TPU 형성에 기여한 엔지니어 Jonathan Ross는 GPU 가정을 재사용하는 것이 아니라 지연 시간과 예측 가능성에서 이기는 추론 칩을 구축한다는 좁은 미션으로 Groq를 설립했습니다. 결과는 LPU(Language Processing Unit)——완전히 스케줄링된 결정론적 프로세서로, 모델 가중치가 있는 곳 옆에 매우 큰 온칩 SRAM을 배치하고 GPU 기반 LLM 서빙을 종종 병목시키는 메모리 대역폭 경로를 줄인다는 간단한 베팅을 중심에 둡니다.
생성 AI가 확장되면서 그 아키텍처는 벤치마크와 고객 사례에서 토큰 생성에 진정으로 빠르게 나타났습니다. 다른 벤더도 SRAM 중심이나 웨이퍼 스케일 각도를 추구했습니다. NVIDIA 관점에서 추론 중심 스타트업의 물결은 데이터센터 GPU와 같은 운영 예산을 놓고 경쟁했습니다. Groq 거래는 CUDA 옆에서 독립적으로 성숙하게 두기보다 가장 신뢰할 만한 대안 스택을 내재화하기로 한 결정으로 읽을 수 있습니다.
Groq 3 LPX: 200억 달러 거래에서 탄생
Groq 3 LPX(내부적으로 LP30로 참조)는 LPU 아키텍처 3세대로, 이제 NVIDIA와 공동 설계되었으며 Samsung 4nm에서 제조됩니다. NVIDIA는 GTC 2026에서 2026년 하반기 일반 가용을 발표했으며, 3분기가 가장 유력한 시기입니다.
랙 규모에서 NVIDIA가 전하는 스토리는 랙당 256개의 상호 연결 Groq 3 LPU 가속기와 IO 바운드 추론 워크플로를 겨냥한 수치 세트를 중심으로 구축됩니다.
- 초당 40PB 온칩 SRAM 대역폭——타임라인을 지배하는 메모리 정지 없이 컴퓨트에 공급.
- high-radix 상호 연결을 통한 초당 640TB 랙 규모 칩 간 통신.
- 동적 스케줄링 지터와 예기치 않은 tail latency 스파이크를 피하기 위한 결정론적, 컴파일러 조율 실행.
- NVIDIA는 관련 스택의 decode 집약 구간에서 GPU 전용 추론 대비 최대 메가와트당 35배 높은 추론 처리량으로 LPX를 포지셔닝하며, 조(兆) 파라미터 규모 서빙 시나리오에서 더 큰 수익 기회를 제시합니다.
아키텍처적 요점은 GPU가 "나쁘다"는 것이 아닙니다——대규모 병렬 학습, prefill, attention 집약 단계에서 여전히 비교 불가합니다. 주장은 autoregressive decode가 다른 프로그램 형태라는 것입니다: 더 순차적이고, 동시성 하에서 tail latency에 더 민감합니다. LPU는 그 슬라이스에 최적화되어, 대규모 GPU 클러스터가 역사적으로 같은 운영 단순성으로 보장하기 어려웠던 예측 가능한 타이밍을 제공합니다.
이종 걸작: LPX와 Vera Rubin의 만남
NVIDIA의 피치는 GPU 박스에 볼트된 사이드카 FPGA가 아닙니다—— 공동 설계된 이종 추론 엔진으로, 각 프로세서 클래스가 가장 잘하는 단계를 담당합니다.
| 워크로드 | 하드웨어 |
|---|---|
| 학습 | Vera Rubin NVL72 (Rubin GPU) |
| Prefill & attention | Vera Rubin NVL72 (Rubin GPU) |
| Long-context 처리 | Vera Rubin NVL72 (Rubin GPU) |
| 저지연 FFN / MoE decode | Groq 3 LPX (LPU) |
| 프리미엄 실시간 토큰 생성 | Groq 3 LPX (LPU) |
접착층은 NVIDIA Dynamo로, 요청을 실시간으로 분류하고 prefill·attention 작업을 Rubin GPU로 라우팅하며, 지연 민감 decode를 LPU로 유도합니다——NVIDIA가 브랜딩하는 AFD(Attention–FFN disaggregation) 루프입니다.
GTC 2026에서 NVIDIA 리더십은 LPU/LPX와 Rubin을 decode 최적화를 위해 통합하는 것이 시장 진출의 주요 초점——부수 실험이 아니라고 강조했습니다. 병행하여 이전 Rubin CPX 개념——추론용으로 스케치된 비용 최적화 단일 GPU 변형——은 이 LPX 중심 경로를 위해 제쳐두었습니다.
비전: 사고의 속도 컴퓨팅
제품 내러티브는 더 빠른 채팅 UI를 넘어섭니다. LPX는 agentic AI를 위해 프레이밍됩니다: 계획하고, 도구를 호출하고, 지속적으로 반복하는 시스템으로, 인간이 느끼는 멈춤이 신뢰를 깨뜨립니다.
생성이 사용자당 초당 약 1,000 토큰에 접근하면 상호작용 모델은 턴제에서 실시간 사고 파트너에 가깝게 전환됩니다. 그에 따라 multi-agent orchestration이 더 실용적이 됩니다——서브 에이전트 생성, 추론 교차 검증, 초가 아닌 밀리초 단위 수렴.
Huang은 또한 저지연, 프리미엄 가격 토큰 생성이 AI 클러스터 컴퓨트의 약 4분의 1을 차지할 수 있는 포트폴리오 뷰를 스케치했으며——NVIDIA가 LPX급 실리콘으로 포착하려는 고마진 슬라이스입니다.
NVIDIA에게 이것이 존재적으로 필요했던 이유
Groq 거래를 허영 구매로 보면 시장을 오독합니다. NVIDIA의 가장 깊은 해자는 학습——대규모 병렬 작업에 대한 수년간의 데이터센터 지출——위에 구축되었습니다. 업계는 동시에 지연, 토큰당 비용, 서빙 경제가 P&L을 지배하는 추론의 시대로 진입했습니다.
| 학습 | 추론 | |
|---|---|---|
| 우선순위 | 처리량 | 저지연 |
| 워크로드 형태 | 병렬 배치 | 순차적 실시간 decode |
| 메모리 패턴 | HBM 대역폭 | 온칩 SRAM |
| 일반적 적합 | GPU (NVIDIA) | LPU / 전용 가속기 |
독립 Groq가 엔터프라이즈 추론을 확장하면 CUDA 정면 싸움에서 이기지 않아도 빠르게 성장하는 세그먼트를 깎아 냈을 것입니다. Groq 인수는 그 벡터를 제거하고 NVIDIA가 이제 포트폴리오에서 가장 강력한 전용 decode 패브릭으로 제시하는 것——Vera Rubin과 단일 레퍼런스 아키텍처 스토리로 병합——을 더합니다.
핵심 요약
Groq 3 LPX는 전략적 전환의 하드웨어 표현으로 이해하는 것이 최선입니다: AI 학습 기본 플랫폼조차 추론 스토리의 공백이 헤드라인급 거래를 정당화할 만큼 컸음을 인정한 것입니다.
엔터프라이즈와 빌더에게 실질적 함의는 일률적 GPU 추론이 이종 시스템——전문화된 단계를 위한 전문화 실리콘, 요청 유형과 SLO를 이해하는 소프트웨어가 조율——으로 양보하고 있다는 것입니다. 경쟁 질문은 누가 가장 큰 단일 칩을 출하하는가보다 누가 가장 일관된 풀 스택을 출하하는가입니다. Vera Rubin과 Groq LPX가 같은 로드맵에 있으므로 NVIDIA는 시장에 더 넓은 스코어카드로 평가해 달라고 요청하고 있습니다.
자체 스택에서 추론이나 agentic AI를 계획 중이신가요?
모델 서빙, 하드웨어 선택, 통합——이종 데이터센터 설계부터 제품 로드맵까지——을 돕습니다. 전략 및 구현 지원을 위해 팀과 상담하세요.

