NVIDIAの200億ドルの賭け:Groq 3 LPXがAI推論の未来をどう変えるか

この10年で最大級のAIインフラ取引の裏にあるシリコンの物語——そして今、異種混合推論が主役となった理由。

2026年3月13分で読める

シリコンバレーを驚かせた取引

2025年12月下旬、NVIDIAはAI推論企業Groqを約200億ドル規模のアクワイハイア(人材獲得目的の買収)で取得し、エンジニアリング組織の大部分を自社に取り込み、LPU(Language Processing Unit)データフローエンジンの背後にある技術をライセンス供与しました。この構造により、長引く可能性があり重い規制の目を引きかねない従来型の買収という物語を避けることができました。この動きは迅速で、的を絞り、明らかに緊迫感のあるものでした。

その後数ヶ月間、NVIDIAは戦略的な狙いについて公にはほとんど語りませんでした。しかしサンノゼで開催されたGTC 2026で状況が変わりました。Jensen HuangはNVIDIA Groq 3 LPX——この取引に明確に根ざした最初のプロダクトライン——を発表し、NVIDIA Vera Rubinプラットフォーム上の一級市民として位置づけました。「なぜGroqが重要だったのか」という問いは、単なる見出しではなく、アーキテクチャの答えとして読まれるようになったのです。

Groqとは何者か——LPUとは何か

GoogleのTPUの初期形成に関わったエンジニア、Jonathan Rossは、明確なミッションを持ってGroqを設立しました。それは、GPUの前提をそのまま再利用するのではなく、レイテンシと予測可能性で勝つ推論チップを構築することです。その結果生まれたのがLPU(Language Processing Unit)——完全にスケジューリングされた決定論的プロセッサで、モデルの重みが存在する場所の近くに非常に大量のオンチップSRAMを配置し、GPUベースのLLMサービングをしばしば阻むメモリ帯域幅の経路を削減するという、単純な賭けを軸に構築されています。

生成AIが規模を拡大するにつれ、このアーキテクチャはベンチマークや顧客の実例において、トークン生成において本当に高速であることが示されました。他のベンダーもSRAMを多用したアプローチやウェーハスケールのアプローチを追求していました。NVIDIAの視点から見れば、推論に特化した多数のスタートアップが、データセンターGPUと同じ運用予算を奪い合っていました。Groqの取引は、この最も有力な代替スタックを、CUDAの隣で独立して成熟させるのではなく、内部に取り込むという決断として読むことができます。

Groq 3 LPX:200億ドルの取引から生まれた

Groq 3 LPX(社内ではLP30と呼ばれている)は、LPUアーキテクチャの第3世代であり、現在はNVIDIAと共同設計され、サムスンの4nmプロセスで製造されています。NVIDIAはGTC 2026で、2026年後半の一般提供を示唆し、第3四半期が最も可能性の高い時期とされています。

ラックスケールでは、NVIDIAが語る物語はラックあたり相互接続された256基のGroq 3 LPUアクセラレータを中心に構築されており、I/Oに制約される推論ワークフローを対象とした一連の数字が示されています。

  • 毎秒40PBのオンチップSRAM帯域幅により、メモリのストールがタイムラインを支配しないように計算を供給することを目指しています。
  • 高ラディックスの相互接続によるラックスケールでのチップ間通信、毎秒640TB
  • 動的なスケジューリングのジッターや予期しないテールレイテンシのスパイクを避けるための決定論的でコンパイラが調整する実行
  • NVIDIAは、デコードが重い関連スタックの部分において、GPU専用推論と比較して最大メガワットあたり35倍高い推論スループットを実現できると位置づけており、兆パラメータ規模のサービングシナリオにおけるより大きな収益機会を示しています。

アーキテクチャ上の要点は、GPUが「悪い」というものではありません——大規模な並列トレーニング、プリフィル、注意(アテンション)が重いフェーズにおいては、GPUは今も比類のない存在です。ここでの主張は、自己回帰的なデコードは異なるプログラムの形をしているということです。より逐次的で、並行処理下でのテールレイテンシに対してより敏感です。LPUはこの部分に最適化されており、大規模なGPUクラスタが同じ運用上のシンプルさで保証することに歴史的に苦労してきた、予測可能なタイミングを提供します。

異種混合の傑作:LPXとVera Rubinの融合

NVIDIAの主張は、GPUボックスに取り付けられた補助的なFPGAではありません——それは、各プロセッサクラスが最も得意とするフェーズを担う共同設計された異種混合推論エンジンです。

ワークロードハードウェア
トレーニングVera Rubin NVL72(Rubin GPU)
プリフィル&アテンションVera Rubin NVL72(Rubin GPU)
長文コンテキスト処理Vera Rubin NVL72(Rubin GPU)
低遅延FFN/MoEデコードGroq 3 LPX(LPU)
プレミアムなリアルタイムトークン生成Groq 3 LPX(LPU)

この接着層となるのがNVIDIA Dynamoで、リクエストをリアルタイムで分類し、プリフィルとアテンションの処理をRubin GPUに、レイテンシに敏感なデコードをLPUに振り分けます——NVIDIAはこれをAFD(Attention–FFN disaggregation)ループと呼んでいます。

GTC 2026において、NVIDIAの経営陣は、LPU/LPXとRubinを統合してデコードを最適化することが、市場に向けた主要な取り組みであり、単なる副次的な実験ではないと強調しました。同時に、以前構想されていたコスト最適化型のモノリシックGPUバリアントであるRubin CPXという推論向けの概念は、このLPX中心の路線に取って代わられました。

ビジョン:思考速度のコンピューティング

このプロダクトの物語は、単に高速なチャットUIを超えたものです。LPXはエージェント型AI——計画を立て、ツールを呼び出し、継続的に反復するシステムであり、人間が感じる一時停止が信頼を損なうもの——のために設計されています。

生成速度がユーザー1人あたり毎秒約1,000トークンのオーダーに近づくと、対話モデルは順番待ちのやり取りから、より生きた思考パートナーに近いものへと変化します。それはまた、マルチエージェント・オーケストレーションをより実用的なものにします——サブエージェントを生成し、推論を相互検証し、秒単位ではなくミリ秒単位で収束させることができます。

Huangはまた、ポートフォリオの視点から、低レイテンシ・プレミアム価格のトークン生成がAIクラスタの計算のおよそ4分の1を占める可能性があると述べました——これは、NVIDIAがLPXクラスのシリコンで獲得しようとしている高マージンの部分です。

なぜこれがNVIDIAにとって存亡に関わる決定だったのか

Groqの取引を単なる見栄えの良い買い物として扱うのは、市場を読み違えることになります。NVIDIAの最も深い堀はトレーニングの上に築かれてきました——大規模な並列ジョブに対する何年にもわたるデータセンターの支出です。業界は同時に、レイテンシ、トークンあたりのコスト、サービング経済性がP&Lを支配する推論の時代に移行しました。

トレーニング推論
優先事項スループット低レイテンシ
ワークロードの形並列バッチ逐次的なリアルタイムデコード
メモリパターンHBM帯域幅オンチップSRAM
典型的な適合先GPU(NVIDIA)LPU/専用アクセラレータ

独立したGroqがエンタープライズ推論の規模を拡大していれば、CUDAとの正面対決を一度もせずに、急成長するセグメントを削り取っていったことでしょう。Groqを買収することで、その脈を断ち切りつつ、NVIDIAは自社のポートフォリオにおいて最強の専用デコード基盤を——Vera Rubinと統合された単一のリファレンスアーキテクチャの物語として——手に入れました。

結論

Groq 3 LPXは、戦略的転換のハードウェア的な表現として理解するのが最適です。AIトレーニングのデフォルトプラットフォームであっても、見出しを取るような取引を正当化するほど大きな、推論の物語における空白を認識していたのです。

企業や開発者にとっての実務上の意味は、画一的なGPU推論異種混合システム——リクエストの種類とSLOを理解するソフトウェアによって調整される、フェーズごとの専用シリコン——へと道を譲っていることです。競争上の問題は、誰が最大の単一チップを出荷するかということよりも、誰が最も一貫性のあるフルスタックを出荷するかということに移っています。Vera RubinとGroq LPXを同じロードマップに乗せることで、NVIDIAは市場にこの、より広いスコアカードで評価するよう求めています。

自社のスタックで推論やエージェント型AIを計画していますか?

私たちは、異種混合データセンターの設計からプロダクトのロードマップまで、モデルサービング、ハードウェアの選定、統合をチームがナビゲートするお手伝いをしています。戦略と実装のサポートについては、私たちのチームにご相談ください。