Cloudflare が AI を革新:Kimi & GLM モデルを 41% 高速化、30% コスト削減
Cloudflare の画期的な最適化技術が大規模言語モデルの展開を変革

AI インフラストラクチャの世界に地殻変動が起きました。Cloudflare は、最も要求の厳しいオープンソース AI モデルである Moonshot AI の Kimi K2.6 と Z.ai の GLM 5.2 の最適化に成功し、大規模言語モデルの提供方法に関する考え方を根本から変える驚異的なパフォーマンス向上を実現しました。
課題:メモリを大量消費する巨人
Kimi と GLM は AI 能力の最先端を代表しています。これらの大規模な混合エキスパート(MoE)モデルは、262,000 トークンを超えるコンテキストウィンドウを誇り、複数言語と複雑なタスクで卓越したパフォーマンスを発揮します。しかし、そのサイズは重大なボトルネックを生み出します:GPU メモリの制約です。
小規模なモデルとは異なり、主なメモリ消費者はモデルの重み自体ではなく、以前に処理されたトークンのアテンションデータを保存する KV(キー・バリュー)キャッシュです。長いコンテキストの会話では、このキャッシュが指数関数的に増加し、利用可能な GPU メモリをすぐに使い果たします。
解決策:3 つの革命的技術
Cloudflare のエンジニアリングチームは、オープンソースの SGLang 推論フレームワークと協力して、ゲームチェンジャーとなる 3 つの最適化を実装しました:
KV キャッシュ量子化
KV キャッシュを BF16 から FP8 に圧縮し、コンテキスト容量を 686,000 トークンから 137 万トークンに倍増。
スループット +41% · トークンあたりコスト −30%
モデル重みの圧縮
モデルの重みに高度な量子化を適用し、精度を犠牲にすることなくメモリフットプリントをさらに削減。より多くのリクエストが同じ GPU を効率的に共有できます。
キャッシュ保護
共有ハードウェアにより多くのリクエストが詰め込まれる中、Cloudflare は大規模での信頼性を確保する堅牢な保護を実装しました。
スループット:BF16 vs FP8 KV キャッシュ
Kimi K2.6 のデコードでは、BF16 がメモリ不足になる一方で FP8 はスケールを続けます:
| 同時リクエスト | BF16(tok/s) | FP8(tok/s) |
|---|---|---|
| 32 | 1,558(上限) | 1,489 |
| 64 | メモリ不足 | 2,192 |
結果:FP8 のピーク同時実行でスループット 41% 向上、トークンあたりコスト 30% 削減。
実世界への影響
これらの最適化は現在、Cloudflare の Workers AI プラットフォームで本番稼働しており、世界中の開発者が Kimi K2.6、Kimi K2.7 Code、GLM 5.2 モデルにアクセスできます。改善の意味するところ:
コスト削減
AI アプリ開発者の本番トークン単価が下がります。
スループット向上
本番ワークロードが GPU あたりより多くの同時リクエストを処理。
精度損失ゼロ
ベンチマークは未最適化版と区別がつかない水準です。
応答高速化
エンドユーザーは長文脈会話でより低いレイテンシを得ます。
中国の AI モデルにとっての重要性
この画期的な進歩は、グローバル市場に参入する中国の AI モデルにとって特に重要です。Kimi と GLM は、多言語理解、ツール呼び出し、推論タスクで卓越した能力を示してきましたが、展開コストが障壁となっていました。
Cloudflare の最適化は、これらの高度なモデルの国際展開の「障壁を下げる」ことに効果的であり、より広範なアプリケーションにとって経済的に実行可能なものにしています。ある観察者が述べたように、これは中国モデルのグローバル展開の課題に対する「次元削減攻撃」を表しています。
技術的優位性
Cloudflare のアプローチが際立っているのは、異なる段階で異なる最適化を戦略的に適用することです:
プリフィルフェーズ
計算がボトルネックとなる場所で BF16 精度を維持。
デコードフェーズ
メモリが制約となる場所で FP8 量子化を適用。
結果:各推論段階での最適なパフォーマンス。
今後の展望
GLM 5.2 と Kimi K2.7 Code が Workers AI で利用可能になったことで、開発者は 262,144 トークンのコンテキストウィンドウ、関数呼び出し、ビジョン機能、高度な推論を備えた最先端規模のモデルにアクセスできるようになりました——すべて本番展開用に最適化されています。
これは単なる段階的な改善ではありません。大規模言語モデルを効率的に提供する方法についての根本的な再考です。AI モデルがサイズと能力において成長し続ける中、Cloudflare のようなイノベーションは、高度な AI をアクセス可能で手頃な価格にするために不可欠となるでしょう。
メッセージは明確です:AI の未来は、より大きなモデルを構築することだけではなく、それらをよりスマートに提供することです。

