Cloudflare 殺瘋了!Kimi、GLM 模型速度提升 41%、成本降低 30%

Cloudflare 突破性優化技術如何改變大型語言模型部署格局

2026年8月7日10 分鐘閱讀

AI 基礎設施領域剛剛經歷了一次地震級的變革。Cloudflare 成功優化了兩個最具挑戰性的開源 AI 模型——月之暗面的 Kimi K2.6 和智譜 AI 的 GLM 5.2——實現了驚人的性能提升,徹底改變了我們對大規模語言模型服務的認知。

挑戰:記憶體吞噬巨獸

Kimi 和 GLM 代表了 AI 能力的最前沿。這些大規模混合專家(MoE)模型擁有超過 262,000 個 token 的上下文窗口,在多語言和複雜任務中表現卓越。然而,它們的規模帶來了一個關鍵瓶頸:GPU 記憶體限制。

與較小的模型不同,主要的記憶體消耗者不是模型權重本身,而是儲存先前處理 token 注意力數據的 KV(鍵值)快取。對於長上下文對話,這個快取呈指數級增長,迅速耗盡可用的 GPU 記憶體。

解決方案:三大革命性技術

Cloudflare 工程團隊與開源 SGLang 推理框架合作,實施了三項改變遊戲規則的優化:

KV 快取量化

將 KV 快取從 BF16 壓縮到 FP8,上下文容量從 686,000 個 token 翻倍至 137 萬個 token。

吞吐量 +41% · 每 token 成本 −30%

模型權重壓縮

對模型權重應用先進量化,進一步減少記憶體佔用且不犧牲準確性,讓更多請求高效共享同一 GPU 硬體。

快取保護機制

隨著更多請求打包到共享硬體,Cloudflare 實施強大保護措施,確保大規模下快取數據的可靠性。

吞吐量:BF16 vs FP8 KV 快取

在 Kimi K2.6 解碼場景中,FP8 能在 BF16 耗盡記憶體後繼續擴展:

並發請求BF16(token/秒)FP8(token/秒)
321,558(極限)1,489
64記憶體不足2,192

結果:峰值 FP8 並發下吞吐量提高 41%每 token 成本降低 30%

實際影響

這些優化現已在 Cloudflare 的 Workers AI 平台上線,全球開發者可以訪問 Kimi K2.6、Kimi K2.7 Code 和 GLM 5.2 模型。改進意味著:

成本更低

AI 應用開發者的生產環境每 token 成本更低。

吞吐量更高

生產工作負載可在同一 GPU 上承載更多並發請求。

零準確度損失

基準測試結果與未優化版本難以區分。

響應更快

終端用戶在長上下文對話中獲得更低延遲。

對中國 AI 模型的重大意義

這一突破對進入全球市場的中國 AI 模型尤其重要。Kimi 和 GLM 在多語言理解、工具調用和推理任務中展現了卓越能力——但部署成本一直是禁區。

Cloudflare 的優化有效地「降低了門檻」,使這些複雜模型的國際部署成為可能,讓更廣泛的應用在經濟上變得可行。正如一位觀察者所說,這代表了對中國模型出海部署挑戰的「降維打擊」。

技術優勢

Cloudflare 方法的獨特之處在於在不同階段戰略性地應用不同的優化:

預填充階段

在計算是瓶頸的地方保持 BF16 精度。

解碼階段

在記憶體受限的地方應用 FP8 量化。

結果:每個推理階段都能達到最佳性能。

展望未來

隨著 GLM 5.2 和 Kimi K2.7 Code 現已在 Workers AI 上提供,開發者可以訪問具有 262,144 個 token 上下文窗口、函數調用、視覺能力和高級推理的前沿規模模型——全部針對生產部署進行了優化。

這不僅僅是漸進式改進;這是對如何高效服務大型語言模型的根本性重新思考。隨著 AI 模型在規模和能力上的持續增長,像 Cloudflare 這樣的創新將對使先進 AI 變得可訪問和負擔得起至關重要。

訊息很明確:AI 的未來不僅僅是構建更大的模型——而是更智能地服務它們。

來源

緊貼最新動態

隨時掌握最新新聞與更新