Ollama vs vLLM vs SGLang:開源大模型推理服務入門指南

2026年8月20日9 分鐘閱讀

把開源權重模型拉到本機其實不難。真正讓初學者卡住的是:一旦不只一個人同時要答案,你該用哪一套執行環境來「服務」這個模型。

自架討論裡幾乎一定會出現三個名字:OllamavLLM、與 SGLang。它們不是同一產品的三種口味,各自解決不同的服務問題;選錯時,常常感覺「GPU 明明夠力,API 卻很慢」。

這篇用白話說明每個引擎適合什麼、底層差在哪,以及如何在不背一堆排行榜的情況下做選擇。

推理引擎到底在做什麼

模型檔是權重;推理引擎是把它變成真實流量下的 token 輸出的執行時:載入模型、管理注意力狀態(KV cache)的顯存、決定哪些請求一起跑,再把 token 串流回去。

Notebook 裡聊天是單一請求;產品服務則是許多開始與結束時間交錯的請求。各引擎的差異,主要在批次調度有多聰明,以及能不能重用已經算過的工作。

三個引擎,三種工作

Ollama

以本機為先,讓開發者在筆電或工作站上幾分鐘就能跑起模型。

  • GGUF/拉取即用
  • 本機 OpenAI 相容 API
  • 適合單人/低併發
vLLM

高吞吐生產伺服器,目標是在大量併發下把 GPU 吃滿。

  • 連續批次(continuous batching)
  • PagedAttention 式 KV 管理
  • 通用多用戶 API 的預設選擇
SGLang

同樣追求吞吐,但擅長前綴重用——適合代理、多輪對話與結構化輸出。

  • 前綴感知排程
  • RadixAttention 快取
  • JSON/正則約束生成

Ollama:先把本機 Demo 跑起來

Ollama 優化的是上手速度與開發體驗:拉取模型、得到相容 OpenAI的端點,就能改提示詞,而不必先打一場 CUDA 編譯戰。底層偏 llama.cpp/GGUF 路徑,請求調度也比生產級 GPU 伺服器保守。

這是刻意的產品取捨。你是唯一併發用戶,或小團隊在原型階段時,它很強;若要為數十上百個重疊請求提供穩定延遲,就不是它的戰場。

vLLM:讓 GPU 持續有活幹

vLLM 成為生產預設有原因:連續批次讓完成的請求離開、新請求加入,不必等整批結束;PagedAttention 用固定大小區塊管理 KV cache,比較像作業系統分頁,減少碎片浪費顯存。

實務上,同一張 GPU 能服務的併發用戶遠多於天真迴圈。流量是大量彼此獨立的提示(共享上下文不多)時,vLLM 通常是最穩的第一站;模型覆蓋面廣,也適合路線圖常變的團隊。

SGLang:重用已經算過的前綴

SGLang 與 vLLM 同屬高吞吐陣營,招牌是 RadixAttention:把算過的 KV 前綴放進基數樹,新請求若共享提示開頭就直接重用。長系統提示、共用 RAG 文件、或越積越長的多輪歷史,不必每次從頭算。

排程也前綴感知——優先跑比較容易命中快取的工作。對代理工具迴圈、固定前言的聊天機器人,以及重複出現的 JSON/正則約束輸出特別有利。

若幾乎每個請求從頭到尾都獨一無二,優勢會縮小,此時改看維運熟悉度與模型支援即可;若超過約一半的 token 落在共享前綴,就值得認真對測。

對照表

面向OllamavLLMSGLang
主要對象本機開發者大量併發用戶多用戶且共享上下文
排程思路簡單/偏 FIFO連續批次前綴感知排程
記憶體手法GGUF/筆電友善路徑PagedAttention KV 區塊RadixAttention 前綴快取
上手門檻最低中等(GPU 維運)中等(GPU 維運)
甜蜜點原型、Demo、本機應用高 QPS 通用 API代理、RAG、多輪對話

實務怎麼選

選 Ollama,若…

今天就要在筆電上有可用端點、在驗證提示詞或產品體驗,而且併發幾乎是一次一人。

預設 vLLM,若…

要對外提供共享 GPU API、流量高,且請求不太重複同一段長前綴。

考慮 SGLang,若…

代理、工具迴圈、多輪聊天或 RAG 反覆重播同一系統提示/文件,且能測到真實前綴命中率。

公開吞吐數字每個版本都會動。把它們當方向,不當命運:在你的提示上量 TTFT 與每秒 token,並在可用時開啟前綴快取,再決定標準化哪一套。

初學者常見錯誤

把 Ollama 當多租戶 API

它能說 OpenAI JSON,但不是為高併發最大化 GPU 利用率而生。原型沒問題;用戶變多再升級。

前綴幾乎不重疊卻選 SGLang

RadixAttention 在共享樹幹時才發光。每次呼叫都獨一無二,等於優化打不中的快取。

上線前一週才想維運

vLLM/SGLang 需要真實的驅動、監控與容量規劃。別只預算模型品質。

永遠相信同一張排行榜

硬體、模型大小與工作負載形狀都會改排名。有條件就用生產流量重播來對測。

快速回顧

Ollama 讓你幾乎零摩擦拿到本機聊天 API;vLLM 在通用流量下擠出更多併發;SGLang 則在共享前綴占主導——代理、RAG、多輪系統——時最划算。

從今天的工作負載出發,而不是從「冠軍」圖表出發。等併發或前綴重用變成瓶頸再換引擎,而不是因為某篇文章叫你換。

緊貼最新動態

隨時掌握最新新聞與更新