AI 應用地圖 · 本地部署
vLLM
開源的高吞吐、記憶體效率佳的 LLM 推理與 Serving 引擎;可在自建環境啟動 OpenAI 相容 API Server,常用於企業內網/私有化部署與成本控管情境
- 開發型態Pro-code
觀念教學
當一顆開源模型要同時服務幾百個使用者,拚的就是吞吐量與記憶體效率 — vLLM 是這個戰場的主流開源推理引擎。
它是什麼
- 開發商:開源專案(源自柏克萊大學研究團隊,社群與企業共同維護)
- 核心能力:高吞吐、記憶體效率佳的 LLM 推理與 Serving 引擎;可在自建環境啟動 OpenAI 相容 API Server
- 同類定位:Ollama 讓你「一個人方便地跑」,vLLM 讓你「一群人高效地用」— 它是生產環境等級的服務引擎
典型情境
- 企業內網架設私有 LLM API,供全公司系統以相容格式呼叫
- 金融、醫療等資料敏感產業做私有化部署,兼顧法遵與效能
- 把開源模型架成正式服務,取代按 token 計費的外部 API,達成成本控管
- 把自家微調後的模型上線,承接大流量服務
選型重點
- 高併發、生產環境、要壓榨 GPU → vLLM;個人開發試模型 → Ollama 或 LM Studio 就夠
- 它是 Pro-code 工具:要懂部署與 GPU 環境維運,不是點一點就能用
- OpenAI 相容 API 是遷移利器 — 原本呼叫雲端 API 的程式幾乎不用改,就能切到自家伺服器
- 成本從「按用量付費」變成「硬體與維運自負」,用量夠大才划算
💡 一句話記憶:vLLM = 私有 LLM 的高速引擎室,同樣的 GPU 塞進更多請求。
iPAS 考點
科目二情境選型:題幹出現企業內網、私有化部署、高吞吐、OpenAI 相容 API、成本控管,答案就指向 vLLM。經典陷阱是和 Ollama 對調 — 記住「開發便利選 Ollama,生產效能選 vLLM」;另一個陷阱是把推理引擎誤選成 Open WebUI 這類介面工具。