回到頂部
深色實驗台上的緊密神經晶體單體與記憶體光路,呈現 Qwen3.6-27B Dense 本地部署

Qwen3.6-27B 本地部署:16GB 能跑嗎?Q4、FP8 與硬體選擇

Qwen3.6-27B 本地部署指南:說明 16GB VRAM 能否運行、Q4 與 FP8 差異、脈絡長度、官方評測及不同顯存的實際選擇。

內容查核: 來源查核:

Qwen3.6-27B 是阿里 Qwen 團隊開放權重的 27B Dense 多模態模型,主打程式開發與 Agent 任務。 對 16GB 顯卡使用者,答案要先講清楚:BF16 與 FP8 權重都放不進 16GB VRAM;社群 Q4 版本可以嘗試,但通常要縮短脈絡、使用 CPU offload,或只載入文字部分。 購買硬體前先看你能接受多少速度與記憶體折衷。

目前可下載 BF16 權重FP8 權重,兩者都包含部署範例。想先理解整個系列,可搭配 Qwen3.6 開源模型總覽閱讀。

Qwen3.6-27B 的規格重點

Qwen3.6-27B 有 27B 參數與 64 層,採用 3 層 Gated DeltaNet 搭配 1 層完整注意力的混合排列。它包含視覺編碼器,可接受圖片與文字;舊版文章若把它描述成純文字模型,已經不準確。

原生脈絡長度是 262,144 token,模型卡另列出可擴展到 1,010,000 token。這是模型能力上限,並非單張消費級 GPU 的實用設定。KV cache 會隨脈絡長度增加,16GB 或 24GB 顯卡應從較短的 8K、16K 或 32K 開始測試。

授權為 Apache 2.0,可以商用與修改,但產品仍要自行處理資料授權、輸出責任與其他適用法規。模型授權寬鬆不等於任何資料都能直接拿來處理。

16GB VRAM 到底能不能跑?

先分清楚「權重檔案大小」和「執行時顯存」。官方 BF16 儲存庫約 55.6GB,FP8 儲存庫約 30.9GB;模型啟動後還需要 KV cache、視覺編碼器、框架緩衝區與作業系統資源。因此 30.9GB 的 FP8 權重也不代表 32GB 顯卡一定能完整、穩定地服務長脈絡請求。

Q4 約為每個權重 4 bit,社群量化檔通常會把權重壓到接近 16GB 的區間。這是依參數量與量化格式做的估算,不是 Qwen 官方硬體保證。 不同 GGUF 製作者是否量化視覺部分、採用哪種 K-quant、是否包含 MTP,都會改變檔案大小與實際需求。

可用記憶體較務實的選擇主要限制
16GB VRAM社群 Q4、短脈絡、CPU offload;優先文字模式很難完整 GPU offload,速度與最大脈絡受限
24GB VRAM社群 Q4,保留較多 KV cache仍放不下官方 FP8 全部權重與執行開銷
32GB VRAMFP8 可測試,但通常非常緊;Q4 較從容FP8 長脈絡或視覺輸入容易超出空間
48GB 以上官方 FP8 較實際併發與超長脈絡仍要另外估算

如果只有 16GB,先用一個可信任的社群 Q4 量化,將 context 設為 8K,測量首 token 延遲與生成速度,再逐步提高。不要一開始就設定 262K;即使成功啟動,也可能因大量 CPU offload 而失去本地部署的速度優勢。

Q4、FP8 與 BF16 怎麼選

Q4 適合單機試用與個人工作流。 它用較小的權重換取精度損失,量化方法與製作者會影響品質。下載前核對 base model、量化格式、vision projector、授權與最近更新時間,避免把名稱相近的微調版當成官方版。

FP8 適合有 48GB 級顯存或多卡環境的團隊。 Qwen 提供官方 FP8 權重,部署來源與設定較容易追蹤。正式服務還要預留 KV cache、併發請求與框架開銷,不要用儲存庫大小直接等同最低 VRAM。

BF16 適合評測基準、再量化或資源充足的伺服器。 單看權重已超過 55GB,實際推論通常需要 80GB 級顯卡、多卡切分或 CPU 記憶體協助。若目標只是本地程式助手,BF16 的成本未必值得。

官方評測該怎麼讀

Qwen 模型卡顯示,3.6-27B 在多項 coding agent 評測勝過體積更大的 Qwen3.5-397B-A17B。SWE-bench Verified 是 77.2 對 76.2、SWE-bench Pro 是 53.5 對 50.9、Terminal-Bench 2.0 是 59.3 對 52.5,SkillsBench 則是 48.2 對 30.0。這些數字都來自 Qwen 自己的測試設定,適合初篩,不能替代獨立實測。

它也沒有在每個項目領先:GPQA Diamond 得分 87.8,略低於 397B MoE 的 88.4。原本「27B 全面打贏 397B」的說法過度延伸;更準確的結論是,它在特定 coding agent 評測以較小的 Dense 架構取得相近或更高成績。

本地部署前的四步測試

  1. 先選格式:16GB、24GB 優先 Q4;48GB 以上再評估官方 FP8。
  2. 限制脈絡:從 8K 起步,逐次測到 16K、32K,記錄是否溢出與速度變化。
  3. 固定真實任務:選 20 個程式修改、工具呼叫或文件問題,統計完成率與人工修正時間。
  4. 驗證部署來源:記錄模型 repo、commit、量化者、推論框架與啟動參數,之後才能重現結果。

Qwen 模型卡提供 Transformers、vLLM、SGLang 與 KTransformers 範例。vLLM 官方建議 Qwen3.6 使用 0.19.0 以上版本;在消費級單卡使用社群 GGUF 時,llama.cpp、Ollama 或 LM Studio 通常比較容易開始,但效能仍要依量化與硬體實測。

商用 API 與本地模型是兩條不同路線。若你同時使用 Qwen Max,請留意 Qwen3.6-Max 下線與 Qwen3.7-Max 遷移指南;API 型號的生命週期不會改變本地權重,但會影響雲端備援流程。

常見問題

Qwen3.6-27B Q4 可以在 16GB VRAM 跑嗎?

可以嘗試社群 Q4,但 16GB 很緊,通常需要短脈絡、CPU offload 或文字模式。不同量化檔大小不一,無法把「16GB 可跑」當成所有版本的保證。24GB 會更實用。

Qwen3.6-27B FP8 需要多少 VRAM?

官方 FP8 儲存庫約 30.9GB,執行時還需要 KV cache 與框架開銷。32GB 多半過於緊繃,48GB 以上較實際;長脈絡與高併發還需要更多空間。

Qwen3.6-27B 支援圖片嗎?

支援。官方模型卡將它列為帶有視覺編碼器的 causal language model,Hugging Face 任務類型也是 Image-Text-to-Text。若使用社群量化,要確認是否同時提供並正確載入視覺元件。

Qwen3.6-27B 可以商用嗎?

官方權重採 Apache 2.0 授權,可用於商業用途。團隊仍要檢查輸入資料權利、輸出用途、個資與產業規範;本地部署只解決資料傳輸的一部分風險。

參考來源

№ · further reading

延伸閱讀