GLM-5.2 是中國 AI 公司 Z.ai 在 2026 年 6 月 16 日發布的開放權重文字模型,主打長時間 coding agent、工具使用與最長約 100 萬 tokens 的 context。它是約 744B 總參數、每個 token 啟用約 40B 的大型 MoE,官方權重採 MIT 授權。
最重要的選型結論是:GLM-5.2 可以下載,不代表一般電腦可以自架。 vLLM 官方 recipe 估原生 FP8 版本至少約 893GB VRAM,BF16 約 1,786GB;要把 1M context 跑在單一節點,文件以 8 張 B200 為目標。個人或小團隊想先測能力,使用 Z.ai 介面或託管 API 通常更實際。
先準備 10–20 個真實 repository 任務,比較它是否能通過測試、持續使用工具與控制成本。只有能力通過,而且資料政策要求權重與推理環境自主管理,再進入 FP8/FP4 自架評估。
GLM-5.2 規格與定位
GLM-5.2 是 text-to-text MoE,約 744B total/40B active,最長 context 為 1,048,576 tokens。每個 token 的主要計算只啟用部分 experts,所有 expert 權重仍要保存。模型可調 thinking effort,也能關閉 thinking,以速度與 token 用量交換較難任務的推理深度。
架構更新包括 DSA、IndexShare、KVShare 與 MTP,目標是降低長 context 計算並提高 speculative decoding 效率。官方 GLM-5.2 權重不處理圖片;需要視覺輸入時要選 GLM-V 系列。權重採 MIT 授權,可修改與商用,發佈時仍須保留授權聲明。
參數總數在不同工具可能顯示約 743B/39B 或 744B/40B,來自計數與四捨五入差異。這不影響部署判斷:它是需要數百 GB VRAM 的 frontier-scale MoE,不應和 Qwen3.6-35B-A3B 這類二十多 GB Q4 模型放在同一個本機選項表。
GLM-5.2 採 DeepSeek Sparse Attention,並用 IndexShare 讓每四層共用索引器。Z.ai 的發布文稱,在 1M context 下可降低 indexer 的重複工作;MTP 則用多個 draft tokens 做 speculative decoding。這些架構改善不會讓記憶體需求消失。
1M Context 真正能解決什麼?
1M context 適合跨大量檔案的程式修改、長時間 agent trajectory、研究資料與需要保留多輪工具結果的工作。它的價值在「任務中途少丟資訊」,而非把整個資料庫一次貼進 prompt。
長 context 有四個成本。首先是 prefill:模型要先處理完整輸入,首 token 會變慢。其次是 KV cache:Z.ai 自己也指出,架構降低 FLOPs 的幅度並不會同比例降低每 token cache。第三是檢索品質:塞入大量無關檔案,模型仍可能忽略真正關鍵的段落。最後是帳單與併發:一個超長請求可能占用大量 token 與 GPU cache,排擠其他使用者。
評估時先從 32K 或 128K 開始,再逐步加入真正需要的 repository 範圍。每次增加 context 都記錄首 token 延遲、完成時間、輸入 token、測試通過率與遺漏檔案。若 128K 加 RAG 已能完成,就不必為 1M 支付固定成本。
API、Coding Plan 與自架怎麼選?
Z.ai 網頁介面適合先試回答與 coding 能力,不需要處理 API 或 GPU。Coding Plan 面向 Claude Code 等開發工具,以月費與用量方案提供模型;實際可用模型、限額與續訂價格應以結帳頁為準。
託管 API 適合要串系統、紀錄 token 與執行評測的團隊。2026 年 8 月 12 日查核時,Z.ai 公開 pricing 頁仍列 GLM-5.1、GLM-5 與 GLM-5-Turbo,尚未清楚列出 GLM-5.2 的獨立 token 單價。因此不能拿 GLM-5.1 的 input 1.4 美元/output 4.4 美元直接當成 GLM-5.2 定價;導入前要在帳號、合約或銷售報價確認。
自架權重適合有多 GPU 基礎設施、需要控制資料位置、能維護 vLLM/SGLang 並負擔監控的人。MIT 授權降低商用授權門檻,硬體、量化品質、推理 kernel 與長 context 穩定性仍是大型工程。
如果只是希望資料留在本機,可以先看 開放權重模型選擇指南與 Ollama 本地模型。GLM-5.2 的規模通常不會是第一個自架模型。
自架需要什麼硬體?
vLLM 在 2026 年 7 月更新的 GLM-5.2 recipe 提供較可靠的容量起點:
| 版本 | vLLM recipe 最低 VRAM 估計 | 目標硬體 |
|---|---|---|
| BF16 | 約 1,786GB | 多節點 |
| 官方 FP8 | 約 893GB | 單節點 8×H200/H20;短於 1M context |
| NVIDIA NVFP4 | 約 558GB | B200/B300,部分權重仍保留 FP8/BF16 |
| AMD MXFP4 | 約 446GB | MI355X,需 ROCm 與 AITER |
這些是模型服務的估算,不含你要保留的併發餘裕、監控與故障備援。完整 1M context 的官方 recipe 指向 8×B200;即使模型權重已放得下,KV cache 仍會決定可用並發與實際 context。
vLLM 範例先把 context 設為 131,072,而非直接開到 1M:
docker run --gpus all \
-p 8000:8000 \
--ipc=host \
-v ~/.cache/huggingface:/root/.cache/huggingface \
vllm/vllm-openai:glm52 zai-org/GLM-5.2-FP8 \
--tensor-parallel-size 8 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--enable-auto-tool-choice \
--max-model-len 131072
正式服務前還要驗證 vLLM 版本、CUDA/ROCm、工具 parser、thinking 設定、MTP 接受率與你的 GPU 拓撲。不要把文件中的 benchmark command 直接當成生產設定。
Benchmark 怎麼解讀?
Z.ai 發布文列出 Terminal-Bench 2.1 為 81.0、SWE-bench Pro 為 62.1,並稱長時間 coding 任務有明顯提升。這些結果附有特定 agent harness、context、最大輸出、timeout 與多次採樣設定,不能等同你公司的 issue 成功率。
最小可用評測應包含 repository checkout、明確 issue、允許工具、測試指令與人工 review。至少記錄一次成功率、重試後成功率、總 token、wall-clock time、測試是否通過,以及模型有沒有做未授權網路或套件操作。完整方法可接 LLM 評測指南。
同一模型的 hosted API、FP8 與 FP4 量化也要分開測。量化、thinking effort、context management 與工具框架不同時,發布 benchmark 無法直接搬過來。
台灣團隊怎麼做風險評估?
Z.ai 是中國公司。使用其雲端服務前,要確認資料處理地點、留存、是否用於訓練、供應商條款與組織的跨境傳輸政策;機密原始碼、個資、合約和政府資料不應在未核准前送入。
台灣政府公開禁用文件目前明文指向 DeepSeek,不能直接改寫成「GLM-5.2 已被台灣禁用」。公部門、政府標案鏈、金融與關鍵基礎設施仍可能有更嚴格的採購與供應鏈規範,應交由資安、法務與採購依實際規定判斷。
自架會降低 prompt 傳到 Z.ai 雲端的風險,卻不會自動處理模型供應鏈、授權追蹤、弱點修補與輸出治理。API 與自架是兩種不同風險組合,不能用一句「地端就安全」代替審查。
常見問題
GLM-5.2 可以在一般電腦或 Mac 跑嗎?
原始官方模型不適合。vLLM 對 FP8 的最低 VRAM 估計約 893GB,即使社群做更激進的量化,仍是數百 GB 等級。一般電腦可使用託管服務,或改選更小的本地模型。
GLM-5.2 的 1M context 可以直接放完整 codebase 嗎?
技術上可接受很長輸入,實務上仍要控制相關檔案。先從 32K/128K 加檢索開始,測首 token 延遲、完成率與成本;無關資料越多,答案不一定越好。
GLM-5.2 可以商用嗎?
官方 Hugging Face repo 採 MIT 授權,可商用、修改與分發,但需保留授權聲明。部署框架、量化版本與其他元件仍要各自核對授權。
GLM-5.2 API 每百萬 token 多少錢?
截至 2026 年 8 月 12 日,Z.ai 公開 pricing 頁尚未清楚列出 GLM-5.2 的獨立單價。不要拿 GLM-5.1 價格代替;請在帳號、合約或官方報價確認後再估算。
台灣目前禁止使用 GLM-5.2 嗎?
本文查核的政府公開文件明文限制 DeepSeek,未將 GLM-5.2 列為同一項現行禁令。公部門與受管制產業仍應依內部採購、資安與供應鏈規範審查,不能自行類推成允許或禁止。
參考來源
- Z.ai:GLM-5.2 Built for Long-Horizon Tasks(2026-06-16)
- Z.ai Hugging Face:GLM-5.2 model card(查閱日期:2026-08-12)
- Z.ai Hugging Face:GLM-5.2 MIT License(查閱日期:2026-08-12)
- vLLM Recipes:GLM-5.2 hardware and deployment recipe(更新日期:2026-07-12)
- Z.ai Developer Docs:Pricing(查閱日期:2026-08-12)
- 數位發展部:公務機關全面禁用 DeepSeek(2025-01-31)