LFM2.5 DSpark 能讓同一模型更快吐字,但不會讓模型變聰明。 Liquid AI 8 月 20 日釋出三個 DSpark draft model,支援 LFM2.5-1.2B-Instruct、2.6B 與 8B-A1B,並接上 llama.cpp 與 SGLang。「最高 3.2 倍」只是一個峰值;加速幅度會隨模型、資料分布、硬體與接受率大幅變動。
推測解碼先讓較小的 draft model 提出一串候選 Token,再由 target model 在一次 forward pass 裡驗證。候選不符合原模型分布就被拒絕,改用 target model 的 Token。原始 DSpark 論文頁說明,它結合平行 draft backbone、序列 head 與信心排程,目的在減少驗證不划算的低信心尾段。
為什麼會快,也為什麼不一定快
LLM decode 常受記憶體頻寬限制:每產一個 Token,都要搬動大量權重。若一次載入權重能驗證多個候選,就能攤薄成本。真正決定加速的是「每輪提出多少、其中多少被接受」,不是 draft model 越大越好。
| 條件 | 可能結果 | 應先檢查 |
|---|---|---|
| 候選接受率高 | target 一次驗過多個 Token | 實際提示與輸出類型 |
| draft 本身太慢 | 額外計算吃掉收益 | draft 大小與後端核心 |
| target 很小或硬體頻寬足 | 可攤薄空間有限 | 基準 tokens/s 與延遲 |
| MoE 後端驗證成本高 | GPU 快、本機未必快 | 專家啟用與 Metal 實作 |
Liquid AI 自測 LFM2.5-2.6B 在單張 H100、BF16、batch 1、temperature 0 的五組資料平均由每秒 323 Token 增至 864 Token,約 2.67 倍;M4 Max、FP16 GGUF 平均由 61 增至 139,約 2.27 倍。官方另稱多工具情境的函式呼叫延遲平均降低 57%。這些是廠商在指定設定的量測,不是你的 Windows 顯卡或長對話可直接得到的數字。
更能說明邊界的是 8B-A1B:官方 H100 平均約 2.54 倍,M4 Max 平均只有 1.18 倍,文章把落差歸因於 llama.cpp Metal 的 MoE 實作與驗證時啟用更多 experts。看到峰值前,先確認表格是哪個模型、哪台機器。
輸出一致有前提
在 greedy decoding 下,target model 逐一驗證候選,拒絕時自行補 Token,所以官方稱輸出與基準一致。這不等於所有採樣參數、並行請求與後端版本都有同樣保證。你仍要對固定提示比較全文、工具呼叫 JSON、停止條件與錯誤率,而不只看 tokens/s。
llama.cpp 的 LFM2 DSpark PR與 SGLang 的支援 PR列出各自實作狀態。兩者都還在快速演進,部署前要鎖定 commit、模型檔與參數;不要把一次可跑當成長期相容。對本機使用者,可先理解本機 AI 的硬體限制,再評估是否值得多載入一組權重。
這四種情況才值得試
你已經選定 LFM2.5、模型品質符合需求,而且單一互動請求的 decode latency 是主要瓶頸;有足夠 RAM、VRAM 或統一記憶體容納 target 加 draft;工作負載有大量固定格式、程式碼或工具呼叫,可量測接受率;最後,部署後端已有穩定 DSpark 支援。符合這些條件,才進入 A/B 測試。
驗收至少比較基準與 DSpark 的首 Token 時間、輸出 tokens/s、整體完成時間、尖峰記憶體、功耗與輸出一致率。下載的 LFM2.5-2.6B-DSpark 模型卡也要和 target 版本配對,不要任意混用 draft checkpoint。
我不建議為了跑分,讓記憶體本來就吃緊的電腦同時載入兩個模型;也不建議在品質不足時用推測解碼掩蓋。若需求是換更準模型、提高大量並行吞吐或縮短 prompt prefill,先看推論部署建議,DSpark 不一定處理到真正瓶頸。
常見問題
DSpark 會改變 LFM2.5 的回答品質嗎?
在官方描述的 greedy decoding 設定下,target model 會驗證每個候選,輸出應與基準一致。其他採樣設定仍要以你使用的後端與回歸測試確認。
MacBook 跑 LFM2.5 DSpark 一定會快兩倍嗎?
不一定。官方不同模型與資料集的加速差異很大,8B-A1B 在 M4 Max 的平均改善遠低於 2.6B;記憶體、後端版本與提示類型都會影響結果。
Ollama 可以直接使用 DSpark 嗎?
這次官方明列的是特定 llama.cpp 與 SGLang 支援。Ollama 是否暴露相同參數要看其整合版本,不能只因底層使用 llama.cpp 就假設立即可用。
參考來源
- Hugging Face Community Blog:Up to 3.2x Faster Inference with LFM2.5-DSpark(2026-08-20)
- Hugging Face Papers:DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation(2026-07-07)
- GitHub llama.cpp:support DSpark for LFM2 models, PR #27383(2026-08-24 查核)
- GitHub SGLang:Add LFM2 and LFM2-MoE DSpark support, PR #31041(2026-08-24 查核)
- Hugging Face Models:LiquidAI/LFM2.5-2.6B-DSpark(2026-08-24 查核)