入門上手
從零開始跑自己的本地 AI
Mason AI Lab 的所有開源 AI 教學、模型評測、本地部署指南,一頁聚合。 從「什麼是開源 LLM」到「用 RAG + MCP 建完整 AI 系統」,不管你是想省錢、重隱私、還是想改模型,這裡都有答案。
模型跑在自己機器上,敏感資料不需要傳到任何雲端,醫療、法律、金融場景首選。
不按 token 計費,跑多少都一樣。高頻呼叫場景的成本可以從每月數千美元降到電費。
Fine-tune、量化、蒸餾、合併——開源模型你愛怎麼改就怎麼改,不受供應商限制。
Hugging Face 上每天數百個新模型,全球開發者共同推進,迭代速度比任何單一公司都快。
每條路徑 3-4 篇文章,照順序看完就能上手。
從零開始跑自己的本地 AI
2026 三大開源模型深度比較
從單一模型到完整 AI 系統
Qwen3.6 vs Gemma 4 vs MiniMax M2.7——一張表看懂差異。
| 項目 | Qwen3.6 | Gemma 4 | MiniMax M2.7 |
|---|---|---|---|
| 總參數 | 235B(MoE) | 27B(Dense) | 456B(MoE) |
| 激活參數 | ~22B | 27B(全量) | ~45.9B |
| SWE-bench | 65.4% | N/A | 56.1% |
| Agent 適用度 | ★★★★★ | ★★★☆☆ | ★★★★☆ |
| 多模態 | 文字 + 視覺 | 文字 + 視覺 + 音訊 | 文字 + 視覺 + 語音 |
| Context 長度 | 128K | 128K | 1M |
| 授權 | Apache 2.0 | Gemma License | MiniMax Open |
| 最低 VRAM | ~16 GB(Q4) | ~18 GB(BF16) | ~32 GB(Q4) |
👉 深度評測:Qwen3.6 · Gemma 4 · MiniMax M2.7
Qwen3.6-35B-A3B 的 16GB 顯卡能不能跑?整理 35B/3B MoE、Q4、FP8、Ollama 與 vLLM 部署、記憶體需求、context 及商用授權。
MiniMax M2.7 為 230B 總參數、10B 活躍參數的 MoE 模型,上下文長度 204,800 tokens。整理官方規格、API 價格與本地部署門檻。
Google 釋出 DiffusionGemma,基於 Gemma 4 的實驗性文字擴散模型;整理 26B MoE、RTX 5090 速度、VRAM、品質限制與台灣導入判斷。
開源 LLM / 本地端 LLM 指南:比較 Llama、DeepSeek、Qwen、Gemma 與雲端 API,整理部署成本、隱私、速度、硬體需求與適合場景。
DeepSeek API 中文教學:整理 V4 Flash/Pro 模型名、價格、OpenAI 相容範例與舊名稱退場,並比較免費網頁版、API 和本機 Ollama。
Ollama 是在 Mac、Windows、Linux 跑本機 AI 模型的工具。先看它適合誰、能做什麼,再接完整安裝、GPU、Open WebUI 與 RAG 教學。
完全新手 → 看 開源 LLM 完全指南。
想馬上動手 → 直接跳 Ollama 本地部署教學。
想比模型 → 看 Qwen3.6 · Gemma 4 · MiniMax M2.7 三篇評測。