AI Agent Skill 不能用「看起來寫得很完整」驗收,要證明安裝後比沒安裝更可靠,而且不會在無關任務亂載入。 NVIDIA 8 月 19 日公開 SkillEvaluator,把評測拆成靜態檢查、重複度分析與隔離實測,方向值得採用;官方公布的高分仍不能直接套到你的 Skill。
NVIDIA 在 300 多個自家 verified skills、30 多項產品上比較 Codex 與 Claude Code,回報整體 Skill Lift 平均為 31 點,排除原本已接近滿分的安全指標後為 39 點。這是官方目錄的宏觀結果,不是你的 Skill 能提升相同比例。
三層評測各自抓什麼
| 層級 | 檢查內容 | 能抓到 | 抓不到 |
|---|---|---|---|
| Tier 1 | schema、frontmatter、授權、秘密、個資、提示注入與腳本 | 格式及明顯安全問題 | Agent 是否真的會用 |
| Tier 2 | Skill 內部與目錄間的語意相似度 | 重複說明、能力撞題 | 任務結果是否更好 |
| Tier 3 | 相同任務有無 Skill 的隔離執行 | 正確性、效果、效率與觸發差異 | 未出現在測試集的真實情境 |
SkillEvaluator 文件使用 Harbor 建立可重複的隔離任務。同一提示、模型、輸入與評分標準各跑有 Skill、無 Skill 兩組,差值才叫 Skill Lift。這比只跑安裝後成功案例更能看出 Skill 的增量。
如果你還在分辨 Skill、MCP 與 Plugin,可先看Agent Plugins 1.0 分工;SkillEvaluator 評的是做事方法是否增加效果,不是在測外部服務本身是否可用。
31 點要怎麼讀才不誤會
NVIDIA 的結果顯示,正確性由 46 分升至 87 分、效果由 39 分升至 78 分;Discoverability 和 Efficiency 也上升。官方同時說明,這些是評分點數,不是通過機率或百分比。
更重要的限制是:85% 已發布結果每個任務只試一次,15% 試兩次,文章沒有提供信賴區間。Agent 執行具有隨機性,一次成功或失敗可能只是抽樣結果。NVIDIA 的資料也來自自家 Skill 目錄與專業任務,不能推論所有公司流程都會得到同樣增益。
我的判斷是,這套工具適合當 CI 評測骨架,不適合當「verified 就可直接上線」的安全認證。完整做法仍要結合企業 Agent 評測框架與人工風險審查。
團隊怎麼驗收自己的 Skill
資料集先從真實工單、錯誤紀錄與使用者需求整理 20 至 50 題,不要全部交給 Skill 作者或模型生成。題型要同時包含明確要求、隱含需求、需要讀上下文的案例,以及「不該載入這個 Skill」的負向題;最後一類能抓出名稱和 description 寫得太寬,導致 Agent 逢題必載入的問題。
對照實驗固定模型版本、系統提示、工具權限與評分器,兩組唯一差異才是有沒有 Skill。每題重跑多次,報平均、波動與最差結果;正確性之外,還要記誤觸發、工具步數、Token、延遲、成本與危險動作。否則一個更會解題、卻多花十倍工具呼叫的 Skill,也可能被誤判為全面進步。
每次改版都重跑固定回歸集,再加入新案例檢查是否過度貼合舊題。若只有作者生成的題目會提升、真實工單沒有差異,就先改 Skill 的範圍和範例,不急著發布。
NVIDIA Skills 儲存庫公開持續更新的 benchmark,但目錄平均值不應成為你的發布門檻。真正的門檻應該是:關鍵任務有提升、負向案例不誤觸發、安全沒有退步,而且成本值得。
常見問題
NVIDIA SkillEvaluator 只能測 NVIDIA Skills 嗎?
工具以 Agent Skill 目錄為輸入,官方 Quickstart 提供建立資料集與執行評測的流程。自訂 Skill 仍要自行設計任務、評分標準與執行環境。
Skill Lift 31 代表效能提升 31% 嗎?
不是。它是有 Skill 分數減去無 Skill 分數後的平均點數差,不能當成百分比,也不代表每個 Skill 都有相同增益。
AI Agent Skill 評測要跑幾次才夠?
沒有適用所有任務的固定次數。高風險或高波動案例應增加重跑次數,至少要能看出平均、離散程度與最差情況,而不是只留一次最好結果。
參考來源
- NVIDIA Technical Blog:Evaluating AI Agent Skill Performance with NVIDIA SkillEvaluator(2026-08-19)
- GitHub NVIDIA:SkillEvaluator(2026-08-24 查核)
- GitHub NVIDIA:Verified Skills repository(2026-08-24 查核)
- NVIDIA Documentation:Tier 3 Live Evaluation(2026-08-24 查核)
- GitHub Harbor Framework:Harbor(2026-08-24 查核)