回到頂部
同一個 AI Agent 在兩座隔離測試艙分別安裝與不安裝 Skill,接受相同任務與人工評分

AI Agent Skill 怎麼驗?NVIDIA SkillEvaluator 三層測試法

NVIDIA SkillEvaluator 以靜態掃描、重複度與有無 Skill 的隔離實測評估 Agent Skills。整理指標、限制與團隊驗收方式。

內容查核: 來源查核:

AI Agent Skill 不能用「看起來寫得很完整」驗收,要證明安裝後比沒安裝更可靠,而且不會在無關任務亂載入。 NVIDIA 8 月 19 日公開 SkillEvaluator,把評測拆成靜態檢查、重複度分析與隔離實測,方向值得採用;官方公布的高分仍不能直接套到你的 Skill。

NVIDIA 在 300 多個自家 verified skills、30 多項產品上比較 Codex 與 Claude Code,回報整體 Skill Lift 平均為 31 點,排除原本已接近滿分的安全指標後為 39 點。這是官方目錄的宏觀結果,不是你的 Skill 能提升相同比例。

三層評測各自抓什麼

層級檢查內容能抓到抓不到
Tier 1schema、frontmatter、授權、秘密、個資、提示注入與腳本格式及明顯安全問題Agent 是否真的會用
Tier 2Skill 內部與目錄間的語意相似度重複說明、能力撞題任務結果是否更好
Tier 3相同任務有無 Skill 的隔離執行正確性、效果、效率與觸發差異未出現在測試集的真實情境

SkillEvaluator 文件使用 Harbor 建立可重複的隔離任務。同一提示、模型、輸入與評分標準各跑有 Skill、無 Skill 兩組,差值才叫 Skill Lift。這比只跑安裝後成功案例更能看出 Skill 的增量。

如果你還在分辨 Skill、MCP 與 Plugin,可先看Agent Plugins 1.0 分工;SkillEvaluator 評的是做事方法是否增加效果,不是在測外部服務本身是否可用。

31 點要怎麼讀才不誤會

NVIDIA 的結果顯示,正確性由 46 分升至 87 分、效果由 39 分升至 78 分;Discoverability 和 Efficiency 也上升。官方同時說明,這些是評分點數,不是通過機率或百分比。

更重要的限制是:85% 已發布結果每個任務只試一次,15% 試兩次,文章沒有提供信賴區間。Agent 執行具有隨機性,一次成功或失敗可能只是抽樣結果。NVIDIA 的資料也來自自家 Skill 目錄與專業任務,不能推論所有公司流程都會得到同樣增益。

我的判斷是,這套工具適合當 CI 評測骨架,不適合當「verified 就可直接上線」的安全認證。完整做法仍要結合企業 Agent 評測框架與人工風險審查。

團隊怎麼驗收自己的 Skill

資料集先從真實工單、錯誤紀錄與使用者需求整理 20 至 50 題,不要全部交給 Skill 作者或模型生成。題型要同時包含明確要求、隱含需求、需要讀上下文的案例,以及「不該載入這個 Skill」的負向題;最後一類能抓出名稱和 description 寫得太寬,導致 Agent 逢題必載入的問題。

對照實驗固定模型版本、系統提示、工具權限與評分器,兩組唯一差異才是有沒有 Skill。每題重跑多次,報平均、波動與最差結果;正確性之外,還要記誤觸發、工具步數、Token、延遲、成本與危險動作。否則一個更會解題、卻多花十倍工具呼叫的 Skill,也可能被誤判為全面進步。

每次改版都重跑固定回歸集,再加入新案例檢查是否過度貼合舊題。若只有作者生成的題目會提升、真實工單沒有差異,就先改 Skill 的範圍和範例,不急著發布。

NVIDIA Skills 儲存庫公開持續更新的 benchmark,但目錄平均值不應成為你的發布門檻。真正的門檻應該是:關鍵任務有提升、負向案例不誤觸發、安全沒有退步,而且成本值得。

常見問題

NVIDIA SkillEvaluator 只能測 NVIDIA Skills 嗎?

工具以 Agent Skill 目錄為輸入,官方 Quickstart 提供建立資料集與執行評測的流程。自訂 Skill 仍要自行設計任務、評分標準與執行環境。

Skill Lift 31 代表效能提升 31% 嗎?

不是。它是有 Skill 分數減去無 Skill 分數後的平均點數差,不能當成百分比,也不代表每個 Skill 都有相同增益。

AI Agent Skill 評測要跑幾次才夠?

沒有適用所有任務的固定次數。高風險或高波動案例應增加重跑次數,至少要能看出平均、離散程度與最差情況,而不是只留一次最好結果。

參考來源

№ · further reading

延伸閱讀