回到頂部
長任務 AI Agent 透過記憶、工具、回饋與監督循環,逐步完成多個陌生互動環境

NVIDIA AVO 的 ARC-AGI-3 100 分代表什麼?限制一次看

NVIDIA AVO 在 ARC-AGI-3 公開集完成 183 關。拆解 RHAE、記憶與監督架構,說明為何不能直接當模型能力或私有集成績。

內容查核: 來源查核:

NVIDIA AVO 是一套讓 AI Agent 用持久記憶、工具回饋與監督器持續完成長任務的架構。 它搭配 Claude Opus 5,在 ARC-AGI-3 的 25 個公開環境完成 183 個關卡並取得 100.00 RHAE。評估長時間 Coding Agent 或自動化流程的工程團隊應該注意這個結果,因為它顯示 harness 會大幅改變表現;採購時仍要分開測模型與完整系統。

這個 100 分不能證明模型已經通過通用智慧測試,官方也明確說明它不涵蓋半私有或完全私有競賽集。更值得看的,是同一模型如何從 ARC Prize 頁面約 30% 的模型層結果,變成完整公開集解題系統。

兩邊的推理設定、觀察表示、記憶、工具與評測流程都不同,不能把 70 點差距全歸功於 AVO,也不能做直接的受控比較。

ARC-AGI-3 在測什麼

ARC-AGI-3讓 Agent 進入沒有說明、規則或明示目標的互動環境。Agent 要透過動作觀察變化、推測規則、保留狀態並用有限步數完成逐漸變難的關卡。

RHAE 方法同時考慮是否完成與相對初次遊玩人類的動作效率。因此 100 分不是百分之百像人,也不是所有推理題都答對;它表示在指定公開關卡與計分方法下達到完整分數。

官方結果可以說不可以推論
25 個公開環境、183 關全完成AVO 對公開集有效私有集也一定滿分
6,624 次環境動作比官方引用的 VISTA 7,542 次少約 12%AVO 單一機制帶來全部差距
Claude Opus 5 搭配 AVO完整系統表現強Claude Opus 5 單獨就是 100 分
64×64 文字網格觀察文本介面可完成任務真實視覺環境同樣可靠

AVO 如何完成長任務

NVIDIA 原文指出兩個核心:持久記憶保存過去實作、測試、錯誤與假設;監督器則在主 Agent 停滯或反覆走錯時,引導它改換方向。工具回饋讓每一步能用外部結果修正,而不是只靠模型在同一段上下文猜。

這個迴圈先用於 GPU kernel 最佳化。AVO 論文與官方文章記錄了搜尋方法;官方表示系統連續運作七天、探索 500 多個方向並提交 40 個版本。這些仍是 NVIDIA 自有硬體與研究設定下的結果,能支持「系統設計重要」,不足以保證任何企業流程都會得到相同效能。

企業該抄架構,不要抄分數

對長任務 Agent,可把測試拆成五項:跨 session 記憶是否正確、失敗後能否從檢查點恢復、工具結果是否真的驅動下一步、停滯多久會換策略、最後證據能否被人重播。這和上下文管理多 Agent 協調是同一組工程問題。

我不建議用公開 benchmark 的單次滿分選模型或供應商。至少要用未公開的公司任務,固定工具與權限,分開測模型、記憶、監督器和工具介面;並依研究重現檢查表記錄版本、成本、失敗與人工介入。

常見問題

ARC-AGI-3 100 分代表 AGI 已經達成嗎?

不代表。這是指定 Agent 系統在公開互動關卡與 RHAE 方法下的成績,不能外推到所有工作、私有集或現實環境。

NVIDIA AVO 是模型還是 Agent?

AVO 是包在模型外的 Agent 架構,負責記憶、工具使用、監督與長時間迭代。這次完整公開集結果使用 Claude Opus 5 作為底層模型。

企業能直接使用 AVO 的 100 分做採購比較嗎?

不建議。採購要用自己的未公開任務,固定模型、權限與工具後做受控比較,還要量成本、延遲、失敗復原和人工介入。

參考來源

№ · further reading

延伸閱讀