回到頂部
AI Agent 從整理過的記憶卡片中選取適量內容,旁邊保留未載入的龐大資料堆

AI Agent 記憶不是越多越好:三種劑量與成本判斷

IBM Research 比較無記憶、完整指南與選擇性檢索。整理 AI Agent memory 的模型差異、Token 成本與上線驗收方法。

內容查核: 來源查核:

AI Agent 的記憶不是存得越多越聰明,關鍵是模型能不能在當下用對。 IBM Research 8 月 18 日公布的八模型比較顯示,同一批經驗指南全部塞入、按任務檢索,或完全不給記憶,會隨模型能力出現不同結果。把完整知識庫固定放進系統提示,可能只是在付更多 Token 費。

先釐清研究範圍:這裡的 memory 不是逐字重播對話,也不是把文件丟進向量資料庫。Agent 先執行任務,再由 ALTK-Evolve從成功與失敗軌跡抽出「有效策略、該避免的錯誤、邊界案例」,合併成指南;推論時才決定給完整集合或少量相關片段。模型權重沒有更新。

三種劑量,回答三個問題

設定Context 放什麼適合先驗證什麼
無記憶原始 Agent目前模型本來會多少
完整指南每一步都載入全部經驗強模型能否吸收長規則集
選擇性檢索固定核心加任務相關片段能否用低成本挑到關鍵經驗

研究以 AppWorld的互動式應用任務測試。作者觀察三種型態:仍有提升空間的強模型常從完整指南獲益;能力較弱的模型容易被大量規則淹沒,精選檢索較好;原本接近任務上限的模型則沒有可量測增益。參數量不是唯一解釋,任務分布、context 長度與指南品質也會改變結果。

這和一般AI Agent 架構設計裡的短期狀態、使用者偏好、業務知識不同。那些資料回答「目前發生什麼」;自我蒸餾指南回答「過去怎麼做比較不會失敗」。若不先分層,檢索器會把對話、文件與操作守則混成一袋,命中率再高也不一定可用。

成本差異比總分更值得看

IBM Research 報告,gpt-oss-120b 使用選擇性檢索後,任務完成率增加 16.1 個百分點,平均 Token 僅增加 5%;同一模型載入完整指南時,Token 增加 51%。DeepSeek-V3.2 用完整指南的 Token 增加 78%,但較嚴格的情境完成指標也有提升。這些都是作者在指定模型、資料集與指南產生流程下的結果,不能外推成產品承諾。

真正可移植的結論是:同時量品質與成本,別只看成功率。 完整指南若每個 ReAct step 都重送,費用來自輸入膨脹;固定前綴可搭配 prompt caching,但前綴順序一改,快取效益可能消失。團隊應記錄每題輸入 Token、工具步數、延遲、最終正確性與危險動作,而不是只比較平均分。

作者先前將 ALTK-Evolve 與 Agentic Context Engineering比較,也指出檢索方式會左右成本與效果;前一輪實驗因此不能直接替代你自己的資料。自我蒸餾還可能把錯誤經驗寫成規則,若沒有來源軌跡、人工覆核與版本回滾,記得更久反而更難除錯。

上線前用小型對照實驗

先從真實失敗工單整理固定測試集,分成需要歷史經驗、只需當下資訊、以及不該讀取記憶的負向題。對同一模型、工具權限與提示,分別跑無記憶、完整指南、精選檢索;每題重跑多次,觀察平均與最差結果。做法可接到Agent Skill 的有無對照評測,差別只在被測元件換成記憶策略。

若要自架 ALTK-Evolve,還要逐一確認程式庫授權、模型 API 或本機推論依賴,以及軌跡中是否含個資與秘密。公開研究結果不等於已替企業處理部署與法遵;無法保存完整軌跡的團隊,可先用人工審核的小型指南集驗證,不必急著建立自我寫入迴圈。

我不建議一開始就讓 Agent 自動把每次成功輸出永久寫入記憶。先限制可寫內容、保留產生軌跡與審核狀態,再設定淘汰與衝突規則。若選擇性檢索沒有優於一小段人工守則,先修資料與任務定義,不急著導入完整 memory framework。

常見問題

AI Agent memory 和 RAG 有什麼不同?

RAG 通常檢索外部知識,Agent memory 還可能包含執行經驗、使用者狀態與過往策略。兩者都能用檢索,但資料用途、保存期限與風險不一樣,應分開治理。

Agent 記憶放越多,回答會越準嗎?

不一定。過多指南可能增加干擾與 Token,較弱模型尤其可能用錯規則;應以同一任務集比較完整載入、選擇性檢索與無記憶基準。

怎麼知道 AI Agent 的記憶值得上線?

至少要在真實任務提高正確性或穩定度,負向題不亂讀記憶,且 Token、延遲與維護成本可接受。只展示一次成功案例不夠。

參考來源

№ · further reading

延伸閱讀