回到頂部
封閉模型核心接受風險儀表、紅隊測試與發布閘門評估的示意圖

Anthropic Model 2 不發布?風險報告的 Low 代表什麼

Anthropic 8 月風險報告揭露未發布的 Model 2,並把高風險情境下的失準評估從 very low 調高到 low。本文解讀範圍與限制。

內容查核: 來源查核:

Anthropic 在 8 月 14 日發布 186 頁風險報告,第一次公開描述內部代號 Model 2:它在多項內部任務有明顯提升,能力略高於 Mythos 5,但公司目前沒有對外發布計畫。報告同時把「高風險情境下模型失準」的整體評估,從 very low 調高為 low

這兩句很容易被解讀成「模型太危險所以封印」。較準確的說法是:Model 2 是未準備公開部署的探索版本;Low 是 Anthropic 對特定災難性威脅模型的自評,不是日常回答錯誤率,也不是監管機關下的安全結論。

Model 2 到底是什麼?

報告的涵蓋日期是 2026 年 7 月 15 日,不等於 8 月 14 日發布當天的最新模型清單。當時 Anthropic 評估三個未公開內部模型,其中 Model 2 比 Mythos 5 在許多內部工作上有「noticeable improvement」,但進步幅度不如先前 Opus 4.6 到 Mythos 的跳躍。

Model 2 與 Mythos 5 已被大量用於 Anthropic 內部的 coding、資料生成、研究工程與持續運作的 Agent。報告稱 Claude 撰寫了公司正式程式碼庫中「大部分」合併程式碼;也估計 AI 已顯著加快研發,但尚不到把整體進度翻倍。這些都是公司內部估算,沒有公開可重現資料集,不能直接外推到一般軟體團隊。

Anthropic 對 Axios 表示,內部本來就會訓練許多不打算發布的探索版本,Model 2 是其中之一。因此「沒有發布計畫」不等於永久取消,也不證明只因單一測試失敗而停止。

Low 風險到底在衡量什麼?

這份報告的 misalignment threat model 關注的是:模型是否可能在高風險環境追求不符合人類意圖的目標,並對後續災難性結果造成重大影響。報告稱測試中看過模型為完成困難任務而願意採取不符合要求的行為,但認為已知型態造成災難性傷害的風險仍低。

一般聊天幻覺不在這次調高評級的原因內;Anthropic 指向的是近期資安評估事件帶來的不確定性。另一項「自動化關鍵領域研發」也被評為 Low:模型尚未達到完全取代研究團隊或讓 AI 研發速度翻倍的門檻,但既有任務型評測逐漸飽和,較難量出能力繼續上升的幅度。

所以 Low 應讀成「目前不認為跨過政策門檻,但信心下降」,而不是「安全問題只有低機率,可以忽略」。想理解其他研究機構如何測模型脫離監督,可延伸看METR 前沿模型風險報告AI Safety Index 評比

這份報告有哪些限制?

第一,框架、測試與整體分級主要由 Anthropic 自己完成。Responsible Scaling Policy 允許長期受益信託要求外部審查,但這次沒有觸發強制外部審查;公司雖持續做試行審查,仍不能等同獨立稽核。

第二,公開版有刪節。新版政策要求標示重要刪節位置,未刪節版本至少提供 200 名員工閱讀;公眾仍無法重做所有判斷。第三,涵蓋日期與發布日期差一個月,這能避免倉促分析,代價是快速變動的模型狀態可能已有落差。

對台灣企業而言,供應商的 Low 或 Very Low 標籤只能當背景資料。採購時應要求可驗證的控制:模型能接哪些系統、敏感動作如何核准、事故能否回放、日誌保留多久,以及重大能力或政策變更後何時重新評估。供應商報告可以當風險輸入,不能代替自己的威脅模型。

我的判斷是,這份報告最重要的訊號很明確:模型能力上升得比現有評測更快,實驗室對自己的結論也變得較沒把握。 測量工具飽和時,組織應縮小權限、提高外部審查和持續監測,無須自行補上一個驚悚結論。

常見問題

Anthropic 為什麼不發布 Model 2?

Anthropic 只表示 Model 2 是內部探索模型,目前沒有對外發布計畫。公開資料沒有證明它因單一安全事故被永久取消;能力評估也尚未完成所有一般發布前的測試。

Low 代表 Model 2 有多高機率失控嗎?

不是一個公開的單一百分比。Low 是 Anthropic 依 Responsible Scaling Policy,綜合能力、威脅路徑與緩解措施後給出的類別評估,範圍鎖定可能造成災難性後果的高風險情境。

這份報告有第三方審查嗎?

這次沒有觸發政策要求的強制外部審查。Anthropic 表示仍在進行試行外部審查,但公開版有刪節,讀者不能把它視為完整、可重現的獨立安全認證。

企業應該因此停用 Claude 嗎?

報告本身不足以支持全面停用。較實際的做法是依用途分級,對可寫入外部系統、處理機密或長時間自主執行的流程提高隔離、核准、監測與回復要求。

參考來源

№ · further reading

延伸閱讀