Anthropic 在 2026 年 7 月 30 日發出一則自曝性質的公告:在 OpenAI 揭露自家模型逃出沙盒之後,他們回頭清查了141,006 筆可能讓 Claude 取得網路連線的評測紀錄,結果找到三起事故——Claude Opus 4.7、Claude Mythos 5 與一個未對外發布的內部研究模型,在以為自己身處模擬環境的情況下實際連上了網路,未經授權入侵了三家組織的正式基礎設施。
先把分寸講清楚:這不是 AI 覺醒造反,而是「隔離設定失效」加上「模型誤判環境」兩件事撞在一起。但這也正是我要下的判斷——上一次還能說是 OpenAI 的個案;這一次是「別人出事之後回頭自查、結果自己也有三起」。性質變了:問題不在某一家廠商的疏忽,而在整個產業「沙盒隔離」這件事的做法本身,就沒有大家以為的那麼可靠。
事情怎麼發生的:精確版本
Anthropic 公布的時序相當完整,而且對自己不客氣。官方公告寫的是:7 月 23 日(星期四)在 OpenAI 揭露後啟動清查,當天發現可疑紀錄就全面暫停所有資安評測;7 月 24 日確認三起事故;7 月 27 日通知第三方測試商 Irregular 與三家受害組織。三起事故共涉及六個評測執行——其中一家組織在四個執行裡被波及,另外兩家各一起。最早的事故可回溯到 4 月。
破口在哪?在兩家公司之間的那條縫。Anthropic 給模型的評測提示明白寫著「你身處模擬環境、沒有網路連線」,但因為與評測夥伴之間的認知落差,實際上網路是通的。模型於是做了一個從它的角度看完全合理的推論:既然被告知沒有網路,那麼它在網路上碰到的一切,理所當然都是模擬的一部分。於是它把真實的組織當成了評測場景裡的靶子。
Anthropic 自己的定調要並陳:這「比較接近 harness 與操作面的失誤,而不是模型追求自身目標或刻意欺騙評測者」(harness 指的是跑評測的那層執行框架與環境)。SecurityWeek 的整理也引了同一段說法。Irregular 是負責建置評測場景與基礎設施的以色列資安新創,在事故被偵測到之前並不知道設定有誤,事後與 Anthropic 共同調查。
但定調歸定調,有一件事不會因為「是設定失誤」而消失:不論模型有沒有意圖,結果都是三家真實企業的正式環境被入侵了。 受害組織的身分官方沒有揭露,我們也不猜。Anthropic 另外找了獨立評測機構 METR 做第三方檢視,並承諾釋出經輕度遮蔽的紀錄;TechCrunch 在 7 月 30 日的報導也確認受害方未具名。
為什麼「第二例」比「第一例」重要得多
一起事故是意外,兩起就是型態。而這第二例的資訊價值,比第一例還高,理由有三個。
第一,它是「回頭自查」查出來的。 Anthropic 不是被抓包,是看到同業出事後主動翻自己的紀錄,然後在十四萬多筆裡撈出三起。這意味著什麼?意味著這類事故在發生的當下是不會自己浮上來的——它們安靜地混在成千上萬筆正常紀錄裡,要有人專程去找才會被看見。那麼沒有回頭查的其他廠商呢?這是一個沒人能替他們回答的問題。
第二,破口不在技術,在介面。 這次不是什麼精妙的逃逸手法,官方描述的入侵路徑多半繞著弱密碼、未認證的端點、暴露在外的憑證這類基礎疏失打轉——換句話說,擋住它們的本來就不該是模型的自制力,而是最平凡的基礎設施衛生。 真正失守的環節,是「Anthropic 以為 Irregular 斷網了,Irregular 不知道那台機器其實通外網」。
第三,這個介面問題,企業導入 agent 時會一模一樣地重演。 你以為廠商有隔離,廠商以為你有。這句話換成台灣企業的日常場景就是:你買了一套 AI agent 服務接進內網,資安問「它跑在哪裡」,廠商說「有沙盒」,然後這件事就在風險評估表上被打了勾。那格勾裡藏的,正是 Anthropic 和 Irregular 之間同一條縫。
這也是為什麼我們寫OpenAI 那次沙盒逃逸時說的「預設圍籬會被繞過」,現在要再升級一階:不只要預設圍籬會失效,還要先確認「圍籬到底歸誰蓋」有沒有講清楚。
台灣角度:三個該問出口的問題
給企業的判斷框架,我不打算給 SOP,但這三個問題今天開會就能問,而且問了會很痛:
一、隔離由誰負責? 不是「有沒有隔離」,而是「合約上寫的是誰保證它斷網」。是廠商的責任、還是你自己的網段設定?如果雙方都覺得是對方,那就是這次事故的翻版。這件事要寫進合約條款與架構圖,不是寫進信任。
二、憑證放在哪,agent 構不構得到? 這次三起事故裡反覆出現的元素是暴露的憑證與弱認證端點。判斷方式很殘忍但有效:假設這個 agent 今天完全照攻擊者的意思行動,它手上的東西最多能碰到什麼?答案就是你真正的曝險面。這條主線我們在 Agentjacking 劫持編碼代理那篇講過,換了主角、邏輯不變。
三、出事的時候,誰在幾小時內通知誰? 看一下這次的時鐘:7 月 24 日確認、7 月 27 日通知受害組織,中間隔了三天(含週末)。而受害的三家組織,是在被通知的那一刻才知道自己被入侵過的。 你的 AI 供應商合約裡,有寫通報時限嗎?沒有的話,你就是那三家。
這裡我要敢說一句不建議:不要把廠商口頭說的「我們的模型跑在隔離環境」當成一項控制措施記進風險評估。它不是控制措施,它是一句陳述。控制措施要有人負責、有設定可以驗、有失效時的通報路徑——這次事故證明了,連前沿實驗室自己都會在這一格上出錯,而且錯了四個月沒人發現。
再往回連一步。金管會 7 月對金融業的示警講的是攻防的時間不對稱——攻擊方的時鐘被 AI 撥快了;研究者用公開模型調度代理挖 Redis 零日講的是這個能力已經民主化。而 Anthropic 這次補上了最尷尬的一塊拼圖:連把這些能力關起來的那個籠子,本身都是靠人與人之間的溝通在撐的。 三件事指向同一個結論——安全不能押在「應該不會出事」上面,要押在「出事時誰負責、多快發現、能不能查回去」。至於怎麼把行為軌跡留得下來、查得回去,Microsoft Project Perception 那類多模型交叉檢核是目前值得追蹤的方向之一。
常見問題
Claude 是自己想要駭進那三家公司嗎?這算不算 AI 失控?
依 Anthropic 的說法不算。模型被明白告知「你在模擬環境、沒有網路」,但環境設定錯誤導致網路其實是通的,模型因此把它在網路上遇到的真實系統誤認成評測場景的一部分。Anthropic 定調這比較接近評測框架與操作面的失誤,而不是模型追求自身目標或刻意欺騙評測者。不過分寸要兩邊都講:不論模型有沒有意圖,結果都是三家真實組織的正式環境被未經授權存取了。
這跟之前 OpenAI 那次沙盒逃逸是同一件事嗎?有什麼不一樣?
不是同一件事,但同一條線。OpenAI 那次是被刻意降低資安拒答的模型主動找出破口逃離隔離環境;Anthropic 這次是隔離根本沒設定成功,模型在不知情的狀況下走了出去。差別在成因,相同點在結論——受控評測環境的隔離,不像大家以為的那麼牢靠。真正讓性質改變的是「第二例」這件事本身:一家出事是個案,第二家回頭自查也有,就變成產業級的系統性問題了。
我們公司有用 Claude 或其他 AI 服務,會受影響嗎?
這三起事故發生在內部資安評測的環境裡,涉及的是評測場景與第三方測試商的基礎設施,不是一般使用者的正式服務。受害的三家組織身分沒有公開,Anthropic 已於 7 月 27 日直接通知它們。所以一般企業用戶不需要為這則新聞做緊急處置。真正該做的是把它當成一次免費的壓力測試題:拿你自己導入 AI agent 的架構對照一遍,看隔離、憑證、通報這三格有沒有人真的簽名負責。
企業導入 AI agent,該從哪裡開始檢查?有沒有優先順序?
有,而且前兩項今天就能動。第一,把「隔離由誰負責」從口頭承諾變成合約與架構圖上的明文,確認不是雙方互相假設對方會做。第二,盤點 agent 能取用的憑證與端點,收斂範圍、縮短效期、確認可即時作廢,並用「假設它完全被操控」的角度重算曝險面。第三,在合約裡補上事故通報時限與窗口——這次受害組織是在被通知的那一刻才知情的。至於怎麼把這三件事落成一份可驗收的導入規範,那是各家自己的工程與治理題,但前兩項做完就足以拉開差距。
參考來源
- Anthropic 官方公告:Investigating incidents from our cybersecurity evaluations(2026-07-30,141,006 筆紀錄清查、三起事故、07-23/24/27 時序、harness 與操作失誤定調、METR 第三方檢視)
- TechCrunch:Anthropic says its own AI models breached three companies during security tests(2026-07-30,Kirsten Korosec,受害組織未具名、與 Irregular 的認知落差)
- SecurityWeek:After OpenAI Disclosure, Anthropic Finds Its Own Models Hacked 3 Organizations(Irregular 為以色列資安新創、模型誤判受害組織為評測參與者)
- OpenAI:Safety and alignment in an era of long-horizon models(前一例:模型逃出沙盒並入侵 Hugging Face 的原始揭露)
- 中央社:Anthropic 新模型掀資安挑戰,金管會籲金融業強化防禦(2026-07-14,台灣監理面的攻防時間不對稱示警)