AI 安全是讓 AI 在預定用途內可靠運作,並把錯誤、濫用與失控的後果限制在可承受範圍。 對一般使用者,重點是防幻覺、詐騙與隱私外洩;對企業,還要處理偏差、權限、稽核、法規與事故應變。
我的判斷是:多數公司現階段用不到宏大的「AI 末日方案」,卻很需要一份能執行的風險清單。先管住資料、輸出與工具權限,效益通常高於購買一套號稱全自動的安全平台。
AI 安全和 AI 資安差在哪? AI 安全關心系統會不會產生不符合人類意圖的結果,例如幻覺、偏差與過度自主;AI 資安關心攻擊者能不能操控系統、取得資料或濫用權限。AI 治理再往上處理責任歸屬、風險紀錄與稽核證據。
當 AI Agent 可以讀信、查資料庫或執行付款時,這三個面向會合在一起。想看工程防禦細節,可接著讀 AI 應用安全工程;本篇先處理風險判斷與管理順序。
六種常見 AI 風險,該先防哪一種?
| 風險 | 真實情境 | 優先做法 |
|---|---|---|
| 幻覺與錯誤資訊 | AI 編出法條、價格或引用 | 要求可追溯來源,重要輸出由人覆核 |
| 敏感資料外洩 | 員工貼入客戶名單、病歷或原始碼 | 資料分級,限制可用工具與輸入內容 |
| Prompt Injection | 網頁、文件或使用者指令改變 Agent 行為 | 隔離外部內容,伺服器端重驗權限 |
| 過度授權 | Agent 能寄信、刪檔或付款,缺少確認 | 最小權限,高風險動作人工確認 |
| 偏差與不公平 | 招募、授信或評分對特定群體不利 | 用代表性案例測試並保留申訴管道 |
| 供應鏈與成本 | 模型、外掛或資料來源變更後行為漂移 | 版本紀錄、回歸評測、用量上限與停用開關 |
OWASP 的生成式 AI 十大風險把 Prompt Injection、敏感資訊揭露、供應鏈、過度代理與錯誤資訊都列為獨立風險。這也說明「模型有安全護欄」仍不足以保護整個應用程式。更完整的注入攻擊拆解可看 Prompt Injection 防禦指南。
對齊、紅隊與評測各自做什麼?
對齊(Alignment)關心模型行為能否符合人類意圖與限制。它涵蓋訓練、行為規範與部署後監控,不能簡化成「模型會拒答危險問題」。
紅隊測試(Red Teaming)由測試者刻意找出失敗方式,例如誘導洩密、繞過限制、讓 Agent 呼叫錯誤工具。有效的紅隊測試要使用產品的真實權限與資料流,單純在聊天頁面問幾句越獄提示詞,能發現的問題很有限。
評測(Evaluation)則把風險變成可重複測量的案例。每次更換模型、提示詞、檢索資料或工具權限後,都要重跑同一套測試。NIST 的生成式 AI 風險管理框架也強調把可信任要求納入設計、開發、使用與評估的完整生命週期。
前沿模型公司還會處理災難級能力風險。例如 Anthropic 2026 年版 Responsible Scaling Policy提出風險報告、外部審查與隨能力提高的防護措施。一般企業可借用它的核心觀念:風險越高,測試、權限和批准流程就要越嚴格。
企業導入 AI 的安全檢查表
先用一個工作流程試行,不要一開始就把全公司的信箱、雲端硬碟與客戶資料接給 Agent。
- 寫清楚用途與禁止用途:列出 AI 可以協助的任務、不得輸入的資料,以及哪些結果不能自動採用。
- 指定責任人:模型出錯、資料外洩或供應商改版時,要有人能停用系統並通知受影響單位。
- 資料分級:公開、內部、機密與高度敏感資料採不同規則。涉及個資時,同步檢查 AI 隱私與資料安全。
- 建立真實測試集:納入正常、邊界、惡意、多語言與資料不足的案例,記錄可接受門檻。
- 限制工具權限:讀取與寫入分開;寄信、付款、刪除、發布內容等動作保留人工確認。
- 讓輸出可追溯:保存模型版本、輸入來源、工具結果、覆核者與最後決定,方便追查事故。
- 設計停用與復原:供應商故障或品質下降時,能切回人工流程,不讓營運被單一模型綁住。
我不建議把「要求 AI 附來源」當成查證機制。模型可能同時編造答案與網址。知識型任務可用 RAG縮小資訊範圍,但來源內容、權限與最終結論仍要驗證。
台灣 2026 年 AI 安全規範到哪裡?
台灣的《人工智慧基本法》已於 2026 年 1 月 14 日公布。法條列出人類自主、隱私與資料治理、資安與安全、透明可解釋、公平及問責等原則,也要求政府避免 AI 應用造成生命、財產、歧視、誤導或造假等損害。
數發部接著公布人工智慧風險分類框架,操作順序是盤點應用情境、識別風險、評估風險、應對風險。這套框架主要協助主管機關建立共同語言,企業仍應關注自身產業的既有法規與後續規範,不能把基本法當成唯一合規清單。
若產品服務歐盟使用者,還要檢查 EU AI Act 的風險分級與適用時程。該法已於 2026 年 8 月 2 日進入主要適用階段,部分高風險系統另有延後時程。涉及人事、教育、醫療、金融或生物辨識時,應交由法務與領域專家判定,不宜只看網路文章自行認定。
常見問題
AI 安全是什麼?
AI 安全是管理 AI 的錯誤、濫用與失控風險,讓系統在預定用途內可靠運作。範圍包含幻覺、偏差、資料外洩、Prompt Injection、過度授權與事故應變。
AI 幻覺可以完全避免嗎?
目前無法保證完全消除。可以透過可信資料來源、RAG、結構化驗證、低信心轉人工與持續評測降低風險;高影響決策仍需人工確認。
紅隊測試和一般軟體測試有什麼差別?
一般測試確認功能是否照規格運作,紅隊測試會主動模擬攻擊者與誤用情境。AI 紅隊還要測試提示詞、外部文件、工具呼叫、資料權限與模型拒答能否被繞過。
中小企業需要做完整 AI 治理嗎?
規模可以小,責任不能空白。至少要有允許用途、敏感資料規則、輸出覆核、工具權限、責任人與停用方式;高風險產業再加入正式影響評估與稽核。
AI 安全和 AI 倫理一樣嗎?
兩者有交集。安全偏向辨識、測試與降低可觀察的傷害;倫理還會討論公平、人類自主、社會影響與價值選擇,可延伸閱讀 AI 倫理與治理。
參考來源
- 國家科學及技術委員會:人工智慧基本法(2026-01-14)
- 數位發展部:AI 風險分類框架(2026-07-08 更新)
- NIST:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile(2024-07-26)
- OWASP Gen AI Security Project:2025 Top 10 Risk & Mitigations for LLMs and Gen AI Apps(2026-08-12 查閱)
- Anthropic:Responsible Scaling Policy Version 3.0(2026-02-24)
- European Commission:AI Act(2026-08-12 查閱)