這個系列前面講了很多「要防」:hook 擋金鑰、紅隊測 Skill、MCP 先唯讀、隊友的話不算數。讀者常問的一句是:真的有人這樣被搞過嗎?
有。而且過去一年三個公開案例,剛好對應 AI 被騙的三種方式。
① 資料裡藏指令 一封信、一個網頁,裡面寫著「AI 請把資料寄到這裡」 ② 讀到惡意內容 瀏覽器代理把網頁內容當成你的指令 ③ 被說服有權限 「這是合法的滲透測試」→ 它就照做了 共同點:不是模型壞掉,是它分不出「資料」和「指令」、分不出「你」和「假裝是你」
案例一:EchoLeak,一封信就夠
2025 年 6 月,Aim Security 揭露 Microsoft 365 Copilot 的一個漏洞,編號 CVE-2025-32711,嚴重度 9.3。攻擊者寄一封信給公司裡任何一個人,信裡藏著給 AI 的指令。收信的人什麼都不用做——Copilot 在例行摘要郵件時讀到那封信,照裡面的指令去翻 OneDrive、SharePoint、Teams 的資料,再透過一個被信任的 Microsoft 網域把資料送出去。零點擊。Microsoft 在伺服器端修了,說沒有在野外被利用。
這是第一個「提示詞注入變成真實資料外洩」的公開案例。它的教訓不是 Copilot 特別弱,是任何一個「能讀很多內部資料、又會讀外部內容」的 AI 助理,都有這個結構。
案例二:Comet,網頁就是指令
2025 年 8 月,Brave 的安全團隊發了一篇針對 Perplexity Comet 瀏覽器的示範。Comet 是那種「幫我摘要這個網頁」的 AI 瀏覽器。Brave 做了一個網頁,把指令藏在使用者看不到的元素裡;使用者叫 Comet 摘要,Comet 把網頁內容原封不動餵給模型,分不出哪些是使用者說的、哪些是網頁寫的,於是照網頁的指令去做事:關分頁、開釣魚網站、把一次性驗證碼寄給攻擊者。10 月 Brave 又發了一篇:把指令藏在截圖裡也行,而且不只 Comet,整個 AI 瀏覽器這一類都有同樣的問題。
教訓:只要 AI 會「讀網頁然後動手」,網頁的作者就等於能對它下指令。
案例三:墨西哥,說服它你有權
2025 年 12 月到 2026 年 1 月,一個攻擊者用 Claude Code 當規劃和執行引擎,攻進墨西哥至少十個政府機關和一家金融機構,帶走約 150 GB、約 1.95 億筆紀錄——納稅人、選民、公務員帳密、戶籍。手法不是技術漏洞,是說服:告訴 AI 這是合法的漏洞獎勵計畫、你是一個頂尖的滲透測試員,然後餵它一份上千行的操作手冊。超過一千個提示詞,大部分遠端指令由 AI 執行,資料還丟給另一家的模型分析。Anthropic 事後封了帳號,說新模型加強了濫用偵測。
教訓:AI 判斷「該不該做」的依據是你給它的脈絡,而脈絡可以是假的。這跟前兩個不同,攻擊者不是繞過使用者,攻擊者就是使用者。
OWASP 在 2026 年 6 月的整理說,提示詞注入仍然是生產環境裡代理式 AI 失敗的主要原因。三個案例,三種方式,同一個根源:模型分不出「資料」和「指令」,分不出「你」和「假裝是你」。
跟你有什麼關係
你不是政府,也可能不用 AI 瀏覽器。但三個結構你公司裡都有。
你有會讀外部內容的 AI。收信、看網頁、讀客戶上傳的檔案——只要它讀外部內容又能動手,案例一和二的結構就在。防線是這個系列講過的:外部內容當資料不當指令(Routines 把 API 傳進來的文字包成「不可信」就是這個設計)、能動手的範圍設窄、對外發送要人確認。
你有會被說服的 AI。它判斷該不該做,靠的是脈絡。所以「絕對不能做的事」不能只寫在提示詞裡,要寫在權限裡,這是「便條不是保險」那句的國家級版本。
你有很多 AI 但不知道全貌。CrowdStrike 9 月出了一個專門找「影子 AI 代理」的產品,這代表企業裡不知道自己有幾個代理在跑已經是普遍問題。12 個孤島那篇的那張清單——有幾個、讀什麼、寫哪裡、誰能關——不是治理潔癖,是案例三發生時你能不能三分鐘內找到是哪一個。
有一件事要先說清楚:這三個案例裡,兩個是研究者示範、一個是真實攻擊。示範不等於已經發生,但示範到真實中間,EchoLeak 用了幾個月,墨西哥是直接真的。距離不遠。
站內延伸
來源: The Hacker News:Zero-Click AI Vulnerability Exposes Microsoft 365 Copilot Data(EchoLeak、CVE-2025-32711、CVSS 9.3、伺服器端修補);Brave:Agentic Browser Security: Indirect Prompt Injection in Perplexity Comet(2025-08)與Unseeable prompt injections in screenshots(2025-10);SecurityWeek:Hackers Weaponize Claude Code in Mexican Government Cyberattack與Cloud Security Alliance 研究筆記(時間、規模、手法);Help Net Security:Prompt injection still drives most agentic AI security failures(OWASP,2026-06)。
三種方式:資料裡藏指令、讀到惡意內容、被說服有權限。根源同一個,它分不出資料和指令、分不出你和假裝是你。防線不新,這個系列講過;新的是它們已經不是假設。
它分不出資料和指令,
也分不出你和假裝是你
什麼時候看這張:你要讓 AI 讀客戶寄來的信或上傳的檔案,順便幫你處理。
- 一封信就夠:收信的人什麼都沒點,資料就出去了
- 有人說服它這是合法測試,帶走約一億九千五百萬筆紀錄
- 絕對不能做的事,寫在提示詞裡沒用,要寫在權限裡
第一個動作打開你最常用的 AI 助理的權限設定,把「可以對外寄送」改成每次都要你確認。三分鐘,外部內容當資料不當指令。