過去兩年我們給 AI 脈絡的方式都是文字:把東西貼進去、把規則寫下來、把資料整理成表格。2026 年下半年多了一條路——讓它自己去看。
三件事排在一起:6 月底 Claude in Chrome 正式推出,可以操作你已經登入的瀏覽器;7 月上旬桌面版加了內建瀏覽器分頁,它可以自己開文件、開設計稿、開你本機跑起來的網站;9 月初,macOS 上的電腦操作可以在背景進行,它在被你批准的應用裡做事,你繼續用別的視窗。
用講的 讓它看 「那個按鈕在右上角」 它自己截圖找 「我把錯誤訊息貼給你」 它自己打開頁面重現 「表格第三欄是金額」 它自己讀那張表
什麼時候讓它看比較省事
我的判斷很簡單:當「描述現況」比「看一眼」還費力的時候,就讓它看。
畫面上的東西尤其明顯。一個表單為什麼送不出去、一張報表哪一欄對不起來、某個網頁版面在手機上壞掉——這些用文字描述要寫十行,而且你描述的是你以為的狀況,不是實際狀況。讓它看,中間那層轉譯就消失了。
反過來,有兩種情況不該讓它看。第一種是規則類的東西:公司的規定、判斷的標準、什麼算做完,這些用文字寫下來才能被重複使用,用看的只是這一次。第二種是大量資料:整份試算表讓它讀畫面,遠不如把資料給它。
所以脈絡的分工變成這樣:規則用寫的、現況用看的、資料用給的。
官方自己列出的限制
這幾個功能都有明確的邊界,值得照抄一遍。
瀏覽器那條需要對應的方案與擴充功能,而且不支援 WSL,也沒有 API 可以接,只能互動式使用。macOS 的背景電腦操作需要系統 15 以上,方案限 Pro 或 Max。終端機裡的電腦操作是研究預覽,只在 macOS,而且要開輔助使用與螢幕錄製權限。
安全那幾條更該知道:它不是作業系統層級的沙箱,網路沒有被擋住;它讀到的螢幕內容會先做提示詞注入的檢查;終端機本身被排除在外,所以它看不到自己那場對話的輸出;同一時間只有一場對話能控制電腦;按 Esc 全域停止。
最後那句是重點:讓 AI 動你的滑鼠之前,先確定你知道怎麼叫停。
動手做
第一次用,挑一件唯讀的事:讓它打開你本機跑起來的頁面,描述它看到什麼,不要改任何東西。
需要它看畫面才能解的問題,用這段開場,重點是逼它先講看到什麼再動手:
我要你用瀏覽器看一個頁面並找出問題。規則: 1. 先只做觀察:打開頁面,描述你實際看到什麼,包含畫面上的文字與狀態, 不要推測,不要動任何按鈕。 2. 把你看到的跟我說的預期比對,列出不一致的地方。 3. 提出最多三個可能原因,各附「要怎麼驗證」的一句話。 4. 動手修改之前先停下來問我,不要自己按下去。 頁面:(網址或路徑) 我預期看到的:(描述)
要它跨到「會按下去」的階段之前,先把不可逆的動作講明白:付款、送出、刪除、對外發送,這幾類要先問過你。
做對了的樣子:你分得出哪些脈絡該用寫的、哪些該用看的;第一次用是唯讀的任務;你知道怎麼緊急停止;涉及送出或付款的畫面,它會先停下來問。
站內延伸
- 脈絡的六塊積木 → 像幫新人做入職簡報
- 讀網頁就等於被下指令的風險 → AI 被騙的三種方式
- 影像初判的落地做法 → 找方法AI 影像初判
來源: Claude Code:Claude in Chrome(方案與擴充功能需求、不支援 WSL、僅互動式);Claude Code:Computer use(研究預覽、macOS 限定、權限需求、非作業系統沙箱、螢幕內容做提示詞注入檢查、終端機排除、單一會話控制、Esc 停止);Claude Code:Desktop(內建瀏覽器分頁);週報 2026-w27、2026-w28、2026-w36(各功能上線時間與方案限制)。
它看得到畫面之後,脈絡分成三種給法:規則用寫的、現況用看的、資料用給的。該讓它看的判準是「描述現況比看一眼還費力」。但它不是沙箱、網路沒擋、螢幕內容要先過注入檢查,所以第一次挑唯讀的任務,並且先確認自己知道怎麼按停。
描述現況比看一眼還費力,
就讓它看
什麼時候看這張:你正要把畫面上的錯誤一行一行描述給它聽。
- 你描述的是你以為的狀況,不是實際狀況
- 它不是沙箱,網路沒被擋住,先確認怎麼叫停
- 第一次挑唯讀的事,看完就好不要動手
第一個動作挑一件唯讀的事讓它看畫面,要它先講看到什麼再停下來,不准按任何按鈕。按 Esc 可以隨時全域停止。