「別一次全塞給它」那篇寫的時候,視窗還是要省的東西。2026 年下半年,兩個數字變了。
第一,視窗變大且不加價。Claude 4.6 之後的模型全系列一百萬 token,一個 90 萬 token 的請求跟 9 千 token 的請求每個字同價。第二,快取變便宜。Fable 5.1 的快取讀取是原價的 0.025 倍,也就是你重複送同一段開頭,第二次起只付 2.5%。
讀者很自然會問:那還需要精簡嗎?把整個專案、整份手冊、整年的會議紀錄全塞進去,不就什麼都知道了?
答案是還是要,理由跟錢無關。
變的 沒變的
視窗:幾十萬 → 一百萬,同價 注意力:越多東西,每一條分到的越少
快取:原價 → 2.5% 退化:從幾萬字就開始,不用等到塞滿
擺法:放哪裡、怎麼寫,影響比份量大
研究說的:退化從幾萬字就開始
Chroma 在 2025 年 7 月發了一份叫 Context Rot 的研究,測了 18 個模型(Anthropic、OpenAI、Google、阿里的都有)。結論的第一句:「模型表現隨輸入長度顯著變化,即使在簡單任務上也是」。幾個具體發現:
問題跟答案的用字越不像,退化越快。同樣一段資料,你問的方式跟資料裡的寫法很接近,長輸入還撐得住;問法換個說法,一拉長就掉。
一個干擾項就有影響。資料裡混進一段「看起來相關但其實不是」的東西,準確度就降,而且有些干擾比別的更毒。Claude 系列在不確定時比較會說不知道,GPT 系列比較會自信地答錯。
連「照抄」都會出錯。叫模型複製一段重複的字、只在中間插一個不一樣的詞,序列越長,它越常漏掉或放錯位置。
他們的結論一句話:「重要的不是資訊有沒有在那裡,是它怎麼被呈現。」
這跟三層載入那篇講的「顧不顧得到」是同一件事,只是現在有 18 個模型的數據。視窗變大解決的是「裝不裝得下」,沒有解決「顧不顧得到」。
快取便宜改變的是什麼
快取便宜確實改變一件事:常駐的東西「每輪重付」的代價變小了。以前常駐檔 200 行的建議有一半是為了錢;現在錢的理由弱了,注意力的理由還在。
但快取有它的規則。Claude Code 的 /usage 現在會顯示快取命中率、miss 幾次、原因是什麼;改了工具定義、換了系統提示、對話被壓縮,快取就重建。訂閱方案的快取活一小時,用到額度外的時候降到五分鐘。也就是說「便宜」是有條件的:你的開頭要穩定不變,而且中間不能離開太久。
所以精簡的理由變成兩條。一是注意力,這條不會因為視窗變大而消失。二是穩定,常駐的東西越少、越不常改,快取越省。
實務上我的做法沒變:常駐檔只留原則和地圖,細節按需載入,長對話換題目就 /clear。多的是一個新習慣——一場對話開很久之後,看一眼 /context,如果對話歷史已經佔了大半,用 /rewind 的「從這裡摘要」把前半段壓掉,不要等它自己塞爆。
動手做
想知道自己現在一場對話塞了多少,Claude Code 打 /context,看常駐檔、工具定義、對話歷史各佔多少。打 /usage 看快取命中率,miss 多的話它會告訴你可能的原因。
有一份很長的東西一定要給 AI 的話,用擺法補救。貼這段:
我要給你一份很長的資料,但我知道長輸入會讓你漏看。請照這個順序處理: 1. 先只讀我的問題(在最後),用一句話複述你理解的問題。 2. 再讀資料,把跟問題直接相關的段落摘出來,附段落位置。 3. 只根據摘出來的段落回答;資料裡有看起來相關但其實不是的部分,列出來說明為什麼排除。 4. 不確定的地方說不確定,不要用資料以外的知識補。 資料:(貼上) 問題:(寫在最後)
做對了的樣子:你知道自己每次開場的常駐部分佔多少,而且它沒有因為「視窗變大了」而變長;長資料你會先問再貼,問題放最後;/usage 的快取命中率高,代表你的開頭穩定;一場對話開了一天,你會主動壓縮,不是等它塞爆。
站內延伸
來源: Chroma:Context Rot: How Increasing Input Tokens Impacts LLM Performance(18 個模型、問答相似度、干擾項、重複字實驗、「怎麼呈現比有沒有重要」);Anthropic:Pricing(1M 視窗同價、Fable 5.1 快取讀取 0.025 倍);Claude Code:Manage costs(/usage 快取統計、快取失效原因、訂閱一小時/額度外五分鐘)。
視窗變大解決的是裝不裝得下,沒解決顧不顧得到;18 個模型的數據說退化從幾萬字就開始。快取便宜讓錢的理由弱了,注意力和穩定的理由還在。常駐只留原則和地圖,長資料先問再貼、問題放最後。
裝得下,
不代表它顧得到
什麼時候看這張:它一次讀得下一百萬字了,你正想把整個專案全塞給它。
- 一份十八個模型的研究說,退化從幾萬字就開始
- 多塞一段看似相關其實無關的,它就答得比較差
- 重複送同一段開頭很便宜,但開頭一改就重算
第一個動作把下一份很長的資料倒過來貼:資料放前面,你要問的問題寫在最後一行。打 /context 看一眼佔用。