跳到主要內容
← 回找觀念
第一架構:思維轉型與任務定義|第 6 篇

視窗一百萬字、快取變便宜,為什麼還要精簡

2026 年兩件事同時發生:主流模型的視窗都到一百萬 token 且不加價,Fable 5.1 的快取讀取降到原價的 2.5%。很容易得出「塞就對了」的結論。但 Chroma 對 18 個模型的研究說,退化從幾萬字就開始,重點不是裝不裝得下,是怎麼擺。

2026-09-08 發布 · 2026-09-16 更新 · 作者整理:Lucas · 資安審稿後整理
資安審稿註記:本文已把「保證安全」「最強防線」等過度承諾改成保守表述;凡涉及金鑰、權限、刪除、提交、外部發送與自動化執行,均保留人工確認、沙盒或測試環境前提。

「別一次全塞給它」那篇寫的時候,視窗還是要省的東西。2026 年下半年,兩個數字變了。

第一,視窗變大且不加價。Claude 4.6 之後的模型全系列一百萬 token,一個 90 萬 token 的請求跟 9 千 token 的請求每個字同價。第二,快取變便宜。Fable 5.1 的快取讀取是原價的 0.025 倍,也就是你重複送同一段開頭,第二次起只付 2.5%。

讀者很自然會問:那還需要精簡嗎?把整個專案、整份手冊、整年的會議紀錄全塞進去,不就什麼都知道了?

答案是還是要,理由跟錢無關。

變的                          沒變的
視窗:幾十萬 → 一百萬,同價    注意力:越多東西,每一條分到的越少
快取:原價 → 2.5%              退化:從幾萬字就開始,不用等到塞滿
                               擺法:放哪裡、怎麼寫,影響比份量大

研究說的:退化從幾萬字就開始

Chroma 在 2025 年 7 月發了一份叫 Context Rot 的研究,測了 18 個模型(Anthropic、OpenAI、Google、阿里的都有)。結論的第一句:「模型表現隨輸入長度顯著變化,即使在簡單任務上也是」。幾個具體發現:

問題跟答案的用字越不像,退化越快。同樣一段資料,你問的方式跟資料裡的寫法很接近,長輸入還撐得住;問法換個說法,一拉長就掉

一個干擾項就有影響。資料裡混進一段「看起來相關但其實不是」的東西,準確度就降,而且有些干擾比別的更毒。Claude 系列在不確定時比較會說不知道,GPT 系列比較會自信地答錯。

連「照抄」都會出錯。叫模型複製一段重複的字、只在中間插一個不一樣的詞,序列越長,它越常漏掉或放錯位置。

他們的結論一句話:「重要的不是資訊有沒有在那裡,是它怎麼被呈現。」

這跟三層載入那篇講的「顧不顧得到」是同一件事,只是現在有 18 個模型的數據。視窗變大解決的是「裝不裝得下」,沒有解決「顧不顧得到」。

快取便宜改變的是什麼

快取便宜確實改變一件事:常駐的東西「每輪重付」的代價變小了。以前常駐檔 200 行的建議有一半是為了錢;現在錢的理由弱了,注意力的理由還在

但快取有它的規則。Claude Code 的 /usage 現在會顯示快取命中率、miss 幾次、原因是什麼;改了工具定義、換了系統提示、對話被壓縮,快取就重建。訂閱方案的快取活一小時,用到額度外的時候降到五分鐘。也就是說「便宜」是有條件的:你的開頭要穩定不變,而且中間不能離開太久

所以精簡的理由變成兩條。一是注意力,這條不會因為視窗變大而消失。二是穩定,常駐的東西越少、越不常改,快取越省。

實務上我的做法沒變:常駐檔只留原則和地圖,細節按需載入,長對話換題目就 /clear。多的是一個新習慣——一場對話開很久之後,看一眼 /context,如果對話歷史已經佔了大半,用 /rewind 的「從這裡摘要」把前半段壓掉,不要等它自己塞爆。

動手做

想知道自己現在一場對話塞了多少,Claude Code 打 /context,看常駐檔、工具定義、對話歷史各佔多少。打 /usage 看快取命中率,miss 多的話它會告訴你可能的原因。

有一份很長的東西一定要給 AI 的話,用擺法補救。貼這段:

我要給你一份很長的資料,但我知道長輸入會讓你漏看。請照這個順序處理:
1. 先只讀我的問題(在最後),用一句話複述你理解的問題。
2. 再讀資料,把跟問題直接相關的段落摘出來,附段落位置。
3. 只根據摘出來的段落回答;資料裡有看起來相關但其實不是的部分,列出來說明為什麼排除。
4. 不確定的地方說不確定,不要用資料以外的知識補。
資料:(貼上)
問題:(寫在最後)

做對了的樣子:你知道自己每次開場的常駐部分佔多少,而且它沒有因為「視窗變大了」而變長;長資料你會先問再貼,問題放最後;/usage 的快取命中率高,代表你的開頭穩定;一場對話開了一天,你會主動壓縮,不是等它塞爆。

站內延伸

來源: Chroma:Context Rot: How Increasing Input Tokens Impacts LLM Performance(18 個模型、問答相似度、干擾項、重複字實驗、「怎麼呈現比有沒有重要」);Anthropic:Pricing(1M 視窗同價、Fable 5.1 快取讀取 0.025 倍);Claude Code:Manage costs/usage 快取統計、快取失效原因、訂閱一小時/額度外五分鐘)。

視窗變大解決的是裝不裝得下,沒解決顧不顧得到;18 個模型的數據說退化從幾萬字就開始。快取便宜讓錢的理由弱了,注意力和穩定的理由還在。常駐只留原則和地圖,長資料先問再貼、問題放最後。

第一架構 · 第 6 篇 · 長資料怎麼給

裝得下,
不代表它顧得到

什麼時候看這張:它一次讀得下一百萬字了,你正想把整個專案全塞給它。

只給重點整包塞給它原則和地圖長資料先問再貼整年紀錄全塞
  • 一份十八個模型的研究說,退化從幾萬字就開始
  • 多塞一段看似相關其實無關的,它就答得比較差
  • 重複送同一段開頭很便宜,但開頭一改就重算

第一個動作把下一份很長的資料倒過來貼:資料放前面,你要問的問題寫在最後一行。打 /context 看一眼佔用。

2026-09-16 查證稜線 Ridgeline
← 看更多觀念總論
取得 AI 實戰工具與更新

之後會不定期整理:新方法、指令包(Prompt Pack)、Checklist 與模板。免費、無廣告;送出後會收到一封確認信,點了連結才算訂閱成功,之後每封信都附一鍵退訂。