在與 AI 協作的軟體開發世界裡,大眾最容易陷入的盲區,就是所謂的「唯模型論」。每當新一代模型發布,不論是 Fable 5、Opus 5 或是 GPT-5.6,社群便會掀起一陣狂熱,人們紛紛討論著新模型的 Benchmark 又拉高了多少分,並期望換上新腦袋後,原本棘手的 Bug 或複雜的專案就能自動煙消雲散。然而,當你興沖沖地把舊模型換成最新、最強的模型時,卻常常發現 AI 依然會犯下愚蠢的錯誤:它依舊會漏看檔案、依舊在修改 A 檔案時搞壞不相干的 B 模組,甚至在遇見錯誤 Log 時陷入原地打轉的當機狀態。
這時,你必須大腦開機,理解一個軟體工程級別的痛徹體悟:大語言模型(Model)並不等於系統本身。它只是一個聰明、會說話,卻沒有手腳、沒有約束、也沒有環境適應力的「裸腦」。Google 與 OpenAI 團隊在進行大規模 Agent 實踐時,為業界確立了一個極具指導意義的全新公式:Agent (代理) = Model (大語言模型) + Harness (工作環境)。
決定 AI 最終交出的是 60 分垃圾還是 90 分成品的,往往不是底層那顆大腦,而是你為這顆大腦量身打造的 Harness(工作環境與基礎建設)。
+-----------------------------------------------------------------+ | AGENT CORE FORMULA | +-----------------------------------------------------------------+ | | | Agent (代理) = Model (大腦) + Harness (工作環境/基礎設施) | | | | - Model : 負責理解語意、進行邏輯推理。 (你無法控制) | | - Harness : 負責給予工具、施加約束、建立自我修正閉環。 (可控制) | | | +-----------------------------------------------------------------+
實戰步驟一:擺脫「唯模型論」的迷思:重新認識 Harness 決定行為的本質
當你手邊的 AI Agent 出現不盡人意的行為時,不要急著去更換模型。請先像個資深的工廠經理一樣,審視你提供給它的 Harness 是否出了問題:
認知到 Harness 是你唯一能完全掌控並投資的領地:底層模型是由 OpenAI 或 Anthropic 等大廠開發的,你無法控制它們什麼時候改版、什麼時候變聰明或變笨,那是一片你無法干涉的外部土地。但 Harness——包含你為專案撰寫的 CLAUDE.md、你配置的自動化測試套件、你劃定的安全沙盒(Sandbox),以及你所建立的錯誤回饋機制,全部都是存在於你本地或專案版本控制(Git Version Control)裡的私有資產。這是一份隨著時間推移,會不斷積累經驗、產生複利效應的系統地基。
用 Benchmark 數據破除大腦迷信:在 Google 與 LangChain 的官方實驗中,曾給出過兩組極具說服力的案例:在硬核的程式碼評測 Benchmark(SWE-bench 2.0)中,一個頂尖團隊完全不更換底層模型,僅僅透過重新設計與修補 Harness 的工具、規則與回饋流程,就硬生生將專案成績從 30 名以外,一路拉進了全球前五名;在另一項 LangChain 實驗中,在同一個模型下,僅僅微調了 system prompt、工具定義與執行中間件(Middlewear),模型的最終得分便直接暴漲了 13.7 分。這充分證明:同一個大腦,換了一套工作環境,表現天差地別。
實戰步驟二:將錯誤化為系統資產:建立「人負責引導,Agent 負責執行」的協作架構
在理解公式後,你必須將日常與 AI 協作的流轉模式,從「人肉幫 AI 擦屁股」的勞力活,升級為系統級的「環境治理」:
實踐 "Human Steer, Agents Execute" 的核心理念:今年初 OpenAI 內部的經典實驗中,一個小團隊花費五個月,自動化產出了高達 100 萬行的程式碼、完成了 1500 個真實的 Pull Request,而期間人類工程師「一行程式碼都沒有親自手寫」。他們之所以能達到這種神話般的效率,是因為他們將自己的工作定位在「系統設計」:人類負責掌握方向(Steer),而 AI Agents 負責在規定的產線上拼命執行(Execute)。
「修補系統,而非修改結果」的防禦心態:當 AI 寫出了不合格的內容或程式碼時,最愚蠢的做法是人類自己動手把那行代碼改對。你必須回頭拷問系統:「為什麼我們的環境,會允許這行爛代碼被寫出來、甚至通過驗證?」。你應該將你的程式排版規範(Linting)、錯誤處理原則(Error Handling)、以及安全紅線,直接寫成 Linter 規則、寫成自動化測試、或是寫進專案的最高憲法 CLAUDE.md 中。下一次,當 AI 再次嘗試犯同樣的錯誤時,Harness 系統會自動在第一時間將其無情擋下,並迫使 AI 進行自我修正。如此一來,AI 踩過的每一個坑、犯過的每一次錯,都不再是平白燒掉的 Token 成本,而是轉化為讓你的 Harness 系統變得更加堅固的永久資產。