當我們進入正式的 AI 生產線(Agentic Workflow)後,最核心的算力調度智慧,莫過於「模型分工(Model Routing)」。
許多人在使用 AI 時,習慣不論大事小事,一律派出手頭上最貴、最強的模型(如 Fable 5、Opus 5 或是 GPT-5.6)。這就像是雇用公司裡薪水最高、判斷力最好的「高階主管」,整天在做複製貼上、整理 CSV 欄位與改檔案名稱等機械化雜事。這不僅是對人才的極大不尊重,更是一場預算上的毀滅災難。真正成熟的架構師,追求的是 Compute Allocation(算力精準分配):依照任務的困難度與出錯代價,指派剛剛好、最符合經濟效益的模型與思考推理強度。
模型路由四象限
用強模型與高推理。
用強模型做策略與架構。
用固定流程加嚴格審核。
用便宜模型或腳本處理。
實戰步驟一:劃分模型選擇與推理強度的「四象限矩陣」,精準配置算力
模型分工(Model Routing)不僅是「選模型」,還必須疊加「推理強度(Reasoning Intensity)」的維度,這決定了你讓模型花多少 Token 預算去「思考與反覆自我檢查」。
兩者結合,構成了以下四個黃金象限:
第一象限:強模型 ✕ 高推理:專門留給方向模糊、決策影響極其深遠的核心任務。例如產品商業策略、軟體系統架構、核心規格書(Spec)的制定。這類任務一旦判斷錯誤,後面做再快也只是往錯的方向狂奔,必須使用最頂尖的大腦與最深度的思考預算。
第二象限:強模型 ✕ 低推理:適合需要良好的判斷力,但不需要想太久的決策點。例如手上有五個產品概念,需要強模型的優良直覺快速篩選出前兩名,此時不需要開啟昂貴的高推理強度。
第三象限:便宜模型 ✕ 高推理:適合方向與規格非常明確,但執行細節需要高技術密度的任務。例如依照既有規格書去補一段複雜的程式邏輯。模型不需重新做大方向決策,但需要給它多一點思考 Token 把代碼寫得乾淨無 Bug。
第四象限:便宜模型 ✕ 低推理:專門處理規則固定、機械化、且極易檢查對錯的工作。例如整理資料、翻譯、改格式、跑自動化檢查、或者產出摘要。
實戰步驟二:通過兩道硬性限制過濾網,並建立 5 步驟交付路由表
要將這套矩陣真正落實到工作中,在挑選模型前,你必須先讓任務通過以下兩道硬性過濾網,並排定好精準的交付路由表:
第一道:公司準用工具與安全過濾網:企業協作的第一個問題永遠是「這份資料能不能外流」。財務資料、客戶私密個資或未發布的專利草稿,絕對不能丟進外部未經授權的 API。必須先從公司安全合規批准的工具(如 ChatGPT Enterprise、Microsoft Copilot)中進行篩選。
第二道:特殊能力與資料源過濾網:檢視任務是否取決於特定的資料源。如果任務需要最新資訊,模型是否具備 Live Web 聯網能力就很關鍵;如果任務取決於 X 社群的討論,或需要串接內部的 CRM、資料庫,就必須挑選對接了該資料流的特定模型。
設計 5 步驟交付鏈(Research -> Design -> Execute -> Review -> Fix)並算一筆賬:我們將一個中型網站開發專案,依 5 步驟進行算力分配調度,交接處完全依靠結構化的 JSON Artifacts 串接:
Research (研究):用 Fable 5 (強模型) 擔任 Manager 拆解問題,指派便宜模型去大量收集,再由 Fable 5 收斂決策報告。
Design (規格):用 Fable 5 ✕ 高推理,寫出極度清晰、毫無歧義的 Spec 規格書。
Execute (執行):將規格拆成小包,交給便宜且做工穩定的 Sonet 5 (便宜模型) 大批生產代碼。
Review (審查):派多個便宜模型當調查員分頭找 Bug,最後將問題清單交回給 Opus 4.8 (強模型) 當法官做綜合判斷。
Fix (修復):依據問題清單,指派 Sonet 5 局部修改代碼並重新部署。
省錢戰報:同樣是 82 萬 input 與 27 萬 output 的工作量,全用 Fable 5 費用是 21.7 美元;但透過上述 Model Routing,費用直接降至 9.15 美元,在品質完全不打折的前提下,成本瞬間直降 58%!