「前緣模型」這四個字最近很常出現:要放慢的是前緣、要管制的是前緣、要申請才能用的也是前緣。但如果你問「哪些模型算前緣」,答案完全取決於你問誰。
因為這條線有兩種畫法,而且兩種的邏輯不一樣。
法規畫線 公司畫線 訓練算力 10^25 FLOP 能不能做到某件危險的事 一次寫進法條 每次評測重新判定 已經被三十幾個跨過 每家自己認定
法規那條線:用算力畫
歐盟 AI Act 第 51 條的做法是:一個通用型 AI 模型,訓練算力超過 10 的 25 次方 FLOP,就「推定」它具有高衝擊能力、屬於有系統性風險的那一類。推定的意思是可以舉證推翻——開發者能證明自家模型的能力不及最先進的那一群,就不算。另外還有一個更低的指示性門檻:訓練算力超過 10 的 23 次方、而且會生成語言、圖像或影片的,才會被當成通用型 AI 模型來管。歐盟 AI Office 的完整執法權(要資料、要求下架、限期改善、開罰)從 2026 年 8 月 2 日起算。
用算力畫線的好處是客觀、可稽核。壞處是它會過期。Epoch AI 的盤點,到 2025 年 6 月就已經有超過三十個公開模型、來自十二家開發者跨過 10 的 25 次方。也就是說,這條線抓到的不是「最前面那幾個」,是一整群,而且會越來越多。
公司那條線:用能力畫
三家大廠的做法剛好相反,它們不看算力,看「它會不會做某件危險的事」。
Anthropic 的 Responsible Scaling Policy 把模型分成不同的 AI 安全等級,每一級對應一組具體的部署標準和模型權重的保護強度;要往上一級推,得先達到那一級的防護要求。OpenAI 的 Preparedness Framework 把早期的四級收斂成兩個門檻,High 和 Critical——GPT-6 Astra 在網路攻擊這個項目上被自己評為 Critical,就是這套框架下的判定。Google DeepMind 的 Frontier Safety Framework 更偏流程:先定義關鍵能力門檻,規定到了要做什麼評估、誰來審。
三份文件寫法不同,共同點是判準從「這個模型有多大」換成「這個模型能做到什麼」。這是對的方向,但它有一個結構性的弱點:這些都是公司自己寫、自己評的。所以才會有前面那篇講的第三方評測員提案。
兩條線正在脫鉤
這幾年真正的變化是:能力不再只來自訓練算力。推理時多想一會兒、接上工具、放進一個會自己跑好幾輪的代理框架,這些都會讓同一個模型能做的事差很多。一個算力沒到門檻的模型,接上一組工具之後做得到的事,可能超過一個更大但單獨運作的模型。
所以法規的門檻會越來越抓不準,而公司的自評又缺少外部驗證。這兩件事加起來,就是 2026 年下半年整個「誰來管、怎麼管」爭論的形狀。
跟你有什麼關係
你不會去訓練模型,但你會買模型做的產品,而下面這三個問題,多數供應商的業務答不出來。
第一,你們按哪一份安全框架?寫在哪裡、哪一版?答不出來的,代表這家公司沒有這個東西,不是他忘了。
第二,這個能力目前評到什麼等級、誰評的?自評和第三方評過,差別很大。
第三,我買的這一包裡有什麼?你買的從來不是模型,是「模型+工具+權限」這一整包,危險程度看的是那一整包,不是模型本身。一個很普通的模型,加上能寄信、能改資料庫的權限,比一個前緣模型關在唯讀環境裡危險得多。
法規的門檻不是你的安全線,它是別人的最低標準。你自己的線要自己畫。
站內延伸
- 三家把最強能力鎖成申請制 → AI 開始有駕照制了
- 接得越多要看得懂的越多 → MCP 改版了
- 供應商怎麼問、怎麼比 → 找方法AI 供應商評估
來源: EU AI Act 第 51 條與 GPAI 指引總覽(10^25 FLOP 推定門檻、可舉證推翻、10^23 指示性門檻);歐盟執委會:General-Purpose AI Models in the AI Act — Q&A(義務生效與執法時程);Epoch AI:Models over 1e25 FLOP(2025-06:超過三十個模型、十二家開發者);Anthropic:Responsible Scaling Policy;OpenAI:Preparedness Framework(此連結對自動化程式回 403,瀏覽器可開);Google DeepMind:Frontier Safety Framework。
法規用算力畫線、公司用能力畫線,兩條線正在脫鉤,因為能力已經不只來自訓練算力。門檻抓到的是一整群模型,公司的分級又是自己評的。對你來說結論很單純:問清楚對方按哪份框架、評到哪一級、誰評的,然後記得你買的是模型加工具加權限那一整包。
你買的從來不是模型,
是模型加工具加權限
什麼時候看這張:供應商說「我們用的是最前緣的模型」,你不知道該問什麼。
- 法規用訓練用掉的算力畫線,公司用能力畫線
- 算力那條線,二○二五年六月已有三十幾個模型跨過
- 公司的分級是自己寫、自己評的,缺外部驗證
第一個動作下次跟供應商開會,先問三句:按哪份安全框架、評到哪一級、誰評的。寫進問題清單,三分鐘。