一、這是什麼三十秒判斷關不關你的事
先確認這一篇解的是不是你的問題。看完這兩節如果覺得不像,就不用再往下讀——省下的時間比讀完更值錢。
01解決的工作問題
顧問、政策研究者或分析師讀十幾篇論文與報告時,最常犯的錯不是讀得不夠多,而是讀完後把印象直接寫成結論——腦中留下「大部分文獻都支持」的感覺,卻沒有真的一篇一篇數過。AI讀得比人快,這個陷阱因此被放大:丟一堆文獻進去問「這些研究怎麼說」,AI很容易把一篇小樣本的相關性研究、一位作者在討論段落裡的推測、甚至只是別人論文裡引用的二手說法,全部混進同一句「研究顯示」裡吐出來,讀起來像普遍結論,其實只有一篇證據撐著,甚至那篇的研究設計根本撐不住這個結論。要擋住這件事,不能只靠「AI你要小心」,而要逼它把每條主張拆開,標明來源、研究類型、樣本、證據強度、限制,以及對原始說法是支持、反駁還是中立,最後由人判斷信心程度——這張表本身就是產出,不是寫報告前的暗中準備。
真的有人這樣做過外部佐證 1 則
以下都是具名機構的公開案例,每個來源都經過連結實測。數字只寫來源講得出來的;來源沒講的,這裡就寫未公開。
VDI/VDE Innovation + Technik(使用Elicit AI)/CSIRO(獨立同儕審查佐證)德國/澳洲 · 2025VDI/VDE用Elicit這款AI研究助理做客戶委託的系統性文獻回顧,把AI逐欄位抽取結果(每篇論文是否符合各項納入標準)匯出成表格,再由團隊人工核對每一筆抽取結果背後的原文引用段落才定案。CSIRO與塔斯馬尼亞大學團隊則在同儕審查期刊上,獨立比較Elicit/GPT-4-Turbo與5位人類專家抽取11個結構化欄位的一致性,作為交叉驗證。
成效VDI/VDE案例:單次文獻回顧規模從50篇擴大到550篇(11倍),人工比對驗證AI正確抽取1,502/1,511個資料點(準確率99.4%)。CSIRO研究:AI判斷「資料是否存在」與人類一致性低(Cohen's kappa<0.10),但AI確實抽取出資料時品質顯著優於門檻值(t=6.91, p<0.001),幻覺率低(29個標記案例中僅1例對不上原文),結論主張LLM能「輔助」但不能「可靠地自動化」證據抽取階段。
不能照抄的理由VDI/VDE案例是Elicit(工具供應商)自己發布的客戶案例研究,屬於商業宣傳性質的官方頁面,不是獨立稽核;案例頁也沒有逐欄列出「來源/研究類型/樣本數/證據強度/支持-反駁-中立」的完整矩陣欄位。CSIRO研究是真正獨立的同儕審查佐證,但故事比較保守——不是一篇漂亮的成功案例,比較適合放在「AI不是萬能,仍需人工把關」的段落。
這些案例與其他外部佐證,完整收在找靈感 →
02什麼時候用、什麼時候別用
什麼情況下該用這一套
- 手上有至少五到八篇論文或報告要交叉比對,且結論會被拿去做決策或政策建議。
- 你需要對「證據強度」誠實分級,而不只是列一份引用清單。
- 有時間先建矩陣、再寫報告的場合,不是趕在下班前生一段結論。
什麼情況下別用
- 只有一篇文獻時
- 矩陣的意義是讓多篇互相比對;只有一篇時沒有Supports/Contradicts的對照對象,直接誠實寫「僅有一篇資料,證據不足」就好,不必硬做矩陣。
- 來不及查證、要立即下結論的場合
- 逐篇核對來源與欄位需要時間,矩陣不是應急工具,臨時要交代的口頭意見不該假裝經過了矩陣式的查核。
- 只找得到二手轉述、找不到任何原始研究時
- Source欄位填不出來,矩陣從根基就立不住,這時該做的是先去找原始文獻,不是先做矩陣。
- 想用來替既定立場找證據背書
- 矩陣的紀律是連反駁證據都要放進去;如果目的是替已經決定的結論湊佐證,矩陣會被做成篩選過的假象,不如不做。
誰會用到
- 顧問
- 你最常要在報告截止前把十幾篇資料讀完,矩陣是逼自己不要用印象下結論的機制,交付前的把關步驟不能省。
- 數據分析
- 你多半已經在做類似的事,只是沒有固定成表格。把欄位定義訂死,之後每次分析的證據強度標準才不會跟著心情漂移。
- PM
- 你可能不寫矩陣本身,但要看得懂它——決定要不要照文獻建議調整專案方向前,先看證據缺口清單,比看結論摘要更重要。
- 法務
- 合規或法規影響評估常常要引用外部研究佐證,矩陣能避免把單一意見書或個案寫成「法界普遍認為」。
- 公務員
- 政策簡報最容易把初步觀察寫成「研究顯示」,矩陣裡的證據缺口清單是給決策者看的,不是拿掉不寫比較好看。
所屬工作情境
二、整件事怎麼跑先看圖,再看逐步
先用一張圖抓全貌,再看逐步展開。圖看不懂沒關係,下一節會把每一步實際在做什麼、誰做,一條一條講清楚。
03流程圖
這張圖是整篇的骨架:輸入 → 步驟 → 困難點 → AI/Agent/Tool 介入 → 人工檢查 → 產出。紅框是最常出事的位置,綠框是不能下放的人工檢查點,粗框是中止條件。後面每一節都是在展開圖上的某一格。
AI 文獻證據矩陣:把「一篇研究」與「研究都證明了」分開Human 輸入Human 步驟AIAgentCheckpointOutputRisk 困難點Stop 中止
看圖重點:這張圖裡最容易被跳過的是第二步「確認是原始研究」——很多人蒐集資料時是先存了一堆別人引用的說法,等到進矩陣才發現找不到原始論文。另外,中止條件不是「證據不足就不能用」,而是「證據不足時不能假裝已經判定支持或反駁」,這兩者的差別正是這個方法要守住的紅線。純文字流程表(手機/螢幕閱讀器建議看這張)
AI 文獻證據矩陣:把「一篇研究」與「研究都證明了」分開(純文字流程表)| 序 | 類型/角色 | 流程步驟 | 這一步的困難點/中止條件 |
|---|
| 1 | Human | 待驗證的Claim + 待比對文獻(全文或方法與結果段落)+ 證據強度分級標準 文獻只有摘要沒有方法與結果段落時,Study Type與Sample無法判斷 | — |
| 2 | Human | 人定義Claim並訂好證據強度分級標準 Claim要寫成可支持/反駁的一句話,不是模糊題目 | — |
| 3 | Human | 人蒐集文獻,確認是原始研究而非二手轉述 只有新聞報導或別人引用時,先標明尚未找到原始來源 | — |
| 4 | AI | AI逐篇抽取Source/Study Type/Sample/Evidence/Limitation 缺的欄位標「未提及」,不得用常識代填 | 困難點/風險AI把只有二手轉述的來源當成原始研究填進Source,Evidence強度被高估 |
| 5 | AI | AI逐篇判定Supports/Contradicts/Neutral並附原文佐證 觀察性/相關性/案例研究不得用因果語言 | 困難點/風險AI把相關性研究的結果寫成因果結論,例如用「導致」「提升了」這類語言 困難點/風險只有一篇低強度證據,摘要卻寫成「研究顯示」「多項研究都證明」 |
| 6 | Checkpoint | 人核對矩陣,抓相關性當因果、單篇當通例的錯誤 | 失敗與中止條件找不到原始研究全文時,該列標「證據不足」,不得填入支持或反駁,中止判定直到找到原始來源 |
| 7 | Agent | 定案規則寫進共用證據矩陣助手,之後比對用同一套標準 | — |
| 8 | Output | 定稿的Evidence Matrix + 信心程度覆核 + 證據缺口清單 | — |
Mermaid 原始碼(貼進 Mermaid Live 或 draw.io 可再編輯)
可直接複製,改成你自己的流程
flowchart TD
in1(["<b>Human</b><br/>待驗證的Claim + 待比對文獻(全文或方法與結果段落)+ 證據強度分級標準<br/><small>文獻只有摘要沒有方法與結果段落時,Study Type與Sample無法判斷</small>"])
s1["<b>Human</b><br/>人定義Claim並訂好證據強度分級標準<br/><small>Claim要寫成可支持/反駁的一句話,不是模糊題目</small>"]
s2["<b>Human</b><br/>人蒐集文獻,確認是原始研究而非二手轉述<br/><small>只有新聞報導或別人引用時,先標明尚未找到原始來源</small>"]
a1[/"<b>AI</b><br/>AI逐篇抽取Source/Study Type/Sample/Evidence/Limitation<br/><small>缺的欄位標「未提及」,不得用常識代填</small>"/]
a2[/"<b>AI</b><br/>AI逐篇判定Supports/Contradicts/Neutral並附原文佐證<br/><small>觀察性/相關性/案例研究不得用因果語言</small>"/]
c1{{"<b>Checkpoint</b><br/>人核對矩陣,抓相關性當因果、單篇當通例的錯誤"}}
g1[["<b>Agent</b><br/>定案規則寫進共用證據矩陣助手,之後比對用同一套標準"]]
o1(["<b>Output</b><br/>定稿的Evidence Matrix + 信心程度覆核 + 證據缺口清單"])
r1>"<b>Risk</b><br/>AI把只有二手轉述的來源當成原始研究填進Source,Evidence強度被高估"]
r2>"<b>Risk</b><br/>AI把相關性研究的結果寫成因果結論,例如用「導致」「提升了」這類語言"]
r3>"<b>Risk</b><br/>只有一篇低強度證據,摘要卻寫成「研究顯示」「多項研究都證明」"]
st1[/"<b>Stop</b><br/>找不到原始研究全文時,該列標「證據不足」,不得填入支持或反駁,中止判定直到找到原始來源"\]
in1 --> s1
s1 --> s2
s2 --> a1
a1 --> a2
a2 --> c1
c1 --> g1
g1 --> o1
a1 -.->|風險| r1
a2 -.->|風險| r2
a2 -.->|風險| r3
c1 ==>|中止| st1
in1 -.->|退回| s1
s1 -.->|退回| s2
s2 -.->|退回| a1
a1 -.->|退回| a2
a2 -.->|退回| c1
c1 -.->|抽取欄位有誤或缺原文出處,回頭重抽| a1
c1 -.->|退回| g1
g1 -.->|退回| o1
classDef clsIn fill:#FFFFFF,stroke:#2C4459,stroke-width:2px,color:#141E2B
classDef clsHuman fill:#FBFCFD,stroke:#7A8CA0,stroke-width:2px,color:#141E2B
classDef clsAI fill:#FFF6EA,stroke:#DE9A45,stroke-width:2px,color:#141E2B
classDef clsAgent fill:#FDEBD2,stroke:#B87A2E,stroke-width:2px,color:#141E2B
classDef clsTool fill:#EDF2F6,stroke:#2C4459,stroke-width:2px,color:#141E2B
classDef clsCheck fill:#E8F2EC,stroke:#3F7A5A,stroke-width:2px,color:#123024
classDef clsOut fill:#141E2B,stroke:#141E2B,stroke-width:2px,color:#F2F6F9
classDef clsRisk fill:#FCEFEA,stroke:#C0552F,stroke-width:2px,color:#5E2110
classDef clsStop fill:#F7E1DB,stroke:#8E2F17,stroke-width:3px,color:#5E2110
class in1 clsIn;
class s1 clsHuman;
class s2 clsHuman;
class a1 clsAI;
class a2 clsAI;
class c1 clsCheck;
class g1 clsAgent;
class o1 clsOut;
class r1 clsRisk;
class r2 clsRisk;
class r3 clsRisk;
class st1 clsStop;04完整步驟圖的文字版,逐步展開
一句話版(快速回顧)
- 先把要驗證的說法寫成一句可支持或反駁的Claim,並訂好證據強度分級標準。
- 蒐集文獻,確認是原始研究而非二手轉述,缺原文的先標明。
- 請AI逐篇抽取Source、Study Type、Sample、Evidence、Limitation,缺的欄位標未提及。
- 請AI逐篇判定支持、反駁或中立,並要求附原文佐證,不得把相關性寫成因果。
- 人核對整張矩陣,抓出過度概化與因果誤用的地方,Confidence由人覆核定案。
- 定稿矩陣,誠實列出證據缺口清單,不要把單篇研究寫成研究都證明了。
完整版(每一步誰做、產出什麼)
| 序 | 誰做 | 步驟與說明 |
|---|
| 1 | Human | 定義待驗證的主張 把要驗證的說法寫成一句可以被支持或反駁的陳述(Claim),不是模糊的題目,並先訂好證據強度分級標準。→ 已定義的Claim與分級標準 |
| 2 | Human | 蒐集文獻並確認來源 把待比對的論文或報告全文,或至少方法與結果段落整理好,確認是原始研究而非二手轉述,找不到原始文獻的先標明。→ 已核對的文獻庫 |
| 3 | AI | 逐篇抽取欄位 針對每一篇,抽取Source、Study Type、Sample、Evidence強度與Limitation,找不到的欄位標「未提及」,不得用常識代填。→ 逐篇欄位草稿 |
| 4 | AI | 逐篇判定支持/反駁/中立 對照Claim,逐篇判定Supports/Contradicts/Neutral,並附原文佐證與初步Confidence建議;相關性研究不得判定為因果支持。→ 逐篇判定草稿 |
| 5 | Human | 人核對矩陣 逐列核對,抓出AI把相關性寫成因果、把單篇小樣本寫成普遍結論、或用二手轉述充當原始來源的地方,退回重做。→ 核對後的矩陣 |
| 6 | Agent | 做成可重複使用的比對助手 把欄位定義、分級標準與紅線寫進系統指令,之後每次比對新文獻都用同一份標準,不必每次重新講規則。→ 共用證據矩陣助手 |
| 7 | Human | 產出定稿矩陣與信心程度摘要 統整整張矩陣的信心程度、標出仍證據不足的主張,交付前再檢查一次沒有把單篇研究寫成「研究都證明了」。→ 定稿Evidence Matrix |
三、動手做備料 → 指令 → 產出 → 工具
這一區是真的動手:先備料、再貼指令、然後對照產出應該長什麼樣。手上是哪一支 AI 都做得完,差別寫在最後的工具那一節。
05開始前要準備什麼標「必要」的沒備齊就先別開始
- 待驗證的Claim必要
- 寫成一句可以被支持或反駁的明確陳述,不是模糊的題目。例如「四天工作制可以提升員工的生產力」而不是「四天工作制好不好」。
- 待比對的文獻必要
- 至少要有方法與結果段落,只有摘要無法判斷Study Type與Sample。優先找得到全文的原始研究。
- 證據強度分級標準必要
- 先訂好像「RCT/統合分析=強、有對照組的類實驗=中、觀察性/相關性研究=弱、案例研究/專家意見=極弱」這樣的規則,不然每次評分標準會漂移。
- 文獻的後設資料可選
- 作者、年份、出處、是否經同儕審查,找不到的先標明未提及。
- NotebookLM或類似工具的文獻庫可選
- 文獻多篇時先建一個可反覆詢問、能標出處頁碼的文獻庫,比每次貼全文更穩定。
餵進去的東西要長這樣
待驗證的Claim(一句可支持/反駁的陳述)+ 待比對文獻(全文或至少方法與結果段落)+ 證據強度分級標準。
- Claim要寫成明確、可以被支持或反駁的一句話,不能是模糊的題目。
- 文獻至少要有方法與結果段落,只有摘要無法判斷Study Type與Sample。
- 找不到原始研究全文、只有二手轉述時要先標明,不能假裝是原始來源。
- 先訂好證據強度分級標準,不然每次評分標準會漂移。
Claim:四天工作制可以提升員工的生產力
證據強度分級標準:RCT/統合分析=強;有對照組的類實驗=中;觀察性研究/相關性調查=弱;案例研究/專家意見/未同儕審查報告=極弱。
文獻:
【文獻A】類實驗,某科技公司(約200人)試行四天工作制6個月,內部人資報告,無對照組……
【文獻B】橫斷面問卷,850名跨產業知識工作者……
【文獻C】案例研究,單一公司45人訪談報告……
06Prompt(快速/完整/進階)
A 快速版貼上就能用;B 完整實戰版把角色、限制、步驟、輸出格式與驗收標準寫足;C 進階版是拿去建 GPT/Skill/Agent 的系統指令。三種都附可替換變數、使用範例、預期輸出與人工確認點。
三種版本共通的紅線三版都不適合用在- 不要把只有一篇證據的立場寫成「研究顯示」或「多項研究都證明」。
- 不要把相關性研究、案例研究的結果寫成因果結論。
- 不要用AI自己給的Confidence判定直接定案,跳過人工覆核。
三版都必須由人確認- Claim的定義與證據強度分級標準由人事先訂定。
- 找不到原始研究、只能找到二手轉述的列,由人確認標「證據不足」而非刪除或亂填。
- 相關性是否被誤寫成因果,由人最終覆核。
- Confidence欄位由人在看過整張矩陣後定案。
- 矩陣的結論摘要與證據缺口清單由人撰寫定稿。
適合的工具ChatGPTClaude
👇 直接複製,{ } 換成你的內容
我要驗證的主張(Claim)是:{Claim}
以下是我蒐集到的文獻,請針對每一篇建立證據矩陣的一列,欄位為:
- Claim:沿用我給的主張,不要換句話說
- Source:作者/年份/出處
- Study Type:研究類型(RCT/類實驗/觀察性研究/案例研究/文獻回顧/統合分析/專家意見/其他)
- Sample:樣本數與組成,文獻沒寫就填「未提及」
- Evidence:證據強度(強/中/弱),並說明分級理由
- Limitation:這篇研究自己承認或明顯存在的限制
- Supports/Contradicts/Neutral:對我的Claim是支持、反駁還是中立,並附原文佐證
- Confidence:你對這一列判定的信心(高/中/低),並說明為什麼
規則:
1. 不得把相關性研究寫成因果結論。
2. 找不到某個欄位的資訊,一律標「未提及」,不得用常識或其他文獻內容代填。
3. 只有一篇證據支持某個立場時,不得使用「研究顯示」「研究都證明」這類暗示多篇共識的語言,只能寫「該篇研究指出」。
4. 每一列的Supports/Contradicts/Neutral判定都要附原文引用或段落出處,不得只憑摘要判斷。
待比對文獻:{貼上}可替換變數
| 變數 | 要換成什麼 |
|---|
{Claim} | 你要驗證的主張,寫成一句可以被支持或反駁的陳述。 |
{貼上} | 待比對文獻全文或至少方法與結果段落,可多篇分開貼。 |
完整使用範例(照這樣填)
我要驗證的主張(Claim)是:四天工作制可以提升員工的生產力
待比對文獻:
【文獻A】類實驗研究,某科技公司(約200名員工)試行四天工作制6個月,作者為內部人資報告,未經同儕審查。方法為受試前後比較同一批員工的產出指標,無對照組。結果:主觀自評「工作效率提升」的比例從38%增加到61%;實際產出指標(客服工單處理量)僅上升4%,且同期公司也調整了排班系統。作者在討論段落寫道:「效率提升可能與四天工作制有關,也可能反映了排班系統優化的效果,兩者無法完全區分。」
【文獻B】橫斷面問卷調查,針對850名不同產業的知識工作者,比較目前實行四天與五天工作制員工的自評壓力與投入度分數。無對照實驗設計,僅為相關性分析。結果:四天工作制員工的自評投入度平均分數高於五天制員工(相差0.6分,5分量表),作者提醒「這是橫斷面資料,可能反映的是壓力較低、投入度本來就高的公司才更願意嘗試四天制,而非四天制本身提升了投入度」。
【文獻C】案例研究,單一公司(45人)導入四天工作制一年後的敘事訪談報告,無量化指標,僅有管理層與員工的訪談摘要,多數受訪者表示「感覺比較不累」,報告未提供離職率、營收或產出的具體數字對照。
預期輸出範例(拿到的東西應該長這樣)
【文獻A】
Claim:四天工作制可以提升員工的生產力
Source:內部人資報告(未同儕審查),約200名員工的科技公司
Study Type:類實驗(前後對照,無對照組)
Sample:n≈200,單一公司科技業員工
Evidence:弱—中(有實際產出指標,但無對照組,且與排班系統調整同時發生,無法排除混淆變項)
Limitation:作者自陳排班系統優化可能是真正原因,因果無法區分;未經同儕審查
Supports/Contradicts/Neutral:部分支持(主觀自評提升明顯,但客觀產出僅微幅上升4%,且作者自己承認因果不明確,不能算完全支持)
Confidence:低(單一公司、無對照組、作者自己都指出混淆因素)
【文獻B】
Source:850人跨產業問卷(橫斷面)
Study Type:相關性調查
Sample:n=850跨產業知識工作者
Evidence:弱(相關性研究,非因果,作者明確提醒自我選擇偏誤)
Limitation:橫斷面設計無法排除「本來投入度高的公司才敢試四天制」的反向因果
Supports/Contradicts/Neutral:中立偏相關(有正相關,但作者自己否定因果解讀,不能算支持「導入會提升」這個因果Claim)
Confidence:低
【文獻C】
Source:單一公司45人訪談報告
Study Type:案例研究(質性訪談)
Sample:n=45,單一公司
Evidence:極弱(無量化指標,僅主觀敘述)
Limitation:沒有離職率、營收或產出等客觀指標對照;無法類推到其他產業或規模
Supports/Contradicts/Neutral:中立(提供的是感受敘述,不足以判定對生產力Claim的支持或反駁)
Confidence:低
【矩陣小結】三篇文獻沒有一篇是能撐住「四天工作制提升生產力」這個因果Claim的高品質證據——沒有RCT、沒有跨公司對照組。若寫成「研究顯示四天工作制能提升生產力」是錯的;誠實的寫法是「目前多為低證據強度的初步觀察,缺乏對照實驗,尚不足以下因果結論」。
常見錯誤用法
- 把「樣本不足」或「未提及」的欄位直接刪掉不顯示。那些空白告訴你矩陣的邊界在哪。
- 看到Evidence標「弱」就把那一列從矩陣裡拿掉。弱證據也是證據,拿掉等於竄改了整體證據分布。
- 只看Supports那一欄就寫結論,跳過Confidence與Limitation欄位。
這一版另外不適合沒有額外的,看上面「三種版本共通的紅線」那一段就好。
缺少資料時怎麼辦文獻只有摘要、沒有方法與結果段落時,Study Type與Sample常常判斷不出來,AI會傾向用摘要裡的形容詞猜,這時要求它一律標「未提及」。
這一版另外要人確認沒有額外的,看上面「三種版本共通的紅線」那一段就好。
適合的工具ChatGPTClaude
👇 直接複製,{ } 換成你的內容
以下是我請AI逐篇建立的證據矩陣草稿,以及原始的Claim。請針對每一列做稽核,不要重新產生矩陣,只做檢查:
1.【因果誤用檢查】逐列檢查Study Type若為觀察性研究/相關性調查/案例研究,Supports/Contradicts/Neutral欄位或其說明是否使用了「導致」「證明」「使…提升」這類因果語言。有的話標記【因果誤用】並改寫為正確的相關性描述。
2.【過度概化檢查】檢查整份矩陣的結論摘要(如果我有附)是否用「研究顯示」「多項研究都證明」這類語言,但實際上只有1篇或少數低強度證據支持。有的話標記【過度概化】並提出更誠實的寫法。
3.【來源檢查】逐列檢查Source欄位,若寫的是「引用自XX的說法」「根據XX報導」而非原始研究本身,標記【二手來源,非原始研究】,並說明這一列的Evidence強度應該調降。
4.【Confidence覆核】針對Confidence欄位標「中」以上的列,說明支持這個信心程度的具體理由是什麼;理由不足的降級為「低」。
5.【證據缺口清單】列出Claim目前完全沒有高強度證據(RCT/統合分析)支持或反駁的部分,這份清單要放進最終報告,不要省略。
原始Claim:{貼上}
證據矩陣草稿:{貼上}可替換變數
| 變數 | 要換成什麼 |
|---|
{貼上} | 你要驗證的原始Claim。 |
{貼上} | AI草擬的證據矩陣草稿(逐列文字或表格皆可)。 |
完整使用範例(照這樣填)
原始Claim:四天工作制可以提升員工的生產力
證據矩陣草稿:
【第1列】文獻A|Source:內部人資報告|Study Type:類實驗|Evidence:中|Supports:支持,四天工作制導致員工工作效率提升
【第2列】文獻B|Source:根據媒體報導引述的問卷調查|Study Type:相關性調查|Evidence:中|Supports:支持
【第3列】文獻C|Source:單一公司訪談報告|Study Type:案例研究|Evidence:中|Supports:支持
結論摘要:研究顯示四天工作制能有效提升生產力。
預期輸出範例(拿到的東西應該長這樣)
【因果誤用檢查】
第1列:Supports欄位寫「導致員工工作效率提升」——文獻A是類實驗、無對照組,且作者自己承認排班系統調整可能是真正原因,這是因果誤用。改寫為:「與工作效率自評提升同時發生,但因無對照組且存在排班系統變動的混淆變項,不能判定為因果」。
【過度概化檢查】
結論摘要「研究顯示四天工作制能有效提升生產力」是過度概化——三篇證據裡沒有一篇是RCT或跨公司對照研究,且文獻B與C的作者都在文中提醒相關性或自選偏誤問題。誠實寫法應為:「目前僅有低強度的初步觀察性證據,缺乏對照實驗,尚不足以下因果結論」。
【來源檢查】
第2列的Source寫「根據媒體報導引述的問卷調查」——這是二手轉述,不是原始研究本身。這一列的Evidence強度應調降為「弱」,並註記「尚未找到原始問卷報告,來源為媒體轉述」。
【Confidence覆核】
三列的Confidence都應該是「低」,不是草稿裡標的「中」——沒有一篇有對照組、沒有一篇是跨產業或跨公司的大樣本,且每篇作者自己都承認限制。
【證據缺口清單】
- 沒有任何RCT或準實驗設計(有對照組)驗證四天工作制對客觀產出指標的因果效果。
- 沒有跨產業、跨公司規模的大樣本研究。
- 沒有長期(一年以上)追蹤資料,判斷效果是否隨時間衰退。
常見錯誤用法
- 把稽核結果直接當成新的矩陣貼進報告,沒有回頭真的去改那三個因果誤用的地方。
- 看到證據缺口清單就跳過不寫進報告——那份清單通常比矩陣本身更重要,它告訴讀者哪裡還不能下結論。
- 拿稽核結果去說服自己原本的結論是對的,而不是拿它去修正結論。
這一版另外不適合沒有額外的,看上面「三種版本共通的紅線」那一段就好。
缺少資料時怎麼辦矩陣草稿裡沒有寫Source原文出處時,AI無法判斷是不是二手轉述,稽核會直接跳過來源檢查,這一步一定要求AI在草稿階段就附段落出處。
這一版另外要人確認沒有額外的,看上面「三種版本共通的紅線」那一段就好。
適合的工具自訂 GPT/Claude ProjectClaude SkillNotebookLM
👇 直接複製,{ } 換成你的內容
請把以下規則,寫成一份可以直接用來建立共用「證據矩陣助手」的系統指令。
【系統指令要包含】
1. 角色與任務:只負責從使用者提供的文獻中,針對指定Claim逐篇建立證據矩陣的一列,不負責替使用者做決策或下報告結論。
2. 矩陣欄位定義(照我提供的欄位定義全文,不得增刪):Claim、Source、Study Type、Sample、Evidence、Limitation、Supports/Contradicts/Neutral、Confidence。
3. 證據強度分級標準(照我提供的分級規則,例如RCT/統合分析 > 有對照組的類實驗 > 觀察性/相關性研究 > 案例研究 > 專家意見/未同儕審查報告)。
4. 硬限制——以下情況一律不得由AI自行判定,必須標記並交由人處理:
- 找不到原始研究、只有二手轉述或新聞報導時,Source欄位標「未找到原始來源」,Evidence強度不得高於「弱」。
- 只有一篇證據支持某個立場時,禁止在任何欄位或摘要中使用「研究顯示」「多項研究證明」等暗示共識的語言。
- 觀察性研究、相關性研究、案例研究的結果,Supports/Contradicts欄位不得使用「導致」「證明」等因果語言。
- Confidence欄位的最終值必須由人在看過整張矩陣後覆核,AI只能給「建議值」。
5. 輸出格式:逐列的矩陣 + 矩陣結論摘要(不得過度概化)+ 證據缺口清單 + 需要人確認的地方。
【另外請給我】
(a) 一份「使用說明」,寫給第一次用的同事看,含三個好例子與三個壞例子。
(b) 一份「維護說明」:分級標準要更新時該改哪裡、多久檢視一次、誰負責。
矩陣欄位定義:{貼上}|證據強度分級標準:{貼上}可替換變數
| 變數 | 要換成什麼 |
|---|
{貼上} | 矩陣欄位定義全文(可用本方法的八欄位定義)。 |
{貼上} | 你們團隊採用的證據強度分級標準。 |
完整使用範例(照這樣填)
(貼上欄位定義:Claim/Source/Study Type/Sample/Evidence/Limitation/Supports-Contradicts-Neutral/Confidence,以及分級標準:RCT/統合分析=強,有對照組的類實驗=中,觀察性/相關性研究=弱,案例研究/專家意見=極弱)
預期輸出範例(拿到的東西應該長這樣)
【共用證據矩陣助手 系統指令】
一、你的角色
你是本團隊的證據矩陣建構助手。你只負責針對使用者指定的Claim,從提供的文獻中逐篇建立矩陣的一列,不負責替使用者下報告結論或建議決策。
二、矩陣欄位(八欄,缺一不可)
Claim|Source|Study Type|Sample|Evidence|Limitation|Supports/Contradicts/Neutral|Confidence
(欄位定義照使用者提供的全文,不得自行增刪或改寫定義)
三、證據強度分級
RCT/統合分析=強;有對照組的類實驗=中;觀察性研究/相關性調查=弱;案例研究/專家意見/未同儕審查報告=極弱。
四、一律不得由AI自行判定、必須標記交人處理的情況
1. 找不到原始研究、只有二手轉述或新聞報導——Source標「未找到原始來源」,Evidence不得高於「弱」。
2. 只有一篇證據支持某立場——禁止使用「研究顯示」「多項研究證明」等暗示共識的語言,只能寫「該篇研究指出」。
3. 觀察性/相關性/案例研究的結果——Supports/Contradicts欄位不得用「導致」「證明」等因果語言。
4. Confidence最終值——你只給建議值,最終由人在看過整張矩陣後覆核並定案。
五、輸出格式
【逐列矩陣】
【矩陣結論摘要】(不得過度概化,若證據薄弱要明講)
【證據缺口清單】(Claim目前沒有高強度證據支持或反駁的部分)
【需要人確認的地方】
──────────
【使用說明(給第一次用的同事看)】
這個助手做什麼:把你提供的文獻,逐篇整理成矩陣的一列。
這個助手不做什麼:幫你決定Claim要不要成立、幫你寫報告的結論段落。
好例子:
1. 貼上3篇文獻全文與你的Claim,說「請逐篇建矩陣」。
2. 貼上矩陣草稿,問「這一列的Confidence為什麼是中,理由夠不夠」。
3. 只有1篇證據時,問「這樣可以寫成研究顯示嗎」——它會回答不行,並說明正確寫法。
壞例子:
1.「幫我決定這個Claim到底成不成立」——那是人的判斷,助手不負責下結論。
2.「這篇報導提到的研究,直接當原始來源填進去」——沒有原始研究全文不能這樣填,要標未找到原始來源。
3.「把Confidence都填高一點,報告比較有說服力」——Confidence造假比沒有矩陣更危險。
【維護說明】
- 證據強度分級標準有更動時只改第三節,其餘不動。
- 每季抽查三份團隊產出的矩陣,確認因果語言與過度概化的檢查有沒有被落實。
- 負責人:〔填寫〕。更新後在共用位置註明版本與日期。
常見錯誤用法
- 把Confidence欄位交給AI自己定案,跳過人工覆核那一步——那正是這個助手唯一會出錯到很危險的地方。
- 讓助手兼著寫報告結論,一旦它開始下結論,過度概化的紅線就沒人在管了。
- 分級標準訂完就不管,不同人各自用不同的強弱標準,矩陣之間沒辦法互相比較。
這一版另外不適合沒有額外的,看上面「三種版本共通的紅線」那一段就好。
缺少資料時怎麼辦沒有先給欄位定義與分級標準,助手就只能套用自己對「證據強度」的一般理解,團隊內部標準不一致的問題還是沒解決。
這一版另外要人確認沒有額外的,看上面「三種版本共通的紅線」那一段就好。
07產出應該長什麼樣拿到的東西要長這樣
逐列矩陣(八欄)+ 矩陣結論摘要 + 證據缺口清單 + 需要人確認的地方。
完成品:同一份文獻,兩種矩陣列:有沒有把「相關」寫成「因果」
【沒有要求分辨相關與因果】
AI產出(節錄):
「文獻B:Source:850人跨產業問卷調查|Study Type:問卷調查|Evidence:中|Supports:支持——四天工作制提升了員工投入度,相差0.6分(5分量表)。」
→ 讀起來像是一個穩固的正面結果。問題是:
→ 這是橫斷面相關性資料,不是實驗,「提升」這個動詞已經在暗示因果。
→ 沒有處理自我選擇偏誤:投入度本來就高的公司,可能才是更願意嘗試四天制的那一群,順序可能反過來。
→ Evidence標「中」,但相關性研究依照分級標準最高只能到「弱」。
【強制分辨相關與因果,並要求附佐證】
AI產出(節錄):
「文獻B:Source:850人跨產業問卷調查|Study Type:橫斷面相關性調查(無對照組)|Evidence:弱(相關性研究,且作者明確提醒自我選擇偏誤)|Limitation:橫斷面設計無法排除反向因果——可能是投入度本來就高的公司才願意嘗試四天制,而非四天制本身提升投入度。〔佐證:文獻B討論段落「這是橫斷面資料,可能反映的是壓力較低、投入度本來就高的公司才更願意嘗試四天制」〕|Supports/Contradicts/Neutral:中立偏相關——四天制員工的自評投入度確實較高,但不能判定為「四天制導致投入度提升」這個因果Claim的支持證據|Confidence:低(相關性研究、有明確的自我選擇偏誤、且作者自己已提出替代解釋)」
【差別在哪】
第一種在描述「結果聽起來正不正面」,第二種在描述「這個結果能不能撐住我要驗證的那句因果Claim」。矩陣要回答的問題是第二種,不是第一種。
輸出格式規格(要照著做的人再展開)
- 每一列都要有八個欄位,缺的欄位標「未提及」,不能留空或代填。
- Supports/Contradicts/Neutral欄位一定要附原文佐證或段落出處。
- 結論摘要禁止用「研究顯示」「研究都證明」這類暗示多篇共識的語言,除非真的有多篇高強度證據一致支持。
- 證據缺口清單要誠實列出,不能省略。
【文獻A】Claim:四天工作制可以提升員工的生產力|Source:內部人資報告(未同儕審查)|Study Type:類實驗(無對照組)|Sample:n≈200|Evidence:弱—中|Limitation:作者自陳排班系統優化可能是真正原因|Supports/Contradicts/Neutral:部分支持|Confidence:低
【矩陣結論摘要】
目前僅有低強度的初步觀察性證據,缺乏對照實驗,尚不足以下因果結論。
【證據缺口清單】
沒有RCT或跨公司對照組研究;沒有跨產業大樣本;沒有一年以上長期追蹤。
08工具怎麼挑
這幾支都做得到——差別在你手上有哪一支、資料能不能外流。標「起手」的是不知道從哪支開始時的建議,不是限定。
| 工具 | 什麼時候用 | 為什麼 | 注意 |
|---|
NotebookLM ↗起手 多份文獻交叉比對的根基工具 | 文獻多、要先建立一個可反覆詢問的文獻庫時 | 能針對上傳的PDF本身作答並標出出處頁碼,減少憑空編出引用的風險。 | 不擅長自動判斷「相關性≠因果」,這一步仍要人設計好Prompt規則並逐列檢查。 |
Claude ↗ 長文本輸入穩定,適合一次貼多篇全文逐篇抽取欄位 | 要一次貼多篇全文,逐篇抽取欄位 | 長文本輸入穩定,能忠實抽取跨篇重複出現的方法與限制描述。 | 同樣要求每欄附出處,不能只憑摘要判斷。 |
ChatGPT ↗ 適合對矩陣草稿做因果誤用與過度概化的稽核 | 已有矩陣草稿,要做稽核與抓因果誤用 | 對「逐項條列式檢查」這種稽核任務執行得穩定。 | 稽核完的建議仍要人核准才能真的改矩陣,不能自動採信。 |
| 自訂 GPT/Claude Project | 團隊要固定用同一套矩陣規則反覆比對 | 欄位定義與分級標準寫進系統指令,所有人用同一個入口,改規則時一次改到位。 | 分享範圍要設對,規則更新後要通知使用者。 |
四、不要做錯這幾關不下放
這一區是踩過的坑與該守的線。標「不下放」的步驟請不要交給 AI 決定;Checklist 是拿來驗收的,不是拿來勾好看的。
09會卡住與會做錯的地方
會卡住的地方(流程困難點)
- 把相關性寫成因果
- AI常用「提升」「導致」「證明」這類因果語言,描述觀察性或相關性研究的結果,讀起來像已證實的因果關係。
- 把單篇/小樣本包裝成普遍結論
- 一篇樣本數只有幾十人的案例研究,被寫成「多項研究顯示」,暗示了實際不存在的共識。
- 找不到原始研究卻照樣填
- 只查得到二手引用或新聞報導轉述,仍在Source欄位填出處,讓證據強度看起來比實際高。
- Confidence欄位被AI自己定案
- AI標了「高信心」就直接被採用,那應該是人看完整張矩陣後的判斷,不是AI自評完就算數。
會做錯的地方(常見失敗方式)
把相關性寫成因果AI用「提升」「導致」描述觀察性/相關性研究的結果,讀起來像已證實的因果關係。
怎麼修規則明訂觀察性/相關性/案例研究的Supports欄位禁用因果語言,並要求AI改寫成中性描述。
單篇證據被包裝成「研究都證明」只有一篇低強度證據,摘要卻寫「研究顯示」「多項研究都證明」,暗示共識其實不存在。
怎麼修規則規定只有一篇證據時只能寫「該篇研究指出」,且Evidence強度要如實標低。
二手轉述被當成原始來源只找得到新聞報導或別人論文裡的引用,卻直接把它當Source填,Evidence強度因此被高估。
怎麼修找不到原始研究全文時,Source標「未找到原始來源」,Evidence不得高於「弱」。
Confidence被AI自己定案AI自己給的信心程度被直接採用,沒有經過人在看完整張矩陣後的覆核。
怎麼修Confidence欄位只當AI的建議值,最終值由人覆核定案。
缺欄位用常識代填文獻沒寫樣本數,AI用「一般而言」的常識推測填上一個數字,讓矩陣看起來比實際完整。
怎麼修缺的欄位一律標「未提及」,不得用常識或其他文獻的內容代填。
證據缺口清單被省略矩陣做完只交出支持/反駁的列表,沒有列出「這個Claim目前根本沒有高強度證據」的部分,讀者以為問題已經有答案。
怎麼修證據缺口清單是矩陣的必要產出之一,不得省略,且要放進最終報告。
其他注意事項
- AI很容易把相關性研究的結果用「導致」「提升了」這類因果語言描述,要逐列檢查。
- 只有一篇證據卻寫成「研究顯示」「多項研究都證明」,是這個方法要擋的核心錯誤。
- 找不到原始研究、只有二手轉述時如果照樣填進Source,整張矩陣的可信度從根基就垮了。
10人工把關與安全限制
AI/Agent/Tool 介入在哪幾步
| 流程位置 | 誰 | 做什麼/怎麼做 |
|---|
| 抽取階段 | AI | 逐篇抽取Source/Study Type/Sample/Evidence/Limitation 每一欄找不到就標「未提及」,不得用常識或其他文獻的內容代填。 |
| 判定階段 | AI | 逐篇判定Supports/Contradicts/Neutral 必須附原文引用或段落出處;觀察性、相關性、案例研究一律不得使用因果語言。 |
| 使用階段 | Agent | 做成共用證據矩陣助手 欄位定義與分級標準寫進系統指令,全團隊用同一個入口,標準改一次就到位。 |
這幾關不下放
- Claim與分級標準
- 要驗證的主張怎麼寫、證據強度怎麼分級,由人事先訂定。
- 證據不足的認定
- 找不到原始研究的列,由人確認要標「證據不足」,不能被刪除或亂填一個來源。
- 相關與因果的最終判斷
- AI的判定只是草稿,相關性是否被誤寫成因果,由人最終覆核。
- Confidence定案
- 信心程度由人在看過整張矩陣後定案,AI只給建議值。
- 結論摘要與證據缺口清單
- 矩陣的整體結論、以及仍待更多證據的部分,由人撰寫定稿,不能只交出逐列表格。
安全與權限限制
- 文獻中的機密或未發表內容
- 上傳給AI或NotebookLM的文獻若含未發表的內部報告或商業機密,先確認工具的資料使用政策,不能公開的先移除或代稱。
- 來源真實性
- AI有時會「編出」看起來合理的作者名或期刊名,Source欄位務必回頭核對原文獻,不可直接採信AI生成的引用資訊。
- 矩陣結論不得替代法律或醫療等專業判斷
- 涉及法規遵循、臨床決策的Claim,矩陣只是文獻整理,最終判斷仍需相應領域的專業人員簽核。
- 共用矩陣助手的分享範圍
- 系統指令裡若含團隊的分級標準與內部案例,分享範圍要設對,避免外流。
11Checklist 與驗收標準
做的時候逐項打勾
做完了才檢查:全部成立才算完成
- Claim寫成一句可以被支持或反駁的明確陳述,不是模糊題目。
- 每一列都有八個欄位,缺的欄位標「未提及」,沒有用常識代填。
- Study Type與Evidence強度依照事先訂好的分級標準判定,不是憑印象。
- 觀察性/相關性/案例研究的Supports欄位沒有使用因果語言。
- 只有一篇證據支持的立場,摘要沒有寫成「研究顯示」「多項研究證明」。
- 找不到原始研究、只有二手轉述的列,Source已標明且Evidence已調降。
- Confidence欄位已由人在看過整張矩陣後覆核定案,不是AI自評直接採用。
- 證據缺口清單已列出並放進最終報告,沒有被省略。
- 矩陣放在共用位置或已核對過原始文獻,不是只存在單次對話裡。
五、延伸看別人做過,然後往下一步
看看別人實際做過的樣子,再決定下一步往哪走。沒有找到可查證案例的方法,這裡會直說沒有,不拿相似的案例充數。
12實際案例
三篇文獻,沒有一篇撐得住「研究顯示」這四個字
當時的狀況:一個地方政府的研考小組要決定要不要在下一季推動「四天工作制試辦方案」,主管請幕僚整理「文獻怎麼說」。幕僚原本打算把手上蒐集到的三篇資料(一份企業內部報告、一份問卷調查、一份案例訪談)簡單摘要成「多項研究顯示四天工作制能提升生產力」,放進簡報第一頁。
AI 做了什麼- 逐篇抽取Source、Study Type、Sample、Evidence、Limitation,標出三篇分別是類實驗(無對照組)、橫斷面問卷(相關性)、案例訪談(無量化指標)。
- 指出第一篇的因果語言誤用:作者自己在討論段落寫「效率提升可能與排班系統優化有關」,因此把Supports欄位改判為「部分支持」而非「支持」。
- 指出第二篇的自我選擇偏誤:橫斷面設計無法排除「本來投入度高的公司才敢試四天制」,因此對因果Claim只能判「中立偏相關」而非「支持」。
- 列出證據缺口清單:沒有任何RCT或跨公司對照組研究、沒有大樣本跨產業資料、沒有一年以上的長期追蹤。
人做了什麼- 核對AI的抽取結果,確認Sample數字與文獻原文一致,沒有被AI誇大或簡化。
- 把原本要寫的「研究顯示能提升生產力」,改成「目前僅有低強度初步觀察,缺乏對照實驗,尚不足以下因果結論」。
- 把證據缺口清單直接放進簡報,作為建議先做小規模對照試辦、而非全面推動的理由。
- 在Confidence欄位上,把AI建議的「中」全部覆核降為「低」,因為每一篇作者自己都承認限制。
結果:簡報第一頁從「研究顯示四天工作制能提升生產力」改成一張三列的證據矩陣,附上「目前證據強度偏低,建議先做小規模對照試辦」的結論。主管後續核准的是一個為期三個月、有對照組的小規模試辦,而不是直接全面推動——矩陣讓大家看清楚,手上的三篇資料本來就撐不起全面推動的決策。
待補資料:本站不提供這場試辦最終是否推動、成效如何的量化結果(本文寫作當下試辦尚未執行完)。這正是矩陣方法要示範的紅線:沒有查證到的數字或結論,就不寫成「已驗證」,這裡誠實只寫到「證據矩陣改變了決策的保守程度」為止。
13相關方法與下一步
把矩陣結論寫進正式報告矩陣是給自己核對用的工作底稿,寫進政策建議或顧問報告時還要顧格式與審核。
文獻本身的事實查核矩陣處理的是「證據強不強」,單篇文獻裡的具體數字是否被正確引用,是另一道查核。
長文獻的逐篇精讀文獻很長、要先抓重點段落再進矩陣時,需要另一套長文件工作法。
更廣的研究蒐集與提問設計矩陣需要先有夠多、夠相關的文獻可比對,蒐集與篩選文獻本身也是一個方法。
可直接使用RELATED PROMPTS
Download
這個方法的模板與 Checklist 下載包整理中——訂閱更新,上架後第一時間通知你。
這個站的做法- 有來源引用的案例都附得出可以點進去的出處;還沒查證完的另外標示,不跟已證實的混在一起。
- 可驗收每個方法都附 Checklist 與驗收標準——你要能自己驗,而不是相信 AI 說它做完了。
- 不亂編指令一律要求「材料裡沒有的不准補」,缺的標【待補】列成問題,不用漂亮的句子蓋過去。
- 不自動送出站內的指令與工具不會替你發布、寄出或執行收不回來的動作。最後一步永遠是人按下去。
- 人要把關方法裡標「不下放」的步驟,寫明白就是不要交給 AI 決定。
- 一般人照做不用寫程式。步驟寫成照著做的樣子,術語第一次出現就用白話解釋。
取得 AI 實戰工具與更新
之後會不定期整理:新方法、指令包(Prompt Pack)、Checklist 與模板。免費、無廣告;送出後會收到一封確認信,點了連結才算訂閱成功,之後每封信都附一鍵退訂。
送出即表示你同意本站的 隱私權說明:我們只儲存 Email 與同意版本,不會把 Email 和你的閱讀紀錄綁在一起。沒有點確認信就不會收到任何內容,之後也隨時可以一鍵退訂。