跳到主要內容
METHOD · 研究與資訊整理

AI 文獻證據矩陣

把好幾篇論文或報告的主張攤成一張矩陣,逐篇標明來源、研究類型、樣本與證據強度,不讓一篇研究被寫成「研究都證明了」。

情境:研究與資訊整理難度:進階|要先備料起手工具:NotebookLM
這是研究與資訊整理情境下的方法之一(共 8 個)· 看這個情境全部 →
一、這是什麼三十秒判斷關不關你的事

先確認這一篇解的是不是你的問題。看完這兩節如果覺得不像,就不用再往下讀——省下的時間比讀完更值錢。

01解決的工作問題

顧問、政策研究者或分析師讀十幾篇論文與報告時,最常犯的錯不是讀得不夠多,而是讀完後把印象直接寫成結論——腦中留下「大部分文獻都支持」的感覺,卻沒有真的一篇一篇數過。AI讀得比人快,這個陷阱因此被放大:丟一堆文獻進去問「這些研究怎麼說」,AI很容易把一篇小樣本的相關性研究、一位作者在討論段落裡的推測、甚至只是別人論文裡引用的二手說法,全部混進同一句「研究顯示」裡吐出來,讀起來像普遍結論,其實只有一篇證據撐著,甚至那篇的研究設計根本撐不住這個結論。要擋住這件事,不能只靠「AI你要小心」,而要逼它把每條主張拆開,標明來源、研究類型、樣本、證據強度、限制,以及對原始說法是支持、反駁還是中立,最後由人判斷信心程度——這張表本身就是產出,不是寫報告前的暗中準備。

真的有人這樣做過外部佐證 1 則

以下都是具名機構的公開案例,每個來源都經過連結實測。數字只寫來源講得出來的;來源沒講的,這裡就寫未公開。

VDI/VDE Innovation + Technik(使用Elicit AI)/CSIRO(獨立同儕審查佐證)德國/澳洲 · 2025

VDI/VDE用Elicit這款AI研究助理做客戶委託的系統性文獻回顧,把AI逐欄位抽取結果(每篇論文是否符合各項納入標準)匯出成表格,再由團隊人工核對每一筆抽取結果背後的原文引用段落才定案。CSIRO與塔斯馬尼亞大學團隊則在同儕審查期刊上,獨立比較Elicit/GPT-4-Turbo與5位人類專家抽取11個結構化欄位的一致性,作為交叉驗證。

成效VDI/VDE案例:單次文獻回顧規模從50篇擴大到550篇(11倍),人工比對驗證AI正確抽取1,502/1,511個資料點(準確率99.4%)。CSIRO研究:AI判斷「資料是否存在」與人類一致性低(Cohen's kappa<0.10),但AI確實抽取出資料時品質顯著優於門檻值(t=6.91, p<0.001),幻覺率低(29個標記案例中僅1例對不上原文),結論主張LLM能「輔助」但不能「可靠地自動化」證據抽取階段。

不能照抄的理由VDI/VDE案例是Elicit(工具供應商)自己發布的客戶案例研究,屬於商業宣傳性質的官方頁面,不是獨立稽核;案例頁也沒有逐欄列出「來源/研究類型/樣本數/證據強度/支持-反駁-中立」的完整矩陣欄位。CSIRO研究是真正獨立的同儕審查佐證,但故事比較保守——不是一篇漂亮的成功案例,比較適合放在「AI不是萬能,仍需人工把關」的段落。

這些案例與其他外部佐證,完整收在找靈感 →

02什麼時候用、什麼時候別用

什麼情況下該用這一套

什麼情況下別用

只有一篇文獻時
矩陣的意義是讓多篇互相比對;只有一篇時沒有Supports/Contradicts的對照對象,直接誠實寫「僅有一篇資料,證據不足」就好,不必硬做矩陣。
來不及查證、要立即下結論的場合
逐篇核對來源與欄位需要時間,矩陣不是應急工具,臨時要交代的口頭意見不該假裝經過了矩陣式的查核。
只找得到二手轉述、找不到任何原始研究時
Source欄位填不出來,矩陣從根基就立不住,這時該做的是先去找原始文獻,不是先做矩陣。
想用來替既定立場找證據背書
矩陣的紀律是連反駁證據都要放進去;如果目的是替已經決定的結論湊佐證,矩陣會被做成篩選過的假象,不如不做。

誰會用到

顧問
你最常要在報告截止前把十幾篇資料讀完,矩陣是逼自己不要用印象下結論的機制,交付前的把關步驟不能省。
數據分析
你多半已經在做類似的事,只是沒有固定成表格。把欄位定義訂死,之後每次分析的證據強度標準才不會跟著心情漂移。
PM
你可能不寫矩陣本身,但要看得懂它——決定要不要照文獻建議調整專案方向前,先看證據缺口清單,比看結論摘要更重要。
法務
合規或法規影響評估常常要引用外部研究佐證,矩陣能避免把單一意見書或個案寫成「法界普遍認為」。
公務員
政策簡報最容易把初步觀察寫成「研究顯示」,矩陣裡的證據缺口清單是給決策者看的,不是拿掉不寫比較好看。

所屬工作情境

二、整件事怎麼跑先看圖,再看逐步

先用一張圖抓全貌,再看逐步展開。圖看不懂沒關係,下一節會把每一步實際在做什麼、誰做,一條一條講清楚。

03流程圖

這張圖是整篇的骨架:輸入 → 步驟 → 困難點 → AI/Agent/Tool 介入 → 人工檢查 → 產出。紅框是最常出事的位置,綠框是不能下放的人工檢查點,粗框是中止條件。後面每一節都是在展開圖上的某一格。

AI 文獻證據矩陣:把「一篇研究」與「研究都證明了」分開
AI 文獻證據矩陣:把「一篇研究」與「研究都證明了」分開直向流程圖。輸入是待驗證的Claim、待比對的文獻全文或方法與結果段落,以及事先訂好的證據強度分級標準。第一步由人定義Claim並訂分級標準;第二步由人蒐集文獻並確認是原始研究而非二手轉述;第三步由AI逐篇抽取Source、Study Type、Sample、Evidence、Limitation,缺的欄位一律標未提及;第四步由AI逐篇判定Supports、Contradicts或Neutral並附原文佐證,觀察性與相關性研究不得使用因果語言;第五步進入人工檢查點,由人核對是否把相關性寫成因果、把單篇證據寫成普遍結論;第六步由Agent把定案的規則寫進共用的證據矩陣助手;產出是定稿的Evidence Matrix、經人覆核的信心程度、以及誠實列出的證據缺口清單。右側標示三個困難點:二手轉述被當成原始來源、相關性被寫成因果、單篇證據被包裝成研究都證明了。並標示中止條件:找不到原始研究全文時該列標為證據不足,不得判定支持或反駁。人工檢查點有退回線回到抽取欄位的步驟。抽取欄位有誤或缺原文出處,回頭重抽INPUT / 輸入待驗證的Claim + 待比對文獻(全文或方法與結果段落)+ 證據強度分級標準文獻只有摘要沒有方法與結果段落時,Study Type與Sample無法判斷HUMAN / 人工步驟人定義Claim並訂好證據強度分級標準Claim要寫成可支持/反駁的一句話,不是模糊題目HUMAN / 人工步驟人蒐集文獻,確認是原始研究而非二手轉述只有新聞報導或別人引用時,先標明尚未找到原始來源AI / AI 介入AI逐篇抽取Source/Study Type/Sample/Evidence/Limitation缺的欄位標「未提及」,不得用常識代填AI / AI 介入AI逐篇判定Supports/Contradicts/Neutral並附原文佐證觀察性/相關性/案例研究不得用因果語言CHECKPOINT / 人工檢查人核對矩陣,抓相關性當因果、單篇當通例的錯誤AGENT / 助手接手定案規則寫進共用證據矩陣助手,之後比對用同一套標準OUTPUT / 產出定稿的Evidence Matrix + 信心程度覆核 + 證據缺口清單RISK / 困難點AI把只有二手轉述的來源當成原始研究填進Source,Evidence強度被高估RISK / 困難點AI把相關性研究的結果寫成因果結論,例如用「導致」「提升了」這類語言RISK / 困難點只有一篇低強度證據,摘要卻寫成「研究顯示」「多項研究都證明」STOP / 中止條件找不到原始研究全文時,該列標「證據不足」,不得填入支持或反駁,中止判定直到找到原始來源
看圖重點:這張圖裡最容易被跳過的是第二步「確認是原始研究」——很多人蒐集資料時是先存了一堆別人引用的說法,等到進矩陣才發現找不到原始論文。另外,中止條件不是「證據不足就不能用」,而是「證據不足時不能假裝已經判定支持或反駁」,這兩者的差別正是這個方法要守住的紅線。
純文字流程表(手機/螢幕閱讀器建議看這張)
AI 文獻證據矩陣:把「一篇研究」與「研究都證明了」分開(純文字流程表)
類型/角色流程步驟這一步的困難點/中止條件
1Human待驗證的Claim + 待比對文獻(全文或方法與結果段落)+ 證據強度分級標準
文獻只有摘要沒有方法與結果段落時,Study Type與Sample無法判斷
2Human人定義Claim並訂好證據強度分級標準
Claim要寫成可支持/反駁的一句話,不是模糊題目
3Human人蒐集文獻,確認是原始研究而非二手轉述
只有新聞報導或別人引用時,先標明尚未找到原始來源
4AIAI逐篇抽取Source/Study Type/Sample/Evidence/Limitation
缺的欄位標「未提及」,不得用常識代填
困難點/風險AI把只有二手轉述的來源當成原始研究填進Source,Evidence強度被高估
5AIAI逐篇判定Supports/Contradicts/Neutral並附原文佐證
觀察性/相關性/案例研究不得用因果語言
困難點/風險AI把相關性研究的結果寫成因果結論,例如用「導致」「提升了」這類語言
困難點/風險只有一篇低強度證據,摘要卻寫成「研究顯示」「多項研究都證明」
6Checkpoint人核對矩陣,抓相關性當因果、單篇當通例的錯誤
失敗與中止條件找不到原始研究全文時,該列標「證據不足」,不得填入支持或反駁,中止判定直到找到原始來源
7Agent定案規則寫進共用證據矩陣助手,之後比對用同一套標準
8Output定稿的Evidence Matrix + 信心程度覆核 + 證據缺口清單

回流線:待驗證的Claim + 待比對文獻(全文或方法與結果段落)+ 證據強度分級標準 → 人定義Claim並訂好證據強度分級標準(退回);人定義Claim並訂好證據強度分級標準 → 人蒐集文獻,確認是原始研究而非二手轉述(退回);人蒐集文獻,確認是原始研究而非二手轉述 → AI逐篇抽取Source/Study Type/Sample/Evidence/Limitation(退回);AI逐篇抽取Source/Study Type/Sample/Evidence/Limitation → AI逐篇判定Supports/Contradicts/Neutral並附原文佐證(退回);AI逐篇判定Supports/Contradicts/Neutral並附原文佐證 → 人核對矩陣,抓相關性當因果、單篇當通例的錯誤(退回);人核對矩陣,抓相關性當因果、單篇當通例的錯誤 → AI逐篇抽取Source/Study Type/Sample/Evidence/Limitation(抽取欄位有誤或缺原文出處,回頭重抽);人核對矩陣,抓相關性當因果、單篇當通例的錯誤 → 定案規則寫進共用證據矩陣助手,之後比對用同一套標準(退回);定案規則寫進共用證據矩陣助手,之後比對用同一套標準 → 定稿的Evidence Matrix + 信心程度覆核 + 證據缺口清單(退回)

Mermaid 原始碼(貼進 Mermaid Live 或 draw.io 可再編輯)
可直接複製,改成你自己的流程
flowchart TD
    in1(["<b>Human</b><br/>待驗證的Claim + 待比對文獻(全文或方法與結果段落)+ 證據強度分級標準<br/><small>文獻只有摘要沒有方法與結果段落時,Study Type與Sample無法判斷</small>"])
    s1["<b>Human</b><br/>人定義Claim並訂好證據強度分級標準<br/><small>Claim要寫成可支持/反駁的一句話,不是模糊題目</small>"]
    s2["<b>Human</b><br/>人蒐集文獻,確認是原始研究而非二手轉述<br/><small>只有新聞報導或別人引用時,先標明尚未找到原始來源</small>"]
    a1[/"<b>AI</b><br/>AI逐篇抽取Source/Study Type/Sample/Evidence/Limitation<br/><small>缺的欄位標「未提及」,不得用常識代填</small>"/]
    a2[/"<b>AI</b><br/>AI逐篇判定Supports/Contradicts/Neutral並附原文佐證<br/><small>觀察性/相關性/案例研究不得用因果語言</small>"/]
    c1{{"<b>Checkpoint</b><br/>人核對矩陣,抓相關性當因果、單篇當通例的錯誤"}}
    g1[["<b>Agent</b><br/>定案規則寫進共用證據矩陣助手,之後比對用同一套標準"]]
    o1(["<b>Output</b><br/>定稿的Evidence Matrix + 信心程度覆核 + 證據缺口清單"])
    r1>"<b>Risk</b><br/>AI把只有二手轉述的來源當成原始研究填進Source,Evidence強度被高估"]
    r2>"<b>Risk</b><br/>AI把相關性研究的結果寫成因果結論,例如用「導致」「提升了」這類語言"]
    r3>"<b>Risk</b><br/>只有一篇低強度證據,摘要卻寫成「研究顯示」「多項研究都證明」"]
    st1[/"<b>Stop</b><br/>找不到原始研究全文時,該列標「證據不足」,不得填入支持或反駁,中止判定直到找到原始來源"\]

    in1 --> s1
    s1 --> s2
    s2 --> a1
    a1 --> a2
    a2 --> c1
    c1 --> g1
    g1 --> o1
    a1 -.->|風險| r1
    a2 -.->|風險| r2
    a2 -.->|風險| r3
    c1 ==>|中止| st1
    in1 -.->|退回| s1
    s1 -.->|退回| s2
    s2 -.->|退回| a1
    a1 -.->|退回| a2
    a2 -.->|退回| c1
    c1 -.->|抽取欄位有誤或缺原文出處,回頭重抽| a1
    c1 -.->|退回| g1
    g1 -.->|退回| o1

    classDef clsIn fill:#FFFFFF,stroke:#2C4459,stroke-width:2px,color:#141E2B
    classDef clsHuman fill:#FBFCFD,stroke:#7A8CA0,stroke-width:2px,color:#141E2B
    classDef clsAI fill:#FFF6EA,stroke:#DE9A45,stroke-width:2px,color:#141E2B
    classDef clsAgent fill:#FDEBD2,stroke:#B87A2E,stroke-width:2px,color:#141E2B
    classDef clsTool fill:#EDF2F6,stroke:#2C4459,stroke-width:2px,color:#141E2B
    classDef clsCheck fill:#E8F2EC,stroke:#3F7A5A,stroke-width:2px,color:#123024
    classDef clsOut fill:#141E2B,stroke:#141E2B,stroke-width:2px,color:#F2F6F9
    classDef clsRisk fill:#FCEFEA,stroke:#C0552F,stroke-width:2px,color:#5E2110
    classDef clsStop fill:#F7E1DB,stroke:#8E2F17,stroke-width:3px,color:#5E2110
    class in1 clsIn;
    class s1 clsHuman;
    class s2 clsHuman;
    class a1 clsAI;
    class a2 clsAI;
    class c1 clsCheck;
    class g1 clsAgent;
    class o1 clsOut;
    class r1 clsRisk;
    class r2 clsRisk;
    class r3 clsRisk;
    class st1 clsStop;

04完整步驟圖的文字版,逐步展開

一句話版(快速回顧)

  1. 先把要驗證的說法寫成一句可支持或反駁的Claim,並訂好證據強度分級標準。
  2. 蒐集文獻,確認是原始研究而非二手轉述,缺原文的先標明。
  3. 請AI逐篇抽取Source、Study Type、Sample、Evidence、Limitation,缺的欄位標未提及。
  4. 請AI逐篇判定支持、反駁或中立,並要求附原文佐證,不得把相關性寫成因果。
  5. 人核對整張矩陣,抓出過度概化與因果誤用的地方,Confidence由人覆核定案。
  6. 定稿矩陣,誠實列出證據缺口清單,不要把單篇研究寫成研究都證明了。

完整版(每一步誰做、產出什麼)

誰做步驟與說明
1Human定義待驗證的主張
把要驗證的說法寫成一句可以被支持或反駁的陳述(Claim),不是模糊的題目,並先訂好證據強度分級標準。→ 已定義的Claim與分級標準
2Human蒐集文獻並確認來源
把待比對的論文或報告全文,或至少方法與結果段落整理好,確認是原始研究而非二手轉述,找不到原始文獻的先標明。→ 已核對的文獻庫
3AI逐篇抽取欄位
針對每一篇,抽取Source、Study Type、Sample、Evidence強度與Limitation,找不到的欄位標「未提及」,不得用常識代填。→ 逐篇欄位草稿
4AI逐篇判定支持/反駁/中立
對照Claim,逐篇判定Supports/Contradicts/Neutral,並附原文佐證與初步Confidence建議;相關性研究不得判定為因果支持。→ 逐篇判定草稿
5Human人核對矩陣
逐列核對,抓出AI把相關性寫成因果、把單篇小樣本寫成普遍結論、或用二手轉述充當原始來源的地方,退回重做。→ 核對後的矩陣
6Agent做成可重複使用的比對助手
把欄位定義、分級標準與紅線寫進系統指令,之後每次比對新文獻都用同一份標準,不必每次重新講規則。→ 共用證據矩陣助手
7Human產出定稿矩陣與信心程度摘要
統整整張矩陣的信心程度、標出仍證據不足的主張,交付前再檢查一次沒有把單篇研究寫成「研究都證明了」。→ 定稿Evidence Matrix
三、動手做備料 → 指令 → 產出 → 工具

這一區是真的動手:先備料、再貼指令、然後對照產出應該長什麼樣。手上是哪一支 AI 都做得完,差別寫在最後的工具那一節。

05開始前要準備什麼標「必要」的沒備齊就先別開始

待驗證的Claim必要
寫成一句可以被支持或反駁的明確陳述,不是模糊的題目。例如「四天工作制可以提升員工的生產力」而不是「四天工作制好不好」。
待比對的文獻必要
至少要有方法與結果段落,只有摘要無法判斷Study Type與Sample。優先找得到全文的原始研究。
證據強度分級標準必要
先訂好像「RCT/統合分析=強、有對照組的類實驗=中、觀察性/相關性研究=弱、案例研究/專家意見=極弱」這樣的規則,不然每次評分標準會漂移。
文獻的後設資料可選
作者、年份、出處、是否經同儕審查,找不到的先標明未提及。
NotebookLM或類似工具的文獻庫可選
文獻多篇時先建一個可反覆詢問、能標出處頁碼的文獻庫,比每次貼全文更穩定。

餵進去的東西要長這樣

待驗證的Claim(一句可支持/反駁的陳述)+ 待比對文獻(全文或至少方法與結果段落)+ 證據強度分級標準。

Claim:四天工作制可以提升員工的生產力

證據強度分級標準:RCT/統合分析=強;有對照組的類實驗=中;觀察性研究/相關性調查=弱;案例研究/專家意見/未同儕審查報告=極弱。

文獻:
【文獻A】類實驗,某科技公司(約200人)試行四天工作制6個月,內部人資報告,無對照組……
【文獻B】橫斷面問卷,850名跨產業知識工作者……
【文獻C】案例研究,單一公司45人訪談報告……

06Prompt(快速/完整/進階)

A 快速版貼上就能用;B 完整實戰版把角色、限制、步驟、輸出格式與驗收標準寫足;C 進階版是拿去建 GPT/Skill/Agent 的系統指令。三種都附可替換變數、使用範例、預期輸出與人工確認點。

三種版本共通的紅線
三版都不適合用在
  • 不要把只有一篇證據的立場寫成「研究顯示」或「多項研究都證明」。
  • 不要把相關性研究、案例研究的結果寫成因果結論。
  • 不要用AI自己給的Confidence判定直接定案,跳過人工覆核。
三版都必須由人確認
  • Claim的定義與證據強度分級標準由人事先訂定。
  • 找不到原始研究、只能找到二手轉述的列,由人確認標「證據不足」而非刪除或亂填。
  • 相關性是否被誤寫成因果,由人最終覆核。
  • Confidence欄位由人在看過整張矩陣後定案。
  • 矩陣的結論摘要與證據缺口清單由人撰寫定稿。
A
A. 快速版

手上有幾篇文獻和一個要驗證的主張,想先拿到一份逐篇的證據矩陣草稿。

適合的工具ChatGPTClaude
👇 直接複製,{ } 換成你的內容
我要驗證的主張(Claim)是:{Claim}

以下是我蒐集到的文獻,請針對每一篇建立證據矩陣的一列,欄位為:
- Claim:沿用我給的主張,不要換句話說
- Source:作者/年份/出處
- Study Type:研究類型(RCT/類實驗/觀察性研究/案例研究/文獻回顧/統合分析/專家意見/其他)
- Sample:樣本數與組成,文獻沒寫就填「未提及」
- Evidence:證據強度(強/中/弱),並說明分級理由
- Limitation:這篇研究自己承認或明顯存在的限制
- Supports/Contradicts/Neutral:對我的Claim是支持、反駁還是中立,並附原文佐證
- Confidence:你對這一列判定的信心(高/中/低),並說明為什麼

規則:
1. 不得把相關性研究寫成因果結論。
2. 找不到某個欄位的資訊,一律標「未提及」,不得用常識或其他文獻內容代填。
3. 只有一篇證據支持某個立場時,不得使用「研究顯示」「研究都證明」這類暗示多篇共識的語言,只能寫「該篇研究指出」。
4. 每一列的Supports/Contradicts/Neutral判定都要附原文引用或段落出處,不得只憑摘要判斷。

待比對文獻:{貼上}

可替換變數

變數要換成什麼
{Claim}你要驗證的主張,寫成一句可以被支持或反駁的陳述。
{貼上}待比對文獻全文或至少方法與結果段落,可多篇分開貼。
完整使用範例(照這樣填)
我要驗證的主張(Claim)是:四天工作制可以提升員工的生產力

待比對文獻:
【文獻A】類實驗研究,某科技公司(約200名員工)試行四天工作制6個月,作者為內部人資報告,未經同儕審查。方法為受試前後比較同一批員工的產出指標,無對照組。結果:主觀自評「工作效率提升」的比例從38%增加到61%;實際產出指標(客服工單處理量)僅上升4%,且同期公司也調整了排班系統。作者在討論段落寫道:「效率提升可能與四天工作制有關,也可能反映了排班系統優化的效果,兩者無法完全區分。」

【文獻B】橫斷面問卷調查,針對850名不同產業的知識工作者,比較目前實行四天與五天工作制員工的自評壓力與投入度分數。無對照實驗設計,僅為相關性分析。結果:四天工作制員工的自評投入度平均分數高於五天制員工(相差0.6分,5分量表),作者提醒「這是橫斷面資料,可能反映的是壓力較低、投入度本來就高的公司才更願意嘗試四天制,而非四天制本身提升了投入度」。

【文獻C】案例研究,單一公司(45人)導入四天工作制一年後的敘事訪談報告,無量化指標,僅有管理層與員工的訪談摘要,多數受訪者表示「感覺比較不累」,報告未提供離職率、營收或產出的具體數字對照。
預期輸出範例(拿到的東西應該長這樣)
【文獻A】
Claim:四天工作制可以提升員工的生產力
Source:內部人資報告(未同儕審查),約200名員工的科技公司
Study Type:類實驗(前後對照,無對照組)
Sample:n≈200,單一公司科技業員工
Evidence:弱—中(有實際產出指標,但無對照組,且與排班系統調整同時發生,無法排除混淆變項)
Limitation:作者自陳排班系統優化可能是真正原因,因果無法區分;未經同儕審查
Supports/Contradicts/Neutral:部分支持(主觀自評提升明顯,但客觀產出僅微幅上升4%,且作者自己承認因果不明確,不能算完全支持)
Confidence:低(單一公司、無對照組、作者自己都指出混淆因素)

【文獻B】
Source:850人跨產業問卷(橫斷面)
Study Type:相關性調查
Sample:n=850跨產業知識工作者
Evidence:弱(相關性研究,非因果,作者明確提醒自我選擇偏誤)
Limitation:橫斷面設計無法排除「本來投入度高的公司才敢試四天制」的反向因果
Supports/Contradicts/Neutral:中立偏相關(有正相關,但作者自己否定因果解讀,不能算支持「導入會提升」這個因果Claim)
Confidence:低

【文獻C】
Source:單一公司45人訪談報告
Study Type:案例研究(質性訪談)
Sample:n=45,單一公司
Evidence:極弱(無量化指標,僅主觀敘述)
Limitation:沒有離職率、營收或產出等客觀指標對照;無法類推到其他產業或規模
Supports/Contradicts/Neutral:中立(提供的是感受敘述,不足以判定對生產力Claim的支持或反駁)
Confidence:低

【矩陣小結】三篇文獻沒有一篇是能撐住「四天工作制提升生產力」這個因果Claim的高品質證據——沒有RCT、沒有跨公司對照組。若寫成「研究顯示四天工作制能提升生產力」是錯的;誠實的寫法是「目前多為低證據強度的初步觀察,缺乏對照實驗,尚不足以下因果結論」。

常見錯誤用法

  • 把「樣本不足」或「未提及」的欄位直接刪掉不顯示。那些空白告訴你矩陣的邊界在哪。
  • 看到Evidence標「弱」就把那一列從矩陣裡拿掉。弱證據也是證據,拿掉等於竄改了整體證據分布。
  • 只看Supports那一欄就寫結論,跳過Confidence與Limitation欄位。
這一版另外不適合

沒有額外的,看上面「三種版本共通的紅線」那一段就好。

缺少資料時怎麼辦

文獻只有摘要、沒有方法與結果段落時,Study Type與Sample常常判斷不出來,AI會傾向用摘要裡的形容詞猜,這時要求它一律標「未提及」。

這一版另外要人確認

沒有額外的,看上面「三種版本共通的紅線」那一段就好。

B
B. 完整實戰版

矩陣草稿有了,要在人工核對之前,先請AI對草稿做一次自我稽核,抓出因果誤用、過度概化與來源問題。

適合的工具ChatGPTClaude
👇 直接複製,{ } 換成你的內容
以下是我請AI逐篇建立的證據矩陣草稿,以及原始的Claim。請針對每一列做稽核,不要重新產生矩陣,只做檢查:

1.【因果誤用檢查】逐列檢查Study Type若為觀察性研究/相關性調查/案例研究,Supports/Contradicts/Neutral欄位或其說明是否使用了「導致」「證明」「使…提升」這類因果語言。有的話標記【因果誤用】並改寫為正確的相關性描述。
2.【過度概化檢查】檢查整份矩陣的結論摘要(如果我有附)是否用「研究顯示」「多項研究都證明」這類語言,但實際上只有1篇或少數低強度證據支持。有的話標記【過度概化】並提出更誠實的寫法。
3.【來源檢查】逐列檢查Source欄位,若寫的是「引用自XX的說法」「根據XX報導」而非原始研究本身,標記【二手來源,非原始研究】,並說明這一列的Evidence強度應該調降。
4.【Confidence覆核】針對Confidence欄位標「中」以上的列,說明支持這個信心程度的具體理由是什麼;理由不足的降級為「低」。
5.【證據缺口清單】列出Claim目前完全沒有高強度證據(RCT/統合分析)支持或反駁的部分,這份清單要放進最終報告,不要省略。

原始Claim:{貼上}
證據矩陣草稿:{貼上}

可替換變數

變數要換成什麼
{貼上}你要驗證的原始Claim。
{貼上}AI草擬的證據矩陣草稿(逐列文字或表格皆可)。
完整使用範例(照這樣填)
原始Claim:四天工作制可以提升員工的生產力

證據矩陣草稿:
【第1列】文獻A|Source:內部人資報告|Study Type:類實驗|Evidence:中|Supports:支持,四天工作制導致員工工作效率提升
【第2列】文獻B|Source:根據媒體報導引述的問卷調查|Study Type:相關性調查|Evidence:中|Supports:支持
【第3列】文獻C|Source:單一公司訪談報告|Study Type:案例研究|Evidence:中|Supports:支持

結論摘要:研究顯示四天工作制能有效提升生產力。
預期輸出範例(拿到的東西應該長這樣)
【因果誤用檢查】
第1列:Supports欄位寫「導致員工工作效率提升」——文獻A是類實驗、無對照組,且作者自己承認排班系統調整可能是真正原因,這是因果誤用。改寫為:「與工作效率自評提升同時發生,但因無對照組且存在排班系統變動的混淆變項,不能判定為因果」。

【過度概化檢查】
結論摘要「研究顯示四天工作制能有效提升生產力」是過度概化——三篇證據裡沒有一篇是RCT或跨公司對照研究,且文獻B與C的作者都在文中提醒相關性或自選偏誤問題。誠實寫法應為:「目前僅有低強度的初步觀察性證據,缺乏對照實驗,尚不足以下因果結論」。

【來源檢查】
第2列的Source寫「根據媒體報導引述的問卷調查」——這是二手轉述,不是原始研究本身。這一列的Evidence強度應調降為「弱」,並註記「尚未找到原始問卷報告,來源為媒體轉述」。

【Confidence覆核】
三列的Confidence都應該是「低」,不是草稿裡標的「中」——沒有一篇有對照組、沒有一篇是跨產業或跨公司的大樣本,且每篇作者自己都承認限制。

【證據缺口清單】
- 沒有任何RCT或準實驗設計(有對照組)驗證四天工作制對客觀產出指標的因果效果。
- 沒有跨產業、跨公司規模的大樣本研究。
- 沒有長期(一年以上)追蹤資料,判斷效果是否隨時間衰退。

常見錯誤用法

  • 把稽核結果直接當成新的矩陣貼進報告,沒有回頭真的去改那三個因果誤用的地方。
  • 看到證據缺口清單就跳過不寫進報告——那份清單通常比矩陣本身更重要,它告訴讀者哪裡還不能下結論。
  • 拿稽核結果去說服自己原本的結論是對的,而不是拿它去修正結論。
這一版另外不適合

沒有額外的,看上面「三種版本共通的紅線」那一段就好。

缺少資料時怎麼辦

矩陣草稿裡沒有寫Source原文出處時,AI無法判斷是不是二手轉述,稽核會直接跳過來源檢查,這一步一定要求AI在草稿階段就附段落出處。

這一版另外要人確認

沒有額外的,看上面「三種版本共通的紅線」那一段就好。

C
C. 進階版(做成共用的證據矩陣助手)

團隊要固定用這套規則比對文獻,做成共用的證據矩陣建構助手,讓每個人比對出來的欄位定義與證據分級標準都一致。

適合的工具自訂 GPT/Claude ProjectClaude SkillNotebookLM
👇 直接複製,{ } 換成你的內容
請把以下規則,寫成一份可以直接用來建立共用「證據矩陣助手」的系統指令。

【系統指令要包含】
1. 角色與任務:只負責從使用者提供的文獻中,針對指定Claim逐篇建立證據矩陣的一列,不負責替使用者做決策或下報告結論。
2. 矩陣欄位定義(照我提供的欄位定義全文,不得增刪):Claim、Source、Study Type、Sample、Evidence、Limitation、Supports/Contradicts/Neutral、Confidence。
3. 證據強度分級標準(照我提供的分級規則,例如RCT/統合分析 &gt; 有對照組的類實驗 &gt; 觀察性/相關性研究 &gt; 案例研究 &gt; 專家意見/未同儕審查報告)。
4. 硬限制——以下情況一律不得由AI自行判定,必須標記並交由人處理:
   - 找不到原始研究、只有二手轉述或新聞報導時,Source欄位標「未找到原始來源」,Evidence強度不得高於「弱」。
   - 只有一篇證據支持某個立場時,禁止在任何欄位或摘要中使用「研究顯示」「多項研究證明」等暗示共識的語言。
   - 觀察性研究、相關性研究、案例研究的結果,Supports/Contradicts欄位不得使用「導致」「證明」等因果語言。
   - Confidence欄位的最終值必須由人在看過整張矩陣後覆核,AI只能給「建議值」。
5. 輸出格式:逐列的矩陣 + 矩陣結論摘要(不得過度概化)+ 證據缺口清單 + 需要人確認的地方。

【另外請給我】
(a) 一份「使用說明」,寫給第一次用的同事看,含三個好例子與三個壞例子。
(b) 一份「維護說明」:分級標準要更新時該改哪裡、多久檢視一次、誰負責。

矩陣欄位定義:{貼上}|證據強度分級標準:{貼上}

可替換變數

變數要換成什麼
{貼上}矩陣欄位定義全文(可用本方法的八欄位定義)。
{貼上}你們團隊採用的證據強度分級標準。
完整使用範例(照這樣填)
(貼上欄位定義:Claim/Source/Study Type/Sample/Evidence/Limitation/Supports-Contradicts-Neutral/Confidence,以及分級標準:RCT/統合分析=強,有對照組的類實驗=中,觀察性/相關性研究=弱,案例研究/專家意見=極弱)
預期輸出範例(拿到的東西應該長這樣)
【共用證據矩陣助手 系統指令】

一、你的角色
你是本團隊的證據矩陣建構助手。你只負責針對使用者指定的Claim,從提供的文獻中逐篇建立矩陣的一列,不負責替使用者下報告結論或建議決策。

二、矩陣欄位(八欄,缺一不可)
Claim|Source|Study Type|Sample|Evidence|Limitation|Supports/Contradicts/Neutral|Confidence
(欄位定義照使用者提供的全文,不得自行增刪或改寫定義)

三、證據強度分級
RCT/統合分析=強;有對照組的類實驗=中;觀察性研究/相關性調查=弱;案例研究/專家意見/未同儕審查報告=極弱。

四、一律不得由AI自行判定、必須標記交人處理的情況
1. 找不到原始研究、只有二手轉述或新聞報導——Source標「未找到原始來源」,Evidence不得高於「弱」。
2. 只有一篇證據支持某立場——禁止使用「研究顯示」「多項研究證明」等暗示共識的語言,只能寫「該篇研究指出」。
3. 觀察性/相關性/案例研究的結果——Supports/Contradicts欄位不得用「導致」「證明」等因果語言。
4. Confidence最終值——你只給建議值,最終由人在看過整張矩陣後覆核並定案。

五、輸出格式
【逐列矩陣】
【矩陣結論摘要】(不得過度概化,若證據薄弱要明講)
【證據缺口清單】(Claim目前沒有高強度證據支持或反駁的部分)
【需要人確認的地方】

──────────

【使用說明(給第一次用的同事看)】

這個助手做什麼:把你提供的文獻,逐篇整理成矩陣的一列。
這個助手不做什麼:幫你決定Claim要不要成立、幫你寫報告的結論段落。

好例子:
1. 貼上3篇文獻全文與你的Claim,說「請逐篇建矩陣」。
2. 貼上矩陣草稿,問「這一列的Confidence為什麼是中,理由夠不夠」。
3. 只有1篇證據時,問「這樣可以寫成研究顯示嗎」——它會回答不行,並說明正確寫法。

壞例子:
1.「幫我決定這個Claim到底成不成立」——那是人的判斷,助手不負責下結論。
2.「這篇報導提到的研究,直接當原始來源填進去」——沒有原始研究全文不能這樣填,要標未找到原始來源。
3.「把Confidence都填高一點,報告比較有說服力」——Confidence造假比沒有矩陣更危險。

【維護說明】
- 證據強度分級標準有更動時只改第三節,其餘不動。
- 每季抽查三份團隊產出的矩陣,確認因果語言與過度概化的檢查有沒有被落實。
- 負責人:〔填寫〕。更新後在共用位置註明版本與日期。

常見錯誤用法

  • 把Confidence欄位交給AI自己定案,跳過人工覆核那一步——那正是這個助手唯一會出錯到很危險的地方。
  • 讓助手兼著寫報告結論,一旦它開始下結論,過度概化的紅線就沒人在管了。
  • 分級標準訂完就不管,不同人各自用不同的強弱標準,矩陣之間沒辦法互相比較。
這一版另外不適合

沒有額外的,看上面「三種版本共通的紅線」那一段就好。

缺少資料時怎麼辦

沒有先給欄位定義與分級標準,助手就只能套用自己對「證據強度」的一般理解,團隊內部標準不一致的問題還是沒解決。

這一版另外要人確認

沒有額外的,看上面「三種版本共通的紅線」那一段就好。

07產出應該長什麼樣拿到的東西要長這樣

逐列矩陣(八欄)+ 矩陣結論摘要 + 證據缺口清單 + 需要人確認的地方。

完成品:同一份文獻,兩種矩陣列:有沒有把「相關」寫成「因果」

【沒有要求分辨相關與因果】
AI產出(節錄):
「文獻B:Source:850人跨產業問卷調查|Study Type:問卷調查|Evidence:中|Supports:支持——四天工作制提升了員工投入度,相差0.6分(5分量表)。」

→ 讀起來像是一個穩固的正面結果。問題是:
→ 這是橫斷面相關性資料,不是實驗,「提升」這個動詞已經在暗示因果。
→ 沒有處理自我選擇偏誤:投入度本來就高的公司,可能才是更願意嘗試四天制的那一群,順序可能反過來。
→ Evidence標「中」,但相關性研究依照分級標準最高只能到「弱」。

【強制分辨相關與因果,並要求附佐證】
AI產出(節錄):
「文獻B:Source:850人跨產業問卷調查|Study Type:橫斷面相關性調查(無對照組)|Evidence:弱(相關性研究,且作者明確提醒自我選擇偏誤)|Limitation:橫斷面設計無法排除反向因果——可能是投入度本來就高的公司才願意嘗試四天制,而非四天制本身提升投入度。〔佐證:文獻B討論段落「這是橫斷面資料,可能反映的是壓力較低、投入度本來就高的公司才更願意嘗試四天制」〕|Supports/Contradicts/Neutral:中立偏相關——四天制員工的自評投入度確實較高,但不能判定為「四天制導致投入度提升」這個因果Claim的支持證據|Confidence:低(相關性研究、有明確的自我選擇偏誤、且作者自己已提出替代解釋)」

【差別在哪】
第一種在描述「結果聽起來正不正面」,第二種在描述「這個結果能不能撐住我要驗證的那句因果Claim」。矩陣要回答的問題是第二種,不是第一種。
輸出格式規格(要照著做的人再展開)
  • 每一列都要有八個欄位,缺的欄位標「未提及」,不能留空或代填。
  • Supports/Contradicts/Neutral欄位一定要附原文佐證或段落出處。
  • 結論摘要禁止用「研究顯示」「研究都證明」這類暗示多篇共識的語言,除非真的有多篇高強度證據一致支持。
  • 證據缺口清單要誠實列出,不能省略。
【文獻A】Claim:四天工作制可以提升員工的生產力|Source:內部人資報告(未同儕審查)|Study Type:類實驗(無對照組)|Sample:n≈200|Evidence:弱—中|Limitation:作者自陳排班系統優化可能是真正原因|Supports/Contradicts/Neutral:部分支持|Confidence:低

【矩陣結論摘要】
目前僅有低強度的初步觀察性證據,缺乏對照實驗,尚不足以下因果結論。

【證據缺口清單】
沒有RCT或跨公司對照組研究;沒有跨產業大樣本;沒有一年以上長期追蹤。

08工具怎麼挑

這幾支都做得到——差別在你手上有哪一支、資料能不能外流。標「起手」的是不知道從哪支開始時的建議,不是限定。

工具什麼時候用為什麼注意
NotebookLM ↗起手
多份文獻交叉比對的根基工具
文獻多、要先建立一個可反覆詢問的文獻庫時能針對上傳的PDF本身作答並標出出處頁碼,減少憑空編出引用的風險。不擅長自動判斷「相關性≠因果」,這一步仍要人設計好Prompt規則並逐列檢查。
Claude ↗
長文本輸入穩定,適合一次貼多篇全文逐篇抽取欄位
要一次貼多篇全文,逐篇抽取欄位長文本輸入穩定,能忠實抽取跨篇重複出現的方法與限制描述。同樣要求每欄附出處,不能只憑摘要判斷。
ChatGPT ↗
適合對矩陣草稿做因果誤用與過度概化的稽核
已有矩陣草稿,要做稽核與抓因果誤用對「逐項條列式檢查」這種稽核任務執行得穩定。稽核完的建議仍要人核准才能真的改矩陣,不能自動採信。
自訂 GPT/Claude Project團隊要固定用同一套矩陣規則反覆比對欄位定義與分級標準寫進系統指令,所有人用同一個入口,改規則時一次改到位。分享範圍要設對,規則更新後要通知使用者。
四、不要做錯這幾關不下放

這一區是踩過的坑與該守的線。標「不下放」的步驟請不要交給 AI 決定;Checklist 是拿來驗收的,不是拿來勾好看的。

09會卡住與會做錯的地方

會卡住的地方(流程困難點)

把相關性寫成因果
AI常用「提升」「導致」「證明」這類因果語言,描述觀察性或相關性研究的結果,讀起來像已證實的因果關係。
把單篇/小樣本包裝成普遍結論
一篇樣本數只有幾十人的案例研究,被寫成「多項研究顯示」,暗示了實際不存在的共識。
找不到原始研究卻照樣填
只查得到二手引用或新聞報導轉述,仍在Source欄位填出處,讓證據強度看起來比實際高。
Confidence欄位被AI自己定案
AI標了「高信心」就直接被採用,那應該是人看完整張矩陣後的判斷,不是AI自評完就算數。

會做錯的地方(常見失敗方式)

把相關性寫成因果

AI用「提升」「導致」描述觀察性/相關性研究的結果,讀起來像已證實的因果關係。

怎麼修規則明訂觀察性/相關性/案例研究的Supports欄位禁用因果語言,並要求AI改寫成中性描述。

單篇證據被包裝成「研究都證明」

只有一篇低強度證據,摘要卻寫「研究顯示」「多項研究都證明」,暗示共識其實不存在。

怎麼修規則規定只有一篇證據時只能寫「該篇研究指出」,且Evidence強度要如實標低。

二手轉述被當成原始來源

只找得到新聞報導或別人論文裡的引用,卻直接把它當Source填,Evidence強度因此被高估。

怎麼修找不到原始研究全文時,Source標「未找到原始來源」,Evidence不得高於「弱」。

Confidence被AI自己定案

AI自己給的信心程度被直接採用,沒有經過人在看完整張矩陣後的覆核。

怎麼修Confidence欄位只當AI的建議值,最終值由人覆核定案。

缺欄位用常識代填

文獻沒寫樣本數,AI用「一般而言」的常識推測填上一個數字,讓矩陣看起來比實際完整。

怎麼修缺的欄位一律標「未提及」,不得用常識或其他文獻的內容代填。

證據缺口清單被省略

矩陣做完只交出支持/反駁的列表,沒有列出「這個Claim目前根本沒有高強度證據」的部分,讀者以為問題已經有答案。

怎麼修證據缺口清單是矩陣的必要產出之一,不得省略,且要放進最終報告。

其他注意事項

10人工把關與安全限制

AI/Agent/Tool 介入在哪幾步

流程位置做什麼/怎麼做
抽取階段AI逐篇抽取Source/Study Type/Sample/Evidence/Limitation
每一欄找不到就標「未提及」,不得用常識或其他文獻的內容代填。
判定階段AI逐篇判定Supports/Contradicts/Neutral
必須附原文引用或段落出處;觀察性、相關性、案例研究一律不得使用因果語言。
使用階段Agent做成共用證據矩陣助手
欄位定義與分級標準寫進系統指令,全團隊用同一個入口,標準改一次就到位。

這幾關不下放

Claim與分級標準
要驗證的主張怎麼寫、證據強度怎麼分級,由人事先訂定。
證據不足的認定
找不到原始研究的列,由人確認要標「證據不足」,不能被刪除或亂填一個來源。
相關與因果的最終判斷
AI的判定只是草稿,相關性是否被誤寫成因果,由人最終覆核。
Confidence定案
信心程度由人在看過整張矩陣後定案,AI只給建議值。
結論摘要與證據缺口清單
矩陣的整體結論、以及仍待更多證據的部分,由人撰寫定稿,不能只交出逐列表格。

安全與權限限制

文獻中的機密或未發表內容
上傳給AI或NotebookLM的文獻若含未發表的內部報告或商業機密,先確認工具的資料使用政策,不能公開的先移除或代稱。
來源真實性
AI有時會「編出」看起來合理的作者名或期刊名,Source欄位務必回頭核對原文獻,不可直接採信AI生成的引用資訊。
矩陣結論不得替代法律或醫療等專業判斷
涉及法規遵循、臨床決策的Claim,矩陣只是文獻整理,最終判斷仍需相應領域的專業人員簽核。
共用矩陣助手的分享範圍
系統指令裡若含團隊的分級標準與內部案例,分享範圍要設對,避免外流。

11Checklist 與驗收標準

做的時候逐項打勾

做完了才檢查:全部成立才算完成

  1. Claim寫成一句可以被支持或反駁的明確陳述,不是模糊題目。
  2. 每一列都有八個欄位,缺的欄位標「未提及」,沒有用常識代填。
  3. Study Type與Evidence強度依照事先訂好的分級標準判定,不是憑印象。
  4. 觀察性/相關性/案例研究的Supports欄位沒有使用因果語言。
  5. 只有一篇證據支持的立場,摘要沒有寫成「研究顯示」「多項研究證明」。
  6. 找不到原始研究、只有二手轉述的列,Source已標明且Evidence已調降。
  7. Confidence欄位已由人在看過整張矩陣後覆核定案,不是AI自評直接採用。
  8. 證據缺口清單已列出並放進最終報告,沒有被省略。
  9. 矩陣放在共用位置或已核對過原始文獻,不是只存在單次對話裡。
五、延伸看別人做過,然後往下一步

看看別人實際做過的樣子,再決定下一步往哪走。沒有找到可查證案例的方法,這裡會直說沒有,不拿相似的案例充數。

12實際案例

三篇文獻,沒有一篇撐得住「研究顯示」這四個字

當時的狀況:一個地方政府的研考小組要決定要不要在下一季推動「四天工作制試辦方案」,主管請幕僚整理「文獻怎麼說」。幕僚原本打算把手上蒐集到的三篇資料(一份企業內部報告、一份問卷調查、一份案例訪談)簡單摘要成「多項研究顯示四天工作制能提升生產力」,放進簡報第一頁。

AI 做了什麼
  • 逐篇抽取Source、Study Type、Sample、Evidence、Limitation,標出三篇分別是類實驗(無對照組)、橫斷面問卷(相關性)、案例訪談(無量化指標)。
  • 指出第一篇的因果語言誤用:作者自己在討論段落寫「效率提升可能與排班系統優化有關」,因此把Supports欄位改判為「部分支持」而非「支持」。
  • 指出第二篇的自我選擇偏誤:橫斷面設計無法排除「本來投入度高的公司才敢試四天制」,因此對因果Claim只能判「中立偏相關」而非「支持」。
  • 列出證據缺口清單:沒有任何RCT或跨公司對照組研究、沒有大樣本跨產業資料、沒有一年以上的長期追蹤。
人做了什麼
  • 核對AI的抽取結果,確認Sample數字與文獻原文一致,沒有被AI誇大或簡化。
  • 把原本要寫的「研究顯示能提升生產力」,改成「目前僅有低強度初步觀察,缺乏對照實驗,尚不足以下因果結論」。
  • 把證據缺口清單直接放進簡報,作為建議先做小規模對照試辦、而非全面推動的理由。
  • 在Confidence欄位上,把AI建議的「中」全部覆核降為「低」,因為每一篇作者自己都承認限制。

結果:簡報第一頁從「研究顯示四天工作制能提升生產力」改成一張三列的證據矩陣,附上「目前證據強度偏低,建議先做小規模對照試辦」的結論。主管後續核准的是一個為期三個月、有對照組的小規模試辦,而不是直接全面推動——矩陣讓大家看清楚,手上的三篇資料本來就撐不起全面推動的決策。

待補資料:本站不提供這場試辦最終是否推動、成效如何的量化結果(本文寫作當下試辦尚未執行完)。這正是矩陣方法要示範的紅線:沒有查證到的數字或結論,就不寫成「已驗證」,這裡誠實只寫到「證據矩陣改變了決策的保守程度」為止。

13相關方法與下一步

把矩陣結論寫進正式報告

矩陣是給自己核對用的工作底稿,寫進政策建議或顧問報告時還要顧格式與審核。

文獻本身的事實查核

矩陣處理的是「證據強不強」,單篇文獻裡的具體數字是否被正確引用,是另一道查核。

長文獻的逐篇精讀

文獻很長、要先抓重點段落再進矩陣時,需要另一套長文件工作法。

更廣的研究蒐集與提問設計

矩陣需要先有夠多、夠相關的文獻可比對,蒐集與篩選文獻本身也是一個方法。

可直接使用RELATED PROMPTS

Download

這個方法的模板與 Checklist 下載包整理中——訂閱更新,上架後第一時間通知你。

這個站的做法
取得 AI 實戰工具與更新

之後會不定期整理:新方法、指令包(Prompt Pack)、Checklist 與模板。免費、無廣告;送出後會收到一封確認信,點了連結才算訂閱成功,之後每封信都附一鍵退訂。

← 回「研究與資訊整理」回找方法 →