METHOD · 學習與人才發展

AI 學習診斷與補強路徑

測驗的價值不在分數,在指出下一步該練什麼——每個弱點都要對得回具體題目,不能是 AI 的印象。

情境:學習與人才發展也用於:知識管理難度:進階|要先備料起手工具:ChatGPT
這是學習與人才發展情境下的方法之一(共 6 個)· 看這個情境全部 →
一、這是什麼三十秒判斷關不關你的事

01解決的工作問題

測驗做完、分數出來,然後就沒有然後了。學員知道自己 62 分,但不知道下一步該補什麼;帶課的人也說不出這一班到底哪裡沒懂。把作答丟給 AI 要它「分析一下」,它會很快給你一段讀起來很專業的診斷——問題是那段診斷通常對不回任何一道題目,而且它很容易從低分推論到學習態度上去。這個方法真正要建立的,是「每一個弱點結論都指得回具體題號」這件事。

真的有人這樣做過?外部佐證

目前沒有找到可公開查證的外部案例。這類工作多半不會有人發新聞稿,找不到不代表沒人做——但在找到之前,這一頁的方法就是作者自己的做法,不借別人的名義。

去找靈感看其他方法的外部案例 →

02什麼時候用、什麼時候別用

什麼情況下該用這一套

什麼情況下別用

題目沒有觀念標記時
AI 會自己發明分類,而且每次跑出來的分類都不一樣,前後兩次無法比較。
只有總分沒有逐題
沒有逐題就沒有依據,任何弱點結論都是猜的。
要拿來考核、升遷或決定去留
那是人事決定,需要更嚴謹的程序與救濟管道,不適用這個方法。
推論學習態度、動機或能力
作答資料支撐不了這些結論,寫出來會傷到人。

誰會用到

老師
你最需要的是班級層級的診斷:這一班哪個觀念集體沒懂。個別學員的部分要小心,那份很容易變成另一種排名。
教育訓練
內訓的價值在於「訓完有沒有變」。診斷要對得回教材出處,補強才排得出來。
HR
職能測驗的診斷結果若進到考績或升遷,性質就變了——那時要適用的是更嚴格的標準,不是這個方法。
主管
要擋的是「用分數推論態度」。AI 很願意寫「學習動機不足」,那不是資料能支撐的結論。
顧問
替客戶做訓練成效評估時,最容易被要求給「等第」。等第是決定,決定要有人負責,不要交給模型。

所屬工作情境

二、整件事怎麼跑先看圖,再看逐步

03流程圖

這張圖是整篇的骨架:輸入 → 步驟 → 困難點 → AI/Agent/Tool 介入 → 人工檢查 → 產出。紅框是最常出事的位置,綠框是不能下放的人工檢查點,粗框是中止條件。後面每一節都是在展開圖上的某一格。

AI 學習診斷:每個弱點都要指得回題號
AI 學習診斷:每個弱點都要指得回題號直向流程圖。輸入是題目與觀念標記、教材出處對照、逐題作答結果以及觀念之間的先後關係。第一步由人確認每題都標了觀念與出處,並把學員姓名換成代號;第二步由 AI 依觀念統計答對率並列出最弱的三到五個觀念,每個結論都要附上支持題號;第三步由 AI 從作答型態區分錯誤類型,分為不會、看錯題目、粗心與無法判斷四類,並說明判斷依據;第四步進入人工檢查點,由人逐條核對支持題號是否真的支持該結論,對不上的一律退回重跑;第五步由人依觀念的先後關係排補強順序,先補會擋住後面的觀念,標為無法判斷的不排補強而改列為需先釐清的事;第六步由試算表比對兩輪同觀念的答對率並區分新題與舊題,確認是真的補起來還是只是記得答案;產出是弱點診斷表、補強清單與學習路徑。右側標示三個困難點:歸因對不回任何題目、從分數推論到學習態度與能力、三種錯誤類型混在一起導致補強開錯藥。並標示中止條件:題目沒有觀念標記時停止診斷,先補標記,否則分類每次都不一樣、兩輪無法比較。人工檢查點有退回線回到觀念歸因的步驟。題號對不上,退回重跑INPUT / 輸入題目與觀念標記 + 教材出處 + 逐題作答 + 觀念先後關係姓名換代號;選了哪個選項要留HUMAN / 人工步驟人確認每題都標了觀念與出處,並去識別化AI / AI 介入AI 依觀念統計答對率,每個結論附「支持題號」AI / AI 介入AI 區分四類錯誤:不會/看錯題目/粗心/無法判斷CHECKPOINT / 人工檢查人逐條核對支持題號,對不上就退回HUMAN / 人工步驟人依觀念先後關係排補強順序(無法判斷者不排)TOOL / 工具處理試算表比對兩輪答對率,分開看新題與舊題OUTPUT / 產出弱點診斷表 + 補強清單 + 學習路徑STOP / 中止條件題目沒有觀念標記時停止診斷,先補標記——否則分類每次都不一樣RISK / 困難點歸因對不回題目:讀起來很專業,但無法執行也無法驗RISK / 困難點從分數推論到人:「動機不足」「基礎不紮實」RISK / 困難點三種錯混在一起,補強開錯藥
看圖重點:整張圖的重量都在第四步那個綠色檢查點,而它檢查的東西只有一件:AI 說的每個弱點,是哪幾題支持的。沒有這一欄的時候,你會拿到一段讀起來很專業、但對不回任何題目也無法驗證的診斷;有這一欄的時候,它沒把握的項目會誠實地標成【無法判斷】——因為它找不到支持的題號。右下角的中止條件也值得看一眼:題目沒有觀念標記就不要開始,那是這個方法唯一不能省的前置。
純文字流程表(手機/螢幕閱讀器建議看這張)
AI 學習診斷:每個弱點都要指得回題號(純文字流程表)
類型/角色流程步驟這一步的困難點/中止條件
1Human題目與觀念標記 + 教材出處 + 逐題作答 + 觀念先後關係
姓名換代號;選了哪個選項要留
2Human人確認每題都標了觀念與出處,並去識別化
失敗與中止條件題目沒有觀念標記時停止診斷,先補標記——否則分類每次都不一樣
3AIAI 依觀念統計答對率,每個結論附「支持題號」
困難點/風險歸因對不回題目:讀起來很專業,但無法執行也無法驗
4AIAI 區分四類錯誤:不會/看錯題目/粗心/無法判斷
困難點/風險從分數推論到人:「動機不足」「基礎不紮實」
5Checkpoint人逐條核對支持題號,對不上就退回
6Human人依觀念先後關係排補強順序(無法判斷者不排)
困難點/風險三種錯混在一起,補強開錯藥
7Tool試算表比對兩輪答對率,分開看新題與舊題
8Output弱點診斷表 + 補強清單 + 學習路徑

回流線:題目與觀念標記 + 教材出處 + 逐題作答 + 觀念先後關係 → 人確認每題都標了觀念與出處,並去識別化(退回);人確認每題都標了觀念與出處,並去識別化 → AI 依觀念統計答對率,每個結論附「支持題號」(退回);AI 依觀念統計答對率,每個結論附「支持題號」 → AI 區分四類錯誤:不會/看錯題目/粗心/無法判斷(退回);AI 區分四類錯誤:不會/看錯題目/粗心/無法判斷 → 人逐條核對支持題號,對不上就退回(退回);人逐條核對支持題號,對不上就退回 → AI 依觀念統計答對率,每個結論附「支持題號」(題號對不上,退回重跑);人逐條核對支持題號,對不上就退回 → 人依觀念先後關係排補強順序(無法判斷者不排)(退回);人依觀念先後關係排補強順序(無法判斷者不排) → 試算表比對兩輪答對率,分開看新題與舊題(退回);試算表比對兩輪答對率,分開看新題與舊題 → 弱點診斷表 + 補強清單 + 學習路徑(退回)

Mermaid 原始碼(貼進 Mermaid Live 或 draw.io 可再編輯)
可直接複製,改成你自己的流程
flowchart TD
    in1(["<b>Human</b><br/>題目與觀念標記 + 教材出處 + 逐題作答 + 觀念先後關係<br/><small>姓名換代號;選了哪個選項要留</small>"])
    s1["<b>Human</b><br/>人確認每題都標了觀念與出處,並去識別化"]
    a1[/"<b>AI</b><br/>AI 依觀念統計答對率,每個結論附「支持題號」"/]
    a2[/"<b>AI</b><br/>AI 區分四類錯誤:不會/看錯題目/粗心/無法判斷"/]
    c1{{"<b>Checkpoint</b><br/>人逐條核對支持題號,對不上就退回"}}
    s2["<b>Human</b><br/>人依觀念先後關係排補強順序(無法判斷者不排)"]
    t1[("<b>Tool</b><br/>試算表比對兩輪答對率,分開看新題與舊題")]
    o1(["<b>Output</b><br/>弱點診斷表 + 補強清單 + 學習路徑"])
    st1[/"<b>Stop</b><br/>題目沒有觀念標記時停止診斷,先補標記——否則分類每次都不一樣"\]
    r1>"<b>Risk</b><br/>歸因對不回題目:讀起來很專業,但無法執行也無法驗"]
    r2>"<b>Risk</b><br/>從分數推論到人:「動機不足」「基礎不紮實」"]
    r3>"<b>Risk</b><br/>三種錯混在一起,補強開錯藥"]

    in1 --> s1
    s1 --> a1
    a1 --> a2
    a2 --> c1
    c1 --> s2
    s2 --> t1
    t1 --> o1
    s1 ==>|中止| st1
    a1 -.->|風險| r1
    a2 -.->|風險| r2
    s2 -.->|風險| r3
    in1 -.->|退回| s1
    s1 -.->|退回| a1
    a1 -.->|退回| a2
    a2 -.->|退回| c1
    c1 -.->|題號對不上,退回重跑| a1
    c1 -.->|退回| s2
    s2 -.->|退回| t1
    t1 -.->|退回| o1

    classDef clsIn fill:#FFFFFF,stroke:#2C4459,stroke-width:2px,color:#141E2B
    classDef clsHuman fill:#FBFCFD,stroke:#7A8CA0,stroke-width:2px,color:#141E2B
    classDef clsAI fill:#FFF6EA,stroke:#DE9A45,stroke-width:2px,color:#141E2B
    classDef clsAgent fill:#FDEBD2,stroke:#B87A2E,stroke-width:2px,color:#141E2B
    classDef clsTool fill:#EDF2F6,stroke:#2C4459,stroke-width:2px,color:#141E2B
    classDef clsCheck fill:#E8F2EC,stroke:#3F7A5A,stroke-width:2px,color:#123024
    classDef clsOut fill:#141E2B,stroke:#141E2B,stroke-width:2px,color:#F2F6F9
    classDef clsRisk fill:#FCEFEA,stroke:#C0552F,stroke-width:2px,color:#5E2110
    classDef clsStop fill:#F7E1DB,stroke:#8E2F17,stroke-width:3px,color:#5E2110
    class in1 clsIn;
    class s1 clsHuman;
    class a1 clsAI;
    class a2 clsAI;
    class c1 clsCheck;
    class s2 clsHuman;
    class t1 clsTool;
    class o1 clsOut;
    class st1 clsStop;
    class r1 clsRisk;
    class r2 clsRisk;
    class r3 clsRisk;

04完整步驟圖的文字版,逐步展開

一句話版(快速回顧)

  1. 出題時就先標好每題考的觀念與出處,診斷才有依據。事後才想歸類,會變成 AI 亂猜。
  2. 把作答結果連同題目與觀念標記一起餵進去,請 AI 做「錯在哪一個觀念」的歸因,每個結論都要列出是哪幾題支持。
  3. 區分三種錯:不會、看錯題目、粗心。三種的補強方式完全不同,混在一起就會開錯藥。
  4. 對每個弱點指出補強材料的具體位置(教材第幾章、哪一份講義),不是泛泛的「多練習」。
  5. 排順序:先補會擋住後面的觀念,再補獨立的細節。順序由人排,AI 不知道你的課程結構。
  6. 下一輪測驗刻意重考上一輪的弱點,確認補起來了沒有——沒有這一步,診斷只是好看的報表。

完整版(每一步誰做、產出什麼)

誰做步驟與說明
1Human確認題目標記
每題的觀念與出處是否都標了。事後才想歸類就會變成 AI 亂猜。→ 已標記題本
2Human去識別化作答
學員姓名換成代號。班級層級的診斷完全不需要姓名。→ 去識別化作答表
3AI觀念層級歸因
依觀念統計答對率,列出最弱的三到五個,每個結論要列出是哪幾題支持。→ 弱點診斷表
4AI區分錯的類型
判斷比較像不會、看錯題目還是粗心,並說明判斷依據;判不出來標【無法判斷】。→ 錯誤類型標記
5Human核對歸因
逐條看它列的題號支不支持結論。對不上的就是它在編。→ 確認過的診斷
6Human排補強順序
先補會擋住後面的觀念,再補獨立細節。順序由人排。→ 補強清單與學習路徑
7Human下一輪重考驗證
刻意重考上一輪的弱點,確認補起來了沒有。→ 驗證紀錄
三、動手做備料 → 指令 → 產出 → 工具

05開始前要準備什麼標「必要」的沒備齊就先別開始

題目與觀念標記必要
每題考什麼觀念、對應教材哪一段。這是診斷的唯一依據。
逐題作答結果必要
不是總分,是每人每題的對錯(選擇題最好連選了哪個選項都留)。
教材出處對照必要
觀念對應到教材第幾章、哪一份講義。補強清單要指得到具體位置。
觀念的先後關係必要
哪些觀念會擋住後面的。排補強順序時要用,AI 不知道你的課程結構。
診斷結果的閱讀範圍必要
誰看得到班級層級、誰看得到個別層級。先講清楚。
上一輪的診斷結果可選
有的話拿出來,才能看出補強有沒有效。

餵進去的東西要長這樣

題目與觀念標記 + 教材出處對照 + 逐題作答結果(已去識別化)+ 觀念先後關係 + 上一輪診斷(如有)。

【題目與標記】
Q1 觀念:資料去識別化的範圍|出處:講義 2-1|題型:一般
Q2 觀念:資料去識別化的範圍|出處:講義 2-1|題型:反向題
Q6 觀念:判斷 AI 是否在編造|出處:講義 4-3|題型:情境題
…(共 20 題)

【觀念先後關係】
「要求 AI 附出處」→ 是「判斷 AI 是否在編造」的前提
「資料去識別化的範圍」→ 獨立

【作答結果】(24 人,姓名已換代號;括號內為所選選項)
學員01:Q1✓(A) Q2✓(D) Q3✓(B) Q4✗(C) Q5✗(A) Q6✗(C) …
學員02:Q1✓(A) Q2✗(B) Q3✓(B) Q4✓(A) Q5✗(C) Q6✗(C) …
…

【教材出處對照】
講義 2-1|第 3 頁|資料去識別化
講義 4-1|第 8 頁|要求出處的三種問法
講義 4-3|第 11 頁|合理但沒有依據的三種樣態

06Prompt(快速/完整/進階)

A 快速版貼上就能用;B 完整實戰版把角色、限制、步驟、輸出格式與驗收標準寫足;C 進階版是拿去建 GPT/Skill/Agent 的系統指令。三種都附可替換變數、使用範例、預期輸出與人工確認點。

三種版本共通的紅線
三版都不適合用在
  • 不要用在沒有觀念標記的題目上——那會得到每次都不一樣的分類。
  • 不要拿來做考核、升遷或決定去留的依據。
  • 不要推論學習態度、動機或能力。
三版都必須由人確認
  • 題目與觀念的對應由出題的人負責,這是診斷的地基。
  • 每個弱點結論的支持題號要由人逐條核對。
  • 補強順序由懂課程結構的人排。
  • 個別診斷的閱讀範圍由人決定,公開等於排名。
A
A. 快速版

手上有一批作答結果與已標記的題目,想快速看出這一班最弱的幾個觀念。

適合的工具ChatGPTClaudeNotebookLM
👇 直接複製,{ } 換成你的內容
以下是測驗題目(含每題的觀念標記與出處)與學員作答結果。請做學習診斷:
1. 依觀念統計答對率,列出這一批人最弱的三到五個觀念,每個觀念要列出「是哪幾題支持這個結論」。
2. 對每個弱點,判斷比較像「不會」「看錯題目」還是「粗心」,並說明你的判斷依據。判斷不出來的標【無法判斷】,不要猜。
3. 對每個弱點指出應該回頭看的教材出處(用我提供的標記,不要自己編章節)。
4. 個別學員的部分:只列出「這個人明顯落後全體的觀念」,不要給綜合評語、不要排名。
規則:不要用分數推論學習態度或能力;作答資料不足以支撐的結論一律標【資料不足】。
題目與觀念標記:{貼上}|作答結果:{貼上}

可替換變數

變數要換成什麼
{貼上}題目與觀念標記、教材出處。
{貼上}逐題作答結果(已去識別化)。
完整使用範例(照這樣填)
以下是測驗題目(含每題的觀念標記與出處)與學員作答結果。請做學習診斷。(照母提示詞四條)

【題目與標記】
Q1 觀念:資料去識別化的範圍|出處:講義 2-1
Q2 觀念:資料去識別化的範圍|出處:講義 2-1
Q3 觀念:提示詞中的角色設定|出處:講義 3-2
Q4 觀念:要求 AI 附出處|出處:講義 4-1
Q5 觀念:要求 AI 附出處|出處:講義 4-1
Q6 觀念:判斷 AI 是否在編造|出處:講義 4-3
Q7 觀念:判斷 AI 是否在編造|出處:講義 4-3
Q8 觀念:判斷 AI 是否在編造|出處:講義 4-3
…(共 20 題)

【作答結果】(24 人,已去識別化)
學員01:Q1✓ Q2✓ Q3✓ Q4✗ Q5✗ Q6✗ Q7✗ Q8✓ …
學員02:Q1✓ Q2✗ Q3✓ Q4✓ Q5✗ Q6✗ Q7✗ Q8✗ …
…
預期輸出範例(拿到的東西應該長這樣)
【觀念層級答對率】
| 觀念 | 支持題號 | 答對率 | 判定 |
|---|---|---|---|
| 判斷 AI 是否在編造 | Q6, Q7, Q8 | 31%(22/72) | 最弱 |
| 要求 AI 附出處 | Q4, Q5 | 44%(21/48) | 弱 |
| 資料去識別化的範圍 | Q1, Q2 | 79%(38/48) | 尚可 |
| 提示詞中的角色設定 | Q3 | 92%(22/24) | 良好 |

【最弱的三個觀念】
1. 判斷 AI 是否在編造(Q6, Q7, Q8,答對率 31%)
   類型判斷:比較像「不會」。依據——三題的錯誤答案高度集中在同一個選項(Q6 有 17 人選 C、Q7 有 15 人選 B),且這兩個選項的共同特徵是「聽起來很有道理但沒有出處」。這代表學員的判準本身就是錯的,不是粗心。
   建議回頭看:講義 4-3

2. 要求 AI 附出處(Q4, Q5,答對率 44%)
   類型判斷:【無法判斷】。依據——Q4 錯的人與 Q5 錯的人重疊度只有 40%,作答型態不一致,我看不出是概念不清還是題目本身有歧義。建議你檢查 Q5 的題幹敘述。
   建議回頭看:講義 4-1

3. 資料去識別化的範圍(Q1, Q2,答對率 79%)
   類型判斷:比較像「看錯題目」。依據——Q2 是反向題(「下列何者『不』屬於」),錯的 10 人裡有 8 人選了正向答案。
   建議回頭看:講義 2-1;另建議檢視反向題的出題方式。

【個別落後的部分】
以下學員在特定觀念上明顯落後全體(僅列觀念,不做排名、不給評語):
- 學員02、學員09、學員17:資料去識別化的範圍
- 學員05、學員13:提示詞中的角色設定(此觀念全體答對率 92%,落後較明顯)

【我沒有做的事】
- 沒有計算總分排名、沒有給任何學員綜合評語。
- 沒有從答對率推論學習態度、動機或能力。
- 沒有使用我沒拿到的資料(出席、作業、過往成績)。

常見錯誤用法

  • 看到「最弱的三個觀念」就直接排補強,跳過支持題號那一欄。那一欄才是讓你確認它沒有在編的東西。
  • 把【無法判斷】自行解讀成「大概是不會吧」。它標無法判斷的時候,通常是題目本身有問題。
  • 把個別落後清單發給全班。那會變成另一種排名。
這一版另外不適合

沒有額外的,看上面「三種版本共通的紅線」那一段就好。

缺少資料時怎麼辦

沒有觀念標記時,它會自己發明分類,而且每次跑都不一樣,前後兩次無法比較。這是這個方法唯一不能省的前置。

這一版另外要人確認

沒有額外的,看上面「三種版本共通的紅線」那一段就好。

B
B. 完整實戰版

診斷做完了,要把它變成一份可以真的執行的補強路徑,含順序與驗證方式。

適合的工具ChatGPTClaudeNotebookLM
👇 直接複製,{ } 換成你的內容
以下是已確認過的弱點診斷、教材出處對照,以及觀念之間的先後關係。請產出補強路徑:

1. 【補強順序】依我提供的先後關係排序,先補會擋住後面的觀念。每一項要說明「為什麼排這個位置」,並標明它擋住了哪些後續觀念。
2. 【每項補強的做法】依錯誤類型給不同做法:
   - 判定為「不會」的:指出教材出處,並設計一個「先講清楚判準、再練」的練習方式。
   - 判定為「看錯題目」的:不需要補教材,需要的是題目形式的說明或作答提醒。
   - 判定為「粗心」的:不需要補教材,需要的是檢查習慣。
   - 判定為【無法判斷】的:不要排補強,改列為「需先釐清的事」,並寫出要釐清什麼。
3. 【驗證設計】下一輪要重考哪些觀念、各出幾題、要達到什麼水準才算補起來。
4. 【時間估計】每項補強大概需要多少時間,以及整體排在幾次課裡。

規則:
- 補強做法要能對回教材出處,不得自行編章節或推薦我沒提供的材料。
- 不要對任何學員的能力或態度下判斷。
- 判定為「看錯題目」與「粗心」的項目,不要用「多練習」帶過——那是最沒有用的建議。

弱點診斷:{貼上}|教材出處對照:{貼上}|觀念先後關係:{貼上}

可替換變數

變數要換成什麼
{貼上}已由人核對過的弱點診斷。
{貼上}觀念對應到教材的哪一章哪一份講義。
{貼上}哪些觀念是後面觀念的前提。
完整使用範例(照這樣填)
(貼上前一步的診斷)

【觀念先後關係】
「要求 AI 附出處」是「判斷 AI 是否在編造」的前提——不會要出處,就沒有東西可以拿來判斷。
「資料去識別化的範圍」獨立,不擋任何後續觀念。
預期輸出範例(拿到的東西應該長這樣)
【補強順序】
第 1 順位:要求 AI 附出處(Q4, Q5)
為什麼排第一:它是「判斷 AI 是否在編造」的前提。學員不會要求出處,就沒有東西可以拿來判斷真假,直接補第二項會補不動。
擋住:判斷 AI 是否在編造。
⚠ 注意:此項診斷為【無法判斷】,見下方「需先釐清的事」。釐清後才排入。

第 2 順位:判斷 AI 是否在編造(Q6, Q7, Q8)
為什麼排第二:答對率最低(31%),但依賴第 1 項。
擋住:無後續觀念。

第 3 順位:資料去識別化的範圍(Q1, Q2)
為什麼排最後:判定為「看錯題目」而非不會,實際的觀念掌握度可能高於 79%。

【每項補強的做法】
第 2 項(判定:不會)
- 教材出處:講義 4-3
- 這一項不能只重講一次。錯誤集中在「聽起來有道理但沒有出處」的選項,代表學員的判準是「合不合理」而不是「有沒有依據」。建議先花十分鐘把這兩者的差別講清楚,再進到練習。
- 練習方式:給三段 AI 產出的文字,其中一段有出處、一段出處是編的、一段沒有出處。請學員先分類,再說明理由。重點在說明理由,不在分類正確。

第 3 項(判定:看錯題目)
- 不需要補教材。
- 需要的是作答提醒:反向題(「下列何者不」)在題本中已用底線標示,但仍有 8 人選了正向答案。建議下次改為粗體加底線,並在測驗開始前口頭提醒。
- 這一項也建議檢討出題方式,不完全是學員的問題。

【需先釐清的事】
第 1 項(要求 AI 附出處)
- Q4 錯的人與 Q5 錯的人重疊度只有 40%,作答型態不一致。
- 要釐清的是:Q5 的題幹是否有歧義。建議找兩三位答錯的學員問「你當時怎麼理解這一題」。
- 釐清之前不要排補強——如果是題目的問題,補強會補錯方向。

【驗證設計】
下一輪重考:
| 觀念 | 題數 | 通過標準 |
|---|---|---|
| 判斷 AI 是否在編造 | 4 題(含 2 題新題) | 全班答對率達 70% |
| 要求 AI 附出處 | 3 題(Q5 改寫後重用) | 全班答對率達 70% |
| 資料去識別化的範圍 | 2 題(含 1 題反向題) | 全班答對率達 85% |
※ 含新題是為了避免只是背了上次的答案。

【時間估計】
第 2 項:講解 10 分鐘 + 練習與討論 25 分鐘
第 3 項:作答提醒 3 分鐘(併入下次測驗前)
第 1 項:釐清後再估
建議排入下一次課的前半段,合計約 40 分鐘。

常見錯誤用法

  • 把【無法判斷】的項目硬排進補強。如果那其實是題目的問題,補強會補錯方向而且沒人發現。
  • 驗證重考時完全用原題。學員記得答案,答對率會漂亮地上升但什麼都沒證明。要含新題。
  • 把「看錯題目」的項目也拿去補教材。那不是知識問題,補了也不會改善。
這一版另外不適合

沒有額外的,看上面「三種版本共通的紅線」那一段就好。

缺少資料時怎麼辦

沒有觀念先後關係時,它只能依答對率高低排序,而那通常是錯的順序——最弱的觀念常常是因為前提沒建立。

這一版另外要人確認

沒有額外的,看上面「三種版本共通的紅線」那一段就好。

C
C. 進階版(兩輪之間的成效驗證)

補強做完、重考也考完了,要確認到底補起來沒有,以及下一輪該調整什麼。

適合的工具ChatGPTClaude試算表
👇 直接複製,{ } 換成你的內容
以下是同一批學員兩輪測驗的觀念層級結果,以及中間做過的補強內容。請做成效驗證:

1. 【逐觀念比對】兩輪答對率並列,標出上升、下降、持平。上升的要判斷是否達到當初設定的通過標準。
2. 【真的補起來了嗎】對每個上升的觀念,判斷證據強度:
   - 若第二輪含新題且新題答對率與舊題相近 → 證據較強
   - 若新題答對率明顯低於舊題 → 可能只是記得答案,標記為「存疑」
   - 若第二輪未含新題 → 一律標記為「無法確認」
3. 【沒補起來的】列出未達標準的觀念,並依第二輪的錯誤型態重新判斷錯誤類型——如果類型變了(例如從「不會」變成「粗心」),那其實是進步,要說明。
4. 【補強做法的檢討】對照中間做過的補強內容,指出哪一種做法對哪一類錯誤有效、哪一種沒效。這是下一輪設計的依據。
5. 【下一輪建議】最多三項。

規則:
- 不要用兩輪的變化推論任何學員的努力程度或學習態度。
- 樣本數少於 10 人的觀念,結論要標註樣本偏少。
- 無法從資料判斷的一律標【資料不足】。

第一輪結果:{貼上}|補強內容:{貼上}|第二輪結果:{貼上}

可替換變數

變數要換成什麼
{貼上}第一輪的觀念層級結果。
{貼上}兩輪之間實際做了哪些補強。
{貼上}第二輪結果,需標明哪些是新題。
完整使用範例(照這樣填)
(貼上兩輪結果與補強紀錄,第二輪的 Q6-1、Q6-2 為新題)
預期輸出範例(拿到的東西應該長這樣)
【逐觀念比對】
| 觀念 | 第一輪 | 第二輪 | 變化 | 通過標準 | 達標? |
|---|---|---|---|---|---|
| 判斷 AI 是否在編造 | 31% | 74% | ↑43 | 70% | 達標 |
| 要求 AI 附出處 | 44% | 68% | ↑24 | 70% | 未達標 |
| 資料去識別化的範圍 | 79% | 88% | ↑9 | 85% | 達標 |

【真的補起來了嗎】
- 判斷 AI 是否在編造:證據較強。第二輪含 2 題新題,新題答對率 71%、舊題 77%,差距不大,代表不是只記得答案。
- 要求 AI 附出處:存疑。舊題(Q5 改寫)答對率 79%,但新題只有 54%,差距 25 個百分點。學員可能是熟悉了這個題型,而不是掌握了觀念。
- 資料去識別化的範圍:達標,但上升幅度只有 9 個百分點,且第一輪本來就判定為「看錯題目」——這次的改善比較可能來自作答提醒(反向題改為粗體),而不是觀念本身的變化。

【沒補起來的】
要求 AI 附出處(68%,差 2 個百分點)
第二輪錯誤型態:錯的人分散,沒有集中在特定選項,且多為新題。錯誤類型從第一輪的【無法判斷】變成比較像「不會」。
這其實是有意義的變化——第一輪的【無法判斷】是因為題目有歧義,Q5 改寫後型態變清楚了,現在看到的是真實的掌握不足。建議下一輪就針對這一項補。

【補強做法的檢討】
有效:
- 「先講清楚判準、再練」對「不會」型錯誤有效(判斷編造:31%→74%)。特別是「先分類再說明理由」的練習方式,第二輪新題的表現支持這一點。
- 作答提醒對「看錯題目」型有效(去識別化:79%→88%),而且只花了 3 分鐘。

沒效或不明:
- 「要求 AI 附出處」這一項在第一輪被判為【無法判斷】而沒有排補強,實際上也確實沒補。所以這次的 68% 不是補強無效,是根本沒補。這是流程問題不是方法問題。

【下一輪建議】
1. 針對「要求 AI 附出處」排補強,套用「先講清楚判準、再練」的做法(該做法在另一個觀念上已驗證有效)。
2. 每一輪重考一律含至少三分之一新題。這次「要求 AI 附出處」的新舊題差距 25 個百分點,如果沒有新題會誤判為達標。
3. 出題時的反向題一律粗體加底線,並在測驗前口頭提醒——這一項成本 3 分鐘、效果明確,直接常態化。

※ 本次 24 人,各觀念樣本數足夠,未觸發樣本偏少的標註。

常見錯誤用法

  • 看到答對率上升就結案。沒有新題的上升不代表任何事,那可能只是記得答案。
  • 把「沒補起來」都算成學員的問題。這次的例子裡,有一項根本沒排補強——那是流程問題。
  • 只看數字不看錯誤型態的變化。從「不會」變成「粗心」是進步,但答對率可能只動了幾個百分點。
這一版另外不適合

沒有額外的,看上面「三種版本共通的紅線」那一段就好。

缺少資料時怎麼辦

第二輪沒有新題時,整個成效驗證會退化成「他們記不記得答案」。新題是這一步的必要條件,不是加分項。

這一版另外要人確認

沒有額外的,看上面「三種版本共通的紅線」那一段就好。

07產出應該長什麼樣拿到的東西要長這樣

四節:觀念層級答對率、最弱觀念與錯誤類型(各附支持題號)、個別落後觀念清單、我沒有做的事。

完成品:同一份作答的兩種診斷:有支持題號 vs 沒有

【沒有要求支持題號】
AI 回覆:「整體來看,學員在『判斷 AI 輸出可信度』這個面向的掌握度較弱,建議加強相關概念的說明與練習。另外部分學員的基礎概念不夠紮實,可能需要額外輔導。整體而言,本次培訓成效尚可,但仍有進步空間。」

→ 讀起來很專業,而且完全無法執行。
→ 「判斷 AI 輸出可信度」這個說法不對應題本上的任何一個觀念標記,是它自己造的詞。
→ 「基礎概念不夠紮實」是對人的判斷,資料支撐不了。

【要求每個結論列出支持題號】
AI 回覆(節錄):
「判斷 AI 是否在編造(支持題號:Q6, Q7, Q8)|答對率 31%(22/72)
類型判斷:比較像『不會』。依據——三題的錯誤答案高度集中在同一個選項:Q6 有 17 人選 C、Q7 有 15 人選 B。這兩個選項的共同特徵是『聽起來很有道理但沒有出處』。若是粗心,錯誤應該分散在各選項;集中在特定選項代表學員的判準本身就是錯的。
建議回頭看:講義 4-3」

→ 每一句都可以驗證。你可以自己去數 Q6 有幾個人選 C。
→ 它給的補強方向是具體的:問題不在「不知道要判斷」,在「判斷的標準錯了」。

【差別在哪】
兩次用的是同一份作答資料。差別只在有沒有強制要求「這個結論是哪幾題支持的」。
沒有這一欄的時候,AI 會給你一段讀起來像診斷的文字;有這一欄的時候,它必須指得回具體題號,而指得回題號的結論你才有辦法驗。

※ 附帶效果:加上這一欄之後,那些它其實沒把握的項目會誠實地標成【無法判斷】——因為它找不到支持的題號。
輸出格式規格(要照著做的人再展開)
  • 每個弱點結論後面必須有「支持題號」,沒有的一律視為無效結論。
  • 錯誤類型只有四種:不會/看錯題目/粗心/無法判斷,且要說明判斷依據。
  • 教材出處只能用輸入提供的標記,不得自行編章節。
  • 個別部分只列觀念,不排名、不給綜合評語。
  • 「我沒有做的事」那一節不得省略——它是這份報告的邊界宣告。
一、觀念層級答對率
| 觀念 | 支持題號 | 答對率 | 判定 |
|---|---|---|---|
| 判斷 AI 是否在編造 | Q6, Q7, Q8 | 31% | 最弱 |

二、最弱觀念與錯誤類型
1. 判斷 AI 是否在編造(Q6, Q7, Q8,31%)
   類型:不會。依據——錯誤集中在同一選項(Q6 有 17 人選 C),該選項特徵為「合理但無出處」,代表判準本身錯誤。
   回頭看:講義 4-3
2. 要求 AI 附出處(Q4, Q5,44%)
   類型:【無法判斷】。依據——兩題錯的人重疊度僅 40%,型態不一致,建議檢查 Q5 題幹是否有歧義。

三、個別落後觀念(僅列觀念,不排名、不評語)
- 學員02、學員09、學員17:資料去識別化的範圍

四、我沒有做的事
- 未計算總分排名、未給任何學員綜合評語
- 未從答對率推論學習態度、動機或能力
- 未使用未提供的資料(出席、作業、過往成績)

08工具怎麼挑

這幾支都做得到——差別在你手上有哪一支、資料能不能外流。標「起手」的是不知道從哪支開始時的建議,不是限定。

工具什麼時候用為什麼注意
ChatGPT ↗起手
批改與歸因
一般班級規模的診斷統計與歸因穩定,能依要求逐條列出支持題號。作答資料要先去識別化,姓名換代號。
Claude ↗
一次處理整班作答
整班或多班一次處理長輸入穩定,較不會只看前面幾位就下結論。同樣先去識別化。
NotebookLM ↗
補強內容對回教材出處
補強要嚴格對回教材原生附出處,可確保建議的補強位置真的存在於教材中。只上傳教材,不要上傳學員資料。
Gemini ↗
讀 Google 表單的作答紀錄
測驗用 Google 表單、作答紀錄在試算表作答明細不必搬家就能做歸因。每個弱點都要對得回具體題號;對不回去的敘述一律刪掉。
試算表
作答紀錄與趨勢
兩輪以上的比對與趨勢答對率並列、變化計算,留得住版本也看得到算法。公式要自己驗一次,特別是跨輪次的對應。
四、不要做錯這幾關不下放

09會卡住與會做錯的地方

會卡住的地方(流程困難點)

歸因對不回題目
AI 給的診斷讀起來很順,但你問它「這是根據哪幾題」的時候答不出來,或答出來的題目其實不考那個觀念。
從分數推論到人
「學習動機不足」「基礎不紮實」這類話,資料支撐不了,但 AI 寫得很自然。
三種錯混在一起
不會、看錯題目、粗心的補強方式完全不同。混成一個「弱點」之後,補強就會開錯藥。
診斷完沒有下一步
產出一份漂亮的報表,然後沒有重考、沒有驗證。這樣永遠不知道補強有沒有用。

會做錯的地方(常見失敗方式)

題目沒有觀念標記

AI 自行發明分類,每次跑都不一樣,兩輪無法比較。

怎麼修出題時就標觀念與出處;來不及的先補標,缺標的題目排除。

歸因對不回題目

診斷讀起來很專業但無法執行也無法驗證。

怎麼修強制每個結論列出支持題號,對不上的一律退回。

從分數推論到人

「動機不足」「基礎不紮實」這類評語傷人且無依據。

怎麼修在規則中明文禁止,並保留「我沒有做的事」那一節作為邊界宣告。

三種錯混在一起

看錯題目與粗心被當成不會,補教材補不到問題點。

怎麼修強制區分四類並說明判斷依據,不同類型走不同補強做法。

依答對率高低排補強

最弱的觀念常常是因為前提沒建立,先補它會補不動。

怎麼修提供觀念先後關係,由人依前提關係排序。

重考全用原題

答對率漂亮上升,但可能只是記得答案。

怎麼修每輪重考至少三分之一新題,並比對新舊題答對率差距。

其他注意事項

10人工把關與安全限制

AI/Agent/Tool 介入在哪幾步

流程位置做什麼/怎麼做
歸因階段AI依觀念統計並列出支持題號
每個弱點結論後面要接「支持題號」欄。這一欄讓你可以驗,也讓它比較難編。
歸因階段AI區分錯誤類型
從作答型態判斷(例如選了相近選項像不會、前面對後面錯像時間不夠、簡單題錯難題對像粗心),並說明依據。
補強階段AI對應教材出處
只能用你提供的出處標記,不得自行編章節。
驗證階段Tool兩輪結果比對
試算表把兩輪同觀念的答對率擺在一起,看有沒有真的補起來。

這幾關不下放

題目與觀念的對應
這是診斷的地基,由出題的人負責。
歸因核對
逐條檢查支持題號,對不上的一律退回。
補強順序
哪個觀念會擋住後面的,只有懂課程結構的人知道。
個別診斷的閱讀範圍
誰看得到,先決定。公開等於排名。
不做能力與態度評語
任何指向人格特質的結論一律刪除。

安全與權限限制

作答資料是個人資料
姓名一律換代號。班級層級的診斷完全不需要姓名。
教材與學員資料分開處理
上傳教材給附出處的工具時,不要一併上傳學員作答。
個別診斷的閱讀範圍
誰看得到要先定。班上公開等於排名,對學員是傷害。
不得作為人事決定依據
考核、升遷、去留需要更嚴謹的程序與救濟管道。
保存期限
作答紀錄要保存多久、什麼時候刪,比照單位的個資規定辦理。

11Checklist 與驗收標準

做的時候逐項打勾

做完了才檢查:全部成立才算完成

  1. 每一題在出題時就標了觀念與教材出處。
  2. 每個弱點結論都列出支持題號,且經人逐條核對確認相符。
  3. 錯誤類型已分為不會/看錯題目/粗心/無法判斷四類,且各有判斷依據。
  4. 標為【無法判斷】的項目沒有被硬排進補強,而是列為需先釐清的事。
  5. 補強清單指到具體教材出處,沒有出現「多練習」這類無效建議。
  6. 補強順序依觀念的先後關係排列,不是依答對率高低。
  7. 報告中沒有任何指向學習態度、動機或能力的評語。
  8. 作答資料已去識別化,個別診斷的閱讀範圍已明確。
  9. 下一輪重考已排定,且含至少三分之一新題。
五、延伸看別人做過,然後往下一步

12實際案例

答對率 31% 的那一題組:他們不是不會,是判準本來就錯了

當時的狀況:一場內部 AI 使用培訓,課後測驗 20 題、24 人。有一個三題的題組答對率只有 31%,帶課的人原本打算「再講一次」。

AI 做了什麼
  • 依觀念統計答對率,並在每個結論後列出支持題號。
  • 指出錯誤高度集中在同一個選項——Q6 有 17 人選 C、Q7 有 15 人選 B。
  • 點出這兩個選項的共同特徵是「聽起來很有道理但沒有出處」,判斷學員的判準是「合不合理」而不是「有沒有依據」,屬於「不會」而非粗心。
  • 另一個題組標為【無法判斷】,理由是兩題錯的人重疊度只有 40%,建議檢查其中一題的題幹是否有歧義。
人做了什麼
  • 逐條核對支持題號,確認 AI 引用的題目確實考那個觀念。
  • 接受【無法判斷】的提醒,去問了三位答錯的學員「你當時怎麼理解這一題」——結果確實是題幹有歧義。
  • 依觀念的先後關係重排順序,把原本答對率最低的那一項排在第二,因為它的前提觀念還沒建立。
  • 設計重考時刻意加入新題,避免只是記得答案。

結果:如果照原本的打算「再講一次」,講的還是同一套內容,而學員的問題不在內容沒聽懂,在於他們判斷真假的標準本身就錯了。真正有效的補強是先花十分鐘把「合理」跟「有依據」的差別講清楚——這一點是從錯誤選項的集中度看出來的,不是從答對率看出來的。

待補資料:本站不提供學習成效提升的量化數字。建議自己記錄兩個指標——「重考新題的答對率」與「錯誤類型的變化」。第二個常被忽略,但從『不會』變成『粗心』是實質進步,答對率上可能只動幾個百分點。

13相關方法與下一步

題目本身要先站得住

診斷的品質上限就是題目標記的品質。

補強材料要找得到

教材出處要對得回一個查得到的地方。

把診斷流程寫成 SOP

誰標題目、誰跑診斷、誰排順序、誰驗證,寫下來才不會斷。

訓練前先問清楚要什麼

訓練要解決什麼問題沒定義清楚,診斷再準也沒有用。

可直接使用RELATED PROMPTS

先理解這些觀念RELATED CONCEPTS

Download

這個方法的模板與 Checklist 下載包整理中——訂閱更新,上架後第一時間通知你。

取得 AI 實戰工具與更新

之後會不定期整理:新方法、指令包(Prompt Pack)、Checklist 與模板。免費、無廣告;正式寄送前會先寄確認信,隨時可來信要求刪除。

← 回「學習與人才發展」回找方法 →