三分鐘版 濃縮成 6 步;要細節再往下讀
出題時就先標好每題考的觀念與出處,診斷才有依據。事後才想歸類,會變成 AI 亂猜。 把作答結果連同題目與觀念標記一起餵進去,請 AI 做「錯在哪一個觀念」的歸因,每個結論都要列出是哪幾題支持。 區分三種錯:不會、看錯題目、粗心。三種的補強方式完全不同,混在一起就會開錯藥。 對每個弱點指出補強材料的具體位置(教材第幾章、哪一份講義),不是泛泛的「多練習」。 排順序:先補會擋住後面的觀念,再補獨立的細節。順序由人排,AI 不知道你的課程結構。 下一輪測驗刻意重考上一輪的弱點,確認補起來了沒有——沒有這一步,診斷只是好看的報表。 這一篇用的是出題與評量 這一招——從教材長出題目、評分標準與補強路徑,超綱與錯答要有人擋。 同一招還能做這幾件事(共 5 篇):
本頁 13 節,分 5 區 一、這是什麼 三十秒判斷關不關你的事
先確認這一篇解的是不是你的問題。看完這兩節如果覺得不像,就不用再往下讀——省下的時間比讀完更值錢。
01 解決的工作問題測驗做完、分數出來,然後就沒有然後了。學員知道自己 62 分,但不知道下一步該補什麼;帶課的人也說不出這一班到底哪裡沒懂。把作答丟給 AI 要它「分析一下」,它會很快給你一段讀起來很專業的診斷——問題是那段診斷通常對不回任何一道題目,而且它很容易從低分推論到學習態度上去。這個方法真正要建立的,是「每一個弱點結論都指得回具體題號 」這件事。
02 什麼時候用、什麼時候別用什麼情況下該用這一套 測驗題目在出題時就標了考的觀念與教材出處(或還來得及補標)。 有一批作答結果,不只是總分,而是逐題對錯。 診斷之後真的會安排補強,不是只為了產一份報表。 什麼情況下別用
題目沒有觀念標記時 AI 會自己發明分類,而且每次跑出來的分類都不一樣,前後兩次無法比較。
只有總分沒有逐題 沒有逐題就沒有依據,任何弱點結論都是猜的。
要拿來考核、升遷或決定去留 那是人事決定,需要更嚴謹的程序與救濟管道,不適用這個方法。
推論學習態度、動機或能力 作答資料支撐不了這些結論,寫出來會傷到人 。誰會用到
老師 你最需要的是班級層級的診斷:這一班哪個觀念集體沒懂。個別學員的部分要小心,那份很容易變成另一種排名。
教育訓練 內訓的價值在於「訓完有沒有變」。診斷要對得回教材出處,補強才排得出來。
HR 職能測驗的診斷結果若進到考績或升遷,性質就變了——那時要適用的是更嚴格的標準,不是這個方法。
主管 要擋的是「用分數推論態度」。AI 很願意寫「學習動機不足」,那不是資料能支撐的結論。
顧問 替客戶做訓練成效評估時,最容易被要求給「等第」。等第是決定,決定要有人負責,不要交給模型。 所屬工作情境 二、整件事怎麼跑 先看圖,再看逐步
先用一張圖抓全貌,再看逐步展開。圖看不懂沒關係,下一節會把每一步實際在做什麼、誰做,一條一條講清楚。
03 流程圖這張圖是整篇的骨架:輸入 → 步驟 → 困難點 → AI/Agent/Tool 介入 → 人工檢查 → 產出。紅框是最常出事的位置,綠框是不能下放的人工檢查點,粗框是中止條件。後面每一節都是在展開圖上的某一格。
AI 學習診斷:每個弱點都要指得回題號 Human 輸入 Human 步驟 AI Tool Checkpoint Output Risk 困難點 Stop 中止
看圖重點: 整張圖的重量都在第四步那個綠色檢查點,而它檢查的東西只有一件:AI 說的每個弱點,是哪幾題支持的。沒有這一欄的時候,你會拿到一段讀起來很專業、但對不回任何題目也無法驗證的診斷;有這一欄的時候,它沒把握的項目會誠實地標成【無法判斷】 ——因為它找不到支持的題號。右下角的中止條件也值得看一眼:題目沒有觀念標記就不要開始,那是這個方法唯一不能省的前置。純文字流程表(手機/螢幕閱讀器建議看這張) AI 學習診斷:每個弱點都要指得回題號(純文字流程表) 序 類型/角色 流程步驟 這一步的困難點/中止條件 1 Human 題目與觀念標記 + 教材出處 + 逐題作答 + 觀念先後關係 姓名換代號;選了哪個選項要留 — 2 Human 人確認每題都標了觀念與出處,並去識別化 失敗與中止條件 題目沒有觀念標記時停止診斷,先補標記——否則分類每次都不一樣
3 AI AI 依觀念統計答對率,每個結論附「支持題號」 困難點/風險 歸因對不回題目:讀起來很專業,但無法執行也無法驗
4 AI AI 區分四類錯誤:不會/看錯題目/粗心/無法判斷 困難點/風險 從分數推論到人:「動機不足」「基礎不紮實」
5 Checkpoint 人逐條核對支持題號,對不上就退回 — 6 Human 人依觀念先後關係排補強順序(無法判斷者不排) 困難點/風險 三種錯混在一起,補強開錯藥
7 Tool 試算表比對兩輪答對率,分開看新題與舊題 — 8 Output 弱點診斷表 + 補強清單 + 學習路徑 —
Mermaid 原始碼(貼進 Mermaid Live 或 draw.io 可再編輯) 可直接複製,改成你自己的流程 複製 Mermaid
flowchart TD
in1(["<b>Human</b><br/>題目與觀念標記 + 教材出處 + 逐題作答 + 觀念先後關係<br/><small>姓名換代號;選了哪個選項要留</small>"])
s1["<b>Human</b><br/>人確認每題都標了觀念與出處,並去識別化"]
a1[/"<b>AI</b><br/>AI 依觀念統計答對率,每個結論附「支持題號」"/]
a2[/"<b>AI</b><br/>AI 區分四類錯誤:不會/看錯題目/粗心/無法判斷"/]
c1{{"<b>Checkpoint</b><br/>人逐條核對支持題號,對不上就退回"}}
s2["<b>Human</b><br/>人依觀念先後關係排補強順序(無法判斷者不排)"]
t1[("<b>Tool</b><br/>試算表比對兩輪答對率,分開看新題與舊題")]
o1(["<b>Output</b><br/>弱點診斷表 + 補強清單 + 學習路徑"])
st1[/"<b>Stop</b><br/>題目沒有觀念標記時停止診斷,先補標記——否則分類每次都不一樣"\]
r1>"<b>Risk</b><br/>歸因對不回題目:讀起來很專業,但無法執行也無法驗"]
r2>"<b>Risk</b><br/>從分數推論到人:「動機不足」「基礎不紮實」"]
r3>"<b>Risk</b><br/>三種錯混在一起,補強開錯藥"]
in1 --> s1
s1 --> a1
a1 --> a2
a2 --> c1
c1 --> s2
s2 --> t1
t1 --> o1
s1 ==>|中止| st1
a1 -.->|風險| r1
a2 -.->|風險| r2
s2 -.->|風險| r3
in1 -.->|退回| s1
s1 -.->|退回| a1
a1 -.->|退回| a2
a2 -.->|退回| c1
c1 -.->|題號對不上,退回重跑| a1
c1 -.->|退回| s2
s2 -.->|退回| t1
t1 -.->|退回| o1
classDef clsIn fill:#FFFFFF,stroke:#2C4459,stroke-width:2px,color:#141E2B
classDef clsHuman fill:#FBFCFD,stroke:#7A8CA0,stroke-width:2px,color:#141E2B
classDef clsAI fill:#FFF6EA,stroke:#DE9A45,stroke-width:2px,color:#141E2B
classDef clsAgent fill:#FDEBD2,stroke:#B87A2E,stroke-width:2px,color:#141E2B
classDef clsTool fill:#EDF2F6,stroke:#2C4459,stroke-width:2px,color:#141E2B
classDef clsCheck fill:#E8F2EC,stroke:#3F7A5A,stroke-width:2px,color:#123024
classDef clsOut fill:#141E2B,stroke:#141E2B,stroke-width:2px,color:#F2F6F9
classDef clsRisk fill:#FCEFEA,stroke:#C0552F,stroke-width:2px,color:#5E2110
classDef clsStop fill:#F7E1DB,stroke:#8E2F17,stroke-width:3px,color:#5E2110
class in1 clsIn;
class s1 clsHuman;
class a1 clsAI;
class a2 clsAI;
class c1 clsCheck;
class s2 clsHuman;
class t1 clsTool;
class o1 clsOut;
class st1 clsStop;
class r1 clsRisk;
class r2 clsRisk;
class r3 clsRisk; 04 完整步驟圖的文字版,逐步展開 完整版共 7 步:把三分鐘版沒展開的準備與收尾也補進來,每一步誰做、做完會有什麼。
序 誰做 步驟與說明 1 Human 確認題目標記 每題的觀念與出處是否都標了。事後才想歸類就會變成 AI 亂猜。→ 已標記題本 2 Human 去識別化作答 學員姓名換成代號。班級層級的診斷完全不需要姓名。→ 去識別化作答表 3 AI 觀念層級歸因 依觀念統計答對率,列出最弱的三到五個,每個結論要列出是哪幾題支持。→ 弱點診斷表 4 AI 區分錯的類型 判斷比較像不會、看錯題目還是粗心,並說明判斷依據;判不出來標【無法判斷】。→ 錯誤類型標記 5 Human 核對歸因 逐條看它列的題號支不支持結論。對不上的就是它在編。→ 確認過的診斷 6 Human 排補強順序 先補會擋住後面的觀念,再補獨立細節。順序由人排。→ 補強清單與學習路徑 7 Human 下一輪重考驗證 刻意重考上一輪的弱點,確認補起來了沒有。→ 驗證紀錄
三、動手做 備料 → 指令 → 產出 → 工具
這一區是真的動手:先備料、再貼指令、然後對照產出應該長什麼樣。手上是哪一支 AI 都做得完,差別寫在最後的工具那一節。
05 開始前要準備什麼標「必要」的沒備齊就先別開始
題目與觀念標記必要 每題考什麼觀念、對應教材哪一段。這是診斷的唯一依據。
逐題作答結果必要 不是總分,是每人每題的對錯(選擇題最好連選了哪個選項都留)。
教材出處對照必要 觀念對應到教材第幾章、哪一份講義。補強清單要指得到具體位置。
觀念的先後關係必要 哪些觀念會擋住後面的。排補強順序時要用,AI 不知道你的課程結構。
診斷結果的閱讀範圍必要 誰看得到班級層級、誰看得到個別層級。先講清楚。
上一輪的診斷結果可選 有的話拿出來,才能看出補強有沒有效。 餵進去的東西要長這樣 題目與觀念標記 + 教材出處對照 + 逐題作答結果(已去識別化)+ 觀念先後關係 + 上一輪診斷(如有)。
每題都要有觀念標記與出處,缺標的題目寧可先排除也不要讓 AI 自己分類。 作答結果要逐題,選擇題最好連選了哪個選項都留——錯誤選項的集中度是判斷錯誤類型的主要依據。 學員姓名一律換成代號。 反向題、情境題等特殊題型要標出來。 重考輪次要標明哪些是新題。 【題目與標記】
Q1 觀念:資料去識別化的範圍|出處:講義 2-1|題型:一般
Q2 觀念:資料去識別化的範圍|出處:講義 2-1|題型:反向題
Q6 觀念:判斷 AI 是否在編造|出處:講義 4-3|題型:情境題
…(共 20 題)
【觀念先後關係】
「要求 AI 附出處」→ 是「判斷 AI 是否在編造」的前提
「資料去識別化的範圍」→ 獨立
【作答結果】(24 人,姓名已換代號;括號內為所選選項)
學員01:Q1✓(A) Q2✓(D) Q3✓(B) Q4✗(C) Q5✗(A) Q6✗(C) …
學員02:Q1✓(A) Q2✗(B) Q3✓(B) Q4✓(A) Q5✗(C) Q6✗(C) …
…
【教材出處對照】
講義 2-1|第 3 頁|資料去識別化
講義 4-1|第 8 頁|要求出處的三種問法
講義 4-3|第 11 頁|合理但沒有依據的三種樣態 06 Prompt(快速/完整/進階)A 快速版貼上就能用;B 完整實戰版把角色、限制、步驟、輸出格式與驗收標準寫足;C 進階版是拿去建 GPT/Skill/Agent 的系統指令,預設收起來,要用再點開。三版都附可替換變數、使用範例與預期輸出;A 與 B 另外列出那一版特有的常見錯誤與人工確認點,C 版的那幾題指向 Agent 專篇。
三種版本共通的紅線 三版都不適合用在 不要用在沒有觀念標記的題目上——那會得到每次都不一樣的分類。 不要拿來做考核、升遷或決定去留的依據。 不要推論學習態度、動機或能力。 三版都必須由人確認 題目與觀念的對應由出題的人負責,這是診斷的地基。 每個弱點結論的支持題號要由人逐條核對。 補強順序由懂課程結構的人排。 個別診斷的閱讀範圍由人決定,公開等於排名。 適合的工具 ChatGPT Claude NotebookLM
👇 直接複製,{ } 換成你的內容 複製這段 Prompt
以下是測驗題目(含每題的觀念標記與出處)與學員作答結果。請做學習診斷:
1. 依觀念統計答對率,列出這一批人最弱的三到五個觀念,每個觀念要列出「是哪幾題支持這個結論」。
2. 對每個弱點,判斷比較像「不會」「看錯題目」還是「粗心」,並說明你的判斷依據。判斷不出來的標【無法判斷】,不要猜。
3. 對每個弱點指出應該回頭看的教材出處(用我提供的標記,不要自己編章節)。
4. 個別學員的部分:只列出「這個人明顯落後全體的觀念」,不要給綜合評語、不要排名。
規則:不要用分數推論學習態度或能力;作答資料不足以支撐的結論一律標【資料不足】。
題目與觀念標記:{貼上}|作答結果:{貼上} 可替換變數 變數 要換成什麼 {貼上}題目與觀念標記、教材出處。 {貼上}逐題作答結果(已去識別化)。
完整使用範例(照這樣填) 以下是測驗題目(含每題的觀念標記與出處)與學員作答結果。請做學習診斷。(照母提示詞四條)
【題目與標記】
Q1 觀念:資料去識別化的範圍|出處:講義 2-1
Q2 觀念:資料去識別化的範圍|出處:講義 2-1
Q3 觀念:提示詞中的角色設定|出處:講義 3-2
Q4 觀念:要求 AI 附出處|出處:講義 4-1
Q5 觀念:要求 AI 附出處|出處:講義 4-1
Q6 觀念:判斷 AI 是否在編造|出處:講義 4-3
Q7 觀念:判斷 AI 是否在編造|出處:講義 4-3
Q8 觀念:判斷 AI 是否在編造|出處:講義 4-3
…(共 20 題)
【作答結果】(24 人,已去識別化)
學員01:Q1✓ Q2✓ Q3✓ Q4✗ Q5✗ Q6✗ Q7✗ Q8✓ …
學員02:Q1✓ Q2✗ Q3✓ Q4✓ Q5✗ Q6✗ Q7✗ Q8✗ …
… 預期輸出範例(拿到的東西應該長這樣) 【觀念層級答對率】
| 觀念 | 支持題號 | 答對率 | 判定 |
|---|---|---|---|
| 判斷 AI 是否在編造 | Q6, Q7, Q8 | 31%(22/72) | 最弱 |
| 要求 AI 附出處 | Q4, Q5 | 44%(21/48) | 弱 |
| 資料去識別化的範圍 | Q1, Q2 | 79%(38/48) | 尚可 |
| 提示詞中的角色設定 | Q3 | 92%(22/24) | 良好 |
【最弱的三個觀念】
1. 判斷 AI 是否在編造(Q6, Q7, Q8,答對率 31%)
類型判斷:比較像「不會」。依據——三題的錯誤答案高度集中在同一個選項(Q6 有 17 人選 C、Q7 有 15 人選 B),且這兩個選項的共同特徵是「聽起來很有道理但沒有出處」。這代表學員的判準本身就是錯的,不是粗心。
建議回頭看:講義 4-3
2. 要求 AI 附出處(Q4, Q5,答對率 44%)
類型判斷:【無法判斷】。依據——Q4 錯的人與 Q5 錯的人重疊度只有 40%,作答型態不一致,我看不出是概念不清還是題目本身有歧義。建議你檢查 Q5 的題幹敘述。
建議回頭看:講義 4-1
3. 資料去識別化的範圍(Q1, Q2,答對率 79%)
類型判斷:比較像「看錯題目」。依據——Q2 是反向題(「下列何者『不』屬於」),錯的 10 人裡有 8 人選了正向答案。
建議回頭看:講義 2-1;另建議檢視反向題的出題方式。
【個別落後的部分】
以下學員在特定觀念上明顯落後全體(僅列觀念,不做排名、不給評語):
- 學員02、學員09、學員17:資料去識別化的範圍
- 學員05、學員13:提示詞中的角色設定(此觀念全體答對率 92%,落後較明顯)
【我沒有做的事】
- 沒有計算總分排名、沒有給任何學員綜合評語。
- 沒有從答對率推論學習態度、動機或能力。
- 沒有使用我沒拿到的資料(出席、作業、過往成績)。 常見錯誤用法 看到「最弱的三個觀念」就直接排補強,跳過支持題號那一欄。那一欄才是讓你確認它沒有在編的東西。 把【無法判斷】自行解讀成「大概是不會吧」。它標無法判斷的時候,通常是題目本身有問題。 把個別落後清單發給全班。那會變成另一種排名。 這一版另外不適合 沒有額外的,看上面「三種版本共通的紅線」那一段就好。
缺少資料時怎麼辦 沒有觀念標記時,它會自己發明分類,而且每次跑都不一樣,前後兩次無法比較。這是這個方法唯一不能省的前置。
這一版另外要人確認 沒有額外的,看上面「三種版本共通的紅線」那一段就好。
適合的工具 ChatGPT Claude NotebookLM
👇 直接複製,{ } 換成你的內容 複製這段 Prompt
以下是已確認過的弱點診斷、教材出處對照,以及觀念之間的先後關係。請產出補強路徑:
1. 【補強順序】依我提供的先後關係排序,先補會擋住後面的觀念。每一項要說明「為什麼排這個位置」,並標明它擋住了哪些後續觀念。
2. 【每項補強的做法】依錯誤類型給不同做法:
- 判定為「不會」的:指出教材出處,並設計一個「先講清楚判準、再練」的練習方式。
- 判定為「看錯題目」的:不需要補教材,需要的是題目形式的說明或作答提醒。
- 判定為「粗心」的:不需要補教材,需要的是檢查習慣。
- 判定為【無法判斷】的:不要排補強,改列為「需先釐清的事」,並寫出要釐清什麼。
3. 【驗證設計】下一輪要重考哪些觀念、各出幾題、要達到什麼水準才算補起來。
4. 【時間估計】每項補強大概需要多少時間,以及整體排在幾次課裡。
規則:
- 補強做法要能對回教材出處,不得自行編章節或推薦我沒提供的材料。
- 不要對任何學員的能力或態度下判斷。
- 判定為「看錯題目」與「粗心」的項目,不要用「多練習」帶過——那是最沒有用的建議。
弱點診斷:{貼上}|教材出處對照:{貼上}|觀念先後關係:{貼上} 可替換變數 變數 要換成什麼 {貼上}已由人核對過的弱點診斷。 {貼上}觀念對應到教材的哪一章哪一份講義。 {貼上}哪些觀念是後面觀念的前提。
完整使用範例(照這樣填) (貼上前一步的診斷)
【觀念先後關係】
「要求 AI 附出處」是「判斷 AI 是否在編造」的前提——不會要出處,就沒有東西可以拿來判斷。
「資料去識別化的範圍」獨立,不擋任何後續觀念。 預期輸出範例(拿到的東西應該長這樣) 【補強順序】
第 1 順位:要求 AI 附出處(Q4, Q5)
為什麼排第一:它是「判斷 AI 是否在編造」的前提。學員不會要求出處,就沒有東西可以拿來判斷真假,直接補第二項會補不動。
擋住:判斷 AI 是否在編造。
⚠ 注意:此項診斷為【無法判斷】,見下方「需先釐清的事」。釐清後才排入。
第 2 順位:判斷 AI 是否在編造(Q6, Q7, Q8)
為什麼排第二:答對率最低(31%),但依賴第 1 項。
擋住:無後續觀念。
第 3 順位:資料去識別化的範圍(Q1, Q2)
為什麼排最後:判定為「看錯題目」而非不會,實際的觀念掌握度可能高於 79%。
【每項補強的做法】
第 2 項(判定:不會)
- 教材出處:講義 4-3
- 這一項不能只重講一次。錯誤集中在「聽起來有道理但沒有出處」的選項,代表學員的判準是「合不合理」而不是「有沒有依據」。建議先花十分鐘把這兩者的差別講清楚,再進到練習。
- 練習方式:給三段 AI 產出的文字,其中一段有出處、一段出處是編的、一段沒有出處。請學員先分類,再說明理由。重點在說明理由,不在分類正確。
第 3 項(判定:看錯題目)
- 不需要補教材。
- 需要的是作答提醒:反向題(「下列何者不」)在題本中已用底線標示,但仍有 8 人選了正向答案。建議下次改為粗體加底線,並在測驗開始前口頭提醒。
- 這一項也建議檢討出題方式,不完全是學員的問題。
【需先釐清的事】
第 1 項(要求 AI 附出處)
- Q4 錯的人與 Q5 錯的人重疊度只有 40%,作答型態不一致。
- 要釐清的是:Q5 的題幹是否有歧義。建議找兩三位答錯的學員問「你當時怎麼理解這一題」。
- 釐清之前不要排補強——如果是題目的問題,補強會補錯方向。
【驗證設計】
下一輪重考:
| 觀念 | 題數 | 通過標準 |
|---|---|---|
| 判斷 AI 是否在編造 | 4 題(含 2 題新題) | 全班答對率達 70% |
| 要求 AI 附出處 | 3 題(Q5 改寫後重用) | 全班答對率達 70% |
| 資料去識別化的範圍 | 2 題(含 1 題反向題) | 全班答對率達 85% |
※ 含新題是為了避免只是背了上次的答案。
【時間估計】
第 2 項:講解 10 分鐘 + 練習與討論 25 分鐘
第 3 項:作答提醒 3 分鐘(併入下次測驗前)
第 1 項:釐清後再估
建議排入下一次課的前半段,合計約 40 分鐘。 常見錯誤用法 把【無法判斷】的項目硬排進補強。如果那其實是題目的問題,補強會補錯方向而且沒人發現。 驗證重考時完全用原題。學員記得答案,答對率會漂亮地上升但什麼都沒證明。要含新題。 把「看錯題目」的項目也拿去補教材。那不是知識問題,補了也不會改善。 這一版另外不適合 沒有額外的,看上面「三種版本共通的紅線」那一段就好。
缺少資料時怎麼辦 沒有觀念先後關係時,它只能依答對率高低排序,而那通常是錯的順序——最弱的觀念常常是因為前提沒建立。
這一版另外要人確認 沒有額外的,看上面「三種版本共通的紅線」那一段就好。
C C. 進階版(兩輪之間的成效驗證) 補強做完、重考也考完了,要確認到底補起來沒有,以及下一輪該調整什麼。
適合的工具 ChatGPT Claude 試算表
👇 直接複製,{ } 換成你的內容 複製這段 Prompt
以下是同一批學員兩輪測驗的觀念層級結果,以及中間做過的補強內容。請做成效驗證:
1. 【逐觀念比對】兩輪答對率並列,標出上升、下降、持平。上升的要判斷是否達到當初設定的通過標準。
2. 【真的補起來了嗎】對每個上升的觀念,判斷證據強度:
- 若第二輪含新題且新題答對率與舊題相近 → 證據較強
- 若新題答對率明顯低於舊題 → 可能只是記得答案,標記為「存疑」
- 若第二輪未含新題 → 一律標記為「無法確認」
3. 【沒補起來的】列出未達標準的觀念,並依第二輪的錯誤型態重新判斷錯誤類型——如果類型變了(例如從「不會」變成「粗心」),那其實是進步,要說明。
4. 【補強做法的檢討】對照中間做過的補強內容,指出哪一種做法對哪一類錯誤有效、哪一種沒效。這是下一輪設計的依據。
5. 【下一輪建議】最多三項。
規則:
- 不要用兩輪的變化推論任何學員的努力程度或學習態度。
- 樣本數少於 10 人的觀念,結論要標註樣本偏少。
- 無法從資料判斷的一律標【資料不足】。
第一輪結果:{貼上}|補強內容:{貼上}|第二輪結果:{貼上} 可替換變數 變數 要換成什麼 {貼上}第一輪的觀念層級結果。 {貼上}兩輪之間實際做了哪些補強。 {貼上}第二輪結果,需標明哪些是新題。
完整使用範例(照這樣填) (貼上兩輪結果與補強紀錄,第二輪的 Q6-1、Q6-2 為新題) 預期輸出範例(拿到的東西應該長這樣) 【逐觀念比對】
| 觀念 | 第一輪 | 第二輪 | 變化 | 通過標準 | 達標? |
|---|---|---|---|---|---|
| 判斷 AI 是否在編造 | 31% | 74% | ↑43 | 70% | 達標 |
| 要求 AI 附出處 | 44% | 68% | ↑24 | 70% | 未達標 |
| 資料去識別化的範圍 | 79% | 88% | ↑9 | 85% | 達標 |
【真的補起來了嗎】
- 判斷 AI 是否在編造:證據較強。第二輪含 2 題新題,新題答對率 71%、舊題 77%,差距不大,代表不是只記得答案。
- 要求 AI 附出處:存疑。舊題(Q5 改寫)答對率 79%,但新題只有 54%,差距 25 個百分點。學員可能是熟悉了這個題型,而不是掌握了觀念。
- 資料去識別化的範圍:達標,但上升幅度只有 9 個百分點,且第一輪本來就判定為「看錯題目」——這次的改善比較可能來自作答提醒(反向題改為粗體),而不是觀念本身的變化。
【沒補起來的】
要求 AI 附出處(68%,差 2 個百分點)
第二輪錯誤型態:錯的人分散,沒有集中在特定選項,且多為新題。錯誤類型從第一輪的【無法判斷】變成比較像「不會」。
這其實是有意義的變化——第一輪的【無法判斷】是因為題目有歧義,Q5 改寫後型態變清楚了,現在看到的是真實的掌握不足。建議下一輪就針對這一項補。
【補強做法的檢討】
有效:
- 「先講清楚判準、再練」對「不會」型錯誤有效(判斷編造:31%→74%)。特別是「先分類再說明理由」的練習方式,第二輪新題的表現支持這一點。
- 作答提醒對「看錯題目」型有效(去識別化:79%→88%),而且只花了 3 分鐘。
沒效或不明:
- 「要求 AI 附出處」這一項在第一輪被判為【無法判斷】而沒有排補強,實際上也確實沒補。所以這次的 68% 不是補強無效,是根本沒補。這是流程問題不是方法問題。
【下一輪建議】
1. 針對「要求 AI 附出處」排補強,套用「先講清楚判準、再練」的做法(該做法在另一個觀念上已驗證有效)。
2. 每一輪重考一律含至少三分之一新題。這次「要求 AI 附出處」的新舊題差距 25 個百分點,如果沒有新題會誤判為達標。
3. 出題時的反向題一律粗體加底線,並在測驗前口頭提醒——這一項成本 3 分鐘、效果明確,直接常態化。
※ 本次 24 人,各觀念樣本數足夠,未觸發樣本偏少的標註。 固化成助手是另一件工程,這一頁不重講 下面這幾題每個方法都一樣,站上各有一篇:
07 產出應該長什麼樣拿到的東西要長這樣 四節:觀念層級答對率、最弱觀念與錯誤類型(各附支持題號)、個別落後觀念清單、我沒有做的事。
完成品:同一份作答的兩種診斷:有支持題號 vs 沒有 【沒有要求支持題號】
AI 回覆:「整體來看,學員在『判斷 AI 輸出可信度』這個面向的掌握度較弱,建議加強相關概念的說明與練習。另外部分學員的基礎概念不夠紮實,可能需要額外輔導。整體而言,本次培訓成效尚可,但仍有進步空間。」
→ 讀起來很專業,而且完全無法執行。
→ 「判斷 AI 輸出可信度」這個說法不對應題本上的任何一個觀念標記,是它自己造的詞。
→ 「基礎概念不夠紮實」是對人的判斷,資料支撐不了。
【要求每個結論列出支持題號】
AI 回覆(節錄):
「判斷 AI 是否在編造(支持題號:Q6, Q7, Q8)|答對率 31%(22/72)
類型判斷:比較像『不會』。依據——三題的錯誤答案高度集中在同一個選項:Q6 有 17 人選 C、Q7 有 15 人選 B。這兩個選項的共同特徵是『聽起來很有道理但沒有出處』。若是粗心,錯誤應該分散在各選項;集中在特定選項代表學員的判準本身就是錯的。
建議回頭看:講義 4-3」
→ 每一句都可以驗證。你可以自己去數 Q6 有幾個人選 C。
→ 它給的補強方向是具體的:問題不在「不知道要判斷」,在「判斷的標準錯了」。
【差別在哪】
兩次用的是同一份作答資料。差別只在有沒有強制要求「這個結論是哪幾題支持的」。
沒有這一欄的時候,AI 會給你一段讀起來像診斷的文字;有這一欄的時候,它必須指得回具體題號,而指得回題號的結論你才有辦法驗。
※ 附帶效果:加上這一欄之後,那些它其實沒把握的項目會誠實地標成【無法判斷】——因為它找不到支持的題號。 輸出格式規格(要照著做的人再展開) 每個弱點結論後面必須有「支持題號」,沒有的一律視為無效結論。 錯誤類型只有四種:不會/看錯題目/粗心/無法判斷,且要說明判斷依據。 教材出處只能用輸入提供的標記,不得自行編章節。 個別部分只列觀念,不排名、不給綜合評語。 「我沒有做的事」那一節不得省略——它是這份報告的邊界宣告。 一、觀念層級答對率
| 觀念 | 支持題號 | 答對率 | 判定 |
|---|---|---|---|
| 判斷 AI 是否在編造 | Q6, Q7, Q8 | 31% | 最弱 |
二、最弱觀念與錯誤類型
1. 判斷 AI 是否在編造(Q6, Q7, Q8,31%)
類型:不會。依據——錯誤集中在同一選項(Q6 有 17 人選 C),該選項特徵為「合理但無出處」,代表判準本身錯誤。
回頭看:講義 4-3
2. 要求 AI 附出處(Q4, Q5,44%)
類型:【無法判斷】。依據——兩題錯的人重疊度僅 40%,型態不一致,建議檢查 Q5 題幹是否有歧義。
三、個別落後觀念(僅列觀念,不排名、不評語)
- 學員02、學員09、學員17:資料去識別化的範圍
四、我沒有做的事
- 未計算總分排名、未給任何學員綜合評語
- 未從答對率推論學習態度、動機或能力
- 未使用未提供的資料(出席、作業、過往成績) 08 工具怎麼挑這幾支都做得到——差別在你手上有哪一支、資料能不能外流。標「起手」的是不知道從哪支開始時的建議,不是限定。
工具 什麼時候用 為什麼 注意 ChatGPT ↗ 起手 批改與歸因 一般班級規模的診斷 統計與歸因穩定,能依要求逐條列出支持題號。 作答資料要先去識別化,姓名換代號。 Claude ↗ 一次處理整班作答 整班或多班一次處理 長輸入穩定,較不會只看前面幾位就下結論。 同樣先去識別化。 NotebookLM ↗ 補強內容對回教材出處 補強要嚴格對回教材 原生附出處,可確保建議的補強位置真的存在於教材中。 只上傳教材,不要上傳學員資料。 Gemini ↗ 讀 Google 表單的作答紀錄 測驗用 Google 表單、作答紀錄在試算表 作答明細不必搬家就能做歸因。 每個弱點都要對得回具體題號;對不回去的敘述一律刪掉。 試算表 作答紀錄與趨勢 兩輪以上的比對與趨勢 答對率並列、變化計算,留得住版本也看得到算法。 公式要自己驗一次,特別是跨輪次的對應。
四、不要做錯 這幾關不下放
這一區是踩過的坑與該守的線。標「不下放」的步驟請不要交給 AI 決定;Checklist 是拿來驗收的,不是拿來勾好看的。
09 會卡住與會做錯的地方會卡住的地方(流程困難點)
歸因對不回題目 AI 給的診斷讀起來很順,但你問它「這是根據哪幾題」的時候答不出來,或答出來的題目其實不考那個觀念。
從分數推論到人 「學習動機不足」「基礎不紮實」這類話,資料支撐不了,但 AI 寫得很自然。
三種錯混在一起 不會、看錯題目、粗心的補強方式完全不同。混成一個「弱點」之後,補強就會開錯藥。
診斷完沒有下一步 產出一份漂亮的報表,然後沒有重考、沒有驗證。這樣永遠不知道補強有沒有用。 會做錯的地方(常見失敗方式) 題目沒有觀念標記 AI 自行發明分類,每次跑都不一樣,兩輪無法比較。
怎麼修 出題時就標觀念與出處;來不及的先補標,缺標的題目排除。
歸因對不回題目 診斷讀起來很專業但無法執行也無法驗證。
怎麼修 強制每個結論列出支持題號,對不上的一律退回。
從分數推論到人 「動機不足」「基礎不紮實」這類評語傷人且無依據。
怎麼修 在規則中明文禁止,並保留「我沒有做的事」那一節作為邊界宣告。
三種錯混在一起 看錯題目與粗心被當成不會,補教材補不到問題點。
怎麼修 強制區分四類並說明判斷依據,不同類型走不同補強做法。
依答對率高低排補強 最弱的觀念常常是因為前提沒建立,先補它會補不動。
怎麼修 提供觀念先後關係,由人依前提關係排序。
重考全用原題 答對率漂亮上升,但可能只是記得答案。
怎麼修 每輪重考至少三分之一新題,並比對新舊題答對率差距。
其他注意事項 個別學員的診斷若在班上公開,會變成另一種排名。診斷結果的閱讀權限要先想好。 10 人工把關與安全限制AI/Agent/Tool 介入在哪幾步 流程位置 誰 做什麼/怎麼做 歸因階段 AI 依觀念統計並列出支持題號 每個弱點結論後面要接「支持題號」欄。這一欄讓你可以驗,也讓它比較難編。歸因階段 AI 區分錯誤類型 從作答型態判斷(例如選了相近選項像不會、前面對後面錯像時間不夠、簡單題錯難題對像粗心),並說明依據。補強階段 AI 對應教材出處 只能用你提供的出處標記,不得自行編章節。驗證階段 Tool 兩輪結果比對 試算表把兩輪同觀念的答對率擺在一起,看有沒有真的補起來。
這幾關不下放
題目與觀念的對應 這是診斷的地基,由出題的人負責。
歸因核對 逐條檢查支持題號,對不上的一律退回。
補強順序 哪個觀念會擋住後面的,只有懂課程結構的人知道。
個別診斷的閱讀範圍 誰看得到,先決定。公開等於排名 。
不做能力與態度評語 任何指向人格特質的結論一律刪除。 安全與權限限制
作答資料是個人資料 姓名一律換代號。班級層級的診斷完全不需要姓名。
教材與學員資料分開處理 上傳教材給附出處的工具時,不要一併上傳學員作答。
個別診斷的閱讀範圍 誰看得到要先定。班上公開等於排名,對學員是傷害。
不得作為人事決定依據 考核、升遷、去留需要更嚴謹的程序與救濟管道。
保存期限 作答紀錄要保存多久、什麼時候刪,比照單位的個資規定辦理。 11 Checklist 與驗收標準做的時候逐項打勾 做完了才檢查:全部成立才算完成 每一題在出題時就標了觀念與教材出處。 每個弱點結論都列出支持題號,且經人逐條核對確認相符。 錯誤類型已分為不會/看錯題目/粗心/無法判斷四類,且各有判斷依據。 標為【無法判斷】的項目沒有被硬排進補強,而是列為需先釐清的事。 補強清單指到具體教材出處,沒有出現「多練習」這類無效建議。 補強順序依觀念的先後關係排列,不是依答對率高低。 報告中沒有任何指向學習態度、動機或能力的評語。 作答資料已去識別化,個別診斷的閱讀範圍已明確。 下一輪重考已排定,且含至少三分之一新題。 五、延伸 把流程走一遍,然後往下一步
先用一個示範情境把流程從頭走一遍,再看具名機構真的做過的事,最後決定下一步往哪走。
12 示範情境答對率 31% 的那一題組:他們不是不會,是判準本來就錯了
這是示範情境,不是真實個案:作者為了把上面的流程走一遍而寫的設想,人物、數字與結果都是設定。目前也還沒找到可公開查證的外部案例——這類工作多半不會有人發新聞稿,找不到不代表沒人做;在找到之前,這一頁的方法就是作者自己的做法,不借別人的名義。去找靈感看其他方法的外部案例 →
設想的狀況: 一場內部 AI 使用培訓,課後測驗 20 題、24 人。有一個三題的題組答對率只有 31%,帶課的人原本打算「再講一次」。
AI 負責什麼 依觀念統計答對率,並在每個結論後列出支持題號。 指出錯誤高度集中在同一個選項——Q6 有 17 人選 C、Q7 有 15 人選 B。 點出這兩個選項的共同特徵是「聽起來很有道理但沒有出處」,判斷學員的判準是「合不合理」而不是「有沒有依據」,屬於「不會」而非粗心。 另一個題組標為【無法判斷】,理由是兩題錯的人重疊度只有 40%,建議檢查其中一題的題幹是否有歧義。 人負責什麼 逐條核對支持題號,確認 AI 引用的題目確實考那個觀念。 接受【無法判斷】的提醒,去問了三位答錯的學員「你當時怎麼理解這一題」——結果確實是題幹有歧義。 依觀念的先後關係重排順序,把原本答對率最低的那一項排在第二,因為它的前提觀念還沒建立。 設計重考時刻意加入新題,避免只是記得答案。 照著走完會得到: 如果照原本的打算「再講一次」,講的還是同一套內容,而學員的問題不在內容沒聽懂,在於他們判斷真假的標準本身就錯了。真正有效的補強是先花十分鐘把「合理」跟「有依據」的差別講清楚——這一點是從錯誤選項的集中度看出來的,不是從答對率看出來的。
待補資料:本站不提供學習成效提升的量化數字。建議自己記錄兩個指標——「重考新題的答對率」與「錯誤類型的變化」。第二個常被忽略,但從『不會』變成『粗心』是實質進步,答對率上可能只動幾個百分點。
13 相關方法與下一步題目本身要先站得住 診斷的品質上限就是題目標記的品質。
補強材料要找得到 教材出處要對得回一個查得到的地方。
把診斷流程寫成 SOP 誰標題目、誰跑診斷、誰排順序、誰驗證,寫下來才不會斷。
訓練前先問清楚要什麼 訓練要解決什麼問題沒定義清楚,診斷再準也沒有用。
可直接使用RELATED PROMPTS 先理解這些觀念RELATED CONCEPTS 站上可以直接開的作品RELATED WORKS 這個站的做法 有來源 引用的案例都附得出可以點進去的出處;還沒查證完的另外標示,不跟已證實的混在一起。 可驗收 每個方法都附 Checklist 與驗收標準——你要能自己驗,而不是相信 AI 說它做完了。 不亂編 指令一律要求「材料裡沒有的不准補」,缺的標【待補】列成問題,不用漂亮的句子蓋過去。 不自動送出 站內的指令與工具不會替你發布、寄出或執行收不回來的動作。最後一步永遠是人按下去。 人要把關 方法裡標「不下放」的步驟,寫明白就是不要交給 AI 決定。 一般人照做 不用寫程式。步驟寫成照著做的樣子,術語第一次出現就用白話解釋。
取得 AI 實戰工具與更新
之後會不定期整理:新方法、指令包(Prompt Pack)、Checklist 與模板。免費、無廣告;送出後會收到一封確認信,點了連結才算訂閱成功 ,之後每封信都附一鍵退訂。
送出即表示你同意本站的 隱私權說明 :我們只儲存 Email 與同意版本,不會把 Email 和你的閱讀紀錄綁在一起。沒有點確認信就不會收到任何內容,之後也隨時可以一鍵退訂。