scan_date: 2026-08-07 mode: 白話解釋版(companion explainer) tier: 對應 deep 報告 master-teacher-perception-2026-08-07.md


白話解釋版:「名師學習狀態感知的 AI 萃取」到底在講什麼

這份文件是正式 radar 報告的姊妹篇。正式報告為了塞進所有證據,把很多概念壓縮成行話; 這份反過來——不預設你知道任何名詞,每個概念從零解釋,寧可囉嗦不要跳步。 讀完這份再回去看正式報告,應該每一句都能看懂。

0. 導讀:這次調查在回答什麼問題

Brian 的想法是:一位真正的名師,看學生寫題目的過程,心裡會自動跑一套雷達——「這孩子這題卡住了」「他不是不會,是粗心」「他快沒耐心了」「現在該給提示,不是給答案」。這套雷達是名師多年經驗養出來的直覺,名師自己往往說不清楚自己是怎麼判斷的。

問題就是:這套說不清楚的直覺,能不能想辦法「抽取」出來,裝進 AI 裡? 這樣 Ethan 在 Boox 上寫題目時,AI 就能像名師一樣「看得懂他的狀態」並「出對的招」。

radar 調查的任務是:這件事有沒有人做過?做到什麼程度?哪裡還是空白? 答案影響 Brian 該自己蓋、抄別人、還是直接用現成的。


1. 先把三個領域講清楚(正式報告說的「三母領域」)

這個題目橫跨三個研究領域,每個領域都做了很多年、東西堆成山(所以報告說它們是「一缸子」——意思是先例多到滿出來,不需要也不應該自己重新發明)。

1a. ITS(intelligent tutoring system,智慧家教系統)

從 1980 年代就有的東西:一套軟體,出題給學生做、看學生答對答錯、決定接下來出什麼題、給什麼提示。你可以想成「一個自動化的補習班老師」,只是早期版本很死板,全靠工程師事先寫好的規則。

1b. Knowledge tracing(知識追蹤,簡稱 KT)

ITS 的核心零件之一。它回答一個問題:「根據這個學生過去的作答紀錄,他現在到底『會了沒』?」

打個比方:電玩遊戲裡每個技能有熟練度條。知識追蹤就是幫每個知識點(例如「一元二次方程式」「分數通分」)維護一條看不見的熟練度條,學生每答對一題,AI 就把估計往上調一點;答錯就往下調。

1c. LLM tutor(大語言模型家教)

就是「用 ChatGPT/Claude/Gemini 這類 AI 當家教」。2023 年後爆發。代表作:

1d. RL(reinforcement learning,強化學習)訓練教學策略

強化學習=「用獎勵訓練」,跟訓練小狗一樣:做對了給點心,做錯了沒點心,久了小狗自己學會什麼動作能拿到點心。

用在教學上:讓 AI 家教嘗試各種教學動作(給提示?給例題?直接講解?),如果學生後來真的學會了就給 AI「獎勵分數」,AI 慢慢學出一套「什麼狀況該出什麼招」的策略。

這條路學術界做了二十年,一直沒走出實驗室。原因:要讓 AI 試錯,就需要大量真實學生陪它試錯——但沒有學校願意讓 AI 拿自己學生當白老鼠,資料永遠不夠。(這個教訓對 Brian 很重要:家教場景只有一兩個學生,走「RL 訓練」這條路是死路;但「參考它的架構思想」是活路。)

1e. 「交界帶」是什麼意思

三個領域各自都很成熟,但兩兩交叉的地方(例如「用 KT 的學生狀態去指揮 LLM 家教說話」「用 RL 去訓練 LLM 家教」)是 2025-2026 才熱起來的新戰場,論文正在密集地出。radar 的發現之一就是:這個交界帶比原本以為的更熱鬧——好消息是有很多現成方法可以抄,壞消息(其實也不算壞)是不要妄想在交界帶本身做出獨創。


2. 第一點修正強化:「k=1 空縫經正面驗證」逐字拆解

正式報告原句:「k=1 名師萃取空縫經 146 篇引用網驗證=真空縫」。這句話每個詞都需要解釋。

2a. 「k=1」是什麼

k 是統計和機器學習裡的慣用符號,代表「數量」。這裡指萃取對象的教師人數。

差別像什麼?「學做菜的 AI 看了一萬個廚師的影片,學會平均水準的家常菜」vs「阿嬤牌滷肉的味道,只跟阿嬤一個人學」。Brian 想要的是後者——不是「大眾好老師」,是「某位特定名師看學生的眼光」。

2b. 「空縫」是什麼

就是「市場/研究的空白地帶」——大家都在做的區域旁邊,有一塊沒人踩過的空地。radar 報告的核心任務就是找空縫:空縫是真的(真的沒人做過),這個題目才值得 Brian 自己做;空縫是假的(其實有人做過只是你沒搜到),就該直接用別人的。

2c. Bridge 是什麼(本次調查最重要的先例,值得完整講)

Bridge 是 Stanford 大學一位研究者 Rose Wang 在 2024 年發表的研究方法。 它要解決的問題跟 Brian 的一模一樣:資深家教的判斷力是隱性的(他們自己說不清楚),怎麼把它變成 AI 能用的東西?

Bridge 的做法分三步,白話版:

  1. 請專家「邊看邊出聲思考」(think-aloud):找來資深家教,給他們看真實的學生錯誤,請他們一邊看一邊把心裡的想法講出來:「嗯,這個學生把分母加起來了,他應該是把分數加法跟乘法搞混……我不會直接糾正他,我會先問他 1/2 + 1/2 等於多少,讓他自己發現怪怪的。」把這些碎碎念全部錄下來。
  2. 整理成「決策三步驟」:研究者發現專家的思考其實有固定結構——先診斷(學生錯在哪、為什麼錯)→ 再選策略(這種錯該用哪種教法:反問?舉反例?拆小步?)→ 最後才生成回應(實際說出口的那句話)。新手家教和 AI 的通病是跳過前兩步直接講話。
  3. 把這套結構變成給 AI 的指令:教 AI 也照「先診斷→選策略→再說話」的順序來,而不是想到什麼說什麼。

他們標註了 700 段真實家教對話當教材。成果:照這套方法調教的 AI,回應品質明顯更像資深家教。

為什麼這對 Brian 是寶:這就是「名師直覺萃取」的標準作業流程(SOP),而且它天然適合小樣本——只需要少數幾位專家的 think-aloud,不需要百萬筆資料。程式碼是 MIT 授權(法律上可以自由抄用)。

2d. Tutor CoPilot 是什麼

同一批人把 Bridge 裝進真實產品的成果(2024 年)。 場景:美國一個線上家教平台,很多家教其實是新手。Tutor CoPilot 是掛在家教聊天視窗旁邊的「AI 軍師」——家教卡住不知道怎麼回學生時,按一下按鈕,AI 就用 Bridge 那套專家決策邏輯生成建議(「先別給答案,問他這一步為什麼這樣寫」),家教可以照用或改寫。

他們做了嚴格的實驗:900 位家教、1,800 名學生隨機分組,一半有 AI 軍師、一半沒有。結果:有軍師那組的學生通過率更高,而且受益最大的是遇到新手家教的弱勢學生——等於 AI 把資深名師的judgment「即時輸血」給新手。成本低到誇張:每位家教每年約 20 美元。這個研究後來被寫進 2025 年美國總統經濟報告。

注意它跟 Brian 想做的差別:Tutor CoPilot 服務的對象是「人類家教」(AI 當軍師、人上場);Brian 的場景是 AI 直接面對 Ethan。但底層的「專家決策萃取」方法完全通用。

2e. 「146 篇引用網驗證」是什麼意思

學術論文有「引用」機制:後來的論文如果用到、比較到、延伸了前人的工作,就會列出來。所以「誰引用了 Bridge」這張清單,就是「Bridge 發表之後,全世界順著這條路做下去的所有人」的完整名單。

deep 掃描做的事:把引用 Bridge 的 74 篇+引用 Tutor CoPilot 的 72 篇(合計 146 篇)一篇一篇看過,檢查有沒有人做了「k=1 單一名師萃取」。

結果:零。 全部後續研究都走「把很多教師資料聚合起來學平均值」的路線。連最接近的 TeachLM(用 10 萬小時真實家教對話訓練 AI)也是混合多位家教的資料。

這就是「空縫經正面驗證」的意思:不是「我沒搜到所以大概沒人做」(可能只是沒搜到),而是「我把所有順著這條路走的人都點名過了,確定沒人走進這塊空地」。前者是猜,後者是查證——可信度完全不同。

2f. Goblins 是什麼、為什麼標 unverified

調查中發現唯一一個「有點像 k=1」的商業產品:美國一個叫 Goblins 的數學家教 app,宣傳點是「克隆你的老師」——AI 家教的長相、聲音、口頭禪做成你真實老師的樣子。

但關鍵問題是:它克隆的是「皮」還是「腦」?

調查時它的官網連不上、主要報導網站擋爬蟲,無法確認是皮還是腦,所以標記 unverified(未驗證)。從常理推測大概率是皮(克隆聲音外貌的技術成熟便宜,克隆教學決策沒有現成技術),但 radar 的紀律是:沒查證到的就不能寫成結論。


3. 第二點修正強化:「感知→決策訓練管線有現成 code」逐字拆解

3a. 「感知→決策」是什麼

把名師的工作拆成兩半:

quick 版調查時以為這條鏈路只有零散的論文;deep 版發現有人已經把整條鏈串起來而且公開了程式碼。三個代表:

3b. dialogue-kt / LLMKT(美國麻州大學團隊)

傳統知識追蹤只看「答對/答錯」的紀錄。這個研究更進一步:從家教對話的內容裡追蹤學生狀態——學生說「喔~所以要先通分」跟說「嗯…好」,答案欄可能都是空的,但透露的狀態天差地遠。LLMKT 就是教 AI 從對話裡讀出這種訊號。程式碼 MIT 授權,可以直接抄。

3c. tutorbot-dpo(同團隊的下一步)

這個把「感知」跟「決策」接起來了,邏輯很漂亮:

  1. AI 家教要回覆學生前,先生成好幾個候選回應(候選 A:直接講解;候選 B:反問;候選 C:給個提示……)
  2. 用上面的 LLMKT 學生狀態模型預測:「如果我用候選 B 回,這個學生等一下自己做對的機率是多少?」
  3. 依預測結果排序:預測效果好的回應=好回應。
  4. 用一種叫 DPO(direct preference optimization,直接偏好優化)的訓練法,把「B 比 A 好」這種成對的比較餵給 AI,AI 就慢慢學會偏向產生「會讓學生學會」的回應。

DPO 白話版:不用告訴 AI 標準答案是什麼,只要一直給它看「這個比那個好」的例子,它就會往好的方向修。像教小孩寫作文,你不必給範文,只要每次拿兩篇說「這篇比那篇好,因為……」,久了他就抓到感覺。

3d. PedagogicalRL(蘇黎世聯邦理工 ETH 團隊)

用強化學習(1d 講的訓練小狗法)教 AI「當家教而不是解題機」。

為什麼需要特別訓練這個?因為有個陷阱:如果只看「這一輪回應好不好」,AI 最容易拿高分的方式是直接把答案講出來(學生立刻說謝謝,看起來皆大歡喜)。但拉長看,直接給答案的學生什麼都沒學到。所以必須把獎勵設在「多輪之後學生真的會了」,AI 才學得會忍住不報答案、改用引導。這篇在 2025 年 EMNLP(自然語言處理領域的頂級會議)拿到口頭報告資格(Oral,代表被評為前幾 % 的論文)。

3e. 授權(license)小知識——為什麼報告一直在講 MIT、無 LICENSE

程式碼公開在 GitHub 上不等於可以自由使用。差別在附的授權條款:

3f. 這一點對 Brian 的實際意義

原本以為「感知→決策」這條鏈要自己從零設計;現在知道:架構抄 tutorbot-dpo 的思路、對話狀態追蹤抄 LLMKT(可以直接用 code)、「別當解題機」的獎勵設計思路抄 PedagogicalRL 的論文。自己要做的只剩「把這套鏈路接到手寫遙測資料上」——而那正好是全世界都沒有的資料(所有論文用的都是打字和點擊紀錄,沒有任何一篇有真實手寫過程資料;Magnai 在 Boox 上收的落筆、停頓、塗改軌跡是文獻裡不存在的東西)。


4. 第三點修正強化:「死案考古改寫存活律」逐字拆解

4a. 什麼是「死案考古」

radar 的固定動作之一:不只看誰活著,還要挖墳——把過去二三十年做「AI 家教/自適應學習」的公司挖出來,一家一家驗屍:死了沒?怎麼死的?活著的憑什麼活?死因的共同模式,就是 Brian 未來要避開的地雷圖。

4b. 驗屍結果精選

4c. 「存活律」三句話的意思

①「範疇窄+證據硬 > 人在環」

②「黑箱比自適應致命」

③「ITS 標籤是負資產」


5. 報告裡其他高頻名詞小辭典


6. 一頁總結(全部串起來)

  1. Brian 想做的事(萃取名師看學生的直覺)有標準作業流程可抄——Stanford 的 Bridge:請專家邊看學生錯誤邊講出內心話 → 整理成「診斷→選策略→回應」三步decision模型 → 變成 AI 指令。已在 900 人實驗(Tutor CoPilot)證明有效。
  2. 但全世界 146 篇後續研究都在做「平均好老師」,沒有人做「特定一位名師」(k=1)。這塊空地經過逐篇點名驗證,確定是真空地。唯一疑似的商業產品(Goblins)大概率只是克隆外表聲音的 cosplay,且查證不到細節。
  3. 「感知學生狀態→決定教學動作」的技術鏈已有公開參考碼(LLMKT/tutorbot-dpo/PedagogicalRL),不用自己發明。要注意授權:有的能抄 code(MIT),有的只能學思路(無 LICENSE)。
  4. 全領域的資料都是打字和點擊,沒有任何人有真實手寫過程資料——Magnai 在 Boox 上收的墨跡遙測是文獻裡不存在的資料,這是 Ethan 專案最深的護城河。
  5. 死人堆教的三件事:只承諾窄範疇+拿硬證據;判斷過程保持透明可解釋(別學 Knewton 吹讀心);別用 AI 模擬學生來自我驗證。Brian 現行設計(透明 md、真學生、teacher/coach 在環)恰好全部站在死因的反面。

本文件是 master-teacher-perception-2026-08-07.md(deep 版)的白話解釋姊妹篇,所有事實與證據連結以正式報告為準;此處為了易讀省略了全部引用連結。