scan_date: 2026-08-07
mode: 白話解釋版(companion explainer)
tier: 對應 deep 報告 master-teacher-perception-2026-08-07.md
白話解釋版:「名師學習狀態感知的 AI 萃取」到底在講什麼
這份文件是正式 radar 報告的姊妹篇。正式報告為了塞進所有證據,把很多概念壓縮成行話;
這份反過來——不預設你知道任何名詞,每個概念從零解釋,寧可囉嗦不要跳步。
讀完這份再回去看正式報告,應該每一句都能看懂。
0. 導讀:這次調查在回答什麼問題
Brian 的想法是:一位真正的名師,看學生寫題目的過程,心裡會自動跑一套雷達——「這孩子這題卡住了」「他不是不會,是粗心」「他快沒耐心了」「現在該給提示,不是給答案」。這套雷達是名師多年經驗養出來的直覺,名師自己往往說不清楚自己是怎麼判斷的。
問題就是:這套說不清楚的直覺,能不能想辦法「抽取」出來,裝進 AI 裡? 這樣 Ethan 在 Boox 上寫題目時,AI 就能像名師一樣「看得懂他的狀態」並「出對的招」。
radar 調查的任務是:這件事有沒有人做過?做到什麼程度?哪裡還是空白? 答案影響 Brian 該自己蓋、抄別人、還是直接用現成的。
1. 先把三個領域講清楚(正式報告說的「三母領域」)
這個題目橫跨三個研究領域,每個領域都做了很多年、東西堆成山(所以報告說它們是「一缸子」——意思是先例多到滿出來,不需要也不應該自己重新發明)。
1a. ITS(intelligent tutoring system,智慧家教系統)
從 1980 年代就有的東西:一套軟體,出題給學生做、看學生答對答錯、決定接下來出什麼題、給什麼提示。你可以想成「一個自動化的補習班老師」,只是早期版本很死板,全靠工程師事先寫好的規則。
1b. Knowledge tracing(知識追蹤,簡稱 KT)
ITS 的核心零件之一。它回答一個問題:「根據這個學生過去的作答紀錄,他現在到底『會了沒』?」
打個比方:電玩遊戲裡每個技能有熟練度條。知識追蹤就是幫每個知識點(例如「一元二次方程式」「分數通分」)維護一條看不見的熟練度條,學生每答對一題,AI 就把估計往上調一點;答錯就往下調。
- BKT(Bayesian knowledge tracing,貝氏知識追蹤):最老牌的做法,用機率計算。它考慮四件事:學生原本會的機率、做一題學會的機率、會了卻粗心答錯的機率(叫 slip)、不會卻矇對的機率(叫 guess)。數學簡單、透明、資料少也能用。
- DKT(deep knowledge tracing,深度知識追蹤):用神經網路做同一件事,準一點,但需要幾萬筆作答紀錄才贏得過 BKT,而且它是黑箱(後面會解釋黑箱為什麼是大忌)。
1c. LLM tutor(大語言模型家教)
就是「用 ChatGPT/Claude/Gemini 這類 AI 當家教」。2023 年後爆發。代表作:
- Khanmigo:可汗學院的 AI 家教。2025 年的實驗顯示它讓學生代數成績進步,但效果大約只有真人家教的六分之一。
- LearnLM:Google 的版本。他們不是拿通用 AI 直接當家教,而是特別訓練過「教學行為」——例如不直接給答案、先問引導問題、依學生程度調整。怎麼訓練的,第 3 節細講。
1d. RL(reinforcement learning,強化學習)訓練教學策略
強化學習=「用獎勵訓練」,跟訓練小狗一樣:做對了給點心,做錯了沒點心,久了小狗自己學會什麼動作能拿到點心。
用在教學上:讓 AI 家教嘗試各種教學動作(給提示?給例題?直接講解?),如果學生後來真的學會了就給 AI「獎勵分數」,AI 慢慢學出一套「什麼狀況該出什麼招」的策略。
這條路學術界做了二十年,一直沒走出實驗室。原因:要讓 AI 試錯,就需要大量真實學生陪它試錯——但沒有學校願意讓 AI 拿自己學生當白老鼠,資料永遠不夠。(這個教訓對 Brian 很重要:家教場景只有一兩個學生,走「RL 訓練」這條路是死路;但「參考它的架構思想」是活路。)
1e. 「交界帶」是什麼意思
三個領域各自都很成熟,但兩兩交叉的地方(例如「用 KT 的學生狀態去指揮 LLM 家教說話」「用 RL 去訓練 LLM 家教」)是 2025-2026 才熱起來的新戰場,論文正在密集地出。radar 的發現之一就是:這個交界帶比原本以為的更熱鬧——好消息是有很多現成方法可以抄,壞消息(其實也不算壞)是不要妄想在交界帶本身做出獨創。
2. 第一點修正強化:「k=1 空縫經正面驗證」逐字拆解
正式報告原句:「k=1 名師萃取空縫經 146 篇引用網驗證=真空縫」。這句話每個詞都需要解釋。
2a. 「k=1」是什麼
k 是統計和機器學習裡的慣用符號,代表「數量」。這裡指萃取對象的教師人數。
- k=很多:把一百位老師的教學資料混在一起,讓 AI 學出「平均而言好老師會怎麼做」。目前所有研究都是這種。
- k=1:只針對一位特定名師,把「他個人」的判斷方式、教學風格抽出來裝進 AI。
差別像什麼?「學做菜的 AI 看了一萬個廚師的影片,學會平均水準的家常菜」vs「阿嬤牌滷肉的味道,只跟阿嬤一個人學」。Brian 想要的是後者——不是「大眾好老師」,是「某位特定名師看學生的眼光」。
2b. 「空縫」是什麼
就是「市場/研究的空白地帶」——大家都在做的區域旁邊,有一塊沒人踩過的空地。radar 報告的核心任務就是找空縫:空縫是真的(真的沒人做過),這個題目才值得 Brian 自己做;空縫是假的(其實有人做過只是你沒搜到),就該直接用別人的。
2c. Bridge 是什麼(本次調查最重要的先例,值得完整講)
Bridge 是 Stanford 大學一位研究者 Rose Wang 在 2024 年發表的研究方法。 它要解決的問題跟 Brian 的一模一樣:資深家教的判斷力是隱性的(他們自己說不清楚),怎麼把它變成 AI 能用的東西?
Bridge 的做法分三步,白話版:
- 請專家「邊看邊出聲思考」(think-aloud):找來資深家教,給他們看真實的學生錯誤,請他們一邊看一邊把心裡的想法講出來:「嗯,這個學生把分母加起來了,他應該是把分數加法跟乘法搞混……我不會直接糾正他,我會先問他 1/2 + 1/2 等於多少,讓他自己發現怪怪的。」把這些碎碎念全部錄下來。
- 整理成「決策三步驟」:研究者發現專家的思考其實有固定結構——先診斷(學生錯在哪、為什麼錯)→ 再選策略(這種錯該用哪種教法:反問?舉反例?拆小步?)→ 最後才生成回應(實際說出口的那句話)。新手家教和 AI 的通病是跳過前兩步直接講話。
- 把這套結構變成給 AI 的指令:教 AI 也照「先診斷→選策略→再說話」的順序來,而不是想到什麼說什麼。
他們標註了 700 段真實家教對話當教材。成果:照這套方法調教的 AI,回應品質明顯更像資深家教。
為什麼這對 Brian 是寶:這就是「名師直覺萃取」的標準作業流程(SOP),而且它天然適合小樣本——只需要少數幾位專家的 think-aloud,不需要百萬筆資料。程式碼是 MIT 授權(法律上可以自由抄用)。
2d. Tutor CoPilot 是什麼
同一批人把 Bridge 裝進真實產品的成果(2024 年)。 場景:美國一個線上家教平台,很多家教其實是新手。Tutor CoPilot 是掛在家教聊天視窗旁邊的「AI 軍師」——家教卡住不知道怎麼回學生時,按一下按鈕,AI 就用 Bridge 那套專家決策邏輯生成建議(「先別給答案,問他這一步為什麼這樣寫」),家教可以照用或改寫。
他們做了嚴格的實驗:900 位家教、1,800 名學生隨機分組,一半有 AI 軍師、一半沒有。結果:有軍師那組的學生通過率更高,而且受益最大的是遇到新手家教的弱勢學生——等於 AI 把資深名師的judgment「即時輸血」給新手。成本低到誇張:每位家教每年約 20 美元。這個研究後來被寫進 2025 年美國總統經濟報告。
注意它跟 Brian 想做的差別:Tutor CoPilot 服務的對象是「人類家教」(AI 當軍師、人上場);Brian 的場景是 AI 直接面對 Ethan。但底層的「專家決策萃取」方法完全通用。
2e. 「146 篇引用網驗證」是什麼意思
學術論文有「引用」機制:後來的論文如果用到、比較到、延伸了前人的工作,就會列出來。所以「誰引用了 Bridge」這張清單,就是「Bridge 發表之後,全世界順著這條路做下去的所有人」的完整名單。
deep 掃描做的事:把引用 Bridge 的 74 篇+引用 Tutor CoPilot 的 72 篇(合計 146 篇)一篇一篇看過,檢查有沒有人做了「k=1 單一名師萃取」。
結果:零。 全部後續研究都走「把很多教師資料聚合起來學平均值」的路線。連最接近的 TeachLM(用 10 萬小時真實家教對話訓練 AI)也是混合多位家教的資料。
這就是「空縫經正面驗證」的意思:不是「我沒搜到所以大概沒人做」(可能只是沒搜到),而是「我把所有順著這條路走的人都點名過了,確定沒人走進這塊空地」。前者是猜,後者是查證——可信度完全不同。
2f. Goblins 是什麼、為什麼標 unverified
調查中發現唯一一個「有點像 k=1」的商業產品:美國一個叫 Goblins 的數學家教 app,宣傳點是「克隆你的老師」——AI 家教的長相、聲音、口頭禪做成你真實老師的樣子。
但關鍵問題是:它克隆的是「皮」還是「腦」?
- 克隆「皮」=外表聲音像你的老師,但腦子是通用 AI——那跟 Brian 想做的(萃取名師的判斷力)根本是兩回事,只是 cosplay。
- 克隆「腦」=真的學了那位老師的教學決策——那才算踩進空縫。
調查時它的官網連不上、主要報導網站擋爬蟲,無法確認是皮還是腦,所以標記 unverified(未驗證)。從常理推測大概率是皮(克隆聲音外貌的技術成熟便宜,克隆教學決策沒有現成技術),但 radar 的紀律是:沒查證到的就不能寫成結論。
3. 第二點修正強化:「感知→決策訓練管線有現成 code」逐字拆解
3a. 「感知→決策」是什麼
把名師的工作拆成兩半:
- 感知:知道學生現在的狀態(會不會、卡不卡、煩不煩)
- 決策:根據狀態決定下一步教學動作(給提示?換例題?直接講?鼓勵一下?)
quick 版調查時以為這條鏈路只有零散的論文;deep 版發現有人已經把整條鏈串起來而且公開了程式碼。三個代表:
3b. dialogue-kt / LLMKT(美國麻州大學團隊)
傳統知識追蹤只看「答對/答錯」的紀錄。這個研究更進一步:從家教對話的內容裡追蹤學生狀態——學生說「喔~所以要先通分」跟說「嗯…好」,答案欄可能都是空的,但透露的狀態天差地遠。LLMKT 就是教 AI 從對話裡讀出這種訊號。程式碼 MIT 授權,可以直接抄。
3c. tutorbot-dpo(同團隊的下一步)
這個把「感知」跟「決策」接起來了,邏輯很漂亮:
- AI 家教要回覆學生前,先生成好幾個候選回應(候選 A:直接講解;候選 B:反問;候選 C:給個提示……)
- 用上面的 LLMKT 學生狀態模型預測:「如果我用候選 B 回,這個學生等一下自己做對的機率是多少?」
- 依預測結果排序:預測效果好的回應=好回應。
- 用一種叫 DPO(direct preference optimization,直接偏好優化)的訓練法,把「B 比 A 好」這種成對的比較餵給 AI,AI 就慢慢學會偏向產生「會讓學生學會」的回應。
DPO 白話版:不用告訴 AI 標準答案是什麼,只要一直給它看「這個比那個好」的例子,它就會往好的方向修。像教小孩寫作文,你不必給範文,只要每次拿兩篇說「這篇比那篇好,因為……」,久了他就抓到感覺。
3d. PedagogicalRL(蘇黎世聯邦理工 ETH 團隊)
用強化學習(1d 講的訓練小狗法)教 AI「當家教而不是解題機」。
為什麼需要特別訓練這個?因為有個陷阱:如果只看「這一輪回應好不好」,AI 最容易拿高分的方式是直接把答案講出來(學生立刻說謝謝,看起來皆大歡喜)。但拉長看,直接給答案的學生什麼都沒學到。所以必須把獎勵設在「多輪之後學生真的會了」,AI 才學得會忍住不報答案、改用引導。這篇在 2025 年 EMNLP(自然語言處理領域的頂級會議)拿到口頭報告資格(Oral,代表被評為前幾 % 的論文)。
3e. 授權(license)小知識——為什麼報告一直在講 MIT、無 LICENSE
程式碼公開在 GitHub 上不等於可以自由使用。差別在附的授權條款:
- MIT / Apache-2.0:最寬鬆,抄、改、商用都可以,只要保留原作者聲明。報告裡標 ✅ 的都是這類。
- 沒有附 LICENSE 檔:法律上等於「著作權全保留」——你可以看、可以學思路,但不能把 code 抄進自己的專案。tutorbot-dpo 和 PedagogicalRL 都是這種,所以報告標「概念參考 only」:方法看論文自己重寫,不碰他們的 code。
- CC BY-NC-SA(TalkMoves 資料集是這種):NC = non-commercial,非商用限制。Brian 自己教 Ethan 用沒問題,但如果哪天 Magnai 變成收費產品,用了這個資料集就是侵權——所以報告標它是「商業化時的雷」。
3f. 這一點對 Brian 的實際意義
原本以為「感知→決策」這條鏈要自己從零設計;現在知道:架構抄 tutorbot-dpo 的思路、對話狀態追蹤抄 LLMKT(可以直接用 code)、「別當解題機」的獎勵設計思路抄 PedagogicalRL 的論文。自己要做的只剩「把這套鏈路接到手寫遙測資料上」——而那正好是全世界都沒有的資料(所有論文用的都是打字和點擊紀錄,沒有任何一篇有真實手寫過程資料;Magnai 在 Boox 上收的落筆、停頓、塗改軌跡是文獻裡不存在的東西)。
4. 第三點修正強化:「死案考古改寫存活律」逐字拆解
4a. 什麼是「死案考古」
radar 的固定動作之一:不只看誰活著,還要挖墳——把過去二三十年做「AI 家教/自適應學習」的公司挖出來,一家一家驗屍:死了沒?怎麼死的?活著的憑什麼活?死因的共同模式,就是 Brian 未來要避開的地雷圖。
4b. 驗屍結果精選
- Knewton(美國):曾募資 1.8 億美元的明星公司,創辦人公開吹噓他們的引擎能「半讀取學生的心智」(semi-read minds)。2019 年賤賣收場。死因:承諾遠超實力+產品是黑箱(學校老師完全看不懂它為什麼這樣安排學生)+討好投資人勝過討好老師。
- Korbit(加拿大):有深度學習教父級人物 Yoshua Bengio 背書的 AI 家教公司。現在?教育產品整條線砍掉,公司轉行做「幫工程師檢查程式碼」的 AI。等於承認教育這條路走不下去。
- Riiid(韓國):做多益考試 AI 家教起家、發過知名論文的公司。現在改名 Socra AI,員工剩 110 人,而且把宣傳詞從「AI 診斷你的弱點」改成「蘇格拉底式引導自主學習」——連他們都在主動撇清「AI 讀心」的形象。
- Querium、Cognii、Bakpax、Thinkster Math:一排小公司,網站不是連不上就是憑證過期(=沒人在維護)。多數共同點:黑箱診斷宣稱、沒有硬證據。
- 活著的:ALEKS(25 年老店還在擴張——它用的是可解釋的數學模型,老師看得懂它為什麼這樣判斷);Carnegie Learning(綁著教科書出版通路);Amira Learning(只做一件窄事:聽小孩朗讀、評流暢度,而且跟兒童醫院合作做臨床級驗證);Third Space Learning(英國,真人家教+AI 助手混合,2026 年 4 月剛募到新資金);松鼠 AI(中國,3000 多家實體學習中心)。
4c. 「存活律」三句話的意思
①「範疇窄+證據硬 > 人在環」
- 「人在環」(human-in-the-loop)=系統裡保留人類監督,AI 只當助手。像民航機的自動駕駛——飛機大部分時間自己飛,但駕駛座永遠坐著人。
- quick 版調查時的初步印象是「有人在環的公司比較活得下來」。deep 版驗屍更多之後發現這個歸納不夠準:Thinkster Math 也是真人+AI 混合,照樣死透(網域都沒了);Amira 幾乎全自動,活得很好。
- 重新歸納後,真正的存活公式是:主張的範圍夠窄(只承諾做好一件小事)+證據夠硬(用嚴格實驗證明那件小事真的有效)。Amira 只做「朗讀流暢度」一件事,但拿臨床研究等級的證據背書。人在環只是達成這個公式的常見「戰術」(有人監督,AI 亂講會被攔下來,等於天然縮小了風險範圍),不是公式本身。
②「黑箱比自適應致命」
- 「黑箱」=系統給出判斷但說不出理由。算命仙說「你今年犯太歲」——你只能信或不信,無從檢驗。「可解釋」=醫生說「你的 X 光片這裡有陰影,所以建議進一步檢查」——你看得到推理過程。
- 驗屍結果的規律非常一致:死掉的(Knewton、Querium、Cognii)都是黑箱讀心宣稱;活最久的 ALEKS 用的是透明的機率模型。原因不難懂:家長和老師不會長期信任一個「說不出理由」的系統來管孩子的學習。
- 對 Brian 的直接含義:telemetry 計畫裡「只收訊號、AI 的推論寫成人看得懂的 markdown 檔、Brian 隨時可以打開來看它為什麼這樣判斷」的設計,正好站在死因的反面——這不是巧合的好品味,是死人堆驗證過的生存策略。
③「ITS 標籤是負資產」
- 到了 2026 年,頂著「智慧家教系統/自適應學習」名號本身就讓投資人和客戶皺眉(因為前面死了一整排)。倖存者的動作很說明問題:Korbit 直接換行業,Riiid 改名字+改故事。
- 對 Brian 的含義:純屬品牌層面的教訓,自用階段無所謂;若 Magnai 日後對外,敘事該長在「窄範疇+硬證據」上(例如「手寫過程的學習訊號」),不要自稱 AI 自適應家教。
5. 報告裡其他高頻名詞小辭典
- RCT(randomized controlled trial,隨機對照試驗):把受試者隨機分兩組,一組用新方法、一組照舊,比較結果。跟新藥上市前的臨床試驗同一套邏輯,是教育研究裡最高等級的證據。報告裡反覆強調某研究「是 RCT」或「不是 RCT」,就是在標證據的硬度。
- SD/效果量(standard deviation,標準差):教育研究衡量「進步多少」的通用單位。粗略換算:0.258 SD ≈ 從全班第 50 名進步到第 40 名左右(百分位 50→60);0.8 SD 以上就算罕見的大效果。所以獅子山實驗的 0.258 SD 是「真實且值得敬佩、但不神奇」的進步;Dartmouth 那個 0.71-1.30 SD 數字很驚人,但它不是 RCT(沒有隨機分組,可能是本來就認真的學生更常用系統),所以要打折看。
- 獅子山 RCT:Google 在西非獅子山做的實驗(2026 年 6 月發布):1,763 名中學生、12 所學校、8 週,隨機分組。用 Gemini 的引導學習模式輔助數學課,進步 0.258 SD。對 Brian 最重要的細節:這個實驗設計是「老師主導課堂,AI 只在 2% 的情況直接給答案」——證明「AI 當助手、引導為主」的路線在嚴格實驗下有效。
- MRBench/BEA 2025 shared task:BEA 是計算語言學界專門研究「NLP 用於教育」的工作坊。2025 年他們辦了一場公開競賽(shared task):給你一段學生犯錯的對話,AI 要在五個項目上表現得像好老師——①有沒有發現學生錯了②有沒有指出錯在哪③給的引導好不好④回饋是否具體可執行⑤(研究用)分辨回應出自 AI 還是人。50 多支隊伍參賽。對 Brian 的用途:這五個評分軸是現成的「講解品質量表」,Magnai 要評估自己的講解好不好,直接借這套軸,不用自己發明。
- MTM(Million Tutoring Moves):2026 年發布的開放資料集:約 4,650 段真實數學家教課的逐字稿,切出超過一百萬個「教學動作」(tutoring moves——老師的每一步:提問、提示、鼓勵、糾正……)。CC-BY-4.0 授權(只要註明出處就能自由使用,商用也行)。等於一座「老師都做了哪些動作」的原料山,未來要建名師動作庫可以從這裡挖。
- 模擬學生失真警告:有一支研究讓 LLM 扮演學生(「假裝你是個會犯粗心錯的八年級生」),用來測試 AI 家教好不好。2026 年的檢驗論文證明:LLM 演的學生不像真學生——能力分布、犯錯模式都失真。含義:拿 AI 學生來驗證 AI 家教=自己考自己,結論不可信。Brian 手上有真學生(Ethan+試點),這個坑天然踩不到。
- Language Bottleneck/與 learned md 同構:一支新研究主張:學生狀態不要存成一堆看不懂的數字(傳統 KT 的做法),改存成一段自然語言摘要(「這個學生分數加法熟練,但遇到帶未知數的通分會卡,且傾向在卡住時亂試」)。「同構」的意思是:這個學術路線跟 Brian 的 telemetry 計畫裡「learned md」(把對 Ethan 的理解寫成 markdown 檔)結構上是同一個東西——等於學術界替 Brian 已拍板的設計提供了背書。
6. 一頁總結(全部串起來)
- Brian 想做的事(萃取名師看學生的直覺)有標準作業流程可抄——Stanford 的 Bridge:請專家邊看學生錯誤邊講出內心話 → 整理成「診斷→選策略→回應」三步decision模型 → 變成 AI 指令。已在 900 人實驗(Tutor CoPilot)證明有效。
- 但全世界 146 篇後續研究都在做「平均好老師」,沒有人做「特定一位名師」(k=1)。這塊空地經過逐篇點名驗證,確定是真空地。唯一疑似的商業產品(Goblins)大概率只是克隆外表聲音的 cosplay,且查證不到細節。
- 「感知學生狀態→決定教學動作」的技術鏈已有公開參考碼(LLMKT/tutorbot-dpo/PedagogicalRL),不用自己發明。要注意授權:有的能抄 code(MIT),有的只能學思路(無 LICENSE)。
- 全領域的資料都是打字和點擊,沒有任何人有真實手寫過程資料——Magnai 在 Boox 上收的墨跡遙測是文獻裡不存在的資料,這是 Ethan 專案最深的護城河。
- 死人堆教的三件事:只承諾窄範疇+拿硬證據;判斷過程保持透明可解釋(別學 Knewton 吹讀心);別用 AI 模擬學生來自我驗證。Brian 現行設計(透明 md、真學生、teacher/coach 在環)恰好全部站在死因的反面。
本文件是 master-teacher-perception-2026-08-07.md(deep 版)的白話解釋姊妹篇,所有事實與證據連結以正式報告為準;此處為了易讀省略了全部引用連結。