scan_date: 2026-08-07 mode: A(idea 先例掃描) tier: deep(quick 同日升級;5 路 subagent fan-out+X 輿情) token_cost: ~60 萬 token(估:quick ~15 萬+deep subagents ~39 萬+主 session 合成)


Radar 報告:「名師學習狀態感知的 AI 萃取」先例掃描

idea:把名師(master teacher)對學習者狀態的 tacit 感知——會什麼/卡哪裡/情緒狀態/此刻該出哪一招——萃取進 AI。 拆解:問題=專家教學感知的外顯化與自動化;對象=一對一家教情境(sys4Ethan/Magnai); 機制=三領域交界:①ITS/knowledge tracing(狀態估計)②LLM tutor(教學生成)③RL 教學策略(決策優化); 差異點=真實手寫載體+行為遙測+家教級縱向關係+「特定名師」而非通用教學法。 本報告與 07-31《行為遙測反思迴路》報告互補:那份蓋「訊號→狀態」側,本份蓋「狀態→教學決策」側與名師萃取線。

1. 裁決(四象限)

三母領域=一缸子;交界帶=熱區正被高密度填補(deep 掃出的 2025-2026 產出帶比 quick 檔所見更密);「k=1 名師感知萃取 × 真實手寫遙測 × 家教級縱向」=零件散落沒人整合——此判定經 deep 檔雪球驗證後站得住。

建議路線:reference(方法論照抄)+ build(整合層自建),不 adopt 任何整套系統。deep 檔三點修正強化:

  1. k=1 空縫經正面驗證:Bridge+Tutor CoPilot 的引用網(74+72 篇)逐一檢視,凡做「教學決策萃取/複製」者清一色走聚合多位教師路線(DPO 偏好對、獎勵模型、超圖、10 萬小時多家教後訓練的 TeachLM),沒有任何一篇拿 Bridge 的認知任務分析方法做單一名師萃取。唯一產業線索 Goblins(克隆「你的老師」的外貌聲線做數學家教 avatar)——但其底層是否萃取教學決策、抑或只是 persona 皮+通用 LLM,官網與報導均無法讀取,方法論 unverified。
  2. 「感知→決策」訓練管線已有現成可跑 code:UMass 的 dialogue-kt(LLMKT 對話知識追蹤,MIT)+tutorbot-dpo(用學生狀態模型預測候選教學回應成效→DPO 排序)串成完整閉環;ETH 的 PedagogicalRL(多輪 RL 訓「當家教而非解題機」,EMNLP 2025 Oral)是獎勵導向的另一條路——reference 池比 quick 檔認知的大得多,「監督式模仿 vs 強化對齊」兩種萃取哲學都有參考碼。
  3. 死案深挖改寫存活律:真正的存活變數是「主張範疇夠窄+證據夠硬」,「人在環」只是達成它的常見戰術(Third Space Learning 剛募 £4.4M vs 同是人在環的 Thinkster Math 網域全滅);「黑箱」比「自適應」更致命(可解釋心理計量模型的 ALEKS 活了 25 年還在擴張;黑箱讀心的 Knewton/Querium/Cognii 死/殭屍);「ITS」標籤本身已是負資產(Korbit 棄教育轉 code review、Riiid 改名 Socra AI 並把敘事從「AI 診斷弱點」改成「蘇格拉底引導」)。

給 Brian 的行動清單(quick+deep 合併)

  1. 細讀 Bridge 論文的決策分類法(診斷錯誤→選策略→生成回應三段 taxonomy)——可直接改造成 Magnai 講解決策 schema;deep 檔確認此方法無人做過 k=1 應用=差異化主軸成立。
  2. 細讀 LearnLM 2025-11 報告+獅子山 RCT(2026-06,預註冊、1,763 學生、ITT 0.258 SD;設計重點=老師主導、AI 僅 2% 情況直接給答案)——coach 一致率驗收的方法論同款,且是「teacher-led+AI 輔助」路線目前最強實證。
  3. MRBench/BEA 2025 shared task 的 5-track 標籤體系(錯誤辨識/錯誤定位/提供引導/回饋可執行性/身分辨識)可直接當 Magnai 講解品質的評分維度——50+ 隊伍已在這套標籤上校準過,不用自己發明評分軸。
  4. MTM(Million Tutoring Moves,CC-BY-4.0)收藏——~4,650 段家教逐字稿、百萬級教學動作的多模態開放資料集,未來要建「名師動作庫」這是最大原料堆。
  5. 兩個反面教材不變:別用 LLM 模擬學生自我驗證 tutor 品質(ACL 2026 已證失真);別做黑箱狀態推斷宣稱(死案深挖再添 Querium/Cognii 兩具屍體)。

2. 硬閘門表(shortlist)

quick 檔原表

repo License(可抄性) 活躍 角色 判
rosewang2008/bridge ✅ MIT ⚠️ 凍結(2024-07) 名師決策萃取 SOP+700 段標註對話 方法論主源(抄流程不抄碼)
rosewang2008/tutor-copilot ✅ Apache-2.0 ⚠️ 凍結(2024-10) Bridge 產品化+RCT 設計 實驗設計參考
CAHLR/OATutor(Berkeley) ✅ MIT 日更(08-06),bus factor 健康 唯一活著的開源完整 ITS(BKT+adaptive);60+ fork 部署變體=準產品級 ITS 架構參考
pykt-team/pykt-toolkit ✅ MIT 活躍(07-21),425★,下載 ~60-76/日 DLKT model zoo 現役標準 日後 KT 升級首選(⚠️ 下游 issue 訊號:重現性差)
eth-nlped/mathdial ❌ root 無 LICENSE(code 不可抄);資料 CC BY-SA 4.0 半活(2025-09) 家教對話資料集 資料可用(share-alike 注意)
eth-lre/mathtutorbench ❌ root 無 LICENSE(不可抄) 活躍(07-30) LLM tutor 教學力 benchmark(EMNLP 2025 oral) 評測概念參考 only
SumnerLab/TalkMoves ⚠️ CC BY-NC-SA 4.0(非商用) 凍結(2022-02) K-12 數學話步標註資料集 個人試點可用;Magnai 商業化時是雷

deep 檔新增(License 全數開檔確認)

repo / 資產 License 活躍 角色 判
umass-ml4ed/dialogue-kt ✅ MIT 2025-02 LLMKT:家教對話中做知識追蹤(LAK 2025) 「感知」端可抄碼
umass-ml4ed/tutorbot-dpo ❌ 無 LICENSE(root 已驗) 2025-08 LLMKT 預測候選回應成效→DPO 排序(AIED 2025) 「感知→決策」管線概念參考 only
eth-lre/PedagogicalRL ❌ 無 LICENSE(root 已驗) 2025-12 多輪 RL 訓「家教而非解題機」(EMNLP 2025 Oral),42★ RL 對齊路線概念參考 only
EduNLP/edu-convokit ✅ MIT 2025-04,116★ 教育對話分析框架(Demszky/Wang 系,TalkMoves 的框架級替代) 可抄碼;話步分析首選
ddemszky/conversational-uptake ✅ MIT 2025-04,25★ 「教師接住學生發言」量化(uptake)——名師感知的微觀操作化 特徵定義可抄
bigdata-ustc/Agent4Edu ❌ 無 LICENSE(root 已驗) 2026-06,93★ AAAI 2025 Oral:LLM 學習者 agent 模擬作答 概念參考 only(且注意模擬學生失真警告)
ai4ed/XES3G5M(好未來) ✅ MIT 2025-07,59★ NeurIPS 2023 KT benchmark:7,652 題/865 知識點/554 萬交互 數學 KT 最大 KC 資料集,日後校準用
MTM 資料集(arXiv 2605.08092) ✅ CC-BY-4.0 2026-05 發布 百萬級 tutoring moves 多模態開放資料集(Koedinger/Kizilcec 系) 名師動作庫原料堆

一票否決觸發:tutorbot-dpo/PedagogicalRL/Agent4Edu 的 code 層(無 LICENSE=著作權全保留,root 檔案清單已逐一開檔確認非偵測器假陰性)。

3. 契合六維(對 reference+build 路線;deep 後更新)

維度 評 一句話
功能 ✅ Bridge SOP+MRBench 評分軸+LLMKT 管線拼起來就是「感知→決策→評分」全鏈參考;k=1 應用無人做過=縫是 Brian 的
技術 ✅ 可抄碼的部分(dialogue-kt/edu-convokit/uptake)全 MIT;無授權的(tutorbot-dpo/PedagogicalRL)方法在論文裡,重寫成本低
維運 ✅ 直接接 telemetry v1(M0-M7),不加新系統
團隊 ✅ 方法論全是 md/prompt/jsonl 層
生態 ⚠️→✅ quick 檔憂慮「名師萃取線凍結」被 deep 檔緩解:BEA/AIED/UMass/ETH 四個活躍研究簇持續產出,2025-2026 是產出高峰帶——追蹤即可,不缺供給
退出成本 ✅ 抄的是流程與 taxonomy,不綁引擎

本機既有資產盤點(不變):Magnai 真實手寫採集鏈(護城河)+telemetry v1 decision-plan+Ethan 三年史 learner context+EverOS muse/distill 反思殼+manim 講解視覺化。deep 檔補一句:交界帶全部論文的資料層都是打字/點擊/對話 log——真實手寫縱向資料在整個文獻裡是零,連 EduClaw-Bench 的 30 天長程關係都只能用模擬學生。Brian 手上的採集鏈產的是全領域都沒有的資料。

4. 差異化空間+死因分析

三母領域現況(一缸子,不要在這裡發明)

交界帶熱區(deep 檔全景,2025-2026 產出帶,追蹤不追建)

還空著的縫(deep 驗證後)

  1. k=1 名師感知萃取——引用網 146 篇零命中;唯一產業線索 Goblins 是外貌聲線克隆(方法論 unverified);學術端連 TeachLM(Demszky 參與,10 萬小時真實家教對話後訓練)都是聚合多家教。縫確認為真,且 Bridge 方法論(少數專家 think-aloud→決策模型)天然適配 k=1,只是沒人做。
  2. 真實手寫行為遙測 → tutor 決策條件化——deep 檔亦零命中(gh search code "wheel spinning" student 精確 0;中文圈「學情」搜尋全誤中情感分析)。
  3. 真實長程家教關係資料——EduClaw-Bench 只能模擬;Brian 的真實縱向資料=全領域缺貨的稀缺資產。
  4. 透明狀態中間層——Language Bottleneck×learned md;死案深挖強化此判斷:可解釋(ALEKS)活、黑箱(Knewton/Querium/Cognii)死。

死因分析(deep 檔死活考核,2026-08 即時證據)

公司 狀態 一句話
Knewton 死(2019 被 Wiley 收購安樂死) 黑箱「semi-read minds」hype+客戶其實是 VC
Korbit(Bengio-backed) 殭屍轉業 ITS 產品線全滅,改做工程師 AI code review
Riiid(Santa) 改名續命(Socra AI,員工剩 110) 敘事從「AI 診斷弱點」改成「蘇格拉底引導」=主動撇清黑箱
Querium/Cognii/Bakpax/Thinkster Math 偏死/殭屍/死/死 黑箱診斷或無差異化;Bakpax/Thinkster 網域 DNS 全滅
Squirrel AI 松鼠AI 活且擴張(TIME100、52M 學生) 3,000+ 實體中心「科技+人味」;無可驗證開源
Carnegie Learning/ALEKS 活 25+ 年 可解釋模型+教材出版通路綁定
Third Space Learning 活(2026-04 募 £4.4M) 人類家教核心+AI 語音助教,與 Tutor CoPilot 模式同構
Amira Learning 活(CHOP/UPenn 臨床研究中) 窄範疇(朗讀流暢度)+硬證據——全自動也能活的反例

存活律(取代 quick 檔的初步歸納):①範疇窄+證據硬 > 人在環(人在環只是達成它的戰術);②黑箱比自適應致命;③「ITS」標籤是負資產,倖存靠換賽道或換敘事;④機構通路綁定比技術護城河抗跌。對 Brian:自用/試點不受商業存活律約束,但若 Magnai 日後產品化,「窄範疇+可驗證成效+透明模型」三件套是死案堆裡撿出來的保命符。

5. 證據連結

名師萃取線:Bridge(NAACL 2024)/rosewang2008/bridge/Tutor CoPilot/TeachLM(10 萬小時後訓練)/NCTE transcripts/SumnerLab/TalkMoves/EduNLP/edu-convokit/conversational-uptake/Goblins 報導(The 74,unverified 方法論) 評測與資料層:BEA 2025 Shared Task Findings(MRBench)/MTM(2605.08092)/Tutor Move Taxonomy(2603.05778)/EduCoder(2507.05385)/LLM vs 專家教學品質量尺(2512.20780) LLM tutor:LearnLM(2412.16429)/LearnLM 2025-11 家教 RCT/獅子山 RCT(DeepMind blog)+報告 PDF/Dartmouth Phosphor(HN)/mathtutorbench/mathdial 訓練管線(交界帶):tutorbot-dpo(AIED 2025)/dialogue-kt(LAK 2025)/PedagogicalRL(EMNLP 2025 Oral)/ETH RL 對齊(2505.15607)/PEARL(USTC+訊飛,2605.29582)/EduClaw-Bench(2608.03206)/sim-student-eval(ACL 2026)/Language Bottleneck Models/Problems with LLMs for Learner Modelling KT 工具與中文圈:pykt-toolkit/OATutor/XES3G5M(NeurIPS 2023)/Agent4Edu(AAAI 2025 Oral)/EduCDM 死案:Knewton/Wiley/adaptive learning 洗牌解析/korbit.ai(現況=code review 產品)/riiid.com→corp.socra.ai(301 實測)/Third Space Learning £4.4M(2026-04) X 輿情(Hermes,1 則已交叉核實):@PositivelyWired 2026-08-06 獅子山貼文 ↔ DeepMind 官方 RCT 報告吻合 ✅;@gastronomy 2026-08-04(LLM tutor 答案洩漏的 release control);@umbertoleon 2026-07-31(LearnLM RCT 西語轉述)

6. 覆蓋聲明

管道 狀態
gh search repos(quick 15 組+deep 中文 5 組+awesome 8 組,含 0 結果組) ✅
gh search code(12 發+負對照 import numpy 6 千萬命中) ✅ deep 開跑;"wheel spinning" student 精確 0=真查無
gh search issues(需求面 2 組 0+負對照;下游反查 pykt/OATutor) ✅(MathDial/pyBKT/TalkMoves 下游未及查——配額盡)
gh api org/user 盤點(rosewang2008/eth-nlped/eth-lre/umass-ml4ed/CAHLR/bigdata-ustc/tal-tech/ai4ed/iflytek/youdao 系) ✅
HN Algolia(3 組) ✅
WebSearch(quick 9+deep 各線 10+8+8+17 發) ✅ 全數列附錄;site:zhihu.com 實測生效
AlternativeTo(錨點 Khanmigo) ✅ 空頁——品類太新,以 WebSearch 補位
pypistats(pykt-toolkit) ✅
License 原文/root 開檔(9 個 repo) ✅
中文圈(知乎生效;V2EX 未跑——額度轉投商業版圖) ✅(部分)
awesome 清單(6 份,ejhshen 最深但讀至 405 行截斷) ✅(部分)
學術會議線(BEA/AIED/EDM/LAK 2025-2026) ✅(LAK 2026 主會清單未深挖;EDM 命中率低已註記)
雪球外擴(2 輪,含 Semantic Scholar 引用網 74+72 篇) ✅(S2 API 間歇 429,IALab 論文細節未補齊)
X 輿情(Hermes 1 發+1 則交叉核實通過) ✅
Wayback(web.archive.org) ❌ 管道失效——WebFetch 全數無法抓取,死案「當年定位」改用官網殘存+訓練記憶補強,該部分標低信心
Crunchbase/Growjo(死案融資時間軸) ❌ 403——死亡時間點細節 unverified,死活狀態本身以 DNS/憑證即時證據為準
學術全文逐篇核實 ⚠️ 10 篇 top 中 8 篇到原文層;2603.05778(taxonomy)僅摘要層、AIED《AI Knows Best?》僅索引頁——均已標 unverified

7. 手動後續(給 Brian)

  1. Bridge 論文 §taxonomy 人工細讀——k=1 應用無人做過,這套三段決策分類是 Magnai 講解決策 schema 的現成骨架。
  2. LearnLM 2025-11 PDF+獅子山 RCT PDF 人工細讀——督導量測設計+teacher-led 配置是 coach 一致率驗收與產品定位的雙重參考。
  3. Goblins 深挖(若 k=1 產品化路線日後升溫)——官網/報導被擋,需人工訪問確認它是 persona 皮還是真決策萃取。
  4. 《AI Knows Best?》(AIED 2025)找全文——「教師專業度×AI 依賴」交互作用直接關係到 coach 介面設計,本次只到索引頁。
  5. Discord 溫度(OATutor/pykt 社群)自動化不了。

8. 附錄:全部查詢原文

quick 檔(主 session)

gh search repos:llm tutor(12)/knowledge tracing llm(0)/socratic tutor(10)/tutor copilot(8)/mathdial(5)/student simulator llm(0)/pedagogical reinforcement learning(0)/intelligent tutoring system sort=stars(12)/simulated student(10)/student simulation(10)/pykt(5)/reinforcement learning tutoring(2)/learning to teach(8)/pearl tutor(5 全誤中)/talkmoves(5) gh search issues:tutor adapt student level(0)/knowledge tracing integrate(0)/負對照 memory leak(✅) HN Algolia:AI tutor/Khanmigo/intelligent tutoring WebSearch(9):①Rose Wang Bridge "Tutor CoPilot" Stanford ②LearnLM pedagogy RL 2025 ③RL pedagogical policy ITS survey ④LLM knowledge tracing survey 2025 ⑤LLM student simulator tutor RL 2025 ⑥Knewton failed shutdown lessons ⑦open source AI tutor Khanmigo alternative 2026 ⑧NCTE talk moves teacher expertise ⑨Dartmouth AI tutor 0.71 SD WebFetch:alternativeto.net/software/khanmigo/(0 替代品);pypistats:pykt-toolkit 主 session deep 補:WebSearch ⑩獅子山 RCT 交叉核實;Hermes X 1 發;gh api 新增 7 repo license+3 repo root 開檔

deep 檔(5 路 subagent,查詢原文全列)

學術線(WebSearch 10):BEA 2025 shared task AI tutor pedagogical ability/AIED 2025 accepted expert teacher modeling/AIED 2026 teacher expertise LLM/EDM 2025 KT LLM affect/LAK 2026 teacher dashboard XAI/Kochmar 2025-2026/Andrew Lan 2025-2026/Rose Wang 2025-2026/Sachan ETH 2025-2026/"tutor move" taxonomy 2025 2026。WebFetch 6 頁(arXiv×4+ETH pub 頁+tutorbot-dpo)。0 結果:無。 中文圈(WebSearch 17):知识追踪 开源 GitHub/学习者建模 LLM/智能导学系统 ITS 中国/学情分析 AI 教师经验/名师 经验 萃取 AI 教学/AI 家教 学生状态 情绪/教学策略 强化学习 论文/自适应学习 引擎 开源/错题 诊断 大模型/site:zhihu.com 名师 AI 学习状态(生效)/松鼠AI 技术 论文/作业帮 猿辅导 学而思 2026/猿辅导 技术 开源/学而思 九章大模型/教师 隐性知识 显性化 AI/XES3G5M benchmark/AIED2024 LLM-KT ai4ed。gh:知识追踪(30)/智能辅导(20)/学情(20 全誤中情感分析)/org 盤點 16 發(bigdata-ustc 70 倉/iflytek 66 倉無教育/youdao 系無教育/tal-tech 100+ 倉/ai4ed=user 17 倉)/負對照 知识图谱+强化学习(✅ 高星命中)。0 結果:netease-youdao(org 404)等已列。 實作層(gh search code 12 發,每發間 sleep 8):負對照 import numpy(60,293,120)/p_slip p_guess(≥15)/prior_knowledge slip guess(≥15)/"wheel spinning" student(0)/gaming_the_system(15 全雜訊)/affect_detection boredom(1 非教育)/pedagogical_policy(≥15 最高產)/tutor_action select(雜訊)/remediation_strategy(雜訊)/talk_move classification(≥15)/policy_network student_state(11)/student_model tutor_policy(2)。awesome(gh repos 8 發):awesome knowledge tracing/awesome AI education/awesome intelligent tutoring(0)/awesome educational NLP(0)/awesome LLM education(0)/awesome adaptive learning/awesome student modeling/awesome educational data mining。issues(4 發):"pykt reproduce"(0→改 repo 範圍 5 筆)/"OATutor integrate"(0→改 repo 全量 8 筆)。 雪球(WebSearch 8):Bridge arXiv NAACL/Tutor CoPilot arXiv/Bridge k=1 clone expert startup/AI extract single master teacher replicate LLM/Unggi Lee EduClaw/PEARL Qikai Chang iFlytek/digital twin teacher single professor 2025 2026/clone your own tutor AI startup。gh api:8 種子 org/user 全列+Demszky/Petukhova/Kochmar/Lin 個人帳號+GEMLab-HKU。Semantic Scholar:2310.10648 citations(74)+2410.03017 citations(72)+search(429 未補全)。WebFetch:arXiv×10+joingoblins.com(DNS 死)+the74million.org(403)。 死案(WebSearch 8):Korbit 2026/Riiid layoffs 2026/松鼠AI 2026/Carnegie MATHia LiveHint 2026/ALEKS 2026/Century Tech 2026/Third Space Learning funding 2026/Amira 2026。WebFetch:korbit.ai/riiid.com→corp.socra.ai/cognii.com/bakpax.com(DNS 死)/thinkstermath.com(DNS 死)/querium.com(憑證死)/wikipedia Querium(404)/web.archive.org(全數失效)。0 結果:無。


tier: deep(2026-08-07 quick 同日升級)。deep 檔已覆蓋原列五面(中文圈/實作層/學術線/雪球/死案)。仍未覆蓋:V2EX、LAK 2026 主會清單、MathDial 下游 issue、Goblins 技術路線查證、第 3 輪雪球。本報告為 2026-08-07 時間快照,>3 個月後引用請先重掃。