2026 年 7 月,蓋茲基金會公布了一份更新過的教育策略,其中有一部分建立在人工智慧上:協助老師做個別化教學的工具,以及替被文書工作淹沒的升學顧問設計的 AI 助理。The 74 的記者 Kevin Mahnken 在報導中引用了史丹佛研究員 Carly Robinson 的話,她研究的正是學生支持這個領域。她的說法很謹慎,我們也認為是對的。
「他們有很大一部分的時間花在繁瑣的行政上,而不是真的在與孩子相處,」她寫道。「如果 AI 能吸收掉那些後勤負擔,你並不是在取代這位顧問。你是讓他能夠把更多時間,放回與學生之間真正重要的工作上。」
這是合理的立場,而它背後的數字是真的。美國的學校輔導老師平均要負責 372 名學生,專業建議的比例則是 250。每週使用 AI 的老師回報,一週省下約六小時。如果軟體能接走表單與排程,把時數還回來,那就是一件單純的好事。
但請注意撐著整個論點的那個說法。真正重要的工作。它從來沒有人定義過,而這份含糊並非無害。假設一個人說不出「重要的工作」具體指什麼。那麼這句話就會替下一件交給自動化的事背書,一次一項,而那個不可取代的部分,永遠預設成剩下來的那些。真正有用的問題不是要不要用這些工具。而是在用的同時,人必須繼續做什麼。
這個問題有一個比多數辯論所暗示的更好的答案,而它不是來自意見。它來自「家教為什麼有效」這件事的研究。
一個學生做錯了一題。一個好的答案引擎會告訴他正確答案是什麼,把正確步驟耐心地走一遍,任何時間都可以,也不會不耐煩。在這件很窄的事情上,它做得很好,而且常常比晚上九點一個累壞的人更好。
它不會做的,是問他為什麼會做錯。看錯題目的學生、對負數有一個具體錯誤觀念的學生,以及聽懂了但沒睡飽、正在安靜崩解的學生,這三種需要三種不同的回應。其中只有一種是數學問題。
一對一(1-on-1)地教一個學生時,分辨這三種,就是這份工作的大部分。老師會注意到回答之前的那個停頓。會注意到一個原本很有把握的學生,安靜了兩個星期。會注意到那個「有意思」的錯誤答案,因為它剛好指出地基裡缺的是哪一塊。然後刻意決定不給答案,因為這個學生需要的,是再多撐九十秒。
這些都不是後勤。這些全部都是那份工作。
以下數字出自文中所標明的研究與機構。合起來看,它們描述的是一項有幫助的技術,而且在有人掌舵時幫助最大。
2025 年,一個由華頓商學院研究者領軍的團隊,在《美國國家科學院院刊》(PNAS)發表了一項研究。近一千名土耳其高中生,在一個數學單元裡分成三組。一組用標準的 AI 助理練習。一組用刻意限制成只給提示與引導問題的版本,那個版本設計成不會直接交出答案。一組完全沒有 AI。
練習過程中,用 AI 的兩組遙遙領先。然後考試時把工具收走,而那是唯一算數的一次測量。
請再讀一次,因為整個論點就在這一個結果裡。兩組用的是同一套底層技術。差別在於,有一個人事先決定了:這個工具要把答案留住,讓學生自己做。那個決定,而不是模型本身,就是「學會」與「看起來像學會」之間的分界。
把答案留住,不是一件自然的事。它違背一個樂於幫忙的系統的每一個本能,也違背眼前這個學生正在要的東西。它需要一個已經判斷過這個孩子現在需要什麼、並且願意短暫地不幫忙的人。這是「重要的工作」的第一項,而我們現在可以把它精確地說出來。
一旦認真看待土耳其那個結果,這條分界就會比公共辯論通常允許的更清楚。教學裡有一部分純粹是後勤,把它交給軟體是一份禮物。有一部分看起來像資訊傳遞,實際上卻是對一個具體的人所下的判斷,把它自動化,等於把讓它有效的那個東西拿掉。
左邊那一欄應該積極自動化。這篇文章的論點不是對科技保持戒慎。而是左邊那一欄是簡單的那一半,把它移給軟體,只有在它換回來的時數花在右邊那一欄時才有意義。省下來、然後拿去擴大班級人數的時數,什麼都沒有改善。它們只是省下來了。
家教是所有教學形式裡研究得最徹底的一種,這讓它成為觀察「什麼在驅動學習」最好的一扇窗。主要的發現很強。橫跨 96 項隨機對照試驗,家教平均帶來約 0.29 個標準差(SD)的進步,是教育研究裡比較可靠的效果之一。
真正說明問題的,是接下來發生的事。當研究者檢視 282 項試驗,問「大規模實施的家教應該期待什麼」時,效果掉到主要數字的三分之一到二分之一之間,而且計畫規模愈大,掉得愈穩定。家教裡有某個東西撐不過規模化,而把它指認出來,就知道價值住在哪裡。
這個領域自己的答案並不含糊。標準的指引把有效的家教定義為密集、以關係為基礎、個別化的教學,並且把關係列在特徵的第一項。其中一條設計原則明白寫著:學生從頭到尾應該遇到同一位老師,因為一致性建立起承載學習的那份關係。人數規模之所以重要,也是同一個道理。一對一的教學帶來約五個月的額外進度,小組約四個月。逐字稿研究發現,一對一的優勢有一部分來自花在個別化與關係上的時間,不是純粹的內容覆蓋量。
最後那個數字值得注意,因為它出自 Robinson 本人。在兩項隨機試驗裡,小學生拿到一個評價很好的 AI 閱讀家教。放著讓他們自己用,他們用了兩到五分鐘。她的結論是:難的不是做出好工具,而是讓學生真的去用,而「拿得到」不等於「會用」。她另一項研究發現,只發訊息給學生,並沒有提高免費家教的使用率,而同時發給家長與學生,使用率提高了 46%。
這一點值得直說。那位主張 AI 應該吸收後勤負擔的研究者,本身就是研究教育中人際關係的學者,而她自己的發現指出了瓶頸所在。瓶頸不在工具好不好。而在於有沒有一個人在迴圈裡,讓這個工具對一個具體的孩子產生意義。
我們在這件事上有利害關係。Harland 賣的是人的教學時間,所以一個主張「人類老師不可取代」的論點,同時也是在替我們自己的產品說話。正因如此,下面的讓步必須具體,不能只是裝飾。
沒有護欄的 AI 會降低學習。在 PNAS 那項試驗裡,用不受限助理練習的學生,在工具收走之後,考試成績比沒有用 AI 的對照組低約 17%。擋下這件事的,是一個由人設計的限制。
效果來自搭配,不是取代。我們找到的每一個嚴謹的成功案例,都有人在迴圈裡:使用 AI 助理的家教、監看 AI 草擬回覆的真人家教,或是在教室裡引導的老師。
有某種關係性的東西無法規模化。家教測得的效果在計畫擴大時掉了一半以上,而這個領域自己的設計指引,把關係與老師的一致性放在核心。
AI 家教確實產生學習。世界銀行在奈及利亞的一項試驗,在六週內測到約 0.23 到 0.31 個標準差的進步。更早的智慧型教學系統,在定義明確的任務上就已經與真人家教不相上下。這不是行銷話術。
公平性的論點很強,而我們沒有答案。AI 支持觸及了那些原本什麼都拿不到的學生,而史丹佛那項試驗裡最大的進步,出現在最弱的家教所帶的學生身上。不完美的東西,勝過沒有。
直接的因果並沒有得到證明。關係與一致性作為投入度與出席率的驅動因素,證據充分。至於它們是否直接拉高考試成績,那是一條合理的推論鏈,不是已經定案的發現,這個領域自己的研究者也這麼說。
人的教學也該少一點神祕感。那個廣為流傳的說法,說家教能帶來兩個標準差的進步,並沒有站住。比較謹慎的數字接近 0.79,而設計良好的軟體,在定義明確的窄任務上已經追平真人家教。這裡的論點不是人在每一件事上都比較好。而是有一份很短的清單,目前還沒有機器替代品,而一位老師的價值,現在就住在那份清單上。
幾個實用的問題,用來讀任何一所學校或業者關於 AI 的說法,包括我們自己的。
一間靠賣人的教學時數維生的補習學苑,寫文章說人的教學不能自動化,不會是一個沒有偏見的來源,您在讀這篇的時候應該知道這件事。我們試著用一個方式換取信任:把對我們最不利的論點直接讓出來。AI 家教有效。它觸及了那些什麼都沒有的學生。而人的家教,也沒有民間說法講得那麼神。
我們自己也用這些工具。它們草擬練習題組,處理行政,把不該有人動手做的工作從老師身上拿走。我們不是在主張這項科技是一個該抵抗的威脅。我們是從看著它把什麼做得很好、又完全還做不到什麼,來下這個判斷。
一對一教學給我們的,是一個很直接的視角,能看見那條界線。當一位老師每週與同一個學生坐在一起,很快就會發現這份工作的哪些部分機器可以接走,哪些部分少了人就會垮掉。答案一直很一致。它可以扛那份負擔。它扛不動關於這個孩子的判斷,也不可能成為那個他不想讓他失望的人。
Harland 一次只教一個學生,由一位依科目配對的專科老師負責,並且維持不換。我們的教學方法是內容導向(content-based learning):理解是透過真實的學科內容建立起來的,不是靠孤立的反覆操練。這個結構的存在,正是為了保護這篇文章所描述的那份工作。
如果您正在思考,除了軟體已經免費給孩子的東西之外,一位老師還應該給他什麼,那您問的正是對的問題。告訴我們孩子現在的狀況,我們會誠實地說,哪些部分我們幫得上。
開啟對話