The Harland Review · 當代學生

機器能分擔的,與不能取代的

The Important Work
適合
正在思考 AI 改變了教學什麼的家長
閱讀時間
約 13 分鐘
最近更新
2026 年 8 月
重新框定

大家都同意,AI 應該把老師空出來,去做真正重要的工作。幾乎沒有人說清楚那是什麼。

2026 年 7 月,蓋茲基金會公布了一份更新過的教育策略,其中有一部分建立在人工智慧上:協助老師做個別化教學的工具,以及替被文書工作淹沒的升學顧問設計的 AI 助理。The 74 的記者 Kevin Mahnken 在報導中引用了史丹佛研究員 Carly Robinson 的話,她研究的正是學生支持這個領域。她的說法很謹慎,我們也認為是對的。

「他們有很大一部分的時間花在繁瑣的行政上,而不是真的在與孩子相處,」她寫道。「如果 AI 能吸收掉那些後勤負擔,你並不是在取代這位顧問。你是讓他能夠把更多時間,放回與學生之間真正重要的工作上。」

這是合理的立場,而它背後的數字是真的。美國的學校輔導老師平均要負責 372 名學生,專業建議的比例則是 250。每週使用 AI 的老師回報,一週省下約六小時。如果軟體能接走表單與排程,把時數還回來,那就是一件單純的好事。

但請注意撐著整個論點的那個說法。真正重要的工作。它從來沒有人定義過,而這份含糊並非無害。假設一個人說不出「重要的工作」具體指什麼。那麼這句話就會替下一件交給自動化的事背書,一次一項,而那個不可取代的部分,永遠預設成剩下來的那些。真正有用的問題不是要不要用這些工具。而是在用的同時,人必須繼續做什麼。

這個問題有一個比多數辯論所暗示的更好的答案,而它不是來自意見。它來自「家教為什麼有效」這件事的研究。

我們所見
機器不會想到要問的那個問題。

一個學生做錯了一題。一個好的答案引擎會告訴他正確答案是什麼,把正確步驟耐心地走一遍,任何時間都可以,也不會不耐煩。在這件很窄的事情上,它做得很好,而且常常比晚上九點一個累壞的人更好。

它不會做的,是問他為什麼會做錯。看錯題目的學生、對負數有一個具體錯誤觀念的學生,以及聽懂了但沒睡飽、正在安靜崩解的學生,這三種需要三種不同的回應。其中只有一種是數學問題。

一對一(1-on-1)地教一個學生時,分辨這三種,就是這份工作的大部分。老師會注意到回答之前的那個停頓。會注意到一個原本很有把握的學生,安靜了兩個星期。會注意到那個「有意思」的錯誤答案,因為它剛好指出地基裡缺的是哪一塊。然後刻意決定不給答案,因為這個學生需要的,是再多撐九十秒。

這些都不是後勤。這些全部都是那份工作。

數字一覽

研究告訴我們什麼

以下數字出自文中所標明的研究與機構。合起來看,它們描述的是一項有幫助的技術,而且在有人掌舵時幫助最大。

家教的整體效果
0.29 SD
橫跨 96 項隨機對照試驗的合併效果,資料來自 Nickow、Oreopoulos 與 Quan,2024 年
規模化之後會發生什麼
⅓ 至 ½
在大型計畫中,這個效果還剩下多少,橫跨 282 項試驗,資料來自 Kraft、Schueler 與 Falken
老師拿回來的時數
5.9 小時
固定使用 AI 的老師每週省下的時間,資料來自 Gallup 與 Walton Family Foundation,2025 年
輔導老師負擔的學生數
372 : 1
美國平均值,對照建議的 250 比 1,資料來自美國學校輔導人員協會(ASCA)
AI 協助一位家教時
+9 分
家教使用 AI 助理之後,最弱那一群家教所帶學生的主題精熟度增幅,資料來自史丹佛 Tutor CoPilot 試驗
沒有護欄的 AI
−17%
工具收走之後,相對於沒有用 AI 的對照組的考試表現,資料來自 Bastani 等人,PNAS 2025
附和的傾向
49%
橫跨 11 個主流模型,它們附和使用者做法的頻率比人類高出多少,資料來自 2026 年一項史丹佛主導的研究
把好工具丟著讓學生自己用
2–5 分鐘
沒有大人把它嵌進學習裡時,小學生使用一個 AI 閱讀家教的時間,資料來自 Robinson 等人
應該形塑這場辯論的那個發現

練習時幫最多的那個工具,在考試時傷最重

2025 年,一個由華頓商學院研究者領軍的團隊,在《美國國家科學院院刊》(PNAS)發表了一項研究。近一千名土耳其高中生,在一個數學單元裡分成三組。一組用標準的 AI 助理練習。一組用刻意限制成只給提示與引導問題的版本,那個版本設計成不會直接交出答案。一組完全沒有 AI。

練習過程中,用 AI 的兩組遙遙領先。然後考試時把工具收走,而那是唯一算數的一次測量。

生成式 AI 與學習 · Bastani 等人,PNAS 2025 · 約 1,000 名學生
練習期間
工具在手邊時,練習題上的表現
標準 AI 助理+48%
限制成只給提示的 AI+127%
沒有 AI基準線
考試時,工具收走
相對於從未使用 AI 的學生的表現
標準 AI 助理−17%
限制成只給提示的 AI傷害幾乎消失
沒有 AI對照組
學得最少的,正是機器幫最多的那一組。分開這兩組 AI 的,只有一個設計決定:這個工具能不能給出答案。

請再讀一次,因為整個論點就在這一個結果裡。兩組用的是同一套底層技術。差別在於,有一個人事先決定了:這個工具要把答案留住,讓學生自己做。那個決定,而不是模型本身,就是「學會」與「看起來像學會」之間的分界。

把答案留住,不是一件自然的事。它違背一個樂於幫忙的系統的每一個本能,也違背眼前這個學生正在要的東西。它需要一個已經判斷過這個孩子現在需要什麼、並且願意短暫地不幫忙的人。這是「重要的工作」的第一項,而我們現在可以把它精確地說出來。

把線劃出來

什麼可以吸收,什麼不能

一旦認真看待土耳其那個結果,這條分界就會比公共辯論通常允許的更清楚。教學裡有一部分純粹是後勤,把它交給軟體是一份禮物。有一部分看起來像資訊傳遞,實際上卻是對一個具體的人所下的判斷,把它自動化,等於把讓它有效的那個東西拿掉。

交出去吧
機器扛得動的負擔
  • 排課、提醒、表單,以及申請進度追蹤
  • 依指定難度產出無上限的練習題
  • 晚上十一點回答一個事實性的問題
  • 起草第一版的教案或評分標準
  • 批改答案對錯明確的作業
  • 彙整哪些學生錯了哪些題型
依現有證據,大約是一位老師每週六小時。是真的,也值得拿走。
無法吸收
重要的工作
  • 決定不給答案,因為這個學生需要卡住
  • 診斷一個學生為什麼卡住,而不只是知道他卡住了
  • 察覺沒有任何人回報的抽離、逃避或不對勁
  • 在學生寧願聽到「你沒問題」的時候,守住標準
  • 夠了解這個孩子,讓那個判斷是對的
  • 成為一個學生不想讓他失望的人
這裡沒有一項是資訊傳遞。每一項都需要長時間認識一個具體的人。

左邊那一欄應該積極自動化。這篇文章的論點不是對科技保持戒慎。而是左邊那一欄是簡單的那一半,把它移給軟體,只有在它換回來的時數花在右邊那一欄時才有意義。省下來、然後拿去擴大班級人數的時數,什麼都沒有改善。它們只是省下來了。

我們為什麼能說得這麼具體

研究指向的是同一件事

家教是所有教學形式裡研究得最徹底的一種,這讓它成為觀察「什麼在驅動學習」最好的一扇窗。主要的發現很強。橫跨 96 項隨機對照試驗,家教平均帶來約 0.29 個標準差(SD)的進步,是教育研究裡比較可靠的效果之一。

真正說明問題的,是接下來發生的事。當研究者檢視 282 項試驗,問「大規模實施的家教應該期待什麼」時,效果掉到主要數字的三分之一到二分之一之間,而且計畫規模愈大,掉得愈穩定。家教裡有某個東西撐不過規模化,而把它指認出來,就知道價值住在哪裡。

這個領域自己的答案並不含糊。標準的指引把有效的家教定義為密集、以關係為基礎、個別化的教學,並且把關係列在特徵的第一項。其中一條設計原則明白寫著:學生從頭到尾應該遇到同一位老師,因為一致性建立起承載學習的那份關係。人數規模之所以重要,也是同一個道理。一對一的教學帶來約五個月的額外進度,小組約四個月。逐字稿研究發現,一對一的優勢有一部分來自花在個別化與關係上的時間,不是純粹的內容覆蓋量。

0.29 SD
橫跨 96 項隨機對照試驗,家教的平均效果
Nickow、Oreopoulos 與 Quan,2024 年
⅓–½
計畫規模化之後,這個效果還剩下多少,橫跨 282 項試驗
Kraft、Schueler 與 Falken
2–5 分鐘
沒有大人把它嵌進學習裡時,學生使用一個好的 AI 家教的時間
Robinson 等人,2025 年

最後那個數字值得注意,因為它出自 Robinson 本人。在兩項隨機試驗裡,小學生拿到一個評價很好的 AI 閱讀家教。放著讓他們自己用,他們用了兩到五分鐘。她的結論是:難的不是做出好工具,而是讓學生真的去用,而「拿得到」不等於「會用」。她另一項研究發現,只發訊息給學生,並沒有提高免費家教的使用率,而同時發給家長與學生,使用率提高了 46%。

這一點值得直說。那位主張 AI 應該吸收後勤負擔的研究者,本身就是研究教育中人際關係的學者,而她自己的發現指出了瓶頸所在。瓶頸不在工具好不好。而在於有沒有一個人在迴圈裡,讓這個工具對一個具體的孩子產生意義。

證據撐得起與撐不起的

這個論點誠實的邊界

我們在這件事上有利害關係。Harland 賣的是人的教學時間,所以一個主張「人類老師不可取代」的論點,同時也是在替我們自己的產品說話。正因如此,下面的讓步必須具體,不能只是裝飾。

證據支持的部分

沒有護欄的 AI 會降低學習。在 PNAS 那項試驗裡,用不受限助理練習的學生,在工具收走之後,考試成績比沒有用 AI 的對照組低約 17%。擋下這件事的,是一個由人設計的限制。

效果來自搭配,不是取代。我們找到的每一個嚴謹的成功案例,都有人在迴圈裡:使用 AI 助理的家教、監看 AI 草擬回覆的真人家教,或是在教室裡引導的老師。

有某種關係性的東西無法規模化。家教測得的效果在計畫擴大時掉了一半以上,而這個領域自己的設計指引,把關係與老師的一致性放在核心。

論點該打住的地方

AI 家教確實產生學習。世界銀行在奈及利亞的一項試驗,在六週內測到約 0.23 到 0.31 個標準差的進步。更早的智慧型教學系統,在定義明確的任務上就已經與真人家教不相上下。這不是行銷話術。

公平性的論點很強,而我們沒有答案。AI 支持觸及了那些原本什麼都拿不到的學生,而史丹佛那項試驗裡最大的進步,出現在最弱的家教所帶的學生身上。不完美的東西,勝過沒有。

直接的因果並沒有得到證明。關係與一致性作為投入度與出席率的驅動因素,證據充分。至於它們是否直接拉高考試成績,那是一條合理的推論鏈,不是已經定案的發現,這個領域自己的研究者也這麼說。

人的教學也該少一點神祕感。那個廣為流傳的說法,說家教能帶來兩個標準差的進步,並沒有站住。比較謹慎的數字接近 0.79,而設計良好的軟體,在定義明確的窄任務上已經追平真人家教。這裡的論點不是人在每一件事上都比較好。而是有一份很短的清單,目前還沒有機器替代品,而一位老師的價值,現在就住在那份清單上。

常見的情況

身為家長,該問什麼

幾個實用的問題,用來讀任何一所學校或業者關於 AI 的說法,包括我們自己的。

一所學校宣布要導入 AI 家教。
問題不在這個工具好不好。而在省下來的時間拿去做什麼。如果 AI 吸收掉批改與行政,而那些時數回到學生身上,那就是這套邏輯照原意運作。如果班級人數變多、或接觸時數變少,因為軟體補上了差額,那這套邏輯,反而替它原本承諾的相反面背書。
孩子正在用 AI 助理寫作業。
真正重要的分別,是它給答案,還是把答案留住。一個會把完整解法講一遍的工具,產生的正是土耳其那項研究裡流暢、有把握、而後在考試時崩掉的練習表現。一個用來把卡住的地方解開、然後就關掉的工具,是另一回事。請孩子把下一題不靠它做出來。
工具告訴您的孩子,這份作業很好。
把聊天機器人的稱讚當成幾乎沒有意義。2026 年一項橫跨 11 個主流模型的研究發現,它們附和使用者做法的頻率比人類高出 49%,而使用附和型 AI 的人,會更加相信自己是對的。一個以「被喜歡」為最佳化目標的系統,沒辦法穩定地告訴您的孩子:這份作業還不夠好。
有業者說 AI 讓他們能服務更多學生。
這可能是真的,也可能是好事,尤其在另一個選項是完全沒有支持的時候。但請追問下去:您的孩子還有沒有一位固定的、認識他的人,還是換成一批輪流的人加上更好的軟體。關於家教規模化時什麼會消失的證據顯示,這個答案比技術本身更重要,兩個方向都是。
我們為何能誠實地寫這篇
我們不是中立的一方,而且我們自己也在用這些工具。

一間靠賣人的教學時數維生的補習學苑,寫文章說人的教學不能自動化,不會是一個沒有偏見的來源,您在讀這篇的時候應該知道這件事。我們試著用一個方式換取信任:把對我們最不利的論點直接讓出來。AI 家教有效。它觸及了那些什麼都沒有的學生。而人的家教,也沒有民間說法講得那麼神。

我們自己也用這些工具。它們草擬練習題組,處理行政,把不該有人動手做的工作從老師身上拿走。我們不是在主張這項科技是一個該抵抗的威脅。我們是從看著它把什麼做得很好、又完全還做不到什麼,來下這個判斷。

一對一教學給我們的,是一個很直接的視角,能看見那條界線。當一位老師每週與同一個學生坐在一起,很快就會發現這份工作的哪些部分機器可以接走,哪些部分少了人就會垮掉。答案一直很一致。它可以扛那份負擔。它扛不動關於這個孩子的判斷,也不可能成為那個他不想讓他失望的人。

Harland 如何提供協助

一位認識您孩子的老師,做那件不能自動化的事。

Harland 一次只教一個學生,由一位依科目配對的專科老師負責,並且維持不換。我們的教學方法是內容導向(content-based learning):理解是透過真實的學科內容建立起來的,不是靠孤立的反覆操練。這個結構的存在,正是為了保護這篇文章所描述的那份工作。

01
同一位老師,久到足以認識這個學生。
家教的研究把「固定的同一位老師」列為設計原則,而不是加分項,因為關於一個學生的判斷,取決於認識這個學生。您的孩子會有一位依科目配對的主要老師,而如果配對不合,我們換老師,不會要求孩子去適應。
02
我們決定什麼時候不給答案。
這篇文章裡最清楚的發現,就是把答案留住,分開了「學會」與「看起來像學會」。那個決定是刻意做的,一個學生一個學生地做,由一個知道這個孩子今天扛得住多少有效掙扎的人來做。它是我們做的事情裡最難自動化的一件。
03
有人會注意到數據沒有回報的事。
儀表板會回報一個學生錯了哪些題。一個人會注意到一個原本安定的學生開始戒備、逃避悄悄出現,或者這週的問題根本不是學業。每一堂課都會產生一份家長看得到的書面紀錄,但注意到這些事,發生在教室裡。

是誰在教您的孩子?

如果您正在思考,除了軟體已經免費給孩子的東西之外,一位老師還應該給他什麼,那您問的正是對的問題。告訴我們孩子現在的狀況,我們會誠實地說,哪些部分我們幫得上。

開啟對話
發布 2026 年 8 月 19 日 · 最近更新 2026 年 8 月 19 日 · 所有數字均於發表時,對照文中所標明的研究或機構查證。
資料來源

這些數字的出處

關於蓋茲基金會更新後的教育策略及其 AI 重點的報導,也是 Carly Robinson 那段引文的出處。The 74 揭露自己接受蓋茲基金會的資助。
Bastani、Bastani、Sungu、Ge、Kabakcı 與 Mariman,《美國國家科學院院刊》(PNAS,2025 年)
〈沒有護欄的生成式 AI 會傷害學習〉。約 994 名土耳其高中生;練習表現分別提高 48% 與 127%,而在不受限的工具收走之後,考試成績相對於對照組低約 17%。
Nickow、Oreopoulos 與 Quan,《American Educational Research Journal》(2024 年)
96 項隨機家教實驗的系統性回顧與統合分析;合併效果約 0.29 個標準差。
Kraft、Schueler 與 Falken(2024、2026 年)
〈大規模家教應該期待什麼樣的效果?〉擴充後的統合分析涵蓋 282 項隨機試驗,發現在對齊大規模計畫之後,效果約為主要數字的三分之一到二分之一。
Robinson 等人,史丹佛 SCALE Initiative
關於 AI 家教使用率的隨機試驗(沒有大人嵌入時,使用時間為兩到五分鐘),以及提高家教使用率的推力研究(訊息同時觸及家長與學生時,使用率提高 46%)。
Wang、Ribeiro、Robinson、Loeb 與 Demszky,Tutor CoPilot(2024 年)
一項隨機試驗,900 位家教、1,800 名學生使用 AI 助理;整體主題精熟度高出 4 個百分點,評價最低那一群家教所帶的學生則高出 9 個百分點。
Robinson、Kraft、Loeb 與 Schueler,EdResearch for Action Brief 30(2024 年 6 月)
高影響力家教的設計原則,將其定義為以關係為基礎,並把「固定的同一位家教」列為設計原則。作者註明,各項計畫特徵之間並未做過直接比較。
一對一教學約帶來五個月的額外進度,小組教學約四個月。
Gallup 與 Walton Family Foundation(2025 年 6 月)
針對 2,232 位美國公立學校教師的調查;每週使用 AI 者回報平均每週省下 5.9 小時。
美國學校輔導人員協會(ASCA)
2024–25 學年全國平均每位輔導老師負責 372 名學生,對照建議的 250 比 1。
De Simone 等人,世界銀行政策研究工作論文 11125(2025 年 5 月)
在奈及利亞貝寧市進行的 GPT-4 家教隨機試驗;六週內測得英文約 0.23 個標準差、整體 0.31 個標準差的進步,過程中有老師從旁引導。
Cheng 等人,《Science》(2026 年)
一項橫跨 11 個主流模型的研究,發現它們附和使用者做法的頻率比人類高出 49%,而與附和型系統互動,會提高使用者「自己是對的」的信心。