ダートマスがAI採点を実地検証:学生は「杓子定規」と嫌うが、使った人ほど成績は良かった
- ダートマス大学が統計学の受講生151人を対象に、AI学習プラットフォームPhosphorを試験導入した。完全に任意で成績にも反映されない教科書の代替として使われ、記述式の採点はClaude Sonnet 4.6が担当した。
- 90.2%の学生が少なくとも一度はこのプラットフォームを使った。これはこの授業で学生と教員が自己申告した教科書の読了率(10〜15%)の6倍以上にあたる。
- フル活用(全24課を完了し、さらに3回の横断復習をすべて通過)と、まったく使わなかった場合を比べると、期末成績の差は事前成績を調整したうえで0.71標準偏差、調整しなければ1.30標準偏差だった。
- 3つのモジュールは学生の反応を受けて出題形式が2回変わり、思いがけず自然実験が成立した。学生が自分で答えを書く記述式モジュールだけが「多く解けば点も伸びる」という関係を保ち、選択式のみのモジュールではこの関係がほぼ消えた。
- プラットフォーム付属のAI質問チャットサイドバーは、学期を通じてわずか72回しか使われず、複数回使ったのは14人だけだった。
AI採点を教科書に組み込んだら、9割の学生が自ら使った
ダートマス大学の統計授業チームは先ごろ、151人の学生を対象にAI学習プラットフォームPhosphorを試験導入した。記述式と選択式のテストを本文の読解フローに直接組み込み、記述式は教員が定めた採点基準に沿ってClaude Sonnet 4.6が採点する。
このプラットフォームが解こうとするのは、すでに存在する一組の矛盾だ。一方で、大学生はほとんど教科書を読まない。1980年代以降、読了率はずっと下がり続け、学生は読書課題に自ら抵抗し、客観的に測った読了率は自己申告よりはるかに低い。この授業(MATH 010 統計入門)では、学生の自己申告による読了率は約15%、教員の見積もりでは10%にすぎず、ある学生の生の声は「そもそも誰も読まない」から「これも録音するんですか」まであった。
もう一方で、学生に自由にAIを使わせると、かえって学習を損なうおそれがある。Bastaniらが千人近くの学生を対象にした無作為比較試験では、制約なしにGPT-4を使わせると、ツールを取り上げた後で成績はむしろ17%下がった。学生はそれを学習ツールではなく松葉杖として使っていたのだ。教育上のガードレールを付けたバージョンだけが、この副作用を避けられた。同時に、学生が課題にAIを使う割合は急増している。2026年の高等教育政策研究所(HEPI)の調査では、94%の大学生が採点対象の課題で生成AIを使ったことがあり、2年前この数字はわずか53%だった。
Phosphor(旧称 Spongium)がやろうとしているのは、「自ら答える」ことを読書体験の中の構造的な一段にすること。本文を読むと同時に、AI採点の小テストを解かなければならない。その設計前提は、AIが最も役立つ位置は内容を届けるシステムそのものに直接組み込むところだ、というもの。これは教育研究で裏付けのある「doer効果」とも呼応する。これは後で触れる。
本文を読んだらすぐテスト、解いたらAIが即採点
Phosphorはウェブアプリで、授業内容は「課」ごとに構成され、各課に15〜20問の問題プールが付く。学生は1課を読み終えると、同じページで小テストを1回受ける。解き終えると、機械とAIがその場で採点する。
CRQ(構成型問答、つまり記述式)は、いくつかの選択肢から答えを選ぶのではなく、学生が自分で一段落を書いて答え、それをAIが教員の定めた採点基準と模範解答と照合して、採点し理由を説明する。選択式よりもう一段階多くを求める。答えを自分の言葉で組み立てることだ。
この設計が賭けているのは「doer効果」だ。演習問題を解くことがもたらす学習効果は、ただ読むだけの何倍にもなる。本当に効いているのは「自ら答える」という動作そのものであって、何ページ読んだかではない。演習を読書に組み込むのは、この効果をデフォルトで起こることに変えたいからだ。この賭けが正しいかどうかは、次節の自然実験が直接の答えを出している。
記述式と選択式、成績を伸ばすのはどっちか
3つのモジュールは本来同じ出題形式を使うはずだったが、学生の反応を受けて途中で2回変わり、かえって比較試験に近い状況ができあがった。
モジュール1(記述統計、9課)は記述式と選択式を混ぜた小テストを使った。モジュール2(確率と標本抽出、8課)は、多くの学生が「記述式の自動採点は杓子定規で、心が折れる」と反応したため、小テストを選択式のみに削った。モジュール3(統計的推測、7課)に入ると、チームは試験結果を分析し、選択式のみの小テストはほとんど学習効果を生まないと判断して、記述式を再び戻した。
こうして同じ学生たち、同じ授業でありながら、モジュールごとに異なる出題形式を経験した。「1課多く終える」ことと「試験で何点多く取る」ことの関係を取り出してみると、3つのモジュールが示す傾きはまったく違っていた。
3つのモジュールの違いは出題形式だけだ。記述式があるときは「1課多く終えれば期末で点が伸びる」という関係が現れ、選択式のみに変えるとこの関係は消え(R²は0.123から0.001へ)、記述式に戻すと関係もまた戻る。本当に点数を押し上げているのは、「自分で言葉を組み立てて答えを書く」という動作だ。これはテスト効果の研究とも一致する。Kangらは、フィードバック付きの記述式は長期記憶において選択式より効果が強い(d=0.41)ことを見いだした。
3つの回帰の完全な数字を開く(Table 2)
| 対象 | モジュール1 → 中間1(記述+選択) | モジュール2 → 中間2(選択のみ) | 全24課 → 期末 |
|---|---|---|---|
| 全プラットフォーム利用者 | 1.64x + 77.9、R²=0.123 | 0.90x + 76.0、R²=0.027 | 0.41x + 84.7、R²=0.091 |
| 1課以上完了 | 1.37x + 80.0、R²=0.111 | −0.29x + 84.7、R²=0.001 | 0.45x + 84.0、R²=0.096 |
モジュール2の「全利用者」の列に正の傾きがあるように見えるのは、未完了と完了済みを引き離しているからにすぎない。完了記録のある学生だけを見ると、傾きは負に転じる。
本当に点を伸ばすのは、課をまたぐ復習テスト
すべての比較を並べてみると、効果が最も大きいのは単課の小テストではなく、モジュール全体をカバーする復習テストだった。3回のモジュール復習をすべて通過した学生は、通過しなかった学生より期末が7.1点高い。
Cohen's d は、2グループの点数の差を「標準偏差いくつ分に相当するか」に換算し、研究をまたいで大小を比べやすくする。教育研究では d=0.66 はふつう中〜大の効果とされ、たいていの授業内介入の効果量はこれよりずっと小さい。下の d=0.66 の棒は、記事で最も大きい単一の効果だ。
あらかじめ設定した5つの比較のうち、Holmの多重比較補正を経てもなお成り立ったのは「全3回の復習を通過」の1項目だけだった(p<0.0001)。この学生たちは研究全体で最も選り抜かれた集団でもあるので、著者はより硬い証拠をより清潔な比較に置いた。モジュール2の内部で、復習を通過した学生は通過しなかった学生より中間が6.1点高く(d=0.39)、内容も時期もクラスも固定されており、方向も大きさも一致する。
モジュール復習と単課の小テストの違いはいくつかある。複数の課をカバーし、異なるトピックを織り交ぜ、ハードルが高く(90%)、記述式も選べる。どれが決め手かは切り分けられないが、最も効いていそうなのは「トピックをまたぐ交互検索練習」、それに学生が自ら育てた間隔をあけた復習リズムだ。
学生が自分で「間隔反復」を積み上げた
3回のモジュール復習では、3分の2の受け直し(237回のうち157回)が少なくとも一度は戻って受け直しており、しかもその多くはしばらく間をあけて戻ってきたもので、その場ですぐ解き直したものではない。
受け直しの間隔の中央値は約1.5日で、3つのモジュールの受け直し率も近い(それぞれ61%、77%、56%)。この「1日あけて戻ってくる」という行動は、まさに記憶研究が推奨する間隔をあけた復習であり、しかも学生が強制されないなかで自発的に形づくったものだ。
フル参加と不参加で、どれだけ差がつくか
「何課受けたか」と「復習を何回通過したか」という2本の参加ラインを1つのモデルに一緒に入れ、フル参加と不参加の間の期末の差を推定する。ここで使うのはTobitモデルだ。
今回の期末では27%の学生が満点の上限に達した。ふつうの回帰をそのまま使うと、この上限に達した学生は他の高得点者と区別がつかず、本当の点差を過小評価してしまう。Tobitモデルはこの「一部の人が天井にぶつかる」状況を専門に扱い、「本来もっと高いはずが満点で頭打ちになった」点数を補正して戻す。
結果は一つの区間として出る。学生の事前の実力も差し引くかどうかによる。
他の変数を調整しないと、フル参加(24課に加え3回の復習をすべて通過)と不参加を比べて、期末は14.7点(1.30標準偏差)の差がつく。2回の中間成績を調整すると、差は8.0点(0.71標準偏差)へと半減する。
著者は、0.71という数字は保守的な下限であって最良推定ではないと強調する。期末が問うのは同じ内容であり、2回の中間は実のところ同じ結果の平行測定だ。それを制御変数として差し引くと、Phosphorが学期の早い時期にすでに生んだ学習効果まで一緒に差し引くことになる。だから妥当な効果の区間は、0.71標準偏差(過剰調整)から1.30標準偏差(自己選択が混ざる)の間に収まる。教育介入の観察研究の基準では、この大きさは小さくない。
Tobitの3列モデルを開く(Table 4)
| 係数 | 参加のみ | +中間1 | +中間2 |
|---|---|---|---|
| 課の完了(0–24) | 0.074 (1.8) | 0.060 (1.8) | 0.058 (1.6) |
| 復習通過(0–3) | 0.584 (1.8) | 0.162 (0.6) | 0.180 (0.7) |
| 中間の制御項 | — | 15.55 (8.0) | 11.63 (6.9) |
| フル参加 vs 不参加の差(/100) | 14.7 | 8.0 | 8.0 |
| 標準偏差に換算 | 1.30 | 0.71 | 0.71 |
中間を調整すると、復習の項目の係数は大きく吸収され(z≈0.6)、各課の完了の係数はほぼ動かない(z≈1.8)。復習の恩恵は中間の時点ですでに実現しており、課数という用量のほうは学期末に向けた独立した信号をまだ帯びている。
AI質問サイドバーは、ほとんど誰も開かなかった
プラットフォームにはAI質問チャットサイドバーも付いており、検索拡張(RAG)技術を使っている。その利用量はテスト機能と2桁の差があった。
RAG(検索拡張生成)チャットアシスタントは、まず学生の質問をベクトルに変換し、この授業の内容ライブラリと照合して、最も関連する段落をAIの回答材料に差し込む。AIがこの授業の内容だけに基づいて答え、脱線もでっち上げもしないようにするためだ。読解ページのサイドバーに置かれ、いつでも質問できる。
学期を通じて、チャットサイドバーはわずか72回しか使われず、複数回使ったのは14人だけだった。学生が挙げた理由は2つ。汎用AIツールのほうが自分の質問に速く強く答えてくれること。そして授業内容そのものがすでに十分に説明しており、読んでいるあいだに質問がたまらず、わざわざチャット枠を開いて聞くまでもないことだ。
この閑散ぶりは外部の観察とも一致する。カーンアカデミーも以前、補助チャットボットを頻繁に使うユーザーは15%だけだと報告している。AIを「テストとフィードバック」という評価の主フローに直接組み込むほうが、外付けのチャット窓にするより、学生に本当に使ってもらいやすい。
この研究はどこまで信頼でき、著者は次に何をしたいのか
著者は限界をはっきり示している。これは観察研究であり、あるエリート校の一つの授業でだけ試験導入され、無作為比較はない。
最大の解釈上の脅威は自己選択だ。多く問題を解こうとする学生は、そもそも実力があり意欲も高い可能性がある。著者は2回の中間成績で事前の実力を制御し、効果の上限と下限を示したが、モジュールをまたぐ課数の比較は、内容領域、時期、そしてモジュール復習が同時に導入されたことという要素が絡み合ったままだ。しかも「3回の復習を全通過」の集団は、研究全体で最も選り抜かれた一群でもある。アンケートデータも小標本からのもので、社会的望ましさのバイアスがあるかもしれない。
研究からはもう一つ潜在的なトレードオフが浮かび上がる。記述式をオフにすると、小テストの完了率は49.6%から58.8%に上がり、再びオンにすると33.4%に下がった。効果が最も強い機能が、必ずしも学生が最も使いたがる機能とは限らない。
著者は次の段階として、課の完了度を授業の成績と結びつけ、より清潔な「用量と効果」の測定を得たうえで、より多くの学校の入門授業で再現する計画だ。記述式と選択式を無作為に振り分ける比較試験も計画に入っており、そうしてはじめて「記述式のほうが効く」という因果の主張を確かなものにできる。
こうした結果は、高い参加度と測定可能な学習効果は同時に達成できることを示している。AIが大規模に、採点基準に沿って記述式を採点するこの能力は、教育上意味があるのであって、単に教員の手間を省くだけではない。 Phosphor 論文の要旨と考察部分(iTextbooks 2026)
AI採点を教科書に組み込むと9割が自ら使う、点を伸ばすのは「自分で答えを書かせる」こと
ダートマス151人がAI学習プラットフォームPhosphorを実測。記述式は選択式より点を伸ばすが、AI質問サイドバーはほぼ誰も押さない。図つき一枚で解説。
↓ 一枚で読める · 動く図が1枚あり
大学生はほとんど教科書を読まないが、自由にAIを使わせても学習を損なうおそれがある。この研究は「学生が自ら使い、しかも本当に成績を上げられる」AI学習ツールを作り、両取りできるかを見ようとした。
✘ なのに教科書は相変わらず誰も読まず(読了率 10–15%)、汎用AIを自由に使わせると、ツールを取り上げた途端に成績はむしろ17%下がる
千人近い無作為比較試験でわかったのは、学生がAIを学習の相棒ではなく松葉杖にしていること。そして教科書がどれだけ良くても、開かなければゼロだ。ダートマスの統計授業チームはこう問う。AIを教科書に組み込んで「自ら答える」を引き出し、学生が自ら使い、しかも本当に身につけられないか?
プラットフォームの名はPhosphor。1課を読み終えるとすぐランダムな小テスト4問を解き、選択式は機械が採点、記述式(選択肢を選ぶのではなく自分で一段落書いて答える)はClaude Sonnet 4.6が教員の定めた基準で採点し理由も示す。完全に任意で成績にも反映されないのに、9割の学生が自ら使い始めた。
だが「よく使う」が「よく学べる」とは限らない。学習好きの学生がもともと問題を解くのが好きなだけでは? 思いがけない出題変更が、その答えを引き出した。
3つのモジュールは本来同じ出題形式のはずが、学生の反応で2回変わった。モジュール1 記述+選択 → モジュール2 学生の要望で選択のみに → モジュール3 記述に復帰。同じ学生たちが偶然の対照実験を生んだ。
小互が3つのモジュールで同じこと、つまり多く解くをやってみる。「自分で答えを書く」モジュールでだけ、多く解くことが点の伸びに変わる。選択肢を選ぶ形式に変えるとこの関係はそのまま消え、記述式に戻すとまた復活する。図中の小さな文字 R² は「この関係がどれだけ強いか」の点数で、大きいほど強く、0に近いほど関係なしだ。
公式が示すのは「標準偏差」で、ふつうの人にはピンとこない。クラス順位に換えればはっきりする。
- × 教科書は誰も読まない · 読了率はわずか 10–15%
- × 汎用AIを松葉杖に · 取り上げると成績17%減
中間が1.64点増
9割が本当に使う