学習ゲームの難易度は、正答率だけで上下させないほうが安全です。同じ不正解でも、知識不足、時間切れ、操作ミス、問題文の読み違いでは必要な支援が違います。正誤に加えて反応時間、ヒント利用、誤りの型、再挑戦での回復を見て、調整する要素を一つずつ選びます。
234人・3条件の研究が示したこと
Sampayo-Vargasらは2013年、中等教育段階の生徒234人を、スペイン語の同根語を学ぶ三つの活動へ割り当てました。条件は、成績に応じて難易度が変わるゲーム、難易度が順番に上がる非適応型ゲーム、筆記活動です。二つのゲームは、難易度の変え方を除いて同じ設計でした。
三条件とも動機づけは高く、条件間に有意差はありませんでした。一方、事前・事後テストで測った学習成果は、適応型ゲームの群が有意に高い結果でした。「適応型だから楽しくなる」とは示されていませんが、この課題では学習の足場として機能したと読めます。
ただし、一つの研究から万能な規則は作れません。ShuteらがPhysics Playgroundを使って行った別の研究では、9年生から11年生の263人を適応型、線形、自由選択、無処置の四群に無作為に割り当てました。ゲーム内のレベル提示方法には、学習への有意な効果が確認されませんでした。対象、教材、変える要素によって結果は異なります。
以下は、これらの研究結果を個別の学習ゲームへ移すための設計上の推論です。論文が特定の正答率や調整アルゴリズムを推奨した、という意味ではありません。
正答率だけではプレイヤーの状態を読めない
たとえば正答率が60%でも、すぐ答えた誤答が続く人と、複数の方針を試して最後に解けた人では状態が違います。前者には誤概念を見直す説明、後者には探索時間や途中保存が役立つかもしれません。
| ログの組み合わせ | 考えられる状態 | 読み違えの例 | 調整候補 |
|---|---|---|---|
| 誤答が多く反応も速い | 手掛かりの見落とし、思い込み | 知識不足と即断する | 根拠を選ばせる、対比例を出す |
| 誤答が多く時間も長い | 概念か手順で行き詰まり | 集中しているから問題なしとする | 問題を分割する、途中ヒントを出す |
| 正答が多くヒントも多い | 支援込みで達成 | 習得済みと判定する | ヒントを段階的に減らす |
| 初回は誤答、再挑戦で修正 | フィードバックから学習中 | 初回だけで難度を下げる | 同水準の別問題で確認する |
| 正答が多く反応が極端に速い | 習得、暗記、推測のいずれか | 即座に難度を上げる | 理由説明や転移課題を挟む |
反応時間には読む速さや端末差も混ざります。全員に同じ秒数の基準を当てるより、本人の過去の傾向と問題の標準時間を分けて見るほうが誤判定を減らせます。
難易度を一つの数値にしない
「難易度3」から「難易度4」へ上げるだけでは、何が難しくなったのか検証できません。学習ゲームでは、少なくとも次の軸を別々に扱います。
- 扱う概念の数と関係の複雑さ
- 選択肢や使える操作の数
- 解答に使える時間
- 関係のない情報の量
- ヒントの具体性と提示時点
- 失敗時に失う資源や戻される距離
知識を測りたい場面で制限時間を短くすると、読解速度や入力速度まで混ざります。反対に判断速度を練習する場面なら、時間は学習目標の一部です。先に「このステージは何をできるようにするか」を決め、その能力に関係しない負荷を調整します。デッキ構築での判断の観察と同様に、正解数だけでなく、判断に使った情報も分けて見ます。
実装は小さな規則から始める
機械学習を導入しなくても、説明できる規則で初期版を作れます。次の順番なら、なぜ問題が変わったかを開発側が追跡できます。
- 学習目標を技能単位に分ける。「日本史」のような大分類ではなく、「二つの出来事を原因と結果で結べる」程度まで絞ります。
- 各問題がどの技能をどの強さで使うか記録する。一問に多くの技能を詰め込みすぎません。
- 正誤、反応時間、ヒント、誤答選択肢、再挑戦をイベントとして残す。ログから能力を推定する場合は、ステルスアセスメントの証拠設計と分けずに考えます。
- 直近の複数問から状態を仮判定し、難易度の一軸だけを変える。
- 変更後は一定数の問題を保ち、すぐ元へ戻さない。上下を繰り返す揺れを防ぎます。
- 小テストと短い自己報告で、学習と遊びやすさを別々に確認する。
開始時の閾値は仮説です。たとえば「複数問で正答し、ヒントを使わず、別形式でも理由を説明できたら次へ進む」と置き、テスト結果に合わせて直します。特定の正答率を研究値として扱ってはいけません。
調整してはいけないものを先に決める
適応処理がプレイヤーを常に成功させると、学ぶべき内容まで薄くなることがあります。歴史の因果関係を学ぶゲームで、苦戦した人だけ原因の選択肢を一つに減らせば、到達目標そのものが変わります。変えるなら、先に資料の注目箇所を示す、比較する出来事を二つに絞るなど、同じ目標へ届く足場を調整します。
報酬量も慎重に扱います。点数を増やして継続率が上がっても、理解が進んだとは限りません。DuolingoとKahoot!の設計とゲーミフィケーション効果量の読み方は、参加を促す仕組みと学習成果を分けて考える材料になります。歴史題材の評価なら歴史ゲームの教育効果も参照してください。
評価は平均値と取りこぼしの両方を見る
A/Bテストでは、平均事後得点だけでなく、開始時の知識が低い層、読む速度が遅い層、特定の誤りを持つ層で結果を分けます。適応ロジックが平均を上げても、一部のプレイヤーを低い難度へ固定していないか確認するためです。
最低限、事前・事後の学習テスト、ゲーム内の技能推定、離脱、主観的な負担を別の列で持ちます。適応が発動した回数そのものは成功指標ではありません。発動後に同じ技能の別問題を解けたかが判断材料です。
よくある質問
目標正答率は何%がよいですか?
全ゲーム共通の値はありません。想起、概念理解、速度訓練では望ましい負荷が違います。まず学習目標を決め、正答率にヒント利用と転移課題を加えて、対象者の試遊データから範囲を調整します。
プレイヤーに難易度変更を知らせるべきですか?
少なくとも、支援や課題が変わる可能性は説明したほうがよいでしょう。教師や開発者には発動理由を記録し、プレイヤーには手動選択ややり直しを残すと、誤判定で行き止まりになるのを避けられます。
少人数のゲームでも適応型にできますか?
できます。大規模な予測モデルより、技能ごとの問題表と説明可能な条件分岐が向いています。最初は一つの章、一つの難易度軸に限定し、ログと外部小テストが一致するか確かめます。
結論
学習ゲームの難易度調整で先に作るべきものは、賢そうな自動化ではなく、学習目標と観察可能な証拠の対応表です。正答率、時間、ヒント、誤り方、再挑戦を組み合わせ、変える軸を限定する。動機づけと学習成果も別々に測る。この土台があれば、適応は「簡単にして遊ばせ続ける機能」ではなく、同じ目標へ届く足場として検証できます。
参考資料
- Sandra Sampayo-Vargas, Chris J. Cope, Zhen He, and Graeme J. Byrne, The effectiveness of adaptive difficulty adjustments on students' motivation and learning in an educational computer game, Computers & Education, 2013.
- Valerie Shute et al., Maximizing learning without sacrificing the fun: Stealth assessment, adaptivity and learning supports in educational games, Journal of Computer Assisted Learning, 2021.


