ステルスアセスメントは、プレイログを集めるだけの仕組みではありません。「測りたい能力」「その能力が現れる行動」「行動を引き出す課題」を先に対応づけ、ゲームを止めずに能力の状態を推定する評価設計です。ゲーム外テストとの照合が必要で、収集データは目的に必要な最小限へ絞ります。
ステルスアセスメントが測るもの
ShuteとVenturaは2013年のMIT Pressの書籍で、デジタルゲーム内へパフォーマンス評価を埋め込む方法を整理しました。プレイヤーは通常の課題を解き、システムは選択や試行の系列から、物理理解、粘り強さ、創造性などの状態を推定します。
代表例のNewton's Playgroundでは、プレイヤーが斜面、振り子、ばね板などを描き、ボールを目標へ運びます。Shute、Ventura、Kimによる2013年の研究には8・9年生167人が参加し、約1.5週間で計4時間ほどプレイしました。物理テストの事前・事後得点は有意に向上し、ゲーム内指標と学習にも有意な関係が報告されました。
ただし、「関係があった」だけで、どのログでも評価に使えるわけではありません。2021年のPhysics Playground研究では、9年生から11年生の263人を含む実験で、ステルスアセスメントによる物理理解の推定値が外部の物理テスト得点と有意に相関しました。
以下の実装案は、これらの研究で使われた考え方を一般的な学習ゲームへ移すための推論です。個々のログ項目が、そのまま別の教科でも有効だと確認されたわけではありません。
能力・証拠・課題を一本につなぐ
先にログ仕様を決めると、「取れるデータ」から能力を後付けしがちです。順番を逆にします。
- 能力モデルを作る。学習目標を、観察したい下位技能へ分けます。
- 証拠モデルを作る。どの行動が、どの技能をどの程度支持・反証するか仮説を置きます。
- 課題モデルを作る。その行動が自然に出るステージや選択肢を設計します。
- イベントを記録する。課題ID、試行、選択、時間、ヒント、結果、設計バージョンを残します。
- 外部テストと照合する。内容を合わせた小テストや説明課題と、推定値の関係を確認します。
| 測りたい能力 | 引き出す課題 | 観察するログ | 別の説明 |
|---|---|---|---|
| 因果関係を組み立てる | 出来事カードを原因から結果へ接続する | 接続順、修正、根拠選択 | 文章の読み違い、総当たり |
| 複数資料を比較する | 記述の異なる史料から判断する | 閲覧順、引用箇所、選択変更 | 画面配置への慣れ |
| 方針を見直す | 初期案では解けない分岐を置く | 再試行までの時間、変更した要素 | 操作ミス、偶然の成功 |
| 知識を転用する | 表面設定だけを変えた問題を出す | 初見課題での方針と説明 | 問題パターンの暗記 |
たとえば「何度も挑戦した」を粘り強さの証拠にすると、操作が分からず困っている人まで高評価になります。ログは能力の直接測定ではなく、複数の解釈がありうる観察値です。ゲームルールが学問法則になるときで扱ったように、学ばせたい関係がルールに現れていなければ、プレイ履歴からもその理解は読めません。
ログ指標の妥当性を確かめる
課題やUIを変えればログの意味も変わるため、妥当性は更新後も確かめます。少なくとも次の確認を行います。
- 内容の対応を確認する。専門家が、課題とログが目標技能を十分に扱っているかを見る。
- 外部基準と照合する。ゲームを使わない小テスト、説明問題、転移課題と推定値を比べる。
- 代替説明を調べる。端末操作、読解速度、ゲーム経験だけで値が高くならないかを見る。
- 集団ごとの差を調べる。学年、利用端末、支援利用などで誤差の傾向が変わらないか確認する。
- 更新後に再検証する。ステージ、ヒント、得点ルールを変えたら対応表とモデルも見直す。
外部テストとの相関があっても、個人への重要な判断を自動化できるとは限りません。対象範囲と誤差を示し、推定値には観察数を添えます。教師には一点の数値だけでなく、根拠になった課題と反例も示します。
プレイログと学習効果の読み分けは歴史ゲームを教材にする前ににも通じます。制作側が検証過程を残す理由は開発ログを公開する方法論で説明しています。
プライバシーは計測設計の最初に入れる
後から匿名化すれば十分、とは限りません。時刻、自由記述、端末情報を組み合わせると、名前がなくても個人を絞り込める場合があります。不要なデータは最初から取りません。個人情報保護委員会の個人情報保護法ガイドライン(通則編)は、利用目的を具体的に特定し、その達成に必要な範囲で正確性と最新性を保ち、不要になった個人データは遅滞なく消去するよう努めること、安全管理措置を講じることを示しています。
実装前に、次をデータ仕様へ書き込みます。
- 利用目的を技能推定、改善、研究などに分ける。
- 目的ごとに必要なイベントと保持期間を決める。
- 表示名やメールアドレスから分離した識別子を使う。
- 自由記述、チャット、画面録画は必要性を個別に審査する。
- 誰が個票を見られるか、削除や訂正の問い合わせをどう受け付けるか決める。
- 研究利用や第三者提供は、適用法令と学校・設置者の規程を確認し、別の説明や同意が必要かを判断する。
具体的な同意方法や保護者対応は、利用地域、年齢、学校の設置者と規程で変わります。ここで示すのは法的判断ではなく、データ最小化のための設計基準です。実装時は適用法令と学校側の規程を個別に確認してください。授業導入時の説明や代替手段については授業で歴史ゲームを使うにはも参考になります。
小さく試すための実装チェック
初期版は一つの能力と数ステージに絞り、行動と解釈をレビューできる規模にします。
- 同じ能力を、形式の異なる複数課題で観察できるか
- 一つのログに頼らず、複数の証拠を組み合わせているか
- 総当たりや攻略暗記で高得点にならないか
- 外部テストの内容が、ゲーム課題と近すぎず遠すぎないか
- 低い推定値が、支援や再挑戦につながる設計か
- 生ログ、集計値、推定値でアクセス権と保持期間を分けたか
評価がプレイヤーを罰するだけなら、隠れていることが不信感につながります。何を測るかを説明し、誤推定に異議を出せる余地を残す。その上でテストの中断感を減らすのが、ステルスアセスメントの使いどころです。
よくある質問
正答数を記録すればステルスアセスメントになりますか?
それだけでは足りません。正答がどの能力の証拠になるかを定義し、その証拠を引き出す課題を設計し、別形式のテストと照合する必要があります。正答数は観察値の一つです。
AIでログを分析すれば精度は上がりますか?
自動的には上がりません。学習目標と証拠の対応が曖昧なら、複雑なモデルも曖昧な値を高精度に再現するだけです。説明可能な規則を基準にし、未使用データでの検証と誤差分析を先に行います。
プレイヤーには評価していると知らせないのですか?
プレイを中断するテストを目立たせないことと、データ利用を隠すことは別です。収集項目、目的、閲覧者、保持期間を理解できる形で知らせ、必要に応じて同意や代替手段を用意します。
結論
プレイログで学びを測るには、ログ量より証拠の筋道が要ります。能力から証拠、証拠から課題へ落とし、外部テストで推定の妥当性を確認する。別の説明や集団差を調べ、更新後も検証し直す。さらに、必要なデータだけを集め、利用目的と保持期間を明らかにする。この順番なら、ステルスアセスメントを「見えない採点」ではなく、遊びを止めずに支援へつなぐ評価として扱えます。推定値を実際の支援へ返す方法は、学習目標を崩さない難易度調整で整理しています。
参考資料
- Valerie J. Shute and Matthew Ventura, Stealth Assessment: Measuring and Supporting Learning in Video Games, MIT Press, 2013.
- Valerie J. Shute, Matthew Ventura, and Yoon Jeon Kim, Assessment and Learning of Qualitative Physics in Newton's Playground, The Journal of Educational Research, 2013.
- Valerie Shute et al., Maximizing learning without sacrificing the fun: Stealth assessment, adaptivity and learning supports in educational games, Journal of Computer Assisted Learning, 2021.
- 個人情報保護委員会, 個人情報の保護に関する法律についてのガイドライン(通則編).


