EduNLP:8分野・5タスクを扱うが、シナリオの多様性が狭く、汎用的な評価基準に依存 (Huang et al., 2024b) プログラミング教育:コード修正・エラー説明を評価 (Koutcheme et al., 2024a,b) 学術QA・語学学習:推論や文章平易化を扱うが、可読性・正確性を重視した固定的な形式が中心 (Rein et al., 2023; Team et al., 2025; Huang et al., 2024a) 全体として、単一科目・事実ベースQAなど狭いシナリオに偏重
Ghanem et al., 2022; Berman et al., 2024) 対話型指導・個別支援:プログラミング・数学などで段階的指導や個別フィードバッ ク (MacNeil et al., 2023; Wang et al., 2024c; Pardos and Bhandari, 2023; Markel et al., 2023) 自動評価:作文・数学解答の採点や診断的フィードバック (Cao et al., 2020; Yang et al., 2020; Jiang et al., 2024) ◦ ◦ • 選択肢ベースの評価形式も広く利用 (Rein et al., 2023) 評価指標は ROUGE・Accuracyなど表層的な指標が中心 (Shi et al., 2025) 教室・試験中心のシナリオに偏り、より広範な教育プロセスを十分にモデル化して いない (Zhu et al., 2025)