NeFut Logo NeFut
EN 管理员登录

[AI学术] 评估预训练模型在新型 AI 辅助教育题目中的教学评估能力

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

AI 辅助生成教育材料的速度远超我们验证其教学质量的能力。使用 Bloom 分类器模型进行自动评估是一种可行的规模化方法,但在面对分布外(OOD)数据——如 AI 生成的新题目时,模型性能可能下降。为寻找在数据分布漂移下仍具鲁棒性的分类器,我们比较了传统机器学习、Transformer 和大语言模型(LLM)在 Bloom 层级分类任务上的表现。我们还尝试了若干特征工程策略:加入 NLP 度量、将学习目标作为输入的一部分以及对文本进行拼接,以期稳定 OOD 性能。基线实验显示,TF‑POS‑IDF 机器学习模型在 OOD 数据上的 Macro F1 为 0.48,显著低于 BERT(0.55)和 LLM(0.79)。文本拼接分别将机器学习模型和 BERT 的 Macro F1 提升至 0.59 和 0.62。将学习目标拼接到输入后,在特定数据集上进一步提升了模型表现。重新训练模型带来了跨模型、跨数据集的最大性能提升。总体而言,这些结果揭示了在新型 AI 辅助教育题目上使用预训练模型的权衡,并表明有针对性的特征增强能够缓解性能衰减。

点评

原文链接: https://arxiv.org/abs/2609.27749

[h] 返回首页