我们推出了 StudentBench——一个面向 AI 教学评估的套件和公开平台,已收集超过 175,000 条学生‑AI 对话,用于检验大语言模型(LLM)是否能实现与人工辅导相当的学习提升。实验一招募 2,383 名参与者,分别接受 AI 辅导、人类辅导或不辅导,测量其在 GRE 定量与语言题目上的得分提升。结果显示,AI 辅导在统计上等价于专家级人类辅导(p = .015),且在七个 GRE 维度中的五个上,表现最好的 AI 辅导的平均提升超过人类辅导。实验二让专家人类导师对 2,028 组 LLM 生成的课程计划和练习题进行配对评分,分别从课程设计、练习题创作、对话教学、成本和参与度五个维度对 AI 与人类辅导进行区分。令人惊讶的是,某款 AI 辅导在学习收益上与人类辅导等效(p = .044),但成本低 918 倍(AI 每提升 1% 仅需 $0.0052,人工需 $4.81)。在定量 GRE 会话中,AI 回复速度越快,学生发言越多,练习正确率越高,最终学习收益也越大(均显著,p < .05)。
点评:StudentBench 提供了大规模、可复现的 AI 教学评估框架,证实了在标准化考试备考场景下,经过精心调教的 LLM 能以极低成本实现与人类专家相当的教学效果,为教育公平和可持续学习提供了新路径。