摘要
本研究介绍了WrAFT,一个写作评估与反馈工具,能够为论证性论文提供准确可靠的评分和有效的综合反馈。WrAFT采用模块化设计,将自动写作评估(AWE)任务分为评分、表层反馈和深层反馈。
在构建系统的过程中,评估了多种大型语言模型(LLMs),包括LLaMA-3-70B-Instruct、GPT-4o和Claude 3.7,采用了直接提示和监督微调的方法。使用了一个包含480篇托福独立写作论文及其官方基准分数的专有数据集。
基于基准的评估显示,WrAFT在评分方面达到了最新的技术水平,具有0.84的二次加权卡帕(QWK)和0.44的均方根误差(RMSE),其官方评分范围为0-5。系统生成反馈的人类评估也显示出高认可率:表层反馈为96.14%,深层宏观反馈为93.03%,深层微观反馈为94.69%。该系统已经开发出一个互动用户界面,并公开免费使用。
博主点评: WrAFT的模块化设计有效地提升了写作评估的准确性和用户体验,尤其在使用多种语言模型的评估方法上显示出其创新性。结合人类评估的高认可度,WrAFT为教育领域提供了强有力的支持工具。