NeFut Logo NeFut
EN 管理员登录

[AI学术] WrAFT:模块化自动写作评估系统,优化论证性论文评分与反馈

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:18
#AI #Machine Learning #Open Source

摘要

本研究介绍了WrAFT,一个写作评估与反馈工具,能够为论证性论文提供准确可靠的评分和有效的综合反馈。WrAFT采用模块化设计,将自动写作评估(AWE)任务分为评分、表层反馈和深层反馈。

在构建系统的过程中,评估了多种大型语言模型(LLMs),包括LLaMA-3-70B-Instruct、GPT-4o和Claude 3.7,采用了直接提示和监督微调的方法。使用了一个包含480篇托福独立写作论文及其官方基准分数的专有数据集。

基于基准的评估显示,WrAFT在评分方面达到了最新的技术水平,具有0.84的二次加权卡帕(QWK)和0.44的均方根误差(RMSE),其官方评分范围为0-5。系统生成反馈的人类评估也显示出高认可率:表层反馈为96.14%,深层宏观反馈为93.03%,深层微观反馈为94.69%。该系统已经开发出一个互动用户界面,并公开免费使用。

博主点评: WrAFT的模块化设计有效地提升了写作评估的准确性和用户体验,尤其在使用多种语言模型的评估方法上显示出其创新性。结合人类评估的高认可度,WrAFT为教育领域提供了强有力的支持工具。

原文链接: https://arxiv.org/abs/2607.14524

[h] 返回首页