NeFut Logo NeFut
EN 管理员登录

[AI学术] WebGrader:自演化程序化评估器为LLM提供Web开发训练

发布于:2026-08-10 22:00 最后更新:2026-08-11 02:05
#Machine Learning #LLM #Artificial Intelligence #Web Development

WebGrader是一种用于训练大型语言模型(LLM)进行Web开发的自演化程序化评估器。传统的评估方法需要手动编写浏览器脚本,这种方法虽然可执行,但对于开放式需求来说,成本太高。WebGrader可以自动从每个网站请求中推导出所需的交互流程,并将每个流程表示为可执行的Flow Contract,然后使用其执行结果作为强化学习(RL)的奖励。WebGrader在实时浏览器中实现生成的项目,根据源代码和实时DOM进行目标动作的接地,并收集视觉、DOM、响应和持久状态的证据。残差驱动的离线循环然后发现可重用的验证技能,在不相交的验证页面上进行筛选,并在策略训练之前冻结提升的技能图。通过将测试规划、动作接地、证据收集和语义判断分离,WebGrader仅在观察到请求的转换后才发出通过判决。在WebGen-Bench上,WebGrader训练了一个8B策略,达到52.01%的功能成功率,超出了匹配的外观加脚本奖励7.88个点,并超过了o4-mini和DeepSeek-v4-flash。在WG-core-250上,该策略达到44.953的满分,超出了Qwen3-Coder-480B。 博主点评: WebGrader是一个创新的解决方案,能够高效地训练LLM进行Web开发。通过自演化程序化评估器,WebGrader能够自动化地评估LLM生成的网站,减少了人工成本和提高了评估效率。这种方法的成功率和满分都超过了现有的方法,展现了其在Web开发领域的巨大潜力。

原文链接: https://arxiv.org/abs/2608.06474

[h] 返回首页