NeFut Logo NeFut
EN 管理员登录

[AI学术] 革命性的Copy-on-Write评分机制:应用特定代理评估新方法

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#algorithm #optimization #Open Source

在软件系统中,可信赖地部署基于大型语言模型(LLM)的代理需要评估它们在应用特定工作流中的表现,尤其是要足够细致以定位成功与失败的环节。然而,现有的代理评估机制存在局限性:基准测试在应用特定工作流和环境中构建效度较低,复刻评估环境的成本高且容易漂移。为此,我们提出了Copy-on-Write (CoW) 评分框架,该框架直接在应用环境中评估代理操作,使用PostgreSQL级别的Copy-on-Write机制来隔离代理的写入操作。

CoW评分生成会话和操作级别的评分,突出显示代理在特定应用环境中数据库写入操作的成功与失败,从而实现对代理工具和表面的低成本评估和迭代。我们在一个开源项目管理平台Plane上展示了这一框架,分析揭示了工具表面中的具体问题,并通过相应的修复实现了受影响模型的可测量改进。

Python库链接:https://github.com/trail-ml/agent-cow-python

博主点评: Copy-on-Write评分机制的提出无疑为LLM代理的评估提供了新的视角,通过精准定位代理操作的表现,使得应用特定的评估变得更为高效和经济。这一创新不仅可以降低评估成本,还能推动软件系统中代理的优化迭代,具有重要的实用价值。

原文链接: https://arxiv.org/abs/2607.14336

[h] 返回首页