NeFut Logo NeFut
EN 管理员登录

[AI学术] 验证并行编码代理的协作:NP-Bench 与调度规划器

发布于:2026-10-07 22:00 最后更新:2026-10-08 01:25
#AI #Machine Learning #LLM

一支由多个代码生成模型组成的团队在单独评估时可能表现良好,但整体合并后却常出现错误。每个代理只通过自己的测试,而合并后的代码库会出现冲突:两个代理同时改写同一函数,一个代理依据刚被同伴修改的接口编写代码,导致集成失败。传统的协作工具往往是事后检测冲突并发出警告,但在代理高速编辑的场景下,警告往往已经为时已晚。

我们将该问题重新表述为调度任务:先读取每个工作项声明的作用域,将工作划分为互不重叠的子域,并依据生产者‑消费者图提前确定合并顺序。基于此思路,我们在 Nerveplane 中实现了调度规划器,并用 NP-Bench 进行评估。NP-Bench 是一个面向真实 Git 合并的三臂基准,分别对应“无协作”“被动检测”“主动规划”。评估在确定性仿真和真实代理运行两种环境下进行。

实验结果显示,规划器将干净集成率从 1/9 提升至 9/9,并将合并冲突数从 13 降至 0,且随代理数量增加优势愈发明显。在一次破坏性接口变更的真实实验中,规划器使得前沿模型的干净集成率从 0 提升至 1.0,小模型提升至 0.6,且代理严格遵守分配的作用域(泄漏 0/5)。跨会话记忆进一步将重复错误率从 1.00 降至 0.00,适用于强弱模型。

我们还报告了一个负面结果:将事实信息路由给代理并不能在窗口适配尺度上提升长上下文准确性;其价值体现在成本与容量,而非注意力机制。该收益在不同能力层级和不同供应商的模型间保持稳定,因为收益来源于工作分配方式,而非模型本身的推理能力。

点评

原文链接: https://arxiv.org/abs/2610.07261

[h] 返回首页