NeFut Logo NeFut
EN 管理员登录

[AI学术] 解密编码代理中的支架效应:选择作为隐含变量的影响

发布于:2026-07-28 22:00 最后更新:2026-07-29 01:08
#algorithm #C++ #Open Source

摘要

公共编码代理排行榜通常通过模型名称和通过率来排名系统,而周围的支架(即发放工具、管理上下文和决定何时停止的机制)往往描述不足。当支架固定时,模型间比较是有效的;当其变化时,性能和效率会混淆模型和支架的效果。

我们在 Terminal-Bench Pro 的一个分层50任务子集上,评估了 Qwen 3.6 Plus 和 MiniMax M2.5 在三个开源支架(Goose、OpenCode、OpenHands-SDK)中的表现。支架选择导致每个解决任务所需的令牌数差异高达40倍,而同一模型内的通过率差异保持在0-8个百分点(95% 的配对任务自助置信区间包括零,除了最大的差距)。

失败指纹在模型间复制(Goose 的 REASON,OpenHands-SDK 的 VERIFY/MAX_TURNS,OpenCode 的 idle-loop/TIME),表明支架级别的偏见在很大程度上与模型无关。对于以人为中心的编码代理评估,仅凭模型名称是不够的比较单位:支架-模型对决定了实际成本、延迟和监督负担;无操作回合是每个任务的等待税,而不仅仅是令牌税。

因此,我们建议在令牌/延迟预算下,根据通过率选择支架-模型对,并在任何模型比较中报告令牌使用、延迟和完整的支架规范。我们发布了匿名配置、原始试验日志、汇总快照和分析脚本。

博主点评: 本文揭示了编码代理评估中的支架效应,强调了选择合适的支架-模型对的重要性。通过对不同支架的比较,研究者可以更全面地理解模型性能,避免因支架偏差而导致的误判。这为未来的编码代理设计提供了新的视角,值得关注与研究。

原文链接: https://arxiv.org/abs/2607.22585

[h] 返回首页