现代编码代理通常通过最终生成正确补丁与否来评估,但补丁生成依赖于早期的上下文获取阶段:找到完成任务所需的仓库文件。我们引入了 Agent Retrieval Bench,这是一项针对上游检索问题的文件级基准。样本来自真实编码工作流程信号,并在冻结的基础提交仓库上进行评估,相关性由代理需要的下一步内容定义,而不是直接的查询文件语义相似性。该基准涵盖四个正向检索任务:code2test、comment2context、trace2code 和 edit2ripple;第五个子集使用自然证据支持的无金案例和反事实错误仓库控制来评估选择性检索。Agent Retrieval Bench 包含 427 个样本,跨越 25 个仓库:345 个正例、50 个自然无金例和 32 个反事实控制。语料库包括 308 个基础提交快照、392,000 个文件和 7.9 百万块。我们评估了词汇检索、RepoMap、开源嵌入、选择性弃权和记录的代理上下文选择。没有任何单一的检索家庭占主导地位:Qwen3-Embedding-4B 在正样本上具有最佳的加权 MRR,Qwen3-Embedding-8B 在 Recall@20 上表现最佳,而 RepoMap 在 8K 令牌的预算上下文收益中表现最佳,任务级赢家之间差异显著。通过反事实控制校准的选择性阈值并未改善自然无金案例上的选择性成功,揭示了校准差距。记录的轨迹在 27-35% 的样本中错过了每个金文件。控制种子干预的试点研究发现,基于检索的初始上下文相较于随机非金上下文能够产生更高的文件 F1,且后续探索更少,而金标准上下文仍显示出显著的提升空间。
博主点评: 该研究通过引入 Agent Retrieval Bench,明确了编码代理在上下文检索中的关键需求,揭示了现有方法在真实任务中的不足之处。尤其是对选择性检索的深入分析,为未来的研究提供了重要的方向,值得开发者关注与探索。