NeFut Logo NeFut
EN 管理员登录

[AI学术] 当代理实现系统时:缺陷、检测与评估严谨性的案例研究

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#AI #Machine Learning #LLM

随着大语言模型(LLM)编码代理逐步承担端到端的工程任务,系统层面的需求——如模式设计、异步编排、配置正确性以及检索‑过滤权衡——缺乏实证描述。本文聚焦于一次完整的案例研究:让单一代理依据已有的详细规范实现一个多组件数据系统。存储技术、模式、实体消歧算法以及检索‑过滤策略在实验前已固定,代理的自主空间仅限于代码实现、缺陷诊断与修复以及交互设计的未定义部分。

在一次连续的工作会话中,我们记录了五类缺陷,分别依据违反的约束类型和检测手段进行归类。随后,在公开的 HotpotQA 基准上评估了该系统的唯一检索权衡:在排序前将候选集合限制为图结构识别出的实体集合,还是直接进行无过滤搜索。由于无法调用 LLM 完成实体识别阶段,我们用基准提供的金标准证据标签代替,并以召回率而非基准的准确率指标报告结果。

实验在检索预算 1~10、100 条问题、共 2994 段文本的语料库上进行。过滤后的召回率在预算为 3 时即达到上限,因为候选已被限制在金标准段落本身;而无过滤搜索即使在预算 10 时也只能恢复约 69% 的所需证据,且在所有预算下均保持显著差距(双侧符号检验 p < 0.0001)。

最后,我们讨论了代理自主完成的成功点与必须人工干预的环节,其中包括一次声称已提升性能的修复未在触发回归的测试上重新测量的案例。

点评

原文链接: https://arxiv.org/abs/2609.01985

[h] 返回首页