NeFut Logo NeFut
EN 管理员登录

[AI学术] 开放式基准:从代理记录衡量认知过程

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

随着研究任务越来越开放——如从自行设计的实验中发现经验规律、改进未知最优的启发式或突破已有纪录——代理的执行日志记录了每一步操作,但仍然只用结果分数来评判。单一分数无法判断代理的主张是否来源于实验,也可能缺乏参考答案。我们提出 OEB(Open-Endedness Bench),一种与基准无关的方法,仅读取代理的执行记录,从不依赖参考答案或分数。OEB 将记录编译成统一的认知事件图,图的边连接代理陈述的命题与用于检验这些命题的动作;每个节点携带代码可在记录中精确匹配的摘录。评分原则是:文本可以提出命题,但只有实际执行动作返回的证据才能支持或驳斥它,OEB 检查代理的书面内容与实际运行是否一致。基于图结构,OEB 在四个能力轴上打分——证据、实验、修正以及防止奖励作弊——主要以代理在合理研究机会中的实际采纳比例计量,并描绘六个主观人格特质以刻画其研究习惯。我们在三个基准(LLM 后训练、芯片设计、训练速度纪录)上的 12 项任务中评估了 119 次运行。结果显示,代理声称的改进只有 16%‑29% 真实;在 10 项任务中,最佳运行在后半段尝试的新想法数量超过最差运行;人格特质模型对每个特质的解释方差中位数为 43%,显著高于任务本身的 7%。

点评

原文链接: https://arxiv.org/abs/2610.02588

[h] 返回首页