AI 研究代理正被广泛用于在程序、数学构造和证明空间中搜索。然而,现有系统往往只优化评估器的反馈,却缺乏对反馈的解释、挑战和复用的治理,导致脆弱的候选方案被误认为发现,基准提升、有限证书和定理级声明容易混淆。
EPOCH 提出了一套证据治理的发现循环,通过显式任务合约、类型化记忆、主动反驳、准入检查和独立回放,使每个候选方案都依据其支撑的主张的强度和范围进行评估。
在 AlgoTune 基准上,EPOCH 的平均归一化得分达到 0.65,显著超过最强基线的 0.53;在内部 Math14 套件上取得最高平均得分 0.57。官方测试回放显示其在未见数据上的表现同样优异,并在 AgentHPO 的描述性聚合指标上领先。
在十个发现任务中,EPOCH 实现了可执行构造、算法优化、反例生成以及支持证明的结果等多项任务特定提升,展示了将搜索转化为数学和计算领域具体进展的能力。
这些结果表明,证据治理是让 AI 研究代理不仅产生更强解答,还能提供更可信科学发现的必要步骤。
点评