AI 研究代理会结合已有知识、公开资源和实验反馈生成有价值的成果。发现认证协议(DCP)把这些成果的主张转化为可执行的恢复与反馈测试。\ \ Gate 1 检验在封闭评估上是否实现了有意义的改进。Gate 2 为匹配的代理提供注册时的起始信息和观察到的网页内容,同时隐藏目标研究的历史记录。每个达到数值目标的有效方法必须提交恢复见证并触发 Core 否决。DCP Core 要求有充分的控制、零观察到的恢复以及在一次全新注册回合中对恢复的有限样本界限。\ \ 可选的 Gate 3 评估真实反馈相对于共享检查点中指定的中性策略的平均效应。DCP Evidence 在独立的零校准和注册的效应边际后加入该效应。两项受控审计在 SQLite 优化和虚拟催化剂控制两种模型下完整执行协议。每项在 96 个回合中均未出现恢复,给出上限 0.0468。每对研究产生 30 次真实恢复且零次中性恢复,并通过 60 对零研究的检验。额外案例展示了 Core、恢复以及审计未完成的决策。一个确定性的、无 LLM 的验证器能够从冻结的证据中复现所有决定。DCP 为有用的结果、备选路径和反馈效应提供了统一的证据语言。\ \ 点评