NeFut Logo NeFut
EN 管理员登录

[AI学术] ClaimReceipt:验证代理评估中的证据充分性与覆盖性

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#algorithm #AI #Machine Learning

代理评估面临两类证据问题:报告的主张能否从保留的证据中重新计算(充分性),以及保留的记录是否覆盖了承诺的实验集合(覆盖性)。普通日志和哈希链式转录均无法可靠回答这两个问题。我们提出 ClaimReceipt,一种相对主张的收据规范和选择性验证器,它将类型化的事务证据绑定到签名的实验清单,并对每个主张返回 PASS、INVALID 或 INCONCLUSIVE。实现前我们冻结规范(SHA-256 18d109...b81)。在 1,392 条历史买卖记录上,CR-2 验证器复现了全部五条人工标记的审计判决,精确回放了 600 条确定性记录和 792 条生成后记录,使 13 个声明字段组在消融实验中均表现为非冗余,并在 11/11 的语义错误测试中得到预期结果,未出现误报。随后进行独立的 CR-3 轮次:在推理前提交 30 项任务,终端收据签名并链式关联,私有证据加密供审计员使用。完整证据实现覆盖和会计 PASS;缺失单个终端收据返回 INCONCLUSIVE_COVERAGE;全部私有打开缺失时仍保持覆盖和协议验证,但经济主张不可判定,恰好符合预注册预测。收据仪器化仅增加 0.021% 的模型推理时间和每笔交易 9.9 KB 的存储。规范可读性探测表明我们冻结的规范尚未对独立读者完全无歧义。因而,主张验证既需要证据的充分性,也需要一个已承诺的实验宇宙,以便让遗漏显现。

点评

原文链接: https://arxiv.org/abs/2609.01992

[h] 返回首页