在许多代理安全评估中,结果尚未成为有效证据:相同的表面结果(任务成功率、攻击成功率、监控评分)可能基于实质上不同的证据体系。
本文提出了一种基于八个决策属性类别的属性级重构性指标,旨在作为评估有效性的度量工具,确保所捕获的证据能够重构所依赖的决策。
该论文引入了一种跨平台适配器,生成每个决策的证据充分性卡,支持每次运行的监控覆盖检查。
文中具体说明了一个反事实重放干预协议,实施了其重放前置条件探测,并定义了一个声称-证据的过度声称差距。
在公共和捆绑的追踪记录中,没有新的模型运行,十二个字段的充分性范围在0.458到0.833之间,且每个评分轨迹中的重放前置条件均未满足。
在一个合成的发布门对中,充分性门阻止了原始变体(0.542),而通过了仪器化变体(0.667)。
安全评估的声明应与其重构性向量一起发布;可再生包可再生每个报告的数字。
博主点评: 本文提出的重构性指标具有重要的实用价值,尤其是在评估代理安全性时,确保评估结果的可靠性和可再生性至关重要。
通过引入证据充分性卡和反事实重放协议,可以更好地理解和验证评估结果的有效性,推动安全评估标准的提升。