评估器常常在推理错误的情况下给出正确标签,这对需要依据评估结果做决策的智能体系统是致命风险。传统评估只检查最终标签是否正确,却忽视判断变化是否基于有效证据、遵循一致规则或正确适用规则。我们将评估器的推理责任归结为三个核心来源:依据(grounds)、规范(norms)和权威(authority)。通过对这三类来源的不同组合,可构成一个八格的反事实判断立方体,用以刻画判断更新的不同情形。
判断凭证(judgment receipts)被定义为能够最小化替换来源集合,使得修正后的判决得以复现,从而解释判断转变的因果路径。我们推导了黑箱评估器的认证成本上界,并推出了 ReasonBench——一个覆盖 19,520 条案例和 7,200 条对照的政策与逻辑推理基准,所有案例均配有可验证的凭证。
在冻结评估环境下,Qwen3-1.7B 的凭证准确率达到 98.41%,而立方体预测得分为 96.99%,两者相差 1.42 分,这一差距在 Qwen3-0.6B 的复现实验中得到验证。标准准确率的高表现掩盖了严重的鲁棒性缺陷。保持语义不变的来源置换将有效凭证恢复率降至 54.8%(直接预测)和 49.2%(立方体预测)。
仅在单一来源变化上进行训练的模型仍能保持 93.75% 的判决准确率,但在面对多来源复杂更新时,仅能恢复 7.16% 的凭证。通过置换重训练提升了一致性至 96.6%,却进一步削弱了立方体预测能力。结构化的反事实监督并不能保证推理的稳健性。我们主张,面向推理的评估必须将预测与认证解耦,除了报告标准准确率外,还应报告转换一致性,以实现可信的评估器审计。
博主点评:本文揭示了评估器表面正确背后的推理脆弱性,提出的凭证框架为审计提供了可操作的解释路径。实验显示,即使大模型在传统指标上表现优异,也可能在因果一致性上失分,提示未来评估体系需要兼顾结果与过程的双重保障。