NeFut Logo NeFut
EN 管理员登录

[AI学术] 陈述的推理步骤是否具有因果负载能力?

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

链式思考(CoT)监控默认模型写出的推理文本与直接产生答案的计算过程相一致。过去的忠实度度量大多是行为层面的:修改推理文本,观察答案是否改变。然而,我们的目标是从激活层面以因果方式衡量忠实度,尤其针对模型自行生成的推理。不同于以往只检测性能下降的因果审计,我们的干预带有明确的预测目标——每一次补丁都应把答案切换到一个可构造的反事实实体。实验使用合成的多跳查找任务(2‑6 跳),在模型陈述每一步中间的 token 区间,将该位置的残差流(residual stream)替换为来自一次反事实运行的对应激活。对 Qwen3‑4B 的测量显示,在最敏感的中层网络(mid‑network)上,76.9% ± 2.8% 的陈述步骤是因果负载的(随机位置基线 11.3%;对底层提示事实的补丁效果 83%,说明陈述步骤承担了约 96% 的可实现影响)。同一批次的标准行为测试得到 88.2%,比因果忠实度高出 11.4 个百分点(匹配项目;111:14 不一致对,p < 0.05)。

点评

原文链接: https://arxiv.org/abs/2609.27038

[h] 返回首页