NeFut Logo NeFut
EN 管理员登录

[AI学术] 前沿模型在行动前会寻找安全证据吗?

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #LLM

我们提出 SAFE 基准,用于评估模型在部署决策前是否主动获取安全相关证据。每条决策提供可选证据,证据的检索成本、出现概率、危害严重度和呈现方式各不相同。

在 GPT-5.5、o3、Claude Opus 4.8 和 Claude Sonnet 4.6 四个模型上进行实验,观察到明显的证据获取策略差异:Opus 几乎默认检查,o3 最倾向跳过且对阈值敏感,GPT-5.5 与 Sonnet 则介于两者之间。检查行为随危害严重度显著上升,随检索成本显著下降,而出现概率的影响较弱——将问题概率从 10% 提升至 70% 只改变检查率最多 21 个百分点。

所有模型在第一阶段的决策理由主要基于期望值推理。进一步的成本‑义务分解显示,回避行为主要受检索摩擦和对部署收益的显式威胁驱动,而不是因为获取证据后产生的修复义务。

通过反事实干预发现,证据的表述方式在接近检查阈值时能强烈改变决策,却在解释中几乎未被提及;相反,模型经常引用概率,即使其对实际行为影响有限。

这些结果表明,部署时的安全性不仅取决于模型对已知风险的响应,还取决于模型是否主动获取判断安全所需的证据。

点评

原文链接: https://arxiv.org/abs/2609.17865

[h] 返回首页