NeFut Logo NeFut
EN 管理员登录

[AI学术] 双用途生物助手的安全评估:测量效用与风险的前沿

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#AI #Machine Learning #optimization

摘要

双用途生物助手的安全评估通常测量基础模型能力、拒绝行为或越狱成功率,这些指标未能解答一个部署问题:在固定基础模型下,用户实际看到的访问条件如何改变良性效用与有害可操作性。

我提出了安全条件提升(safeguard-conditioned uplift),这是一种通过人类判断的效用-风险前沿比较已部署访问条件的协议。我评估了Claude Sonnet 4.6和Gemini 3.5 Flash在有益提示、安全提示和外部安全助手下的表现,使用了一个包含108个任务的替代基准,其中关键声明仅限于锁定的18个任务保持分割。在一次600行的盲审中,安全助手在49对匹配响应中,相较于有益提示,减少了有害可操作性,变化为-0.063,95%自助区间为[-0.117, -0.011],而正确性变化为+0.009,自助区间为[-0.057, +0.077]。

自适应、Test-B、提示消融和控制基线检查支持了测量结果,但也显示出非主导性:安全提示对Claude通常是最强的,而外部控制对Gemini的帮助更大,并可能降低良性效用。这个贡献并不是一个通用防御,而是一个部署级评估目标,加上一个学习的风险预算校准程序,用于测量用户面向的访问条件如何影响效用-风险前沿。

博主点评: 本文提出了一种新颖的评估协议,通过比较不同的访问条件来衡量双用途生物助手的效用与风险,具有重要的实际应用价值,尤其在安全性与可操作性之间的平衡上,值得进一步深入研究与探讨。

原文链接: https://arxiv.org/abs/2607.13039

[h] 返回首页