NeFut Logo NeFut
EN 管理员登录

[AI学术] EvalSafetyGap:针对大语言模型评估与安全缺口的混合调查与概念框架

发布于:2026-07-19 22:00 最后更新:2026-07-22 01:02
#AI #Machine Learning #Open Source

摘要

大语言模型(LLM)评估与人工智能安全面临共同的测量问题:基准分数、奖励模型信号及报告的安全指标可能在改善,但它们所代表的潜在属性却难以验证。本文结合了一项混合调查——系统搜索与叙述性综合相结合,并单独追踪灰色证据,形成了一个概念框架和结构化的十模型审计。

综合研究涵盖了八个证据流:基准有效性、动态评估、LLM作为评判者的可靠性、安全评估、越狱/拒绝的鲁棒性、奖励黑客、机制可解释性,以及治理/审计能力,涵盖了2018-2026年间的评估安全测量工作。

我们提出了EvalSafetyGap作为一种组织假设,用于在优化压力下比较评估侧与对齐侧的代理失败,使用古德哈特法则以及我们在此发展出的两个构造——不稳定性分解和对齐三难困境,作为生成可测试比较的工具。审计显示,当能力、行为安全和治理被单独测量时,结论会发生变化。在这份样本中($n = 10$),能力与持续的对抗鲁棒性之间的关联在使用显示的表3输入时在统计上是不确定的(Pearson $r = +0.232$, $p = 0.520$),而显然的开放-封闭安全缺口是适度的,主要由治理和披露驱动,而非行为鲁棒性,并且对如何分类一个边界模型敏感;尝试预算结果依赖于协议。

由于公共证据使用异质协议,审计是诊断性的,而非生成排名。我们的贡献是提供共享的词汇和证据地图,以支持动态评估、透明的来源报告、多尝试安全测量和可审计的对齐实践。

博主点评: 本文通过整合多种证据流,为大语言模型的安全性评估提供了新的视角,强调了治理与行为鲁棒性之间的复杂关系。这种框架不仅有助于理解当前的评估机制,还为未来的研究指明了方向,尤其是在动态评估与透明报告方面的应用潜力。

原文链接: https://arxiv.org/abs/2606.30219

[h] 返回首页