NeFut Logo NeFut
EN 管理员登录

[AI学术] 面向欧盟 AI 法案实践准则的系统性风险证据开放管线与仪表盘

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#AI #LLM #Open Source

我们推出了 Systemic Risk Index,一个开放的评估管线和交互式仪表盘,旨在让 AI 安全的实证证据对公众更加透明、可追溯。该系统将 19 项公开基准划分为欧盟 GPAI 实践准则定义的四类系统性风险:CBRN(化学、生物、放射、核)、网络攻击、有害操纵以及失控风险。评估过程中使用了保留危害的扰动方法,并在模拟部署情境下对模型进行测试。

仪表盘支持在平均聚合和最坏情况聚合之间切换,用户可以调节模型能力对整体得分的影响,并追溯每一项风险评分对应的基准证据。对 18 种模型进行实验时,最坏情况聚合下的得分比平均聚合下降了 14 到 37 分,凸显了平均评估可能掩盖的风险信息。

LLM 评审者与人工评分者的吻合度达到 $\kappa = 0.78\text{--}0.82$,盲审结果显示 $83\%$ 的抽样变换能够保留原始危害。一次包含 21 名受访者的调查表明,大多数参与者认为得分易于理解,且仪表盘促使他们在不同设置下审视模型评估。

点评:该平台通过公开基准、可解释的聚合方式以及可追溯的风险来源,为 AI 系统的系统性风险评估提供了可复制、可审计的工具,对监管和公众监督具有重要价值。

原文链接: https://arxiv.org/abs/2609.28335

[h] 返回首页