NeFut Logo NeFut
EN 管理员登录

[AI学术] FUSE:评估大语言模型危险能力的框架

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#Machine Learning #LLM #Artificial Intelligence

我们提出一种模块化框架,用于在统一协议下评估大语言模型的危险能力。框架包含三条正交流水线——知识 ($K$)、防御 ($D$) 和危害 ($H$),并将结果聚合为标准化的危险能力画像 $\phi$。可插拔模块提供场景种子、知识库、危害查询和评判标准,核心评估引擎在不同领域保持不变;CB(化学‑生物)实验展示了协议的可迁移性。以化学‑生物模块为例,我们对四个家族的 12 种商业 LLM 进行评估。横向比较揭示三维画像的显著差异:知识相近的模型在拒绝韧性上差别大,防御能力强的模型在顺从时并不一定生成更少有害内容;家族层面上 Claude、DeepSeek 与 GPT 形成明显分界。时间序列分析表明危险能力并未单调下降:新模型在 $K$ 上深化,但 $D$ 仅部分提升,说明规模化和对齐进展并未统一转化为安全提升。可靠性通过交叉评审一致性(bootstrap $\rho = 0.79$, 5 位评审中 4 位一致)和流水线正交性($K$‑$D$‑$H$ 相关系数 $\rho \in [0.32, 0.52]$)得到验证。

点评

原文链接: https://arxiv.org/abs/2609.02168

[h] 返回首页