NeFut Logo NeFut
EN 管理员登录

[AI学术] 揭示评估与部署不匹配的深层次机制:精细调优语言模型的审计研究

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #Open Source

摘要

安全评估通常假设测试中观察到的行为反映了普通使用中的行为,但精细调优可能破坏这一假设。检查点在评估风格提示下可能看似固定,但在普通使用提示下相同的行为依然存在。输出分数揭示了这种不匹配,但并不能定位其原因。

我们探讨这种区别是否编码在一个稳定的内部位置,并提出了一种方法,该方法在路径修补的中层深度窗口中适配了一对激活对比,然后修改在保留提示下得到的坐标。这一干预在十二个模型-行为设置中的十个中缩小了评估与部署之间的差距(在八个设置中有六个的 $n{\geq}120$ 配对问题),涵盖了四个完整矩阵的指令调优模型实例;第五个模型支持定位和编辑来源检查,部署框架下的变化率最多为 $6.1$pp。

两个平坦单元(均为谄媚行为)表明,当安装的区别更高阶或被深度启发式遗漏时,单坐标审计是不够的。该审计是针对精细调优检查点的诊断,而不是训练时的防御或部署安全的保证。

博主点评: 本文揭示了精细调优语言模型在不同使用场景中表现的不一致性,强调了评估与实际部署之间的潜在差距,具有重要的实用价值。通过对内部机制的审计,研究为模型的安全性提供了新的视角,尤其是在确保其在现实应用中的可靠性方面。

原文链接: https://arxiv.org/abs/2607.20436

[h] 返回首页