NeFut Logo NeFut
EN 管理员登录

[AI学术] 利用推理时共识机制缓解大语言模型微调中的潜在隐患

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #optimization

摘要

最近的研究表明,即便是对少量受污染数据的微调,也会导致语言模型出现目标性的不当行为,而表面上看似无害的数据可能会传递隐藏的偏好,并广泛泛化。标准防御措施如数据过滤、混入无害数据和正则化虽然可以减轻这些影响,但并不能完全消除它们。

我们提出通过冗余来增强鲁棒性:收集来自不同来源的多个数据集,仅学习它们之间的共同部分。因此,即使只有部分来源是恶意的,潜在的不当行为也会被阻止。

为了实施这种防御策略,我们对每个来源的数据集微调一个单独的参考模型,并在解码时聚合它们的下一个标记分布。

我们引入了两种共识解码器:一种是逐标记最小值解码器,它将每个标记的概率限制为所有来源中最低的概率;另一种是基于相对基础的变体,它在来源之间存在对立时恢复到基础概率。

我们进一步放宽了精确一致性,以容忍来源之间的部分支持以及相同意图的不同表述方式。

在控制的污染任务、潜隐学习和新兴的不对齐情况下,共识解码抑制了特定来源的不当行为,同时保留了共享的期望行为,包括那些在联合训练和权重平均中保留了不良行为的情况。

博主点评: 该研究提供了一种创新的方法来增强大语言模型的鲁棒性,尤其是在面对潜在恶意数据时。通过引入共识解码机制,研究者有效地减少了不当行为的影响,同时保留了模型的有益特性,为未来的模型安全性提供了新的思路。

原文链接: https://arxiv.org/abs/2607.23394

[h] 返回首页