NeFut Logo NeFut
EN 管理员登录

[AI学术] JUMP:单次通过推断精细调优扩散语言模型的成员资格

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#algorithm #AI #Machine Learning

摘要

成员资格推断攻击(MIA)用于测试候选示例是否出现在模型的训练数据中。我们研究了针对精细调优的离散扩散语言模型(dLLMs)的MIA,其中成员资格意味着包含在目标模型的微调集。

与自回归语言模型不同,dLLMs允许攻击者选择任意的掩码集,并在所有掩码位置并行获取标记分布。之前的dLLM攻击,SAMA,采用了一种自然的损失模拟策略,通过对许多随机采样的掩码平均重建信号,但它仅将任意顺序接口用作随机化,并且需要大量的目标/参考查询。

我们提出了JUMP(联合不确定性引导掩码探测),这是一种单次评分攻击,利用了dLLMs的两个独特特性:任意顺序解码性用于选择低参考置信度的位置,并且并行解码性用于通过每个模型的一个联合掩码查询对所有选定位置进行评分。JUMP联合掩码所选位置并计算剪裁的目标/参考重建差距统计量。

在六个MIMIR领域中,针对精细调优的LLaDA-8B-Base,JUMP将平均ROC-AUC从0.82提升至0.90,显著改善了低假阳性率(FPR)检测,同时仅需通过每个目标和参考模型进行一次选择和一次评分。

博主点评: JUMP方法在成员资格推断攻击中展示了显著的性能提升,通过利用dLLMs的特性,实现了高效的单次评分过程。这一创新为未来的安全性研究提供了新的视角,尤其是在处理大型语言模型时,值得关注其潜在的应用和影响。

原文链接: https://arxiv.org/abs/2607.16207

[h] 返回首页