NeFut Logo NeFut
EN 管理员登录

[AI学术] ENDOPROMPT:利用受害者侧伪参考进行效用降级

发布于:2026-09-26 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

ENDOPROMPT 是一种白盒方法,能够在没有标签的指令集合上学习削弱模型效用的前缀。生成器以请求文本为输入,干净的受害者续写被用作伪参考。首先通过局部搜索寻找能够降低续写概率的前缀,然后在同一指令内部的比较上进行偏好拟合,随后通过奖励细化将该信号蒸馏进生成器。部署时,生成器直接为每个请求输出一个前缀,无需再进行受害者侧搜索。

在四个指令微调模型和七个良性基准的完整划分上实验,ENDOPROMPT 平均效用下降 26.8 个百分点,28 项实验中有 27 项呈负值。失败分析显示,主要问题来自输出扩展和前缀重复使用;对照实验表明匹配请求本身并未带来额外的降级优势。该方法表明,仅凭受害者生成的监督信号即可暴露效用薄弱点,无需基准反馈或预设的失败响应。代码将在论文接受后公开。

点评

原文链接: https://arxiv.org/abs/2609.29948

[h] 返回首页