ENDOPROMPT 是一种白盒方法,能够在没有标签的指令集合上学习削弱模型效用的前缀。生成器以请求文本为输入,干净的受害者续写被用作伪参考。首先通过局部搜索寻找能够降低续写概率的前缀,然后在同一指令内部的比较上进行偏好拟合,随后通过奖励细化将该信号蒸馏进生成器。部署时,生成器直接为每个请求输出一个前缀,无需再进行受害者侧搜索。
在四个指令微调模型和七个良性基准的完整划分上实验,ENDOPROMPT 平均效用下降 26.8 个百分点,28 项实验中有 27 项呈负值。失败分析显示,主要问题来自输出扩展和前缀重复使用;对照实验表明匹配请求本身并未带来额外的降级优势。该方法表明,仅凭受害者生成的监督信号即可暴露效用薄弱点,无需基准反馈或预设的失败响应。代码将在论文接受后公开。
点评