摘要
生成高质量的对抗文本在低查询预算下仍然是一个挑战性问题,尤其是在硬标签场景中。现有大多数方法依赖贪心算法,逐个选择文本中的位置进行替换,再进行其他位置的替换。这种局部搜索方法可能会错过高质量对抗样本,且常常导致过高的查询成本。理想情况下,最佳对抗样本应考虑文本中所有位置的组合,但穷举搜索在计算上是不切实际的。
为了解决这个问题,我们提出了一种基于采样的方法,称为LBA,它通过整合先验和后验知识构建高质量对抗示例的近似分布,并利用该分布进行采样。随着采样过程的推进,后验知识会更新近似分布,从而引导更有效的采样。
在六种语言模型上进行的大量实验证明,LBA在所有评估指标上显著超越了现有的最先进基线。此外,基于LLM的评估表明,LBA生成的对抗文本在语义上更具保留性和可理解性。
博主点评: LBA方法通过结合先验与后验知识,有效降低了查询成本,并提升了对抗样本的质量,展示了在对抗攻击领域的创新思路。未来的研究可以进一步探索基于此方法的多样化对抗样本生成策略。