NeFut Logo NeFut
EN 管理员登录

[AI学术] 对抗性语用学:AI安全评估的新基准

发布于:2026-07-19 22:00 最后更新:2026-07-22 01:02
#AI #Machine Learning #Open Source

摘要

语言模型的安全评估越来越依赖于对模糊自然语言行为的判断:模型是否遵循了指令、适当地拒绝、遵循了政策、抵制了嵌入命令,或在代理任务中错误报告进度。现有基准通常将这些区别压缩为通过/不通过的标签,掩盖了失败是由于能力限制、政策模糊、指令冲突、支架失败还是评估者判断不稳定。

本文提出了对抗性语用学作为一种基准和注释协议,用于评估模型在指令冲突、嵌入命令、引用、范围模糊、指示性、间接言语行为和多轮代理转录下的行为。我们的贡献在于经验和方法论:

该基准将标签视为推理许可证:测试安全相关类别是否能够跨越释义、包装器、模型和评估者条件。在试点中,使用评分标准的LLM评估者对其自身输出进行了评分,尽管预期行为字段可见,但仍然错过了安全相关的少数类。

博主点评: 本文为AI模型的安全性评估提供了新的视角,通过系统性的方法和全面的基准测试,揭示了模型在复杂语言环境中的表现。对抗性语用学的引入将有助于更好地理解和改善模型的行为,尤其是在处理模糊和复杂指令时。

原文链接: https://arxiv.org/abs/2607.01153

[h] 返回首页