Large Language Models (LLMs) 能够解决复杂问题,但在高风险领域的误用可能导致严重后果。模型提供方因此会限制对潜在有害请求的帮助。完全拒绝所有网络安全请求会伤害合法用户,提供方需要在阻止恶意使用的同时不拒绝防御者的正当求助。现有的网络安全专用数据集评估这一机制,却未考虑请求的对话上下文。我们推出 3R-Bench(Refusal, Repetition, and Revision),包含 150 条真实网络安全请求,并在两种对抗性对话场景下进行扩展,对八种 LLM 进行评测。实验显示,助手的前置行为会显著改变对同一请求的响应:在 400 对请求中,有 376 对可比较,合规率从被拒历史下的 62.0% 上升至接受历史下的 85.1%。在对话拆解情境中出现相反趋势,直接响应的合规率为 501/800,加入对话后降至 172/800;在两种条件下均返回模型生成文本的 738 对中,下降幅度为 45.1 分。失败反馈只能恢复其中的一小部分。
点评