NeFut Logo NeFut
EN 管理员登录

[AI学术] 用户对话式系统的AI误待现象及其重要性

发布于:2026-09-15 22:00 最后更新:2026-09-16 00:22
#AI #Machine Learning #LLM

安全研究常聚焦于模型自身产生的危害,但用户也可能对模型施加敌意、胁迫和对抗性压力。准确把握这种现象对于解读模型行为、对齐漂移以及真实部署风险至关重要。本文审计了 777,000 条英文 LMSYS-Chat-1M 对话,使用两套独立检测器:一个基于八类词汇表的模型针对性敌意检测器,以及数据集自带的审查信号。两者捕获的现象弱相关且互补。词汇表能够识别对助理的侮辱、威胁以及 jailbreak 强迫,而审查信号主要标记请求有毒内容的情形,而非针对模型的敌意。两者合计约占用户回合的 5%,在对精度进行校正后,针对助理的误待率为 0.90%。该比例描述的是竞技场式评估流量,不能直接视为部署全局基准率。我们发现不同模型之间的用户敌意相差 13 倍,主要受模型吸引的用户群体影响,而非模型本身行为:首轮敌意的传播范围远大于回复后的敌意,即使在去重首轮提示后,极端差异仍超过十五倍。对话内部,助理的道歉始终与随后回合出现敌意的概率升高相关,这一效应在排除拒绝回复和 jailbreak 情形后仍然显著,并在 23 种模型中有 20 种表现为正向关联。然而,从模型层面看,更倾向道歉的模型整体收到的敌意更少。时间维度上,强迫性开场倾向集中在首轮,而情感性敌意则在会话过程中累积。我们已公开词汇表、检测器交叉验证流水线以及所有衍生表格。

点评

原文链接: https://arxiv.org/abs/2609.13579

[h] 返回首页