对话式 AI 系统常出现幻觉、阿谀奉承、过度自信和人格化等安全风险,这些风险在日常使用中难以被用户察觉。我们提出 Safety Nudges,一种基于浏览器的轻量级工具,当聊天机器人出现可疑行为时会在对话中实时标记。\ \ 在为期两周、包含 45 名高频聊天机器人用户的现场研究中,我们收集了交互日志、问卷以及对各类 nudges 的反馈。结果显示,参与者普遍认为该工具有用、信息清晰且干扰最小,几乎所有用户的 AI 风险意识都有所提升。然而,仅有意识提升并未必然转化为显著的行为改变。\ \ 研究表明,面向用户的安全 nudges 能够补充模型层面的防护,帮助用户在具体情境中批判性地评估 AI 响应。设计时需关注 nudges 的相关性、校准度以及用户控制权,以实现对话式 AI 安全的有效干预。\ \ 点评:Safety Nudges 展示了用户侧干预的潜力,但要实现行为层面的改变仍需进一步探索 nudges 与用户决策过程的耦合机制。