NeFut Logo NeFut
EN 管理员登录

[AI学术] 生成AI心理健康支持的风险治理:多轮安全架构的突破

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #Open Source

摘要

大型语言模型(LLMs)在情感支持中越来越多地被使用,然而它们缺乏有效的机制来安全地管理不断演变的心理健康风险。现有的安全方法主要负责检测风险,但很少能影响模型在对话中如何应对这些风险的变化。为此,我们开发了一种模型无关的安全治理架构,结合了上下文风险检测、基于推理的验证和协议引导的响应生成,专为多轮心理健康互动设计。

我们使用基于现实世界心理健康叙事的合成对话来评估该架构的性能,测试对象包括GPT-5-chat和Qwen3.5-27B,结果显示高风险检测性能(特异性:0.85(95%CI: 0.78;0.91),敏感性:0.92(95%CI: 0.88;0.95)),并且在保留良好关系和连接的同时,临床医生偏好的升级响应增加了25.6至59.2个百分点。性能在对话长度上保持稳定,并且在专有和开源模型间普遍适用。这些发现表明,临床基础的安全治理不仅限于风险检测,还能改善LLMs应对不断变化的心理健康风险的能力,为模型的安全部署提供了可扩展的框架。

博主点评: 本文提出了一种创新的多轮安全架构,旨在提升生成AI在心理健康支持中的应用安全性。这种方法不仅注重风险检测,更关注如何有效应对风险变化,对于未来AI在心理健康领域的应用具有重要的指导意义。它的广泛适用性和高效性为相关研究提供了新的视角和思路。

原文链接: https://arxiv.org/abs/2607.22692

[h] 返回首页