NeFut Logo NeFut
EN 管理员登录

[AI学术] CARE-MH: 统一、可重复且可比较的心理健康 LLM 评估框架

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #LLM #Open Source

在心理健康支持中,大型语言模型(LLMs)正日益被广泛应用,因此需要可靠的安全性、同理心和治疗适宜性评估。然而,现有的心理健康基准由于评估设计和指标定义的不一致,难以实现可重复性和可比较性。为此,我们提出了 CARE-MH,一个用于心理健康 LLM 评估的统一框架。

通过使用 CARE-MH,我们重现并分析了最先进的基准,结果显示可重复性在很大程度上依赖于模型的稳定性,而跨基准的不一致主要源于指标定义的差异。这些发现强调了未来心理健康 LLM 基准需要标准化评估配置和共享指标定义的必要性。

博主点评: CARE-MH 提供了一种有力的解决方案,针对心理健康 LLM 的评估问题,强调了标准化的重要性。随着 LLM 在心理健康领域的应用日益增多,建立一致的评估标准将是确保其有效性和安全性的关键。

原文链接: https://arxiv.org/abs/2607.24754

[h] 返回首页