在心理健康支持中,大型语言模型(LLMs)正日益被广泛应用,因此需要可靠的安全性、同理心和治疗适宜性评估。然而,现有的心理健康基准由于评估设计和指标定义的不一致,难以实现可重复性和可比较性。为此,我们提出了 CARE-MH,一个用于心理健康 LLM 评估的统一框架。
通过使用 CARE-MH,我们重现并分析了最先进的基准,结果显示可重复性在很大程度上依赖于模型的稳定性,而跨基准的不一致主要源于指标定义的差异。这些发现强调了未来心理健康 LLM 基准需要标准化评估配置和共享指标定义的必要性。
博主点评: CARE-MH 提供了一种有力的解决方案,针对心理健康 LLM 的评估问题,强调了标准化的重要性。随着 LLM 在心理健康领域的应用日益增多,建立一致的评估标准将是确保其有效性和安全性的关键。