摘要
沉思传统长期以来指导着道德行为和亲社会互动,最近的研究表明,沉思原则(如正念、同情与非对立思维)可能为对齐大型语言模型(LLMs)提供了一种有前景的范式,从而改善合作并减少LLM输出中的伦理违规。然而,随着新模型、评估指标和基准的快速出现,系统评估沉思原则如何增强LLM对齐的挑战依然存在,现有方法往往是临时的且缺乏普适性。
我们提出了一种模块化、可扩展的评估框架,最初针对心理健康领域,能够通过可重用的管道无缝集成新模型、指标和基准。该框架目前重现了现有的最先进结果,并通过灵活混合和匹配模型、指标和基准支持系统的交叉评估,促进公平比较和深入见解。其即插即用的提示模块为纳入沉思原则等伦理视角提供了有原则的路径,允许领域专家在不需要技术专长的情况下定义对齐标准。虽然最初专注于心理健康,该框架是领域无关的,自然扩展到决策、道德推理和人机协作等领域。
通过将计算评估与以人为本的伦理推理相结合,这项工作为跨认知科学、行为经济学、哲学和系统设计的跨学科研究奠定了基础,旨在构建稳健、可信赖且对社会有益的人机生态系统。
博主点评: 该框架的设计不仅展示了技术与伦理的结合潜力,还为未来人机协作的道德构建提供了新的思路。通过模块化的方式,研究者可以灵活适应不同领域的需求,从而推动跨学科的深入研究与应用。尤其是在心理健康等敏感领域,这一方法尤为重要。