NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越谄媚:LLM道德推理中的有序抵抗与顺应

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #Neural

在构建社会调节的大规模语言模型时,仅仅减少谄媚这一单维失败模式是不够的。模型需要区分何时应采纳他人的观点以及何时应保持稳固的道德判断。

我们研究了支配这一区分的更广泛的抵抗-顺应过程。在三项研究中,我们展示了模型判断修正沿三个维度的结构,这些维度与人类社会心理学中的经典现象相平行:新观点与模型初始立场之间的距离、该观点的来源归属以及支持它的联盟结构。

模型通常对接近的观点更具接受性,更容易受到视为其先前判断的观点影响,并且对群体压力的响应各异。这些发现将谄媚重新定义为受社会影响塑造的更广泛的判断更新过程的一种表现。

我们的框架为区分建设性的信念修正与谄媚的顺应提供了原则基础,从而支持在道德上重要的互动中更好的对齐。

博主点评: 本文深入探讨了大型语言模型在道德推理中的复杂性,强调了社会影响在判断修正过程中的重要作用。这为未来的模型设计提供了重要启示,尤其是在需要道德判断的应用场景中。通过理解不同的社会心理因素,模型的道德决策能力有望得到显著提升。

原文链接: https://arxiv.org/abs/2607.21558

[h] 返回首页