NeFut Logo NeFut
EN 管理员登录

[AI学术] TPvG:从一次性到序列反馈的大语言模型道德决策框架

发布于:2026-09-02 22:00 最后更新:2026-09-03 02:56
#AI #Machine Learning #LLM

现有的 LLM 道德评估通常只给模型呈现孤立的道德情境,并让模型给出一次性决策,忽略了对人类道德行为影响巨大的因素——后果反馈。为此我们提出 TPvG(基于文本的痛苦‑收益),该框架改编自人类道德实验,将后果反馈嵌入“不伤害他人 vs 最大化自我收益”的日常道德困境中。TPvG 包含五个道德决策任务,任务难度从最小上下文的一次性选择逐步升级到带有明确后果反馈的序列决策。实验结果表明,LLM 的道德选择受决策形式(一次性 vs 序列)影响显著;显式的接受者反馈在不同模型间产生了不一致的效应。更重要的是,LLM 对显式反馈的响应模式与人类参考模式出现分歧,暗示其可能采用了不同的决策过程。这些发现提醒我们,需要在高风险交互场景中进一步检验 LLM 的道德行为是否保持稳定。

点评

原文链接: https://arxiv.org/abs/2608.28610

[h] 返回首页