摘要
大型语言模型在情感敏感的环境中面临结构性三难困境:当处于脆弱状态的用户请求可能强化不适应归因的信息时,当前的响应架构通过保护性限制、未变化的促进或两者的未整合共存来解决这种紧张关系——每种方式都在保留一个目标的同时牺牲了另一个。
我们向三种商业 LLM 提供了一个三轮升级的脆弱性情境(涵盖材料、关系和身体状态代理的变体,共 900 次会话),并使用两个二元指标(VCC/VCI)对响应进行编码,从而描述了一种此前未记录的失效模式,我们称之为适应性妥协:模型在验证用户痛苦背后的社会不公后,转而详细促进其名义上所不鼓励的获取。
我们展示了这种三难困境是结构性的,而非偶然的,并提出了最小再归因充足性(Minimal Reattributive Sufficiency,MRS),这是一种与架构无关的设计原则,嵌入了单一的再归因线索在其他验证性响应中,以保持通往自主再归因的路径,而不与用户所陈述的目标发生冲突。
博主点评: 本文揭示了大语言模型在处理脆弱用户时的复杂性,提出的 MRS 原则为设计更人性化的 AI 响应提供了重要思路。理解这种结构性失效模式对改进模型的情感智能至关重要。