在大型语言模型(LLMs)中,模型在不同运行中可能会对相同的决策问题给出不同的答案,甚至在其先前答案作为上下文时反转决策。我们探讨这种不稳定性是否可以被测量并在不改变模型权重的情况下部分减少。我们测试了认知内核模型(CKM),这是一种在提示级别的状态强制层。在决策之前,模型必须将输入分为三种认知角色:事实(可验证信息)、启发式(推断或假设)和情感(评估或优先信号)。CKM并不增加模型的能力,而是强制模型在采取行动之前跟踪所使用的信息类型。形式上,它维护一个结构化状态 $S_t = \\{F_t, H_t, E_t\\}$,通过转移函数进行更新。
我们在26个来自四个供应商的LLMs和37,403个观察样本上评估CKM,针对韩语决策场景(模糊性、伦理冲突、资源分配、错误处理)进行四项核心实验,包括四臂消融实验、五臂假限制消融实验和温度探测实验。研究结果显示:
- CKM减少了重复输出的变异性(随机效应Hedges' g=1.09, 95% CI [0.83, 1.35], 31对模型);
- 状态持久性使得新模型的决策反转率降低了82%(g=1.52);
- 该效果并非仅仅由于JSON格式化(仅值重计算,g=2.24);
- 固定锚状态下的内在随机性微不足道;
- 在采样随机性下,优势更为明显(在温度0.7时g=2.87);
- 假消融实验将约45%的增益归因于结构支架,55%归因于事实/启发式/情感内容,而CKM是唯一一个既提高一致性又减少反转的组。CKM并未改善推理的正确性。更窄的结论是:行为一致性是可测量的,在模型之间存在差异,并且通过强制模型在决策前区分事实、假设和评估信号,部分可改进。
博主点评: CKM的提出为解决大语言模型的一致性问题提供了新的思路,尤其是在多样化决策环境中。通过结构化的状态管理,模型能够更清晰地识别和处理信息,虽然CKM未提升推理准确性,但在一致性方面的显著改善,值得后续深入研究与应用。