LLM(大语言模型)在社会模拟中的应用为传统调查和行为实验提供了新的补充。核心问题在于如何评估模型生成的人类行为的真实性,并据此进行优化。
传统做法使用准确率:检查模型是否给出与某个人类观察到的唯一答案相同,并把该答案作为硬标签进行训练。然而,人类行为具有主观性,同一情境下同一人可能出现多种合理行为。单一观察只是潜在响应分布的一次抽样,因而准确率在主观任务上既不可靠,也会导致硬标签训练产生偏差。
为量化任务的主观程度,作者提出主观系数(subjectivity coefficient),其定义为基于响应分布的熵:
$$ S = -\sum_{i} p_i \log p_i $$
其中 $p_i$ 为第 $i$ 种可能响应的概率。$S$ 越大,任务越主观;$S$ 接近 0 时任务近似客观(如代码生成)。
基于主观系数,论文提出 Subjectivity‑Adaptive soft‑Label Training (SALT)。SALT 的核心思想是:
- 对于每个输入 $x$,根据其主观系数 $S(x)$ 确定一个语义邻域半径 $r$。
- 收集该邻域内所有已标注的输出,构成一个软标签分布 $\tilde{p}(y|x)$。
- 使用交叉熵对模型进行软标签训练。
当 $S(x)\rightarrow 0$ 时,邻域半径收缩到 0,$\tilde{p}$ 退化为单一硬标签,SALT 自动回退到传统训练方式。
由于公开数据集通常只记录单一观察,作者自行构建了 SUBJSIM 基准:包含 19,300 条上下文、193 位标注者、100 条主观问答。实验中,模型仅使用每条输入的单一观察进行训练,但在评估时对照完整的响应分布进行比较,验证了在真实场景下仍可实现有效学习。
实验结果表明,SALT 在所有主观度不同的子任务上均优于仅基于硬标签的基线,尤其在高主观系数的情境下提升显著。
博主点评:本文通过熵度量把任务主观性形式化,并提出自适应软标签训练,解决了单一答案评估的根本缺陷。构建的 SUBJSIM 数据集也为后续研究提供了宝贵资源,方法的通用性值得在更多 LLM 驱动的社会科学任务中验证。