NeFut Logo NeFut
EN 管理员登录

[AI学术] 重新思考基于大语言模型的社会模拟的评估与优化

发布于:2026-08-21 22:00 最后更新:2026-08-22 11:02
#AI #Machine Learning #LLM

LLM(大语言模型)在社会模拟中的应用为传统调查和行为实验提供了新的补充。核心问题在于如何评估模型生成的人类行为的真实性,并据此进行优化。

传统做法使用准确率:检查模型是否给出与某个人类观察到的唯一答案相同,并把该答案作为硬标签进行训练。然而,人类行为具有主观性,同一情境下同一人可能出现多种合理行为。单一观察只是潜在响应分布的一次抽样,因而准确率在主观任务上既不可靠,也会导致硬标签训练产生偏差。

为量化任务的主观程度,作者提出主观系数(subjectivity coefficient),其定义为基于响应分布的熵:

$$ S = -\sum_{i} p_i \log p_i $$

其中 $p_i$ 为第 $i$ 种可能响应的概率。$S$ 越大,任务越主观;$S$ 接近 0 时任务近似客观(如代码生成)。

基于主观系数,论文提出 Subjectivity‑Adaptive soft‑Label Training (SALT)。SALT 的核心思想是:

  1. 对于每个输入 $x$,根据其主观系数 $S(x)$ 确定一个语义邻域半径 $r$。
  2. 收集该邻域内所有已标注的输出,构成一个软标签分布 $\tilde{p}(y|x)$。
  3. 使用交叉熵对模型进行软标签训练。

当 $S(x)\rightarrow 0$ 时,邻域半径收缩到 0,$\tilde{p}$ 退化为单一硬标签,SALT 自动回退到传统训练方式。

由于公开数据集通常只记录单一观察,作者自行构建了 SUBJSIM 基准:包含 19,300 条上下文、193 位标注者、100 条主观问答。实验中,模型仅使用每条输入的单一观察进行训练,但在评估时对照完整的响应分布进行比较,验证了在真实场景下仍可实现有效学习。

实验结果表明,SALT 在所有主观度不同的子任务上均优于仅基于硬标签的基线,尤其在高主观系数的情境下提升显著。

博主点评:本文通过熵度量把任务主观性形式化,并提出自适应软标签训练,解决了单一答案评估的根本缺陷。构建的 SUBJSIM 数据集也为后续研究提供了宝贵资源,方法的通用性值得在更多 LLM 驱动的社会科学任务中验证。

原文链接: https://arxiv.org/abs/2608.19689

下一篇:没有了
[h] 返回首页