NeFut Logo NeFut
EN 管理员登录

[AI学术] 可重复性并不等同于构念效度:LLM 对制度化沟通的测量

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#AI #Machine Learning #LLM

本研究检验了高注释可重复性是否必然意味着 LLM 推断的度量能够捕捉其目标构念。我们使用欧盟委员会《AI 法案》咨询的数据,将结构化问卷回答与同一利益相关者的自由文本提交进行配对。

LLM 对文本提交的标注表现出极高的可重复性,内部一致系数(intraclass correlation)为 $\text{ICC}=0.99$,但与问卷报告的名义构念的收敛度有限。

不同利益相关者群体的偏差呈系统性差异:商业协会在文本咨询中对 AI 风险的关注度高于问卷回答,偏差约为 $\Delta = +1.0$;而公共部门及若干非商业组织的偏差则较小或为负。

文本得分的空间分布显示出正的空间自相关,Moran's I 为 $\text{I}=0.347$($p=0.036$),表明相邻国家的利益相关者在 AI 安全立场上更为相似。

尽管存在偏差,问卷报告的风险关注仍与对可解释性的支持呈强正相关,且该关联在不同偏差水平下均保持稳健。

这些结果表明,LLM 注释的高可重复性可以与构念对应性差并存,强调在将 LLM 用作测量工具时,需要区分可重复性、构念效度以及沟通情境的变异性,并制定相应的验证程序。

点评:本研究提醒研究者在使用 LLM 进行文本测量时,不能仅凭可重复性判断度量有效性,必须加入跨情境的构念效度检验。

原文链接: https://arxiv.org/abs/2609.19866

[h] 返回首页