NeFut Logo NeFut
EN 管理员登录

[AI学术] 相同文本,不同数字:LLM 基于度量的分歧

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #LLM

研究者越来越多地使用生成式大语言模型(LLM)将公司文本转化为可量化变量。本文考察了这些基于 LLM 的文本度量在模型选择上的稳健性,使用了包括情感、管理清晰度、不确定性、答案具体性以及气候和政治风险在内的十三项指标。我们让七家不同供应商的 LLM 对标普 500 公司财报电话会议记录进行打分。跨模型的秩相关平均仅为 0.52,且各模型共同产生的记录层面差异只解释了总变异的 34%。跨模型分歧并未预测后续分析师或市场的分歧,说明大部分差异来源于模型自身而非信息本身的模糊性。模型选择对下游回归结果影响显著,系数的大小、符号和显著性在不同模型间差异明显。对多模型取平均可以提升大多数指标的排名稳定性,但分数水平仍对所选模型敏感。因此,LLM 生成的变量应视为依赖模型的测量,需要在不同提供商之间进行验证。

点评

原文链接: https://arxiv.org/abs/2609.31013

[h] 返回首页