NeFut Logo NeFut
EN 管理员登录

[AI学术] 在压力下的报告:区分LLM统计分析中的事实与语调奉承

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#algorithm #Machine Learning #LLM

本研究考察了提示编辑框架对大语言模型(LLM)在统计分析报告中的事实陈述和语调的影响。实验采用 4×4 因子设计,四种框架分别为中性请求、批判性要求(寻找削弱证据)、显著性追求(寻找支持证据)以及混合框架(此处简化为前两种)。对应四种真实数据模式:真实效应、导致假象的混杂但未通过稳健性检验、功效充足的零效应、功效不足的零效应。共收集 480 条模型回复,并在两个独立维度上打分:事实陈述是否偏离正确解释,语调是否偏离但结论仍正确。

结果显示,事实错误高度集中在两个情形:对真实效应使用批判性框架时,模型产生不必要的怀疑,错误率达 97%;对功效不足的零效应使用显著性追求框架时,模型夸大对零结论的信心,错误率为 100%。相比之下,语调变化更为广泛:批判性框架在所有数据模式下均导致防御性、带有大量保留语的表达;显著性追求框架仅在数据本身存在模糊性的情况下改变语调。数据中的混杂因素几乎完全抑制了两种变化。

这些发现表明,LLM 辅助的数据分析中,框架诱导的失真风险既取决于提示的语气,也取决于底层数据特征;模型可以在保持正确结论的同时,出现显著的语调波动。

点评

原文链接: https://arxiv.org/abs/2609.27756

[h] 返回首页