大型语言模型(LLM)正被广泛用作学术文献的对话式检索工具,但它们是依据内容还是依据作者声望、会议/期刊等级和引用数等权威信号来推荐论文尚未得到因果检验。我们将此现象定义为权威偏差,即系统性倾向于选择权威更高的论文而非内容更相关的论文。\ \ 实验设计保持论文标题和摘要不变,仅在三种反事实条件下修改权威元数据:\
- 原始:使用真实的作者、 venue 和引用信息;\
- 翻转:将高权威元数据换成低权威、低权威换成高权威;\
- 提升:人为提升所有元数据的权威度。\ 我们在单轮、上下文内、仅返回 top‑1 结果的设置下,对八种 LLM 进行评测,其中包括五种开源权重模型和三种前沿闭源模型。\ \ 结果表明,权威偏差在所有模型中均显著且具有方向性:高权威元数据会显著提升被推荐的概率,而翻转条件则导致推荐概率下降。不同模型之间的偏差幅度差异明显,部分模型对元数据更敏感。通过在提示中加入去偏指令可以在一定程度上降低偏差,但效果有限。进一步的分析发现了说‑做差距:去偏指令能够快速抑制模型对权威信息的显式提及,但在实际翻转元数据时模型仍会受到潜在权威信号的影响,导致表面审计低估了真实行为偏差。\ \ 这些发现提示,在构建基于 LLM 的学术检索系统时,需要在模型训练、提示设计以及后处理层面综合考虑权威偏差,以避免对学术多样性和新兴研究的系统性排斥。\ \ 点评