大型语言模型(LLM)正日益充当科研代理,但由于评审和研究想法缺乏唯一可验证的结果,评估它们捕捉研究关注度变化的能力十分困难。为此我们提出 Research Attention Prediction (RAP),一个滚动基准,覆盖 278 个 AI/ML 细分领域和 1,390 个时间段。每个截点,LLM 代理在时间受限的 arXiv 语料库中检索,并预测接下来六个月在八个固定研究方向上的论文占比。
实验表明检索总体有帮助,但四种诊断模型在组合准确性上均不如一个精确计数的指数加权移动平均(EWMA)基线。我们进一步定位了两个相互关联的瓶颈:在累计历史访问模式下,State carry-forward 始终优于直接 Forecast;而 frozen‑evidence replay 将这一逆转归因于 Forecast‑导向策略只检索了较少的近期证据。即便拥有完整的历史活动信息,面向未来的更新仍受限——只有 GPT‑5.5 配合重新开启的检索略微超越 EWMA。
针对实现结果进行微调能够显著提升预测性能。对 Qwen3‑4B 进行微调后,其在后期来源的未见领域上 Spearman 相关系数提升了 0.105,且在变化剧烈的情境中同样获得收益。
点评:RAP 为评估 LLM 在科研情境下的注意力追踪提供了系统化平台,揭示了检索策略与历史利用之间的细微权衡,为未来模型改进指明了方向。