Deep research agents 已经能够进行网页检索、工具调用、多模态证据分析以及信息合成。然而,现有基准大多只考察中等时程的探索,鲜有评估代理在长链、依赖密集的研究过程中的持续能力。我们提出 Mr.LHDR(Multimodal real‑world Long‑Horizon Deep Research),它通过隐藏的节点‑关系图构造八类问题,每道题平均需要 12.1 条必要的中间结论,依赖深度平均为 10.4,最终得到唯一且可验证的简短答案。题目中至少包含一种非文本元素(如图片、地图、PDF、徽标、图表、表格或视频帧),这些元素会改变推理状态。Mr.LHDR 同时评估最终答案和在标注依赖下的中间结论正确性,使用整体准确率(OA)、严格准确率(SA)、检查表得分(CS)以及依赖感知检查表得分(DACS)四个指标。实验表明,即使是最强系统也仅达到 43.1% OA 和 34.3% SA,说明仅看最终答案会显著高估研究成功率。去除图像会使 DACS 下降 12.6 分,凸显多模态证据的重要性;随着推理链长度增加,SA 持续下降。上述结果揭示,当前深度研究代理的瓶颈在于持续、依赖一致的证据整合,而非孤立的事实检索。
点评