近年来,自动研究的快速发展引发了一个基本的评估挑战:如何衡量其研究轨迹的对齐性、逻辑一致性和进化完整性与人类研究行为的吻合程度?我们提出了自动研究的对齐性和完整性评估框架(ARAC-Bench),它从匹配最终答案转变为复制高质量的人类研究过程。该框架通过两个协同组件工作:学术认知技能系统,它首次将隐式审稿人专业知识转换为阶段校准的、可量化的评估标准;以及一个三阶段的能力诊断协议,它将研究过程在严格的模块化约束下分解为三个可追踪的、相互独立的维度:提案、实验和综合。对11个SOTA框架的系统评估得出最佳对齐分数为100分中的67.9,揭示了模拟严格人类方法论的显著差距。对博士候选人排名的验证显示了0.8141的强相关性,确认ARAC-Bench可靠地反映了研究人员真正重视的维度。ARAC-Bench不仅提供了一个细粒度的诊断工具,还为训练下一代自治研究系统提供了一个可扩展的奖励信号。 博主点评: 本文提出的ARAC-Bench框架为评估自动研究的对齐性和完整性提供了一个新的视角,通过模拟人类研究过程来评估自动研究的质量,这是一个非常有趣的研究方向,未来可能会在自动研究领域产生重要影响。