体感代理有望实现科学实验的自动化,但缺乏可靠、系统的评估环境限制了其进展。现有的基于仿真的实验室基准大多依赖人工任务设计,导致难以在大规模上将多样的科学实验协议编译为可执行、可验证的体感任务。
为了解决这一瓶颈,SciHorizon-eLab 将科学体感任务构建视为编译问题。给定自然语言描述的实验协议,系统通过三阶段逐步编译:语义映射把协议中的概念对应到仿真环境;可执行任务合成生成操作程序;多阶段仿真认证验证任务的语义保持并输出步骤级成功规范。
编译过程产出语义对齐的实验环境、可直接运行的操作脚本以及每一步的成功判定标准,同时还能自动生成可复现的专家示范轨迹。基于该流水线,我们构建了 \BenchName,包含 300 条经认证的实验任务,覆盖多种实验室操作。该基准支持硬件在环(HIL)任务执行、可复现的专家示范生成以及有序的步骤级评估。
在代表性任务上,最强策略的平均成功率仅为 49.7%,进一步评估揭示了在人机协同和体感代理协作方面的显著弱点。代码、基准数据和评估工具已在 https://github.com/SciHorizon-elab/SciHorizon-elab 开源。
点评:SciHorizon-eLab 提供了从自然语言协议到可执行体感任务的系统化路径,为科学实验自动化提供了可扩展的评估框架,但当前策略仍难以突破半数成功率,表明在复杂协同和细粒度控制上仍有大量研究空间。