NeFut Logo NeFut
EN 管理员登录

[AI学术] SciHorizon-eLab:面向可扩展科学体感代理基准的协议到任务编译器

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #Compiler

体感代理有望实现科学实验的自动化,但缺乏可靠、系统的评估环境限制了其进展。现有的基于仿真的实验室基准大多依赖人工任务设计,导致难以在大规模上将多样的科学实验协议编译为可执行、可验证的体感任务。

为了解决这一瓶颈,SciHorizon-eLab 将科学体感任务构建视为编译问题。给定自然语言描述的实验协议,系统通过三阶段逐步编译:语义映射把协议中的概念对应到仿真环境;可执行任务合成生成操作程序;多阶段仿真认证验证任务的语义保持并输出步骤级成功规范。

编译过程产出语义对齐的实验环境、可直接运行的操作脚本以及每一步的成功判定标准,同时还能自动生成可复现的专家示范轨迹。基于该流水线,我们构建了 \BenchName,包含 300 条经认证的实验任务,覆盖多种实验室操作。该基准支持硬件在环(HIL)任务执行、可复现的专家示范生成以及有序的步骤级评估。

在代表性任务上,最强策略的平均成功率仅为 49.7%,进一步评估揭示了在人机协同和体感代理协作方面的显著弱点。代码、基准数据和评估工具已在 https://github.com/SciHorizon-elab/SciHorizon-elab 开源。

点评:SciHorizon-eLab 提供了从自然语言协议到可执行体感任务的系统化路径,为科学实验自动化提供了可扩展的评估框架,但当前策略仍难以突破半数成功率,表明在复杂协同和细粒度控制上仍有大量研究空间。

原文链接: https://arxiv.org/abs/2609.30971

[h] 返回首页