在评估人工智能时,通常关注知识、推理和计划生成,然而科学代理需要可靠的物理行动和对证据的适应性。本文利用机器人化学实验室作为物理世界的测试平台,使科学代理的可测量性得以实现。
实验中,45个模块化工作站被暴露为机器可读的技能,总共进行了4,608次实验。结果显示,仅有3.3%的实验产生了在实验室约束下专家评估可执行的工作流程;即便是表现最好的系统也仅达到了28.1%。
长期规划仍然是一个挑战:只有三个可执行工作流程超过了30个操作,最长的工作流程包含44个操作。在五轮实验中,实验反馈促使了局部调整,但没有进行工作流程级别的重新规划或分析方法的重新设计。
通过使物理可执行性和证据驱动的重新规划可测量,我们的研究提供了基于证据的部署准备评估和指导闭环改进的诊断框架,旨在推动物理基础的自主研究。
博主点评: 该研究为大型语言模型在物理实验中的应用提供了重要的实证数据,揭示了当前技术在复杂任务中的局限性,尤其是在长期规划方面。未来的研究需要聚焦如何提高模型在动态环境中的适应能力。