真实的分子设计任务对基于大语言模型(LLM)的智能体提出了多重挑战:需要理解设计情境、满足显式与隐式约束、识别不可行的规格,并在多步工具调用中进行推理。现有基准大多只关注显式、狭窄的约束,且仅包含可行问题和单一路径解,难以反映实际需求。
为弥补这一缺口,我们推出 MolDesignBench,一个情境驱动的基准,旨在更真实地评估工具增强型 LLM 智能体的分子设计能力。基准包含约 2K 条生成与优化实例,每条实例融合了设计叙述中的隐式需求、显式的性质与官能团约束,并加入不可行案例。任务要求智能体有效调用 17 种专用化学工具完成分子构建、属性预测、合成可行性评估等步骤。
我们在多种前沿 LLM 上进行实验,整体成功率偏低,最佳模型仅达到约 $43\%$。失败主要集中在隐式约束推理、不可行性检测以及工具调用推理上。细粒度的失效模式分析表明,隐式约束解释和不可行性检测是当前系统的主要瓶颈。
MolDesignBench 通过公开基准数据、工具接口定义以及评估代码,为后续化学智能体的研发提供了严格的测试平台。
点评