近期 AI 在科学发现中的进展提升了分子理解与设计能力,但对不完整化学表示的推理仍不清晰。Markush 结构通过可变的 R‑基团占位符(如 $R_{1}$、$R_{2}$、$X$ 等)描述分子族,在药品专利中极为常见,需要在分子、文本和化学信息之间实现精准定位。现有的分子‑语言基准大多聚焦于完整分子,忽视了 R‑基团的定位评估。\ 我们构建了 R‑GroundBench,基于真实专利 Markush 结构设计诊断基准,包含两大任务:\
- 多项选择(VQA)轨道,设有难度和模态划分,控制捷径以衡量真实推理能力;\
- 开放式生成轨道,要求模型在给定上下文下生成完整分子。\ 实验结果显示:在 Easy VQA 上模型准确率超过 90%,但在 Hard VQA 上跌至 56%‑66%,说明在消除捷径后模型的定位能力显著下降。即使是经过化学领域预训练的视觉语言模型(VLM),在 Hard VQA 上也仅达到 25.7%‑46.2%。生成任务的 Exact Match 率大多数模型不足 20%,在需要视觉输入时更低于 8%。\ 这些发现表明当前 AI 系统在 Markush 编辑的定位与执行方面仍不可靠,凸显了面向 AI 驱动科学发现的关键挑战。\
点评