语言模型在跨学科科学文献分析中面临独特挑战。生物物理研究要求答案必须基于原始数据、量化的物理模型以及对应的生物机制进行推理。为此我们构建了 BioPhys-Bridge 数据集,专注于证据支撑的科学推理。每个案例提供证据块、稳定的证据 ID、数值、单位、方程、假设、机制以及后续决策,作为问答(QA)和检索增强生成(RAG)的 grounding 目标。首批发布包含 500 条案例、1,517 条面向智能体的任务,覆盖六个生物学领域和九类物理模型,其中三类稀疏模型留待后续扩展。所有案例均通过严格的模式、证据完整性、量化 grounding、许可证、去重、单位归一化等质量门槛,并由领域专家对 81 条案例进行审阅和标注。初步评估显示 DeepSeek‑V4‑Flash 在证据 ID $F_1$ 上取得最高得分 0.360,随后是 Qwen3.7‑Max(0.316)和 GPT‑4o‑mini(0.294)。BioPhys-Bridge 旨在评估模型的归因能力、忠实度、幻觉抑制以及复杂多步的生物实验设计推理。未来工作将扩大数据规模和复杂度,并进行更全面的评估。代码和数据已在 GitHub 与 Hugging Face 上公开。
点评:该基准通过细粒度证据标注和多模态量化信息,为评估大模型在跨学科科学推理中的可信度提供了重要实验平台。