摘要
自动化科学发现的加速面临着大型语言模型(LLMs)的语义推理与哺乳动物生物学的确定性物理之间的认知鸿沟。尽管近期的多智能体框架已实现自主假设生成和体外实验分析,但它们缺乏多尺度临床转化所需的数学基础和因果约束。此外,虽然算法临床数字双胞胎成功预测生物状态,但其依赖黑箱潜在空间,牺牲了机制可解释性以换取预测准确性。
在此,我们介绍了多尺度自主发现引擎(Octopus),一种神经符号架构,将零泄漏的本地LLM群体与严格的算法物理引擎结合。该系统不仅停留在孤立的细胞测定上,而是自主生成针对体外CRISPR依赖数据(CCLE)的治疗假设,利用机制可解释性(XGBoost SHAP向量)追踪动态因果级联,并正交地将新兴脆弱性转化为体内预测(PDX)和人类整体生存(Marisa)。
在对结直肠癌转录组的完全无监督扫描中,该管道自主识别出胰岛素样生长因子2(IGF2)作为对5-氟尿嘧啶耐药性的严格界定脆弱性。经过严格的Benjamini-Hochberg假发现率校正后,该发现仍具有显著性(q=0.0292, Log-Rank p=0.0007),并成功预测了独立小鼠队列中的显著肿瘤体积缩小(Mann-Whitney p=0.0373)。通过弥合多智能体推理与数学约束临床生存之间的鸿沟,该框架建立了一个可验证的、零泄漏的自动化生物医学发现范式。
博主点评: 这项研究通过将多智能体系统与严格的物理模型相结合,展示了在生物医学领域进行自主发现的巨大潜力。IGF2作为新发现的脆弱性,预示着未来治疗策略的创新,且其方法论为其他领域的科学发现提供了重要借鉴。