ScientistTwo 是一个完全自主的多智能体框架,旨在实现问题驱动的自动科研。系统接受专家提出的基础挑战,首先在公开数据集上建立最新基准,然后生成新假设并调度专门的子代理完成理论推导、实验设计、代码实现等环节,实现从问题定义到论文撰写的闭环。
实验阶段框架会自动选择多样化的数据集和评价指标,执行大规模实验并通过自动消融研究优化方法。完成后,系统利用模拟的同行评审反驳引擎进行自检,确保结果可复现并符合学术标准。
我们在 ICLR、ICML、NeurIPS 等顶会的已接受论文上进行基准测试,ScientistTwo 能独立产出专家水平的论文和可执行代码,性能超越当前人类最优模型,并在自动化 AI 评审下获得更高的平均评分。结果表明,ScientistTwo 已超越辅助工具的范畴,成为能够自主拓展人类知识边界的科研主体。
点评