人类只需研读少量高质量教材即可掌握学科并挑战最高难度题目。我们认为理想的自我进化方法也应具备同样的特性,即能够从原始训练材料中自主学习并获得可迁移的解题能力。然而,目前缺乏直接衡量这种能力的指标。为此我们提出 StudyBench——一个受控的物理基准,用于直接测量自我进化方法将训练材料转化为能力的效率。测试集分为两部分:应用集包含难度较高的教材题目,用以评估吸收能力;迁移集收录奥林匹克水平的题目,用以评估迁移能力。我们在三种基础模型上对代表性自我进化方法进行基准测试,发现提升应用集表现并不一定带来迁移集的提升。进一步的引导消融实验揭示了“引导差距”:即使是最强方法,也只能利用少量材料带来的提升,而将相同材料作为上下文提示时能够获得的提升要大得多。此外,所有方法都出现了计算平台限,即在耗尽计算预算之前就已出现性能饱和。由此可见,剩余的差距主要是方法层面的限制,而非数据或计算资源的问题。StudyBench 通过提供清晰可控的基准,将自我进化的进展从开放式探索转化为可度量的目标,为后续研究指明方向。代码已在 https://github.com/thunlp/StudyBench 开源。
点评