系统化概括指在已知原子元素的基础上重新组合以解决新问题,这被视为人类智能的核心能力,却难以在受控实验中严格评估。已有工作往往通过三类简化来降低任务难度:① 近似线性动作组合,使归纳推理需求减弱;② 基于生产力的测试,只考察在训练长度范围内的组合能力;③ 动作显式目标,削弱了溯因推理的负担。这些简化让系统化概括更易测量,却可能遗漏关键认知环节。
为揭示缺失之处,我们提出 TranSGrid,一个将演绎、归纳、溯因三种推理统一进同一任务的测试平台。任务要求模型在给定的规则网格中,根据部分观察推断隐藏的因果结构,并生成满足特定目标的动作序列。
我们在 4,800 条 TranSGrid 实例上评估了七种 Transformer 变体。结果显示,所有模型在普通留出测试集上的最高准确率为 79.6%,但在 TranSGrid 上仅为 55.3%,最难子集甚至跌至 15.8%。该差距在训练长度范围内仍然显著,说明仅靠生产力指标不足以衡量系统化概括。
随后,我们分别在 TranSGrid 中恢复两种简化:一是让动作几乎线性组合,降低归纳需求;二是将目标设为动作显式,降低溯因需求。两种改动均使模型表现回升至接近普通测试集的水平,表明任一简化即可将任务降为普通的留出测试。
综上,现有系统化概括任务往往削弱或消除归纳与溯因两类推理的需求。要全面衡量系统化概括能力,必须设计同时涉及演绎、归纳、溯因三种推理的任务。
点评:TranSGrid 为系统化概括提供了更完整的评估框架,提醒研究者在构建基准时不要忽视归纳和溯因推理的作用。