在大型语言模型中,自我精炼常常无法有效增强少样本归纳推理。简单地提示模型明确陈述其推断规则并不能产生实质性效果。关键在于在推理阶段之间施加结构性隔离,以便信息只能以压缩的符号状态在阶段间传递。
我们提出了沙漏推理,该方法在推理阶段之间强制执行严格的上下文隔离。冻结的语言模型作为元构造器,为每个任务构建一个符号编码器-解码器:一个归纳模块将支持示例压缩为模式 $\phi$(编码器)和一个瞬态支架 $z$;一个推导模块从这些信息中推导规则 $T$(解码器)并丢弃 $z$;一个实施者将 $(\phi, T)$ 编译为工件;一个基于错误的修正者修订 $(\phi, T)$ 并从头生成工件。只有 $(\phi, T)$ 跨越阶段边界,因此所有的精炼过程都与规则紧密相连。
我们在三个基准测试上评估了沙漏推理,涵盖视觉抽象、硬件合成和文本规则归纳,使用了 GPT-5.5 和 Gemini 3.1 Pro。在 ARC-AGI-2 上,它的最佳五次准确率提高了最多 14 分,相较于迭代精炼基线。在 ChipBench 上,它几乎将 GPT-5.5 的 Verilog 合成准确率从 31% 提高到 58%。BBEH-Linguini 利用国际语言学奥林匹克的难题,以前的研究表明,明确的语言表达可能会影响表现。沙漏推理缓解了这一趋势,在 Gemini 3.1 Pro 上,它完全逆转了这一效果。消融实验确认,这些提升源于阶段之间的隔离和初始归纳的质量,而非提示的措辞或使用的特定符号形式。信息如何在推理过程中流动,而不是表达它的语言,驱动了冻结语言模型中的归纳推理。
博主点评: 沙漏推理通过严格的阶段隔离改变了推理的信息流动方式,为少样本学习提供了新的视角。这一方法不仅提升了模型的性能,还揭示了推理过程中的结构性重要性,值得在更多应用场景中探索与验证。