摘要
复杂的结构化推理任务往往需要额外的计算,然而当前语言模型主要通过增加参数规模或将中间步骤序列化为思考链(CoT)令牌来获取这些计算。前者提高了训练和部署成本,而后者则将推理计算与自回归输出长度绑定在一起。我们引入了Penelope,这是一个高效的潜在推理框架,针对预训练的仅解码器Transformer,局部化递归计算到选定的解码器区间。
关键技术
较低的解码器前缀被一次评估以构建问题条件的边界记忆,随后通过时间调制的GRU动态和递归读出状态进行迭代细化,最终生成答案。渐进式的CoT到潜在课程将可见推理转移到这个内部递归路径,允许在潜在空间中分配额外的计算,而无需重复执行完整的解码器或生成长的中间跟踪。
在开放源代码的结构化推理基准测试中进行的实验显示,在验证选择的潜在预算下,Penelope在准确性上与已建立的潜在推理模型相竞争,同时减少了测量的推理延迟。这些结果表明,潜在细化可以局部化到狭窄的解码器区间,从而减少重复的全解码器执行,并且不生成长的可见推理轨迹,为仅解码器Transformer模型提供了实际的准确性与效率的权衡。
博主点评: Penelope通过局部化递归计算显著提升了推理效率,突破了传统模型在结构化推理任务中的限制。其创新的GRU动态和边界记忆机制为未来的Transformer研究提供了重要的参考,尤其是在资源受限的环境中,这种方法将极大提高模型的实用价值。