NeFut Logo NeFut
EN 管理员登录

[AI学术] 突破性思维政策:通过在线政策演化提升LLM推理能力

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:18
#AI #Machine Learning #optimization

摘要

大型语言模型(LLMs)在复杂的长时间推理中面临挑战,主要由于其固定政策假设导致的不稳定性。当前的测试时间扩展方法仅将执行反馈视为过滤或重写轨迹的外部信号,而未将其内化以改善基础推理策略。受波普的“猜想与反驳”认识论启发,我们认为,智能需要通过学习失败的尝试实时演化模型的政策。

我们提出了思维政策(Policy of Thoughts, PoT)框架,将推理视为实例内的在线优化过程。PoT 首先通过高效的探索机制生成多样的候选解决方案,然后使用群体相对政策优化(Group Relative Policy Optimization, GRPO)基于执行反馈更新瞬态 LoRA 适配器。这种闭环设计使得模型的推理先验能够动态、实例特定地进行精细化。

实验表明,PoT 显著提升了性能:一个 4B 模型在 LiveCodeBench 上达到了 49.71% 的准确率,尽管其规模比 GPT-4o 和 DeepSeek-V3 小超过 50%。

博主点评: 这项研究通过实时政策演化的思路,打破了传统 LLM 在推理能力上的局限,展示了动态优化的潜力。PoT 框架不仅提升了性能,同时也为未来的 LLM 发展提供了新的视角,值得关注和探索。

原文链接: https://arxiv.org/abs/2601.20379

[h] 返回首页