NeFut Logo NeFut
EN 管理员登录

[AI学术] 弹性视野:在自主强化学习中发现有效交互前沿

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

在强化学习中,交互视野(interaction horizon)指单个回合中智能体能够与环境交互的最大步数。近期研究表明,扩大视野可以显著提升大语言模型(LLM)代理在长时序任务上的表现。传统做法采用固定视野或预设的递增计划,但这些计划是开环的:视野单调增长直至手工设定的上限,缺乏判断何时继续扩展已无收益的机制。

我们提出 有效交互前沿假设:存在一个动态边界,超过该边界后每增加一次交互的收益递减,而计算成本却线性增长。基于该假设,我们设计了 Elastic Horizon(弹性视野)控制器,它通过监测成功轨迹长度的第 90 百分位数来实时估计前沿位置,实现闭环调节。

在 AppWorld 和 BFCL 两个基准上,我们先进行固定视野的全扫实验,观察到成功率随视野增大出现明显的饱和平台。随后在不同的初始视野(过小或过大)下启动 Elastic Horizon,结果表明控制器能够将视野稳定在饱和区间内,既避免了资源浪费,又提升了成功率。相较于固定视野,Elastic Horizon 在 7B 与 14B 模型上均取得最高成功率,并且在每步轨迹的 token 消耗上最高节省约 25%。

我们的工作将焦点从“如何扩展交互视野”转向“何时停止扩展”,为大规模 LLM 代理的高效训练提供了新的思路。

点评

原文链接: https://arxiv.org/abs/2609.07247

[h] 返回首页