NeFut Logo NeFut
EN 管理员登录

[AI学术] 可验证隐藏动力学游戏:从已解模型生成智能体强化学习环境

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

语言模型智能体正面临需要长期规划、状态随时间演化、决策相互依赖以及结果延迟的任务。要在规模上提升它们的训练,需要大量多样的智能体环境、可靠的结果信号以及低成本的扩展方式。传统的生成流水线往往先构造环境,再定义结果规则或标注轨迹,导致动力学与评估只能事后对齐。VHD‑Play 通过先抽样并求解数学模型,再让基于语料库的 setter 将其决策过程渲染为有状态工具,彻底颠倒了这一依赖关系。可执行的动力学和轨迹评分参考均来源于同一已解模型。该流水线在每个环境仅花费几美分的成本下,生成了 3,300 种多样的智能体环境。我们在三个机制族上使用 Qwen3.6‑35B‑A3B 进行训练,使其在五族诊断中的平均智能体得分从 0.204 提升至 0.815。训练后模型在所有三族的未见实例以及八个全新机制族上均表现提升,并进一步在通用函数调用、旅行规划以及 365 天电商等外部基准上取得超越基线的效果。在 E‑Commerce Bench 上,训练得到的检查点能够完整运行所有任务且不出现破产,性能超过 Qwen3.7‑Max。我们比较了文字版问题与揭示或隐藏参数的有状态版本,结果表明可学习的提升主要来源于有状态交互而非纯粹的题目求解。一个冻结的 35B setter 能够生成更大的环境,且在机制规模和时间视野增长时,规模匹配的训练仍能保持收益,暗示了一个可持续演化的训练基底的潜力。

点评

原文链接: https://arxiv.org/abs/2609.27321

[h] 返回首页