大型语言模型的快速发展正把 AI 从被动内容生成推向工程和科学发现的主动工作流。一个核心问题随之而来:AI 能否既是研发对象,又是构建下一代 AI 系统的主动参与者?我们在闭环 AI‑for‑AI 框架中实现了 Qwen‑Planner‑Agent,以支持可扩展的开发和迭代提升。
移动规划是该框架的严苛测试场景:任务跨度长、复杂度高,对代理的可靠性提出挑战;而真实设备交互成本高,限制了开发的规模化。框架通过共享的动作‑反馈‑验证合约,将数据生成、模型训练和部署紧密相连。
(i) AI for Data 构建了一个人类监管的代理数据飞轮。专用代理负责生成任务、收集交互轨迹、策划并平衡训练数据,并利用训练反馈指导后续数据生成。
(ii) AI for Training 将监督式规划冷启动与混合环境在线强化学习相结合。我们提出了 Competence‑Aware Reward‑and‑Advantage Engineering (CARE),在保持任务性能的前提下降低推理和工具使用成本。
(iii) AI 驱动模型‑执行体协同进化 通过执行证据循环,动态调度记忆、技能和工具,并将结构化的动作反馈与失败痕迹回流至模型和执行体的同步适配。
在 MobilePA‑Bench 上,Qwen‑Planner‑Agent 超越所有已评估模型和系统,显著提升了工具使用、记忆管理、技能调用以及子代理协同等维度。进一步的实验表明,在非移动代理基准上也取得了稳健提升,同时基本保持了通用能力。
点评:该工作展示了闭环 AI‑for‑AI 体系在高成本真实环境中的可行性,为移动规划等长时序任务提供了系统化的研发路径。