NeFut Logo NeFut
EN 管理员登录

[AI学术] 学习激活策略:面向长时序多模态代理的组合能力分配

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #optimization

长时序多模态代理需要感知、检索、推理、验证和执行等专用能力。传统系统往往一次性激活全部能力或遵循固定工作流,导致计算开销大且无法适应不同阶段的能力需求变化。本文聚焦 组合能力分配 问题:在每个交互阶段,系统需在成本约束下选择一个能力子集。该子集的价值取决于当前已选能力,而先前的分配又会影响后续状态,使得决策过程高度耦合。我们提出 CoCA(Combinatorial Capability Allocation),一种基于 on‑policy 学习的框架。学生策略遍历的状态上,教师会比较候选能力的边际净价值 $\Delta v_i$,条件是当前已选子集。随后通过条件效用模型将这些比较转化为自回归的能力子集策略,避免显式枚举所有子集。为缓解学生策略与教师分布之间的偏差,CoCA 引入双层 on‑policy 蒸馏:一层在环境状态层面对齐,另一层在子集构造过程的部分子集层面对齐。最后,在轨迹层面加入强化学习,使蒸馏得到的策略进一步优化任务成功率、激活成本和分配稳定性。推理阶段仅使用轻量学生策略,无需教师查询或在线更新。实验在多个长时序多模态环境以及受控的能力需求转移场景下,CoCA 均显著超越现有最先进基线。

点评

原文链接: https://arxiv.org/abs/2609.27869

[h] 返回首页