AgentBrew 是一种离线训练框架,能够仅凭一批原始交互轨迹学习工具使用策略。框架的核心步骤包括:① 环境探索收集未过滤的原始轨迹;② 通过回顾式任务推断为每条轨迹生成与实际结果对应的指令;③ 基于点互信息的信用分配将轨迹对指令的整体信息分解为每一步的增量贡献。点互信息的计算公式为 $$\text{PMI}(a,s)=\log\frac{P(a,s)}{P(a)P(s)}$$,其中 $a$ 为动作,$s$ 为指令。得到的信用值作为权重加入策略的损失函数,从而放大有效动作、抑制无效动作。实验在 GitHub、Notion、PostgreSQL 三个真实工具使用场景中进行,AgentBrew 将 Qwen3‑32B 的平均准确率提升 8.7、得分提升 9.7,超过 Qwen3‑235B 的提升幅度,并显著优于拒绝采样基线。代码已开源。
点评