NeFut Logo NeFut
EN 管理员登录

[AI学术] 智能体与推测者合一:提升工具调用预测的强化学习新方法

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #Machine Learning #Reinforcement Learning

在大型语言模型智能体中,常常需要花费大量时间等待工具调用结果。工具调用推测可以通过预测并预执行智能体的下一次工具调用来隐藏这种延迟,但现有的推测器通常是独立的草稿模型或缓存轨迹,与部署的智能体行为不匹配。我们识别了这一推测器与智能体之间的差距,并展示了目标智能体本身是一个强大的下一次调用推测器。这指向了一个更简单的设计:将智能体和推测器统一在同一个模型中。

在本文中,我们介绍了自推测智能体,这是一种单一模型,既可以在智能体模式下解决任务,也可以在推测器模式下从部分轨迹预测其下一次工具调用,完全重用前缀KV缓存。为了实现这一双模智能体而不降低性能,我们提出了一种联合智能体-推测器强化学习方法,该方法从智能体自身的回滚中导出推测目标,并交替更新智能体和推测器。

在智能体搜索问答和对话工具使用任务中,我们的方法将平均下一次工具调用的Hit@1从44.1提升至61.2(Qwen3-4B),从48.9提升至66.3(Qwen3.5-4B),同时保持了智能体任务的成功率。

博主点评: 本文提出的自推测智能体通过强化学习有效地整合了推测与智能体的功能,不仅简化了模型设计,还显著提高了工具调用的准确性。这种创新方法在实际应用中具有广泛的潜力,值得进一步研究与探索。

原文链接: https://arxiv.org/abs/2607.25816

[h] 返回首页