工具使用的 LLM 代理在推理之外,还会在串行的动作‑观察回合中耗费墙钟时间,每一次工具调用、环境转移和观察都会延迟后续决策。我们提出 Speculative Macro Commit(SMC),一种针对两层代理系统的运行时机制:大型权威 actor 模型负责生成官方轨迹,速度更快的 speculative drafter 模型在隔离的环境快照上持续预测并执行未来的动作链。SMC 从训练轨迹中挖掘重复出现的多动作骨架,存入宏库,在运行时将其与 drafter 预测的动作链匹配。当 actor 的下一个工具调用与草稿的首个动作相匹配时,SMC 将其余已预执行的草稿步骤及对应观察一次性提交到官方轨迹。实验使用 Qwen3.5‑27B INT4 作为权威 actor,Qwen3.5‑4B 作为草稿模型。相较于 Speculative Actions(SA)基线,SMC 在 $$\tau^2$$‑Bench Telecom 子集上将整体延迟降低 10.23%,比顺序执行降低 18.59%;在 AppWorld 上相对 SA 基线降低 7.7%,相对顺序执行降低 44.9%,任务完成率略有下降。SMC 展示了复用多步推测执行以超越单步推测的实用路径。代码已公开 https://github.com/zeyuliu1037/speculative-macro-commit。
点评