NeFut Logo NeFut
EN 管理员登录

[AI学术] 永不止步思考:连续时间语言代理

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#Machine Learning #LLM #Artificial Intelligence

语音代理通常遵循“听‑思‑说”固定循环,在每次回复前会出现数秒的沉默。我们在未修改的文本模型上加入轻量级的中断‑恢复调度器,实现了连续时间认知,即在听的同时思考、在说的同时思考,使整体延迟降低 19%,在目标场景下降低约 50%。

为评估连续时间思考的实际收益,构建了 ReactiveBench:包含 120 个交互场景,依据预先登记的二元需求进行评分,并提供一个可验证的流式轨道,以精确正确性计分。实验揭示了一个重要陷阱:LLM 评审倾向奖励可见的推理过程,导致连续思考在该评审下表现出显著优势;但在独立评审下,这一优势消失甚至逆转,且受评审训练的模型在思考时完成的需求更少。

随后进行的五阶段训练研究定位了有效信号的三个层面。其来源:可验证的目标将思考从有害转为有益;其结构:统一奖励忽略的部分会被优化过程抛弃,简短的回复削弱了多步工具链的效果;其优化器:偏好优化只能在冲突子目标之间权衡,而基于类型形状奖励的在策略强化学习(RL)能够同步提升所有正确性维度,使流式完成率从 48% 提升至 73%±5%,并在更大规模和第二模型上复现。调度器是实现连续时间交互的前提,正确来源、形状和优化的可验证信号则是其成功的关键。

点评:连续时间交互通过软中断实现了更自然的对话流,然而仅靠显式推理奖励并不足以提升真实任务完成度。必须结合可验证的目标设定和在策略 RL,才能真正把思考转化为性能提升。

原文链接: https://arxiv.org/abs/2609.17416

[h] 返回首页