NeFut Logo NeFut
EN 管理员登录

[AI学术] CounterRoute:通过层次反事实信用分配实现自路由推理

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

CounterRoute 是一种在线强化学习框架,直接在原始双模检查点上学习路由决策和模式条件响应,省去特定的 SFT 预热。框架通过配对当前策略的反事实 rollout,只把跨模信用分配给路由标记,而在同一模内部使用 GRPO 训练响应标记。训练初期采用配对‑到‑自路由课程:强制两种模式各生成一次 rollout,随后逐步增加自路由更新,以稳定探索并提升自主路由能力。实验在九个基准上比较了启发式和自适应路由方法,CounterRoute 在准确率和计算效率之间取得更佳平衡。相较于始终思考的检查点,宏观平均准确率提升的同时,生成的 token 数平均下降 51%(Qwen3‑8B)和 41%(Qwen3‑14B)。在指令遵循和常识推理等直接回答表现强的任务上,思考比例降至 1% 左右,且响应质量进一步提升。尽管仅在数学和指令跟随数据上训练,路由行为和响应质量仍能迁移到未见的编码、科学、知识和常识基准。点评

原文链接: https://arxiv.org/abs/2609.29109

[h] 返回首页