NeFut Logo NeFut
EN 管理员登录

[AI学术] COMED:多模型推理中路由与协作的缺失中间层

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#optimization #LLM #GPT

在实际使用中,没有单一的大语言模型(LLM)能够在所有查询上保持一致的可靠性,这促使研究者构建多模型推理系统。传统的路由方式在选定首个模型后即停止,而密集协作则在每一次查询上都调用所有候选模型。我们发现协作行为是非单调的:在某些情况下,同行模型能够纠正单模型无法解决的错误,但在另一些情况下,协作反而会破坏本已正确的答案。

为了解决这一矛盾,我们提出了 COMED(Controlled Model Escalation for Multi-LLM Deliberation),它是一种后锚控制器,用于在需要时选择性地进行跨模型协作。COMED 通过三大机制实现选择:

我们进一步用“救援‑伤害”分解公式化了选择性协作的收益:当通过协作救援的错误数量大于因协作引入的错误时,整体性能提升。实验在医学、科学和通用推理基准上进行,覆盖 16 种开源模型配置。结果显示,COMED 在所有设置下均优于固定锚点和路由锚点,最高在 MedQA 上提升了 10.7 个百分点,同时调用的模型数量和解码 token 数均低于密集协作。

在使用前沿模型(如 GPT‑5.5)的 HLE 基准上,COMED 将准确率从 23.1% 提升至 28.1%,超越了密集协作并取得最佳成绩。

点评

原文链接: https://arxiv.org/abs/2609.26913

[h] 返回首页