在实际使用中,没有单一的大语言模型(LLM)能够在所有查询上保持一致的可靠性,这促使研究者构建多模型推理系统。传统的路由方式在选定首个模型后即停止,而密集协作则在每一次查询上都调用所有候选模型。我们发现协作行为是非单调的:在某些情况下,同行模型能够纠正单模型无法解决的错误,但在另一些情况下,协作反而会破坏本已正确的答案。
为了解决这一矛盾,我们提出了 COMED(Controlled Model Escalation for Multi-LLM Deliberation),它是一种后锚控制器,用于在需要时选择性地进行跨模型协作。COMED 通过三大机制实现选择:
- 锚点自一致性:如果模型自身输出在多次采样后保持一致,则直接接受。
- 路由器边际:利用路由器的置信度差距判断答案是否模糊。
- 轻量同行探测:在模糊情况下,向少数候选模型发送简短探测,以评估协作的潜在收益。
我们进一步用“救援‑伤害”分解公式化了选择性协作的收益:当通过协作救援的错误数量大于因协作引入的错误时,整体性能提升。实验在医学、科学和通用推理基准上进行,覆盖 16 种开源模型配置。结果显示,COMED 在所有设置下均优于固定锚点和路由锚点,最高在 MedQA 上提升了 10.7 个百分点,同时调用的模型数量和解码 token 数均低于密集协作。
在使用前沿模型(如 GPT‑5.5)的 HLE 基准上,COMED 将准确率从 23.1% 提升至 28.1%,超越了密集协作并取得最佳成绩。
点评