成对语言模型判决器可以通过直接比较、推理或基于参考的验证来收集证据,但没有一种协议能在所有基准和判决骨干上表现最佳。我们提出骨干自适应证据路由(BAER),在保持候选对称性的前提下动态调整证据机制:交换两个响应可能会改变偏好方向,但不会改变其强度。BAER 将每个专家的有符号偏好与候选不变的可靠性分离,并构建三种对称头:证据堆叠、基于可靠性的专家路由以及候选盲参考验证。开发数据用于为每个基准‑骨干条件选择一种头部,并在测试前冻结该选择。实验覆盖四个基准和两种 8B 判决骨干,在全部八个条件下 BAER 获得最高测试准确率,预测覆盖率为 100%,相较最强外部基线提升 0.87‑7.32 分。结果表明,适配证据获取方式比在所有场景固定单一判决协议更为可靠。
点评:BAER 通过动态选择证据机制,在多种基准和模型骨干上实现了显著提升,验证了证据路由的实用性。