NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越路由权重:通过贡献对比实现混合专家奖励模型的响应级别解释

发布于:2026-08-10 22:00 最后更新:2026-08-11 02:05
#AI #Machine Learning #LLM

最近的稀疏混合专家(Mixture-of-Experts,MoE)奖励模型试图通过将提示路由到专门的专家并通过高路由权重的示例来改善其预测的可解释性。然而,路由权重仅揭示了哪些提示被路由到哪个专家,而没有表明专家如何判断响应,仅提供了对专家行为的部分解释。因此,我们提出了Contribution-Contrast(CoCo)响应级别解释方法,该方法使用具有最大贡献对比的选中-拒绝响应对来表征专家的角色,同时捕获路由和偏好行为。在自动和人工评估中,CoCo 方法比基于路由器、基于评分和基于稀疏自动编码器的替代方法产生更连贯、更忠实和更专业的解释,同时保持了具有竞争力的奖励模型准确性。 博主点评: 本文提出了一种新的混合专家奖励模型的响应级别解释方法,通过贡献对比来更好地理解专家的行为和决策过程,这是奖励模型领域的一个重要进展。

原文链接: https://arxiv.org/abs/2608.06400

[h] 返回首页