文档可以视为由不同领域的文本片段组成的离散 token 序列,例如 README 文件会在自然语言、代码和配置之间切换。若文档被损坏且只能使用已冻结的领域专家进行恢复,需要在测试时同时决定缺失的内容以及在每个位置应信任哪个专家,而无需区域标签或训练好的路由器。我们提出 证据对齐的局部组合 方法:先依据给定的损坏模型计算观测的边缘证据,再利用各专家自身的去噪损失估计该证据,并在位置上平滑得到一个软的、逐位的专家加权。加权是软的,因而在真实组合为混合时能够恢复混合分布,在单一专家足够时则会集中于该专家。实验在分类模拟器、字节级专家以及从 $1.3$B 离散流匹配模型微调的专家上进行。结果显示,在自然混合的科学文档上加权能够以 $0.85$ 的区域准确率追踪真实区域;在词汇上完全不相交的构造混合上准确率达到 $0.98$。当专家之间差异显著时,恢复效果优于使用单一全局权重;当专家趋于一致时,方法自然退化为全局权重,并能够反映专家分离度的变化。
点评