在工业级 NLP 应用中,需要把噪声大、相互冲突的自由文本假设汇聚成可靠的共识。单一的大语言模型(LLM)虽然表达力强,但受限于上下文长度、幻觉累积以及推理延迟。传统的弱监督方法在统计上更严谨,却只能处理离散标签,难以直接用于开放式文本。
Loom 将两者优势结合:首先,模块化启发式(如根因分析模板)根据具体事件填充实体、时间和指标,生成开放式假设;随后将这些假设映射到连续的嵌入空间。核心算法是基于迭代质心的再加权:在每轮迭代中计算所有嵌入的质心,根据与质心的相似度重新分配权重,以削弱冲突信号并强化一致信息。
权重确定后,仅使用一次轻量级 LLM 完成最终文本合成,大幅降低调用次数。实验在 OpenRCA 基准的四个子数据集上进行:在 Bank 与 Market‑2 上的准确率与最先进的自主代理持平,在 Market‑1 与 Telecom 上略有下降,但整体推理速度提升约 26 倍,使用 8B 参数的合成模型时提升约 33 倍。
部署过程中我们发现:深度代理虽能捕获更多细节,但推理延迟显著;冗余检测的负面实验表明简单的相似度过滤不足以提升质量;确定性的共识结果能够显著提升领域专家(SME)的信任感。
点评