NeFut Logo NeFut
EN 管理员登录

[AI学术] 企业NLP系统中用户信任的稳健解释研究

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#LLM #NLP #Robustness

摘要

稳健的解释对于建立用户在企业自然语言处理(NLP)系统中的信任越来越重要。然而,在黑箱部署(仅通过API访问)的常见情况下,预部署验证变得困难,基于表现的解释方法无法实现,现有研究对解释在真实用户噪声下的稳定性提供的指导有限,尤其是当组织从编码器分类器迁移到解码器大语言模型(LLMs)时。

为了解决这一问题,我们提出了一种基于留一法遮蔽的统一黑箱稳健性评估框架,针对多种严重性级别下的现实扰动(如交换、删除、打乱和反向翻译)操作化解释的稳健性,并通过顶级标记翻转率进行评估。

使用该协议,我们在三个基准数据集和六个模型(涵盖编码器和解码器家族,包括BERT、RoBERTa、Qwen 7B/14B、Llama 8B/70B;共计64,800个案例)之间进行系统的跨架构比较。结果表明,解码器LLMs生成的解释比编码器基线更加稳定(平均翻转率低73%),并且随着模型规模的增加,稳定性有所提升(从7B到70B提升44%)。

最后,我们将稳健性改善与推理成本联系起来,得出一个实际的成本-稳健性权衡曲线,为合规敏感的应用在部署前支持模型和解释的选择提供指导。

博主点评: 本文提供了对企业NLP系统中解释稳健性的深入研究,揭示了解码器LLM在用户信任构建中的优势。通过系统的比较和实证分析,研究不仅为模型选择提供了实用建议,也为未来的NLP模型开发指明了方向。

原文链接: https://arxiv.org/abs/2604.12069

[h] 返回首页