在面向代理工作流的 LLM 决策组件中,模型常常会给出与动作相关的建议或判断,并附带解释。运维人员会依据这些解释监控系统、诊断错误或决定是否升级输出。这种做法默认解释与组件的可观测决策行为保持一致。本文考察了两种对解释中提及因素的解释方式:(\text{必要性})——若改变该因素则输出会改变;(\text{充分性})——在保留该因素且去除其他可变信息的情况下,输出仍保持不变。我们在两个合成场景中进行评估:为客户推荐顾问以及对提示进行有害性或风险评估。模型会返回一个输出以及对其影响最大的前三个因素。通过受控的黑箱干预,计算每个因素的必要性得分(衡量改变该因素导致输出变化的频率)和充分性得分(衡量保留该因素而去除其他信息仍能保持输出的频率)。在 Claude、GPT、Gemini 系列共八个模型上,顾问推荐任务中引用排名与必要性、充分性得分的平均 Spearman 相关系数分别为 0.349 和 0.354;提示监控任务中分别为 0.431 和 0.580。进一步观察到,在顾问推荐任务中,未被引用的因素在 57.6%(必要性)和 58.1%(充分性)的情况下得分高于最低被引用因素;对应的提示监控任务比例分别为 25.8% 和 8.9%。虽然引用的前三个因素包含有用信息,但并未可靠地识别出在必要性或充分性度量下影响最大的三个因素。该框架为代理监督中使用的解释提供了一种黑箱可靠性检查,且仅针对单个 LLM 决策进行评估。
点评:该研究展示了通过行为干预量化解释可信度的可行路径,为实际系统中解释的使用提供了实证依据,但仍需探索更复杂任务和更细粒度因素的评估方法。