解释在构建可信的推荐系统中至关重要,但选择合适的解释方法面临诸多挑战。现有解释方法众多,却缺乏针对不同场景的明确指导。大多数生成式解释输出抽象,需要进一步加工才能对用户友好,而可供选择的方案几乎无穷。对所有方案进行用户实验往往不可行,自动评估指标要么只衡量解释器的抽象输出,要么需要与不可得的真实答案比较。\ \ 近期研究表明,大语言模型(LLM)可以充当解释评估的“裁判”,但其可靠性尚未系统验证。本文首先考察 LLM 在给定推荐系统和用户信息的情况下生成解释原型的能力。我们基于不同信息组合生成了 18 种解释原型,并使用 14 秞不同规模的 LLM 在两种 temperature 设置下进行评分,随后与用户研究得到的人类评分进行对比。\ \ 实验结果显示,LLM 的评分模式与人类相似,排名相关性达到中等水平,但绝对评分一致性较低,且随模型规模和评估构造的不同而波动显著。基于此我们提出四条实用建议:提示词保持简洁;在评估时倾向使用更大的模型;事先对评估构造进行测试;对解释内容的事实性进行审计,因为无论是人类还是 LLM 都难以可靠检测非事实信息。\ \ 点评