在金融领域,解释机器学习预测至关重要,但可解释AI的数值输出对非专业人士往往难以理解。大型语言模型(LLM)能够将这些数值转化为自然语言,却在推断数值变化和特征关系时易产生错误。本文提出一种面向横截面股票收益预测的LLM叙事框架,核心是将时间序列的Shapley additive explanations(SHAP)证据与历史情景类比相结合。
时间证据:跟踪XGBoost模型在六个月内归一化全局SHAP重要性的变化,形成时间序列 $\{\text{SHAP}_t\}$。
历史类比:在历史数据中检索出 SHAP 变化模式相似的时期,提供这些时期的模型表现和随后市场回报作为对比。
在此框架下,我们设计了渐进式推理外化实验,依次向模型提供原始 SHAP 序列、确定性的时间描述、以及特征间的关系描述。每条生成的陈述都通过与溯源证据的匹配进行验证。
实验使用 Qwen3 系列模型。结果显示,外化数值和关系推理显著提升了证据忠实度和时间、关系准确性。对 Qwen3-32B-Instruct,证据忠实度从 0.696 提升至 0.996。虽然历史类比未提升自动化结构化忠实度,但在人工评估中获得更高的有用性评分。
点评:将可解释模型的数值证据显式化并配以历史类比,可显著增强LLM生成叙事的可信度和实用价值。