本研究在保持模型检查点和提示内容不变的前提下,对比了两种读数方式的效果:
- 直接对答案 token 进行打分(scored readout)。
- 在给出书面推理后让模型生成答案(generated readout)。
实验覆盖四类零售任务、三个市场,共 13 个模型‑领域组合,其中两组使用完全公开的数据和检查点。结果显示,scored readout 在 12/13 组合中对结果排序更准确(双侧符号检验 p≈0.003),AUC 提升幅度在 1.5 到 14.5 点之间。所有新测量的组合的配对自助置信区间均不包含零。
误差差距随任务监督方式和训练‑服务格式不匹配程度而变化,未调优的基础模型出现 -2.2 点的下降,而使用推理格式监督的模型可达 +13.7 点的提升。对约 9,000 条推理进行分析,发现两大相关因素:对主导预测特征的依赖度下降以及趋向于使用固定模板表达。概率饱和度并未解释差距。
第三种读数方式是在作出任何判决前先询问概率(pre‑verdict probability),其校准效果显著提升(Brier 分数从 0.47 降至 0.15),但在排序上仅与 scoring 处于噪声水平,并且仅在训练中出现的结果率上有效;当 scoring 头已经校准时,它的表现反而更差。
我们将这些差异归因于各读数方式匹配的目标,指出可以通过特定的训练策略缩小差距,并建议在保留生成式推理的同时,使用 scoring 头进行排序。
点评