在推理语言模型(RLM)中加入思考过程一直是争议焦点:它是消除偏见的利器,还是偏见的放大器?已有研究给出了相互矛盾的结论。为了解答这一问题,我们在同一模型内部对比了思考(thinking)与非思考(non‑thinking)两种模式,选取了 QwQ‑32B、DeepSeek‑R1‑Distill‑Qwen‑32B 与 Qwen3‑32B 三个 32B 参数模型,并在 Adult、COMPAS、Credit 三个高风险决策数据集上进行实验。
实验结果显示,思考对反事实公平性产生了不对称的双重效应:它既能修复非思考基线产生的反事实翻转(resolved flips),又会在模型置信度接近饱和时产生新的翻转(created flips)。在全部 9 种(模型, 数据集)组合中,产生的新翻转数量约为修复翻转的 5 倍。
为解释这一现象,我们将思考过程本身视为公平性变化的可测量位置,并提出两种动态分析工具:
- 反事实深度概率差(Counterfactual Depth Probability Gap, CDPG):该指标随思考深度记录偏差的演化,实验表明偏差会随思考层数逐步传播并放大。
- 偏差转移矩阵(Bias Transition Matrix, BTM):该矩阵描述从非思考到思考状态下,反事实样本对的预测如何转变。分析发现,不对称双重效应来源于样本对状态的联合转移,即部分对在思考后从公平转为不公平,而另一些对则相反。
总体而言,思考并非单纯的公平提升手段;在高置信度情境下,它可能引入更多不公平翻转。未来的研究需要在设计思考路径时显式考虑公平性约束,以抑制偏差的累积放大。
点评