NeFut Logo NeFut
EN 管理员登录

[AI学术] 思考能否提升公平性?推理令牌在缓解偏差的同时也会产生新偏差

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #LLM

在推理语言模型(RLM)中加入思考过程一直是争议焦点:它是消除偏见的利器,还是偏见的放大器?已有研究给出了相互矛盾的结论。为了解答这一问题,我们在同一模型内部对比了思考(thinking)与非思考(non‑thinking)两种模式,选取了 QwQ‑32B、DeepSeek‑R1‑Distill‑Qwen‑32B 与 Qwen3‑32B 三个 32B 参数模型,并在 Adult、COMPAS、Credit 三个高风险决策数据集上进行实验。

实验结果显示,思考对反事实公平性产生了不对称的双重效应:它既能修复非思考基线产生的反事实翻转(resolved flips),又会在模型置信度接近饱和时产生新的翻转(created flips)。在全部 9 种(模型, 数据集)组合中,产生的新翻转数量约为修复翻转的 5 倍。

为解释这一现象,我们将思考过程本身视为公平性变化的可测量位置,并提出两种动态分析工具:

  1. 反事实深度概率差(Counterfactual Depth Probability Gap, CDPG):该指标随思考深度记录偏差的演化,实验表明偏差会随思考层数逐步传播并放大。
  2. 偏差转移矩阵(Bias Transition Matrix, BTM):该矩阵描述从非思考到思考状态下,反事实样本对的预测如何转变。分析发现,不对称双重效应来源于样本对状态的联合转移,即部分对在思考后从公平转为不公平,而另一些对则相反。

总体而言,思考并非单纯的公平提升手段;在高置信度情境下,它可能引入更多不公平翻转。未来的研究需要在设计思考路径时显式考虑公平性约束,以抑制偏差的累积放大。

点评

原文链接: https://arxiv.org/abs/2609.30768

[h] 返回首页