NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于参考的LLM偏差检测:隐藏状态相对表示方法

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#Machine Learning #LLM #Artificial Intelligence

现有的偏差审计方法大多依赖模型输出,需要昂贵的基准或评判模型,且可能遗漏只在内部表征中出现的偏移。我们提出一种基于参考的审计框架,直接比较模型在不同变体(如微调前后)隐藏层的表征。由于微调会改变表征的几何结构,直接比较绝对隐藏向量不可行。我们首先构建一组固定的锚句,将每个待评估句子映射为与这些锚句的相似度向量,从而得到共享比较空间中的相对表征。随后计算目标群体在正负属性上的关联变化,定义为表征偏差转移 $$\Delta B$$。在三个模型族以及 WildGuardMix、DecodingTrust、ToxiGen 三个基准上实验,$$\Delta B$$ 与输出层偏差变化的相关系数在 18 组实验中有 15 组达到 $|r|=0.84$($p<0.01$),表明相对表征能够可靠捕捉隐藏层的偏差迁移。

点评

原文链接: https://arxiv.org/abs/2609.10060

[h] 返回首页