自动化的候选人与职位匹配系统正被新兴监管列为高风险 AI,然而对其进行人口统计偏差审计成本高昂。传统的对应审计需要手工制作简历并人工投递,难以适应快速的模型迭代。本文提出一种通用且可复用的方法论,核心步骤如下:
-
使用任务专用的 LLM 代理生成身份中性的基础简历,并在五个受保护特征轴(性别、年龄、居住地、语言、残障)上注入受控的人口属性,形成 $K \times (1+N)$ 的对应审计矩阵。
-
通过与欧盟 AI 法案对齐的提示,定性标记每份简历推断出的受保护特征。
-
利用微调的句向量模型计算简历与职位描述的余弦相似度进行排序,余弦相似度公式为 $cos(\mathbf{v}_1,\mathbf{v}_2)=\frac{\mathbf{v}_1\cdot\mathbf{v}_2}{\|\mathbf{v}_1\|\|\mathbf{v}_2\|}$。
-
计算包含九类指标的公平性套件:
- 反事实指标:分数差异、平均绝对排名变化、翻转率。
- 群体公平指标:Top‑K 保留率、四分之三/影响比率。
- 绩效感知指标:Recall@K、nDCG@K、等机会、等化差错率。 每个指标均提供 bootstrap 置信区间、显著性检验以及 Benjamini‑Hochberg 校正,最终生成 PASS/INVESTIGATE/FAIL 报告并给出综合风险得分。
在一个包含 5 个职位、100 名基础候选人和 10 种人口属性处理的实验中,共评估了 90 项指标‑变体组合。结果显示,所有处理的分数偏移、Top‑K 保留率以及绩效感知差距均在容忍范围内,但 排名稳定性指标(MARC) 与 nDCG@K 暴露出边缘情况——甚至在中性基线上也出现异常,这在仅关注分数或保留率时会被忽略。实验表明,多指标、多维度审计优于单一聚合分数,且基于 LLM 代理的审计能够以低成本补充人工审计,适用于任何候选‑职位匹配流水线。
博主点评:该工作展示了 LLM 在自动化公平审计中的潜力,尤其是在高频迭代的招聘系统中。多指标框架提供了更细粒度的风险洞察,值得在实际产品中推广。