NeFut Logo NeFut
EN 管理员登录

[AI学术] 用于识别、分类和解释 AI 生成代码偏见的框架

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #LLM

随着大语言模型(LLM)逐步融入软件开发流程,AI 生成代码中的潜在偏见引发关注。已有证据表明此类偏见存在,但系统化的识别、分类与解释研究仍然缺乏。本文提出一种基于分类法的框架,用于检测并解释 AI 生成代码中的偏见。

我们在已有的偏见 Python 代码数据集基础上进行扩展,并人工标注每段代码的偏见类别及对应的解释,构建了可靠的真值集。随后,利用该数据集对商业闭源模型和开源模型进行零样本提示(ICL)评估,分别测量其偏见检测准确率和解释相似度。

实验结果显示,Gemini 在分类任务中取得 80.14% 的准确率,精确率 84.0%,召回率 95.7%。开源模型 Qwen3‑coder 的准确率为 82.45%,精确率 68.64%,召回率 80.22%。在解释层面,两者相对于人工解释的相似度分别为 80.4% 与 80.14%,代码定位相似度分别为 86.0% 与 87.82%。这些数据表明 LLM 能够有效识别生成代码中的偏见逻辑,并给出与专家解释高度一致的说明。

点评

原文链接: https://arxiv.org/abs/2609.30642

[h] 返回首页