NeFut Logo NeFut
EN 管理员登录

[AI学术] DIAL:带自适应人类偏好校准的位置信息偏差LLM评审框架

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#Machine Learning #LLM #Artificial Intelligence

大型语言模型(LLM)可以作为评审者实现大规模评价,但其判断往往受答案顺序影响,即使去除顺序效应后仍可能系统性偏离人类偏好。DIAL 提出一个统一框架,利用大量 LLM 比较和少量人工比较,分离评审者的顺序效应,学习去偏后的 LLM 偏好共享结构,并通过自适应校准将该结构对齐至人类偏好目标。理论上,DIAL 分别研究了三点:① 潜在 LLM 偏好、顺序效应与人类校准的可识别性;② 在有限人工证据下平衡 LLM 锚定的自适应估计;③ 对校准后人类偏好的固定权重不确定性量化。实验方面,作者在受控仿真和三个真实人类偏好基准上分别评估了去偏和对齐效果,结果表明 DIAL 对不平衡的答案顺序保持鲁棒,使用少量标签即可获得与人类高度一致的排序,并在 LLM 信息不完备时能够向人工证据自适应收敛。实际数据收集了 21 种 LLM 在两种展示顺序下的 410K 条判断,为后续研究 LLM 评审偏差、异质性和人类对齐提供了资源。

点评:DIAL 展示了在有限人工标注下,通过结构化去偏和自适应校准实现高效人类对齐的可行路径,为评审系统的公平性和可靠性提供了新思路。

原文链接: https://arxiv.org/abs/2609.31215

[h] 返回首页