大规模文本标注常依赖专家制定的代码本,将 AI 标注器的输出统一到一致的标签体系。传统上,代码本的迭代需要数月时间,因为需要人工审阅大量标注结果并不断修正规则。本文提出利用大语言模型(LLM)之间的分歧来快速定位最需要专家介入的样本,从而把数月的工作压缩到数天。
我们设计了三种基于跨模型分歧的专家反馈方式:
- 代码本验证:在多个 LLM 对同一文本给出不同标签时,生成修订建议,专家直接编辑这些建议;
- 问答:专家回答关于分歧样本的具体问题,以帮助模型理解冲突根源;
- 理据标注:专家为分歧样本提供标注理由,模型据此学习更精准的判别。
在数千条辅导会话转录上进行实验,理据标注的 LLM 标注准确率达到 64.9%,显著高于仅使用专家修订代码本得到的 57.8%。最佳的问答设置也取得 60.5% 的准确率,均超过基线。实验表明,跨模型分歧能够有效聚焦专家注意力,使代码本的迭代周期从数月缩短到数天,同时保持甚至提升标注质量。
该方法的核心逻辑是:
- 使用多个 LLM 同时标注同一批数据;
- 统计标签分布,挑选分歧度最高的样本;
- 将这些样本交给专家进行有针对性的反馈;
- 将专家反馈回流到 LLM,更新代码本或直接微调模型。
通过上述闭环,系统能够在最少的人工成本下快速收敛到高质量的标注方案。
点评