NeFut Logo NeFut
EN 管理员登录

[AI学术] 中文竞技辩论数据集与基准

发布于:2026-09-22 22:00 最后更新:2026-09-24 00:40
#AI #Machine Learning #LLM

辩论裁判需要追踪论点在交互中的演变,但现有数据集很少同时提供细粒度的辩论转录和真实比赛中专业评委依据统一量表给出的判决。我们构建了一个面向中文竞技辩论的全新数据集与基准,覆盖比赛、阶段和发言人三个层级。我们组织了 182 场比赛,邀请 120 位专业评委,每场比赛由三位评委独立依据预设量表打分。

剔除记录不全的比赛后,数据集保留 148 场比赛、2,698 个阶段、20,542 条交流单元,所有转录和分段均经人工核验,并保留原始阶段得分、比赛投票、最佳辩手票以及裁判理由。基于此我们设定了三项任务:预测胜者倾向、预测阶段得分、预测最佳辩手。

对多种大语言模型进行零样本评估,最高的胜者预测准确率为 66.2%,阶段得分与人工平均评分的皮尔逊相关系数最高为 0.250,最佳辩手预测准确率最高为 56.8%。该数据集与基准为研究大模型在交互式论证理解以及与专业裁判一致性提供了实验平台。点评

原文链接: https://arxiv.org/abs/2609.21637

[h] 返回首页