NeFut Logo NeFut
EN 管理员登录

[AI学术] Dude:用于论文代码不一致检测的双检测多智能体系统

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#algorithm #Machine Learning #LLM

随着科研论文数量激增,基于大语言模型(LLM)的论文‑代码不一致检测成为热点。传统的单智能体 LLM 方法受限于上下文容量,且只能单向检查,导致召回率不足。\ \ 本文提出 Dude,首个采用双检测、多智能体架构的系统。我们发现论文语言与代码语言的粒度不对称会引发过度解释过度报告,进而产生大量误报。为此,Dude 引入两项关键机制:\

  1. 粒度对齐协商:在两个智能体之间共享粒度信息,确保它们在同一抽象层次上对比论文描述和代码实现。\
  2. 两阶段显著性过滤:第一阶段基于语义相似度筛除低相关片段;第二阶段利用结构化提示进一步验证潜在不一致,仅保留高置信度的报告。\ 实验在真实的论文‑代码不一致数据集上进行,Dude 的召回率和精确率相较基线提升最高 22.8%,F1 分数提升 18.7%。\ \ 点评
原文链接: https://arxiv.org/abs/2609.03416

[h] 返回首页