NeFut Logo NeFut
EN 管理员登录

[AI学术] KC-Bench:用于评估LLM代理知识冲突的动态交互式基准

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#AI #LLM #Open Source

随着大语言模型(LLM)越来越多地通过工具执行任务,它们需要在采纳用户指令、内部参数知识以及动态环境观测之间进行调和,才能做出正确的行动。为此我们提出 KC-Bench,一个受控的多轮基准,用于量化模型在三类冲突情境下的表现:世界知识冲突、输入不一致以及多源时间冲突。

基准从超过 1,000 条生成候选中手工筛选出 238 任务,组合了用户模拟器、带状态的工具、确定性的环境断言、开源自然语言评估器以及人工轨迹验证模块。每个任务要求模型在对话过程中检测并纠正冲突,然后安全地调用工具或生成输出。

我们在九个模型上进行评估,包括 DeepSeek‑V4‑Flash、GLM‑5.2、MiniMax‑M3 等。实验显示,各模型在跨领域表现上差异显著:没有任何模型能够在事实纠正、身份一致性检查和时间冲突解决三个维度上实现全覆盖。尤其在模拟环境中,冲突未被识别会导致错误的工具调用或合成受保护数据的流动。

KC-Bench 关注模型层面的冲突处理能力,而非整体代理框架的排名,提供了可复现的诊断手段,帮助研究者构建具备冲突感知推理和执行防护的系统。

点评

原文链接: https://arxiv.org/abs/2609.03588

[h] 返回首页