随着大语言模型(LLM)越来越多地通过工具执行任务,它们需要在采纳用户指令、内部参数知识以及动态环境观测之间进行调和,才能做出正确的行动。为此我们提出 KC-Bench,一个受控的多轮基准,用于量化模型在三类冲突情境下的表现:世界知识冲突、输入不一致以及多源时间冲突。
基准从超过 1,000 条生成候选中手工筛选出 238 任务,组合了用户模拟器、带状态的工具、确定性的环境断言、开源自然语言评估器以及人工轨迹验证模块。每个任务要求模型在对话过程中检测并纠正冲突,然后安全地调用工具或生成输出。
我们在九个模型上进行评估,包括 DeepSeek‑V4‑Flash、GLM‑5.2、MiniMax‑M3 等。实验显示,各模型在跨领域表现上差异显著:没有任何模型能够在事实纠正、身份一致性检查和时间冲突解决三个维度上实现全覆盖。尤其在模拟环境中,冲突未被识别会导致错误的工具调用或合成受保护数据的流动。
KC-Bench 关注模型层面的冲突处理能力,而非整体代理框架的排名,提供了可复现的诊断手段,帮助研究者构建具备冲突感知推理和执行防护的系统。
点评