参考答案作为评判基准的 LLM‑as‑a‑judge 方法默认参考答案即为目标答案。实际部署的智能体系统会在动态实体(如工单、资产、账户)上执行操作,此时最接近的参考答案往往对应不同实体的正确流程,导致评判把标识符、日期、状态的差异误判为错误或幻觉,这一现象称为参考实例分歧(RID)。
CARGO 框架针对 RID 提出三项改进:① 将检索到的参考答案视为过程示例,并在实时实例的观察上下文中进行事实判断;② 为每条陈述分配三种状态(支持、矛盾、不可验证),仅对矛盾进行惩罚;③ 依据检索置信度对评估进行门控,将生产环境评估视为选择性预测。
为验证 CARGO 的效果,作者构建了 CARGO‑Bench——基于扰动的诊断套件,内部生成真值,能够区分宽容度与判别力。在 246 条项目、两种评判模型、7872 次判断的实验中,传统的参考基准评判对所有实体迁移正确的答案都给出 100% 的惩罚,判别指数 DI 接近 0;即使直接提供实时事实也未改变结果。CARGO 消除了这些误罚(0/50),同时保持几乎完整的矛盾召回(50/50 与 49/50),DI 提升至 0.58 [0.48, 0.68]。对照实验表明,主要收益来源于基于上下文的维度定义。
然而,CARGO 本身也存在局限:对实体值的宽容会抑制对过程错误的检测,导致仅 20% 的过程腐败被捕获。后置修正未能弥补这一缺口,使用 LLM‑as‑annotator 并配合书面指南与仲裁的实验同样出现该盲点。
作者公开了预注册的扩展协议,可用于在真实流量上评估专家一致性、风险覆盖率与成本等指标。
点评