评估任务导向对话代理不仅要判断回复的语言流畅度,还要确认每轮对话是否正确推进了底层工作流状态。传统的整体 LLM 判官往往把整个上下文视为一个整体评估,且每轮需要一次或多次完整模型调用,容易漏掉状态层面的错误。
SAGE(State-Grounded Abstention-Aware Evaluation)通过编译工作流规范和每轮的状态差分,将评估目标拆解为原子化、基于模式的判定标准。每个标准随后进入符号规则与编码器/自然语言推理(NLI)验证器的级联链路,这些验证器在不确定时会选择回避(abstain)而不是盲目猜测,并将各判定结果聚合为轮级决策,同时保留证据追踪。
SAGE 的推荐运行模式 SAGE-Core 仅使用编译器、符号规则和本地编码器,就能在 81%–91% 的标准上作出决定,且无需付费 LLM 资源。SAGE-LLM 在此基础上提供可选的聚焦 LLM 回退,用于处理开放类标准。
在四个数据切片(MultiWOZ、Schema‑Guided Dialogue、ABCD 等)上,所有已评估的 LLM‑as‑judge 基线(包括状态感知的 GPT‑4.1 判官及更廉价的 GPT‑4.1‑mini 变体)均未在任何切片上显著超越 SAGE-Core。相比之下,GPT‑4.1 的 G‑Eval 判官每千轮成本约为 $4.7$–$8.0,而 SAGE-Core 的成本接近 $0。
一次双标注人工审计(n=200,$\kappa$=0.94)表明,在对话记录可见的失败类别上,SAGE-Core 与最强 LLM 判官的标签一致性统计上持平(除弱显著性的 IUV 类外),并且能够将被忽略的用户价值合理地视为状态一致性信号,尽管其在人类广泛关注度上较弱。我们进一步分析了注入错误和部分符号循环带来的构建效度限制。
点评