随着代理系统在安全关键领域的快速落地,衡量其行为置信度变得尤为重要。相较于传统机器学习模型,代理工作流涉及规划、工具调用和动态环境交互,导致更复杂的失效模式。本文探讨模型内部表征能否提供比表层生成更强的任务成功信号。我们提出两种互补方法:
- 潜在轨迹动力学(LTD):在交互轨迹上汇总残差流表征的变化,以捕捉隐藏的成功趋势。
- 动作表征探针(ARP):在做出动作决策时直接预测成功概率。
在 Bash、SQL、Python 三个交互基准以及 Qwen14B、Qwen7B、DeepSeek6.7B 三类模型上实验表明,LTD 与 ARP 均显著超越基于生成表层或序列校准的基线。该监控器无需修改提示或进行多样本回滚,几乎不增加计算开销。
点评:本文提供了一套轻量且通用的置信度校准方案,为安全可靠的代理系统部署提供了实用工具。