NeFut Logo NeFut
EN 管理员登录

[AI学术] 代理是否知道自己成功?从内部表征校准代理置信度

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#AI #LLM #DeepSeek

随着代理系统在安全关键领域的快速落地,衡量其行为置信度变得尤为重要。相较于传统机器学习模型,代理工作流涉及规划、工具调用和动态环境交互,导致更复杂的失效模式。本文探讨模型内部表征能否提供比表层生成更强的任务成功信号。我们提出两种互补方法:

在 Bash、SQL、Python 三个交互基准以及 Qwen14B、Qwen7B、DeepSeek6.7B 三类模型上实验表明,LTD 与 ARP 均显著超越基于生成表层或序列校准的基线。该监控器无需修改提示或进行多样本回滚,几乎不增加计算开销。

点评:本文提供了一套轻量且通用的置信度校准方案,为安全可靠的代理系统部署提供了实用工具。

原文链接: https://arxiv.org/abs/2609.09448

[h] 返回首页