NeFut Logo NeFut
EN 管理员登录

[AI学术] 风险感知自适应评估:在有限预算下发现高影响失效

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #optimization

评估交互式智能体成本高且行为随机,需要在多次试验中衡量可靠性。传统基准把预算均匀分配,例如只读查询和不可逆支付动作的试验次数相同,导致大量预算浪费在几乎不出现失效的场景。我们将评估建模为固定预算下的顺序分配问题:在未知失效分布的若干场景中,决定哪些场景需要执行以及是否重复执行。为此提出风险感知上下文 Thompson 采样策略,利用每个场景的上下文向量、固定的影响分数以及评估过程中观察到的失效结果进行后验更新。我们在 70 条 τ‑bench 航空场景和 824 条记录试验上进行离线回放实验。最小预算(仅 50 次试验,约占语料库的 $6\%$)时,策略能够恢复 oracle 可发现的影响加权失效的 $86\%$,而均匀分配仅为 $25\%$。在相同试验数下,发现的影响加权失效数量提升 $3.5\times$($215.4$ vs. $62.2$),每美元发现率提升 $5\times$,且对从未失效的场景的预算浪费从 $34\%$ 降至 $2.8\%$。进一步分析表明,随着预算接近语料库规模,优势逐渐减弱;配对显著性检验显示,场景上下文在小预算时贡献显著,而基于后验的探索在中等预算时更为关键。风险感知自适应分配正好在预算最紧张时提供最大收益。

点评:该工作展示了在资源受限的评估环境中,结合上下文信息和贝叶斯探索的策略能够显著提升高影响失效的发现率,为实际系统安全评估提供了可行路径。

原文链接: https://arxiv.org/abs/2609.38914

[h] 返回首页