NeFut Logo NeFut
EN 管理员登录

[AI学术] 校准LLM代理的准则修订:失效模式与基于追踪的协议

发布于:2026-08-24 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning #LLM

语言模型代理在出现错误后可以自我改进,或在跨回合时携带文本而不更新成功判据。本文聚焦更窄的归因问题——准则修订:当准则 $K_0$ 接受了违背更宽承诺 $B$ 的结果时,哪些观测能够支撑系统已经形成并持续使用了新的准则 $K_1$?

我们提出了五个非补偿性条件:① 检测准则失效;② 模型主动给出修订提案;③ 在新回合中能够转移该提案;④ 对声称的承载者进行干预时表现出敏感性;⑤ 保持修订后的行为不被意外覆盖。只有同时满足这五条,才能认定出现了真正的准则修订。

实验使用 CMB‑0.1 在十二个跨领域案例上进行评估,分别在四种执行臂上运行:无状态推理、仅追加历史、模型生成但由外部 harness 提交的状态、以及评估者手写的 oracle 状态。共设置七种机制装置,产生 84 次确定性评分器试验;四个本地量化工件导致 96 次调用,进而形成 192 次模型‑案例‑臂组合试验。

结果显示,没有任何模型试验同时满足全部五个条件。虽然零成功并不等同于普遍缺乏能力,但已暴露出多类失效模式:如 Qwen2.5‑7B 在每一次转移与保持项上都给出答案,却未提供任何修订状态,表明其能够在零状态下重构信息。其他失效包括:多次调用后仍无效、承诺泄露目标区分、harness 实际执行提交、删除操作导致无状态调用被复用、冲突导致多因素变化等。

基于这些诊断,我们提出了面向未来的 CMB‑0.4 协议。该协议要求:① 隐蔽的转移过程;② 明确的 WRITE/NO‑WRITE/ESCALATE 动作标记;③ 单独记录的策略选定提交;④ 匹配的干预实验;⑤ 重复的隐藏项检测;⑥ 冻结的可执行 oracle。CMB‑0.4 旨在提供更具辨别力的测试框架,而非已经完成的确认性结果。

本文的主要贡献在于:构建了一条完整的测量链、对首个实现(CMB‑0.1)进行经验性诊断、并提出了更严格的后续协议以支撑准则修订的未来评估。

博主点评:本文深入剖析了 LLM 代理在自我修订过程中的盲点,实验设计严谨且透明。虽然当前实现仍未达到全部条件,但提出的 CMB‑0.4 框架为后续研究提供了清晰的路线图,值得关注。

原文链接: https://arxiv.org/abs/2608.20729

[h] 返回首页