NeFut Logo NeFut
EN 管理员登录

[AI学术] LLM 代理环境中的行动结算审计:顺序、进展与重放

发布于:2026-10-03 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

在大语言模型(LLM)代理环境中,多个代理的并发行动即使各自合法也需要仲裁。我们实现了一种带类型的快照‑结算合约,并审计了三个关键属性:顺序敏感性、有效进展以及重放一致性。针对五种结算策略,开展了 28,800 组全排列实验和 2,160 组脚本化多步情景。结果显示,联合策略在固定优先级下对空间顺序保持不变,但保守拒绝策略在六代理人门口任务中仅完成 31.25% 的代理,而随机票据策略完成率达 90.28%,提升幅度为 59.03 个百分点(95% bootstrap 区间:50.00‑68.06)。所有策略均满足空间约束,然而基于优先级的仲裁仍未达到独立小实例的最优解。另一次全状态日志审计能够精确重放 156 个检查点,并在保留终端锚点的前提下拒绝了 1,332 条构造的损坏记录。上述证据关注的是执行语义,而非人类真实感或长期公平性。

点评

原文链接: https://arxiv.org/abs/2610.01138

[h] 返回首页