近期,arXiv 上发布了一篇题为《TRACE:人类 AI 控制器协调下的多层次基准测试》的论文。该论文提出了一个名为 TRACE 的基准测试,用于评估人类、AI 决策模块和自动控制器在单一控制循环中的协调。TRACE 基准测试通过在 ALFRED 基准测试中注入受控的漂移,生成了 1,918 个带有漂移的轨迹。每个轨迹都是一个时间对齐的、五层执行记录序列(状态、观察、决策、规则、控制),并且带有漂移类型、受影响层、开始时间、负责的执行者和因果机制的标签。验证结果表明,在泄漏感知协议下,漂移可以被识别和归因于相应的层和执行者。博主点评: TRACE 基准测试为人类 AI 控制器协调下的多层次评估提供了一个新的视角,能够帮助我们更好地理解漂移和故障在多层次系统中的传播机制。