AI 代理如何决定遵循哪些规则?一条规则允许行为,另一条可能设条件、例外或冲突义务。确定系统在规则明确时能解析关系,但语言中隐含的规则会导致遗漏。完全拒绝未解析的行为会安全却阻止合法操作。我们最初假设几何度量能提供判断依据。把动作和策略表示为向量,检验其几何关系能否识别支配策略并解释动作与之的关联。四项实验表明,这些方法未能实现可靠的事前判断。最后的合成实验中,词汇路由器找到了所有支配和阻断策略,并将中位检查次数降低 97.7%。但整个流水线仍把 2,304 条测试动作全部上报,包括本应放行的。把所有策略喂给同一下游模块并未改变决定。找到策略并未解决解释问题。于是我们修正假设:AI 判断需要构建后果图,将行为主体、权威、策略条件、例外以及动作产生的变化关联起来。后续研究将检验显式关系是否帮助代理区分行动、停止或请求复审的时机。
点评