NeFut Logo NeFut
EN 管理员登录

[AI学术] 人工身份:驱动与持久对齐在能动 AI 中的作用

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#algorithm #AI #Machine Learning

在近期的研究中,能动 AI 正在从仅执行受限任务的模式,转向能够保留重要状态、跨任务持续运行并自行适应的系统。这一转变带来了控制难题:现有的目标设定、重试、验证、停止规则等行为转移大多需要人工外部指定。为此,作者提出“人工身份”(artificial id),即一种自适应的内部驱动力,用来判断行为是继续、停止还是改变。

作者在一个极简的虚拟培养皿实验中验证了该概念。实验中的控制器体积极小,无法进行通用推理,也没有任务特定的行为目标。它仅通过“差异化持久性”(differential persistence)学习到有用的控制策略。当某种行为在环境中能够更持久地存在时,控制器会倾向于采用该行为,即使这是一种未预期的物理策略;当环境意义改变时,它还能自行替换先前学习的传感映射。

这些结果表明,适应性的方向可以在没有显式行为目标的情况下自然出现。然而,同样的持久性也可能导致对齐失效、状态腐化以及跨任务的意外行为。若要构建可扩展的人工身份,需要让其在任务边界之间携带关键的状态和驱动力,使对齐成为持续的系统属性,而非单次模型响应或轨迹的属性。实现这一目标必须建立持久的对齐边界,涵盖可信观测、因果通道、持久状态、权威、身份、来源以及硬约束等要素。

点评

原文链接: https://arxiv.org/abs/2609.11911

[h] 返回首页