最近几年,人工智能因大规模模型具备泛化能力和生成复杂输出而取得突破。然而,将这种潜能转化为具身代理时出现关键瓶颈:最先进的系统仍依赖已有数据集和人类反馈,这在动态或未知情境中往往不足。
为实现适应,代理必须通过与环境的直接交互获取知识。一种可行策略是引入内在动机机制,如好奇心和能力感,以驱动在复杂环境中的探索与学习。
这种自主性提升了灵活性,却使保持与人类目标的一致性(对齐)更加困难。对齐本已是人工系统的难题,在缺乏结构的动态情境中更为棘手,预设规则难以覆盖所有情况。
因此,规范应通过经验的认识论过程形成:从简单、情境化的原则出发,借助自主学习和与其他道德主体的合作,逐步构建更复杂的规则体系。
类似儿童通过探索环境并参与集体实践来学习社会规范,人工代理也需要通过教育过程实现对齐。依据Dennett的观点,道德主体的地位并非天生,而是随着其负责任管理日益增长的自由度而逐步赋予。
从这一视角看,监管沙盒可视为AI的教学环境——动态空间中,代理通过交互与合作,在日益复杂的情境下形成对齐行为。
点评:本文提出将对齐视为一个发展过程,借鉴儿童社会化机制,为构建可在未知环境中安全自主的人工代理提供了新思路。