在当前的对齐方法中,通常侧重于使用静态的人类偏好表现来模拟人类行为,这未能捕捉到现实世界中人机交互的动态和上下文依赖特性。本文主张应从静态和模拟的对齐转向互动和互补的对齐,其中偏好通过互动而产生,对齐不仅仅由满足偏好来定义。
我们首先通过对比现有对齐方法与轨迹级视角,正式化这一差距,强调人类与模型行为在时间上的共同演化。由于这些交互动态在现有的机器学习框架中尚未得到充分捕捉,我们基于跨学科研讨会的见解来扎根这一观点。
我们借鉴人类间合作的社会科学经验,认为人机系统放大了这些动态,带来了新的不对称性,使得对不确定性的推理变得更加困难,并引入新的协调挑战。基于这些经验教训和新挑战,我们最终概述了一个研究议程,以开发与人类在互动中对齐的AI系统,这需要机器学习与社会与决策科学的跨学科综合。
博主点评: 本文提出的动态人机对齐思路对现有AI技术的局限性进行了深刻反思,强调了互动性的重要性。这一研究方向不仅丰富了AI与人类合作的理论框架,还为未来的AI系统设计提供了新的视角,值得关注。