本文研究人类行为控制的习惯性与目标导向两大机制。传统类人代理主要建模目标导向行为,忽略了日常生活中关键的习惯行为。我们提出一种受人类行为控制启发的框架,包括习惯控制器、目标导向控制器和仲裁器。习惯控制器从个性化的习惯记忆中检索由线索触发的行为;目标导向控制器利用上下文感知的世界模型预测动作后果并估计价值;仲裁器根据个体差异和瞬时内部状态动态平衡两者的影响。为在三维环境中生成多样的人类级指令,我们进一步设计了关键帧引导的三维运动生成模块。大量实验、用户研究和消融实验表明,加入习惯行为和多系统协同显著提升了代理的人类相似度。
点评