NeFut Logo NeFut
EN 管理员登录

[AI学术] 突破性进展:生成代理在社会模拟中的步骤级偏好学习

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:18
#algorithm #AI #Machine Learning

在大型语言模型(LLM)基础上,生成代理通过长远决策过程模拟人类行为,这些过程包括规划、记忆检索、反思和行动选择等中间步骤。然而,对这些中间步骤的细粒度人类注释仍然稀缺,现有代理未能基于人类对这些中间决策的偏好进行构建。为了解决这一问题,我们引入了 \method,这是一个交互式模拟界面,使我们能够收集代理决策轨迹上的步骤级人类偏好监督,从而形成一个包含 57K 细粒度注释的数据集。我们在开放权重的语言模型上进行步骤级偏好学习,采用监督微调和直接偏好优化,持续提升了模拟的逼真度、协调性和互动质量,促使代理行为更加社会有效。我们的结果表明,步骤级人类监督是改善局部决策质量和长远代理行为的有效训练信号。

博主点评: 本文提出的步骤级偏好学习方法为生成代理的训练提供了新的视角,尤其是在缺乏细粒度人类注释的情况下,利用人类偏好进行监督显著提升了模拟效果。这种方法有望推动社会模拟领域的发展,尤其是在更复杂的人类行为交互场景中。未来的研究可以进一步探索如何在更广泛的应用中实现此方法。

原文链接: https://arxiv.org/abs/2607.14485

[h] 返回首页