NeFut Logo NeFut
EN 管理员登录

[AI学术] 如何训练你的世界模型:微调 vs RAG 在基于语言模型的世界建模中的比较

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

世界模型(World Model,WM)用于模拟环境的转移动力学,使智能体能够对行为的后果进行规划。在文本交互环境中,微调语言模型(LM)以充当 WM 已成为主流方法。尽管检索增强生成(RAG)在非参数化任务中表现优异,但其在 LM‑based 世界建模中的应用仍未得到系统研究。

我们在五类环境(包括具身、网页导航和社交场景)上进行系统评估,对比了微调和基于 RAG 的两种构建方式。实验表明,微调 WM 在 15/20 的设置中获得更高奖励,整体上优于 RAG。两种方法都受益于更丰富的探索数据;RAG 在数据利用率上更高,而微调则在经验规模扩大时收益更显著。

针对 RAG‑based WM,我们提出一种利用反事实干预估计检索阶段错误率的流程,发现检索器常常返回经验缓冲区中的次优转移。为缓解该问题,我们探索了多种查询重构策略,结果显示层次化检索方案优于传统流水线。

最终,我们将上述发现整合为一种混合世界模型:核心环境动力学由参数化模型捕获,辅助记忆库通过主动维护的检索机制提供补充信息。该混合系统在多个环境和模型上持续超越其他方法,验证了其鲁棒性和实用性。

点评

原文链接: https://arxiv.org/abs/2610.02542

[h] 返回首页