NeFut Logo NeFut
EN 管理员登录

[AI学术] ChronoSRL:用于自监督强化学习的时间几何

发布于:2026-09-30 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #optimization

目标在空间上很近,却可能在时间上很远。障碍、地形以及智能体的能力决定了到达目标所需的时长。现有的对比学习和生存强化学习的评价函数并未在表征空间中使用时间单位来衡量距离。为此我们提出 ChronoSRL,使评价函数的嵌入拥有显式的时间几何。状态‑动作与目标的嵌入距离被训练为匹配智能体到达目标的实际时间(goal‑reaching time),而未达成的目标以及来自其他轨迹的目标则被强制推至至少一个折扣时域之外。

仅凭一次快速到达并不能说明该目标一般可可靠到达,因而策略不应直接追随时间距离。我们基于生存强化学习,在时间嵌入上预测目标到达时间的完整分布以及在目标附近停留的时间。这样,策略被训练为倾向于更快、更可靠地到达目标,并保持在目标附近。

实验在七个标准的行走与导航基准上进行,ChronoSRL 相比对比学习、块状对比学习以及生存强化学习基线学习更快、性能更高,即使使用的网络规模更小。为了检验自监督强化学习的极限,我们在逼真的仿真‑真实四足机器人平台上加入了速度跟踪、目标位置到达和箱子攀爬任务,并展示了机器人常用的 shaping 项可以自然地融入本框架。ChronoSRL 是所有测试方法中唯一能够保持指令速度、精确到达目标位置并成功攀爬最高箱子的算法。

点评:ChronoSRL 通过在表征空间引入时间度量,解决了空间距离与实际时间不一致的问题,并通过预测时间分布提升了策略的可靠性和鲁棒性,展示了自监督强化学习在复杂机器人任务中的潜力。

原文链接: https://arxiv.org/abs/2609.36238

[h] 返回首页