现有的离线目标条件强化学习(GCRL)方法在处理长时程任务时表现不佳。折扣因子会使得远距离状态之间的价值差异被压缩到函数逼近误差以下,导致智能体失去对状态排序的信号。时间抽象通过把 $k$ 步环境交互视为一次转移,能够在长距离上恢复价值差异,但单一固定的 $k$ 无法兼顾所有状态‑目标距离:较大的 $k$ 能保持远程价值差异,却会模糊相邻状态的区分;较小的 $k$ 则相反。为了解决这一权衡,本文提出 广义隐式时间抽象 (GITA),它在同一个价值函数上显式条件化 $k$。GITA 通过在多个 $k$ 上聚合优势加权的监督信号来训练单一策略,优势为正且规模更大的状态‑目标对在更新中占更大权重。这样,GITA 不必在局部分辨率和长程信号之间做出取舍,能够同时保留两者而无需固定 $k$。实验在 OGBench 基准上进行,GITA 超越了多种离线 GCRL 基线,在所有任务上的平均成功率提升了 25 个百分点(相对提升 73%),相较于最强的固定 $k$ 方法 OTA 提高了 7 个百分点(相对提升 14%)。
点评:GITA 通过对 $k$ 的显式建模,实现了多尺度价值估计的统一框架,显著提升了长时程目标导向任务的离线学习效果,为时间抽象在强化学习中的应用提供了新的思路。