在自主系统(包括自主物联网AIoT)中,强化学习(RL)被广泛应用以提升性能。然而,RL的试错性质在真实环境中进行时,成本高昂且在某些场景中存在风险。因此,大多数RL研究在模拟环境中进行,这种依赖性引入了与模拟到真实(Sim-to-Real)迁移相关的挑战。评估Sim-to-Real算法的鲁棒性及其差距是提升RL在现实世界中表现的关键前提。
为了应对这些问题,我们开发了一种用于研究AIoT中RL的真实世界平台。在该平台上,部署在边缘设备上的智能体通过硬件模拟键盘在单独的主机计算机上玩视频游戏,并通过视觉输入进行引导。该平台使用市场上可获得的组件,成本低于400美元,并配备两台计算机。由于系统的目标是游戏分数最大化,因此固有地降低了与现实世界RL部署相关的安全风险。
实验结果表明,经过模拟训练的智能体在真实世界部署后相较于人类水平的表现下降了1160%,显示出显著的Sim-to-Real差距。使用深度Q网络(DQN)算法进行直接的真实世界训练,在经过1000万步训练后,达到了约38%的人类水平表现,证明了在真实条件下应用RL的可行性。这些结果表明,所提出的Sim-to-Real基准平台为现实世界AIoT系统中RL的定性和定量评估提供了坚实的基础。
博主点评: 本文提出的基准平台为AIoT领域的强化学习研究提供了重要的实验基础。通过降低成本并减少安全风险,研究者可以在更广泛的应用场景中评估RL算法的实际表现,推动技术的实用化进程。值得期待的是,该平台如何影响未来的RL研究与应用。