本文提出了一种基于信息增益引导的强化学习传感器选择框架,用于在异构海洋传感器网络中进行单船舶跟踪。该方法受到信息论传感器管理的启发:与其激活所有传感器或反复进行计算开销大的在线期望信息增益评估,不如通过学习的策略在每个决策时刻选择一个与跟踪相关的传感器。\n\n采用贝叶斯序贯蒙特卡罗跟踪器,从噪声测量中估计船舶状态,并为在非线性和非高斯条件下的调度提供信念表示。使用的策略优化代理(Proximal Policy Optimization)选择在塞浦路斯艾亚纳帕海港的CMMI智能码头测试床中部署的五个传感器之一。该代理观察信念状态、检测历史、覆盖范围、传感器几何特性以及实现的信息增益特征。奖励定义为由可观测性掩码限制的实现信息增益项。\n\n最终测试模拟将所提出的框架与随机单传感器选择、同时启用所有传感器的持续感知,以及我们之前工作的期望信息增益传感器选择基线进行了比较。结果表明,学习的策略在每个决策时刻仅激活一个传感器,跟踪性能接近持续感知,同时避免了期望信息增益选择所需的计算开销大的在线熵搜索。\n\n博主点评: 本文通过强化学习优化传感器选择,展示了在复杂环境中有效利用信息增益的潜力。与传统方法相比,所提框架在性能与计算效率之间达成了良好的平衡,具有重要的应用前景。具体的实现细节和实验结果为进一步研究提供了坚实的基础。