本文研究了在随机链路激活条件下,利用无人机(UAV)搭载可重构智能表面(RIS)实现的设备到设备(D2D)通信。模型同时考虑了UAV的三维轨迹与姿态、随时间变化的Rician衰落角度以及角度相关的RIS反射特性。
在此基础上,构建了一个联合优化问题:在满足移动性、能耗以及硬件约束的前提下,最大化系统的平均总速率。该问题的决策变量包括UAV的飞行路径、姿态角以及RIS的相位矩阵。
为求解该高维非凸问题,本文采用深度强化学习(DRL)框架,并进一步引入Decision Transformer。Decision Transformer在多个场景下收集的专家轨迹上进行离线预训练,使模型能够捕获跨场景的策略模式。实验表明,零样本迁移(zero‑shot transfer)显著优于直接的DRL迁移,而在线微调(online fine‑tuning)在交互次数更少的情况下即可达到与传统DRL相当的性能。
点评