本文将光伏(PV)政策设计视为一个序列决策问题,结合强化学习(RL)与随机主体模型(ABM)模拟年度光伏采纳过程。决策者在 16 年的时间跨度内每年选择激励手段,包括资本补贴、优惠贷款利率和上网电价。采用标量化奖励框架,将采纳量与公共支出通过权重 $w_{\text{cost}}$ 进行平衡。\
使用 PPO、SAC、TD3 三种算法进行策略学习,并在随机仿真环境中评估。结果显示,最高采纳策略(TD3,$w_{\text{cost}}=0.5$)实现约 4,145 名采纳者,成本 41.73 百万欧元;最低成本策略(PPO,$w_{\text{cost}}=2.0$)将支出降至 7.27 百万欧元,采纳者为 2,682 名;平衡策略(PPO,$w_{\text{cost}}=1.6$)实现 3,495 名采纳者,成本 22.47 百万欧元。不同算法均呈现一致的采纳‑成本权衡,表明该关系具有鲁棒性。相较于静态基线政策,RL 框架能够探索更广泛的政策配置空间,展示了在不确定环境下自适应政策设计的潜力。\
点评