摘要
温室强化学习能够以难以通过单纯的作物实验实现的速度和规模测试气候控制方案。然而,对于智能温室控制而言,单一的模拟器返回值并不足够:种植者或控制工程师还需要了解策略何时进行加热、富集 CO2、通风、管理湿度、部署遮阳网或使用灯具。
我们提出了一种可复现的校准优先奖励审计框架,该框架使得命名的温室控制奖励组件在模拟器训练、适应设施的实施、记录的自主温室挑战记录和执行器规则提炼之间保持可比性。在 GreenLight-Gym 中,该框架将标量奖励分解为条件温度、CO2、湿度和蒸汽压力缺失、遮阳网和执行代理项;将 GreenLight 适应于第二届自主温室挑战的记录气候轨迹;并对记录的温室数据上的相同组件进行评分。
博主点评: 本文提出的校准优先奖励审计框架为优化温室环境控制提供了重要思路,通过分解奖励机制,提升了控制策略的可解释性和可比性,对智能农业领域具有重要的应用价值。