智能温室强化学习新框架:校准优先的奖励审计方法
在智能温室控制领域,强化学习能够以远超实际作物实验的速度和规模测试气候控制方案。然而,仅凭模拟器返回的单一奖励值并不足以满足实际需求——种植者或控制工程师需要确切知道AI策略在何时执行加热、增补二氧化碳、通风、调节湿度、部署遮阳屏或使用补光灯等具体操作。
为此,研究团队提出了一种可复现的“校准优先奖励审计框架”。该框架通过将温室控制奖励分解为可命名的组件,确保在不同场景下保持可比性:包括模拟器训练、设施适配部署、记录的“自主温室挑战赛”数据以及执行器规则提炼过程。
在GreenLight-Gym环境中,该框架将标量奖励分解为条件温度、二氧化碳浓度、湿度与蒸汽压差、遮阳屏控制以及执行器代理等多个独立项。研究还将GreenLight适配到第二届自主温室挑战赛记录的气候轨迹数据中,并对相同组件在真实温室记录数据上进行评分验证。
这一方法为农业AI控制提供了更透明的决策洞察,有助于推动智能温室从黑箱优化向可解释、可审计的精准控制演进。