温室种植的本质,是在一个封闭空间里为作物创造最适宜的环境。听起来简单,做起来难:温度、湿度、光照、CO₂ 四个要素互相耦合——开窗通风可以降温除湿,但会损失 CO₂ 和热量;补光提高光合速率,同时又会抬升温度和空气饱和差。
传统的做法是设定独立的阈值:温度超过 28 度开窗,湿度超过 85% 启动除湿。这种"单点控制"在大多数时候有效,但无法处理要素之间的冲突,也做不到"提前调节",永远在被动响应。
我们尝试的方案,是用强化学习训练一个环境控制器。状态输入包括温室内外温湿度、光照强度、CO₂ 浓度、天气预报与番茄当前生育阶段;动作空间包括天窗开度、遮阳幕开合、湿帘风机档位、补光灯与 CO₂ 施放阀;奖励函数则综合了环境偏差、能耗与生长模型预测的光合累积量。
训练的难点在于"试错成本":真实的温室不能承受反复折腾。我们先用历史数据训练一个环境仿真模型,让控制器在仿真中学习,再迁移到真实温室,并设置安全护栏——任何动作都不能让环境参数超出作物可忍受的范围。
控制器上线后的一个完整生产季,数据是这样的:产量提升 23%,能源消耗下降 11%。更有意思的是它的控制策略与老技术员的经验完全不同——它会在清晨提前小幅降温,为白天的升温预留缓冲;会在光照不足的午后补光而不是上午,因为上午的 CO₂ 浓度更充足。
强化学习在农业控制里的价值,不是替代种植者的判断,而是把"多目标权衡"这件事做得更细。人擅长的是设定目标与边界,算法擅长的是在边界内持续寻找更优解。两者结合,才是温室智控真正的形态。