收益:
- 能够解释产量预测中使用的数据源以及机器学习和机械模型之间的差异
- 能够使用人工智能配置产量预测设置、功能和不确定性范围
- 能够通过历史产量、基准和现场测量来验证模型输出并防止过度自信
“我将从这个领域获得多少产品?”这是农业中最古老、最有价值的问题。知道正确答案;这意味着规划收割工人、仓库、运输、销售合同和融资。认识错误意味着浪费资源或无法跟上。人工智能和机器学习(ML,一种学习数据模式并预测新情况的方法)可以为这个问题提供强有力但危险的令人信服的答案。本单元教您产量预测的数据来源、两种基本方法(机器学习和机械模型)之间的差异、预测的不确定性范围,以及最重要的是如何避免过度自信。
效率取决于什么?输入
产量不仅仅取决于一件事;是多种因素的产物。主要输入源:
- 植物状态:跨季节的 NDVI/NDRE 时间序列(生物量开发)、植物密度、健康状况。
- 土壤:pH、OM、KDK、保水性、管理区。
- 天气/气候:GDD累积、关键期降水和温度、霜/冰雹事件。
- 管理:品种、栽期、施肥量及灌水、喷药。
- 历史:同一领域上一年的产量(最强的单一指标之一)。
人工智能结合这些输入(特征)并产生预测。但不应该忘记的是:模型只知道它所输入的数据以及它在该数据中看到的模式。如果您不提供十月日期,它将忽略该因素。
两种方法:机器学习与机械模型
机器学习模型从过去几年的“这是这些条件下的产量”示例中学习统计模式。它的优势:捕获许多变量和复杂的关系。弱点:超出训练数据时信心崩溃(新品种、前所未有的干旱、不同地区);很难解释原因(“黑匣子”)。
机械(基于过程)模型通过方程(光合作用、水养分平衡)模拟植物生长生理学。优点:在新条件下更可靠、更容易解释。缺点:需要大量输入和校准,设置困难。
实践中将两者结合起来,并通过现场测量进行验证。人工智能加速了这两种方法的设置、功能和报告。
尺寸
机器学习
机理模型
基础
历史数据模式
生理学方程
新状况
弱(外推风险)
更强
可解释性
低(黑匣子)
高
数据需要
很久以前的例子
多参数/校准
人工智能的作用
专题+模型小说
报名准备、评论
提示:在相信收益率预测之前,先问自己:“今年的情况与模型所学到的过去相似吗?”异常干旱、新品种或不同地区都会导致 ML 估计不可靠。在这种情况下,扩大不确定性范围。
不确定性范围:为什么是区间而不是点?
良好的产量估算并不是“每十亩 620 公斤”;而是“每亩 620 公斤”。他说:“每十公斤560-680公斤,最有可能的是620公斤,可信度中等。”因为未来是不确定的,奇数会产生错误的确定性。十二月;它可以设置场景(差/中/好)并管理规划中的风险。在进行人工智能预测时,始终询问范围和置信度;对给出奇数的模型持怀疑态度。
三个迷你案例:从数字来看
案例 1 - 间隔规划。一家小麦生产商根据单点估算(每十亩 500 公斤)安排了收割劳动力和运输。当人工智能支持的模型给出430-560公斤的额定值并且“对关键时期降雨敏感”时,制造商制定了灵活的工人计划。实际重量445公斤;虽然严格的规划会产生大量费用,但间距可以节省灵活性。
案例 2 - 外推陷阱。一个模型根据历史数据预测了前所未有的严重干旱年份的高产。工程师意识到条件超出了训练数据范围,因此拒绝了预测并返回到现场测量(植物密度、穗数)。如果单独听取该模型,那将是一个严重的计划错误。
案例 3 - 缺少功能。一项估计高于预期;检查后发现,模型中没有输入冰雹事件。输入完成后,预测结果就变成现实了。教训:模型只知道你给它的那么多;忘记一个关键事件会导致估计值过高。
弱提示/强提示
弱提示:
我将从这个领域获得多少产量?给我一个号码。
强力提示:
您的角色:农业数据分析师。设计一种产量预测方法(不是模型构建,而是虚构和解释)。我有输入:[NDVI 系列、土壤、GDD、种植日期、历史产量...]。任务:- 解释我应该使用哪些特征,哪些是最具决定性的, - 要求将估计作为间隔和置信水平,而不是点。- 今年的情况与过去相似吗?评估是否存在外推风险。 - 询问可能缺失的关键投入(冰雹、霜冻、疾病)。 - 写出如何验证估计的田间测量结果(穗数/果实数)。
强大的提示强制执行间距、外推检查、缺失输入检测和字段验证。
四个可复制模板
1)功能优先级:
按确定顺序列出可用于估计以下产品产量的特征;简要解释为什么每一项都很重要。单独标记我没有但有价值的数据。
2)不确定度范围:
不是将这个估计作为一个点,而是作为一个下上范围和置信水平(高/中/低)。写出缩小和扩大范围的因素。
3)外推检查:
将今年的条件(天气、品种、管理)与往年的典型情况进行比较。模型是否偏离训练数据?如果是这样,我应该在多大程度上相信这个预测?
4)现场验证计划:
我如何在收获前进行哪种测量(每块田地的穗数/果实、谷物重量)来验证田间的产量估计?建议抽样计划。
常见错误
- 相信一个数字。点估计的精度是错误的;询问范围和置信度。
- 忽略外推法。不寻常年份的 ML 估计不可靠;与过去的情况进行比较。
- 忘记关键输入。如果您不输入冰雹、霜冻和疾病等事件,预报就会被夸大。
- 将模型关闭到现场。直接测量(例如穗/果实计数)是最终的锚点;不要跳过它。
- 盲目相信黑匣子。无法解释原因的预测不应在未经质疑的情况下成为决定。
注意:产量预测会触发财务和运营决策(合同、贷款、员工)。基于过于乐观预测的承诺如果无法实现,将会造成严重损害。将估计呈现为一系列可能性,并根据谨慎的情况做出关键承诺。
综上所述
产量预测是多种投入(植物、土壤、天气、管理、历史)的组合。机器学习可以捕捉复杂的模式,但当它超出训练数据范围时,它的信心就会崩溃;机理模型在新的条件下更加可靠,但建立起来比较困难。人工智能加速了这两种方法的构建。好的估计是一个区间,而不是一个点,具有置信水平,检查外推的风险,并通过现场测量进行验证。过度自信是最昂贵的错误;预测是一种可能性,而不是承诺。
应用任务
列出作物的(代表性)输入:几年的历史产量、NDVI 趋势、种植日期、关键期降雨量。让人工智能通过本单元中的“特征优先级”和“不确定性差距”模板来预测产量。然后故意删除一个关键输入(例如冰雹事件)并再次询问并观察预测如何变化。在一段话中写下您将如何在收获前在田间验证预报。
清单
- [ ] 我想要估计点,而不是范围和置信水平。
- [ ] 我将今年的情况与过去进行了比较,并检查了外推的风险。
- [ ] 我检查了关键输入(冰雹、霜冻、疾病)是否缺失。
- [ ] 我将估计的历史收益率与基准进行了比较。
- [ ] 我制定了一个带有现场测量的验证计划(穗数/果实数)。