大数跨境

当历史不再足够:AI Agent如何改变销售预测的决策架构

当历史不再足够:AI Agent如何改变销售预测的决策架构 闻道-供应链思维
2026-09-16
1
导读:企业过去花了很多精力,让模型更会学习历史,但未来已经不是历史的重复。传统机器学习学习的是“变量如何影响销量”。大语言模型真正打开的新空间,是把尚未结构化的现实变化,变成可以进入预测的变量。

阿里跨境电商平台,背后用着最先进的预测模型同时预测多个国家下周的销量。

从系统里看,它面对的也许只是几条时间序列:历史销量、价格、促销、星期、库存、地区。

但真实的世界远比这复杂。

有的国家正处于斋月后期,消费者会在开斋前集中采购;有的国家即将进入宗教节日,需求可能先冲高,再因为家庭活动物流暂停快速回落;有的市场正在叠加平台级大促、免运费和卖家激励;还有的国家虽然也是节假日,但消费行为更偏旅行和休闲。

电商需求很容易受到大促、优惠券、免运费、网红活动、宗教节日和公共假期影响。这些事件会在很短的时间窗口里制造需求激增或骤降,而这种变化并不能只靠历史序列推演出来。
这些只能靠当地有经验的运营团队来弥补,如果运营团队的相关人员离职,或者遗漏了某些关键信息,就不可避免的导致缺货或者库存的积压。

这让销售预测暴露出一个长期被忽视的问题。

企业过去花了很多精力,让模型更会学习历史,但未来已经不是历史的重复。

未来已经变了,但模型还不知道。


时序模型:看不到“还没有进入数据的未来”

销售预测长期以来都被当成一个数学问题。如果企业有历史销量,就去寻找趋势。如果有季节波动,就建季节性模型。如果有价格和促销数据,就分析弹性。

从指数平滑、ARIMA,到随机森林、XGBoost,再到深度神经网络和时序大模型,技术路线越来越复杂,但背后的逻辑没有发生根本变化:

过去发生过什么,可以帮助我们判断未来通常会发生什么。

需求稳定时,它非常有效。趋势、季节性、自相关和重复出现的活动模式,都可以从历史数据中学习。时序基础模型也可以作为很强的数值预测底座。

真正麻烦的是另一类信息:未来促销、节假日、价格变化和平台干预。它们可能直接改变需求,却未必能从过去的销量中显性出来。

这意味着,销售预测其实一直同时面对两个问题。

一个问题是:在类似历史条件下,销量通常是多少?这是数学问题,统计模型和机器学习已经做得越来越好。

另一个问题是:这一次,未来有什么地方和过去不同?长期以来这部分信息主要靠专家补充。

这也是很多企业预测会议真正存在的理由,在需求计划员拿出一版基准预测后,市场会提醒,这次促销力度更大。运营会补充,某个国家的消费者最近有明显变化,产品也会提出这是老款清仓,新款马上上线,两代产品会有一段时间重叠。人工的调整在弥补预测系统的信息盲区。

但在越来越不确定的场景中,这个盲区变大了。跨境电商就是一个典型的业务场景,每个国家有自己的节日体系,不同地区有不同文化习惯,同一个促销机制,在不同市场里的效果也不一样。

对于算法来说,问题已经不是“有没有特征变量”,而是同一个特征变量,在不同国家、不同时间、不同商品上,可能意味着完全不同的需求机制。


大模型改变的:不是预测算法

无论是传统预测模型还是机器学习,都有一个共同前提:信息必须先以某种形式进入模型。

模型可以学习:促销会影响需求。却不会凭空知道:下周某个国家会有一个新的平台活动,而且这个活动正好和一个宗教节日重叠。这就是大模型真正补上的位置。

大模型在销售预测上做的最有价值的事,就是让模型先理解业务世界。

“买二赠一,但高端品牌除外”。“订单满15美元免运费”。“可与免运费优惠券叠加”。“开斋前购物高峰”。“满150减30”。

这些表达,对业务人员来说并不陌生。可对传统预测模型来说,它们只是文本。

里面会有缩写,也有拼写错误,有内部业务规则,有活动叠加,也有文化背景。让传统规则系统要处理这些信息,需要不断维护解析逻辑;而大语言模型可以直接利用语言理解和世界知识,把这些非结构化记录转成业务语义。

在跨境场景中,很多预测条件不是固定字段,而是带有强语境的信息。

同样是免运费,有的市场可能是无门槛免运费,有的要满5美元,有的只针对特定品类。同样是节日,有的带来节前购物高峰,有的会让消费者离开城市,有的还会造成物流暂停。

大语言模型可以利用预训练获得的世界知识理解文化差异、区域节日和新的事件组合,而不必为每一种国家和活动重新编写规则。这就是大语言模型与传统特征工程最不同的地方。

所以我们用大模型做预测,并不是寄希望大模型能直接生成一个更准确的数值。大模型在数值精度、时间依赖和多步误差方面并不是最合适的工具。更合理的架构,是让大语言模型负责业务情境推理,再让专门的预测模块完成数值预测。

传统机器学习学习的是“变量如何影响销量”。大语言模型真正打开的新空间,是把尚未结构化的现实变化,变成可以进入预测的变量。

但是问题并没有结束,现在这个世界最不缺的,就是信号。真正难的是另一件事:哪些信号值得相信?


真正的智能:是知道什么时候不要改预测

做过需求计划的人,对预测增值(Forecast Value Added,FVA)并不陌生。

FVA背后的思想并不复杂。一版基准预测出来以后,会经历计划员调整、销售修正、共识预测。

FVA不关心某个部门是不是“最懂业务”。它只复盘一件事情:这个环节加入以后,预测究竟变准了,还是变差了?

而专家判断并不天然创造预测价值。2025年发表于《International Journal of Forecasting》的一项研究汇总约14.7万条预测记录发现,人工调整只有略高于一半的SKU改善了预测;其中向上调整尤其危险,仅约46%的调整提高了准确率。

但是真的能把FVA这项持续复盘机制放到需求计划流程的公司极少,很容易理解,哪个公司的需求计划员愿意去得罪这些专家。

而阿里巴巴的AI智能体,把这个问题的时间点往前挪了一大步。它开始在事前发问:这次,到底值不值得调整?

碰到一个待预测的场景,智能体先掂量掂量,再选路走。当前的数值预测已经够可靠了?那就跳过,什么都不改。事件明确、又跟这个商品相关?进入基础推理,简单读一读。情况复杂、心里没底、不确定性高?才去调用工具,检索证据、翻历史同期、算统计指标。

这背后是一条非常成熟的管理原则:任何干预,都得先证明自己的增量价值。

传统的专家判断,通常是一句话:"我觉得这次会涨20%。"听着挺笃定,可这一句话里,其实糊在一起塞进了太多没被分开的判断:为什么会涨?什么时候涨?涨多久?峰值在哪天?幅度凭什么是20%?全揉成了一团,谁也验证不了。

智能体做的事,是把这团东西一层层剥开。它不只说"涨",还得说清楚为什么相关、什么时候涨、能涨多久、峰值落在哪里、幅度到底多大。判断被拆开了,才谈得上被检验、被复盘、被改进。

它得能想清楚几件事:这个事件,跟眼前这个商品真的相关吗?它会让需求上升,还是下降?影响是一两天的事,还是要持续整整一周?是一次短暂的脉冲,还是把需求水位整体抬高了一截?幅度是大是小?说到底有没有必要去动那个基准预测?

智能体把这一连串判断,明明白白地拆成了几个可以分头回答的字段:相关性、主导事件、方向、时间形态、影响幅度、峰值。

这样就把预测效用直接引进了智能体的训练里。加了某次语义判断之后,误差变小了,这次干预就创造了价值;误差反而更大了,那就是"负迁移",智能体会记住、会惩罚。就连调用工具这件事本身,也要计入成本,不是越勤快越好,是要算账的。


结语

销售预测,正在从一个"模型问题",悄悄变成一个"决策架构问题"。基准预测只是个起点。

真正预测智能体还要往下走很多步,感知市场变化、判断相关性、选用什么工具和模型、形成预测、等待真实结果、再从结果里回头学习。

预测的逻辑,也在这几年里一路演进。

过去的逻辑是:

历史数据 -> 预测
后来变成:
历史数据 -> 预测 ->专家修正
而新的架构开始接近:
历史数据 ->未来情景感知-> 判断相关性 -> 选择正确的模型 -> 预测 -> 结果复盘 ->学习

这已经不只是一台预测引擎了。它开始接近一个真正的决策智能系统


相关原创长文阅读:

提升预测准确率:选择模型前应该思考的几个问题

经典论文精讲:需求预测的GPT-3时刻《DeepAR 算法》

预测的艺术与科学:从巴比伦古庙到AI时代的思考









【声明】内容源于网络
0
0
闻道-供应链思维
一个有态度的专业供应链公众号,坚持原创,不发软文
内容 133
粉丝 0
闻道-供应链思维 一个有态度的专业供应链公众号,坚持原创,不发软文
总阅读1.5k
粉丝0
内容133