大数跨境

阿里最新论文解读:电商Agent到底能不能帮你赚钱

阿里最新论文解读:电商Agent到底能不能帮你赚钱 BiddingX
2026-08-08
3
导读:正文约2450字 | 阅读大约需要6分钟让 AI 经营网店 365 天,最好的 Agent 只做到人类的 27

正文约 1200 字 | 阅读大约需要 4 分钟


让 AI 经营网店 365 天:最佳 Agent 表现仅达人类的 27.3%

会调用工具只是起点,长期经营需经受时间与延迟反馈的考验。阿里团队于 7 月 31 日发布关于电商 Agent 的最新论文,揭示了当前 AI 在长周期商业决策中的局限性。

研究中出现了一个典型案例:由 Kimi K2.6 驱动的 Agent 在第 104 天便判定店铺无法挽救。在剩余 523 个决策窗口中,该 Agent 有 355 次未采取任何经营动作,任由时间流逝。相比之下,人类经营者需面对选品占用资金、销量滞后转化为退款差评等复杂连锁反应,错误判断的影响可能持续数月。

MerchantBench[1]正是为了评测 LLM Agent 这种“长期连贯性”能力而构建的基准,通过 365 天的模拟经营来检验其表现。

01. 为何经营店铺比完成考卷更难

传统的 Agent 基准测试通常任务明确且有清晰终点。而 MerchantBench 聚焦于卖家侧电商,引入了延迟反馈和需求动态变化两大核心挑战。

在模拟环境中,订单生成即扣除采购资金,但售后与发货异常往往滞后出现,Agent 必须追溯问题源头并修正旧决策。同时,需求随 618、双 11 及春节等节点波动,选品成为一项需持续调整的投资组合管理。

图 1:Agent 需同时处理选品、定价、现金流管理及延迟反馈。图源:论文 Figure 2。

论文将这种能力定义为“长期连贯性”[2],即 Agent 在长达一年的周期内,是否仍能铭记初始目标,并依据新证据及时修正旧策略。

02. 模拟店铺的运转机制

该环境基于 1688 平台 98,843 条真实商品记录及 36,576 个供应商数据构建,完整保留了全年需求轨迹及大促波动。

图 2:真实年度需求曲线,以及供应商事件和订单异常的分布情况。图源:论文 Figure 3。

每个 Agent 初始资金为 2,000 元现金加 1,000 元保证金,上限上架 50 个商品。模拟器以小时为单位推进,Agent 每 12 小时获得一次决策机会,可调用 26 种商家工具进行选品、定价及订单追踪。

关键难点在于信息差:Agent 只能看到已发生的事实。供应商涨价立即可见,但商品退款率需待订单完成后才知悉。局部失误会通过订单、现金、评分和流量等路径产生连锁传播效应。

03. 顶尖配置表现仅为人类的 27.3%

研究团队测试了 8 个大语言模型,分别接入 ReAct 和 Hermes 两套框架,累计运行 48 个完整年度。对照组包含规则策略及 3 名无电商经验的人类参与者。

表现最佳的组合为"Hermes + Qwen3.7-Max",其平均期末净资产为 59,460 元,而人类平均水平为 217,610 元,前者仅为后者的 27.3%。值得注意的是,期末净资产[3]涵盖现金、保证金、在途资金及应收款,比 GMV 更能反映店铺实际留存资产。

图 3:三次重复实验的期末净资产对比,菱形代表均值。图源:论文 Figure 4。

数据还显示,即便排名第一的组合,其三次运行的变异系数高达 55.1%,表明在生产环境中稳定性不足。此外,Hermes 框架整体表现优于 ReAct,但在某些模型上也可能因保存错误策略而导致性能下降。

04. Agent 为何会出现策略漂移

研究发现导致 AI 表现不佳的两个主要原因:

首先是“运营连贯性”[5]下降。部分 Agent 随着时间推移,主动选品、调价和复盘的频率大幅降低。人类参与者的持续窗口率[4]为 100%,而 LLM 最低值仅为 10.6%。

其次是“战略连贯性”[5]漂移。部分 Agent 虽保持忙碌,但动作逐渐偏离期末净资产最大化的目标。它们容易被短期的供应商异常牵着走,或将一次局部经验错误地固化为长期政策。

图 4:人类与 Hermes Agent 在月度活跃度、工具调用及净利润上的对比。图源:论文 Figure 5。

例如,有 Agent 因认定下架弱商品可集中流量,导致货架商品从 47 个锐减至 3 个;另有 Agent 误记经营终点,提前 83 天停止补货。这些看似简单的判断错误,在长周期中被放大,严重影响最终结果。

05. 电商人如何利用 Agent 提效

基于上述研究,现阶段电商从业者应采取"Human in the loop"(人在回路)策略,将 Agent 定位为长期运营执行搭档,而非全权委托对象。

具体落地建议如下:

1. 智能日报与监控:利用 Agent 汇总销售、毛利、广告消耗、退款及库存等数据,自动生成经营日报并标记异常 SKU,减少人工多后台切换成本。

2. 选品初筛:让 Agent 基于销量、毛利、退款率及季节趋势进行货盘初筛,提供上新或清退建议,由人工做最终确认。

3. 大促全流程辅助:在活动前检查预算与风险,活动中监控转化与库存,活动后关联决策与结果进行复盘分析。

4. 售后归因:将退款、差评定位到具体 SKU 和供应商,并将每次调整写入经营账本,保留决策假设与复查日期。

5. 多维指标考核:除 GMV 外,重点监控毛利、现金占用、退款率及店铺评分,防止 Agent 为冲量牺牲利润。

实施时应从低风险环节入手,先开放监控与建议权限,待稳定后再逐步授权自动调价等功能,而批量下架、预算调整等高风险操作仍需人工把控。

27.3% 的数据更像是一条警报:会调用工具仅是 Agent 进入业务的起点。真正能全权委托、具备长期目标导向的电商 Agent,仍有漫长的路要走。

概念备注与出处

[1] MerchantBench:一套基于 365 天订单级电商模拟的基准,环境包含近 10 万条真实商品记录及 26 个商家工具。

[2] 长期连贯性:指 Agent 在长周期内维持目标导向行为,并依据累积证据调整决策的能力。

[3] 期末净资产:定义为现金、保证金、在途资金和应收款之和,是衡量店铺留存资产的核心指标。

[4] 持续窗口率:在任意滚动 30 天内,包含环境工具调用的决策窗口占比。

[5] 两类连贯性:运营连贯性关注活动持续性;战略连贯性关注行为是否服务长期目标及策略更新能力。

统一来源:MerchantBench 论文

论文与代码

论文:arXiv:2607.28956

代码:GitHub / merchantbench

图片授权说明:论文采用 arXiv 非独占分发许可,原图已标注来源。正式商业发布前,建议向作者确认复用授权。

互动话题

如果将 Agent 接入真实店铺,您最愿意先交给它哪一部分工作?又有哪些环节会坚持由人来把控?

【声明】内容源于网络
0
0
BiddingX
各类跨境出海行业相关资讯
内容 76
粉丝 0
BiddingX 各类跨境出海行业相关资讯
总阅读11.1k
粉丝0
内容76