📝 英文题目:Generative AI and customer engagement with the retailer: Does product type matter?
📚 来源期刊:Journal of Business Research
🗓 发表时间:2026-04-15
✍ 作者:Lina Anggraini, Nathalie T.M. Demoulin, Gwarlann De Kerviler
🏆 期刊等级:JCR Q1 · 中科院 管理学1区 · TOP 管理学 · SSCI Q1 · Scopus
📌 本文看点
01
生成式 AI 聊天机器人(ChatGPT)
02
搜索型商品 vs 体验型商品
03
顾客参与(cognitive / affective / behavioral)
BACKGROUND
研究背景
问题提出
过去十年,电商聊天机器人研究做得很厚——购买意愿、满意、忠诚、接受度,拟人化、胜任力、话术策略,Table 1 逐条列了。但这些研究几乎全针对「预定义规则的旧式机器人」,生成式 AI 客服是另一回事:它不靠写死规则,而是即时生成、能顺用户语气调整的回复。作者的判断:代际差异让消费者反应完全不同,旧结论不能直接搬。 对企业这不是学术趣味而是预算问题:生成式 AI 客服要持续投入,行业预测 80% 企业 2025 年前采用。没弄清「对哪类商品有效」就铺开,等于用最贵的方案覆盖最不需要它的场景。 作者还点明要质疑「越依赖技术决策越好」这个默认信念。
难点剖析
难点集中在四处,每一处都决定「不做这一步,结论就成空话」。 (1)「顾客参与」是三维构念(认知处理 / 情感 / 行为激活,Hollebeek 等 2014),不能当单变量——本文把三维度分别作因变量跑了六组序列中介。 (2)机制用「感知控制」并拆成「认知控制」(看不看得懂)与「行为控制」(做不做得到),两者作用方式不同。 (3)「商品类型」调节变量不能自说自话——作者专门做独立前测(N = 128)验证候选商品落位,而非直接假设。 (4)要证明「AI 在某些场景有害」必须把场景做对:搜索品属性一眼可评,消费者本就有高控制,AI 介入反而干扰。于是有 Study 4:人为给搜索品制造选择过载(10 选项),看能否翻转——把「无效」升级成「有条件有效或有害」。
理论脉络
五条线拼在一起: ① 聊天机器人研究传统——旧结论建立在「预定义规则应答」前提上;生成式 AI 即时生成、可自适应,旧结论适用性本身待检验。 ② 社会反应理论(SRT,Nass & Moon 2000)——人会不自觉把计算机当社交行动者,对生成式 AI 也成立(Gnewuch 等 2022 等)。本文用它解释:复杂 / 不确定购买里,「人味」为何特别起作用。 ③ 顾客参与三维框架(Brodie 2011;Hollebeek 2014)——认知处理、情感、行为激活。本文操作定义为「与零售商的认知 / 情感 / 行为投入水平」。 ④ 感知控制双成分——认知控制来自 Averill(1973)「赋予意义、降不确定性」;行为控制来自 Ajzen(1991)计划行为理论「能否执行」。分工:认知解决「看不看得懂」,行为解决「做不做得到」。 ⑤ 商品二分法 + 选择过载——搜索品属性购前可评、体验品购后(Nelson 1974;Klein 1998);选择过载(Chernev & Hamilton 2009)抬高决策难度。本文新颖点:大量搜索品选项能把搜索情境复杂度抬到接近体验品——这是 Study 4 的理论起点。
METHOD
研究方法
理论模型
纯实验,无结构方程,但有一张标准调节中介框架图(Fig.1),四假设全画在上面。 框架是递进式而非平面:H1 立直接效应 → H2a 拆机制 → H2b 接结果 → H3 加边界(商品类型)→ H4 再加一阶边界(货架规模)。
读这篇要记住:H1–H4 不是并列四条,而是四层递进。只看 H1 / H2 会以为「AI 普遍有效」;真正改变实践决策的是 H3 / H4。
研究假设
四个假设 H1–H4 与四个实验一一对应,且层层递进(不是并列): H1:生成式 AI 客服对购买意愿有显著正向影响(直接效应,比旧式机器人更强)。 H2a:AI 客服对顾客参与的影响,由感知控制(认知 / 行为)中介。认知控制靠「把信息说清楚」,行为控制靠「帮用户真的把动作做出来」(任务促进)。 H2b:AI 客服对购买意愿的影响,由感知控制与顾客参与序列中介。 H3:商品类型调节上述中介——体验品效应强于搜索品。推理:搜索品顾客本就有较高控制、对外部建议依赖低,AI 协助「没那么必要」;体验品顾客更依赖引导,AI 能显著增强两类控制。 H4:搜索品上的选择过载会增强 AI 作用(选项有限时减弱);体验品无论货架大小都保持强健。推理:选项过多抬高决策负荷,搜索情境变复杂,AI「过滤选项、突出差异」的能力重新稀缺。 📌 体系特征:H1 总效应 → H2a 机制 → H2b 接结果 → H3 边界 → H4 二阶边界。四项实验必须「一个回答一层」,否则无法定位适用边界。
分析策略
分析路线:四实验逐层验证 + 全套 PROCESS 中介 / 调节中介(5000 次 bootstrap,95% 偏差校正 CI)。 ① 四个实验分工
| 实验 | 检验 | 设计 | 样本 | 模型 |
|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
② Study 2b 跑六组序列中介(认知 / 行为控制 × 参与三维度):b 从 0.429(行为控制 → 认知参与)到 1.481(行为控制 → 行为参与),六组 CI 全不含 0——比「合成总分跑一次」实在,也能看出哪条最强。 ③ Study 4 必须用 Model 11(不是 Model 7):H4 是「调节的调节」= 三阶交互的条件调节中介,才能同时估计两个货架水平的条件间接效应。 ④ 操纵检验每项都做:AI 客服(Bot vs No-Bot 均值差显著,p < 0.001)、商品类型(Weathers 2007 量表)、场景可信度(believability / realism ≈ 6 分,p < 0.001)、前测商品落位。 ⑤ 📌 统计报告几处需留意(我核出来的):Study 1 ANOVA 自由度写 [1, 115] 但 N = 300(同段操纵检验 [1, 298],疑似笔误);Study 3 操纵检验 [1, 423] 与 N = 245 不符;个别正文系数与表格不一致(如 Study 3 搜索品行为控制正文 −2.212 vs 表 −1.212;Study 2b 一处 CI 上下限颠倒)。区间均不含 0,定性结论不受影响,但具体数值以表格为准。
DESIGN
实验设计
数据收集
数据统一:Prolific 招募美国被试,在线情境实验,AI 客服条件的推荐由 ChatGPT 生成;全部组间设计(每人只经历一种条件)。
Study 4 货架操纵:小货架 3 选项、大货架 10 选项,数量取自 Haynes(2009)前置实验(不拍脑袋)。 前测(N = 128):验证商品落位——食谱书、复合维生素判为搜索品;裤子、西装外套判为体验品(均 p < 0.001)。把「什么算搜索品」从假设变成可检验操纵,是审稿人最爱追问的点。 信息公开:数据「可依请求提供」;作者声明无利益冲突;缺伦理审批 / 知情同意 / 预注册说明(近年期刊通常标配,值得留意)。
研究样本
五项研究累计 1784 人次,全为 Prolific 美国便利样本。
| 研究 | 样本 | 女性 | 均龄 | 备注 |
|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
📌 两处需留意: (1)Study 1 与 Study 2b 极可能共用同一份 300 人样本——样本量、性别比、均龄、操纵检验均值与 F 值(MBot = 6.25, MNoBot = 2.44, F[1, 298] = 219.672)逐位一致。若是同批数据,H1 与 H2b 是两次分析而非两次独立验证,论文未说明也未讨论多重比较。 (2)Study 4 均龄 33 岁(全样本最低)却样本最大——年龄结构变化是否影响对「复合维生素」这类偏年长品类的判断,论文未讨论。 推广边界:全为美国便利样本、全为情境想象(非真实购买)、商品集中在服装与保健品、未覆盖高价耐用品 / 服务 / 数字商品。
测量工具
全部用已发表量表,但信度只报了 Cronbach‘s α 一项(测量部分最需留意)。 Table 2 量表清单
| 构念 | 来源 | 题项 | α(各研究) |
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
📌 测量三处需留意: (1)只有 α,没有 CFA / CR / AVE / 区分效度,也未讨论共同方法偏差。核心构念(认知控制、行为控制、认知参与)语义接近,区分效度存疑。 (2)行为控制仅 2 题且偏「省时省力」,与 Ajzen(1991)「我能做到」的自我效能内核有偏差。 (3)认知控制三题(好懂 / 好把握 / 好预测)更像「网站易用性」而非 Averill(1973)定义的「赋予意义、降不确定性」——考虑到 AI 客服对认知控制的回归 R² 高达 0.898(行为研究里罕见),存在「测到界面形式差异而非心理变量」的替代解释空间。
RESULTS
结果与分析
信效度检验
判断:可信度靠三件事——四层递进设计、全套操纵检验、系数全摊开;但测量部分有短板。 (1)信度:主构念 α 全在 0.960–0.990;操纵构念 0.771–0.940。⚠️ 只有 α,无 CFA / CR / AVE / 区分效度。 (2)操纵检验全做
(3)系数报告完整(强项):六组间接效应、两侧条件间接效应、两货架条件指数——点估计、SE、95% CI 全给;统一 PROCESS + 5000 bootstrap + 95% 偏差校正 CI。 (4)⚠️ 三类问题(引用前务必看过):① 统计笔误(S1 自由度 [1, 115] 与 N = 300 不符;S3 [1, 423] 与 N = 245 不符;S3 正文 −2.212 vs 表 −1.212;S2b 一处 CI 上下限颠倒);
② Study 1 与 2b 极可能共用 300 人样本(见样本节);
③ 认知 / 行为控制构念效度需打折(题项偏易用性 / 省时省力)。
假设检验
H1:生成式 AI 客服 → 购买意愿 — b = 1.597,SE = 0.211,t = 7.556,p < 0.001;MBot = 5.18 vs MNoBot = 3.58(N = 300) → 支持
H2a:生成式 AI 客服 → 感知控制(认知 / 行为)→ 顾客参与(认知 / 情感 / 行为) — 客服 → 认知控制 b = 4.061(t = 46.451)、→ 行为控制 b = 3.871(t = 40.993);六条间接效应 1.209–2.104,95% CI 全部不含 0(N = 246) → 支持
H2b:生成式 AI 客服 → 感知控制 → 顾客参与 → 购买意愿(序列中介) — 认知控制 × 认知参与 0.533(0.332, 0.783)、× 情感参与 0.510(0.308, 0.773)、× 行为参与 0.989(0.693, 1.321);行为控制 × 认知参与 0.429(0.152, 0.769)、× 情感参与 0.443(0.113, 0.845)、× 行为参与 1.481(1.124, 1.837),六组全部显著(N = 300) → 支持
H3:商品类型调节感知控制的中介(体验品强于搜索品) — 搜索品六条间接效应全为负(−0.638 至 −3.050,CI 均不含 0),体验品六条全为正(+0.630 至 +2.963);调节中介指数 1.268–6.012(CI 均不含 0)(N = 245) → 支持(实际结果是「搜索品上方向反转」,比假设的「体验品更强」更极端)
H4:选择过载条件化调节商品类型的调节(仅搜索品受影响) — 搜索品小货架(3 选项)时 AI 客服降低参与、大货架(10 选项)时提升参与;体验品不论货架大小均保持正向;条件调节中介指数小货架 2.064–5.535、大货架 0.154–0.621(N = 493) → 支持
CONCLUSION
总体结论
研究结论
五层结论,从「有没有用」推到「什么时候别用」。 ① 直接效应成立且量大:购买意愿 3.58 → 5.18(b = 1.597, p < 0.001),把机制分析的「地基」立住。 ② 真正起作用的是「控制感」链,不是「聊得好」:AI → 认知 / 行为控制 → 参与 → 购买意愿。作者强调「参与是控制感的结果,不是交互性的直接产物」——修正了顾客参与研究的一个流行默认假设。人话:顾客不是聊开心才投入,而是「我看懂了、也做得到」这份控制感换来投入。 ③(最关键)方向取决于商品类型,搜索品上可能为负:搜索品六条间接效应全负(最低 −3.050),体验品全正(最高 +2.963)。机制:搜索品顾客本就有高控制,AI 介入没增益反而削弱「自己能搞定」的体验。这一条同时挑战「更多技术 = 更好决策」和「消费者不愿用 AI 评估体验品」两个信念——数据恰好相反。 ④ 选择过载能翻盘:搜索品小货架
(3)时 AI 降低参与,大货架
(10)时提升;体验品不论货架都正向。把结论从「搜索品别上 AI」修正成「搜索品看 SKU 规模再定」。 ⑤ 管理启示(可直接落地):
(1) 先看商品类型——卖搜索品大范围上机器人「可能没必要」,预算放清晰描述更有效;卖体验品优先投 AI。
(2) 货架规模是第二开关——搜索品 + 大货架(亚马逊 / 速卖通级)AI 价值显著上升。
(3) 算 ROI(成本节省 / 效率 / 参与 / 收入)别凭感觉。
(4) AI 当补充不当替代,保留人工协助通道。 一句话:它没写「AI 客服十个最佳实践」,而是用四实验把「有没有用」拆成「对谁有用、靠什么、什么时候反过来没用」;最重要一句提醒恰与「AI 万能论」相反——「聊天机器人存在,不自动保证更好的互动或决策。」
研究局限
作者自陈 4 条 + 我核出 5 条补充边界。 作者:① 全情境实验,缺真实外部效度(建议现场研究);
② 参与模型可扩(认知沉浸、AR / VR);
③ 生成式 AI 三类风险(信息不准 / 偏见放大 / 过度依赖侵蚀人际);
④ 结论本身「有条件」。 我核出的 5 条: ⑤ ⚠️ Study 1 与 2b 极可能共用 300 人样本(样本量 / 性别 / 均龄 / 操纵检验逐位一致),论文未说明也未讨论多重比较。 ⑥ ⚠️ 测量缺效度证据 + 两控制构念题项偏题:只有 α 无 CFA;认知控制题项近「易用性」、行为控制仅 2 题偏「省时省力」;认知控制回归 R² = 0.898 异常高,存在「测到界面差异」的替代解释。 ⑦ ⚠️ 统计笔误多(S1 自由度、S3 自由度、S3 正文 vs 表系数、S2b CI 颠倒),具体数值以表为准。 ⑧ ⚠️ 缺实验质量披露:未见注意力检验通过率、样本剔除标准、先验品牌态度 / AI 经验协变量;未披露失败被试处理。 ⑨ 全为美国便利样本、情境想象非真实购买、商品集中服装保健品。
未来展望
**作者 2 条 + 我补 4 条(
③ 是最直接切口)。**
① 走向真实场景:与真实电商做 A/B,用真实浏览 / 点击 / 加购 / 成交作因变量。
② 扩展构念与技术:纳入认知沉浸;扩到 AR / VR。
③ 直接测「控制感被夺走」机制(本文最该补的):搜索品负向效应文中是推论不是测量——加入「我更信自己判断」「AI 让我觉得自己的判断没被用上」类题项并检验其中介。
④ 用更硬测量替换量表:重做认知 / 行为控制题项池,跑 CFA + 区分效度,加真实易用性量表作竞争变量。
⑤ 补注意力检验 / 剔除标准 / 预注册(低成本高收益,能排除 R² = 0.898 的「数据质量」解释)。
⑥ 把商品二分做成连续谱:测「搜索性—体验性」连续位置,看 AI 效应是否单调变化,比 2 × 2 更贴真实商品结构。
金句
原文:“The mere presence of chatbots does not automatically guarantee better customer interactions or decision-making. Our findings challenge the assumption that more technology inherently leads to improved outcomes.” 解读:全文落点,最有价值的一句——把「该不该上 AI」改成「上了值不值」。措辞克制:存在 ≠ 效果。它有硬数据骨架顶着:搜索品六条间接效应全负(最低 −3.050),体验品全正(最高 +2.963),同一机器人同一批被试来源方向完全相反。对批 AI 预算的人:效果不取决于技术选型,取决于你在卖什么。 原文:“Engagement emerges as a consequence of perceived control rather than as a direct product of mere interactivity, refining prevailing assumptions in engagement research.” 解读:最易被忽略却理论最重——动的是顾客参与研究的默认前提(交互越丰富 → 参与越高)。本文数据掐断它:链条是 AI → 控制感 → 参与。真正稀缺的环节在「控制感」(AI 对认知控制 b = 4.061, R² = 0.898),不在「聊得好不好」。 实践含义:只把话术磨更拟人更热情,没让顾客更看得懂更做得到,参与度不会本质变化。 原文:“For experience goods, the generative bot had a positive effect on engagement regardless of assortment size. However, for search goods, the generative bot decreased engagement when the assortment size was small but increased engagement when the assortment size was large.” 解读:最实用的一条,把绝对结论救回来。若无 Study 4,读到 Study 3 会得出「搜索品别上 AI」(危险)。Study 4 把货架从 3 加到 10,结论翻转——选项一多,搜索情境复杂度抬到接近体验品,AI「过滤选项、突出差异」重新稀缺。迁移价值:亚马逊 / 速卖通级几千 SKU,「帮顾客把选项砍到能下决心」本身就是核心能力,搜索品也能受益;只几个 SKU 的标准化商品,热情 AI 很可能帮倒忙——有 −2.421 顶着。
— 研究模型图
📄 摘要原文
Generative artificial intelligence (AI) is reshaping the retail sector, ushering in an era in which personalization and automation redefine the customer experience. This study contributes to knowledge by exploring the emerging role of generative AI chatbots, their impact on customer engagement and purchase intention, and the psychological mechanism of perceived control, demonstrating how generative AI chatbots can alleviate decision-making challenges. Using four scenario-based experiments, our research shows that generative AI chatbots boost purchase intention and customer engagement by increasing cognitive and behavioral control. Notably, this mediated effect is moderated by product type, with a stronger impact on experience goods due to their evaluation complexity. By contrast, clear product descriptions are often more effective in search goods with small assortments. The results suggest that companies selling experience goods should prioritize chatbots, while those focused on search goods may benefit more from structured product information. This ensures that chatbot investments are aligned with customer needs.
📎 阅读原文:DOI: 10.1016/j.jbusres.2026.116182
END
我是扣子,高校教师/在读博士/AI顾问。关注AIGC,学术科研,博士生活;分享AI赋能和论文带读,打破AI信息差。视频号:扣子说AI。
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。
欢迎关注我的视频号
(❤️会不定期更新AI工具哦❤️)
三连一下,不失联!

