2026 年 7 月,TikTok 表示,平台累计标注的 AI 生成视频已经达到30亿条;八个月前,这个数字还是13亿。Meta 也提到,已有900万家小企业在使用它的AI广告创意工具,图像生成的采用率一个季度翻了一倍。
内容生产力已经到了一个很吓人的阶段。以前拍一组图、剪一个片子需要全组动员,现在脚本、标题、卖点重组,AI一天就能产出成百上千个版本。
内容生产的门槛正在快速下降。问题是,当每个卖家都能低成本做出海量内容时,竞争的差距还会出现在哪里?
很多人的第一反应是:拼量。
但真正跑过投放之后会发现,事情恰恰相反。生产力的爆炸并没有让生意变简单,反而让「判断」这件事变得前所未有地贵。
音乐流媒体 Deezer 曾统计过一组数据,AI 生成的曲目一度占到了每日新上传量的一半以上,但最终的播放量占比只有1% 到 3%。
广告也是一样,Motion 分析了 6000 多个广告账户、近 58 万条素材,发现大约一半的广告素材几乎拿不到任何花费,每个账户约 6% 的素材吃掉了大部分预算。也就是说,我们不是做不出足够多的内容,而是做出来的内容,远远超过了市场和投放系统能够验证、消化的数量。
AI 解决的是生产问题,却没有解决需求问题。
素材成本可以越来越低,但真实的曝光、点击、订单和广告预算不会凭空增加。你做出 100条素材,并不意味着市场会给你100次平等的验证机会。
当「做内容」逐渐变成一种基础能力,真正拉开差距的,就不再是谁做的多,而是谁能更快判断:什么值得继续投,什么应该立刻停。
01
为什么「验证」会变贵?
一条素材从诞生到真正产生经营结果,中间其实隔着三层成本。
麻烦的地方在于,AI只降低了第一层。第二层和第三层不仅没有变便宜,反而因为第一层的爆炸而变得更拥挤。
很多人容易掉进一个陷阱:既然素材多了,我就全发上去测测看。
但从统计上看,这件事没有那么便宜。因为,你想分辨的差异越小,买到一个可靠答案所需要的数据就越多。按 4 万多个电商品牌的 Meta 投放中位数算,大概是这个量级:
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
注:品类、客单价、转化率、CPM 不同,实际数字会变,这里只看量级。
这张表真正想说明的,不是「测试一条素材一定要花多少钱」。
而是:AI可以降低生产一条素材的成本,却不会降低验证一个差异所需要的证据量。你能从10条素材做到1000条素材,但真实流量不会因此变成原来的100倍。
反过来,如果你同时把越来越多素材送进测试,有限的曝光和订单只会被进一步摊薄。
于是问题来了,每条素材只有几百、几千次曝光的时候,你看到的所谓「赢家」,到底是真的赢家,还是随机波动?某条视频前几个小时点击率特别高,可能只是系统碰巧先把它推给了一批更容易转化的人。某条素材跑赢另外一条,也可能只是数据量还没大到足以排除随机性。
这就像此前达人营销里的一个行业经验,寄出100份样品给达人,可能有60个人发了内容,但最后真正值得你砸钱投流的素材往往只有5到10条,而能跑出大爆款的,可能只有一两条。
素材验证,天然就是一个高损耗漏斗。AI 只是把漏斗的口子开大了,但它没有缩短漏斗的路径。
02
更麻烦的是,平台正在把答案藏起来
上面说的还只是样本不够带来的失真。还有一层更结构性的麻烦:这两年各大平台的广告产品,正在系统性地把「哪条素材起了作用」这个问题变得更难回答。
从 2025 年7月起,GMV Max成了TikTok Shop Ads唯一支持的广告系列类型。商品、素材、版位、人群,全部交给系统自动组合,商家手里能调的核心杠杆,基本只剩一个 ROI 目标。Google的Performance Max是同一个思路:你把素材丢进素材库,剩下的由系统自己排列组合。
对投放效率来说,这是好事。系统确实比人更快找到能放量的组合,也确实能把钱花出去。
但对「验证」这件事来说,它很麻烦。因为归因的口径变了。
以GMV Max 为例,活动期内这个商品的付费订单和自然订单,都可能被算进去。也就是说,报表里面那个看起来很漂亮的ROI,里面混着一部分本来就可能发生的自然成交。
Performance Max更隐蔽,它会给标题、描述、图片分别记转化,报表看上去粒度很细。但真实购买往往是多个组件共同作用的结果,于是同一笔订单,可能同时被多个组件记上一笔转化,组件层面的数据因此很容易被高估。
看起来有数据,不代表知道原因。
于是你会遇到一个很容易被忽略的问题,平台报表能告诉你,系统愿意把预算投给哪条素材;但它回答不了:如果没有这条素材,这些订单还会不会发生。
这两者之间的差距,本质上就是「平台优化」和「因果判断」之间的差距。
系统给某条素材放量,只能说明它在平台自己的目标函数下表现好;但这并不等于这条素材真的为你的生意带来了增量。
平台没有错,它只是在解决和商家不完全一样的问题。
还有一个容易被忽略的约束:广告系统学习真正需要的,也不是素材数量,而是真实转化事件。
无论是 Google还是TikTok,广告系统想要跑稳,都需要积累足够多的真实转化信号。你手里有10条素材还是 1000条素材,并不会改变这件事:系统需要的真实订单,不会因为你多生成了 990 条素材就自动减少。
这也是现在最拧巴的地方。
一边是AI把素材供给推向近乎无限;另一边,真正能够验证素材价值的流量、订单和预算,依然有限。生产越来越便宜,验证却没有一起变便宜。
而且这个验证过程,越来越多地发生在平台的黑箱里。
那商家怎么办?
至少有一件事现在就可以做:平台给你一个指标,你自己再配一个经营指标。
|
|
|
|
|
|
|
|
|
|
|
|
如果这两列数字长期在打架,优先相信离你的利润更近的那一列。
03
从「内容工厂」到「实验系统」
这就对现在的团队提出了一个很高的要求:你不能再把自己当成一个「内容工厂」,你得变成一个「实验系统」。
过去我们考核内容团队,看的是产量、看的是成片。但在 AI 时代,产量正在迅速变成最不值钱的指标。
真正应该关心的是:为了找到一个有效方向,你总共花了多少钱、多少时间?我更愿意叫它「有效方向验证成本」。
有效方向验证成本 =(生产费用 + 验证费用 + 必要的放量确认费用)÷ 真正被验证成立的方向数
分母之所以是「方向」而不是「素材」,是因为真正值得积累的,不是那一条具体素材,而是素材背后那些可复用的判断。
比如「真人试穿比参数图更打动这批人」,之后还能用,但某一条具体成片,可能跑几个星期就不行了。
所以你的目标不是不断囤积赢家素材,而是不断提高自己发现赢家方向的效率。
所以正确的顺序应该是:
- 先问:多大的差异,才会真的改变我的经营决策?
- 再算:为了分辨这个差异,需要多少曝光、订单和预算?
- 买得起,就测。
- 买不起,就接受更低的分辨率。
- 如果放宽之后依然买不起,就不要硬用 A/B Test 给自己制造一个“科学答案”
比如,一个AI生成的新版本如果只比旧版本好 1%,但这个提升既不足以让你重新拍摄,也不足以让你调整货架和预算,那么你根本不需要知道这 1% 到底是不是真的。
因为这个答案即使测出来,也不会改变你的决策。
对很多中小卖家来说,真正有经营意义的,往往不是分辨 1%、2% 的微小差异,而是判断一个方向有没有带来足够明显的改善。
如果为了识别一个很小的提升,需要投入远超其潜在收益的预算,那么就不应该硬测。这个时候,直接结合净毛利、退货率、履约难度和复购表现做决定,反而更合理。真正的严谨,不是所有问题都做实验,而是知道什么问题值得花钱验证,什么问题不值得。
样本量买不起,却还坚持从有限数据里找显著性,最后得到的往往不是答案,只是一个看起来很科学的噪音。
04
AI 扩大假设,真人提供真实信号
如果团队要从「内容工厂」变成「实验系统」,那 AI 和真人的分工也应该重新调整。
AI 最擅长的,不应该只是帮你多做几百条素材。而应该是帮你快速扩大值得验证的假设空间。真人则负责另外一件更难被复制的事情。提供真实信号。
我们要承认,AI 很擅长写脚本、换角度、改口吻、做本地化,它可以把一个想法迅速变成几十种、几百种表达。但有些东西,它给不了。
比如产品真正用起来是什么感觉,一个用户为什么买了第二次,一个创始人为什么坚持某个判断,一次售后到底是怎么解决的。
这些东西不是生成出来的,而是真实发生过的。
一项由哥伦比亚大学等机构与 Taboola 合作的研究,覆盖 30 多万条广告、5 亿多次曝光,把「素材实际是谁做的」和「用户觉得是谁做的」交叉着看,点击率如下:
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
最值得注意的,其实不是「人工一定比 AI 好」。恰恰相反。
表现最好的,是AI 做的,但用户没有觉得它像 AI。而人工做的素材,只要被用户误认为 AI,表现同样会明显下降。
这至少说明一个问题:用户真正排斥的,未必是 AI 这项技术本身。
他们更容易排斥的是:低质、模板化、缺乏真实感的内容。所以未来真正能拉开差距的,也不只是「谁更会生成」。
而是谁拥有更多:竞争对手无法轻易复制的真实输入。
比如产品在真实厨房里的使用过程,创始人对这个行业有什么别人没有的判断,甚至一次具体、可核验的售后处理过程。
这些信号先由真人、用户和真实业务提供。然后 AI 再把它们拆开、重组,从不同人群、场景、卖点和表达方式里,扩展出几十个甚至几百个待验证的假设。
注意,是假设,不是成片。
因为前面说过,如果一开始就同时铺开上千条成片,只会把有限的数据进一步摊薄。AI 真正应该放大的,是探索空间,而不是素材库存。
先用它快速找到更多值得测试的方向,再用真实流量和订单筛掉错误答案。等一个方向真的被验证成立之后,再批量生产成片。
这才是生产能力爆炸之后,更合理的工作方式:真人提供真实世界里的信号,AI 扩大假设,实验系统负责筛选答案。
所以面对这一轮 AI 浪潮,商家最该问自己的,可能已经不是:「我该用哪个 AI 工具做内容?」
而是另外两个问题:我的内容里,有没有一些竞争对手无法轻易复制的真实信号?以及我有没有一套系统,能从一堆看起来都不错的方向里,尽快分辨出哪个只是热闹,哪个才是真机会?
因为接下来,素材只会越来越便宜。
AI也会让每个人都拥有近乎无限的生产能力。但真实世界能够给你的验证机会,始终有限。
未来真正拉开差距的,不是谁生成得更多。而是谁更快知道,什么值得继续。
数据与口径说明
-
About attribution for GMV Max(TikTok):GMV Max 归因口径 -
Conversion reporting by asset in Performance Max(Google): 素材层级转化归因 -
Demand Gen campaign performance guide(Google):"The campaign needs to generate at least 50 conversions";"Your budget should be at least 10 times your target CPA" -
Learning Phase FAQs(TikTok) :"Achieving 50 conversions is the most significant indicator of passing the learning phase" -
Taboola × 哥伦比亚行业报告 PDF:1.55% / 1.31% / 1.03% / 0.20% 这四个数出自这里,30 多万条广告、5 亿多次曝光 -
TikTok Newsroom, 2026-07-10:"we've labeled over 3 billion videos as AIGC" -
TikTok Newsroom, 2025-11-19 :"These efforts helped label over 1.3 billion videos to date" -
Motion报告:12.9 亿美元消耗、578,750 条素材、6,015 个账户、2025-09-01 至 2026-01-01;约 5% 的素材是赢家,占掉约 55% 的消耗 Deezer Newsroom, 2026-07-21: 超过 50% 的新上传是全 AI 生成(月均 9 万首),但只占总播放量的 1–3%
Meta Q2 2026 财报电话会实录(The Motley Fool):"over 9 million small businesses using at least one AI creative tool";"Image generation... saw adoption more than double this quarter"(Susan Li)

