大数跨境

万字长文:AI智播细节+变量+去重处理保姆级教程

万字长文:AI智播细节+变量+去重处理保姆级教程 怪兽抱抱AI电商
2025-03-03
2
这是怪兽抱抱的第2篇文章
这一年的时间我主要在做,AI+电商方面的业务。自研AI实景语音直播工具和纯无人直播工具,以及Ai在电商上的应用。整合项目资源,以及提升自己的内核。
本文是一篇关于AI直播的内容,飞书文档有2万多字。写这篇文章的目的,今年以来,市面上的AI直播工具有很多。但是大多数人做不起来,原因是但是很多人不懂得其中的原理,用了AI工具实际上也做不起来。

里面一些内容。可能在外面收费都要大几万,甚至有可能想要付费也学习不到,更甚至有些玩家可能看了这篇文章会把部分内容加入到自己的线下课中,这些内容是我花很长的时间去研究去测试去请教得出来的结果。

一.Ai智播声音解决方案

1.音频重复度


1.1文案编写:拿袋鼠智匠Ai举例,主文案,互动文案,自定义文案,脚本一定要多写,写的越多越好,写的越全越好。

1.2文案Ai改写:Ai改写,话术去同质化,多样化语言表达,重新写不同的版本,要求意思一样,文字完全不一样,要口语化,不要书面化,不要出现极限词,同时注意话术违禁词


在生成文本内容时,让 AI 使用多种句式和词汇来避免单调。例如,不要总是用陈述句,可以穿插疑问句、感叹句。在词汇上,除了常用词,也使用一些同义词或近义词来丰富表达。

下面的智能文案重写以及不同主播说出来的话术感觉是不一样的。需要在编写话术过程中选择合适的主播,适当增加或减少逗号,句号,以及空格等。(需要提示词后台私我)

1.3多变量及中场控话术:AI细节的处理,多变量和中控场控话术,回复关键词,以及多项变量以及控制回复回复概率

  • 脆皮五花肉主播助播相互配合相互搭配

  • 实时模块报时报在线人数+主播助播配合

  • 观众昵称和重读弹幕模块

1.4内容流畅性方面:文本预处理:在写文案的时候,要确保文本内容通顺、逻辑连贯。避免出现错别字、语病和突兀的内容衔接,不可以有读出错别字等。这样可以让生成的语音更加流畅自然。语速调整:根据直播内容的难易程度和重要性来调整语速。


1.5声音的流畅度以及匹配度:

1.5.1声音的流畅度

自然连贯性,从听众的角度来看,流畅的 AI 声音就像是人类自然说话一样,没有明显的停顿、结巴或者不连贯的地方。例如,在一个长篇的故事讲述中,AI 语音应该能够像人类讲话一样,语句之间过渡自然,不会出现奇怪的中断或者重复某个词语的现象。应该有语音停顿和节奏控制。

自然停顿:像人类说话一样,在句子之间、短语之间以及重要内容前后插入适当的停顿。

节奏变化:根据内容的情感和重要性调整语音节奏。

语法停顿:就像我们平常说话一样,句子中间要停顿。比如 “我(停顿)今天很开心”,或者 “这个产品(停顿)很好用”。这样停顿一下,符合我们平时说话的习惯,观众也能更好地跟上你的节奏。

语义停顿:你想让观众注意某个重要的东西,就要停顿一下。比如 “这个优惠(停顿)超级大”,你在 “优惠” 后面停一下,观众就会更关注优惠这个重点。

语气词的添加:在句子中适当添加像 “嗯”“啊”“呢”“吧” 这样的语气词,使语音听起来更自然。例如,“嗯,啊,对,好,等。 不过要注意语气词不能过度使用,以免显得啰嗦。同时也可以模拟口头禅。

1.5.2声音的采集度

采集主播语料的时候一定要注意主播要在什么样的场景下直播,是室内还是室外,室内的话要在多大的屋子,以及回声多少!还有主播声音离麦的远近,助播离麦的远近。我就有过失误,中控的声音离麦克风太近了。所以你在多大的房间直播,不同房间的回声不同;你在哪里直播,在户外直播就不能用室内声音;你离麦克风多远,场控中控就不可能贴麦说话

单独训练每个品类主播的声音,在声音素材采集的时候就要求主播的声音必须和真实直播的时候一模一样,这样训练出来的声音才有98%相似度,分别训练处主播情绪激动的高音部分,主播娓娓道来的第低音部分,尽可能的把声音的频率范围囊括的全一些,声音的语速也全一些,主播的口语化词语,节奏和停顿,有自然的停顿、语气变化、呼吸声,甚至可能会有口误、重复等情况。以及一个主播声音不要用太长时间,建议2-4小时为一组,

1.5.3声音的匹配度

音色和风格与内容主题相匹配。如果是情感类的内容,AI 声音可以是一种具有深厚文化底蕴、沉稳庄重的音色。而对于卖场型的直播间需要更加的激情,一定要选择合适的音色:根据直播要卖的品类和目标受众来挑选 AI 语音音色。

自然的语调变化:设置 AI 语音的语调,使其能根据内容自然地变化。例如,在提问的时候语调上扬,在陈述重要观点的时候语调沉稳而有力。通过模拟人类自然说话时的语调起伏,增强语音的吸引力。

情感模拟:为 AI 语音添加适当的  情感表达。目前能做到的时候想要啥样的效果就要给到啥样的素材,能还原真实主播98%的音色。

1.6如何解决低频互动违规?

解决低频互动问题。先解决话术架构问题,公屏上一般会出现哪些问题?需要怎么去解决?提前设想好用户有可能会问到的问题。把答案植入到话术里面。植入问题非常密集。配合画面去说话。并主动互动,提前设计好话术里面抛出问题,然后解决问题。话术逼单密集。主播在录制素材的时候先多录入一些互动的问题,多问一些通用的互动问题




2.音色和语调调整

2.1添加语音瑕疵:真实人类的语音会有一些小瑕疵,如轻微的口吃、咬字不清或者换气声。软件中,可以通过插入一些短暂的停顿或者模拟换气声来增加真实感。比如,每隔几句话就插入一个 0.1 - 0.2 秒的小停顿,真实麦克风或者在适当的位置添加微弱的换气声效果,让声音听起来更像真人在说话。

2.2音色调整:尽量让 TTS 语音的音色更接近自然人类声音的音色变化,包括加入一些自然的颤音、音量的微小波动等。(软件升级后更好),目前能做到每隔一定时间换主播音色。

2.3背景音混合:加入复杂的背景音,如嘈杂的环境声、背景音乐等,让音频特征检测变得复杂。但是,如果背景音过大影响内容理解,又会引发其他问题,并且平台也可以通过技术分离背景音和主播声音来检测。

2.3.1.在采集视频素材的时候自带环境音:在使用手机拍摄视频时,避免手指遮挡手机底部的麦克风。同时避免手机没电,同时,不同的拍摄模式可能会对音频采集有不同的影响。真实的直播过程出现的噪音,尽可能的录进去,声音大点没关系,毕竟后期可以降低音量。

2.3.2直播过程中物理麦克风收音:直播过程中,一定要加入一个物理麦克风,收录实时的现场环境,将物理麦克风和虚拟麦克风(如软件模拟的麦克风或电脑内部麦克风)的声音合并。

2.3.3OBS内放环境音声音素材:OBS里面加入一些提前录制好的环境音

2.4软件参数调节:TTS 软件通常有许多参数可以调整音色。例如,可以改变音调的高低起伏范围,使其更贴近人类在情绪变化或自然交流时的状态。人类说话时,音调不是一成不变的,会随着语句的重点、情绪(如兴奋时音调升高)等因素而变化。对于 TTS 语音,可以尝试设置音调在一个较小的区间内随机波动,比如设置音调在平均音调上下浮动 5 - 10% 的范围。




3.背景音混合

3.1环境音模拟:选择与直播内容相匹配的环境音。如果是户外直播主题,可以添加街道上的车辆行驶声、人群交谈声、风声等。对于室内直播,可以添加电器运行的嗡嗡声、空调的风声等。这些环境音的音量应该根据直播场景合理设置。


3.2背景音乐融合:根据直播主题选择合适的背景音。其节奏和风格要与直播内容相符。网易云音乐选择一个歌单,随机播放,声音不宜过大或者过小。比如,在读书分享直播中,可以添加轻柔的雨声或舒缓的古典音乐作为背景音,营造轻松的氛围;但要注意背景音不能太响,以免掩盖 AI 语音。


3.3音效配合:适时地添加一些音效来增强直播效果。一般在视频素材采集的时候就已经放进去了。




4.多音频源融合

4.1入真人语音片段:在 TTS 语音直播过程中,偶尔插入一小段真人语音片段,比如一些笑声、感叹声等。


4.2模拟多人对话场景:如果是模拟多人对话的直播场景,可以使用不同的AI 音色来生成不同 “人物” 的语音,并且调整每个语音的位置、音量和音色等参数,营造出一种空间感和真实的对话氛围。例如,将不同 “人物” 的语音在左右声道之间适当分配,模拟他们在空间中的不同位置。




5.音频传输通道和方式



6.如何避免被直播平台检测到使用虚拟麦克风?

6.1确保声音质量接近真实:使用虚拟麦克风,尽量添加一些背景噪音模拟真实环境。有一些软件可以生成如轻微的环境音、电脑风扇声等背景声音,使声音信号更接近真实麦克风采集的带有环境特征的音频。


6.2音频特效和滤镜:

6.2.1回声和混响效果:适当添加回声和混响效果可以让声音听起来像是在一个真实的空间环境中发出的。例如,模拟在一个房间或者大厅里说话的效果。不过,这种效果需要谨慎添加,因为如果回声和混响参数设置不当,会让声音显得很不自然。而且不同的空间环境对应的回声和混响模式是不同的,需要根据直播场景来合理选择,比如小房间的混响时间较短,而大教堂之类的空间混响时间较长。


6.2.2空间感模拟:音频定位:为真人语音片段和 TTS 语音营造相似的空间感。如果 TTS 语音是模拟在室内正前方发出的声音,那么真人语音片段也应该定位在类似的位置,避免出现一个声音像是在远处,另一个声音像在耳边的不自然情况。可以通过音频软件的声像定位功能来实现,将声音定位在正前方或者根据直播场景合理定位在其他位置。环境音效统一:确保真人语音片段和 TTS 语音带有相同的环境音效。如果 TTS 语音带有轻微的室内环境的混响效果,真人语音片段也应该添加相同的混响效果,使它们听起来像是处于同一个空间环境中。


二.Ai智播画面解决方案



1.直播素材采集


1.1一手素材采集:纯手机实拍多机位拍摄素材,我们一般手机录制拍摄,用相机拍摄内存卡容易占满,所以手机端采用的是1080p像素,30帧。并且会多手机多机位同时拍摄素材

素材全部采集高穿透的直播场景

1.1.2直播转播

1.1.3 4k屏直播

1.1.4 真人直播+录播拉时长(真转无)




2.素材采集细节注意


2.1直播素材时长

素材时长最多不超过循环2遍-3遍,越长越好!!!不要一段20分钟半小时的素材直播20小时,并且2-3天一定要换直播素材。且直播素材A账号用过不要给B账号使用。

如果是纯录播的话记得经常更换素材第一天素材1,第二天素材2,第三天素材3,一个素材用两天就好

直播时长:一个人直播时长尽量不要超过12小时。不然会跳非触发二次审核。真人一个人录播超过12个小时。大概率会被点掉。(模拟真人直播,真人直播再有体力不会超过六小时吧?)我们一般是一个人2-4小时一组,然后有进有出录制。

2.2直播画面变量

2.2.1)时间相关元素方面:在直播场景中,无论是挂在墙上的时钟、日历,还是画面中人物使用的手机、电脑等电子设备上显示的时间,都应该和实际直播时间相匹配。如果在直播过程中,这些时间显示出现明显与实际时间不符的情况,例如时间相差几个小时甚至几天,这是非常明显的录播迹象。

比如说直播间主播提及当下时间为晚上 8 点钟,然而实际状况是处于早上 10 点钟,所以在采集素材的过程中务必要阐述一些通用性质的内容,不可提及当前具体时间以及直播间的人数情况。

以下是一些在直播中识别画面录播的具体案例:一位美妆博主在直播中声称是现场试用一款新口红。但在直播过程中,细心的观众发现,博主手上手表显示的时间与直播实际时间不符,手表时间是下午 2 点,而当时直播时间是晚上 8 点。而且,博主在拿口红的动作上有明显的不连贯,手部像是突然瞬移到了口红位置,中间过渡动作缺失。

一个旅游博主在海边进行直播。在长达两个小时的直播过程中,太阳位置一直没有变化,海面上的光影也没有任何动态变化。并且,在直播中途,博主身后的一艘游船在画面中出现了两次一模一样的行驶路线和位置。

2.2.2时效性内容方面

比如说现在已经双11了,但是直播间依然在宣传国庆节打折,比如目前已经是卖爱媛橙的季节,但是直播间依然在宣传卖其他产品等

2.2.3实景实时变量道具

放鱼缸,平板放流星雨,跑马灯,旋转装饰球,飘动的织物或彩带,烟雾发生器,放只鸟都可以用起来

2.2.4)OBS虚拟实时变量道具:OBS画面处理字母雨,流星雨等:

桌面时钟:

OBS画面跳动插件:

3.素材画面质量与连贯性

3.1人物穿插关系:人物穿插关系,并且要经常有人出现,比如说这个是我做的录播,在未开始录制之前先点录制,然后人物进场,正常直播间讲品或者做做动作,录制时长人物要有进有出,模拟真人直播时长,比如真人直播一个主播正常播2-4小时,那么录制的时候也要注意正常的时长。同时换人的时候要做人物变量(不同主播,不同衣服,不同发型,不同场景,不同文字等),录制到最后人再走出去,然后点停止录制。

3.2动作衔接方面:在直播过程中,主播的动作是自然流畅的。不可以二次拼接,因为拼接一定会有疏漏。例如,主播伸手去拿一个产品,这个动作会有自然的起始、过程和结束,手臂的运动轨迹是连贯的。如果拼接了,在剪辑拼接的过程中,可能会出现动作不连贯的情况。比如,主播的手在拿产品的过程中突然跳跃了一段距离,或者动作的速度出现不自然的变化,没有过渡阶段。


3.3画面质量方面:物体保持不动,画面稍微抖动,在素材采集过程中,该动的物体可以动,不该动的物体一定不能动,尽可能在同一天完成,怎么讲呢?拿我上面的无骨鸡爪举例,在开始之前台面很干净,但是录制到后面台面已经很不干净,并且一些盆之类的也有明显变化。这样就会导致前后衔接不上来,然后被用户发现穿帮。在室内直播时,如果灯光的位置、强度和颜色有所改变,主播位置发生了移动,那就也是很容易穿帮。


3.4产品细节展示:在素材采集过程中,一个核心要点就是要动起来,不要嫌麻烦,不要嫌累,产品中一定要多多展示产品细节可以一次性全部录进去,也可以分批绿幕录制。以下案例小黄鱼就是不合格案例,因为没有特写细节展示,同理牛肋排就有产品展示。


下面鸡爪的素材你们觉得拍的怎么样?

3.5环境音收录及直播场景匹配

在素材采集过程中注意不要瞎说话,因为要收录原始的环境音,在直播环境中,噪音情况很复杂。比如在街边直播,会有车辆行驶的声音、人群的嘈杂声等。这些噪音会随着环境变化而变化,像是车辆经过时,噪音会突然增大,随后又减小。如果在室内直播,也可能会有旁人说话声、电器运行声等不确定的噪音。因为室内环境音,工厂环境音,室外环境音,直播间环境音都是不一样的。

4:直播画面搭建方式

1.纯实景"顾名思义,手机或者摄像头直接对着搭建好的实景进行直接开播。


2.纯绿幕"顾名思义纯录播,纯放视频直播,容易违规视频素材:如果纯用视频作为背景,必须要原创素材,素材尽可能大于2小时,如果长时间直播,尽量不要重复三轮以上。禁止A直播间用过的素材不经过任何处理直接放在B直播间用,不然系统会有反应。如果实在没有新视频,更新了一下蒙版。

3.虚实结合:虚实景结合:实景占比画面二分之一左右,最低不少于三分之一,尽可能场景会动,非静止画面。

4.AI换脸直播

5.录播视频网络特征更接近实时直播的稳定性?

5.1视频码率优化:根据网络带宽调整视频码率。如果网络带宽有限,适当降低码率可以使视频播放更稳定。例如,在网络状况一般的情况下,将码率从较高的蓝光品质(如平均码率 10Mbps 以上)降低到高清品质(平均码率 3 - 5Mbps)。(其他人说的,自己并未实操)



三.Ai智播用户体验解决方案


1.实时连接弹讲解

物理:卷极(现在价格比前几个月贵好多);元音(个人感觉不太好用)虚拟:小云朵,光圈智播等

2.实时滚屏


3.实时文字置顶


4.实时评论设置,回复用户问题,快捷语回复关键词等


5.屏蔽关键词


6.发福袋


7.互动性方面

实时互动功能集成:添加互动功能,让 AI 语音能够实时响应观众的提问和评论。可以通过设置关键词触发机制,当观众发送特定关键词的评论时,AI 语音能够及时做出针对性的回答,或者让AI智能意图回复,互动引导语设计:用话术引导用户公屏互动


7.1AI工具模拟互动回复行为

在模拟点赞和评论时,设置不同的时间间隔。不要让点赞和评论的行为过于规律,例如点赞可以按照一个随机的时间间隔进行,间隔时间在 30 秒 - 2 分钟之间随机分布

评论内容回复:使用Ai来生成多样化的评论回复内容。

7.2设置延迟回复

延迟时间动态调整:设置一个延迟回复的时间范围,比如 10 - 30 秒。但这个延迟时间不能是固定的,可以根据问题的复杂程度和类型进行动态调整。

回复内容生成:回复内容的生成可以在进行文案编写的过程中。对于常见的问题类型,准备好一系列的回答模板,并且在回答中可以适当加入一些语气词和思考性的表达,比如 “嗯…… 这个问题有点复杂,不过我可以简单给你讲讲”,让回复看起来更像是经过思考后给出的。

8.尽可能打单品,客观因素产生的变量越低越好


最后希望大家都爆单!!!




如果你也喜欢这篇文章,别忘了点赞,收藏和分享!也欢迎关注我的公众号【怪兽抱抱AI电商】,获取更多AIGC,直播,电商相关的干货内容。


【声明】内容源于网络
0
0
怪兽抱抱AI电商
1234
内容 103
粉丝 0
怪兽抱抱AI电商 1234
总阅读1
粉丝0
内容103