导读:7月17日,在2026世界人工智能大会(WAIC)现场,百度一镜正式首发数字人视频播客解决方案。数字人视频播客具备两大突出优势:在内容力层面上,可实现高质量多人剧本创作,内容力超越真人;在表现力层面上,数字人视频播客具有真人感审美与细腻的微表情,人物表现真实生动、自然鲜活。
传统数字人的驱动逻辑是“打情绪标签”——台词里出现“高兴”就调用一段预设的“傻笑”,出现“生气”就机械地换成“瞪眼”。这种模态拼接导致眼嘴分离、神态僵硬,观众潜意识一眼就能看穿。而百度一镜的做法是把数字人从“执行指令的木偶”变成“理解内容的演绎者”。文心大模型像导演一样,根据人物设定、剧情场景和对话内容,从情绪、表情、动作、声音、人设、场景六个维度做综合判断,对眼神、嘴角、眉毛、面部肌肉等微表情进行细粒度规划。在技术层面,百度一镜数字人视频播客构建了三层底层能力支撑:依托文心大模型,实现微表情的细粒度规划,突破单一情绪标签限制;自研数字人专精模型将表情控制粒度压缩至1秒以内,实现眼神、肢体动作与语音的精准同步。据现场视频实测,当对谈中一方抛出一个观点,数字人能在1秒内给出挑眉、抿嘴、眼神游离等细微反应,实现了自然插话和真人般的对话节奏;同时,基于海量专业视听样本的精细化训练,提升多模态深度融合水平,进一步增强数字人的整体生成表现。为了让数字人摆脱“完美AI脸”的塑料感,百度一镜在视觉层面采用了分层复刻皮肤肌理和多光源动态拟合技术,模拟真实光线在皮肤不同层面上的反射,并为数字人保留了细纹、黑眼圈等略带瑕疵的差异化面部特征,让数字人的质感更接近真人。
产品功能方面,百度一镜提供编剧、导演、剪辑三大AI智能体及多种skills,支持自动生成思辨型访谈脚本,并可覆盖单人讲学、双人观点对谈等多种场景,适用于财经、法律、科技、人文等全垂类内容生产。
据实测数据,百度一镜数字人播客使制作成本下降74%,内容表现力提升785%,平均播放时长增长29%,人物自然度综合表现超越市场主流模型。
百度一镜于今年5月在Create大会上完成升级,定位为全球首个集数字人直播、数字人视频、实时互动于一体的全场景多智能体数字人平台。根据IDC、沙利文等多家机构报告,百度一镜综合能力及市场份额已连续位居行业第一。截至目前,百度一镜累计服务客户超10万,覆盖30多个行业。从罗永浩数字人直播首秀超1300万人次观看、GMV超5500万元,到“AI范志毅”实时互动数字人在世界杯期间上线,再到此次WAIC首发数字人视频播客,百度一镜正在从电商带货走向深度访谈、知识科普、品牌营销等更复杂的内容形态,推动视频内容创作进入工业化量产时代。

