大数跨境

字节跳动放大招!OmniHuman数字人模型即将上线:一张图+一段音频即可生成视频

字节跳动放大招!OmniHuman数字人模型即将上线:一张图+一段音频即可生成视频 圆海
2025-02-08
2
导读:近期,抖音集团旗下图片视频工具即梦AI在官方社交媒体上发布了一条新功能上线预告片。新功能采用了全新的多模态视频生成模型OmniHuman,让用户仅需输入一张图片和一段音频,

即梦 AI 上线 OmniHuman:图音驱动生成高自然度视频

近日,抖音集团旗下图片视频工具“即梦 AI"宣布推出基于全新多模态视频生成模型 OmniHuman 的功能。该功能允许用户仅通过输入一张图片和一段音频,即可生成动作生动、口型匹配的 AI 视频,旨在显著提升短片制作的效率与质量

自研闭源模型,支持多尺寸与复杂动作

OmniHuman 是字节跳动自研的闭源模型,具备强大的多模态处理能力。它支持肖像、半身及全身等不同尺寸的图片输入,并能依据音频内容驱动人物完成演讲、唱歌、乐器演奏及移动等复杂动作。针对以往人物视频生成中常见的手部细节崩坏问题,该模型实现了显著优化。

风格兼容性强,暂不对外提供下载

除真人影像外,OmniHuman 在动漫、3D 卡通等非真人图片输入上也表现优异,能够精准保持原图的特定风格与运动模式。鉴于技术滥用的潜在风险,字节跳动明确表示,OmniHuman 目前不会对外提供下载服务

开启小范围内测,强化安全审核机制

即梦 AI 方面透露,虽然模型当前表现良好,但在达到影视级真实度上仍有提升空间。相关功能将以小范围内测形式进行调优,并逐步开放。为确保技术正向应用,平台将部署严格的安全审核机制,并对输出视频强制添加水印标识,助力创作者安全、高效地实现创意表达。

【声明】内容源于网络
0
0
圆海
圆海跨境知识分享
内容 4092
粉丝 0
圆海 圆海跨境知识分享
总阅读7.3k
粉丝0
内容4.1k