即梦 AI 上线 OmniHuman:图音驱动生成高自然度视频
近日,抖音集团旗下图片视频工具“即梦 AI"宣布推出基于全新多模态视频生成模型 OmniHuman 的功能。该功能允许用户仅通过输入一张图片和一段音频,即可生成动作生动、口型匹配的 AI 视频,旨在显著提升短片制作的效率与质量。
自研闭源模型,支持多尺寸与复杂动作
OmniHuman 是字节跳动自研的闭源模型,具备强大的多模态处理能力。它支持肖像、半身及全身等不同尺寸的图片输入,并能依据音频内容驱动人物完成演讲、唱歌、乐器演奏及移动等复杂动作。针对以往人物视频生成中常见的手部细节崩坏问题,该模型实现了显著优化。
风格兼容性强,暂不对外提供下载
除真人影像外,OmniHuman 在动漫、3D 卡通等非真人图片输入上也表现优异,能够精准保持原图的特定风格与运动模式。鉴于技术滥用的潜在风险,字节跳动明确表示,OmniHuman 目前不会对外提供下载服务。
开启小范围内测,强化安全审核机制
即梦 AI 方面透露,虽然模型当前表现良好,但在达到影视级真实度上仍有提升空间。相关功能将以小范围内测形式进行调优,并逐步开放。为确保技术正向应用,平台将部署严格的安全审核机制,并对输出视频强制添加水印标识,助力创作者安全、高效地实现创意表达。

