今日,全新一代视频生成模型 Wan3.0 正式开启公测。该模型在生成时长、多模态创作、全能参考与真实感等核心维度实现全面升级:单次支持生成 30 秒长视频,完整表达创作意图;除文本、图片、音频、视频外,首次支持 doc、xls、ppt、pdf、md 等文档格式输入;致力于精准还原真实世界,实现人物“千人千面”,确保每一帧画面既真实又可信。
叙事升级:单段 30 秒生成与智能时长控制
Wan3.0 支持单段 30 秒视频生成,使叙事节奏更加从容,能够充分表达连续运镜、一镜到底等复杂镜头语言,推动 AI 视频从“生成单一镜头”迈向“讲述完整故事”。
此外,模型新增智能时长功能,可根据提示词自动推荐最佳时长;结合视频延长功能,用户可轻松延展剧情走向,让创意自然生长。
视频来源:创作者@上分吧 Pt
万物皆可生视频:结构化文档深度解析
视频正成为通用表达方式,Wan3.0 已从单纯的视频生成模型跃迁为信息表达载体。模型不仅能以文本、图片、音视频作为参考,更能直接读取 doc、xls、ppt、pdf、md 等结构化文档(单个文件或链接限制为 100MB 以内、50 页以内),搭配提示词即可快速生成教学课件、产品演示等内容。
例如,上传咖啡馆介绍文本并配合指令,即可生成完整的品牌形象片。这得益于模型强大的提示词工程与指令遵循能力,它能将千差万别的信息输入转化为连贯的视频表达。
真实感重塑:千人千面与细节刻画
视频生成模型正从内容创作工具升级为生产力工具,用户对画面的要求已超越清晰,更追求真实。Wan3.0 力求精准复刻现实场景与数字化信息。
人像生成:情绪自然,细节入微
Wan3.0 生成的人像力求“千人千面”,能敏锐刻画五官与皮肤细节。人物情绪表达自然克制,微表情与肢体动作高度联动;即便在群像场景中,也能细腻呈现不同角色的复杂情绪。
一致性突破:生产力场景的核心指标
一致性是生产力应用的关键。在全能参考任务中,Wan3.0 可精准复刻参考细节,保持角色、道具、声音、空间关系及风格等关键维度的高度一致。
多维度稳定性表现
- 角色一致性:稳定保持五官、发型发色、形体、服饰及配饰等细粒度特征,避免画面“出戏”。
- 道具一致性:多角度外观、硬件结构、Logo 及材质细节均保持稳定。
- 场景一致性:准确处理角色站位与机位视角的空间关系。
- 风格一致性:精准渲染影视拍摄调性,多风格创作时不易发生混淆。
针对数字化信息,Wan3.0 提升了画面审美水准,注重色彩和谐与信息流畅度,让图表、数据与界面内容同样具备质感。
编辑能力进阶与公测渠道
Wan3.0 大幅提升了视频编辑能力,支持对画面、剧情与台词进行修改。目前,模型在声音质感与文字准确度方面仍有优化空间。
即日起,Wan3.0 已在阿里云百炼、万镜一刻、万相官网、千问创作 PC 端、IF STUDIO 和堆友开启公测,并在千问 App 灰度开放,API 接口将于近期全量上线。
从 Wan1.0 学会“画”,到 Wan2.0 学会“拍”,再到 Wan3.0 学会“懂”——理解真实世界的运转方式。从一段视频到一个世界,这条路虽长,但前景已愈发清晰。

