大数跨境

“快手版Sora”可灵开放测试 最长可生成2分钟视频

“快手版Sora”可灵开放测试 最长可生成2分钟视频 圆海
2024-06-06
2
导读:快手公司推出了一款名为可灵的全新国产视频生成大模型,它采用了与Sora相似的技术路线,并结合了快手自研的技术创新。这款模型能够生成长达2分钟、30fps、1080p分辨率的超长

快手发布国产视频大模型“可灵”,正式开启邀测

快手公司推出全新国产视频生成大模型“可灵”。该模型采用与 Sora 相似的技术路线,融合快手自研创新技术,具备生成长达 2 分钟、30fps、1080p 分辨率超长视频的能力,并支持多种宽高比。不同于实验室演示,“可灵”定位为产品级应用,现已在快影 APP 正式开启邀测。

核心能力:精准模拟物理规律与复杂运动

“可灵”大模型不仅能基于想象进行创作,更能准确描绘符合真实物理规律的运动场景。其擅长处理复杂、大幅度的时空运动,能够模拟真实物理特性及交互细节,例如精准呈现人物进食时食物形态的细微变化。

技术架构:原生文生视频与四大核心要素

“可灵”采用原生文生视频技术路线,摒弃了传统的“图像生成加时序模块”组合,这是其实现长时长、高帧率及复杂运动处理的关键。快手大模型团队围绕模型设计、数据保障、计算效率及能力扩展四大核心要素进行了深度优化。

模型设计:类 Sora 的 DiT 结构

在架构上,“可灵”采用类 Sora 的 DiT(Diffusion Transformer)结构,以 Transformer 替代传统扩散模型中的卷积网络 U-Net。同时,通过自研的 3D VAE 网络和全注意力机制(3D Attention),显著提升了模型的建模能力。

数据构建:精细化标签体系

团队构建了完备的标签体系,对训练数据进行精细化筛选,并研发专用视频描述模型,旨在生成精确、详尽且结构化的视频描述,为模型训练提供高质量数据支撑。

运算效率:Flow 模型与分布式训练

为提升硬件利用率,“可灵”选用传输路径更短的 Flow 模型作为扩散基座,并结合分布式训练集群与算子优化技术,大幅提高了运算效率。

能力扩展:自由宽高比与时序拓展

在功能扩展方面,“可灵”支持自由调整视频宽高比,研发了基于自回归的视频时序拓展方案,并兼容多种控制信息输入,增强了应用的灵活性。

生态应用与未来展望

基于“可灵”大模型,快手已推出"AI 舞王”、"AI 唱跳”等衍生应用,图生视频功能也即将上线。快手在大模型领域动作迅速,通过与多所高校及科研机构合作,积累了深厚的技术沉淀。随着文生视频功能的正式亮相,预计将在短视频场景中实现广泛落地。

AI 视频创作感兴趣的用户,可前往快影 APP 体验“可灵”大模型功能。

官网地址:https://kling.kuaishou.com/

【声明】内容源于网络
0
0
圆海
圆海跨境知识分享
内容 4092
粉丝 0
圆海 圆海跨境知识分享
总阅读7.3k
粉丝0
内容4.1k