大数跨境

终于拿到内测!豆包-PixelDance真是字节视频生成大杀器

终于拿到内测!豆包-PixelDance真是字节视频生成大杀器 机器之心
2024-09-29
25
导读:豆包-PixelDance真让像素舞动起来了!

字节跳动发布豆包全模态大模型家族,视频生成能力惊艳亮相

在2024火山引擎AI创新巡展深圳站,字节跳动正式推出「豆包全模态大模型家族」,涵盖视频生成、音乐创作、同声传译三大新模型,并对通用语言模型、文生图模型和语音模型进行全面升级,展现出其在多模态AI领域的全面布局与技术实力[k]

视频生成双模型发布:PixelDance与Seaweed登场

本次发布的豆包视频生成模型包括PixelDance(像素跳动)和Seaweed(海草)两个版本。基于DiT(扩散Transformer)架构,模型支持复杂运镜如变焦、环绕、平摇、缩放和目标跟随,实现电影级镜头语言表达[k]

两大模型突破性地解决了多镜头切换中主体、风格与氛围的一致性难题,具备支持复杂提示词、多动作多主体交互、多样化艺术风格及多种宽高比(1:1、3:4、4:3、16:9、9:16、21:9)等核心能力,适用于影视、社交、广告等多种应用场景[k]

实测显示,模型可精准还原“老人眺望大海、轮船驶来、海鸥飞翔”或“女生流泪后转为笑容并拥抱男生”等情感细腻、动态丰富的场景,运镜流畅自然,视觉表现力接近专业影视制作水平[k]

目前,PixelDance与Seaweed已在火山引擎平台开启企业邀测[k]

音频模态双突破:音乐生成与同声传译模型发布

豆包音乐模型支持文本与图片双输入生成音乐,用户可通过一句话或一张照片激发AI创作旋律,并支持将10秒语音/歌声转换为不同风格的音乐作品,涵盖民谣、流行、摇滚、国风、嘻哈等十余种风格[k]

该模型已接入豆包App与海绵音乐App,开发者可通过火山方舟API调用[k]

豆包同声传译模型采用端到端技术路径,避免传统三阶段流程的误差累积,延迟控制在半句话以内,在办公、法律、教育等专业场景下准确率接近甚至超越人类同传水平[k]

模型还具备音色克隆功能,可生成与说话人音色一致的外语语音,实现“真正同声”的沉浸式体验[k]

已有模型全面升级,性能与效率双提升

豆包通用模型Pro完成迭代,综合能力提升25%,尤其在数学与专业知识领域表现突出;上下文窗口从128k扩展至256k,可一次性处理约40万汉字,相当于《三体》前两部内容量[k]

文生图模型升级至2.0版本,采用更高效DiT架构,出图速度最快达3秒,强化物理感知能力,能准确理解多主体、数量、大小、姿态等复杂属性,并高质量呈现中国古代绘画风格如水墨、工笔等[k]

语音合成模型新增混音功能,支持自由组合不同音色,包括用户自定义音源复刻,生成声音在自然度、连贯性、音质和韵律上达到接近真人的高水平[k]

为提升实用性,火山引擎将豆包Pro默认TPM(每分钟token数)设为800k,居业界领先水平,并支持弹性扩容;同时通过技术创新,于2025年5月将每千token成本降至0.001元以下,成为国内首家实现该成本门槛的企业[k]

此外,全新上下文缓存技术可保留对话记忆,降低多轮交互延迟,优化用户体验并减少企业调用成本[k]

构建全模态AI生态,加速产业落地

此次发布会标志着火山引擎“全模态大模型家族”战略的全面落地,覆盖文本、图像、视频、语音及跨模态应用,致力于打造一个从创意生成到内容生产的完整AI生态系统[k]

通过高性能、高效率与低成本的结合,火山引擎正推动大模型技术向企业级应用加速渗透,助力开发者与创作者实现“一人即团队”的智能创作新模式[k]

【声明】内容源于网络
0
0
机器之心
专业的人工智能媒体和产业服务平台
内容 17239
粉丝 0
机器之心 专业的人工智能媒体和产业服务平台
总阅读390.5k
粉丝0
内容17.2k