大数跨境

前字节视觉负责人创业,3 年把 AI 视频工具做到 1.5 亿注册用户、估值20亿美元

前字节视觉负责人创业,3 年把 AI 视频工具做到 1.5 亿注册用户、估值20亿美元 Fun AI Everyday
2026-07-29
0
导读:2023年初,王长虎准备创业。一些投资人见到他的第一反应,不是讨论技术,也不是讨论市场,而是觉得他“不够年轻”。

今天分享的这家公司,我其实很早就分享过:国内宝藏 AI 公司|爱诗科技:AI 视频生成出海玩家

7月初,这家公司刚完成 3亿美元的 C轮融资创下了亚洲 AI 视频生成单笔融资记录。


2023年初,王长虎准备创业。

一些投资人见到他的第一反应,不是讨论技术,也不是讨论市场,而是觉得他“不够年轻”。

当时,ChatGPT 刚刚出现,AI 创业最受关注的是大语言模型。

投资人普遍认为,大模型变化太快,35 岁以下的年轻创始人学得更快,也更了解第一批AI用户。

王长虎的履历正好相反,他在计算机视觉领域已经做了近20年。

从中国科学技术大学博士毕业后,王长虎在微软亚洲研究院工作了13年。

2017年,他加入字节跳动,组建 AI Lab 视觉技术团队,担任集团视觉技术负责人,参与了抖音和 TikTok 早期视觉技术体系的建设。

简单来说,他过去的工作,是让机器“看懂视频”。

一段视频里有什么人、人在做什么、镜头如何移动、用户为什么会停留、点赞或者划走,这些内容都需要被机器识别,才能用于推荐、搜索、审核和广告。

2021年,王长虎离开字节跳动,进入龙湖负责数字化和智能化转型。

两年后,他再次离职,创办爱诗科技。

另一位联合创始人谢旭璋,则走了一条完全不同的路线。

谢旭璋是 90后,毕业于北京大学光华管理学院,创业前在光源资本工作了6年,主要关注互联网、TMT 和 AI 项目。

生成式AI出现后,他开始频繁参加线下黑客松,尝试 AI 图片和视频产品,随后与王长虎组成创业团队。

一个长期研究如何让机器理解视频,一个长期研究公司、资本和商业机会。

但两个人有一个共同点:此前都没有完整操盘过一款面向普通用户的消费产品。

但是三年后,他们做出的 PixVerse 爱诗科技已经拥有超过 1.5 亿注册用户、1500 万月活跃用户,覆盖 177 个以上国家和地区。

2026 年 7 月,PixVerse 宣布完成C轮扩展融资,使整个 C 轮的融资总额达到4.39亿美元,估值超过20亿美元。

公司目前只有约 150 名员工,分布在新加坡、北京和上海

所有人都在做大语言模型,他们选择了视频

爱诗科技成立于 2023年 4月。

公司刚成立时,并没有立刻确定要做视频生成。

当时市场上最热的是ChatGPT,创业者集中在聊天机器人、办公工具和大语言模型。

直到 2023年 6月,核心团队基本到位,王长虎决定把资源全部投入视频生成。

原因并不复杂,大语言模型已经聚集了大量公司,AI 绘画也有 Midjourney 和Stable Diffusion。

但视频生成难度更大,需要同时处理人物、物体、动作、镜头、光线和前后画面的一致性,真正投入这一方向的团队反而不多。

这与王长虎过去的经历又高度匹配。

仅仅四个月后,2023 年 10月,爱诗科技完成第一代视频生成模型。

2024 年1月,海外产品PixVerse 正式上线。

最初的 PixVerse 已经可以让用户输入一句话或者上传一张图片,生成一段短视频。

上线 88 天,用户累计生成了 1000万条视频。

但这个阶段的 PixVerse,仍然是一款典型的 AI 生成工具。

用户需要写提示词,等待模型生成,然后在几次结果里挑出一个勉强可用的版本。

这对专业创作者可以接受,对普通人却太麻烦。

普通用户不会为了生成一条几秒钟的视频,反复修改提示词、等待几分钟,再连续尝试五六次。

PixVerse 后来真正跑出来,靠的不是继续给用户增加参数,而是把这些参数全部藏了起来。

不用再写提示词,而是直接上传一张照片

现在打开 PixVerse,普通用户最容易理解的功能不是“文生视频”,而是各种视频模板。

用户上传一张自己、朋友或者宠物的照片,再选择一个模板,就可以让照片里的人变成美人鱼、超级英雄、玩具手办,或者让宠物跳舞、做动作。

整个过程不需要写提示词,也不需要理解模型。

它和短视频软件里的传统特效看起来相似,但生产方式不同。

传统特效通常需要设计师和工程师针对一个效果单独制作。换一个动作、人物或者场景,往往需要重新调整。

PixVerse 的模板建立在视频生成模型上。

模型需要先理解照片中的主体,再重新生成一段完整的动作和变化过程。

例如,一个人“变成超级英雄”,并不只是在脸上覆盖一层贴纸,模型还要生成服装变化、身体动作、环境反应和镜头效果。

同一套生成能力可以被封装成不同模板,也可以适应不同人物、动物和图片。

对普通用户来说,PixVerse 把一个开放式创作问题,变成了一道选择题:

上传照片、挑一个效果、等待几秒,然后把结果分享到 TikTok、Instagram 或者其他社交平台。

这个产品改动看起来不复杂,但它改变了 PixVerse 的用户群。

过去,AI 视频工具服务的是愿意研究提示词和参数的创作者。

模板出现后,任何有一张照片的人都可以使用。

第一次大规模破圈,靠的是“毒液变身”

2024 年 10月,PixVerse 发布 V3模型。

此前,AI 视频生成很像“抽卡”。同一个提示词生成五次,可能只有一次能用。

人物的脸会变,手脚会错位,动作做到一半突然消失,背景里的物体也会莫名变化。

PixVerse V3 首先解决的是生成成功率

按照王长虎的说法,在特定模板场景中,V3 把过去很低的成功率提升到了接近100%。

用户上传一张照片,选择模板,大部分情况下都能得到一个完整结果。

PixVerse 随后上线了“毒液变身”等模板。

用户上传照片后,照片中的人物会逐渐被黑色物质覆盖,最后完成类似超级英雄的变身。

这类视频开始在 TikTok、Instagram 等平台传播,全网累计播放量超过 10亿次。

仅这个阶段的变身特效,就为 PixVerse 带来了约 1000万名新增用户。

2024 年 12月,PixVerse 又发布 V3.5,把视频生成时间从分钟级压缩到10秒以内,随后推出移动端 App。

生成成功率解决“能不能用”,生成速度解决“愿不愿意等”,模板则解决“普通人知不知道该做什么”。

这三个条件同时满足后,PixVerse 才从一个模型演示工具变成了一款消费产品

字节的经验,迁移过来的不是数据,而是“怎么看视频”

要分享 PixVerse,就必须聊聊一个特别容易被忽略的能力:数据标注

联合创始人谢旭璋认为,视频数据本身并不稀缺,网上到处都是视频。

难的是,如何准确描述一段视频里发生了什么。

这里的能力迁移,并不是把抖音或 TikTok 的数据带到新公司,而是把一套理解视频的方法带了出来。

推荐系统要把正确的视频推给用户,首先需要“看”懂视频

它不能只知道“画面里有一只猫”,还需要进一步理解:

猫是在奔跑还是睡觉,镜头是静止还是移动,情绪是搞笑还是紧张,动作在哪一秒开始,用户最可能在哪一个位置失去兴趣。

视频生成模型同样需要这种理解能力。

如果训练数据只告诉模型“这是一段超级英雄视频”,模型很难学会人物如何转身、衣服如何变化、镜头如何推进,以及前后动作如何连起来。

标签越准确,模型越容易理解“变化发生的过程”。

王长虎在字节跳动参与建设的视觉理解技术,原本服务于抖音、TikTok的内容识别和推荐。

到了 PixVerse,这套能力被用于整理和理解训练视频。

这也是 PixVerse 与单纯采购开源模型、再套一层产品界面的 AI 视频工具之间的区别。

开源模型更新一次,后者的产品能力就可能被重新洗牌。

PixVerse 同时控制底层模型和上层产品,用户在产品里的生成、重试、下载和分享行为,又能持续告诉团队哪些效果更受欢迎、哪些动作容易失败。

模型决定产品能做到什么,产品则告诉模型下一步应该改什么。

不过,数据标注并不是 PixVerse 唯一的技术答案。

王长虎也多次强调,视频生成速度和质量来自模型架构、算法、工程优化和产品反馈的共同作用。

如果把它简单归结为“字节有很多视频经验”,就低估了视频模型训练的复杂程度。

从 1200万到 1.5亿用户,用了不到两年

PixVerse 的用户增长,可以分成几个阶段。

2024 年 1月,PixVerse 海外版上线,88 天生成 1000万条视频。

到 2024年 12月,PixVerse 注册用户超过 1200万,月活跃用户接近 600万。

2025 年 3月,注册用户超过 4000万,月活跃用户达到 1500万。

2025 年 5月,用户规模超过 6000万。

V4.5上线后,一款“咧嘴笑”模板把 PixVerse 推到美国 iOS 应用下载榜第四。

2025 年 8月,用户规模突破 1亿,产品推出 13 种语言,覆盖 175 个以上国家和地区。用户累计生成超过 8亿条视频。

2026 年 7月,注册用户达到 1.5亿,月活跃用户超过 1500万。

如果你看完这篇文章,打开 PixVerse 的网站,你会看到满屏的模板库,相信你也很难忍得住不用这些模版做一张自己/宠物/动漫角色的图片或视频。

不到一年做到 4000万美元年化收入

PixVerse 早期先积累用户,到 2024年 11月才正式开始商业化。

它的个人用户主要通过订阅和点数付费。不同模型、分辨率、视频长度和是否生成音频,会消耗不同数量的点数。

2025 年 10月,爱诗科技披露,PixVerse 与国内版 “拍我AI” 的年度经常性收入已经超过 4000万美元。

从 2024年 11月开始收费,到 2025年 10月,PixVerse 的收入增长超过 10倍。

公司当时表示,订阅收入已经可以覆盖绝大部分成本,现金流接近转正。

个人订阅之外,PixVerse 还在发展第二种收入:把视频模型卖给企业和开发者。

目前,PixVerse 把模型分成三条产品线:

  • V 系列面向普通用户和 API 调用,主要负责文生视频、图生视频、音画同步和常见创作功能。

  • C 系列面向影视和商业制作,强调镜头控制、角色表现、多镜头内容和更专业的制作流程。

  • R 系列面向游戏、互动娱乐和“世界模型”,重点不再是生成一条固定视频,而是让画面根据用户操作持续变化。

PixVerse 目前图生视频 API 的公开价格约为每分钟 4.8 美元。

领投它的阿里巴巴自然也已经与PixVerse达成合作,将其视频生成能力部署到相关业务中。

融到 4.39亿美元后,PixVerse 开始把目标移到游戏

PixVerse 最近一轮融资的投资人名单很有意思。

2025 年 9月,公司完成 6000万美元 B轮融资,由阿里巴巴领投。一个月后,又完成 1亿元人民币 B+轮融资。

2026 年 3月,PixVerse 完成约 3亿美元 C轮融资,由鼎晖投资领投,中国儒意、三七互娱等产业投资方参与。

2026 年 7月,公司又完成 C轮扩展融资,使整个 C轮融资总额增加到 4.39亿美元,估值超过 20亿美元。

新的投资方包括阿里巴巴、蓝色光标、未来资产等机构和公司。

这批投资人覆盖云计算、电商、广告、影视和游戏,基本对应了 PixVerse 正在拓展的企业场景。

与此同时,PixVerse 的产品目标也开始变化。

过去的 AI 视频生成,是用户输入一句话或者一张图片,等待模型生成一段固定视频。

2026 年 1月,PixVerse 发布实时世界模型 R1。

它生成的内容不是提前做好的固定片段,而是一段持续输出的画面。

用户在观看过程中发出新的指令,视频会根据指令继续变化。

例如,用户进入一个AI生成的场景,告诉角色向左走、打开一扇门或者与另一个角色对话,模型需要立即生成后续画面。

三个月后,PixVerse 又为 R1 增加了共享世界和个人化身,让多个用户可以同时进入同一个生成场景。

真的很难忍得住……

2026 年 7月,公司进一步发布 PixVerse Game Engine,希望把 R1用于互动游戏和实时直播:

创作者负责设定游戏规则、角色和大致结构,模型负责实时生成画面、动作和环境。

PixVerse 做对的,是把模型指标改成了"用户动作"

很多年前,可能都在雷军做小米社群之前,在那个满世界都在说人人都是产品经理的年代,“用户思维”、“用户体验”、“用户旅程”这样的词就已经被说成是“陈词滥调”了。

但到了 AI 时代,这种“老掉牙”的产品思维,依旧发挥着巨大作用。

很多 AI 视频公司习惯展示分辨率、视频长度、模型参数和排行榜成绩。

PixVerse 当然也在做这些事情,但它在消费产品上盯住了另外几个指标:

用户生成一次,能不能成功?用户需要等待多久?用户需不需要学习提示词?生成的结果,用户愿不愿意发出去?

这几个问题直接决定了普通人会不会使用。

PixVerse 没有要求所有用户先成为视频创作者。

模板负责降低第一次使用门槛,底层模型负责保证效果和成功率,TikTok 和 Instagram 负责传播,订阅和点数负责变现。

这套路径把一家需要大量算力的视频模型公司,变成了一款能够依靠用户作品持续获客的消费产品。

以上,祝你今天开心。

【声明】内容源于网络
0
0
Fun AI Everyday
每天分享一个好玩的AI应用
内容 74
粉丝 0
Fun AI Everyday 每天分享一个好玩的AI应用
总阅读1.1k
粉丝0
内容74