今天分享的这家公司,我其实很早就分享过:国内宝藏 AI 公司|爱诗科技:AI 视频生成出海玩家
7月初,这家公司刚完成 3亿美元的 C轮融资,创下了亚洲 AI 视频生成单笔融资记录。
2023年初,王长虎准备创业。
一些投资人见到他的第一反应,不是讨论技术,也不是讨论市场,而是觉得他“不够年轻”。
当时,ChatGPT 刚刚出现,AI 创业最受关注的是大语言模型。
投资人普遍认为,大模型变化太快,35 岁以下的年轻创始人学得更快,也更了解第一批AI用户。
王长虎的履历正好相反,他在计算机视觉领域已经做了近20年。
从中国科学技术大学博士毕业后,王长虎在微软亚洲研究院工作了13年。
2017年,他加入字节跳动,组建 AI Lab 视觉技术团队,担任集团视觉技术负责人,参与了抖音和 TikTok 早期视觉技术体系的建设。
简单来说,他过去的工作,是让机器“看懂视频”。
一段视频里有什么人、人在做什么、镜头如何移动、用户为什么会停留、点赞或者划走,这些内容都需要被机器识别,才能用于推荐、搜索、审核和广告。
2021年,王长虎离开字节跳动,进入龙湖负责数字化和智能化转型。
两年后,他再次离职,创办爱诗科技。
另一位联合创始人谢旭璋,则走了一条完全不同的路线。
谢旭璋是 90后,毕业于北京大学光华管理学院,创业前在光源资本工作了6年,主要关注互联网、TMT 和 AI 项目。
生成式AI出现后,他开始频繁参加线下黑客松,尝试 AI 图片和视频产品,随后与王长虎组成创业团队。
一个长期研究如何让机器理解视频,一个长期研究公司、资本和商业机会。
但两个人有一个共同点:此前都没有完整操盘过一款面向普通用户的消费产品。
但是三年后,他们做出的 PixVerse 爱诗科技已经拥有超过 1.5 亿注册用户、1500 万月活跃用户,覆盖 177 个以上国家和地区。
2026 年 7 月,PixVerse 宣布完成C轮扩展融资,使整个 C 轮的融资总额达到4.39亿美元,估值超过20亿美元。
所有人都在做大语言模型,他们选择了视频
爱诗科技成立于 2023年 4月。
公司刚成立时,并没有立刻确定要做视频生成。
当时市场上最热的是ChatGPT,创业者集中在聊天机器人、办公工具和大语言模型。
直到 2023年 6月,核心团队基本到位,王长虎决定把资源全部投入视频生成。
原因并不复杂,大语言模型已经聚集了大量公司,AI 绘画也有 Midjourney 和Stable Diffusion。
但视频生成难度更大,需要同时处理人物、物体、动作、镜头、光线和前后画面的一致性,真正投入这一方向的团队反而不多。
这与王长虎过去的经历又高度匹配。
仅仅四个月后,2023 年 10月,爱诗科技完成第一代视频生成模型。
2024 年1月,海外产品PixVerse 正式上线。
最初的 PixVerse 已经可以让用户输入一句话或者上传一张图片,生成一段短视频。
上线 88 天,用户累计生成了 1000万条视频。
但这个阶段的 PixVerse,仍然是一款典型的 AI 生成工具。
用户需要写提示词,等待模型生成,然后在几次结果里挑出一个勉强可用的版本。
这对专业创作者可以接受,对普通人却太麻烦。
普通用户不会为了生成一条几秒钟的视频,反复修改提示词、等待几分钟,再连续尝试五六次。
PixVerse 后来真正跑出来,靠的不是继续给用户增加参数,而是把这些参数全部藏了起来。
不用再写提示词,而是直接上传一张照片
现在打开 PixVerse,普通用户最容易理解的功能不是“文生视频”,而是各种视频模板。
用户上传一张自己、朋友或者宠物的照片,再选择一个模板,就可以让照片里的人变成美人鱼、超级英雄、玩具手办,或者让宠物跳舞、做动作。
整个过程不需要写提示词,也不需要理解模型。
它和短视频软件里的传统特效看起来相似,但生产方式不同。
传统特效通常需要设计师和工程师针对一个效果单独制作。换一个动作、人物或者场景,往往需要重新调整。
PixVerse 的模板建立在视频生成模型上。
模型需要先理解照片中的主体,再重新生成一段完整的动作和变化过程。
例如,一个人“变成超级英雄”,并不只是在脸上覆盖一层贴纸,模型还要生成服装变化、身体动作、环境反应和镜头效果。
同一套生成能力可以被封装成不同模板,也可以适应不同人物、动物和图片。
对普通用户来说,PixVerse 把一个开放式创作问题,变成了一道选择题:
上传照片、挑一个效果、等待几秒,然后把结果分享到 TikTok、Instagram 或者其他社交平台。
这个产品改动看起来不复杂,但它改变了 PixVerse 的用户群。
过去,AI 视频工具服务的是愿意研究提示词和参数的创作者。
模板出现后,任何有一张照片的人都可以使用。
第一次大规模破圈,靠的是“毒液变身”
2024 年 10月,PixVerse 发布 V3模型。
此前,AI 视频生成很像“抽卡”。同一个提示词生成五次,可能只有一次能用。
人物的脸会变,手脚会错位,动作做到一半突然消失,背景里的物体也会莫名变化。
PixVerse V3 首先解决的是生成成功率。
按照王长虎的说法,在特定模板场景中,V3 把过去很低的成功率提升到了接近100%。
用户上传一张照片,选择模板,大部分情况下都能得到一个完整结果。
PixVerse 随后上线了“毒液变身”等模板。
用户上传照片后,照片中的人物会逐渐被黑色物质覆盖,最后完成类似超级英雄的变身。
这类视频开始在 TikTok、Instagram 等平台传播,全网累计播放量超过 10亿次。
仅这个阶段的变身特效,就为 PixVerse 带来了约 1000万名新增用户。
2024 年 12月,PixVerse 又发布 V3.5,把视频生成时间从分钟级压缩到10秒以内,随后推出移动端 App。
生成成功率解决“能不能用”,生成速度解决“愿不愿意等”,模板则解决“普通人知不知道该做什么”。
这三个条件同时满足后,PixVerse 才从一个模型演示工具变成了一款消费产品。
字节的经验,迁移过来的不是数据,而是“怎么看视频”
要分享 PixVerse,就必须聊聊一个特别容易被忽略的能力:数据标注。
联合创始人谢旭璋认为,视频数据本身并不稀缺,网上到处都是视频。
难的是,如何准确描述一段视频里发生了什么。
这里的能力迁移,并不是把抖音或 TikTok 的数据带到新公司,而是把一套理解视频的方法带了出来。
推荐系统要把正确的视频推给用户,首先需要“看”懂视频。
它不能只知道“画面里有一只猫”,还需要进一步理解:
猫是在奔跑还是睡觉,镜头是静止还是移动,情绪是搞笑还是紧张,动作在哪一秒开始,用户最可能在哪一个位置失去兴趣。
视频生成模型同样需要这种理解能力。
如果训练数据只告诉模型“这是一段超级英雄视频”,模型很难学会人物如何转身、衣服如何变化、镜头如何推进,以及前后动作如何连起来。
标签越准确,模型越容易理解“变化发生的过程”。
王长虎在字节跳动参与建设的视觉理解技术,原本服务于抖音、TikTok的内容识别和推荐。
到了 PixVerse,这套能力被用于整理和理解训练视频。
这也是 PixVerse 与单纯采购开源模型、再套一层产品界面的 AI 视频工具之间的区别。
开源模型更新一次,后者的产品能力就可能被重新洗牌。
PixVerse 同时控制底层模型和上层产品,用户在产品里的生成、重试、下载和分享行为,又能持续告诉团队哪些效果更受欢迎、哪些动作容易失败。
模型决定产品能做到什么,产品则告诉模型下一步应该改什么。
不过,数据标注并不是 PixVerse 唯一的技术答案。
王长虎也多次强调,视频生成速度和质量来自模型架构、算法、工程优化和产品反馈的共同作用。
如果把它简单归结为“字节有很多视频经验”,就低估了视频模型训练的复杂程度。
从 1200万到 1.5亿用户,用了不到两年
PixVerse 的用户增长,可以分成几个阶段。
2024 年 1月,PixVerse 海外版上线,88 天生成 1000万条视频。
到 2024年 12月,PixVerse 注册用户超过 1200万,月活跃用户接近 600万。
2025 年 3月,注册用户超过 4000万,月活跃用户达到 1500万。
2025 年 5月,用户规模超过 6000万。
V4.5上线后,一款“咧嘴笑”模板把 PixVerse 推到美国 iOS 应用下载榜第四。
2025 年 8月,用户规模突破 1亿,产品推出 13 种语言,覆盖 175 个以上国家和地区。用户累计生成超过 8亿条视频。
2026 年 7月,注册用户达到 1.5亿,月活跃用户超过 1500万。
如果你看完这篇文章,打开 PixVerse 的网站,你会看到满屏的模板库,相信你也很难忍得住不用这些模版做一张自己/宠物/动漫角色的图片或视频。

不到一年做到 4000万美元年化收入
PixVerse 早期先积累用户,到 2024年 11月才正式开始商业化。
它的个人用户主要通过订阅和点数付费。不同模型、分辨率、视频长度和是否生成音频,会消耗不同数量的点数。
2025 年 10月,爱诗科技披露,PixVerse 与国内版 “拍我AI” 的年度经常性收入已经超过 4000万美元。
从 2024年 11月开始收费,到 2025年 10月,PixVerse 的收入增长超过 10倍。
公司当时表示,订阅收入已经可以覆盖绝大部分成本,现金流接近转正。
个人订阅之外,PixVerse 还在发展第二种收入:把视频模型卖给企业和开发者。
目前,PixVerse 把模型分成三条产品线:
V 系列面向普通用户和 API 调用,主要负责文生视频、图生视频、音画同步和常见创作功能。
C 系列面向影视和商业制作,强调镜头控制、角色表现、多镜头内容和更专业的制作流程。
R 系列面向游戏、互动娱乐和“世界模型”,重点不再是生成一条固定视频,而是让画面根据用户操作持续变化。
PixVerse 目前图生视频 API 的公开价格约为每分钟 4.8 美元。
领投它的阿里巴巴自然也已经与PixVerse达成合作,将其视频生成能力部署到相关业务中。
融到 4.39亿美元后,PixVerse 开始把目标移到游戏
PixVerse 最近一轮融资的投资人名单很有意思。
2025 年 9月,公司完成 6000万美元 B轮融资,由阿里巴巴领投。一个月后,又完成 1亿元人民币 B+轮融资。
2026 年 3月,PixVerse 完成约 3亿美元 C轮融资,由鼎晖投资领投,中国儒意、三七互娱等产业投资方参与。
2026 年 7月,公司又完成 C轮扩展融资,使整个 C轮融资总额增加到 4.39亿美元,估值超过 20亿美元。
新的投资方包括阿里巴巴、蓝色光标、未来资产等机构和公司。
这批投资人覆盖云计算、电商、广告、影视和游戏,基本对应了 PixVerse 正在拓展的企业场景。
与此同时,PixVerse 的产品目标也开始变化。
过去的 AI 视频生成,是用户输入一句话或者一张图片,等待模型生成一段固定视频。
2026 年 1月,PixVerse 发布实时世界模型 R1。
它生成的内容不是提前做好的固定片段,而是一段持续输出的画面。
用户在观看过程中发出新的指令,视频会根据指令继续变化。
例如,用户进入一个AI生成的场景,告诉角色向左走、打开一扇门或者与另一个角色对话,模型需要立即生成后续画面。
三个月后,PixVerse 又为 R1 增加了共享世界和个人化身,让多个用户可以同时进入同一个生成场景。
真的很难忍得住……
2026 年 7月,公司进一步发布 PixVerse Game Engine,希望把 R1用于互动游戏和实时直播:
创作者负责设定游戏规则、角色和大致结构,模型负责实时生成画面、动作和环境。
PixVerse 做对的,是把模型指标改成了"用户动作"
很多年前,可能都在雷军做小米社群之前,在那个满世界都在说人人都是产品经理的年代,“用户思维”、“用户体验”、“用户旅程”这样的词就已经被说成是“陈词滥调”了。
但到了 AI 时代,这种“老掉牙”的产品思维,依旧发挥着巨大作用。
很多 AI 视频公司习惯展示分辨率、视频长度、模型参数和排行榜成绩。
PixVerse 当然也在做这些事情,但它在消费产品上盯住了另外几个指标:
用户生成一次,能不能成功?用户需要等待多久?用户需不需要学习提示词?生成的结果,用户愿不愿意发出去?
这几个问题直接决定了普通人会不会使用。
PixVerse 没有要求所有用户先成为视频创作者。
模板负责降低第一次使用门槛,底层模型负责保证效果和成功率,TikTok 和 Instagram 负责传播,订阅和点数负责变现。
这套路径把一家需要大量算力的视频模型公司,变成了一款能够依靠用户作品持续获客的消费产品。
以上,祝你今天开心。

