6 月 22 日,阿里发布视频生成模型 HappyHorse 1.1。
如果只看发布稿,它当然又是一次"五大维度升级":动态表现力、主体一致性、指令遵循、视觉质感、音频能力。但放到 2026 年的 AI 视频赛道里看,HappyHorse 1.1 更值得关注的不是"又一个模型变强了",而是它正在把 AI 视频从 Demo 展示,推向更接近商业生产的状态。
以前大家比的是"谁的样片更炸";现在真正有价值的问题变成了——谁能稳定生成,谁能控制角色,谁能支持多语言,谁能让创作者和企业日常用得起。
HappyHorse 1.1 这次升级,正是朝这个方向走。
五大升级里,最值得看的不是画质,而是"可控性"
首先是动态表现力。
视频为AI生成,动态测试:红裙旋转场景,观察肢体、裙摆和镜头运动是否连贯。
HappyHorse 1.0 曾被吐槽过动作节奏偏慢、运动不够有力量感。1.1 针对运动建模和时序一致性做了优化,舞蹈、打斗、布料、人物移动这些高动态场景,比上一代更流畅。
但这里不能神化。复杂物理场景,比如失重、流体、多主体碰撞,仍然是 AI 视频模型的难点。HappyHorse 1.1 在边缘场景、多参考主体任务中,真实感和物理规律遵循仍有优化空间。
真正重磅的是主体一致性。
HappyHorse 1.1 新增/强化了参考生视频能力,最多支持 9 张参考图。对短剧、电商广告、品牌内容来说,这比单纯"画面更漂亮"更重要。
因为实际生产里,最怕的不是画面不够惊艳,而是:
9 张参考图的价值,就是尽量把角色、商品、品牌元素和场景风格"钉住"。它不能保证 100% 不漂移,但能明显降低抽卡和重生成成本。
它更像是给短剧、电商、广告准备的模型
HappyHorse 1.1 的产品方向很清楚:它不是只为炫技样片服务,而是瞄准内容生产。
阿里云百炼官方文档显示,HappyHorse 1.1 已提供三类模型:
单次可生成 3–15 秒视频,支持 720P 和 1080P,参考生视频支持 1–9 张参考图输入。
这几个规格放在一起看,它的适用场景就很明确了:
它不是一次性生成完整长片的工具,更像是一个"高质量视频片段生成器"。用得好的方式不是指望它一口气做完一部片,而是把它放进现有工作流:出分镜、做素材、补镜头、测试广告创意。
视觉质感变好了,但 AI 味还没有彻底消失
HappyHorse 1.1 这次对视觉质感的优化,重点不是单纯提高分辨率,而是减少过去 AI 视频里常见的“假”和“腻”。
很多早期 AI 视频都有一种典型的塑料感:皮肤过度光滑,人物脸部像被强行磨皮;画面锐化过度,边缘细节不自然;光影虽然漂亮,但整体更像美颜滤镜开满,而不是真实镜头。
1.1 的改进方向,是尽量保留更真实的人物细节。比如毛孔、法令纹、痘印、皮肤纹理这些过去容易被模型抹掉的细节,现在会被保留下来一些。人物特写不再一味追求“完美”,而是更接近真实拍摄里的质感。
这对短剧和广告尤其重要。
因为商业内容不只是要“好看”,还要“可信”。如果观众一眼看出画面是 AI 生成,人物再精致,也会削弱代入感。尤其在人像口播、剧情短片、产品广告里,真实感本身就是转化的一部分。
当然,HappyHorse 1.1 还没有彻底摆脱 AI 视频的共性问题。比如画面中的文字仍可能出现乱码;复杂物理场景下,液体、重力、碰撞关系不一定稳定;多人物交互时,手部、眼神和身体关系也可能出现穿帮。
所以它更适合用来生成短剧分镜、广告片段、产品展示和口播素材,而不是直接替代完整的专业视频后期流程。
音频能力,是 HappyHorse 的差异化卖点
HappyHorse 从 1.0 起就强调音视频联合生成,而不是简单“先生成画面,再后期配音”。
到 1.1,音频部分继续增强:台词语速、停顿、语气可以根据场景情绪变化调整,也支持在提示词里描述背景音、环境音效。
视频为AI生成,音频测试:观察中文台词、口型、语气停顿和环境音是否自然匹配
这件事对短剧、口播、电商、出海广告都很重要。
传统流程里,多语言视频往往要经历:
生成画面 → 配音 → 对口型 → 调字幕 → 再校对。
如果模型能直接生成带声音、带口型同步的视频,哪怕还不是完美,也会大幅降低试错成本。
HappyHorse 1.1 已经让 AI 视频从“无声素材生成”更接近“可用片段生成”。
价格:不是最低,但开始接近"可跑量"
HappyHorse 1.1 的价格也有明显调整。
以文生视频为例:
1080P 价格相比 1.0 下调了 25%。
这意味着,一条 10 秒 1080P 视频,优惠期大约 7.2 元。它未必是全市场最低价,但已经进入了很多创作者和中小团队可以日常测试的区间。
所以 HappyHorse 1.1 的价格逻辑不是"极致便宜",而是"在较强画质、角色一致性和音频能力之间,给出一个可规模化尝试的成本"。
这才是它真正接近商业落地的地方。
别急着给它排第一,但可以说它站稳了国产第一梯队
HappyHorse 1.0 曾在 Artificial Analysis 视频生成榜单中取得很高位置,尤其在无音频文生视频榜单中表现突出。1.1 则是在此基础上,继续补齐商业生产里最关键的几块短板:动态、角色一致性、提示词理解、视觉质感和音频表达。
也就是说,HappyHorse 1.1 的意义不只是"榜单成绩",而是它开始回答一个更现实的问题:
AI 视频模型能不能进入项目,而不是只停留在朋友圈演示?
从这点看,它已经是国产 AI 视频模型里非常值得关注的一支。
不同创作者怎么选
最现实的策略不是迷信某一个模型,而是组合使用:
HappyHorse 做核心角色和有声片段,更便宜的模型做批量素材,专业工具做后期精修。
总结
HappyHorse 1.1 不是完美的视频生成模型。
它还有 15 秒时长限制,文字渲染还不稳,复杂物理模拟仍会穿帮,长视频叙事也需要工作流配合。
视频为AI生成:为了测试边界,特意试了一个更容易翻车的 Prompt:让画面里出现让咖啡、桌椅、人物在失重环境中漂浮。结果也符合预期:HappyHorse 1.1 在人物和商品生成上更稳定,但遇到复极端物理场景时,仍然会出现物体关系不自然、动作逻辑跳变等问题。
但它值得关注的地方在于:它没有只追求"惊艳一秒",而是在解决 AI 视频真正进入生产线前必须面对的问题——角色能不能稳定、商品能不能不变形、音画能不能同步、成本能不能跑量。
AI 视频的竞争,已经从"能不能生成"进入"能不能交付"。HappyHorse 1.1 的位置,也正在这里。

