数字人带货视频制作成本从万元级降至几行命令,港科大HOMIE框架开源,统一解决人-物交互、Logo贴牌、OCR文字与多视角一致性四大难题。
你是否遇到过这样的场景:用AI生成带货视频,产品上的文字糊成一团、品牌Logo飘忽不定、多个人物和商品同时出现时“串脸”翻车?
这些问题在学术界被称为HOCVP(Human-object Centric Video Personalization,人-物中心的视频个性化)——它是当前AIGC视频领域公认的硬骨头,比普通文生视频高出一个段位,因为模型不仅要“会画”,还要“会认”和“会绑”。
2026年7月21日,香港科技大学推出HOMIE框架,这是一个统一处理“人+物+Logo+文字”四要素的视频生成框架,基于阿里通义万相Wan2.1-T2V-14B骨干网络,引入多模态大模型Qwen3-VL-2B-Thinking作为“视觉大脑”。
在200条自构HOCVP评估集上,HOMIE刷新了开源模型成绩单:OCR准确率达0.452,比开源最强SkyReels-V3(0.326)相对提升38.7%;多视角合成DINOrec达0.685,比Phantom高8.2%;40人用户研究中,64.7%的评分人将“整体质量”票投给HOMIE第一。
项目采用 Apache2.0 协议可商用,完整释放论文、GitHub 推理代码与 HuggingFace 权重,支持 480P 单卡、720P 多卡推理,适配电商带货、IP 动画、虚拟主播等大量落地场景。
相关链接
-
论文:https://arxiv.org/abs/2607.18217 -
主页:https://yiyangcai.github.io/homie-page.github.io -
代码:https://github.com/YIYANGCAI/HOMIE -
权重:https://huggingface.co/yychai/homie-r2v-wan2.1
HOMIE是什么?
HOMIE的全称是“Human-object Centric Video Personalization via Multimodal Intelligent Enhancement”——用多模态智能增强做的人-物视频个性化。它的核心不是做一个更大的视频模型,而是把多模态大模型(MLLM)的“眼睛”和“大脑”塞进Wan2.1的DiT流水线,让“数字人+商品+Logo”在短短5.5K步训练后就能实现精准交互。
论文指出,现有方法面临两个关键瓶颈:
-
跨主体(inter-subject)层面:多数方法难以在保持主体高保真度的同时,精准刻画人与各类物体(尤其是Logo这类抽象概念)之间的交互模式。 -
主体内部(intra-subject)层面:虽然OCR图、多视角输入等内部参考能增强主体保真度,但现有方法缺乏理解这些潜在对应关系的机制。
HOMIE的核心贡献在于:用一个统一框架同时解决跨主体和主体内部两类输入场景。
如何做到的?
HOMIE的技术创新主要体现在三个方面:
-
更优的MLLM集成策略:相比以往方法,HOMIE提出了一种更好的多模态大模型集成方式——在不牺牲文本编码器可控性、不产生昂贵重对齐成本的前提下,提取参考图之间的语义关系知识。
-
全局多模态自注意力引导:HOMIE在自注意力机制中引入全局多模态引导,将MLLM提取的语义特征与VAE视觉token更好地对齐。简单说,就是让模型“看懂”参考图里的内容后,再决定怎么画到视频里。
-
模态-参考嵌入:团队提出模态-参考嵌入(modality-reference embedding) 技术,用来区分MLLM特征token和VAE视觉token,并将主体内部的参考图像token关联起来。这让模型能清晰分辨“这是参考图里的信息”和“这是要生成的画面”。
训练配置方面:
-
训练数据:基于OpenS2V-5M + PhantomData + 自构2万段HOC片段,共100K多主体样本,筛选出40K 720P高清子集。 -
训练流程:三阶段渐进——单主体(3000步480P)→ 多主体(2000步480P)→ 高清(500步720P)。 -
训练成本:仅需5.5K步 / 1万A100小时,远低于同类方法的3.5万步、4万步。 -
推理:单卡可跑832×480 / 97帧 / 24fps,8卡FSDP可做720P。
实验
HOMIE 与既有 SOTA 方法在受试者层面的定性对比,涵盖了更多受试者及抽象内容的个性化生成。与受试者及交互相关的提示词已特别标出。
HOMIE 与既有 SOTA 方法在受试者内部的定性比较。文中展示了两个具有代表性的受试者内部示例(包含 OCR 图像和多视角参考图),并高亮标出了与受试者及交互相关的提示词(prompts)。
结论
HOMIE的开源意味着数字人带货视频的制作门槛从“需要专业团队+设备”降到了“几行命令就能跑”。对于内容创作者、电商运营、广告从业者来说,这是一个实实在在的生产力工具。
当然,HOMIE目前主要解决的是主体一致性和精准控制问题。如果你需要的是天马行空的创意视频,文生视频模型可能更合适;但如果你需要的是“指定的人拿着指定的产品做指定动作”——这正是HOMIE的战场。
感谢你看到这里,添加小助手 AIGC_Tech 加入官方 AIGC读者交流群,下方扫码加入 AIGC Studio 星球,获取前沿AI应用、AIGC实践教程、大厂面试经验、AI学习路线以及IT类入门到精通学习资料等,欢迎一起交流学习💗~

