热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >HOMIE – 香港科技大学开源的数字人视频生成框架

HOMIE – 香港科技大学开源的数字人视频生成框架

来源:互联网 更新时间:2026-08-12 15:35

HOMIE是什么

HOMIE 是香港科技大学开源的一套数字人视频生成框架,底层采用 Wan2.1-T2V-14B 骨干网络,并整合了 Qwen3-VL 多模态大模型。它的关键价值在于,能把数字人、商品、Logo 和文字这四类核心要素放进同一套生成流程里统一处理,针对人-物交互、品牌贴牌、OCR 文字保真以及多视角一致性这四个行业里最棘手的问题,给出了更精确的解决方案。训练成本也相当克制,整个模型只需 5.5K 步、约 1 万 A100 小时;在效果上,OCR 准确率比当前最强的开源模型再提升 38.7%,推理方面则覆盖从 480P 单卡到 720P 多卡的部署方式,明显拉低了电商带货、虚拟主播等场景的视频制作门槛。

HOMIE – 香港科技大学开源的数字人视频生成框架

HOMIE的主要功能

  • 人-物交互视频个性化

    :支持多个人物与多种物体同时出现在同一视频中,保持每个主体的外观一致性,并实现自然、合理的交互动作(如手持、展示、传递商品等)。
  • Logo / 抽象概念精准贴附

    :用多模态大模型(MLLM)的语义推理能力,自动将品牌Logo等抽象概念贴附到语义最相关的物体上,无需在提示词中显式描述位置关系。
  • OCR 文字高保真生成

    :配合 OCR 参考图,确保产品包装、标签上的文字在生成视频中清晰可读、不模糊、不串字,解决 AI 视频生成中”文字糊成一团”的痛点。
  • 多视角一致性生成

    :给定同一物体的多视角参考图,当物体在视频中发生旋转或运动时,能保持一致的外观和细节,适用于手办、3D模型、玩偶等展示场景。

HOMIE的技术原理

  • 整体架构:

    阿里 Wan2.1-T2V-14B 的 DiT 为骨干,引入 Qwen3-VL-2B-Thinking 作为视觉理解模块,配合 UmT5 文本编码器和 VAE 视觉编码器,形成”文本+多模态语义+视觉”三路并行的生成架构。
  • MLLM 集成策略:

    在不破坏原有文生视频对齐关系、不产生昂贵重对齐成本的前提下,将多模态大模型的语义推理能力注入 DiT,使模型能自动理解参考图像之间的潜在关系。
  • 全局多模态自注意力引导(GMG):

    在 DiT 的自注意力层中,将 MLLM 提取的语义特征与 VAE 视觉 token 进行全局对齐,通过投影、池化和仿射变换,让生成过程中的每个视频 token 都能”看到”参考图的全局语义信息。
  • 模态-参考嵌入(MRE):

    为 MLLM 特征 token 和 VAE 视觉 token 分别赋予模态嵌入,为不同参考图像赋予独立参考嵌入,并将同一主体的多视角/OCR 参考图 token 关联起来,避免信息混淆。
  • 三阶段渐进训练:

    单主体 480P→ 多主体 480P→ 高清 720P,总计仅 5.5K 步完成训练,远低于同类方法的数万步。
HOMIE – 香港科技大学开源的数字人视频生成框架

微信关注回复“

开源

”,加入

AI开源项目交流群

如何使用HOMIE

  • 环境准备

    :从 GitHub 克隆 HOMIE 代码仓库到本地并完成环境依赖安装。
  • 权重下载

    :从 HuggingFace 下载官方发布的预训练权重到指定模型目录。
  • 素材准备

    :准备参考图像,包括人物照片、商品图、Logo 图或 OCR 文字图等多主体素材。
  • 提示词编写

    :编写文本提示词,准确描述目标视频中人物与物体之间的交互动作和场景。
  • 运行推理

    :运行推理脚本,HOMIE 会自动融合多模态参考信息并生成个性化视频。
  • 分辨率选择

    :单卡 GPU 可直接生成 832×480 分辨率视频,多卡 FSDP 可扩展至 720P 高清输出。

HOMIE的核心优势

  • 统一框架

    :一个框架同时处理人-物交互、Logo 贴牌、OCR 文字保真和多视角一致性四大任务,无需为不同场景切换不同模型。
  • 训练高效

    :仅需 5.5K 步 / 约 1 万 A100 小时即可完成训练,成本远低于同类方法通常所需的 3–4 万步。
  • MLLM 无损集成

    :在不牺牲文本编码器可控性、不产生昂贵重对齐成本的前提下,将多模态大模型的语义推理能力注入视频生成管线。
  • 质量领先

    :OCR 准确率相对提升 38.7%,多视角一致性提升 8.2%,40 人用户研究中 64.7% 将整体质量票选为第一。
  • 推理灵活

    :支持 480P 单卡到 720P 多卡推理,并可输出 1280×720 竖屏视频,直接适配直播带货与短视频制作。

HOMIE的项目地址

  • 项目官网

    :https://yiyangcai.github.io/homie-page.github.io
  • GitHub仓库

    :https://github.com/YIYANGCAI/HOMIE
  • HuggingFace模型库

    :https://huggingface.co/yychai/homie-r2v-wan2.1
  • arXiv技术论文

    :https://arxiv.org/pdf/2607.18217

HOMIE的同类竞品对比

对比维度HOMIESkyReels-V3
发布方香港科技大学昆仑万维
骨干网络Wan2.1-T2V-14B自研视频模型
MLLM 集成Qwen3-VL-2B,保留文本编码器无损注入集成 MLLM,但替换文本编码器
OCR 准确率0.452(开源最高)0.326
多视角一致性 (DINOrec)0.6850.654
主体一致性 (Face-Sim)0.7860.751
Logo 细节保真能忠实渲染 Logo 细节Logo 位置正确但细节易模糊
训练成本5.5K 步 / ~1 万 A100 小时未公开,推测远高于 HOMIE
开源协议Apache 2.0(可商用)开源可商用

HOMIE的应用场景

  • 电商直播带货

    :生成指定数字人手持指定商品做指定动作的带货视频,支持 1280×720 竖屏输出,直接适配短视频平台。
  • 品牌广告制作

    :自动将品牌 Logo 贴附到语义相关的产品上,无需在提示词中显式指定位置关系。
  • 虚拟主播 / 数字人

    :保持数字人身份一致的同时,与多种商品进行自然交互。
  • 产品多视角展示

    :给定手办、3D 模型或玩偶的多视角参考图,生成旋转展示视频,各角度外观保持一致。
  • 包装文字保真

    :配合 OCR 参考图,确保产品包装、标签上的文字在视频中清晰可读,适用于食品、化妆品、保健品等需要展示成分/说明的场景。

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc