热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >JoyAI-Video-Edit – 京东开源的实时流式视频编辑模型

JoyAI-Video-Edit – 京东开源的实时流式视频编辑模型

来源:互联网 更新时间:2026-08-06 14:47

JoyAI-Video-Edit是什么

先说说京东开源的这个新家伙——JoyAI-Video-Edit。它不是又一个传统的视频编辑工具,而是一个实时流式视频编辑模型。基于16B参数的自回归扩散架构,在720P分辨率下能跑到30FPS的推理速度,关键是支持任意时长的稳定流式编辑。操作方式很简单:用户通过自然语言指令,在视频播放过程中就能实时修改人物、场景、风格甚至物体,完全不用等整个视频生成完。在OpenVE-Bench评测中,它超越了所有流式编辑方法,各项指标全面领先。更别说,它还能为具身智能提供大规模数据合成路径,这背后的潜力值得深挖。

JoyAI-Video-Edit – 京东开源的实时流式视频编辑模型

JoyAI-Video-Edit的主要功能

  • 实时流式编辑

    :视频帧一到就处理,不需要预先知道整个序列长什么样。
  • 开放式指令控制

    :全局风格迁移、局部对象增删改、背景替换、动作调整,甚至参考图引导编辑,全都支持。
  • 任意时长处理

    :不再局限于秒级或分钟级,可以持续随视频播放进行稳定编辑。
  • 720P高吞吐部署

    :端到端pipeline在720×1280分辨率下达到了30.19 FPS,这个吞吐量相当可观。
  • 多维度编辑能力

    :人物换装、场景变换、风格转换、物体替换以及字幕编辑,几乎覆盖了常见的编辑需求。

JoyAI-Video-Edit的技术原理

拆开来看,背后的技术架构其实挺清晰的。首先是

MLLM条件编码器

,用多模态大语言模型把自然语言指令编码成编辑条件,从而实现开放式语义控制。然后是

因果视频VAE

,采用因果时序结构的变分自编码器对视频帧进行压缩与重建,确保流式场景下的时序一致性。核心引擎是

16B参数MMDiT骨干

,一个16B参数的多模态扩散Transformer,负责融合文本与视觉特征进行自回归扩散生成。为了让推理更快,引入了

自回归分布匹配蒸馏

,通过对齐自回归分布的蒸馏策略,显著降低训练与推理的分布差异。最后是

长时域优化与有界KV推理

,通过长时域稳定性优化和有界KV缓存机制,抑制累积时序漂移,同时维持高吞吐量。

JoyAI-Video-Edit – 京东开源的实时流式视频编辑模型

如何使用JoyAI-Video-Edit

  • 环境准备

    :创建Conda环境,Python版本3.10,然后安装requirements.txt里的依赖。
  • 下载权重

    :从Hugging Face拉取模型文件,按指定目录结构放好检查点。
  • 启动服务

    :进入deploy目录,执行bash run_server.sh启动本地服务器。
  • 访问界面

    :浏览器打开http://localhost:8080,就能看到交互式编辑界面。
  • 实时编辑

    :上传视频或接入摄像头流,输入自然语言指令,边播边改,效果立竿见影。

JoyAI-Video-Edit的核心优势

  • 实时流式编辑

    :视频帧到达即处理,不需要等待完整序列,真正实现了“边播边改”的交互体验。
  • 速度与质量双优

    :720P分辨率下端到端推理达30.19 FPS,在OpenVE-Bench评测中超越了所有流式与离线编辑方法。
  • 任意时长稳定输出

    :突破了传统模型仅支持秒级或分钟级片段的限制,可持续随视频播放进行无漂移稳定编辑。
  • 开放式语义控制

    :基于MLLM条件编码器,支持自然语言指令驱动的全局风格、局部对象、背景替换及参考图引导等多维度编辑。
  • 高效推理架构

    :16B参数自回归扩散Transformer配合分布匹配蒸馏与有界KV缓存,显著降低了训练推理差异,并抑制了时序累积误差。

JoyAI-Video-Edit的项目地址

  • GitHub仓库

    :https://github.com/jd-opensource/JoyAI-Video-Edit
  • HuggingFace模型库

    :https://huggingface.co/jdopensource/JoyAI-Video-Edit
  • arXiv技术论文

    :https://arxiv.org/pdf/2608.03974

JoyAI-Video-Edit的同类竞品对比

维度JoyAI-Video-EditSANA-Streaming
模型规模16B参数2B参数
推理速度37.21 FPS (DiT)约54 FPS (DiT)
编辑质量3.60 (OpenVE-Bench)约2.6
编辑类型开放式多维度编辑流式编辑
分辨率支持720P稳定输出较低分辨率为主
时序稳定性任意时长,有界KV优化短片段为主

JoyAI-Video-Edit的应用场景

  • 短视频创作

    :创作者可以在视频播放过程中实时替换人物服装、调整场景风格,内容生产效率大幅提升。
  • 直播实时特效

    :主播边播边改背景或添加虚拟元素,实现互动式直播视觉增强。
  • 家装与室内设计

    :用户在浏览房间视频时实时更换家具、墙面材质与灯光效果,辅助装修决策。
  • 影视后期预演

    :导演在剪辑阶段快速尝试不同视觉风格与场景替换,降低试错成本。
  • 具身智能数据合成

    :将人手操作视频转化为机械臂操作素材,低成本扩展机器人训练数据规模。

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc