【#实测京东实时流式视频编辑模型#,AI终于可以边播边改视频了吗?】
对于视频生成用户来说,“抽卡”是一个很考验成本和耐心的过程,用户输入指令,模型生成结果,查看效果后再决定是否调整。一段视频往往需要经过多轮生成,创作过程被拆成了多个等待环节。
最近,京东开源自研的实时流式视频编辑模型JoyAI-Video-Edit,尝试改变这一创作流程。
在测试中,我们让模型直接处理正在播放的视频:直播画面中的商品可以被替换,室内空间可以实时调整,户外场景也可以根据指令改变,整个过程不需要等待完整视频生成完成,模型会随着视频输入持续完成编辑。
与传统视频生成模型不同,JoyAI-Video-Edit处理的不是一段已经结束的视频文件,而是一条持续输入的视频流。
根据官方公布的技术报告,JoyAI-Video-Edit采用基于自回归扩散的视频编辑架构,由多模态语言模型编码器、因果视频VAE以及多模态扩散Transformer组成。在单张NVIDIA B200 GPU环境下,完整流水线吞吐约30 FPS,请求到响应周期约266毫秒。
不过,实时速度只是这类模型需要解决的问题之一。
视频编辑相比单张图片处理更复杂,模型既要理解用户希望修改什么,也要保持人物身份、动作轨迹和未修改区域稳定。如果视频持续播放,前面生成的结果还会成为后续处理的参考,一旦误差积累,就可能出现画面漂移。
为了验证JoyAI-Video-Edit的实际表现,我们选择了几个更接近真实使用的场景进行测试,包括直播商品替换、家装效果调整、户外环境变化,以及具身智能相关的人手替换机械手。
阅读全文👉http://t.cn/AXNTuqEP
