VOID 解释:Netflix 视频对象和交互删除以实现隐私、匿名化和背景删除 |背景模糊
How VOID uses VLM reasoning, CogVideoX-5B, and SAM 2 for physics-aware video object removal; benchmark context; demo video; and how BgRemover (BGB) already covers production removal while we integrat…

当编辑谈论“从剪辑中删除某些内容”时,他们通常指的是修复:隐藏对象并填充合理的像素。 VOID(视频对象和交互删除)——来自 Netflix 附属研究人员和合作者——将其扩展到仅靠像素还不够的情况:如果删除的对象推动、阻挡或偏转其他东西,则整个时间线可能需要更改(项目站点)。
PH1
对于 BGBlur 润色采访、产品镜头或社交剪辑的读者来说,VOID 很好地概述了学术视频 ML 的发展方向:反事实视频 尊重简单的物理,而不仅仅是纹理。
演示:我们附加到本文的 VOID 风格剪辑
下面的 MP4 是您提供的 GitHub 用户附件,在本网站上以 PH0 形式提供,因此播放保持可靠(签名的 GitHub URL 过期)。与交互感知移除相比,这是对无污点运动的良好健全性检查。
VOID 的工作原理(高级)
根据 VOID 网站和论文 (arXiv:2604.02296):
- 用户选择突出显示要删除的对象。
- **视觉语言模型(VLM)**估计哪些其他区域受到“因果性”影响(应该掉落、弹跳或改变路线的物体)。
- 该指导针对 视频扩散 主干进行编码,描述为在整个堆栈中使用 CogVideoX-5B 和 SAM 2。 4.如果第一次合成变形对象,可选的细化过程会使用流扭曲噪声——作者将这种失败模式与较小的视频扩散模型联系起来。
训练依赖于合成/运动丰富的配对数据(包括 Kubric 和 HUMOTO,如其页面上所总结的),因此网络会看到“删除对象 A”真正意味着“改变整个交互”的示例。
Runway、ProPainter 和评估质量
VOID 在视频对象去除方面处于领先地位;在他们的材料上,您将看到比较,其中包括来自文献中的 Runway 级和 ProPainter 相关参考文献。将它们用作论文级指导:它们反映了特定的数据集和指标,而不是每个现实世界的摘要。
在不同的工具中,创作者仍然判断相同的事情:时间一致性、缺乏拖尾以及背景运动是否看起来是有意的。
BGB (BgRemover) 集成以及已经起作用的内容
BgRemover.video 的 BgRemover (BGB) 已经提供了一种干净的、伪像感知的视频对象和背景去除团队今天发布的——基线 VOID 建立在更困难的物理情况之上。
我们的路线图:将 VOID 视为交互感知屏蔽和训练信号的蓝图,一旦它们足够强大以适应生产 SLA,我们就可以将其合并到 BGB 中。 BGBlur 始终专注于电影背景模糊和隐私风格效果,而 BGB 仍然是删除的家 - 因此通过您已使用的同一产品系列进行集成工作渠道。
常见问题解答
###“互动删除”是什么意思?
删除一个对象并更新其他对象在物理耦合到该对象时的移动方式——根据 void-model.github.io 上 VOID 的框架。
VOID 可以作为消费者应用程序使用吗?
今天的公共制品是研究级的;像 BgRemover 这样的生产工具现在继续提供实用的删除路径。
官方的说明在哪里?
参考文献
- Saman Motamed、William Harvey、Benjamin Klein、Luc Van Gool、Zhuoning Yuan、Ta-Ying Cheng,VOID:视频对象和交互删除,2026。https://arxiv.org/abs/2604.02296