火山引擎推出AI MediaKit理解式视频编辑引擎,以自研ReFM残差流匹配技术实现字幕擦除从像素级抹除到语义理解式编辑的升级,支持复杂花字、动态水印精准擦除,同时保留招牌、包装等真实场景文字。

真实视频中的文字远比想象中复杂:人物姓名可能竖排在角色身侧,章节标题可能带有书法笔触、描边、阴影和动态特效,账号水印可能半透明地浮在复杂背景上;与此同时,招牌、海报、产品包装、衣服印字、现场大屏又属于画面原始信息,不能被误删。这让字幕擦除从“找到文字并抹掉”变成两道更难的题:哪些文字是后期叠加应该擦掉,哪些属于真实场景必须留下,以及擦除之后背景如何保持真实、稳定、不闪烁。

新版字幕擦除引擎引入多模态理解能力,先判断文字在画面中的角色,再决定是否擦除。系统不会孤立判断每一帧,而是根据空间重叠关系和时间连续性,将检测结果组织成稳定的文字轨迹,并选取多个代表帧联合分析,既能借助前后文判断文字属性,也能补齐短时漏检,减少“前一帧擦掉、后一帧又出现”的闪烁问题。对白字幕、人物姓名与身份介绍、章节标题、提示花字、推广水印应当擦除;招牌、海报、书本、服装印字、产品包装、现场屏幕、品牌卡与固定Logo应当保留。对于语义不明确的区域,系统采用保守策略,优先保留原始画面。

在修复环节,AI MediaKit将视频生成大模型改造为面向擦除任务的残差编辑模型ReFM,不再从高斯噪声开始生成,而是从带字幕的原视频潜变量出发,学习它与无字画面之间真正需要改变的残差,模型目标从“重新画一遍视频”变成“只完成必要的那次修改”。这条更短、更确定的编辑路径能更充分地继承原视频中的人物、光照、纹理和运动信息,并在4步采样下完成高质量修复。模型还加入遮挡区域跨帧上下文聚合与全局视频表征引导两类互补引导,局部信息负责补对细节,全局信息负责让整段视频保持统一风格。