基于扩散的视频重照明技术能够从单段输入视频实现可控重照明,但现代视频扩散骨干模型是在短视频片段上训练的,当通过分块滑动窗口推理应用于长时程视频时,往往会在分块边界产生时间不连续性。我们通过将长时程重照明视为时间条件下的潜域翻译问题来应对这一挑战。我们的框架通过在边界处传播目标域潜变量来强制实现跨块连续性。目标域中的掩码自条件机制使模型能够从经过时间掩码的传播上下文继续生成。我们还引入了热启动提示(warm-start prompting),利用可控生成模型产生的重照明提示锚点来建立初始目标域状态,并为基于提示的重照明提供通用接口。在真实世界长时程视频上的实验表明,该方法显著提升了时间一致性,大幅减少了分块边界伪影,并抑制了分块之间非预期的外观变化。
HorizonRelight:通过扩散变换器实现长时程视频的一致重照明
NVIDIA研究团队提出HorizonRelight,一种基于扩散Transformer的长时程视频重照明方法。该方法将重照明视为时间条件下的潜域翻译问题,通过跨块传播目标域潜变量和掩码自条件来保证块间一致性,并利用热启动提示建立初始状态。实验显示,该方法能显著减少分块边界伪影,提升长视频的时间一致性。
对FDE而言,该研究展示了扩散Transformer在长视频任务中的最新进展。FDE在客户交付中可关注此类生成模型的能力边界,特别是分块推理带来的时间一致性问题,以便在涉及视频重照明、编辑等企业AI应用场景中更好地评估技术可行性并设计工程方案。