ECCV 2026|4步去噪实现12.66 FPS,清华、港科大提出实时流式视频编辑框架LiveEdit
来源:机器之心原文链接:https://mp.weixin.qq.com/s/HT6AMtSUoKPSpEKI2TLy5Q文本指令驱动的视频编辑技术正在从离线内容生产走向直播特效、视频会议和增强现实等在线交互场景。然而,高质量的视频扩散模型的通常依赖于对完整视频进行双向时空注意力处理,即模型需要等待未来帧到齐,再对整段视频进行联合处理。这种范式能够获得较好的编辑结果,却难以满足低延迟、持续输入与即时输出的要求。近日,清华大学与香港科技大学的研究团队提出 LiveEdit,一种面向通用文本指令的实时流式视频编辑框架。该方法以因果、分块的方式处理持续到来的视频,在 4 步 / 视频块的推理条件下实现 12.66 FPS 的流式编辑,并能保持被编辑区域的准确性以及未编辑区域的一致性。论文标题:LiveEdit: Towards Real-Time Diffusion-Based Streamin
原文:雷峰网