近年来,视频生成模型在“从无到有”合成像素上进展飞速,但真实的视频创作还有另一半问题:素材已经拍好了,怎么剪成一条能交付的片子。
选哪几段、留多长、怎么排、怎么卡点,成片得卡在目标时长内,指定的镜头不能丢,画面还要踩上音乐的节奏。在动手渲染之前,先得解决的其实是这道约束规划题。
目前的主流做法,是把闭源前沿大模型套上提示词、包进手工搭建的流程里充当剪辑大脑——一个不可训练的workflow式智能体。
它的短板很直接:决策策略被冻结在提示词里;成本、延迟和隐私都拴在闭源API上;同一份诉求每次剪出来都不一样。而手机厂商需要的,是一个能在手机上本地运行、还能持续学习的小型剪辑智能体。
针对这一问题,vivo AI Lab和香港中文大学(深圳)的研究团队提出了RefineCut框架:把剪辑做成一个闭环——模型一步步修改剪辑方案,一个确定性验证器(verifier)当场逐条打分,训练所需的全部信号都来自这个验证器。经过多教师蒸馏与偏好优化两阶段训练,8B规模的开源模型在完全相同的闭环协议下反超了其中两位教师,追平最强的DeepSeek-V4-Pro。该工作已被EMNLP 2026主会(Main Conference)接收。
△隐式的提示词决策,变成一份可以逐条检查的显式剪辑计划。
0
评论 (0)