手机本地一键成片,全靠8B自我进化
2026-08-29 22:25:23 · chineseheadlinenews.com · 来源: 量子位
近年来,视频生成模型在“从无到有”合成像素上进展飞速,但真实的视频创作还有另一半问题:素材已经拍好了,怎么剪成一条能交付的片子。
选哪几段、留多长、怎么排、怎么卡点,成片得卡在目标时长内,指定的镜头不能丢,画面还要踩上音乐的节奏。在动手渲染之前,先得解决的其实是这道约束规划题。
目前的主流做法,是把闭源前沿大模型套上提示词、包进手工搭建的流程里充当剪辑大脑——一个不可训练的workflow式智能体。
它的短板很直接:决策策略被冻结在提示词里;成本、延迟和隐私都拴在闭源API上;同一份诉求每次剪出来都不一样。而手机厂商需要的,是一个能在手机上本地运行、还能持续学习的小型剪辑智能体。
针对这一问题,vivo AI Lab和香港中文大学(深圳)的研究团队提出了RefineCut框架:把剪辑做成一个闭环——模型一步步修改剪辑方案,一个确定性验证器(verifier)当场逐条打分,训练所需的全部信号都来自这个验证器。经过多教师蒸馏与偏好优化两阶段训练,8B规模的开源模型在完全相同的闭环协议下反超了其中两位教师,追平最强的DeepSeek-V4-Pro。该工作已被EMNLP 2026主会(Main Conference)接收。


△隐式的提示词决策,变成一份可以逐条检查的显式剪辑计划。
核心思路:让剪辑计划成为“可以被检查”的对象
RefineCut的出发点,是剪辑这件事的一个特殊性质:虽然没有唯一正确答案,但一个剪辑计划合不合格,是可以被客观检查的。
围绕这一点,系统把剪辑改写成一个标准的智能体问题——任务规范、动作、反馈,各有明确定义:
约束账本(constraint ledger):任务的显式规范——把每份自然语言诉求翻译成一组机器可逐条核对的约束:目标时长、必保镜头、禁用素材、音乐对齐要求;
RefinePatch:智能体的结构化动作空间——规划器不整段重写方案,而是在类型化时间线上做小步修改,每一步改了什么都有迹可查;
确定性验证器:环境反馈的来源——把每个修改应用到时间线上、对照账本逐条判定,并汇总为量化总分VES(论文中为0–1分值,本文统一换算成百分制)。
这套设定的关键在于:验证器输出的是确定、可复核的信号,相当于给剪辑这个创作任务配上了大模型后训练中广受关注的“可验证奖励”。接下来的训练分两步。
方法:一个验证器,串起数据、训练与部署

△RefineCut整体框架:(A)任务与多教师轨迹,(B)验证器回放蒸馏与自我进化训练,(C)闭环剪辑智能体。
起点:一批昂贵但含噪的教师轨迹
团队先让GPT-5.4、Qwen3-Max、DeepSeek-V4-Pro三个前沿模型在数千个任务上闭环作业——读状态、出补丁、收反馈,积累了近5900段教师轨迹、13800余次前沿模型修复调用。但这批数据没法直接学:三家教师模型的输出格式与分支结构互不一致,各自最好的分支也大多只是局部修复而非完整方案。论文实测,直接模仿这批轨迹只能把模型从59.4分带到62.0分,与不训练相比几乎没有变化。
验证器回放蒸馏:老师的答案,先验过再学
第一阶段训练因此不模仿教师,而是把全部候选分支逐一放回验证器“重放”:规范化、应用到真实剪辑状态、逐条对照账本打分——这一步做的其实就是拒绝采样,以验证器为准绳,只留最优修复作为训练数据。提纯后的训练集只剩原来的三分之一(3317条对9690条),同一个模型却直接升到85.8分。
RefineCut-Evo:不再需要老师的自我进化
第二阶段彻底离开教师:模型自己生成候选修复,由验证器打分,再用一套任务准则(rubric)细化分差,只保留分差足够大的高置信偏好对(最终779对)做DPO偏好优化,把成绩推到92.4分。训练完成后,它在推理时就是一个纯本地的剪辑智能体——读取当前时间线和尚未满足的账本条目,输出一个RefinePatch,验证器当场应用并重算,至多迭代三步,平均每个任务11.7秒,全程没有一次外部大模型调用。
RefineCut-Bench:给剪辑决策层一个公开基准
由于此前不存在面向剪辑决策层的公开基准,团队把任务、素材与验证协议一并整理成RefineCut-Bench:3578个剪辑任务、7971个带结构化描述的素材片段、499条音乐轨道,每个任务附显式约束账本,训练/开发/测试按任务记录切分,所有方法在同一套规则下对比。

△RefineCut-Bench一览:素材库、任务分类、约束分布、多教师轨迹与评测协议。
实验结果
同一闭环下与前沿模型直接对比
最能说明问题的对比,是让三位教师在与学生完全相同的状态、账本、接口和停止规则下亲自下场。RefineCut-Evo拿到92.4分,高于GPT-5.4的89.3分和Qwen3-Max的77.3分,与最强的DeepSeek-V4-Pro(93.6分)几乎不相上下,而它是其中唯一跑在本地的8B模型。

△同一闭环协议下的对比:教师模型、未训练8B与RefineCut-Evo(VES为百分制,满分100)
研究团队还专门检验了“只靠提示技巧行不行”:同一个不训练的8B基座,直接提示只有50.2分,加上验证器反馈迭代到59.2分,让验证器在4个候选里挑最好的也只到70.0分;哪怕把这些方法每个任务碰到过的最好结果单独挑出来算分,也只有71.2分,离训练后的92.4分还差一大截。
训练各阶段的贡献
拆开训练过程看,最大的一步来自验证器回放蒸馏:62.0分到85.8分,一步涨了23.8分;偏好训练在此之上推进到86.4分,Evo自进化收在92.4分。

△训练各阶段在Common-100上的成绩(VES百分制)

△训练阶段推进:验证器回放蒸馏贡献最大单步提升(62.0→85.8分),Evo将成绩推至92.4分。
消融实验进一步定位了Evo的增益来源:仅用验证器给偏好对打分已经能到90.9分,任务准则的细化分差在此之上还能再涨一点;反过来,不做分差过滤、什么样的偏好对都往里放,成绩明显回落。进哪些样本,比分数怎么算影响更大,这与蒸馏阶段“三分之一的数据反而更好”的现象是一致的。
跨模型家族的迁移
同一套流程在Llama-3.1-8B和GLM-4-9B上原样重复:原始模仿在两个家族上持平甚至倒退(?7.0分、?3.6分),回放蒸馏则把每个家族都稳定拉起(+15.3分、+7.9分),三个家族的必保镜头召回分别到98%、92%与99%,此前最低只有39%。验证器带来的收益并不绑定某一个基座。

△跨基座迁移:验证器回放蒸馏在三个模型家族上的结果(VES百分制)
渲染盲测与剪辑行为
自动指标之外,团队把成片渲染出来请人盲选:三位标注者对随机打乱左右顺序的150组A/B预览逐一比较,Evo对上一阶段的偏好训练模型(Mixed-Pref)拿下100胜、34平、16负,偏好率78%,标注者之间的判断也相当一致,与自动指标的排序相符。剪辑行为上,它平均每个任务只动1.76次修改(提示基线为2.72次),操作更少(3.77对5.95),从不引用不存在的素材;100个任务里一次合格的方案从上一阶段的74个增加到91个,此前最常见的失败——时长不达标——从16例降到1例。

△失败构成变化:一次合格的计划从74个增至91个,时长不达标从16例降至1例。
局限与未来方向
论文也把边界写得很清楚:VES由训练所用的同一验证器定义,是协议内的分数,渲染后的观感好不好还得靠独立评测,所以才有上面的盲测;规划器读到的是素材描述与元数据而不是原始像素,上游描述的质量会给成片设上限;偏好训练阶段目前只在Qwen基座上完成。下一步计划包括:面向真实用户的自由格式需求、更长篇幅的成片、更多素材领域,以及把感知端一并纳入训练闭环。
总结与展望
回头看,RefineCut依赖的其实是一件事:当任务的结果存在可执行的规范时,确定性验证器就能接过人工标注和学习型评委的工作——先筛掉教师数据里的噪声,再给模型自己的输出打分,不依赖任何人工标签。它也把“可验证奖励”这条在数学、代码任务上得到验证的训练路线,延伸到了剪辑这样的创作型智能体任务上。
放回真实场景,移动影像已经是大众创作的主要方式,“相册一键成片”“智能vlog剪辑”这类体验的瓶颈,就在RefineCut所处的决策层:在用户的时长、内容与配乐约束下,给出一份可以执行、也经得起检查的剪辑计划,相当于手机创作智能体的“大脑”。这些场景没法依赖云端API:模型要能在手机上跑,同样的输入要给出同样的结果——这也是vivo蓝心大模型一直在推进的端侧路线。