手机本地一键成片,全靠8B自我进化

2026-08-29 22:25:23 · chineseheadlinenews.com · 来源: 量子位

近年来,视频生成模型在“从无到有”合成像素上进展飞速,但真实的视频创作还有另一半问题:素材已经拍好了,怎么剪成一条能交付的片子。

选哪几段、留多长、怎么排、怎么卡点,成片得卡在目标时长内,指定的镜头不能丢,画面还要踩上音乐的节奏。在动手渲染之前,先得解决的其实是这道约束规划题。

目前的主流做法,是把闭源前沿大模型套上提示词、包进手工搭建的流程里充当剪辑大脑——一个不可训练的workflow式智能体。

它的短板很直接:决策策略被冻结在提示词里;成本、延迟和隐私都拴在闭源API上;同一份诉求每次剪出来都不一样。而手机厂商需要的,是一个能在手机上本地运行、还能持续学习的小型剪辑智能体。

针对这一问题,vivo AI Lab和香港中文大学(深圳)的研究团队提出了RefineCut框架:把剪辑做成一个闭环——模型一步步修改剪辑方案,一个确定性验证器(verifier)当场逐条打分,训练所需的全部信号都来自这个验证器。经过多教师蒸馏与偏好优化两阶段训练,8B规模的开源模型在完全相同的闭环协议下反超了其中两位教师,追平最强的DeepSeek-V4-Pro。该工作已被EMNLP 2026主会(Main Conference)接收。

△隐式的提示词决策,变成一份可以逐条检查的显式剪辑计划。

核心思路:让剪辑计划成为“可以被检查”的对象

RefineCut的出发点,是剪辑这件事的一个特殊性质:虽然没有唯一正确答案,但一个剪辑计划合不合格,是可以被客观检查的。

围绕这一点,系统把剪辑改写成一个标准的智能体问题——任务规范、动作、反馈,各有明确定义:

约束账本(constraint ledger):任务的显式规范——把每份自然语言诉求翻译成一组机器可逐条核对的约束:目标时长、必保镜头、禁用素材、音乐对齐要求;

RefinePatch:智能体的结构化动作空间——规划器不整段重写方案,而是在类型化时间线上做小步修改,每一步改了什么都有迹可查;

确定性验证器:环境反馈的来源——把每个修改应用到时间线上、对照账本逐条判定,并汇总为量化总分VES(论文中为0–1分值,本文统一换算成百分制)。

这套设定的关键在于:验证器输出的是确定、可复核的信号,相当于给剪辑这个创作任务配上了大模型后训练中广受关注的“可验证奖励”。接下来的训练分两步。

方法:一个验证器,串起数据、训练与部署

△RefineCut整体框架:(A)任务与多教师轨迹,(B)验证器回放蒸馏与自我进化训练,(C)闭环剪辑智能体。

起点:一批昂贵但含噪的教师轨迹

团队先让GPT-5.4、Qwen3-Max、DeepSeek-V4-Pro三个前沿模型在数千个任务上闭环作业——读状态、出补丁、收反馈,积累了近5900段教师轨迹、13800余次前沿模型修复调用。但这批数据没法直接学:三家教师模型的输出格式与分支结构互不一致,各自最好的分支也大多只是局部修复而非完整方案。论文实测,直接模仿这批轨迹只能把模型从59.4分带到62.0分,与不训练相比几乎没有变化。

验证器回放蒸馏:老师的答案,先验过再学

第一阶段训练因此不模仿教师,而是把全部候选分支逐一放回验证器“重放”:规范化、应用到真实剪辑状态、逐条对照账本打分——这一步做的其实就是拒绝采样,以验证器为准绳,只留最优修复作为训练数据。提纯后的训练集只剩原来的三分之一(3317条对9690条),同一个模型却直接升到85.8分。

RefineCut-Evo:不再需要老师的自我进化

第二阶段彻底离开教师:模型自己生成候选修复,由验证器打分,再用一套任务准则(rubric)细化分差,只保留分差足够大的高置信偏好对(最终779对)做DPO偏好优化,把成绩推到92.4分。训练完成后,它在推理时就是一个纯本地的剪辑智能体——读取当前时间线和尚未满足的账本条目,输出一个RefinePatch,验证器当场应用并重算,至多迭代三步,平均每个任务11.7秒,全程没有一次外部大模型调用。

RefineCut-Bench:给剪辑决策层一个公开基准

由于此前不存在面向剪辑决策层的公开基准,团队把任务、素材与验证协议一并整理成RefineCut-Bench:3578个剪辑任务、7971个带结构化描述的素材片段、499条音乐轨道,每个任务附显式约束账本,训练/开发/测试按任务记录切分,所有方法在同一套规则下对比。

△RefineCut-Bench一览:素材库、任务分类、约束分布、多教师轨迹与评测协议。

实验结果

同一闭环下与前沿模型直接对比

最能说明问题的对比,是让三位教师在与学生完全相同的状态、账本、接口和停止规则下亲自下场。RefineCut-Evo拿到92.4分,高于GPT-5.4的89.3分和Qwen3-Max的77.3分,与最强的DeepSeek-V4-Pro(93.6分)几乎不相上下,而它是其中唯一跑在本地的8B模型。

△同一闭环协议下的对比:教师模型、未训练8B与RefineCut-Evo(VES为百分制,满分100)

研究团队还专门检验了“只靠提示技巧行不行”:同一个不训练的8B基座,直接提示只有50.2分,加上验证器反馈迭代到59.2分,让验证器在4个候选里挑最好的也只到70.0分;哪怕把这些方法每个任务碰到过的最好结果单独挑出来算分,也只有71.2分,离训练后的92.4分还差一大截。

训练各阶段的贡献

拆开训练过程看,最大的一步来自验证器回放蒸馏:62.0分到85.8分,一步涨了23.8分;偏好训练在此之上推进到86.4分,Evo自进化收在92.4分。

△训练各阶段在Common-100上的成绩(VES百分制)

△训练阶段推进:验证器回放蒸馏贡献最大单步提升(62.0→85.8分),Evo将成绩推至92.4分。

消融实验进一步定位了Evo的增益来源:仅用验证器给偏好对打分已经能到90.9分,任务准则的细化分差在此之上还能再涨一点;反过来,不做分差过滤、什么样的偏好对都往里放,成绩明显回落。进哪些样本,比分数怎么算影响更大,这与蒸馏阶段“三分之一的数据反而更好”的现象是一致的。

跨模型家族的迁移

同一套流程在Llama-3.1-8B和GLM-4-9B上原样重复:原始模仿在两个家族上持平甚至倒退(?7.0分、?3.6分),回放蒸馏则把每个家族都稳定拉起(+15.3分、+7.9分),三个家族的必保镜头召回分别到98%、92%与99%,此前最低只有39%。验证器带来的收益并不绑定某一个基座。

△跨基座迁移:验证器回放蒸馏在三个模型家族上的结果(VES百分制)

渲染盲测与剪辑行为

自动指标之外,团队把成片渲染出来请人盲选:三位标注者对随机打乱左右顺序的150组A/B预览逐一比较,Evo对上一阶段的偏好训练模型(Mixed-Pref)拿下100胜、34平、16负,偏好率78%,标注者之间的判断也相当一致,与自动指标的排序相符。剪辑行为上,它平均每个任务只动1.76次修改(提示基线为2.72次),操作更少(3.77对5.95),从不引用不存在的素材;100个任务里一次合格的方案从上一阶段的74个增加到91个,此前最常见的失败——时长不达标——从16例降到1例。

△失败构成变化:一次合格的计划从74个增至91个,时长不达标从16例降至1例。

局限与未来方向

论文也把边界写得很清楚:VES由训练所用的同一验证器定义,是协议内的分数,渲染后的观感好不好还得靠独立评测,所以才有上面的盲测;规划器读到的是素材描述与元数据而不是原始像素,上游描述的质量会给成片设上限;偏好训练阶段目前只在Qwen基座上完成。下一步计划包括:面向真实用户的自由格式需求、更长篇幅的成片、更多素材领域,以及把感知端一并纳入训练闭环。

总结与展望

回头看,RefineCut依赖的其实是一件事:当任务的结果存在可执行的规范时,确定性验证器就能接过人工标注和学习型评委的工作——先筛掉教师数据里的噪声,再给模型自己的输出打分,不依赖任何人工标签。它也把“可验证奖励”这条在数学、代码任务上得到验证的训练路线,延伸到了剪辑这样的创作型智能体任务上。

放回真实场景,移动影像已经是大众创作的主要方式,“相册一键成片”“智能vlog剪辑”这类体验的瓶颈,就在RefineCut所处的决策层:在用户的时长、内容与配乐约束下,给出一份可以执行、也经得起检查的剪辑计划,相当于手机创作智能体的“大脑”。这些场景没法依赖云端API:模型要能在手机上跑,同样的输入要给出同样的结果——这也是vivo蓝心大模型一直在推进的端侧路线。


    24小时新闻排行榜更多>>
  1. 胡锡进:孙宇晨分明是给前女友的未来“关灯”
  2. 福建泉州一化工厂发生溴泄露 当地网民:喉咙痛呼吸困难
  3. 被查传闻沸沸扬扬之际 刘国梁参加国际乒联会议
  4. 英特尔14A传来重大进展
  5. 刚入警1年的大学女生,在吉隆口岸的泥石流中失联
  6. 赵长鹏劝架,孙宇晨承诺“不再多说”后再发长文
  7. 什么是好房子?这4种极佳户型 越住越旺
  8. 中国如何管控西藏灾情?大灾之中审查依然不缺位
  9. 一群“不会算计别人”的人,让科学家困惑了
  10. 柯文哲揭露与绿营决裂原因:国民党“餐桌礼仪”较好
  11. 川普签署行政令,筹建太空学院
  12. 向佐炮轰亲妈:别没事找事
  13. 央视曝光“痛风神药”美力森压片糖果骗局
  14. 一切都彻底变了:15万“横漂”大洗牌
  15. 美更正中国黑客案说法 多机构遭锁定但仅部分被骇
  16. 刘翔同届奥运冠军现状:多人晋升高位
  17. 美联储沃什鹰派发言震颤市场:黄金暴跌逾3%
  18. 俄罗斯开始量产“星链”干扰器“波穹保护”系统
  19. FBI悄悄放宽录用标准:嫖娼、偷窃前科也可以考虑
  20. Fox主持人:“今年美国中期选举对共和党将是残酷的”
  21. 全球资本增配人民币资产
  22. 基因一剪永逸!研究曝堵塞血管坏胆固醇降低50%
  23. 9月Fed升息几率逼近60%
  24. 库尔德人遭伊朗猛攻,川普断军援
  25. 当教练或买断二选一 43岁刘翔想走第三条路
  26. 马斯克:14年后地球上将有10亿人形机器人
  27. 为什么赵长鹏一条消息,就能让孙宇晨闭嘴?
  28. 孙哥为啥没去酒店退款?
  29. 中共二十大后 57名上将出事 习近平把军队搞瘫痪
  30. 中国重回英国最大留学生来源国
  31. 新加坡华人和中国人,到底是什么关系?
  32. 郭德纲的问题没那么简单
  33. 失联人数逼近3000,幸存者讲述获救经历
  34. 奥特曼最后一战:4个月后,交付AGI
  35. 全国重点实验室公布吉隆泥石流灾害初步研判报告
  36. 喝了这种瓶装水,他急性肾损伤
  37. 长鑫存储起诉五角大楼,将美防长等人列为被告
  38. 比尔盖茨,为什么变了?
  39. 美移民签证面试暂停何时结束 有三种可能情况
  40. 中资水坝贪腐案 厄前总统与中国前大使均判5年徒刑
  41. 马斯克回应OpenAI断供Cursor
  42. 外国人眼中的中国,居然是这个样子?
  43. 92岁,未婚未育,500万遗产留给谁?
  44. 女记者德黑兰日志:边说日子太难 餐厅依然爆满
  45. 9月Fed升息几率将近60%?专家举3理由证市场斑估
  46. 驶入迷雾,静待下一个催化
  47. 全球炼油缺口正在扩大
  48. 美媒团队遭以定居者袭击,内塔尼亚胡谴责
  49. 上海高知夫妻:不要儿女放弃家庭来尽孝 想办法活百岁
  50. 震撼影片,中尼巨灾源头
  51. 如何应对快速轮动的行情?
  52. SpaceX要自产“燃气轮机叶片”
  53. 长寿的5个习惯:坐地板也上榜
  54. 法拉盛华人收入支出:底层蓝领日子紧
  55. 美国屋主崩溃了!外送员全裸送餐 遭监视器拍下
  56. 中国加大对台海上施压 北京意在压缩台北控制权
  57. 和泽连斯基闹掰后 乌前防长接受意大利的工作邀请
  58. 美加关系持续恶化 加拿大开始从美顶尖高校挖人才
  59. X称发现20万疑似中国虚假账号组“机器人账号农场”
  60. 第五届气象经济论坛即将启幕