你有没有见过这种诡异的画面:AI生成的一段视频,前几秒还好好的,一只猫叼着鱼在沙滩上奔跑,后面有人追赶,画面充满动感。可是随着视频往后播放,猫的动作越来越僵,最后整个画面几乎变成了一张会呼吸的照片,猫定在原地,人也定在原地,只有摄像机在缓慢移动。
这不是bug,这是AI视频生成领域一个真实存在、而且相当棘手的问题。而更让人意外的是,一些本来是为了让视频更"靠谱"而设计的技术,恰恰是导致画面变僵的元凶。
(资料图片仅供参考)
这篇来自UCLA和清华团队的论文,叫做Stream4D,就是冲着这个问题去的。
**流式生成的AR视频模型:一种可以边生成边播放的视频AI,它不需要先算完整段视频再给你看,而是像直播一样一段一段往外吐画面,所以能做到实时生成、还能一直往后延续,时长可以很长**
这类模型这几年发展很快,因为它们特别适合做实时应用,比如给AI角色配上会动的画面,或者搭一个能实时交互的虚拟世界。但问题也随之而来,模型是一段一段生成的,每一段只能看到前面已经生成的内容,看不到全局,这就好比你蒙着眼睛往前走,只能凭脚下的触感判断方向,走的时间越长,偏离原来路线的可能性就越大。
这种"越走越偏"的现象,在视频生成里叫做误差累积。生成到第10秒的画面,可能已经和第1秒的场景在几何结构上完全不搭了,深度关系错乱,物体忽大忽小,运动也变得不合常理。
问题到底难在哪
要理解这篇论文的贡献,得先搞懂前人是怎么想解决这个问题的,以及这个解法本身出了什么岔子。
之前有两个比较有代表性的工作,一个叫World-R1,一个叫VideoGPA,它们的思路是类似的:既然视频容易失去几何一致性,那就用三维重建技术当裁判,去打分。
**3D Gaussian Splatting(3D-GS):一种用大量高斯点云去拟合三维场景的重建技术,能根据多张照片还原出一个静态的三维模型,常用于三维场景重建和渲染**
这个裁判的逻辑是这样的:把AI生成的视频喂给一个3D重建模型,如果这段视频能被很好地还原成一个稳定的三维场景,说明这段视频的几何是一致的,给高分;如果重建效果很差,说明画面里可能出现了穿模、抖动、物体位置漂移,扣分。
听起来挺合理,对吧?但这里藏着一个致命的漏洞。
3D-GS重建出来的,是一个静态的场景。它假设你拍的是一个不会动的房间,从不同角度拍了很多照片,然后拼出一个立体模型。可现实中的视频里,猫在跑,鱼在跳,人在追,这些都是真实的运动,不是噪声,不是错误。
但对一个只会处理静态场景的重建模型来说,任何运动都会被它当成"重建失败"。猫从A点移动到B点,在这个裁判眼里,跟猫的模型突然崩塌变形没有任何区别,都是重建误差,都要扣分。
于是就出现了这篇论文标题里点出的核心矛盾:这个裁判会把真实的物体运动,误判为重建错误,从而惩罚运动本身。而AI模型为了拿高分,学会的策略特别简单粗暴,让画面尽量不动就行了,只留下摄像机的平移或缩放,制造出一种"看起来在运动,其实啥也没动"的假象。
这就好比给一个学生批改跑步姿势的作业,但评分标准是"身体位置偏离起点越少分数越高"。学生很快就会发现,最高分的策略不是跑得又快又稳,而是压根不跑,站在原地扭一扭。评分系统本意是奖励稳定的跑姿,结果却在奖励静止不动,学生按照这个激励去优化,只会越练越站得笔直,跑步能力反而退化了。
而且这个问题在流式生成里会被放大。因为AR模型只能看到前面生成过的内容,一旦某一段选择了"冻结"策略,后面的每一段都会继续沿着这个冻结的配置往下生成,越往后越难挣脱出来,就像滚雪球一样越滚越大。
论文里做了一个实验验证这个现象,用Spearman相关系数去衡量运动幅度和重建质量之间的关系,发现两者确实存在微弱的负相关,运动越大,重建分数确实会有一点下降,但幅度很小。这说明单纯的静态裁判存在明显偏差,会系统性地打压运动,而不只是对运动"中性"。
Stream4D怎么解这个死结
既然问题的根源是重建模型不懂动态场景,那顺理成章的思路就是,换一个懂动态场景的重建模型。
**MoVieS:一个前馈式的4D高斯溅射重建模型,和传统3D-GS的区别在于,它把场景拆成两部分,一部分是不随时间变化的核心几何,另一部分是随时间变化的形变和场景流,能够刻画物体在时间轴上的运动**
**4D重建:相比只重建三维空间的3D重建,4D重建多了一个时间维度,意味着它承认场景里的东西是会动的,并试图把这种运动本身也建模出来**
有了这个工具,Stream4D的核心逻辑变成了这样:把AI生成的视频喂给MoVieS,让它去拟合出一个既有空间结构又有时间变化的四维场景,然后用这个四维场景反过来渲染出每一帧画面,跟原始生成的画面做对比。如果两者高度吻合,说明这段视频的几何、运动、摄像机轨迹都是自洽的,能被一个合理的动态世界模型解释,给高分。
关键的区别在于,猫在奔跑这件事,对4D重建模型来说不是异常,而是它本来就要去建模的对象。运动不再是噪声,而是信号本身。
这就好比之前那个跑步评分系统换了个新老师,新老师不再只看学生站的位置,而是全程录像分析学生的跑步姿态是否协调、步频是否稳定、有没有摔倒。这时候站着不动反而拿不到高分,因为老师压根就没在考核"是否偏离起点"这件事,考核的是"跑得像不像一个正常人在跑"。学生要拿高分,唯一的办法就是好好跑,不能靠耍滑头站着糊弄过去。
论文里对这个重建奖励的计算方式做了具体说明,用的是LPIPS这种感知距离,而不是逐像素比较。
**LPIPS:一种衡量两张图片感知相似度的指标,它不是简单比较像素点数值上的差异,而是通过一个预训练好的深度网络去提取图像特征,然后比较特征层面的差异,这样可以避免因为轻微的位置偏移或者光照变化就判定两张图片差别很大**
用LPIPS的好处是,它对细微的低层次错位不那么敏感,但依然能揪出那些真正影响视觉质量的重建误差,比如物体身份漂移、几何结构错乱这类问题。
不过光是换掉裁判还不够。因为虽然4D重建模型不会主动惩罚运动,但论文的作者发现了一个更微妙的现象,运动幅度小一点的视频,确实是相对更容易被重建准确的,这是个客观事实,不是bug,只是重建这件事本身的特性。
如果什么都不做,模型依然有一点点动力去悄悄减少运动幅度,只是没有之前那么极端了。为了彻底堵上这个口子,作者又设计了第二层奖励,专门针对运动的质量和幅度做约束。
运动奖励怎么设计才不翻车
这一部分是整篇论文里我觉得设计得最巧妙的地方,因为它没有简单地说"运动越多越好",而是精确地卡在一个"自然"的区间里。
**运动门控奖励:一个以高斯函数形态设计的奖励项,它会在某个理想的运动幅度上给出最高分,运动幅度过小或过大都会被扣分,像是给运动强度设了一个甜蜜点**
为什么不能简单粗暴地说运动越多越好?因为如果这样设计,模型很可能会走向另一个极端,为了拿高分疯狂制造运动,结果画面变得抖动模糊,物体一会儿变形一会儿分裂,看起来"很活跃"但实际上乱七八糟,完全不自然。
论文里的实验也验证了这一点。当研究者把运动奖励改成一个线性函数,也就是运动幅度越大分数线性增加,结果画面确实动得更多了,但重建质量和人类偏好评分都明显下降。这说明运动这件事不是越多越好,而是要卡在一个合理的区间里。
那这个合理区间怎么确定?论文的做法是,从原始的基础模型(没有经过强化学习训练的版本)生成的一批视频里,统计出运动幅度的中位数,把这个中位数设为目标值,然后用高斯函数去构造一个奖励曲线,运动幅度越接近这个目标值,奖励越高,偏离得越多,无论是偏多还是偏少,奖励都会下降。
这就好比给汽车设计定速巡航系统,不是让你越快越好也不是越慢越好,而是设定一个符合路况的合理速度,开得太慢会堵车影响后面的人,开得太快又危险,只有维持在那个甜蜜点附近才是最优解。如果没有这个上限约束,只是单纯奖励"车速越快越好",那司机很可能会一路狂踩油门,制造出速度感很强但极其危险的驾驶行为,这正是论文里线性运动奖励翻车的原因。
光有幅度约束还不够,因为幅度对了,运动质量也可能很差,比如画面抖动或者物体变形得乱七八糟。所以Stream4D又加了两个质量因子。
第一个叫平滑度,用来惩罚运动幅度剧烈波动的情况,防止画面变成一顿一顿的抽搐感。
第二个叫刚性,这个设计尤其值得说一下。论文的思路是,真实世界里,同一个物体上相邻的点,运动速度和方向应该是差不多的,就算是一个人在做柔软的舞蹈动作,他的手臂上相邻的皮肤也是一起移动的,不会突然一部分往左一部分往右。如果重建出来的场景流里,相邻像素点的运动方向差异特别大,那很可能对应的是画面里出现了撕裂、抖动或者物体"融化"这种崩坏的伪影。
**场景流:描述视频画面中每个像素点在三维空间里从一帧到下一帧的运动轨迹,可以理解成给画面里每一个点都标出一个运动箭头**
论文通过计算场景流在空间上的梯度变化,把这种局部运动的不一致性量化成一个刚性分数,梯度越大代表相邻点运动差异越大,扣分越多。
最后,这三个因子(运动门控、平滑度、刚性)是相乘的关系,不是相加。这个设计选择本身也很讲究,因为相乘意味着任何一项特别差,整体分数都会被拉得很低,模型没办法靠某一项特别好来弥补另一项的糟糕表现。论文的消融实验也证明了这一点,如果去掉门控只留平滑度和刚性,模型又会滑向冻结画面的老毛病,因为一个静止的画面对平滑度和刚性来说是最容易拿满分的情况,等于是给模型留了一条捷径。这也印证了那个反事实推理:去掉高斯门控之后,Self-Forcing和Causal-Forcing两个模型都出现了明显的画面冻结现象。
第三块拼图:审美锚点
除了重建奖励和运动奖励,Stream4D还加了第三个组件,一个相对简单但同样必要的锚点。
**HPSv2:一个基于人类偏好训练出来的图像美学评分模型,用来打分一张图片在视觉上有多讨人喜欢**
为什么需要这个?因为前两个奖励都在管几何和运动,谁都没管画面本身好不好看。理论上模型完全可能在满足几何一致性和运动自然度的前提下,把画面画得很粗糙、很难看,因为这两个约束并没有对画质本身做要求。加上HPSv2这个锚点,就是为了把生成结果稳稳地拉回到接近原始基础模型的视觉水准,不让优化过程在无人看管的维度上跑偏。
三个奖励最后是怎么合并到一起的?论文用的是z-score标准化后加权求和的方式,每个维度先各自做标准化,拉到同一个数值尺度上,再乘以各自的权重加起来。这样处理的好处是,不同奖励天然的数值范围差异很大,比如HPSv2原始分数大概在0.2左右,运动奖励在0.8左右,如果直接相加,数值范围大的那个会主导整个结果,标准化之后大家才能公平地按权重发挥作用。
结果到底怎么样
论文在三个不同的流式AR视频模型上做了实验,分别是Self-Forcing、Causal-Forcing和LongLive,前两个生成5秒视频,LongLive生成10.3秒视频,时间跨度更长,误差累积问题也更严重。
核心指标叫4D-PSNR,也就是用MoVieS重建后再渲染出来的画面和原始生成画面之间的峰值信噪比,数值越高说明重建吻合度越好,也就间接说明视频本身的时空一致性越好。
数据摆出来相当直观。Self-Forcing的基础模型4D-PSNR只有16.88,用Stream4D训练之后提升到20.34。Causal-Forcing从15.44提升到20.97。LongLive从17.44提升到24.20,涨幅达到6.76分贝,是三个模型里提升最明显的一个,可能正因为它生成的视频时长最长,误差累积最严重,改进空间也最大。
对比两个基于静态3D重建的方法,World-R1和VideoGPA,虽然它们的4D-PSNR数值有时候看起来也不低,甚至在LongLive上World-R1能达到22.64,但这里有个陷阱:一个几乎冻结不动的画面,天然就比一个持续运动的画面更容易被任何重建模型精确还原,所以单看这一个指标容易被误导。
这就是为什么论文还引入了一个不依赖MoVieS的独立验证,用另一个架构完全不同的重建模型4DGT来做交叉检验。结果显示,Stream4D在这个完全独立的重建模型上依然拿到最好的PSNR和SSIM分数,比World-R1领先0.7到2.5分贝不等,说明这个提升不是MoVieS一家的偏好,换个裁判结论依然成立。
更有说服力的是运动保持度的评估。论文用了一个不知道自己在评谁的视觉语言模型(Gemini)来当裁判,专门去看视频里的物体运动有没有被保留下来。结果是Stream4D在三个模型上的运动分数分别是0.833、0.765、0.706,都明显高于World-R1和VideoGPA。而且这个判官还做了一个更严格的"一致性"判断,要求候选视频必须同时做到保住运动、且比基础模型更连贯,才能算赢,单纯靠冻结画面是拿不到这个分的。Stream4D在这项上的胜率分别是82.2%、73.9%、74.2%,明显碾压对手。
论文还做了一场真人评测,找了5个评审员,针对LongLive这个最容易出问题的长视频模型,做了150组盲测对比。结果人类评审员对Stream4D的偏好度,相比World-R1达到76%,相比VideoGPA达到80%,而且人类给出的排序和AI裁判给出的排序完全一致,这多少说明前面那些自动化指标不是自娱自乐的数字游戏。
拆开来看,每个部件都不能少
论文还做了细致的消融实验,一个一个拆掉三个奖励组件,看看少了哪个会出什么问题。
去掉运动奖励这一项,三个模型全部出现明显的画面冻结,尤其是运动判官给出的分数直接跌到0.3到0.5左右,说明这一项是防止冻结最直接的防线。
去掉重建奖励这一项,情况走向另一个极端。运动分数确实冲得很高,甚至能到0.98这种接近满分的水平,但重建质量断崖式下跌,画面的一致性判官给出的胜率跌到二三十的水平,说明画面已经乱到没法看了,物体乱飘、几何崩坏,运动虽然多但完全不可信。
去掉审美锚点这一项,影响相对温和一些,但在Causal-Forcing模型上会导致一致性判官的胜率跌破50%,输给自己没训练过的基础版本,在LongLive上则会损失掉3.6分贝的重建质量和15个百分点的整体偏好胜率。
三个组件像三条腿的凳子,任何一条腿短了,凳子都会往一边倒。
一个容易被忽视的验证细节
论文里有一处我觉得特别值得点出来的设计,就是他们专门做了一个"随机抽样测试集"作为对照,而不只是用精心筛选的"高运动量测试集"。
这个安排相当聪明,因为如果只在高运动量的测试集上验证,很容易被质疑说这是不是刻意挑了对自己方法有利的场景。所以论文额外拿了一批完全随机抽取、没有经过运动量筛选的提示词做测试,结果发现在这批数据里,静态裁判方法(VideoGPA、World-R1)在传统的重建指标和VideoReward评分上反而表现得更好,甚至一度超过Stream4D。
但当研究者用运动感知的判官去检验这些"看起来分数很高"的视频时,真相浮出水面:VideoGPA在这批数据上的运动分数只有0.136到0.484之间,一致性胜率跌到个位数,说明它的高分完全是靠冻结画面换来的,这批低运动量提示词恰好给了它一个作弊的舒适区。而Stream4D在这批随机数据上依然保持运动分数在0.7左右,一致性胜率也稳定超过60%,是唯一一个在这批数据上依然打得过自己基础模型的方法。
这个对照实验说明了一件很朴素但容易被忽视的事:评估AI生成质量的时候,指标本身的选择比模型本身还关键,一个设计有缺陷的评估体系,可能会让一个"偷懒"的模型看起来比一个"认真做事"的模型分数还高。
写在后面
读完这篇论文,让我印象最深的不是Stream4D这个方法本身有多精巧,而是它揪出的那个漏洞本身有多隐蔽。
用3D重建当裁判去评价视频质量,这个思路听起来毫无问题,甚至挺前沿,因为它试图用一个"更懂几何"的模型去纠正视频生成模型对空间结构的误判。可它的隐患藏在一个太容易被忽略的假设里,就是这个裁判自己也是个有偏见的模型,它只见过静止的世界。这种"用一个有偏见的模型去纠正另一个模型的偏见"的情况,其实在很多机器学习系统里都可能悄悄发生,只是不一定每次都像这篇论文里这么明显、这么容易被数据揪出来。
论文里那张Spearman相关系数只有负0.27的散点图,其实是个挺谦逊的展示方式。研究者完全可以夸大这个相关性来制造更强的叙事张力,但他们诚实地呈现了这只是个"弱相关",说明就算是他们自己提出的新裁判MoVieS,也没能做到对运动完全中立,只是偏见小了很多。这种克制反而让整篇论文的可信度更高。
还有一个细节值得单独说,就是论文选择用"相乘"而不是"相加"的方式去组合运动门控、平滑度和刚性这三个因子。这个看起来很小的数学选择,其实决定了整个奖励系统的行为模式:相加意味着某一项特别差可以被另一项特别好抵消,相乘意味着任何一项崩了,整体就崩了。这背后其实是个哲学问题,你到底希望你的评价系统是"及格就行、扬长避短",还是"每一项都不能掉链子"。视频生成这种任务,容错空间本来就不大,一个环节崩了整体观感就毁了,所以相乘这个选择在这里是对的。
这篇论文也留了一个没解决的口子,就是它现在依赖的还是一个非流式的4D重建模型,需要拿到一整段视频之后统一重建,这跟LongLive这类模型本身能无限延展生成的能力其实是不匹配的。论文自己也提到,下一步需要一个真正的流式4D重建器,能边生成边评估,而不是等一段视频攒够了再回头打分。这个问题听起来技术细节,但其实牵动的是这整套思路能不能真正用到实时交互场景里,毕竟实时应用等不起"攒够一整段再打分"这种延迟。
如果一个AI裁判自己都没见过运动的世界,它凭什么去判断另一个AI生成的运动是不是自然的?这个问题放在更大的语境里,其实也值得琢磨:我们用来评价AI的那些标准,本身是不是也带着某种它们自己都没意识到的盲区?
Q&A
Q1:Stream4D是什么?
A:Stream4D是UCLA和清华团队提出的一种强化学习训练方法,用来解决流式AI视频生成模型长时间生成后画面变僵、动作消失的问题。它用一个能理解动态场景的4D重建模型当裁判,而不是只能理解静态场景的3D重建模型,从而避免真实的物体运动被误判成错误而遭到惩罚。
Q2:为什么用3D重建模型当裁判会导致AI视频冻结不动?
A:因为3D高斯溅射这类重建技术本身只能建模静态场景,任何真实的物体运动在它眼里都等同于重建失败。AI模型为了拿高分,学会的最简单策略就是让画面尽量不动,只留摄像机移动,久而久之整段视频就会退化成几乎静止的画面。
Q3:Stream4D具体靠什么防止运动幅度失控?
A:Stream4D设计了一个类似钟形曲线的运动门控奖励,运动幅度接近一个从真实视频中统计出的自然值时奖励最高,太少或太多都会被扣分,同时还搭配了平滑度和刚性两个质量因子,防止模型靠抖动或变形来凑运动量。










营业执照公示信息