Vera1.1 大画幅外扩实测:从已有画面往外延伸,到底能扩多远
一、视频外扩为什么难
先把问题讲清楚。
图片外扩(outpainting)已经不新鲜了——给一张图,让 AI 把画面左右上下延伸。视频外扩难在三个地方:
帧间一致性:图片外扩只需要空间连续,视频外扩还要时间连续——新长出来的区域,每一帧都要和已有区域对得上;
角色不崩:外扩区域里如果有已有角色,不能长着长着脸变了;
光影统一:新区域的光源方向、色调、透视,要和已有区域一致,不然像贴上去的。
传统做法是把已有帧当条件,直接生成新帧。结果就是边缘发虚、光影错位、帧率闪烁——做过视频后期的人都见过。
Vera1.1 走的不是这条路。下面拆它怎么做。
二、技术原理:Layer-Diffusion 分层扩散
Vera1.1 的外扩能力,底层是 Layer-Diffusion 分层扩散架构(论文 arXiv:2606.23610)。核心思路一句话:
把”生成什么”和”保留什么”解耦。
具体怎么做:
内容流:负责新区域的画面生成;
透明度流(alpha matte):负责新区域和已有区域的边界融合;
两路联合生成,最后合成成一段视频。
华为云社区把这个包装成”内容流 + 透明度流”双流架构。和 Photoshop 的图层思维类似——把画面拆成前景主体、背景环境、特效叠加层,每层单独扩散、单独可控,最后合成。
为什么这个架构对外扩重要:传统方法把已有区域也一起重新生成,容易把原来的内容改坏。分层扩散让已有区域保持不动,只在新区域生成内容,边界用透明度流做无缝融合。这就是为什么外扩之后原画面不会变。
三、外扩幅度:安全区间在哪
这是最实际的问题。官方在《量化实验:Vera1.1 无限画布视频的 FVD、人物偏差率测试》里给了明确数据:
| 外扩幅度 | 效果区间 | 建议 |
| 单次外扩 ≤40% | 商用优秀 | 绝大多数场景的安全区 |
| 总外扩幅度 ≤1 倍 | 商用优秀 | 多次外扩累计不超过原值的 100% |
| 超过这个区间 | 指标下降 | 不建议,容易崩 |
怎么理解这两个数字:
单次 40%:你有一段 1920×1080 的视频,往右外扩,新区域宽度不超过原宽度的 40%(约 768 像素),效果稳;
总 1 倍:如果你分多轮外扩,累计新增长度不要超过原始画面宽度。比如原画面 1920,累计外扩后总宽度不要超过 3840。
多轮外扩会不会断崖式下跌? 官方答案:会有累积衰减,但不会断崖式下跌。意思是每多扩一轮,画质和一致性会逐步下降,但不是突然崩掉。这给了你多轮外扩的空间——但要有节制。
工程建议:
一次到位比多次小步外扩好——每多一轮就多一次衰减;
必须多轮时,每轮之间检查角色和光影;
超过总 1 倍,建议重新构图,不要硬扩。
四、不同画幅的参数配置
外扩不是一个参数走天下。按目标画幅配:
| 目标画幅 | 瓦片重叠 | 单块边长 | 时序对齐 | 备注 |
| 21:9 4K 宽幅 | 128px | 2048px | 关全局 | 品牌广告,平衡速度 |
| 3:1 8K 长卷轴 | 192px | 1536px | 开 + 亚像素映射 | 漫剧,保角色一致 |
| 普通 16:9 外扩 | 默认 | 默认 | 默认 | 重叠 15%–25% |
几个关键参数的含义:
瓦片重叠率:新块和已有块重叠多少。重叠大,接缝稳,但算力高;重叠小,快,但容易有缝。默认 15%–25%,快速运镜或大幅外扩拉到 30%;
时序对齐:外扩区域的帧和已有区域的帧怎么对齐。长卷轴漫剧必须开全局时序对齐 + 亚像素坐标映射,否则角色跨块会飘;
单块边长:分块大小。显存够就开大,不够就开小。
五、外扩时角色怎么不崩
外扩最怕的不是画质,是新长出来的区域里角色变脸。Vera1.1 的做法:
68 个五官关键点全局锚定:外扩前先对已有画面做人脸检测,提取 68 个五官锚点,转成全局空间坐标。新区域生成时,这些锚点同步过去;
全局特征池:角色身份特征存在独立向量池,外扩区域引用同一个池,不从零重建;
每扩一瓦校准一次:大幅扩幅(2 倍)时,不是按帧校准,是每扩一个瓦片就和已有区域对一次基准。
官方实测:无限画布场景角色保留率 94.7%。这个数字是在分块+外扩场景下测的,不是单帧测试。
但要注意一个边界:如果外扩区域里角色是全新的(比如原画面只有主角,外扩区域要出现配角),那不是”外扩”能解决的,需要单独给配角建特征资产。外扩延伸的是已有内容,不是凭空加新角色。
六、后端在做什么:坐标映射和特征缓存
外扩看起来是”画布往右拉一点”,后端其实做了三件事:
坐标映射:原始视频、外扩区域、新画布三者之间的空间坐标转换。旧特征要从旧坐标映射到新坐标,不能错位;
分层特征缓存:已有区域的特征不重新生成,直接缓存复用。外扩只算新区域,省算力;
接缝三重校准:坐标严格对齐、特征加权平滑、帧间运动校验。官方实测接缝可感知瑕疵率压到 3% 以内。
为什么这层重要:如果后端只是简单 resize + 局部重绘,外扩几次就会累积坐标误差,角色慢慢飘走。Vera1.1 的坐标映射体系就是防这个的。
七、外扩的成本和限制
诚实地说几个限制:
成本:
外扩不是免费的——新区域要重新生成,显存和算力按新区域面积算;
4K 宽幅单卡只能 1 路并发,161 秒一段;8K 长竖幅 302 秒一段;
多轮外扩的成本是叠加的,不是一次性的。
限制:
总像素建议不超过 1 亿(约 10K 以内)。超过这个数,不管外扩多巧,画质和稳定性都会下降;
总外扩幅度不超过 1 倍。超过了,建议重新构图而不是硬扩;
外扩区域如果需要全新角色、全新场景,外扩帮不了你,那是新生成不是延伸。
一个容易被忽略的点:外扩方向也有讲究。横向外扩(宽幅)比纵向外扩(高幅)稳定,因为视频模型的训练数据里横向构图更多。纵向超长卷轴(比如 9:16 拉成 9:32)衰减会比横向快。
八、外扩工作流速查表
| 场景 | 建议 |
| 首次外扩 | 单次 ≤40%,一次到位 |
| 多轮外扩 | 累计 ≤1 倍,每轮检查角色 |
| 21:9 品牌广告 | 重叠 128px,关全局时序对齐 |
| 3:1 漫剧长卷轴 | 重叠 192px,开全局时序对齐 |
| 外扩后角色变脸 | 检查是否挂了全局特征池、锚定权重是否 ≥0.85 |
| 外扩后接缝明显 | 加大瓦片重叠到 30%,检查坐标映射 |
| 总像素超限 | 建议 ≤1 亿像素(约 10K),更大需定制 |
九、什么时候该外扩,什么时候该重新生成
最后一个判断:不是所有”画面不够大”都该外扩。
适合外扩:
已有一段好画面,想把左右/上下延伸出更多环境;
宽幅广告、长卷轴漫剧,在已有构图上扩展;
镜头运动需要更大的画框空间。
适合重新生成:
外扩幅度超过 1 倍——重新构图比硬扩稳;
外扩区域需要全新角色、全新场景——那是新镜头,不是延伸;
原画面本身就不满意——别在外扩上救,重生成原镜头。
十、写在最后
大画幅外扩这件事,技术上不是”把画布拉大让 AI 补全”那么简单。它需要分层扩散把”保留”和”生成”分开,需要坐标映射把旧特征搬到新空间,需要全局特征池保证角色不崩,需要瓦片重叠把接缝磨到看不见。
Vera1.1 在这条路上给的安全区间很明确:单次 40%、总 1 倍以内。这个数字不是保守,是工程上测出来的商用优秀区间。超过它不是不能做,是要接受画质和一致性的下降。
做宽幅广告、长卷轴漫剧的团队,外扩是个省时间的功能——不用重新构图,在已有好画面上延伸就行。但别把它当无限用,画布真到了 10K 以上,重新生成比硬扩更靠谱。
本作品采用《CC 协议》,转载必须注明作者和本文链接
关于 LearnKu