视频生成领域的大模型排名
个人娱乐分析。
2026年视频生成领域的大模型排名
视频生成(Text-to-Video)目前最权威、客观的排名来自 Artificial Analysis 的盲测Arena(Elo评分系统,用户在相同提示下盲选生成视频优劣,无厂商偏见)。另一个盲测平台 llm-stats.com 也提供了类似数据,两者趋势高度一致:以运动物理、真实感和时序一致性为核心。
1. 顶级排名(Text-to-Video with Audio,Elo最高)
| 排名 | 模型名称 | 开发者 | Elo评分 | 最新发布 | 备注(API定价示例,约1分钟1080p) |
|---|---|---|---|---|---|
| 1 | Gemini Omni Flash | 1240 | 2026.5 | $6.00 /min(高速/免费额度多) | |
| 2 | Dreamina Seedance 2.0 720p | ByteDance | 1225 | 2026.3 | 多图像/多片段/原生音频强 |
| 3 | Wan2.7-260612 | Alibaba | 1159 | 2026.6 | 高速、低成本 |
| 4 | HappyHorse-1.1 | Alibaba-ATH | 1150 | 2026.6 | 原生音频+唇同步优秀 |
| 5 | HappyHorse-1.0 | Alibaba-ATH | 1127 | 2026.4 | 画质最纯净的开源级选项 |
(注:无音频榜单中,HappyHorse-1.0 常年领先,Gemini Omni Flash 仍居首。)
2. 其他重要模型(部分榜单视角)
- Kling 3.0(快手可灵):物理运动、镜头控制极强,性价比高,常获“最真实运动”评价。部分盲测平台(如llm-stats)位居整体第一。
- Veo 3.1(Google):结构化精度、原生音频、电影感强。免费额度充足(Gemini/Google One用户可试),被许多评测评为“最安全选择”。
- Runway Gen-4.5 / Gen-4:专业创作者首选,编辑控制(相机、运动模糊、风格迁移)全球顶尖。
- Luma Ray 3 / Dream Machine:自然运动、图像-to-video强。
- Grok Imagine Video / Sora 2(xAI/OpenAI):Sora 2 仍是质量标杆(物理、故事感),但访问和Sora 1 时代相比受限;Grok Imagine Video 性价比和速度突出。
- 开源/本地权值:LTX-2.3系列(Lightricks)、Wan 2.7 等,价格最低(每秒几美分),适合开发者自托管。
选择建议(2026年7月视角)
- 追求最高质量/电影感:Gemini Omni Flash 或 Seedance 2.0(多参考图像+音频全能)。
- 物理/动作/广告级真实:Kling 3.0 或 HappyHorse。
- 专业后期/控制:Runway Gen-4.5。
- 预算有限 / 快速迭代:LTX-2 Fast 或 Wan 2.7(开源权值)。
- 免费起步:Veo 3.1(Google AI Studio)、部分 Kling/Seedance 免费额度、Grok Imagine。
注意:排名会随新模型发布快速变化(目前变化极快,每月都有新版本)。实际效果还取决于提示词、图像参考、时长(多数5-10秒,可拼接长视频)和分辨率。建议直接在平台试用(Artificial Analysis Arena、llm-stats playground、或官方站点)对比同一提示的输出。
需要特定模型的详细对比、API访问链接或最新盲测视频样本?随时告诉我,我可以帮你进一步查询!
本作品采用《CC 协议》,转载必须注明作者和本文链接
关于 LearnKu