NVIDIA把视频生成打到了地板价!单GPU 13秒出720p,比Wan 2.2快120倍
做AI视频的朋友,一定被"算力焦虑"折磨过。跑一段10秒的720p视频,一张H100烧掉好几分钟。想商用?成本比雇个剪辑师还贵。
7月23日,NVIDIA在arXiv上放出了SANA-Video 2.0,答案来了。
⚡ 13秒,一张H100,720p
这是最硬核的数字。5B参数规模下,端到端管线跑720p/5秒视频只需13.06秒。同一张卡上Wan 2.2-A14B要跑26分钟——120倍的差距。
两个版本:5B适合单卡部署,14B(40层/4096宽度)在384张B200上训练。5B在VBench拿到84.30分,与全softmax顶级模型质量在同一水平线。
🔬 核心秘密:75%廉价注意力 + 25%锚点
传统视频扩散模型用softmax attention,计算量随视频帧数呈平方增长。纯线性注意力虽然O(N)复杂度,但表达能力不够。
SANA-Video 2.0的做法是混合注意力(Hybrid Linear-Softmax Attention):
• 75%层用门控线性注意力(快车道)
• 每4层插一个softmax"锚点"恢复全秩交互
• 块注意力残差把已完成块摘要路由到后面,深层有效秩提升12%
大部分计算走快车道,隔几站进一次服务区全量检查,不迷路还飞快。
🛠️ Sol-Engine:三层优化榨干硬件
NVIDIA自家推理栈再加速3.58倍:
• 核融合+执行优化:62.65s → 30.74s
• 残差复用(跳33/50步):30.74s → 20.89s
• 稀疏注意力:20.89s → 13.06s
单张H100搞定,GitHub已开源(github.com/NVlabs/Sana)。
💰 对行业意味着什么?
1️⃣ 视频生成真正进入单卡可用时代——不用组集群
2️⃣ 长视频不再是禁区——线性注意力让延迟不随时长暴涨
3️⃣ 交互式视频生成成为可能——打字几秒后出结果
4️⃣ Wan 2.2为代表的旧架构面临架构级挑战——120倍差距不是小修小补能追的
当然它也有局限:14B画质细节与顶级离线模型还有差距,高运动场景有待验证。但这些是"好"的问题——速度已经让一大票应用场景从"不可行"变成了"可以考虑"。
你现在的视频生成一张卡要等多久?SANA-Video 2.0开源了,测过了吗?评论区聊聊实测体验 👇


