基于校准稀疏注意力加速文本到视频生成
Accelerating Text-to-Video Generation with Calibrated Sparse Attention
摘要
近期研究发现,扩散模型(diffusion models)在视频生成中因采用基于Transformer的大规模骨干网络和时空注意力(spatiotemporal attention)机制而运行缓慢。作者观察到,大量token间连接产生可忽略的注意力分数,且模式在不同查询(query)间重复,局部token块间也存在类似现象。基于此,提出通过跳过这些冗余计算来加速推理,而对生成质量影响极小。
近期扩散模型(diffusion models)实现了高质量视频生成,但存在运行速度慢的问题。这些模型中使用的基于Transformer(变换器)的大规模骨干网络受限于时空注意力(spatiotemporal attention)机制。本文发现,在各类输入中,有相当一部分token间连接始终产生可忽略的分数,且其模式在不同查询(query)间往往重复出现。因此,这些情况下的注意力计算可以跳过,而对结果几乎不产生影响。这一观察同样适用于局部token块之间的连接。基于此,我们……
译自 Apple · ML Research · 录于 二〇二六年七月二十二日