Apple · ML Research

VideoFlexTok:灵活长度的粗到细视频分词

VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization

二〇二六年七月三日 · 英文原文

视觉分词器将高维像素映射为压缩表示,供下游建模使用。当前视频分词的标准方法是将视频表示为时空三维token网格,每个token捕捉局部信息。这迫使下游模型(如文本到视频模型)必须“逐像素”预测所有低级细节,无论视频复杂度如何,导致计算冗余。

视觉分词器将高维原始像素映射为压缩表示,供下游建模使用。除了压缩之外,分词器还决定了哪些信息被保留以及如何组织这些信息。视频分词的事实标准方法是将视频表示为时空三维 token 网格,每个 token 捕捉原始信号中对应的局部信息。这就要求消费这些 token 的下游模型(例如文本到视频模型)必须学会“逐像素”预测所有低级细节,而无论视频本身的复杂程度如何,从而导致……

译自 Apple · ML Research · 录于 二〇二六年七月三日