Apple · ML Research

一层足矣:适配预训练视觉编码器用于图像生成

One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation

二〇二六年七月十六日 · 英文原文

视觉生成模型(如扩散模型)在压缩潜在空间中运行以平衡效率与质量。研究者尝试利用预训练视觉表征(如通过VAE内部或生成模型中对齐),但理解导向特征与生成友好潜在空间存在根本性不匹配。表征编码器依赖高维潜在变量捕捉多样化假设,适配仍具挑战。

视觉生成模型(如扩散模型)通常在压缩的潜在空间中运行,以平衡训练效率与样本质量。与此同时,利用高质量预训练视觉表征的兴趣日益增长——无论是通过在VAE内部对齐,还是直接在生成模型中对齐。然而,由于理解导向的特征与生成友好的潜在空间之间存在根本性不匹配,适配此类表征仍然具有挑战性。表征编码器受益于高维潜在变量,这些变量能够捕捉多样化的假设,以……

译自 Apple · ML Research · 录于 二〇二六年七月十六日