Apple · ML Research

STARFlow2:弥合语言模型与归一化流,实现统一多模态生成

STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation

二〇二六年八月二十六日 · 英文原文

统一多模态模型在理解、推理及生成交错文本-图像序列时存在结构碎片化问题:现有方法或通过离散tokenization牺牲视觉保真度,或结合因果文本生成与迭代扩散去噪造成结构不对称,或在适配生成任务时削弱预训练理解能力。研究观察到,自回归归一化流本质上是自回归Transformer,与LLM共享因果掩码、KV-cache机制及从左到右结构,使其成为统一架构的候选方案。

统一多模态模型在理解、推理及生成交错文本-图像序列方面仍存在结构上的碎片化问题:现有方法要么通过离散tokenization牺牲视觉保真度,要么通过结合因果文本生成与基于迭代扩散的去噪过程造成结构不对称,要么在将视觉-语言模型适配于生成任务时削弱预训练的理解能力。我们观察到,自回归归一化流本质上是自回归Transformer——它们与LLM共享相同的因果掩码、KV-cache机制及从左到右的结构——这使得它们成为最…

译自 Apple · ML Research · 录于 二〇二六年八月二十六日