InterleaveThinker:强化代理交错生成
InterleaveThinker: Reinforcing Agentic Interleaved Generation
近期图像生成器在单图生成与编辑任务中展现出惊人的照片级真实感与指令遵循能力。然而受限于其架构设计,它们无法实现交错式生成(文本-图像序列),而这一能力在视觉叙事、引导式交互及具身操作中具有关键应用。即便是最新的开源统一多模态模型(UMMs)在此方面表现也相当有限。本文提出InterleaveThinker——首个旨在赋予任意现有图像生成器交错生成能力的多智能体流水线。具体而言,我们采用规划器智能体(planner agent)组织图像-文本输入序列,向图像生成器指示每一步所需执行的操作。随后引入评判器智能体(critic agent)评估生成器输出,识别偏离规划指令的样本,并优化指令以重新生成。为实现该流水线,我们构建了Interleave-Planner-SFT-80k与Interleave-Critic-SFT-112k数据集进行格式冷启动,进而开发Interleave-Critic-RL-13k,利用GRPO强化生成轨迹中逐步指令修正能力。由于单条交错生成轨迹可能涉及超过25次生成器调用,优化整条轨迹在计算上不可行,因此我们提出准确率奖励(accuracy reward)与逐步奖励(step-wise reward),使单步强化学习能有效引导整条生成轨迹。实验结果表明,InterleaveThinker能提升多种图像生成器的性能。在交错生成基准测试中,其表现可媲美Nano Banana与GPT-5。令人意外的是,该模型在基于推理的基准测试中也显著增强了基础模型性能——例如在4步FLUX.2-klein上,我们在WISE与RISE指标上观察到大幅提升。