Apple · ML Research

通过高级模态条件与交互驯服文生音视频

Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction

二〇二六年七月八日 · 英文原文

本研究聚焦文本到有声视频(T2SV)生成任务,提出一种新方法以解决文本条件瓶颈与跨模态融合问题。针对共享描述(TV=TA)引发的模态干扰及训练-推理描述差异,设计解耦条件机制;针对特征交互融合不明确,提出自适应融合模块。实验在多个benchmark上验证,生成视频的音频同步性与文本对齐度均优于现有SOTA方法。

本研究聚焦于文本到有声视频(Text-to-Sounding-Video, T2SV)生成任务,旨在根据文本生成带有同步音频的视频,并使两种模态与文本条件对齐。尽管联合音视频训练已取得进展,但仍存在两个关键挑战:(1)文本条件成为瓶颈——共享描述(TV=TA)会引发模态干扰,同时密集训练描述与简洁推理用户提示之间存在差距;(2)跨模态特征交互的最优融合机制尚不明确。为应对第一个挑战,我们首先提出……

译自 Apple · ML Research · 录于 二〇二六年七月八日