激励自我中心视频理解模型的时间感知能力
Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
摘要
多模态大语言模型(MLLMs)在自我中心场景中因训练目标缺乏时间推理奖励而表现不足。为此,研究者提出时间全局策略优化(TGPO),一种基于可验证奖励的强化学习(RLVR)算法,旨在激励模型对事件顺序与演变的正确推理,提升时间感知能力。
多模态大语言模型(MLLMs)近期在视觉理解方面展现出强劲性能,但在自我中心场景中往往缺乏时间感知能力,尤其是在推理依赖于事件正确顺序与演变过程时。这一缺陷部分源于训练目标未能明确奖励时间推理,而是依赖帧级空间捷径。为解决这一局限,我们提出时间全局策略优化(TGPO),这是一种基于可验证奖励的强化学习(RLVR)算法,旨在激励时间……
译自 Apple · ML Research · 录于 二〇二六年七月十日