TimeLens2: 基于多模态LLM的通用视频时间定位
TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
来自 Multimedia Computing Group-Nanjing University
摘要
视频多模态大语言模型(MLLM)能够描述视频中发生的事件,但很少能指出支撑证据出现的时间位置。我们研究通用型视频时间定位任务,即单个模型需跨视频长度、领域、查询形式和视角,预测一组基数可变的证据区间。现有训练策略与该集合值任务存在错位:长视频标注常依赖脆弱的单次标注流程,而强化学习奖励要么无法区分无重叠预测,要么需要脆弱的片段匹配。TimeLens2 在整个监督和优化过程中将时间证据视为区间集合。TimeLens2-93K 通过字幕派生提案、独立定位、跨智能体共识、语义验证和边界细化,构建了可靠的多跨度监督。我们的时间 Wasserstein 奖励在合并区间支撑上的均匀分布之间计算精确的一维 (W_1),提供密集、无需匹配的反馈,可处理不等基数和等价碎片化情况;时间 IoU 则通过精确重叠反馈进行补充。在七个基准测试中,TimeLens2-2B 在每个基准上都优于所有同等规模的基线模型,而 4B 和 8B 变体达到了最先进性能,超越了参数规模高达 397B 的开源模型。2B、4B 和 8B 变体分别在其 Qwen3-VL 骨干网络上提升了 14.2、13.0 和 18.1 个 mIoU 点。
译自 Hugging Face · Daily Papers · arXiv:2607.17423 · 录于 二〇二六年七月二十一日