LVSum:时间戳感知长视频摘要基准
LVSum: A Benchmark for Timestamp-Aware Long Video Summarization
摘要
LVSum是一个人工标注的基准,用于评估多模态大语言模型(MLLMs)在长视频摘要中的时间对齐能力。该基准包含72个覆盖13个领域的视频,平均时长16分钟,每个视频配有最多10条包含时间引用的人工生成摘要。研究通过全面评估测试模型在长时间跨度内保持时间准确性和生成语义、时间双重依据摘要的能力。
长视频摘要对多模态大语言模型(MLLMs)提出了重大挑战,尤其是在长时间跨度内保持时间准确性,以及生成既在语义上又在时间上有所依据的摘要。我们提出了 LVSum,这是一个人工标注的基准,用于评估具有细粒度时间对齐的长视频摘要。LVSum 包含 72 个涵盖 13 个领域的多样化视频,平均时长 16 分钟,每个视频配有最多 10 条包含时间引用的人工生成摘要。我们进行了全面的评估……
译自 Apple · ML Research · 录于 二〇二六年七月二十一日