VideoChat3:面向高效通用视频理解的全开源视频MLLM
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
来自 Multimedia Computing Group-Nanjing University
摘要
近期视频理解领域的进展已涵盖运动、长视频和流式交互,推动该领域向实际应用迈进。尽管取得这些进步,当前开源模型仍存在若干局限:它们往往难以泛化至多样化的视频类型,仅在特定领域有效;高计算需求进一步限制了其效率与可扩展性;此外,多数模型仅部分开源,训练代码、策略或数据集等关键组件缺失,阻碍了可复现性与社区驱动的发展。为解决这些问题,我们提出VideoChat3——一个完全开源、高效且通用的视频中心多模态大语言模型(MLLM)。VideoChat3通过两种互补设计推进视频理解:在效率方面,我们引入膨胀3D视觉Transformer(I3D-ViT)与自适应帧分辨率流式视频感知技术,实现高效的时空表征,并降低训练与推理阶段处理视频输入的成本;在效果方面,我们开发了可扩展的视频数据合成流水线,构建三个多样化、高质量的训练数据集——VideoChat3-Academic2M、VideoChat3-LV116K与VideoChat3-OL617K,覆盖通用、长视频与流式视频场景,提升模型跨领域的泛化能力。通过整合这些设计,VideoChat3实现了广泛泛化与计算效率的罕见平衡。在通用、长视频与流式基准测试上的实验表明,VideoChat3仅以4B参数和更高效率,便超越了参数规模相当或更大的现有开源模型。
译自 Hugging Face · Daily Papers · arXiv:2607.14935 · 录于 二〇二六年七月十七日