Kwai Keye-VL-2.0 技术报告
Kwai Keye-VL-2.0 Technical Report
来自 Kwai Keye
摘要
我们推出 Kwai Keye-VL-2.0-30B-A3B,这是一个开源的混合专家(MoE)多模态基础模型,旨在推动长视频理解与智能体(agent)能力的发展。针对小时级视频中存在的超长上下文、信息冗余以及高昂计算成本等挑战,Keye-VL-2.0 首次将 DeepSeek 稀疏注意力(DSA)适配到基于 GQA 的多模态架构中,在捕捉关键帧与长程时序依赖的同时,实现了无损的 256K 上下文处理。该架构依托高度优化的训练与推理基础设施,包括可扩展的视频 I/O、异构 ViT-LM 并行以及定制的 DSA 内核,显著提升了吞吐量并降低了计算开销。此外,为克服多任务对齐过程中灾难性遗忘的算法难题,我们引入了跨模态多教师在线策略蒸馏(MOPD),并结合 Context-RL 与 Video-RL。通过将在线策略 rollout 产生的密集 token 级教师反馈蒸馏回仅激活 3B 参数的 MoE 骨干网络,Keye-VL-2.0 原生支持代码、工具与搜索场景下的高级智能体协作,并具备多模态自我纠错能力。在视频理解、时间定位、推理、STEM 及智能体基准上的广泛评估表明,Keye-VL-2.0-30B-A3B 在同等规模模型中达到了最先进水平,尤其在 TimeLens 上的细粒度时间定位、Video-MME-v2 与 LongVideoBench 上的长视频理解任务中表现突出。我们已发布模型检查点,以加速社区向可扩展且鲁棒的多模态智能体应用迈进。
译自 Hugging Face · Daily Papers · arXiv:2606.10651 · 录于 二〇二六年六月十日