JoyAI-VL-Interaction:实时视觉-语言交互智能
JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence
现实世界中的许多时刻并不会等待用户主动提问。安全监控画面中燃起火焰,视频通话中闪过一个表情,或直播中观众心仪的商品转瞬即逝。然而,当前的大模型在设计上大多仍以轮次对话为基础:它们只在被召唤时才会回应,即便是看似具备交互性的视频通话应用,本质上仍是问答系统,仅在轮询或提示时才会作出反应。我们主张一种不同的范式:一个像人一样存在于世界中的模型。它持续观察当下正在发生的事,自行决定是开口说话还是保持沉默,实时进行交互,并在遇到难题时委托给后台模型处理。为了推动交互模型的发展及其在各领域的应用,我们做出了两项完全开源贡献。首先,我们发布了 JoyAI-VL-Interaction,一个 8B 规模、视觉优先的 VL 交互模型。该模型在内部做出响应决策,每秒选择保持沉默、回应或委托给后台模型,并在视觉触发的响应能力和时间感知方面表现出色。我们为其配套提供了一套可迁移的训练方案,从中涌现出我们从未专门训练过的能力,例如引导购物者切换应用界面,或根据幻灯片即兴授课。其次,我们发布了一个围绕该模型构建的完整、可部署系统。该系统将任何实时视频流输入模型,使其真正存在于世界之中。所有其他组件均为可插拔设计,包括 ASR/TTS 模块、记忆模块、可视化用户界面,以及可连接任何 API 或智能体的后台大脑。在六个真实场景中,人类评估者以显著优势偏好 JoyAI-VL-Interaction,而非豆包和 Gemini 的应用程序内视频通话助手。据我们所知,这是首个与训练方案、数据及完整可部署系统一同发布的开源、视觉驱动的交互模型。