JarvisHub:面向画布原生多模态创意智能体的开放框架
JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
摘要
创意人工智能正从单步资产生成迈向长周期多模态制作。尽管当前生成模型能够合成高质量的图像、视频、音频片段、UI元素、故事板、幻灯片及其他创意资产,但现实中的创意工作远不止孤立的提示-输出交互。它涉及参考素材、草稿、备选方案、编辑、失败尝试、版本关系、工具操作、评估信号以及人类反馈,这些共同构成了一个不断演化的项目状态。现有的基于提示、聊天和节点的生成系统仅部分支持这种状态,因为它们常常丢弃中间上下文、依赖线性对话或需要手动指定工作流。近期商业系统显示出向智能体辅助创意生产转变的趋势,但其封闭架构使得研究智能体如何表示上下文、选择工具、修改作品、从失败中恢复以及长期保持一致性变得困难。为填补这一空白,我们提出JarvisHub——一个面向长周期多模态创作的画布原生创意智能体框架。JarvisHub将可编辑画布视为用户工作空间、智能体的外部记忆、动作空间和共享项目状态,将多模态作品、依赖关系、版本和反馈表示为带类型的画布节点与链接。通过画布状态、协议桥接和智能体运行时三层架构,JarvisHub使智能体能够在可检查、可编辑的创意状态中行动。这一设计将创意智能体从孤立的工具使用推向可持续、可人工引导的创意自动化——智能体能够逐步规划、生成、修订和组织多模态项目,同时用户在整个过程中保持可检查、可引导、可干预的能力。
译自 Hugging Face · Daily Papers · arXiv:2607.23588 · 录于 二〇二六年七月二十八日