SemComp-Bench:视频生成中语义任务完成基准测试
SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation
来自 FrameX-AI
摘要
我们提出语义任务完成视频生成(Semantic Task Completion Video Generation),这是一种以结果为导向的视频生成任务。在该设定下,成功既要求实现预期结果,也要求具备语义接地(semantic grounding)。语义接地刻画了参考图像与生成结果之间在任务相关高层语义上的对应关系。评估聚焦于生成结果,既不需要呈现完整的中间任务步骤序列,也不要求与参考图像保持传统的外观一致性。为支持系统性评估,我们构建了SemComp-Data,一个覆盖六个领域的评估数据集。每个实例包含一张参考图像、一条详细指令、一条简短指令以及一段以结果为中心的视频片段。一个可扩展的四阶段整理流程将原始视频转换为标准化的SemComp-Data实例。我们进一步引入SemComp-Bench,一种评估协议,使用视觉语言模型(VLM)回答结构化二元问题。SemComp-Bench分别报告OA分数(结果达成)和GR分数(生成可靠性)。对代表性视频生成模型的实验表明,在实现预期结果的同时保持参考图像中任务相关语义接地仍具挑战性。
译自 Hugging Face · Daily Papers · arXiv:2608.17426 · 录于 二〇二六年八月二十日