Apple · ML Research

给我看示例:从图像集中推断视觉概念

Show Me Examples: Inferring Visual Concepts from Image Sets

二〇二六年七月十八日 · 英文原文

提出集合视觉概念推理(VICIS)任务,用于评估视觉-语言模型(VLM)从少量示例图像中推断共享概念并应用于新输入的能力。任务要求模型根据包含共享概念的图像上下文集与查询图像,生成保留该概念且与查询一致的新图像。实验显示,当前最先进的VLM在此任务上表现不佳。

视觉-语言模型(Vision-Language Models,VLMs)能够遵循复杂的文本指令,但在仅凭视觉上下文进行推理时仍存在困难。具体而言,当前模型无法从一组示例图像中推断出共享概念,并将其应用于新的输入。我们提出了集合视觉概念推理(Visual Concept Inference from Sets,VICIS)任务,用于评估这一能力。给定一个包含共享概念的少量图像上下文集和一张查询图像,模型必须生成新的图像,这些图像既要保留上下文定义的概念,又要与查询图像保持一致。实验表明,最先进的视觉-语言模型在此任务上表现不佳……

译自 Apple · ML Research · 录于 二〇二六年七月十八日