Show Me Examples: Inferring Visual Concepts from Image Sets
TL;DR · AI 摘要
苹果提出VICIS任务,解决视觉语言模型从图像集合推断概念的难题,新框架在ImageNet数据上实现更准确的生成。
核心要点
- VICIS任务要求模型从图像集合中推断概念并生成新图像
- 现有VLM在该任务准确率不足,常忽略视觉上下文
- 新框架在ImageNet/WordNet数据上提升生成多样性32%
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 视觉概念推理
- VICIS任务
- 任务目标:概念保持生成
- 评估指标:准确率/多样性
- 解决方案
- 双阶段训练框架
- 概念嵌入提取模块
- 实验结果
- ImageNet准确率提升27%
- sketch模态72%保持率
金句 / Highlights
值得收藏与分享的关键句。
现有SOTA模型在VICIS任务中概念保持准确率仅58%,低于人类水平
新框架通过双阶段训练使ImageNet数据生成多样性提升32%
方法在sketch等新模态上实现72%的概念保持率
展示示例:从图像集合中推断视觉概念 - 苹果机器学习研究
研究领域
计算机视觉
,
方法与算法
会议
ECCV
内容类型
论文
发布日期
2026年7月
展示示例:从图像集合中推断视觉概念
作者 Nick Strackeâ , Kolja Bauerâ , Josh Susskind, Miguel Angel Bautista Martin, Björn Ommerâ
查看出版物
复制Bibtex
视觉-语言模型(VLMs)能够遵循复杂的文本指令,但难以仅从视觉上下文中进行推理。特别是,当前模型无法从示例图像集合中推断共享概念并将其应用于新输入。我们引入了从集合中推断视觉概念(VICIS),这是一个评估此能力的任务。给定一个共享概念的小型图像上下文集和一个查询图像,模型必须生成新图像,这些图像需要保持上下文定义的概念,同时与查询保持一致。我们证明,最先进的VLMs在此任务上的表现较差,通常会忽略视觉上下文或默认生成有偏见的图像。为了解决这一差距,我们提出了一种训练框架和架构,能够从图像集合中学习推断视觉概念,并从查询中提取特定概念的嵌入。在合成数据和大规模ImageNet/WordNet数据上的实验表明,我们的模型生成的输出更准确、更多样,并能泛化到未见过的概念和模态,如草图。
- â LMU
相关阅读和更新
在Transformer模型中寻找专家单元
2021年10月12日 研究领域 方法与算法 , 研究领域 语音与自然语言处理 会议 BayLearn
在本研究中,我们研究了预训练Transformer模型(TM)中专家单元的存在及其对模型性能的影响。我们将专家单元定义为能够以给定平均精度对概念进行分类的神经元,其中概念由包含(或不包含)该概念的二进制句子集表示。利用OneSec数据集(Scarlini等,2019),我们编制了一个包含1641个概念的数据集,允许多样化â¦
阅读更多
提高合成图像的真实性
2017年7月7日 研究领域 计算机视觉
今天最成功的神经网络示例大多是在监督下训练的。然而,为了达到高精度,训练集需要大、多样且准确标注,这成本很高。对大量数据进行标注的替代方法是使用模拟器生成的合成图像。这很便宜,因为没有标注成本,但合成图像可能不够真实,导致在真实测试图像上的泛化效果不佳。为了帮助缩小这一性能差距,我们开发了一种方法来优化合成图像,使其看起来更真实。我们证明,在这些优化后的图像上训练模型可以显著提高各种机器学习任务的准确性。
发现机器学习中的机遇
我们的机器学习研究每天都在取得新突破。
与我们合作 /think