多标签图像识别是一个基本又实用的任务,因为真实世界的图像固有地拥有多个语义标签。然而,由于输入图像和输出标签空间的复杂性,难以收集大规模的多标签注释。为了降低注释成本,我们提出了一种结构化语义传输(SST)框架,使得能够培训具有部分标签的多标签识别模型,即,仅在每个图像中丢失其他标签(也称为未知标签)。该框架由两个互补传输模块组成,探索图像内和交叉图像语义相关性,以传输已知标签的知识,以为未知标签生成伪标签。具体地,一个图像内语义传输模块学习特定于图像的标签共出矩阵,并将已知的标签映射到基于该矩阵的补充未知标签。同时,交叉图像传输模块学习特定于类别的特征相似性,并帮助您具有高相似之处的补充未知标签。最后,已知和生成的标签都用于训练多标签识别模型。对Microsoft Coco,Visual Genome和Pascal VOC数据集的广泛实验表明,所提出的SST框架在当前最先进的算法上获得了卓越的性能。代码可用于\ url {https:/github.com/hcplab-sysu/sst-ml -pl
translated by 谷歌翻译
为了解决不同面部表情识别(FER)数据集之间的数据不一致的问题,近年来许多跨域FER方法(CD-FERS)已被广泛设计。虽然每个声明要实现卓越的性能,但由于源/目标数据集和特征提取器的不一致选择,缺乏公平的比较。在这项工作中,我们首先分析了这些不一致的选择造成的性能效果,然后重新实施了一些良好的CD-FER和最近发布的域适应算法。我们确保所有这些算法采用相同的源数据集和特征提取器,以便进行公平CD-FER评估。我们发现大多数主要的领先算法使用对抗性学习来学习整体域的不变功能来缓解域移位。然而,这些算法忽略了局部特征,这些功能在不同的数据集中更可转换,并为细粒度适应提供更详细的内容。为了解决这些问题,我们通过开发新的对抗图表示适应(AGRA)框架,将图形表示传播与对抗域整体局部特征共同适应的对抗。具体地,它首先构建两个图形,以分别在每个域内和跨不同的域内相关的全部和局部区域。然后,它从输入图像中提取整体本地特征,并使用可学习的每类统计分布来初始化相应的图形节点。最后,采用两个堆叠的图形卷积网络(GCNS)在每个域内传播全部本地功能,以探索它们的交互和整体域的不同域,用于全部局部功能共同适应。我们对几个流行的基准进行了广泛和公平的评估,并表明建议的AGRA框架优于以前的最先进的方法。
translated by 谷歌翻译
The task of multi-label image recognition is to predict a set of object labels that present in an image. As objects normally co-occur in an image, it is desirable to model the label dependencies to improve the recognition performance. To capture and explore such important dependencies, we propose a multi-label classification model based on Graph Convolutional Network (GCN). The model builds a directed graph over the object labels, where each node (label) is represented by word embeddings of a label, and GCN is learned to map this label graph into a set of inter-dependent object classifiers. These classifiers are applied to the image descriptors extracted by another sub-net, enabling the whole network to be end-to-end trainable. Furthermore, we propose a novel re-weighted scheme to create an effective label correlation matrix to guide information propagation among the nodes in GCN. Experiments on two multi-label image recognition datasets show that our approach obviously outperforms other existing state-of-the-art methods. In addition, visualization analyses reveal that the classifiers learned by our model maintain meaningful semantic topology.
translated by 谷歌翻译
对比度学习(CL)在任何监督的多级分类或无监督的学习中显示出令人印象深刻的图像表示学习进步。但是,这些CL方法无法直接适应多标签图像分类,因为难以定义正面和负面实例以对比多标签场景中给定的锚图像对比给定的锚图像,让标签单独丢失,这意味着借用了借用的标签通常,从对比度多级学习来定义它们的常用方式将产生许多不利的虚假负面实例。在本文中,通过引入标签校正机制来识别缺失的标签,我们首先优雅地产生了锚映像的单个语义标签的阳性和负面因素,然后定义了带有缺少标签的多标签图像分类的独特对比度损失(CLML) ),损失能够准确地使图像接近其真实的正面图像和虚假的负面图像,远离其真实的负面图像。与现有的多标签CL损失不同,CLML还保留了潜在表示空间中的低排名全球和局部标签依赖关系,在这些空间中,已证明此类依赖性有助于处理缺失的标签。据我们所知,这是在缺失标签方案中的第一个一般多标签CL损失,因此可以通过单个超参数与任何现有多标签学习方法的损失无缝配对。已提出的策略已被证明可以在三个标准数据集(MSCOCO,VOC和NUS范围内)提高RESNET101模型的分类性能,分别为1.2%,1.6%和1.3%。代码可在https://github.com/chuangua/contrastivelossmlml上找到。
translated by 谷歌翻译
在低标签制度中,解决图像的多标签识别(MLR)是许多现实世界应用的一项艰巨任务。最近的工作学会了文本和视觉空间之间的一致性,以补偿图像标签不足,但由于可用的MLR注释量有限,因此失去了准确性。在这项工作中,我们利用数百万辅助图像文本对预测的文本和视觉特征的牢固对齐,并提出双背景优化(dualCoop)作为部分标签MLR和零发射MLR的统一框架。 DualCoop用类名来编码正面和负面的上下文,作为语言输入的一部分(即提示)。由于DualCoop仅在验证的视觉语言框架上引入了非常轻松的开销,因此它可以迅速适应具有有限的注释甚至看不见的类别的多标签识别任务。对两个挑战性低标签设置的标准多标签识别基准测试的实验证明了我们方法比最新方法的优势。
translated by 谷歌翻译
Although various methods have been proposed for multi-label classification, most approaches still follow the feature learning mechanism of the single-label (multi-class) classification, namely, learning a shared image feature to classify multiple labels. However, we find this One-shared-Feature-for-Multiple-Labels (OFML) mechanism is not conducive to learning discriminative label features and makes the model non-robustness. For the first time, we mathematically prove that the inferiority of the OFML mechanism is that the optimal learned image feature cannot maintain high similarities with multiple classifiers simultaneously in the context of minimizing cross-entropy loss. To address the limitations of the OFML mechanism, we introduce the One-specific-Feature-for-One-Label (OFOL) mechanism and propose a novel disentangled label feature learning (DLFL) framework to learn a disentangled representation for each label. The specificity of the framework lies in a feature disentangle module, which contains learnable semantic queries and a Semantic Spatial Cross-Attention (SSCA) module. Specifically, learnable semantic queries maintain semantic consistency between different images of the same label. The SSCA module localizes the label-related spatial regions and aggregates located region features into the corresponding label feature to achieve feature disentanglement. We achieve state-of-the-art performance on eight datasets of three tasks, \ie, multi-label classification, pedestrian attribute recognition, and continual multi-label learning.
translated by 谷歌翻译
在本文中,我们研究了部分多标签(PML)图像分类问题,其中每个图像都用候选标签集注释,由多个相关标签和其他嘈杂标签组成。现有的PML方法通常会设计一种歧义策略来通过利用具有额外假设的先验知识来滤除嘈杂的标签,但不幸的是,这在许多实际任务中都无法使用。此外,由于歧义的目标函数通常是在整个训练集中精心设计的,因此在小型批次上使用SGD的深层模型中几乎无法优化它。在本文中,我们第一次提出了一个深层模型,以增强表示能力和歧视能力。一方面,我们提出了一种新型的基于课程的放弃策略,以通过融合不同类别的各种困难来逐步识别地面真相标签。另一方面,引入了一个一致性正规化,以供模型重新培训,以平衡拟合的易于标签并利用潜在的相关标签。对常用基准数据集的广泛实验结果表明,所提出的方法显着优于SOTA方法。
translated by 谷歌翻译
仅使用图像级标签的弱监督语义细分旨在降低分割任务的注释成本。现有方法通常利用类激活图(CAM)来定位伪标签生成的对象区域。但是,凸轮只能发现对象的最歧视部分,从而导致下像素级伪标签。为了解决这个问题,我们提出了一个限制的显着性和内类关系的显着性(I $^2 $ CRC)框架,以协助CAM中激活的对象区域的扩展。具体而言,我们提出了一个显着性指导的类不足的距离模块,以通过将特征对准其类原型来更接近类别内特征。此外,我们提出了一个特定的距离模块,以将类间特征推开,并鼓励对象区域的激活高于背景。除了加强分类网络激活CAM中更多积分对象区域的能力外,我们还引入了一个对象引导的标签细化模块,以完全利用分割预测和初始标签,以获取出色的伪标签。 Pascal VOC 2012和可可数据集的广泛实验很好地证明了I $^2 $ CRC的有效性,而不是其他最先进的对应物。源代码,模型和数据已在\ url {https://github.com/nust-machine-intelligence-laboratory/i2crc}提供。
translated by 谷歌翻译
零拍摄对象检测(ZSD),将传统检测模型扩展到检测来自Unseen类别的对象的任务,已成为计算机视觉中的新挑战。大多数现有方法通过严格的映射传输策略来解决ZSD任务,这可能导致次优ZSD结果:1)这些模型的学习过程忽略了可用的看不见的类信息,因此可以轻松地偏向所看到的类别; 2)原始视觉特征空间并不合适,缺乏歧视信息。为解决这些问题,我们开发了一种用于ZSD的新型语义引导的对比网络,命名为Contrastzsd,一种检测框架首先将对比学习机制带入零拍摄检测的领域。特别地,对比度包括两个语义导向的对比学学习子网,其分别与区域类别和区域区域对之间形成对比。成对对比度任务利用从地面真理标签和预定义的类相似性分布派生的附加监督信号。在那些明确的语义监督的指导下,模型可以了解更多关于看不见的类别的知识,以避免看到概念的偏见问题,同时优化视觉功能的数据结构,以更好地辨别更好的视觉语义对齐。广泛的实验是在ZSD,即Pascal VOC和MS Coco的两个流行基准上进行的。结果表明,我们的方法优于ZSD和广义ZSD任务的先前最先进的。
translated by 谷歌翻译
多标签图像分类旨在预测图像中的所有可能标签。考虑到在每个培训图像中注释所有标签可能是昂贵的,通常将其作为部分标签的学习问题。关于部分标签学习的现有作品集中在每个训练图像只有其标签的子集注释的情况下。一种特殊情况是在每个训练图像中仅注释一个正标签。为了进一步减轻注释负担并增强了分类器的性能,本文提出了一个新的部分标签设置,其中仅标记了训练图像的一个子集,每个图像只有一个正面标签,而其余的培训图像仍保留未标记。为了处理这个新设置,我们建议一个端到端的深层网络PLMCL(部分标签动量课程学习),可以学会为部分标记和未标记的培训图像生成自信的伪标签。基于动量的新法律通过考虑更新伪标签的速度,更新每个训练图像上的软伪标签,这些标签的更新有助于避免捕获到低信心的本地最低限度,尤其是在培训的早期阶段,由于缺乏观察到的标签和培训的早期阶段对伪标签的信心。此外,我们还提出了一个信心的调度程序,以适应性地对不同标签进行易于锻炼的学习。广泛的实验表明,我们提出的PLMCL在三个不同数据集上的各个部分标签设置下优于许多最先进的多标签分类方法。
translated by 谷歌翻译
在缺少标签(MLML)的情况下,多标签学习是一个具有挑战性的问题。现有方法主要关注网络结构或培训方案的设计,这提高了实现的复杂性。这项工作旨在满足MLML中的损失函数的潜力,而不增加程序和复杂性。为此,我们通过鲁棒损失设计提出了两种简单但有效的方法,基于观察到模型可以在高精度训练期间识别丢失的标签。首先是对底层的良好损失,即山损,重量底部以山的形状重量否定,以减轻虚假底片的效果。第二个是自定步损耗校正(SPLC)方法,其利用缺失标签的近似分布下的最大似然标准导出的丢失。在各种多标签图像分类数据集上的综合实验表明,我们的方法可以显着提高MLML的性能,并在MLML中实现新的最先进的损失函数。
translated by 谷歌翻译
弱监督的多标签分类(WSML)任务是使用每个图像的部分观察标签学习多标签分类,由于其巨大的注释成本,它变得越来越重要。在这项工作中,我们首先将未观察到的标签视为负标签,将WSML任务投入到嘈杂的多标签分类中。从这个角度来看,我们从经验上观察到,在多标签环境中也出现了在嘈杂的多级环境中最初发现的记忆效应。也就是说,该模型首先了解清洁标签的表示,然后开始记住嘈杂的标签。基于这一发现,我们提出了WSML的新方法,该方法拒绝或纠正大型损失样品,以防止模型记住嘈杂的标签。如果没有沉重且复杂的组件,我们提出的方法在几种部分标签设置上的先前最先前的WSML方法(包括Pascal VOC 2012,Coco,MS Coco,Nuswide,Cub,Cub和OpenImimages V3数据集)都优于先前的最先前的WSML方法。各种分析还表明,我们的方法实际上效果很好,证实了在弱监督的多标签分类中正确处理大损失的问题。我们的代码可从https://github.com/snucml/largelossmatters获得。
translated by 谷歌翻译
很少有视觉识别是指从一些标记实例中识别新颖的视觉概念。通过将查询表示形式与类表征进行比较以预测查询实例的类别,许多少数射击的视觉识别方法采用了基于公制的元学习范式。但是,当前基于度量的方法通常平等地对待所有实例,因此通常会获得有偏见的类表示,考虑到并非所有实例在总结了类级表示的实例级表示时都同样重要。例如,某些实例可能包含无代表性的信息,例如过多的背景和无关概念的信息,这使结果偏差。为了解决上述问题,我们提出了一个新型的基于公制的元学习框架,称为实例自适应类别表示网络(ICRL-net),以进行几次视觉识别。具体而言,我们开发了一个自适应实例重新平衡网络,具有在生成班级表示,通过学习和分配自适应权重的不同实例中的自适应权重时,根据其在相应类的支持集中的相对意义来解决偏见的表示问题。此外,我们设计了改进的双线性实例表示,并结合了两个新型的结构损失,即,阶层内实例聚类损失和阶层间表示区分损失,以进一步调节实例重估过程并完善类表示。我们对四个通常采用的几个基准测试:Miniimagenet,Tieredimagenet,Cifar-FS和FC100数据集进行了广泛的实验。与最先进的方法相比,实验结果证明了我们的ICRL-NET的优势。
translated by 谷歌翻译
多标签图像分类是计算机愿景中的基本但具有挑战性的任务。在过去的几十年里,解决方案探索语义标签之间的关系取得了很大进展。然而,标签的潜在空间上下文信息被剥削。为了解决这个问题,提出了一种空间背景感知的深神经网络,以考虑语义和空间信息的考虑标签。在Microsoft Coco和Pascal VOC上评估了这一提议的框架,用于图像多标签的两个广泛使用的基准数据集。结果表明,该方法优于处理多标签图像分类问题的最先进解决方案。
translated by 谷歌翻译
多标签图像分类允许从给定图像预测一组标签。与多类分类不同,每个图像只有一个标签,此类设置适用于更广泛的应用程序。在这项工作中,我们重新审视了多标签分类的两种流行方法:基于变压器的头和标签关系信息信息图处理分支。尽管基于变压器的头被认为比基于图基的分支更好地取得了更好的结果,但我们认为,使用适当的训练策略,基于图形的方法可以证明精确度的较小,同时将计算资源减少到推理上。在我们的训练策略中,我们在角度空间中引入了其修饰作用,而不是非对称损失(ASL)(ASL),而不是非对称损失(ASL)。与二进制跨熵损失相比,它隐含地学习了每个班级单位超球的代理特征向量,从而提供更好的歧视能力。根据提出的损失和训练策略,我们在单个模态方法中获得SOTA结果,以广泛的多标签分类基准,例如MS-Coco,Pascal-Voc,Nus wide和Visual Genome 500。 OpenVino培训扩展https://github.com/openvinotoolkit/deep-object-reid/tree/tree/multilabel
translated by 谷歌翻译
由于难以收集详尽的多标签注释,因此多标签数据集通常包含部分标签。我们考虑了这个弱监督的学习问题的极端,称为单个积极的多标签学习(SPML),其中每个多标签训练图像只有一个正标签。传统上,所有未注释的标签都被认为是SPML中的负标签,它引入了假阴性标签,并导致模型训练被假定的负标签所支配。在这项工作中,我们选择从替代角度来对待所有未经注释的标签,即承认它们是未知的。因此,我们提出熵最大化(EM)损失,以达到提供适当监督信号的特殊梯度制度。此外,我们提出了采用不对称耐受性策略和自定进度程序的不对称伪标记(APL),以与EM损失合作,然后提供更精确的监督。实验表明,我们的方法可显着提高性能,并在所有四个基准测试中实现最先进的结果。代码可从https://github.com/correr-zhou/spml-acktheunknown获得。
translated by 谷歌翻译
多标签少量拍摄图像分类(ML-FSIC)是基于少量训练示例将描述性标签分配给以前的未经看台图像的任务。多标签设置的关键特征是图像通常具有多个标签,该标签通常是指图像的不同区域。当估计原型的基于度量的设置时,重要的是确定哪些区域与哪个标签相关,但训练数据有限使得这一极具挑战性。作为一个解决方案,在本文中,我们建议使用Word Embeddings作为关于标签含义的先前知识的形式。特别地,使用依赖于标签嵌入的关注机制来聚合支持图像的本地特征映射来获得视觉原型。作为一个重要的优势,我们的模型可以在不需要微调任何模型参数的情况下推断出不必要的标签的原型,这证明了其强大的概括能力。 Coco和Pascal VOC的实验还表明,我们的模型大大提高了当前最先进的。
translated by 谷歌翻译
Semi-supervised object detection (SSOD) aims to boost detection performance by leveraging extra unlabeled data. The teacher-student framework has been shown to be promising for SSOD, in which a teacher network generates pseudo-labels for unlabeled data to assist the training of a student network. Since the pseudo-labels are noisy, filtering the pseudo-labels is crucial to exploit the potential of such framework. Unlike existing suboptimal methods, we propose a two-step pseudo-label filtering for the classification and regression heads in a teacher-student framework. For the classification head, OCL (Object-wise Contrastive Learning) regularizes the object representation learning that utilizes unlabeled data to improve pseudo-label filtering by enhancing the discriminativeness of the classification score. This is designed to pull together objects in the same class and push away objects from different classes. For the regression head, we further propose RUPL (Regression-Uncertainty-guided Pseudo-Labeling) to learn the aleatoric uncertainty of object localization for label filtering. By jointly filtering the pseudo-labels for the classification and regression heads, the student network receives better guidance from the teacher network for object detection task. Experimental results on Pascal VOC and MS-COCO datasets demonstrate the superiority of our proposed method with competitive performance compared to existing methods.
translated by 谷歌翻译
几次拍摄的语义分割旨在将新颖的类对象分段为仅具有少数标记的支持图像。大多数高级解决方案利用度量学习框架,通过将每个查询功能与学习的类特定的原型匹配来执行分段。然而,由于特征比较不完整,该框架遭受了偏见的分类。为了解决这个问题,我们通过引入类别特定的和类别不可知的原型来提出自适应原型表示,从而构建与查询功能学习语义对齐的完整样本对。互补特征学习方式有效地丰富了特征比较,并有助于在几次拍摄设置中产生一个非偏见的分段模型。它用双分支端到端网络(\即,特定于类分支和类别不可知分支)实现,它生成原型,然后组合查询特征以执行比较。此外,所提出的类别无神不可话的分支简单而且有效。在实践中,它可以自适应地为查询图像生成多种类别 - 不可知的原型,并以自我对比方式学习特征对齐。广泛的Pascal-5 $ ^ i $和Coco-20 $ ^ i $展示了我们方法的优越性。在不牺牲推理效率的费用中,我们的模型实现了最先进的,导致1-Shot和5-Shot Settings进行语义分割。
translated by 谷歌翻译
大多数现有的语义分割方法都以图像级类标签作为监督,高度依赖于从标准分类网络生成的初始类激活图(CAM)。在本文中,提出了一种新颖的“渐进贴片学习”方法,以改善分类的局部细节提取,从而更好地覆盖整个对象的凸轮,而不仅仅是在常规分类模型中获得的CAM中的最歧视区域。 “补丁学习”将特征映射破坏成贴片,并在最终聚合之前并行独立处理每个本地贴片。这样的机制强迫网络从分散的歧视性本地部分中找到弱信息,从而提高了本地细节的敏感性。 “渐进的补丁学习”进一步将特征破坏和补丁学习扩展到多层粒度。与多阶段优化策略合作,这种“渐进的补丁学习”机制隐式地为模型提供了跨不同位置粒状性的特征提取能力。作为隐式多粒性渐进式融合方法的替代方案,我们还提出了一种明确的方法,以同时将单个模型中不同粒度的特征融合,从而进一步增强了完整对象覆盖的凸轮质量。我们提出的方法在Pascal VOC 2012数据集上取得了出色的性能,例如,测试集中有69.6 $%miou),它超过了大多数现有的弱监督语义细分方法。代码将在此处公开提供,https://github.com/tyroneli/ppl_wsss。
translated by 谷歌翻译