PhD Thesis

Classification of visual data with unreliable annotations: a real case in the fashion domain

Maria Beatriz Alves de Sousa Quintino Ferreira2021

Key information

Authors:

Maria Beatriz Alves de Sousa Quintino Ferreira (Maria Beatriz Alves de Sousa Quintino Ferreira)

Supervisors:

João Pedro Castilho Pereira Santos Gomes (João Pedro Castilho Pereira Santos Gomes); João Paulo Salgado Arriscado Costeira (João Paulo Salgado Arriscado Costeira)

Published in

June 16, 2021

Abstract

A classificação de imagens é um problema fundamental de visão por computador, tornando-se cada vez mais relevante na nossa sociedade atual orientada para a informação. Apesar do enorme avanço verificado recentemente neste campo devido a técnicas de aprendizagem profunda (deep learning), esta tese identifica dois problemas principais que se encontram ainda por resolver e que são, atualmente, tópicos de investigação bastante ativos: a classificação multi-label de imagens e a classificação na presença de dados ruidosos ou anotações erróneas. O processo de tomada de decisão por parte de um ser humano, por exemplo durante a compra de um produto, depende sobremaneira de descrições completas, ricas e exatas, descrições estas que implicam, necessariamente, processos de recuperação (retrieval) multi-label. Contudo, os métodos de classificação multi-label são desafiados pela alta dimensionalidade e complexidade dos espaços de representação obtidos e também pela sua dependência em conjuntos de dados de larga escala correta e exatamente anotados. Nas aplicações de comércio online, presentemente massificadas, o incremento diário de novos dados exige um esforço de anotação esmagador. Habitualmente realizado por humanos, este esforço de anotação representa um enorme custo e ainda assim origina elevadas taxas de anotações ruidosas ou omissas. A presente tese visa a classificação de imagens de fashion, através da aplicação de métodos de deep learning, para abordar os problemas de multi-class e multi-label com o intuito de gerar descrições de imagens mais ricas e completas. As coleções de dados visuais de fashion são geralmente desafiantes uma vez que (1) incluem uma vasta quantidade de imagens com aspeto similar, e (2) são anotadas com uma grande diversidade de atributos, embora existam poucas anotações por cada exemplo ou instância. Para responder aos problemas anteriores, a presente tese explora o uso de conhecimento do domínio para restringir as soluções de métodos deep learning que, de outra forma, seriam completamente orientadas pelos dados. Mais concretamente, é primeiramente abordada a integração de conhecimento relativo à estrutura das anotações. Image classification is a fundamental Computer Vision task that has become more relevant in our current information-driven society. Despite the recent leap forward in the field brought by deep learning approaches, we identify two main challenging problems that are still unresolved and are currently active research topics: multi-label image classification and classifying in the presence of noisy data. In order to make decisions, for instance when purchasing a product, people rely on rich and accurate descriptions, which entail multi-label retrieval processes. However, multi-label classification is challenged by high dimensional and complex feature spaces and its dependency on large and accurately annotated datasets. In current massified online shopping applications the daily insertion of new data requires an overwhelming annotation effort. Usually done by humans, it comes at a huge cost and yet generates high rates of noisy or missing labels. In this thesis we focus on image classification of fashion images, using deep learning approaches to tackle the multi-class/multi-label problems in order to generate rich images descriptions. Fashion datasets are generally challenging because (1) they include a vast amount of similarly looking images, (2) they are annotated with a large diversity of attributes but with few labels per exemplar. To address the previous issues we explore the use of domain knowledge to constrain the (otherwise completely data-driven) solutions. Specifically, we first show how to incorporate knowledge about annotations structure. Secondly, we use context and semantic localization to guide an attention mechanism that designs the feature space by focusing on visually meaningful regions. Finally, considering that missing and noisy supervision seriously hinder the effectiveness of deep learning approaches, we develop a framework that is able to relabel noisy annotations by learning a sparse reconstruction of image features as a combination of very few correctly annotated images, therefore increasing the number of correct labels in multi-label datasets.

Publication details

Authors in the community:

RENATES TID

101462999

Degree Name

Dotoramento em Engenharia Electrotécnica e de Computadores

Fields of Science and Technology (FOS)

electrical-engineering-electronic-engineering-information-engineering - Electrical engineering, electronic engineering, information engineering

Keywords

  • Classificação de Imagem
  • Redes Neuronais Convolucionais
  • Classificação Multi-label
  • Mecanismos de Atenção
  • Anotações Ruidosas
  • Image Classification
  • Convolutional Neural Networks
  • Multi-label Classification
  • Attention Mechanisms
  • Noisy Labels

Publication language (ISO code)

eng - English

Rights type:

Only metadata available

Institution name

Instituto Superior Técnico

Financing entity

Fundação para a Ciência e a Tecnologia