Publication

Integrating audio and vision for robust automatic gender recognition

2008
Rapport ou document de travail

Résumé

We propose a multi-modal Automatic Gender Recognition (AGR) system based on audio-visual cues and present its thorough evaluation in realistic scenarios. First, we analyze robustness of different audio and visual features under varying conditions and create two uni-modal AGR systems. Then, we build an integrated audio-visual system by fusing information from each modality at the classifier level. Our extensive studies on the BANCA corpus comprising datasets of varying complexity show that: (a) the audio-based system is more robust than the vision-based system; (b) integration of audio-visual cues yields a resilient system and improves performance in noisy conditions.

Source officielle

https://infoscience.epfl.ch/record/146264?ln=fr

À propos de ce résultat

Cette page est générée automatiquement et peut contenir des informations qui ne sont pas correctes, complètes, à jour ou pertinentes par rapport à votre recherche. Il en va de même pour toutes les autres pages de ce site. Veillez à vérifier les informations auprès des sources officielles de l'EPFL.

Graph Chatbot

Chattez avec Graph Search

Posez n’importe quelle question sur les cours, conférences, exercices, recherches, actualités, etc. de l’EPFL ou essayez les exemples de questions ci-dessous.

AVERTISSEMENT : Le chatbot Graph n'est pas programmé pour fournir des réponses explicites ou catégoriques à vos questions. Il transforme plutôt vos questions en demandes API qui sont distribuées aux différents services informatiques officiellement administrés par l'EPFL. Son but est uniquement de collecter et de recommander des références pertinentes à des contenus que vous pouvez explorer pour vous aider à répondre à vos questions.

Connectez-vous pour utiliser Chat avec Graph Search

Integrating audio and vision for robust automatic gender recognition

Graph Chatbot

Chattez avec Graph Search

Acoustical Features as Knee Health Biomarkers: A Critical Analysis

ASAP: a Dataset of Aligned Scores and Performances for Piano Transcription

Speaker Inconsistency Detection in Tampered Video

ASAP: a Dataset of Aligned Scores and Performances for Piano Transcription

Speaker Inconsistency Detection in Tampered Video

Acoustical Features as Knee Health Biomarkers: A Critical Analysis