Impact of synthetic data generated by a beta-variational autoencoder on speech emotion recognition

Carregando...
Imagem de Miniatura

Data

Autor(es)



Orientador(es)


Membros da banca


Título da Revista

ISSN da Revista

Título de Volume

Objetivo de Desenvolvimento Sustentável


Resumo

O Reconhecimento de Emoções na Fala (Speech Emotion Recognition) é uma técnica amplamente utilizada em pesquisas voltadas para a identificação de emoções por meio de expressões vocais. Este estudo explora a aplicação do reconhecimento de emoções na fala utilizando o modelo XLSR-53, UMAP, β-VAE e algoritmos de Machine Learning para classificação em cinco bases de dados (EMODB, ESD, emoUERJ, EMOVO e SEV). O objetivo principal é avaliar o desempenho do modelo e dos algoritmos de classificação no reconhecimento de emoções em diferentes línguas e variações linguísticas, ao mesmo tempo em que se analisa a capacidade do modelo em extrair características relevantes a partir dos sinais de fala. O modelo XLSR-53, conhecido por sua forte capacidade de generalização, foi inicialmente aplicado junto com o UMAP para redução de dimensionalidade. Após essa etapa, o β-VAE foi introduzido para gerar dados sintéticos e reclassificar os sinais de entrada. Por meio dessa abordagem, foi possível avaliar a capacidade do modelo em diferenciar emoções como felicidade, raiva, tristeza e surpresa em múltiplos idiomas, incluindo inglês, chinês, italiano, alemão, português brasileiro e espanhol. As bases de dados utilizadas forneceram uma variedade diversa de falantes e expressões emocionais, permitindo testes e comparações abrangentes. Os algoritmos de Machine Learning foram implementados de forma eficaz devido à natureza generalizada dos dados. Com base nos resultados, o estudo destaca como o modelo consegue generalizar sem a necessidade de fine-tuning, como o β-VAE contribui gerando amostras sintéticas para enriquecer o conjunto de dados inicial, e como os classificadores de Machine Learning categorizam eficientemente os estados emocionais. Portanto, a pesquisa apresentada se mostra uma ferramenta valiosa para o reconhecimento de emoções na fala, especialmente em contextos multilíngues e multiculturais.


Abstract

Speech Emotion Recognition is a widely employed technique in research focused on identifying emotions through vocal expressions. This study explores the application of emotion recognition in speech using the XLSR-53 model, UMAP, β-VAE, and Machine Learning algorithms for classification across five datasets (EMODB, ESD, emoUERJ, EMOVO, and SEV). The primary objective is to assess the performance of the model and classification algorithms in recognizing emotions across different spoken languages and linguistic variations, while examining the model’s ability to extract relevant features from speech signals. The XLSR-53 model, known for its strong generalization capabilities, was initially applied alongside UMAP for dimensionality reduction. Following this step, β-VAE was introduced to generate synthetic data and reclassify the input signals. Through this approach, we were able to evaluate the model’s capacity to differentiate between emotions such as happiness, anger, sadness, and surprise in multiple languages, including English, Chinese, Italian, German, Brazilian Portuguese, and Spanish. The datasets utilized provided a diverse range of speakers and emotional expressions, allowing for comprehensive testing and comparisons. Machine Learning algorithms were effectively implemented due to the generalized nature of the data. Based on the findings, the study highlights how the model generalizes without the need for fine-tuning, how β-VAE contributes by generating synthetic samples to enhance the initial dataset, and how Machine Learning classifiers efficiently categorize emotional states. Therefore, the research presented serves as a valuable tool for speech emotion recognition, particularly in multilingual and multicultural contexts.


Citação

Coleções

Avaliação

Revisão

Suplementado Por

Referenciado Por

Licença Creative Commons

Exceto quando indicado de outra forma, a licença deste item é descrita como Acesso aberto
Logo do IFES
RI/Ifes é uma implementação do DSpace e é gerenciado
pela Pró-Reitoria de Pesquisa e Pós-Graduação

© Todos os direitos reservados
Logo RBRDLogo OASISLogo LaReferencia
Desenvolvido porLogo Acervos Digitais