Síntese de fala em português brasileiro utilizando Deep Learning
Data
Autor(es)
Orientador(es)
Título da Revista
ISSN da Revista
Título de Volume
Editor
Resumo
A síntese de fala em português brasileiro assume cada vez mais importância no mercado, com crescente demanda por locuções, narrações e dublagens realizadas por meio de vozes geradas por Inteligência Artificial (IA). No entanto, a geração de vozes sintéticas realistas e expressivas, capazes de se adaptarem a diversas aplicações, ainda representa um desafio. Este estudo visa desenvolver um modelo de síntese de fala em português brasileiro de alta qualidade, atendendo às necessidades do mercado, superando os desafios da área. O modelo proposto é treinado em um conjunto de dados de pares texto-fala, utilizando técnicas avançadas de aprendizado de máquina e síntese de voz. A combinação do Tacotron 2, que converte texto em espectrogramas Mel, e do Wavenet, que transforma esses espectrogramas em formas de onda de áudio, permite a geração de vozes sintéticas que são fluidas e naturais. Este processo, viabilizado pelo mecanismo de atenção, é fundamental para capturar as nuances da fala humana, resultando em uma gravação sintética mais realista e convincente. Com essa abordagem, o modelo não apenas reproduz o conteúdo do texto, mas também imita o ritmo, entonação e variações na fala, essenciais para uma síntese de voz de alta qualidade. Os resultados demonstram a similaridade entre as vozes sintéticas geradas pelo modelo e as vozes originais do conjunto de dados, comprovando a eficácia da metodologia proposta. A validação quantitativa foi realizada por meio de métricas de avaliação, como a medida de similaridade de cosseno, que alcançou valores acima de 0,84. Essa avaliação foi complementada por testes qualitativos, nos quais um grupo diverso de pessoas, independente de idade, raça, credo ou gênero, ouviu as gravações humanas (vozes originais) e não humanas (vozes sintéticas) para avaliar e pontuar a qualidade e naturalidade das vozes sintetizadas. Apesar dos resultados promissores, a pesquisa ainda apresenta algumas limitações, como a necessidade de um conjunto de dados de treinamento maior e mais diversificado para garantir a generalização do modelo. Além disso, a otimização dos parâmetros ainda pode ser aprimorada para alcançar resultados ainda mais precisos. Esta pesquisa representa um avanço significativo na tecnologia de síntese de fala em português brasileiro, oferecendo soluções inovadoras e promissoras para diversas aplicações. Os resultados obtidos são valiosos para o desenvolvimento de sistemas e dispositivos que dependem de vozes sintéticas de alta qualidade, contribuindo para uma experiência de usuário mais eficiente e envolvente.
