Cross native–translated evaluation of transformer-based vision models for brazilian portuguese image captioning

Carregando...
Imagem de Miniatura

Data

Autor(es)



Orientador(es)


Membros da banca


Título da Revista

ISSN da Revista

Título de Volume

Objetivo de Desenvolvimento Sustentável


Resumo

Image Captioning (IC) refere-se à geração automática de descrições em linguagem natural para imagens. Esta tarefa possui aplicações que variam desde a geração de conteúdo para redes sociais até o auxílio a indivíduos com deficiência visual. Embora a maior parte da pesquisa tenha se concentrado em modelos baseados no inglês, idiomas com poucos recursos, como o português do Brasil, enfrentam desafios significativos devido à falta de conjuntos de dados e modelos especializados. Diversos estudos criam conjuntos de dados traduzindo automaticamente conjuntos de dados existentes no inglês para mitigar a escassez de recursos. Este trabalho aborda essa lacuna ao propor uma investigação cruzada entre dados nativos e traduzidos de modelos Vision Encoder-Decoder (VED) baseados em Transformer e Vision-Language Models (VLMs). Avaliamos nove configurações de VED combinando codificadores pré-treinados (ViT, Swin, DeiT) com decodificadores de linguagem em português do Brasil (BERTimbau, DistilBERTimbau, GPorTuguese-2). Estes são comparados com VLMs de última geração (ViTucano, PaliGemma, Phi-3 V, LLaMa 3.2 V e GPT-4o) em configurações zero-shot e com ajuste fino (fine-tuning). Os experimentos utilizam duas versões do conjunto de dados Flickr30K: uma contendo legendas traduzidas automaticamente e outra com descrições nativas anotadas por falantes da língua portuguesa. Avaliamos o desempenho em configurações de mesma fonte (same-source) e fontes cruzadas (cross-source) para quantificar a generalização de domínio. Nossos resultados revelam que o Swin-DistilBERTimbau oferece o melhor equilíbrio entre eficiência e desempenho em cenários de fontes cruzadas, enquanto o Swin-GPorTuguese-2 se destaca em contextos nativos. Entre os VLMs, o ViTucano, pré-treinado em português, supera modelos multilíngues maiores em métricas lexicais, enquanto o GPT-4o domina no alinhamento imagem-texto (CLIP-Score). Além disso, demonstramos que VLMs com ajuste fino superam significativamente os VEDs, com ViTucano 2B, Phi-3 V e PaliGemma alcançando os resultados mais altos em dados traduzidos e nativos. Por fim, nossa análise de acurácia de métricas sugere que o CLIP-Score é mais robusto do que as métricas lexicais tradicionais para distinguir legendas corretas de legendas incorretas selecionadas aleatoriamente.


Abstract

Image captioning (IC) refers to the automatic generation of natural language descriptions for images. This task has applications ranging from social media content generation to assisting individuals with visual impairments. While most research has focused on English-based models, low-resource languages, such as Brazilian Portuguese, face significant challenges due to the lack of specialized datasets and models. Several studies create datasets by automatically translating existing ones to mitigate resource scarcity. This work addresses this gap by proposing a cross-native-translated investigation of Transformer-based Vision Encoder-Decoder (VED) models and Vision-Language Models (VLMs). We evaluate nine VED configurations by combining pre-trained encoders (ViT, Swin, DeiT) with Brazilian Portuguese language decoders (BERTimbau, DistilBERTimbau, GPorTuguese-2). These are compared against state-of-the-art VLMs (ViTucano, PaliGemma, Phi-3 V, LLaMa 3.2 V, and GPT-4o) in both zero-shot and fine-tuned settings. Experiments utilize two versions of the Flickr30K dataset: one featuring machine-translated captions and another with native, human-annotated descriptions. We assess performance in the same-source and cross-source setups to quantify domain generalization. Our findings reveal that Swin-DistilBERTimbau offers the best trade-off between efficiency and performance in cross-source scenarios, while Swin-GPorTuguese-2 excels in native contexts. Among VLMs, the Portuguese pre-trained ViTucano outperforms larger multilingual models in lexical metrics, whereas GPT-4o dominates in image-text alignment (CLIP-Score). Furthermore, we demonstrate that fine-tuned VLMs significantly outperform VEDs, with ViTucano 2B, Phi-3 V, and PaliGemma achieving the highest results across translated and native data. Finally, our metrics accuracy analysis suggests that CLIP-Score is more robust than traditional lexical metrics in distinguishing correct captions from incorrect, randomly selected captions.


Citação

LIMA, Gabriel Mota Bromonschenkel. Cross native–translated evaluation of transformer-based vision models for brazilian portuguese image captioning. 2025. 72 f. Dissertação (Mestrado em Computação Aplicada) – Instituto Federal do Espírito Santo, Serra, 2025.

Coleções

Avaliação

Revisão

Suplementado Por

Referenciado Por

Licença Creative Commons

Exceto quando indicado de outra forma, a licença deste item é descrita como Acesso aberto
Logo do IFES
RI/Ifes é uma implementação do DSpace e é gerenciado
pela Pró-Reitoria de Pesquisa e Pós-Graduação

© Todos os direitos reservados
Logo RBRDLogo OASISLogo LaReferencia
Desenvolvido porLogo Acervos Digitais