Redes neurais com mecanismos de atenção aplicadas à classificação de imagens de rochas ornamentais
Data
Autor(es)
Orientador(es)
Título da Revista
ISSN da Revista
Título de Volume
Editor
Resumo
A indústria de rochas ornamentais no Brasil se destaca pela sua grande diversidade, mas enfrenta desafios na classificação devido à subjetividade e à dependência do julgamento de especialistas, o que pode gerar divergências comerciais. Além disso, profissionais da área comumente relatam desconhecimento sobre a carteira brasileira de produtos de rochas ornamentais. Neste cenário, a inteligência artificial se apresenta como uma ferramenta promissora para aprimorar o reconhecimento e a valorização das rochas brasileiras. Este trabalho investiga a aplicação de redes neurais com mecanismos de atenção para a classificação de imagens de rochas ornamentais, com o objetivo de verificar se o uso dessas arquiteturas pode melhorar o desempenho em comparação com modelos que não utilizam tais mecanismos. Para isso, foram realizados dois experimentos independentes. No primeiro, utilizou-se uma base de dados balanceada composta por imagens de granito, mármore e quartzito, com 12 classes e um total de 1.794 imagens, destinada ao treinamento e avaliação de diferentes arquiteturas de redes neurais. No segundo experimento, as redes foram treinadas e avaliadas sobre uma base ampliada e desbalanceada, formada a partir da combinação dessa base inicial com outros conjuntos de dados publicamente disponíveis, resultando em 66 classes e 37.135 imagens. As arquiteturas avaliadas incluíram modelos tradicionais baseados em convoluções (AlexNet, VGG16, VGG19, DenseNet121, DenseNet169, ResNet50, ResNet101, Xception e Inception V3), convoluções modernas (ConvNeXt) e modelos com mecanismos de atenção: Vision Transformer (ViT) e o modelo híbrido CoAtNet. Os resultados obtidos demonstraram que as redes neurais que incorporam mecanismos de atenção apresentaram desempenho superior às que não utilizam tais mecanismos. Na base de dados balanceada, com 12 classes, a rede ViT alcançou 98,36% de acurácia e 98,42% de F1-score. Na base unificada, com 66 classes desbalanceadas, o modelo híbrido CoAtNet obteve os melhores resultados, com 93,96% de acurácia e 93,96% de F1-score.
Abstract
ABSTRACT The ornamental stone industry in Brazil stands out for its great diversity but faces classification challenges due to subjectivity and reliance on expert judgment, which can lead to commercial disagreements. In addition, professionals in the field often report a lack of awareness regarding the full range of Brazilian ornamental stone products. In this context, artificial intelligence emerges as a promising tool to improve the recognition and appreciation of Brazilian stones. This work investigates the application of neural networks with attention mechanisms for the classification of ornamental stone images, aiming to verify whether the use of these architectures can improve performance compared to models that do not employ such mechanisms. For this purpose, two independent experiments were conducted. In the first, a balanced dataset consisting of images of granite, marble, and quartzite, with 12 classes and a total of 1,794 images, was used for training and evaluating different neural network architectures. In the second experiment, the networks were trained and evaluated on an expanded and imbalanced dataset, created by combining this initial dataset with other publicly available datasets, resulting in 66 classes and 37,135 images. The evaluated architectures included traditional convolution-based models (AlexNet, VGG16, VGG19, DenseNet121, DenseNet169, ResNet50, ResNet101, Xception, and Inception V3), modern convolutions (ConvNeXt), and models with attention mechanisms: Vision Transformer (ViT) and the hybrid model CoAtNet. The results showed that neural networks incorporating attention mechanisms outperformed those that do not use such mechanisms. In the balanced database, with 12 classes, the ViT network achieved 98.36% accuracy and 98.42% F1-score. In the unified database, with 66 unbalanced classes, the hybrid model CoAtNet achieved the best results, with 93.96% accuracy and 93.96% F1-score. Keywords: ornamental rocks, artificial intelligence, convolutional neural networks, vision transformer.
