Extracting fields in brazilian national driver’s license : a study focusing on deep learning text recognition methods
Data
Autor(es)
Orientador(es)
Título da Revista
ISSN da Revista
Título de Volume
Editor
Resumo
RESUMO: Com o avanço da digitalização, a demanda por soluções de extração de informações em documentos tem crescido. Instituições têm incorporado processos de verificação de identidade de forma remota que permite maior agilidade e eficiência, reduzindo o tempo e etapas manuais. No entanto, estudos focados em Carteiras de Habilitação (CNH) Brasileiras ainda são escassos na literatura. Por se tratarem de dados sensíveis, as CNHs não estão acessíveis publicamente; por isso, este estudo utiliza o banco de dados Documentos de Identificação Brasileiros (BID, do inglês Brazilian Identification Documents), composto de amostras com dados sintéticos. Este trabalho busca contribuir para preencher essa lacuna ao comparar métodos de reconhecimento textual, incluindo o TrOCR (com diferentes configurações), o Tesseract e modelos baseados em Transformador Pré-treinado Generativo (GPT, do inglês Generative Pretrained Transformer), para a extração automatizada de dados da CNH. Propomos um pipeline de extração de informação baseado em duas abordagens distintas: a primeira, denominada Abordagem Baseada em Detecção (do inglês Detection-based Approach), consiste na localização automática de campos textuais de interesse por meio de uma rede neural de detecção treinada especificamente para identificar as regiões de interesse da CNH; a segunda, chamada Abordagem de Reconhecimento de Tiro Zero (do inglês Zero-shot Recognition Approach), utiliza modelos pré-treinados, multimodais capazes de extrair informações diretamente da imagem sem a necessidade de uma etapa prévia de identificação dos campos. Os experimentos contemplaram tanto a frente quanto o verso da CNH e incluem etapas como detecção dos campos de texto, estruturação das anotações da base de dados, geração e comparação de hipóteses de texto com os valores de referência, e análise dos resultados. A avaliação foi conduzida em dois níveis: no nível de caracteres, emprega-se a métrica Taxa de Erro de Caractere (CER, do inglês Character Error Rate) para mensurar a acurácia da transcrição; e no nível de palavras, utilizam-se as métricas de precisão, recall e F1-score para campos específicos, possibilitando uma análise das vantagens e limitações de cada modelo. Adicionalmente, aplica-se o teste estatístico de Wilcoxon, a fim de verificar se as diferenças observadas apresentam significância estatística. Entre os modelos avaliados, o TrOCR destacou-se por apresentar resultados promissores, aliado à vantagem de ser uma solução de código aberto. O estudo também avalia o custo computacional e o tempo de processamento dos modelos, oferecendo uma perspectiva sobre sua viabilidade em cenários reais.
Abstract
ABSTRACT: With the advancement of digitalization, the demand for document information extraction solutions has grown. Institutions have incorporated remote identity verification processes, allowing for greater agility and efficiency, reducing time and manual steps. However, studies focused on Brazilian Driver’s Licenses (CNH, from Portuguese Carteira Nacional de Habilitação) are still scarce in the literature. Because they are sensitive data, CNHs are not publicly accessible; therefore, this study uses the Brazilian Identification Documents (BID) database, composed of samples with synthetic data. This work seeks to contribute to filling this gap by comparing text recognition methods, including TrOCR (with different configurations), Tesseract, and Generative Pretrained Transformer (GPT)-based models, for the automated extraction of CNH data. We propose an information extraction pipeline based on two distinct approaches: the first, called the Detection-Based Approach, consists of the automatic location of text fields of interest using a detection neural network trained specifically to identify regions of interest in CNH; the second, called the Zero- Shot Recognition Approach,uses pre-trained, multimodal models capable of extracting information directly from the image without the need for a prior field identification step. The experiments covered both the front and back sides of the CNH and included steps such as detecting text fields, structuring database annotations, generating and comparing text hypotheses with reference values, and analyzing the results. The evaluation was conducted at two levels: at the character level, the Character Error Rate (CER) metric is used to measure transcription accuracy; and at the word level, precision, recall, and F1-score metrics are used for specific fields, enabling an analysis of the advantages and limitations of each model. Additionally, the Wilcoxon test is applied to verify whether the observed differences are statistically significant. Among the models evaluated, TrOCR stood out for presenting promising results, combined with the advantage of being an open-source solution. The study also evaluates the computational cost and processing time of the models, offering insight into their viability in real-world scenarios.
