Sumarização automática de artigos de notícias em português: da extração à abstração com abordagens clássicas e modelos neurais
Data
Autor(es)
Orientador(es)
Membros da banca
Título da Revista
ISSN da Revista
Título de Volume
Objetivo de Desenvolvimento Sustentável
Resumo
O aumento na produção de dados digitais tem intensificado os desafios relacionados à leitura e compreensão de grandes volumes de informação, evidenciando a necessidade de métodos capazes de sintetizar conteúdo de forma eficiente. Nesse contexto, a Sumarização Automática de Texto (SAT) destaca-se como uma ferramenta essencial, especialmente em sua vertente abstrativa, que gera resumos mais similares aos escritos por humanos por meio de técnicas de geração de linguagem natural. Apesar dos avanços recentes, os estudos voltados ao português do Brasil ainda são escassos. Este trabalho investigou métodos extrativos e abstrativos aplicados à sumarização de artigos de notícias em português do Brasil. Foram avaliados modelos baseados na arquitetura T5, como PTT5 e Flan-T5, ajustados com o corpus RecognaSumm, além de comparações com baselines clássicos, um sistema extrativo baseado em Programação Linear Inteira (PLI) e modelos de linguagem de larga escala (LLMs) proprietários e de código aberto, incluindo GPT-4o, GPT-3.5 Turbo, Gemma 2, LLaMA 3, LLaMA 4 Maverick, Sabiázinho-3 e Sabiá-3. Os experimentos foram conduzidos nos corpora TeMário, CSTNews e RecognaSumm, contemplando cenários de sumarização monodocumento e multidocumento. A avaliação dos resumos utilizou as métricas de similaridade textual ROUGE-L e BERTScore, além da estratégia G-Eval, que emprega LLMs como juízes automáticos. Os resultados experimentais demonstram que os modelos ajustados PTT5 e Flan-T5 apresentam desempenho competitivo nas medidas de avaliação tradicionais baseadas em similaridade, superando baselines extrativos em diversos cenários. Entretanto, os LLMs demonstraram melhor qualidade discursiva segundo o G-Eval, produzindo textos mais fluentes, coerentes e bem estruturados. As análises também revelam diferenças significativas entre métricas lexicais, semânticas e os valores gerados pelo G-Eval, indicando que essas abordagens capturam dimensões distintas da qualidade dos resumos. De forma geral, o estudo evidencia o potencial dos modelos baseados na arquitetura T5 ajustados para o português, a robustez dos métodos extrativos em contextos com restrições computacionais e o desempenho superior dos LLMs na geração de resumos abstrativos de alta qualidade textual, com destaque para Sabiá-3 e GPT-4o.
Abstract
The increase in digital data production has intensified challenges related to reading and understanding large volumes of information, highlighting the need for methods capable of efficiently synthesizing content. In this context, Automated Text Summarization (ATS) stands out as an essential tool, particularly in its abstractive approach, which generates summaries more similar to those written by humans through natural language generation techniques. Despite recent advances, studies focused on Brazilian Portuguese remain scarce. This work investigated extractive and abstractive methods for summarizing news articles written in Brazilian Portuguese. Models based on the Transformer architecture, such as PTT5 and Flan-T5, fine-tuned on the RecognaSumm corpus, were evaluated, along with comparisons to classical baselines, an extractive system based on Integer Linear Programming (ILP), and proprietary and open-source Large Language Models (LLMs), including GPT-4o, GPT-3.5 Turbo, Gemma, LLaMA 3, LLaMA 4 Maverick, Sabiázinho-3, and Sabiá-3. The experiments were conducted on the TeMário, CSTNews, and RecognaSumm corpora, covering both single-document and multi-document summarization scenarios. The generated summaries were evaluated using the traditional similarity-based metrics ROUGE-L and BERTScore, as well as the G-Eval strategy, which employs LLMs as automatic judges. The experimental results show that the fine-tuned PTT5 and Flan-T5 models achieve competitive performance on traditional similarity-based evaluation metrics, outperforming extractive baselines in several scenarios. However, LLMs demonstrated superior discursive quality according to G-Eval, producing more fluent, coherent, and well-structured texts. The analyses also reveal significant differences between lexical and semantic similarity metrics and the scores generated by G-Eval, indicating that these approaches capture distinct dimensions of summary quality. Overall, the study highlights the potential of Transformer models optimized for Portuguese, the robustness of extractive methods under computational constraints, and the superior performance of LLMs in generating high-quality abstractive summaries, particularly Sabiá-3 and GPT-4o.



