Towards brazilian Portuguese automatic open question generation using transformer-based models
Data
Autor(es)
Orientador(es)
Membros da banca
Título da Revista
ISSN da Revista
Título de Volume
Objetivo de Desenvolvimento Sustentável
Resumo
A tarefa de Geração Automática de Perguntas (QG, do inglês Question Generation) possui aplicações relevantes em tecnologias educacionais e sistemas conversacionais. No entanto, a avaliação sistemática de diferentes arquiteturas de modelos voltadas ao português brasileiro ainda é limitada. Diante desse contexto, este trabalho tem como objetivo realizar uma avaliação abrangente de modelos baseados na arquitetura Transformers para QG em português do Brasil, investigando duas abordagens: modelos baseados na arquitetura T5 com ajuste fino e Modelos de Linguagem de Grande Escala (LLMs, do inglês Large Language Models) por meio da estratégia zero-shot. Os experimentos foram conduzidos utilizando três conjuntos de dados, abrangendo diferentes domínios: PIRÁ, FairytaleQA e SQuAD. As abordagens investigadas incluem seis modelos T5 ajustados (PTT5 e FLAN-T5 nas variantes pequena, base e grande) e doze LLMs (modelos especializados em português brasileiro e modelos multilíngues) avaliados em três cenários experimentais: geração de perguntas a partir apenas do contexto, geração baseada em contexto e resposta de referência, e geração simultânea de pares de perguntas e respostas. A metodologia de avaliação combina medidas baseadas em similaridade com uma avaliação multicritério conduzida por LLM, contemplando aspectos como fluência, correção gramatical, coerência, respondibilidade, relevância e completude. Os resultados experimentais indicam que, tanto entre os modelos T5 quanto entre os LLMs, as variantes monolíngues especializadas em português superam de forma consistente suas contrapartes multilíngues na maioria dos conjuntos de dados e cenários. Entre os LLMs avaliados, os modelos de grande escala obtiveram as maiores pontuações de qualidade, embora apresentem menor alinhamento lexical com as perguntas de referência em comparação aos modelos T5 ajustados. Experimentos de generalização entre domínios mostraram que o modelo PTT5, especializado em português, apresenta melhor adaptação a novos domínios em relação ao FLAN-T5 multilíngue. Na geração simultânea de perguntas e respostas, os modelos T5 mostraram limitações na produção de respostas, enquanto os LLMs apresentaram desempenho consistente em todos os domínios. De modo geral, os resultados evidenciaram uma relação de custo-benefício entre as abordagens: os modelos T5 ajustados apresentam melhor alinhamento lexical e menor demanda de recursos computacionais, enquanto os LLMs produziram perguntas e respostas de maior qualidade, porém com maior custo computacional. Esses achados estabelecem referências de desempenho para a tarefa de QG em português do Brasil, oferecendo subsídios para a seleção de modelos com base em evidências em diferentes contextos de aplicação e apontam direções promissoras de pesquisa, incluindo o ajuste fino de modelos menores especializados no português do Brasil.
Abstract
Question Generation (QG) has relevant applications in educational technologies and conversational systems. However, the systematic evaluation of different model architectures for Brazilian Portuguese is still limited. In this context, this work aims to conduct a comprehensive evaluation of Transformers-based models for QG in Brazilian Portuguese, investigating two approaches: fine-tuned T5-based models and Large Language Models (LLMs) using a zero-shot strategy. The experiments were conducted using three datasets, covering different domains: PIRÁ, FairytaleQA, and SQuAD. The investigation included six fine-tuned T5 models (PTT5 and FLAN-T5 in small, base, and large variants) and twelve LLMs (models specialized in Brazilian Portuguese and multilingual models) evaluated in three experimental scenarios: question generation based solely on context, generation based on context and reference answer, and simultaneous generation of question-answer pairs. The evaluation methodology combines similarity-based measures with a multi-criteria evaluation conducted by LLM, considering fluency, grammatical correctness, coherence, respondability, relevance, and completeness. The experimental results indicate that the monolingual models specialized in Portuguese consistently outperform their multilingual counterparts in most datasets and scenarios. Among the LLMs evaluated, the large-scale multilingual models obtained the highest quality scores, although they showed lower lexical alignment with the reference questions compared to the adjusted T5 models. To assess the ability to generalize across different domains, data transfer experiments were conducted between datasets using the adjusted T5 models. These experiments showed that the PTT5 model, specialized in Portuguese, exhibits better adaptation to new domains compared to the multilingual FLAN-T5. In the simultaneous generation of questions and answers, the T5 models exhibited limitations in answer generation, whereas the LLMs demonstrated consistent performance across all domains. Overall, the results revealed a cost-benefit relationship between the approaches: the adjusted T5 models demonstrated better lexical alignment and lower computational requirements, while the LLMs produced higher-quality questions and answers, albeit at a higher computational cost. These findings establish performance benchmarks for the question-and-answer task in Portuguese, providing support for the selection of evidence-based models across different application contexts, and point to promising research directions, including the fine-tuning of smaller models specialized in Brazilian Portuguese.


