Reconhecimento de Entidades Nomeadas com Ensembles de Transformers: Uma Aplicação na Análise de Convênios do Diário Oficial da União
Reconhecimento de Entidades Nomeadas. Processamento de Linguagem Natural. Modelos Transformer. Combinação de Modelos. Ensemble. Convênios Públicos.
A extração automática de informações de documentos oficiais é um desafio central para a promoção da transparência e a fiscalização da aplicação dos recursos públicos no Brasil. Uma tarefa fundamental para este fim é o Reconhecimento de Entidades Nomeadas (REN), que visa identificar e classificar dados-chave em textos não estruturados. No domínio dos convênios públicos, a ausência de corpora anotados em larga escala representa uma barreira significativa para o desenvolvimento de modelos de REN de alto desempenho. Este trabalho aborda essa lacuna, objetivando o desenvolvimento e a avaliação de modelos baseados na arquitetura Transformer e técnicas de ensemble para a extração de 26 tipos de entidades de documentos de convênios publicados no Diário Oficial da União (DOU). Para viabilizar este trabalho, foi construído um corpus massivo a partir de 554.101 convênios (1996–2022), resultando em 192.900 documentos e mais de 10,4 milhões de entidades anotadas automaticamente. Com base nesses dados, a metodologia experimental comparou o ajuste fino (fine-tuning) de sete modelos Transformer individuais contra três estratégias de combinação destes. Os resultados indicam que, para além de superar a linha de base em métricas globais (F1-score de 0,700 na votação por maioria contra 0,690 no melhor modelo individual), os ensembles ofereceram ganhos expressivos na análise granular por categoria de entidade. Demonstrou-se a viabilidade de ajustar o trade-off entre precisão e revocação, permitindo configurar sistemas “conservadores” (alta confiança) ou “abrangentes” (alta cobertura) conforme a necessidade da aplicação. Qualitativamente, a combinação de modelos mostrou-se eficaz na correção de erros de omissão e capaz de generalizar além dos padrões rígidos da anotação automática baseada em regras. As contribuições deste trabalho incluem a criação e disponibilização pública de um corpus anotado em larga escala e a demonstração de que a combinação de modelos aprimora a robustez de sistemas de REN, com potencial na aplicação direta em projetos estratégicos de fiscalização e inteligência conduzidos por grandes instituições federais brasileiras.