Topificação de documentos com Modelos de Linguagem em Larga Escala
Modelagem de Tópicos, LLMs de Código Aberto, Clusterização
Este trabalho propõe uma metodologia de modelagem de tópicos não supervisionada auxiliada por Modelos de Linguagem de Grande Porte (LLMs) de código aberto para a tipificação eficiente de grandes bases de dados documentais. A relevância da proposta reside na superação das limitações semânticas e estruturais de modelos estatísticos tradicionais, como o LDA, por meio de uma arquitetura que integra algoritmos de clusterização para amostragem estratégica e um fluxo de auto-correção projetado para mitigar inconsistências temáticas com baixo custo operacional. A validação metodológica será realizada quantitativamente em conjuntos de dados de referência, avaliando a escalabilidade da propagação de tópicos através das métricas de Pureza, Índice Rand Ajustado (ARI) e
Informação Mútua Normalizada (NMI), além de incluir um estudo de caso qualitativo com dados reais de redes sociais submetido à avaliação de um humano especialista.