Pré-treinamento eficiente de modelos encoders para o português
Processamento de Linguagem Natural, BERT, ModernBERT, Português Brasileiro, Modelos Fundacionais
Modelos baseados em encoders bidirecionais, paradigma estabelecido pela arquitetura BERT, consolidam-se como o estado da arte para múltiplas tarefas de Processamento de Linguagem Natural (PLN), especialmente as que exigem compreensão de contexto. O modelo ModernBERT surge como a evolução mais recente desta família ao utilizar mecanismos como Flash Attention e Unpadding para otimizar a eficiência de treinamento e fornecer suporte a contextos longos. No entanto, seu treinamento utiliza um corpus predominantemente centrado na língua inglesa. Tendo em vista que a literatura demonstra que o emprego de um corpus monolíngue gera resultados superiores a abordagens multilíngues, submeter a arquitetura ModernBERT a um treinamento especializado ao português brasileiro se traduz em ganhos diretos de desempenho para tarefas de PLN. Paralelamente, as implementações dos modelos BERT disponíveis para o português brasileiro se ancoram em arquiteturas legadas, limitadas a janelas de contexto curtas, que subutilizam as capacidades do hardware atual. Para preencher esta lacuna, este trabalho propõe o BERTomelo, uma adaptação da arquitetura ModernBERT para o português brasileiro. Apresenta-se uma metodologia de pré-treinamento estruturada que engloba um corpus recente e filtrado, composto pelo ClassiCC-PT, pelo uso de tokenizadores especializados e pela aplicação de um regime de pré-treinamento em duas etapas. As avaliações extrínsecas conduzidas neste trabalho demonstram que o BERTomelo atinge desempenho competitivo frente ao estado da arte em tarefas como Similaridade Semântica (STS) e Reconhecimento de Entidades Nomeadas (NER), superando baselines de referência. Como trabalhos futuros, visando expandir esta pesquisa, planeja-se a integração de técnicas para otimização do tempo de treinamento, mantendo a eficiência de aprendizado por token, além da execução de estudos de ablação isolados para mensurar a influência do tokenizador na qualidade do modelo pré-treinado.