Banca de QUALIFICAÇÃO: RENNÊ RUAN ALVES OLIVEIRA

Uma banca de QUALIFICAÇÃO de MESTRADO foi cadastrada pelo programa.
DISCENTE : RENNÊ RUAN ALVES OLIVEIRA
DATA : 28/04/2026
HORA: 09:00
LOCAL: Microsoft Teams: https://teams.microsoft.com/meet/26847243554435?p=nBlyq1Ir4IkSHu2Ymo
TÍTULO:

Pré-treinamento eficiente de modelos encoders para o português


PALAVRAS-CHAVES:

Processamento de Linguagem Natural, BERT, ModernBERT, Português Brasileiro, Modelos Fundacionais


PÁGINAS: 67
RESUMO:

Modelos baseados em encoders bidirecionais, paradigma estabelecido pela arquitetura BERT, consolidam-se como o estado da arte para múltiplas tarefas de Processamento de Linguagem Natural (PLN), especialmente as que exigem compreensão de contexto. O modelo ModernBERT surge como a evolução mais recente desta família ao utilizar mecanismos como Flash Attention e Unpadding para otimizar a eficiência de treinamento e fornecer suporte a contextos longos. No entanto, seu treinamento utiliza um corpus predominantemente centrado na língua inglesa. Tendo em vista que a literatura demonstra que o emprego de um corpus monolíngue gera resultados superiores a abordagens multilíngues, submeter a arquitetura ModernBERT a um treinamento especializado ao português brasileiro se traduz em ganhos diretos de desempenho para tarefas de PLN. Paralelamente, as implementações dos modelos BERT disponíveis para o português brasileiro se ancoram em arquiteturas legadas, limitadas a janelas de contexto curtas, que subutilizam as capacidades do hardware atual. Para preencher esta lacuna, este trabalho propõe o BERTomelo, uma adaptação da arquitetura ModernBERT para o português brasileiro. Apresenta-se uma metodologia de pré-treinamento estruturada que engloba um corpus recente e filtrado, composto pelo ClassiCC-PT, pelo uso de tokenizadores especializados e pela aplicação de um regime de pré-treinamento em duas etapas. As avaliações extrínsecas conduzidas neste trabalho demonstram que o BERTomelo atinge desempenho competitivo frente ao estado da arte em tarefas como Similaridade Semântica (STS) e Reconhecimento de Entidades Nomeadas (NER), superando baselines de referência. Como trabalhos futuros, visando expandir esta pesquisa, planeja-se a integração de técnicas para otimização do tempo de treinamento, mantendo a eficiência de aprendizado por token, além da execução de estudos de ablação isolados para mensurar a influência do tokenizador na qualidade do modelo pré-treinado.


MEMBROS DA BANCA:
Presidente - 3128249 - LUIS PAULO FAINA GARCIA
Interno - 2679452 - PEDRO GARCIA FREITAS
Interno - 1821656 - THIAGO DE PAULO FALEIROS
Externo à Instituição - DIEGO FURTADO SILVA - USP
Notícia cadastrada em: 08/04/2026 16:26
SIGAA | Secretaria de Tecnologia da Informação - STI - (61) 3107-0102 | Copyright © 2006-2026 - UFRN - app04.sigaa04