Banca de DEFESA: Vinícius Di Oliveira
Uma banca de DEFESA de DOUTORADO foi cadastrada pelo programa.
DISCENTE : Vinícius Di Oliveira
DATA : 12/12/2025
HORA: 14:00
LOCAL: TEAM
TÍTULO:
Aprimorando LLM’s para Língua Portuguesa: Caso de Estudo da Normalização Lexical
PALAVRAS-CHAVES:
Grandes Modelos de Linguagem, Geração Aumentada por Recuperação, Processamento de Linguagem Natural, Processamento de Língua Portuguesa, Engenharia de Prompt.
PÁGINAS: 145
RESUMO:
Esta tese aborda o desafio urgente de classificar mercadorias de forma eficaz de acordo com a Nomenclatura Comum do Mercosul (NCM), especialmente no contexto da língua portuguesa, onde recursos e modelos limitados apresentam obstáculos significativos. Os modelos de linguagem tradicionais muitas vezes enfrentam dificuldades para lidar com a especificidade e complexidade exigidas por essas tarefas, especialmente em línguas não inglesas. Como resultado, há uma forte necessidade de uma solução que não apenas processe o português de maneira eficiente, mas também melhore a precisão e a relevância das saídas de classificação em domínios especializados, como a fiscalização tributária.
A pesquisa propõe um modelo híbrido inovador, o Modelo Simplificado Lógico Inteligente de Ajuste Fino com Geração Aumentada por Recuperação de Informações (SLIM-RAFT), que combina as forças da Geração Aumentada por Recuperação (RAG) com a precisão de Modelos de Linguagem de Grande Escala (LLMs) ajustados. Esse modelo é projetado especificamente para lidar com tarefas de classificação em português, utilizando técnicas avançadas de engenharia de prompts e uma nova aplicação do processo de raciocínio Cadeia de Pensamento (CoT) para melhorar a interpretabilidade. Ao integrar esses componentes, o SLIM-RAFT resolve limitações importantes dos modelos existentes, oferecendo uma solução mais eficiente e precisa na categorização de mercadorias com base na NCM.
A metodologia empregada nesta pesquisa envolveu experimentações extensas com diversas arquiteturas de modelos e técnicas de treinamento. Ajustando os modelos com dados específicos de domínio em língua portuguesa, a pesquisa demonstra como o modelo SLIM-RAFT pode superar abordagens existentes tanto em termos de precisão quanto de eficiência de recursos. A capacidade do modelo de generalizar entre diferentes conjuntos de dados e cenários de classificação destaca seu potencial para aplicações mais amplas além da NCM, sugerindo que ele poderia ser aplicado a outras tarefas de classificação estruturadas em vários setores.
Durante o desenvolvimento, foi utilizado um conjunto de dados extenso, incluindo mais de 240.000 registros da NCM provenientes de notas fiscais eletrônicas (NFe’s). O modelo SLIM-RAFT foi capaz de alcançar um aumento de até 15\% na precisão em relação aos modelos atuais, com uma redução significativa no tempo de processamento. A avaliação foi realizada utilizando uma métrica de score baseada em perguntas e respostas, onde o SLIM-RAFT demonstrou um desempenho superior, atingindo uma média de 92\% de acertos nas tarefas de categorização, superando os modelos de comparação por uma margem de 10 a 12 pontos percentuais em cenários de dados complexos.
Esta pesquisa faz uma contribuição significativa ao campo do processamento de linguagem natural multilíngue, particularmente para a língua portuguesa. O modelo SLIM-RAFT não apenas oferece uma solução prática para melhorar a classificação de mercadorias segundo a NCM, mas também estabelece um precedente sobre como modelos híbridos, combinando geração aumentada por recuperação e ajuste fino, podem melhorar o desempenho de modelos de linguagem em domínios especializados. O trabalho futuro se concentrará em refinar ainda mais o modelo, expandir sua aplicação para outras tarefas de classificação e explorar a escalabilidade dessa abordagem para outras línguas e domínios.
MEMBROS DA BANCA:
Interna - 1780217 - EDNA DIAS CANEDO
Interno - 1220587 - LI WEIGANG
Interno - 2679452 - PEDRO GARCIA FREITAS
Externa à Instituição - ALINE MARINS PAES CARVALHO - UFF
Externo à Instituição - RODOLFO IPOLITO MENEGUETTE - USP