Métodos Estatísticos para Avaliação de Large Language Models
Large Language Models; Teoria de Resposta ao Item; avaliação psicométrica; tradução automática; estabilidade comportamental
Esta tese propõe um framework multidimensional, fundamentado em psicometria comportamental, para avaliação de Large Language Models (LLMs). A motivação central reside na constatação de que métricas unidimensionais, amplamente utilizadas em benchmarks e leaderboards, são insuficientes para caracterizar o comportamento de modelos de linguagem: elas sistematicamente inflam a qualidade percebida ao conflitar correspondência superficial de padrões com competência genuína. A tese argumenta que a avaliação de LLMs é, em sua natureza, um problema de mensuração psicométrica, e que somente um framework multidimensional, fundamentado na Teoria de Resposta ao Item (TRI), que unifique sinais comportamentais, linguísticos e temporais em uma escala latente comum, pode revelar o perfil verdadeiro de competência de um modelo e detectar sua degradação ao longo do tempo. O framework está organizado em cinco pilares complementares, dos quais os três primeiros abordam lacunas empíricas e os dois últimos fornecem a infraestrutura psicométrica unificadora.
Pilar 1: TraCE-LLM (Trait and Consistency Evaluation). O primeiro pilar introduz um protocolo de avaliação que mede dois traços comportamentais latentes: Depth of Reasoning (DoR), que quantifica a completude inferencial e coerência lógica das justificativas, e Originality (ORI), que mede a variação comportamental entre execuções repetidas do mesmo prompt. O protocolo utiliza o rubricado ZSSIRED sob três condições de prompting estratificado: Ingênuo, Chain-of-Thought e Adversarial. Dois fenômenos são documentados: o Adversarial Compensation Effect (ACE), no qual a acurácia melhora sob pressão adversarial enquanto a estabilidade dos traços se degrada, e o raciocínio comprimido, no qual respostas corretas coexistem com justificativas superficiais. A análise de alinhamento humano revelou correlação de Kendall próxima de zero (τ_b ≈ 0) entre rankings de juízes-LLM e especialistas humanos, identificando uma limitação estrutural dos protocolos LLM-as-judge. Este trabalho foi aceito para publicação no Journal of the Brazilian Computer Society (JBCS).
Pilar 2: Avaliação de Qualidade em Retrotradução. O segundo pilar apresenta um framework estatístico para detecção de artefatos verbatim em retrotradução por LLMs. Utilizando testes não paramétricos (Friedman com análise post-hoc de Dunn e correção de Benjamini-Hochberg), o protocolo identifica dois clusters estatisticamente distintos de modelos a partir de 1.335 observações (89 × 5 × 3): {Claude 3.7, DeepSeek V3, Gemini 2.0} versus {Grok-Beta, GPT 4.5}, com diferenças médias de BLEU entre 0,065 e 0,081. O achado central é que escores BLEU anomalamente altos (> 0,90) podem resultar de reprodução memorizada do texto original, em vez de reconstrução translinguística genuína. A correlação moderada entre BLEU e Similaridade Semântica (0,41) confirma que métricas de superfície e métricas semânticas capturam aspectos complementares da qualidade de tradução. A ferramenta NLPMetricLab foi desenvolvida para avaliação multi-métrica reprodutível. Este trabalho foi publicado em Frontiers of Information Technology & Electronic Engineering (FITEE/Springer).
Pilar 3: DualBT (Diagnósticos de Retrotradução Dual para Governança Terminológica). O terceiro pilar formaliza a retrotradução como um operador de quase identidade em um espaço métrico completo, identificando duas condições suficientes (SC1, SC2) sob as quais o ciclo de retrotradução contrai para um ponto fixo único. Quatro métricas de nível terminológico são introduzidas: EMR (correspondência lexical binária), SMR (equivalência semântica com limiar τ), IRS (completude informacional graduada na escala {0; 0,5; 1}) e TDI (divergência distribucional via Jensen-Shannon sobre perfis TF-IDF). Uma camada diagnóstica de entropia dual separa o deslocamento lexical (divergência JS) da dispersão semântica (|Δh|/d via entropia diferencial kNN), permitindo a detecção de quatro modos de degradação (Q1-Q4) invisíveis a métricas de eixo único. Experimentos translinguísticos com 89 documentos, 5 LLMs e 3 repetições (N = 1.335) fornecem suporte estatístico frequentista e bayesiano para três hipóteses sobre invariância semântica, maturidade de domínio e efeitos de variante de escrita. Este trabalho foi submetido à Engineering (Elsevier).
Pilar 4: Framework IRT Unificado. O quarto pilar propõe três modelos Bayesianos aninhados para unificar métricas heterogêneas de avaliação em uma escala latente comum. O modelo Beta-IRT acomoda respostas contínuas em (0,1) via função de ligação logit, parametrizando a distribuição Beta pela habilidade latente θ_i do tradutor e pela dificuldade b_j do item. O modelo EIRT (Explanatory IRT) estende o Beta-IRT incorporando covariáveis dos Pilares 1-3 como preditores da dificuldade do item (x_j: TDI, JS, |Δh|/d, comprimento, frequência terminológica) e da habilidade do tradutor (z_i: família de modelo, contagem de parâmetros), permitindo explicar por que determinados itens são difíceis e por que determinados modelos falham. O modelo MFRM (Many-Facet Rasch Model) harmoniza sete facetas de avaliação (BLEU, chrF, COMET-QE, COMETKiwi, MetricX, LaBSE e MiniLM) em uma escala única, calibrando a severidade sistemática de cada métrica (c_k). O desenho de equalização indireta incorpora tradutores humanos como um 12º participante via facetas reference-free (COMETKiwi, MetricX, LaBSE), ancorado por anotações MQM em itens WMT. Esse desenho resolve o problema de escalas incomparáveis identificado na análise de plataformas: sem equalização, um modelo classificado em primeiro lugar por BLEU pode ocupar a quinta posição por COMET no mesmo conjunto de dados. Um estudo piloto (N = 450, K = 3) validou a viabilidade computacional da inferência Bayesiana via PyMC (4 cadeias, 2.000 warmup, 2.000 amostras, R-hat < 1,01, ESS > 400) e revelou uma disparidade de severidade de quase 10 vezes entre métricas (c_COMET-QE = +3,13 vs. c_LaBSE = +0,34), confirmando empiricamente que escores brutos não são diretamente comparáveis e atestando a necessidade do framework IRT para harmonização em escala latente. A convergência do operador de agrupamento foi verificada formalmente via prova em Lean 4 (0 sorry).
Pilar 5: AR-IRT (Degradação Semântica em Ecossistemas Multi-Agente). O quinto pilar estende o framework IRT estático para configurações dinâmicas via um modelo autorregressivo de ordem 1. A habilidade latente θ_i(t) de cada agente evolui segundo θ_i(t) = ψ · θ_i(t-1) + η_t, onde ψ < 1 implica decaimento exponencial com meia-vida semântica t_1/2 = -ln 2 / ln ψ. O modelo IRT estático do Pilar 4 é recuperado como caso especial quando ψ = 1, estabelecendo uma relação de aninhamento formal entre os dois pilares metodológicos. A análise empírica utiliza a plataforma Moltbook (157k posts, 39k agentes, 22 dias calendário com resolução de 8 horas, T = 45 pontos temporais) com baseline humano pré-2022 extraído do Reddit (5,6M posts). O pipeline de processamento segue cinco etapas: ingestão, geração de embeddings, agrupamento via HDBSCAN, mensuração por facetas métricas e modelagem AR-IRT. Uma análise de trilha dupla (categorias atribuídas pela plataforma e clusters latentes) alimenta o modelo de degradação, permitindo distinguir colapso semântico genuíno de variação temática natural. Propriedades formais (convergência geométrica sob contração ψ < 1, invariância de encoder com limites Wasserstein) foram estabelecidas, com a prova de convergência mecanicamente verificada em Lean 4. Este framework aguarda validação empírica completa sobre os dados do Moltbook.
Análise de lacunas em plataformas de avaliação. Uma análise sistemática das dez principais plataformas de avaliação de LLMs (HELM, Chatbot Arena, OpenLLM Leaderboard, BIG-Bench, MMLU, AlpacaEval, MT-Bench, WMT, LLMEval, SafetyBench/TruthfulQA) identificou quatro lacunas estruturais compartilhadas: (a) agregação escalar sem incerteza, na qual todas as plataformas colapsam dimensões de qualidade em um escalar único (rank, acurácia, Elo) sem intervalo de confiança; (b) escalas incomparáveis entre plataformas, na qual nenhum mecanismo de equalização permite combinar formalmente rankings de HELM com ratings do Chatbot Arena; (c) ausência de calibração de severidade de avaliadores, na qual métricas com disparidades de severidade de até 10 vezes são tratadas como equivalentes; e (d) ausência de dinâmica temporal, na qual nenhuma plataforma modela como a qualidade de avaliação evolui com atualizações e fine-tuning dos modelos. Essas lacunas motivam diretamente os Pilares 4 e 5 desta tese.
Conexões inter-pilares e contribuições. Os cinco pilares convergem em quatro eixos: (i) paralelos de inflação métrica, nos quais o ACE (Pilar 1), os artefatos verbatim (Pilar 2) e a dissociação EMR-entropia (Pilar 3) demonstram independentemente que métricas unidimensionais mascaram falhas; (ii) medidas de profundidade complementares, nas quais DoR, entropia diferencial e ORI capturam dimensões ortogonais de qualidade, validadas empiricamente pela correlação parcial entre os pilares; (iii) unificação psicométrica, na qual o EIRT integra covariáveis de todos os pilares empíricos em um único modelo latente, estimando simultaneamente a habilidade do tradutor θ_i, a dificuldade do item b_j e a severidade da métrica c_k; e (iv) sensibilidade temporal, na qual o AR-IRT estende a mensuração estática para detecção de colapso semântico ao longo do tempo, com o modelo estático recuperável como caso particular ψ = 1.