Geração de Imagens Faciais com Difusão Estável: Um Estudo sobre a Representação de Raça, Gênero e Traços Anatômicos
Difusão Estável, Geração de Imagens, Reconhecimento Facial
Esta dissertação investiga a fidelidade semântica, a justiça representacional e a consistência descritiva na geração de imagens faciais sintéticas pelo modelo Stable Diffusion. Embora os modelos generativos baseados em difusão produzam imagens de alta qualidade,ainda há pouca investigação sobre sua precisão e equidade ao representar atributos humanos, como raça, gênero e idade. Essa limitação pode levar à amplificação de estereótipos e à subrepresentação de alguns grupos. Para preencher esta lacuna, propõem-se uma metodologia experimental que gera um vasto banco de 14.400 imagens a partir de 1.440 prompts textuais descritivos, cobrindo combinações balanceadas de seis grupos raciais,oito faixas etárias, dois gêneros e descritores anatômicos. A validação é realizada por dois classificadores faciais state-of-the-art, framework DeepFace e FairFace (ResNet-34) para quantificar a correspondência entre os atributos solicitados nos prompts e aqueles inferidos nas imagens geradas, assegurando validação cruzada, considerando os vieses das ferramentas.Os resultados preliminares revelam disparidades sistemáticas entre os atributos solicitados nos prompts e os inferidos nas imagens geradas. Observase maioracurácia para indivíduos brancos (75%) em comparação com outros grupos étnico-raciais,como asiáticos (48%), além de uma tendência de superclassificação da categoria “branco”.Na dimensão etária, os classificadores apresentaram erros mais pronunciados em crianças e idosos. Também foi identificada uma assimetria de gênero no DeepFace, com 100% de acerto para homens e 76% para mulheres.Para além da acurácia pontual, este trabalho introduz análises de consistência intra-prompt e de distinção inter-prompt, evidenciando que, apesar do realismo visual, o StableDiffusion apresenta limitações de fidelidade semântica na representação de atributos demográficos. Tais resultados sugerem que o modelo pode herdar e, potencialmente, amplificar vieses presentes em seus dados de treinamento. Ressalta-se, contudo, que essas conclusões dependem das capacidades e limitações dos classificadores empregados, os quais também carregam vieses próprios.