Detecção de áudios sintéticos com análise de robustez a ruído utilizando espectrogramas Mel e redes neurais convolucionais
redes neurais convolucionais, detecção de áudio sintético, espectrograma MEL, forense
Os rápidos avanços em modelos de síntese de fala baseados em redes neurais
têm introduzido desafios para a identificação de áudios sintéticos gerados
por essas tecnologias. Entre as ferramentas utilizadas nesse contexto está
o vocoder (do inglês voice encoder), um modelo capaz de analisar e
sintetizar sinais de voz. Ele permite não apenas a compactação e a
modificação do áudio, mas também a geração de fala artificial, incluindo a
recriação do timbre e das características específicas de uma voz humana.
Este trabalho implementa uma abordagem para detectar o uso de vocoders
neurais por meio da análise de imagens de espectrogramas Mel, utilizando
redes neurais convolucionais (CNNs) para identificar características
distintivas presentes em áudios gerados por vocoders. Começando com uma
visão geral abrangente dos vocoders, seu desenvolvimento histórico e as
tecnologias que impulsionaram os avanços dos vocoders neurais, destacamos a
transição das técnicas tradicionais de processamento de sinal para a
síntese impulsionada por aprendizado profundo. Nossa abordagem envolve
testar várias arquiteturas de CNNs e estressá-las sob diferentes condições
de ruído para avaliar a robustez e a eficácia de cada modelo na distinção
entre imagens de espectrogramas de áudios sintéticos e reais. Os resultados
demonstram que esse método baseado em imagens é eficaz para a detecção de
vocoders, embora testes adicionais sejam necessários para melhorar o
desempenho em diversos ambientes de áudio e tipos de vocoders.