Design of Efficient Spatiotemporal Architectures for Human Action Recognition
Reconhecimento de Ações Humanas; ConvNeXt; Autoatenção; Aprendizado Espaço-Temporal; Aprendizado Profundo Eficiente
O Reconhecimento de Ações Humanas (HAR) visa identificar ações humanas a partir de sequências de vídeo e requer a modelagem de informações espaciais e temporais. No entanto, modelos temporais complexos frequentemente aumentam o custo computacional sem garantir ganhos de desempenho. Este trabalho investiga arquiteturas eficientes ao combinar um backbone espacial ConvNeXt com diferentes estratégias de modelagem temporal, variando de métodos leves (Average Pooling, GRU, TConv) a módulos baseados em atenção (Attention Pooling, MHSA, Transformer, Conformer). Experimentos nos conjuntos de dados Weizmann e UCF-Sports demonstram que a agregação simples é competitiva em benchmarks mais simples, enquanto os mecanismos de atenção ajudam em ações mais complexas. Entre os módulos avaliados, o Multi-Head Self-Attention (MHSA) alcançou o melhor equilíbrio entre acurácia e simplicidade arquitetural. Análises adicionais mostraram que reduzir a dimensão de projeção do MHSA de 768 para 384 reduziu o custo do módulo temporal em 62% com uma perda mínima de desempenho, e a redução do número de cabeças de atenção de oito para quatro manteve a mesma acurácia. Trabalhos futuros estenderão essas simplificações estruturais para benchmarks maiores, como UCF101 e HMDB51, a fim de desenvolver modelos de HAR compactos e eficientes.