Um Framework para Recomendação de Configuração para Cargas Analíticas em Arquiteturas Lakehouse sobre Kubernetes
Lakehouse, Apache Spark, Kubernetes, Recomendação de Configu- ração, Ajuste Automático
A configuração do Apache Spark sobre Kubernetes para cargas analíticas é uma tarefa não-trivial, pois dezenas de parâmetros interagem de forma não-linear com a carga, com os dados e com a topologia do cluster. Além disso, as ferramentas de ajuste automático existentes concentram-se em clusters baseados em YARN, e não em ambientes Kuber- netes heterogêneos e geograficamente distribuídos. Este trabalho investiga um framework de recomendação de configuração para Apache Spark sobre Kubernetes em arquitetura lakehouse. O framework é treinado a partir de dados empíricos coletados ao longo de diferentes pipelines de cargas TPC-DS (Transaction Processing Performance Council De- cision Support ) no cluster da RNP (Rede Nacional de Ensino e Pesquisa). O conjunto consolidado nesta versão de qualificação contém 14.285 observações por consulta bem- sucedidas, provenientes de 208 execuções (de 483 planejadas), em seis fatores de escala (10, 50, 100, 250, 500, 750). A abordagem proposta combina árvores por gradient boost- ing com atribuição via SHAP e um conjunto de regras para cold-start e extrapolação, e é exposta ao usuário final por meio de uma interface de linha de comando e uma aplicação web. Os resultados preliminares mostram que a configuração ótima depende do fator de escala e da estrutura da consulta, e que os modelos supervisionados superam os baselines agnósticos à carga na predição do tempo de execução.