scieee AI-readable full text Open interactive document viewer

Identificação de jogadores atípicos no campeonato brasileiro de futebol com uso de aprendizado de máquina

Oliveira, Rodrigo Marcel Araujo; Sant'Anna, Angelo; Ferreira, Paulo Henrique

Abstract

No futebol profissional, a avaliação de desempenho dos atletas é fundamental para tomadas de decisão que envolvem técnicas e estratégias. Geralmente, essas avaliações são feitas com base em indicadores isolados, como gols ou assistências. No entanto, essas métricas podem não capturar o desempenho global do jogador, especialmente considerando diferentes funções em campo. Este trabalho propõe uma abordagem baseada em detecção de outliers, utilizando o algoritmo Isolation Forest (iForest), para identificar jogadores com desempenhos atípicos, tanto positivos quanto negativos, ao longo das partidas. A técnica de Análise de Componentes Principais (PCA) foi empregada para reduzir a dimensionalidade dos dados e permitir a visualização dos jogadores em um espaço bidimensional, facilitando a identificação de padrões. O método SHapley Additive exPlanations (SHAP) foi utilizado para compreender quais variáveis mais influenciam a classificação de um jogador como fora do padrão. Os resultados permitem identificar de forma transparente os principais fatores técnicos e táticos associados aos desempenhos dos jogadores.

Full text

Identificac¸ ˜ ao de jogadores at´ıpicos no campeonato brasileiro de futebol com uso de aprendizado de m´ aquina Rodrigo M. A. Oliveira1,2,ˆ Angelo M. O. Sant’Anna1,2, Paulo H. Ferreira3 1Programa de P´ os-Graduac¸ ˜ ao em Engenharia Industrial 2Escola Polit´ ecnica, Universidade Federal da Bahia 2Instituto de Matem´ atica e Estat´ ıstica, Universidade Federal da Bahia Salvador - BA, Brasil [email protected], [email protected], [email protected] Introduc¸ ˜ ao No futebol profissional, a avaliac¸ ˜ ao de desempenho dos atletas ´ e fundamental para tomadas de decis˜ ao que envolvem t´ ecnicas e estrat´ egias. Geralmente, essas avaliac¸ ˜ oes s˜ ao feitas com base em indicadores isolados, como gols ou assistˆ encias. No entanto, essas m´ etricas podem n˜ ao capturar o desempenho global do jogador, especialmente considerando diferentes func¸ ˜ oes em campo. Este trabalho prop˜ oe uma abordagem baseada em detecc¸ ˜ ao de outliers, utilizando o algoritmo Isolation Forest (iForest), para identificar jogadores com desempenhos at´ ıpicos, tanto positivos quanto negativos, ao longo das partidas. A t´ ecnica de An´ alise de Componentes Principais (PCA) foi empregada para reduzir a dimensionalidade dos dados e permitir a visualizac¸ ˜ ao dos jogadores em um espac¸o bidimensional, facilitando a identificac¸ ˜ ao de padr˜ oes. O m´ etodo SHapley Additive exPlanations (SHAP) foi utilizado para compreender quais vari´ aveis mais influenciam a classificac¸ ˜ ao de um jogador como fora do padr˜ ao. Os resultados permitem identificar de forma transparente os principais fatores t´ ecnicos e t´ aticos associados aos desempenhos dos jogadores. Principais objetivos O presente estudo tem como objetivos: (i) classificar jogadores em grupos de alto desempenho, baixo desempenho e desempenho normal, ao longo das partidas; (ii) analisar os indicadores que mais contribuem para que um jogador seja considerado outlier; e (iii) gerar indicadores que possam servir de suporte ` a decis˜ ao para treinadores, analistas e departamentos de desempenho. Estudo de caso A base de dados utilizada compreende estat´ ısticas individuais de jogadores do campeonato brasileiro de futebol masculino, que corresponde ` a S´ erie A da temporada 2024. As vari´ aveis utilizadas est˜ ao diretamente relacionadas ao desempenho t´ ecnico e t´ atico dos jogadores, tais como: minutos jogados (Min.), gols marcados (Gols), assistˆ encias (Assis.), expectativa de gols (xG), expectativa de gols sem pˆ enaltis (npxG), expectativa de assistˆ encias (xAG), ac¸ ˜ oes que levam a finalizac¸ ˜ oes (SCA), ac¸ ˜ oes que levam a gols (GCA), precis˜ ao de passes (Cmp, Att, Cmp%), conduc¸ ˜ oes de bola e dribles (Conduc¸ ˜ oes, PrgC, Tent, Suc), bem como m´ etricas associadas ` a construc¸ ˜ ao de jogadas (PrgP). As informac¸ ˜ oes foram extra´ ıdas da seguinte base de dados dispon´ ıvel no Kaggle:brasileiro-player-stats-2024. Metodologia O iForest, proposto por [2], ´ e um modelo n˜ ao supervisionado para detecc¸ ˜ ao de outliers baseado em ´ arvores que visa isolar amostras atrav´ es de particionamentos recursivos. Para cada ponto in´ edito, o algoritmo gera uma pontuac¸ ˜ ao, representada pela Equac¸ ˜ ao (1), em que E(h(x)) ´ e o valor m´ edio das profundidades que um ponto in´ edito atinge em todas as ´ arvores da floresta. O fator de normalizac¸ ˜ ao c(k)(Equac¸ ˜ ao (2)) representa a profundidade m´ edia mal-sucedida em uma busca na ´ arvore bin´ aria, com krepresentando o n´ umero de pontos usados na construc¸ ˜ ao da ´ arvore; e a func¸ ˜ ao H(i)(Equac¸ ˜ ao (3)) o n´ umero harmˆ onico estimado. S(x, k)=2− E(h(x)) c(x),(1) c(x)=2H(k−1) −2(k−1) k,(2) H(i) = ln i+0,5772156649.(3) O PCA ´ e uma t´ ecnica de reduc¸ ˜ ao de dimensionalidade que transforma vari´ aveis correlacionadas em um novo conjunto de vari´ aveis ortogonais, denominadas componentes principais [1]. Essas componentes s˜ ao combinac¸ ˜ oes lineares das vari´ aveis originais e preservam a maior variabilidade poss´ ıvel dos dados. No contexto deste trabalho, a PCA permite visualizar os padr˜ oes de desempenho dos jogadores em duas dimens˜ oes, facilitando a identificac¸ ˜ ao de grupos e outliers. As variˆ ancias explicadas por cada componente correspondem aos autovalores da matriz de covariˆ ancia dos dados. A metodologia SHAP, proposta por [3], ´ e uma t´ ecnica utilizada para explicabilidade de modelos de aprendizado de m´ aquina. Essa abordagem ´ e baseada na Teoria dos Jogos e incorpora m´ etodos de interpretac¸ ˜ oes globais e locais como: importˆ ancia de recursos, dependˆ encia de recursos e interac¸ ˜ oes. Resultados A distribuic¸ ˜ ao da idade dos jogadores est´ a representada na Figura 1. Nota-se que a maior parte dos jogadores tem idade entre 20 e 35 anos. A Figura 2 representa a classificac¸ ˜ ao dos jogadores para os 10 primeiros colocados em relac¸ ˜ ao ` a quantidade de gols marcados, e a Figura 3 a quantidade de assistˆ encias por jogadores. Os dados foram segmentados por posic¸ ˜ ao, garantindo que a an´ alise considerasse a natureza espec´ ıfica das func¸ ˜ oes desempenhadas pelos atletas dentro de campo. A an´ alise descrita a seguir foi exemplificada com foco nos atacantes. Para garantir a comparabilidade entre vari´ aveis que possuem escalas distintas, todos os atributos quantitativos foram padronizados utilizando a distribuic¸ ˜ ao N(0,1), ou seja, transforma as vari´ aveis para uma distribuic¸ ˜ ao com m´ edia zero e desvio padr˜ ao unit´ ario. Figura 1: Distribuic¸ ˜ ao da idade dos jogadores. Figura 2: Classificac¸ ˜ ao dos jogadores por gols. Figura 3: Classificac¸ ˜ ao dos jogadores por assistˆ encias. O iForest foi ajustado com um parˆ ametro de contaminac¸ ˜ ao de 1%, refletindo a proporc¸ ˜ ao esperada de jogadores considerados como desempenhos at´ ıpicos ao longo das partidas. Os valores negativos do score do modelo para cada jogador indicam instˆ ancias normais e valores positivos indicam outliers. O resultado da classificac¸ ˜ ao est´ a disposto na Figura 4. Esse gr´ afico corresponde ` as informac¸ ˜ oes das vari´ aveis explicativas representadas em duas dimens˜ oes com aux´ ılio da t´ ecnica PCA. A primeira componente representa 35,4% e a segunda 48,4% da variˆ ancia total. Figura 4: Distribuic¸ ˜ ao dos dados em func¸ ˜ ao do PCA e da classificac¸ ˜ ao do iForest. Figura 5: Explicabilidade global do modelo iForest. A Figura 5 representa a explicabilidade global do modelo iForest com uso do SHAP. Ela fornece uma interpretac¸ ˜ ao global dos resultados; para cada ponto no gr´ afico, representa uma observac¸ ˜ ao da amostra. ´ E poss´ ıvel identificar o impacto de cada vari´ avel para a decis˜ ao do modelo na detecc¸ ˜ ao de outliers, conforme a tonalidade da cor. A quantidade de gols ´ e a vari´ avel mais importante para discriminar jogadores at´ ıpicos na posic¸ ˜ ao de ataque; portanto quanto maior ´ e esse valor, maior a pontuac¸ ˜ ao do iForest. Para a quantidade de minutos em campo, quanto menor esse valor, maior a pontuac¸ ˜ ao. Figura 6: Outlier. Figura 7: Normal. As Figuras 6 e 7 representam amostras de jogadores classificados como outlier e normal, respectivamente. Elas fornecem uma explicabilidade local. Para o jogador classificado como outlier as vari´ aveis com maiores pesos foram a quantidade de gols e expectativa de gols. Para o jogador classificado como normal as vari´ aveis com maiores contribuic¸ ˜ oes foram a precis˜ ao dos passes e quantidade de gols e dribles bem-sucedidos. Os jogadores foram posteriormente classificados em trˆ es categorias distintas: (i) alto desempenho, representando os outliers de melhor performance; (ii) baixo desempenho, correspondendo aos outliers negativos; (iii) e desempenho normal, compreendendo os jogadores dentro do padr˜ ao estat´ ıstico da amostra. No contexto dos jogadores do ataque, a distinc¸ ˜ ao entre alto e baixo desempenho levou em considerac¸ ˜ ao a m´ edia da expectativa de gols. Portanto, jogadores com ´ ındice abaixo da m´ edia foram classificados como baixo desempenho. Isso resultou em 1346 partidas de jogadores classificados como normais, 12 com alto e 2 com baixo desempenho. Conclus˜ oes A abordagem com iForest foi capaz de identificar jogadores com desempenhos at´ ıpicos. A t´ ecnica SHAP permitiu explicar os fatores mais relevantes para essa classificac¸ ˜ ao. Os resultados mostram o potencial do aprendizado de m´ aquina como ferramenta de apoio ` a an´ alise de desempenho no futebol. Agradecimentos Este estudo foi financiado em parte pela Coordenac¸ ˜ ao de Aperfeic¸oamento de Pessoal de N´ ıvel Superior (CAPES) - Brasil - C´ odigo Financeiro 001 Referˆ encias [1] Trevor Hastie, Robert Tibshirani, and Jerome Friedman. The Elements of Statistical Learning. 2009. [2] Fei Tony Liu, Kai Ming Ting, and Zhi Hua Zhou. Isolation forest. Proceedings - IEEE International Conference on Data Mining, ICDM, pages 413–422, 2008. [3] Scott M Lundberg, Paul G Allen, and Su-In Lee. A Unified Approach to Interpreting Model Predictions. Advances in Neural Information Processing Systems, 30, 2017. WECDAE I, Workshop de Estat´ ıstica e Ciˆ encia de Dados Aplicadas no Esporte - UFBA, 10 de junho, 2025, Salvador, Bahia, Brasil