scieee AI-readable full text Open interactive document viewer

Graph neural network-based anomaly detection in financial transactions associated with money laundering

Oliveira, Rodrigo Marcel Araujo; Sant'Anna, Angelo; Ferreira, Paulo Henrique

Abstract

The money laundering is a global threat, compromising the integrity of the financial system and risking the stability of the global economy. This work proposes the use of complex network techniques and presents a methodology to detect anomalies in financial transactions of individuals under investigation for suspected money laundering. The methodology involves creating various financial indicators, such as the average, sum of transaction values, and the number of transactions sent and received by each bank account. In this context, the account number represents the node in the directed graph. The Unifying Local Outlier Detection Methods via Graph Neural Networks (LUNAR) algorithm was used to recognize patterns in financial transactions and identify anomalies. The results highlight the model's effectiveness, with Silhouette score and Davies-Bouldin Index metrics of 1.59 and 0.83 achieved on the test set, respectively. This indicates that groups of anomalous and normal accounts are well represented in terms of similarity and dissimilarity. The results are promising and may assist in investigations by helping to identify potential groups of individuals involved in illicit activities, such as drug and arms trafficking, fraud, and scams.

Full text

Livro de resumos do 2nd SaLLy Day 30 de novembro de 2024 Evento Online Editado por Paulo Canas Rodrigues Beatriz Lopes Maria Andreina Moreira Universidade Federal da Bahia, Salvador, Brasil Jonatha Sousa Pimentel Universidade Federal de Pernambuco, Recife, Brasil Web Design João Vitor Rocha da Silva SaLLy, UFBA, Salvador, Brasil Design da Capa Ana Caroline Pinheiro SaLLy, UFBA, Salvador, Brasil Citar como: Rodrigues, P.C.; Lopes, B.; Moreira, M. A..; Pimentel, J.S.; Silva, J.V.R. ; Pinheiro, A. C. Livro de resumos do 2nd SaLLy Day, 2024. Contents Part I. Introdução Bem vindo ao 2nd SaLLy Day ........................................................ 7 Comissões ............................................................................ 9 Part II. Programação Científica Programação Científica ............................................................... 13 Part III. Palestra de abertura Aprendizagem de máquina e as fronteiras com a estatística e a ciência de dados ...... 17 Luciano Rebouças Oliveira Part IV. Minicurso Transforme seus PDFs em chatbots: Um guia completo para RAG com R e python ... 21 Magno T. F. Severino Part V. Mesa Redonda O papel da estatística na inteligência artificial ........................................ 25 Júnia Ortiz, Jorge Mendes, Wagner Bonat, Téo Calvo e João Vitor da Silva Part VI. Sessão de Pôsteres SP1: Modelos para dados de contagem com superdispersão: Uma aplicação em dados da malária ............................................................................ 29 Abrantes Mussafo, José Govone e Liciana Arruda SP2: Modeling and forecasting intentional violent deaths (MVIs): Impact of actions in the years 2015 to 2023 in the state of Piauí ........................................ 30 Dario Galvão e Rita de Cássia de Lima Idalino SP3: Leak detection in water distribution networks through deep learning ............ 31 Mariana G. M. Pereira, Luciano M. Queiroz, Karla P. Oliveira-Esquerre e Enrique L. Droguett Contents Contents SP4: Adaptações do extreme gradient tree boosting (Xgboost) para base de dados desbalanceadas ....................................................................... 32 Gabriel Almeida Ferreira e Adriano Kamimura Suzuki SP5: O uso de LightGBM para identificar autistas: uma revisão sistemática .......... 33 Nayara Mota SP6: Explainable artificial intelligence for defect detection in industrial manufacturing processes ............................................................................. 34 Rodrigo Marcel Araujo Oliveira, Ângelo Márcio Oliveira Sant’Anna e Paulo Henrique Ferreira SP7: Graph neural network-based anomaly detection in financial transactions associated with money laundering .......................................................... 35 Rodrigo Marcel Araujo Oliveira, Ângelo Márcio Oliveira Sant’Anna e Paulo Henrique Ferreira SP8: O Método bootstrapping em regressão logística para previsão de diabetes ....... 36 Carla Patrícia de Carvalho Oliveira, Álbaro Ramon Paiva Sanz, Ursilandia de Carvalho Oliveira, Liciana de Arruda Silveira e Viriato Campelo SP9: Análise espaço-temporal da atividade de raios no Brasil de 2020 até 2022 ....... 37 Beatriz Lopes e Paulo Canas Rodrigues SP10: Aprimoramento da detecção de câncer em bases de imagens limitadas: Uma abordagem baseada em ensemble e aumento de dados ................................ 38 Fernando Moraes, Adriano Suzuki, Francisco Louzada Neto e Ricardo Rocha SP11: Modelo casual decision tree: Uma aplicação na avaliação do impacto heterogênico da campanha de vacinação da dengue ................................................. 39 Diego Santos Souza e Paulo Canas Rodrigues SP12: Análise temporal e espacial da inadimplência das famílias brasileiras ........... 40 Maria Moreira, Vanessa Barros e Paulo Canas Rodrigues SP13: Comparison between computer methods in the automatic detection of Alzheimer’s disease................................................................................ 41 Andriana Campanharo, Mário Vicchietti, Luiz Betting e Fernando Ramos SP14: Early detection of Alzheimer’s disease using complex network analysis ......... 42 Mário L. Vicchietti, Maria C. de Cola, Angelo Quartarone, Fernando M. Ramos e Andriana S. L. O. Campanharo Index ................................................................................. 43 2nd SaLLy Day, 30 de novembro de 2024, Evento Online 3 Part I Introdução 2nd SaLLy Day: O poder da Inteligência Artificial Bem Vindo ao 2st SaLLy Day! Em nome da Comissão Organizadora e da Comissão Científica, é com grande entusiasmo que damos as boas-vindas a todos os amantes e entusiastas da estatística, da aprendizagem de máquina e da inteligência artificial a segunda edição do SaLLy Day, um evento emocionante e enriquecedor organizado pelo Statistical Learning Laboratory (SaLLy) da Universidade Federal da Bahia. Neste dia de imersão intelectual, convidamos você a se juntar a nós para uma jornada repleta de descobertas, insights e aprendizados profundos no mundo da estatística e da inteligência artificial. O 2st SaLLy Day não é apenas um evento, mas uma oportunidade única de se conectar com especialistas renomados, colegas entusiasmados e mentes criativas que estão moldando o cenário da aprendizagem estatística. A organização deste encontro foi realizada pelo SaLLy - Statistical Learning Laboratóry e o seu objetivo é reunir investigadores e profissionais, da academia e da indústria, que desenvolvam e apliquem métodos estatísticos e computacionais a inteligência artificial. Este evento proporcionará um fórum para compartilhar e discutir formas de melhorar o acesso ao conhecimento e promover colaborações interdisciplinares. O programa científico inclui uma palestra de abertura, uma mesa redonda sobre o Papel da Estatística na Inteligência Artificial, um minicurso e uma sessão de pôster. Os expositores de pôster presentes no 2nd SaLLy Day tiveram a possibilidade de concorrer ao prêmio de melhor pôster. Os organizadores gostariam de agradecer aos colaboradores que forneceram apoio para tornar esta organização possível. Agradecemos aos palestrantes, aos debatedores da mesa redonda, aos expositores de pôsteres, e a todos os participantes por sua contribuição para a confecção de um grande programa científico. Obrigado a todos pela vossa contribuição! Em nome do Comité do Programa Científico e do Comité Organizador Local, Paulo Canas Rodrigues Coordenador da Comissão Científica do 2st SaLLy Day João Vitor R. Silva Coordenador da Comissão Organizadora Local do 2st SaLLy Day 2nd SaLLy Day, 30 de novembro de 2024, Evento Online 7 Part III Palestra de abertura Palestra de abertura Aprendizagem de máquina e as fronteiras com a estatística e a ciência de dados Luciano Rebouças Oliveira1,2 1Universidade Federal da Bahia, Brasil 2IVISION - Laboratório de Pesquisa em Visão Inteligente, UFBA, Brasil Email: lreb[email protected] Abstract A palestra explora o campo da aprendizagem de máquina, destacando sua interseção com a estatística e a ciência de dados. Serão abordados conceitos fundamentais desses campos, como modelagem estatística e algoritmos de aprendizado, e como suas fronteiras estão se tornando cada vez mais tênues no contexto moderno. O foco será na importância da estatística para garantir a robustez e a interpretabilidade dos modelos de aprendizado, bem como na contribuição da ciência de dados para a aplicação prática em grande escala. Exemplos práticos e desafios atuais serão discutidos, tentando apresentar uma visão abrangente para aqueles que desejam entender como esses domínios se complementam. 2nd SaLLy Day, 30 de novembro de 2024, Evento Online 17 Part IV Minicurso Minicurso Minicurso Transforme seus PDFs em chatbots: Um guia completo para RAG com R e python Magno T. F. Severino1 Instituto de Ensino e Pesquisa, INSPER, São Paulo E-mail: [email protected] Resumo: Neste minicurso, você aprenderá a construir chatbots inteligentes capazes de responder a suas perguntas com base no conteúdo de documentos em formato PDF usando R e Python. Utilizando as mais recentes tecnologias de inteligência artificial, como grandes modelos de linguagem e RAG (RetrievalAugmented Generation), você dará vida aos seus documentos, tornando-os acessíveis e interativos. Abordaremos desde os conceitos básicos de inteligência artificial generativa até a implementação prática de sistemas de RAG. Você aprenderá a preparar seus dados, criar representações numéricas (embeddings) dos textos, armazenar essas representações em bancos de dados vetoriais e, por fim, construir chatbots capazes de gerar respostas coerentes e informativas. 2nd SaLLy Day, 30 de novembro de 2024, Evento Online 21 Part V Mesa Redonda Sessão de Pôsteres Sessão de Pôsteres SP2: Modeling and forecasting intentional violent deaths (MVIs): Impact of actions in the years 2015 to 2023 in the state of Piauí Dario Galvão1e Rita de Cássia de Lima Idalino2 1SEDUC, Piauí Email: dario1p[email protected] 2Universidade Federal do Piauí, UFPI, Teresina, Piauí Email: [email protected] Abstract This study investigates Intentional Violent Deaths in Piauí from 2015 to 2023. It analyzes historical data and employs predictive statistical models to understand trends in IVDs, noting significant fluctuations influenced by events like the COVID-19 pandemic and the rise of criminal organizations. The research highlights seasonal variations and spatial distributions, particularly in the urban peripheries of Teresina, identifying areas of high violence. The analysis shows variable trends in IVDs, especially in 2019, 2020, 2022, and 2023, with increased median values likely linked to economic crises and local conflicts. Monthly data indicates that cyclical factors, such as year-end festivities, also impact IVD incidence. A spatial analysis reveals regions in Teresina with a high potential for violence, underscoring the need for targeted interventions. A significant finding is the reduction of approximately 15.25% in IVDs from 2022 to 2023, reflecting the positive impact of SSP-PI’s initiatives. This highlights the importance of data-driven security policies and strategic planning in public safety, enabling more effective resource allocation. The study advocates for an integrated approach to combat IVDs, combining quantitative and qualitative analyses, and emphasizes the need for ongoing monitoring and evaluation of public security. 30 2nd SaLLy Day, 30 de novembro de 2024, Evento Online Sessão de Pôsteres Sessão de Pôsteres SP3: Leak detection in water distribution networks through deep learning Mariana G. M. Pereira1, Luciano M. Queiroz2, Karla P. Oliveira-Esquerre3e Enrique L. Droguett4 1Water and Sanitation Company, EMBASA, Bahia Email: [email protected] 2Department of Environmental Engineering, Graduate Program in Environment, Water and Sanitation, Polytechnic School of Engineering, Federal University of Bahia, Bahia Email: [email protected] 3Department of Chemical Engineering, Graduate Program of Industrial Engineering, Polytechnic School of Engineering, Federal University of Bahia, Bahia Email: [email protected] 4Department of Civil and Environmental Engineering Center for Reliability Science and Engineering, Garrick Institute for the Risk Sciences, University of California, USA Email: [email protected] Abstract Water loss control is a priority for water supply companies around the world, given the scarcity of water resources. Leaks represent a large portion of the lost volume of water, and the precise and early detection of these anomalies in water supply networks remains a great challenge. Detection by inspection methods presents high monetary costs, limited response capacity, besides being a time-consuming and laborious activity. On the other hand, the detection approach using hydraulic models is difficult to implement, mainly in Brazil, due to the complex topology and the uncertainty in the hydraulic conditions of the water distribution networks. In this context, this research proposed the application of a Deep Learning algorithm to build a model for leak detection in water distribution networks. However, field hydraulic monitoring data presents high uncertainty, which makes it difficult to obtain accurate Machine Learning models. Therefore, a detailed exploratory and statistical data analysis was conducted to identify and preprocess the model’s input data. The treatments performed, including the imputation of missing values through the training of secondary time series models and geoprocessing for locating the anomaly and labeling the dataset, made it possible to minimize the influence of: low data quality; uncertainty regarding the actual start of leaks; and operational regimes or maintenance on the network that generate changes in hydraulic parameters similar to leaks. One of the biggest challenges was the amount of data available, approximately 380 million records even after scope delimitation. 2nd SaLLy Day, 30 de novembro de 2024, Evento Online 31 Sessão de Pôsteres Sessão de Pôsteres SP4: Adaptações do extreme gradient tree boosting (Xgboost) para base de dados desbalanceadas Gabriel Almeida Ferreira1e Adriano Kamimura Suzuki2 1Universidade de São Paulo, USP, São Paulo Email: [email protected] 2Universidade de São Paulo, USP, São Paulo Email: [email protected] Abstract Nesse trabalho, foram estudadas maneiras de adaptar o XGBoost para bases de dados desbalanceadas. Isso foi feito de duas formas: por meio do balanceamento artificial dos dados e pela utilização de uma função de perda adequada. A respeito dos métodos de balanceamento dos dados, foram utilizados métodos de oversampling (Smote, ADASYN, Borderline Smote e Random Oversampling), undersampling (Edited Nearest Neighbor, Tomek Links e Random Undersampling) e abordagem mista (SmoteEEN). Ademais, uma nova função de perda foi proposta, utilizando como base a função de perda Weighted Focal Loss, que já foi utilizada como função de perda em redes neurais e, recentemente, no XGBoost. Essa modificação consiste em modelar as probabilidades estimadas por meio da ligação potência logito, o que adiciona flexibilidade à função de perda, permitindo assimetria para modelar as probabilidades. Portanto, a nova função de perda tem três hiperparâmetros: dois que vêm da função Weighted Focal Loss, para controlar os falsos negativos e para "direcionar o aprendizado aos exemplos difíceis de classificar", e um que veio da função de perda potência logito, responsável por introduzir assimetria na forma como as probabilidades são modeladas. Os modelos supramencionados foram testados em 13 conjuntos com diferentes graus de desbalanceamento, utilizando um procedimento de otimização de hiperparâmetros e um esquema de validação adequado para evitar vazamento dos dados. Em geral, observamos que os modelos estudados podem ser utilizados como alternativa ao XGBoost sem nenhuma modificação, já que houve aumento nas métricas de área sobre a curva precision recall e área sobre a curva ROC. 32 2nd SaLLy Day, 30 de novembro de 2024, Evento Online Sessão de Pôsteres Sessão de Pôsteres SP5: O uso de LightGBM para identificar autistas: uma revisão sistemática Nayara Mota1 Universidade Católica, Salvador, Bahia Email: nay[email protected] Abstract Assim como a estatística convencional, a aprendizagem de máquina pode ser usada para analisar aspectos individuais e contextuais. O modelo de classificação LightGBM destaca-se por sua alta precisão e flexibilidade para manejar padrões não lineares. Assim, considera-se a ampliação de sua aplicabilidade para estudos preditivos de quadros clínicos com alta variabilidade, como o transtorno do espectro autista. Através de uma revisão sistemática nas principais bases de dados - IEEE, ACM, EMBASE e Google Acadêmico (os primeiros 10 registros), objetivou-se compreender o cenário científico quanto ao uso de LightGBM para identificar autismo. Realizou-se a seguinte busca por artigos: "lightGBM AND (autism or autistic)". No IEEE e no ACM, não houve resultados na categoria de artigos. Na MEDLINE, o único registro foi excluído por não referir-se ao autismo. No Google Acadêmico, após triagem e exclusão de registros que não fossem artigos ou que tivessem outros objetivos ou técnicas, foram incluídos 2 artigos à revisão. Entre estes, o uso de LightGBM, junto com a pesquisa aleatória para otimização de hiperparâmetros, promoveu alta precisão (>95) na classificação de autistas, em equivalência ao Autistic Spectrum Disorder Screening Test; assim como alta (>99%) precisão, especificidade e sensibilidade na classificação de autistas, ao manejar dados psicofisiológicos do eletroencefalograma. Portanto, esta aplicabilidade da LightGBM na classificação de pessoas autistas ainda é incipiente. A substituição das técnicas estatísticas convencionais por aprendizagem de máquina, especificamente LightGBM, para a validação de técnicas diagnósticas do autismo - como questionários e neuroimagem - demandará o manejo de variáveis clínicas e sociais diversificadas, através da interdisciplinaridade. 2nd SaLLy Day, 30 de novembro de 2024, Evento Online 33 Sessão de Pôsteres Sessão de Pôsteres SP6: Explainable artificial intelligence for defect detection in industrial manufacturing processes Rodrigo Marcel Araujo Oliveira1, Ângelo Márcio Oliveira Sant’Anna2e Paulo Henrique Ferreira1 1Polytechnic School, Federal University of Bahia, Bahia Email: ro[email protected] 2Polytechnic School, Federal University of Bahia, Bahia Email: angelo.san[email protected] 3Institute of Mathematics and Statistics, Federal University of Bahia, Bahia Email: [email protected] Abstract In Industry 4.0, machine learning algorithms for non-linear pattern recognition are transforming defect detection in manufacturing, enabling enhanced quality monitoring, operational efficiency, and competitiveness. Explainable Artificial Intelligence (XAI) can facilitate understanding how the models make decisions and assist in tracking anomaly points. This research proposes an XAI framework for machine learning models in defect detection. This work applied the multinational industry’s approach to the tire manufacturing process. Models such as random forest, gradient boosting decision tree, light gradient boosting machine, logistic regression, support vector machine, and multilayer perceptron were considered to evaluate the performance of tires in compliance with production standards. The selection of model parameters was based on the optimization technique using genetic algorithms. The random forest and logistic regression models achieved the best performances with an accuracy of 92% and 96%, respectively. The Local Interpretable Model-Agnostic Explanations (LIME) and SHapley Additive exPlanations (SHAP) methods were used to identify the relevant process variables. The approach presents the global and local interpretations of the results, allowing for a deeper understanding of how process variables discriminate the fault. This approach provides a relevant tool for quality control management in tire manufacturing industries. 34 2nd SaLLy Day, 30 de novembro de 2024, Evento Online Sessão de Pôsteres Sessão de Pôsteres SP7: Graph neural network-based anomaly detection in financial transactions associated with money laundering Rodrigo Marcel Araujo Oliveira1, Ângelo Márcio Oliveira Sant’Anna2e Paulo Henrique Ferreira1 1Polytechnic School, Federal University of Bahia, Bahia Email: ro[email protected] 2Polytechnic School, Federal University of Bahia, Bahia Email: angelo.san[email protected] 3Institute of Mathematics and Statistics, Federal University of Bahia, Bahia Email: [email protected] Abstract The money laundering is a global threat, compromising the integrity of the financial system and risking the stability of the global economy. This work proposes the use of complex network techniques and presents a methodology to detect anomalies in financial transactions of individuals under investigation for suspected money laundering. The methodology involves creating various financial indicators, such as the average, sum of transaction values, and the number of transactions sent and received by each bank account. In this context, the account number represents the node in the directed graph. The Unifying Local Outlier Detection Methods via Graph Neural Networks (LUNAR) algorithm was used to recognize patterns in financial transactions and identify anomalies. The results highlight the model’s effectiveness, with Silhouette score and Davies-Bouldin Index metrics of 1.59 and 0.83 achieved on the test set, respectively. This indicates that groups of anomalous and normal accounts are well represented in terms of similarity and dissimilarity. The results are promising and may assist in investigations by helping to identify potential groups of individuals involved in illicit activities, such as drug and arms trafficking, fraud, and scams. 2nd SaLLy Day, 30 de novembro de 2024, Evento Online 35 Sessão de Pôsteres Sessão de Pôsteres SP8: O Método bootstrapping em regressão logística para previsão de diabetes Carla Patrícia de Carvalho Oliveira1, Álbaro Ramon Paiva Sanz2, Ursilandia de Carvalho Oliveira3, Liciana de Arruda Silveira4e Viriato Campelo5 1Universidade Estadual Paulista Júlio de Mesquita Filho, UNESP, Botucatu, São Paulo Email: [email protected] 2Universidade Estadual da Paraíba, UEPB, Campina Grande, Paraíba Email: albaropaiv[email protected] 3Instituto Federal de Educação, Ciência e Tecnologia do Maranhão, IFM, Codó, Maranhão Email: ursilandia.oliv[email protected] 4Universidade Estadual Paulista Júlio de Mesquita Filho, UNESP, Botucatu, São Paulo Email: liciana.silv[email protected] 5Universidade Federal do Piauí, UFPI, Piauí Email: [email protected] Abstract Existem inúmeras aplicações que utilizam regressão logística em amostras obtidas por reamostragem, aproveitando a capacidade dos métodos de lidar favoravelmente com a alta demanda computacional. Neste contexto, aplicamos a técnica de bootstrap para prever o início do diabetes com base em um conjunto de dados de saúde. O conjunto de dados é composto por 768 registros de pacientes do sexo feminino, cada um caracterizado por oito atributos de saúde e uma variável binária indicando a presença (1) ou ausência (0) de diabetes. Ressalta-se que ajustou-se um modelo de regressão logística através de um modelo linear generalizado para dados binários, com o intuito de estimar a probabilidade de ocorrência de diabetes em função da glicose. Desse modo, apresentamos através dos intervalos de confiança de 95% dos parâmetros desconhecidos do modelo do modelo logístico e odds ratio, para testar a hipótese de que a prevalência de diabetes não depende da glicose. Assim, utilizamos métodos clássicos e de bootstrap, incluindo abordagens paramétricas e não-paramétricas. Observamos que ao comparar os métodos bootstrap e a regressão logística clássica os resultados foram bastante similares. Conforme observado, o método bootstrap é uma técnica muito eficiente para avaliar a variabilidade dos coeficientes do modelo e apresentar estimativas robustas, prioritariamente em amostras pequenas ou em distribuições de variáveis desconhecidas. 36 2nd SaLLy Day, 30 de novembro de 2024, Evento Online Sessão de Pôsteres Sessão de Pôsteres SP9: Análise espaço-temporal da atividade de raios no Brasil de 2020 até 2022 Beatriz Lopes1e Paulo Canas Rodrigues2 1SaLLy, UFBA, Bahia Email: beatrizlop[email protected] 2SaLLy, UFBA, Bahia Email: paulo[email protected] Abstract O Brasil é considerado o país com maior incidência de raios no mundo. De acordo com estudos realizados pelo ELAT (Grupo de Eletricidade Atmosférica), caem em média 77,8 milhões de descargas no Brasil anualmente. A localização na região tropical, combinada com altas temperaturas e elevada umidade do ar, cria condições ideais para a formação desse fenômeno de consequências proporcionais a sua intensidade. Este trabalho tem como objetivo analisar a distribuição espaço-temporal da atividade de raios no Brasil, utilizando técnicas de Análise Exploratória de Dados Espaciais (AEDE) para interpretar os dados. Os materiais utilizados neste estudo foram obtidos do acervo virtual da Universidade Federal de Itajubá (UNIFEI), que disponibiliza registros de raios para toda a América Latina. Essas informações são coletadas pelo aparelho GOES-16 abordo do sensor Geostationary Lightning Model (GLM), operado pela NASA. O período de estudo (2020-2022) corresponde ao intervalo disponível para download no acervo. A fim de compreender a distribuição espacial dos raios no território brasileiro, foram utilizados os métodos estatísticos I de Moran Global e I de Moran Local. Através do I de Moran Global, foi possível identificar a existência de uma autocorrelação espacial do fenômeno. Já o I de Moran Local (LISA) confirmou a existência de uma autocorrelação positiva, sendo evidenciada visualmente em gráfico de dispersão e cartograma. Esses resultados indicam que municípios com alta concentração de raios tendem a estar próximos geograficamente uns dos outros, além disso, representam a maior parte da região estudada. 2nd SaLLy Day, 30 de novembro de 2024, Evento Online 37 Sessão de Pôsteres Sessão de Pôsteres SP10: Aprimoramento da detecção de câncer em bases de imagens limitadas: Uma abordagem baseada em ensemble e aumento de dados Fernando Moraes1, Adriano Suzuki2, Francisco Louzada Neto3e Ricardo Rocha4 1Universidade de São Paulo, USP, São Paulo Email: fernandohumb[email protected] 2Universidade de São Paulo, USP, São Paulo Email: [email protected] 3Universidade de São Paulo, USP, São Paulo Email: [email protected] 4Universidade Federal da Bahia, UFBA, Bahia Email: [email protected] Abstract Modelos de Deep Learning são promissores na análise de imagens, mas exigem muitos dados, dificultando seu uso em bases médicas limitadas. Em dados pequenos e desbalanceados, técnicas como transferência de aprendizado, ensemble, aumento de dados e reamostragem (undersampling e oversampling) melhoram a classificação de imagens. Este estudo aplica uma abordagem de ensemble com diferentes pesos para aprimorar a predição de classes minoritárias em dados oncológicos de câncer de pele e mama, obtendo melhores métricas com reamostragem e aumento de dados. 38 2nd SaLLy Day, 30 de novembro de 2024, Evento Online Sessão de Pôsteres Sessão de Pôsteres SP11: Modelo casual decision tree: Uma aplicação na avaliação do impacto heterogênico da campanha de vacinação da dengue Diego Santos Souza1e Paulo Canas Rodrigues2 1Universidade Federal da Bahia, UFBA, Bahia Email: [email protected] 2Universidade Federal da Bahia, UFBA, Bahia Email: paulo[email protected] Abstract As vacinas são um método de controle de epidemias, onde por meio de estudos clínicos randomizados controlados, são avaliadas a sua eficácia em um nível individual, porém os estudos clínicos citados não conseguem avaliar um programa de vacinação a nível populacional, e métodos quasi-experimentais precisam ser usados. Neste trabalho analisamos a casualidade do impacto heterogêneo da campanha de vacinação da dengue na redução de sua incidência utilizando o modelo Casual Decision Tree. 2nd SaLLy Day, 30 de novembro de 2024, Evento Online 39