Full text
| 24 de outubro de 2024 LIBRO DE RESUMOS
PROGRAMA E RESUMOS 24 de outubro de 2024 Organiza: Asociación de usuarios de software libre da Terra de Melide
Editado por: María José Ginzo Villamayor en Santiago de Compostela 2024 |Asociación de usuarios de software libre da Terra de Melide Obra baixo licenza Creative Commóns Atribución-Compartir igual 4.0 Internacional Atribución - Compartir igual En calquera mención da obra debe citarse a autoría Debe proverse enlace á licenza e indicalo cando se introduzan cambios A obra derivada debe licenciarse do mesmo xeito que a orixinal ISBN: 978-84-09-66122-0
Presentación A Asociación de usuarios de software libre da Terra de Melide (MeLiSA) comprácese en presentar a XI Xornada de Usuarios de R en Galicia. Este evento busca converterse nun punto de encontro para todas aquelas persoas interesadas en compartir as súas experiencias e establecer colaboracións dentro da comunidade, ao tempo que promove e difunde o coñecemento libre da linguaxe estatística R e as súas aplicacións prácticas. O programa contempla vinte relatorios ao longo de todo o día. Dos cales seis son convidados e ás outras catorce atenderon á chamada de recepción de propostas. O evento contará con participantes destacados do Centro de Investigación e Tecnoloxía Matemática de Galicia (CITMAga), da Xunta de Galicia, así como do Instituto Galego de Estatística e das tres universidades galegas ou da Universidad Carlos III de Madrid. Tamén participarán académicos de universidades internacionais, como a Universidad Cooperativa de Colombia, Universidade Federal Fluminense (Brasil) e da Academia da Força Aérea (Brasil), así como un profesor de Ensino Medio do IES Pedra da Auga en Ponteareas. Todo isto non sería posible sen o patrocinio de AMTEGA á que agradecemos a súa contribución. Santiago de Compostela, outubro de 2024 O Comité Organizador
Comités Comité organizador Comité científico María José Ginzo Villamayor Universidade de Santiago de Compostela Rafael Rodríguez Gayoso Asociación de usuarios de software libre da Terra de Melide María José Ginzo Villamayor Universidade de Santiago de Compostela Miguel Ángel Rodríguez Muíños Dirección Xeral de Saúde Pública (Consellería de Sanidade) Miguel Ángel Rodríguez Muíños Dirección Xeral de Saúde Pública (Consellería de Sanidade)
Información xeral Data 24 de outubro de 2024 Web das xornadas https://www.r-users.gal/ Certificados Todos os certificados remitiranse ás persoas solicitantes en formato dixital por correo electrónico unha vez rematada a XI Xornada. Lugar de celebración Aula Magna. Facultade de Matemáticas (USC)
Programa 24 de outubro de 2024
Índice npcirc: NOVAS ACTUALIZACIÓNS DE MÉTODOS NON PARAMÉTRICOS PARA DATOS CIRCULARES. María Alonso Pena, Jose Ameijeiras Alonso, Rosa M. Crujeiras e Irène Gijbels. Universidade de Santiago de Compostela .................................................................................. 11 R PARA A ELABORACIÓN E VISUALIZACIÓN DA ESTATÍSTICA DE VIVENDAS FAMILIARES PRINCIPAIS OCUPADOS EN GALICIA. Esther López Vizcaíno, Isabel del Río Viqueira e Solmary Silveira Calviño. Instituto Galego de Estatística .......................................................................... 46 OS EFECTOS DA PANDEMIA NA FENDA DIXITAL NA EDUCACIÓN EN AMÉRICA CENTRAL E DO SUR. José Manuel Amoedo, Bruno Blanco Varela e Hugo Campos-Romero. Universidade de Santiago de Compostela.............................................................................................................. 13 EFECTO DA ASMA NA CALIDADE DE VIDA AUTOPERCIBIDA POLOS PACIENTES EN ESPAÑA. Alba Paz Castro e José Manuel Amoedo. Universidade de Santiago de Compostela ......................... 67 R, WEBSCRAPING E OPEN SCIENCE. ESQUIVANDO BALAS EN MATRIX. Álvaro Theotonio. Universidad Carlos III de Madrid ................................................................................................. 74 COMPARISON OF CUMULATIVE INCIDENCE CURVES WITH MULTIPLE CAUSES OF DEATH. Nora Martínez Villanueva, Marta Sestelo, Luís Meira Machado e Javier Roca Padiñas. Universidade de Vigo ......................................................................................................................................... 50 KEEP THE BALL ROLLING: CONTROL ESTADÍSTICO DE LA CALIDAD PARA LA INDUSTRIA 5.0. Salvador Naya Fernández, Javier Tarrío Saavedra e Miguel Flores. Universidade da Coruña .... 55 NON METAS A GAMBA! ANÁLISES DE DATOS XENÓMICOS CON R. Adrián Casanova, Miguel Hermida, Paulino Martínez, Inmaculada Carrasco, Francisca Robles, Rafael Navajas, Roberto de la Herrán e Carmelo Ruiz. Universidade de Santiago de Compostela ........................................ 23 adegenet E parallelstructure: ANÁLISES XENÓMICOS DE ESTRUTURA POBOACIONAL EN ÁRNICA. Fernando Cabana, Adrián Casanova, Manuel A. Rodríguez-Guitian, Andrés Blanco, Carlos Real, Rosa Romero, Carmen Bouza e Manuel Vera. Universidade de Santiago de Compostela ................................................................................................................................. 19 O PAPEL DE R EN INVESTIGACIÓN MARIÑA. DA XENÓNMICA A ESTUDO GLOBAL DOS OCÉANOS. Isabel Fuentes Santos. Instituto de Investigacións Mariñas ....................................................... 41 CALCULO DE RUTAS DE ESCAPE NUN INCENDIO FORESTAL. Manuel Antonio Novo Pérez, Marta Rodríguez Barreiro e María José Ginzo Villamayor. Centro de Investigación e Tecnoloxía Matemática de Galicia ................................................................................................................ 59 CALCULANDO A SEVERIDADE DUN INCENDIO FORESTAL CON R. Marta Rodríguez Barreiro, Manuel Antonio Novo Pérez e María José Ginzo Villamayor. Centro de Investigación e Tecnoloxía Matemática de Galicia .............................................................................................. 68 EL ANÁLISIS POR COMPONENTES EN LAS CIENCIAS SOCIALES. Jorge Alejandro Obando, Aura Viviana Rincón Ramirez e Laura Nathalia Obando. Universidad Cooperativa de Colombia ....... 63 INTRODUCTION TO THE R PACKAGES BASED ON JDEMETRA+ 3RD VERSION. Cheyenne Amoroso, Carolina García Martos, Germán Aneiros, José A. Vilar Fernández, Manuel Oviedo de la Fuente, Mario Francisco Fernández. Universidade da Coruña ............................................... 17 APLICATIVOS PARA APRENDIZAGEM ACELERADA DAS ITERAÇOES DO MÉTODO SIMPLEX. Luciane Ferreira Alcoforado. Academia da Força Aérea, ............................................................ 37
Figura 2: Fenda en lectura Figura 3: Fenda en matemáticas 4. CONCLUSIÓNS A principal conclusión desta investigación é que a Pandemia de Covid-19 incremento a fenda no desempeño académico entre os estudantes con acceso a ordenador e conexión a internet na meirande nos países analizados. Se ben é preciso sinalar que existen certos matices e diferenzas entre os países e as competencias analizadas xa que os incrementos observados son dispares entre países e entre competencias. De feito, podemos observar como nalgúns países e competencias non existe un incremento significativo en dita fenda. As implicacións derivadas deste estudo para as políticas públicas son a necesidade de fomentar o igual acceso ás TIC entre os estudantes para garantir a equidade no sistema educativo e a relevancia de ter en conta a desigual exposición ante fenómenos adversos, como o foi a Pandemia da Covid-19, dos estudantes segundo o seu contexto de cara a protexer a aqueles máis vulnerables. Referencias [1] Ogundari, K. (2023). Student access to technology at home and learning hours during COVID-19 in the U.S. Educational Research for Policy and Practice, 22(3), 443–460. [2] OECD (2019). PISA 2018 Database. https://www.oecd.org/pisa/data/2018database/ [3] OECD (2023). PISA 2022 Database. https://www.oecd.org/pisa/data/2022database/ [4] Blanco-Varela, B., Amoedo, J. M., & Sánchez-Carreira, M. C. (2024). Analysing ability grouping in secondary school: A way to improve academic performance and mitigate educational inequalities in Spain?. International Journal of Educational Development, 107, 103028. [5] Stuart, E. A. (2010). Matching methods for causal inference: A review and a look forward. Statistical Science : A Review Journal of the Institute of Mathematical Statistics, 25(1), 1–21.
XI Xornada de Usuarios de R en Galicia Santiago de Compostela, 24 de outubro do 2024 Introduction to the R Packages based on JDemetra+ 3rd version Cheyenne Amoroso1, Carolina Garc´ıa-Martos2, Germ´an Aneiros1, Jos´e A. Vilar1, Manuel Oviedo de la Fuente1, Mario Francisco-Fern´andez1 1CITIC, Grupo MODES, Departamento de Matem´aticas, Universidade da Coru˜na. 2Escuela Tecnica Superior de Ingenieros Industriales (ETSII), Universidad Polit´ecnica de Madrid. ABSTRACT Time series can exhibit a variety of underlying patterns that contribute to the observed changes over a period of time. These patterns are crucial to understanding the dynamics within the data and can be broken down into three main components: trend, seasonal and irregular. The trend component represents the long-term movement in the data, often indicating growth or decline over an extended period. The seasonal component captures periodic fluctuations that occur at regular intervals, such as monthly or quarterly, reflecting recurring events such as holidays or seasonal weather patterns. Finally, the irregular component accounts for the random or unpredictable variations in the data that cannot be attributed to the trend or seasonal components. A common task in economics is the seasonal adjustment of time series, which involves removing the seasonal component from the data. This adjustment is crucial because seasonal fluctuations can obscure both short-term and long-term movements in the data, making it difficult to identify underlying trends and patterns. By removing the seasonal component, analysts can gain a clearer understanding of the underlying phenomena driving the series, allowing for more accurate forecasting and policy analysis. In 2009, the European Statistical System (ESS) published Guidelines on Seasonal Adjustment [1] with the aim of harmonising European practices and improving the comparability of national infra-annual statistics. Following the first edition in 2009, the revised ESS Guidelines on Seasonal Adjustment were published in 2015 [2], presenting theoretical aspects and practical implementation issues in a user-friendly and easy-toread framework. In line with the Eurostat guidelines, the National Statistics Institute (Spain) has established certain recommendations for the treatment of socio-economic time series [4]. The two most commonly used approaches to seasonal adjustment are ARIMA model-based adjustment and fixed filter-based adjustment. Both methods are recognised as equally valid by the ESS. Currently, INE applies seasonal adjustment using the ARIMA model-based approach. Specifically, the seasonal adjustment of time series is carried out using the Tramo-Seats method [3], which is a well-established procedure in the field of time series analysis and consists of two main stages. In the first step, a Reg-ARIMA model is fitted to the data to remove outliers and to account for calendar effects, such as the influence of holidays or different month lengths. This step is critical to isolate the deterministic effects that can bias the analysis. In the second stage, the signal is extracted using Wiener-Kolmogorov filtering, a sophisticated technique for separating the signal from the noise. The recommended seasonal adjustment methods are currently implemented in several ways. In particular, INE recommends the use of the JDmetra+ package, which is also
widely recommended by Eurostat. JDemetra+ is an open source software for seasonal adjustment and time series analysis, developed by the National Bank of Belgium in the framework of Eurostat’s ”Centre of Excellence on Statistical Methods and Tools” with the support of the Deutsche Bundesbank and Insee. There are several versions, including version 2.2.4, which is highly recommended, and the version 3.x family, which includes advanced features for seasonal adjustment and trend estimation, including high frequency data. The latest version 3.2.4 was released on 11 July 2024. The core Java algorithms of JDemetra+ can be accessed from within R. During the XI Xornada de Usuarios de R congress an overview of the R ecosystem in the context of JDemetra+ 3.x [5] is provided. Keywords: Seasonal adjustment, Tramo-Seats, JDemetra+. Acknowledgements: CITIC, as a center accredited for excellence within the Galician University System and a member of the CIGUS Network, receives subsidies from the Department of Education, Science, Universities, and Vocational Training of the Xunta de Galicia. Additionally, it is cofinanced by the EU through the FEDER Galicia 2021-27 operational program (Ref. ED431G 2023/01). References [1] Eurostat (2009). ESS Guidelines on Seasonal Adjustment: 2009 edition. [2] Eurostat (2015). ESS Guidelines on Seasonal Adjustment: 2015 edition. [3] G´omez, Victor and Maravall, Agustin (1996). Programs tramo and seats, instruction for user (beta version: september 1996). Working papers, Banco de Espa˜na. [4] INE (2019). Est´andar del INE para la correcci´on de efectos estacionales y efectos de calendario en las series coyunturales. [5] Palate, Jean and Alain Quartier la Tente (2024). rjd3tramoseats: Seasonal Adjustment with TRAMO-SEATS and ’JDemetra+ 3.0’, R package version 3.2.2. https://github.com/rjdemetra/ rjd3tramoseats
XI Xornada de Usuarios de R en Galicia Santiago de Compostela, 24 de outubro do 2024 ADEGENET E PARALLELSTRUCTURE: ANÁLISES XENÓMICOS DE ESTRUTURA POBOACIONAL EN ÁRNICA Fernando Cabana1, Adrián Casanova1, Manuel A. Rodríguez-Guitian2, Andrés Blanco1, Carlos Real3, Rosa Romero2, Carmen Bouza1, Manuel Vera1 1 Departamento de Zooloxía, Xenética e Antropoloxía Física, Facultade de Veterinaria, Universidade de Santiago de Compostela. Campus Terra, 27002 Lugo, España 2 Departamento de Produción Vexetal, Escola Politécnica Superior, Universidade de Santiago de Compostela. Campus Terra, 27002 Lugo, España 3 Departamento de Ecoloxía, Escola Politécnica Superior, Universidade de Santiago de Compostela. Campus Terra, 27002 Lugo, España RESUMO Dentro do amplo catálogo de paquetes do entorno R, moitos son fundamentais para a realización de análises xenómicas. Un exemplo destas análises serían aquelas que procuran definir as estruturas poboacionais dun conxunto de mostras, para a xestión dos recursos naturais. Neste caso de estudo móstrase o uso de dous paquetes de R, adegenet e ParallelStructure, para determinar a estrutura xenómica poboacional de 12 localidades de Arnica montana, planta medicinal con propiedades antiinflamatorias e de grande interese de conservación en Galicia e Europa. Estes paquetes ofrecen dúas aproximacións diferentes: (i) adegenet, baseada en análises discriminante de compoñentes principais e (ii) ParallelStructure o cal optimiza o programa de análise bayesiano STRUCTURE para poder procesar un gran volume de datos xenómicos. Palabras e frases chave: Arnica montana, xenómica, estrutura poboacional. 1. INTRODUCIÓN Arnica montana L. é unha planta perenne da familia das asteráceas, distribuída ao longo de Europa. Ten interese farmacéutico debido as súas propiedades antiinflamatorias, derivadas de metabolitos secundarios, basicamente lactonas sesquiterpénicas. No estudo do presente caso, realizouse unha primeira aproximación xenómica como continuación de estudos xenéticos previos [1,2,3]. A partir de 120 individuos de 12 localidades do norte de España (Táboa 1), obtivéronse 5675 marcadores de polimorfismos de nucleótido único (SNPs, do inglés Single Nucleotide Polymorphisms). Dentro da batería de análises realizadas a partir destes marcadores atópanse análises de estrutura poboacional. Para estas, empregáronse dous paquetes de R, adegenet [4] e ParallelStructure [5], sitos nos repositorios, CRAN (https://cran.rproject.org/) e R-forge (https://r-forge.r-project.org/), respectivamente.
Táboa 1: Localidades co seu código asociado e o número de individuos mostrados. O paquete adegenet permite inferir a estrutura xenómica dos nosos datos en dúas etapas principais Na primeira etapa definiríanse o número de unidades poboacionais máis probables segundo o criterio de información bayesiana (BIC, do inglés Bayesian Information Criterion) empregando a función “find.clusters”. Posteriormente, na segunda etapa consistiría na realización de análises discriminantes de compoñentes principais (DAPCs, do inglés Discriminant Analysis of Principal Components) [6] coa función “dapc”. Este método consta a súa vez de dous pasos: a análise de compoñentes principais ou PCA (Principal Component Analysis) + a análise discriminante ou DA (Discriminant Analysis). Os DAPCs teñen como obxectivo mostrar as diferencias entre grupos minimizando as variacións dentro dos grupos, de menor interese neste tipo de análises. A selección do número de compoñentes principais é unha decisión crítica, e existen diferentes criterios publicados na bibliografía científica. Por outra banda, o paquete ParallelStructure permite a execución e a paralelización da ferramenta STRUCTURE [7]. Este programa, identifica o número de unidades poboacionais máis probable entre os analizados en base a certas asuncións xenéticas (e.g., equilibrio de Hardy-Weinberg dentro das unidades poboacionais identificadas) empregando unha aproximación bayesiana. Ao empregar de miles a millóns de marcadores, con longas iteracións (100,000-1,000,000), ademais de analizar un elevado número de unidades poboacionais posibles (Ks) para as nosas mostras, estas análises son computacionalmente moi intensivas. Isto implica que a paralelización (i.e., emprego paralelo de varias unidades de procesamento) é fundamental para poder manexar tempos de execución razoables tanto en local (e.g., ordenador de sobremesa) como en centros de supercomputación. 2. METODOLOXÍA Co paquete de R adegenet utilizouse a función “find.clusters” testando até K = 20 unidades poboacionais ou clústeres, empregando 1,000,000 iteracións por cada K. Para a selección do número de clústeres máis probables seleccionáronse as Ks cos valores BIC máis baixos. Posteriormente, no DAPC, probáronse diferentes criterios para a selección do número de compoñentes principais : (i) o criterio de porcentaxe de varianza conservada (capturando tantos PCs necesarios para reter tanto o 50% como para o 90%) Localidade Código Nº Individuos Ponte Pedrido (Guitiriz, Lugo) PPED 10 Outeiro de Rei (Lugo) OUT 12 Ponte de Bous (Serra dos Ancares, Lugo) PBOU 12 Catro Carballos (Serra dos Ancares, León) CCAR 5 Marco do Pozo (Serra dos Ancares, Lugo) POZO 4 Alto do Couto (Serra do Courel, Lugo) COUT 10 Pico Formigueiros (Serra do Courel, Lugo) PFOR 9 Covadonga (Asturias) COME 11 Boya (Zamora) BOYA 13 Forcadura (Zamora) FORC 14 Salduero (Vizcaia) SALD 13 Ripollés (Girona) RIPO 7
(ii) α-score, a diferenza entre a proporción de reatribucións con éxito de análise (discriminación observada) e os valores obtidos utilizando grupos aleatorios (discriminación aleatoria). (iii) retención dun número de compoñentes principais equivalente ao número de Ks inferidos mediante “find.clusters” -1, empregando a configuración inicial das localidades, criterio baseado en [8]. Tras unha comparación de resultados, este último criterio foi o elixido para empregar en todas as análises de DAPC xa que ademais de reter unha elevada porcentaxe da variación total dos datos (i.e., >50%; primeiro criterio) os resultados foron similares. As análises con ParallelStructure foron realizadas no supercomputador FinisTerrae III do Centro de Supercomputación de Galicia (CESGA). Testouse un número de K dende 1 ata 13 (número de localidades + 1) cos modelos ADMIXTURE (podería haber fluxo xénico e híbridos entre diferentes localidades) e frecuencias alélicas correlacionadas. Para a interpretación de resultados empregouse o programa web StructureSelector [9], que ofrece diferentes estimadores do valor de K máis probable [7, 10-11], e a representación visual empregando o programa CLUMPAK [12]. 3. RESULTADOS Os resultados atopados con ambos métodos foron consistentes entre si (Figura 1).
Figura 1: A: Visualización de CLUMPAK dos resultados de STRUCTURE para diferentes K (2,3 e 4 con apoio dos modelos). Cada individuo está representado como unha barra vertical dividida en segmentos segundo a proporción do xenoma pertencente a cada un dos clústeres inferidos (en cores distintas). Observamos dous grandes bloques, que ao aumentar K se diferencian en subgrupos. As: Asturias; Za: Zamora; Vi: Bizcaia; Gi: Xirona B e C: resultados de DAPC comparando o primeiro DA eigenvalue co segundo (B) e co terceiro (C) respectivamente. Os individuos están representados como puntos e as localidades como elipses de inercia. Dependendo do estimador de K de STRUCTURE empregado obtivéronse distintos resultados. Isto apuntaría a unha xerarquía dos clústeres estruturais, en que algúns se subdividen en varios segundo consideramos a posibilidade de maiores K (Figura 1). Os resultados suxerirían que hai dous clústeres principais, representados en azul e laranxa respectivamente (Figura 1) coincidindo con observacións de traballos previos. Ademais, obsérvase que localidades próximas entre si (CCAR-POZO) e afastadas (COME-SALD)agruparíanse en clústeres propios con maiores valores de K, suxerindo a implicación de factores demográficos e adaptación locais na estrutura poboacional. AGRADECEMENTOS Este traballo foi apoiado polos contratos da Deputación de Lugo para estudos de Arnica montana dos anos 2023 e 2024. Fernando Cabana foi beneficiario dunha Bolsa Iniciación á Investigación do Campus Terra (2024).Agradecemos o apoio bioinformático do CESGA. Referencias [1] Vera, M., Romero, R., Rodríguez Guitián, M., Barros, R., Real, C. e Bouza, C. (2015). Phylogeography and genetic variability of the Arnica montana chemotypes in NW Iberian Peninsula. Silvae Genetica, 63, 293–300. [2] Vera, M., Mora, G., Rodríguez-Guitián, M. A., Blanco, A., Casanova, A., Real, C., Romero, R. e Bouza, C. (2020). Living at the edge: population differentiation in endangered Arnica montana from NW Iberian Peninsula. Plant Systematics and Evolution, 306, 44. [3] Bouza, C., Lorenzo, I., Rodríguez-Guitián, M. A., Casanova, A., Real, C., Romero, R. e Vera, M. (2023). Genetic survey extension of the threatened Iberian Arnica montana L. revealed the presence of divergent plastid lineages and highly structured populations in northern Spain. Genetic Resources and Crop Evolution, 70, 1677–1689. [4] Jombart, T. e Ahmed, I. (2011). adegenet 1.3-1: new tools for the analysis of genomewide SNP data. Bioinformatics, 27, 3070–3071. [5] Besnier, F. e Glover, K. A. (2013). ParallelStructure: A R Package to Distribute Parallel Runs of the Population Genetics Program STRUCTURE on Multi-Core Computers. PLOS ONE, 8, e70651. [6] Jombart, T., Devillard, S. e Balloux, F. (2010). Discriminant analysis of principal components: a new method for the analysis of genetically structured populations. BMC Genetics, 11, 94. [7] Pritchard, J. K., Stephens, M. e Donnelly, P. (2000). Inference of Population Structure Using Multilocus Genotype Data. Genetics, 155, 945–959. [8] Thia, J. A. (2023). Guidelines for standardizing the application of discriminant analysis of principal components to genotype data. Molecular Ecology Resources, 23, 523–538. [9] Li, Y. L. e Liu, J. X. (2018). StructureSelector: A web-based software to select and visualize the optimal number of clusters using multiple methods. Molecular Ecology Resources, 18, 176–177. [10] Evanno, G., Regnaut, S. e Goudet, J. (2005). Detecting the number of clusters of individuals using the software STRUCTURE: a simulation study. Molecular Ecology, 14, 2611– 2620. [11] Puechmaille, S. J. (2016). The program STRUCTURE does not reliably recover the correct population structure when sampling is uneven: subsampling and new estimators alleviate the problem. Molecular Ecology Resources, 16, 608–627. [12] Kopelman, N. M., Mayzel, J., Jakobsson, M., Rosenberg, N. A. e Mayrose, I. (2015). CLUMPAK: a program for identifying clustering modes and packaging population structure inferences across K. Molecular Ecology Resources, 15, 1179–1191.
TOPONOMASTICS, UMA FERRAMENTA PARA O ESTUDO DA TOPONÍMIA COM FOCO NO SUPERESTRATO Afonso Xavier Canosa Rodrigues 11 1 IES Pedra da Auga (Ponteareas) RESUMO Obter listagens, mapas com a distribuição geográfica e processar os dados para a análise estatística é parte importante do estudo da toponímia. Apresentamos aqui uma série de funções de pesquisa e elaboração de informes (listagens, cartografia e gráficos) assim como exemplos de análises exploratórias obtidas com os scripts disponíveis no repositório Toponomastics, uma utilidade especialmente concebida para o trabalho com topónimos de superestrato de base antroponímica. Palabras e frases chave: toponímia, antroponímia, objetos geográficos, entidades geográficas, R 1. INTRODUÇÃO Toponomastics 1 é o nome dado a um repositório de funções desenhadas inicialmente para o estudo de temas (i.e. unidades lexicais em que segmentamos um topónimo) de origem antroponímica na toponímia. Os scripts permitem definir um tema (ou mais) e pesquisá-lo numa base de dados oferecendo listagens de resultados selecionados em função do tipo (ponto: localidade; ou polígono: freguesia ou concelho) assim como a sua distribuição espacial na área de estudo (mapas). Ainda que este tipo de perguntas pode ser respondido de modo direto ou com um mínimo de elaboração num SIG e mesmo em webs específicas de cartografia e toponímia, Toponomastics ambiciona criar um sistema em R que aproveite a versatilidade desta linguagem à hora de adicionar e processar os dados. 2. OBJETIVOS ESPECÍFICOS Os scripts atuais de Topomastics foram concebidos para operarem com as bases de dados do Plan Visor Básico da Xunta 2 , por estarmos a trabalhar nesta área e entendermos que oferece dados fiáveis a nível toponímico, para além de prover capas com os diferentes níveis administrativos. Porém, os dataframes são modificáveis e ampliáveis, e de facto estamos já a incorporar dados do Norte de Portugal, um continuum necessário na matéria de estudo. Objetivo geral de Toponomastics é ser aplicável a bases de dados doutras partes de Europa relevantes para o objeto principal de pesquisa: topónimos de base antroponímica e morfologia ditemática (dous temas num único topónimo). Topomastics está orientado para a análise de dados toponímicos com objetivos linguísticos. Nesta primeira fase o objetivo concreto é obter e processar os dados para oferecer respostas e produzir informes exploratórios rápidos (listagens, mapas, gráficos). A sequência dum script tipo segue um princípio cíclico[1] para resolver perguntas como: que topónimos contêm o tema x? qual é a distribuição espacial do tema x? qual é distribuição espacial do tema x vs. tema y? 1 https://github.com/afonsoxavier/toponomastics 2 https://mapas.xunta.gal/visores/pba
3. ESTRUTURA DUM SCRIPT TIPO 3.1 Nos scripts de exemplo oferecidos no repositório, os dados podem ser carregados automaticamente. Por segurança e para evitar a repetição de descarregamentos desnecessários, a função tem de ser ativada no próprio script. Uma vez obtidos os dados, selecionamos os mais relevantes dentro do conjunto, homogeneizamos colunas equivalentes mas com diferentes nomes nas taxonomias de origem para evitar a acumulação de NAs e melhorar a operatividade e finalmente ordenamos as variáveis mais relevantes. Toponomastics trabalha inicialmente com ficheiros tipo shape que converte num dataframe com o pacote sf[2], o utilizado de modo preferente para operar com os objetos geográficos. 3.2 Uma vez preparados os dataframes, a aplicação mais recorrente é a de pesquisa. A função data_search pesquisa um tema que nesta altura requer REGEX para precisar a posição prototemática ou deuterotemática (ambos casos são contemplados nos scripts de exemplo) e permite especificar o tipo de entidade (localidade, freguesia, concelho, comarca ou todas à vez). Da sua parte, search_comarca agiliza o processo de pesquisa sobre uma ou várias comarcas. A função unique_toponym produz um único resultado quando o topónimo se repete em vários níveis de tipo de entidade num mesmo espaço (ex. um concelho que também é freguesia ou lugar) para evitar distorções nas análises frequentísticas. Finalmente, entropy devolve a entropia do sistema gerado pelos topónimos e entidades geográficas associadas em que ocorre um tema. 3.3. Toponomastics oferece diferentes tipos de resultados sobre as pesquisas. A função list_toponimos, cria uma listagem ordenada com todos os topónimos para um tema (e posição). Cada entidade geográfica associada ao topónimo vem acompanhada da entidade maior a que pertence. Uma segunda função, barplot_freq, apresenta um gráfico de barras com as frequências dos topónimos a partir do tema dado e barplot_freq_entropy adiciona o número de expressões toponímicas, entidades geográficas e entropia como subtítulo. Finalmente full_report pesquisa, cria uma listagem de entidades e representa os resultados num mapa, todo na mesma função. 4. EXEMPLOS DE ANÁLISES EXPLORATÓRIAS Os casos a seguir foram obtidos com os scripts de mostra oferecidos no repositório de Toponomastics 3 . No primeiro exemplo utilizamos uma função de pesquisa para o deuterotema -ufe, produzimos listagens, filtramos entidades concorrentes para um mesmo topónimo, representamos no mapa as entidades geográficas e finalmente obtemos um gráfico com a produtividade de cada um dos topónimos associados ao tema (fig.1). 3 Visor_toponomastics_main.R exemplo dum script tipo, experiment_maps.R para exemplos de mapas e visor_toponomastics_particular_area.R, estudo duma área geográfica mais definida. Figura 1 Listagem e frequências dos topónimos com deuterotema -ufe
Para além de vermos a sua presença geográfica, podemos comprovar se há alguma relação espacial com outras formas. Neste caso (fig. 2) observamos a tendência à complementaridade que evidencia as formas pesquisadas serem variantes dum mesmo tema com distribuição geográfica. Se observamos que há uma relação local relevante podemos focar numa área. No seguinte exemplo vemos a distribuição das formas -mil e -mir (fig. 3). A presença dum clúster para as formas -mir faz com que exploremos com mais pormenor a área, por exemplo com um mapa que restrinja a pesquisa a nível comarcal (fig. 4). Figura 2 Relevância espacial da distribuição do deuterotema -ufe e variante -ulfe Figura 3 Distribuição das formas -mir e -mil
2. Procesamento dun ficheiro CSV que contén erros de formato e non resulta lexible Explicaremos un caso de procesar un ficheiro CSV de medicións (de máis de un millón de filas) que contiña erros de formato: non era un ficheiro CSV válido senón un TXT que case era un CSV. Non podía ser lido directamente mediante ningunha librería, polo que foi necesario programar un procesamento a medida un pouco máis avanzado.
3. Procesamento de múltiples ficheiros CSV co mesmo formato Mediante programación funcional (paquete purrr e paquete fs) conseguimos leer decenas de ficheiros CSV de similar formato. Cada ficheiro contén os datos dun período de tempo concreto. O proceso consolida varios ficheiros nun único dataframe (tibble).
3. Xeración de gráficos sofisticados de apoio ás explicacións numéricas Mediante ggplot automatizamos a creación de informes PDF de varias páxinas, con deceas de gráficos por páxina. Utilizamos ggforce::facet_wrap_paginate e ggplot2::ggsave.
3. Xeración de recomendacións mediante fórmulas Tamén xeramos de maneira automatizada (mediante R) decenas de recomendacións de uso a medida (para reducir gastos, dirixidas aos usuarios finais).
XI Xornada de Usuarios de R en Galicia Santiago de Compostela, 24 de outubro do 2024 Aplicativos para Aprendizagem Acelerada das Itera¸c˜oes do M´etodo Simplex Luciane Ferreira Alcoforado - Academia da For¸ca A´erea Brasileira (AFA) RESUMO Este trabalho apresenta a cria¸c˜ao de dois aplicativos Shiny desenvolvidos para facilitar o ensino do m´etodo Simplex em programa¸c˜ao linear. Esses aplicativos permitem a manipula¸c˜ao e resolu¸c˜ao de problemas de programa¸c˜ao linear de forma mais eficiente, automatizando a constru¸c˜ao e opera¸c˜ao de matrizes e vetores no procedimento iterativo do m´etodo. O objetivo ´e melhorar a compreens˜ao dos conceitos fundamentais do m´etodo Simplex, acelerando o tempo gasto nos c´alculos matriciais e promovendo uma experiˆencia de aprendizado mais dinˆamica. Palavras chave: M´etodo Simplex, itera¸c˜oes, opera¸c˜oes matriciais, aplicativo shiny. 1. INTRODUC¸ ˜ AO O ensino do m´etodo Simplex em programa¸c˜ao linear frequentemente enfrenta desafios relacionados `a manipula¸c˜ao de elementos matriciais. Estudantes muitas vezes encontram dificuldades na constru¸c˜ao e opera¸c˜ao de matrizes e vetores, o que pode limitar a explora¸c˜ao de diferentes problemas devido ao tempo necess´ario para estruturar e calcular as itera¸c˜oes do algoritmo Simplex. “Diretamente relacionadas com o c´alculo matricial, destacam-se as dificuldades relacionadas com a multiplica¸c˜ao de matrizes, facto explic´avel porque o algoritmo da multiplica¸c˜ao de matrizes ´e novo para os alunos e diferencia-se da habitual multiplica¸c˜ao de n´umeros reais.” (Barros, Ara´ujo e Fernandes, 2013) [5] . Al´em disso, o trabalho com os conte´udos de Matrizes, Determinantes e Sistemas Lineares (MDSL) apresenta dificuldades adicionais, pois s˜ao estruturas extensas e que necessitam de muitas opera¸c˜oes aritm´eticas precisas para serem realizadas. “A multiplica¸c˜ao de matrizes, embora poss´ıvel manualmente para elementos com baixa dimens˜ao, torna-se virtualmente impratic´avel de ser realizada, em sala de aula, quando a ordem da matriz ´e superior a trˆes. O excesso de c´alculos n˜ao contribui para manter o interesse dos alunos, principalmente daqueles que apresentam dificuldades e que se constituem na maioria dos alunos.” (Steinhorst, 2011) [6] . Essas dificuldades s˜ao corroboradas por estudos que mostram que a complexidade das opera¸c˜oes matriciais pode ser um obst´aculo significativo no aprendizado de programa¸c˜ao linear. A necessidade de realizar c´alculos precisos e a estrutura¸c˜ao de matrizes de alta ordem consomem tempo e podem desmotivar os alunos, limitando a pr´atica e a explora¸c˜ao de diferentes cen´arios de problemas. O algoritmo Simplex, desenvolvido por George Dantzig, ´e uma t´ecnica algor´ıtmica utilizada para encontrar a solu¸c˜ao ´otima de problemas de programa¸c˜ao linear [4]. Ele envolve a manipula¸c˜ao de matrizes e vetores para iterativamente melhorar a solu¸c˜ao at´e que a solu¸c˜ao ´otima seja encontrada. O m´etodo Simplex utiliza um estrutura matricial que representa o sistema de equa¸c˜oes lineares do problema. Cada itera¸c˜ao do algoritmo envolve opera¸c˜oes matriciais, como transposi¸c˜ao, invers˜ao e multiplica¸c˜ao de matrizes. Para enfrentar esses desafios, este artigo apresenta dois aplicativos Shiny desenvolvidos para acelerar o processo de manipula¸c˜ao e resolu¸c˜ao de problemas de programa¸c˜ao linear. Esses aplicativos permitem que os alunos tenham acesso a uma ampla variedade de problemas, com diferentes n´umeros de vari´aveis e restri¸c˜oes, e possam realizar as itera¸c˜oes do algoritmo at´e atingir sua regra de parada e analisar a solu¸c˜ao final. O objetivo ´e ilustrar como a linguagem R pode ser utilizada para inovar no aprendizado do m´etodo simplex atrav´es de um aplicativo funcional.
Ao automatizar a constru¸c˜ao e manipula¸c˜ao de matrizes, os aplicativos criados n˜ao apenas economizam tempo, mas tamb´em permitem que os alunos se concentrem na compreens˜ao dos conceitos fundamentais do m´etodo Simplex, em vez de se perderem em c´alculos tediosos. Dessa forma, a experiˆencia de aprendizado se torna mais rica e envolvente, promovendo uma melhor assimila¸c˜ao dos conte´udos e uma maior motiva¸c˜ao para explorar diferentes problemas de programa¸c˜ao linear. 2. APRESENTAC¸ ˜ AO DOS APLICATIVOS A base te´orica para a constru¸c˜ao dos aplicativos considera o problema que expressaremos na forma matricial, sendo A0uma matriz m×n′que representa os coeficientes das restri¸c˜oes do modelo inicial; c0que representa o vetor custo, x0que representa o vetor das vari´aveis de decis˜ao do modelo inicial e bque representa o vetor de recursos, cujas dimens˜oes s˜ao respectivamente n′×1, n′×1 e m×1. Assim, o modelo matem´atico inicia com a seguinte estrutura: Fun¸c˜ao Objetivo: min ou max z=cT 0·x0 Sujeito a: A0·x0≤b,x0≥0 Ap´os, coloca-se o problema na forma padr˜ao em que a fun¸c˜ao objetivo passa a ser de minimiza¸c˜ao (se inicialmente era max, multiplica-se o vetor cpor -1) e s˜ao acrescentadas a cada restri¸c˜ao do tipo ≤,mnovas vari´aveis de folga xn′+1, ...xn′+m, totalizando n=n′+mvari´aveis, alterando assim as dimens˜oes dos elementos matriciais e considerando o problema na forma de minimiza¸c˜ao com restri¸c˜oes de igualdade. O modelo forma padr˜ao se apresenta com a seguinte estrutura: min z=cT·x Sujeito a: A·x=b,x≥0 e b≥0 ´ E importante ressaltar que na forma padr˜ao a fun¸c˜ao objetivo linear deve ser minimizada; as restri¸c˜oes do problema s˜ao definidas por um sistema de equa¸c˜oes lineares; as condi¸c˜oes de n˜ao negatividade de todas as vari´aveis de decis˜ao complementam as restri¸c˜oes do problema. Para empregar o algoritmo Simplex, o sistema na forma padr˜ao ´e particionado em parte B´asica e N˜ao B´asica tal que xT= [xT N|xT B]; cT= [cT N|cT B]; A= [N|B], com IBeINos ´ındices das posi¸c˜oes do particionamento B´asico e N˜ao B´asico, respectivamente. Na primeira itera¸c˜ao do algoritmo Simplex, o particionamento ser´a sempre formado por IN= {1,2, ...n′}eIB={n′+ 1, ..., n}com B = I (matriz identidade de dimens˜ao m×m). A cada nova itera¸c˜ao, c´alculos como - solu¸c˜ao corrente obtida por B·xB=bou seja xB=B−1·bexN=−→ 0 . Vari´aveis cujo ´ındice pertence a INs˜ao sempre nulas, est´a ´e uma condi¸c˜ao para garantir que a solu¸c˜ao corrente seja um v´ertice da regi˜ao vi´avel. - custo relativo c′ i,i∈INobtido por c′ i=ci−λT·aital que λ=BT−1·cBeai´e a i-´esima coluna da matriz A. Verifica¸c˜ao da regra de otimalidade: c′ i>0∀i∈IN. Se a regra de otimalidade foi atingida, a solu¸c˜ao corrente ´e ´otima. Caso contr´ario deve-se realizar a troca da base para obter um novo v´ertice. Identificar o ´ındice k∈INcom menor custo relativo negativo. - dire¸c˜ao simplex ytal que y=B−1·ak, sendo aka k-´esima coluna da matriz A. - tamanho de passo ϵtal que ϵz=xz/yz, z ∈IB. Verifica¸c˜ao da regra de Parada: N˜ao Existe ϵj>0 para algum j∈IB? Se esta regra de parada foi atingida, conclui-se que n˜ao h´a solu¸c˜ao ´otima. Caso contr´ario, a vari´avel b´asica com o menor ϵj>0 deixar´a a base. Identificar o ´ındice s∈IBtal que ϵs=min{ϵj>0, ∀j∈IB}. Os novos contadores ser˜ao atualizados, considerando tal mudan¸ca e nova itera¸c˜ao ser´a iniciada com IN={1,2, ..., n′}−{k}∪{s}eIB={n′+ 1, n′+ 2, ..., m}−{s}∪{k} Formula¸c˜ao do Modelo O aplicativo ”Simplex Formas”([3]), ´e uma ferramenta essencial para a estrutura¸c˜ao de modelos de programa¸c˜ao linear. Ele permite que os usu´arios definam a fun¸c˜ao objetivo e as restri¸c˜oes do problema, retornando a forma padr˜ao, os elementos matriciais envolvidos e o particionamento inicial. Este aplicativo ´e especialmente ´util para estudantes que est˜ao come¸cando a aprender sobre programa¸c˜ao linear, pois facilita a visualiza¸c˜ao e compreens˜ao dos componentes fundamentais do modelo. A interface intuitiva permite a entrada de dados de forma simples e direta, auxiliando na constru¸c˜ao das matrizes e vetores necess´arios para a aplica¸c˜ao do m´etodo Simplex (Figura 1).
Figura 1: Aplicativo Simplex Formas. Fonte: [3], 2024. Algoritmo Simplex O aplicativo ”Simplex Entra e Sai da Base”((Figura 2), permite ao usu´ario informar o n´umero de vari´aveis e restri¸c˜oes, os coeficientes da fun¸c˜ao objetivo e restri¸c˜oes, as dire¸c˜oes das restri¸c˜oes e seus limites. As entradas s˜ao exibidas e edit´aveis dinamicamente, sem a necessidade de um bot˜ao ‘Submeter’. Al´em disso, o aplicativo auxilia nas itera¸c˜oes do algoritmo Simplex, fornecendo de modo autom´atico o particionamento da primeira itera¸c˜ao. A partir da an´alise dos custos relativos c′ ie dos tamanhos de passo ϵj, o usu´ario pode realizar a mudan¸ca de base, alterando o IBde entrada. Caso tenha d´uvida, pode conferir na aba ‘Pr´oxima Itera¸c˜ao’ a mudan¸ca que dever´a ser feita. Figura 2: Aplicativo Entra e Sai da Base. Fonte: [2], 2024. 3. RESULTADOS E CONCLUS ˜ OES Para ilustrar a efic´acia dos aplicativos desenvolvidos face ao objetivo proposto, vamos considerar um exemplo pr´atico de um problema de programa¸c˜ao linear, que tamb´em pode ser resolvido pelo m´etodo gr´afico conforme explicado em [1] e que agora ser´a detalhado com o m´etodo do algoritmo:
Maximizar Z= 3x1+ 2x2 Sujeito a: x1+x2≤4 2x1+x2≤5 x1, x2≥0 Passo 1: Formula¸c˜ao do Modelo: O usu´ario inicia o aplicativo “Simplex Formas”, inserindo a fun¸c˜ao objetivo Z= 3x1+ 2x2e as restri¸c˜oes do problema. O aplicativo apresenta a forma padr˜ao e os elementos matriciais envolvidos, facilitando a visualiza¸c˜ao da estrutura do problema. Passo 2: Inser¸c˜ao dos Dados: No aplicativo “Simplex Entra e Sai da Base”, o aluno informa o n´umero de vari´aveis (2) e restri¸c˜oes (2), inserindo os coeficientes da fun¸c˜ao objetivo considerando o problema na forma padr˜ao de minimiza¸c˜ao (-3 e -2), os coeficientes das restri¸c˜oes (1, 1; 2, 1), as dire¸c˜oes das restri¸c˜oes (≤) e os limites das restri¸c˜oes (4 e 5). As entradas s˜ao exibidas e edit´aveis dinamicamente. Passo 3: Primeira Itera¸c˜ao: O aplicativo auxilia na montagem da primeira itera¸c˜ao do m´etodo Simplex, fornecendo o particionamento inicial. O aluno pode analisar os custos relativos c′ ie os tamanhos de passo ϵj, e realizar a mudan¸ca de base alterando o ´ındice b´asico (IB) de entrada. Passo 4: Itera¸c˜oes Subsequentes: Caso o aluno tenha d´uvidas sobre a pr´oxima itera¸c˜ao, ele pode conferir na aba ‘Pr´oxima Itera¸c˜ao’ a mudan¸ca que dever´a ser feita. O aplicativo continua a auxiliar nas itera¸c˜oes at´e que a solu¸c˜ao ´otima seja encontrada. Se o modelo inicial era de maximiza¸c˜ao, a solu¸c˜ao ´otima de z∗dever´a ter ser sinal invertido, pois o problema resolvido ´e sempre de minimiza¸c˜ao (forma padr˜ao considerada). Os aplicativos foram desenhados para simplificar de modo significativo a manipula¸c˜ao de matrizes e a execu¸c˜ao do algoritmo Simplex, permitindo que os alunos se concentrem na compreens˜ao dos conceitos fundamentais. Com a capacidade de lidar com uma ampla variedade de problemas de programa¸c˜ao linear, permitindo variar o n´umero de vari´aveis e restri¸c˜oes, podendo explorar diferentes cen´arios e aprofundar sua compreens˜ao do m´etodo Simplex. A utiliza¸c˜ao da linguagem R e dos aplicativos Shiny ilustram a possibilidade de uma abordagem inovadora para o ensino de programa¸c˜ao linear, facilitando a aprendizagem de conceitos complexos e promovendo uma melhor assimila¸c˜ao dos conte´udos. Assim, ao automatizar a constru¸c˜ao e manipula¸c˜ao de matrizes, os aplicativos n˜ao apenas economizam tempo, mas tamb´em permitem que os alunos se concentrem na compreens˜ao dos conceitos fundamentais do m´etodo Simplex, promovendo uma melhor assimila¸c˜ao dos conte´udos e uma maior motiva¸c˜ao para explorar diferentes problemas de programa¸c˜ao linear. AGRADECIMENTOS ` A Divis˜ao de Ensino da Academia da For¸ca A´erea pelo apoio ao Projeto de Pesquisa Portaria AFA n. 87/SPPC. Referˆencias [1] L. F. Alcoforado. Programa¸c˜ao linear no plano: uma proposta usando ggplot2. In M. J. G. Villamayor, editor, X Xornada de Usuarios de R en Galicia, Santiago de Compostela, outubro 2023. [2] L. F. Alcoforado. Simplex entra e sai da base. https://lucianefalcoforado.shinyapps.io/Simplex_Entra_ Sai_Base/, 2024. Aplicativo Shiny para o m´etodo Simplex. Acessado em: 12 de setembro de 2024. [3] L. F. Alcoforado. Simplex formas. https://lucianefalcoforado.shinyapps.io/Simplex_Formas/, 2024. Aplicativo Shiny para o m´etodo Simplex. Acessado em: 12 de setembro de 2024. [4] M. N. Arenales, V. A. Armentano, R. Morabito, and H. H. Yanasse. Pesquisa Operacional. Elsevier, Rio de Janeiro, 1 edition, 2011. Cap´ıtulo sobre o M´etodo Simplex, incluindo a formula¸c˜ao original de Dantzig e desenvolvimentos subsequentes. [5] P. M. Barros, C. M. Ara´ujo, and J. A. Fernandes. Racioc´ınios de estudantes do ensino superior na resolu¸c˜ao de tarefas sobre matrizes. In J. A. Fernandes, M. H. Martinho, J. Tinoco, and F. Viseu, editors, Atas do XXIV Semin´ario de Investiga¸c˜ao em Educa¸c˜ao Matem´atica, Braga, 2013. ESTiG - Instituto Polit´ecnico de Bragan¸ca, Centro de Matem´atica – Universidade do Minho, CIEd – Universidade do Minho, Centro de Investiga¸c˜ao em Educa¸c˜ao da Universidade do Minho. [6] A. C. Steinhorst. O processo de constru¸c˜ao dos conceitos de matrizes, determinantes e sistemas lineares no ensino m´edio, utilizando a planilha como recurso: um estudo comparativo. Disserta¸c˜ao de mestrado, Pontif´ıcia Universidade Cat´olica do Rio Grande do Sul, Porto Alegre, 2011. Orientador: Prof. Dr. Lor´ı Viali.
XI Xornada de Usuarios de R en Galicia Santiago de Compostela, 24 de outubro do 2024 O papel de R en Investigaci´on Mari˜na. Da xen´onmica a estudo global dos oc´eanos Isabel Fuentes-Santos1 1Instituto de Investigaci´ons Mari˜nas (IIM-CSIC), 36208, Vigo, Espa˜na RESUMO O Instituto de Investigaci´ons Mari˜nas (IIM-CSIC) ´e un dos principais centros de investigaci´on mari˜na da Pen´ınsula Ib´erica. Mirando cara ao Atl´antico dende Vigo, o IIM-CSIC enfr´ontase ao reto de avanzar no co˜necemento sobre o oc´eano, dende as s´uas caracter´ısticas f´ısicas ata os alimentos que tomamos del e os procesos que interconectan todo o sistema. As li˜nas de investigaci´on do IIM van dende a secuenciaci´on de ADN ou estudos inmunol´oxicos de especies mari˜nas, ata a an´alise e modelizaci´on das caracter´ısticas tanto f´ısicas como bioxeoqu´ımicas de oc´eanos e ´areas costeiras. En cada un destes ´ambitos empr´eganse distintas metodoloxias de an´alise e inferencia estat´ıstica e, por tanto, distintos paquetes de R. Neste traballo facemos unha revisi´on dos paquetes de Rque se usan habitualmente no IIM. Os paquetes mgcv, para o axuste de modelos GAM e GAMM, e ggplot2, para representaci´on gr´afica, son ferramentas com´uns nas distintas ´areas de investigaci´on do centro. En ecolox´ıa mari˜na ´usase inferencia bayesiana, coa axuda de paquetes como INLA,SIBER,nicheROBER. En xen´omica e biotecnolox´ıa comb´ınase o uso de software espec´ıfico con paquetes como Bioconductor,adegenet,qiime2R ephylosec. Nembargantes, en oceanograf´ıa, con gran cantidade de datos espaciotemporais e direccionais, o uso de R´e residual, polo que tam´en exploramos a contribuci´on potencial de t´ecnicas estat´ıticas desenvolvidas nos ´ultimos anos e implementadas en Ra esta ´area de investigaci´on. Palabras e frases chave: Oceanograf´ıa, ecolox´ıa pesqueira acuicultura, xen´omica, bioinform´atica, an´alise estatistica.
para intercambiar información sobre fianzas de alugueiros firmado en maio de 2024 o IGVS proporciónalle ao IGE un rexistro onde constan as fianzas depositadas polos arrendadores dos bens inmobles en Galicia, co cal contén información daquelas vivendas que están alugadas, identificadas mediante a súa RC. Nos contratos de arrendamento relativos a vivendas e predios urbanos será obrigatoria a esixencia e prestación de fianza en metálico. Teñen a obriga de depositar esta fianza os arrendadores de vivendas e predios urbanos ante o IGVS. 3. PROCEDEMENTO SEGUIDO PARA O CRUCE DE TODAS AS BASES DE DATOS O proceso para a identificación e caracterización das vivendas familiares segue catro pasos: 1. En primeiro lugar definirase un directorio de vivendas a partir dos datos do Catastro Inmobiliario. O Catastro non identifica nin contabiliza vivendas, se non que identifica bens inmobles con uso residencial ou construcións con destino residencial. O ben inmoble é unha unidade xurídica, que o Catastro divide en construcións, en función das peculiaridades destas para definir con precisión as características dos inmobles e poder asignarlle a correspondente valoración catastral. A vivenda, sen embargo, é unha unidade física, tal e como se quere identificar neste traballo. Para chegar a este concepto a partir de vivenda e dende os bens inmobles foi necesario facer determinados procesos previos, en parte baseados no traballo de Enrique et al. [1]. A dificultade que presenta traballar con estas bases de datos é a dimensión das mesmas, por esta razón neste traballo empregouse o paquete de R dbplyr [5]. 2. A continuación farase unha asignación entre as vías do Catastro e as vías do Rueiro do Censo Electoral. É necesario determinar unha relación das vías de Catastro co Rueiro do Censo Electoral (utilizado no PMH) para poder identificar aquelas vivendas que son residencia habitual da poboación de Galicia. Cada persoa pode ter varias vivendas en propiedade (Catastro) -resida ou non nelase ao contrario, unha persoa pode residir (PMH) nunha vivenda que pode ter ou non en propiedade (pode ser alugada ou cedida); polo tanto, a relación entre os ficheiros de Catastro e de PMH deberá efectuarse empregando o enderezo das vivendas. Neste procedemento fanse moitas comparacións de textos e emprégase principalmente o paquete de [3]. Tamén se empregou ao paquete de R sf [6] para a xeración de envolventes convexas de vivendas co obxectivo de contrastar que as asignacións anteriores estivesen correctas. 3. Neste punto determinaranse as vivendas familiares principais no PMH. O PMH indica, para cada persoa, cal é o seu fogar padronal. Este fogar vén dado polas persoas empadronadas nun mesmo enderezo, ou, cando non está suficientemente determinado, polas persoas inscritas na mesma folla padronal. Neste procedemento empregaremos principalmente os paquetes dplyr, purrr, [5] e fuzzyjoin [8]. 4. Por último, asignaranse as RC ás vivendas principais do PMH. Neste punto está dispoñible o directorio de vivendas coas súas características e a súa titularidade de Catastro. Ademais, disponse da relación entre os códigos de vía de Catastro e os códigos de vías do PMH, obtidos nun procedemento anterior. Tendo en conta que o 78% das persoas galegas son propietarias da vivenda onde viven (IGE, 2020), cruzaremos o ficheiro da residencia das persoas do PMH (coas vivendas principais identificadas no paso anterior) co directorio de vivendas de Catastro, para asignarlle ás persoas a RC da vivenda onde residen. Neste procedemento empregaremos principalmente os paquetes do entorno tidyverse [5], stringdist [4], sf [6]
5. FERRAMENTAS DE VISUALIZACIÓN Unha vez que se dispón do directorio de vivendas familiares principais, é importante ter ferramentas de visualización que axuden, por un lado, a contrastar visualmente todos os traballos anteriores e, polo outro, a visualizar información agregada que nos achegue conclusións sobre o espazo habitado de Galicia. Neste punto botaremos man das librerías shinydashboard [9] e tmap[10]. Na Figura 1 presentamos un exemplo da visualización empregada. Figura 1. Vivendas familiares principais ocupadas no concello de Lugo segundo o ano de construción. Referencias [1] Enrique, I., Valverde, J, Ramirez, A., Ojeda, S. (2020) Identificación de las viviendas y sus características en la información del Catastro. El caso de Andalucía. Revista Catastro, 99. [2] IGE (2020) Enquisa estrutural a fogares. Vivendas familiares. Características e medio: https://www.ige.gal/web/mostrar_actividade_estatistica.jsp?idioma=gl&codigo=03040 05. [3] Selivanov D., Bickel, M., Wang, O. (2022) text2vec: Modern Text Mining Framework for R. R package version 0.6.3. https://CRAN.R-project.org/package=text2vec. [4] Van der Loo, M. (2014) The stringdist package for approximate string matching. The R Journal, 6, 111-122. https://CRAN.R-project.org/package=stringdist. [5] Wickham H, Girlich M, Ruiz E (2023) dbplyr: A 'dplyr' Back End for Databases. R package version 2.3.2, https://CRAN.R-project.org/package=dbplyr. [6] Pebesma, E., 2018. Simple Features for R: Standardized Support for Spatial Vector Data. The R Journal 10 (1), 439-446, [7] Wickham H, Averick M, Bryan J, Chang W, McGowan LD, François R, Grolemund G, Hayes A, Henry L, Hester J, Kuhn M, Pedersen TL, Miller E, Bache SM, Müller K, Ooms J, Robinson D, Seidel DP, Spinu V, Takahashi K, Vaughan D, Wilke C, Woo K, Yutani H (2019). “Welcome to the tidyverse.” _Journal of Open Source Software_, *4*(43), 1686. [8] Robinson D (2020). _fuzzyjoin: Join Tables Together on Inexact Matching_. R package version 0.1.6, https://CRAN.R-project.org/package=fuzzyjoin [9] Chang W, Borges Ribeiro B (2021). _shinydashboard: Create Dashboards with 'Shiny'_. R package version 0.7.2, <https://CRAN.R-project.org/package=shinydashboard> [10] Tennekes M (2018). “tmap: Thematic Maps in R.” _Journal of Statistical Software_, *84*(6), 1-39. doi:10.18637/jss.v084.i06 <https://doi.org/10.18637/jss.v084.i06>
XI Xornada de Usuarios de R en Galicia Santiago de Compostela, 24 de outubro do 2024 Comparison of cumulative incidence curves with m¸cultiple causes of death Nora M. Villanueva1, Marta Sestelo2,1, Lu´ıs Meira-Machado3and Javier Roca-Padi˜nas2,1 1Dep. Statistics and O.R., & SiDOR group, University of Vigo, Vigo 2CITMAga, Santiago de Compostela, 15782, Spain. 3Centre of Mathematics & Department of Mathematics, University of Minho, Portugal. RESUMO The comparison of multiple populations using different curves is a topic that arises frequently in many areas. This is particularly important in the medical field where one often wants to compare multiple survival curves [2, 3]. Though this can be performed using parametric models through the comparison of the resulting model parameters, nonparametric methods are usually used for this purpose. However, the proposed methods cannot be applied to competing risk survival data and there are few methods to compare groups or curves of interest in the presence of competing risks. Most of the literature is focused on the comparison of the cumulative incidence functions for a particular type of failure among different groups. However, the comparison of the cumulative incidence functions among each other is also useful since it can reveal whether two or more of these functions are equal or whether one is “more serious” than the other. With this in mind, we propose an approach that allows determining clusters of cumulative incidence functions with an automatic selection of their number [1]. Palabras e frases chave:: Multiple curves; Cumulative Incidence Functions; Clustering; Competing Risk data; Causes of Death. Referencias [1] Marta Sestelo, Lu´ıs Meira-Machado, Nora M. Villanueva, and Javier Roca-Pardi˜nas. A method for determining groups in cumulative incidence curves in competing risk data. Biometrical Journal, 66(4), 2024. [2] Nora M. Villanueva, Marta Sestelo, and Lu´ıs Meira-Machado. A Method for Determining Groups in Multiple Survival Curves. Statistics in Medicine, 38(5):366–377, 2019. [3] Nora M. Villanueva, Marta Sestelo, Lu´ıs Meira-Machado, and Javier Roca-Pardi˜nas. clustcurv: An R Package for Determining Groups in Multiple Curves. The R Journal, 13(1):164–183, 2021.
XI Xornada de Usuarios de R en Galicia Santiago de Compostela, 24 de outubro do 2024 Mandalas Matem´aticas: Uma Releitura das Padronagens e Cores das Cerˆamicas de Sargadelos Luciane Ferreira Alcoforado1, Jo˜ao Paulo Martins dos Santos1e Maria Cl´audia de Jesus Machado 1 1Academia da For¸ca A´erea, Pirassununga, S˜ao Paulo, Brasil. RESUMO Este trabalho apresenta a cria¸c˜ao de mandalas inspiradas nas cerˆamicas de Sargadelos, combinando an´alise hist´orica, padr˜oes geom´etricos e paletas de cores tradicionais com curvas matem´aticas e transforma¸c˜oes geom´etricas. O processo resulta em mandalas que reinterpretam a heran¸ca visual de Sargadelos, unindo hist´oria, matem´atica e computa¸c˜ao. Palavras chave: Mandalas. Padr˜oes Geom´etricos. Cerˆamicas de Sargadelos. 1. INTRODUC¸ ˜ AO Considerando a arte uma forma de comunica¸c˜ao, entende-se que ela constitui n˜ao apenas a express˜ao da beleza e da harmonia, mas tamb´em da express˜ao da identidade de um povo: sua hist´oria, seus costumes, suas cren¸cas, seu habitat. A arte da cerˆamica manifesta-se na cultura dos povos desde a mais remota antiguidade. Na Gal´ıcia destaca-se a cerˆamica de Sargadelos, cuja pintura possui padr˜oes geom´etricos tipicamente na cor azul cobalto em fundo branco. As cores verdes e ocre tamb´em est˜ao presentes, escolha que se justifica pelo modo de cozimento: “Los colores azules, verdes y ocres son ´oxidos met´alicos que cubren las piezas de Sargadelos en su mayor parte y resultan ser los colores m´as id´oneos para cocer bajo cubierta a tan altas temperaturas como exige la porcelana.” [7]. A hist´oria da produ¸c˜ao da cerˆamica de Sargadelos remonta ao s´eculo XIX impulsionada por Antonio Raimundo Ib´a˜nez, Marques de Sargadelos, com a cria¸c˜ao da primeira f´abrica na Gal´ıcia. Ressaltase que a mat´eria prima abundante na regi˜ao para a elabora¸c˜ao da cerˆamica era o caulim (argila branca). No entanto, no s´eculo XX, no p´os-guerra espanhol, os intelectuais Isaac D´ıaz Pardo y Luis Seoane L´opez iniciam um projeto de grande dimens˜ao, que levaria `a cria¸c˜ao do complexo industrial do Laborat´orio de Formas em 1963. Esse projeto visou, sobretudo, revitalizar a produ¸c˜ao de cerˆamica e, por meio dela, resgatar a hist´oria da terra galega e sua identidade, assim como a mem´oria hist´orica do lugar, que tinham sido desvalorizadas como consequˆencia da repress˜ao franquista. Inspiram-se em formas existentes na paisagem, no mundo rural, nos objetos herdados do passado, nas profiss˜oes, nas igrejas, nos monumentos. Todas estas formas refletem as caracter´ısticas culturais locais, mas agregando tra¸cos de modernidade. Destaca-se que o tipo de produ¸c˜ao da cerˆamica envolve processos mecˆanicos e manuais. Portanto, tradi¸c˜ao e renova¸c˜ao se fundem nas formas, no estilo desta cerˆamica e na maneira como ´e produzida. “El Laboratorio de Formas era la agrupaci´on de una serie de proyectos, algunos generados en la ´ultima etapa de la dictadura franquista, otros impulsados durante la transici´on democr´atica; los cuales se basaban en la idea de experimentaci´on, la renovaci´on de las producciones populares, la recuperaci´on del patrimonio material e inmaterial, incorporando emblemas del pasado, de la civilizaci´on celt´ıbera que entroncaban con las costumbres y la memoria” [8]
As joias, bem como os amuletos s˜ao exemplos desta fus˜ao. Acredita-se que os amuletos, na forma de pingentes, inspirados nas antigas lendas celtas, oferecem prote¸c˜ao contra as bruxas ou meigas, protagonistas do folclore galego, repleto de magia e mist´erio. Estas personagens femininas est˜ao associadas com feiti¸cos malignos em muitas hist´orias e, ao mesmo tempo, com habilidades m´agicas, capazes de curar. Por conseguinte, os desenhos que servem de inspira¸c˜ao para a cria¸c˜ao dos pingentes defensivos s˜ao uma fus˜ao da hist´oria, geografia e cultura do povo galego com um tipo de arte com tra¸cos mais contemporˆaneos. Neste contexto, considerando os padr˜oes geom´etricos e cores t´ıpicas presentes nas tradicionais cerˆamicas de Sargadelos, este trabalho se prop˜oe a produzir um conjunto de mandalas com base na integra¸c˜ao entre os elementos hist´orico-culturais da Gal´ıcia e os elementos Matem´aticos e Computacionais. 2. METODOLOGIA A metodologia b´asica para a constru¸c˜ao das mandalas foi baseada no processo desenvolvido em [1], [2] e complementado em [3], [4]. Um elemento essencial ´e que os autores pressup˜oem que uma curva seja conhecida, em geral na forma param´etrica. No presente artigo, esse pressuposto ´e violado, ou seja, um padr˜ao de cores e formas ´e apresentado e ´e necess´ario obter as figuras e cores elementares para o processo de constru¸c˜ao. Dessa forma, devido ao vi´es de associa¸c˜ao hist´orica, foi necess´ario um levantamento para estabelecimento das possibilidades de padr˜oes e cores. Ap´os, foi necess´ario estabelecer os padr˜oes de cores aproximados baseados em inspe¸c˜ao visual das cores do modelo RGB, dispon´ıveis no R b´asico (Ver [5]); as paletas de cores foram constru´ıdas de forma emp´ırica para refletir a colora¸c˜ao observada nas amostras de figuras consultadas. A identifica¸c˜ao das curvas que permitiram recriar, ao menos aproximadamente, os elementos geom´etricos da amostra, s˜ao objetos de an´alise da fase subsequente. Neste momento o processo de constru¸c˜ao converge para o delineamentos de [2], o qual aplica as transforma¸c˜oes geom´etricas tais como rota¸c˜oes, transla¸c˜oes, reflex˜oes e homotetias. A paleta de cores ´e composta de trˆes outras paletas de forma que ´e poss´ıvel estabelecer propor¸c˜oes das cores adotadas. Os pormenores podem ser consultados nos c´odigos disponibilizados no GitHub. Deve ser notado, no entanto, que apesar do delineamento dos elementos construtivos, h´a fases cr´ıticas no desenvolvimento, sendo que a principal ´e o estabelecimento de uma ou mais curvas, de forma emp´ırica, que ir˜ao possibilitar a cria¸c˜ao. 3. RESULTADOS E CONCLUS ˜ OES O levantamento da paleta de cores foi realizado com base em amostras do Cat´alogo da Galeria Oficial de Sargadelos, conforme Figura 2. A amostra de s´ımbolos utilizada para a constru¸c˜ao das mandalas tem´aticas est˜ao mostradas na Figura 1. Figura 1: Amostra de padr˜oes utilizados nas cerˆamicas de Sargadelos. Fonte: blog Art natura galicia, 2018. Figura 2: Sele¸c˜ao da paleta de cores t´ıpica de Sargadelos Fonte: Cat´alogo da Galeria Oficial de Sargadelos, 2024.
As mandalas inspiradas na coluna ”Amostra”da Tabela 1 foram desenvolvidas a partir da equa¸c˜ao param´etrica da circunferˆencia x=r·cos(θ) e x=r·sin(θ). Para a amostra 1 utilizou-se de transla¸c˜oes (MandalaR::f_transxy) intercaladas com rota¸c˜oes sucessivas (MandalaR::f_rotacao) e filtro (dplyr::filter) para pontos cuja distˆancia fosse menor ou igual a 1 e finalizando com redu¸c˜oes (MandalaR::f_factor) entre 1% e 90%, gerando o conjunto final de pontos armazenados em um dataframe. Para obter o efeito de colora¸c˜ao foi utilizado uma fun¸c˜ao criada para esta finalidade denominada de colorir_mandala que tem como argumento outra fun¸c˜ao de cria¸c˜ao de paleta de cores, o que possibilita o emprego de paletas criadas para cada caso. Especificamente para este estudo foi criada a fun¸c˜ao gerar_paleta_sargadelos que cont´em as trˆes bases de cores de acordo com a Figura 2. Para a amostra 2 utilizou-se de circunferˆencia com oito diferentes raios (r0=0.1, r1=0.3, r2=0.4, r3=0.5, r4=0.7, r5=0.8, r6=0.9, r7=1) e identifica¸c˜ao dos setores circulares para aplica¸c˜ao do m´etodo de colora¸c˜ao que seguiu um conjunto de 4 regras baseadas nas distˆancias entre os raios, assim uma coluna contendo a cor de cada ponto foi acrescentada ao dataframe final. Para obter o desenho final, foram utilizadas trˆes camadas com as fun¸c˜oes ggplot2::geom_point,ggplot2::geom_segment eggplot2::geom_curve. Para a amostra 3, identificou-se que trata-se de um tipo de n´o Celta, cuja curva param´etrica n˜ao foi encontrada, desse modo, utilizou-se de uma constru¸c˜ao com c´ırculos e segmentos de reta que procurasse expressar de forma aproximada o desenho da amostra. Os c´odigos em R destas constru¸c˜oes espec´ıficas est˜ao dispon´ıveis em GitHub. Amostra Mandala 1 Mandala 2 Mandala 3 Tabela 1: Mandalas inspiradas nas cerˆamicas de Sargadelos. Fonte: Autores, 2024. As mandalas inspiradas na coluna ”Amostra”da Tabela 2 foram desenvolvidas a partir das composi¸c˜oes entre circunferˆencias, da Lemniscata de Gerono, a fun¸c˜ao seno e a espiral de Euler, seguindo as referˆencias apontadas e paleta de cores utilizada anteriormente. A primeira utiliza rota¸c˜oes da Lemniscata de Gerono composta com c´ırculos concˆentricos; a segunda utiliza circunferˆencias concˆentricas com sequˆencias de raios agrupadas em torno de duas regi˜oes distintas e rota¸c˜oes da fun¸c˜ao seno (sin(x)) definido em intervalo [a, b] espec´ıfico; por fim, a terceira utiliza uma aproxima¸c˜ao em s´erie da Espiral de Euler com exclus˜ao de pontos em duas regi˜oes espec´ıficas. Os pormenores dos c´odigos e aproxima¸c˜oes utilizadas podem ser encontrados no GitHub.
Amostra Mandala 1 Mandala 2 Mandala 3 Tabela 2: Mandalas inspiradas nas cerˆamicas de Sargadelos. Fonte: Autores, 2024. Referˆencias [1] Alcoforado, L. F. (2022). Construindo Mandalas com R. In Mar´ıa Jos´e Ginzo Villamayor (Eds.), IX Xornada de Usuarios de R en Galicia. Santiago de Compostela, 20 out. 2022. Dispon´ıvel em: https://www.r-users.gal/sites/default/files/libro2022.pdf. Acesso em: 12 set. 2024. [2] Alcoforado, L. F., Santos, J. P. M., Lima, M. V. A., Firmiano, A., & L´opez Linares, J. (2023). Mandalas, curvas cl´assicas e visualiza¸c˜ao com R. Universidade de S˜ao Paulo. Faculdade de Zootecnia e Engenharia de Alimentos. Dispon´ıvel em: https://www.livrosabertos.sibi.usp.br/portaldelivrosUSP/catalog/book/1017. Acesso em: 1 ago. 2023. [3] Santos, J. P. M. (2024). Curvas e Cores em R: Movimentos R´ıgidos no Plano. In L. F. Alcoforado et al. (Eds.), Aplica¸c˜oes em R: encurtando distˆancias nas ciˆencias (pp. 123-145). Universidade de S˜ao Paulo. Faculdade de Zootecnia e Engenharia de Alimentos. Dispon´ıvel em: http://www.livrosabertos.abcd.usp.br/portaldelivrosUSP/catalog/book/1249. Acesso em: 27 jul. 2024. [4] Santos, J. P. M., & Alcoforado, L. F. (2023). Colorindo mandalas com R: explorando cores e gradientes em curvas planas. In Mar´ıa Jos´e Ginzo Villamayor (Eds.), X Xornada de Usuarios de R en Galicia. Santiago de Compostela, 18 out. 2023. Dispon´ıvel em: https://www.rusers.gal/sites/default/files/libro2023.pdf. [5] R Core Team. (2023). R: A Language and Environment for Statistical Computing. R Foundation for Statistical Computing, Vienna, Austria. Dispon´ıvel em: https://www.R-project.org/. [6] Wickham, H. (2016). ggplot2: Elegant Graphics for Data Analysis. Springer-Verlag New York. ISBN: 978-3-319-24277-4. Dispon´ıvel em: https://ggplot2.tidyverse.org. [7] STEBAN G´ OMEZ, Teresa. Evoluci´on y cambio de las formas cer´amicas en Sargadelos: or´ıgenes y caracter´ısticas de la empresa cer´amica sargadeliana. Tese de doutorado. Universidad Complutense de Madrid. 1992. ISBN: 978-84-8466-191-7. [8] REAL L´ OPEZ, Inmaculada. Sargadelos: patrimonio cultural, memor´ıstico y tur´ıstico. I Simposio anual de Patrimonio Natural y Cultural ICOMOS Espa˜na. 21-23 de noviembre 2019. Madrid. DOI: https://doi.org/10.4995/icomos2019.2020.11405.
XI Xornada de Usuarios de R en Galicia Santiago de Compostela, 24 de outubro do 2024 KEEP THE BALL ROLLING: CONTROL ESTADÍSTICO DE LA CALIDAD PARA LA INDUSTRIA 5.0 Salvador Naya1, Javier Tarrío-Saavedra1 y Miguel Flores2 1Grupo MODES, CITIC, Departamento de Matemáticas, Escola Politécnica de Enxeñaría de Ferrol, Universidade da Coruña. 2 Departamento de Matemática. Grupo MODES. Escuela Politécnica Nacional. Quito. Ecuador. RESUMO En este trabajo queremos presentar ejemplos de aplicación con R usados en clase y que forman parte del libro “control estadístico de calidad en la Industria 5.0”. El objetivo es exponer una serie de ejemplos de aplicación en el contexto actual de la denominada Industria 5.0. En el libro, todos los ejemplos presentados están resueltos usando el Software R, concretamente los paquetes qcr, ILS y r6qualityTools que incorporan técnicas novedosas de tipo no paramétrico tanto para datos multivariante como para datos funcionales, muy habituales en este nuevo contexto de la Industria 5.0, marco en que los datos son obtenidos en gran parte mediante sensores y la aplicación de técnicas IoT. Palabras e frases chave: Control Estadístico de la Calidad, DoE, Gráficos de control, Análisis de Capacidad, Industria 5.0. 1. INTRODUCCIÓN La Industria 5.0 representa un nuevo paradigma, que va más allá de la mera automatización y digitalización de procesos, centrándose en la colaboración entre humanos y máquinas para lograr una producción más flexible, personalizada y sostenible. En este contexto, el control estadístico de la calidad juega un papel fundamental para garantizar la excelencia en los procesos productivos y la satisfacción del cliente. Podemos resumir la Industria 5.0 como una ampliación de la 4.0 en la que se incorporan nuevas claves como: Colaboración humano-máquina, la Sostenibilidad y la Resiliencia. Los elementos clave son la automatización, la robotización, el BigData, los sistemas inteligentes, la virtualización, la IA, el aprendizaje automático y la Internet de las cosas (IoT). Según la Unión Europea, este concepto “ofrece una visión de la industria que va más allá de la eficiencia y la productividad como únicos objetivos, y refuerza el papel y la contribución de la industria a la sociedad” y “sitúa el bienestar del trabajador en el centro del proceso de producción y utiliza las nuevas tecnologías para proporcionar prosperidad más allá del empleo y el crecimiento, respetando los límites de producción del planeta”. Por tanto, la Industria 5.0 complementa el enfoque de la Industria 4.0
“poniendo específicamente la investigación y la innovación al servicio de la transición hacia una industria europea sostenible, centrada en el ser humano” [1,2]. Bajo este nuevo paradigma, el control estadístico de la calidad en la Industria 5.0 debe adaptarse a las nuevas realidades y desafíos que presenta este paradigma. Por un lado, adaptando los procesos al manejo de datos complejos, la interconexión de sistemas y el uso de sensores generan grandes volúmenes de datos complejos y heterogéneos. El control de calidad debe ser capaz de procesar y analizar estos datos de manera eficiente. Por otra parte, el análisis da datos en tiempo real, que precisa de la toma de decisiones en tiempo real es crucial en la Industria 5.0. Los métodos de control de calidad deben proporcionar información instantánea para permitir ajustes inmediatos en los procesos productivos. Como novedad, se presentarán técnicas avanzadas para datos funcionales además de herramientas de la estadística no paramétrica para datos multivariantes, con., con aplicaciones a los procesos de la Industria 5.0. Es habitual que, este tipo de procesos (debido al uso de sensores), generen datos de tipo funcional. Por otra parte, es frecuente que los datos no siempre sigan distribuciones paramétricas conocidas, por lo que es necesario utilizar técnicas estadísticas avanzadas para manejar estos tipos de datos complejos [3]. 2. PAQUETES DE R PARA EL CONTROL DE CALIDAD EN LA INDUSTRIA 5.0 Los paquetes qcr e ILS de R ofrecen herramientas versátiles y con gran capacidad para el control estadístico de la calidad en el contexto de la Industria 5.0. [4, 5, 6, 7]. El paquete qcr permite tanto aplicar herramientas básicas del control de la calidad como también gráficos de control avanzados. Entre las novedades está la opción de implementar gráficos de control para datos funcionales. En relación al análisis de capacidad de procesos para cumplir especificaciones, el paquete qcr proporciona métodos para el cálculo de índices de capacidad para cumplir especificaciones y su representación gráfica, con el objeto de evaluar la capacidad de procesos complejos. Como novedad incluye técnicas robustas para el cálculo de índices de capacidad. El paquete ILS, centrado inicialmente en los estudios interlaboratorio (Inter Laboratory Study), facilita el análisis de estudios de comparación entre laboratorios, esenciales para la calibración y validación de métodos en la Industria 5.0. Como novedad la librería ILS incorpora la opción de usar métodos no paramétricos y ofrece técnicas estadísticas que no asumen distribuciones específicas, adaptándose a la naturaleza diversa de los datos en la Industria 5.0. Igualmente, proporciona aproximaciones para datos funcionales de los estadísticos h y k de Mandel. Por tanto, el paquete ILS presenta al usuario diversas alternativas robustas para la detección de laboratorios atípicos en los contextos del análisis multivariante y el Análisis de Datos Funcionales (FDA). Por otra parte, el paquete r6qualityTools proporciona un conjunto completo de herramientas estadísticas para la gestión de la calidad, diseñado en torno al ciclo Definir, Medir, Analizar, Mejorar y Controlar (DMAIC), utilizado en la metodología Six Sigma. Es importante destacar que esta librería representa una actualización del paquete qualitytools, actualmente retirado del CRAN y archivado [8]. Este paquete tiene como novedad la programación orientada a objetos 'R6' para una mayor flexibilidad y rendimiento. Reemplaza los gráficos tradicionales con visualizaciones modernas e interactivas utilizando 'ggplot2' y 'plotly'. Desarrollado sobre los principios de 'tidyverse', simplifica la manipulación y visualización de datos, ofreciendo un enfoque intuitivo a la ciencia de la calidad. [9]. 3. APLICACIONES PRÁCTICAS Se presentarán distintas aplicaciones a problemas reales con los que han trabajado los autores y que se centran en el control de procesos en tiempo real. Se analizaron el empleo de gráficos de control del paquete qcr para monitorear variables críticas en líneas de producción automatizadas. Se presentará un estudio de la capacidad de un
proceso en fabricación aditiva, empleando técnicas de análisis funcional del paquete qcr para evaluar la calidad de piedra artificial. Se presentará un ejemplo de validación de sensores inteligentes aplicando los métodos del paquete ILS para comparar y validar las mediciones de diferentes sensores en un entorno de fabricación inteligente. Finalmente se presentarán ejemplos de aplicación del paquete r6qualitytools para el estudio de procesos siguiendo el modelo SixSigma. Concretamente, se presenta un caso de estudio en el que se analizan los datos de tránsito de varios buques por el Canal de Panamá Ampliado. Este ejemplo se usa en el libro para un estudio detallado de estadística descriptiva para finalmente presentar un modelo de regresión que facilita el estudio de la llamada curva de aprendizaje de los prácticos del Canal. También se emplea este paquete para el cálculo de Gráficos de Control tipo Shewhart para medidas individuales, obtenido a partir de datos sintéticos del tránsito de buques a través de la tercera esclusa del Canal de Panamá. Se usarán los gráficos obtenidos para monotorizar el proceso de tránsito. Una segunda aplicación práctica es el estudio de control de calidad de cigüeñales de automóvil, en este caso usamos el paquete SixSigma para analizar los defectos superficiales y las grietas. Concretamente se empleará la función ss.pMap para la obtención del mapa de procesos correspondiente a la producción de cigüeñales. Este es otro ejemplo real de aplicación en datos procedentes de una empresa y que se pondrá de ejemplo para presentar las salidas gráficas de varios paquetes que presentan mapas de procesos y otras herramientas básicas del control de procesos industriales como los diagramas de Ishikawa o los diagramas de Pareto. Otro conjunto de datos, son los de un estudio de dureza de un nuevo material que simula la piedra, que está disponible en el paquete qcr, en el data.frame plates. Con estos datos se analizarán diferentes gráficos de control y el estudio de la capacidad del proceso de producción. Para el caso de datos funcionales, se hará uso de los datos sobre eficiencia energética del data.frame, Consumo. Con estos datos es posible aplicar gráficos de tipo funcional. Además, se incorporan nuevas funciones para la estimación de índices de capacidad no paramétricos. En lo que respecta al control de calidad multivariante, se hará del paquete qcr, y del conjunto de datos Contaminacion.txt. Este conjunto de datos sintéticos contiene dos variables: por un lado el contenido en contaminantes, específicamente agua (ppm) y por otra, partículas sólidas (mg/l) en el queroseno usado como combustible para aviación. El contenido máximo de estos contaminantes esta regulado por normas internacionales; un alto contenido en agua o partículas solidas pueden ser fuente de fallos en los elementos de las aeronaves y, por tanto, de accidentes. Esta base de datos está basada en experimentos reales realizados en laboratorio. Finalmente se dedica un capítulo al diseño de experimentos (DoE) y otro al estudio de la detección de anomalías a partir de datos complejos. Se emplean datos de experimentos realizados en laboratorio en los que se usa el paquete, ILS, para el estudio de la consistencia entre laboratorios, diseños RyR que se extienden también al estudio de consistencia de datos proveniente de sensores en los que se proponiendo en este caso el cálculo de aproximaciones FDA de los estadísticos h y k de Mandel, definidos para la detección de laboratorios atípicos. 4. CONCLUSIONES El control estadístico de la calidad es esencial para el éxito de la Industria 5.0, permitiendo mantener altos estándares de calidad en entornos de producción altamente personalizados y colaborativos. Los paquetes qcr e ILS de R proporcionan herramientas avanzadas que se adaptan perfectamente a los desafíos de este nuevo paradigma industrial. Para profundizar en estos temas y explorar más aplicaciones prácticas, recomendamos nuestro próximo libro "Control de Calidad Avanzado para la Industria 5.0: Aplicaciones con R". Esta obra ofrece una guía completa sobre cómo implementar técnicas de control de calidad utilizando R, con un enfoque especial en
2. Desarrollo del Análisis por componentes (PCA) La tabla muestra los valores del MSA (Measure of Sampling Adequacy) tanto de manera general como para cada una de las variables individuales relacionadas con la participación en actividades de memoria histórica en El Castillo, Meta. El MSA es una medida que indica la adecuación de las variables para ser incluidas en un análisis factorial o de componentes principales, con valores cercanos a 1 indicando una mayor adecuación. MSA MSA General 0.843 Actividades 0.867 Eventos 0.849 Talleres 0.869 Reconciliación 0.888 Promoción 0.912 Iniciativas 0.852 Construcción 0.807 Participación 0.829 Motivación 0.859 Interés 0.843 Contribución 0.814 Transformación 0.846 Identificación 0.760 Recorridos 0.731 Tabla 1. Contraste de Kaiser-Meyer-Olkin El valor general del MSA es 0.843, lo que sugiere que, en promedio, las variables son adecuadas para el análisis. Individualmente, todas las variables presentan valores de MSA por encima de 0.7, con "Promoción" (0.912) y "Reconciliación" (0.888) siendo las variables con mayor adecuación, lo que indica que son particularmente apropiadas para este tipo de análisis. Por otro lado, "Recorridos" (0.731) y "Identificación" (0.760) tienen los valores más bajos, aunque aún se consideran adecuadas. Figura 1. scree plot. Esta observación dada en la figura 1, subraya la eficiencia del PCA para identificar los factores más significativos y resalta la importancia de determinar el número adecuado de componentes para un análisis preciso y útil en estudios de ciencias sociales. Por ejemplo, del segundo al tercer componente se nota una disminución considerable de varianza, presentándose el codo, momento óptimo para detener el análisis, ya que los
componentes adicionales aportan una explicación marginalmente menor de la varianza total, entonces para este análisis se tomas dos dimensiones que aportan el 56,6% de la varianza total. Figura 2. Biplot de análisis de componentes principales La figura muestra un análisis de componentes principales (PCA) de las variables relacionadas con la participación en actividades de memoria histórica en el contexto del tejido social en El Castillo, Meta. El PCA, que explica un 35% y un 21.6% de la varianza total en los dos primeros componentes, permite visualizar cómo las actividades como eventos, talleres, y promoción están fuertemente correlacionadas y agrupadas en el gráfico. Esto sugiere que estas actividades son esenciales para la reconstrucción del tejido social y la memoria histórica en la comunidad. Además, variables como participación, motivación, interés y transformación indican una fuerte relación entre la percepción individual de la importancia de estas actividades y su impacto en la transformación social. Figura 3. Mapa de calor La figura 2 un mapa de calor de la matriz de correlaciones entre diversas variables relacionadas con la participación en actividades de memoria histórica en el contexto del tejido social en El Castillo, Meta. Se observa que variables como "Actividades", "Eventos", "Talleres" y "Reconciliación" tienen fuertes correlaciones positivas entre sí, lo que sugiere que la participación en una de estas actividades está altamente asociada
con la participación en las otras. Esto refuerza la importancia de las actividades colectivas en la reconstrucción del tejido social. 3. CONCLUSIÓNS El uso de R en las ciencias sociales permite un análisis profundo y detallado de variables críticas como tejido_social, cohesión, posconflicto y resiliencia. Mediante técnicas avanzadas como el Análisis por Componentes Principales (ACP), R facilita la identificación de patrones y relaciones clave entre estas variables, proporcionando insights valiosos para la reconstrucción del tejido social en contextos de posconflicto. La capacidad de R para manejar grandes conjuntos de datos y realizar análisis complejos lo convierte en una herramienta indispensable para investigadores y académicos en el campo de las ciencias sociales. Referencias [1] Cataño, S. V., Jiménez, E. A., & López, M. (2023). La trayectoria de quienes quedan. Narrativa y desaparición forzada en Colombia. Textos y Contextos, 27, e4322. [2] HUMAN Review. (2023). Prácticas pedagógicas para la reconstrucción del tejido social en territorios de conflicto. HUMAN Review. [3] Hernández González, G. (2020). Uso de la categoría tejido social/comunitaria en los Foros Escucha para la Pacificación y la Reconciliación Nacional. Revista Kavilando, 12(2), 429-439. [4] Páez, C. (2013). La práctica de la resistencia en las brigadas muralistas de los '80. Universidad de Chile. [5] Centro Nacional de Memoria Histórica. (2015). Pueblos arrasados: Memorias del desplazamiento forzado en El Castillo (Meta). Bogotá: CNMH. [6] González-Bustamante, B. (2023). Análisis de Componentes Principales con correlaciones policóricas: Aplicación en consumo de medios. [7] Vijverberg, W. P. (1997). The quantitative methods component in social sciences curricula in view of journal content. Journal of Policy Analysis and Management: The Journal of the Association for Public Policy Analysis and Management, 16(4), 621-62 Anexo objetos de R Código R Usado para PCA Librerias library(factoextra), library(ggplot2), library(readxl),library(corrplot) Lectura del archivo Excel desde la ruta especificada data <- read_excel("D:/Academicos2024/EventoGalicia/Encuesta.xlsx") Estandarizar los datos data_scaled <- scale(data) PCA pca_result <- prcomp(data_scaled, center = TRUE, scale. = TRUE) Scree plot fviz_screeplot(pca_result, addlabels = TRUE, ylim = c(0, 50)) Círculo de correlación fviz_pca_var(pca_result, col.var = "cos2", gradient.cols = c("#00AFBB", "#E7B800", "#FC4E07"), repel = TRUE) Matriz de correlaciones cor_matrix <- cor(data) Gráfico de calor con la matriz de correlaciones corrplot(cor_matrix, method = "color", tl.col = "black", tl.srt = 45, addCoef.col = "black", number.cex = 0.7) Tabla 2. Códigos en R para la realización de un PCA
XI Xornada de Usuarios de R en Galicia Santiago de Compostela, 24 de outubro do 2024 Efecto da asma na calidade de vida autopercibida polos pacientes en España Alba Paz-Castro1,2, José Manuel Amoedo3 1 Grupo Bioloxía do Linfocito (BioLinfo) Departamento de Bioquímica e Bioloxía Molecular, Facultade de BioloxíaCentro de Investigacións Biolóxicas (CIBUS), Universidade de Santiago de Compostela, Santiago de Compostela, España. 2 Grupo de Investigación Traslacional en Enfermidades das Vías Respiratorias (TRIAD), Instituto de Investigación Sanitaria de Santiago de Compostela (IDIS), Santiago de Compostela, España. 3 Grupo de Investigación ICEDE, Departamento de Economía Aplicada, Facultade de Ciencias Económicas e Empresariais, Universidade de Santiago de Compostela RESUMO O asma é unha enfermidade respiratoria crónica que afecta significativamente á calidade de vida dos doentes. Este traballo ten como obxectivo analizar o impacto da asma na calidade de vida autopercibida dos pacientes en España, empregando datos provintes das enquisas de saúde nacionais. A través de Propensity Scoore Matching e de estimacións econométricas loxísticas estimouse a influencia do asma na calidade de vida dos pacientes asmáticos. Empregáronse os datos dispoñibles na enquisa estandarizada de saúde do Instituto Nacional de Estadística (INE) do ano 2020 onde se mediron a percepción dos pacientes sobre o seu estado de saúde e benestar xeral. As dimensións avaliadas inclúen o impacto físico, emocional e social da asma, permitindo unha visión global do problema. Para levar a cabo a análise emprégase tres librerías de R que permiten levar a cabo as diferentes fases da análise. En primeiro lugar, lévase a cabo unha Análise de Compoñentes Principais (ACP) que permite simplificar as covariables de control para evitar posibles problemas de multicolinealidade. En segundo lugar, a librería MatchIt, permite obter grupos de tratamento (doentes con asma) e de control (doentes sen asma) similares mediante o uso de Propensity Score Matching. Finalmente, a librería nnet permite realizar estimacións loxísticas multinomiais para analizar como afecta a asma ós doentes que a padecen. Os resultados preliminares indican unha correlación significativa entre a presencia de asma no paciente e unha menor calidade de vida. Neste senso, as estimacións loxístixas multinomiais indican que o feito de padecer asma incrementa de forma significativa a probabilidade de empeorar a saúde autopercibida. Ademais, os resultados amosan como a probabilidade de que a saúde autopercibida empeore ó padecer asma é especialmente elevada entre os individuos con peor saúde. Palabras e frases chave: asma, calidade de vida, saúde, benestar, España
XI Xornada de Usuarios de R en Galicia Santiago de Compostela, 24 de outubro do 2024 CALCULANDO A SEVERIDADE DUN INCENDIO FORESTAL CON R Marta Rodr´ıguez Barreiro1, Manuel Antonio Novo P´erez1e Mar´ıa Jos´e Ginzo Villamayor1,2 1Centro de Investigaci´on e Tecnolox´ıa Matem´atica de Galicia (CITMAga) 2Departamento de Estat´ıstica, An´alise Matem´atica e Investigaci´on Operativa, Universidade de Santiago de Compostela RESUMO O algoritmo desenvolto permite calcular a severidade dun incendio unha vez extinto, proporcionando informaci´on sobre as posibilidades de rexeneraci´on da vexetaci´on afectada. Para isto, util´ızase un ´ındice denominado Normalized Burn Ratio (NBR) que se calcula a partir de imaxes obtidas do sat´elite Sentinel-2, mediante o servizo proporcionado por Google Earth Engine. Empregando librer´ıas de R de estat´ıstica espacial como terra,sf ou tidyterra, o algoritmo desenvolto conecta cun script de Python capaz de descargar as imaxes de sat´elite previas e posteriores ´o incendio, e a continuaci´on procesa estas imaxes para calcular a diferencia dos ´ındices Normalized Burn Ratio e clasificar os valores de cada p´ıxel indicando a severidade do incendio nos mesmos e a probabilidade de rexeneraci´on. Isto permite co˜necer as zonas nas que ´e necesario intervir para axudar ´a rexeneraci´on da vexetaci´on. Palabras e frases chave: Incendios forestais, rexeneraci´on, dNBR, GEE, imaxes sat´elite. 1. INTRODUCI ´ ON Tras un incendio forestal, a capacidade de rexeneraci´on da vexetaci´on depende de diversos factores como a severidade do incendio, as especies vexetais presentes, as condici´ons ambientais... (Sterner et al., 2022). Un dos obxectivos despois dun incendio forestal debe ser recuperar o ecosistema orixinal previo ´a existencia do incendio. A vexetaci´on nativa da zona a mi´udo ad´aptase para rexenerarse ou reproducirse despois dun incendio forestal de baixa ou media intensidade, pero en incendios de alta severidade as ´areas queimadas tardan en rexenerar. Unha vez que se extingue un incendio forestal todos os esforzos deben centrarse na rehabilitaci´on da zona e a estabilizaci´on do solo. O primeiro paso para isto ´e a avaliaci´on da severidade do incendio, que se define como o grado no que unha zona foi alterada polo lume. A creaci´on dun mapa que reflicta os efectos do incendio na superficie do solo e o estado deste, facilita a identificaci´on das ´areas potenciais de preocupaci´on e o reco˜necemento inicial do terreo. Isto axuda na toma de decisi´on das ´areas nas que os tratamentos de rehabilitaci´on poden ser m´ais eficaces. O obxectivo do algoritmo desenvolvido ´e proporcionar apoio para esta tarefa, calculando un mapa que represente a severidade dun incendio. Para isto, utilizaranse imaxes de sat´elite para calcular o Normalized Burn Ratio (NBR) do terreo previo ´o incendio e despois deste. O NBR ´e un ´ındice que se utiliza comunmente para identificar zonas queimadas calculando a reflectancia das bandas de infravermellos. Un valor alto do NBR indica vexetaci´on saudable, mentres que un valor baixo indica solo descuberto e ´areas recentemente queimadas. A diferenza entre os valores do ´ındice, Differenced Normalized Burn Ratio (dNBR) ´e a diferencia entre o NBR antes e despois do incendio e proporciona informaci´on de gran utilidade sobre a recuperaci´on da vexetaci´on. Os valores positivos do dNBR indican zonas que sufriron cambios debido a un incendio, e os valores negativos indican ´areas de rexeneraci´on ou crecemento da vexetaci´on despois do incendio. Os valores do dNBR
poden variar polo que a s´ua interpretaci´on debe levarse a cabo mediante unha avaliaci´on de campo, sempre que sexa posible. Por´en, o Servizo Xeol´oxico dos Estados Unidos (USGS) desenvolveu unha clasificaci´on dos valores do dNBR para interpretar a gravidade dun incendio (Key & Benson, 2006), tal e como se amosa na Figura 1. Figura 1: Clasificaci´on da severidade dun incendio a partir dos valores do dNBR, creada polo USGS. 2. C ´ ALCULO DA SEVERIDADE DO INCENDIO O algoritmo desenvolto con R proporciona un mapa co dNBR clasificado do incendio, comparando o NBR actual da zona cos valores previos ´o incendio. Utiliza a clasificaci´on do USGS (Figura 1), resaltando as zonas sobre as que hai que actuar xa que non se producir´a unha rexeneraci´on natural. En primeiro lugar, o algoritmo obt´en da base de datos o per´ımetro final asociado ´o incendio a partir do identificador introducido polo usuario. Este per´ımetro ´e necesario para establecer a rexi´on de interese na que se calcula o dNBR. O seguinte paso ´e a descarga de imaxes previas e posteriores ´o incendio, para o que se utilizan as imaxes do Sentinel-2 mediante o servizo proporcionado por Google Earth Engine (GEE). Para conectar con este servizo empr´egase un script de Python que se executa dende R. Unha vez que se disp´on das imaxes, hai que filtrar aquelas que son de baixa calidade. A continuaci´on, agr´eganse todas as imaxes previas ´o incendio, creando unha imaxe que ´e a composici´on de todas usando os valores medianos. Faise o mesmo coas imaxes posteriores. Deste xeito, tense unha ´unica imaxe previa ´o incendio e outra posterior. Calc´ulase o NBR de cada unha das imaxes, e despois r´estase para obter o valor do dNBR previamente mencionado. Na imaxe resultante, clasif´ıcanse os valores do dNBR en funci´on da clasificaci´on proporcionada polo USGS que se amosa na Figura 1, e proporci´onase este mapa clasificado como sa´ıda. Deste xeito, o usuario pode ver rapidamente as zonas nas que ´e necesaria a intervenci´on humana. Figura 2: Severidade dun incendio segundo a clasificaci´on do USGS. As cores fan referencia a esta clasificaci´on, no que os valores m´ais altos indican maior severidade do incendio. Na Figura 2 am´osase un exemplo da sa´ıda do algoritmo vista desde o visor de QGIS. Tr´atase do dNBR clasificado na zona na que se produciu un incendio forestal, o que permite ver de xeito r´apido
as zonas nas que se debe actuar para favorecer a rexeneraci´on. Neste caso, as zonas de cor laranxa son de risco alto de non rexeneraci´on, mentres que as zonas de cor vermella indican que se debe actuar de xeito inmediato, xa que non se vai producir unha rexeneraci´on natural da vexetaci´on. Para o tratamento das imaxes de sat´elite e a creaci´on dos mapas, o algoritmo emprega librar´ıas para datos espaciais de R como son terra,sf ou tidyterra. 3. CONCLUSI ´ ONS A soluci´on aportada por este algoritmo permite establecer unha estimaci´on dos danos provocados por un incendio forestal en funci´on dos valores do dNBR e seguindo unha clasificaci´on establecida polo USGS. ´ E unha ferramenta que pode ser de gran axuda en canto ´o restablecemento do solo e a vexetaci´on, xa que proporciona dun xeito r´apido as zonas nas que se deber´ıa intervir con traballos de rexeneraci´on xa que esta non se vai producir de forma natural. O algoritmo pode ser executado en diferentes momentos despois dun incendio, o que permite analizar a evoluci´on da rexeneraci´on do solo, iniciando as labores de rexeneraci´on tan pronto como sexan necesarias. Pode ocorrer que inmediatamente despois dun incendio unha zona non mostre signos de que sexa necesaria a actuaci´on humana, pero co paso do tempo, e analizando a rexeneraci´on da vexetaci´on segundo os valores do dNBR, se detecte que a evoluci´on da vexetaci´on non sexa a esperada e se decida intervir. Esta ferramenta non substit´ue o traballo de campo, no que se estuda e analiza o solo despois dun incendio. Por´en, proporciona unha axuda a estes traballos xa que, en zonas nas que hai moitos incendios, pode servir como primeiro indicador para avaliar as zonas nas que se deben centrar os estudos e os esforzos de rexeneraci´on. Este algoritmo foi desenvolto en colaboraci´on coa empresa de aviaci´on Avincis, no marco do proxecto Civil UAVs Initiative da Axencia Galega de Innovaci´on (Xunta de Galicia). Referencias [1] Hernang´omez, D. (2023). Using the tidyverse with terra objects: the tidyterra package. Journal of Open Source Software, 8(91), 5751. ISSN 2475-9066. [2] Key, C.H., Benson, N.C. (2006). Landscape Assessment (LA). In Lutes, D.C., Keane, R.E., Caratti, J.F., Key, C.H., Benson, N.C., Sutherland, S., Gangi, L.J. (eds.): FIREMON: Fire effects monitoring and inventory system. USDA Forest Service, Rocky Mountain Research Station. Gen. Tech. Rep. RMRSGTR-164-CD, 1-5 [3] Pebesma, E. (2018). Simple Features for R: Standardized Support for Spatial Vector Data. The R Journal, 10(1), 439-446 [4] Pebesma, E., Bivand, R. (2023). Spatial Data Science. Chapman and Hall, New York [5] Sterner, S., Aslan, C., Chaudhry, T. (2022). Forest management effects on vegetation regeneration after a high severity wildfire: A case study in the southern Cascade range. Forest Ecology and Management, 520, 120394.
XI Xornada de Usuarios de R en Galicia Santiago de Compostela, 24 de outubro do 2024 Análisis de nubes de puntos masivas en R Nataly Romarís-Lodeiro1, Olamar Benavente-Fernández1, Rubén Fernández-Casal2 y Salvador Naya2 1Centro Mixto de Investigación UDC-Navantia, Universidade da Coruña. 2Grupo MODES, Departamento de Matemáticas, CITIC, Universidade da Coruña. RESUMO Hoy en día están disponibles distintas técnicas de teledetección que permiten obtener mediciones de alta resolución de la superficie de estructuras tridimensionales. Entre ellas podríamos destacar las mediciones LiDAR (Light Detection and Ranging) obtenidas mediante pulsos láser. Las nubes de puntos resultantes tienen aplicación en muchos campos, como por ejemplo ciencias forestales, morfología o control de procesos de fabricación. En este trabajo se pretende hacer una breve revisión de algunas de las herramientas disponibles en R para la manipulación y el análisis de este tipo de datos. Palabras e frases chave: datos LiDAR, isosuperficies, mallas triangulares, coordenadas espaciales 3D. 1. INTRODUCIÓN Cada observación de una nube de puntos LiDAR incluye coordenadas espaciales en tres dimensiones y opcionalmente otros atributos, como la intensidad del pulso reflejado. El primer paso para el análisis de este tipo de datos es su importación en R y su representación gráfica. Para ello, la recomendación es emplear el paquete rgl (Murdoch y Adler, 2023), especialmente si se trata de conjuntos de datos de gran tamaño. Este paquete incluye funciones para importar, construir y visualizar objetos tridimensionales (incluyendo nubes de puntos y mallas triangulares), además de muchas otras operaciones geométricas (como realizar transformaciones afines o segmentar un objeto en partes orientadas en una dirección determinada). También pueden resultar de utilidad paquetes de R diseñados para su aplicación en campos específicos. Entre ellos podemos destacar los paquetes lidR (Roussel y Auty, 2023) y lasR (Roussel, 2024) para el análisis de datos forestales, y el paquete Morpho (Schlager, 2017) para el análisis de datos morfológicos mediante puntos de referencia y mallas de superficie. El conjunto de datos puede estar formado por decenas o cientos de millones de puntos por lo que antes de realizar cualquier análisis resulta necesario reducir su dimensión. Para ello se pueden emplear distintas técnicas de discretización, entre ellas binning o voxelización, utilizando los paquetes npsp (Fernández-Casal, 2024) o VoxR
(Lecigne et al., 2018), por ejemplo. Aun así, los requerimientos en cuanto a la precisión de los resultados, pueden hacer necesario el trabajar con nubes formadas por millones de puntos. En muchas ocasiones las nubes de puntos no son una representación adecuada del objeto escaneado e interesa aproximar su forma mediante una malla triangular. Para ello se pueden emplear diversas técnicas, entre ellas la envoltura α-convexa de la nube de puntos, niveles de densidad (isosuperficies) o el método Ball-Pivoting. Para calcular la envoltura α-convexa de un conjunto de puntos se puede emplear el paquete alphashape3d (Lafarge et al., 2014), o el paquete alphahull (Pateiro-López y Rodrıguez-Casal, 2010) para conjuntos de puntos en el plano. Sin embargo, como estos métodos están basados en la triangulación de Delaunay, sus requerimientos computacionales son muy elevados y en la práctica solo pueden ser empleados con unos pocos miles de datos. Otra técnica para aproximar la forma del objeto, especialmente útil si hay errores de medición, es la generación de isosuperficies correspondientes a niveles de densidad (ver e.g. Chacón y Duong, 2018, Sección 6.1). Este enfoque se basa en estimaciones de la densidad multidimensional en una rejilla regularmente espaciada, que pueden ser obtenidas mediante suavizado tipo núcleo, empleando los paquetes ks (Duong, 2022) o npsp, entre otros. También se podría emplear directamente la rejilla binning para acelerar los cálculos. La isosuperficie estará determinada por un determinado valor (nivel) de densidad y serviría como una aproximación de la forma del objeto escaneado. Para obtener la correspondiente malla triangular se puede emplear el paquete misc3d (Feng y Tierney, 2008). Este paquete genera isosuperficies tridimensionales utilizando una versión optimizada del algoritmo Marching Cubes (Lorensen y Cline, 1987). El objeto resultante puede representarse utilizando el paquete rgl o los gráficos estándar de R. También se puede emplear el algoritmo Ball-Pivoting, implementado en la librería Rvcg (Schlager, 2017), para la generación de una malla de triángulos a partir de la nube tridimensional de puntos. El mecanismo de este algoritmo es relativamente sencillo; se considerará que tres puntos forman un triángulo de la malla siempre y cuando una bola de radio p (especificado previamente por el usuario) los toca sin incluir ningún otro punto de la nube. Este algoritmo partirá de un triángulo inicial o triángulo “semilla” girando la bola alrededor de los bordes hasta encontrar nuevos puntos para formar más triángulos repitiendo este proceso hasta que se hayan probado todos los bordes accesibles y todos los puntos hayan sido considerados. En nubes de puntos con densidades desiguales, es posible volver a ejecutar el algoritmo con un radio mayor para evitar que quede una malla no hermética. Además, el paquete Rvcg implementa métodos avanzados para manipular mallas de superficies y realizar análisis de formas. Entre ellas, permite la limpieza de la malla, por ejemplo, eliminando piezas aisladas, seleccionadas por una cantidad mínima de caras o de un diámetro por debajo de un umbral determinado. También permite realizar suavizados, calcular vectores normales, calcular distancias geodésicas y el submuestreo de la superficie de la malla triangular, devolviendo un conjunto de puntos ubicados en esa malla, entre otras funciones. Por último, es posible desarrollar procedimientos adicionales empleando herramientas implementadas en Python, y que pueden ser llamadas desde R empleando el paquete reticulate (Ushey et al., 2024). Esto también permite mejorar computacionalmente ciertas operaciones que en R todavía presentan limitaciones.
AGRADECEMENTOS Este trabajo ha sido financiado por la Axencia Galega de Innovación (GAIN) de la Xunta de Galicia y la empresa Navantia (SEPI), en el marco del Centro Mixto de Investigación UDC-NAVANTIA, con el proyecto "O estaleiro do futuro" (IN853C). Referencias Chacón J.E., Duong T. (2018). Multivariate kernel smoothing and its applications. Chapman and Hall/CRC. Bernardini F., Mittleman J., Rushmeier H., Silva C., Taubin G. (1999). The ball-pivoting algorithm for surface reconstruction. IEEE transactions on visualization and computer graphics, 5(4), 349-359. Duong T. (2022). ks: Kernel Smoothing. R package version 1.14.0, https://CRAN.Rproject.org/package=ks. Feng D., Tierney L. (2008). Computing and Displaying Isosurfaces in R. Journal of Statistical Software, 28, 1-24. Fernández-Casal R. (2024). npsp: Nonparametric Spatial Statistics. R package version 0.714. https://rubenfcasal.github.io/npsp. Lafarge T., Pateiro-López B., Possolo A., Dunkers J. (2014). R Implementation of a Polyhedral Approximation to a 3D Set of Points Using the α-Shape. Journal of Statistical Software, 56, 1-19. Lecigne B., Delagrange S., Messier C. (2018). Exploring trees in three dimensions: VoxR, a novel voxel-based R package dedicated to analysing the complex arrangement of tree crowns. Annals of Botany, 121, 589-601. Lorensen W.E., Cline H.E. (1987). Marching Cubes: A High Resolution 3D Surface Reconstruction Algorithm. Computer Graphics, 21(4), 163-169. Murdoch D., Adler D. (2023). rgl: 3D Visualization Using OpenGL. R package version 1.1.3, https://CRAN.R-project.org/package=rgl. Pateiro-López B., Rodrıguez-Casal A. (2010). Generalizing the convex hull of a sample: the R package alphahull. Journal of Statistical Software, 34, 1-28. Roussel J.R., Auty D. (2023). lidR: Airborne LiDAR Data Manipulation and Visualization for Forestry Applications. R package version 3.1.0. https://cran.r-project.org/package=lidR. Roussel, J.R. (2024). lasR: Fast and Pipeable Airborne LiDAR Data Tools. R package version 0.10.2, https://r-lidar.github.io/lasR. Schlager S. (2017). Morpho and Rvcg - Shape Analysis in R. En Zheng G., Li S., Szekely G. (Eds.), Statistical Shape and Deformation Analysis, pp. 217-256. Academic Press. Ushey K, Allaire J, Tang Y (2024). reticulate: Interface to 'Python'. R package version 1.39.0, https://CRAN.R-project.org/package=reticulate.