scieee AI-readable full text Open interactive document viewer

Asociación entre variables cualitativas: ejemplo práctico de análisis de correspondencias

Castiñeiras Rella, Jorge

Abstract

[ES] El análisis de correspondencias es una técnica de la estadística descriptiva aplicada a tablas de contingencia cuyo objetivo es la visualización de una nube de puntos multidimensional asociada a unas ciertas variables en un espacio de menor dimensión. Se generan mapas que plasman los puntos intentando respetar al máximo sus posiciones en el espacio original perdiendo el mínimo de información, lo que nos permite elaborar un análisis exploratorio de ellos rápido y eficaz además de poder establecer asociaciones entre las variables. Las proyecciones habitualmente son sobre espacios de dimensión 2 por nuestra familiaridad con ellos. Se tratará el contraste de la homogeneidad de la tabla, se introducirá una medida más adecuada para esta técnica (la distancia ji-cuadrado) y se expresará la varianza de la tabla en función de estos conceptos. Esta nueva medida de la varianza es lo que queremos conservar al realizar la proyección de la tabla. Se introducirán diversos tipos de análisis de correspondencias y técnicas para su implementación, así como realizar inferencia y contrastes sobre los datos. Todo el trabajo se acompaña de varios ejemplos para facilitar la comprensión de qué se está haciendo. Por último, llevaremos a la práctica todo lo introducido a lo largo del trabajo en un estudio médico real con las pretensiones de resumir los datos, establecer un análisis descriptivo y establecer relaciones entre varias enfermedades comunes y la calidad y forma de vida de 820 pacientes.

Full text

Trabajo de Fin de Grado Asociación entre variables cualitativas; ejemplo práctico de análisis de correspondencias Jorge Castiñeiras Rella 2018/2019 UNIVERSIDAD DE SANTIAGO DE COMPOSTELA GRADO DE MATEMÁTICAS Trabajo de Fin de Grado Asociación entre variables cualitativas; ejemplo práctico de análisis de correspondencias Jorge Castiñeiras Rella Febrero, 2019 UNIVERSIDAD DE SANTIAGO DE COMPOSTELA Trabajo propuesto Área de conocimiento: Estadística e Investigación Operativa. Título: Asociación entre variables cualitativas; ejemplo práctico de análisis de correspondencias. Breve descripción del contenido: Una tabla de contingencia permite resumir información de dos variables cualitativas de modo que las las representan las categorías de una de las variables y las columnas representan las categorías de la otra variable. El análisis de correspondencias permite representar tablas de contingencia y analizar la similitud entre las categorías de cada una de las variables con respecto a las categorías de la otra. El objetivo de este TFG es que la/el alumna/o haga una revisión de esta metodología de análisis multivariante y aplique los conocimientos adquiridos a un conjunto de datos real. iii Índice general Resumen ix Introducción xi 1. Datos para los ejemplos 1 1.1. Base de datos sobre enfermedades y fármacos comunes . . . . . . . . . . . . 1 1.2. Base de datos sobre ansiedad y depresión . . . . . . . . . . . . . . . . . . . 3 2. Tablas de contingencia y perles 5 2.1. Tablasdecontingencia.............................. 5 2.2. Perles....................................... 6 3. Distancia ji-cuadrado e inercia 11 4. Representación 17 4.1. Descomposición en valores singulares . . . . . . . . . . . . . . . . . . . . . . 18 v vi ÍNDICE GENERAL 4.2. Escaladoóptimo ................................. 19 4.3. Ejes y coordenadas principales . . . . . . . . . . . . . . . . . . . . . . . . . 22 4.4. Representaciones en dos dimensiones . . . . . . . . . . . . . . . . . . . . . . 23 4.5. Simetría entre el AC de las y columnas . . . . . . . . . . . . . . . . . . . . 25 4.6. Contribuciones a la inercia . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26 4.7. Puntosadicionales ................................ 28 4.8. Biplots....................................... 30 4.9. Transformación de tablas . . . . . . . . . . . . . . . . . . . . . . . . . . . . 32 4.10.Regresión ..................................... 36 5. Análisis de correspondencias alternativos 39 5.1. Análisis de correspondencias múltiple . . . . . . . . . . . . . . . . . . . . . . 39 5.1.1. ACM a partir de la tabla binaria . . . . . . . . . . . . . . . . . . . . 39 5.1.2. ACM a partir de la tabla de Burt . . . . . . . . . . . . . . . . . . . . 42 5.1.3. Escalado óptimo del ACM . . . . . . . . . . . . . . . . . . . . . . . . 43 5.2. Análisis de correspondencias conjunto . . . . . . . . . . . . . . . . . . . . . 45 5.3. Análisis de correspondencias de subgrupos . . . . . . . . . . . . . . . . . . . 46 5.4. Análisis de tablas cuadradas . . . . . . . . . . . . . . . . . . . . . . . . . . . 47 6. Inferencia 51 ÍNDICE GENERAL vii 6.1. Bootstrapping................................... 51 6.2. Prueba de distribución asintótica . . . . . . . . . . . . . . . . . . . . . . . . 53 6.3. Testdepermutaciones.............................. 53 6.4. Simulación de Monte Carlo . . . . . . . . . . . . . . . . . . . . . . . . . . . 54 6.5. Agrupaciones ................................... 55 7. Aplicación práctica del AC en un estudio 59 7.1. AC del estado civil respecto al resto de variables . . . . . . . . . . . . . . . 63 7.2. AC de la ansiedad y depresión . . . . . . . . . . . . . . . . . . . . . . . . . . 65 7.3. AC de la edad sobre el resto de variables . . . . . . . . . . . . . . . . . . . . 69 7.4. AC sobre las enfermedades . . . . . . . . . . . . . . . . . . . . . . . . . . . . 72 7.5. Perímetrosconvexos ............................... 78 Glosario 83 Bibliografía 87 xiv INTRODUCCIÓN En el último capítulo se incluirá un AC mucho más detallado y profundo de los datos proporcionados por este investigador, aplicando todo lo explicado y tratado a lo largo del trabajo. Dispondremos de una base de datos con muchas variables de las utilizadas en los ejemplos del trabajo e intentaremos llegar a conclusiones que resulten de interés medico. Muchos de los resultados que se testan en el anexo no lo han sido nunca y pueden llegar a explicar y probar varios fenómenos médicos sobre los que solo hay hipótesis. La introducción a este estudio y sus datos se realizará en el último capítulo. La parte teórica del trabajo ha sido desarrollada a partir de la consulta de los libros que se incorporan en la bibliografía, siendo el libro de referencia  La práctica del análisis de correspondencias  de Michael Greenacre. No mencionamos este libro a lo largo del trabajo pues en general ha sido el que hemos consultado para todos los capítulos. En algunas secciones citamos ciertos libros por su relevancia en esa parte, pero la mayoría de conceptos han sido explicados tras consultar los libros recogidos en la bibliografía, buscando la notación y explicación más adecuada e intuitiva. Capítulo 1 Datos para los ejemplos 1.1. Base de datos sobre enfermedades y fármacos comunes Los datos sobre los que elaboraremos todos los ejemplos y cálculos descritos en la primera parte del trabajo se recogen en este capítulo. El primer conjunto de datos cruza 22 de las enfermedades crónicas más habituales con el consumo de 16 fármacos también comunes (ver Cuadro 1.1). Esta base de datos es fruto de un estudio en profundidad de la medicación que toman y las enfermedades que padecen 1515 pacientes. Disponemos pues de un gran número de individuos por lo que los resultados obtenidos serán signicativos de cara a trabajos y estudios posteriores en el campo médico. El hecho de cruzar el uso de fármacos y enfermedades en este trabajo es una demostración práctica de que efectivamente el AC es una técnica que funciona y que nos puede aportar mucha información por sí sola. El conjunto de datos interesante tanto en el campo médico como matemático será el que se trate en el último capítulo. Por parte de nuestro investigador y de su equipo se espera obtener información respecto a variables sobre las que casi no existe ningún trabajo, tratándose de hecho este trabajo de un estudio completamente novedoso y que no se había realizado hasta ahora. La innovación sumada a la gran cantidad de datos de la que se ha dispuesto abre la puerta a algún descubrimiento interesante. 1 2 CAPÍTULO 1. DATOS PARA LOS EJEMPLOS A lo largo del trabajo utilizaremos estos datos para establecer ejemplos aclaratorios que reejen la motivación y desarrollo de lo que hacemos en todo momento. Los datos se recogen en el Cuadro 1.1 y en el Cuadro 1.2 mostramos su codicación. Benzo Antidepre MetGluc ado1 Antiinf Insul2 hipSed Estatinas cortic ACO2 betabloq diureticos Glucosamin fenitoina antipsic dm 39 42 471 151 24 32 33 103 2 3 30 59 3 1 4 hta 118 93 689 110 84 23 92 209 9 10 78 161 10 2 3 hlp 125 107 696 107 72 27 91 287 5 10 63 113 9 2 10 ci 20 11 159 19 9 3 15 50 1 2 32 27 1 2 4 ic 5 4 74 8 3 4 2 14 0 0 12 21 0 0 0 ap 7 2 55 10 5 5 6 11 0 1 7 12 1 1 0 ir 14 5 78 9 4 6 4 21 1 0 9 19 0 0 0 hep 19 15 81 15 9 1 12 22 2 2 10 19 0 0 0 asma 20 14 35 1 7 0 17 12 2 7 2 7 0 1 0 epoc 10 6 49 6 5 4 8 17 2 0 4 10 2 1 2 saos 8 5 42 4 2 1 4 12 1 0 4 10 0 0 0 depre 126 170 201 32 44 5 90 64 6 10 14 33 4 0 8 reuma 10 8 46 7 17 0 11 14 7 1 5 7 1 0 0 evc 8 7 63 9 4 4 6 22 1 1 5 10 2 1 2 osteo 30 20 55 5 22 1 16 19 3 2 4 15 4 0 0 cancer 16 13 85 14 9 2 11 26 1 6 8 13 2 0 0 eii 5 3 6 1 3 0 2 1 1 2 0 0 0 0 0 psoriasis 10 7 27 3 4 1 9 8 2 5 3 3 0 0 1 derma 2 2 4 0 2 0 1 1 1 0 0 2 0 0 0 tir 27 30 86 12 22 2 28 36 1 3 12 14 0 0 1 ulcus 5 3 19 2 3 1 4 7 0 0 3 4 0 0 0 migraña 15 13 27 3 19 0 18 7 0 5 6 3 2 0 1 Cuadro 1.1: Tabla de contingencia con los datos sobre enfermedades y medicamentos ABREVIATURA ENFERMEDAD ABREVIATURA MEDICAMENTO dm Diabetes media Benzo Benzocaína hta Hipertensión arterial Antidepre Antidepresivos hlp Hiperlipemia MetGluc Metabolismo de la glucosa ci Cardiopatía isquémica ado1 Antidiabéticos orales ic Insuciencia cardíaca Antiinf Antiinamatorios ap Arteriopatía periférica Insul2 Isulina ir Insuciencia renal hipSed Hipnótico-sedantes hep Hepatopatía Nfarm N o Fármacos que toma asma Asma Estatinas Estatinas epoc Bronquitis crónica cortic Corticoides saos - ACO2 Anticonceptivos orales depre Depresión betabloq Betabloqueante reuma Reuma diureticos Diuréticos evc Enfermedad vascular cerebral Glucosamin Glucosamina osteo Artosis fenitoina Fenitonina cancer Cancer antipsic Antipsicótico eii - psoriasis Psoriasis derma Dermatitis tir Tiroidismo ulcus Úlcera migraña Migrañas Cuadro 1.2: Tabla con la codicación de los datos sobre enfermedades y fármacos 1.2. BASE DE DATOS SOBRE ANSIEDAD Y DEPRESIÓN 3 1.2. Base de datos sobre ansiedad y depresión El otro conjunto de datos que consideraremos es una tabla que recoge las notas para la ansiedad y depresión de 820 pacientes en una escala del 0 al 9, donde 0 corresponde con no tener la correspondiente enfermedad y 9 tener el mayor grado de esta. Estos datos están relacionados con la tabla anterior y forman parte de un conjunto con muchas más variables de interés del cual ya hemos hablado y que será tratado en el último capítulo. La tabla consta de 820 las (una para cada paciente) por lo que solo mostramos la tabla para los 5 primeros pacientes (Cuadro 1.3), siendo análoga para el resto de individuos considerados. ID Ansiedad Depresión 8 1 0 15 6 7 22 0 0 23 7 6 24 0 2 . . .. . .. . . Cuadro 1.3: Primeras 5 las de la tabla con las puntuaciones sobre ansiedad y depresión Durante toda la parte teórica del trabajo trabajaremos sobre las dos tablas expuestas en este capítulo. 4 CAPÍTULO 1. DATOS PARA LOS EJEMPLOS Capítulo 2 Tablas de contingencia y perles 2.1. Tablas de contingencia El comienzo de todo AC es una tabla de contingencia en la que se recogen recuentos o frecuencias de algún suceso o categoría cruzados con grupos, categorías, sucesos... En esta tabla mediremos la dispersión de los datos, la correlación entre las y columnas, qué celdas de la tabla son más relevantes en el AC, qué datos son atípicos y hasta podremos ampliar la tabla o considerar subtablas de esta. A partir de las tablas de contingencia se construyen todas las herramientas y rudimentos del AC, de ahí su importancia y que comencemos con ellas. En el Cuadro 2.1 mostramos una tabla de contingencia para el caso general con k las y m columnas, tal como muestra el libro Análisis de correspondencias simples y múltiples de Santiago de la Fuente Fernández. Sean X e Y dos variables categóricas, respectivamente, con categorías x1, ..., xk e y1, ..., ym . Una variable categórica se caracteriza por solo poder tomar valores en un cierto conjunto, en donde cada valor se asocia a un grupo o categoría. Lo que representamos en las tablas de contingencia es el recuento para cada categoría dentro de la población sobre la que se ha tomado la muestra. La intersección entre una la y una columna da lugar a una celda, cuya frecuencia observada es nij . Los valores marginales representan la suma de todos los valores de esa la o columna, es decir: ni•= m X j=1 nij (2.1) 5 6 CAPÍTULO 2. TABLAS DE CONTINGENCIA Y PERFILES n•j= k X i=1 nij (2.2) n•• =X i ni•=X j n•j (2.3) y1y2··· yj··· ym TOTAL FILA x1n11 n12 ··· n1j··· n1mn1• x2n21 n22 ··· n2j··· n2mn2• ··· . . .. . .. . .. . .. . .. . .. . . xini1ni2··· nij ··· nin ni• ··· . . .. . .. . .. . .. . .. . .. . . xknk1nk2··· nkj ··· nkm nk• TOTAL COL. n•1n•2··· n•j··· n•mn•• Cuadro 2.1: Tabla de contingencia (caso general) 2.2. Perles Desde este momento y a lo largo de todo el trabajo expresaremos los cálculos y de- niciones asociados al AC de las las. Para las columnas se puede realizar todo lo que hagamos de forma exactamente análoga, por lo que no insistiremos en este. A partir de la tabla de frecuencias construimos un concepto fundamental en el AC, los perles . Un perl es el vector de las frecuencias de una la divididas por su total. En el Cuadro 2.2 mostramos la tabla de frecuencias asociada a la tabla anterior, donde reejamos los perles la de los datos. Los perles columna se hallarían de forma equivalente dividiendo por los marginales de las columnas. Así, por ejemplo para la la i-ésima, su perl la viene dado por el vector: (ni1, ni2, ..., nim)T/ni•= (ni1/ni•, ni2/ni•,··· , nim/ni•)T (2.4) 2.2. PERFILES 7 y1y2··· yj··· ym TOTAL FILA x1n11/n1•n12/n1•··· n1j/n1•··· n1m/n1• 1 x2n21/n2•n22/n2•··· n2j/n2•··· n2m/n2• 1 ··· . . .. . .. . .. . .. . .. . .. . . xini1/ni•ni2/ni•··· nij/ni•··· nim/ni• 1 ··· . . .. . .. . .. . .. . .. . .. . . xknk1/nk•nk2/nk•··· nkj/nk•··· nkm/nk• 1 Cuadro 2.2: Tabla de perles la (caso general) Un caso especial de perl es el que llamaremos vértice , es un perl que concentra toda la frecuencia en una sola componente, es decir, es de la forma (1,0, ..., 0)T . Será de utilidad a la hora de representar los datos. Una vez hemos denido los perles, observamos que los perles la ocupan un espacio de dimensión m-1, ya que la suma de todos los elementos del perl es 1 y por tanto una componente resulta redundante. En el caso de perles con 3 componentes los podríamos representar en un plano sin perdida de información, pero habitualmente no son de interés tablas tan pequeñas. Como primer ejemplo vamos a tomar la tabla del Cuadro 2.3. Insul2 cortic betabloq Total dm 32 2 30 64 ci 3 1 32 36 ic 4 0 12 16 asma 0 2 2 4 psoriasis 1 2 3 6 Total 40 7 79 126 Cuadro 2.3: Tabla de contingencia sobre enfermedades y fármacos de tamaño 5x3 A partir de la tabla de contingencia de los recuentos, podemos expresar la tabla según las frecuencias de cada la, es decir los perles la. Solo tenemos que dividir cada valor de cada la por el marginal de la correspondiente la. 8 CAPÍTULO 2. TABLAS DE CONTINGENCIA Y PERFILES El Cuadro 2.4 muestra los perles la asociados al Cuadro 2.3. Insul2 cortic betabloq Total dm 0.500 0.031 0.469 1 ci 0.083 0.028 0.889 1 ic 0.250 0.000 0.750 1 asma 0.000 0.500 0.500 1 psoriasis 0.167 0.333 0.500 1 Cuadro 2.4: Perles la asociados a la tabla del Cuadro 2.3 Esta tabla puede ser representada en un espacio de 3 dimensiones, en donde la componente en cada dimensión sea la frecuencia con la que los individuos con cierta enfermedad toman ese fármaco. Mostramos la representación de los perles la del Cuadro 2.4 en la Figura 2.1. Así por ejemplo, las coordenadas para psoriasis en el espacio de 3 dimensiones generado por las tres columnas serían (0,167,0,333,0,5)T . Cada eje corresponde con una columna, en nuestro caso con los medicamentos. El valor máximo de cada componente sería 1 (vértices), por lo que todos los perles aparecen en un tetraedro de lado 1. En cada eje, a distancia 1 del origen se encuentra el vértice asociado a ese eje. Representando los perles de la tabla anterior en un espacio de 3 dimensiones obtenemos la Figura 2.1. Figura 2.1: Perles la del Cuadro 2.3 2.2. PERFILES 9 Observamos algo que ya se comentó anteriormente, que es que los puntos se sitúan en un espacio de una dimensión menor. En la Figura 2.2 tomamos el plano que contiene a los 5 perles la. Vemos como los puntos se sitúan todos en el mismo plano. Considerando el triángulo en el que se encuentran los puntos, obtenemos: Figura 2.2: Perles la del Cuadro 2.3 en un espacio de dimensión 2 En el espacio de dimensión 2 los perles quedan perfectamente representados en un triángulo. Los vértices del triángulo son los valores extremos en los que se concentra toda la frecuencia en un punto, lo que denimos como vértices del AC. Los perles no pierden sus posiciones relativas respecto a los vértices ni respecto a ellos mismos y se conservan sus distancias. Esta es una primera aproximación a la utilidad y construcción del AC. Cada perl se encuentra en las coordenadas denidas por su frecuencia en cada eje. De ahí por ejemplo que asma no tenga componente en la dirección de Insul2 (su frecuencia es 0), o que ci esté tan cerca del vértice asociado a betabloqueantes (su frecuencia para este eje es 0,89). Una vez tenemos la tabla de frecuencias, determinamos el concepto de masas . Las masas corresponden a cada una de las las y se denen como el marginal de la la dividido por el total de la tabla. Por ejemplo, para la tabla general, la masa asociada al perl la i será: ri=ni• n•• . 16 CAPÍTULO 3. DISTANCIA JI-CUADRADO E INERCIA Figura 3.1: Perles la y vértices escalados para los datos del Cuadro 2.3 Se observa, a pesar de que los perles ocupan la misma posición unos respecto de otros que las distancias entre ellos se han modicado, dejando patente que efectivamente la anterior representación no era la correcta. Vemos como el vértice asociado a Corticoides, que era la categoría menos frecuente, es el que más se ha estirado. Esto proviene del hecho de dividir por la raíz cuadrada de la masa para esta categoría y esta ser la que menos masa tiene. De aquí concluimos que las categorías o variables que presenten menos masa serán las que más sufran este efecto de estiramiento. Las distancias que se observan en este mapa escalado corresponden con la distancia χ2 entre los perles o vértices. Ahora sí que podemos interpretar el mapa y las distancias entre puntos y podemos sacar conclusiones de estas. Siguen siendo válidos los razonamiento anteriores, donde concluíamos que las enfermedades cardíacas tienden a suponer el consumo de betabloqueantes. No siempre tienen porqué conservarse estas relaciones entre la representación sin escalar y escalada, pero una vez la vemos en el mapa escalado, podemos garantizar esta relación. Concluimos indicando a partir del mapa de la Figura 3.1 que a parte de lo razonado con las enfermedades cardíacas, las personas que padecen asma tienden más a tomar corticoides y las personas con diabetes a consumir insulina. Es lo que habríamos intuido a priori conforme a lo que sabemos de las dolencias y los medicamentos. La tabla ha conrmado nuestras sospechas iniciales, dejando claro todas estas conclusiones. Este es un ejemplo de para qué sirve y la utilidad práctica del AC. Capítulo 4 Representación En el ejemplo anterior ya no resulta evidente visualizar las posiciones de los perles al encontrarse en un espacio tridimensional. Cuando trabajemos con tablas mayores (lo cual es habitual) vamos a tener un gran problema para visualizar los datos en un mapa. De ahí que resulte necesario encontrar métodos y alternativas que nos permitan la visualización en espacios de menor dimensión. El AC soluciona esto y nos dará varias herramientas, buscando al mismo tiempo reducir al máximo la pérdida de información. Cuando hablemos de pérdida de información estaremos pensando en la inercia. Esta es la medida de la variación de la tabla y de la relación entre las variables. Nos interesa expresar en nuestro nuevo espacio lo más elmente posible esta dispersión entre los datos para poder establecer relaciones y diferencias entre grupos y/o categorías. Perder esta información podría ser muy peligroso, conduciéndonos a errores de interpretación y camuando el verdadero comportamiento de los datos. Llamemos S a un posible subespacio de nuestro espacio total, preferiblemente de baja dimensionalidad y denotemos por di(S) la distancia χ2 entre el subespacio S y el i-ésimo perl la ai con masa ri . Consideramos la proximidad de todos los perles a S como: k X i=1 ri[di(S)]2 (4.1) Multiplicamos cada factor por la masa del perl la para que así los perles con más masa tengan más peso y forzar a S a pasar cerca de estos perles. Claro está que el 17 18 CAPÍTULO 4. REPRESENTACIÓN subespacio que mejor representa los datos debe pasar más cerca de aquellos que más relevancia tienen en términos de masa. El objetivo del AC es encontrar el subespacio que minimice la distancia anterior. Como primera aproximación, se cumple que necesariamente el subespacio S buscado tiene que pasar por el centroide (perl medio) de los puntos. 4.1. Descomposición en valores singulares Para implementar la minimización expuesta antes uno de los métodos es recurrir a la descomposición en valores singulares (DVS) . Nos apoyaremos en este concepto del álgebra computacional para hallar las coordenadas que tendrían nuestros perles en un espacio de menor dimensión. Esta técnica aparece detallada en el libro Análisis de Correspondencias de Salvador Figueras, M., de donde hemos extraído los conceptos explicados en este capítulo. Hemos cruzado la información de este libro con el de Luis Joaristi Olariaga y Luis Lizasoain Hernández, Análisis de correspondencias , para poder comprender bien esta técnica y poder adoptar la notación y conceptos necesarios para desenvolver el trabajo. Comenzamos deniendo la matriz C , llamada matriz de residuos estandarizados, del siguiente modo: C= (cij), cij =nij −eij √eij (4.2) Como trabajamos con tablas de recuentos y frecuencias, los componentes de C serán reales, por tanto la matriz CtC∈Rmxm será cuadrada, simétrica y semidenida positiva y por tanto sus autovalores serán todos positivos. Sean λ1≥λ2≥λm los autovalores de la matriz CTC . Entonces los valores σi=√λi se denominan los valores singulares de la matriz C . Sea h el número de dimensiones sobre el que queremos proyectar nuestros datos perdiendo la mínima información (inercia). El AC busca encontrar dos matrices A, B que representen los perles la o columna respectivamente en el espacio de menor dimensión, es decir: A=a0 1···a0 k, a0 i= (a0 i1,··· , a0 ih)T, con h la dimensión del nuevo espacio. (4.3) B=b0 1···b0 m, b0 i= (b0 i1,··· , b0 ih)T, con h la dimensión del nuevo espacio. (4.4) 4.2. ESCALADO ÓPTIMO 19 Por lo general h=2. Para calcular esta A y B el AC descompone la matriz C calculando los valores singulares y las matrices U, D, V tal que: C=UDV t (4.5) Donde: D=diag(σ1,··· , σH), UUt=VtV=I, U∈RkxH, V∈RmxH, H=min{k−1, m −1} Y una vez calculadas las matrices U, D, V se determinan A y B como: A=D−1/2 kUD (4.6) B=D−1/2 mV D (4.7) Siendo: D−1/2 k=diag(n1•,··· , nm•), D−1/2 m=diag(n•1,··· , n•k) 4.2. Escalado óptimo Cuando trabajamos con tablas de contingencias es habitual encontrar variables categóricas a las que es difícil asignar un valor numérico. Por ejemplo, para los datos del cuadro 2.3 sobre el que hemos estado trabajando, podríamos considerar como: 1=Insulina, 2=Corticoides, 3=Betabloqueantes. Podríamos calcular la medicación media como: (1 ·40 + 2 ·7+3·79)/126 = (0,318 ·1) + (0,056 ·2) + (0,627 ·3) = 2,311 20 CAPÍTULO 4. REPRESENTACIÓN Donde (0,318,0,056,0,627)T son las componentes del perl la medio. El problema de este cálculo, es que los valores 1,2,3 han sido establecidos sin ningún rigor, hemos tomado esta escala como podríamos haber tomado cualquier otra. Análogamente podemos hallar la media de cada grupo de pacientes con cierta enfermedad usando la escala anterior, obteniendo: Fila Media dm 1.969 ci 2.806 ic 2.500 asma 2.500 psoriasis 2.333 También podemos calcular la varianza de la tabla con esta escala: 64 126 ·(1,969 −2,311)2+36 126 ·(2,806 −2,311)2+16 126 ·(2,5−2,311)2+ +4 126 ·(2,5−2,311)2+6 126 ·(2,333 −2,311)2= 0,135 Los resultados de las medias dependen de la escala entera escogida y puesto que no tenemos ninguna justicación para la elección de estos valores 1,2,3 buscamos una nueva escala más adecuada, que llamaremos escala óptima . En general, llamemos v1, v2,··· , vm a la escalada asignada a nuestras variables. La media de medicamento global y para cada la sería: media global =s= [(n•1·v1)+(n•2·v2) + ···+ (n•m·vm)]/n media fila i =si= [(ni1·v1)+(ni2·v2) + ···+ (nim ·vm)]/n Una vez denido esto, establecemos restricciones y condiciones que queremos que cumplan los v1,··· , vm para despejarlos. Una propiedad deseable sería que las medias de las las estuvieran lo más espaciadas posibles unas de otras con el n de distinguir al máximo entre grupos. Igualmente, nos interesa que la varianza sea máxima, para poder tener el máximo de información y poder detectar mejor los agrupamientos o diferencias entre grupos. 4.2. ESCALADO ÓPTIMO 21 La escala óptima vendrá dada por los vi que maximicen la varianza tal como la indicamos antes. Calculamos estos valores imponiendo las condiciones de identicación o restricciones , que son que la media global sea 0, y la varianza 1. Obtenemos entonces los valores óptimos de escala resolviendo el sistema: [(n•1·v1)+(n•2·v2) + ···+ (n•m·vm)]/n = 0 (4.8) [(n•1·v1)2+ (n•2·v2)2+···+ (n•m·vm)2]/n2= 1 (4.9) Tomando la dimensión que mejor ajusta los datos (caso dim(S) = 1 , donde S es el subespacio considerado al principio de este capitulo), las posiciones de los vértices en esta dimensión resuelven el sistema anterior. La varianza máxima es igual a la inercia en esta dimensión calculada por el AC. Una vez tenemos los valores de escala óptimos, podemos transformarlos mediante operaciones lineales a una escala más conveniente. En general nos interesa jar el valor mínimo y máximo de la escala. Para hacer esto, basta con despejar los nuevos valores de escala v0 i tal que: •vmin =min{vi, i = 1,···m}, •rango =Max{vi, i = 1,···m}−vmin, •v0 min = El nuevo límite inferior, por ej. 0 •rango0= rango que nos interesa, por ej. 0-100 , Entonces, para obtener los valores en la nueva escala con el máximo y mínimo donde nos interesa transformamos los valores: v0 i=(vi−vmin)·rango0 rango +v0 min (4.10) Otra alternativa para hallar el escalado óptimo es abordar esta búsqueda desde otra perspectiva. Denidos los vértices, el objetivo será encontrar una escala tal que los perles con mayor frecuencia en un vértice estén más cerca de este. Si h1,··· , hm son los valores de la escala para las columnas y a1,··· , ak los de las las, se intenta minimizar la función: X iX j pijd2 ij =X i,j pijkai−hjk2 (4.11) 22 CAPÍTULO 4. REPRESENTACIÓN Donde dij =kai−hjk es la distancia entre un grupo (en nuestro ejemplo enfermedades) y una categoría (medicamentos). Por conveniencia tomamos el cuadrado de las diferencias en vez de el valor absoluto. Si consideramos de nuevo las condiciones de identicación, obtenemos de nuevo la solución con el espacio óptimo del AC de dimensión 1. 4.3. Ejes y coordenadas principales En la anterior sección nos hemos referido a la dimensión que mejor ajusta los datos pero no hemos profundizado en ella. Esta dimensión se suele denotar como primer eje principal . Una vez hallado este eje, podemos calcular la inercia de los datos una vez proyectados sobre el. A la inercia explicada por este eje se le llama primera inercia principal . Análogamente se denen el segundo eje principal y la segunda inercia principal y así sucesivamente. El segundo eje principal es el que intenta explicar la inercia que no ha sido explicada por el primer eje principal y así con todos los ejes, hasta el punto en que si tomamos todas las dimensiones de la tabla representemos el 100% de la inercia al estar representando los perles en el espacio en que se encuentran. Dividiendo la inercia principal de un eje entre la inercia original, obtenemos una medida de la inercia explicada en el eje en forma de porcentaje, lo que nos da una idea de lo bien o mal representados que quedan los datos en este eje. Cuanto mayor sea este porcentaje, mejor representados estarán los perles en el eje. La inercia que queda sin representar es la que intentaríamos representar con el segundo eje principal. Entre los dos ejes explican la suma de sus inercias principales. El objetivo del AC es encontrar el menor número de ejes que expliquen la mayor parte de la inercia. A las coordenadas en estos ejes nos referiremos como coordenadas principales . Los conceptos de ejes y coordenadas principales, representación e inercia han sido reforzados en este trabajo con el libro Análisis de correspondencias de Luis Joaristi Olariaga y Luis Lizasoain Hernández. Este libro incluye además en el segundo capítulo un detallado ejemplo para mostrar todos estos conceptos, lo que nos ha facilitado su comprensión. 4.4. REPRESENTACIONES EN DOS DIMENSIONES 23 4.4. Representaciones en dos dimensiones Vamos a trabajar con otros datos extraídos de los introducidos en el primer capítulo. Ahora tenemos una tabla que cruza 6 enfermedades con 4 medicamentos. Presentamos este segundo cruce en el Cuadro 4.1. Insul2 Antidepre Estatinas ado1 dm 32 42 103 151 ci 3 11 50 19 ic 4 4 14 8 depre 5 170 64 32 hta 23 93 209 110 ap 5 2 11 10 Cuadro 4.1: Tabla de recuentos sobre enfermedades y fármacos En este ejemplo, el espacio de perles queda representado en un espacio de 3 dimensiones. Vamos a proyectar los vértices y los perles sobre el plano que mejor se ajuste, es decir, el que más inercia explique. Con los procedimientos expuestos anteriormente y representando el primer eje principal horizontalmente (lo habitual en AC), obtenemos el mapa de la Figura 4.1. Entre paréntesis al lado de la etiqueta de cada dimensión nos aparecen el porcentaje de inercia explicada en cada eje, por lo que la inercia explicada por el plano es 80,4 % + 17,6 % = 98 % de la inercia total de la tabla. El 2 % que no aparece representado en la tabla corresponde a la tercera dimensión. El porcentaje de inercia explicado es muy elevado, por lo que tenemos una muy buena representación de los datos renunciando a una dimensión. Esto nos indica que los datos pasan todos muy cerca del plano, por ello al explorar las posiciones relativas de los perles en el mapa no habrá ningún problema obviando la dimensión no representada. El origen representa el perl medio. Se representan los vértices para tener una referencia y establecer comparaciones, lo mismo para el perl medio. En la tabla vemos una estructura muy clara de los vértices en el primer eje principal. A la derecha se sitúa el perl y el vértice asociado a enfermedades psíquicas y a la derecha los perles y vértices asociados a enfermedades físicas. 24 CAPÍTULO 4. REPRESENTACIÓN Figura 4.1: Perles representados en los dos primeros ejes principales del Cuadro 4.1 Por tanto, un perl situado a la derecha del origen (perl medio) se asociará con una enfermedad psíquica. En el segundo eje, también se aprecia una clara tendencia. Los dos vértices superiores a la izquierda corresponden con fármacos para tratar la diabetes y el inferior izquierdo con un medicamento para bajar el colesterol. Por tanto, si un perl de una enfermedad se encuentra a la izquierda del origen, se asociará con fármacos para la diabetes si está por encima del origen y con tratamientos para la dolencia cardíaca si se encuentra por debajo. También podemos indicar cómo dentro de las enfermedades cardíacas, el caso del ci (cardiopatía isquémica) es el que más tiende a ser medicado con estatinas. Al haber una inercia explicada muy alta, las interpretaciones son correctas y vemos como se relacionan las enfermedades y los fármacos elmente. En general, si la representación es de calidad (hay un alto porcentaje de inercia explicado en el mapa) podemos establecer conclusiones ables de esta. Un perl que se encuentre cerca de un vértice, indica que este perl se identica mucho con ese vértice. Podemos sacar conclusiones comparando a que vértice está más próximo cada perl, entre dos perles cual se dispone más cerca de un cierto vértice, si existe alguna ordenación de los perles o vértices, etc... 4.5. SIMETRÍA ENTRE EL AC DE FILAS Y COLUMNAS 25 En el AC no existe una norma universal para su interpretación, dentro de cada mapa estudiamos las posiciones de vértices y perles y sacamos conclusiones de estas según su proximidad u ordenación. Decimos que los ejes están anidados , ya que de realizar la proyección de los perles del plano sobre el primer eje principal, obtendríamos las mismas coordenadas que si hiciésemos el AC para hallar solo el primer eje principal. Llamamos coordenadas principales a las coordenadas de los perles en un eje principal y coordenadas estándares a las coordenadas en un eje principal de los vértices. En la representación de la Figura 4.1 hemos representado las las en coordenadas principales y las columnas en coordenadas estándares. A una representación de este tipo se le denomina mapa asimétrico . El mismo nombre recibiría un mapa con las las en coordenadas estándares y las columnas en coordenadas principales. El nombre del mapa viene de que las coordenadas de las y columnas no están expresadas de la misma forma. La Figura 4.1 también recibe el nombre de mapa en las principales . Esto motiva la introducción de un nuevo tipo de mapa llamado mapa simétrico . Consiste en una representación de las y columnas en coordenadas principales. No existe un consenso respecto a qué mapa es mejor. Los mapas simétricos suelen ser más útiles cuando la inercia de la tabla es baja, pues al representar las y columnas en coordenadas principales se aprecia mejor la dispersión de los datos. A cambio, en los mapas simétricos solo se pueden establecer conclusiones a partir de la posición relativa de los perles, basándonos en la proximidad entre perles. El hecho de no representar los vértices hace que perdamos este punto de referencia. Lo habitual es decantarse entre un mapa u otro dependiendo de los datos y tipo de estudio que nos interese realizar. 4.5. Simetría entre el AC de las y columnas Hemos comentado que todos los cálculos y deniciones introducidos para las las tienen su análogo para columnas. En este capítulo profundizaremos más en la relación que existe entre el AC por las y columnas. De hecho, como introducción, podríamos pensar el análisis por columnas como un AC de las las de la tabla traspuesta. 32 CAPÍTULO 4. REPRESENTACIÓN Como dijimos, podemos interpretar las proyecciones de cada punto sobre el eje generado por cada columna. De esta forma, vemos como el eje Antidepre aparece casi en perpendicular a los otros dos ejes, y como la enfermedad depre claramente es la que tiene un valor mayor en este eje. También vemos una situación similar con la diabetes y los dos medicamentos considerados para tratarla y que las enfermedades cardíacas se ordenan de la misma forma respecto al eje de Estatinas. Podemos obtener los mismos razonamientos que hicimos con el mapa del AC de estos datos pero en este caso con el biplot estándar. Este ejemplo muestra como efectivamente existe gran relación entre el AC y los biplots y como interpretar la información que nos dan estos. Los biplots funcionan igual de bien para tablas con inercias bajas o altas, por lo que serán especialmente útiles cuando nos encontremos con tablas de datos de baja inercia como la que teníamos. De hecho en el biplot vemos una mayor diferenciación entre los perles asociados a la diabetes y su tratamiento y el resto. 4.9. Transformación de tablas Pueden interesarnos casos en los que intervengan más de dos variables en la determinación de los individuos o de las categorías por la naturaleza inherente de los datos, por una estructura o diferenciación que nos interese comprobar o simplemente para renar lo calculado en un AC anterior. Otra posibilidad sería la de pretender realizar el AC a una tabla con muchas variables en las, columnas o ambas. En este caso consideraremos el análisis de tablas concatenadas, en el que solaparemos varias tablas con distintas variables pero relacionadas y en la misma escala para que el solapamiento tenga sentido. Así, al realizar el AC podemos estudiar el comportamiento global de la tabla solapada y el de cada subtabla. En el ejemplo del Cuadro 4.1 sobre las enfermedades podríamos introducir una tercera variable como el sexo. De esta forma, obtendríamos 2x5 variables en las las en lugar de las 5 que teníamos anteriormente. Una vez hecho esto, nos interesará saber si el efecto del género se mantiene a lo largo de todos los grupos, es decir, que la relación hombres-mujeres se mantenga uniformemente dentro de los 5 grupos. De haber algún o algunos grupos en los que no se mantuviese esa homogeneidad, en estos se presentaría un efecto de interacción. 4.9. TRANSFORMACIÓN DE TABLAS 33 Para contrastar esto, construiríamos una nueva tabla con 10 las representando (2 géneros)x(5 enfermedades), realizaríamos el AC y veríamos en el mapa obtenido en qué grupos existe el fenómeno de interacción y en cuales no. Si no se produjese interacción en ningún grupo veríamos una distribución en el mapa similar en los puntos de los hombres y mujeres, encontrándose cerca enfermedades iguales en hombres y mujeres. De esta forma intuiríamos la no interacción entre género y enfermedades. En general, si tenemos dos variables categóricas con I, J categorías respectivamente, podemos codicar ambas en una tabla de múltiples entradas codicando una nueva variable con IxJ categorías. Cruzamos esta nueva variable con otra que nos interese, realizamos el AC e interpretamos este de la manera habitual, con la posibilidad además de estudiar el efecto de interacción entre las dos variables categóricas que codicamos como una y la variable cruzada. En el párrafo anterior hablamos del caso de dos variables categóricas con I, J categorías respectivamente, lo que conduce a una tabla con una variable con IxJ categorías. Pero en el caso de tener más variables categóricas la tabla crecería de tamaño hasta un punto en que no podamos interpretar los puntos del mapa. Para el ejemplo de las enfermedades cruzadas con los fármacos, si añadiésemos las categorías sexo, casado/soltero, nacionalidad, ... llegaríamos a una tabla enorme y consecuencia de esto obtendríamos una elevada cantidad de puntos en el mapa que no nos permitirían diferenciar unos de otros y dicultaría la interpretación. En estos casos consideramos codicar los datos en forma de tablas concatenadas. En estas tablas cruzamos las categorías con la variable indicada en la tabla pero considerando las subtablas de cada categoría. Primero realizamos este análisis y después consideramos todas las tablas concatenadas. Este método no nos permite identicar interacciones, pero si lo podemos considerar como un AC medio de las subtablas que consideremos. Recalcamos que con estas interpretaciones no podemos establecer relaciones entre las categorías de las subtablas, solo entre las categorías dentro de cada subtabla con las categorías con las que se cruzan. Para realizar estas comparaciones, tendríamos que cruzarlas y realizar el AC a la tabla grande. Hemos expresado el ejemplo para el caso en que aumentamos el número de las. Pero podría razonarse análogamente para las columnas e incluso para el caso en que tengamos más categorías para las y columnas. Pongamos que nuestra tabla concatenada tenga 34 CAPÍTULO 4. REPRESENTACIÓN ahora S y Q categorías para las y columnas respectivamente. Dentro de cada categoría encontramos subcategorías que conforman la subtabla. Para el ejemplo de las enfermedades, al añadir la categoría sexo encontraríamos una tabla con 2x5 las, donde S=5 y cada tabla tendría dos subcategorías, hombre-mujer. Otro razonamiento sería el de una tabla con S=2 y 5 subcategorías referentes a cada enfermedad. Esta elección suele venir motivada por lo que nos interese contrastar. La tabla concatenada es esencialmente la misma, solo estamos intercambiando las, por lo que los resultados del AC no varían. Como aclaración, la tabla concatenada resultante tendría la forma de la tabla de la Figura 4.4. Figura 4.4: Diagrama tabla concatenada con S y Q categorías La inercia total de la tabla concatenada es la media de las inercias de cada subtabla. Si tenemos S y Q variables categóricas respectivamente que componen la tabla concatenada, la inercia de esta es: inercia(N) = 1 QS Q X q=1 S X s=1 inercia(Nqs) +  (4.16) Donde Nqs representa la subtabla de contingencia (q,s) y  es un error que se comete al realizar esta aproximación. El error proviene de que no todas las subtablas tienen porque 4.9. TRANSFORMACIÓN DE TABLAS 35 tener las mismas frecuencias marginales debido a valores perdidos, no respondidos... por lo que la media no concuerda exactamente con la inercia global. Si todas tuvieran los mismos valores marginales, = 0 . Si trabajamos con variables expresadas en una escala de grados (por ejemplo una encuesta de satisfacción donde las respuestas estén entre 1-5) precisamos realizar una transformación de esta escala que aporte información al AC. Esta transformación se conoce como doblado de los datos . Consiste en expresar los datos en relación a su diferencia con el valor más bajo y más alto de la escala. Lo preferible es situar en cero el valor más bajo de la escala. Para el ejemplo de la encuesta de satisfacción procederíamos restando uno a todas las variables y trabajando con la escala 0-4. Después expresaríamos los valores doblados de cada respuesta como: 1→0 4 2→1 3 3→2 2 4→3 1 5→4 0 Por ejemplo el valor 2 tiene 1 (1) valor por debajo y 3 (3,4,5) por encima. De ahí su codicación. De esta forma construimos una nueva tabla que dobla el tamaño de las columnas, apareciendo para cada la su valor doblado en cada respuesta para cada variable. Esta tabla mide la asociación de cada encuestado con los extremos de la escala. Aplicando el AC a esta tabla doblada, obtenemos información de los datos y podemos interpretar los mapas obtenidos. Los valores doblados en el mapa se hallarán en puntos opuestos respecto al origen. Podemos trazar una linea entre cada perl doblado e interpretar los cosenos entre cada linea como una correlación como hacíamos antes. De esta forma, los perles cuyas rectas muestren poco ángulo entre ellas se asociarán con variables con mucha correlación, y los que muestren ángulos más próximos a 90 o se asociarán con variables incorreladas. Podemos realizar todo lo anterior ante cualquier tipo de datos que se pueda codicar doblando los datos, ya sean grados de preferencia, ordenar algún producto,... Cuando estas respuestas aparezcan de forma continua podemos hacer el doblado de los datos de igual forma. Basta expresar primero la escala continua en rangos. 36 CAPÍTULO 4. REPRESENTACIÓN 4.10. Regresión Hemos hablado de cómo representar las las y columnas en un mapa a partir del AC y como interpretarlo. En esta sección trataremos las relaciones existentes entre las y columnas de forma matemática y no solo gráca. Unas vez representado un punto en coordenadas estándares, podemos representar este punto como unas coordenadas cartesianas en un plano de la forma (x,y). La recta de regresión de Y sobre X (las sobre columnas) tendrá como pendiente el coeciente de correlación entre X e Y, es decir √λ1 , siendo λ1 la primera inercia principal. La recta de regresión de X sobre Y tendrá como pendiente la inversa de este valor, es decir 1/√λ1 . Cuanto más parecidas sean las dos rectas de regresión mayor será la inercia, por lo que se cumple que las coordenadas estándares de las las y columnas minimizan el ángulo entre la regresión de las sobre columnas y la de columnas sobre las. Recordando que las coordenadas principales corresponden a perles y las estándares a vértices, podemos establecer la relación entre las y columnas como: fik =X jpij riγjk (4.17) Siendo fik la k-ésima coordenada principal de la la i y γjk la k-ésima coordenada estándar de la j-ésima columna. Análogamente: gik =X ipij cjφik (4.18) Siendo gjk la k-ésima coordenada principal de la columna j y φik la k-ésima coordenada estándar de la i-ésima la. El coeciente k hace referencia a la dimensión en la que nos interesa interpretar los datos, por lo que habitualmente k=2. Ya habíamos visto la relación entre las coordenadas principales y estándares: fik =pλkφik (4.19) gik =pλkγjk (4.20) 4.10. REGRESIÓN 37 A partir de las expresiones (4.17), (4.18), (4.19), (4.20) llegamos a las siguientes ecuaciones para relacionar las coordenadas principales de las y columnas: fik =1 √λkX jpij rigik (4.21) gik =1 √λkX ipij cjfik (4.22) Y análogamente para relacionar las coordenadas estándares de las y columnas: φik =1 √λkX jpij riγjk (4.23) γjk =1 √λkX ipij cjφik (4.24) Podemos utilizar cualquiera de las ecuaciones anteriores para estimar por regresión las coordenadas de los puntos en el mapa a partir de los perles (variables explicativas). Realizaríamos una regresión lineal sobre los valores que tenemos buscando los coecientes que mejor ajusten cualquiera de los modelos expresados en las ecuaciones (4.21), ..., (4.24). En regresión suponemos que los datos se ajustan a un modelo lineal y buscamos la estimación de los coecientes que mejor ajustan esta recta. Aquí hacemos lo mismo estimando los coecientes que hemos expresado antes. 38 CAPÍTULO 4. REPRESENTACIÓN Capítulo 5 Análisis de correspondencias alternativos 5.1. Análisis de correspondencias múltiple Hasta ahora hemos considerado unas variables categóricas la y otras columna diferentes entre sí. En este capítulo consideraremos el caso en que realizamos el análisis sobre variables similares, el análisis de correspondencias múltiples (ACM) . Analizaremos la relación entre dos o más variables en el contexto de un solo fenómeno de interés. Lo necesario es que las variables sean notablemente similares en su naturaleza o denición. 5.1.1. ACM a partir de la tabla binaria Podemos pensar el ACM como un AC sobre la matriz binaria de los datos. Expresaremos esta matriz como lo hace Santiago de la Fuente Fernández en su libro Análisis de correspondencias simples y múltiples . La matriz binaria es una matriz Nx PQ q=1 Jq , donde N son los individuos o grupos, Q las variables y Jq el número de categorías dentro de la q-ésima variable. 39 40 CAPÍTULO 5. ANÁLISIS DE CORRESPONDENCIAS ALTERNATIVOS Denotamos esta matriz por Z y se construye como: zij = 1 , si el i-ésimo individuo pertenece a la categoría j zij = 0 , si el i-ésimo individuo NO pertenece a la categoría j Las respuestas son excluyentes entre sí, en el sentido de que para un individuo en una variable, la matriz binaria solo puede tomar el valor 1 en una sola de las Jq categorías y 0 en el resto dentro de cada variable. Denida esta matriz, realizamos el AC sobre ella y podemos interpretar el mapa de forma análoga a lo hecho hasta ahora. La diferencia reside en que ahora interpretamos las relaciones entre variables similares y no tomamos de referencia los vértices, simplemente interpretamos las posiciones de los puntos y la proximidad de unos a otros. Podemos considerar la matriz binaria como una tabla concatenada donde solapamos Q subtablas, donde en cada subtabla para cada la hay un 1 y el resto 0. Es decir, los marginales de las las de cada subtabla es una columna toda de unos. Vamos a introducir otro ejemplo para exponer este tipo de tablas. En este ejemplo (de nuevo a partir de los datos proporcionados por nuestro investigador) se recoge una puntuación para el nivel de ansiedad y el nivel de depresión en una escala de 0-9 para 820 pacientes. Construimos la matriz binaria asociada a estos datos y obtenemos la tabla del Cuadro 5.1 (en la que solo se representan las 5 primeras las). ID A0 A1 A2 A3 A4 A5 A6 A7 A8 A9 D0 D1 D2 D3 D4 D5 D6 D7 D8 D9 1 0 1 0 0 0 0 0 0 0 0 1 0 0 0 0 0 0 0 0 0 2 0 0 0 0 0 0 1 0 0 0 0 0 0 0 0 0 0 1 0 0 3 1 0 0 0 0 0 0 0 0 0 1 0 0 0 0 0 0 0 0 0 4 0 0 0 0 0 0 0 1 0 0 0 0 0 0 0 0 1 0 0 0 5 1 0 0 0 0 0 0 0 0 0 0 0 1 0 0 0 0 0 0 0 . . .. . .. . .. . .. . .. . .. . .. . .. . .. . .. . .. . .. . .. . .. . .. . .. . .. . .. . .. . .. . . Cuadro 5.1: Primeras 5 las de la tabla binaria con las notas de ansiedad y depresión Notemos que en este ejemplo, J1=J2= 10 , Q= 2 y N= 820 y que la tabla cumple las condiciones que hemos expuesto para ser considerada binaria. Ahora simplemente realizamos el AC como hemos introducido a lo largo de todo el trabajo, con la única salvedad de que la interpretación es distinta. Ahora no representamos vértices (no tendría sentido) y lo que interpretamos son las distancias y posiciones de los perles usando los propios perles 5.1. ANÁLISIS DE CORRESPONDENCIAS MÚLTIPLE 41 como referencia. Así diremos que un vértice está relacionado con otro si se encuentran cerca o que no lo están si se encuentran distanciados uno de otro. El mapa del AC para el ejemplo del Cuadro 5.1 lo incluimos en la Figura 5.1. Figura 5.1: Mapa del AC para la tabla binaria del Cuadro 5.1 Este mapa explica un bajo porcentaje de la inercia por lo que no lo podemos interpretar con seguridad. Aquí la incluimos para mostrar como se razona este tipo de AC. La interpretación no resulta muy fácil al encontrarse muchos perles muy juntos, por tanto solo concluimos de esta tabla que los altos grados de depresión (8 y 9) no están relacionados con la puntuación de la ansiedad, salvo el nivel 8 que parece seguir relacionado. Podríamos razonar que la cercanía entre los perles indica que en los niveles bajos de depresión y ansiedad las dos enfermedades están bastante relacionadas salvo para el peor grado de depresión, para el cual probablemente afecten más factores que solo la ansiedad al tratarse del peor nivel para la enfermedad. La inercia de la matriz binaria solo depende del número de variables y no de sus valores. Si J=PqJq , la matriz binaria es de tamaño QxJ. Los marginales de las las para cada subtabla de tamaño NxJq son todos 1, por lo que estamos en el caso extremo en que todos los perles se corresponden con los vértices. Por tanto, como ya explicamos en el capítulo 2, la inercia de la subtabla será igual a su dimensionalidad, es decir, Jq−1 . 48 CAPÍTULO 5. ANÁLISIS DE CORRESPONDENCIAS ALTERNATIVOS Una vez tenemos esta matriz realizamos el AC sobre ella. Si la matriz N es de tamaño SxS , la nueva tabla tendrá una dimensionalidad de 2S−1 . Cuando descomponemos las inercias principales asociadas a todos los 2S−1 ejes nos encontraremos con valores de inercia que aparecen a pares y otros individualmente. Los valores que aparezcan a pares serán los asociados a la parte antisimétrica de la tabla y los que aparezcan solos a la simétrica. El AC de la parte simétrica lo interpretaremos de la manera habitual, es decir, el mapa mostrará la asociación entre variables de la tabla. El AC de la parte antisimétrica tiene una interpretación especial debido a las diferencias en la naturaleza de la tabla con las vistas hasta ahora. La primera diferencia se produce por la igualdad de las inercias principales, lo que provoca que las coordenadas puedan girar por el mapa. Por este motivo, en este AC no dibujamos los ejes. La segunda se debe a la característica antisimétrica de la matriz, lo que hace que los resultados aparezcan repetidos con signos opuestos. Solo representaremos uno de los dos pares de signos. Llamaremos ujo al fenómeno que expresa la relación entre las las y las columnas de la tabla original, en el sentido de que si existe un ujo entre una determinada la i y columna j estaremos expresando que la frecuencia del punto (i,j) de la tabla varía mucho respecto al (j,i). La interpretación una vez congurado el mapa con las sutilezas comentadas anteriormente no se realiza a partir de las distancias. Lo que se hace es denir regiones triangulares denidas por dos puntos y el origen. Los triángulos grandes expresarán un ujo entre las las y columnas que denen los triángulos y los triángulos pequeños indicarán la ausencia de ujo entre esas las y columnas. Recurrimos de nuevo al ejemplo sobre la ansiedad y depresión. Hecho el AC sobre la matriz de recuentos de las respuestas de la ansiedad y depresión (donde en cada celda (i,j) aparece el número de individuos con puntuación i-1 en depresión y j-1 en ansiedad) construimos la matriz como la indicada en la fórmula (5.7). Una vez realizado el AC sobre esta tabla obtenemos las inercias principales en las 2x10-1 dimensiones de la tabla. Las inercias principales para cada eje se muestran en el Cuadro 5.2. Del Cuadro 5.2 deducimos que el primer eje está asociado a la parte simétrica de la tabla, la segunda y la tercera a la parte antisimétrica y así sucesivamente. Una vez identicados qué ejes corresponden con cada parte, solo nos queda interpretar los resultados. 5.4. ANÁLISIS DE TABLAS CUADRADAS 49 Dimensión Inercia Principal 1 0.3718 2 0.0799 3 0.0799 4 0.0561 5 0.0345 6 0.0345 7 0.0253 8 0.0253 9 0.0142 10 0.0124 11 0.0095 12 0.0052 13 0.0052 14 0.0038 15 0.0027 16 0.0016 17 1.8x10-50 18 1.8x10-50 19 3x10-6000 TOTAL 0.7622 Cuadro 5.2: Tabla con las 19 inercias principales Representando los primeros ejes de la parte simétrica obtenemos el mapa de la Figura 5.3 y representando los primeros ejes para la parte antisimétrica obtenemos el mapa de la Figura 5.4. Figura 5.3: Mapa de la parte simétrica para la tabla cuadrada de ansiedad y depresión 50 CAPÍTULO 5. ANÁLISIS DE CORRESPONDENCIAS ALTERNATIVOS Como ya hemos comentado, el análisis de la parte simétrica se realiza de la manera habitual y por tanto no realizaremos la interpretación de este mapa. El caso nuevo es el mapa asociado a la parte antisimétrica de la tabla. En este mapa consideraremos los ujos entre perles. Hemos representado en el mapa un triángulo que une el eje, el perl de A8 y D8. Es uno de los triángulos de mayor área que podemos trazar considerando como vértices del triángulo el origen y dos perles, uno para cada variable. Interpretamos triángulos con un área grande como perles entre los que existe un ujo. En este caso, no hay triángulos muy grandes, por lo que interpretamos que las frecuencias de los pacientes con un nivel de ansiedad y depresión se mantienen en toda la tabla. El único punto para el que podría haber ujo es para el mayor nivel de ansiedad, mostrando que las frecuencias del mayor grado de ansiedad son distintas dependiendo del grado de depresión. Figura 5.4: Mapa de la parte antisimétrica para la tabla cuadrada de ansiedad y depresión Capítulo 6 Inferencia Hasta ahora hemos considerado en algunos casos la eliminación de puntos por ejemplo. Lo que no hemos tratado es cómo afecta esta eliminación al AC. Ya vimos en el capítulo 4 las contribuciones a la inercia de los puntos. Si un punto tiene mucho peso en la conguración del mapa puede modicarlo sustancialmente, así como un punto con menos inuencia puede ser obviado en cuanto a que no varían mucho los resultados. Para comprobar si la supresión de uno o varios puntos afecta signicativamente a la conguración del mapa efectuamos el AC omitiendo los puntos y vemos como se ven afectados los resultados. Otro tema importante es la variabilidad de la muestra que tenemos en la tabla de contingencia. ¾Tenemos datos sobre una parte de la población elegida de forma aleatoria o siguiendo algún criterio de selección? Lo idílico sería poder realizar el AC muchas veces sobre muchas muestras, pero por lo general es imposible. A raíz de esto nos formulamos la pregunta, ¾caracteriza el AC de esta muestra a la población o es resultado del azar? 6.1. Bootstrapping Esta sección ha sido desarrollado a partir de la consulta al libro An introduction to the bootstrap de Efron, B. y Tibshirani, R. J., donde se introduce el concepto de bootstrap y su 51 52 CAPÍTULO 6. INFERENCIA desarrollo en profundidad. Nuestro libro de referencia no incide mucho en este apartado, por lo que el trabajo de Efron, B. y Tibshirani, R. J. nos ha sido de gran utilidad para la comprensión y posterior explicación del bootstrap. No podemos realizar remuestreos sobre la población, por lo que recurrimos al bootstrapping . Consiste en considerar los datos que tenemos como si fuesen la población total y crear una nueva muestra tomada de esta. Realizaríamos la toma del mismo número de datos que para el muestreo original tomándolos de uno en uno con reemplazamiento de los datos originales. De esta manera las frecuencias de la nueva muestra tenderán a parecerse bastante a las que ya teníamos. Podemos repetir este automuestreo tantas veces como queramos, siendo lo habitual entre 100 y 1000 veces. Otra alternativa es recurrir al automuestreo multinomial , que consiste en tomar los nuevos datos de una supuesta población en donde cada variable tiene como probabilidad de ser tomada su frecuencia en la tabla original. Realizar el AC sobre las 100-1000 tablas de las que disponemos ahora y compararlas sería muy laborioso y no tendría una fácil interpretación. La alternativa más sencilla consiste en el automuestreo parcial . Consiste en representar los perles de todas las tablas que hayamos construido en el mismo mapa. Una vez representados los perles de todas las tablas, representamos perímetros convexos que contienen todos los perles de una cierta la en cada tabla. Por ejemplo, si remuestreamos hasta 100 tablas, para la la i tendríamos 100 perles la distintos, cada uno asociado a las coordenadas calculadas para esa la en una de las 100 tablas. Podemos encerrar los 100 perles la dentro de un perímetro convexo delimitado por los perles más externos. Habitualmente se eliminan valores atípicos, construyendo perímetros convexos que contengan el 95% de los datos más internos. Este perímetro constituye entonces una región de conanza al 95% para el perl la correspondiente. La interpretación después de representar todos los perímetros convexos (uno para cada la) es que si dos perímetros convexos no se solapan tenemos bastante seguridad de que las las son signicativamente distintas. No podemos hacer el razonamiento análogo en el caso de que dos perímetros se solapen, pues al estar representando una proyección de los datos, podrían no estar solapados en otra dimensión no representada y por tanto no estar relacionadas las las. 6.2. PRUEBA DE DISTRIBUCIÓN ASINTÓTICA 53 Una alternativa para construir los perímetros convexos es a partir del método Delta . Con esta herramienta calculamos las varianzas y covarianzas de las coordenadas de todas las tablas y suponiendo una distribución normal bivariante calculamos elipses de conanza en el plano. Estas elipses tenderán a parecerse a los perímetros convexos de los que hablamos antes. Podemos realizar más contrastes sobre la tabla de contingencia y los resultados del AC que los expuestos anteriormente. Resultan de gran interés para establecer un análisis más profundo y llegar a un mejor análisis de los datos. Existen herramientas para justicar estadísticamente las conclusiones que hayamos extraído del AC, aquí destacamos a mayores del bootstraping: 6.2. Prueba de distribución asintótica Es utilizada para contrastar la signicación de la primera inercia principal. Utilizamos la misma prueba que la expuesta en el capítulo 3. Hallamos el estadístico χ2= (Inercia)·N y contrastamos con la distribución χ2 con los grados de libertad correspondientes si se cumple la hipótesis nula de que la primera inercia principal no es signicativa, lo cual será análogo a la homogeneidad de la tabla. 6.3. Test de permutaciones En este test comenzamos deniendo una medida que nos interese contrastar. Por ejemplo, para contrastar la agrupación de varios perles medimos la distancia entre ellos (agrupación en el sentido de encontrarse cerca todos los perles). A continuación, generamos todas las posibles tablas permutando las agrupaciones y para estas calculamos de nuevo las distancias entre los perles. Con todas estas medidas se construye la distribución del estadístico de contraste para el test de permutación. Tomamos como p-valor el porcentaje de permutaciones que produzcan una distancia menor entre los perles que la que tenemos en la tabla de la agrupación contrastada. Si el p-valor de contraste es bajo, aceptamos la hipótesis alternativa de que las variables están efectivamente agrupadas. 54 CAPÍTULO 6. INFERENCIA La linea de planteamiento del ejemplo anterior se reproduce para cualquier contraste que queramos hacer. Basta denir una medida que nos interese y contrastar la hipótesis nula que queramos comprobar testando su signicación frente al resto de posibles permutaciones de los datos. 6.4. Simulación de Monte Carlo El test de permutaciones es un test exacto, en el sentido de que realizamos todas las comparaciones y el p-valor es el porcentaje entre todas las posibilidades. El problema de este test es que cuando el tamaño muestral es grande resulta complicado de llevar a cabo. Para solucionar esto nace la simulación de Monte Carlo, que en vez de tomar todas las posibles muestras considera solo varias tomadas de forma aleatoria. Resulta mucho más sencillo con el coste de que deja de ser un test exacto. La prueba no es insesgada, por lo que hay que hacer la corrección: p−valor =r+ 1 t+ 1 Donde r es el número de permutaciones que superan el valor de nuestro estadístico observado y t el número de permutaciones usadas en la simulación. En el AC se utilizará habitualmente para contrastar la hipótesis nula de que no existe asociación entre las y columnas. De ser así, como ya vimos, los valores de las celdas deberían parecerse bastante al producto de los valores marginales correspondientes. Construimos una nueva tabla con los valores esperados a partir de los datos originales, y con esta tabla obtendremos muestras simuladas del mismo tamaño que la original. Sea t el número de tablas que construimos. Realizamos el AC para estas t tablas y calculamos las inercias principales de cada una. Para el caso de la primera inercia principal, sea r el número de tablas cuya primera inercia principal es mayor que la de la tabla original. Estimamos el p-valor utilizando la fórmula anterior r+1 t+1 . A un nivel de signicación α , rechazamos la hipótesis nula de que la primera inercia principal no es signicativa si r+1 t+1 < α . Podemos proceder de forma análoga con la inercia total para testar la hipótesis nula de que no exista asociación entre las y columnas o con la segunda inercia principal para testar si esta es signicativa. 6.5. AGRUPACIONES 55 6.5. Agrupaciones Durante todo el trabajo hemos considerado la representación e interpretación de los datos en los mapas. En este capítulo nos centraremos en la herramienta estadística que nos permite contrastar las igualdades o diferencias entre grupos. Ya se explicó que agrupar puntos conlleva una perdida de inercia y la separación en varios subgrupos de un grupo su aumento. Comencemos introduciendo el concepto de inercia intergrupos , una medida de la variabilidad entre los grupos que estemos considerando (una vez agrupados los datos originales de alguna forma). Llamamos inercia intragrupos a la diferencia entre la inercia total y la intergrupos. Este concepto nos dará una idea de la variabilidad que perdemos al realizar la agrupación. Un resultado importante sobre las medidas anteriores es que: Inercia total = Inercia intergrupos + Inercia intragrupos (6.1) Denimos la inercia en la fórmula (3.4) como: X i rid2 i Siendo ri la masa y di la distancia χ2 entre el i-ésimo perl la y el centroide c de los datos. La inercia intergrupos se calcula de forma análoga: X g rgd2 g (6.2) Siendo los coecientes los mismos que para el calculo de la fórmula (3.4) pero de la tabla con los datos una vez agrupados. Los perles ag tienen el mismo centroide c que los perles originales. Por tanto, la inercia de cada grupo g la podemos calcular como: X i∈g rid2 ig (6.3) 56 CAPÍTULO 6. INFERENCIA Donde dig es la distancia χ2 entre el perl de la la i del grupo g al centroide. Sumando los valores de la fórmula (6.3) para todos los grupos, obtenemos la inercia intragrupos. Recopilando todo lo anterior, obtenemos lo que queríamos demostrar: X g rgd2 g+X gX i∈g rid2 ig =X i rid2 i (6.4) De esta forma, podemos calcular la inercia intragrupos realizando el AC para la tabla original y la tabla agrupada y restando estos valores. Notemos que la inercia intragrupos de cualquier variable agrupada solo consigo misma es cero. El objetivo entonces será agrupar los datos de forma que obtengamos la máxima inercia intergrupos y la mínima intragrupos. Para ello utilizamos el algoritmo de agrupación , que agrupa en cada paso al par de variables cuya agrupación conlleve a la menor reducción de la inercia intergrupos, es decir, a la menor reducción del estadístico χ2 . El algoritmo termina cuando se agrupan todas las las y tenemos un solo grupo. El concepto de que dos las se agrupen por conllevar la menor reducción del estadístico χ2 se traduce en que estas dos las son bastante parecidas y cuanto menor sea la reducción del estadístico, mayor será este parecido. Ahora lo que nos queda es decidir qué las es razonable agrupar y en que punto del algoritmo debemos parar. Está claro que el caso en que agrupemos todos los grupos de la tabla en uno no será habitual. Como herramienta para decisión utilizaremos las representaciones en árbol. Comenzamos calculando el valor de la distribución ji-cuadrado de la tabla original para un cierto valor de conanza. Si el estadístico nos permite rechazar la hipótesis nula de homogeneidad de la tabla continuamos con el proceso, si aceptamos la hipótesis de homogeneidad no tiene sentido continuar pues no existen diferencias signicativas entre perles y no llegaremos a ninguna agrupación nueva. A continuación realizamos el AC para todas las tablas con los datos agrupados a partir del algoritmo. Tomamos como umbral el valor del cuartil a un cierto nivel de conanza de la distribución χ2 con los grados de libertad de la tabla original. Si el estadístico χ2 para alguna tabla reducida es mayor que el el cuartil considerado, tendremos una prueba estadística de que estos grupos presentan similitudes signicativas entre ellos, por lo que tiene sentido la agrupación. El diagrama de árbol es de la forma del mostrado en la Figura 6.1. 6.5. AGRUPACIONES 57 Figura 6.1: Diagrama en árbol para la agrupación de 5 las Donde la linea roja marca el valor del cuartil de la distribución ji-cuadrado de la tabla original. En el ejemplo de la Figura 6.1 solo tendríamos evidencias estadísticamente signicativas para la agrupación de las las (1,2) y (3,4,5), pues es la única agrupación que mantiene un valor del estadístico χ2 superior al cuartil de la distribución ji-cuadrado al nivel de conanza considerado. La tabla original mostraba diferencias signicativas entre los perles al tener un estadístico χ2 mayor que el cuartil para el nivel de conanza considerado. Por tanto, en algún punto de la tabla tenían que existir estas diferencias. Al realizar todas las agrupaciones vemos que una tabla agrupada es signicativamente heterogénea, por lo que estos eran los perles que provocaban la alta inercia. 64 CAPÍTULO 7. APLICACIÓN PRÁCTICA DEL AC EN UN ESTUDIO resi.baja resi.media resi.alta EC1 69 359 72 EC2 5 14 2 EC3 9 61 18 EC4 3 23 3 EC5 2 11 3 EC6 25 122 19 Cuadro 7.5: Tabla de contingencia para el cruce del estado civil con los niveles de resiliencia Una vez construidas las tablas de contingencia de los cruces contrastamos la hipótesis nula de homogeneidad de la tabla. En el caso de cumplirse esta hipótesis nos indicaría que las frecuencias de las enfermedades estudiadas o de los niveles de resiliencia son similares entre todos los estados civiles. De incumplirse la hipótesis de homogeneidad, nos indicaría que la frecuencia de alguna enfermedad o nivel de resiliencia varía dependiendo del estado civil. El contraste se realiza como indicamos en el capítulo 3, construyendo el estadístico ji-cuadrado y buscando su p-valor asociado en la distribución ji-cuadrado con tantos grados de libertad como (nofilas −1)x(nocolumnas −1) . Con el comando ca de R realizamos al AC para las dos tablas y nos devuelve el valor de la inercia total. Multiplicando la inercia por n (el número de casos considerados para la tabla del Cuadro 7.4 y 7.5 respectivamente) obtenemos el estadístico ji-cuadrado para cada una de las dos tablas. Para la tabla del Cuadro 7.4, χ2= 0,044719 ∗886 = 39,62 , con un p-valor asociado en la distribución ji-cuadrado con 9∗5 = 45 grados de libertad de 0,7. Para la tabla del Cuadro 7.5 tenemos χ2= 0,009061 ∗820 = 7,43 , con un p-valor asociado en la distribución ji-cuadrado con 5∗2 = 10 grados de libertad de 0,68 . Por tanto, en ambas tablas aceptamos la hipótesis nula de homogeneidad y concluimos que el estado civil no inuye en el padecimiento de las enfermedades ni en los niveles de resiliencia. Por completitud realizamos también el AC para la tabla que cruza el estado civil con el padecer o no ansiedad y depresión. La tabla de contingencia de este cruce se muestra en el Cuadro 7.6. Para este cruce volvemos a concluir que el estado civil no inuye en tener o no ansiedad o depresión. Las frecuencias de ambas enfermedades se mantienen homogéneas en todos los estados civiles, lo que deducimos de que el estadístico χ2= 8,58 deje en la distribución ji-cuadrado con 5∗3 = 15 grados de libertad un p-valor de 0,9. 7.2. AC DE LA ANSIEDAD Y DEPRESIÓN 65 NO ANS. ANS NO DEPRE DEPRE EC1 382 118 380 120 EC2 17 4 17 4 EC3 69 19 65 23 EC4 23 6 21 8 EC5 15 1 15 1 EC6 132 34 118 48 Cuadro 7.6: Tabla de contingencia para el cruce del estado civil y la ansiedad y depresión 7.2. AC de la ansiedad y depresión Ahora vamos a realizar un cruce más interesante, con el que queremos estudiar la relación entre las notas de ansiedad y la depresión. No consideramos ahora el tener o no ansiedad y depresión, consideramos las propias notas medidas de 0-9. Debido a las bajas frecuencias en los altos niveles de ansiedad y depresión agrupamos las notas 8 y 9 para ambas enfermedades. Seguimos teniendo una inercia alta con estas agrupaciones y el estadístico ji-cuadrado deja un p-valor del orden de 0 para el contraste de la dependencia de las variables tras la agrupación, por lo que no habrá ningún problema al hacer estas agrupaciones y resolvemos el problema de las bajas frecuencias. La tabla de contingencia para este cruce se recoge en el Cuadro 7.7. A0 A1 A2 A3 A4 A5 A6 A7 A89 D0 423 83 12 12 18 23 10 5 1 D1 14 8 1 2 1 1 2 0 0 D2 14 2 0 3 3 5 3 1 1 D3 15 6 1 2 5 2 4 5 3 D4 86023386 3 D5 47042435 3 D6 31000726 4 D7 40002227 7 D89 0 1 0 0 0 1 1 2 6 Cuadro 7.7: Tabla de contingencia para el cruce de las notas de ansiedad y depresión Antes de comenzar con el AC debemos comprobar si la tabla presenta forma homogénea o no. De ser homogénea no serviría de nada realizar el AC y construir lo mapas pues 66 CAPÍTULO 7. APLICACIÓN PRÁCTICA DEL AC EN UN ESTUDIO ya la propia tabla nos indica la no relación entre unas variables y otras. Para la tabla mostrada en el Cuadro 7.7, χ2= 467,40 , que en la distribución ji-cuadrado con 8∗8 = 64 grados de libertad deja un p-valor del orden de 0. Tenemos pruebas signicativas por tanto de la no homogeneidad de la tabla, por lo que existirán notas de ansiedad que tengan asociadas distintas notas de depresión, es decir, algunas notas de ansiedad y depresión estarán relacionadas. Una vez comprobamos que la tabla no es homogénea, construimos el mapa del AC. En este caso vamos a jarnos en el mapa simétrico (ver Figura 7.2), pues lo que vamos a interpretar son la distancia entre los perles de las y columnas y no precisaremos los vértices como referencia. El mapa asimétrico (ver Figura 7.1) proporciona la misma interpretación de los datos, pero al considerar tantas variables se aprecian menos las relaciones y es más difícil el estudio de este mapa. Mostramos ambos mapas como ejemplo para reejar la similitud entre ambos mapas que ya comentamos en el capítulo 4. Figura 7.1: Mapa asimétrico del AC asociado a la tabla del Cuadro 7.7 Los mapas muestran una clara estructura. En primer lugar, en el mapa asimétrico en el eje horizontal (primer eje principal) se produce una ordenación de menor a mayor en las notas en depresión de izquierda a derecha. Por tanto un perl la de ansiedad situado a la derecha indicará una mayor nota en depresión. Los propios perles la de la ansiedad 7.2. AC DE LA ANSIEDAD Y DEPRESIÓN 67 también se ordenan en el eje horizontal de menor a mayor, por lo que concluimos que existe una relación directa entre las notas de depresión y ansiedad de forma que pacientes con altos niveles de ansiedad tienden a tener mayores niveles de depresión. En el eje vertical (segundo eje principal) se observa como los vértices asociados al 8 y 9 en depresión se alejan del resto. Podemos interpretar esto indicando que los altos niveles de depresión no siguen una estructura similar a los demás, lo que probablemente se deba a que niveles tan altos de depresión no se expliquen solo respecto a la ansiedad. Figura 7.2: Mapa simétrico del AC asociado a la tabla del Cuadro 7.7 En el mapa simétrico de la Figura 7.2 observamos lo mismo que hemos comentado antes pero más claramente. No tenemos los vértices como referencia pero vemos como los perles de ansiedad y depresión tienden a estar juntos según sus notas, estando más cerca los perles de ansiedad y depresión con la misma nota. Al igual que antes, los niveles altos de depresión se desmarcan del resto de donde se deduce que debe existir algún otro factor que conlleve un nivel de depresión extremo. En cada eje se muestra el porcentaje de inercia que explica cada uno como ya explicamos en el capítulo 4. El primer eje principal del mapa asimétrico explica el 73,4 % de la inercia total de la tabla del Cuadro 7.7 y el segundo eje principal el 13,5 % . La suma es el 86,9 % , que es el porcentaje explicado por el mapa. El mapa simétrico explica un 86,9 % también. Tenemos un gran porcentaje de inercia explicado, por lo que las conclusiones obtenidas son ables y los perles están bien representados en el mapa respecto a su posición real (en un espacio de 9 dimensiones). 68 CAPÍTULO 7. APLICACIÓN PRÁCTICA DEL AC EN UN ESTUDIO Una vez que hemos visto que existe una relación directa entre los niveles de ansiedad y depresión vamos a contrastar qué relación existe entre la ansiedad y la depresión y la resiliencia. En este caso cruzamos el hecho de tener o no ansiedad y depresión y los niveles bajo-medio-alto de resiliencia. El cruce de estas dos variables se muestra en la tabla del Cuadro 7.8. NO ANS. ANS NO DEPRE DEPRE resi.baja 74 39 57 56 resi.media 459 131 451 139 resi.alta 105 12 108 9 Cuadro 7.8: Tabla de contingencia para el cruce de ansiedad y depresión con niveles de resiliencia De nuevo, lo primero que hacemos es contrastar la hipótesis nula de homogeneidad de la tabla. Para la tabla de contingencia del Cuadro 7.8 el estadístico de contraste vale χ2= 75,45 , que deja un p-valor de 3,09e−14 en la distribución ji-cuadrado con 3∗2=6 grados de libertad, por lo que tenemos pruebas signicativas de que varían las frecuencias de ansiedad y depresión respecto al nivel de resiliencia del individuo. Para la representación, notemos que todos los perles se pueden representar perfectamente en un espacio de dimensión 2, por lo que para este cruce representaremos el mapa simétrico (Figura 7.3), donde se representan los perles sin perdida de información. La interpretación en el mapa de la Figura 7.3 es muy clara. En el primer eje principal se sitúan a un lado del origen (que corresponde con el perl medio como ya se comentó en el capítulo 4) los perles de no tener depresión, no tener ansiedad y los perles de resiliencia alta y media. A la derecha del origen se sitúan los perles asociados a la depresión, ansiedad y resiliencia baja. El primer eje principal explica el 99,3 % de la inercia, por lo que considerando solo la interpretación de este eje ya obtendremos conclusiones ables. Se ve muy claramente como los pacientes con una resiliencia alta o media tienden a no padecer de depresión ni ansiedad y como los pacientes con baja resiliencia padecen de estas enfermedades. Por tanto asociamos un nivel bajo de resiliencia como un factor de riesgo ante la posibilidad de padecer ansiedad o depresión (las cuales como ya vimos están muy relacionadas también). Puede deberse a que las personas con baja resiliencia tienden a afrontar peor los problemas, viéndose más afectados por ellos (lo que las deprime) y viéndose superados por ellos (lo que les provoca ansiedad). 7.3. AC DE LA EDAD SOBRE EL RESTO DE VARIABLES 69 Resumiendo, un bajo nivel de resiliencia supone un factor de riesgo de cara a poder padecer ansiedad y depresión debido a la relación que existe entre las variables, relación que se ve patente en el mapa del AC de la Figura 7.3. Figura 7.3: Mapa simétrico del AC asociado a la tabla del Cuadro 7.8 7.3. AC de la edad sobre el resto de variables Ahora vamos a estudiar el efecto de la edad sobre las demás variables de interés de nuestro estudio. Comenzamos dividiendo la escala continua de edad (que va de 18 a 90 años) en una escala con tres niveles. Realizamos la división igual que con la resiliencia, tomando como pacientes en edad joven a aquellos que se encuentran entre la media más-menos la desviación típica de la variable edad. Así, dividimos el intervalo [18,90] en [18,48061 − 16095],[48061−16095,48061+16095],[48061+16095,90] = [18,31065],[31065,65056],[65056,90] , donde el primer intervalo corresponde a los jóvenes, el segundo a la edad media y el tercero a la edad anciana. Construimos en base a estos nuevos intervalos la matriz binaria (representada en el Cuadro 7.9) que codica a qué grupo de edad pertenece cada paciente y realizamos el AC con esta matriz. 70 CAPÍTULO 7. APLICACIÓN PRÁCTICA DEL AC EN UN ESTUDIO Recuento Joven 152 Edad media 506 Anciano 162 Cuadro 7.9: Tabla con los recuentos para cada grupo de edad Con la edad ya codicada, construimos la tabla de contingencia que cruza la edad con el nivel de resiliencia (Cuadro 7.10). Sobre esta tabla calculamos el estadístico jicuadrado, χ2= 4,06 y calculamos la probabilidad que deja en la distribución ji-cuadrado con 2∗2=4 grados de libertad, lo que nos da el p-valor 0,4 , por lo que aceptamos la hipótesis de homogeneidad de la tabla y concluimos que los tres grupos de edad tienen unos niveles de resiliencia homogéneos. resi.baja resi.media resi.alta Joven 14 114 24 Edad.media 72 362 72 Anciano 27 114 21 Cuadro 7.10: Tabla de contingencia para el cruce de la edad con el nivel de resiliencia El cruce de la edad con la ansiedad y la depresión produce la tabla del Cuadro 7.11. Para este cruce, el estadístico ji-cuadrado es χ2= 12 , que deja un p-valor en la distribución ji-cuadrado con 3∗2=6 grados de libertad de 0,06 . Rechazamos a un nivel del 5 % la hipótesis nula de homogeneidad, además al tratarse de una tabla de tan baja dimensión no merece la pena realizar el AC. NO ANS. ANS NO DEPRE DEPRE Joven 115 37 123 29 Edad media 391 115 386 120 Anciano 132 30 107 55 Cuadro 7.11: Tabla de contingencia para el cruce de la edad con tener o no ansiedad o depresión El último cruce que haremos con la edad podría incluirse en la siguiente sección. 7.3. AC DE LA EDAD SOBRE EL RESTO DE VARIABLES 71 Vamos a cruzar los tres grupos de edad con las enfermedades que hemos agrupado anteriormente. Este cruce produce la tabla de contingencia del Cuadro 7.12. Para esta tabla rechazamos la hipótesis de homogeneidad al dejar el estadístico χ2= 117,66 un pvalor de 1,11e−16 , lo que supone una prueba signicativa. Por tanto, existirán diferencias en los distintos grupo de edad respecto a las enfermedades padecidas. En la Figura 7.4 construimos el mapa asimétrico, representando las columnas en coordenadas principales y las las como vértices para poder tomar los tres grupos de edad como referencia de cara a realizar conclusiones. Cardio Arterial Pulmon Cuerpo Piel Hormona Ins.Ren Hepat. Depre Cancer Joven 2 4 11 1 11 9 0 4 10 1 Edad media 103 117 32 12 23 65 1 26 73 11 Anciano 115 89 17 17 6 56 12 9 30 19 Cuadro 7.12: Tabla de contingencia para el cruce de la edad con las enfermedades Figura 7.4: Mapa asimétrico del AC asociado a la tabla del Cuadro 7.12 Del mapa de la Figura 7.4 comenzamos destacando que los perles se encuentran representados perfectamente al considerar una tabla de dimensión 2, por tanto las conclusiones que hagamos serán ables. Vemos una clara ordenación en el eje horizontal, situándose de izquierda a derecha los tres grupos de edad ordenados de menor a mayor. Como para los grupos de edad hemos representado los vértices, interpretaremos que una enfermedad 72 CAPÍTULO 7. APLICACIÓN PRÁCTICA DEL AC EN UN ESTUDIO situada a la derecha es más habitual en ancianos que otras que se sitúe más a la izquierda. En este eje tenemos explicado el 83 % de la inercia, por lo que bastará estudiar este eje. Concluimos entonces que las enfermedades cardíacas, arteriales, relacionadas con el cuerpo (reuma y osteoporosis), la diabetes, el hipertiroidismo, la insuciencia renal y el cáncer se asocian con un grupo de edad anciano, y la hepatopatía, las enfermedades pulmonares y las relacionadas con la piel con los jóvenes. Por tanto, por ejemplo, la edad es un factor de riesgo ante la posibilidad de padecer insuciencia renal. El hecho de que el vértice de los jóvenes se encuentre tan alejado del de la edad media y anciana indica que en general la edad es un factor de riesgo ante cualquier enfermedad, pues todos los perles de las enfermedades se encuentran más próximos a los vértices de las edades mayores. 7.4. AC sobre las enfermedades El primer contraste que realizamos en esta sección es el que hacemos sobre la tabla que cruza las enfermedades y los fármacos. A priori esperamos que se asocien los fármacos con las enfermedades para los que se recetan, pero hasta comprobarlo estadísticamente no lo podremos asegurar. La tabla de contingencia para este cruce se muestra en el Cuadro 7.13. Esta tabla tiene una inercia de 0,14 y n= 2742 , por lo que el estadístico de contraste será χ2= 0,14 ∗2742 = 383,88 . En la distribución ji-cuadrado con 9∗12 = 108 grados de libertad, este estadístico deja un p-valor del orden de 0, por lo que rechazamos la hipótesis de homogeneidad de la tabla. Existirán entonces diferencias entre las enfermedades respecto a la medicación que toman los pacientes que las padecen. Benzo Antidepre MetGluc ado1 Antiinf Insul2 hipSed Estatinas cortic betabloq diureticos Glucosamin antipsic Cardio 49 46 324 48 32 9 40 101 3 37 77 3 2 Arterial 42 34 292 41 27 11 35 124 2 25 46 3 5 Pulmon 13 10 34 2 3 0 11 10 2 2 7 0 0 Cuerpo 12 9 23 3 5 1 7 6 2 2 6 1 0 Piel 7 5 15 1 2 0 5 4 1 2 2 0 0 Hormona 22 32 224 64 15 11 28 53 0 15 29 1 2 Ins.Ren 4 1 39 6 0 3 1 8 0 3 9 0 0 Hepat. 10 7 23 4 6 0 6 10 1 1 4 0 0 Depre 53 76 86 13 17 3 46 21 2 8 15 2 3 Cancer 4 8 36 8 4 1 5 9 0 2 4 1 0 Cuadro 7.13: Tabla de contingencia para el cruce de las enfermedades y fármacos Como estamos ante una tabla no homogénea, representamos el mapa del AC para esta tabla y estudiamos el resultado para encontrar cuales son las asociaciones entre variables 7.4. AC SOBRE LAS ENFERMEDADES 73 que rompen la homogeneidad. Este mapa se presenta en la Figura 7.5. Mostramos el mapa simétrico ya que debido al alto número de variables consideradas en esta tabla, en un mapa asimétrico se dicultaría la interpretación e incluso distinguir entre las etiquetas de los perles. En el mapa de la Figura 7.5 observamos como se cumple lo que parecía razonable desde un principio. Los antidiabéticos y la insulina se hallan cerca de las enfermedades de diabetes e hipertiroidismo, los antidepresivos cerca de los antidepresivos, los medicamentos para el corazón (estatinas, betabloqueantes) cerca de las dolencias cardíacas y las enfermedades del cuerpo, pulmones y piel cerca de los antiinamatorios y con una tendencia hacia los corticoides. Esta cercanía como ya comentamos a lo largo del trabajo se interpreta como asociación entre los perles, y al tener un 84,6 % de inercia explicada en el mapa, tomamos las conclusiones anteriores con seguridad. Figura 7.5: Mapa simétrico del AC asociado a la tabla del Cuadro 7.13 Los siguientes dos cruces constituyen la parte más interesante desde el punto de vista médico. La resiliencia es una medida que todavía no está muy estudiada y establecer la relación de ésta con alguna enfermedad sería un descubrimiento. Sería un avance para poder explicar la resiliencia mejor, su mejor entendimiento y poder estudiar con mayor profundidad su comportamiento. Lo mismo ocurre con la ansiedad y la depresión, que a pesar de ser enfermedades más estudiadas tampoco existen muchos trabajos probando su relación con otras enfermedades. El investigador insistió en la relevancia de estos dos cruces y de la importancia que pueden tener en futuras investigaciones y estudios. 80 CAPÍTULO 7. APLICACIÓN PRÁCTICA DEL AC EN UN ESTUDIO mapa del AC para este cruce (Figura 7.6 y Figura 7.7). No podemos establecer la relación entre ansiedad y depresión por el solapamiento de sus perímetros convexos pues podrían no existir en otra dimensión no considerada. Lo que podemos hacer es concluir que tenemos pruebas signicativas de las diferencias de los perles asociados con padecer ansiedad y depresión y los que no. Así, respecto a padecer ansiedad o depresión, las frecuencias de las enfermedades consideradas son diferentes, por lo que dependiendo de si el paciente tiene ansiedad y depresión o no tenderá a tener unas enfermedades u otras. Figura 7.11: Perímetros convexos para el cruce de las enfermedades y la ansiedad y depresión De nuevo el último cruce es el más interesante desde el punto de vista médico. Cruzamos ahora las enfermedades con los niveles de resiliencia y construimos las simulaciones a partir de la tabla del Cuadro 7.15. Para este cruce obtenemos los perímetros convexos de la Figura 7.12. Volvemos a observar una clara diferenciación en las frecuencias (perles) que tienen las enfermedades consideradas respecto al nivel de resiliencia de los pacientes. Por tanto, un nivel de resiliencia u otro serán determinantes a la hora de padecer una enfermedad u otra. A partir del AC realizado anteriormente representado en los mapas de la Figura 7.8 y 7.9 comprobamos qué enfermedades se asocian con cada nivel de resiliencia. 7.5. PERÍMETROS CONVEXOS 81 Figura 7.12: Perímetros convexos para el cruce de las enfermedades y los niveles de resiliencia 82 CAPÍTULO 7. APLICACIÓN PRÁCTICA DEL AC EN UN ESTUDIO Glosario Recogemos todos los conceptos y notaciones tratados a lo largo del trabajo por orden de introducción: • tabla de contingencia : Tabla que recoge las frecuencias o recuentos de los cruces de las variables consideradas. •nij : Frecuencia observada para la celda (i,j) de la tabla de contingencia. •ni•=Pm j=1 nij , marginal de la la i-ésima. (2.1) •n•j=Pk i=1 nij , marginal de la columna j-ésima. (2.2) •n•• =n=Pini•=Pjn•j , total de frecuencias de la tabla de contingencia. (2.3) • perl la : ai= (ni1, ni2, ..., nim)T/ni•= (ni1/ni•, ni2/ni•,··· , nim/ni•)T , vector de las frecuencias de una la divididas por su total. (2.4) • vértice : p.e. (1,0, ..., 0)T , perl extremo que concentra toda la frecuencia en una sola coordenada o componenete. • masa : ri=ni• n•• , marginal de la la dividido por el total de la tabla. • perl la medio : c=Pk i=1 ni1 n•• ,Pk i=1 ni2 n•• ,··· ,Pk i=1 nim n•• T (2.5) • Distancia χ2 : r(ni1 ni• −nj1 nj• )2 c1+(ni2 ni• −nj2 nj• )2 c2+···+(nim ni• −njm nj• )2 cm (3.1) •eij =ni•·n•j n•• , valor esperado celda (i,j). (3.2) •χ2=Pi,j (nij −eij )2 eij , estadístico ji-cuadrado. 83 84 GLOSARIO • Inercia : χ2/n =Piri·kai−ck2 c=PiriPjpij ri−cj2/cj (3.5) • kai−ckc = qPj(aij −cj)2/cj , distancia χ2 entre el i-ésimo perl la ai y el perl la medio c . • DVS : Descomposición en valores singulares. • Escalado óptimo : Escala de las categorías que maximiza la inercia de la tabla. • Eje pricipal : Eje del mapa del AC. • Inercia principal : Inercia explicada por un eje principal. • Coordenada principal : Coordenada de un perl en un eje principal. • Coordenada estándar : Coordenada de un vértice en un eje principal. • Mapa asimétrico : Mapa que representa las las en coordenadas principales y las columnas en coordenadas estándares o viceversa. • Mapa simétrico : Mapa que representa las las y las columnas en coordenadas principales . • Inercia de las : ri·kai−ck2 c , contribución de cada la a la inercia. •fik di2 , contribución del eje k a la inercia del i-ésimo perl. • Biplot : representación del AC para cada perl la y columna conjuntamente a partir del producto escalar de dos vectores. • Fórmula de reconstitución : pij =ricj1 + PK k=1 √λkφikγjk (4,14) • Biplot estándar : Biplot de los perles escalados. • Doblado de los datos : Expresión de los datos en relación a su diferencia con el valor más bajo y más alto de la escala. •fik =Pjpij riγjk , k-ésima coordenada principal de la la i. (4.17) •γjk : k-ésima coordenada estándar de la j-ésima columna. •gik =Pipij cjφik , k-ésima coordenada principal de la columna j. (4.18) •φik : k-ésima coordenada estándar de la i-ésima la. • ACM : Análisis de correspondencias múltiple. 85 • Matriz binaria (Z) : Matriz con un 1 en la componente (i,j) si el individuo i pertenece a la categoría j y 0 si no. • Matriz de Burt : B=ZTZ • ACCo : Análisis de correspondencias conjunto. • ACC : Análisis de correspondencias canónico. • Bootstrapping : Técnica que considera los datos que tenemos como si fuesen la población total para crear nuevas muestras tomadas de esta. • Inercia intergrupos : Medida de la variabilidad de la tabla una vez agrupados los datos originales de alguna forma. • Inercia intragrupos : Diferencia entre la inercia total y la intergrupos. 86 GLOSARIO Bibliografía La práctica del análisis de correspondencias , Michael Greenacre, Barcelona, 2008. Análisis de correspondencias simples y múltiples , Santiago de la Fuente Fernández, Universidad Autónoma de Madrid (UAM), 2011. The biplot graphic display of matrices with application to principal component analisis , K.R. Grabiel, 1971. Análisis de Correspondencias , Salvador Figueras, M., 2003 An introduction to the bootstrap. Efron, B. & Tibshirani, R. J., 1993. Análisis de correspondencias. Luis Joaristi Olariaga & Luis Lizasoain Hernández, 2000. 87