scieee AI-readable full text Open interactive document viewer

Estudio del suicidio a través de indicadores de desarrollo y regiones geográficas

Fernández Campos, Paula

Abstract

Los objetivos de este estudio son: • Analizar las variables, observar cómo se relacionan entre ellas y con los países. Para ello se usará el análisis factorial. • Estimar la tasa de suicidio a través de la región geográfica y los indicadores de desarrollo globales. Se buscará el mejor modelo por medio de la regresión múltiple. • Responder, gracias a los contrastes de hipótesis, a las siguientes preguntas: ¿Los hombres se suicidan más que las mujeres? ¿Qué indicador de desarrollo es el más influyente? ¿Cómo se relaciona la esperanza de vida con el suicidio?

Full text

Paula Fernández Campos Trabajo de Fin de Grado 2022 1 FACULTAD DE ESTUDIOS ESTADÍSTICOS GRADO EN ESTADÍSTICA APLICADA Curso 2021/2022 Trabajo de Fin de Grado TÍTULO: ESTUDIO DEL SUICIDIO A TRAVÉS DE INDICADORES DE DESARROLLO Y REGIONES GEOGRÁFICAS ALUMNO: PAULA FERNÁNDEZ CAMPOS TUTOR: MARIA GAMBOA PÉREZ Junio de 2022 Paula Fernández Campos Trabajo de Fin de Grado 2022 2 Paula Fernández Campos Trabajo de Fin de Grado 2022 3 ÍNDICE 1.INTRODUCCIÓN ......................................................................................................... 5 2. METODOLOGÍA ......................................................................................................... 7 2.1. DEPURACIÓN DE DATOS ................................................................................. 7 2.2. ANÁLISIS FACTORIAL ...................................................................................... 8 2.3. REGRESIÓN MÚLTIPLE .................................................................................... 9 3. CONSTRUCCIÓN DE LA BASE DE DATOS ........................................................ 12 3.1. DEPURACIÓN DE DATOS ............................................................................... 12 3.2. IMPUTACIÓN DE LOS DATOS DALTANTES ............................................... 15 4. ANÁLISIS DESCRIPTIVO Y VALORES ATIPICOS ............................................. 18 5. ANÁLISIS FACTORIAL........................................................................................... 26 5.1. ANÁLISIS PREVIO ............................................................................................ 26 5.2.ROTACIÓN DE FACTORES .............................................................................. 27 5.3. BONDAD DE AJUSTE ....................................................................................... 29 5.4. PLANOS FACTORIALES .................................................................................. 29 6.REGRESIÓN LINEAL ............................................................................................... 32 6.1 MULTICOLINEALIDAD .................................................................................... 32 6.2. TRAIN Y TEST ................................................................................................... 32 6.3. SELECCIÓN MANUAL DE VARIABLES ....................................................... 33 6.4. MÉTODO DE SELECCIÓN DE VARIABLES ................................................. 35 6.5. VALIDACIÓN DEL MODELO ......................................................................... 39 7. CONTRASTES DE HIPÓTESIS ............................................................................... 42 7.1. MUJERES Y HOMBRES ................................................................................... 42 7.2. INDICADORES GLOBALES ............................................................................ 44 7.3. ESPERANZA DE VIDA ..................................................................................... 46 8. CONCLUSIONES ...................................................................................................... 48 9. BIBLIOGRAFÍA ........................................................................................................ 49 10. ANEXO .................................................................................................................... 51 Paula Fernández Campos Trabajo de Fin de Grado 2022 4 Paula Fernández Campos Trabajo de Fin de Grado 2022 5 1.INTRODUCCIÓN Según datos de la Organización Mundial de la Salud, cada año cerca de 703 000 personas se quitan la vida y muchas más intentan hacerlo. Los suicidios no solo ocurren en países de altos ingresos, sino que afecta a todas las regiones del mundo. Más del 77% de los suicidios ocurridos en 2019 tuvieron lugar en países de ingresos bajos y medianos. (OMS, 2021a) El suicidio no hace distinciones, se puede dar a cualquier edad y según estos datos parece que tampoco depende de la posición económica. Este fenómeno ha pasado a considerarse un problema importante para la salud pública, aunque su importancia varía considerablemente entre países con diferentes niveles de desarrollo. Unas de las claves para hacer frente a este suceso es estudiar los factores de riesgo y las características poblacionales de la conducta suicida, pero resulta un gran desafío debido a que sigue existiendo un fuerte estigma sobre la salud mental. Tal y como afirma Molina en su estudio (Molina et al., 2003): En el mundo sanitario, es fundamental identificar cuáles son las características personales de los suicidas y parasuicidas y determinar en ellos los factores de riesgo asociados con respecto a la población general según las variables personales de sexo, edad, antecedente de consumo de alcohol, drogas, enfermedades crónicas, antecedentes familiares con historia de suicidio, antecedentes familiares con trastornos psiquiátricos y funcionalidad familiar en parasuicidas y población de control. (p. 21) Varios estudios han demostrado que factores como los trastornos mentales, el alcoholismo y/o el abuso de drogas, los problemas financieros y las dificultades de comunicación interpersonal están asociados con el comportamiento suicida. Pero ¿alguien se ha parado a pensar si el ``entorno´´ afecta a la salud mental? O si el desarrollo de un país aumenta o disminuye el número de suicidios. Después de investigar un poco sobre ello, se encontraron limitados estudios que considerasen variables externas al individuo. No obstante, en 2017, un equipo de investigadores iranies (Khazaei et al., 2017) estudiaron la relación que había entre el suicidio y el Índice de Desarrollo Humanitario (IDH), el cual es un indicador elaborado por el Programa de las Naciones Unidas para el Desarrollo, que se utiliza para clasificar a los países en tres niveles de desarrollo humano y que tiene en cuenta principalmente la esperanza de vida, la educación e ingresos per cápita. Cuanto más alto sea el índice, mayor será el nivel de desarrollo del país. Sus resultados mostraron que las tasas de suicidio aumentaban al incrementar el nivel de IDH. Sin embargo, al consultar estudios similares vieron como también se había demostrado una relación inversa entre los niveles de ingresos (como componente del IDH) y la tasa de suicidio. Esta paradoja se atribuyó al efecto de otros factores de confusión como la religión y la raza en diferentes sociedades. También se achacó al uso de diferentes escalas para medir el nivel socioeconómico, el tipo de diseño del estudio y el tamaño de la muestra. Paula Fernández Campos Trabajo de Fin de Grado 2022 6 Asimismo, se observó una correlación directa y significativa entre la incidencia del suicidio y los porcentajes de urbanización de los países, el PIB y la esperanza de vida de las mujeres. En vista de estos resultados y de la falta de análisis estadísticos en cuanto a la relación que hay entre el suicidio y factores socioeconómicos, en este trabajo se pretende analizar la tasa de suicidio a través de la región geográfica y algunos indicadores de desarrollo. Los indicadores elegidos para el estudio son los que se consideran que tienen mayor relación con la variable a estudiar, seleccionados a criterio del investigador. Los objetivos de este estudio son: • Analizar las variables, observar cómo se relacionan entre ellas y con los países. Para ello se usará el análisis factorial. • Estimar la tasa de suicidio a través de la región geográfica y los indicadores de desarrollo globales. Se buscará el mejor modelo por medio de la regresión múltiple. • Responder, gracias a los contrastes de hipótesis, a las siguientes preguntas: ¿Los hombres se suicidan más que las mujeres? ¿Qué indicador de desarrollo es el más influyente? ¿Cómo se relaciona la esperanza de vida con el suicidio? Paula Fernández Campos Trabajo de Fin de Grado 2022 7 2. METODOLOGÍA A continuación, se van a explicar las diferentes técnicas estadísticas que se usaran para llevar a cabo el análisis de los datos. 2.1. DEPURACIÓN DE DATOS En primera instancia, se deben tratar los valores perdidos (en caso de que los haya), ya que no se puede comenzar el estudio sin tener una base de datos depurada. Para ello se observa que observaciones o variables son las que mayor porcentaje de missing tienen y se decide si se eliminan de la base de datos o no. Cuando se tenga un número aceptable de valores perdidos, se da paso a la imputación de los datos. Algo primordial para imputar datos es diagnosticar si los valores perdidos son MCAR, MAR O NMAR: ● MCAR (Missing Completely At Random): La probabilidad de que una respuesta a una variable sea dato faltante es independiente tanto del valor de esta variable como del valor de otras variables del conjunto de datos. ● MAR (Missing At Random): La probabilidad de que una respuesta sea dato faltante es independiente de los valores de la misma variable, pero es dependiente de los valores de otras variables del conjunto de datos. ● NMAR (Not Missing At Random): La probabilidad de que una respuesta a una variable sea dato faltante es dependiente de los valores de la variable. Dentro de que es preferible no tener datos perdidos, la situación ideal es la MCAR, que es cuando estos datos se han perdido aleatoriamente. Para elegir qué tipo de imputación se va a realizar, aparte de tener en cuenta si son MCAR o no, se debe observar la correlación que hay entre las variables. Hay varias técnicas de imputación: por media y moda, por regresión, por regresión estocástica, por máxima esperanza y por imputación múltiple. Debido a razones que se expondrán más adelante, se define solo la imputación múltiple ya que es el método utilizado. La imputación múltiple es una técnica creada por Little y Rubin en 1987, en la que los datos faltantes, son sustituidos por m>1 valores simulados. Esto permitió hacer un uso eficiente de los datos, obtener estimadores no sesgados y reflejar adecuadamente la incertidumbre que la no-respuesta parcial introduce en la estimación de parámetros. El análisis de imputación múltiple está dividido en tres fases: 1. Fase de imputación 2. Fase de análisis 3. Fase de Agregación. La fase de imputación crea múltiples copias de los conjuntos de datos (m), y cada una de ellas contiene diferentes estimaciones de los valores perdidos. Conceptualmente, este paso es una versión iterativa de la imputación por regresión estocástica, aunque parte de sus fundamentos estadísticos se basan también en los principios de estimación bayesiana. Paula Fernández Campos Trabajo de Fin de Grado 2022 8 En la fase de análisis, como su nombre indica, se analizan los conjuntos de datos imputados. Este paso aplica los mismos procedimientos estadísticos que un individuo hubiera utilizado si tuviera todos los datos. La única diferencia es que se realiza cada análisis m veces, una para cada conjunto de datos imputados. La fase de análisis lleva a m conjuntos de estimaciones de parámetros y errores estándar. Finalmente, en la fase de agregación, Rubin propuso ciertas formulas sencillas para poner en común las estimaciones finales. El proceso de analizar conjuntos de datos múltiples y poner en común la agregación final no es una tarea fácil y depende de los diferentes paquetes de software estadístico. 2.2. ANÁLISIS FACTORIAL Uno de los objetivos de este estudio es ver como se relacionan las variables entre sí y a la vez, observar que variables son las que más explican o representan un país. Para ello, se usará el análisis factorial. El fin principal del análisis factorial por componentes principales (A.C.P) es transformar un conjunto de variables correlacionadas en un conjunto menor de variables no correlacionadas, de manera que este último grupo de variables recoja la mayor parte de la información existente en las variables iniciales, es decir, las variables objeto de este estudio podrán agruparse mediante sus correlaciones, de manera que, todas las variables dentro de un grupo estén altamente correlacionadas entre ellas, pero tendrán correlaciones relativamente bajas con otras variables que a su vez se encuentran en grupos diferentes. En primer lugar, se debe estudiar si es recomendable hacer un análisis factorial. Como se ha mencionado anteriormente, las variables deben estar altamente correlacionadas entre sí. Para comprobar el grado de asociación entre ellas, se pueden utilizar varios métodos, pero en este caso se usarán: 1) el Test de esfericidad de Barlett, que comprueba si la matriz de correlaciones se ajusta a la matriz identidad, lo que indicaría ausencia de correlación significativa entre las variables: H0: R=I H1: R≠ I 2) el Índice de Kaiser-Meyer-Olkin (KMO), que mide el grado de asociación que existe entre todas las variables en su conjunto, y según este criterio: si KMO ≤ 0.5 valor inaceptable se desaconseja el A F si ≤ 0.5KMO ≤ 0.6 valor demasiado bajo si ≤ 0.6 KMO ≤ 0.8 valor mediocre si KMO> 0.8 valor excelente 3) la medida de adecuación de la muestra MSA para comprobar el grado de asociación entre las variables. Se eliminarán aquellas variables que tengan un valor MSA menor de 0.5. En segundo lugar, se decide si el análisis se realizará con la matriz de varianzascovarianzas o con la matriz de correlaciones. Si las variables no están medidas en las mismas unidades y sus varianzas no son semejantes, el A.C.P se realizará sobre la matriz de correlaciones. Paula Fernández Campos Trabajo de Fin de Grado 2022 9 En tercer lugar, se realiza un análisis por encima de todas las variables para poder tantear el número de factores más adecuado. Para determinar el número óptimo de factores hay varios criterios, en este caso elegiremos los autovalores que superen el 1, pero observando a la vez la variabilidad explicada que aporta cada uno y si se considera suficiente la proporción acumulada con ese número de factores escogido. Para facilitar la interpretación de las cargas factoriales obtenidas y equilibrar la varianza explicada por cada factor, se rotan los factores hasta que se consigue una estructura más sencilla. Los dos tipos de rotación de factores más comunes son: • Varimax→ rotación que maximiza la varianza de los factores. Debido a que la varianza implica una desviación al cuadrado, es mejor tratar de poner toda la varianza de cualquier pregunta en un solo factor, en lugar de distribuirla. Este es el método de rotación ortogonal más popular que se usa con frecuencia de forma predeterminada y tiene como objetivo encontrar un modelo simple donde las variables estén relacionadas con factores únicos. • Quartimax→ maximiza la varianza en cada elemento (en lugar de cada factor). También busca un modelo simple, es recomendable para estudios con un número elevado de variables. Y por último, a fin de determinar el ajuste del modelo, una de las técnicas más utilizadas consiste en calcular las diferencias entre las correlaciones observadas (matriz de correlación de entrada) y las correlaciones reproducidas, las cuales se estiman a partir de la matriz factorial. Si los residuos de la matriz residual (RMSR) son inferiores a 0.07 se da por bueno el modelo factorial. 2.3. REGRESIÓN MÚLTIPLE La principal meta de este estudio es estimar la tasa de suicido a través de algunos índices de desarrollo y región geográfica, además de comprobar cómo afectan a la variable dependiente. El método más utilizado para la estimación de una variable a través de otras es la regresión lineal múltiple. El Análisis de Regresión Lineal es una técnica estadística utilizada para estudiar la relación entre una variable llamada dependiente (Y) y una o más variables independientes, explicativas o predictoras (X1, X2, …, Xk) desarrollando una ecuación lineal con fines predictivos. Se persigue explicar la variable Y como combinación lineal de las variables predictoras, asumiendo un error e. Y = β0 + β1 X1 + β2 X2 + … + βk Xk + e El análisis consiste en estimar los parámetros βi, que miden la intensidad media de los efectos de las variables predictoras Xi sobre la variable a explicar Y y se obtienen según: 𝛽𝑖 =𝜕𝑌 𝜕𝑋𝑖 para i=1, … k Existen diferentes procedimientos para ajustar una función, cada uno de los cuales intenta minimizar una medida diferente del grado de ajuste. La opción seleccionada ha sido por Paula Fernández Campos Trabajo de Fin de Grado 2022 16 Figura 3.2.2 Patrones aleatoriedad Figura 4.2.3 Diagrama de barras. Porcentaje de valores perdidos por patrón No se aprecia ningún patrón sospechoso que nos indique no aleatoriedad en cuanto a valores perdidos (Figura 3.2.2), además de que el patrón que más se repite es el que tiene todas las variables completas como se puede ver en el diagrama de barras (Figura 3.2.3), seguido de tener la variable internet como perdido, algo esperable ya que tiene un 30% de datos incompletos. Para asegurar que los datos son MCAR se suele recurrir al test de Little (Little, 1988), donde: H0: los valores faltantes están perdidos aleatoriamente H1: los valores faltantes no están perdidos aleatoriamente Tabla 3.2.1 Matriz de correlaciones de variables con valores perdidos y resultado del test. Se obtiene un p-valor de 0.319, bastante alto para cualquier nivel de significación. Por tanto, no tenemos evidencias estadísticas suficientes como para rechazar la hipótesis nula, se dice que estos valores perdidos son aleatorios. En este caso, se pueden imputar los datos tanto por regresión estocástica como por regresión, pero para que sea métodos precisos, la correlación entre las variables perdidas y el resto deben ser alta entre todas y como se puede observar en la Tabla 3.2.2 hay algunas que no tienen casi correlación. Tabla 3.2.2 Matriz de correlaciones para todas las variables Paula Fernández Campos Trabajo de Fin de Grado 2022 17 Debido a esto, se opta por usar la imputación múltiple, la cual se puede utilizar sin ninguna condición previa, aunque que los datos sean MCAR ayuda a que se realice una mejor estimación. En este caso, uso SPSS para realizarla. Decido hacer 7 imputaciones porque según la regla clásica de Rubin (1987) de entre 3 a 10 imputaciones son suficientes. Cuando se tienen las 7 imputaciones, decido hacer la media entre las 7 y esa será la base final. Se realiza una comparación entre la base final (Tabla 3.2.3) y la inicial (Tabla 3.2.4) para comprobar que no han variado mucho los estadísticos descriptivos en cuanto a las variables que tenían valores perdidos que eran WATER, HEALTH, UNEMPLOY, MILITARY, GOVERN_HEALTH, INTERNET, INFLAT_CONSUMER. Tabla 3.2.3 Estadísticos descriptivos final Tabla 3.2.3 Estadísticos descriptivos inicial Solo se han modificado en unas pocas décimas o unidades, por tanto, se da por concluida satisfactoriamente la depuración de datos. Ya se puede trabajar con la base final. Paula Fernández Campos Trabajo de Fin de Grado 2022 18 4. ANÁLISIS DESCRIPTIVO Y VALORES ATIPICOS Antes de realizar cualquier estudio con los datos, se debe analizar que distribución tiene cada variable y si hay valores atípicos o extremos que puedan afectar al estudio. La diferencia entre los casos extremos y los atípicos es que los extremos están alejados más de 3 longitudes de caja del percentil 75 mientras que los atípicos están alejados más de 1.5 longitudes de caja del percentil 75. Se decide eliminar solo los valores extremos ya que se está tratando con una base de datos pequeña. Al realizar el estudio con SPSS, el diagrama de cajas nos facilita la visualización de ambos, diferenciando los extremos con una estrella y los atípicos con un círculo. Se realiza un análisis descriptivo de cada variable, exceptuando REGION, COUNTRY, SUICIDE_MALE y SUICIDE_FEMALE. ● ELECTRICITY: % de población con acceso a la electricidad. Tabla 4.1 Estadísticos descriptivos. Variable electricidad La media se encuentra en casi un 85% con una desviación estándar no muy alta (25.19). La mayoría de las observaciones (75%) superan el 70% de acceso a la electricidad. El porcentaje mínimo es de 8.4% correspondiente al país Chad. Se observa en el diagrama de cajas y bigotes como los países que no superan el 40% son todos africanos. Figura 4.1 Diagrama de caja y bigotes. Variable electricidad No se eliminan del estudio porque son considerados valores atípicos y no extremos. Paula Fernández Campos Trabajo de Fin de Grado 2022 19 ● WATER: % de población con acceso a servicios básicos de agua potable. Tabla 4.2 Estadísticos descriptivos. Variable agua La media se encuentra en un 88% con una desviación estándar no muy alta (15.44). La mayoría de las observaciones (75%) superan el 80% de acceso a agua potable. El porcentaje mínimo es de 38.2% correspondiente al país Republica Central Africana. Al igual que en la anterior variable, los países que no superan el 60% son africanos. En este caso tampoco se elimina ningún país. Figura 4.2 Diagrama de caja y bigotes. Variable agua ● HEALTH: % de población con acceso a servicios básicos sanitarios. Tabla 4.3 Descriptivos. Variable sanidad Figura 4.3 caja y bigotes. Variable sanidad La media se encuentra en casi un 76% con una desviación estándar un poco más alta que en las variables anteriores (27.9). La mayoría de las observaciones (75%) superan el 50% de acceso a sanidad básica. El porcentaje mínimo es de 8.6%. No hay ninguna observación que se considere atípica ni extrema. Paula Fernández Campos Trabajo de Fin de Grado 2022 20 ● GDPpc: PIB Per cápita. Tabla 4.4 Descriptivos. Variable Pib per cápita La media es de 13464.62$ y la mediana de 5482.23$. El mayor problema que representa esta variable es su gran desviación estándar, algo esperable ya que el mundo es muy desigual en cuanto a riqueza por países. Solo hay que fijarse en como el mínimo es de 278.31$ mientras que el máximo supera los 100000$. Figura 4.4 caja y bigotes. Variable Pib per capita Los países con valores extremos son: Luxemburgo, Suiza, Irlanda, Noruega y Qatar. Los tres primeros son paraísos fiscales y Qatar un país prioritario en la venta de petróleo, y de ahí su riqueza. (Figura 4.4) Los demás países atípicos son países desarrollados, la mayoría europeos, pero también encuentran países petrolíferos, como Emiratos Árabes, los países norteamericanos Canadá y EE. UU, Australia y Nueva Zelanda. Se decide eliminar los valores extremos. ● UNEMPLOY: Desempleo, total (% de la población activa total) (estimación modelada ILO). Tabla 4.5 Descriptivos. Variable desempleo La media de la tasa de paro es de 7.16 con una desviación estándar pequeña comparada con las demás variables (5.51). La máxima tasa de desempleo es de 28.47% que corresponde a Sudáfrica, muy seguido de Djibouti. Paula Fernández Campos Trabajo de Fin de Grado 2022 21 Figura 4.5 caja y bigotes. Variable desempleo Al investigar un poco sobre el caso extremo de Sudáfrica, se ha visto como tienen un problema con su PIB el cual decae a cada año que pasa, estando en recesión continua. Se elimina del estudio al igual que Djibouti, que se acerca mucho a ser un caso extremo y su situación es similar a la de Sudáfrica. ● INFANT_MORT: tasa de mortalidad infantil, por cada 1000 bebes nuevos nacidos. Tabla 4.6 descriptivos. Variable mortalidad infantil La media se encuentra en 20.9 con una desviación estándar de 19.46. El máximo porcentaje (82.4%) pertenece a Sierra Leona. Figura 4.6 caja y bigotes. Variable mortalidad infantil Se observa cómo los 3 países atípicos superan casi el 80%, un valor muy por encima de la mediana. Aunque no se consideren casos extremos, se eliminan de la base de datos, ya que los 3 son países africanos con condiciones de vida inestables. Paula Fernández Campos Trabajo de Fin de Grado 2022 22 ● LIFE_EXPEC: esperanza de vida en años. Tabla 4.7 descriptivos. Variable esperanza de vida Figura 4.7 caja y bigotes La variable esperanza de vida puede ser la que mejor repartida este, ya que su media coincide prácticamente con la mediana, con una desviación estándar pequeña y su rango intercuartílico también es pequeño comparado con las demás variables. Como era de esperar, por lo datos que hemos visto en la tabla anterior, no hay ningún valor atípico ni extremo. ● MILITARY: % del PIB destinado a material del ejército. Tabla 4.8 descriptivos. Variable presupuesto militar La media se encuentra en 1.86%, similar a la mediana 1.57%, con una desviación estándar pequeña. Con un máximo de 8.63% perteneciente a Omán. El 75% de las observaciones no supera el 2% en presupuesto militar. Figura 4.8 caja y bigotes. Variable presupuesto militar Los tres países que más dinero destinan al ejército son Omán, Arabia saudí y Argelia. Al investigar sobre estos 3 países, se ha encontrado que Omán es un país con un historial largo de continuas guerras además de que en la actualidad hace de mediador en la guerra civil de Yemen. Arabia saudí se encuentra en guerra con Yemen por lo que es lógico su presupuesto militar elevado. Sobre Argelia no se ha encontrado motivo puntual pero también se eliminará de la base. Paula Fernández Campos Trabajo de Fin de Grado 2022 23 ● GOVERN_HEALTH: % del PIB destinado a la financiación de la salud p.e: mejora de instalaciones, inversión en una mejor educación a los sanitarios etc. Tabla 4.9 descriptivos. Presupuesto sanitario Figura 4.9 caja y bigotes. La media se encuentra en 3.47%, similar a la mediana 2.99%, con una desviación estándar pequeña y con un máximo de 10.12% perteneciente a Cuba. El 75% de las observaciones no supera el 5%. El único país que supera el 10% de presupuesto sanitario es Cuba, aunque no sea considerado caso extremo lo elimino de la base ya que es una dictadura, es decir, caso excepcional. ● INTERNET: % de población con acceso a internet. Tabla 4.10 descriptivos. Internet Figura 4.10 caja y bigotes. La media se encuentra en 61.25% con una desviación estándar alta. El 75% de las observaciones se encuentran entre un 40-80% de población con acceso a internet. No hay valores extremos ni atípicos. ● INFLAT_CONSUMER: Índice de precios de consumo (IPC) Tabla 4.11 descriptivos. IPC Figura 4.11 caja y bigotes. IPC Como se puede observar (Figura 4.11), Zimbabue tiene un valor muy elevado el cual dificulta identificar las demás observaciones extremas. Se elimina de la muestra. Al investigar sobre el porqué de su situación se han encontrado varios factores clave: las inundaciones y la sequía repartidas equitativamente durante todo el año 2019, dificultaron la producción de alimento agrario de la que tanto dependen. También se Paula Fernández Campos Trabajo de Fin de Grado 2022 24 dieron plagas de enfermedades en la ganadería además que es un país que se encuentra en pobreza. Se estima que el 25% de su población rural se encuentra en una situación de crisis extrema. (IPC, 2019) Después de eliminar Zimbabue se vuelve a dibujar el diagrama de cajas y bigotes para identificar a los demás países con valores extremos. La situación de Sudan e Irán es bastante similar, dependen mucho de sus propias cosechas y ganadería, las cuales son difíciles de mantener debido a su posición geográfica y más factores. Se decide eliminar también Uzbekistán. ● RURAL_POP: % de población que vive en área rural. Tabla 4.12 descriptivos. Población rural Figura 4.12 caja y bigotes ● URBAN_POP: % de población que vive en área urbana. Tabla 4.13 descriptivos. Población urbana Figura 4.13 caja y bigotes Tanto para la variable de población urbana como la rural no hay ningún valor atípico. Paula Fernández Campos Trabajo de Fin de Grado 2022 25 ● SUICIDE_MORT: tasa de mortalidad por suicidio global por cada 100000 habitantes. Tabla 4.14 descriptivos. Tasa de suicidio Por último, la variable objeto de estudio. Tiene una media de 9.54% mientras que su mediana es algo menor, con una desviación estándar de 8.06. El máximo es de 72.4%, un valor muy alto perteneciente a Lesoto. El 75% de las observaciones no superan el 20% de tasa de suicidio. Figura 4.15 caja y bigotes. Tasa de suicidio Claramente los dos países con más tasa de suicidio son Lesoto y Guayana. Según estudios recientes, el estigma social de la salud mental, el abuso de alcohol, la pobreza y una red de seguridad social disfuncional pueden ser los motivos de estas tasas de suicidio tan altas. Se eliminan del estudio ambos países. En este proceso, se han eliminado Luxembourg, Switzerland, Ireland, Norway, Qatar, South Africa, Djibouti, Sierra Leone, Central African Republic, Somalia, Algeria, Oman, Saudi Arabia, Cuba, Zimbabwe, Sudan, Iran, Uzbekistan, Lesotho y Guyana. Después de realizar la depuración de datos y el tratamiento de valores atípicos, se da comienzo a los estudios principales del trabajo con la muestra final, que contiene 158 países. Estos se pueden encontrar en el 10. ANEXO. Paula Fernández Campos Trabajo de Fin de Grado 2022 32 6.REGRESIÓN LINEAL Se continua con la regresión lineal múltiple, con la que se buscará un modelo que estime la tasa de suicidio a través de los indicadores de desarrollo y la región geográfica lo más preciso posible. 6.1 MULTICOLINEALIDAD Lo primero que se debe hacer es comprobar que no existe multicolinealidad entre las variables, ya que eso afectaría seriamente a las estimaciones de los parámetros. Se examina, tal y como se ha mencionado en el apartado metodológico, el VIF y el IC. Tabla 6.1.1 Multicolinealidad. VIF: Variance Inflation Se observa que varias variables superan por poco el 10 de VIF, pero nada fuera de lo normal. A la vez se comprueba el IC por componentes. Tabla 6.1.2 Multicolinealidad. IC: Condition Index Hay un IC que supera el 100 y las variables que tienen una proporción de varianza mayor de 0.5 son LIFE_EXPEC e INFANT_MORT. Sin embargo, INFANT_MORT solo supera por 6 centésimas la condición y su VIF no era mayor de 10. Se mantienen ambas dos en el modelo, aunque sí que se puede suponer una relación entre ellas ya que los países con una gran mortalidad infantil suelen tener una menor esperanza de vida. Se confirma entonces que no hay problemas de multicolinealidad graves, por tanto, se continua con la estimación del modelo a través de regresión lineal múltiple con todas las variables. En caso de que hubiese algún problema de multicolinealidad, pero no se quiere eliminar variables, los modelos PLS ayudan a mitigar el efecto negativo a las estimaciones. 6.2. TRAIN Y TEST Para asegurarse que el modelo no sufre un sobreajuste en cuanto a la estimación, se divide el fichero en dos: train y test. Uno se utilizará para crear el modelo y el otro para estudiar los residuos, es decir, si las respuestas predichas por el modelo para un caso totalmente nuevo son acertadas o no. La división se realiza de forma aleatoria seleccionando una Paula Fernández Campos Trabajo de Fin de Grado 2022 33 muestra de 47 para test y 111 para train ya que lo recomendado es 70% para train y 30% para test. 6.3. SELECCIÓN MANUAL DE VARIABLES Se comienza con una regresión múltiple con todas las variables explicativas para ver cuáles son significativas en cuanto a la variable dependiente. Tabla 6.3.1 Estimación de coeficientes del modelo Se obtienen los estimadores de los coeficientes con su error estándar, el estadístico para resolver el contraste de significatividad individual y correspondiente p-valor. Se observa como ninguna es significativa a parte de algunas regiones. Inflat_consumer es la que menor p-valor tiene, pero aun así supera el 0.05 como para considerarla significativa a un alfa del 5%. Como algunas de las regiones se consideran significativas, se crea un modelo con solo la variable REGION. Tabla 6.3.2 Significatividad del modelo Como era de esperar la variable REGION es significativa (Tabla 6.3.2). Tabla 6.3.3 Estimación de coeficientes Solo las regiones del Este de Asia, Este de Europa, Melanesia, Norte América, Norte de Europa, Sur de África y Sur de Europa no son significativas (Tabla 6.3.3). Paula Fernández Campos Trabajo de Fin de Grado 2022 34 Figura 6.3.1 Diagrama de cajas y bigotes. Tasa de suicidio por región El gráfico (Figura 6.3.1) muestra la distribución de la variable objetivo por regiones. S e aprecia como hay bastante variabilidad, sobre todo en la zona del este de Asia (Tabla 6.3.4) que tiene un rango más grande que los demás. Country Region Suicide_mort Suicide_male suicide_female China Eastern Asia 8.10 9.80 6.20 Japan Eastern Asia 15.30 21.80 9.20 Korea, Rep. Eastern Asia 28.60 40.20 16.90 Mongolia Eastern Asia 17.90 30.70 5.40 Tabla 6.3.4 Países del este asiático A diferencia de la concepción que se tiene en Occidente del suicidio, Corea del Sur, Japón y China han tenido fama de usar este recurso como una escapatoria a la decepción que provocan sus culturas tan exigentes. Solo hay que ver como en la segunda guerra mundial, los japoneses preferían morir antes que volver a casa después de haber perdido una batalla, los famosos ‘kamikazes’ eran considerados héroes solo por no dejarse atrapar por las fuerzas enemigas. Son países con una influencia cultural basada en el éxito y en el trabajo constante para la gratificación tanto personal como familiar, y cuando no se cumplen sus expectativas la salud mental se deteriora considerablemente. Por desgracia sigue existiendo un fuerte estigma sobre la salud mental y como se menciona en este articulo (Ercasi, 2004) ‘En la cultura oriental, quitarse la vida se ha considerado una forma de expresión en sí misma, una protesta en silencio, mientras se desprecia la exteriorización de las emociones’. Este hecho contrasta mucho con el oeste de ese mismo continente (Tabla 6.3.5), que tiene un rango menor y no tiene observaciones que superen el 10% de tasa de suicidio. Tabla 7.3.6 Paula Fernández Campos Trabajo de Fin de Grado 2022 35 Según un estudio reciente (Lew et al., 2022), esto puede deberse por la religión, ya que la mayoría de su población es musulmana. El suicidio está prohibido por la ley islámica, además que los intentos están duramente castigados. Como es un tema tabú, ellos mismos son reacios a informar una muerte por suicidio, lo que conduce a infra registrar las tasas de suicidio y que los datos no sean realmente representativos. Pero con diferencia, la región de micronesia es la que mayor tasa de suicidio sufre. Tabla 7.3.7 Es una zona bastante alejada de Europa, compuesta por solo dos países, pero tiene una tasa de suicidio que dobla la media de Europa. Al ser una región tan pequeña y alejada de islas grandes y continentes, no es un foco de gran importancia para estudiar. No obstante, un estudio sobre la juventud suicida en Micronesia podría dar algunas claves del porqué estas tasas de suicidio tan alta. En éste (Rubinstein, 2002) se concluía que: La complejidad de los factores sociales y culturales que influyen en el suicidio en Micronesia hace que el problema sea especialmente difícil y preocupante ya que el suicidio ha ganado familiaridad entre los jóvenes, y el acto en sí se ha vuelto cada vez más aceptable o incluso esperado. La epidemia de los suicidios parece haber comenzado como una respuesta de los jóvenes a los conflictos que surgen dentro de su familia, sobre todo por desacuerdos con los progenitores. El fenómeno del suicidio juvenil en Micronesia está entrando ahora en su tercera década, sin signos de reducción significativa. 6.4. MÉTODO DE SELECCIÓN DE VARIABLES Previamente nos hemos limitado a quedarnos únicamente con las variables que eran significativas, pero esta puede ser una estrategia demasiado restrictiva pues es posible que otras variables también sean útiles pero que su información esté duplicada por la presencia de una tercera variable. Para evitar esto, se pueden seleccionar las variables que van a formar parte del modelo de manera automática. En este caso usaremos el criterio de significación con un nivel alfa de 0.15. FORWARD Con el método forward y el criterio de selección de significación obtenemos que el modelo optimo que disminuye los principales criterios globales y aumenta el R cuadrado contiene las variables REGION, INTERNET, INFLAT_CONSUMER, ELECTRICITY, HEALTH, LIFE_EXPEC, y UNEMPLOY. Tabla 6.4.1 Resumen de pasos en el proceso de selección Tabla 6.4.2 Criterios globales Paula Fernández Campos Trabajo de Fin de Grado 2022 36 La tabla 7.4.1 muestra el proceso de selección de variables paso a paso, se ve como cada variable que entra al modelo aumenta el R cuadrado y a la vez disminuye los criterios globales. Un resumen de estos valores finales se recoge en la tabla 7.4.2. Estos índices servirán para comparar los modelos. Tabla 6.4.3 Estimación de coeficientes del modelo Se muestran los coeficientes estimados y los estandarizados con su error estándar, estadístico y p-valor sobre el contraste de significatividad individual. Podemos observar cómo, aunque hayan entrado al modelo según el criterio de SL, ninguna de las variables es significativa a un nivel alfa de 0.05. Sin embargo, internet sí que se podría considerar significativa a un nivel 0.1. Figura 6.4.1 Grafico de coeficientes estandarizados Este grafico (Figura 6.4.1) nos da un poco de idea de cómo se comportan las variables en relación con la variable dependiente. Se observa como el internet y la región de micronesia tienen un mayor efecto positivo en la tasa de suicidio en comparación con las demás. Mientras que la esperanza de vida tiene el efecto contrario, es decir cuántos menos años de esperanza de vida tenga un país mayor será su tasa de suicidio, aunque al no ser significativa no se puede afirmar que su efecto sea relevante. Paula Fernández Campos Trabajo de Fin de Grado 2022 37 BACKWARD Como se ha mencionado anteriormente, el método backward parte con un modelo complejo que contiene todas las variables y se van eliminando de una en una dependiendo de su poca influencia sobre la variable dependiente. Tabla 6.4.4 Resumen de pasos en el proceso de selección Se muestran los pasos realizados para la eliminación de las variables que no aportaban casi información ni disminuían los criterios globales del modelo. Por tanto, se obtiene un modelo con 2 variables: REGION E INTERNET, que explican una variabilidad del 58% de la tasa de suicidios. Tabla 6.4.5 Criterios globales Si se compara la tabla 6.4.2 frente a la tabla 6.4.5, se obtiene un R cuadrado casi igual con 5 variables menos, simplificando más el modelo. La variable internet disminuye su p-valor y aumenta su importancia sobre la variable dependiente. Además, todos los criterios globales son menores con el método Backward. Por tanto, el primer modelo queda descartado. STEPWISE Por último, se obtiene el modelo Stepwise. Tabla 6.4.7 Resumen de pasos en el proceso de selección Paula Fernández Campos Trabajo de Fin de Grado 2022 38 Con este método la variable INFLAT_CONSUMER entra al modelo junto con internet, aunque su p-valor es alto para un contraste de significatividad con un alfa de 0.05, por ello parece que no tiene un efecto demasiado relevante sobre la variable objetivo. Figura 6.4.2 Grafico de coeficientes estandarizados Al examinar el grafico (Figura 6.4.2), se ve que el internet sigue siendo la variable más influyente positivamente, es decir, cuanto más acceso se tenga a internet, mayor será la tasa de suicidio. Puede ser la variable que más se esperaría que fuese significativa en esta nueva era digital en la que vivimos. Aunque ha traído muchas cosas buenas, también tiene su lado negativo, la dependencia a los móviles/redes sociales y la constante sobrecarga informática son factores que deterioran la salud mental. Un artículo científico (Sedgwick et al.,2019) estudió la relación entre las redes sociales, el uso del internet y los intentos de suicidios en adolescentes. En él concluyeron en que el uso de las redes sociales y los suicidios eran independientes, sin embargo, en otros estudios sí que se había demostrado una relación significativa, por lo que recomendaron realizar más estudios longitudinales para poder establecer la dirección de una posible asociación entre las variables, controlando los impactos de posibles factores de confusión, como la alteración del sueño y el ciberacoso. Finalmente comentan ‘…a medida que se desarrollen las plataformas de Internet y las redes sociales, será esencial una mayor comprensión de los riesgos y mecanismos específicos asociados con los diferentes tipos de actividad digital por parte de diferentes grupos de población para comprender realmente el riesgo’. Al tener ya los 3 modelos creados, se elige cual es el mejor a partir de los criterios globales. El modelo Forward se había descartado anteriormente. Tabla 6.4.8 Al comparar la tabla 6.4.5 y la 6.4.8, se ve como casi no hay diferencias entre un modelo y otro, solo que el R cuadrado aumenta ligeramente y disminuye un poco el AIC. Por Paula Fernández Campos Trabajo de Fin de Grado 2022 39 tanto, por el principio de parsimonia, se escoge el modelo Forward que incluye solo las variables REGION e INTERNET. 6.5. VALIDACIÓN DEL MODELO Utilizaremos los residuos obtenidos con la base de datos test para validar las hipótesis sobre los errores y así evitar un sobreajuste. Nos quedaremos con el modelo que cumpla la mayoría de hipotesis. MODELO MANUAL El modelo resultante había sido el que contenía solo la variable REGION. Lo primero que se hace es observar los gráficos de residuos (Figura 6.5.1) por si se ve a priori heterocedasticidad, es decir, forma de embudo en el primer gráfico. En este caso no se ve claro por tanto se recurrirá a los test de homocedasticidad. Lo que si se observa claramente es la falta de normalidad, tanto en el qq-plot como en el histograma se ve como las colas son pequeñas y como es muy puntiaguda por el medio, signos de una distribución leptocúrtica, además de que se aprecia asimetría positiva. Figura 6.5.1 Resumen diagnóstico de residuos Tras este primer análisis, se contrastan las hipótesis que se deben cumplir: 1. Significatividad individual de cada uno de los parámetros: mediante el test t-Student se trata de ver que los resultados obtenidos para todos los parámetros estimados tienen un nivel de significatividad inferior al 5%. En este caso el estadístico F coincide con el estadístico t porque solo hay una variable dentro del modelo y por tanto el p-valor también. Source DF Sum of Squares Mean Square F Value Pr > F Model 14 1476.064014 105.433144 6.08 <.0001 Error 32 554.680667 17.333771 Corrected Total 46 2030.744681 Tabla 6.5.1 Significatividad del modelo Se confirma la significatividad de la variable REGION. Paula Fernández Campos Trabajo de Fin de Grado 2022 40 2. Independencia de los residuos: para verificar que no existe autocorrelación de los residuos se utiliza el test de Durbin-Watson, esto es que 𝐸(𝜀𝑖, 𝜀𝑗) = 0 𝑝𝑎𝑟𝑎 𝑖 ≠ 𝑗. Para aceptar la hipotesis de independencia, el estadístico debe estar en torno a 2. Ordinary Least Squares Estimates Durbin-Watson 2.0284 Total R-Square 0.7269 Tabla 6.5.2 Estadístico de Durbin Watson Se ve (Tabla 7.5.2) como el estadístico DW es casi 2, por tanto, se acepta independencia de residuos. 3. Normalidad de los residuos: para ello se realiza el test de Shapiro Wilk y/o K-S de comparación de distribuciones en donde la hipótesis nula se define como: H0: 𝜀𝑖 ≈ 𝑁(0, 𝜎) ∀𝑖. Test Statistic Pvalue Shapiro Wilk 0.8526 0.0000 Kolmogorov Smirnov 0.1983 0.0428 El tamaño de muestra máximo para realizar el test de Shapiro-Wilk es de 50 observaciones, en este caso tenemos 47. Con Shapiro se rechazaría la hipotesis de normalidad para cualquier nivel de significación mientras que con K-S se podría aceptar normalidad para un alfa de 0.01. 4. Media de los residuos 0: se utiliza el test de comparación de medias de la t-Student, donde se especifica que la hipótesis nula a contrastar es H0: µ=0 sobre los errores de estimación (residual). El p-valor debe ser superior, al menos, al 5% para concluir media 0. Tests for Location: Mu0=0 Test Statistic p Value Student's t t 0 Pr > |t| 1.0000 Sign M -3 Pr >= |M| 0.4514 Signed Rank S -81 Pr >= |S| 0.3504 Tabla 6.5.3. T-student comparación de medias Se rechaza H0 para cualquier nivel de significación ya que el p-valor es 1, es decir la distribución de los residuos está centrada en el 0. 5. Volatilidad constante de los residuos: este supuesto se le denomina supuesto de homocedasticidad, esto significa que la variabilidad en torno a la línea de regresión es la misma en toda la muestra. Se contrasta pues la hipótesis nula de igualdad de varianzas, H0 : σ 1 = σ2 = · · · = σn. Se escoge el contraste de Breusch-Pagan con el que se obtiene un p-valor de 0.7527, bastante alto por lo que se acepta homocedasticidad para cualquier nivel de significación. MODELO AUTOMÁTICO El modelo resultante había sido el que contenía a la variable REGION e INTERNET. 1. Significatividad individual de cada uno de los parámetros: mediante el test tStudent se trata de ver que los resultados obtenidos para todos los parámetros estimados tienen un nivel de significatividad inferior al 5%. Paula Fernández Campos Trabajo de Fin de Grado 2022 41 Tabla 6.5.4. Estimación de los coeficientes con la base de datos test Al realizar de nuevo la regresión múltiple, la estimación de los coeficientes y sus p-valores se han modificado, ya que se ha realizado con la base de datos test. El internet pasa a no ser significativo, por lo que no tiene sentido revisar las demás hipotesis, habría que sacar del modelo a INTERNET y se quedaría igual que el manual. Por tanto, se elige el modelo que contiene la variable REGION, la cual ella sola consigue explicar un 73% de la variabilidad de la variable suicidio. Paula Fernández Campos Trabajo de Fin de Grado 2022 48 8. CONCLUSIONES Los resultados de estos análisis no han sido exactamente los esperados. Los indicadores de desarrollo no han tenido el suficiente impacto sobre la variable suicidio como para ser parte del modelo de estimación. No obstante, el modelo ha resultado satisfactorio con solo una variable. Se ha observado como la posición geográfica de los países sí que es significativa, ya sea por temas culturales o religiosos. Además, tras esta investigación, se ha confirmado que la calidad de los datos sobre el suicidio es bastante mejorable, ya que solo los países occidentales parecen estar comprometidos en la correcta notificación de los casos de suicidio, lo que hace que el resto de los países tengan tasas no muy fiables y eso afecta directamente a la estimación del modelo. En cuanto al análisis factorial, sí que ha cumplido el objetivo, se han obtenido resultados bastante satisfactorios, consiguiendo agrupar las 12 variables en 4 factores. El primer factor, que se ha denominado calidad de vida, explica las variables que representan el acceso a necesidades básicas y que se relacionan de forma positiva con la esperanza de vida y en negativo con la mortalidad infantil. Esto confirma la importancia de cubrir las necesidades básicas del ser humano, ya que cada vez más países usan la esperanza de vida como un indicador para controlar la salud de sus poblaciones. A parte, se ha visto como el factor ‘riqueza en salud’ relaciona positivamente el PIB per cápita con el presupuesto dedicado a la salud, y de forma negativa la población rural. Aquí se concluye que los países con mayor riqueza individual son los que menor población rural tienen, es decir, se observa como las economías mas grandes ya no se dedican al sector primario, si no que buscan riqueza en el sector servicios y apuestan por un desarrollo más tecnológico. Y por tanto, cuanta más riqueza, más dinero para invertir en sanidad y mejorar la calidad de vida de sus habitantes. Por desgracia, se sigue apreciando una gran diferencia entre los países occidentales y el resto, sobre todo con los países africanos, tanto en calidad de vida como en riqueza para la salud. La desigualdad es más que evidente, solo hay que fijarse en que la mayoría de los países atípicos eran africanos, ya que sus valores contrastaban demasiado con el resto de países de otros continentes. Finalmente, con los contrastes de hipótesis se ha conseguido dar respuesta a algunas de las creencias que hay actualmente sobre el suicidio. Se ha confirmado que los hombres sí tienden a suicidarse más que las mujeres, y en cuanto a las razones, pueden variar según estudios, pero las que más se repiten son debido a la distinta concepción que se tiene sobre pedir ayuda. El hombre es mucho mas reacio a expresar sus emociones y solicitar ayuda cuando se esta en un momento de depresión, lo consideran un símbolo de debilidad, además de que para cometer el acto se necesita una impulsividad severa, característica más masculina. En cambio, la mujer, aun siendo más propensa a sufrir depresión, se piensa mas las cosas y no le da tanto apuro pedir consejo o ayuda en periodos de dificultad personal. También se ha observado como la esperanza de vida claramente disminuye cuando la tasa de suicidio es alta, y viceversa. Solo con 4 variables la mortalidad infantil, el PIB per cápita, el suicidio y la inversión sanitaria, se consigue explicar casi un 90% de la esperanza de vida. Personalmente sí creo que el entorno y la región en la que se vive influye en la incidencia suicida. No obstante, para que sea un estudio con resultados de calidad, se necesitará una Paula Fernández Campos Trabajo de Fin de Grado 2022 49 mejora en la recogida de la tasa de suicidio para que se refleje realmente la relación entre los indicadores de desarrollo y la variable de estudio. 9. BIBLIOGRAFÍA Apuntes de la asignatura Estudio y depuración de datos impartida por Daniel Gómez González Apuntes de Métodos de predicción lineal impartida por Julia Amador Pacheco Apuntes de Técnicas avanzadas de predicción lineal impartida por Juana María Alonso Arenas, Maribel. El alto porcentaje de suicidios aumenta la preocupación en Corea del Sur, China y Japón. - https://asianortheast.com/el-alto-porcentaje-de-suicidios-aumenta-lapreocupacion-en-corea-del-sur-china-y-japon/ Bordon, Javier. (2021). El conflicto de Yemen y Arabia Saudí: sin influencia para resolver pero con motivos para no hacerlo - https://www.realinstitutoelcano.org/analisis/el-conflicto-de-yemen-y-arabiasaudi-sin-influencia-para-resolver-pero-con-motivos-para-no-hacerlo/ Boundi, Mohamed. (2015). Omán y la guerra civil en Yemen - https://periodistas-es.com/oman-la-guerra-civil-yemen-50695 Dilinger, Jessica. (2019). Countries With the Highest Suicide Rates - https://www.worldatlas.com/articles/countries-with-the-most-suicides-in-theworld.html Ercasi, Claudia (2004). La cultura del suicidio. EL PAIS - https://elpais.com/diario/2004/01/18/domingo/1074401558_850215.html González, Ana. (2015) Selección de variables: una revisión de métodos existentes TFM - http://eio.usc.es/pub/mte/descargas/ProyectosFinMaster/Proyecto_1263.pdf IPC, Integrated food security Phase Classification. (septiembre, 2019) - https://reliefweb.int/report/sudan/sudan-ipc-acute-food-insecurity-analysis-june2019-august-2019-issued-september-2019 - https://fscluster.org/zimbabwe/news/zimbabwe-ipc-acute-food-insecurity Khan, M. (2005). Suicide prevention and developing countries. Journal of the Royal Society of Medicine, 98 (10), 459-463. - https://journals.sagepub.com/doi/pdf/10.1177/014107680509801011 Knipe DW, Metcalfe C, Gunnell D. (2015) WHO suicide statistics–a cautionary tale. - https://www.ncbi.nlm.nih.gov/pmc/articles/PMC4384175/ Paula Fernández Campos Trabajo de Fin de Grado 2022 50 Lew, B., Lester, D., Kõlves, K. et al. (2022). An analysis of age-standardized suicide rates in Muslim-majority countries in 2000-2019. BMC Public Health 22, 882 - https://doi.org/10.1186/s12889-022-13101-3 Little, Roderick J. A. (1988) A Test of Missing Completely at Random for Multivariate Data with Missing Values. Journal of the American Statistical Association 83 (404) Molina, R. T et al. (2003). Factores de riesgo asociados al suicidio e intento de suicidio. Salud uninorte, (17), p 19-28. - https://www.redalyc.org/pdf/817/81701703.pdf Murphy, George. (1998) Why women are less likely than men to commit suicide, Comprehensive Psychiatry, Volume 39, Issue 4, 1998, Pages 165-175, - https://doi.org/10.1016/S0010-440X(98)90057-8. OMS, Organización Mundial de la Salud. (2021a) Notas de prensa: Suicidio - https://www.who.int/es/news-room/fact-sheets/detail/suicide OMS, Organización Mundial de la Salud (2021b). Una de cada 100 muertes es por suicidio. Comunicado de prensa. - https://www.who.int/es/news/item/17-06-2021-one-in-100-deaths-is-by-suicide OMS Organización Mundial de la Salud (2021c) WHO report highlights global shortfall in investment in mental health. Comunicado de prensa. - https://www.who.int/news/item/08-10-2021-who-report-highlights-globalshortfall-in-investment-in-mental-health Rubin, D. B. (1987). Multiple imputation for nonresponse in surveys. Rubinstein, D. H. (2002). Youth suicide and social change in Micronesia. Occas Pap, 36, p 33-41. - http://cpi.kagoshima-u.ac.jp/publications/occasionalpapers/occasional/vol36/33-42.pdf Sagna, A.O Kemp, M.L.S., DiNitto D.M., Choi N.G (2020) Impact of suicide mortality on life expectancy in the United States, 2011 and 2015: age and sex decomposition. Public Health, Volume 179, p 76-83. - https://www.sciencedirect.com/science/article/abs/pii/S0033350619303178 Khazaei, S, et al. (2017) Suicide rate in relation to the Human Development Index and other health related factors: A global ecological study from 91 countries. Journal of Epidemiology and Global Health. Volume 7, Issue 2, p 131-134. - https://www.sciencedirect.com/science/article/pii/S2210600616300430#b0045 Paula Fernández Campos Trabajo de Fin de Grado 2022 51 Sedgwick, R., Epstein, S., Dutta, R., & Ougrin, D. (2019). Social media, internet use and suicide attempts in adolescents. Current opinion in psychiatry, 32(6), p 534–541. - https://doi.org/10.1097/YCO.0000000000000547 Uriel, Ezequiel. (2003) Introducción a la econometría. Universidad de Valencia - https://www.uv.es/uriel/material/multicolinealidad3.pdf UN, United Nations, Department of economic and Social Affairs. (2015) LDC Identification Criteria & Indicators - https://web.archive.org/web/20050614063659/http://www.un.org/specialrep/ohrlls/ldc/ldc%20criteria.htm 10. ANEXO Países en la base de datos inicial: Afghanistan, Albania, Angola, Antigua and Barbuda, Argentina, Armenia, Australia, Austria, Azerbaijan, Bahamas, Bahrain, Bangladesh, Barbados, Belarus, Belgium, Belize, Benin, Bhutan, Bolivia, Bosnia and Herzegovina, Botswana Brazil, Brunei Darussalam, Bulgaria, Burkina Faso, Burundi, Cabo Verde, Cambodia, Cameroon, Canada, Chad, Chile, China, Colombia, Comoros, Congo, Dem. Rep., Congo, Rep., Costa Rica, Cote d'Ivoire, Croatia, Cyprus, Czech Republic, Denmark, Dominican Republic, Ecuador, Egypt, Arab Rep., El Salvador, Equatorial Guinea, Estonia, Eswatini, Ethiopia, Fiji, Finland, France, Gabon, Gambia, Georgia, Germany, Ghana, Greece, Grenada, Guatemala, Guinea, Guinea-Bissau, Haiti, Honduras, Hungary, Iceland, India, Indonesia, Iraq, Israel, Italy, Jamaica, Japan, Jordan, Kazakhstan, Kenya, Kiribati, Korea, Rep., Kuwait, Kyrgyz Republic, Lao PDR, Latvia, Lebanon, Liberia, Libya, Lithuania, Madagascar, Malawi, Malaysia, Maldives, Mali, Malta, Mauritania, Mauritius, Mexico, Micronesia, Fed., Moldova, Mongolia, Montenegro, Morocco, Mozambique, Myanmar, Namibia, Nepal, Netherlands, New Zealand, Nicaragua, Niger, Nigeria, North Macedonia, Pakistan, Panama, Papua New Guinea, Paraguay, Peru, Philippines, Poland, Portugal, Romania, Russian Federation, Rwanda, Samoa, Sao Tome and Principe, Senegal, Serbia, Seychelles, Singapore, Slovak Republic, Slovenia, Solomon Islands, Spain, Sri Lanka, St. Lucia, St. Vincent and the Grenadines, Suriname, Sweden, Syrian Arab Republic, Tajikistan, Tanzania, Thailand, Timor-Leste, Togo, Tonga, Trinidad and Tobago, Tunisia, Turkey, Turkmenistan, Uganda, Ukraine, United Arab Emirates, United Kingdom, United States, Uruguay, Vanuatu, Vietnam, Zambia, Luxembourg, Switzerland, Ireland, Norway, Qatar, South Africa, Djibouti, Sierra Leone, Central African Republic, Somalia, Algeria, Oman, Saudi Arabia, Cuba, Zimbabwe, Sudan, Iran, Uzbekistan, Lesotho, Guyana,American Samoa, Andorra, Aruba, Bermuda, British Virgin Islands, Cayman Islands, Channel Islands, Curacao, Dominica, Faroe Islands, French Polynesia, Gibraltar, Greenland, Guam, Hong Kong, Isle of Man, Liechtenstein, Macao, Marshall Islands, Monaco, Nauru, New Caledonia, Mariana Islands, Palau, Puerto Rico, San Marino, Sint Maarten, St. Kitts and Nevis, St. Martin (French part), Turks and Caicos Islands, Tuvalu, Virgin Islands y West Bank and Gaza. Paula Fernández Campos Trabajo de Fin de Grado 2022 52 Países en la base de datos final: Afghanistan, Albania, Angola, Antigua and Barbuda, Argentina, Armenia, Australia, Austria, Azerbaijan, Bahamas, Bahrain, Bangladesh, Barbados, Belarus, Belgium, Belize, Benin, Bhutan, Bolivia, Bosnia and Herzegovina, Botswana Brazil, Brunei Darussalam, Bulgaria, Burkina Faso, Burundi, Cabo Verde, Cambodia, Cameroon, Canada, Chad, Chile, China, Colombia, Comoros, Congo, Dem. Rep., Congo, Rep., Costa Rica, Cote d'Ivoire, Croatia, Cyprus, Czech Republic, Denmark, Dominican Republic, Ecuador, Egypt, Arab Rep., El Salvador, Equatorial Guinea, Estonia, Eswatini, Ethiopia, Fiji, Finland, France, Gabon, Gambia, Georgia, Germany, Ghana, Greece, Grenada, Guatemala, Guinea, Guinea-Bissau, Haiti, Honduras, Hungary, Iceland, India, Indonesia, Iraq, Israel, Italy, Jamaica, Japan, Jordan, Kazakhstan, Kenya, Kiribati, Korea, Rep., Kuwait, Kyrgyz Republic, Lao PDR, Latvia, Lebanon, Liberia, Libya, Lithuania, Madagascar, Malawi, Malaysia, Maldives, Mali, Malta, Mauritania, Mauritius, Mexico, Micronesia, Fed., Moldova, Mongolia, Montenegro, Morocco, Mozambique, Myanmar, Namibia, Nepal, Netherlands, New Zealand, Nicaragua, Niger, Nigeria, North Macedonia, Pakistan, Panama, Papua New Guinea, Paraguay, Peru, Philippines, Poland, Portugal, Romania, Russian Federation, Rwanda, Samoa, Sao Tome and Principe, Senegal, Serbia, Seychelles, Singapore, Slovak Republic, Slovenia, Solomon Islands, Spain, Sri Lanka, St. Lucia, St. Vincent and the Grenadines, Suriname, Sweden, Syrian Arab Republic, Tajikistan, Tanzania, Thailand, Timor-Leste, Togo, Tonga, Trinidad and Tobago, Tunisia, Turkey, Turkmenistan, Uganda, Ukraine, United Arab Emirates, United Kingdom, United States, Uruguay, Vanuatu, Vietnam y Zambia. Regiones geográficas: Eastern Africa, western Africa, northern Africa, middle Africa, southern Africa, central Asia, eastern Asia, southern Asia, south-eastern Asia, western Asia, Eastern Europe, northern Europe, southern Europe, Western Europe, northern America, Central America, Caribbean, South America, Melanesia, Australia and New Zealand, Polynesia y Micronesia. Salidas de R Test de normalidad: Test Statistic pvalue ----------------------------------------------- Shapiro-Wilk 0.8526 0.0000 Kolmogorov-Smirnov 0.1983 0.0428 Cramer-von Mises 4.6616 0.0000 Anderson-Darling 2.0106 0.0000 Test de homocedasticidad: studentized Breusch-Pagan test data: model BP = 10.129, df = 14, p-value = 0.7527 Test de Wilcoxon: Wilcoxon rank sum test with continuity correction data: datos$Suicide_male and datos$suicide_female W = 21910, p-value < 2.2e-16 alternative hypothesis: true location shift is not equal to 0