scieee AI-readable full text Open interactive document viewer

Análisis de la sostenibilidad del sistema público de pensiones español, mediante una evaluación comparativa de técnicas univariantes y multivariantes de predicción de series temporales de agregados económicos y demográficos

Rodríguez Rodríguez, Gustavo

Abstract

En las próximas páginas se evaluará la sostenibilidad futura de nuestro sistema público de pensiones, mediante el análisis de series temporales de agregados macroeconómicos y demográficos. La motivación de este trabajo es doble: económica y estadística. Por un lado, el gasto en pensiones es uno de los mayores desembolsos que realiza el Estado y, actualmente, el sistema se encuentra en una situación de dificultad e incertidumbre, debido principalmente a la grave situación económica y a la dinámica demográfica. Por otro lado, a pesar de que los modelos multivariantes son muy usados en economía para modelizar las interdependencias, no lo son tanto a la hora de predecir series temporales. El motivo es que a menudo los métodos univariantes superan a los multivariantes a causa de su simplicidad. Por ello en este trabajo comprobaremos que método nos proporciona una mayor precisión para predecir el porcentaje de Producto Interior Bruto que se destinará al gasto en pensiones en España. Al final determinaremos que la mejor aproximación la obtendremos mediante modelos univariantes. También concluiremos que el sistema público de pensiones necesita cambios estructurales, puesto que la crisis producida por el COVID-19 ha acelerado su deterioro y pasará a estar en una situación insostenible en los próximos años.

Full text

FACULTAD DE ESTUDIOS ESTADÍSTICOS GRADO EN ESTADÍSTICA APLICADA Curso 2019/2020 Trabajo de Fin de Grado TÍTULO: Análisis de la sostenibilidad del sistema público de pensiones español, mediante una evaluación comparativa de técnicas univariantes y multivariantes de predicción de series temporales de agregados económicos y demográficos Alumno: Gustavo Rodríguez Rodríguez Tutor: José Luis Valencia Delfa Septiembre de 2020 2 Contenido RESUMEN ...................................................................................................................................... 3 1. INTRODUCCIÓN ................................................................................................................. 4 1.1. El Origen de los Sistemas de Pensiones de Reparto ...................................................... 4 1.2. El Sistema Público de Pensiones Español ....................................................................... 4 1.3. La Situación Actual ......................................................................................................... 6 2. ESTADO DEL ARTE ........................................................................................................... 13 2.1. Introducción ................................................................................................................. 13 2.2. Enfoques de Estudio de la Sostenibilidad de un Sistema de Pensiones ...................... 13 3. HIPÓTESIS Y OBJETIVOS ................................................................................................... 16 3.1. Hipótesis ....................................................................................................................... 16 3.2. Objetivo Principal del Estudio ...................................................................................... 16 3.3. Objetivos Secundarios del Estudio ............................................................................... 16 4. MATERIAL Y METODOLOGÍA ........................................................................................... 17 4.1. Ámbito y Periodo del Estudio ....................................................................................... 17 4.2. Fuentes de Datos .......................................................................................................... 17 4.3. Definiciones .................................................................................................................. 17 4.4. Pasos a Seguir en el Análisis de los Datos .................................................................... 19 4.5. Técnicas Estadísticas Utilizadas .................................................................................... 21 • 4.5.1. Análisis Univariante ....................................................................................... 21 ➢ 4.5.1.1. Métodos de Suavizado o Alisado Exponencial ....................................... 21 ➢ 4.5.1.2. Metodología Box-Jenkins ....................................................................... 22 • 4.5.2. Análisis Multivariante .................................................................................... 23 ➢ 4.5.2.1. Análisis de Componentes Principales ..................................................... 23 ➢ 4.5.2.2. Modelos Vectoriales ............................................................................... 24 • 4.5.3. Variables de Intervención.............................................................................. 26 4.6. Software ....................................................................................................................... 26 5. ANÁLISIS Y RESULTADOS ................................................................................................. 27 5.1. Procesamiento de las Series ......................................................................................... 27 5.2. Análisis .......................................................................................................................... 28 4.3. Comparativa y Selección del Mejor Modelo ................................................................ 52 4.4. Predicción ..................................................................................................................... 54 6. DISCURSIÓN Y CONCLUSIONES ....................................................................................... 58 7. BIBLIOGRAFÍA .................................................................................................................. 60 3 RESUMEN En las próximas páginas se evaluará la sostenibilidad futura de nuestro sistema público de pensiones, mediante el análisis de series temporales de agregados macroeconómicos y demográficos. La motivación de este trabajo es doble: económica y estadística. Por un lado, el gasto en pensiones es uno de los mayores desembolsos que realiza el Estado y, actualmente, el sistema se encuentra en una situación de dificultad e incertidumbre, debido principalmente a la grave situación económica y a la dinámica demográfica. Por otro lado, a pesar de que los modelos multivariantes son muy usados en economía para modelizar las interdependencias, no lo son tanto a la hora de predecir series temporales. El motivo es que a menudo los métodos univariantes superan a los multivariantes a causa de su simplicidad. Por ello en este trabajo comprobaremos que método nos proporciona una mayor precisión para predecir el porcentaje de Producto Interior Bruto que se destinará al gasto en pensiones en España. Al final determinaremos que la mejor aproximación la obtendremos mediante modelos univariantes. También concluiremos que el sistema público de pensiones necesita cambios estructurales, puesto que la crisis producida por el COVID-19 ha acelerado su deterioro y pasará a estar en una situación insostenible en los próximos años. Palabras clave: Pensiones, Sostenibilidad, Predicción, Series Temporales, Suavizado Exponencial, Box-Jenkins, Univariante, Multivariante, Variables de Intervención, COVID-19. 4 1. INTRODUCCIÓN 1.1. El Origen de los Sistemas de Pensiones de Reparto En las sociedades previas a la Revolución Industrial los ancianos solo podían recibir ayuda a través de los recursos informales de apoyo social, principalmente los miembros de la familia y las amistades, lo que conllevaba alta tasas de morbilidad y mortalidad. La industrialización y el capitalismo implicaron una transformación de la estructura familiar y una mayor esperanza de vida. Todos estos procesos impulsarían la demanda de creación de sistemas estructurados de ayuda para la jubilación, enfermedad, accidentes o discapacidad. El primer sistema de Seguridad Social fue creado en 1881 por Otto von Bismarck con la finalidad de proporcionar una renta en situaciones vulnerables como la vejez o la incapacidad. Al terminar la Primera Guerra Mundial, los sistemas de seguros sociales se extendieron por las distintas naciones hasta llegar a la situación en la que se encuentran actualmente. Durante su desarrollo surgió una pugna sobre cómo debía articularse un verdadero sistema pensiones. Unos argumentaban que las aportaciones del trabajador y su pensión debían mantener una relación directa (Sistemas de Reparto Contributivo o Bismarckianos). Por el contrario, otros defendían un sistema de mínimos, en el cuál las pensiones tuvieran igual cuantía para cada trabajador (Sistemas Asistenciales o Beveridge). Hoy en día la mayoría de los países europeos cuenta con lo que se denomina un sistema público de pensiones de reparto. En esencia, este tipo de sistemas de pensiones se basan en la idea del pacto intergeneracional para la redistribución de la renta, es decir, los trabajadores contribuyen con una parte de su salario a pagar las pensiones actuales con la esperanza de que el sistema se prolongue el tiempo suficiente como para que las generaciones venideras aporten sus futuras pensiones. 1.2. El Sistema Público de Pensiones Español En nuestro país, la Ley General de la Seguridad Social de 1966 fue la encargada de implantar un modelo unitario e integrado de protección social con una base financiera de reparto, participación del Estado en la financiación y gestión pública. Con esta ley se establecía la edad de jubilación a los 65 años, se necesitaban 8 años de cotización para tener derecho a la misma y se tenían en cuenta los 2 años anteriores a la fecha de la jubilación para calcular la pensión. A lo largo de las últimas décadas del siglo XX y las primeras del siglo XXI se han realizado sucesivas reformas con el objetivo de adecuar el sistema a las necesidades sociales, económicas y demográficas del país. A continuación, se muestra una tabla con los principales hitos y medidas que se tomaron en distintas etapas. 5 Tabla 1.1. Principales Reformas en el Sistema Público de Pensiones Década de los 80 Finales de los 90 y principios del 2000 Década del 2010 • Equiparación paulatina de las bases de cotización con los salarios reales. • Revalorización de las pensiones en función de la variación del IPC. • Extensión de la protección a más colectivos no cubiertos. • Aumento del período mínimo de cotización de 10 a 15 años. • Aumento desde los 2 años hasta los 8 años previos a la jubilación para el cómputo de la base reguladora de la pensión. • Regulación de las pensiones no contributivas. • Firma del Pacto de Toledo para asegurar la estabilidad financiera y las prestaciones futuras. • Aumento de 8 a 15 en el número de años aplicados al cálculo de la base reguladora de la pensión. • Creación del Fondo de Reserva para asegurar la sostenibilidad del Sistema y atender posibles necesidades futuras. • Incentivación de la jubilación más allá de los 65 años. • Aumento de la edad de jubilación de 65 a 67 años. • Aumento de la base reguladora de la pensión de 15 a 25 años. • Aumento de 35 a 37 años cotizados para alcanzar el 100% de la base reguladora de la pensión. • Introducción del Factor de Sostenibilidad. • Desvinculación de la revalorización de las pensiones al IPC y vinculación al Índice de Revalorización. Fuente: Secretaría de Estado de la Seguridad Social Muchas de estas medidas se crearon con el propósito de aumentar el número de trabajadores afiliados a la Seguridad Social, disminuir el número de pensionistas y rebajar la cuantía de la pensión media. Sin embargo, a pesar de que en el momento de su aplicación supusieron un alivio para el sistema, se mantuvo la tendencia creciente tanto en la cantidad de pensiones como en el importe de la pensión media. Todo ello, nos lleva a la siguiente pregunta: ¿En qué circunstancias nos encontramos ahora? 6 1.3. La Situación Actual El progresivo envejecimiento de la población, debido al aumento de la esperanza de vida, ha modificado de manera sustancial la estructura de la pirámide poblacional española. Gráfico 1.1. Población 1994 Gráfico 1.2. Población 2019 Datos: INE Datos: INE Cada vez ganan más peso los colectivos más longevos, en especial los de más de 65 años y más de 85 años. Tabla 1.2. Población de más de 65 años (1994-2019) Año Mayores de 65 años Población Total Porcentaje Población Mayor de 65 años Incremento 1994 5.857.730 39.547.353 14,81% 1999 6.616.982 40.369.666 16,39% 1,58% 2004 7.154.259 42.859.173 16,69% 0,30% 2009 7.727.117 46.367.550 16,66% -0,03% 2014 8.510.477 46.455.123 18,32% 1,65% 2019 9.180.401 47.100.395 19,49% 1,17% Datos: INE 7 Gráfico 1.3. Población de más de 85 años (1994-2019) Datos: INE En la Tabla 1.2 y el Gráfico 1.3 vemos como el engrosamiento de las cohortes de más edad ha sido continuo durante los últimos 25 años. Tan solo la llegada de inmigrantes jóvenes, motivados por el crecimiento económico de comienzos de siglo XXI, pudo ralentizar la progresión del incremento en el peso específico de estos grupos sobre el total de la población. Gráfico 1.4. Flujos Máximos y Mínimos de Inmigración Anual por Edades en los Periodos 1993-2000, 2001-2008 y 2009-2016 Datos: EUROSTAT 8 Mientras, las generaciones más jóvenes van mermando año tras año. Así, en el primer semestre de 2019 en España solo han nacido 170.074 personas, lo que supone la cifra más baja registrada desde 1941, primer año del que hay datos. También la tasa bruta de natalidad ha decrecido a lo largo de las últimas décadas, situándose en su mínimo desde que se empezaron a contabilizar datos en 1975. Gráfico 1.5. Tasa de Natalidad (1975-2018) Datos: INE Este fuerte descenso de la natalidad, motivado por causas culturales, sociales y económicas, se produce esencialmente por el retraso en la edad a la que se tienen hijos. Tabla 1.3. Edad Media a la Maternidad (1994-2018) Año Edad Media 1994 29,74 1999 30,68 2004 30,87 2009 31,04 2014 31,78 2018 32,20 Datos: INE 9 La unión de todos estos fenómenos demográficos produce un peligroso aumento de la tasa de dependencia de la población mayor de 64 años, entendida como el cociente entre la población mayor de 64 años y la población entre 16 y 64 años. Gráfico 1.6. Tasa de Dependencia de la Población mayor de 64 años (1975-2019) Datos: INE Aunque este índice de dependencia sea, estrictamente hablando, un indicador demográfico, se utiliza ampliamente como indicador económico. Puesto que contrapone al grupo que es principal generador de riqueza, frente al grupo que es mayor consumidor de recursos del estado. La tendencia claramente creciente que nos muestra el Gráfico 1.6 es una señal de que, si no se producen cambios estructurales, en el futuro tendremos desequilibrios económicos. Por otro lado, la evolución del saldo del Sistema de Seguridad Social tampoco arroja resultados halagüeños. Aunque los ingresos de los últimos años mantienen una tendencia positiva gracias al aumento en las cotizaciones sociales, la partida de gastos crece a tasas todavía más altas. 16 3. HIPÓTESIS Y OBJETIVOS 3.1. Hipótesis La hipótesis de partida es que existe una relación subyacente en los datos de las series temporales de gasto en pensiones como porcentaje del PIB que puede ser modelizada mediante técnicas estadísticas. Y, por tanto, podemos pronosticar, con diferentes grados de confianza, el comportamiento de la serie en el futuro. 3.2. Objetivo Principal del Estudio La finalidad principal de este estudio es comprobar si el sistema de pensiones, tal y como está estructurado actualmente, es viable en un horizonte temporal de 10 años. Para ello calcularemos el porcentaje del PIB que supone el gasto en pensiones durante los años 2020-2030. 3.3. Objetivos Secundarios del Estudio Entre los propósitos secundarios están: • Comparar distintas metodologías para predecir series temporales, tanto univariantes como multivariantes, y determinar cuál es la que proporciona mejores resultados. • Estimar el posible impacto que tendrá la crisis del COVID-19 en nuestro sistema de pensiones. 17 4. MATERIAL Y METODOLOGÍA 4.1. Ámbito y Periodo del Estudio El trabajo se ha desarrollado en el ámbito del territorio español. Los datos pertenecen al periodo 1995-2020 y como unidad de tiempo básica se ha seleccionado el mes. 4.2. Fuentes de Datos Los datos para poder llevar a cabo los objetivos de este estudio se han seleccionado siguiendo, esencialmente, tres criterios: su disponibilidad, su fiabilidad y su potencial capacidad explicativa. Teniendo en cuenta el primer y el segundo criterio se han empleado bases de datos procedentes de Eurostat, el Instituto Nacional de Estadística y la Seguridad Social. El uso de fuentes de datos que han sido elaboradas por instituciones que se encuentran bajo el paraguas del Sistema Estadístico Europeo (SEE) garantiza que los datos son fiables y comparables, ya que han sido tratados de manera adecuada a lo largo de todo el proceso. En cuanto al tercer criterio, nos guiaremos por los trabajos publicados por otros investigadores y por nuestra intuición. Como hemos visto en las secciones anteriores los flujos de inmigración, las tasas de mortalidad y fecundidad, el nivel de empleo y afiliación, la estructura de la población, etcétera juegan un papel determinante en las fluctuaciones a lo largo del tiempo del porcentaje del PIB destinado al gasto en pensiones. Por todo lo anterior las variables que se han incluido en este estudio son: • Número de pensiones pagadas. • Valor de la pensión media a precios corrientes. • Número de inmigrantes llegados a España por edad. • Producto Interior Bruto de España a precios corrientes. • Número de habitantes en España por edad y sexo. • Número de defunciones por cada mil habitantes en España por edad y sexo. • Número de personas afiliadas a la Seguridad Social. El motivo principal de no introducir los datos relativos a la natalidad es que el impacto de los nuevos nacimientos solo será de utilidad en estudios a más largo plazo (20 o más años). 4.3. Definiciones Como paso previo al análisis y la construcción de modelos, es esencial definir un indicador que pueda medir fehacientemente el grado de sostenibilidad del sistema de pensiones y un determinado umbral en el que establecer si el sistema es o no viable. 18 La variable indicadora de la sostenibilidad será el porcentaje de PIB que se dedica a cubrir el gasto en pensiones, que, a partir de ahora, denominaremos PGP (Porcentaje de Gasto en Pensiones). Esta variable queda definida por la siguiente expresión: 𝑃𝐺𝑃𝑡=𝐺𝑃𝑡 𝑃𝐼𝐵𝑡=𝑃𝑀𝑡×𝑁𝑃𝑡 𝑃𝐼𝐵𝑡 donde 𝐺𝑃𝑡 representa el gasto en pensiones en el instante t, 𝑃𝐼𝐵𝑡 representa el Producto Interior Bruto en el instante t, 𝑃𝑀𝑡 representa la pensión media en el instante t y 𝑁𝑃𝑡 representa el número de pensiones en el instante t. Puesto que las únicas variables que se miden en unidades monetarias son el PIB y la pensión media, a lo largo del estudio usaremos precios corrientes. La razón es obvia, ya que dividir numerador y denominador por el deflactor nos daría los mismos resultados. El establecimiento de un umbral a partir del cual determinar la sostenibilidad o no de nuestro sistema de pensiones es un asunto más complejo. En la literatura no existe un consenso, por lo que tomaremos esta decisión en base a los datos de España y de países de nuestro entorno. Tabla 4.1. Porcentaje del PIB Destinado a Pensiones (2015) País % PIB Grecia 17.8 Italia 16.5 Francia 15.0 Portugal 14.9 Austria 14.6 Dinamarca 13.5 Finlandia 13.1 Países Bajos 13.0 UE-28 12.8 Bélgica 12.7 España 12.6 Alemania 11.8 Polonia 11.8 Suecia 11.4 Reino Unido 11.4 Eslovenia 10.9 Datos: EUROSTAT Observamos que el gasto medio en los países de la UE en pensiones se situó en 2015 en el 12.8% del PIB, para España los datos son muy similares a la media europea (tan solo unas décimas por debajo). Dentro de ese 12.6% del PIB que gasto nuestro país en pensiones se engloban diferentes tipos de pensiones, como las de la Seguridad Social (aproximadamente el 9.1% del PIB) o las de las clases pasivas (alrededor del 1.2% del PIB). 19 Teniendo en cuenta que los datos que manejamos en este estudio son los relativos a las pensiones pagadas por la Seguridad Social, podemos establecer a través de una relación de proporcionalidad que el umbral de gasto en pensiones para nuestro estudio debería situarse como mucho en una banda entre el 13% y el 15% del PIB. Ya que, en caso de superar ese umbral, el gasto total de España en pensiones se situaría muy por encima del resto de países de la UE. En resumen, determinamos que el sistema se encuentra en una situación sostenible mientras nuestras predicciones de gasto del PIB en pensiones estén por debajo del 13%; en situación de riego cuando estén entre el 13% y el 15%; y en situación claramente insostenible cuando estén por encima del 15%. 4.4. Pasos a Seguir en el Análisis de los Datos En primer lugar, uniremos las distintas series temporales en un único conjunto de datos y calcularemos las variables que sean necesarias. En muchos de los casos para poder trabajar tendremos que realizar un procesamiento de las series que incluye: su desestacionalización, ya que es fundamental para poder analizar de manera correcta su evolución y tendencia a lo largo del tiempo; y la interpolación de datos faltantes, ya que algunas de las series estadísticas disponibles no tienen la periodicidad adecuada (trimestrales, semestrales o anuales). A continuación, procederemos a la parte del análisis y la creación de modelos. En este apartado usaremos dos tipos de metodología: univariante y multivariante. Un paso esencial en la fase de análisis es el de dividir nuestro conjunto de datos en dos partes: una para la estimación de los parámetros (entrenamiento) y otra para comprobar la calidad de nuestras predicciones (test). Gráfico 4.1. Como dividir las series temporales Cuando ya tengamos nuestros modelos estimados y validados procederemos a ver cuál es el que nos proporciona una mejor aproximación a la realidad. Seleccionaremos el modelo que nos proporcione unas mejores predicciones. Por último, usaremos todos las observaciones de las que disponemos para predecir el comportamiento del porcentaje de PIB que se destina a cubrir el gasto en pensiones. Con estas últimas predicciones veremos si el sistema es o no sostenible en el tiempo. Datos Disponibles (Pasado) Entrenamiento Test Futuro Predicciones 20 Gráfico 4.2. Esquema general de trabajo 21 4.5. Técnicas Estadísticas Utilizadas Para llevar a cabo el análisis de nuestra base de datos, vamos a utilizar diversas técnicas estadísticas. • 4.5.1. Análisis Univariante ➢ 4.5.1.1. Métodos de Suavizado o Alisado Exponencial Los métodos de suavizado o alisado exponencial fueron desarrollados por Brown, Holt y Winters entre 1950 y 1960. Estos modelos ajustan la evolución de la serie calculando cada nueva observación como una media ponderada de las anteriores, considerando que los pesos de las mismas se reducen exponencialmente. Pese a su simplicidad, varios autores han demostrado que pueden tener mejor desempeño que otros modelos más complejos, particularmente cuando los datos no son normales. Existen multitud de métodos de suavizado, pero los más conocidos y usados son el método de alisado simple, el método de alisado doble de Holt, el método aditivo de HoltWinters y el método multiplicativo de Holt-Winters. Estos dos últimos serán los que utilizaremos nosotros y los que detallamos a continuación. El método de Holt-Winters se puede aplicar en series temporales con tendencia lineal y estacionalidad. El modelo aditivo y el multiplicativo se definen matemáticamente de la siguiente forma: Holt-Winters Aditivo Holt-Winters Multiplicativo 𝒙𝒕=(𝑳𝒕+𝒃𝒕)+𝑺𝒕+𝝐𝒕 donde 𝑳𝒕=𝜶(𝒙𝒕−𝑺𝒕−𝒔)+(𝟏−𝜶)(𝑳𝒕−𝟏+𝒃𝒕−𝟏) 𝒃𝒕=𝜷(𝑳𝒕−𝑳𝒕−𝟏)+(𝟏−𝜷)𝒃𝒕−𝟏 𝑺𝒕=𝜸(𝒙𝒕−𝑳𝒕)+(𝟏−𝜸)𝑺𝒕−𝒔 𝝐≡𝑵(𝟎,𝝈) 𝒙𝒕=(𝑳𝒕+𝒃𝒕)×𝑺𝒕+𝝐𝒕 donde 𝑳𝒕=𝜶𝒙𝒕 𝑺𝒕−𝒔+(𝟏−𝜶)(𝑳𝒕−𝟏+𝒃𝒕−𝟏) 𝒃𝒕=𝜷(𝑳𝒕−𝑳𝒕−𝟏)+(𝟏−𝜷)𝒃𝒕−𝟏 𝑺𝒕=𝜸𝒙𝒕 𝑳𝒕+(𝟏−𝜸)𝑺𝒕−𝒔 𝝐≡𝑵(𝟎,𝝈) Los tres parámetros 𝜶, 𝜷 y 𝜸 toman valores que oscilan entre 0 y 1. Las predicciones para estos modelos se calculan como: 22 Holt-Winters Aditivo Holt-Winters Multiplicativo 𝒙𝒕+𝟏=(𝑳𝒕+𝒃𝒕)+𝑺𝒕+𝟏−𝒔 𝒙𝒕+𝟏=(𝑳𝒕+𝒃𝒕)×𝑺𝒕+𝟏−𝒔 Tan solo señalaremos que en estos modelos cuando el valor de los parámetros está próximo a 0, indica que las predicciones se modifican muy poco con la nueva información, por lo que son muy similares entre sí (mucha memoria). Por el contrario, cuando toman un valor cercano a 1 la predicción se va adaptando según el valor que toman las últimas observaciones, por lo que se dice que tiene poca memoria (los valores alejados prácticamente no tienen influencia en la predicción). ➢ 4.5.1.2. Metodología Box-Jenkins La publicación de “Time Series Analysis: Forecasting and Control” por Box y Jenkins a comienzos de los 70 supuso la integración del conocimiento previo existente sobre la noción de estocasticidad en series de tiempo, así como la creación de una metodología coherente sobre cómo abordar la identificación, estimación y validación de los modelos. La caracterización principal de este enfoque es la consideración de que la serie temporal viene determinada por la realización de un proceso estocástico, siendo esta una realización particular del mismo. Sobre la base de esta simple idea se han ido desarrollando multitud de modelos: autorregresivos (AR), de medias móviles (MA), mixtos autorregresivos-medias móviles (ARMA) y autorregresivos integrados de medias móviles (ARIMA). La estructura de los modelos AR, MA y ARMA solo permite ser usada en series de tiempo estacionarias1, pero la mayoría de las series no lo son. Gracias a la introducción de los modelos ARIMA se realiza la integración o diferenciación que permite abordar series no estacionarias. Se dice que un proceso 𝑧𝑡 es 𝐴𝑅𝐼𝑀𝐴(𝑝,𝑑,𝑞)(𝑃,𝐷,𝑄)𝑠 cuando 𝑝 es el orden de la parte autorregresiva, 𝑑 el orden de integración, 𝑞 el orden de la parte móvil, 𝑃 el orden de la parte autorregresiva periódica o estacional, 𝐷 el orden de integración de la parte periódica o estacional, 𝑄 el orden de la parte móvil periódica o estacional y 𝑠 es la periodicidad de la serie2. Matemáticamente se define como: Φ𝑃(𝐿𝑠)𝜙𝑝(𝐿)(1−𝐿𝑠)𝐷(1−𝐿)𝑑𝑧𝑡=c+Θ𝑄(𝐿𝑠)𝜃𝑞(𝐿)𝜖𝑡 donde: 1 En términos prácticos, una serie es estacionaria (en el sentido débil) cuando la media, la varianza y la covarianza permanecen constantes a lo largo del tiempo. 2 La periodicidad de la serie viene determinada por la naturaleza de los datos (días, meses, trimestres, etcétera), luego no hay que calcular 𝑠. 23 Φ𝑃(𝐿𝑠)=(1−Φ1𝐿𝑠−⋯−Φ𝑃𝐿𝑠𝑃) es el operador AR estacional de orden P, 𝜙𝑝(𝐿)=(1−𝜙1𝐿−⋯−𝜙𝑝𝐿𝑝) es el operador AR regular de orden p, Θ𝑄(𝐿𝑠)=(1−Θ1𝐿𝑠−⋯−Θ𝑄𝐿𝑠𝑄) es el operador MA estacional de orden Q, 𝜃𝑞(𝐿)=(1−𝜃1𝐿−⋯−𝜃𝑞𝐿𝑞) es el operador MA regular de orden q, (1−𝐿𝑠)𝐷 son las diferencias estacionales, (1−𝐿)𝑑 son las diferencias regulares y 𝜖𝑡 es un proceso de ruido blanco. También es conveniente definir el operador polinomial de retardos L, que aplicado a la variable 𝑧𝑡 se define de la siguiente manera: 𝐿(𝑧𝑡)=𝑧𝑡−1 𝐿𝑘(𝑧𝑡)=𝑧𝑡−𝑘 (1−𝐿)𝑧𝑡=𝑧𝑡−𝑧𝑡−1 • 4.5.2. Análisis Multivariante Primeramente, debemos asegurarnos de que no existen problemas debido a que existan variables que son combinación lineal directa de otras. Una solución sencilla para este problema consiste en eliminar alguna de las variables que sea combinación lineal de las otras. Una vez solucionado el problema anterior, debemos comprobar si existen variables que tengan información redundante, es decir, si hay una relación de dependencia lineal fuerte entre algunas de las variables predictoras (Multicolinealidad). En caso afirmativo, procederemos a realizar una reducción de la dimensión mediante componentes principales. El último paso será utilizar los datos resultantes de la reducción de la dimensión para poder estimar el comportamiento de la serie multivariante. ➢ 4.5.2.1. Análisis de Componentes Principales El Análisis de Componentes Principales describe la variación de un conjunto de datos multivariante en términos de un conjunto incorrelado de variables, cada una de las cuales es una combinación lineal particular de las variables originales. Estas nuevas variables reciben el nombre de Componentes Principales y se obtienen en orden decreciente a su importancia. Esto quiere decir que la primera Componente Principal recoge la máxima información de los datos originales, y como consecuencia, la 24 segunda Componente recoge la mayor cantidad de información que no haya sido recogida por la primera Componente y así sucesivamente con el resto de cada una de las Componentes Principales. Debido a que las Componentes Principales se utilizan para resumir los datos originales con la mínima pérdida de información, esto dará lugar a importantes simplificaciones en los análisis posteriores que vamos a realizar. Elegiremos el número de Componentes en función de la proporción de variabilidad explicada, de manera que dicha proporción se considere suficiente (con resultados de encuestas reales un 70% es suficiente, si son pruebas de laboratorio se debe ser más exigente). Desde un punto de vista geométrico las Componentes Principales representan la selección de un nuevo sistema de coordenadas obtenido mediante la rotación del sistema original. Los nuevos ejes representan las direcciones con máxima variabilidad y producen una descripción más simple y ordenada de la estructura de la matriz de VarianzasCovarianzas. Luego, partiendo de la matriz de Varianzas-Covarianzas, se hallará su descomposición en función de sus valores propios y la matriz formada por sus autovectores correspondientes. Matemáticamente queda expresado de la siguiente forma: Σ=𝑃Λ𝑃−1 siendo 𝑃 la matriz que contiene a los autovectores y Λ una matriz diagonal formada por los autovalores. De este modo, la primera componente principal será aquella variable cuyo vector dirección coincide con el del autovector correspondiente al mayor autovalor de la matriz de Varianzas-Covarianzas. Finalmente hay que destacar que cuando las variables no se midan en unidades semejantes, se aplicará el análisis sobre la matriz de correlaciones (en vez de sobre la matriz de Varianzas-Covarianzas). ➢ 4.5.2.2. Modelos Vectoriales La generalización de la metodología Box-Jenkins a las series temporales multivariantes no tardó mucho en llegar. Los procesos vectoriales autorregresivos de medias móviles (VARMA) fueron descritos por primera vez por Quenouille en 1957, aunque el software para poder implementarlos solo estaría disponible a principios de los años 80. Fue a partir de esa década cuando el uso de este tipo de modelos se convirtió en la piedra angular de la predicción macroeconómica, gracias a la publicación de más trabajos teóricos y prácticos. Los primeros modelos que se utilizarían fueron los modelos vectoriales autorregresivos (VAR), que constituyen un caso particular de los VARMA. A pesar de que la teoría económica no está de acuerdo con el modelado de procesos que usan modelos VAR (ya que los términos de medias móviles no pueden excluirse), la dificultad de la metodología VARMA impulsó la selección de modelos VAR. 25 En esencia, un modelo 𝑉𝐴𝑅(𝑝) se define de la siguiente forma: 𝒛𝑡=𝑨1𝒛𝑡−1+⋯+𝑨𝑃𝒛𝑡−𝑝+𝝐𝑡 donde 𝒛𝑡=(𝑧1𝑡,𝑧2𝑡,…,𝑧𝑘𝑡)∀ 𝑘=1,…,𝑛 (𝑉𝑒𝑐𝑡𝑜𝑟 𝑑𝑒 𝑣𝑎𝑟𝑖𝑎𝑏𝑙𝑒𝑠) 𝑨𝑖∈ℳ𝑘×𝑘 ∀ 𝑖=1,…,𝑝 ∧ 𝑘=1,…,𝑛 (𝑀𝑎𝑡𝑟𝑖𝑧 𝑑𝑒 𝑐𝑜𝑒𝑓𝑖𝑐𝑖𝑒𝑛𝑡𝑒𝑠) 𝔼[𝝐𝑡]=0 ∧ 𝔼[𝝐𝑡𝝐𝑡′]=Σ𝜖 𝑑𝑒𝑓𝑖𝑛𝑖𝑑𝑎 𝑝𝑜𝑠𝑖𝑡𝑖𝑣𝑎 (𝑅𝑢𝑖𝑑𝑜 𝑏𝑙𝑎𝑛𝑐𝑜 𝑘−𝑑𝑖𝑚𝑒𝑛𝑠𝑖𝑜𝑛𝑎𝑙) Por tanto, la expresión matricial de un modelo 𝑉𝐴𝑅(1) con un vector de dos variables es: [𝑧1,𝑡 𝑧2,𝑡]=[𝛼11 𝛼12 𝛼21 𝛼22][𝑧1,𝑡−1 𝑧2,𝑡−1]+[𝝐1,𝑡 𝝐2,𝑡] En general, los modelos VAR proporcionaban unos resultados bastantes buenos y supusieron una mejora sobre los modelos anteriores. Con el tiempo se descubriría que tienden a sufrir un ligero sobreajuste (proporcionan predicciones deficientes fuera de la muestra, aunque el ajuste sea muy bueno dentro de la muestra). A pesar de ello se mantuvieron como uno de los principales modelos de referencia durante casi dos décadas. La falta de interés en los modelos multivariantes de medias móviles se debió principalmente a la dificultad a la hora de implementarlos. Sería necesario una nueva ampliación de la metodología y, sobre todo, de la capacidad de cómputo de los ordenadores para que se extendiera su uso a finales de los 90. Utilizando una mixtura de la notación usada para describir los modelos univariantes 𝐴𝑅𝐼𝑀𝐴(𝑝,𝑑,𝑞)(𝑃,𝐷,𝑄)𝑠 y los multivariantes 𝑉𝐴𝑅(𝑝), tenemos que un modelo 𝑉𝐴𝑅𝑀𝐴(𝑝,𝑞) se define matemáticamente como: 𝒛𝑡−𝝓1𝒛𝑡−1−⋯−𝝓𝑝𝒛𝑡−𝑝=𝒄+𝝐𝑡−𝜽1𝝐𝑡−1−⋯−𝜽𝑞𝝐𝑡−𝑞 Estos modelos también permiten la introducción de variables ficticias o dummy para poder modelar la estacionalidad (seasonal factors). Por ejemplo, con datos trimestrales el modelo se especificaría de la forma: 𝒛𝑡−𝝓1𝒛𝑡−1−⋯−𝝓𝑝𝒛𝑡−𝑝=𝒄+𝑫𝑄1𝜷𝑄1+⋯+𝑫𝑄3𝜷𝑄3+𝝐𝑡−𝜽1𝝐𝑡−1−⋯−𝜽𝑞𝝐𝑡−𝑞 donde: • 𝒄 es el vector correspondiente a la parametrización del cuarto trimestre (Q4). • 𝑫𝑄𝑖∀ 𝑖=1,…,3 son matrices dummy con todos sus valores iguales a 0 salvo que el trimestre t sea el correcto. Es decir, si el trimestre t es Q1 entonces 𝑫𝑄1 es la matriz identidad, en otro caso es una matriz nula. • 𝜷𝑄𝑖∀ 𝑖=1,…,3 son vectores que contienen los parámetros de los efectos de cada uno de los trimestres. 32 Tabla 5.6. Estadísticas de ajuste para la variable PGP Estadístico Valor Error cuadrático medio 0.0022329 Error cuadrático medio de la raíz 0.04725362 Error absoluto medio 0.03238464 R-cuadrado 0.99805205 R-cuadrado ajustado 0.99803712 Criterio de información de Akaike -1605.5754 Criterio de información bayesiano de Schwarz -1594.8475 Cálculos basados en el rango de ajuste de datos. Tabla 5.7. Estadísticas de rendimiento para la variable PGP Estadístico Valor Grados de error de libertad 36 Número de observaciones utilizadas 36 Error de suma de cuadrados 1.00272543 Error cuadrático medio 0.02785348 Error cuadrático medio de la raíz 0.16689363 Error absoluto medio 0.13999174 R-cuadrado 0.66138652 R-cuadrado ajustado 0.67079245 Criterio de información de Akaike -128.9087 Criterio de información bayesiano de Schwarz -128.9087 Cálculos basados en la región de predicción de datos. En definitiva, tanto el modelo aditivo como el multiplicativo son adecuados para modelizar el porcentaje de gasto del PIB en pensiones. La principal virtud de estos métodos es que a pesar de su sencillez proporcionan unas predicciones muy ajustadas a la realidad. Ambos modelos quedan definidos matemáticamente de la siguiente manera: Holt-Winters Aditivo 𝒙𝒕=(𝑳𝒕+𝒃𝒕)+𝑺𝒕 donde 33 𝑳𝒕=𝟎.𝟑𝟎𝟖𝟑𝟏(𝒙𝒕−𝑺𝒕−𝒔)+(𝟏−𝟎.𝟑𝟎𝟖𝟐𝟏)(𝑳𝒕−𝟏+𝒃𝒕−𝟏) 𝒃𝒕=𝟎.𝟑𝟐𝟕𝟓𝟕(𝑳𝒕−𝑳𝒕−𝟏)+(𝟏−𝟎.𝟑𝟐𝟕𝟓𝟕)𝒃𝒕−𝟏 𝑺𝒕=𝟎.𝟐𝟔𝟓𝟒𝟗(𝒙𝒕−𝑳𝒕)+(𝟏−𝟎.𝟐𝟔𝟓𝟒𝟗)𝑺𝒕−𝒔 Holt-Winters Multiplicativo 𝒙𝒕=(𝑳𝒕+𝒃𝒕)×𝑺𝒕 donde 𝑳𝒕=𝟎.𝟐𝟖𝟑𝟔𝟕𝒙𝒕 𝑺𝒕−𝒔+(𝟏−𝟎.𝟐𝟖𝟑𝟔𝟕)(𝑳𝒕−𝟏+𝒃𝒕−𝟏) 𝒃𝒕=𝟎.𝟑𝟔𝟓𝟎𝟑(𝑳𝒕−𝑳𝒕−𝟏)+(𝟏−𝟎.𝟑𝟔𝟓𝟎𝟑)𝒃𝒕−𝟏 𝑺𝒕=𝟎.𝟏𝟑𝟕𝟗𝟑𝒙𝒕 𝑳𝒕+(𝟏−𝟎.𝟏𝟑𝟕𝟗𝟑)𝑺𝒕−𝒔 El siguiente paso será la creación de un modelo ARIMA mediante el uso de la metodología Box-Jenkins. La principal dificultad de esta metodología es que, debido a la infinidad de modelos que pueden ser creados, no siempre es fácil saber cuál es el correcto para explicar la estructura de nuestra serie. Por ello a lo largo de los años se ha desarrollado un procedimiento iterativo que permite identificar el modelo más apropiado (Gráfico 5.6). El problema de este esquema de trabajo es que no siempre conduce a resultados únicos, por lo que dos investigadores podrían llegar a resultados diferentes y validos con los mismos datos. Paralelamente a esta forma manual de actuar casi todos los programas estadísticos actuales han desarrollado algoritmos que permiten el cálculo del mejor modelo de forma automática, aunque los resultados no siempre son los óptimos. Aquí también trabajaremos con los datos desde 1995 hasta 2016 para la creación del modelo y los posteriores para comprobar la calidad de las predicciones. En este caso sí que debemos comprobar si nuestra serie es estacionaria, pues en caso contrario deberemos de diferenciar regular y/o estacionalmente. Para que una serie {𝑧𝑡}𝑡≥1 sea estacionaria debe cumplir las siguientes propiedades: 𝜇=𝐸[𝑧𝑡] ∀ 𝑡∈ℤ+ 𝜎2=𝑉𝑎𝑟[𝑧𝑡] ∀ 𝑡∈ℤ+ 𝛾𝑡,𝑡+ℎ=𝐶𝑜𝑣[𝑧𝑡 ,𝑧𝑡+ℎ] ∀ 𝑡,ℎ∈ℤ+ 34 Gráfico 5.6. Esquema general de trabajo de la metodología Box-Jenkins En primer lugar, analizaremos si es necesario realizar transformaciones para estabilizar la varianza. Para ello utilizaremos principalmente el test de Levene, donde se pone a prueba la hipótesis nula de igualdad de varianzas en la población. 35 Gráfico 5.7. Box-Plot variable PGP Tabla 5.8. Test de Levene para homogeneidad de la varianza PGP ANOVA de desviaciones absolutas de las medias de grupo Fuente DF Suma de cuadrados Cuadrado de la media F-Valor Pr > F Year 24 0.2813 0.0117 0.69 0.8558 Error 275 4.6383 0.0169 Teniendo en cuenta el Gráfico 5.7 y la Tabla 5.8, determinamos que no hay evidencias estadísticamente significativas para rechazar la homocedasticidad. Luego los datos son constantes en varianza y no hace falta realizar ninguna transformación. Observamos ahora que la serie no es estacionaria, lo cual se pone de manifiesto en el lento decrecimiento de su ACF, tanto regular como periódica, y en que no podemos rechazar la hipótesis nula de la existencia de raíces unitarias mediante la prueba de Dickey-Fuller. Gráfico 5.8. ACF y PACF variable PGP 36 Tabla 5.9. Pruebas aumentadas de la raíz unidad de Dickey-Fuller variable PGP Tipo Rho Pr < Rho Tau Pr < Tau F Pr > F Zero Mean 0.0249 0.6882 0.03 0.6923 Single Mean -13.0799 0.0617 -2.50 0.1172 3.21 0.2493 Tendencia -36.2181 0.0016 -4.40 0.0025 9.71 0.0010 Por tanto, tomamos la decisión de que debemos realizar primero una diferenciación ordinaria, y luego una diferenciación periódica. Si hubiéramos procedido diferenciando primero estacionalmente, habríamos llegado también a la conclusión de que teníamos que diferenciar después regularmente. Gráfico 5.9. ACF y PACF variable PGP (1,12) Tabla 5.10. Pruebas aumentadas de la raíz unidad de Dickey-Fuller variable PGP (1,12) Tipo Rho Pr < Rho Tau Pr < Tau F Pr > F Zero Mean -419.378 0.0001 -28.55 <.0001 Single Mean -419.368 0.0001 -28.50 <.0001 406.13 0.0010 Tendencia -419.377 0.0001 -28.45 <.0001 404.67 0.0010 Ahora que ya podemos decir que la serie PGP (1,12) es estacionaria, procedemos a estimar el mejor modelo posible que logre identificar la estructura de la serie. Para avanzar en la búsqueda hacia ese modelo ideal, utilizaremos la ACF, PACF, la significatividad de los coeficientes estimados, el estadístico de Box.Ljung y los estadísticos de información. 37 Tabla 5.11. Elección del Mejor Modelo MODELO BoxLjung ¿Son significativos todos los coeficientes? SBC ¿Es válido el modelo? PASO 1. MODELO DE PARTIDA 𝑨𝑹𝑰𝑴𝑨(𝟎,𝟏,𝟎)(𝟎,𝟏,𝟎)𝟏𝟐 𝑨𝑹𝑰𝑴𝑨(𝟎,𝟏,𝟎)(𝟎,𝟏,𝟎)𝟏𝟐 <.0001 SI -607.134 NO 𝑨𝑹𝑰𝑴𝑨(𝟏,𝟏,𝟎)(𝟎,𝟏,𝟎)𝟏𝟐 <.0001 SI -671.506 NO 𝑨𝑹𝑰𝑴𝑨(𝟎,𝟏,𝟏)(𝟎,𝟏,𝟎)𝟏𝟐 <.0001 SI -657.04 NO 𝑨𝑹𝑰𝑴𝑨(𝟎,𝟏,𝟎)(𝟏,𝟏,𝟎)𝟏𝟐 <.0001 SI -669.244 NO 𝑨𝑹𝑰𝑴𝑨(𝟎,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 <.0001 SI -695.577 NO PASO 2. MODELO DE PARTIDA 𝑨𝑹𝑰𝑴𝑨(𝟎,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 𝑨𝑹𝑰𝑴𝑨(𝟏,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 <.0001 SI -733.635 NO 𝑨𝑹𝑰𝑴𝑨(𝟎,𝟏,𝟏)(𝟎,𝟏,𝟏)𝟏𝟐 <.0001 NO -701.087 NO 𝑨𝑹𝑰𝑴𝑨(𝟎,𝟏,𝟎)(𝟏,𝟏,𝟏)𝟏𝟐 <.0001 SI -713.115 NO PASO 3. MODELO DE PARTIDA 𝑨𝑹𝑰𝑴𝑨(𝟏,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 𝑨𝑹𝑰𝑴𝑨(𝟐,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 0.0005 SI -738.519 NO … … … … … PASO 4. MODELO DE PARTIDA 𝑨𝑹𝑰𝑴𝑨(𝟐,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 𝑨𝑹𝑰𝑴𝑨(𝟑,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 0.0030 SI -738.592 NO … … … … … PASO 5. MODELO DE PARTIDA 𝑨𝑹𝑰𝑴𝑨(𝟑,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 𝑨𝑹𝑰𝑴𝑨(𝟒,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 0.0316 SI -739.256 NO … … … … … PASO 6. MODELO DE PARTIDA 𝑨𝑹𝑰𝑴𝑨(𝟒,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 𝑨𝑹𝑰𝑴𝑨(𝟓,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 0.2876 SI -744.263 SI … … … … … PASO 7. MODELO DE PARTIDA 𝑨𝑹𝑰𝑴𝑨(𝟓,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 𝑨𝑹𝑰𝑴𝑨(𝟔,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 0.7103 SI -748.083 SI … … … … … PASO 8. MODELO DE PARTIDA 𝑨𝑹𝑰𝑴𝑨(𝟔,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 𝑨𝑹𝑰𝑴𝑨(𝟕,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 0.9158 SI -749.69 SI 𝑨𝑹𝑰𝑴𝑨(𝟔,𝟏,𝟏)(𝟎,𝟏,𝟏)𝟏𝟐 0.6675 NO -743.176 NO 𝑨𝑹𝑰𝑴𝑨(𝟔,𝟏,𝟎)(𝟏,𝟏,𝟏)𝟏𝟐 0.6691 NO -742.424 NO PASO 9. MODELO DE PARTIDA 𝑨𝑹𝑰𝑴𝑨(𝟕,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 𝑨𝑹𝑰𝑴𝑨(𝟖,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 0.9039 NO -746.079 NO 𝑨𝑹𝑰𝑴𝑨(𝟕,𝟏,𝟏)(𝟎,𝟏,𝟏)𝟏𝟐 0.8702 NO -745.088 NO 𝑨𝑹𝑰𝑴𝑨(𝟕,𝟏,𝟎)(𝟏,𝟏,𝟏)𝟏𝟐 0.9093 NO -744.103 NO PASO 10. MODELO FINAL 𝑨𝑹𝑰𝑴𝑨(𝟕,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 A lo largo de este proceso iterativo determinamos que el mejor candidato para modelizar nuestra serie es el 𝐴𝑅𝐼𝑀𝐴(7,1,0)(0,1,1)12. A continuación, se muestra la información asociada a este modelo. 38 Tabla 5.12. 𝑨𝑹𝑰𝑴𝑨(𝟕,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 Parámetro Estimador Error estándar Valor t Aprox Pr > |t| Retardo MU -0.0000551 0.0023473 -0.02 0.9813 0 MA1,1 0.63297 0.05053 12.53 <.0001 12 AR1,1 -0.53578 0.05962 -8.99 <.0001 1 AR1,2 -0.10337 0.06629 -1.56 0.1201 2 AR1,3 0.12539 0.06410 1.96 0.0514 3 AR1,4 0.20318 0.06350 3.20 0.0015 4 AR1,5 0.29959 0.06448 4.65 <.0001 5 AR1,6 0.26517 0.06676 3.97 <.0001 6 AR1,7 0.16100 0.06040 2.67 0.0081 7 Tabla 5.13. Comprobación de autocorrelación de residuales (Box-Ljung) Para retardo Chi-cuadrado DF Pr > ChiSq 12 4.41 4 0.3533 18 6.79 10 0.7453 24 10.46 16 0.8415 30 12.45 22 0.9473 36 17.37 28 0.9409 42 23.33 34 0.9158 Tabla 5.14. Estadísticas de ajuste para la variable PGP Error Std Estimación 0.060942 AIC -782.625 SBC -749.69 Número de residuales 287 Se observa que los parámetros del modelo tienen un p-valor asociado muy bajo (salvo la constante que no importa si es o no estadísticamente significativa); sus residuos son normales e incorrelados; y sus predicciones se acercan mucho a los datos reales. Por tanto, en este caso también concluimos que el modelo 𝐴𝑅𝐼𝑀𝐴(7,1,0)(0,1,1)12 es adecuado para estimar el porcentaje de gasto del PIB en pensiones. Nuestro modelo queda definido matemáticamente como: 39 (1+0.53578𝐿+0.10337𝐿2−0.12539𝐿3−0.20318𝐿4−0.29959𝐿5−0.26517𝐿6 −0.1600𝐿7)(1−𝐿12)(1−𝐿)𝑧𝑡=−0.00006+(1−0.63297𝐿12)𝜖𝑡 Gráfico 5.10. Residuos 𝑨𝑹𝑰𝑴𝑨(𝟕,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 Gráfico 5.11. Predicciones 𝑨𝑹𝑰𝑴𝑨(𝟕,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 40 Pasemos ahora a cambiar de paradigma, para adentrarnos en la metodología multivariante. El primer punto a tratar será la reducción del número de variables. En nuestro caso partimos de las siguientes series: Tabla 5.15. Número de Variables Series Número de Variables Descripción Afiliados 1 Número de afiliados a la Seguridad Social PGP 1 Porcentaje del PIB destinado a pensiones Inmigración 100 Flujo de inmigrantes por edad Mortalidad 200 Tasa de mortalidad por edad y sexo Población 172 Población por edad y sexo Debido a que muchas de estas series están muy correlacionadas, procederemos a realizar una reducción mediante componentes principales. El ACP se hará en tres fases independientes: una para las series de inmigración, otra para las de mortalidad y una última para las de población. En el caso de las series de inmigración, vemos que al analizar los autovalores debemos de reducir a dos componentes principales, ya que con ello conseguimos explicar más del 90% de la variabilidad de nuestros datos. Tabla 5.16. Serie Inmigración - Autovalores de la matriz de correlación Autovalor Diferencia Proporción Acumulada 1 85.6728872 74.0499011 0.8482 0.8482 2 11.6229861 10.5404390 0.1151 0.9633 3 1.0825471 0.5065657 0.0107 0.9740 Gráfico 5.12. ACP Serie de Inmigración 41 Gráfico 5.13. Patrones Componentes Inmigración Las representaciones gráficas nos ayudan a entender como están recogidas nuestras variables iniciales en las nuevas componentes. Por lo que podríamos decir que, en general, la primera Componente toma valores cercanos a uno cuando son personas menores de 65 años y valores inferiores a medida que aumenta su edad. La segunda Componente toma valores negativos hasta los 60 años aproximadamente (con el mínimo cercano a los 20 años), para luego crecer rápidamente. Procediendo de manera similar estipulamos que la serie de mortalidad puede ser reducida a tres componentes principales y la serie de población a cuatro componentes principales. En ambos casos conseguimos explicar más del 90% de la variabilidad de nuestros datos. Tabla 5.17. Serie Mortalidad - Autovalores de la matriz de correlación Autovalor Diferencia Proporción Acumulada 1 169.999371 162.356933 0.8416 0.8416 2 7.642438 3.098831 0.0378 0.8794 3 4.543607 1.884282 0.0225 0.9019 4 2.659325 0.495731 0.0132 0.9151 48 Tabla 5.22. Test de Granger-Causality Wald Test DF Chi-cuadrado Pr > ChiSq 1 20 36.88 0.0121 2 2 4.62 0.0990 3 8 16.84 0.0318 4 6 5.72 0.4549 5 4 10.19 0.0373 6 40 71.37 0.0017 El resultado muestra que se puede aceptar que todas las variables intervienen directamente o a través de otras variables en la variable PGP y, por lo tanto, las 11 variables deben estar en el modelo. Ahora calculamos los parámetros del modelo 𝑉𝐴𝑅(2). El principal problema de este modelo es que tiene una gran cantidad de coeficientes y que muchos de ellos no son estadísticamente significativos. Por eso procedemos a ir eliminando coeficientes de manera iterativa hasta quedarnos con un modelo con menos parámetros, en el que todos los coeficientes sean en general más significativos. Tabla 5.23. Estimadores del parámetro del modelo 𝑽𝑨𝑹(𝟐) Parámetro Estimador Error estándar Valor t Pr > |t| Variable CONST1 0.00099 0.00590 0.17 0.8670 1 AR1_1_1 -0.60592 0.05810 -10.43 0.0001 PGP(t-1) AR1_1_7 -0.14524 0.10466 -1.39 0.1664 MortCP1(t-1) … … … .. … … AR2_11_10 -0.13126 0.02101 -6.25 0.0001 InmiCP1(t-2) AR2_11_11 -0.82987 0.03338 -24.86 0.0001 InmiCP2(t-2) Ya solo queda predecir y comprobar los estadísticos de información asociados al modelo. Tabla 5.24. Criterios de información 𝑽𝑨𝑹(𝟐) AICC -11533.8 HQC -13505.2 AIC -13834.1 SBC -13014.7 FPEC 1.99E-27 49 Gráfico 5.19. Predicciones 𝑽𝑨𝑹(𝟐) Debido a la cantidad de variables del modelo, no vamos a comprobar si todos los residuos cumplen con los supuestos de normalidad y autocorrelación. En este caso nos valdremos únicamente de las predicciones para estipular si el modelo es o no válido. Como vemos que las capacidades de predicción del modelo son buenas, pasamos a explicar brevemente algunas de las interacciones entre las variables de nuestro modelo. Utilizaremos los impulsos para poder explicar de manera visual cómo influyen unas variables sobre otras. Los impulsos representan la respuesta que se produce en una variable cuando en la otra se incrementa una unidad. Si la gráfica se acerca al punto de equilibrio o regresa a la línea de equilibrio original (cero), significa que la respuesta de una variable al impulso de otra variable desaparece, de modo que no tiene un efecto permanente en el tiempo. Gráfico 5.20. Respuesta a Impulso en NAFIL de PGP 50 Gráfico 5.21. Respuesta a Impulso en PopCP de PGP 51 Gráfico 5.22. Respuesta a Impulso en MortCP de PGP Gráfico 5.23. Respuesta a Impulso en PGP de PGP 52 Gráfico 5.24. Respuesta a Impulso en InmiCP de PGP Un ejemplo concreto de la interpretación de estos resultados es el siguiente: teniendo en cuenta que un valor cercano a 1 en InmiCP1 se asocia a un inmigrante en edad de trabajar, interpretaremos que la llegada de inmigración joven produce una disminución del porcentaje de gasto del PIB en pensiones. Por otro lado, un valor cercano a 1 en CP2 se asocia a un inmigrante mayor de 60 años, luego la llegada de inmigración de más de 60 años produce un aumento del porcentaje de gasto del PIB en pensiones. 4.3. Comparativa y Selección del Mejor Modelo El principal objetivo de nuestro estudio es pronosticar el comportamiento futuro del porcentaje de gasto del PIB que se dedica a pensiones, luego para determinar qué modelo es el elegido nos guiaremos principalmente por la calidad de las predicciones. Los estadísticos más comunes para comparar series temporales son el MAE (Mean Absolute Error o Error Absoluto Medio) y el RSME (Root Mean Squared Error o Error Cuadrático Medio). Los modelos serán mejores cuanto menor sea su MAE o su RMSE. Matemáticamente se definen como: 𝑅𝑀𝑆𝐸=√1𝑁∑(𝑦𝑖−𝑦𝑖 )2 𝑁 𝑖=1 𝑀𝐴𝐸=1𝑁∑|𝑦𝑖−𝑦𝑖 | 𝑁 𝑖=1 53 Tabla 5.25. Métricas sobre el conjunto Test Métrica H-W Aditivo H-W Multiplicativo ARIMA VAR MAE 0.0257795 0.0278535 0.0202728 0.0463431 RSME 0.3665130 0.3741546 0.3473594 0.4003582 En el Gráfico 5.25 vemos que para las primeras observaciones el modelo VAR es el que mejor se ajusta, pero a largo plazo pierde su capacidad pronosticadora. Por el contrario, los modelos ARIMA y Holt-Winters son un poco peores en el corto plazo, pero mucho más ajustados a la realidad en el largo plazo. Luego teniendo en cuenta la capacidad pronosticadora a largo plazo escogeremos los modelos de Holt-Winters o el ARIMA. Gráfico 5.25. Comparativa de Predicciones Otro factor determinante a la hora de decidir el modelo a escoger es que para la variable PGP tenemos datos hasta mediados de 2020, mientras que los datos de flujo de inmigración o población solo están disponibles hasta diciembre de 2018. Por tanto, teniendo en cuenta la disponibilidad de datos más actuales con los que hacer las predicciones escogeremos los modelos de Holt-Winters o el ARIMA. Por último, hay que tener en cuenta que uno de los objetivos secundarios es poder predecir cual será el impacto de la crisis del COVID-19 en el sistema de pensiones. Esto solo se puede llevar a cabo mediante el uso de variables de intervención. Los modelos de alisado exponencial no están implementados para el uso de variables de intervención, pero los métodos ARIMA y VAR si están implementados para ello. Teniendo en cuenta todos los factores anteriores, determinamos que el mejor modelo para realizar predicciones en nuestro estudio es el modelo ARIMA. 54 4.4. Predicción Ahora calcularemos el modelo 𝐴𝑅𝐼𝑀𝐴(7,1,0)(0,1,1)12 con todos los datos disponibles y variable de intervención para la crisis del COVID-19. Como actualmente desconocemos como va a ser la duración e intensidad de la crisis, vamos a plantear un escenario hipotético. Este escenario se basa en la información publicada en los últimos meses sobre cuál es el avance más probable de la pandemia. Los factores que se han considerado para elaborar este escenario son: • Hasta el presente, la parte más dura de la crisis fue entre marzo y mayo de 2020. • La mayoría de los sectores económicos y sociales continúan sufriendo los efectos de la crisis, aunque de manera menos intensa. • En general los ciudadanos y las empresas están más concienciados y preparados para hacer frente a nuevos repuntes, por lo que de haberlos no tendrán la misma intensidad que la primera oleada. • El desarrollo de tratamientos y vacunas se prevé que empiece a dar sus frutos a lo largo del año 2021. Por lo tanto, nuestro escenario determinará de 0 a 10 el nivel de intensidad de la crisis en los próximos años. Como se observa el pico de intensidad de la crisis se produce en los primeros meses de 2020 y va descendiendo de manera progresiva hasta que sus efectos desaparecen a lo largo del 2022. Gráfico 5.26. Intensidad de la Crisis COVID-19 55 Para crear este escenario hemos asignado a cada uno de los 120 meses (10 años) que queremos pronosticar un valor 𝑥 consecutivo del intervalo de 0 a 1, asegurándonos de que ningún mes tomará el valor 0 o 1. Este proceso se ha conseguido asignando a enero de 2020 el valor de 𝑖=1, a febrero de 2020 el valor de 𝑖=2 y así sucesivamente. Y luego aplicando la función: 𝑥=𝑖/121 Finalmente utilizamos el valor obtenido para calcular la intensidad de la crisis utilizando la función de densidad de una 𝐵𝑒𝑡𝑎(1.5,20), es decir, 𝑁𝑖𝑣𝑒𝑙 𝑑𝑒 𝐼𝑛𝑡𝑒𝑛𝑠𝑖𝑑𝑎𝑑𝑡= { 0 𝑠𝑖 𝑥<0 Γ(1.5+20) Γ(1.5)Γ(20)𝑥1.5−1(1−𝑥)20−1 𝑠𝑖 𝑥∈(0,1) 0 𝑠𝑖 𝑥>1 siendo Γ la función gamma de Euler. A continuación, se muestran los datos relativos a los residuos del modelo con variable de intervención para el COVID-19 y las predicciones obtenidas. Tabla 5.26. Comprobación de autocorrelación de residuales (Box-Ljung) Para retardo Chi-cuadrado DF Pr > ChiSq 6 . 0 . 12 4.50 4 0.3426 18 6.92 10 0.7327 24 10.67 16 0.8296 30 12.69 22 0.9414 36 17.70 28 0.9335 42 23.77 34 0.9049 56 Gráfico 5.27. Residuos 𝑨𝑹𝑰𝑴𝑨(𝟕,𝟏,𝟎)(𝟎,𝟏,𝟏)𝟏𝟐 con variable de Intervención Gráfico 5.28. Predicciones del Gasto en Pensiones 2020-2030 (Datos hasta Junio de 2020 y con variable de Intervención COVID-19) 57 Vemos que el modelo ARIMA con variable de intervención cumple con los requisitos necesarios para ser un modelo válido. Evidentemente ahora es imposible evaluar la calidad de las predicciones, pues son sucesos que todavía no han ocurrido. Lo que si podemos valorar es que los intervalos de confianza para el modelo son bastante estrechos para los 5 primeros años. Al ser unas predicciones a largo plazo la estimación puntual no es de gran importancia, ya que un intervalo de tiempo tan amplio contendrá muchos errores. Por eso vamos a quedarnos única y exclusivamente con la tendencia de la serie. Gráfico 5.29. Comparativa de la Tendencia del Gasto en Pensiones 2020-2030 Nuestro escenario recoge una crecida del porcentaje de PIB destinado pensiones, que se plasma en un aumento en la tendencia muy brusco durante el primer año para luego continuar su subida de forma menos acentuada.