scieee AI-readable full text Open interactive document viewer

Caracterización de la intensidad de uso del comercio electrónico en España

Sainz-Trápaga Devoto, Florencia

Abstract

En este trabajo se pretende caracterizar la intensidad de uso del comercio electrónico en España. Para ello, se utilizará la “Encuesta sobre Equipamiento y Uso de Tecnologías de Información y Comunicación en los Hogares (TIC-H)” elaborada por el INE en 2019. Se trabajará con dos modelos Probit Ordenado para analizar qué variables resultan más significativas para cada una de las variables respuesta. Se observará, a grandes rasgos, que cuanto mayor sea el nivel de estudios, el nivel de conocimientos informáticos, la frecuencia de uso de Internet, el nivel de ingresos y la confianza en Internet, mayor será la probabilidad de comprar más frecuentemente y por más valor.

Full text

MEMORIA DEL TRABAJO DE FIN DE GRADO CARACTERIZACIÓN DE LA INTENSIDAD DE USO DEL COMERCIO ELECTRÓNICO EN ESPAÑA CHARACTERIZATION OF THE INTENSITY OF USE OF ECOMMERCE USER IN SPAIN Autora: Florencia Sainz-Trápaga Devoto (51113945-X) Tutor: Cipriano Quirós Romero Grado en ESTADÍSTICA APLICADA FACULTAD DE ESTUDIOS ESTADÍSTICOS UNIVERSIDAD COMPLUTENSE DE MADRID Curso Académico 2020/2021 FACULTAD DE ESTUDIOS ESTADÍSTICOS UNIVERSIDAD COMPLUTENSE DE MADRID 1 RESUMEN En este trabajo se pretende caracterizar la intensidad de uso del comercio electrónico en España. Para ello, se utilizará la “Encuesta sobre Equipamiento y Uso de Tecnologías de Información y Comunicación en los Hogares (TIC-H)” elaborada por el INE en 2019. Se trabajará con dos modelos Probit Ordenado para analizar qué variables resultan más significativas para cada una de las variables respuesta. Se observará, a grandes rasgos, que cuanto mayor sea el nivel de estudios, el nivel de conocimientos informáticos, la frecuencia de uso de Internet, el nivel de ingresos y la confianza en Internet, mayor será la probabilidad de comprar más frecuentemente y por más valor. Palabras Clave: Comercio electrónico, Internet, Usuario, Consumidor, Comprador, Probit Ordenado, Regresión, Caracterización. ABSTRACT In this paper, the intensity of use of e-commerce in Spain is intended to be characterized. In order to do so, the “Survey on Equipment and Use of Information and Communication Technologies in Households (TIC-H)” made by the INE in 2019 will be used. Two Ordered Probit models will be developed to analyze which variables are more significant for each response variable. In general, it will be found that the higher the level of studies, computer knowledge, Internet-use frequency, level of income and trust on the Internet, the higher the likelihood to purchase more frequently and more expensively. Key Words: E-commerce, Internet, User, Buyer, Consumer, Ordered Probit, Regression, Characterization 2 3 ÍNDICE 1. INTRODUCCIÓN ....................................................................................... 7 1.1. Introducción y motivaciones ........................................................ 7 1.2. Revisión de literatura y antecedentes ......................................... 13 1.3. Objetivos .................................................................................... 16 2. METODOLOGÍA ....................................................................................... 19 2.1. Obtención de datos ..................................................................... 19 2.2. Modelo Probit Ordenado ............................................................ 21 2.3. Recodificación y construcción de variables ................................. 24 2.3.1. Variable respuesta Modelo 1 .................................................. 25 2.3.2. Variable respuesta Modelo 2 .................................................. 25 2.3.3. Variables explicativas recodificadas ....................................... 26 2.3.4. Variables explicativas creadas ................................................ 28 2.3.5. Análisis descriptivo de las variables ....................................... 29 2.4. Tratamiento de los datos perdidos o “missing” ........................... 33 3. RESULTADOS ........................................................................................... 35 3.1. Modelo 1 ..................................................................................... 35 3.1.1. Estimación de los coeficientes y puntos de corte .................... 35 3.1.2. Estimación de los efectos marginales ...................................... 41 3.1.3. Probabilidades de predicción .................................................. 44 3.2. Modelo 2 ..................................................................................... 45 3.2.1. Estimación de los coeficientes y puntos de corte .................... 45 4 3.2.2. Estimación de los efectos marginales ...................................... 50 3.2.3. Probabilidades de predicción .................................................. 53 3.3. Otros resultados .......................................................................... 53 4. CONCLUSIONES ....................................................................................... 55 5. BIBLIOGRAFÍA ......................................................................................... 59 6. ANEXOS .................................................................................................... 63 6.1. Anexo I: Código en RStudio ....................................................... 63 6.2. Anexo II: Salidas de RStudio ...................................................... 67 ÍNDICE DE GRÁFICOS Gráfico 1. Evolución del Volumen de Negocio del Comercio Electrónico en España (en millones de €) ............................................................................................... 8 Gráfico 2. Evolución de la Aportación de la Economía Digital al PIB en España (%) ..................................................................................................................... 9 Gráfico 3. Volumen de Negocio del Comercio Electrónico en España Segmentado Geográficamente ................................................................................................. 9 Gráfico 4. Ventas Online Minoristas sobre el Total (%) .................................... 10 Gráfico 5. Distribución de Compradores Online en España en 2019 (%) ........... 11 Gráfico 6. Motivos Frecuentes por los que No Comprar por Internet ................ 12 Gráfico 7. Ejemplo del Modelo Probit Ordenado ............................................... 23 Gráfico 8. Total de Miembros del Hogar ........................................................... 32 Gráfico 9. Nivel de Conocimientos Informáticos ................................................ 32 5 Gráfico 10. Bienes y Servicios Comprados por Internet ..................................... 54 ÍNDICE DE TABLAS Tabla 1. Frecuencias Relativas de las Tareas Informáticas................................ 29 Tabla 2. Resumen Descriptivo de las Variables Respuesta ................................ 30 Tabla 3. Resumen Descriptivo Variables Explicativas Cualitativas................... 30 Tabla 4: Análisis Descriptivo Variables Explicativas Cuantitativas .................. 33 Tabla 5. Estimaciones Iniciales de los Coeficientes del Modelo 1 ....................... 36 Tabla 6. Estimaciones de los Coeficientes del Modelo 1 Modificado .................. 38 Tabla 7. Estimaciones de los Coeficientes del Modelo 1 Final ........................... 39 Tabla 8. Estimaciones de los Puntos de Corte del Modelo 1 ............................. 40 Tabla 9. Estimaciones de los Efectos Marginales ............................................... 41 Tabla 10. Probabilidades de Predicción Modelo 1 ............................................. 44 Tabla 11. Estimaciones Iniciales de los Coeficientes del Modelo 2 ..................... 45 Tabla 12. Estimaciones de los Coeficientes del Modelo 2 Modificado ................ 46 Tabla 13. Estimaciones de los Coeficientes del Modelo 2 Final ......................... 47 Tabla 14. Estimaciones de los Puntos de Corte del Modelo 2 ........................... 49 Tabla 15. Estimaciones de los Efectos Marginales ............................................. 50 Tabla 16. Probabilidades de Predicción Modelo 2 ............................................. 53 6 7 1. INTRODUCCIÓN 1.1. Introducción y motivaciones Según la Comisión de Comunidades Europeas (1997): “El comercio electrónico consiste en realizar electrónicamente transacciones comerciales; es cualquier actividad en la que las empresas y consumidores interactúan y hacen negocios entre sí o con las administraciones por medios electrónicos”. Existen varios tipos de comercio electrónico, aunque en lo que respecta a este estudio nos vamos a centrar en el modelo B2C (Business to consumer), que consiste en la compraventa de bienes y servicios a través de Internet entre empresas productoras o distribuidoras y el usuario. (ONTSI, 2019). Este tipo de comercio electrónico aparece en la década de los 90, momento en el que en los hogares empieza a haber ordenadores con conexión a la red y se crean páginas web que son utilizadas para comercializar. Esto evoluciona rápidamente con la aparición de empresas como Amazon en 1995 que posteriormente impulsan este fenómeno. A medida que se abaratan los costes de la red y del equipamiento necesario para participar del comercio electrónico y, de manera más evidente, con la aparición de “smartphones”, “tablets” y a través del desarrollo de aplicaciones informáticas (Apps) cada vez ha sido más fácil que los hogares tengan acceso a este tipo de comercio. Es por todo lo mencionado que, en 2019, se registró que el 80,9% de las viviendas en España tienen algún tipo de ordenador y que el 91,4% tiene acceso a Internet. (INE, 2019). Debido a este rápido y creciente desarrollo, el comercio electrónico es un tema de gran interés en la actualidad. A continuación, se muestra dicho desarrollo 8 en el Gráfico 1, elaborado por el Observatorio Nacional de las Telecomunicaciones y de la Sociedad de la Información. Gráfico 1. Evolución del Volumen de Negocio del Comercio Electrónico en España (en millones de €) Fuente: El Comercio Electrónico B2C en España 2019 (ONTSI). Se puede apreciar cómo en el año 2019 en España se registró un volumen de negocio en el comercio electrónico B2C de 50.382 millones de €, lo que supone un incremento de un 21,4% con respecto a la cifra de 2018. Esta tendencia creciente, hace que el comercio electrónico vaya ganando cada vez más importancia en la evolución de la economía nacional. En el Gráfico 2, elaborado para el informe “Economía Digital en España” de BCG y Adigital en 2019, se observa cómo la aportación al PIB de la economía digital en España ha crecido en 1,6 puntos porcentuales de 2009 a 2019. 15 Valarezo, A. et al. (2018), efectuaron un análisis de regresión para estudiar las variables que contribuyen a la decisión de comprar por Internet. A través de su estudio, llegaron a la conclusión de que ser hombre, tener un alto nivel de estudios y gran habilidad informática aumenta la probabilidad de participar del comercio electrónico. Garín-Muñoz, T. et al. (2019), llevaron a cabo técnicas de regresión logística para determinar qué factores influyen en que una persona utilice los servicios de “e-commerce”, “e-banking” y de “e-government”. Encontraron que tener menor edad, el mayor nivel de estudios y mayor nivel de conocimientos informáticos aumenta la probabilidad de usar cualquiera de los tres servicios. Por otro lado, observaron que el sexo y el nivel de ingresos son significativos sólo en cuanto a “e-commerce” y a “e-banking”; y que, el nivel de confianza en Internet sólo afecta significativamente al comercio electrónico. Ruiz-Rodríguez, F. et al. (2017), analizaron el grado de adopción de las TICs y del comercio electrónico por las empresas en las distintas regiones españolas, haciendo una comparación con determinados países europeos. Utilizaron un análisis factorial para la construcción del índice sintético “Digital Development” y un análisis Cluster para la comparación entre los distintos territorios. Encontraron que España se encuentra en un nivel alto del ranking de países europeos en cuanto al índice se refiere, teniendo un nivel superior a la media en el uso de las TICs para el acceso a Internet y la interacción con las administraciones públicas; y, teniendo nivel inferior a la media en la integración de las TICs en el comercio electrónico. Zareef, M. y Gurvirender, T. (2017), estudiaron el impacto de la cultura en la relación entre la privacidad de la información y la adopción del comercio 16 electrónico en distintos países desarrollados y en vías de desarrollo. Obtuvieron que la percepción de la seguridad en Internet, la aceptación del “e-coommerce”, el nivel de preocupación por la privacidad y los intereses personales son los factores más influyentes a la hora de decidir sobre transacciones en línea; y que, a su vez, estos factores son influenciados por la cultura nacional de cada uno de los países investigados. Por último, Laconi, S. et al. (2018), investigaron la relación entre el uso problemático de Internet y el tiempo empleado en línea, las actividades en línea y psicopatologías, teniendo en cuenta diferencias de género y de cultura en nueve países europeos. Concluyeron que el uso problemático de Internet está fuertemente relacionado con un mayor uso de Internet en fines de semana, síntomas obsesivos-compulsivos, hostilidad, paranoia y ansiedad. Además, observaron que el uso problemático de Internet está presente con mayor frecuencia en mujeres que en hombres. 1.3. Objetivos Es por todo lo explicado anteriormente que se dispone a realizar un modelo de regresión ordinal con datos obtenidos a través de la “Encuesta sobre Equipamiento y Uso de Tecnologías de Información y Comunicación en los Hogares (TIC-H)” realizada por el Instituto Nacional de Estadística (INE) en 2019. El principal objetivo del presente estudio es intentar llevar a cabo, de manera sencilla, una caracterización de la intensidad de uso del comercio electrónico en España en la actualidad, con el fin de observar qué factores son 17 determinantes para un comprador por Internet a la hora de tomar decisiones con respecto a la intensidad con la que usa este tipo de comercio. Se pretende determinar cuáles son las características que diferencian a un usuario que usa internet para comprar en mayor medida, frente a uno que lo usa ocasionalmente. Dicha intensidad se va a medir atendiendo a dos criterios distintos: en primer lugar, la frecuencia de compra; y, en segundo lugar, el valor de las compras realizadas. De manera que una persona que usa más el comercio electrónico que otra, será aquélla que haga un mayor número de compras, si se analiza desde el punto de vista de la frecuencia de compra, o bien, será aquélla cuyo gasto sea mayor, si se analiza desde el punto de vista del valor de las compras. Como objetivo secundario, se llevará a cabo un breve análisis descriptivo con el fin de obtener información sobre cuáles son los bienes o servicios que más se adquieren a través de Internet actualmente en España. 18 19 2. METODOLOGÍA Para poder alcanzar los objetivos anteriormente descritos, el estudio se ha llevado a cabo con el apoyo de varios programas y herramientas. Se ha utilizado el software estadístico R con la interfaz RStudio para, entre otras cosas, leer los datos, recodificar las variables, hacer todos los cálculos necesarios para el análisis y construir los gráficos. De manera complementaria, las tablas que se muestran a lo largo de este informe han sido elaboradas con Microsoft Excel. 2.1. Obtención de datos La base de datos utilizada en este estudio es la referente a la “Encuesta sobre Equipamiento y Uso de Tecnologías de Información y Comunicación en los Hogares (TIC-H)” del año 2019. Los resultados de dicha encuesta se encuentran en la página web del Instituto Nacional de Estadística (INE), dentro del bloque de “Ciencia y tecnología” y en el apartado de “Nuevas tecnologías de la información y de la comunicación”. La encuesta mencionada se lleva a cabo de manera personal o telefónicamente, con periodicidad anual en los meses de febrero a mayo y se efectúa a viviendas familiares principales dentro del territorio nacional. En 2019 se realizó esta encuesta en 2.500 secciones censales y en alrededor de 25.000 viviendas. Para ello, se utilizó un tipo de muestreo trietápico con estratificación de las unidades de la primera etapa. Siendo las unidades de esta primera etapa las secciones censales; las viviendas familiares, las de la segunda; y, las de la tercera, las personas residentes de la vivienda de más de 15 años. 20 En estas viviendas, se eligió aleatoriamente a uno de los residentes de 16 años o más para que respondiera a las preguntas del cuestionario. Sin embargo, en todas las viviendas en las que los hubiese, se hicieron preguntas referentes a los menores residentes de 10 a 15 años. Este cuestionario consta de once bloques clasificados en tres apartados: el primero recoge información TIC sobre la vivienda; el segundo, información TIC sobre menores (de 10 a 15 años) residentes en la vivienda; y, por último, información TIC sobre la persona seleccionada en la vivienda. Este último apartado será el que tenga mayor interés para el objetivo de este estudio. De esta manera, tras obtener los datos, se cuenta con una base de datos que consta de 17.196 observaciones y 252 variables. Inmediatamente se reducirá este volumen de datos ya que se eliminarán aquellas observaciones correspondientes con las personas encuestadas que contestaron “No” a las preguntas del cuestionario 11.b “¿Ha usado Internet alguna vez?” y 11.c “¿Ha usado Internet en alguna otra ocasión antes de cumplimentar este cuestionario?”. Tras esta reducción, la base de datos cuenta con 13.388 observaciones, un 77,86% de las observaciones iniciales. Además, se va a reducir el número de observaciones a aquellos individuos que hayan comprado por Internet alguna vez. Esto se debe a que el objetivo de este estudio es caracterizar la intensidad de uso del comercio electrónico con el fin de analizar qué factores diferencian a los distintos usuarios de éste, agrupados según la intensidad con la que hacen uso del “e-commerce”. De manera que, no se tendrá en cuenta a aquellas personas que no hayan utilizado nunca Internet para realizar alguna compra ya que no son de interés para alcanzar el objetivo del presente trabajo. 21 Finalmente, tras esta última reducción, la base de datos con la que se trabajará desde este punto en adelante cuenta con 8.374 observaciones. 2.2. Modelo Probit Ordenado Para alcanzar el objetivo de este estudio se va a utilizar un modelo Probit Ordenado. A continuación, se presenta una breve explicación del mismo. El Probit Ordenado es un modelo de regresión que es una generalización del modelo Probit Binomial en el que la variable respuesta, en lugar de ser binaria, tiene tres categorías o más (preferiblemente, menos de siete). Estas categorías están representadas con valores finitos y discretos que contienen información ordinal. Esto quiere decir que la variable dependiente o variable respuesta tiene varias categorías ordenables. Estas categorías, aunque estén codificadas como 0, 1, 2, etc., son “rankings”, lo que significa que los números en sí no tienen sentido. Esto se debe a que la diferencia que existe entre la categoría codificada como 0 y la codificada como 1, no tiene por qué ser la misma que la diferencia existente entre la 1 y la 2. En este tipo de modelo, lo primero que se necesita es una variable respuesta latente o no observable, de la cual lo único que se puede conocer es cuándo cambia de categoría. Por ejemplo, en una encuesta de opinión en la que haya que responder a una afirmación utilizando escala de Likert, se puede observar los niveles seleccionados, no lo que opina realmente el individuo, esa opinión no 22 observable sería la variable latente y el nivel seleccionado por el individuo sería la variable respuesta ordinal observable. De manera que, se considera el modelo de variable latente ordenada que puede tomar valores {0,1,2,…,𝐽}, sin constante y con 𝐾 variables explicativas. 𝑦𝑖∗=𝛽1∙𝑥1+𝛽2∙𝑥2+⋯+𝛽𝑘∙𝑥𝑘+𝜀𝑖 donde 𝜀𝑖~𝑁(𝜇=0,𝜎2=1) Lo primero que se llevará a cabo es la estimación de los coeficientes {𝛽1,𝛽2,…,𝛽𝑘} para que, calculado según la fórmula que aparece previamente, cada observación 𝑖 cuente con un valor de la variable latente no observable 𝑦∗. A continuación, se definen 𝐽 puntos de corte {𝛾1,𝛾2,…,𝛾𝑗} que sirven para asignar a cada observación con un valor de la variable latente 𝑦∗, una de las categorías de la variable respuesta ordinal observable 𝑦. De manera que no se observa 𝑦∗, pero sí ciertos valores discretos que responden a la regla que aparece a continuación: 𝑦𝑖=𝑗 si 𝛾𝑗−1<𝑦𝑖∗≤𝛾𝑗 De esta manera, se puede calcular la probabilidad de que la observación 𝑖 pertenezca a la categoría 𝑗 usando la función de densidad de la distribución Normal: 𝑃𝑖𝑗=𝑃(𝑦𝑖=𝑗)=𝑃(𝛾𝑗−1<𝑦𝑖∗≤𝛾𝑗) Se presenta el siguiente gráfico con el objetivo de ilustrar un ejemplo del modelo Probit Ordenado en el que la variable respuesta ordinal observable 𝑦, tiene cuatro categorías. 23 Gráfico 7. Ejemplo del Modelo Probit Ordenado Fuente: Elaboración propia con R. En el Gráfico 7 se observan las probabilidades de predicción para cada una de las cuatro categorías de la variable respuesta (ficticia) 𝑦. Además, se observan los puntos de corte (tipificados) que separan dichas categorías. Las estimaciones necesarias para este tipo de modelo no pueden ser calculadas por el método de Mínimos Cuadrados Ordinarios por no ser la variable dependiente continua, por lo que se estimarán por el método de Máxima Verosimilitud. En este tipo de modelo, los coeficientes {𝛽1,𝛽2,…,𝛽𝑘} a estimar no son fácilmente interpretables, aunque sus signos muestran si la variable latente 𝑦∗ aumenta o disminuye con cada una de las variables regresoras. En consecuencia, coeficientes positivos harán que aumente la probabilidad de pertenecer a categorías más altas de la variable respuesta categórica observable 𝑦. Por el contrario, signos negativos de los coeficientes, harán que aumente la probabilidad de pertenecer a categorías más bajas de ésta. 𝑃(𝑦=0) 𝑃(𝑦=1) 𝑃(𝑦=2) 𝑃(𝑦=3) Ejemplo Modelo Probit Ordenado 24 Para una mejor y más detallada interpretación, se calcularán los efectos marginales. Estos indican en qué proporción aumenta o disminuye la probabilidad de pertenecer a la categoría 𝑗, cuando aumenta la variable explicativa que estemos analizando en una unidad, mientras el resto continúan contantes (“ceteris paribus”). En cuanto a la bondad de ajuste del modelo, al ser no lineal, la interpretación del coeficiente 𝑅2 no es exactamente la habitual, sino que es más compleja. De manera que, para medir el ajuste del modelo, se compararán las probabilidades estimadas por el mismo con las proporciones realmente observadas. Una vez elegido el modelo que se va a utilizar, se definen las variables que van a participar en el mismo. 2.3. Recodificación y construcción de variables El objetivo de este estudio anteriormente mencionado es construir una caracterización de la intensidad de uso del comercio electrónico. Esta caracterización se llevará a cabo atendiendo a distintas variables obtenidas de la “Encuesta sobre Equipamiento y Uso de Tecnologías de Información y Comunicación en los Hogares (TIC-H)” del año 2019 del INE y utilizando un modelo Probit Ordenado, explicado en el apartado anterior. En este estudio se van a plantear dos modelos distintos, ya que, aunque se utilicen las mismas variables explicativas de partida, se cambiará la variable respuesta. 31 Estudiando 8,34% 698 Otros 16,01% 1.341 PNACTO España 91,82% 7.689 Otro país dentro de la UE 2,46% 206 País fuera de la UE 5,72% 479 CONFINT Poco o nada 22,83% 1.912 Bastante 68,50% 5.736 Mucho 8,67% 726 RRSS No 30,86% 2.584 Sí 69,12% 5.788 Missing 0,02% 2 ESTC Soltero/a 39,29% 3.290 Casado/a 48,08% 4.026 Viudo/a 2,84% 238 Separado/a 1,96% 164 Divorciado/a 7,83% 656 FREC_INT Menos de 5 veces por semana 8,89% 744 Diariamente, al menos 5 veces por semana 91,09% 7.628 Missing 0,02% 2 NIVELEST E.S.O. o menor 23,38% 1.958 Grado Medio o BACH 27,23% 2.280 Grado Superior, Estudios Universitarios o mayor 49,39% 4.136 ING_HOG Menos de 900€ 9,83% 823 de 900 a menos de 1.600€ 27,62% 2.313 de 1.600 a menos de 2.500€ 24,59% 20.059 de 2.500 a menos de 3.000€ 9,91% 830 3.000€ o más 14,25% 1.193 NS/NR 13,80% 1.156 Fuente: Elaboración propia con datos del operados con R. Además, se adjuntan dos gráficos con el objetivo de ilustrar la distribución de las dos variables cuantitativas mencionadas anteriormente. La variable que hace referencia al número total de miembros que residen en la vivienda que 32 participa en la encuesta, TOT_MH, aparece representada en el Gráfico 8 a través de un diagrama de barras, ya que es una variable cuantitativa discreta. Gráfico 8. Total de Miembros del Hogar Fuente: Elaboración propia con datos del INE operados con R. Por otro lado, el Gráfico 9 es una representación de la distribución del índice sintético creado que hace referencia al nivel de conocimientos informáticos que tiene la persona encuestada, NIVEL_CI. Esta representación se ha realizado a través de un histograma, ya que es una variable cuantitativa continua. Gráfico 9. Nivel de Conocimientos Informáticos Fuente: Elaboración propia con datos del INE operados con R. Total de Miembros del Hogar Nivel de Conocimientos Informáticos 33 Por último, en la Tabla 4, se presentan algunas medidas estadísticas calculables en las únicas dos variables cuantitativas (TOT_MH y NIVEL_CI), de nuestra selección de variables explicativas: Tabla 4: Análisis Descriptivo Variables Explicativas Cuantitativas Variable Mínimo Primer Cuartil Mediana Media Tercer Cuartil Máximo TOT_MH 1 2 3 2,667 4 10 NIVEL_CI 0 0,494 1,411 1,195 1,885 2,796 Fuente: Elaboración propia con datos del INE operados con R. 2.4. Tratamiento de los datos perdidos o “missing” Los comandos utilizados en el programa R con la interfaz RStudio que se van a utilizar para el cálculo de las estimaciones ignoran por defecto aquellas observaciones que tengan datos perdidos o “missing”. Como la base de datos que se va a utilizar cuenta con un gran número de observaciones, este tratamiento de los valores perdidos no supone un problema para el presente estudio, de manera que no es necesario imputarlos. Bajo estas condiciones, para las estimaciones del Modelo 1 se ha trabajado con 5.366 observaciones; y, para las estimaciones del Modelo 2, con 5.214 observaciones. 34 35 3. RESULTADOS Para intentar responder a los objetivos propuestos, se van a plantear dos modelos de regresión ordinal Probit atendiendo a distintas variables respuesta. En este apartado se presentan los resultados obtenidos para cada uno de los modelos desde su planteamiento inicial hasta llegar, en cada caso, al modelo final. 3.1. Modelo 1 En cuanto al primer modelo, se va a intentar caracterizar la intensidad de uso del comercio electrónico atendiendo al número de compras que el usuario lleva a cabo. De esta manera, la variable respuesta, como ya se indicó con anterioridad, es el número de compras realizadas por motivos particulares en los últimos 3 meses por la persona encuestada (NCOMPRAS). 3.1.1. Estimación de los coeficientes y puntos de corte Para llegar a la variable respuesta, primero se debe plantear la construcción de la variable latente 𝑦∗ en función de las 12 variables explicativas seleccionadas: 𝑦∗ =𝛽1∗𝑆𝐸𝑋𝑂+𝛽2∗𝐸𝐷𝐴𝐷+𝛽3∗𝑆𝐼𝑇_𝐿𝐴𝐵+𝛽4∗𝑃𝑁𝐴𝐶𝑇𝑂+𝛽5∗𝐶𝑂𝑁𝐹𝐼𝑁𝑇 +𝛽6∗𝑅𝑅𝑆𝑆+𝛽7∗𝐸𝑆𝑇𝐶+𝛽8∗𝐹𝑅𝐸𝐶_𝐼𝑁𝑇+𝛽9∗𝑁𝐼𝑉𝐸𝐿𝐸𝑆𝑇+𝛽10 ∗𝐼𝑁𝐺_𝐻𝑂𝐺+𝛽11∗𝑇𝑂𝑇_𝑀𝐻+𝛽12∗𝑁𝐼𝑉𝐸𝐿_𝐶𝐼 El siguiente paso será estimar los coeficientes {𝛽1,𝛽2,…,𝛽12} y eliminar aquellas variables que resulten no significativas. Para saber si son significativas 36 o no, se lleva a cabo el siguiente contraste de hipótesis para cada uno de los coeficientes estimados: {𝐻0: 𝛽𝑘=0 𝐻1: 𝛽𝑘≠0 para todo 𝑘={1,2,…,12} En la Tabla 5 se observan los coeficientes estimados y los resultados para cada uno de los doce contrastes que se han realizado: Tabla 5. Estimaciones Iniciales de los Coeficientes del Modelo 1 Variable Estimación Error Estándar t-valor p-valor IC 2,5% IC 97,5% SEXO -0,023748 0,03164 -0,7505 0,4530 -0,085775 0,038267 EDAD -0,037636 0,02116 -1,7783 0,0754 -0,079122 0,003839 SIT_LAB -0,032784 0,01521 -2,1556 0,0311 -0,062617 -0,002999 PNACTO 0,010463 0,03380 0,3095 0,7569 -0,055958 0,076561 CONFINT 0,145969 0,02964 4,9255 0,0000 0,087903 0,204073 RRSS 0,104874 0,03666 2,8608 0,0042 0,033058 0,176761 ESTC 0,003648 0,01585 0,2302 0,8179 -0,027442 0,034672 FREC_INT 0,367417 0,07307 5,0284 0,0000 0,224942 0,511404 NIVELEST 0,061090 0,02197 2,7808 0,0054 0,018048 0,104164 ING_HOG 0,134319 0,01352 9,9337 0,0000 0,107824 0,160827 TOT_MH -0,019286 0,01369 -1,4084 0,1590 -0,046135 0,007543 NIVEL_CI 0,242619 0,02237 10,8447 0,0000 0,198785 0,288648 Fuente: Elaboración propia con datos del INE operados con R. Serán estadísticamente significativas aquellas variables cuyo p-valor sea menor que el nivel de significación seleccionado (𝛼=0,05); cuyo t-valor esté fuera del intervalo [−2,2]; y, cuyo intervalo de confianza al 95% no contenga al 0. Según estos criterios, son estadísticamente significativas con un nivel de significación 𝛼=0,05 las variables: SIT_LAB, CONFINT, RRSS, FREC_INT, NIVELEST, ING_HOG y NIVEL_CI. 37 A continuación, se van a eliminar las variables SEXO, PNACTO, ESTC, TOT_MH, que no resultan significativas en el modelo planteado. En cuanto a la variable EDAD, va a ser recodificada para que tenga menos de seis categorías, ya que es posible que no resulte significativa porque no se observen grandes diferencias entre ellas. La nueva variable EDAD_RECOD queda definida: 𝐸𝐷𝐴𝐷_𝑅𝐸𝐶𝑂𝐷={ 1=𝑑𝑒 16 𝑎 45 𝑎ñ𝑜𝑠 2=𝑑𝑒 46 𝑎 75 𝑎ñ𝑜𝑠 3=𝑑𝑒 76 𝑎 105 𝑎ñ𝑜𝑠 Se consideran estas tres categorías, atendiendo a los saltos generacionales en España y la relación de las distintas generaciones con el uso de los ordenadores. De esta manera, la primera categoría corresponde a los individuos que han crecido con acceso a un ordenador en su vivienda o han disfrutado de ese acceso en su veintena, estos son la generación Z, los conocidos como “Millenials”, y la mitad más joven de la generación X. La segunda categoría, corresponde con la mitad de más edad de la generación X y con la generación del “BabyBoom”, quienes quizá no han tenido acceso a un ordenador desde sus viviendas en su juventud, pero probablemente sí que lo han tenido desde sus trabajos o más adelante en sus viviendas. Por último, se ha considerado a los individuos que no han tenido acceso a un ordenador en su vivienda, ya sea por falta de conocimientos o por falta de necesidad, hasta años más recientes. La variable latente, con los cambios mencionados en el modelo, queda: 𝑦∗ =𝛽1∗𝐸𝐷𝐴𝐷_𝑅𝐸𝐶𝑂𝐷+𝛽2∗𝑆𝐼𝑇_𝐿𝐴𝐵+𝛽3∗𝐶𝑂𝑁𝐹𝐼𝑁𝑇+𝛽4∗𝑅𝑅𝑆𝑆+𝛽5 ∗𝐹𝑅𝐸𝐶_𝐼𝑁𝑇+𝛽6∗𝑁𝐼𝑉𝐸𝐿𝐸𝑆𝑇+𝛽7∗𝐼𝑁𝐺_𝐻𝑂𝐺+𝛽8∗𝑁𝐼𝑉𝐸𝐿_𝐶𝐼 38 En la Tabla 6 se observan los nuevos coeficientes estimados y los resultados para cada uno de los ocho contrastes que se han realizado: Tabla 6. Estimaciones de los Coeficientes del Modelo 1 Modificado Variable Estimación Error Estándar t-valor p-valor IC 2,5% IC 97,5% EDAD_RECOD -0,122934 0,032534 -3,778621 0,0002 -0,185714 -0,059182 SIT_LAB -0,027081 0,014982 -1,807583 0,0707 -0,056468 0,002261 CONFINT 0,146903 0,029694 4,962227 0,0000 0,088895 0,204943 RRSS 0,094927 0,036287 2,615990 0,0089 0,023841 0,166086 FREC_INT 0,356002 0,073014 4,875786 0,0000 0,213631 0,499883 NIVELEST 0,063702 0,021632 2,944797 0,0032 0,021317 0,106113 ING_HOG 0,131314 0,012917 10,165745 0,0000 0,106000 0,156635 NIVEL_CI 0,233540 0,021777 10,724176 0,0000 0,190873 0,276238 Fuente: Elaboración propia con datos del INE operados con R. Utilizando los mismos criterios y con los cambios que se acaban de implementar, se observa que, con un nivel de significación de 𝛼=0,05, la variable SIT_LAB deja de ser significativa y la variable EDAD_RECOD sí que lo es. De manera que se elimina la variable no significativa y se vuelve a estimar el modelo. La variable latente, con los últimos cambios incorporados, se calcula como: 𝑦∗ =𝛽1∗𝐸𝐷𝐴𝐷_𝑅𝐸𝐶𝑂𝐷+𝛽2∗𝐶𝑂𝑁𝐹𝐼𝑁𝑇+𝛽3∗𝑅𝑅𝑆𝑆+𝛽4∗𝐹𝑅𝐸𝐶_𝐼𝑁𝑇+𝛽5 ∗𝑁𝐼𝑉𝐸𝐿𝐸𝑆𝑇+𝛽6∗𝐼𝑁𝐺_𝐻𝑂𝐺+𝛽7∗𝑁𝐼𝑉𝐸𝐿_𝐶𝐼 En la Tabla 7 se observan los nuevos coeficientes estimados y los resultados para cada uno de los siete contrastes que se han realizado: 39 Tabla 7. Estimaciones de los Coeficientes del Modelo 1 Final Variable Estimación Error Estándar t-valor p-valor IC 2,5% IC 97,5% EDAD_RECOD -0,134612 0,031889 -4,221285 0,0000 -0,197130 -0,072127 CONFINT 0,147447 0,029603 4,980673 0,0000 0,089443 0,205490 RRSS 0,095426 0,036287 2,629777 0,0085 0,024339 0,166581 FREC_INT 0,359905 0,072976 4,931852 0,0000 0,217612 0,503713 NIVELEST 0,069349 0,021404 3,239977 0,0012 0,027413 0,111316 ING_HOG 0,132728 0,012892 10,295026 0,0000 0,107464 0,158002 NIVEL_CI 0,233474 0,021775 10,722120 0,0000 0,190811 0,276168 Fuente: Elaboración propia con datos del INE operados con R. Utilizando los mismos criterios y con la última modificación incorporada, se observa que, con un nivel de significación de 𝛼=0,05, las siete variables explicativas del modelo son significativas. Como ya se ha mencionado anteriormente, al no ser un modelo lineal, la interpretación de los coeficientes estimados es bastante compleja. No obstante, se puede comentar el signo y comparar la aportación de los mismos. Se aprecia que todas las variables, menos la variable EDAD_RECOD, tienen aportación positiva a la variable respuesta. Esto quiere decir que un aumento en cualquiera de las variables CONFINT, RRSS, FREC_INT, NIVELEST, ING_HOG y NIVEL_CI, si las demás permanecen constantes, produce un aumento en la variable respuesta latente 𝑦∗ y un aumento en la probabilidad de pertenecer a categorías más altas de la variable respuesta NCOMPRAS. Es decir que, a grandes rasgos, tener un mayor nivel de confianza en Internet, ser usuario de redes sociales, usar Internet con mayor frecuencia, tener un mayor nivel de estudios, tener un mayor nivel de ingresos o tener un mayor nivel de conocimientos informáticos hace que aumente la probabilidad de comprar por Internet con mayor frecuencia. En cambio, si aumentara la variable EDAD_RECOD, aumentaría la probabilidad de pertenecer a categorías más 40 bajas de la variable respuesta NCOMPRAS, es decir, disminuiría 𝑦∗. Es decir que, de manera generalizada, pertenecer a uno de los grupos de mayor edad, aumenta la probabilidad de comprar por Internet con menor frecuencia. Además, se puede observar que las variables ING_HOG y FREC_INT son las que más peso tienen en la variable latente 𝑦∗, lo que significa que el nivel de ingresos y la frecuencia de uso de Internet son las dos variables (dentro de las estudiadas) que más influyen en la frecuencia con la que compra por Internet un individuo. Por otro lado, las variables NIVELEST y RRSS, son las que menos peso tienen en la variable latente 𝑦∗, lo que significa que, dentro del modelo planteado, ser usuario de redes sociales o no y el nivel de estudios son los dos factores menos influyentes en la frecuencia de compra del usuario de “ecommerce”. A continuación, se estiman los puntos de corte {𝛾1,𝛾2,𝛾3} para poder calcular la variable respuesta 𝑦𝑀𝑜𝑑𝑒𝑙𝑜 1 o NCOMPRAS. Para saber si son significativos o no, se lleva cabo el siguiente contraste de hipótesis para cada uno de ellos: {𝐻0: 0≤𝛾𝑗−1≤ 𝛾𝑗 𝐻1:0>𝛾𝑗−1> 𝛾𝑗 para todo 𝑗={2,3} Mostramos los resultados en la Tabla 8: Tabla 8. Estimaciones de los Puntos de Corte del Modelo 1 Punto de Corte Estimación Error Estándar t-valor p-valor 1 o 2 veces | De 3 a 5 veces 1,239908 0,114714 10,808713 0,0000 De 3 a 5 veces | De 6 a 10 veces 2,173157 0,116301 18,685700 0,0000 De 6 a 10 veces | Más de 10 veces 2,742505 0,117845 23,272331 0,0000 Fuente: Elaboración propia con datos del INE operados con R. 47 PNACTO -0,052587 0,032362 -1,624991 0,1042 -0,116082 0,010776 CONFINT 0,087617 0,028351 3,090416 0,0020 0,032056 0,143191 FREC_INT 0,224866 0,065645 3,425508 0,0006 0,096352 0,353680 NIVELEST 0,102783 0,021032 4,886873 0,0000 0,061566 0,144012 ING_HOG 0,220603 0,013149 16,777185 0,0000 0,194841 0,246385 TOT_MH -0,076878 0,012341 -5,806006 0,0000 -0,102839 -0,050934 NIVEL_CI 0,198643 0,021488 9,244477 0,0000 0,156536 0,024077 Fuente: Elaboración propia con datos del INE operados con R. Utilizando los mismos criterios y con los cambios que se acaban de implementar, se aprecia que, con un nivel de significación de 𝛼=0,05, las variables SEXO y PNACTO dejan de ser significativas. Se eliminan dichas variables y se vuelven a estimar los coeficientes del modelo. La variable latente, con los últimos cambios incorporados, se calcula como: 𝑦∗ =𝛽1∗𝐸𝐷𝐴𝐷+𝛽2∗𝑆𝐼𝑇_𝑙𝐴𝐵+𝛽3∗𝐶𝑂𝑁𝐹𝐼𝑁𝑇+𝛽4∗𝐹𝑅𝐸𝐶_𝐼𝑁𝑇+𝛽5 ∗𝑁𝐼𝑉𝐸𝐿𝐸𝑆𝑇+𝛽6∗𝐼𝑁𝐺_𝐻𝑂𝐺+𝛽7∗𝑇𝑂𝑇_𝑀𝐻+𝛽8∗𝑁𝐼𝑉𝐸𝐿_𝐶𝐼 En la Tabla 13 se observan los nuevos coeficientes estimados y los resultados para cada uno de los siete contrastes que se han realizado: Tabla 13. Estimaciones de los Coeficientes del Modelo 2 Final Variable Estimación Error Estándar t-valor p-valor IC 2,5% IC 97,5% EDAD 0,109858 0,018526 5,930072 0,0000 0,073553 0,146172 SIT_LAB -0,072979 0,014446 -5,051912 0,0000 -0,101301 -0,044674 CONFINT 0,087364 0,028317 3,085187 0,0020 0,031868 0,142870 FREC_INT 0,217517 0,065568 3,317430 0,0009 0,089149 0,346176 NIVELEST 0,098095 0,020852 4,704359 0,0000 0,057232 0,138971 ING_HOG 0,223467 0,013099 17,059937 0,0000 0,197804 0,249151 TOT_MH -0,078177 0,013230 -5,909156 0,0000 -0,104115 -0,052256 NIVEL_CI 0,206451 0,021248 9,716315 0,0000 0,164813 0,248104 Fuente: Elaboración propia con datos del INE operados con R. 48 Utilizando los mismos criterios y con la última modificación incorporada, se observa que, con un nivel de significación de 𝛼=0,05, las siete variables explicativas del modelo son significativas. Respecto a la interpretación de los coeficientes, se aprecia que todas las variables, menos SIT_LAB y TOT_MH, tienen aportación positiva a la variable respuesta. Esto significa que un aumento en cualquiera de las variables EDAD, CONFINT, FREC_INT, NIVELEST, ING_HOG y NIVEL_CI, si las demás permanecen constantes, produce un aumento en la variable respuesta latente 𝑦∗ y un aumento en la probabilidad de pertenecer a categorías más altas de la variable respuesta VCOMPRAS. Esto quiere decir que, de manera generalizada, pertenecer a uno de los grupos de mayor edad, tener mayor confianza en Internet, usar Internet con mayor frecuencia, tener un mayor nivel de estudios, tener un mayor nivel de ingresos y un tener un mayor nivel de conocimientos informáticos aumentan la probabilidad de que el valor de las compras realizadas por Internet sea mayor. En cambio, si aumentara alguna de las variables SIT_LAB y TOT_MH, aumentaría la probabilidad de pertenecer a categorías más bajas de la variable respuesta VCOMPRAS, es decir, disminuiría 𝑦∗. Esto significa que, a grandes rasgos, estar en situación de desempleo, ser jubilado o estudiante y que haya un número mayor de residentes en el hogar hace que aumente la probabilidad de gastar menos dinero a la hora de comprar por Internet. Además, se puede observar que las variables ING_HOG y NIVELCI son las que más peso tienen en la variable latente 𝑦∗, lo que significa que el nivel de ingresos y el nivel de conocimientos informáticos son los dos factores más influyentes en el valor de las compras por Internet de un individuo. Por otro lado, las variables SIT_LAB y TOT_MH, son las que menos peso tienen en la variable latente 𝑦∗, lo que significa que la situación laboral y el número total de miembros 49 que reside en un hogar son las dos variables que menos influencia tienen en el valor de las compras realizadas por usuarios de “e-commerce”. A continuación, se estiman los puntos de corte {𝛾1,𝛾2,𝛾3,𝛾4} para poder calcular la variable respuesta 𝑦𝑀𝑜𝑑𝑒𝑙𝑜 2 o VCOMPRAS. Para saber si son significativos o no, se lleva cabo el siguiente contraste de hipótesis para cada uno de ellos: {𝐻0: 0≤𝛾𝑗−1≤ 𝛾𝑗 𝐻1:0>𝛾𝑗−1> 𝛾𝑗 para todo 𝑗={2,3,4} Se muestran los resultados en la Tabla 14: Tabla 14. Estimaciones de los Puntos de Corte del Modelo 2 Término Independiente Estimación Error Estándar t-valor p-valor Menos de 50€ | De 50 a menos de 100€ 0,613056 0,113345 5,408744 0,0000 De 50 a menos de 100€ | De 100 a menos de 500€ 1,487692 0,114383 13,006210 0,0000 De 100 a menos de 500€ | De 500 a menos de 1.000€ 2,712551 0,117002 23,183634 0,0000 De 500 a menos de 1.000€ | 1.000€ o más 3,299805 0,119424 27,630905 0,0000 Fuente: Elaboración propia con datos del INE operados con R. Se observa que todos los puntos de corte son significativos con un nivel de significación de 𝛼=0,05. Esto indica que las categorías de la variable respuesta son significativamente distintas entre sí. Finalmente, queda un modelo en el que se calcula, para cada observación, la variable latente no observable como sigue: 50 𝑦∗ =0,1099∗𝐸𝐷𝐴𝐷−0,0730∗𝑆𝐼𝑇_𝐿𝐴𝐵+0,0874∗𝐶𝑂𝑁𝐹𝐼𝑁𝑇+0,2175 ∗𝐹𝑅𝐸𝐶_𝐼𝑁𝑇+0,0981∗𝑁𝐼𝑉𝐸𝐿𝐸𝑆𝑇+0,2235∗𝐼𝑁𝐺_𝐻𝑂𝐺−0,0782 ∗𝑇𝑂𝑇_𝑀𝐻+0,2065∗𝑁𝐼𝑉𝐸𝐿_𝐶𝐼 Y, posteriormente, se calcula la variable respuesta observable: 𝑉𝐶𝑂𝑀𝑃𝑅𝐴𝑆= { 𝑀𝑒𝑛𝑜𝑠 𝑑𝑒 50€ 𝐷𝑒 50 𝑎 𝑚𝑒𝑛𝑜𝑠 𝑑𝑒 100€ 𝐷𝑒 100 𝑎 𝑚𝑒𝑛𝑜𝑠 𝑑𝑒 500€ 𝐷𝑒 500 𝑎 𝑚𝑒𝑛𝑜𝑠 𝑑𝑒 1.000€ 𝑀á𝑠 𝑑𝑒 1.000€ 𝑠𝑖 𝑦𝑖∗≤0,6131 𝑠𝑖 0,6131<𝑦𝑖∗≤1,4877 𝑠𝑖 1,4877<𝑦𝑖∗≤2,7126 𝑠𝑖 2,7126<𝑦𝑖∗≤3,2998 𝑦𝑖∗>3,2998 3.2.2. Estimación de los efectos marginales Igual que con el Modelo 1, se estiman los efectos marginales con el fin de llevar a cabo una interpretación más detallada y comprensible de los resultados de las estimaciones del modelo. En la Tabla 15 se observan las estimaciones de los efectos marginales: Tabla 15. Estimaciones de los Efectos Marginales Variable Menos de 50€ De 50 a menos de 100€ De 100 a menos de 500€ De 500 a menos de 1.000€ Más de 1.000€ EDAD -0,030 -0,014 0,023 0,012 0,008 SIT_LAB 0,020 0,009 -0,015 -0,008 -0,006 CONFINT -0,024 -0,011 0,019 0,010 0,007 FREC_INT -0,064 -0,022 0,050 0,022 0,014 NIVELEST -0,027 -0,012 0,021 0,011 0,007 ING_HOG -0,061 -0,028 0,047 0,025 0,017 TOT_MH 0,021 0,010 -0,017 -0,009 -0,006 NIVEL_CI -0,057 -0,026 0,044 0,023 0,016 Fuente: Elaboración propia con datos del INE operados con R. Para la interpretación se van a exponer un par de ejemplos. 51 Atendiendo a los efectos marginales que tiene la variable CONFINT en la variable respuesta, asumiendo que las demás variables permanecen constantes, se puede ver que un aumento en una unidad de dicha variable (por ejemplo, pasar de la categoría de los que confían poco en Internet a la categoría de los que confían bastante) disminuye en un 2,4% la probabilidad de pertenecer a la categoría de los que han gastado menos de 50€; y, en un 1,1% la probabilidad de pertenecer a la categoría de los que han gastado entre 50 y menos de 100€ en compras por Internet en los últimos tres meses. Además, un aumento en una unidad de la misma variable aumenta en un 2,3% la probabilidad de pertenecer a la categoría de los que han gastado entre 100 y menos de 500€; en un 1,2% la probabilidad de pertenecer a la categoría de los que han gastado entre 500 y menos de 1.000€; y, en un 0,8% la probabilidad de pertenecer a la categoría de los que han gastado más de 1.000€. Atendiendo a los efectos marginales que tiene la variable TOT_MH en la variable respuesta, asumiendo que las demás variables permanecen constantes, podemos ver que un aumento en una unidad de dicha variable (por ejemplo, que el número de miembros residentes del hogar encuestado pase de ser 1 a ser 2) aumenta en un 2,1% la probabilidad de pertenecer a la categoría de los que han gastado menos de 50€; y, en un 1% la probabilidad de pertenecer a la categoría de los que han gastado entre 50 y menos de 100€ en compras por Internet en los últimos tres meses. Además, un aumento en una unidad de la misma variable disminuye en un 1,7% la probabilidad de pertenecer a la categoría de los que han gastado entre 100 y menos de 500€; en un 0,9% la probabilidad de pertenecer a la categoría de los que han gastado entre 500 y menos de 1.000€; y, en un 0,6% la probabilidad de pertenecer a la categoría de los que han gastado más de 1.000€. 52 Nuevamente se observa que los efectos marginales de cada variable suman 0 y que son consistentes con los coeficientes que hemos estimado anteriormente. Se observa que aumentos en las variables SIT_LAB y TOT_MH producen disminuciones en la probabilidad de pertenecer a categorías más altas de la variable respuesta, lo que concuerda con el aporte negativo de estas variables a la variable latente 𝑦∗. Lo contrario ocurre con las demás variables, ya que tenían aportaciones positivas en los coeficientes estimados. De manera que, gracias a los cálculos de los efectos marginales se puede interpretar que un usuario “accidental” del comercio electrónico, es decir, que haya gastado menos de 50€ por Internet en los últimos tres meses, es una persona con menor edad, que se encuentra en situación de desempleo o es estudiante, que tiene poca confianza en Internet, que usa Internet menos de cinco veces por semana, cuyo nivel de ingresos del hogar en el que reside es inferior a la media, que reside con un mayor número de personas y cuyo nivel de conocimientos informáticos es bajo. Mientras que un individuo que hace mucho uso del comercio electrónico, es decir, que haya gastado de 500 a 1.000€, o más de 1.000€ en compras por Internet en los últimos tres meses es una persona de mayor edad, que se encuentra trabajando, que tiene mucha confianza en Internet, que usa Internet a diario, cuyo nivel de ingresos del hogar en el que reside es superior a la media, que reside con un menor número de personas y cuyo nivel de conocimientos informáticos es alto. 53 3.2.3. Probabilidades de predicción De nuevo, son comparadas las probabilidades de predicción cuando las variables regresoras toman su valor medio con las frecuencias relativas observadas de la variable utilizada como respuesta (VCOMPRAS). Se muestra en la Tabla 16: Tabla 16. Probabilidades de Predicción Modelo 2 Categoría Probabilidad de Predicción Frecuencia Relativa Observado Menos de 50€ 0,2120 0,2163 De 50 a menos de 100€ 0,2902 0,2899 De 100 a menos de 500€ 0,3695 0,3686 De 500 a menos de 1.000€ 0,0816 0,0806 1.000€ o más 0,0467 0,0447 Fuente: Elaboración propia con datos del INE operados con R. Se puede observar que las probabilidades de predicción del Modelo 2 y las frecuencias relativas observadas son similares, lo que indica que la variable respuesta del modelo y la variable respuesta real observada tienen una distribución semejante. 3.3. Otros resultados Como objetivo secundario, se elabora un breve análisis descriptivo de los bienes y servicios que más se consumen a través de Internet. En el siguiente gráfico, se puede observar, de menor a mayor, cuáles son los bienes y servicios que más se han comprado por Internet en 2019, basándonos en la base de datos descrita con anterioridad. 54 Gráfico 10. Bienes y Servicios Comprados por Internet Fuente: Elaboración propia con datos del INE operados con R. Se observa que un 56,98% de la muestra afirma haber contratado servicios de alojamiento, como hoteles o Airbnb, seguido de la compra de ropa y material deportivo con un 54,75%. También destaca las compras de bienes del hogar, como pueden ser muebles, electrodomésticos o juguetes, con un 42,93%; y, la contratación de servicios de transporte como BlaBlaCar, MyTaxy, Cabify o compra de billetes de transporte público, con un 41,36%. Por el contrario, como se aprecia en el gráfico, los medicamentos son los tipos de bienes que menos proporción de nuestra muestra ha adquirido alguna vez por Internet, siendo un 4,88% de la misma. Bienes y Servicios Comprados por Internet 55 4. CONCLUSIONES En este trabajo, el objetivo principal es caracterizar la intensidad de uso del “e-commerce” en España en la actualidad. Para ello se han utilizado los datos de la “Encuesta sobre Equipamiento y Uso de Tecnologías de Información y Comunicación en los Hogares (TIC-H)” llevada a cabo por el Instituto Nacional de Estadística en 2019. Con ellos, se han elaborado dos modelos de regresión Probit Ordenado con dos variables respuesta distintas (valor de las compras y número de compras), y, posteriormente, se ha analizado cuáles de las variables regresoras tienen una mayor influencia, ya sea positiva o negativa, en el comportamiento del comprador por Internet. Como conclusiones, se puede decir que las variables que más aumentan la probabilidad de comprar más por Internet, ya sea midiendo el valor de las compras o la cantidad de veces que se compra, son la frecuencia de uso de Internet, el nivel de ingresos, el nivel de conocimientos informáticos, el nivel de estudios y la confianza del usuario en Internet. Es decir, una persona que tenga un mayor nivel de estudios, un mayor nivel de ingresos, mayor confianza en Internet, mayor nivel de conocimientos informáticos y sea usuario frecuente de Internet, tiene una mayor probabilidad de comprar más frecuentemente por Internet y de gastar más dinero en dichas compras. Por el contrario, una persona con menor nivel de estudios, menor nivel de ingresos, menor nivel de conocimientos informáticos, que no confíe mucho en Internet y que, además, no lo use con mucha frecuencia, tiene una mayor probabilidad de comprar con poca frecuencia por Internet, y, cuando compre, de no gastar mucho dinero. También se puede concluir que el hecho de ser usuario de redes sociales aumenta la probabilidad de comprar con mayor frecuencia por Internet, pero, sin 56 embargo, no tiene influencia en el valor de dichas compras. Esto puede deberse a la alta presencia de publicidad en las redes sociales. Por otro lado, se ha visto en el estudio que el número de miembros que tiene un hogar y estar en situación de desempleo, jubilación o ser estudiante, influyen de manera negativa al gasto en compras por Internet, pero no influyen en el número de compras que se llevan a cabo. Es decir, una persona que viva en un hogar con mayor número de miembros y que no tenga empleo, sea estudiante o esté jubilada, tendrá mayor probabilidad de gastar menos dinero en sus compras por Internet, sin importar la frecuencia de las mismas. Además, es interesante comentar el caso de la edad como factor determinante para las compras por internet. En el estudio se ha obtenido que cuantos más años tiene una persona, tiene mayor probabilidad de gastar más dinero en compras por Internet, pero a su vez, tiene mayor probabilidad de comprar con menos frecuencia por Internet. Esto quiere decir que, a mayor edad, se realizan compras de bienes o servicios de más valor y con menos frecuencia por Internet, como por ejemplo viajes, mobiliario y electrodomésticos. Por último, se ha concluido que el sexo, el país de nacimiento y el estado civil, no son factores que influyen en el valor ni la frecuencia de las compras por Internet, como sugerían otros estudios mencionados en la revisión bibliográfica. En cuanto a las barreras o limitaciones de este trabajo, se puede mencionar que, aunque los datos se hayan obtenido de fuentes oficiales, dichas fuentes son secundarias, es decir, no son datos de elaboración propia. Cabe añadir, el número de observaciones que se han perdido por estar incompletas, ya que el programa y los modelos empleados no podían interpretarlas. 63 6. ANEXOS 6.1. Anexo I: Código en RStudio 64 65 66 67 6.2. Anexo II: Salidas de RStudio 68 69 70 71 72