scieee AI-readable full text Open interactive document viewer

Análisis del comportamiento de los viajeros del transporte interurbano en la isla de Gran Canaria

Cristóbal Betancor, Teresa

Abstract

En este trabajo se hace uso de técnicas de Inteligencia de Negocio y Minería de Datos para la extracción de conocimiento útil para la empresa concesionaria del servicio de transporte interurbano de la isla de Gran Canaria. El objetivo ha sido encontrar un patrón que permita predecir la cantidad de viajeros que querrán ir de un punto a otro de red de transporte en un momento dado. Para ello se han utilizado los ficheros de eventos generados en los vehículos de la flota entre 2005 y 2006, teniendo en cuenta información: 1. De carácter temporal: momento del día en el que hace el viaje. Condición de laborable del día. Mes. Estación del año. 2. De carácter geográfico y demográfico: parada de origen y de destino. Tipo de parada: núcleo urbano, zona residencial, núcleo rural, zona rural, centro educativo. Código postal de la parada origen y destino. Las líneas elegidas han sido aquellas que constituyen el denominado "Corredor Capital-Centro", y con ellas se han alcanzado los siguientes resultados: 1. Se ha modelado el número de viajeros en cada una de las líneas troncales del corredor, las que tienen mayor cantidad de viajeros y de vehículos, teniendo en cuenta las paradas origen y destino. 2. Se ha modelado el número de viajeros en el corredor, teniendo en cuenta en este caso el "tipo de parada" origen y el "tipo de parada" destino.

Full text

UNIVERSIDAD DE LAS PALMAS DE GRAN CANARIA M´aster Oficial en Sistemas Inteligentes y Aplicaciones Num´ericas en Ingenier´ıa Trabajo Final de M´aster An´alisis del comportamiento de los viajeros del transporte interurbano en la isla de Gran Canaria. Teresa Crist´obal Betancor Tutores: D. Jos´e Javier Lorenzo Navarro. D. Carmelo Rub´en Garc´ıa Rodr´ıguez. Septiembre 2014 A Rub´en, Pablo y Julia, y a mi querida amiga Marga, cuya sonrisa me acompa˜nar´a siempre. ii Agradecimientos Quiero agradecer a mis tutores Jos´e Javier Lorenzo y Carmelo Rub´en Garc´ıa su dedicaci´on y consejo, a la empresa de transportes Global que permitiera el uso de sus ficheros en la realizaci´on de este trabajo, y reconocer la generosidad de todos aquellos que con su ayuda hicieron posible que cursara este m´aster. iii iv Resumen. En este trabajo se hace uso de t´ecnicas de Inteligencia de Negocio y Miner´ıa de Datos para la extracci´on de conocimiento ´util para la empresa concesionaria del servicio de transporte interurbano de la isla de Gran Canaria. El objetivo ha sido encontrar un patr´on que permita predecir la cantidad de viajeros que querr´an ir de un punto a otro de red de transporte en un momento dado. Para ello se han utilizado los ficheros de eventos generados en los veh´ıculos de la flota entre 2005 y 2006, teniendo en cuenta informaci´on: De car´acter temporal: •Momento del d´ıa en el que hace el viaje. •Condici´on de laborable del d´ıa. •Mes. •Estaci´on del a˜no. De car´acter geogr´afico y demogr´afico: •Parada de origen y de destino. •Tipo de parada: n´ucleo urbano, zona residencial, n´ucleo rural, zona rural, centro educativo. •C´odigo postal de la parada origen y destino. Las l´ıneas elegidas han sido aquellas que constituyen el denominado Corredor Capital-Centro, y con ellas se han alcanzado los siguientes resultados: 1. Se ha modelado el n´umero de viajeros en cada una de las l´ıneas troncales del corredor, las que tienen mayor cantidad de viajeros y de veh´ıculos, teniendo en cuenta las paradas origen y destino. 2. Se ha modelado el n´umero de viajeros en el corredor, teniendo en cuenta en este caso el tipo de parada origen y el tipo de parada destino. v ´ Indice general Resumen V 1. Introducci´on. 3 2. Trabajos relacionados. 5 3. Metodolog´ıa y Herramientas. 9 3.1. Metodolog´ıa. ........................... 9 3.2. Herramientas software. ...................... 11 3.2.1. Pentaho Community Edition. .............. 11 3.2.2. Weka ............................ 15 4. Detalle del proyecto. 21 4.1. Comprensi´on del negocio y planificaci´on. ............ 21 4.1.1. Glorario de t´erminos. ................... 23 4.2. Comprensi´on de los datos. .................... 24 4.2.1. Datos de partida. ..................... 24 4.2.2. Exploraci´on de los datos. ................. 25 4.2.3. Calidad de los datos. ................... 26 4.3. Preparaci´on de los datos. ..................... 27 4.3.1. Determinaci´on del ´ambito de estudio. .......... 27 4.3.2. Creaci´on de los registros cero .............. 30 4.3.3. Datos seleccionados. ................... 31 4.3.4. Definici´on del grano temporal. .............. 32 4.3.5. Prepocesado de los datos. ................ 32 4.3.6. Integraci´on de datos. ................... 34 4.3.7. Formatear/clasificar datos. ................ 34 4.3.8. Descripci´on del conjunto de datos definitivo. ...... 34 4.4. Modelado. ............................. 36 4.4.1. Selecci´on de atributos. .................. 36 4.4.2. M´etodos de modelado utilizados. ............ 39 4.5. Evaluaci´on de los modelos. .................... 40 4.5.1. Resultados obtenidos. ................... 47 5. Posibles aplicaciones y futuras l´ıneas de trabajo. 49 vii 4CAP´ ITULO 1. INTRODUCCI ´ ON. Esta memoria est´a organizada de la siguiente manera: primero se hace un breve resumen de algunas de las publicaciones relacionadas con la aplicaci´on de t´ecnicas de miner´ıa de datos en el ´ambito del transporte de pasajeros. A continuaci´on se presenta la metodolog´ıa y las herramientas software utilizadas. En el cap´ıtulo cuarto se detallan todas las fases propias del proyecto de miner´ıa de datos: comprensi´on, preparaci´on y pre-procesado de los datos - donde adem´as se delimita el conjunto a tratar -, fase de modelado y de resultados. En el ´ultimo cap´ıtulo se exponen las conclusiones finales y se proponen l´ıneas futuras de actuaci´on. 2. Trabajos relacionados. En este cap´ıtulo se presenta una s´ıntesis de los an´alisis y estudios realizados para dar soluci´on, con t´ecnicas de miner´ıa de datos, a algunos de los problemas relacionados con el servicio p´ublico de transporte terrestre de pasajeros. Hay que destacar que el objetivo ´ultimo de todos ellos es potenciar la calidad del transporte p´ublico para disuadir al ciudadano del uso del transporte privado. Wets [2] hace una revisi´on hist´orica de como se ha modelado la demanda en los sistemas de transporte a lo largo de los a˜nos, buscando la interrelaci´on existente entre el destino del viajero, el tipo de transporte, la planificaci´on de los servicios, la duraci´on de los viajes, etc. Cuando surgen los primeros algoritmos capaces de proponer reglas derivadas de los datos y deja de ser necesario el conocimiento de un experto que determine las condiciones y mecanismos subyacentes a esta actividad, es cuando se crea el primer sistema de modelado basado en t´ecnicas de aprendizaje autom´atico: ALBATROSS (A Learnig-Based Transportacion Oriented Simulation System), Arentze [3], impulsado en 2007 por el Ministerio Holand´es de Transporte y Gesti´on del Agua. Este sistema es capaz de predecir, de una forma comprensible, qu´e est´a pasando, cu´ando, donde, por cu´anto tiempo, por qui´en y en qu´e tipo de transporte, utilizando ´arboles de decisi´on CHAID (Chi-squared Automatic Interaction Detector). En 2006 Agard [4] utiliza t´ecnicas de miner´ıa de datos con los millones de registros que se generan con el uso de tarjetas inteligentes (SCAFC, Smart Card Automated Fare Collection) en la red de transporte, consiguiendo caracterizar segmentos de mercado dentro de los usuarios del transporte p´ublico. Lathia y Capra [5], [6] y [7], han realizado diferentes estudios bas´andose en la informaci´on generada por ese tipo de medio de pago: en el primero [5], partiendo de los viajes realizados por cada usuario en el metro de Londres, proponen y eval´uan m´etodos para, en base a los recorridos previstos, clasificar las estaciones para que la empresa de transporte pueda acondicionarlas debidamente. En un segundo trabajo [6] para que los viajeros no se equivoquen al elegir las tarifas en los viajes (despu´es de descubrir que en 5 6CAP´ ITULO 2. TRABAJOS RELACIONADOS. total se podr´ıan haber ahorrado mas de 200 millones de libras esterlinas) proponen, partiendo de la informaci´on que generan esos viajes, desarrollar un sistema que suministre, a cada uno de los viajeros unas recomendaciones que les ayude a ahorrar dinero, utilizando clasificadores sencillos cono Naive Bayes, y ´arboles de decisi´on. Por ´ultimo [7], plantean alimentar los sistemas de informaci´on al ciudadano de la empresa de transporte con la informaci´on generada por el uso de las tarjetas inteligentes, convirti´endolos en sistemas de informaci´on din´amicos. Tambi´en proponen algoritmos para predecir el tiempo que se tarda en ir de una parada origen a otra destino, sin considerar la ruta, bas´andose en los siguientes patrones: uno denominado de contexto del viaje, usando los datos de los viajeros que hicieron el mismo recorrido en un intervalo de tiempo, el segundo relacionado con la familiaridad, que considera la frecuencia en la que el viajero realiza ese viaje, y el tercero, que supone que el viajero mantiene los mismos h´abitos a la hora de moverse entre las mismas dos paradas. Du [8] tambi´en utiliza la informaci´on registrada por los sistemas de pago autom´atico para estimar el comportamiento de los ciudadanos teniendo en cuenta tambi´en factores de car´acter socio-demogr´afico: ubicaci´on de centros comerciales, zonas deportivas, residenciales, etc. . En el estudio realizado a partir del uso de cerca de los 15.000 autobuses que transitan en la capital de China, y que trasladan a cerca de 17 millones de pasajeros diariamente, el objetivo ha sido encontrar el patr´on de movilidad de la poblaci´on (GMP, Group Movility Pattern) que prediga su comportamiento en ´areas urbanas, y permita estimar la demanda del servicio de transporte p´ublico en zonas de expansi´on de las ciudades. En este caso se utilizan t´ecnicas de miner´ıa de patrones, m´etodos de miner´ıa de datos especializados en la b´usqueda de patrones, tales como ST-DBSCAN, m´etodo de asociaci´on basado en el algoritmo DBSCAN (Density-Based Spatial Clustering of Applications with Noise). Levner [10], propone el desarrollo de un sistema para pronosticar y detectar los puntos d´ebiles de la red de transporte, bas´andose en miner´ıa de datos y en sistemas multi-agentes. Distingue entre dos tipos de problemas, uno de tratamiento off-line, relacionado con una planificaci´on inadecuada, y otro de tratamiento en tiempo real para solucionar los problemas que surjan de tipo aleatorio (accidentes, congestiones puntuales, ...) o t´ecnico. Los multi-agentes inteligentes (IMA, intelligent multi-agent) miden y procesan informaci´on relacionada con el entorno y realizan acciones para intentar mejorarlo y, partiendo de la informaci´on generada por ellos, establecer modelos para aumentar la calidad del servicio, introduciendo nuevas clasificaciones en 7 la red de transporte y en la planificaci´on de los mismos. No todos los agentes tienen asociados un dispositivo f´ısico, por ejemplo el correspondiente a los pasajeros podr´a informar bas´andose en las preferencias del usuario (obtenidas de viajes anteriores) y en la situaci´on del tr´afico y de las rutas disponibles (suministradas por otros agentes). Zhou [12], partiendo de la informaci´on generada por el GPS de los veh´ıculos, realiza un estudio para evitar el hacinamiento que, junto con los retrasos en las llegadas, pueden disuadir al ciudadano de utilizar los servicios p´ublicos de transporte. Plantea que primero se ha de determinar: los per´ıodos en los que se divide el d´ıa no homog´eneos respecto al transporte, los momentos en los que se producen r´afagas en la demanda (vacaciones, cambios de tiempo, eventos, etc.) y los per´ıodos que son significativos en la demanda como el d´ıa de la semana y la estaci´on del a˜no. Tran [11] propone utilizar los datos de los sistemas autom´aticos de conteo de pasajeros (APC, Automatic Passenger Counters) y de los sistemas de localizaci´on autom´atica de veh´ıculos (AVL, Automatic Vehicle Location) para construir diagramas de diagn´ostico de la fiabilidad del servicio utilizando redes Bayesianas, con objeto de descubrir la variabilidad de los atributos de los servicios y sus efectos en el comportamiento de los viajeros. Por ´ultimo, O˜na [13] propone analizar las encuestas de satisfacci´on con una t´ecnica de miner´ıa de datos para que no sea necesario establecer relaciones predefinidas entre el aspecto a evaluar y la calidad del servicio, tal y como sucede si se utilizan m´etodos estad´ısticos para evaluar el peso. Destaca el valor a˜nadido de esa herramienta si considera la utilidad pr´actica que pueden tener los resultados (por su simplicidad y f´acil interpretaci´on). 8CAP´ ITULO 2. TRABAJOS RELACIONADOS. 3. Metodolog´ıa y Herramientas. En este cap´ıtulo sen van a describir dos aspectos determinantes de este trabajo: la metodolog´ıa de referencia para su desarrollo y las herramientas software que se han utilizado. 3.1. Metodolog´ıa. Este trabajo se ha realizado utilizando CRISP-DM acr´onimo de CRossIndustry Standard Process for Data Mining [14], un modelo de miner´ıa de datos, no-propietario y documentado. Desarrollado en 1996 por cuatro compa˜n´ıas l´ıderes en el entonces incipiente campo de la miner´ıa de datos: DaimlerBenz, Integral Solutions Ltd. (ISL), NCR, y OHRA, y con la aportaci´on de m´as de 200 usuarios y proveedores de herramientas de miner´ıa, ofrece a las organizaciones la estructura necesaria para obtener r´apidamente los mejores resultados en proyectos de este tipo [15]: Incluye descripciones de las fases normales de un proyecto y las tareas necesarias en cada fase. Un esquema de cada una de ellas se presenta en la figura 3.1, donde se destacan las que constituyen el n´ucleo de este trabajo. Documenta el ciclo vital del proyecto, las relaciones entre esas seis fases que, como se ilustra en la figura 3.2, se encuentran interrelacionadas. Hay que tener en cuenta que la secuencia definida no es estricta, los proyectos avanzan o retroceden entre las fases con frecuencia, dependiendo de si los resultados obtenidos alcanzan o no los objetivos planteados. A modo de resumen, ´estas son las tareas principales de cada fase [15]: 1. Business Understanding - Comprensi´on del negocio. Recopilar informaci´on sobre la situaci´on comercial de la empresa, sus recursos, problemas y objetivos, valorar su situaci´on y conocer sus prioridades para determinar los objetivos de la miner´ıa de datos. 2. Data Understanding - Comprensi´on de los datos. Estudiar de cerca los datos disponibles para minimizar los problemas que puedan surgir en la siguiente fase de preparaci´on de los datos. Recopilarlos, 9 10 CAP´ ITULO 3. METODOLOG´ IA Y HERRAMIENTAS. Figura 3.1: Fases y tareas del modelo CRISP-DM describirlos y explorarlos con ayuda de tablas y gr´aficos, y determinar su calidad. 3. Data Preparation - Preparaci´on de los datos. Con frecuencia ´esta es la fase que m´as tiempo exige y consiste en las siguientes tareas: fusionar conjuntos o registros de datos, derivar nuevos atributos, clasificar, y definir los conjuntos de entrenamiento y de prueba. 4. Modeling - Modelado. En este punto los datos se incorporan a las herramientas de modelado, normalmente probando distintos m´etodos y par´ametros, volviendo a la fase de preparaci´on de los datos si fuera necesario. Hay que tener en cuenta que la t´ecnica a utilizar vendr´a dada por distintos factores relacionados con los datos elegidos, por ejemplo si son o no suficientes, si son del tipo adecuado o si tienen cierta calidad. Tambi´en en esta fase hay que determinar los procedimientos de comprobaci´on y evaluaci´on de los modelos. 5. Evaluation - Evaluaci´on. Esta fase no trata de evaluar la bondad de los m´etodos de modelado escogidos sino de verificar que los resultados obtenidos responden a las necesidades planteadas por la empresa y recogidas al comienzo del proyecto. Hay que tener en cuenta que deben ser dos los resultados de la miner´ıa de datos: los modelos seleccionados en la fase anterior y las conclusiones obtenidas de los modelos, los descubrimientos. 3.2. HERRAMIENTAS SOFTWARE. 11 Figura 3.2: Ciclo de vida contemplado en el modelo CRISP-DM 6. Deployment - Distribuci´on. En esta ´ultima es cuando los nuevos conocimientos se han de implementar en la organizaci´on. Aunque no siempre impliquen la adopci´on de medidas concretas sino que sirvan en la planificaci´on y toma de decisiones comerciales, de gesti´on o de marketing. 3.2. Herramientas software. En cuanto a las herramientas, este trabajo se apoya fundamentalmente en dos productos de c´odigo abierto para la exploraci´on, preprocesado, an´alisis y modelado de los datos: 3.2.1. Pentaho Community Edition. Se trata de la versi´on de open source de Pentaho Data Integration yPentaho Business Analytics Platform, dos de las principales aplicaciones de la plataforma Pentaho Business Intelligence dise˜nada para crear soluciones para la toma de decisiones [16]. 12 CAP´ ITULO 3. METODOLOG´ IA Y HERRAMIENTAS. La versi´on libre tiene algunas limitaciones respecto a la Enterprise Edition: no dispone de generaci´on de informes interactivos, de cuadros de mando, de configuraci´on LDAP para acceso a directorios, ni de aquellas herramientas relacionadas con la gesti´on de tareas y rendimiento del sistema. A continuaci´on se describen brevemente estas dos aplicaciones: 1. El m´odulo de integraci´on de datos de Pentaho (PDI, Pentaho Data Integration) es una herramienta de extracci´on, transformaci´on y carga (ETL, Extract Transform Load) que se utiliza para integrar y manipular datos, cuyo origen puede ser diverso: ficheros planos, bases de datos relacionales, bases de datos no SQL, anal´ıticas, flujos de redes sociales, etc. Tambi´en puede utilizarse para limpiar, enriquecer e incorporar nuevos datos. Tiene los siguientes componentes: La herramienta de dise˜no Spoon. Es la interfaz gr´afica de usuario que permite dise˜nar y ejecutar transformaciones y trabajos ETLs. Est´a basado en Kettle (acr´onimo recursivo de ”Kettle Extraction, Transformation, Transportation, and Load Environment”), y constituida a su vez por dos subsistemas: •Pan, motor de transformaci´on de datos que realiza funciones de lectura, manipulaci´on, y escritura de datos hacia y desde las distintas fuentes de datos. •Kitchen, programa que ejecuta los trabajos dise˜nados con Spoon. Las Transformaciones y Trabajos se pueden almacenar en un archivo XML o se pueden colocar en un cat´alogo de base de datos, un repositorio, de Kettle. Plugins y comandos para acceder a las distintas fuentes de datos. En las figuras 3.3 y3.4 se presentan dos ejemplos de transformaciones generadas en el transcurso de este proyecto. El primero, bastante sencillo, muestra uno de los creados en la fase de exploraci´on de los datos. Al ser una herramienta que permite preparar y realizar manipulaciones de una forma sencilla y r´apida, se ha utilizado con frecuencia en esa primera fase. Despu´es, en la de preprocesado se utiliz´o tanto para 3.2. HERRAMIENTAS SOFTWARE. 13 crear nuevos campos como para incorporar otros obtenidos de ficheros adicionales. Figura 3.3: Ejemplo sencillo de tratamiento de datos. Hay que decir que solo se utilizaron ficheros de texto planos por lo que no fue necesario ahondar en la multitud de posibilidades de importaci´on y exportaci´on que contempla. Solo fue necesario a˜nadir el m´odulo que permite la generaci´on de ficheros de tipo ARFF, el formato utilizado en Weka y que se comentar´a m´as adelante. 2. Business Analytics Platform, la herramienta OLAP (On-Line Analytical Processing) de Pentaho, una soluci´on abierta y unificada que incluye integraci´on y visualizaci´on de datos para su an´alisis, y que est´a formada por: a) Servidor BA (Business Analytics), el coraz´on de Pentaho, que centraliza el repositorio de los datos, al que se accede a trav´es de una herramienta web, la Consola de Usuario. b) Generador de informes, a partir de cualquier fuente de datos. c) Analizador, para filtrar y visualizar los datos, a˜nadiendo par´ametros a las consultas si es necesario y generando informes de manera 20 CAP´ ITULO 3. METODOLOG´ IA Y HERRAMIENTAS. Figura 3.9: Resultado obtenido por un clasificador. Figura 3.10: Errores cometidos en la clasificaci´on. 4. Detalle del proyecto. Como se mencion´o anteriormente, en este proyecto de Miner´ıa se ha seguido la metodolog´ıa CRISP-DM, por lo que a continuaci´on se detallan las tareas realizadas en cada una de las fases que constituyen su ciclo de vida, sin considerar la relacionada con la implementaci´on, que no est´a contemplada. 4.1. Comprensi´on del negocio y planificaci´on. La empresa Global naci´o el 17 de marzo de 2000, fruto de la fusi´on de las dos operadoras de transporte interurbano de viajeros que exist´ıan en Gran Canaria, Salcai (concesi´on SurSureste) y Utinsa (concesi´on Centro – Norte), que a su vez prestaron los servicios de transporte en Gran Canaria desde 1973. Empresa puntera en nuevas tecnolog´ıas -recibi´o la distinci´on de Mejor Empresa del A˜no 2002 de Espa˜na en la modalidad de Transporte Regular de viajeros -, dispone de sistemas novedosos ejecutados y desarrollados junto a la Universidad de Las Palmas de Gran Canaria que le permiten prestar un servicio de calidad, ofreciendo a los viajeros f´ormulas de pago autom´atico y sistemas de prepago, as´ı como coordinar la flota a trav´es del programa de Control y Motorizaci´on. En el a˜no 2005 instala en sus veh´ıculos un ordenador de abordo que registra el detalle de todo lo realizado en ellos: El comienzo y el fin de un servicio por parte de un conductor. El comienzo y el fin de cada expedici´on. Cada cambio de parada tarifaria. La emisi´on de un billete para uno o varios viajeros. El uso de una tarjeta. Como se observa que, excepto en recorridos secundarios, en la planificaci´on de las l´ıneas solo se tiene en cuenta la frecuencia - las programaciones son peri´odicas (tal y como se puede ver en la figura 4.1) - y puesto que se 21 22 CAP´ ITULO 4. DETALLE DEL PROYECTO. dispone de un fichero con los datos mencionados anteriormente registrados por los veh´ıculos de la flota entre 2005 y 2006, se plantea la posibilidad de realizar un proyecto de Miner´ıa de Datos para extraer informaci´on acerca del comportamiento de los viajeros, teniendo en cuenta los siguientes factores: 1. De car´acter temporal: Momento del d´ıa en el que hace el viaje. Condici´on de laborable del d´ıa. Mes. Estaci´on del a˜no. 2. De car´acter geogr´afico y demogr´afico: Parada de origen y de destino. Tipo de parada de origen y de destino. C´odigo postal de la parada origen y de destino. Figura 4.1: Planificaci´on actual l´ınea 303 En cada parada en la red de transporte existe un punto de informaci´on en el que se indica, en cuadros similares al anterior, de cada l´ınea que pasa 4.1. COMPRENSI ´ ON DEL NEGOCIO Y PLANIFICACI ´ ON. 23 por ese punto, el momento en el que tiene previsto la llegada de un veh´ıculo. Pero esa planificaci´on no siempre se cumple, son las experiencias pasadas las que permiten aproximar al usuario el momento en el que llegar´a la guagua: en horas de mayor afluencia de viajeros se retrasar´a, en otros mementos es posible que se adelante respecto al horario previsto. Por lo tanto, una herramienta como esta no solo ayudar´a a racionalizar en la empresa los recursos disponibles sino que beneficiar´a directamente a los usuarios. 4.1.1. Glorario de t´erminos. Anotaci´on. Registro de datos generado por el sistema de abordo. Billete. Recibo asociado al pago con dinero de un trayecto de uno o m´as viajeros. Corredor. Conjunto de l´ıneas que discurren por una zona geogr´afica concreta. Expedici´on: recorrido de una l´ınea realizado por un veh´ıculo en un sentido. Guagua: veh´ıculo, autob´us. L´ınea circular. Aquella que tiene como parada origen y destino la misma parada. L´ınea principal. Que tiene como origen o destino la capital de la isla. L´ınea secundaria. Aquella que no tiene como parada origen o destino la capital de la isla. Parada, parada tarifaria. Aunque la parada tarifaria es el conjunto de paradas f´ısicas que tienen la misma tarifa, en este proyecto ambos t´erminos son equivalentes. Servicio: conjunto de expediciones realizadas en un veh´ıculo por un conductor identificado en la toma de servicio. Tarjeta. Medio de pago autom´atico. Viaje. Recorrido que hace uno o varios viajeros en la l´ınea, definido por la parada origen y destino. 24 CAP´ ITULO 4. DETALLE DEL PROYECTO. 4.2. Comprensi´on de los datos. En el an´alisis preliminar se realiz´o la exploraci´on de los datos mediante gr´aficos y herramientas de visualizaci´on, con objeto de detectar los elementos m´as significativos de la red de transporte, verificar su calidad y perfilar los objetivos concretos del proceso de miner´ıa. 4.2.1. Datos de partida. Los datos de partida para este estudio fueron los siguientes: Datos existentes. Se han utilizado varios ficheros de la empresa de transporte: 1. Anotaciones registradas en los veh´ıculos. Los principales datos de este proyecto se encuentran en un ´unico fichero binario, denominado ANOTACIONES donde, agrupados por servicio y expediciones, se encuentra el detalle de los viajes realizados ordenados cronol´ogicamente. Un ejemplo de los mismos se muestra en la figura 4.2. Figura 4.2: Ejemplo de anotaciones en el fichero original 2. Datos relativos a las l´ıneas. En cuanto a las l´ıneas se trataron dos tipos de ficheros, aunque con car´acter complementario, ninguno de sus datos se incorpor´o al fichero final utilizado en la fase de modelado: 4.2. COMPRENSI ´ ON DE LOS DATOS. 25 a) para mayor compresi´on, el de la denominaci´on de las mismas. b) para verificar la calidad de los registros el de su configuraci´on, con la relaci´on de las paradas que las componen, denominado L´ INEAS. 3. Datos relativos a las paradas. En este caso tambi´en se manejaron dos ficheros: a) para mayor compresi´on, el de la denominaci´on de las mismas. b) para conocer su localizaci´on el que indicaba su c´odigo postal, denominado PARADAS. Datos adquiridos. Datos relativos a la tipolog´ıa de las paradas y que se comentar´an m´as adelante, cuando se aborte la fase de preprocesado. 4.2.2. Exploraci´on de los datos. Gracias a la herramienta de integraci´on de datos de Pentaho, en la primera aproximaci´on al problema y para facilitar la manipulaci´on de los registros con los datos de todas las l´ıneas (algo m´as de 50 millones), se dividi´o el primer fichero por a˜no y mes, y partiendo de cada uno de ellos se crearon otros acumulando el total de pasajeros con diferentes criterios: Por misma parada origen, parada destino, d´ıa de la semana y semana del a˜no. Por misma parada origen, parada destino y mes. Por misma parada destino y mes. Por l´ınea, d´ıa de la semana y semana del a˜no. Y utilizando la herramienta OLAP de Pentaho (figura 4.3) comenzaron a definirse l´ıneas y paradas importantes en cuanto a volumen de viajeros y tambi´en datos que hubo que analizar en detalle para comprobar si se trataba o no de informaci´on err´onea, como por ejemplo picos de afluencia por eventos extraordinarios (musicales, deportivos o fiestas locales). 26 CAP´ ITULO 4. DETALLE DEL PROYECTO. Figura 4.3: Ejemplo de exploraci´on de los datos con Business Inteligent 4.2.3. Calidad de los datos. A partir del an´alisis realizado en la fase de exploraci´on anterior, se alcanzaron las siguientes conclusiones: Aunque hay registros datados desde comienzos del a˜no 2005 hasta finales de 2006 no siempre de todas las l´ıneas de la red de transporte, por lo que finalmente se decide acotar el intervalo temporal entre el 1 de julio de 2005 al 31 de junio de 2006. De esta manera se dispone de un a˜no natural completo con todos los recorridos existentes. En total existen datos de unas 150 l´ıneas y de 270 paradas aproximadamente. Hay pocas l´ıneas que concentran un porcentaje de viajeros elevado, tal y como puede apreciarse en la figura 4.4. Se observan en ellos fundamentalmente tres tipos de errores, probablemente debidos a la tecnolog´ıa de la memoria de los sistemas de abordo (de estado s´olido): •En las fechas. •En el indicador de n´umero de viajeros. •En el identificador de la parada destino. Puesto que no era posible inferir dichos datos a partir del resto y como solo suponen el 0.8 % del total de anotaciones finalmente se decide desechar los registros afectados. 4.3. PREPARACI ´ ON DE LOS DATOS. 27 Figura 4.4: % de viajeros de las 10 l´ıneas m´as concurridas 4.3. Preparaci´on de los datos. La siguiente tarea es constituir el conjunto de datos definitivo, aquel que contenga lo necesario para construir el modelo que se persigue. Generalmente esta fase puede suponer hasta el 80 % del tiempo en un proyecto de Miner´ıa de Datos, y aunque en este caso no ha llegado a ese porcentaje tambi´en ha sido alto (cerca del 50 %), puesto que no solo es cuando se ha tratado de delimitar el ´ambito a estudiar sino tambi´en cuando se ha generado el conjunto de datos realmente robusto y coherente. Los distintos procesos se han llevado a cabo fundamentalmente con un programa desarrollado en C (CreaReg) y con la herramienta de integraci´on de datos de Pentaho, tal como se muestra en la figura 4.5. En esta tarea se distinguen a su vez las siguientes fases: 4.3.1. Determinaci´on del ´ambito de estudio. Como se mencion´o con anterioridad, pocas l´ıneas acumulan un significativo porcentaje de pasajeros. Pero es m´as, analizando las primeras cinco l´ıneas del ranking, que suman cerca del 30 % del total de viajeros en un a˜no, se observa que las tres que ocupan la segunda, tercera y cuarta posici´on transcurren por la subida de Tafira (parada de Pico Viento), acumulando la mitad 28 CAP´ ITULO 4. DETALLE DEL PROYECTO. Figura 4.5: Procesos que intervienen en la preparaci´on de los datos de ese porcentaje, el 15 % aproximadamente. Las otras dos son: la troncal de la zona sur-este de la isla que une Las Palmas de Gran Canaria con Mog´an y la l´ınea que une Puerto de Mog´an con Morro Besudo. Estas l´ıneas se denominan: Denominaci´on L´ınea Las Palmas - Puerto de Mog´an 1 Las Palmas - Campus 326 Sta. Catalina - Lomo Blanco 327 San Mateo - Las Palmas 303 Morro Besudo - Puerto de Mog´an 32 Cuadro 4.1: Denominaci´on de las l´ıneas principales. 4.3. PREPARACI ´ ON DE LOS DATOS. 29 y se muestran en la figura 4.6 Figura 4.6: Distribuci´on del 30 % de los viajeros. Las que discurren por la zona sur-este de la isla, mueven gran cantidad de viajeros en una red amplia, tanto en lo que se refiere a kil´ometros como a n´umero de paradas y l´ıneas secundarias, por lo que constituye un corredor de cierta complejidad. En cambio, analizando las tres de la zona centro se observa que: El n´umero de l´ıneas primarias y secundarias relacionadas con ´estas es limitado. El n´umero de paradas involucradas tambi´en es limitado. Hay l´ıneas de car´acter estacional. Hay l´ıneas circulares. Por lo que finalmente el conjunto de l´ıneas con las que se realiz´o este estudio son las que se de denominaron como las del Corredor Ciudad-Centro, las que aparecen en la tabla 4.9, y que discurren entre los municipios de Las Palmas de Gran Canaria, Santa Br´ıgida, Vega de San Mateo, Teror y Tejeda, tal y como se muestra en la figura 4.7. El total de anotaciones que se dispone de ellas es de algo m´as de 13 millones. 36 CAP´ ITULO 4. DETALLE DEL PROYECTO. 4.4. Modelado. Es en esta fase cuando se procede a extraer informaci´on de los datos obtenidos, pero son muchos los factores que influyen en el comportamiento de los algoritmos de miner´ıa. Uno de ellos es la calidad de los datos ya que si la informaci´on es redundante o irrelevante puede complicar los procesos de extracci´on de informaci´on. Es por ello por lo que es importante identificar y eliminar todos los atributos redundantes e irrelevantes que sea posible ([18]). 4.4.1. Selecci´on de atributos. No todos los algoritmos de aprendizaje se comportan igual: en un extremo est´an los que basan la clasificaci´on en la distancia a los elementos m´as cercanos ya clasificados, utilizando todos sus atributos, y en el otro se encuentran los ´arboles de decisi´on que se basan en los atributos que consideren relevantes ignorando los que no lo son. Dependiendo del valor de ciertos atributos, los algoritmos dividen los datos en subconjuntos que contengan la gran mayor´ıa de instancias de una de las clases, por lo que, para evitar el sobre-ajuste al conjunto de entrenamiento, ´estos deben ser lo m´as predictivos posibles. Reduciendo la dimensi´on de los datos se reduce el espacio de hip´otesis y los algoritmos son m´as r´apidos y m´as eficientes. A veces se consigue aumentar la precisi´on de la clasificaci´on, en otras puede ayudar a entender mejor el resultado. Hay que tener en cuenta que en la fase de preprocesado de los datos se incorporaron campos con cierto grado de redundancia: los relativos a intervalos de n´umero de pasajeros, de per´ıodos del d´ıa, de per´ıodos del a˜no, por lo que necesariamente hay que seleccionarlos para no disminuir la eficacia de los m´etodos. En este trabajo se seleccionaron atributos en dos momentos determinados: 1. Al inicio de la fase de modelado se realiz´o la selecci´on de atributos de forma individual, para descartar aquellos generados en la fase de preprocesado que finalmente resultaran poco significativos. En concreto se ejecutaron dos m´etodos: 4.4. MODELADO. 37 ChiSquaredAttributeEval: obtiene el nivel de correlaci´on de cada atributo respecto a la clase a partir del valor estad´ıstico Chicuadrado. Como resultado se obtuvo la relaci´on de atributos que se muestra en la tabla 4.6. average merit average rank attribute 232753.829 +-191.295 1 +- 0 p destino 231544.64 +-200.512 2 +- 0 p origen 172956.878 +-171.32 3 +- 0 t porigen 150431.508 +-209.414 4 +- 0 t pdestino 65170.052 +-196.308 5 +- 0 intervalo 5 14316.834 +-75.853 6 +- 0 t horario2 9890.938 +-60.238 7 +- 0 CP pdestino 6284.757 +-43.523 8 +- 0 mes 6009.609 +-51.506 9 +- 0 CP porigen 5533.392 +-50.984 10 +- 0 dia semana 4843.883 +-48.079 11 +- 0 t diasem 1923.835 +-27.379 12 +- 0 t estacion 1104.171 +-17.563 13 +- 0 dia 871.977 +-14.956 14 +- 0 ano 131.013 +- 8.69 15 +- 0 t lectivo Cuadro 4.6: Resultados selecci´on Chi-cuadrado GainRatioAttributeEval: eval´ua cada atributo midiendo su ganancia de informaci´on con respecto a la clase. En este caso la relaci´on de atributos es la que se muestra en la tabla 4.7. 38 CAP´ ITULO 4. DETALLE DEL PROYECTO. average merit average rank attribute 0.095 +- 0 1 +- 0 t porigen 0.082 +- 0 2 +- 0 t pdestino 0.081 +- 0 3 +- 0 p origen 0.08 +- 0 4 +- 0 p destino 0.022 +- 0 5 +- 0 intervalo 5 0.008 +- 0 6 +- 0 t horario2 0.007 +- 0 7 +- 0 CP pdestino 0.007 +- 0 8 +- 0 t diasem 0.005 +- 0 9 +- 0 CP porigen 0.002 +- 0 10 +- 0 dia semana 0.002 +- 0 11 +- 0 mes 0.001 +- 0 12 +- 0 t estacion 0.001 +- 0 13 +- 0 ano 0 +- 0 14 +- 0 dia 0 +- 0 15 +- 0 t lectivo 0 +- 0 16 +- 0 sentido 0 +- 0 17 +- 0 linea Cuadro 4.7: Resultados selecci´on Gain Ratio Considerando las coincidencias entre ellos finalmente se determina que el conjunto de campos a considerar en el modelado sea el que se muestra en la figura 4.10. Figura 4.10: Relaci´on de atributos de las instancias de entrada. Se mantienen dos campos relacionados con el n´umero de pasajeros (clase np1 y clase np2 ) puesto que, dependiendo del m´etodo escogido, se 4.4. MODELADO. 39 comparar´an los distintos resultados con uno y otro. 2. Adem´as, con algunos m´etodos se realiz´o una ejecuci´on combinada de selecci´on de subconjunto de atributos y de m´etodo de clasificaci´on, utilizando los clasificadores meta de Weka, que permiten hacer esa asociaci´on. De esta forma se eval´ua el valor de un subconjunto de atributos teniendo en cuenta la capacidad de predicci´on individual de cada caracter´ıstica, junto con el grado de redundancia entre ellos. 4.4.2. M´etodos de modelado utilizados. Debido a la naturaleza de los atributos, se han empleado algoritmos de clasificaci´on, que predicen el valor de una clase de tipo nominal, que en este trabajo son los campos relacionados con el n´umero de pasajeros (clase np1 y clase np2). Por ser los utilizados com´unmente en problemas de este tipo se eligen los siguientes: 1. Navive Bayes, clasificador de car´acter estad´ıstico, basado en las probabilidades de ocurrencia de los atributos. Es uno de los clasificadores m´as utilizados por su simplicidad y rapidez. Est´a basado en el Teorema de Bayes, tambi´en conocido como teorema de la probabilidad condicionada. Su principal caracter´ıstica es que considera que el efecto de cada uno de los atributos sobre la clase a determinar (en este caso el n´umero de pasajeros) es independiente entre ellos, y esto hace que la creaci´on del modelo sea relativamente sencilla. 2. C4.5. Clasificador que genera un ´arbol de decisi´on, y que suele ser interpretable. Utiliza la medida de ganancia de la infomaci´on para seleccionar aquellos atributos que mejor subdividen el conjunto de instancias en una clase o en otra, y que constituyen los nodos determinantes del ´arbol. Este m´etodo est´a implementado en Weka en el algoritmo J48 por lo que a partir de ahora se utilizar´a esas denominaciones indistintamente. 3. Random Forest. Es uno de los algoritmos de aprendizaje m´as certeros que hay disponibles y se basa en la creaci´on de m´ultiples ´arboles de 40 CAP´ ITULO 4. DETALLE DEL PROYECTO. decisi´on, siendo su clasificaci´on dif´ıcil de interpretar. Cada uno de estos tres algoritmos se aplic´o a su vez en cada uno de los ficheros ARFF generado por la herramienta de integraci´on de datos de Pentaho: uno por cada una de las catorce l´ıneas que constituyen el corredor y dos por el total, ya que ´este se trat´o de dos maneras: Considerando las paradas de origen y destino, conjunto que se denominar´a a partir de ahora P Considerando el tipo de parada origen y el de la parada destino, eliminado los identificadores de paradas originales, conjunto que se denominar´a a partir de ahora Tp Adem´as, tambi´en se crearon modelos con los atributos de la clase clase np1 y de la clase np2, con los significados comentados y que se muestran en la tabla 4.3: Clase np1: en los tres clasificadores. Clase np2: en los dos clasificadores que dieron mejores resultados, el C4.5 (o J48) y el Random Forest. En total se realizaron: Total clasificaciones = (14 + 2) ∗(3 + 2) = 80 (4.1) A modo de resumen, en las figuras 4.11 y4.12 se muestra el porcentaje de instancias bien clasificadas en cada uno de los casos. 4.5. Evaluaci´on de los modelos. Como ya se coment´o en la descripci´on de Weka, una cuesti´on importarte a la hora de determinar la bondad de los resultados de los algoritmos de clasificaci´on es el m´etodo de evaluaci´on seleccionado, por eso hay que indicar que en todos los casos utiliz´o como conjunto de entrenamiento el 66 % de las instancias originales y como conjunto de evaluaci´on el 34 % restante, puesto que se consiguieron resultados similares a la validaci´on cruzada siendo sensiblemente m´as r´apido, al tratarse de ficheros con un considerable n´umero de registros. 4.5. EVALUACI ´ ON DE LOS MODELOS. 41 Figura 4.11: Porcentaje aciertos obtenidos con clase np1. Para evaluar los resultados se han tenido en cuenta fundamentalmente tres de los indicadores que se muestran en la herramienta de exploraci´on de Weka: el porcentaje de instancias bien clasificadas por el modelo generado, y para cada uno de los valores de la clase a estimar dos medidas de relevancia: Precision, precisi´on: indica, para cada valor predicho de una clase, la relaci´on entre las instancias correctamente clasificadas frente al total de instancias asignadas a ese valor por el modelo. Recall, sensibilidad o exahustividad: indica la relaci´on entre las instancias correctamente clasificadas frente al total de instancias que realmente tienen ese valor. Esto permite discernir ante un porcentaje de acierto en la clasificaci´on d´onde se han producido los errores, qu´e valores de la clase han sido peor clasificados. A continuaci´on se presentan las conclusiones extra´ıdas de la bater´ıa de clasificaciones realizadas: 1. Al considerar como atributo a predecir el clase np1, es decir, si sube alg´un pasajero o no al veh´ıculo. 42 CAP´ ITULO 4. DETALLE DEL PROYECTO. Figura 4.12: Porcentaje aciertos obtenidos con clase np2. Tal y como aparece en la figura 4.11, donde se recoge el porcentaje de aciertos de cada m´etodo, hay una sensible diferencia entre los resultados obtenidos con el m´etodo Naive Bayes y los alcanzados con las otras dos t´ecnicas. Hay que puntualizar que este algoritmo no se ejecut´o con selecci´on previa de atributos puesto que, al tratarse de un algoritmo que los considera independientes entre si, daba peores resultados si se eliminaba alguno. Concretamente, el detalle de las m´etricas obtenidas en cada uno de los ficheros por ese m´etodo se presentan en la tabla de la figura 4.13. En ella se observa que realmente los ratios de precision y recall fluct´uan enormemente, por lo que finalmente no se analiza su comportamiento con la clase np2 y se desecha como clasificador. En cambio, puesto que los porcentajes de aciertos son elevados cuando se aplican los otros dos clasificadores, se decide analizar sus resultados con el atributo clase np2 que ajusta un poco m´as la cantidad de pasajeros. 2. Al considerar como atributo a predecir el clase np2, es decir, si sube 4.5. EVALUACI ´ ON DE LOS MODELOS. 43 Figura 4.13: Resultados del clasificador Naive Bayes. uno, o m´as de uno, o ning´un viajero. En estos casos, las m´etricas obtenidas se muestran en las tablas de las figuras 4.14 y4.15, y de manera resumida en la figura 4.16. Figura 4.14: Resultados del clasificador J48. Puesto que el porcentaje medio de instancias correctamente clasificadas ronda el 75 % , la primera impresi´on es que los m´etodos no han dado malos resultados. 44 CAP´ ITULO 4. DETALLE DEL PROYECTO. Figura 4.15: Resultados del clasificador Random Forest. Entrando m´as en detalle en las tablas 4.14 y4.15, se observa que realmente ambos modelos clasifican acertadamente las instancias con el valor 0, el que indica que no sube nadie a la guagua, y que es clasificando los valores 1 y 2, que hay un viajero que va desde esa parada a otra concreta o m´as de uno, cuando se cometen el mayor n´umero de errores, y esto puede tener una importancia relativa dependiendo de la aplicaci´on que se de a estos resultados. Otra cuesti´on importante es ver qu´e factores/campos dentro de los planteados inicialmente (temporales o geogr´aficos y demogr´aficos) son los que han sido utilizados por estos dos m´etodos de clasificaci´on. Con los atributos seleccionados en cada uno de los casos se ha confeccionado la tabla de la figura 4.17, donde se han destacado las columnas correspondientes a los atributos principales utilizados con ese car´acter temporal: el mes, si se trata de un d´ıa laborable o festivo (abreviado como t dsem), el campo que considera los cuatro intervalos horarios dentro del d´ıa (abreviado como t hor2), y el intervalo de 5 minutos de la hora (Int 5, que, como se consideran intervalos horarios y no horas concretas no es relevante a la 4.5. EVALUACI ´ ON DE LOS MODELOS. 45 Figura 4.16: Precision y Recall medios de cada m´etodo. hora de sacar conclusiones pr´acticas). El correspondiente a la estaci´on astr´on´omica solo fue utilizado en una ocasi´on. Figura 4.17: Atributos significativos por l´ıneas. De esta tabla se pueden extraer las siguiente conclusiones: Solo en las l´ıneas destacadas en color rojo se han utilizado todas las caracter´ısticas que se plantearon inicialmente en este trabajo (parada origen y destino y momento en el que se realiza el viaje: 52 BIBLIOGRAF´ IA [9] Differentially private transit data publication: A case study on the montreal transportation system Chen, R., Fung, B.C.M., Desai, B.C., Sossou, N.M. (2012) Proceedings of the ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, pp. 213-221. [10] Detection and improvement of deficiencies and failures in publictransportation networks using agent-enhanced distribution data mining Levner, E., Ceder, A., Elalouf, A., Hadas, Y., Shabtay, D. (2011) IEEE International Conference on Industrial Engineering and Engineering Management, art. no. 6118006, pp. 694-698. [11] Learning diagnostic diagrams in transport-based data-collection systems Tran, V.T., Eklund, P, Cook, C. (2014) Lecture Notes in Computer Science (including subseries Lecture Notes in Artificial Intelligence and Lecture Notes in Bioinformatics), 8502 LNAI, pp. 560-566. [12] The passenger demand prediction model on bus networks Zhou, C., Dai, P., Li, R. (2013) Proceedings - IEEE 13th International Conference on Data Mining Workshops, ICDMW 2013, art. no. 6754040, pp. 1069-1076. [13] Tesis Doctoral: .An´alisis de la calidad del servicio del transporte p´ublico mediante ´arboles de decisi´on”. Editorial de la Universidad de Granada 2013 Roc´ıo de O˜na L´opez ISBN: 978-84-9028-679-1 [14] The CRISP-DM Model: The New Blueprint for Data Mining Colin Shearer (2000)Journal of Data Warehousing. Volume 5, Number 4, pp. 13-23 [15] Manual CRISP DM de IBM SPSS Modeler. Copyright IBM Corporation 1994, 2012. [16] Pentaho Data Integration Beginner’s Guide Mar´ıa Carina Rold´an Packt Publishing October 24, 2013 ISBN-13: 978-1-78216-504-0 [17] Data Mining: How Research Meets Practical Development? Xindong Wu, Philip S. Yu, Gregory Piatetsky-Shapiro, Nick Cercone,T.Y.Lin, Ramamohanarao Kotagiri and Benjamin W. Wah DOI 10.1007/s10115-0030101-1 Springer-Verlag London Ltd. 2003 Knowledge and Information Systems (2003) 5: 248–261 [18] Benchmarking Attribute Selection Techniques for Data Mining. Hall MA, Holmes G. Technical Report 00/10, University of Waikato, Department of Computer Science, Hamilton, New Zealand, July 2002.