Aplicación de redes neuronales para la resolución de problemas complejos de confiabilidad y riesgo
Abstract
Programa de doctorado: Sistemas Inteligentes y Aplicaciones Numéricas en Ingeniería. La fecha de publicación es la fecha de lectura
Full text
Programa de Doctorado: Sistemas Inteligentes y Aplicaciones Numéricas en Ingeniería Instituto Universitario de Sistemas Inteligentes y Aplicaciones Numéricas en Ingeniería Tesis Doctoral Aplicación de Redes Neuronales para la Resolución de Problemas Complejos en Confiabilidad y Riesgo Mustapha Maarouf 2015
Programa de Doctorado: Sistemas Inteligentes y Aplicaciones Numéricas en Ingeniería Aplicación de Redes Neuronales para la Resolución de Problemas Complejos en Confiabilidad y Riesgo Tesis Doctoral Las Palmas de Gran Canaria 2015 UNIVERSIDAD DE LAS PALMAS DE GRAN CANARIA (ULPGC) Instituto Universitario de Sistemas y Aplicaciones Numéricas en Ingeniería (SIANI) Autor Director Mustapha Maarouf Dr. Blas José Galván González
Dedico este trabajo a mis padres.
Agradecimiento Quiero agradecer a mi familia por su apoyo. A mi tutor, Dr. Blas Galv´an Jos´e Gonz´alez, quien ha aceptado dirigir mi tesis. Estoy muy agradecido por sus esfuerzos, por sus valiosos consejos acad´emicos y no acad´emicos, por su apoyo, por su insistencia, y que ha ayudado mucho para terminar mis estudios de investigaci´on. Agradezco tambi´en a los miembros del jurado, que no s´olo accedieran a probar esta tesis, pero tambi´en que dieron su tiempo y esfuerzo para corregir mi tesis. Agradezco sinceramente a todos los profesores e investigadores con quien he tenido contacto durante mis estudios y que hayan proporcionado documentos o datos, me orientaron en mis trabajos de investigaci´on. No se me olvidan tambi´en los profesores que tuve en toda mi vida, el primer de ellos ha sido mi padre, mi gran maestro, del pasado, el presente y el futuro, siempre estar´a presente. Agradezco a mi familia sus esfuerzos y su confianza, a todos mis colegas dentro o fuera del trabajo, con los he compartido los altibajos a lo largo de los a˜nos. Por ´ultimo, un gran agradecimiento a los que no han sido nominados y que me han ayudado de alguna manera en mi camino personal y profesional.
Resumen La ingenier´ıa de Fiabilidad, Mantenibilidad, Disponibilidad y Seguridad/Riesgo (Ingenier´ıa RAMS) se enfrenta a retos importantes debido a la creciente magnitud y complejidad de muchos de los modernos procesos industriales, de su log´ıstica, de las comunicaciones necesarias para su correcto funcionamiento, de la interacci´on con el ser humano, de las amenazas externas que comprometen el correcto funcionamiento de los sistemas t´ecnicos que les dan soporte y de eventos no deseados que pueden afectar a los bienes, la naturaleza o al ser humano. Entre otros cabe citar la obtenci´on din´amica de planes ´optimos de mantenimiento basados en la condici´on de los equipos, la determinaci´on en tiempo real del nivel de riesgo asociado a determinados eventos procesos cr´ıticos, la determinaci´on del alcance de las consecuencias de sucesos no deseados (explosiones, nubes t´oxicas, vertidos marinos, etc.) y la estimaci´on de la propagaci´on de eventos dif´ıcilmente controlables como los incendios (en industrias o en el medio humano: Ciudades, Bosques, etc.). El modelado de tales procesos y eventos ha de realizarse en general usando formulaciones matem´aticas muy complejas cuya soluci´on implica frecuentemente el empleo de m´etodos num´ericos y uso intensivo de recursos de computaci´on. La soluci´on de casos reales suele por tanto ser costosa en tiempos de CPU y tardar semanas o meses hasta alcanzar valores satisfactorios. Existen sin embargo situaciones en las que no es viable esperar semanas o meses para dar soluciones a un problema, tal es el caso de la predicci´on de la evoluci´on de un vertido marino, una nube t´oxica, de una aver´ıa en un equipo cr´ıtico o un incendio forestal, entre otros. En estas situaciones es necesario obtener respuestas satisfactorias (no necesariamente ´optimas) en tiempos muy cortos (horas o minutos), lo que convierte al conjunto heterog´eneo de estas situaciones en una clase de problemas con caracter´ısticas espec´ıficas que requieren de un tratamiento diferenciado y en los que el uso de la Inteligencia Artificial (IA) adquiere especial relevancia. Entre las metodolog´ıas de IA y para esta clase problemas mencionados cabe destacar el uso de Redes Neuronales por su capacidad de
reflejar relaciones complejas entre variables y de dar respuestas r´apidas aceptables. El trabajo presentado en esta tesis doctoral se enmarca por tanto de forma general en los problemas de Ingenier´ıa RAMS y en particular en la clase de problemas complejos y/o cr´ıticos que requieren de una respuesta r´apida no necesariamente ´optima, siendo estos resueltos mediante Redes Neuronales. Como punto de partida se realiza un estudio del estado del arte de las Redes Neuronales con especial ´enfasis en sus aplicaciones para Ingenier´ıas RAMS y la clase de problemas mencionados. Se estudiar´a tambi´en el estado del arte de los modelos matem´aticos que dan soporte cient´ıfico a esos problemas centr´andose en dos modelos especialmente escogidos por su representatividad: Los de Vida ´ Util Remanente y los de Incendios Forestales. Las contribuciones de esta tesis radican no solo en novedades en el modelado de tales problemas sino tambi´en en ciertas mejoras en las Redes Neuronales que incrementan la calidad de sus soluciones cuando se aplican a esos problemas. Se ha dise˜nado un conjunto de experimentos que incluye situaciones reales complejas que son resueltos con diferentes tipos de Redes Neuronales y diversos m´etodos de entrenamiento. Diferentes m´etricas de inter´es se usan para comparar los resultados y alcanzar conclusiones contrastadas. El resultado final es la demostraci´on con base cient´ıfica de que es viable obtener un conjunto de Redes Neuronales entrenadas y validadas que permita dar respuestas r´apidas aceptables para problemas relevantes de la clase de problemas abordados.
Abstract Reliability engineering and risk analysis facing significant challenges due to the size, complexity and risks of many modern industrial processes, their logistics, of the communications necessary for its correct operation, from interacting with humans, from external threats that compromise the proper functioning of the technical systems, that support them and undesired events that may affect the property, nature or human beings. In addition, the realization of intelligent maintenance plans based on the actual condition of industrial equipment, determination of the risk level associated with hazardous industrial activities, calculation of the extent of the risk of fire, contaminating leaks, toxic clouds, the consequences of industrial accidents, etc. The modeling of such processes has been generally performed using complex mathematical formulas, whose solution often involves the use of numerical methods and intensive computing resources. The solution of real problems is usually costly in terms of CPU time; processes can employs weeks or months to reach satisfactory solutions. However, there are situations where it is not feasible to wait a long time to gets solutions, as it is the case of forecasting the forest fire behaviour, a toxic cloud or a marine spill, etc. In these situations it is necessary to get satisfactory answers in a very short time (hours or minutes), therefore the use of techniques of Artificial Intelligence (AI) is especially relevant. Among the methodologies of AI and for the above problems, there is the use of neural networks for their ability to reflect complex relationships between variables and to provide acceptable answers in short time. Therefore, we interest in performing a doctoral thesis on the application of Neural Networks to solve complex problems in Reliability and Risk. In this thesis, study and summarize of the state of the art in terms of neural networks, and industrial type applications with special emphasis on problems related to Reliability and Risk,
we will also be explored the mathematical models that give scientific support to the complex problems of Reliability and Risk, and the behavior of forest fires. Modeling and resolving these applications with different kind of neural networks, with different training methods, will be compared. Among the expected results of the proposed thesis, is to obtain a set of trained and validated neural networks, to provide rapid response to the applications considered, with an assessment of the reliability of their responses. The relevant results are validated by scientific publications in journals with impact index.
R´esum´e L’ing´enierie de la fiabilit´e, de la disponibilit´e, de la maintenabilit´e et de la s´ecurit´e (Ing´enierie FDMS) fait face `a des d´efis importants due `a la croissance de la complexit´e de nombreux processus industriels modernes, de leurs logistique, des communications n´ecessaires pour leurs correcte fonctionnement, de leurs interaction avec les humains, des menaces ext´erieures qui mettent en p´eril le bon fonctionnement des syst`emes techniques qui les soutiennent ou qui peuvent provoquer des ´ev´enements ind´esirables. La mod´elisation de ces processus doit ˆetre r´ealis´ee en utilisant des formules math´ematiques complexes. G´en´eralement, la solution implique souvent l’utilisation de m´ethodes num´eriques et des ressources qui n´ecessitent des calculs intensifs. La r´esolution des cas r´eels est g´en´eralement si coˆuteuse en termes de CPU, ainsi que les processus peuvent atteindre des semaines ou des mois pour pouvoir trouver des solutions satisfaisantes. Cependant, il y a des situations o`u ce n’est pas facile d’attendre des semaines pour r´esoudre tel probl`eme, comme le cas de la pr´evision de l’´evolution d’un feu de forˆet, un nuage toxique ou les d´etritus marins, etc. Dans ces situations, il est n´ecessaire d’obtenir des r´eponses satisfaisantes en peu de temps (question d’heures ou quelques minutes), alors que l’usage des techniques de l’intelligence artificielle (IA) est particuli`erement pertinente. Parmi les m´ethodes de l’IA et pour les probl`emes ci-dessus nomm´es, on trouve l’utilisation de r´eseaux de neurones, du a leur capacit´e de trouver des relations entre des variations complexes et qui peuvent fournir des r´eponses acceptables et rapides. Par cons´equent, notre objectif est de r´ealiser une th`ese sur l’application des r´eseaux de neurones pour r´esoudre des probl`emes complexes en mati`ere de fiabilit´e et des risques. Dans cette th`ese, le but est de r´ealiser et de r´esumer l’´etat de l’art en termes de r´eseaux de neurones, et des applications de type industriel ou ´ecologique, avec une attention particuli`ere sur les probl`emes li´es `a la fiabilit´e et les risques.
´ INDICE 3.3 Contribuciones en la Aplicaci´on de RNA en la Predicci´on de la Vida ´ Util Remanente en Equipos Industriales . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 116 3.3.1 Caracterizaci´on de la VR . . . . . . . . . . . . . . . . . . . . . . . . . . . 117 3.3.2 Caracterizaci´on del caso de Informaci´on Incompleta . . . . . . . . . . . . 117 3.3.3 Caracter´ısticas de las RNA propuestas para estimar la VR . . . . . . . . . 119 3.4 Contribuciones en la Aplicaci´on de las RNA en el Comportamiento de Incendios Forestales ........................................122 3.5 Contribuciones en la Aplicaci´on de las RNA en la estimaci´on de la demanda de energ´ıael´ectrica.....................................126 4 Experimentaci´on y Aplicaciones 129 4.1 Experimentaci´on en la Mejora del dise˜no y del uso de las Redes Neuronales Artificiales........................................130 4.1.1 Experimentaci´on para la Inicializaci´on de los pesos de una RNA . . . . . 130 4.1.2 Experimentaci´on en las funciones de activaci´on . . . . . . . . . . . . . . . 131 4.1.3 Experimentaci´on para la definici´on de la estructura de una RNA . . . . . 134 4.1.4 Conclusiones ..................................136 4.2 Experimentaci´on en el uso de las RNAs para la Predicci´on de la Vida Remanente ´ UtilenEquiposIndustriales..............................137 4.2.1 Problemapropuesto ..............................137 4.2.1.1 An´alisis de Datos y selecci´on de Entradas para el Modelo . . . . 138 4.2.1.2 Selecci´on del modelo neuronal . . . . . . . . . . . . . . . . . . . 140 4.2.1.3 Primer enfoque para la predicci´on del ´ Indice de Salud . . . . . . 141 4.2.1.4 Segundo enfoque para la predicci´on del ´ Indice de Salud . . . . . 144 4.2.2 Comparaci´on de los dos enfoques . . . . . . . . . . . . . . . . . . . . . . . 149 4.2.3 Evaluaci´on de la Fiabilidad - Rendimiento de los Modelos . . . . . . . . . 150 4.2.4 Conclusiones ..................................159 4.3 Experimentaci´on en el uso de las RNAs para la Predicci´on del Comportamiento deIncendiosForestales.................................160 4.3.1 Estructura del modelo ANNFBP . . . . . . . . . . . . . . . . . . . . . . . 160 4.3.2 Arquitectura del Modelo ANNFBP . . . . . . . . . . . . . . . . . . . . . . 160 4.3.3 Entrenamiento y Validaci´on del ANNFBP . . . . . . . . . . . . . . . . . . 161 4.3.4 Test del modelo ANNFBP con otros casos de estudio . . . . . . . . . . . . 162 4.3.5 Conclusiones ..................................169 xiv
´ INDICE 4.4 Experimentaci´on de las RNA para la estimaci´on de la Demanda de Energ´ıa El´ectrica.........................................170 4.4.1 An´alisisdedatos................................170 4.4.2 Estimaci´on de la DEE mediante regresi´on lineal y logar´ıtmica . . . . . . . 173 4.4.3 Estimaci´on de la DEE mediante Inteligencia Artificial . . . . . . . . . . . 174 4.4.3.1 MedianteMSV............................174 4.4.3.2 MedianteAG.............................176 4.4.3.3 MedianteRNA............................176 4.4.4 Eficiencia de los m´etodos . . . . . . . . . . . . . . . . . . . . . . . . . . . 177 4.4.5 Medida de confianza para la RNA . . . . . . . . . . . . . . . . . . . . . . 178 4.4.6 Conclusiones ..................................180 5 CONCLUSIONES Y L´ INEAS FUTURAS 181 Bibliograf´ıa 187 xv
´ INDICE DE FIGURAS 2.1 Matriz de memoria de correlaci´on . . . . . . . . . . . . . . . . . . . . . . . . . . . 16 2.2 ALC........................................... 18 2.3 Red con tres capas con funciones umbrales binarias . . . . . . . . . . . . . . . . . 26 2.4 Ejemplo de una Red Neuronal Recurrente . . . . . . . . . . . . . . . . . . . . . . 27 2.5 Funci´on lineal f(x) = x................................ 29 2.6 Funci´on Gaussiana f(x) = exp(−x).......................... 30 2.7 Funci´on Sigmoidal f(x) = sigm(x) .......................... 31 2.8 Funci´on Tangente hiperb´olica f(x) = Tanh(x) ................... 31 2.9 ReddeunaNeurona.................................. 34 2.10 Red Neuronal Multicapas (Lcapas) con nvariables de entrada y m variables de salida .......................................... 38 2.11 Red neuronal de tres capas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 43 2.12 Modelo conceptual para la gesti´on de incendios forestales (Burrows 1994) . . . . 71 2.13 El Sistema Canadiense de Evaluaci´on de Peligro de Incendios Forestales . . . . . 76 2.14 El ´ Indice Meteorol´ogico de Peligro de Incendios (FWI) . . . . . . . . . . . . . . . 78 2.15 Estructura del sistema de evaluaci´on de peligro de incendios de los Estados Unidos 79 2.16 Visi´on general de la gesti´on del ciclo de vida para sistemas cr´ıticos . . . . . . . . 84 2.17 Estructura general del diagn´ostico mediante RNA . . . . . . . . . . . . . . . . . . 87 2.18 Etapas del Pron´ostico acorde con ISO 13381-1 (126) ................ 89 2.19 Estrucutra general para el pron´ostico con RNA . . . . . . . . . . . . . . . . . . . 90 2.20 clasificaci´on de metodolog´ıas para la Estimaci´on de la Vida Remanente . . . . . . 92 xvii
´ INDICE DE FIGURAS 3.1 Etapas para aplicar las RNA . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 105 3.2 ProgramaNNFINDER.................................107 3.3 Evoluci´on del error (Datos 1) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 109 3.4 Evoluci´on del error (Datos 2) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 109 3.5 Funci´on α-Sigm.....................................114 3.6 Funci´on α-Tanh ....................................115 3.7 ProgramaNNCI ....................................116 3.8 Sensor4.........................................118 3.9 Estructura del modelo ANNFBP . . . . . . . . . . . . . . . . . . . . . . . . . . . 124 3.10 Algoritmo para la reducci´on de entradas . . . . . . . . . . . . . . . . . . . . . . . 125 3.11El´ındicedeFWI....................................126 3.12 Estructura del sistema FBP . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 127 3.13 El modelo neuronal para la estimaci´on de la DEE . . . . . . . . . . . . . . . . . . 128 4.1 Evoluci´on del error con Matriz de Hilbert y diferentes ejecuciones (Datos 1) . . . 130 4.2 Evoluci´on del error con matriz de Hilbert y diferentes ejecuciones (Datos 2) . . . 131 4.3 Evoluci´on del error con la funci´on de activaci´on sigmoidal y α= 2-Sigm y α= 3Sigm(Datos1) .....................................132 4.4 Evoluci´on del error con la funci´on de activaci´on sigmoidal y α= 2-Sigm y α= 3Sigm(Datos2) .....................................133 4.5 Evoluci´on del error con la funci´on de activaci´on Tanh y α= 2-Tanh y α= 3-Tanh (Datos1) ........................................133 4.6 Evoluci´on del error con la funci´on de activaci´on Tanh y α= 2-Tanh y α= 3-Tanh (Datos2) ........................................134 4.7 Definici´on de la vida remanente ´util . . . . . . . . . . . . . . . . . . . . . . . . . 137 4.8 Sensor1vssensor2 ..................................139 4.9 Sensor7vssensor12..................................139 4.10 Dispersi´on (sensor1 - sensor2) y (Sensor 7sensor 12) . . . . . . . . . . . . . . . . 140 4.11 Arquitectura de la red neuronal para la predicci´on de IS . . . . . . . . . . . . . . 141 4.12 IS modelo vs regresi´on lineal (Unidad 1) . . . . . . . . . . . . . . . . . . . . . . . 142 4.13 IS modelo vs regresi´on lineal (Unidad 6) . . . . . . . . . . . . . . . . . . . . . . . 142 4.14 IS modelo vs regresi´on lineal (Unidad 147) . . . . . . . . . . . . . . . . . . . . . . 143 4.15 IS Modelo vs Modelo Fit regresi´on (Unidad 1) . . . . . . . . . . . . . . . . . . . . 145 xviii
´ INDICE DE FIGURAS 4.16 IS Modelo vs Modelo Fit regresi´on (Unidad 6) . . . . . . . . . . . . . . . . . . . . 145 4.17 IS Modelo vs Modelo Fit regresi´on (Unidad 147) . . . . . . . . . . . . . . . . . . 146 4.18 IS modelo vs regresi´on lineal (considerando t−2, t−1 y t) (Unidad 1) . . . . . . 146 4.19 IS modelo vs regresi´on lineal (considerando t−2, t−1 y t) (Unidad 6) . . . . . . 147 4.20 IS modelo vs regresi´on lineal (considerando t−2, t−1 y t) (Unidad 147) . . . . 147 4.21 IS modelo vs regresi´on lineal (Unidad 1) . . . . . . . . . . . . . . . . . . . . . . . 148 4.22 IS Modelo vs Modelo regresi´on lineal ajustada (Fit) (Unidad 6) . . . . . . . . . . 148 4.23 IS Modelo vs Modelo regresi´on lineal ajustada (Fit) (Unidad 147) . . . . . . . . . 149 4.24 IS: primer enfoque vs segundo enfoque (Unidad 1) . . . . . . . . . . . . . . . . . 150 4.25 IS: primer enfoque vs segundo enfoque (Unidad 6) . . . . . . . . . . . . . . . . . 151 4.26 IS: primer enfoque vs segundo enfoque (Unidad 147) . . . . . . . . . . . . . . . . 151 4.27 IS vs. IS Modelo y el intervalo de confianza del modelo (Unidad 1) . . . . . . . . 153 4.28Indicador1(Unidad1).................................154 4.29Indicador2(Unidad1) .................................154 4.30Indicador3(Unidad1).................................155 4.31 IS vs. IS Modelo y el intervalo de confianza del modelo (Unidad 6) . . . . . . . . 155 4.32Indicador1(Unidad6).................................156 4.33Indicador2(Unidad6).................................156 4.34Indicador3(Unidad6).................................157 4.35 IS vs. IS Modelo y el intervalo de confianza del modelo (Unidad 147) . . . . . . . 157 4.36Indicador1(Unidad147) ...............................158 4.37Indicador2(Unidad147) ...............................158 4.38Indicador3(Unidad147) ...............................159 4.39 Comparaci´on de la predicci´on de FWI: ANNFBP vs. Estaci´on Mt Cook . . . . . 164 4.40 Predicci´on de FWI y VP mediante ANNFBP-2 y Estaci´on de Alberta . . . . . . 166 4.41 Dispersi´on matricial de los datos disponibles . . . . . . . . . . . . . . . . . . . . . 168 4.42 DEE vs. POB, Islas Canarias . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 171 4.43 DEE vs. PIB, Islas Canarias . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 172 4.44 Estimaci´on de la DEE mediante RLM . . . . . . . . . . . . . . . . . . . . . . . . 173 4.45 Estimaci´on de la DEE mediante RLog . . . . . . . . . . . . . . . . . . . . . . . . 174 4.46 Estimaci´on de la DEE mediante MSV con n´ucleo lineal . . . . . . . . . . . . . . 175 4.47 Estimaci´on de la DEE mediante MSV con n´ucleo gaussiano . . . . . . . . . . . . 175 4.48 Estimaci´on de la DEE mediante AG . . . . . . . . . . . . . . . . . . . . . . . . . 176 xix
´ INDICE DE FIGURAS 4.49 Estructura de la RNA para predecir la DEE . . . . . . . . . . . . . . . . . . . . . 177 4.50 Estimaci´on de la DEE mediante RNA . . . . . . . . . . . . . . . . . . . . . . . . 178 4.51 Porcentaje de precisi´on para datos de ajuste . . . . . . . . . . . . . . . . . . . . . 179 4.52 Porcentaje de precisi´on para datos de test . . . . . . . . . . . . . . . . . . . . . . 179 xx
´ INDICE DE TABLAS 4.1 Resultado de NNFINDER ejemplo 1 . . . . . . . . . . . . . . . . . . . . . . . . . 135 4.2 Evaluaci´onEnfoque1 .................................152 4.3 Evaluaci´onEnfoque2 .................................152 4.4 ArquitecturadelANNFBP ..............................161 4.5 Rendimiento del Modelo ANNFBP . . . . . . . . . . . . . . . . . . . . . . . . . . 163 4.6 Predicci´on de VP mediante ANNFBP vs. Observado por La estaci´on de Mt Cook basandose en modelos de Nueva Zelanda . . . . . . . . . . . . . . . . . . . . . . . 165 4.7 Evaluaci´on del modelo ANNFBP v. Estaci´on de Alberta . . . . . . . . . . . . . . 166 4.8 Evaluaci´on de la predicci´on del area quemada: ANNFBP-5 frente a las medicionesreales.......................................167 4.9 Evaluaci´on del error de estimaci´on de los m´etodos . . . . . . . . . . . . . . . . . 178 xxi
CAP ´ ITULO 1 INTRODUCCI´ ON 1
1. INTRODUCCI´ ON 1.3 Publicaciones relacionadas con la l´ınea de investigaci´on Algunas de las contribuciones de esta tesis han sido publicadas en un libro y en una revista cient´ıfica. Adem´as han sido presentadas en congresos y jornadas: 1.3.1 Proyectos Participaci´on como miembro del equipo de investigaci´on CEANI de la ULPGC, en el proyecto: “Logistic Efficiencies And Naval architecture for Wind Installations with Novel Developments – LEANWIND, ref 614020”, contribuyendo a la investigaci´on de las Aplicaciones de las RNA en Diagn´ostico y Pron´ostico de aver´ıas en Aerogeneradores. (13 de marzo del 2014Actualidad) Premio de Programa Innova Canarias 2020, para realizar el proyecto: “Uso de la Inteligencia Artificial para el Diagnostico, Fiabilidad de una Central El´ectrica en Canarias”. (01/01/2013-31/12/2013) Participaci´on como becario de investigaci´on en el proyecto CENIT L´ıderes en Energ´ıas Renovables Oce´anicas OCEAN LIDER. Investigando y aplicando las redes neuronales para el Diagn´ostico/Pronostico de los aerogeneradores. (01/02/2011 - 31/10/2012) Colaboraci´on como personal investigador de apoyo a la divisi´on “CEANI” Instituto de Sistemas Inteligentes y Aplicaciones Num´ericas en Ingeniera “SIANI” de la Universidad de Las Palmas de Gran Canaria “ULPGC”. (01/10/2010Actualidad). 1.3.2 Publicaciones Winter-Althaus, G., Gonzalez-Landin, B., Pulido-Alonso, A., Galvan-Gonzalez, B., Maarouf, M. (2015) “Long Terms Predictions Of Electricity Demand: A Challenge For Computer Engineering”. DYNA DOI: http://dx.doi.org/10.6036/7834 . Winter-Althaus, G., Gonzalez-Landin, B., Pulido-Alonso, A., Galvan-Gonzalez, B., Maarouf, M.. (2015). ”Forecasting Electricity Consumption Including Data Of The Present Economic And Financial Crisis”. Application To Canary Islands. Dyna Energ´ıa y Sostenibilidad, 4(1). 1-13. DOI: http://dx.doi.org/10.6036/ES7782 M. Maarouf, B. Galv´an. ”Prediction of Wildfire Behaviour Parameters using an Artificial Neural Network Model”. International Journal of Wildland Fire (JCR: 2.429, Estado: revisiones menores con fecha 22-08-2015). 8
1.3 Publicaciones relacionadas con la l´ınea de investigaci´on M. Maarouf, B. Galv´an. (2015) “A weight initialization method for improving training speed in feedforward neural network”. Artificial Intelligence. Elsevier Editorial. Estado: Bajo revisi´on desde 15-01-2015) A. Pulido, G. Winter, B. Gonzalez-Landin B., Galvan-Gonzalez B., Maarouf M.. “Analysis of the impact of the meteorological, tourist-related and economic variables on monthly electricity demand: Gran Canaria Island (Spain)”. Journal of Energy in Southern Africa , Estado: Bajo revision con fecha 30-07-2015) 1.3.3 Cap´ıtulos de libros The Role of Artificial Neural Networks in Evolutionary Optimisation: A Review. M. Maarouf, A. Sosa, B. Galvn, D. Greiner, G. Winter, M. Mendez, R. Aguasca. Extended Abstracts Book: Evolutionary and Deterministic Methods for Design, Optimization and Control with Applications to Industrial and Societal Problems. Universidad de Las Palmas de Gran Canaria. EUROGEN 2013. October 7-9, 2013. pp 163-168. ISBN 978-84616-6249-4 Physical Activity Classification Using Resilient Backpropagation (RPROP) with Multiple Outputs. Mustapha Maarouf, Blas J. Galv´an Gonz´alez. Computer Aided Systems Theory - EUROCAST 2013. Lecture Notes in Computer Science Volume 8111, 2013, pp 77-83 1.3.4 Congresos The Role of Artificial Neural Networks in Evolutionary Optimisation: A Review. M. Maarouf, A. Sosa, B. Galvn, D. Greiner, G. Winter, M. Mendez, R. Aguasca. Extended Abstracts Book: Evolutionary and Deterministic Methods for Design, Optimization and Control with Applications to Industrial and Societal Problems. Universidad de Las Palmas de Gran Canaria. EUROGEN 2013. October 7-9, 2013 Physical Activity Classification Using Resilient Backpropagation (RPROP) with Multiple Outputs. Mustapha Maarouf, Blas J. Galv´an Gonz´alez. Computer Aided Systems Theory - EUROCAST 2013. (Ponencia) Uso de Inteligencia Artificial en Diagnosis Remota de activos industriales: Caso de Aerogeneradores. Blas Galv´an, Mustapha Maarouf, Silvia Alonso, Juan Pedro Ramos. XV 9
1. INTRODUCCI´ ON Seminario ´ultimos Avances en Inform´atica UAI 2011. Universidad de La Laguna ULL. Tenerife. Septiembre 2011 (Ponencia). Identit´e num´erique et Apprentissage en R´eseau: Application PhD-ePortfolio. Mustapha Maarouf, Enrique Rubio Royo, Manuel Gal´an Moreno, Gin´es Delgado Cejudo. Open Digital Space for the Mediterranean Conference. March 26-29 Agadir, Morocco. (Ponencia) 1.3.5 Organizaci´on de Esta Memoria En el cap´ıtulo 2, lo m´as importante a citar aqu´ı es que se realiza una completa revisi´on del estado del arte de las RNA en lo que pueda ser de inter´es para las aplicaciones I−RAMS de esta tesis, adem´as se definen los conceptos b´asicos y necesarios para tener una conceptualizaci´on general acerca de las RNA, tanto los principios de convergencia, los intervalos de confianza. En el cap´ıtulo 3se presentan los aspectos te´oricos, metodol´ogicos y los an´alisis realizados como contribuciones originales de esta tesis, ya descritos anteriormente en resumencontri. En el cap´ıtulo 4se presentan los resultados de la experimentaci´on y aplicaci´on de las aportaciones. Finalmente, en el cap´ıtulo 5se presentan las conclusiones generales de esta tesis doctoral y las futuras l´ıneas de investigaci´on. 10
CAP ´ ITULO 2 ESTADO DEL ARTE 11
2. ESTADO DEL ARTE 2.1 Redes Neuronales Artificiales “RNAs” Una red neuronal es una herramienta potente de modelizaci´on de datos, que es capaz de captar y representar relaciones complejas entre entradas y salidas. La motivaci´on para el desarrollo de la tecnolog´ıa de las redes neuronales surgi´o del deseo de desarrollar un sistema artificial que pudiera realizar tareas “inteligentes” similares a las tareas realizadas por el cerebro humano. Las redes neuronales se asemejan al cerebro humano en dos aspectos: Una red neuronal adquiere conocimiento a trav´es del aprendizaje. El conocimiento de una red neuronal se almacena dentro de las conexiones entre las neuronas conocidas como pesos sin´apticos. La potencia y la utilidad de las Redes Neuronales Artificiales se ha demostrado en m´ultiples aplicaciones, incluyendo la s´ıntesis del habla, problemas de diagn´ostico, medicina, negocios y finanzas, control de rob´otica, procesamiento de se˜nales, visi´on artificial y muchos otros problemas que se incluyen en la categor´ıa de reconocimiento de patrones. En algunas ´areas de aplicaci´on, se espera que los modelos neuronales logren en un futuro no muy lejano rendimientos similares a los del ser humano. 2.1.1 Historia de las Redes Neuronales A continuaci´on, se describe el desarrollo hist´orico de las RNA: McCulloch y Pitts (1943) desarrollaron modelos de redes neuronales basados en su conocimiento de la neurolog´ıa y en supuestos acerca de c´omo trabajan las neuronas. Sus redes se basaban en neuronas simples, que eran consideradas como dispositivos binarios con umbrales fijos. Los resultados fueron funciones l´ogicas simples, tales como “AoB” y “AyB”. Otro intento fue mediante el uso de simulaciones por ordenador. Rosenblatt (1958) despert´o un inter´es y una actividad considerable en el campo cuando dise˜n´o y desarroll´o el perceptr´on. El perceptr´on ten´ıa tres capas, con la capa intermedia conocida como la capa de asociaci´on. Otro sistema era el Adaline (Elemento Lineal Adaptativo “ADAptive LINear Element”), que fue desarrollado en 1960 por Widrow y Hoff (en la Universidad de Stanford). El Adaline era un dispositivo electr´onico anal´ogico hecho de componentes simples. El m´etodo utilizado para el aprendizaje no solo era diferente al del perceptr´on, sino que emple´o la media de los M´ınimos Cuadrados (LMS) como regla de aprendizaje. 12
2.1 Redes Neuronales Artificiales “RNAs” El per´ıodo de frustraci´on y desprestigio: en 1969, Minsky y Papert, escribieron un libro libro (24) en que se generalizan las limitaciones de los modelos del perceptr´on con una sola capa y sistemas multicapas. Las conclusiones acentuaron el desencanto de los investigadores en el campo, causando un perjuicio considerable a las l´ıneas de investigaci´on y desarrollo. La era de Innovaci´on: aunque el inter´es p´ublico y los fondos disponibles eran m´ınimos, varios investigadores continuaron trabajando en el desarrollo de la neurociencia bas´andose en m´etodos computacionales para problemas como el reconocimiento de patrones. Durante este per´ıodo se generaron varios paradigmas que mejoraron el uso de las RNA. Anderson y Kohonen desarrollaron t´ecnicas asociativas independientes. Henry Klopf en 1972 desarroll´o una base para el aprendizaje en las neuronas artificiales fundamentada en la heterostasis, un principio biol´ogico para el aprendizaje neuronal. En 1974, Paul Werbos desarroll´o y utiliz´o el m´etodo de aprendizaje de retro-propagaci´on, sin embargo, pasaron varios a˜nos antes de que este enfoque se popularizase (15). En 1988, Steve Grossberg y Carpenter Gail fundaron una escuela de pensamiento que explora algoritmos de resonancia. Ellos desarrollaron la Teor´ıa de Resonancia Adaptativa como un arte de redes basadas en modelos biol´ogicamente plausibles (25). Las redes de retro-propagaci´on son probablemente las m´as conocidas y las m´as ampliamente aplicadas en las redes neuronales de hoy en d´ıa. En esencia, la red de propagaci´on hacia atr´as, es un perceptr´on con m´ultiples capas, una funci´on de umbral diferente en la neurona artificial, y una regla de aprendizaje m´as robusta. En 1976, Amari Shun-Ichi un investigador esencialmente dedicado a desarrollos te´oricos, public´o un documento en el que estableci´o una teor´ıa matem´atica como base de aprendizaje (m´etodo de correcci´on de errores), para la clasificaci´on de patrones. Mientras, Fukushima en (26), dio un paso m´as entrenando una red neuronal multicapa para la interpretaci´on de los caracteres escritos a mano. La red original se public´o en 1975 y fue llamada Cognitron (27,28,29). Los avances durante la d´ecada de los 70 y a principios de los 80 fueron importantes para la reaparici´on del inter´es en el campo de las RNA. Varios factores influyeron en este cambio de tendencia. Por un lado los libros publicados contribuyeron a difundir ampliamente los avances, mientras que por otro lado las conferencias globales proporcionaron foros t´ecnicos de discusi´on para los especialistas. Siendo amplia y positiva la respuesta y acogida ambos tipos de actividades. Los medios de comunicaci´on recogieron el aumento de la actividad y 13
2. ESTADO DEL ARTE crearon tutoriales ayudando a difundir la tecnolog´ıa. Aparecieron programas acad´emicos y cursos que se introdujeron en la mayor´ıa de las principales universidades (en EE.UU. y Europa). Hoy en d´ıa se ha hecho un progreso significativo en el campo de las RNA, suficiente como para atraer una gran atenci´on de organismos y entidades, lo que permite financiar la investigaci´on en este campo en muchos frentes. Como fruto de ello est´an surgiendo tanto conceptos neuronales como aplicaciones nuevas para resolver problemas complejos. Existen evidencias razonables, a favor de una percepci´on generalizada en muchos investigadores, de que en la actualidad se est´a en un periodo de transici´on hacia modelos neuronales mucho m´as avanzados. 2.1.2 Ventajas de las Redes Neuronales Artificiales Muchas son las t´ecnicas inform´aticas que pueden utilizar las redes neuronales artificiales, con su notable capacidad de entender el significado / naturaleza de los datos complejos o imprecisos, para extraer patrones y detectar tendencias de dif´ıcil detecci´on. Las ventajas incluyen: Aprendizaje adaptativo: una habilidad para aprender a hacer las tareas basandose en los datos proporcionados para el entrenamiento o la experiencia inicial. Auto-organizaci´on: una RNA puede crear su propia organizaci´on, o representaci´on, de la informaci´on que reciba durante el proceso del aprendizaje. Operaciones en Tiempo Real: los c´alculos de las RNA pueden llevarse a cabo en paralelo, y en la actualidad se dise˜nan y fabrican dispositivos hardware especiales para aprovechar esta capacidad. Tolerancia de los fallos a trav´es de la codificaci´on de informaciones redundantes: la destrucci´on parcial de una red conduce a la correspondiente degradaci´on del rendimiento. Sin embargo, algunas capacidades de la red pueden ser retenidas incluso con da˜nos en la red principal. 2.1.3 Las Redes Neuronales Artificiales vs. los Equipos Convencionales Las redes neuronales artificiales adoptan un enfoque diferente que el proporcionado por los ordenadores convencionales, para la soluci´on de problemas, y se debe a que: 14
2.1 Redes Neuronales Artificiales “RNAs” Los ordenadores convencionales utilizan una aproximaci´on algor´ıtmica, es decir, el ordenador sigue un conjunto de instrucciones con el fin de resolver un problema, pero solo podr´a hacerlo si son conocidos los datos espec´ıficos que el algoritmo necesita. Eso limita la capacidad de generalizaci´on. No obstante es evidente que los ordenadores ser´ıan mucho m´as ´utiles si pudiesen resolver problemas para los cuales se desconoce la aproximaci´on algor´ıtmica que permitir´ıa resolverlos. Las redes neuronales por otra parte, procesan la informaci´on de una manera similar al cerebro humano. La red est´a compuesta de un gran n´umero de elementos de procesamiento altamente interconectados (neuronas) que trabajan en paralelo para resolver un problema espec´ıfico. Las redes neuronales aprenden con los ejemplos. La red neuronal puede descubrir c´omo resolver un problema por s´ı misma, su funcionamiento puede llegar a ser impredecible. Mientras que los ordenadores convencionales utilizan un enfoque cognitivo totalmente predecible y si algo sale mal se debe a un fallo de hardware o software. Las redes neuronales y los algoritmos convencionales no compiten, sino que se complementan entre s´ı. Hay tareas que son m´as apropiadas para un enfoque algor´ıtmico, como las operaciones aritm´eticas, y tareas que son m´as adecuadas para un enfoque neuronal. M´as a´un, un gran n´umero de tareas requieren de sistemas que utilizan una combinaci´on de los dos enfoques (normalmente un ordenador convencional se utiliza para supervisar la red neural) para llevarlas a cabo con la m´axima eficacia. 2.1.4 Las predicciones mediante las RNA Predecir lo que puede suceder en el futuro siempre ha sido visto como una actividad misteriosa, que los cient´ıficos tratan de convertir en una actividad cient´ıfica basada en teor´ıas y modelos. En la sociedad moderna, la predicci´on se puede utilizar en muchos problemas del mundo real para poner a prueba nuestra comprensi´on cient´ıfica del comportamiento de una variedad de sistemas o fen´omenos complejos. Tambi´en se puede utilizar la predicci´on como una gu´ıa potencial o base para la toma de decisiones, especialmente en la prevenci´on de cat´astrofes y / o en la mitigaci´on del alcance de sus consecuencias. En la actualidad, la predicci´on cient´ıfica es utilizada para abordar varios problemas dif´ıciles como lo son la mayor´ıa de problemas existentes en el mundo real, en una variedad de campos y aplicaciones tales como las previsiones financieras y las predicciones del medio ambiente. 15
2. ESTADO DEL ARTE 2.1.5 Presentaci´on General, Definiciones y Teoremas En esta secci´on se presentan los conceptos, fundamentos, teoremas y definiciones que son importantes a la hora de entender y aplicar las Redes Neuronales Artificiales. 2.1.5.1 Definiciones y Teoremas Definici´on 1 La distancia de Hamming se define como: ρ(a, b) = 1 2 n X i=1 |ai−bi| Teorema 1 Sea x(1), x(2), ..., x(p)un conjunto aleatorio de patrones x(i)∈ {−1,1}nbipolares. Si x∈ {−1,1}nse encuentra a una distancia de Hamming de n 2pde un patr´on x(m), es decir: ρ(x, xm) = n 2p Entonces: x(m)es el patr´on m´as cercano a x.∀i∈ {1,2, ..., p}−{m}:ρ(x, x(i))⩾n 2p La condici´on n 2pes suficiente para la convergencia, pero no es necesaria. Definici´on 2 La matriz de correlaci´on entre x(1), x(2), ..., x(n)yy(1), y(2), ..., y(n)yi= n P j=1 Mijxi,y una matriz M= p P m=1 y(m)x(m)T ⇒Mij = p X m=1 (y(m)x(m)T)ij = p X m=1 yi(m)xj(m)T Fig. 2.1: Matriz de memoria de correlaci´on La cuesti´on es poder encontrar una matriz M∈ <n∗mde tal manera que: Ma(i)=b(i),∀i∈ {1,2, ..., p},es decir Ma =b. 16
2.1 Redes Neuronales Artificiales “RNAs” Proposici´on 1 La tres propiedades siguientes son equivalentes: ∀A∈ <n∗p, ATA∈ <p∗p, A es invertible ⇔hA=a(1), a(2), ..., a(p), v1a(1) +v2a(2) +... +vpa(p)= 0 ⇔v1=v2=... =vpi ⇔A un vector linealmente independiente en <n Teorema 2 Sea A∈ <n∗p, linealmente independiente. Entonces: ∀B∈ <m∗p:∃M∈M(n∗m)de tal manera que: MA =B Ejemplo 1 Se puede considerar por ejemplo la matriz como: M=B(ATA)−1AT Definici´on 3 Sea Xes la matriz inversa generalizada de A Xes la matriz inversa generalizada deA⇔ AXA =A XAX =X (AX)T=AX (XA)T=XA Se suele anotar la matriz inversa generalizada como: A# Proposici´on 2 ∀A∈ <m∗n,AA#es la proyecci´on ortogonal de Asi: AA#= (AA#)T= (AA#)2 Nota 1 Si rang(A) = n⇒A#= (ATA)−1ATSi rang(A) = m⇒A#=AT(AAT)−1 Definici´on 4 k.kFF-norm en <m∗n: kAkF 2=Tr(ATA) = n X i=1 (ATA)ii = m X j=1 n X i=1 ATijAji = m X j=1 n X i=1 A2ij Por lo tanto se puede obtener: Tr(AB) = Tr(BA) y Tr(AT) = Tr(A) , Tr(ATB) = Tr(ABT) = Tr(BAT) = Tr(BTA) Teorema 3 Sea A∈ <n∗p,B∈ <m∗p: X=BA#∈ <m∗n= min kXA −BkF Cualquier matriz Xque satisface: X=BA#B, se considera como una soluci´on m´ınima. 17
2. ESTADO DEL ARTE Definici´on 5 Sea S1, S2∈ <n, linealmente separables ⇔ ∃w∈ <n,∃θ∈ < : n X i=1 wixi> θ, ∀x∈S1 n X i=1 wixi< θ, ∀x∈S2 ⇔S1yS2se encuentran en lados opuestos de un hiperplano: n P i=1 wixi=θ∈ <n Teorema 5 (Teorema de Convergencia del Perceptr´on Simple) Sea S1, S2∈ <n, y C= (C1)∪(−C2)donde: S1⊂C1∈ <n+1, S2⊂C2∈ <n+1 y= (−1, x)∈ <n+1 S1, S2son linealmente separables. Sea y(k)cualquier secuencia de los vectoresy(k)∈C Y si y∈Cocurre infinitas veces en y(k) w(1) ∈ <n+1 arbitrario. w(k+1) =(w(k)si w(k)y(k)>0 w(k)+y(k)si no. ∃N∈N:w(N).y > 0,∀y∈C. Es decir, que despu´es de Netapas finitas de iteraciones, todas las entradas y los pesos no cambian. Demonstraci´on (Teorema de Convergencia del Perceptr´on Simple) Al definir α(k)de tal forma que: w(k+1) =w(k)+α(k)y(k) Donde: α(k)=(0si w(k)y(k)>0 1si no ∀k Al tener en cuenta tambi´en que: α(k)y(k)w(k)⩽0∀k. Entonces: w(k+1) =w(k)+α(k)y(k) w(k+1) =w(k−1) +α(k−1)y(k−1) +α(k)y(k) w(k+1) =w(1) +α(1)y(1) +... +α(k)y(k) Como S1yS2son L.S⇒∃ˆw∈ <n+1 : ˆwy > 0∀y∈C Sea ζ= min {ˆwy, y ∈C} Entonces: ζ > 0Por lo tanto: ˆwy(k)⩾ζ, ∀kY as´ı: w(k+1) ˆw=w(1) ˆw+α(1)y(1) ˆw+... +α(k)y(k)ˆw ⇒w(k+1) ˆw⩾w(1) ˆw+ (α(1) +... +α(k))ζ Aplicando la inigualdad de Shwartz (w(k+1) ˆw⩽ w(k+1) kˆwk) , se obtiene: w(1) ˆw+ (α(1) +... +α(k))ζ⩽ w(k+1) kˆwk 24
2.1 Redes Neuronales Artificiales “RNAs” Por otra parte: w(k+1) 2=w(k+1)w(k+1) w(k+1) 2=w(k)+α(k)y(k)w(k)+α(k)y(k) w(k+1) 2= w(k) 2+α(k)2 y(k) 2+ 2 w(k)α(k)y(k) | {z } ⩽0 w(k+1) 2 ⩽ w(k) 2+α(k)2 y(k) 2,(seg´un la definici´on de α(k),α(k)2=α(k)) w(k+1) 2 ⩽ w(1) 2+α(1) y(1) 2+... +α(k) y(k) 2 w(k+1) 2 ⩽ w(1) 2+α(1) +... +α(k)K, siendo k= max kyk2,∀y∈C w(k+1) 2 ⩽ w(1) 2+N(k)K, siendo N(k)=α(1) +... +α(k) As´ı que: w(k+1) 2 ⩽ w(1) 2+N(k)K < w(1) +pN(k)√K2 w(k+1) kˆwk⩾w(1) ˆw+N(k)ζ Entonces: N(k)κ⩽w(1) +`√N(k)⇒N(k)⩽b+c√N(k)As´ı que N(k)tiene un posible valor mayor (extremo), y como N(k+1) ⩾N(k)(una serie decreciente), entonces la serie N(k) converge. ∃N∈N:α(N)=α(N+1) =... = 0 ⇒w(N)y > 0,∀y∈C Despu´es de N, los pesos no cambian. Observaci´on La condici´on de “linealmente separable” era suficiente para la demonstraci´on, y no hizo falta saber ˆw. Definici´on 6 S1, S2(∈ <l)son linealmente separables estrictamente (L.S.S). ⇔ ∃!v∈ <l, θ ∈ <, δ > 0 : (v.x > θ +δ∀x∈S1 v.x < θ −δ∀x∈S2 Teorema 6 Sea C∈ <l+1,∃ˆw∈ <l+1, δ > 0 : ˆw.y > δ ∀y∈C∀y(k)∈C (w(k))secuancia: w(k+1) =w(k)+α(k)y(k); donde α(k)=(0si w(k)y(k)>0 1si no. ⇒ ∃M:α(1), α(2), ..., α(k)=N1(k)⩽M∀k = 1,2, ... Es decir α(k)→0, k suficientemente grande, los pesos no cambian. Nota 3 Cuando S1, S2son L.S.S, no necesariamente se puede separar todos los vectores de S1, yS2, porque puede que al elegir w(1) arbitrario, se obtiene: w(1)y(i)>0,∀i. Lo que demuestra la imposibilidad de obtener una clasificaci´on del todo satisfactoria. 25
2. ESTADO DEL ARTE Teorema 7 Sea mclases Silinealmente separables en el sentido de que existe: w1∗, w2∗, ..., wm∗∈ <n:wi∗x>wj∗x∀x∈Si. Si (x(k))es una serie de S=S1∪... ∪Sm, cada patr´on de esta serie aparece a menudo en S. Entonces, despu´es de un n´umero finito de iteraciones la serie converge. Fig. 2.3: Red con tres capas con funciones umbrales binarias Definici´on 7 Sea funa funci´on de paridad de orden nsi: f: [0,1]n→ {0,1} f(x) = f(x1, ..., xn) = 1 si n X i=1 xi= 2k+ 1 f(x1, ..., xn)=1si n X i=1 xi= 2k i.e f(x1, ..., xn) = 1 2(1 −(−1)x1+...+xn) Teorema 8 No se puede implementar una funci´on de paridad de orden n, como un perceptr´on simple con nentradas. Teorema 9 Se puede implementar una funci´on de paridad de orden n, como una red de tres capas de funciones umbrales binarias con nentradas. La figura 2.3, es un ejemplo gr´afico de una red de tres capas de acuerdo con el teorema 9. M´etodo 1 (Algoritmo de Ho-Kashyap (31)) . El objetivo es poder clasificar S1, S2(∈ <l). Sea S1⊂C1∈ <l+1, S2⊂C2∈ <l+1, C=C1∪(−C2). Entonces hay que encontrar: w, b ∈ <N,∀y∈C:y= (y(1), ..., y(N))que satisface wy(i)= bi>0∀i. Sea b(1) arbitrario, b(1)j>0∀1⩽j⩽N. w(k)=y#b(k)yb(k+1) =b(k)+α∆b(k), α > 0 26
2.1 Redes Neuronales Artificiales “RNAs” Como el error se define: e(k)=yw(k)−b(k),entonces: b(k+1) =b(k)+α(ej(k)si ej(k)>0 0si no Teorema 10 Si S1, S2son L.S (linealmente separables) entonces: si ∀k, ej(k)⩽0⇒e(k)= 0. Se puede encontrar ej(k)<0entonces S1, S2no son L.S. Teorema 11 Si S1, S2son L.S, 0< α < 2. El algoritmo converge a una soluci´on despu´es de un n´umero finito de iteraciones. yw =b, J =kyw −bk2=1 2kyw −bkF 2=1 2 N P j=1 (y(j)Tw−bj)2 dJ dbj=−(y(j)Tw−bj)⇒dJ dbj=−(yTw−b) b(k+1) =b(k)+αdJ db =b(k)−α(yTw−b),yw(k)=y#b(k) 2.1.5.4 Conclusiones Fundamentales En (32) han demostrado que cualquier red neuronal “recurrente”, por muy compleja que pueda ser, se puede representar de una forma particular, llamada Can´onica, que contiene una red neuronal “no recurrente” (sin bucles) donde algunas salidas vuelven a formar parte de las entradas (con un retardo de una unidad). Esta forma consiste, por lo tanto, en un gr´afico c´ıclico (ver figura 2.4). Fig. 2.4: Ejemplo de una Red Neuronal Recurrente En (22) Hornik et. al han demostrado que cualquier funci´on suficientemente regular acotada, se puede aproximar uniformemente, con una precisi´on arbitraria, en un espacio 27
2. ESTADO DEL ARTE finito de sus variables, mediante una red neuronal con una capa oculta de neuronas finitas, teniendo todas la misma funci´on de activaci´on y una neurona de salida lineal. En (33), se demuestra que el n´umero de par´ametros del modelo (en este caso la red neuronal) aumenta exponencialmente con el n´umero de variables cuando se usan aproximadores lineales, y aumenta linealmente cuando se usan aproximadores no lineales. La lentitud del entrenamiento es m´as notable cuando el n´umero de entradas del modelo es m´as grande: para un modelo de una o dos entradas, se puede utilizar un modelo lineal con respecto a sus par´ametros (por ejemplo: un polinomio) o un modelo no lineal respeto a sus par´ametros (por ejemplo: una red neuronal). 2.1.5.5 Funciones de Activaci´on Entre las neuronas que forman la red neuronal artificial existe un conjunto de conexiones que las unen. Cada neurona transmite se˜nales a aquellas que est´an conectadas con su salida. La funci´on de activaci´on de una neurona es la funci´on que relaciona la informaci´on de entrada de la neurona con el siguiente estado de activaci´on que tenga esa neurona. Cuando se dise˜na una red neuronal deben establecerse los valores de activaci´on para cada neurona, y decidir con qu´e funci´on de activaci´on la neurona procesar´a las entradas hacia las dem´as neuronas. Por lo tanto, la funci´on de activaci´on act´ua sobre las se˜nales de entrada, sobre los pesos sin´apticos asociados y sobre el valor de activaci´on que ten´ıa la neurona en el momento de recibir las se˜nales. En esta secci´on se presentan las funciones de activaci´on m´as comunes y usualmente utilizadas: 1. Funci´on de escal´on binaria La funci´on de escal´on binaria o escal´on de Heaviside “Binary threshold function”, tambi´en llamada funci´on escal´on unitario. Es una funci´on discontinua cuyo valor es 0 para cualquier argumento negativo, y 1 para cualquier argumento positivo. Y se define como: ϕ(v) = (1 si v ⩾u 0 si v < u 2. Funci´on de escal´on bipolar Llamada “bipolar threshold function”, se define como: ϕ(v) = (1 si v ⩾u −1 si v < u 28
2.1 Redes Neuronales Artificiales “RNAs” −4−2 2 4 −4 −2 2 4 x f(x) Fig. 2.5: Funci´on lineal f(x) = x 3. Funci´on lineal ϕ(v) = tv 4. Funci´on lineal a tramos “Hard-limited linear function” ϕ(v) = 0 si v < 1 2 v+1 2si - 1 2⩽v < 1 2 1 si v⩾1 2 5. Funci´on de Activaci´on competitiva ϕ(v) = (1 si n es m´aximo 0 si no 6. Funci´on Gaussiana y=ce−x σ 7. Funci´on Sigmoidal “Sigm” La funci´on sigmoidal se define como: y= 1/(1 + e−x) = f(x) (2.2) Es una funci´on continua, que tiende a 1 cuando x >> 0, y tiende a 0 cuando x << 0, 29
2. ESTADO DEL ARTE 5 10 15 20 25 0.5 1 x f(x) Fig. 2.6: Funci´on Gaussiana f(x) = exp(−x) igual a 1 2cuando x= 0. Y calculando su derivada se obtiene: dy dx =d dx(1 1 + e−x) dy dx =d dx(1 + e−x)−1 dy dx = (−1) ×(1 + e−x)−2×(−1) ×e−x dy dx =1 1 + e−x×e−x 1 + e−x dy dx =1 1 + e−x×1 + e−x−1 1 + e−x dy dx =1 1 + e−x×1 + e−x 1 + e−x−1 1 + e−x Por lo tanto: dy dx =y(1 −y) (2.3) 8. Funci´on Tangente hiperb´olica “Tanh”: Tambi´en cumple la condici´on de continuidad, y su primera derivada es f´acil de calcular como en la ecuaci´on 2.3, y se define como: y=tanh(x 2) = g(x) y=1−e−x 1 + e−x(2.4) Es decir: y=2 1+e−x−1 y= 2f(x)−1 = g(x), siendo fla funci´on sigmoidal anterior. 30
2.1 Redes Neuronales Artificiales “RNAs” −20 −10 10 20 0.2 0.4 0.6 0.8 1 x f(x) Fig. 2.7: Funci´on Sigmoidal f(x) = sigm(x) Calculando la derivada de la Tanh se obtiene: dy dx = 2df(x) dx dy dx = 2f(x)(1 −f(x)) (2.5) −8−6−4−2 2468 −0.8 −0.6 −0.4 −0.2 0.2 0.4 0.6 0.8 x f(x) Fig. 2.8: Funci´on Tangente hiperb´olica f(x) = T anh(x) Nota 4 En (34), se presenta un estudio exhaustivo de los motivos por los que se usa la funci´on Tanh para resolver los problemas no lineales. 31
2. ESTADO DEL ARTE 2.1.6 El Aprendizaje Num´erico Dentro las propiedades deseadas de una red neuronal, la m´as fundamental es su capacidad de aprender de su entorno y de mejorar su rendimiento a trav´es de su aprendizaje. Pero ¿qu´e es el aprendizaje? La noci´on del aprendizaje es clara e intuitiva para los seres humanos y los animales, es un proceso cognitivo que tiene que hacer el individuo para realizar una tarea especificada. T´ıpicamente, estos procesos se suelen efectuar a partir de pruebas, hasta que se pueda aprender a realizar tal tarea de una manera efectiva. Por ejemplo, cuando se ense˜na a un ni˜no leer o escribir, al final del aprendizaje el ni˜no ser´a capaz de leer y escribir, pero no solamente las formas de escritura de aquellos libros que se usaron para su ense˜nanza, sino otras debido a la capacidad de generalizar adquirida en el proceso de aprendizaje . El aprendizaje num´erico tiene el mismo objetivo, poder aprender y generalizar. Con la ayuda de procesos num´ericos de programaci´on y algoritmos, y realizar predicciones dependiendo de las entradas. En el contexto de redes neuronales, se adopta esta definici´on: Definici´on 8 El aprendizaje es un proceso din´amico e iterativo que permite modificar los par´ametros de la red como respuesta a los est´ımulos que recibe de su entorno. El tipo de aprendizaje se determina de c´omo se producen los cambios en los par´ametros de la neurona. En la mayor´ıa de las referencias bibliogr´aficas, el aprendizaje se traduce como el cambio o la modificaci´on de la eficiencia sin´aptica, es decir los cambios de los par´ametros (pesos) de la red. La manera tradicional de cambiar los pesos es mediante su diferencia: ∆wij(t) = wij (t+ 1) −wij(t) (2.6) Un conjunto de reglas bien definidas permiten realizar tales procesos, lo que se llama “Algoritmo de Aprendizaje de la Red”. En el contexto de la definici´on 8, se pueden distinguir dos tipos de aprendizaje: aprendizaje “supervisado” y aprendizaje “sin supervisi´on” (no-supervisado). 2.1.6.1 Aprendizaje Supervisado Se ha visto en el apartado anterior, que una red realiza una relaci´on algebraica entre sus entradas y salidas. Por lo tanto se puede asignar a la red una tarea, y realizar una funci´on algebraica no lineal, que puede ser: 1. Anal´ıticamente conocida: Por ejemplo, aproximar una funci´on. 32
2.1 Redes Neuronales Artificiales “RNAs” 2. Anal´ıticamente desconocida: Cuando se dispone de valores resultantes mediante mediciones, registros, etc. Por lo tanto, la red realiza lo que se llama un modelado estad´ıstico, o un modelado de regresi´on. Este ´ultimo tipo de aplicaciones, funci´on algebraica no lineal anal´ıticamente desconocida, es el motivo principal por el cual se implementan mucho las redes neuronales mediante el aprendizaje supervisado. Los puntos para los que se dispone de valores que deben ser la salida de la red de acuerdo a las entradas correspondientes, son los que posibilitan el aprendizaje “supervisado”. Despu´es del entrenamiento, la red neuronal se eval´ua usando conjuntos de entrada y salida conocidos, proporcion´andole s´olo valores de entrada y midiendo la cercan´ıa de las salidas de la red con respecto a las salidas correctas. 2.1.6.2 Aprendizaje no-supervisado En el aprendizaje no supervisado, a la red neuronal no se le proporcionan las salidas objetivo durante el aprendizaje. Las redes neuronales no-supervisadas suelen realizar alg´un tipo de compresi´on de datos, tales como la reducci´on de dimensionalidad o agrupamiento. Las redes neuronales de aprendizaje no supervisado m´as estudiadas son las “mapas de Kohonen”. 2.1.7 Conceptos b´asicos de una Red Neuronal Una red neuronal es una funci´on no lineal, parametrizable con valores definidos. (Se mencionar´a en adelante la palabra red neuronal lineal, solo por distinguir que su funci´on de activaci´on es lineal). Una representaci´on sencilla de una neurona artificial se muestra en la figura 2.9 que se inspira del modelo de una neurona biol´ogica (35). y=f(w0+ n X i=1 wixi) Donde: f: es la funci´on de activaci´on, y: es la salida de la neurona, xi,∀1⩽i⩽nson las variables de entrada, wi,∀1⩽i⩽nson los par´ametros (llamados tambi´en pesos de la red neuronal), y w0se llama bias o la polarizaci´on, que representa el umbral de activaci´on de la neurona (en general w0=−1). 33
2. ESTADO DEL ARTE Sea ∀t∈[−2Nπ, 2Nπ] : P m,n=1 amn cos(mx) cos(ny)−P m,n=1 amn (τ(mx +ny) + τ(mx −ny)) ⩽P m,n=1 |amn|ε 4(N+1)2K+ε 4(N+1)2K X m,n=1 amn cos(mx) cos(ny)−X m,n=1 amn (τ(mx +ny) + τ(mx −ny)) <X m,n=1 ε 2(N+ 1)2 X m,n=1 amn cos(mx) cos(ny)−X m,n=1 amn (τ(mx +ny) + τ(mx −ny)) <ε 2 Pero como τse puede representar como: τ(t) = M P j=1 wistep(t−θj). Entonces: X m,n=1 amn (τ(mx +ny) + τ(mx −ny)) = X m,n=1 amnwj(step(mx +ny −θj)−step(mx −ny −θj)) Que es justo una representaci´on de la formulaci´on matem´atica de una red neuronal. 2.1.9.2 Clasificaci´on Un clasificador es un algoritmo que asigna autom´aticamente una clase (o categor´ıa) a un determinado patr´on. Antes de considerar el caso espec´ıfico de clasificadores “neuronales”, es importante comprender las caracter´ısticas b´asicas de los problemas de clasificaci´on. Las redes con dos capas (una capa oculta, con funci´on de activaci´on sigmoidal), permiten generar fronteras de decisi´on convexas (abiertas o cerradas), mientras que las redes de tres capas ocultas, y funciones de activaci´on no lineales, permiten generar fronteras de decisi´on c´oncava o convexa (abierta o cerrada). Hay que tener en cuenta que una curva o superficie convexa no implica ning´un cambio en el signo de la concavidad, mientras una c´oncava implica un punto de inflexi´on. Los componentes de un problema de clasificaci´on suelen ser: 1. un conjunto de Npatrones; 2. nvariables (o caracter´ısticas) que describen los patrones y son relevantes para la tarea de clasificaci´on; 3. un conjunto de Cclases al que los patrones deben ser asignados (una de las clases puede ser una clase de rechazo en la que todos los patrones que no pueden ser asignados a las otras clases ser´an clasificados) 40
2.1 Redes Neuronales Artificiales “RNAs” Por lo tanto, la soluci´on de un problema de clasificaci´on requiere encontrar una aplicaci´on del conjunto de patrones que debe ser clasificado en un conjunto de clases. Es importante darse cuenta de que los clasificadores estad´ısticos, tales como las redes neuronales, no son apropiados para resolver todos los problemas de clasificaci´on: hay muchos m´etodos de clasificaci´on alternativos disponibles. En (36) se muestra una serie de ejemplos que ilustra el ´ambito de la aplicaci´on de las redes neuronales para la tarea de clasificaci´on. 2.1.10 Retro-Propagaci´on 2.1.10.1 Repaso Hist´orico del Algoritmo de Retro-Propagaci´on A finales de 1950, se introdujeron dos redes neuronales artificiales que han tenido un gran impacto en los actuales modelos de redes neuronales. La primera de ellas se conoce como el perceptr´on y contiene unidades lineales con umbral, es decir, las salidas son cero o uno. La segunda contiene unidades lineales con umbral, a partir de unidades Adaline que tienen una salida lineal sin un umbral. Estas redes utilizan una regla de aprendizaje que se llama la regla delta (17). El principal inconveniente de estos dos modelos de redes neuronales son sus limitaciones. In (24) Minsky y Pitts mostraron que tales redes son s´olo capaces de asociar entradas linealmente separables. Minsky y Papert tambi´en observaron que estas limitaciones se pueden superar si se introduce una capa intermedia de m´as. En ese momento, sin embargo, no se conoce ninguna regla de aprendizaje eficiente para las redes con capas intermedias. En 1985, se reportaron varios esquemas de aprendizaje para la adaptaci´on de estas conexiones como lo muestran los trabajos de Parker y LeCun (16,37). En esta apartado, se va a centrar exclusivamente en la regla delta generalizada que se introdujo en 1986. La aplicaci´on de la regla delta generalizada requiere dos fases. En La primera fase, la entrada se propaga hacia adelante a las unidades de salida, donde se mide el error de la red. En la segunda fase, el error se propaga hacia atr´as a trav´es de la red y se utiliza para la adaptaci´on de las conexiones. Debido a la segunda fase, este procedimiento se conoce hoy en d´ıa como el m´etodo de propagaci´on hacia atr´as del error (Retro-Propagaci´on). Es importante se˜nalar que este procedimiento es similar a un algoritmo descrito mucho antes por Werbos en 1974. 2.1.10.2 Introducci´on El m´etodo de entrenamiento m´as popularmente usado es el algoritmo de retro-propagaci´on, que usa esencialmente el gradiente descendente. Para el algoritmo del gradiente descendente, 41
2. ESTADO DEL ARTE un tama˜no de paso, que se denomina: la tasa de aprendizaje, debe ser especificado. La tasa de aprendizaje es crucial para la propagaci´on hacia atr´as de los cambios de pesos. Pero ante un cambio no adecuado en la tasa de aprendizaje, el entrenamiento puede sufrir problemas de convergencia lenta, ineficiencia y falta de robustez. Elegir tasas de aprendizaje peque˜nas tiende a retardar el proceso de aprendizaje, mientras que las grandes tasas de aprendizaje pueden provocar oscilaciones de la red en el espacio de pesos. Una forma de mejorar el m´etodo de gradiente decendente original, es incluir un par´ametro adicional llamado momentum, para permitir que tasas m´as grandes de aprendizaje, produzcan una convergencia m´as r´apida y una reducci´on al m´ınimo de la tendencia a oscilar (17). La idea de introducir el t´ermino momentum consiste en dirigir el cambio de peso en el pr´oximo paso, en la misma direcci´on que la etapa anterior, y por lo tanto reducir el efecto de oscilaciones mayores en las tasas de aprendizaje. In (38), Yu et al. describen un m´etodo din´amico de optimizaci´on adaptativo de la tasa de aprendizaje usando su derivada. Tambi´en se ha mostrado que el paso se puede determinar efectivamente mediante el establecimiento de la relaci´on entre la propagaci´on hacia atr´as y el m´etodo del gradiente conjugado. 2.1.10.3 Algoritmo de entrenamiento: Retro-Propagaci´on y RPROP El algoritmo de Retro-Propagaci´on tambi´en conocido como BCP, o con el nombre propagaci´on hacia atr´as, en ingl´es “Back-Propagation”. La retro-propagaci´on es un algoritmo supervisado de las redes multicapas. Requiere dos pasos de c´alculo: 1. la propagaci´on de la activaci´on (paso hacia delante) 2. retro-propagaci´on de errores (paso hacia atr´as) La retro-propagaci´on funciona de la siguiente manera: se propaga la activaci´on de la entrada a la capa oculta, y de la capa oculta a la capa de salida, se calcula el error en las unidades de salida, de nuevo se propaga el error en las unidades ocultas y luego a las unidades de entrada. BCP tiene un poder de aproximaci´on universal, es decir, dada una funci´on contin´ua, existe una red de tres capas (una capa oculta) que puede ser entrenada mediante la retro-propagaci´on con el fin de aproximar esta funci´on. Aunque el algoritmo de retro-propagaci´on es el algoritmo de entrenamiento conexionista m´as conocido y utilizado, es computacionalmente caro y a veces lento, y no resuelve satisfactoriamente los problemas de gran tama˜no en general, incluso la soluci´on encontrada puede ser atrapada en un m´ınimo local y no global. Estas dificultades se han intentado superar mediante sucesivas mejoras en el algoritmo. 42
2.1 Redes Neuronales Artificiales “RNAs” Luego en resumen, dos par´ametros importantes se utilizan para controlar el proceso de aprendizaje de una red neuronal mediante la retro-propagaci´on. La tasa de aprendizaje se utiliza para especificar si en la red neuronal se van a hacer ajustes importantes despu´es de cada ensayo de aprendizaje, o si s´olo se van a hacer peque˜nos ajustes. El mom´entum es la tasa adicional de aprendizaje que se usa para controlar las posibles oscilaciones en los pesos, que podr´ıan ser provocadas por las se˜nales del error. Ahora se va tratar con el caso m´as general de una red Fig. 2.11: Red neuronal de tres capas neuronal de tres capas feedforward con nnodos de entrada, mneuronas en la capa oculta y l en la capa de la salida. Un an´alisis similar puede llevarse a cabo en general en una red neuronal multicapa (m´as capas ocultas). En primer lugar, se denota que: Las variables {x1, x2, ..., xn}son las entradas que se encuentran en la capa de entrada. Las variables {d1, d2, ..., dl}son las salidas deseadas. Las variables{y1, y2, ..., ym}son las salidas de la red neuronal, que se encuentran en la capa de salida. El peso wji que conecta una neurona ide la capa de entrada con la neurona jde la capa oculta. El peso ¯wkj que conecta una neurona jde la capa oculta con la neurona kde la capa de salida. La funci´on ϕ(.) ser´a la funci´on de activaci´on utilizada en la capa oculta. 43
2. ESTADO DEL ARTE La funci´on ¯ϕ(.) ser´a la funci´on de activaci´on utilizada en la capa de salida. Por lo tanto cada neurona jde la capa oculta tiene como entrada: vjin = n X i=1 wjixi+θj= n X i=0 wjixi Donde θj=wj0, x0=−1. (θjes el umbral de la neurona j) Y como salida: vjout =ϕ(vjin) = ϕ n X i=0 wjixi! Entonces, la entrada de la neurona kde la capa de salida, ser´ıa: ykin = l X j=1 ¯wkjvjout +¯ θk= l X j=0 ¯wkjvjout Donde: ¯wk0=¯ θkyv0out =−1. (¯ θkes el umbral de la neurona k) Y su salida ser´ıa: yk=ykout = ¯ϕykin= ¯ϕ( l X j=0 ¯wkjvjout) La funci´on del error de la se˜nal en la neurona de la salida est´a definido por: ε=1 2 m X k=1 (dk−yk)2 La estrategia consiste en intentar minimizar ε. Se suelen usar diversos algoritmos, se empieza en este p´arrafo con el algoritmo del gradiente descendiente, aplicado a los pesos de la red neuronal: w7→ w−λgradε (2.9) 44
2.1 Redes Neuronales Artificiales “RNAs” Donde λes la tasa de aprendizaje. Para concluir, se necesita calcular las derivadas siguientes. dε d¯wkj = l X s=1 −(ds−ys)dys d¯wkj dε d¯wkj =−(dk−yk)dyk d¯wkj dε d¯wkj =−(dk−yk)dykout d¯wkj dε d¯wkj =−(dk−yk)d¯ϕykin d¯wkj dε d¯wkj =−(dk−yk) d¯ϕ( l P j=0 ¯wkjvjout) d¯wkj dε d¯wkj =−(dk−yk) ¯ϕ0ykinvjout dε d¯wkj =−¯ ψvjout Donde: ¯ ψ= (dk−yk) ¯ϕ0ykin. Y por otra parte: dε dwji =− l X s=1 (ds−ys)dys dwji dε dwji =− l X s=1 (ds−ys)dysout dwji dε dwji =− l X s=1 (ds−ys)d¯ϕysin dwji dε dwji =− l X s=1 (ds−ys) d¯ϕ l P j=0 ¯wsjvjout! dwji dε dwji =− l X s=1 (ds−ys) d¯ϕ l P j=0 ¯wsjϕn P i=0 wjixi! dwji dε dwji =− l X s=1 (ds−ys) ¯ϕ0ysin¯wsj dϕn P i=0 wjixi dwji dε dwji =− l X s=1 (ds−ys) ¯ϕ0ysin¯wsjϕ0(vjin)xi dε dwji =−ψxi 45
2. ESTADO DEL ARTE Donde: ψ= l X s=1 (ds−ys) ¯ϕ0ysin¯wsjϕ0(vjin) ψ= l X s=1 ¯ ψ¯wsjϕ0(vjin) As´ı que el algoritmo del error de retro-propagaci´on se define siguiendo las etapas siguientes: 1. Inicializar los pesos (m´as detalles en 2.1.11.5) 2. Presentar todos los patrones de entrada y calcular todas las activaciones. 3. Calcular los discriminantes ¯ ψyψy determinar las derivadas parciales del error respecto al peso. 4. Actualizar los pesos con el algoritmo del gradiente descendiente: w7→ w−λgradε 5. Repetir el proceso hasta llegar al termino de parada (ver 2.1.11.1). La ecuaci´on 2.9, en la etapa t+ 1 del aprendizaje, seria: wji(t+ 1) = wji(t)−λdε dwji (t) (2.10) 2.1.10.4 Algoritmo RPROP Retro-propagaci´on es el algoritmo m´as utilizado para el aprendizaje supervisado en las redes feedforward. La idea b´asica del algoritmo de aprendizaje de retro-propagaci´on, (ver 2.1.10), es repetir una cadena de tasas de aprendizajes para el c´alculo de la influencia de cada peso en la red respecto a la funci´on del error de la red E. El c´alculo de la deriva dε dwji (t) de la funci´on del error respeto a los pesos, est´a dada en 2.1.10. Donde wij es el peso que relaciona la neurona ja la neurona i. Una vez que se conoce la derivada parcial para cada peso, el objetivo de minimizar la funci´on del error, se consigue mediante la realizaci´on del gradiente descendente simple (ver la ecuaci´on 2.10). Obviamente, la elecci´on de la tasa de aprendizaje λ, con la que se escala la derivada, tiene un efecto importante en el tiempo necesario para alcanzar la convergencia. Si se establece demasiado peque˜na, ser´an necesarios demasiados pasos para llegar a una soluci´on aceptable, por el contrario, una tasa de aprendizaje grande posiblemente dar´a lugar a una oscilaci´on, evitando que el error caiga por debajo de un cierto valor, como se ha mencionado en 2.1.10, una propuesta para deshacerse de este problema es introducir el mom´entum en la ecuaci´on 2.10: ∆wji(t) = −λdε dwji (t) + µ∆wji(t−1) (2.11) 46
2.1 Redes Neuronales Artificiales “RNAs” Donde µrepresenta el momentum, que escala la influencia de las etapas anteriores en la actual. Se espera que la incorporaci´on del momentum haga que el procedimiento de aprendizaje ser´a m´as estable y acelere la convergencia en las regiones superficiales de la funci´on del error. Sin embargo, en la pr´actica esto no es siempre cierto. Resulta, en efecto, que el valor ´optimo del momentum es igualmente un problema dependiente como lo es la tasa de aprendizaje, y que no lo mejora generalmente (39). Tambien nos encontramos con otro problema que es definir la tasa de aprendizaje adecuada, y el momentum adecuado. Muchos algoritmos se han propuesto para hacer frente al problema de actualizaci´on adecuada de los pesos. Y la mayor´ıa de las estrategias, que se emplearon, se pueden dividir en dos categor´ıas: estrategias globales y locales. Las estrategias globales se basan en el conocimiento del estado de toda la red (por ejemplo, la direcci´on paso a paso de los pesos anteriores) para modificar los par´ametros, mientras que las estrategias locales utilizan la informaci´on disponible s´olo en el peso espec´ıfico (por ejemplo, la derivada parcial), para adaptar el par´ametro de este peso espec´ıfico. Se ha demostrado que las estrategias de adaptaci´on locales est´an m´as recomendadas que las estrategias globales (40). Algunos ejemplos de estas estrategias se pueden encontrar en (41),(42). El algoritmo “RPROP” abreviaci´on de “Resilient PROPagation”, propuesto por Martin Riedmiller y Heinrich Braun en (43). El RPROP actualiza el valor del peso wji directamente, es decir sin tener en cuenta el valor de la derivada parcial. EL algoritmo RPROP tiene diversas implementaciones: RPORP+, RPROP−, iRPROP+, iRPROP−(44). A continuaci´on RPROP+ se define de la manera siguiente: 2.1.11 Fundamentos para la implementaci´on de una RNA 2.1.11.1 Condici´on de T´ermino Se pueden implementar muchos criterios para ajustar el proceso de aprendizaje. Las estrategias m´as comunes consisten por ejemplo en fijar un n´umero m´aximo de iteraciones, o fijar un error m´ınimo a alcanzar. Estas dos ´ultimas t´ecnicas, no son muy buenas si no se determinan adecuadamente. Por ejemlo, en la primera que consiste en fijar el n´umero m´aximo de iteraciones, al implementarla con el algoritmo de retro-propagaci´on, a veces no asegura alcanzar el m´ınimo global, pero puede converger a m´ınimos locales. La segunda t´ecnica, puede sufrir el fen´omeno de sobre-aprendizaje, todo dependiendo de si los datos de entrada son buenos (i.e. que puedan representar el fen´omeno que estamos aprendiendo o no), y de si los errores de medici´on, acompa˜nados con los ruidos, representan o no la 47
2. ESTADO DEL ARTE Algorithm 1 RPORP 1: Descripci´on del RPROP+. 2: for para cada wij do 3: if ∂E(t−1) ∂wij .∂E(t) ∂wij >0then 4: ∆ij(t):= min ∆ij(t−1).η+,∆max; 5: ∆ij(t):= −sign ∂E(t) ∂wij .∆ij (t) 6: wij(t+1) := wij (t)+ ∆wij(t) 7: end if 8: if ∂E(t−1) ∂wij .∂E(t) ∂wij <0then 9: ∆ij(t):= max ∆ij(t−1).η−,∆min; 10: wij(t+1) := wij (t)−∆wij(t); 11: ∂E(t) ∂wij := 0; 12: end if 13: if ∂E(t−1) ∂wij .∂E(t) ∂wij = 0 then 14: ∆ij(t):= −sign ∂E(t) ∂wij .∆ij (t) 15: wij(t+1) := wij (t)+ ∆wij(t) 16: end if 17: end for naturaleza del problema a estudiar. Se puede solucionar este problema usando una t´ecnica de validaci´on cruzada “cross-validation”, (usando dos conjuntos independientes de datos para el entrenamiento: uno para el ajuste de los par´ametros de la red, y el otro para su validaci´on). 2.1.11.2 Fen´omeno de Saturaci´on Una consideraci´on m´as a tener en cuenta es la saturaci´on de las neuronas. Las neuronas en la pr´actica pueden dejar de aprender. Por lo tanto, es importante adoptar medidas que intenten evitar esta situaci´on. Entre ellas cabe citar la normalizaci´on de los datos de entrada y la inicializaci´on de los pesos de la primera capa considerando un intervalo ajustado para las entradas. Por ejemplo: −1 Max q|pqi|,1 Max q|pqi|∀1⩽i⩽r, donde qes un conjunto de entradas de aprendizaje, res el n´umero de entradas de la red. Otra alternativa, es fijar todos los pesos a cero, esto puede arreglar el problema de saturaci´on, pero no es viable porque el origen del espacio de los pesos corresponde a un lugar inestable en la funci´on de error de la red, eso facilita la divergencia del algoritmo de retro-propagaci´on. Tambi´en se puede utilizar el concepto de Agrupaci´on, es decir, en vez de modificar (actualizar) los pesos en cada iteraci´on, una enfoque alternativo es acumular las variaciones de los pesos en 48
2.1 Redes Neuronales Artificiales “RNAs” un periodo de aprendizaje, y actualizarlos una vez con la media de estas variaciones (“Batching”). Sin embargo, el agrupamiento no es un remedio eficaz, porque ralentiza la convergencia. No obstante el agrupamiento puede contribuir a evitar que el proceso vaya en direcciones malas, y que quede atrapado en m´ınimos locales inadecuados. 2.1.11.3 Selecci´on de variables Se presenta a continuaci´on un resumen del procedimiento para descartar variables irrelevantes: 1. Elegir el conjunto de los candidatos de entrada (variables primarias y secundarias). 2. Seleccionar la entrada m´as correlacionada con la salida, en el espacio de observaci´on, proyectar todas las otras entradas, y la salida, sobre el sub-espacio nulo de la entrada seleccionada. 3. En el espacio nulo de las m–1 variables seleccionadas en anteriores iteraciones: (a) Seleccionar el vector de entrada proyectado con m´as correlaci´on con el vector de salida previsto. (b) Calcular la probabilidad Hmde que la funci´on de probabilidad sea m´as relevante que una de las mentradas seleccionadas previamente, y compararlo con el riesgo αelegido. (c) Si Hmes menor que el riesgo, volver al paso 3. (d) Si Hmes mayor que el riesgo, ir al paso 4. 4. Utilizar las variables seleccionadas como entradas de una red neuronal y entrenar como se indica en las siguientes secciones. El primer paso en cualquier procedimiento del dise˜no de la red neuronal consiste en la reducci´on de la dimensi´on del espacio de entrada, haciendo dos preguntas. ¿La dimensi´on del vector de entrada es la m´as reducida posible, o es posible encontrar una representaci´on de entradas m´as compacta, preservando al mismo tiempo la cantidad de informaci´on relevante? ¿Las entradas candidatas son todas relevantes para el modelado del valor objetivo? La respuesta a la primera pregunta es proporcionada mediante el an´alisis de los componentes principales, o posiblemente mediante operaciones m´as complejas, como el an´alisis de componentes curvilineales o los mapas de auto-organizaci´on. La respuesta a la segunda pregunta es proporcionada por m´etodos estad´ısticos, como el m´etodo 49
2. ESTADO DEL ARTE retirada del conjunto de entrenamiento, y los entrenamientos se llevan a cabo (con diferentes valores iniciales en los par´ametros) con N−1 ejemplos del conjunto de entrenamiento, para cada modelo, se calcula el error de predicci´on en el ejemplo retirado k, y el error m´as peque˜no de predicci´on en el ejemplo retirado,rk(−k)se almacena. El error ser´ıa: Et=v u u t1 N N X k=1 (rk(−k))2 Que se calcula de la misma manera explicada en el apartado anterior, y los modelos ser´an dise˜nados, hasta que Etcomienza a aumentar y que aumente la complejidad. El principal inconveniente de esta t´ecnica es que es computacionalmente costosa, pero se puede demostrar que Etes un estimador no-sesgado del error de generalizaci´on (52). 2.1.12 Estimaci´on de los Intervalos de Confianza en la Predicci´on de una RNA El uso de t´ecnicas de estimaci´on de la confianza en las salidas de las redes neuronales desempe˜na un papel importante y se aplican en muchas aplicaciones pr´acticas. Sin embargo algunas de estas t´ecnicas no siempre tienen sensibilidad suficiente para considerar los niveles de ruido presentes en los datos, por lo que algunos autores han estudiado alternativas para superar esta deficiencia. En el trabajo (53) se presenta una extensi´on del m´etodo de regresi´on no lineal para estimar los intervalos de predicci´on de las redes neuronales feedforward. La idea principal de su m´etodo es que la variaci´on de los residuos debe ser estimada en funci´on de los datos de entrada y no como una constante. El error producido en una predicci´on mediante una RNA (o cualquier otro modelo emp´ırico) como modelo de un sistema f´ısico dependen en buena medida de la posibilidad de que se produzcan en dicho sistema valores (datos) incontrolables o no observables (54). Cuando las RNAs se utilizan en los problemas de regresi´on, su fiabilidad y facilidad de uso mejorar´an si la precisi´on de los resultados de la red neuronal es apoyada por alg´un tipo de medida de confianza (55). El error cuadr´atico medio ”MSE” es s´olo una indicaci´on global de la exactitud del modelo y proporciona una indicaci´on aproximada de la predicci´on de la red en toda la regi´on donde los datos de entrenamiento est´an disponibles (56). El buen ajuste en el contexto de los modelos 56
2.1 Redes Neuronales Artificiales “RNAs” neuronales puede empeorarse debido al ruido en los datos de entrenamiento o como consecuencia de la densidad de la informaci´on en algunas regiones (57), y/o su ausencia en los datos de entrenamiento. Muchos m´etodos y teor´ıas han sido desarrollados para responder a este problema, teniendo en cuenta que algunas hip´otesis deben estar presentes en el modelo, como: suponer que los residuos del modelo son independientes y tienen una distribuci´on normal con media nula y no hay ning´un error de observaci´on (54), el n´umero de los entrenamientos tiende a cero y la red neuronal converge. En la mayor´ıa de los casos pr´acticos donde si se suele disponer de la verdadera media o varianza de los residuos, pero s´olo una muestra finita para poder estimarlos. La media puede ser distinta de cero debido a la falta de correspondencia entre los modelos, y los residuos de estas funciones son a menudo los valores de la entrada del modelo y deben ser modelados. El histograma se ha presentado como el estimador de densidad no param´etrico s´olo hasta la d´ecada de 1950, cuando se hacia la estimaci´on de la densidad o la estimaci´on de la densidad espectral. En un trabajo poco conocido de Fix y Hodges en 1951 (58), se introdujo el algoritmo b´asico de estimaci´on de la densidad no param´etrica. Se abord´o el problema de la discriminaci´on estad´ıstica, cuando la forma param´etrica de la densidad de muestreo no era conocida. Durante la d´ecada siguiente, varios algoritmos generales y formas alternativas de an´alisis te´oricas fueron introducidos por Rosenblatt (1956) (59), Parzen (1962) (60) y Cencov (1962) (61). Despu´es, se ha seguido con muchas publicaciones te´oricas importantes principalmente la de Watson y Leadbetter (62), Schwartz (63), Epanechnikov (64), Tarter y Kronmal (65), Wahba (66), etc. La generalizaci´on con multi-variables fue introducida por Cacoullos (67). En la d´ecada de los 70, tuvieron lugar las primeras aplicaciones pr´acticas de estos m´etodos se encuentran en (68) y (69), entre otros. la utilizaci´oon del histograma como t´ecnica de representaci´on de datos o como estimador de la densidad, la diferencia b´asica es que en este ´utimo caso debe estar normalizado para integrar 1. La estimaci´on de densidad por n´ucleos puede ser interesante no s´olo como un caso l´ımite del histograma, sino tambi´en por otras t´ecnicas. De hecho, pr´acticamente todos los algoritmos no param´etricos son asint´oticamente m´etodos del n´ucleo, un hecho demostrado emp´ıricamente por Walter y Blum (70), y Scott (71). 1. Problemas con el uso del histograma La representaci´on gr´afica de un conjunto de datos es una ayuda indispensable para la interpretaci´on de los mismos y su implementaci´on en el entrenamiento en los modelos no lineales, las representaciones gr´aficas visuales pueden facilitar juicios acerca de la tendencia central, intervalos de confianza, etc. Permiten tambi´en adoptar decisiones de si la 57
2. ESTADO DEL ARTE distribuci´on de los datos se ajusta a los supuestos que subyacen a los resultados de un modelo lineal / no lineal. Las herramientas m´as utilizadas por los cient´ıficos de an´alisis para visualizar la distribuci´on de datos de una variable son gr´aficas con puntos, y para grandes conjuntos de datos, el histograma. El histograma es f´acil de construir y proporciona una idea sobre la distribuci´on de la densidad de los datos, si se utiliza una elecci´on adecuada de las clases. El histograma es una estimaci´on de la distribuci´on de densidad de poblaci´on. Sin embargo, la impresi´on visual obtenida a partir de un histograma puede depender en un grado no deseado de los intervalos seleccionados para las clases (es decir, el n´umero y el punto medio de los datos). Una reconstrucci´on de la densidad de poblaci´on m´as consistente que el histograma, por lo tanto, ser´ıa bienvenida. La estimaci´on de la densidad del n´ucleo puede cumplir con este requisito (68,72). Observaci´on En esta secci´on se revisa brevemente el m´etodo de estimaci´on de densidad por n´ucleo para una variable y el caso de multi-variables. Dada una secuencia de variables aleatorias independientes {x1, ..., xn}id´enticamente distribuidas con una funci´on de densidad f(x), el problema de estimaci´on de la densidad es la construcci´on de una secuencia de estimadores ˆ f(x, h) (hes un par´ametro llamado “Band-width” ancho de banda de f(x) basado en un muestreo de datos {x1, ..., xn}). 2. La estimaci´on de la densidad por n´ucleos para una variable La estimaci´on de la densidad es una t´ecnica com´un y ´util para realizar un an´alisis de datos. Dada una secuencia de variables aleatorias independientes de una distribuci´on espec´ıfica, el problema de estimaci´on de la densidad es la construcci´on de una funci´on de densidad de la distribuci´on sobre la base de los datos extra´ıdos de la misma. La estimaci´on de la densidad es un problema muy importante en el an´alisis num´erico, la miner´ıa de datos y otros campos de investigaci´on (69). Si se conoce la distribuci´on de la densidad de una muestra del conjunto de datos, se puede tener una idea sobre la distribuci´on que se debe implementar en el conjunto de datos. As´ı que en muchas aplicaciones de miner´ıa de datos, como el muestreo de la densidad y la agrupaci´on basada en la densidad, la estimaci´on de la densidad es un paso inevitable. La estimaci´on de la densidad por n´ucleos es un m´etodo no param´etrico ampliamente estudiado para la estimaci´on de la densidad (73). La idea detr´as del m´etodo es la generalizaci´on del m´etodo de Parzen de estimaci´on mediante el histograma. En el segundo m´etodo, la densidad en un punto xse calcula en una 58
2.1 Redes Neuronales Artificiales “RNAs” proporci´on de observaciones {x1, ..., xn}que est´an cerca de h. Para ello, se puede seleccionar una area alrededor de Xcuya anchura es controlada por un par´ametro de suavizado h, entonces se calcula el n´umero de observaciones que caen en esta ´area. Esta estimaci´on, que depende del par´ametro de suavizado h, tiene buenas propiedades estad´ısticas, pero no es continua. El objetivo del m´etodo de estimaci´on por n´ucleos es conseguir la continuidad: para ello, se sustituye el ´area centrada en Xy de ancho h, por una curva de campana centrada en X. Cuantas m´as observaciones se encuentran cerca del punto Xa lo largo de la curva de campana se le asigna un valor num´erico grande, por el contrario, se le asigna un valor num´erico insignificante. El estimador est´a formado por la suma (o m´as bien la media) de las curvas de campana. La idea simple de la estimaci´on por n´ucleos, se basa en que para cada punto de los datos xi, i ∈ {1,2, ..., n}se sustituye por una distribuci´on especificada (por lo general normal), centrada en el punto y con una desviaci´on est´andar designada h. Las distribuciones normales se suman y la distribuci´on resultante se escala para tener una unidad de superficie (es una curva suave), y la estimaci´on de la densidad del n´ucleo (Parzen), se define en forma general como: ˆ f(x, h) = 1 nh n X i=1 Kx−xi h Donde Kes el n´ucleo: una funci´on sim´etrica, pero no negativa, que integra a 1: RK(x)dx = 1, yh > 1 es un par´ametro de suavizado llamado ancho de banda (band-width). Un n´ucleo con el sub´ındice hse llama el n´ucleo de escala y se define como: Kh(x) = kx h h . Intuitivamente, uno quiere elegir htan peque˜no como los datos lo permitan, sin embargo siempre hay un equilibrio entre el sesgo del estimador y su varianza. Una gama de funciones del n´ucleo son de uso general: uniforme, triangular, Epanechnikov, normal, . . . . El n´ucleo de la normal que se usa a menudo: K(x) = ϕ(x) donde ϕes la funci´on est´andar de densidad normal. La estimaci´on por n´ucleo, cuando se calcula con un valor apropiado de h, da una buena estimaci´on de la funci´on de densidad en los datos, sin hacer ninguna hip´otesis, por ejemplo 59
2. ESTADO DEL ARTE cuando es una distribuci´on normal. Esto es ´util en los ejemplos de an´alisis cient´ıficos, donde la desviaci´on de la normalidad es com´un. Los c´alculos se pueden programar f´acilmente. La ´unica complicaci´on es la determinaci´on de un valor adecuado para h. Esta elecci´on es un contexto espec´ıfico y se le requiere experiencia. Obviamente, la desventaja de este m´etodo es que es necesario obtener los ndatos y mantenerlos en la memoria antes de hacer la estimaci´on. Cuando los datos se presentan en forma de flujo continuo de datos, el gran volumen y la infinitud de datos hacen que sea imposible obtener todos los datos con antelaci´on y guardarlos en la memoria. Es decir, la estimaci´on de la densidad del n´ucleo s´olo se puede calcular con conjuntos de datos est´aticos, y no puede manejar flujos de datos. 3. Funci´on de densidad por n´ucleos para multi-variables El an´alisis te´orico de los estimadores por n´ucleo para multi-variables es el mismo que el de una variable a excepci´on de algunos detalles. Dado un conjunto de ndatos p-dimensionales xi∈ <P, i ∈ {1,2, ..., n}. La estimaci´on de densidad mediante un n´ucleo fijo y de ancho de banda fijo para multivariables (“Multivariate fixed with kernel density estimator”), con una funci´on de n´ucleo fija ϕ(funci´on de n´ucleo global) y de par´ametro h, es definida por: ˆ f(x) = 1 nhP n X i=1 ϕ1 h(x−xi) Donde: ϕ(x)⩾0,Z<P −<P ϕ(x)dx = 1 La funci´on m´as utilizada es el n´ucleo Gaussiano: ϕ(x) = 1 P √2πexp −1 2xTx Normalmente, los datos observados no est´an igualmente extendidos en todas las direcciones. Por lo tanto, es muy deseable pre-escalar los datos para evitar estas diferencias. Un enfoque atractivo es la primera esfera (74) (mediante una transformaci´on lineal con media cero y matriz de covarianza como unidad), es decir: x→z=S1 2(x−E[x]) 60
2.1 Redes Neuronales Artificiales “RNAs” E[x] : La esperanza, que se calcula a trav´es de la media de la muestra. Y S∈ <P∗P matriz de covarianza, es decir: S=E[x−E[x]] Entonces: ˆ f(z) = 1 nhP n X i=1 ϕ1 h(z−zi) ⇔ˆ f(x) = 1 nhPdet (S)1 2 n X i=1 ϕ1 hS−1 2(x−xi) Un ancho de banda ´optimo del n´ucleo h∗se puede determinar a trav´es de la minimizaci´on del error medio cuadrado (68). Por ejemplo usando la funci´on Gaussiana, se propuso en (68), para la estimaci´on de los datos distribuidos normalmente con la covarianza por unidad h∗es decir: h∗=4 (2p+ 1)n1 p+4 O tambi´en podemos usar el siguiente valor: h∗=4 31 5 σn−1 5∼1.06σn−1 5 Esta aproximaci´on se conoce como la aproximaci´on con la distribuci´on normal, la aproximaci´on de Gauss, o la regla emp´ırica de Silverman (68). 2.1.12.1 Estimaci´on con M´ınimos Cuadrados 1. M´ınimos Cuadrados No Lineales: Los m´ınimos cuadrados no lineales representan una forma de m´ınimos cuadrados especializados en la estimaci´on de modelos no lineales, con mpar´ametros a partir de nobservaciones (n>m). Suponiendo que hay nobservaciones (xi, yi), i ∈ {1,2, ..., n}, a partir de un modelo no lineal con una relaci´on funcional conocida f, As´ı que: yi=f(xi, θ∗) + εi, i ∈ {1,2, ..., n} Donde: εes el error asociado con la funci´on de modelar el sistema, que asumimos que es independiente e id´enticamente distribuido con una varianza σ2, donde su distribuci´on tiene la forma N0, σ2, entonces E[εi] = 0 , y var(εi) = σ2.xies un vector k∗1. θ∗es 61
2. ESTADO DEL ARTE el valor correcto de θ. Se define ˆ θcomo el m´ınimo de la suma del error al cuadrado: ˆ θ= min θS(θ) S(θ) = n X i=0 [yi−f(xi, θ)]2 (Es importante se˜nalar que esta suma tendr´a m´ınimos locales a parte del m´ınimo absoluto ˆ θ) Se indicara m´as adelante, que bajo ciertas suposiciones regulares, que: ˆ θy: S2=S(ˆ θ) (n−p) son estimaciones coherentes respectivamente de θ∗yσ2. Con otra condici´on de regularidad ˆ θes asint´oticamente una distribuci´on normal cuando n→ ∞. Adem´as si εitiene una distribuci´on normal, entonces ˆ θes un estimador m´aximo de vecindad (75). Como ˆ θ= min θS(θ), entonces: ∂S(θ) ∂θrˆ θ= 0,∀r∈ {1,2, ..., p} Notaciones: fi(θ) = f(xi, θ), f(θ)=(f1(θ), ..., fn(θ))T F(θ) = ∂f(θ) ∂θ =∂fi(θ) ∂θji,j ,∀i∈ {1,2, ..., n}, j ∈ {1,2, ..., p} Sabiendo que: S(θ) = n X i=0 [yi−f(xi, θ)]2 S(θ) = n X i=0 [yi−fi(θ)]2 S(θ)=[y−f(θ)]T[y−f(θ)] S(θ) = ky−f(θ)k2(2.12) Y por lo tanto: ∂S(θ) ∂θr ˆ θ= 0 ⇒ −2 n X i=0 [yi−f(xi, θ)] ∂fi(θ) ∂θj ˆ θ= 0,∀j∈ {1,2, ..., p} 62
2.1 Redes Neuronales Artificiales “RNAs” ⇒F(ˆ θ)Ty−f(ˆ θ)= 0 ⇒Fˆ θTˆε= 0 Recordando que y=f(ˆ θ) + ˆε. La matriz idempotente: ˆ PF=ˆ F(ˆ FTˆ F)−1ˆ FT, se puede reescribir la ecuaci´on anterior de la forma siguiente: ˆ FTˆε= 0 . Es decir: ˆ PFˆε= 0 La ecuaci´on 2.12 se llama la ecuaci´on normal del modelo no lineal, normalmente es dif´ıcil de resolver anal´ıticamente, y es necesario usar m´etodos iterativos (75). 2. Aproximaci´on lineal: Seg´un la extensi´on de Taylor de primer orden, se puede escribir: fi(θ)≈fi(θ∗) + Pp r=0 ∂fi(θ) ∂θr|ˆ θ.(θr−θ∗ r) Es decir: f(θ) = f(θ∗) + F(θ−θ∗) (2.13) Seg´un la ecuaci´on 2.13:S(θ)≈ ky−f(θ∗)−F(θ−θ∗)k2 Se anota:z=y−f(θ∗) = εyβ=θ−θ∗, entonces: S(θ)≈ kz−Fβk2 Por lo tanto si: S(ˆ θ)=0⇒ z−Fˆ β 2= 0 ⇒z−Fˆ β= 0 ⇒FTz−FTFˆ β= 0 Entonces: ˆ β= (FTz)−1FTz Cuando θ=ˆ θ, se obtiene: f(ˆ θ)−f(θ∗)≈F.(ˆ θ−θ∗) = F.FTF−1FTε=PFε Por otro lado: y−f(ˆ θ)≈y−f(θ∗)−F−ˆ θ−θ∗ 63
2. ESTADO DEL ARTE =ε−Fˆ θ−θ∗ =ε−PFε ⇒(n−p)s2=S(ˆ θ) = y−f(ˆ θ) 2 =k(In−PF)εk2 (n−p)s2=εT(In−PF)ε Del mismo modo: f(ˆ θ)−f(θ∗) 2=kPFεk2=εTPFε ˆ θ−θ∗≈FTF−1FTε⇒εTF= (ˆ θ−θ∗)(FTF) As´ı: εTPFε=εTF(FTF)−1FTε εTPFε=ˆ θ−θ∗TFTFFFTF−1FTFˆ θ−θ∗ εTPFε=ˆ θ−θ∗TFTFˆ θ−θ∗ Entonces: S(θ∗)−S(ˆ θ) = εTε−εT(In−PF)ε ⇒S(θ∗)−Sˆ θ=εTPFε ⇒S(θ∗)−S(ˆ θ) = ˆ θ−θ∗TFTFˆ θ−θ∗ Ahora seg´un el teorema siguiente: Teorema 17 Dado ε∼N0, σ2, y las condiciones de regularidad, para ngrande, tenemos: (a) ˆ θ−θ∗∼NP0, σ2C−1, C =FTF=FT(θ∗)F(θ∗) (b) (n−p)s2 σ2∼εT(In−PF)ε σ2∼ ℵ2 n−p (c) ˆ θes est´aticamente independiente deS2y (d) S(θ∗)−S(ˆ θ) p S(ˆ θ) n−p≈εTPFε εT(In−PF)ε n−p p 64
2.1 Redes Neuronales Artificiales “RNAs” 2.1.12.2 Intervalos de Confianza en la predicci´on de la red neuronal La salida de la RNA satisface un modelo de regresi´on no lineal: y=f(x, θ∗) + ε, xrepresenta el vector de las entradas, yel vector de salida, θ∗es el vector de los par´ametros correctos, εes el vector de los errores asociados a la modelizaci´on de la red neuronal despu´es del entrenamiento. Sea ˆ θel vector de los par´ametros obtenidos despu´es del entrenamiento (resultado de la minimizaci´on por m´ınimos cuadrados de la funci´on del error): ˆ θ= min θS(θ) = min θ n X i=1 (yi−f(xi, θ))2 Entonces la predicci´on de la RNA para una entrada x0es: ˆy0=fx0,ˆ θ Se asume que εes independiente y normalmente distribuido con media cero. El porcentaje 100(1 −α) de confianza del intervalo del valor predicho ˆy0es: ˆy0±c, donde ces calculado de la forma siguiente (54): c=tα 2 n−ps1 + f0TFTF−1f01 2 Donde tα 2 n−pes la inversa de la distribuci´on t-student con n−pgrados de libertad, evaluado a α 2,pes el n´umero de los par´ametros de la red, s2=s(ˆ θ) n−p El vector f0es dado por: f0=∂f(x0, θ∗) ∂θ1∗, ..., ∂f(x0, θ∗) ∂θp∗T Siendo Fla matriz Jacobiana: F= ∂f(x1,ˆ θ) ∂ˆ θ1... ∂f(x1,ˆ θ) ∂ˆ θp . . . . . . . . . . . . . . . ∂f(xn,ˆ θ) ∂ˆ θ1...∂f(xn,ˆ θ) ∂ˆ θp En (56), se incorpor´o la influencia de la distribuci´on de los datos de entrenamiento en la estimaci´on del intervalo de confianza, y utiliz´o el m´etodo wavelet para estimar la densidad de los datos de entrenamiento, y modific´o el intervalo de confianza como: Cs=2c 1 + ρ ρmax (2.14) 65
2. ESTADO DEL ARTE tambi´en va hacia arriba. Si el viento se sostiene con suficiente velocidad sobre una direcci´on constante, se pueden llegar a “doblar” las llamas en la direcci´on que sopla, lo que contribuye a da˜nar a los ´arboles. La inclinaci´on de la llama hace que la distinci´on entre la altura de la llama y su longitud se vuelva cr´ıtica. La altura de la llama es la distancia vertical desde la punta de la llama hacia abajo al centro de la superficie del combustible, mientras que la longitud de la llama es la distancia desde el punto medio de la cama de combustible a la punta de la llama. Sin viento, la longitud de la llama y su altura son iguales porque la llama es “hacia arriba”. Cuando la llama se “inclina”, la longitud de la llama ser´a mayor que la altura. El punto medio del lecho de combustible se utiliza en lugar de la tierra porque la llama no siempre se extiende hasta el suelo. Otro t´ermino que se aplica al viento respecto al fuego es la “velocidad del viento en el medio de la llama”. Durante un incendio es frecuente que tal velocidad sea estimada por un experto mediante ”inspecci´on visual”. 2.2.2 Sistemas de evaluaci´on del peligro de los incendios El peligro de incendio se determina en funci´on de diversos factores, entre los m´as importantes se pueden citar: La facilidad de ignici´on de la vegetaci´on, la dificultad para controlar el incendio una vez que se declare y la evaluaci´on del da˜no puede hacer. Los denominados ”Sistemas de Clasificaci´on de Peligro de Incendio” (SCPI) producen indicadores cualitativos y / o cuantitativos del potencial del incendio, bas´andose para ello en los factores antes citados como componentes del ambiente del incendio: Combustibles, Clima y Topograf´ıa. Estos indicadores permiten evaluar con objetividad la eficiencia de las medidas de prevenci´on existentes, as´ı como identificar las zonas donde es necesario actuar tanto de forma preventiva (ejemplos: reducci´on de combustibles) como correctiva (ejemplo: decidir la asignaci´on de recursos durante el desarrollo de los incendios). Los SCPI son herramientas imprescindibles para la prevenci´on y el control de los incendios. El desarrollo de tales sistemas requiere una gran inversi´on econ´omica y de tiempo, acompa˜nada casi siempre de rigurosos e intensivos proyectos de investigaci´on rigurosa e intensiva. A continuaci´on se presenta una breve descripci´on de los sistemas de prevenci´on y control de incendios forestales m´as conocidos. 72
2.2 Comportamiento de Incendios Forestales 2.2.3 Sistemas de un solo ´ındice 1. ´ Indice de Monte Alegre o de Soarez El ´ındice FMA de Monte Alegre fue desarrollado para ecosistemas h´umedos del sudeste de Brasil. Su ecuaci´on b´asica es la siguiente: FMA =Iacum ∗F+ 100 ∗X1 H Donde Hla humedad relativa, Fes el factor de correcci´on en base a la precipitaci´on, Iacum es la sumatoria de los ´ındices de los d´ıas anteriores. 2. ´ Indice Angstrom Es un ´ındice de origen sueco, muy b´asico del peligro de incendios. Utiliza s´olo la temperatura y la humedad relativa. Los par´ametros de entrada del ´ındice de Angstrom Ison: Ttemperatura del aire y Rla humedad relativa. I=R 20+(29 −T) 10 Que ha sido aplicado en los trabajos (77)y(78). 3. ´ Indice de humedad del combustible (FMI) El ´ındice de humedad del combustible (FMI) es muy b´asico, pero demostr´o en un estudio presentado por su desarrollador Sharpes, su buen comportamiento en comparaci´on con otros ´ındices de humedad del combustible. Se utiliza la temperatura del aire y la humedad relativa para calcular un´ındice num´erico de peligro de incendio. No existe una clasificaci´on de riesgo de incendios para este ´ındice. Cuanto menor sea el n´umero, mayor es el riesgo de incendio, m´as informaci´on en (77). Los par´ametros de entrada: Ttemperatura del aire y Rla humedad relativa. Y se calcula de manera siguiente: FMI = 10 −0.25 ∗(T−R) 4. ´ Indice de peligro de incendio forestal (FFDI) El ´ Indice de Peligro de Incendios Forestales (FFDI) fue desarrollado en la d´ecada de 1960 por el cient´ıfico de AG McArthur para medir el grado de peligro de los incendios en los bosques australianos. El ´ındice combina un registro de la sequedad, con base a las precipitaciones, la evaporaci´on, y variables meteorol´ogicas como la velocidad del viento, temperatura y humedad, m´as informaci´on en (79). 73
2. ESTADO DEL ARTE 5. ´ Indice de Nesterov El algoritmo de este ´ındice fue desarrollado en Rusia. El ´ındice de Nesterov es un ´ındice acumulativo que suma el valor actual a los valores estimados en los ´ultimos d´ıas hasta que haya una cierta cantidad de precipitaci´on. Posteriormente se establece en cero. Este ´ındice de peligro de incendios se utiliza actualmente tambi´en en Austria. Los par´ametros de entrada son: V= vapor de saturaci´on, D= punto de roc´ıo, R= Humedad relativa del aire, T= temperatura, y se calcula de la manera siguiente: P= W X i=1 (Ti−Di).Ti P= ´ındice de Nesterov y W= el n´umero de d´ıas con precipitaciones >4mm. 6. ´ Indice de WBKZ Este ´ındice se utiliza en la parte noreste de Alemania. Fue desarrollado para mejorar la previsi´on del riesgo de incendios en las masas puras de pino. La base para el ´ındice es muy similar al ´ındice de Nesterov. Se tiene en cuenta la temperatura y la saturaci´on de vapor y calcula un ´ındice del incendio que se acumula cada d´ıa. Los par´ametros de entrada son: V= vapor de saturaci´on y T= temperatura. WBKZ = 30.9 X 15.2 (T+ 10).V 7. ´ Indice de Thornthwaite “PET” El c´alculo del potencial de evapotranspiraci´on “PET” se define como la cantidad de evaporaci´on que se producir´ıa si esta disponible suficiente agua. Se utiliza principalmente para la caracterizaci´on de paisajes y su r´egimen de agua. Como ´ındice operacional de pron´ostico de peligro de incendios diario no puede ser utilizado, ya que utiliza la temperatura media mensual y la cantidad anual de precipitaci´on para su c´alculo. Se calculan los valores mensuales de PET para describir el desarrollo de PET a lo largo de las temporadas de incendios, m´as informaci´on en (80). Los par´ametros de entrada: Temperatura media mensual Tmon, suma anual de la precipitaci´on, factor de correcci´on Latitud Clat, y se calculan los valores mensuales de PET si la temperatura media mensual 74
2.2 Comportamiento de Incendios Forestales >0. I = XTmon 51.514 , a = 0.0675 ∗I3−7.71 ∗I2+ 1792 ∗I+ 49239 EPmon = 1.6 *10 *Tmon Ia ∗Clat Donde: EPmon= evaporaci´on potencial mensual, I= ´ındice de calor del a˜no, a=un coeficiente emp´ırico. 8. ´ Indice de peligro desarrollado por Rodr´ıguez y Moretti Este ´ındice fue desarrollado para la Regi´on Andino Patag´onica, en base al an´alisis de correlaciones entre las variables meteorol´ogicas consideradas y la ocurrencia y magnitud de los incendios. Las variables de entrada: Temperatura, humedad relativa, viento y d´ıas consecutivos con o sin precipitaci´on. Se asumi´o que cada una de las variables utilizadas explicaba un determinado porcentaje del peligro total de propagaci´on del fuego. 2.2.4 Sistemas con m´ultiples ´ındices 2.2.4.1 Sistema Canadiense de Evaluaci´on de Peligro de Incendios Forestales El sistema Canadiense de Evaluaci´on de Peligro de Incendios Forestales (CFFDRS) proporciona un m´etodo uniforme, num´erico de evaluaci´on de peligro de incendios a lo largo de un ´area, que depende del clima y no tiene en cuenta diferencias en el riesgo, el combustible o la topograf´ıa. Este sistema consiste de cuatro m´odulos o subsistemas: ´ Indice Meteorol´ogico de Peligro de Incendios (FWI); Subsistema de Predicci´on de Comportamiento del Incendio (FBP); Subsistema de Predicci´on de Ocurrencia de Incendio (FOP) y Subsistema Accesorio de Humedad de Combustibles (AFM) 2.13. El Subsistema de “Accessory Fuel Moisture” (AFM), y el Sistema “Fire Occurrence Prediction System” (FOP), no se han desarrollado en su totalidad para el uso nacional, aunque varias versiones regionales de este ´ultimo subsistema se encuentran entre otros en (81,82). Los componentes del FOP en el CFFDRS est´an destinados a predecir el n´umero de rayos y los incendios causados por el hombre, mientras que el objetivo es soportar aplicaciones especiales de los otros tres subsistemas del CFFDRS (83). El CFFDRS constituye uno de los pilares b´asicos para las otras gu´ıas y sistemas desarrollados ya sea para el personal de control de incendios u otros investigadores de incendios forestales (84). El ´ Indice Meteorol´ogico de Peligro “Fire weather Index” (FWI) consiste en seis componentes. Los tres primeros son c´odigos de humedad del combustible que sufren cambios diarios en el contenido de humedad; los valores m´as altos representan un contenido de humedad menor y por lo 75
2. ESTADO DEL ARTE Fig. 2.13: El Sistema Canadiense de Evaluaci´on de Peligro de Incendios Forestales tanto mayor inflamabilidad. Los tres componentes finales son ´ındices del comportamiento, que representan la velocidad de propagaci´on, la cantidad de combustible disponible y la intensidad del fuego; sus valores aumentan a medida que empeoran las condiciones meteorol´ogicas del fuego. Los seis c´odigos est´andar e ´ındices del Sistema del ´ Indice Meteorol´ogico de Peligro son: 1. C´odigo de humedad de los combustibles finos (FFMC) es un c´odigo num´erico del contenido de humedad de la hojarasca y otros combustibles finos curados. Este c´odigo indica la facilidad de ignici´on e inflamabilidad de los combustibles finos muertos (85). 2. C´odigo de humedad del humus bruto (DMC) es un ´ındice num´erico del contenido promedio de humedad de las capas org´anicas poco compactas o poco profundas. Este c´odigo indica el consumo de combustible en las capas de humus bruto. Dicho de otra manera, este c´odigo estima la cantidad de combustible medio disponible para arder, relacionada con el contenido de humedad de la capa org´anica poco profunda del suelo (85). 3. C´odigo de sequ´ıa (DC) es un ´ındice num´erico del contenido de humedad media en las capas org´anicas profundas y compactas. Este c´odigo indica los efectos de la sequ´ıa estacional sobre los combustibles del bosque, y la cantidad de rescoldos en las capas profundas del suelo vegetal y en los troncos grandes. Es un indicador de la importancia que puede tener la combusti´on sin llama en dicha capa y en la madera de grandes dimensiones (85). 76
2.2 Comportamiento de Incendios Forestales 4. ´ Indice de propagaci´on inicial (ISI) es un c´odigo num´erico que indica el ritmo pronosticable de propagaci´on del incendio. Este combina los efectos del viento y del c´odigo de humedad de los combustibles finos sobre la velocidad de propagaci´on pero excluye la influencia de las cantidades variables de combustible (85). 5. ´ Indice de acumulaci´on (BUI) es un indicador que realiza una clasificaci´on num´erica de la cantidad total del combustible disponible para la combusti´on, combina los c´odigos de humedad del suelo vegetal y de sequ´ıa. (Tambi´en conocido como el c´odigo ajustado de humedad del suelo vegetal o ADMC entre 1969 y 1975). En resumen, representa el grado de disponibilidad del combustible para arder, combina los dos ´ındices DMC y DC (85). 6. El ´ Indice Meteorol´ogico de Peligro de Incendios (FWI) se considera como un indicador de la intensidad de Byram (1959) , que se obtiene combinando el ISI y el BUI, y se emplea como ´ındice general de peligro meteorol´ogico de incendios en Canad´a. Representa la intensidad de propagaci´on del frente de llamas seg´un la cantidad de energ´ıa desprendida por la unidad lineal del frente del incendio (85). En la figura 2.14, se puede ver la relaci´on de los seis componentes entre s´ı. 2.2.4.2 Sistema de evaluaci´on de peligro de incendios de los Estados Unidos (NFDRS) En 1914 los administradores en California determinaron que “la ocurrencia de incendios y el comportamiento del fuego estaban relacionados con la precipitaci´on y la humedad relativa”. Harry Gisborne desarroll´o una medida de riesgo de incendios en la d´ecada de 1930. En los siguientes 25 a˜nos se llevaron a cabo numerosos esfuerzos para desarrollar los sistemas de clasificaci´on de riesgo de incendios. En 1958 exist´ıan al menos nueve sistemas diferentes utilizados por el Servicio Forestal, adem´as de numerosos otros sistemas utilizados por las organizaciones de protecci´on estatales y privadas. En 1958, se tom´o la decisi´on de desarrollar un solo sistema de evaluaci´on de peligro para ser utilizado en todo el pa´ıs. En 1968, el Servicio Forestal comenz´o a trabajar en el desarrollo de un sistema de evaluaci´on de peligro que se construye bas´andose en principios de la ciencia y la ingenier´ıa en lugar de observaciones locales. La primera versi´on del NFDRS fue lanzada en 1972. Fue un sistema de funcionamiento manual compuesto por varias tablas de b´usqueda y nomogramas. Esta primera versi´on inclu´ıa una disposici´on para la evaluaci´on y actualizaci´on del sistema durante los primeros cinco a˜nos despu´es de su publicaci´on. 77
2. ESTADO DEL ARTE Fig. 2.14: El ´ Indice Meteorol´ogico de Peligro de Incendios (FWI) En 1975, se instal´o en un sistema inform´atico accesible a nivel nacional llamado “Administrative and Forest Fire Information Retrieval and Management System” (AFIRMAS) una versi´on automatizada del NFDRS. En 1993, el AFIRMAS fue sustituido por el Sistema de Gesti´on de Informaci´on Meteorol´ogica (“Weather Information Management System” WIMS) como procesador de informaci´on de peligro de incendios y en la actualidad est´a siendo utilizado por la mayor´ıa de las agencias estatales y federales (86). En la figura 2.15, se pueden apreciar las entradas y las salidas del sistema de evaluaci´on de peligro de incendios de los Estados Unidos: 2.2.4.3 Conceptos Importantes 1. ¿Cu´al es el ´ındice de riesgo del incendio?: el FWI fue desarrollado por el Servicio Forestal Canadiense y es utilizado por varios pa´ıses en el mundo, especialmente en Europa. Mediante el uso de este ´ındice, es posible estimar el riesgo de incendio a partir del estado de los diversos combustibles presentes, que se determina indirectamente a trav´es de la observaci´on de los elementos meteorol´ogicos. Para estimar el riesgo de incendio del sistema canadiense FWI se tienen en cuenta las 78
2.2 Comportamiento de Incendios Forestales Fig. 2.15: Estructura del sistema de evaluaci´on de peligro de incendios de los Estados Unidos siguientes variables: Temperatura del aire, Humedad relativa, Velocidad del viento y Cantidad de la precipitaci´on de las ´ultimas 24h. El FWI es un ´ındice acumulativo, lo que significa que el valor de ´ındice para un d´ıa refleja tanto las condiciones observadas en ese d´ıa y su evoluci´on a lo largo del tiempo transcurrido desde el comienzo de la estimaci´on del ´ındice. 2. La tasa de propagaci´on (ROS): es la velocidad de avance lineal del frente de un incendio en la direcci´on perpendicular a la parte delantera del incendio. La definici´on anterior permite el c´alculo de la velocidad de propagaci´on o intensidad de la l´ınea del incendio para cualquier porci´on del per´ımetro del incendio. Cuando se estima la velocidad de propagaci´on mediante la observaci´on del intervalo de tiempo entre llamas y el paso frontal en dos puntos, es importante que los dos puntos est´en orientados perpendicularmente a la parte delantera del fuego. 3. Intensidad del incendio “IF”: probablemente la medida m´as importante del comportamiento del incendio es su intensidad. La “IF” representa el calor liberado por el frente de incendio en cada metro (kW / m). Se trata de una funci´on de producci´on de calor (1) 79
2. ESTADO DEL ARTE de combustible (kilojulios por kilogramo), (2) la cantidad de combustible por unidad de superficie Kgm2y (3) la velocidad de propagaci´on del frente de incendio (km/h). Esta relaci´on es descrita por la ecuaci´on de Byram: I=HWR Donde: I = intensidad (kW /m) H = calor liberado de combustible (J /g) w = combustible consumido Kgm2 r = propagaci´on (m/sec) 4. Comportamiento extremo de un incendio: el comportamiento extremo del incendio se da cuando se alcanza tal nivel de actividad en el mismo que obstaculiza gravemente o impide su extinci´on. Por lo general implica uno o m´as de los siguientes factores: Alta velocidad de propagaci´on y alta intensidad de fuego. Altura alta de coronaci´on. Remolinos grandes de fuego. La columna de convecci´on alta. etc. 2.2.5 El uso de la Inteligencia Artificial en los Incendios Forestales La aplicaci´on de la inteligencia artificial para resolver problemas complejos relativos a los incendios forestales se ha desarrolado en los ´ultimos a˜nos. Los primeros sistemas inteligentes con aplicaciones en incendios forestales aparecieron en la literatura a finales de 1980. Seg´un Kourtz (87) las t´ecnicas de inteligencia artificial han sido reconocidas desde hace tiempo como herramientas adecuadas para el manejo forestal. A continuaci´on se citan algunos trabajos de la aplicaci´on de la inteligencia artificial en el campo de incendios forestales: AlonsoBetanzos et al. (88) calcularon la tasa del riesgo diaria en los bosques y la clasificaron en cuatro categor´ıas simb´olicas de riesgo utilizando una red neural. En (89) Sakr et al. Presentaron un trabajo basado en dos m´etodos de inteligencia artificial (RNAs y MSV ) en el cual trataron de predecir la ocurrencia de incendios forestales bas´andose en la reducci´on del n´umero de entidades de supervisi´on y la eliminaci´on de los mecanismos 80
2.2 Comportamiento de Incendios Forestales meteorol´ogicos de predicci´on. C¸ etin y Yusuf (90) mostraron un sistema de soporte de decisi´on con multiagente para los incendios forestales, que se utiliza en el sistema de apoyo a la toma de decisiones relativas a incendios forestales (FOFDESS), utilizaron las RNAs, un clasificador bayesiano, la l´ogica difusa y el procesamiento de im´agenes en su trabajo. En (91) Li Z. et al. desarrollaron t´ecnicas de teledetecci´on por sat´elite para identificar el humo de los incendios forestales mediante redes neuronales (que fueron exploradas para su aplicaci´on con im´agenes, con muy alta resoluci´on, del radi´ometro (AVHRR) a bordo de sat´elites NOAA). En (92) Armando et al. propusieron un nuevo m´etodo de clasificaci´on en la detecci´on de humos compuestos mediante redes neuronales. En (93) Wu J. et al. propusieron un nuevo algoritmo para la extracci´on de caracter´ısticas del humo de los incendios forestales basado en im´agenes, usando en una red neuronal de impulsos acoplada (PCNN). En (94) Cheng y Wang utilizan t´ecnicas de miner´ıa de datos en espacio-temporales, su modelo se centra en la predicci´on de una zona quemada y utiliza una red neuronal recurrente para combinar los datos hist´oricos de incendios y los datos meteorol´ogicos. Un enfoque similar fue presentado por Cortez y Morais (95), donde exploraron la miner´ıa de datos (DM), los datos meteorol´ogicos y usan una m´aquina de soporte vectorial (MSV), junto con los modelos de FBPs y RNA para predecir la ocurrencia de incendios forestales y estimar la superficie quemada. En (89) Sakr et al. presentaron un algoritmo de predicci´on del riesgo de los incendios forestales, que se basa en MSV para predecir el nivel del riesgo. En (96,97) se propuso un algoritmo de detecci´on en tiempo real de incendios forestales mediante redes neuronales. En (98), Angayarkkani y Radhakrishnan presentaron un sistema inteligente para detectar la presencia de incendios forestales con los datos espaciales forestales utilizando RNAs. En (99) Deng et al. utilizaron un m´etodo basado en redes neuronales para el c´alculo y la predicci´on de la tasa de liberaci´on del calor en diferentes materiales para la seguridad durante los incendios. Otro enfoque para el modelado de la propagaci´on del incendio usando un modelo difuso y neuronal es presentado por Vakalis et al. en (100,101). La reducci´on de falsas alarmas tambi´en se present´o por Okayama (102). Los trabajos citados anteriormente, entre otros, han demostrado la eficacia del uso de la inteligencia artificial para resolver diversos problemas en lo que respecta los incendios forestales. 81
2. ESTADO DEL ARTE ser debido al entorno operativo que puede ser muy complejo y la no linealidad de los sistemas industriales reales, lo que hace dif´ıcil establecer enfoques de pron´ostico efectivos, lo suficientemente robustos para tolerar la incertidumbre, y lo suficientemente fiables para mostrar un rendimiento aceptable en diversas condiciones. ´ Ultimamente se presta una gran atenci´on a enfoques de pron´ostico basado en datos (principalmente las t´ecnicas de inteligencia artificial). Tales m´etodos tienen como objetivo transformar los datos en informaci´on apropiada mediante la realizaci´on de una modelizaci´on no lineal de los sistemas reales. Sin embargo, la aplicabilidad de los enfoques basados esta limitada por los requisitos industriales, tales como la complejidad de la aplicaci´on pr´actica, las decisiones humanas y la parametrizaci´on inicial (121,122). Los problemas de robustez, fiabilidad y aplicabilidad de los pron´osticos, siguen siendo ´areas abiertas que deben ser abordados mediante tareas de investigaci´on y desarrollo. Robustez; puede ser definida como la “capacidad de un enfoque de pron´ostico de ser insensible a las variaciones de los datos de entrada”. En la pr´actica, un enfoque s´olido debe ser lo suficientemente preciso para capturar el comportamiento din´amico de un sistema que se degrada. Fiabilidad; puede ser definida como la “capacidad de que un m´etodo de pron´ostico sea coherente en situaciones en las que se presentan datos nuevos o desconocidos”. Aplicabilidad; puede ser definida como la “capacidad de que un m´etodo de pron´ostico pueda ser aplicado pr´acticamente bajo las limitaciones industriales”. La aplicabilidad puede considerarse frente a diferentes aspectos: requisitos de aplicaci´on, tiempo de c´alculo, l´ımites te´oricos del enfoque o la verosimilitud de hip´otesis. Otras definiciones acerca del pron´ostico industrial existen en (116,123,124), y los principales aspectos que se destacan son: el estado del sistema actual, la proyecci´on (o extrapolaci´on) del estado actual y la estimaci´on del tiempo restante antes del fallo. Estas definiciones se han normalizado por la norma ISO 13381 −1 (125) en el que el pron´ostico se define como la estimaci´on del tiempo de operaci´on antes del fallo y el riesgo futuro de la existencia o aparici´on de uno o varios modos de fallo. Esta norma define los entornos del pron´ostico, identifica los datos necesarios para realizarlo y establece los umbrales de alarma y los l´ımites del sistema. Los pasos principales en la realizaci´on del pron´ostico, tal como se define en la norma citada, se resumen en la figura 2.18. A pesar de que el diagn´ostico y el pron´ostico se refieren a la evaluaci´on de la salud, los resultados del diagn´ostico conducen a decisiones reactivas sobre acciones 88
2.3 Diagn´ostico / Pron´ostico en Equipos Industriales Fig. 2.18: Etapas del Pron´ostico acorde con ISO 13381-1 (126) correctivas, mientras que los resultados del pron´ostico conducen a decisiones proactivas acerca de las acciones preventivas y/o evasivas, con el objetivo de aumentar la vida ´util de los equipos. Los diferentes enfoques de pron´ostico que se han aplicado con ´exito para diferentes tipos de problemas se han basado en la experiencia, an´alisis de tendencias, uso de Inteligencia Artificial la AI y estimadores de estado (127). En general, los pron´osticos pueden ser clasificados seg´un tres enfoques principales: modelos basados en la f´ısica, basados en la experiencia y basados en los datos (128). Los modelos basados en la f´ısica requieren modelos matem´aticos exactos que se construyen a partir del principio f´ısicos de los modos de fallo del sistema (129). Este enfoque se centra en la evaluaci´on de residuos entre la medici´on detectada en el equipo y la salida de los modelos matem´aticos. Este enfoque es el m´etodo m´as preferible cuando hay calidad en los datos medidos durante el funcionamiento y los modelos f´ısicos de los fallos son buenos. Sin embargo, para desarrollar un modelo matem´atico preciso son necesarios conocimiento global y conocimiento sobre la mec´anica te´orica de los equipos monitoreados. El pron´ostico basado en la experiencia depende ´unicamente de las opiniones de expertos y es de menor complejidad que el modelado basado en la f´ısica (129). El enfoque del pron´ostico basado en datos utiliza datos hist´oricos para aprender autom´aticamente el comportamiento del sistema (130). El modelo se utiliza para predecir la VR 2.19. El reto principal con este enfoque es obtener suficientes datos normales hist´oricos para el desarrollo de un modelo de pron´ostico. 2.3.4 Vida ´ Util Remanente “VR” La vida ´util remanente “VR” (Remaining Useful Life “RUL”) llamada tambi´en la vida residual, se refiere al tiempo que queda antes de se produzca el fallo o una aver´ıa debido a la edad y el estado actual de la m´aquina. En algunas situaciones, especialmente cuando hay un fallo, ser´ıa deseable predecir la probabilidad de que una m´aquina funciona sin un fallo o un fracaso hasta alg´un tiempo futuro (por ejemplo, intervalo de inspecci´on siguiente) dada la condici´on 89
2. ESTADO DEL ARTE Fig. 2.19: Estrucutra general para el pron´ostico con RNA actual de la m´aquina y el perfil de funcionamiento anterior. La estimaci´on de la VR es una tarea importante como parte de las labores de Pron´ostico que se incluyen en el proceso de determinaci´on del estado de salud de equipos industriales. En realidad, en cualquier caso, la probabilidad de que un equipo funcione sin fallos hasta un intervalo siguiente de inspecci´on podr´ıa ser una buena referencia para el personal de mantenimiento, para determinar si el intervalo de inspecci´on es apropiado o no. La mayor´ıa de los art´ıculos en la literatura de pron´ostico versa sobre la estimaci´on de la VR (131,132). La estimaci´on de la Vida ´util remanente es la tarea m´as com´un en el campo de investigaci´on sobre pron´osticos y la gesti´on de la salud. El enfoque basado en datos para la estimaci´on de la VR normalmente se basa en la disponibilidad de datos de funcionamiento hasta el fallo, base sobre la cual se puede estimar la VR, ya sea directamente a trav´es de un modelo multi-variable, o indirectamente mediante la estimaci´on de da˜nos por la extrapolaci´on de la progresi´on de fallos (133). Existen diferentes estrategias para la estimaci´on de la vida ´util remanente. En los m´etodos dirigidos por datos “data-driven”, la estrategia estima directamente la VR mediante la aplicaci´on de un modelo multi-variable definido sobre los datos. Otra estrategia es estimar la VR indirectamente de los fallos, luego realizar una extrapolaci´on adecuada para la progresi´on del fallo y calcular la VR mediante la intersecci´on de los fallos extrapolados y el criterio de fallo. Este ´ultimo enfoque requiere la definici´on de los fallos y del criterio de error, que muchas 90
2.3 Diagn´ostico / Pron´ostico en Equipos Industriales veces es muy dif´ıcil de establecer (133). L.C. Tang en (134) considera la vida residual como una variable aleatoria, y presenta su comportamiento asint´otico cuando la funci´on de fiabilidad est´a representada por distintas funciones de distribuci´on. En (135), Lim J. y Park D. H. estudian el comportamiento ascendente de la vida residual, y ponen a prueba la hip´otesis nula de que la vida residual no es mon´otona. Siddiqui y Caglar (136) tratan la vida residual como una variable aleatoria, y dan una representaci´on de su funci´on de distribuci´on. Cuando la distribuci´on es Gamma, o Weibull, los autores calculan la media y la varianza de la variable. Bradley y Gupta tambi´en estudian el comportamiento asint´otico de la vida residual en (137). Los pron´osticos m´as avanzados se centran en el seguimiento de los resultados y la evaluaci´on de la degradaci´on, por lo que los fallos se pueden predecir y prevenir. Para cumplir con el objetivo del pron´ostico, tres pasos fundamentales son necesarios: En primer lugar, tener la capacidad de detectar la anomal´ıa en una etapa temprana. En segundo lugar, el funcionamiento del equipo/sistema debe evaluarse robustamente mediante un seguimiento continuo. Por ´ultimo, la vida ´util remanente y el modo de fallo posible deben ser predichos con un grado de fiabilidad alto. 2.3.5 Clasificaci´on de los modelos para la estimaci´on de la VR Inicialmente, los modelos de estimaci´on de la vida remanente (EVR) se clasificaron en la Figura 2.20. A continuaci´on se presentan algunas conclusiones importantes como fruto de una revisi´on bibliogr´afica. Diversas metodolog´ıas para la estimaci´on de la VR y sus aplicaciones pr´acticas se han propuesto en la literatura. En la figura 2.20 se presenta una clasificaci´on detallada de todas estas metodolog´ıas. Las redes neuronales representan una buena estrategia para resolver problemas complejos sin ning´un conocimiento o suposiciones acerca de la composici´on interna de la estructura o algunas partes de un sistema t´ecnico. La metodolog´ıa de las RNAs se muestra mediante una descripci´on formal de las reglas de transformaci´on que vinculan las entradas y las salidas o mediante la construcci´on de un prototipo del comportamiento que aproxima el funcionamiento del sistema (138). En (139) y (140) las redes neuronales han sido utilizadas para desarrollar las metodolog´ıas de la VR, Shao y Nezu (141) propuso un nuevo concepto llamado progresi´on basada en la predicci´on 91
2. ESTADO DEL ARTE Fig. 2.20: clasificaci´on de metodolog´ıas para la Estimaci´on de la Vida Remanente 92
2.3 Diagn´ostico / Pron´ostico en Equipos Industriales de la vida ´util remanente (PPRL) para estimar la VR de un rodamiento. Este nuevo concepto manipula las variables de entrada a partir de mediciones en l´ınea a trav´es de un modelo neuronal. Los pasos del concepto PPRL incluyen: La aplicaci´on de diferentes normas log´ısticas para comprobar el estado del componente en la etapa inicial de funcionamiento; Dividir el trabajo de predicci´on en predicci´on de evoluci´on general y predicci´on de VR, y la construcci´on del modelo de predicci´on en tiempo real utilizando el m´etodo de ventana m´ovil; La obtenci´on de los l´ımites de la VR. Tambi´en se puede citar los trabajos de Gebraeel et al. (139,140) que desarrollaron una red neuronal para calcular la VR de los cojinetes de elementos rodantes mediante el control de sus vibraciones. Huang et al. (142) presentaron un ejemplo de un m´etodo para predecir la VR de un cojinete de bolas, basado en mapa auto-organizados (SOM) y de un nuevo m´etodo de propagaci´on de redes neuronales. El procedimiento utilizado en su modelo, se compone de los siguientes pasos: Paso 1: Dividir de los datos hist´oricos disponibles de los fallos, que incluye los valores de edad y los valores reales de monitoreo en puntos de inspecci´on de cada hist´orico del fallo. Paso 2: Cada serie de mediciones para un historial de fallos se fija con la funci´on generalizada Weibull-FR. Los valores de edad y los valores de medici´on insertados, en los puntos de control para todos los historiales de fallo, se utilizan para construir el conjunto de entrenamiento de la RNA. Paso 3: El conjunto de validaci´on RNA se construye utilizando los valores de edad y los valores de medici´on reales en los puntos de inspecci´on de todo el hist´orico de fallos. Paso 4: Capacitar el modelo de la RNA por un conjunto de entrenamiento y el conjunto de validaci´on mediante el algoritmo de Levenberg-Marquardt (LM). Despu´es del paso 4, el proceso de entrenamiento de RNA se ha completado, y el modelo RNA entrenado est´a disponible para la predicci´on de la VR. Para un componente de equipo que est´a siendo monitoreado, los pasos siguientes sirven para la predicci´on de la VR para el equipo. Paso 5: En un punto de inspecci´on dado, se obtiene la serie de los valores de medici´on hasta el momento actual. Los valores de medici´on ajustados en los puntos de inspecci´on actuales y anteriores, as´ı como los valores de edad en estos puntos, se utilizan como las entradas al modelo 93
2. ESTADO DEL ARTE neuronal entrenado Paso 6: El porcentaje de la vida residual previsto en el punto actual se calcula utilizando el modelo neuronal entrenado. Paso 7: la VR se calcula bas´andose en la edad actual de los componentes y el porcentaje de la VR prevista. Por ejemplo, si la edad actual es de 400 d´ıas y el porcentaje de vida ´util prevista es del 80%, el tiempo de fallo previsto ser´ıa de 400/80% = 500 (d´ıas), y la VR ser´ıa de 500 −400 = 100 (d´ıas). Paso 8: Cuando nuevos datos de inspecci´on est´an disponibles, repetir el Paso 5 −7 sobre la base de los datos disponibles, y actualizar la predicci´on de la VR. Ventajas: Las redes neuronales son t´ecnicas de modelado muy sofisticadas capaces de modelar funciones extremadamente complejas y de gran alcance para la predicci´on de la VR. Las otras ventajas son la facilidad de uso, la robustez y la generalizaci´on libre del modelo para la estimaci´on de la VR (143). Desventajas: Las redes neuronales son a veces lentas en la fase de entrenamiento cuando hay muchos datos. 2.3.6 Observaciones importantes Durante la realizaci´on de la revisi´on general de las metodolog´ıas utilizadas para el c´alculo de la VR, se han recopilado las siguientes observaciones: La estimaci´on de la VR es muy dependiente del sistema de ingenier´ıa / producto considerado. No todas las metodolog´ıas son aplicables a todos los sistemas / productos. En algunos casos, m´ultiples metodolog´ıas se han fusionado y como resultado la estimaci´on de la VR suele ser m´as precisa que cuando se aplican una ´unica por separado. Independientemente de los tipos de modelos de predicci´on de la VR, por lo general es necesario predecir la evoluci´on futura del indicador de degradaci´on para la predicci´on de la VR. 2.3.7 Conclusi´on La precisi´on de la estimaci´on de la VR depende altamente de la cantidad y la calidad de los datos. En contraste, las metodolog´ıas basadas en modelos f´ısicos depender´an de la comprensi´on fundamental de la f´ısica del fallo del sistema. Los modelos f´ısicos contienen un mapeo 94
2.3 Diagn´ostico / Pron´ostico en Equipos Industriales funcional de los par´ametros del sistema y su comportamiento, en consecuencia la precisi´on de las metodolog´ıas basadas en modelos f´ısicos es sustancialmente mayor que las metodolog´ıas basadas en datos. La combinaci´on de los enfoques basados en caracter´ısticas f´ısicas y los enfoques basados en datos, proporciona una capacidad de pron´ostico m´as completa que la que se obtiene de aplicaciones no combinadas. El resultado es una informaci´on m´as valiosa para la planificaci´on de la inspecci´on de los componentes/equipos durante per´ıodos espec´ıficos. 95
2. ESTADO DEL ARTE 2.4 Estimaci´on de la Demanda de Energ´ıa El´ectrica 2.4.1 Introducci´on Desde principios de los 70s, a ra´ız de la primera crisis del petr´oleo, la energ´ıa llam´o la atenci´on de los responsables pol´ıticos, lo que produjo un aumento y gran inter´es en la investigaci´on de la demanda de energ´ıa “DE”, con el fin de superar la comprensi´on limitada de la misma y de dar respuesta satisfactoria a la DE incluso en circunstancias extraordinarias (144). En la actualidad, la sociedad afronta acontecimientos clim´aticos, sociales y econ´omicos inestables que ocasionan alteraciones en la DE as´ı como en las posibilidades de satisfacerla eficientemente. La DE mundial crece debido al aumento de la poblaci´on mundial. Por ejemplo, el consumo de petr´oleo en Estados Unidos, como uno de los m´as grandes consumidores de energ´ıa del mundo, se ha incrementado en un 20,4% entre 1990 y 2005, su consumo de gas natural tambi´en ha aumentado un 16.32% seg´un la administraci´on de informaci´on de la energ´ıa “EIA” (ver http://www.eia.gov). Los gobiernos y los responsables pol´ıticos demandan pron´osticos precisos de la DE, especialmente de las predicciones a largo plazo, para la toma de decisiones a gran escala, como la planificaci´on de la inversi´on para la generaci´on y distribuci´on de energ´ıa. El debate continuo, entre los ingenieros y los economistas, llev´o a importantes desarrollos metodol´ogicos que enriquecieron el proceso de toma de decisiones sobre la energ´ıa en su conjunto, y se desarrollaron una amplia variedad de modelos para el an´alisis, previsi´on y predicci´on de la demanda de energ´ıa el´ectrica “DEE”. Actualmente, nos encontramos en la era de la tecnolog´ıa y la informaci´on. Las nuevas tecnolog´ıas de la informaci´on y computaci´on ofrecen t´ecnicas de predicci´on cuyo objetivo es obtener estimaciones de valores futuros de una serie temporal a partir de la informaci´on hist´orica contenida en la serie observada hasta el momento actual. Estas t´ecnicas requieren la especificaci´on de los factores que determinan el comportamiento de las variables. Tras determinar el efecto que aporta cada variable explicativa, se puede considerar que en un futuro su influencia permanecer´a inalterable, por lo que si se cuenta con una predicci´on de la evoluci´on futura global, podr´a extrapolarse el comportamiento futuro de la variable de estudio. 2.4.2 Importancia y necesidad de una estimaci´on eficiente de DEE Son varios los tipos de empresas los que requieren las estimaciones a largo plazo de la DEE: Las empresas que de forma regulada o en monopolio estatal, como la distribuci´on y el transporte de electricidad, buscan realizar la cobertura de la demanda de electricidad, logrando un m´ınimo coste con una fiabilidad y calidad razonable mediante la explotaci´on 96
2.4 Estimaci´on de la Demanda de Energ´ıa El´ectrica centralizada del sistema. Para ello tienen que plantear nuevas inversiones que permitan absorber los incrementos futuros previstos. En el caso del transporte el´ectrico lo costea el Gobierno Central, en el caso de la red de distribuci´on el gasto depende de lo que lo ocasione, pudiendo tener que asumir la inversi´on la compa˜n´ıa de distribuci´on o el Gobierno Auton´omico o usuarios y promotores. Las empresas en libre competencia, como las de generaci´on en r´egimen ordinario o especial, que est´an interesadas en conocer cu´al va ser el volumen de negocio al que optan con sus inversiones actuales y futuras, realizando una valoraci´on de las mismas. Considerar el mantenimiento operativo de instalaciones existentes, o su desmantelamiento, as´ı como posibilidades de ampliaci´on o realizaci´on de nuevas inversiones. Si las predicciones resultan muy bajas podr´ıan aparecer deficiencias en el suministro de energ´ıa, con inconvenientes para distintos sectores econ´omicos, siendo los costes muy superiores a la energ´ıa no abastecida. Si por el contrario, las estimaciones han resultado excesivas, los costes de oportunidad presentados ser´ıan elevados, present´andose una elevada inversi´on econ´omica improductiva. En ambos casos, ya sea por defecto o por exceso, se encarecer´ıa el precio que paga el consumidor. Si se produjera una carencia, a fin de ajustar la curva de producci´on con la demanda subir´ıa el precio de la energ´ıa consumida, como bien de este comercio. Si por el contrario se produjera un exceso de generaci´on, los costes asociados a la misma, a pesar de no emplearse, se repercutir´an al consumidor igualmente, dado que en la mayor´ıa de los casos el cliente no cuenta con opci´on a prescindir de este bien, cambi´andolo por otro. Las comercializadoras, han visto aumentar el n´umero de clientes a los que suministrar electricidad, con el consiguiente crecimiento de la incertidumbre a la hora de gestionarles la energ´ıa. Para minimizar el riesgo del precio las comercializadoras pueden firmar contratos de compra/venta de energ´ıa a medio y largo plazo en distintos mercados. Antes de acudir a los mercados de medio y largo plazo (f´ısicos o financieros) es necesario conocer, con la menor incertidumbre posible, el consumo de su cartera de clientes, y as´ı poder ajustar las cantidades de energ´ıa para la que desea cubrir su riesgo de precio. En este punto es cuando surge la necesidad de disponer de un buen modelo de previsi´on de energ´ıa el´ectrica a medio o largo plazo. A las administraciones p´ublicas les corresponde garantizar el fluido el´ectrico a la poblaci´on, para mantener su nivel de vida, y todas las actividades econ´omicas, sean del sector pri97
3. CONTRIBUCIONES 3.1 Introducci´on En el cap´ıtulo 2, se han introducido los conceptos y definiciones y deficiencias de las RNAs, un repaso bibliogr´afico sobre el comportamientos de los incendios forestales, la vida remanente y la demanda de energ´ıa el´ectrica en los que se centrar´an las aplicaciones pr´acticas de esta memoria. Este cap´ıtulo presenta las contribuciones originales que se han podido llevar a cabo durante este periodo de investigaci´on. Para dar mayor claridad a la exposici´on se ha decidido describir cada contribuci´on en un apartado diferenciado, realizando una exposici´on detallada de las mismas, atendiendo a los aspectos te´oricos y metodol´ogicos que se completar´an con los resultados del dise˜no experimental que se presentar´a en el cap´ıtulo siguiente. 3.2 Contribuciones en las Redes Neuronales Artificiales Las aportaciones que a continuaci´on se citan han surgido de las necesidades espec´ıficas y complejas (retos I−RAMS) descritas en el cap´ıtulo de introducci´on. Para responder a los nuevos retos es necesario mejorar deficiencias y limitaciones observables en las aplicaciones de las actuales RNA, especialmente en lo que respecta a su arquitectura, estabilidad y a la fiabilidad de sus respuestas. Como primera etapa se ha realizado un an´alisis exhaustivo de los conceptos, definiciones y teor´ıas, as´ı como de las consideraciones te´orico-pr´acticas para la aplicaci´on de las redes neuronales artificiales (RNA), ya expuestas en 2.1. Como segunda etapa se han comparado los resultados de ese an´alisis con las necesidades de los casos de aplicaci´on afrontados en la l´ınea de investigaci´on I−RAMS en la que se enmarca este trabajo. En la etapa final se han definido las necesidades y posibilidades abordables cuya investigaci´on ha permitido establecer las contribuciones que aqu´ı se describen. Como referencia para la descripci´on de las contribuciones en el uso de las RNA, se seguir´a el esquema mostrado en la figura 3.1 que muestra las etapas est´andar para crear una RNA cuyo dise˜no permita la resoluci´on de problemas complejos. 3.2.1 Aportaci´on para la definici´on de la estructura Se ha mostrado en el an´alisis del estado del arte que no existe un criterio ´unico para definir el n´umero de neuronas ocultas necesarias y suficientes para garantizar mejor convergencia. Existen varias propuestas para hacer frente a este problema, entre ellas se pueden mencionar: 104
3.2 Contribuciones en las Redes Neuronales Artificiales Fig. 3.1: Etapas para aplicar las RNA Comenzar con una red de gran tama˜no y luego disminuir su tama˜no hasta lograr una menor complejidad computacional y un rendimiento mejor en la generalizaci´on 2.1.5.4, aplicar la eliminaci´on de Gauss-Jordan con m´ınimos cuadrados lineales que se ha discutido en (161), usar la descomposici´on de Cholesky (162), aplicar el algoritmo cl´asico de Gram-Schmidt (163), usar m´ınimos cuadrados ortogonales (164) y emplear m´etodos evolutivos (165), (166), (167), etc. La comparaci´on de resultados entre las diferentes propuestas mencionadas no es concluyente, por lo que sigue siendo generalizado el uso de la experimentaci´on para elegir el n´umero de neuronas y capas ocultas. En general se procede entrenando varias redes neuronales con diferente n´umero de capas ocultas y de neuronas en cada capa, midiendo a continuaci´on el desempe˜no, por ejemplo mediante validaci´on cruzada (detallada en 2.1.11.8). Por ello tanto los procesos de prueba-error como los de b´usqueda (exhaustiva, restringida, optimizando alg´un objetivo, etc.) son a priori utilizables. Para el tipo de problemas abordados en este trabajo se han ensayado varios algoritmos hasta concluir que el que a continuaci´on se describe contribuye a la mejora de resultados. El algoritmo denominado “NNFINDER” (Neural Network Finder) es de tipo restringido y permite evaluar distintos rangos de neuronas ocultas, as´ı como el n´umero de las capas ocultas, el n´umero de iteraciones m´aximas y el error m´aximo. La descripci´on del algoritmo NNFINDER se muestra en 2y consiste esencialmente en la realizaci´on de iteraciones sucesivas hasta que se cumpla un criterio de parada. El criterio de parada no es fijo por lo que habr´a que ajustarlo en funci´on del tipo del problema abordado. El criterio general utilizado para ajustar el criterio de parada en la resoluci´on de los problemas abordados en esta memoria se basa en dos magnitudes: El error y el n´umero m´aximo de iteraciones. El entrenamiento no para hasta alcanzar el n´umero m´aximo establecido de iteraciones o que el error sea constante o creciente. Como resultado se obtienen varias redes candidatas, y se elige la mejor empleando un criterio de decisi´on adaptado al problema bordado. El algoritmo NNFINDER 2es de orden (n×m), un poco elevado sobre 105
3. CONTRIBUCIONES Algorithm 2 Algoritmo NNFINDER 1: Descripci´on del Algoritmo NNFINDER. 2: for i= 1,2, . . . , m do 3: for j= 1,2, . . . , n do 4: Entrenar; 5: if Criterio de Parada = correcto then 6: Red Entrenada 7: end if 8: if Criterio de Parada = falso then 9: Error 10: end if 11: end for 12: end for todo cuando hay muchas entradas. Para superar este defecto, se propone modificar el criterio de parada eligiendo menos iteraciones de entrenamiento. Una vez se elige la mejor estructura (por ejemplo: mejor error de entrenamiento y menos neuronas ocultas), se puede ir aumentando el n´umero de iteraciones para disminuir el error global de entrenamiento y el de validaci´on. En la figura 3.2 se muestra una captura de pantalla del ejecutable NNFINDER que se utiliza en todas las aplicaciones de esta investigaci´on con el prop´osito de encontrar la mejor estructura y evaluar su eficacia. 3.2.2 Aportaci´on sobre la inicializaci´on de pesos La generaci´on de los valores iniciales de los pesos en una red neuronal, generalmente, se hace mediante un generador de n´umeros pseudoaleatorio llamado GPAN. GPAN es un algoritmo que produce una sucesi´on de n´umeros aleatorios, y el estado del GPAN no es exactamente aleatorio en el sentido de que la sucesi´on queda completamente determinada por un conjunto de valores iniciales relativamente peque˜no. Otros enfoques son las implementaciones de “Nguyen Widrow Weight Initialization” y la de “Fan-In Weight Randomization”. La t´ecnica “Fan-In Weight Randomization” fue introducida por Simon Haykin en (168). Aqu´ı los pesos se inicializan usando la siguiente f´ormula: w=min n+αmax −min nSiendo αun n´umero aleatorio entre −1y 1. Y nes el n´umero de neuronas ocultas. Por otra parte, la t´ecnica de “Nguyen Widrow Weight Initialization”, fue introducida por Derrick Nguyen y Bernard Widrow en (169), y para implementar esta t´ecnica, primero se inicializan los pesos de la red neuronal con valores al azar en un rango espec´ıfico. Luego se calcula un par´ametro βde la 106
3.2 Contribuciones en las Redes Neuronales Artificiales Fig. 3.2: Programa NNFINDER siguiente manera: β= 0.7×n1/m Siendo nel n´umero de las neuronas ocultas, y m el n´umero de las entradas. Despu´es se calcula la distancia euclidiana de todos los pesos: D=v u u t n X i=1 w2 i Una vez calculado βyD, se modifican los pesos de la siguiente manera: wi=βwi D Se ha demostrado emp´ıricamente que la t´ecnica de “Fan-In Weight Randomization” es una t´ecnica eficaz, pero generalmente no proporciona tan buenos resultados como la t´ecnica “Nguyen Widrow Weight Initialization” (170). Ahora bien, las dos t´ecnicas son mejores que la inicializaci´on mediante un generador pseudoaleatorio de n´umeros (GPAN), aunque lo usan. Sin embargo el m´etodo de Nguyen sigue presentando la deficiencia de que tambi´en depende de la inicializaci´on aleatoria de los pesos adem´as de requerir m´as c´alculos, aunque no es una tarea compleja o que necesite mucho tiempo de c´alculo. 107
3. CONTRIBUCIONES En 2.1.11.5, se han explicado algunas recomendaciones encontradas en la literatura para la inicializaci´on de los pesos. En general se trata de inicializar los valores de los pesos dentro de unos rangos muy peque˜nos, pero la pregunta que cabe hacer es: ¿hasta qu´e punto este enfoque general es fiable y permite concluir que esta inicializaci´on es buena y no?, ¿hay mejores? Para responder a estas preguntas, es importante tener presente que a priori se desconoce la arquitectura adecuada de la red neuronal m´as adecuada para resolver un problema concreto. No existe ning´un teorema universal que defina el n´umero de neuronas ocultas que debe tener una red neuronal, siendo por tanto frecuente que los investigadores y aplicadores utilicen el error global de entrenamiento de la RNA como indicador para decidir el n´umero de neuronas ocultas. Tambi´en hay que tener presente, como se ha se˜nalado en apartados anteriores, que cada vez que se entrena una red neuronal se generan los pesos iniciales (matriz de pesos de la red) de forma aleatoria. Por consiguiente en cada entrenamiento, se generan pesos iniciales distintos y se obtiene un error diferente a los del resto de entrenamientos, aunque se est´e usando la misma arquitectura de la RNA (mismo n´umero de neuronas ocultas, mismo n´umero de capas, mismos datos de entrenamiento, mismas funciones de activaci´on, mismo criterio de parada). Como ilustraci´on a continuaci´on, se han generado dos redes neuronales con datos de entrenamiento de dos problemas distintos. Para el conjunto 1, los datos utilizados son datos reales del monitoreo de las actividades f´ısicas de nueve individuos, para 18 diferentes actividades. Las mediciones de monitoreo han sido realizadas a trav´es de sensores. El conjunto de datos se pueden descargar en “PAMAP project’s” http://www.pamap.org/demo.html. Para el conjunto 2, los datos completos y una descripci´on completa se pueden encontrar en el repositorio UCI de bases de datos de aprendizaje autom´atico http://kdd.ics.uci.edu/databases/ covertype/covertype.html. Los datos son de un problema real que describe el ´area quemada de los incendios forestales ocurridos, obtenidos del Servicio Forestal de Estados Unidos (USFS) usando sistema de Informaci´on de Recursos (RIS) de datos, se trata de predecir tipo de bosque a partir de variables cartogr´aficas. Y se ha usado el mismo algoritmo de entrenamiento (RPROP), definido en 2.1.10.4. La figura 3.3 corresponde a la red 1 con datos de entrenamiento (datos 1) del problema propuesto en 4.2) y la figura 3.4 corresponde a la red 2 con datos de entrenamiento (datos 2) del problema propuesto en 4.3). Se muestra la evoluci´on del error de entrenamiento para la misma configuraci´on de la red neuronal (n´umero de entradas / salidas, neuronas ocultas y capas del modelo, son fijos) pero en diferentes sesiones de entrenamiento. Como se puede observar la evoluci´on del entrenamiento es diferente en cada caso. 108
3.2 Contribuciones en las Redes Neuronales Artificiales Nota 8 En las figuras, el s´ımbolo E−i,i∈ {1,2, ...}, se refiere a la ejecuci´on i. 0 20 40 60 80 100 120 140 160 180 200 220 240 260 280 300 0.6 0.7 0.8 0.9 Ciclo Error de Entrenamiento (Datos 1) E-1 E-2 E-3 E-4 E-5 E-6 E-7 E-8 E-9 E-10 Fig. 3.3: Evoluci´on del error (Datos 1) 0 20 40 60 80 100 120 140 160 0.2 0.3 0.4 0.5 Ciclo Error de Entrenamiento (Datos 3) E-1 E-2 E-3 E-4 E-5 E-6 E-7 E-8 E-9 E-10 Fig. 3.4: Evoluci´on del error (Datos 2) La aportaci´on de esta tesis pretende encontrar una forma determinista para la inicializaci´on de los pesos, que satisfaga los siguientes requisitos: 1. Garantizar la convergencia durante el entrenamiento 2. Garantizar el mismo resultado. 109
3. CONTRIBUCIONES 3. Ofrecer buen resultado En las redes unidireccionales, ante un patr´on de entrada, las neuronas responden proporcionando directamente, la salida del sistema. Al no existir bucles de realimentaci´on no existe problema en relaci´on a su estabilidad. Por el contrario, las redes con realimentaci´on (las RNA empleadas en esta tesis) son sistemas din´amicos no lineales, que requieren ciertas condiciones para que su respuesta acabe convergiendo a un estado estable o un punto fijo (23,171). Una serie de teoremas generales (teorema de Cohen-Grossberg (172), teorema de CohenGrossberg-Kosko (173), etc.) indican las condiciones que se deben cumplir para asegurar la estabilidad y la convergencia. B´asicamente, el teorema de Cohen-Grossberg (172) establece las condiciones que garantizan la estabilidad asint´otica global de un sistema din´amico no-lineal. Este teorema se basa en el concepto de la funci´on de energ´ıa de Lyapunov. El m´etodo de Lyapunov establece que para un sistema din´amico, como puede ser una RNA, de variables de entrada xi, i ∈ {1,··· , n}, si el sistema est´a en reposo solamente en el origen, entonces existen derivadas de las ecuaciones que lo describen en todo el dominio, las variables est´an acotadas y se puede encontrar una funci´on, llamada funci´on de energ´ıa de Lyapunov, de las variables (x1,··· , xn), tal que: ˙ L= n X i=1 dL dxi≤0,∀˙xi Entonces el sistema converge para todas las posibles entradas (x1,··· , xn). En esencia, se trata de ser capaz de encontrar una cierta funci´on energ´ıa, que cumplas con las propiedades anteriormente descritas, lo que se puede interpretar en el campo de las RNA como que la funci´on de minimizaci´on del error es asociable a esa funci´on de energ´ıa. Consid´erese a continuaci´on el teorema de Cohen-Gorssberg (172), que establece lo siguiente: Para cualquier sistema din´amico no lineal que se pueda describir de la forma siguiente: dxi dt =αi(xi) βi(xi)− n X i=1 wijSj(xi)!, i = 1,2, . . . , n Tal que: La matriz kmijkes sim´etrica y mij ≥0,∀i, j La funci´on αi(s) es continua ∀s≥0 αi(s)≥0,∀s≥0; Si(s),∀s≥0. 110
3.2 Contribuciones en las Redes Neuronales Artificiales Entonces la funci´on: E=1 2 n X i=1 n X j=1 wijSi(xi)Sj(xj)− n X i=1 xi Z0 S0i(θj)βi(θi)dθi Es una funci´on de energ´ıa de Lyapunov para el sistema, y el sistema es estable. Por lo tanto en el caso de una red neuronal, considerando la funci´on de minimizaci´on del error E, y la matriz de pesos wij. Entonces . E= n P i=1 dE dxi≤0,∀xisiempre y cuando se cumplen las siguientes condiciones: Simetr´ıa y no-negatividad de los wij, es decir wij =wji ≥0,∀i, j Sies una funci´on diferenciable, no-negativa y no decreciente. αiyβison funciones continuas , y αi(t)≥0,∀t≥0 Entonces el sistema es estable y converge a un equilibrio en finitos puntos o finitas iteraciones. Grossberg y Cross aplicaron el mismo concepto para demostrar la estabilidad de funci´on de energ´ıa Lyapunov en diversas redes neuronales feedforward (174). Por otra parte, Hopfield demostr´o que su modelo neuronal completamente interconectado era estable en el caso de que la matriz de pesos fuese sim´etrica y de diagonal nula (171). La aportaci´on de esta tesis, consiste en considerar la inicializaci´on de los pesos de una RNA feedforward mediante la matriz de Hilbert. Esta matriz fue introducida por Hilbert en 1894 (175), que es una matriz sim´etrica definida positiva, definida en cada unidad seg´un la f´ormula siguiente: Hij =1 / i+j−1En la matriz siguiente, un ejemplo de una matriz de Hilbert de orden (n×m) es: 11 2 1 3... 1 n−2 1 n−1 1 n 1 2 1 3 1 4... 1 n−1 1 n 1 n+1 1 3 1 4 1 5... 1 n 1 n+1 1 n+2 . . . . . . . . . . . . . . . . . . . . . 1 m−2. . . . . . . 1 m+n−3 1 m−1 1 m 1 m+1 . . . . 1 m+n−3 1 m+n−2 1 m 1 m+1 1 m+2 ... 1 m+n−3 1 m+n−2 1 m+n−1 Por lo tanto, aplicar esta matriz a una red neuronal, que a su vez satisface las condiciones del teorema Cogen-Gorssberg, garantiza la convergencia de la red neuronal, algo primordial que en los m´etodos que se basan en la inicializaci´on aleatoria no siempre ocurre. 111
3. CONTRIBUCIONES Por otra parte, al tratarse de un m´etodo de inicializaci´on determinista se garantiza la obtenci´on del mismo resultado si se vuelve a repetir el proceso de entrenamiento con la misma arquitectura. Esta caracter´ıstica (que podr´ıa constituir una ventaja frente a los m´etodos existentes), deber´ıa permitir la resoluci´on de algunos de los inconvenientes mencionados anteriormente para aplicar una RNA a determinados problemas. Citamos el hecho de que obtener el mismo resultado cada vez que se repite el entrenamiento, permite comparar si al a˜nadir/eliminar m´as neuronas ocultas mejora en t´erminos absolutos el resultado del entrenamiento de la RNA. El algoritmo para la inicializaci´on de los pesos se define de la manera siguiente en 3: El Algorithm 3 Inicializaci´on de pesos 1: Inicializaci´on de los pesos 2: mn´umero de entradas 3: nn´umero de neuronas ocultas 4: ln´umero de salidas 5: for i= 1,2, . . . , m do 6: for j= 1,2, . . . , n do 7: wij =1 i+j−1 8: end for 9: end for 10: for j= 1,2, . . . , n do 11: for k= 1,2, . . . , l do 12: wjk =1 k+j−1 13: end for 14: end for planteamiento anterior satisface los dos primeros requisitos mencionados al principio de esta secci´on. Queda pendiente el tercer requisito ”ofrecer buenos resultados”, que se analizar´a en el cap´ıtulo dedicado a la experimentaci´on de esta tesis. 4 Los resultados de la evoluci´on del error durante el entrenamiento, junto con las evoluciones del error mediante la inicializaci´on de los pesos aleatoriamente, se presentan en 4.1, para poder realizar una comparaci´on con otras t´ecnicas de inicializaci´on bien conocidas y aplicadas. 3.2.2.1 Aportaci´on sobre las funciones de activaci´on Para los retos I−RAMS abordados en este trabajo de investigaci´on es importante la velocidad de todo el proceso de obtenci´on de la red neuronal entrenada, por ello se ha analizado la posibilidad de acelerar el proceso de entrenamiento. Tras varias formulaciones se ha desarrollado el concepto de “suavizado” de las funciones de activaci´on que les confiere la propiedad de 112
3.2 Contribuciones en las Redes Neuronales Artificiales activaci´on para valores menores que el est´andar en RNA. La forma escogida de realizar este “suavizado” ha sido la introducci´on de un factor en la formulaci´on que permite adem´as el escalado de las activaciones para diferentes valores del mismo. Dado que para problemas no lineales se usan generalmente la funci´on sigmoidal “Sigm” o la funci´on tangente hiperb´olica “Tanh”, la formulaci´on del “suavizado” se ha centrado en estas dos funciones. Por otra parte, las modificaciones de “suavizado” llevadas a cabo en las funciones de activaci´on cumplen los requisitos establecidos en 2.1.5.5, lo que garantiza que se pueden implementar para la resoluci´on de problemas no lineales. Suavizado de la funci´on sigmoidal Se ha definido la funci´on sigmoidal anteriormente en 7, y la idea es usar la forma general de las funciones sigmoidales, que a˜naden un factor αde suavizado en 3.1, de la siguiente manera: y= 1/(1 + e−αx) = f(x) y= 1/(1 + e−αx) = f(x) (3.1) Donde α∈R La ecuaci´on 3.1 tambi´en define una funci´on continua, que tiende a 1 cuandox >> 0, y tiende a 0 cuandox << 0, igual a 1 2cuandox= 0. . Y calculando su derivada se obtiene: dy dx =d dx(1 1 + e−αx ) dy dx =d dx(1 + e−αx)−1 dy dx =−1×(1 + e−αx)−2×e−αx ×−α dy dx =α 1 + e−αx ×e−αx 1 + e−αx dy dx =α 1 + e−αx ×1 + e−αx −1 1 + e−αx dy dx =α 1 + e−αx ×1 + e−αx 1 + e−αx −1 1 + e−αx Por lo tanto: dy dx =αy(1 −y) (3.2) En la figura 3.5, se muestra la presentaci´on grafica de la funci´on α-Sigm, para: α= 1,2,3. 113
3. CONTRIBUCIONES El porcentaje medio de error absoluto (MAPER): esta medida cuantifica el error medio del modelo en porcentaje: MAPER =1 T T X t=1 100.ε(t) ISreal(t)(3.8) La exactitud relativa “Relative accuracy measure (RA)”: es una medida que permite evaluar la exactitud de la estimaci´on de la RUL en diferentes momentos: RA = 1 −|ISreal(t)−IS(t)| ISreal(t)(3.9) Est´as m´etricas son ´utiles y han sido ampliamente utilizadas en aplicaciones cient´ıficas. Sin embargo proponen informaci´on acerca de todo el conjunto de la muestra, pero no sobre un punto/dato individual. Por consiguiente, su uso es bueno para comparar las redes neuronales una vez entrenadas con objeto de seleccionar la m´as adecuada (en general la de menor error). En esta tesis se proponen como novedosos los siguientes indicadores: Un indicador que proporciona el porcentaje de error en cada punto, que viene definido as´ı: Ind1i= 100.exp −(reali−estimadoi)2 MSE !,∀i(3.10) Se ha elegido esta f´ormula por las siguientes razones: En primer lugar por utilizar la funci´on exponencial que es una funci´on estrictamente creciente, por lo tanto se incrementa el contraste entre el error cometido en los diferentes puntos. La pendiente del gr´afico en cualquier punto ser´a la altura de la funci´on en ese punto. Siendo MSE = n P i=1 (xi−yi)2 n , se ha usado (xi−yi)2 MSE para que muestre lo que representa el error cometido en un punto respecto al conjunto global. El signo negativo en la exponencial es debido a que 0 <exp(x)≤1,∀−∞< x ≤0, y se tiene que: 0>−(xi−yi)2 MSE =−n(xi−yi)2 n P i=1 (xi−yi)2>−n Por lo tanto, 0 <exp −(xi−yi)2 MSE <1, es decir: 0 < Ind1i<100,∀i 120
3.3 Contribuciones en la Aplicaci´on de RNA en la Predicci´on de la Vida ´ Util Remanente en Equipos Industriales Este indicador permite dar un valor que se interpreta en t´ermino de porcentaje (×100). Un indicador basado en el indicador anterior y el intervalo de confianza Como se ha descrito anteriormente en refaportacionconfianza, se dispone del intervalo de confianza de forma individual, (se le va denotar por Ind1), denotando al indicador anterior por Ind2, se propone otro indicador que refleja tanto la informaci´on dada por Ind1yInd2, de la forma siguiente: Ind3=(Ind1+Ind2) / 2 El comportamiento de estos indicadores se analizar´a en el cap´ıtulo dedicado a experimentaci´on de esta tesis. 121
3. CONTRIBUCIONES 3.4 Contribuciones en la Aplicaci´on de las RNA en el Comportamiento de Incendios Forestales La investigaci´on del comportamiento de Incendios Forestales se realiza desde muy diversos enfoques y la ciencia ha contribuido con grandes avances en la modelizaci´on, como se ha comentado en 2. Entre las ´ultimas tendencias cabe citar la fuerte orientaci´on hacia la ayuda a la toma de decisiones por parte de los responsables de extinci´on. Esta toma de decisiones se caracteriza por la necesidad de adoptar medidas en cortos espacios de tiempo y en base a informaci´on de campo, experiencia previa y resultados de los modelos. Entre otras los Directores de Extinci´on consideran muy valiosas las respuestas a las siguientes preguntas: ¿Cu´ando alcanzar´a el incendio zonas cr´ıticas? ¿En qu´e direcci´on o direcciones se propagar´a el incendio? ¿Cu´anta superficie puede quemar un incendio? ¿Cu´al ser´a la velocidad de propagaci´on del incendio? ¿Cu´ales ser´an el ´area, el per´ımetro y la distancia recorrida por el incendio en la direcci´on de propagaci´on principal despu´es de 1 hora o m´as? ¿Ser´a un incendio de alta intensidad o de baja intensidad? ¿Ser´a un incendio continuo o discontinuo? ¿Ser´a un incendio de superficie o de copas de ´arboles? ¿Qu´e tan dif´ıcil ser´a controlar la extinci´on? ¿Cu´al es el riesgo del incendio? Con frecuencia los modelos tradicionales son costosos en t´erminos de tiempo de CPU y por tanto pueden resultar ´utiles para la planificaci´on de las emergencias (Definir Planes de Extinci´on), pero poco ´utiles para responder cada vez que se requiera a las preguntas anteriormente citadas y, por ende, poco ´utiles para la ayuda a la toma de decisiones en tiempo real. Como resultado de sus trabajos Gimblett y Ball (178) se˜nalaron que la toma de decisiones en los recursos naturales a menudo conduce complejidad m´as all´a del alcance de las t´ecnicas estad´ısticas emp´ıricas, y requiere de enfoques a veces m´as heur´ısticos que algor´ıtmicos, conclusi´on que sigue 122
3.4 Contribuciones en la Aplicaci´on de las RNA en el Comportamiento de Incendios Forestales siendo totalmente v´alida hoy en d´ıa. Otros autores han analizado las diferentes fuentes de error presentes en los m´etodos cl´asicos (7,8,9,10,11), identificando entre otros la falta de aplicabilidad, inexactitud interna y errores en los datos de entrada (datos an´omalos y/o inexistentes). De entre los errores en los datos de entrada cabe destacar el asociado a la inexactitud sobre el tipo de combustible asociable a la masa forestal, debido a la no uniformidad, la discontinuidad, la heterogeneidad y la presencia de m´ultiples capas de vegetales. La aplicaci´on propuesta en esta investigaci´on consiste en usar las RNA como m´etodo alternativo a las metodolog´ıas tradicionales (2.2), que no pretenden sustituirlos pero si complementarlos, especialmente en el apoyo a la toma de decisiones aportando respuestas r´apidas y suficientemente precisas a algunas de las preguntas antes citadas. El modelo neuronal buscado se inspira en las mismas entradas y salidas que los modelos convencionales, pero pretende crear y encontrar arquitecturas neuronales que tengan en cuenta solo algunas entradas y no todas, con la condici´on de conservar una calidad similar en la predicci´on de las salidas (par´ametros) que los m´etodos tradicionales. La arquitectura del modelo propuesto, denominado ANNFBP, consiste de una red neuronal feedforward de tres capas. La primera y la tercera son reservadas para las entradas y las salidas deseadas sucesivamente. El algoritmo de entrenamiento usado est´a definido en definido en 2.1.10.4. Respecto a las funciones de activaci´on tanto para la segunda capa como para la ´ultima, se ha utilizado la tangente hiperb´olica definida en la ecuaci´on 2.4. Respeto a las entradas del modelo neuronal, han sido las misma que las de los modelos convencionales (detallados en 2). La arquitectura obtenida del modelo neuronal es la siguiente: Para disminuir la influencia de los errores, antes mencionados, asociados a los datos se propone optimizar las entradas analizando si existen subconjuntos de las mismas que conducen a resultados aceptables. El algoritmo utilizado para optimizar (reducir) las entradas se detalla en la siguiente figura 3.10. Tras la aplicaci´on de este algoritmo las entradas elegidas para la red neuronal se ilustran en la figura 3.11 y3.12, con una estrella, para obtener las salidas deseadas a su vez marcadas con dos estrellas. Las figuras reflejan respectivamente el modelo forestal canadiense definido en 2.14 y la estructura del sistema canadiense de predicci´on del comportamiento de los incendios forestales definido en 2.12. En el cap´ıtulo 4, se analiza el rendimiento de este modelo con dos caso de estudio, y se comparar´an los resultados del modelo neuronal con los resultados de otros modelos. 123
3. CONTRIBUCIONES Fig. 3.9: Estructura del modelo ANNFBP 124
3.4 Contribuciones en la Aplicaci´on de las RNA en el Comportamiento de Incendios Forestales Fig. 3.10: Algoritmo para la reducci´on de entradas 125
3. CONTRIBUCIONES Fig. 3.11: El ´ındice de FWI 3.5 Contribuciones en la Aplicaci´on de las RNA en la estimaci´on de la demanda de energ´ıa el´ectrica La estimaci´on de la demanda de energ´ıa el´ectrica (DEE) es muy importante para lograr una operaci´on segura y econ´omica de los sistemas el´ectricos. Sobra indicar la importancia de la electricidad, y el alcance de su empleo en el mundo actual. La planificaci´on del sistema de energ´ıa el´ectrica abarca un conjunto de problemas de optimizaci´on interrelacionados entre ellos, los cuales requieren de una predicci´on eficiente de la demanda. Los factores econ´omicos, los t´ecnicos y la gesti´on de la demanda son claves en la comprensi´on de las tendencias a largo plazo. Las tendencias futuras de energ´ıa son fundamentales para la formulaci´on de pol´ıticas que permitan el desarrollo de nuestra sociedad. La aproximaci´on de las t´ecnicas de predicci´on es importante para intentar reducir la incertidumbre de la demanda y as´ı obtener una programaci´on ´optima y realista. La estimaci´on de la DEE es un problema de inter´es en la comunidad cient´ıfica. En la actualidad nos encontramos frente a unos nuevos acontecimientos clim´aticos, sociales, econ´omicos y tecnol´ogicos, que dan lugar a nuevos conceptos y situaciones que generan incertidumbre y dificultan la estimaci´on. 126
3.5 Contribuciones en la Aplicaci´on de las RNA en la estimaci´on de la demanda de energ´ıa el´ectrica Fig. 3.12: Estructura del sistema FBP 127
3. CONTRIBUCIONES Disponer de nuevas herramientas/modelos que pueden hacer frente a estos cambios, es indudablemente necesario, para evitar p´erdidas econ´omicas y no abusar de los recursos naturales sin necesidad. Por consiguiente, se ha propuesto comparar la predicci´on de la actual DEE usando RNA con las predicciones de otros m´etodos tanto lineales como no lineales. De entre los m´etodos lineales por su amplio uso y aceptaci´on, se han elegido los modelos de regresi´on logar´ıtmica y lineal m´ultiple. Estos se compararan con otros basados en Inteligencia Artificial, de entre los que por los mismo criterios se han seleccionado los siguientes: M´aquina de Soporte Vectorial (con n´ucleo lineal y con n´ucleo gaussiano), Algoritmo Gen´etico y una RNA. Se ha creado un modelo neuronal, con una estructura b´asica (una capa oculta), teniendo en cuenta solo tres variables (entradas del modelo); Poblaci´on (POB), ´ Indice de Precios al Consumidor (IPC) y Producto Interior Bruto (PIB) (ver figura 3.13). Se a˜nadir´a al modelo la consideraci´on de intervalos de confianza. Las propuestas anteriormente mencionadas en este cap´ıtulo ser´an validadas o rechazadas mediante el dise˜no experimental detallado en el cap´ıtulo 4de esta memoria. Fig. 3.13: El modelo neuronal para la estimaci´on de la DEE 128
CAP ´ ITULO 4 EXPERIMENTACI ´ ON Y APLICACIONES 129