Estudios de predicción en series temporales de datos meteorológicos utilizando redes neuronales recurrentes
Abstract
En los últimos años, en el campo de las energías renovables, la energía eólica ha sido una de las que mas se ha desarrollado e invertido. La importancia de las predicciones de viento radica en la ayuda que aportan para planificar y anticiparse a los valores futuros que afectarán al sistema, ayudando a gestionar la adquisición de los recursos necesarios con antelación suficiente. Recientemente se han desarrollado nuevas arquitecturas de redes recurrentes que resultan muy prometedoras para realizar predicción. En este trabajo se probará y experimentará con dichas arquitecturas para realizar distintas predicciones de la velocidad del viento en un horizonte de corto y muy corto plazo a partir de datos de series temporales de viento.
Full text
ESTUDIOSDEPREDICCIÓNEN SERIESTEMPORALESDEDATOS METEOROLÓGICOSUTILIZANDO REDESNEURONALESRECURRENTES Autor:BesayMontesdeocaSantana Tutor:CayetanoGuerraArtal Fecha:12072016
Índice. 1. Introducción:Generacióneólica. 1.1. Importanciadelaprediccióneólica. 2. Objetivos 3. Antecedentesydefinicióndeconceptos. 3.1. AprendizajeAutomático. 3.2. RedesNeuronales. 3.2.1. Introducción. 3.2.2. Historia. 3.2.3. RedesFeedForward. 3.2.4. RedesNeuronalesRecurrentes. 3.2.4.1. RedesLSTM. 4. Descripcióndelasherramientasutilizadas. 5. Modelosdepredicciónpropuestos. 5.1. Datosdeentrenamiento. 5.2. Hiperparámetros. 5.3. Entrenamiento. 6. Experimentos. 6.1. Medidasdeerror. 6.2. Primeraetapa:Ajustedeloshiperparámetros. 6.3. Segundaetapa:Evaluacióndelosmodelos. 6.3.1. Modelosdereferencia.. 6.3.2. Resultados 7. Conclusiones. 8. Bibliografía.
1.Introducción:Generacióneólica. Elcontinuodesarrolloindustrialdelosúltimos150añoshavenidoligadoaunaumento progresivoenelconsumodeenergía.Comocontrapartida,debidoaquelasprincipales fuentesdeenergíaquesehanutilizadoparahacerposibleestedesarrollohansido combustiblesfósilesysusderivados,sehanemitidograndescantidadesdegasesdeefecto invernadero,queseconsideranresponsablesdelcalentamientoglobalqueestá experimentandoelplaneta. Porotraparte,elcontinuoaumentodelademandadeenergíaenlospaísesdesarrolladosy envíasdedesarrolloestáacarreandounafuertedependenciaenergéticaparamuchos países,principalmenteeuropeos. Lafuertedependenciaenergética,lapresiónsocialylatomadeconcienciaporpartedelos gobiernosenlaluchacontraelcambioclimático,handadolugaraqueseadoptenmarcos regulatoriosquefavoreceneldesarrolloyelusoderecursosenergéticosrenovables,más limpiosysostenibles.Estosrecursosrenovablessonobtenidosapartirderecursos naturalesydesechos,eincluyen,entreotras,laenergíahidráulica,eólica,solar,biomasa, geotérmica,yelaprovechamientodelosresiduossólidosurbanoseindustriales. Peroademásdelosbeneficiosmedioambientales,elimpulsoalasenergíasrenovablestrae consigootrosbeneficios.Porunlado,debidoalagrandispersiónenlaubicacióndelas instalacionesgeneradorasqueutilizanrecursosrenovables,sufomentohapropiciadola creacióndeempleoslocales,eldesarrolloregionalyunsustancialrendimientoeconómico paralosmunicipiosenlosqueestáninstaladaslasplantasgeneradoras.Porotrolado,este tipodegeneracióndispersa,queenlamayoríadeloscasosesdepotenciasrelativamente reducidas,conllevaotrasventajas,comoladisminucióndelaspérdidasportransporteenla red,graciasaquelageneraciónseacercamásalconsumo. Elfuerteimpulsoquesehadadoalasfuentesdeenergíadeorigenrenovablehapropiciado queenlosúltimosañossehayaproducidoungranaumentodelapotenciainstalada,y entreellas,laenergíaeólicahasidolaquehatenidounmayorauge,debidoprincipalmente alagranmadurezdelatecnología,resultandoenuncostepormegavatioinstaladocada vezmenor.Porotraparte,lagranventajadelaenergíaeólica,quehaimpulsadoenmayor medidasudesarrollorespectodeotrasfuentesdeenergíarenovables,essurelativamente
elevadadisponibilidadgeográfica,puesenmayoromenormedidahaycorrientesdeviento encasicualquierregiónelplaneta. Comocontrapartida,lageneracióneólicaconllevaciertosinconvenientes.Porunlado,la granvariabilidaddelviento,yportantodelageneracióneólica,complicasuintegraciónen elsistemaeléctrico.Además,algunosgeneradorespuedendesconectarsedelsistemaante perturbacionescomoloshuecosdetensión,descensosbruscosenlatensiónquetienen lugarcuandoseproduceuncortocircuitoenelsistema.Estasperturbacionespueden provocarunapérdidasúbitadegeneracióneólicaenelsistema,quepuedeponerenriesgo laseguridaddelsuministro.Sinembargo,larecienteincorporacióndemejorastecnológicas enelcomportamientodelosaerogeneradoresfrenteaperturbacionesenlaredcomienzaa permitirunaltogradodepenetracióndelaenergíaeólicasincomprometerendemasíala seguridaddelabastecimientoeléctrico. Graciasalasmejorasenelcomportamientodelosaerogeneradores,alacontinuabajada enelcostepormegavatioinstaladodepotenciaeólica,yalosavancesenlosmétodosde apoyoalaprogramaciónygestióndeestaenergía,laeólicasehaconvertidoenlafuente deenergíarenovablequemássehadesarrolladoenlosúltimosaños. Figura1.1:PotenciaeólicainstaladaenEspaña
1.1Necesidaddeprediccióndeenergíaeólica Unproblemadepredicciónestadísticaconsistebásicamenteenanalizarlosvalores pasadosdeunavariableydeotrasvariablesrelacionadasparabuscarpatrones significativos,conelobjetivodepoderconoceroextrapolarlosvaloresquetomarádicha variableenelfuturo. Enlasúltimasdécadashatenidolugarungranavanceenlossistemasdepredicción, debidoalenormeincrementoenpotenciadecálculodelosordenadoresactuales,que permitenalmacenar,analizaryrelacionargrandescantidadesdevariablesysusvaloresen untiempomuyreducido.Esporelloquelosalgoritmosdepredicciónsonunaherramienta muydesarrolladayutilizadahoyendía. Laimportanciadelasprediccionesradicaenlaayudaqueaportanparaplanificary anticiparsealosvaloresfuturosqueafectaránaunsistema,ayudandoagestionarla adquisicióndelosrecursosnecesariosconantelaciónsuficiente,osirviendocomo herramientaparamaximizarlarentabilidadmediantelatomadedecisionesquemaximicen losbeneficiosdeunaactividad. Elgranaugequehantenidolasfuentesdeenergíarenovablesdurantelosúltimosañosha obligadoaplantearseunnuevoproblemadeprevisión,eldeconocerconlaantelación suficientelaenergíaquevanagenerarestascentrales.Dadoqueelmayoraugeenel ámbitodelasenergíasrenovableslohaexperimentadolaenergíaeólica,esenestesector enelquesehanvenidoaplicandomayoresesfuerzosporcrearherramientasdepredicción deenergíafiablesyeficientes,queayudenaintegrarestaformadeenergíaenlared. Laeólicaesunaformadegeneraciónnoprogramable,yaquesoloseproduceenergía cuandosoplaelviento,quepuedellegarasermuyvariableinclusoenelcortoplazo,con posibilidaddeintermitenciaygrandescambiosenintervaloscortosdetiempo.Porello,es difícilconocerconantelaciónyprecisiónsuficientelacantidaddeenergíaeólicaconlaque podremoscontarencadamomento.Estavariabilidadhaceespecialmentecomplejasu operación,porloquesuproducciónfuturatienequeserestimadaoprevista,viniendoesta previsióndepotenciafuturainevitablementeafectadaporunerroroincertidumbrede predicción.
Sielvientodisminuye,lapotenciageneradaenlosparqueseólicostambiéndisminuye,y esafaltadepotenciadebeserreemplazadaporotrasfuentesdegeneraciónconuna reservasuficienteenmagnitudyvelocidadderespuestaparaquelademandaeléctricano seveaafectada.Enotrasocasiones,puedeocurrirquenosepuedaintegrarenelsistema todalaproduccióneólicadisponible,yaquelaenergíaeólicanosegeneradeacuerdoalas necesidadesdeconsumo,yseanecesarioreducirelsuministrodeestafuentedeenergía. Portodoesto,laprediccióndegeneracióneólicasehaconvertidoenuntemaclavepara hacerfactibleeldesarrolloeimplantacióndelaenergíaeólica,ysuintegraciónenel sistemaeléctrico. Desdeelpuntodevistadegeneracióneólica,odecualquierotrafuentedeenergía renovable,suprevisiónresultaútiltantoparaeloperadordelsistemacomoparalosagentes delmercadoolospropietariosdeparques.Así,eloperadordelsistemaeléctriconecesita conocerconantelaciónsuficientelacantidaddeenergíaeólicaqueseráinyectadaenlared paragestionarlapotenciaquedeberángenerarlascentralesconvencionales,conel objetivodecubrirlademandatotaldelsistema.Entretanto,losagentesdemercadoestarán interesadosenconocerconlamayorcertezaposiblelapotenciaquegeneraránsusparques eólicosconelobjetivodeseguirlasestrategiasqueresultenmásrentablesenelmercado deenergíaeléctrica.Además,lospropietariosdeparqueseólicostambiénestarán interesadosenconocerenquéperiodosseesperanmenorespotenciasgeneradasensus instalaciones,paraafrontarlaboresprogramadasdemantenimiento. Elvalordelaprevisióndegeneracióneólicaentérminoseconómicostienedos perspectivas.Porunlado,tenemoslareduccióndecostesdeoperaciónenelsistema originadaporlareduccióndereservanecesaria.Porotroladoestánlasposibles penalizacioneseconómicasqueseaplicanalosagentes,debidasalosdesvíosensus compromisosdegeneraciónadquiridosenelmercadodeenergíaeléctrica. 2.Objetivos Enlosúltimosañossehanaplicadodiversosmétodosenelámbitodelaprediccióneólica. Estetrabajosecentraráenlasprediccioneseólicasacortoplazo,yhabitualmenteparaeste horizontesehanutilizadodosaproximacionesbásicas,losmodelosfísicosylosmodelos estadísticos.
Losmodelosfísicostienenencuentaconsideracionesfísicasparaadaptarlaspredicciones devientoenunazonaalascondicionesconcretasdelemplazamientodondeserealizanlas mediciones.Parahacerestaadaptaciónseutilizanmodelosdemesoescalaomicroescala que,partiendodelascondicionesinicialesydecontornoobtenidasdeunmodelo atmosféricodemayorescala,calculanlavelocidaddelvientoincidenteenlasturbinasdel parqueparaposteriormentecalcularlaprediccióndepotenciapormediodelacurvade potencia. Porotrolado,deentrelosmodelosestadísticospodemosencontrarlafamiliadelasseries temporales,quesoloutilizanvalorespasadosdelasvariablescomodatosdeentradadel modelo,ylosqueademásdevalorespasadosutilizancomoentradaslosvaloresde predicciónmeteorológicademodelosatmosféricos,relacionándolosconlosvaloresde potenciahistóricauotrosvaloreshistóricosmedidos. EsteeselenfoquedestacanlosmodelosARIMAoBoxJenkins,queresultanútilesparala predicciónendeterminadosprocesosindustriales,yenelcontextodelapredicciónde energíaeólicaproporcionaresultadosrazonablementebuenosparahorizonteshasta6 horas. Tambiénsehanutilizadodistintostiposdemodelosregresivos,comoporejemplolos modelosAR,ARMAylosmodelosbasadosenlaRegresiónporvectoresdesoporte(SVR), loscualeshandadomuybuenosresultadosenlosúltimosaños. Elobjetivodeestetrabajoespresentarotrosdosmodelosdepredicción,basadosenuna seriedearquitecturaspertenecientesalaprendizajeautomáticoyalaprendizajeprofundo. Concretamenteseusaráncomomodelosdeprediccióndiferentesarquitecturasderedes neuronalesartificiales,talescomoredesneuronalesFeedforwardyredesLSTM. Asímismo,serealizaráunaseriedeexperimentosconestosmodelosparaestudiarsu capacidaddepredicciónyanalizarelprocesodeaprendizajevariandolosdistintos parámetrosqueposeenestasredes.Tambiénserealizaráunaexhaustivaevaluaciónde erroresdelosmodelossiguiendounaseriedeprotocolosydirectricesyaestablecidasenel ámbitodeprediccionesdeviento.
3.Antecedentesydefinicióndeconceptos Elobjetivodeestecapítuloesorientarallectorenelámbitodelaprendizajeautomáticoy definirunaseriedeconceptosqueestaránrelacionadosconlasdosarquitecturasderedes neuronalesqueseutilizaránpararealizarlasdistintasprediccionesdelosdatos metereológicos. 3.1.AprendizajeAutomático ElAprendizajeAutomático(AA,oMachineLearning,porsunombreeninglés)eslaramade laInteligenciaArtificialquetienecomoobjetivodesarrollartécnicasquepermitanalas computadorasaprender.Deformamásconcreta,setratadecrearalgoritmoscapacesde generalizarcomportamientosyreconocerpatronesapartirdeunainformaciónsuministrada enformadeejemplos.Es,porlotanto,unprocesodeinduccióndelconocimiento,esdecir, unmétodoquepermiteobtenerporgeneralizaciónunenunciadogeneralapartirde enunciadosquedescribencasosparticulares. Cuandosehanobservadotodosloscasosparticulareslainducciónseconsideracompleta, porloquelageneralizaciónalaquedalugarseconsideraválida.Noobstante,enla mayoríadeloscasosesimposibleobtenerunainduccióncompleta,porloqueelenunciado aquedalugarquedasometidoaunciertogradodeincertidumbre,yenconsecuencianose puedeconsiderarcomounesquemadeinferenciaformalmenteválidonisepuedejustificar empíricamente. Enmuchasocasioneselcampodeactuacióndelaprendizajeautomáticosesolapaconel deDataMining,yaquelasdosdisciplinasestánenfocadasenelanálisisdedatos,sin embargoelaprendizajeautomáticosecentramásenelestudiodelacomplejidad computacionaldelosproblemasconlaintencióndehacerlosfactiblesdesdeelpuntode vistapráctico,noúnicamenteteórico. Aunnivelmuybásico,podríamosdecirqueunadelastareasdelAAesintentarextraer conocimientosobrealgunaspropiedadesnoobservadasdeunobjetobasándoseenlas propiedadesquesíhansidoobservadasdeesemismoobjeto(oinclusodepropiedades observadasenotrosobjetossimilares)...o,enpalabrasmásllanas,predecir comportamientofuturoapartirdeloquehaocurridoenelpasado.
3.2.RedesNeuronales UnosdelosmétodosmásexitososdelAprendizajeAutomáticosonlasredesneuronales artificiales.Sonunparadigmadeaprendizajeyprocesamientoautomáticoinspiradoenla formaenquefuncionaelsistemanerviosodelosanimales.Setratadeunsistemade interconexióndeneuronasquecolaboranentresíparaproducirunestímulodesalida 3.2.1.Historia Losprimerosmodelosderedesneuronalesdatande1943porlosneurólogosWarren McCullochyWalterPitts.Añosmástarde,en1949,DonaldHebbdesarrollósusideassobre elaprendizajeneuronal,quedandoreflejadoenla"regladeHebb".En1958,Rosenblatt desarrollóelperceptrónsimple,yen1960,WidrowyHoffdesarrollaronelADALINE,quefue laprimeraaplicaciónindustrialreal.Enlosañossiguientes,seredujolainvestigación, debidoalafaltademodelosdeaprendizajeyelestudiodeMinskyyPapertsobrelas limitacionesdelperceptrón.Sinembargo,enlosaños80,volvieronaresurgirlasRNA graciasaldesarrollodelareddeHopfield,yenespecial,alalgoritmodeaprendizajede retropropagación(BackPropagation)ideadoporRumelhartyMcClellanden1986quefue aplicadoeneldesarrollodelosperceptronesmulticapa. 3.2.2.Propiedades Desdeunpuntodevistabiológico,todosistemanerviosoconstadeelementos básicos,lasneuronas.Paraunaredneuronal,elelementobásicoesconocidoenforma generalcomouncombinadorlinealadaptativo(adaptivelinearcombiner),elcualtiene unarespuesta paraunaseriedeentradasdelvector (verFigura3.1).EnesteSkWk elemento,semuestraquelaentrada esmodificadaporciertoscoeficientes,Xk denominadospesos(weights)queformanpartedelvector ycuyovaloreselWk resultadodecompararlasalida conelvalordesalidadeseado .LaseñaldeerrorSkdk queesgeneradaseusaasuvezparaactualizarlospesos , ,etc,detalmaneraqueW0kW1k medianteunprocesoiterativolasalidaseaproximealvalordeseadoyaunerror deƐk cero. LaestructurageneraldelelementoensutotalidadeslaquesemuestraenlaFigura3.1.
● ElsiguientepasoquerealizalaLSTMesdecidirquéinformaciónnuevasevaa almacenarenelestadodememoria.Estoserealizaendosetapas.Enprimerlugar, unapuertallamada"InputGate"decidequévaloresvamosaactualizar.A continuación,unapequeñaredcontanhcreaunvectordevaloresnuevos candidatos, ,quepodríanañadirsealestado.Enelsiguientepaso,secombinanĈt losdosresultadosparacrearunaactualizacióndeestado. Figura3.8:Imputgate ● Enestemomentoyapodemosactualizarelestadodelamemoriacambiando Ct−1 porelnuevoestado .Comoenlospasosanterioresyasehadecididoquéhacer,Ct sólotenemosqueaplicarlasoperacionesdecadapuerta.Multiplicamoselestado anteriorpor ,olvidandounaciertalacantidaddeinformaciónenfunciónde .Aftft continuaciónsumamos alamemoria,actualizandolamismaconnuevosit*Ĉt valoresquenospodríanservirenunfuturo. Figura3.9:Actualizacióndelamemoria
● Porúltimo,tenemosquedecidirqueserálasalidadecélulaLSTM.Estaseobtendrá medianteelproductodedoselementos.Elprimerodeellosserálasalidadelared consigmoide,queserviráparadecidirquéelementosdelamemoriasecombinarán. Elsegundoelementoseráelfiltradodedatosdesdelamemoriaporunatanh(para empujarlosvaloresaestarentre1y1).Estosdoselementossemultiplicaran dandocomoresultadolanuevasalidadelacélula. . Figura3.10:Salida 4.Descripcióndelasherramientasutilizadas Todaslasarquitecturasderedesneuronalesdescritasenelapartadoanterior,puedenllegar aserrealmentedifícilesdeimplementar,porelloexistendiversosframeworkespecialmente desarrolladosparaqueelusuarionotengaqueprofundizardemasiadoeneldiseñoe implementacióndelasdiferentesestructurasdelaprendizajeautomático.Entrelasmás importantesestánTheano,TorchoCaffe,perorecientementesehadadoaconocerotro frameworkqueenteoríaofreceaúnmásfacilidadesparausuarioalahoradeutilizarlas diferentesarquitecturas,nosoloparaimplementarlassinoademásparaestudiarsu comportamientoyrealizarestudiosexperimentales. ElframeworksellamaTensorFlow,yoriginalmentefuedesarrolladoporinvestigadorese ingenierosquetrabajanenelgrupodeinvestigacióndeInteligenciadeGoogleconelfinde desarrollarmáquinasdeaprendizajeprofundobasadoenredesneuronales,peroelsistema eslosuficientementepotentecomoparaseraplicableenunaampliavariedaddecampos. Esdecódigoabiertoyestápensadoparaelcálculonuméricomediantegráficosdeflujode datos.Estosdiagramasdescribenelcálculomatemáticoconungrafodirigidodonde
tenemosnodosybordes.Losnodossuelenrepresentarlasoperacionesmatemáticas,pero tambiénpuntosdealimentacióndelosdatos,eliminaciónderesultados,olalectura/ escrituradevariablespersistentes.Losbordesdescribenlasrelacionesdeentrada/salida entrelosnodos.Estosbordestransmitenconjuntosdedatosmultidimensionales,otensores quesepuedenasignaralosdispositivosdecómputoparaejecutardeformaasincrónicao paralela. Otracaracterísticaimportanteesquegraciasasuarquitecturalepermiteimplementarla computaciónaunaomásCPUoGPUenunordenadordesobremesa,servidoro dispositivomóvilconunasolaAPI.TieneAPIsdisponiblesenvariosidiomas,tantoparala construcciónyejecucióndeungráficoTensorFlow.LaAPIdePythonesenlaactualidadlas máscompletaylamásfácildeusar,perolaAPIC++puedeofreceralgunasventajasde rendimientoenlaejecucióngráfica,yapoyaeldesplieguedepequeñosdispositivoscomo Android. 5.Modelosdepredicciónpropuestos ComosehaespecificadoenelcapítulodeObjetivos,enestetrabajoseproponendos modelosdepredicciónbasadosenredesneuronales.Elprimeroutilizandounaredneuronal FeedforwardyelsegundounaredneuronalrecurrenteLSTM. Lasredesneuronalesfeedforwardsepodríanconsiderarestructurasadaptativasde procesamientodeinformación,dondeelprocesamientosellevaacabomediantela interconexióndesusneuronas.Soncapacesdecaptarrelacionescomplejasnolineales entredistintasvariables,yporestosepuedenutilizarpararesolverciertotipodeproblemas muycomplejosdondenoseconocenlasrelacionesexistentesentrelasvariables explicativasylasalida,comopuedeserlapredicción. Encambiolasredesneuronalesrecurrentespresentanunoomásciclosenelgrafodefinido porlasinterconexionesdesusunidadesdeprocesamiento.Laexistenciadeestosciclosles permitetrabajardeformainnataconsecuenciastemporales.Sonsistemasdinámicosno linealescapacesdedescubrirregularidadestemporalesenlassecuenciasprocesadasy puedenaplicarse,porlotanto,amultituddetareasdeprocesamientodeestetipode secuencias.
Suprincipalventajaestáenlaposibilidaddealmacenarunarepresentacióndelahistoria recientedelasecuencia,loquepermite,adiferenciadeloqueocurreconlasredes neuronalesnorecurrentes,quelasalidaanteundeterminadovectordeentradapueda variarenfuncióndelaconfiguracióninternaactualdelared. Laestructuradelasdosredeseslasiguiente: ● Redfeedforward ○ Capadeentrada:32 ○ Capasinternas:1capainternade30neuronas ○ Capadesalida:1deunaneurona ○ Algoritmosdeaprendizaje:Gradientedescendente ○ Funcióndeactivación:Sigmoide ○ Algoritmodeparada:Númerodeiteraciones=500 ● RedrecurrenteLSTM ○ Capadeentrada:32 ○ Capasinternas:1capainternade50neuronas ○ Capadesalida:1deunaneurona ○ Algoritmosdeaprendizaje:Gradientedescendente ○ Funcióndeactivación:Ninguna,valoresdesalidareales ○ Algoritmodeparada:Númerodeiteraciones=100 Elmotivodehaberescogidoestasconfiguraciones(númerodeentradas,deneuronas,de iteracionesydemás),seabordaráenlossiguientesapartados. 5.1Datosdeentrenamiento Losdatosqueseutilizaranpararealizarlasdistintaspruebas,losentrenamientosypor supuestolapredicción,seránlasdistintaspotenciasdevelocidaddeviento(m/s)captadas porunanemómetrosituadoenlatorreclimatológicaPozoizquierdo,concretamente potenciastomadasaunaalturade40metrosdurantelosmesesdeJulioyAgosto. Lasmedidasdevelocidaddevientoestántomadascadaminuto,portantosonunas80.000 muestras,peroeneltrabajoserealizarándiferentesentrenamientostomandolosdatos
cada10minutosocadahoraparaestudiardistintosaspectosdelapredicción.Tambiénse haránpruebastomandolapromediodelosdatosendistintosrangos(promediocada10 muestrasporejemplo). Elrendimientodeunmodeloestárelacionadaconsucapacidaddepredicciónennuevos datoseindependientesdelentrenamiento.Laevaluacióndeesterendimientoesmuy importante,yaqueestosdatosnosdaunamedidadelacalidaddelmodelodepredicción enlapráctica. Portanto,esimportanteevaluarlasmedidasdeerrorendatosquenosehautilizadopara laconstruccióndelmodelodepredicciónoparaajustaralgunosparámetrosdelmétodo.Por estarazón,losdatosserándivididostalcomosemuestraenlaFigura5.1. Figura5.1:Divisióndelosdatos 5.2Hiperparametros Encualquierentrenamientodeunaredneuronalexistenunaseriedehiperparametrosque elprogramadordebeajustarenfuncióndecómosehadesarrolladoelentrenamiento,dela evolucióndelafuncióndecoste,delacalidaddelasalidadelaredodeltiempode ejecucióndelamisma. Enconcreto,loshiperparametrosquehabráqueajustarenlasdistintasredesneuronales conlasquesetrabajarásonlossiguientes: ●Númerodeépocas:Elaprendizajeenesteestudioserealizaporépocas.Laredse haceevolucionarduranteunperiododetiempo(época)enelqueselevanpasando losdistintosbatchdelconjuntodedatos.Unavezllegadoalfinaldeunaépocala
redyahabráentrenadocontodoslosdatosyhabráalcanzadoundeterminadoerror decostequeseintentaráreducirenlassiguientesépocas. ●Tamañodebatch:Laentradadelarednoesmásqueunvectordenúmeros(de velocidadesdeviento),TensorFlowestádesarrolladodeformaque,alahorade entrenar,elprogramadorpuedepasarlemásdeunaentradaalared,esdecir,más deunvectordedatos.Estelotededatosseconoceconelnombredebatch,yel tamañodeesteloteesunparámetroimportantedelaredpuestoquepuede determinareltiempodeejecucióndelared,perotambiénvariarlacalidaddelas prediccionesdelamisma. ●Númerodeneuronasdelacapaoculta:Elnúmerodeneuronasquedebetenerla rednoesundatoquesesepadeantemano,dependedelosdatosdeentrada.Por elloesnecesariorealizarunapequeñaexperimentaciónconelnúmerodeneuronas aemplearparaoptimizarelfuncionamientodelared. ● Factordeaprendizaje:Estádirectamenterelacionadoconlavelocidadde aprendizajedelared.Esteparámetroindicaelporcentajeenquesepermiteque varíenlospesosdelaredencadaépocadeentrenamiento.Sielvaloresalto,la modificacióndelospesosdeunaépocaaotrapuedesermuygrande,mientrasque sielvaloresreducido,lospesossólopuedenvariarenpequeñaproporción: ○Enelperíododeaprendizaje,valoresaltosdetasadeaprendizajefavorecen elacercamientorápidoalosvaloresóptimosdelospesos,peronopermiten elajustefinodeestospesosprovocandounmovimientocontinuoalrededor delóptimo. ○Losvaloresbajosdelfactordeaprendizajesuponenunlentoajustedelos valoresdelospesospudiendoprovocarlacaídaenmínimoslocalesdelos quenoesposiblesaliraltenerunvalorbajodetasadeaprendizaje. Esnecesariolocalizarunvalordecompromisodefactordeaprendizajeadecuado paracadaproblemaconcreto,losuficientementealtaparaacercarsealóptimoenun tiempoprudencialyevitarelriesgodecaerenmínimoslocales,ysuficientemente pequeñoparapodertenergarantíasdelocalizarunvalorcercanoalóptimo.
● Tamañodeventana:Eltamañodeventanaserefierealalongituddelvectorde entradadelared,esdecir,alnúmerodedatosquetomaralaredyqueevaluará parapredecirlosdatosfuturos. Figura6.2:Ventana 5.3Entrenamiento Entrenarunaredneuronalesunprocesoquemodificaelvalordelospesosybias asociadosacadaneuronaconelfindequelaRNApuedaapartirdeunosdatos presentadosenlaentradaygenerarunasalida.Enelcasodelaprendizajesupervisado,se tieneunconjuntodedatosperonoseconocelafunciónorelaciónmatemáticaquelos representa;alpropagarhaciadelantecadaunodeestospatronesseobtieneunarespuesta enlasalidadelaRNAlacualsecomparaconlasalidadeseada,permitiendoobtenerel errordeldesempeñodelared. Parasupervisaryanalizarlacalidaddeunentrenamientoelprogramadordebeexaminar diferentespuntos,elprimerodeelloseselerrordeprediccióndelared,queseexpondrá detalladamenteenlossiguientescapítulos.Elotropuntoquedebeanalizarelprogramador despuésyduranteelentrenamientoeslavariacióndelcosteoerrordeentrenamiento generadaporlafuncióndecostedelared. Lafuncióndecosteesunapartefundamentaldelentrenamientodeunared,puesesla encargadadeestimarlacalidaddelasalidamedianteelcálculodeunerror(error cuadráticomedionormalmente)utilizandolasalidaresultantedelaredylasalidadeseada. Esteerrordebeirdisminuyendoamedidaqueavanzaelentrenamiento,loquesignificaría quelaredestáaprendiendoyportantolasalidadelamismasevapareciendocadavez másalasalidadeseada.
Esteerrorsepuederecolectarparaluegoserrepresentadoenunagráficaquenospuede darciertainformacióndecómohasidoentrenamientodelared. PorejemploenlagráficadelaFigura5.3podemosobservarquelaevolucióndelcosteen lasúltimasépocassiguedescendiendo,esdecir,nopermanecemásomenosconstante,lo quesignificaqueelcostedelaredpuedeseguirdisminuyendo.Yportantosería recomendableaumentarelnúmerodeépocasparaobtenermejoresresultados. Figura5.3:Ejemplodegráficadecoste OtroejemplopodríaserelquevemosenlaFigura5.4,dondepodemosverqueelcosteno desciendedeformaconstante,sinoqueenlasprimerasépocashasubido.Estopuedeser debidoaquequizáshemosentrenadoconunfactordeaprendizajedemasiadoelevado,lo queprovocaquecuandoserealizaeldescensoporelgradiente,alserunsaltoligeramente grande,laaproximaciónalmínimoóptimodelafunciónnoseaprecisa,provocandoqueel erroraumenteyquesetardemásenajustarseparallegaraesemínimo.
Paracorregirestosimplementetendríamosquereducirelfactordeaprendizajehastaque observemosquelagráficadecostedesciendedeformaprogresiva. Figura4.4:Ejemplodegráficadecoste 6.Experimentos Enestasecciónseexplicarálosexperimentosyestudiosquesellevaránacaboconel modelodepredicciónbasadoenunaredLSTMyconelmodelobasadoenunared feedforward. Primeroesnecesariodefinircómoserányenquéfrecuenciaestaránlosdatosconlosque realizaremoslosexperimentos,paraello,primerodebemosrealizarunapequeñareflexión sobreelcomportamientodelviento. Elviento,aunqueesunsistemacaóticoymásomenosaleatorio,presentaunaseriede patronesociclosqueserepitenalolargodelaño.Porejemplo,elvientotienelosllamados
ciclosestacionales,dondeseproduceciertocomportamientorepetitivoenelcambiode estaciones,oelciclolunar,dondeelsatéliteinfluyeenestasvelocidadesdevientoen periodosde28días.Porúltimo,existentambiénlosllamadoscicloscircadianos,quese producenenperiodode24horas.Comoenesteexperimentodisponemosdemuestrasde solo2meses,elúnicocicloquepodemosestudiaresesteúltimo.Portantotrabajaremos condatosdondelafrecuenciademuestreoserádelpromediodecadahora.Laspruebasse haránconuntamañodeventanade32muestras(32horas),puestoque,comoseha indicadoantes,elciclocircadianoocurrecada24horas,yparaquelasredespuedancaptar estepatrónalcompleto,debemosaumentarlaventanaqueanalizalasmuestrasaun tamañomásgrandeparaabarcarmásdeundía. Esimportantedestacar,queasuvezsetrabajaranconlosdatosnormalizadosentre valoresde0y1,puestoquelasredesconlasqueexperimentemosutilizaransigmoideo tanhcomofuncionesdetransferencia,yestádemostradoquelosvaloresnormalizados ofrecenmejoresresultadosalahoradegenerarlasalida. Elexperimentosedividiráendosetapas.Laprimeraetapadelexperimentoconsistiráen realizarunestudiodelaevolucióndeloserroresdeprediccióndelosmodelosvariando algunosdesushiperparametros,conelfindeajustarlosavaloresóptimosquedenmejores resultadosenlapredicción.Unejemploseríaanalizarlaevolucióndeloserroressise incrementaprogresivamenteelnúmerodeneuronasdelacapaocultadelared. Lasegundaetapaconsistiráenevaluarlacalidaddelaprediccióndelosmodelos,paraello secomparancondistintosmodelosdereferenciayaestandarizadosenelámbitodela prediccióneólica. Tantoenlaprimeraetapacomoenlasegundasetrabajaranconunaseriedemedidasde errorqueseutilizaranpararealizarlasdistintascomparacionesycrearlasdistintasgráficas. Porello,antesdedetallarlosexperimentos,enelcapítuloquevieneacontinuaciónse definiránestoserrores 6.1Medidasdeerror Engeneralenelcampodelaprediccióndeseriestemporales,elerrordepredicciónse definecomoladiferenciaentrelamedidarealyelvalorpredicho.Porlotanto,puestoque
Analizandolasgráficaspodemosadvertirqueamedidaquevamosaumentandolacantidad deneuronasquelaredesutilizanparaentrenar,elerrormedioabsolutotiendeabajar,en cambioeltiempodeentrenamientocrecedeformaprogresiva. Aprimeravistaparecequelasdosredestienencomportamientosparecidos,perosinos fijamosbienenlasescalasdelasgráficasveremosunadiferenciasignificativa. EnelcasoderedFeedforward,esciertoqueparecequeelerrordesciendeamedidaque aumentamoslacantidaddeneuronas,peroesteerrorfluctúaentre0.06y0.0585,loque nosllevaapensarque,comoelerrorsemantienedeformamásomenosconstantesobre esosvalores,elnúmerodeneuronasrealmentenodeterminaengranmedidalacalidadde lapredicciónenelcasodelaredFeedforward,esdecir,enlapráctica,sientrenamoscon 10neuronasycon100prácticamentenonotaremosladiferenciaencuantoalapredicción quegenera. EnlaredLSTMlacantidaddeneuronassiqueesligeramentemásdeterminantepuesto queladiferenciadelerroresmásconsiderable.Asíquelomásrecomendableseríautilizar unacantidaddeneuronasentornoa50puestoqueescogermas,comosepuedeapreciar enlagráfica,nonosgarantizaobtenerunamenortasaerror(elerrorsemantienemáso menosconstante)perosíqueaumentaeltiempodeentrenamiento.
Númerodeépocas Tambiénesimportanteparaobtenerbuenosresultadosdeterminarelnúmerodeépocasde entrenamientoquelasredesnecesitanparaajustarcorrectamentesuspesosyempezara generarsalidasválidas. Asípuesserealizarondiferentesejecucionesincrementandoestenúmeroparaestudiarla evolucióndelerror. FeedForward
LSTM ObservandolasgráficaspodemosapreciarquelaredFeedforwardapartirdeunas300 épocasempiezaaofrecertasasdeerrormásbajas.EnelcasodelaredLSTMpareceser quenonecesitadetantasépocasparaalcanzarsutope,observamosqueentornoalas 100épocasseempiezanaobtenerlosmejoresresultados.
EstadiferenciaenelnúmerodeépocassedebequelaredLSTM,porsuarquitecturaypor cómoestádiseñada,enunaejecuciónlasneuronasrealizanmuchomásoperacionesde ajusteenloqueseconocecomoelprocesode“rollback”,dondeademásintervieneel estadodememoriaparagenerarsalidasmuchosmásprecisas. Factordeaprendizaje Porúltimoserealizaronpruebasconelfactordeaprendizajeconelobjetivodedeterminar aproximadamentecuáleselvaloradecuadoparacadaunadelasredes. Enestecaso,porcuestionesdevisualización,sehavolcadolosresultadosenunatabla, dondepodemosobservarquesehanprobadodistintosvaloresdefactordeaprendizajey sehacalculado,igualqueenlosotroscasos,elpromediodelerrormedioabsolutodediez ejecucionesconcadafactor. MAE Feedforward LSTM 0.1 0.71 0.47 0.01 0.52 0.44 0.001 0.92 0.46 0.0001 0.103 0.88 0.00001 0.107 0.14 PodemosapreciarqueenlaredFeedforwardclaramenteelvalordefactordeaprendizaje quemejorresultadosofrecees0.01.Ladiferenciadeentrenarconunfactoruotroesmuy grande,ademáslosotrosvaloresofrecentasasdeerrormuyaltasencomparaciónconeste factorde0.01. EncambioenlaredLSTM,esmásdifícildeterminarquéfactoreseladecuado,puestoque, comopodemosobservar,losvaloresdefactordeaprendizajede0.1,0.01y0.001ofrecen tasasdeerrorprácticamenteiguales.Seríarecomendableescogerelvalorqueestáen medio(0.01)deestostresparaevitarunposibleajustedemasiadobruscodelospesoscon
unfactordemasiadoalto(0.1)yporotroevitartambiénunajustedemasiadofinoylento (0.001)quepuedeprovocarunestancamientoenalgúnmínimolocal. 6.3Segundaetapa:Evaluacióndelosmodelos Existenvariosmodosdeevaluaciónyapropuestosenlaliteraturaparalacomparaciónentre diferentesmodeloscondistintoscasosdeestudio,yparaconocerlabondaddelos diferentesprocedimientosdecálculodeprediccionesagregadasqueseproponenypoder compararsuprecisión. Paracuantificarlagananciadeprediccióndelosmodelospropuestosalosmodelosde referencia,seutilizarálasiguientefórmula: donde sonloscriteriosdeevaluaciónaconsiderar,esdecir,lasmedidasdeerrorC(k)E calculadasenlaetapadevalidación(BIAS,MAE,MSE,etc...),ytérmino seCE ref corresponderíaconlosdistintosmodelosdereferenciaquesedetallaranenelsiguiente capítulo. 6.3.1Modelosdereferencia Enelcampodelapredicción,sehandefinidoalgunosmodelossencillosquesirven comoreferenciaalahoradeevaluarlacalidaddelosnuevosmodelosdepredicción desarrollados.Estosmodelosdereferenciaestánbasadosenmodelossencillosde seriestemporales. UnodelosmodelosdereferenciamásutilizadoseselmodelodePersistencia.Según estemodelolasprediccionesdepotenciaafuturo,paracualquierhorizonte,coinciden conelvaloractualdelavariable,enestecasolapotenciaeólica: donde eslapredicciónparaelhorizontedetiempo ,calculadaenelinstante(t|t)P+h t +h actualt,y eslamedidaactualdepotenciaregistradaenelparqueolaregiónde(t)P estudio.
Elmodelodepersistenciaesuncasoconcretodelmodelodemediamóvildelas últimasnobservaciones,conn=1,elcualseráelsegundomodelodereferenciaquese utilizaraenesteestudio: siendo lamedidadepotenciaenelinstante ,deantigüedad .(t)P−i t −i i Cuandoelordendelmodelodemediamóviltiendeainfinito,entoncestenemosla mediaglobaloincondicionaldetodoelhistóricodepotenciaseólicasregistradasenel parqueoregión,tambiénllamadamediaclimática,loqueseríaunbuenmodelode predicciónamuylargoplazo: Frutodecombinarlabondaddelasprediccionesdelmodelodepersistenciaparael muycortoplazo,ylarelativabondaddelasprediccionesdeunmodelodemedia globaldepotenciaparaprediccionesalargoplazo,obtenemosunnuevomodelode referenciaqueresultadeunaponderacióndeambosmétodos,cuyoscoeficientesde ponderacióndependendelhorizontedepredicción: donde eselfactordeponderaciónquehabríaqueestimar,convaloresentre0y1ak dependiendodelhorizontedepredicción,yquetomarávalorescercanosalaunidad parahorizontesdepredicciónmuycortos,dandomuchopesoalmodelode persistencia,yvalorescercanosaceroparahorizontesdepredicciónmuyelevados,en losquelapotenciaesperadaseaproximarámásalamediadepotenciaregistrada históricamente. Aunqueelúltimomodelodereferenciapropuestoesmáselaboradoyproporcionamejores resultadosqueelmodelodepersistencia,enlaprácticaelmodelodereferenciamás utilizadosiguesiendoelmodelodepersistencia,debidoasusencillezyaquenorequierela estimacióndeparámetroalguno.
6.3.2Resultados Paraapreciarmejorytenerunareferenciamásvisualdecómoeslacalidaddepredicción delosmodelos,tantolospropuestoscomolosdereferencia,semostraránprimerouna seriedegráficasquenosenseñarandichaspredicciones,yacontinuaciónseabordarála evaluacióndelosmodelospropuestosaplicandolasreglasylasdirectricesquehemosvisto enlosapartadosanteriores. Enlasdistintasgráficasveremosdosseriestemporales.Enazulserepresentarálaserie temporalrealquesehautilizadocomotestparagenerarlasdistintasprediccionesdelos modelos.Estasprediccionessesuperpondranencolorverdesobrelosdatosrealesconel findeapreciarmejorlacalidaddelapredicciónycomprobarsiseajustacorrectamenteala serietemporalreal.Adicionalmentesemostrará,paraevaluaraúnmáslapredicción,un zoomdelaprediccióndelmodeloencuestión. Modelodepersistencia
Recordemosqueelmodelodepersistenciagenerasusprediccionescogiendoelúltimo valordelaserietemporalenesemomento.Porestarazónvemosquelalíneaverdeestá unaposiciónadelantadaconrespectoalaserietemporalreal. Modelodepersistenciapromedio
Elmodelodepersistenciapromediogeneralasprediccionescalculandoelpromediodelas núltimasobservaciones.Enestecasonsecorresponderíaconelvalordeltamañodela ventanaconelquehemosrealizadolasdistintaspredicciones,32.Esevidentequela predicciónesbastantepeorqueenelmodeloanterior,yaqueestemodeloestápensado paraprediccionesdemásalargoplazo. Modelodepersistenciacombinado
Elestemodelosurge,comobiendiceelnombre,delacombinacióndelosdosmodelos anteriores,juntoconunciertocoeficientedeponderación,queseajustaenfuncióndel horizontedepredicción.Paraestecasosehaescogidouncoeficientede0.75. Modelopropuestos Feedforward
Parahiperparámetrodeltamañodebatch,observamosqueambasredespresentanel mismocomportamiento.Apartirdeuntamañoentornoa200,seempiezanaobtenertasas deerrormáselevadasyparatamañosmáspequeñosqueestéelerrorsemantienemáso menosconstante.Porotroladotambiénobservamosenambasgráficasdetiempo,queeste esmuchomayorcuantomáspequeñoseaelbatch.Portantoteniendoencuentaestasdos reflexiones,sedeberíaescogeruntamañodebatchmediotalquenoseademasiado pequeñoparaevitareltiempodeentrenamientoexcesivo,peronomayorde200parano obtenertasasdeerrordemasiadoelevadas. Encuantoalhiperparámetrodelacantidadneuronasautilizarenlacapaocultadelas redes,vimosquelaredFeedforwardpresentabauncomportamientoligeramentedistintoal delaredLSTM.Seobservóqueelnúmerodeneuronasnoesunfactordemasiado determinanteenelcasodelaredFeedforward,puestoquelatasadeerrorquegenerabala redaliraumentandoelnúmeronodescendíadeunaformasignificativa,sinoquelohacía enunrangodeerroresmuyreducido. EncambioenlaredLSTMsiqueseobservóuncambiomásacentuadoalañadirmás neuronasparaelentrenamiento.Quedóclaroquelascantidadesreducidasdeneuronasno ofrecíanbuenosresultados,yesentornoa50cuandoseempiezanaobtenertasasde errormásbajas. Porúltimoserealizaronpruebasparadeterminarelnúmerodeépocasdeentrenamientoy elfactordeaprendizajequelasredesnecesitabanparallegarallamejorconfiguracionde pesos.EnloreferentealnúmerodeépocaspareceserquelaredLSTM,porsuarquitectura recursiva,necesitademenosépocasdeentrenamientoquelaredFeedforward.Encuanto alfactordeaprendizaje,aunquelaredLSTMpresenteuncomportamientomásconstante, sepuedeconsiderarqueambasobtienenlosmejoresresultadosconelmismovalor,que estáentornoa0.01. Enrelaciónalosresultadosobtenidosenlasegundaetapadelexperimento,dondese evaluógráficamenteyluegonuméricamentelosmodelospropuestos,podemosafirmarque engenerallosmodelosFeedforwardyLSTMmejoranalosdereferenciapero,comovimos enlastablascomparativas,pormuypoco.Centrándonosenlascomparacionesconel modelodepersistenciabásicoelcuáleselmásutilizadoenlascomparacionesdenuevos
modelosdeseriestemporales,vimosquelastasasdeerrorgeneradasporlosmodelos propuestoseranmuyparecidasaldelapersistencia,pornohablarque,salvoporalgunos detalles,gráficamenteeraimposibledistinguirlaprediccióndeestemodelodereferenciade ladelosmodelospropuestos. Endefinitiva,sehademostradodeformaempírica,quelasredesFeedforwardylasredes LSTM,conlaconfiguraciónpropuesta,presentanuncomportamientomuysimilaralmodelo depersistencia.Esdecir,pareceserqueambasredesgeneransussalidasenfuncióndel últimovalorobservado.Locualesuncomportamientoquenoseesperabaconestasredes ypodríasermateriadeinvestigaciónenunfuturoeldeterminarlarazóndeesteproceder. 8.Bibliografía MiguelGarcíaLobo.Tesisdoctoral.Métodosdeprediccióndelageneraciónagregadade energíaeólica.Leganés,2010 HenrikMadsen,PierrePinson,GeorgesKariniotakis,HenrikAa.Nielsen,TorbenSkov Nielsen.AProtocolforStandardazingtheperformanceevaluationofshorttermwindpower predictionmodels.WindEngineering,MultiSciencePublishing,2005. CarlosAlbertoOropezaClavel.TesisDoctoral.ModeladoySimulacióndeunSistemade DeteccióndeIntrusosUtilizandoRedesNeuronalesRecurrentes.México,2007 MarcosGestalPose.IntroducciónalasRedesdeNeuronasArtificiales.Universidadeda Coruña,2009 IbrahimEspinoMartín,FranciscoMarioHernándezTejera.TrabajodeFindeMáster. EstudioyanálisisestadísticodelcomportamientodelvientoenlazonasurestedeGran Canariaconunenfoquealapredicción. J.R.HileraandV.J.Martinez.Redesneuronalesartificiales.Fundamen tos,modelosyaplicaciones.AddisonWesleyIberoamericanaS.A,Madrid,1995 JuanAntonioPérezOrtiz.TesisDoctoral.Modelospredictivosbasadosenredesneuronales recurrentesdetiempodiscreto.
colah´sblog,UnderstandingLSTMNetworks.Abril,2016. http://colah.github.io/posts/201508UnderstandingLSTMs/ RubénLópez,¿Quéesycómofunciona“DeepLearning”?,Mayo,2016. https://rubenlopezg.wordpress.com/2014/05/07/queesycomofuncionadeeplearning/ NeuralNetworkFramework,IntroducciónalasRedesNeuronalesysusModelos,Mayo,2016. http://www.redesneuronales.com.es/tutorialredesneuronales/tutorialredes.htm wikipedia,Artificialneuralnetwork,Abril,2016. https://en.wikipedia.org/wiki/Artificial_neural_network EstructurayentrenamientodelaRNA,Junio,2016. http://sabia.tic.udc.es/sc/web2/frame_capitulo5.html#tasa