scieee AI-readable full text Open interactive document viewer

Generación de escenarios de propagación mediante modelos generativos y aprendizaje por refuerzo

Mártir Moreno, Natalia María; Ramírez-Arroyo, Alejandro; Vafa, Sohrab; García Martínez, Luz; Valenzuela-Valdés, Juan

Abstract

Las comunicaciones 6G esperan generar nuevosescenarios en un mundo completamente interconectado. Silas comunicaciones 5G se centran en proporcionarinfraestructura celular terrestre, las redes 6G van un pasomás allá proporcionando cobertura global integrada paracomunicaciones por satélite y drones, comunicacionesterrestres, marítimas y submarinas. Por primera vez, estasredes se conciben de manera que la Inteligencia Artificial seauna de las características clave de las nuevasarquitecturas. Para desarrollar redes eficientes e inteligentes,es necesario caracterizar, clasificar y generar escenarios decomunicaciones futuras para su estudio. A partir de lasmedidas adquiridas en canales de propagación controlados,se propone generar nuevos escenarios de comunicacionesmediante el uso de Aprendizaje por Refuerzo.

Full text

Actas de las XV Jornadas de Ingeniería Telemática (JITEL 2021), A Coruña (España), 27-29 de octubre de 2021. This work is licensed under a Creative Commons 4.0 International License (CC BY-NC-ND 4.0) Generación de escenarios de propagación mediante modelos generativos y aprendizaje por refuerzo Natalia Mártir-Moreno, Alejandro Ramírez-Arroyo, Sohrab Vafa, Luz García, y Juan F. ValenzuelaValdés Departamento de Teoria de la Señal, Telemática y Comunicaciones Universidad de Granada nataliamar[email protected], [email protected], [email protected], [email protected], [email protected]. Abstract: Las comunicaciones 6G esperan generar nuevos escenarios en un mundo completamente interconectado. Si las comunicaciones 5G se centran en proporcionar infraestructura celular terrestre, las redes 6G van un paso más allá proporcionando cobertura global integrada para comunicaciones por satélite y drones, comunicaciones terrestres, marítimas y submarinas. Por primera vez, estas redes se conciben de manera que la Inteligencia Artificial sea una de las características clave de las nuevas arquitecturas. Para desarrollar redes eficientes e inteligentes, es necesario caracterizar, clasificar y generar escenarios de comunicaciones futuras para su estudio. A partir de las medidas adquiridas en canales de propagación controlados, se propone generar nuevos escenarios de comunicaciones mediante el uso de Aprendizaje por Refuerzo. Palabras ClaveComunicaciones inalámbricas, Inteligencia Artificial, clustering, VAEs, propagación. I. INTRODUCCIÓN Hoy en día, los avances en las redes de comunicaciones han dado como resultado un mundo completamente conectado. La Inteligencia Artificial (IA) se aplica ya en todas las capas/niveles de protocolos de las redes 5G. Además, la combinación de IA y técnicas de computación está siendo explorada en el campo de la investigación. Por lo tanto, las aproximaciones basadas en IA serán uno de los pilares fundamentales para que las redes 6G cumplan con los requisitos de millones de usuarios en todo el mundo [1][2]. Se requieren redes inteligentes 6G para negociar un equilibrio entre el rendimiento de la red, la respuesta instantánea y el consumo de energía, para lo que una configuración óptima de la potencia de transmisión en las estaciones base logra un equilibrio energético en la red [3]. Para alcanzar este equilibrio es necesario realizar optimizaciones multiobjetivo para cada uno de los diferentes nuevos escenarios 6G como los que se muestran en la Figura 1. En este marco de futuras comunicaciones se definen los siguientes tres escenarios tipo en función de los requisitos del usuario: •further-enhanced Mobile BroadBand (furthereMBB). Este esquema tiene como objetivo proporcionar al usuario velocidades de datos en el rango de TB/s. •enhanced ultra–Reliable Low Latency Communications (enhanced uRLLC). Este enfoque se centra en minimizar el retraso de un extremo a otro en las redes de comunicación. Para ello, nuevos esquemas de red menos complejos en su arquitectura permitirán un procesamiento más rápido de los paquetes de datos. •ultra-massive Machine-Type Communications (ultra-mMTC). Basado en el paradigma de Internet de las cosas (IoT), este enfoque propone un esquema de red donde múltiples dispositivos están completamente interconectados. 261 N. Mártir-Moreno, A. Ramírez-Arroyo, L. García, S. Vafa, J.F. Valenzuela-Valdés. 2021. Todos estos avances tendrán que hacerse con nuevas arquitecturas de red que permitan una cobertura global de las redes, por lo que 6G debe proporcionar una red integrada Espacio-Aire-Tierra-Mar [4]. Por lo tanto, en las redes 6G aparecerán nuevos escenarios que deberán caracterizarse. En estos nuevos escenarios, las comunicaciones Ship-to-Ship (S2S), Vehicle-to-Satellite (V2S) o UAV-to-UAV, solo se pueden desarrollar de manera fiable si tenemos una caracterización previa de los entornos de red. Resumiendo lo anterior, es necesario un conocimiento y modelado del canal de comunicaciones para analizar y optimizar su impacto físico en las señales radio de comunicación. Con ello se consigue diseñar tecnologías de comunicación efectivas y viables que respondan a las necesidades del usuario. Actualmente, se están comenzando a desarrollar técnicas de IA para estimar el canal de comunicación. Una de las propuestas de este artículo es dar un paso más, no solo para estimar el canal de comunicación a través de la IA sino para clasificar y generar futuros canales de comunicaciones. En particular, dados los nuevos y desafiantes esquemas de redes futuras que coexisten con entornos de medición controlados, como las cámaras anecoicas y reverberantes, la IA puede desempeñar un papel importante para emular los casos de tráfico real trabajando con grandes cantidades de medidas de canal obtenidas de un entorno controlado. Al centrarnos en la parte de IA, relacionada con los paradigmas de aprendizaje automático, el objetivo es aprender a combinar y procesar mediciones controladas para crear escenarios de tráfico real deseados sin tener un modelo exacto. La aportación de este trabajo es la propuesta y prueba de concepto de un nuevo banco de pruebas y metodología de trabajo basada en IA para clasificar y generar escenarios de propagación. II. GENERACIÓN DE ESCENARIOS MEDIANTE APRENDIZAJE POR REFUERZO (DEEP REINFORCEMENT LEARNING) El aprendizaje por refuerzo imita el proceso cognitivo del cerebro humano explorando acciones de aprendizaje por prueba y error en los casos en los que no se puede aplicar una estrategia estructurada de aprendizaje automático supervisado. Se define un agente que interactúa con un entorno para explorar las mejores acciones para representar indirectamente un modelo, maximizando una cierta recompensa a largo plazo. El aprendizaje por refuerzo se propone para una amplia gama de aplicaciones de futuras comunicaciones inalámbricas, funcionando especialmente bien cuando se utilizan arquitecturas de redes profundas. El aprendizaje por refuerzo profundo asegura la convergencia de los algoritmos de aprendizaje con un coste inferior en términos de tiempo comparado con aprendizaje por refuerzo clásico [5]. A. Procesamiento mediante DRL Nuestro trabajo propone aplicar DRL para procesar y combinar un conjunto de respuestas en frecuencia y en tiempo de un canal de comunicaciones, con el objetivo de crear nuevas respuestas complejas de diversos escenarios de tráfico real. La Figura 2 muestra un esquema de este enfoque: •El agente DRL se implementa con una red neuronal profunda que aprende a combinar un conjunto de respuestas de canal controladas originadas en el banco de pruebas. Como resultado, genera instancias de la respuesta del canal emulado. •El entorno DRL se implementa utilizando modelos generativos profundos en competencia, para la clasificación de los escenarios emulados. Cada modelo se entrena con una amplia colección de datos de cada escenario real. Los modelos generativos como los Variational Autoencoders (VAEs) o las Redes Generativas Antagónicas (Generative Adversarial Networks, GANs) aprenden la verdadera distribución de los datos de entrenamiento para generar nuevas instancias de datos con algunas variaciones. •La recompensa DRL se obtiene cuando la respuesta de canal emulada por el agente DRL, es clasificada por el entorno DRL. La probabilidad de que el canal emulado pertenezca a la clase objetivo de la emulación será la recompensa. Si se quiere emular uno de los escenarios existentes, la recompensa será proporcional a la probabilidad de que el canal emulado pertenezca a la clase del escenario en particular. El ciclo Emulación de canal - Clasificación de canal se repite de forma recursiva hasta la convergencia del algoritmo DRL. Como prueba de concepto, el resto de esta sección proporciona al lector un ejemplo de clusterización, Fig. 2. Esquema del enfoque de Deep Learning para la generación de nuevos escenarios de tráfico real. 262 Actas de las XV Jornadas de Ingeniería Telemática (JITEL 2021), A Coruña (España), 27-29 de octubre de 2021. This work is licensed under a Creative Commons 4.0 International License (CC BY-NC-ND 4.0) clasificación y emulación de cuatro escenarios diferentes a través de DRL. Estos escenarios se miden en la banda de 24.25-27.5 GHz, específicamente reservada para la asignación de espectro 5G en Europa. Además, incluimos medidas en la banda de ondas milimétricas (60 GHz) [6] que serán fundamentales en las futuras comunicaciones móviles. B. Propiedades del canal Para aplicar DRL es fundamental comprender y extraer las propiedades que hacen que cada tipo de escenario sea único. El canal se puede analizar tanto en el dominio del tiempo como en el de la frecuencia y de cada uno se pueden extraer diferentes propiedades discriminatorias. Por un lado, en el dominio del tiempo adquirimos los relacionados con el tiempo de llegada de las componentes multicamino del canal. Por otro lado, en el dominio de la frecuencia obtenemos métricas relacionadas con la atenuación y fase del canal. Por ejemplo, algunas de estas propiedades son: •Factor K: Es la relación entre la componente principal de los MultiPath Components (MPCs) y la potencia total del resto de MPCs en el escenario. •Retardo promedio (𝜏𝑚𝑒𝑎𝑛), retardo de varianza (𝜏𝑣𝑎𝑟) y dispersión del retardo (𝜏𝑅𝑀𝑆): Estas tres propiedades están relacionadas con el tiempo de llegada de la señal. 𝜏𝑚𝑒𝑎𝑛 indica el tiempo promedio en que la potencia de la señal recorre el par TX-RX. 𝜏𝑣𝑎𝑟 y 𝜏𝑅𝑀𝑆 son indicativos de la separación temporal de las distintas componentes multicamino. •Atenuación: En el dominio de la frecuencia, esta propiedad representa la atenuación de la onda electromagnética debido a la propagación en el escenario. •Eficiencia espectral: Determina la cantidad máxima de información (en bps/s/Hz) que se puede transmitir de manera fiable a través del canal de comunicaciones. A modo de ejemplo, mostramos cómo esta parametrización discriminativa de canales podría funcionar en cuatro escenarios diferentes. Los escenarios elegidos son una cámara anecoica, una cámara reverberante, un escenario indoor y un escenario outdoor (ver Figura 3). Se adquieren 1089 medidas para cada escenario, para un total de 4356 canales. Los dos primeros escenarios pertenecen a la familia de escenarios controlados. Los dos últimos pertenecen a la familia de escenarios reales que podrían ocurrir en un entorno real de comunicaciones móviles. Los tres primeros escenarios se miden en la banda de 26 GHz, mientras que el último se adquiere en la banda de 60 GHz [6]. C. Clusterización, clasificación y generación de escenarios. Como se dijo anteriormente, cada escenario se puede caracterizar por un conjunto de parámetros discriminativos basados en sus propiedades. En el ejemplo proporcionado, se han utilizado el Factor K, 𝜏𝑚𝑒𝑎𝑛, 𝜏𝑣𝑎𝑟, 𝜏𝑅𝑀𝑆, la atenuación y la eficiencia espectral. Dado que estas seis propiedades producen un espacio de seis dimensiones que no es fácilmente interpretable a primera vista, estamos interesados en reducir la dimensionalidad a un espacio bidimensional. Específicamente, t-Distributed Stochastic Neighbor Embedding (t-SNE) [7] es una técnica no lineal para la reducción de dimensionalidad particularmente adecuada para la visualización en un espacio bidimensional de conjuntos de datos de mayor dimensión. Al aplicar t-SNE a las mediciones de nuestros escenarios, podemos visualizar el grado de clusterización de estos cuatro escenarios como se muestra en la Figura 4(a). t-SNE aprovecha las características discriminativas de cada escenario para formar cuatro grandes grupos. Una vez que t-SNE detecta las peculiaridades de cada escenario, puede distinguir cuatro grupos principales, uno para cada escenario. Una vez definimos las técnicas t-SNE para la reducción de la dimensionalidad, se proceden a usar modelos generativos, en este caso los VAEs. En la prueba de concepto presentada, hemos seleccionado el VAE [8] como modelo generativo para modelar las verdaderas distribuciones de datos de los escenarios. Los VAE son arquitecturas de aprendizaje automático no supervisadas formadas por dos redes neuronales, denominadas codificador y decodificador respectivamente. El objetivo del codificador es disminuir la dimensión de las entradas al VAE, creando un conjunto de parámetros en un espacio latente. El decodificador es responsable de regenerar los datos originales a partir de dichos parámetros en el espacio latente. 263 N. Mártir-Moreno, A. Ramírez-Arroyo, L. García, S. Vafa, J.F. Valenzuela-Valdés. 2021. En nuestro ejemplo se entrenan de manera no supervisada 4 VAEs, usando en cada uno de ellos datos de cada uno de los cuatro escenarios que se quieren modelar. Una vez entrenados los VAEs para cada uno de los 4 escenarios, el nuevo escenario emulado que se quiere clasificar se usa para regenerar datos en los 4 VAEs. Se elegirá como clase de pertenencia del canal emulado, la clase del VAE que genere muestras con una entropía cruzada más baja. La Figura 4(b) muestra un ejemplo simple de clasificación de los cuatro escenarios siguiendo la estrategia descrita. Se puede ver que la clasificación se produce de manera satisfactoria, con precisiones superiores al 93% en todas las clases. En el paso final del proceso de aprendizaje, es viable generar el canal en base a las recompensas que brinda el entorno DRL. El agente DRL elige aquellos canales que, agregados linealmente, recrean un escenario dado con mayor precisión. Además, el agente no solo elige los mejores canales, sino que también incluye un retardo y atenuación para cada escenario. Esta técnica de postprocesamiento implica un retraso en el canal o una disminución en la potencia de transmisión. La Figura 5 muestra un ejemplo de generación de nuevos escenarios. Este ejemplo se genera modificando cuatro escenarios reales, cada uno representado en un color diferente. Cada uno de los nuevos escenarios se combina de forma lineal agregando una determinada atenuación y delay de manera que la nueva respuesta al impulso es representativa de un escenario completamente nuevo. III. CONCLUSIONES Este trabajo propone la parametrización, clusterización y clasificación de escenarios 6G basados en Aprendizaje por Refuerzo Profundo y Modelos Generativos. Utilizando un conjunto de medidas de entorno controlado y escenarios reales como entrada, esta idea define un agente de aprendizaje que emula nuevos escenarios a través de una red neuronal profunda clásica. Las recreaciones son recompensadas con el resultado de un entorno de clasificación implementado como un conjunto de autoencoders variacionales (VAEs) entrenados con escenarios reales. Estos modelos generativos utilizados para la clasificación están orientados a conocer las verdaderas distribuciones de datos de los escenarios a clasificar y, por tanto, proporcionan herramientas útiles para modificar las distribuciones de datos de acuerdo con las necesidades potenciales. Como líneas futuras, el uso de redes generativas antagónicas para combinar escenarios bajo demanda siguiendo las estrategias exitosas aplicadas en otros campos del conocimiento pueden abrir nuevas líneas de investigación. La generación de escenarios presentada ayudará a modelar y analizar en profundidad los nuevos canales de comunicaciones móviles. Estos modelos permitirán el estudio y mejora de las prestaciones, por ejemplo en ámbitos tan demandados como la eficiencia energética. AGRADECIMIENTOS Este trabajo ha sido financiado por el Programa Español de Investigación, Desarrollo e Innovación bajo el Proyectos RTI2018-102002-A-I00, el Proyecto PID2020112545RB-C54, y el Proyecto TIN2016-75097-P, y en parte por la “Junta de Andalucía” bajo el Proyecto B-TIC402-UGR18, el Proyecto A-TIC-608-UGR20, y Proyecto P18.RT. 4830 y en parte por la beca predoctoral FPU19/01251. Los autores agradecen a Carmelo GarcíaGarcía, Ángel Palomares-Caballero, Carlos Molero-Jiménez por sus ayuda y comentarios, y a José Francisco Cortés-Gómez por el apoyo gráfico. REFERENCIAS [1] C. -X. Wang, J. Huang, H. Wang, X. Gao, X. You and Y. Hao, "6G Wireless Channel Measurements and Models: Trends and Challenges," IEEE Vehicular Technology Magazine, vol. 15, no. 4, pp. 22-32, Dec. 2020. [2] Z. Zhang et al., "6G Wireless Networks: Vision, Requirements, Architecture, and Key Technologies," IEEE Vehicular Technology Magazine, vol. 14, no. 3, pp. 28-41, Sept. 2019. [3] A. Ramírez-Arroyo, P. H. Zapata-Cano, Á. Palomares-Caballero, J. Carmona-Murillo, F. Luna-Valero and J. F. Valenzuela-Valdés, "Multilayer Network Optimization for 5G & 6G," IEEE Access, vol. 8, pp. 204295-204308, 2020. [4] I. F. Akyildiz, A. Kak and S. Nie, "6G and Beyond: The Future of Wireless Communications Systems," IEEE Access, vol. 8, pp. 133995134030, 2020. [5] N.C. Loung, D.T. Hoang, D. Niyato, P. Wang, Y.C. Liang, D. In Kim, “Applications of Deep Reinforcement Learning in Communications and Networking: A Survey”, IEEE Communications Surveys and Tutorials, vol. 21, no 4, 2019. [6] mmWave Channel Model Alliance Database, Fraunhofer HeinrichHertz-Institut, Berlin, Germany. [Online]. Available: https:// 5gmm.nist.gov/ [7] L.J.P. van der Maaten and G.E. Hinton, “Visualizing HighDimensional Data Using t-SNE,” Journal of Machine Learning Research vol. 9, pp. 2579-2605, 2008. [8] D. Kingma and M. Welling, “Auto-Encoding Variational Bayes” in 2nd International Conference on Learning Representations, ICLR 2014, Banff, AB, Canada, 2014. [9] A. Jabbar, X. Li and B. Omar, “A Survey on Generative Adversarial Networks: variants, applications and training”, 2020, doi:arXiv:1909.11573 264