scieee AI-readable full text Open interactive document viewer

Estudio de la influencia de la red de interconexión en la ejecución de aplicaciones paralelas

Campos González, María Camen

Full text

U NIVERSIDAD P OLITÉCNICA DE V ALENCIA E SCUELA T ÉCNICA S UPERIOR DE I NFORMÁTICA P ROYECTO F IN DE C ARRERA Estudio de la inuenia de la red de interonexión en la ejeuión de apliaiones paralelas Autora : C armen C amp os G onzález Tutor : D r. F ederio S illa J iménez N oviembre de 2010 2 Índie general 1. Intro duión 5 2. Equip o de pruebas 7 2.1. Computadores........................... 7 2.2. Interonexión ........................... 7 3. Pruebas realizadas 9 3.1. Caraterizaión de las redes . . . . . . . . . . . . . . . . . . . 9 3.2. Benhmarks MPI de Intel . . . . . . . . . . . . . . . . . . . . 9 3.2.1. Benhmars de omuniaión simple . . . . . . . . . . . 10 3.2.2. Benhmarks de omuniaión paralela . . . . . . . . . 11 3.2.3. Comuniaión oletiva . . . . . . . . . . . . . . . . . 12 3.3. Apliaiones............................ 13 3.3.1. Gromas.......................... 13 3.3.2. Lammps.......................... 13 3.3.3. NPB............................ 13 3.3.4. Multipliaión matriial . . . . . . . . . . . . . . . . . 14 4. Resultados 15 4.1. Anho de banda de las redes . . . . . . . . . . . . . . . . . . . 15 4.2. Benhmarks MPI de Intel . . . . . . . . . . . . . . . . . . . . 16 4.2.1. PingPong ......................... 16 4.2.2. PingPing ......................... 18 4.2.3. Multi-PingPong . . . . . . . . . . . . . . . . . . . . . . 20 4.2.4. Multi-PingPing . . . . . . . . . . . . . . . . . . . . . . 26 4.2.5. Sendrev.......................... 34 4.2.6. Conlusiones sobre los resultados de omuniaión paralela ........................... 39 4.2.7. Gather........................... 39 4.2.8. Satter........................... 42 4.2.9. Bast ........................... 45 4.2.10.Redue .......................... 51 4.2.11. RedueSatter . . . . . . . . . . . . . . . . . . . . . . 53 3 4 ÍNDICE GENERAL 4.2.12.Alltoall .......................... 56 4.2.13.Allgather ......................... 60 4.2.14. Conlusiones a los resultados de las pruebas on b en- hmarks MPI de Intel . . . . . . . . . . . . . . . . . . 62 4.3. Apliaiones............................ 63 4.3.1. Gromas.......................... 65 4.3.2. NPB............................ 73 4.3.3. Multipliaión de matries . . . . . . . . . . . . . . . . 77 5. Conlusiones 89 Capítulo 1 Intro duión El primer ob jetivo que se ha p erseguido al diseñar este proyeto n de arrera está relaionado on la formaión del alumno. Se pretende prop orionar a éste un primer ontato on las tareas de investigaión, iniiando su forma- ión en este amp o. Por otro lado, se busa reforzar el dominio del alumno en el manejo de equip os informátios y disp ositivos de red, omplementando así las destrezas adquiridas en la arrera. Para alanzar este doble ob jetivo se ha deidido esoger omo tema de estudio las redes de interonexión en la omputaión paralela. Más onretamente, se va a analizar la inuenia de las mismas en el tiemp o de ejeuión de varias apliaiones paralelas. La omputaión paralela surge debido a las limitaiones de apaidad de álulo que presentan los sistemas monopro esador. En este sentido, la resoluión de problemas que neesitan gran p otenia de ómputo se viene haiendo, desde hae tiemp o, on la ayuda de sistemas multipro esadores, en los que varios elementos traba jan en paralelo. Mediante la omputaión paralela es p osible reduir el tiemp o total de ejeuión, repartiendo la arga de traba jo entre distintos pro esadores, que realizarán de forma simultánea su parte del traba jo. Basiamente hay dos formas de programar las aplia- iones que serán ejeutadas en estos sistemas multipro esador. La primera es haiendo uso del paradigma de memoria ompartida, y la segunda es mediante el paso de mensa jes. En la primera, los diferentes proesos o threads que omp onen la apliaión paralela son un mapa de memoria omún y la omuniaión se realiza de forma implíita aediendo a variables ompartidas. En ambio, uando se usa el paradigma de paso de mensa jes, los pro esos que se omunian lo haen de forma explíita interambiando mensa jes que ontienen los datos que quieren omuniar. El ejemplo más ono ido de este paradigma es el MPI (Message Passing Interfae). Muhos de los sistemas multipro esadores tienen, a menudo, un oste muy elevado, p or lo que ada vez es más habitual utilizar sistemas multipro esadores formados p or lusters de PCs interonetados mediante redes, ya sean redes de altas prestaiones 5 6 CAPÍTULO 1. INTRODUCCIÓN o redes de área lo al estándar. En este aso, lo habitual es usar el paradigma de paso de mensa jes para omuniar los diferentes pro esos. En este ontexto de interés general p or la omputaión paralela, en el presente proyeto n de arrera se ha deidido realizar un estudio sobre las prestaiones que p o dría prop orionar un sistema multipro esador formado on elementos de uso omún y al alane de ualquiera. En onreto, nuestro sistema estará formado p or 16 PCs de sobremesa onvenionales, onetados en red. Para la red de interonexión, se han onsiderado diferentes op iones, to das ellas de uso habitual (o inluso ya en desuso), ba jo oste eonómio y aesibles para ualquiera. Así, las redes esogidas han sido: 1. Red ethernet interonetada mediante un swith de 100Mbps . 2. Red ethernet interonetada mediante un swith de 10Mbps . 3. Red ethernet interonetada mediante un hub de 10Mbps . 4. Red inalámbria on router wi de 54Mbps . Se pretende estudiar el mo do en que las araterístias de las redes utilizadas para la interonexión de PCs pueden inuir en el rendimiento que se obtiene al ejeutar sobre ellos apliaiones paralelas que utilizan paso de mensa jes. Se evaluará el omp ortamiento que presentan las diferentes redes y si éstas son o no adeuadas para la omputaión paralela. Para ello, utilizando las redes desritas, se ejeutará una serie de apliaiones paralelas, implementadas sobre MPI. La medida de los tiemp os de ejeuión de dihas apliaiones, sobre ada una de las redes, servirá para omparar el omp ortamiento que presentan éstas uando se utilizan para omputaión paralela. Como paso previo a la ejeuión de apliaiones reales, se utilizarán los b enhmarks IMB de Intel para realizar un estudio del rendimiento que presenta ada una de las redes en la ejeuión de las distintas funiones MPI. Este estudio dará una primera aproximaión del omp ortamiento de las redes disp onibles al ejeutar apliaiones basadas en MPI. Cab e destaar que en este proyeto no se está prop oniendo el uso de dihas redes para interone- tar los no dos de un luster. Para este n, las tenolgías atuales, omo 1Gb Ethernet, 10 Gb Ethernet o Inniband, son muho más apropiados. En este proyeto se hae uso de las redes menionadas anteriormente p orque son las disp onibles en los lab oratorios do entes del departamento, y p orque a p esar de sus ba jas prestaiones, p ermiten intro duir al proyetando en las lab ores de investigaión, así omo aanzar y ampliar sus ono imientos sobre redes. Estos dos ob jetivos son la meta de este proyeto. Capítulo 2 Equip o de pruebas La parte exp erimental de este estudio se ha realizado utilizando las instalaiones del lab oratorio do ente de redes de la esuela de informátia. Se han empleado en este estudio 16 PCs. Si bien el lab oratorio uenta on más equip os, dado que el número de los mismos no alanza los 32, se ha optado p or emplear tan sólo los 16 itados, ya que de este mo do nos p ermite mejorar la distribuión del traba jo entre los equip os. 2.1. Computadores Los PCs utilizados tienen las siguientes araterístias: Plaa base dmideode . Pro esador, AMD Athlon 64x2 4800 Memoria, 4GB Sistema op erativo, Kubuntu 8.04 Tarjetas de red: • ethernet 100/1000Mbps (eth0), mo delo NVIDIAnfore . • ethernet 10/100Mbps (eth1), mo delo 3om 3905 . • wi (wlan1), Coneptronis C54RU . 2.2. Interonexión Los disp ositivos de interonexión empleados son: Para la interfaz eth0 se utiliza un swith de 100Mbps , mara 3COM , mo delo 3300 XM . Este swith se utiliza para onetar la red interna del lab oratorio, a internet . 7 8 CAPÍTULO 2. EQUIPO DE PRUEBAS Para la interfaz eth1 se utiliza: un swith de 10Mbps , mara 3COM , mo delo 610, o bien, un hub de 10Mbps mara 3COM , mo delo PS Hub 40 . Para la interfaz wlan1 se utiliza un router wi de 54Mbps , mara ASSUS , mo delo WL500G premium . Los 16 PCs omparten un diretorio en el que está instalado MPI y las apliaiones utilizadas. Este diretorio es exp ortado p or NFS desde un servidor al que se aede a través del swith de 100Mbps . Capítulo 3 Pruebas realizadas En este apítulo se desrib en las pruebas que se han ejeutado en el presente proyeto, on esp eial atenión a las araterístias de las distintas apliaiones y b enhmarks empleados. 3.1. Caraterizaión de las redes Con el n de ono er las araterístias de anho de banda real en las redes que se utilizan, se plantean pruebas senillas en java on las que se miden tiemp os de envío de heros y anho de banda. En onreto, para ada una de las redes, se realizan 10 envíos de heros de diferentes tamaños (0, 1, 1K, 1M, 10M y 100M bytes) y se mide, para ada uno de ellos, el tiemp o empleado en la transmisión. Dividiendo el tamaño del mensa je entre el tiemp o obtenido, se alula el anho de banda orresp ondiente. 3.2. Benhmarks MPI de Intel (IMB) Estos b enhmarks son un onjunto de kernels elementales que p ermiten evaluar ualquier funión de MPI . Serán utilizados para obtener una omparaión de ba jo nivel entre las redes. Se ejeutaron los siguientes b enhmarks: PingPong PingPing Sendrev Exhange Allredue Redue 9 16 CAPÍTULO 4. RESULTADOS Figura 4.2: Anho banda ( Mbps ) 1 2 3 4 5 6 7 8 9 10 0 10000 20000 30000 40000 50000 60000 70000 80000 90000 100000 Mbps Kbytes fichero switch10 hub wifi En la tabla 4.1 se muestran, a mo do de ejemplo, las medidas de anho de banda que se obtienen en el envío de heros de 10Mbytes . Tabla 4.1: Medida de anho de banda real para heros de 10Mbytes red swith 100Mbps swith 10Mbps hub 10Mbps wi 54Mbps Mbps reales 93,90 9,41 8,82 3,64 En los valores mostrados en la tabla 4.1, se observa que el anho de banda real que presentan las redes utilizadas es algo menor que el nominal en las redes ethernet, mientras que es onsiderablemente menor al nominal en la red inalámbria (6.7 % del anho de banda nominal). 4.2. Benhmarks MPI de Intel En esta seión se exp onen los resultados obtenidos on los benhmarks utilizados, y que se han desrito en el apartado 3.2. 4.2.1. PingPong En las guras 4.3 y 4.4, donde la segunda es un zo om de la primera, se representan las medidas de anho de banda prop orionadas p or el b enhmark IMB-PingPong . 4.2. BENCHMARKS MPI DE INTEL 17 Figura 4.3: PingPong ( Mbytes/seg ) 0 2 4 6 8 10 12 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/seg longitud mensaje (Bytes) switch100 switch10 hub wifi Figura 4.4: PingPong ( Mbytes/seg ) 0 0.2 0.4 0.6 0.8 1 1.2 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/seg longitud mensaje (Bytes) switch10 hub wifi La tabla 4.2 muestra las medidas de anho de banda para envíos de 4Mbytes , que se obtienen utilizando IMB-PingPong : Tabla 4.2: Medida de anho de banda dada por IMB-PingPong (para 4Mbytes ) red swith 100Mbps swith 10Mbps hub 10Mbps wi 54Mbps Mbytes/se 11,20 1,12 0,94 0,38 Mbps 93,95 9,39 7,88 3,19 Comprobamos que los resultados son similares a los obtenidos en la se- ión 4.1, aunque para alguna de las redes se observa que existe p érdida en el anho de banda debido a la sobrearga de MPI . En la tabla 4.3 se muestra la evaluaión de esta p érdida de anho de banda. 18 CAPÍTULO 4. RESULTADOS Tabla 4.3: Pérdida de anho de banda p or sobrearga MPI red swith 100Mbps swith 10Mbps hub 10Mbps wi 54Mbps diferenia Mbps −0,05 0,02 0,93 0,45 % p érdida 0 % 0,2 % 10,5 % 12,3 % Por un lado se observa que la sobrearga que representa MPI es despre- iable en las redes onetadas mediante un swith. Por otro lado, la p érdida de anho de banda no dep ende úniamente del propio anho de banda de la red. Por ejemplo, las redes onetadas on un swith de 10Mbps y on un hub de 10Mbps tienen un anho de banda en omuniaiones punto a punto muy similar, y sin embargo la p érdida que presenta la segunda es signiativamente mayor que la primera. Como veremos más adelante, esto es debido a que las redes onetadas mediante un swith tienen una imp ortante ganania de anho de banda uando se realizan múltiples omuniaiones simultáneas (neesarias para la sinronizaión on MPI ). De forma equivalente puede deirse que la red onetada mediante un hub pierde anho de banda ante omuniaiones paralelas (la red wi tendrá un omp ortamiento similar a la red onetada mediante un hub). 4.2.2. PingPing En las guras 4.5 y 4.6 (la segunda es un zo om de la primera) se muestran los valores de anho de banda bidireional prop orionados p or IMBPingPing . Figura 4.5: PingPing (Mbytes/seg) 0 2 4 6 8 10 12 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/seg longitud mensaje (Bytes) switch10 switch10 hub wifi 4.2. BENCHMARKS MPI DE INTEL 19 Figura 4.6: PingPing (Mbytes/seg) 0 0.2 0.4 0.6 0.8 1 1.2 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/seg longitud mensaje (Bytes) switch10 hub wifi Para heros de 4Mbytes se obtienen las medidas para IMB-PingPong e IMB-PingPing presentadas en la tabla 4.4: Tabla 4.4: Comparaión IMB-PingPong e IMB-PingPing ( Mbytes/sec ) ( Mbps ) swith 100Mbps swith 10Mbps hub 10Mbps wi 54Mbps PingPong 11,20 1,12 0,94 0,38 PingPing 10,57 1,09 0,46 0,27 % p érdida 5,6 % 2,7 % 51,06 % 28,95 % Se observa que en las redes que utilizan un swith para la interonexión, ap enas disminuyen el anho de banda, mientras que la red que utiliza un hub redue el anho de banda a la mitad. Esto es debido a que los swithes presentan omuniaión fullduplex y el hub no. Respeto a la red inalámbria, redue su anho de banda entre un terio y un uarto aproximadamente. Hay que tener en uenta que los datos de anho de banda que prop oriona este b enhmark sólo onsideran uno de los envíos que hae la pareja de no dos, y representa el anho de banda que lo almente detetaría uno de los no dos en su envío. Si se onsiderasen los dos envíos que realiza la pareja de no dos simultaneamente, se observaría una ganania de anho de banda en las redes onetadas on un swith. Pueden haerse dos leturas del mismo heho: una es que, al realizar dos envíos simultáneos las redes on swith mantienen su anho de banda (lo al), mientras que la red on hub redue su anho de banda a la mitad. La otra letura sería que al realizar los dos envíos simultáneos, las redes on swith presentan una ganania en su anho de banda (global), que se duplia. Por el ontrario, en la red onetada on un hub, el anho de banda (global) se mantiene onstante. 20 CAPÍTULO 4. RESULTADOS 4.2.3. Multi-PingPong Swith-100Mbps: Las gráas 4.7 y 4.8 muestran que las urvas resultantes de variar el número de no dos han quedado sup erpuestas, lo ual implia que el número de parejas de no dos que efetuan simultaneamente omuni- aiones punto a punto no inuye en el tiemp o de envío de mensa jes, ni en el anho de banda en ada no do. Este omp ortamiento se deb e al heho de que una red onetada mediante un swith p ermite distintos anales de omuniaión simultánea entre pares. De esta forma, el anho de banda teório puede verse multipliado p or el número de omuniaiones que se dan de forma paralela en un determinado momento. Figura 4.7: Multi-PingPong Swith100Mbps 0 50000 100000 150000 200000 250000 300000 350000 400000 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.8: Multi-PingPong Swith100Mbps 0 2 4 6 8 10 12 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 Veamos on un ejemplo la ganania de anho de banda que se tiene uando efetuamos n omuniaiones de forma paralela. Calularemos el an- ho de banda del sistema uando 2n no dos ejeutan simultaneamente IMBPingPong, para un envío de x= 4Mbytes : 4.2. BENCHMARKS MPI DE INTEL 21 Indep endientemente del valor de n , el tiemp o obtenido al ejeutar IMBMultiPingPong es aproximadamente t= 356600µs . Así, p or ada pareja, en t= 356600µs se envían x= 4Mbytes . Por tanto el anho de banda global ( ABG ) del sistema viene dado p or la expresión: ABG =n∗4∗1048576Bytes 356600µs =n∗4∗8∗1048576bits 356600 ∗10−6s=n∗94Mbps Tabla 4.5: ABG - MultiPingPong on Swith100Mbps n o no dos 2 4 8 16 n 1 2 4 8 ABG(Mbps) 94 188 376 752 La tabla 4.5 muestra ómo el anho de banda global ree de forma prop orional al número de omuniaiones punto a punto simultáneas entre pares de no dos. Nótese que no ha habido p érdida de generalidad al efetuar los álulos para un determinado tamaño de envío ( x= 4Mbytes ). Tal omo muestra la gráa 4.7, el tiemp o ree de forma lineal on el tamaño de envío, p or lo que los resultados obtenidos habrían sido los mismos si onsideramos otro tamaño de envío, on su latenia orresp ondiente. Swith-10Mbps: Las gráas 4.9 y 4.10 muestran que la red onetada mediante un swith de 10Mbps presenta un omp ortamiento similar al de la red onetada mediante un swith de 100Mbps . Indep endientemente del valor de n (número de omuniaiones punto a punto simultáneas) los tiemp os obtenidos al ejeutar IMB-PingPong en ada uno de los pares es aproximadamente el mismo para to dos ellos. Figura 4.9: Multi-PingPong Swith10Mbps 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 22 CAPÍTULO 4. RESULTADOS Figura 4.10: Multi-PingPong Swith10Mbps 0 0.2 0.4 0.6 0.8 1 1.2 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 De forma similar al ejemplo anterior, para estimar la ganania de anho de banda que se pro due al tener omuniaiones simultáneas, alulamos el anho de banda global del sistema ( ABG ). Para ello onsideramos, sin p érdida de generalidad, un tamaño de envío x= 4Mbytes . La latenia para este valor de x es, aproximadamente, t= 3545530µs indep endientemente del número de no dos impliados en la omuniaión. El anho de banda global vendrá dado p or la expresión: ABG =n∗4Mbytes 3545530µs =n∗4∗8∗1048576bits 3545530 ∗10−6s=n∗9,4Mbps Tabla 4.6: ABG -MultiPingPong on Swith10Mbps n o no dos 2 4 8 16 n 1 2 4 8 ABG(Mbps) 9,4 18,8 37,6 75,2 A la vista de la tabla 4.6, se omprueba, de nuevo, que uando para la interonexión se utiliza un swith, el heho de que haya omuniaiones simultáneas hae que aumente el anho de banda global . Se observa que los valores de anho de banda obtenidos para la red onetada mediante el swith de 100Mbps son 10 vees los obtenidos para la red onetada mediante el swith de 10Mbps . Hub: Con las guras 4.11 y 4.12 se puede omprobar que el omp ortamiento que presenta la red onetada mediante un hub es diferente al de las redes onetadas mediante un swith. En el aso del hub, se observa que el tiemp o de envío y el anho de banda obtenidos varían on el número de 4.2. BENCHMARKS MPI DE INTEL 23 no dos: al dupliar el número de no dos se duplia el tiemp o de envío y el anho de banda (lo al) se redue a la mitad. Figura 4.11: Multi-PingPong Hub 0 5e+06 1e+07 1.5e+07 2e+07 2.5e+07 3e+07 3.5e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.12: Multi-PingPong Hub 0 0.2 0.4 0.6 0.8 1 1.2 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 Calularemos el anho de banda del sistema uando 2n no dos ejeutan simultaneamente IMB-PingPong y omprobaremos que en este aso no se pro due la ganania de los asos anteriores. Como puede observarse en la gráa 4.11, para un envío de x= 4Mbytes , la latenia ( tn ), dep ende del número de omuniaiones simultáneas ( n ) que hay en un momento dado. El anho de banda global del sistema viene dado p or la expresión: ABG =n∗4Mbytes tnµs =n∗4∗8∗1048576bits tn∗10−6s 24 CAPÍTULO 4. RESULTADOS Tabla 4.7: ABG - MultiPingPong on Hub10Mbps n o no dos 2 4 8 16 n 1 2 4 8 latenia ( µs ) 4363298 8040792 15846112 31202804 ABG (Mbps) 7,69 8,34 8,47 8,60 Con los datos de la tabla 4.7 omprobamos que, en el aso de utilizar un hub para la interonexión, el anho de banda global no aumenta al aumentar el número de onexiones simultáneas, sino que se mantiene onstante. Se hae notar que en este aso tamp o o ha habido p érdida de generalidad al onsiderar un tamaño onreto de mensa je ya que al igual que en los otros asos, para un valor de n dado, el tiemp o de envío es diretamente prop orional al tamaño de mensa je. Wi: Las gráas orresp ondientes a la red wi (4.13 y 4.14) muestran un omp ortamiento bastante pareido al de la red onetada mediante un hub. Es deir esta red pierde anho de banda en ada no do a medida que aumenta el número de omuniaiones simultáneas. Figura 4.13: Multi-PingPong Wi 0 5e+06 1e+07 1.5e+07 2e+07 2.5e+07 3e+07 3.5e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 4.2. BENCHMARKS MPI DE INTEL 25 Figura 4.14: Multi-PingPong Wi 0 0.05 0.1 0.15 0.2 0.25 0.3 0.35 0.4 0.45 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 Realizamos, para la red inalámbria, álulos análogos a los realizados para las otras redes. Consideramos envíos simultáneos de x= 4Mbytes : ABG =n∗4Mbytes tnµs =n∗4∗8∗1048576bits tn∗10−6s Tabla 4.8: ABG - MultiPingPong on Wi n o no dos 2 4 8 16 n 1 2 4 8 latenia ( µs ) 10464152 15195967 23351171 32669240 ABG (Mbps) 3,20 4,42 5,75 8,22 Aunque se observa (tabla 4.8) que el anho de banda global aumenta on el número de omuniaiones simultáneas, no se trata de un aumento omparable al observado en las redes onetadas mediante un swith, sino que se trata de un p equeño aumento, más pareido al observado en el aso del hub. En la guras 4.15 y 4.16 (la segunda es un zo om de la primera) se omparan los tiemp os obtenidos al ejeutar IMB-MultiPingPong sobre ada una de las redes onsideradas, para un tamaño de mensa je de 4MBytes . A la vista de éstas, se omprueba, de nuevo, el efeto que tiene el número de omuni- aiones simultáneas sobre el tiemp o neesario para llevarlas a ab o. Vemos ómo este tiemp o se mantiene onstante en las redes onetadas mediante un swith y ómo aumenta de forma prop orional al número de omuniaiones en el aso del hub. Resp eto a la red wi, en prinipio paree omp ortarse de forma bastante similar a la red onetada mediante un hub, p ero, tal vez debido a la elevada variabilidad detetada en la red wi, no es p osible onluir nada denitivo al resp eto. 32 CAPÍTULO 4. RESULTADOS La latenia y el anho de banda (lo al) varía on el número de no dos. Al dupliar el número de no dos se duplia la latenia y se redue el anho de banda a la mitad. El anho de banda en ada no do es la mitad que el obtenido para IMB-MultiPingPong . El anho de banda global no varía on el número de nodos y oinide on el obtenido para IMB-MultiPingPong . Wi: Las guras 4.25 y 4.26 muestran el omp ortamiento que presenta esta red al ejeutar IMB-MultiPingPing . Figura 4.25: Multi-PingPing Wi 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 7e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.26: Multi-PingPing Wi 0 0.05 0.1 0.15 0.2 0.25 0.3 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 Se realizan, para la red wi, álulos del anho de banda global oresp ondiente a la funión IMB-MultiPingPing , de forma similar a los efetuados para las otras redes. Los resultados obtenidos se muestran en la tabla 4.12. 4.2. BENCHMARKS MPI DE INTEL 33 Tabla 4.12: ABG - MultiPingPing on wi n o no dos 2 4 8 16 n 1 2 4 8 latenia ( µs ) 14852572 26204922 38200406 60618160 ABG (Mbps) 4,5 5,12 7,02 8,8 En las guras 4.27 y 4.28, en las que se ompara el omp ortamiento de las ditintas redes al ejeutar IMB-MultiPingPing para un tamaño de mensa je de 4MBytes , observamos que el tiemp o de envío se mantiene onstante al variar el número de no dos en las redes onetadas p or un swith, mientras que varía en las otras dos. En el aso del hub la variaión es lineal. En el aso de la red wi, aunque aparenta un omp ortamiento similar al de la red on hub, la variaión no presenta una tendenia lara. Figura 4.27: Multi-PingPing , omparaión para 4MBytes 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 7e+07 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 hub wifi Figura 4.28: Multi-PingPing , omparaión para 4MBytes 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 34 CAPÍTULO 4. RESULTADOS 4.2.5. Sendrev Con el n de analizar el omp ortamiento que presentan las distintas redes al ejeutar IMB-Sendrev , en las guras 4.29 a 4.36 se muestran los resultados obtenidos en la ejeuión de diho b enhmark sobre ada una de las redes. Figura 4.29: Sendrev Swith100Mbps 0 100000 200000 300000 400000 500000 600000 700000 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.30: Sendrev Swith100Mbps 0 5 10 15 20 25 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 4.2. BENCHMARKS MPI DE INTEL 35 Figura 4.31: Sendrev Swith10Mbps 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.32: Sendrev Swith10Mbps 0 0.5 1 1.5 2 2.5 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.33: Sendrev Hub 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 7e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 36 CAPÍTULO 4. RESULTADOS Figura 4.34: Sendrev Hub 0 0.2 0.4 0.6 0.8 1 1.2 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.35: Sendrev Wi 0 2e+07 4e+07 6e+07 8e+07 1e+08 1.2e+08 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.36: Sendrev Wi 0 0.1 0.2 0.3 0.4 0.5 0.6 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 Para el álulo del anho de banda global (orresp ondiente a N no dos), 4.2. BENCHMARKS MPI DE INTEL 37 se onsidera que en un tiemp o tN se realizan N envíos de x= 4Mbytes . Los resultados se muestran en las tablas 4.13 a 4.16 ABG =N∗4Mbytes tNµs =N∗4∗8∗1048576 tN∗10−6Mbps Tabla 4.13: ABG -Sendrev on Swith100Mbps n o no dos ( N ) 2 4 8 16 latenia ( µs ) 679481 399195 402837 437136 ABG (Mbps) 99 336 666 1228 Tabla 4.14: ABG -Sendrev on Swith10Mbps n o no dos ( N ) 2 4 8 16 latenia ( µs ) 3673248 3849091 3751472 3980619 ABG (Mbps) 18,26 34,87 71,55 134,87 Tabla 4.15: ABG -Sendrev on Hub10Mbps n o no dos ( N ) 2 4 8 16 latenia ( µs ) 8681823 17237575 32993052 64428851 ABG (Mbps) 7,73 7,78 8,13 8,33 Tabla 4.16: ABG -Sendrev on Wi n o no dos ( N ) 2 4 8 16 latenia ( µs ) 15285366 35564079 56214253 119075487 ABG (Mbps) 4,39 3,77 4,77 4,5 Observamos que los resultados obtenidos son muy similares a los obtenidos para IMB-MultiPingPing (seión 4.2.4). Se haen las siguientes anotaiones: Las gráas 4.29 y 4.30, que haen referenia a la red onetada mediante un swith de 100Mbps , muestran un omp ortamiento inesp erado para 2 no dos que p o dría ser debido a alguna anomalía de fun- ionamiento del swith de 100Mbps omo la que se detetó en IMBMultiPingPing . Para onrmar esta sup osiión, omprobamos que la 38 CAPÍTULO 4. RESULTADOS red onetada mediante un swith de 10Mbps no presenta ese omp ortamiento. Se observa ierta variabilidad, on el número de no dos, en las redes onetadas mediante un swith, que p o dría ser debida al heho de que aunque la funión MPI-Sendrev se omp one de un onjunto de fun- iones MPI-Isend y MPI-Irev (igual que IMB-MultiPingPing ), para llevarla a ab o se preisa una o ordinaión adiional entre to dos los no dos. Los datos de anho de banda que prop oriona este b enhmark tienen en uenta dos envíos p or no do, mientras que IMB-MultiPingPing sólo onsidera uno de ellos. Esto hae que los valores de anho de banda que prop oriona IMB-Sendrev sean el doble que los de IMBMultiPingPing . En este ejemplo la red wi muestra un omp ortamiento análogo al de la red onetada on un hub: • En las gráas 4.35 y 4.36 se observa que al dupliar el número de no dos se duplia la latenia mientras que el anho de banda (lo al) se redue a la mitad. • El anho de banda global se mantiene onstante al variar el número de no dos (tabla 4.16). Figura 4.37: Sendrev , omparaión para 4MBytes 0 2e+07 4e+07 6e+07 8e+07 1e+08 1.2e+08 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 Hub Wifi 4.2. BENCHMARKS MPI DE INTEL 39 Figura 4.38: Sendrev , omparaión para 4MBytes 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 Las gráas que se muestran en las guras 4.37 y 4.38 son similares a las obtenidas para IMB-MultiPingPing (Fig. 4.27). Aunque en este aso paree onrmarse la similitud, que no había p o dido ser determinada en otros ejemplos, entre el omp ortamiento de la red wi y la red que utiliza un hub. 4.2.6. Conlusiones sobre los resultados de omuniaión paralela La idea prinipal que extraemos tras el análisis de los b enhmarks que estudian las omuniaiones paralelas, es que las redes que utilizan un swith para la interonexión mejoran onsiderablemente su rendimiento ante omuniaiones simultáneas, mientras que no es así para las que utilizan un hub o wi. Las redes onetadas mediante un swith obtienen una imp ortante ganan- ia de anho de banda uando se llevan a ab o omuniaiones simultáneas entre parejas de no dos. Esto es debido a que un swith p ermite varios anales de omuniaión simultáneos. No o urre lo mismo en la red onetada on un hub ni en la red wi. Po dría deirse que dado que en estas redes no son p osibles los envíos simultáneos, ante ualquier intento de omuni- aión en paralelo, ésta quedaría serializada. Las transmisiones se ordenan transformando una omuniaión paralela en seuenial. 4.2.7. Gather Pasamos a analizar el primer ejemplo de omuniaión oletiva. 40 CAPÍTULO 4. RESULTADOS Figura 4.39: Gather Swith100Mbps 0 1e+06 2e+06 3e+06 4e+06 5e+06 6e+06 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.40: Gather Swith10Mbps 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.41: Gather Hub 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 7e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 4.2. BENCHMARKS MPI DE INTEL 41 Figura 4.42: Gather Wi 0 2e+07 4e+07 6e+07 8e+07 1e+08 1.2e+08 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 En este ejemplo, tal omo puede observarse en las guras 4.39 a 4.42, las uatro redes muestran el mismo omp ortamiento: La latenia ree linealmente on el tamaño de envío (retas) y es prop orional al número de no dos. Este omp ortamiento oinide on el que hasta ahora presentaba la red onetada mediante un hub. Cuando N no dos invo an la funión MPI-Gather, se llevan a ab o N−1 envíos de datos desde diferentes no dos a un no do maestro ( N0 ). Por otro lado, en ualquiera de las redes que estudiamos, dado que los envíos se realizan to dos a un mismo no do N0 , éste sólo p o drá reibir datos de uno de los no dos en un momento determinado. Es deir, los envíos no p o drán ser simultáneos en ningún aso, siempre serán seueniales. Este heho hae que, al ejeutar MPI-Gather , las redes onetadas mediante un swith no tengan en este aso ganania alguna y presenten el mismo omp ortamiento que las otras redes. Figura 4.43: Gather , omparaión para 4MBytes 0 2e+07 4e+07 6e+07 8e+07 1e+08 1.2e+08 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 hub wifi 48 CAPÍTULO 4. RESULTADOS El razonamiento anterior p o dría justiar el heho de que en las gráas 4.51 y 4.52 la latenia no varíe de forma lineal al variar el tamaño de envío. En ellas observamos que, omo era de esp erar, para 2 no dos la latenia sí ree de forma lineal on el tamaño del envío. Por otro lado, las urvas orresp ondientes a 4, 8 y 16 no dos están aproximadamente omprendidas entre la gráa que se orresp onde on 2 no dos, y el doble de ésta. Esto se deb e a que mediante la división del mensa je original, tal omo se ha expliado antes, se onsigue que el tiemp o de envío no sup ere 2tx , siendo tx el tiemp o neesario para enviar el mensa je original de un no do a otro. En la gráa 4.55 se muestra de nuevo la gráa 4.51, a la que se le ha añadido, a mo do de referenia, la línea 2×N2 obtenida multipliando p or 2 la línea orresp ondiente a 2 no dos. Figura 4.55: Swith100Mbps /Bast 0 100000 200000 300000 400000 500000 600000 700000 800000 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 2*N2 A ontinuaión se desrib e, de una forma aproximada, un p osible mo do en que se dividirían los mensa jes iniiales, dep endiendo del tamaño de éstos y del número de no dos, para obtener una gráa similar a la representada en la gura 4.55. Consideremos la fórmula, para N no dos, que nos p ermite alular el tiemp o de envío neesario uando se divide un mensa je de tamaño x en q partes: t= log2(qN)tq= log2(qN)tx q (4.3) 16-no dos: Para un tamaño de mensa je x , menor y próximo a 262144bytes , la urva de 16 no dos está p or enima de línea 2×N2 , aunque aparentemente no se aleja demasiado. Posiblemente para estos valores de x el mensa je se divide en 2 para mejorar el rendimiento. Utilizando la euaión (4.3) on N= 16 y q= 2 tendremos t= log2(32) tx 2=5 2tx= 2,5tx . Este valor expliaría que la urva esté ligeramente p or enima de la línea 2×N2 . Para x= 524288bytes la urva ba ja p or deba jo de la línea de referenia 2×N2 . En este aso, se habría pro duido una nueva división 4.2. BENCHMARKS MPI DE INTEL 49 de mensa jes y se tendría N= 16 y q= 4 . Apliando la fórmula (4.3) nuevamente, tendremos t= log2(64) tx 4=6 4tx= 1,5tx . A la vista de la gráa 4.55 paree laro, sin embargo, que la reduión de la latenia es mayor, p or lo que el valor de q tendría que ser mayor que el supuesto. Si tomamos q= 8 tendríamos t=7 8tx= 0,9tx que paree a justarse mejor a la urva. Se hae notar que aunque t= 0,9tx sup ondría que la urva orresp ondiente a 16 no dos estuviera p or deba jo de la de 2 no dos, esto no suede debido a la sobrearga que indudablemente se añade al dividir el mensa je original en 8 nuevos mensa jes. 8-no dos: Para un tamaño de mensa je x menor de 2097152bytes , la urva de 8 no dos es similar a la línea 2×N2 . Esto se onsigue dividiendo el mensa je original entre 2. En efeto, si onsideramos la euaión 4.3 on N= 8 y q= 2 obtenemos t= log2(16) tx 2=4 2tx= 2tx , tal omo se esp eraba. Para x= 4194304bytes vuelve a hab er una nueva división. Tomamos N= 8 y q= 4 y obtenemos t= 1,25tx que se a justa (onsiderando la sobrearga) a lo observado en la gráa. 4-no dos: Para este número de no dos, la primera división de mensa je se hae para x= 2097152bytes . Considerando N= 4 , q= 2 se tiene t= 1,5tx que no oinide on lo observado. Tomando N= 4 , q= 4 se tiene t= 1tx , que una vez onsiderada la sobrearga orresp ondiente, sí se a justa a la urva de 4 no dos. Se hae notar que dado que la red onetada mediante un hub seuenializa ualquier intento de omuniaión simultánea, no va a obtener niguna venta ja de la implementaión de la funión bast . Aunque los mensa jes se dividan, no se enviarán de forma simultánea, sino que serán enviados uno tras otro. En el aso de esta red, esta implementaión emp eora p or tanto los tiemp os de latenia ya que la sobrearga añadida p or la fragmentaión de los mensa jes, no se ve omp ensada en mo do alguno. Resp eto a la red wi tiene un omp ortamiento análogo a la red onetada on un hub, on el inonveniente añadido de que la sobrearga paree ausarse más en esta red. El estudio del mo do en que la funión MPI-bast ha sido implementada, nos p ermite deduir que la versión de MPI que utilizamos no ha sido diseñada para ser ejeutada utilizando una red del tip o hub o wi. 50 CAPÍTULO 4. RESULTADOS Figura 4.56: Bast, omparaión para 4MBytes 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 7e+07 8e+07 9e+07 1e+08 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 hub wifi Figura 4.57: Bast, omparaión para 4MBytes 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 5e+06 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 Figura 4.58: Bast, omparaión para 4MBytes 360000 380000 400000 420000 440000 460000 480000 500000 520000 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 En este ejemplo, en el que la latenia no varía linealmente on el tamaño 4.2. BENCHMARKS MPI DE INTEL 51 de envío, no se puede generalizar a partir de datos partiulares, orresp ondientes a un determinado tamaño de mensa je. Las gráas anteriones (4.56 a 4.58) p osiblemente variarían de forma onsiderable al onsiderar otro tamaño de mensa je. Es de destaar que la implementaión de la funión MPI-Bast no aproveha la apaidad de broadast de las redes ethernet. Esto se dedue al observar que el número de no dos inuye en la latenia. 4.2.10. Redue Este ejemplo es similar a bast en el heho de presentar omuniaiones tanto paralelas omo seueniales. Figura 4.59: Swith100Mbps /Redue 0 100000 200000 300000 400000 500000 600000 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.60: Swith10Mbps /Redue 0 1e+06 2e+06 3e+06 4e+06 5e+06 6e+06 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 52 CAPÍTULO 4. RESULTADOS Figura 4.61: Hub/Redue 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.62: Wi/Redue 0 2e+07 4e+07 6e+07 8e+07 1e+08 1.2e+08 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.63: Redue, omparaión para 4MBytes 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 hub wifi 4.2. BENCHMARKS MPI DE INTEL 53 Figura 4.64: Redue, omparaión para 4MBytes 0 1e+06 2e+06 3e+06 4e+06 5e+06 6e+06 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 Figura 4.65: Redue, omparaión para 4MBytes 360000 380000 400000 420000 440000 460000 480000 500000 520000 540000 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 Nuevamente los swith presentan, amb os, la misma forma de gráa que vendrá determinada p or la forma en que está heha la implementaión de la funión redue . Muy p osiblemente en forma de árb ol, de forma similar a la funión bast (seión 4.2.9). Se hae notar que en este aso se observa un p eor rendimiento para 8 no dos, igual que suedía en la funión bast . 4.2.11. RedueSatter La funión MPI-Reduesatter lleva a ab o una op eraión redue seguida de otra satter . Como es de esp erar, se observa que las gráas de esta funión son una ombinaión de las dos op eraiones de que onsta. Los tiemp os mostrados en estas gráas resultan de sumar los tiemp os orresp ondientes a las gráas de las funiones Satter (4.2.8) y Redue (4.2.10), teniendo en uenta que uando se ejeuta Reduesatter para un tamaño de mensa je x 54 CAPÍTULO 4. RESULTADOS determinado, se ejeuta Redue para un tamaño x y Satter para un tamaño x N , siendo N el número de no dos. Figura 4.66: Swith100Mbps /RedueSatter 0 100000 200000 300000 400000 500000 600000 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.67: Swith10Mbps /RedueSatter 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 5e+06 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 4.2. BENCHMARKS MPI DE INTEL 55 Figura 4.68: Hub/RedueSatter 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 7e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.69: Wi/RedueSatter 0 2e+07 4e+07 6e+07 8e+07 1e+08 1.2e+08 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.70: RedueSatter, omparaión para 4MBytes 0 2e+07 4e+07 6e+07 8e+07 1e+08 1.2e+08 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 hub wifi 56 CAPÍTULO 4. RESULTADOS Figura 4.71: RedueSatter, omparaión para 4MBytes 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 5e+06 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 Figura 4.72: RedueSatter, omparaión para 4MBytes 150000 200000 250000 300000 350000 400000 450000 500000 550000 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 4.2.12. Alltoall En seiones anteriores hemos omprobado que uando las omuniaiones generadas en la ejeuión de una determinada funión se haen de forma seuenial (omo o urre siempre en la red onetada mediante el hub y en la red wi), la latenia es prop orional al número de mensa jes que se envían. Dado que en to dos los ejemplos vistos hasta ahora los mensa jes enviados oinidían on el número de no dos, se hablaba, de forma equivalente, de que la latenia era prop orional al número de no dos, uando en realidad se refería al número de mensa jes enviados. En este ejemplo, tendremos presente que en la ejeuión de la funión Al ltoal l el número de mensa jes enviados no oinide on el de no dos. En la ejeuión de la funión MPI-Al ltoal l ada no do envía un mensa je, en prinipio diferente, a ada uno de los no dos restantes. Esto sup one que si la funión es invo ada p or N no dos, para su ejeuión se genera un total de N2 mensa jes. 4.2. BENCHMARKS MPI DE INTEL 57 Figura 4.73: Al ltoal l Swith100Mbps 0 1e+06 2e+06 3e+06 4e+06 5e+06 6e+06 7e+06 8e+06 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.74: Al ltoal l Swith10Mbps 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 7e+07 8e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.75: Al ltoal l Hub 0 1e+08 2e+08 3e+08 4e+08 5e+08 6e+08 7e+08 8e+08 9e+08 1e+09 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 64 CAPÍTULO 4. RESULTADOS Con el n de failitar el análisis de los resultados obtenidos en las distintas pruebas realizadas, se haen las siguientes sup osiiones: 1. El tiemp o que la apliaión neesita para efetuar sus op eraiones (tiemp o de ómputo C1 ) es el tiemp o que se obtiene al ejeutar la apliaión para un no do ( N= 1 ). 2. Al ejeutar la apliaión en n no dos, el tiemp o de omputo en uno de los no dos ( Cn ) viene dado p or la expresión Cn=C1 n , es deir el tiemp o de ómputo se reparte entre los distintos no dos. 3. Estimamos el tiemp o empleado en omuniaión, omo la diferenia entre el tiemp o de ejeuión y el de ómputo. Esta estimaión se reere al tiemp o mínimo de omuniaión, ya que, en algunos asos estos tiemp os p o drían solaparse, on lo que el tiemp o de omuniaión real sería aún mayor. Estas sup osiiones nos p ermiten desglosar el tiemp o de ejeuión en tiemp o de ómputo y tiemp o de omuniaión entre los distintos no dos. De esta forma, p o dremos evaluar la sobrearga que sup one la omuniaión en el tiemp o de ejeuión. Como hemos visto en la seión 4.2, hay varios fatores que inuyen en la latenia de las funiones MPI . Estos pueden resumirse en: 1. Caraterístias de la red. Prinipalmente, anho de banda y si p ermite omuniaiones simultáneas. 2. Tip o de omuniaión. Por ejemplo, ante una omuniaión seuen- ial, no habrá diferenia entre la red que p ermite las omuniaiones paralelas de aquella que no las p ermite. 3. Tamaño del mensa je a enviar. En la seión 4.2 se ha p o dido omprobar que para ualquiera de las funiones estudiadas, indep endientemente de la red o del número de no dos, la latenia aumenta on el tamaño del mensa je a enviar. Considerando una red onreta, para analizar la evoluión que la latenia de omuniaión presenta al aumentar el número de no dos, tendremos en uenta, p or un lado, que la latenia puede aumentar (o no) debido al aumento del número de omuniaiones. Por otro, que la latenia p o dría disminuir si el aumento de no dos onlleva la reduión del tamaño de los mensa jes. Como onseuenia, el aumento o no de la latenia de omuniaión, dep enderá, en gran medida, de las araterístias de la apliaión. El ob jetivo de la omuniaión paralela es reduir el tiemp o de ejeu- ión de las apliaiones. Esto se pro duirá si la disminuión en el tiemp o de ómputo puede omp ensar el p osible aumento de la latenia de omuniaiones. En la gura 4.87 se muestra, p or un lado, el mo do en que disminuye el 4.3. APLICACIONES 65 tiemp o de ejeuión al aumentar el número de no dos, y p or otro, el umbral máximo para la latenia de omuniaión, que no deb erá ser sobrepasado para obtener tiemp os inferiores a la ejeuión en un únio no do. Figura 4.87: Evoluión del tiemp o de ómputo y del umbral de latenia de omuniaión 0 0.2 0.4 0.6 0.8 1 2 4 6 8 10 12 14 16 18 20 tiempo nodos computo comunicacion Las apliaiones que hemos utilizado para el presente estudio son las siguientes: 1. Gromas 2. Lammps 3. NBP 4. Multipliaión matriial 4.3.1. Gromas Para esta apliaión se han onsiderado dos ejemplos (dpp  y p oly) de distinto tamaño. Gromas-dpp  Este es el ejemplo de apliaión paralela real de mayor tamaño que se ha utilizado. Los resultados obtenidos on esta apliaión se muestran en las guras 4.88 a 4.90. 66 CAPÍTULO 4. RESULTADOS Figura 4.88: gromas_dpp 0 20000 40000 60000 80000 100000 120000 140000 160000 180000 200000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub Figura 4.89: gromas_dpp 0 2000 4000 6000 8000 10000 12000 14000 16000 18000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 Figura 4.90: gromas_dpp 1800 2000 2200 2400 2600 2800 3000 3200 3400 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 A la vista de estos primeros datos de ejeuión de apliaiones reales, se 4.3. APLICACIONES 67 p one de maniesto la imp ortania que tiene la red utilizada para la interonexión de los no dos empleados para la ejeuión en paralelo. Se omprueba que una mala eleión en la red de interonexión puede haer que no se onsiga el ob jetivo deseado de reduir el tiemp o de ejeuión. Comprobamos que este aumento de tiemp o de ejeuión puede llegar a ser onsiderablemente mayor al tiemp o de ejeuión en un únio no do. Por ejemplo, al ejeutar gromas-dp , on 16 no dos, en la red onetada on un hub, obtenemos un tiemp o de ejeuión 60 vees mayor que el tiemp o de ejeuión en un no do. Consideramos que el tiemp o de ómputo de la apliaión es 3320seg (ejeuión para un no do). A partir de este dato haemos una estimaión de la latenia de omuniaión que presenta ada una de las redes, al ejeutar esta apliaión. Los resultados se muestran en la tabla 4.18 Tabla 4.18: gromas_dpp  latenia de omuniaión (seg) n o no dos 1 2 4 8 16 swith100Mbps 0 930 1779 1798 1697 swith10Mbps 0 6925 14549 16372 16237 hub 0 15658 47960 95282 197680 Puede observarse que en las redes onetadas mediante un swith la latenia de omuniaión se duplia al pasar de 2 a 4 no dos mientras que se mantiene onstante on 4, 8 y 16. Por otro lado, la red onetada mediante un hub triplia su latenia de omuniaión al pasar de 2 a 4 no dos y se va dupliando al pasar de 4 a 8 y de 8 a 16. Este omp ortamiento vendrá determinado p or la propia implementaión de la apliaión. Como ya se omentó al prinipio de la seión 4.3, dep endiendo de la implementaión de ada apliaión paralela, y de las araterístias de la red utilizada, la latenia de omuniaión p o día aumentar, mantenerse onstante o inluso disminuir a medida que aumenta el número de no dos. En las guras 4.91 a 4.93, se representa, para ada una de las redes, el tiemp o de latenia de omuniaión, on la referenia del umbral de omuniaión denido al iniio de esta seión. 68 CAPÍTULO 4. RESULTADOS Figura 4.91: gromas-dpp latenia de omuniaión 0 20000 40000 60000 80000 100000 120000 140000 160000 180000 200000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub umbral de comunicacion Figura 4.92: gromas-dpp latenia omuniaión 0 2000 4000 6000 8000 10000 12000 14000 16000 18000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s10 umbral de comunicacion Figura 4.93: gromas-dpp latenia omuniaión 0 500 1000 1500 2000 2500 3000 3500 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 umbral de comunicacion La gráa 4.92 muestra un ejemplo en el que se sup era el umbral máximo 4.3. APLICACIONES 69 de omuniaión, mientras que la gráa 4.93 muestra un ejemplo en el que la latenia de omuniaión se mantiene p or deba jo del umbral. El omp ortamiento observado en estas gráas oinide on los datos que se muestran en las gráas 4.89 y 4.90 en las que se puede omprobar que para la red onetada mediante el swith de 100Mbps mejoramos el tiemp o de ejeuión a medida que aumenta el número de no dos, mientras que en la red del swith de 10Mbps este tiemp o emp eora. Gromas-p oly Ante los elevados tiemp os de ejeuión obtenidos en la apliaión gromas-dpp , se plantean pruebas on un problema de menor tamaño que p ermita evaluar la red wi. Los resultados obtenidos on esta apliaión se muestran en las guras 4.94 a 4.96. Figura 4.94: gromas_poly 0 10000 20000 30000 40000 50000 60000 70000 80000 90000 100000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub wifi Figura 4.95: gromas_poly 0 500 1000 1500 2000 2500 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 70 CAPÍTULO 4. RESULTADOS Figura 4.96: gromas_poly 50 100 150 200 250 300 350 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 Tiemp o de omputo C1 = 66seg Tabla 4.19: gromas_poly latenia de omuniaión n o no dos ( N ) 1 2 4 8 16 swith100Mbps 0 74 83.5 125 297 swith10Mbps 0 668 763 1084 2385 hub 0 1668 4055 10993 43967 wi 0 1461 42526 95511 En este ejemplo p o demos observar que, en ninguna de las redes se mejora el tiemp o de ejeuión de un no do. La sobrearga de omuniaión es muy elevada. Veamos, p or ejemplo (gura 4.97), ómo la latenia de omuniaión en la red del swith de 100Mbps está p or enima del umbral de omuniaión: Figura 4.97: gromas-poly latenia de omuniaión 0 50 100 150 200 250 300 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 umbral de comunicacion A la vista de los resultados obtenidos, p o demos onluir que las redes que 4.3. APLICACIONES 71 habitualmente se utilizan para la ejeuión de apliaiones omo ésta, tienen un mayor anho de banda que ualquiera de las redes que onsideramos. Lammps En el aso de esta otra apliaión paralela real, se ha esogido un ejemplo de tamaño p equeño omo es Lammps-rak . Los resultados obtenidos on esta apliaión se muestran en las guras 4.98 a 4.100. Figura 4.98: lammps_rak 0 5000 10000 15000 20000 25000 30000 35000 40000 45000 50000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub wifi Figura 4.99: lammps_rak 200 400 600 800 1000 1200 1400 1600 1800 2000 2200 2400 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 72 CAPÍTULO 4. RESULTADOS Figura 4.100: lammps_rak 300 320 340 360 380 400 420 440 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 Tiemp o estimado de ómputo para un no do: C1= 332seg Tabla 4.20: lammps_rak. latenia de omuniaión n o no dos ( N ) 2 4 8 16 swith100Mbps 263 288 360 300 swith10Mbps 1992 1336 2244 1846 hub 2233 3414 11904 20803 wi 14765 7028 18051 47521 Figura 4.101: lammps_rak. latenia en omuniaión 0 5000 10000 15000 20000 25000 30000 35000 40000 45000 50000 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub wifi 4.3. APLICACIONES 73 Figura 4.102: lammps_rak. latenia en omuniaión 0 500 1000 1500 2000 2500 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 Figura 4.103: lammps_rak. latenia en omuniaión 0 50 100 150 200 250 300 350 400 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 umbral de comunicacion En la gráa 4.103, al igual que en la gura 4.100, se omprueba que, on 4 y 16 no dos, se redue el tiemp o de ejeuión obtenido para un no do. Como ya se ha omentado anteriormente, dep endiendo de la implementaión de la apliaión paralela, y de las araterístias de la red utilizada, la latenia de omuniaión puede aumentar, mantenerse onstante o inluso disminuir a medida que aumenta el número de no dos. Éste es un ejemplo en el que la latenia de omuniaión aumenta o disminuye en funión del número de no dos. A la vista de las gráas 4.101 a 4.103, p o dríamos deduir que la implementaión de la apliaión lammps-rak hae que la latenia de omuniaión sea notablemente menor uando el número de nodos es uadrado p erfeto. 4.3.2. NPB Los ejemplos que se estudian en esta seión no son apliaiones paralelas reales, aunque el ó digo que ontienen forma parte de gran número de ellas. 80 CAPÍTULO 4. RESULTADOS El estudio realizado on el b enhmark Multi-PingPong (4.2.3) nos sirve ahora para sab er el omp ortamiento que tendrá la op eraión multiqBcastp desrita, dep endiendo de si la red sobre la que se eje- uta p ermite omuniaiones simultáneas o no: multiqBcastp(M n) = (Bcastp(M n), swith q×Bcastp(M n), hub y wi (4.5) Utilizando p or un lado las expresiones 4.4 y 4.5, y p or otro, los tiempos obtenidos en la eje- uión del IMB-Bast (seión 4.2.9), p o demos haer una estimaión del tiemp o empleado para la omuniaión, al ejeutar el algoritmo. Se deb e tener en uenta que al aumentar el número de no dos, el tamaño de mensa je a enviar irá disminuyendo. Por ejemplo, en el aso de una matriz 1000 ×1000 , dado que los datos son números reales en doble preisión, se tiene un tamaño iniial M= 1000 ×1000 ×8Bytes = 8 1,048576 MBytes , que estará repartido entre los no dos, en blo ques de tamaño 8 n×1,048576 MBytes . Los tiemp os obtenidos se muestran en la tabla 4.23. Tabla 4.23: Estimaión de tiemp o de omuniaión. Matriz-1000x1000 n o no dos 2 4 8 16 swith100Mbps 0.69 0.69 0.85 0.68 swith10Mbps 6.79 6.79 8.41 6.93 hub 8.9 16.1 33.5 51.1 wi 18.9 34.9 97.9 121.4 En las guras 4.111 a 4.113 se representan onjuntamente, para su omparaión, los datos mostrados en las tablas 4.22 y 4.23, que se orresp onden on los tiemp os de omuniaión obtenidos on los dos méto dos desritos. 4.3. APLICACIONES 81 Figura 4.111: Comparaión tiemp os omuniaión. swith100Mbps 0 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos latencia comunicacion suma Bcast Figura 4.112: Comparaión tiemp os omuniaión. swith10Mbps 0 1 2 3 4 5 6 7 8 9 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos latencia comunicacion suma Bcast Figura 4.113: Comparaión tiemp os omuniaión. Hub y Wi 0 20 40 60 80 100 120 140 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos latencia comunicacion hub suma Bcast hub latencia comunicacion wifi suma Bcast wifi Puede observarse gran similitud entre las gráas de latenia de omu- 82 CAPÍTULO 4. RESULTADOS niaión , obtenida a partir del tiemp o de ejeuión, y de suma de Bast obtenida para estimar el tiemp o de omuniaión, a partir de la suma de tiemp os de funiones Bast . Sin embargo, en el aso de la red wi, se observa una divergenia entre ambas urvas, que p o dría ser debida, en parte, a irregularidades detetadas en los datos de que se disp one de la ejeuión de IMB-Bast para 2 no dos, y que se muestran a ontinuaión. Tabla 4.24: Datos de la ejeuión de IMB-Bast Bytes 2 no dos (seg) 4 no dos (seg) 65536 127447.01 531953.14 131072 268508.82 1038381.60 262144 507681.01 2012707.11 524288 2082159.21 3979421.08 1048576 4929343.22 7913571.77 2097152 4576611.46 15794822.28 4194304 9910334.23 30419769.94 En los tiemp os prop orionados en la tabla 4.24 se omprueba que, para 4 no dos, la latenia se duplia, aproximadamente, uando también lo hae el tamaño del mensa je (o urre lo mismo para otras redes). Sin embargo, para 2 no dos, el tiemp o orresp ondiente a 524288Bytes es 4 vees el de 262144Bytes (deb ería ser el doble), y el orresp ondiente a 1048576Bytes es mayor que el de 2097152Bytes (deb ería ser la mitad). Matriz 2000x2000 Probamos on un tamaño mayor de matriz, busando que, on ualquiera de las redes de que disp onemos, el tiemp o de ejeuión mejore al aumentar el número de no dos. Los resultados obtenidos on esta apliaión se muestran en las guras 4.114 y 4.115. Figura 4.114: Multipliaión Matriz 2000x2000 0 50 100 150 200 250 300 350 400 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub wifi 4.3. APLICACIONES 83 Figura 4.115: Multipliaión Matriz 2000x2000 0 10 20 30 40 50 60 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 Al aumentar el tamaño de matriz obtenemos el resultado que busábamos para la red onetada on el swith de 10Mbps . Sin embargo, en el aso de las redes hub y wi, el tiemp o de ejeuión sigue aumentando on el número de no dos. Matriz 4000x4000 Consideramos un tamaño mayor, busando mayor es- alabilidad. Figura 4.116: Multipliaión Matriz 4000x4000 0 200 400 600 800 1000 1200 1400 1600 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub wifi 84 CAPÍTULO 4. RESULTADOS Figura 4.117: Multipliaión Matriz 4000x4000 0 50 100 150 200 250 300 350 400 450 500 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 Si bien en este ejemplo se observa que para la red onetada mediante un hub, el tiemp o de ejeuión para 2 no dos es menor que la ejeuión en un sólo no do, al aumentar más aún el número de no dos, vuelve a inrementarse el tiemp o de ejeuión, quedando éste p or enima del valor para un no do. En el aso de la red wi, los tiemp os obtenidos se enuentran siempre p or enima de la ejeuión en un no do. Matriz 8000x8000 Probamos un nuevo tamaño de matriz on el n de aumentar la prop orión entre tiemp o de ómputo frente al de omuniaión, busando mayor esalabilidad. Figura 4.118: Multipliaión Matriz 8000x8000 0 1000 2000 3000 4000 5000 6000 7000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub wifi 4.3. APLICACIONES 85 Figura 4.119: Multipliaión Matriz 8000x8000 0 500 1000 1500 2000 2500 3000 3500 4000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 En este tamaño de matriz se observa esalabilidad hasta 16 no dos, al menos, en las redes onetadas mediante swith, hasta 4 no dos en la red hub, y on 2 no dos en la wi. Multipliaión Matriz on pro esador más lento A la vista de los resultados obtenidos, se omprueba que la esalabilidad que presenta la red onetada mediante un swith de 10Mbps es esasa, y prátiamente nula en las redes hub o wi. Esto nos lleva a preguntarnos ómo sería la omputaión paralela uando las redes de que se disp onía eran más lentas de lo que son hoy en día, y si la falta de esalabilidad observada puede deb erse a que se están ombinando, p or un lado, redes antiguas omo lo es la onetada mediante un hub (wi on omp ortamiento similar a hub) on pro esadores rápidos (relativamente mo dernos). Se plantean nuevas pruebas en las que se ejeuta el algoritmo de la multipliaión, simulando pro esadores más lentos. Para ello se ejeutan, de forma simultánea a la multipliaión, varios programas que onsumen CPU. 86 CAPÍTULO 4. RESULTADOS Figura 4.120: Multipliaión M=1000x1000 + Sobrearga, para Swith 10Mbps 5 10 15 20 25 30 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos 100%CPU 50%CPU 25%CPU Figura 4.121: Multipliaión M=2000x2000 + Sobrearga, para Swith 10Mbps 0 50 100 150 200 250 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos 100%CPU 50%CPU 25%CPU Figura 4.122: Multipliaión M=2000x2000 + Sobrearga, para Hub 50 100 150 200 250 300 350 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos 100%CPU 50%CPU 25%CPU 17%CPU 4.3. APLICACIONES 87 Figura 4.123: Multipliaión M=2000x2000 + Sobrearga, para Wi 50 100 150 200 250 300 350 400 450 500 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos 100%CPU 25%CPU 17%CPU Observamos (guras 4.120 a 4.123) que on ualquiera de las redes, a medida que disminuye la apaidad de ómputo, se onsigue mayor esalabilidad. Esto es debido a que se redue el tiemp o de omuniaión resp eto al de ómputo. Como ya se omentó al prinipio de la seión 4.3, para mejorar el tiemp o de ejeuión al aumentar el número de no dos, el tiemp o añadido debido a la omuniaión deb e ser inferior a la reduión que sufrirá el tiemp o de ómputo omo onseuenia de repartir el trabajo entre más no dos. En las gráas 4.122 y 4.123, orresp ondientes a las redes Hub y Wi, en las que no son p osibles las omuniaiones simultáneas, observamos que uando el pro esador es suientemente lento, o equivalentemente, uando el tiemp o de omuniaión es suientemente p equeño (resp eto al de ómputo), al aumentar el número de no dos disminuye el tiemp o de ejeuión. Aún así, en este aso, sólo esala hasta 4 no dos. Esto se deb e a que, tal omo hemos p o dido omprobar a lo largo del presente estudio, el tiemp o de omuniaión en estas redes ree onsiderablemente on el número de no dos. Por otro lado, el tiemp o de ómputo deree de forma exp onenial, tal omo se vió en la gura 4.87. Por tanto, aún uando se da la ondiión de que el tiemp o añadido de omuniaión es menor que la reduión del tiemp o de ómputo, y dado que éste último deree muy rápidamente, mientras que el primero ree, más o menos rápido, on el número de no dos, la esalabilidad que presentan estas redes es esasa. Estas observaiones p onen de maniesto que, para onseguir esalabilidad en la resoluión de problemas en paralelo, la red utilizada deb e, además de tener un determinado anho de banda, p ermitir omuniaiones simultáneas. 88 CAPÍTULO 4. RESULTADOS Capítulo 5 Conlusiones Tras realizar y analizar los diferentes exp erimentos presentados en esta memoria, p o demos onsiderar que las prinipales onlusiones que se obtienen son: 1. El ob jetivo de la omputaión paralela es reduir el tiemp o de ejeu- ión de apliaiones que preisan una enorme antidad de op eraiones. Su estrategia onsiste en repartir el traba jo a realizar entre distintos no dos pro esadores. Ahora bien, para que varios no dos lleven a ab o un traba jo omún, neesitan omuniarse. Deb e tenerse en uenta que el tiemp o empleado en esa omuniaión se sumará al de ómputo para dar el tiemp o nal de ejeuión de la apliaión paralela. Se deb e p oner un verdadero interés en reduir al máximo la latenia de omuniaión, ya que el éxito o fraaso en la obtenión de un buen tiemp o de ejeuión dep ende, en gran medida, de esta latenia. Una deiente planiaión de la red de interonexión p o dría llevarnos a asos extremos omo el visto en la gura 4.88, en el que una apliaión, que un sólo ordenador ejeutaba en 55 minutos, al ser ejeutada en paralelo, dividiendo el traba jo entre 16 ordenadores, pasaba a tardar 2 días y 7 horas. 2. En el rendimiento inuyen las araterístias de red, no sólo de anho de banda, sino determinadas araterístias que p ermiten obtener ganan- ia de anho de banda. Hemos p o dido omprobar que el heho de que la red p ermita o no omuniaiones simultáneas, inuye en gran medida en la latenia. Si la red utilizada no p ermite ningún tip o de omuni- aión simultánea, no es p osible onseguir gran esalabilidad, ya que la latenia siempre reerá on el número de no dos. En una situaión omo ésta, las únias apliaiones paralelas que presentarían un buen omp ortamiento serían aquellas que tuvieran muy p o a omuniaión, on lo que se limitaría enormemente el p otenial de la omputaión paralela. Po demos deir, p or tanto, que para obtener buenos resultados, 89