Estudio de la influencia de la red de interconexión en la ejecución de aplicaciones paralelas
Full text
U NIVERSIDAD P OLITÉCNICA DE V ALENCIA E SCUELA T ÉCNICA S UPERIOR DE I NFORMÁTICA P ROYECTO F IN DE C ARRERA Estudio de la inuenia de la red de interonexión en la ejeuión de apliaiones paralelas Autora : C armen C amp os G onzález Tutor : D r. F ederio S illa J iménez N oviembre de 2010
2
Índie general 1. Intro duión 5 2. Equip o de pruebas 7 2.1. Computadores........................... 7 2.2. Interonexión ........................... 7 3. Pruebas realizadas 9 3.1. Caraterizaión de las redes . . . . . . . . . . . . . . . . . . . 9 3.2. Benhmarks MPI de Intel . . . . . . . . . . . . . . . . . . . . 9 3.2.1. Benhmars de omuniaión simple . . . . . . . . . . . 10 3.2.2. Benhmarks de omuniaión paralela . . . . . . . . . 11 3.2.3. Comuniaión oletiva . . . . . . . . . . . . . . . . . 12 3.3. Apliaiones............................ 13 3.3.1. Gromas.......................... 13 3.3.2. Lammps.......................... 13 3.3.3. NPB............................ 13 3.3.4. Multipliaión matriial . . . . . . . . . . . . . . . . . 14 4. Resultados 15 4.1. Anho de banda de las redes . . . . . . . . . . . . . . . . . . . 15 4.2. Benhmarks MPI de Intel . . . . . . . . . . . . . . . . . . . . 16 4.2.1. PingPong ......................... 16 4.2.2. PingPing ......................... 18 4.2.3. Multi-PingPong . . . . . . . . . . . . . . . . . . . . . . 20 4.2.4. Multi-PingPing . . . . . . . . . . . . . . . . . . . . . . 26 4.2.5. Sendrev.......................... 34 4.2.6. Conlusiones sobre los resultados de omuniaión paralela ........................... 39 4.2.7. Gather........................... 39 4.2.8. Satter........................... 42 4.2.9. Bast ........................... 45 4.2.10.Redue .......................... 51 4.2.11. RedueSatter . . . . . . . . . . . . . . . . . . . . . . 53 3
4 ÍNDICE GENERAL 4.2.12.Alltoall .......................... 56 4.2.13.Allgather ......................... 60 4.2.14. Conlusiones a los resultados de las pruebas on b en- hmarks MPI de Intel . . . . . . . . . . . . . . . . . . 62 4.3. Apliaiones............................ 63 4.3.1. Gromas.......................... 65 4.3.2. NPB............................ 73 4.3.3. Multipliaión de matries . . . . . . . . . . . . . . . . 77 5. Conlusiones 89
Capítulo 1 Intro duión El primer ob jetivo que se ha p erseguido al diseñar este proyeto n de arrera está relaionado on la formaión del alumno. Se pretende prop orionar a éste un primer ontato on las tareas de investigaión, iniiando su forma- ión en este amp o. Por otro lado, se busa reforzar el dominio del alumno en el manejo de equip os informátios y disp ositivos de red, omplementando así las destrezas adquiridas en la arrera. Para alanzar este doble ob jetivo se ha deidido esoger omo tema de estudio las redes de interonexión en la omputaión paralela. Más onretamente, se va a analizar la inuenia de las mismas en el tiemp o de ejeuión de varias apliaiones paralelas. La omputaión paralela surge debido a las limitaiones de apaidad de álulo que presentan los sistemas monopro esador. En este sentido, la resoluión de problemas que neesitan gran p otenia de ómputo se viene haiendo, desde hae tiemp o, on la ayuda de sistemas multipro esadores, en los que varios elementos traba jan en paralelo. Mediante la omputaión paralela es p osible reduir el tiemp o total de ejeuión, repartiendo la arga de traba jo entre distintos pro esadores, que realizarán de forma simultánea su parte del traba jo. Basiamente hay dos formas de programar las aplia- iones que serán ejeutadas en estos sistemas multipro esador. La primera es haiendo uso del paradigma de memoria ompartida, y la segunda es mediante el paso de mensa jes. En la primera, los diferentes proesos o threads que omp onen la apliaión paralela son un mapa de memoria omún y la omuniaión se realiza de forma implíita aediendo a variables ompartidas. En ambio, uando se usa el paradigma de paso de mensa jes, los pro esos que se omunian lo haen de forma explíita interambiando mensa jes que ontienen los datos que quieren omuniar. El ejemplo más ono ido de este paradigma es el MPI (Message Passing Interfae). Muhos de los sistemas multipro esadores tienen, a menudo, un oste muy elevado, p or lo que ada vez es más habitual utilizar sistemas multipro esadores formados p or lusters de PCs interonetados mediante redes, ya sean redes de altas prestaiones 5
6 CAPÍTULO 1. INTRODUCCIÓN o redes de área lo al estándar. En este aso, lo habitual es usar el paradigma de paso de mensa jes para omuniar los diferentes pro esos. En este ontexto de interés general p or la omputaión paralela, en el presente proyeto n de arrera se ha deidido realizar un estudio sobre las prestaiones que p o dría prop orionar un sistema multipro esador formado on elementos de uso omún y al alane de ualquiera. En onreto, nuestro sistema estará formado p or 16 PCs de sobremesa onvenionales, onetados en red. Para la red de interonexión, se han onsiderado diferentes op iones, to das ellas de uso habitual (o inluso ya en desuso), ba jo oste eonómio y aesibles para ualquiera. Así, las redes esogidas han sido: 1. Red ethernet interonetada mediante un swith de 100Mbps . 2. Red ethernet interonetada mediante un swith de 10Mbps . 3. Red ethernet interonetada mediante un hub de 10Mbps . 4. Red inalámbria on router wi de 54Mbps . Se pretende estudiar el mo do en que las araterístias de las redes utilizadas para la interonexión de PCs pueden inuir en el rendimiento que se obtiene al ejeutar sobre ellos apliaiones paralelas que utilizan paso de mensa jes. Se evaluará el omp ortamiento que presentan las diferentes redes y si éstas son o no adeuadas para la omputaión paralela. Para ello, utilizando las redes desritas, se ejeutará una serie de apliaiones paralelas, implementadas sobre MPI. La medida de los tiemp os de ejeuión de dihas apliaiones, sobre ada una de las redes, servirá para omparar el omp ortamiento que presentan éstas uando se utilizan para omputaión paralela. Como paso previo a la ejeuión de apliaiones reales, se utilizarán los b enhmarks IMB de Intel para realizar un estudio del rendimiento que presenta ada una de las redes en la ejeuión de las distintas funiones MPI. Este estudio dará una primera aproximaión del omp ortamiento de las redes disp onibles al ejeutar apliaiones basadas en MPI. Cab e destaar que en este proyeto no se está prop oniendo el uso de dihas redes para interone- tar los no dos de un luster. Para este n, las tenolgías atuales, omo 1Gb Ethernet, 10 Gb Ethernet o Inniband, son muho más apropiados. En este proyeto se hae uso de las redes menionadas anteriormente p orque son las disp onibles en los lab oratorios do entes del departamento, y p orque a p esar de sus ba jas prestaiones, p ermiten intro duir al proyetando en las lab ores de investigaión, así omo aanzar y ampliar sus ono imientos sobre redes. Estos dos ob jetivos son la meta de este proyeto.
Capítulo 2 Equip o de pruebas La parte exp erimental de este estudio se ha realizado utilizando las instalaiones del lab oratorio do ente de redes de la esuela de informátia. Se han empleado en este estudio 16 PCs. Si bien el lab oratorio uenta on más equip os, dado que el número de los mismos no alanza los 32, se ha optado p or emplear tan sólo los 16 itados, ya que de este mo do nos p ermite mejorar la distribuión del traba jo entre los equip os. 2.1. Computadores Los PCs utilizados tienen las siguientes araterístias: Plaa base dmideode . Pro esador, AMD Athlon 64x2 4800 Memoria, 4GB Sistema op erativo, Kubuntu 8.04 Tarjetas de red: • ethernet 100/1000Mbps (eth0), mo delo NVIDIAnfore . • ethernet 10/100Mbps (eth1), mo delo 3om 3905 . • wi (wlan1), Coneptronis C54RU . 2.2. Interonexión Los disp ositivos de interonexión empleados son: Para la interfaz eth0 se utiliza un swith de 100Mbps , mara 3COM , mo delo 3300 XM . Este swith se utiliza para onetar la red interna del lab oratorio, a internet . 7
8 CAPÍTULO 2. EQUIPO DE PRUEBAS Para la interfaz eth1 se utiliza: un swith de 10Mbps , mara 3COM , mo delo 610, o bien, un hub de 10Mbps mara 3COM , mo delo PS Hub 40 . Para la interfaz wlan1 se utiliza un router wi de 54Mbps , mara ASSUS , mo delo WL500G premium . Los 16 PCs omparten un diretorio en el que está instalado MPI y las apliaiones utilizadas. Este diretorio es exp ortado p or NFS desde un servidor al que se aede a través del swith de 100Mbps .
Capítulo 3 Pruebas realizadas En este apítulo se desrib en las pruebas que se han ejeutado en el presente proyeto, on esp eial atenión a las araterístias de las distintas apliaiones y b enhmarks empleados. 3.1. Caraterizaión de las redes Con el n de ono er las araterístias de anho de banda real en las redes que se utilizan, se plantean pruebas senillas en java on las que se miden tiemp os de envío de heros y anho de banda. En onreto, para ada una de las redes, se realizan 10 envíos de heros de diferentes tamaños (0, 1, 1K, 1M, 10M y 100M bytes) y se mide, para ada uno de ellos, el tiemp o empleado en la transmisión. Dividiendo el tamaño del mensa je entre el tiemp o obtenido, se alula el anho de banda orresp ondiente. 3.2. Benhmarks MPI de Intel (IMB) Estos b enhmarks son un onjunto de kernels elementales que p ermiten evaluar ualquier funión de MPI . Serán utilizados para obtener una omparaión de ba jo nivel entre las redes. Se ejeutaron los siguientes b enhmarks: PingPong PingPing Sendrev Exhange Allredue Redue 9
16 CAPÍTULO 4. RESULTADOS Figura 4.2: Anho banda ( Mbps ) 1 2 3 4 5 6 7 8 9 10 0 10000 20000 30000 40000 50000 60000 70000 80000 90000 100000 Mbps Kbytes fichero switch10 hub wifi En la tabla 4.1 se muestran, a mo do de ejemplo, las medidas de anho de banda que se obtienen en el envío de heros de 10Mbytes . Tabla 4.1: Medida de anho de banda real para heros de 10Mbytes red swith 100Mbps swith 10Mbps hub 10Mbps wi 54Mbps Mbps reales 93,90 9,41 8,82 3,64 En los valores mostrados en la tabla 4.1, se observa que el anho de banda real que presentan las redes utilizadas es algo menor que el nominal en las redes ethernet, mientras que es onsiderablemente menor al nominal en la red inalámbria (6.7 % del anho de banda nominal). 4.2. Benhmarks MPI de Intel En esta seión se exp onen los resultados obtenidos on los benhmarks utilizados, y que se han desrito en el apartado 3.2. 4.2.1. PingPong En las guras 4.3 y 4.4, donde la segunda es un zo om de la primera, se representan las medidas de anho de banda prop orionadas p or el b enhmark IMB-PingPong .
4.2. BENCHMARKS MPI DE INTEL 17 Figura 4.3: PingPong ( Mbytes/seg ) 0 2 4 6 8 10 12 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/seg longitud mensaje (Bytes) switch100 switch10 hub wifi Figura 4.4: PingPong ( Mbytes/seg ) 0 0.2 0.4 0.6 0.8 1 1.2 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/seg longitud mensaje (Bytes) switch10 hub wifi La tabla 4.2 muestra las medidas de anho de banda para envíos de 4Mbytes , que se obtienen utilizando IMB-PingPong : Tabla 4.2: Medida de anho de banda dada por IMB-PingPong (para 4Mbytes ) red swith 100Mbps swith 10Mbps hub 10Mbps wi 54Mbps Mbytes/se 11,20 1,12 0,94 0,38 Mbps 93,95 9,39 7,88 3,19 Comprobamos que los resultados son similares a los obtenidos en la se- ión 4.1, aunque para alguna de las redes se observa que existe p érdida en el anho de banda debido a la sobrearga de MPI . En la tabla 4.3 se muestra la evaluaión de esta p érdida de anho de banda.
18 CAPÍTULO 4. RESULTADOS Tabla 4.3: Pérdida de anho de banda p or sobrearga MPI red swith 100Mbps swith 10Mbps hub 10Mbps wi 54Mbps diferenia Mbps −0,05 0,02 0,93 0,45 % p érdida 0 % 0,2 % 10,5 % 12,3 % Por un lado se observa que la sobrearga que representa MPI es despre- iable en las redes onetadas mediante un swith. Por otro lado, la p érdida de anho de banda no dep ende úniamente del propio anho de banda de la red. Por ejemplo, las redes onetadas on un swith de 10Mbps y on un hub de 10Mbps tienen un anho de banda en omuniaiones punto a punto muy similar, y sin embargo la p érdida que presenta la segunda es signiativamente mayor que la primera. Como veremos más adelante, esto es debido a que las redes onetadas mediante un swith tienen una imp ortante ganania de anho de banda uando se realizan múltiples omuniaiones simultáneas (neesarias para la sinronizaión on MPI ). De forma equivalente puede deirse que la red onetada mediante un hub pierde anho de banda ante omuniaiones paralelas (la red wi tendrá un omp ortamiento similar a la red onetada mediante un hub). 4.2.2. PingPing En las guras 4.5 y 4.6 (la segunda es un zo om de la primera) se muestran los valores de anho de banda bidireional prop orionados p or IMBPingPing . Figura 4.5: PingPing (Mbytes/seg) 0 2 4 6 8 10 12 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/seg longitud mensaje (Bytes) switch10 switch10 hub wifi
4.2. BENCHMARKS MPI DE INTEL 19 Figura 4.6: PingPing (Mbytes/seg) 0 0.2 0.4 0.6 0.8 1 1.2 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/seg longitud mensaje (Bytes) switch10 hub wifi Para heros de 4Mbytes se obtienen las medidas para IMB-PingPong e IMB-PingPing presentadas en la tabla 4.4: Tabla 4.4: Comparaión IMB-PingPong e IMB-PingPing ( Mbytes/sec ) ( Mbps ) swith 100Mbps swith 10Mbps hub 10Mbps wi 54Mbps PingPong 11,20 1,12 0,94 0,38 PingPing 10,57 1,09 0,46 0,27 % p érdida 5,6 % 2,7 % 51,06 % 28,95 % Se observa que en las redes que utilizan un swith para la interonexión, ap enas disminuyen el anho de banda, mientras que la red que utiliza un hub redue el anho de banda a la mitad. Esto es debido a que los swithes presentan omuniaión fullduplex y el hub no. Respeto a la red inalámbria, redue su anho de banda entre un terio y un uarto aproximadamente. Hay que tener en uenta que los datos de anho de banda que prop oriona este b enhmark sólo onsideran uno de los envíos que hae la pareja de no dos, y representa el anho de banda que lo almente detetaría uno de los no dos en su envío. Si se onsiderasen los dos envíos que realiza la pareja de no dos simultaneamente, se observaría una ganania de anho de banda en las redes onetadas on un swith. Pueden haerse dos leturas del mismo heho: una es que, al realizar dos envíos simultáneos las redes on swith mantienen su anho de banda (lo al), mientras que la red on hub redue su anho de banda a la mitad. La otra letura sería que al realizar los dos envíos simultáneos, las redes on swith presentan una ganania en su anho de banda (global), que se duplia. Por el ontrario, en la red onetada on un hub, el anho de banda (global) se mantiene onstante.
20 CAPÍTULO 4. RESULTADOS 4.2.3. Multi-PingPong Swith-100Mbps: Las gráas 4.7 y 4.8 muestran que las urvas resultantes de variar el número de no dos han quedado sup erpuestas, lo ual implia que el número de parejas de no dos que efetuan simultaneamente omuni- aiones punto a punto no inuye en el tiemp o de envío de mensa jes, ni en el anho de banda en ada no do. Este omp ortamiento se deb e al heho de que una red onetada mediante un swith p ermite distintos anales de omuniaión simultánea entre pares. De esta forma, el anho de banda teório puede verse multipliado p or el número de omuniaiones que se dan de forma paralela en un determinado momento. Figura 4.7: Multi-PingPong Swith100Mbps 0 50000 100000 150000 200000 250000 300000 350000 400000 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.8: Multi-PingPong Swith100Mbps 0 2 4 6 8 10 12 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 Veamos on un ejemplo la ganania de anho de banda que se tiene uando efetuamos n omuniaiones de forma paralela. Calularemos el an- ho de banda del sistema uando 2n no dos ejeutan simultaneamente IMBPingPong, para un envío de x= 4Mbytes :
4.2. BENCHMARKS MPI DE INTEL 21 Indep endientemente del valor de n , el tiemp o obtenido al ejeutar IMBMultiPingPong es aproximadamente t= 356600µs . Así, p or ada pareja, en t= 356600µs se envían x= 4Mbytes . Por tanto el anho de banda global ( ABG ) del sistema viene dado p or la expresión: ABG =n∗4∗1048576Bytes 356600µs =n∗4∗8∗1048576bits 356600 ∗10−6s=n∗94Mbps Tabla 4.5: ABG - MultiPingPong on Swith100Mbps n o no dos 2 4 8 16 n 1 2 4 8 ABG(Mbps) 94 188 376 752 La tabla 4.5 muestra ómo el anho de banda global ree de forma prop orional al número de omuniaiones punto a punto simultáneas entre pares de no dos. Nótese que no ha habido p érdida de generalidad al efetuar los álulos para un determinado tamaño de envío ( x= 4Mbytes ). Tal omo muestra la gráa 4.7, el tiemp o ree de forma lineal on el tamaño de envío, p or lo que los resultados obtenidos habrían sido los mismos si onsideramos otro tamaño de envío, on su latenia orresp ondiente. Swith-10Mbps: Las gráas 4.9 y 4.10 muestran que la red onetada mediante un swith de 10Mbps presenta un omp ortamiento similar al de la red onetada mediante un swith de 100Mbps . Indep endientemente del valor de n (número de omuniaiones punto a punto simultáneas) los tiemp os obtenidos al ejeutar IMB-PingPong en ada uno de los pares es aproximadamente el mismo para to dos ellos. Figura 4.9: Multi-PingPong Swith10Mbps 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2
22 CAPÍTULO 4. RESULTADOS Figura 4.10: Multi-PingPong Swith10Mbps 0 0.2 0.4 0.6 0.8 1 1.2 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 De forma similar al ejemplo anterior, para estimar la ganania de anho de banda que se pro due al tener omuniaiones simultáneas, alulamos el anho de banda global del sistema ( ABG ). Para ello onsideramos, sin p érdida de generalidad, un tamaño de envío x= 4Mbytes . La latenia para este valor de x es, aproximadamente, t= 3545530µs indep endientemente del número de no dos impliados en la omuniaión. El anho de banda global vendrá dado p or la expresión: ABG =n∗4Mbytes 3545530µs =n∗4∗8∗1048576bits 3545530 ∗10−6s=n∗9,4Mbps Tabla 4.6: ABG -MultiPingPong on Swith10Mbps n o no dos 2 4 8 16 n 1 2 4 8 ABG(Mbps) 9,4 18,8 37,6 75,2 A la vista de la tabla 4.6, se omprueba, de nuevo, que uando para la interonexión se utiliza un swith, el heho de que haya omuniaiones simultáneas hae que aumente el anho de banda global . Se observa que los valores de anho de banda obtenidos para la red onetada mediante el swith de 100Mbps son 10 vees los obtenidos para la red onetada mediante el swith de 10Mbps . Hub: Con las guras 4.11 y 4.12 se puede omprobar que el omp ortamiento que presenta la red onetada mediante un hub es diferente al de las redes onetadas mediante un swith. En el aso del hub, se observa que el tiemp o de envío y el anho de banda obtenidos varían on el número de
4.2. BENCHMARKS MPI DE INTEL 23 no dos: al dupliar el número de no dos se duplia el tiemp o de envío y el anho de banda (lo al) se redue a la mitad. Figura 4.11: Multi-PingPong Hub 0 5e+06 1e+07 1.5e+07 2e+07 2.5e+07 3e+07 3.5e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.12: Multi-PingPong Hub 0 0.2 0.4 0.6 0.8 1 1.2 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 Calularemos el anho de banda del sistema uando 2n no dos ejeutan simultaneamente IMB-PingPong y omprobaremos que en este aso no se pro due la ganania de los asos anteriores. Como puede observarse en la gráa 4.11, para un envío de x= 4Mbytes , la latenia ( tn ), dep ende del número de omuniaiones simultáneas ( n ) que hay en un momento dado. El anho de banda global del sistema viene dado p or la expresión: ABG =n∗4Mbytes tnµs =n∗4∗8∗1048576bits tn∗10−6s
24 CAPÍTULO 4. RESULTADOS Tabla 4.7: ABG - MultiPingPong on Hub10Mbps n o no dos 2 4 8 16 n 1 2 4 8 latenia ( µs ) 4363298 8040792 15846112 31202804 ABG (Mbps) 7,69 8,34 8,47 8,60 Con los datos de la tabla 4.7 omprobamos que, en el aso de utilizar un hub para la interonexión, el anho de banda global no aumenta al aumentar el número de onexiones simultáneas, sino que se mantiene onstante. Se hae notar que en este aso tamp o o ha habido p érdida de generalidad al onsiderar un tamaño onreto de mensa je ya que al igual que en los otros asos, para un valor de n dado, el tiemp o de envío es diretamente prop orional al tamaño de mensa je. Wi: Las gráas orresp ondientes a la red wi (4.13 y 4.14) muestran un omp ortamiento bastante pareido al de la red onetada mediante un hub. Es deir esta red pierde anho de banda en ada no do a medida que aumenta el número de omuniaiones simultáneas. Figura 4.13: Multi-PingPong Wi 0 5e+06 1e+07 1.5e+07 2e+07 2.5e+07 3e+07 3.5e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2
4.2. BENCHMARKS MPI DE INTEL 25 Figura 4.14: Multi-PingPong Wi 0 0.05 0.1 0.15 0.2 0.25 0.3 0.35 0.4 0.45 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 Realizamos, para la red inalámbria, álulos análogos a los realizados para las otras redes. Consideramos envíos simultáneos de x= 4Mbytes : ABG =n∗4Mbytes tnµs =n∗4∗8∗1048576bits tn∗10−6s Tabla 4.8: ABG - MultiPingPong on Wi n o no dos 2 4 8 16 n 1 2 4 8 latenia ( µs ) 10464152 15195967 23351171 32669240 ABG (Mbps) 3,20 4,42 5,75 8,22 Aunque se observa (tabla 4.8) que el anho de banda global aumenta on el número de omuniaiones simultáneas, no se trata de un aumento omparable al observado en las redes onetadas mediante un swith, sino que se trata de un p equeño aumento, más pareido al observado en el aso del hub. En la guras 4.15 y 4.16 (la segunda es un zo om de la primera) se omparan los tiemp os obtenidos al ejeutar IMB-MultiPingPong sobre ada una de las redes onsideradas, para un tamaño de mensa je de 4MBytes . A la vista de éstas, se omprueba, de nuevo, el efeto que tiene el número de omuni- aiones simultáneas sobre el tiemp o neesario para llevarlas a ab o. Vemos ómo este tiemp o se mantiene onstante en las redes onetadas mediante un swith y ómo aumenta de forma prop orional al número de omuniaiones en el aso del hub. Resp eto a la red wi, en prinipio paree omp ortarse de forma bastante similar a la red onetada mediante un hub, p ero, tal vez debido a la elevada variabilidad detetada en la red wi, no es p osible onluir nada denitivo al resp eto.
32 CAPÍTULO 4. RESULTADOS La latenia y el anho de banda (lo al) varía on el número de no dos. Al dupliar el número de no dos se duplia la latenia y se redue el anho de banda a la mitad. El anho de banda en ada no do es la mitad que el obtenido para IMB-MultiPingPong . El anho de banda global no varía on el número de nodos y oinide on el obtenido para IMB-MultiPingPong . Wi: Las guras 4.25 y 4.26 muestran el omp ortamiento que presenta esta red al ejeutar IMB-MultiPingPing . Figura 4.25: Multi-PingPing Wi 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 7e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.26: Multi-PingPing Wi 0 0.05 0.1 0.15 0.2 0.25 0.3 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 Se realizan, para la red wi, álulos del anho de banda global oresp ondiente a la funión IMB-MultiPingPing , de forma similar a los efetuados para las otras redes. Los resultados obtenidos se muestran en la tabla 4.12.
4.2. BENCHMARKS MPI DE INTEL 33 Tabla 4.12: ABG - MultiPingPing on wi n o no dos 2 4 8 16 n 1 2 4 8 latenia ( µs ) 14852572 26204922 38200406 60618160 ABG (Mbps) 4,5 5,12 7,02 8,8 En las guras 4.27 y 4.28, en las que se ompara el omp ortamiento de las ditintas redes al ejeutar IMB-MultiPingPing para un tamaño de mensa je de 4MBytes , observamos que el tiemp o de envío se mantiene onstante al variar el número de no dos en las redes onetadas p or un swith, mientras que varía en las otras dos. En el aso del hub la variaión es lineal. En el aso de la red wi, aunque aparenta un omp ortamiento similar al de la red on hub, la variaión no presenta una tendenia lara. Figura 4.27: Multi-PingPing , omparaión para 4MBytes 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 7e+07 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 hub wifi Figura 4.28: Multi-PingPing , omparaión para 4MBytes 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10
34 CAPÍTULO 4. RESULTADOS 4.2.5. Sendrev Con el n de analizar el omp ortamiento que presentan las distintas redes al ejeutar IMB-Sendrev , en las guras 4.29 a 4.36 se muestran los resultados obtenidos en la ejeuión de diho b enhmark sobre ada una de las redes. Figura 4.29: Sendrev Swith100Mbps 0 100000 200000 300000 400000 500000 600000 700000 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.30: Sendrev Swith100Mbps 0 5 10 15 20 25 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2
4.2. BENCHMARKS MPI DE INTEL 35 Figura 4.31: Sendrev Swith10Mbps 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.32: Sendrev Swith10Mbps 0 0.5 1 1.5 2 2.5 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.33: Sendrev Hub 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 7e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2
36 CAPÍTULO 4. RESULTADOS Figura 4.34: Sendrev Hub 0 0.2 0.4 0.6 0.8 1 1.2 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.35: Sendrev Wi 0 2e+07 4e+07 6e+07 8e+07 1e+08 1.2e+08 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.36: Sendrev Wi 0 0.1 0.2 0.3 0.4 0.5 0.6 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 Mbytes/s longitud mensaje (Bytes) N16 N8 N4 N2 Para el álulo del anho de banda global (orresp ondiente a N no dos),
4.2. BENCHMARKS MPI DE INTEL 37 se onsidera que en un tiemp o tN se realizan N envíos de x= 4Mbytes . Los resultados se muestran en las tablas 4.13 a 4.16 ABG =N∗4Mbytes tNµs =N∗4∗8∗1048576 tN∗10−6Mbps Tabla 4.13: ABG -Sendrev on Swith100Mbps n o no dos ( N ) 2 4 8 16 latenia ( µs ) 679481 399195 402837 437136 ABG (Mbps) 99 336 666 1228 Tabla 4.14: ABG -Sendrev on Swith10Mbps n o no dos ( N ) 2 4 8 16 latenia ( µs ) 3673248 3849091 3751472 3980619 ABG (Mbps) 18,26 34,87 71,55 134,87 Tabla 4.15: ABG -Sendrev on Hub10Mbps n o no dos ( N ) 2 4 8 16 latenia ( µs ) 8681823 17237575 32993052 64428851 ABG (Mbps) 7,73 7,78 8,13 8,33 Tabla 4.16: ABG -Sendrev on Wi n o no dos ( N ) 2 4 8 16 latenia ( µs ) 15285366 35564079 56214253 119075487 ABG (Mbps) 4,39 3,77 4,77 4,5 Observamos que los resultados obtenidos son muy similares a los obtenidos para IMB-MultiPingPing (seión 4.2.4). Se haen las siguientes anotaiones: Las gráas 4.29 y 4.30, que haen referenia a la red onetada mediante un swith de 100Mbps , muestran un omp ortamiento inesp erado para 2 no dos que p o dría ser debido a alguna anomalía de fun- ionamiento del swith de 100Mbps omo la que se detetó en IMBMultiPingPing . Para onrmar esta sup osiión, omprobamos que la
38 CAPÍTULO 4. RESULTADOS red onetada mediante un swith de 10Mbps no presenta ese omp ortamiento. Se observa ierta variabilidad, on el número de no dos, en las redes onetadas mediante un swith, que p o dría ser debida al heho de que aunque la funión MPI-Sendrev se omp one de un onjunto de fun- iones MPI-Isend y MPI-Irev (igual que IMB-MultiPingPing ), para llevarla a ab o se preisa una o ordinaión adiional entre to dos los no dos. Los datos de anho de banda que prop oriona este b enhmark tienen en uenta dos envíos p or no do, mientras que IMB-MultiPingPing sólo onsidera uno de ellos. Esto hae que los valores de anho de banda que prop oriona IMB-Sendrev sean el doble que los de IMBMultiPingPing . En este ejemplo la red wi muestra un omp ortamiento análogo al de la red onetada on un hub: • En las gráas 4.35 y 4.36 se observa que al dupliar el número de no dos se duplia la latenia mientras que el anho de banda (lo al) se redue a la mitad. • El anho de banda global se mantiene onstante al variar el número de no dos (tabla 4.16). Figura 4.37: Sendrev , omparaión para 4MBytes 0 2e+07 4e+07 6e+07 8e+07 1e+08 1.2e+08 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 Hub Wifi
4.2. BENCHMARKS MPI DE INTEL 39 Figura 4.38: Sendrev , omparaión para 4MBytes 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 Las gráas que se muestran en las guras 4.37 y 4.38 son similares a las obtenidas para IMB-MultiPingPing (Fig. 4.27). Aunque en este aso paree onrmarse la similitud, que no había p o dido ser determinada en otros ejemplos, entre el omp ortamiento de la red wi y la red que utiliza un hub. 4.2.6. Conlusiones sobre los resultados de omuniaión paralela La idea prinipal que extraemos tras el análisis de los b enhmarks que estudian las omuniaiones paralelas, es que las redes que utilizan un swith para la interonexión mejoran onsiderablemente su rendimiento ante omuniaiones simultáneas, mientras que no es así para las que utilizan un hub o wi. Las redes onetadas mediante un swith obtienen una imp ortante ganan- ia de anho de banda uando se llevan a ab o omuniaiones simultáneas entre parejas de no dos. Esto es debido a que un swith p ermite varios anales de omuniaión simultáneos. No o urre lo mismo en la red onetada on un hub ni en la red wi. Po dría deirse que dado que en estas redes no son p osibles los envíos simultáneos, ante ualquier intento de omuni- aión en paralelo, ésta quedaría serializada. Las transmisiones se ordenan transformando una omuniaión paralela en seuenial. 4.2.7. Gather Pasamos a analizar el primer ejemplo de omuniaión oletiva.
40 CAPÍTULO 4. RESULTADOS Figura 4.39: Gather Swith100Mbps 0 1e+06 2e+06 3e+06 4e+06 5e+06 6e+06 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.40: Gather Swith10Mbps 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.41: Gather Hub 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 7e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2
4.2. BENCHMARKS MPI DE INTEL 41 Figura 4.42: Gather Wi 0 2e+07 4e+07 6e+07 8e+07 1e+08 1.2e+08 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 En este ejemplo, tal omo puede observarse en las guras 4.39 a 4.42, las uatro redes muestran el mismo omp ortamiento: La latenia ree linealmente on el tamaño de envío (retas) y es prop orional al número de no dos. Este omp ortamiento oinide on el que hasta ahora presentaba la red onetada mediante un hub. Cuando N no dos invo an la funión MPI-Gather, se llevan a ab o N−1 envíos de datos desde diferentes no dos a un no do maestro ( N0 ). Por otro lado, en ualquiera de las redes que estudiamos, dado que los envíos se realizan to dos a un mismo no do N0 , éste sólo p o drá reibir datos de uno de los no dos en un momento determinado. Es deir, los envíos no p o drán ser simultáneos en ningún aso, siempre serán seueniales. Este heho hae que, al ejeutar MPI-Gather , las redes onetadas mediante un swith no tengan en este aso ganania alguna y presenten el mismo omp ortamiento que las otras redes. Figura 4.43: Gather , omparaión para 4MBytes 0 2e+07 4e+07 6e+07 8e+07 1e+08 1.2e+08 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 hub wifi
48 CAPÍTULO 4. RESULTADOS El razonamiento anterior p o dría justiar el heho de que en las gráas 4.51 y 4.52 la latenia no varíe de forma lineal al variar el tamaño de envío. En ellas observamos que, omo era de esp erar, para 2 no dos la latenia sí ree de forma lineal on el tamaño del envío. Por otro lado, las urvas orresp ondientes a 4, 8 y 16 no dos están aproximadamente omprendidas entre la gráa que se orresp onde on 2 no dos, y el doble de ésta. Esto se deb e a que mediante la división del mensa je original, tal omo se ha expliado antes, se onsigue que el tiemp o de envío no sup ere 2tx , siendo tx el tiemp o neesario para enviar el mensa je original de un no do a otro. En la gráa 4.55 se muestra de nuevo la gráa 4.51, a la que se le ha añadido, a mo do de referenia, la línea 2×N2 obtenida multipliando p or 2 la línea orresp ondiente a 2 no dos. Figura 4.55: Swith100Mbps /Bast 0 100000 200000 300000 400000 500000 600000 700000 800000 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 2*N2 A ontinuaión se desrib e, de una forma aproximada, un p osible mo do en que se dividirían los mensa jes iniiales, dep endiendo del tamaño de éstos y del número de no dos, para obtener una gráa similar a la representada en la gura 4.55. Consideremos la fórmula, para N no dos, que nos p ermite alular el tiemp o de envío neesario uando se divide un mensa je de tamaño x en q partes: t= log2(qN)tq= log2(qN)tx q (4.3) 16-no dos: Para un tamaño de mensa je x , menor y próximo a 262144bytes , la urva de 16 no dos está p or enima de línea 2×N2 , aunque aparentemente no se aleja demasiado. Posiblemente para estos valores de x el mensa je se divide en 2 para mejorar el rendimiento. Utilizando la euaión (4.3) on N= 16 y q= 2 tendremos t= log2(32) tx 2=5 2tx= 2,5tx . Este valor expliaría que la urva esté ligeramente p or enima de la línea 2×N2 . Para x= 524288bytes la urva ba ja p or deba jo de la línea de referenia 2×N2 . En este aso, se habría pro duido una nueva división
4.2. BENCHMARKS MPI DE INTEL 49 de mensa jes y se tendría N= 16 y q= 4 . Apliando la fórmula (4.3) nuevamente, tendremos t= log2(64) tx 4=6 4tx= 1,5tx . A la vista de la gráa 4.55 paree laro, sin embargo, que la reduión de la latenia es mayor, p or lo que el valor de q tendría que ser mayor que el supuesto. Si tomamos q= 8 tendríamos t=7 8tx= 0,9tx que paree a justarse mejor a la urva. Se hae notar que aunque t= 0,9tx sup ondría que la urva orresp ondiente a 16 no dos estuviera p or deba jo de la de 2 no dos, esto no suede debido a la sobrearga que indudablemente se añade al dividir el mensa je original en 8 nuevos mensa jes. 8-no dos: Para un tamaño de mensa je x menor de 2097152bytes , la urva de 8 no dos es similar a la línea 2×N2 . Esto se onsigue dividiendo el mensa je original entre 2. En efeto, si onsideramos la euaión 4.3 on N= 8 y q= 2 obtenemos t= log2(16) tx 2=4 2tx= 2tx , tal omo se esp eraba. Para x= 4194304bytes vuelve a hab er una nueva división. Tomamos N= 8 y q= 4 y obtenemos t= 1,25tx que se a justa (onsiderando la sobrearga) a lo observado en la gráa. 4-no dos: Para este número de no dos, la primera división de mensa je se hae para x= 2097152bytes . Considerando N= 4 , q= 2 se tiene t= 1,5tx que no oinide on lo observado. Tomando N= 4 , q= 4 se tiene t= 1tx , que una vez onsiderada la sobrearga orresp ondiente, sí se a justa a la urva de 4 no dos. Se hae notar que dado que la red onetada mediante un hub seuenializa ualquier intento de omuniaión simultánea, no va a obtener niguna venta ja de la implementaión de la funión bast . Aunque los mensa jes se dividan, no se enviarán de forma simultánea, sino que serán enviados uno tras otro. En el aso de esta red, esta implementaión emp eora p or tanto los tiemp os de latenia ya que la sobrearga añadida p or la fragmentaión de los mensa jes, no se ve omp ensada en mo do alguno. Resp eto a la red wi tiene un omp ortamiento análogo a la red onetada on un hub, on el inonveniente añadido de que la sobrearga paree ausarse más en esta red. El estudio del mo do en que la funión MPI-bast ha sido implementada, nos p ermite deduir que la versión de MPI que utilizamos no ha sido diseñada para ser ejeutada utilizando una red del tip o hub o wi.
50 CAPÍTULO 4. RESULTADOS Figura 4.56: Bast, omparaión para 4MBytes 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 7e+07 8e+07 9e+07 1e+08 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 hub wifi Figura 4.57: Bast, omparaión para 4MBytes 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 5e+06 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 Figura 4.58: Bast, omparaión para 4MBytes 360000 380000 400000 420000 440000 460000 480000 500000 520000 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 En este ejemplo, en el que la latenia no varía linealmente on el tamaño
4.2. BENCHMARKS MPI DE INTEL 51 de envío, no se puede generalizar a partir de datos partiulares, orresp ondientes a un determinado tamaño de mensa je. Las gráas anteriones (4.56 a 4.58) p osiblemente variarían de forma onsiderable al onsiderar otro tamaño de mensa je. Es de destaar que la implementaión de la funión MPI-Bast no aproveha la apaidad de broadast de las redes ethernet. Esto se dedue al observar que el número de no dos inuye en la latenia. 4.2.10. Redue Este ejemplo es similar a bast en el heho de presentar omuniaiones tanto paralelas omo seueniales. Figura 4.59: Swith100Mbps /Redue 0 100000 200000 300000 400000 500000 600000 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.60: Swith10Mbps /Redue 0 1e+06 2e+06 3e+06 4e+06 5e+06 6e+06 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2
52 CAPÍTULO 4. RESULTADOS Figura 4.61: Hub/Redue 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.62: Wi/Redue 0 2e+07 4e+07 6e+07 8e+07 1e+08 1.2e+08 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.63: Redue, omparaión para 4MBytes 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 hub wifi
4.2. BENCHMARKS MPI DE INTEL 53 Figura 4.64: Redue, omparaión para 4MBytes 0 1e+06 2e+06 3e+06 4e+06 5e+06 6e+06 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 Figura 4.65: Redue, omparaión para 4MBytes 360000 380000 400000 420000 440000 460000 480000 500000 520000 540000 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 Nuevamente los swith presentan, amb os, la misma forma de gráa que vendrá determinada p or la forma en que está heha la implementaión de la funión redue . Muy p osiblemente en forma de árb ol, de forma similar a la funión bast (seión 4.2.9). Se hae notar que en este aso se observa un p eor rendimiento para 8 no dos, igual que suedía en la funión bast . 4.2.11. RedueSatter La funión MPI-Reduesatter lleva a ab o una op eraión redue seguida de otra satter . Como es de esp erar, se observa que las gráas de esta funión son una ombinaión de las dos op eraiones de que onsta. Los tiemp os mostrados en estas gráas resultan de sumar los tiemp os orresp ondientes a las gráas de las funiones Satter (4.2.8) y Redue (4.2.10), teniendo en uenta que uando se ejeuta Reduesatter para un tamaño de mensa je x
54 CAPÍTULO 4. RESULTADOS determinado, se ejeuta Redue para un tamaño x y Satter para un tamaño x N , siendo N el número de no dos. Figura 4.66: Swith100Mbps /RedueSatter 0 100000 200000 300000 400000 500000 600000 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.67: Swith10Mbps /RedueSatter 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 5e+06 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2
4.2. BENCHMARKS MPI DE INTEL 55 Figura 4.68: Hub/RedueSatter 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 7e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.69: Wi/RedueSatter 0 2e+07 4e+07 6e+07 8e+07 1e+08 1.2e+08 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.70: RedueSatter, omparaión para 4MBytes 0 2e+07 4e+07 6e+07 8e+07 1e+08 1.2e+08 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 hub wifi
56 CAPÍTULO 4. RESULTADOS Figura 4.71: RedueSatter, omparaión para 4MBytes 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 5e+06 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 switch10 Figura 4.72: RedueSatter, omparaión para 4MBytes 150000 200000 250000 300000 350000 400000 450000 500000 550000 2 4 6 8 10 12 14 16 latencia (microseg) nodos switch100 4.2.12. Alltoall En seiones anteriores hemos omprobado que uando las omuniaiones generadas en la ejeuión de una determinada funión se haen de forma seuenial (omo o urre siempre en la red onetada mediante el hub y en la red wi), la latenia es prop orional al número de mensa jes que se envían. Dado que en to dos los ejemplos vistos hasta ahora los mensa jes enviados oinidían on el número de no dos, se hablaba, de forma equivalente, de que la latenia era prop orional al número de no dos, uando en realidad se refería al número de mensa jes enviados. En este ejemplo, tendremos presente que en la ejeuión de la funión Al ltoal l el número de mensa jes enviados no oinide on el de no dos. En la ejeuión de la funión MPI-Al ltoal l ada no do envía un mensa je, en prinipio diferente, a ada uno de los no dos restantes. Esto sup one que si la funión es invo ada p or N no dos, para su ejeuión se genera un total de N2 mensa jes.
4.2. BENCHMARKS MPI DE INTEL 57 Figura 4.73: Al ltoal l Swith100Mbps 0 1e+06 2e+06 3e+06 4e+06 5e+06 6e+06 7e+06 8e+06 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.74: Al ltoal l Swith10Mbps 0 1e+07 2e+07 3e+07 4e+07 5e+07 6e+07 7e+07 8e+07 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2 Figura 4.75: Al ltoal l Hub 0 1e+08 2e+08 3e+08 4e+08 5e+08 6e+08 7e+08 8e+08 9e+08 1e+09 0 500000 1e+06 1.5e+06 2e+06 2.5e+06 3e+06 3.5e+06 4e+06 4.5e+06 latencia (microseg) longitud mensaje (Bytes) N16 N8 N4 N2
64 CAPÍTULO 4. RESULTADOS Con el n de failitar el análisis de los resultados obtenidos en las distintas pruebas realizadas, se haen las siguientes sup osiiones: 1. El tiemp o que la apliaión neesita para efetuar sus op eraiones (tiemp o de ómputo C1 ) es el tiemp o que se obtiene al ejeutar la apliaión para un no do ( N= 1 ). 2. Al ejeutar la apliaión en n no dos, el tiemp o de omputo en uno de los no dos ( Cn ) viene dado p or la expresión Cn=C1 n , es deir el tiemp o de ómputo se reparte entre los distintos no dos. 3. Estimamos el tiemp o empleado en omuniaión, omo la diferenia entre el tiemp o de ejeuión y el de ómputo. Esta estimaión se reere al tiemp o mínimo de omuniaión, ya que, en algunos asos estos tiemp os p o drían solaparse, on lo que el tiemp o de omuniaión real sería aún mayor. Estas sup osiiones nos p ermiten desglosar el tiemp o de ejeuión en tiemp o de ómputo y tiemp o de omuniaión entre los distintos no dos. De esta forma, p o dremos evaluar la sobrearga que sup one la omuniaión en el tiemp o de ejeuión. Como hemos visto en la seión 4.2, hay varios fatores que inuyen en la latenia de las funiones MPI . Estos pueden resumirse en: 1. Caraterístias de la red. Prinipalmente, anho de banda y si p ermite omuniaiones simultáneas. 2. Tip o de omuniaión. Por ejemplo, ante una omuniaión seuen- ial, no habrá diferenia entre la red que p ermite las omuniaiones paralelas de aquella que no las p ermite. 3. Tamaño del mensa je a enviar. En la seión 4.2 se ha p o dido omprobar que para ualquiera de las funiones estudiadas, indep endientemente de la red o del número de no dos, la latenia aumenta on el tamaño del mensa je a enviar. Considerando una red onreta, para analizar la evoluión que la latenia de omuniaión presenta al aumentar el número de no dos, tendremos en uenta, p or un lado, que la latenia puede aumentar (o no) debido al aumento del número de omuniaiones. Por otro, que la latenia p o dría disminuir si el aumento de no dos onlleva la reduión del tamaño de los mensa jes. Como onseuenia, el aumento o no de la latenia de omuniaión, dep enderá, en gran medida, de las araterístias de la apliaión. El ob jetivo de la omuniaión paralela es reduir el tiemp o de ejeu- ión de las apliaiones. Esto se pro duirá si la disminuión en el tiemp o de ómputo puede omp ensar el p osible aumento de la latenia de omuniaiones. En la gura 4.87 se muestra, p or un lado, el mo do en que disminuye el
4.3. APLICACIONES 65 tiemp o de ejeuión al aumentar el número de no dos, y p or otro, el umbral máximo para la latenia de omuniaión, que no deb erá ser sobrepasado para obtener tiemp os inferiores a la ejeuión en un únio no do. Figura 4.87: Evoluión del tiemp o de ómputo y del umbral de latenia de omuniaión 0 0.2 0.4 0.6 0.8 1 2 4 6 8 10 12 14 16 18 20 tiempo nodos computo comunicacion Las apliaiones que hemos utilizado para el presente estudio son las siguientes: 1. Gromas 2. Lammps 3. NBP 4. Multipliaión matriial 4.3.1. Gromas Para esta apliaión se han onsiderado dos ejemplos (dpp y p oly) de distinto tamaño. Gromas-dpp Este es el ejemplo de apliaión paralela real de mayor tamaño que se ha utilizado. Los resultados obtenidos on esta apliaión se muestran en las guras 4.88 a 4.90.
66 CAPÍTULO 4. RESULTADOS Figura 4.88: gromas_dpp 0 20000 40000 60000 80000 100000 120000 140000 160000 180000 200000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub Figura 4.89: gromas_dpp 0 2000 4000 6000 8000 10000 12000 14000 16000 18000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 Figura 4.90: gromas_dpp 1800 2000 2200 2400 2600 2800 3000 3200 3400 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 A la vista de estos primeros datos de ejeuión de apliaiones reales, se
4.3. APLICACIONES 67 p one de maniesto la imp ortania que tiene la red utilizada para la interonexión de los no dos empleados para la ejeuión en paralelo. Se omprueba que una mala eleión en la red de interonexión puede haer que no se onsiga el ob jetivo deseado de reduir el tiemp o de ejeuión. Comprobamos que este aumento de tiemp o de ejeuión puede llegar a ser onsiderablemente mayor al tiemp o de ejeuión en un únio no do. Por ejemplo, al ejeutar gromas-dp , on 16 no dos, en la red onetada on un hub, obtenemos un tiemp o de ejeuión 60 vees mayor que el tiemp o de ejeuión en un no do. Consideramos que el tiemp o de ómputo de la apliaión es 3320seg (ejeuión para un no do). A partir de este dato haemos una estimaión de la latenia de omuniaión que presenta ada una de las redes, al ejeutar esta apliaión. Los resultados se muestran en la tabla 4.18 Tabla 4.18: gromas_dpp latenia de omuniaión (seg) n o no dos 1 2 4 8 16 swith100Mbps 0 930 1779 1798 1697 swith10Mbps 0 6925 14549 16372 16237 hub 0 15658 47960 95282 197680 Puede observarse que en las redes onetadas mediante un swith la latenia de omuniaión se duplia al pasar de 2 a 4 no dos mientras que se mantiene onstante on 4, 8 y 16. Por otro lado, la red onetada mediante un hub triplia su latenia de omuniaión al pasar de 2 a 4 no dos y se va dupliando al pasar de 4 a 8 y de 8 a 16. Este omp ortamiento vendrá determinado p or la propia implementaión de la apliaión. Como ya se omentó al prinipio de la seión 4.3, dep endiendo de la implementaión de ada apliaión paralela, y de las araterístias de la red utilizada, la latenia de omuniaión p o día aumentar, mantenerse onstante o inluso disminuir a medida que aumenta el número de no dos. En las guras 4.91 a 4.93, se representa, para ada una de las redes, el tiemp o de latenia de omuniaión, on la referenia del umbral de omuniaión denido al iniio de esta seión.
68 CAPÍTULO 4. RESULTADOS Figura 4.91: gromas-dpp latenia de omuniaión 0 20000 40000 60000 80000 100000 120000 140000 160000 180000 200000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub umbral de comunicacion Figura 4.92: gromas-dpp latenia omuniaión 0 2000 4000 6000 8000 10000 12000 14000 16000 18000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s10 umbral de comunicacion Figura 4.93: gromas-dpp latenia omuniaión 0 500 1000 1500 2000 2500 3000 3500 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 umbral de comunicacion La gráa 4.92 muestra un ejemplo en el que se sup era el umbral máximo
4.3. APLICACIONES 69 de omuniaión, mientras que la gráa 4.93 muestra un ejemplo en el que la latenia de omuniaión se mantiene p or deba jo del umbral. El omp ortamiento observado en estas gráas oinide on los datos que se muestran en las gráas 4.89 y 4.90 en las que se puede omprobar que para la red onetada mediante el swith de 100Mbps mejoramos el tiemp o de ejeuión a medida que aumenta el número de no dos, mientras que en la red del swith de 10Mbps este tiemp o emp eora. Gromas-p oly Ante los elevados tiemp os de ejeuión obtenidos en la apliaión gromas-dpp , se plantean pruebas on un problema de menor tamaño que p ermita evaluar la red wi. Los resultados obtenidos on esta apliaión se muestran en las guras 4.94 a 4.96. Figura 4.94: gromas_poly 0 10000 20000 30000 40000 50000 60000 70000 80000 90000 100000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub wifi Figura 4.95: gromas_poly 0 500 1000 1500 2000 2500 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10
70 CAPÍTULO 4. RESULTADOS Figura 4.96: gromas_poly 50 100 150 200 250 300 350 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 Tiemp o de omputo C1 = 66seg Tabla 4.19: gromas_poly latenia de omuniaión n o no dos ( N ) 1 2 4 8 16 swith100Mbps 0 74 83.5 125 297 swith10Mbps 0 668 763 1084 2385 hub 0 1668 4055 10993 43967 wi 0 1461 42526 95511 En este ejemplo p o demos observar que, en ninguna de las redes se mejora el tiemp o de ejeuión de un no do. La sobrearga de omuniaión es muy elevada. Veamos, p or ejemplo (gura 4.97), ómo la latenia de omuniaión en la red del swith de 100Mbps está p or enima del umbral de omuniaión: Figura 4.97: gromas-poly latenia de omuniaión 0 50 100 150 200 250 300 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 umbral de comunicacion A la vista de los resultados obtenidos, p o demos onluir que las redes que
4.3. APLICACIONES 71 habitualmente se utilizan para la ejeuión de apliaiones omo ésta, tienen un mayor anho de banda que ualquiera de las redes que onsideramos. Lammps En el aso de esta otra apliaión paralela real, se ha esogido un ejemplo de tamaño p equeño omo es Lammps-rak . Los resultados obtenidos on esta apliaión se muestran en las guras 4.98 a 4.100. Figura 4.98: lammps_rak 0 5000 10000 15000 20000 25000 30000 35000 40000 45000 50000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub wifi Figura 4.99: lammps_rak 200 400 600 800 1000 1200 1400 1600 1800 2000 2200 2400 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10
72 CAPÍTULO 4. RESULTADOS Figura 4.100: lammps_rak 300 320 340 360 380 400 420 440 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 Tiemp o estimado de ómputo para un no do: C1= 332seg Tabla 4.20: lammps_rak. latenia de omuniaión n o no dos ( N ) 2 4 8 16 swith100Mbps 263 288 360 300 swith10Mbps 1992 1336 2244 1846 hub 2233 3414 11904 20803 wi 14765 7028 18051 47521 Figura 4.101: lammps_rak. latenia en omuniaión 0 5000 10000 15000 20000 25000 30000 35000 40000 45000 50000 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub wifi
4.3. APLICACIONES 73 Figura 4.102: lammps_rak. latenia en omuniaión 0 500 1000 1500 2000 2500 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 Figura 4.103: lammps_rak. latenia en omuniaión 0 50 100 150 200 250 300 350 400 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 umbral de comunicacion En la gráa 4.103, al igual que en la gura 4.100, se omprueba que, on 4 y 16 no dos, se redue el tiemp o de ejeuión obtenido para un no do. Como ya se ha omentado anteriormente, dep endiendo de la implementaión de la apliaión paralela, y de las araterístias de la red utilizada, la latenia de omuniaión puede aumentar, mantenerse onstante o inluso disminuir a medida que aumenta el número de no dos. Éste es un ejemplo en el que la latenia de omuniaión aumenta o disminuye en funión del número de no dos. A la vista de las gráas 4.101 a 4.103, p o dríamos deduir que la implementaión de la apliaión lammps-rak hae que la latenia de omuniaión sea notablemente menor uando el número de nodos es uadrado p erfeto. 4.3.2. NPB Los ejemplos que se estudian en esta seión no son apliaiones paralelas reales, aunque el ó digo que ontienen forma parte de gran número de ellas.
80 CAPÍTULO 4. RESULTADOS El estudio realizado on el b enhmark Multi-PingPong (4.2.3) nos sirve ahora para sab er el omp ortamiento que tendrá la op eraión multiqBcastp desrita, dep endiendo de si la red sobre la que se eje- uta p ermite omuniaiones simultáneas o no: multiqBcastp(M n) = (Bcastp(M n), swith q×Bcastp(M n), hub y wi (4.5) Utilizando p or un lado las expresiones 4.4 y 4.5, y p or otro, los tiempos obtenidos en la eje- uión del IMB-Bast (seión 4.2.9), p o demos haer una estimaión del tiemp o empleado para la omuniaión, al ejeutar el algoritmo. Se deb e tener en uenta que al aumentar el número de no dos, el tamaño de mensa je a enviar irá disminuyendo. Por ejemplo, en el aso de una matriz 1000 ×1000 , dado que los datos son números reales en doble preisión, se tiene un tamaño iniial M= 1000 ×1000 ×8Bytes = 8 1,048576 MBytes , que estará repartido entre los no dos, en blo ques de tamaño 8 n×1,048576 MBytes . Los tiemp os obtenidos se muestran en la tabla 4.23. Tabla 4.23: Estimaión de tiemp o de omuniaión. Matriz-1000x1000 n o no dos 2 4 8 16 swith100Mbps 0.69 0.69 0.85 0.68 swith10Mbps 6.79 6.79 8.41 6.93 hub 8.9 16.1 33.5 51.1 wi 18.9 34.9 97.9 121.4 En las guras 4.111 a 4.113 se representan onjuntamente, para su omparaión, los datos mostrados en las tablas 4.22 y 4.23, que se orresp onden on los tiemp os de omuniaión obtenidos on los dos méto dos desritos.
4.3. APLICACIONES 81 Figura 4.111: Comparaión tiemp os omuniaión. swith100Mbps 0 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos latencia comunicacion suma Bcast Figura 4.112: Comparaión tiemp os omuniaión. swith10Mbps 0 1 2 3 4 5 6 7 8 9 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos latencia comunicacion suma Bcast Figura 4.113: Comparaión tiemp os omuniaión. Hub y Wi 0 20 40 60 80 100 120 140 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos latencia comunicacion hub suma Bcast hub latencia comunicacion wifi suma Bcast wifi Puede observarse gran similitud entre las gráas de latenia de omu-
82 CAPÍTULO 4. RESULTADOS niaión , obtenida a partir del tiemp o de ejeuión, y de suma de Bast obtenida para estimar el tiemp o de omuniaión, a partir de la suma de tiemp os de funiones Bast . Sin embargo, en el aso de la red wi, se observa una divergenia entre ambas urvas, que p o dría ser debida, en parte, a irregularidades detetadas en los datos de que se disp one de la ejeuión de IMB-Bast para 2 no dos, y que se muestran a ontinuaión. Tabla 4.24: Datos de la ejeuión de IMB-Bast Bytes 2 no dos (seg) 4 no dos (seg) 65536 127447.01 531953.14 131072 268508.82 1038381.60 262144 507681.01 2012707.11 524288 2082159.21 3979421.08 1048576 4929343.22 7913571.77 2097152 4576611.46 15794822.28 4194304 9910334.23 30419769.94 En los tiemp os prop orionados en la tabla 4.24 se omprueba que, para 4 no dos, la latenia se duplia, aproximadamente, uando también lo hae el tamaño del mensa je (o urre lo mismo para otras redes). Sin embargo, para 2 no dos, el tiemp o orresp ondiente a 524288Bytes es 4 vees el de 262144Bytes (deb ería ser el doble), y el orresp ondiente a 1048576Bytes es mayor que el de 2097152Bytes (deb ería ser la mitad). Matriz 2000x2000 Probamos on un tamaño mayor de matriz, busando que, on ualquiera de las redes de que disp onemos, el tiemp o de ejeuión mejore al aumentar el número de no dos. Los resultados obtenidos on esta apliaión se muestran en las guras 4.114 y 4.115. Figura 4.114: Multipliaión Matriz 2000x2000 0 50 100 150 200 250 300 350 400 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub wifi
4.3. APLICACIONES 83 Figura 4.115: Multipliaión Matriz 2000x2000 0 10 20 30 40 50 60 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 Al aumentar el tamaño de matriz obtenemos el resultado que busábamos para la red onetada on el swith de 10Mbps . Sin embargo, en el aso de las redes hub y wi, el tiemp o de ejeuión sigue aumentando on el número de no dos. Matriz 4000x4000 Consideramos un tamaño mayor, busando mayor es- alabilidad. Figura 4.116: Multipliaión Matriz 4000x4000 0 200 400 600 800 1000 1200 1400 1600 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub wifi
84 CAPÍTULO 4. RESULTADOS Figura 4.117: Multipliaión Matriz 4000x4000 0 50 100 150 200 250 300 350 400 450 500 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 Si bien en este ejemplo se observa que para la red onetada mediante un hub, el tiemp o de ejeuión para 2 no dos es menor que la ejeuión en un sólo no do, al aumentar más aún el número de no dos, vuelve a inrementarse el tiemp o de ejeuión, quedando éste p or enima del valor para un no do. En el aso de la red wi, los tiemp os obtenidos se enuentran siempre p or enima de la ejeuión en un no do. Matriz 8000x8000 Probamos un nuevo tamaño de matriz on el n de aumentar la prop orión entre tiemp o de ómputo frente al de omuniaión, busando mayor esalabilidad. Figura 4.118: Multipliaión Matriz 8000x8000 0 1000 2000 3000 4000 5000 6000 7000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 hub wifi
4.3. APLICACIONES 85 Figura 4.119: Multipliaión Matriz 8000x8000 0 500 1000 1500 2000 2500 3000 3500 4000 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos s100 s10 En este tamaño de matriz se observa esalabilidad hasta 16 no dos, al menos, en las redes onetadas mediante swith, hasta 4 no dos en la red hub, y on 2 no dos en la wi. Multipliaión Matriz on pro esador más lento A la vista de los resultados obtenidos, se omprueba que la esalabilidad que presenta la red onetada mediante un swith de 10Mbps es esasa, y prátiamente nula en las redes hub o wi. Esto nos lleva a preguntarnos ómo sería la omputaión paralela uando las redes de que se disp onía eran más lentas de lo que son hoy en día, y si la falta de esalabilidad observada puede deb erse a que se están ombinando, p or un lado, redes antiguas omo lo es la onetada mediante un hub (wi on omp ortamiento similar a hub) on pro esadores rápidos (relativamente mo dernos). Se plantean nuevas pruebas en las que se ejeuta el algoritmo de la multipliaión, simulando pro esadores más lentos. Para ello se ejeutan, de forma simultánea a la multipliaión, varios programas que onsumen CPU.
86 CAPÍTULO 4. RESULTADOS Figura 4.120: Multipliaión M=1000x1000 + Sobrearga, para Swith 10Mbps 5 10 15 20 25 30 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos 100%CPU 50%CPU 25%CPU Figura 4.121: Multipliaión M=2000x2000 + Sobrearga, para Swith 10Mbps 0 50 100 150 200 250 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos 100%CPU 50%CPU 25%CPU Figura 4.122: Multipliaión M=2000x2000 + Sobrearga, para Hub 50 100 150 200 250 300 350 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos 100%CPU 50%CPU 25%CPU 17%CPU
4.3. APLICACIONES 87 Figura 4.123: Multipliaión M=2000x2000 + Sobrearga, para Wi 50 100 150 200 250 300 350 400 450 500 0 2 4 6 8 10 12 14 16 tiempo (seg) nodos 100%CPU 25%CPU 17%CPU Observamos (guras 4.120 a 4.123) que on ualquiera de las redes, a medida que disminuye la apaidad de ómputo, se onsigue mayor esalabilidad. Esto es debido a que se redue el tiemp o de omuniaión resp eto al de ómputo. Como ya se omentó al prinipio de la seión 4.3, para mejorar el tiemp o de ejeuión al aumentar el número de no dos, el tiemp o añadido debido a la omuniaión deb e ser inferior a la reduión que sufrirá el tiemp o de ómputo omo onseuenia de repartir el trabajo entre más no dos. En las gráas 4.122 y 4.123, orresp ondientes a las redes Hub y Wi, en las que no son p osibles las omuniaiones simultáneas, observamos que uando el pro esador es suientemente lento, o equivalentemente, uando el tiemp o de omuniaión es suientemente p equeño (resp eto al de ómputo), al aumentar el número de no dos disminuye el tiemp o de ejeuión. Aún así, en este aso, sólo esala hasta 4 no dos. Esto se deb e a que, tal omo hemos p o dido omprobar a lo largo del presente estudio, el tiemp o de omuniaión en estas redes ree onsiderablemente on el número de no dos. Por otro lado, el tiemp o de ómputo deree de forma exp onenial, tal omo se vió en la gura 4.87. Por tanto, aún uando se da la ondiión de que el tiemp o añadido de omuniaión es menor que la reduión del tiemp o de ómputo, y dado que éste último deree muy rápidamente, mientras que el primero ree, más o menos rápido, on el número de no dos, la esalabilidad que presentan estas redes es esasa. Estas observaiones p onen de maniesto que, para onseguir esalabilidad en la resoluión de problemas en paralelo, la red utilizada deb e, además de tener un determinado anho de banda, p ermitir omuniaiones simultáneas.
88 CAPÍTULO 4. RESULTADOS
Capítulo 5 Conlusiones Tras realizar y analizar los diferentes exp erimentos presentados en esta memoria, p o demos onsiderar que las prinipales onlusiones que se obtienen son: 1. El ob jetivo de la omputaión paralela es reduir el tiemp o de ejeu- ión de apliaiones que preisan una enorme antidad de op eraiones. Su estrategia onsiste en repartir el traba jo a realizar entre distintos no dos pro esadores. Ahora bien, para que varios no dos lleven a ab o un traba jo omún, neesitan omuniarse. Deb e tenerse en uenta que el tiemp o empleado en esa omuniaión se sumará al de ómputo para dar el tiemp o nal de ejeuión de la apliaión paralela. Se deb e p oner un verdadero interés en reduir al máximo la latenia de omuniaión, ya que el éxito o fraaso en la obtenión de un buen tiemp o de ejeuión dep ende, en gran medida, de esta latenia. Una deiente planiaión de la red de interonexión p o dría llevarnos a asos extremos omo el visto en la gura 4.88, en el que una apliaión, que un sólo ordenador ejeutaba en 55 minutos, al ser ejeutada en paralelo, dividiendo el traba jo entre 16 ordenadores, pasaba a tardar 2 días y 7 horas. 2. En el rendimiento inuyen las araterístias de red, no sólo de anho de banda, sino determinadas araterístias que p ermiten obtener ganan- ia de anho de banda. Hemos p o dido omprobar que el heho de que la red p ermita o no omuniaiones simultáneas, inuye en gran medida en la latenia. Si la red utilizada no p ermite ningún tip o de omuni- aión simultánea, no es p osible onseguir gran esalabilidad, ya que la latenia siempre reerá on el número de no dos. En una situaión omo ésta, las únias apliaiones paralelas que presentarían un buen omp ortamiento serían aquellas que tuvieran muy p o a omuniaión, on lo que se limitaría enormemente el p otenial de la omputaión paralela. Po demos deir, p or tanto, que para obtener buenos resultados, 89