scieee Open visual document viewer

Separación automática de instrumentos musicales utilizando aprendizaje máquina

Guerra Cornejo, Hugo

Abstract

La separación de fuentes sonoras ha sido en los últimos tiempos, uno de los temas más recurrentes en el ámbito del procesado de señal. El avance en disciplinas tales como el Deep Learning ha supuesto una gran contribución en la mejora de los algoritmos que tratan de recrear la habilidad humana de identificar fuentes sonoras de manera individual. Este trabajo se centra en abordar el estudio de las distintas técnicas de separación de fuentes musicales en mezclas estereofónicas. En él se presentan las claves para la implementación y evaluación de un modelo que permita separar los diferentes instrumentos musicales de mezclas musicales profesionales. Para ello se comienza analizando las propuestas existentes de sistemas basados en redes neuronales y su rendimiento para, posteriormente, implementar una arquitectura de separación automática de fuentes musicales y realizar al sistema resultante una evaluación de medidas objetivas.

Full text

Equa ion Chap e 1 Sec ion 1 T abajo Fin de G ado G ado en Ingenie ía de las Tecnologías de Telecomunicación Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina Au o : Hugo Gue a Co nejo Tu o : F ancisco José Simois Ti ado Dp o. Teo ía de la Señal y Comunicaciones Escuela Técnica Supe io de Ingenie ía Uni e sidad de Se illa Se illa, 2023 iii T abajo Fin de G ado G ado en Ingenie ía de las Tecnologías de Telecomunicación Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina Au o : Hugo Gue a Co nejo Tu o : F ancisco José Simois Ti ado P o eso Con a ado Doc o Dp o. de Teo ía de la Señal y Comunicaciones Escuela Técnica Supe io de Ingenie ía Uni e sidad de Se illa Se illa, 2023 T abajo Fin de G ado: Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina Au o : Hugo Gue a Co nejo Tu o : F ancisco José Simois Ti ado El ibunal nomb ado pa a juzga el P oyec o a iba indicado, compues o po los siguien es miemb os: P esiden e: Vocales: Sec e a io: Acue dan o o ga le la cali icación de: Se illa, 2023 El Sec e a io del T ibunal ii Ag adecimien os Es e abajo supone el in de una e apa. Po ello, me gus a ía ag adece a odas aquellas pe sonas que han es ado conmigo en es e pe iodo: A mi amilia, en especial a mis pad es, po sus enseñanzas, ca iño y apoyo incondicional en los buenos y malos momen os. Sin ellos no se ía posible habe eco ido es e camino. A mis compañe os y amigos, po odos los buenos a os i idos y po habe me apo ado o as isiones de la ida. A mi u o , F ancisco José Simois, po b inda me la opo unidad de hace es e abajo y su buena a ención conmigo cada ez que lo he necesi ado. ix Resumen La sepa ación de uen es sono as ha sido en los úl imos iempos, uno de los emas más ecu en es en el ámbi o del p ocesado de señal. El a ance en disciplinas ales como el Deep Lea ning ha supues o una g an con ibución en la mejo a de los algo i mos que a an de ec ea la habilidad humana de iden i ica uen es sono as de mane a indi idual. Es e abajo se cen a en abo da el es udio de las dis in as écnicas de sepa ación de uen es musicales en mezclas es e eo ónicas. En él se p esen an las cla es pa a la implemen ación y e aluación de un modelo que pe mi a sepa a los di e en es ins umen os musicales de mezclas musicales p o esionales. Pa a ello se comienza analizando las p opues as exis en es de sis emas basados en edes neu onales y su endimien o pa a, pos e io men e, implemen a una a qui ec u a de sepa ación au omá ica de uen es musicales y ealiza al sis ema esul an e una e aluación de medidas obje i as. x ii ÍNDICE DE FIGURAS Figu a 1-1. Sepa ación de uen es musicales [3]. 1 Figu a 2-1. Diag ama de una ed neu onal. 4 Figu a 2-2. Diag ama de una neu ona a i icial. Adap ado de [9]. 5 Figu a 2-3. Funciones de ac i ación. 6 Figu a 2-4. E ec o del sob eajus e 7 Figu a 2-5. Funcionamien o del d opou . Adap ada de [12]. 7 Figu a 2-6. Ejemplo de dos con oluciones con en adas 2D [3]. 8 Figu a 2-7. Ejemplo de ag upación máxima y ag upación media [14]. 9 Figu a 2-8. Implemen ación de modulo LSTM [16]. 9 Figu a 2-9. Ejemplo de o ma de onda pa a la oz humana masculina [17]. 10 Figu a 2-10. Ejemplo de espec og ama. 11 Figu a 2-11. Tipos de en anas más comunes en la sepa ación de uen es [3]. 11 Figu a 2-12. P oceso de ob ención de la STFT [18]. 12 Figu a 2-13. Aplicación de una másca a iempo- ecuencia a un espec og ama. Adap ada de [3] 12 Figu a 4-1. Logo de py hon 17 Figu a 4-2. Logos de Theano y Lasagne. 18 Figu a 4-3. Logos de PyTo ch y NumPy. 18 Figu a 4-4. Esquema de la composición de los da ase s [40]. 19 Figu a 4-5. Compa a i a de MusDB18 y MusDB18-HQ [33]. 20 Figu a 4-6. Diag ama de bloques del modelo DeepCon Sep 20 Figu a 4-7. A qui ec u a de la ed neu onal del modelo DeepCon Sep [29] 21 Figu a 4-8. Es uc u a del modelo Open-Unmix [41]. 22 Figu a 4-9. A qui ec u a de la ed neu onal del modelo p opues o. 23 Figu a 5-1. P ime as épocas del en enamien o de DeepCon Sep 25 Figu a 5-2. Úl imas épocas del en enamien o de DeepCon Sep 25 Figu a 5-3. Cap u a de JSON que con iene los de alles de en enamien o 27 Figu a 5-4. Cáp u a de la consola de comandos du an e el en enamien o del modelo p opues o. 28 xix ÍNDICE DE ECUACIONES Ecuación 2-1. Función de ac i ación sigmoidea 5 Ecuación 2-2. Función de ac i ación angen e hipe bólica 5 Ecuación 2-3. Función de ac i ación ReLU 5 Ecuación 2-4. Salida de una neu ona a i icial. 6 Ecuación 2-5. Cálculo de la STFT 10 Ecuación 2-6. Descomposición de la uen e es imada pa a su e aluación. 13 Ecuación 2-7. Cálculo de la elación señal a dis o sión. 13 Ecuación 2-8. Cálculo de la elación señal a in e e encia. 13 Ecuación 2-9. Cálculo de la elación señal a a e ac os. 14 1 1 INTRODUCCIÓN a sepa ación de uen es sono as (SSS) es el p oceso po el cual se ex aen una o a ias señales de in e és de una mezcla musical que con iene múl iples señales supe pues as. Es o iene una especial impo ancia en el p ocesamien o de señales pues o que elimina uen es indeseadas como el uido o aisla las señales de in e és pe mi e ope a con señales sin in e e encias. El se humano cuen a con la habilidad de sepa a las di e en es uen es de audio. Es o es algo que en la década de los cincuen a ue denominado e ec o de ies a de cóc el [1]. Aunque es cie o que se han log ado no ables a ances en los úl imos iempos pa a ec ea es a habilidad en o denado es, es un campo que con inúa en cons an e desa ollo e in es igación. Una ama conc e a enma cada den o de la sepa ación de uen es sono as es la sepa ación de uen es musicales (MSS). Es a iene como obje i o di idi una mezcla de audio musical en los di e en es ins umen os que la componen. Es a sepa ación iene aplicaciones ales como la ealización de un “ka aoke”, el emezclado de canciones, la gene ación de sonido en ol en e, la es au ación de g abaciones an iguas, el análisis de ins umen os po sepa ado y un la go e cé e a. Po ello la sepa ación de uen es musicales es un ema ampliamen e es udiado den o de la comunidad de ecupe ación de in o mación musical (MIR) y sob e el que habi ualmen e se o ganizan e os y campañas de e aluación ales como la SISEC [2]. Figu a 1-1. Sepa ación de uen es musicales [3]. En es e abajo nos cen a emos en la sepa ación de ins umen os ( uen es) musicales a pa i de mezclas de audio es e eo ónicas. En conc e o, pa iendo de dichas mezclas a a emos de ob ene a chi os de audio co espondien es a es uen es musicales: oz, ba e ía y bajo. Además, sepa a emos una cua a uen e ela i a al es o de ins umen os p esen es en la composición musical. Siguiendo con es e apa ado in oduc o io, a con inuación, se enume a án de mane a sin e izada los dis in os obje i os que se p e enden alcanza en es e abajo y, inalmen e, se pasa á a de alla la mane a en la que es á es uc u ada la memo ia. L In oducción 2 1.1 Obje i os Los p incipales obje i os que es e abajo p e ende cub i son los siguien es: 1. Realiza un es udio del es ado del a e de las p incipales écnicas de sepa ación de uen es sono as haciendo hincapié en las en ocadas a sepa ación de ins umen os musicales. 2. Analiza y comp ende dos de los p incipales algo i mos de sepa ación de uen es musicales exis en es. 3. Gene a un código en Py hon de un modelo que pe mi a ealiza la sepa ación au omá ica de ins umen os. 4. E alua de mane a obje i a los esul ados ob enidos a pa i de un conjun o de da os de p ueba. 1.2 O ganización de la memo ia La memo ia del p esen e abajo se es uc u a en los sie e capí ulos que se desc iben a con inuación: El p ime capí ulo, en el que se encuen a es a sección, apo a una b e e in oducción del ema a a a en el abajo, así como los p opósi os que se ienen y un esumen de cómo se abo da á la ma e ia en las dis in as secciones de la memo ia, pa a que el lec o pueda comp ende de mane a g adual la emá ica es udiada. El segundo capí ulo se cen a á en los undamen os eó icos p e ios a la p esen ación del abajo ealizado. En él se in oduci án di e en es concep os elacionados con las edes neu onales la ep esen ación y el enmasca ado de audio. Así mismo, se p esen a án las medidas pa a ealiza una e aluación obje i a de la sepa ación. Pos e io men e, en el e ce capí ulo, se ha á una e isión esumida del es ado del a e ela i o a la sepa ación de uen es sono as haciendo especial mención a los algo i mos de sepa ación de ins umen os musicales. En el cua o capí ulo de es a memo ia, se de alla á la me odología empleada, mencionando los dis in os equisi os necesa ios pa a la ealización de es e abajo y se desc ibi án de alladamen e las a qui ec u as de edes neu onales seleccionadas pa a nues a a ea que nos ocupa. A lo la go del quin o capí ulo se comen a án los de alles ela i os al en enamien o de los dis in os modelos seleccionados, así como del modelo que se p opone. En el sex o capí ulo se expond án los esul ados ob enidos con las a qui ec u as con las que se han abajado y una pos e io compa ación con o os modelos exis en es, haciendo uso de medidas de e aluación obje i as. Las conclusiones, así como las líneas u u as de in es igación queda ás ecogidas en el sép imo y úl imo capí ulo. Además, se apo a á un anexo en el que se inclui á el código en Py hon del modelo de ed neu onal implemen ado Jun o con los sie e capí ulos y el anexo que se acaba de menciona , la memo ia con a á con un apa ado dedicado a las e e encias empleadas a lo la go de la misma, índices de ablas, igu as y ecuaciones, además de un glosa io. 3 2 FUNDAMENTOS TEÓRICOS lo la go de es e capí ulo se in oduci án aquellos concep os undamen ales pa a comp ende los sis emas de sepa ación au omá ico de uen es musicales median e ap endizaje máquina como los que abo da emos más adelan e. Debido a que exis en mul i ud de elemen os suscep ibles de se usados en es os p ocedimien os de sepa ación, se explica an con mayo p o undidad aquellos que in e ienen en los sis emas a ados en es e abajo. En p ime luga , se p esen a án los undamen os básicos del ap endizaje máquina y de las edes neu onales, y pos e io men e, se abo da án las cues iones elacionadas con la ep esen ación y el enmasca amien o en iempo- ecuencia. Pa a inaliza es e capí ulo eó ico, se comen a án las mé icas que emplea emos pa a e alua obje i amen e los modelos a ados en es e abajo. 2.1 Ap endizaje Máquina El ap endizaje máquina (Machine Lea ning) es una ama de la in eligencia a i icial (IA) que consis e en enseña a equipos in o má icos a que ap endan de la expe iencia. Pa a ello, sus algo i mos se apoyan en mé odos compu acionales en ocados a ap ende in o mación di ec amen e a a és de da os, sin necesi a pa a ello una ecuación p ede e minada como modelo. Su endimien o se op imiza de mane a adap a i a con o me aumen a el núme o de mues as con las que cuen an pa a el ap endizaje [4]. Es os algo i mos pueden clasi ica se en cua o ipos de ap endizaje dependiendo de la salida espe ada, así como del ipo de en ada: • Ap endizaje supe isado. El sis ema ap ende en base un conjun o de da os de en enamien o e ique ados y de inidos pa a e alua las co elaciones, especi icándose las en adas y salidas del algo i mo. Es e ipo de ap endizaje iene como en aja la simplicidad y acilidad de diseño, pe o supone el desa ío de e ique a la g an can idad de da os que necesi a. • Ap endizaje no supe isado. El sis ema de ec a pa ones y ca ego iza da os a pa i de un conjun o de da os en enamien o no e ique ados, sin dispone de los da os de salida deseados. Si bien poseen una con igu ación ácil dado que no equie en e ique ado, es os modelos no suelen o ece p edicciones p ecisas. • Ap endizaje semisupe isado. En es e ipo de ap endizaje se combinan los dos ipos de ap endizaje an e io men e comen ados. En el en enamien o se usan una pequeña can idad de da os e ique ados y una g an can idad sin e ique a de mane a que, una ez en enado pa cialmen e el algo i mo con da os e ique ados, es e se es capaz de e ique a los da os no e ique ados. • Ap endizaje po e ue zo: Se ap ende median e ecompensas, de mane a que el obje i o del modelo es consegui el mayo núme o de pun os de ecompensas posible y alcanza una me a [5]. A Fundamen os eó icos 4 El conjun o de da os con el que abajan es os algo i mos suele di idi se en los siguien es subconjun os: • Da os de en enamien o, sob e los que se ealiza la op imización de los pa áme os del modelo (pesos y umb ales). • Da os de alidación, que si en pa a e i ica el compo amien o del modelo y así pode ajus a los hipe pa áme os en base a las p edicciones que el modelo ealiza sob e ellos. • Da os de p ueba, sob e los que se ealiza la e aluación inal del modelo. Den o del campo del ap endizaje máquina, exis e una a iedad especializada denominada ap endizaje p o undo (Deep Lea ning) que aumen a la p ecisión de los algo i mos has a el pun o de supe a en ocasiones al p opio endimien o humano. Sus modelos en enan con una g an can idad de da os e ique ados y es os se enca gan po sí solos de ex ae las ca ac e ís icas a pa i de los da os empleando pa a ello a qui ec u as basadas en edes neu onales que se desc ibi án en el siguien e pun o. El a ance en los úl imos años del ap endizaje p o undo (DL) ha supues o que los algo i mos adicionales empleados en la sepa ación de uen es ales como el análisis de componen es p incipales (PCA) [6] o la ac o ización de ma ices no nega i as (NMF) [7], se hayan is o sus i uidas po a qui ec u as de edes neu onales. Es o se debe, en g an medida, a que es os algo i mos de ap endizaje son capaces de p opo ciona implemen aciones más ápidas y complejas que los an e io es o eciendo mejo es esul ados. 2.1.1 Redes neu onales Las edes neu onales, ambién llamadas edes neu onales a i iciales (ANN), son un subconjun o del ap endizaje máquina y ep esen an una pa e undamen al en los algo i mos de ap endizaje p o undo. Se a a de sis emas inspi ados en la es uc u a y el uncionamien o del ce eb o humano. Las ANN es án basadas en en ena da os con el in de ap ende y mejo a su p ecisión con el iempo. Una ez ajus ados de mane a p ecisa, son conside adas po en es he amien as en el mundo de la in eligencia a i icial que pe mi en clasi ica y ag upa da os a g an elocidad [8]. Figu a 2-1. Diag ama de una ed neu onal. Es as edes es án cons i uidas po capas o madas po una se ie de nodos in e conec ados en e sí, denominados neu onas a i iciales. En la igu a 2-1 se mues a la es uc u a de una ed neu onal básica. Las edes neu onales con ienen una capa de en ada, una o a ias capas ocul as y una capa de salida. En es e ejemplo la ed con end ía dos a iables de en ada, es neu onas en cada una de las dos capas ocul as y una en la capa de salida. 5 5 Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina 2.1.1.1 Neu onas a i iciales Como acabamos de e , la unidad básica de la que es án do ados las edes neu onales son las neu onas a i iciales. En la igu a 2-2 puede ap ecia se un diag ama de una neu ona a i icial. Figu a 2-2. Diag ama de una neu ona a i icial. Adap ado de [9]. Una neu ona cons a básicamen e de los siguien es elemen os: • En adas (𝑥𝑗): Reciben las salidas de o as neu onas o las en adas de la ed neu onal. • Pesos (𝑤𝑘𝑗): De e minan el e ec o de las en adas en la neu ona a i icial. • Umb al (𝑏𝑘): En ada ex e na a la neu ona. Su alo es modi icado du an e el en enamien o. • Función de ac i ación (𝜑(·)): De e mina la salida de la neu ona aplicando una unción ma emá ica a la en ada e ec i a. Son di e enciables y suelen se no lineales. Algunas de las más empleadas son las siguien es: o Sigmoidea (𝜎): Es muy adecuada pa a c ea las másca as sua es necesa ias en la sepa ación y que se e án en una sección pos e io . En la igu a 2-5 a puede obse a se su g á ica. 𝜎(𝑥)=1 1+𝑒−𝑥 Ecuación 2-1. Función de ac i ación sigmoidea o Tangen e hipe bólica ( anh): Es más común emplea la en zonas in e medias de la ed que en los ex emos. La igu a 2-5 b mues a la g á ica de es a unción. anh(𝑥)=𝑒−𝑥 −𝑒−𝑥 𝑒−𝑥 +𝑒−𝑥 Ecuación 2-2. Función de ac i ación angen e hipe bólica o Unidad lineal ec i icada (ReLU): A eces se emplea pa a gene a másca as y algunos sis emas la emplean pa a gene a o mas de onda [3]. Su g á ica se mues a en la igu a 2-5 c. 𝑓(𝑥)=max⁡(0,𝑥) Ecuación 2-3. Función de ac i ación ReLU Fundamen os eó icos 12 Con iene a su ez señala la exis encia de una écnica denominada solapamien o-suma (o e lap-add), la cual es empleada en la e apa de sín esis, pa a ecupe a la señal en iempo que se basan en un conjun o de pa áme os llamados COLA (Cons an O e lap-Add) los cuales suman un alo cons an e al aplica en anas sucesi as [3] . En la igu a 2-12 se mues a el p oceso po el cual se ob iene la STFT. Figu a 2-12. P oceso de ob ención de la STFT [18]. Pa a inaliza es e apa ado en el que hemos pues o el oco en la STFT, cabe menciona la exis encia de algunas ep esen aciones ales como la CQT [19], la CFT [20] o la MCFT [21], en e o as, que ambién han sido ambién usadas en en oques de sepa ación de uen es. 2.3 Másca as iempo- ecuencia La sepa ación de uen es musicales equie e la u ilización de un il o a ian e en el iempo. Es po ello po lo que las másca as iempo- ecuencia sean un ecu so ampliamen e usado en los sis emas de sepa ación mode nos como los que nos ocupan. Como podemos e en la igu a 2-13 es as másca as (ma ices que con ienen alo es en el in e alo [0.0,1.0]) ealizan su a ea de il ado median e la mul iplicación elemen o a elemen o con el espec og ama a il a como paso p e io a la in e sión de es e y ecupe ación de la señal de iempo. Figu a 2-13. Aplicación de una másca a iempo- ecuencia a un espec og ama. Adap ada de [3] 13 13 Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina Algunas de las másca as iempo- ecuencia empleadas en el ámbi o de la sepa ación de uen es sono as son: • Másca a bina ia. Solo oman alo es 1, cuando se asume que la señal a sepa a es á dominada po una uen e, y 0 en caso con a io. Si bien su uso se ha educido en es imaciones inales de uen es, sigue siendo álida en a eas de en enamien o. • Másca a sua e. Pueden oma cualquie alo den o del in e alo [0.0,1.0], lo que las hace más lexibles que las an e io es y po lo gene al conducen a esul ados con meno dis o sión [22]. El cálculo de las másca as equie e una es imación de las uen es indi iduales en el dominio de iempo- ecuencia. Es a a ea puede lle a se a cabo median e el uso de una ed neu onal que las p ediga [10]. 2.4 Medidas de e aluación obje i a Con el in de e alua obje i amen e los esul ados de un modelo de sepa ación de uen es, se han desa ollado medidas que se basan en la descomposición de la uen e es imada 𝑠𝑗 en a ias señales[23]: 𝑠𝑡𝑎𝑟𝑔𝑒𝑡 ( e sión de la uen e o iginal a ec ada po una dis o sión pe mi ida), 𝑒𝑖𝑛𝑡𝑒𝑟𝑓 (in e e encia p oceden e de uen es no deseadas), 𝑒𝑛𝑜𝑖𝑠𝑒 ( uido p oceden e de los senso es empleados pa a la cap u a de la mezcla) y 𝑒𝑎𝑟𝑡𝑖𝑓 (a e ac os p opios del algo i mo de sepa ación). 𝑠𝑗=𝑠𝑡𝑎𝑟𝑔𝑒𝑡 +𝑒𝑖𝑛𝑡𝑒𝑟𝑓 +𝑒𝑛𝑜𝑖𝑠𝑒 +𝑒𝑎𝑟𝑡𝑖𝑓 Ecuación 2-6. Descomposición de la uen e es imada pa a su e aluación. A con inuación, se p esen an unas mé icas ampliamen e usadas en la e aluación obje i a de la sepa ación basadas en descomposición que acabamos de comen a : • Relación señal a dis o sión (SDR): 𝑆𝐷𝑅 =10log10 ‖𝑠𝑡𝑎𝑟𝑔𝑒𝑡‖2 ‖𝑒𝑖𝑛𝑡𝑒𝑟𝑓 +⁡𝑒𝑛𝑜𝑖𝑠𝑒 +𝑒𝑎𝑟𝑡𝑖𝑓‖2 Ecuación 2-7. Cálculo de la elación señal a dis o sión. • Relación señal a in e e encia (SIR): 𝑆𝐼𝑅 =10log10‖𝑠𝑡𝑎𝑟𝑔𝑒𝑡‖2 ‖𝑒𝑖𝑛𝑡𝑒𝑟𝑓‖2 Ecuación 2-8. Cálculo de la elación señal a in e e encia. Fundamen os eó icos 14 • Relación señal a a e ac os (SAR): 𝑆𝐴𝑅 =10log10‖𝑠𝑡𝑎𝑟𝑔𝑒𝑡 +𝑒𝑖𝑛𝑡𝑒𝑟𝑓 +⁡𝑒𝑛𝑜𝑖𝑠𝑒‖2 ‖𝑒𝑎𝑟𝑡𝑖𝑓‖2 Ecuación 2-9. Cálculo de la elación señal a a e ac os. 15 3 ESTADO DEL ARTE a sepa ación de uen es musicales es una a ea que ha a aído a mul i ud de in es igado es a lo la go de las cinco úl imas décadas. Es o es en pa e debido a que exis en di e en es o mas de abo da el p oblema en cues ión. A lo la go de es e capí ulo se enume a án los dis in os en oques que se ha p opues o a lo la go del iempo pa a esol e es a a ea de sepa ación. Los mé odos de sepa ación de uen es pueden di idi se en dos ca ego ías p incipales: una que usa modelos basados en los espec og amas y o a que emplea modelos basados en la o ma de onda. Los modelos que abajan en ep esen aciones de iempo- ecuencia p edicen un espec og ama de po encia pa a cada una de las uen es y eu ilizan la ase de la mezcla de en ada pa a sin e iza las o mas de onda. A p incipios de es e siglo, las écnicas de ac o ización no nega i a de ma ices [24] (NMF) se empeza on a aplica con éxi o a la sepa ación de uen es musicales. Es as écnicas se basan en modela el espec o de po encia como una suma ponde ada de un dicciona io espec al, cuyos elemen os son ag upados en uen es indi iduales. A es as écnicas han con ado con dis in as mejo as ales como su ex ensión a núme os complejos [25], pe mi iendo modela ase y magni ud de o ma simul ánea. A su ez, o o de los mé odos p opues os pa a abo da el p oblema de la sepa ación ha sido el análisis de componen es independien es, basado en supues os de independencia y la exis encia de múl iples mic ó onos. El a ance en los úl imos años de las écnicas de ap endizaje p o undo ha pe mi ido mejo a los en oques an e io es. En 2014 se ealizó un p ime abajo pa a la sepa ación del habla [26]. A es e le siguie on abajos sob e música empleando edes comple amen e conec adas [27][28] así como edes con olucionales y ecu en es [29] [30]. En 2016, las écnicas basadas en espec og amas comienzan a usa il ado de Wiene , una ez demos ada su e iciencia [31], siendo usado en la ac ualidad po los modelos de mejo endimien o. En 2019 se publica Open Unmix [32], un modelo ep oducible, en enado sob e la base de da os MusDB [33] que p esen a una g an base pa a la in es igación de es a emá ica. Un año más a de apa ece D3Ne [34] mejo ando la ecnología en el dominio del espec og ama. Es e modelo usa con oluciones dila adas con conexión densa. También en 2020 se p esen a o a a qui ec u a llamada Splee e [35] que ha sido ampliamen e adop ada en la indus ia musical debido a su g an endimien o. Po o a pa e, ecien emen e se han desa ollado modelos que ope an sob e la o ma de onda en luga de hace lo sob e el espec og ama. En p ime luga , apa ece Wa e-U-Ne [36], un modelo que ue adap ado al dominio de la o ma a pa i de o o inicial basado en el espec og ama. Si bien es e modelo supuso un pun o de pa ida, su endimien o es á muy alejado de los modelos basados en espec og amas que se han comen ado an e io men e. L Es ado del a e 16 Pos e io men e se p esen an Tasne [37] y Con -Tasne [38]. Es e úl imo es una e sión e inada de Tasne que sus i uye la LSTM p opues a inicialmen e po una supe posición de con oluciones dila adas. Es o supuso una no able mejo a en los esul ados. Po úl imo, cabe des aca la apa ición de Demucs [39], un modelo al que le siguie on sucesi as e siones y que con inúa ac ualizándose a modelos más complejos y se ha si uado como uno de los mejo es a ni el de endimien o en el ma co de la sepa ación de uen es musicales. 17 4 METODOLOGÍA na ez ealizada la in oducción eó ica ace ca de la sepa ación au omá ica de uen es musicales y p esen ado el es ado de la écnica de es a, en es e capí ulo se pasa á a desc ibi los ecu sos, da ase s y a qui ec u as empleadas pa a cub i nues o obje i o inal de análisis y diseño de un modelo de sepa ación de uen es musicales. Pa a ello, en un p ime luga se pa i á del análisis de los modelos exis en es DeepCon Sep [29] y Open Unmix [32] y inalmen e se ealiza án una se ie de modi icaciones en la a qui ec u a de ed de es e úl imo modelo. 4.1 Recu sos u ilizados 4.1.1 Ha dwa e Tal y como se ha comen ado en la pa e eó ica de es e abajo, en ena un modelo de Machine Lea ning es una a ea que puede eque i una g an capacidad de cálculo compu acional. Si bien odos los modelos a ados en es e abajo pueden se en enados con la CPU, es a no esul a especialmen e e icien e y p olonga no ablemen e el iempo de en enamien o. Es po ello po lo que hemos hecho uso de las GPUs, especí icamen e diseñadas pa a esol e simul áneamen e un g an núme o de ope aciones. Conc e amen e, se ha usado un sis ema con las siguien es ca ac e ís icas: Tabla 4-1. Especi icaciones de la compu ado a usada. CPU I9-12900 H 2.5 GHz 12 h Gen RAM 32 GB ALMACENAMIENTO 1 TB SSD GPU NVIDIA GeFo ce RTX 3070 8 GB SISTEMA OPERATIVO Linux Pop!_OS 4.1.2 So wa e Pa a cada uno de los modelos a ados en es e abajo se ha hecho uso de di e en es e siones de Py hon y de dis in as lib e ías. Figu a 4-1. Logo de py hon U Me odología 18 Así pues, DeepCon Sep, se desa olla en Py hon 2.7 y emplea Theano y Lasagne pa a el en enamien o de las edes neu onales. Es e modelo usa o as dependencias ales como NumPy, SciPy o clima e. Figu a 4-2. Logos de Theano y Lasagne. Po su pa e, Open-Unmix y nues a e sión modi icada del mismo es án ealizadas en Py hon 3.7 y emplean la lib e ía PyTo ch en sus implemen aciones además de di e en es lib e ías en e las que des acan sciki -lea n, NumPy, SciPy, qdm, cuda oolki o FFmpeg. Figu a 4-3. Logos de PyTo ch y NumPy. A con inuación, se desc ibi án b e emen e an o el lenguaje de p og amación py hon y algunas de las lib e ías des acadas que se han comen ado an e io men e: • Py hon: Es un lenguaje de p og amación ampliamen e u ilizado en Machine Lea ning si bien su ámbi o de uso es mucho más amplio (aplicaciones web, desa ollo de so wa e, e c.). Es un lenguaje mul ipla a o ma muy e icien e y ácil de ap ende , in e p e ado, de al o ni el y o ien ado a obje os y en e sus nume osos bene icios des acan su ácil comp ensión, al ene una sin axis simila al inglés, su p oduc i idad o la g an can idad de biblio ecas con las que cuen a. Además, exis e una comunidad ac i a compues a po millones de desa ollado es al ededo del mundo que o ecen sopo e an e los dis in os p oblemas que pueden p esen a se. • Theano: Es una lib e ía que pe mi e de ini , op imiza y e alua e icien emen e exp esiones ma emá icas de ma ices de múl iples dimensiones. • Lasagne: Es una lib e ía pa a cons ui y en ena edes neu onales en Theano. • PyTo ch: Es una lib e ía de enso es op imizada pa a el ap endizaje p o undo que cuen a con la capacidad de ejecu a se en GPUs, con la consiguien e acele ación del en enamien o de los modelos. • NumPy: Es una lib e ía especializada en el cálculo numé ico y el análisis de da os que inco po a una clase de obje os denominadas a ays que pe mi e ep esen a colecciones de da os de un mismo ipo en múl iples dimensiones y cuen a con unciones muy e icien es pa a su manipulación. Pe mi e un p ocesamien o mucho mayo que las lis as con encionales de Py hon lo que la hace muy ú il pa a el p ocesamien o de ma ices de múl iples dimensiones. • SciPy: Es una lib e ía que incluye módulos es adís ica, op imización, algeb a lineal, ans o madas de Fou ie , p ocesamien o de señales, e c. • Sciki -Lea n: Es una lib e ía pa a el ap endizaje au omá ico que incluye e siones de muchos algo i mos de clasi icación, eg esión y análisis de g upos. 19 19 Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina 4.2 Da ase (MusDB18) Figu a 4-4. Esquema de la composición del da ase [40]. MusDB18 [33] es un conjun o de da os compues o po mezclas es e eo ónicas de 150 canciones comple as (al ededo de 10 ho as de du ación), que es án acompañadas po sus espec i as pis as aisladas co espondien es a ba e ía, bajo, oz y o os acompañamien os. En cuan o a la dis ibución de géne os musicales, al y como sucede con DSD100, los es ilos musicales que p edominan son y el pop y el ock al y como podemos obse a en la abla 4-3. Tabla 4-2. Dis ibución de géne os musicales del conjun o de da os MusDB18 GÉNERO MUSICAL NÚMERO DE CANCIONES Can au o 14 Coun y 3 Elec ónica 7 Hea y me al 12 Jazz 3 Pop/Rock 101 Rap/Reggae 10 MusDB18 cons a de dos subconjun os de da os. Uno de ellos es á compues o po 100 canciones y se usa pa a el en enamien o del modelo y el o o se compone de 50 canciones y es el ela i o a la p ueba de es e. Cabe señala que pa a nues o abajo hemos empleado el da ase MusDB18-HQ, idén ico al desc i o an e io men e, al y como se obse a en la igu a 4-5, pe o que cons a de a chi os WAV sin comp imi . Me odología 20 Figu a 4-5. Compa a i a de MusDB18 y MusDB18-HQ [33]. 4.3 Modelos de sepa ación de uen es musicales empleados 4.3.1 Modelo DeepCon Sep Es e modelo de sepa ación au omá ico de uen es musicales ue p opues o po P i ish Chadna y Ma ius Mi on en el año 2017 [29]. En la igu a 4-6 se mues a el diag ama de bloques del sis ema: Figu a 4-6. Diag ama de bloques del modelo DeepCon Sep La STFT se calcula pa a cada uno de los segmen os que componen la mezcla de audio. El espec og ama de magni ud esul an e pasa a a és de la ed neu onal con olucional, gene ándose una es imación pa a cada una de las uen es musicales sepa adas. Es a se usa pa a el cálculo de las másca as sua es de iempo- ecuencia aplicadas al espec og ama de magni ud de la mezcla pa a calcula las es imaciones de magni ud inal pa a las uen es sepa adas. Es as es imaciones, jun o con la ase de la mezcla de audio, se emplean pa a ob ene las señales de audio co espondien es a las uen es musicales sepa adas. En la igu a 4-6 se puede obse a la a qui ec u a de la ed neu onal de es e modelo, si bien solo se ep esen an dos salidas, aunque el sis ema es á compues o po cua o salidas (ba e ía, bajo, oz y o os ins umen os). 21 21 Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina Figu a 4-7. A qui ec u a de la ed neu onal del modelo DeepCon Sep [29] Como se obse a en la igu a 4-7, en el a ance a a és de la ed neu onal ienen luga una e apa de codi icación y o a de decodi icación. En ellas in e ienen las siguien es capas: • Capa de Con olución Ve ical: En ella se lle a a cabo una con olución e ical que iene po obje i o ob ene una ep esen ación de las ca ac e ís icas de ecuencia de la en ada. • Capa de Con olución Ho izon al: Modela la e olución empo al pa a los di e en es ins umen os a pa i de las ca ac e ís icas ap endidas en la capa an e io . • P ime a Capa comple amen e conec ada: Es a capa que es la úl ima de la ase de codi icación, iene como obje i o acili a la ob ención de ca ac e ís icas no lineales a pa i de las en adas an e io es. Es una capa compa ida po odas las salidas de las uen es y ac úa como cuello de bo ella de la ed. Usa una unción de ac i ación ReLU. • Segunda Capa comple amen e conec ada: Ac úa como il o pa a de e mina qué ca ac e ís icas son mejo es pa a de e mina las salidas pa a cada uen e. • Capa de Decon olución Ho izon al: En ella se lle a a cabo el paso opues o al que iene luga en la Capa de Con olución Ho izon al. • Capa de Decon olución Ve ical: Es a capa p opo ciona la salida inal de la ed que puede in e p e a se como las másca as de las uen es. 4.3.2 Modelo Open-Unmix El segundo modelo con el que hemos abajado es Open-Unmix. Se a a de un so wa e de código abie o que ope a con los espec og amas de audio. Se ca ac e iza po el empleo de capas LSTM bidi eccionales en su ed neu onal y en e sus p incipales en ajas des acan su acilidad de ep oducción y ampliación, así como la apidez en el ap endizaje de la ed. En la igu a 4-8 puede obse a se la es uc u a de es e modelo. Tal y como sucede en el modelo an e io , Open-Unmix ope a en el dominio de iempo- ecuencia. En una p ime a e apa la en ada de audio se di ide en segmen os ga an izándose así que no quede comp ome ido el cos e compu acional. El espec og ama de en ada se eco a a 16 KHz y se no maliza En enamien o de los modelos 28 Tabla 5-5. Núme o de épocas en enadas en Open-Unmix Ins umen o Núme o de épocas Voz 450 Ba e ía 210 Bajo 475 5.3 En enamien o del modelo p opues o El p oceso pa a ealiza el en enamien o sob e nues o modelo ha sido muy simila al desc i o pa a el modelo an e io ya que, como hemos comen ado an e io men e, el modelo que p oponemos iene su base en él. En la igu a 5-4 se mues a una cap u a ealizada du an e el en enamien o en la que pueden obse a se da os in e esan es ales como la du ación de las épocas (en o no a los 3 minu os), iempos medios de i e aciones den o de una época (en o no a 1 segundo) y las sucesi as pé didas. Es e úl imo alo es de g an ele ancia pues o que nos pe mi e iden i ica en qué momen o deja de mejo a el modelo. Figu a 5-4. Cáp u a de la consola de comandos du an e el en enamien o del modelo p opues o. Hay que des aca que modelo p opues o se en enó du an e menos iempo que Open-Unmix ya que la pé dida dejaba de educi se en épocas más emp anas que el modelo an e io . En la abla 5-6 se mues a el núme o de épocas en enadas po el modelo pa a cada uen e. Tabla 5-6.Núme o de épocas en enadas en el modelo p opues o Ins umen o Núme o de épocas Voz 160 Ba e ía 75 Bajo 100 29 29 Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina Pa a inaliza , en la abla 5-7 puede e se el ajus e inal de los pa áme os, que como hemos dicho, es muy simila al del modelo an e io . Tabla 5-7.Valo es de pa áme os des acados en el modelo p opues o. --ba ch-size 32 --seq-du 6.0 --hidden-size 512 --l 0.001 --weigh _decay 0.00001 --bandwid h 16000 --n 4096 Con iene ecalca que los es modelos se han en enado con múl iples con igu aciones dis in as pe o los alo es ecogidos en las ablas an e io es son los que nos han o ecido mejo es esul ados. Es os esul ados se p esen a án a con inuación en el capí ulo siguien e. 30 6 RESULTADOS na ez en enados ealizado el en enamien o de los dis in os modelos, ealizamos una e aluación obje i a de los esul ados de sepa ación de es os. A lo la go de es e capí ulo se p esen an los dis in os esul ados ob enidos basados en las medidas que se desc ibie on en la sección 2.4 de es a memo ia. 6.1 E aluación del modelo DeepCon Sep En p ime luga , as el en enamien o del algo i mo DeepCon Sep, ob u imos unos esul ados que subje i amen e se alejaban de nues as expec a i as ya que, si bien en la sepa ación de un ins umen o en conc e o se pe cibía la a enuación del es o de los ins umen os, es os pe manecían siendo no ablemen e audibles. Es o pod ía se debido a un ajus e inadecuado de los hipe pa áme os, aunque lo cie o es que al ealiza la e aluación obje i a los esul ados no di e ían en exceso a los que se p esen an en [29] y cuyos esul ados comple os pueden obse a se en la abla 6-3. Tal y como se obse a en la abla 6-1, es e modelo p esen a un mejo desempeño en la sepa ación de la ba e ía espec o al es o de las uen es, lo que pod ía se debido a la o ma que ienen los il os en la p ime a de las capas con olucionales haciéndolos e icien es en el modelado de señales pe cusi as. Tabla 6-1. Mediana de las medidas de e aluación obje i a en dB. SDR SIR SAR Voz 2.35 2.69 6.49 Bajo 2.32 1.99 6.13 Ba e ía 2.72 7.74 5.92 En la abla 6-2 se mues an las medidas SDR pa a cada uno de los géne os musicales. Tabla 6-2. Valo es de SDR po géne os musicales (modelo DeepCon Sep). Pop/Rock Reggae/Rap Elec ónica Hea y Me al Voz 2.94 2.88 -11.39 2.26 Bajo 2.59 1.59 3.27 0.17 Ba e ía 2.73 2.63 2.62 5.31 U 31 31 Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina Tabla 6-3. Valo es de los esul ados de la e aluación obje i a del modelo DeepCon Sep. ID canción SDR SIR SAR VOZ BATERÍA BAJO VOZ BATERÍA BAJO VOZ BATERÍA BAJO 1 4.03 1.65 3.40 6.71 1.37 3.79 8.60 3.40 7.47 2 5.74 3.40 -9.53 11.25 3.55 -7.59 9.25 10.24 5.50 3 3.26 3.31 2.58 7.25 5.73 1.81 8.71 6.33 7.07 4 1.33 2.63 3.28 3.18 5.36 2.40 5.39 4.30 9.31 5 2.05 3.01 2.80 2.55 4.50 2.49 5.99 6.17 6.70 6 -4.87 6.83 3.92 -6.25 11.41 6.12 3.25 9.22 6.50 7 4.83 2.33 3.80 9.58 3.39 4.36 5.88 4.34 7.62 8 3.51 2.03 2.21 5.71 3.64 1.32 6.41 4.19 8.92 9 2.82 5.68 3.40 4.14 10.39 3.79 6.78 8.42 6.20 10 3.26 -0.66 -6.72 4.59 0.89 -8.01 9.02 4.63 5.53 11 4.41 6.81 1.78 6.97 10.48 0.77 9.52 9.37 4.51 12 3.15 3.65 0.17 7.17 6.31 -2.69 4.47 8.10 2.13 13 4.53 5.43 3.05 6.39 8.54 2.82 8.63 7.28 6.52 14 1.38 4.03 0.68 3.09 5.12 -0.25 3.06 7.56 3.71 15 1.45 3.06 2.38 1.75 7.27 3.63 5.60 5.76 5.37 16 0.82 2.69 1.05 0.59 3.23 -0.06 4.66 4.58 5.07 17 -1.77 0.99 3.13 3.04 -0.92 3.28 5.67 6.07 7.10 18 2.43 2.05 0.17 3.40 3.51 -0.59 7.04 4.89 5.06 19 1.94 8.45 0.07 4.71 12.18 -2.98 6.33 11.57 6.12 20 4.36 1.79 3.64 10.63 14.86 6.40 10.09 11.03 4.96 21 2.19 2.74 1.59 3.25 6.09 0.98 4.98 6.51 5.85 22 6.42 -4.66 0.68 11.23 -1.64 -0.47 9.97 3.74 6.26 23 2.08 2.76 2.72 4.22 4.43 -1.05 8.57 5.13 6.58 24 3.57 5.95 2.25 4.29 9.29 1.75 9.81 9.28 5.02 25 1.08 0.44 2.96 0.55 -2.25 2.09 10.02 3.64 8.25 26 3.13 4.67 1.42 4.49 9.02 1.13 6.09 7.95 3.37 27 -0.30 2.59 2.59 0.91 4.98 2.68 8.86 6.25 6.14 28 -37.62 7.24 3.41 -36.12 11.93 3.40 -0.32 9.76 -0.61 29 -21.17 4.13 0.57 -28.73 10.47 18.64 0.01 8.51 1.72 30 3.53 4.67 4.12 6.72 5.68 10.43 5.43 9.61 4.44 31 1.84 1.64 2.70 2.83 1.49 1.30 5.39 6.59 7.43 32 2.35 -0.39 2.99 3.23 -1.35 3.89 7.29 3.68 5.59 33 1.68 1.24 0.22 1.62 0.64 -1.96 7.19 3.34 7.75 34 2.74 1.96 4.59 3.71 2.63 5.15 6.58 3.84 9.65 35 6.01 8.73 3.26 13.11 14.63 5.52 10.62 11.76 4.18 36 5.28 1.10 0.35 8.38 1.35 -1.26 8.99 4.21 7.18 37 -2.95 -0.31 -1.88 -1.70 -1.01 0.36 1.88 2.27 1.67 38 -0.18 1.10 4.29 -1.39 0.73 5.76 6.24 3.78 6.69 39 3.11 1.09 0.97 3.67 0.76 3.31 6.78 3.27 5.45 40 3.77 1.15 2.26 4.50 2.34 3.03 6.25 1.71 5.88 41 1.31 4.29 -2.23 1.68 5.23 -5.91 7.99 10.21 6.84 42 1.40 1.50 -1.24 1.62 2.15 -2.92 3.78 1.80 4.06 43 -1.79 1.18 6.33 0.24 0.92 8.67 9.26 4.77 8.93 44 2.22 1.86 3.13 3.23 2.24 1.99 5.97 4.22 6.52 45 6.21 4.37 3.58 8.45 8.24 4.53 10.11 5.60 6.59 46 1.17 0.49 -4.55 0.97 -2.58 -8.07 1.55 5.46 11.75 47 2.26 5.31 1.57 3.44 9.99 0.96 4.57 6.99 4.37 48 4.79 2.80 7.14 7.85 5.03 10.99 9.68 3.61 9.27 49 1.13 6.01 -1.89 -2.21 7.55 -6.23 3.55 11.72 6.00 50 2.94 3.95 -0.75 3.40 6.82 -2.88 8.28 6.28 5.63 Resul ados 32 6.2 E aluación del modelo Open-Unmix En la abla 6-6 se mues an los esul ados comple os de e aluación obje i a del modelo que en enamos de Open-Unmix, ealizada sob e el conjun o de p ueba MusDB-HQ. La abla 6-4 ecoge los alo es de la mediana pa a cada una de las medidas de e aluación. Tabla 6-4. Medidas de e aluación obje i a en dB ob enidas en el modelo Open-Unmix. SDR SIR SAR Voz 5.98 14.81 4.01 Ba e ía 5.45 14.40 4.65 Bajo 4.92 16.52 2.24 En is a a los esul ados ob enidos, nues o modelo o ece unos esul ados muy simila es a los que ob u ie on sus au o es, po lo que c eemos que el ine- unning de es e modelo, desc i o en la sección 5.2, ha esul ado óp imo. En la abla 6-5 se mues an las medidas SDR pa a cada uno de los géne os musicales ob enidas en la e aluación de es e modelo. Tabla 6-5. Valo es de SDR po géne os musicales (modelo Open-Unmix). Pop/Rock Reggae/Rap Elec ónica Hea y Me al Voz 6.06 6.48 -3.78 5.6 Bajo 5.32 4.24 0.9 4.28 Ba e ía 5.41 5.5 4.87 6.53 Open-Unmix ep esen a una g an opción como sis ema de sepa ación, aunque en la ac ualidad sus esul ados se han is o supe ados po o os modelos como se puede e en la abla 6-6. Tabla 6-6. Algo i mos con mejo es esul ados en Musdb18-HQ [42]. Modelo SDR (medio) SDR (bajo) SDR (ba e ía) SDR ( ocales) Spa se HT Demucs 9.20 10.47 10.83 9.37 Hyb id T ans o me Demucs 9.00 10.39 10.08 9.20 Band-Spli RNN 8.97 8.16 10.15 10.47 TFC-TDF-Une 8.34 8.45 8.44 9.59 KUIELab-MDX-Ne 7.47 7.83 7.20 8.97 CWS-PResUNe 6.77 5.93 6.38 8.92 33 33 Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina Tabla 6-7. Valo es de los esul ados de la e aluación obje i a del modelo Open-Unmix. ID canción SDR SIR SAR VOZ BATERÍA BAJO VOZ BATERÍA BAJO VOZ BATERÍA BAJO 1 7.20 4.51 -3.64 16.73 11.06 6.28 7.90 5.23 -3.19 2 6.41 3.44 5.52 10.85 4.08 16.36 5.17 1.18 2.30 3 8.33 5.32 4.46 10.53 9.01 20.41 6.63 4.08 1.17 4 5.73 5.50 6.21 -0.33 -8.36 19.42 12.68 11.41 -10.24 5 2.75 8.65 6.54 -3.91 -2.58 30.67 0.66 1.57 0.09 6 9.17 6.07 9.04 3.16 -12.56 13.03 4.05 0.17 1.36 7 2.45 6.30 6.70 18.13 16.06 16.54 2.50 5.95 6.44 8 7.39 5.49 5.56 22.17 16.05 17.81 6.63 4.72 5.32 9 1.34 7.36 6.18 -1.54 4.48 13.44 0.26 4.58 2.41 10 4.62 3.62 -1.18 21.98 11.23 1.91 3.24 3.07 -0.35 11 8.37 8.97 4.28 1.68 7.10 31.03 2.99 5.81 0.08 12 6.89 4.99 0.00 12.65 16.99 1.36 7.60 5.73 -0.05 13 8.42 0.95 3.43 27.19 -5.04 -1.29 0.22 0.16 1.06 14 5.53 8.40 4.67 25.03 17.59 19.74 4.97 8.91 2.96 15 4.11 6.44 6.52 12.67 14.21 14.26 3.08 5.89 5.34 16 3.96 6.35 2.72 24.27 12.37 10.12 3.35 6.81 2.99 17 6.44 4.54 0.69 19.94 15.11 11.67 6.19 3.95 -0.85 18 5.43 5.42 4.94 3.91 -0.37 24.24 2.54 1.91 0.17 19 7.13 9.63 1.64 23.91 24.24 17.30 7.27 9.83 -0.12 20 9.19 1.80 9.14 17.64 20.33 22.49 9.37 8.27 9.48 21 6.48 7.09 5.65 8.61 7.79 22.37 4.66 5.00 0.41 22 9.93 4.63 4.44 22.97 11.33 14.51 9.15 3.62 4.42 23 8.10 4.29 6.40 3.10 -6.08 5.11 3.59 0.39 1.61 24 8.08 7.67 4.24 18.86 17.78 11.96 7.41 8.31 3.53 25 3.45 5.30 9.28 24.94 18.50 16.39 2.38 5.29 8.52 26 8.56 12.10 6.84 2.93 7.15 24.28 3.79 6.95 0.55 27 5.15 7.99 4.80 8.88 4.65 22.59 3.96 4.17 0.29 28 -11.06 10.85 0.00 -30.82 16.56 16.63 -0.49 13.02 -1.87 29 -9.91 5.28 1.09 -25.71 16.09 20.99 2.35 8.69 1.96 30 5.74 6.33 4.57 13.90 14.64 17.69 6.38 7.50 5.84 31 4.12 4.49 5.83 -1.37 -10.71 6.54 1.03 0.21 2.18 32 10.09 3.22 8.01 24.61 15.74 16.58 9.79 1.74 8.50 33 5.06 3.82 3.73 22.50 16.32 17.01 4.43 2.83 2.30 34 6.22 5.13 9.49 18.85 15.72 18.31 6.08 4.87 10.21 35 10.68 10.49 6.79 15.66 21.65 17.31 11.62 12.49 6.42 36 7.76 2.67 -0.33 14.21 -6.53 13.58 6.33 0.15 -0.01 37 0.00 5.77 9.32 10.60 15.82 14.76 -0.40 5.64 9.63 38 2.34 4.38 10.35 7.23 17.59 20.54 3.50 6.19 10.55 39 5.65 3.12 11.94 22.00 22.16 28.29 5.59 3.62 12.03 40 4.87 6.82 1.14 6.19 -0.04 9.93 3.57 1.57 -0.27 41 2.76 7.14 2.48 13.32 16.71 19.80 1.81 7.81 2.42 42 2.49 7.42 6.27 16.68 13.36 16.49 0.90 9.03 5.02 43 7.08 4.77 4.90 24.11 15.58 14.96 6.75 3.88 3.58 44 7.84 4.15 8.23 24.87 15.00 14.85 8.40 1.85 8.98 45 9.35 0.50 5.33 18.52 14.74 6.56 9.61 -1.49 6.80 46 2.82 3.00 1.63 12.35 12.33 7.65 1.90 1.31 0.13 47 7.10 11.93 4.28 0.44 -4.31 17.86 2.78 1.38 0.08 48 6.98 3.80 9.72 16.14 11.61 16.30 6.87 3.52 11.98 49 4.26 9.25 1.24 15.41 14.60 13.80 3.22 9.23 -1.23 50 5.66 6.53 1.09 25.07 15.50 17.14 5.37 6.76 -3.60 Resul ados 34 6.3 E aluación del modelo p opues o Pa a inaliza , se ealizó una e aluación del modelo p opues o. A ni el subje i o, pe cibimos una sepa ación acep able, en la que, si bien en algunas canciones la e iciencia de la sepa ación es mejo que o as, a ni el gene al se de ec a cla amen e la p edominancia del ins umen o a sepa a . En la abla 6-10 se mues an las medidas de e aluación obje i as ob enidas sob e el conjun o de p ueba de MusDB18-HQ. La abla 6-8 con iene los alo es de la mediana pa a cada una de las medidas obje i as. Tabla 6-8. Medidas de e aluación obje i a del modelo p opues o. SDR SIR SAR Voz 3.41 9.65 2.05 Ba e ía 3.97 8.64 3.09 Bajo 3.37 13.51 0.98 En la abla 6-8 puede obse a se que los esul ados son in e io es a los o ecidos po Open-Unmix ( abla 6-4) pe o si ep esen an una mejo a signi ica i a con espec o a los que ob u imos con el modelo de DeepCon Sep. A su ez se obse a que ob enemos un mejo SDR en la sepa ación de la ba e ía. Es o puede se debido a lo comen ado an e io men e en la e aluación de DeepCon Sep ya que la a qui ec u a del modelo que p oponemos es á cla amen e inspi ada en la de es e modelo de sepa ación. La abla 6-9 ecoge los alo es de SDR ob enidos pa a cada es ilo musical. Tabla 6-9. Valo es de SDR po géne os musicales (modelo p opues o). Pop/Rock Reggae/Rap Elec ónica Hea y Me al Voz 3.97 3.10 -14.37 3.85 Bajo 3.55 2.54 1.55 3.54 Ba e ía 3.96 2.2 3.72 7.15 35 35 Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina Tabla 6-10. Valo es de los esul ados de la e aluación obje i a del modelo p opues o. ID canción SDR SIR SAR VOZ BATERÍA BAJO VOZ BATERÍA BAJO VOZ BATERÍA BAJO 1 5.51 3.93 -3.66 9.78 7.75 3.82 6.69 5.41 -2.69 2 4.86 2.28 3.41 6.01 0.34 12.78 3.45 0.83 1.32 3 6.03 3.63 2.25 5.55 2.94 18.53 3.58 2.01 -0.04 4 2.35 0.74 3.13 -0.20 -11.83 15.52 1.10 -0.09 0.11 5 1.99 7.38 4.23 -9.40 -0.55 26.48 0.24 2.10 0.09 6 6.25 4.42 7.11 4.46 -12.84 6.12 3.93 0.16 1.07 7 1.44 5.27 5.09 16.74 11.74 14.65 1.02 5.55 4.69 8 4.87 3.84 4.08 15.92 11.47 13.59 4.22 3.19 3.62 9 1.87 8.02 4.24 -1.81 4.85 9.62 -0.01 4.79 1.26 10 3.03 3.37 -0.26 16.39 9.75 0.19 2.10 3.14 0.00 11 6.17 8.96 2.96 -3.01 -0.78 28.47 1.25 2.36 0.04 12 3.47 5.36 0.06 9.51 12.00 -14.56 5.76 6.48 -0.07 13 4.85 1.76 -0.56 25.97 -7.49 -8.77 0.10 0.06 0.89 14 3.37 7.40 2.00 22.48 13.17 14.70 2.41 8.41 0.55 15 3.05 4.67 4.29 8.02 10.63 13.42 1.66 4.06 3.11 16 1.78 3.98 2.18 14.59 5.45 3.73 0.60 6.17 2.95 17 4.51 2.50 -0.90 16.83 9.12 7.79 3.92 1.20 -1.60 18 3.85 4.01 3.84 0.21 -5.03 19.32 1.08 0.63 0.08 19 4.43 6.83 0.33 17.72 18.48 16.51 3.85 7.59 -0.37 20 1.99 0.06 1.20 7.34 1.46 0.76 1.01 -1.34 2.39 21 3.27 6.09 3.98 3.32 6.96 20.11 1.45 4.34 0.34 22 8.12 3.73 3.84 21.54 10.11 13.26 7.50 2.75 3.19 23 4.99 3.94 5.31 1.08 -8.10 -1.01 2.00 0.38 0.59 24 3.10 5.38 2.54 10.82 10.58 11.64 2.99 6.44 1.14 25 0.61 3.97 5.94 19.40 17.02 11.36 0.71 4.22 5.50 26 4.45 9.57 5.02 -5.60 -1.88 20.64 0.79 2.06 0.13 27 4.80 6.69 3.63 2.57 0.64 20.35 2.39 2.50 0.17 28 -44.21 8.26 0.27 -40.33 12.45 3.88 -0.44 11.69 -0.96 29 -18.93 4.94 0.92 -26.78 12.53 20.12 0.00 8.70 1.80 30 3.45 3.18 2.32 10.44 5.03 18.73 4.21 7.86 3.13 31 2.56 3.56 3.53 -7.24 -0.66 8.03 0.00 1.58 0.34 32 6.92 1.91 6.24 17.42 8.51 15.05 6.28 1.78 6.83 33 2.53 2.37 0.05 16.84 10.72 9.00 1.84 0.80 -0.05 34 3.30 3.82 7.28 14.49 11.29 13.79 2.77 3.41 7.78 35 7.43 8.15 3.34 11.51 15.79 13.62 9.63 10.49 3.18 36 5.41 2.20 0.00 11.70 -5.85 16.76 4.04 0.26 -0.05 37 0.50 3.24 6.88 3.92 9.80 13.02 -3.02 3.04 7.21 38 0.93 2.44 6.63 7.16 9.86 18.79 1.19 3.88 7.15 39 4.09 1.67 11.12 15.29 11.11 23.01 4.03 2.58 12.05 40 2.73 4.78 0.10 1.95 0.44 18.12 0.75 1.80 -0.05 41 1.16 5.45 2.48 7.51 11.85 14.26 2.18 6.13 2.53 42 0.82 6.26 4.60 9.13 10.74 18.10 0.44 6.99 3.36 43 4.81 2.71 3.81 18.67 8.79 11.84 4.20 1.60 2.89 44 5.63 4.23 7.12 19.95 11.67 11.78 5.43 4.18 8.37 45 7.56 1.37 1.59 13.91 5.28 0.10 7.88 0.89 9.21 46 1.40 2.19 -3.49 7.59 7.82 1.61 -0.36 1.06 -5.42 47 5.15 10.28 3.54 -7.71 -5.19 16.71 0.56 1.10 0..06 48 5.18 2.89 7.57 14.68 6.36 15.33 4.80 3.24 9.72 49 1.75 7.15 0.42 14.47 11.29 6.75 0.56 8.00 -4.54 50 3.23 5.78 1.09 18.77 12.52 6.21 2.31 6.09 -1.28 36 7 CONCLUSIONES Y FUTUROS PASOS n es e úl imo capí ulo se expond án las dis in as conclusiones que se han ido ob eniendo du an e la ealización de es e abajo. Además, pa a inaliza , se p opond án algunas líneas de in es igación. 7.1 Conclusiones A lo la go de es e abajo se ha analizado la a qui ec u a, el uncionamien o y endimien o de di e sos algo i mos des acados del es ado del a e de la sepa ación au omá ica de uen es musicales. Se decidió cen a el es udio en dos de ellos: DeepCon Sep y Open-Unmix. En un p ime luga se op ó po el algo i mo DeepCon Sep ya que nues o abajo se inició es udiando la esis doc o al “Sou ce Sepa a ion Me hods o O ches al Music: Timb e-In o med and Sco e- In o med S a egies” elabo ada po Ma ius Mi on de la Uni e sidad Pompeu Fab a [42] y en ella se p oponía es e in e esan e modelo de sepa ación. Una ez analizado, en enado y e aluado es e modelo que hace uso de edes con olucionales en su a ea de sepa ación, se decidió p o undiza en o o algo i mo que usase o o ipo de edes neu onales y así pode compa a el desempeño de unas y o as edes. Pa a ello, se escogió Open-Unmix debido a su acilidad de ep oducción, modi icación y ampliación además de que o ecía unos buenos esul ados de sepa ación. Si bien el es udio y ep oducción de DeepCon Sep ue un buen pun o de pa ida pa a aden a nos en el conocimien o de las edes neu onales, desde su publicación ha pasado unos años, con el consiguien e desa ollo de nue os modelos que o ecen unos esul ados supe io es. Además, es e algo i mo es á implemen ado en Py hon 2.7, el cual se encuen a desac ualizado en la ac ualidad. Es po ello po lo que se conside ó in e esan e implemen a un modelo inspi ado en las edes con olucionales que se p oponen en DeepCon Sep ap o echando el so wa e de código abie o que Open-Unmix o ece como pun o de pa ida pa a la in es igación de es a emá ica. Es o con ibuyó a la consecución de los obje i os iniciales que se es ablecie on en la e apa inicial de es e abajo. Si bien con nues o modelo p opues o no conseguimos iguala los esul ados alcanzados po Open- Unmix, el uso de un so wa e ac ualizado o el empleo de unciones de ac i ación ReLU a la salida de las capas con olucionales, en e o as cosas, supusie on una mejo a en los esul ados en compa ación a los que se ob u ie on con DeepCon Sep. Como hemos comen ado, du an e odo el abajo hemos op ado po implemen aciones de código abie o lo que ha supues o una g an ayuda en é minos de a ance en la in es igación. Además de los modelos expues os a lo la go de es a memo ia se han analizado o os, los cuales han sido inalmen e desca ados debido a su complejidad o a incon enien es su gidos en el en enamien o de es os ales como dispone de una capacidad compu acional insu icien e. E 37 37 Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina 7.2 Fu u os pasos Pa a ob ene una sepa ación de buena calidad median e el uso de algo i mos de ap endizaje máquina, se necesi a dispone de una g an can idad de da os. T abajos u u os pod ían cen a se en la c eación de bases de da os más amplias y de es ilos musicales conc e os que pe mi a a los modelos especializa se en ellos. Si bien el uso de la STFT simpli ica eno memen e las a qui ec u as de edes empleadas en los sis emas de sepa ación de uen es, no esul a adecuado pa a odas las señales que es án p esen es en las composiciones musicales. Además, desca ando la in o mación de ase pod ía pe de se in o mación ele an e. Es po ello po lo que op a po o as écnicas como las en anas adap a i as pa a ep esen a el audio pod ían mejo a los sis emas de sepa ación. Anexo A: Código implemen ado 44 sel .laye = nn.Sequen ial( nn.Linea (30, 512), nn.ReLU(), nn.Linea (512,30), nn.ReLU(), ) i inpu _mean is no None: inpu _mean = o ch. om_numpy(-inpu _mean[: sel .nb_bins]). loa () else: inpu _mean = o ch.ze os(sel .nb_bins) i inpu _scale is no None: inpu _scale = o ch. om_numpy(1.0 / inpu _scale[: sel .nb_bins]). loa () else: inpu _scale = o ch.ones(sel .nb_bins) sel .inpu _mean = Pa ame e (inpu _mean) sel .inpu _scale = Pa ame e (inpu _scale) sel .ou pu _scale = Pa ame e ( o ch.ones(sel .nb_ou pu _bins). loa ()) sel .ou pu _mean = Pa ame e ( o ch.ones(sel .nb_ou pu _bins). loa ()) de eeze(sel ): # se all pa ame e s as no equi ing g adien , mo e RAM-e icien # a es ime o p in sel .pa ame e s(): p. equi es_g ad = False sel .e al() 45 de o wa d(sel , x: Tenso ) -> Tenso : """ A gs: x: inpu spec og am o shape `(nb_samples, nb_channels, nb_bins, nb_ ames)` Re u ns: Tenso : il e ed spec og am o shape `(nb_samples, nb_channels, nb_bins, nb_ ames)` """ mix = x.de ach().clone() x = sel .encode (x) x = sel .laye (x. iew(-1,30)) x = x. iew(nb_samples,30,1,-1) x = sel .decode(x) x = F. elu(x) * mix e u n 46