Full text
Equa ion Chap e 1 Sec ion 1
T abajo Fin de G ado
G ado en Ingenie ía de las Tecnologías de
Telecomunicación
Sepa ación au omá ica de ins umen os musicales
u ilizando ap endizaje máquina
Au o : Hugo Gue a Co nejo
Tu o : F ancisco José Simois Ti ado
Dp o. Teo ía de la Señal y Comunicaciones
Escuela Técnica Supe io de Ingenie ía
Uni e sidad de Se illa
Se illa, 2023
iii
T abajo Fin de G ado
G ado en Ingenie ía de las Tecnologías de Telecomunicación
Sepa ación au omá ica de ins umen os musicales
u ilizando ap endizaje máquina
Au o :
Hugo Gue a Co nejo
Tu o :
F ancisco José Simois Ti ado
P o eso Con a ado Doc o
Dp o. de Teo ía de la Señal y Comunicaciones
Escuela Técnica Supe io de Ingenie ía
Uni e sidad de Se illa
Se illa, 2023
T abajo Fin de G ado: Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina
Au o :
Hugo Gue a Co nejo
Tu o :
F ancisco José Simois Ti ado
El ibunal nomb ado pa a juzga el P oyec o a iba indicado, compues o po los siguien es miemb os:
P esiden e:
Vocales:
Sec e a io:
Acue dan o o ga le la cali icación de:
Se illa, 2023
El Sec e a io del T ibunal
ii
Ag adecimien os
Es e abajo supone el in de una e apa. Po ello, me gus a ía ag adece a odas aquellas pe sonas que
han es ado conmigo en es e pe iodo:
A mi amilia, en especial a mis pad es, po sus enseñanzas, ca iño y apoyo incondicional en los buenos
y malos momen os. Sin ellos no se ía posible habe eco ido es e camino.
A mis compañe os y amigos, po odos los buenos a os i idos y po habe me apo ado o as isiones
de la ida.
A mi u o , F ancisco José Simois, po b inda me la opo unidad de hace es e abajo y su buena
a ención conmigo cada ez que lo he necesi ado.
ix
Resumen
La sepa ación de uen es sono as ha sido en los úl imos iempos, uno de los emas más ecu en es en
el ámbi o del p ocesado de señal. El a ance en disciplinas ales como el Deep Lea ning ha supues o una
g an con ibución en la mejo a de los algo i mos que a an de ec ea la habilidad humana de iden i ica
uen es sono as de mane a indi idual.
Es e abajo se cen a en abo da el es udio de las dis in as écnicas de sepa ación de uen es musicales
en mezclas es e eo ónicas. En él se p esen an las cla es pa a la implemen ación y e aluación de un
modelo que pe mi a sepa a los di e en es ins umen os musicales de mezclas musicales p o esionales.
Pa a ello se comienza analizando las p opues as exis en es de sis emas basados en edes neu onales y
su endimien o pa a, pos e io men e, implemen a una a qui ec u a de sepa ación au omá ica de uen es
musicales y ealiza al sis ema esul an e una e aluación de medidas obje i as.
x ii
ÍNDICE DE FIGURAS
Figu a 1-1. Sepa ación de uen es musicales [3]. 1
Figu a 2-1. Diag ama de una ed neu onal. 4
Figu a 2-2. Diag ama de una neu ona a i icial. Adap ado de [9]. 5
Figu a 2-3. Funciones de ac i ación. 6
Figu a 2-4. E ec o del sob eajus e 7
Figu a 2-5. Funcionamien o del d opou . Adap ada de [12]. 7
Figu a 2-6. Ejemplo de dos con oluciones con en adas 2D [3]. 8
Figu a 2-7. Ejemplo de ag upación máxima y ag upación media [14]. 9
Figu a 2-8. Implemen ación de modulo LSTM [16]. 9
Figu a 2-9. Ejemplo de o ma de onda pa a la oz humana masculina [17]. 10
Figu a 2-10. Ejemplo de espec og ama. 11
Figu a 2-11. Tipos de en anas más comunes en la sepa ación de uen es [3]. 11
Figu a 2-12. P oceso de ob ención de la STFT [18]. 12
Figu a 2-13. Aplicación de una másca a iempo- ecuencia a un espec og ama. Adap ada de [3] 12
Figu a 4-1. Logo de py hon 17
Figu a 4-2. Logos de Theano y Lasagne. 18
Figu a 4-3. Logos de PyTo ch y NumPy. 18
Figu a 4-4. Esquema de la composición de los da ase s [40]. 19
Figu a 4-5. Compa a i a de MusDB18 y MusDB18-HQ [33]. 20
Figu a 4-6. Diag ama de bloques del modelo DeepCon Sep 20
Figu a 4-7. A qui ec u a de la ed neu onal del modelo DeepCon Sep [29] 21
Figu a 4-8. Es uc u a del modelo Open-Unmix [41]. 22
Figu a 4-9. A qui ec u a de la ed neu onal del modelo p opues o. 23
Figu a 5-1. P ime as épocas del en enamien o de DeepCon Sep 25
Figu a 5-2. Úl imas épocas del en enamien o de DeepCon Sep 25
Figu a 5-3. Cap u a de JSON que con iene los de alles de en enamien o 27
Figu a 5-4. Cáp u a de la consola de comandos du an e el en enamien o del modelo p opues o. 28
xix
ÍNDICE DE ECUACIONES
Ecuación 2-1. Función de ac i ación sigmoidea 5
Ecuación 2-2. Función de ac i ación angen e hipe bólica 5
Ecuación 2-3. Función de ac i ación ReLU 5
Ecuación 2-4. Salida de una neu ona a i icial. 6
Ecuación 2-5. Cálculo de la STFT 10
Ecuación 2-6. Descomposición de la uen e es imada pa a su e aluación. 13
Ecuación 2-7. Cálculo de la elación señal a dis o sión. 13
Ecuación 2-8. Cálculo de la elación señal a in e e encia. 13
Ecuación 2-9. Cálculo de la elación señal a a e ac os. 14
1
1 INTRODUCCIÓN
a sepa ación de uen es sono as (SSS) es el p oceso po el cual se ex aen una o a ias señales de
in e és de una mezcla musical que con iene múl iples señales supe pues as. Es o iene una
especial impo ancia en el p ocesamien o de señales pues o que elimina uen es indeseadas como
el uido o aisla las señales de in e és pe mi e ope a con señales sin in e e encias.
El se humano cuen a con la habilidad de sepa a las di e en es uen es de audio. Es o es algo que en la
década de los cincuen a ue denominado e ec o de ies a de cóc el [1]. Aunque es cie o que se han
log ado no ables a ances en los úl imos iempos pa a ec ea es a habilidad en o denado es, es un campo
que con inúa en cons an e desa ollo e in es igación.
Una ama conc e a enma cada den o de la sepa ación de uen es sono as es la sepa ación de uen es
musicales (MSS). Es a iene como obje i o di idi una mezcla de audio musical en los di e en es
ins umen os que la componen. Es a sepa ación iene aplicaciones ales como la ealización de un
“ka aoke”, el emezclado de canciones, la gene ación de sonido en ol en e, la es au ación de
g abaciones an iguas, el análisis de ins umen os po sepa ado y un la go e cé e a. Po ello la sepa ación
de uen es musicales es un ema ampliamen e es udiado den o de la comunidad de ecupe ación de
in o mación musical (MIR) y sob e el que habi ualmen e se o ganizan e os y campañas de e aluación
ales como la SISEC [2].
Figu a 1-1. Sepa ación de uen es musicales [3].
En es e abajo nos cen a emos en la sepa ación de ins umen os ( uen es) musicales a pa i de mezclas
de audio es e eo ónicas. En conc e o, pa iendo de dichas mezclas a a emos de ob ene a chi os de
audio co espondien es a es uen es musicales: oz, ba e ía y bajo. Además, sepa a emos una cua a
uen e ela i a al es o de ins umen os p esen es en la composición musical.
Siguiendo con es e apa ado in oduc o io, a con inuación, se enume a án de mane a sin e izada los
dis in os obje i os que se p e enden alcanza en es e abajo y, inalmen e, se pasa á a de alla la mane a
en la que es á es uc u ada la memo ia.
L
In oducción
2
1.1 Obje i os
Los p incipales obje i os que es e abajo p e ende cub i son los siguien es:
1. Realiza un es udio del es ado del a e de las p incipales écnicas de sepa ación de uen es sono as
haciendo hincapié en las en ocadas a sepa ación de ins umen os musicales.
2. Analiza y comp ende dos de los p incipales algo i mos de sepa ación de uen es musicales
exis en es.
3. Gene a un código en Py hon de un modelo que pe mi a ealiza la sepa ación au omá ica de
ins umen os.
4. E alua de mane a obje i a los esul ados ob enidos a pa i de un conjun o de da os de p ueba.
1.2 O ganización de la memo ia
La memo ia del p esen e abajo se es uc u a en los sie e capí ulos que se desc iben a con inuación:
El p ime capí ulo, en el que se encuen a es a sección, apo a una b e e in oducción del ema a a a
en el abajo, así como los p opósi os que se ienen y un esumen de cómo se abo da á la ma e ia en las
dis in as secciones de la memo ia, pa a que el lec o pueda comp ende de mane a g adual la emá ica
es udiada.
El segundo capí ulo se cen a á en los undamen os eó icos p e ios a la p esen ación del abajo
ealizado. En él se in oduci án di e en es concep os elacionados con las edes neu onales la
ep esen ación y el enmasca ado de audio. Así mismo, se p esen a án las medidas pa a ealiza una
e aluación obje i a de la sepa ación.
Pos e io men e, en el e ce capí ulo, se ha á una e isión esumida del es ado del a e ela i o a la
sepa ación de uen es sono as haciendo especial mención a los algo i mos de sepa ación de
ins umen os musicales.
En el cua o capí ulo de es a memo ia, se de alla á la me odología empleada, mencionando los dis in os
equisi os necesa ios pa a la ealización de es e abajo y se desc ibi án de alladamen e las a qui ec u as
de edes neu onales seleccionadas pa a nues a a ea que nos ocupa.
A lo la go del quin o capí ulo se comen a án los de alles ela i os al en enamien o de los dis in os
modelos seleccionados, así como del modelo que se p opone.
En el sex o capí ulo se expond án los esul ados ob enidos con las a qui ec u as con las que se han
abajado y una pos e io compa ación con o os modelos exis en es, haciendo uso de medidas de
e aluación obje i as.
Las conclusiones, así como las líneas u u as de in es igación queda ás ecogidas en el sép imo y úl imo
capí ulo.
Además, se apo a á un anexo en el que se inclui á el código en Py hon del modelo de ed neu onal
implemen ado
Jun o con los sie e capí ulos y el anexo que se acaba de menciona , la memo ia con a á con un apa ado
dedicado a las e e encias empleadas a lo la go de la misma, índices de ablas, igu as y ecuaciones,
además de un glosa io.
3
2 FUNDAMENTOS TEÓRICOS
lo la go de es e capí ulo se in oduci án aquellos concep os undamen ales pa a comp ende los
sis emas de sepa ación au omá ico de uen es musicales median e ap endizaje máquina como
los que abo da emos más adelan e. Debido a que exis en mul i ud de elemen os suscep ibles de
se usados en es os p ocedimien os de sepa ación, se explica an con mayo p o undidad aquellos que
in e ienen en los sis emas a ados en es e abajo. En p ime luga , se p esen a án los undamen os
básicos del ap endizaje máquina y de las edes neu onales, y pos e io men e, se abo da án las cues iones
elacionadas con la ep esen ación y el enmasca amien o en iempo- ecuencia. Pa a inaliza es e
capí ulo eó ico, se comen a án las mé icas que emplea emos pa a e alua obje i amen e los modelos
a ados en es e abajo.
2.1 Ap endizaje Máquina
El ap endizaje máquina (Machine Lea ning) es una ama de la in eligencia a i icial (IA) que consis e
en enseña a equipos in o má icos a que ap endan de la expe iencia. Pa a ello, sus algo i mos se apoyan
en mé odos compu acionales en ocados a ap ende in o mación di ec amen e a a és de da os, sin
necesi a pa a ello una ecuación p ede e minada como modelo.
Su endimien o se op imiza de mane a adap a i a con o me aumen a el núme o de mues as con las que
cuen an pa a el ap endizaje [4].
Es os algo i mos pueden clasi ica se en cua o ipos de ap endizaje dependiendo de la salida espe ada,
así como del ipo de en ada:
• Ap endizaje supe isado. El sis ema ap ende en base un conjun o de da os de en enamien o
e ique ados y de inidos pa a e alua las co elaciones, especi icándose las en adas y salidas
del algo i mo. Es e ipo de ap endizaje iene como en aja la simplicidad y acilidad de diseño,
pe o supone el desa ío de e ique a la g an can idad de da os que necesi a.
• Ap endizaje no supe isado. El sis ema de ec a pa ones y ca ego iza da os a pa i de un
conjun o de da os en enamien o no e ique ados, sin dispone de los da os de salida deseados.
Si bien poseen una con igu ación ácil dado que no equie en e ique ado, es os modelos no
suelen o ece p edicciones p ecisas.
• Ap endizaje semisupe isado. En es e ipo de ap endizaje se combinan los dos ipos de
ap endizaje an e io men e comen ados. En el en enamien o se usan una pequeña can idad de
da os e ique ados y una g an can idad sin e ique a de mane a que, una ez en enado
pa cialmen e el algo i mo con da os e ique ados, es e se es capaz de e ique a los da os no
e ique ados.
• Ap endizaje po e ue zo: Se ap ende median e ecompensas, de mane a que el obje i o del
modelo es consegui el mayo núme o de pun os de ecompensas posible y alcanza una me a
[5].
A
Fundamen os eó icos
4
El conjun o de da os con el que abajan es os algo i mos suele di idi se en los siguien es subconjun os:
• Da os de en enamien o, sob e los que se ealiza la op imización de los pa áme os del modelo
(pesos y umb ales).
• Da os de alidación, que si en pa a e i ica el compo amien o del modelo y así pode
ajus a los hipe pa áme os en base a las p edicciones que el modelo ealiza sob e ellos.
• Da os de p ueba, sob e los que se ealiza la e aluación inal del modelo.
Den o del campo del ap endizaje máquina, exis e una a iedad especializada denominada ap endizaje
p o undo (Deep Lea ning) que aumen a la p ecisión de los algo i mos has a el pun o de supe a en
ocasiones al p opio endimien o humano. Sus modelos en enan con una g an can idad de da os
e ique ados y es os se enca gan po sí solos de ex ae las ca ac e ís icas a pa i de los da os empleando
pa a ello a qui ec u as basadas en edes neu onales que se desc ibi án en el siguien e pun o.
El a ance en los úl imos años del ap endizaje p o undo (DL) ha supues o que los algo i mos
adicionales empleados en la sepa ación de uen es ales como el análisis de componen es p incipales
(PCA) [6] o la ac o ización de ma ices no nega i as (NMF) [7], se hayan is o sus i uidas po
a qui ec u as de edes neu onales. Es o se debe, en g an medida, a que es os algo i mos de ap endizaje
son capaces de p opo ciona implemen aciones más ápidas y complejas que los an e io es o eciendo
mejo es esul ados.
2.1.1 Redes neu onales
Las edes neu onales, ambién llamadas edes neu onales a i iciales (ANN), son un subconjun o del
ap endizaje máquina y ep esen an una pa e undamen al en los algo i mos de ap endizaje p o undo.
Se a a de sis emas inspi ados en la es uc u a y el uncionamien o del ce eb o humano. Las ANN es án
basadas en en ena da os con el in de ap ende y mejo a su p ecisión con el iempo. Una ez ajus ados
de mane a p ecisa, son conside adas po en es he amien as en el mundo de la in eligencia a i icial que
pe mi en clasi ica y ag upa da os a g an elocidad [8].
Figu a 2-1. Diag ama de una ed neu onal.
Es as edes es án cons i uidas po capas o madas po una se ie de nodos in e conec ados en e sí,
denominados neu onas a i iciales. En la igu a 2-1 se mues a la es uc u a de una ed neu onal básica.
Las edes neu onales con ienen una capa de en ada, una o a ias capas ocul as y una capa de salida.
En es e ejemplo la ed con end ía dos a iables de en ada, es neu onas en cada una de las dos capas
ocul as y una en la capa de salida.
5
5
Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina
2.1.1.1 Neu onas a i iciales
Como acabamos de e , la unidad básica de la que es án do ados las edes neu onales son las neu onas
a i iciales. En la igu a 2-2 puede ap ecia se un diag ama de una neu ona a i icial.
Figu a 2-2. Diag ama de una neu ona a i icial. Adap ado de [9].
Una neu ona cons a básicamen e de los siguien es elemen os:
• En adas (𝑥𝑗): Reciben las salidas de o as neu onas o las en adas de la ed neu onal.
• Pesos (𝑤𝑘𝑗): De e minan el e ec o de las en adas en la neu ona a i icial.
• Umb al (𝑏𝑘): En ada ex e na a la neu ona. Su alo es modi icado du an e el en enamien o.
• Función de ac i ación (𝜑(·)): De e mina la salida de la neu ona aplicando una unción
ma emá ica a la en ada e ec i a. Son di e enciables y suelen se no lineales. Algunas de las
más empleadas son las siguien es:
o Sigmoidea (𝜎): Es muy adecuada pa a c ea las másca as sua es necesa ias en la
sepa ación y que se e án en una sección pos e io . En la igu a 2-5 a puede obse a se
su g á ica.
𝜎(𝑥)=1
1+𝑒−𝑥
Ecuación 2-1. Función de ac i ación sigmoidea
o Tangen e hipe bólica ( anh): Es más común emplea la en zonas in e medias de la ed
que en los ex emos. La igu a 2-5 b mues a la g á ica de es a unción.
anh(𝑥)=𝑒−𝑥 −𝑒−𝑥
𝑒−𝑥 +𝑒−𝑥
Ecuación 2-2. Función de ac i ación angen e hipe bólica
o Unidad lineal ec i icada (ReLU): A eces se emplea pa a gene a másca as y algunos
sis emas la emplean pa a gene a o mas de onda [3]. Su g á ica se mues a en la
igu a 2-5 c.
𝑓(𝑥)=max(0,𝑥)
Ecuación 2-3. Función de ac i ación ReLU
Fundamen os eó icos
12
Con iene a su ez señala la exis encia de una écnica denominada solapamien o-suma (o e lap-add),
la cual es empleada en la e apa de sín esis, pa a ecupe a la señal en iempo que se basan en un conjun o
de pa áme os llamados COLA (Cons an O e lap-Add) los cuales suman un alo cons an e al aplica
en anas sucesi as [3] . En la igu a 2-12 se mues a el p oceso po el cual se ob iene la STFT.
Figu a 2-12. P oceso de ob ención de la STFT [18].
Pa a inaliza es e apa ado en el que hemos pues o el oco en la STFT, cabe menciona la exis encia de
algunas ep esen aciones ales como la CQT [19], la CFT [20] o la MCFT [21], en e o as, que ambién
han sido ambién usadas en en oques de sepa ación de uen es.
2.3 Másca as iempo- ecuencia
La sepa ación de uen es musicales equie e la u ilización de un il o a ian e en el iempo. Es po ello
po lo que las másca as iempo- ecuencia sean un ecu so ampliamen e usado en los sis emas de
sepa ación mode nos como los que nos ocupan.
Como podemos e en la igu a 2-13 es as másca as (ma ices que con ienen alo es en el in e alo
[0.0,1.0]) ealizan su a ea de il ado median e la mul iplicación elemen o a elemen o con el
espec og ama a il a como paso p e io a la in e sión de es e y ecupe ación de la señal de iempo.
Figu a 2-13. Aplicación de una másca a iempo- ecuencia a un espec og ama. Adap ada de [3]
13
13
Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina
Algunas de las másca as iempo- ecuencia empleadas en el ámbi o de la sepa ación de uen es sono as
son:
• Másca a bina ia. Solo oman alo es 1, cuando se asume que la señal a sepa a es á dominada
po una uen e, y 0 en caso con a io. Si bien su uso se ha educido en es imaciones inales de
uen es, sigue siendo álida en a eas de en enamien o.
• Másca a sua e. Pueden oma cualquie alo den o del in e alo [0.0,1.0], lo que las hace
más lexibles que las an e io es y po lo gene al conducen a esul ados con meno dis o sión
[22].
El cálculo de las másca as equie e una es imación de las uen es indi iduales en el dominio de iempo-
ecuencia. Es a a ea puede lle a se a cabo median e el uso de una ed neu onal que las p ediga [10].
2.4 Medidas de e aluación obje i a
Con el in de e alua obje i amen e los esul ados de un modelo de sepa ación de uen es, se han
desa ollado medidas que se basan en la descomposición de la uen e es imada 𝑠𝑗 en a ias señales[23]:
𝑠𝑡𝑎𝑟𝑔𝑒𝑡 ( e sión de la uen e o iginal a ec ada po una dis o sión pe mi ida), 𝑒𝑖𝑛𝑡𝑒𝑟𝑓 (in e e encia
p oceden e de uen es no deseadas), 𝑒𝑛𝑜𝑖𝑠𝑒 ( uido p oceden e de los senso es empleados pa a la cap u a
de la mezcla) y 𝑒𝑎𝑟𝑡𝑖𝑓 (a e ac os p opios del algo i mo de sepa ación).
𝑠𝑗=𝑠𝑡𝑎𝑟𝑔𝑒𝑡 +𝑒𝑖𝑛𝑡𝑒𝑟𝑓 +𝑒𝑛𝑜𝑖𝑠𝑒 +𝑒𝑎𝑟𝑡𝑖𝑓
Ecuación 2-6. Descomposición de la uen e es imada pa a su e aluación.
A con inuación, se p esen an unas mé icas ampliamen e usadas en la e aluación obje i a de la
sepa ación basadas en descomposición que acabamos de comen a :
• Relación señal a dis o sión (SDR):
𝑆𝐷𝑅 =10log10 ‖𝑠𝑡𝑎𝑟𝑔𝑒𝑡‖2
‖𝑒𝑖𝑛𝑡𝑒𝑟𝑓 +𝑒𝑛𝑜𝑖𝑠𝑒 +𝑒𝑎𝑟𝑡𝑖𝑓‖2
Ecuación 2-7. Cálculo de la elación señal a dis o sión.
• Relación señal a in e e encia (SIR):
𝑆𝐼𝑅 =10log10‖𝑠𝑡𝑎𝑟𝑔𝑒𝑡‖2
‖𝑒𝑖𝑛𝑡𝑒𝑟𝑓‖2
Ecuación 2-8. Cálculo de la elación señal a in e e encia.
Fundamen os eó icos
14
• Relación señal a a e ac os (SAR):
𝑆𝐴𝑅 =10log10‖𝑠𝑡𝑎𝑟𝑔𝑒𝑡 +𝑒𝑖𝑛𝑡𝑒𝑟𝑓 +𝑒𝑛𝑜𝑖𝑠𝑒‖2
‖𝑒𝑎𝑟𝑡𝑖𝑓‖2
Ecuación 2-9. Cálculo de la elación señal a a e ac os.
15
3 ESTADO DEL ARTE
a sepa ación de uen es musicales es una a ea que ha a aído a mul i ud de in es igado es a lo
la go de las cinco úl imas décadas. Es o es en pa e debido a que exis en di e en es o mas de
abo da el p oblema en cues ión. A lo la go de es e capí ulo se enume a án los dis in os en oques
que se ha p opues o a lo la go del iempo pa a esol e es a a ea de sepa ación.
Los mé odos de sepa ación de uen es pueden di idi se en dos ca ego ías p incipales: una que usa
modelos basados en los espec og amas y o a que emplea modelos basados en la o ma de onda.
Los modelos que abajan en ep esen aciones de iempo- ecuencia p edicen un espec og ama de
po encia pa a cada una de las uen es y eu ilizan la ase de la mezcla de en ada pa a sin e iza las
o mas de onda.
A p incipios de es e siglo, las écnicas de ac o ización no nega i a de ma ices [24] (NMF) se
empeza on a aplica con éxi o a la sepa ación de uen es musicales. Es as écnicas se basan en modela
el espec o de po encia como una suma ponde ada de un dicciona io espec al, cuyos elemen os son
ag upados en uen es indi iduales. A es as écnicas han con ado con dis in as mejo as ales como su
ex ensión a núme os complejos [25], pe mi iendo modela ase y magni ud de o ma simul ánea.
A su ez, o o de los mé odos p opues os pa a abo da el p oblema de la sepa ación ha sido el análisis
de componen es independien es, basado en supues os de independencia y la exis encia de múl iples
mic ó onos.
El a ance en los úl imos años de las écnicas de ap endizaje p o undo ha pe mi ido mejo a los en oques
an e io es.
En 2014 se ealizó un p ime abajo pa a la sepa ación del habla [26]. A es e le siguie on abajos sob e
música empleando edes comple amen e conec adas [27][28] así como edes con olucionales y
ecu en es [29] [30].
En 2016, las écnicas basadas en espec og amas comienzan a usa il ado de Wiene , una ez
demos ada su e iciencia [31], siendo usado en la ac ualidad po los modelos de mejo endimien o.
En 2019 se publica Open Unmix [32], un modelo ep oducible, en enado sob e la base de da os MusDB
[33] que p esen a una g an base pa a la in es igación de es a emá ica.
Un año más a de apa ece D3Ne [34] mejo ando la ecnología en el dominio del espec og ama. Es e
modelo usa con oluciones dila adas con conexión densa. También en 2020 se p esen a o a a qui ec u a
llamada Splee e [35] que ha sido ampliamen e adop ada en la indus ia musical debido a su g an
endimien o.
Po o a pa e, ecien emen e se han desa ollado modelos que ope an sob e la o ma de onda en luga
de hace lo sob e el espec og ama.
En p ime luga , apa ece Wa e-U-Ne [36], un modelo que ue adap ado al dominio de la o ma a pa i
de o o inicial basado en el espec og ama. Si bien es e modelo supuso un pun o de pa ida, su
endimien o es á muy alejado de los modelos basados en espec og amas que se han comen ado
an e io men e.
L
Es ado del a e
16
Pos e io men e se p esen an Tasne [37] y Con -Tasne [38]. Es e úl imo es una e sión e inada de
Tasne que sus i uye la LSTM p opues a inicialmen e po una supe posición de con oluciones dila adas.
Es o supuso una no able mejo a en los esul ados.
Po úl imo, cabe des aca la apa ición de Demucs [39], un modelo al que le siguie on sucesi as
e siones y que con inúa ac ualizándose a modelos más complejos y se ha si uado como uno de los
mejo es a ni el de endimien o en el ma co de la sepa ación de uen es musicales.
17
4 METODOLOGÍA
na ez ealizada la in oducción eó ica ace ca de la sepa ación au omá ica de uen es musicales
y p esen ado el es ado de la écnica de es a, en es e capí ulo se pasa á a desc ibi los ecu sos,
da ase s y a qui ec u as empleadas pa a cub i nues o obje i o inal de análisis y diseño de un
modelo de sepa ación de uen es musicales. Pa a ello, en un p ime luga se pa i á del análisis de los
modelos exis en es DeepCon Sep [29] y Open Unmix [32] y inalmen e se ealiza án una se ie de
modi icaciones en la a qui ec u a de ed de es e úl imo modelo.
4.1 Recu sos u ilizados
4.1.1 Ha dwa e
Tal y como se ha comen ado en la pa e eó ica de es e abajo, en ena un modelo de Machine Lea ning
es una a ea que puede eque i una g an capacidad de cálculo compu acional. Si bien odos los modelos
a ados en es e abajo pueden se en enados con la CPU, es a no esul a especialmen e e icien e y
p olonga no ablemen e el iempo de en enamien o. Es po ello po lo que hemos hecho uso de las
GPUs, especí icamen e diseñadas pa a esol e simul áneamen e un g an núme o de ope aciones.
Conc e amen e, se ha usado un sis ema con las siguien es ca ac e ís icas:
Tabla 4-1. Especi icaciones de la compu ado a usada.
CPU
I9-12900 H 2.5 GHz 12 h Gen
RAM
32 GB
ALMACENAMIENTO
1 TB SSD
GPU
NVIDIA GeFo ce RTX 3070 8 GB
SISTEMA OPERATIVO
Linux Pop!_OS
4.1.2 So wa e
Pa a cada uno de los modelos a ados en es e abajo se ha hecho uso de di e en es e siones de Py hon
y de dis in as lib e ías.
Figu a 4-1. Logo de py hon
U
Me odología
18
Así pues, DeepCon Sep, se desa olla en Py hon 2.7 y emplea Theano y Lasagne pa a el en enamien o
de las edes neu onales. Es e modelo usa o as dependencias ales como NumPy, SciPy o clima e.
Figu a 4-2. Logos de Theano y Lasagne.
Po su pa e, Open-Unmix y nues a e sión modi icada del mismo es án ealizadas en Py hon 3.7 y
emplean la lib e ía PyTo ch en sus implemen aciones además de di e en es lib e ías en e las que
des acan sciki -lea n, NumPy, SciPy, qdm, cuda oolki o FFmpeg.
Figu a 4-3. Logos de PyTo ch y NumPy.
A con inuación, se desc ibi án b e emen e an o el lenguaje de p og amación py hon y algunas de las
lib e ías des acadas que se han comen ado an e io men e:
• Py hon: Es un lenguaje de p og amación ampliamen e u ilizado en Machine Lea ning si bien
su ámbi o de uso es mucho más amplio (aplicaciones web, desa ollo de so wa e, e c.). Es un
lenguaje mul ipla a o ma muy e icien e y ácil de ap ende , in e p e ado, de al o ni el y
o ien ado a obje os y en e sus nume osos bene icios des acan su ácil comp ensión, al ene
una sin axis simila al inglés, su p oduc i idad o la g an can idad de biblio ecas con las que
cuen a. Además, exis e una comunidad ac i a compues a po millones de desa ollado es
al ededo del mundo que o ecen sopo e an e los dis in os p oblemas que pueden p esen a se.
• Theano: Es una lib e ía que pe mi e de ini , op imiza y e alua e icien emen e exp esiones
ma emá icas de ma ices de múl iples dimensiones.
• Lasagne: Es una lib e ía pa a cons ui y en ena edes neu onales en Theano.
• PyTo ch: Es una lib e ía de enso es op imizada pa a el ap endizaje p o undo que cuen a con
la capacidad de ejecu a se en GPUs, con la consiguien e acele ación del en enamien o de los
modelos.
• NumPy: Es una lib e ía especializada en el cálculo numé ico y el análisis de da os que
inco po a una clase de obje os denominadas a ays que pe mi e ep esen a colecciones de
da os de un mismo ipo en múl iples dimensiones y cuen a con unciones muy e icien es pa a
su manipulación. Pe mi e un p ocesamien o mucho mayo que las lis as con encionales de
Py hon lo que la hace muy ú il pa a el p ocesamien o de ma ices de múl iples dimensiones.
• SciPy: Es una lib e ía que incluye módulos es adís ica, op imización, algeb a lineal,
ans o madas de Fou ie , p ocesamien o de señales, e c.
• Sciki -Lea n: Es una lib e ía pa a el ap endizaje au omá ico que incluye e siones de muchos
algo i mos de clasi icación, eg esión y análisis de g upos.
19
19
Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina
4.2 Da ase (MusDB18)
Figu a 4-4. Esquema de la composición del da ase [40].
MusDB18 [33] es un conjun o de da os compues o po mezclas es e eo ónicas de 150 canciones
comple as (al ededo de 10 ho as de du ación), que es án acompañadas po sus espec i as pis as
aisladas co espondien es a ba e ía, bajo, oz y o os acompañamien os.
En cuan o a la dis ibución de géne os musicales, al y como sucede con DSD100, los es ilos musicales
que p edominan son y el pop y el ock al y como podemos obse a en la abla 4-3.
Tabla 4-2. Dis ibución de géne os musicales del conjun o de da os MusDB18
GÉNERO MUSICAL
NÚMERO DE CANCIONES
Can au o
14
Coun y
3
Elec ónica
7
Hea y me al
12
Jazz
3
Pop/Rock
101
Rap/Reggae
10
MusDB18 cons a de dos subconjun os de da os. Uno de ellos es á compues o po 100 canciones y se
usa pa a el en enamien o del modelo y el o o se compone de 50 canciones y es el ela i o a la p ueba
de es e.
Cabe señala que pa a nues o abajo hemos empleado el da ase MusDB18-HQ, idén ico al desc i o
an e io men e, al y como se obse a en la igu a 4-5, pe o que cons a de a chi os WAV sin comp imi .
Me odología
20
Figu a 4-5. Compa a i a de MusDB18 y MusDB18-HQ [33].
4.3 Modelos de sepa ación de uen es musicales empleados
4.3.1 Modelo DeepCon Sep
Es e modelo de sepa ación au omá ico de uen es musicales ue p opues o po P i ish Chadna y Ma ius
Mi on en el año 2017 [29]. En la igu a 4-6 se mues a el diag ama de bloques del sis ema:
Figu a 4-6. Diag ama de bloques del modelo DeepCon Sep
La STFT se calcula pa a cada uno de los segmen os que componen la mezcla de audio. El espec og ama
de magni ud esul an e pasa a a és de la ed neu onal con olucional, gene ándose una es imación pa a
cada una de las uen es musicales sepa adas. Es a se usa pa a el cálculo de las másca as sua es de
iempo- ecuencia aplicadas al espec og ama de magni ud de la mezcla pa a calcula las es imaciones
de magni ud inal pa a las uen es sepa adas. Es as es imaciones, jun o con la ase de la mezcla de audio,
se emplean pa a ob ene las señales de audio co espondien es a las uen es musicales sepa adas.
En la igu a 4-6 se puede obse a la a qui ec u a de la ed neu onal de es e modelo, si bien solo se
ep esen an dos salidas, aunque el sis ema es á compues o po cua o salidas (ba e ía, bajo, oz y o os
ins umen os).
21
21
Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina
Figu a 4-7. A qui ec u a de la ed neu onal del modelo DeepCon Sep [29]
Como se obse a en la igu a 4-7, en el a ance a a és de la ed neu onal ienen luga una e apa de
codi icación y o a de decodi icación. En ellas in e ienen las siguien es capas:
• Capa de Con olución Ve ical: En ella se lle a a cabo una con olución e ical que iene po
obje i o ob ene una ep esen ación de las ca ac e ís icas de ecuencia de la en ada.
• Capa de Con olución Ho izon al: Modela la e olución empo al pa a los di e en es
ins umen os a pa i de las ca ac e ís icas ap endidas en la capa an e io .
• P ime a Capa comple amen e conec ada: Es a capa que es la úl ima de la ase de
codi icación, iene como obje i o acili a la ob ención de ca ac e ís icas no lineales a pa i de
las en adas an e io es. Es una capa compa ida po odas las salidas de las uen es y ac úa como
cuello de bo ella de la ed. Usa una unción de ac i ación ReLU.
• Segunda Capa comple amen e conec ada: Ac úa como il o pa a de e mina qué
ca ac e ís icas son mejo es pa a de e mina las salidas pa a cada uen e.
• Capa de Decon olución Ho izon al: En ella se lle a a cabo el paso opues o al que iene luga
en la Capa de Con olución Ho izon al.
• Capa de Decon olución Ve ical: Es a capa p opo ciona la salida inal de la ed que puede
in e p e a se como las másca as de las uen es.
4.3.2 Modelo Open-Unmix
El segundo modelo con el que hemos abajado es Open-Unmix. Se a a de un so wa e de código
abie o que ope a con los espec og amas de audio. Se ca ac e iza po el empleo de capas LSTM
bidi eccionales en su ed neu onal y en e sus p incipales en ajas des acan su acilidad de ep oducción
y ampliación, así como la apidez en el ap endizaje de la ed. En la igu a 4-8 puede obse a se la
es uc u a de es e modelo.
Tal y como sucede en el modelo an e io , Open-Unmix ope a en el dominio de iempo- ecuencia. En
una p ime a e apa la en ada de audio se di ide en segmen os ga an izándose así que no quede
comp ome ido el cos e compu acional. El espec og ama de en ada se eco a a 16 KHz y se no maliza
En enamien o de los modelos
28
Tabla 5-5. Núme o de épocas en enadas en Open-Unmix
Ins umen o
Núme o de épocas
Voz
450
Ba e ía
210
Bajo
475
5.3 En enamien o del modelo p opues o
El p oceso pa a ealiza el en enamien o sob e nues o modelo ha sido muy simila al desc i o pa a el
modelo an e io ya que, como hemos comen ado an e io men e, el modelo que p oponemos iene su
base en él. En la igu a 5-4 se mues a una cap u a ealizada du an e el en enamien o en la que pueden
obse a se da os in e esan es ales como la du ación de las épocas (en o no a los 3 minu os), iempos
medios de i e aciones den o de una época (en o no a 1 segundo) y las sucesi as pé didas. Es e úl imo
alo es de g an ele ancia pues o que nos pe mi e iden i ica en qué momen o deja de mejo a el
modelo.
Figu a 5-4. Cáp u a de la consola de comandos du an e el en enamien o del modelo p opues o.
Hay que des aca que modelo p opues o se en enó du an e menos iempo que Open-Unmix ya que la
pé dida dejaba de educi se en épocas más emp anas que el modelo an e io . En la abla 5-6 se mues a
el núme o de épocas en enadas po el modelo pa a cada uen e.
Tabla 5-6.Núme o de épocas en enadas en el modelo p opues o
Ins umen o
Núme o de épocas
Voz
160
Ba e ía
75
Bajo
100
29
29
Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina
Pa a inaliza , en la abla 5-7 puede e se el ajus e inal de los pa áme os, que como hemos dicho, es
muy simila al del modelo an e io .
Tabla 5-7.Valo es de pa áme os des acados en el modelo p opues o.
--ba ch-size
32
--seq-du
6.0
--hidden-size
512
--l
0.001
--weigh _decay
0.00001
--bandwid h
16000
--n
4096
Con iene ecalca que los es modelos se han en enado con múl iples con igu aciones dis in as pe o
los alo es ecogidos en las ablas an e io es son los que nos han o ecido mejo es esul ados. Es os
esul ados se p esen a án a con inuación en el capí ulo siguien e.
30
6 RESULTADOS
na ez en enados ealizado el en enamien o de los dis in os modelos, ealizamos una
e aluación obje i a de los esul ados de sepa ación de es os. A lo la go de es e capí ulo se
p esen an los dis in os esul ados ob enidos basados en las medidas que se desc ibie on en la
sección 2.4 de es a memo ia.
6.1 E aluación del modelo DeepCon Sep
En p ime luga , as el en enamien o del algo i mo DeepCon Sep, ob u imos unos esul ados que
subje i amen e se alejaban de nues as expec a i as ya que, si bien en la sepa ación de un ins umen o
en conc e o se pe cibía la a enuación del es o de los ins umen os, es os pe manecían siendo
no ablemen e audibles. Es o pod ía se debido a un ajus e inadecuado de los hipe pa áme os, aunque
lo cie o es que al ealiza la e aluación obje i a los esul ados no di e ían en exceso a los que se
p esen an en [29] y cuyos esul ados comple os pueden obse a se en la abla 6-3.
Tal y como se obse a en la abla 6-1, es e modelo p esen a un mejo desempeño en la sepa ación de la
ba e ía espec o al es o de las uen es, lo que pod ía se debido a la o ma que ienen los il os en la
p ime a de las capas con olucionales haciéndolos e icien es en el modelado de señales pe cusi as.
Tabla 6-1. Mediana de las medidas de e aluación obje i a en dB.
SDR
SIR
SAR
Voz
2.35
2.69
6.49
Bajo
2.32
1.99
6.13
Ba e ía
2.72
7.74
5.92
En la abla 6-2 se mues an las medidas SDR pa a cada uno de los géne os musicales.
Tabla 6-2. Valo es de SDR po géne os musicales (modelo DeepCon Sep).
Pop/Rock
Reggae/Rap
Elec ónica
Hea y Me al
Voz
2.94
2.88
-11.39
2.26
Bajo
2.59
1.59
3.27
0.17
Ba e ía
2.73
2.63
2.62
5.31
U
31
31
Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina
Tabla 6-3. Valo es de los esul ados de la e aluación obje i a del modelo DeepCon Sep.
ID
canción
SDR
SIR
SAR
VOZ
BATERÍA
BAJO
VOZ
BATERÍA
BAJO
VOZ
BATERÍA
BAJO
1
4.03
1.65
3.40
6.71
1.37
3.79
8.60
3.40
7.47
2
5.74
3.40
-9.53
11.25
3.55
-7.59
9.25
10.24
5.50
3
3.26
3.31
2.58
7.25
5.73
1.81
8.71
6.33
7.07
4
1.33
2.63
3.28
3.18
5.36
2.40
5.39
4.30
9.31
5
2.05
3.01
2.80
2.55
4.50
2.49
5.99
6.17
6.70
6
-4.87
6.83
3.92
-6.25
11.41
6.12
3.25
9.22
6.50
7
4.83
2.33
3.80
9.58
3.39
4.36
5.88
4.34
7.62
8
3.51
2.03
2.21
5.71
3.64
1.32
6.41
4.19
8.92
9
2.82
5.68
3.40
4.14
10.39
3.79
6.78
8.42
6.20
10
3.26
-0.66
-6.72
4.59
0.89
-8.01
9.02
4.63
5.53
11
4.41
6.81
1.78
6.97
10.48
0.77
9.52
9.37
4.51
12
3.15
3.65
0.17
7.17
6.31
-2.69
4.47
8.10
2.13
13
4.53
5.43
3.05
6.39
8.54
2.82
8.63
7.28
6.52
14
1.38
4.03
0.68
3.09
5.12
-0.25
3.06
7.56
3.71
15
1.45
3.06
2.38
1.75
7.27
3.63
5.60
5.76
5.37
16
0.82
2.69
1.05
0.59
3.23
-0.06
4.66
4.58
5.07
17
-1.77
0.99
3.13
3.04
-0.92
3.28
5.67
6.07
7.10
18
2.43
2.05
0.17
3.40
3.51
-0.59
7.04
4.89
5.06
19
1.94
8.45
0.07
4.71
12.18
-2.98
6.33
11.57
6.12
20
4.36
1.79
3.64
10.63
14.86
6.40
10.09
11.03
4.96
21
2.19
2.74
1.59
3.25
6.09
0.98
4.98
6.51
5.85
22
6.42
-4.66
0.68
11.23
-1.64
-0.47
9.97
3.74
6.26
23
2.08
2.76
2.72
4.22
4.43
-1.05
8.57
5.13
6.58
24
3.57
5.95
2.25
4.29
9.29
1.75
9.81
9.28
5.02
25
1.08
0.44
2.96
0.55
-2.25
2.09
10.02
3.64
8.25
26
3.13
4.67
1.42
4.49
9.02
1.13
6.09
7.95
3.37
27
-0.30
2.59
2.59
0.91
4.98
2.68
8.86
6.25
6.14
28
-37.62
7.24
3.41
-36.12
11.93
3.40
-0.32
9.76
-0.61
29
-21.17
4.13
0.57
-28.73
10.47
18.64
0.01
8.51
1.72
30
3.53
4.67
4.12
6.72
5.68
10.43
5.43
9.61
4.44
31
1.84
1.64
2.70
2.83
1.49
1.30
5.39
6.59
7.43
32
2.35
-0.39
2.99
3.23
-1.35
3.89
7.29
3.68
5.59
33
1.68
1.24
0.22
1.62
0.64
-1.96
7.19
3.34
7.75
34
2.74
1.96
4.59
3.71
2.63
5.15
6.58
3.84
9.65
35
6.01
8.73
3.26
13.11
14.63
5.52
10.62
11.76
4.18
36
5.28
1.10
0.35
8.38
1.35
-1.26
8.99
4.21
7.18
37
-2.95
-0.31
-1.88
-1.70
-1.01
0.36
1.88
2.27
1.67
38
-0.18
1.10
4.29
-1.39
0.73
5.76
6.24
3.78
6.69
39
3.11
1.09
0.97
3.67
0.76
3.31
6.78
3.27
5.45
40
3.77
1.15
2.26
4.50
2.34
3.03
6.25
1.71
5.88
41
1.31
4.29
-2.23
1.68
5.23
-5.91
7.99
10.21
6.84
42
1.40
1.50
-1.24
1.62
2.15
-2.92
3.78
1.80
4.06
43
-1.79
1.18
6.33
0.24
0.92
8.67
9.26
4.77
8.93
44
2.22
1.86
3.13
3.23
2.24
1.99
5.97
4.22
6.52
45
6.21
4.37
3.58
8.45
8.24
4.53
10.11
5.60
6.59
46
1.17
0.49
-4.55
0.97
-2.58
-8.07
1.55
5.46
11.75
47
2.26
5.31
1.57
3.44
9.99
0.96
4.57
6.99
4.37
48
4.79
2.80
7.14
7.85
5.03
10.99
9.68
3.61
9.27
49
1.13
6.01
-1.89
-2.21
7.55
-6.23
3.55
11.72
6.00
50
2.94
3.95
-0.75
3.40
6.82
-2.88
8.28
6.28
5.63
Resul ados
32
6.2 E aluación del modelo Open-Unmix
En la abla 6-6 se mues an los esul ados comple os de e aluación obje i a del modelo que en enamos
de Open-Unmix, ealizada sob e el conjun o de p ueba MusDB-HQ. La abla 6-4 ecoge los alo es de
la mediana pa a cada una de las medidas de e aluación.
Tabla 6-4. Medidas de e aluación obje i a en dB ob enidas en el modelo Open-Unmix.
SDR
SIR
SAR
Voz
5.98
14.81
4.01
Ba e ía
5.45
14.40
4.65
Bajo
4.92
16.52
2.24
En is a a los esul ados ob enidos, nues o modelo o ece unos esul ados muy simila es a los que
ob u ie on sus au o es, po lo que c eemos que el ine- unning de es e modelo, desc i o en la sección
5.2, ha esul ado óp imo. En la abla 6-5 se mues an las medidas SDR pa a cada uno de los géne os
musicales ob enidas en la e aluación de es e modelo.
Tabla 6-5. Valo es de SDR po géne os musicales (modelo Open-Unmix).
Pop/Rock
Reggae/Rap
Elec ónica
Hea y Me al
Voz
6.06
6.48
-3.78
5.6
Bajo
5.32
4.24
0.9
4.28
Ba e ía
5.41
5.5
4.87
6.53
Open-Unmix ep esen a una g an opción como sis ema de sepa ación, aunque en la ac ualidad sus
esul ados se han is o supe ados po o os modelos como se puede e en la abla 6-6.
Tabla 6-6. Algo i mos con mejo es esul ados en Musdb18-HQ [42].
Modelo
SDR
(medio)
SDR (bajo)
SDR
(ba e ía)
SDR ( ocales)
Spa se HT Demucs
9.20
10.47
10.83
9.37
Hyb id T ans o me Demucs
9.00
10.39
10.08
9.20
Band-Spli RNN
8.97
8.16
10.15
10.47
TFC-TDF-Une
8.34
8.45
8.44
9.59
KUIELab-MDX-Ne
7.47
7.83
7.20
8.97
CWS-PResUNe
6.77
5.93
6.38
8.92
33
33
Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina
Tabla 6-7. Valo es de los esul ados de la e aluación obje i a del modelo Open-Unmix.
ID
canción
SDR
SIR
SAR
VOZ
BATERÍA
BAJO
VOZ
BATERÍA
BAJO
VOZ
BATERÍA
BAJO
1
7.20
4.51
-3.64
16.73
11.06
6.28
7.90
5.23
-3.19
2
6.41
3.44
5.52
10.85
4.08
16.36
5.17
1.18
2.30
3
8.33
5.32
4.46
10.53
9.01
20.41
6.63
4.08
1.17
4
5.73
5.50
6.21
-0.33
-8.36
19.42
12.68
11.41
-10.24
5
2.75
8.65
6.54
-3.91
-2.58
30.67
0.66
1.57
0.09
6
9.17
6.07
9.04
3.16
-12.56
13.03
4.05
0.17
1.36
7
2.45
6.30
6.70
18.13
16.06
16.54
2.50
5.95
6.44
8
7.39
5.49
5.56
22.17
16.05
17.81
6.63
4.72
5.32
9
1.34
7.36
6.18
-1.54
4.48
13.44
0.26
4.58
2.41
10
4.62
3.62
-1.18
21.98
11.23
1.91
3.24
3.07
-0.35
11
8.37
8.97
4.28
1.68
7.10
31.03
2.99
5.81
0.08
12
6.89
4.99
0.00
12.65
16.99
1.36
7.60
5.73
-0.05
13
8.42
0.95
3.43
27.19
-5.04
-1.29
0.22
0.16
1.06
14
5.53
8.40
4.67
25.03
17.59
19.74
4.97
8.91
2.96
15
4.11
6.44
6.52
12.67
14.21
14.26
3.08
5.89
5.34
16
3.96
6.35
2.72
24.27
12.37
10.12
3.35
6.81
2.99
17
6.44
4.54
0.69
19.94
15.11
11.67
6.19
3.95
-0.85
18
5.43
5.42
4.94
3.91
-0.37
24.24
2.54
1.91
0.17
19
7.13
9.63
1.64
23.91
24.24
17.30
7.27
9.83
-0.12
20
9.19
1.80
9.14
17.64
20.33
22.49
9.37
8.27
9.48
21
6.48
7.09
5.65
8.61
7.79
22.37
4.66
5.00
0.41
22
9.93
4.63
4.44
22.97
11.33
14.51
9.15
3.62
4.42
23
8.10
4.29
6.40
3.10
-6.08
5.11
3.59
0.39
1.61
24
8.08
7.67
4.24
18.86
17.78
11.96
7.41
8.31
3.53
25
3.45
5.30
9.28
24.94
18.50
16.39
2.38
5.29
8.52
26
8.56
12.10
6.84
2.93
7.15
24.28
3.79
6.95
0.55
27
5.15
7.99
4.80
8.88
4.65
22.59
3.96
4.17
0.29
28
-11.06
10.85
0.00
-30.82
16.56
16.63
-0.49
13.02
-1.87
29
-9.91
5.28
1.09
-25.71
16.09
20.99
2.35
8.69
1.96
30
5.74
6.33
4.57
13.90
14.64
17.69
6.38
7.50
5.84
31
4.12
4.49
5.83
-1.37
-10.71
6.54
1.03
0.21
2.18
32
10.09
3.22
8.01
24.61
15.74
16.58
9.79
1.74
8.50
33
5.06
3.82
3.73
22.50
16.32
17.01
4.43
2.83
2.30
34
6.22
5.13
9.49
18.85
15.72
18.31
6.08
4.87
10.21
35
10.68
10.49
6.79
15.66
21.65
17.31
11.62
12.49
6.42
36
7.76
2.67
-0.33
14.21
-6.53
13.58
6.33
0.15
-0.01
37
0.00
5.77
9.32
10.60
15.82
14.76
-0.40
5.64
9.63
38
2.34
4.38
10.35
7.23
17.59
20.54
3.50
6.19
10.55
39
5.65
3.12
11.94
22.00
22.16
28.29
5.59
3.62
12.03
40
4.87
6.82
1.14
6.19
-0.04
9.93
3.57
1.57
-0.27
41
2.76
7.14
2.48
13.32
16.71
19.80
1.81
7.81
2.42
42
2.49
7.42
6.27
16.68
13.36
16.49
0.90
9.03
5.02
43
7.08
4.77
4.90
24.11
15.58
14.96
6.75
3.88
3.58
44
7.84
4.15
8.23
24.87
15.00
14.85
8.40
1.85
8.98
45
9.35
0.50
5.33
18.52
14.74
6.56
9.61
-1.49
6.80
46
2.82
3.00
1.63
12.35
12.33
7.65
1.90
1.31
0.13
47
7.10
11.93
4.28
0.44
-4.31
17.86
2.78
1.38
0.08
48
6.98
3.80
9.72
16.14
11.61
16.30
6.87
3.52
11.98
49
4.26
9.25
1.24
15.41
14.60
13.80
3.22
9.23
-1.23
50
5.66
6.53
1.09
25.07
15.50
17.14
5.37
6.76
-3.60
Resul ados
34
6.3 E aluación del modelo p opues o
Pa a inaliza , se ealizó una e aluación del modelo p opues o. A ni el subje i o, pe cibimos una
sepa ación acep able, en la que, si bien en algunas canciones la e iciencia de la sepa ación es mejo que
o as, a ni el gene al se de ec a cla amen e la p edominancia del ins umen o a sepa a .
En la abla 6-10 se mues an las medidas de e aluación obje i as ob enidas sob e el conjun o de p ueba
de MusDB18-HQ.
La abla 6-8 con iene los alo es de la mediana pa a cada una de las medidas obje i as.
Tabla 6-8. Medidas de e aluación obje i a del modelo p opues o.
SDR
SIR
SAR
Voz
3.41
9.65
2.05
Ba e ía
3.97
8.64
3.09
Bajo
3.37
13.51
0.98
En la abla 6-8 puede obse a se que los esul ados son in e io es a los o ecidos po Open-Unmix ( abla
6-4) pe o si ep esen an una mejo a signi ica i a con espec o a los que ob u imos con el modelo de
DeepCon Sep.
A su ez se obse a que ob enemos un mejo SDR en la sepa ación de la ba e ía. Es o puede se debido
a lo comen ado an e io men e en la e aluación de DeepCon Sep ya que la a qui ec u a del modelo que
p oponemos es á cla amen e inspi ada en la de es e modelo de sepa ación.
La abla 6-9 ecoge los alo es de SDR ob enidos pa a cada es ilo musical.
Tabla 6-9. Valo es de SDR po géne os musicales (modelo p opues o).
Pop/Rock
Reggae/Rap
Elec ónica
Hea y Me al
Voz
3.97
3.10
-14.37
3.85
Bajo
3.55
2.54
1.55
3.54
Ba e ía
3.96
2.2
3.72
7.15
35
35
Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina
Tabla 6-10. Valo es de los esul ados de la e aluación obje i a del modelo p opues o.
ID
canción
SDR
SIR
SAR
VOZ
BATERÍA
BAJO
VOZ
BATERÍA
BAJO
VOZ
BATERÍA
BAJO
1
5.51
3.93
-3.66
9.78
7.75
3.82
6.69
5.41
-2.69
2
4.86
2.28
3.41
6.01
0.34
12.78
3.45
0.83
1.32
3
6.03
3.63
2.25
5.55
2.94
18.53
3.58
2.01
-0.04
4
2.35
0.74
3.13
-0.20
-11.83
15.52
1.10
-0.09
0.11
5
1.99
7.38
4.23
-9.40
-0.55
26.48
0.24
2.10
0.09
6
6.25
4.42
7.11
4.46
-12.84
6.12
3.93
0.16
1.07
7
1.44
5.27
5.09
16.74
11.74
14.65
1.02
5.55
4.69
8
4.87
3.84
4.08
15.92
11.47
13.59
4.22
3.19
3.62
9
1.87
8.02
4.24
-1.81
4.85
9.62
-0.01
4.79
1.26
10
3.03
3.37
-0.26
16.39
9.75
0.19
2.10
3.14
0.00
11
6.17
8.96
2.96
-3.01
-0.78
28.47
1.25
2.36
0.04
12
3.47
5.36
0.06
9.51
12.00
-14.56
5.76
6.48
-0.07
13
4.85
1.76
-0.56
25.97
-7.49
-8.77
0.10
0.06
0.89
14
3.37
7.40
2.00
22.48
13.17
14.70
2.41
8.41
0.55
15
3.05
4.67
4.29
8.02
10.63
13.42
1.66
4.06
3.11
16
1.78
3.98
2.18
14.59
5.45
3.73
0.60
6.17
2.95
17
4.51
2.50
-0.90
16.83
9.12
7.79
3.92
1.20
-1.60
18
3.85
4.01
3.84
0.21
-5.03
19.32
1.08
0.63
0.08
19
4.43
6.83
0.33
17.72
18.48
16.51
3.85
7.59
-0.37
20
1.99
0.06
1.20
7.34
1.46
0.76
1.01
-1.34
2.39
21
3.27
6.09
3.98
3.32
6.96
20.11
1.45
4.34
0.34
22
8.12
3.73
3.84
21.54
10.11
13.26
7.50
2.75
3.19
23
4.99
3.94
5.31
1.08
-8.10
-1.01
2.00
0.38
0.59
24
3.10
5.38
2.54
10.82
10.58
11.64
2.99
6.44
1.14
25
0.61
3.97
5.94
19.40
17.02
11.36
0.71
4.22
5.50
26
4.45
9.57
5.02
-5.60
-1.88
20.64
0.79
2.06
0.13
27
4.80
6.69
3.63
2.57
0.64
20.35
2.39
2.50
0.17
28
-44.21
8.26
0.27
-40.33
12.45
3.88
-0.44
11.69
-0.96
29
-18.93
4.94
0.92
-26.78
12.53
20.12
0.00
8.70
1.80
30
3.45
3.18
2.32
10.44
5.03
18.73
4.21
7.86
3.13
31
2.56
3.56
3.53
-7.24
-0.66
8.03
0.00
1.58
0.34
32
6.92
1.91
6.24
17.42
8.51
15.05
6.28
1.78
6.83
33
2.53
2.37
0.05
16.84
10.72
9.00
1.84
0.80
-0.05
34
3.30
3.82
7.28
14.49
11.29
13.79
2.77
3.41
7.78
35
7.43
8.15
3.34
11.51
15.79
13.62
9.63
10.49
3.18
36
5.41
2.20
0.00
11.70
-5.85
16.76
4.04
0.26
-0.05
37
0.50
3.24
6.88
3.92
9.80
13.02
-3.02
3.04
7.21
38
0.93
2.44
6.63
7.16
9.86
18.79
1.19
3.88
7.15
39
4.09
1.67
11.12
15.29
11.11
23.01
4.03
2.58
12.05
40
2.73
4.78
0.10
1.95
0.44
18.12
0.75
1.80
-0.05
41
1.16
5.45
2.48
7.51
11.85
14.26
2.18
6.13
2.53
42
0.82
6.26
4.60
9.13
10.74
18.10
0.44
6.99
3.36
43
4.81
2.71
3.81
18.67
8.79
11.84
4.20
1.60
2.89
44
5.63
4.23
7.12
19.95
11.67
11.78
5.43
4.18
8.37
45
7.56
1.37
1.59
13.91
5.28
0.10
7.88
0.89
9.21
46
1.40
2.19
-3.49
7.59
7.82
1.61
-0.36
1.06
-5.42
47
5.15
10.28
3.54
-7.71
-5.19
16.71
0.56
1.10
0..06
48
5.18
2.89
7.57
14.68
6.36
15.33
4.80
3.24
9.72
49
1.75
7.15
0.42
14.47
11.29
6.75
0.56
8.00
-4.54
50
3.23
5.78
1.09
18.77
12.52
6.21
2.31
6.09
-1.28
36
7 CONCLUSIONES Y FUTUROS PASOS
n es e úl imo capí ulo se expond án las dis in as conclusiones que se han ido ob eniendo du an e
la ealización de es e abajo. Además, pa a inaliza , se p opond án algunas líneas de
in es igación.
7.1 Conclusiones
A lo la go de es e abajo se ha analizado la a qui ec u a, el uncionamien o y endimien o de di e sos
algo i mos des acados del es ado del a e de la sepa ación au omá ica de uen es musicales. Se decidió
cen a el es udio en dos de ellos: DeepCon Sep y Open-Unmix.
En un p ime luga se op ó po el algo i mo DeepCon Sep ya que nues o abajo se inició es udiando
la esis doc o al “Sou ce Sepa a ion Me hods o O ches al Music: Timb e-In o med and Sco e-
In o med S a egies” elabo ada po Ma ius Mi on de la Uni e sidad Pompeu Fab a [42] y en ella se
p oponía es e in e esan e modelo de sepa ación.
Una ez analizado, en enado y e aluado es e modelo que hace uso de edes con olucionales en su a ea
de sepa ación, se decidió p o undiza en o o algo i mo que usase o o ipo de edes neu onales y así
pode compa a el desempeño de unas y o as edes. Pa a ello, se escogió Open-Unmix debido a su
acilidad de ep oducción, modi icación y ampliación además de que o ecía unos buenos esul ados de
sepa ación.
Si bien el es udio y ep oducción de DeepCon Sep ue un buen pun o de pa ida pa a aden a nos en el
conocimien o de las edes neu onales, desde su publicación ha pasado unos años, con el consiguien e
desa ollo de nue os modelos que o ecen unos esul ados supe io es. Además, es e algo i mo es á
implemen ado en Py hon 2.7, el cual se encuen a desac ualizado en la ac ualidad.
Es po ello po lo que se conside ó in e esan e implemen a un modelo inspi ado en las edes
con olucionales que se p oponen en DeepCon Sep ap o echando el so wa e de código abie o que
Open-Unmix o ece como pun o de pa ida pa a la in es igación de es a emá ica. Es o con ibuyó a la
consecución de los obje i os iniciales que se es ablecie on en la e apa inicial de es e abajo.
Si bien con nues o modelo p opues o no conseguimos iguala los esul ados alcanzados po Open-
Unmix, el uso de un so wa e ac ualizado o el empleo de unciones de ac i ación ReLU a la salida de
las capas con olucionales, en e o as cosas, supusie on una mejo a en los esul ados en compa ación a
los que se ob u ie on con DeepCon Sep.
Como hemos comen ado, du an e odo el abajo hemos op ado po implemen aciones de código abie o
lo que ha supues o una g an ayuda en é minos de a ance en la in es igación. Además de los modelos
expues os a lo la go de es a memo ia se han analizado o os, los cuales han sido inalmen e desca ados
debido a su complejidad o a incon enien es su gidos en el en enamien o de es os ales como dispone
de una capacidad compu acional insu icien e.
E
37
37
Sepa ación au omá ica de ins umen os musicales u ilizando ap endizaje máquina
7.2 Fu u os pasos
Pa a ob ene una sepa ación de buena calidad median e el uso de algo i mos de ap endizaje máquina,
se necesi a dispone de una g an can idad de da os. T abajos u u os pod ían cen a se en la c eación de
bases de da os más amplias y de es ilos musicales conc e os que pe mi a a los modelos especializa se
en ellos.
Si bien el uso de la STFT simpli ica eno memen e las a qui ec u as de edes empleadas en los sis emas
de sepa ación de uen es, no esul a adecuado pa a odas las señales que es án p esen es en las
composiciones musicales. Además, desca ando la in o mación de ase pod ía pe de se in o mación
ele an e. Es po ello po lo que op a po o as écnicas como las en anas adap a i as pa a ep esen a
el audio pod ían mejo a los sis emas de sepa ación.
Anexo A: Código implemen ado
44
sel .laye = nn.Sequen ial(
nn.Linea (30, 512),
nn.ReLU(),
nn.Linea (512,30),
nn.ReLU(),
)
i inpu _mean is no None:
inpu _mean = o ch. om_numpy(-inpu _mean[: sel .nb_bins]). loa ()
else:
inpu _mean = o ch.ze os(sel .nb_bins)
i inpu _scale is no None:
inpu _scale = o ch. om_numpy(1.0 / inpu _scale[: sel .nb_bins]). loa ()
else:
inpu _scale = o ch.ones(sel .nb_bins)
sel .inpu _mean = Pa ame e (inpu _mean)
sel .inpu _scale = Pa ame e (inpu _scale)
sel .ou pu _scale = Pa ame e ( o ch.ones(sel .nb_ou pu _bins). loa ())
sel .ou pu _mean = Pa ame e ( o ch.ones(sel .nb_ou pu _bins). loa ())
de eeze(sel ):
# se all pa ame e s as no equi ing g adien , mo e RAM-e icien
# a es ime
o p in sel .pa ame e s():
p. equi es_g ad = False
sel .e al()
45
de o wa d(sel , x: Tenso ) -> Tenso :
"""
A gs:
x: inpu spec og am o shape
`(nb_samples, nb_channels, nb_bins, nb_ ames)`
Re u ns:
Tenso : il e ed spec og am o shape
`(nb_samples, nb_channels, nb_bins, nb_ ames)`
"""
mix = x.de ach().clone()
x = sel .encode (x)
x = sel .laye (x. iew(-1,30))
x = x. iew(nb_samples,30,1,-1)
x = sel .decode(x)
x = F. elu(x) * mix
e u n
46