Transcripción asistida de audio
Abstract
Los medios de comunicación analógicos o digitales requieren tecnología avanzada para ser utilizados, además es difícil encontrar en este medio algún segmento o frase con las técnicas clásicas de computación y por otro lado, este medio se vuelve ineficiente para personas con alguna discapacidad acústica; una solución ampliamente utilizada es la de disponer de las transcripciones escritas del contenido sonoro del medio audiovisual, incrustadas en el propio vídeo en forma de subtítulos.
Full text
memoria 2012/9/10 10:52 page i #1 i i UNIVERSIDAD POLITÉCNICA DE VALÉNCIA ESCUELA TÉCNICA SUPERIOR DE INGENIERÍA INFORMÁTICA DEPARTAMENTO DE SISTEMAS INFORMÁTICOS Y COMPUTACIÓN Transrip ión asistida de audio. Proyeto Final de Carrera - Ingeniería Informátia Juan Daniel Valor Miró Sup ervisado p or: Dr. Jorge Civera Saiz Dr. Alfons Juan Cisar 10 de septiembre de 2012
memoria 2012/9/10 10:52 page i i #2 i i
memoria 2012/9/10 10:52 page iii #3 i i Graias a los que me han ayudado en el transurso de este proyeto.
memoria 2012/9/10 10:52 page iv #4 i i
memoria 2012/9/10 10:52 page v #5 i i Índie general 1. Intro duión 1 1.1. Motivaión del Proyeto . . . . . . . . . . . . . . . . . . . . . . . . . . 1 1.2. Reono imiento de Formas . . . . . . . . . . . . . . . . . . . . . . . . 2 1.3. Reono imiento del Habla Continua . . . . . . . . . . . . . . . . . . . 3 1.4. Extraión de Caraterístias . . . . . . . . . . . . . . . . . . . . . . . 5 1.5. Entrenamiento de los Mo delos . . . . . . . . . . . . . . . . . . . . . . . 5 1.5.1. Mo delos de Markov de Capa Oulta . . . . . . . . . . . . . . . 6 1.5.2. Mo delo Léxio . . . . . . . . . . . . . . . . . . . . . . . . . . . 7 1.5.3. Mo delos de Lengua je de N-Gramas . . . . . . . . . . . . . . . . 7 1.6. Evaluaión de los Resultados . . . . . . . . . . . . . . . . . . . . . . . 9 2. Desrip ión del Corpus 11 2.1. Plataforma p oliMedia . . . . . . . . . . . . . . . . . . . . . . . . . . . 11 2.2. El Formato de poliMedia . . . . . . . . . . . . . . . . . . . . . . . . . . 12 2.3. El Corpus p oliMedia . . . . . . . . . . . . . . . . . . . . . . . . . . . . 13 2.3.1. Pro eso de Transripión . . . . . . . . . . . . . . . . . . . . . 13 3. Software de Reono imiento 15 3.1. Software de Preproeso . . . . . . . . . . . . . . . . . . . . . . . . . . . 15 3.2. BLISS Lexion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15 3.3. SRILM NGram . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16 3.4. RWTH ASR System . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17 3.4.1. Extraion de Caraterístias . . . . . . . . . . . . . . . . . . . 17 3.4.2. Entrenamiento on Monofonemas . . . . . . . . . . . . . . . . . 18 3.4.3. Entrenamiento on Trifonemas . . . . . . . . . . . . . . . . . . 20 3.4.4. Reono imiento del Habla . . . . . . . . . . . . . . . . . . . . . 20 3.5. Analizador WER++ . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21 3.6. Programaión de un Front-End . . . . . . . . . . . . . . . . . . . . . . 22 4. Exp erimentos Preliminares 25 4.1. Partiion Utilizada . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25 4.2. Pro eso de Optimizaión . . . . . . . . . . . . . . . . . . . . . . . . . . 25 4.3. Resultados Obtenidos . . . . . . . . . . . . . . . . . . . . . . . . . . . 27 5. Exp erimentaión 31 5.1. Partiiones Utilizadas . . . . . . . . . . . . . . . . . . . . . . . . . . . 31 5.2. Resultados Base . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 32 5.3. Mejora del Reono imiento . . . . . . . . . . . . . . . . . . . . . . . . 33 v
memoria 2012/9/10 10:52 page vi #6 i i Índie general 6. Conlusiones Finales 35 6.1. Resumen del Traba jo . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35 6.2. Mejoras Futuras . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35 vi PRHLT-DSIC-UPV
memoria 2012/9/10 10:52 page 1 #7 i i Capítulo 1 Introduión 1.1. Motivaión del Proyeto En la Soiedad de la Informaión en la que estamos inmersos, es muha la informa- ión que p o demos enontrar en muhos medios de omuniaión digitales o analógios. Tradiionalmente, esta informaión se ha transmitido en un medio esrito, llegando así al alane de la mayoría de la p oblaión existente; sin embargo atualmente esta tendenia está ambiando, tomando esp eial relevania otro tip o de medios de transmisión omo el audiovisual. De esta forma, este medio naido en el siglo XIX, ha ido tomando relevania en muhos ámbitos de la vida diaria omo la eduaión [Per02℄, el arte [Mag05℄, el turismo [Mar10℄, el ine [Med02℄, et. Sin embargo, y a pesar de las muhas venta jas que este medio ap orta a la transmisión de informaión, existen laras desventa jas de este medio resp eto a los medios lásios omo el esrito. En primer lugar, se trata de un medio que requiere de tenología avanzada para p o der ser utilizado (algún dispositivo on apaidad de reproduión de heros multimedia). Además, es muy diil enontrar en este medio algún segmento o frase on las ténias lásias de omputaión; de forma que si busamos una parte en onreto de, p or ejemplo, una onferenia, probablemente deb eremos esuharla ompletamente para lo alizar diho fragmento. Por otro lado, este medio se vuelve muy ineiente para p ersonas on algún tip o de disapaidad austia [dA11℄, ya que gran antidad de la informaión se transmite mediante el sonido. Destaar p or último, que la traduión de un medio audiovisual es muho más ompleja que la de un medio esrito, límitando así su expansión geográa. Así pues, una soluión ampliamente utilizada es la de disp oner de las transrip- iones esritas del ontenido sonoro del medio audiovisual, inrustadas en el propio video en forma de subtitulos. Así pues, de esta forma se soluiona on relativa failidad to dos los problemas menionados previamente, al pasar a traba jar on un medio puramente esrito. Sin embargo, el proeso de transripión de un medio audiovisual suele ser muy ostoso en tiempo y reursos [RG05℄, ya que se trata de un pro eso manual. Así pues, 1
memoria 2012/9/10 10:52 page 2 #8 i i Capítulo 1. Introduión para realizar la transrip ión de un medio audiovisual ámplio se requiere de muho p ersonal, tiempo, y reursos que no siempre se pueden obtener. Así pues, de la mano del Reonoimiento de Formas [DH73℄ se plantea la soluión a este problema mediante ténias de Reonoimiento Automátio del Habla Continua . De esta forma a partir de un medio audiovisual, de forma automátia y en base a unos modelos previamente generados, se puede extraer la transrip ión on una tasa de error relativamente ba ja. Además, para mejorar más aún esta tasa de error, pueden utilizarse ténias interativas de transrip ión asistida de audio, que pregunte al transriptor úniamente aquellos fragmentos de audio en los que rea que la transrip ión automátia ha p o dido fallar. 1.2. Reono imiento de Formas El Reono imiento de Formas es una rama de la Informátia uyo ob jetivo es la p erep ión de ob jetos p or un sistema, entendiendo p or p erep ión de ob jetos la apaidad de un sistema de darle un signiado semántio a un onjunto de datos mediante su etiquetado o lasiaión [Seg92℄. Un sistema de Reono imiento de Formas básio onsta de los siguiente mo dulos: 1. Prepro eso: Adquiere la señal desde un sensor externo o de alguna base de datos de informaión externa al sistema, la ltra eliminando el ruido y la prepara para ser pro esada p or el omputador. 2. Extraión de Caraterístias: Obtiene una serie de medidas, de la señal pro esada p or el mo dulo previo, que son relevantes para llevar a ab o el pro eso de etiquetado o lasiaión en la etapa p osterior. 3. Clasiaión: A partir de un mo delo debidamente entrenado y de las araterístias extraidas en el mo dulo anterior, utiliza ténias para aso iar al ob jeto su signiado semántio. Preproceso Extracción de Características Clasificación Objeto Vector de Características EtiquetaSeñal Modelo Figura 1.1: Sistema Básio de Reonoimiento de Formas Como se puede observar en la gura 1.1, para llevar a ab o el pro eso de lasi- aión nos hae falta un mo delo, que se obtiene mediante el uso de ténias estadístias de aprendiza je sobre un onjunto de datos de ejemplos ya lasiados o etiquetados previamente de forma manual y orreta. Para haernos una idea un po o más aproximada de omo funiona de forma básia un sistema de Reono imiento de Formas desde el punto de vista estadístio; 2 PRHLT-DSIC-UPV
memoria 2012/9/10 10:52 page 3 #9 i i 1.3. Reono imiento del Habla Continua sup ongamos que E es un espaio de representaión de las muestras a etiquetar, y Ω = {ω1, ω2, ω3, ..., ωc} un onjunto de C etiquetas que pueden ser asignadas a ada una de las muestras x∈E del total de muestras E . Asi pues, si onoemos la proporión de muestras de la lase ωi resp eto al total, o lo que es lo mismo la probabilidad a priori P(ωi) ; y la probabilidad de que se de un x onreto sabiendo de antemano ωi , o lo que es lo mismo la probabilidad ondiional P(x|ωi) ; mediante la Regla de Bayes po demos estimar la probabilidad de que diha x p erteneza a ωi , o lo que es lo mismo la probabilidad a p osteriori P(ωi|x) [DH73℄. P(ωi|x) = P(x|ωi)P(ωi) PC j=1 P(x|ωj)P(ωj) (1.1) Sin embargo, en la mayoría de apliaiones de Reono imiento de Formas, es muy diil estimar adeuadamente P(ωi) y P(x|ωi) , p or lo que la mayoría de vees se opta p or utilizar ténias de aprendiza je que los estiman a partir de un onjunto de muestras de entrenamiento ya lasiadas. 1.3. Reono imiento del Habla Continua La rama que nos interesa del Reonoimiento de Formas es la que estudia el Reono imiento del Habla Continua, y que es onsiderada omo una rama uya tarea es muy ompleja [Ser05℄ debido a to dos los requerimientos impliitos de la misma. Los iniios de esta rama está en los años 50 en los lab oratorios Bell, donde onsiguieron realizar un reono imiento de dígitos aislados monoloutor. Al mismo tiemp o, en la University England Col lege rearon el primer reono edor fonétio, y en el MIT Linoln Lab un reono edor de vo ales indep endiente del hablante. En los años 60, se onsiguió la Alineaión Dinámia en el Tiemp o en Vintsyuk (la Unión Sovietia), y un primer intento de reono imiento del habla ontinua en el Carnegie Mel lon University . En los años 70, el mundo de la estadístia llegó al Reono imiento del Habla Continua, p ermitiendo p or primera vez un sistema de reono imiento de palabras aisladas que funionara muy bien. Además IBM desarrolló varios proyetos de reono imiento de grandes vo abularios, y la Carnegie Mel lon University desarrolló el primer sistema de reonoimiento del habla on éxito. A partir de los años 80, se produe una explosión de los méto dos estadístios, uyo éxito se debió a los Mo delos Oultos de Markov. Además el area de las Redes Neuronales se empezó a inluir en diversas partes del reono imiento de voz, mejorando su índie de éxito en el reono imiento. Además naió el sistema de reonoimiento del habla SPHINX [HCS℄ onsiderado omo uno de los mejores reonoedores del habla que existen hoy en día. Finalmente, desde los años 90 hasta la atualidad se han onseguido diversas apli- aiones omo sistemas de ditado, integraión en apliaiones telefónias, integraión en el Sistema Operativo, apariión del estándar VoieXML, et [RG06℄. Además la apariión del HTK Hidden Markov Mo del To olkit [YEG + 06℄ en el año 1989 de la mano de Cambridge University Engineering Department fue un gran avane para el Reono imiento del Habla Continua. PRHLT-DSIC-UPV 3
memoria 2012/9/10 10:52 page 10 #16 i i
memoria 2012/9/10 10:52 page 11 #17 i i Capítulo 2 Desripión del Corpus 2.1. Plataforma p oliMedia El orpus que se ha utilizado en el presente proyeto se ha extraido de los videos on lienia libre del rep ositorio oial de la Universidad Politénia de Valenia ono ido omo p oliMedia. Según su desrip ión propia, p oliMedia es un sistema diseñado en la UPV para la reaión de ontenidos multimedia omo ap oyo a la doenia presenial, que abara desde la preparaión del material doente hasta la distribuión a través de distintos medios (TV, Internet, CD, et.) a los destinatarios de los mismos (que generalmente son los alumnos de la UPV) [dV12b℄. Las araterístias básias que denen a p oliMedia (según su web oial [dV12b℄) son las que se enumeran a ontinuaión: 1. p oliMedia es un sistema de pro duión de materiales eduativos de alidad. 2. Es un reurso integrado on to das las herramientas de PoliformaT. 3. Es muy adeuado omo apoyo y omplemento a la enseñanza presenial. 4. El autor es el propietario inteletual de la obra. 5. Sistema ompletamente innovador y únio, disp onible sólo en la UPV. 6. Disp onibilidad de instrumentos, materiales y ténios para el profesorado. 7. Lleva aso iado un plan de inentivos eonómios. 8. Es fáil: no requiere ono imientos audiovisuales o ténios. En resumen, p olimedia es una plataforma donde los profesores pueden publiar videos do entes según un mo delo estándar y utilizando los medios de la UPV para ello. Además se trata de una plataforma que a día 15 de Febrero de 2012 posee 6830 grabaiones que suman más de 1350 horas de video de más de 1033 profesores diferentes, lo ual le da muhisima relevania a nivel global. 11
memoria 2012/9/10 10:52 page 12 #18 i i Capítulo 2. Desrip ión del Corpus 2.2. El Formato de p oliMedia Los videos do entes que existen en la plataforma p oliMedia, siguen un formato estandar en to dos los videos, araterístio de la plataforma. Se trata de una vista onjunta de profesor y pantalla (diap ositivas, programas, et) en un mismo plano de ámara que no se mueve en to do el video. Diapositivas Programas Videos Educativos Otros Recursos Profesor UPV Figura 2.1: Formato de los Videos de p oliMedia El pro eso es muy simple: se graba en un estudio al profesor sobre un fondo blano (audio y video), y simultaneamente a la pantalla del ordenador (que previamente habrá argado algún tip o de reurso multimedia). Despúes se extrae la grabaión del profesor y se mezla on la de la pantalla según el esquema de la gura 2.1 y se le añade el logo de la UPV, añadiendo el nalmente el audio del profesor al video generado [dV12b℄. Este video ya editado nalmente se distribuye a través del portal oial de p oliMedia en formato MOV o MP4 (dependiendo del navegador utilizado para aeder a la plataforma). Sin embargo, para p o der traba jar on estos videos, en el presente proyeto se ha optado p or eliminar la parte gráa del video extrayendo del mismo el audio en formato WAV, que se utilizará omo entrada para nuestro sistema junto a la transripión manual del mismo. Destaar nalmente que la alidad del audio de los videos del p olimedia es muy alta, y no p osee pratiamente ningún tip o de ruido de fondo (ya que ha sido grabado en un estudio errado). Sin embargo, los loutores de los videos (más de 1.000 profesores) son de diferentes sexo y edad, lo que hae muy variables los tonos de voz y los ritmos de habla aso iados. Además las áreas temátias de los videos pueden llegar a 12 PRHLT-DSIC-UPV
memoria 2012/9/10 10:52 page 13 #19 i i 2.3. El Corpus p oliMedia ser muy diferentes (on más de 650 areas temátias bien difereniadas), y además se tiende a emplear términos muy ténios que es improbable que se repitan más de tres o uatro vees en to do el p olimedia. Esto hae del p oliMedia un rep ositorio de audio bueno, p ero muy variable en uanto a austia y semántia, lo ual representa un grave inonveniente uando se traba ja on sistemas de Reonimiento del Habla Continua que se basan en modelos de aprendiza je. 2.3. El Corpus p oliMedia El onjunto utilizado se orresp onde on una p equeña parte del total de graba- iones del p olimedia, uyos autores han dejado la lienia ompletamente libre. En total, hemos extraido 1350 horas de video aproximadamente en 732 grabaiones de diferentes temas y profesores [dV12b℄. Tabla 2.1: Comparativa del p oliMedia Completo on Nuestro Corpus Conjunto Horas Videos poliMedia Completo 1350 6830 Nuestro Conjunto 119 732 Porentaje Total 8,85 % 10,72 % Diho orpus ha sido transrito manualmente al ompleto p or 10 p ersonas, y el autor de este proyeto nal de arrera on un total de 832 minutos de video. Para ello se ha utilizado la herramienta de software libre ono ida omo Transrib er [BGWL00℄. 2.3.1. Pro eso de Transrip ión Para transribir ada uno de los videos se ha seguido un pro eso estándar p or to dos los miembros del grup o, para que los resultados sean los mismos en to das las transrip iones y de esta manera onseguir un orpus uniado y ompleto. En primer lugar, y partiendo del video, se ha utilizado mpeg para extraer su ontenido en formato WAV (una pista de audio únia). Una vez extraido el audio, pasamos a iniiar su transrip ión on el programa Transriber, que nos p ermite realizar dos tareas fundamentales a la hora de llevar a ab o una transrip ión: 1. Segmentar: Hay que olo ar maras de tiemp o para separar las frases on un signiado sintátio y semántio propio, para p o der apliar el sistema desrito en la seión 1.5. 2. Transribir: Cada segmento deb e p oseer en arateres UTF-8 el ontenido de las palabras que se pronunian en él, siguiendo las reglas que se desriben en esta seión. PRHLT-DSIC-UPV 13
memoria 2012/9/10 10:52 page 14 #20 i i Capítulo 2. Desrip ión del Corpus Además, hay que destaar que se han optado p or una serie de onveniones a la hora de realizar dihas transripiones, on el ob jetivo de representar adeuadamente las disuenias orales en el habla. Estas onveniones son las siguientes: 1. Se identiará el profesor que habla en ada video, asi omo su sexo. 2. Se segmentará el audio en frases, transribiendo ada una de ellas. 3. Cuando se pro duza una disuenia, se anotara utilizando la siguiente notaión estándar global: /sonido pronuniado/palabra orreta/ 4. Cuando se pro duza un silenio largo se reará un segmento uya transrip ión será úniamente [sonido de fondo℄. 5. Cuando se pro duza un silenio orto se añadirá la notaión /SF//. Es imp ortante destaar la laboriosa tarea que sup one la transrip ión un video de forma manual y lo importante que ha sido para la puesta en marha de este proyeto nal de arrera. Por destaar algunos datos, omentar que el RTF (ratio de tiemp o de transrip ión de audio resp eto al tiempo del propio audio) es de una media de 11. Esto implia que p or ada minuto de audio se emplean 11 para transribirlo, lo ual implia que para transribir todo el orpus utilizado en este proyeto se han empleado aproximadamente 1314 horas. Después se deb e veriar los errores de ortografía ometidos al transribir rápidamente un video, por lo que utilizaremos la herramienta aspel l para veriar y orregir dihos errores. Además utilizaremos un p equeño sript para omprobar si las expresiones espeiales que hemos olo ado entre barras están orretas o existe algúna de más o de menos, ya que esto provo aría a la hora de parsear la transripión numerosos errores. Tabla 2.2: Ejemplo de una Transrip ión de Varios Segmentos Seg. Tiemp o Transripión 1 3,1s El bule for /ih/eah/ es un bule que itera una lista. 2 1,9s Por ejemplo, la variable entera /jota/J/. 3 4,0s Se trata /e//, de una sentenia realmente útil. 4 5,4s No olvideis /que que/que/ no existe en /e/C/. Como p o demos ver en la Tabla 2.2, la transrip ión de un fragmento de audio no es trivial. En el segmento 1 po demos observar omo se pronunia una palabra en inglés, y omo esta mediante la sintáxis de las barras deb e ser esp eiada primero fonetiamente y luego bien esrita. En el segmento 2 pasa algo similar, pero en este aso se trata de la pronuniaión de una letra del alfab eto. En el segmento 3 se pro due una duda del loutor, que pronunia un sonido eee uando en realidad deb ería hab er ontinuado la frase. En el segmento 4, el lo utor repite la pronuniaión del que siendo úniamente uno de los dos válido, y de nuevo o urre la situaión del segmento número 2. 14 PRHLT-DSIC-UPV
memoria 2012/9/10 10:52 page 15 #21 i i Capítulo 3 Software de Reonoimiento 3.1. Software de Prepro eso En primer lugar, destaar que para el preproeso del orpus original (videos en formato estádar MP4), se han realizado los siguientes ltrados, para extraer una señal denitiva de audio en formato WAV: 1. Extraión del anal de audio del video original utilizando mpeg . 2. Reo diaión del audio en formato WAV a un anal y 16000Hz on SOX. Así pues, el software impliado es el onoido manejador de heros multimedia mpeg y el reo diador de diversos formatos SOX, muy ono idos en el area de la multimedia y el proesado de heros. Por otro lado, para el preproeso de las transrip iones se ha utilizado un sript manual en Python 3, reado por el autor de este proyeto nal de arrera, para adaptar las transrip iones a las onveniones tomadas en el apítulo anterior. 3.2. BLISS Lexion BLISS es una librería esrita en Python que nos p ermite generar un modelo léxio, que es el que ontendrá to dos los fonemas p osibles, y la transrip ión fonetia de to das las palabras que apareen en el orpus [Uni12a℄. En otras palabras, es el nexo de unión entre el Modelo de Lengua je y el Mo delo Austio. Para generar este mo delo, lo primero que haemos es parsear to das las transrip- iones y extraer to dos los textos en un hero (ada segmento transrito en una linea), eliminando aentos, signos de puntuaión y demás aráteres no pronuniables. Además onvertimos la adena resultante a mayúsulas, ya en uando se habla no se diferenian las mayúsulas de las minúsulas. El siguiente paso es obtener una lista de to das las palabras que apareen en el orpus de entrenamiento a partir de los heros generados anteriormente. A esta lista 15
memoria 2012/9/10 10:52 page 16 #22 i i Capítulo 3. Software de Reono imiento de palabras se le añade a la dereha su transrip ión fonétia, omo se puede observar en la tabla 3.1. Tabla 3.1: Ejemplo de varias Transrip iones Fonétias Palabra Transrip ión Fonétia ABACO a b a k o ACCEDIENDO a k z e d i e n d o NOTACION n o t a z i o n PREVIAMENTE p r e b i a m e n t e PEDIAN p e d i a n RECUERDO e k u e r d o REFLEJAR e f l e x a r TOTAL t o t a l Por último, utilizamos sobre el hero resultante on la lista de to das las palabras y su transrip ión fonétia, la herramienta Bliss Lexion [Uni12a℄ que genera un mo delo léxio aorde al formato que neesita el RWTH ASR System (ver seión 3.4). Este mo delo léxio posee las siguientes araterístias: 1. Posee una lista ompleta de to dos los fonemas utilizados. 2. Genera uatro lemas esp eiales para el silenio, iniio de frase, nal de frase y palabra desono ida (fuera del vo abulario del léxio). 3. Formatea la lista de lemmas (palabra on su transrip ión fonétia). 4. Es un hero XML bien formado, estándar y legible. Generar orretamente el mo delo léxio es el primer paso para p o der entrenar los mo delos que se neesitan para nuestro sistema. 3.3. SRILM NGram Para generar el Modelo de Lengua je, hemos utilizado la herramienta SRILM [Sto02℄ que es ompatible on el RWTH ASR System (ver seión 3.4). Esta herramienta se ha ido desarrollando desde 1995 p or el SRI Speeh Tehnology and Researh Laboratory y uenta ahora on una gran variedad de algoritmos y optimiza- iones. El Mo delo de Lengua je se genera utilizando esta herramienta sobre el hero de frases parseado reado previamente (en la seión 3.2), y genera un hero en texto plano on to dos los n-gramas y su probabilidad de apariión. Sin embargo existen muhas variantes que se listan a ontinuaión: 1. Permite jar ualquier orden de N-Gramas al mo delo de lengua je (unigramas, bigramas, trigramas, uatrigramas, et). 16 PRHLT-DSIC-UPV
memoria 2012/9/10 10:52 page 17 #23 i i 3.4. RWTH ASR System 2. Permite utilizar multiples ténias de desuento entre las que destaa el algoritmo Kneser-Ney [KN95℄ que mejora los resultados. 3. Permite apliar ténias de suavizado al mo delo de lengua je según lo expliado en la seión 1.5.3 de este do umento. Como hemos omentado, el mo delo de lengua je generado es un hero en texto plano on diversas seiones [Sto02℄. La primera seión india para ada orden de n-gramas que antidad de ellos se ha generado (si se aplia suavizado habrán datos desde el n-grama esogido hasta el unigrama). Después aparee la lista de los n-gramas divididas en seiones para ada uno de los n-gramas (una seión on unigramas, otra on bigramas, otra trigramas, et). A ada uno de estos n-gramas le aompaña la probabilidad en formato logarítmio en base 10, para aumentar la preisión ya que suelen ser probabilidades muy p equeñas (al hab er muhisimas palabras en el mo delo de lengua je). 3.4. RWTH ASR System El RWTH ASR System es un to olkit de Reono imiento del Habla Continua reado en el 2001 y mantenido por la RWTH AACHEN University . Es un to olkit fundamentalmente entrado en la generaión de Mo delos Austios [Uni12℄, sin embargo puede utilizar el Mo delo de Lengua je de SRILM para realizar el proeso de entrenamiento y reono imiento del habla ompletos. Este to olkit p osee una gran antidad de araterístias que lo haen uno de los to olkits más avanzados para el Reono imiento del Habla Continua [LGH + 07℄ [RGH + 09℄. Entre estas araterístias destaa la posibilidad de realizar on este toolkit to das las fases del Reonoimiento del Habla Continua (exepto la generaión del Mo delo de Lengua je) que se ilustran en las guras 1.2 y 1.3. En esta seión vamos a introduir el funionamiento básio de este to olkit, y a expliar el pro eso que se sigue para realizar las diferentes fases del Reono imiento del Habla on él. 3.4.1. Extraion de Caraterístias El pro eso de extraión de araterístias requiere iniialmente de segmentos de audio en formato WAV; p or lo que deb emos prepro esar los videos para extraerles el audio y segmentarlos según las maras de tiempo que se hayan oloado manualmente en la transrip ión del video. Para esto hemos utilizado las herramientas mpeg y SoX, según se ha omentado en la seión 3.1. A ontinuaión se deb en rear unos heros reording y orpus que simplemente listan to dos los segmentos que se deben utilizar para la extraión de araterístias. En este aso hemos reado un par de estos heros p or ada video del orpus, listando to dos los segmentos del video. El formato de estos heros es muy simple y puede onsultarse en la do umentaión oial del to olkit [Uni12b℄. A partir de este punto, omo se puede observar en la gura 3.1, pasamos a la fase de extraión de araterístias propiamente diha. Para esta fase ya utilizamos el PRHLT-DSIC-UPV 17
memoria 2012/9/10 10:52 page 18 #24 i i Capítulo 3. Software de Reono imiento Figura 3.1: Pro eso de Extraión de Caraterístias on RASR to olkit RASR, deniendo un hero de onguraión indiandole to dos los parámetros que neesita para esta fase. Aproximadamente on un RTF de 0,06 to do el orpus presentado en la seión 2.3 ha sido proesado on éxito por el RASR obteniendo un hero ahe por ada video que ontiene su MFCC (ver seión 1.4). A ontinuaión se van a normalizar las ahés reando una matriz de ovarianzas mediante dos heros de onguraión más, que el RASR apliará en dos pasos onseutivos. Esto nos p ermite normalizar todas las araterístias entre si para que no se distorsione la fase de aprendiza je. Este proeso es muy rápido y apenas tarda on el orpus del presente proyeto, obteniendo un RTF de pro esamiento que se aproximó al 0,01. 3.4.2. Entrenamiento on Monofonemas Para iniiar la fase de entrenamiento lo primero que se deb e de haer es denir unas partiiones en el orpus de datos. De esta forma tradiionalmente se divide en un onjunto de entrenamiento, uno de validaión y otro de testing, y se aplia esta fase úniamente sobre el onjunto de entrenamiento reando un hero Bundle que lista to das las ahés readas en el paso previo. A ontinuaión se deb e denir un hero de onguraión que utilizará el RASR para realizar el entrenamiento [Uni12b℄. En este hero no se india úniamente las rutas, y algunos detalles sin imp ortania, sino que se deb en espeiar dos parámetros 18 PRHLT-DSIC-UPV
memoria 2012/9/10 10:52 page 19 #25 i i 3.4. RWTH ASR System muy relevantes: 1. Estados: Se deb en de esp eiar el número de estados del Mo delo de Markov y sus rep etiiones para ada uno de los fonemas denidos en el Mo delo Léxio. Así pues, un valor de 5 provo ará que para ada fonema de una palabra hayan ino estados para representarla. 2. Mixturas: Se deb en denir el número de mixturas de gausianas p or estado. Generalmente este valor es un número múltiplo de 2 omo 128 o 512. Además se dene el número de iteraiones que se utilizan para álular estas mixturas (un valor adeuado osila entre 1 y 4). 0 10 20 30 40 50 60 70 80 90 100 0 100 200 300 400 500 600 Number Mixtures 0 10 20 30 40 50 60 70 0 100 200 300 400 500 600 700 800 900 1000 Number Mixtures 0 5 10 15 20 25 30 35 40 0 200 400 600 800 1000 1200 1400 1600 1800 2000 Number Mixtures Figura 3.2: Cantidad de Estados que tienen un número de Mixturas. Destaar que el número de mixturas es el máximo que un estado puede tener, p ero pueden hab er estados on muhas menos mixturas. Esto se puede observar laramente en la gura 3.2 que representa en ada olumna un número de mixturas y su valor es el número de estados que p oseen esa antidad de mixturas, y que ha sido extraida de un orpus de entrenamiento que se dene on el orpus presentado en la seión 2.3 asi ompleto. Así pues, en la gura 3.2 omprobamos que para un límite máximo de 512 mixturas hay muhos estados en la zona de 450-512 mixturas; para 1024 ya vemos omo el pio está sobre las 850 mixturas, p ero aún hay muhas on el límite máximo de mixturas denido. Sin embargo, para 2048 ya vemos omo prátiamente no hay estados on PRHLT-DSIC-UPV 19
memoria 2012/9/10 10:52 page 26 #32 i i Capítulo 4. Exp erimentos Preliminares 2. Word Insertion Penality: Rango de exploraión de valores entre 3 y 20, a intervalos de la unidad. 3. Número de Estados: Pruebas de 2 a 6 estados p or fonema on 1 o 2 repetiiones p or estado. 4. Número de Mixturas: Lista de valores disretos de 27 , 28 , 29 , 210 y 211 mixturas de gausianas. 5. Monofonemas o Trifonemas: To dos los parámetros anteriores se han optimizado para un mo delo de monofonemas, y para otro de trifonemas. 6. Número de Ho jas en Trifonemas: Para el mo delo de trifonemas se han probado on un máximo de 400, 600 u 800 ho jas. Optimización de Estados Optimización de Mixturas Optimización del GSF Optimización del WIP Monofonemas Trifonemas Hojas del Arbol de Trifonemas N del N-Grama WER Optimo Figura 4.1: Priorizaión de las Optimizaiones Realizadas Así pues, omo p o demos ver en la gura 4.1, para optimizar un entrenamiento on monofonemas (p or ejemplo) deb emos probar distintos valores de p osibles estados, y para ada uno de esos valores distintos valores de mixturas, y para ada una de esas mixturas distintos valores de GSF y WIP. Para el aso de trifonemas se añade de forma intermedia el número de Ho jas del Arbol de trifonemas. Destaar que el tiemp o de entrenamiento para monofonemas de ada una de las pruebas es muy elevado, siendo de aproximadamente de 0,26 de RTF para 27 mixturas, 0,39 de RTF para 29 mixturas, y hasta 1 de RTF para el aso de 210 mixturas de 26 PRHLT-DSIC-UPV
memoria 2012/9/10 10:52 page 27 #33 i i 4.3. Resultados Obtenidos gausianas. En otras palabras, el tiemp o de entrenamiento de los mo delos dep ende de forma direta del número de mixturas p or estado que se empleen en su entrenamiento, y tiene una evoluión exp onenial de tiemp o resp eto al número de mixturas utilizado. En el aso de trifonemas, el tiemp o de entrenamiento es aproximadamente un p o o más del doble que en el entrenamiento de monofonemas, ya que deb en entrenarse primero estos y a partir de ellos los mo delos de trifonemas. Así pues, el tiemp o de entrenamiento vuelve a dep ender del número de mixturas, que para el aso más omún de 29 mixturas alanza un RTF de 1,07. 4.3. Resultados Obtenidos En primer lugar, se ha realizado el a juste del número de estados p or fonema utilizando un mo delo de monofonemas y jando las mixturas a un número arbitrario de 27 mixturas p or gausianas. Los resultados de esta exploraión pueden verse en la gura 4.2, en la que p o demos ver omo el WER varía de 66.80 de máximo a 48.69 en el valor óptimo de ino estados p or fonema. 45 50 55 60 65 70 2 3 4 5 6 Word Error Rate Numero de Estados Figura 4.2: Ajuste del Número de Estados on Monofonemas A ontinuaión se ha realizado una exploraión del número de mixturas de gausianas óptimo para el mo delo de monofonemas, jando el número de estados al óptimo enontrado previamente de 5 estados p or fonema. La gura 4.3 muestra los resultados de la exploraión que osila entre 48.69 y 44.55 en el valor óptimo de 2048 mixturas de gausianas. PRHLT-DSIC-UPV 27
memoria 2012/9/10 10:52 page 28 #34 i i Capítulo 4. Exp erimentos Preliminares 43 44 45 46 47 48 49 128 256 512 1024 2048 4096 Word Error Rate Numero de Mixturas Figura 4.3: Ajuste del Número de Mixturas on Monofonemas 38.5 38.6 38.7 38.8 38.9 39 39.1 39.2 39.3 39.4 39.5 128 256 512 Word Error Rate Numero de Mixturas 400 Hojas 600 Hojas 800 Hojas Figura 4.4: Resultados del Ajuste de Trifonemas 28 PRHLT-DSIC-UPV
memoria 2012/9/10 10:52 page 29 #35 i i 4.3. Resultados Obtenidos Finalmente, se ha pasado a utilizar un mo delo de trifonemas, y utilizando el número de estados óptimo y la zona óptima de mixturas de gausianas obtenidas a partir de la exploraión de monofonemas, se ha realizado una exploraión onjunta del número de ho jas del árb ol de trifonemas y el número de mixturas óptimo en ada aso. Los resultados pueden observarse en la gura 4.4, que nos india laramente el óptimo en 800 ho jas y 256 mixturas on un WER de 38.61. Los resultados de este primer exp erimento ratian en primer lugar, que es muho mejor utilizar un sistema basado en trifonemas que uno basado en monofonemas, ya que funionan muho mejor. Además, este exp erimento p one de maniesto la omplejidad de la tarea de Reono imiento del Habla (en términos generales), y de los resultados de la misma. Destaar que es neesario optimizar el GSF y el WIP [Uni12℄ en ada una de las pruebas, ya que estos fatores determinan que el WER alane un mínimo global o se dispare de forma muy abrupta. Así pues, ada uno de los puntos de la gráa representar el valor de GSF y WIP optimo enontrado para ada onguraión de parámetros onreta. Así pues, en este primer experimento hemos onseguido un WER óptimo de 38.61 on mo delos de trifonemas de 5 estados sin rep etiión, y 28 mixturas de gausianas en 4 renamientos suesivos, on 800 ho jas máximas, un GSF de 10 y un WIP de 12. Destaar nalmente que estos resultado nos ofreen una transrip ión legible, aunque on bastantes errores sintátios, p ero que sin embargo es un buen punto de partida para esta ompleja tarea del Reono imiento del Habla Continua. Tabla 4.2: Resultados Optimos de la Experimentaión Preliminar Tip o de Mo delo WER Optimo Monofonemas 44.55 Trifonemas 38.61 PRHLT-DSIC-UPV 29
memoria 2012/9/10 10:52 page 30 #36 i i
memoria 2012/9/10 10:52 page 31 #37 i i Capítulo 5 Experimentaión 5.1. Partiiones Utilizadas Para la experimentaión denitiva de este proyeto, y una vez realizada una primera toma de ontato en la seión 4.1, se han utilizado las partiiones denidas sobre el proyeto europ eo de investigaión TransLetures [dV12a℄. La esp eiaión de estas partiiones se puede observar on más detalle en las tablas 5.1 y 5.2, y nos garantiza en gran medida que los resultados no estén sesgados. Tabla 5.1: Resumen de los videos de validaión de TransLetures Conjunto Duraión Dominio Genero 00501-Profesores_POLIMEDIA_II/M46 01:24:00 Leyes Hombre Profesores_POLIMEDIA/M74 00:48:00 Estadístia Mujer Profesores_POLIMEDIA/M26 00:42:00 Gráos Mujer 00501-Profesores_POLIMEDIA_II/M54 00:36:00 Geolo alizaión Hombre Profesores_POLIMEDIA_I/M40 00:18:00 Botánia Hombre Tabla 5.2: Resumen de los videos de test nal de TransLetures Conjunto Duraión Dominio Genero Profesores_POLIMEDIA_I/M47 01:06:00 Arquitetura Mujer Profesores_POLIMEDIA/M62 00:48:00 Marketing Hombre 00505-Profesores_Aloy/M03 00:42:00 Medio Ambiente Hombre Profesores_POLIMEDIA/M67 00:30:00 Informátia Hombre Profesores_POLIMEDIA/M47 00:18:00 Leyes Mujer 31
memoria 2012/9/10 10:52 page 32 #38 i i Capítulo 5. Exp erimentaión Este proyeto de investigaión europ eo dene una partiión de validaión de 3 horas y 48 minutos, y otra para el test nal de 3 horas y 24 minutos. El resto de videos desritos en la seión 2.3 que no están inluidos en ninguno de estos onjuntos, y que no han presentado ningún problema en el software de reono imiento, se han utilizado para realizar el entrenamiento de los mo delos (on un total de 89 horas). 5.2. Resultados Base La optimizaión iniial se ha llevado a abo siguiendo el proeso denido en la se- ión 4.2, que onsiste en una exploraión exhaustiva de parámetros sobre el onjunto de validaión para obtener el mejor WER p osible. Debido al enorme tamaño del orpus de entrenamiento, esto se ha llevado a ab o partiendo de la base obtenida el la seión 4.3 de forma que se ha restringido diha exploraión a los parámetros que mejor han funionado previamente. Se ha restringido la exploraión a mo delos de trifonemas de tres a ino estados sin rep etiiones, explorando el número de ho jas y mixturas en un rango muy aotado (600 y 800 ho jas on 27 , 28 y 29 mixturas de gausianas), y probando mo delos de lengua je de bigramas, trigramas y uatrigramas. El resultado es una onguraión de parámetros muy similar al obtenido en la seión 4.2, p ero al utilizar más antidad de audio se han elevado el número de mixturas de gausianas neesarias a 29 , que es el óptimo enontrado. Una vez obtenidos estos parámetros optimos, hemos pasado a realizar una prueba nal sobre el onjunto de test esp eiado en la seión 5.3. Para ello se han empleado los parámetros obtenidos sobre el onjunto de validaión en el reono edor, obteniendo un WER nal de 39.37 puntos (ver mas detalles en la tabla 5.3). Como p o demos ver el resultado es muy similar al exp erimento de la seión 4.3, p or lo que realizar el a juste sobre un sub onjunto de datos ha sido una deisión aertada (p or el ahorro de tiemp o que onlleva, y la validez de los resultados). Tabla 5.3: WER Óptimo del Baseline de la Exp erimentaion Mo delo de Lengua je WER Óptimo 2-Gramas 40.62 3-Gramas 39.37 4-Gramas 39.44 Así pues, partiendo de estos resultados base iniiales, vamos a pro eder a realizar una mejora sustanial en el pro eso de reono imiento para mejorar este aeptable resultado iniial de forma signiativa. 32 PRHLT-DSIC-UPV
memoria 2012/9/10 10:52 page 33 #39 i i 5.3. Mejora del Reono imiento 5.3. Mejora del Reono imiento Los resultados obtenidos hasta ahora son una muy buena base iniial, p ero se pueden intentar mejorar aún más utilizando diversas ténias más avanzadas. Como ob jetivo en este proyeto nos hemos planteado utilizar la ombinaión de diversos mo delos de lengua je para mejorar estos resultados de forma signiativa. Para ello, hemos empleado omo mo delo de lengua je externo los ono idos Go ogle NGrams [MSA + ℄ disp onibles de forma públia a través de su propia página web. Los Go ogle NGrams es el resultado que ha obtenido Go ogle de apliar ténias de OCR sobre una gran antidad de libros que datan desde el 1800 hasta el 2009. Una vez apliado este OCR se han omputado los unigramas, bigramas, trigramas, uatrigramas y 5-gramas de todas las obras separando el resultado por años. El resultado nal es un omp endio de uentas divididas p or años de una antidad ingente de libros, que Go ogle ha puesto a libre disposiión, y que se van a utilizar en este proyeto para generar un mo delo de lengua je que omplementará al extraido de las transrip iones manuales de los videos del onjunto de entrenamiento. El primer paso ha sido uniar to das las uentas que están divididas p or años en una únia gran uenta que ontemple to dos los años a la vez. A ontinuaión se ha extraido un mo delo de lengua je de n-gramas utilizando omo base esta gran uenta generada en el paso previo. Paralelamente se ha extraido un mo delo de lengua je de las transrip iones del onjunto de entrenamiento, y se han ombinado linealmente los dos mo delos de lengua je en uno únio, p onderando los dos iniiales para obtener la menor perplegidad p osible sobre las transripiones del onjunto de validaión. Esta ombinaión se realiza partiendo de un voabulario base, e inluyendo to dos los ngramas que se enuentran en este vo abulario de los dos mo delos al mo delo nal uniado, p onderando los pesos de forma óptima. Así pues, este pro eso se va a rep etir para mo delos de lengua je de bigramas, trigramas y uatrigramas on el ob jetivo de enontrar el mo delo de lengua je óptimo. Además, se van a utilizar a la hora de realizar la ombinaión lineal tres voabularios diferentes: 1. Úniamente el vo abulario exlusivo de p oliMedia, sin añadir palabras de las uentas de Google NGrams. 2. To do el vo abulario de p oliMedia y las 20.000 palabras más freuentes de las uentas de Google NGrams. 3. To do el vo abulario de p oliMedia y las 50.000 palabras más freuentes de las uentas de Google NGrams. Para realizar este pro eso nos hemos a servido de la herramienta SRILM NGram que se ha presentado en la seión 3.3, que nos p ermite llevar a ab o este pro eso de forma muy senilla, indiándole los textos de las transripiones de p oliMedia, las uentas de Go ogle NGrams, y el voabulario que se desea emplear. Una vez nalizada la ombinaión lineal de ada uno de los mo delos de lengua je, se han vuelto a enontrar los valores de GSF y WIP óptimos on el nuevo modelo de lengua je sobre el onjunto de validaión. Los resultados obtenidos han sido los que se muestran en la graa 5.1. PRHLT-DSIC-UPV 33
memoria 2012/9/10 10:52 page 34 #40 i i Capítulo 5. Exp erimentaión 32 33 34 35 36 37 38 39 40 2 3 4 Word Error Rate Orden de N-Gramas Baseline Google 0K Vocab Google 20K Vocab Google 50K Vocab Figura 5.1: Evoluión del WER en funión del Orden de N-Gramas Así pues, el aso en el que mejor se omp orta es uando utilizamos el vo abulario de p oliMedia y las 50.000 palabras más freuentes del mo delo de lengua je que hemos generado a partir de las uentas de Go ogle NGrams. Utilizando esta onguraión hemos obtenido nalmente un 33.73 de WER sobre el onjunto de test lo que sup one una mejora de un inreible 5.64 puntos de WER. Esta mejora se ve reejada en la tabla 5.4. Tabla 5.4: Resultados Optimos de la Exp erimentaión Final Sistema Empleado WER Trigramas WER Cuatrigramas Baseline 39.37 39.44 50K Google 33.73 33,78 Mejora Obtenida 5,64 5,66 34 PRHLT-DSIC-UPV
memoria 2012/9/10 10:52 page 35 #41 i i Capítulo 6 Conlusiones Finales 6.1. Resumen del Traba jo En el presente proyeto, se ha diseñado un sistema de reono imiento del habla ontinua, optimizando los mo delos y parámetros para obtener los mejores resultados p osibles sobre un orpus esp eio. Como software básio destaar que hemos utilizado el RWTH ASR System y el SRILM NGram para el entrenamiento de modelos y el reono imiento del audio, omo programas relevantes y fundamentales para el presente proyeto. El orpus empleado han sido los videos de libre distribuión de la plataforma Polimedia de la Universidad Politénia de Valenia, que se ha dividido en tres partiiones (entrenamiento, validaión y test nal) según las partiiones denidas en el proyeto europ eo de investigaión TransLetures [dV12a℄. El pro eso seguido ha onsistido en primer lugar en realizar una exploraión exhaustiva de parámetros y mo delos, para obtener un punto de partida iniial aeptable, que ha sido de 39.37 puntos de WER. Sobre este resultado iniial se ha planteado y ejeutado una mejora relevante, onsistente en la fusión del mo delo de lengua je iniial on el prop orionado p or Go ogle on el ob jetivo de mejorar el modelo iniial. La mejora nal obtenida ha sido de 5.64 puntos de WER obteniendo un resultado nal de 33.73 puntos de WER. Finalmente, estos mo delos se han empleado en la onstruión del reono edor del habla automátio para el sistema nal, generado omo resultado de este Proyeto Final de Carrera. Se trata de un programa que a partir de un diretorio on segmentos de audio genera una transrip ión aeptable de los mismos de forma ompletamente automátia. 6.2. Mejoras Futuras Durante el transurso del presente proyeto, se han enontrado diversos asp etos a tener en uenta para posibles mejoras futuras. De esta forma probablemente los 35
memoria 2012/9/10 10:52 page 42 #48 i i
memoria 2012/9/10 10:52 page 43 #49 i i Indie de Tablas 2.1. Comparativa del poliMedia Completo on Nuestro Corpus . . . . . . . 13 2.2. Ejemplo de una Transrip ión de Varios Segmentos . . . . . . . . . . . 14 3.1. Ejemplo de varias Transrip iones Fonétias . . . . . . . . . . . . . . . 16 4.1. Comparativa del Corpus Empleado y el Total de Videos . . . . . . . . 25 4.2. Resultados Optimos de la Experimentaión Preliminar . . . . . . . . . 29 5.1. Resumen de los videos de validaión de TransLetures . . . . . . . . . 31 5.2. Resumen de los videos de test nal de TransLetures . . . . . . . . . . 31 5.3. WER Óptimo del Baseline de la Exp erimentaion . . . . . . . . . . . . 32 5.4. Resultados Optimos de la Experimentaión Final . . . . . . . . . . . . 34 43
memoria 2012/9/10 10:52 page 44 #50 i i