scieee AI-readable full text Open interactive document viewer

Transcripción asistida de audio

Valor Miró, Juan Daniel

Abstract

Los medios de comunicación analógicos o digitales requieren tecnología avanzada para ser utilizados, además es difícil encontrar en este medio algún segmento o frase con las técnicas clásicas de computación y por otro lado, este medio se vuelve ineficiente para personas con alguna discapacidad acústica; una solución ampliamente utilizada es la de disponer de las transcripciones escritas del contenido sonoro del medio audiovisual, incrustadas en el propio vídeo en forma de subtítulos.

Full text

memoria  2012/9/10  10:52  page i  #1 i i UNIVERSIDAD POLITÉCNICA DE VALÉNCIA ESCUELA TÉCNICA SUPERIOR DE INGENIERÍA INFORMÁTICA DEPARTAMENTO DE SISTEMAS INFORMÁTICOS Y COMPUTACIÓN Transrip ión asistida de audio. Proyeto Final de Carrera - Ingeniería Informátia Juan Daniel Valor Miró Sup ervisado p or: Dr. Jorge Civera Saiz Dr. Alfons Juan Cisar 10 de septiembre de 2012 memoria  2012/9/10  10:52  page i i  #2 i i memoria  2012/9/10  10:52  page iii  #3 i i Graias a los que me han ayudado en el transurso de este proyeto. memoria  2012/9/10  10:52  page iv  #4 i i memoria  2012/9/10  10:52  page v  #5 i i Índie general 1. Intro duión 1 1.1. Motivaión del Proyeto . . . . . . . . . . . . . . . . . . . . . . . . . . 1 1.2. Reono imiento de Formas . . . . . . . . . . . . . . . . . . . . . . . . 2 1.3. Reono imiento del Habla Continua . . . . . . . . . . . . . . . . . . . 3 1.4. Extraión de Caraterístias . . . . . . . . . . . . . . . . . . . . . . . 5 1.5. Entrenamiento de los Mo delos . . . . . . . . . . . . . . . . . . . . . . . 5 1.5.1. Mo delos de Markov de Capa Oulta . . . . . . . . . . . . . . . 6 1.5.2. Mo delo Léxio . . . . . . . . . . . . . . . . . . . . . . . . . . . 7 1.5.3. Mo delos de Lengua je de N-Gramas . . . . . . . . . . . . . . . . 7 1.6. Evaluaión de los Resultados . . . . . . . . . . . . . . . . . . . . . . . 9 2. Desrip ión del Corpus 11 2.1. Plataforma p oliMedia . . . . . . . . . . . . . . . . . . . . . . . . . . . 11 2.2. El Formato de poliMedia . . . . . . . . . . . . . . . . . . . . . . . . . . 12 2.3. El Corpus p oliMedia . . . . . . . . . . . . . . . . . . . . . . . . . . . . 13 2.3.1. Pro eso de Transripión . . . . . . . . . . . . . . . . . . . . . 13 3. Software de Reono imiento 15 3.1. Software de Preproeso . . . . . . . . . . . . . . . . . . . . . . . . . . . 15 3.2. BLISS Lexion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15 3.3. SRILM NGram . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16 3.4. RWTH ASR System . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17 3.4.1. Extraion de Caraterístias . . . . . . . . . . . . . . . . . . . 17 3.4.2. Entrenamiento on Monofonemas . . . . . . . . . . . . . . . . . 18 3.4.3. Entrenamiento on Trifonemas . . . . . . . . . . . . . . . . . . 20 3.4.4. Reono imiento del Habla . . . . . . . . . . . . . . . . . . . . . 20 3.5. Analizador WER++ . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21 3.6. Programaión de un Front-End . . . . . . . . . . . . . . . . . . . . . . 22 4. Exp erimentos Preliminares 25 4.1. Partiion Utilizada . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25 4.2. Pro eso de Optimizaión . . . . . . . . . . . . . . . . . . . . . . . . . . 25 4.3. Resultados Obtenidos . . . . . . . . . . . . . . . . . . . . . . . . . . . 27 5. Exp erimentaión 31 5.1. Partiiones Utilizadas . . . . . . . . . . . . . . . . . . . . . . . . . . . 31 5.2. Resultados Base . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 32 5.3. Mejora del Reono imiento . . . . . . . . . . . . . . . . . . . . . . . . 33 v memoria  2012/9/10  10:52  page vi  #6 i i Índie general 6. Conlusiones Finales 35 6.1. Resumen del Traba jo . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35 6.2. Mejoras Futuras . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35 vi PRHLT-DSIC-UPV memoria  2012/9/10  10:52  page 1  #7 i i Capítulo 1 Introduión 1.1. Motivaión del Proyeto En la Soiedad de la Informaión en la que estamos inmersos, es muha la informa- ión que p o demos enontrar en muhos medios de omuniaión digitales o analógios. Tradiionalmente, esta informaión se ha transmitido en un medio esrito, llegando así al alane de la mayoría de la p oblaión existente; sin embargo atualmente esta tendenia está ambiando, tomando esp eial relevania otro tip o de medios de transmisión omo el audiovisual. De esta forma, este medio naido en el siglo XIX, ha ido tomando relevania en muhos ámbitos de la vida diaria omo la eduaión [Per02℄, el arte [Mag05℄, el turismo [Mar10℄, el ine [Med02℄, et. Sin embargo, y a pesar de las muhas venta jas que este medio ap orta a la transmisión de informaión, existen laras desventa jas de este medio resp eto a los medios lásios omo el esrito. En primer lugar, se trata de un medio que requiere de tenología avanzada para p o der ser utilizado (algún dispositivo on apaidad de reproduión de heros multimedia). Además, es muy diil enontrar en este medio algún segmento o frase on las ténias lásias de omputaión; de forma que si busamos una parte en onreto de, p or ejemplo, una onferenia, probablemente deb eremos esuharla ompletamente para lo alizar diho fragmento. Por otro lado, este medio se vuelve muy ineiente para p ersonas on algún tip o de disapaidad austia [dA11℄, ya que gran antidad de la informaión se transmite mediante el sonido. Destaar p or último, que la traduión de un medio audiovisual es muho más ompleja que la de un medio esrito, límitando así su expansión geográa. Así pues, una soluión ampliamente utilizada es la de disp oner de las transrip- iones esritas del ontenido sonoro del medio audiovisual, inrustadas en el propio video en forma de subtitulos. Así pues, de esta forma se soluiona on relativa failidad to dos los problemas menionados previamente, al pasar a traba jar on un medio puramente esrito. Sin embargo, el proeso de transripión de un medio audiovisual suele ser muy ostoso en tiempo y reursos [RG05℄, ya que se trata de un pro eso manual. Así pues, 1 memoria  2012/9/10  10:52  page 2  #8 i i Capítulo 1. Introduión para realizar la transrip ión de un medio audiovisual ámplio se requiere de muho p ersonal, tiempo, y reursos que no siempre se pueden obtener. Así pues, de la mano del Reonoimiento de Formas [DH73℄ se plantea la soluión a este problema mediante ténias de Reonoimiento Automátio del Habla Continua . De esta forma a partir de un medio audiovisual, de forma automátia y en base a unos modelos previamente generados, se puede extraer la transrip ión on una tasa de error relativamente ba ja. Además, para mejorar más aún esta tasa de error, pueden utilizarse ténias interativas de transrip ión asistida de audio, que pregunte al transriptor úniamente aquellos fragmentos de audio en los que rea que la transrip ión automátia ha p o dido fallar. 1.2. Reono imiento de Formas El Reono imiento de Formas es una rama de la Informátia uyo ob jetivo es la p erep ión de ob jetos p or un sistema, entendiendo p or p erep ión de ob jetos la apaidad de un sistema de darle un signiado semántio a un onjunto de datos mediante su etiquetado o lasiaión [Seg92℄. Un sistema de Reono imiento de Formas básio onsta de los siguiente mo dulos: 1. Prepro eso: Adquiere la señal desde un sensor externo o de alguna base de datos de informaión externa al sistema, la ltra eliminando el ruido y la prepara para ser pro esada p or el omputador. 2. Extraión de Caraterístias: Obtiene una serie de medidas, de la señal pro esada p or el mo dulo previo, que son relevantes para llevar a ab o el pro eso de etiquetado o lasiaión en la etapa p osterior. 3. Clasiaión: A partir de un mo delo debidamente entrenado y de las araterístias extraidas en el mo dulo anterior, utiliza ténias para aso iar al ob jeto su signiado semántio. Preproceso Extracción de Características Clasificación Objeto Vector de Características EtiquetaSeñal Modelo Figura 1.1: Sistema Básio de Reonoimiento de Formas Como se puede observar en la gura 1.1, para llevar a ab o el pro eso de lasi- aión nos hae falta un mo delo, que se obtiene mediante el uso de ténias estadístias de aprendiza je sobre un onjunto de datos de ejemplos ya lasiados o etiquetados previamente de forma manual y orreta. Para haernos una idea un po o más aproximada de omo funiona de forma básia un sistema de Reono imiento de Formas desde el punto de vista estadístio; 2 PRHLT-DSIC-UPV memoria  2012/9/10  10:52  page 3  #9 i i 1.3. Reono imiento del Habla Continua sup ongamos que E es un espaio de representaión de las muestras a etiquetar, y Ω = {ω1, ω2, ω3, ..., ωc} un onjunto de C etiquetas que pueden ser asignadas a ada una de las muestras x∈E del total de muestras E . Asi pues, si onoemos la proporión de muestras de la lase ωi resp eto al total, o lo que es lo mismo la probabilidad a priori P(ωi) ; y la probabilidad de que se de un x onreto sabiendo de antemano ωi , o lo que es lo mismo la probabilidad ondiional P(x|ωi) ; mediante la Regla de Bayes po demos estimar la probabilidad de que diha x p erteneza a ωi , o lo que es lo mismo la probabilidad a p osteriori P(ωi|x) [DH73℄. P(ωi|x) = P(x|ωi)P(ωi) PC j=1 P(x|ωj)P(ωj) (1.1) Sin embargo, en la mayoría de apliaiones de Reono imiento de Formas, es muy diil estimar adeuadamente P(ωi) y P(x|ωi) , p or lo que la mayoría de vees se opta p or utilizar ténias de aprendiza je que los estiman a partir de un onjunto de muestras de entrenamiento ya lasiadas. 1.3. Reono imiento del Habla Continua La rama que nos interesa del Reonoimiento de Formas es la que estudia el Reono imiento del Habla Continua, y que es onsiderada omo una rama uya tarea es muy ompleja [Ser05℄ debido a to dos los requerimientos impliitos de la misma. Los iniios de esta rama está en los años 50 en los lab oratorios Bell, donde onsiguieron realizar un reono imiento de dígitos aislados monoloutor. Al mismo tiemp o, en la University England Col lege rearon el primer reono edor fonétio, y en el MIT Linoln Lab un reono edor de vo ales indep endiente del hablante. En los años 60, se onsiguió la Alineaión Dinámia en el Tiemp o en Vintsyuk (la Unión Sovietia), y un primer intento de reono imiento del habla ontinua en el Carnegie Mel lon University . En los años 70, el mundo de la estadístia llegó al Reono imiento del Habla Continua, p ermitiendo p or primera vez un sistema de reono imiento de palabras aisladas que funionara muy bien. Además IBM desarrolló varios proyetos de reono imiento de grandes vo abularios, y la Carnegie Mel lon University desarrolló el primer sistema de reonoimiento del habla on éxito. A partir de los años 80, se produe una explosión de los méto dos estadístios, uyo éxito se debió a los Mo delos Oultos de Markov. Además el area de las Redes Neuronales se empezó a inluir en diversas partes del reono imiento de voz, mejorando su índie de éxito en el reono imiento. Además naió el sistema de reonoimiento del habla SPHINX [HCS℄ onsiderado omo uno de los mejores reonoedores del habla que existen hoy en día. Finalmente, desde los años 90 hasta la atualidad se han onseguido diversas apli- aiones omo sistemas de ditado, integraión en apliaiones telefónias, integraión en el Sistema Operativo, apariión del estándar VoieXML, et [RG06℄. Además la apariión del HTK Hidden Markov Mo del To olkit [YEG + 06℄ en el año 1989 de la mano de Cambridge University Engineering Department fue un gran avane para el Reono imiento del Habla Continua. PRHLT-DSIC-UPV 3 memoria  2012/9/10  10:52  page 10  #16 i i memoria  2012/9/10  10:52  page 11  #17 i i Capítulo 2 Desripión del Corpus 2.1. Plataforma p oliMedia El orpus que se ha utilizado en el presente proyeto se ha extraido de los videos on lienia libre del rep ositorio oial de la Universidad Politénia de Valenia ono ido omo p oliMedia. Según su desrip ión propia, p oliMedia es un sistema diseñado en la UPV para la reaión de ontenidos multimedia omo ap oyo a la doenia presenial, que abara desde la preparaión del material doente hasta la distribuión a través de distintos medios (TV, Internet, CD, et.) a los destinatarios de los mismos (que generalmente son los alumnos de la UPV) [dV12b℄. Las araterístias básias que denen a p oliMedia (según su web oial [dV12b℄) son las que se enumeran a ontinuaión: 1. p oliMedia es un sistema de pro duión de materiales eduativos de alidad. 2. Es un reurso integrado on to das las herramientas de PoliformaT. 3. Es muy adeuado omo apoyo y omplemento a la enseñanza presenial. 4. El autor es el propietario inteletual de la obra. 5. Sistema ompletamente innovador y únio, disp onible sólo en la UPV. 6. Disp onibilidad de instrumentos, materiales y ténios para el profesorado. 7. Lleva aso iado un plan de inentivos eonómios. 8. Es fáil: no requiere ono imientos audiovisuales o ténios. En resumen, p olimedia es una plataforma donde los profesores pueden publiar videos do entes según un mo delo estándar y utilizando los medios de la UPV para ello. Además se trata de una plataforma que a día 15 de Febrero de 2012 posee 6830 grabaiones que suman más de 1350 horas de video de más de 1033 profesores diferentes, lo ual le da muhisima relevania a nivel global. 11 memoria  2012/9/10  10:52  page 12  #18 i i Capítulo 2. Desrip ión del Corpus 2.2. El Formato de p oliMedia Los videos do entes que existen en la plataforma p oliMedia, siguen un formato estandar en to dos los videos, araterístio de la plataforma. Se trata de una vista onjunta de profesor y pantalla (diap ositivas, programas, et) en un mismo plano de ámara que no se mueve en to do el video. Diapositivas Programas Videos Educativos Otros Recursos Profesor UPV Figura 2.1: Formato de los Videos de p oliMedia El pro eso es muy simple: se graba en un estudio al profesor sobre un fondo blano (audio y video), y simultaneamente a la pantalla del ordenador (que previamente habrá argado algún tip o de reurso multimedia). Despúes se extrae la grabaión del profesor y se mezla on la de la pantalla según el esquema de la gura 2.1 y se le añade el logo de la UPV, añadiendo el nalmente el audio del profesor al video generado [dV12b℄. Este video ya editado nalmente se distribuye a través del portal oial de p oliMedia en formato MOV o MP4 (dependiendo del navegador utilizado para aeder a la plataforma). Sin embargo, para p o der traba jar on estos videos, en el presente proyeto se ha optado p or eliminar la parte gráa del video extrayendo del mismo el audio en formato WAV, que se utilizará omo entrada para nuestro sistema junto a la transripión manual del mismo. Destaar nalmente que la alidad del audio de los videos del p olimedia es muy alta, y no p osee pratiamente ningún tip o de ruido de fondo (ya que ha sido grabado en un estudio errado). Sin embargo, los loutores de los videos (más de 1.000 profesores) son de diferentes sexo y edad, lo que hae muy variables los tonos de voz y los ritmos de habla aso iados. Además las áreas temátias de los videos pueden llegar a 12 PRHLT-DSIC-UPV memoria  2012/9/10  10:52  page 13  #19 i i 2.3. El Corpus p oliMedia ser muy diferentes (on más de 650 areas temátias bien difereniadas), y además se tiende a emplear términos muy ténios que es improbable que se repitan más de tres o uatro vees en to do el p olimedia. Esto hae del p oliMedia un rep ositorio de audio bueno, p ero muy variable en uanto a austia y semántia, lo ual representa un grave inonveniente uando se traba ja on sistemas de Reonimiento del Habla Continua que se basan en modelos de aprendiza je. 2.3. El Corpus p oliMedia El onjunto utilizado se orresp onde on una p equeña parte del total de graba- iones del p olimedia, uyos autores han dejado la lienia ompletamente libre. En total, hemos extraido 1350 horas de video aproximadamente en 732 grabaiones de diferentes temas y profesores [dV12b℄. Tabla 2.1: Comparativa del p oliMedia Completo on Nuestro Corpus Conjunto Horas Videos poliMedia Completo 1350 6830 Nuestro Conjunto 119 732 Porentaje Total 8,85 % 10,72 % Diho orpus ha sido transrito manualmente al ompleto p or 10 p ersonas, y el autor de este proyeto nal de arrera on un total de 832 minutos de video. Para ello se ha utilizado la herramienta de software libre ono ida omo Transrib er [BGWL00℄. 2.3.1. Pro eso de Transrip ión Para transribir ada uno de los videos se ha seguido un pro eso estándar p or to dos los miembros del grup o, para que los resultados sean los mismos en to das las transrip iones y de esta manera onseguir un orpus uniado y ompleto. En primer lugar, y partiendo del video, se ha utilizado mpeg para extraer su ontenido en formato WAV (una pista de audio únia). Una vez extraido el audio, pasamos a iniiar su transrip ión on el programa Transriber, que nos p ermite realizar dos tareas fundamentales a la hora de llevar a ab o una transrip ión: 1. Segmentar: Hay que olo ar maras de tiemp o para separar las frases on un signiado sintátio y semántio propio, para p o der apliar el sistema desrito en la seión 1.5. 2. Transribir: Cada segmento deb e p oseer en arateres UTF-8 el ontenido de las palabras que se pronunian en él, siguiendo las reglas que se desriben en esta seión. PRHLT-DSIC-UPV 13 memoria  2012/9/10  10:52  page 14  #20 i i Capítulo 2. Desrip ión del Corpus Además, hay que destaar que se han optado p or una serie de onveniones a la hora de realizar dihas transripiones, on el ob jetivo de representar adeuadamente las disuenias orales en el habla. Estas onveniones son las siguientes: 1. Se identiará el profesor que habla en ada video, asi omo su sexo. 2. Se segmentará el audio en frases, transribiendo ada una de ellas. 3. Cuando se pro duza una disuenia, se anotara utilizando la siguiente notaión estándar global: /sonido pronuniado/palabra orreta/ 4. Cuando se pro duza un silenio largo se reará un segmento uya transrip ión será úniamente [sonido de fondo℄. 5. Cuando se pro duza un silenio orto se añadirá la notaión /SF//. Es imp ortante destaar la laboriosa tarea que sup one la transrip ión un video de forma manual y lo importante que ha sido para la puesta en marha de este proyeto nal de arrera. Por destaar algunos datos, omentar que el RTF (ratio de tiemp o de transrip ión de audio resp eto al tiempo del propio audio) es de una media de 11. Esto implia que p or ada minuto de audio se emplean 11 para transribirlo, lo ual implia que para transribir todo el orpus utilizado en este proyeto se han empleado aproximadamente 1314 horas. Después se deb e veriar los errores de ortografía ometidos al transribir rápidamente un video, por lo que utilizaremos la herramienta aspel l para veriar y orregir dihos errores. Además utilizaremos un p equeño sript para omprobar si las expresiones espeiales que hemos olo ado entre barras están orretas o existe algúna de más o de menos, ya que esto provo aría a la hora de parsear la transripión numerosos errores. Tabla 2.2: Ejemplo de una Transrip ión de Varios Segmentos Seg. Tiemp o Transripión 1 3,1s El bule for /ih/eah/ es un bule que itera una lista. 2 1,9s Por ejemplo, la variable entera /jota/J/. 3 4,0s Se trata /e//, de una sentenia realmente útil. 4 5,4s No olvideis /que que/que/ no existe en /e/C/. Como p o demos ver en la Tabla 2.2, la transrip ión de un fragmento de audio no es trivial. En el segmento 1 po demos observar omo se pronunia una palabra en inglés, y omo esta mediante la sintáxis de las barras deb e ser esp eiada primero fonetiamente y luego bien esrita. En el segmento 2 pasa algo similar, pero en este aso se trata de la pronuniaión de una letra del alfab eto. En el segmento 3 se pro due una duda del loutor, que pronunia un sonido eee uando en realidad deb ería hab er ontinuado la frase. En el segmento 4, el lo utor repite la pronuniaión del que siendo úniamente uno de los dos válido, y de nuevo o urre la situaión del segmento número 2. 14 PRHLT-DSIC-UPV memoria  2012/9/10  10:52  page 15  #21 i i Capítulo 3 Software de Reonoimiento 3.1. Software de Prepro eso En primer lugar, destaar que para el preproeso del orpus original (videos en formato estádar MP4), se han realizado los siguientes ltrados, para extraer una señal denitiva de audio en formato WAV: 1. Extraión del anal de audio del video original utilizando mpeg . 2. Reo diaión del audio en formato WAV a un anal y 16000Hz on SOX. Así pues, el software impliado es el onoido manejador de heros multimedia mpeg y el reo diador de diversos formatos SOX, muy ono idos en el area de la multimedia y el proesado de heros. Por otro lado, para el preproeso de las transrip iones se ha utilizado un sript manual en Python 3, reado por el autor de este proyeto nal de arrera, para adaptar las transrip iones a las onveniones tomadas en el apítulo anterior. 3.2. BLISS Lexion BLISS es una librería esrita en Python que nos p ermite generar un modelo léxio, que es el que ontendrá to dos los fonemas p osibles, y la transrip ión fonetia de to das las palabras que apareen en el orpus [Uni12a℄. En otras palabras, es el nexo de unión entre el Modelo de Lengua je y el Mo delo Austio. Para generar este mo delo, lo primero que haemos es parsear to das las transrip- iones y extraer to dos los textos en un hero (ada segmento transrito en una linea), eliminando aentos, signos de puntuaión y demás aráteres no pronuniables. Además onvertimos la adena resultante a mayúsulas, ya en uando se habla no se diferenian las mayúsulas de las minúsulas. El siguiente paso es obtener una lista de to das las palabras que apareen en el orpus de entrenamiento a partir de los heros generados anteriormente. A esta lista 15 memoria  2012/9/10  10:52  page 16  #22 i i Capítulo 3. Software de Reono imiento de palabras se le añade a la dereha su transrip ión fonétia, omo se puede observar en la tabla 3.1. Tabla 3.1: Ejemplo de varias Transrip iones Fonétias Palabra Transrip ión Fonétia ABACO a b a k o ACCEDIENDO a k z e d i e n d o NOTACION n o t a z i o n PREVIAMENTE p r e b i a m e n t e PEDIAN p e d i a n RECUERDO  e k u e r d o REFLEJAR  e f l e x a r TOTAL t o t a l Por último, utilizamos sobre el hero resultante on la lista de to das las palabras y su transrip ión fonétia, la herramienta Bliss Lexion [Uni12a℄ que genera un mo delo léxio aorde al formato que neesita el RWTH ASR System (ver seión 3.4). Este mo delo léxio posee las siguientes araterístias: 1. Posee una lista ompleta de to dos los fonemas utilizados. 2. Genera uatro lemas esp eiales para el silenio, iniio de frase, nal de frase y palabra desono ida (fuera del vo abulario del léxio). 3. Formatea la lista de lemmas (palabra on su transrip ión fonétia). 4. Es un hero XML bien formado, estándar y legible. Generar orretamente el mo delo léxio es el primer paso para p o der entrenar los mo delos que se neesitan para nuestro sistema. 3.3. SRILM NGram Para generar el Modelo de Lengua je, hemos utilizado la herramienta SRILM [Sto02℄ que es ompatible on el RWTH ASR System (ver seión 3.4). Esta herramienta se ha ido desarrollando desde 1995 p or el SRI Speeh Tehnology and Researh Laboratory y uenta ahora on una gran variedad de algoritmos y optimiza- iones. El Mo delo de Lengua je se genera utilizando esta herramienta sobre el hero de frases parseado reado previamente (en la seión 3.2), y genera un hero en texto plano on to dos los n-gramas y su probabilidad de apariión. Sin embargo existen muhas variantes que se listan a ontinuaión: 1. Permite jar ualquier orden de N-Gramas al mo delo de lengua je (unigramas, bigramas, trigramas, uatrigramas, et). 16 PRHLT-DSIC-UPV memoria  2012/9/10  10:52  page 17  #23 i i 3.4. RWTH ASR System 2. Permite utilizar multiples ténias de desuento entre las que destaa el algoritmo Kneser-Ney [KN95℄ que mejora los resultados. 3. Permite apliar ténias de suavizado al mo delo de lengua je según lo expliado en la seión 1.5.3 de este do umento. Como hemos omentado, el mo delo de lengua je generado es un hero en texto plano on diversas seiones [Sto02℄. La primera seión india para ada orden de n-gramas que antidad de ellos se ha generado (si se aplia suavizado habrán datos desde el n-grama esogido hasta el unigrama). Después aparee la lista de los n-gramas divididas en seiones para ada uno de los n-gramas (una seión on unigramas, otra on bigramas, otra trigramas, et). A ada uno de estos n-gramas le aompaña la probabilidad en formato logarítmio en base 10, para aumentar la preisión ya que suelen ser probabilidades muy p equeñas (al hab er muhisimas palabras en el mo delo de lengua je). 3.4. RWTH ASR System El RWTH ASR System es un to olkit de Reono imiento del Habla Continua reado en el 2001 y mantenido por la RWTH AACHEN University . Es un to olkit fundamentalmente entrado en la generaión de Mo delos Austios [Uni12℄, sin embargo puede utilizar el Mo delo de Lengua je de SRILM para realizar el proeso de entrenamiento y reono imiento del habla ompletos. Este to olkit p osee una gran antidad de araterístias que lo haen uno de los to olkits más avanzados para el Reono imiento del Habla Continua [LGH + 07℄ [RGH + 09℄. Entre estas araterístias destaa la posibilidad de realizar on este toolkit to das las fases del Reonoimiento del Habla Continua (exepto la generaión del Mo delo de Lengua je) que se ilustran en las guras 1.2 y 1.3. En esta seión vamos a introduir el funionamiento básio de este to olkit, y a expliar el pro eso que se sigue para realizar las diferentes fases del Reono imiento del Habla on él. 3.4.1. Extraion de Caraterístias El pro eso de extraión de araterístias requiere iniialmente de segmentos de audio en formato WAV; p or lo que deb emos prepro esar los videos para extraerles el audio y segmentarlos según las maras de tiempo que se hayan oloado manualmente en la transrip ión del video. Para esto hemos utilizado las herramientas mpeg y SoX, según se ha omentado en la seión 3.1. A ontinuaión se deb en rear unos heros reording y orpus que simplemente listan to dos los segmentos que se deben utilizar para la extraión de araterístias. En este aso hemos reado un par de estos heros p or ada video del orpus, listando to dos los segmentos del video. El formato de estos heros es muy simple y puede onsultarse en la do umentaión oial del to olkit [Uni12b℄. A partir de este punto, omo se puede observar en la gura 3.1, pasamos a la fase de extraión de araterístias propiamente diha. Para esta fase ya utilizamos el PRHLT-DSIC-UPV 17 memoria  2012/9/10  10:52  page 18  #24 i i Capítulo 3. Software de Reono imiento Figura 3.1: Pro eso de Extraión de Caraterístias on RASR to olkit RASR, deniendo un hero de onguraión indiandole to dos los parámetros que neesita para esta fase. Aproximadamente on un RTF de 0,06 to do el orpus presentado en la seión 2.3 ha sido proesado on éxito por el RASR obteniendo un hero ahe por ada video que ontiene su MFCC (ver seión 1.4). A ontinuaión se van a normalizar las ahés reando una matriz de ovarianzas mediante dos heros de onguraión más, que el RASR apliará en dos pasos onseutivos. Esto nos p ermite normalizar todas las araterístias entre si para que no se distorsione la fase de aprendiza je. Este proeso es muy rápido y apenas tarda on el orpus del presente proyeto, obteniendo un RTF de pro esamiento que se aproximó al 0,01. 3.4.2. Entrenamiento on Monofonemas Para iniiar la fase de entrenamiento lo primero que se deb e de haer es denir unas partiiones en el orpus de datos. De esta forma tradiionalmente se divide en un onjunto de entrenamiento, uno de validaión y otro de testing, y se aplia esta fase úniamente sobre el onjunto de entrenamiento reando un hero Bundle que lista to das las ahés readas en el paso previo. A ontinuaión se deb e denir un hero de onguraión que utilizará el RASR para realizar el entrenamiento [Uni12b℄. En este hero no se india úniamente las rutas, y algunos detalles sin imp ortania, sino que se deb en espeiar dos parámetros 18 PRHLT-DSIC-UPV memoria  2012/9/10  10:52  page 19  #25 i i 3.4. RWTH ASR System muy relevantes: 1. Estados: Se deb en de esp eiar el número de estados del Mo delo de Markov y sus rep etiiones para ada uno de los fonemas denidos en el Mo delo Léxio. Así pues, un valor de 5 provo ará que para ada fonema de una palabra hayan ino estados para representarla. 2. Mixturas: Se deb en denir el número de mixturas de gausianas p or estado. Generalmente este valor es un número múltiplo de 2 omo 128 o 512. Además se dene el número de iteraiones que se utilizan para álular estas mixturas (un valor adeuado osila entre 1 y 4). 0 10 20 30 40 50 60 70 80 90 100 0 100 200 300 400 500 600 Number Mixtures 0 10 20 30 40 50 60 70 0 100 200 300 400 500 600 700 800 900 1000 Number Mixtures 0 5 10 15 20 25 30 35 40 0 200 400 600 800 1000 1200 1400 1600 1800 2000 Number Mixtures Figura 3.2: Cantidad de Estados que tienen un número de Mixturas. Destaar que el número de mixturas es el máximo que un estado puede tener, p ero pueden hab er estados on muhas menos mixturas. Esto se puede observar laramente en la gura 3.2 que representa en ada olumna un número de mixturas y su valor es el número de estados que p oseen esa antidad de mixturas, y que ha sido extraida de un orpus de entrenamiento que se dene on el orpus presentado en la seión 2.3 asi ompleto. Así pues, en la gura 3.2 omprobamos que para un límite máximo de 512 mixturas hay muhos estados en la zona de 450-512 mixturas; para 1024 ya vemos omo el pio está sobre las 850 mixturas, p ero aún hay muhas on el límite máximo de mixturas denido. Sin embargo, para 2048 ya vemos omo prátiamente no hay estados on PRHLT-DSIC-UPV 19 memoria  2012/9/10  10:52  page 26  #32 i i Capítulo 4. Exp erimentos Preliminares 2. Word Insertion Penality: Rango de exploraión de valores entre 3 y 20, a intervalos de la unidad. 3. Número de Estados: Pruebas de 2 a 6 estados p or fonema on 1 o 2 repetiiones p or estado. 4. Número de Mixturas: Lista de valores disretos de 27 , 28 , 29 , 210 y 211 mixturas de gausianas. 5. Monofonemas o Trifonemas: To dos los parámetros anteriores se han optimizado para un mo delo de monofonemas, y para otro de trifonemas. 6. Número de Ho jas en Trifonemas: Para el mo delo de trifonemas se han probado on un máximo de 400, 600 u 800 ho jas. Optimización de Estados Optimización de Mixturas Optimización del GSF Optimización del WIP Monofonemas Trifonemas Hojas del Arbol de Trifonemas N del N-Grama WER Optimo Figura 4.1: Priorizaión de las Optimizaiones Realizadas Así pues, omo p o demos ver en la gura 4.1, para optimizar un entrenamiento on monofonemas (p or ejemplo) deb emos probar distintos valores de p osibles estados, y para ada uno de esos valores distintos valores de mixturas, y para ada una de esas mixturas distintos valores de GSF y WIP. Para el aso de trifonemas se añade de forma intermedia el número de Ho jas del Arbol de trifonemas. Destaar que el tiemp o de entrenamiento para monofonemas de ada una de las pruebas es muy elevado, siendo de aproximadamente de 0,26 de RTF para 27 mixturas, 0,39 de RTF para 29 mixturas, y hasta 1 de RTF para el aso de 210 mixturas de 26 PRHLT-DSIC-UPV memoria  2012/9/10  10:52  page 27  #33 i i 4.3. Resultados Obtenidos gausianas. En otras palabras, el tiemp o de entrenamiento de los mo delos dep ende de forma direta del número de mixturas p or estado que se empleen en su entrenamiento, y tiene una evoluión exp onenial de tiemp o resp eto al número de mixturas utilizado. En el aso de trifonemas, el tiemp o de entrenamiento es aproximadamente un p o o más del doble que en el entrenamiento de monofonemas, ya que deb en entrenarse primero estos y a partir de ellos los mo delos de trifonemas. Así pues, el tiemp o de entrenamiento vuelve a dep ender del número de mixturas, que para el aso más omún de 29 mixturas alanza un RTF de 1,07. 4.3. Resultados Obtenidos En primer lugar, se ha realizado el a juste del número de estados p or fonema utilizando un mo delo de monofonemas y jando las mixturas a un número arbitrario de 27 mixturas p or gausianas. Los resultados de esta exploraión pueden verse en la gura 4.2, en la que p o demos ver omo el WER varía de 66.80 de máximo a 48.69 en el valor óptimo de ino estados p or fonema. 45 50 55 60 65 70 2 3 4 5 6 Word Error Rate Numero de Estados Figura 4.2: Ajuste del Número de Estados on Monofonemas A ontinuaión se ha realizado una exploraión del número de mixturas de gausianas óptimo para el mo delo de monofonemas, jando el número de estados al óptimo enontrado previamente de 5 estados p or fonema. La gura 4.3 muestra los resultados de la exploraión que osila entre 48.69 y 44.55 en el valor óptimo de 2048 mixturas de gausianas. PRHLT-DSIC-UPV 27 memoria  2012/9/10  10:52  page 28  #34 i i Capítulo 4. Exp erimentos Preliminares 43 44 45 46 47 48 49 128 256 512 1024 2048 4096 Word Error Rate Numero de Mixturas Figura 4.3: Ajuste del Número de Mixturas on Monofonemas 38.5 38.6 38.7 38.8 38.9 39 39.1 39.2 39.3 39.4 39.5 128 256 512 Word Error Rate Numero de Mixturas 400 Hojas 600 Hojas 800 Hojas Figura 4.4: Resultados del Ajuste de Trifonemas 28 PRHLT-DSIC-UPV memoria  2012/9/10  10:52  page 29  #35 i i 4.3. Resultados Obtenidos Finalmente, se ha pasado a utilizar un mo delo de trifonemas, y utilizando el número de estados óptimo y la zona óptima de mixturas de gausianas obtenidas a partir de la exploraión de monofonemas, se ha realizado una exploraión onjunta del número de ho jas del árb ol de trifonemas y el número de mixturas óptimo en ada aso. Los resultados pueden observarse en la gura 4.4, que nos india laramente el óptimo en 800 ho jas y 256 mixturas on un WER de 38.61. Los resultados de este primer exp erimento ratian en primer lugar, que es muho mejor utilizar un sistema basado en trifonemas que uno basado en monofonemas, ya que funionan muho mejor. Además, este exp erimento p one de maniesto la omplejidad de la tarea de Reono imiento del Habla (en términos generales), y de los resultados de la misma. Destaar que es neesario optimizar el GSF y el WIP [Uni12℄ en ada una de las pruebas, ya que estos fatores determinan que el WER alane un mínimo global o se dispare de forma muy abrupta. Así pues, ada uno de los puntos de la gráa representar el valor de GSF y WIP optimo enontrado para ada onguraión de parámetros onreta. Así pues, en este primer experimento hemos onseguido un WER óptimo de 38.61 on mo delos de trifonemas de 5 estados sin rep etiión, y 28 mixturas de gausianas en 4 renamientos suesivos, on 800 ho jas máximas, un GSF de 10 y un WIP de 12. Destaar nalmente que estos resultado nos ofreen una transrip ión legible, aunque on bastantes errores sintátios, p ero que sin embargo es un buen punto de partida para esta ompleja tarea del Reono imiento del Habla Continua. Tabla 4.2: Resultados Optimos de la Experimentaión Preliminar Tip o de Mo delo WER Optimo Monofonemas 44.55 Trifonemas 38.61 PRHLT-DSIC-UPV 29 memoria  2012/9/10  10:52  page 30  #36 i i memoria  2012/9/10  10:52  page 31  #37 i i Capítulo 5 Experimentaión 5.1. Partiiones Utilizadas Para la experimentaión denitiva de este proyeto, y una vez realizada una primera toma de ontato en la seión 4.1, se han utilizado las partiiones denidas sobre el proyeto europ eo de investigaión TransLetures [dV12a℄. La esp eiaión de estas partiiones se puede observar on más detalle en las tablas 5.1 y 5.2, y nos garantiza en gran medida que los resultados no estén sesgados. Tabla 5.1: Resumen de los videos de validaión de TransLetures Conjunto Duraión Dominio Genero 00501-Profesores_POLIMEDIA_II/M46 01:24:00 Leyes Hombre Profesores_POLIMEDIA/M74 00:48:00 Estadístia Mujer Profesores_POLIMEDIA/M26 00:42:00 Gráos Mujer 00501-Profesores_POLIMEDIA_II/M54 00:36:00 Geolo alizaión Hombre Profesores_POLIMEDIA_I/M40 00:18:00 Botánia Hombre Tabla 5.2: Resumen de los videos de test nal de TransLetures Conjunto Duraión Dominio Genero Profesores_POLIMEDIA_I/M47 01:06:00 Arquitetura Mujer Profesores_POLIMEDIA/M62 00:48:00 Marketing Hombre 00505-Profesores_Aloy/M03 00:42:00 Medio Ambiente Hombre Profesores_POLIMEDIA/M67 00:30:00 Informátia Hombre Profesores_POLIMEDIA/M47 00:18:00 Leyes Mujer 31 memoria  2012/9/10  10:52  page 32  #38 i i Capítulo 5. Exp erimentaión Este proyeto de investigaión europ eo dene una partiión de validaión de 3 horas y 48 minutos, y otra para el test nal de 3 horas y 24 minutos. El resto de videos desritos en la seión 2.3 que no están inluidos en ninguno de estos onjuntos, y que no han presentado ningún problema en el software de reono imiento, se han utilizado para realizar el entrenamiento de los mo delos (on un total de 89 horas). 5.2. Resultados Base La optimizaión iniial se ha llevado a abo siguiendo el proeso denido en la se- ión 4.2, que onsiste en una exploraión exhaustiva de parámetros sobre el onjunto de validaión para obtener el mejor WER p osible. Debido al enorme tamaño del orpus de entrenamiento, esto se ha llevado a ab o partiendo de la base obtenida el la seión 4.3 de forma que se ha restringido diha exploraión a los parámetros que mejor han funionado previamente. Se ha restringido la exploraión a mo delos de trifonemas de tres a ino estados sin rep etiiones, explorando el número de ho jas y mixturas en un rango muy aotado (600 y 800 ho jas on 27 , 28 y 29 mixturas de gausianas), y probando mo delos de lengua je de bigramas, trigramas y uatrigramas. El resultado es una onguraión de parámetros muy similar al obtenido en la seión 4.2, p ero al utilizar más antidad de audio se han elevado el número de mixturas de gausianas neesarias a 29 , que es el óptimo enontrado. Una vez obtenidos estos parámetros optimos, hemos pasado a realizar una prueba nal sobre el onjunto de test esp eiado en la seión 5.3. Para ello se han empleado los parámetros obtenidos sobre el onjunto de validaión en el reono edor, obteniendo un WER nal de 39.37 puntos (ver mas detalles en la tabla 5.3). Como p o demos ver el resultado es muy similar al exp erimento de la seión 4.3, p or lo que realizar el a juste sobre un sub onjunto de datos ha sido una deisión aertada (p or el ahorro de tiemp o que onlleva, y la validez de los resultados). Tabla 5.3: WER Óptimo del Baseline de la Exp erimentaion Mo delo de Lengua je WER Óptimo 2-Gramas 40.62 3-Gramas 39.37 4-Gramas 39.44 Así pues, partiendo de estos resultados base iniiales, vamos a pro eder a realizar una mejora sustanial en el pro eso de reono imiento para mejorar este aeptable resultado iniial de forma signiativa. 32 PRHLT-DSIC-UPV memoria  2012/9/10  10:52  page 33  #39 i i 5.3. Mejora del Reono imiento 5.3. Mejora del Reono imiento Los resultados obtenidos hasta ahora son una muy buena base iniial, p ero se pueden intentar mejorar aún más utilizando diversas ténias más avanzadas. Como ob jetivo en este proyeto nos hemos planteado utilizar la ombinaión de diversos mo delos de lengua je para mejorar estos resultados de forma signiativa. Para ello, hemos empleado omo mo delo de lengua je externo los ono idos Go ogle NGrams [MSA + ℄ disp onibles de forma públia a través de su propia página web. Los Go ogle NGrams es el resultado que ha obtenido Go ogle de apliar ténias de OCR sobre una gran antidad de libros que datan desde el 1800 hasta el 2009. Una vez apliado este OCR se han omputado los unigramas, bigramas, trigramas, uatrigramas y 5-gramas de todas las obras separando el resultado por años. El resultado nal es un omp endio de uentas divididas p or años de una antidad ingente de libros, que Go ogle ha puesto a libre disposiión, y que se van a utilizar en este proyeto para generar un mo delo de lengua je que omplementará al extraido de las transrip iones manuales de los videos del onjunto de entrenamiento. El primer paso ha sido uniar to das las uentas que están divididas p or años en una únia gran uenta que ontemple to dos los años a la vez. A ontinuaión se ha extraido un mo delo de lengua je de n-gramas utilizando omo base esta gran uenta generada en el paso previo. Paralelamente se ha extraido un mo delo de lengua je de las transrip iones del onjunto de entrenamiento, y se han ombinado linealmente los dos mo delos de lengua je en uno únio, p onderando los dos iniiales para obtener la menor perplegidad p osible sobre las transripiones del onjunto de validaión. Esta ombinaión se realiza partiendo de un voabulario base, e inluyendo to dos los ngramas que se enuentran en este vo abulario de los dos mo delos al mo delo nal uniado, p onderando los pesos de forma óptima. Así pues, este pro eso se va a rep etir para mo delos de lengua je de bigramas, trigramas y uatrigramas on el ob jetivo de enontrar el mo delo de lengua je óptimo. Además, se van a utilizar a la hora de realizar la ombinaión lineal tres voabularios diferentes: 1. Úniamente el vo abulario exlusivo de p oliMedia, sin añadir palabras de las uentas de Google NGrams. 2. To do el vo abulario de p oliMedia y las 20.000 palabras más freuentes de las uentas de Google NGrams. 3. To do el vo abulario de p oliMedia y las 50.000 palabras más freuentes de las uentas de Google NGrams. Para realizar este pro eso nos hemos a servido de la herramienta SRILM NGram que se ha presentado en la seión 3.3, que nos p ermite llevar a ab o este pro eso de forma muy senilla, indiándole los textos de las transripiones de p oliMedia, las uentas de Go ogle NGrams, y el voabulario que se desea emplear. Una vez nalizada la ombinaión lineal de ada uno de los mo delos de lengua je, se han vuelto a enontrar los valores de GSF y WIP óptimos on el nuevo modelo de lengua je sobre el onjunto de validaión. Los resultados obtenidos han sido los que se muestran en la graa 5.1. PRHLT-DSIC-UPV 33 memoria  2012/9/10  10:52  page 34  #40 i i Capítulo 5. Exp erimentaión 32 33 34 35 36 37 38 39 40 2 3 4 Word Error Rate Orden de N-Gramas Baseline Google 0K Vocab Google 20K Vocab Google 50K Vocab Figura 5.1: Evoluión del WER en funión del Orden de N-Gramas Así pues, el aso en el que mejor se omp orta es uando utilizamos el vo abulario de p oliMedia y las 50.000 palabras más freuentes del mo delo de lengua je que hemos generado a partir de las uentas de Go ogle NGrams. Utilizando esta onguraión hemos obtenido nalmente un 33.73 de WER sobre el onjunto de test lo que sup one una mejora de un inreible 5.64 puntos de WER. Esta mejora se ve reejada en la tabla 5.4. Tabla 5.4: Resultados Optimos de la Exp erimentaión Final Sistema Empleado WER Trigramas WER Cuatrigramas Baseline 39.37 39.44 50K Google 33.73 33,78 Mejora Obtenida 5,64 5,66 34 PRHLT-DSIC-UPV memoria  2012/9/10  10:52  page 35  #41 i i Capítulo 6 Conlusiones Finales 6.1. Resumen del Traba jo En el presente proyeto, se ha diseñado un sistema de reono imiento del habla ontinua, optimizando los mo delos y parámetros para obtener los mejores resultados p osibles sobre un orpus esp eio. Como software básio destaar que hemos utilizado el RWTH ASR System y el SRILM NGram para el entrenamiento de modelos y el reono imiento del audio, omo programas relevantes y fundamentales para el presente proyeto. El orpus empleado han sido los videos de libre distribuión de la plataforma Polimedia de la Universidad Politénia de Valenia, que se ha dividido en tres partiiones (entrenamiento, validaión y test nal) según las partiiones denidas en el proyeto europ eo de investigaión TransLetures [dV12a℄. El pro eso seguido ha onsistido en primer lugar en realizar una exploraión exhaustiva de parámetros y mo delos, para obtener un punto de partida iniial aeptable, que ha sido de 39.37 puntos de WER. Sobre este resultado iniial se ha planteado y ejeutado una mejora relevante, onsistente en la fusión del mo delo de lengua je iniial on el prop orionado p or Go ogle on el ob jetivo de mejorar el modelo iniial. La mejora nal obtenida ha sido de 5.64 puntos de WER obteniendo un resultado nal de 33.73 puntos de WER. Finalmente, estos mo delos se han empleado en la onstruión del reono edor del habla automátio para el sistema nal, generado omo resultado de este Proyeto Final de Carrera. Se trata de un programa que a partir de un diretorio on segmentos de audio genera una transrip ión aeptable de los mismos de forma ompletamente automátia. 6.2. Mejoras Futuras Durante el transurso del presente proyeto, se han enontrado diversos asp etos a tener en uenta para posibles mejoras futuras. De esta forma probablemente los 35 memoria  2012/9/10  10:52  page 42  #48 i i memoria  2012/9/10  10:52  page 43  #49 i i Indie de Tablas 2.1. Comparativa del poliMedia Completo on Nuestro Corpus . . . . . . . 13 2.2. Ejemplo de una Transrip ión de Varios Segmentos . . . . . . . . . . . 14 3.1. Ejemplo de varias Transrip iones Fonétias . . . . . . . . . . . . . . . 16 4.1. Comparativa del Corpus Empleado y el Total de Videos . . . . . . . . 25 4.2. Resultados Optimos de la Experimentaión Preliminar . . . . . . . . . 29 5.1. Resumen de los videos de validaión de TransLetures . . . . . . . . . 31 5.2. Resumen de los videos de test nal de TransLetures . . . . . . . . . . 31 5.3. WER Óptimo del Baseline de la Exp erimentaion . . . . . . . . . . . . 32 5.4. Resultados Optimos de la Experimentaión Final . . . . . . . . . . . . 34 43 memoria  2012/9/10  10:52  page 44  #50 i i