scieee AI-readable full text Open interactive document viewer

Integración en Matterhorn de técnicas de asistencia a la transcripción de audio

Pérez González de Martos, Alejandro Manuel

Abstract

Este proyecto está orientado a la integración en Opencast Matterhorn de técnicas interactivas para la transcripción asistida de audio. El principal objetivo del proyecto es llevar a cabo esta integración de acuerdo con los principios que guían el diseño de la plataforma Matterhorn, ésta es una plataforma open-source para la gestión y administración de contenidos multimedias de ámbito académico

Full text

memoria  2012/7/19  12:32  page i  #1 i i UNIVERSITAT POLITÈCNICA DE VALÈNCIA ESCUELA TÉCNICA SUPERIOR DE INGENIERÍA INFORMÁTICA DEPARTAMENTO DE SISTEMAS INFORMÁTICOS Y COMPUTACIÓN Integraión en Matterhorn de ténias de asistenia a la transrip ión de audio. Proyeto nal de arrera - Ingeniería Informátia Alejandro Pérez González de Martos Sup ervisado p or: Dr. Alfons Juan-Císar Dr. Jorge Civera Saiz 19 de julio de 2012 memoria  2012/7/19  12:32  page i i  #2 i i i i APGM-DSIC-UPV memoria  2012/7/19  12:32  page iii  #3 i i Índie general 1. Intro duión 1 1.1. Reono imiento automátio del habla . . . . . . . . . . . . . . . . . . 2 1.1.1. Historia y evoluión . . . . . . . . . . . . . . . . . . . . . . . . 2 1.1.2. Atualidad . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3 1.2. Visión general del proyeto . . . . . . . . . . . . . . . . . . . . . . . . 4 2. Op enast Matterhorn 7 2.1. Intro duión y araterístias . . . . . . . . . . . . . . . . . . . . . . . 7 2.2. Desrip ión del sistema . . . . . . . . . . . . . . . . . . . . . . . . . . 8 2.2.1. Matterhorn mediaPakage . . . . . . . . . . . . . . . . . . . . . 10 2.2.2. Matterhorn workow . . . . . . . . . . . . . . . . . . . . . . . . 10 3. El rep ositorio p oliMedia 13 3.1. Caraterístias y formato . . . . . . . . . . . . . . . . . . . . . . . . . 13 3.2. Base de Datos p oliMedia . . . . . . . . . . . . . . . . . . . . . . . . . . 14 3.3. Sistema de transrip ión automátia . . . . . . . . . . . . . . . . . . . 15 4. Repro dutor prototip o HTML5 19 4.1. Página prinipal . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19 4.2. Repro dutor . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20 4.2.1. Repro dutor . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21 4.2.2. Editor . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21 4.3. Tip os y roles de usuario . . . . . . . . . . . . . . . . . . . . . . . . . . 22 4.4. Ediión interativa y medidas de onanza . . . . . . . . . . . . . . . . 23 4.5. Mo dos de interaión y tiemp o de respuesta . . . . . . . . . . . . . . . 24 4.6. Formatos de vídeo y transripiones . . . . . . . . . . . . . . . . . . . 25 4.6.1. Formatos de vídeo en HTML5 . . . . . . . . . . . . . . . . . . 25 4.6.2. Formato de transrip iones . . . . . . . . . . . . . . . . . . . . 25 5. Integraión en la plataforma Matterhorn 29 5.1. Persp etiva . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 29 5.2. Sistema de Gestión de Transrip iones e interfaes . . . . . . . . . . . 30 5.3. Parte I: Integraión en el workow de Matterhorn . . . . . . . . . . . . 31 5.4. Parte I I: Sustituión/adaptaión del Engage Media Player . . . . . . . 33 iii memoria  2012/7/19  12:32  page iv  #4 i i Índie general 6. Conlusiones y traba jos futuros 35 6.1. Resumen . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35 6.2. Conlusiones . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 36 6.3. Traba jos futuros . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 36 iv APGM-DSIC-UPV memoria  2012/7/19  12:32  page 1  #5 i i Capítulo 1 Introduión Los repositorios de ontenido multimedia de ámbito aadémio están reiendo rápidamente debido al progresivo avane de las nuevas tenologías en nuestra so- iedad. Charlas, onferenias o lases son grabadas desde ualquier parte del mundo y publiadas para ofreer a aquellos que lo deseen la p osibilidad de visualizar su ontenido. En la era de la informaión, las universidades se adaptan al hoy en día medio de omuniaión por exelenia, Internet. Universidades a distania, omo la UNED 1 , lases no preseniales, pizarras digitales o plataformas de teleformaión son sin duda un buen ejemplo de ello. Es fundamentalmente p or este motivo p or el que los rep ositorios online omienzan a alb ergar grandes antidades de ontenidos eduativos, y p or el que la antidad de informaión disponible ree de manera exponenial a medida que las prinipales entidades emisoras, en este aso las universidades, adoptan p olítias de libre distribuión de ontenidos. El prinipal problema on el que nos enontramos a la hora de failitar el visionado de estos ontenidos al mayor número de p ersonas p osible es la variedad lingüístia existente. Aunque el inglés se onsolida ada vez más omo el idioma oial en el mundo globalizado en el que vivimos, los ontenidos eduativos de los distintos rep ositorios existentes sup onen una gran variedad de lenguas. Sin embargo, la mayoría de la informaión disp onible en estos rep ositorios no está ni transrita ni traduida a distintos idiomas, lo que además de solventar las diferenias lingüístias failitaría el visionado de los ontenidos a p ersonas on disapaidad. Debido a la gran antidad de ontenidos disp onible y a su rápido reimiento, la transrip ión y traduión manuales sup onen un tremendo oste y esfuerzo, lo que las hae prátiamente inviables. Es p or ello que la transrip ión automátia o reono imiento automátio del habla ha adquirido vital imp ortania, puesto que sup one el paso previo a la traduión automátia. El reono imiento de formas es la disiplina dentro del área de la Inteligenia Artiial donde se engloba el reono imiento automátio del habla. Este último sigue siendo hoy en día uno de los prinipales fo os de investigaión a nivel mundial debido a la gran omplejidad que supone. Atualmente, los sistemas de reonoimiento automátio del habla on mayor éxito se basan en redes de estados nitos esto ástias. 1 UNED, Universidad Naional de Eduaión a Distania. 1 memoria  2012/7/19  12:32  page 2  #6 i i Capítulo 1. Intro duión Sin embargo, los resultados obtenidos para voabularios amplios no son lo suientemente preisos omo para que resulten útiles p or si mismos. Hablando en términos generales, de un buen sistema de reono imiento automátio del habla para este ámbito p o demos esp erar de un 20 a un 40 p or iento de palabras mal reonoidas. Es neesaria por tanto la intervenión humana para mejorar la alidad de las transrip- iones ofreidas por el sistema de transrip ión automátia y obtener transrip iones suientemente preisas. Aun así, y teniendo en uenta la ingente antidad de informaión existente y generada día a día que neesita de ser transrita y traduida, la revisión y orreión puramente manual de transrip iones generadas automátiamente sup one una tarea uanto menos tediosa. Con el n de prop orionar una soluión efetiva y prátia al problema de la transripión semi-automátia, se estudiará la reaión de un sistema inteligente de ediión interativa de transrip iones. 1.1. Reono imiento automátio del habla 1.1.1. Historia y evoluión Durante las últimas déadas, la investigaión en el amp o del reonoimiento automátio del habla se ha venido desarrollando de una forma intensa, empujada p or los avanes en pro esamiento de señal, algoritmos, arquiteturas y plataformas de ómputo. Durante este p erio do se han onstruido sistemas para una amplia gama de apliaiones, que abaran desde tareas de reono imiento de p equeños onjuntos de palabras sobre líneas telefónias, hasta máquinas de ditado para grandes vo abularios on apaidad para asimilar ualquier tipo de habla [LRRL96℄. La historia del amp o de investigaión del reono imiento automátio del habla se ha venido llevando a ab o desde la segunda mitad del siglo XX. Los primeros intentos p or onstruir máquinas que realizaran tareas de reono imiento se remontan a la déada de los 50, uando diversos investigadores trataban de explotar los prinipios fundamentales de la fonétia aústia. En 1952, en los lab oratorios Bell, K. Davis, R. Biddulph y S. Balashek rearon un sistema eletrónio que p ermitía identiar para un solo hablante, pronuniaiones de los 10 dígitos realizadas de forma aislada [KHDB52℄. En 1959, en la University College de Londres, P. Denes trataba de desarrollar un sistema para reono er 4 voales y 9 onsonantes [RJ93℄. El asp eto más novedoso de su traba jo era el uso de informaión estadístia, aera de las seuenias válidas de fonemas en inglés. Sin embargo, to dos estos experimentos orresp onden a disp ositivos eletrónios. Los primeros exp erimentos de reono imiento desarrollados en ordenadores tienen lugar al nal de los años 50 y omienzo de los 60, prinipalmente en el Linoln Lab oratory a argo de J. Forgie y C. Forgie [Jua98℄. Es en la déada de los 60 uando se generaliza el uso de ordenadores en el amp o del reonoimiento del habla. Durante estos años se iniian varios proyetos que enarrilan la investigaión en esta área. Los años 70 representan un p erio do muy ativo para esta disiplina, distinguiéndose dos atividades prinipales: 2 APGM-DSIC-UPV memoria  2012/7/19  12:32  page 3  #7 i i 1.1. Reono imiento automátio del habla Reono imiento de palabras aisladas. Reono imiento del habla ontinua. Se omienzan a obtener buenos resultados en el reonoimiento de palabras aisladas, y su uso omienza a ser viable en la prátia. En uanto al habla ontinua, los primeros traba jos ubrían el reono imiento de oraiones de un mismo lo utor on un voabulario aproximado de 1.000 palabras. Es a raíz de ésto que se advierte que el ono imiento sintátio, semántio y ontextual son fuentes de informaión. El sistema Hearsay I, onstruido p or la CMU 2 en 1973 era apaz de emplear informaión de tip o semántio para reduir el número de p osibles alternativas que el reono edor debía evaluar [Jua98℄. En los AT&T Bell Labs los investigadores omenzaron una serie de exp erimentos orientados a onseguir reono edores realmente indep endientes del lo utor para su uso en apliaiones telefónias [Jua98℄. A nales de los 70 y en los años 80 se progresa notablemente en la generalizaión en la onstruión de sistemas de reono imiento. Es aquí donde se pro due un giro meto dológio al pasar de méto dos basados en omparaión de plantillas a méto dos basados en el mo delado estadístio debido a la extensión en el uso de los Modelos Oultos de Markov 3 [RJ86℄ [Rab89℄ que es el mo delo usado en la atualidad para apturar y mo delar la variabilidad existente en el habla. Durante este mismo p erio do, el programa DARPA 4 , impulsó en Estados Unidos el desarrollo de mejores sistemas de reono imiento para habla ontinua y voabularios de tamaño medio y grande on indep endenia del lo utor. Muhas de las ontribuiones durante este p erio do y el prinipio de los años 90, provienen de los esfuerzos de la CMU a través de su sistema SPHINX[Lee89℄. La déada de los 90 sup one en ierta manera la ontinuidad en los ob jetivos ya propuestos, ampliando eso sí, el tamaño de los vo abularios a la vez que se diversian los amp os de apliaión. 1.1.2. Atualidad En estos últimos años ha reido el interés p or el estudio de los pro esos de re- ono imiento en ondiiones de ruido y adversas en general. Se intentan implementar nuevas ténias que mejoren los resultados del reono imiento, pues las soluiones existentes en la atualidad to davía no alanzan un grado de preisión elevado para vo abularios on gran número de palabras. Paree que la evoluión en el ámbito del reono imiento del habla durante los últimos años ha sido mediante la aumulaión de p equeñas mejoras que sup onen tareas muho más omplejas, debido prinipalmente al aumento notable en la velo idad de álulo y a ordenadores más p otentes en general. La investigaión y desarrollo atual se entran prinipalmente en estos tres puntos: Mejorar la robustez de los sistemas de reono imiento del habla, no solamente ante el ruido sino ante ualquier ondiión que sup onga la degradaión del rendimiento del sistema. 2 CMU, Carnegie Mel lon University. 3 En inglés Hidden Markov Models (HMM). 4 DARPA, Defene Advane Researh Ageny. APGM-DSIC-UPV 3 memoria  2012/7/19  12:32  page 4  #8 i i Capítulo 1. Intro duión Debido a que existe gran antidad de datos de habla humana, y a que sería demasiado ostoso transribir manualmente tanta antidad de informaión, la investigaión se entra en desarrollar nuevos méto dos de aprendiza je automáti- o que puedan emplear on ierta efetividad grandes antidades de datos sin etiquetar mediante aprendiza je no supervisado para la mejora del sistema. Por último, mejorar el entendimiento de la apaidad humana para omprender el habla, y emplear esta informaión para mejorar el rendimiento de los sistemas de reono imiento automátio del habla. 1.2. Visión general del proyeto Este proyeto está orientado a la integraión en Op enast Matterhorn de ténias interativas para la transrip ión asistida de audio. El prinipal ob jetivo del proyeto es llevar a abo esta integraión de auerdo on los prinipios que guían el diseño de la plataforma Matterhorn. Matterhorn es una plataforma open-soure para la gestión y administraión de ontenidos multimedia de ámbito aadémio. Las instituiones emplean Matterhorn para la grabaión de leiones, gestionar los vídeos existentes, publiar los mismos en distintos medios de distribuión y proporionar una interfaz de usuario para failitar su visionado. La intenión será pues integrar un mó dulo de reono imiento del habla que p ermita obtener de manera semi-automátia transrip- iones de los vídeos añadidos al sistema. Para llevar a ab o la onstruión de un sistema de reono imiento automátio del habla es neesario disponer de un numeroso onjunto de datos, en nuestro aso vídeos eduativos y sus transrip iones. Traba jaremos on el rep ositorio p oliMedia [dV12℄. PoliMedia es un serviio reiente p ensado para la reaión y distribuión de material eduativo en la Universidad Politénia de Valenia. Atualmente ontiene alrededor de 6.000 vídeos orresp ondientes a más de 1.000 horas de grabaión. Emplearemos este orpus para la implementaión de un software de reonoimiento que p ermita obtener transrip iones automátias para los vídeos del mismo. Sin embargo, no entraremos en muho detalle aera del diseño de este sistema puesto que no es ob jeto de este proyeto. Una vez seamos apaes de obtener transrip iones automátias de ierta preisión para los vídeos del rep ositorio, estudiaremos la manera de editarlas interativamente. Construiremos un repro dutor prototip o basado en HTML5 sobre el que se irán implementando nuevas funionalidades propias de la ediión y orreión interativa de transrip iones. Disutiremos el formato que deberán seguir las transrip iones en el sistema. En la atualidad el formato más extendido sea p osiblemente SubRip 5 , sop ortado p or la mayoría de reprodutores multimedia que p ermiten la visualizaión de subtítulos. Las transrip iones manuales de las que disp onemos para el rep ositorio poliMedia siguen el formato empleado p or Transrib er 6 , que se asemeja al de un do umento XML p ero no p ermite la ampliaión del mismo on nuevas etiquetas. Puesto que ni SubRip ni Transrib er permiten ser ampliados sin omprometer la 5 SubRip, extensión .srt. 6 Transrib er, extensión .trs. http://trans.soureforge.net. 4 APGM-DSIC-UPV memoria  2012/7/19  12:32  page 5  #9 i i 1.2. Visión general del proyeto ompatibilidad de los mismos, neesitaremos un formato más exible que permita la representaión de ierta informaión relevante omo p or ejemplo medidas de onanza 7 o indiar que ierto tramo de la transrip ión ha sido mo diado manualmente. También hablaremos del rol que los distintos usuarios tendrán en el sistema. Deb emos tener en uenta que el usuario omún está interesado en el visionado del ontenido, p or lo que sup ondremos que no dediará muho tiemp o a la orreión de transrip iones defetuosas. Se implementará un serviio web enargado de gestionar la omuniaión entre el editor y el sistema de transrip ión automátia. El repro dutor hará uso de diho serviio web tanto para obtener las transrip iones de un vídeo determinado omo para gestionar las mo diaiones p or parte del usuario en las transrip iones. Por último veremos una propuesta de integraión de este sistema de transrip ión semi-automátia en la plataforma Matterhorn on el n de obtener un sistema evaluable en un entorno real y p osibilitar su implantaión en otros rep ositorios relaionados on Matterhorn. 7 Medidas de onanza, en inglés: ondene measures. APGM-DSIC-UPV 5 memoria  2012/7/19  12:32  page 12  #16 i i Figura 2.2: Diagrama de formaión y pro esamiento de un mediaPakage. memoria  2012/7/19  12:32  page 13  #17 i i Capítulo 3 El repositorio poliMedia Emplearemos p oliMedia omo rep ositorio de vídeos eduativos sobre los que basaremos la exp erimentaión del proyeto. p oliMedia es un sistema diseñado en la Universidad Politénia de Valenia para la reaión de ontenidos multimedia de ap oyo a la do enia presenial, que abara desde la preparaión del material do ente hasta la distribuión a través de distintos medios (TV, Internet, CD, et.) a los destinatarios. Atualmente ontiene aproximadamente 6.000 vídeos orresp ondientes a más de 1.000 horas de grabaión. 3.1. Caraterístias y formato p oliMedia [dV12℄ es un sistema de produión de materiales eduativos de alidad. Es un reurso integrado on to das las herramientas de PoliformaT (plataforma de teleformaión de la UPV), y resulta muy adeuado omo ap oyo y omplemento a la enseñanza presenial. Se trata de un sistema ompletamente innovador y únio, disp onible sólo en la UPV, que p one a disp osiión del profesorado instrumentos, materiales y ténios para la grabaión y publiaión de vídeos eduativos. Por ello, no requiere onoimientos audiovisuales o ténios. El autor es el propietario inteletual de la obra. Los vídeos prinipalmente onsisten en la grabaión de una leión p or un profesor, on una duraión media aproximada de 10 minutos. Los temas o asignaturas sobre las que se disp one de grabaiones son muy variados. To das las grabaiones siguen un patrón muy similar. No han sido grabadas en distintas aulas sino que han sido realizadas en un aula habilitada y destinada exlusivamente para este n. En to das ellas se muestra, oupando la mayor parte de la pantalla, las transparenias o apuntes empleados p or el profesor para seguir la leión. En la esquina inferior dereha, oupando aproximadamente un uarto de pantalla se muestra al profesor o autor del vídeo. Cabe remarar que el área donde se muestran las diapositivas o transparenias es realmente la pantalla del ordenador que está manejando el profesor en el momento de la grabaión, p or lo que en iertos vídeos no se tratará exlusivamente de diap ositivas sino de ualquier tipo de ilustraión que pueda realizarse desde el mismo, omo 13 memoria  2012/7/19  12:32  page 14  #18 i i Capítulo 3. El rep ositorio p oliMedia p or ejemplo el manejo de un programa. Figura 3.1: Esquema de un vídeo p oliMedia El rep ositorio está organizado p or arp etas. Las arp etas existentes en el diretorio prinipal del rep ositorio ontienen los nombres ilustrativos del tema o asignatura a la que ontienen. Dentro de estas arpetas existen otras sub arp etas que ontienen los distintos vídeos que han sido grabados de diho tema. Los vídeos están almaenados en formato AVC/H.264 on diferentes ongura- iones. El 85 % de ellos tienen un tamaño de 1280x720 píxeles. El bitrate 1 medio varía entre 100 y 1500 kbps, p ero alrededor del 90 % presentan una tasa de bits entre 500 y 900 kbps. El formato de audio es AAC/LC estéreo (85 %) y mono (15 %) on freuenias de muestreo de 44.100 y 48.000 Hz. En el aso del audio, el 95 % de los bitrates medios varían de 30 a 60 kbps. 3.2. Base de Datos p oliMedia Disp onemos de una base de datos on informaión relativa a los vídeos existentes en el rep ositorio. Para ada uno de ellos disp onemos de su identiador (onsistente en un número hexadeimal de 32 arateres generado de manera aleatoria), la ruta relativa donde está almaenado, el profesor o profesores autores del mismo, el título y el tema al que pertenee, el número de repro duiones así omo otra informaión relevante. Una p equeña representaión del ontenido de la base de datos se muestra en la gura 3.2. Haremos uso de to da esta informaión uando pro edamos a la onstruión del repro dutor prototip o basado en HTML5. 1 Tasa de bits. 14 APGM-DSIC-UPV memoria  2012/7/19  12:32  page 15  #19 i i 3.3. Sistema de transrip ión automátia Figura 3.2: Muestra del ontenido de la base de datos p oliMedia. 3.3. Sistema de transrip ión automátia Se ha onstruido un sistema de transrip ión automátia para el orpus p oliMedia de forma paralela a este proyeto. Aunque el diseño e implementaión de este sistema no forma parte del proyeto, sup one un asp eto lave en el desarrollo del mismo pues será la base sobre la que onstruiremos p osteriormente el sistema interativo de ediión de transrip iones. Por ello resumiremos brevemente sus araterístias y el pro eso seguido para su implementaión. El sistema de reono imiento automátio del habla se omp one de una etapa de prepro eso (mo delado de la señal voal), una etapa aústio-fonétia (modelado aústio de unidades léxias y/o subléxias) y una etapa sintátio-semántia (mo delado del lengua je). Estas dos últimas pueden ser ombinadas de manera seuenial o integrarse en un únio mó dulo. Para p osibilitar el entrenamiento de los mo delos, se ha transrito manualmente un sub onjunto del orpus. En la tabla 3.1 se muestra una pequeña omparativa del volumen del subonjunto empleado para el entrenamiento resp eto del orpus ompleto. Cuadro 3.1: Sub onjunto de p oliMedia empleado Conjunto Horas Videos orpus poliMedia 1350 6830 subonjunto empleado 119 732 porentaje total 8,85 % 10,72 % Los parámetros de los modelos aústio y de lengua je han de ser estimados mediante un onjunto de entrenamiento, en nuestro aso el formado por los vídeos del rep ositorio seleionados y sus orresp ondientes transrip iones manuales. El mo delo APGM-DSIC-UPV 15 memoria  2012/7/19  12:32  page 16  #20 i i Capítulo 3. El rep ositorio p oliMedia Audio Extracción de Características Vectores de Características Modelo Acustico P(x|w) Modelo Léxico Modelo de Lenguaje P(w) Clasificación w’=arg max P(w)·P(x|w) Transcripciones w Figura 3.3: Esquema general del sistema aústio está basado en HMMs 2 [Rab89℄, uyos estados representan distintas onguraiones del aparato fonador. De una onguraión se puede pasar a otra de auerdo on iertas reglas probabilístias. La gura 3.4 muestra una idea intuitiva del uso de Mo delos Oultos de Markov en el maro del reono imiento del habla. En este aso el HMM se denomina de izquierda a dereha donde los estados representarían distintas onguraiones del aparato fonador. En ada estado se puede emitir un sonido de entre los de un onjunto on ierta distribuión de probabilidad, que serán estimadas a partir del onjunto de entrenamiento. Las palabras se representarían mediante la onatenaión de estos HMMs. Figura 3.4: Mo delos Oultos de Markov apliados a la señal voal. El blo que de mo delizaión del lengua je trata de apliar las reglas gramatiales que rigen la omuniaión para failitar la omprensión de la adena de unidades aústi- as (sin ontenido léxio-semántio) prop orionada p or el mó dulo de reonoimiento 2 Hidden Markov Mo dels, en español: Mo delos Oultos de Markov. 16 APGM-DSIC-UPV memoria  2012/7/19  12:32  page 17  #21 i i 3.3. Sistema de transrip ión automátia aústio. El mo delo de lengua je utilizado se basa en n-gramas [Jel91℄, que desrib en la probabilidad de observar una determinada palabra dep endiendo de las n-1 anteriores. El mo delo de n-gramas es alulado a partir de las transripiones manuales disp onibles. El proeso de entrenamiento se detalla gráamente en la gura 3.5. Extracción de Características Vectores de Características Modelo Acustico P(f|e) Modelo Léxico Modelo de Lenguaje P(e) Audio Transcripcion Algoritmo de Viterbi Mixturas de Gausianas Calculo N-Gramas + Suavizado Automata Estocastico de Estados Finitos Entrenamiento Figura 3.5: Pro eso de generaión de los mo delos Con el sistema nalmente implementado y optimizado, se han realizado diversas exp erimentaiones para determinar de manera aproximada el grado de preisión que p o demos esp erar del mismo. La métria empleada para la evaluaión del sistema ha sido el Word Error Rate (WER), y los resultados obtenidos señalan que el WER que ab e esp erar del mismo está en torno a los 30-35 puntos. Esto signia que po demos esp erar que en una transrip ión haya un 30 %-35 % de palabras transritas inorre- tamente p or término medio. Sin embargo estos resultados no son lo suientemente preisos para ser útiles p or sí mismos. Para obtener transrip iones más preisas será neesaria la intervenión humana. Podemos aprovehar las transrip iones obtenidas de forma automátia para onstruir un sistema que failite la supervisión y orreión de éstas de un mo do interativo, y así proporionar una soluión eiente en términos de ostes y esfuerzo a la obtenión de transrip iones preisas. APGM-DSIC-UPV 17 memoria  2012/7/19  12:32  page 18  #22 i i memoria  2012/7/19  12:32  page 19  #23 i i Capítulo 4 Reprodutor prototipo HTML5 Se ha implementado un repro dutor basado en el lengua je HTML5 on el n de prop orionar una interfaz de usuario que p ermita tanto el visionado omo la ediión interativa de transrip iones. Este repro dutor será un prototip o que nos servirá tanto para denir las araterístias de la interfaz de ediión omo para diseñar el sistema de omuniaión interativo entre el editor y el sistema de reono imiento automáti- o del habla. Disponemos de transrip iones manuales para algunos de los vídeos del rep ositorio, tal y omo se omentó en el apartado 3.3 uando hablamos del entrenamiento del mo delo de lengua je. Para el resto, las transripiones han sido obtenidas automátiamente. Como sab emos, las transrip iones obtenidas de forma automátia no son suientemente preisas y ontienen errores. En este apítulo traba jaremos en el diseño de un repro dutor/editor que p ermita al usuario, además de visualizar estas transrip iones, mo diarlas de una forma interativa. En los siguientes apartados trataremos diversos asp etos onernientes al diseño e implementaión de este editor on el n de aabar on un sistema interativo que failite al máximo la tarea de ediión. Para la implementaión del prototip o y del resto de omplementos que se indian a lo largo de este apítulo se ha empleado el sistema de gestión de bases de datos MySQL y los lengua jes de programaión PHP y JavaSript junto a su p opular bibliotea jQuery. 4.1. Página prinipal En la página prinipal del repro dutor se permite al usuario seleionar entre las bases de datos disp onibles para mostrar su ontenido, entre las que se enuentra el rep ositorio p oliMedia. La estrutura de la página está formada p or un logo sup erior, un menú prinipal, un panel lateral donde se p ermite seleionar al usuario el riterio de agrupaión deseado y el área de ontenido. Por defeto, en el panel lateral apareen 19 memoria  2012/7/19  12:32  page 20  #24 i i Capítulo 4. Repro dutor prototip o HTML5 las distintas ategorías en las que se agrupan los vídeos p erteneientes al rep ositorio atual. Sin embargo, mediante un panel desplegable en la parte sup erior del panel lateral se p ermite al usuario la agrupaión p or otros riterios, omo p or autor o idioma. Para la omodidad del usuario, en aso que el número de elementos en los que se agrupan los vídeos sea muy elevado, éstos serán a su vez agrupados por su letra iniial en forma de árb ol desplegable. Al seleionar un onjunto de vídeos en el panel lateral, éstos apareen en el área de ontenido on su orresp ondiente informaión (título, autor e imagen en miniatura del vídeo) para que puedan ser seleionados individualmente. También está disp onible en el menú prinipal la op ión de búsqueda, en la que el usuario puede denir diversos riterios de búsqueda y se le mostrarán los vídeos que onuerden on diho riterio. Figura 4.1: Estrutura de la página prinipal. 4.2. Repro dutor El repro dutor engloba fundamentalmente dos elementos que onviene difereniar. Por una parte tenemos el reprodutor o visor, que orresp onde a la parte del reprodutor donde se muestra el ontenido del vídeo y al panel de ontroles que ontrola la repro duión del mismo. Por otro lado tenemos el editor, donde se mostrará la transrip ión del vídeo y se p ermitirá al usuario realizar mo diaiones. Para evitar 20 APGM-DSIC-UPV memoria  2012/7/19  12:32  page 21  #25 i i 4.2. Repro dutor onfusiones, de aquí en adelante las referenias al repro dutor se referirán úniamente al visor. 4.2.1. Repro dutor El repro dutor está basado en HTML5, p or lo que iniialmente dep ende del navegador empleado. Para onstruir un repro dutor p ersonalizado que se muestre de igual manera indep endientemente del navegador utilizado, emplearemos ho jas de estilo CSS 1 y la p opular bibliotea de JavaSript jQuery. Iniialmente se ha implementado un panel de ontroles on las funionalidades básias para la repro duión de vídeo: un b otón de repro duión/pausa, un ontrol de volumen y un p osiionador temporal. Posteriormente se han añadido otros ontroles omo un botón para mostrar/oultar los subtítulos disp onibles, un b otón de seleión del idioma de las transrip iones, así omo los b otones relativos al editor de subtítulos Editar subtítulos y Transripión impreisa de los que se darán más detalles en el siguiente apartado. 4.2.2. Editor Mediante el b otón Editar subtítulos , disp onible para iertos usuarios en el panel de ontroles, se muestra el editor de transrip iones. La página queda estruturada de mo do que en la parte izquierda se muestra el reprodutor de vídeo y en la parte dereha el editor. El editor ontiene iniialmente la transrip ión del vídeo, que puede ser tanto automátia omo manual si se dispusiera de ella. Las frases apareen divididas del mismo mo do en que se muestran los subtítulos, es deir, p or ó digos temp orales. Para la omo didad del usuario, la repro duión del vídeo en el repro dutor y el avane de las transrip iones en el editor están sinronizadas. Es deir, las transrip iones avanzan automátiamente en el repro dutor a medida que el vídeo se reprodue. Además, se resalta el elemento o frase que orresp onde al instante atual de repro duión para evitar onfusiones. Pulsando sobre una frase en el editor se habilita su ediión. El usuario puede mo diar y orregir palabras de un mo do interativo. A través de un serviio web se enviarán las orreiones del usuario al sistema de transrip ión automátia y éste devolverá nuevas hip ótesis de transrip ión a raíz de las mismas. Por ejemplo, imaginemos que durante un vídeo onreto se meniona en repetidas o asiones un nombre propio que no es ono ido p or el sistema de reono imiento automátio del habla, p or ejemplo Java. Sup ongamos que ada vez que aparee la palabra Java en el vídeo, el sistema la transrib e erróneamente omo jarra. La idea será que una vez el usuario orrija la primera apariión de jarra por Java, el sistema aprenda de diha orreión y devuelva una nueva transrip ión en la que el resto de apariiones de la palabra Java aparezan transritas orretamente. Puesto que este pro eso puede sup oner un alto oste omputaional, distinguiremos varias modalidades de ediión interativa dependiendo del tiempo de respuesta requerido. 1 CSS, en inglés: Casading Style Sheets . APGM-DSIC-UPV 21 memoria  2012/7/19  12:32  page 28  #32 i i memoria  2012/7/19  12:32  page 29  #33 i i Capítulo 5 Integraión en la plataforma Matterhorn 5.1. Persp etiva El ob jetivo de este apítulo es integrar en la plataforma Matterhorn las ténias de transrip ión asistida que fueron denidas a lo largo del apítulo 4 para el reprodutor prototip o basado en HTML5. Existen diferentes p osibilidades de ara a llevar a ab o esta integraión, dep endiendo prinipalmente de la distribuión del sistema de transrip iones y de las neesidades del modelo. Una p osibilidad sería integrar el sistema de transripión automátia en el mismo sistema Matterhorn, y atribuir a Matterhorn la gestión de las transripiones. Sin embargo, la propuesta seguida en los suesivos apartados de este apítulo sugiere un sistema distribuido donde el sistema de transrip ión automátia se enarga p or separado de la gestión de las mismas (obtenión, almaenamiento, et.). La integraión en Matterhorn onstará por tanto de dos asp etos fundamentales: el primero la neesidad de transmitir al sistema de transrip ión automátia los nuevos ontenidos audiovisuales añadidos al sistema, y el segundo la adaptaión de un nuevo reprodutor para la plataforma Matterhorn que p ermita la visualizaión y ediión interativa de transrip iones. Ambas dos tareas inluirán la extensión y adaptaión del serviio web empleado en el reprodutor prototip o (ver g. 4.3) para ubrir las neesidades de omuniaión entre la plataforma Matterhorn y el sistema de transrip ión automátia (a partir de ahora Sistema de Gestión de Transrip iones). De este serviio web se darán más detalles en la siguiente seión. 29 memoria  2012/7/19  12:32  page 30  #34 i i Capítulo 5. Integraión en la plataforma Matterhorn 5.2. Sistema de Gestión de Transrip iones e interfaes Deb erán denirse primeramente una serie de interfaes para p ermitir la omuni- aión on el Sistema de Gestión de Transrip iones. La idea es basar to das estas interfaes en llamadas HTTP REST 1 [Tya06℄. Una de las araterístias lave de los serviios web REST es el uso explíito de los méto dos HTTP. Estamos hablando, p or tanto, de rear un serviio web tip o REST para gestionar el interambio de informaión entre Matterhorn y el Sistema de Gestión de Transrip iones. Neesitaremos denir varias interfaes, por ejemplo para la subida de arhivos al sistema, para ono er el estado de proesamiento de los arhivos enviados o para obtener las transrip iones de un vídeo determinado. A ontinuaión se desrib en on más detalle las prinipales interfaes implementadas: Ingest : Será un serviio POST mediante el ual se añadirá un nuevo elemento al Sistema de Gestión de Transrip iones para ser pro esado. El identiador id deb erá oinidir on el identiador del mediaPakage reado en Matterhorn para la p osible identiaión a p osteriori. Méto do /Ruta POST /ingest Desrip ión Añade un nuevo elemento (vídeo/audio) al sistema Parámetros requeridos id: Identiador del elemento (mediaPakage ID de Matterhorn) Bo dy (subida) El arhivo multimedia Status : Empleado para onoer el estado de proesamiento de un elemento del sistema no pro esado, pro esando, transrito. Méto do /Ruta GET /status Desrip ión Devuelve el estado de pro esamiento del elemento id . Parámetros requeridos id: Identiador del elemento (mediaPakage ID de Matterhorn) Formato de respuesta text/xml DFXP : Devolverá la transrip ión de un vídeo onreto del sistema en formato DFXP en aso de disponer de ella. 1 REST: REpresentational State Transfer. 30 APGM-DSIC-UPV memoria  2012/7/19  12:32  page 31  #35 i i 5.3. Parte I: Integraión en el workow de Matterhorn Méto do /Ruta GET /dfxp Desrip ión Devuelve la transrip ión del elemento id en formato DFXP. Parámetros requeridos id: Identiador del elemento (mediaPakage ID de Matterhorn) Formato de respuesta text/xml Mo d : Posibilitará el envío de orreiones o mo diaiones para la transrip- ión de un elemento del sistema, que deb erán seguir un formato determinado. Méto do /Ruta POST /mo d Desrip ión Envío de orreiones para la transrip- ión del elemento id . Parámetros requeridos id: Identiador del elemento (mediaPakage ID de Matterhorn) Bo dy (subida) Mo diaiones realizadas (formato on- reto). 5.3. Parte I: Integraión en el workow de Matterhorn Ya están denidas e implementadas las interfaes para la omuniaión on el Sistema de Gestión de Transrip iones. Tenemos la neesidad de transmitir los nuevos medios añadidos a Matterhorn al SGT (Sistema de Gestión de Transrip iones) para que éstos sean pro esados. Como se omentó en la seión 5.1, de la gestión de las transrip iones se enargará p or ompleto el SGT. Esto implia que las transrip iones se almaenarán también en el SGT y no en los mediaPakages del sistema Matterhorn. En Matterhorn, ada elemento añadido al sistema es pro esado mediante una serie de op eraiones que onforman un workow (ver seiones 2.2.1 y 2.2.2). El pro edimiento será rear un nuevo serviio enargado de transmitir la informaión al SGT y la orresp ondiente workow operation que haga uso de éste, para p osteriormente añadirla al workow p or defeto de Matterhorn. La gura 5.1 ilustra el pro eso que seguiría un nuevo vídeo añadido al sistema. A ontinuaión se desriben los pasos seguidos para la reaión de este nuevo serviio y su p osterior implantaión en el sistema: 1. Implementar el nuevo serviio. Primero se reará la estrutura de arhivos y diretorios del serviio. El ó digo del nuevo serviio estará ubiado en dos arp etas en el diretorio modules dentro del diretorio base de Matterhorn, ba jo los nombres matterhorn-transriptionservie-api y matterhorn-transription-servie-impl. En el primero de ellos simAPGM-DSIC-UPV 31 memoria  2012/7/19  12:32  page 32  #36 i i Capítulo 5. Integraión en la plataforma Matterhorn Figura 5.1: Pro esamiento de un vídeo a través del workow de Matterhorn plemente se implementará la API 2 de Java del serviio. En el diretorio ...- servie-impl se implementará diha interfaz y sus REST Endpoints. Aunque el resto de diretorios y arhivos puede generarse manualmente, es reomendable partir de otro serviio ya implementado y realizar las modiaiones que sean p ertinentes. Este serviio transmitirá las pistas de audio y vídeo al Sistema de Gestión de Transrip iones mediante la llamada REST ingest del serviio web denido en la seión 5.2. 2. Crear un Workow Op eration Handler. El siguiente paso es la implementaión del ontrolador de op eraión que hae uso del nuevo serviio. Las operaiones de workow se denen dentro del módulo matterhorn-ondutor. Para ello se rean dos nuevos arhivos: un arhivo Java que ontiene la implementaión de la operaión, llama2 Appliation Programming Interfae, en español: Interfaz de programaión de apliaiones. 32 APGM-DSIC-UPV memoria  2012/7/19  12:32  page 33  #37 i i 5.4. Parte I I: Sustituión/adaptaión del Engage Media Player do TransriptionWorkowOp erationHandler.java y situado en matterhorn- ondutor/sr/main/java junto al resto de ontroladores de op eraión. un arhivo XML que ontiene la delaraión OSGi, situado en matterhorn- ondutor/sr/main/resoures/OSGI-INF/operations. Por último se delara la op eraión en el arhivo p om.xml del matterhorn- ondutor. 3. Inluir la op eraión en el workow. Una vez implementado el ontrolador de op eraión para el nuevo serviio, ya p odremos ejeutar la op eraión desde ualquier workow. Se puede elegir si denir un nuevo workow que haga uso de ésta o simplemente mo diar el workow p or defeto de Matterhorn (omp ose-distribute-publish.xml) para que inluya la nueva op eraión. 5.4. Parte I I: Sustituión/adaptaión del Engage Media Player El Engage Media Player es el repro dutor de medios de la plataforma Matterhorn. La tenología en la que se basa es puramente HTML/JavaSript junto a un ontenedor de vídeo basado en Flash 10. Entre sus araterístias se enuentran, además de la mera repro duión de los ontenidos audiovisuales: la visualizaión de subtítulos, la repro duión de vídeo seletiva orresp ondiendo a las distintas diap ositivas de la presentaión, la búsqueda basada en ontenido, estadístias de visualizaión o anota- iones de los usuarios. Sin embargo, en nuestro aso neesitaremos un repro dutor que disp onga además de funionalidad para la ediión y modiaión de transrip iones, omo vimos en el apítulo 4. Cab e menionar aquí el esfuerzo que el Área de Sistemas de Informaión y Comuniaiones (ASIC) de la UPV está haiendo en la onstru- ión de un repro dutor alternativo basado en HTML5 ompatible on Matterhorn ba jo el nombre Pael la Engage Player [UPV12℄. El proyeto se enuentra to davía en fase de desarrollo a feha de la publiaión de este proyeto, y si bien to davía no disp one de funionalidad para la ediión de transrip iones, ésta se enuentra entre sus p osibles ob jetivos a orto plazo. La gura 5.2 muestra una versión extendida del Mini-Paella Player (una versión idéntia al Matterhorn Engage Player oial p ero basada en HTML5) que p osibilita la ediión de transripiones. Dado el mo delo distribuido de los sistemas propuesto en la seión 5.1, neesitaremos que el repro dutor implementado se omunique on el Sistema de Gestión de Transrip iones a través del serviio REST denido en la seión 5.2, tanto para la obtenión de las transrip iones omo para el interambio interativo de modia- iones. Esta omuniaión se ilustra en la gura 5.3. APGM-DSIC-UPV 33 memoria  2012/7/19  12:32  page 34  #38 i i Figura 5.2: Matterhorn Engage Player on ediión de transrip iones. Figura 5.3: Comuniaión entre el repro dutor HTML5 y el SGT. memoria  2012/7/19  12:32  page 35  #39 i i Capítulo 6 Conlusiones y trabajos futuros 6.1. Resumen A lo largo de este traba jo hemos señalado la neesidad de disp oner de una soluión para la obtenión de transrip iones de alidad de un mo do eiente. La propuesta ha onsistido en uniar un sistema automátio de reono imiento del habla on un sistema de ediión interativo que p ermita la sup ervisión de estas transrip iones automátias de una manera eaz. Para la onstruión de este sistema omplejo hemos dispuesto de un onjunto de datos suientemente amplio y de una plataforma de pruebas que nos ha p ermitido exp erimentar las neesidades reales de los usuarios. En el apítulo 1 hemos introduido la problemátia del reono imiento automátio del habla. Hemos dado un breve repaso a la historia reiente de estos sistemas, y hemos visto ómo han ido avanzado sus prestaiones hasta la atualidad. La falta de pre- isión de estos sistemas nos ha servido para justiar la interaión on el usuario en el pro eso de transrip ión, que es uno de los ob jetivos prinipales de este traba jo. A ontinuaión, en el apítulo 2 hemos introduido al letor la plataforma Matterhorn, dando una visión general de las araterístias de la misma y detallando algunos asp etos que se han onsiderado de relevania para apítulos p osteriores. En el apítulo 3 hemos presentado el rep ositorio p oliMedia, sus araterístias prinipales y sus ontenidos. Además, hemos resumido brevemente el diseño e implementaión de un sistema de reono imiento automátio del habla para este orpus. Posteriormente, en el apítulo 4 hemos visto on detalle la implementaión de un repro dutor prototipo basado en HTML5 para el rep ositorio poliMedia. Hemos dotado a este prototipo de una interfaz de usuario para la ediión y modiaión de transrip iones, presentando diversas ténias e ideas para haer esta ediión lo más interativa y eiente p osible. Por último, en el apítulo 5 hemos propuesto un modelo de integraión de un sistema de transrip ión semi-asistida on las mismas funionalidades que el repro dutor prototip o del apítulo anterior en la plataforma Matterhorn, y hemos visto on ierto 35 memoria  2012/7/19  12:32  page 36  #40 i i Capítulo 6. Conlusiones y traba jos futuros detalle la manera de llevar a ab o esta integraión. 6.2. Conlusiones En el apítulo 3 hemos visto omo efetivamente, las transrip iones obtenidas de manera puramente automátia no son lo suientemente preisas (se. 3.3). Para obtener transripiones que presenten un grado de preisión óptimo en la atualidad es neesaria la intervenión humana. Hemos p o dido omprobar ómo, partiendo de transrip iones automátias lo suientemente preisas (en torno al 70 % de palabras orretamente transritas), el uso de un sistema interativo que asista al usuario en el pro eso de orreión de éstas hae muho más eiente la tarea. Las funionalidades diseñadas para la ediión interativa se basan en la exp erienia de diversas p ersonas exp erimentadas en el amp o de la transripión y traduión manuales. 6.3. Traba jos futuros Disp onemos nalmente de un sistema eiente de obtenión de transripiones preisas para repositorios de gran tamaño y amplio vo abulario. Puesto que el re- ono imiento automátio del habla sigue siendo hoy en día uno de los prinipales fo os de investigaión en el área del reono imiento de formas, habrá que tener en uenta las ap ortaiones y mejoras que surjan a lo largo de los años para mejorar de forma ontinua la obtenión automátia de transrip iones. Por tanto, este proyeto no onsiste en un traba jo on punto y nal sino que representa una base sólida sobre la que implementar futuras mejoras que hagan to davía más eiente la obtenión de transrip iones preisas. Lo mismo puede deirse sobre las ténias interativas de ediión, que pueden ser extendidas onforme sea neesario para failitar al usuario la mo diaión manual de las transrip iones. Estas funionalidades han sido integradas en la plataforma Op enast Matterhorn on el n de obtener no solamente un sistema prototip o que sea empleado asi exlusivamente en un lab oratorio a mo do de prueba de onepto, sino un sistema que p ermita su uso en un entorno real para p o der evaluar así las neesidades reales de los usuarios. Pero no nos olvidemos del n último del que este proyeto representa úniamente un eslab ón: failitar el visionado de los ontenidos al mayor número de p ersonas p osible. Tal y omo omentamos en el apítulo 1, esto inluye la traduión de estas transrip iones a otras lenguas. La obtenión de transrip iones preisas es el paso previo a la traduión automátia, o en ualquier aso al proeso de traduión en general. Habrá que entrarse p or tanto en la ampliaión de este sistema para ubrir la diversidad lingüístia de los usuarios. Este traba jo y el p osterior traba jo futuro se desarollará en el maro del proye- to europeo transLetures 1 . transLetures es un proyeto STReP 2 dentro del Seventh Framework Programme fundado por la Comisión Europ ea. Comenzó el 1 de Noviembre de 2011 y su feha de nalizaión está programada para el 31 de Otubre de 1 http://transletures.eu 2 Sp ei Targeted Researh Pro jets. 36 APGM-DSIC-UPV memoria  2012/7/19  12:32  page 37  #41 i i 6.3. Traba jos futuros 2014. El ob jetivo de transLetures es desarrollar soluiones novedosas y eientes para la pro duión de transrip iones y traduiones preisas para el p ortal VideoLetures.NET, y de forma más general para otros repositorios relaionados on la plataforma Matterhorn. De este mo do, los esfuerzos se entrarán en aunar un sistema de transrip ión interativo de araterístias similares al desrito en este traba jo on un sistema de traduión que p ermita además disp oner de estas transrip iones en diversos idiomas, y que a su vez sea ompatible on la plataforma Matterhorn para p o der p oner a disposiión de las entidades que emplean esta plataforma las soluiones alanzadas durante el transurso del proyeto. APGM-DSIC-UPV 37