scieee AI-readable full text Open interactive document viewer

Un detector de la unidad central de un texto basado en técnicas de aprendizaje automático en textos científicos para el euskera

Bengoetxea Kortazar, Kepa Xabier,Atutxa Salazar, Aitziber,Iruskieta Quintian, Mikel

Abstract

En este artículo presentamos el primer detector de la Unidad Central (UC) de resúmenes científicos en euskera basado en técnicas de aprendizaje automático. Después de segmentar el texto en unidades de discurso elementales, la detección de la unidad central es crucial para anotar de forma más fiable la estructura relacional de textos bajo la Teoría de la Estructura Retórica o Rhetorical Structure Theory (RST). Además, la unidad central puede ser explotada en diversas tareas como resumen automático, tareas de pregunta y respuesta o análisis del sentimiento. Los resultados obtenidos demuestran que las técnicas de aprendizaje automático superan a las técnicas basadas en reglas a pesar del pequeño tamaño del corpus y de la heterogeneidad de los dominios que éste muestra, dejando todavía lugar para mejoras y desarrollo.

Full text

Un detector de la unidad central de un texto basado en t´ecnicas de aprendizaje autom´atico en textos cient´ıficos para el euskera∗ A Machine Learning based Central Unit Detector for Basque Scientific Texts Kepa Bengoetxea, Aitziber Atutxa y Mikel Iruskieta IXA Group. University of the Basque Country {kepa.bengoetxea,aitziber.atucha,mikel.iruskieta}@ehu.eus Resumen: En este art´ıculo presentamos el primer detector de la Unidad Central (UC) de res´umenes cient´ıficos en euskera basado en t´ecnicas de aprendizaje autom´atico. Despu´es de segmentar el texto en unidades de discurso elementales, la detecci´on de la unidad central es crucial para anotar de forma m´as fiable la estructura relacional de textos bajo la Teor´ıa de la Estructura Ret´orica o Rhetorical Structure Theory (RST). Adem´as, la unidad central puede ser explotada en diversas tareas como resumen autom´atico, tareas de pregunta y respuesta o an´alisis del sentimiento. Los resultados obtenidos demuestran que las t´ecnicas de aprendizaje autom´atico superan a las t´ecnicas basadas en reglas a pesar del peque˜no tama˜no del corpus y de la heterogeneidad de los dominios que ´este muestra, dejando todav´ıa lugar para mejoras y desarrollo. Palabras clave: Unidad central, t´opico principal, RST, aprendizaje autom´atico Abstract: This paper presents an automatic detector of the discourse central unit (CU) in scientific abstracts based on machine learning techniques. After segmenting a text in its elementary discourse units, the detection of the central unit is a crucial step on the way to robustly build discourse trees under the Rhetorical Structure Theory (RST). Besides, CU detection may also be useful in automatic summarization, question answering and sentiment analysis tasks. Results show that the CU detection using machine learning techniques for Basque scientific abstracts outperform rule based techniques, even on a small size corpus on different domains. This leads us to think that there is still room for improvement. Keywords: Central unit, main topic, RST, machine learning 1 Introducci´on Saber cu´al es el tema principal o la idea global del texto es una tarea relativamente f´acil siempre que se domine la lengua; aunque tambi´en es cierto que dicha tarea puede complicarse en algunos textos que no exponen la idea principal expl´ıcitamente, para conseguir un efecto comunicativo o simplemente porque los textos no est´an bien redactados. El tema principal puede ser representado de diferentes formas: i) por elementos o palabras clave (desde una ´unica palabra a una ∗Agradecemos tanto a Kike Fernandez como a Esther Miranda todo el trabajo t´ecnico para poder analizar y visibilizar los resultados de este trabajo. Este trabajo a sido financiado en parte por el siguiente proyecto: TIN2015-65308-C5-1-R (MINECO/FEDER). lista de palabras), ii) por proposiciones u oraciones completas. Seg´un Iruskieta, Diaz de Ilarraza, y Lersundi (2014) la detecci´on del tema principal o unidad central (UC)1es de gran ayuda en la anotaci´on de la estructura ret´orica, ya que conocer de antemano c´ual es la UC permite mejorar el ratio de acuerdo entre anotadores en la Rhetorical Structure Theory (RST) de Mann y Thompson (1988). Teniendo en cuenta esos resultados, pensamos que un analizador discursivo autom´atico podr´ıa 1La Unidad Central (UC) es un concepto asociado con los ´arboles de la RST y es la unidad discursiva elemental (UDE) m´as importante del ´arbol que tiene la funci´on de ser el principal n´ucleo del ´arbol, aunque puede constar de m´ultiples UDEs en el caso de parataxis. recibido 11-11-2016 revisado 12-01-2017 aceptado 07-02-2017 ISSN 1135-5948 © 2017 Sociedad Española para el Procesamiento del Lenguaje Natural Procesamiento del Lenguaje Natural, Revista nº 58, marzo de 2017, pp. 37-44 ofrecer resultados m´as fiables si detectara la unidad central tras la segmentaci´on discursiva autom´atica (Iruskieta y Zapirain, 2015). Adem´as, podr´ıa ser utilizado en tareas del Procesamiento del Lenguaje Natural (PLN), aquellas como, resumen autom´atico, an´alisis del sentimiento o b´usqueda de respuestas. El objetivo de este art´ıculo es construir un detector autom´atico de unidades centrales en textos cient´ıficos para el euskera construyendo un clasificador del tipo Multivariate Bernoulli Naive Bayes.2 Para entrenar y evaluar el detector autom´atico de la unidad central hemos utilizado el corpus3Basque RST Treebank (Iruskieta et al., 2013), previamente anotado para otros prop´ositos y tareas (y el ´unico accesible para el euskera).4 En el Ejemplo (1) presentamos un texto de ese corpus anotado manualmente: con los segmentos enumerados y la UC en negrita. (1) [Estomatitis Aftosa Recurrente (I): Epidemiologia, etiopatogenia eta aspektu klinikopatologikoak.]1 [“Estomatitis aftosa recurrente” deritzon patologia, ahoan agertzen den ugarienetako bat da,]2[tamainu, kokapena eta iraunkortasuna aldakorra izanik.]3[Honen etiologia eztabaidagarria da.]4[Ultzera mingarri batzu bezala agertzen da,]5[hauek periodiki beragertzen dira.]6[Lan honetan patologia arrunt honetan ezaugarri epidemiologiko, etiopatogeniko eta klinikopatologiko garrantsitsuenak analizatzen ditugu.]7GMB030135 2Los textos utilizados son relativamente complejos teniendo en cuenta la disposici´on discursiva de la unidad central, ya que la unidad central puede estar en diferentes posiciones en el texto: al principio, en la mitad o al final del texto. 3Este corpus puede ser consultado en http:// ixa2.si.ehu.eus/diskurtsoa/. 4Aunque en este trabajo nos hemos basado en la RST, pensamos que la detecci´on de la unidad central podr´ıa ser aplicable tambi´en en otras teor´ıas. 5Texto literalmente traducido: [La Estomatitis Aftosa Recurrente (I): Epidemiolog´ıa, etiopatogenia y aspectos cl´ınicopatol´ogicos.]1[La estomatitis aftosa recurrente es una de las patolog´ıas orales m´as frecuentes,]2[de tama˜no, localizaci´on y duraci´on variable.]3[Su etiolog´ıa es todav´ıa controvertida.]4[Se caracteriza por la aparici´on de ´ulceras dolorosas,]5 [estas recidivan periodicamente.]6[En este trabajo analizamos las principales caracter´ısticas epidemiol´ogicas, etiopatog´enicas y clinicopatol´ogicas de esEl texto del Ejemplo (1) se ha segmentado en 7 Unidades de Discurso Elementales (UDE)6y la unidad central es la ´ultima de ellas, la UDE7. Seg´un Paice (1980) existen algunos indicadores que facilitan detectar autom´aticamente las ideas principales. Bas´andonos en esos indicadores y otros que hemos desarrollado en este estudio, la UDE7muestra los siguientes: i)Lan honetan ‘en este trabajo’, el nombre lan ‘trabajo’ junto al demostrativo hau ‘este’ junto con el sufijo -n(inesivo) de lugar, se refiere al trabajo que el autor presenta en el resumen. ii)Garrantzitsuena ‘el m´as importante’, el adjetivo garrantzitsu ‘importante’ y el superlativo −en−‘el m´as’ indican que el elemento modificado por el adjetivo est´a resaltado de alguna forma en la oraci´on. iii)Analizatu dugu ‘hemos analizado’, el verbo analizatu ‘analizar’ es com´un para expresar la acci´on principal que se realiza en trabajos de investigaci´on (Iruskieta, Diaz de Ilarraza, y Lersundi, 2014) y el pronombre adjunto al verbo auxiliar −gu ‘nosotros’, indica que el la acci´on la han desarrollado los autores del art´ıculo. Aunque los indicadores7por si solos pueden ser ambiguos, ya que pueden utilizarse en otras UDEs que no son unidades centrales, nuestra hip´otesis es que podemos detectar la unidad central de res´umenes cient´ıficos de una forma aceptable, utilizando adecuadamente todos estos indicadores con t´ecnicas de aprendizaje autom´atico. En lo que sigue del art´ıculo, explicamos en la Secci´on 2los trabajos relacionados en los que nos hemos basado. En la Secci´on 3la metodolog´ıa que hemos empleado para construir el detector de la unidad central. En la Secci´on 4presentamos el sistema y en la Secci´on 5los resultados obtenidos. Finalmente, exponemos en la Secci´on 6las conclusiones y ta com´un patolog´ıa oral.]7 6Las UDEs son los bloques o segmentos m´as peque˜nos de los que consta una estructura en ´arbol discursivo (Carlson, Marcu, y Okurowski, 2001). En general, las UDEs son enunciados independientes o adverbiales. 7Otros indicadores en este texto aunque m´as complejos son: i) las palabras o lemas repetidos del t´ıtulo: epidemiologia ‘epidemiolog´ıa’, etiopatogenia yklinikopatologia ‘clinicopatolog´ıa’, ii) los sin´onimos como aspektu ‘aspecto’ y ezaugarri ‘caracter´ıstica’, y iii) la relaci´on de anafora entre Estomatitis Aftosa Recurrente ypatologia arrunt honetan ‘esta patolog´ıa com´un’. Kepa Bengoetxea, Aitziber Atutxa, Mikel Iruskieta 38 el trabajo futuro. 2 Trabajos relacionados La extraci´on de la unidad m´as relevante de un texto se ha estudiado con diferentes prop´ositos y aplicando distintas t´ecnicas. Luhn (1958) hace uso de informaci´on estad´ıstica sobre una lista de palabras significativas o clave para la extracci´on de las sentencias m´as relevantes en res´umenes literarios en ingl´es. Mientras que Neto et al. (2000) aplica la t´ecnica TF-ISF (Term Frequency-Inverse Sentence Frequency) para generar de forma autom´atica res´umenes de textos. En Pardo, Rino, y Nunes (2003) emplean ambas t´ecnicas para extraer la oraci´on m´as importante de textos cient´ıficos tanto en ingl´es como en portugu´es de Brasil y obtienen mejores resultados haciendo un ranking de sentencias basado en palabras clave y la posici´on de la oraci´on. La unidad central tambi´en se puede extraer autom´aticamente de aquellos analizadores que obtienen la estructura relacional del discurso en forma de ´arboles jer´arquicos. Por ejemplo, se puede extraer del analizador CODRA8para el ingl´es (Joty, Carenini, y Ng, 2015), ya que ´esta ser´ıa la UDE situada en la raiz del ´arbol. Nuestro trabajo es similar al trabajo realizado por Burstein et al. (2001), que emplea un clasificador Bayesiano para identificar la oraci´on tem´atica del texto. El clasificador se sirve como caracter´ısticas de la posici´on, de una lista de palabras clave y ciertas caracter´ısticas discursivas basadas en el analizador RST de Marcu (2000). Para extraer la lista de palabras clave, hemos tomado como punto de partida el trabajo de Iruskieta et al. (2015) basado en reglas, para detectar la UC en res´umenes cient´ıficos de euskera. En la secci´on 5, los resultados del presente experimento en el que se aplican t´ecnicas de aprendizaje autom´atico se comparan con aquellos obtenidos en Iruskieta et al. (2015) a partir de aplicaci´on de reglas. 3 Metodolog´ıa 3.1 Etapas Las etapas para desarrollar nuestro detector de UCs basado en t´ecnicas de aprendizaje autom´atico han sido las siguientes: 8CODRA se puede probar muy facilmente aqu´ı: http://alt.qcri.org/demos/Discourse_Parser_ Demo/. i. Corpus. Se ha reutilizado el mismo corpus de Iruskieta et al. (2015) que consta de 100 res´umenes cient´ıficos en euskera segmentados y con las UCs anotadas manualmente. ii. Indicadores. Se han utilizado los indicadores de Iruskieta et al. (2015). iii. Optimizaci´on. Se ha elegido y optimizado el algoritmo de aprendizaje autom´atico. iv. Evaluaci´on. Se ha evaluado el detector autom´atico de UCs. 3.2 El corpus El corpus sobre el que hemos realizado este estudio est´a conformado por 100 textos de 5 dominios diferentes (medicina (GMB), terminologia (TERM), ciencia (ZTF), ciencias de la salud (OSA) y de la vida (BIZ)), catalogados por UZEI9y la Udako Euskal Unibertsitatea (UEU).10 El corpus de 100 textos contiene 15.168 palabras, cada texto con su unidad central. Presentamos el corpus con mayor detalle en la Tabla 1. Dominio Textos Palabras UDEs UCs GMB 20 2.753 247 29 TERM 20 5.398 523 37 ZTF 20 6.646 548 27 OSA 20 4.964 454 21 BIZ 20 5.407 572 23 Total 100 15.168 2.344 137 Tabla 1: Descripci´on del Corpus Hemos empleado los dominios GMB, TERM y ZTF para entrenar nuestro sistema y generar el modelo de aprendizaje (incluyendo la selecci´on caracter´ısticas y la optimizaci´on hiperparam´etrica), y los dominios OSA y BIZ para validar los resultados. El corpus de entrenamiento se ha dividido en 10 partes para realizar una validaci´on cruzada. En la Tabla 2hemos calculado si ambos corpus muestran la misma dificultad en la detecci´on de la unidad central de este modo: Dificultad =U Cs UDEs cuanto m´as cerca de 1 es m´as f´acil de determinar la UC. Corpus UDEs UCs Dificultad Train 1.318 93 0,07050 Test 1.026 44 0,04288 Tabla 2: Dificultad para elegir la UC 9http://www.uzei.eus/. 10http://www.ueu.eus/. Un detector de la unidad central basado en técnicas de aprendizaje automático en textos científicos para el euskera 39 Seg´un la informaci´on de la Tabla 2detectar la UC en el corpus de validaci´on (test) es m´as dif´ıcil. Los resultados obtenidos en (Iruskieta et al., 2015) tambi´en se˜nalan que el resultado fu´e peor en esa parte del corpus. El tama˜no de este corpus (a nivel de n´umero de textos) es similar al que se ha utilizado en trabajos ya mencionados anteriormente, como el de Paice (1980) con un corpus de 32 textos y el de Burstein et al. (2001) con 100 textos. 3.3 El m´etodo de anotaci´on El corpus fu´e anotado con la herramienta RSTTool11 por dos linguistas expertos de RST, en tres fases: i) Los anotadores segmentaron el texto en UDEs. ii) Ambos anotadores determinaron cual o cuales de las UDEs formaban la UC. iii) La anotaci´on de la UC fue evaluada y harmonizada para obtener un gold standard. 3.4 Acuerdo entre anotadores Dos anotadores anotaron manualmente las UDEs y las UCs.12 El acuerdo entre el anotador-1 (A1) y el anotador-2 (A2) con el coeficiente Kappa (κ) (Siegel y Castellan, 1988) fue del 0,796 (de un total de 2.344 UDEs). Este grado de acuerdo que est´a entre los valores del 0,8 κ(acuerdo muy alto) y del 0,6 κ(buen acuerdo) es aceptable, seg´un Krippendorff (2004). Tambi´en es comparable al acuerdo obtenido en trabajos similares como el de Burstein et al. (2001) con un acuerdo entre dos anotadores de 0,733 κ (de un total de 2.391 oraciones) en un corpus compuesto por 100 textos.13 3.5 Extracci´on de caracter´ısticas El corpus ha sido enriquecido con informaci´on morfosint´actica utilizando un analizador morfol´ogico (Aduriz, 2000) y el desambiaguador morfol´ogico (Ezeiza et al., 1998). Se ha creado una lista de palabras clave o significativas para la extracci´on de la unidad central, una vez que se han analizado las caracter´ısticas que mejor indican las UCs en el corpus 11http://www.isi.edu/licensed-sw/RSTTool/. 12El gold standard de estos ficheros pueden ser consultados en http://ixa2.si.ehu.es/diskurtsoa/ en/segmentuak.php. 13Los desacuerdos m´as comunes y el proceso de armonizaci´on para obtener un gold standard se describen en Iruskieta et al. (2015). de entrenamiento. Tomando como referencia el trabajo de Paice (1980), hemos analizado qu´e verbos, nombres, pronombres y palabras claves (bonus words) permiten identificar la UC en nuestro corpus, incluyendo las caracter´ısticas que fueran necesarias. Un resumen de las caracter´ısticas que se utilizan aprendizaje autom´atico puede verse en la Tabla 3. Caract. Descripci´on Nombres Lista de nombres relacionados con la UC Verbos Lista de verbos relacionados con la UC Clave/bonus Lista de adjetivos y adverbios Ver. Auxiliares Lista de verbos con la primera persona del plural Determinantes Del tipo hau ‘este’ y hemen ‘aqui’ Pronombres Primera persona del plural gu ‘nosotros’ Combinaciones Nombres + determinantes, pronombres + nombres y verbos + verbos auxiliares Verbos principales Si contiene un verbo principal T´ıtulo Listas de palabras que aparecen en el texto del t´ıtulo Posici´on Posici´on del segmento en el texto Posici´on UDE con verb. aux. Orden del segmento entre los que incluyen un verbo auxiliar Condional Si contiene un verbo condicional Lista de palabras de parada Lista de palabras carentes de significado para las UCs Tabla 3: Caracter´ısticas para detectar la UC 3.6 Medidas de evaluaci´on Para evaluar el detector de la UC, el corpus se ha separado en dos partes. Una parte para el entrenamiento y otra para la prueba final de validaci´on. Se ha utilizado la misma separaci´on de datos de entrenamiento y validaci´on de Iruskieta et al. (2015) para poder comparar los resultados de ambos trabajos. Los experimentos se han realizado aplicando la t´ecnica de 10-fold cross-validation sobre los datos de entrenamiento y finalmente se ha evaluado sobre los datos de validaci´on. Para evaluar el sistema se han utilizado las medidas habituales: Exhaustividad (Recall), Precisi´on, y los valores de ambas m´etricas combinadas en una media arm´onica denominada valor-F (F-score oF1). Tambi´en se ha llevado a cabo un an´alisis de errores a nivel de texto, para entender como funciona el detector de la UC y ver si hay Kepa Bengoetxea, Aitziber Atutxa, Mikel Iruskieta 40 log(P(UC|UDE)) = log(P(UC)) + X i          log(P(Ai|UC)/P(Ai)), Si UDE contiene Ai log(P(Ai|UC)/P(Ai)), Si UDE no contiene Ai Tabla 4: F´ormula Bernoulli multivariante lugar para mejoras. 4 El detector autom´atico de UCs Como se ha mencionado previamente, para crear un clasificador que detecte aquellos segmentos de un resumen que tienen mayor probabilidad para ser etiquetados como UC, se ha experimentado con diferentes algoritmos de clasificaci´on como Multinomial Naive Bayes,Multivariate Bernoulli Naive Bayes, Support Vector Machines (SVM) con polinomios de grado 2 y 3, Radial Basis Functions (RBF) ySingle Perceptron, utilizando tanto caracter´ısticas basadas en frecuencia como binarias. Finalmente se ha optado por Multivariate Bernoulli Naive Bayes por las siguientes razones: −Los par´ametros necesarios para el clasificador se pueden estimar con corpus de entrenamiento peque˜nos. −Ha sido utilizado con ´exito en tareas similares: para identificar oraciones tem´aticas (Burstein et al., 2001) o para clasificar textos cortos (McCallum y Nigam, 1998). −Puede ser empleado tanto como modelo predictivo como descriptivo. −La aplicaci´on de este clasificador es la que mejores resultados nos ha brindado sobre el corpus de entrenamiento. La distribuci´on de Bernoulli a la hora de clasificar tiene en cuenta tanto la ausencia como la presencia de las carater´ısticas. Para enriquecer el modelo, hemos valido de las caracter´ısticas que se muestran en la Tabla 3. Empleando la f´ormula de la Tabla 4,Bernoulli multivariante, se obtiene la probabilidad logar´ıtmica que tiene una UDE para pertenecer a la clase UC. El rendimiento mejora si utilizamos el estimador de Laplace para hacer frente a los casos en que las estimaciones de probabilidad de ciertas caracter´ısticas que son iguales a cero. En la f´ormula de la Tabla 4:i)P(UC) es la probabilidad a priori para que una UDE pertenezca a la clase UC, ii)P(Ai|UC) es la probabilidad condicional para que una UDE que pertenece a UC tenga la caracter´ıstica Ai, y iii)P(Ai) es la probabilidad a priori para que una UDE contenga la caracter´ıstica Ai,iv)P(Ai|UC) es probabilidad condicional de que una UDE que pertenece a UC no tenga la caracter´ıstica Ai, y v)P(Ai) es la probabilidad a priori para que una UDE no contenga la caracter´ıstica Ai. 4.1 Elecci´on de un subconjunto de caracter´ısticas usando un m´etodo Wrapper Como los algoritmos ingenuos de Bayes sufren con las caracter´ısticas reduntantes o correlacionadas, despu´es de seleccionar el algoritmo de aprendizaje con todas las caracter´ısticas de entrada, hemos aplicado un wrapper que nos permite seleccionar el mejor subconjunto de caracter´ısticas para el clasificador seleccionado. Para aplicar wrapper necesitamos definir los siguientes criterios: −Operaciones en el Espacio de B´usqueda. Las operaciones puede ser “a˜nadir caracter´ıstica” o “eliminar caracter´ıstica” o ambas. El t´ermino de “selecci´on hacia delante” se refiere a realizar la b´usqueda usando el operador “a˜nadir caracter´ıstica”, mientras que el t´ermino “selecci´on hacia atr´as” se refiere a realizar la b´usqueda usando el operador “eliminar caracter´ıstica”. Mientras que t´ermino “step-wise” usa ambos operadores. En nuestros experimentos hemos usado ´unicamente el operador “eliminar caracter´ıstica”. −Estimador de exactitud. Para medir la exactitud de cada operaci´on hemos usado ten-fold cross-validation con la funci´on de estimaci´on F-score. −El algoritmo de b´usqueda. Para conduUn detector de la unidad central basado en técnicas de aprendizaje automático en textos científicos para el euskera 41 cir la b´usqueda se puede usar diferentes algoritmos. En nuestro experimentos hemos usado el algoritmo de b´usqueda hill-climbing con la “selecci´on hacia atr´as”. El algoritmo empieza con todo el conjunto de caracter´ısticas y progresivamente elimina una caracter´ıstica y en cada iteraci´on genera sucesores del mejor nodo (aquel que ha obtenido el mayor F-score). La condici´on de terminaci´on ser´a cuando todos los sucesores de la iteracci´on actual no mejoren el valor de F-score de la iteracci´on anterior. El wrapper resuelve que el subconjunto ´optimo de caracter´ısticas que mejor resultado ha obtenido es el siguiente: nombres, verbos, bonus, determinantes, pronombres, palabras del t´ıtulo, posici´on, verbos auxiliares y 3 combinaciones (nombres + determinantes, pronombres + nombres y verbos + verbos auxiliares). 4.2 Post-proceso estad´ıstico Finalmente, se ha realizado un post-proceso estad´ıstico para los casos en los el clasificador no elija ninguna UDE como UC. En este caso, el post-proceso selecciona el primer candidato m´as probable de todos ellos, ya que el clasificador nos devuelve un valor de probabilidad para cada UDE. 4.3 Demo para detectar la UC Una vez realizadas estas tareas, hemos desarrollado una demo, para que pueda ser utilizada por la comunidad cient´ıfica. De esta forma, la demo pide un texto plano de entrada y ofrece dos formatos de salida diferentes: i) Formato web, para utilizar en tareas de PLN. ii) Formato RSTTool (RS3), para poder correguir la segmentaci´on o la unidad central y seguir con la tarea manual de la anotaci´on de las relaciones RST en euskera. La demo que puede ser consultada en http://ixa2.si.ehu.es/CU-detector. 5 Resultados En la Tabla 5se muestran varios resultados: i)Rule Based. En la primera fila se presenta el mejor resultado registrado en Iruskieta, Antonio, y Labaka (2016) utilizando m´etodos basados en reglas y aplicando la mejor heur´ıstica. ii)ML. En la segunda fila se pueden ver los resultados obtenidos con el clasificador Bernoulli Naive Bayes utilizando todas las caracter´ısticas. iii)ML +Wrap. En la tercera fila aparecen los resultados obtenidos despu´es de emplear el wrapper, y aplicando el mejor subconjunto de caracter´ısticas obtenido. iv)ML +Wrap +Post. Y finalmente, en la cuarta fila se presentan los resultados despu´es de aplicar el post-proceso estad´ıstico. Obteniendo los mejores resultados en Fscore de 0,54 con 10-fold cross-validation y 0,57 con los datos de validaci´on. Sistema Datos Prec. Rec. F1 Rule Based Dev 0,43 0,51 0,47 Test 0,70 0,40 0,51 ML Dev 0,47 0,48 0,48 Test 0,46 0,54 0,50 ML+Wrap Dev 0,58 0,46 0,51 Test 0,46 0,59 0,51 ML+Wrap+Post Dev 0,56 0,53 0,54 Test 0,48 0,70 0,57 Tabla 5: Tabla de resultados 5.1 An´alisis de errores Los diferentes tipos de acuerdos y desacuerdos que hemos observado en el an´alisis global (texto por texto) de errores que describimos en la Tabla 6son los siguientes: −Acuerdo total (coincidencia). El detector solamente ha etiquetado como UC, aquella UDE que se determina como UC en el gold standard. −Acuerdo en UC, pero con falsos candidatos (exceso). Adem´as de las UCs determinadas, el detector ha etiquetado otras UDEs que nos son UCs en el texto. −Acuerdo parcial en UCs m´ultiples (falta). El detector ha detectado alguna UC del texto, pero ha dejado otras UCs sin etiquetar. −Desacuerdo total (desacuerdo). El detector no ha detectado bien ninguna UC del texto. Coinc. Exc. Falta Desac. ML+Wrap 13 13 0 14 ML+Wrap+Post 16 13 2 9 Tabla 6: An´alisis de errores Si comparamos los resultados obtenidos con el m´etodo ML+Wrap y con el ML+Wrap+post de la Tabla 6, observamos que el postproceso mejora los resultados; ya que, hay mayor n´umero de acuerdos: i) hay mayor ‘coincidencia’ y ii) hay mayor n´umero de ‘falta’, que son acuerdos parciales, ya que Kepa Bengoetxea, Aitziber Atutxa, Mikel Iruskieta 42 por lo menos una de las UCs ha sido etiquetada adecuadamente. Hemos podido observar que las causas de los errores cometidos por el sistema en los resultados del post-proceso, son los siguientes: −‘Exceso’. En 13 ocasiones se ha detectado la UC y otro falso candidato. En 10 ocasiones la primera UC detectada por el sistema es el ´unico v´alido y en 7 de ellas es la UDE con m´as indicadores. En las otras 3 ocasiones, el sistema deber´ıa decantarse por el segundo candidato detectado con tambi´en con m´as indicadores. −‘Falta’. En 2 ocasiones se ha detectado una sola UC de las UCs m´ultiples anotadas manualmente. −‘Desacuerdo’. En 9 ocasiones el detector no ha sabido establecer correctamente la UC. En 2 ocasiones el texto no cuenta con indicadores suficientes para su detecci´on. En otras 5 ocasiones la unidad central no se presenta como tema principal, sino como una definici´on o se anuncia mediante una cat´afora. En las otras 2 el sistema ha fallado, porque no se han definido alguna otra caracter´ıstica, como por ejemplo la de darle importancia a que algunas caracter´ıticas est´en unas detr´as de otras. Observando estos datos pensamos que hay lugar para mejorar resultados desarrollando t´ecnicas para seleccionar candidatos en el postproceso bas´andonos en reglas. 6 Conclusiones y trabajo futuro La mayor aportaci´on de este trabajo es que se ha creado el primer detector de la unidad central (UC) de textos cient´ıficos para el euskera, que primero segmenta los textos en UDEs y despu´es determina la UC utilizando ´unicamente t´ecnicas de aprendizaje autom´atico.14 La UC se puede extraer del an´alisis autom´atico que realizan otros analizadores de la RST, como por ejemplo del analizador CODRA, que est´a entrenado con textos period´ısticos en ingl´es y no para abstracts cient´ıficos. Ahora mismo estamos estudiando si es posible mejorar los resultados obtenidos de las siguientes formas: 14Este detector se puede probar en http://ixa2. si.ehu.es/CU-detector. −Combinando otras t´ecnicas de aprendizaje autom´atico. −Combinando diferentes sistemas basados en reglas y en aprendizaje autom´atico. En el futuro tambi´en queremos medir la utilidad de este detector en tareas del PLN y adaptar este detector a otras lenguas y g´eneros textuales. −Utilizar en tareas de b´usqueda de respuestas (Aldabe et al., 2013) para preguntar sobre el tema principal del texto. −Aplicar en tareas de an´alisis del sentimiento en euskera, ya que mejora resultados seg´un Alkorta et al. (2015). −Adaptar el detector a otras lenguas y evaluarlo con corpus anotados con RST, como pueden ser: •La Spanish RST Treebank (da Cunha et al., 2011) con 267 textos anotados. •La RST Treebank en ingl´es (Carlson, Okurowski, y Marcu, 2002) con 385 textos anotados. Bibliograf´ıa Aduriz, I. 2000. EUSMG: morfologiatik sintaxira murriztapen gramatika erabiliz. Ph.D. tesis, Euskal Herriko Unibertsitatea, UPV/EHU, Donostia. Aldabe, I., I. Gonzalez-Dios, I. Lopez-Gazpio, I. Madrazo, y M. Maritxalar. 2013. Two approaches to generate questions in basque. Procesamiento del Lenguaje Natural, (51):101–108. Alkorta, J., K. Gojenola, M. Iruskieta, y A. Perez. 2015. Using relational discourse structure information in Basque sentiment analysis. En 5th Workshop RST and Discourse Studies”, in Actas del XXXI Congreso de la Sociedad Espa˜nola del Procesamiento del Lenguaje Natural (SEPLN 2015), Alicante. Burstein, J., D. Marcu, S. Andreyev, y M. Chodorow. 2001. Towards automatic classification of discourse elements in essays. En Proceedings of the 39th annual Meeting on Association for Computational Linguistics, p´aginas 98–105. Association for Computational Linguistics. Un detector de la unidad central basado en técnicas de aprendizaje automático en textos científicos para el euskera 43 Carlson, L., D. Marcu, y M. Okurowski. 2001. Building a discourse-tagged corpus in the framework of rhetorical structure theory. En 2nd SIGDIAL Workshop on Discourse and Dialogue, Eurospeech 2001, p´agina 10, Aalborg, Denmark, 1-2 September. Association for Computational Linguistics. Carlson, L., M. E. Okurowski, y D. Marcu. 2002. RST discourse treebank. Linguistic Data Consortium, University of Pennsylvania. da Cunha, I., J.-M. Torres-Moreno, G. Sierra, L.-A. Cabrera-Diego, y B.-G. CastroRol´on. 2011. The RST Spanish Treebank On-line Interface. En International Conference Recent Advances in NLP, Bulgaria, 12-14 September. Ezeiza, N., I. Alegria, J.-M. Arriola, R. Urizar, y I. Aduriz. 1998. Combining stochastic and rule-based methods for disambiguation in agglutinative languages. Proceedings and 17th International Conference on Computational Lingustics, 1:380– 384. Iruskieta, M., J. Antonio, y G. Labaka. 2016. Detecting the central units in two different genres and languages: a preliminary study of brazilian portuguese and basque texts. Procesamiento de Lenguaje Natural, (56):65–72. Iruskieta, M., M. Aranzabe, A. Diaz de Ilarraza, I. Gonzalez, M. Lersundi, y O. L. de la Calle. 2013. The RST Basque TreeBank: an online search interface to check rhetorical relations. En 4th Workshop ”RST and Discourse Studies”, Brasil, October 21-23. Iruskieta, M., A. Diaz de Ilarraza, G. Labaka, y M. Lersundi. 2015. The Detection of Central Units in Basque scientific abstracts. En 5th Workshop RST and Discourse Studies¨ın Actas del XXXI Congreso de la Sociedad Espa˜nola del Procesamiento del Lenguaje Natural (SEPLN), Alicante. Iruskieta, M., A. Diaz de Ilarraza, y M. Lersundi. 2014. The annotation of the central unit in rhetorical structure trees: A key step in annotating rhetorical relations. En COLING, p´aginas 466–475, Dublin. Dublin City University and ACL. Iruskieta, M. y B. Zapirain. 2015. Euseduseg: a dependency-based edu segmentation for basque. Procesamiento del Lenguaje Natural, (55):41–48. Joty, S., G. Carenini, y R. T. Ng. 2015. Codra: A novel discriminative framework for rhetorical analysis. Computational Linguistics, 41(3):385–435. Krippendorff, K. 2004. Content analysis: An introduction to its methodology. Sage. Luhn, H. P. 1958. The automatic creation of literature abstracts. IBM Journal of research and development, 2(2):159–165. Mann, W. C. y S. A. Thompson. 1988. Rhetorical structure theory: Toward a functional theory of text organization. TextInterdisciplinary Journal for the Study of Discourse, 8(3):243–281. Marcu, D. 2000. The rhetorical parsing of unrestricted texts: A surfacebased approach. Computational Linguistics, 26(3):395–448. McCallum, A. y K. Nigam. 1998. A comparison of event models for naive bayes text classification. En AAAI-98 workshop on learning for text categorization, volumen 752, p´aginas 41–48. Neto, J. L., A. D. Santos, C. A. Kaestner, y A. A. Freitas. 2000. Generating text summaries through the relative importance of topics. Advances in Artificial Intelligence, p´aginas 300–309. Paice, C. D. 1980. The automatic generation of literature abstracts: an approach based on the identification of self-indicating phrases. En Proceedings of the 3rd annual ACM conference on Research and development in information retrieval, p´aginas 172–191. Butterworth & Co. Pardo, T., L. Rino, y M. Nunes. 2003. GistSumm: A summarization tool based on a new extractive method. Computational Processing of the Portuguese Language, p´aginas 196–196. Siegel, S. y N. Castellan. 1988. The Friedman two-way analysis of variance by ranks. Nonparametric statistics for the behavioral sciences, p´aginas 174–184. Kepa Bengoetxea, Aitziber Atutxa, Mikel Iruskieta 44