Identificación de entidades con nombre basada en modelos de Markov y árboles de decisión
Abstract
Este artículo presenta un sistema para el reconocimiento de entidades con nombre apoyándonos en dos técnicas clásicas de aprendizaje automático: los modelos de Markov y los árboles de decisión. Se han desarrollado varios sistemas en los que hemos investigado el efecto producido por la inclusión de características que no dependen en exceso del idioma utilizado. Los experimentos se han realizado con el corpus del español distribuido para la tarea de reconocimiento de entidades con nombre del CoNLL 2002.
Full text
Identificaci´on de Entidades con Nombre basada en Modelos de Markov y ´ Arboles de Decisi´on ∗ Jos´e A. Troyano, V´ıctor J. D´ıaz, Fernando Enr´ıquez Javier Barroso yVicente Carrillo Universidad de Sevilla Avda. Reina Mercedes s/n 41012 Sevilla {troyano,vjdiaz}@lsi.us.es Resumen: Este art´ıculo presenta un sistema para el reconocimiento de entidades con nombre apoy´andonos en dos t´ecnicas cl´asicas de aprendizaje autom´atico: los modelos de Markov y los ´arboles de decisi´on. Se han desarrollado varios sistemas en los que hemos investigado el efecto producido por la inclusi´on de caracter´ısticas que no dependen en exceso del idioma utilizado. Los experimentos se han realizado con el corpus del espa˜nol distribuido para la tarea de reconocimiento de entidades con nombre del CoNLL 2002. Palabras clave: Reconocimiento de entidades, Modelos de Markov, ´ Arboles de decisi´on Abstract: In this paper we investigate Named Entity Recognition (NER) systems using two well-known classifiers in the machine learning literature: Markov Models and Decision Trees. We have designed several systems to check the impact of introducing different characteristics which have a weak dependence of the language used. We also report the results obtained by our systems on the Spanish corpus provided in the NER Task of ConNLL 2002 conference. Keywords: Name-Entity Recognition, Markov Models, Decision Trees 1. Introducci´on Un sistema encargado del reconocimiento de entidades con nombre (NER, Named Entity Recognition) persigue delimitar en un texto arbitrario aquellas frases simples que responden de forma directa a preguntas del tipo ¿qui´en?, ¿d´onde?, ¿cu´ando? o ¿cu´anto?. Por ejemplo, dado el siguiente texto: El presidente del Consejo Municipal Social, Luis M. Jap´on, advirti´o en una conferencia en Madrid celebrado el d´ıa del Trabajo, que el gobierno pretende a partir de enero subir el precio del tabaco en toda Espa˜na m´as de un 20 por ciento. un sistema NER reconocer´ıa un nombre de persona (Luis M. Jap´on), dos localizaciones (Madrid, Espa˜na), una organizaci´on (Consejo Municipal Social), dos fechas (d´ıa del Trabajo, enero) y una cantidad (20 por ciento). El reconocimiento de estas entidades se considera un paso previo hacia la compren- ∗Parcialmente financiado por el Ministerio de Ciencia y Tecnolog´ıa (FIT-150500-2002-416). si´on autom´atica de un texto, ya que aportan mucha informaci´on sobre su contenido. Por tanto, es frecuente que los sistemas NER est´en integrados dentro de otros sistemas m´as complejos que abordan la recuperaci´on de informaci´on, la extracci´on de informaci´on o los sistemas de b´usquedas de respuestas, por citar tan s´olo algunos de ellos. Las conferencias MUC-6 y MUC-7 (Chinchor, 1998) constituyeron un hito a la hora de especificar lo que se entiende por entidad con nombre y la forma de evaluaci´on de los sistemas NER. Los resultados tan prometedores que se obtuvieron entonces han motivado el desarrollo de sistemas NER cada vez m´as ambiciosos en los que se valoran otros factores como la capacidad de adaptaci´on a distintos g´eneros y formatos de textos, el multiling¨uismo, la limitaci´on en el uso de informaci´on externa como diccionarios o gazetters, etc. 1.1. Planteamiento del problema Los sistemas NER pueden ser interpretados como un problema de clasificaci´on en el que dado un texto representado como una secuencia de palabras (o tokens) ¯w=w1. . . wT
se desea asociar a cada palabra wiuna etiqueta tique determina el tipo de entidad que es. En nuestro caso adoptaremos la ontolog´ıa propuesta en (Tjong, 2002) donde se consideran las siguientes clase de entidades: PER para personas, LOC para localizaciones, ORG para organizaciones y MISC para entidades miscel´aneas que no se ci˜nen a los tres anteriores tipos. Para que cada palabra disponga de una etiqueta propia utilizaremos la notaci´on BIO (figura 1). La etiqueta de la primera palabra perteneciente a una entidad de tipo XXX ser´a etiquetada mediante B-XXX. Las siguientes palabras, si existen, pertenecientes a la misma entidad ser´an etiquetadas I-XXX. Finalmente, aquellas palabras del texto que no son consideradas entidades presentar´an la etiqueta O. De esta forma, si deseamos reconocer ntipos de entidades, dispondremos de 2n+ 1 etiquetas. Palabra Etiqueta La O Delegaci´on B-ORG de I-ORG la I-ORG Agencia I-ORG EFE I-ORG en O Extremadura B-LOC transmitir´a O ... ... Figura 1: Ejemplo de texto etiquetado Un aspecto importante en todo desarrollo de un sistema NER es poder calibrar su calidad. Para conseguirlo se suelen adoptar medidas que determinen, dado un texto de referencia previamente etiquetado, la divergencia que existe entre las etiquetas propuestas y las del texto. Las medidas m´as habituales que se aplican son la cobertura Cy precisi´on Pdefinidas mediante: P=# entidades correctas en el an´alisis propuesto # entidades en el an´alisis propuesto C=# entidades correctas en el an´alisis propuesto # entidades en el texto Es frecuente aportar adem´as una medida de compensaci´on entre la cobertura y precisi´on denominada medida Fβdefinida mediante: Fβ=(β2+ 1)P C β2P C 2. Modelos de aprendizaje Una vez planteado el reconocimiento de entidades como un problema de clasificaci´on es posible la adopci´on de m´etodos de aprendizaje autom´atico supervisado. Estos m´etodos parten de un texto (corpus) de referencia previamente etiquetado (conjunto de entrenamiento) y su objetivo es capturar el conocimiento impl´ıcito es dicho conjunto con la idea de aplicarlo sobre textos desconocidos. Una de las metas que nos hemos marcado en este trabajo es explorar qu´e grado de ´exito puede ser alcanzado por un sistema NER utilizando como base dos de los m´etodos m´as ampliamente divulgados en la literatura: los modelos de Markov y los ´arboles de decisi´on. 2.1. Modelos de Markov Considerando que el etiquetado de entidades sigue un proceso markoviano de primer orden podemos determinar que dada un texto de Tpalabras w= (w1,...,wT) su etiquetado ¯ t= (t1,...,tT) vendr´ıa dado por: ¯ t= argmax t1,...,tT i=T Y i=1 P(ti|ti−1)P(wi|ti) considerando una etiqueta extra t0=O para marcar el principio de etiquetado. El factor P(ti|ti−1) establece la probabilidad de transici´on de una etiqueta a otra. El factor P(wi|ti) establece la probabilidades l´exicas de que una palabra sea emitida por una etiqueta. Las probabilidades l´exicas y de transici´on deben ser estimadas y almacenadas en sendas matrices. Una vez conocidas ambas, se puede aplicar el algoritmo de Viterbi para calcular el vector ¯ t. Visto lo anterior, el problema fundamental con el que nos enfrentamos es la determinaci´on de ambas matrices. A partir de un corpus de entrenamiento podemos obtener el valor de los par´ametros aplicando el estimador de m´axima probabilidad. La ´unica dificultad es que la carencia de suficientes ejemplos (dispersi´on de datos) puede introducirnos demasiados par´ametros con valores nulos o muy cercanos a cero. Este problema, m´as agudo cuanto mayor es el conjunto de etiquetas o palabras, puede ser amortiguado aplicando t´ecnicas de suavizado que reparten
la masa probabil´ıstica entre todos las observaciones. 2.2. ´ Arboles de decisi´on Los ´arboles de decisi´on son clasificadores inspirados en la estrategia divide y vencer´as. Un ´arbol de decisi´on es un tipo especial de ´arbol donde cada nodo interior se asocia con una pregunta sobre un determinado conjunto de atributos X. Las respuestas a dichas preguntas determinan cada uno de los caminos que parten de cada nodo. Dado un objeto odescrito mediante una tupla de atributos (x1,...xm)∈X, el proceso de clasificaci´on comienza desde la ra´ız y desciende por las ramas del ´arbol seg´un sean las respuestas obtenidas en cada uno de los nodos hasta alcanzar la hoja que determinar´a su clase. El problema de la construcci´on eficiente de ´arboles de decisi´on a partir de corpus ha sido objeto de amplio estudio, profundizando en aquellos criterios de divisi´on de nodos que favorecen la ganancia de informaci´on. Ahora bien, cuando el problema de clasificaci´on es complejo, el ´arbol de decisi´on puede tener un tama˜no tal que no sea f´acil su comprensi´on. Tambi´en surgen dificultades cuando abordamos objetos del que no conocemos completamente todas sus caracter´ısticas. A pesar de esto, los ´arboles de decisi´on son uno de los clasificadores m´as ampliamente utilizados en el campo del aprendizaje autom´atico. 2.3. Combinaci´on de clasificadores En muchas ocasiones es deseable disponer de varias opiniones antes de tomar una decisi´on. Esta idea es la que respalda a dos t´ecnicas de aprendizaje que se basan en la combinaci´on de distintos clasificadores. Dos de las t´ecnicas m´as utilizadas son el boosting y el bagging (Witten y Frank, 2002). Ambas se basan en la generaci´on de distintos clasificadores a partir del mismo conjunto de entrenamiento, pero se diferencian en la manera en la que estos clasificadores son construidos. Las ideas b´asicas de estas t´ecnicas son: Bagging: Consiste en la generaci´on de distintos conjuntos de entrenamiento a partir del conjunto original. Para generar cada nuevo conjunto, se muestrea el original eliminando y replicando ejemplos de forma aleatoria. Cada conjunto de entrenamiento dar´a lugar a un clasificador distinto. Boosting: En lugar de generar cada modelo de forma independiente como lo hace el bagging, el boosting es una t´ecnica iterativa que va aprovechando en cada iteraci´on los resultados de la iteraci´on anterior. Cada nuevo modelo se fuerza para que d´e mejor respuesta en los ejemplos en los que los modelos anteriores fracasaron. Ello se consigue dando distintos pesos a los ejemplos del conjunto de aprendizaje. Una vez generados los distintos clasificadores, el resultado final se obtiene por votaci´on (ponderada en el caso del boosting). 3. Caracter´ısticas utilizadas Los modelos de Markov tienen muchas ventajas, pero entre ellas no se encuentra una gran flexibilidad para integrar distintas caracter´ısticas. En un problema como el del reconocimiento de entidades con nombre, esto supone una limitaci´on ya que alrededor de una entidad se pueden encontrar muchas pistas para determinar sus l´ımites y para clasificarla. B´asicamente se pueden distinguir dos posibles soluciones a la integraci´on de caracter´ısticas en los modelos de Markov. 1. Aquellas que incorporan informaci´on adicional transformando el corpus de entrenamiento mediante la sustituci´on de las etiquetas originales por otras que aporten m´as informaci´on. Por ejemplo, en (R¨ossler, 2002) se utiliza esta t´ecnica para especializar las etiquetas de las palabras que aparecen con m´as frecuencia antes y despu´es de cada tipo de entidad. 2. Aquellas, como sucede en (Zhou y Su, 2002), que intentan incluir esa informaci´on en las palabras, en vez de en las etiquetas. Bajo este enfoque, las probabilidades l´exicas pueden ser estimadas teniendo en cuenta caracter´ısticas m´as complejas. Una forma parecida de proceder, esta vez aplicada a la tarea de etiquetado morfosint´actico, la encontramos en (Brants, 2000) donde la probabilidad de las palabras desconocidas se estima en base a la frecuencia de secuencias de letras como, por ejemplo, los sufijos. Ambas soluciones requieren un mayor volumen de datos de entrenamiento a medida que se incorporan nuevas caracter´ısticas.
Las primeras porque ampl´ıan el conjunto de etiquetas y aumenta por tanto la dimensi´on de la matriz de transiciones, las segundas porque ampl´ıan la matriz l´exica en funci´on del n´umero de posibles combinaciones de caracter´ısticas. En muchos casos la identificaci´on de entidades con nombre plantea un problema de clasificaci´on bastante dif´ıcil, por ejemplo la palabra Sevilla puede hacer referencia a un lugar, a una organizaci´on (el ayuntamiento) o incluso a una persona (un apellido). Ante este tipo de ambig¨uedades hay muchos elementos que pueden ser relevantes para clasificar adecuadamente, de manera que cuantas m´as caracter´ısticas tengamos en cuenta mejor. Si queremos explorar este camino y a˜nadir un n´umero considerable de caracter´ısticas, no podremos hacerlo apoy´andonos exclusivamente en los modelos de Markov, por los problemas que plantear´ıa la estimaci´on de los par´ametros. Este planteamiento nos lleva a descargar de trabajo al modelo de Markov, exigi´endole exclusivamente la tarea de identificar las secuencias de palabras que forman parte de una entidad, sin determinar la categor´ıa a la que pertenece. Con ello se resuelven dos problemas de distinta naturaleza, la delimitaci´on y la clasificaci´on, lo que permite aplicar a cada uno de ellos la t´ecnica m´as apropiada, y utilizar en cada caso tambi´en las caracter´ısticas m´as apropiadas. En las siguientes subsecciones describiremos las diferentes caracter´ısticas que hemos probado en nuestros experimentos. 3.1. En la delimitaci´on En la delimitaci´on de entidades, la inclusi´on de caracter´ısticas, m´as que a˜nadir informaci´on, lo que nos va a permitir es quedarnos exclusivamente con la informaci´on que nos hace falta. La t´ecnica que hemos elegido para introducir este tipo de informaci´on es la de transformaci´on del corpus (R¨ossler, 2002). B´asicamente esta t´ecnica consiste en modificar tanto el corpus de entrenamiento como el de test de manera que se obtenga un modelo de Markov distinto al que se obtendr´ıa con el corpus original. Con ello se pueden conseguir varias cosas: modelar un problema de etiquetado distinto al original dar m´as peso a ciertas palabras del vocabulario agrupar varias palabras del vocabulario en una ´unica entrada La figura 1, que presenta un fragmento del corpus original, nos servir´a de apoyo a la hora de mostrar las distintas transformaciones que hemos aplicado al corpus. Para que el modelo de Markov se encargue exclusivamente de delimitar las entidades existentes procedemos a transformar el corpus de entrenamiento eliminando de las etiquetas la informaci´on relativa a la categor´ıa de las entidades (figura 2). Palabra Etiqueta La O Delegaci´on B-XXX de I-XXX la I-XXX Agencia I-XXX EFE I-XXX en O Extremadura B-XXX transmitir´a O ... ... Figura 2: Transformaci´on de etiquetas La estrategia de simplificar la tarea del modelo de Markov da resultados bastante buenos al detectar entidades que han aparecido en el corpus de entrenamiento pero se comporta bastante mal ante entidades desconocidas. El problema de las palabras desconocidas es bastante com´un en todo proceso de etiquetado, pero es m´as cr´ıtico a´un, si cabe, en la identificaci´on de entidades ya que dichas palabras suelen ser buenas candidatas para formar parte de una entidad. La falta de informaci´on que conlleva el desconocimiento de una palabra puede ser compensada con la informaci´on que proporcionan las may´usculas, ya que en espa˜nol gran parte de los nombres de entidades contienen palabras en may´usculas y, a la inversa, la mayor parte de las palabras en may´usculas forman parte de entidades con nombre. Adem´as de las palabras que contienen may´usculas, hay otro tipo de palabras que pueden ser de ayuda en la detecci´on de nombres de entidades, se trata de aquellas palabras en min´uscula que aparecen frecuentemente alrededor o dentro de una entidad.
Tanto la informaci´on de las may´usculas como la de las palabras que aparecen de forma frecuente rodeando o dentro de una entidad ha sido introducida a trav´es de transformaciones del corpus de entrenamiento. A diferencia de la transformaci´on anterior, en este caso no se modifican las etiquetas sino que son las palabras del vocabulario las que se transforman. Se aplican las siguientes reglas: Se sustituye cada palabra del corpus por un token representativo. Los tokens considerados son: may para palabras que comienzan con may´usculas, min para min´usculas, tmay para palabras s´olo con may´usculas, mypto para una may´uscula seguida de un punto, abrev para abreviaturas en general, y 1apal para aquellas palabras que comienzan una frase. Se excluyen de esta transformaci´on aquellas palabras que aparecen frecuentemente alrededor o dentro de una entidad. Palabra Etiqueta La O may B-XXX de I-XXX la I-XXX may I-XXX tmay I-XXX en O may B-XXX min O ... ... Figura 3: Transformaci´on de etiquetas y palabras Dado que esta ´ultima transformaci´on afecta al vocabulario debe aplicarse tanto al corpus de entrenamiento como al de test. La figura 3 muestra el aspecto del fragmento del corpus original (figura 1) tras la aplicaci´on de las transformaciones de etiquetas y vocabulario. 3.2. En la clasificaci´on Tras delimitar las entidades disponemos de un texto en el que han sido se˜naladas las posibles entidades sin especificar a qu´e clase pertenecen. Para cada una de estas entidades se genera un vector de caracter´ısticas que son utilizadas para clasificar. Los ejemplos de entrenamiento son generados aplicando el mismo proceso de extracci´on de vectores de caracter´ısticas a las entidades presentes en el corpus de entrenamiento. Las caracter´ısticas utilizadas en los experimentos se agrupan en las siguientes categor´ıas: 1. Ortogr´aficas: A pesar de que parte de esta informaci´on ha sido ya utilizada en el proceso de delimitaci´on puede a´un ser ´util a la hora de discriminar la categor´ıa de una entidad. Se tiene en cuenta si una entidad contiene palabras que comienzan en may´usculas, totalmente en may´usculas, d´ıgitos y n´umeros romanos. Se incluyen tambi´en en este grupo otras caracter´ısticas como la longitud en palabras de una entidad, la posici´on relativa dentro de la frase y si contiene comillas o no. 2. Sufijos: Se calculan a partir del corpus de entrenamiento los sufijos de dos y tres letras relevantes para cada categor´ıa. 3. Contextos: En una ventana de tres palabras alrededor de una entidad se calculan las palabras relevantes para cada categor´ıa seg´un los ejemplos del corpus de entrenamiento. 4. Palabras significativas: Para cada categor´ıa se calcula el conjunto de palabras significativas eliminando palabras huecas y en min´usculas de los ejemplos del corpus de entrenamiento. 5. Listas externas: Se comprueba si una entidad presenta alguna palabra perteneciente a una serie de listas generadas con informaci´on externas al corpus de entrenamiento. Se tienen en cuenta listas de nombres, apellidos, pa´ıses, ciudades y disparadores internos de cada categor´ıa (por ejemplo calle para la categor´ıa LOC). En las caracter´ısticas 2, 3 y 4 se dispone de una serie de listas generadas autom´aticamente a partir del corpus de entrenamiento. Todas los elementos de una lista no son igualmente relevantes ya que algunos ser´an muy frecuentes en el corpus de entrenamiento y otros lo ser´an menos. En nuestros ex-
perimentos aprovechamos esa informaci´on a la hora de computar la caracter´ıstica de una entidad, dando m´as peso a los elementos m´as frecuentes. 4. Experimentos Todos los experimentos se han realizado con el corpus del espa˜nol distribuido para la tarea de reconocimiento de entidades con nombre del CoNLL 2002 (Tjong, 2002). Dicha distribuci´on consta de un corpus de entrenamiento de 264715 tokens y 18794 entidades, un test A (52923 tokens y 4315 entidades) que ha sido utilizado durante el desarrollo y un test B (51533 tokens y 3558 entidades) utilizado exclusivamente en las pruebas finales. 4.1. Experimento 1 En la tabla 1 se muestran los resultados de nuestro primer experimento. Como punto de arranque decidimos construir un ´unico modelo de Markov que llevase a cabo al mismo tiempo las tareas de delimitaci´on y clasificaci´on. Por tanto no se aplica ninguna transformaci´on al corpus ni se utiliza ning´un clasificador adicional. Los resultados no son malos, aunque s´ı se observa cierta debilidad en la categor´ıa MISC debido seguramente a que es la menos natural de las definidas en la ontolog´ıa de CoNLL. precisi´on cobertura Fβ=1 PER 80.04 % 56.19 % 66.03 % LOC 77.39 % 67.90 % 72.33 % ORG 73.28 % 69.93 % 71.56 % MISC 46.37 % 33.82 % 39.12 % Total 73.52 % 63.02 % 67.87 % Tabla 1: Delimitaci´on y clasificaci´on con modelos de Markov La tabla 2 muestra los resultados de la tarea de delimitaci´on (sin clasificaci´on) de entidades . En el experimento TrEt se transforma el corpus de entrenamiento previamente a la estimaci´on del modelo de Markov, cambiando las etiquetas tal y como se indica en la figura 2. En el experimento TrEtVc se transforman tanto el corpus de aprendizaje como el de test, cambiando las etiquetas y el vocabulario tal y como se muestra en la figura 3. Los resultados muestran que la utilizaci´on de los modelos de Markov exclusivamente en precisi´on cobertura Fβ=1 TrEt 79.98 % 66.56 % 72.66 % TrEtVc 87.21 % 84.71 % 85.95 % Tabla 2: S´olo delimitaci´on con modelos de Markov la delimitaci´on conlleva una sensible mejora con respecto al experimento inicial (tabla 1). Esta mejora es bastante m´as acusada en el experimento TrEtVc donde la estimaci´on del modelo se ve beneficiada por el aprovechamiento de la informaci´on que proporcionan las may´usculas, las palabras delimitadores y la reducci´on del tama˜no del vocabulario. 4.2. Experimento 2 En este segundo experimento partimos del mejor resultado en el proceso de delimitaci´on (experimento 1, TrEtVc). Para cada una de las entidades detectadas se genera un vector de caracter´ısticas. La base de datos resultantes sirve como conjunto de entrenamiento para la obtenci´on de un ´arbol de decisi´on. La tabla 3 muestra los resultados de cinco pruebas distintas, que difieren en las caracter´ısticas utilizadas para generar cada vector: Base: se utilizan caracter´ısticas ortogr´aficas, contextos, sufijos y palabras significativas. Estas caracter´ısticas se utilizan como base en el resto de modelos. RedCont: se reducen las listas de contextos y palabras significativas en un 25 %. RefMisc: se refuerza la informaci´on sobre la categor´ıa MISC. Para ello se generan nuevas listas de palabras significativas que incluyen aquellas palabras relevantes para MISC y no relevantes para el resto de categor´ıas. Ext: se incorporan caracter´ısticas calculadas en base a listas externas (ciudades, nombres de persona, apellidos, ...). Todas: se incluyen al experimento Base, las caracter´ısticas de los otros tres experimentos. Las tres modificaciones propuestas mejoran por separado los resultados del experimento base. La mejora m´as significativa se debe a la reducci´on de un 25 % en las listas
precisi´on cobertura Fβ=1 Base 63.44 % 61.62 % 62.51 % RedCont 67.75 % 65.81 % 66.76 % RefMisc 66.68 % 64.77 % 65.71 % Ext 64.71 % 62.85 % 63.77 % Todas 68.93 % 66.96 % 67.93 % Tabla 3: Clasificaci´on con ´arboles de decisi´on de palabras significativas y contexto, con ello se consigue relajar la dependencia de los ejemplos del corpus con respecto a estas caracter´ısticas lo que impide que afecten de forma negativa a los ejemplos del test que no las presenten. En menor medida mejoran el experimento base el refuerzo de la categor´ıa MISC, que orienta el sistema a la categor´ıa m´as dif´ıcil, y la utilizaci´on de informaci´on externa al corpus de aprendizaje. Con la combinaci´on de las tres modificaciones se alcanza un resultado similar al obtenido en el experimento inicial (tabla 1) en el que se utilizaba un modelo de Markov para reconocer y clasificar al mismo tiempo. No obstante, queda la impresi´on de que a´un hay margen de mejora ya que la suma de las mejoras obtenidas por separado con cada una de las modificaciones superar´ıa sensiblemente el resultado de la combinaci´on. Esta impresi´on quedar´a confirmada en el siguiente experimento, en el que utilizando t´ecnicas de aprendizaje m´as complejas se consigue sacar m´as partido de los datos utilizados en ´este. 4.3. Experimento 3 En este experimento se comprueba el efecto que tiene la utilizaci´on de t´ecnicas que generan distintos clasificadores a partir del mismo conjunto de entrenamientos. Se comparan los resultados obtenidos con el mejor modelo del experimento 2 en el que se utilizan ´arboles de decisi´on como modelo de aprendizaje con los obtenidos aplicando boosting ybagging. precisi´on cobertura Fβ=1 ´ Arbol 68.93 % 66.96 % 67.93 % Boosting 70.12 % 68.11 % 69.10 % Bagging 71.10 % 69.06 % 70.07 % Tabla 4: Clasificaci´on con boosting ybagging Se han obtenido mejoras en los resultados en ambos casos, lo que muestra la importancia de la elecci´on de un modelo de aprendizaje apropiado en la etapa de clasificaci´on. Esta es una de las l´ıneas que queremos explotar en el futuro, experimentando con clasificadores m´as vers´atiles como las SVM (Support Vector Machines) o las propias t´ecnicas de bagging yboosting aplicadas a clasificadores m´as simples, que se han demostrado muy ´utiles en este tipo de problemas (Carreras et al., 2002). 5. Conclusiones y trabajo futuro El sistema presentado en este trabajo constituye una primera aproximaci´on al problema de Reconocimiento de Entidades con Nombre. Los resultados obtenidos situar´ıan a nuestro sistema en la parte media del ranking de los trabajos presentados en la tarea NER de CoNLL 2002. La poca relevancia de la informaci´on externa al corpus hace que el sistema sea f´acilmente portable ante cambios de idioma y de conjuntos de categor´ıas. La divisi´on entre delimitaci´on y clasificaci´on facilita el desarrollo y la mejora del sistema, ya que permite atacar ambos problemas de forma separada usando distintas t´ecnicas. Para el problema de la delimitaci´on, los modelos de Markov se han mostrado como una t´ecnica bastante ´util, ya que con unas simples transformaciones del corpus se han obtenido unos resultados muy buenos. En la etapa de clasificaci´on el rango de t´ecnicas a utilizar es muy amplio, hemos comenzado utilizado ´arboles de decisi´on con unos resultados aceptables, pero una vez obtenida una base de datos a partir del corpus podemos experimentar con cualquier tipo de clasificador. En nuestra agenda de trabajos futuros hay muchos frentes abiertos por los que continuar nuestra investigaci´on. Con respecto a la delimitaci´on a´un se puede afinar m´as experimentando con nuevas caracter´ısticas que permitan agrupar las palabras del vocabulario mediante un criterio ling¨u´ıstico en lugar de con simples expresiones regulares. En la parte de clasificaci´on, las v´ıas de trabajo pasan por la b´usqueda de nuevas caracter´ısticas que aporten m´as informaci´on a los clasificadores y la experimentaci´on con nuevos modelos de aprendizaje. El experimento 3 ha sido un primer intento en este sentido, y nos ha abierto un camino esperanzador mostr´andonos que se puede sacar m´as partido de los mismos datos de entrenamiento eligiendo la t´ecnica de aprendizaje apropia-
da. Bibliograf´ıa Brants, T. 2000. TnT - a statistical partof-speech tagger, En Proceedings of the 6th Applied NLP Conference (ANLP00), p´aginas 224–231, Seattle, USA. Carreras, X., L. M`arquez y L. Padr´o. 2002. Named Entity Extraction using AdaBoost, En CoNLL02 Computational Natural Language Learning. Shared Task, Chinchor, N. 1998. MUC-7 Named Entity Task Definition (Version 3.5), En Message Understanding Conference Proceedings MUC-7, Fairfax, Virginia, USA. Mannig C. y H. Sch¨utze. 1999. Foundations of Statistical Natural Language Processing MIT Press. R¨ossler M. 2002. Using Markov Models for Named Entity recognition in German newspapers, En Proceedings of the Worl¡kshop on Machine Learning Approaches in Computational Linguistics, p´aginas 29–37, Trento, Italia. Tjong K. S. E. 2002. Introduction to CoNLL-2002 shared task: Languageindependent named entity recognition En Proceedings of Sixth Conference on Natural Language Learning CoNLL 2002, Taipei, Taiwan. Witten I. H. y E. Frank. 2000. Data Mining, Morgan Kaufmann Publishers. Zhou, G. y J. Su. 2002. Named Entity Recognition using an HMM-based Chunk Tagger, En Proceedings of ACL 2002, p´aginas 473-480