Full text
357Las construcciones comparativas encorpus delespañol… LAS CONSTRUCCIONES COMPARATIVAS ENCORPUS DELESPAÑOL SINTÁCTICAMENTE ANOTADOS M.ª Paula Santalla del Río/Eva M.ª Domínguez Noya Universidad de Santiago de Compostela/Centro Ramón Piñeiro para aInvestigación en Humanidades Resumen En esta exposición, tras una breve explicación de los presupuestos en que se basa la elaboración del corpus CSA yde lo que entendemos que subyace alos niveles de descripción gramatical que pueden reconocerse, se aborda el estudio de las estructuras comparativas, clasificadas en grupos apartir fundamentalmente de la Nueva Gramática de la Lengua Española (NGLE), en cuanto acomo puede variar yvaría su análisis en tres corpus sintácticamente analizados (UAM Spanish Treebank, IULA Spanish LSP Treebank yAnCora-es) ycon respecto especialmente al propio corpus CSA. De ello se concluye que, para los propósitos de la anotación de corpus yla reutilización de recursos, una reflexión conjunta que camine hacia una estandarización en el paso de un nivel de descripción no formalizado auno que sí lo esté se hace hoy necesaria. Palabras clave: Corpus, anotación sintáctica, estructuras comparativas, formalización. 1. Introducción La construcción de recursos lingüísticos, entre los que se encuentran los corpus obases de datos textuales, es fundamental en toda lengua para el avance en el procesamiento automático del lenguaje http://dx.doi.org/10.18778/8220-201-4.26
358 M.ª Paula Santalla del Río/Eva M.ª Domínguez Noya natural, pero además es también especialmente beneficiosa para profundizar en el conocimiento mismo de la lengua, porque obliga auna descripción formalizada del material analizado. La creación de CSA, un corpus sintácticamente anotado del español1, se concentró en este hecho, dado que su objetivo primordial fue la exploración en detalle del instrumento que codifica el análisis del recurso en sí. Este planteamiento nació de la observación de las repercusiones que en la elaboración de los corpus tiene la distinción entre distintos niveles de descripción gramatical: descripción gramatical, descripción gramatical comprensiva yexhaustiva, ydescripción gramatical formalizada; este último es el necesario para analizar corpus lingüísticos, pero es un nivel descriptivo que cada corpus anotado suele en la práctica alcanzar de manera independiente de los demás. Como resultado de lo anterior, se observa que la heterogeneidad de los análisis recogidos en los corpus para las mismas estructuras es con frecuencia muy amplia, lo cual dificulta enormemente la reutilización posterior de unos recursos cuyo desarrollo es muy costoso. Tal heterogeneidad es especialmente apreciable en estructuras sobre cuya descripción no hay ya de partida un acuerdo tan consensuado como para otras. A la luz de la diversidad de lo que se ha dicho de ellas, las construcciones comparativas se encuentran, precisamente, entre las que presentan mayor complejidad sintáctica de toda la gramática española. En este trabajo apartir de una clasificación de estas estructuras derivada de una serie de estudios sobre ellas (Gutiérrez, 1994; Sáez, 1999; Brucart, 2003; NGLE, 2009; Sáez, Sánchez, 2014), revisaremos cómo tales estructuras han sido tratadas en otros corpus analizados sintácticamente (el UAM Spanish Treebank [http://www.lllf.uam.es/ESP/Treebank.html, Moreno et al., 1999], IULA Spanish LSP Treebank [https://repositori.upf.edu/ handle/10230/20048, Marimon et al., 2012] yAnCora-es [http:// clic.ub.edu/corpus/es, Martí et al., 2008]), ycompararemos esos tratamientos con la presentación de cómo el sistema de anotación de CSA analiza las comparativas, todo ello con el fin de mostrar 1 http://gramatica.usc.es/proxectos/drasae/.
359Las construcciones comparativas encorpus delespañol… como, para los propósitos de la Lingüística de corpus yel Procesamiento del Lenguaje Natural, parece hoy, efectivamente, hacerse más necesario que nunca avanzar en la propuesta de estándares de descripción formal yanálisis de corpus. No podemos, pues, conformarnos en el momento actual con la difusión que de modo natural han alcanzado estándares que lo son fundamentalmente de formato, como el CoNLL, sino que se hace preciso proponer ypromocionar estándares de análisis descriptivo, para en un futuro próximo disponer de recursos plenamente reutilizables e integrables, así como producir masivamente datos que puedan servir para alimentar modelos de análisis lingüístico automático. Tras una breve explicación de los presupuestos en que se basa la elaboración del corpus CSA (apartado 2) yde lo que subyace alos niveles de descripción referidos (apartado 3), en el apartado 4, apartir de una clasificación de las estructuras comparativas basada fundamentalmente en la Nueva Gramática de la Lengua Española (NGLE), pero también en otros autores (Gutiérrez, 1994; Sáez, 1999; Sáez ySánchez, 2014), se aborda su estudio en cuanto acómo varía su análisis en tres corpus sintácticamente analizados (UAM Spanish Treebank, IULA Spanish LSP Treebank yAnCora-es) ycon respecto especialmente al propio corpus CSA. Tras todo ello, se exponen las conclusiones que cabe extraer de esta revisión. 2. El corpus CSA El corpus CSA2 contiene, por el momento, el análisis completo, llevado acabo manualmente, de una única obra: Crónica de una muerte anunciada, de Gabriel García Márquez. La anotación realizada es exclusivamente de tipo sintáctico; esto es, segmentación yasignación exhaustivas de función sintáctica ytipo de unidad atodos los segmentos identificados para cada secuencia aislada que forma parte del corpus. 2 Se puede consultar ydescargar en https://galvan.usc.es/drasae/.
360 M.ª Paula Santalla del Río/Eva M.ª Domínguez Noya 2.1. El sistema de anotación 3 Para la elaboración del sistema de anotación de CSA fueron consultados los criterios ysistemas de anotación de los ya no pocos, ypara no pocas lenguas, corpus sintácticamente analizados existentes. No hay lugar aquí para una revisión de todos ellos: nos referimos especialmente alos corpus AnCora, para español ycatalán (Taulé et al., 2008), y, apartir de ellos, alos que los inspiraron, citados en Martí et al. (2008). De manera breve, el sistema de anotación aplicado aCSA puede ser descrito apartir de las siguientes afirmaciones: a) codifica un análisis constitutivo yno dependencial, b) se sustenta en un modelo teórico constitutivo yfuncionalista, c) es exhaustivo en cuanto al reconocimiento de constituyentes yla asignación alos mismos de funciones yunidades sintácticas, d) respeta estrictamente el carácter presencial yel orden secuencial de los constituyentes reconocidos, ye) siendo consistente en la anotación del mismo hecho ode hechos parcialmente semejantes alo largo del corpus, es lo más simple posible yse propone resultar familiar asus posibles usuarios recurriendo alas tradiciones descriptivas más ampliamente reconocidas (NGLE). Con tales premisas, CSA se analiza con un tagset de 42 etiquetas funcionales y32 estructurales, apoyadas por tres recursos adicionales de representación: sangrado y/o dígitos de nivel (para la representación de la jerarquización), coindización de elementos al margen de la jerarquización (para elementos funcionales más allá del segmento en el que se analizan) ynumeración romana de constituyentes interrumpidos por otros constituyentes al mismo nivel4. Así, en CSA cada secuencia analizada es un árbol tradicional, solo que dispuesto verticalmente. En cada línea horizontal se identifica un segmento resultado de la progresiva segmentación de la secuencia analizada, yse le asigna aese segmento una unidad yuna función. Sangrado yun dígito que identifica el nivel de 3 Para más detalles remitimos alo ya presentado aeste respecto en Santalla (2012). 4 Se puede consultar en https://gramatica.usc.es/wiki/drasae.
361Las construcciones comparativas encorpus delespañol… profundidad alcanzado hasta ese punto en el análisis representan la jerarquización. La visualización del análisis de una secuencia en la aplicación PaME es la que vemos en la figura 1: muy amigable para el usuario yen la que solo los atributos del PREDICADO quedan ocultos, ala espera de que se pose sobre dicha función sintáctica el puntero del ratón para que emerja un cuadro con sus características: Figura 1. Análisis en CSA de Tampoco Santiago Nasar reconoció el presagio 3. La descripción lingüística yla anotación lingüística Aunque la segunda de estas operaciones, asociada al desarrollo de corpus lingüísticos en formato electrónico yde reciente aparición, se lleva acabo sobre la base de fundamentos que ha sentado la primera alo largo de su ya prolongada historia, una yotra son operaciones muy distintas, cuyas respectivas prácticas de trabajo son en consecuencia también diferentes. Esta diferencia, unida ala circunstancia de que la descripción ala que pueden acceder quienes anotan no se proporciona siempre en el nivel de desarrollo por
362 M.ª Paula Santalla del Río/Eva M.ª Domínguez Noya esta operación requerido, está en la base de la heterogeneidad de los variados análisis codificados por los anotadores para las mismas estructuras en distintos corpus lingüísticos. Estos hechos, que comprobaremos para las estructuras comparativas en el apartado sucesivo, se derivan de los condicionamientos, relacionados con el contexto en el que se desenvuelven esos procesos, que determinan las actividades de descripción yanotación lingüística. Así, mientras la anotación es una actividad que se enfrenta atexto real yha de analizarlo exhaustiva ysecuencialmente, la descripción es una operación que, sobre la base de una clasificación previa de los hechos lingüísticos, se focaliza sucesivamente en los que describe, haciéndolo de tal manera que incluso los ejemplos con los que se ilustran esos hechos, que no siempre son de texto real, se describen solo con respecto alos que se pretende que ilustren (sin describir lo que tienen asu alrededor)5. Por otro lado, además de lo anterior, tenemos que tener presente que, contemplada globalmente, la descripción lingüística en la que se basan quienes anotan puede encontrarse en distintos niveles de desarrollo. Puede ser un conjunto de descripciones parciales, en documentos distintos ycada una sobre un fenómeno concreto, que se analiza más omenos en profundidad (con suerte utilizando presupuestos semejantes), opuede ser una descripción comprensiva, general yen un único documento, que analiza cada fenómeno con menor detalle, pero más homogéneamente en relación con otros fenómenos considerados. El estadio de desarrollo en el que se cuenta con gramáticas descriptivas comprensivas ydetalladas (como la NGLE) facilita enormemente el trabajo de diseño yaplicación de un sistema de anotación, pero se necesita ir aún más allá para, incluso sobre la base de estas descripciones, anotar corpus lingüísticos: la descripción tiene que estar formalizada, esto es, tiene que haber sido reducida 5 Una muestra de la insuficiencia con la que la descripción sirve ala anotación es la falta de atención que la primera presta ala integración, ineludible en la anotación, de lo discursivo en lo sintáctico (¿dónde se ubica, por ejemplo, en el análisis sintáctico codificado en un corpus un conector discursivo?).
363Las construcciones comparativas encorpus delespañol… auna notación limitada de etiquetas categoriales y/o funcionales representable gráficamente por medio de unos recursos también limitados. Aparte del hecho de que pueden remitirse amarcos teórico-descriptivos distintos (algo que es difícil de salvar), incluso cuando se remiten al mismo, del hecho de que cada grupo que desarrolla un corpus formaliza independientemente de los demás la descripción más omenos tradicional de la que parte, surgen las diferencias entre corpus anotados, yde manera más acusada, por la más amplia naturaleza de los fenómenos tratados, las diferencias entre corpus sintácticamente anotados. Ilustramos esas diferencias en el apartado siguiente, apartir del análisis que de las estructuras comparativas algunos corpus sintácticamente analizados yespecialmente el corpus CSA han codificado, basándose para ello en tradiciones descriptivas que se reconocen como comparables. 4. Las estructuras comparativas Las construcciones comparativas están, en opinión de muchos especialistas, entre las que presentan mayor complejidad sintáctica de toda la gramática española. No todos los gramáticos reconocen, al menos explícitamente, como comparativas el mismo conjunto de estructuras, pero todos consideran tales al menos, de entre las que se han llamado tradicionalmente de grado, alas constituidas en torno amás/menos… que/de ytanto/a/os/as/tan… como. En ellas nos centramos acontinuación. 4.1. Comparativas de grado Si bien, grosso modo, hay acuerdo ala hora de clasificarlas semánticamente en función de los cuantificadores que las componen, distinguiendo entre comparativas de igualdad, superioridad
364 M.ª Paula Santalla del Río/Eva M.ª Domínguez Noya einferioridad (estos dos últimos tipos englobados en las comparativas de desigualdad), oen función de la magnitud comparada, según la cual, dependiendo de la clase de palabra ala que modifique el cuantificador comparativo, se establece la existencia de comparativas de grado cualitativas (con adjetivos yadverbios) ycomparativas de grado cuantitativas (con sustantivos), incluso con respecto aeste primer grupo de comparativas, sigue sin haber todavía una propuesta de análisis sintáctico integral que dé cuenta de ellas. Es cierto que, con algunas diferencias relativas aelementos más bien secundarios, reconocidos ono por unos u otros, y, sobre todo, con diferencias terminológicas, más omenos todos los gramáticos reconocen en estas comparativas (en términos de la NGLE) un primer término de la comparación, un grupo cuantificativo yun segundo término de la comparación ocomplemento comparativo. Pero también es cierto que ninguno de esos gramáticos alcanza un consenso general con el resto, más allá de ese punto de la descripción, sobre detalles ulteriores de la misma. Ymenos aún se produce el consenso en cuanto ala formalización, que ni siquiera se plantean en la mayor parte de los casos, de las estructuras en cuestión. ¿Cómo hemos formalizado nosotros ese consenso descriptivo, ylo que va más allá de él, en la anotación de CSA? Seleccionamos, para los propósitos de esta exposición, tres ejes de variación observados en las descripciones revisadas yen los corpus examinados, yvemos primero que en CSA los tratamos, como se evidencia en el análisis de la figura 2, del modo siguiente: i) reconocemos como estructura comparativa (con la etiqueta correspondiente) al grupo cuantificador yal segundo término, dejando fuera el primero; ii)reconocemos una posible construcción verbal (una cláusula) en el segundo término; iii) entendemos que el segundo término modifica al grupo cuantificativo yno solo al cuantificador.
365Las construcciones comparativas encorpus delespañol… Figura 2. Análisis en CSA de Ella no estuvo entonces tan segura como la primera vez Así, respecto a i) la Estructura comparativa (utilizamos ahora las denominaciones de las etiquetas de CSA) abarca al segmento tan segura como la primera vez y deja fuera al primer término de la comparación (entonces). Con respecto a ii), el 2.º TÉRMINO está constituido por un Fragmento, una denominación que corresponde, en este caso, a una cláusula (construcción verbal) en la que falta el verbo (pero en la que seguimos teniendo dos funciones clausales, dos instanciaciones de COMPLEMENTO CIRCUNSTANCIAL). Con respecto a iii), el 2.º TÉRMINO se encuentra al nivel jerárquico del segmento tan segura, con el que constituye la Estructura comparativa, y no al de tan, en conjunción con el cual se encontraría al nivel de segura y constituiría la Estructura comparativa en un análisis que ligara el segundo término al cuantificador y no al grupo cuantificativo. ¿Qué sucede, en cambio, en otros corpus sintácticamente analizados? En el corpus UAM Spanish Treebank se identifican estructuras comparativas de esta clase (no siempre del mismo modo) con los elementos comparativos grupo cuantificativo y segundo término, y con un segundo término que se relaciona con el grupo cuantificativo, pero no se reconoce consistentemente el carácter de construcción verbal de ese segundo término. Así en Y augura el advenimiento de una era de ordenadores [que]1.º térm.
372 M.ª Paula Santalla del Río/Eva M.ª Domínguez Noya cada uno asu manera. Quizá deberíamos reflexionar, sobre todo, las instituciones con más recursos para ello, sobre lo mucho que lo señalado perjudica al intercambio yala reutilización de unos recursos tan costosos de producir como son los corpus anotados, yproponernos alcanzar un mayor grado de formalización, al menos para propósitos como la elaboración de corpus, en las descripciones que desarrollamos. 6. Agradecimientos Trabajo financiado por la Xunta de Galicia, proyecto DRASAE (10PXIB204269PR). Esta investigación ha podido también beneficiarse de la financiación FEDER/Ministerio de Ciencia, Innovación yUniversidades – Agencia Estatal de Investigación/ ESLORA+ (FFI2017-86379-P). M.ª Paula Santalla forma asimismo parte del grupo Gramática del Español de la Universidad de Santiago de Compostela, beneficiario de una ayuda para «Consolidación eestruturación de Grupos con Potencial de Crecemento 2017» de la Consellería de Cultura, Educación e Ordenación Universitaria de la Xunta de Galicia (ED431B 2017/39). Referencias bibliográficas Brucart, J. M.ª (2003), “Adición, sustracción ycomparación: un análisis composicional de las construcciones aditivo-sustractivas del español”, en F. Sánchez (ed.), Actas del XXIII Congreso Internacional de Lingüística yFilología Románica, Tübingen: Niemeyer, 11–60. Gutiérrez, S. (1994), Estructuras comparativas, Madrid: Arco/Libros. Marimon, M., Fisas, B., Bel, N., Arias, B., Vázquez, S., Vivaldi, J., Torner, S., Villegas, M., Lorente, M. (2012), “The IULA Treebank”, en Proceedings of the Eight International Conference on Language Resources and Evaluation (LREC‘12), Estambul: European Language Resources Association (ELRA), 1920–1926.
373Las construcciones comparativas encorpus delespañol… Martí, M.ª A., Taulé, M., Bertran, M., Màrquez, L. (2008), AnCora: AMultilingual and Multi-level Annotated Corpus,[en línea] <https://www.researchgate.net/publication/228349954_Ancora_Multilingual_and_multilevel_annotated_corpora/download>, [fecha de consulta: 19/11/2018]. Moreno, A., López, S., Sánchez, F. (1999), Spanish Tree Bank: Specifications, Version 5 (30 April 1999), [en línea] <http:// www.lllf.uam.es/ESP/Treebank.html>, [fecha de consulta: 19/11/2018]. Real Academia Española (2009), Nueva gramática de la lengua española. Morfología ysintaxis, Madrid: Espasa Calpe. Real Academia Española (2010), Nueva gramática de la lengua española. Manual, Madrid: Espasa Calpe. Sáez, L. Á. (1999), “Los cuantificadores: las construcciones comparativas ysuperlativas”, en I. Bosque yV. Demonte (eds.), Gramática descriptiva de la lengua española, Madrid: Espasa Calpe, 1129–1188. Sáez, L. Á., Sánchez, C. (eds.) (2014), Las construcciones comparativas, Madrid: Visor. Santalla, M.ª P. (2012), “La elaboración de un sistema de anotación sintáctica. Algunos problemas relacionados con el tratamiento de la coordinación que implica averbos”, en T. Jiménez Juliá, B.López Meirama, V. Vázquez Rozas yA. Veiga (eds.), Cum corde et in nova grammatica. Estudios ofrecidos aGuillermo Rojo, Santiago de Compostela: Universidade de Santiago de Compostela, 771–790. Taulé, M., Martí, M.ª A., Recasens, M. (2008), “AnCora: Multilevel Annotated Corpora for Catalan and Spanish”, en N. Calzolari, K. Choukri, B. Maegaard, J. Mariani, J. Odjik, S. Piperidis yD.Tapias (eds.), Proceedings of the Sixth International Conference on Language Resources and Evaluation (LREC’08), Marrakech, 96–101.