scieee AI-readable full text Open interactive document viewer

Corpus-Driven Analysis of Multi-Word Terms Including the Word ‘Risk’ in English, French and Lithuanian

Oksana Smirnova; Sigita Rackevičienė

Abstract

ANGLŲ, PRANCŪZŲ IR LIETUVIŲ KALBŲ DAUGIA ŽODŽIŲ TERMINŲ SU ŽODŽIU RIZIKA ANALIZĖ TEKSTYNŲ LINGVISTIKOS METODAIS    Straipsnyje pristatomi deskriptyviosios terminologijos tyrimo principai bei empirinis daugiažodžių terminų su žodžiu rizika tyrimas, kurio tikslas – taikant tekstynų lingvistikos metodus, surinkti terminus iš ES finansų srities dokumentų tekstynų ir atlikti jų formaliosios sandaros analizę.    Tyrimo tikslams buvo sukaupti keturi tekstynai: finansų srities dokumentų anglų kalba (802 933 žodžiai), prancūzų kalba (940 655 žodžiai) ir lietuvių kalba (639 279 žodžiai) bei lygiagretusis anglų–prancūzų–lietuvių kalbų tekstynas. Iš tekstynų surinkta 210 terminų, kuriuose žodis rizika eina pagrindiniu dėmeniu: 70 angliškų terminų ir po tiek pat jų atitikmenų prancūzų ir lietuvių kalbomis. Žodžio rizika pasirinkimą lėmė tai, kad šis žodis buvo dažniausias visų trijų kalbų tekstynuose.    Terminų atpažinimui ir surinkimui buvo naudojamos dvi kompiuterinės progra-mos – AntConc ir AntPConc. Dirbta tokiais etapais:    • dažniausių žodžių, galinčių būti terminų branduoliu, angliškame, prancūziškame ir lietuviškame tekstynuose nustatymas ir vieno iš jų (žodžio rizika) atrinkimas tolesnei analizei;    • žodžio rizika kolokacijų ir daiktavardinių junginių su pagrindiniu dėmeniu rizika ir jo kairiaisiais bei dešiniaisiais kolokatais nustatymas angliškame tekstyne;    • daiktavardinių junginių, laikytinų daugiažodžiais terminais, atrinkimas;    • atrinktų angliškų terminų prancūziškų ir lietuviškų atitikmenų nustatymas.    Pritaikyta metodologija leido rezultatyviai surinkti daugiažodžius terminus iš daugiakalbių tekstynų. Tai duoda pagrindą teigti, kad ji gali būti taikoma terminų kaupimui bei tyrimams.    Surinktų terminų formaliosios sandaros analizė atskleidė keletą svarbių terminų darybos tendencijų tiriamose kalbose:    • vyraujantis terminų tipas pagal dėmenų skaičių visose trijose tiriamose kalbose yra dvižodžiai terminai; tai rodo, kad ES terminų kūrėjai laikosi kalbos ekonomijos principo ir stengiasi kurti kuo trumpesnius daugiažodžius terminus;    • tik keletas angliškų ir prancūziškų terminų turi daugiau kaip 2–3 dėmenis; tuo tarpu lietuviški terminai, susidedantys iš 4 ir daugiau dėmenų, sudaro beveik ketvirtadalį surinktų terminų;    • anglų ir lietuvių kalbų terminų darybos modeliuose vyrauja prepozicinė ir post­ pozicinė modifikacija, o prancūzų kalbos – postpozicinė modifikacija;    • daugumos anglų ir lietuvių kalbų terminų priklausomieji dėmenys yra daiktavardžiai ir būdvardžiai, o prancūzų kalboje – prielinksninės konstrukcijos.    Formaliosios sandaros analizės rezultatai suteikia informacijos, kuri gali būti naudinga terminų kūrėjams ir vertėjams. Tyrimo metu nustatyti sintaksinių struktūrų modeliai gali būti taikomi, kuriant kompiuterinius lingvistinius metodus automatiniam terminų atpažinimui be iš anksto pasirinktų raktinių žodžių.

Full text

8 Oksana Smirnova Análisis impulsado por el corpus de los términos de varias Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian palabras, incluido el análisis impulsado por el corpus de las palabras múltiples Términos que incluyen la palabra "Risk" en inglés, francés y lituano OKSANA SMIRNOVA Universidad Mykolas Romeris, Lituania SIGITA RACKEVIČIENĖ Universidad Mykolas Romeris, Lituania PAZAS clave: terminología descriptiva, análisis basado en corpus, términos financieros, extracción de términos, patrones de formación de términos 1. INTRODUCCIÓN (véase también la sección "Introducción"). Las tecnologías computacionales han abierto nuevas posibilidades a la investigación lingüística: los corpora digitales y el software de análisis de corpus han facilitado el acceso a las estructuras lingüísticas más profundas y a las relaciones entre las diferentes unidades lingüísticas y han revelado peculiaridades de su uso en diferentes dominios durante diferentes períodos de tiempo. Por lo tanto, el análisis impulsado por corpus del lenguaje natural se aplica hoy en día en una amplia gama de áreas lingüísticas: lexicografía, enseñanza de idiomas, desarrollo de la traducción automática, compilación de bases de datos lingüísticas, etc. La investigación terminológica también se ha vuelto en gran medida impulsada por el corpus. Los corpus digitales permiten a los terminólogos trabajar con una gran cantidad de documentos, observar características particulares de un lenguaje especializado, recopilar información sobre el uso real de los términos y su evolución, capturar nuevos términos que no podrían sentirse o predecirse intuitivamente, así como llevar a cabo análisis contrastivo de datos de varios idiomas. El software de análisis de corpus, las herramientas de extracción automática y semiautomática de términos también contribuyen a la estandarización de la terminología, por ejemplo, el recuento de frecuencia de sinónimos puede proporcionar evidencia distributiva útil que indica términos nologists to revise terminographical information about terms in existing estadísticamente preferidos (Khurshid, Rogers 1992: 36). Por lo tanto, los corpora digitales permiten las bases de datos de términos y las actualizan constantemente. 8Terminología | 2018 | 25 According to M. Teresa Cabré, M. Amor Montané and Rogelio Nazar, El objetivo de la terminología moderna es producir descripciones formales, semánticas y funcionales de unidades léxicas que tengan valor to explain their relation with the rest of the units of the linguistic system. terminológico, así como el objeto de la investigación terminológica es la terminología viva (terminología que ocurre naturalmente en textos especializados) y el aspecto comunicativo del uso de los términos que se instancia mejor en un corpus (Cabré, Montané, Nazar 2012). El objetivo, el objeto y los objetivos de la investigación. El objetivo de la investigación es aplicar la metodología de la lingüística de corpus para la extracción y el análisis de la estructura formal de términos financieros de varias palabras, incluida la palabra "riesgo" como sustantivo principal en inglés, francés y lituano. Para lograr este objetivo, se fijaron los siguientes objetivos: 1) analizar los principios de la terminología descriptiva impulsada por el corpus, incluidos los métodos de análisis de colocación y coligación; 2) recopilar corpora de los actos jurídicos de la UE en el ámbito financiero en tres idiomas (inglés, francés y lituano) y seleccionar el software adecuado para la investigación basada en el corpus; 3) extraer las palabras más frecuentes de los corpus en las lenguas investigadas y seleccionar la palabra clave (substantivo) más frecuente para el análisis posterior; 4) realizar un análisis de colocación de la palabra clave seleccionada en el corpus inglés y extraer términos de varias palabras, incluida la palabra clave seleccionada como cabeza semántica y sintáctica de términos del corpus inglés. material del corpus en inglés; 5) establecer equivalentes franceses y lituanos de los términos ingleses seleccionados en el corpus paralelo inglés-francés-lituano; 6) realizar un análisis cuantitativo de la estructura formal de los términos polivalentes seleccionados y determinar qué patrones de modificación y estructuras sintácticas de los términos son predominantes en las lenguas investigadas. Datos y alcance de la investigación. A los efectos de la investigación, tres four corpora of the EU documents of financial domain were compiled: corpus monolingües (inglés, francés y lituano) y un corpus paralelo (EN-FR-LT). Los tamaños de los corpora son los siguientes: EN 802 933 palabras, FR 940 655 palabras, LT 639 279 palabras. En total, se han concedido 210 ayudas financieras. 8 Oksana Smirnova Análisis impulsado por el corpus de términos de varias Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian palabras, incluidos los términos generales, incluida la palabra "riesgo" como sustantivo principal, extraídos de los corpus: 70 términos en inglés y sus equivalentes en francés y lituano. La elección de la palabra "riesgo" fue determinada por los datos del corpus que revelaron que esta palabra era la más frecuente en los documentos de la UE seleccionados. 2. Principios teóricos de la investigación 2.1 Gestión de la terminología prescriptiva y descriptiva La evolución de las tecnologías computacionales para la investigación del lenguaje natural diferenció claramente la terminología tradicional de la moderna. La actitud de los terminólogos hacia la concepción de un término, las fuentes de términos, la estandarización de términos y otras cuestiones siderably. Two directions of terminology research and management have terminológicas ha cambiado con la distinción: terminología prescriptiva y terminología descriptiva (Zeller 2005; Bielinskienė et al. 2015). Los defensores de la terminología prescriptiva se centran en la estandarización de la terminología basada en diccionarios de terminología, bases de datos, listas de terminología aprobada y documentos sobre principios de estandarización. En la terminología prescriptiva, la concepción de un término se basa en el lugar del concepto, descrito por él, en el sistema jerárquico conceptual del dominio y su relación con otros conceptos (Pearson 1998: 10; Marcinkevičienė 2000: 6). De acuerdo con los principios de la terminología prescriptiva, un término debe usarse para describir un concepto, ya que tal reciprocidad reduce la probabilidad de ambigüedad, facilita la comunicación y, simultáneamente, el desarrollo del sistema jerárquico conceptual de un dominio. Los terminólogos descriptivos se distancian de la actitud estricta hacia la concepción de términos, la no ambigüedad de términos, el desarrollo de un sistema conceptual jerárquico y la estandarización. En la terminología descriptiva, al contrario de la prescriptiva, un contexto juega un papel vital en el análisis de un término, y un término se asume como una unidad léxica dependiente de su contexto. Su objetivo no es formar un término de acuerdo con ciertos principios, sino registrar su uso, la variedad de sus formas en diferentes textos y describir sus peculiaridades, formando así una base para su estandarización (Bielinskienė et al. 2015: 10[…]11). El desarrollo de las tecnologías dio lugar a un enorme flujo de información presentada en varios tipos de textos y, al mismo tiempo, a un número cada vez mayor de términos utilizados en ellos. En esta realidad en constante cambio, el término 9Terminologija | 2018 | 25 Los nólogos ya no son capaces de controlar el rápido desarrollo de la terminología a medida que los términos cambian más rápido de lo que se procesan. Por lo tanto, la gestión de la terminología requiere un enfoque más flexible basado en la descripción en lugar de en la metodología de prescripción. El enfoque ha pasado de la estandarización de la terminología al análisis de la terminología en los corpora (Bielinskienė y otros 2015: 11). La terminología descriptiva condujo al desarrollo de la Teoría Comunicativa de la Terminología, que se centra en la terminología viva que se utiliza en discursos especializados y pone el énfasis en el aspecto comunicativo del uso de los términos (Cabré, Montané, Nazar, 2012). Según esta teoría, el papel principal de los términos es comunicar el conocimiento experto; Por lo tanto, se conciben como un poliedro triplo que tiene un componente cognitivo (el concepto), un componente lingüístico (el término) y uno comunicativo (la situación) (Cabré, Montané, Nazar 2012: 1). Los estudios terminológicos basados en la teoría comunicativa no solo están interesados en la terminología establecida por las normas o encontrada en las bases de datos oficiales, sino también (y particularmente) en los términos que se utilizan realmente en los textos de la lengua para propósitos específicos. Por lo tanto, la teoría comunicativa […]no solo adopta un enfoque in vitro, sino que también está interesada en términos in vivo[…] (Cabré, Montané, Nazar 2012: 1[…]2). La investigación de la terminología viva revela que la noción tradicional de univocidad de términos (correspondencia uno a uno entre un concepto y términos particulares en diferentes idiomas) no está bien fundada en el lenguaje real. La variación (sinonimia, ambigüedad, perifrasas, redundancia) es característica no sólo de las unidades lingüísticas generales, sino también de la terminología; Por lo tanto, los conceptos y términos deben estudiarse "en su interacción dinámica" (Cabré, Montané, Nazar 2012: 2 […]3). El enfoque en el uso de los términos ha hecho de los corpora el principal espacio de trabajo del análisis terminológico moderno. El software de análisis de corpora digitales y corpus han mejorado la terminología con ricos recursos y herramientas que permiten a los terminólogos extraer términos de una gran cantidad de documentos, capturar los cambios más recientes en la terminología de un dominio específico, analizar su evolución, así como establecer interconexión conceptual entre términos del mismo dominio. Corpora permite obtener información confiable, basada en estadísticas, previamente totalmente no disponible sobre el uso de términos en el lenguaje natural. Por lo tanto, la metodología impulsada por el corpus se ha convertido en la metodología predominante que proporciona un conjunto de herramientas indispensables para la investigación y la gestión de la terminología (Zeller 2005; Cabré, Montané, Nazar 2012; Bielinskienė et al. 2015). 9 0 Oksana Smirnova Análisis impulsado por el corpus de términos de varias palabras, incluido Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian 2.2 Principios de análisis impulsado por el corpus: métodos de colocación y coligación La extracción y el análisis de la terminología impulsada por el corpus se realizan utilizando métodos estadísticos y lingüísticos. En la investigación dada se aplican métodos de colocación y coligación. Collocations refer to syntagmatic attraction between lexical units. AcSegún Tomas Lehecka (2015), "el concepto de colocación se basa en la noción de que cada palabra en una lengua prefiere ciertos contextos léxicos sobre otros, es decir, que cualquier palabra dada tiende a co-ocurrir con ciertas palabras con más frecuencia que con otras" (Lehecka 2015: 2). El análisis estadístico de los datos del corpus se utiliza para medir el grado de atracción entre las palabras, sus resultados permiten determinar qué combinaciones de palabras aparecen juntas significativamente más a menudo de lo que se esperaría por casualidad dada la frecuencia total de las palabras en el corpus (Lehecka 2015: 2). De esta manera se establecen las colocaciones más significativas de las palabras elegidas en el corpus analizado. Este método se utiliza principalmente para el análisis semántico contextual de las unidades léxicas, ya que permite observar toda la variedad de palabras co-ocurrentes de las palabras investigadas, establecer los patrones de co-ocurrencia predominantes y, por lo tanto, describir sus significados en función de su entorno contextual (Atkins, Rundell, Sato 2003: 340 […] 341). El análisis colocacional se ha convertido en una herramienta indispensable para los lexicógrafos, también se aplica ampliamente en la lingüística computacional con fines de traducción automática, procesamiento de lenguaje natural y otras áreas (Lehecka 2015). El método colocacional se utiliza a menudo en combinación con el método coligacional. El concepto de coligación se refiere a la atracción de una unidad léxica y un patrón gramatical y se basa en la noción de que las palabras prefieren usarse en ciertos patrones gramaticales y evitan otros patrones gramaticales (Sinclair 1998; Lehecka 2015). El análisis extended and encompass the relationship between the lexical unit and coligativo puede ser la posición en una frase, cláusula, oración, texto o discurso donde se puede usar la unidad léxica (Hoey 2005: 49 […] 52). El análisis coligativo se ha empleado ampliamente en combinación con estudios collocational analysis to study the meanings of near-synonyms as corpus lingüísticos que han revelado que a menudo se utilizan en diferentes contextos léxicos y gramaticales (Lehecka 2015). Investigaciones lingüísticas de corpus 9 1Terminología | 2018 | 25 patrones de colocación y coligación ferentes (Aston, have shown that even different senses of polysemous words may have difBurnard 1998). Por lo tanto, los análisis de colocación y coligación han demostrado que la semántica y la gramática no deben tratarse como independientes, sino que deben tenerse en cuenta en los análisis como interconnected systems (Lehecka 2015). pragmatic aspect should also be colocación y coligación y diferentes tipos de textos (Butler 2004: 157; Newman, preferences of a lexical unit vary significantly between different domains Rice 2006). 2.3 Aplicación del método de colocación-coligación en la extracción y el análisis de terminología El método de colocación-coligación también puede utilizarse para la extracción de términos de varias palabras; es especialmente apropiado para la extracción de terminología, incluidas palabras clave preseleccionadas […] palabras de potencial relevancia terminológica características del dominio al que pertenece el corpus. Esta metodología se basa en el supuesto de que los términos complejos están hechos de términos simples existentes (Nakagawa 2001). Las herramientas de análisis de corpus extraen palabras co-ocurrentes de las palabras clave preseleccionadas y permiten establecer las colocaciones dominantes. Una parte de estas colocaciones son frases sustantivas que tienen que ser seleccionadas de las listas de colocación utilizando métodos lingüísticos. Las frases de sustantivos seleccionadas se utilizan para un análisis adicional de los datos del corpus y la extracción de términos de varias palabras que consisten en las frases de sustantivos seleccionadas y potencialmente de colocados adicionales. En la investigación dada, los términos extraídos se analizan más a fondo utilizando principios de análisis de coligación que buscan revelar modelos de estructura formal de la terminología en las lenguas investigadas y contribuir a estudios multilingües contrastantes de patrones de formación de términos (véase Janulevičienė, Rackevičienė 2014; Mockienė 2016). 3.Desarrollo de la corporación y la selección El propósito de la compilación de un corpus de documentos de un dominio According to M. Teresa Cabré, M. Amor Montané and Rogelio Nazar, específico es triple. En primer lugar, los terminólogos deben familiarizarse con la extracción de la minología de tipos y realizar análisis of language of the domain; secondly, a corpus is needed to perform terestadísticos de los términos; y 9 Oksana Smirnova Análisis impulsado por corpus de términos de varias Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian palabras Incluyendo finalmente, los textos se utilizan para obtener información complementaria sobre los términos como pistas semánticas, sintácticas o de colocación (Cabré, Montané, Nazar 2012: 3[…]4). El corpus compilado debe ser de tamaño y calidad suficientes para ser considerado representativo del dominio elegido. No hay requisitos precisos para el tamaño de un corpus; pero debe contener tantos documentos como sea posible porque cuanto más grande sea, se pueden sacar conclusiones más confiables sobre el uso de la terminología en el dominio (Cabré, Montané, Nazar 2012: 4). Teniendo en cuenta todos estos aspectos, se recopilaron los corpus de los actos jurídicos de la UE en inglés, francés y lituano. Los actos jurídicos se descargaron del Diario Oficial de la Unión Europea, que es una fuente en línea de libre acceso. Se recopilaron 101 actos jurídicos relativos a cuestiones financieras de la UE promulgados en el período 2014-2017. Los documentos se transformaron en texto sin formato y se alinearon para la extracción de términos y su análisis. Se utilizaron tres programas para compilar, alinear los textos y extraer los datos necesarios de ellos: AntConc (2014), AntPConc (2017) creado y certificado por Laurence Anthony y NOVA Text Aligner (2014). AntConc es un kit de herramientas multiplataforma de software gratuito para llevar a cabo investigación lingüística de corpus y aprendizaje basado en datos, mientras que AntPConc está destinado a crear un corpus paralelo de varios idiomas. Ambos programas permiten al investigador tratar con una gran cantidad de datos y llevar a cabo un análisis lingüístico multilingüe integral. Las herramientas que se proporcionan a los usuarios por el programa AntConc son las siguientes: Lista de palabras, Colocados, Clusters, Palabras clave, Concordancia, Trama de concordancia, herramienta de vista de archivos. En la investigación dada se aplicaron cuatro herramientas de AntConc: • Lista de palabras que permite determinar las palabras más frecuentes en los corpus; • Collocates enabled to determine the dominant collocates of the palabra "riesgo" y medir el grado de su atracción sintagmática por la palabra "riesgo"; • Se permitió a los grupos divulgar los términos polivalentes más dominantes, incluida la palabra "riesgo" como sustantivo principal; • Concordances gave a wide variety of samples illustrating the usage de los términos en los textos. La instantánea del programa AntConc se presenta en la Figura 1. 9Terminología | 2018 | 25 Antes de compilar un corpus paralelo, los textos descargados en tres idiomas se alinearon manualmente con la ayuda del programa NOVA Text Aligner. Después de la alineación de los textos, se construyó un corpus paralelo utilizando el programa AntpConc (véase la figura 2). Figura 2 El importe de la ayuda es el importe de la ayuda. Programa AntPConc (en inglés) Figura 1 El importe de la ayuda es el importe de la ayuda. Programa AntConc (en inglés) 9 Oksana Smirnova Análisis impulsado por corpus de términos de varias Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian palabras, incluido el programa AntpConc, permitió exponer los ejemplos de tres idiomas al mismo tiempo: uno podía hacer clic en una frase elegida para ver los equivalentes en otros idiomas. El programa también permitió distinguir las palabras clave y sus colocaciones a la izquierda o a la derecha mediante el uso de diferentes colores. Sin embargo, no fue posible ver el documento del que se extrajo el ejemplo. Utilizando el corpus paralelo, se extrajeron los equivalentes franceses y lituanos de 70 términos ingleses. 4. Análisis del cuerpo y extracción de términos Las herramientas de los programas AntConc y AntpConc 4.1 Establecimiento de las palabras más frecuentes en los corpus Para determinar las palabras más frecuentes en el corpus de los documentos financieros, se utilizó la herramienta Word list del programa AntConc. Proporcionó los resultados de la frecuencia de las palabras en los corpora ingleses, franceses y lituanos, lo que permitió comparar las frecuencias de las palabras en los idiomas investigados y elaborar una lista trilingüe de las diez palabras más frecuentes (véase el cuadro 1). La lista de palabras también proporcionaba información sobre el número de tokens de palabras y tipos de palabras que había en los corpora y daba acceso al contexto en el que se utilizaban los términos (véase el cuadro 1). Cuadro 1. Las 10 palabras más frecuentes en los corpora (corpus en inglés) 802 933 palabras 279, fichas, 933 palabras) tipos de palabras FR (corpus 940 655 tokens de palabras, 12365 tipos de palabras) LT (corpus 639 24727 tipos de 1. riesgo (3252), riesgo (592) riesgos riesgo (2855), riesgo (997) (536), rizikai (2549), riesgo (1063), (355), rizikas (4) 2. créditos (3183), créditos (3307), (222) (29), créditos (28), créditas (8), créditos (3103), créditos (52), créditos (6), créditos (4), créditos créditos de crédito (18) créditos (3), créditos (2) 3. mercado (1643), mercado marchas (484) (229), rinkoje (1631), mercados (1355), rinkų (226), rink (76), rinkose (75), (310), mercados de rinca (424) rinkai (51), rinkoms (182), rinkas (7), rinkomis (2) 101Terminología | 2018 | 25 Cuadro 6. Estructuras sintácticas de los patrones de modificación postnominales de los términos Estructuras sintáticas EN FR LT Riesgo […] + págs 13 términos, por ejemplo: riesgo para el sistema concentración, riesgo de términos, por ejemplo: 22 riesgo de la institución, financiero, riesgo de pérdida, riesgo de modelo riesgo de crédito, […] riesgo + A riesgo 20 términos, por ejemplo: : intradiurno, riesgo específico riesgo interno, "Riesgo + A + riesgo específico de pp 4 términos, por ejemplo: : correlación, riesgo correlación, riesgo general de correlación significativo de riesgo […] + pp + A […]15 términos, por ejemplo: […] riesgo de crédito diario, riesgo sur matière première riesgo de crédito específico riesgo + + pp risque de crédit pp + A + 9 términos, por ejemplo: : […] intrajournalier a intrajournalier a las risque de liquidité 24 horas las 24 horas, Diagrama 1 El diagrama 1 es el diagrama 1 del diagrama 1. Modelos de modificación de los términos 102 Oksana Smirnova Análisis impulsado por corpus de términos de varias Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian palabras que incluyen Los resultados muestran que la modificación prenominal es dominante en las lenguas inglesa y lituana, mientras que la modificación postnominal es característica de la lengua francesa. No se detectaron found in French, and no terms of postnominal modification patterns were términos de patrón de modificación prenominal en lituano. Sólo los términos number of terms with postnominal modifiers is rather low. ingleses eran de ambos tipos, aunque todos los términos investigados incluyen uno o varios modificadores que son sustantivos, adjetivos o frases prepositivas que ocupan diferentes posiciones en las unidades terminológicas. Los resultados del análisis revelan que los modificadores dominantes de los términos en inglés y lituano son los sustantivos y los adjetivos, mientras que en los términos en francés la palabra "risk" se modifica principalmente por frases prepositivas. Los términos que incluyen tres o más palabras pueden clasificarse aún más de acuerdo con sus niveles de modificación (términos que incluyen modificadores que modifican el sustantivo principal y términos que incluyen modificadores que modifican otros modificadores), pero, debido al espacio limitado, este análisis no se presenta en este documento. Los resultados resumidos en los cuadros también revelan que los términos difieren en el número de sus constituyentes. Se realizó el análisis cuantitativo de la longitud del término para establecer el número dominante de constituyentes del término en los idiomas investigados; sus resultados se presentan en el diagrama 2. El diagrama revela dos tendencias principales. En primer lugar, los desarrolladores de términos de la UE respetan el requisito principal de la economía lingüística (brevedad de términos): los términos de dos palabras son frecuentes en las tres lenguas. En segundo lugar, sólo unos pocos términos en inglés y francés tienen más de 2-3 palabras mientras que en el diagrama 2. Número 103Terminología | 2018 | 25 Los términos lituanos que contienen cuatro o más palabras constituyen una parte significativa de los datos seleccionados (17 de 70). The tendency of prevalence of two-word terms coincides with the tende constituyentes del término dencias establecidas por otros investigadores terminológicos. La investigación sobre la extracción automática y la definición del by Agnė Bielinskienė et al. revealed that most Lithuanian terms of this dominio de la terminología de la educación y la ciencia son términos de dos palabras: constituyeron más de dos tercios de los términos seleccionados de los specialised corpus (Bielinskienė et al. 2015: 62). The contrastive research candidatos de términos extraídos automáticamente de una terminología de derecho constitucional por Liudmila Mockienė reveló la misma tendencia en tres idiomas diferentes. En los actos jurídicos de carácter constitucional investigados en inglés, ruso y lituano, la mayoría de los términos polivalentes extraídos consistían en dos constituyentes: constituían el 78,5% de los términos polivalentes en inglés, el 62% de los términos polivalentes en ruso y el 74,5% de los términos polivalentes en lituano (Mockienė 2016: 43-45). Por lo tanto, los desarrolladores de términos de diferentes dominios y diferentes idiomas tienden a adherirse al mismo principio de economía de lenguaje y facilidad de uso. 6. Conclusiones El software AntCont, utilizado para el análisis monolingüe de corpus, y AntpConc, utilizado para el análisis paralelo de corpus, permitieron extraer términos de varias palabras en inglés, francés y lituano, incluida la palabra "riesgo" como sustantivo principal de los corpus especializados de los documentos de la UE del dominio financiero compilados a los fines de la investigación. La extracción se realizó en las siguientes etapas: • extraer las palabras clave de los corpora ingleses, franceses y lituanos (las palabras de potencial relevancia terminológica características del dominio que representan los corpora) y elegir la palabra clave más frecuente (la palabra "riesgo") para un análisis posterior; • extraer colocaciones de la palabra "risk" y frases sustantivas que incluyen la palabra "risk" como el sustantivo principal con la izquierda y/o la derecha se coloca del corpus inglés; • seleccionar unidades léxicas que tengan valor terminológico de la lista de las frases sustantivas extraídas; • establecer equivalentes franceses y lituanos de los términos ingleses seleccionados en el corpus paralelo inglés-francés-lituano. 104 Oksana Smirnova Análisis impulsado por corpus de términos de varias Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian palabras, incluida la metodología aplicada, demostró ser adecuada para una extracción multilingüe efectiva de la terminología que puede utilizarse para el desarrollo o la actualización de bases de términos o el análisis científico de términos. El análisis de la estructura formal de los términos extraídos reveló algunos aspectos importantes. term formation tendencies in the investigated languages: • la modificación prenominal es dominante en las lenguas inglesa y lituana, mientras que la modificación postnominal es característica del idioma lituano. Lengua francesa; • los modificadores dominantes de los términos ingleses y lituanos son sustantivos y adjetivos, mientras que en los términos franceses la palabra "risk" se modifica principalmente por frases prepositivas; • el tipo de término predominante según el número de constituyentes son los términos de dos palabras […] constituyen el mayor número de términos en las listas TOP 70 en inglés, francés y lituano; Esto demuestra que los desarrolladores de términos de la UE respetan el requisito principal de la guage economy (brevity of terms); • sólo unos pocos términos en inglés y francés tienen más de 2-3 palabras, mientras que en la lista lituana TOP 70 los términos con 4 o más palabras constituyen una parte significativa de los datos seleccionados (17 de 70). Los resultados del análisis de la estructura formal revelan las tendencias de formación de términos en las lenguas investigadas y proporcionan información terminológica que podría ser útil para los desarrolladores y traductores de términos. Los patrones sintácticos, establecidos en la investigación, pueden utilizarse para el desarrollo de métodos lingüísticos automáticos de extracción de términos sin palabras clave preseleccionadas. REFERENCES Aston g., Burnard L. 1998: The BNC Handbook. Exploring the British National Corpus with SARA, Edinburgh: Edinburgh University press. Atkins S., Rundell M., Sato H. 2003: The contribution of FrameNet to practical lexicography. – Internation al Journal of Lexicography 16(3), 333–357. Bielinskienė A., Boizou L, Grigonytė G., Kovalevskaitė J., Rimkutė E., Utka A. 2015: Lietuvių kalbos terminų automatinis atpažinimas ir apibrėžimas. Monografija, Kaunas: Vytauto Didžiojo universitetas. Butler C. S. 2004: Corpus studies and functional linguistic theories. – Functions of Language 11(2), 147–186. Cabré M. T., Montané M. A., Nazar R. 2012: Corpus-based Terminology Processing. TKE 2012 Tutorial. Available at http://terminus.iula.upf.edu/tke2012/. hoey M. 2005: Lexical Priming: A New Theory of Words and Language, London: Routledge. Janulevičienė V., Rackevičienė S. 2014: Formation of criminal law terms in English, Lithuanian and Norwegian. – LSP journal – Language for special purposes, professional communication, knowledge management and cognition 15(1), 4–20. 105Terminologija | 2018 | 25 Lehecka T. 2015: Collocation and colligation. – Handbook of Pragmatics Online. J.-O. Östman, & J. Verschueren (Eds.), Amsterdam: John Benjamins Publishing Company, 1–23. Khurshid A., Rogers M. 1992: Terminology management: a corpus-based approach. – Translating and the Computer 14, 33–44. Marcinkevičienė R. 2000: Terminografija ir tekstynas. – Terminologija 6, 5–23. Mockienė L. 2016: Formation of terminology of constitutional law in English, Lithuanian and Russian. Doctoral Thesis, Vilnius: Mykolas Romeris University. Nakagawa H. 2001: Experimental evaluation of ranking and selection methods in term extraction. – Recent Advances in Computational Terminology. D. Bourigault, Ch. Jacquenim and M.-C. L’homme (Eds.), Amsterdam/Philadelphia: John Benjamins Publishing Company, 303–325. Newman J., Rice S. 2006: Transitivity schemas of English EAT and DRINK in the BNC. – Corpora in Cognitive Linguistics: Corpus-Based Approaches to Syntax and Lexis. S.T. gries and A. Stefanowitsch (Eds.), Berlin/New York: Mouton de Gruyter, 225–260. pearson J. 1998: Terms in Context, Amsterdam/philadelphia: John Benjamins publishing Company. Sinclair J. 1998: The lexical item. – Contrastive Lexical Semantics. E. Weigand (Ed.), Amsterdam: John Benjamins Publishing Company, 1–24. Zeller I. 2005: Automatinis terminų atpažinimas ir apdorojimas. Daktaro disertacija, Kaunas: Vytauto Didžiojo universitetas, Vilnius: Lietuvių kalbos institutas. Fuentes Diario Oficial de la Unión Europea: https: eur-lex.europa.eu/oj/direct-access.html SOFTWARE de computación uSED para el análisisSiS Anthony L. 2014: AntConc (versión 3.4.4w) [software de computación]. Tokio, Japón: Universidad de Waseda. Disponible en http: www.antlab.sci.waseda.ac.jp Anthony L. AntpConc (Versión 1.2.0) [Programa informático 2017:]. Se utiliza para el control de la seguridad de los sistemas informáticos. Tokio, Japón: Universidad de Waseda. Disponible en el sitio web www.antlab.sci.waseda.ac.jp Supernova-soft. El alineador de texto NOVA. Disponible en el sitio web https: www.nova-text-aligner.soft112.com. ANALISE TEKSTYNų LiNgviSTiKOS METODAiS pristatyje Straips empiromi deskriptyviosios terminologijos principai bei daugiažodžių terminų su žodžiu tyrimo, tikslas tyrimo taikant tekstynų lingvistikos metodus, surinkti terminus iš finansų srities ES dokumentų tekstynų ir jų formali sandaros analizę. Tyrimo tikslams buvo sukaupti keturi tekstynai: finansų srities dokumentų anglų kalba (802 933 žodžiai), prancūzų kalba (940 655 žodžiai) ir lietuvių kalba (639 279 žodžiai) bei lygiagretusis anglųprancūzųlietuvių kalbų tekstynas. Iš tekstynų surinkta 210 terminų, kuriuose žodis rizika eina pagrindiniu dėmeniu: 70 terminų ir po tiek pat jų atitikmenų prancūzų ir lietuvių kalbomis. Žodžio rizika pasirinkimą lėmė tai, kad šis žodis fueron dažniausias de todos los tres kalbų tekstynuose. mos […] AntConc y AntPConc. Dirbta Terminų atpažinimui ir surinkimui buvo naudojamos dvi kompiuterinės progratokiais etapais: (en inglés) • las variaciones de las palabras, de los términos, de los términos branduoliu, en inglés, en francés y en lituaniano, en los textos, en las determinaciones y en los acuerdos de sus (žodžio rizika) atrinkimas tolesnei analizei; 106 Oksana Smirnova Análisis impulsado por el corpus de términos de varias palabras, Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian incluidos: • palabras de riesgo de colocaciones y daiktavardinių junginių su pagrindiniu dėmeniu riesgo de jo kairiaisiais bei dešiniaisiais kolokatais nustatymas angliškame tekstyne; • daiktavardinių junginių, laikytinų daugiažodžiais terminais, atrinkimas; • la determinación de los términos ingleses, franceses y lituanos correspondientes. Pritaikyta metodologija leido rezultatyviai surinkti daugiažodžius terminus iš daugiakalbių tekstynų. Pritaikyta metodologija leido rezultatyviai surinkti daugiažodžius terminus iš daugiakalbių tekstynų. Tai duoda pagrindą teigti, kad ji gali būti taikoma terminų kaupimui bei tyrimams. (Tai duoda pagrindą teigti, kad ji gali būti taikoma terminų kaupimui bei tyrimams) Es una palabra que se utiliza para referirse a las ventas de bienes o servicios. Surinktų terminų formaliosios sandaros analizė atskleidė keletą svarbių terminų darybos tendencijų tiriamose kalbose: • vyraujantis terminų tipas pagal dėmenų skaičių visose trijose tiriamose kalbose yra dvižodžiai terminai; tai, kad rodo ES terminų kūrėjai laikosi kalbos ekonomijos principo ir stengiasi kurti kuo trumpesnius daugiažodžius terminus; • tik keletas en inglés y en francés, terminos más variados que 23 dėmenis; tuo tarpu lietuviški terminai, susidedantys iš 4 ir daugiau dėmenų, sudaro beveik ketvirtadalį surinktų terminų; • inglés y lituano kalbų terminų darybos modeliuose vyrauja prepozicinė ir postpozicinė modifikacija, o francés postpozicinė modifikacija; • las hijas inglesas y lituanas tienen términos de dependencia que se muestran como daiktavardžiai y būdvardžiai, o en francés kalboje […] prielinksninės konstrukcijos. Los resultados de los análisis formales de sandaros proporcionan información, kuri gali būti naudinga terminų kūrėjams ir vertėjams. El método para determinar los modelos estructurales sintácticos es el que se aplica a los usuarios, el método de identificación automática de los terminos de la computadora lingüística es el que se aplica a los usuarios de las palabras seleccionadas. Gauta y el 21 de mayo de 2018 Oksana Smirnova Universidad de Mykolo Romerio Ateities g. 20, LT-08303 Vilna y sus alrededores E. paštas [email protected] (en inglés) Sigita Rackevičienė Universidad de Mykolo Romerio Ateities g. 20, LT-08303 Vilna y sus alrededores E. paštas [email protected] (en inglés)