Full text
5 Jana Levická Uso y productividad empírica de la organización Adjectival Suffixes in Slovak Revisited internacional doi.org/10.35321/term28-03 Uso y productividad empírica de los sufijos adjetivos internacionales en eslovaco revisitado Instituto de Lingüística Jana Levická Ľ. Štúr de la Academia Eslovaca de Ciencias ORCID id: https://orcid.org/0000-0001-6027-604X RESUMENDO: El Consejo de Administración y el Consejo de Administración de la Unión Europea han adoptado el presente Reglamento. Este artículo representa una secuela de una investigación anterior centrada en el uso y la productividad de cinco sufijos latinos en eslovaco. El análisis se centra en la productividad real y potencial en una comparación en dos etapas: 1) tokens y lemmas que ocurren en un corpus general equilibrado frente a un corpus general de textos especializados y académicos; 2) corpus general de textos especializados y académicos frente a un (sub) corpus especializado de textos médicos, legales, económicos y religiosos. El primer objetivo de la secuela fue establecer si los lemmas de baja frecuencia incluyen nuevas monedas que podrían contribuir a la variación de productividad en todos los dominios. El segundo objetivo era identificar e implementar una medida estadística apropiada que permitiera la comparación de los datos de los corpus de productividad en corpora de diferentes tamaños. PAZAS clave: productividad, adjetivo, sufijo, corpus general, corpus especializado, hapax legomena, lema de baja frecuencia, gran número de distribuciones de eventos raros. ANOTACIJA El estudio de la descripción del título es un estudio temprano, el examen de los penkių lotynų kalbos priesagų vartojimą ir produktyvumą slovakų kalboje, tęsinys. Tyrime pretende determinar realų ir potencialų produktyvumą atliekant palyginimą dviem etapais: 1) formas de palabras (angl. tokens) ir antraštinės žodžių formos, arba lemos (angl. lemmas), esančios bendrajame subalansuotame tekstyne, lyginamos su esančiomis bendrajame specialiųjų ir akademinių tekstų tekstyne; 2) lyginamos bendrajame specialiųjų ir akademinių tekstų tekstyne ir specialiajame medicininių, teisinių, ekonominių ir religinių tekstų patekstynyje esančios žodžių formos ir lemos. El objetivo del estudio de tęstinio es determinar, ar tarp retai vartojamų lemų yra naujažodžių, kurie galėtų prisidėti prie produktyvumo skirtumų skirtingose srityse. Se trata de determinar el alcance de las medidas estatísticas de adaptación, de comparar las medidas estatísticas con las medidas estatísticas de productos de la materia. ESMINIAI ŽODŽIAI: produktyvumas, būdvardis, priesaga, bendrasis tekstynas, specialusis tekstynas, hapaksas, retai vartojama lema, didelis retų įvykių pasiskirst skaičius
5 5Terminologija | 2021 | 28 1. INTRODUCTION La motivación para nuestra investigación surgió de un interés en la sinonimia terminológica y, dentro de este tema más amplio, en los adjetivos denominacionales sinónimos como constituyentes de términos de varias palabras. El enfoque en los adjetivos no es una novedad en la investigación terminológica. Los análisis detallados dirigidos a los adjetivos se pueden encontrar en el trabajo de varios terminólogos, especialmente de los años 90 y 20001. En la historia de la terminología eslovaca, los estudios centrados en los adjetivos, desencadenados por la necesidad de unificar y acuñar terminologías eslovacas estandarizadas, se pueden rastrear hasta el los años cincuenta (véase, por ejemplo, Ján Horecký 1956). La importancia de los adjetivos en la terminología y los idiomas para fines especializados también puede ilustrarse por los datos estadísticos proporcionados por los corpora. La mayoría de los corpus especializados que surgieron del proyecto del Corpus Nacional Eslovaco (en lo sucesivo solo proyecto SNC) presentan una proporción más alta de adjetivos en comparación con el corpus de referencia (prim-7,0-frk), es decir, el corpus recopilado de una parte uniforme de textos ficticios, especializados y periodísticos2. Como se puede ver en el cuadro 1, esta diferencia asciende a casi el 2%, excepto para el corpus religioso (blf-2.0) en el que la proporción de adjetivos es aproximadamente la misma que en el corpus de referencia (7,46%). La segunda fila de la tabla 1 presenta la proporción de gerundos que también se utilizan con funciones de diferenciación y clasificación en términos polivalentes eslovacos. En el marco de la anotación morfológica del proyecto SNC, estos se clasifican como un grupo específico, por lo que se etiquetan por separado de los verbos (Garabík et al. 2004). La coexistencia y la competencia de los adjetivos se han identificado y analizado en el contexto del lenguaje en general (p. ej. Nábělková 1996). Sin embargo, su entrada en términos de varias palabras representa un tema bastante poco investigado. Un fenómeno común que resulta en la sinonimia y la competencia de los adjetivos es la coexistencia de los adjetivos latinos y sus contrapartes (eslovacos) (vnútrožilový […] intravenózny […] intravenoso[…]). Este último grupo comprende también un subgrupo que presenta tanto el eslovaco como, desde el punto de vista etimológico, el sufijo latino o internacional combinado con la misma raíz internacional (por ejemplo, bakterialny […] baktériový […] bacterial […]). Ocasionalmente, una variación de dos sufijos internacionales con el mismo en1 Véase, por ejemplo, H. Assadi y D. Bourigault 1995; S. Normand y D. Bourigault 2001; B. Daille 2001; F. Maniez 2001; M.-C. L[…]Homme 2002, 2003; o I. Carrière 2008. En la parte 3.2 se presentan más detalles sobre los corpus utilizados para el análisis presentado.
5 Jana Levická Uso y productividad empírica de la raíz internacional Adjectival Suffixes in Slovak Revisited puede surgir (por ejemplo, hypersonórny […] hypersonický, kontradiktorický […] kontradiktórny). This study, focusing on the usage of specific suffixes in the Slovak En el caso de la productividad morfológica, el objetivo es determinar si algunas de ellas son más propensas a facilitar tal coexistencia o a aparecer con mayor frecuencia en los adjetivos terminológicos, por lo que el concepto de productividad morfológica se vuelve relevante en este caso. Los sufijos seleccionados para el análisis representan un grupo menor utilizado para acuñar adjetivos denominales dentro de una amplia gama de sufijos adjetivos eslovacos3. En cuanto a su composición, los cinco sufijos consisten en un sufijo adjetivo internacional (adaptado) combinado con el eslovaco semánticamente equivalente -ný/ny: -álico, -árny, -itný, -ívny, -ózny, por lo tanto, su estatus adjetivo se multiplica un poco. Parece obvio que los cinco sufijos de origen latino se usaron para acuñar adjetivos de sustantivos latinos (-alis con la variante -aris, -ītus, -ōsus) o verbos (-ōrius). Vale la pena señalar, sin embargo, que muchos adjetivos eslovacos con los sufijos analizados entraron 3 Martin Ološtiak y Lucia Ološtiaková (2015: 230) mencionan hasta 38 sufijos, aunque 25 sufijos en su muestra […] derivados del Slovník koreňových morfém slovenčiny que comprende 66.500 unidades léxicas […] representan solo el 1% de los adjetivos. Cuadro 1. Número de tokens y proporciones de adjetivos y gerundos en los corpus de referencia y especializados del proyecto SNC CORreFer-SCIeNTIF-MEDICAL LEGAL RELI-ECOPUS ENCE IC CORPUS SUB-SUBCORPUS -SUB-GIOCORPUS US NOMIC CORPUS (Nómica CORPUS de las sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub-sub CORPUS Número de fichas en el corpus 253,137,609 149,581,785 7,099,555 33,600,183 65,920,357 164,987,015 Número de adjetivos en las fichas 19,090,396 7.54% 13,415,554 8.97% 660,025 9.3% 4,841,400 9.88% 4,914,860 7.46% 15,540,381 9.42% Número of gerde unds en fichas 3,174,567 1.25% 2,394,914 1.6% 112,164 1.58% 1,267,598 2.59% 761,719 1.16% 2,154,124 1.31%
5Terminologija | 2021 | 28 el léxico eslovaco no solo directamente del latín, sino más a menudo a través del francés o el inglés en las últimas décadas (Horecký 1999) y se sometió al proceso de adaptación por medio del sufixo adjetivo eslovaco antes mencionado. Es significativo que este préstamo y la posterior adaptación fueron habilitados y mejorados por factores extra-lingüísticos. Debido a consideraciones predominantemente históricas, el eslovaco ha estado muy abierto a nuevas palabras originadas en latín y, por lo tanto, la proporción de palabras latinas es alta, incluso en el léxico general del eslovaco (Horecký 1999: 81). Hoy en día, gracias al impacto de los medios de comunicación, Internet y las redes sociales, esta formación process of both borrowing and derivation is exceedingly profitable and combinada de palabras es muy pertinente para un estudio lingüístico y terminológico. Nuestro documento representa una secuela de nuestra research topic, which is currently in print (Levická 2021). For the sake investigación anterior sobre la misma de comparación y claridad para el lector, consideramos necesario incluir un resumen del razonamiento y los hallazgos anteriores, complementados con nuevos conocimientos y antecedentes teóricos. Por lo tanto, algunas de las tablas (1[…]4), aunque aparecieron en nuestro primer artículo, se repiten aquí. 2. Fundamento teórico El concepto teórico de productividad morfológica se ha desarrollado, el pensamiento teórico y by quite a number of researchers and scholars. An overview of previous los estudios en el siglo XX se han resumido y comentado en una serie de estudios y artículos, por ejemplo, por Jesús Fernández-Dominguez (2013) o Victoria Hulse (2011). Aquí, nos centraremos sólo en una serie de consideraciones teóricas, que tanto nos proporcionaron inspiración como influyeron en nuestra elección del enfoque y la metodología. La definición más antigua citada aquí fue escrita en 1948 por el lingüista estadounidense Dwight L. Bolinger (citado por Säily 2018: 198), quien concluyó que la productividad era la "preparación estadísticamente determinable4 con la que un elemento entra en nuevas combinaciones". En 1961, el lingüista holandés Henk Schulting (citado por Stefan Evert y Anke Lüdeling 2001: 165) definió la productividad como "la posibilidad de que los usuarios de la lengua acuinen involuntariamente y, en principio, un número ilimitado de nuevas formaciones, utilizando el procedimiento morfológico que se encuentra detrás de la correspondencia forma-significado de algunas palabras conocidas". 4 Las frases o palabras marcadas en negrita representan las características clave de nuestra investigación.
5 Jana Levická Usage and Empirical Productivity of International Por último, Adjectival Suffixes in Slovak Revisited pero no menos importante, nos gustaría referirnos a la investigación de formación de palabras del lingüista checo Miloš Dokulil, quien presentó una compleja teoría de la productividad de la formación de palabras en su obra Teorie tvoření slov en 1962. En primer lugar, Dokulil definió la productividad de un dispositivo lingüístico en general como una capacidad de este dispositivo lingüístico (ya sea una base, un afixe o un patrón de formación de palabras) para participar activamente en la acuñación de nuevas palabras (1962: 78). Especificó que esta capacidad puede ser absoluta, es decir, su usabilidad para acuñar nuevas palabras en cualquier momento y dentro de cualquier patrón de formación de palabras, o relativa que es semánticamente, o más bien dependiente del estilo, así como dependiente del patrón de formación de palabras. En la teoría de Dokulil, la productividad es un "concepto de naturaleza sincrónica, mientras que la implementación de esta capacidad - acuñar nuevas palabras de acuerdo con reglas específicas - es, por el contrario, un concepto de naturaleza diacrónica" (1962: 80). Dokulil también diferenció entre la productividad sistémica y la empírica (también denominada "parole" o "productividad real" por Framntišek Štícha 2012) que da una "idea general de la explotación general de un patrón específico de formación de palabras o dispositivo lingüístico en el sistema de una lengua en un tiempo dado" (Dokulil 1962: 80). Dokulil creía que incluso "los datos aproximados relativos al uso cuantitativo de un determinado proceso o elemento de formación de palabras son de primordial importancia para la imagen general de una determinada lengua en general y para las características de su léxico en particular" (punto 77). Entre los lingüistas checos contemporáneos que se basan en la teoría de la productividad de Dokulil y verifican sus suposiciones sobre los datos de corpus (ver, por ejemplo, Štícha 2002, 2007, 2009, 2012 o Magda Ševčíková 2014), Štícha sugiere el análisis de la productividad empírica o parola, no solo en grandes corpora, sino también por medio de una serie de corpora de diferentes tamaños y composición. (2012: 104). Se podría afirmar que las suposiciones de Dokulil con respecto a la productividad relativa fueron repetidas por Harald Baayen y otros cuyos métodos y enfoques se referirán más adelante en este análisis. En 1999, Baayen y sus colegas Ingo Plag y Christiane Dalton-Puffer escribieron que "las afirmaciones sobre la productividad de un afix dado generalmente se hacen sin diferenciar la productividad de acuerdo con el tipo de discurso, aunque se asume comúnmente que ciertos tipos de sufijos derivativos son más pertinentes en ciertos tipos de textos que en otros" (1999: 209). Con grandes corpora disponibles, es posible medir, identificar y analizar la productividad de un patrón o elemento de formación de palabras no solo en el lenguaje general en un momento dado, sino también en dominios y registros especializados.
5Terminología | 2021 | 28 3. PREVIOUS RESEARCH En línea con el razonamiento y las suposiciones de los lingüistas citados en la parte anterior, formulamos tres preguntas clave de investigación al comienzo de nuestra investigación destinada a identificar la productividad morfológica de los sufijos adjetivos: 1) ¿Difiere la productividad morfológica de los sufijos adjetivos individuales del grupo seleccionado en los textos generales y especializados? ¿Y estas diferencias son estadísticamente significativas? 2) ¿Puede la productividad morfológica de los sufijos adjetivos individuales del grupo seleccionado variar dependiendo del dominio específico? ¿Son algunos de esos cinco sufijos más "aptos" para contribuir a la codificación de conceptos específicos de campo o dominio? 3) ¿Qué métodos son relevantes para este análisis específico de los datos del corpus? En primer lugar, debido a la especificidad de este tipo de patrón de formación de palabras, base latina + sufijo latino + sufijo etimológicamente nativo, decidimos dejar de lado el análisis cualitativo que implica los límites y las reglas que rigen la combinación de bases latinas individuales con uno de los sufijos adjetivos seleccionados en el contexto de la lengua eslovaca. Aunque el enfoque cuantitativo no puede proporcionar la imagen completa del estado de productividad de un sufijo o de cualquier otra forma morfológica, su beneficio para este tipo de investigación radica en presentar la perspectiva, el contexto de uso de palabras acuñadas de acuerdo con un patrón específico, junto con comparaciones específicas con formas semánticamente y funcionalmente equivalentes. Es una opinión generalmente aceptada que un enfoque cuantitativo en los análisis de la productividad morfológica representa un método significativo y complementario a la investigación cualitativa (ver, por ejemplo, Evert y Lüdeling 2001). Como afirma Plag: "Las nociones cuantitativas y cualitativas de productividad [...] están estrechamente relacionadas. Por lo tanto, la idea de potencialidad, que es central para las definiciones cualitativas de la productividad, puede expresarse en los términos estadísticos de la probabilidad (citado por Naccarato 2016: 135). Del mismo modo, Baayen y sus coautores abogan por que la productividad "parece ser un concepto escalar [...] con algunos afijos es más probable que uno se encuentre con palabras recién formadas que con otros, un hecho que hace que la productividad sea una noción probabilística que es susceptible al análisis estadístico". (1999: 10).
6 0 Jana Levická Uso y productividad empírica de las empresas internacionales Adjectival Suffixes in Slovak Revisited 3.1. Statistical methods En la etapa 1 de nuestro análisis, adoptamos el camino metodológico bien recorrido de Harald Baayen y sus colegas y seguidores (1991, 1992, 1993, 1994, 1996, 1997). Identificamos la llamada productividad realizada, es decir, la frecuencia de uso de adjetivos acuñados con sufijos seleccionados, así como el número de adjetivos diferentes acuñados con estos sufijos en diferentes corpora. Estas estadísticas de corpus describen la productividad de los sufijos con respecto a la situación lingüística pasada y presente. El siguiente paso fue determinar la productividad potencial de los sufijos analizados, es decir, una estimación de la tasa a la que se espera que aparezcan nuevos tipos. (2009 Baayen: 7) sugiere calcularlo como la relación de hapax legomena6 con el afixe X y todos los tokens con el afixe X en un corpus. El uso de hapax legomena para el cálculo de la productividad ha sido ampliamente criticado, ya que este grupo no representa directamente nuevas monedas que se supone que reflejan la productividad de un elemento o patrón. Plag, DaltonPuffer y Baayen argumentan que la productividad potencial es una medida probabilística, y que con el aumento del tamaño de un corpus, la proporción de neologismos entre los hapax legomena aumenta y se ha demostrado que es precisamente entre los hapax legomena que aparece el mayor número de neologismos (1999: 12). En la etapa anterior de nuestra investigación, decidimos no utilizar el método hapax/token, sino que adoptamos el método hapax/tipo en línea con el razonamiento de van Marle (1992) de que la frecuencia de los tokens no es una variable tan relevante en una medida de productividad como el número de lemmas. Sin embargo, el inconveniente más grave impuesto por esta medida es la imposibilidad de comparar los datos estadísticos de corpora de diferentes tamaños (Naccarato 2016: 133). Volveremos a esta consideración en la Parte 5. 3.2 Corpora utilizada en el análisis7 Los tres corpora y tres subcorpora utilizados en este análisis fueron publicados por el Departamento del SNC en 2013-2020 y son accesibles para todos los usuarios registrados. 5 Los tipos en la lingüística de corpus representan palabras únicas, son sinónimos de lemmas (Baker et al. 2006). 6x hapax legomena (frase griega original que significa "una vez dicho"), también abreviada como hapax, es una palabra que ocurre sólo una vez en un corpus en particular (Baker et al. 2006). 7 La mayor parte de esta sección proviene del artículo que describe la etapa anterior de nuestra investigación (Levická 2021), sin embargo, esta repetición es necesaria para explicar la naturaleza de los datos del corpus.
6Terminología | 2021 | 28 El primero, el corpus de referencia (prim-7.0-frk), que asciende a más de 253 million tokens, is composed of an even share of journalistic, specialised textos de ficción (el 64,12% de ellos están escritos originalmente en eslovaco, mientras que el 29,51% representan traducciones), escritos entre 1991 y 2015. used in the compilation of two frequency dictionaries of Slovak (2017, El corpus fue de 2018), así como el diccionario inverso (2018). El segundo corpus, prim-9.0-public-prf, es un subcorpus de acceso público del corpus primario del proyecto SNC (en lo sucesivo denominado subcorpus científico). Compilado a partir de textos especializados, académicos y de no ficción, este subcorpus presenta más de 149 millones de fichas y documentos, así como el discurso general de la ciencia y la investigación, incluido el periodismo especializado. Sus textos fueron escritos entre 1955 y 2019. El porcentaje de textos escritos entre 1955 y 1991 asciende al 8,7% (más de 13 millones de fichas). El corpus (sub) más pequeño de todos los corpora buscados es el resultado del filtrado del corpus primario del proyecto SNC [9], versión 9.0. Consiste en textos que pertenecen al campo de la medicina escritos entre 1976 y 2019 y que comprenden poco más de 7 millones de fichas. El porcentaje de textos escritos entre 1955 y 1991 asciende al 1,09%. Nos referiremos a él a lo largo del texto como el subcorpo médico. Con el fin de disponer de una fuente comparable procedente de otros corpus especializados y del corpus de referencia, el corpus especializado legal-1.1 (en lo sucesivo denominado subcorpus jurídico), creado en cooperación con el Ministerio de Justicia eslovaco, se redujo a los textos legislativos creados en el período 1991-2011. Sus casi 49 millones de fichas se redujeron así to 33.5 million tokens. El corpus especializado […] blf-2.0 […] centrado en el dominio religioso, fue lanzado en 2014. Sus textos consisten en casi 66 millones de fichas escritas entre 1989 y 2014 (en lo sucesivo denominado el corpus religioso). Comprende más del 80% de las revistas y periódicos temáticos. Del mismo modo, el corpus especializado ecn-2.0-público (en lo sucesivo denominado corpus económico), dedicado al dominio de la economía, incluye hasta el 96,24% de los textos especializados publicados en revistas y periódicos temáticos. Los textos de este corpus provienen de 1992-2014 y comprenden casi 165 millones de fichas. Sin embargo, debe tenerse en cuenta que estos corpus son heterogéneos y cubren una amplia variedad de textos.
6 Jana Levická Usage and Empirical Productivity of International En lo que se Adjectival Suffixes in Slovak Revisited refiere a la búsqueda de corpus, no basamos las consultas en el etiquetado morfológico proporcionado para cada uno de los (sub) corpora incluidos en el análisis, sobre la base de que, con palabras latinas, el etiquetado resultó ser inadecuado y erróneo. Por lo tanto, optamos por una búsqueda simple de la finalización específica de un token, por ejemplo, [lemma=.*álny], combinada con el filtrado automático de palabras con la misma cadena de caracteres (véase la Parte 4.1). 3.3 Resultados de la etapa anterior En la etapa anterior, los datos estadísticos de los corpora nos permitieron crear una clasificación para la productividad realizada de los sufijos analizados. El sufijo -álny es definitivamente el más utilizado en todos los (sub) corpora, mientras que -órny está en el polo opuesto del eje de frecuencia en 5 (sub) corpora. Como se puede ver en las frecuencias normalizadas de uso de cuatro de los cinco sufijos, aparecen con mayor frecuencia en textos especializados y académicos (es decir, las frecuencias normalizadas de sufijos en el subcorpus médico son iguales o entific subcorpus) compared to the reference corpus. It is also noteworthy considerablemente superiores a las ipm en el subcorpus científico, mientras que son considerablemente más bajas que en el corpus de referencia). Esto puede explicarse en parte por the ipm of suffixes (instances per million) in the religious corpus is manel tipo de textos incluidos en esos (sub) corpora. Cuadro 2. Frecuencia y frecuencia normalizada (IPM, instancias por millón) de los sufijos analizados en los respectivos (sub) cuerpos. Los cuerpos están ordenados de la más pequeña a la más grande SuF-MEDICAL LEGAL RELI-SCIENTIF-ECOreFerFIx SUB-SUBCORPUS -GIOUS IC CORPUS SUB-NOMCORPUS IC ENCE CORPUS (en CORPUS inglés) CORPUS Las fichas las fichas las fichas las fichas las fichas IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM IPM - El número de empleados es de 31.408 102.863 128.472 537.682 597 005 547.742 4423.94 3061.38 1948.9 3594.57 3618.5 2163.81 - El número de muertos es de 4,529 25,980 14,253 94,586 38,178 84,780 637.93 773.21 216.22 634.14 231.40 334.92 -itný 2.683 2.256 9.176 30.402 52.574 44.655 Lo que es más importante es que el número de personas que trabajan en el sector es cada vez mayor. 377.91 67.14 139.20 203.25 318.66 176.41
9Terminologija | 2021 | 28 un sufijo dado. En comparación con el cuadro 4, la clasificación cambió en todos los (sub)corpus excepto en el corpus de referencia. Por lo tanto, parece que la inclusión de lemmas de baja frecuencia resultó valer la pena. El sufijo -órny es más productivo en dos corpus (en comparación con tres en la tabla 4), mientras que -ózny se mantuvo en la parte superior de dos clasificaciones y -itný en la parte superior de la clasificación en el corpus económico. En el corpus jurídico, el sufijo más productivo parece ser -árny, mientras que este mismo sufijo es simultáneamente least productive in medical texts and economic texts. The last place in the clasificado por la productividad ocupado por el sufijo -órny tanto en el corpus de referencia como en los textos médicos, por el sufijo -ózny en los textos científicos generales y el sufijo -itný permaneció menos productivo en los corpora jurídicos y religiosos. 5. Comparación entre la actividad de producción (SuB) Como señalamos en la parte 3.1, las medidas estadísticas que utilizan frecuencias crudas y recuentos de tipos nos impidieron comparar resultados anteriores procedentes de diferentes (sub) cuerpos. Si estamos de acuerdo con la afirmación o más bien la hipótesis de que la productividad de cualquier elemento de formación de palabras o tabla 9. Diferencia en la proporción de neologismos potenciales entre el grupo de lemmas de baja frecuencia (4[…]1 ocurrencias) y el número de tipos. El orden de los sufijos resaltados ha cambiado en comparación con el cuadro 4 W-FrequeNCy LeMMAS/TyPe RATIO corpus de referencia subcorpus científico subcorpus médico -ózny 0.2689075 -órny 0.2727272 -ózny 0.2638888 -árny 0.246666 -álgico 0.2716468 -álgico 0.1682785 -álgico 0.2053838 -árny 0.2712328 -órny 0.1538461 -itný 0.133333 -itný 0.2653061 -itný 0.13888 -órny LO 0.12 -ózny 0.2436974 -árny 0.1284916 subcorpus legal corpus religioso corpus económico corpus -árny 0.1212121 -órny (en inglés) 0,3 -itný 0,3504273 El número de personas que trabajan en el sector de la agricultura es de 0,354273 y el número de personas que trabajan en el sector de la agricultura es de 0,354273. - Qué bueno. - 0.1 el mínimo 0.2651391 - el mínimo 0.2647849 - No lo sé. - 0.1ózny 0.2115384 -ózny 0.2560975 -alny 0.0776397 -árny 0.1985815 -órny 0.2307692 -ózny 0.2307692 -ózny 0.0776397 -ózny 0.085815 -ózny 0.2307692 -ózny 0.0776397 -ózny 0.085815 -ózny 0.2307692 -ózny 0.2307692 -ózny 0.0759 -ózny 0.0759 -ózny 0.0759 -ózny 0.0759 -ózny 0.0759 -ózny 0.0759 -ózny 0.0 -itný 0-itný 0,1818181 -árny 0,225 -itný 0,1818181 -itný 0,225 -itný 0,225 -itný 0,225 -itný 0,225 -itný 0,225 -itný 0,225 -itný 0,225 -itný 0,225 -itný 0,225 -itný 0,225 -itný 0,225 -itný 0,225 -itný 0,2
7 Jana Levická Usage and Empirical Productivity of International pattern se Adjectival Suffixes in Slovak Revisited puede concluir a partir de nuevas monedas (y, al mismo tiempo, demostramos en la parte 4.2 que estas nuevas monedas podrían ocurrir no sólo dentro de grupos hapax, sino también entre tipos de baja frecuencia), es posible basar un análisis adicional en distribuciones de frecuencia de palabras y espectros de frecuencia. Por "espectro de frecuencias" nos referimos a una lista que informa cuántos tipos en una lista de frecuencias se pueden observar que ocurren (Baroni 2009: 807). Desde la perspectiva de la distribución de la frecuencia de las palabras, evert y Lüdeling (2001: 166), en línea con la definición de Schultink, afirman que "un patrón productivo se caracteriza, en teoría, por un vocabulario infinito (véase la noción de ilimitado en la definición de Schultink), mientras que se espera que un patrón totalmente improductivo tenga un vocabulario finito y a menudo bastante pequeño". Señalan que los tipos de baja frecuencia (incluidos los hapax legomena, pero también los tipos que ocurren dos, tres, etc. veces) representan una parte importante del vocabulario de los patrones productivos y concluyen que este tipo de comparación no puede basarse en modelos estadísticos estándar (2001: 167). Para este propósito de modelado estadístico, Baayen introdujo en 2001 las llamadas distribuciones LNRE10. El beneficio de estos modelos especializados radica en la posibilidad de extrapolar las estadísticas de fichas de tipo a partir de una muestra específica a valores más grandes de fichas y, por lo tanto, estimar potenciales neologismos fuera de esta muestra. Se basan en los tamaños de vocabulario predichos obtenidos a partir de un recuento de tipos de baja frecuencia en el corpus. Uno de los resultados de este modelado son las curvas de crecimiento del vocabulario o, en lugar de las curvas de crecimiento de los tokens de tipo, que cuentan el número de tipos como una función del número de tokens. Una forma típica de esta curva para un proceso improductivo comienza con un aumento, pero luego "se aplanan y convergen a un valor constante, el tamaño completo del vocabulario" (2001: 168). Por el contrario, un patrón productivo típico presenta un vocabulario infinito, es decir, la curva parece crecer indefinidamente. Al emplear las distribuciones LNRE, es posible estimar el número de tipos en grandes cantidades de textos, e incluso el número de tipos 10 La teoría LNRE (teoría de un gran número de eventos raros, como un área independiente de estadística) tiene su origen en 1988 cuando el estadístico georgiano Estate Khmaladze publicó El análisis estadístico de un gran número de eventos raros. Como escribió su estudiante Giorgi Kvizhinadze: "La característica común de los ejemplos que presentaremos a continuación es que junto con varios eventos frecuentes también hay un número muy grande de eventos muy raros, por ejemplo, con frecuencia 0,1,2. La cantidad total de estos eventos raros en comparación con el número de obuses en el libro sólo una vez puede servations typically is not large but the number of these events among all the different observed events is always very significant. These rare events are usually very important. For instance, the number of words considerarse no de importancia vital para este libro, pero está muy claro que estas palabras son absolutamente importantes porque constituyen la mitad del vocabulario del autor (2010).
7 1Terminología | 2021 | 28 de un patrón de formación de palabras en toda la "población", es decir, en una lengua como tal. Al mismo tiempo, es posible estimar o predecir el número de tipos en muestras del mismo tamaño derivadas de corpora más grandes. Como se mencionó en la parte 4.1, este procedimiento estadístico también requiere los recuentos de calidad de tipos y fichas, de lo contrario, el cálculo del tamaño o tipos de vocabulario estimados sería erróneo. En lugar de aplanarse y converger a un valor constante, la curva podría seguir creciendo. 5.1 Las distribuciones de LNRE Decidimos aplicar los modelos LNRE para identificar la productividad en corpora de diferentes tamaños, en parte debido al hecho de que también existe una herramienta de código abierto disponible en línea […] Zipfr desarrollada por evert y Marco Baroni (2007). Esta herramienta de código abierto incluye varios modelos, de los cuales utilizamos el modelo finito de Zipf-Mandelbrot (fZM) basado en la ley de Zipf-Mandelbrot12. Como afirman los autores, su uso va más allá de la lingüística. ZipfR acepta varios formatos de entrada, incluidas listas de frecuencia simples y muestras simples, en un formato de un token por línea. Podríamos utilizar listas de frecuencias de nuestra investigación anterior que se habían sometido a la limpieza manual de la primera etapa (véase la parte 4.1), lo que representaba otra ventaja de este método. Nuestras listas de frecuencias se sometieron a cuatro operaciones básicas (Evert, Baroni 2007): i) estimación de parámetros, donde los parámetros del modelo LNRE M se determinan a partir de una muestra de entrenamiento de tamaño comparando el espectro de frecuencias esperado con el espectro de frecuencias observado; ii) evaluación de la bondad de ajuste basada en la matriz de covarianza del número de tipos y el número de tipos que ocurren exactamente m veces; iii) interpolación y extrapolación del crecimiento del vocabulario, utilizando los valores esperados; iv) la predicción del espectro de frecuencias esperado para un tamaño de muestra arbitrario. Como señalaron Evert y Baroni (2007), este modelado no se centra en las frecuencias de los tipos de palabras individuales, sino más bien en la distribución de tales frecuencias (en una muestra) y probabilidades (en la población). 11 Queremos agradecer la invaluable ayuda de nuestro colega Ján Mázik, quien aseguró el impulso12. Para una descripción completa de la ley de Zipf-Mandelbrot, se hace referencia al lector, por ejemplo: Baroni mentation of the fZM model for our corpus data. en el año 2009.
7 Jana Levická Uso y productividad empírica de las empresas internacionales Adjectival Suffixes in Slovak Revisited 5.2 Aplicación de las distribuciones y evaluación de las LNRE La herramienta ZipfR nos proporcionó espectros de frecuencia de palabras y curvas de fichas de tipo para cada sufijo en cada (sub) corpus. Por falta de espacio, sólo presentamos los gráficos que muestran curvas de fichas de tipo que se ajustaron para tener la misma escala en el eje x. El eje y difiere, ya que depende y resulta, del número real de tipos para un sufijo específico en un determinado (sub) corpus. Proponemos comparar los pares de gráficos y finalmente evaluar la productividad de los sufijos en nuestros datos de corpus. El eje x representa el número de fichas, mientras que el eje y muestra el número (esperado) de diferentes tipos producidos por el patrón de formación de palabras que presenta uno de los sufijos analizados. Ambos corpora, los de referencia y los científicos, muestran la misma clasificación de sufijos coronados por el sufijo -álny y que terminan con el sufijo -órny. En el corpus de referencia, la curva de tres sufijos -alny, -árny, -ózny crece y, por lo tanto, indica su productividad, mientras que las curvas de -itný y, en particular, -órny se aplanan. En el subcorpus científico, dos sufijos pueden considerarse productivos: - y -árny. Las curvas de los tres restantes (ózny, -itný, -órny) crecen muy lentamente, pero muestran la tendencia a aplanarse al final del eje x incluido en el gráfico. Los gráficos para el subcorpus médico y el corpus legal muestran sólo un aplanamiento muy rápidamente productive suffix: -álny13. In the medical subcorpus, both -árny and -ózny (posiblemente, alcanzan su máximo de tamaño de vocabulario), y mientras que -itný y -órny crecen lentamente, pero constantemente, cruzan el punto de tipo 100 y posiblemente se aplanan bajo el punto de tipo 200. El sufijo -álny en los textos legales se dirige al punto de tipo 350, mientras que en los textos médicos es el punto de tipo 800 (véase la escala en el eje y). Sin embargo, en el corpus legal la clasificación difiere ligeramente […] el sufijo -itný viene en tercer lugar superando el sufijo -ózny, que parece casi completamente improductivo con la curva que corre paralela al eje x. El sufijo final -órny presenta un aumento muy lento y una subsiguiente tendencia a aplanarse. Si bien el gráfico del corpus religioso muestra tres sufijos productivos -alny, -árny y -ózny, es digno de mención que los 5 sufijos analizados parecen ser productivos en textos económicos. La clasificación de los sufijos en ambos corpora remains the same. 13 Estos dos gráficos omiten la curva de interpolación para el sufijo -álico. La razón de esto radica en el ajuste y la unificación de la escala del eje x para todos los (sub) cuerpos que no permitieron crear este tipo de curva.
7Terminología | 2021 | 28 Figura 3 El número de personas que trabajan en el del vocabulario de los sufijos analizados Figura 4. sector de la construcción es de Curvas de crecimiento Curvas de crecimiento del vocabulario de los sufijos analizados en el corpus médico en el corpus jurídico Figura 1 El cuadro 1 indica que el importe de la ayuda es del vocabulario de los sufijos analizados Figura 2. inferior al importe de la ayuda. Curvas de crecimiento Curvas de crecimiento del vocabulario de los sufijos analizados en el corpus de referencia en el subcorpus científico En el corpus religioso, ambas curvas de -itný y -órny se aplanan bien debajo del punto de tipo 100. Si resumimos los hallazgos mencionados anteriormente con respecto a la productividad de los sufijos analizados a través de nuestros datos de corpus, podemos afirmar que el sufijo más productivo es -álny, encabezando la clasificación en todos los (sub) corpora. Su productividad parece ser más academic texts and in the medical subcorpus, followed by the reference alta en el subcorpus de científicos y corpus (la curva se dirige al punto de 700 tipos), el religioso
7 Jana Levická Usage and Empirical Productivity of International corpus (la Adjectival Suffixes in Slovak Revisited curva cruza el punto de tipo 600), el corpus económico (la curva se dirige al punto de tipo 500) y, finalmente, el corpus jurídico (en su punto más alto, la curva está cerca del punto de tipo 350). El sufijo -árny viene en segundo lugar y presenta productividad en 4 de los 6 (sub) cuerpos. La forma de las curvas sugiere que no es productivo en textos legales y médicos. La mayor productividad de este sufijo puede ser el punto de tipo 400), luego en el seen in the subcorpus of scientific and academic texts (the curve crosses corpus de referencia (la curva cruza el punto de tipo 300), mientras que en los textos religiosos y económicos la curva se extiende cerca del punto de tipo 300. Del mismo modo, el sufijo -ózny parece ser productivo en 4 de los 6 cuerpos. Curiosamente, parece ser improductivo en la misma (sub) corporación que el sufijo -árny en corpora legales y médicos. Es más productivo en los textos económicos donde la curva corre bien sobre el punto de tipo 200, luego en el corpus de referencia donde la curva cruza el mismo punto, mientras que en los dos corpus restantes la curva toca el mismo punto, pero parece aplanarse allí (prim-9.0-público-prf) o sólo se dirige a este punto en el corpus religioso. Además, el sufijo -itný parece ser productivo en 4 de los 6 cuerpos. La curva de aplanamiento que indica la improductividad se puede ver en los gráficos de los cuerpos legales y religiosos. Es más productivo en textos económicos donde la curva se extiende bien más de 100 puntos de tipo, mientras que en las tres (sub) corpora restantes cruza este punto y se Fig. 6. Vocabulary growth curves of analysed suffixes extiende más abajo. en el corpus económico en el corpus religioso Fig. 5. Vocabulary growth curves of analysed suffixes
7Terminología | 2021 | 28 The final suffix in the ranking -órny – is productive in 4 out of 6 corPora, también. Su improductividad fue identificada en los cuerpos de referencia y religiosos. Su mayor productividad es en los textos médicos y económicos donde la curva cruza el punto de tipo 100, en los textos académicos y científicos la curva se acerca a este punto y en los textos legales apenas cruza el punto Punto de tipo 25. En conclusión, puede decirse que los sufijos analizados son más productivos en los textos científicos y académicos o en los textos de un dominio especial (economía o medicina), lo que no es sorprendente teniendo en cuenta su etimología. Su productividad, o más bien su grado de productividad, difiere considerablemente entre los (sub) cuerpos. La observación más interesante, tal vez, es la improductividad de tres sufijos en el dominio legal y la menor productividad de los dos sufijos restantes en el mismo dominio. Podría indicar que los textos legales no favorecen la creatividad léxica en la acuñación de nuevos adjetivos de este tipo. En comparación con la parte 4, la diferencia en la clasificación de los sufijos puede explicarse parcialmente por el fenómeno observado por Václav Cvrček (2012) con respecto a la relación de tipo hapax. Según los experimentos de Cvrček, esta relación tiende a disminuir desde su valor máximo de 1 hasta su mínimo local (ibid: 5). Sin embargo, después de este punto, la relación comienza a aumentar de nuevo. Cvrček afirma que es "algo así como un principio cuantitativo general de grandes colecciones de textos" (ibid: 14). La forma de la función de tipo hapax parece ser aproximadamente la misma incluso para idiomas tipológicamente diferentes, sin embargo, el tamaño de una muestra textual depende del tipo de lenguaje. Para alcanzar el punto mínimo de la relación de tipo hapax, Cvrček afirma que un corpus en inglés debería comprender al menos 3 millones de tokens, mientras que un corpus checo (y creemos que también un corpus eslovaco debido a la relación tipológica de las dos lenguas) debería comprender hasta 58 millones de tokens. Como dos subcorpora de nuestro análisis son más pequeños que el límite de Cvrček, su relación de tipo hapax está situada en la parte decreciente de la función de tipo hapax. 6. Conclusión En la secuela de nuestra investigación centrada en la productividad de los sufijos seleccionados en diferentes corpora y dominios, logramos responder a ambas preguntas presentadas en la Parte 4. 1. Fuimos capaces de probar que los lemmas de baja frecuencia extraídos de un corpus también incluyen potenciales neologismos, y, aunque su distribución puede variar en los datos del
7 6 Jana Levická Usage and Empirical Productivity of International Adjectival Suffixes in Slovak Revisited corpus, pueden alterar la clasificación de productividad basada en la fórmula hapax/tipo. 2. Identificamos y aplicamos modelos estadísticos para la evaluación de la productividad en las distribuciones de corpora […] LNre. Al alimentar la herramienta de código abierto con nuestros datos de corpus, recibimos un modelado visual de la productividad que nos permitió afirmar que la productividad de los sufijos analizados difiere no solo cuando se comparan textos generales y científicos, sino también entre diferentes dominios especializados. Creemos que el modelado muestra claramente el potencial real de cada uno de los sufijos analizados para producir nuevos tipos en un dominio respectivo. Sin embargo, los resultados y la clasificación de las partes 4 y 5 de este documento son bastante mutuamente incomparables porque la primera se basa directamente en datos en bruto, el recuento de tipos y hapaxes o tipos de baja frecuencia en un corpus (sub) específico, mientras que la segunda se basa en los espectros de frecuencia esperados para cada corpus (sub). En resumen, mientras que el primero representa datos reales, el segundo busca estimar la productividad de un elemento en el lenguaje específico como tal. Por lo tanto, para corpora más grandes de textos médicos y legales, deberíamos identificar más hapaxes, lo que podría dar lugar a una clasificación de sufijos diferente. Nuestras suposiciones podrían eventualmente verificarse en investigaciones futuras analizando corpora más extensos que comprenden una muestra representativa de tipos de texto relevantes para dominios específicos porque los géneros de texto también pueden desempeñar un papel en la productividad morfológica de un elemento. Dado que incluso el corpus más grande no comprendería todas las palabras, creemos que es más razonable evaluar la productividad morfológica de cualquier elemento por medio de métodos más sofisticados que el recuento en bruto de tipos o fichas. En conclusión, podría decirse que somos capaces de identificar la productividad pasada en un patrón o elemento de formación de palabras. También podemos proporcionar diferentes estimaciones de su explotación futura, es decir, la productividad potencial de Baayen. Además, incluso si completamos las medidas estadísticas con un análisis cualitativo, deberíamos tener en cuenta un hecho más: como sostiene con razón Fernández-Domínguez, las predicciones probabilísticas de la productividad morfológica deben percibirse en el contexto de factores extralingüísticos y, en particular, los que involucran las necesidades de nombramiento de una comunidad de habla. […]Si no existe la necesidad de nombramiento, no puede ocurrir ninguna formación de palabras productiva[…] (Fernández-Domínguez 2013: 438).
7 7Terminologija | 2021 | 28 Recoñecimientos El artículo ha sido escrito dentro del proyecto Corpus Nacional Eslovaco apoyado by the Slovak Academy of Sciences, Ministry of education, Science, research and por el Deporte de la República Eslovaca, el Ministerio de Cultura de la República Eslovaca y el Instituto de Lingüística Ľudovít Štúr, Academia Eslovaca de Ciencias. Lista de fuentes El cuerpo nacional eslovaco. Corpus prim-7.0-frk. ¿Qué es esto? Bratislava: Jazykovedný ústav Ľ. Štúra SAv 2018. El proyecto se encuentra en la zona de Bratislava. Accesible en el siguiente enlace: https://korpus.sk. El cuerpo nacional eslovaco. Corpus prim-9.0-público-prf. Bratislava: Jazykovedný ústav Ľ. Štúra SAv 2020. El Consejo de la Unión Europea y el Consejo de la Unión Europea Accesible en el siguiente enlace: https://korpus.sk. El cuerpo nacional eslovaco. Corpus prim-9.0-juls-todo el tiempo. Bratislava: Jazykovedný ústav Ľ. Štúra SAv 2020. El Consejo de la Unión Europea y el Consejo de la Unión Europea Accesible en el siguiente enlace: https://korpus.sk. El cuerpo nacional eslovaco. Corpus legal uno y uno. Bratislava: Jazykovedný ústav Ľ. Štúra SAv 2013. El proyecto se basa en el proyecto de proyecto de la Universidad de Bratislava. Accesible en el siguiente enlace: https://korpus.sk. El cuerpo nacional eslovaco. El cuerpo blf-2.0. Bratislava: Jazykovedný ústav Ľ. Štúra SAv 2014. El Consejo de la Unión Europea ha decidido que la Unión Europea no puede participar en el Consejo de la Unión Europea. Accesible en el siguiente enlace: https://korpus.sk. El cuerpo nacional eslovaco. Corpus ecn-2.0-público. Bratislava: Jazykovedný ústav Ľ. Štúra SAv 2016. El Consejo de la Unión Europea ha decidido que la Unión Europea no puede participar en el Consejo de la Unión Europea. Accesible en el siguiente enlace: https://korpus.sk. Slovníkový portál Jazykovedného ústavu Ľ. Štúra SAv https://slovnik.juls.savba.sk. El paquete ZipfR. Disponible en el siguiente sitio: http://zipfr.r-forge.r-project.org. REFERENCES Assadi Houssem, Bourigault Didier 1995: Classification d’adjectifs extraits d’un corpus pour l’aide à la modélisation de connaissances. – Troisièmes journées internationales d’analyse des données textuelles, 313–320. Baayen r. Harald, Lieber rochelle 1991: Productivity and english derivation: a corpus-based study. – Linguistics 29, 801–843. Baayen r. Harald 1992: quantitative aspects of morphological productivity. – Yearbook of Morphology 1991, eds. g. e. Booij, J. van Marle, Dordrecht: Kluwer Academic Publishers, 109–149. Baayen r. Harald 1993: On frequency, transparency, and productivity. – Yearbook of Morphology 1992, eds. g. e. Booij, J. van Marle, Dordrecht: Kluwer Academic Publishers, 181–208. Baayen R. Harald 1994: Productivity in production. – Language and Cognitive Processes 9, 447–469. Baayen R. Harald, Renouf Antoinette 1996: Chronicling The Times: Productive Lexical Innovations in an english Newspaper. – Language 72, 69–96. Baayen r. Harald, Lieber rochelle 1997: Word frequency distributions and lexical semantics. – Computers and the Humanities 30, 281–291. Baayen r. Harald 2009: Corpus linguistics in morphology: morphological productivity. – Corpus Linguistics. An international handbook, eds. A. Lüdeling, M. Kyto, Berlin, Mouton De gruyter, 900–919. Baker Paul, Hardie Andrew, Mcenery Tony 2006: A Glossary of Corpus Linguistics, Edinburgh: Edinburgh University Press Ltd. Available at: https://pdfs.semanticscholar.org/856a/9640311005ff8a97ab98976c9209 aa12120a.pdf. Baroni Marco 2009: Distributions in text. – Corpus Linguistics. An international handbook, eds. A. Lüdeling, M. Kyto, Berlin, Mouton De gruyter, 803–822. Available at: https://home.sslmit.unibo.it/~baroni/publications/hsk_39_dist_rev2.pdf. Carrière Isabelle 2008: Méditerm: encodage des adjectifs médicaux. – Corpus et dicionnaires de langues de spécialités, eds. F. Manize, P. Dury, N. Arlin, C. rougemont, grenoble: Presses universitaires de grenoble, 175–196. Cvrček václav 2012: How Large is the Core of Language. – Corpus Linguistics 2011 [online], Birmingham. Available at: https://www.birmingham.ac.uk/Documents/college-artslaw/corpus/conference-archives/2011/Paper-145.pdf. Daille Béatrice 2001: qualitative terminology extraction: Identifying relational adjectives. – Recent advances in computational terminology, eds. D. Bourigault, C. Jacquemin, M.-C. L’Homme, Amsterdam: John Benjamins Publishing Co, 149–166.
7 8 Jana Levická Usage and Empirical Productivity of International Adjectival Suffixes in Slovak Revisited Dokulil Miloš 1962: Teorie tvoření slov, Praha: Nakladatelství ČSAv. Evert Stefan, Lüdeling Anke 1991: Constraining psycholinguistic models of morphological processing and representation: the role of productivity. – Yearbook of morphology 1991, eds. g. Booij, J. van Marle, Dordrecht: Kluwer Academic Publishers, 165–183. evert Stefan, Baroni Marco 2007: The zipfR library: Words and other rare events in R. Presentation at useR! 2006: The Second R User Conference, Vienna, Austria. Available at: https://zipfr.r-forge.r-project.org. evert Stefan 2004: A simple LNre model for random character sequences. – Proceedings of JADT 2004, 411–422. Fernández-Domínguez Jesús 2013: Morphological Productivity Measurement: exploring qualitative versus Quantitative Approaches. – English Studies 94, 4, 422–447. garabík radovan, gianitsová Lucia, Horák Alexander, Šimková Mária 2004: Tokenizácia, lematizácia a morfologická anotácia Slovenského národného korpusu: internal document for manual morphological annotation. Unpublished. Available at: https://korpus.sk/attachments/publications/2004-garabik-gianitsova-horak-simkova-tokenizacia.pdf. Horecký Ján 1956: Základy slovenskej terminológie, Bratislava: VEDA. Horecký Ján 1999: Internacionalizácia a europeizácia slovenčiny. – Internacionalizácia v súčasných slovanských jazykoch: za a proti, ed. J. Bosák, Bratislava: veda, 80–82. Hulse Victoria 2011: Productivity in morphological negation: a corpus based approach, The university of Manchester. Available at: https://www.research.manchester.ac.uk/portal/en/theses/productivity-in-morphological-negation-a-corpusbased-approach(266d2241-a266-4b99-8fab-e19571381d8f).html. Kvizhinadze Giorgi 2010: Large number of rare events: Diversity analysis in multiple choice questionnaires and related topics, Victoria University of Wellington doctor thesis. Available at https://core.ac.uk/download/ pdf/41336663.pdf Levická Jana 2021: Usage and empirical productivity of international adjectival suffixes in Slovak based on general and specialised corpora. – Jazykovedný časopis 72, 2 (in print). L’Homme Marie-Claude 2002: Fonctions lexicales pour représenter les relations entre termes. – Traitement automatique des langues 43, 1, 19–41. L’Homme Marie-Claude 2003: Adjectifs dérivés sémantiques dans la structuration des terminologies. – Journées d’étude Terminologie, Ontologie et représentation des connaissance, Lyon. Maniez François 2002: Distinguer les termes des collocations: études sur corpus du patron < Adjectif – Nom > en anglais médical. – Actes du colloque TALN de Nancy 1, 24–27 juin 2002, 345–350. van Marle Jaap 1992: The relationship between Morphological Productivity and Frequency: A Comment on Baayen’s Performance-Orientated Conception of Morphological Productivity. – Yearbook of Morphology 1991, eds. g. Booij, J. van Marle, Dordrecht: Kluwer Academic Publishers, 151–163. Nábělková Mira 1996: variantnosť ako prvok dynamiky v adjektívnej paradigme. – Slovenská reč 61, 257–266. Naccarato Chiara 2016: A corpus-based quantitative approach to the study of morphological productivity in diachrony: The case of samo-compounds in russian. – A Blend of MaLT Hanna Christ, eds. D. Kle nov šak, L. Sönning, v. Werner, Bamberg: university of Bamberg Press, 133–153. Normand Sylvie, Bourigault Didier 2001: Analysing adjectives used in a histopathology corpus with NLP tools. – Terminology 7, 2, 155–164. Plag Ingo, Dalton-Puffer Christiane, Baayen Harald 1999: Morphological productivity across speech and writing. – English Language and Linguistics 3, 2, 209–228. Säily Tanja 2018: Change or variation? Productivity of the suffixes -ness and -ity. – Patterns of Change in 18th Century English. A Sociolinguistic Approach, eds. T. Nevalainen, M. Palander-Collin, T. Säily, Amsterdam: John Benjamins, 197–218. Ševčíková Magda 2014: Zjišťování slovotvorné produktivity z korpusových dat: přípony odvozující názvy vlastností. – Naše reč 97, 228–240. Štícha František 2012: Jak v epoše elektronických korpusů následovat Miloše Dokulila (Miloši Dokulilovi ke stému výročí narození). – Jazykovědné aktuality 49, 95–107. Štícha František 2002: K Dokulilovu pojmu slovotvorné produktivity (z hlediska korpusové analýzy). – Čeština doma a ve světě 4, 302–310. Štícha František 2007: Korpusové statistiky a slovotvorná produktivita. – Grammar & Corpora/Gramatika a korpus 2005, eds. F. Štícha, J. Šimandl, Praha: Academia, 250–257. Štícha František 2009: Slovotvorná produktivita a gramatičnost: gradační expresivní adjektiva s prefixy pra-, přea velev současné psané češtině. – Eslavística Complutense 9, 145–170.