scieee AI-readable full text Open interactive document viewer

„Knygos nobažnystės“ (1653) morfologijos tyrimo galimybės naudojant reliacinę duomenų bazę

Dalia Jakulytė

Full text

ACTA LINGUISTICA LITHUANICA LI (2004), 1-14 Knygos nobažnystės (1653) morfologijos tyrimo galimybės naudojant relaacinę duomenų bazę Universidad DALIA JAKULYTĖ de Klaipėda El artículo presenta la base de datos relacional creada para la investigación de la morfología de los antiguos escritos lituanos. Se desarrolló e implementó un modelo de datos lógico dentro del sistema de gestión de bases de datos (SGBD) Microsoft Access. Todas las palabras de dos partes del Knyga Nobažnystės fueron introducidas en la base de datos. Se creó un motor para la selección de datos morfológicos (inflexibles), de modo que las palabras ahora pueden ser seleccionadas por cualquier propiedad o conjunto de propiedades asignadas. Tal base de datos sirve como una herramienta para la clasificación, selección y corrección de datos, así como el texto Jor y el almacenamiento de medios de índice. Permite al investigador abordar diversos problemas lingüísticos, como la alternancia de las raíces de los sustantivos, la autoría de los textos, etc., de una manera eficiente, clara y precisa. INTRODUCCIÓN Uno de los mayores problemas a los que se enfrentan los lingüistas que estudian las escrituras antiguas es la selección del material. Las principales fuentes de material son los propios textos (por ejemplo, fotocopias de libros), diccionarios, registros de palabras. Los datos se transcriben (a mano o por ordenador), se crean ficheros en papel, se clasifican y se ordenan en un orden determinado. La selección del material de este archivo es un trabajo largo y bastante complicado: se revisa todo el archivo, se seleccionan las hojas necesarias, se clasifican, etc. ; Al finalizar el trabajo, las hojas seleccionadas deben ser devueltas a su lugar en el archivo común, de lo contrario no será apto para su uso. La tecnología informática ayuda a resolver estos problemas. Para la investigación lexicográfica se crean textos computadorizados, bases de datos de escrituras antiguas, etc. Una de las características esenciales de los libros de texto computadorizados es la posibilidad de realizar análisis automáticos de texto, por ejemplo, hacer concordancias automáticas de texto, es decir, presentar la palabra buscada en un contexto mínimo. Para el análisis automático del lenguaje, los textos deben estar marcados para que el programa de concordancia busque unidades lingüísticas no solo por características formales, sino también por características gramaticales. (Martínez, 1997). Sin embargo, solo para el lenguaje normativo se pueden desarrollar y aplicar programas automáticos de reconocimiento de formas gramaticales del lenguaje, etc. Los signos gramaticales de las escrituras antiguas de Oo deben ser marcados manualmente. Por ejemplo, el libro de texto de 100 millones de palabras en lituano (donelaitis.vdu.lt/ tekstynas), preparado por el Centro de Lingüística Computacional de la Facultad de Humanidades de la Universidad Vytautas Didysis, está compuesto por publicaciones del período de la independencia, seleccionadas de tal manera que 2 | DALIA JAKULYTĖ riau reflejaría el idioma lituano escrito actual. El motor de búsqueda del diccionario permite realizar búsquedas por palabra, obtener información estadística sobre la palabra seleccionada, buscar la palabra seleccionada en una forma gramatical específica (por ejemplo, independencia) o todas las formas de la palabra utilizando el símbolo "*" (independencia*). El Instituto de Matemáticas e Informática de la Universidad de Letonia también ha puesto a disposición en línea textos de antiguos monumentos de escritura de los siglos XVI-XVIII con posibilidades de búsqueda similares (se puede buscar una palabra específica o parte de ella con el símbolo "96") y archivos archivados del diccionario e índice de frecuencias de formas de palabras (www.ailab.lv/senie). En el Instituto de Lengua Lituana se realiza un trabajo similar: se recopilan o se escanean textos de escrituras antiguas y se crean índices de formas de palabras. Se componen de forma semimanual, es decir, la computadora, siguiendo un programa especial, solo coloca las formas de las palabras en orden alfabético, indicando su posición en el texto y proporcionando el contexto. La información textual y el significado gramatical y léxico de una forma específica de palabra se anotan a mano (Ambrazas 1998). En el caso de las lenguas indoeuropeas, la morfología es el estudio de la morfología de las palabras, no solo de los morfemas, sino también de otras partes del lenguaje, tales como las palabras, los morfemas, los verbos, las formas, etc. La morfología de las lenguas indoeuropeas es un estudio de la morfología de las lenguas indoeuropeas. Por lo tanto, la estructura de la base de datos informática y las posibilidades de selección de material deben adaptarse en consecuencia. La idea de crear una base de datos de morfología de las antiguas escrituras surgió de la continuación de las investigaciones de Antanas Jakulis sobre la nobažnytė de Knyga (1653). En 2004, la Academia de Ciencias de Lituania (Lietuvos mokslų akademija) publicó un microfilme de la edición de 1968, que se conserva en la Biblioteca Central de la Academia de Ciencias de Lituania. En 1999, la Universidad de California en Berkeley publicó un libro sobre el tema, titulado "Las 100 mejores películas de ciencia ficción de todos los tiempos" (en inglés: The 100 Best Movies of Science Fiction of All Time). En este sentido, el libro es un ejemplo de la escritura de la Biblia en un solo libro, el Evangelio de Mateo (Mateo 28:19-20). Para este registro léxico se creó una cartografía en papel de todo el léxico, es decir, las palabras escritas en hojas separadas, indicando sus formas básicas, significado, forma gramatical (Figura 1), estas hojas se agruparon según las formas básicas y se ordenaron alfabéticamente. Sin embargo, el autor de la obra seguía escribiendo en su propio idioma, y su obra seguía teniendo un gran éxito. Básicamente, tuvo que ser reconstruida, pero queríamos hacerla adecuada para su uso repetido. Por lo tanto, se decidió crear una biblioteca electrónica, una base de datos en la que se recopilaran, clasificaran o filtraran diversos datos morfológicos, léxicos, semánticos, etc., y que sirviera como herramienta para el investigador de la morfología de las escrituras antiguas. El desarrollo de una base de datos de este tipo consta de dos etapas principales: diseño y realización. En el caso de los sistemas de información, la definición de la base de datos es el conjunto de datos que contienen las preguntas, respuestas y datos que se necesitan para responder a las preguntas. El resultado de esta etapa es una estructura lógica de datos. Se describe en este artículo En el apartado 2.1. Para más información sobre el Libro de la Iglesia y su historia, véase. 2004: El hombre de las mil caras (2004) 2006: El hombre de las mil caras 2008: El hombre de las mil caras 2009: El hombre de las mil caras 2010: El hombre de las mil caras 2011: El hombre de las mil caras 2012: El hombre de las mil caras 2013: El hombre de las mil caras 2014: El hombre de las mil caras 2015: El hombre de las mil caras 2016: El hombre de las mil caras 2017: El hombre de las mil caras 2018: El hombre de las mil caras 2018. BASE DE DATOS DE LOS LIBROS DE LA NUEVA IGLESIA | Etapa 3 —realización de la estructura de datos creada en uno de los sistemas de gestión de bases de datos —descrito En el apartado 2.2. La base de datos de morfología de las escrituras antiguas, que ya se ha creado e implementado, ya puede utilizarse para la investigación, es decir, una vez cargados los datos y marcados los atributos necesarios, estos datos se pueden seleccionar, procesar y clasificar en el orden deseado. La segunda sección del artículo describe la aplicación de la base de datos de morfología de las escrituras antiguas creada para el estudio de la morfología de una fuente específica: la Iglesia del Libro. 1. BASE DE DATOS DE MORFOLOGÍA DE ESCRITURAS ANTIGUAS DESARROLLO 1.1. Estructura lógica de los datos Los elementos principales de un registro léxico son las formas de las palabras utilizadas en el texto (en adelante, cada forma de palabra, es decir, cada uso de cualquier lexema, se denominará “palabra”). Una tarjeta — una palabra y sus características (atributos) (ver Figura 1). 1 PAV. 2009. «Las 100 mejores canciones de la historia de la música» (PDF). «Las 100 mejores canciones de la historia de la música» (PDF). «Las 100 mejores | canciones — de la historia de la música» oF (PDF). «Las 100 mejores ii canciones i de la historia de la música» (PDF). «Las 100 mejores canciones de la historia de la música» (PDF). «Las 100 mejores canciones de la historia de la música» (PDF). «Las 100 mejores canciones de la historia de la música» (PDF). «Las 100 mejores canciones de la historia de la música» (PDF). Incluso si la misma palabra se usa varias veces en la misma forma y significado, cada vez estará en un lugar diferente, en un contexto diferente; Si las tarjetas estuvieran numeradas, las mismas formas de palabras tendrían números diferentes. Por lo tanto, el elemento principal de la base de datos debe ser una palabra con un número único. Sus atributos: forma, fuente, formas básicas, significado, etc. Algunos atributos (por ejemplo, una parte del lenguaje, un paradigma) son comunes a todo el lexema. El término "conjunción" se refiere a la combinación de varios elementos de una misma palabra, por ejemplo, una palabra puede tener varias conjunciones. La estructura lógica general de los datos morfológicos de las escrituras antiguas se muestra en la Figura 2. 2 PAV. ¿Qué es una estructura de datos? DALIA JAKULYTĖ Palabra I Zisman Lexemas de la Palabra ID Tumikabis mmeris Leksemos ID Principales f. N Socket Valor 4 Pág. f, ormos Función Parte del lenguaje Cambiando los ; enlaces. ; Asmen. Kilme Familiar: L Motacilla. ; - No. No. ; General 1. Estructura Número {ns dgs., i.e. Paradigma Grado de į mentiras. ; Altura... Palabra 1. Definición /įvardž. ; rt ormantas Forma de acción Sbendr. asm dal; f Sly ... : Presentación(es) Reflexividad ~~ /sanex; Don. Especie fvelk ; reveik, Determina la relación, Lip; Alquitrán. ; Tiempo de fes. ; ser. ; es decir, ; Será. Laiko/nuos.forma | vient. sud dejar.sud comenzar.,... Persona 11;2;3 El tronco la i va ow... Valdym as Tu padre. ; su kilm. .... Oración de / cadena de texto de ar contexto El texto į del evangelio; sermón oración... Autor Sección Página Línea La definición de los términos, su significado y la relación entre ellos se describen en el artículo sobre la creación de una base de datos de morfología de la Iglesia del Libro (Jakulytė 2001). 1.2. Realización de la base de datos morfológica El equivalente electrónico de un archivo es una base de datos. Para el procesamiento, visualización, selección, impresión e introducción de nuevos datos se utiliza un software especializado: un sistema de gestión de bases de datos (DBMS). En la actualidad, los sistemas de gestión de bases de datos relacionales más utilizados (por ejemplo, Visual Studio 2005) utilizan la estructura de datos lógica para representar los elementos de la información almacenada en una base de datos. En la parte superior aparece el nombre de la entidad, en la parte inferior las propiedades de la entidad. La relación "uno con muchos" se representa con una red ramificada. LIBROS Iglesias DUOMENŲ BASE | 5 FoxPro, dBase, Paradox, etc.). MS Access es un sistema de gestión de bases de datos relacional que se integra perfectamente con el resto de aplicaciones de Microsoft Office. Los datos se almacenan en tablas. Cada fila de la tabla principal es un registro separado — (atributos del ir jo elemento principal). Las listas de elementos duplicados (atributos) se almacenan en tablas auxiliares. Los elementos se escriben en la tabla principal y los atributos se seleccionan de las tablas secundarias. Las tablas vinculadas permiten realizar varias consultas que permiten seleccionar información de una o más tablas (es decir, seleccionar las tarjetas de la biblioteca de tarjetas y colocarlas en el orden deseado). La base de datos de la morfología de las escrituras antiguas se realizó utilizando Microsoft Access 2003 DBMS. Aquí se crean dos tablas principales: "Palabras" (para las formas de las palabras) ir «Formas básicas» (leksemoms)- ». En las tablas auxiliares, las listas de atributos. Todas las tablas secundarias con una relación de enlace principal "uno su entre muchos". Las tablas de la base de datos de morfología de escrituras antiguas y las relaciones entre ellas se muestran en la Figura 3. 3 PAV. DUOMENŲ BASE TABLAS IR COMUNICACIONES TARP JŲ DBVS MS ACCESO SCHEMA Autor Capítulo Page Línea Autosuficiencia Formas básicas Definición aldymas Verbo for Linksniavino, asme Daryba Palabra clave Controlador de acción Raíz de referencia1 Raíz subyacente 2 Priesaga (personas) Prefijo (ii) base de referencia Laco/nuosakos para Persona 1. Observaciones Jaknavičius Sirvydas Daukša 3 Aquí están los nombres originales de las tablas por ahora. Ellos, bueno, ko cambiable no será el cambio de — nombre bastante complicado, el usuario o por lo jo general no ve. 6 | DALIA JAKULYTĖ Algunas tablas auxiliares ya están llenas, otras se están adaptando a cada monumento de escritura. Las tablas de categorías gramaticales (que se muestran en la Figura 3 a la izquierda) están completas. Cada uno consta de varios gráficos: identificador, nombre(s) del atributo y notas. En la tabla principal solo se guarda el identificador de la subtabla, pero para duomenų atrankoje galima naudoti bet kurios grafos duomenis, todėl vartotojų patola goma algunos atributos están definidos tanto en términos lituanos como internacionales (véase la lista de categorías de verbos en la tabla 1). Las tablas Contexto, Sección, Texto y Autor se adaptan a cada monumento de escritura. Las tablas de "Formas básicas" (leksemy) y "Valores" están inicialmente vacías, pero los datos pueden ser cargados desde la base de datos creada para otro monumento de escritura. CUADRO 1. LISTA DE ATRIBUTO DE CATEGORIA DE LINKS Categoría de LINKS ID LINKS Latín Notas 0 i 1 ward. 2.- Nombre de la persona 2. 3.- El señor de la guerra. 4.ª ed., pág. 44. 5.- La llave de la puerta. 6.- El intruso. - Entra. Inesyvas 7 iliat. - Él. 8.- El 8 de abril. Ad. Adesyvas 9 aliados. Al. Aliativa 10 cucharadas. 21.- El fusil de asalto. G. poses. El agente causal característico BASE DE DATOS DE LIBROS DE LA NUEVA IGLESIA | 7 2. APLICACIÓN DE LAS BASES DE DATOS A LAS BASE DE DATOS DE LIBROS PARA LOS ESTUDIOS DE MORFOLOGÍA 2.1. Antes de introducir los datos morfológicos de un monumento de una determinada escritura, se adapta la base de datos. Por ejemplo, el estudio del lenguaje KN debe tener en cuenta la estructura del texto y la autoría (ver Jakulis 1982, 1984). En la tabla "Texto" se enumeran los tipos de texto (evangelios, sermones, oraciones, himnos, etc.) y en la tabla "Autores" se enumeran los autores conocidos de la Biblia. Se rellenará también el cuadro «Capítulo» para incluir todas las secciones de la NC (véase el gráfico 6). La entrada de datos comienza con la escritura. El número de líneas de la tabla se asigna a cada línea de la tabla. A continuación, el texto se divide en palabras, se les asignan números de identificación, se etiquetan con el ID de línea, el ID de texto, el ID de sección y los números de página y línea originales. Todas estas acciones se llevan a cabo automáticamente por las macros del editor de texto Microsoft Word creadas por el autor. Dado que en este texto los límites de las palabras a menudo no coinciden con los espacios entre las palabras, la tabla resultante se revisa y corrige. Las tablas vistas se cargan en las tablas correspondientes de la base de datos de morfología, "Contexto" (que se ha renombrado como "KNtext") y "Palabras- ". Los ID de otros atributos (genro, número, verbo, tiempo, etc.) se registran manualmente (no automáticamente) en la tabla de la base de datos "Palabras- ". Para facilitar la introducción, los ID son números, números de serie de la categoría correspondiente, por lo que, por ejemplo, la forma de la palabra Kryftus (hombre. vns. kilm.) Para ello, basta con escribir «1», «1» y «2» en los cuadros correspondientes (véase la figura 4). 4 PAV. El fragmento de la tabla "Palabras". INSTRUCCIÓN DE FORMA BSR | Palabra I Contexto cision im ea oy i Vía ro | | 20030701 dteyfiancia 200307 2 I 301 3 7 O etti(at) venido 2 1 2 1.12 3 0 | | 20030702 Señora 200307 2 I S01 3 7 señor señor la 1 1 1 2 1 0 P| 20030703 Kryftaus 0007 2 1 Sot 3 7 O Kristus 102/1 1 10 0 || 20030704 ant 200307 2 1 s01 3 7 0 ant 2804/1 0 g-.0 '0 0 0 |_| 20030705 luda 200307 2 1 S01 3 7 0 sūdasi sūdas 1 1 || 2 1 0 Antes de especificar las formas básicas, se crea la entrada correspondiente en la tabla "Formas básicas" y se escribe en la columna "Formas básicas" de la tabla "Palabras" o se selecciona expandiendo la lista (Figura 5). 8 | DALIA JAKULYTĖ 5 PAV. El fragmento de la tabla "Palabras". Indicación de las formas básicas | | i [K m: | a Sa Fb lg Zi Significado HOE my ar ira 2 1 3 7 0 ir(at) venir 2 1 1 0 | | 20030702 Pond Ar 2 1 ui 3 7 0 señor señor la 1 a 1; a 0 |-7| 20030703 Kryftaus 200307 2 1 sol 3 7 0 o 0 | | 20030704 an 200307 2 1 S01 3 7 0 1 0 0 | | 20030705 fuda 200307 2 1 S01 3 7 0 Knstu Knstus, Cristo 1 1 0 | | 20030802 Kayp 200308 2 1 S01 3 8 0 Crucifixión crucifixión, crucificación 1 1 0 |_| 20030803 tatay 200308 2 1 S01 3 8 O Įkrosyti krosyt krosyti* 3 0 0 | | 20030804 ira 200308 2 1 S01 3 8 0 Įkrūpauti krūpai krūpauti $ 1 0 Actualmente, las palabras SE, Pas, MKr y K están incluidas en la base de datos, y se han marcado aquellos de sus caracteres que no requieren estudios adicionales o que ya han sido estudiados. Por ejemplo, la hipótesis de Antanas Jakulis (Jakulis 1982) marca la autoría de las partes SE, y en la tabla "Formas principales" solo se introduce el identificador, el nicho, la forma principal implícita y el ID de la parte del lenguaje. Las formas básicas pueden modificarse y otras características se indican más adelante después de examinar todas las formas de la palabra (véase la sección 3.2). No todos los signos se muestran por varias razones: —las características especificadas (ubicación, forma y formas principales) son suficientes para la selección del material para los estudios morfológicos, Muchas de las características están reservadas para otros estudios, como la lexicología o la semántica. —algunas características son necesarias solo para otro investigador (por ejemplo, la formación, la palabra de referencia, etc., solo se ocuparán de los especialistas en formación de palabras- ), algunas deberían ser indicadas por el especialista correspondiente (por ejemplo, significados —lexicólogo), etc. ; —muchos signos son discutibles o dudosos, algunos dependen del punto de partida de los estudios: por ejemplo, la palabra montaña debe considerarse como una raíz o un prefijo, un derivado del prefijo, es decir, ¿se asocia en la conciencia del hablante con subir, levantar o no? ¿O tus manos? La forma de indicar la raíz, tal como está (kal-) o con el grado de vocalización de base (kel-), también depende de las necesidades del investigador, por ejemplo, si quiere seleccionar palabras con una a en la raíz o todos los derivados de una determinada raíz. —a menudo es difícil definir el tipo de broma (se indica en la tabla “Formas básicas”- ), ya que en el Libro de la Iglesia hay muchas formas variadas, por ejemplo: horrible/- feo, honor/honor, etc. En cada uno de estos casos es necesario realizar primero una investigación detallada, determinar de qué depende esta variación (si está determinada por la semántica, si las diferentes formas son utilizadas por diferentes autores, etc.); Al parecer, cuánto menos problemas deberían surgir al indicar el tronco de una forma específica (en la tabla "Palabras"), pero también aquí hay que dudar: si el oído —i del tronco, los oídos —io del tronco, los oídos —de la grasa, entonces el oído —? Por lo tanto, estas señales se dejan al propio investigador para resumirlas. Para esto, es conveniente usar diferentes modos de visualización de material del sistema de gestión de bases de datos. 4 Es cierto que existen dos columnas para ello: “Raíz” y “Raíz de referencia”. BASE DE DATOS DE LIBROS DE LA NUEVA IGLESIA | 9 2.2. Revisión, clasificación y corrección del material El material se puede ver directamente con el principal en tablas auxiliares vinculadas. En la tabla "Capítulos" podemos ver el texto completo de cada capítulo (Figura 6). 6 PAV. Fragmento de la tabla "Capítulo". CAPÍTULO 13 RESUMEN DEL CONTENIDO | | ID del capítulo | Libro | Título del capítulo | Evangelio | Introducción 1 En la quinta semana después de las tres guerras Mateo 13, 24:30 37 =!5813 1 Antecedentes de los antiguos uzugavenių Mateo 20, 1:16 4C | ID | Filas | Texto + 204005 ANT NEDELOS 8 = 204006 SENU UZUGAVENIU. g | + 204007 EVANGELIO Mat. 20. 8 mf 204008 PRiliginta y karalifte dangaus žmoguj kutlay 1 E 204009 iBeio tšbay anklti/famdit darbinikus ing 1 EF 204010 winničią [awą o kad [udereia darbinikus iž gra-1 pip 204011 fia ant dienos/nuliunte iuos winnicion lawa. | + MAN? TeiRaias dna alina tvačia imide Ihe Rosse 1 Al navegar por el texto, podemos ver y editar todas las palabras y los caracteres jy de cada línea (Figura 7). 7 PAV. REVISIÓN DE LOS DATOS DE LA TABLA «TEXTO NC* Página oficial de la serie en IMDb (en inglés) + 207005 uzutaykis/no sabor [muerte en los siglos/kal-1 = 207006 beia entonces él židay. Nubar pažind iuog welnia 1, D | Palabra [Tekst[Autor] Sección [Puslag| Reilut{Savar|Principal fo] Significado |Kaity| Gimin] Skaid Link{Kamien|Laips] Ap |-| 20700601 entonces 1 1 S20 70 6 O entonces 0 0 {0 lo io 0 |-| 20700602 iam 1 1 S00 7 6 0 iis 0 1 2 11 3 o 0 |-| 20700603 židay 1 1 S20 70 6 0 judío 0 1 i 13 id 10 |_| 20700604 Ahora 1 1 50 70 ls O ahora ahora 1/o 9 io 10 o 10 |» | 20700605 paind 1 1 S10 70 6 0 = conocer 0 2 | 0—13 io gv o | | 20700606 iuog 1 1 S20 70 6 0 jog 0 0:0 {0 0 o 0 | | 20700607 welnia 1 1 S20 70 6 0 = diablo 0 1 1 1 4 2 0 |%) 0 0 0 0 0 0 0 10 ip 0 gig + 207007 tiene. Abrahomés numire y prénaBay/o tu 1 a j 2 + 207008 kalbi iey kas zodi mano uzutaykis/ne ragaus 1 Al examinar las formas básicas, vemos todos los casos de uso de cada palabra (Figura 8). Es el modo más conveniente para editar las formas básicas y otros atributos del léxico, ya que muestra todas las formas de cada palabra, el texto y los capítulos donde se utilizan, etc. Por lo tanto, es posible determinar el tipo de cambio de cada lexema.