„Knygos nobažnystės“ (1653) morfologijos tyrimo galimybės naudojant reliacinę duomenų bazę
Full text
ACTA LINGUISTICA LITHUANICA LI (2004), 1-14 L’article présente la base de données relationnelle créée pour l’étude de la morphologie des anciennes écritures DALIA JAKULYTĖ lituaniennes. Cette base de données relationnelle est utilisée pour l’étude de la morphologie des anciennes écritures lituaniennes. Un modèle de données logique a été développé et mis en œuvre dans le système de gestion de base de données (SGBD) Microsoft Access. Tous les mots de deux parties du Knyga Nobažnystės ont été entrés dans la base de données. Un moteur a été créé pour la sélection des données morphologiques (inflexionnelles), de sorte que les mots peuvent maintenant être sélectionnés par n'importe quelle propriété assignée ou ensemble de propriétés. Une telle base de données sert d'outil pour le tri, la sélection et la correction des données, ainsi que pour le stockage de textes et d'index Jor. Il permet au chercheur de traiter divers problèmes linguistiques, tels que l'alternance des racines des noms, l'auteur des textes, etc., d'une manière efficace, précise et précise. INTRODUCTION L’un des plus grands problèmes auxquels sont confrontés les linguistes qui étudient les écritures anciennes est la sélection du matériel. Les principales sources sont les textes eux-mêmes (par exemple, les photocopies de livres), les dictionnaires, les registres de mots. Les données sont ensuite transcrites (à la main ou par ordinateur), classées dans des dossiers papier, triées et rangées dans un certain ordre. La sélection de la matière d’une telle archive est un travail long et assez compliqué : on passe en revue toute l’archive, on sélectionne les feuilles nécessaires, on les classe, etc. ; À la fin du travail, les feuilles sélectionnées doivent être remises à leur place dans le dossier commun, faute de quoi celui-ci ne pourra pas être utilisé. Ces problèmes sont résolus par la technologie informatique. Pour les recherches lexicographiques, des textes informatisés, des bases de données d'écritures anciennes, etc. sont créés. L'une des caractéristiques essentielles des livres de texte informatisés est la possibilité d'effectuer une analyse automatique du texte, par exemple en effectuant automatiquement des concordances de texte, c'est-à-dire en présentant le mot recherché dans un contexte minimal. Pour l'analyse automatique de la langue, les textes doivent être marqués afin que le logiciel de concordance recherche les unités linguistiques non seulement par des caractéristiques formelles, mais aussi par des caractéristiques grammaticales. (Marseille, 1997). Cependant, seuls les langages normaux peuvent être développés et utilisés par des programmes de reconnaissance automatique des formes grammaticales de la langue, etc. Les caractères grammaticaux des anciennes écritures Oo doivent être marqués manuellement. Par exemple, le recueil de textes en lituanien de 100 millions de mots (donelaitis.vdu.lt/ tekstynas), préparé par le Centre de linguistique informatique de la Faculté des sciences humaines de l’Université Vytautas Didysis, est composé de publications de la période de l’indépendance, sélectionnées de manière à ce que le plus grand nombre possible de personnes puissent les lire.
2 | DALIA JAKULYTĖ riau refléterait la langue lituanienne écrite actuelle. Le moteur de recherche du dictionnaire vous permet de rechercher un mot, d'obtenir des informations statistiques sur le mot sélectionné, de rechercher le mot sélectionné dans une forme grammaticale spécifique (par exemple, indépendance) ou toutes les formes du mot en utilisant le symbole "*" (indépendance*). L'Institut de mathématiques et d'informatique de l'Université de Lettonie a également mis en ligne des textes d'anciens monuments d'écriture des XVIe-XVIIIe siècles avec des possibilités de recherche similaires (il est possible de rechercher un mot spécifique ou une partie de celui-ci avec le symbole « 96 ») et des fichiers archivés du dictionnaire et de l'index des fréquences des formes de mots (www.ailab.lv/senie). Un travail similaire est effectué à l’Institut de la langue lituanienne, où les textes d’écritures anciennes sont collectés ou numérisés par ordinateur et où des index des formes de mots sont établis. Il s'agit d'un système semi-manuel, c'est-à-dire que l'ordinateur ne fait que placer les formes des mots dans l'ordre alphabétique, en indiquant leur position dans le texte et en fournissant le contexte. Les informations textuelles et la signification grammaticale et lexicale d'une forme particulière de mot sont écrites à la main (Ambrazas 1998). La morphologie des écritures anciennes est traditionnellement étudiée à l'aide des mêmes cartes que celles utilisées pour les dictionnaires, mais avec un mécanisme d'utilisation différent, par exemple, la classification non seulement par les lexiques, mais aussi par d'autres caractéristiques (parties de la langue, morphèmes, verbes, formes, etc.). La structure de la base de données informatisée et les possibilités de sélection des matériaux doivent donc être adaptées en conséquence. L'idée de créer une base de données morphologique des anciennes écritures est née de la poursuite des recherches d'Antanas Jakulis sur Knygos nobažnystė (1653). En 2004, après la création de l'Académie des sciences de la République de Moldova, le nom de l'académie a été changé en Académie des sciences de la République de Moldova (en roumain : Academia Națională de Științe a Republicii Moldova). La même année, le Centre de Baltistique de l'Université de Klaipėda possédait des photocopies du Livre de l'Église (Évangiles de Summa et Prières de Krikscionisky) réalisées par A. Jakulis, et la bibliothèque de la Faculté des Arts possédait des photocopies du recueil de chants. Il est l'auteur d'un ouvrage intitulé Le Livre de l'Évangile selon Jean, qui n'a été publié qu'une seule fois, en 1995. Pour ce registre lexical, une fiche papier de tout le lexique a été constituée, c'est-à-dire des mots inscrits sur des feuilles séparées, en indiquant leurs formes principales, leur signification, leur forme grammaticale (figure 1), ces feuilles sont regroupées selon les formes principales et disposées par ordre alphabétique. Cependant, le livre a été publié dans une version remaniée, avec un nouveau titre et une nouvelle traduction, qui a été publiée par le même éditeur. Il fallait essentiellement la reconstruire, mais nous voulions qu'elle puisse être utilisée à plusieurs reprises. Il a donc été décidé de créer une base de données électronique, une base de données où les différentes données morphologiques, lexicales, sémantiques, etc. seraient collectées, triées ou filtrées et qui servirait d’outil aux chercheurs de morphologie des écritures anciennes. Le développement d'une telle base de données se compose de deux étapes principales : la conception et la réalisation. Il s'agit d'une méthode de recherche qui permet de déterminer les données à collecter, les spécificités de la base de données, les spécificités de la base de données, les spécificités de la base de données, les spécificités de la base de données. Le résultat de cette étape est une structure de données logique. Il est décrit dans cet article 2.1. dans la section 2.1. Pour plus d'informations sur le Livre de l'Église et son histoire, voir. Il a participé à la réalisation de films tels que : La vie d'un autre (1988), Le Grand amour (1988), Le Grand amour 2 (1988), Le Grand amour 3 (1988).
BASE DE DONNÉES DE L’ÉGLISE DU LIVRE | Étape 3 —réalisation de la structure de données créée dans l’un des systèmes de gestion de base de données —décrit Voir le chapitre 2.2. La base de données morphologique des écritures anciennes, qui a été créée et mise en œuvre, peut déjà être utilisée pour la recherche, c’est-à-dire, après avoir téléchargé les données et marqué leurs caractéristiques nécessaires, ces données peuvent être sélectionnées, traitées et triées dans l’ordre souhaité. La deuxième partie de l’article décrit l’application de la base de données morphologique des écritures anciennes créée pour l’étude morphologique d’une source spécifique – l’Église du Livre. 1. BASES DE DONNÉES DE MORPHOLOGIE DES ÉCRITS ANTIQUES DÉVELOPPEMENT 1.1. Structure logique des données Les éléments essentiels d’un fichier de registre lexical sont les formes des mots utilisés dans le texte (ici et ci-après, chaque forme de mot, c’est-à-dire chaque utilisation de tout lexeme, sera appelée « mot »). Une carte — un mot et ses caractéristiques (attributs) (voir figure 1). 1 PAV. Le mot de base kara forme source, page, ligne partie de la langue chief id sas, (E50 kt « à un facteur mimatytas, mistatytas, skutas metas, termmas » signification Pagizink | tq čiefą — atlankima faw/o duolds jam oF kolap éigfas ird dffiraft —| ii Bais Eshis i Chaque mot est unique. Même si le même mot est utilisé plusieurs fois sous la même forme et dans le même sens, chaque fois il sera à un endroit différent, dans un contexte différent; Si les cartes étaient numérotées, les mêmes formes de mots auraient des numéros différents. La base de données est un ensemble de données qui contient un nombre infini de données. Ses attributs – forme, source, formes fondamentales, signification, etc. Certains attributs (par exemple, une partie du langage, un paradigme) sont communs à l'ensemble du lexique. Pour définir les attributs d'un lexique, on crée un élément « Lexème » qui est lié à un élément « Mot » par une relation « un à plusieurs », c'est-à-dire qu'une entrée dans le lexique peut correspondre à plusieurs entrées dans le mot. La structure logique des données morphologiques des anciennes écritures est présentée à la figure 2.
2 PAV. STRUCTURE DE DONNÉES LOGIQUE? DALIA JAKULYTĖ Word I Zisman Lexique du mot ID Tumikabis mmeris Leksemos ID Principales f. N Socket Valeur 4 Page. f, ormos Fonction Partie de la langue Changement de ; liens. ; Asmen. Kilme La L Famille, éd.. ; nek. ; Général 1. Structure Nombre d ' unités {ns dgs., i.e. Paradigme Le degré į de mensonge. ; 100 m², 1er étage,... Mot 1. Définition /įvardž. ; rt Ormantas Forme d'action Sbendr. asm dal; f sly ... : Présentation(s) Réfléchissement ~~ /sanex; Don. Espèce fvelk ; reveik, Détermine la relation, Lip; Tar. ; Temps de fes. ; être. ; soit.d. ; Il y aura. Laiko/nuos.forma | vient. sud atlikt.sud sākt.,... Personne 11;2;3 La tige va la i ow... Valdym as Tu as un père. ; su kilm. .... Contexte / Chaîne de texte ar Phrase Texte de į l'évangile; sermon prière... Auteur Section Page Ligne Les spécificités des données morphologiques, les éléments prévus, leurs attributs et leurs relations entre eux sont décrits dans l'article sur la création d'une base de données morphologique de l'église du Livre (Jakulytė 2001). 1.2. Mise en œuvre de la base de données morphologiques Article détaillé : Base de données. Le traitement, la visualisation, la sélection, l'impression et l'introduction de nouvelles données sont effectués par un logiciel spécialisé appelé système de gestion de base de données (SGBD). La plupart des systèmes de gestion de base de données relationnelles (par exemple, Visual Basic 2005) utilisent une structure logique de données. Le nom de l'entité est affiché en haut, les attributs de l'entité sont affichés en bas. La relation « un à beaucoup » est représentée par un réseau ramifié.
Livres Églises DONNÉES BASE | 5 FoxPro, dBase, Paradox, etc.). MS Access, inclus dans la suite Microsoft Office, possède toutes les caractéristiques d'un SGBD relationnel et une bonne intégration avec les autres programmes de la suite. Les données sont stockées dans des tables. Chaque ligne de la table principale est un enregistrement distinct — (attributs de l'élément ir jo de base). Les listes d'éléments en double (attributs) sont stockées dans des tables auxiliaires. Les éléments sont écrits dans la table principale et les attributs sont sélectionnés dans les tables secondaires. Les tables liées permettent d’effectuer diverses requêtes qui vous permettent de sélectionner des informations à partir d’une ou plusieurs tables (c’est-à-dire de sélectionner les cartes appropriées dans une bibliothèque de cartes et de les placer dans l’ordre souhaité). La base de données morphologique des anciennes écritures a été réalisée en utilisant Microsoft Access 2003 DBMS. Deux tableaux principaux sont créés ici: "Mots" (pour les formes de mots) ir «Formes principales» (leksemoms)- ». Dans les tables auxiliaires, les listes d'attributs. Toutes les tables secondaires avec la relation de base liée « un su parmi beaucoup ». Les tables de la base de données morphologique des anciennes écritures et les relations entre elles sont illustrées à la figure 3. 3 PAV. DONNÉES BASE TABLEAUX IR COMMUNICATIONS TARP JŲ DBVS MS ACCÈS SCHEMA Auteur Chapitre Page Ligne Autonomie Formes principales Définition aldymas Verbe for Linksniavino, asme Daryba Mot de référence Le contrôleur d'action Racine de référence1 Racine sous-jacente 2 Priesaga (hommes) Préfixe (ii) Base de calcul Lako/nuosakos for Personne Notes : Jaknavičius Sirvydas Daukša 3 Pour l'instant, les noms des tables sont conservés. Ils, bien, ko changeable ne sera pas le — changement de nom assez compliqué, o l'utilisateur jo ne voit généralement pas.
6 | DALIA JAKULYTĖ Certains tableaux d'aide sont déjà remplis, d'autres sont en cours d'adaptation pour chaque monument d'écriture. Les tableaux des catégories grammaticales sont remplis (voir figure 3 à gauche). Chacun d'eux est composé de plusieurs graphiques: l'identifiant, le nom de l'attribut (s) et les commentaires. Le nom de l'espèce a été donné en l'honneur de l'écrivain, duomenų atrankoje galima naudoti bet kurios grafos duomenis, todėl vartotojų patomais certains auteurs utilisent aussi le nom de l'espèce en référence à l'espèce humaine (voir la liste ci-dessous- ). Les tableaux Contexte, Section, Texte et Auteur s'appliquent à chaque monument. Les tableaux « Formes de base » (leksemy) et « Valeurs » sont vides au début, mais les données peuvent être chargées à partir d'une base de données créée pour un autre monument d'écriture. TABLEAU 1. Liste des attributs d'une catégorie de lien Catégorie de lien ID Lien Latin Notes 0 i 1 gardien. 2e édition, 2 volumes. 3e compagnie d'artillerie légère. 4e armée de l'A.D.I.. 5e équipe : 5e équipe. 6e équipe : 6e équipe. Entrez. Inesyvas 7 iliat. Il. Il y a 8 étages. Ad. 9 adhérents. Al. Alimentation 10 cuillères à soupe. 21e régiment d'infanterie de ligne. G. Possess. L ' agent pathogène caractéristique
BASE DE DONNÉES DE L'ÉGLISE DES LIVRES | 7 2. APPLICATION DE LA BASE DE DONNÉES DE LIVRES ÉTUDES DE MORPHOLOGIE 2.1. Avant d'entrer les données morphologiques d'un monument spécifique, la base de données est adaptée. Il s'agit d'une étude de l'influence de la langue et de l'écriture sur l'apprentissage des langues étrangères (1982). Les différentes parties du livre ont été préparées ou traduites par différents auteurs, donc le tableau « Texte » liste les types de texte (évangile, sermon, prière, hymne...), le tableau « Auteurs » liste les auteurs connus de la Bible. Le tableau «Chapitre» est également rempli pour répertorier toutes les sections de la NC (voir fig. 6). La saisie de données commence par la saisie de texte. Les numéros de série sont indiqués dans le tableau ci-dessous. Le texte est ensuite divisé en mots, auxquels sont attribués des numéros d’identification, des ID de ligne, des ID de texte, des ID de section et des numéros de page et de ligne originaux. Toutes ces opérations sont effectuées automatiquement par des macros Microsoft Word créées par l'auteur. Dans ce texte, les limites des mots ne coïncident souvent pas avec les espaces entre les mots, le tableau est donc revu et corrigé. Les tables révisées sont chargées dans les tables «Contexte» (renommée «KNtext») et «Mots» correspondantes de la base de données de morphologie. Les ID des autres caractéristiques (genre, nombre, verbe, temps, etc.) sont enregistrés manuellement (manuellement) dans la table "Mots" de la base de données. Les nombres entiers sont des nombres réels dont les nombres réels sont des nombres entiers, c'est-à-dire des nombres réels. vns. kilm.) Il suffit d’inscrire «1», «1», «2» dans les colonnes correspondantes (voir fig. 4). 4 PAV. Un fragment du tableau "MOTS". INSTRUCTION DE FORMULE BSR | Mot I Contexte cision im ea oy i Via ro | | 20030701 dteyfiancia 200307 2 I 301 3 7 O etti(at) ateiti 2 1 2 1.12 3 0 | | 20030702 Madame 200307 2 I S01 3 7 Monsieur Monsieur la 1 1 1 2 1 0 P| 20030703 Kryftaus 0007 2 1 Sot 3 7 O Christ 102/1 1 10 0 || 20030704 ant 200307 2 1 s01 3 7 0 ant 2804/1 0 g-.0 '0 0 0 |_| 20030705 luda 200307 2 1 S01 3 7 0 soudasi sūdas 1 1 || 2 1 0 Avant de spécifier les formes de base, l'entrée correspondante est créée dans la table « Formes de base » et elle est saisie ou sélectionnée en développant la liste dans la colonne « Formes de base » de la table « Mots » (Figure 5).
8 | DALIA JAKULYTĖ 5 PAV. LENTELĖS „ŽODŽIAI“ FRAGMENTAS. PAGRINDINIŲ FORMŲ NURODYMAS | | i [K m: | a Sa Fb lg Zi Reikšmė HOE my ar ira 2 1 3 7 0 eiti(at) ateiti 2 1 1 0 | | 20030702 Pond Ar 2 1 ui 3 7 0 ponas ponas la 1 į 1; į 0 |-7| 20030703 Kryftaus 200307 2 1 sol 3 7 0 o 0 | | 20030704 ant 200307 2 1 S01 3 7 0 1 0 0 | | 20030705 fuda 200307 2 1 S01 3 7 0 Knstu Knstusas, Kristuso 1 1 0 | | 20030706 raBtas 200307 2 1 S01 3 7 0 |knvida krividė krivida, krividos 1 1 0 |_| 20030707 Bwentas 200307 2 1 S01 3 7-8 0 Įkrividijimas knvidy krividijimas, krividijimo 1 1 0 | | 20030801 primeana 200308 2 1 so 3 8 O Įkryžiavoti (nv kryžia' nukryžiavoti, --, --ojo 5 1 0 | | 20030802 Kayp 200308 2 1 S01 3 8 0 Įkryžius kryžių kryžius, kryžiaus 1 0 0 |_| 20030803 tatay 200308 2 1 S01 3 8 O Įkrosyti krosyt krosyti* 3 0 0 | | 20030804 ira 200308 2 1 S01 3 8 0 Įkrūpauti krūpai krūpauti $ 1 0 Šiuo metu į duomenų bazę suvesti SE, Pas, MKr ir K žodžiai, sužymėti tie jų požymiai, kuriems nereikia papildomų tyrimų arba tyrimai jau atlikti. Par exemple, selon l'hypothèse d'Antanas Jakulis (Jakulis 1982), la paternité des parties SE est marquée, tandis que dans la table « Formes principales » seuls l'identifiant, la niche, la forme principale implicite et l'ID de la partie langagière sont entrés. Les formes de base peuvent être ajustées et d'autres caractéristiques sont indiquées ultérieurement après avoir examiné toutes les formes du mot (voir section 3.2). Tous les signes ne sont pas indiqués pour plusieurs raisons: —les caractéristiques indiquées (emplacement, forme et formes principales) sont suffisantes pour sélectionner le matériel pour les études morphologiques, De nombreux attributs sont réservés à d'autres études, telles que la lexicologie ou la sémantique. —certaines caractéristiques ne sont nécessaires qu'à un seul chercheur (par exemple, la construction, le mot de référence, etc., ne concerneront que les spécialistes de la construction des mots), d'autres devraient être indiquées par le spécialiste concerné (par exemple, les significations — le lexicologue), etc. ; — beaucoup de caractéristiques sont discutables ou douteuses, certaines dépendent du point de départ des recherches : par exemple, le mot kalnas doit-il être considéré comme une racine ou un adverbe, un dérivé d’un adverbe, c’est-à-dire s’il est associé dans la conscience du locuteur à monter, à lever ou non? Ou vos doigts? La manière de désigner la racine — telle qu'elle est (kal-) ou avec le degré de voyelle de base (kel-) — dépend également des besoins du chercheur, par exemple, s'il veut sélectionner les mots avec un a dans la racine ou tous les dérivés d'une racine donnée. —il est souvent difficile de définir le type de moquerie (il est indiqué dans le tableau « Formes de base »), car le Livre de l’Église est riche en formes variées, par exemple: hideux/moche, honneur/- honneur, etc. Dans chaque cas, il faut d'abord faire des recherches approfondies, déterminer de quoi dépend cette variation (si elle est déterminée par la sémantique, si les différentes formes sont utilisées par différents auteurs, etc.); Il semblerait que les problèmes soient beaucoup moins importants si l’on indique le tronc d’une forme particulière (dans le tableau « Mots »), mais ici aussi, il faut douter : si l’oreille —i du tronc, les oreilles —io du tronc, l’oreille —de la graisse, alors l’oreille —? C'est donc à l'enquêteur qu'il appartient de déterminer ces caractéristiques. Pour ce faire, il est pratique d'utiliser différents modes de visualisation du matériel du système de gestion de base de données. 4 Il y a deux colonnes prévues à cet effet: «Racine» et «Racine de référence».
BASE DE DONNÉES DES LIVRES DE L'ÉGLISE | 9 2.2. Examen, tri et ajustement du matériel Le matériel peut être visualisé directement avec le principal dans les tableaux auxiliaires liés. Dans le tableau « Chapitres », nous pouvons voir le texte complet de chaque chapitre (Figure 6). 6 PAV. Fragment du tableau « CHAPITRE ». CHAPITRE 13 APERÇU DU TEXTE | | Numéro du chapitre | Livre | Titre du chapitre | Évangile | 1 Le cinquième jour de la semaine, après les trois jours de sabbat Matthieu 13, 24:30 37 =!5813 1 Antéchrist des anciens prophètes Matthieu 20, 1:16 4C | ID | Lignes | Texte + 204005 POUR LA SEMAINE 8 = 204006 POUR LA SEMAINE 9 g | + 204007 L'ÉVANGÉLIE Matt. 20. 8 mf 204008 PRiliginta ir karalifte dangaus žmoguj kutlay 1 E 204009 iBeio tšbay anklti/famdit darbinikus ing 1 EF 204010 winničią [awą o kad [udereia darbinikus iž gra-1 pip 204011 fia ant dienos/nuliunte iuos winnicion lawa. | + MAN? TeiRaias dna alina tvačia imide Ihe Rosse 1 En parcourant le texte, nous pouvons voir et modifier tous les mots et les caractères jy de chaque ligne (Figure 7). 7 PAV. VÉRIFICATION DES DONNÉES DANS LE TABLEAU «TEXTE NC* Article détaillé : Liste des épisodes d'Episode IX. + 207005 uzutaykis/pas de goût [mort sur les siècles/kal-1 = 207006 beia alors lui židay. Nubar pažind iuog welnia 1, D | Mot [Tekst[Autor] Chapitre [Puslag| Reilut{Savar|Principales fo] Signification |Kaity| Gimin] Skaid Link{Kamien|Laips] Ap |-| 20700601 alors 1 1 S20 70 6 O alors 0 0 {0 lo io 0 |-| 20700602 iam 1 1 S00 7 6 0 iis 0 1 2 11 3 o 0 |-| 20700603 židay 1 1 S20 70 6 0 juif 0 1 i 13 id 10 |_| 20700604 Maintenant 1 1 50 70 ls O maintenant maintenant 1/o 9 io 10 o 10 |» | 20700605 paind 1 1 S10 70 6 0 = connaître(pa) 0 2 | 0—13 io gv o | | 20700606 iuog 1 1 S20 70 6 0 jog 0 0:0 {0 0 o 0 | | 20700607 welnia 1 1 S20 70 6 0 = diable 0 1 1 1 4 2 0 |%) 0 0 0 0 0 0 0 10 ip 0 gig + 207007 tuiles. Abrahomés numire et prénaBay/o tu 1 en j 2 + 207008 kalbi iey kas zodi mano uzutaykis/ne ragaus 1 En examinant les formes de base, nous voyons toutes les utilisations de chaque mot (Figure 8). C'est le mode le plus pratique pour modifier les formes de base et d'autres caractéristiques du lexique, car il affiche toutes les formes de chaque mot, le texte et les chapitres où ils sont utilisés, etc. Il est donc possible de déterminer le type de fusion de chaque lexique.
