scieee AI-readable full text Open interactive document viewer

„Knygos nobažnystės“ (1653) morfologijos tyrimo galimybės naudojant reliacinę duomenų bazę

Dalia Jakulytė

Full text

ACTA LINGUISTICA LITHUANICA LI (2004), 1-14 L'articolo presenta il database relazionale creato per l'indagine della morfologia degli antichi scritti lituani, che è stato DALIA JAKULYTĖ utilizzato per la prima volta nel 2006. Un modello logico di dati è stato sviluppato e implementato all'interno del sistema di gestione di database Microsoft Access (DBMS). Tutte le parole di due parti del Knyga Nobažnystės sono state inserite nel database. È stato creato un motore per la selezione dei dati morfologici (inflessionali), in modo che le parole possano ora essere selezionate da qualsiasi proprietà assegnata o insieme di proprietà. Tale database funge da strumento per l'ordinamento, la selezione e la correzione dei dati, nonché per la memorizzazione di testi Jor e di media di indice. Consente al ricercatore di affrontare vari problemi linguistici, come l'alternanza delle radici dei sostantivi, l'autore di testi ecc. in modo efficiente, accurato e accurato. INTRODUZIONE Uno dei maggiori problemi che i linguisti devono affrontare nello studio degli scritti antichi è la selezione del materiale. Le principali fonti di materiale sono i testi stessi (ad esempio fotocopie di libri), dizionari, registri di parole. I dati vengono trascritti (a mano o con un computer) in cartelle cartacee, ordinati e ordinati in un certo ordine. La selezione del materiale da un tale archivio è un lavoro lungo e piuttosto complicato: si esamina l’intero archivio, si selezionano i fogli necessari, li si ordina, ecc. ; Al termine del lavoro, i fogli selezionati devono essere rimessi al loro posto nel fascicolo comune, altrimenti non sarà utilizzabile. La tecnologia informatica aiuta a risolvere tali problemi. Per la ricerca lessicografica vengono creati testi informatici, banche dati di scritti antichi, ecc. Una caratteristica essenziale dei libri di testo informatici è la possibilità di eseguire analisi automatiche del testo, come la concordanza automatica del testo, ovvero la presentazione della parola ricercata in un contesto minimo. Per l'analisi automatica del linguaggio, i testi devono essere contrassegnati in modo che il programma di concordanza possa cercare le unità linguistiche non solo in base alle caratteristiche formali, ma anche in base alle caratteristiche grammaticali. (Roma, 1997). Tuttavia, solo per il linguaggio normativo è possibile sviluppare e applicare programmi automatici per il riconoscimento delle forme grammaticali del linguaggio o simili, i segni grammaticali delle vecchie scritture Oo devono essere contrassegnati manualmente. Ad esempio, il testo di 100 milioni di parole della lingua lituana (donelaitis.vdu.lt/ tekstynas), preparato dal Centro di Linguistica Informatica della Facoltà di Scienze Umane dell’Università Vytautas Didysis, è composto da pubblicazioni del periodo dell’indipendenza, selezionate in modo da 2 | DALIA JAKULYTĖ ria rifletterebbe l'attuale lingua lituana scritta. Il motore di ricerca del dizionario permette di cercare una parola, ottenere informazioni statistiche sulla parola selezionata, cercare la parola selezionata in una forma grammaticale specifica (ad esempio indipendenza) o tutte le forme della parola utilizzando il simbolo "*" (indipendenza*). L’Istituto di Matematica e Informatica dell’Università della Lettonia ha messo a disposizione online anche i testi degli antichi monumenti scritti del XVI-XVIII secolo con simili possibilità di ricerca (è possibile cercare una parola specifica o una parte di essa con il simbolo “96”) e i file archiviati del dizionario e dell’indice delle frequenze delle forme delle parole (www.ailab.lv/senie). Un lavoro simile viene svolto anche all’Istituto della Lingua Lituana, dove vengono raccolti o scannerizzati i testi delle antiche scritture e creati indici delle forme delle parole. Essi sono semi-manuali, il che significa che un computer, utilizzando un programma speciale, si limita a disporre le forme delle parole in ordine alfabetico, indicando la loro posizione nel testo e fornendo il contesto. Le informazioni testuali e il significato grammaticale e lessicale di una particolare forma di parola sono registrati a mano (Ambrazas 1998). Per la morfologia delle scritture antiche si usano tradizionalmente le stesse cartografie che per i dizionari, ma il meccanismo di utilizzo è diverso, per esempio, la classificazione non avviene solo in base ai lessemi, ma anche in base ad altri segni (parti del linguaggio, morfemi, aggettivi, forme, ecc.). Di conseguenza, la struttura della banca dati informatizzata e le possibilità di selezione del materiale devono essere adattate di conseguenza. L'idea di creare una banca dati morfologica delle antiche scritture è nata continuando le ricerche iniziate da Antanas Jakulis sulla Knygos nobažnystė (1653). Fino al 2004, quando è apparsa l’edizione facsimile del Libro della Chiesa (Pociūtė, red., 2004), i linguisti lituani avevano a disposizione solo un microfilm realizzato nel 1968 (conservato nella Biblioteca Centrale dell’Accademia delle Scienze). Nello stesso anno, il Centro Baltico dell’Università di Klaipėda possedeva fotocopie del Libro della Chiesa (Vangeli di Summa e Preghiere di Krikscionisky) realizzate da A. Jakulis, mentre la biblioteca della Facoltà di Arti possedeva fotocopie dell’innario. Di questi, A. Jakulis ha compilato un registro del lessico della Chiesa del Libro, del quale è stata pubblicata solo una parte — il lessico dei Vangeli di Summa (Jakulis 1995). Per questo registro del lessico è stata creata una cartografia cartacea di tutto il lessico, cioè le parole sono state scritte su fogli separati, indicando le loro forme principali, il significato, la forma grammaticale (figura 1), questi fogli sono stati raggruppati secondo le forme principali e disposti in ordine alfabetico. Tuttavia, il compilatore continuò a studiare il linguaggio del Libro della Chiesa, utilizzando la sua cartografia e riordinando i fogli in un ordine che solo lui conosceva. Fondamentalmente, doveva essere ricomposta, ma volevamo renderla adatta a un uso ripetuto. Si è quindi deciso di creare una cartella elettronica, una banca dati in cui raccogliere, ordinare o filtrare i vari dati morfologici, lessicali, semantici, ecc., e che serva da strumento allo studioso della morfologia delle scritture antiche. La creazione di un database di questo tipo consiste in due fasi principali: progettazione e realizzazione. La progettazione determina il tipo di dati necessari per lo studioso della morfologia delle scritture antiche, definisce la specificità, le caratteristiche e le interrelazioni di questi dati e prevede a quali domande deve rispondere il database. Il risultato di questa fase è una struttura logica dei dati. È descritto in questo articolo 2.1. Per ulteriori informazioni sul Libro della Chiesa e la sua storia, vedere. Dainora Pociūtė (2004), Ingė Lukšaitė (2001), Zigmas Zinkevičius (1988: 213-223), Juozas Tumelis (1967, 1968) e altri. BASE DI DATI DELLA CHIESA DEL LIBRO | Fase 3 —realizzazione della struttura di dati creata in uno dei sistemi di gestione di database —descritto 2.2. Una volta creato e implementato, il database morfologico delle scritture antiche può essere utilizzato per la ricerca, ovvero, dopo aver caricato i dati e contrassegnato le caratteristiche necessarie, selezionare, gestire e ordinare i dati nell'ordine desiderato. Il secondo capitolo dell’articolo descrive l’applicazione del database morfologico creato per le antiche scritture allo studio morfologico di una fonte specifica, la Chiesa del Libro. 1. BANCA DATI DELLA MORFOLOGIA DEGLI ANTICHI SCRITTI SVILUPPO 1.1. Struttura logica dei dati Gli elementi fondamentali di un registro lessicale sono le forme delle parole usate nel testo (qui di seguito ogni forma di parola, cioè ogni uso di un lessimo, sarà definita “parola”). Una scheda — una parola e i suoi attributi (vedi Figura 1). 1 pag. CARTELLA DEL LESSICO DELLA CHIESA LIBRO parola principale kara forma fonte, pagina, riga parte della lingua chief id sas, (E50 kt "a un fattore mimatytas, mistatytas, skutas metas, termmas" significato | Pagizink tq — čiefą atlankima faw/o oF duolds jam kolap éigfas ird ii dffiraft —| i Bais Eshis Ogni parola è unica. Anche se la stessa parola viene usata più volte nella stessa forma e significato, ogni volta sarà in un posto diverso, in un contesto diverso; Se le carte fossero numerate, le stesse forme di parole avrebbero numeri diversi. Pertanto, l'elemento principale del database deve essere una parola con un numero univoco. I suoi attributi: forma, origine, forme fondamentali, significato, ecc. Alcuni attributi (ad esempio, una parte del linguaggio, un paradigma) sono comuni a tutti i lessemi. Per definire gli attributi di un lessamo, viene creato un elemento "Lessamo" collegato all'elemento "Parola" in una relazione "uno a molti", cioè una voce "Lessamo" può corrispondere a più voci "Parola". La struttura logica dei dati morfologici delle antiche scritture è riassunta nella Figura 2. 2 pag. STRUTTURA DEI DATI LOGICA? DALIA JAKULYTĖ Parola I Zisman Il Lessico della Parola ID Tunicatum Tunicatum leucospermum ID Principali f. N Socket Valore 4 Pag. f, Ormos Funzione Parte del linguaggio Cambiare i link. ; ; Asmen. Origine La L famiglia, su motto.it. ; Nessuno. ; Generale Struttura Numero {ns dgs., i. e. Paradigma Il grado di į menzogna. ; Altezza... Pamat. Parola Definizione /Identificrt azione ; ormante Forma di azione Sbendr. asm dal; f Sly. ... : Allegato(i) Riflettività ~~ /sanex; Don. Specie fvelk ; reveik, Determina il diritto, Lip; Catrame. ; È ora di fes. ; essere. ; ad es. ; 200 mg una volta al giorno per 12 settimane. Laiko/nuos.forma | viene. sud atlikt.sud iniziare.,... Persona 11;2;3 Il tronco la i va ow... Valdim. as Hai un papà. ; su kilm. .... Contesto / stringa di testo frase ar Il testo del į Vangelo; sermone preghiera.- .. Autore Sezione Pagina Riga Ulteriori informazioni sulle specifiche dei dati morfologici, gli elementi previsti, i loro attributi e le loro relazioni sono descritte nell'articolo sulla creazione del database morfologico della Chiesa del Libro (Jakulytė 2001). 1.2. Realizzazione di una banca dati morfologica L'equivalente elettronico di un archivio è una banca dati. Per l'elaborazione, la visualizzazione, la selezione, la stampa e l'inserimento di nuovi dati viene utilizzato un software specializzato - un sistema di gestione di database (DBMS). Dabartiniu metu plačiausiai taikomos reliacinės duomenų bazių valdymo sistemos (pvz., Visual 2 Duomenų bazėje saugomos informacijos elementas —esybė —loginėje duomenų struktūroje žymimas stačiakampiu. Il nome dell'entità è elencato in alto, mentre gli attributi sono elencati in basso. La relazione uno-a-molti è rappresentata da una rete ramificata. LIBRI Chiese DATI BASE | 5 FoxPro, dBase, Paradox, ecc.). MS Access, un DBMS incluso nella suite Microsoft Office, ha tutte le caratteristiche di un DBMS relazionale e si integra perfettamente con gli altri programmi della suite. I dati vengono memorizzati in tabelle. Ogni riga della tabella principale è un record separato — (elemento principale ir jo attributi). Gli elenchi di elementi duplicati (attributi) sono memorizzati in tabelle secondarie. Gli elementi vengono scritti nella tabella principale e gli attributi vengono selezionati dalle tabelle secondarie. Quando si collegano le tabelle, è possibile eseguire una serie di query che consentono di estrarre informazioni da una o più tabelle, ad esempio scegliere le schede desiderate da una raccolta di schede e disporle nell'ordine desiderato. Sulla base della struttura logica dei dati, il database morfologico delle antiche scritture è stato realizzato utilizzando Microsoft Access 2003 DBMS. Qui vengono create due tabelle principali: "Parole" (per le forme delle parole) ir «Forme principali» (per le lexeme)». Tabelle ausiliarie: elenchi di attributi. Tutte le tabelle secondarie con una relazione di collegamento principale "Uno tra su molti". Le tabelle del database morfologico delle scritture antiche e le relazioni tra di esse sono mostrate nella Figura 3. 3 PAV. DATI BASE TABELLINE IR COMUNICAZIONI Tarp JŲ DBVS MS ACCESSO SCHEMA Autore Capitolo Pagina Riga Autonomia Forme principali Definizione aldymas Verbo for Linksniavino, asme Operazione Parola di riferimento Controllo di azione Radice di riferimento1 Radice di base 2 Aggiungi (os) Prefisso (ii) base operativa Vernice/nuova per Persona Osservazioni Giacobbe Sirvydas Acciaio inossidabile 3 Per il momento, i nomi originali delle tabelle sono rimasti. Essi, bene, ko modificabile non sarà la modifica del — nome piuttosto complicato, l'utente di o solito non jo vede. 6 | DALIA JAKULYTĖ Alcune tabelle ausiliarie sono già state compilate, altre sono in fase di adattamento per ogni monumento della scrittura. Le tabelle delle categorie grammaticali sono state compilate (vedi Figura 3 a sinistra). Ciascuno di essi è composto da diversi grafici: identificatore, nome o nomi degli attributi e note. Nella tabella principale viene inserito solo l'identificatore dalla sottotabella, ma per duomenų atrankoje galima naudoti bet kurios grafos duomenis, todėl vartotojų patola gomma alcuni attributi sono definiti sia in termini italiani che internazionali (vedi l'elenco delle categorie di verbi nella tabella 1). Le tabelle Contesto, Sezione, Testo e Autore sono personalizzate per ogni monumento. Le tabelle "Lexemy" e "Values" sono vuote all'inizio, ma i dati possono essere caricati da un database creato per un altro monumento. TABELLA 1. ELENCO DEGLI ATTRIBUTI DELLA CATEGORIA DI LINKS Categoria di link ID Link Latino Note 0 i 1 ward. 2, 2000, pagg. G. Kilmininkas 3 punti D. Utilizzatore d 4 gal. A. Il posteriore 5 innag. I. Il guardiano 6 ines. Entra. 7 ^ Ibid. pagg. Il. 8 ^ Ibid. pagg. Ad. Adesyvas 9 alleati. Al. Alimentazione 10 cucchiai. 21 ^ Il fuggitivo, pag. G. Possesso. L'agente causale caratteristico BASE DI DATI DEI LIBRI DELLA NUOVA CHIESA | 7 2. APPLICAZIONE DELLE BASE DI DATI ALLE BASE DI DATI DEI LIBRI PER STUDI MORFOLOGICI 2.1. Prima di inserire i dati morfologici di un monumento specifico, il database viene personalizzato. Per esempio, lo studio della lingua KN deve tenere conto della struttura del testo e dell’autore (per maggiori dettagli, vedi Jakulis 1982, 1984). Le diverse parti del libro sono state preparate o tradotte da autori diversi, quindi la tabella “Testo” elenca i tipi di testo (vangelo, sermone, preghiera, inno...), la tabella “Autori” elenca gli autori noti della Bibbia. Compilare anche la tabella «Sezione» per elencare tutte le sezioni NC (cfr. figura 6). L'immissione dei dati inizia con la digitazione di testo. Il testo compilato viene caricato in una tabella a righe, con numeri di identificazione assegnati alle righe. Il testo viene quindi suddiviso in parole, a cui vengono assegnati numeri di identificazione, identificatori di riga, identificatori di testo, identificatori di sezione e numeri di pagina e riga originali. Tutte queste operazioni vengono eseguite automaticamente dalle macro di Microsoft Word create dall'autore. Poiché in questo testo i confini delle parole spesso non coincidono con gli spazi tra le parole, la tabella creata viene rivista e corretta. Le tabelle visualizzate vengono caricate nelle corrispondenti tabelle "Contesto" (rinominata "KNtext") e "Parole" del database morfologico. Gli ID degli altri attributi (genere, numero, verbo, tempo, ecc.) vengono registrati manualmente nella tabella "Parole" del database. Per comodità di immissione, gli ID sono numeri, numeri di serie della categoria corrispondente, quindi, ad esempio, per la forma della parola Crif (maschio. vns. 100 mg/ kg basta inserire «1», «1», «2» nelle rispettive colonne (cfr. figura 4). 4 pag. UNA PARTE DELLA TAVOLA "PAROLE- ". INDICAZIONE DELLA FORMA BSR | Parola I Contesto cision im ea oy i Via ro | | 20030701 dteyfiancia 200307 2 I 301 3 7 O etti(at) ateiti 2 1 2 1.12 3 0 | | 20030702 Signora 200307 2 I S01 3 7 signor signor la 1 1 1 2 1 0 P| 20030703 Kryftaus 0007 2 1 Sot 3 7 O Cristo 102/1 1 10 0 || 20030704 ant 200307 2 1 s01 3 7 0 ant 2804/1 0 g-.0 '0 0 0 |_| 20030705 luda 200307 2 1 S01 3 7 0 succo di merda 1 1 || 2 1 0 Prima di specificare le forme di base, la voce corrispondente viene creata nella tabella "Forme di base" e viene inserita nella colonna "Forme di base" della tabella "Parole" o selezionata espandendo l'elenco (Figura 5). 8 | 5 PAV. UNA PARTE DELLA TAVOLA "PAROLE". Indice delle forme di base | | i [K m: | a Sa Fb lg Zi Significato HOE my ar ira 2 1 3 7 0 andare(at) venire 2 1 1 0 | | 20030702 Pond Ar 2 1 ui 3 7 0 signore signore la 1 a 1; a 0 |-7| 20030703 Kryftaus 200307 2 1 sol 3 7 0 o 0 | | 20030704 an 200307 2 1 S01 3 7 0 1 0 0 | | 20030705 fuda 200307 2 1 S01 3 7 0 Knstu Knstus, Cristo 1 1 0 | | 20030801 primeana 200308 2 1 so 3 8 O Crocifisso crocifisso, crocifisso 1 1 0 | | 20030802 Kayp 200308 2 1 S01 3 8 0 Crocifisso croce croce, croce 1 0 0 |_| 20030803 tatay 200308 2 1 S01 3 8 O Įkrosyti krosyt krosyti* 3 0 0 | | 20030804 ira 200308 2 1 S01 3 8 0 Įkrūpauti krūpai krūpauti $ 1 0 Attualmente sono presenti nel database le parole SE, Pas, MKr e K, con indicazione dei segni che non richiedono ulteriori ricerche o per i quali sono già state effettuate ricerche. Perciò, ad esempio, secondo l'ipotesi di Antanas Jakulis (Jakulis 1982) è stata contrassegnata l'autorizzazione delle parti SE, mentre nella tabella "Forme principali" sono stati inseriti solo l'identificatore, il nido, la forma principale implicita e l'ID della parte del linguaggio. Le forme di base possono essere modificate e gli altri segni sono indicati successivamente, dopo aver esaminato tutte le forme della parola (vedere paragrafo 3.2). Non tutti i segni sono elencati per diversi motivi: —le caratteristiche indicate (posizione, forma e forme principali) sono sufficienti per selezionare il materiale per gli studi morfologici, Molti segni sono riservati ad altri studi, come la lessicologia o la semantica. —alcune caratteristiche sono necessarie solo ad un altro ricercatore (ad esempio, la formazione, la parola di base, ecc., si occuperanno solo gli specialisti della formazione delle parole), alcune dovrebbero essere indicate dallo specialista in questione (ad esempio, i significati — il lessicologo), ecc. ; —molti segni sono discutibili o dubbi, alcuni dipendono dal punto di partenza delle ricerche: ad esempio, la parola montagna deve essere considerata radice o prefisso, derivato del prefisso, cioè se nella coscienza del parlante è associata con salire, alzare o no? E le mani? Il modo di indicare la radice — così com'è (kal-) o con il grado di vocalizzazione di base (kel-) — dipende anche dalle esigenze dello studioso, ad esempio se vuole selezionare le parole con la a nella radice o tutti i derivati di una determinata radice". — Spesso è difficile definire il tipo di scherno (indicato nella tabella “Forme principali- ”), poiché il Libro della Chiesa è ricco di forme diverse, ad esempio: brutto/brutto, onore/onore, ecc. In ogni caso, occorre prima fare una ricerca approfondita per stabilire da cosa dipende questa variazione (se è determinata dalla semantica, se le forme diverse sono usate da autori diversi, ecc.); Sembra, quanto meno problemi dovrebbero sorgere per indicare una forma specifica del tronco (nella tabella "Parole"- ), ma anche qui si deve dubitare: se orecchie —i tronco, orecchie —io tronco, orecchie —di grasso, allora orecchio —? Pertanto, tali segni sono lasciati al ricercatore stesso per riassumere. Per questo, è conveniente utilizzare diverse modalità di visualizzazione del materiale del sistema di gestione del database. 4 Sono previste due colonne: "Radice" e "Radice di riferimento". BASE DI DATI DEI LIBRI DELLA NUOVA CHIESA | 9 2.2. Revisione, selezione e correzione del materiale Il materiale può essere visualizzato direttamente con il principale nelle tabelle ausiliarie collegate. Nella tabella Capitoli possiamo vedere il testo completo di ogni capitolo (Figura 6). 6 pag. FRANCHIZZO DELLA TAVOLA "CAPITOLO". CAPITOLO 13 SOMMARIO | | ID del capitolo | Libro | Titolo del capitolo | Vangelo | Inizio pu: 1 Nella quinta settimana dopo le tre guerre Matteo 13, 24:30 37 =!5813 1 Annunciazione di un vecchio profeta Matteo 20, 1:16 4C | ID | Righe | Testo + 204005 ALLA SETTIMANA 8 = 204006 ALLA SETTIMANA 10 g | + 204007 VANGELO DI MATT. 20. 8 mf 204008 PRiliginta ir karalifte dangaus žmoguj kutlay 1 E 204009 iBeio tšbay anklti/famdit darbinikus ing 1 EF 204010 winničią [awą o kad [udereia darbinikus iž gra-1 pip 204011 fia ant dienos/nuliunte iuos winnicion lawa. | + MAN? TeiRaias dna alina tvačia imide Ihe Rosse 1 Quando si visualizza il testo, possiamo vedere e modificare tutte le parole e i caratteri di ogni riga (Figura 7). 7 pag. ESCLUSIONE DEI DATI NELLA TAVOLA «TESTO NC* (EN) Scheda su IMDb, su imdb.com. + 207005 uzutaykis/non assaggiare [morte su eternità- /kal-1 = 207006 beia poi gli židay. Nubar pažind iuog welnia 1, D | Parola [Tekst[Autor] Sezione [Puslag| Reilut{Savar|Principali fo] Significato |Kaity| Gimin] Skaid Link{Kamien|Laips] Ap |-| 20700601 allora 1 1 S20 70 6 O allora 0 0 {0 lo io 0 |-| 20700602 iam 1 1 S00 7 6 0 iis 0 1 2 11 3 o 0 |-| 20700603 židay 1 1 S20 70 6 0 ebreo 0 1 i 13 id 10 |_| 20700604 Ora 1 1 50 70 ls O ora ora 1/o 9 io 10 o 10 |» | 20700605 paind 1 1 S10 70 6 0 = conoscere(pa) 0 2 | 0—13 io gv o | | 20700606 iuog 1 1 S20 70 6 0 jog 0 0:0 {0 0 o 0 | | 20700607 welnia 1 1 S20 70 6 0 = diavolo 0 1 1 1 4 2 0 |%) 0 0 0 0 0 0 0 0 10 ip 0 gig + 207007 ha. Abrahomés numire e prénaBay/o tu 1 in j 2 + 207008 kalbi iey kas zodi mano uzutaykis/ne ragaus 1 Guardando le forme di base, vediamo tutti gli usi di ogni parola (figura 8). Questa modalità è la più comoda per modificare le forme principali e altri attributi del lessema, poiché mostra tutte le forme di ogni parola, il testo e i capitoli in cui sono usate, ecc. Solo qui si può cercare di determinare, per esempio, il tipo di alterazione di ogni lessema.