scieee AI-readable full text Open interactive document viewer

„Knygos nobažnystės“ (1653) morfologijos tyrimo galimybės naudojant reliacinę duomenų bazę

Dalia Jakulytė

Full text

ACTA LINGUISTICA LITHUANICA LI (2004), 1-14 Knygos nobažnystės (1653) morfologijos tyrimo galimybės naudojant relaacinę duomenų bazę Universidade DALIA JAKULYTĖ de Klaipėda O artigo apresenta a base de dados relacional criada para a investigação da morfologia de antigos escritos lituanos. Um modelo lógico de dados foi desenvolvido e implementado dentro do sistema de gerenciamento de banco de dados (SGBD) Microsoft Access. Todas as palavras de duas partes do Knyga Nobažnystės foram inseridas no banco de dados. Um motor foi criado para seleção de dados morfológicos (inflexão), de modo que as palavras podem agora ser selecionadas por qualquer propriedade atribuída ou conjunto de propriedades. Tal banco de dados serve como uma ferramenta para classificação, seleção e correção de dados, bem como armazenamento de mídia de texto e índice Jor. Permite ao pesquisador lidar com vários problemas linguísticos, como alternância de raízes substantivas, autoria de textos etc., de forma eficiente, precisa e precisa. INTRODUÇÃO Um dos maiores problemas enfrentados pelos linguistas que estudam textos antigos é a seleção do material. As principais fontes de material são os próprios textos (por exemplo, fotocópias de livros), dicionários, registros de palavras. A partir deles, os dados são transcritos (à mão ou por computador), feitos em arquivos de papel, classificados e ordenados em uma determinada ordem. A seleção do material de tal arquivo é um trabalho longo e bastante complicado: o arquivo inteiro é examinado, as folhas necessárias são selecionadas, elas são divididas, etc. ; Após o trabalho, as folhas selecionadas devem ser devolvidas ao seu lugar no arquivo comum, caso contrário, ele não será adequado para uso. A tecnologia de computador ajuda a resolver esses problemas. Para a pesquisa lexicográfica, são criados textos computadorizados, bases de dados de escritas antigas, etc. Uma das características essenciais dos livros de texto computadorizados é a capacidade de realizar análises automáticas de texto, como a realização automática de concordâncias de texto, ou seja, a apresentação da palavra procurada num contexto mínimo. Para a análise automática da linguagem, os textos devem ser marcados para que o programa de concordâncias procure unidades linguísticas não apenas por características formais, mas também por características gramaticais. (Março de 1997). No entanto, apenas a língua normativa pode ser desenvolvida e aplicada por programas automáticos de reconhecimento de formas gramaticais da língua ou similares, e os sinais gramaticais de escritas antigas devem ser marcados manualmente. Por exemplo, o dicionário lituano de 100 milhões de palavras (donelaitis.vdu.lt/textynas- ), preparado pelo Centro de Linguística Computacional da Faculdade de Ciências Humanas da Universidade Vytautas Didysis, é composto por publicações do período da independência, selecionadas de modo a melhorar a compreensão da língua. Atualmente, a língua lituana é escrita com o alfabeto cirílico. O mecanismo de busca permite pesquisar uma palavra, obter estatísticas sobre a palavra selecionada, procurar uma forma gramatical específica da palavra selecionada (por exemplo, independência) ou todas as formas da palavra usando o símbolo "*" (independência*). O Instituto de Matemática e Ciência da Computação da Universidade da Letónia também disponibilizou na Internet textos de manuscritos antigos dos séculos XVI-XVIII com possibilidades de pesquisa semelhantes (pode-se procurar uma palavra específica ou parte dela com o símbolo "96") e arquivos de dicionário e índice de frequências de formas de palavras (www.ailab.lv/senie). Além disso, o Instituto de Língua Lituana realiza um trabalho semelhante, coletando e digitalizando textos escritos antigos e criando índices de formas de palavras. São semimanuais, ou seja, o computador apenas coloca as formas de palavras em ordem alfabética, indicando a sua posição no texto e fornecendo o contexto, de acordo com um programa especial. O termo é usado para descrever a forma e o conteúdo de uma mensagem de texto (Alberts, 1998). Apesar de ser um termo genérico, a morfologia é um ramo da linguística que estuda a morfologia das línguas, não apenas a morfologia das palavras, mas também a morfologia das formas, dos morfemas, dos verbos, dos verbos compostos e dos verbos não compostos. Por conseguinte, a estrutura da base de dados informática e as possibilidades de selecção do material devem ser adaptadas em conformidade. A ideia de criar uma base de dados de morfologia de escritas antigas surgiu a partir das pesquisas de Antanas Jakulis sobre a Knygos nobažnystė (1653). Em 2004, o livro foi reeditado em formato digital, com a tradução em inglês, e em 2006, o livro foi reeditado em formato digital, com a tradução em inglês, pela Editora da Universidade de São Paulo (USP). No mesmo ano, a Universidade de São Paulo (USP) criou o curso de graduação em Comunicação Social (CMS) e o curso de pós-graduação em Comunicação Social (CMS). Além disso, o livro é uma compilação de artigos publicados em revistas científicas, incluindo um artigo sobre a espécie, publicado em 1995. Para este registo léxico foi criado um ficheiro em papel de todo o léxico, isto é, palavras escritas em folhas separadas, com indicação das suas formas básicas, significado, forma gramatical (Figura 1), agrupadas por formas básicas e dispostas em ordem alfabética. No entanto, o próprio autor, ao escrever o livro, usou uma cartilha e reorganizou as folhas de acordo com a ordem que conhecia. Basicamente, teve de ser reconstruída, mas queria torná-la adequada para ser usada muitas vezes. Assim, decidiu-se criar uma base de dados eletrônica, uma base de dados que poderia armazenar, classificar ou filtrar vários dados morfológicos, léxicos, semânticos, etc., e que poderia servir como uma ferramenta para o pesquisador de morfologia de escritas antigas. O desenvolvimento de uma base de dados consiste em duas etapas principais: concepção e implementação. O objetivo do projeto é identificar quais são as necessidades do usuário, quais são as necessidades do cliente, quais são as necessidades do fornecedor, quais são as necessidades do cliente e quais são as necessidades do fornecedor. O resultado desta etapa é uma estrutura lógica de dados. Ele é descrito neste artigo Secção 2.1. Para mais informações sobre o Livro da Igreja e sua história, veja. 2004 - 2006 - 2007 - 2008 - 2009 - 2010 - 2011 - 2012 - 2013 - 2014 - 2015 - 2016 - 2017 - 2018 - 2019 - 2020 - 2021 - 2022 - 2023 - 2024 - 2025 - 2026 - 2027 - 2028 - 2029 - 2030 - 2031 - 2032 - 2033 - 2034 - 2035 - 2036 - 2037 - 2038 - 2039 - 2040 - 2041 - 2042 - 2043 - 2044 - 2045 - 2046 - 2047 - 2048 - 2049 - 2050 - 2051 - 2052 - 2053 - 2053 - 2054 - 2055 - 2056 - 2057 - 2058 - 2059 - 2059 BASE DE DADOS DA IGREJA DO LIVRO | Etapa 3 —Implementação da estrutura de dados criada em um dos sistemas de gerenciamento de banco de dados —descrito Secção 2.2. A base de dados de morfologia de escritas antigas, que foi desenvolvida e implementada, já pode ser utilizada para fins de investigação, isto é, após o carregamento dos dados e a marcação das suas características necessárias, estes dados podem ser seleccionados, tratados e ordenados na ordem pretendida. O segundo capítulo do artigo descreve a aplicação da base de dados de morfologia de escrituras antigas criada para o estudo da morfologia de uma fonte específica — a Igreja do Livro. 1. BASE DE DADOS DE MORFOLOGIA DE ESCRITOS ANTIGOS DESENVOLVIMENTO 1.1. Estrutura lógica dos dados Os elementos principais de um registo léxico são as formas das palavras utilizadas no texto (aqui e daqui em diante, cada forma de uma palavra, ou seja, cada uso de qualquer lexema, será referido como uma "palavra"). Um cartão — uma palavra e seus atributos (ver Figura 1). 1 pág. O termo é derivado da palavra grega βίβλος, bíblos, que significa "livro" ou "livro de livros" e que significa "livro" ou "livro de livros" e | que — significa "livro" ou "livro" e oF que significa "livro" ou ii "livro" e i que significa "livro" ou "livro" e que significa "livro" ou "livro" e que significa "livro" ou "livro" e que significa "livro" ou "livro" e que significa "livro" ou "livro" e que significa "livro" ou "livro" e que significa "livro" ou "livro" e que significa "livro" ou "livro" e que significa "livro" ou "livro" e que significa "livro" ou "livro" e que significa "livro" ou "livro" e que significa "livro" ou "livro". Mesmo que a mesma palavra seja usada várias vezes na mesma forma e significado, cada vez ela estará em um lugar diferente, em um contexto diferente; se os cartões fossem numerados, as mesmas formas de palavras teriam números diferentes. Além disso, o elemento principal da base de dados deve ser uma palavra com um número único. Seus atributos — forma, origem, formas básicas, significado, etc. Alguns atributos (por exemplo, parte da linguagem, paradigma) são comuns a todo o lexema. A definição de um elemento "Lexème" para definir os atributos de um lexema é associada a um elemento "Palavra" em uma relação um-para-- muitos, ou seja, um registro de Lexème pode corresponder a vários registros de Palavra. A estrutura lógica geral dos dados morfológicos das escritas antigas é mostrada na Figura 2. 2 págs. Estrutura Lógica de Dados DALIA JAKULYTĖ Palavra I Zisman O Lexicon da Palavra ID O Wikcionário tem o verbete leitura. ID Principais f. N Soquete Valor 4 Pagr. f, Ormos Função Parte da linguagem Alternando ; imekat links. ; Asmen. Origem A Família, L Ed. ; Não. ; 2008/ 01/ 01 Estrutura Número {ns dgs., i. e. Paradigma O grau de į mentira. ; Ao nível do chão... Palavra Definição /Identidart de ; ormantas Forma de eficácia Sbendr. asm dal; f Sly. ... : Anexo(s) Reflectividade ~~ /sanex; Don. Espécie fvelk ; reveik, Determina a relação, Lip; Alcatrão. ; É hora de fes. ; ser. ; ou seja, ; - Sim, será. Laiko/nuos.forma | vem. sud adiar.sud começar.,... Pessoa 11;2;3 O tronco la i vai ow... Valdim. as O teu pai. ; su kilm. .... Frase de / cadeia de texto de ar contexto O texto do į Evangelho; sermão oração... Autor Seção Página Linha Além disso, o uso de algoritmos de análise de dados, como o algoritmo de Morse e o algoritmo de Morse-Steinberg, são usados para determinar a localização de um objeto em um banco de dados. 1.2. Realização de uma base de dados morfológica O equivalente eletrônico de um arquivo é um banco de dados. O software é usado para processar, visualizar, selecionar, imprimir e inserir novos dados, através de um sistema de gerenciamento de banco de dados (DBMS). Atualmente, os sistemas de gerenciamento de banco de dados relacionais mais amplamente utilizados (por exemplo, o Visual Basic 2008) são baseados em um modelo de dados de objetos. O nome da entidade é listado na parte superior, e as propriedades da entidade são listadas na parte inferior. A relação "um para muitos" é representada por uma rede ramificada. LIVROS Igrejas DADOS BASE | 5 FoxPro, dBase, Paradox, etc.). O MS Access é um sistema de gerenciamento de banco de dados que inclui todas as características de um sistema de gerenciamento de banco de dados relacional e uma boa integração com outros programas do pacote Microsoft Office. Os dados são armazenados em tabelas. Cada linha da tabela principal é um registro — separado (atributos do ir jo elemento principal). Listas de itens repetidos (atributos) são armazenadas em tabelas auxiliares. Os elementos são gravados na tabela principal e os atributos são selecionados a partir de tabelas auxiliares. Ao vincular tabelas, você pode fazer várias consultas que permitem que você selecione informações de uma ou mais tabelas (ou seja, selecione os cartões necessários de uma biblioteca de cartões e coloque-os na ordem desejada). A partir de 2003, o banco de dados foi implementado com o Microsoft Access 2003 DBMS. Existem dois tipos de palavras-chave: Palavras-chave (keywords). ir «Formas básicas» (leksemoms)- ». Em tabelas auxiliares — listas de atributos. Todas as tabelas secundárias com uma relação de ligação principal "um su entre muitos". As tabelas da base de dados de morfologia de escritas antigas e as relações entre elas são mostradas na Figura 3. 3 PAV. DADOS BASE QUADRO 1 IR COMUNICAÇÕES Tarp JŲ DBVS MS ACESSO ESCÁLONES Autor Capítulo Página Linha Auto-suficiência Formas básicas Definição aldymas Verb for Linksniavino, asme Ação Palavra-- chave Controlador de ação Raiz de referência1 Raiz subjacente 2 Precedência (os) Prefixo (ii) base operacional Verniz/nuosakos para Pessoa Observações Jacarezinho Sírio-Libanês Aço inoxidável 3 Os nomes originais das tabelas são deixados aqui. Eles, bem, ko alteráveis não será a mudança de — nome bastante complicado, o usuário o geralmente jo não vê. 6 | DALIA JAKULYTĖ Algumas tabelas auxiliares já estão preenchidas e outras estão sendo adicionadas para cada monumento. As tabelas de categorias gramaticais (mostradas na Figura 3 à esquerda) estão preenchidas. Cada um é composto por vários gráficos: identificador, nome(s) do atributo e notas. A tabela principal contém apenas o identificador da sub-tabela, mas para a borracha duomenų atrankoje galima naudoti bet kurios grafos duomenis, todėl vartotojų patoalguns atributos são definidos tanto em termos lituanos como internacionais (veja a lista de categorias de verbos na Tabela 1). As tabelas "Contexto- ", "Seção", "Texto" e "Autores" são personalizadas para cada monumento de escrita. As tabelas de "Formas básicas" (leksemy) e "Valores" são inicialmente vazias, mas os dados podem ser carregados a partir de um banco de dados criado para outro monumento de escrita. QUADRO 1. Lista de atributos de uma categoria de link ID da categoria de link Link em latim Notas 0 i 1 ward. 2ª ed. 2ª ed.. 3.ª ed. Nova Iorque. 4ª ed. : Ed. A. O último 5 innag. O 6º Batalhão de Infantaria 6. Entrar. 7.ª edição. Ele. 8 páginas Ibid. Ad. 9 páginas. Al. Alimentação 10 colheres de sopa. 21º da classificação geral. G. Posse. O agente causador característico BASE DE DADOS DE LIVROS DA IGREJA | 7 2. APLICAÇÃO DE BASE DE DADOS PARA BASE DE DADOS DE LIVROS PARA ESTUDOS DE MORFOLOGIA 2.1. Antes de introduzir os dados morfológicos de um monumento de um determinado manuscrito, a base de dados é configurada. Além disso, o estudo da linguagem de sinais deve levar em consideração a estrutura e a autoria do texto (Jakulis 1982, 1984). O livro é dividido em três partes, cada uma com o título de um dos autores (o autor do livro, o autor da obra, o autor da obra e o autor da obra). Preencher também o quadro «Cabeçalho» para indicar todas as cabeças NC (ver figura 6). A entrada de dados começa com a digitação de texto. A tabela abaixo mostra os números de linhas e os números de linhas de identificação. Em seguida, o texto é dividido em palavras, com números de identificação atribuídos a elas, identificação de linha, identificação de texto, identificação de seção e números de página e linha do original. Todas essas ações são realizadas automaticamente por macros do Microsoft Word criadas pelo autor. Como os limites das palavras neste texto muitas vezes não coincidem com os espaços entre as palavras, a tabela resultante é revisada e corrigida. As tabelas visualizadas são carregadas nas tabelas correspondentes "Contexto" (renomeada para "KNtext") e "Palavras" na base de dados de morfologia. Outros atributos (genro, número, verbo, tempo, etc.) são registrados manualmente (manualmente) na tabela "Palavras" do banco de dados. O número de linhas é o número de linhas de um objeto, por exemplo, um grafo. vns. kilm.) basta escrever «1», «1», «2» nas colunas correspondentes (ver figura 4). 4 págs. «Fragmento da tabela "Palavras"». INSTRUÇÃO DE FORMA BSR | Palavra I Contexto cision im ea oy i Via ro | | 20030701 dteyfiancia 200307 2 I 301 3 7 O etti(at) ateiti 2 1 2 1.12 3 0 | | 20030702 Sra 200307 2 I S01 3 7 Sr. Sr. la 1 1 1 2 1 0 P| 20030703 Kryftaus 0007 2 1 Sot 3 7 O Kristus 102/1 1 10 0 || 20030704 ant 200307 2 1 s01 3 7 0 ant 2804/1 0 g-.0 '0 0 0 |_| 20030705 luda 200307 2 1 S01 3 7 0 sūdasi sūdas 1 1 || 2 1 0 Antes de especificar as formas básicas, a entrada correspondente é criada na tabela "Formas básicas", e na tabela "Palavras", na coluna "Formas básicas", é digitada ou selecionada ao expandir a lista (Figura 5). 8.ª Divisão de Infantaria 5.ª Divisão de Infantaria «Fragmento da tabela "Palavras"- ». Indicação das formas básicas | | i [K m: | a Sa Fb lg Zi Significado HOE my ar ira 2 1 3 7 0 ir(at) vir 2 1 1 0 | | 20030702 Pond Ar 2 1 ui 3 7 0 senhor senhor la 1 em 1; em 0 |-7| 20030703 Kryftaus 200307 2 1 sol 3 7 0 o 0 | | 20030704 an 200307 2 1 S01 3 7 0 1 0 0 | | 20030705 fuda 200307 2 1 S01 3 7 0 Knstu Knstus, Cristo 1 1 0 | | 20030801 primeana 200308 2 1 so 3 8 O Cruzar (nv cruzar, --, --ojo 5 1 0 | | 20030802 Kayp 200308 2 1 S01 3 8 0 Cruzar cruzes cruzes, cruzes 1 0 0 |_| 20030803 tatay 200308 2 1 S01 3 8 O Įkrosyti krosyt krosyti* 3 0 0 | | 20030804 ira 200308 2 1 S01 3 8 0 Įkrūpauti krūpai krūpauti $ 1 0 Atualmente, as palavras SE, Pas, MKr e K estão incluídas no banco de dados, com os seus caracteres marcados como não necessitando de investigação adicional ou já tendo sido investigados. Por exemplo, a hipótese de Antanas Jakulis (Jakulis 1982) marca a autoria das partes SE, e na tabela "Formas Principais" introduz apenas o identificador, o nicho, a forma principal implícita e o ID da parte da linguagem. As formas básicas podem ser ajustadas e outras características são indicadas posteriormente, após a análise de todas as formas da palavra (ver secção 3.2). Nem todos os sinais são listados por várias razões: —as características especificadas (localização, forma e formas principais) são suficientes para a selecção do material para estudos morfológicos, Muitos atributos são reservados para outros estudos, como a lexicologia ou a semântica. —algumas características são necessárias apenas para um outro pesquisador (por exemplo, formação, palavra de referência, etc., só serão importantes para os especialistas em formação de palavras- ), algumas devem ser indicadas pelo especialista em questão (por exemplo, significados — lexicólogo), etc. ; —muitas características são controversas ou duvidosas, algumas dependem do ponto de partida das pesquisas: por exemplo, a palavra montanha deve ser considerada uma raiz ou um advérbio, um derivado do advérbio, isto é, se na consciência do falante está associada com subir, levantar ou não? Ou das mãos? A forma de indicar a raiz — tal como está (kal-) ou com o grau de vogal de referência (kel-) — depende também das necessidades do pesquisador, por exemplo, se ele quer selecionar palavras com a na raiz ou todos os derivados de uma determinada raiz. —muitas vezes é difícil definir o tipo de sarcasmo (indicado na tabela “Formas básicas”- ), porque o Livro da Igreja é cheio de formas variadas, por exemplo: feio/feo, honra/honra, etc. Em cada um desses casos, é necessário primeiro fazer uma investigação detalhada, determinar de que depende essa variação (se é determinada pela semântica, se as diferentes formas são usadas por diferentes autores, etc.); Parece, quanto menos problemas devem surgir com a indicação de uma forma específica de tronco (na tabela "Palavras"), mas também aqui é necessário duvidar: se orelha —i tronco, orelhas —io tronco, orelhas —anterior, então orelha —? O resultado é revelado pelo próprio pesquisador. Para isso, é conveniente usar diferentes modos de visualização de material do sistema de gerenciamento de banco de dados. Existem dois tipos de raízes: raízes simples e raízes compostas. BASE DE DADOS DE LIVROS DA IGREJA | 9 2.2. Revisão, triagem e correção do material O material pode ser visualizado diretamente com o principal em tabelas auxiliares vinculadas. Na tabela "Capítulos", podemos ver o texto completo de cada capítulo (Figura 6). 6 págs. Fragmento da tabela "CAPÍTULO". VISÃO GERAL DO CONTEÚDO DO CAPÍTULO 13 | | ID do capítulo | Livro | Título do capítulo | Evangelho | Início | +1S12 1 Na quinta semana depois de três dias Mateus 13, 24:30 37 =!5813 1 Antigo Testamento Mateus 20, 1:16 4C | ID | Linhas | Texto + 204005 NA SEMANA 8 = 204006 NO VELHO NÍVEL. g | + 204007 EVANGELHO DE MATT. 20. 8 mf 204008 PRiliginta ir karalifte dangaus žmoguj kutlay 1 E 204009 iBeio tšbay anklti/famdit darbinikus ing 1 EF 204010 winničią [awą o kad [udereia darbinikus iž gra-1 pip 204011 fia ant dienos/nuliunte iuos winnicion lawa. | + MAN? TeiRaias dna alina tvačia imide Ihe Rosse 1 Ao navegar pelo texto, podemos ver e editar todas as palavras e caracteres de cada linha (Figura 7). 7 págs. REVISÃO DOS DADOS DO QUADRO «TEXTO NC* Página oficial da Associação de Futebol de Leiria + 207005 uzutaykis/não gosto [morte na eternidade/kal-1 = 207006 beia então ele židay. Agora pažind iuog welnia 1, D | Palavra [Tekst[Autor] Capítulo [Puslag| Reilut{Savar|Principal fo] Significado |Kaity| Gimin] Skaid Link{Kamien|Laips] Ap |-| 20700601 então 1 1 S20 70 6 O então 0 0 {0 lo io 0 |-| 20700602 iam 1 1 S00 7 6 0 iis 0 1 2 11 3 o 0 |-| 20700603 židay 1 1 S20 70 6 0 judeu 0 1 i 13 id 10 |_| 20700604 Agora 1 1 50 70 ls O agora agora 1/o 9 io 10 o 10 |» | 20700605 paind 1 1 S10 70 6 0 = conhecer(pa) 0 2 | 0—13 io gv o | | 20700606 iuog 1 1 S20 70 6 0 jog 0 0:0 {0 0 o 0 | | 20700607 welnia 1 1 S20 70 6 0 = diabo 0 1 1 1 4 2 0 |%) 0 0 0 0 0 0 0 0 10 ip 0 gig + 207007 tem. Abrahomés numire e prénaBay/o tu 1 em j 2 + 207008 kalbi iey kas zodi mano uzutaykis/ne ragaus 1 Ao olhar para as formas básicas, vemos todos os casos de cada palavra (Figura 8). Este modo é o mais conveniente para editar as formas básicas e outros atributos do lexema, pois mostra todas as formas de cada palavra, o texto e os capítulos onde são usadas, etc. Por exemplo, pode-se tentar determinar o tipo de alteração de cada lexema.