scieee AI-readable full text Open interactive document viewer

MODELLO DEI LESSICI E ECOSISTEMA DEI DATI

Bandini, Michela; Quochi, Valeria

Abstract

Research presentation delivered within the final workshop of the PRIN 2017 project “Lingue e culture dell’Italia antica: linguistica storica e modelli digitali”, held in Venice on 20 September 2024. The presentation illustrates the theoretical and technical foundations of the lexical model and data ecosystem developed in the ItAnt project, focusing on the representation of computational lexica for ancient and fragmentary languages. It discusses principles of lexical modelling, Semantic Web standards, and the adoption of OntoLex-Lemon and related extensions for representing lexical entries, senses, semantic fields, etymology, and corpus attestations. The contribution highlights the integration of lexical resources with textual corpora and external Linked Open Data resources, outlining an interoperable ecosystem designed to support research in historical linguistics and Digital Humanities.

Full text

MODELLO DEI LESSICI E ECOSISTEMA DEI DATI Valeria Quochi e Michela Bandini CNR-ILC Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali LESSICI COMPUTAZIONALI ❖Definizioni: ➢Lessici Computazionali: risorse linguistiche usate per l'elaborazione automatica della lingua. ➢Dizionari Elettronici: dizionari digitalizzati (retro-digitalizzati o nativi) per uso umano e tecnologico. ❖Ruolo e Funzioni: sono il “ponte” tra diverse risorse linguistiche e tecnologie: ➢Input per tecnologie di elaborazione del linguaggio naturale → rappresentazione (digitale/formale) permette o facilita l’elaborazione automatica della lingua. ➢Indicizzazione e normalizzazione dei testi. ➢Astrazione linguistica e analisi delle parole. ❖Rappresentazione delle parole: ➢Strutturazione granulare di lessemi. ➢Caratteristiche fonetiche, morfologiche, sintattiche, semantiche sono esplicitate. ➢Relazioni lessicali, semantiche ed etimologiche fra lessemi sono esplicitate. Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali MODELLI DI RAPPRESENTAZIONE DELL’INFORMAZIONE LESSICALE ❖Modelli creati e strutturati per facilitare la decodifica da parte dell’applicazione informatica che ne farà uso. ❖Modelli basati su/ispirati a teorie computazionali e/o semantico-lessicali. ❖Modelli mirati alla rappresentazione di fenomeni linguistici specifici. Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali La struttura delle informazioni linguistiche dipende dal modello lessicografico applicato dal costruttore del dizionario: PRINCIPI CARDINE DELLA RAPPRESENTAZIONE LESSICALE ❖Entrata Lessicale: i dati lessicali sono solitamente organizzati attorno al concetto di "entrata lessicale", che include informazioni su ortografia, PoS, flessione, e il/i significato/i, pronuncia. ❖Struttura Gerarchica e/o Relazionale: le banche dati lessicali si basano su queste relazioni con lo scopo di modellare le relazioni tra le parole (e.i. sinonimi, contrari, iponimi/iperonimi, meronimi, etc.) e definire i loro significati e contesti. ❖Proprietà Semantiche e Sintattiche: principi linguistici comuni, come ruoli semantici, strutture argomentali, categorie sintattiche per fornire profondità alla rappresentazione delle parole. ❖Metadati Standardizzati: alcune risorse linguistiche seguono standard di metadati o vocabolari controllati e condivisi nella comunità scientifica di riferimento (e.g. TEI, LMF, OntoLex-Lemon, lexinfo, OLiA, etc.) per fornire uniformità nella rappresentazione. Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali TEI LEX-O & ONTOLEX-LEMON Dizionario come testo ❖specifica tecnica dello schema TEI (Text Encoding Initiative) ❖raccomandazioni per codifica di dizionari elettronici ❖necessità di uniformare processo e formato di creazione di dizionari retro-digitalizzati Dizionario come fonte di conoscenza ❖standard de-facto per la rappresentazione di informazione lessicale nel Web Semantico ❖modello di rappresentazione di lessici (primariamente) computazionali basati su ontologie e vocabolari controllati che favoriscono l’interoperabilità semantica Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali INTRODUZIONE AL WEB SEMANTICO COSA E’ IL WEB SEMANTICO? ❖Uno spazio aperto di conoscenza formalizzata e condivisa disponibile via web anche per l’elaborazione automatica. ❖Descrizione formale del significato delle risorse attraverso metadati e formalismi (rispetto a XML) Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali SEMANTICA E DATI: ❖La semantica del dato è esplicita: anche i software possono “comprendere” il significato delle informazioni e manipolarle e integrarle ❖Utilizza triple RDF (Soggetto - Predicato - Oggetto) per rappresentare e intergare le info IDENTIFICAZIONE E STRUTTURA DATI ❖L’informazione è atomizzata: ogni elemento, proprietà e relazione ha un identificativo univoco dereferenziabile (URI) ❖Insiemi strutturati di informazioni e di regole d’inferenza (con le ontologie) che permettono alla macchina di automatizzare i ragionamenti (Grafi orientati con archi etichettati) ACCESSO ALLA CONOSCENZA E RIUSO ❖La diffusione di internet permette di accedere a tutta la conoscenza distribuita nella rete, purchè sia collegata ❖Garantita l’interoperabilità tra risorse diverse e riuso di informazioni usando vocabolari comuni e condivisi LINKED (OPEN) DATA E APPLICAZIONI ❖Modalità di pubblicazione sul web di dati strutturati e collegati basati su standard del Web Semantico: RDF, URI o HTTP. ❖La pubblicazione sfrutta anche l’utilizzo di Ontologie e Vocabolari condivisi ❖Ogni informazione codificata può essere riusata da altre risorse disponibili sul web (interoperanbilità) → Si ha una rete di risorse indipendentemente descritte ma collegate disponibili sul web Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali CC-BY. “Open Linguistics Working Group (2016), The Linguistic Linked Open Data cloud diagram, version of 2016-05-24, http://linguistic-lod.org/llod-cloud” ❖Il Web Semantico e Linked Open Data hanno rivoluzionato l'approccio alla conoscenza: adottato rapidamente anche dalle Digital Humanities. ❖Grandi potenzialità per le Digital Humanities, con applicazioni significative come l'epigrafia digitale, che sfrutta le tecnologie semantiche per migliorare l'analisi e la gestione dei testi antichi. ONTOLEX-LEMON ❖ Lexicon Model for Ontologies: formato de-facto standard W3C per la rappresentazione e pubblicazione di lessici (“dictionary-like information”) come triple RDF sfruttando i Linked Data. ❖Modello di rappresentazione di lessici (primariamente) computazionali, in connessione a ontologie, basato su 5 principi fondanti: ➢tecnologia Linked Data: formati OWL, RDF ➢multilingue: rappresenta info di molte lingue ➢semantica referenziale/denotazionale: il significato delle parole è dato dalla presenza di un’ontologia ➢formato aperto: gratuito e flessibile, estendibile ➢riuso di standard esistenti ❖Per i lessici computazionali esiste già una comunità attiva dal 2006, modelli e vocabolari già testati da poter riutilizzare (i.e, estensioni) Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali ONTOLEX-LEMON: CORE MODEL cfr.: McCrae&Declerc “Introduction to the OntoLex-Lemon Model”- http://esslli2018.folli.info/wp-content/uploads/Introduction-to-the-OntoLex-Lemon-Model.pdf Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali ETIMOLOGIA E COGNATES: deívaí Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali ATTESTAZIONI: collegamenti al corpus → FrAC OntoLex (unofficial) extension Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali ❖Collega una forma a una iscrizione o una parola (sequenza di caratteri) nell’edizione del corpus ItAnt ❖Rappresenta altre info: ➢autore responsabile dell’attribuzione ➢forma ricostruita secondo convenzioni Leida ➢riferimenti bibliografici COLLEGAMENTI A RISORSE ESTERNE ❖LiLa Lemma Bank ➢http://hdl.handle.net/20.500.11752/OPEN-532 ➢collezione di lemmi con proprietà morfosintattiche ➢usato per collegare i Cognates e le entrate@lat ❖The Etymological Dictionary of Latin and the other Italic Languages ➢http://hdl.handle.net/20.500.11752/OPEN-532 ➢usato per collegare gli etimi e le etimologie Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali Per il progetto ItAnt, esistono poche risorse Linked Open Data (5 stelle) utili a questo scopo. Due risorse lessicali interessanti e utili per specificare le informazioni etimologiche, per il Latino: ECOSISTEMA DATI (DIG)ITANT Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali Bibliography LRMOO (EPIDOC) editions of Epigraphies standard/common vocabularies (LLOD) Lexica of Ancient languages Edit / explore web platform External LLOD Lexical Res. External Bibliography Management (Zotero) Un Ecosistema di dati connessi (lessici, testi, metadati, riferimenti bibliografici) e strumenti per la loro manipolazione e visione integrata. VERSO UNA “LOD-IFICAZIONE" TOTALE Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali ❖Il lessico computazionale è allineato, sfruttando modello OntoLex-Lemon e rappresentazione RDF. ❖Ma la pubblicazione di corpora testuali (in TEI/EpiDoc) sul Semantic Web è ancora in fase iniziale: si sta ancora decidendo quale approccio/modello seguire. VERSO UNA “LOD-IFICAZIONE" TOTALE Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali Un Abbiamo dunque svolto una Revisione Sistematica della Letteratura (Bandini, M. & Quochi, V. 2024) perchè: ❖la maggior parte delle risorse linguistiche nella rete dei Linguistic Linked Open Data sono dizionari, lessici, thesauri, terminologie e vocabolari controllati; ❖la pubblicazione di corpora testuali come Linked Open Data è ancora dibattuta e controversa; ❖alcuni progetti recenti hanno iniziato a esplorare diversi approcci e modelli per convertire e rappresentare i corpora testuali come Linked Open Data: NIF (Hellmann et. ali, 2013) POWLA, (Chiarcos, 2022), CoNLL-RDF (Chiarcos, 2020); → per valutare i vantaggi e identificare il modello più adatto per convertire o rappresentare le iscrizioni in lingua antica in Linked Open Data: POWLA. GRAZIE PER L’ATTENZIONE Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali Valeria Quochi, [email protected].it Michela Bandini, [email protected].it