Full text
MODELLO DEI LESSICI E ECOSISTEMA DEI DATI Valeria Quochi e Michela Bandini CNR-ILC Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali
LESSICI COMPUTAZIONALI ❖Definizioni: ➢Lessici Computazionali: risorse linguistiche usate per l'elaborazione automatica della lingua. ➢Dizionari Elettronici: dizionari digitalizzati (retro-digitalizzati o nativi) per uso umano e tecnologico. ❖Ruolo e Funzioni: sono il “ponte” tra diverse risorse linguistiche e tecnologie: ➢Input per tecnologie di elaborazione del linguaggio naturale → rappresentazione (digitale/formale) permette o facilita l’elaborazione automatica della lingua. ➢Indicizzazione e normalizzazione dei testi. ➢Astrazione linguistica e analisi delle parole. ❖Rappresentazione delle parole: ➢Strutturazione granulare di lessemi. ➢Caratteristiche fonetiche, morfologiche, sintattiche, semantiche sono esplicitate. ➢Relazioni lessicali, semantiche ed etimologiche fra lessemi sono esplicitate. Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali
MODELLI DI RAPPRESENTAZIONE DELL’INFORMAZIONE LESSICALE ❖Modelli creati e strutturati per facilitare la decodifica da parte dell’applicazione informatica che ne farà uso. ❖Modelli basati su/ispirati a teorie computazionali e/o semantico-lessicali. ❖Modelli mirati alla rappresentazione di fenomeni linguistici specifici. Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali La struttura delle informazioni linguistiche dipende dal modello lessicografico applicato dal costruttore del dizionario:
PRINCIPI CARDINE DELLA RAPPRESENTAZIONE LESSICALE ❖Entrata Lessicale: i dati lessicali sono solitamente organizzati attorno al concetto di "entrata lessicale", che include informazioni su ortografia, PoS, flessione, e il/i significato/i, pronuncia. ❖Struttura Gerarchica e/o Relazionale: le banche dati lessicali si basano su queste relazioni con lo scopo di modellare le relazioni tra le parole (e.i. sinonimi, contrari, iponimi/iperonimi, meronimi, etc.) e definire i loro significati e contesti. ❖Proprietà Semantiche e Sintattiche: principi linguistici comuni, come ruoli semantici, strutture argomentali, categorie sintattiche per fornire profondità alla rappresentazione delle parole. ❖Metadati Standardizzati: alcune risorse linguistiche seguono standard di metadati o vocabolari controllati e condivisi nella comunità scientifica di riferimento (e.g. TEI, LMF, OntoLex-Lemon, lexinfo, OLiA, etc.) per fornire uniformità nella rappresentazione. Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali
TEI LEX-O & ONTOLEX-LEMON Dizionario come testo ❖specifica tecnica dello schema TEI (Text Encoding Initiative) ❖raccomandazioni per codifica di dizionari elettronici ❖necessità di uniformare processo e formato di creazione di dizionari retro-digitalizzati Dizionario come fonte di conoscenza ❖standard de-facto per la rappresentazione di informazione lessicale nel Web Semantico ❖modello di rappresentazione di lessici (primariamente) computazionali basati su ontologie e vocabolari controllati che favoriscono l’interoperabilità semantica Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali
INTRODUZIONE AL WEB SEMANTICO COSA E’ IL WEB SEMANTICO? ❖Uno spazio aperto di conoscenza formalizzata e condivisa disponibile via web anche per l’elaborazione automatica. ❖Descrizione formale del significato delle risorse attraverso metadati e formalismi (rispetto a XML) Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali SEMANTICA E DATI: ❖La semantica del dato è esplicita: anche i software possono “comprendere” il significato delle informazioni e manipolarle e integrarle ❖Utilizza triple RDF (Soggetto - Predicato - Oggetto) per rappresentare e intergare le info IDENTIFICAZIONE E STRUTTURA DATI ❖L’informazione è atomizzata: ogni elemento, proprietà e relazione ha un identificativo univoco dereferenziabile (URI) ❖Insiemi strutturati di informazioni e di regole d’inferenza (con le ontologie) che permettono alla macchina di automatizzare i ragionamenti (Grafi orientati con archi etichettati) ACCESSO ALLA CONOSCENZA E RIUSO ❖La diffusione di internet permette di accedere a tutta la conoscenza distribuita nella rete, purchè sia collegata ❖Garantita l’interoperabilità tra risorse diverse e riuso di informazioni usando vocabolari comuni e condivisi
LINKED (OPEN) DATA E APPLICAZIONI ❖Modalità di pubblicazione sul web di dati strutturati e collegati basati su standard del Web Semantico: RDF, URI o HTTP. ❖La pubblicazione sfrutta anche l’utilizzo di Ontologie e Vocabolari condivisi ❖Ogni informazione codificata può essere riusata da altre risorse disponibili sul web (interoperanbilità) → Si ha una rete di risorse indipendentemente descritte ma collegate disponibili sul web Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali CC-BY. “Open Linguistics Working Group (2016), The Linguistic Linked Open Data cloud diagram, version of 2016-05-24, http://linguistic-lod.org/llod-cloud” ❖Il Web Semantico e Linked Open Data hanno rivoluzionato l'approccio alla conoscenza: adottato rapidamente anche dalle Digital Humanities. ❖Grandi potenzialità per le Digital Humanities, con applicazioni significative come l'epigrafia digitale, che sfrutta le tecnologie semantiche per migliorare l'analisi e la gestione dei testi antichi.
ONTOLEX-LEMON ❖ Lexicon Model for Ontologies: formato de-facto standard W3C per la rappresentazione e pubblicazione di lessici (“dictionary-like information”) come triple RDF sfruttando i Linked Data. ❖Modello di rappresentazione di lessici (primariamente) computazionali, in connessione a ontologie, basato su 5 principi fondanti: ➢tecnologia Linked Data: formati OWL, RDF ➢multilingue: rappresenta info di molte lingue ➢semantica referenziale/denotazionale: il significato delle parole è dato dalla presenza di un’ontologia ➢formato aperto: gratuito e flessibile, estendibile ➢riuso di standard esistenti ❖Per i lessici computazionali esiste già una comunità attiva dal 2006, modelli e vocabolari già testati da poter riutilizzare (i.e, estensioni) Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali
ONTOLEX-LEMON: CORE MODEL cfr.: McCrae&Declerc “Introduction to the OntoLex-Lemon Model”- http://esslli2018.folli.info/wp-content/uploads/Introduction-to-the-OntoLex-Lemon-Model.pdf Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali
ETIMOLOGIA E COGNATES: deívaí Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali
ATTESTAZIONI: collegamenti al corpus → FrAC OntoLex (unofficial) extension Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali ❖Collega una forma a una iscrizione o una parola (sequenza di caratteri) nell’edizione del corpus ItAnt ❖Rappresenta altre info: ➢autore responsabile dell’attribuzione ➢forma ricostruita secondo convenzioni Leida ➢riferimenti bibliografici
COLLEGAMENTI A RISORSE ESTERNE ❖LiLa Lemma Bank ➢http://hdl.handle.net/20.500.11752/OPEN-532 ➢collezione di lemmi con proprietà morfosintattiche ➢usato per collegare i Cognates e le entrate@lat ❖The Etymological Dictionary of Latin and the other Italic Languages ➢http://hdl.handle.net/20.500.11752/OPEN-532 ➢usato per collegare gli etimi e le etimologie Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali Per il progetto ItAnt, esistono poche risorse Linked Open Data (5 stelle) utili a questo scopo. Due risorse lessicali interessanti e utili per specificare le informazioni etimologiche, per il Latino:
ECOSISTEMA DATI (DIG)ITANT Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali Bibliography LRMOO (EPIDOC) editions of Epigraphies standard/common vocabularies (LLOD) Lexica of Ancient languages Edit / explore web platform External LLOD Lexical Res. External Bibliography Management (Zotero) Un Ecosistema di dati connessi (lessici, testi, metadati, riferimenti bibliografici) e strumenti per la loro manipolazione e visione integrata.
VERSO UNA “LOD-IFICAZIONE" TOTALE Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali ❖Il lessico computazionale è allineato, sfruttando modello OntoLex-Lemon e rappresentazione RDF. ❖Ma la pubblicazione di corpora testuali (in TEI/EpiDoc) sul Semantic Web è ancora in fase iniziale: si sta ancora decidendo quale approccio/modello seguire.
VERSO UNA “LOD-IFICAZIONE" TOTALE Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali Un Abbiamo dunque svolto una Revisione Sistematica della Letteratura (Bandini, M. & Quochi, V. 2024) perchè: ❖la maggior parte delle risorse linguistiche nella rete dei Linguistic Linked Open Data sono dizionari, lessici, thesauri, terminologie e vocabolari controllati; ❖la pubblicazione di corpora testuali come Linked Open Data è ancora dibattuta e controversa; ❖alcuni progetti recenti hanno iniziato a esplorare diversi approcci e modelli per convertire e rappresentare i corpora testuali come Linked Open Data: NIF (Hellmann et. ali, 2013) POWLA, (Chiarcos, 2022), CoNLL-RDF (Chiarcos, 2020); → per valutare i vantaggi e identificare il modello più adatto per convertire o rappresentare le iscrizioni in lingua antica in Linked Open Data: POWLA.
GRAZIE PER L’ATTENZIONE Venezia, 20 settembre 2024 - PRIN 2017 Lingue e culture dell’Italia antica: linguistica storica e modelli digitali Valeria Quochi, [email protected].it Michela Bandini, [email protected].it