Adizki jokatu historikoen etiketatzaile-analizatzaile automatikorantz
Abstract
This poster presents the work we are doing to create an automatic analyser for analysing conjugated verb forms in basque historical texts (16th century). This work was presented at the fourth CLARIAH-EUS workshop, on November 28, 2025 in Vitoria-Gasteiz.
Full text
Adizki jokatu historikoen etiketatzaileAdizki jokatu historikoen etiketatzaileanalizatzaile automatikorantz analizatzaile automatikorantz Borja Ariztimuño-Lopez1,3, Ainara Estarrona2, Ander Soraluze2 1 CNRS – IKER (UMR5478) & UPV/EHU 2 HiTZ Zentroa – Ixa, UPV/EHU {borja.ariztimuno, ainara.estarrona, ander.soraluze}@ehu.eus HELBURUAK 1) BIM-SAHCOBA proiektuan garaturiko algoritmoa hobetzea edo haren osagarri litzatekeen beste bat garatzea →normalizatu gabeko adizkiak identifikatu eta zenbait ezaugarri morfologikoren arabera analiza ditzakeena 2) Ariztimuño (2023)-ko datu-basea Leizarragaren datuez osatzea (oraingoz XVI. mendeko gainerako adizki guztak dauzka) METODOLOGIA ●BIM-SAHCOBAn Leizarragaren adizki gisa identifikaturikoen zerrenda zuzendu ●Bestelako bilaketak eginik eskuraturikoak erantsi, eskuz ●Orobat eskuz erauzi Leizarragaren beste testu laburragoetako adizkiak (ABC, Catechismea, etab.) ●Zerrenda osatu eta zuzendu hori erabili machine learning bidez algoritmoa berrentrenatzeko ●BIM-SAHCOBAn sartu ez zen Leizarragaren testu-zatia erabili algoritmo berria testatzeko ● Behar diren doikuntzak eta eskuzko zuzenketak egin (Leizarragaren aditza % 95ean zuzen etiketatzeko eta analizatzeko gai dela ziurtatu arte) ● Ariztimuño (2023)-ko datu-basea erabili algoritmoaren doikuntza zehatza areagotzeko, beste euskalki eta erregistroetako datuak ere ezagut ahal ditzan AURREIKUSPENAK □Leizarragaren adizki jokatu guztiak identifikaturik, etiketaturik eta analizaturik Ariztimuño (2023) datu-→ basean integratu + BIM-SAHCOBA elikatu □ Datu-base kontsultagarria eta erreminta digitala denon eskura ipini nahi genituzke, CLARIAH-EUSen hegalpean Erreferentziak Agerri, Rodrigo, Josu Bermudez, German Rigau (2014). Multilingual, Efficient and Easy NLP Processing with IXA Pipeline. EACL 2014: 5-8. ISBN:9781632663962. http://ixa.si.ehu.es/sites/ default/files/dokumentuak/3287/eacl2014-ixa-pipes.pdf Agerri, Rodrigo, Iñaki San Vicente, Jon Ander Campos, Ander Barrena, Xabier Saralegi, Aitor Soroa, Eneko Agirre (2020). Give your Text Representation Models some Love: the Case for Basque. Proceedings of LREC. Also available at arxiv https://arxiv.org/pdf/2004.00033.pdf Ariztimuño-Lopez, Borja (2023). Euskara Arkaikoko adizki jokatuen gaineko ikergaiak. Corpusa eta azterketa filologiko-linguistikoak [UPV/EHUko doktoretza tesia]. http://hdl.handle.net/ 10810/62152 Azurmendi, Ekhi, Jaione Bengoetxea, Julen Etxaniz, Joseba Fernandez de Landa, Maite Heredia, Aitor Soroa, Mikel Zubillaga (2024). BERnaT: Euskal Hizkuntzaren Aniztasuna Modelatzen [3. CLARIAH-EUS workshopean aurkezturiko posterra, 2024/11/21]. https://doi.org/10.5281/zenodo.17591663 Estarrona, Ainara, Izaskun Etxeberria, Ricardo Etxepare, Manuel Padilla-Moyano, Ander Soraluze (2020). Sintaktikoki etiketatutako euskarazko corpus historikoa eraikitzen. Fontes Linguae Vasconum 50 urte. Ekarpen berriak euskararen ikerketari. Nuevas aportaciones al estudio de la lengua vasca. http://www.culturanavarra.es/uploads/files/fontes50urte.15.pdf Estarrona, Ainara, Izaskun Etxeberria, Ricardo Etxepare, Manuel Padilla-Moyano, Ander Soraluze (2021). The First Annotated Corpus of Historical Basque. Digital Scholarship in the Humanities, vol. 37(2), pp. 391-404. https://doi.org/10.1093/llc/fqab066. Otegi, Arantxa, Nerea Ezeiza, Iakes Goenaga, Gorka Labaka (2016). A Modular Chain of NLP Tools for Basque. Proceedings of the 19th International Conference on Text, Speech and Dialogue, TSD 2016, Brno, Czech Republic, Lecture Notes in Computer Science, vol. 9924, pp. 93-100, Springer. ISBN 978-3-319-45509-9. https://doi.org/10.1007/978-3-319-45510-5_11 SARRERA ►Aurrerapen ikusgarria euskara estandar jasoaren analisi automatikoan (Agerri et al., 2014; Otegi et al., 2016; Agerri et al., 2020); berriki, ordea: ○BERnaT (Azurmendi et al. 2023) →Aldaera kolokial ez-estandarretarako ○BIM-SAHCOBA (Estarrona et al., 2021) →Aldaera historikoak →Etiketatzaile morfosintaktikoa →1M hitzeko datu-base kontsultagarria sarean (Leizarraga ez osorik) BAINA →Zailtasunak adizki jokatuen analisian (Estarrona et al., 2020) →Hutsak etiketatze eta analisietan →Normalizaturiko formetan oinarritu → ikerketa historikoa zaildu DATUAK Datu-baseko etiketen zehaztasunak CLARIAH-EUS IV. WORKSHOP-A Gasteiz, 2025/11/28 3 Eusko Jaurlaritzaren doktoretza-ondoko laguntza (POS_2023_1_0055) BIM-SAHCOBA (~15 testu) Leizarraga (automatikoa, ez osoa) Ariztimuño (2023) Adizki kopurua 138.000+ 21.000+ 8500+