scieee AI-readable full text Open interactive document viewer

Euskarazko haur hizkerarako ASR sortzen CHILDES datu basea Datu Hezigarri bihurtzen, hiztun eleaniztunen garapenari buruzko ikerketa hedagarria ahalbidetzeko

McArtor, David; Navas, Eva; GUTIERREZ MANGADO, MARIA JUNCAL

Abstract

This poster presents the work being done to optimise ASR systems for child speech, particularly for low-resource languages. The poster was presented at the fourth CLARIAH-EUS workshop, on November 28, 2025 in Vitoria-Gasteiz.

Full text

•CHILDES/ PhonBank datuetan Whisper sintonizatzeak murriztu egiten al ditu haur hizkuntzako errore tasak (WER) hizkuntzetan ezberdinetan ? •Nola aldatzen da errendimendua faktore linguistikoekin eta garapen - faktoree n arabera ? •Nola eragiten dio WERi 1,8-10 ordu euskaraz hitz egitea k? Ikerketa galderak •Modeloaren tamaina •Hizkuntza •Hizkuntza familia k •Prestakuntza -datuen kopurua •Doi ketarako datuen kopurua •Hizlarien adina •Sexuko hizlaria •Hiztun bakarren kopurua •Domeinua /Hizketa -mota •Curriculuma doit zea Faktore esperimentalak 1. Haur -hizkuntzako transkripzio eskalagarria sortze a hizkuntzarako , hezkuntzarako eta garapen -ikerketarako 2. Euskal haur -hizkuntzako lehen ASR ereduak ahalbidetzen dituzten tresnak eta erreferentzia - markak sortzea 3. Hizkuntza ezberdinetatik jasotako haurren hizkuntza jabekuntzaren , kode -txandaketaren eta tipologiaren ezagutza zabaltzea Espero diren emaitzak Euskarazko haur hizkerarako ASR sortzen : CHILDES datu basea Datu Hezigarri bihurtzen , hiztun eleaniztunen garapenari buruzko ikerketa hedagarria ahalbidetzeko David McArtor 1, Eva Navas 2eta M.J. Gutierrez -Mangado 3 (1) UPV/EHU; (2) HiTZ , UPV/EHU, (3) LASLAB, UPV/EHU Transkriba zioak prozesa tu •CHAT /XML transkripzioak prozesatu •Metadatuak atera , baliozkotu eta normalizatu •Testuinguruko etiketak ezarri Audioaren prozes atu •Haur zatiak aukeratu •15-30s •ASRrako prest •Denboralea -lerrokat u Datu sorta sortzea •Audioak + Transkripzioak + Metadatuak •HF -rekin bateragarriak •50+ corpora Oinarrizko ebaluazioa •Whisper inferentzia •WER /CER •MLFlowen Metrikak erregistrat u Doit zea (fine -tuning) •PEFT/ LoRA •Modeloaren tamaina , datu kopurua eta FT curriculu doitu Doit zearen ondorengo analisia •Faktore esperimen -talak aztert u Whisper doitua : orain arteko emaitzak Aurreko Dat u Sorta Konbinatu Handiena Helburu den CHILDES /PhonBank Data proposamena Zergatik haur hizkuntzarak o ASRk ? ✔Eskala handiko hizkuntzen ikerket ak errepikatzeko ✔Hezkuntza eta irisgarritasunerako tresnak lantzeko ✔Hizkuntzaren atzerapenak garaiz detektatze ko Egungo erronkak ✔Haurren ASR ez da helduena bezain zehatza ✔Baliabide urriko hizkuntzek (adibidez , euskarak ) are emaitza txarragoak dituzte ✔Zehaztasuna hobetu behar da tresna horiek zuzenak eta erabilgarriak izan daitezen Ikerketaren helburua : Haurren ASR errendimendua hobet zea , batez ere hizkuntza tkikietan Whisperren doit zea Faktore esperimental anitzen azterketa konparatiboa egitea CHILDES eko datu ak bihurtu ASRrako prest atzea Metodoa ⮚Aurrez prestatutako eredu eleaniztun handia erabil iz ⮚Hizkuntza askotan transkribatutako haur -diskurtsoa erabiliz hola (eg )iten du hala gero hala yeah (.) an(d) dat [: that] night got stop y luego (.) y luego sale el perro al argol [: árbol] [*] . Muga Euskarazko haur hizkuntzako 10 ordu gehiago behar dira Zenbat datu berri ? •400+ Ordu •9 Hizkuntza •5 Hizkuntza familia Laburpena eta erreferentziak Webgunea