Euskarazko emozio-hitzen datu-base normatibo irekia
Abstract
This project aims to create the first open normative database of Basque emotion words by collecting emotional valence, arousal, and concreteness ratings for 4,200 words from native and highly proficient Basque speakers, using ANEW-based methods and making the results openly available for research and language technology applications. The poster was presented at the fourth CLARIAH-EUS workshop, on November 28, 2025 in Vitoria-Gasteiz.
Full text
Euskarazko emozio-hitzen datu-base normatiboa Mikel Santesteban1, Itziar San Martin1, Anna Hatzidaki2 eta Kepa Erdocia1 1 Gogo Elebiduna ikertaldea – Euskal Herriko Unibertsitatea (EHU) 2 National and Kapodistrian University of Athens (NKUA) SARRERA HELBURUAK: 1. Euskarazko hitzen balentzia emozionala, asaldura-maila eta konkretutasun-maila biltzen dituen lehen datu-base normatiboa sortzea. 2. Hitzen eta emozioen arteko lotura hiztunen lehen (H1) eta bigarren (H2) hizkuntzan berdina ote den ikertzea. Facial and Emotional Effects in Language (FEEL) proiektuan, euskarazko lehen emozio-hitzen datu-base normatibo irekia sortuko dugu. Hizkuntzaren prozesamenduan oso garrantzitsuak diren hitzen informazion lexikoko hainbat dimentsio ematen ditu EHME bezalako datu-baseak: maiztasuna, egitura ortografikoa, auzokideak, silabaegitura, morfologia, kategoria gramatikala, etab… Lan honen helburua prozesamenduan eragina duten beste 3 dimentsioren datuak biltzea da: Balentzia emozionala: Positiboa ala Negatiboa Asaldura-maila: Kitzikadura handia ala txikia Konkretutasun-maila: Abstraktua ala Konkretua Harremanetarako e-posta: [email protected] Eskertzak: Ikerketa hau Espainiako Gobernuaren (Zientzia eta Berrikuntza Ministerioa: PID2024-156359NB-I00) eta Eusko Jaurlaritzaren (IT1439-22) diru-laguntzarekin egin da. AA-ren afektibotasuna neurtzen PID2024-156359NB-I00 proiektu finantziatua: Partaideak •1.000 H1-euskara hiztun •1.000 H2-euskara hiztun •Datu-bilketa: % 25 laborategian % 75 online Materialak •5.000 hitz euskaraz (ahal bada, 15.000 hitzera zabaldu) •Iturriak: •ANEW datu-basearen euskarazko egokitzapena, 1.034 hitz •Multipic datu-baseko 500 izen (Duñabeitia et al., 2022) •Sentitegi datu-baseko 1.237 hitz (Alkorta et al., 2018) •Gainerako hitzak euskaraz egindako psikohizkuntzalaritza esperimentuetan erabilitakoak + EHME datu-basean gutxieneko maiztasun bat dutenak •Hitz-Kategoriak: izenak (% 75), aditzak (% 20), adjektiboak (% 12) eta adberbioak (% 7) •Hitzen %15-20 inguru gaztelera eta/edo frantsesarekin kognatuak. METODOAK Prozedura •Hizkuntza-profila neurtzeko galdetegia bete. •50 zerrenda esperimental (300 hitz zerrenda/partaide bakoitzeko) •100 hitzetako 3 bloke: balentzia, asaldura eta konkretutasuna •Zerrenda bakoitzean 10 kalibrazio-hitz (muturreko balioak) •PCIbex online plataforma erabilita, partaideek hitzak kalifikazio-eskala hauetan ebaluatuko dituzte (6. irudia): https://farm.pcibex.net/ •Balentzia emozionala: 1-9 (poztasuna-tristura) •Asaldura-maila: 1-9 (asaldatuta-lasai) •Konkretutasun-maila: 1-7 (abstraktua-konkretua) H1-Euskara hiztunak: •Beste hizkuntzetan (adib., ingelesa, espainola, kroaziera, Italiera) topatu ohi diren kalifikazioekin korrelazioa altuak hiru neurrietan. (Bradley & Lang, 1999; Doso et al., 2019; Montefinese et al., 2014, Redondo et al., 2007; Stadthagen-Gonzalez et al., 2017; Warriner et al., 2013).. •Asaldura-maila altuagoak hitz emozionaletan hitz neutroetan baino, batez ere balentzia positiboa duten hitzetan (e.g., Guasch et al., 2016). •Balentzia emozional eta asaldura-maila altuagoa duten hitzak abstraktuagoak izatea (e.g., Kousta et al., 2011; Vigliocco et al., 2014). 2. Irudia. Balentzia eta asaldura kalifikazioen arteko erlazioa irudikatzen duen grafikoa, Guasch et al. (2016) lanetik hartua Emaitzen aurreikuspenak 3. Irudia. Aldagai afektiboen (balentzia eta asaldura) eta lexiko-semantikoen (konkretutasuna) arteko erlazioa erakusten duen sakabanatze-matrizea eta erregresiolinealen lerroak (Guasch et al., 2016). H2-Euskara hiztunak: •Neurri afektiboetan (balentzia eta asaldura), H2 hiztunen balorazioek H1 hiztunenak baino eragin emozional ahulagoa (4. irudia; alboetako balioak eskalaren erdigunera bilduagoak) (Ferré et al., 2022; Imbault et al., 2021; Pavlenko, 2005). •H2ren gaitasun mailak eragin emozionalaren ahultzea txikiagotuko du (5. irudia). •Konkretutasun maila antzekoa bi taldeetan, aldagai hau hizkuntzaz independentea den maila kontzeptualekoa baita (Kroll & Stewart, 1994). Datu-base osoa sarbide irekikoa izango da (e.g. OSF, ADDI) eta bildutako datuak EHME edo bestelako datu-baseetan gehitu daitezke. 4. Irudia. H1 eta H2 balentzia-balorazioen arteko desberdintasunaren sakabanatze-diagrama, H1 balorazioen aurka irudikatua, joera-lerroarekin (Imbault et al., 2020). 5. Irudia. H1-eko balentziabalorazioen eragina H1-H2 balentzia-balorazioen desberdintasunean, ingelesezko irakurketagaitasun subjektiboaren arabera (Imbault et al., 2020). Prozedura oLatxa-ri eta beste hainbat AA-ri gure parte-hartzaileei emandako jarraibideak emanez, gizakiek baloratutako hitzak 3 dimentsioetan ebaluatzeko eskatu. oAA ezberdinen balorazioak gizakiek emandakoekin konparatu (Trott, 2024; Martínez et al., 2024, 2025). Aurreikuspenak oKorrelazio altuak (rho>.70) giza parte-hartzaileen eta AA-en epaien artean, batez ere H1-Euskara hiztunekin. Korrelazio onak lortuz gero, euskarazko klase irekiko hitz guztietako balentzia, asaldura-eta konkretutasun-mailak kalkulatuko ditugu emaitza onenak ematen dituen AArekin: LATXA-k irabaziko al du? 6. Irudia. GPT-4ren balorazioen eta giza balorazioen arteko erlazioa (Trott, 2024-etik moldatua)