This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.
UTFORSKANDE AV SKALERAD AIC INOM ENGELSKA SLUTNA SAMMANSÄTTNINGAR
En undersökning av skalad AIC hos engelska slutna sammansättningar (sammansatta ord)
ANNOTATION
Akaikes informationskriterium (AIC) är ett etablerat goodness-of-fit-mått för val av modeller vid analys av empiriska data. AIC är emellertid känsligt för stickprovsstorleken. Författarens tidigare forskning har visat att skalad AIC, det vill säga AIC dividerat med stickprovsstorleken, är ett effektivt verktyg för att bedöma modellanpassning och rangordna regressionsmodeller. Den föreliggande studien undersöker ytterligare egenskaper hos denna variabel. Undersökningsobjektet är 66 multipla regressionsmodeller som avser bearbetningen av slutna (konkatenerade) engelska sammansättningar hämtade från Gagné et al.:s (2019) Large Database of English Compounds (LADEC). I synnerhet ställs skalad AIC mot English Lexicon Project (ELP) och British Lexicon Project (BLP) som källor till responstider, de lexikala besluts- och benämningsuppgifterna, sammansättningarnas längd och transparensnormer. Envägs-ANOVA, analys av huvudeffekter och icke-parametriska test används som metoder. Resultaten antyder att skalad AIC reagerar på experimentell design, källan till responstiderna samt de lexikala besluts- och benämningsuppgifterna. Samtidigt ger resultaten av denna studie empiriskt stöd för valideringen av de metoder som används av Gagné et al. (2019).
NYCKELORD: engelska sammansättningar, skalad AIC, lexikalt beslut, benämning.
ANNOTATION
Akaikes informationskriterium (eng. AIC) är ett stabilt mått på modellanpassning som används vid analys av empiriska data. AIC är dock känsligt för stickprovsstorleken. Tidigare
Straipsniai / Articles
273
Page 2
CHARITON CHARITONIDIS
författarens forskning har visat att skalad AIC, dividerad med stickprovsstorleken, är ett effektivt verktyg för att bedöma modellanpassning och rangordna regressionsmodeller. I denna studie undersöks ytterligare egenskaper hos denna variabel. Undersökningsobjektet är 66 multipla regressionsmodeller som avser bearbetningen av slutna (sammansatta) engelska sammansättningar hämtade från Gagnés et al. (2019) Large Database of English Compounds (eng. LADEC). Inledningsvis jämförs AIC med English Lexicon Project (eng. ELP) och British Lexicon Project (eng. BLP), som källor till responstider, uppgifter för lexikala beslut och benämning, sammansättningarnas längd samt transparensnormer. De metoder som används är envägs-ANOVA (eng. Analysis of variance), analys av huvudeffekter och icke-parametriska test. Resultaten visar att skalad AIC reagerar på den experimentella designen, källan till responstiderna och uppgifterna för lexikala beslut och benämning. Samtidigt ger resultaten av denna studie ett empiriskt underlag för att bekräfta de metoder som används av Gagné et al. (2019).
NYCKELORD: engelska sammansättningar (sammansatta ord), skalad AIC, lexikalt beslut, benämning.
1. DEN STORA DATABASEN MED ENGELSKA SAMMANSÄTTNINGAR (LADEC: GAGNÉ ET AL. 2019)¹
The Large Database of English Compounds (LADEC: Gagné et al. 2019) är den största befintliga databasen med sammansatta ord. Den innehåller över 8000 icke-mellanslagsskrivna (”slutna” eller ”konkatenerade”) sammansättningar (=substantiv) som valts från olika källor, däribland CELEX-databasen (Baayen et al. 1995), English Lexicon Project (ELP; Balota et al. 2007), British Lexicon Project (BLP; Keuleers et al. 2012), British National Corpus (BNC) och Wordnet. Av hela mängden LADEC-poster kan 7 804 sammansättningar entydigt analyseras som bestående av två fria morfemkonstituenter.² Ett mycket stort urval av sammansättningar beaktas, till exempel substantiv-substantiv-sammansättningar, t.ex. buttercup, shipyard, sammansättningar med en andra konstituent avledd från en verbal stam, t.ex. pacemaker, painkiller, osv. (för definitioner av sammansättningsklasser, se Lieber 2004: 46). Den första konstituenten, som inte är huvud, omfattar ett brett spektrum av grammatiska kategorier. Figur 1 innehåller ett kort urval av LADEC-poster.
Gagné et al.:s (2019) multipla regressionsmodeller omfattar ett brett spektrum av prediktorvariabler (=oberoende variabler), såsom sammansättningens längd, bigramfrekvens
¹ Detta avsnitt har hämtats från Chariton Charitonidis (2022) med mindre ändringar.
² LADEC innehåller pluralformer av redan listade sammansättningar som separata poster.
274
Acta Linguistica Lithuanica XC
Page 3
Exploring Scaled AIC within English Closed Compounds
vid morfemgränsen, familjestorlek, ordfrekvens, sannolikhets- och associationsmått (vektorbaserade), emotionella/affektiva normer beräknade från deltagarskattningar osv. De logaritmerade responstiderna för sammansättningarna från ELP (lexikalt beslut, benämning) och BLP (lexikalt beslut) används som beroende variabler. För det mesta används sammansättningens längd (antal tecken) och den logaritmerade frekvensen för sammansättningen (=ordet) från SUBTLEX-US-korpusen (Brysbaert, New 2009)³ och BNC (BLP) som kontrollvariabler. I Gagné et al.:s (2019) modeller hade de ovan nämnda prediktorvariablerna signifikanta effekter på tiderna för lexikala beslut och benämning.
FIGUR 1. LADEC-poster: urval
Huvudfokus i Gagné et al.:s (2019) studie låg på olika mått på semantisk transparens. Gagné et al. (2019) bad deltagarna att bedöma sammansättningarna med avseende på hur förutsägbar sammansättningens betydelse är utifrån dess delar (betydelseförutsägbarhet-skattningar, sammansättningsbaserade) och hur mycket av varje konstituents betydelse som behålls i sammansättningen (betydelsebevarande-skattningar, konstituentbaserade). Författarna fann att transparensfördelningen för den andra konstituenten var betydligt mer toppig och högre än transparensfördelningen för den första konstituenten (MC1: 64.80 [SD: 19.59] jämfört med MC2: 71.00 [SD: 16.46]. N = 8115). Skattningen för
³ SUBTLEX–US-korpusen är en korpus med 51 miljoner token baserad på undertexter från amerikanska filmer och tv-program. Flera nyare studier har gett belägg för att frekvensnormer som erhålls från undertexter till filmer och tv-program tenderar att vara effektivare än sådana som härrör från tryckta texter när det gäller att förklara skillnader i lexikal bearbetningstid och, i vissa fall, träffsäkerhet hos infödda talare av olika språk (se Chen et al. 2018: 2 och referenserna däri).
Straipsniai / Articles
275
Page 4
CHARITON CHARITONIDIS
första konstituenten var starkare korrelerad med skattningen för hela sammansättningen än skattningen för den andra konstituenten (c1~cmp: r = 0.75, p <.001 jämfört med c2~cmp: r = 0.66, p <.001. N = 429).⁴ Särskilt betydelsefullt var att betydelsebevarandeskattningen för den första konstituenten och betydelseförutsägbarhetsskattningen för sammansättningen förutsade alla tre typerna av responstider, dvs. ELP:s lexikala beslutstider, BLP:s lexikala beslutstider och ELP:s benämningstider.
Sammanfattningsvis tycks den toppigare och högre transparensfördelningen för den andra konstituenten och den första konstituentens starkare samband med sammansättningens betydelseförutsägbarhet omedelbart avspeglas i huvudoperationerna hos engelska sammansättningar. Den andra konstituenten, dvs. huvudet, är en enhet vars transparens förbättras kategoriskt och semantiskt (beträffande den semantiska aspekten, se även relationerna av entailment och hyponymi). Den första konstituenten, dvs. bestämningen, är den mest kritiska faktorn när sammansättningens referens etableras. Därför kovarierar dess transparens starkast med sammansättningens transparens.⁵
2. AKAIKES INFORMATIONSKRITERIUM (AIC)
År 1973 utvecklade Hirotugu Akaike en metod för att uppskatta den relativa förväntningen av Kullback–Leibler-avståndet (Kullback 1959) med hjälp av Fishers maximerade log-likelihood (Fisher 1922; se även Aldrich 1997). Detta mått, som vanligen kallas Akaikes informationskriterium (AIC; Akaike 1973), introducerade ett nytt ramverk för modellval vid analys av empiriska data och innebar ett betydande paradigmskifte (Burnham, Anderson 2002).
AIC beräknas vanligtvis enligt följande: −2lnL + 2k, där ”lnL” avser modellens maximerade/fullständiga log-likelihood och ”k” avser antalet parametrar inklusive konstanten. Ett mindre antal prediktorer är vanligtvis förknippat med effektivare modeller (modeller med mindre informationsförlust). Ju lägre (=mer negativt) AIC-värdet är, desto bättre är modellanpassningen. I detta sammanhang bestraffar AIC, som mått på modellanpassning, användningen av ett stort antal prediktorer som potentiellt leder till högre AIC-värden (se ”+2k”-delen av AIC-ekvationen).
⁴ Steigers (1980) z-test visade att denna skillnad var signifikant, z = 27.71, p <.0001 (Gagné et al. 2019).
⁵ Med hänvisning till tidigare forskning rapporterar Gagné et al. (2019) att ”bestämningen (den första konstituenten i engelskan) tenderar att spela en större roll i valet av relationslätthet under bearbetningen av sammansättningar och nominalfraser.”
276
Acta Linguistica Lithuanica XC
Page 5
Exploring Scaled AIC within English Closed Compounds
AIC är känsligt för stickprovsstorleken. AICc, en korrigerad version av AIC, införlivar stickprovsstorleken genom formeln 2k (k + 1)/ (n − k − 1). Det behandlar dock specifikt små stickprov och rekommenderas inte för modeller baserade på stora stickprov, såsom det i Gagné et al. (2019).⁶ Det bör noteras att forskare som Kenneth P. Burnham & David R. Anderson (2002) inte erbjuder någon definitiv lösning för att jämföra AIC-värden för modeller anpassade till både olika och stora stickprovsstorlekar.⁷
I synnerhet ger Burnham & Anderson (2002: 80–85, 334–335) en omfattande diskussion om konsekvenserna av ojämlika stickprovsstorlekar för modelljämförelser. De hävdar att användningen av informationskriterier för att jämföra modeller med olika stickprovsstorlekar kan leda till missvisande resultat. På motsvarande sätt, som Svetunkov noterade i en diskussion på nätet 2016 (se referensen efter bibliografin), bygger alla informationskriterier på likelihoodfunktionen, som i sin tur beror på stickprovsstorleken. När stickprovsstorleken ökar minskar likelihooden. Följaktligen ökar även informationskriterierna i sådana fall.⁸
3. TIDIGARE FORSKNING
I Charitonidis (2022) dividerades AIC-värdena för 44 multipla regressionsmodeller med olika kombinationer av emotionsvariabler (valens, aktivering och konkrethet för (a) ord och (b) ordkontexter) med stickprovsstorleken (N), vilket gav värden för skalad AIC (AIC/N). Därefter användes dessa värden för att bedöma
⁶ För ytterligare information om AICc hänvisas läsaren till Burnham & Anderson (2002: 374–380).
⁷ En av de lösningar som Burnham & Anderson (2002) föreslår avser omvandlingen av AIC-värdena till ”Akaikevikter”, som definieras som ”modellens relativa likelihood givet data” (Burnham, Anderson 2002: xiii; se även Wagenmakers, Farrell 2004).
⁸ Tillgänglig på: https://stats.stackexchange.com/questions/94718/model-comparison-with-aic-based-on-different-sample-size [läst 16.06.2023]. Läsaren kan förstå Svetunkovs påstående genom att ersätta olika värden för ”lnL”-komponenten i AIC-ekvationen, samtidigt som ”2k”-komponenten hålls konstant. En minskning av lnL-värdet leder till ett högre, dvs. sämre, AIC-värde.
⁹ I litteraturen kallas skalad AIC också ”medel-AIC”. Enligt Svetunkov (personlig kommunikation) är det inte någon ny företeelse att dividera Akaikes informationskriterium med stickprovsstorleken. Hastie et al. (2009: 230–231) definierar till exempel AIC på ett icke-kanoniskt sätt och använder N som nämnare i formeln. Även om denna avvikelse från den konventionella AIC-formeln har sina kritiker, förblir den ett vanligt tillvägagångssätt, vilket bland annat framgår av att det ingår i statistikprogrammet Stata. Stata rapporterar exempelvis ”AIC dividerat med N” i sin modellutskrift, vilket beläggs av flera exempel som finns tillgängliga på nätet (Tack till I. Svetunkov för denna information).
Straipsniai / Articles
277
Page 6
CHARITON CHARITONIDIS
och jämföra modellernas modellanpassning. Införandet av centrala prediktorer i globala, dvs. generella, modeller visade att BLP:s lexikala beslutstider krävde bättre modellanpassning än ELP:s lexikala beslutstider. Anpassningen hos ELP:s benämningsmodeller låg inom det intervall som observerades för ELP:s och BLP:s lexikala beslutsmodeller. Särskilt framträdde kontextuell konkrethet för den andra konstituenten som en signifikant prediktor i alla modeller med SUBTLEX-US-frekvens, både för lexikala beslut och benämning.
I Charitonidis (2024) jämfördes alla signifikanta koefficienter från globala modeller med SUBTLEX-US-frekvens med variabeln hyponymi (Gagné et al. 2020). Det visade sig att modeller som inkluderade både hyponymi och kontextuell konkrethet för den andra konstituenten alltid var förknippade med det lägsta (=bästa) värdet för skalad AIC jämfört med nästlade, dvs. reducerade, modeller där någon av dessa två variabler utelämnades. De därefter genomförda Wald-testerna visade att nästlade modeller alltid hänvisade till en signifikant minskning (=försämring) av determinationskoefficienten (R2). Tabell 1 och 2 visar värdena för skalad AIC respektive resultaten av de motsvarande Wald-testerna.
TABELL 1.
Skalade AIC-värden för nästlade modeller där hyponymi (”Modell 2”) eller kontextuell konkrethet för den andra konstituenten (”Modell 3”) utelämnas från fullständiga modeller (”Modell 1”) för att förutsäga lexikala beslutstider i English Lexicon Project (ELP) (LD), lexikala beslutstider i British Lexicon Project (BLP) samt benämningstider i ELP
Wald-tester för nästlade modeller där hyponymi (”Modell 2”) eller kontextuell konkrethet för den andra konstituenten (”Modell 3”) utelämnas från fullständiga modeller (”Modell 1”) för att förutsäga lexikala beslutstider i English Lexicon Project (ELP) (LD), lexikala beslutstider i British Lexicon Project (BLP) samt benämningstider i ELP
Sammanfattningsvis rangordnade två olika effektstorleksmått, nämligen skalad AIC och R2, samma regressionsmodeller identiskt och visade samtidigt samma preferens för den bästa modellen. Det finns således starka belägg för att måttet skalad AIC är ett kvalitativt verktyg för att bedöma modellanpassning.
Straipsniai / Articles
279
Page 8
CHARITON CHARITONIDIS
4. DEN FÖRELIGGANDE STUDIEN
Den föreliggande studien bygger vidare på författarens tidigare forskning som presenterades i avsnitt 3. Forskningsmaterialet består av 66 modeller för lexikala beslut och benämning av engelska slutna (konkatenerade) sammansättningar, konstruerade av Gagné et al. (2019). Alla modeller inkluderar SUBTLEX-US-frekvens som kontrollvariabel. Våra mål är tvåfaldiga och löper parallellt. För det första bedömer vi egenskaperna hos Gagné et al.:s (ibid.) modeller. För det andra undersöker vi väsentliga egenskaper hos måttet skalad AIC.
Forskningsfrågorna är: 1. Är skalad AIC känsligt för modelldesignen hos Gagné et al. (2019)? Vilka modellgrupper gynnas? 2. Vilken inverkan har kontrollvariablerna ”sammansättningens frekvens” och ”sammansättningens längd” på skalad AIC? 3. Hur är morfologisk transparens relaterad till skalad AIC?
Vår studie är strukturerad enligt följande: Avsnitt 5 ger en översikt över våra metoder. Avsnitt 6.1 ger deskriptiv statistik för skalad AIC med avseende på de modeller som beaktas. Tonvikten ligger på de parametriska respektive icke-parametriska egenskaperna hos modellkategorierna. Avsnitt 6.2 undersöker sambandet mellan källan till responstiderna och de lexikala bearbetningsuppgifterna. Avsnitt 6.3 jämför skalad AIC med kontrollvariablerna ”sammansättningens frekvens” och ”sammansättningens längd”. I avsnitt 6.4 kopplas signifikansnivåerna för transparenskoefficienterna från Gagné et al.:s (2019) modeller till värdena för skalad AIC. De viktigaste resultaten sammanfattas i avsnitt 7, följt av en diskussion av resultaten i avsnitt 8.
5. METODER
Vår övergripande metod var en jämförande analys av huvudparametrarna och egenskaperna hos Gagné et al.:s (2019) modeller, där skalad AIC användes som beroende variabel. De oberoende variablerna omfattade bland annat stickprovsegenskaper (t.ex. källa till responstider och lexikala bearbetningsuppgifter), studiedesign (t.ex. kontrollvariabler) och signifikansnivån för transparenskoefficienterna.
De specifika statistiska metoder som användes var följande: (a) deskriptiv statistik för medelvärden och medianer, tillsammans med tillämpning av Shapiro–Wilk-testet för att bedöma centraltendens, variabilitet och fördelning av skalad AIC i olika modellkategorier och grupper (avsnitt 6.1 och 6.2), (b) analyser av huvudeffekter genomförda för källan till responstiderna (ELP/BLP) och de lexikala bearbetningsuppgifterna (lexikalt beslut/benämning) (avsnitt
280
Acta Linguistica Lithuanica XC
Page 9
Exploring Scaled AIC within English Closed Compounds
6.2), (c) separata ANOVA-analyser av källan till responstiderna och de lexikala bearbetningsuppgifterna, med sammansättningens längd som kovariat (avsnitt 6.3), samt (d) användning av Kruskal–Wallis- och Jonckheere–Terpstra-testen för att undersöka skillnader mellan rangordningarna för ordinalt omkodade koefficienter för semantisk transparens (avsnitt 6.4). För mer information om metoderna hänvisas läsaren till analyserna i avsnitt 6.1–6.4.
6. ANALYSER
6.1. Skalad AIC kontra modellkategorier
De 66 AIC-värdena från Gagné et al.:s (2019) multipla regressionsmodeller med SUBTLEX–US-frekvens som kontrollvariabel dividerades med varje modells stickprovsstorlek för att ge en uppsättning av 66 värden för skalad AIC.
Tabell 3 nedan ger den deskriptiva statistiken för skalad AIC och Figur 2 visar motsvarande boxplot för den ordnade uppsättningen värden.10 Det fanns inga extremvärden i stickprovet. Skevhetsvärdena (Sk) och kurtosisvärdena (Ku) var godtagbara.11
Medelvärdet för skalad AIC var −3.50030. Standardavvikelsen var 0.19052, det vill säga observationerna var relativt tätt klustrade kring medelvärdet. Minimi- och maximivärdena var −3.85502 respektive −3.15754. Medianvärdet var −3.55732, dvs. något lägre än medelvärdet.12 De mellersta 50% av data låg mellan −3.66575 (första kvartilen, Q1) och −3.30959 (tredje kvartilen, Q3). Följaktligen var interkvartilavståndet (IQR) 0.35616.
10 Den nedre, eller första kvartilens linje i lådan (Q1) markerar gränsen under vilken de nedersta 25% av data sträcker sig. På motsvarande sätt markerar den övre, eller tredje kvartilens linje i lådan (Q3) gränsen över vilken de översta 25% av data sträcker sig. Det skuggade området visar gränserna för de mellersta 50% av data, eller interkvartilavståndet (IQR), som kan beräknas genom att subtrahera den första kvartilen från den tredje kvartilen (Q3−Q1). Den horisontella linjen inuti lådan visar medianen, eller den mellersta kvartilen (Q2), dvs. det värde som ligger mitt i datamängden.
11 Med hänvisning till SPSS-miljön betraktas värden mellan −1 och +1 för skevhet och mellan −2 och +2 för kurtosis i allmänhet som godtagbara vid bedömning av normalfördelning. Det bör dock noteras att skevhet och kurtosis ensamma inte utgör ett avgörande bevis för normalitet (se även diskussionen om https://www.researchgate.net/post/What_is_the_acceptable_range_of_skewness_and_kurtosis_for_normal_distribution_of_data).
12 I linje med detta mönster fanns en liten positiv skevhet i data (0.494).
Straipsniai / Articles
281
Page 10
CHARITON CHARITONIDIS
TABELL 3. Deskriptiv statistik för skalad AIC (hela uppsättningen)
Medelvärde SD Min Max −3.50030 0.19052 −3.85502 −3.15754 Median IQR Q1 Q3 −3.55732 0.35616 −3.66575 −3.30959
N=66. Sk=0.494, Ku=−1.101
FIGUR 2. Fördelning av skalad AIC (hela uppsättningen): boxplot
Det förväntades att hela uppsättningen av värden för skalad AIC inte skulle uppvisa normalfördelning, eftersom den omfattade olika uppgifter (lexikalt beslut, benämning) och härrörde från olika källor till responstider (ELP, BLP). Shapiro–Wilk-testet och Kolmogorov–Smirnov-testet bekräftade våra antaganden.13 I synnerhet var statistiken för Shapiro–Wilk-testet W (66) = 0.90, p <.001, och statistiken för Kolmogorov–Smirnov-testet var D (66) = 0.17, p <.001. Det bör noteras att samma fullständiga uppsättning inte uppvisade normalfördelning ens efter tillämpning av den naturliga logaritmen och kvadratrotsomvandlingarna på absolutvärdena.
Tabell 4 nedan ger den deskriptiva statistiken för skalad AIC med hänvisning till huvudmodellkategorierna hos Gagné et al. (2019), dvs. ELP:s lexikala beslut, BLP:s lexikala beslut och ELP:s benämning (varje grupp innehåller 22 modeller). Figur 3 visar motsvarande boxdiagram. Som kan ses är medelvärdena och medianerna
Exploring Scaled AIC within English Closed Compounds
för BLP:s lexikala beslut och ELP:s benämning avsåg liknande värden för skalad AIC. ELP:s lexikala beslut avsåg högre (=sämre) värden som dessutom var disjunkta från värdena för BLP:s lexikala beslut.14 Sammanfattningsvis krävde BLP:s lexikala beslut och ELP:s benämning alltid bättre modeller än ELP:s lexikala beslut.
TABELL 4. Deskriptiv statistik för skalad AIC efter huvudmodellkategorier
Det förväntades att hela uppsättningens icke-parametriska profil skulle vara mindre sannolik inom huvudmodellkategorierna, dvs. de huvudsakliga kombinationerna av responstider och uppgifter. Som det kommer att framgå bekräftades denna förväntan.
Shapiro-Wilk-testet visade att ELP:s lexikala beslutsdata avvek signifikant från normalitet. I synnerhet beräknade vi en teststatistika på W (22) = 0.90, p <.05.15
BLP:s lexikala beslutsdata var normalfördelade. Den motsvarande statistiken var W (22) = 0.92, p >.05 (Shapiro-Wilk).
14 Ett t-test av sammanfattningsdata för ELP:s lexikala beslut och BLP:s lexikala beslut (Tabell 4) visade en mycket signifikant skillnad mellan stickprovsmedelvärdena, t = 18.296, p <.0001.
15 Det bör noteras att en uppsättning av sex ELP-modeller för lexikala beslut hänförde sig till Scaled AIC-värden nära maximivärdet −3.15754, vilket indikerar den sämsta anpassningen i hela datamängden. Dessa modeller bidrog till en framträdande topp mot den högre änden av fördelningen (från −3.17304 till −3.15754), vilket resulterade i ett nästan bimodalt fördelningsmönster. Denna observation stöds av ett relativt högt negativt kurtosisvärde på −1.444.
Straipsniai / Articles
283
Page 12
CHARITON CHARITONIDIS
FIGUR 3. Boxplotrepresentationer av Scaled AIC efter huvudmodellkategorier
På liknande sätt var ELP:s namngivningsdata normalfördelade. Den motsvarande statistiken var W (22) = 0.93, p >.05 (Shapiro–Wilk).
Sammanfattningsvis var både den fullständiga uppsättningen modeller och ELP-modellerna för lexikala beslut förknippade med en icke-parametrisk fördelning av Scaled AIC. Däremot var BLP:s data för lexikala beslut och ELP:s namngivningsdata normalfördelade. Låt oss nu försöka klarlägga inflytandet av enskilda faktorer på Scaled AIC.
6.2. Scaled AIC kontra källa till responstid och uppgifter
Tabell 5 nedan innehåller deskriptiv statistik för Scaled AIC-värdena för de grupper som kategoriserats efter huvudfaktorerna ”responstider” och ”uppgifter”, dvs. (a) ELP-responstider, (b) BLP-responstider, (c) namngivningsuppgift och (d) lexikal beslutsuppgift. ELP-responstiderna och den lexikala beslutsuppgiften
284
Acta Linguistica Lithuanica XC
Page 13
Exploring Scaled AIC within English Closed Compounds
är övergripande grupper som hänför sig till ”lexikala beslut & namngivning” respektive ”ELP & BLP”. Grupperna ”BLP” och ”Namngivning” är identiska med modellkategorierna ”BLP lexikala beslut” respektive ”ELP namngivning”, som redan presenterades i Tabell 4 (avsnitt 6.1). Figur 4 visar de motsvarande boxplotrepresentationerna.
Som framgår av Tabell 5 hänförde sig både ”BLP” och ”Namngivning” till (a) lägre (=bättre) huvud- och medianvärden för Scaled AIC, och (b) mindre värden för standardavvikelse (SD) och interkvartilavstånd (IQR), i kontrast till de övergripande grupperna ”ELP-responstider” och ”lexikala beslut”.16 Samma övergripande grupper har relativt höga kurtosisvärden, dvs. −1.403 respektive −1.616 (i histogrammen för dessa grupper – som inte återges här – framträdde två tydliga toppar, liknande dem i en bimodal värdefördelning). Dessa mönster antyder att måttet Scaled AIC var unikt förknippat med de väldefinierade experimentella kategorierna BLP lexikala beslut (se gruppen ”BLP”) och ELP namngivning (se gruppen ”Namngivning”).
TABELL 5.
Deskriptiv statistik för Scaled AIC avseende de grupper som kategoriserats under ”responstider” och ”uppgifter”
16 Lägre medelvärden och medianer tillsammans med mindre värden för standardavvikelse och interkvartilavstånd indikerar större tillförlitlighet och minskad känslighet för avvikare eller extrema värden.
Straipsniai / Articles
285
Page 14
CHARITON CHARITONIDIS
FIGUR 4. Boxplotrepresentationer för Scaled AIC avseende de grupper som kategoriserats under ’svarstider’ och ’uppgifter’
Liksom för hela uppsättningen Scaled AIC-värden som diskuterades i avsnitt 6.1 förväntades en icke-parametrisk profil framträda för de övergripande grupperna ’ELP’ och ’lexikalt beslut’, utan begränsning till specifika experiment. Normalitetstesterna bekräftade våra förväntningar.
Med hänvisning till Shapiro–Wilk-testet avvek Scaled AIC-data för ELP-gruppen signifikant från normalitet. Vi beräknade en teststatistika på W (44) = 0.91, p <.01. På motsvarande sätt avvek Scaled AIC-data för gruppen ’lexikalt beslut’ signifikant från normalitet. Vi beräknade en teststatistika på W (44) = 0.89, p <.001.
Låt oss nu gå vidare till analysen av huvudeffekter. Det primära syftet var att fastställa huruvida BLP:s lexikala besluts- och ELP:s namngivningsgrupper fortsätter att förutsäga bättre modeller när man kontrollerar för effekterna av den andra gruppen.
I de statistiska tester som följer tilldelades grupperna som kategoriserats under huvudfaktorerna ’svarstider’ och ’uppgifter’ nominalvärden. Scaled AIC-medelvärdet för BLP-gruppen, det vill säga −3.623, användes som referenscell eller intercept.
Resultaten visade att både svarstider och uppgifter hade en huvudeffekt på Scaled AIC, men att ingen interaktion förekom. I synnerhet fanns det en signifikant huvudeffekt av svarstider, F (1, 63) = 271.87, p <.001. I regressionstermer förutsade koefficienten för ELP ett högre, det vill säga sämre, Scaled AIC-värde, b = 0.37, SE = 0.02, t = 16.49, p <.001. Dessutom fanns det en signifikant huvudeffekt av uppgifter, F (1, 63) = 275.42, p <.001. I regressionstermer förutsade koefficienten för namngivning ett lägre, det vill säga bättre, Scaled AIC-värde, b = −0.37, SE = 0.02, t = −16.60, p <.001.
Figur 5 ger en översikt över huvudeffekterna med hjälp av ett punkt- och linjediagram. Interceptet eller referenscellen avser både det lägsta ELP-namngivningsvärdet och det högsta BLP-värdet för lexikalt beslut, det vill säga −3.623. Linjerna är staplade
286
Acta Linguistica Lithuanica XC
Page 15
Exploring Scaled AIC within English Closed Compounds
vertikalt eftersom intervallen för Scaled AIC-värdena för ELP:s lexikala beslut och BLP:s lexikala beslut var disjunkta (se Tabell 4). Dessutom är linjerna parallella eftersom frånvaron av en grupp för ’BLP-namngivning’ inom uppgifterna eliminerade eventuella interaktionseffekter.
Sammanfattningsvis förutsade BLP:s svarstider och namngivningsuppgiften konsekvent bättre skalade AIC-värden, även efter ömsesidig kontroll för relevanta faktorer. Dessa resultat ökar noggrannheten och effektiviteten hos de respektive modellerna.
FIGUR 5. Diagram över huvudeffekter för Scaled AIC
Det bör noteras att analysen av huvudeffekter som presenteras i detta avsnitt är mer tillämplig på källan till svarstiderna än på uppgiftsprestationen, eftersom kombinationen ’BLP-namngivning’, som redan nämnts, inte var tillgänglig. Detta faktum kan begränsa resultatens generaliserbarhet bortom de specifika urvalen.
6.3. Scaled AIC kontra kontrollvariabler
I detta avsnitt kommer fokus att ligga på kontrollvariablerna sammansättningslängd (i tecken) och SUBTLEX-US-frekvens, det vill säga den logaritmerade sammansättningsfrekvensen som härletts från SUBTLEX-US-korpusen (Brysbaert, New 2009). Båda variablerna användes utförligt i Gagné et al.:s (2019) regressionsmodeller.
Straipsniai / Articles
287
Page 16
CHARITON CHARITONIDIS
För att upptäcka inflytandet av sammansättningslängd och sammansättningsfrekvens på Scaled AIC kodades de respektive regressionskoefficienterna om till ordinalvärden enligt deras positivitet och signifikansnivå; se Tabell 6. Signifikansnivåerna mappades till ordinal skalor eftersom de representerade konventionella gränsvärden baserade på de exakta signifikansvärdena.
TABELL 6. Tabell för ordinal omkodning av regressionskoefficienter
Signifikans Positivitet Ordinalvärden Beskrivning p <.001 negativ −3 stor negativ effekt p <.01 negativ −2 måttlig negativ effekt p <.05 negativ −1 liten negativ effekt p >.05 negativ/positiv 0 icke-signifikant effekt p <.05 positiv 1 liten positiv effekt p <.01 positiv 2 måttlig positiv effekt p <.001 positiv 3 stor positiv effekt
I Gagné et al.:s (2019) modeller var SUBTLEX-US-frekvens alltid förknippad med negativa (=latensreducerande) koefficienter med stor effekt, p <.001. Följaktligen kodades alla koefficienter om som −3, ett värde som var perfekt kollineärt med utfallsvariabeln Scaled AIC. Av denna anledning uteslöts SUBTLEX-US-frekvens från den föreliggande analysen.
Vad gäller sammansättningslängd hade alla signifikanta regressionskoefficienter från Gagné et al.:s (2019) modeller en stor positiv (=latensinducerande) effekt, p <.001. Till skillnad från SUBTLEX-US-variabeln förekom flera icke-signifikanta koefficienter. Med utgångspunkt i dessa mönster skapades en kategorisk variabel med värdet ’1’ för positiv effekt (=interferens från sammansättningslängd) och ’0’ för ingen effekt (=ingen interferens från sammansättningslängd). Det resulterande urvalet innehöll 39 Scaled AIC-värden. Pearsons korrelationstest mellan sammansättningslängd och Scaled AIC gav en mycket signifikant korrelationskoefficient på 0.51, p =.001, vilket indikerar en måttlig till stark korrelation mellan de två variablerna.
Sammansättningslängd inkluderades som en enda oberoende variabel i en linjär regressionsmodell. Det visade sig att det predicerade medelvärdet för Scaled AIC vid ingen interferens från sammansättningslängd var 3.611 (=interceptet). Interferensen från sammansättningslängd resulterade i ett högre (=sämre) värde på −3.407 (b = 0.204, p =.001). Figur 6 nedan illustrerar dessa mönster. Kort sagt försämras Scaled AIC när sammansättningslängd blir relevant inom modellerna.
288
Acta Linguistica Lithuanica XC
Page 17
Exploring Scaled AIC within English Closed Compounds
FIGUR 6. Sammansättningslängd och Scaled AIC
Vi genomförde separata ANOVA-analyser för källa till responstid (ELP/BLP) och uppgiftsprestation (lexikal beslut/namngivning), med hänsyn tagen till sammansättningslängd som kovariat. Det primära syftet var att identifiera skillnader i medelvärden som tidigare hade justerats för att beakta de kontrollerande effekterna av sammansättningslängd.
(a) ANOVA för källa till responstid. BLP tilldelades värdet ’0’ och ELP tilldelades värdet ’1’. Pearsons korrelationstest visade en stark kollinearitet mellan källa till responstid och sammansättningslängd, r = 1 (N = 39). Följande evidens stöder vårt resultat: För det första visade ELP-gruppen konsekvent signifikanta positiva korrelationer med sammansättningslängd, vilket indikerar en stor effekt. För det andra uppvisade BLP-gruppen konsekvent icke-signifikanta korrelationer med sammansättningslängd. Följaktligen var det predicerade medelvärdet för Scaled AIC för källan till responstid detsamma med eller utan sammansättningslängd i analysen (M = 3.407 i båda fallen). Sammanfattningsvis hade sammansättningslängd ingen signifikant effekt på Scaled AIC när källan till responstid inkluderades.
(b) ANOVA för uppgiftsprestation. Namngivning tilldelades värdet ’0’ och lexikalt beslut tilldelades värdet ’1’. Pearsons korrelationstest visade en negativ korrelation mellan uppgift och sammansättningslängd, vilket indikerar en måttlig effekt, r = −.5, p =.001 (N = 39). Detta resultat antyder att sammansättningslängd är mer relevant för namngivning än för lexikalt beslut.
17 Det bör noteras att 11 av de 13 BLP-koefficienterna var negativa.
Straipsniai / Articles
289
Page 18
CHARITON CHARITONIDIS
När uppgiften betraktas som den primära variabeln var sammansättningslängd en signifikant prediktor för Scaled AIC, F (1, 145.030), p =.000. På motsvarande sätt var uppgiften, när sammansättningslängd betraktas som den primära variabeln, en signifikant prediktor för Scaled AIC, F (1, 125.30), p =.000. Det predicerade medelvärdet för Scaled AIC för enbart uppgiften skilde sig signifikant från det predicerade medelvärdet för Scaled AIC när sammansättningslängd beaktades (3.584 respektive 3.203). På motsvarande sätt skilde sig det predicerade medelvärdet för Scaled AIC för enbart sammansättningslängd (3.584) signifikant från det predicerade medelvärdet för Scaled AIC när uppgiften beaktades (−3.23). Sammanfattningsvis predicerade såväl den lexikala beslutsuppgiften som sammansättningslängd, vad gäller kovariata justeringar, sämre modeller.
6.4. Scaled AIC kontra transparensnormer
Detta avsnitt undersöker effekten av regressionskoefficienterna för semantisk transparens i Gagné et al. (2019) modeller på Scaled AIC. Dessa regressionskoefficienter kodades på tre ordinalskalor, där var och en motsvarade en av de tre morfologiska nivåerna, dvs. sammansättning, första konstituent och andra konstituent. Tabellen för ordinal omkodning finns i Table 6.
Table 7 nedan visar medianerna och variationsvidderna för de ordinalt transformerade transparenskoefficienterna på alla tre morfologiska nivåer. Medianerna ger användbar information om ordinalvärdenas centrala tendens och spridning och kan bidra till att informera analyser baserade på ordinala variabler.
TABLE 7. Ordinalt transformerade transparenskoefficienter: medianer och variationsvidder
Median Minimum Maximum Sammansättning −3 −3 −1 Första konstituent 2 −3 3 Andra konstituent 0 −2 3
N = 18
Som framgår var medianen för sammansättningen ‘−3’, medianen för den första konstituenten ‘2’ och medianen för den andra konstituenten ‘0’. Dessa resultat antyder att transparens för sammansättningen i Gagné et al.:s (2019) modeller med SUBTLEX–US-frekvens var förknippad med en stor negativ effekt (kortare responstider), att transparens för den första konstituenten var förknippad med en måttlig positiv effekt (längre responstider), och att transparens för den andra konstituenten inte hade någon signifikant effekt eller hade
290
Acta Linguistica Lithuanica XC
Page 19
Exploring Scaled AIC within English Closed Compounds
en osäker roll. De högre transparensbedömningarna för den andra konstituenten, som rapporteras av Gagné et al. (ibid.), tyder på en inneboende bias till dess fördel, vilket leder till att hela sammansättningens transparens blir beroende av den första konstituentens transparens. I detta sammanhang indikerar medianen för den första konstituenten, som är positiv och latensinducerande, dess förmedlande, kanske referensetablerande, roll i denna relation (se även avsnitt 1). Det återstår att visa vilka semantiska funktioner som i tillräcklig grad representerar den andra konstituentens inneboende bias i processeringstermer.18
Den forskningsfråga som nu ska behandlas är huruvida transparenskoefficienternas positivitet och signifikansnivå påverkar Scaled AIC. Vår metod syftar primärt till att upptäcka överanpassningseffekter. Som Daniel J. Navarro & Jay I. Myung (2005) hävdar kan ”en komplex modell med många parametrar och starkt icke-linjär form ofta passa data bättre än en enkel modell med få parametrar, även om det var den senare som genererade data” (Navarro, Myung 2005: 1240). Följaktligen har ett stort antal parametrar potential att fånga brus eller unika egenskaper hos de tillgängliga data, men kan hindra modellens förmåga att generalisera till nya data. AIC begränsar problemet med överanpassning genom att införa en straffavgift för inkluderingen av många parametrar i en modell; se delen ”+2k” i AIC-ekvationen i avsnitt 2.
Vad gäller den följande analysen postuleras att modeller som uppvisar högre (=sämre) Scaled AIC-värden kan ha signifikanta, systematiskt härledda koefficienter, det vill säga koefficienter som är relevanta enbart enligt LADEC-datasetet. I detta sammanhang antyder vår hypotes att en kontrasterande tendens kan framträda i sambandet mellan transparens och Scaled AIC, jämfört med den indikation som medianerna i Tabell 7 ger.
I synnerhet kan lägre (=bättre) Scaled AIC-värden vara förknippade med (a) positiva koefficienter (längre responstider) för hela sammansättningen, (b) negativa koefficienter (kortare responstider) för den första konstituenten och (c) positiva eller negativa koefficienter (längre respektive kortare responstider) för den andra konstituenten. Det bör noteras att medianen i Tabell 7, vad gäller den andra konstituenten, inte antyder någon effekt.
För att besvara forskningsfrågan kommer två icke-parametriska mått att användas, det vill säga Kruskal–Wallis-testet och Jonckheere–Terpstra-testet. Kruskal–Wallis-testet, även känt som ”H-testet”, är ett icke-parametriskt test baserat på
18 I Charitonidis (2024) hävdas att både hyponymi och kontextuell konkretion för den andra konstituenten är signifikanta semantiska prediktorer i lexikal beslutning och namngivning. Analysen som presenteras där visar att inkluderingen av båda dessa prediktorer leder till en förbättring av Scaled AIC och R2 jämfört med modeller som utelämnar någon av dessa variabler.
Straipsniai / Articles
291
Page 20
CHARITON CHARITONIDIS
chi-tvåfördelningen. Det kräver att den beroende variabeln är ordinal eller kontinuerlig. Detta test är utformat för att avgöra om det finns signifikanta skillnader mellan medianerna för två eller flera grupper och används som ett alternativ till envägs-ANOVA. Vad gäller proceduren ordnades värdena för den kontinuerliga beroende variabeln, det vill säga Scaled AIC, från lägst till högst, och observationerna tilldelades rangordningar. De resulterande rangordningarna fördes tillbaka in i grupperna efter signifikansnivå (den oberoende variabeln), och rangordningarna för varje grupp summerades. Formeln för beräkning av ”H” innebar bland annat att summan av rangordningarna för varje grupp kvadrerades och att detta värde därefter dividerades med stickprovsstorleken.
Tabellerna 8–10 innehåller de beaktade indata och summan av rangordningarna för varje grupp.
19
20
summan av rangordningarna för varje grupp.
TABELL 8. Sammansättning
Signifikansnivåer | N | Summan av rangordningarna för Scaled AIC | 1 – liten negativ effekt | 1 | 2 | 2 – måttlig negativ effekt | 5 | 46 | 3 – stor negativ effekt | 12 | 123 | Totalt | 18 |
TABELL 9. Första konstituenten
Signifikansnivåer | N | Summan av rangordningarna för Scaled AIC | 1 – stor positiv effekt | 6 | 59 | 2 – måttlig positiv effekt | 4 | 34 | 3 – liten positiv effekt | 1 | 3 | 4 – ingen effekt | 1 | 2 | 5 – liten negativ effekt | 1 | 10 | 6 – måttlig negativ effekt | 1 | 11 | 7 – stor negativ effekt | 4 | 52 | Totalt | 18 |
19 För övriga beräkningar, se Field (2009: 561–562).
20 I alla tre tabellerna är den totala rangsumman ungefär 171. Den är lika med summan av heltalen från 1 till 18, se stickprovsstorlek (N).
292
Acta Linguistica Lithuanica XC
Page 21
Exploring Scaled AIC within English Closed Compounds
Innan vi går in på resultaten av Kruskal-Wallis-testet (H) är det viktigt att notera att detta test inte ger information om de specifika skillnaderna mellan enskilda grupper. För att hantera detta problem användes även Jonckheere-Terpstra-testet (JT). Detta test gav information om huruvida gruppernas medianer ökade eller minskade i den ordning som angavs av kodningsvariabeln (=grupperingsvariabeln), närmare bestämt från stor positiv effekt till stor negativ effekt. När det gäller metoder omvandlades JT-statistikan till ett z-värde. Ett positivt z-värde indikerade en trend mot stigande medianer, det vill säga att medianerna ökade (=högre/underlägsen Scaled AIC) när kodningsvariabelns värden ökade. Ett negativt z-värde indikerade en trend mot sjunkande medianer, det vill säga att medianerna minskade (=lägre/bättre Scaled AIC) när kodningsvariabelns värden ökade. Nedan redovisas resultaten av Kruskal-Wallis-testet (H) och Jonckheere-Terpstra-testet (JT) gemensamt.
(a) Scaled AIC för föreningen påverkades inte signifikant av signifikansnivån, vilket fastställdes med Kruskal-Wallis-testet (H (2) = 2.226, p >.05). En trend mot stigande medianer konstaterades, vilket bekräftade vår överanpassningshypotes; se den negativa medianen för föreningen i tabell 7. Denna trend var emellertid inte statistiskt signifikant enligt Jonckheere-Terpstra-testet (JT = 50, z = 1.064, p >.05).
(b) Scaled AIC för den första konstituenten påverkades inte signifikant av signifikansnivån, vilket fastställdes med Kruskal-Wallis-testet (H (6) = 5.427, p >.05). En trend mot stigande medianer konstaterades, vilket förkastade vår överanpassningshypotes; se den positiva medianen för den första konstituenten i tabell 7. Denna trend var emellertid inte statistiskt signifikant enligt Jonckheere-Terpstra-testet (JT = 70, z = 0.549, p >.05).
(c) Scaled AIC för den andra konstituenten påverkades inte signifikant av signifikansnivån, vilket fastställdes med Kruskal-Wallis-testet (H (4) = 4.607, p >.05). Någon trend mot stigande eller sjunkande medianer observerades inte, vilket förkastade
Straipsniai / Articles
293
Page 22
CHARITON CHARITONIDIS
vår överanpassningshypotes. I synnerhet var z-statistikan för Jonckheere–Terpstra-testet i princip noll, i överensstämmelse med medianen noll för den andra konstituenten i tabell 7 (JT = 54, z = 0.041, p >.05).
Sammanfattningsvis kan man dra slutsatsen att signifikansnivån för transparenskoefficienterna i Gagné et al.s (2019) modeller med SUBTLEX-US-frekvens inte påverkar storleken på Scaled AIC. Detta resultat ger indirekt stöd för kvaliteten hos Gagné et al.s (2019) modeller med transparensprediktorer och visar specifikt att överanpassningshypotesen för dessa modeller inte kan upprätthållas. En begränsning i den föreliggande studien är den lilla stickprovsstorleken, med N = 18. För att bekräfta våra resultat behövs mer forskning med ett bredare intervall av Scaled AIC-värden.
För att säkerställa tydlighet och fullständighet i presentationen av våra forskningsresultat har vi infogat ett särskilt avsnitt med fokus på att sammanfatta de viktigaste resultaten av vår studie. För denna övergripande översikt, fortsätt till avsnitt 7.
7. HUVUDRESULTAT
Tabell 11 nedan presenterar en omfattande analys av modellprestanda och relevanta variabler i samband med lexikala beslut och namngivningsuppgifter, baserad på resultaten i Gagné et al. (2019). Varje del av tabellen behandlar specifika ämnen och visar vilka modeller som är mest effektiva. ANOVA- samt Kruskal–Wallis/Jonckheere–Terpstra-testerna (avsnitt 6.3 och 6.4) tillämpades efter att nominella (ordinala eller kategoriska) värden hade tilldelats regressionskoefficienterna i Gagné et al.s (2019) modeller. För detaljer om de särskilda tester som tillämpades, se respektive avsnitt.
TABELL 11.
Scaled AIC inom engelska slutna sammansättningar: Omfattande analys av modellprestanda i lexikala besluts- och namngivningsuppgifter (Gagné et al. 2019)
294
Acta Linguistica Lithuanica XC
Page 23
Exploring Scaled AIC within English Closed Compounds
Försökspersoner | Statistik | Utvärdering | Avsnitt Kontrollvariabler | ANOVA | Compound frequency ✓; Compound length ~ | 6.3 Semantisk transparens | Kruskal–Wallis Jonckheere–Terpstra | Första konstituentens NOF/ns; Andra konstituentens NOF/ns; Compound NOF/ns | 6.4
PAR: parametriska data | NPAR: icke-parametriska data | ✓: bättre modeller (lägre AIC) ~: sämre modeller (högre AIC) | NOF/ns: ingen överanpassning/icke-signifikant test
8. DISKUSSION
Tidigare forskning av Charitonidis (2022, 2024) har visat att Scaled AIC är ett tillförlitligt mått på goodness-of-fit som kan användas vid modellval, eventuellt i kombination med andra mått såsom Wald-testet (se avsnitt 3). Med hänvisning till Gagné et al.:s (2019) multipla regressionsmodeller med SUBTLEX-US-frekvens introducerade den föreliggande analysen ytterligare egenskaper hos måttet Scaled AIC. Även om giltiga invändningar har framförts mot jämförelsen av modeller som anpassats till olika urvalsstorlekar med hjälp av informationskriterier (se avsnitt 2), tyder resultaten av denna studie på att Scaled AIC i vissa kontexter faktiskt kan vara ett värdefullt verktyg för att bedöma modellens passform och rangordna regressionsmodeller. Vår forskning har visat att Scaled AIC är känsligt för experimentell design, källor till responstider och specifika uppgifter. Det är dock viktigt att inse att Scaled AIC:s tillämplighet kan vara kontextberoende och att dess användbarhet bör utvärderas från fall till fall.
Innan vi går vidare till denna artikels huvudsakliga resultat är det viktigt att behandla de forskningsfrågor som formulerades i avsnitt 4.
1. Fördelningarna av Scaled AIC-värden, tillsammans med kombinationer av olika källor till responstider och bearbetningsuppgifter, tyder på att Scaled AIC effektivt identifierar förekomsten eller frånvaron av väldefinierade underliggande faktorer i experimentell design och statistisk modellering. I detta sammanhang uppvisade BLP lexical decision och ELP naming större prediktiv styrka för Scaled AIC även under kontrollerade förhållanden.
2. Compound frequency var utan undantag en negativ prediktor för Scaled AIC och indikerade alltid en stor effekt. ELP lexical decision visade konsekvent
Straipsniai / Articles
295
Page 24
CHARITON CHARITONIDIS
signifikanta positiva korrelationer med compound length, vilket förutsade högre (= sämre) Scaled AIC-värden. BLP lexical decision visade konsekvent icke-signifikanta korrelationer med compound length. Både lexical decision och compound length förutsade sämre modeller vid kovariatjustering.
Positiviteten och signifikansnivån hos transparenskoefficienterna i Gagné et al:s (2019) modeller påverkade inte Scaled AIC:s storlek. Detta resultat innebär att Gagné et al:s (2019) modeller med transparensprediktorer inte medför överanpassningsbias.
Genom hänvisning till specifika avsnitt i analyserna kan de huvudsakliga resultaten av denna studie sammanfattas enligt följande:
I avsnitt 6.1 fokuserade vår analys på en jämförelse mellan Scaled AIC-värden i olika modellkategorier. Även efter försök att tillämpa transformationerna ”naturlig logaritm” och ”kvadratrot” på absolutvärdena överensstämde det övergripande Scaled AIC-urvalet inte med en normalfördelning. På liknande sätt uppvisade ELP lexical decision-modellerna en icke-parametrisk fördelning av sina Scaled AIC-värden. Däremot följde data relaterade till BLP lexical decision och ELP naming ett normalfördelningsmönster.
I avsnitt 6.2 skiftade vårt fokus till att undersöka sambandet mellan Scaled AIC och (a) källorna till responstider och (b) uppgiftsprestation. Intressant nog överlappade intervallen för Scaled AIC-värden för ELP- och BLP lexical decision-modellerna inte varandra, vilket visade att de var åtskilda. Testresultaten visade signifikanta huvudeffekter av både källan till responstiderna och uppgiftsprestationen på Scaled AIC. Anmärkningsvärt nog var Scaled AIC:s prediktiva förmåga bättre för modeller förknippade med BLP lexical decision-tiderna och naming-uppgiften. Dessa resultat bidrar i betydande grad till de respektive modellernas precision och effektivitet.
I avsnitt 6.3 fördjupade vi oss i sambandet mellan Scaled AIC och kontrollvariablerna ”compound frequency” och ”compound length”. Compound frequency uteslöts från analysen eftersom den var perfekt kollinear med Scaled AIC. Däremot observerades en minskning av Scaled AIC-värdena när compound length blev en relevant faktor i modellerna. Samtidigt var compound length mest relevant för naming-uppgiften.
När det gäller kovariatjustering förutsade både lexical decision-uppgiften och compound length sämre modeller.
I avsnitt 6.4 låg vårt fokus på sambandet mellan Scaled AIC och semantisk transparens. Forskningsfrågan var huruvida positiviteten och signifikansnivån hos transparenskoefficienterna i Gagné et al:s (2019) modeller påverkade Scaled AIC. Det primära målet med vår metod var att upptäcka potentiella överanpassningseffekter. Vi postulerade att modeller med sämre Scaled AIC-värden kunde ha signifikanta koefficienter som var relevanta
296
Acta Linguistica Lithuanica XC
Page 25
Exploring Scaled AIC within English Closed Compounds
enligt enbart LADEC-datasetet. Även om vi observerade en trend mot ökande (= sämre) Scaled AIC-värden för ett kluster av signifikanta negativa koefficienter på sammansättningsnivå – i linje med vår överanpassningshypotes – visade Jonckheere–Terpstra-testet att denna trend inte uppnådde statistisk signifikans.
Sammanfattningsvis har utforskningen av olika parametrar med Scaled AIC som beroende variabel belyst de varierande sätt på vilka modellkategorier, källa till responstid, bearbetningsuppgifter, kontrollvariabler och semantisk transparens påverkar modellernas goodness-of-fit. Genom att uppmärksamma de nyanserade sambanden mellan dessa element är forskare bättre rustade att fatta välgrundade beslut om modellval, justeringar och tolkning.
REFERENCES
Akaike Hirotugu 1973: Information Theory and an Extension of the Maximum Likelihood Principle. – Second International Symposium on Information Theory, eds. B. F. Csaki, B. N. Petrov, Budapest: Academiai Kiado, 267–281.
Aldrich John R. 1997: R. A. Fisher and the Making of Maximum Likelihood 1912–1922. – Statistical Science 12(3), 162–176.
Baayen Harald R., Piepenbrock Richard, Gulikers Leon 1995: The CELEX Lexical Database (Data set, Release 2, CD-ROM), Linguistic Data Consortium, University of Pennsylvania. Available at: https://catalog.ldc.upenn.edu.
Balota David A., Yap Melvin J., Cortese Michael J., Hutchison Keith I., Kessler Brett, Loftis Bjorn, Neely James H., Nelson Douglas L., Simpson Greg B., Treiman Rebecca 2007: The English Lexicon Project. – Behavior Research Methods 39, 445–459.
Brysbaert Marc, New Boris 2009: Moving Beyond Kučera and Francis: A Critical Evaluation of Current Word Frequency Norms and the Introduction of a New and Improved Word Frequency Measure for American English. – Behavior Research Methods 41, 977–990. DOI: doi.org/10.3758/BRM.41.4.977.
Burnham Kenneth P., Anderson David R. 2002: Model Selection and Multimodal Inference: A Practical Information-Theoretic Approach, 2ⁿᵈ edition, New York: Springer. DOI: dx.doi.org/10.1007/b97636.
Charitonidis Chariton 2022: Context Concreteness for the Second Constituent Slows Down Compound-Word Processing. – Lexis 20. DOI: doi.org/10.4000/lexis.6769.
Straipsniai / Articles
297
Page 26
CHARITON CHARITONIDIS
Charitonidis Chariton 2024: The Role of Hyponymy and Context Concreteness in Compound Word Processing. – Studia Neophilologica. DOI: doi.org/10.1080/00393274.2024.2336851.
Chen Xiaocong, Dong Yanping, Yu Xiufen 2018: On the Predictive Validity of Various Corpus-Based Frequency Norms in L2 English Lexical Processing. – Behavior Research Methods 50, 1–25. DOI: doi.org/10.3758/s13428-017-1001-8.
Field Andy 2009: Discovering statistics using SPSS, 3rd edition, London: Sage Publications.
Fisher Ronald A. 1922: On the Mathematical Foundations of Theoretical Statistics. – Philosophical Transactions of the Royal Society of London, Series A 222, 309–368.
Gagné Christina L., Spalding Thomas L., Schmidtke Daniel 2019: LADEC: The Large Database of English Compounds. – Behavior Research Methods 51, 2152–2179. DOI: doi.org/10.3758/s13428-019-01282-6.
Gagné Christina L., Spalding Thomas L., Spicer Patricia, Wong Dixie, Rubio Beatriz, Perez-Cruz Karen 2020: Is Buttercup a Kind of Cup? Hyponymy and Semantic Transparency in Compound Words. – Journal of Memory and Language 113. DOI: doi.org/10.1016/j.jml.2020.104110.
Hastie Trevor, Tibshirani Robert, Friedman Jerome 2009: The Elements of Statistical Learning: Data Mining, Inference, and Prediction. 2nd edition, New York: Springer.
Keuleers Emmanuel, Lacey Paula, Rastle Kathleen, Brysbaert Marc 2012: The British Lexicon Project: Lexical Decision Data for 28,730 Monosyllabic and Disyllabic English Words. – Behavior Research Methods 44, 287–304. DOI: doi.org/10.3758/s13428-011-0118-4.
Kullback Solomon 1959: Information Theory and Statistics. New York: Wiley.
Navarro Daniel J., Myung Jay I. 2005: Model Evaluation. – Encyclopedia of Statistics in Behavioral Science, vol. 3, eds. B. S. Everitt, D. C. Howell, Chichester: Wiley, 1239–1242.
Steiger James H. 1980: Tests for Comparing Elements of a Correlation Matrix. – Psychological Bulletin 87(2), 245–251. DOI: doi.org/10.1037/0033-2909.87.2.245.
Wagenmakers Eric-Jan, Farrell Simon 2004: AIC Model Selection Using Akaike Weights. – Psychonomic Bulletin & Review 11(1), 192–196.
298
Acta Linguistica Lithuanica XC
Page 27
Exploring Scaled AIC within English Closed Compounds
I N T E R N E T D I S C U S S I O N S
Model comparison with AIC based on different sample size. Available at: https://stats.stackexchange.com/questions/94718/model-comparison-with-aic-based-on-different-sample-size [accessed 15.5.2024].
What is the acceptable range of skewness and kurtosis for normal distribution of data? Available at: https://www.researchgate.net/post/What_is_the_acceptable_range_of_skewness_and_kurtosis_for_normal_distribution_of_data [accessed 15.5.2024].
L A R G E L A N G U A G E M O D E L S
GPT-3.5 (available at: https://chat.openai.com/) and Google Gemini (available at: https://gemini.google.com [accessed 11.10.2023]) were selectively used as auxiliary proofreading and editing tools. The responses from both AI tools were further proofread and edited by the author.
Anglų kalbos uždarųjų junginių (sudurtinių žodžių) skalės AIC tyrimas
S A N T R A U K A
Šiame tyrime nagrinėjamos modifikuotos Akaikės informacijos kriterijaus, pavadinto skalės kriterijumi, t. y. AIC, kaip tinkamumo rodiklio, padalinto iš imties dydžio, varianto ypatybės. Tyrimo objektas – 66 daugialypės regresijos modeliai, susiję su uždarųjų (sudurtinių) anglų kalbos žodžių junginių, paimtų iš Gagné'es ir kitų (2019) Anglų kalbos sudurtinių žodžių (junginių) didžiosios duomenų bazės (angl. LADEC), apdorojimu. Toliau pateikiami išsamios analizės rezultatai:
1. Modelių kategorijų modeliai pasižymi nevienareikšmiais rezultatais. Britų kalbos žodyno projekto (angl. BLP) leksinių sprendimų modeliai ir Anglų kalbos žodyno projekto (angl. ELP) įvardijimo modeliai veikia geriau (tai rodo mažesnis AIC), palyginus su Anglų kalbos žodyno projekto (angl. ELP) leksinių sprendimų modeliais.
Straipsniai / Articles
299
Page 28
CHARITON CHARITONIDIS
2. Laiko šaltinio ir leksikos apdorojimo užduočių atsakymais atskleidžia reikšmingus pagrindinius skalės AIC rezultatus. Britų kalbos žodyno projekto leksinių sprendimų modeliai ir Anglų kalbos žodyno projekto įvardijimo modeliai veikia gerai, o pastarojo projekto leksinių sprendimų modeliai yra mažiau veiksmingi.
3. Įvertinus kontrolinius kintamuosius, tokius kaip junginių dažnumas ir junginių ilgis, matyti, kad modelių rezultatyvumas skiriasi. Junginių dažnumas yra stiprus veiksnys (parodo didesnis produktyvumas), o sudėtinio ilgio modelių prognozės blogesnės.
4. Kalbant apie pirmosios ir antrosios žodžių junginių sudedamųjų dalių, taip pat ir apie junginių semantinį skaidrumą, modeliai nerodo per didelio suderinamumo. Tai parodo, kad semantinis skaidrumas nesumažina modelių galėjimo apibendrinti naujus duomenis.