scieee.
EN original LT DE FR IT ES PT PL HU RO UK TR RU NL CS SV EL AR
Machine-translated document

This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.

Preparing document pages…

CHARITON CHARITONIDIS Nezávislý výzkumník ORCID id: orcid.org/0000-0003-0298-2629 Oblasti výzkumu: tvorba slov, víceslovné výrazy, lexikální sémantika, rozpoznávání slov, emoce. DOI: doi.org/10.35321/all90-11

ZKOUMÁNÍ ŠKÁLOVANÉHO AIC V RÁMCI ANGLICKÝCH UZAVŘENÝCH KOMPOZIT

Výzkum škálovaného AIC v anglických uzavřených kompozitech (složených slovech)

ANOTACE

Akaikeho informační kritérium (AIC) je zavedenou mírou shody modelu s daty pro výběr modelů při analýze empirických dat. AIC je však citlivé na velikost vzorku. Předchozí výzkum autora ukázal, že škálované AIC, tj. AIC vydělené velikostí vzorku, je účinným nástrojem pro hodnocení shody modelu s daty a hierarchizaci regresních modelů. Tato studie dále zkoumá vlastnosti této proměnné. Předmětem výzkumu je 66 vícenásobných regresních modelů vztahujících se ke zpracování anglických uzavřených (konkatenovaných) kompozit převzatých z Velké databáze anglických kompozit Gagného et al. (2019) (LADEC). Škálované AIC je zejména konfrontováno s English Lexicon Project (ELP) a British Lexicon Project (BLP) jakožto zdroji reakčních časů, úloh lexikálního rozhodování a pojmenování, délky kompozit a norem transparentnosti. Jako metody jsou použity jednofaktorová ANOVA, analýza hlavních efektů a neparametrické testy. Výsledky naznačují, že škálované AIC reaguje na experimentální design, zdroj reakčních časů a úlohy lexikálního rozhodování a pojmenování. Zároveň výsledky této studie poskytují empirickou podporu validaci metod použitých Gagné et al. (2019).

KLÍČOVÁ SLOVA: anglické kompozity, škálované AIC, lexikální rozhodování, pojmenování.

ANOTACE

Akaikeho informační kritérium (angl. AIC) je ustálenou mírou vhodnosti modelu používanou při analýze empirických dat. AIC je však citlivé na velikost vzorku. Předchozí

Straipsniai / Articles

273

CHARITON CHARITONIDIS

výzkumy autora ukázaly, že škálované AIC, vydělené velikostí vzorku, je účinným nástrojem pro hodnocení vhodnosti modelu a hierarchizaci regresních modelů. Tato studie zkoumá další vlastnosti této proměnné. Předmětem výzkumu je 66 vícenásobných regresních modelů souvisejících se zpracováním anglických uzavřených (složených) kompozit převzatých z Velké databáze anglických kompozit (složených slov) (angl. LADEC) Gagného et al. (2019). Především je AIC porovnáváno s English Lexicon Project (angl. ELP) a British Lexicon Project (angl. BLP) jako zdroji reakčních časů, úloh lexikálního rozhodování a pojmenování, délky kompozit a norem transparentnosti. Použité metody zahrnují jednofaktorovou ANOVA (angl. Analysis of variance), analýzu hlavních výsledků a neparametrické testy. Závěry ukazují, že škálované AIC reaguje na experimentální design, zdroj reakčních časů a úlohy lexikálního rozhodování a pojmenování. Výsledky této studie zároveň poskytují empirický základ pro potvrzení metod použitých Gagné et al. (2019).

KLÍČOVÁ SLOVA: anglické kompozity (složená slova), škálované AIC, lexikální rozhodování, pojmenování.

1. VELKÁ DATABÁZE ANGLICKÝCH KOMPOZIT (LADEC: GAGNÉ ET AL. 2019)¹

Velká databáze anglických kompozit (LADEC: Gagné et al. 2019) je největší existující databází složených slov. Obsahuje více než 8000 nespojitě psaných („uzavřených“ nebo „konkatenovaných“) kompozit (=podstatných jmen) vybraných z různých zdrojů, mimo jiné z databáze CELEX (Baayen et al. 1995), English Lexicon Project (ELP; Balota et al. 2007), British Lexicon Project (BLP; Keuleers et al. 2012), British National Corpus (BNC) a Wordnetu. Z úplného souboru položek LADEC lze 7 804 kompozit jednoznačně rozčlenit na dva volné morfémové konstituenty.² Zvažována je velmi široká škála kompozit, například kompozita podstatné jméno–podstatné jméno, např. buttercup, shipyard, kompozita s druhým konstituentem odvozeným od slovesného kmene, např. pacemaker, painkiller atd. (definice tříd kompozit viz Lieber 2004: 46). První konstituent, který není hlavou, odkazuje na širokou škálu gramatických kategorií. Obrázek 1 obsahuje krátký výběr položek LADEC.

Vícenásobné regresní modely Gagné et al. (2019) zahrnují širokou škálu prediktorových (= nezávislých) proměnných, jako je délka kompozita, frekvence bigramů

¹ Tato část byla převzata z Chariton Charitonidis (2022) s drobnými úpravami.

² LADEC obsahuje plurály již uvedených kompozit jako samostatné položky.

274

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

na hranici morfémů, velikost slovní čeledi, frekvence slov, pravděpodobnostní a asociační (vektorové) míry, emoční/afektivní normy vypočtené z hodnocení účastníků atd. Logaritmické reakční časy kompozit z ELP (lexikální rozhodování, pojmenování) a BLP (lexikální rozhodování) jsou použity jako závislé proměnné. Většinou se jako kontrolní proměnné používají délka kompozita (počet znaků) a logaritmická frekvence kompozita (= slova) z korpusu SUBTLEX-US (Brysbaert, New 2009)³ a BNC (BLP). V modelech Gagné et al. (2019) měly výše uvedené prediktorové proměnné významné účinky na časy lexikálního rozhodování a pojmenování.

OBRÁZEK 1. Položky LADEC: ukázka

Primární pozornost ve studii Gagné et al. (2019) byla věnována různým mírám sémantické transparentnosti. Gagné et al. (2019) požádali účastníky, aby hodnotili kompozita s ohledem na to, nakolik lze význam kompozita předvídat z jeho částí (hodnocení předvídatelnosti významu, založené na kompozitu) a nakolik je v kompozitu zachován význam každého z konstituentů (hodnocení zachování významu, založené na konstituentech). Autoři zjistili, že rozložení transparentnosti druhého konstituentu bylo výrazně špičatější a vyšší než rozložení transparentnosti prvního konstituentu (MC1: 64.80 [SD: 19.59] oproti MC2: 71.00 [SD: 16.46]. N = 8115). Hodnocení pro

³ Korpus SUBTLEX–US je korpus o 51 milionech tokenů založený na titulcích amerických filmů a televizních pořadů. Několik nedávných studií poskytlo důkazy, že frekvenční normy získané z titulků filmů a televizních pořadů bývají účinnější než normy odvozené z tištěných textů, pokud jde o vysvětlení rozdílů v době lexikálního zpracování a v některých případech i v přesnosti u rodilých mluvčích různých jazyků (viz Chen et al. 2018: 2 a tam uvedené odkazy).

Straipsniai / Articles

275

CHARITON CHARITONIDIS

první konstituent byl silněji korelován s hodnocením celého kompozita než hodnocení druhého konstituentu (c1~cmp: r = 0.75, p <.001 oproti c2~cmp: r = 0.66, p <.001. N = 429).⁴ Nejdůležitější je, že hodnocení zachování významu prvního konstituentu a hodnocení předvídatelnosti významu kompozita predikovaly všechny tři typy reakčních časů, tj. časy lexikálního rozhodování v ELP, časy lexikálního rozhodování v BLP a časy pojmenování v ELP.

Závěrem lze říci, že špičatější a vyšší rozložení transparentnosti druhého konstituentu a lepší souvislost prvního konstituentu s předvídatelností významu kompozita se zřejmě bezprostředně promítají do operací s hlavou v anglických kompozitech. Druhý konstituent, tj. hlava, je jednotka, jejíž transparentnost je kategoricky a sémanticky zvýšená (k sémantickému aspektu viz vztahy vyplývání a hyponymie). První konstituent, tj. modifikátor, je nejkritičtějším faktorem při ustavování reference kompozita. V důsledku toho jeho transparentnost nejvýrazněji kovariuje s transparentností kompozita.⁵

2. AKAIKEHO INFORMAČNÍ KRITÉRIUM (AIC)

V roce 1973 Hirotugu Akaike vyvinul metodu pro odhad relativního očekávání Kullbackovy–Leiblerovy vzdálenosti (Kullback 1959) pomocí Fisherova maximalizovaného logaritmu věrohodnosti (Fisher 1922; viz také Aldrich 1997). Tato míra, běžně označovaná jako Akaikeho informační kritérium (AIC; Akaike 1973), zavedla nový rámec pro výběr modelů při analýze empirických dat a znamenala významný posun paradigmatu (Burnham, Anderson 2002).

AIC se obvykle vypočítává takto: −2lnL + 2k, kde „lnL“ označuje maximalizovaný/plný logaritmus věrohodnosti modelu a „k“ označuje počet parametrů včetně konstanty. Menší počet prediktorů je obvykle spojen s efektivnějšími modely (modely s menší informační ztrátou). Čím nižší (= zápornější) je hodnota AIC, tím lepší je shoda modelu s daty. V tomto kontextu AIC jako míra shody s daty penalizuje použití velkého počtu prediktorů, které potenciálně vedou k vyšším hodnotám AIC (viz část „+2k“ rovnice AIC).

⁴ Steigerův (1980) z-test ukázal, že tento rozdíl byl významný, z = 27.71, p <.0001 (Gagné et al. 2019).

⁵ S odkazem na předchozí výzkum Gagné et al. (2019) uvádějí, že „modifikátor (první konstituent v angličtině) má při zpracování kompozit a jmenných frází tendenci hrát větší roli při snadnosti výběru vztahu“.

276

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

AIC je citlivé na velikost vzorku. AICc, korigovaná verze AIC, zohledňuje velikost vzorku pomocí vzorce 2k (k + 1)/ (n − k − 1). Řeší však specificky malé velikosti vzorku a nedoporučuje se pro modely založené na velkých vzorcích, jako je model v Gagné et al. (2019).⁶ Je třeba poznamenat, že výzkumníci jako Kenneth P. Burnham & David R. Anderson (2002) nenabízejí definitivní řešení pro porovnávání hodnot AIC modelů přizpůsobených různým i velkým velikostem vzorku.⁷

Burnham & Anderson (2002: 80–85, 334–335) zejména poskytují komplexní diskusi o důsledcích nestejných velikostí vzorku pro porovnávání modelů. Tvrdí, že použití informačních kritérií k porovnávání modelů s různými velikostmi vzorku může vést k zavádějícím výsledkům. Podobně, jak uvedl Svetunkov v online diskusi v roce 2016 (viz odkaz za bibliografií), všechna informační kritéria jsou založena na funkci věrohodnosti, která zase závisí na velikosti vzorku. Konkrétně s rostoucí velikostí vzorku věrohodnost klesá. V důsledku toho se v takových případech zvýší i informační kritéria.⁸

3. PŘEDCHOZÍ VÝZKUM

V Charitonidis (2022) byly hodnoty AIC pro 44 vícenásobných regresních modelů s různými kombinacemi emočních proměnných (valence, aktivace a konkrétnost pro (a) slova a (b) slovní kontexty) vyděleny velikostí vzorku (N), čímž vznikly hodnoty škálovaného AIC (AIC/N). Následně byly tyto hodnoty použity k hodnocení

⁶ Pro další informace o AICc se čtenář odkazuje na Burnham & Anderson (2002: 374–380).

⁷ Jedno z řešení, která Burnham & Anderson (2002) navrhují, se týká transformace hodnot AIC na „Akaikeho váhy“, které jsou definovány jako „relativní věrohodnost modelu vzhledem k datům“ (Burnham, Anderson 2002: xiii; viz také Wagenmakers, Farrell 2004).

⁸ Dostupné na: https://stats.stackexchange.com/questions/94718/model-comparison-with-aic-based-on-different-sample-size [přístup 16.06.2023]. Čtenář může Svetunkovovo tvrzení pochopit tak, že v rovnici AIC dosadí za složku „lnL“ různé hodnoty a složku „2k“ ponechá konstantní. Snížení hodnoty lnL povede k vyšší, tj. horší hodnotě AIC.

⁹ V literatuře se škálované AIC označuje také jako „průměrné AIC“. Podle Svetunkova (osobní sdělení) není dělení Akaikeho informačního kritéria velikostí vzorku novinkou. Například Hastie et al. (2009: 230–231) definují AIC nekánonickým způsobem, když ve vzorci používají N jako jmenovatel. Ačkoli tato odchylka od konvenčního vzorce AIC není bez kritiků, zůstává běžným přístupem, jak dokládá její zahrnutí do statistického softwarového balíku Stata. Stata například ve výstupu modelu uvádí „AIC dělené N“, jak dokládají různé příklady dostupné online (děkuji I. Svetunkovovi za poskytnutí této informace).

Straipsniai / Articles

277

CHARITON CHARITONIDIS

a porovnání shody modelů s daty. Vložení klíčových prediktorů do globálních, tj. obecných modelů ukázalo, že časy lexikálního rozhodování z BLP vyžadovaly lepší shodu s daty než časy lexikálního rozhodování z ELP. Shoda modelů pojmenování z ELP spadala do rozmezí hodnot pozorovaných u modelů lexikálního rozhodování z ELP a BLP. Nejdůležitější je, že konkrétnost kontextu druhého konstituentu se ukázala jako významný prediktor ve všech modelech s frekvencí SUBTLEX-US, a to u lexikálního rozhodování i pojmenování.

V Charitonidis (2024) byly všechny významné koeficienty z globálních modelů s frekvencí SUBTLEX-US porovnány s proměnnou hyponymie (Gagné et al. 2020). Bylo zjištěno, že modely zahrnující jak hyponymii, tak konkrétnost kontextu druhého konstituentu byly vždy spojeny s nejnižší (= nejlepší) hodnotou škálovaného AIC ve srovnání s vnořenými, tj. redukovanými modely, v nichž jedna z těchto dvou proměnných chyběla. Následně použité Waldovy testy ukázaly, že vnořené modely vždy souvisely s významným snížením (= zhoršením) koeficientu determinace (R2). Tabulky 1 a 2 zobrazují hodnoty škálovaného AIC a výsledky příslušných Waldových testů.

TABULKA 1.

Hodnoty škálovaného AIC pro vnořené modely, z nichž byla vynechána hyponymie („Model 2“) nebo konkrétnost kontextu druhého konstituentu („Model 3“), z úplných modelů („Model 1“) pro predikci časů lexikálního rozhodování v English Lexicon Project (ELP), časů lexikálního rozhodování v British Lexicon Project (BLP) a časů pojmenování v ELP

Model | Škálované AIC | AIC | N ELP LD 1 | −3.36281ᵃ | −3557.85 | 1058 2 | −3.30375 | −4169.334 | 1262 3 | −3.34845 | −3700.038 | 1105 BLP LD 1 | −3.79552ᵃ | −2903.574 | 765 2 | −3.76618 | −3920.592 | 1041 3 | −3.76718 | −2987.37 | 793 ELP naming 1 | −3.58686ᵇ | −7396.108 | 2062 2 | −3.54304 | −8418.27 | 2376 3 | −3.58379 | −7389.784 | 2062

278

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

a. Prediktory: (Konstanta), posouzení hyponymie, délka kompozita, frekvence SUBTLEX–US, valence reprezentace (cmp), konkrétnost kontextu (c2)

b. Prediktory: (Konstanta), posouzení hyponymie, délka kompozita, frekvence SUBTLEX–US, valence kontextu (cmp), aktivace kontextu (c1), aktivace kontextu (c2), konkrétnost kontextu (c2)

TABULKA 2.

Waldovy testy pro vnořené modely, z nichž byla vynechána hyponymie („Model 2“) nebo konkrétnost kontextu druhého konstituentu („Model 3“), z úplných modelů („Model 1“) pro predikci časů lexikálního rozhodování v English Lexicon Project (ELP), časů lexikálního rozhodování v British Lexicon Project (BLP) a časů pojmenování v ELP

Model | R2 square | F change | df1 | df2 | p ELP LD 1 |.184a | 47.506 | 5 | 1052 |.000 2 | −.004 | 4.562 | 1 | 1052 |.033 3 | −.010 | 13.175 | 1 | 1052 |.000 BLP LD 1 |.211a | 40.479 | 5 | 759 |.000 2 | −.013 | 12.091 | 1 | 759 |.001 3 | −.015 | 14.007 | 1 | 759 |.000 ELP naming 1 |.288b | 118.711 | 7 | 2054 |.000 2 | −.003 | 8.286 | 1 | 2054 |.004 3 | −.003 | 8.309 | 1 | 2054 |.004

a. Prediktory: (Konstanta), posouzení hyponymie, délka kompozita, frekvence SUBTLEX–US, valence reprezentace (cmp), konkrétnost kontextu (c2)

b. Prediktory: (Konstanta), posouzení hyponymie, délka kompozita, frekvence SUBTLEX–US, valence kontextu (cmp), aktivace kontextu (c1), aktivace kontextu (c2), konkrétnost kontextu (c2)

Závěrem lze říci, že dvě různé míry velikosti účinku, jmenovitě škálované AIC a R2, hierarchizovaly tytéž regresní modely identicky a zároveň vykazovaly stejnou preferenci nejlepšího modelu. Existují tedy silné důkazy, že míra škálovaného AIC je kvalitativním nástrojem pro hodnocení shody modelu s daty.

Straipsniai / Articles

279

CHARITON CHARITONIDIS

4. TATO STUDIE

Tato studie vychází z předchozího výzkumu autora představeného v oddílu 3. Výzkumný soubor tvoří 66 modelů lexikálního rozhodování a pojmenování anglických uzavřených (konkatenovaných) kompozit vytvořených Gagné et al. (2019). Všechny modely zahrnují frekvenci SUBTLEX-US jako kontrolní proměnnou. Naše cíle jsou dvojí a probíhají souběžně. Zaprvé hodnotíme charakteristiky modelů Gagné et al. (ibid.). Zadruhé zkoumáme zásadní vlastnosti míry škálovaného AIC.

Výzkumné otázky jsou: 1. Je škálované AIC citlivé na konstrukci modelu v Gagné et al. (2019)? Které skupiny modelů jsou upřednostňovány? 2. Jaký dopad mají kontrolní proměnné „frekvence kompozita“ a „délka kompozita“ na škálované AIC? 3. Jak souvisí morfologická transparentnost se škálovaným AIC?

Naše studie je strukturována takto: Oddíl 5 poskytuje přehled našich metod. Oddíl 6.1 uvádí deskriptivní statistiky škálovaného AIC vztahující se k posuzovaným modelům. Důraz je kladen na parametrické versus neparametrické charakteristiky kategorií modelů. Oddíl 6.2 zkoumá vztah mezi zdrojem reakčních časů a úlohami lexikálního zpracování. Oddíl 6.3 porovnává škálované AIC s kontrolními proměnnými „frekvence kompozita“ a „délka kompozita“. V oddílu 6.4 jsou hladiny významnosti koeficientů transparentnosti z modelů Gagné et al. (2019) mapovány na hodnoty škálovaného AIC. Klíčová zjištění jsou shrnuta v oddílu 7, po němž následuje diskuse výsledků v oddílu 8.

5. METODY

Naší obecnou metodou byla komparativní analýza hlavních parametrů a charakteristik modelů Gagné et al. (2019), při níž bylo jako závislá proměnná použito škálované AIC. Nezávislé proměnné zahrnovaly mimo jiné charakteristiky vzorku (např. zdroj reakčních časů a úlohy lexikálního zpracování), design studie (např. kontrolní proměnné) a hladinu významnosti koeficientů transparentnosti.

Použité konkrétní statistické metody byly následující: (a) deskriptivní statistiky týkající se průměrů a mediánů spolu s použitím Shapirova–Wilkova testu k posouzení centrální tendence, variability a rozložení škálovaného AIC napříč různými kategoriemi a skupinami modelů (oddíly 6.1 a 6.2), (b) analýzy hlavních efektů provedené pro zdroj reakčních časů (ELP/BLP) a úlohy lexikálního zpracování (lexikální rozhodování/pojmenování) (oddíl

280

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

6.2), (c) samostatné ANOVY provedené pro zdroj reakčních časů a úlohy lexikálního zpracování, zahrnující délku kompozita jako kovariátu (oddíl 6.3), a (d) použití Kruskalova–Wallisova a Jonckheereho–Terpstrova testu ke zkoumání rozdílů mezi pořadími ordinálně překódovaných koeficientů sémantické transparentnosti (oddíl 6.4). Další informace o metodách nalezne čtenář v analýzách v oddílech 6.1–6.4.

6. ANALÝZY

6.1. Škálované AIC versus kategorie modelů

66 hodnot AIC z vícenásobných regresních modelů Gagné et al. (2019) s frekvencí SUBTLEX–US jako kontrolní proměnnou bylo vyděleno velikostí vzorku každého modelu, čímž vznikl soubor 66 hodnot škálovaného AIC.

Níže uvedená tabulka 3 poskytuje deskriptivní statistiky škálovaného AIC a obrázek 2 zobrazuje odpovídající krabicový graf vztahující se k seřazenému souboru hodnot.10 Ve vzorku nebyly žádné odlehlé hodnoty. Hodnoty šikmosti (Sk) a špičatosti (Ku) byly přijatelné.11

Průměrná hodnota škálovaného AIC byla −3.50030. Směrodatná odchylka byla 0.19052, což znamená, že pozorování byla relativně těsně seskupena kolem průměru. Minimální a maximální hodnoty byly −3.85502 a −3.15754. Mediánová hodnota byla −3.55732, tj. mírně nižší než průměrná hodnota.12 Prostředních 50% dat se pohybovalo mezi −3.66575 (první kvartil, Q1) a −3.30959 (třetí kvartil, Q3). Interkvartilové rozpětí (IQR) tedy činilo 0.35616.

10 Dolní neboli první kvartilová čára krabice (Q1) označuje hranici, pod níž se rozprostírá dolních 25% dat. Obdobně horní neboli třetí kvartilová čára krabice (Q3) označuje hranici, nad níž se rozprostírá horních 25% dat. Stínovaná plocha zobrazuje hranice prostředních 50% dat neboli interkvartilového rozpětí (IQR), které lze vypočítat odečtením prvního kvartilu od třetího kvartilu (Q3−Q1). Vodorovná čára uvnitř krabice zobrazuje medián neboli prostřední kvartil (Q2), tj. hodnotu ležící uprostřed souboru dat.

11 V prostředí SPSS se hodnoty mezi −1 a +1 pro šikmost a mezi −2 a +2 pro špičatost obecně považují za přijatelné při posuzování normálního rozložení. Je však třeba poznamenat, že samotná šikmost a špičatost neposkytují přesvědčivý důkaz normality (viz také diskuse o https://www.researchgate.net/post/What_is_the_acceptable_range_of_skewness_and_kurtosis_for_normal_distribution_of_data).

12 V souladu s tímto vzorcem byla v datech zjištěna mírná kladná šikmost (0.494).

Straipsniai / Articles

281

CHARITON CHARITONIDIS

TABULKA 3. Deskriptivní statistiky škálovaného AIC (úplný soubor)

Průměr SD Min Max −3.50030 0.19052 −3.85502 −3.15754 Medián IQR Q1 Q3 −3.55732 0.35616 −3.66575 −3.30959

N=66. Sk=0.494, Ku=−1.101

OBRÁZEK 2. Rozložení škálovaného AIC (úplný soubor): krabicový graf

Očekávalo se, že úplný soubor hodnot škálovaného AIC nebude vykazovat normální rozložení, protože zahrnoval různé úlohy (lexikální rozhodování, pojmenování) a byl odvozen z různých zdrojů reakčních časů (ELP, BLP). Shapiro–Wilkův test a Kolmogorovův–Smirnovův test naše předpoklady potvrdily.13 Konkrétně statistiky Shapiro–Wilkova testu byly W (66) = 0.90, p <.001, a statistiky Kolmogorovova–Smirnovova testu byly D (66) = 0.17, p <.001. Je třeba poznamenat, že stejný úplný soubor nevykazoval normální rozložení ani po použití přirozeného logaritmu a odmocninových transformací na absolutní hodnoty.

Níže uvedená tabulka 4 poskytuje deskriptivní statistiky škálovaného AIC s odkazem na hlavní kategorie modelů v Gagné et al. (2019), tj. lexikální rozhodování ELP, lexikální rozhodování BLP a pojmenování ELP (každá skupina obsahuje 22 modelů). Obrázek 3 zobrazuje odpovídající krabicové grafy. Jak je patrné, průměry a mediány

13 Kolmogorovův–Smirnovův test použil Lillieforsovu korekci významnosti.

282

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

pro lexikální rozhodování BLP a pojmenování ELP odkazovaly na podobné hodnoty škálovaného AIC. Lexikální rozhodování ELP odkazovalo na vyšší (= horší) hodnoty, které byly navíc nesouvislé s hodnotami lexikálního rozhodování BLP.14 Stručně řečeno, lexikální rozhodování BLP a pojmenování ELP vždy vyžadovaly lepší modely než lexikální rozhodování ELP.

TABULKA 4. Deskriptivní statistiky škálovaného AIC podle hlavních kategorií modelů

Očekávalo se, že neparametrický profil úplného souboru hodnot škálovaného AIC se v hlavních kategoriích modelů, tj. v hlavních kombinacích zdrojů reakčních časů a úloh, objeví s menší pravděpodobností. Jak bude zřejmé, toto očekávání se potvrdilo.

Shapiro–Wilkův test ukázal, že data lexikálního rozhodování ELP se významně odchylovala od normality. Konkrétně jsme vypočítali testovou statistiku W (22) = 0.90, p <.05.15

Data lexikálního rozhodování BLP měla normální rozložení. Příslušné statistiky byly W (22) = 0.92, p >.05 (Shapiro-Wilkův test).

14 t-test souhrnných dat lexikálního rozhodování ELP a lexikálního rozhodování BLP (tabulka 4) ukázal vysoce významný rozdíl mezi průměry vzorků, t = 18.296, p <.0001.

15 Je třeba poznamenat, že soubor šesti modelů lexikálního rozhodování ELP odkazoval na hodnoty Scaled AIC blízké maximální hodnotě −3.15754, což svědčí o nejhorším přizpůsobení v celém souboru dat. Tyto modely přispěly k výraznému vrcholu směrem k vyššímu konci rozdělení (v rozmezí od −3.17304 do −3.15754), což vedlo k téměř bimodálnímu tvaru rozdělení. Toto pozorování podporuje relativně vysoká záporná hodnota špičatosti −1.444.

Straipsniai / Articles

283

CHARITON CHARITONIDIS

OBRÁZEK 3. Krabicové grafy Scaled AIC podle hlavních kategorií modelů

Obdobně byla data ELP z úlohy pojmenování normálně rozložena. Příslušné statistiky byly W (22) = 0.93, p >.05 (Shapiro–Wilkův test).

Souhrnně lze říci, že jak celý soubor modelů, tak modely ELP lexikálního rozhodování byly spojeny s neparametrickým rozdělením Scaled AIC. Naproti tomu data BLP lexikálního rozhodování a ELP pojmenování byla normálně rozložena. Nyní se pokusme odhalit vliv jednotlivých faktorů na Scaled AIC.

6.2. Scaled AIC vs. zdroj reakčních časů a úlohy

Tabulka 5 níže obsahuje deskriptivní statistiky hodnot Scaled AIC pro skupiny kategorizované podle hlavních faktorů „reakční časy“ a „úlohy“, tj. (a) reakční časy ELP, (b) reakční časy BLP, (c) úloha pojmenování a (d) úloha lexikálního rozhodování. Reakční časy ELP a úloha lexikálního rozhodování

284

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

jsou nadřazené skupiny odkazující na „lexikální rozhodování a pojmenování“ a „ELP a BLP“. Skupiny „BLP“ a „Pojmenování“ jsou totožné s kategoriemi modelů „BLP lexikální rozhodování“ a „ELP pojmenování“, které již byly uvedeny v tabulce 4 (část 6.1). Obrázek 4 znázorňuje příslušné krabicové grafy.

Jak je patrné z tabulky 5, skupiny „BLP“ i „Pojmenování“ vykazovaly (a) nižší (=lepší) průměrné a mediánové hodnoty Scaled AIC a (b) menší hodnoty směrodatné odchylky (SD) a mezikvartilového rozpětí (IQR) oproti nadřazeným skupinám „reakční časy ELP“ a „lexikální rozhodování“.16 Tyto nadřazené skupiny mají rovněž relativně vysoké hodnoty špičatosti, konkrétně −1.403 a −1.616 (v histogramech těchto skupin – zde neuvedených – se objevily dva jasné vrcholy, podobně jako u bimodálního rozdělení hodnot). Tyto vzorce naznačují, že míra Scaled AIC byla jedinečně spojena s jasně vymezenými experimentálními kategoriemi BLP lexikálního rozhodování (viz skupina „BLP“) a ELP pojmenování (viz skupina „Pojmenování“).

TABULKA 5.

Deskriptivní statistiky Scaled AIC pro skupiny kategorizované podle „reakčních časů“ a „úloh“

Reakční časy Úlohy ELP BLP Pojmenování Lexikální rozhodování Průměr −3.43917 −3.62255 −3.62495 −3.43797 SD 0.20286 0.06778 0.08710 0.19808 Min −3.85502 −3.75547 −3.85502 −3.75547 Max −3.15754 −3.52945 −3.50150 −3.15754 Medián −3.42626 −3.62174 −3.61886 −3.44024 IQR 0.35152 0.13704 0.13758 0.36196 Q1 −3.62127 −3.68840 −3.69419 −3.63171 Q3 −3.26975 −3.55136 −3.55662 −3.26975 Sk −0.126 −0.097 −0.559 −0.006 Ku −1.403 −1.244 0.725 −1.616 44 22 22 44

16 Nižší průměry a mediány spolu s menšími hodnotami směrodatné odchylky a mezikvartilového rozpětí ukazují na vyšší spolehlivost a menší náchylnost k odlehlým nebo extrémním hodnotám.

Straipsniai / Articles

285

CHARITON CHARITONIDIS

OBRÁZEK 4. Krabicové grafy Scaled AIC pro skupiny kategorizované podle „reakčních časů“ a „úloh“

Stejně jako u celého souboru hodnot Scaled AIC diskutovaného v části 6.1 se očekávalo, že u nadřazených skupin „ELP“ a „lexikální rozhodování“, které nejsou omezeny na konkrétní experimenty, bude patrný neparametrický profil. Testy normality naše očekávání potvrdily.

Pokud jde o Shapiro–Wilkův test, data Scaled AIC pro skupinu ELP se významně odchýlila od normality. Vypočítali jsme testovou statistiku W (44) = 0.91, p <.01. Obdobně se data Scaled AIC pro skupinu lexikálního rozhodování významně odchýlila od normality. Vypočítali jsme testovou statistiku W (44) = 0.89, p <.001.

Nyní přejděme k analýze hlavních účinků. Hlavním cílem bylo zjistit, zda skupiny BLP lexikálního rozhodování a ELP pojmenování i nadále predikují lepší modely při kontrole účinků kterékoli z těchto skupin.

V následujících statistických testech byly skupinám kategorizovaným podle hlavních faktorů „reakční časy“ a „úlohy“ přiřazeny nominální hodnoty. Jako referenční buňka neboli intercept byl použit průměr Scaled AIC pro skupinu BLP, tj. −3.623.

Výsledky ukázaly, že jak reakční časy, tak úlohy měly na Scaled AIC hlavní účinek, avšak nebyla zjištěna interakce. Konkrétně byl zjištěn významný hlavní účinek reakčních časů, F (1, 63) = 271.87, p <.001. V regresních termínech koeficient pro ELP predikoval vyšší, tj. horší, hodnotu Scaled AIC, b = 0.37, SE = 0.02, t = 16.49, p <.001. Kromě toho byl zjištěn významný hlavní účinek úloh, F (1, 63) = 275.42, p <.001. V regresních termínech koeficient pro pojmenování predikoval nižší, tj. lepší, hodnotu Scaled AIC, b = −0.37, SE = 0.02, t = −16.60, p <.001.

Obrázek 5 poskytuje přehled hlavních účinků pomocí bodového a čárového grafu. Intercept neboli referenční buňka se vztahuje jak k nejnižší hodnotě ELP pojmenování, tak k nejvyšší hodnotě BLP lexikálního rozhodování, tj. −3.623. Čáry jsou naskládány

286

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

vertikálně, protože rozsahy hodnot Scaled AIC pro ELP lexikální rozhodování a BLP lexikální rozhodování se nepřekrývaly (viz tabulka 4). Kromě toho jsou čáry rovnoběžné, protože absence skupiny „BLP pojmenování“ v rámci úloh odstranila veškeré interakční účinky.

Souhrnně lze říci, že reakční časy BLP a úloha pojmenování trvale predikovaly lepší hodnoty Scaled AIC i po vzájemné kontrole relevantních faktorů. Tato zjištění zvyšují přesnost a účinnost příslušných modelů.

OBRÁZEK 5. Graf hlavních účinků pro Scaled AIC

Je třeba poznamenat, že analýza hlavních účinků uvedená v této části se více vztahuje ke zdroji reakčních časů než k výkonu v úloze, protože, jak již bylo uvedeno, kombinace „BLP pojmenování“ nebyla k dispozici. Tato skutečnost může omezovat zobecnitelnost výsledků nad rámec konkrétních vzorků.

6.3. Scaled AIC vs. kontrolní proměnné

V této části bude pozornost věnována kontrolním proměnným délka složeniny (ve znacích) a frekvence SUBTLEX-US, tj. logaritmická frekvence složenin odvozená z korpusu SUBTLEX-US (Brysbaert, New 2009). Obě proměnné byly rozsáhle použity v regresních modelech Gagné et al. (2019).

Straipsniai / Articles

287

CHARITON CHARITONIDIS

Pro zjištění vlivu délky složeniny a frekvence složeniny na Scaled AIC byly příslušné regresní koeficienty překódovány na ordinální hodnoty podle jejich kladnosti a hladiny významnosti, viz tabulka 6. Hladiny významnosti byly mapovány na ordinální škály, protože představovaly konvenční hraniční body založené na přesných hodnotách významnosti.

TABULKA 6. Přehled ordinálního překódování regresních koeficientů

Významnost Kladnost Ordinální hodnoty Popis p <.001 záporný −3 velký záporný účinek p <.01 záporný −2 střední záporný účinek p <.05 záporný −1 malý záporný účinek p >.05 záporný/kladný 0 nevýznamný účinek p <.05 kladný 1 malý kladný účinek p <.01 kladný 2 střední kladný účinek p <.001 kladný 3 velký kladný účinek

V modelech Gagné et al. (2019) byla frekvence SUBTLEX-US vždy spojena se zápornými (=latenci zkracujícími) koeficienty s velkým účinkem, p <.001. Všechny koeficienty proto byly překódovány jako −3, což byla hodnota dokonale kolineární s výstupní proměnnou Scaled AIC. Z tohoto důvodu byla frekvence SUBTLEX-US z této analýzy vyloučena.

Pokud jde o délku složeniny, všechny významné regresní koeficienty z modelů Gagné et al. (2019) měly velký kladný (=latenci vyvolávající) účinek, p <.001. Na rozdíl od proměnné SUBTLEX-US se objevilo několik nevýznamných koeficientů. Na základě těchto vzorců byla vytvořena kategoriální proměnná s hodnotami „1“ pro kladný účinek (=interference délky složeniny) a „0“ pro žádný účinek (=žádná interference délky složeniny). Výsledný vzorek obsahoval 39 hodnot Scaled AIC. Pearsonův korelační test mezi délkou složeniny a Scaled AIC poskytl vysoce významný korelační koeficient 0.51, p =.001, což svědčí o středně silné až silné korelaci mezi oběma proměnnými.

Délka složeniny byla zahrnuta jako jediná nezávislá proměnná v lineárním regresním modelu. Bylo zjištěno, že predikovaný průměr Scaled AIC pro absenci interference délky složeniny byl 3.611 (=intercept). Interference délky složeniny vedla k vyšší (=horší) hodnotě −3.407 (b = 0.204, p =.001). Obrázek 6 níže ilustruje tyto vzorce. Stručně řečeno, Scaled AIC se zhoršuje, když se délka složeniny stává v modelech relevantní.

288

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

OBRÁZEK 6. Délka složeniny a Scaled AIC

Provedli jsme samostatné ANOVA pro zdroj reakčních časů (ELP/BLP) a výkon v úloze (lexikální rozhodování/pojmenování), přičemž jsme zohlednili délku složeniny jako kovariát. Hlavním cílem bylo identifikovat rozdíly v průměrech, které byly dříve upraveny tak, aby zohledňovaly kontrolní účinky délky složeniny.

(a) ANOVA pro zdroj reakčních časů. BLP byla přiřazena hodnota „0“ a ELP hodnota „1“. Pearsonův korelační test odhalil silnou kolinearitu mezi zdrojem reakčních časů a délkou složeniny, r = 1 (N = 39). Naše zjištění podporují následující skutečnosti: Zaprvé skupina ELP trvale vykazovala významné kladné korelace s délkou složeniny, což svědčí o velkém účinku. Zadruhé skupina BLP trvale vykazovala nevýznamné korelace s délkou složeniny. Predikovaný průměr Scaled AIC pro zdroj reakčních časů byl proto stejný s délkou složeniny i bez ní v analýze (M = 3.407 v obou případech). Souhrnně délka složeniny neměla významný účinek na Scaled AIC, když byl do analýzy zahrnut zdroj reakčních časů.

(b) ANOVA pro výkon v úloze. Pojmenování byla přiřazena hodnota „0“ a lexikálnímu rozhodování hodnota „1“. Pearsonův korelační test odhalil zápornou korelaci mezi úlohou a délkou složeniny, což svědčí o středním účinku, r = −.5, p =.001 (N = 39). Tento výsledek naznačuje, že délka složeniny je relevantnější pro pojmenování než pro lexikální rozhodování.

17 Je třeba poznamenat, že 11 ze 13 koeficientů BLP bylo záporných.

Straipsniai / Articles

289

CHARITON CHARITONIDIS

Při zohlednění úlohy jako primární proměnné byla délka složeniny významným prediktorem Scaled AIC, F (1, 145.030), p =.000. Obdobně při zohlednění délky složeniny jako primární proměnné byla úloha významným prediktorem Scaled AIC, F (1, 125.30), p =.000. Predikovaný průměr Scaled AIC pouze pro úlohu se významně lišil od predikovaného průměru Scaled AIC při zohlednění délky složeniny (3.584 vs. 3.203). Obdobně se predikovaný průměr Scaled AIC pouze pro délku složeniny (3.584) významně lišil od predikovaného průměru Scaled AIC při zohlednění úlohy (−3.23). Souhrnně lze říci, že z hlediska úpravy o kovariát oba faktory, úloha lexikálního rozhodování i délka složeniny, predikovaly horší modely.

6.4. Scaled AIC vs. normy transparentnosti

Tato část zkoumá účinek regresních koeficientů sémantické transparentnosti v modelech Gagné et al. (2019) na Scaled AIC. Tyto regresní koeficienty byly kódovány na třech ordinálních škálách, z nichž každá odpovídala jedné ze tří morfologických úrovní, tj. složenině, první konstituentě a druhé konstituentě. Přehled ordinálního překódování lze nalézt v tabulce 6.

Tabulka 7 níže uvádí mediány a rozsahy ordinálně transformovaných koeficientů transparentnosti pro všechny tři morfologické úrovně. Mediány poskytují užitečné informace o centrální tendenci a rozptylu ordinálních hodnot a mohou pomoci při analýzách založených na ordinálních proměnných.

TABULKA 7. Ordinálně transformované koeficienty transparentnosti: mediány a rozsahy

Medián Minimum Maximum Složenina −3 −3 −1 První konstituenta 2 −3 3 Druhá konstituenta 0 −2 3

N = 18

Jak je patrné, medián pro složeninu byl „−3“, medián pro první konstituentu byl „2“ a medián pro druhou konstituentu byl „0“. Tato zjištění naznačují, že v modelech Gagné et al. (2019) s frekvencí SUBTLEX–US byla transparentnost složeniny spojena s velkým záporným účinkem (kratšími reakčními časy), transparentnost první konstituenty byla spojena se středním kladným účinkem (delšími reakčními časy) a transparentnost druhé konstituenty neměla významný účinek nebo měla

290

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

nejistou úlohu. Vyšší hodnocení transparentnosti druhé konstituenty uváděná Gagné et al. (tamtéž) naznačují inherentní zkreslení v její prospěch, které vede k tomu, že celková transparentnost složeniny závisí na transparentnosti první konstituenty. V tomto kontextu kladný medián první konstituenty vyvolávající latenci naznačuje její zprostředkující, snad referenčně ustavující úlohu v tomto vztahu (viz také část 1). Zůstává třeba prokázat, které sémantické funkce dostatečně reprezentují inherentní zkreslení druhé konstituenty z hlediska zpracování.18

Výzkumná otázka, kterou se nyní budeme zabývat, zní, zda kladnost a hladina významnosti koeficientů transparentnosti ovlivňují Scaled AIC. Naše metoda je primárně zaměřena na odhalení účinků přeučení. Jak uvádějí Daniel J. Navarro & Jay I. Myung (2005), „složitý model s mnoha parametry a vysoce nelineární formou může často data přizpůsobit lépe než jednoduchý model s několika parametry, i když data generoval právě tento druhý model“ (Navarro, Myung 2005: 1240). Velký počet parametrů proto může zachytit šum nebo jedinečné charakteristiky dostupných dat, ale může omezit schopnost modelu zobecňovat na nová data. AIC zmírňuje problém přeučení zavedením sankce za zahrnutí četných parametrů do modelu, viz část „+2k“ v rovnici AIC v části 2.

Pokud jde o následující analýzu, předpokládá se, že modely vykazující vyšší (=horší) hodnoty Scaled AIC mohou mít významné, systematicky odvozené koeficienty, tj. koeficienty relevantní pouze podle souboru dat LADEC. V této souvislosti naše domněnka naznačuje, že ve vztahu mezi transparentností a Scaled AIC by se mohl objevit opačný trend ve srovnání s tím, co naznačují mediány v tabulce 7.

Konkrétně mohou být nižší (=lepší) hodnoty Scaled AIC spojeny s (a) kladnými koeficienty (delšími reakčními časy) týkajícími se celé složeniny, (b) zápornými koeficienty (kratšími reakčními časy) týkajícími se první konstituenty a (c) kladnými nebo zápornými koeficienty (delšími, respektive kratšími reakčními časy) týkajícími se druhé konstituenty. Je třeba poznamenat, že pokud jde o druhou konstituentu, medián v tabulce 7 nenaznačuje žádný účinek.

Pro zodpovězení výzkumné otázky budou použity dvě neparametrické míry, tj. Kruskalův–Wallisův test a Jonckheereho–Terpstrův test. Kruskalův–Wallisův test, známý také jako „H test“, je neparametrický test založený na

18 V Charitonidis (2024) se uvádí, že jak hyponymie, tak kontextová konkrétnost druhé konstituenty jsou významnými sémantickými prediktory v lexikálním rozhodování a pojmenování. Analýza v dané práci ukazuje, že zahrnutí obou těchto prediktorů vede ke zlepšení Scaled AIC a R2 ve srovnání s modely, které některou z těchto proměnných vynechávají.

Straipsniai / Articles

291

CHARITON CHARITONIDIS

chí-kvadrátovém rozdělení. Vyžaduje, aby závislá proměnná byla ordinální nebo spojitá. Tento test je určen ke zjištění, zda existují významné rozdíly mezi mediány dvou nebo více skupin, a používá se jako alternativa k jednofaktorové ANOVA. Pokud jde o postup, hodnoty spojité závislé proměnné, tj. Scaled AIC, byly seřazeny od nejnižší po nejvyšší a skóre byla převedena na pořadí. Výsledná pořadí byla znovu přiřazena skupinám hladiny významnosti (nezávislé proměnné) a pořadí pro každou skupinu byla sečtena. Vzorec pro výpočet „H“ mimo jiné zahrnoval umocnění součtu pořadí pro každou skupinu a následné vydělení této hodnoty velikostí vzorku.

Tabulky 8–10 obsahují zvažovaná vstupní data a součet pořadí pro každou skupinu.

19

20

součet pořadí pro každou skupinu.

TABULKA 8. Složenina

Hladiny významnosti | N | Součet pořadí Scaled AIC | 1 – malý záporný účinek | 1 | 2 | 2 – střední záporný účinek | 5 | 46 | 3 – velký záporný účinek | 12 | 123 | Celkem | 18 |

TABULKA 9. První konstituenta

Hladiny významnosti | N | Součet pořadí Scaled AIC | 1 – velký kladný účinek | 6 | 59 | 2 – střední kladný účinek | 4 | 34 | 3 – malý kladný účinek | 1 | 3 | 4 – žádný účinek | 1 | 2 | 5 – malý záporný účinek | 1 | 10 | 6 – střední záporný účinek | 1 | 11 | 7 – velký záporný účinek | 4 | 52 | Celkem | 18 |

19 Pro zbytek výpočtů viz Field (2009: 561–562).

20 Ve všech třech tabulkách je celkový součet pořadí přibližně 171. To se rovná součtu celých čísel od 1 do 18, viz velikost vzorku (N).

292

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

TABULKA 10. Druhá konstituenta

Scaled AIC | Hladiny významnosti | N | Součet pořadí Scaled AIC | 1 – velký kladný účinek | 6 | 59 Scaled AIC | 2 – malý kladný účinek | 1 | 14 Scaled AIC | 3 – žádný účinek | 8 | 59 Scaled AIC | 4 – malý záporný účinek | 1 | 18 Scaled AIC | 5 – střední záporný účinek | 2 | 21 | Celkem | 18 |

Než se ponoříme do výsledků Kruskalova–Wallisova (H) testu, je důležité poznamenat, že tento test neposkytuje informace o konkrétních rozdílech mezi jednotlivými skupinami. K řešení tohoto problému byl dodatečně použit Jonckheereho–Terpstrův (JT) test. Tento test poskytl informaci o tom, zda mediány skupin rostly nebo klesaly v pořadí určeném kódovací (=seskupovací) proměnnou, konkrétně od velkého kladného účinku po velký záporný účinek. Pokud jde o metody, statistika JT byla převedena na z-skóre. Kladná hodnota z označovala trend rostoucích mediánů, tedy že mediány rostly (=vyšší/horší Scaled AIC), když se hodnoty kódovací proměnné zvyšovaly. Záporná hodnota z označovala trend klesajících mediánů, tedy že mediány klesaly (=nižší/lepší Scaled AIC), když se hodnoty kódovací proměnné zvyšovaly. Níže jsou společně uvedeny výsledky Kruskalova–Wallisova (H) a Jonckheereho–Terpstrůva (JT) testu.

(a) Scaled AIC pro složeninu nebyl významně ovlivněn hladinou významnosti, jak bylo určeno Kruskalovým–Wallisovým testem (H (2) = 2.226, p >.05). Byl zjištěn trend rostoucích mediánů, který potvrzoval naši hypotézu přeučení; viz záporný medián pro složeninu v tabulce 7. Tento trend však nebyl statisticky významný podle Jonckheereho–Terpstrůva testu (JT = 50, z = 1.064, p >.05).

(b) Scaled AIC pro první konstituentu nebyl významně ovlivněn hladinou významnosti, jak bylo určeno Kruskalovým–Wallisovým testem (H (6) = 5.427, p >.05). Byl zjištěn trend rostoucích mediánů, který vyvracel naši hypotézu přeučení; viz kladný medián pro první konstituentu v tabulce 7. Tento trend však nebyl statisticky významný podle Jonckheereho–Terpstrůva testu (JT = 70, z = 0.549, p >.05).

(c) Scaled AIC pro druhou konstituentu nebyl významně ovlivněn hladinou významnosti, jak bylo určeno Kruskalovým–Wallisovým testem (H (4) = 4.607, p >.05). Trend rostoucích ani klesajících mediánů nebyl pozorován, což vyvracelo

Straipsniai / Articles

293

CHARITON CHARITONIDIS

naši hypotézu přeučení. Konkrétně statistika z Jonckheereho–Terpstrůva testu byla v podstatě nulová, v souladu s nulovým mediánem pro druhou konstituentu v tabulce 7 (JT = 54, z = 0.041, p >.05).

Souhrnně lze vyvodit, že hladina významnosti koeficientů transparentnosti v modelech Gagné et al. (2019) s frekvencí SUBTLEX-US neovlivňuje velikost Scaled AIC. Toto zjištění nepřímo podporuje kvalitu modelů Gagné et al. (2019) s prediktory transparentnosti, konkrétně naznačuje, že hypotéza přeučení pro tyto modely není opodstatněná. Omezením této studie je malá velikost použitého vzorku, N = 18. K potvrzení našich zjištění je zapotřebí další výzkum využívající širší rozsah hodnot Scaled AIC.

Abychom zajistili jasnost a úplnost prezentace výsledků našeho výzkumu, zařadili jsme samostatnou část zaměřenou na shrnutí hlavních zjištění naší studie. Pro tento komplexní přehled pokračujte prosím k části 7.

7. HLAVNÍ ZJIŠTĚNÍ

Tabulka 11 níže uvádí komplexní analýzu výkonnosti modelů a relevantních proměnných v kontextu úloh lexikálního rozhodování a pojmenování na základě zjištění Gagné et al. (2019). Každá část tabulky se zabývá konkrétními tématy a odhaluje, které modely jsou nejúčinnější. ANOVA a testy Kruskalův–Wallisův/Jonckheereho–Terpstrův (části 6.3 a 6.4) byly použity po přiřazení nominálních (ordinálních nebo kategoriálních) hodnot regresním koeficientům z modelů Gagné et al. (2019). Podrobnosti o použitých speciálních testech naleznete v příslušných částech.

TABULKA 11.

Scaled AIC v anglických uzavřených složeninách: Komplexní analýza výkonnosti modelů v úlohách lexikálního rozhodování a pojmenování (Gagné et al. 2019)

294

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

Témata | Statistiky | Hodnocení | Část Kontrolní proměnné | ANOVA | Frekvence složeniny ✓; Délka složeniny ~ | 6.3 Sémantická transparentnost | Kruskalův–Wallisův Jonckheereho–Terpstrův | První konstituenta NOF/ns; Druhá konstituenta NOF/ns; Složenina NOF/ns | 6.4

PAR: parametrická data | NPAR: neparametrická data | ✓: lepší modely (nižší AIC) ~: horší modely (vyšší AIC) | NOF/ns: žádné přeučení/nevýznamný test

8. DISKUSE

Předchozí výzkum Charitonidis (2022, 2024) ukázal, že Scaled AIC je spolehlivá míra dobrého přizpůsobení, kterou lze využít při výběru modelů, případně ve spolupráci s dalšími mírami, jako je Waldův test (viz část 3). S odkazem na vícenásobné regresní modely Gagné et al. (2019) s frekvencí SUBTLEX-US zavedla tato analýza další vlastnosti míry Scaled AIC. Ačkoli byly vzneseny oprávněné obavy ohledně porovnávání modelů přizpůsobených na různě velkých vzorcích pomocí informačních kritérií (viz část 2), zjištění této studie naznačují, že v určitých kontextech může být Scaled AIC skutečně cenným nástrojem pro posuzování shody modelu s daty a hierarchizaci regresních modelů. Náš výzkum prokázal, že Scaled AIC reaguje na experimentální design, zdroje reakčních časů a konkrétní úlohy. Je však nezbytné uznat, že použitelnost Scaled AIC může záviset na kontextu a její užitečnost by měla být posuzována případ od případu.

Než přejdeme k hlavním zjištěním této práce, je důležité zabývat se výzkumnými otázkami formulovanými v části 4.

1. Rozložení hodnot Scaled AIC spolu s kombinacemi různých zdrojů reakčních časů a zpracovatelských úloh naznačují, že Scaled AIC účinně identifikuje přítomnost či nepřítomnost jasně vymezených základních faktorů v experimentálním designu a statistickém modelování. V tomto kontextu vykázaly lexikální rozhodování BLP a pojmenovávání ELP silnější prediktivní schopnost pro Scaled AIC i za kontrolovaných podmínek.

2. Frekvence složenin byla bez výjimky negativním prediktorem Scaled AIC a vždy ukazovala na velký efekt. Lexikální rozhodování ELP soustavně vykazovalo

Straipsniai / Articles

295

CHARITON CHARITONIDIS

významné pozitivní korelace s délkou složenin, které predikovaly vyšší (=horší) hodnoty Scaled AIC. Lexikální rozhodování BLP soustavně vykazovalo nevýznamné korelace s délkou složenin. Jak lexikální rozhodování, tak délka složenin predikovaly při adjustaci na kovariáty horší modely.

3. Pozitivita a hladina významnosti koeficientů transparentnosti v modelech Gagné et al. (2019) neovlivňovaly velikost Scaled AIC. Toto zjištění naznačuje, že modely Gagné et al. (2019) s prediktory transparentnosti nezavádějí zkreslení v důsledku přeučení.

S odkazem na konkrétní části analýz lze hlavní zjištění této studie shrnout následovně:

V části 6.1 se naše analýza zaměřila na porovnání hodnot Scaled AIC napříč různými kategoriemi modelů. Ani po pokusu o transformace „přirozený logaritmus“ a „druhá odmocnina“ absolutních hodnot neodpovídal celkový vzorek Scaled AIC normálnímu rozdělení. Obdobně modely lexikálního rozhodování ELP vykazovaly neparametrické rozdělení svých hodnot Scaled AIC. Naproti tomu data související s lexikálním rozhodováním BLP a pojmenováváním ELP sledovala vzorec normálního rozdělení.

V části 6.2 se naše pozornost přesunula ke zkoumání vztahu mezi Scaled AIC a (a) zdroji reakčních časů a (b) výkonem v úloze. Zajímavé je, že rozsahy hodnot Scaled AIC pro modely lexikálního rozhodování ELP a BLP se nepřekrývaly, což signalizuje jejich odlišnost. Výsledky testů odhalily významné hlavní efekty jak zdroje reakčních časů, tak výkonu v úloze na Scaled AIC. Prediktivní schopnost Scaled AIC byla pozoruhodně lepší u modelů spojených s reakčními časy lexikálního rozhodování BLP a s úlohou pojmenovávání. Tato zjištění významně přispívají k přesnosti a účinnosti příslušných modelů.

V části 6.3 jsme zkoumali vztah mezi Scaled AIC a kontrolními proměnnými „frekvence složeniny“ a „délka složeniny“. Frekvence složeniny byla z analýzy vyloučena, protože byla se Scaled AIC dokonale kolineární. Naproti tomu byl pozorován pokles hodnot Scaled AIC, když se délka složeniny stala v modelech relevantním faktorem. Současně byla délka složeniny nejrelevantnější pro úlohu pojmenovávání.

Pokud jde o adjustaci na kovariáty, jak úloha lexikálního rozhodování, tak délka složeniny predikovaly horší modely.

V části 6.4 jsme se zaměřili na vztah mezi Scaled AIC a sémantickou transparentností. Výzkumná otázka zněla, zda pozitivita a hladina významnosti koeficientů transparentnosti v modelech Gagné et al. (2019) ovlivnily Scaled AIC. Hlavním cílem naší metody bylo odhalit potenciální účinky přeučení. Předpokládali jsme, že modely s horšími hodnotami Scaled AIC mohou mít významné koeficienty, které jsou relevantní

296

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

podle samotného datasetu LADEC. Přestože jsme u shluku významných negativních koeficientů na úrovni složenin pozorovali trend rostoucích (=horších) hodnot Scaled AIC – v souladu s naší hypotézou o přeučení –, test Jonckheere–Terpstra ukázal, že tento trend nedosáhl statistické významnosti.

Závěrem lze říci, že zkoumání různých parametrů s využitím Scaled AIC jako závislé proměnné objasnilo rozmanité způsoby, jimiž kategorie modelů, zdroj reakčních časů, zpracovatelské úlohy, kontrolní proměnné a sémantická transparentnost ovlivňují kvalitu přizpůsobení modelů. Uvědomění si jemných vztahů mezi těmito prvky umožňuje výzkumníkům lépe přijímat informovaná rozhodnutí při výběru, úpravách a interpretaci modelů.

REFERENCES

Akaike Hirotugu 1973: Information Theory and an Extension of the Maximum Likelihood Principle. – Second International Symposium on Information Theory, eds. B. F. Csaki, B. N. Petrov, Budapest: Academiai Kiado, 267–281.

Aldrich John R. 1997: R. A. Fisher and the Making of Maximum Likelihood 1912–1922. – Statistical Science 12(3), 162–176.

Baayen Harald R., Piepenbrock Richard, Gulikers Leon 1995: The CELEX Lexical Database (Data set, Release 2, CD-ROM), Linguistic Data Consortium, University of Pennsylvania. Available at: https://catalog.ldc.upenn.edu.

Balota David A., Yap Melvin J., Cortese Michael J., Hutchison Keith I., Kessler Brett, Loftis Bjorn, Neely James H., Nelson Douglas L., Simpson Greg B., Treiman Rebecca 2007: The English Lexicon Project. – Behavior Research Methods 39, 445–459.

Brysbaert Marc, New Boris 2009: Moving Beyond Kučera and Francis: A Critical Evaluation of Current Word Frequency Norms and the Introduction of a New and Improved Word Frequency Measure for American English. – Behavior Research Methods 41, 977–990. DOI: doi.org/10.3758/BRM.41.4.977.

Burnham Kenneth P., Anderson David R. 2002: Model Selection and Multimodal Inference: A Practical Information-Theoretic Approach, 2ⁿᵈ edition, New York: Springer. DOI: dx.doi.org/10.1007/b97636.

Charitonidis Chariton 2022: Context Concreteness for the Second Constituent Slows Down Compound-Word Processing. – Lexis 20. DOI: doi.org/10.4000/lexis.6769.

Straipsniai / Articles

297

CHARITON CHARITONIDIS

Charitonidis Chariton 2024: The Role of Hyponymy and Context Concreteness in Compound Word Processing. – Studia Neophilologica. DOI: doi.org/10.1080/00393274.2024.2336851.

Chen Xiaocong, Dong Yanping, Yu Xiufen 2018: On the Predictive Validity of Various Corpus-Based Frequency Norms in L2 English Lexical Processing. – Behavior Research Methods 50, 1–25. DOI: doi.org/10.3758/s13428-017-1001-8.

Field Andy 2009: Discovering statistics using SPSS, 3rd edition, London: Sage Publications.

Fisher Ronald A. 1922: On the Mathematical Foundations of Theoretical Statistics. – Philosophical Transactions of the Royal Society of London, Series A 222, 309–368.

Gagné Christina L., Spalding Thomas L., Schmidtke Daniel 2019: LADEC: The Large Database of English Compounds. – Behavior Research Methods 51, 2152–2179. DOI: doi.org/10.3758/s13428-019-01282-6.

Gagné Christina L., Spalding Thomas L., Spicer Patricia, Wong Dixie, Rubio Beatriz, Perez-Cruz Karen 2020: Is Buttercup a Kind of Cup? Hyponymy and Semantic Transparency in Compound Words. – Journal of Memory and Language 113. DOI: doi.org/10.1016/j.jml.2020.104110.

Hastie Trevor, Tibshirani Robert, Friedman Jerome 2009: The Elements of Statistical Learning: Data Mining, Inference, and Prediction. 2nd edition, New York: Springer.

Keuleers Emmanuel, Lacey Paula, Rastle Kathleen, Brysbaert Marc 2012: The British Lexicon Project: Lexical Decision Data for 28,730 Monosyllabic and Disyllabic English Words. – Behavior Research Methods 44, 287–304. DOI: doi.org/10.3758/s13428-011-0118-4.

Kullback Solomon 1959: Information Theory and Statistics. New York: Wiley.

Navarro Daniel J., Myung Jay I. 2005: Model Evaluation. – Encyclopedia of Statistics in Behavioral Science, vol. 3, eds. B. S. Everitt, D. C. Howell, Chichester: Wiley, 1239–1242.

Steiger James H. 1980: Tests for Comparing Elements of a Correlation Matrix. – Psychological Bulletin 87(2), 245–251. DOI: doi.org/10.1037/0033-2909.87.2.245.

Wagenmakers Eric-Jan, Farrell Simon 2004: AIC Model Selection Using Akaike Weights. – Psychonomic Bulletin & Review 11(1), 192–196.

298

Acta Linguistica Lithuanica XC

Exploring Scaled AIC within English Closed Compounds

I N T E R N E T D I S C U S S I O N S

Model comparison with AIC based on different sample size. Available at: https://stats.stackexchange.com/questions/94718/model-comparison-with-aic-based-on-different-sample-size [accessed 15.5.2024].

What is the acceptable range of skewness and kurtosis for normal distribution of data? Available at: https://www.researchgate.net/post/What_is_the_acceptable_range_of_skewness_and_kurtosis_for_normal_distribution_of_data [accessed 15.5.2024].

L A R G E L A N G U A G E M O D E L S

GPT-3.5 (available at: https://chat.openai.com/) and Google Gemini (available at: https://gemini.google.com [accessed 11.10.2023]) were selectively used as auxiliary proofreading and editing tools. The responses from both AI tools were further proofread and edited by the author.

Anglų kalbos uždarųjų junginių (sudurtinių žodžių) skalės AIC tyrimas

S A N T R A U K A

Šiame tyrime nagrinėjamos modifikuotos Akaikės informacijos kriterijaus, pavadinto skalės kriterijumi, t. y. AIC, kaip tinkamumo rodiklio, padalinto iš imties dydžio, varianto ypatybės. Tyrimo objektas – 66 daugialypės regresijos modeliai, susiję su uždarųjų (sudurtinių) anglų kalbos žodžių junginių, paimtų iš Gagné'es ir kitų (2019) Anglų kalbos sudurtinių žodžių (junginių) didžiosios duomenų bazės (angl. LADEC), apdorojimu. Toliau pateikiami išsamios analizės rezultatai:

1. Modelių kategorijų modeliai pasižymi nevienareikšmiais rezultatais. Britų kalbos žodyno projekto (angl. BLP) leksinių sprendimų modeliai ir Anglų kalbos žodyno projekto (angl. ELP) įvardijimo modeliai veikia geriau (tai rodo mažesnis AIC), palyginus su Anglų kalbos žodyno projekto (angl. ELP) leksinių sprendimų modeliais.

Straipsniai / Articles

299

CHARITON CHARITONIDIS

2. Laiko šaltinio ir leksikos apdorojimo užduočių atsakymais atskleidžia reikšmingus pagrindinius skalės AIC rezultatus. Britų kalbos žodyno projekto leksinių sprendimų modeliai ir Anglų kalbos žodyno projekto įvardijimo modeliai veikia gerai, o pastarojo projekto leksinių sprendimų modeliai yra mažiau veiksmingi.

3. Įvertinus kontrolinius kintamuosius, tokius kaip junginių dažnumas ir junginių ilgis, matyti, kad modelių rezultatyvumas skiriasi. Junginių dažnumas yra stiprus veiksnys (parodo didesnis produktyvumas), o sudėtinio ilgio modelių prognozės blogesnės.

4. Kalbant apie pirmosios ir antrosios žodžių junginių sudedamųjų dalių, taip pat ir apie junginių semantinį skaidrumą, modeliai nerodo per didelio suderinamumo. Tai parodo, kad semantinis skaidrumas nesumažina modelių galėjimo apibendrinti naujus duomenis.

Įteikta 2024 m. sausio 11 d.

CHARITON CHARITONIDIS

[email protected]

300

Acta Linguistica Lithuanica XC