scieee AI-readable full text Open interactive document viewer

Exploring Scaled AIC within English closed compounds

Chariton Charitonidis

Abstract

The Akaike Information Criterion (AIC) is an established goodness-of-fit measure for selecting models in the analysis of empirical data. However, AIC is sensitive to sample size. Author’s previous research has shown that Scaled AIC, i.e. AIC divided by sample size, is an effective tool for assessing model fit and hierarchizing regression models. The present study explores further properties of this variable. The object of investigation are 66 multiple regression models referring to the processing of closed (concatenated) English compounds taken from Gagné et al.’s (2019) Large Database of English Compounds (LADEC). In particular, Scaled AIC is juxtaposed to the English Lexicon Project (ELP) and British Lexicon Project (BLP) as sources of response times, the lexical decision and naming tasks, compound length, and transparency norms. One-way ANOVA, main effects analysis, and non-parametric tests are used as methods. The findings suggest that Scaled AIC is responsive to experimental design, the source of response times, and the lexical decision and naming tasks. At the same time, the results of this study offer empirical support for the validation of methods employed by Gagné et al. (2019).

Full text

Les articles 273 et 273 de la loi CHARITONCHARITONIDIS Rechercheur indépendant Le numéro d'identification ORCID est le suivant: orcid.org/0000-0003-0298-2629 Ses domaines de recherche sont la formation des mots, les expressions à plusieurs mots, la sémantique lexicale, la reconnaissance des mots, l'émotion. DOI: doi.org/10.35321/all90-11 (en anglais) L'AIC à l'échelle d'exploration En anglais fermé Les composés Langue anglaise des jungliers (sudurtinius žodžių) skalės AIC tyrimas (l'examen du niveau d'études de l'AIC) Notation à l'appui L'AIC est une mesure établie de la bonté de l'ajustement pour la sélection de modèles dans l'analyse de données empiriques, mais la validité est sensible à la taille de l'échantillon.Les recherches précédentes de l'auteur ont montré que l'AIC à l'échelle, c'est-à-dire divisé par la taille de l'échantillon, est un outil efficace pour évaluer l'ajustement du modèle et la hiérarchisation des modèles de régression.L'étude actuelle explore d'autres propriétés de cette variable.L'AIC est l'objet de 66 modèles de réponse de l'AIC se référant au traitement de composés anglais fermés (concatenés) tirés du projet Gagné et al. KEYWORDS: composés anglais, AIC à l'échelle, décision lexicale, dénomination. ANOTACIJA Akaikės informacijos kriterijus (angl. AIC) est pastovus modelių tinkamumo matas, taikomas empirinių duomenų analizei. Tačiau AIC est jautrus dydties imžiui. Ankstesni Chariton et charitonidés 274 Acta Linguistica Lituanica XC authoriaus tyrimai parodė, kad skalės, padalytas iš imties dydžio, yra veiksminga priemonė modelio tinkamumui įvertinti ir regresijos modeliami hierarchizuoti. Šiame tyrime nagrinėjamos tolimesnės šio kint ypatybių. patvirtimo objektas 66 daugių regresijos modeliai, susiję su uždarų (sudurtinių) anglų kalbos junginių, paimtų iš bazės (AIC) , apdorojimu Pirmiausia sugretė su projektų metodai Analysis of variance (ANOVA), pagrindinių rezultato ir iraparinų šaltinių. Gagné’ėsirkitų (2019)Anglųkalbossudurtiniųžodžių(junginių) didžiosiosduomenų ESMINIAI ŽODŽIAI: anglais langues junginiai (sudurtiniai žodžiai), skalės AIC, leksinis sprendimas, projektu(angl.ELP)irBritųkalbosžodynoprojektu(angl.BLP),kaipatsakolaiko,leksinių sprendimųirįvardijimoužduočių,junginiųilgioirskaidrumonormųšaltiniai.Naudojami įvardijimas. 1. La grande base de données Des composés anglais (LADEC: GAGNÉ et AL. 2019)1 Il est important de noter que les données fournies par les États membres ne sont pas conformes à la législation de l'Union européenne. La grande base de données des composés anglais (LADEC: Gagné et al. 2019) est la plus grande base de données existante de mots composés. de l'ensemble complet des entrées de LADEC, 7804 composés peuvent être librement parés en deux morphones uniques. une grande variété de composés est considérée, par exemple, le CELEX (Baayen et al. 1995), le projet de lexique anglais (ELP; Balota et al. 2007), le projet de lexique britannique (BLP; Keeler et al. 2012), le British National Corpus (B), et la base de données Wordnet. Les modèles de régression multiple de Gagné et al. (2019) comprennent un large éventail de variables prédictives (=indépendantes), telles que la longueur du composé, la fréquence du bigramme. 2004:46).Thefirstnon-headconstituentreferstoawiderangeofgrammatical 2 LADEC inclut le pluriel des composés déjà répertoriés en tant qu'entrées distinctes. Les articles 275 et 275 du Statut Exploring Scaled AIC within English Closed Compounds Les temps de réponse logarithmiques pour les composés de ELP (décision lexicale, dénomination) et BLP (décision lexicale) sont utilisés comme variables dépendantes.Pour la plupart, la longueur du composé (nombre de caractères) et la fréquence du logarithme composé du corpus 2009 SULEX-BT-US (Brysbaert, New) 3 et BNC (BLP) sont utilisés comme variables de contrôle. Figure 1 Le tableau ci-dessous est présenté. Les entrées de LADEC: rythme avion imbécile cadenas terre chantier naval joueur de échantillon de la vie après la mort cendrier inconvénient analgésique ballon tête d'œuf lacet de rêve éveillé stimulateur de arrière bord tremblement de chaussure couteau sourcil fusil de chasse gardien progéniture retour en arrière manuel naufragé rejeté retour en arrière feu croisé surmobile Gagné et al. (2019) ont demandé aux participants d'évaluer les composés en tenant compte de la prévisibilité de la signification du composé à partir de ses parties (c'est-à-dire les notes de prévisibilité, basées sur les composés) et de la quantité de signification de chacun des constituants conservée dans le composé (c'est-à-dire les notes de rétention, basées sur les constituants). 3 Le corpus SUBTLEX-US est un corpus de 51 millions de jetons basé sur les sous-titres de films et de programmes de télévision américains. Plusieurs études récentes ont fourni des preuves indiquant que les normes de fréquence obtenues à partir des sous-titres de films et de programmes de télévision ont tendance à être plus efficaces que celles dérivées de textes imprimés lorsqu'il s'agit d'expliquer les différences dans le temps de traitement lexicale et, dans certains cas, l'exactitude parmi les locuteurs natifs de diverses langues. 2018: 2 et les références qui y figurent). Chariton et charitonidés 276 Acta Linguistica Lithuanica XC le premier constituant était plus fortement corrélé avec la note pour l'ensemble du composé que la note pour le deuxième constituant (c1 ~ cmp: r = 0,75, p <.001 vs. c2 ~ cmp: r = 0,66, p <.001. N = 429).4 Plus notamment, la note de rétention de sens pour le premier constituant et la décision de notation de prévisibilité de sens, la décision lexicale BLP et les temps de nommage ELP. Pour conclure, le sommet et la distribution plus élevée des forthecompoundpredictedallthreetypesofresponsetimes,i.e.ELPlexical transparences pour le deuxième constituant et la meilleure association du premier constituant avec les opérations de tête dans les composés anglais. Le deuxième constituant, c'est-à-dire la tête, est une unité dont la transparence est améliorée catégoriquement et sémantiquement (en compound’s meaning predictability appear to be immediately mapped onto ce qui concerne l'aspect sémantique, voir les relations d'inclusion et d'hyponymie). est généralement calculé comme suit: […]2lnL + 2k, dans lequel […]lnL[…] se réfère à la probabilité logarithmique maximisée ou complète du modèle et […]k[…] se réfère au nombre de paramètres, y compris la constante. Un ensemble plus petit de prédicteurs est généralement associé à des modèles plus efficaces (modèles avec une perte d'information plus faible). ofthecompoundmoststrongly.5 2. AKAIKEINFORMATIONCRITERION(AIC) In 1973, Hirotugu Akaike developed a method to estimate the relative partoftheAICequation). 4 Steiger’s(1980)ztestshowedthatthisdifferencewassignificant,z=27.71,p<.0001(Gagné etal.2019). 5 En se référant à des recherches antérieures, Gagné et al. (2019) rapportent que "le modificateur (le premier constituant en anglais) a tendance à jouer un rôle plus important dans la sélection de la facilité de relation lors du traitement des composés et des phrases de noms". Les articles 277 et 278 de la loi Exploring Scaled AIC within English Closed Compounds L'AICc, une version corrigée de l'AIC, intègre la taille de l'échantillon par la formule 2k (k + 1) (n […] k […] 1). Cependant, il s'adresse spécifiquement aux petites tailles d'échantillon et n'est pas recommandé pour les modèles basés sur de grandes tailles d'échantillon telles que celles de Gagné et al. (2019). En particulier, Burnham et Anderson (2002: 80 <85, 334 <335) fournissent une discussion approfondie des implications des tailles d'échantillon inégales pour la comparaison des modèles. Ils soutiennent que l'utilisation de critères d'information pour comparer des modèles avec des tailles d'échantillon différentes peut conduire à des résultats trompeurs. De même, comme noté dans une discussion en ligne par Svetunkov en 2016 (voir référence après la bibliographie), tous les critères d'information sont basés sur la fonction de probabilité qui, à son tour, dépend de la taille de l'échantillon. 3. Recherches antérieures Dans Charitonidis (2022), les valeurs de l'AIC pour 44 modèles de régression multiple avec différentes combinaisons de variables émotionnelles (valence, excitation et concrétité pour (a) les mots et (b) les contextes des mots) ont été divisées par la taille de l'échantillon (N) pour produire des valeurs à l'échelle (AIC/N). 7 L'une des solutions proposées par Burnham et Anderson (2002) fait référence à la transformation des valeurs de l'AIC en "poids d'Akaike" qui sont définis comme "la probabilité relative du modèle, compte tenu des données" (Burnham, Anderson 2002: xiii; voir également Wagenmakers, Farrell 2004). Le lecteur peut comprendre l'affirmation de Svetunkov en substituant des valeurs différentes pour la composante […]lnL[…] dans l'équation, tout en maintenant la composante […]2k[…] constante. Une diminution de la valeur lnL entraînera une valeur d'AIC plus élevée, c'est-à-dire inférieure. Selon Svetunkov (communication personnelle), la pratique de diviser le critère d'information d'Akaike par la taille de l'échantillon n'est pas nouvelle. Par exemple, Hastie et al. (2009) définissent de manière non canonique, en employant N comme dénominateur dans la formule. Bien que cet écart par rapport à la formule AIC conventionnelle ne soit pas sans ses critiques, il reste une approche répandue, comme en témoigne son inclusion dans le logiciel statistique Stata. Chariton et charitonidés 278 ActaLinguisticaLithuanicaXC L'insertion de prédicteurs clés dans des modèles globaux, c'est-à-dire généraux, a montré que les temps de décision lexicale BLP nécessitaient une meilleure qualité de l'ajustement que les temps de décision lexicale ELP. L'ajustement des modèles ELP est tombé dans la fourchette de ceux observés pour les modèles de décision lexicale ELP et BLP. Plus particulièrement, la concréteté du contexte pour le deuxième constituant est apparue comme un prédicteur significatif dans tous les modèles avec fréquence SUBTLEX-US, à travers la décision lexicale et la dénomination. Dans Charitonidis (2024), tous les coefficients significatifs des modèles globaux avec fréquence SUBTLEX-US ont été juxtaposés à la variable d'hyponymie (Gagné et al. 2020). Il a été constaté que les modèles comprenant à la fois l'hyponymie et la concréteté du contexte pour les deuxièmes variables étaient toujours associés à la valeur Scaled (c.-à-d. la meilleure) de la composante par rapport aux modèles imbriqués, c'est-à-dire réduits, omettant l'un ou l'autre de ces deux modèles. Tableau 1. Le tableau 1. Le tableau 2. Les valeurs à l'échelle pour les modèles imbriqués omettant l'hyponymie ("modèle 2") ou la concrétesse du contexte pour le deuxième constituant ("modèle 3") à partir de modèles complets ("modèle 1) pour prédire les temps de décision lexicale (LD) du projet de lexique anglais (ELP), les temps de décision lexicale (BLP) et les temps de concrétesse du deuxième constituant (ELP) des modèles imbriqués ("modèle 2") ou des modèles imbriqués ("modèle 2") à partir de modèles modèles (ELP) pour prédire les temps de décision hyponomique, la fréquence du lexique britannique (ELP) et la valence du contexte (c). Modèle à l'échelle AIC AIC N ELP LD Il s'agit d'une question qui concerne l'application de la directive. 2-3.30375 -4169.334 1262 3-3.34845 -3700.038 1105 BLPLD Il s'agit d'une question qui concerne l'application de la directive. 2-3.76618 -3920.592 1041 3-3.76718 -2987.37 793 dénomination de l'ELP Il s'agit d'une affaire qui concerne des personnes âgées. 2-3.54304 -8418.27 2376 3-3.58379 -7389.784 2062 Les articles 279 et 279 de la loi Exploring Scaled AIC within English Closed Compounds SUBTLEX-USfrequency,representationvalence(cmp),contextconcreteness (c2) Temps de dénomination des ELP Modèle R2 carré F changement df1 df2 p ELP LD 1.184a47.506 5 1052 000 personnes ont été blessées. 2-.004 4.562 1 1052 .033 3-.010 13.175 1 1052 .000 BLP LD 1.211a40.479 5 759.000 Le montant de l'aide est fixé en fonction de l'ampleur de l'aide accordée. 2-.013 12.091 1 759 .001 3-.015 14.007 1 759 .000 dénomination de l'ELP 1.288b118.711 72054.000 Autres espèces et espèces 2-.003 8.286 1 2054 .004 3-.003 8.309 1 2054 .004 a. Prédicteurs: (constante), jugement d'hyponymie, longueur du composé, fréquence SUBTLEX-US, valence de représentation (cmp), concrétité du contexte (c2) b. Prédicteurs: (constante), jugement d'hyponymie, longueur du composé, fréquence SUBTLEX-US, valence de contexte (cmp), excitation de contexte (c1), excitation de contexte (c2), concréteté de contexte (c2) En conclusion, deux mesures différentes de taille d'effet, à savoir l'AIC à l'échelle et la même préférence pour le meilleur modèle. R2,hierarchizedthesameregressionmodelsidenticallywhiledemonstrating Chariton et charitonidés 280 Acta Linguistica Lituanica XC (en anglais) 4. L'étude actuelle La présente étude s'appuie sur les recherches précédentes de l'auteur présentées à la section 3. Les sujets de recherche sont 66 modèles de décision et de dénomination lexicales pour les composés fermés (concatenés) anglais construits par Gagné et al. (2019). Tous les modèles incluent la fréquence SUBTLEX-US comme variable de contrôle. Nos objectifs sont doubles et fonctionnent en parallèle. Premièrement, nous évaluons les caractéristiques des modèles de Gagné et al. (ibid.). Les questions de recherche sont les suivantes: 1. L'AIC à l'échelle est-elle sensible à la conception du modèle de Gagné et al. (2019)? Quels groupes de modèles sont favorisés? 2. Quel est l'impact des variables de contrôle "fréquence composée" et "longueur composée" sur l'AIC à l'échelle? 3. Comment la transparence morphologique est-elle liée à l'AIC à l'échelle? L'étude est structurée comme suit: la section 5 fournit un aperçu de nos méthodes. la section 6.1 fournit des statistiques descriptives pour l'AIC à l'échelle en se référant aux modèles considérés. l'accent est mis sur les caractéristiques paramétriques par rapport aux caractéristiques non paramétriques des catégories de modèles. la section 7.2 explore la relation entre la source des temps de réponse et les tâches de traitement lexicale. la section 6.3 juxtapose l'AIC à la variable de contrôle "fréquence composée" et "longueur composée". dans la section 6.4 les niveaux de signification des coefficients de transparence des modèles de Gagné et al. (2019) sont mappés sur les valeurs à l'échelle. 5. Les méthodes Notre méthode générale était l'analyse comparative des principaux paramètres et caractéristiques des modèles de Gagné et al. (2019), en utilisant des variables à échelle comme variable dépendante. Les variables indépendantes comprenaient les caractéristiques de l'échantillon (par exemple, la source du temps de réponse et les tâches de traitement lexicale), la conception de l'étude (par exemple, le contrôle) et le niveau de signification des coefficients de transparence, entre autres facteurs. Les méthodes statistiques spécifiques utilisées étaient les suivantes: a) des statistiques descriptives relatives aux moyennes et aux médianes, ainsi que l'application du test de Shapiro-Wilk pour évaluer la tendance centrale, la variabilité et la distribution des effets de Scaled à travers différentes catégories et groupes de modèles (sections 6.1 et 6.2), b) des analyses principales menées pour la source des temps de réponse (ELP/BLP) et les tâches de traitement lexicale (nommage de décision lexicale) (section Les articles 281 et 282 de la loi Exploring Scaled AIC within English Closed Compounds 6. c) des ANOVA distinctes effectuées sur la source du temps de réponse et les tâches de traitement lexicale, incorporant la longueur composée comme covariable (section 6.3), et d) l'utilisation des tests de transparence sémantique de Kruskal-Wallis et de to explore differences amongthe ranks of ordinally-recodedcoefficientsfor Jonckheere-Terpstra (section 6.4). 6. Analyses effectuées 6.1 Classification à l'échelle par rapport aux catégories de modèles Les 66 valeurs d'AIC des modèles de régression multiple 2 de Gagné et al. (2019) affichent le with SUBTLEX-US frequency as a control variable were divided by each model’ssamplesizetoyieldasetof66ScaledAICvalues. Table3belowprovidesthedescriptivestatisticsforScaledAICandFigure graphique correspondant se référant à l'ensemble ordonné de valeurs.10 Il n'y avait pas de valeurs aberrantes dans l'échantillon. Les valeurs de biais (Sk) et de kurtosis (Ku) étaient tolérables.11 La valeur moyenne pour l'AIC à l'échelle était de -3,50030. L'écart-type était de 0,19052, c'est-à-dire que les observations étaient relativement étroitement regroupées autour de la moyenne. Les valeurs minimales et maximales étaient de -3,85502 et -3,7315754, respectivement. La valeur médiane était de -3,552, c'est-à-dire légèrement inférieure à la valeur moyenne. (IQR) était de 0,35616. 10 La ligne du quartile inférieur ou premier de la boîte (Q1) marque la limite en dessous de laquelle s'étend le 25% inférieur des données. de même, la ligne du quartile supérieur ou troisième de la boîte (Q3) marque le 50% du milieu boundaryabovewhichtheupper25%ofthedataextends.Theshadedareashowstheboundaries des données ou la fourchette interquartile (IQR), qui peut être calculée en soustrayant 114. en référence à thefirstquartilefromthethirdquartile(Q3-Q1).Thehorizontallineinsidetheboxshowsthe medianormiddle quartile(Q2),i.e.thevaluethatfallsinthemiddleofthedataset. l'environnement SPSS, les valeurs entre -1 et +1 pour l'écart et entre -2 et +2 pour la kurtosis sont généralement considérées comme acceptables pour l'évaluation de la distribution normale. What_is_the_acceptable_range_of_skewness_and_kurtosis_for_normal_distribution_of_data). Chariton et charitonidés Pour détecter l'influence de la longueur et de la fréquence des composés sur l'AIC à l'échelle, les coefficients de régression respectifs ont été recodés en valeurs ordinaires en fonction de leur positivité et de leur niveau de signification, voir le tableau 6. TABLE 6. Tableau de recodage ordinal pour les coefficients de régression Significance Positivité valeurs ordonnées Description p <.05001 négatif -3 grand effet négatif p <.0501 négatif -2 effet négatif modéré p <.0505 négatif petit effet négatif p >.0505 négatif/positif 0 effet non significatif p <.05 positive 1 petit effet positif p <.0501 positif 2effet positif modéré p <.05 positive 3grand effet positif Dans les modèles de Gagné et al. (2019) , la fréquence SUBTLEX-US a toujours été associée à des coefficients négatifs avec un grand effet, p < Sc.001. En ce qui concerne la longueur composée, tous les coefficients de régression significatifs des modèles de Gagné et al. (2019) ont eu un grand effet positif d'induction de latence, p <.001. Contrairement à la variable SUBTLEX-US, plusieurs coefficients non significatifs ont été observés. Compte tenu de ces modèles, une variable catégorique a été créée avec les valeurs 0,5 <1> pour l'effet positif (interférence de longueur composée) et 0 <0 <0> pour l'effet nul (interférence de longueur composée). La longueur composée a été incluse comme une seule variable indépendante dans un modèle de régression linéaire. il a été constaté que la moyenne d'AIC à l'échelle prédite pour l'absence d'interférence de longueur composée était de 3,611 (= l'interception). l'interférence de longueur composée a entraîné une valeur plus élevée de -3.407 (= b = 204, p. 001). Straipsniai articles 289 et 299 Exploring Scaled AIC within English Closed Compounds Figure 6. Longueur composée et AIC à l'échelle Nous avons mené des ANOVA séparées pour la source du temps de réponse (ELP/BLP) et la performance de la tâche (décision lexicale/nommage), en tenant compte de la longueur composée en tant que covariable. Le test de corrélation de Pearson a révélé une forte collinéarité entre la source du temps de réponse et la longueur du composé, r = 1 (N = 39).Les preuves suivantes soutiennent notre conclusion: Premièrement, le groupe ELP a régulièrement montré des corrélations positives significatives avec la longueur du composé, indiquant un effet important.Deuxièmement, le groupe BLP a régulièrement montré des corrélations non significatives avec la longueur du composé.17 Par conséquent, la moyenne prédite de Sc pour la source du temps de réponse était la même avec ou sans composé dans l'analyse (M = 3,407 dans les deux cas). Le test de corrélation de Pearson a révélé une corrélation négative entre la tâche et la longueur du composé, indiquant un effet modéré, r = -.5, p =.001 (N = 39). 17 Il convient de noter que 11 des 13 coefficients BLP étaient négatifs. Chariton et charitonidés Acta Linguistica Lituanica XC Lorsqu'on considère la tâche comme la variable primaire, la longueur composée était une longueur composée considérée comme la variable primaire, la significantpredictorofScaledAIC,F(1,145.030),p=.000.Similarly,when tâche était un prédicteur significatif de l'AIC à l'échelle, F (1, 125.30), p = 000. La moyenne de l'AIC à l'échelle prédite pour la tâche seule était significativement différente de la moyenne de l'AIC à l'échelle prédite lorsque la longueur composée était prise en compte (3,584 vs 3,203, respectivement). Cette section étudie l'effet des coefficients de régression pour la sémantique sur les trois niveaux morphologiques, c'est-à-dire le composé, le premier constituant et le deuxième constituant. Le tableau 7 ci-dessous affiche les médianes et les plages des coefficients de transparence transformés ordinairement pour les trois niveaux morphologiques. Les médianes fournissent des informations utiles sur la tendance 6.4. ScaledAICvs.transparencynorms centrale et la dispersion des valeurs ordinales et peuvent aider à éclairer les analyses transparencyinGagnéetal.(2019)modelsonScaledAIC.Theseregression coefficientswerecodedonthreeordinalscales,eachcorrespondingtooneof basées sur les variables ordinales. TABLE 7. Coefficients de transparence transformés ordinairement: médianes et fourchettes Médiane minimale maximale Composé -3 -3 -1 Premier constituant 2-3 3 Deuxième constituant 0 -2 3 N = 18 ans Comme on peut le voir, la médiane pour le composant était […]-3[…], la médiane pour le premier composant était […]2[…], et la médiane pour le deuxième composant était […]0[…]. Ces résultats suggèrent que dans les modèles de Gagné et al. […]s, la transparence pour le composant était associée à un effet négatif important (temps de réponse plus courts), la transparence pour le premier composant était associée à un effet positif modéré (temps de réponse plus longs) et la transparence pour le deuxième composant n'avait pas d'effet significatif ou avait un rôle incertain. Selon Scarro et al. (2005), les évaluations de transparence plus élevées pour le Les articles 291 et 292 de la loi Exploring Scaled AIC within English Closed Compounds deuxième composant restent un biais inhérent, conduisant à la transparence globale dépendant de la fréquence du premier composant. En ce qui concerne l'analyse à suivre, il est postulé que les modèles présentant des valeurs à l'échelle plus élevées (inférieures) peuvent posséder des coefficients significatifs dérivés systématiquement, c'est-à-dire des coefficients qui sont pertinents selon l'ensemble de données LADEC seul. En particulier, des valeurs d'AIC à plus faible échelle peuvent être associées à: a) des coefficients positifs (temps de réponse plus longs) concernant l'ensemble du composé; b) des coefficients négatifs (temps de réponse plus theinherentbiasofthesecondconstituent.18 courts) concernant le premier constituant; et c) des coefficients positifs ou négatifs (temps de réponse plus longs ou plus courts, respectivement) concernant le deuxième constituant. Pour répondre à la question de recherche, deux mesures non paramétriques seront utilisées, à savoir le test de Kruskal-Wallis et le test de Jonckheere-Terpstra. Le test de Kruskal-Wallis, également connu sous le nom de "test H", est un test non paramétrique basé sur 18 dans Charitonidis (2024) il est soutenu que l'hyponymie et la concrétesse du contexte pour le deuxième constituant sont des prédicteurs sémantiques importants dans la décision lexicale et la dénomination. Chariton et charitonidés 292 Acta Linguistica Lituanica XC la distribution chi-carré. Elle exige que la variable dépendante soit ordinaire ou continue. Ce test est conçu pour déterminer s'il existe des différences significatives entre les médianes de deux groupes ou plus et est utilisé comme alternative à l'ANOVA unidirectionnelle. En ce qui concerne la procédure, les valeurs de la variable dépendante continue, c'est-à-dire l'AIC à l'échelle, ont été ordonnées de la plus basse à la plus élevée et les scores ont été attribués. Les rangs résultants ont été réintégrés dans les groupes de niveau de signification (la variable indépendante) et les rangs pour chaque groupe ont été additionnés. amongothers,squaringthesumofranksforeachgroupandthendividingthis TABLE 8. Composé Significancelevels N SumofRanks Effet négatif à Il s'agit de l'AIC. l'échelle 1 […] faible 1 2 2 […] effet négatif modéré 5 46 3 […] effet négatif important 12 123 Au total, 18 personnes TABLE9.Firstconstituent Significancelevels N SumofRanks Scaled Il s'agit de l'AIC. 1–largepositiveeffect 6 59 2 […] effet positif modéré 4 34 3 […] petit effet positif 1 3 4 […] aucun effet 1 2 5 […] petit effet négatif 1 10 6 […] effet négatif modéré 1 11 7 […] effet négatif important 452 Au total, 18 personnes 19 Pour le reste des calculs, voir Field (2009: 561 […] 562). 20 Dans les trois tableaux, la somme totale des rangs est d'environ 171. Elle est égale à la somme des entiers de 1 à 18, voir taille d'échantillon (N). Straipsniai articles 29 et 33 Exploring Scaled AIC within English Closed Compounds TABLE 10. Deuxième composant Significancelevels N SumofRanks Scaled Il s'agit de l'AIC. 1–largepositiveeffect 6 59 2 […] petit effet positif 1 14 3 […] aucun effet 8 59 4 […] petit effet négatif 1 18 5–moderatenegativeeffect 221 Au total, 18 personnes Avant d'entrer dans les résultats du test de Kruskal-Wallis (H), il est important de noter que ce test ne fournit pas d'informations sur les différences spécifiques entre les groupes individuels. Pour résoudre ce problème, le test de Jonckheere-Terpstra (JT) a été employé en outre. Ce test a fourni des informations sur la question de savoir si les médianes des groupes ont augmenté ou diminué dans l'ordre spécifié par la variable de codage (groupage), en particulier de l'effet positif important à l'effet négatif important. En ce qui concerne les méthodes JT, l'AIC a été converti en un z-score. (a) L'AIC à l'échelle pour le composé n'a pas été significativement affecté par le niveau de signification, tel que déterminé par le test de Kruskal-Wallis (H (2) = 2,226, p > 0,05). Il s'agit d'une étude réalisée par la Société européenne de l'énergie et de l'énergie. (b) L'AIC à l'échelle (6) pour le premier constituant n'a pas été significativement affecté par le niveau de signification, tel que déterminé par le test de Kruskal-Wallis (H = 5,427, p > 0,05). Une tendance de médianes ascendantes a été constatée rejetant notre hypothèse de suradaptation, voir la médiane positive pour le premier constituant dans le tableau 7. c) L'AIC à l'échelle pour le deuxième constituant n'a pas été significativement affecté par le niveau de signification, tel que déterminé par le test de Kruskal-Wallis (H (4) = 4,607, p > 0,05). Chariton et charitonidés 294 ActaLinguisticaLithuanicaXC En particulier, la statistique z du test Jonckheere-Terpstra était essentiellement nulle, conformément à la médiane zéro pour le deuxième constituant du tableau 7 (JT = 54, z = 0,041, p > 0,05). En résumant, il peut être déduit que le niveau de signification des coefficients de transparence dans les modèles de Gagné et al. (2019) avec fréquence SUBTLEX-US n'affecte pas l'ampleur de Scaled. les valeurs de l'AIC. Pour assurer la clarté et l'exhaustivité de la présentation de nos résultats de recherche, nous avons incorporé une section dédiée axée sur le résumé des principales conclusions de notre étude. 7. Conclusions clés Chaque section du tableau approfondit des sujets spécifiques, révélant quels modèles sont les plus efficaces. Les tests ANOVA et Kruskal-Wallis/Jonckheere-Terpstra (sections 6.3 et 6.4) ont été appliqués après avoir attribué des coefficients nominaux (ordinaux ou catégoriques) aux coefficients de régression des modèles de Gagné et al (2019). TABLE 11. AIC à l'échelle dans les composés fermés anglais: analyse approfondie des performances du modèle dans les tâches de décision et de dénomination lexicales (Gagné et al. 2019) Subjects Statistics Evaluation Section Catégories de Tests de normalité modèles Descriptifs décision lexicale BLP dénomination de l'ELP ELP décision lexicale NPAR/~ PourcenPourcentage d'équilibre tage d'équilibre 6.1 Temps de réponse ELP ~ source Le task Effets principaux décision lexicale traitement décision lexicale BLP lexicale de la dénomination ELP […]6.2 Straipsniai articles 295 et Exploring Scaled AIC within English Closed Compounds Subjects Statistics Evaluation Section Variables de contrôle ANOVA Fréquence composée Longueur du composé ✓ ~ 6.3 Sémantique NOF/ns Kruskal-WalltransparenComposé is Premier ce de constituant Jonckheere-- Terpstra NOF/ns deuxième constituant NOF/ns 6.4 PAR: données paramétriques | NPAR: données non paramétriques | : meilleurs modèles (AIC inférieur) ~: modèles inférieurs (AIC supérieur) | NOF/ns: aucun essai de suradaptation ou non significatif 8. Débat Des recherches antérieures de Charitonidis (2022, 24) ont démontré que Scaled AIC est une mesure fiable de la bonté de l'ajustement qui peut être utilisée dans la sélection de modèles, peut-être en coopération avec d'autres mesures telles que le test Wald (voir la section 2023) avec référence à Gagné et al. (2019) modèles de régression multiple avec fréquence SUBTLEX-US. Cependant, il est essentiel de reconnaître que la réactivité de la mesure Scaled AIC peut dépendre du contexte et que son utilité doit être évaluée au cas par cas. informationcriteria(seesection2),thefindingsofthisstudysuggestthatin Les distributions des valeurs d'AIC à l'échelle, ainsi que les combinaisons de différentes addresstheresearchquestionssetupinsection4. sources de temps de réponse et de tâches de traitement, suggèrent que l'AIC à l'échelle identifie efficacement la présence ou l'absence de facteurs sous-jacents bien définis dans la conception expérimentale et la modélisation statistique. La fréquence composée était sans exception un prédicteur négatif de l'AIC à l'échelle, indiquant toujours un effet important. Chariton et charitonidés 296 Acta Linguistica Lithuanica XC corrélations positives significatives avec la longueur composée prédisant des valeurs d'AIC à l'échelle plus élevées (=inférieures). La positivité et le niveau de signification des coefficients de transparence dans les modèles de Gagné et al. (2019) n'ont pas affecté l'ampleur de l'AIC à l'échelle. En faisant référence à des sections spécifiques des analyses, les principales conclusions de cette étude peuvent être résumées comme suit: Dans la section 6.1, notre analyse s'est concentrée sur la comparaison entre les valeurs d'échelle à travers diverses catégories de modèles. Même après avoir tenté les transformations "logarithme naturel" et "racine carrée" sur les valeurs absolues, l'échantillon global d'échelle n'était pas conforme à une distribution normale. Dans la section 6.2, nous nous sommes concentrés sur l'examen de la relation entre l'AIC à l'échelle et (a) les sources des temps de réponse et (b) la performance des tâches.Il est intéressant de noter que les plages de valeurs de l'AIC à l'échelle pour les modèles de décision lexicale ELP et BLP ne se chevauchent pas, ce qui indique leur distinctivité.Les résultats des tests ont révélé des effets principaux significatifs de la source de temps de réponse et de la performance des tâches sur l'AIC à l'échelle. Dans la section 6.3, notre exploration s'est penchée sur la relation entre l'AIC à l'échelle et les variables de contrôle "fréquence composée" et "longueur composée". La fréquence composée a été exclue de l'analyse parce qu'elle était parfaitement collinéaire avec l'AIC à l'échelle. D'autre part, un déclin des valeurs de la longueur composée a été observé lorsque la longueur composée est devenue un facteur pertinent dans les modèles. Concomitantly,compoundlengthwasmostrelevantforthenamingtask. Dans la section 6.4, nous nous sommes concentrés sur la relation entre l'AIC à l'échelle et le andsemantictransparency.Theresearchquestionwaswhetherthepositivity niveau de signification des coefficients de transparence dans les modèles de Gagné et al. (2019) qui ont eu un impact sur l'AIC à l'échelle. En conclusion, l'exploration de différents paramètres utilisant l'AIC à l'échelle comme variable dépendante a éclairé les différentes façons dont les catégories de modèles, la source du temps de réponse, les tâches de Les articles 297 et 297 de la loi Exploring Scaled AIC within English Closed Compounds accordingtotheLADECdatasetalone.Whileweobservedatrendofincreasing (=inferior)ScaledAICvaluesforaclusterofsignificantnegativecoefficientsat traitement, les variables de contrôle et la transparence sémantique affectent la qualité de l'ajustement des modèles. REFERENCES Akaike Hirotugu 1973:InformationTheoryandanExtensionoftheMaximum Likelihood Principle. – Second International Symposium on Information Theory, eds. B.F.Csaki,B.N.Petrov,Budapest:AcademiaiKiado,267–281. AldrichJohnR.1997:R.A.FisherandtheMakingofMaximumLikelihood1912– 1922.–Statistical Science12(3),162–176. Baayen Harald R., Piepenbrock Richard, Gulikers Leon 1995: The CELEX Lexical Database(Dataset,Release2,CD-ROM),LinguisticDataConsortium, UniversityofPennsylvania.Availableat:https://catalog.ldc.upenn.edu. Balota David A., Yap Melvin J., Cortese Michael J., Hutchison KeithI.,KesslerBrett,LoftisBjorn,NeelyJamesH.,NelsonDouglas L.,SimpsonGregB.,TreimanRebecca2007:TheEnglishLexiconProject.– Behavior Research Methods39,445–459. Brysbaert Marc, New Boris 2009: Moving Beyond Kučera and Francis: A CriticalEvaluationofCurrentWordFrequencyNormsandtheIntroductionofaNew andImprovedWordFrequencyMeasureforAmericanEnglish.–Behavior Research Methods41,977–990.DOI:doi.org/10.3758/BRM.41.4.977. BurnhamKennethP.,AndersonDavidR.2002:Model Selection and Multimodal Inference: A Practical Information-Theoretic Approach, 2ndedition,NewYork:Springer. DOI:dx.doi.org/10.1007/b97636. Charitonidis Chariton 2022:ContextConcretenessfortheSecondConstituent SlowsDownCompound-WordProcessing.–Lexis20.DOI:doi.org/10.4000/lexis.6769.