scieee AI-readable full text Open interactive document viewer

Exploring Scaled AIC within English closed compounds

Chariton Charitonidis

Abstract

The Akaike Information Criterion (AIC) is an established goodness-of-fit measure for selecting models in the analysis of empirical data. However, AIC is sensitive to sample size. Author’s previous research has shown that Scaled AIC, i.e. AIC divided by sample size, is an effective tool for assessing model fit and hierarchizing regression models. The present study explores further properties of this variable. The object of investigation are 66 multiple regression models referring to the processing of closed (concatenated) English compounds taken from Gagné et al.’s (2019) Large Database of English Compounds (LADEC). In particular, Scaled AIC is juxtaposed to the English Lexicon Project (ELP) and British Lexicon Project (BLP) as sources of response times, the lexical decision and naming tasks, compound length, and transparency norms. One-way ANOVA, main effects analysis, and non-parametric tests are used as methods. The findings suggest that Scaled AIC is responsive to experimental design, the source of response times, and the lexical decision and naming tasks. At the same time, the results of this study offer empirical support for the validation of methods employed by Gagné et al. (2019).

Full text

CHARITON CHARITONIDIS Независимый исследователь ORCID id: orcid.org/0000-0003-0298-2629 Области исследований: словообразование, многословные выражения, лексическая семантика, распознавание слов, эмоции. DOI: doi.org/10.35321/all90-11 ИССЛЕДОВАНИЕ МАСШТАБИРОВАННОГО AIC В АНГЛИЙСКИХ ЗАКРЫТЫХ СЛОЖНЫХ СЛОВАХ Исследование масштабированного AIC в английских закрытых сложных словах АННОТАЦИЯ Информационный критерий Акаике (AIC) является общепризнанным показателем качества подгонки, используемым для выбора моделей при анализе эмпирических данных. Однако AIC чувствителен к размеру выборки. Предыдущие исследования автора показали, что масштабированный AIC, то есть AIC, делённый на размер выборки, является эффективным инструментом оценки качества подгонки модели и иерархизации регрессионных моделей. В настоящем исследовании дополнительно изучаются свойства этой переменной. Объектом исследования являются 66 моделей множественной регрессии, относящихся к обработке английских закрытых (конкатенированных) сложных слов, взятых из Большой базы данных английских сложных слов (LADEC) Gagné и др. (2019). В частности, масштабированный AIC сопоставляется с English Lexicon Project (ELP) и British Lexicon Project (BLP) как источниками времени реакции, заданиями на лексическое решение и называние, длиной сложного слова и нормами прозрачности. В качестве методов используются однофакторный ANOVA, анализ главных эффектов и непараметрические тесты. Результаты показывают, что масштабированный AIC реагирует на экспериментальный дизайн, источник времени реакции, а также задания на лексическое решение и называние. В то же время результаты настоящего исследования обеспечивают эмпирическую поддержку валидации методов, применённых Gagné и др. (2019). КЛЮЧЕВЫЕ СЛОВА: английские сложные слова, масштабированный AIC, лексическое решение, называние. АННОТАЦИЯ Информационный критерий Акаике (англ. AIC) является общепризнанным показателем качества подгонки моделей, применяемым при анализе эмпирических данных. Однако AIC чувствителен к размеру выборки. Предыдущие Straipsniai / Articles 273 CHARITON CHARITONIDIS автора показали, что масштабированный AIC, делённый на размер выборки, является эффективным инструментом оценки качества подгонки модели и иерархизации регрессионных моделей. В настоящем исследовании рассматриваются дальнейшие свойства этой переменной. Объект исследования — 66 моделей множественной регрессии, связанных с обработкой английских закрытых (сложных) слов, взятых из Большой базы данных английских сложных слов (англ. LADEC) Gagné и др. (2019). Прежде всего AIC сопоставляется с English Lexicon Project (англ. ELP) и British Lexicon Project (англ. BLP) как источниками времени реакции, заданий на лексическое решение и называние, длины сложных слов и норм прозрачности. Используемые методы — однофакторный ANOVA (англ. Analysis of variance), анализ главных результатов и непараметрические тесты. Выводы показывают, что масштабированный AIC реагирует на экспериментальный дизайн, источник времени реакции, а также задания на лексическое решение и называние. В то же время результаты настоящего исследования обеспечивают эмпирическое основание для подтверждения методов, применённых Gagné и др. (2019). КЛЮЧЕВЫЕ СЛОВА: английские сложные слова (сложные слова), масштабированный AIC, лексическое решение, называние. 1. БОЛЬШАЯ БАЗА ДАННЫХ АНГЛИЙСКИХ СЛОЖНЫХ СЛОВ (LADEC: GAGNÉ И ДР. 2019)¹ Большая база данных английских сложных слов (LADEC: Gagné и др. 2019) является крупнейшей существующей базой данных сложных слов. Она содержит более 8000 слитно пишущихся («закрытых» или «конкатенированных») сложных слов (= существительных), отобранных из различных источников, включая, среди прочего, базу данных CELEX (Baayen и др. 1995), English Lexicon Project (ELP; Balota и др. 2007), British Lexicon Project (BLP; Keuleers и др. 2012), British National Corpus (BNC) и Wordnet. Из полного набора записей LADEC 7,804 сложных слова могут быть однозначно расчленены на два свободных морфемных компонента.² Рассматривается огромное разнообразие сложных слов, например сложные слова типа «существительное—существительное», напр. buttercup, shipyard, сложные слова со вторым компонентом, образованным от глагольной основы, напр. pacemaker, painkiller и т. д. (определения классов сложных слов см. Lieber 2004: 46). Первый неядерный компонент охватывает широкий спектр грамматических категорий. На рисунке 1 приведена небольшая выборка записей LADEC. Модели множественной регрессии Gagné и др. (2019) включают широкий спектр предикторов (= независимых переменных), таких как длина сложного слова, частота биграмм ¹ Этот раздел заимствован из работы Chariton Charitonidis (2022) с небольшими изменениями. ² LADEC включает формы множественного числа уже перечисленных сложных слов в качестве отдельных записей. 274 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds на границе морфемы, размер словообразовательного семейства, частота слов, меры вероятности и ассоциации (на основе векторов), эмоциональные/оценочные нормы, рассчитанные по оценкам участников, и т. д. Логарифмические времена реакции для сложных слов из ELP (лексическое решение, называние) и BLP (лексическое решение) используются в качестве зависимых переменных. В основном длина сложного слова (количество символов) и логарифм частоты сложного слова (= слова) из корпуса SUBTLEX-US (Brysbaert, New 2009)³ и BNC (BLP) используются в качестве контрольных переменных. В моделях Gagné и др. (2019) упомянутые выше предикторы оказывали значимое влияние на время лексического решения и называния. РИСУНОК 1. Записи LADEC: пример Основное внимание в исследовании Gagné и др. (2019) уделялось различным мерам семантической прозрачности. Gagné и др. (2019) просили участников оценить сложные слова с учётом того, насколько предсказуемо значение сложного слова по его частям (оценки предсказуемости значения, основанные на сложных словах) и насколько сохраняется в сложном слове значение каждого из компонентов (оценки сохранения значения, основанные на компонентах). Авторы обнаружили, что распределение прозрачности для второго компонента было значительно более пиковым и высоким, чем распределение прозрачности для первого компонента (MC1: 64.80 [SD: 19.59] против MC2: 71.00 [SD: 16.46]. N = 8115). Однако оценка для ³ Корпус SUBTLEX–US представляет собой корпус объёмом 51 миллион токенов, основанный на субтитрах американских фильмов и телевизионных программ. Несколько недавних исследований предоставили свидетельства того, что частотные нормы, полученные из субтитров к фильмам и телевизионным программам, как правило, эффективнее норм, полученных из печатных текстов, когда речь идёт об объяснении различий во времени лексической обработки и, в некоторых случаях, точности у носителей различных языков (см. Chen и др. 2018: 2 и приведённые там ссылки). Straipsniai / Articles 275 CHARITON CHARITONIDIS первого компонента сильнее коррелировала с оценкой всего сложного слова, чем оценка второго компонента (c1~cmp: r = 0.75, p <.001 против c2~cmp: r = 0.66, p <.001. N = 429).⁴ Наиболее примечательно, что оценка сохранения значения первого компонента и оценка предсказуемости значения сложного слова предсказывали все три типа времени реакции, то есть время лексического решения в ELP, время лексического решения в BLP и время называния в ELP. В заключение следует отметить, что более пиковое и высокое распределение прозрачности второго компонента и более тесная связь первого компонента с предсказуемостью значения сложного слова, по-видимому, непосредственно отображаются в операциях над ядром английских сложных слов. Второй компонент, то есть ядро, представляет собой единицу, прозрачность которой категориально и семантически повышена (что касается семантического аспекта, см. отношения следования и гипонимии). Первый компонент, то есть модификатор, является наиболее важным фактором при установлении референции сложного слова. В результате его прозрачность сильнее всего ковариирует с прозрачностью сложного слова.⁵ 2. ИНФОРМАЦИОННЫЙ КРИТЕРИЙ AKAIKE (AIC) В 1973 году Hirotugu Akaike разработал метод оценки относительного математического ожидания расстояния Кульбака—Лейблера (Kullback 1959) с использованием максимизированного логарифма правдоподобия Fisher (Fisher 1922; см. также Aldrich 1997). Этот показатель, обычно называемый информационным критерием Акаике (AIC; Akaike 1973), предложил новую концепцию выбора моделей при анализе эмпирических данных, ознаменовав существенный сдвиг парадигмы (Burnham, Anderson 2002). AIC обычно рассчитывается следующим образом: −2lnL + 2k, где «lnL» обозначает максимизированный/полный логарифм правдоподобия модели, а «k» — число параметров, включая константу. Меньший набор предикторов обычно связан с более эффективными моделями (моделями с меньшей потерей информации). Чем ниже (= более отрицательно) значение AIC, тем лучше подгонка модели. В этом контексте AIC как показатель качества подгонки штрафует использование большого числа предикторов, которые потенциально приводят к более высоким значениям AIC (см. часть «+2k» уравнения AIC). ⁴ z-тест Steiger (1980) показал, что это различие было значимым: z = 27.71, p <.0001 (Gagné и др. 2019). ⁵ Ссылаясь на предыдущие исследования, Gagné и др. (2019) сообщают, что «модификатор (первый компонент в английском языке), как правило, играет более значительную роль в выборе простоты установления связи при обработке сложных слов и именных групп». 276 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds AIC чувствителен к размеру выборки. AICc, скорректированная версия AIC, учитывает размер выборки по формуле 2k (k + 1)/ (n − k − 1). Однако он предназначен именно для малых размеров выборки и не рекомендуется для моделей, основанных на больших выборках, таких как выборка Gagné и др. (2019).⁶ Следует отметить, что такие исследователи, как Kenneth P. Burnham & David R. Anderson (2002), не предлагают однозначного решения для сравнения значений AIC моделей, построенных как на разных, так и на больших выборках.⁷ В частности, Burnham & Anderson (2002: 80–85, 334–335) дают всестороннее обсуждение последствий неравных размеров выборки для сравнения моделей. Они утверждают, что использование информационных критериев для сравнения моделей с разными размерами выборки может приводить к вводящим в заблуждение результатам. Аналогично, как отмечает Svetunkov в онлайн-обсуждении 2016 года (см. ссылку после библиографии), все информационные критерии основаны на функции правдоподобия, которая, в свою очередь, зависит от размера выборки. В частности, с увеличением размера выборки правдоподобие уменьшается. Следовательно, в таких случаях информационные критерии также будут возрастать.⁸ 3. ПРЕДЫДУЩИЕ ИССЛЕДОВАНИЯ В Charitonidis (2022) значения AIC для 44 моделей множественной регрессии с различными сочетаниями эмоциональных переменных (валентность, возбуждение и конкретность для (a) слов и (b) контекстов слов) были разделены на размер выборки (N), чтобы получить значения масштабированного AIC (AIC/N). Затем эти значения использовались для оценки ⁶ Для получения дополнительной информации об AICc читателю следует обратиться к Burnham & Anderson (2002: 374–380). ⁷ Одно из решений, предложенных Burnham & Anderson (2002), заключается в преобразовании значений AIC в «веса Akaike», которые определяются как «относительная правдоподобность модели при данных данных» (Burnham, Anderson 2002: xiii; см. также Wagenmakers, Farrell 2004). ⁸ Доступно по адресу: https://stats.stackexchange.com/questions/94718/model-comparison-with-aic-based-on-different-sample-size [дата обращения: 16.06.2023]. Читатель может понять утверждение Svetunkov, подставляя различные значения компонента «lnL» в уравнение AIC, сохраняя компонент «2k» постоянным. Уменьшение значения lnL приведёт к более высокому, то есть худшему, значению AIC. ⁹ В литературе масштабированный AIC также называют «средним AIC». Согласно Svetunkov (личное сообщение), практика деления информационного критерия Акаике на размер выборки не является новой. Например, Hastie и др. (2009: 230–231) определяют AIC неканоническим образом, используя N в качестве знаменателя формулы. Хотя это отклонение от традиционной формулы AIC не лишено критики, такой подход остаётся распространённым, что подтверждается, например, его включением в статистический пакет Stata. Например, Stata сообщает «AIC, делённый на N» в выводе модели, как показывают различные примеры, доступные в интернете (выражаем благодарность I. Svetunkov за предоставление этой информации). Straipsniai / Articles 277 CHARITON CHARITONIDIS и сравнения качества подгонки моделей. Включение ключевых предикторов в глобальные, то есть общие, модели показало, что времена лексического решения BLP требовали лучшего качества подгонки, чем времена лексического решения ELP. Подгонка моделей называния ELP находилась в диапазоне значений, наблюдавшихся для моделей лексического решения ELP и BLP. Наиболее примечательно, что конкретность контекста для второго компонента выступала значимым предиктором во всех моделях с частотой SUBTLEX-US — как для лексического решения, так и для называния. В Charitonidis (2024) все значимые коэффициенты из глобальных моделей с частотой SUBTLEX-US были сопоставлены с переменной гипонимии (Gagné и др. 2020). Было установлено, что модели, включавшие как гипонимию, так и конкретность контекста для второго компонента, всегда характеризовались самым низким (= лучшим) значением масштабированного AIC по сравнению с вложенными, то есть сокращёнными, моделями, в которых отсутствовала одна из этих двух переменных. Последующие применённые тесты Wald показали, что вложенные модели всегда были связаны со значимым снижением (= ухудшением) коэффициента детерминации (R2). В таблицах 1 и 2 соответственно представлены значения масштабированного AIC и результаты соответствующих тестов Wald. ТАБЛИЦА 1. Значения масштабированного AIC для вложенных моделей, исключающих гипонимию («Модель 2») или конкретность контекста для второго компонента («Модель 3») из полных моделей («Модель 1») для прогнозирования времени лексического решения в English Lexicon Project (ELP) (LD), времени лексического решения в British Lexicon Project (BLP) и времени называния в ELP Модель | Масштабированный AIC | AIC | N ELP LD 1 | −3.36281ᵃ | −3557.85 | 1058 2 | −3.30375 | −4169.334 | 1262 3 | −3.34845 | −3700.038 | 1105 BLP LD 1 | −3.79552ᵃ | −2903.574 | 765 2 | −3.76618 | −3920.592 | 1041 3 | −3.76718 | −2987.37 | 793 ELP naming 1 | −3.58686ᵇ | −7396.108 | 2062 2 | −3.54304 | −8418.27 | 2376 3 | −3.58379 | −7389.784 | 2062 278 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds a. Предикторы: (Константа), оценка гипонимии, длина сложного слова, частота SUBTLEX–US, валентность репрезентации (cmp), конкретность контекста (c2) b. Предикторы: (Константа), оценка гипонимии, длина сложного слова, частота SUBTLEX–US, валентность контекста (cmp), возбуждение контекста (c1), возбуждение контекста (c2), конкретность контекста (c2) ТАБЛИЦА 2. Тесты Wald для вложенных моделей, исключающих гипонимию («Модель 2») или конкретность контекста для второго компонента («Модель 3») из полных моделей («Модель 1») для прогнозирования времени лексического решения в English Lexicon Project (ELP) (LD), времени лексического решения в British Lexicon Project (BLP) и времени называния в ELP Модель | R2 square | F change | df1 | df2 | p ELP LD 1 |.184a | 47.506 | 5 | 1052 |.000 2 | −.004 | 4.562 | 1 | 1052 |.033 3 | −.010 | 13.175 | 1 | 1052 |.000 BLP LD 1 |.211a | 40.479 | 5 | 759 |.000 2 | −.013 | 12.091 | 1 | 759 |.001 3 | −.015 | 14.007 | 1 | 759 |.000 ELP naming 1 |.288b | 118.711 | 7 | 2054 |.000 2 | −.003 | 8.286 | 1 | 2054 |.004 3 | −.003 | 8.309 | 1 | 2054 |.004 a. Предикторы: (Константа), оценка гипонимии, длина сложного слова, частота SUBTLEX–US, валентность репрезентации (cmp), конкретность контекста (c2) b. Предикторы: (Константа), оценка гипонимии, длина сложного слова, частота SUBTLEX–US, валентность контекста (cmp), возбуждение контекста (c1), возбуждение контекста (c2), конкретность контекста (c2) В заключение следует отметить, что две различные меры размера эффекта, а именно масштабированный AIC и R2, одинаково иерархизировали одни и те же регрессионные модели, демонстрируя при этом одинаковое предпочтение лучшей модели. Таким образом, имеются веские основания считать, что показатель масштабированного AIC является качественным инструментом оценки качества подгонки модели. Straipsniai / Articles 279 CHARITON CHARITONIDIS 4. НАСТОЯЩЕЕ ИССЛЕДОВАНИЕ Настоящее исследование опирается на предыдущие исследования автора, представленные в разделе 3. Объектами исследования являются 66 моделей лексического решения и называния для английских закрытых (конкатенированных) сложных слов, построенных Gagné и др. (2019). Все модели включают частоту SUBTLEX-US в качестве контрольной переменной. Наши цели двояки и реализуются параллельно. Во-первых, мы оцениваем характеристики моделей Gagné и др. (там же). Во-вторых, мы изучаем существенные свойства показателя масштабированного AIC. Исследовательские вопросы таковы: 1. Чувствителен ли масштабированный AIC к структуре модели у Gagné и др. (2019)? Каким группам моделей отдаётся предпочтение? 2. Каково влияние контрольных переменных «частота сложного слова» и «длина сложного слова» на масштабированный AIC? Как морфологическая прозрачность связана с масштабированным AIC? Наше исследование организовано следующим образом: в разделе 5 представлен обзор методов. В разделе 6.1 приведена описательная статистика масштабированного AIC для рассматриваемых моделей. Особое внимание уделяется параметрическим и непараметрическим характеристикам категорий моделей. В разделе 6.2 исследуется связь между источником времени реакции и задачами лексической обработки. В разделе 6.3 масштабированный AIC сопоставляется с контрольными переменными «частота сложного слова» и «длина сложного слова». В разделе 6.4 уровни значимости коэффициентов прозрачности из моделей Gagné и др. (2019) соотносятся со значениями масштабированного AIC. Основные результаты обобщаются в разделе 7, после чего в разделе 8 обсуждаются результаты. 5. МЕТОДЫ Нашим общим методом был сравнительный анализ основных параметров и характеристик моделей Gagné и др. (2019) с использованием масштабированного AIC в качестве зависимой переменной. Независимые переменные включали характеристики выборки (например, источник времени реакции и задачи лексической обработки), дизайн исследования (например, контрольные переменные) и уровень значимости коэффициентов прозрачности, среди прочих факторов. Использованные конкретные статистические методы были следующими: (a) описательная статистика средних значений и медиан наряду с применением теста Шапиро—Уилка для оценки центральной тенденции, вариативности и распределения масштабированного AIC в различных категориях и группах моделей (разделы 6.1 и 6.2), (b) анализы главных эффектов, проведённые для источника времени реакции (ELP/BLP) и задач лексической обработки (лексическое решение/называние) (раздел 280 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds 6.2), (c) отдельные ANOVA, проведённые для источника времени реакции и задач лексической обработки с включением длины сложного слова в качестве ковариаты (раздел 6.3), и (d) применение тестов Краскела—Уоллиса и Джонкхира—Терпстры для изучения различий между рангами порядково перекодированных коэффициентов семантической прозрачности (раздел 6.4). Дополнительную информацию о методах читатель найдёт в анализах, представленных в разделах 6.1–6.4. 6. АНАЛИЗЫ 6.1. Масштабированный AIC и категории моделей 66 значений AIC из моделей множественной регрессии Gagné и др. (2019) с частотой SUBTLEX–US в качестве контрольной переменной были разделены на размер выборки каждой модели, в результате чего был получен набор из 66 значений масштабированного AIC. В таблице 3 ниже приведена описательная статистика масштабированного AIC, а на рисунке 2 показан соответствующий диаграмма размаха для упорядоченного набора значений.10 В выборке не было выбросов. Значения асимметрии (Sk) и эксцесса (Ku) были приемлемыми.11 Среднее значение масштабированного AIC составляло −3.50030. Стандартное отклонение равнялось 0.19052, то есть наблюдения были относительно тесно сгруппированы вокруг среднего. Минимальное и максимальное значения составляли соответственно −3.85502 и −3.15754. Медианное значение равнялось −3.55732, то есть было немного ниже среднего значения.12 Средние 50% данных находились в диапазоне от −3.66575 (первый квартиль, Q1) до −3.30959 (третий квартиль, Q3). Соответственно, межквартильный размах (IQR) составлял 0.35616. 10 Нижняя, или первая квартильная, линия рамки (Q1) обозначает границу, ниже которой располагаются нижние 25% данных. Аналогично, верхняя, или третья квартильная, линия рамки (Q3) обозначает границу, выше которой располагаются верхние 25% данных. Заштрихованная область показывает границы средних 50% данных, или межквартильного размаха (IQR), который можно вычислить, вычитая первый квартиль из третьего квартиля (Q3−Q1). Горизонтальная линия внутри рамки показывает медиану, или средний квартиль (Q2), то есть значение, находящееся в середине набора данных. 11 В среде SPSS значения асимметрии от −1 до +1 и значения эксцесса от −2 до +2 обычно считаются приемлемыми для оценки нормального распределения. Однако следует отметить, что одни лишь асимметрия и эксцесс не дают окончательного доказательства нормальности (см. также обсуждение https://www.researchgate.net/post/What_is_the_acceptable_range_of_skewness_and_kurtosis_for_normal_distribution_of_data). 12 В соответствии с этой закономерностью в данных наблюдалась небольшая положительная асимметрия (0.494). Straipsniai / Articles 281 CHARITON CHARITONIDIS ТАБЛИЦА 3. Описательная статистика масштабированного AIC (полный набор) Среднее SD Мин. Макс. −3.50030 0.19052 −3.85502 −3.15754 Медиана IQR Q1 Q3 −3.55732 0.35616 −3.66575 −3.30959 N=66. Sk=0.494, Ku=−1.101 РИСУНОК 2. Распределение масштабированного AIC (полный набор): диаграмма размаха Ожидалось, что полный набор значений масштабированного AIC не будет демонстрировать нормальное распределение, поскольку он охватывал различные задачи (лексическое решение, называние) и был получен из разных источников времени реакции (ELP, BLP). Тест Шапиро—Уилка и тест Колмогорова—Смирнова подтвердили наши предположения.13 В частности, статистика теста Шапиро—Уилка составила W (66) = 0.90, p <.001, а статистика теста Колмогорова—Смирнова — D (66) = 0.17, p <.001. Следует отметить, что тот же полный набор не демонстрировал нормального распределения даже после применения натурального логарифма и преобразований квадратного корня к абсолютным значениям. В таблице 4 ниже приведена описательная статистика масштабированного AIC применительно к основным категориям моделей у Gagné и др. (2019), то есть к лексическому решению ELP, лексическому решению BLP и называнию ELP (каждая группа содержит 22 модели). На рисунке 3 представлены соответствующие диаграммы размаха. Как видно, средние значения и медианы 13 В тесте Колмогорова—Смирнова применялась поправка на значимость Lilliefors. 282 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds для лексического решения BLP и называния ELP относились к сходным значениям масштабированного AIC. Лексическое решение ELP относилось к более высоким (= худшим) значениям, которые, кроме того, были непересекающимися со значениями лексического решения BLP.14 В итоге лексическое решение BLP и называние ELP всегда требовали лучших моделей, чем лексическое решение ELP. ТАБЛИЦА 4. Описательная статистика масштабированного AIC по основным категориям моделей Ожидалось, что непараметрический профиль полного набора значений масштабированного AIC будет менее вероятен внутри основных категорий моделей, то есть основных сочетаний источников времени реакции и задач. Как станет очевидно, это ожидание подтвердилось. Тест Шапиро—Уилка показал, что данные лексического решения ELP значительно отклонялись от нормальности. В частности, рассчитанная статистика теста составила W (22) = 0.90, p <.05.15 Данные лексического решения BLP имели нормальное распределение. Соответствующие статистические показатели составили W (22) = 0.92, p >.05 (тест Шапиро—Уилка). 14 t-тест сводных данных лексического решения ELP и лексического решения BLP (таблица 4) указал на высокозначимое различие между средними значениями выборок: t = 18.296, p <.0001. 15 Следует отметить, что шесть моделей лексического решения ELP относились к значениям Scaled AIC, близким к максимальному значению −3.15754, что указывает на наихудшее соответствие во всём наборе данных. Эти модели сформировали заметный пик в сторону верхнего края распределения (от −3.17304 до −3.15754), в результате чего распределение приобрело почти бимодальную форму. Это наблюдение подтверждается относительно высоким отрицательным значением эксцесса −1.444. Straipsniai / Articles 283 CHARITON CHARITONIDIS РИСУНОК 3. Представление Scaled AIC в виде диаграмм размаха по основным категориям моделей Аналогично, данные ELP по называнию имели нормальное распределение. Соответствующие статистические показатели: W (22) = 0.93, p >.05 (критерий Shapiro–Wilk). Итак, как полный набор моделей, так и модели лексического решения ELP характеризовались непараметрическим распределением Scaled AIC. С другой стороны, данные BLP по лексическому решению и данные ELP по называнию имели нормальное распределение. Теперь попробуем выявить влияние отдельных факторов на Scaled AIC. 6.2. Scaled AIC и источник времени реакции и задания В таблице 5 ниже приведена описательная статистика значений Scaled AIC для групп, классифицированных по основным факторам «время реакции» и «задания», то есть (a) время реакции ELP, (b) время реакции BLP, (c) задание на называние и (d) задание на лексическое решение. Время реакции ELP и задание на лексическое решение 284 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds представляют собой обобщённые группы, относящиеся соответственно к «лексическому решению и называнию» и «ELP и BLP». Группы «BLP» и «Называние» идентичны категориям моделей «лексическое решение BLP» и «называние ELP» соответственно, которые уже были представлены в таблице 4 (раздел 6.1). На рисунке 4 показаны соответствующие диаграммы размаха. Как видно из таблицы 5, обе группы — «BLP» и «Называние» — характеризовались (a) более низкими (= лучшими) средними и медианными значениями Scaled AIC и (b) меньшими значениями стандартного отклонения (SD) и межквартильного размаха (IQR) по сравнению с обобщёнными группами «время реакции ELP» и «лексическое решение».16 Те же обобщённые группы имеют относительно высокие значения эксцесса, то есть соответственно −1.403 и −1.616 (на гистограммах этих групп, которые здесь не приводятся, появились два отчётливых пика, подобно бимодальному распределению значений). Эти закономерности показывают, что показатель Scaled AIC был специфически связан с чётко определёнными экспериментальными категориями «лексическое решение BLP» (см. группу «BLP») и «называние ELP» (см. группу «Называние»). ТАБЛИЦА 5. Описательная статистика Scaled AIC для групп, классифицированных по «времени реакции» и «заданиям» Времена реакции Задания ELP BLP Называние Лексическое решение Среднее −3.43917 −3.62255 −3.62495 −3.43797 SD 0.20286 0.06778 0.08710 0.19808 Мин. −3.85502 −3.75547 −3.85502 −3.75547 Макс. −3.15754 −3.52945 −3.50150 −3.15754 Медиана −3.42626 −3.62174 −3.61886 −3.44024 IQR 0.35152 0.13704 0.13758 0.36196 Q1 −3.62127 −3.68840 −3.69419 −3.63171 Q3 −3.26975 −3.55136 −3.55662 −3.26975 Sk −0.126 −0.097 −0.559 −0.006 Ku −1.403 −1.244 0.725 −1.616 44 22 22 44 16 Более низкие средние и медианные значения в сочетании с меньшими значениями стандартного отклонения и межквартильного размаха указывают на большую надёжность и меньшую подверженность выбросам или экстремальным значениям. Straipsniai / Articles 285 CHARITON CHARITONIDIS РИСУНОК 4. Представление Scaled AIC в виде диаграмм размаха для групп, классифицированных по «времени реакции» и «заданиям» Как и в случае полного набора значений Scaled AIC, рассмотренного в разделе 6.1, ожидалось, что для обобщённых групп «ELP» и «лексическое решение», не ограниченных конкретными экспериментами, будет наблюдаться непараметрический профиль. Проверки нормальности подтвердили наши ожидания. Согласно критерию Shapiro–Wilk, данные Scaled AIC для группы ELP значительно отклонялись от нормальности. Рассчитанное значение статистики критерия составило W (44) = 0.91, p <.01. Аналогично, данные Scaled AIC для группы лексического решения значительно отклонялись от нормальности. Рассчитанное значение статистики критерия составило W (44) = 0.89, p <.001. Теперь перейдём к анализу основных эффектов. Главная цель заключалась в установлении того, продолжают ли группы «лексическое решение BLP» и «называние ELP» предсказывать лучшие модели при контроле эффектов каждой из групп. В последующих статистических тестах группам, классифицированным по основным факторам «время реакции» и «задания», были присвоены номинальные значения. Среднее Scaled AIC для группы BLP, то есть −3.623, использовалось в качестве референсной ячейки или свободного члена. Результаты показали, что и время реакции, и задания оказывали основной эффект на Scaled AIC, но взаимодействие отсутствовало. В частности, наблюдался значимый основной эффект времени реакции: F (1, 63) = 271.87, p <.001. В терминах регрессии коэффициент для ELP предсказывал более высокое, то есть худшее, значение Scaled AIC: b = 0.37, SE = 0.02, t = 16.49, p <.001. Кроме того, наблюдался значимый основной эффект заданий: F (1, 63) = 275.42, p <.001. В терминах регрессии коэффициент для называния предсказывал более низкое, то есть лучшее, значение Scaled AIC: b = −0.37, SE = 0.02, t = −16.60, p <.001. На рисунке 5 представлен обзор основных эффектов с помощью точечного графика с линиями. Свободный член или референсная ячейка соответствует одновременно самому низкому значению для называния ELP и самому высокому значению для лексического решения BLP, то есть −3.623. Линии расположены одна над другой 286 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds вертикально, поскольку диапазоны значений Scaled AIC для лексического решения ELP и лексического решения BLP не пересекались (см. таблицу 4). Кроме того, линии параллельны, поскольку отсутствие группы «называние BLP» среди заданий исключало эффекты взаимодействия. В итоге время реакции BLP и задание на называние устойчиво предсказывали лучшие значения Scaled AIC даже после взаимного контроля соответствующих факторов. Эти результаты повышают точность и эффективность соответствующих моделей. РИСУНОК 5. График основных эффектов для Scaled AIC Следует отметить, что анализ основных эффектов, представленный в этом разделе, в большей степени применим к источнику времени реакции, чем к выполнению заданий, поскольку, как уже упоминалось, комбинация «называние BLP» отсутствовала. Это обстоятельство может ограничивать обобщаемость результатов за пределами конкретных выборок. 6.3. Scaled AIC и контрольные переменные В этом разделе основное внимание будет уделено контрольным переменным — длине сложного слова (в символах) и частотности SUBTLEX-US, то есть логарифму частотности сложных слов, полученному из корпуса SUBTLEX-US (Brysbaert, New 2009). Обе переменные широко использовались в регрессионных моделях Gagné et al. (2019). Straipsniai / Articles 287 CHARITON CHARITONIDIS Чтобы выявить влияние длины сложного слова и его частотности на Scaled AIC, соответствующие регрессионные коэффициенты были перекодированы в порядковые значения согласно их знаку и уровню значимости; см. таблицу 6. Уровни значимости были сопоставлены с порядковыми шкалами, поскольку они представляли собой общепринятые пороговые точки, основанные на точных значениях значимости. ТАБЛИЦА 6. Схема порядкового перекодирования регрессионных коэффициентов Значимость Знак Порядковые значения Описание p <.001 отрицательный −3 сильный отрицательный эффект p <.01 отрицательный −2 умеренный отрицательный эффект p <.05 отрицательный −1 слабый отрицательный эффект p >.05 отрицательный/положительный 0 незначимый эффект p <.05 положительный 1 слабый положительный эффект p <.01 положительный 2 умеренный положительный эффект p <.001 положительный 3 сильный положительный эффект В моделях Gagné et al. (2019) частотность SUBTLEX-US всегда была связана с отрицательными (= сокращающими задержку) коэффициентами и сильным эффектом, p <.001. Поэтому все коэффициенты были перекодированы как −3 — значением, которое находилось в состоянии полной коллинеарности с зависимой переменной Scaled AIC. По этой причине частотность SUBTLEX-US была исключена из настоящего анализа. Что касается длины сложного слова, все значимые регрессионные коэффициенты в моделях Gagné et al. (2019) имели сильный положительный (= вызывающий задержку) эффект, p <.001. В отличие от переменной SUBTLEX-US, встречались несколько незначимых коэффициентов. С учётом этих закономерностей была создана категориальная переменная со значениями «1» для положительного эффекта (= интерференция длины сложного слова) и «0» для отсутствия эффекта (= отсутствие интерференции длины сложного слова). Полученная выборка содержала 39 значений Scaled AIC. Критерий корреляции Pearson между длиной сложного слова и Scaled AIC дал высокозначимый коэффициент корреляции 0.51, p =.001, что указывает на умеренную или сильную корреляцию между двумя переменными. Длина сложного слова была включена в линейную регрессионную модель как единственная независимая переменная. Было установлено, что прогнозируемое среднее Scaled AIC при отсутствии интерференции длины сложного слова составляло 3.611 (= свободный член). Интерференция длины сложного слова приводила к более высокому (= худшему) значению −3.407 (b = 0.204, p =.001). На рисунке 6 ниже показаны эти закономерности. Вкратце, Scaled AIC ухудшается, когда длина сложного слова становится значимой в моделях. 288 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds РИСУНОК 6. Длина сложного слова и Scaled AIC Мы провели отдельные ANOVA для источника времени реакции (ELP/BLP) и выполнения задания (лексическое решение/называние), учитывая длину сложного слова как ковариату. Главная цель заключалась в выявлении различий средних значений, ранее скорректированных с учётом контролируемого влияния длины сложного слова. (a) ANOVA для источника времени реакции. BLP было присвоено значение «0», а ELP — значение «1». Критерий корреляции Pearson выявил сильную коллинеарность между источником времени реакции и длиной сложного слова, r = 1 (N = 39). Наш вывод подтверждают следующие данные: во-первых, группа ELP неизменно демонстрировала значимые положительные корреляции с длиной сложного слова, указывая на сильный эффект. Во-вторых, группа BLP неизменно демонстрировала незначимые корреляции с длиной сложного слова. Следовательно, прогнозируемое среднее Scaled AIC для источника времени реакции было одинаковым при включении и без включения длины сложного слова в анализ (M = 3.407 в обоих случаях). В итоге длина сложного слова не оказывала значимого влияния на Scaled AIC при включении источника времени реакции. (b) ANOVA для выполнения задания. Называнию было присвоено значение «0», а лексическому решению — значение «1». Критерий корреляции Pearson выявил отрицательную корреляцию между заданием и длиной сложного слова, указывающую на умеренный эффект, r = −.5, p =.001 (N = 39). Этот результат показывает, что длина сложного слова более значима для называния, чем для лексического решения. 17 Следует отметить, что 11 из 13 коэффициентов BLP были отрицательными. Straipsniai / Articles 289 CHARITON CHARITONIDIS При рассмотрении задания в качестве основной переменной длина сложного слова была значимым предиктором Scaled AIC: F (1, 145.030), p =.000. Аналогично, при рассмотрении длины сложного слова в качестве основной переменной задание было значимым предиктором Scaled AIC: F (1, 125.30), p =.000. Прогнозируемое среднее Scaled AIC только для задания значимо отличалось от прогнозируемого среднего Scaled AIC при учёте длины сложного слова (соответственно 3.584 и 3.203). Аналогично, прогнозируемое среднее Scaled AIC только для длины сложного слова (3.584) значимо отличалось от прогнозируемого среднего Scaled AIC при учёте задания (−3.23). Итак, с точки зрения корректировки по ковариате, и задание на лексическое решение, и длина сложного слова предсказывали худшие модели. 6.4. Scaled AIC и нормы прозрачности В этом разделе исследуется влияние регрессионных коэффициентов семантической прозрачности в моделях Gagné et al. (2019) на Scaled AIC. Эти регрессионные коэффициенты были закодированы по трём порядковым шкалам, каждая из которых соответствовала одному из трёх морфологических уровней, то есть сложному слову, первому конституенту и второму конституенту. Схему порядкового перекодирования можно найти в таблице 6. В таблице 7 ниже представлены медианы и диапазоны порядково преобразованных коэффициентов прозрачности для всех трёх морфологических уровней. Медианы дают полезную информацию о центральной тенденции и разбросе порядковых значений и могут помочь при планировании анализов, основанных на порядковых переменных. ТАБЛИЦА 7. Порядково преобразованные коэффициенты прозрачности: медианы и диапазоны Медиана Минимум Максимум Сложное слово −3 −3 −1 Первый конституент 2 −3 3 Второй конституент 0 −2 3 N = 18 Как видно, медиана для сложного слова составляла «−3», медиана для первого конституента — «2», а медиана для второго конституента — «0». Эти результаты показывают, что в моделях Gagné et al. (2019) с частотностью SUBTLEX–US прозрачность сложного слова была связана с сильным отрицательным эффектом (более коротким временем реакции), прозрачность первого конституента — с умеренным положительным эффектом (более длительным временем реакции), а прозрачность второго конституента не имела значимого эффекта или 290 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds играла неопределённую роль. Более высокие оценки прозрачности второго конституента, приведённые Gagné et al. (ibid.), указывают на присущий ему уклон в пользу этого конституента, в результате чего общая прозрачность сложного слова зависит от прозрачности первого конституента. В этом контексте положительная медиана для первого конституента, вызывающая увеличение времени реакции, указывает на его опосредующую, возможно устанавливающую референцию, роль в этой связи (см. также раздел 1). Ещё предстоит установить, какие семантические функции достаточно полно представляют, с точки зрения обработки, присущий второму конституенту уклон.18 Теперь рассматривается вопрос о том, влияют ли знак и уровень значимости коэффициентов прозрачности на Scaled AIC. Наш метод прежде всего направлен на выявление эффектов переобучения. Как отмечают Daniel J. Navarro & Jay I. Myung (2005), «сложная модель с большим числом параметров и высоконелинейной формой часто может лучше подогнать данные, чем простая модель с небольшим числом параметров, даже если именно последняя породила данные» (Navarro, Myung 2005: 1240). Соответственно, большое число параметров может улавливать шум или уникальные характеристики доступных данных, но способно препятствовать способности модели обобщаться на новые данные. AIC смягчает проблему переобучения, вводя штраф за включение многочисленных параметров в модель; см. часть «+2k» уравнения AIC в разделе 2. Что касается последующего анализа, предполагается, что модели с более высокими (= худшими) значениями Scaled AIC могут обладать значимыми, систематически выведенными коэффициентами, то есть коэффициентами, релевантными исключительно согласно набору данных LADEC. В этом контексте наша гипотеза предполагает, что в связи между прозрачностью и Scaled AIC может проявиться тенденция, противоположная той, на которую указывают медианы в таблице 7. В частности, более низкие (= лучшие) значения Scaled AIC могут быть связаны с (a) положительными коэффициентами (более длительным временем реакции) для всего сложного слова, (b) отрицательными коэффициентами (более коротким временем реакции) для первого конституента и (c) положительными или отрицательными коэффициентами (соответственно более длительным или более коротким временем реакции) для второго конституента. Следует отметить, что для второго конституента медиана в таблице 7 указывает на отсутствие эффекта. Для ответа на исследовательский вопрос будут использованы две непараметрические меры, то есть критерий Kruskal–Wallis и критерий Jonckheere–Terpstra. Критерий Kruskal–Wallis, также известный как «H-критерий», представляет собой непараметрический тест, основанный на 18 В Charitonidis (2024) утверждается, что и гипонимия, и конкретность контекста для второго конституента являются значимыми семантическими предикторами в лексическом решении и назывании. Представленный там анализ показывает, что включение обоих этих предикторов приводит к улучшению Scaled AIC и R2 по сравнению с моделями, в которых одна из этих переменных отсутствует. Straipsniai / Articles 291 CHARITON CHARITONIDIS распределении хи-квадрат. Он требует, чтобы зависимая переменная была порядковой или непрерывной. Этот критерий предназначен для определения наличия значимых различий между медианами двух или более групп и используется как альтернатива однофакторному ANOVA. В рамках процедуры значения непрерывной зависимой переменной, то есть Scaled AIC, упорядочивались от наименьшего к наибольшему, и им присваивались ранги. Полученные ранги возвращались в группы уровня значимости (независимую переменную), после чего ранги для каждой группы суммировались. Формула расчёта «H» включала, среди прочего, возведение суммы рангов каждой группы в квадрат с последующим делением этого значения на объём выборки. В таблицах 8–10 представлены рассмотренные исходные данные и сумма рангов для каждой группы. 19 20 сумма рангов для каждой группы. ТАБЛИЦА 8. Сложное слово Уровни значимости | N | Сумма рангов Scaled AIC | 1 — слабый отрицательный эффект | 1 | 2 | 2 — умеренный отрицательный эффект | 5 | 46 | 3 — сильный отрицательный эффект | 12 | 123 | Итого | 18 | ТАБЛИЦА 9. Первый конституент Уровни значимости | N | Сумма рангов Scaled AIC | 1 — сильный положительный эффект | 6 | 59 | 2 — умеренный положительный эффект | 4 | 34 | 3 — слабый положительный эффект | 1 | 3 | 4 — отсутствие эффекта | 1 | 2 | 5 — слабый отрицательный эффект | 1 | 10 | 6 — умеренный отрицательный эффект | 1 | 11 | 7 — сильный отрицательный эффект | 4 | 52 | Итого | 18 | 19 Для остальных расчётов см. Field (2009: 561–562). 20 Во всех трёх таблицах общая сумма рангов приблизительно равна 171. Она равна сумме целых чисел от 1 до 18; см. объём выборки (N). 292 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds ТАБЛИЦА 10. Второй конституент Scaled AIC | Уровни значимости | N | Сумма рангов Scaled AIC | 1 — сильный положительный эффект | 6 | 59 Scaled AIC | 2 — слабый положительный эффект | 1 | 14 Scaled AIC | 3 — отсутствие эффекта | 8 | 59 Scaled AIC | 4 — слабый отрицательный эффект | 1 | 18 Scaled AIC | 5 — умеренный отрицательный эффект | 2 | 21 | Итого | 18 | Прежде чем перейти к результатам критерия Kruskal-Wallis (H), важно отметить, что этот критерий не предоставляет информации о конкретных различиях между отдельными группами. Для решения этой проблемы дополнительно применялся критерий Jonckheere-Terpstra (JT). Этот критерий позволил определить, увеличивались или уменьшались медианы групп в порядке, заданном кодирующей (= группирующей) переменной, в частности от сильного положительного эффекта к сильному отрицательному эффекту. В методическом отношении статистика JT была преобразована в z-оценку. Положительное значение z указывало на тенденцию к возрастанию медиан, то есть медианы увеличивались (= более высокий/худший Scaled AIC) по мере увеличения значений кодирующей переменной. Отрицательное значение z указывало на тенденцию к убыванию медиан, то есть медианы уменьшались (= более низкий/лучший Scaled AIC) по мере увеличения значений кодирующей переменной. Ниже совместно представлены результаты критериев Kruskal-Wallis (H) и Jonckheere-Terpstra (JT). (a) На Scaled AIC для сложного слова уровень значимости не оказывал значимого влияния, согласно критерию Kruskal-Wallis (H (2) = 2.226, p >.05). Наблюдалась тенденция к возрастанию медиан, подтверждающая нашу гипотезу о переобучении; см. отрицательную медиану для сложного слова в таблице 7. Однако эта тенденция не была статистически значимой согласно критерию Jonckheere-Terpstra (JT = 50, z = 1.064, p >.05). (b) На Scaled AIC для первого конституента уровень значимости не оказывал значимого влияния, согласно критерию Kruskal-Wallis (H (6) = 5.427, p >.05). Наблюдалась тенденция к возрастанию медиан, опровергающая нашу гипотезу о переобучении; см. положительную медиану для первого конституента в таблице 7. Однако эта тенденция не была статистически значимой согласно критерию Jonckheere-Terpstra (JT = 70, z = 0.549, p >.05). (c) На Scaled AIC для второго конституента уровень значимости не оказывал значимого влияния, согласно критерию Kruskal-Wallis (H (4) = 4.607, p >.05). Тенденция к возрастанию или убыванию медиан не наблюдалась, что опровергает Straipsniai / Articles 293 CHARITON CHARITONIDIS нашу гипотезу о переобучении. В частности, z-статистика критерия Jonckheere–Terpstra была практически равна нулю, что соответствует нулевой медиане для второго конституента в таблице 7 (JT = 54, z = 0.041, p >.05). Итак, можно сделать вывод, что уровень значимости коэффициентов прозрачности в моделях Gagné et al. (2019) с частотностью SUBTLEX-US не влияет на величину Scaled AIC. Этот результат косвенно подтверждает качество моделей Gagné et al. (2019) с предикторами прозрачности, указывая, в частности, на несостоятельность гипотезы о переобучении этих моделей. Ограничением настоящего исследования является малый объём выборки, N = 18. Для подтверждения наших результатов необходимы дальнейшие исследования с более широким диапазоном значений Scaled AIC. Чтобы обеспечить ясность и полноту изложения результатов исследования, мы включили отдельный раздел, посвящённый обобщению основных выводов нашего исследования. Для этого общего обзора перейдите, пожалуйста, к разделу 7. 7. ОСНОВНЫЕ РЕЗУЛЬТАТЫ В таблице 11 ниже представлен всесторонний анализ эффективности моделей и релевантных переменных в контексте заданий на лексическое решение и называние, основанный на результатах Gagné et al. (2019). Каждый раздел таблицы посвящён определённой теме и показывает, какие модели являются наиболее эффективными. Тесты ANOVA и Kruskal–Wallis/Jonckheere–Terpstra (разделы 6.3 и 6.4) применялись после присвоения номинальных (порядковых или категориальных) значений регрессионным коэффициентам из моделей Gagné et al. (2019). Подробности о применённых специальных тестах см. в соответствующих разделах. ТАБЛИЦА 11. Scaled AIC в английских сложных словах с замкнутой структурой: всесторонний анализ эффективности моделей в заданиях на лексическое решение и называние (Gagné et al. 2019) 294 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds Темы | Статистики | Оценка | Раздел Контрольные переменные | ANOVA | Частотность сложного слова ✓; Длина сложного слова ~ | 6.3 Семантическая прозрачность | Kruskal–Wallis Jonckheere–Terpstra | Первый конституент NOF/ns; Второй конституент NOF/ns; Сложное слово NOF/ns | 6.4 PAR: параметрические данные | NPAR: непараметрические данные | ✓: лучшие модели (более низкий AIC) ~: худшие модели (более высокий AIC) | NOF/ns: отсутствие переобучения/незначимый тест 8. ОБСУЖДЕНИЕ Предыдущие исследования Charitonidis (2022, 2024) показали, что Scaled AIC является надёжной мерой соответствия, которую можно применять при выборе моделей, возможно, в сочетании с другими мерами, такими как критерий Wald (см. раздел 3). В настоящем анализе, посвящённом моделям множественной регрессии Gagné et al. (2019) с частотностью SUBTLEX-US, были выявлены дополнительные свойства показателя Scaled AIC. Хотя высказывались обоснованные сомнения относительно сравнения моделей, подогнанных по выборкам разного объёма, с использованием информационных критериев (см. раздел 2), результаты настоящего исследования показывают, что в определённых контекстах Scaled AIC действительно может быть ценным инструментом для оценки соответствия моделей и иерархизации регрессионных моделей. Наше исследование показало, что Scaled AIC реагирует на экспериментальный дизайн, источники времени реакции и конкретные задания. Однако важно признать, что применимость Scaled AIC может зависеть от контекста, поэтому его полезность следует оценивать в каждом конкретном случае. Прежде чем перейти к основным результатам этой статьи, важно рассмотреть исследовательские вопросы, сформулированные в разделе 4. 1. Распределения значений Scaled AIC наряду с сочетаниями различных источников времени реакции и задач обработки свидетельствуют о том, что Scaled AIC эффективно выявляет наличие или отсутствие чётко определённых лежащих в основе факторов в экспериментальном дизайне и статистическом моделировании. В этом контексте лексическое решение BLP и называние ELP демонстрировали более высокую прогностическую силу для Scaled AIC даже в контролируемых условиях. 2. Частотность сложных слов неизменно была отрицательным предиктором Scaled AIC, всегда указывая на большой эффект. Лексическое решение ELP стабильно демонстрировало Straipsniai / Articles 295 CHARITON CHARITONIDIS значимые положительные корреляции с длиной сложного слова, предсказывая более высокие (= худшие) значения Scaled AIC. Лексическое решение BLP стабильно демонстрировало статистически незначимые корреляции с длиной сложного слова. И лексическое решение, и длина сложного слова предсказывали худшие модели при корректировке по ковариатам. 3. Направленность и уровень значимости коэффициентов прозрачности в моделях Gagné et al. (2019) не влияли на величину Scaled AIC. Этот результат подразумевает, что модели Gagné et al. (2019) с предикторами прозрачности не вносят смещения, обусловленного переобучением. Основные результаты этого исследования со ссылками на конкретные разделы анализа можно обобщить следующим образом: В разделе 6.1 наш анализ был сосредоточен на сравнении значений Scaled AIC в различных категориях моделей. Даже после попытки применить к абсолютным значениям преобразования «натуральный логарифм» и «квадратный корень» общая выборка Scaled AIC не соответствовала нормальному распределению. Аналогично, модели лексического решения ELP демонстрировали непараметрическое распределение своих значений Scaled AIC. Напротив, данные, относящиеся к лексическому решению BLP и называнию ELP, следовали нормальному распределению. В разделе 6.2 наше внимание сместилось к изучению взаимосвязи между Scaled AIC и (a) источниками времени реакции и (b) выполнением задания. Примечательно, что диапазоны значений Scaled AIC для моделей лексического решения ELP и BLP не перекрывались, что свидетельствует об их различии. Результаты тестов выявили значимые основные эффекты как источника времени реакции, так и выполнения задания на Scaled AIC. В частности, прогностическая способность Scaled AIC была выше для моделей, связанных со временем лексического решения BLP и задачей называния. Эти результаты существенно повышают точность и эффективность соответствующих моделей. В разделе 6.3 наше исследование было посвящено взаимосвязи между Scaled AIC и контрольными переменными «частотность сложного слова» и «длина сложного слова». Частотность сложного слова была исключена из анализа, поскольку она была полностью коллинеарна Scaled AIC. С другой стороны, наблюдалось снижение значений Scaled AIC, когда длина сложного слова становилась релевантным фактором в моделях. Одновременно длина сложного слова была наиболее релевантна для задачи называния. С точки зрения корректировки по ковариатам и лексическое решение, и длина сложного слова предсказывали худшие модели. В разделе 6.4 наше внимание было сосредоточено на взаимосвязи между Scaled AIC и семантической прозрачностью. Исследовательский вопрос заключался в том, влияли ли направленность и уровень значимости коэффициентов прозрачности в моделях Gagné et al. (2019) на Scaled AIC. Основной целью нашего метода было выявление потенциальных эффектов переобучения. Мы предположили, что модели с худшими значениями Scaled AIC могут обладать значимыми коэффициентами, сохраняющими релевантность 296 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds согласно лишь набору данных LADEC. Хотя мы наблюдали тенденцию к увеличению (= ухудшению) значений Scaled AIC для кластера значимых отрицательных коэффициентов на уровне сложного слова, что согласуется с нашей гипотезой о переобучении, тест Jonckheere–Terpstra показал, что эта тенденция не достигла статистической значимости. В заключение отметим, что изучение различных параметров с использованием Scaled AIC в качестве зависимой переменной выявило разнообразные способы, которыми категории моделей, источник времени реакции, задачи обработки, контрольные переменные и семантическая прозрачность влияют на качество подгонки моделей. Осознавая нюансированные взаимосвязи между этими элементами, исследователи получают больше возможностей для принятия обоснованных решений при выборе моделей, внесении корректировок и интерпретации результатов. REFERENCES Akaike Hirotugu 1973: Information Theory and an Extension of the Maximum Likelihood Principle. – Second International Symposium on Information Theory, eds. B. F. Csaki, B. N. Petrov, Budapest: Academiai Kiado, 267–281. Aldrich John R. 1997: R. A. Fisher and the Making of Maximum Likelihood 1912–1922. – Statistical Science 12(3), 162–176. Baayen Harald R., Piepenbrock Richard, Gulikers Leon 1995: The CELEX Lexical Database (Data set, Release 2, CD-ROM), Linguistic Data Consortium, University of Pennsylvania. Available at: https://catalog.ldc.upenn.edu. Balota David A., Yap Melvin J., Cortese Michael J., Hutchison Keith I., Kessler Brett, Loftis Bjorn, Neely James H., Nelson Douglas L., Simpson Greg B., Treiman Rebecca 2007: The English Lexicon Project. – Behavior Research Methods 39, 445–459. Brysbaert Marc, New Boris 2009: Moving Beyond Kučera and Francis: A Critical Evaluation of Current Word Frequency Norms and the Introduction of a New and Improved Word Frequency Measure for American English. – Behavior Research Methods 41, 977–990. DOI: doi.org/10.3758/BRM.41.4.977. Burnham Kenneth P., Anderson David R. 2002: Model Selection and Multimodal Inference: A Practical Information-Theoretic Approach, 2ⁿᵈ edition, New York: Springer. DOI: dx.doi.org/10.1007/b97636. Charitonidis Chariton 2022: Context Concreteness for the Second Constituent Slows Down Compound-Word Processing. – Lexis 20. DOI: doi.org/10.4000/lexis.6769. Straipsniai / Articles 297 CHARITON CHARITONIDIS Charitonidis Chariton 2024: The Role of Hyponymy and Context Concreteness in Compound Word Processing. – Studia Neophilologica. DOI: doi.org/10.1080/00393274.2024.2336851. Chen Xiaocong, Dong Yanping, Yu Xiufen 2018: On the Predictive Validity of Various Corpus-Based Frequency Norms in L2 English Lexical Processing. – Behavior Research Methods 50, 1–25. DOI: doi.org/10.3758/s13428-017-1001-8. Field Andy 2009: Discovering statistics using SPSS, 3rd edition, London: Sage Publications. Fisher Ronald A. 1922: On the Mathematical Foundations of Theoretical Statistics. – Philosophical Transactions of the Royal Society of London, Series A 222, 309–368. Gagné Christina L., Spalding Thomas L., Schmidtke Daniel 2019: LADEC: The Large Database of English Compounds. – Behavior Research Methods 51, 2152–2179. DOI: doi.org/10.3758/s13428-019-01282-6. Gagné Christina L., Spalding Thomas L., Spicer Patricia, Wong Dixie, Rubio Beatriz, Perez-Cruz Karen 2020: Is Buttercup a Kind of Cup? Hyponymy and Semantic Transparency in Compound Words. – Journal of Memory and Language 113. DOI: doi.org/10.1016/j.jml.2020.104110. Hastie Trevor, Tibshirani Robert, Friedman Jerome 2009: The Elements of Statistical Learning: Data Mining, Inference, and Prediction. 2nd edition, New York: Springer. Keuleers Emmanuel, Lacey Paula, Rastle Kathleen, Brysbaert Marc 2012: The British Lexicon Project: Lexical Decision Data for 28,730 Monosyllabic and Disyllabic English Words. – Behavior Research Methods 44, 287–304. DOI: doi.org/10.3758/s13428-011-0118-4. Kullback Solomon 1959: Information Theory and Statistics. New York: Wiley. Navarro Daniel J., Myung Jay I. 2005: Model Evaluation. – Encyclopedia of Statistics in Behavioral Science, vol. 3, eds. B. S. Everitt, D. C. Howell, Chichester: Wiley, 1239–1242. Steiger James H. 1980: Tests for Comparing Elements of a Correlation Matrix. – Psychological Bulletin 87(2), 245–251. DOI: doi.org/10.1037/0033-2909.87.2.245. Wagenmakers Eric-Jan, Farrell Simon 2004: AIC Model Selection Using Akaike Weights. – Psychonomic Bulletin & Review 11(1), 192–196. 298 Acta Linguistica Lithuanica XC Exploring Scaled AIC within English Closed Compounds I N T E R N E T D I S C U S S I O N S Model comparison with AIC based on different sample size. Available at: https://stats.stackexchange.com/questions/94718/model-comparison-with-aic-based-on-different-sample-size [accessed 15.5.2024]. What is the acceptable range of skewness and kurtosis for normal distribution of data? Available at: https://www.researchgate.net/post/What_is_the_acceptable_range_of_skewness_and_kurtosis_for_normal_distribution_of_data [accessed 15.5.2024]. L A R G E L A N G U A G E M O D E L S GPT-3.5 (available at: https://chat.openai.com/) and Google Gemini (available at: https://gemini.google.com [accessed 11.10.2023]) were selectively used as auxiliary proofreading and editing tools. The responses from both AI tools were further proofread and edited by the author. Anglų kalbos uždarųjų junginių (sudurtinių žodžių) skalės AIC tyrimas S A N T R A U K A Šiame tyrime nagrinėjamos modifikuotos Akaikės informacijos kriterijaus, pavadinto skalės kriterijumi, t. y. AIC, kaip tinkamumo rodiklio, padalinto iš imties dydžio, varianto ypatybės. Tyrimo objektas – 66 daugialypės regresijos modeliai, susiję su uždarųjų (sudurtinių) anglų kalbos žodžių junginių, paimtų iš Gagné'es ir kitų (2019) Anglų kalbos sudurtinių žodžių (junginių) didžiosios duomenų bazės (angl. LADEC), apdorojimu. Toliau pateikiami išsamios analizės rezultatai: 1. Modelių kategorijų modeliai pasižymi nevienareikšmiais rezultatais. Britų kalbos žodyno projekto (angl. BLP) leksinių sprendimų modeliai ir Anglų kalbos žodyno projekto (angl. ELP) įvardijimo modeliai veikia geriau (tai rodo mažesnis AIC), palyginus su Anglų kalbos žodyno projekto (angl. ELP) leksinių sprendimų modeliais. Straipsniai / Articles 299 CHARITON CHARITONIDIS 2. Laiko šaltinio ir leksikos apdorojimo užduočių atsakymais atskleidžia reikšmingus pagrindinius skalės AIC rezultatus. Britų kalbos žodyno projekto leksinių sprendimų modeliai ir Anglų kalbos žodyno projekto įvardijimo modeliai veikia gerai, o pastarojo projekto leksinių sprendimų modeliai yra mažiau veiksmingi. 3. Įvertinus kontrolinius kintamuosius, tokius kaip junginių dažnumas ir junginių ilgis, matyti, kad modelių rezultatyvumas skiriasi. Junginių dažnumas yra stiprus veiksnys (parodo didesnis produktyvumas), o sudėtinio ilgio modelių prognozės blogesnės. 4. Kalbant apie pirmosios ir antrosios žodžių junginių sudedamųjų dalių, taip pat ir apie junginių semantinį skaidrumą, modeliai nerodo per didelio suderinamumo. Tai parodo, kad semantinis skaidrumas nesumažina modelių galėjimo apibendrinti naujus duomenis. Įteikta 2024 m. sausio 11 d. CHARITON CHARITONIDIS [email protected] 300 Acta Linguistica Lithuanica XC