This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.
Preparing document pages…
Page 1
CHARITON CHARITONIDIS Bağımsız araştırmacı ORCID id: orcid.org/0000-0003-0298-2629 Araştırma alanları: sözcük oluşumu, çok sözcüklü ifadeler, sözlüksel anlambilim, sözcük tanıma, duygu. DOI: doi.org/10.35321/all90-11
İngilizce kapalı bileşiklerde (birleşik sözcüklerde) ölçeklendirilmiş AIC'nin incelenmesi
ÖZET
Akaike Bilgi Kriteri (AIC), ampirik verilerin analizinde model seçimi için yerleşik bir uyum iyiliği ölçüsüdür. Ancak AIC, örneklem büyüklüğüne duyarlıdır. Yazarın önceki araştırmaları, örneklem büyüklüğüne bölünmüş AIC, yani Ölçeklendirilmiş AIC'nin, model uyumunu değerlendirmek ve regresyon modellerini hiyerarşik olarak sıralamak için etkili bir araç olduğunu göstermiştir. Bu çalışma, bu değişkenin diğer özelliklerini incelemektedir. Araştırmanın nesnesi, Gagné ve diğerlerinin (2019) Large Database of English Compounds (LADEC) veri tabanından alınan kapalı (birleştirilmiş) İngilizce bileşiklerin işlenmesine ilişkin 66 çoklu regresyon modelidir. Özellikle Ölçeklendirilmiş AIC; tepki sürelerinin, sözcüksel karar ve adlandırma görevlerinin, bileşik uzunluğunun ve saydamlık normlarının kaynakları olarak English Lexicon Project (ELP) ve British Lexicon Project (BLP) ile karşılaştırılmaktadır. Yöntem olarak tek yönlü ANOVA, ana etkiler analizi ve parametrik olmayan testler kullanılmıştır. Bulgular, Ölçeklendirilmiş AIC'nin deneysel tasarıma, tepki sürelerinin kaynağına ve sözcüksel karar ile adlandırma görevlerine duyarlı olduğunu göstermektedir. Aynı zamanda bu çalışmanın sonuçları, Gagné ve diğerlerinin (2019) kullandığı yöntemlerin geçerlenmesi için ampirik destek sunmaktadır.
ANAHTAR SÖZCÜKLER: İngilizce bileşikler, Ölçeklendirilmiş AIC, sözcüksel karar, adlandırma.
ÖZET
Akaike bilgi kriteri (İng. AIC), ampirik verilerin analizinde uygulanan yerleşik bir model uyum ölçüsüdür. Ancak AIC, örneklem büyüklüğüne duyarlıdır. Önceki
Straipsniai / Articles
273
Page 2
CHARITON CHARITONIDIS
yazarın araştırmaları, örneklem büyüklüğüne bölünmüş ölçeklendirilmiş AIC'nin model uyumunu değerlendirmek ve regresyon modellerini hiyerarşik olarak sıralamak için etkili bir araç olduğunu göstermiştir. Bu çalışmada bu değişkenin diğer özellikleri incelenmektedir. Araştırmanın nesnesi, Gagné ve diğerlerinin (2019) Large Database of English Compounds (İng. LADEC) veri tabanından alınan kapalı (birleşik) İngilizce bileşiklerin işlenmesiyle ilgili 66 çoklu regresyon modelidir. Öncelikle AIC, tepki sürelerinin, sözcüksel karar ve adlandırma görevlerinin, bileşik uzunluğunun ve saydamlık normlarının kaynakları olarak English Lexicon Project (İng. ELP) ve British Lexicon Project (İng. BLP) ile karşılaştırılmaktadır. Kullanılan yöntemler tek yönlü ANOVA (İng. Analysis of variance), ana sonuçlar analizi ve parametrik olmayan testlerdir. Sonuçlar, ölçeklendirilmiş AIC'nin deneysel tasarıma, tepki süresi kaynağına ve sözcüksel karar ile adlandırma görevlerine tepki verdiğini göstermektedir. Bununla birlikte, bu çalışmanın sonuçları Gagné ve diğerlerinin (2019) uyguladığı yöntemlerin doğrulanması için ampirik bir temel sağlamaktadır.
TEMEL SÖZCÜKLER: İngilizce bileşikler (birleşik sözcükler), ölçeklendirilmiş AIC, sözcüksel karar, adlandırma.
1. İNGİLİZCE BİLEŞİKLERİN BÜYÜK VERİ TABANI (LADEC: GAGNÉ VE DİĞERLERİ 2019)¹
Large Database of English Compounds (LADEC: Gagné ve diğerleri 2019), mevcut bileşik sözcüklerin en büyük veri tabanıdır. Bu veri tabanı, diğerlerinin yanı sıra CELEX veri tabanı (Baayen ve diğerleri 1995), English Lexicon Project (ELP; Balota ve diğerleri 2007), British Lexicon Project (BLP; Keuleers ve diğerleri 2012), British National Corpus (BNC) ve Wordnet dâhil olmak üzere çeşitli kaynaklardan seçilmiş 8000'den fazla boşluksuz (“kapalı” veya “birleştirilmiş”) bileşik (=isim) içerir. LADEC kayıtlarının tamamından 7.804 bileşik, iki serbest biçimbirim bileşenine benzersiz biçimde ayrıştırılabilir.² Örneğin isim-isim bileşikleri, ör. buttercup, shipyard; ikinci bileşeni bir fiil kökünden türemiş bileşikler, ör. pacemaker, painkiller vb. olmak üzere çok çeşitli bileşikler ele alınmaktadır (bileşik sınıflarının tanımları için bkz. Lieber 2004: 46). Baş olmayan ilk bileşen, geniş bir dilbilgisel kategori yelpazesine işaret eder. Şekil 1, LADEC kayıtlarından kısa bir örnek içermektedir.
Gagné ve diğerlerinin (2019) çoklu regresyon modelleri; bileşik uzunluğu, bigram sıklığı gibi çok çeşitli yordayıcı (=bağımsız) değişkenler içerir
¹ Bu bölüm, küçük değişikliklerle Chariton Charitonidis'ten (2022) uyarlanmıştır.
² LADEC, daha önce listelenmiş bileşiklerin çoğullarını ayrı kayıtlar olarak içerir.
274
Acta Linguistica Lithuanica XC
Page 3
Exploring Scaled AIC within English Closed Compounds
biçimbirim sınırındaki, aile büyüklüğü, sözcük sıklığı, olasılık ve ilişkilendirme (vektör tabanlı) ölçümleri, katılımcı değerlendirmelerinden hesaplanan duygusal/duygu normları vb. ELP'den (sözcüksel karar, adlandırma) ve BLP'den (sözcüksel karar) bileşikler için log tepki süreleri bağımlı değişken olarak kullanılır. Çoğunlukla bileşik uzunluğu (karakter sayısı) ve SUBTLEX-US derleminden (Brysbaert, New 2009)³ ve BNC'den (BLP) log bileşik (=sözcük) sıklığı kontrol değişkenleri olarak kullanılır. Gagné ve diğerlerinin (2019) modellerinde, yukarıda belirtilen yordayıcı değişkenler sözcüksel karar ve adlandırma süreleri üzerinde anlamlı etkilere sahipti.
ŞEKİL 1. LADEC kayıtları: örnek
Gagné ve diğerlerinin (2019) çalışmasında birincil odak, çeşitli anlamsal saydamlık ölçümlerine verilmiştir. Gagné ve diğerleri (2019), katılımcılardan bileşik sözcüğün anlamının parçalarından ne ölçüde öngörülebilir olduğunu (anlam öngörülebilirliği değerlendirmeleri, bileşik temelli) ve bileşenlerin her birinin anlamının ne kadarının bileşikte korunduğunu (anlam korunumu değerlendirmeleri, bileşen temelli) dikkate alarak bileşikleri değerlendirmelerini istemiştir. Yazarlar, ikinci bileşene ilişkin saydamlık dağılımının, birinci bileşene ilişkin saydamlık dağılımına kıyasla çok daha sivri ve yüksek olduğunu bulmuştur (MC1: 64.80 [SD: 19.59] ve MC2: 71.00 [SD: 16.46]. N = 8115). Ancak,
³ SUBTLEX–US derlemi, ABD filmleri ve televizyon programlarının altyazılarına dayanan 51 milyon sözcüklük bir derlemdir. Yakın tarihli birçok çalışma, filmlerin ve televizyon programlarının altyazılarından elde edilen sıklık normlarının, çeşitli dillerin anadili konuşurlarında sözcüksel işlemleme süresindeki ve bazı durumlarda doğruluktaki farklılıkları açıklama bakımından basılı metinlerden türetilenlerden daha etkili olma eğiliminde olduğunu gösteren kanıtlar sunmuştur (bkz. Chen ve diğerleri 2018: 2 ve oradaki kaynaklar).
Straipsniai / Articles
275
Page 4
CHARITON CHARITONIDIS
birinci bileşenin, tüm bileşiğe ilişkin derecelendirmeyle, ikinci bileşene ilişkin derecelendirmeden daha güçlü biçimde korelasyon gösterdiği bulundu (c1~cmp: r = 0.75, p <.001; c2~cmp: r = 0.66, p <.001. N = 429).⁴ En dikkat çekici olarak, birinci bileşen için anlamın korunması derecesi ile bileşik için anlam öngörülebilirliği derecesi, üç yanıt süresinin tümünü, yani ELP sözcüksel karar, BLP sözcüksel karar ve ELP adlandırma sürelerini öngördü.
Sonuç olarak, ikinci bileşene ilişkin saydamlıkların daha sivri ve yüksek dağılımı ile birinci bileşenin bileşiğin anlam öngörülebilirliğiyle daha güçlü ilişkisi, İngilizce bileşiklerdeki baş işlemlerine doğrudan yansıyor görünmektedir. İkinci bileşen, yani baş, saydamlığı kategorik ve anlamsal olarak artırılmış bir birimdir (anlamsal açıdan bkz. içerim ve alt anlamlılık ilişkileri). Birinci bileşen, yani niteleyici, bileşik göndergesinin oluşturulmasındaki en kritik etkendir. Bunun sonucunda, onun saydamlığı bileşiğin saydamlığıyla en güçlü biçimde birlikte değişir.⁵
2. AKAIKE BİLGİ KRİTERİ (AIC)
Hirotugu Akaike, 1973'te Fisher'ın Kullback–Leibler uzaklığının (Kullback 1959) göreli beklentisini Fisher'ın maksimize edilmiş log olabilirliğini (Fisher 1922; ayrıca bkz. Aldrich 1997) kullanarak tahmin etmeye yönelik bir yöntem geliştirdi. Yaygın olarak Akaike Bilgi Kriteri (AIC; Akaike 1973) olarak adlandırılan bu ölçü, ampirik verilerin analizinde model seçimi için yeni bir çerçeve sunarak önemli bir paradigma değişimine işaret etti (Burnham, Anderson 2002).
AIC genellikle şu şekilde hesaplanır: −2lnL + 2k; burada ‘lnL’ modelin maksimize edilmiş/tam log olabilirliğini, ‘k’ ise sabit terim dâhil parametre sayısını ifade eder. Daha küçük bir yordayıcı kümesi genellikle daha verimli modellerle (daha düşük bilgi kaybına sahip modellerle) ilişkilidir. AIC değeri ne kadar düşük (=daha negatif) olursa modelin uyumu o kadar iyidir. Bu bağlamda AIC, bir uyum iyiliği ölçüsü olarak, potansiyel olarak daha yüksek AIC değerlerine yol açan çok sayıda yordayıcının kullanımını cezalandırır (AIC denklemindeki ‘+2k’ kısmına bkz.).
⁴ Steiger'ın (1980) z testi bu farkın anlamlı olduğunu gösterdi; z = 27.71, p <.0001 (Gagné ve diğerleri 2019).
⁵ Gagné ve diğerleri (2019), önceki araştırmalara atıfta bulunarak “niteleyicinin (İngilizcedeki ilk bileşenin), bileşiklerin ve ad öbeklerinin işlenmesi sırasında ilişki seçiminin kolaylığında daha büyük bir rol oynama eğiliminde olduğunu” bildirmektedir.
276
Acta Linguistica Lithuanica XC
Page 5
Exploring Scaled AIC within English Closed Compounds
AIC, örneklem büyüklüğüne duyarlıdır. AIC'nin düzeltilmiş bir biçimi olan AICc, 2k (k + 1)/ (n − k − 1) formülü aracılığıyla örneklem büyüklüğünü içerir. Ancak özellikle küçük örneklem büyüklüklerini ele alır ve Gagné ve diğerlerindeki (2019) gibi büyük örneklem büyüklüklerine dayanan modeller için önerilmez.⁶ Kenneth P. Burnham & David R. Anderson (2002) gibi araştırmacıların hem farklı hem de büyük örneklem büyüklüklerine uydurulmuş modellerin AIC değerlerini karşılaştırmak için kesin bir çözüm sunmadıkları belirtilmelidir.⁷
Özellikle Burnham & Anderson (2002: 80–85, 334–335), model karşılaştırmasında eşit olmayan örneklem büyüklüklerinin sonuçlarını kapsamlı biçimde tartışmaktadır. Farklı örneklem büyüklüklerine sahip modelleri karşılaştırmak için bilgi kriterlerinin kullanılmasının yanıltıcı sonuçlara yol açabileceğini savunurlar. Benzer şekilde, Svetunkov'un 2016 tarihli çevrim içi tartışmasında belirttiği üzere (kaynakçadan sonraki kaynağa bkz.), tüm bilgi kriterleri, kendisi de örneklem büyüklüğüne bağlı olan olabilirlik fonksiyonuna dayanır. Özellikle örneklem büyüklüğü arttıkça olabilirlik azalır. Sonuç olarak, bu gibi durumlarda bilgi kriterleri de artar.⁸
3. ÖNCEKİ ARAŞTIRMALAR
Charitonidis'te (2022), farklı duygu değişkeni kombinasyonlarına ilişkin 44 çoklu regresyon modelinin AIC değerleri (a) sözcükler ve (b) sözcük bağlamları için değerlik, uyarılmışlık ve somutluk örneklem büyüklüğüne (N) bölünerek Ölçeklendirilmiş AIC (AIC/N) değerleri elde edilmiştir. Daha sonra bu değerler, değerlendirmek için kullanılmıştır
⁶ AICc hakkında daha fazla bilgi için okuyucu Burnham & Anderson'a (2002: 374–380) yönlendirilir.
⁷ Burnham & Anderson'ın (2002) önerdiği çözümlerden biri, AIC değerlerinin “veriler göz önüne alındığında modelin göreli olabilirliği” olarak tanımlanan “Akaike ağırlıkları”na dönüştürülmesiyle ilgilidir (Burnham, Anderson 2002: xiii; ayrıca bkz. Wagenmakers, Farrell 2004).
⁸ Şu adreste mevcuttur: https://stats.stackexchange.com/questions/94718/model-comparison-with-aic-based-on-different-sample-size [erişim: 16.06.2023]. Okuyucu, ‘2k’ bileşenini sabit tutarken AIC denklemindeki ‘lnL’ bileşeni için farklı değerler koyarak Svetunkov'un ifadesini kavrayabilir. lnL değerindeki bir azalma, daha yüksek, yani daha düşük nitelikli bir AIC değeriyle sonuçlanacaktır.
⁹ Literatürde Ölçeklendirilmiş AIC, “ortalama AIC” olarak da anılır. Svetunkov'a göre (kişisel iletişim), Akaike Bilgi Kriteri'nin örneklem büyüklüğüne bölünmesi uygulaması yeni değildir. Örneğin Hastie ve diğerleri (2009: 230–231), formülde N'yi payda olarak kullanarak AIC'yi kanonik olmayan bir biçimde tanımlar. Geleneksel AIC formülünden bu sapmanın eleştirmenleri bulunsa da Stata istatistik yazılım paketine dâhil edilmesiyle örneklendiği üzere bu yaklaşım yaygınlığını korumaktadır. Örneğin Stata, çevrim içi olarak erişilebilen çeşitli örneklerin gösterdiği gibi model çıktısında “AIC'nin N'ye bölünmesi”ni raporlar (Bu bilgiyi sağladığı için I. Svetunkov'a teşekkür edilir).
Straipsniai / Articles
277
Page 6
CHARITON CHARITONIDIS
ve modellerin uyum iyiliğini karşılaştırmak. Temel yordayıcıların genel, yani genel, modellere eklenmesi, BLP sözcüksel karar sürelerinin ELP sözcüksel karar sürelerine kıyasla daha iyi bir uyum iyiliği gerektirdiğini gösterdi. ELP adlandırma modellerinin uyumu, ELP ve BLP sözcüksel karar modellerinde gözlemlenen aralık içinde kaldı. En önemlisi, ikinci bileşen için bağlam somutluğu, sözcüksel karar ve adlandırma genelinde SUBTLEX-US sıklığını içeren tüm modellerde anlamlı bir yordayıcı olarak ortaya çıktı.
Charitonidis'te (2024), SUBTLEX-US sıklığını içeren genel modellerdeki tüm anlamlı katsayılar alt anlamlılık değişkeniyle (Gagné ve diğerleri 2020) karşılaştırılmıştır. Hem alt anlamlılığı hem de ikinci bileşen için bağlam somutluğunu içeren modellerin, bu iki değişkenden herhangi birini çıkarmış iç içe, yani indirgenmiş modellere kıyasla her zaman en düşük (=en iyi) Ölçeklendirilmiş AIC değeriyle ilişkili olduğu bulunmuştur. Daha sonra uygulanan Wald testleri, iç içe modellerin belirlilik katsayısında (R2) her zaman anlamlı bir azalmaya (=kötüleşmeye) işaret ettiğini göstermiştir. Tablo 1 ve 2, sırasıyla Ölçeklendirilmiş AIC değerlerini ve karşılık gelen Wald testlerinin sonuçlarını göstermektedir.
TABLO 1.
İngilizce Lexicon Project (ELP) sözcüksel karar (LD) sürelerini, British Lexicon Project (BLP) sözcüksel karar sürelerini ve ELP adlandırma sürelerini öngörmek üzere tam modellerden (‘Model 1’) alt anlamlılığın (‘Model 2’) veya ikinci bileşen için bağlam somutluğunun (‘Model 3’) çıkarıldığı iç içe modeller için Ölçeklendirilmiş AIC değerleri
İngilizce Lexicon Project (ELP) sözcüksel karar (LD) sürelerini, British Lexicon Project (BLP) sözcüksel karar sürelerini ve ELP adlandırma sürelerini öngörmek üzere tam modellerden (‘Model 1’) alt anlamlılığın (‘Model 2’) veya ikinci bileşen için bağlam somutluğunun (‘Model 3’) çıkarıldığı iç içe modeller için Wald testleri
Sonuç olarak, iki farklı etki büyüklüğü ölçüsü, yani Ölçeklendirilmiş AIC ve R2, aynı regresyon modellerini aynı biçimde hiyerarşik olarak sıralamış ve en iyi modele yönelik aynı tercihi göstermiştir. Dolayısıyla, Ölçeklendirilmiş AIC ölçüsünün model uyumunu değerlendirmede niteliksel bir araç olduğuna ilişkin güçlü kanıt bulunmaktadır.
Straipsniai / Articles
279
Page 8
CHARITON CHARITONIDIS
4. BU ÇALIŞMA
Bu çalışma, 3. bölümde sunulan yazarın önceki araştırmalarını temel almaktadır. Araştırma konuları, Gagné ve diğerleri (2019) tarafından oluşturulan İngilizce kapalı (birleştirilmiş) bileşikler için 66 sözcüksel karar ve adlandırma modelidir. Tüm modeller, kontrol değişkeni olarak SUBTLEX-US sıklığını içermektedir. Amaçlarımız iki yönlüdür ve paralel ilerlemektedir. İlk olarak Gagné ve diğerlerinin (age.) modellerinin özelliklerini değerlendiriyoruz. İkinci olarak Ölçeklendirilmiş AIC ölçüsünün temel özelliklerini inceliyoruz.
Araştırma soruları şunlardır: 1. Ölçeklendirilmiş AIC, Gagné ve diğerlerinin (2019) model tasarımına duyarlı mıdır? Hangi model grupları tercih edilmektedir? 2. ‘Bileşik sıklığı’ ve ‘bileşik uzunluğu’ kontrol değişkenlerinin Ölçeklendirilmiş AIC üzerindeki etkisi nedir? 3. Biçimbilimsel saydamlık Ölçeklendirilmiş AIC ile nasıl ilişkilidir?
Çalışmamız şu şekilde yapılandırılmıştır: 5. bölüm yöntemlerimize genel bir bakış sunar. 6.1. bölüm, incelenen modellere ilişkin Ölçeklendirilmiş AIC için betimsel istatistikleri sunar. Model kategorilerinin parametrik ve parametrik olmayan özelliklerine vurgu yapılır. 6.2. bölüm, tepki sürelerinin kaynağı ile sözcüksel işlemleme görevleri arasındaki ilişkiyi inceler. 6.3. bölüm, Ölçeklendirilmiş AIC'yi ‘bileşik sıklığı’ ve ‘bileşik uzunluğu’ kontrol değişkenleriyle karşılaştırır. 6.4. bölümde Gagné ve diğerlerinin (2019) modellerindeki saydamlık katsayılarının anlamlılık düzeyleri Ölçeklendirilmiş AIC değerleriyle eşleştirilir. Temel bulgular 7. bölümde özetlenir; ardından 8. bölümde sonuçlar tartışılır.
5. YÖNTEMLER
Genel yöntemimiz, bağımlı değişken olarak Ölçeklendirilmiş AIC'yi kullanarak Gagné ve diğerlerinin (2019) modellerinin temel parametrelerinin ve özelliklerinin karşılaştırmalı analiziydi. Bağımsız değişkenler, diğer etkenlerin yanı sıra örneklem özelliklerini (ör. tepki süresi kaynağı ve sözcüksel işlemleme görevleri), çalışma tasarımını (ör. kontrol değişkenleri) ve saydamlık katsayılarının anlamlılık düzeyini içeriyordu.
Kullanılan özgül istatistiksel yöntemler şunlardı: (a) farklı model kategorileri ve grupları genelinde Ölçeklendirilmiş AIC'nin merkezi eğilimini, değişkenliğini ve dağılımını değerlendirmek üzere Shapiro–Wilk testinin uygulanmasıyla birlikte ortalamalara ve medyanlara ilişkin betimsel istatistikler (6.1 ve 6.2. bölümler), (b) tepki sürelerinin kaynağı (ELP/BLP) ve sözcüksel işlemleme görevleri (sözcüksel karar/adlandırma) için yürütülen ana etkiler analizleri (bölüm
280
Acta Linguistica Lithuanica XC
Page 9
Exploring Scaled AIC within English Closed Compounds
6.2), (c) bileşik uzunluğunu ortak değişken olarak içeren tepki süresi kaynağı ve sözcüksel işlemleme görevleri üzerinde yürütülen ayrı ANOVA'lar (6.3. bölüm) ve (d) anlamsal saydamlık için sıralı olarak yeniden kodlanmış katsayıların sıraları arasındaki farklılıkları incelemek üzere Kruskal–Wallis ve Jonckheere–Terpstra testlerinin kullanılması (6.4. bölüm). Yöntemler hakkında daha fazla bilgi için okuyucu 6.1–6.4. bölümlerdeki analizlere yönlendirilir.
6. ANALİZLER
6.1. Ölçeklendirilmiş AIC ve model kategorileri karşılaştırması
Gagné ve diğerlerinin (2019) SUBTLEX–US sıklığını kontrol değişkeni olarak içeren çoklu regresyon modellerinden elde edilen 66 AIC değeri, 66 Ölçeklendirilmiş AIC değeri kümesi elde etmek üzere her modelin örneklem büyüklüğüne bölünmüştür.
Aşağıdaki Tablo 3, Ölçeklendirilmiş AIC için betimsel istatistikleri sunmakta ve Şekil 2, sıralanmış değerler kümesine ilişkin karşılık gelen kutu grafiğini göstermektedir.10 Örneklemde aykırı değer bulunmamıştır. Çarpıklık (Sk) ve basıklık (Ku) değerleri kabul edilebilir düzeydedir.11
Ölçeklendirilmiş AIC'nin ortalama değeri −3.50030'du. Standart sapma 0.19052 idi; yani gözlemler ortalama çevresinde görece sıkı biçimde kümelenmişti. Minimum ve maksimum değerler sırasıyla −3.85502 ve −3.15754'tü. Medyan değer −3.55732 idi; yani ortalama değerden biraz daha düşüktü.12 Verilerin ortadaki%50'si −3.66575 (birinci çeyrek, Q1) ile −3.30959 (üçüncü çeyrek, Q3) arasında değişiyordu. Buna göre çeyrekler arası aralık (IQR) 0.35616 idi.
10 Kutunun alt veya birinci çeyrek çizgisi (Q1), verilerin alt%25'inin altında uzandığı sınırı işaretler. Benzer şekilde, kutunun üst veya üçüncü çeyrek çizgisi (Q3), üst%25'in üzerinde uzandığı sınırı işaretler. Gölgelendirilmiş alan, verilerin ortadaki%50'sinin sınırlarını veya çeyrekler arası aralığı (IQR) gösterir; bu aralık, birinci çeyreğin üçüncü çeyrekten çıkarılmasıyla (Q3−Q1) hesaplanabilir. Kutunun içindeki yatay çizgi, medyanı veya orta çeyreği (Q2), yani veri kümesinin ortasına düşen değeri gösterir.
11 SPSS ortamına göre çarpıklık için −1 ile +1 arasındaki ve basıklık için −2 ile +2 arasındaki değerler, normal dağılım değerlendirmesinde genel olarak kabul edilebilir sayılır. Bununla birlikte, yalnızca çarpıklık ve basıklığın normalliğe ilişkin kesin bir kanıt sağlamadığına dikkat edilmelidir (ayrıca şu konudaki tartışmaya bkz. https://www.researchgate.net/post/What_is_the_acceptable_range_of_skewness_and_kurtosis_for_normal_distribution_of_data).
12 Bu örüntüyle uyumlu olarak, verilerde az miktarda pozitif çarpıklık (0.494) vardı.
Straipsniai / Articles
281
Page 10
CHARITON CHARITONIDIS
TABLO 3. Ölçeklendirilmiş AIC için betimsel istatistikler (tam küme)
Ortalama SD Min Maks −3.50030 0.19052 −3.85502 −3.15754 Medyan IQR Q1 Q3 −3.55732 0.35616 −3.66575 −3.30959
Farklı görevleri (sözcüksel karar, adlandırma) kapsadığı ve farklı tepki süresi kaynaklarından (ELP, BLP) türetildiği için Ölçeklendirilmiş AIC değerlerinin tam kümesinin normal dağılım göstermemesi beklenmiştir. Shapiro–Wilk testi ve Kolmogorov–Smirnov testi varsayımlarımızı doğrulamıştır.13 Özellikle Shapiro–Wilk testi istatistikleri W (66) = 0.90, p <.001 ve Kolmogorov–Smirnov testi istatistikleri D (66) = 0.17, p <.001 olarak bulunmuştur. Aynı tam kümenin mutlak değerlere doğal logaritma ve karekök dönüşümleri uygulandıktan sonra bile normal dağılım göstermediği belirtilmelidir.
Aşağıdaki Tablo 4, Gagné ve diğerlerindeki (2019) başlıca model kategorilerine, yani ELP sözcüksel kararı, BLP sözcüksel kararı ve ELP adlandırmasına ilişkin Ölçeklendirilmiş AIC için betimsel istatistikleri sunmaktadır (her grup 22 model içermektedir). Şekil 3, karşılık gelen kutu grafiklerini göstermektedir. Görüldüğü üzere ortalamalar ve medyanlar
Exploring Scaled AIC within English Closed Compounds
BLP sözcüksel kararı ve ELP adlandırması için benzer Ölçeklendirilmiş AIC değerlerine işaret ediyordu. ELP sözcüksel kararı, daha yüksek (=daha düşük nitelikli) değerlere işaret ediyor ve bu değerler ayrıca ayrık biçimde BLP sözcüksel karar değerlerinden ayrılıyordu.14 Özetle, BLP sözcüksel kararı ve ELP adlandırması, ELP sözcüksel kararından her zaman daha iyi modeller gerektirmiştir.
TABLO 4. Ana model kategorilerine göre Ölçeklendirilmiş AIC için betimsel istatistikler
Ölçeklendirilmiş AIC değerlerinin tam kümesinin parametrik olmayan profilinin, ana model kategorileri, yani tepki süreleri ve görevlerin temel kombinasyonları içinde ortaya çıkma olasılığının daha düşük olması beklenmiştir. Görüleceği üzere bu beklenti doğrulanmıştır.
Shapiro-Wilk testi, ELP sözcüksel karar verilerinin normallikten anlamlı ölçüde saptığını gösterdi. Özellikle W (22) = 0.90, p <.05 test istatistiğini hesapladık.15
BLP sözcüksel karar verileri normal dağılım göstermiştir. İlgili istatistikler W (22) = 0.92, p >.05'tir (Shapiro-Wilk).
14 ELP sözcüksel kararı ve BLP sözcüksel kararına ilişkin özet veriler üzerinde yapılan bir t-testi (Tablo 4), örneklem ortalamaları arasında oldukça anlamlı bir fark bulunduğunu göstermiştir; t = 18.296, p <.0001.
15 Altı ELP sözcüksel karar modelinin, −3.15754 olan maksimum değere yakın Scaled AIC değerlerine sahip olduğu ve bunun tüm veri kümesindeki en kötü uyuma işaret ettiği belirtilmelidir. Bu modeller, dağılımın yüksek ucuna doğru belirgin bir tepeye (−3.17304 ile −3.15754 arasında) katkıda bulunarak neredeyse iki tepeli bir dağılım örüntüsü oluşturmuştur. Bu gözlem, −1.444 gibi görece yüksek bir negatif basıklık değeriyle desteklenmektedir.
Straipsniai / Articles
283
Page 12
CHARITON CHARITONIDIS
ŞEKİL 3. Ana model kategorilerine göre Scaled AIC’nin kutu grafiği gösterimleri
Benzer şekilde, ELP adlandırma verileri de normal dağılmıştır. İlgili istatistikler W (22) = 0.93, p >.05’tir (Shapiro–Wilk).
Özetle, hem modellerin tamamı hem de ELP sözcüksel karar modelleri Scaled AIC’nin parametrik olmayan bir dağılımıyla ilişkilidir. Buna karşılık, BLP sözcüksel karar ve ELP adlandırma verileri normal dağılmıştır. Şimdi tek tek faktörlerin Scaled AIC üzerindeki etkisini ortaya çıkarmaya çalışalım.
6.2. Scaled AIC ile tepki süresi kaynağı ve görevler karşılaştırması
Aşağıdaki Tablo 5, ‘tepki süreleri’ ve ‘görevler’ ana faktörleri altında kategorize edilen gruplara ilişkin Scaled AIC değerlerinin betimsel istatistiklerini içermektedir; bunlar sırasıyla (a) ELP tepki süreleri, (b) BLP tepki süreleri, (c) adlandırma görevi ve (d) sözcüksel karar görevidir. ELP tepki süreleri ve sözcüksel karar görevi
284
Acta Linguistica Lithuanica XC
Page 13
Exploring Scaled AIC within English Closed Compounds
sırasıyla ‘sözcüksel karar ve adlandırma’ ile ‘ELP ve BLP’yi ifade eden kapsayıcı gruplardır. ‘BLP’ ve ‘Adlandırma’ grupları, daha önce Tablo 4’te (6.1 bölümü) sunulan ‘BLP sözcüksel karar’ ve ‘ELP adlandırma’ model kategorileriyle sırasıyla aynıdır. Şekil 4, ilgili kutu grafiği gösterimlerini sunmaktadır.
Tablo 5’te görülebileceği üzere, hem ‘BLP’ hem de ‘Adlandırma’, kapsayıcı ‘ELP tepki süreleri’ ve ‘sözcüksel karar’ gruplarının aksine, (a) Scaled AIC için daha düşük (=daha iyi) ortalama ve medyan değerlere ve (b) daha küçük standart sapma (SD) ve çeyrekler arası aralık (IQR) değerlerine işaret etmiştir.16 Aynı kapsayıcı gruplar görece yüksek basıklık değerlerine, yani sırasıyla −1.403 ve −1.616’ya sahiptir (bu gruplara ait histogramlarda —burada verilmemiştir— değerlerin iki tepeli dağılımına benzer şekilde iki belirgin tepe ortaya çıkmıştır). Bu örüntüler, Scaled AIC ölçütünün iyi tanımlanmış deneysel kategoriler olan BLP sözcüksel kararı (‘BLP’ grubu) ve ELP adlandırması (‘Adlandırma’ grubu) ile özgün biçimde ilişkili olduğunu göstermektedir.
TABLO 5.
‘Tepki süreleri’ ve ‘görevler’ altında kategorize edilen gruplara ilişkin Scaled AIC’nin betimsel istatistikleri
16 Daha düşük ortalamalar ve medyanlar ile daha küçük standart sapma ve çeyrekler arası aralık değerleri, daha yüksek güvenilirliğe ve aykırı ya da uç değerlere daha düşük duyarlılığa işaret eder.
Straipsniai / Articles
285
Page 14
CHARITON CHARITONIDIS
ŞEKİL 4. ‘Tepki süreleri’ ve ‘görevler’ altında kategorize edilen gruplara ilişkin Scaled AIC’nin kutu grafiği gösterimleri
6.1 bölümünde ele alınan Scaled AIC değerlerinin tüm kümesinde olduğu gibi, belirli deneylerle sınırlanmayan kapsayıcı ‘ELP’ ve ‘sözcüksel karar’ grupları için parametrik olmayan bir profilin ortaya çıkması beklenmiştir. Normallik testleri beklentilerimizi doğrulamıştır.
Shapiro–Wilk testine göre, ELP grubuna ait Scaled AIC verileri normallikten anlamlı biçimde sapmıştır. W (44) = 0.91, p <.01 test istatistiğini hesapladık. Benzer şekilde, sözcüksel karar grubuna ait Scaled AIC verileri de normallikten anlamlı biçimde sapmıştır. W (44) = 0.89, p <.001 test istatistiğini hesapladık.
Şimdi ana etkiler analizine geçelim. Temel amaç, gruplardan birinin etkileri kontrol edildiğinde BLP sözcüksel karar ve ELP adlandırma gruplarının daha iyi modelleri yordamaya devam edip etmediğini belirlemekti.
İzleyen istatistiksel testlerde, ‘tepki süreleri’ ve ‘görevler’ ana faktörleri altında kategorize edilen gruplara nominal değerler atanmıştır. BLP grubunun Scaled AIC ortalaması olan −3.623, referans hücre ya da sabit terim olarak kullanılmıştır.
Sonuçlar, hem tepki sürelerinin hem de görevlerin Scaled AIC üzerinde ana etkisi olduğunu, ancak etkileşim bulunmadığını göstermiştir. Özellikle, tepki sürelerinin ana etkisi anlamlıdır: F (1, 63) = 271.87, p <.001. Regresyon terimleriyle, ELP katsayısı daha yüksek, yani daha düşük nitelikli, bir Scaled AIC değerini yordamıştır; b = 0.37, SE = 0.02, t = 16.49, p <.001. Ayrıca görevlerin ana etkisi de anlamlıdır: F (1, 63) = 275.42, p <.001. Regresyon terimleriyle, adlandırma katsayısı daha düşük, yani daha iyi, bir Scaled AIC değerini yordamıştır; b = −0.37, SE = 0.02, t = −16.60, p <.001.
Şekil 5, ana etkilere nokta ve çizgi grafiği aracılığıyla genel bir bakış sunmaktadır. Sabit terim ya da referans hücre, hem en düşük ELP adlandırma hem de en yüksek BLP sözcüksel karar değerini, yani −3.623’ü ifade eder. Çizgiler üst üste yerleştirilmiştir
286
Acta Linguistica Lithuanica XC
Page 15
Exploring Scaled AIC within English Closed Compounds
dikey olarak; çünkü ELP sözcüksel karar ve BLP sözcüksel karar için Scaled AIC değerlerinin aralıkları birbirinden ayrıdır (bkz. Tablo 4). Ayrıca çizgiler paraleldir; çünkü görevler içinde ‘BLP adlandırma’ grubunun bulunmaması etkileşim etkilerini ortadan kaldırmıştır.
Özetle, ilgili faktirler karşılıklı olarak kontrol edildikten sonra bile BLP tepki süreleri ve adlandırma görevi sürekli olarak daha iyi Scaled AIC değerlerini yordamıştır. Bu bulgular, ilgili modellerin doğruluğunu ve etkililiğini artırmaktadır.
ŞEKİL 5. Scaled AIC için ana etkiler grafiği
Bu bölümde sunulan ana etkiler analizinin, görev performansından çok tepki sürelerinin kaynağına daha uygun olduğu belirtilmelidir; çünkü daha önce de belirtildiği üzere ‘BLP adlandırma’ birleşimi mevcut değildi. Bu durum, sonuçların belirli örneklemlerin ötesine genellenebilirliğini sınırlayabilir.
6.3. Scaled AIC ile kontrol değişkenlerinin karşılaştırılması
Bu bölümde vurgu, bileşik uzunluğu (karakter cinsinden) ve SUBTLEX-US sıklığı, yani SUBTLEX-US derleminden türetilen log bileşik sıklığı (Brysbaert, New 2009) olarak kontrol değişkenlerine yapılacaktır. Her iki değişken de Gagné ve diğerlerinin (2019) regresyon modellerinde kapsamlı biçimde kullanılmıştır.
Straipsniai / Articles
287
Page 16
CHARITON CHARITONIDIS
Bileşik uzunluğunun ve bileşik sıklığının Scaled AIC üzerindeki etkisini saptamak için ilgili regresyon katsayıları, pozitifliklerine ve anlamlılık düzeylerine göre sıralı değerlere yeniden kodlanmıştır; bkz. Tablo 6. Anlamlılık düzeyleri, kesin anlamlılık değerlerine dayalı geleneksel kesme noktalarını temsil ettikleri için sıralı ölçeklere eşlenmiştir.
TABLO 6. Regresyon katsayıları için sıralı yeniden kodlama çizelgesi
Anlamlılık Pozitiflik Sıralı değerler Açıklama p <.001 negatif −3 büyük negatif etki p <.01 negatif −2 orta düzeyde negatif etki p <.05 negatif −1 küçük negatif etki p >.05 negatif/pozitif 0 anlamlı olmayan etki p <.05 pozitif 1 küçük pozitif etki p <.01 pozitif 2 orta düzeyde pozitif etki p <.001 pozitif 3 büyük pozitif etki
Gagné ve diğerlerinin (2019) modellerinde SUBTLEX-US sıklığı her zaman p <.001 düzeyinde, büyük etkili negatif (=gecikmeyi azaltan) katsayılarla ilişkilendirilmiştir. Buna göre tüm katsayılar −3 olarak yeniden kodlanmıştır; bu değer, sonuç değişkeni olan Scaled AIC ile tam kollineerdir. Bu nedenle SUBTLEX-US sıklığı mevcut analizden çıkarılmıştır.
Bileşik uzunluğuna gelince, Gagné ve diğerlerinin (2019) modellerindeki tüm anlamlı regresyon katsayıları p <.001 düzeyinde büyük pozitif (=gecikmeye yol açan) etkiye sahipti. SUBTLEX-US değişkeninin aksine, anlamlı olmayan birkaç katsayı ortaya çıkmıştır. Bu örüntüler doğrultusunda, pozitif etki (=bileşik uzunluğunun girişimi) için ‘1’ ve etki yokluğu (=bileşik uzunluğunun girişimi yok) için ‘0’ değerlerini alan kategorik bir değişken oluşturulmuştur. Ortaya çıkan örneklem 39 Scaled AIC değeri içermiştir. Bileşik uzunluğu ile Scaled AIC arasındaki Pearson korelasyon testi, 0.51 gibi yüksek düzeyde anlamlı bir korelasyon katsayısı vermiştir, p =.001; bu da iki değişken arasında orta ila güçlü bir korelasyona işaret etmektedir.
Bileşik uzunluğu, doğrusal regresyon modeline tek bir bağımsız değişken olarak dâhil edilmiştir. Bileşik uzunluğunun girişiminin olmadığı durum için öngörülen Scaled AIC ortalamasının 3.611 (=sabit terim) olduğu bulunmuştur. Bileşik uzunluğunun girişimi, −3.407’lik daha yüksek (=daha düşük nitelikli) bir değerle sonuçlanmıştır (b = 0.204, p =.001). Aşağıdaki Şekil 6 bu örüntüleri göstermektedir. Kısacası, modeller içinde bileşik uzunluğu önem kazandığında Scaled AIC kötüleşmektedir.
288
Acta Linguistica Lithuanica XC
Page 17
Exploring Scaled AIC within English Closed Compounds
ŞEKİL 6. Bileşik uzunluğu ve Scaled AIC
Bileşik uzunluğunu ortak değişken olarak dikkate alarak tepki süresi kaynağı (ELP/BLP) ve görev performansı (sözcüksel karar/adlandırma) için ayrı ANOVA’lar yürüttük. Temel amaç, daha önce bileşik uzunluğunun kontrol edici etkilerine uyum sağlamak üzere düzeltilmiş ortalamalardaki farklılıkları belirlemekti.
(a) Tepki süresi kaynağı için ANOVA. BLP’ye ‘0’, ELP’ye ‘1’ değeri atanmıştır. Pearson korelasyon testi, tepki süresi kaynağı ile bileşik uzunluğu arasında güçlü bir kollineerlik olduğunu ortaya koymuştur, r = 1 (N = 39). Bulgumuzu şu kanıtlar desteklemektedir: Birincisi, ELP grubu sürekli olarak bileşik uzunluğuyla anlamlı pozitif korelasyonlar göstermiş ve bu büyük bir etkiye işaret etmiştir. İkincisi, BLP grubu bileşik uzunluğuyla sürekli olarak anlamlı olmayan korelasyonlar sergilemiştir. Sonuç olarak, tepki süresi kaynağı için öngörülen Scaled AIC ortalaması, analizde bileşik uzunluğu olsun ya da olmasın aynıydı (her iki durumda da M = 3.407). Özetle, tepki süresi kaynağı dâhil edildiğinde bileşik uzunluğunun Scaled AIC üzerinde anlamlı bir etkisi olmamıştır.
(b) Görev performansı için ANOVA. Adlandırmaya ‘0’, sözcüksel karara ‘1’ değeri atanmıştır. Pearson korelasyon testi, görev ile bileşik uzunluğu arasında negatif bir korelasyon bulunduğunu göstermiştir; bu orta düzeyde bir etkiye işaret etmektedir, r = −.5, p =.001 (N = 39). Bu sonuç, bileşik uzunluğunun sözcüksel karara kıyasla adlandırma için daha ilgili olduğunu göstermektedir.
17 BLP katsayılarının 13’ünden 11’inin negatif olduğu belirtilmelidir.
Straipsniai / Articles
289
Page 18
CHARITON CHARITONIDIS
Görev birincil değişken olarak ele alındığında, bileşik uzunluğu Scaled AIC’nin anlamlı bir yordayıcısı olmuştur, F (1, 145.030), p =.000. Benzer şekilde, bileşik uzunluğu birincil değişken olarak ele alındığında, görev Scaled AIC’nin anlamlı bir yordayıcısı olmuştur, F (1, 125.30), p =.000. Yalnızca görev için öngörülen Scaled AIC ortalaması, bileşik uzunluğu hesaba katıldığında öngörülen Scaled AIC ortalamasından anlamlı biçimde farklıdır (sırasıyla 3.584 ve 3.203). Aynı şekilde, yalnızca bileşik uzunluğu için öngörülen Scaled AIC ortalaması (3.584), görev hesaba katıldığında öngörülen Scaled AIC ortalamasından (−3.23) anlamlı biçimde farklıdır. Özetle, ortak değişken düzeltmesi açısından hem sözcüksel karar görevi hem de bileşik uzunluğu daha düşük nitelikli modelleri yordamıştır.
6.4. Scaled AIC ile şeffaflık normlarının karşılaştırılması
Bu bölüm, Gagné ve diğerlerinin (2019) modellerindeki anlamsal şeffaflık regresyon katsayılarının Scaled AIC üzerindeki etkisini incelemektedir. Bu regresyon katsayıları, üç biçimbilimsel düzeyin her birine karşılık gelen üç sıralı ölçekte kodlanmıştır: bileşik, birinci bileşen ve ikinci bileşen. Sıralı yeniden kodlama çizelgesi Tablo 6’da bulunabilir.
Aşağıdaki Tablo 7, üç biçimbilimsel düzeyin tümü için sıralı olarak dönüştürülmüş şeffaflık katsayılarının medyanlarını ve aralıklarını göstermektedir. Medyanlar, sıralı değerlerin merkezi eğilimi ve dağılımı hakkında yararlı bilgiler sağlar ve sıralı değişkenlere dayalı analizlerin yönlendirilmesine yardımcı olabilir.
TABLO 7. Sıralı olarak dönüştürülmüş şeffaflık katsayıları: Medyanlar ve aralıklar
Medyan Minimum Maksimum Bileşik −3 −3 −1 Birinci bileşen 2 −3 3 İkinci bileşen 0 −2 3
N = 18
Görülebileceği üzere, bileşik için medyan ‘−3’, birinci bileşen için medyan ‘2’ ve ikinci bileşen için medyan ‘0’dır. Bu bulgular, SUBTLEX–US sıklığını içeren Gagné ve diğerlerinin (2019) modellerinde bileşiğe ilişkin şeffaflığın büyük negatif bir etkiyle (daha kısa tepki süreleri), birinci bileşene ilişkin şeffaflığın orta düzeyde pozitif bir etkiyle (daha uzun tepki süreleri) ilişkili olduğunu; ikinci bileşene ilişkin şeffaflığın ise anlamlı bir etkiye sahip olmadığını ya da
290
Acta Linguistica Lithuanica XC
Page 19
Exploring Scaled AIC within English Closed Compounds
belirsiz bir rol üstlendiğini düşündürmektedir. Gagné ve diğerleri (a.g.e.) tarafından bildirilen ikinci bileşene ilişkin daha yüksek şeffaflık puanları, ikinci bileşen lehine doğuştan bir yanlılığa işaret etmekte ve bileşiğin genel şeffaflığının birinci bileşenin şeffaflığına bağlı olmasına yol açmaktadır. Bu bağlamda, birinci bileşen için pozitif, gecikmeye yol açan medyan, bu ilişkideki aracılık eden ve muhtemelen gönderim oluşturan rolüne işaret etmektedir (ayrıca bkz. bölüm 1). İkinci bileşenin doğuştan yanlılığını işleme açısından yeterince temsil eden anlamsal işlevlerin hangileri olduğu henüz gösterilmemiştir.18
Şimdi ele alınacak araştırma sorusu, şeffaflık katsayılarının pozitifliğinin ve anlamlılık düzeyinin Scaled AIC’yi etkileyip etkilemediğidir. Yöntemimiz öncelikle aşırı uyum etkilerini saptamayı amaçlamaktadır. Daniel J. Navarro ve Jay I. Myung’un (2005) ileri sürdüğü üzere, “çok sayıda parametreye ve yüksek derecede doğrusal olmayan biçime sahip karmaşık bir model, verileri, veriyi üretmiş olan az sayıda parametreli basit bir modelden çoğu zaman daha iyi uydurabilir” (Navarro, Myung 2005: 1240). Buna göre, çok sayıda parametre mevcut verilerin gürültüsünü veya özgün özelliklerini yakalayabilir, ancak modelin yeni verilere genelleme yeteneğini engelleyebilir. AIC, bir modele çok sayıda parametrenin dâhil edilmesine ceza uygulayarak aşırı uyum sorununu azaltır; bkz. bölüm 2’deki AIC denkleminin ‘+2k’ kısmı.
İzleyen analiz bakımından, daha yüksek (=daha düşük nitelikli) Scaled AIC değerleri sergileyen modellerin anlamlı, sistematik olarak türetilmiş katsayılara, yani yalnızca LADEC veri kümesine göre ilgili olan katsayılara sahip olabileceği varsayılmaktadır. Bu bağlamda varsayımımız, Tablo 7’deki medyanların gösterdiği eğilime kıyasla, şeffaflık ile Scaled AIC arasındaki ilişkide karşıt bir eğilimin ortaya çıkabileceğini öne sürmektedir.
Özellikle daha düşük (=daha iyi) Scaled AIC değerleri (a) bütün bileşiğe ilişkin pozitif katsayılarla (daha uzun tepki süreleri), (b) birinci bileşene ilişkin negatif katsayılarla (daha kısa tepki süreleri) ve (c) ikinci bileşene ilişkin pozitif veya negatif katsayılarla (sırasıyla daha uzun veya daha kısa tepki süreleri) ilişkili olabilir. İkinci bileşen bakımından Tablo 7’deki medyanın herhangi bir etki olmadığını gösterdiği belirtilmelidir.
Araştırma sorusunu yanıtlamak için iki parametrik olmayan ölçü kullanılacaktır: Kruskal–Wallis testi ve Jonckheere–Terpstra testi. ‘H testi’ olarak da bilinen Kruskal–Wallis testi, şu temele dayanan parametrik olmayan bir testtir:
18 Charitonidis (2024)’te, ikinci bileşen için hem alt türlülük hem de bağlam somutluğunun sözcüksel karar ve adlandırmada anlamlı anlamsal yordayıcılar olduğu ileri sürülmektedir. Orada sunulan analiz, bu yordayıcıların her ikisinin dâhil edilmesinin, bu değişkenlerden herhangi birini dışlayan modellerle karşılaştırıldığında Scaled AIC ve R2 değerlerinde iyileşme sağladığını göstermektedir.
Straipsniai / Articles
291
Page 20
CHARITON CHARITONIDIS
ki-kare dağılımı. Bağımlı değişkenin sıralı veya sürekli olmasını gerektirir. Bu test, iki ya da daha fazla grubun medyanları arasında anlamlı farklar bulunup bulunmadığını belirlemek üzere tasarlanmıştır ve tek yönlü ANOVA’ya alternatif olarak kullanılır. İşlem bakımından, sürekli bağımlı değişkenin, yani Scaled AIC’nin değerleri düşükten yükseğe sıralanmış ve puanlara sıra numaraları atanmıştır. Ortaya çıkan sıralar, anlamlılık düzeyi gruplarına (bağımsız değişken) yeniden yerleştirilmiş ve her grup için sıralar toplanmıştır. ‘H’nin hesaplanmasına ilişkin formül, diğerlerinin yanı sıra, her grup için sıra toplamının karesinin alınmasını ve ardından bu değerin örneklem büyüklüğüne bölünmesini içeriyordu.
Tablo 8–10, dikkate alınan girdi verilerini ve her grup için sıra toplamını içermektedir.
19
20
her grup için sıra toplamı.
TABLO 8. Bileşik
Anlamlılık düzeyleri | N | Scaled AIC Sıra Toplamı | 1 – küçük negatif etki | 1 | 2 | 2 – orta düzeyde negatif etki | 5 | 46 | 3 – büyük negatif etki | 12 | 123 | Toplam | 18 |
TABLO 9. Birinci bileşen
Anlamlılık düzeyleri | N | Scaled AIC Sıra Toplamı | 1 – büyük pozitif etki | 6 | 59 | 2 – orta düzeyde pozitif etki | 4 | 34 | 3 – küçük pozitif etki | 1 | 3 | 4 – etki yok | 1 | 2 | 5 – küçük negatif etki | 1 | 10 | 6 – orta düzeyde negatif etki | 1 | 11 | 7 – büyük negatif etki | 4 | 52 | Toplam | 18 |
19 Hesaplamaların geri kalanı için bkz. Field (2009: 561–562).
20 Her üç tabloda da sıra toplamı yaklaşık olarak 171’dir. Bu, örneklem büyüklüğüne (N) bakınız, 1’den 18’e kadar olan tam sayıların toplamına eşittir.
292
Acta Linguistica Lithuanica XC
Page 21
Exploring Scaled AIC within English Closed Compounds
TABLO 10. İkinci bileşen
Scaled AIC | Anlamlılık düzeyleri | N | Scaled AIC Sıra Toplamı | 1 – büyük pozitif etki | 6 | 59 Scaled AIC | 2 – küçük pozitif etki | 1 | 14 Scaled AIC | 3 – etki yok | 8 | 59 Scaled AIC | 4 – küçük negatif etki | 1 | 18 Scaled AIC | 5 – orta düzeyde negatif etki | 2 | 21 | Toplam | 18 |
Kruskal-Wallis (H) testinin sonuçlarına geçmeden önce, bu testin tek tek gruplar arasındaki özgül farklar hakkında bilgi sağlamadığını belirtmek önemlidir. Bu sorunu ele almak için Jonckheere-Terpstra (JT) testi ayrıca kullanılmıştır. Bu test, grupların medyanlarının kodlama (=gruplama) değişkeni tarafından belirtilen sırada, özellikle büyük pozitif etkiden büyük negatif etkiye doğru artıp azalmadığı hakkında bilgi sağlamıştır. Yöntemler bakımından JT istatistiği bir z-puanına dönüştürülmüştür. Pozitif z-değeri, medyanların yükselen bir eğilime sahip olduğunu, yani kodlama değişkeninin değerleri arttıkça medyanların arttığını (=daha yüksek/daha düşük nitelikli Scaled AIC) göstermiştir. Negatif z-değeri, medyanların alçalan bir eğilime sahip olduğunu, yani kodlama değişkeninin değerleri arttıkça medyanların azaldığını (=daha düşük/daha iyi Scaled AIC) göstermiştir. Aşağıda Kruskal-Wallis (H) ve Jonckheere-Terpstra (JT) testlerinin sonuçları birlikte verilmiştir.
(a) Bileşiğe ilişkin Scaled AIC, Kruskal-Wallis testinin belirlediği üzere anlamlılık düzeyinden anlamlı biçimde etkilenmemiştir (H (2) = 2.226, p >.05). Medyanların yükselen bir eğilimi bulunmuş ve bu, bileşik için Tablo 7’deki negatif medyanda görülen aşırı uyum hipotezimizi doğrulamıştır. Ancak bu eğilim, Jonckheere-Terpstra testine göre istatistiksel olarak anlamlı değildir (JT = 50, z = 1.064, p >.05).
(b) Birinci bileşene ilişkin Scaled AIC, Kruskal-Wallis testinin belirlediği üzere anlamlılık düzeyinden anlamlı biçimde etkilenmemiştir (H (6) = 5.427, p >.05). Medyanların yükselen bir eğilimi bulunmuş ve bu, Tablo 7’de birinci bileşen için verilen pozitif medyanda görülen aşırı uyum hipotezimizi reddetmiştir. Ancak bu eğilim, Jonckheere-Terpstra testine göre istatistiksel olarak anlamlı değildir (JT = 70, z = 0.549, p >.05).
(c) İkinci bileşene ilişkin Scaled AIC, Kruskal-Wallis testinin belirlediği üzere anlamlılık düzeyinden anlamlı biçimde etkilenmemiştir (H (4) = 4.607, p >.05). Medyanların artan ya da azalan bir eğilimi gözlenmemiş ve bu, hipotezimizi reddetmiştir
Straipsniai / Articles
293
Page 22
CHARITON CHARITONIDIS
aşırı uyum hipotezimizi reddetmiştir. Özellikle, Jonckheere–Terpstra testinin z-istatistiği, Tablo 7’de ikinci bileşen için verilen sıfır medyanla uyumlu olarak esasen sıfırdır (JT = 54, z = 0.041, p >.05).
Özetle, SUBTLEX-US sıklığı içeren Gagné ve diğerlerinin (2019) modellerindeki şeffaflık katsayılarının anlamlılık düzeyi Scaled AIC’nin büyüklüğünü etkilememektedir. Bu bulgu, Gagné ve diğerlerinin (2019) şeffaflık yordayıcılarını içeren modellerinin niteliğini dolaylı olarak desteklemekte ve özellikle bu modeller için aşırı uyum hipotezinin geçerli olmadığını göstermektedir. Mevcut çalışmanın bir sınırlılığı, N = 18 olan küçük örneklem büyüklüğüdür. Bulgularımızı doğrulamak için daha geniş bir Scaled AIC değerleri aralığı kullanılarak daha fazla araştırma yapılması gerekmektedir.
Araştırma sonuçlarımızı açık ve eksiksiz biçimde sunmak için çalışmamızın temel bulgularını özetlemeye ayrılmış özel bir bölüm ekledik. Bu kapsamlı genel bakış için lütfen Bölüm 7’ye geçiniz.
7. TEMEL BULGULAR
Aşağıdaki Tablo 11, Gagné ve diğerlerinin (2019) bulgularına dayanarak sözcüksel karar ve adlandırma görevleri bağlamında model performansının ve ilgili değişkenlerin kapsamlı bir analizini sunmaktadır. Tablonun her bölümü belirli konuları ele alarak hangi modellerin en etkili olduğunu ortaya koymaktadır. ANOVA ile Kruskal–Wallis/Jonckheere–Terpstra testleri (6.3 ve 6.4 bölümleri), Gagné ve diğerlerinin (2019) modellerindeki regresyon katsayılarına nominal (sıralı veya kategorik) değerler atandıktan sonra uygulanmıştır. Uygulanan özel testlerin ayrıntıları için lütfen ilgili bölümlere başvurunuz.
TABLO 11.
İngilizce kapalı bileşiklerde Scaled AIC: Sözcüksel karar ve adlandırma görevlerinde model performansının kapsamlı analizi (Gagné ve diğerleri 2019)
294
Acta Linguistica Lithuanica XC
Page 23
Exploring Scaled AIC within English Closed Compounds
Konular | İstatistikler | Değerlendirme | Bölüm Kontrol değişkenleri | ANOVA | Bileşik sıklığı ✓; Bileşik uzunluğu ~ | 6.3 Anlamsal şeffaflık | Kruskal–Wallis Jonckheere–Terpstra | Birinci bileşen NOF/ns; İkinci bileşen NOF/ns; Bileşik NOF/ns | 6.4
PAR: parametrik veri | NPAR: parametrik olmayan veri | ✓: daha iyi modeller (daha düşük AIC) ~: daha düşük nitelikli modeller (daha yüksek AIC) | NOF/ns: aşırı uyum yok/anlamlı olmayan test
8. TARTIŞMA
Charitonidis’in (2022, 2024) önceki araştırmaları, Scaled AIC’nin model seçiminde, muhtemelen Wald testi gibi diğer ölçütlerle birlikte kullanılabilecek güvenilir bir uyum iyiliği ölçüsü olduğunu göstermiştir (bkz. bölüm 3). SUBTLEX-US sıklığını içeren Gagné ve diğerlerinin (2019) çoklu regresyon modellerine atıfla, mevcut analiz Scaled AIC ölçütünün ek özelliklerini ortaya koymuştur. Farklı örneklem büyüklükleri üzerinde uydurulan modellerin bilgi ölçütleri kullanılarak karşılaştırılmasına ilişkin haklı kaygılar dile getirilmiş olsa da (bkz. bölüm 2), bu çalışmanın bulguları belirli bağlamlarda Scaled AIC’nin model uyumunu değerlendirmek ve regresyon modellerini hiyerarşik olarak düzenlemek için gerçekten değerli bir araç olabileceğini göstermektedir. Araştırmamız, Scaled AIC’nin deneysel tasarıma, tepki süresi kaynaklarına ve belirli görevlere duyarlı olduğunu göstermiştir. Bununla birlikte, Scaled AIC’nin uygulanabilirliğinin bağlama bağlı olabileceğini ve yararlılığının duruma göre değerlendirilmesi gerektiğini kabul etmek önemlidir.
Bu makalenin temel bulgularına geçmeden önce, bölüm 4’te ortaya konan araştırma sorularını ele almak önemlidir.
1. Farklı tepki süresi kaynakları ve işlemleme görevlerinin bileşimleriyle birlikte Scaled AIC değerlerinin dağılımları, Scaled AIC’nin deneysel tasarımda ve istatistiksel modellemede iyi tanımlanmış temel etmenlerin varlığını ya da yokluğunu etkili biçimde belirlediğini göstermektedir. Bu bağlamda, BLP lexical decision ve ELP naming, kontrollü koşullarda dahi Scaled AIC için daha güçlü öngörü gücü sergilemiştir.
2. Compound frequency, istisnasız biçimde Scaled AIC’nin negatif bir öngörücüsü olmuş ve her zaman büyük bir etkiye işaret etmiştir. ELP lexical decision tutarlı olarak şunu göstermiştir
Straipsniai / Articles
295
Page 24
CHARITON CHARITONIDIS
compound length ile anlamlı pozitif korelasyonlar sergileyerek daha yüksek (=daha düşük nitelikli) Scaled AIC değerlerini öngörmüştür. BLP lexical decision, compound length ile sürekli olarak anlamlı olmayan korelasyonlar göstermiştir. Hem lexical decision hem de compound length, kovaryat düzeltmesinde daha düşük nitelikli modelleri öngörmüştür.
Gagné et al.’s (2019) modellerindeki transparency katsayılarının pozitifliği ve anlamlılık düzeyi, Scaled AIC’nin büyüklüğünü etkilememiştir. Bu bulgu, Gagné et al.’s (2019) transparency öngörücülerini içeren modellerinin aşırı uyum yanlılığı yaratmadığını göstermektedir.
Analizlerin belirli bölümlerine atıfta bulunularak, bu çalışmanın temel bulguları aşağıdaki şekilde özetlenebilir:
Section 6.1’de analizimiz, çeşitli model kategorileri arasındaki Scaled AIC değerlerinin karşılaştırılmasına odaklanmıştır. Mutlak değerlere ‘natural logarithm’ ve ‘square root’ dönüşümlerini uygulamayı denedikten sonra bile, genel Scaled AIC örneklemi normal dağılıma uymamıştır. Benzer şekilde, ELP lexical decision modelleri de Scaled AIC değerlerinin parametrik olmayan bir dağılımını sergilemiştir. Buna karşılık, BLP lexical decision ve ELP naming ile ilgili veriler normal dağılım örüntüsünü izlemiştir.
Section 6.2’de odağımız, Scaled AIC ile (a) tepki süresi kaynakları ve (b) görev performansı arasındaki ilişkiyi incelemeye kaymıştır. İlginç olarak, ELP ve BLP lexical decision modellerinin Scaled AIC değer aralıkları örtüşmemiş ve bu da aralarındaki farklılığa işaret etmiştir. Test sonuçları, hem tepki süresi kaynağının hem de görev performansının Scaled AIC üzerinde anlamlı ana etkileri olduğunu ortaya koymuştur. Özellikle, Scaled AIC’nin öngörü kapasitesi BLP lexical decision süreleri ve naming göreviyle ilişkili modeller için daha iyi olmuştur. Bu bulgular, ilgili modellerin kesinliğine ve etkililiğine önemli ölçüde katkıda bulunmaktadır.
Section 6.3’te incelememiz, Scaled AIC ile ‘compound frequency’ ve ‘compound length’ kontrol değişkenleri arasındaki ilişkiye yönelmiştir. Compound frequency, Scaled AIC ile mükemmel doğrusal bağlantı içinde olduğu için analizden çıkarılmıştır. Öte yandan, compound length modeller içinde ilgili bir etmen hâline geldiğinde Scaled AIC değerlerinde bir düşüş gözlenmiştir. Eşzamanlı olarak, compound length naming görevi için en ilgili değişken olmuştur.
Kovaryat düzeltmesi bakımından, hem lexical decision görevi hem de compound length daha düşük nitelikli modellerin öngörücüsü olmuştur.
Section 6.4’te odağımız, Scaled AIC ile semantic transparency arasındaki ilişkiye yönelmiştir. Araştırma sorusu, Gagné et al.’s (2019) modellerindeki transparency katsayılarının pozitifliğinin ve anlamlılık düzeyinin Scaled AIC üzerinde bir etkisi olup olmadığıydı. Yöntemimizin temel amacı, olası aşırı uyum etkilerini saptamaktı. Daha düşük Scaled AIC değerlerine sahip modellerin, anlamlı ve ilgili katsayılara sahip olabileceğini öne sürdük
296
Acta Linguistica Lithuanica XC
Page 25
Exploring Scaled AIC within English Closed Compounds
yalnızca LADEC veri kümesine göre. Birleşik sözcük düzeyinde anlamlı negatif katsayılardan oluşan bir küme için artan (=daha düşük nitelikli) Scaled AIC değerleri eğilimi gözlemlemiş olsak da —bu, aşırı uyum hipotezimizle örtüşmektedir— Jonckheere–Terpstra testi, bu eğilimin istatistiksel anlamlılığa ulaşmadığını göstermiştir.
Sonuç olarak, Scaled AIC’nin bağımlı değişken olarak kullanıldığı farklı parametrelerin incelenmesi; model kategorilerinin, tepki süresi kaynağının, işlemleme görevlerinin, kontrol değişkenlerinin ve anlamsal saydamlığın modellerin goodness-of-fit’i üzerinde etkili olduğu çeşitli yolları aydınlatmıştır. Bu unsurlar arasındaki incelikli ilişkilerin farkına vararak araştırmacılar, model seçimi, düzeltmeleri ve yorumlanması konusunda bilinçli kararlar vermek için daha iyi bir konuma gelmektedir.
REFERENCES
Akaike Hirotugu 1973: Information Theory and an Extension of the Maximum Likelihood Principle. – Second International Symposium on Information Theory, eds. B. F. Csaki, B. N. Petrov, Budapest: Academiai Kiado, 267–281.
Aldrich John R. 1997: R. A. Fisher and the Making of Maximum Likelihood 1912–1922. – Statistical Science 12(3), 162–176.
Baayen Harald R., Piepenbrock Richard, Gulikers Leon 1995: The CELEX Lexical Database (Data set, Release 2, CD-ROM), Linguistic Data Consortium, University of Pennsylvania. Available at: https://catalog.ldc.upenn.edu.
Balota David A., Yap Melvin J., Cortese Michael J., Hutchison Keith I., Kessler Brett, Loftis Bjorn, Neely James H., Nelson Douglas L., Simpson Greg B., Treiman Rebecca 2007: The English Lexicon Project. – Behavior Research Methods 39, 445–459.
Brysbaert Marc, New Boris 2009: Moving Beyond Kučera and Francis: A Critical Evaluation of Current Word Frequency Norms and the Introduction of a New and Improved Word Frequency Measure for American English. – Behavior Research Methods 41, 977–990. DOI: doi.org/10.3758/BRM.41.4.977.
Burnham Kenneth P., Anderson David R. 2002: Model Selection and Multimodal Inference: A Practical Information-Theoretic Approach, 2ⁿᵈ edition, New York: Springer. DOI: dx.doi.org/10.1007/b97636.
Charitonidis Chariton 2022: Context Concreteness for the Second Constituent Slows Down Compound-Word Processing. – Lexis 20. DOI: doi.org/10.4000/lexis.6769.
Straipsniai / Articles
297
Page 26
CHARITON CHARITONIDIS
Charitonidis Chariton 2024: The Role of Hyponymy and Context Concreteness in Compound Word Processing. – Studia Neophilologica. DOI: doi.org/10.1080/00393274.2024.2336851.
Chen Xiaocong, Dong Yanping, Yu Xiufen 2018: On the Predictive Validity of Various Corpus-Based Frequency Norms in L2 English Lexical Processing. – Behavior Research Methods 50, 1–25. DOI: doi.org/10.3758/s13428-017-1001-8.
Field Andy 2009: Discovering statistics using SPSS, 3rd edition, London: Sage Publications.
Fisher Ronald A. 1922: On the Mathematical Foundations of Theoretical Statistics. – Philosophical Transactions of the Royal Society of London, Series A 222, 309–368.
Gagné Christina L., Spalding Thomas L., Schmidtke Daniel 2019: LADEC: The Large Database of English Compounds. – Behavior Research Methods 51, 2152–2179. DOI: doi.org/10.3758/s13428-019-01282-6.
Gagné Christina L., Spalding Thomas L., Spicer Patricia, Wong Dixie, Rubio Beatriz, Perez-Cruz Karen 2020: Is Buttercup a Kind of Cup? Hyponymy and Semantic Transparency in Compound Words. – Journal of Memory and Language 113. DOI: doi.org/10.1016/j.jml.2020.104110.
Hastie Trevor, Tibshirani Robert, Friedman Jerome 2009: The Elements of Statistical Learning: Data Mining, Inference, and Prediction. 2nd edition, New York: Springer.
Keuleers Emmanuel, Lacey Paula, Rastle Kathleen, Brysbaert Marc 2012: The British Lexicon Project: Lexical Decision Data for 28,730 Monosyllabic and Disyllabic English Words. – Behavior Research Methods 44, 287–304. DOI: doi.org/10.3758/s13428-011-0118-4.
Kullback Solomon 1959: Information Theory and Statistics. New York: Wiley.
Navarro Daniel J., Myung Jay I. 2005: Model Evaluation. – Encyclopedia of Statistics in Behavioral Science, vol. 3, eds. B. S. Everitt, D. C. Howell, Chichester: Wiley, 1239–1242.
Steiger James H. 1980: Tests for Comparing Elements of a Correlation Matrix. – Psychological Bulletin 87(2), 245–251. DOI: doi.org/10.1037/0033-2909.87.2.245.
Wagenmakers Eric-Jan, Farrell Simon 2004: AIC Model Selection Using Akaike Weights. – Psychonomic Bulletin & Review 11(1), 192–196.
298
Acta Linguistica Lithuanica XC
Page 27
Exploring Scaled AIC within English Closed Compounds
I N T E R N E T D I S C U S S I O N S
Model comparison with AIC based on different sample size. Available at: https://stats.stackexchange.com/questions/94718/model-comparison-with-aic-based-on-different-sample-size [accessed 15.5.2024].
What is the acceptable range of skewness and kurtosis for normal distribution of data? Available at: https://www.researchgate.net/post/What_is_the_acceptable_range_of_skewness_and_kurtosis_for_normal_distribution_of_data [accessed 15.5.2024].
L A R G E L A N G U A G E M O D E L S
GPT-3.5 (available at: https://chat.openai.com/) and Google Gemini (available at: https://gemini.google.com [accessed 11.10.2023]) were selectively used as auxiliary proofreading and editing tools. The responses from both AI tools were further proofread and edited by the author.
Anglų kalbos uždarųjų junginių (sudurtinių žodžių) skalės AIC tyrimas
S A N T R A U K A
Šiame tyrime nagrinėjamos modifikuotos Akaikės informacijos kriterijaus, pavadinto skalės kriterijumi, t. y. AIC, kaip tinkamumo rodiklio, padalinto iš imties dydžio, varianto ypatybės. Tyrimo objektas – 66 daugialypės regresijos modeliai, susiję su uždarųjų (sudurtinių) anglų kalbos žodžių junginių, paimtų iš Gagné'es ir kitų (2019) Anglų kalbos sudurtinių žodžių (junginių) didžiosios duomenų bazės (angl. LADEC), apdorojimu. Toliau pateikiami išsamios analizės rezultatai:
1. Modelių kategorijų modeliai pasižymi nevienareikšmiais rezultatais. Britų kalbos žodyno projekto (angl. BLP) leksinių sprendimų modeliai ir Anglų kalbos žodyno projekto (angl. ELP) įvardijimo modeliai veikia geriau (tai rodo mažesnis AIC), palyginus su Anglų kalbos žodyno projekto (angl. ELP) leksinių sprendimų modeliais.
Straipsniai / Articles
299
Page 28
CHARITON CHARITONIDIS
2. Laiko šaltinio ir leksikos apdorojimo užduočių atsakymais atskleidžia reikšmingus pagrindinius skalės AIC rezultatus. Britų kalbos žodyno projekto leksinių sprendimų modeliai ir Anglų kalbos žodyno projekto įvardijimo modeliai veikia gerai, o pastarojo projekto leksinių sprendimų modeliai yra mažiau veiksmingi.
3. Įvertinus kontrolinius kintamuosius, tokius kaip junginių dažnumas ir junginių ilgis, matyti, kad modelių rezultatyvumas skiriasi. Junginių dažnumas yra stiprus veiksnys (parodo didesnis produktyvumas), o sudėtinio ilgio modelių prognozės blogesnės.
4. Kalbant apie pirmosios ir antrosios žodžių junginių sudedamųjų dalių, taip pat ir apie junginių semantinį skaidrumą, modeliai nerodo per didelio suderinamumo. Tai parodo, kad semantinis skaidrumas nesumažina modelių galėjimo apibendrinti naujus duomenis.