CHARITON CHARITONIDIS Ανεξάρτητος ερευνητής ORCID id: orcid.org/0000-0003-0298-2629 Πεδία έρευνας: σχηματισμός λέξεων, πολυλεκτικές εκφράσεις, λεξική σημασιολογία, αναγνώριση λέξεων, συναίσθημα. DOI: doi.org/10.35321/all90-11
ΔΙΕΡΕΥΝΗΣΗ ΤΟΥ SCALED AIC ΣΤΑ ΑΓΓΛΙΚΑ ΚΛΕΙΣΤΑ ΣΥΝΘΕΤΑ
Διερεύνηση του Scaled AIC στα αγγλικά κλειστά σύνθετα (σύνθετες λέξεις)
ΠΕΡΙΛΗΨΗ
Το Κριτήριο Πληροφορίας του Akaike (AIC) είναι ένα καθιερωμένο μέτρο καλής προσαρμογής για την επιλογή μοντέλων στην ανάλυση εμπειρικών δεδομένων. Ωστόσο, το AIC είναι ευαίσθητο στο μέγεθος του δείγματος. Προηγούμενη έρευνα του συγγραφέα έχει δείξει ότι το Scaled AIC, δηλαδή το AIC διαιρεμένο διά του μεγέθους του δείγματος, αποτελεί αποτελεσματικό εργαλείο για την αξιολόγηση της προσαρμογής μοντέλων και την ιεράρχηση μοντέλων παλινδρόμησης. Η παρούσα μελέτη διερευνά περαιτέρω ιδιότητες αυτής της μεταβλητής. Αντικείμενο της έρευνας είναι 66 μοντέλα πολλαπλής παλινδρόμησης που αφορούν την επεξεργασία αγγλικών κλειστών (συνεκφερόμενων) σύνθετων λέξεων, τα οποία αντλήθηκαν από τη Large Database of English Compounds (LADEC) των Gagné et al. (2019). Ειδικότερα, το Scaled AIC αντιπαραβάλλεται με το English Lexicon Project (ELP) και το British Lexicon Project (BLP) ως πηγές χρόνων απόκρισης, τις εργασίες λεξικής απόφασης και ονομασίας, το μήκος των σύνθετων λέξεων και τους κανόνες διαφάνειας. Ως μέθοδοι χρησιμοποιούνται η μονοπαραγοντική ANOVA, η ανάλυση κύριων επιδράσεων και μη παραμετρικές δοκιμασίες. Τα ευρήματα υποδεικνύουν ότι το Scaled AIC ανταποκρίνεται στον πειραματικό σχεδιασμό, στην πηγή των χρόνων απόκρισης και στις εργασίες λεξικής απόφασης και ονομασίας. Παράλληλα, τα αποτελέσματα της μελέτης παρέχουν εμπειρική υποστήριξη για την επικύρωση των μεθόδων που χρησιμοποιήθηκαν από τους Gagné et al. (2019).
ΛΕΞΕΙΣ-ΚΛΕΙΔΙΑ: αγγλικά σύνθετα, Scaled AIC, λεξική απόφαση, ονομασία.
ΠΕΡΙΛΗΨΗ
Το Κριτήριο Πληροφορίας του Akaike (αγγλ. AIC) είναι ένα σταθερό μέτρο καλής προσαρμογής μοντέλων, το οποίο εφαρμόζεται στην ανάλυση εμπειρικών δεδομένων. Ωστόσο, το AIC είναι ευαίσθητο στο μέγεθος του δείγματος. Προηγούμενες
Straipsniai / Articles
273
CHARITON CHARITONIDIS
έρευνες του συγγραφέα έδειξαν ότι το Scaled AIC, διαιρεμένο διά του μεγέθους του δείγματος, αποτελεί αποτελεσματικό εργαλείο για την αξιολόγηση της προσαρμογής του μοντέλου και την ιεράρχηση μοντέλων παλινδρόμησης. Στην παρούσα μελέτη εξετάζονται περαιτέρω ιδιότητες αυτής της μεταβλητής. Αντικείμενο της έρευνας είναι 66 μοντέλα πολλαπλής παλινδρόμησης που σχετίζονται με την επεξεργασία αγγλικών κλειστών (σύνθετων) λέξεων, οι οποίες αντλήθηκαν από τη Large Database of English Compounds (αγγλ. LADEC) των Gagné και άλλων (2019). Αρχικά, το Scaled AIC αντιπαραβάλλεται με το English Lexicon Project (αγγλ. ELP) και το British Lexicon Project (αγγλ. BLP), ως πηγές χρόνων απόκρισης, εργασιών λεξικής απόφασης και ονομασίας, μήκους σύνθετων λέξεων και κανόνων διαφάνειας. Οι μέθοδοι που χρησιμοποιούνται είναι η μονοπαραγοντική ANOVA (αγγλ. Analysis of variance), η ανάλυση κύριων αποτελεσμάτων και μη παραμετρικές δοκιμασίες. Τα συμπεράσματα δείχνουν ότι το Scaled AIC ανταποκρίνεται στον πειραματικό σχεδιασμό, στην πηγή των χρόνων απόκρισης και στις εργασίες λεξικής απόφασης και ονομασίας. Ταυτόχρονα, τα αποτελέσματα της παρούσας μελέτης παρέχουν εμπειρική βάση για την επικύρωση των μεθόδων που εφαρμόστηκαν από τους Gagné και άλλους (2019).
ΒΑΣΙΚΕΣ ΛΕΞΕΙΣ: αγγλικά σύνθετα (σύνθετες λέξεις), Scaled AIC, λεξική απόφαση, ονομασία.
1. Η LARGE DATABASE OF ENGLISH COMPOUNDS (LADEC: GAGNÉ ET AL. 2019)¹
Η Large Database of English Compounds (LADEC: Gagné et al. 2019) είναι η μεγαλύτερη υφιστάμενη βάση δεδομένων σύνθετων λέξεων. Περιέχει περισσότερα από 8000 μη διαχωριζόμενα («κλειστά» ή «συνεκφερόμενα») σύνθετα (=ουσιαστικά) που επιλέχθηκαν από διάφορες πηγές, μεταξύ άλλων από τη βάση δεδομένων CELEX (Baayen et al. 1995), το English Lexicon Project (ELP· Balota et al. 2007), το British Lexicon Project (BLP· Keuleers et al. 2012), το British National Corpus (BNC) και το Wordnet. Από το πλήρες σύνολο των καταχωρίσεων της LADEC, 7,804 σύνθετα μπορούν να αναλυθούν μοναδικά σε δύο ελεύθερα μορφηματικά συστατικά.² Εξετάζεται μια τεράστια ποικιλία σύνθετων, όπως, για παράδειγμα, σύνθετα ουσιαστικό-ουσιαστικό, π.χ. buttercup, shipyard, σύνθετα με δεύτερο συστατικό προερχόμενο από ρηματικό θέμα, π.χ. pacemaker, painkiller, κ.λπ. (για τους ορισμούς των κατηγοριών σύνθετων λέξεων βλ. Lieber 2004: 46). Το πρώτο συστατικό, που δεν είναι κεφαλή, αναφέρεται σε ευρύ φάσμα γραμματικών κατηγοριών. Το Figure 1 περιέχει ένα σύντομο δείγμα καταχωρίσεων της LADEC.
Τα μοντέλα πολλαπλής παλινδρόμησης των Gagné et al. (2019) περιλαμβάνουν ένα ευρύ φάσμα προγνωστικών (= ανεξάρτητων) μεταβλητών, όπως το μήκος της σύνθετης λέξης, η συχνότητα διγράμματος
¹ Η ενότητα αυτή προσαρμόστηκε από το έργο του Chariton Charitonidis (2022), με μικρές τροποποιήσεις.
² Η LADEC περιλαμβάνει τους πληθυντικούς τύπους σύνθετων λέξεων που έχουν ήδη καταχωριστεί, ως ξεχωριστές καταχωρίσεις.
274
Acta Linguistica Lithuanica XC
Exploring Scaled AIC within English Closed Compounds
στο όριο του μορφήματος, το μέγεθος της οικογένειας, η συχνότητα λέξης, μέτρα πιθανότητας και συνάφειας (βασισμένα σε διανύσματα), συναισθηματικοί/θυμικοί κανόνες που υπολογίστηκαν από αξιολογήσεις συμμετεχόντων κ.λπ. Οι λογαριθμικοί χρόνοι απόκρισης για τις σύνθετες λέξεις από το ELP (λεξική απόφαση, ονομασία) και το BLP (λεξική απόφαση) χρησιμοποιούνται ως εξαρτημένες μεταβλητές. Ως επί το πλείστον, το μήκος της σύνθετης λέξης (αριθμός χαρακτήρων) και η λογαριθμική συχνότητα της σύνθετης λέξης (= λέξης) από το σώμα SUBTLEX-US (Brysbaert, New 2009)³ και το BNC (BLP) χρησιμοποιούνται ως μεταβλητές ελέγχου. Στα μοντέλα των Gagné et al. (2019), οι προαναφερθείσες προγνωστικές μεταβλητές είχαν σημαντικές επιδράσεις στους χρόνους λεξικής απόφασης και ονομασίας.
ΣΧΗΜΑ 1. Καταχωρίσεις LADEC: δείγμα
Το κύριο ενδιαφέρον στη μελέτη των Gagné et al. (2019) επικεντρώθηκε σε διάφορα μέτρα σημασιολογικής διαφάνειας. Οι Gagné et al. (2019) ζήτησαν από τους συμμετέχοντες να αξιολογήσουν σύνθετες λέξεις, λαμβάνοντας υπόψη πόσο προβλέψιμη είναι η σημασία της σύνθετης λέξης από τα μέρη της (αξιολογήσεις προβλεψιμότητας της σημασίας, βασισμένες στη σύνθετη λέξη) και πόσο από τη σημασία καθενός από τα συστατικά διατηρείται στη σύνθετη λέξη (αξιολογήσεις διατήρησης της σημασίας, βασισμένες στο συστατικό). Οι συγγραφείς διαπίστωσαν ότι η κατανομή των βαθμών διαφάνειας για το δεύτερο συστατικό ήταν πολύ πιο αιχμηρή και υψηλότερη από την κατανομή των βαθμών διαφάνειας για το πρώτο συστατικό (MC1: 64.80 [SD: 19.59] έναντι MC2: 71.00 [SD: 16.46]. N = 8115). Ωστόσο, η αξιολόγηση για το
³ Το σώμα SUBTLEX–US είναι ένα σώμα 51 εκατομμυρίων λεκτικών μονάδων, βασισμένο σε υπότιτλους αμερικανικών κινηματογραφικών ταινιών και τηλεοπτικών προγραμμάτων. Αρκετές πρόσφατες μελέτες έχουν παράσχει στοιχεία που δείχνουν ότι οι κανόνες συχνότητας που λαμβάνονται από υπότιτλους ταινιών και τηλεοπτικών προγραμμάτων τείνουν να είναι αποτελεσματικότεροι από εκείνους που προέρχονται από έντυπα κείμενα, όταν πρόκειται για την εξήγηση των διαφορών στον χρόνο λεξικής επεξεργασίας και, σε ορισμένες περιπτώσεις, στην ακρίβεια μεταξύ φυσικών ομιλητών διαφόρων γλωσσών (βλ. Chen et al. 2018: 2 και τις εκεί βιβλιογραφικές αναφορές).
Straipsniai / Articles
275
CHARITON CHARITONIDIS
πρώτου συστατικού συσχετιζόταν ισχυρότερα με την αξιολόγηση ολόκληρης της σύνθετης λέξης απ’ ό,τι η αξιολόγηση του δεύτερου συστατικού (c1~cmp: r = 0.75, p <.001 έναντι c2~cmp: r = 0.66, p <.001. N = 429).⁴ Ιδιαίτερα αξιοσημείωτο είναι ότι η αξιολόγηση διατήρησης της σημασίας για το πρώτο συστατικό και η αξιολόγηση προβλεψιμότητας της σημασίας για τη σύνθετη λέξη προέβλεπαν και τους τρεις τύπους χρόνων απόκρισης, δηλαδή τους χρόνους λεξικής απόφασης του ELP, τους χρόνους λεξικής απόφασης του BLP και τους χρόνους ονομασίας του ELP.
Συμπερασματικά, η αιχμηρή και υψηλότερη κατανομή των βαθμών διαφάνειας για το δεύτερο συστατικό και η ισχυρότερη συσχέτιση του πρώτου συστατικού με την προβλεψιμότητα της σημασίας της σύνθετης λέξης φαίνεται να αντιστοιχούν άμεσα στις λειτουργίες της κεφαλής στα αγγλικά σύνθετα. Το δεύτερο συστατικό, δηλαδή η κεφαλή, είναι μια μονάδα της οποίας η διαφάνεια ενισχύεται κατηγοριακά και σημασιολογικά (για τη σημασιολογική πτυχή, βλ. τις σχέσεις συνεπαγωγής και υπωνυμίας). Το πρώτο συστατικό, δηλαδή ο προσδιοριστής, είναι ο κρισιμότερος παράγοντας για την καθιέρωση της αναφοράς της σύνθετης λέξης. Ως αποτέλεσμα, η διαφάνειά του συνδιακυμάνεται ισχυρότερα με τη διαφάνεια της σύνθετης λέξης.⁵
2. ΤΟ ΚΡΙΤΗΡΙΟ ΠΛΗΡΟΦΟΡΙΑΣ ΤΟΥ AKAIKE (AIC)
Το 1973, ο Hirotugu Akaike ανέπτυξε μια μέθοδο για την εκτίμηση της σχετικής αναμενόμενης απόστασης Kullback–Leibler (Kullback 1959), χρησιμοποιώντας τη μεγιστοποιημένη λογαριθμική πιθανοφάνεια του Fisher (Fisher 1922· βλ. επίσης Aldrich 1997). Αυτό το μέτρο, που συνήθως αναφέρεται ως Κριτήριο Πληροφορίας του Akaike (AIC· Akaike 1973), εισήγαγε ένα νέο πλαίσιο για την επιλογή μοντέλων στην ανάλυση εμπειρικών δεδομένων, σηματοδοτώντας μια σημαντική αλλαγή παραδείγματος (Burnham, Anderson 2002).
Το AIC υπολογίζεται συνήθως ως εξής: −2lnL + 2k, όπου το «lnL» αναφέρεται στη μεγιστοποιημένη/πλήρη λογαριθμική πιθανοφάνεια του μοντέλου και το «k» αναφέρεται στον αριθμό των παραμέτρων, συμπεριλαμβανομένης της σταθεράς. Ένα μικρότερο σύνολο προγνωστικών μεταβλητών συνδέεται συνήθως με αποδοτικότερα μοντέλα (μοντέλα με μικρότερη απώλεια πληροφορίας). Όσο χαμηλότερη (= περισσότερο αρνητική) είναι η τιμή του AIC, τόσο καλύτερη είναι η προσαρμογή του μοντέλου. Στο πλαίσιο αυτό, το AIC penalizes, ως μέτρο καλής προσαρμογής, τη χρήση μεγάλου αριθμού προγνωστικών μεταβλητών που ενδέχεται να οδηγούν σε υψηλότερες τιμές AIC (βλ. το τμήμα «+2k» της εξίσωσης του AIC).
⁴ Η δοκιμασία z του Steiger (1980) έδειξε ότι αυτή η διαφορά ήταν σημαντική, z = 27.71, p <.0001 (Gagné et al. 2019).
⁵ Αναφερόμενοι σε προηγούμενη έρευνα, οι Gagné et al. (2019) αναφέρουν ότι «ο προσδιοριστής (το πρώτο συστατικό στα αγγλικά) τείνει να διαδραματίζει μεγαλύτερο ρόλο στην επιλογή της ευκολίας της σχέσης κατά την επεξεργασία σύνθετων λέξεων και ονοματικών φράσεων».
276
Acta Linguistica Lithuanica XC
Exploring Scaled AIC within English Closed Compounds
Το AIC είναι ευαίσθητο στο μέγεθος του δείγματος. Το AICc, μια διορθωμένη εκδοχή του AIC, ενσωματώνει το μέγεθος του δείγματος μέσω του τύπου 2k (k + 1)/ (n − k − 1). Ωστόσο, αφορά ειδικά μικρά μεγέθη δείγματος και δεν συνιστάται για μοντέλα που βασίζονται σε μεγάλα μεγέθη δείγματος, όπως εκείνο των Gagné et al. (2019).⁶ Θα πρέπει να σημειωθεί ότι ερευνητές όπως οι Kenneth P. Burnham & David R. Anderson (2002) δεν προσφέρουν οριστική λύση για τη σύγκριση τιμών AIC μοντέλων που προσαρμόζονται σε διαφορετικά και μεγάλα μεγέθη δείγματος.⁷
Ειδικότερα, οι Burnham & Anderson (2002: 80–85, 334–335) παρέχουν εκτενή συζήτηση των συνεπειών των άνισων μεγεθών δείγματος για τη σύγκριση μοντέλων. Υποστηρίζουν ότι η χρήση κριτηρίων πληροφορίας για τη σύγκριση μοντέλων με διαφορετικά μεγέθη δείγματος μπορεί να οδηγήσει σε παραπλανητικά αποτελέσματα. Παρομοίως, όπως σημειώνει ο Svetunkov σε διαδικτυακή συζήτηση το 2016 (βλ. την αναφορά μετά τη βιβλιογραφία), όλα τα κριτήρια πληροφορίας βασίζονται στη συνάρτηση πιθανοφάνειας, η οποία με τη σειρά της εξαρτάται από το μέγεθος του δείγματος. Συγκεκριμένα, καθώς αυξάνεται το μέγεθος του δείγματος, η πιθανοφάνεια μειώνεται. Κατά συνέπεια, τα κριτήρια πληροφορίας επίσης αυξάνονται σε τέτοιες περιπτώσεις.⁸
3. ΠΡΟΗΓΟΥΜΕΝΗ ΕΡΕΥΝΑ
Στο Charitonidis (2022), οι τιμές AIC για 44 μοντέλα πολλαπλής παλινδρόμησης με διαφορετικούς συνδυασμούς μεταβλητών συναισθήματος (σθένος, διέγερση και συγκεκριμενικότητα για (α) λέξεις και (β) περιβάλλοντα λέξεων) διαιρέθηκαν διά του μεγέθους του δείγματος (N), ώστε να προκύψουν τιμές Scaled AIC (AIC/N). Στη συνέχεια, αυτές οι τιμές χρησιμοποιήθηκαν για την αξιολόγηση
⁶ Για περισσότερες πληροφορίες σχετικά με το AICc, ο αναγνώστης παραπέμπεται στους Burnham & Anderson (2002: 374–380).
⁷ Μία από τις λύσεις που προτείνουν οι Burnham & Anderson (2002) αφορά τη μετατροπή των τιμών AIC σε «βάρη Akaike», τα οποία ορίζονται ως «η σχετική πιθανοφάνεια του μοντέλου, δεδομένων των δεδομένων» (Burnham, Anderson 2002: xiii· βλ. επίσης Wagenmakers, Farrell 2004).
⁸ Διαθέσιμο στη διεύθυνση: https://stats.stackexchange.com/questions/94718/model-comparison-with-aic-based-on-different-sample-size [πρόσβαση 16.06.2023]. Ο αναγνώστης μπορεί να κατανοήσει τη δήλωση του Svetunkov αντικαθιστώντας διαφορετικές τιμές για το συστατικό «lnL» στην εξίσωση του AIC, διατηρώντας σταθερό το συστατικό «2k». Μείωση της τιμής lnL θα οδηγήσει σε υψηλότερη, δηλαδή κατώτερη, τιμή AIC.
⁹ Στη βιβλιογραφία, το Scaled AIC αναφέρεται επίσης ως «μέσο AIC». Σύμφωνα με τον Svetunkov (προσωπική επικοινωνία), η πρακτική της διαίρεσης του Κριτηρίου Πληροφορίας του Akaike διά του μεγέθους του δείγματος δεν είναι νέα. Για παράδειγμα, οι Hastie et al. (2009: 230–231) ορίζουν το AIC με μη κανονικό τρόπο, χρησιμοποιώντας το N ως παρονομαστή στον τύπο. Παρόλο που αυτή η απόκλιση από τον συμβατικό τύπο του AIC δεν στερείται επικριτών, παραμένει διαδεδομένη προσέγγιση, όπως δείχνει η συμπερίληψή της στο στατιστικό λογισμικό Stata. Για παράδειγμα, το Stata αναφέρει «AIC διαιρεμένο διά N» στην έξοδο του μοντέλου του, όπως αποδεικνύεται από διάφορα παραδείγματα που είναι διαθέσιμα στο διαδίκτυο (Ευχαριστίες στον I. Svetunkov για την παροχή αυτής της πληροφορίας).
Straipsniai / Articles
277
CHARITON CHARITONIDIS
και να συγκρίνουν την καλή προσαρμογή των μοντέλων. Η εισαγωγή βασικών προγνωστικών μεταβλητών σε γενικά μοντέλα έδειξε ότι οι χρόνοι λεξικής απόφασης του BLP απαιτούσαν καλύτερη προσαρμογή από τους χρόνους λεξικής απόφασης του ELP. Η προσαρμογή των μοντέλων ονομασίας του ELP ενέπιπτε στο εύρος εκείνων που παρατηρήθηκαν για τα μοντέλα λεξικής απόφασης του ELP και του BLP. Ιδιαίτερα αξιοσημείωτο είναι ότι η συγκεκριμενικότητα του περιβάλλοντος για το δεύτερο συστατικό αναδείχθηκε ως σημαντική προγνωστική μεταβλητή σε όλα τα μοντέλα με συχνότητα SUBTLEX-US, τόσο στη λεξική απόφαση όσο και στην ονομασία.
Στο Charitonidis (2024), όλοι οι σημαντικοί συντελεστές από τα γενικά μοντέλα με συχνότητα SUBTLEX-US αντιπαραβλήθηκαν με τη μεταβλητή υπωνυμίας (Gagné et al. 2020). Διαπιστώθηκε ότι τα μοντέλα που περιλάμβαναν τόσο την υπωνυμία όσο και τη συγκεκριμενικότητα του περιβάλλοντος για το δεύτερο συστατικό συνδέονταν πάντοτε με τη χαμηλότερη (= καλύτερη) τιμή Scaled AIC, σε σύγκριση με ενσωματωμένα, δηλαδή μειωμένα, μοντέλα που παρέλειπαν μία από αυτές τις δύο μεταβλητές. Οι Wald tests που εφαρμόστηκαν στη συνέχεια έδειξαν ότι τα ενσωματωμένα μοντέλα αναφέρονταν πάντοτε σε σημαντική μείωση (= επιδείνωση) του συντελεστή προσδιορισμού (R2). Οι Tables 1 και 2 παρουσιάζουν, αντίστοιχα, τις τιμές Scaled AIC και τα αποτελέσματα των αντίστοιχων Wald tests.
TABLE 1.
Τιμές Scaled AIC για ενσωματωμένα μοντέλα που παραλείπουν την υπωνυμία («Model 2») ή τη συγκεκριμενικότητα του περιβάλλοντος για το δεύτερο συστατικό («Model 3») από πλήρη μοντέλα («Model 1») για την πρόβλεψη των χρόνων λεξικής απόφασης του English Lexicon Project (ELP) (LD), των χρόνων λεξικής απόφασης του British Lexicon Project (BLP) και των χρόνων ονομασίας του ELP
Model | Scaled AIC | AIC | N ELP LD 1 | −3.36281ᵃ | −3557.85 | 1058 2 | −3.30375 | −4169.334 | 1262 3 | −3.34845 | −3700.038 | 1105 BLP LD 1 | −3.79552ᵃ | −2903.574 | 765 2 | −3.76618 | −3920.592 | 1041 3 | −3.76718 | −2987.37 | 793 ELP naming 1 | −3.58686ᵇ | −7396.108 | 2062 2 | −3.54304 | −8418.27 | 2376 3 | −3.58379 | −7389.784 | 2062
278
Acta Linguistica Lithuanica XC
Exploring Scaled AIC within English Closed Compounds
α. Προγνωστικές μεταβλητές: (Σταθερά), κρίση υπωνυμίας, μήκος σύνθετης λέξης, συχνότητα SUBTLEX–US, σθένος αναπαράστασης (cmp), συγκεκριμενικότητα περιβάλλοντος (c2)
β. Προγνωστικές μεταβλητές: (Σταθερά), κρίση υπωνυμίας, μήκος σύνθετης λέξης, συχνότητα SUBTLEX–US, σθένος περιβάλλοντος (cmp), διέγερση περιβάλλοντος (c1), διέγερση περιβάλλοντος (c2), συγκεκριμενικότητα περιβάλλοντος (c2)
TABLE 2.
Wald tests για ενσωματωμένα μοντέλα που παραλείπουν την υπωνυμία («Model 2») ή τη συγκεκριμενικότητα του περιβάλλοντος για το δεύτερο συστατικό («Model 3») από πλήρη μοντέλα («Model 1») για την πρόβλεψη των χρόνων λεξικής απόφασης του English Lexicon Project (ELP) (LD), των χρόνων λεξικής απόφασης του British Lexicon Project (BLP) και των χρόνων ονομασίας του ELP
Model | R2 square | F change | df1 | df2 | p ELP LD 1 |.184a | 47.506 | 5 | 1052 |.000 2 | −.004 | 4.562 | 1 | 1052 |.033 3 | −.010 | 13.175 | 1 | 1052 |.000 BLP LD 1 |.211a | 40.479 | 5 | 759 |.000 2 | −.013 | 12.091 | 1 | 759 |.001 3 | −.015 | 14.007 | 1 | 759 |.000 ELP naming 1 |.288b | 118.711 | 7 | 2054 |.000 2 | −.003 | 8.286 | 1 | 2054 |.004 3 | −.003 | 8.309 | 1 | 2054 |.004
α. Προγνωστικές μεταβλητές: (Σταθερά), κρίση υπωνυμίας, μήκος σύνθετης λέξης, συχνότητα SUBTLEX–US, σθένος αναπαράστασης (cmp), συγκεκριμενικότητα περιβάλλοντος (c2)
β. Προγνωστικές μεταβλητές: (Σταθερά), κρίση υπωνυμίας, μήκος σύνθετης λέξης, συχνότητα SUBTLEX–US, σθένος περιβάλλοντος (cmp), διέγερση περιβάλλοντος (c1), διέγερση περιβάλλοντος (c2), συγκεκριμενικότητα περιβάλλοντος (c2)
Συμπερασματικά, δύο διαφορετικά μέτρα μεγέθους επίδρασης, συγκεκριμένα το Scaled AIC και το R2, ιεράρχησαν τα ίδια μοντέλα παλινδρόμησης με πανομοιότυπο τρόπο, ενώ έδειξαν την ίδια προτίμηση για το καλύτερο μοντέλο. Επομένως, υπάρχουν ισχυρές ενδείξεις ότι το μέτρο Scaled AIC αποτελεί ποιοτικό εργαλείο για την αξιολόγηση της προσαρμογής μοντέλων.
Straipsniai / Articles
279
CHARITON CHARITONIDIS
4. Η ΠΑΡΟΥΣΑ ΜΕΛΕΤΗ
Η παρούσα μελέτη βασίζεται στην προηγούμενη έρευνα του συγγραφέα που παρουσιάστηκε στην ενότητα 3. Τα ερευνητικά αντικείμενα είναι 66 μοντέλα λεξικής απόφασης και ονομασίας για αγγλικές κλειστές (συνεκφερόμενες) σύνθετες λέξεις, τα οποία κατασκευάστηκαν από τους Gagné et al. (2019). Όλα τα μοντέλα περιλαμβάνουν τη συχνότητα SUBTLEX-US ως μεταβλητή ελέγχου. Οι στόχοι μας είναι διττοί και εξελίσσονται παράλληλα. Πρώτον, αξιολογούμε τα χαρακτηριστικά των μοντέλων των Gagné et al. (ό.π.). Δεύτερον, διερευνούμε ουσιώδεις ιδιότητες του μέτρου Scaled AIC.
Τα ερευνητικά ερωτήματα είναι: 1. Είναι το Scaled AIC ευαίσθητο στον σχεδιασμό του μοντέλου των Gagné et al. (2019); Ποιες ομάδες μοντέλων ευνοούνται; 2. Ποιος είναι ο αντίκτυπος των μεταβλητών ελέγχου «συχνότητα σύνθετης λέξης» και «μήκος σύνθετης λέξης» στο Scaled AIC; 3. Πώς σχετίζεται η μορφολογική διαφάνεια με το Scaled AIC;
Η μελέτη μας διαρθρώνεται ως εξής: Η Ενότητα 5 παρέχει επισκόπηση των μεθόδων μας. Η Ενότητα 6.1 παρέχει περιγραφικά στατιστικά στοιχεία για το Scaled AIC που αφορούν τα υπό εξέταση μοντέλα. Έμφαση δίνεται στα παραμετρικά έναντι των μη παραμετρικών χαρακτηριστικών των κατηγοριών μοντέλων. Η Ενότητα 6.2 διερευνά τη σχέση μεταξύ της πηγής των χρόνων απόκρισης και των εργασιών λεξικής επεξεργασίας. Η Ενότητα 6.3 αντιπαραβάλλει το Scaled AIC με τις μεταβλητές ελέγχου «συχνότητα σύνθετης λέξης» και «μήκος σύνθετης λέξης». Στην Ενότητα 6.4 τα επίπεδα σημαντικότητας των συντελεστών διαφάνειας από τα μοντέλα των Gagné et al. (2019) αντιστοιχίζονται στις τιμές Scaled AIC. Τα βασικά ευρήματα συνοψίζονται στην Ενότητα 7 και ακολουθούνται από συζήτηση των αποτελεσμάτων στην Ενότητα 8.
5. ΜΕΘΟΔΟΙ
Η γενική μας μέθοδος ήταν η συγκριτική ανάλυση των κύριων παραμέτρων και χαρακτηριστικών των μοντέλων των Gagné et al. (2019), με το Scaled AIC ως εξαρτημένη μεταβλητή. Οι ανεξάρτητες μεταβλητές περιλάμβαναν χαρακτηριστικά του δείγματος (π.χ. πηγή χρόνων απόκρισης και εργασίες λεξικής επεξεργασίας), τον σχεδιασμό της μελέτης (π.χ. μεταβλητές ελέγχου) και το επίπεδο σημαντικότητας των συντελεστών διαφάνειας, μεταξύ άλλων παραγόντων.
Οι συγκεκριμένες στατιστικές μέθοδοι που χρησιμοποιήθηκαν ήταν οι εξής: (α) περιγραφικά στατιστικά στοιχεία σχετικά με τους μέσους όρους και τις διαμέσους, μαζί με την εφαρμογή της δοκιμασίας Shapiro–Wilk για την αξιολόγηση της κεντρικής τάσης, της μεταβλητότητας και της κατανομής του Scaled AIC σε διαφορετικές κατηγορίες και ομάδες μοντέλων (Ενότητες 6.1 και 6.2), (β) αναλύσεις κύριων επιδράσεων για την πηγή των χρόνων απόκρισης (ELP/BLP) και τις εργασίες λεξικής επεξεργασίας (λεξική απόφαση/ονομασία) (Ενότητα
280
Acta Linguistica Lithuanica XC
Exploring Scaled AIC within English Closed Compounds
6.2), (γ) διακριτές ANOVAs που πραγματοποιήθηκαν στην πηγή των χρόνων απόκρισης και στις εργασίες λεξικής επεξεργασίας, με ενσωμάτωση του μήκους της σύνθετης λέξης ως συμμεταβλητής (Ενότητα 6.3), και (δ) χρήση των δοκιμασιών Kruskal–Wallis και Jonckheere–Terpstra για τη διερεύνηση διαφορών μεταξύ των τάξεων των μεταβλητών που ανακωδικοποιήθηκαν σε τακτικές κλίμακες, για τη σημασιολογική διαφάνεια (Ενότητα 6.4). Για περισσότερες πληροφορίες σχετικά με τις μεθόδους, ο αναγνώστης παραπέμπεται στις αναλύσεις των Ενοτήτων 6.1–6.4.
6. ΑΝΑΛΥΣΕΙΣ
6.1. Scaled AIC έναντι κατηγοριών μοντέλων
Οι 66 τιμές AIC από τα μοντέλα πολλαπλής παλινδρόμησης των Gagné et al. (2019), με τη συχνότητα SUBTLEX–US ως μεταβλητή ελέγχου, διαιρέθηκαν διά του μεγέθους του δείγματος κάθε μοντέλου, ώστε να προκύψει ένα σύνολο 66 τιμών Scaled AIC.
Ο Table 3 παρακάτω παρέχει τα περιγραφικά στατιστικά στοιχεία για το Scaled AIC και το Figure 2 παρουσιάζει το αντίστοιχο boxplot που αναφέρεται στο διατεταγμένο σύνολο των τιμών.10 Δεν υπήρχαν ακραίες τιμές στο δείγμα. Οι τιμές ασυμμετρίας (Sk) και κύρτωσης (Ku) ήταν ανεκτές.11
Η μέση τιμή του Scaled AIC ήταν −3.50030. Η τυπική απόκλιση ήταν 0.19052, δηλαδή οι παρατηρήσεις ήταν σχετικά συγκεντρωμένες γύρω από τον μέσο όρο. Οι ελάχιστες και μέγιστες τιμές ήταν αντίστοιχα −3.85502 και −3.15754. Η διάμεση τιμή ήταν −3.55732, δηλαδή ελαφρώς χαμηλότερη από τη μέση τιμή.12 Το μεσαίο 50% των δεδομένων κυμαινόταν μεταξύ −3.66575 (πρώτο τεταρτημόριο, Q1) και −3.30959 (τρίτο τεταρτημόριο, Q3). Συνεπώς, το ενδοτεταρτημοριακό εύρος (IQR) ήταν 0.35616.
10 Η κάτω ή πρώτη τεταρτημοριακή γραμμή του πλαισίου (Q1) σηματοδοτεί το όριο κάτω από το οποίο εκτείνεται το κατώτερο 25% των δεδομένων. Παρομοίως, η άνω ή τρίτη τεταρτημοριακή γραμμή του πλαισίου (Q3) σηματοδοτεί το όριο πάνω από το οποίο εκτείνεται το ανώτερο 25% των δεδομένων. Η σκιασμένη περιοχή δείχνει τα όρια του μεσαίου 50% των δεδομένων ή το ενδοτεταρτημοριακό εύρος (IQR), το οποίο μπορεί να υπολογιστεί αφαιρώντας το πρώτο τεταρτημόριο από το τρίτο τεταρτημόριο (Q3−Q1). Η οριζόντια γραμμή μέσα στο πλαίσιο δείχνει τη διάμεσο ή το μεσαίο τεταρτημόριο (Q2), δηλαδή την τιμή που βρίσκεται στο μέσο του συνόλου δεδομένων.
11 Αναφορικά με το περιβάλλον SPSS, οι τιμές μεταξύ −1 και +1 για την ασυμμετρία και μεταξύ −2 και +2 για την κύρτωση θεωρούνται γενικά αποδεκτές για την αξιολόγηση της κανονικής κατανομής. Αξίζει να σημειωθεί, ωστόσο, ότι η ασυμμετρία και η κύρτωση από μόνες τους δεν παρέχουν οριστική απόδειξη κανονικότητας (βλ. επίσης τη συζήτηση για https://www.researchgate.net/post/What_is_the_acceptable_range_of_skewness_and_kurtosis_for_normal_distribution_of_data).
12 Σύμφωνα με αυτό το πρότυπο, υπήρχε μικρή θετική ασυμμετρία στα δεδομένα (0.494).
Straipsniai / Articles
281
CHARITON CHARITONIDIS
TABLE 3. Περιγραφικά στατιστικά στοιχεία για το Scaled AIC (πλήρες σύνολο)
Μέσος όρος SD Ελάχιστο Μέγιστο −3.50030 0.19052 −3.85502 −3.15754 Διάμεσος IQR Q1 Q3 −3.55732 0.35616 −3.66575 −3.30959
N=66. Sk=0.494, Ku=−1.101
FIGURE 2. Κατανομή του Scaled AIC (πλήρες σύνολο): Boxplot
Αναμενόταν ότι το πλήρες σύνολο τιμών Scaled AIC δεν θα παρουσίαζε κανονική κατανομή, επειδή περιλάμβανε διαφορετικές εργασίες (λεξική απόφαση, ονομασία) και προερχόταν από διαφορετικές πηγές χρόνων απόκρισης (ELP, BLP). Η δοκιμασία Shapiro–Wilk και η δοκιμασία Kolmogorov–Smirnov επιβεβαίωσαν τις υποθέσεις μας.13 Ειδικότερα, τα στατιστικά στοιχεία για τη δοκιμασία Shapiro–Wilk ήταν W (66) = 0.90, p <.001, ενώ τα στατιστικά στοιχεία για τη δοκιμασία Kolmogorov–Smirnov ήταν D (66) = 0.17, p <.001. Θα πρέπει να σημειωθεί ότι το ίδιο πλήρες σύνολο δεν παρουσίασε κανονική κατανομή ούτε μετά την εφαρμογή του φυσικού λογαρίθμου και των μετασχηματισμών τετραγωνικής ρίζας στις απόλυτες τιμές.
Ο Table 4 παρακάτω παρέχει τα περιγραφικά στατιστικά στοιχεία για το Scaled AIC σε σχέση με τις κύριες κατηγορίες μοντέλων των Gagné et al. (2019), δηλαδή τη λεξική απόφαση ELP, τη λεξική απόφαση BLP και την ονομασία ELP (κάθε ομάδα περιέχει 22 μοντέλα). Το Figure 3 παρουσιάζει τα αντίστοιχα boxplots. Όπως φαίνεται, οι μέσοι όροι και οι διάμεσοι
13 Η δοκιμασία Kolmogorov–Smirnov εφάρμοσε τη διόρθωση σημαντικότητας Lilliefors.
282
Acta Linguistica Lithuanica XC
Exploring Scaled AIC within English Closed Compounds
για τη λεξική απόφαση BLP και την ονομασία ELP αναφέρονταν σε παρόμοιες τιμές Scaled AIC. Η λεξική απόφαση ELP αναφερόταν σε υψηλότερες (= κατώτερες) τιμές, οι οποίες επιπλέον ήταν ασύνδετες από τις τιμές της λεξικής απόφασης BLP.14 Συνοπτικά, η λεξική απόφαση BLP και η ονομασία ELP απαιτούσαν πάντοτε καλύτερα μοντέλα από τη λεξική απόφαση ELP.
TABLE 4. Περιγραφικά στατιστικά στοιχεία για το Scaled AIC ανά κύρια κατηγορία μοντέλου
Αναμενόταν ότι το μη παραμετρικό προφίλ του πλήρους συνόλου τιμών Scaled AIC θα ήταν λιγότερο πιθανό να εμφανιστεί εντός των κύριων κατηγοριών μοντέλων, δηλαδή των βασικών συνδυασμών χρόνων απόκρισης και εργασιών. Όπως θα γίνει φανερό, η προσδοκία αυτή επιβεβαιώθηκε.
Η δοκιμασία Shapiro-Wilk έδειξε ότι τα δεδομένα λεξικής απόφασης ELP απέκλιναν σημαντικά από την κανονικότητα. Ειδικότερα, υπολογίσαμε στατιστικό δοκιμασίας W (22) = 0.90, p <.05.15
Τα δεδομένα λεξικής απόφασης BLP είχαν κανονική κατανομή. Τα αντίστοιχα στατιστικά στοιχεία ήταν W (22) = 0.92, p >.05 (Shapiro-Wilk).
14 Μια t-test στα συνοπτικά δεδομένα για τη λεξική απόφαση ELP και τη λεξική απόφαση BLP (Table 4) έδειξε μια εξαιρετικά σημαντική διαφορά μεταξύ των μέσων όρων των δειγμάτων, t = 18.296, p <.0001.
15 Θα πρέπει να σημειωθεί ότι ένα σύνολο έξι μοντέλων λεξικής απόφασης ELP αναφερόταν σε τιμές Scaled AIC κοντά στη μέγιστη τιμή −3.15754, υποδεικνύοντας την ασθενέστερη προσαρμογή σε ολόκληρο το σύνολο δεδομένων. Τα μοντέλα αυτά συνέβαλαν σε μια έντονη κορυφή προς το υψηλότερο άκρο της κατανομής (από −3.17304 έως −3.15754), με αποτέλεσμα ένα σχεδόν διτροπικό πρότυπο κατανομής. Η παρατήρηση αυτή υποστηρίζεται από μια σχετικά υψηλή αρνητική τιμή κύρτωσης −1.444.
Straipsniai / Articles
283
CHARITON CHARITONIDIS
FIGURE 3. Αναπαραστάσεις boxplot του Scaled AIC ανά κύριες κατηγορίες μοντέλων
Παρομοίως, τα δεδομένα ονομασίας ELP ακολουθούσαν κανονική κατανομή. Οι αντίστοιχες στατιστικές ήταν W (22) = 0.93, p >.05 (Shapiro–Wilk).
Συνοψίζοντας, τόσο το πλήρες σύνολο μοντέλων όσο και τα μοντέλα λεξικής απόφασης ELP συνδέονταν με μη παραμετρική κατανομή του Scaled AIC. Από την άλλη πλευρά, τα δεδομένα λεξικής απόφασης BLP και ονομασίας ELP ακολουθούσαν κανονική κατανομή. Ας προσπαθήσουμε τώρα να αποκαλύψουμε την επίδραση μεμονωμένων παραγόντων στο Scaled AIC.
6.2. Scaled AIC έναντι πηγής χρόνου απόκρισης και εργασιών
Ο παρακάτω Table 5 περιέχει τα περιγραφικά στατιστικά για τις τιμές Scaled AIC των ομάδων που κατηγοριοποιούνται σύμφωνα με τους κύριους παράγοντες «χρόνοι απόκρισης» και «εργασίες», δηλαδή (a) χρόνοι απόκρισης ELP, (b) χρόνοι απόκρισης BLP, (c) εργασία ονομασίας και (d) εργασία λεξικής απόφασης. Οι χρόνοι απόκρισης ELP και η εργασία λεξικής απόφασης
284
Acta Linguistica Lithuanica XC
Exploring Scaled AIC within English Closed Compounds
αποτελούν υπερκείμενες ομάδες που αναφέρονται στις «λεξική απόφαση & ονομασία» και «ELP & BLP», αντίστοιχα. Οι ομάδες «BLP» και «Naming» είναι ταυτόσημες με τις κατηγορίες μοντέλων «BLP lexical decision» και «ELP naming», αντίστοιχα, οι οποίες παρουσιάστηκαν ήδη στο Table 4 (ενότητα 6.1). Η Figure 4 παρουσιάζει τις αντίστοιχες αναπαραστάσεις boxplot.
Όπως φαίνεται στο Table 5, τόσο οι «BLP» όσο και οι «Naming» αναφέρονταν σε (a) χαμηλότερες (=καλύτερες) μέσες και διάμεσες τιμές για το Scaled AIC και (b) μικρότερες τιμές τυπικής απόκλισης (SD) και ενδοτεταρτημοριακού εύρους (IQR), σε αντίθεση με τις υπερκείμενες ομάδες «ELP response times» και «lexical decision».16 Οι ίδιες υπερκείμενες ομάδες έχουν σχετικά υψηλές τιμές κύρτωσης, δηλαδή −1.403 και −1.616, αντίστοιχα (στα ιστογράμματα αυτών των ομάδων —που δεν παρατίθενται εδώ— εμφανίστηκαν δύο σαφείς κορυφές, παρόμοιες με εκείνες μιας διτροπικής κατανομής τιμών). Τα πρότυπα αυτά υποδεικνύουν ότι το μέτρο Scaled AIC συνδεόταν μοναδικά με τις σαφώς ορισμένες πειραματικές κατηγορίες BLP lexical decision (βλ. ομάδα «BLP») και ELP naming (βλ. ομάδα «Naming»).
TABLE 5.
Περιγραφικά στατιστικά για το Scaled AIC σχετικά με τις ομάδες που κατηγοριοποιούνται υπό τους «χρόνους απόκρισης» και τις «εργασίες»
Χρόνοι απόκρισης Εργασίες ELP BLP Ονομασία Λεξική απόφαση Μέσος όρος −3.43917 −3.62255 −3.62495 −3.43797 SD 0.20286 0.06778 0.08710 0.19808 Ελάχιστο −3.85502 −3.75547 −3.85502 −3.75547 Μέγιστο −3.15754 −3.52945 −3.50150 −3.15754 Διάμεσος −3.42626 −3.62174 −3.61886 −3.44024 IQR 0.35152 0.13704 0.13758 0.36196 Q1 −3.62127 −3.68840 −3.69419 −3.63171 Q3 −3.26975 −3.55136 −3.55662 −3.26975 Sk −0.126 −0.097 −0.559 −0.006 Ku −1.403 −1.244 0.725 −1.616 44 22 22 44
16 Χαμηλότεροι μέσοι όροι και διάμεσοι, σε συνδυασμό με μικρότερες τιμές τυπικής απόκλισης και ενδοτεταρτημοριακού εύρους, υποδεικνύουν μεγαλύτερη αξιοπιστία και μειωμένη ευαισθησία σε ακραίες ή εξαιρετικά μεγάλες τιμές.
Straipsniai / Articles
285
CHARITON CHARITONIDIS
FIGURE 4. Αναπαραστάσεις boxplot για το Scaled AIC σχετικά με τις ομάδες που κατηγοριοποιούνται υπό τους «χρόνους απόκρισης» και τις «εργασίες»
Όπως και με ολόκληρο το σύνολο τιμών Scaled AIC που συζητήθηκε στην ενότητα 6.1, αναμενόταν ότι θα εμφανιζόταν μη παραμετρικό προφίλ για τις υπερκείμενες ομάδες «ELP» και «lexical decision», οι οποίες δεν περιορίζονται από συγκεκριμένα πειράματα. Οι έλεγχοι κανονικότητας επιβεβαίωσαν τις προσδοκίες μας.
Αναφορικά με τον έλεγχο Shapiro–Wilk, τα δεδομένα Scaled AIC για την ομάδα ELP απέκλιναν σημαντικά από την κανονικότητα. Υπολογίσαμε στατιστική ελέγχου W (44) = 0.91, p <.01. Παρομοίως, τα δεδομένα Scaled AIC για την ομάδα λεξικής απόφασης απέκλιναν σημαντικά από την κανονικότητα. Υπολογίσαμε στατιστική ελέγχου W (44) = 0.89, p <.001.
Ας προχωρήσουμε τώρα στην ανάλυση κύριων επιδράσεων. Ο πρωταρχικός στόχος ήταν να διαπιστωθεί αν οι ομάδες BLP lexical decision και ELP naming εξακολουθούν να προβλέπουν καλύτερα μοντέλα όταν ελέγχονται οι επιδράσεις της εκάστοτε ομάδας.
Στις στατιστικές δοκιμές που ακολουθούν, οι ομάδες που κατηγοριοποιούνται υπό τους κύριους παράγοντες «χρόνοι απόκρισης» και «εργασίες» έλαβαν ονομαστικές τιμές. Ο μέσος όρος Scaled AIC για την ομάδα BLP, δηλαδή −3.623, χρησιμοποιήθηκε ως κελί αναφοράς ή σταθερός όρος.
Τα αποτελέσματα έδειξαν ότι τόσο οι χρόνοι απόκρισης όσο και οι εργασίες είχαν κύρια επίδραση στο Scaled AIC, αλλά δεν υπήρχε αλληλεπίδραση. Ειδικότερα, υπήρχε σημαντική κύρια επίδραση των χρόνων απόκρισης, F (1, 63) = 271.87, p <.001. Με όρους παλινδρόμησης, ο συντελεστής για το ELP προέβλεπε υψηλότερη, δηλαδή κατώτερη, τιμή Scaled AIC, b = 0.37, SE = 0.02, t = 16.49, p <.001. Επιπλέον, υπήρχε σημαντική κύρια επίδραση των εργασιών, F (1, 63) = 275.42, p <.001. Με όρους παλινδρόμησης, ο συντελεστής για την ονομασία προέβλεπε χαμηλότερη, δηλαδή καλύτερη, τιμή Scaled AIC, b = −0.37, SE = 0.02, t = −16.60, p <.001.
Η Figure 5 παρέχει επισκόπηση των κύριων επιδράσεων μέσω γραφήματος σημείων και γραμμών. Το κελί αναφοράς ή ο σταθερός όρος αναφέρεται τόσο στη χαμηλότερη τιμή ELP naming όσο και στην υψηλότερη τιμή BLP lexical decision, δηλαδή −3.623. Οι γραμμές στοιβάζονται
286
Acta Linguistica Lithuanica XC
Exploring Scaled AIC within English Closed Compounds
κατακόρυφα επειδή τα εύρη των τιμών Scaled AIC για τα ELP lexical decision και BLP lexical decision ήταν ασύνδετα (βλ. Table 4). Επιπλέον, οι γραμμές είναι παράλληλες επειδή η απουσία ομάδας «BLP naming» στις εργασίες εξάλειψε τυχόν επιδράσεις αλληλεπίδρασης.
Συνοψίζοντας, οι χρόνοι απόκρισης BLP και η εργασία ονομασίας προέβλεπαν σταθερά καλύτερες τιμές Scaled AIC, ακόμη και μετά τον αμοιβαίο έλεγχο των σχετικών παραγόντων. Τα ευρήματα αυτά ενισχύουν την ακρίβεια και την αποτελεσματικότητα των αντίστοιχων μοντέλων.
FIGURE 5. Γράφημα κύριων επιδράσεων για το Scaled AIC
Θα πρέπει να σημειωθεί ότι η ανάλυση κύριων επιδράσεων που παρουσιάζεται σε αυτή την ενότητα εφαρμόζεται περισσότερο στην πηγή των χρόνων απόκρισης παρά στην επίδοση της εργασίας, επειδή, όπως ήδη αναφέρθηκε, ο συνδυασμός «BLP naming» δεν ήταν διαθέσιμος. Το γεγονός αυτό μπορεί να περιορίσει τη δυνατότητα γενίκευσης των αποτελεσμάτων πέρα από τα συγκεκριμένα δείγματα.
6.3. Scaled AIC έναντι μεταβλητών ελέγχου
Σε αυτή την ενότητα, η έμφαση θα δοθεί στις μεταβλητές ελέγχου μήκος σύνθετης λέξης (σε χαρακτήρες) και συχνότητα SUBTLEX-US, δηλαδή στη λογαριθμική συχνότητα της σύνθετης λέξης που προέρχεται από το σώμα SUBTLEX-US (Brysbaert, New 2009). Και οι δύο μεταβλητές χρησιμοποιήθηκαν εκτενώς στα μοντέλα παλινδρόμησης των Gagné et al. (2019).
Straipsniai / Articles
287
CHARITON CHARITONIDIS
Για την ανίχνευση της επίδρασης του μήκους και της συχνότητας της σύνθετης λέξης στο Scaled AIC, οι αντίστοιχοι συντελεστές παλινδρόμησης επανακωδικοποιήθηκαν σε διατακτικές τιμές σύμφωνα με τη θετικότητα και το επίπεδο σημαντικότητάς τους, βλ. Table 6. Τα επίπεδα σημαντικότητας αντιστοιχίστηκαν σε διατακτικές κλίμακες, επειδή αντιπροσώπευαν συμβατικά σημεία αποκοπής που βασίζονται στις ακριβείς τιμές σημαντικότητας.
TABLE 6. Πίνακας διατακτικής επανακωδικοποίησης για συντελεστές παλινδρόμησης
Σημαντικότητα Θετικότητα Διατακτικές τιμές Περιγραφή p <.001 αρνητική −3 μεγάλη αρνητική επίδραση p <.01 αρνητική −2 μέτρια αρνητική επίδραση p <.05 αρνητική −1 μικρή αρνητική επίδραση p >.05 αρνητική/θετική 0 μη σημαντική επίδραση p <.05 θετική 1 μικρή θετική επίδραση p <.01 θετική 2 μέτρια θετική επίδραση p <.001 θετική 3 μεγάλη θετική επίδραση
Στα μοντέλα των Gagné et al. (2019), η συχνότητα SUBTLEX-US συνδεόταν πάντοτε με αρνητικούς (=μειωτικούς της καθυστέρησης) συντελεστές μεγάλης επίδρασης, p <.001. Κατά συνέπεια, όλοι οι συντελεστές επανακωδικοποιήθηκαν ως −3, τιμή που ήταν τέλεια συγγραμμική με τη μεταβλητή έκβασης, το Scaled AIC. Για τον λόγο αυτό, η συχνότητα SUBTLEX-US εξαιρέθηκε από την παρούσα ανάλυση.
Όσον αφορά το μήκος σύνθετης λέξης, όλοι οι σημαντικοί συντελεστές παλινδρόμησης από τα μοντέλα των Gagné et al. (2019) είχαν μεγάλη θετική (=προκαλούσα καθυστέρηση) επίδραση, p <.001. Σε αντίθεση με τη μεταβλητή SUBTLEX-US, εμφανίστηκαν αρκετοί μη σημαντικοί συντελεστές. Με βάση αυτά τα πρότυπα, δημιουργήθηκε κατηγορική μεταβλητή με τιμές «1» για θετική επίδραση (=παρεμβολή του μήκους της σύνθετης λέξης) και «0» για καμία επίδραση (=καμία παρεμβολή του μήκους της σύνθετης λέξης). Το δείγμα που προέκυψε περιείχε 39 τιμές Scaled AIC. Ο έλεγχος συσχέτισης Pearson μεταξύ του μήκους της σύνθετης λέξης και του Scaled AIC έδωσε έναν εξαιρετικά σημαντικό συντελεστή συσχέτισης 0.51, p =.001, υποδεικνύοντας μέτρια έως ισχυρή συσχέτιση μεταξύ των δύο μεταβλητών.
Το μήκος της σύνθετης λέξης συμπεριλήφθηκε ως μοναδική ανεξάρτητη μεταβλητή σε γραμμικό μοντέλο παλινδρόμησης. Διαπιστώθηκε ότι ο προβλεπόμενος μέσος όρος Scaled AIC για την απουσία παρεμβολής του μήκους της σύνθετης λέξης ήταν 3.611 (=ο σταθερός όρος). Η παρεμβολή του μήκους της σύνθετης λέξης οδήγησε σε υψηλότερη (=κατώτερη) τιμή −3.407 (b = 0.204, p =.001). Η Figure 6 παρακάτω απεικονίζει αυτά τα πρότυπα. Με λίγα λόγια, το Scaled AIC επιδεινώνεται όταν το μήκος της σύνθετης λέξης καθίσταται σχετικό εντός των μοντέλων.
288
Acta Linguistica Lithuanica XC
Exploring Scaled AIC within English Closed Compounds
FIGURE 6. Μήκος σύνθετης λέξης και Scaled AIC
Πραγματοποιήσαμε χωριστές ANOVA για την πηγή χρόνου απόκρισης (ELP/BLP) και την επίδοση της εργασίας (λεξική απόφαση/ονομασία), λαμβάνοντας υπόψη το μήκος της σύνθετης λέξης ως συμμεταβλητή. Ο πρωταρχικός στόχος ήταν να εντοπιστούν διαφορές στους μέσους όρους, οι οποίοι είχαν προηγουμένως προσαρμοστεί ώστε να ληφθούν υπόψη οι επιδράσεις ελέγχου του μήκους της σύνθετης λέξης.
(a) ANOVA για την πηγή χρόνου απόκρισης. Στο BLP αποδόθηκε η τιμή «0» και στο ELP η τιμή «1». Ο έλεγχος συσχέτισης Pearson αποκάλυψε ισχυρή συγγραμμικότητα μεταξύ της πηγής χρόνου απόκρισης και του μήκους της σύνθετης λέξης, r = 1 (N = 39). Τα ακόλουθα στοιχεία υποστηρίζουν το εύρημά μας: Πρώτον, η ομάδα ELP εμφάνιζε σταθερά σημαντικές θετικές συσχετίσεις με το μήκος της σύνθετης λέξης, υποδεικνύοντας μεγάλη επίδραση. Δεύτερον, η ομάδα BLP εμφάνιζε σταθερά μη σημαντικές συσχετίσεις με το μήκος της σύνθετης λέξης. Κατά συνέπεια, ο προβλεπόμενος μέσος όρος Scaled AIC για την πηγή χρόνου απόκρισης ήταν ο ίδιος με ή χωρίς το μήκος της σύνθετης λέξης στην ανάλυση (M = 3.407 και στις δύο περιπτώσεις). Συνοψίζοντας, το μήκος της σύνθετης λέξης δεν είχε σημαντική επίδραση στο Scaled AIC όταν στην ανάλυση συμπεριλαμβανόταν η πηγή χρόνου απόκρισης.
(b) ANOVA για την επίδοση της εργασίας. Στην ονομασία αποδόθηκε η τιμή «0» και στη λεξική απόφαση η τιμή «1». Ο έλεγχος συσχέτισης Pearson αποκάλυψε αρνητική συσχέτιση μεταξύ εργασίας και μήκους σύνθετης λέξης, υποδεικνύοντας μέτρια επίδραση, r = −.5, p =.001 (N = 39). Το αποτέλεσμα αυτό υποδηλώνει ότι το μήκος της σύνθετης λέξης είναι περισσότερο σχετικό με την ονομασία παρά με τη λεξική απόφαση.
17 Θα πρέπει να σημειωθεί ότι 11 από τους 13 συντελεστές BLP ήταν αρνητικοί.
Straipsniai / Articles
289
CHARITON CHARITONIDIS
Όταν η εργασία θεωρήθηκε κύρια μεταβλητή, το μήκος της σύνθετης λέξης ήταν σημαντικός προβλεπτικός παράγοντας του Scaled AIC, F (1, 145.030), p =.000. Παρομοίως, όταν το μήκος της σύνθετης λέξης θεωρήθηκε κύρια μεταβλητή, η εργασία ήταν σημαντικός προβλεπτικός παράγοντας του Scaled AIC, F (1, 125.30), p =.000. Ο προβλεπόμενος μέσος όρος Scaled AIC για την εργασία μόνη της διέφερε σημαντικά από τον προβλεπόμενο μέσο όρο Scaled AIC όταν λαμβανόταν υπόψη το μήκος της σύνθετης λέξης (3.584 έναντι 3.203, αντίστοιχα). Ομοίως, ο προβλεπόμενος μέσος όρος Scaled AIC για το μήκος της σύνθετης λέξης μόνο (3.584) διέφερε σημαντικά από τον προβλεπόμενο μέσο όρο Scaled AIC όταν λαμβανόταν υπόψη η εργασία (−3.23). Συνοψίζοντας, ως προς την προσαρμογή με συμμεταβλητή, τόσο η εργασία λεξικής απόφασης όσο και το μήκος της σύνθετης λέξης προέβλεπαν κατώτερα μοντέλα.
6.4. Scaled AIC έναντι προτύπων διαφάνειας
Η ενότητα αυτή διερευνά την επίδραση των συντελεστών παλινδρόμησης για τη σημασιολογική διαφάνεια στα μοντέλα των Gagné et al. (2019) στο Scaled AIC. Οι συντελεστές αυτοί κωδικοποιήθηκαν σε τρεις διατακτικές κλίμακες, καθεμία από τις οποίες αντιστοιχεί σε ένα από τα τρία μορφολογικά επίπεδα, δηλαδή στη σύνθετη λέξη, στο πρώτο συστατικό και στο δεύτερο συστατικό. Ο πίνακας διατακτικής επανακωδικοποίησης βρίσκεται στο Table 6.
Το παρακάτω Table 7 παρουσιάζει τις διαμέσους και τα εύρη των διατακτικά μετασχηματισμένων συντελεστών διαφάνειας και για τα τρία μορφολογικά επίπεδα. Οι διάμεσοι παρέχουν χρήσιμες πληροφορίες για την κεντρική τάση και τη διασπορά των διατακτικών τιμών και μπορούν να συμβάλουν στην ενημέρωση αναλύσεων που βασίζονται σε διατακτικές μεταβλητές.
TABLE 7. Διατακτικά μετασχηματισμένοι συντελεστές διαφάνειας: Διάμεσοι και εύρη
Διάμεσος Ελάχιστο Μέγιστο Σύνθετη λέξη −3 −3 −1 Πρώτο συστατικό 2 −3 3 Δεύτερο συστατικό 0 −2 3
N = 18
Όπως φαίνεται, η διάμεσος για τη σύνθετη λέξη ήταν «−3», η διάμεσος για το πρώτο συστατικό ήταν «2» και η διάμεσος για το δεύτερο συστατικό ήταν «0». Τα ευρήματα αυτά υποδεικνύουν ότι στα μοντέλα των Gagné et al. (2019) με συχνότητα SUBTLEX–US, η διαφάνεια για τη σύνθετη λέξη συνδεόταν με μεγάλη αρνητική επίδραση (μικρότερους χρόνους απόκρισης), η διαφάνεια για το πρώτο συστατικό συνδεόταν με μέτρια θετική επίδραση (μεγαλύτερους χρόνους απόκρισης) και η διαφάνεια για το δεύτερο συστατικό δεν είχε σημαντική επίδραση ή είχε
290
Acta Linguistica Lithuanica XC
Exploring Scaled AIC within English Closed Compounds
αβέβαιο ρόλο. Οι υψηλότερες αξιολογήσεις διαφάνειας για το δεύτερο συστατικό, όπως αναφέρθηκαν από τους Gagné et al. (ibid.), υποδηλώνουν εγγενή μεροληψία υπέρ του, με αποτέλεσμα η συνολική διαφάνεια της σύνθετης λέξης να εξαρτάται από τη διαφάνεια του πρώτου συστατικού. Σε αυτό το πλαίσιο, η θετική, προκαλούσα καθυστέρηση, διάμεσος για το πρώτο συστατικό υποδεικνύει τον διαμεσολαβητικό, ίσως ρόλο καθορισμού αναφοράς, στη σχέση αυτή (βλ. επίσης ενότητα 1). Απομένει να αποδειχθεί ποιες είναι οι σημασιολογικές λειτουργίες που αντιπροσωπεύουν επαρκώς, από άποψη επεξεργασίας, την εγγενή μεροληψία του δεύτερου συστατικού.18
Το ερευνητικό ερώτημα που θα εξεταστεί τώρα είναι αν η θετικότητα και το επίπεδο σημαντικότητας των συντελεστών διαφάνειας επηρεάζουν το Scaled AIC. Η μέθοδός μας αποσκοπεί κυρίως στην ανίχνευση επιδράσεων υπερπροσαρμογής. Όπως υποστηρίζουν οι Daniel J. Navarro & Jay I. Myung (2005), «ένα σύνθετο μοντέλο με πολλές παραμέτρους και εξαιρετικά μη γραμμική μορφή μπορεί συχνά να προσαρμόζεται στα δεδομένα καλύτερα από ένα απλό μοντέλο με λίγες παραμέτρους, ακόμη και αν το τελευταίο παρήγαγε τα δεδομένα» (Navarro, Myung 2005: 1240). Κατά συνέπεια, ένας μεγάλος αριθμός παραμέτρων μπορεί να συλλάβει θόρυβο ή μοναδικά χαρακτηριστικά των διαθέσιμων δεδομένων, αλλά μπορεί να εμποδίσει την ικανότητα του μοντέλου να γενικεύεται σε νέα δεδομένα. Το AIC μετριάζει το ζήτημα της υπερπροσαρμογής εισάγοντας ποινή για τη συμπερίληψη πολυάριθμων παραμέτρων σε ένα μοντέλο, βλ. το μέρος «+2k» της εξίσωσης AIC στην ενότητα 2.
Όσον αφορά την ανάλυση που ακολουθεί, διατυπώνεται η υπόθεση ότι τα μοντέλα που εμφανίζουν υψηλότερες (=κατώτερες) τιμές Scaled AIC ενδέχεται να διαθέτουν σημαντικούς, συστηματικά παραγόμενους συντελεστές, δηλαδή συντελεστές που είναι σχετικοί μόνο σύμφωνα με το σύνολο δεδομένων LADEC. Σε αυτό το πλαίσιο, η εικασία μας υποδηλώνει ότι μπορεί να εμφανιστεί αντίθετη τάση στη σχέση μεταξύ διαφάνειας και Scaled AIC, σε σύγκριση με την ένδειξη που παρέχουν οι διάμεσοι στο Table 7.
Ειδικότερα, χαμηλότερες (=καλύτερες) τιμές Scaled AIC μπορεί να συνδέονται με (a) θετικούς συντελεστές (μεγαλύτερους χρόνους απόκρισης) για ολόκληρη τη σύνθετη λέξη, (b) αρνητικούς συντελεστές (μικρότερους χρόνους απόκρισης) για το πρώτο συστατικό και (c) θετικούς ή αρνητικούς συντελεστές (μεγαλύτερους ή μικρότερους χρόνους απόκρισης, αντίστοιχα) για το δεύτερο συστατικό. Θα πρέπει να σημειωθεί ότι, όσον αφορά το δεύτερο συστατικό, η διάμεσος στο Table 7 υποδηλώνει απουσία επίδρασης.
Για να απαντηθεί το ερευνητικό ερώτημα, θα χρησιμοποιηθούν δύο μη παραμετρικά μέτρα, δηλαδή ο έλεγχος Kruskal–Wallis και ο έλεγχος Jonckheere–Terpstra. Ο έλεγχος Kruskal–Wallis, γνωστός και ως «έλεγχος H», είναι μη παραμετρικός έλεγχος που βασίζεται στη
18 Στο Charitonidis (2024) υποστηρίζεται ότι τόσο η υπωνυμία όσο και η συγκεκριμενότητα του πλαισίου για το δεύτερο συστατικό είναι σημαντικοί σημασιολογικοί προβλεπτικοί παράγοντες στη λεξική απόφαση και την ονομασία. Η ανάλυση που παρουσιάζεται εκεί δείχνει ότι η συμπερίληψη και των δύο αυτών προβλεπτικών παραγόντων οδηγεί σε βελτίωση του Scaled AIC και του R2 σε σύγκριση με μοντέλα που παραλείπουν οποιαδήποτε από αυτές τις μεταβλητές.
Straipsniai / Articles
291
CHARITON CHARITONIDIS
την κατανομή chi-square. Απαιτεί η εξαρτημένη μεταβλητή να είναι διατακτική ή συνεχής. Ο έλεγχος αυτός έχει σχεδιαστεί για να προσδιορίζει αν υπάρχουν σημαντικές διαφορές μεταξύ των διαμέσων δύο ή περισσότερων ομάδων και χρησιμοποιείται ως εναλλακτική της μονόδρομης ANOVA. Όσον αφορά τη διαδικασία, οι τιμές της συνεχούς εξαρτημένης μεταβλητής, δηλαδή του Scaled AIC, διατάχθηκαν από τη χαμηλότερη προς την υψηλότερη και στις βαθμολογίες αποδόθηκαν τάξεις. Οι τάξεις που προέκυψαν εισήχθησαν εκ νέου στις ομάδες του επιπέδου σημαντικότητας (την ανεξάρτητη μεταβλητή) και οι τάξεις για κάθε ομάδα αθροίστηκαν. Ο τύπος υπολογισμού του «H» περιλάμβανε, μεταξύ άλλων, την ύψωση στο τετράγωνο του αθροίσματος των τάξεων για κάθε ομάδα και κατόπιν τη διαίρεση αυτής της τιμής με το μέγεθος του δείγματος.
Οι Πίνακες 8–10 περιέχουν τα εξεταζόμενα δεδομένα εισόδου και το άθροισμα των τάξεων για κάθε ομάδα.
19
20
άθροισμα των τάξεων για κάθε ομάδα.
TABLE 8. Σύνθετη λέξη
Επίπεδα σημαντικότητας | N | Άθροισμα τάξεων Scaled AIC | 1 – μικρή αρνητική επίδραση | 1 | 2 | 2 – μέτρια αρνητική επίδραση | 5 | 46 | 3 – μεγάλη αρνητική επίδραση | 12 | 123 | Σύνολο | 18 |
TABLE 9. Πρώτο συστατικό
Επίπεδα σημαντικότητας | N | Άθροισμα τάξεων Scaled AIC | 1 – μεγάλη θετική επίδραση | 6 | 59 | 2 – μέτρια θετική επίδραση | 4 | 34 | 3 – μικρή θετική επίδραση | 1 | 3 | 4 – καμία επίδραση | 1 | 2 | 5 – μικρή αρνητική επίδραση | 1 | 10 | 6 – μέτρια αρνητική επίδραση | 1 | 11 | 7 – μεγάλη αρνητική επίδραση | 4 | 52 | Σύνολο | 18 |
19 Για τους υπόλοιπους υπολογισμούς βλ. Field (2009: 561–562).
20 Και στους τρεις πίνακες, το συνολικό άθροισμα των τάξεων είναι περίπου 171. Ισούται με το άθροισμα των ακεραίων από το 1 έως το 18, βλ. μέγεθος δείγματος (N).
292
Acta Linguistica Lithuanica XC
Exploring Scaled AIC within English Closed Compounds
TABLE 10. Δεύτερο συστατικό
Scaled AIC | Επίπεδα σημαντικότητας | N | Άθροισμα τάξεων Scaled AIC | 1 – μεγάλη θετική επίδραση | 6 | 59 Scaled AIC | 2 – μικρή θετική επίδραση | 1 | 14 Scaled AIC | 3 – καμία επίδραση | 8 | 59 Scaled AIC | 4 – μικρή αρνητική επίδραση | 1 | 18 Scaled AIC | 5 – μέτρια αρνητική επίδραση | 2 | 21 | Σύνολο | 18 |
Πριν εξετάσουμε λεπτομερώς τα αποτελέσματα του ελέγχου Kruskal-Wallis (H), είναι σημαντικό να σημειωθεί ότι ο έλεγχος αυτός δεν παρέχει πληροφορίες σχετικά με τις συγκεκριμένες διαφορές μεταξύ μεμονωμένων ομάδων. Για την αντιμετώπιση αυτού του ζητήματος, χρησιμοποιήθηκε επιπλέον ο έλεγχος Jonckheere-Terpstra (JT). Ο έλεγχος αυτός παρείχε πληροφορίες σχετικά με το αν οι διάμεσοι των ομάδων αυξάνονταν ή μειώνονταν με τη σειρά που καθοριζόταν από τη μεταβλητή κωδικοποίησης (=ομαδοποίησης), συγκεκριμένα από τη μεγάλη θετική επίδραση έως τη μεγάλη αρνητική επίδραση. Όσον αφορά τις μεθόδους, η στατιστική JT μετατράπηκε σε z-score. Μια θετική τιμή z υποδείκνυε τάση αύξησης των διαμέσων, δηλαδή οι διάμεσοι αυξάνονταν (=υψηλότερο/κατώτερο Scaled AIC) καθώς αυξάνονταν οι τιμές της μεταβλητής κωδικοποίησης. Μια αρνητική τιμή z υποδείκνυε τάση μείωσης των διαμέσων, δηλαδή οι διάμεσοι μειώνονταν (=χαμηλότερο/καλύτερο Scaled AIC) καθώς αυξάνονταν οι τιμές της μεταβλητής κωδικοποίησης. Στη συνέχεια, τα αποτελέσματα των ελέγχων Kruskal-Wallis (H) και Jonckheere-Terpstra (JT) παρουσιάζονται από κοινού.
(a) Το Scaled AIC για τη σύνθετη λέξη δεν επηρεάστηκε σημαντικά από το επίπεδο σημαντικότητας, όπως προσδιορίστηκε από τον έλεγχο Kruskal-Wallis (H (2) = 2.226, p >.05). Εντοπίστηκε τάση αύξησης των διαμέσων, επιβεβαιώνοντας την υπόθεσή μας περί υπερπροσαρμογής· βλ. την αρνητική διάμεσο για τη σύνθετη λέξη στο Table 7. Ωστόσο, η τάση αυτή δεν ήταν στατιστικά σημαντική σύμφωνα με τον έλεγχο Jonckheere-Terpstra (JT = 50, z = 1.064, p >.05).
(b) Το Scaled AIC για το πρώτο συστατικό δεν επηρεάστηκε σημαντικά από το επίπεδο σημαντικότητας, όπως προσδιορίστηκε από τον έλεγχο Kruskal-Wallis (H (6) = 5.427, p >.05). Εντοπίστηκε τάση αύξησης των διαμέσων, απορρίπτοντας την υπόθεσή μας περί υπερπροσαρμογής· βλ. τη θετική διάμεσο για το πρώτο συστατικό στο Table 7. Ωστόσο, η τάση αυτή δεν ήταν στατιστικά σημαντική σύμφωνα με τον έλεγχο Jonckheere-Terpstra (JT = 70, z = 0.549, p >.05).
(c) Το Scaled AIC για το δεύτερο συστατικό δεν επηρεάστηκε σημαντικά από το επίπεδο σημαντικότητας, όπως προσδιορίστηκε από τον έλεγχο Kruskal-Wallis (H (4) = 4.607, p >.05). Δεν παρατηρήθηκε τάση αύξησης ή μείωσης των διαμέσων, απορρίπτοντας
Straipsniai / Articles
293
CHARITON CHARITONIDIS
την υπόθεσή μας περί υπερπροσαρμογής. Ειδικότερα, η z-στατιστική του ελέγχου Jonckheere–Terpstra ήταν ουσιαστικά μηδενική, σε συμφωνία με τη μηδενική διάμεσο για το δεύτερο συστατικό στο Table 7 (JT = 54, z = 0.041, p >.05).
Συνοψίζοντας, μπορεί να συναχθεί ότι το επίπεδο σημαντικότητας των συντελεστών διαφάνειας στα μοντέλα των Gagné et al. (2019) με συχνότητα SUBTLEX-US δεν επηρεάζει το μέγεθος του Scaled AIC. Το εύρημα αυτό υποστηρίζει έμμεσα την ποιότητα των μοντέλων των Gagné et al. (2019) με προβλεπτικούς παράγοντες διαφάνειας, υποδεικνύοντας συγκεκριμένα ότι η υπόθεση υπερπροσαρμογής για τα μοντέλα αυτά δεν είναι βάσιμη. Περιορισμός της παρούσας μελέτης είναι το μικρό μέγεθος δείγματος, με N = 18. Για την επιβεβαίωση των ευρημάτων μας απαιτείται περισσότερη έρευνα με χρήση ευρύτερου εύρους τιμών Scaled AIC.
Για να διασφαλίσουμε τη σαφήνεια και την πληρότητα στην παρουσίαση των ερευνητικών μας αποτελεσμάτων, ενσωματώσαμε ειδική ενότητα αφιερωμένη στη σύνοψη των βασικών ευρημάτων της μελέτης μας. Για αυτή την ολοκληρωμένη επισκόπηση, παρακαλούμε συνεχίστε στην Ενότητα 7.
7. ΒΑΣΙΚΑ ΕΥΡΗΜΑΤΑ
Ο παρακάτω Table 11 παρουσιάζει μια ολοκληρωμένη ανάλυση της επίδοσης των μοντέλων και των σχετικών μεταβλητών στο πλαίσιο των εργασιών λεξικής απόφασης και ονομασίας, με βάση τα ευρήματα των Gagné et al. (2019). Κάθε ενότητα του πίνακα εξετάζει συγκεκριμένα θέματα, αποκαλύπτοντας ποια μοντέλα είναι τα αποτελεσματικότερα. Οι έλεγχοι ANOVA και Kruskal–Wallis/Jonckheere–Terpstra (ενότητες 6.3 και 6.4) εφαρμόστηκαν μετά την απόδοση ονομαστικών (διατακτικών ή κατηγορικών) τιμών στους συντελεστές παλινδρόμησης των μοντέλων των Gagné et al. (2019). Για λεπτομέρειες σχετικά με τους ειδικούς ελέγχους που εφαρμόστηκαν, ανατρέξτε στις αντίστοιχες ενότητες.
TABLE 11.
Scaled AIC σε αγγλικές κλειστές σύνθετες λέξεις: Ολοκληρωμένη ανάλυση της επίδοσης των μοντέλων σε εργασίες λεξικής απόφασης και ονομασίας (Gagné et al. 2019)
294
Acta Linguistica Lithuanica XC
Exploring Scaled AIC within English Closed Compounds
Θέματα | Στατιστικές | Αξιολόγηση | Ενότητα Μεταβλητές ελέγχου | ANOVA | Συχνότητα σύνθετης λέξης ✓· Μήκος σύνθετης λέξης ~ | 6.3 Σημασιολογική διαφάνεια | Kruskal–Wallis Jonckheere–Terpstra | Πρώτο συστατικό NOF/ns· Δεύτερο συστατικό NOF/ns· Σύνθετη λέξη NOF/ns | 6.4
PAR: παραμετρικά δεδομένα | NPAR: μη παραμετρικά δεδομένα | ✓: καλύτερα μοντέλα (χαμηλότερο AIC) ~: κατώτερα μοντέλα (υψηλότερο AIC) | NOF/ns: απουσία υπερπροσαρμογής/μη σημαντικός έλεγχος
8. ΣΥΖΗΤΗΣΗ
Προηγούμενη έρευνα των Charitonidis (2022, 2024) έχει δείξει ότι το Scaled AIC είναι ένα αξιόπιστο μέτρο καλής προσαρμογής που μπορεί να χρησιμοποιηθεί στην επιλογή μοντέλων, ενδεχομένως σε συνεργασία με άλλα μέτρα, όπως ο έλεγχος Wald (βλ. ενότητα 3). Αναφορικά με τα μοντέλα πολλαπλής παλινδρόμησης των Gagné et al. (2019) με συχνότητα SUBTLEX-US, η παρούσα ανάλυση εισήγαγε πρόσθετες ιδιότητες του μέτρου Scaled AIC. Παρότι έχουν διατυπωθεί βάσιμοι προβληματισμοί σχετικά με τη σύγκριση μοντέλων προσαρμοσμένων σε διαφορετικά μεγέθη δείγματος με χρήση κριτηρίων πληροφορίας (βλ. ενότητα 2), τα ευρήματα της μελέτης αυτής υποδεικνύουν ότι, σε ορισμένα πλαίσια, το Scaled AIC μπορεί πράγματι να αποτελέσει πολύτιμο εργαλείο για την αξιολόγηση της καλής προσαρμογής και την ιεράρχηση μοντέλων παλινδρόμησης. Η έρευνά μας έδειξε ότι το Scaled AIC ανταποκρίνεται στον πειραματικό σχεδιασμό, στις πηγές χρόνων απόκρισης και σε συγκεκριμένες εργασίες. Ωστόσο, είναι ουσιώδες να αναγνωριστεί ότι η εφαρμοσιμότητα του Scaled AIC μπορεί να εξαρτάται από το πλαίσιο και ότι η χρησιμότητά του θα πρέπει να αξιολογείται κατά περίπτωση.
Πριν προχωρήσουμε στα κύρια ευρήματα της παρούσας εργασίας, είναι σημαντικό να εξετάσουμε τα ερευνητικά ερωτήματα που διατυπώθηκαν στην ενότητα 4.
1. Οι κατανομές των τιμών του Scaled AIC, μαζί με συνδυασμούς διαφορετικών πηγών χρόνων απόκρισης και εργασιών επεξεργασίας, υποδηλώνουν ότι το Scaled AIC εντοπίζει αποτελεσματικά την παρουσία ή απουσία σαφώς προσδιορισμένων υποκείμενων παραγόντων στον πειραματικό σχεδιασμό και τη στατιστική μοντελοποίηση. Στο πλαίσιο αυτό, η λεξική απόφαση του BLP και η κατονομασία του ELP παρουσίασαν ισχυρότερη προβλεπτική ισχύ για το Scaled AIC ακόμη και υπό ελεγχόμενες συνθήκες.
2. Η συχνότητα του Compound ήταν κατ’ εξαίρεση αρνητικός προβλεπτικός παράγοντας του Scaled AIC, υποδεικνύοντας πάντοτε μεγάλη επίδραση. Η λεξική απόφαση του ELP παρουσίαζε σταθερά
Straipsniai / Articles
295
CHARITON CHARITONIDIS
σημαντικές θετικές συσχετίσεις με το μήκος του Compound, προβλέποντας υψηλότερες (=κατώτερες) τιμές του Scaled AIC. Η λεξική απόφαση του BLP παρουσίαζε σταθερά μη σημαντικές συσχετίσεις με το μήκος του Compound. Τόσο η λεξική απόφαση όσο και το μήκος του Compound προέβλεπαν κατώτερα μοντέλα κατά την προσαρμογή συνδιακυμάνσεων.
3. Η θετικότητα και το επίπεδο σημαντικότητας των συντελεστών διαφάνειας στα μοντέλα των Gagné et al. (2019) δεν επηρέασαν το μέγεθος του Scaled AIC. Το εύρημα αυτό υποδηλώνει ότι τα μοντέλα των Gagné et al. (2019) με προβλεπτικούς παράγοντες διαφάνειας δεν εισάγουν μεροληψία υπερπροσαρμογής.
Με αναφορά σε συγκεκριμένες ενότητες των αναλύσεων, τα κύρια ευρήματα της παρούσας μελέτης μπορούν να συνοψιστούν ως εξής:
Στην Ενότητα 6.1, η ανάλυσή μας επικεντρώθηκε στη σύγκριση μεταξύ των τιμών του Scaled AIC σε διάφορες κατηγορίες μοντέλων. Ακόμη και μετά την απόπειρα εφαρμογής των μετασχηματισμών «φυσικός λογάριθμος» και «τετραγωνική ρίζα» στις απόλυτες τιμές, το συνολικό δείγμα του Scaled AIC δεν ακολουθούσε κανονική κατανομή. Παρομοίως, τα μοντέλα λεξικής απόφασης του ELP παρουσίασαν μη παραμετρική κατανομή των τιμών του Scaled AIC. Αντιθέτως, τα δεδομένα που σχετίζονταν με τη λεξική απόφαση του BLP και την κατονομασία του ELP ακολουθούσαν πρότυπο κανονικής κατανομής.
Στην Ενότητα 6.2, η εστίασή μας μετατοπίστηκε στην εξέταση της σχέσης μεταξύ του Scaled AIC και (α) των πηγών χρόνων απόκρισης και (β) της επίδοσης στις εργασίες. Ενδιαφέρον παρουσιάζει το γεγονός ότι τα εύρη των τιμών του Scaled AIC για τα μοντέλα λεξικής απόφασης του ELP και του BLP δεν επικαλύπτονταν, γεγονός που καταδεικνύει τη διακριτότητά τους. Τα αποτελέσματα των ελέγχων αποκάλυψαν σημαντικές κύριες επιδράσεις τόσο της πηγής χρόνου απόκρισης όσο και της επίδοσης στην εργασία στο Scaled AIC. Αξιοσημείωτα, η προβλεπτική ικανότητα του Scaled AIC ήταν καλύτερη για τα μοντέλα που συνδέονταν με τους χρόνους λεξικής απόφασης του BLP και την εργασία κατονομασίας. Τα ευρήματα αυτά συμβάλλουν σημαντικά στην ακρίβεια και την αποτελεσματικότητα των αντίστοιχων μοντέλων.
Στην Ενότητα 6.3, η διερεύνησή μας εστίασε στη σχέση μεταξύ του Scaled AIC και των μεταβλητών ελέγχου «συχνότητα του Compound» και «μήκος του Compound». Η συχνότητα του Compound αποκλείστηκε από την ανάλυση, επειδή ήταν πλήρως συγγραμμική με το Scaled AIC. Από την άλλη πλευρά, παρατηρήθηκε μείωση των τιμών του Scaled AIC όταν το μήκος του Compound καθίστατο σχετικός παράγοντας εντός των μοντέλων. Παράλληλα, το μήκος του Compound ήταν περισσότερο σχετικό με την εργασία κατονομασίας.
Όσον αφορά την προσαρμογή συνδιακυμάνσεων, τόσο η εργασία λεξικής απόφασης όσο και το μήκος του Compound προέβλεπαν κατώτερα μοντέλα.
Στην Ενότητα 6.4, η εστίασή μας τοποθετήθηκε στη σχέση μεταξύ του Scaled AIC και της σημασιολογικής διαφάνειας. Το ερευνητικό ερώτημα ήταν κατά πόσον η θετικότητα και το επίπεδο σημαντικότητας των συντελεστών διαφάνειας στα μοντέλα των Gagné et al. (2019) επηρέαζαν το Scaled AIC. Πρωταρχικός στόχος της μεθόδου μας ήταν ο εντοπισμός πιθανών φαινομένων υπερπροσαρμογής. Υποθέσαμε ότι τα μοντέλα με κατώτερες τιμές του Scaled AIC ενδέχεται να διαθέτουν σημαντικούς συντελεστές που διατηρούν συνάφεια
296
Acta Linguistica Lithuanica XC
Exploring Scaled AIC within English Closed Compounds
σύμφωνα αποκλειστικά με το σύνολο δεδομένων LADEC. Ενώ παρατηρήσαμε τάση αυξανόμενων (=κατώτερων) τιμών του Scaled AIC για μια συστάδα σημαντικών αρνητικών συντελεστών σε επίπεδο Compound —σε συμφωνία με την υπόθεσή μας περί υπερπροσαρμογής—, ο έλεγχος Jonckheere–Terpstra έδειξε ότι η τάση αυτή δεν达νει στατιστική σημαντικότητα.
Συμπερασματικά, η διερεύνηση διαφορετικών παραμέτρων με τη χρήση του Scaled AIC ως εξαρτημένης μεταβλητής ανέδειξε τους ποικίλους τρόπους με τους οποίους οι κατηγορίες μοντέλων, η πηγή χρόνου απόκρισης, οι εργασίες επεξεργασίας, οι μεταβλητές ελέγχου και η σημασιολογική διαφάνεια επηρεάζουν την καλή προσαρμογή των μοντέλων. Αναγνωρίζοντας τις λεπτές σχέσεις μεταξύ αυτών των στοιχείων, οι ερευνητές είναι καλύτερα εξοπλισμένοι να λαμβάνουν τεκμηριωμένες αποφάσεις ως προς την επιλογή, την προσαρμογή και την ερμηνεία μοντέλων.
REFERENCES
Akaike Hirotugu 1973: Information Theory and an Extension of the Maximum Likelihood Principle. – Second International Symposium on Information Theory, eds. B. F. Csaki, B. N. Petrov, Budapest: Academiai Kiado, 267–281.
Aldrich John R. 1997: R. A. Fisher and the Making of Maximum Likelihood 1912–1922. – Statistical Science 12(3), 162–176.
Baayen Harald R., Piepenbrock Richard, Gulikers Leon 1995: The CELEX Lexical Database (Data set, Release 2, CD-ROM), Linguistic Data Consortium, University of Pennsylvania. Available at: https://catalog.ldc.upenn.edu.
Balota David A., Yap Melvin J., Cortese Michael J., Hutchison Keith I., Kessler Brett, Loftis Bjorn, Neely James H., Nelson Douglas L., Simpson Greg B., Treiman Rebecca 2007: The English Lexicon Project. – Behavior Research Methods 39, 445–459.
Brysbaert Marc, New Boris 2009: Moving Beyond Kučera and Francis: A Critical Evaluation of Current Word Frequency Norms and the Introduction of a New and Improved Word Frequency Measure for American English. – Behavior Research Methods 41, 977–990. DOI: doi.org/10.3758/BRM.41.4.977.
Burnham Kenneth P., Anderson David R. 2002: Model Selection and Multimodal Inference: A Practical Information-Theoretic Approach, 2ⁿᵈ edition, New York: Springer. DOI: dx.doi.org/10.1007/b97636.
Charitonidis Chariton 2022: Context Concreteness for the Second Constituent Slows Down Compound-Word Processing. – Lexis 20. DOI: doi.org/10.4000/lexis.6769.
Straipsniai / Articles
297
CHARITON CHARITONIDIS
Charitonidis Chariton 2024: The Role of Hyponymy and Context Concreteness in Compound Word Processing. – Studia Neophilologica. DOI: doi.org/10.1080/00393274.2024.2336851.
Chen Xiaocong, Dong Yanping, Yu Xiufen 2018: On the Predictive Validity of Various Corpus-Based Frequency Norms in L2 English Lexical Processing. – Behavior Research Methods 50, 1–25. DOI: doi.org/10.3758/s13428-017-1001-8.
Field Andy 2009: Discovering statistics using SPSS, 3rd edition, London: Sage Publications.
Fisher Ronald A. 1922: On the Mathematical Foundations of Theoretical Statistics. – Philosophical Transactions of the Royal Society of London, Series A 222, 309–368.
Gagné Christina L., Spalding Thomas L., Schmidtke Daniel 2019: LADEC: The Large Database of English Compounds. – Behavior Research Methods 51, 2152–2179. DOI: doi.org/10.3758/s13428-019-01282-6.
Gagné Christina L., Spalding Thomas L., Spicer Patricia, Wong Dixie, Rubio Beatriz, Perez-Cruz Karen 2020: Is Buttercup a Kind of Cup? Hyponymy and Semantic Transparency in Compound Words. – Journal of Memory and Language 113. DOI: doi.org/10.1016/j.jml.2020.104110.
Hastie Trevor, Tibshirani Robert, Friedman Jerome 2009: The Elements of Statistical Learning: Data Mining, Inference, and Prediction. 2nd edition, New York: Springer.
Keuleers Emmanuel, Lacey Paula, Rastle Kathleen, Brysbaert Marc 2012: The British Lexicon Project: Lexical Decision Data for 28,730 Monosyllabic and Disyllabic English Words. – Behavior Research Methods 44, 287–304. DOI: doi.org/10.3758/s13428-011-0118-4.
Kullback Solomon 1959: Information Theory and Statistics. New York: Wiley.
Navarro Daniel J., Myung Jay I. 2005: Model Evaluation. – Encyclopedia of Statistics in Behavioral Science, vol. 3, eds. B. S. Everitt, D. C. Howell, Chichester: Wiley, 1239–1242.
Steiger James H. 1980: Tests for Comparing Elements of a Correlation Matrix. – Psychological Bulletin 87(2), 245–251. DOI: doi.org/10.1037/0033-2909.87.2.245.
Wagenmakers Eric-Jan, Farrell Simon 2004: AIC Model Selection Using Akaike Weights. – Psychonomic Bulletin & Review 11(1), 192–196.
298
Acta Linguistica Lithuanica XC
Exploring Scaled AIC within English Closed Compounds
I N T E R N E T D I S C U S S I O N S
Model comparison with AIC based on different sample size. Available at: https://stats.stackexchange.com/questions/94718/model-comparison-with-aic-based-on-different-sample-size [accessed 15.5.2024].
What is the acceptable range of skewness and kurtosis for normal distribution of data? Available at: https://www.researchgate.net/post/What_is_the_acceptable_range_of_skewness_and_kurtosis_for_normal_distribution_of_data [accessed 15.5.2024].
L A R G E L A N G U A G E M O D E L S
GPT-3.5 (available at: https://chat.openai.com/) and Google Gemini (available at: https://gemini.google.com [accessed 11.10.2023]) were selectively used as auxiliary proofreading and editing tools. The responses from both AI tools were further proofread and edited by the author.
Anglų kalbos uždarųjų junginių (sudurtinių žodžių) skalės AIC tyrimas
S A N T R A U K A
Šiame tyrime nagrinėjamos modifikuotos Akaikės informacijos kriterijaus, pavadinto skalės kriterijumi, t. y. AIC, kaip tinkamumo rodiklio, padalinto iš imties dydžio, varianto ypatybės. Tyrimo objektas – 66 daugialypės regresijos modeliai, susiję su uždarųjų (sudurtinių) anglų kalbos žodžių junginių, paimtų iš Gagné'es ir kitų (2019) Anglų kalbos sudurtinių žodžių (junginių) didžiosios duomenų bazės (angl. LADEC), apdorojimu. Toliau pateikiami išsamios analizės rezultatai:
1. Modelių kategorijų modeliai pasižymi nevienareikšmiais rezultatais. Britų kalbos žodyno projekto (angl. BLP) leksinių sprendimų modeliai ir Anglų kalbos žodyno projekto (angl. ELP) įvardijimo modeliai veikia geriau (tai rodo mažesnis AIC), palyginus su Anglų kalbos žodyno projekto (angl. ELP) leksinių sprendimų modeliais.
Straipsniai / Articles
299
CHARITON CHARITONIDIS
2. Laiko šaltinio ir leksikos apdorojimo užduočių atsakymais atskleidžia reikšmingus pagrindinius skalės AIC rezultatus. Britų kalbos žodyno projekto leksinių sprendimų modeliai ir Anglų kalbos žodyno projekto įvardijimo modeliai veikia gerai, o pastarojo projekto leksinių sprendimų modeliai yra mažiau veiksmingi.
3. Įvertinus kontrolinius kintamuosius, tokius kaip junginių dažnumas ir junginių ilgis, matyti, kad modelių rezultatyvumas skiriasi. Junginių dažnumas yra stiprus veiksnys (parodo didesnis produktyvumas), o sudėtinio ilgio modelių prognozės blogesnės.
4. Kalbant apie pirmosios ir antrosios žodžių junginių sudedamųjų dalių, taip pat ir apie junginių semantinį skaidrumą, modeliai nerodo per didelio suderinamumo. Tai parodo, kad semantinis skaidrumas nesumažina modelių galėjimo apibendrinti naujus duomenis.
Įteikta 2024 m. sausio 11 d.
CHARITON CHARITONIDIS
[email protected]
300
Acta Linguistica Lithuanica XC