Diachronní korpusová analýza: slovosled českých posesivních adjektiv uvnitř nominální fráze
Abstract
42
Full text
Diachronní korpusová analýza: slovosled českých posesivních adjektiv uvnitř nominální fráze jan Křivan — michal Láznička ABSTRACT: Diachronic corpus analysis: the order of Czech possesive adjectives within nominal phrase. This paper is concerned with the diachronic development of the placement of Czech possessive adjectives relative to the head noun in Old and Middle Czech. At the same time, the aim of this study is also to introduce apossible way of approaching complex language data. We base our analysis on cross-linguistic synchronic generalizations regarding possessor placement which connect monolexemic possessors (which are high on the nominal animacy hierarchy) to the prenominal position. Asample of 1417 possessive adjectives obtained from available sources of Old and Middle Czech texts was annotated for an array of semantic and syntactic variables. The relationship between these variables and the possessor placement was analysed using classification trees and random forests. The results do not support the synchronic generalizations. We interpret this finding by positing two frequent, lexically partially filled constructions, N Kristův ‘N of Christ’ and syn N-ův ‘son of N’. We conclude that the patterns observed in the data can be explained by the interaction of extralinguistic socio-cultural factors and the effects of frequency and similarity in these two constructions. KLÍČOVÁ SLOVA / KEY WORDS: adnominální posesivita, diachronní korpusová analýza, klasifikační stromy, lingvistika založená na užívání jazyka, náhodné lesy, postavení posesora uvnitř nominální fráze adnominal possession, classification trees, diachronic corpus analysis, pos sessor placement within nominal phrase, random forests, usage-based linguistics 1. ÚVOD Vposledních několika desetiletích prochází lingvistika vmnoha svých subdisciplínách výraznou změnou, která je charakterizována důrazem na využití empirických metod zkoumání apráci srelativně velkými soubory dat. Vtomto procesu dochází také kpostupnému osvojování rigoróznějších metod práce apřebírání pokročilých statistických technik, které jsou vhodné pro analýzu dat scharakteristikami typicky vídanými vlingvistickém výzkumu. Průkopníky tohoto směru jsou studie psycholing vistické, které mají vurčitém slova smyslu blíže kexperimentální psychologii než kteoretické lingvistice. Vposledních letech se však tento trend prosazuje ivkorpusové lingvistice, lingvistické typologii či sociolingvistice (např.Poplack & Cacoullos, 2015; Widmer et al., 2017). Po svém nástupu na počátku 80.let procházejí také podoblasti kognitivně afunkčně orientované lingvistiky vposledních desetiletích podobným empirickým obratem. Stím souvisí rostoucí zájem olingvistiku založenou na užívání jazyka OPEN ACCESS
jAN KŘIVAN — mIchAL LÁZNIČKA 43 (usage-based linguistics) aemergentistický pohled na gramatiku (Bybee, 1985, 2006; Hopper, 1987; Langacker, 1988). Tyto přístupy se dívají na jazyk jako na komplexní dynamický (někdy též adaptivní) systém (Beckner et al., 2009), tj.jako na „dynamický systém proměnlivých kategorií aflexibilních omezení, které jsou neustále přestrukturovávány areorganizovány pod tlakem doménově nespecifických kognitivních procesů“ (Diessel, 2017, vlastní překlad). Základní principy jsou následující: (i) Jazyk slouží ke zprostředkování komunikace mezi jednotlivými členy daného jazykového společenství, kteří její pomocí naplňují své cíle. (ii) Mluvčí mezi sebou interagují svyužitím inventáře jazykových prostředků různé úrovně uložených vpaměti zpředchozích komunikačních situací (usage events).1 (iii) Na základě výsledků těchto interakcí jsou některé prvky tohoto mentálního inventáře zvýhodňovány ajiné naopak penalizovány. Jazyková struktura, systematičnost aidiosynkratičnost, které typicky pozoruje apopisuje lingvistika, se pak „vynořují“ (emerge) jako vedlejší produkt těchto lokálních interakcí na úrovni jednotlivých mluvčích. Tyto přístupy tak ze své podstaty umožňují vysvětlovat jazykové chování mluvčích jak pomocí sociálních faktorů (předpoklad bohatých informací ointerakčním aobecně mimojazykovém kontextu jako součásti reprezentace), tak doménově nespecifických kognitivních mechanismů (efekty frekvence různé úrovně, podobnosti aanalogie, recentnosti aprimingu). Zvýše uvedeného zároveň plynou dvě skutečnosti: (i) jednak se nepředpokládá, že by mentální gramatiky všech příslušníků daného společenství byly zcela totožné, (ii) jednak se tyto mentální gramatiky vyvíjejí během celého života mluvčího; vdůsledku lze předpokládat, že po každé jednotlivé komunikační situaci dochází kaktualizaci těchto gramatik. To zároveň implikuje, že nositeli jazykové změny vtomto přístupu nejsou primárně děti osvojující si daný jazyk, ale spíše dospělí mluvčí. Do popředí zájmu se tím dostávají variující, blízce synonymní struktury různého řádu, unichž jsou zkoumány faktory, které vedou kvýběru jedné ze „soupeřících“ konstrukcí nad jinou. Stále častěji se pak utakových výzkumných problémů uplatňuje korpusový výzkum, při němž je velký vzorek anotován sohledem na řadu teoreticky motivovaných proměnných anásledně jsou konstruovány statistické modely, sjejichž pomocí se usuzuje na vliv daných faktorů na užití některé zvariant konstrukce.2 Takové modely potom jednak popisují aza pomoci sledovaných prediktorů vysvětlují pravidelnosti vdaném datovém souboru, jednak predikují chování mluvčích. Tyto predikce je pak možno testovat nepřímo na dalších textech vnásledných korpusových analýzách či přímo vlaboratorním prostředí manipulací zjištěných prediktorů vexperimentálním kontextu. 1 Teoreticky vzato se jedná ojednotky sahající od jednotlivých artikulačních gest přes lexikální slova azobecněné, lexikálně nespecifické konstrukce až po nadvětné celky. 2 Jak upozorňují Milin et al. (2016), tyto modely typicky nemají ambici být kognitivně realistické vtom smyslu, že by předpokládaly podobný typ analýzy (typicky lineární regrese) vmyslích mluvčích při zpracování jazyka, volené techniky modelování vycházejí spíše zcharakteristik dat ahledají kompromis mezi dostatečně výkonnou apřiměřeně komplexní analýzou. OPEN ACCESS
44 STUDIE ZAPLIKOVANÉ LINGVISTIKY Nutnou součástí uvažování ojazyce vrámci přístupů založených na užívání je dále logicky idiachronní výzkum. Vpřípadě existence konkurenčních prostředků je po každé úspěšné komunikační situaci posílena paměťová stopa užité varianty ajejí asociace sdaným kontextem, zatímco reprezentace konkurenční varianty (či její asociace sdaným kontextem) může být oslabena. Jedna zvariant se pak postupně může stát pro daného mluvčího natolik úspěšnou či užitečnou, že druhou zcela přestane používat ajejí paměťová stopa postupně téměř zanikne. Tento proces se může opakovat utak velkého množství mluvčích, že dojde kjazykové změně ajedna zvariant se zcela ztratí či zůstane velmi silně kontextově omezena. Jazykový vývoj je tak přirozeně vnímán jako odraz aextenze stejných principů, které je možno pozorovat vkaždém okamžiku vmikroperspektivě jednotlivých komunikačních situací. Také výše popsaná metodologie je přirozeně aplikovatelná ivdiachronním výzkumu. Studujeme-li období vývoje jazyka, pro které je dostupný relativně objemný textový materiál, azaměřujeme-li se zároveň na dvě či více konstrukcí spodobnou funkcí, které si vurčitém období konkurovaly, je možné svyužitím zmiňovaného přístupu kjazyku lépe popsat apochopit kontexty, které favorizují tu či onu konstrukci, avdůsledku lépe pochopit vývoj vdané fázi. Takové studie, které kombinují perspektivu mechanismů ovlivňujících reprezentace azpracování jazyka na individuální úrovni sperspektivou vývoje včasových úsecích přesahujících jednotlivé generace, se začínají vposlední době objevovat stále častěji (např.Hilpert, 2013 či Wolk et al., 2013). Tato studie vychází zvýše uvedených principů aklade si dva cíle: na příkladu vývoje slovosledu vrámci adnominální posesivní konstrukce včeštině chceme za využití tohoto obecného metodologického rámce (i) představit možnosti využití moderních pokročilých statistických metod a(ii) zároveň popsat některé faktory, které mohly mít na vývoj konstrukce vliv, atím rozšířit naše poznatky otéto problematice včeské historické mluvnici. Konkrétně se soustředíme na variaci vpostavení posesivního adjektiva (posesora) vrámci adnominální posesivní konstrukce vůči řídícímu substantivu (posesu) vobdobí od počátku 14.století do roku 1850.3 Vycházíme přitom zněkolika mezijazykových pozorování, která spojují pozici posesora sněkterými sémantickými, syntaktickými adiskurzně-pragmatickými faktory. Vedle této výchozí hypotézy pak vrámci tohoto exploratorního výzkumu sledujeme další faktory, které mohly mít na postavení posesora vliv. Struktura článku je následující: Vdruhém oddílu představíme vstupní hypotézu avýzkumné otázky apopíšeme dosavadní poznatky oslovosledu uvnitř jmenné fráze včeštině. Ve třetím oddílu popíšeme proces tvorby vzorku apovahu zdrojových souborů dat anásledné anotace konkordancí ve vzorku včetně přehledu jednotlivých sledovaných proměnných. Ve čtvrtém oddílu představíme zvolenou metodu analýzy, klasifikační stromy anáhodné lesy. Vpátém oddílu představíme výsledky analýzy spolu sjejich interpretací. Vzávěru článek krátce shrneme. 3 Vcelém článku používáme pojmy posesor pro vlastníka aposesum pro vlastněné. OPEN ACCESS
jAN KŘIVAN — mIchAL LÁZNIČKA 45 2. VÝZKUMNÁ OTÁZKA ATEORETICKÉ PŘEDPOKLADY PRO VÝVOJ SLOVOSLEDU UVNITŘ NOMINÁLNÍ FRÁZE 2.1 VÝZKUmNÁ OTÁZKA Způsob vyjádření posesivity uvnitř nominální fráze se vsoučasné češtině vyznačuje obecně známou dichotomií: lexikálně vyjádřeného posesora lze za určitých morfologických podmínek vyjádřit buď posesivním adjektivem, nebo genitivní konstrukcí. Obojí způsob vyjádření má přitom (do značné míry) pravidelné koreláty zhlediska slovosledu: posesivní adjektiva se vyskytují uvnitř nominální fráze vantepozici (1a), zatímco genitivní konstrukce převážně (tj.svýjimkou zvláštních případů prenominálního genitivu) vpostpozici (1b). (1) a. Janova kniha b. Kniha krále Jana Tento stav je však relativně nový. Bylo už dříve zjištěno, že vnejstarších zdokladovaných obdobích, tj.od 14.století, mohla stát všechna adjektiva (tedy irelační akvalitativní) jak vantepozici, tak vpostpozici (Gebauer, 2007/1929). Variaci uposesivních adjektiv ilustruje příklad (2). (2) a. Jozef, jenž jest uprosil uPiláta [tělo Ježíšovo] (Vokabulář webový 2006–2016a, položka 6640, datace 1442) b. S[rychtářovým odpuštěním] prsty zdvihl. (Vokabulář webový 2006–2016a, položka 67078, datace 1490) Tato slovosledná variace existovala až do 19.století. Dosud však nebylo podrobněji zkoumáno, jak se uvedená variace vprůběhu let vyvíjela, ani nebylo podrobně popsáno, jak se měnil poměr obou sledů akteré faktory měly vliv na vývoj ksoučasnému stavu.4 Stanovili jsme si tedy následující výzkumnou otázku: jak se vyvíjelo slovosledné postavení adjektivního posesora uvnitř nominální fráze včeštině od počátku 14.století do roku 1850. Konkrétněji jsme potom chtěli především zachytit změny vpoměru antepozice apostpozice vzávislosti na čase aněkterých jazykových imimojazykových faktorech. 4 Variaci avývoji adnominální posesivní konstrukce vsoučasné češtině se věnoval Vachek, který argumentoval ve prospěch pronikání genitivu na místo posesivních adjektiv tím, že vobjektivním pořádku tématu arématu je „žádoucí, aby označení vlastněného předmětu, jakožto členu určovaného, předcházelo před označením vlastníka, které platí za člen určující“ (Vachek, 1972, s.147). Toto vysvětlení je založeno na zcela opačné argumentaci než vysvětlení, která předkládáme níže. OPEN ACCESS
46 STUDIE ZAPLIKOVANÉ LINGVISTIKY 2.2 TEOrETIcKÉ PŘEDPOKLADY AVSTUPNÍ hYPOTÉZA Pro náš výzkum jsme přijali teoretické předpoklady, které vycházejí zfunkčně zaměřených přístupů (usage-based linguistics) nastíněných vúvodu tohoto článku. Využili jsme zejména poznatků jazykové typologie. Vgermánských, románských aslovanských jazycích bylo na synchronních datech pozorováno (O’Connor, Maling & Skarabela, 2013), že nominální konstrukce sposesorem vyjádřeným jedním lexémem jsou kategoriálně omezeny na antepozici (viz výše (1) vsoučasné češtině). Stejná tendence (tj.nikoliv kategoriální omezení, ale tendence vjazykovém užívání) se projevuje ivangličtině, pokud jde opreferenci prenominálního posesora vtzv.’s genitivu (3a) před posesorem prepozicionálním (3b). (3) a. John’s book b. Abook of King John Nominální fráze sprenominálním posesorem jsou vanglickém úzu spojeny svlastnostmi, které se na základě rozsáhlých zkoumání lingvistické typologie zrůzných jazyků světa přisuzují prototypickým agentivním argumentům aposesorům: zejména umístění vysoko na škále na tzv.nominální hierarchii životnosti, viz např.Aikhenvald (2013): Posesor má tendenci obsazovat pozici relativně vysoko vnominální hierarchii: prototypický posesor je životný nebo lidský aje vyjádřen osobním zájmenem nebo vlastním jménem. (Aikhenvald, 2013, s.40, vlastní překlad) Stím úzce souvisí, že se posesoři společně sagentivními argumenty často identifikují jako entity vysoce aktivované vinformační struktuře věty (tj.jde typicky oznámou informaci— téma) (pro češtinu viz Křivan, 2014). Zároveň platí, že vantepozici mají tendenci se vyskytovat entity syntakticky lehké, tj.jednoduché, nerozvité (Behaghel, 1909; nověji viz např.hypotézy Hawkinse, 2004). Jedná se tedy vúhrnu oto, že prenominální posesivní konstrukce jsou podle těchto pozorování (diskuse viz O’Connor, Maling & Skarabela, 2013) typicky spjaty snerozvitými (syntakticky lehkými) životnými posesory, kteří jsou zhlediska diskurzu známí (referenčně aktivovaní). Naše vstupní hypotéza je proto následující: očekáváme, že právě takovéto entity se vhistorickém vývoji češtiny častěji vyskytovaly vantepozici alze uvažovat oroli těchto konstrukcí vdaných kontextech (tj.zejména oroli diskurzního statusu posesora vtěchto konstrukcích) jako spouštěčů celé kategoriální změny. Rozhodli jsme se tedy především sledovat referenční, sémantickou asyntaktickou charakteristiku posesora acelého posesivního spojení, abychom se pokusili odhalit uvedené principy. Jinými slovy, zatímco vznik konstrukce sposesorem vantepozici je na základě dosavadních výzkumů usage-based linguistics vysvětlen současným užíváním (rozložením diskurzně-pragmatických rysů vsynchronních datech), vnašem výzkumu se snažíme najít pro tato pozorování oporu vdiachronních datech. OPEN ACCESS
jAN KŘIVAN — mIchAL LÁZNIČKA 47 Na závěr této části musíme zdůraznit, že ipřes řadu výše nastíněných teoretických předpokladů budeme provádět analýzu exploratorní. To znamená, že sledujeme nejen faktory podporující naše předpoklady, ale také další, zejména společenské atextové charakteristiky, které mohly mít na zkoumanou variaci vliv. Vnásledujícím oddílu představíme skladbu vzorku ařadu charakteristik, které jsme anotovali, abychom dosáhli výše uvedených cílů. 3. SESTAVENÍ VZORKU DAT AANOTACE JEDNOTLIVÝCH POLOŽEK 3.1 VZOrEK DAT 3.1.1 ZDrOjOVÁ DATA Ksestavení vzorku jsme se rozhodli primárně využít edičně zpracovaných dat infrastruktury RIDICS Ústavu pro jazyk český AV ČR. Data zobdobí od 14.do 16.století jsme získali ze Staročeské textové banky (Vokabulář webový, 2006–2016a), data zobdobí od 16.století do poloviny 19.století pocházejí ze Středněčeské textové banky (Vokabulář webový, 2006–2016b). Vzhledem knižšímu objemu textů zobdobí střední češtiny jsme data částečně doplnili odiachronní zdroje Českého národního korpusu (diakorp v6: Kučera et al., 2015) zlet 1650 až 1850, stím, že data zduplicitních zdrojů jsme zahrnuli vždy pouze ve verzi ze Středněčeské textové banky. Všechny uvedené korpusy jsou zpovahy věci nereprezentativní, leč pro značnou část období se jedná ojediné dostupné (existující) texty dané doby. 3.1.2 EXTrAKcE APŘÍPrAVA KONKOrDANcÍ Zuvedených zdrojů jsme pomocí regulárních výrazů získali konkordance všech potenciálních výskytů posesivních adjektiv, viz (4). Tímto postupem jsme extrahovali celkem 85 104 položek. (Za získání dat ztextových bank ÚJČ děkujeme Borisovi Lehečkovi aEvě Lehečkové.) (4) [word=".*(ov|in)(ých|ým|ými|ýma|ejch|ejm|ejma)"] | [word=".*ov[aoyuěi]"] | [word=".*in[aoyuěi]"] | [word = ".*(ó|uo|ů)v"] Výsledky dotazu jsme uložili do tabulkové podoby. Každá konkordance obsahovala kromě samotného adjektiva ajeho levého apravého kontextu také metadata ztextových bank ÚJČ: jednoznačnou identifikaci položky, identifikaci zdroje, jeho přesné datování, uvedení padesátileté periody, literární druh aliterární žánr. Položky diakorpu, kde je použito částečně odlišné členění, jsme převedli do této šablony. Následně jsme ručně prošli aodfiltrovali všechny položky, které neodpovídají výskytu posesivních adjektiv. Tím jsme získali soubor 13 254 položek jako základ pro vytvoření samotného vzorku (9380 adjektiv odvozených zproprií, 3874 odvozených zapelativ). OPEN ACCESS
48 STUDIE ZAPLIKOVANÉ LINGVISTIKY 3.1.3 VYTVOŘENÍ VZOrKU Data kanalýze jsme se rozhodli připravit jako stratifikovaný vzorek, vněmž bude (i)zajištěno dostatečné zastoupení jak adjektiv odvozených zproprií, tak adjektiv odvozených zapelativ, (ii) obsažen alespoň minimální počet dokladů ze všech padesátiletých period, který umožní statistickou analýzu, (iii) uperiod zastoupených více doklady bude využito většího množství položek. Kanotaci jsme připravili 1000 adjektiv zproprií a500 adjektiv zapelativ (počet deapelativních adjektiv ve vzorku jsme tak oproti striktně poměrnému zastoupení mírně navýšili). Vtabulkovém editoru jsme vytvořili systém vzorců, který spočítal doklady vkaždé zperiod. Následně jsme počty dokladů do vzorku depropriálních ideapelativních adjektiv zajistili ve dvou krocích: (i) vprvním skrutiniu jsme rozpočítali dvě třetiny dokladů rovnoměrně podle period (pokud doklady vdané periodě dosahovaly alespoň tohoto poměrného počtu), (ii) vdruhém skrutiniu byla zbylá třetina rozdělena podle přebytků všech period (vjejich vzájemném poměru). Uvedený vzorek jsme uložili do tabulky, aby mohl být následně doplněn oanotační kategorie. Při práci na anotacích (viz oddíl 3.2.1) jsme pak museli ještě vyřadit další konkordance, které nebyly posesivními adjektivy nebo pro ně nebyly dostupné veškeré požadované informace. Finální vzorek tak obsahoval celkem 1417 výskytů, znichž je 466 deapelativních a953 depropriálních posesorů. 3.2 ANOTAcE 3.2.1 ANOTAcE ZÁKLADNÍch chArAKTErISTIK Vtabulkových souborech jsme sohledem na výzkumnou otázku připravili základní anotační charakteristiky, které lze vysledovat zkontextu jednotlivých dokladů: (i)informace oposesorovi: (a) lemma posesora, (b) rozvití posesora (bez rozvinutí, koordinace, modifikace, apozice), (c) životnost posesora (lidský, ostatní životný, neživotný); (ii) informace onominální frázi: (a) slovosled nominální fráze (celá nominální fráze členěná po slovech: tři pozice nalevo anapravo od řídícího členu NP), (b)syntakticko-sémantické určení modifikátorů (posesor, demonstrativum, kvantifikátor, relační adjektivum, kvalitativní adjektivum, genitivní konstrukce, předložková konstrukce, vztažná klauze), (c) pád řídícího členu NP, (d) řídící člen řídícího členu NP (jeho slovní druh), (e) (ne)projektivita posesora ařídícího členu vrámci klauze, (f) pozice řídícího členu NP vůči slovesu (před slovesem: téma, za slovesem: réma). Uvedené charakteristiky byly prakticky anotovány tak, aby bylo možné další zpracování kategorií (kombinování kategorií, vylučování hodnot zkategorií, jejich rozdělování islučování). Základní anotaci dokladů připravily pod naším vedením studentky FF UK Lucie Salzmannová aAnna Stuchlá, následně jsme provedli kontrolu všech položek avyřadili jsme další konkordance, které nebylo možné zahrnout do vzorku (viz oddíl 3.1.3), abychom mohli provést finální anotaci pro potřeby statistických výpočtů. OPEN ACCESS
jAN KŘIVAN — mIchAL LÁZNIČKA 49 3.2.2 fINÁLNÍ ANOTAcE KATEGOrIÍ PrO STATISTIcKÉ ANALÝZY Připravené položky jsme sloučili do jedné tabulky apřipravili tak datový soubor pro statistické zpracování. Všechny sledované proměnné azpůsob jejich vytvoření představíme na následujících řádcích po jednotlivých tematických skupinách. Závislá proměnná Závislou proměnnou (A) jsme extrahovali pomocí jednoduchého vzorce zkomplexních informací oslovosledu nominální fráze. (A) pozice posesora vůči řídícímu substantivu (pr.position): antepozice (initial), postpozice (final)5 Metadata Vzhledem kdiachronní povaze výzkumu jsme museli pečlivě zvážit časové hledisko. Jednou zmožností je pojmout čas jako spojitou proměnnou, kde jsou díla reprezentována pomocí vročení. Spojitý charakter této proměnné by však zachytil iřadu idiosynkratických rozdílů (např.mezi jednotlivými tituly), proto jsme využili přístup, který pracuje sintervaly azároveň přímo na základě dat identifikuje periody, vnichž dochází kdiachronní změně ve variaci sledované závislé proměnné (A). Časovou osu jsme nejprve rozdělili na periody po 25 letech (nejjemnější dělení, vněmž bylo ještě smysluplné získaná data kvantitativně porovnávat, zároveň jsme kvůli nedostatku primárních dat sloučili nejstarší tři období 1300–1375 aztéhož důvodu zůstalo neobsazeno období 1625–1650). Následně jsme vtěchto obdobích pomocí metody variability-based neighbour clustering (VNC, Gries & Hilpert, 2012a) avypočítaného dendrogramu identifikovali celkem tři periody, vnichž se data zhlediska závislé proměnné chovají nejvíce kohezivně (tj.seskupují se do klastrů): 1300–1400, 1400–1725, 1725–1850, viz graf 1 avýsledná proměnná (B).6 Výpočet jsme provedli vprogramu R (R Core Team, 2017) postupem zveřejněným na webu Gries & Hilpert (2012b) pomocí připravené funkce vnc.individual. Zároveň jsme upravili anotaci žánrového členění (C). (B) časové členění na periody metodou VNC (period.id): 1.rané období do konce 14.století (early), 2.střední období od začátku 15.století do první čtvrtiny 18.století (high), 3.pozdní období od druhé čtvrtiny 18.století do poloviny 19.století (late) (C) žánry (genre): disputace (arg), bible ajejí části (bib), slovníky (dict), zábavná literatura (fun), kroniky (chron), naučná literatura (learn), naučná náboženská literatura (learn.cr), legendy (leg), noviny (newsp) 5 Kurzivou vzávorce uvádíme názvy proměnných ajejich hodnot užité vanotačním schématu ipři výpočtech. 6 Jedná se ovyužití klastrové analýzy, která je vzhledem kanalyzované časové dimenzi omezena tím, že vytvoření uzlu je možné pouze upřímo sousedících datových bodů (odtud tedy neighbour clustering). OPEN ACCESS
50 STUDIE ZAPLIKOVANÉ LINGVISTIKY Sémantické vlastnosti posesivního spojení Tři další charakteristiky se týkají sémantiky vztahu mezi posesorem aposesem. Následující kategorie jsme doanotovali na základě dalších úvah nad daty: status specifičnosti posesora založený na typu jména (D), ne/zcizitelnost posesa (E), sémantický typ posesa (F). (D) status specifičnosti posesora založený na typu jména (status): proprium unikátní (uni.prop), proprium ostatní (ot.prop), apelativum unikátní (uni.apel), apelativum relační, tj.neunikátní (neuni.apel), apelativum ostatní (ot.apel) (E) zcizitelnost posesa (alienable): zcizitelný (a), nezcizitelný, tj.příbuzenské vzta - hy ačásti těla (i) (F) sémantika posesa, tj.řídícího členu fráze (h.class): příbuzenské ajiné osobní vztahy (soc.rel), část těla (b.part), událost (event), instituce (instit), místo (place), produkt (product), věc (thing) Tyto kategorie si zaslouží stručný komentář. Vpřípadě charakteristiky posesora (D) se jedná okomplexní proměnnou motivovanou výchozí hypotézou. Vprvní úrovni členění na typ jména posesora (propria, apelativa) vycházíme znominální hierarchie životnosti (Silverstein, 1976), vníž stojí (lidská) propria výše než apelativa. Při dalších úvahách ostatusu posesora nebylo vzhledem kpovaze anotovaných konkordancí (nedostatečně dlouhý kontext) možné bezpečně určit míru kontextové aktivovanosti Graf 1:Dendrogram vygenerovaný pomocí metody variability-based neighbour clustering se sledovanými časovými obdobími. Osa y = Vzdálenost jako součet směrodatných odchylek, osa x = časová období. OPEN ACCESS
jAN KŘIVAN — mIchAL LÁZNIČKA 57 Vprvní buňce vidíme, že pro 1071 datových bodů byla predikována postpozice, přičemž tuto hodnotu mají datové body ivanotovaném souboru, naopak 319 datových bodů, pro něž byla predikována postpozice, má ve vzorku antepozici, jde tedy onesprávně predikované případy. Ztabulky 1 získáme výpočtem poměru správně klasifikovaných případů klasifikační přesnost modelu, která činí 77 %, tedy o27 % více než náhodný model, zároveň je patrné, že model je velmi přesný při předpovědi postpozice, naopak pro většinu antepozic predikuje taktéž postpozici. Vpřípadě binární závislé proměnné je též možné pomocí funkce somers2() zbalíčku Hmisc (Harrell, 2017) vypočíst index konkordance (C-index), který vyjadřuje poměr případů, kdy je predikovaná pravděpodobnost dané hodnoty závislé proměnné vyšší než pravděpodobnost druhé možné ata je zároveň ihodnotou pozorovanou. Umožní nám to kód (8). (8) library(Hmisc) strom.adj.pred <- unlist(treeresponse(strom.adj)) [c(FALSE, TRUE)] somers2(strom.adj.pred, as.numeric(adjectives$pr.position) — 1) Získáme tak C-index 0,74, který je vliteratuře popisován jako indikátor přijatelné diskriminační síly modelu (viz Hosmer & Lemeshow, 2000, s.162). Vidíme, že získaný model je relativně úspěšný, ponechává ovšem též značný prostor pro zlepšení. Toho je možno dosáhnout rozšířením metody onáhodné lesy. 4.3 NÁhODNÉ LESY Analýzu pomocí klasifikačních stromů lze dále rozšířit azpřesnit pomocí metody generování náhodných lesů (random forests) (Breiman, 2001), která byla vyvinuta pro zmírnění některých nedostatků CART. Metoda je založena na generování velkého množství stromů, které jsou konstruovány stejným způsobem jako jednotlivé stromy; každý strom vdaném lese je přitom modelován na náhodně vybraném vzorku zanalyzovaného datového souboru za použití náhodné kombinace prediktorů vmodelu, jejichž počet je předem určen (standardně jde odruhou odmocninu celkového počtu prediktorů). Na základě jednotlivých stromů je možno predikovat hodnotu závislé proměnné pro pozorování, která do daného vzorku nebyla zařazena, atak lze pak hodnotit prediktivní sílu celého modelu. Náhodný les je možno svyužitím balíčku party vytvořit pomocí kódu (9). Argument ntree přitom stanoví počet jednotlivých vytvořených stromů, mtry potom určuje, kolik prediktorů má být vkaždém modelu použito, vtomto případě generujeme 500 klasifikačních stromů, každý svyužitím čtyř zcelkových 12 sledovaných prediktorů. (9) set.seed(75) les.adj <- cforest(pr.position ~ period.id + status + pr.cmplx + genre + alienable + h.class + h.case + h.head + h.cmplx + focus + nonproj + mod.other, data = adjectives, control = cforest_unbiased(ntree = 500, mtry = 4)) OPEN ACCESS
58 STUDIE ZAPLIKOVANÉ LINGVISTIKY Ačkoli takový model zlogiky věci neumožňuje podobnou vizualizaci jako jednotlivé stromy, můžeme ipro vytvořený les určit jeho přesnost. To provedeme pomocí kódu (10). Vprvním kroku opět získáme tabulky predikovaných apozorovaných hodnot, poté index konkordance. (10) table(predict(les.adj), adjectives$pr.position) les.adj.pred <- unlist(treeresponse(les.adj)) [c(FALSE, TRUE)] somers2(les.adj.pred, as.numeric(adjectives$pr.position) — 1) Použitím metody náhodného lesa získáváme model svýrazně vyšším indexem konkordance (0,85— výborná diskriminační schopnost modelu), zároveň vzrostla iprediktivní síla modelu (správně predikuje v81 % případů, úspěšnější je predikce antepozice, zůstává však stále relativně dosti chybová), viz tabulka 2. klasifikační strom náhodný les pozice posesora postpozice (pozorováno) antepozice (pozorováno) postpozice (pozorováno) antepozice (pozorováno) postpozice (predikováno) 1071 319 1062 261 antepozice (predikováno) 2 25 11 83 přesnost 77 % 81 % C-index 0,74 0,85 Tabulka 2:Srovnání prediktivní síly modelů klasifikačního stromu anáhodného lesa. Vedle toho můžeme na základě metody lesa získat další důležitou informaci: model nám umožňuje posoudit význam jednotlivých prediktorů pro přesnost modelu. Metoda je založena na permutačním testu, kdy jsou hodnoty jednoho prediktoru vdatovém souboru permutovány (Strobl et al., 2008). Permutovaný prediktor je spolu sostatními nezměněnými prediktory použit pro predikci hodnot pozorování mimo vzorek (viz výše) daného lesa. Pokud se přesnost při použití permutovaného prediktoru sníží, dovodíme, že daný prediktor je důležitý, pokud naopak zůstane srovnatelná, předpokládáme, že prediktor (ajeho hodnoty) není pro daný datový soubor důležitý. Funkce varimp() implementovaná vbalíčku party umožňuje tuto analýzu provést způsobem, který zároveň zohledňuje korelace mezi prediktory (argument conditional = T vnásledujícím kódu). Tyto hodnoty získáme způsobem uvedeným v(11). (11) les.varimp <- varimp(les.adj, conditional = T) Nevýhodou této metody jsou vysoké komputační nároky (výpočet pro popsaný les trval na laptopu ML několik hodin). Výsledkem jsou hodnoty pro jednotlivé proměnné, které vyjadřují právě pokles prediktivní síly. Příkazem v(12) získáme graf svypočtenými hodnotami seřazenými podle velikosti, viz graf 5. (12) dotchart(sort(les.varimp)) OPEN ACCESS
jAN KŘIVAN — mIchAL LÁZNIČKA 59 Zgrafu 5 můžeme jednak vyčíst, že jako výrazně důležitější prediktory se ukazují období, žánr, status posesora, sémantická třída řídícího členu, otrochu méně též komplexnost posesora, nadřazený řídící člen; naopak ostatní prediktory zřejmě nehrají zhlediska struktury dat příliš velkou roli. Zároveň je nutno poznamenat, že vypočtené hodnoty jsou velmi nízké. To ukazuje na to, že prediktory jsou výrazně korelované ažádný znich nemá sám osobě relativně větší sílu. Celkově tedy můžeme konstatovat, že vytvořený model náhodného lesa je poměrně přesný, ač existuje prostor pro zlepšování. Dále ivzhledem ktomu, co ukázal jednotlivý klasifikační strom, vidíme, že jako nejvýznamnější se ukazují prediktory období, žánr aaž následně typ posesora, sémantická třída řídícího členu, jeho řídící člen, okrajově jeho pád. Získané výsledky blíže diskutujeme vnásledujícím oddílu. 5. DISKUZE 5.1 ShrNUTÍ PrAVIDELNOSTÍ VDATEch Představená analýza poukazuje na pravidelnosti, které jsou teoreticky smysluplné alze je shrnout následujícím způsobem: — Vdatech je značná míra variace, po všechna sledovaná období přitom sledujeme značný podíl postpozice. — Významnější podíl na strukturování dat má žánr, období vzniku, dále také sémantické areferenční vlastnosti posesora asyntaktické vlastnosti řídícího členu. Graf 5:Významnost jednotlivých prediktorů vyhodnocená permutačním testem. OPEN ACCESS
60 STUDIE ZAPLIKOVANÉ LINGVISTIKY — Bible jakožto samostatný žánr vykazuje výraznou preferenci postpozice. — Depropriální posesor má obecně vyšší preferenci postpozice než posesor deapelativní. — Ve středním, datově nejvíce reprezentovaném období sledujeme mírný nárůst preference postpozice. — Pozice adnominální posesivní konstrukce vnepřímých pádech vykazuje nižší preferenci postpozice. — Adnominální posesivní konstrukce závislé na substantivech vykazují výraznou preferenci postpozice. Naše výchozí hypotéza předpokládala, že posesor, který je depropriální, svyšší mírou aktivace (vanotačním schématu unikátní) asyntakticky lehký, bude vykazovat tendenci objevovat se vantepozici dříve asvětší pravděpodobností. Pokud izolujeme výskyty stakovou hodnotou statusu specifičnosti posesora (nerozvinuté unikátní proprium), nalezneme 513 konkordancí, znichž je ve všech obdobích většina užita vpostpozici. Při pohledu na deapelativní posesory pak zjistíme, že izde má většina konkordancí posesora vpostpozici, viz srovnání vtabulce 3.Ze tří sledovaných stupňů aktivovanosti mají potom největší podíl postpozice unikátní deapelativní posesoři. období posesor 1. rané 2. střední 3. pozdní nerozvité unikátní proprium 18 / 32 60 / 330 17 / 56 unikátní apelativum 1 / 1 14 / 57 3 / 3 relační apelativum 16 / 11 71 / 161 12 / 19 ostatní apelativum 1 / 3 16 / 51 16 / 8 Tabulka 3:Srovnání nerozvinutých unikátních depropriálních posesorů se skupinami deapelativních posesorů bez ohledu na rozvitost (vjednotlivých buňkách je počet výskytů vantepozici/postpozici). Zhlediska sémantických adiskurzně-pragmatických vlastností jsou tedy trendy vdatech přesně opačné, než byl náš vstupní předpoklad. Domníváme se, že tento fakt je možno svyužitím východisek popsaných vúvodu studie smysluplně interpretovat. Než tak ovšem učiníme, je nutno ještě konstatovat, že analýza pomocí náhodných lesů ukázala byť malý příspěvek komplexnosti posesora, která byla součástí výchozí hypotézy. Vtomto případě situace odpovídá mezijazykovým pozorováním uvedeným voddílu 2: zcelkového počtu 150 rozvitých posesorů se většina (114) objevuje vpostpozici. Abychom vysvětlili nejvýraznější pozorované trendy, které jsou zároveň rozporné sohledem na výchozí hypotézu, blíže jsme prozkoumali některé další kategorie. OPEN ACCESS
jAN KŘIVAN — mIchAL LÁZNIČKA 61 5.2 VYSVĚTLENÍ TrENDŮ ODPOrUjÍcÍch VÝchOZÍ hYPOTÉZE: ANALÝZA LEmmAT POSESOrA ALEmmAT POSESA 5.2.1 ZÁKLADNÍ ZjIŠTĚNÍ Vzhledem kzobecnitelnosti ivelkému množství hodnot jsme do modelů nezahrnuli dvě základní anotační charakteristiky lemma posesora alemma posesa azároveň jsme při předcházející konstrukci vzorku nezohledňovali konkrétní lexikální obsazení konkordancí. Jak ukazuje tabulka 4, při pohledu na frekvenci lemmat vobou kategoriích pozorujeme některá výrazně nadreprezentovaná lemmata. Průměrná frekvence pro posesorské lemma činí 3,7, pro řídící člen pak 3,1. lemma posesora frekvence lemma posesa frekvence Kristus 197 syn 155 král 113 dům 43 hospodin 50 tělo 39 David 41 kniha 33 Mojžíš 41 pokolení 25 císař 30 slovo 23 Ježíš 27 víra 21 otec 24 jméno 20 Šalamoun 22 dcera 19 Jezukristus 21 smrt 18 Tabulka 4:10 lemmat posesora a10 lemmat posesa snejvyšší frekvencí ve vzorku. Tabulka 4 ukazuje, že posesorské lemma Kristus je ve srovnání se všemi ostatními výrazně frekventovanější. Pokud bychom chápali různá jména Krista jako jedno „konceptuální“ lemma Ježíš, bylo by zcelkového počtu 1417 pozorování 245 obsazeno tímto lexémem. Podobně je relativně velké množství případů obsazeno řídícím lexémem syn. Vzhledem ktomu, že obě tyto množiny jsou disjunktní, je celkový počet konkordancí obsazených jedním ztěchto dvou lemmat 400. Při pohledu na pozici posesora pak mají obě tato lemmata výraznou preferenci postpozice (347 postpozic). Lemma syn se navíc často objevuje ve spojeních typu Asyn B-ův či synové B-ovi (ve smyslu potomci, národ, pokolení) sdepropriálním posesorem, často postavou zbible sjedinečnou referencí. Většina těchto kontextů se tak logicky vyskytuje vbiblických textech. Podobně lemma Ježíš/Kristus je samozřejmě spjato sbiblickými texty ašířeji skřesťanskou tematikou (učené náboženské texty, legendy, ale též kroniky). Identifikovali jsme tak dvě spojení, která výrazně preferují postpozici po celý sledovaný časový úsek ajsou asociována sdepropriálními posesory se značným podílem unikátních referentů, kteří jsou asociováni sbiblickou či obecně náboženskou tematikou. Při pohledu na syntaktické rámce, vnichž se tato spojení objevují, je dále patrné, že především lemma syn se objevuje vpřímých pádech sfrekvencí o10 % vyšší, než je tomu vrámci ostatních pozorování. Počet užití obou diskutovaných lem mat OPEN ACCESS
62 STUDIE ZAPLIKOVANÉ LINGVISTIKY vpřímých pádech je zároveň vobou případech téměř dvakrát vyšší než celková frekvence druhého nejpočetnějšího lemmatu (188 konkordancí pro lemma Ježíš, 130 konkordancí pro lemma syn), obě sledovaná spojení se tedy prototypicky objevují vsubjektové či objektové pozici. 5.2.2 VYSVĚTLENÍ VSOULADU SPŘIjATÝmI TEOrETIcKÝmI PŘEDPOKLADY Spojíme-li zjištěná fakta svýchodiskovým pojetím jazyka popsaným vúvodu, lingvistikou založenou na užívání jazyka, která klade při vysvětlování jazykového chování důraz jak na sociální aobecně mimojazykový kontext, vněmž se uživatelé jazyka pohybují, tak na doménově nespecifické kognitivní pochody, dostáváme poměrně zajímavý arealistický interpretační rámec pravidelností odhalených zvolenou analýzou. Domníváme se, že je možno předpokládat existenci dvou lexikálně částečně obsazených konstrukcí sfixovaným sledem, sice N Kristův/Ježíšův asyn/synové N-ův/N-ovi, jejichž existence aužívání jsou včeských datech podmíněny sociokulturním kontextem, vněmž byla literární tvorba spojena skosmopolitními biblickými akřesťanskými tématy avněmž byla dále četná díla cele či částečně překládána, adaptována či sloužila jako vzor pro vznikající domácí, českojazyčnou literární tradici. Převažující slovosledná konfigurace utěchto konstrukcí tak může být ovlivněna jazykovým kontaktem. Na základě uvedených zjištění aúvah pak lze předpokládat situaci, vníž tyto dvě zmiňované ajim podobné konstrukce slouží jako výrazné exempláře. Jejich relativně vysoká frekvence mohla mít za následek, že konstrukce přitahovaly jiná spojení, která jim byla podobná svými sémantickými ((unikátní) depropriální posesor) či syntaktickými vlastnostmi (subjektová či objektová pozice), případně též sdílenými textovými typy (tento potenciální efekt může do určité míry vysvětlovat vyšší zastoupení postpozice pod koncovým uzlem 21 prezentovaného stromu vgrafu 5, který na rozdíl od uzlu 18 obsahuje žánry učené náboženské inenáboženské literatury alegendy). Naopak spojení, která jsou svými sémantickými isyntaktickými vlastnostmi nejméně podobná vymezeným konstrukcím (relační aneunikátní deapelativní posesor vnepřímém pádu), vykazují vyšší míru variability, atedy irelativně nižší míru preference postpozice. Naše interpretace tak předpokládá působení sociálních akulturních faktorů, které vnesly do psaného jazyka určité struktury, aty byly následně včleněny do repertoáru jazykových prostředků amohly působit organizaci jazykového systému prostřednictvím popsaných mechanismů. 6. ZÁVĚR Vtomto textu jsme představili perspektivu, zníž je možné studovat vývoj jazyka se zohledněním představ tzv.usage-based linguistics ofungování jazyka na úrovni jednotlivých mluvčích icelých jejich společenství aoprovázanosti jazykových imimojazykových faktorů různé úrovně, na jejichž základě je možné interpretovat zdánlivě náhodnou variabilitu vjazykových datech. Zároveň jsme názorně ukázali, jak je možné vpodobné analýze výhodně využít některých vlingvistice méně uplatňovaOPEN ACCESS
jAN KŘIVAN — mIchAL LÁZNIČKA 63 ných statistických metod, vtomto případě klasifikačních aregresních stromů anáhodných lesů. Vnaší analýze jsme ukázali míru variace vpostavení posesora vůči řídícímu substantivu vrámci adnominální posesivní konstrukce ve staré astřední češtině apokusili jsme se tuto variaci vysvětlit postulováním dvou částečně lexikálně obsazených konstrukcí N Kristův asyn N-ův, které jako silné exempláře mohly působit na ostatní posesivní konstrukce, apoukázali jsme na jejich spojení jak sfaktory sociálními akulturními, tak sfaktory jazykovými akognitivními. Nutno ovšem dodat, že studie má isvé nedostatky aposkytuje prostor pro další šetření. Především by bylo třeba prošetřit chování posesivních zájmen, která jsou zhlediska životnosti areferenčnosti nadřazena apelativům ipropriím akterá by svým kategoriálním charakterem asouvisející možnou vyšší odolností vůči jazykovému kontaktu zároveň mohla lépe odrážet obecný stav vjazyce. Zhlediska zmíněného jazykového kontaktu postrádají naše data informace opřekladovosti či vlivu cizojazyčných předloh; tuto složitou problematiku bude třeba vnavazujících studiích ošetřit. Zároveň by bylo žádoucí na základě širšího kontextu připojit anotaci kontextového referenčního statusu posesora. Konečně by na základě našich zjištění bylo vhodné na větším vzorku deapelativních posesivních adjektiv ověřit, zda má naše interpretace širší platnost. PODĚKOVÁNÍ Tato studie vznikla za podpory projektu Univerzity Karlovy Progres č.4, Jazyk vproměnách času, místa, kultury. Při vzniku práce byly využity zdroje Výzkumné infrastruktury pro diachronní bohemistiku (RIDICS, http://vokabular.ujc.cas.cz). LITERATURA Aikhenvald, A.Y. (2013): Possession and ownership: across linguistic perspective. In: A.Y.Aikhenvald (Ed.), Possession and ownership: Across-linguistic typology (s.1–64). Oxford: Oxford University Press. Baayen, R.H. (2008): Analyzing Linguistic Data. APractical Introduction to Statistics using R.Cambridge: Cambridge University Press. Behaghel, O. (1909): Beziehungen zwischen Umfang und Reihenfolge von Satzgliedern. Indogermanische Forschungen, 25, 110–142. Beckner, C., Blythe, R., Bybee, J., Christiansen, M., Croft, W., Ellis, N., Holland, J., Ke, J., Larsen-Freeman, D., & Schoenemann, T. (2009): Language is acomplex adaptive system. Language Learning, 59(Supplement), 1–26. Breiman, L. (2001): Random Forests. Machine Learning, 45(1), 5–32. Breiman, L., Friedman, J.H., Olshen, R.A., & Stone, C.J. (1984): Classification and Regression Trees. Belmont, CA: Wadsworth. Bybee, J.L. (1985): Morphology: AStudy of the Relation between Meaning and Form. Amsterdam: Benjamins. Bybee, J.L. (2006): From usage to grammar: the mind’s response to repetition. Language, 82, 711–733. Daneš, F. (1985): Věta atext: studie ze syntaxe spisovné češtiny. Praha: Academia. Diessel, H. (2017): Usage-Based Linguistics [online]. In M.Aronoff (Ed.), Oxford Research Encyclopedia of Linguistics. New York, NY: Oxford University Press. Dostupné z: <https://doi.org/10.1093/ acrefore/9780199384655.013.363>. Gebauer, J. (2007/1929): Historická mluvnice jazyka českého IV. Skladba. (2. vyd. 2007; OPEN ACCESS
64 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1.vyd. 1929, ed. F.Trávníček.) Praha: Academia. Gries, S.T., & Hilpert, M. (2012a): Variabilitybased neighbor clustering: abottom-up approach to periodization in historical linguistics. In T.Nevalainen & E.C.Traugott, (Eds.), The Oxford Handbook on the History of English (s.134–144). Oxford: Oxford University Press. Gries, S.T., & Hilpert, M. (2012b): Variabilitybased Neighbor Clustering: Abottomup approach to periodization in historical linguistics. Companion website [online]. T.Nevalainen & E.C.Traugott, (Eds.), The Oxford Handbook on the History of English. Oxford: Oxford University Press. Dostupné z: <http://global.oup.com/us/companion. websites/fdscontent/uscompanion/us/static/ companion.websites/nevalainen/GriesHilpert_web_final/vnc.individual.html>. Harrell, F.E. (2017): Hmisc: Harrell Miscellaneous. R package version 4.0-3. Dostupné zWWW: <https://CRAN.R-project.org/ package=Hmisc>. Haspelmath, M. (2008): Frequency vs. iconicity in explaining grammatical asymmetries. Cognitive Linguistics, 19, s.1–33. Hawkins, J.A. (2004): Efficiency and Complexity in Grammars. Oxford: Oxford University Press. Hilpert, M. (2013): Constructional Change in English: Developments in Allomorphy, Word Formation, and Syntax. Cambridge: Cambridge University Press. Hopper, P.J. (1987): Emergent grammar. In J.Aske, N.Beery, L.Michaelis & H.Filip (Eds.), Proceedings of the Annual Meeting of the Berkeley Linguistics Society, 13 (s.139–157). Berkeley, CA: Berkeley Linguistics Society. Hosmer, D.W.,& Lemeshow, S. (2000): Applied Logistic Regression. New York, NY: Wiley. Hothorn, T., Hornik, K. & Zeileis, A. (2006): Unbiased recursive partitioning: Aconditional inference framework. Journal of Computational and Graphical Statistics, 15(3), 651–674. Křivan, J. (2014): The role of information structure in Czech possessive constructions. In J.Emond & M.Janebová (Eds.), Language Use and Linguistic Structure: Proceedings of the Olomouc Linguistics Colloquium 2013 (s.211–227). Olomouc: Univerzita Palackého. Kučera, K., Řehořková, A., & Stluka, M. (2015): DIAKORP: Diachronní korpus, verze 6 z18.12.2015. Praha: Ústav Českého národního korpusu FF UK. Cit.9.7.2016. Dostupné zWWW: <http://www.korpus.cz>. Langacker, R.W. (1988): AUsage-Based Model. In B.Rudzka-Ostyn (Ed.), Topics in Cognitive Linguistics (s.127–161). Amsterdam: Benjamins. Levshina, N. (2015): How to do Linguistics with R.Data Exploration and Statistical Analysis. Amsterdam: John Benjamins. Milin, P., Divjak, D., Dimitrijević, S., & Baayen, R.H. (2016): Towards cognitively plausible data science in language research. Cognitive Linguistics, 27(4), 507–526. O’Connor, C., Maling, J. & Skarabela, B., (2013): Nominal categories and the expression of possession: Across-linguistic study of probabilistic tendencies and categorical constraints. In K.Börjars., D.Denison & A.Scott (Eds.), Morphosyntactic categories and the expression of possession (s.89–121). Amsterdam: John Benjamins. Poplack, S., & Cacoullos, R.T. (2015): Linguistic emergence on the ground: Avariationist paradigm. In B.MacWhinney & W.O’Grady (Eds.), The Handbook of Language Emergence (s.267–291). Chichester: Wiley-Blackwell. R Core Team (2017): R: Alanguage and environment for statistical computing [online]. RFoundation for Statistical Computing: Wien. Dostupné z: <http://www.R-project.org/>. Rezaee, A.A., & Golparvar, S.E. (2016): The Sequencing of Adverbial Clauses of Time in Academic English: Random Forest Modelling of Conditional Inference Trees. Journal of Language Modelling, 4(2), 225–244. RStudio Team (2016): RStudio: Integrated Development for R.RStudio, Inc., Boston, MA. Dostupné zWWW: <http://www.rstudio. com>. Seiler, H. (1983): Posession as an operational dimension of language. Tübingen: Günter Narr. Silverstein, M. (1976). Hierarchy of Features and Ergativity. In R.M.W.Dixon (Ed.), OPEN ACCESS
jAN KŘIVAN — mIchAL LÁZNIČKA 65 Grammatical Categories in Australian Languages (s.112–171). Canberra: Australian National University. Strobl, C., Boulesteix, A., Kneib, T., Augustin, T., & Zeiles, A. (2008): Conditional variable importance for Random Forests. BMC Bioinformatics, 9(307). Dostupné zWWW: <https://doi.org/10.1186/1471-2105-9-307>. Tagliamonte, S.A., & Baayen, R.H. (2012): Models, forests, and trees of York English: Was/were variation as acase study for statistical practice. Language Variation and Change, 24(2), 135–178. Vachek, J. (1972): Ještě kosudu českých posesívních adjektiv (Glosa kpohybu včeském tvarosloví). Slovo aslovesnost, 33, 146–148. Vokabulář webový (2006–2016a): Staročeská textová banka. Praha: Oddělení vývoje jazyka Ústavu pro jazyk český AV ČR. Dostupné z: <http://vokabular.ujc.cas.cz/banka.aspx>. Vokabulář webový (2006–2016b): Středněčeská textová banka. Praha: Oddělení vývoje jazyka Ústavu pro jazyk český AV ČR. Cit.Dostupné z: <http://vokabular.ujc.cas.cz/banka.aspx>. Wickham, H. (2009): ggplot2: Elegant Graphics for Data Analysis. New York, NY: Springer. Widmer, M., Auderset, S., Nichols, J., Widmer,P., & Bickel, B. (2017): NP recursion over time: evidence from Indo-European. Language, 93(4), 799–826. Wolk, C., Bresnan, J., Rosenbach, A., & Szmrecsanyi, B. (2013): Dative and Genitive Variability in Late Modern English: Exploring Cross-constructional Variation and Change. Diachronica, 30(3), 382–419. Jan Křivan | Ústav pro jazyk český, v. v. i. <[email protected]> Michal Láznička | Ústav Blízkého východu aAfriky FF UK <[email protected]> OPEN ACCESS