Využití korpusových metod v popisu češtiny: příklad kolostrukční analýzy
Abstract
167
Full text
issn 0008-7386 © filozofická fakulta, univerzita karlova vpraze ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2, S. 167–180 Využití korpusových metod vpopisu češtiny: příklad kolostrukční analýzy1 Eva Lehečková (Praha) CORPUS METHODS AND THE DESCRIPTION OF CZECH: COLLOSTRUCTIONAL ANALYSIS The paper presents areview of principles and applicability of collostructional analysis— acluster of corpus methods developed by Anatol Stefanowitsch and Stefan Th. Gries since 2003. Collostructional analysis measures the strength of association by which lexemes are attracted to aparticular position in aconstruction. It derives from the Construction Grammar concept of construction as conventionalized pairing of form and meaning. Collostructional analysis allows for systematic measurements of the degree of conventionalization of constructions. The paper introduces various types of collostructional analysis and provides an overview of research areas where collostructional analysis has been employed. It concludes with acase showing how collostructional analysis can be applied to the description of Czech. KEY WORDS collostructional analysis, association measures, construction grammar, variability, idiomatic expres sions, Czech KLÍČOVÁ SLOVA kolostrukční analýza, asociační míry, konstrukční gramatika, variabilita, idiomy, čeština Rozvoj korpusové lingvistiky po roce 1990 výrazně proměnil podobu výzkumu včetných odvětvích lingvistiky, ne-li již ve většině znich. Korpusové přístupy kanalýze jazykových dat jsou dnes považovány za jednu zreprezentativních metod, jejichž zjištění se obecně hodnotí jako platná aspolehlivá. Jedním zdůsledků důvěry vkládané do této metodologie je rozšiřující se spektrum konkrétních kvantitativních metod, které umožňují korpusová data analyzovat různorodými způsoby apřicházet tak na nová zjištění oužívání jazyka. Jednou ztěchto metod je takzvaná kolostrukční analýza (vpůvodním znění collostructional analysis), jejíž představení je cílem této studie. Vznik kolostrukční analýzy se obvykle datuje kroku 2003, kdy byl publikován první text otéto metodě (Stefanowitsch— Gries, 2003)— jedná se tedy ometodu poměrně novou, aproto pochopitelně včeském prostředí dosud málo známou. Ztoho důvodu se jeví jako užitečné seznámit českou lingvistickou obec spodstatou kolostrukční analýzy (první oddíl), se způsoby amezemi jejího uplatnění (druhý oddíl) isukázkou toho, jak ji lze využít při popisu českého jazykového materiálu (oddíl třetí).2 1 Tato studie vznikla za podpory projektu Univerzity Karlovy Progres č.4, Jazyk vproměnách času, místa, kultury. 2 Původní podoba tohoto příspěvku zazněla na interním semináři pracovníků Ústavu Českého národního korpusu dne 1.11.2016. Všem účastníkům bych ráda poděkovala za cennou diskusi apodněty. OPEN ACCESSOPEN ACCESS
168 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2 1. VYMEZENÍ KOLOSTRUKČNÍ ANALÝZY Autory kolostrukční analýzy (dále KolA) jsou původem němečtí badatelé Anatol Stefanowitsch (Freie Universität vBerlíně) aStefan Th. Gries (Kalifornská univerzita vSanta Barbaře), kteří ji představili sérií čtyř článků vletech 2003–2005 (viz Stefanowitsch— Gries, 2003; Gries— Stefanowitsch, 2004a a2004b, aStefanowitsch— Gries, 2005), kolostrukční analýze se však věnují kontinuálně (viz například Stefanowitsch— Gries, 2008, nebo Gries— Wulff(ová), 2009).3 Kolostrukční analýza vychází zteoretického zázemí konstrukční gramatiky (construction grammar, viz například Hoffmann— Trousdale, 2013, včeštině Fried(ová), 2013). Zejména se opírá okognitivně-funkční povahu tohoto přístupu, podle nějž jsou základními jednotkami jazyka konstrukce, ustálená spojení surčitými formálními vlastnostmi, významem afunkcí vkomunikaci. Vzhledem ktomu, že konstrukční gramatika vychází zužívání jazyka (tj.je usage-based), předpokládá, že jazykové znaky vznikají akonvencionalizují se užíváním vkomunikaci. Jejich podoba je do určité míry ovlivněna ikognitivními možnostmi aomezeními lidské mysli, vníž se jazykové konstrukce ukládají pravděpodobně ve formě nějaké komplexní uspořádané sítě jednotek avztahů mezi nimi (podrobněji viz např.Diessel, 2015). Konstrukce jsou jednotky různé velikosti, od lexikálních konstrukcí (krutopřísný) přes valenční konstrukce (alternující větné vzorce uslovesa naložit, srov.naložit auto zbožím vs. naložit zboží do auta) nebo víceslovné frazémy (cestou necestou, rád nerad) po konstrukce větné (Až naprší auschne). Vtomto pojetí se tak— vsouladu sobecnými principy kognitivní lingvistiky— stírá ostrá hranice mezi slovníkem asyntaxí aje nahrazena kontinuem konstrukcí od lexikálně specifických po otevřená konstrukční schémata, do nichž lze dosadit různé lexémy snáležitými vlastnostmi. Konstrukčněgramatický popis tím, že vychází zreálného užívání jazyka, věnuje pozornost variantnosti konstrukcí vkomunikaci, přesto usiluje oidentifikaci konstrukcí prototypických (sohledem na určitý komunikační kontext), pokud existují. Aprávě ktomu slouží kolostrukční analýza. Autoři KolA za svůj inspirační zdroj označují výzkum kolokací coby ustálených lexikálně-sémantických spojení slovních tvarů. Princip kolokací autoři přenášejí do vztahu mezi syntaktickou konstrukcí alexikální jednotkou, odtud motivace pojmenování kolo-strukce, které odkazuje jednak ke kolokacím, jednak ke konstrukcím. Kolostrukční analýza je ve skutečnosti souborem několika metod, jejichž společným principem je to, že umožňují sledovat vztah (souvýskyt) mezi konkrétními syntaktickými konstrukcemi4 alexikálními jednotkami, které se vtěchto konstrukcích vyskytují— těmto lexikálním jednotkám se pak obvykle říká kolexémy (collexemes). Vztah mezi konstrukcemi akolexémy se vyjadřuje pomocí nějakého typu asociační míry. 3 Stefan Th. Gries je důsledným stoupencem volného přístupu kinformacím, proto jsou všechny jeho časopisecké studie akapitoly vmonografiích, přinejmenším vrukopisných verzích, dostupné na jeho osobní stránce: http://www.linguistics.ucsb.edu/faculty/stgries/ research/overview-research.html#PublicationsEditing [cit.1. 3. 2017] 4 Lexiko-gramatické vztahy se někdy označují jako koligace, colligations, viz Nový encyklopedický slovník češtiny online, 2016, s. v. OPEN ACCESS
EvA LEhEČkOvá 169 Výsledkem kolostrukční analýzy je seznam lexémů, které signifikantně vůči jiným svým výskytům vkorpusu tíhnou kvýskytu vrámci určité syntaktické konstrukce. Například Stefanowitsch aGries (2003) ve svém prvním textu na základě KolA uplatněné na data zBritského národního korpusu ukazují, že kpozici substantiva N vanglické konstrukci [N waiting to happen] typicky tíhnou substantiva accident, disaster, earthquake nebo invasion, ale že silnou asociační míru vykazují isubstantiva recovery, dream nebo event, unichž není inherentně přítomná negativní hodnota. Autoři výsledky KolA konfrontují se slovníkem Collins COBUILD, který jediný tuto konstrukci uvádí (pod heslem accident avdokladech uhesla disaster), s následujícími závěry: na jednu stranu KolA utéto konstrukce potvrdila, že je vhodné tuto konstrukci zmiňovat právě utěchto dvou substantiv, aže jde tedy onenáhodný vztah. Na druhou stranu upozorňují, že je vhodné tuto anglickou konstrukci vymezovat neutrálněji jako děj, který téměř jistě nastane, jak je patrné vmomentu promluvy, akterý pouze často, nikoliv výhradně nese negativní konotace. Gries aStefanowitsch zdůvodňují potřebnost KolA tím, že zmíněné lexiko-gramatické vztahy mezi konstrukcemi alexémy nelze efektivně sledovat běžnými kolokačními nástroji. Lze to doložit na příkladu substantiva švestka vkorpusech Českého národního korpusu. Korpusový manažer KonText umožňuje vyhledat toto lemma aseřadit na základě zadaných kritérií jeho kolokáty. Pokud nás například vSYN2015 zajímají ustálené kolokáty na třech pozicích nalevo od hledaného slova, výsledek (zahrnující asociační míru logDice5 arelativní frekvenci) řazený podle hodnot logDice vypadá tak, jak ukazují tabulky č.1 (pro lemmata) ač.2 (pro slovní tvary)6: pořadí kolokát— lemma absolutní frekvence logDice relativní frekvence 1 sušený 104,00 10,46 6,44 2 nachytat 13,00 8,34 2,52 3 sbalit 21,00 8,21 1,38 4 hruška 13,00 8,07 1,66 5 hrušeň 8,00 7,98 3,35 6 jabloň 10,00 7,91 1,78 7 slivoň 9,00 7,81 1,77 8 meruňka 8,00 7,75 1,95 9 třešně 9,00 7,69 1,44 10 puchrovitost 5,00 7,66 71,43 11 pecka 9,00 7,51 1,10 tabulka 1.Nejčastější kolokáty (lemmata) lexému švestka podle SYN2015 5 Podrobněji viz https://wiki.korpus.cz/doku.php/pojmy:asociacni_miry [cit.1. 3. 2017]. 6 Pro postižení kolokačního profilu substantiva švestka vco největší šíři uvádím nejčastější kolokace jak lemmat, tak slovních tvarů. OPEN ACCESS
170 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2 pořadí kolokát— word absolutní frekvence logDice relativní frekvence 1 sušených 37,00 10,07 11,42 2 sušené 36,00 9,78 6,69 3 sušenými 12,00 8,75 11,11 4 hrušky 10,00 8,24 3,60 5 sušená 7,00 7,99 7,07 6 sušenou 6,00 7,80 7,79 7 hrušně 5,00 7,56 7,69 8 sušené 5,00 7,54 6,58 9 meruňky 5,00 7,43 3,33 10 svejch 5,00 7,27 1,94 11 sbalil 5,00 7,23 1,75 tabulka 2.Nejčastější kolokáty (slovní tvary) lexému švestka podle SYN2015 Podle nástroje SyD (Cvrček — Vondřička, 2011) kolokační profil lemmatu švestka na nejvýraznějších pozicích obsahuje lexémy jablko, nachytat, jako, na, nebo a pudink. Výsledky vyhledávání kolokací nás informují okonkrétních výrazech, snimiž se lemma švestka typicky pojí, apřípadně ojejich sémantických polích (např.peckovité ovoce, sušené ovoce, ovocné stromy, jejich nemoci). Zároveň je však zřejmé, že jednotlivé kolokáty obsazují různé pozice vkonstrukcích, vnichž se spolu slemmatem švestka vyskytují, aže se jedná ovyšší, ale neznámý počet konstrukcí. Informace okonstrukcích se zkolokační analýzy někdy dají vyvodit jednoznačně (viz modifikace substantiva švestka adjektivem sušený), někdy svelkou mírou pravděpodobnosti: ovoce aovocné stromy se budou patrně vyskytovat slemmatem švestka vkoordinaci,7 sloveso nachytat je patrně součástí frazému nachytat na švestkách, předložka na bude nejspíše souviset se způsobem přípravy pokrmu. Někdy je podobná úvaha obtížnější: sbalit může odkazovat kfrazému sbalit svých pět švestek, ale švestky lze jistě isbalit vdoslovném významu— to vnáší další rovinu úvahy, která varianta je pravděpodobnější8; nebo spojka jako ukazuje na srovnávací konstrukci, ale není zřejmé, zda švestka bude srovnávaným pojmem, nebo srovnávacím standardem (nebo obojím?). Hlubší porozumění tomu, co vlastně ukazují uvedené přehledy kolokací, avyřešení nejasných otázek oužívání lexému švestka tak vyžaduje navazující sérii zjišťování. Gries aStefanowitsch se podobnými příklady snaží ukázat, že necitlivostí ktomu, na jaké pozici avjaké konstrukci se daný kolokát nachází, se snižuje výpovědní hodnota kolokačních přehledů, zejména vkontextu takových popisů jazyka, jako je konstrukční gramatika, které předpokládají, že reálná jazyková znalost je komplexní, 7 Poukazují na to ispojky aanebo mezi nejobvyklejšími kolokacemi podle SyD— není však jasné, zda se švestka vyskytuje typicky na první pozici vkoordinaci, nebo na druhé, nebo žádnou typickou pozici nemá. 8 Navíc vpřípadě, že sbalit odkazuje kfrazému sbalit si svých pět švestek, bude se kněmu vázat islovní tvar svejch vtabulce č.2, tj.máme zde dva tvary odkazující ke dvěma různým pozicím vjedné konstrukci. OPEN ACCESS
EvA LEhEČkOvá 171 tj.zahrnuje jak morfosyntaktické, tak sémanticko-pragmatické informace odané konstrukci. Zároveň si kladou otázku, nakolik je vůbec možné tyto kolokáty mezi sebou srovnávat, když by se měly spíše srovnávat svýrazy podobného typu, které se vyskytují ve stejné pozici vkonkrétní konstrukci. Tato úvaha je zárodkem kolostrukční analýzy. 2. ZPŮSOBY AMEZE UPLATNĚNÍ KOLOSTRUKČNÍ ANALÝZY Levshina (2015, s.224n.) oKolA pojednává jako ojedné zasociačních měr, které jsou obvykle založeny na podobném principu, ať už měří vztah mezi slovy, nebo, jako KolA, vztah mezi slovy akonstrukcemi. Tento princip lze vyjádřit kontingenční tabulkou odvou sloupcích advou řádcích, vnichž se uvádějí absolutní frekvence výskytu sledovaných jevů ve vzorku, viz schematicky vtabulce 3. Konkretizace jevů AaB ihodnot n vkontingenční tabulce závisí na konkrétní výzkumné otázce azvolené metodě. Vnejjednodušším případě například Apředstavuje nějaký lexém, B konstrukci. Pro výpočet kolostrukční analýzy pak potřebujeme znát frekvenci (n) lexému Avdané konstrukci (nA aB), frekvenci jiných lexémů než Avdané konstrukci (n¬AaB), frekvenci Avjiných konstrukcích než B (nA a¬B) afrekvenci jiných lexémů než Avjiných konstrukcích než B (n¬Aa¬B). Vzhledem klogickým vztahům vjednotlivých řádcích asloupcích vtabulce 1 se typicky pro různé typy KolA (viz níže) používají hodnoty uvedené vřádcích asloupcích nadepsaných Celkem vtabulce 1 (nA, n¬A, nB, ¬B anA aB a¬Aa¬B, přičemž poslední hodnota odpovídá velikosti korpusu). B ¬B Celkem AnA aB nA a¬B nA ¬A n¬AaB n ¬Aa¬B n¬A Celkem nB n¬B nA aB a¬Aa¬B tabulka 3.Schematická tabulka frekvencí pro jevy AaB ajejich souvýskyt9 Kolostrukční analýza je typem obousměrné asociační míry, tedy takové, která najednou pro množinu výrazů měří jak jejich tíhnutí kurčité konstrukci nebo konstrukcím (attraction), tak odpor kní/nim (repulsion). Tento rozdíl se vyjadřuje kladnou, respektive zápornou hodnotou výsledné asociační síly. Již vúvodu bylo řečeno, že KolA je množinou metod umožňujících měřit vztah mezi konstrukcemi alexémy. Gries aStefanowitsch rozlišují tři základní typy: 1. Kolexémová analýza (collexeme analysis)— měří míru atrakce lexému kurčité pozici vnějaké konstrukci; lze například zjišťovat, jaká substantiva se typicky vyskytují vkonstrukci jde oN. 2. Distinktivní kolexémová analýza (distinctive collexeme analysis)— zjišťuje tíhnutí určitého lexému knějaké konstrukci ve srovnání sjinou, funkčně srovnatelnou 9 Viz např.Stefanowitsch (2013). OPEN ACCESS
172 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2 konstrukcí; tímto typem lze například porovnávat lexémy vpříslušných pozicích vkonstrukcích naložit auto zbožím vs. naložit zboží do auta apřispět tak pomocí KolA kpopisu jejich vzájemných funkčních rozdílů, které by se hypoteticky měly odrážet ivtypické distribuci jednotlivých lexémů, vyjádřené asociační silou. 3. Kovariační kolexémová analýza (covarying collexeme analysis)— sleduje míru atrakce lexémů na jedné pozici vkonstrukci slexémy na jiné pozici vkonstrukci; lze tak porovnávat například lexémy vpozici patientu arecipienta vditranzitivních konstrukcích nebo slovesa na dvou pozicích vkonstrukcích kontroly (doporučit panovníkovi vyhlásit válku).10 Například ukolexémové analýzy je nutné vkontingenční tabulce uvést absolutní frekvenci výskytu daného lexému L na určité pozici vkonstrukci K(L vK), poté frekvenci výskytu lexému L vjiných konstrukcích v(sub)korpusu (L vnonK), dále frekvenci výskytu Kv(sub)korpusu anakonec velikost (sub)korpusu. Udistinktivní kolexémové analýzy se uvádí absolutní frekvence lexému L vkonstrukci 1 avkonstrukci 2 apoté frekvence jiných lexémů vjedné adruhé konstrukci. Díky tomu, že se zjišťuje vztah mezi hodnotami uvedenými vtabulce 3 výše, mohou mít ilexémy se stejnou absolutní frekvencí výskytu vdané konstrukci rozdílnou asociační sílu, což se chápe jako jedna zpředností KolA. Očekává se přitom, že lexémy celkově velmi frekventované (často buď sémanticky vyprázdněné, nebo výrazně polysémní) budou ke specifické konstrukci přitahovány slabou silou, nebo iodpuzovány, alexémy vyskytující se vobou porovnávaných konstrukcích (vpřípadě distinktivní kolexémové analýzy) budou umístěny ve středu pole. KolA lze provádět různými asociačními mírami, ale Gries aStefanowitsch nejčastěji používají adoporučují Fisherův exaktní test sYatesovou korekcí (FYE). Jedná se ojeden ztestů statistické signifikance, kterým se (přesně, ne aproximativně jako uchí-kvadrátu) měří pravděpodobnost asociace lexému akonstrukce. Gries aStefanowitsch jako výhody tohoto testu zmiňují to, že je na rozdíl od chí-kvadrátu využitelný ipři malých výskytech lexémů ve sledovaných konstrukcích (tj.nižších než 5) aže nepředpokládá žádné (natož normální) rozdělení dat, což je pro jazyková data výhodné. Výsledkem KolA je uspořádaný seznam lexémů skonkrétní číselnou hodnotou udávající sílu asociace— pokud je kladná, jedná se oatrakci, pokud je záporná, jedná se oodpor. Tyto hodnoty lze převést na pravděpodobnostní škálu obvyklou vempirických studiích azjistit, zda se jedná, nebo nejedná osignifikantní atrakci/odpor. KolA se obvykle provádí ve volně dostupném počítačovém programu R umožňujícím statistickou analýzu dat.11 SKolA je spojena průběžně aktualizovaná internetová 10 Autoři KolA později rozšířili distinktivní akovariační kolexémovou analýzu ina více než dvě pozice vjedné konstrukci, popřípadě více než dvě konstrukce— tyto doplňky se označují jako mnohočetná kolostrukční analýza azteoretického hlediska vhodně reflektují představu kognitivně-konstrukčních přístupů otom, že jazyk je založen na síti mnohočetných amnohaúrovňových vztahů mezi konstrukcemi. 11 R Development Core Team (2008): R: Alanguage and environment for statistical computing. R Foundation for Statistical Computing. Austria: Vienna. Dostupné zWWW: http://www. R-project.org. [cit.1. 3. 2017] OPEN ACCESS
EvA LEhEČkOvá 173 stránka spravovaná Stefanem Griesem, která shromažďuje informace potřebné pro porozumění této metodě ipro její uplatnění. Ztéto stránky je také možné si stáhnout skript Coll.analysis 3.5 vytvořený Griesem vprogramu R (Gries, 2014), který je možné použít přímo při zpracování jednotlivých typů KolA bez nutnosti tyto skripty samostatně vytvářet nebo kopírovat.12 Výchozí asociační mírou je Fisherův exaktní test, avšak je možné znabídky zvolit ijiné míry, například chí-kvadrát, MI/T-score či přirozený logaritmus poměru šancí (log odds ratio). KolA se od svého vzniku využívá krůzným účelům aoblasti, kde se uplatnila, se postupně rozšiřují. Typické je její využití při popisu částečně schematizovaných konstrukcí (tj.takových, které mají některé pozice otevřené, jako konstrukce jde oN), viz například Stefanowitschova analýza metaforické konstrukce in the heart of N (2005). Podobně KolA umožňuje sledovat tíhnutí slovesných lexémů kurčitým valenčním konstrukcím nebo kurčité hodnotě kategorií času, vidu azpůsobu (viz kontrastivní výzkum kauzativních konstrukcí vangličtině afrancouzštině ve studii Guilquin(ové), 2015). Existují výzkumy zjišťující rozdíly vatrakci lexémů vzávislosti na varietě (britská vs. americká angličtina, Wulff(ová) et al., 2007) nebo způsobu realizace promluvy (psaný/mluvený projev, Stefanowitsch— Gries, 2008). Posledně zmíněná studie je zajímavou extenzí původní verze KolA. Autoři na třech případových studiích zjišťují, zda budou výsledky KolA různé při změně komunikačního kanálu (vytvářejí tak třídimenzionální kolostrukční analýzu kombinující lexém, konstrukci akanál). Jejich obecným zjištěním je, že výsledky třídimenzionální KolA zásadním způsobem výsledky původní KolA nemění, umějí však odhalit specifické asymetrie dané komunikačním kanálem: například vdistribuci sloves vaktivu apasivu existoval rozdíl mezi psaným amluveným projevem vtom, že aktivní konstrukce vmluveném projevu přitahovaly nejsilněji anglická jednoslabičná slovesa germánského původu (například do, get, say, want), kdežto vpsaném projevu se vaktivu vyskytovala typicky slovesa delší, původu románského (enclose, provide, include, contain)— tento rozdíl ale nebyl doložen upasiva. Hilpert (2006 a2012) ukazuje možnosti využití azpůsoby interpretace KolA vdiachronním výzkumu, vprvní studii mimo jiné na příkladu distinktivní kolexémové analýzy uplatněné na tři historická období, vnichž se vangličtině vyvíjelo užívání konstrukce shall + infinitiv. KolA se využívá ive výzkumu osvojování druhého/cizího jazyka (Ellis— Ferreira-Junior, 2009; Gries— Wulff, 2005, 2009), ato zejména při kombinaci korpusových aexperimentálních psycholingvistických výzkumů, vnichž se kupříkladu při hodnocení přijatelnosti nebo úlohách zaměřených na dokončování vět (sentence completion tasks) zjišťuje citlivost nerodilých mluvčích ktíhnutí konkrétních lexémů kurčitým konstrukcím. Od vytvoření KolA se objevily dvě její zásadnější kritiky (Bybee, 2010, aSchmid— Küchenhoff, 2013), které stojí za to zmínit. Na oba kritické texty rozsáhle reagoval Gries (2012 a2015). Vtomto textu uvádím jen dvě výhrady, které nemají jen technický13, ale iteoretický rozměr. Za prvé je otázka, zda je adekvátnější vyjádřit nějaký 12 Skripty ke KolA uvádí například Levshina (2015). 13 Mezi techničtější otázky patří například fakt, že Schmid— Küchenhoff (2013) kritizují použitou asociační míru FYE anavrhují vlastní variantu měření, jež nepracuje spravOPEN ACCESS
174 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2 vztah asociační silou než absolutními frekvencemi. Bybee(ová) se dlouhodobě věnuje výzkumu vlivu tokenové atypové frekvence na ukládání, reprezentaci avybavování jazykových jednotek, které se obvykle vtěchto výzkumech udávají vabsolutních frekvencích. Ztohoto hlediska jsou zajímavé psycholingvistické výzkumy, které realizoval Gries spolu skolegy (Gries et al., 2010). Podle nich se zdá, že pro ukládání avybavování konstrukcí je asociační míra lepší prediktor než absolutní frekvence. To je jistě cenný výsledek, který si vyžaduje další replikace ina jiných jazycích. Druhá námitka souvisí sotázkami kognitivní adekvátnosti— je možné provázat metodu KolA ajejí výsledky sněkterými zkognitivních schopností aprocesů? Gries (2015) uvádí, že lze uvažovat osouvislosti sprocesy ukládání (entrenchment) avyhodnocování distinktivní hodnoty rysu (cue validity and reliability) při kategorizaci avybavování informace. Vreakci na kritické texty Gries (2015, s.533) souhrnně konstatuje, že je nutné si být vědom toho, že KolA, tak jako jiné asociační míry, je založena na jednoduché metodě, která tak nutně komplexní multidimenzionální mentální prostor znalosti jazyka jeho mluvčími představuje ve zjednodušené formě.14 Ztoho důvodu je podle Griese zásadní vnejbližší budoucnosti rozvíjet sofistikovanější metody analýzy dat (smíšené modely zohledňující vliv jednotlivých lexémů ajednotlivých mluvčích, měření korelací mezi výsledky korpusových aexperimentálních výzkumů apod.). Na druhou stranu není podle něj vhodné KolA pro její omezení zcela zatracovat: je vhodným avelmi snadným nástrojem pro zjištění systematických vztahů mezi lexémy akonstrukcemi, ahodí se proto pro první fáze výzkumů zaměřených na lexiko-gramatické vztahy. Navíc výzkumy poukazující na její prediktivní sílu činí její výsledky zajímavými izkognitivního hlediska. 3. PŘÍPADOVÁ STUDIE: [V(SI) (SVÝCH) PĚT/PÁR ŠVESTEK] Pro ilustraci uplatnění KolA na češtinu můžeme vyjít zvýsledků analýzy kolokací lexému švestka vprvní části tohoto textu. Domnívali jsme se, že sloveso balit atvar zvratného posesivního zájmena svejch mohou pocházet zfrazému sbalit si svých pět švestek. Když se předběžně podíváme do psaných korpusů Českého národního korpusu (SYN ve verzi 4, viz Hnátková et al., 2014), vidíme, že konstrukce vykazuje poměrně velkou míru variability, jak ukazují příklady (1)–(6): (1) Poté vzal svých „pět švestek“, ženu zamkl autekl. (2) Sbalil jsem si svých pět švestek apěkně po anglicku se vypařil. děpodobnostními hodnotami. Gries namítá, že KolA je použitelná srůznými asociačními mírami podle preferencí každého badatele, auvádí, proč on sám preferuje FYE (viz výše vtomto textu). Dále usložitějších typů KolA je nutné vkontingenční tabulce uvádět počet konstrukcí odlišných od té sledované, vnichž se konkrétní lexém vyskytuje, což může vpouze lemmatizovaných korpusech (oproti syntakticky anotovaným) představovat metodologický problém. Gries (2015) navrhuje možné způsoby jeho řešení. 14 Vědomí této skutečnosti se ostatně uautorů KolA odráží ivtom, že vyvíjejí pokročilejší verze této metody, jako je mnohočetná nebo třídimenzionální KolA. OPEN ACCESS
EvA LEhEČkOvá 175 (3) Tak jsem si sbalil pět švestek ajelo se do Ostravy (4) …vsešikmeném rohovém domě za vodárnou složil svých pět švestek. (5) Přijdou, pak zase seberou svejch pět švestek atáhnou dál. (6) Když jsme se vzali akaždý rozbalil svých „pár švestek“. Jednak všesti příkladech vidíme pět různých sloves (vzít, sbalit, složit, sebrat, rozbalit), ve větě může být přítomno zvratné zájmeno osobní (si) nebo přivlastňovací (svých nebo svejch) nebo obě najednou, kvantifikujícím výrazem může být buď číslovka pět, nebo pár. Vprostoru, jaký poskytuje tato studie, se můžeme zaměřit na dvě otázky: 1.Jaká je variabilita na pozici řídícího slovesa akterá ztěchto sloves jsou ke sledované konstrukci přitahována? 2. Je variabilita na pozici kvantifikátoru (pět/pár) determinována lexémem na pozici predikátu? Kzískání odpovědi na první otázku použijeme jednoduchou kolexémovou analýzu, kdruhé otázce použijeme kovariační kolexémovou analýzu. Konstrukci sbalit si svých pět švestek chápeme jako částečně schematizovanou snásledující strukturou [V(si) (svých) pět/pár švestek]15. Podle toho můžeme formulovat korpusový dotaz: [tag="V.*"]{0,4}[lemma="pět|pár"][word="švestek"], který obsahuje otevřenou pozici slovesa, protože chceme sledovat lexikální variabilitu na této pozici vdaném frazému; vzhledem ktomu, že může, nebo nemusí být přítomno zvratné osobní a/nebo přivlastňovací zájmeno, popřípadě ještě adverbium, na dané pozici umožňujeme přítomnost dalších výrazů— {0,4}, na další pozici pak očekáváme buď výraz pár, nebo pět anakonec slovní tvar švestek16. Ze získaných 710 dokladů (i.p.m. 0.16) jsem ručně odstranila nefigurativní kontexty aduplicity. Zůstalo 605konkordancí. Unich jsem doplnila slovesná lemmata, kterých bylo 66. Tam, kde se jednalo opolysémní slovesný lexém, nebo vpříkladech, kde by slovesné lemma neodkázalo přesně kvýznamu použitému vdané větě, jsem přidala nezbytné doplnění, viz například dát_dohromady nebo koupit_za níže. Následně jsem vytvořila kontingenční tabulku. Pro kolexémovou analýzu potřebujeme znát čtyři údaje: frekvenci slovesa ve sledované konstrukci, frekvenci slovesa vkorpusu SYN (bez jeho výskytu ve sledované konstrukci), výskyt konstrukce vkorpusu avelikost korpusu. Výsledná tabulka ve formátu .txt se vloží vprogramu R do skriptu vytvořeného S. Griesem (2014). Výsledkem je seznam sloves sudanou hodnotou jejich asociační síly. Asociační síla měřená Fisherovým exaktním testem se interpretuje tak, že pokud je kladná avětší než 3, je hodnota pravděpodobnosti p < 0.001, hodnota větší než 2 odpovídá p < 0.01 ahodnoty nad 1,3 odpovídají p < 0.05. Pokud je tedy kolostrukční síla vyšší než 1,3, daná slovesa jsou ke sledované konstrukci přitahována vmíře větší, než vyplývá znáhodné distribuce, za dostatečně signifikantní se obvykle považují hodnoty vyšší než 2,0. Výsledky kolexémové analýzy pro prvních 15 Od možnosti postpozice slovesa za akuzativní NP vtéto sondě pro jednoduchost odhlížím, výsledky nejsou touto redukcí zásadně ovlivněny. 16 Hledání podle slovního tvaru švestek, nikoliv lemmatu švestka přispívá keliminaci nerelevantních dokladů. Zároveň nepředpokládám, že výraz švestek bude bezprostředně premodifikován jiným výrazem ještě před modifikací kvantifikátorem pět/pár. OPEN ACCESS