Kolokační grafy a sítě s použitím nástroje #LancsBox: aplikace v angličtině a češtině
Abstract
36
Full text
ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.1, S. 36–59 Kolokační grafy asítě spoužitím nástroje #LancsBox: aplikace vangličtině ačeštině* Václav Březina (Lancaster)— Petr Pořízka (Olomouc) Václav Březina— Petr Pořízka COLLOCATION GRAPHS AND NETWORKS USING #LANCSBOX: APPLICATIONS IN ENGLISH AND CZECH This article deals with the notion of collocation graphs and lexical networks, which not only represent the visualization of the collocational relationship between linguistic units— these have been traditionally displayed in atabular form with frequency distributions and association measure values— but also an important analytical method in its own right. We illustrate the use of collocation graphs and networks with two case studies as examples demonstrating the use of this technique in lexicography and discourse analysis. The examples are based on both English and Czech corpora, which we analysed using #LancsBox, afree tool which can build collocation graphs and networks on the fly. KEYWORDS association measures, collocations, collocation graphs and networks, corpus, quantitative analysis, #LancsBox, conceptual metaphor, contrastive analysis, MI-score KLÍČOVÁ SLOVA asociační míry, kolokace, kolokační grafy asítě, korpus, kvantitativní analýza, #LancsBox, konceptuální metafora, kontrastivní analýza, MI-score DOI https://doi.org/10.14712/23366591.2021.1.2 ÚVOD Bezprostřední kontext, který vtextech sdílejí lexikální výrazy, nám poskytuje jedinečnou možnost analyzovat základních struktury jazyka iinterakci mezi slovy. Vzásadě lze říci, že kolokace je jev spojený sopakovaným výskytem dvou (či více) slov vtextu. Včeské terminologii tak hovoříme osouvýskytu slov. Záměrně zde používáme velice širokou definici kolokace, kterou různí autoři pojímají zrůzných * Poděkování: Autoři by chtěli poděkovat dvěma anonymním recenzentům za vnímavé afaktické komentáře, jež bezesporu pomohly tento text vylepšit. Poděkování patří iredakci časopisu, zejména profesoru Klégrovi, za podporu při psaní arevizi článku. Příspěvek vznikl za podpory MŠMT ČR udělené UP vOlomouci (IGA_FF_2020_021 „Bohemistika: literárněvědné alingvistické přesahy ainterpretace“). Prezentovaný výzkum byl dále podpořen následujícími granty: Granty ESRC č. EP/P001559/1,ES/K002155/1 aES/R008906/1. OPEN ACCESS
VÁCLAV BŘEZINA— PETR POŘÍZKA 37 hledisek. Nemáme tedy na mysli jen lexikální jednotky austálená spojení typu cestovní ruch atratoliště krve, ale též volnější asociace mezi slovy vdiskurzu. Ztohoto důvodu také vpřípadových studiích používáme poněkud široký kolokační rozsah pět slov vlevo apět slov vpravo od nodu (viz kapitola 1). Kolokaci zde tak chápeme jako široký pojem sřadou definic (např.Firth, 1957; Sinclair, 1991; Čermák, 2006; Wray, 2008; Paquot— Granger, 2012; Gries 2013). Vtomto textu, jenž vychází zpředchozích výzkumů astudií publikovaných na toto téma vangličtině (Brezina, 2018b) adoplňuje je kontrastivní rovinou mezi angličtinou ačeštinou, se tak navracíme kjednoduchému firthovskému pojmu kolokace definovanému jako „obvyklý souvýskyt slov“ („the habitual co-occurrence of words“) (Firth, 1957, s.2). Tento souvýskyt je přitom statisticky identifikován užitím celé řady asociačních měr (blíže Evert, 2008; Pecina 2010; Gablasova et al., 2017b). Tyto asociační míry jsou nástroje, které operacionalizují konkrétní definici nebo teoretické pojetí kolokace. Předkládaná studie rovněž navazuje na metodologii korpusové lingvistiky, jež poskytuje empirický základ pro kvantitativní identifikaci anáslednou extrakci kolokací. Například slovní spojení vzásadě zúvodu tohoto článku tvoří kolokaci,1 jež se vreprezentativním korpusu češtiny SYN2015 vyskytuje 2041krát (průměrně 16,9krát v1 milionu slov).2 Při hledání kolokací se však nemusíme omezovat jen na pouhou frekvenci souvýskytu dvou slov, příp. na výrazy svysokou četností— vtéto souvislosti jsme dosud hovořili oobvyklém nebo opakovaném souvýskytu. Často je vhodnější podívat se na exkluzivní vztah mezi dvěma výrazy, jejichž spojení nemusí být tak frekventované. Ktomuto účelu slouží kolokační míry jako MI-score (Pořízka, 2014, s.40). Tabulka 1 uvádí výrazy identifikované právě prostřednictvím MI-score, vyskytující se vjedinečném (exkluzivním) vztahu se slovním tvarem zásadě. Jak je vidět, nejedná se jen oustálená slovní spojení (zásada rovnoprávnosti), ale ioobecnější asociace se samotným výrazem (v) zásadě (např.dvojím, irelevantní, neliší). MI-score (Church— Hanks, 1990) je jednou znejvyužívanějších běžných asociačních měr (statistických metod) používaných vkorpusové lingvistice právě kdetekci aextrakci kolokátů, má ale isvé nevýhody, snimiž je třeba při analýze počítat— vliv výrazů snízkou četností, detekce spíše příznakovějších, neobvyklejších kolokátů ad. (srov.Pořízka, 2014, s.39n.). Ke kvantitativní informaci— číselné hodnotě vyjadřující míru asociace mezi dvěma slovy— lze rovněž vygenerovat graf (obr. 1), tj.vizuální reprezentaci zkoumaných slovních spojení. Právě tato vizualizace kolokátů je užitečnou interpretační technikou vhodnou kanalýze komplexnějších jazykových vztahů vkorpusových datech. Tradičně jsou totiž kolokace chápány jako diskrétní jevy prezentované ve formě tabulkových seznamů kolokátů (tab. 1). Naší snahou je mj.ukázat, že kolokační spojení jsou nicméně propojenými entitami, jež mohou být zobrazeny vpodobě kolokačních grafů asítí. 1 Vurčitém pojetí může být tato vazba chápána jako koligace, společný výskyt slov tvořící gramatickou vazbu. My se však zde přidržíme obecnějšího pojetí kolokace zahrnující jak lexikální, tak gramatické výrazy, atermín koligace ponecháme pro abstraktnější gramatické vztahy (např.sloveso + předložka), srov.Hunston, 2001. 2 Blíže viz https://wiki.korpus.cz/doku.php/cnk:syn2015 (poslední přístup: březen 2021). OPEN ACCESS
38 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.1 kolokát MI-score 1. rovnoprávnosti 10.695 2. dvojím 10.367 3. didaktické 10.235 4. irelevantní 10.024 5. dvojího 9.837 6. rozlišujeme 9.782 7. dokončeny 9.668 8. namítat 9.457 9. restituce 9.289 10. neliší 9.104 TABULKA 1.Kolokáty slovního tvaru (typu) zásadě vkorpusu SYN2015 (CPN: 03– MI-score (3), L3–R3, C:5-NC:5)3 Pro ilustraci uvádíme kolokační graf vytvořený na základě BNC2014 Baby +, korpusu psané amluvené angličtiny opěti milionech slov (Brezina, 2019). OBRÁZEK 1.Kolokační graf slovního tvaru essence vBNC2014 Baby + (CPN: 03– MI-score (3), L3–R3, C:3-NC:3) 3 Vzávorce používáme uvšech příkladů vtextu tzv.kolokační notaci— CPN = Collocation Parameters Notation (blíže Brezina et al., 2015, s.144n.). Formalizovaný zápis ztab.1 má následující význam: ve třetím sloupci hodnoty MI-score sprahovou hodnotou 3 (03– MI-score (3)); rozsah kontextu 3 výrazy vlevo ivpravo (L3–R3); minimální četnost kolokátu (C) ikolokace (NC) 5 výskytů. Blíže vysvětlujeme CPN zde vkap. 2. OPEN ACCESS
VÁCLAV BŘEZINA— PETR POŘÍZKA 39 Graf na obr.1 vykresluje slovní tvary vblízkosti výrazu essence (esence, zásada) vkolokačním okně tří slov vlevo ivpravo. Výraz essence zde terminologicky označujeme jako uzel, tedy (základové) slovo, okteré se zajímáme. Délka spojnic (hran) vgrafu vyjadřuje sílu kolokace (izde měřenou prostřednictvím MI-score): čím je kolokace blíže kuzlu, tím silnější vztah vyjadřuje (detailněji viz kapitola 2). Tento poměrně jednoduchý kolokační graf lze rozšířit do složitější kolokační sítě, což je komplexnější typ grafu, kněmuž přináleží více uzlů sjejich jedinečnými asdílenými kolokáty. Jednoduché kolokační grafy ikomplexní kolokační sítě proto mají potenciál nejen účinně vytvářet přehled odatech, ale také, jak chceme ukázat ivtéto studii, přinést nové možnosti jazykové analýzy. Zatímco kolokační grafy poskytují užitečnou vizuální reprezentaci nejdůležitějších kolokátů kolem základového uzlu, apředstavují tak exploratorní alternativu ktradičnímu seznamu snalezenými kolokáty, kolokační sítě jdou ještě okrok dále, naznačujíce složitější či komplexnější vztahy širší skupiny výrazů mezi sebou (uzlů). Kolokační sítě ukazují nejen sílu asociace, ale ijejí komplexnost vykreslenou jedinečnými isdílenými kolokáty. To vše jsou informace oužití či jazykovém chování výrazů, jež nejsou ztradiční formy evidence kolokací zřejmé či snadno dostupné. Myšlenka kolokačních sítí se opírá opůvodní výzkum Phillipse (1985) abyla použita například ve studiích terminologie (Williams, 1998), historického asociálního vývoje jazyka (McEnery, 2006), ale ionline diskurzu (Brezina, 2016). Donedávna však analýza kolokačních sítí vyžadovala značnou manuální práci. Se zveřejněním softwarového nástroje #LancsBox (Brezina et al., 2015), který kolokace automaticky identifikuje ajejich sítě dynamicky generuje, se tento analytický úkol stal pro lingvisty mnohem lépe zvládnutelným apřístupnějším.4 Tento článek nejprve pojednává okonceptu kolokačních grafů asítí. Poté následují dvě případové studie, které ukazují použití tohoto konceptu jak vangličtině, tak ivčeštině. Tyto studie jsou zoblasti lexikografie aanalýzy diskurzu avyužívají právě nástroj #LancsBox.5 Co se týče samotného zaměření tohoto článku, jedná se okonceptuální studii ilustrující akriticky hodnotící vizualizační techniku kolokačních grafů asítí používaných vcelé řadě oblastí korpusového výzkumu. Příklady prezentované 4 Je třeba poznamenat, že #LancsBox není jediným nástrojem vytvářejícím kolokační grafy asítě, je ale jedním znástrojů uživatelsky nejpřívětivějších (kolokační analýza je relativně velmi snadná) avolně dostupných, nekomerčních. Kolokační grafy produkuje např.iCONE (Gullick et al., 2010), nabízí však jen omezený počet možností identifikace kolokací. Ikorpusový nástroj Sketch Engine (dostupný z: https://www.sketchengine.eu/) umožňuje kromě tradičního způsobu vytěžování kolokátů generovat avizualizovat vztahy mezi výrazy prostřednictvím tzv.word sketch diferencí (Kilgarriff et al., 2010; srov.též https://www.sketchengine.eu/guide/word-sketch-collocations-and-word-combinations/) (cit.2.3.2021). Jedná se ale bohužel oproprietární software, byť je vsoučasnosti akademickým institucím vEU poskytován bezúplatně (grantová podpora projektu Elexis do března 2022). Kolokační grafy lze vneposlední řadě vytvářet ipomocí obecných (neling vistických) softwarových nástrojů jako Gephi (dostupný z: https://gephi.org/). 5 Dostupný zwww: http://corpora.lancs.ac.uk/lancsbox/ (cit.2.3.2021), aktuálně ve verzi 6.0. OPEN ACCESS
40 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.1 vtomto příspěvku apřípadové studie nemají za cíl poskytnout ucelený obraz otématech, kterých se dotýkáme, ani prezentovat plně srovnatelnou diskusi orozdílech mezi českými aanglickými kolokacemi. Namísto toho se zaměřujeme na ilustraci řady aspektů ametodických rozhodnutí, která musí výzkumník učinit při aplikaci dané techniky vkonkrétním výzkumném kontextu. 1. KOLOKAČNÍ GRAFY ASÍTĚ: VYMEZENÍ POJMŮ ACHARAKTERISTIKA KONCEPTU Přestože jsou kolokační grafy asítě identifikovány agenerovány pomocí nástroje #LancsBox automaticky, musíme vždy učinit řadu klíčových rozhodnutí, jež se týkají nastavení parametrů vytěžování kolokací: volba asociační míry, prahová hodnota (minimální hodnota asociační míry), minimální frekvence výrazů, kolokační rozsah atd. Podrobněji otěchto parametrech pojednává Gablasova akol. (2017b). Pro standardizovaný zápis těchto parametrů navrhli Brezina et al. (2015) systém nazvaný Collocation Parameter Notation (CPN, zápis kolokačních parametrů) používaný ivtomto textu. Parametry ainformace, jež je třeba uvést, shrnuje tabulka 2: identifikační číslo asociační míry,6 název asociační míry (statistické metody) + její prahová hodnota, kolokační rozsah vlevo (L) avpravo (R), minimální frekvence kolokátu + minimální frekvence kolokace ajakékoli další filtry použité během analýzy. identifi kační číslo asociační míry název asociační míry prahová hodnota rozsah vlevo (L) avpravo (R) minimální frekvence kolokátu (C) minimální frekvence kolokace (NC) filtr 4b MI2 3 L5–R5 5 1 funkční slova odstraněna TABULKA 2.Notace kolokačních parametrů (Brezina et al.)7 4b-MI2 (3), L5–R5, C:5-NC:1; funkční slova odstraněna Souhrnně řečeno, aspekty kolokačního vztahu, jež lze prozkoumat metodou kolokačních grafů asítí, jsou: i) frekvence, ii) síla asociace, iii) poloha, iv) kolokační jednotka av) kolokační propojení. Všechny rysy lze vjazykové analýze využít, jak ilustrují případové studie níže vtextu. Ilustrujme nyní na konkrétním příkladu rozdíl (a) vtradiční, statické prezentaci kolokací a(b) dynamické reprezentaci prostřednictvím kolokačního grafu asítě. Tabulka 3 ukazuje prvních sedm kolokátů substantiva love (láska) vkolokačním okně L3–R3 (tři slova vlevo ivpravo) zkorpusu BE06 současné psané britské angličtiny (Baker, 2009). Kolokace jsou setříděny podle hodnoty MI-score. 6 Sodkazem na seznam asociačních měr vpublikacích Brezina et al., 2015, aBrezina, 2018. 7 Vposledním řádku tab. 2 je uveden konkrétní příklad, navrhovaná forma zápisu. OPEN ACCESS
VÁCLAV BŘEZINA— PETR POŘÍZKA 41 Tytéž informace mohou být vizualizovány jako kolokační graf (obr. 2) ukazující vztah mezi uzlem ajeho kolokáty, konkrétně vždy podle zvolené asociační míry. Délka spojnice (hrany) mezi uzlem akolokáty je přitom nepřímo úměrná síle asociace: čím je asociace silnější, tím je spojnice kratší. Jak je možno vidět na obr.2, nejsilněji spojenými kolokáty kvýrazu love podle MI-score jsou affair, fell, falling afallen. Ve srovnání stím představují výrazy me, I’m alife zřetelně méně těsné spojení. Graf dále zobrazuje ifrekvenci jednotlivých kolokací (souvýskytů uzlu + kolokátu): tmavší barevný odstín je odrazem častějšího souvýskytu jednotek. Například ve vnějším kruhu kolokátů jsou me alife častějšími kolokáty než I’m. Vsymetrickém okně (jako 3L–3R) je další kolokační dimenzí, již lze změřit, pozice kolokace vtextu. Některé zkolokací se vyskytují vsyntaktických (lineárních) pozicích, které vtextu předcházejí uzlu, jiné vpozicích, jež následují. Například různé kolokát MI-score AF (kolokace) AF (korpus) affair 8.86 5 37 fell 8.52 14 131 falling 8.52 5 47 fallen 8.37 5 52 me 5.57 23 1667 i’m 5.30 5 437 life 5.12 8 791 TABULKA 3.Kolokáty výrazu love vBE06 (CPN: 03– MI-score (5), L3–R3, C:5-NC:5) OBRÁZEK 2.Kolokační graf: love (přehledné zobrazení) vBE06 (CPN: 03– MI (5), L3–R3, C:5-NC:5) OPEN ACCESS
42 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.1 formy slovesa fall vždy předcházejí výrazu love, aby vytvořily frázi fall in love (zamilovat se); ve srovnání stím slovo affair vždy následuje za love, aby tak vytvořilo slovní spojení love affair (milostná aféra). Tato forma zobrazení kolokátů, která ilustruje jejich přesnou (syntaktickou) polohu vtextu, ale vede kpřekrývání (jako na obrázku 3 níže), pokud se víceré kolokáty vyskytují vtéže pozici. Obrázek 3 také ukazuje převládající tendenci jednotlivých kolokátů objevit se spíše vlevo či převážně vpravo od svého uzlu. Tato pozice je vgrafu stanovena na základě výpočtu podílu případů vyskytujících se nalevo či napravo. Například substantivum life se obvykle objevuje až za výrazem love, jako vpříkladu (1): (1) The BBC was clear that Mr Blunkett’s love life was absolutely his own affair. (BE06, B) [BBC jasně uvedla, že milostný život pana Blunketta je jeho čistě soukromá záležitost.] Vněkterých případech však může život předcházet lásce, srov.níže: (2) Do You Believe In Life After Love? (BE06, K) [Věříte vživot po lásce?] Proto je na obrázku 3 kolokát life zobrazen spravostrannou tendencí, ale nikoli zcela vpravo od uzlu (love). I’m, podobně jako life, má pravostrannou tendenci. Nutno upozornit, že rozhodnutí, zda je kolokát zobrazen nad uzlem či pod ním, je motivováno čitelností (přehledností zobrazení) anevztahuje se kžádné zvlastností kolokace. Kromě uvedených dvou kolokátů stendencí objevovat se spíše vpravo od uzlu ukazuje graf na obrázku 3 ikolokát me, gravitující mírně vlevo spřevahou příkladů jako (3): (3) Dad needed to leave me to love the next child. (BE06, K) [Táta mě musel opustit, aby mohl milovat další dítě.] Pozice vgrafu nám tedy pomáhá interpretovat jazykové chování kolokací aposkytuje užitečné shrnutí typických syntaktických či textových pozic, vnichž se kolokáty vyskytují. Doposud byly základními jednotkami kolokační analýzy slovní tvary (wordforms, types). Než budeme pokračovat, musíme učinit důležitou terminologickou poznámku. Terminologie se vodborné literatuře liší, pokud jde oužití výrazů jako slovní tvar (wordform), lemma, typ (type) aslovníková forma (headword). Vtomto článku definujeme následující termíny vsouladu shlavními publikacemi vangličtině takto: LEMMA: Skupina slovních tvarů, které jsou spojeny tím, že jsou flektivními tvary stejného základního slova. Lemma je obvykle označeno touto základní formou nebo kmenem slova. TYP: (a) Jeden konkrétní slovní tvar. Jakýkoli rozdíl ve formě (například pravopis) dělá ze slova jiný typ. OPEN ACCESS
VÁCLAV BŘEZINA— PETR POŘÍZKA 43 Obě definice jsou převzaty zMcEnery— Hardie (2011, s.245, 252). Srovnej též podrobnou diskusi otom, co je slovo vBrezina (2018, s.38–41). Vtomto úzu se termín slovní tvar používá synonymně stermínem typ. Naopak, slovníková forma (headword) se odlišuje od lemmatu vnásledujícím smyslu: Lemma je abstraktní třída zahrnující více slovních tvarů, zatímco slovníková forma je jeden tvar (základní forma slova nebo kmen), který se používá kreprezentaci celého lemmatu. Zdá se, že se česká terminologie8 od toho úzu odlišuje vrozlišování typu jako nadřazeného termínu, který lze realizovat slovním tvarem nebo lemmatem např.ve frekvenčních seznamech slov ave výpočtech token–type ratio atd. Zřetelně se zde též nerozlišuje mezi slovníkovou formou alemmatem. Vtabulce 3 ana obrázku 2 se různé gramatické (flektivní) tvary slovesa fall objevily jako tři různé kolokáty (fallen, falling afell). Pro některé typy analýz může být naopak užitečné či vhodné pracovat slemmaty (viz ipozn.níže odůležitosti volby základní jednotky vsouvislosti stypologicky různými jazyky). Lze například nastavit love jako lemma slovesa to love. Tímto způsobem vyloučíme všechna nominální užití výrazu love, ale zahrneme do analýzy všechny slovesné tvary, včetně loves, loving, loved. Budeme-li tedy pracovat slemmaty, výsledný graf bude odlišný, jak je vidět na obrázku 4. Uzly ivšechny kolokáty vgrafu představují slovníkovou formu výrazů aslovnědruhovou příslušnost azastupují všechny slovní tvary přináležející kdanému lemmatu (paradigmatu). Volba základní jazykové jednotky kolokační analýzy je metodologicky velmi důležitá, tradičně si konkurují type (slovní tvar) alemma. Tato volba nabývá důležitosti obzvláště utak typologicky rozdílných jazyků, jako je angličtina (analytický typ) ačeština (flexivní typ). Zatímco vpřípadě angličtiny nemusí být rozdíl vužití type/ lemma během analýzy týchž textů nijak zásadní (srov.ale Sinclair, 1991, kde se dis8 Přehled základních pojmů korpusové lingvistiky, dostupný zhttps://wiki.korpus.cz/doku. php/pojmy:prehled_pojmu (cit. 2. 3. 2021). OBRÁZEK 3.Kolokační graf (poziční pohled): tvar love vBE06 ( CPN: 03– MI (5), L3–R3, C:5-NC:5) OPEN ACCESS
44 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.1 kutuje odůležitosti jednotlivých slovních tvarů vkolokacích pro angličtinu) aběžně je základní jednotkou typ, učeštiny může být vmnohých situacích vhodnější lemma vzhledem kflektivnímu charakteru jazykového systému. Lemma je totiž jednotka zastupující všechny textové tvary vážící se kjednomu paradigmatu. Jinak řečeno: výběr jednotky (slovní tvar vs. lemma) by mohl být pro flektivní jazyky důležitější než pro jazyky neflektivní povahy, aby byly do kolokační analýzy zahrnuty všechny typy daného lemmatu (paradigmatu). Nakonec musíme zvážit ještě jednu důležitou vlastnost kolokací— konektivitu (Phillips, 1985; Brezina et al., 2015). Kolokace vjazyce idiskurzu vstupují do bohaté sítě významových akřížových asociací. Významové asociace představují jednoduchý vztah mezi dvěma výrazy (uzlem ajeho kolokátem), zatímco křížové asociace zahrnují skupinu širších vztahů mezi více slovy vrámci určitého textu/diskurzu. Analýza avizualizace těchto sítí nám tak může pomoci odkrýt důležité vztahy vjazyce (textu či diskurzu). Kolokační konektivitu nelze snadno aefektivně zachytit tradičním způsobem (kolokačním seznamem); vhodnou formou zobrazení této konektivity je komplexní graf nazývaný kolokační síť (viz obrázek níže). Obrázek 5 reprezentuje kolokační síť, jež ukazuje spojení mezi třemi různými substantivními lemmaty: love (láska), life (život) afamily (rodina). Barvy kolokátů vgrafu označují jejich slovnědruhovou příslušnost, např.modrá značí substantiva, zelená adjektiva ačervená slovesa. Jak můžeme vidět, love je spojeno sfamily nepřímo, prostřednictvím kolokátu life. Family alife navíc sdílejí dva společné kolokáty: whole aentire. Tyto kolokáty se vyskytují vanglických spojeních whole life/family aentire life/family (celý život / celá rodina). Prozkoumat ale můžeme ikolokace, jež jsou jedinečné (nesdílené) pro každý ze tří uzlů.9 9 Pro další teoretickou diskusi okonceptu kolokačních sítí ajeho využití vanalýze viz Phillips, 1985; Brezina et al., 2015; Baker, 2016, aBrezina, 2016. OBRÁZEK 4.Kolokační graf— poziční pohled, lemmatizovaný: lemma love vBE06 (CPN: 03– MI (5), L3–R3, C:5-NC:5) OPEN ACCESS
VÁCLAV BŘEZINA— PETR POŘÍZKA 51 Podobné závěry jsou ale vzhledem kfázi výzkumu prozatím spíše hypotetické, přestože určité souvislosti tato případová studie naznačuje. Je totiž známo, že výsledné kolokace jsou podmíněny mj.ivýběrem asociační míry (srov.Křen, 2006), atak bude třeba tyto dva možné faktory— vliv typu textu a/nebo asociační míry— vbudoucnu prověřit dalšími analýzami. 3. PŘÍPADOVÁ STUDIE 2: KOLOKAČNÍ SÍTĚ VANALÝZE DISKURZU Podívejme se nyní na vnímání „východoevropských přistěhovalců“ analýzou kolokačních asociací svýrazy immigrant (přistěhovalec) aimmigrants (přistěhovalci) vkomentářích čtenářů pod články dvou britských novin: The Guardian aDaily Mail. Každé ztěchto periodik přitahuje jiný typ čtenáře. Zatímco Guardian, který lze charakterizovat jako typ seriózních novin politicky nakloněných doleva, přitahuje čtenáře, jejichž hodnoty se spozicí novin typicky shodují, Daily Mail jsou novinami pro masový trh politicky tíhnoucí doprava amají obecnější čtenářskou obec (McNair, 2009). Komentáře vyjadřují subjektivní názory, perspektivy aideologie čtenářů vreakci na konkrétní obsah novinových článků. Těžištěm této dílčí analýzy je otázka imigrace, téma, jež bylo již dříve široce zkoumáno nejrůznějšími metodami, včetně metod korpusové lingvistiky (např.Blinder— Allen, 2016; KhosraviNik, 2009; Gabrielatos— Baker, 2008). Samotnou analýzu je nutno uvést malou historickou poznámkou, jež doplňuje kontext výzkumu: vlednu 2014 otevřela Británie svůj trh práce občanům zRumunska aBulharska. Vpřípravě na tento politický krok probíhaly vbritském tisku časté diskuse omožných dopadech tohoto rozhodnutí na britskou ekonomiku akvalitu života vBritánii. Média také srovnávala podobnou událost, jež se stala odeset let dříve (2004), kdy se trh práce otevřel občanům Polska, Maďarska, České republiky aSlovenska. Zajímavé je, že po referendu obrexitu vroce 2016, jež přineslo rozhodnutí Británie opustit Evropskou unii, lze debatu opřistěhovalectví před brexitem považovat za faktor přispívající kvýsledku referenda, atedy otázku svysokým společenským významem adopadem. 3.1 METODA ADATA Data použitá ktéto analýze jsou, jak jsme již uvedli, vzorkem čtenářských komentářů vyskytujících se pod články vnovinách The Guardian aDaily Mail. Kidentifikaci příslušných článků těchto dvou novin zlet 2010 až 2013 jsme jako vyhledávací výraz použili East/Eastern European(s) (Východoevropan(é)). Jde okolektivní jazykový výraz často používaný britským tiskem při uvádění odkazů na občany znových zemí Evropské unie (např.Rumunska, Bulharska, České republiky nebo Polska). Celkově bylo zThe Guardian (dále GU) extrahováno 1 024 495 tokenů, zDaily Mail (dále DM) pak 729 042 tokenů. Detailnější informace otěchto subkorpusech viz tabulka 7: OPEN ACCESS
52 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.1 korpus počet komentářů počet přispěvatelů (čtenářů) tokeny průměrná délka komentáře (tokenu) GU 10,193 4,072 1,024,495 101 DM 13,265 6,093 729,042 55 celkem 23,458 10,165 1,753,537 75 TABULKA 7.Charakteristika subkorpusů The Guardian (GU) aDaily Mail (DM) Ztabulky 7 je patrné, že vkaždém ztěchto dvou subkorpusů je více než deset tisíc komentářů, přičemž čtenáři Guardian přispívají méně často, ale vprůměru delšími komentáři než čtenáři Daily Mail. Průměrná délka komentáře činila 101 tokenů vGU a55 tokenů vDM. Průměrný komentář čtenáře vGuardian byl tedy téměř dvakrát delší než průměrný komentář vDaily Mail. Hledaným výrazem vkolokační analýze bylo nominální lemma immigrant (přistěhovalec). Tentokrát jsme zvolili jako asociační měřítko kidentifikaci častých avýlučných asociací skóre logDice (Rychlý, 2008; Gablasova et al., 2017b; Brezina, 2018). Je důležité si uvědomit, že témata, názory ipovaha publikovaných novinových článků mají vliv ina typ či charakter čtenářských komentářů, které se pod články objevují. Od tohoto vztahu mezi novinovými články atypy čtenářských komentářů odhlížíme. Důraz je kladen výhradně na diskurz vytvořený čtenáři vreakci na články, jež vdaném časovém období obsahovaly hledaný výraz East/Eastern European(s). 3.2 VÝSLEDKY ADISKUSE Výsledky analýzy ve formě kolokačních grafů lemmatu immigrant (imigrant) vobou subkorpusech (GU aDM), zahrnující tvary singuláru iplurálu, uvádíme na obrázcích 8 a9. Vanalýze čtenářských komentářů nás zajímaly především konceptuální souvislosti patrné vdiskurzu: zaměřili jsme se proto pouze na substantiva, slovesa aadjektiva jako kolokáty nesoucí sémantický (nikoli gramatický) význam. Poloha kolokátů kolem uzlu je užitečným indikátorem typu syntaktických rámců (či odrazem textových pozic), vnichž se uzel ijeho kolokáty vyskytují. Poziční zobrazení vgrafech na obrázcích 8 a9 tedy vykresluje kolokáty vlevo od uzlu, pokud se před klíčovým slovem immigrant objevují ivtextu, zatímco kolokáty zobrazené vpravo od uzlu klíčové slovo (uzel) vtextu následují. Ve dvou výše zobrazených grafech suzlem immigrant lze pozorovat srovnatelný počet kolokátů: 16 vGU a19 vDM. Ztoho je 9 kolokátů sdíleno oběma subkorpusy: be_ verb (být_verbum), come_verb (přijít_verbum), country_noun (země_substantivum), european_adjective (evropský_adjektivum), illegal_adjective (ilegální_adjektivum), job_noun (zaměstnání_substantivum), many_adjective (mnoho_adjektivum), number_noun (počet_substantivum), work_verb (pracovat_verbum). To ale neznamená, že se tyto kolokáty používají vobou subkorpusech ve shodných kontextech astýmiž konotacemi. Např.adjektivum illegal (nelegální) je vkomentářích databáze DM užito převážně vnegativně laděných kontextech (viz př. 13 a14 níže), zatímco subkorpus GU obsahuje řadu případů, kdy je deskriptor illegal zpochybněn (př. 15 a16). OPEN ACCESS
VÁCLAV BŘEZINA— PETR POŘÍZKA 53 OBRÁZEK 8.Kolokace lemmatu immigrant vsubkorpusu GU (9a-MI (9), R5–L5, C:10-NC:10; zobrazena pouze substantiva, slovesa aadjektiva) OBRÁZEK 9.Kolokace lemmatu immigrant vsubkorpusu DM (9a-MI (9), R5–L5, C:10-NC:10; zobrazena pouze substantiva, slovesa aadjektiva) OPEN ACCESS
54 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.1 (13) … must come OUT of the EU NOW and send home all illegal immigrants NOW Iam sick to death of reading articles like this. (DM) (14) Iwon’t even get into the ILLEGAL immigrants and how easy we have made it for them… (DM) (15) Rarely is the distinction made between asylum seekers, immigrants and illegal immigrants. Personally, Ihave no time for people who easily take aswipe at hard working low-paid legal migrants who often take jobs that unemployed UK citizens sometimes find unpalatable. (GU) (16) … also irritating when the Daily Mail/BNP crowd posting here repeatedly confuse “illegal” immigrants with EU citizens, who have every right to be in Britain. (GU) Zaměřme se nyní na jedinečné kolokace vkaždém zobou subkorpusů. GU obsahuje řadu neutrálních kolokátů jako do_verb (dělat_verbum), eastern_adjective (východní_ adjektivum), have_verb (mít_verbum), immigrant_noun (imigrant_substantivum) auk_noun (UK_substantivum). Tyto kolokáty naznačují, že se diskuse vede kolem přistěhovalců zvýchodní Evropy do Velké Británie, což je mj.odrazem toho, jak byl subkorpus vytvořen: vyhledáváním článků stouto problematikou. Verba do (dělat) ahave (mít) se vyskytují jednak jako pomocná slovesa, jednak jako plnovýznamová slovesa ve spojení svýrazem immigrant(s) (imigrant(i)) vsyntaktické roli podmětu apředmětu; proto neodkazují na žádné konkrétní téma diskuse opřistěhovalcích. Vsubkorpusu GU byla nalezena pouze dvě jedinečná spojení, jež zdůrazňují konkrétní téma nebo část diskuse: take_verb (vzít/získat_verbum) aworker_noun (pracovník_substantivum). To souvisí sotázkou, zda přistěhovalečtí pracovníci berou práci britským pracovníkům. Příklady této diskuse jsou uvedeny níže: (17) What some “working class” Brits fail to understand is that non-British workers (both immigrants and Eastern European workers, again, different categories) put alot more into the British welfare state than get out of. (GU) (18) His wife may not need to work because of the high value of the cash that the immigrant worker can send home, so relatively fixed costs like childcare and mortgages become irrelevant. (GU) (19) Brown says British jobs for British people, then we get the results in. Immigrants take 81% of new jobs. (GU) Nyní se podívejme na jedinečné kolokáty vsubkorpusu DM. Jedná se obenefit_noun (dávky_substantivum), blame_verb (obviňovat_verbum), eu_noun (EU_substantivum), flood_verb (zaplavit_verbum), influx_noun (příliv/nával_substantivum), let_ verb (nechat/dovolit_verbum), more_adjective (více_adjektivum),15 new_adjective (nový_adjektivum), pay_verb (platit_verbum), want_verb (chtít_verbum). Lze je rozdělit do tří hlavních skupin: na i) kontextové (eu_noun); ii) popisné/hodnoticí (flood_ verb, influx_noun, more_adjective, new_adjective, benefit_noun) aiii) orientované na činnost (blame_verb, pay_verb, want_verb, let_verb). Jediným kontextovým koloká15 Vangličtině je výraz more používán jako determinant, adverbium nebo zájmeno. Automatická analýza zde vrozporu skonvencí označuje prenominální výskyty more jako adjektiva. OPEN ACCESS
VÁCLAV BŘEZINA— PETR POŘÍZKA 55 tem je EU, má však vkontextu diskuse opřistěhovalectví často negativní konotace. Popisné/hodnoticí kolokace ukazují hlavní příběh diskuse: existuje velké množství nových přistěhovalců, kteří již ve Velké Británii jsou nebo se do Británie chystají; tito přistěhovalci berou podporu vnezaměstnanosti atd. Silně negativní výrazy jako flood (zaplavit) či influx (příliv) slouží ktomu, poukázat na souvislosti mezi přistěhovalectvím apřírodní katastrofou (viz př. 20–21). (20) Jobs, benefits and housing will all be given to amassive influx of immigrants. (DM) (21) Its no surprise that we are in this state, Labour desperately wanted aflood of immigrants into the country. (DM) Poslední skupina kolokátů je zaměřena vširokém smyslu na činnost— všechny tyto kolokáty jsou verbální. Vyskytují se vrůzných kontextech, ajak je patrno zpozic zobrazených vgrafu na obrázku 10, přistěhovalci jsou vtěchto spojeních syntaktickými podměty nebo předměty. Viz příklady tohoto aspektu diskuse níže: (22) Dont blame the immigrants, they are just after abetter quality of life. (DM) (23) … wait only when the country is completely over run will they learn, because the immigrants wont be paying any tax to fund the madness. (DM) (24) should Ipay council tax to fund immigrants to ruin our Country? (DM) (25) we don’t want or need anymore immigrants. (DM) (26) don’t let immigrants in to the country. (DM) 4. POTENCIÁL ALIMITACE TECHNIKY KOLOKAČNÍCH GRAFŮ ASÍTÍ Vzávěru studie je třeba zhodnotit, nebo přinejmenším tematizovat potenciál ipraktická omezení grafické vizualizace kolokací ve formě kolokačních grafů asítí. Obecně platí, že neexistuje žádný nástroj nebo metoda vyhovující všem výzkumným účelům. Ani autoři tohoto textu si nenárokují univerzálně platné avětšinové použití nástroje #LancsBox vkolokačních analýzách. Nicméně jsme přesvědčeni, že vizualizace kolokací má nesporný potenciál nového analytického vhledu, který je dán schopností výzkumníka nahlížet na kolokace komplexněji. Ačkoli všechny informace okolokacích lze prezentovat prostřednictvím tradičních kolokačních seznamů, ba dokonce ivelmi složitou kolokační síť lze nahradit řadou kolokačních tabulek se statistickými údaji— ty jsou ostatně kdispozici vnástroji #LancsBox vedle kolokačních grafů—, efektivní analýze propojení mezi různými lexikálními jednotkami vjazyce adiskur - su velmi napomáhá právě grafický formát (tj.vizualizace). Mimoto mohou grafy zobrazit více dimenzí kolokace současně, ato včetně pozice kolokace vtextu adiskursu, slovnědruhové příslušnosti afrekvence kolokátu— to vše navíc ksíle kolokace vyjádřené konkrétní asociační mírou. Kolokační sítě jsou tedy informačně bohaté amají vysoké data–ink ratio (Tufte, 2001), což je jedním zkritérií efektivní vizualizace. Užitečnost této techniky, prezentované ivtomto textu, byla prokázána mj.ipopularitou nástroje #LancsBox svíce než 50 tisíci uživateli ve více než 150 zemích po celém světě. OPEN ACCESS
56 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.1 #LancsBox se také stále častěji používá vpublikovaných výzkumech akonferenčních příspěvcích (vkvětnu 2021 uvádí Google Scholar přes 400 odkazů na tento nástroj). Uveďme pro ilustraci témata několika nedávných studií kdalším příkladům použití analytické techniky kolokačních grafů asítí: — analýza vulgárních slov na twitteru (Gauthier, 2021); — analýza jazyka, kterým se hovořilo oglobální pandemii během tříměsíčního období kontroly pohybu (lockdown) vMalajsii (Joharry— Turiman, 2020); — analýza jazyka emocí vbritských novinách vkontextu úsporných opatření (austerity) (Ha, 2020); — analýzy jazyka asexuality (Baker, 2018). Dále se #LancsBox avizualizace kolokačních sítí úspěšně používají vjazykové pedagogice. Například Liu (2020) ukázala, že metodický přístup DDL (data driven learning) snástrojem #LancsBox byl efektivní při zlepšování receptivních iproduktivních znalostí anglických kolokací učínských studentů. Postoje studentů navíc naznačovaly, že většina znich byla saplikací tohoto přístupu kučení kolokací spokojena. Podívejme se nyní na určitá omezení této techniky. Hlavním omezením je zobrazení kolokací vdvourozměrném prostoru (2D). Vzhledem kvelkému počtu uzlů akolokací může být graf snadno přeplněn, apak ztrácí schopnost jasně či přehledně zobrazit informace. Existují však techniky pro redukci tohoto problému (srov.Brezina et al., 2015). Tabulková forma prezentace dat nesporně nadále zůstává užitečným asvým způsobem nutným prostředkem pro interpretaci kolokací. Je důležité si ale uvědomit, že kolokační grafy asítě nejsou vkonkurenčním, ale doplňkovém vztahu ktradičním kolokačním seznamům. Lze rovněž zmínit, že jednotliví lingvisté budou pro analýzu kolokací dávat přednost rozličným analytickým technikám avyužívat různé nástroje idatabáze různých velikostí. Tuto rozmanitost vaplikaci korpusových metod anástrojů bychom měli přijmout jako pozitivní aspekt, který lze produktivně využít prostřednictvím triangulace (Baker— Egbert, 2016). 5. ZÁVĚR Hlavním cílem tohoto textu bylo představit korpusový nástroj #LancsBox atechniku dynamické vizuální kolokační analýzy. Zvláštní pozornost byla věnována teoretickému konceptu kolokačních grafů asítí imetodickým otázkám identifikace kolokace vkorpusech, zejména nastavení klíčových parametrů kolokační analýzy. Tyto parametry je možno systematicky zaznamenat pomocí notace CPN umožňující replikaci výsledků. Vzhledem komezenému rozsahu této studie však nebylo možno provést komplexní (hloubkové) analýzy, ale spíše prezentovat ailustrovat možnosti kolokačních grafů asítí při analýze lexikálních (či sémantických) vztahů mezi výrazy ve dvou případových studiích zoblasti lexikografie aanalýzy diskurzu na vybraných příkladech zangličtiny ačeštiny. OPEN ACCESS
VÁCLAV BŘEZINA— PETR POŘÍZKA 57 Budoucí výzkum by měl zahrnovat komplexnější kontrastivní (komparativní) analýzu kolokací včeštině aangličtině, detailněji charakterizující jazykové užití výrazů vtextu akontextu či diference chování výrazů vtěchto typologicky odlišných jazykových systémech. LITERATURA Baker, P. (2018): Language, sexuality and corpus linguistics: Concerns and future directions. Journal of Language and Sexuality, 7, 2, s.263–279. Baker, P. (2016): The shapes of collocation. International Journal of Corpus Linguistics, 21, 2, s.139–164. Baker, P. (2009): The BE06 Corpus of British English and recent language change. International journal of corpus linguistics, 14, 3, s.312–337. Baker, P.— Egbert, J. (eds.) (2016): Triangulating Methodological Approaches in Corpus Linguistic Research. New York: Routledge. Béjoint, H. (2016): Dictionaries for general users: history and development; current issues. In: P.Durkin (ed.), The Oxford handbook of lexicography. Oxford: Oxford University Press, s.7–24. Blinder, S.— Allen, W.L. (2016): Constructing immigrants: Portrayals of migrant groups in British national newspapers, 2010–2012. International Migration Review, 50, 1, s.3–40. Brezina, V. (2016): Collocation networks. In: P.Baker— J.Egbert (eds.), Triangulating Methodological Approaches in Corpus Linguistic Research. New York: Routledge, s.90–107. Brezina, V. (2018a): Statistics for corpus Linguistics: Apractical guide. Cambridge: Cambridge University Press. Brezina, V. (2018b): Collocation Graphs and Networks: Selected Applications. In: Lexical Collocation Analysis. Cham: Springer, s.59–83. Brezina, V.— Gablasova, D. (2018): The corpus method. In: J.Culpeper— P.Kerswill— R.Wodak— T.McEnery— F.Katamba (eds.), English Language: Description, Variation and Context. Second edition. Basingstoke: Palgrave Macmillan. Brezina, V.— McEnery, T.— Wattam, S. (2015): Collocations in context: Anew perspective on collocation networks. International Journal of Corpus Linguistics, 20, 2, s.139–173. Cope, B.— Kalantzis, M.— Magee, L. (2011): Towards asemantic web: Connecting knowledge in academic research. Oxford: Chandos. Council of Europe (2001): Common European Framework of Reference for Languages: Learning, teaching, assessment. Cambridge: Cambridge University Press. Cvrček, V.— Laubeová, Z.— Lukeš, D.— Poukarová, P.— Řehořková, A.— Zasina, A.J. (2020): Registry včeštině. Praha: Nakladatelství Lidové noviny. Čermák, F. (2006): Kolokace vlingvistice. In: F.Čermák— M.Šulc (eds.), Kolokace. Studie zkorpusové lingvistiky. Sv. 2. Praha: Nakladatelství Lidové noviny, s.9–16. Deignan, A. (2015): Figurative language and lexicography. International Handbook of Lexicography. Berlin, Germany: Springer. Evert, S. (2008): Corpora and collocations. Corpus linguistics. An international handbook, 2, s.1212–1248. Firth, J. (1957): Papers in Linguistics. Oxford: Oxford University Press. Gablasova, D.— Brezina, V.— McEnery, T. (2017a): Exploring learner language through corpora: Comparing and interpreting corpus frequency information. Language Learning, 67, S1, s.155–179. Gablasova, D.— Brezina, V.— McEnery, T. (2017b): Collocations in corpus-based language learning research: identifying, comparing and interpreting the evidence. Language Learning, 67, S1, s.130–154. OPEN ACCESS
58 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.1 Gablasova, D.— Brezina, V.— McEnery, T.— Boyd, E. (2017): Epistemic stance in spoken L2 English: The effect of task and speaker style. Applied Linguistics, 38, 5, s.613–637. Gabrielatos, C.— Baker, P. (2008): Fleeing, sneaking, flooding: Acorpus analysis of discursive constructions of refugees and asylum seekers in the UK press, 1996–2005. Journal of English linguistics, 36, 1, s.5–38. Gauthier, M. (2021): ‘Eww wtf, what adumb bitch’: acase study of similitudes inside gender-specific swearing patterns on Twitter. Corpora, 16, 1, s.31–61. Granger, S.— Paquot, M. (eds.) (2012): Electronic Lexicography. Oxford: OUP. Gries, S.T. (2013): 50-something years of work on collocations. International Journal of Corpus Linguistics, 18, 1, s.137–166. Gullick, D.— Rayson, P.— Mariani, J.— Piao, S.— Taiani, F. (2010): CONE: COllocational Network Explorer [software]. https://code.google.com/archive/p/collocationnetwork-explorer/ (cit.září 2020). Ha, F.W. (2020). Collocation and Emotions in the Context of Austerity in British Newspapers. In: T.Griebel— S.Evert— P.Heinrich (eds.), Multimodal Approaches to Media Discourses: Reconstructing the Age of Austerity in the United Kingdom. Abingdon: Routledge, s.88–109. Hanks, P. (2016): Definition. In: P.Durkin (ed.), The Oxford handbook of lexicography. Oxford: Oxford University Press, s.94–122. Hoffmannová, J.— Homoláč, J.— Chvalovská, E.— Jílková, L.— Kaderka,P.— Mareš, P., Mrázková, K. (2016): Stylistika mluvené apsané češtiny. Praha: Academia. Howarth, P. (1998): Phraseology and second language proficiency. Applied linguistics, 19, 1, s.24–44. Hunston, S. (2001): Colligation, lexis, pattern, and text. In: M.Scott— G.Thompson (eds.), Patterns of text: In honour of Michael Hoey. Amsterdam: John Benjamins, s.13–33. Church, K.W.— Hanks, P. (1990): Word association norms, mutual information, and lexicography. Computational Linguistics, 16, s.22–29 Joharry, S.A.— Turiman, S. (2020): Collocation Networks and Covid-19 in Letters to the Editor: AMalaysian Case Study. Asia Pacific Journal of Corpus Research, 1, 1, s.1–30. Karlík, P.— Nekula, M.— Rusínová, Z. (eds.) (1997): Příruční mluvnice češtiny. Praha— Brno: Nakladatelství Lidové noviny. Karlík, P.— Nekula, M.— Pleskalová, J. (eds.) (CzechEncy): Nový encyklopedický slovník češtiny online. Dostupné zwww: https://www. czechency.org/ Kilgarriff, A.— Rychlý, P.— Smrž, P.— Tugwell, D (2004): The Sketch Engine. Information Technology. Kilgarriff, A.— Kovář, V.— Krek, S.— Srdanović, I.— Tiberius, C. (2010): Aquantitative evaluation of word sketches. In: Proceedings of the 14th EURALEX International Congress. Afûk, Ljouwert: Fryske Akademy, s.372–79. Kilgarriff, A.— Baisa, V.— Bušta,J.— Jakubíček, M.— Kovář, V.— Michelfeit,J.— Rychlý, P.— Suchomel,V. (2014): The Sketch Engine: ten years on. Lexicography, 1, 1, s.7–36. KhosraviNik, M. (2009): The representation of refugees, asylum seekers and immigrants in British newspapers during the Balkan conflict (1999) and the British general election (2005). Discourse & Society, 20, 4, s.477–498. Křen, M. (2006): Kolokační míry ačeština: srovnání na datech ČNK. In: F.Čermák— M.Šulc (eds.): Kolokace. Praha: Nakladatelství Lidové noviny, s.223–248. Lakoff, G.— Johnson, M. (1980): Metaphors we live by. Chicago: University of Chicago Press. Lakoff, G.— Johnson, M. (2002): Metafory, kterými žijeme. Brno: Host. Liu, T. (2020): Evaluating the effect of data-driven learning (DDL) on the acquisition of academic collocations by Chinese learners of English (Doctoral dissertation, Lancaster University). McEnery, T. (2006): Swearing in English: Bad language, purity and power from 1586 to the present. London: Routledge. OPEN ACCESS
VÁCLAV BŘEZINA— PETR POŘÍZKA 59 McEnery, T.— Hardie, A. (2011): Corpus linguistics: Method, theory and practice. Cambridge: Cambridge University Press. McNair, B. (2009): News and Journalism in the UK. London: Routledge. Mluvnice češtiny [2]. Tvarosloví (1986). Praha: Academia. Murphy, L.M. (2016): Meaning Relations in Dictionaries: Hyponymy, meronymy, synonymy, antonymy, and contrast. In: P.Durkin (ed.), The Oxford handbook of lexicography. Oxford: Oxford University Press, s.94–122. Paquot, M. (2017): The phraseological dimension in interlanguage complexity research. Second Language Research, 35, 1, s.121–145. Pecina, P. (2010): Lexical association measures and collocation extraction. Language resources and evaluation, 44, 1, s.137–158. Phillips, M. (1985): Aspects of Text Structure: An Investigation of the Lexical Organisation of Text. Amsterdam, Netherlands: North-Holland. Pořízka, P. (2014): Tvorba korpusů avytěžování jazykových dat: metody, modely, nástroje. Olomouc: Vydavatelství FF UP. Rychlý, P. (2008): A lexicographer-friendly association score. In: P. Sojka – A. Horák (eds.), RASLAN 2008: Recent Advances in Slavonic Natural Language Processing, Brno: Masarykova Univerzita, s. 6–9. Sinclair, J.M. (1991): Corpus, Concordance, Collocation. Oxford: Oxford University Press. Tufte, E. (2001): Visual display of quantitative information. Cheshire, CT: Graphics Press. Williams, G. (1998): Collocational networks: Interlocking patterns of lexis in acorpus of plant biology research articles. International Journal of Corpus Linguistics, 3, 1, s.151–171. ZDROJE ANÁSTROJE Baker, P. (2006): British English 2006 (BE06). Dostupný z: https://cqpweb.lancs.ac.uk/ Brezina, V.— Weill-Tessier, P.— McEnery,A. (2020): #LancsBox (v. 5.1.2) [software]. Dostupný z: http://corpora.lancs.ac.uk/lancsbox Brezina, V. (2019): BNC2014 Baby +. Dostupný z#LancsBox: http://corpora.lancs.ac.uk/ lancsbox Pořízka, P. (2021): KFS— korpus funkčních stylů (v1.0). Olomouc. Dostupný z#LancsBox: http://corpora.lancs.ac.uk/lancsbox The Sketch Engine [software]. Dostupný z: https:// www.sketchengine.eu/ Křen, M.— Cvrček, V.— Čapka,T.— Čermáková, A.— Hnátková,M.— Chlumská, L.— Jelínek,T.— Kováříková,D.— Petkevič,V.— Procházka,P.— Skoumalová,H.— Škrabal, M.— Truneček, P.— Vondřička,P.— Zasina,A. (2015): SYN2015: reprezentativní korpus psané češtiny. Praha: Ústav Českého národního korpusu FF. Dostupný z: https://www.korpus. cz/kontext/query?corpname=syn2015 Václav Březina | Department of Linguistics and English Language, ESRC Centre for Corpus Approaches to Social Science, Faculty of Arts and Social Sciences, Lancaster University | Lancaster, United Kingdom LA1 4YL ORCID ID: 0000-0002-1613-6100 [email protected] Petr Pořízka | Katedra bohemistiky, Filozofická fakulta Univerzita Palackého | Křížkovského 10, 779 00 Olomouc ORCID ID: 0000-0001-6980-9148 [email protected] OPEN ACCESS