Kvantitativní určení lexikálního jádra jazyka
Abstract
9
Full text
ČASOPIS PRO MODERNÍ FILOLOGII 96, 2014, Č. 1, S. 9–26 issn 0008-7386 © filozofická fakulta, univerzita karlova v praze Kvantitativní určení lexikálního jádra jazyka1 Václav Cvrček (Praha) QUANTITATIVE DELIMITATION OF THE CORE OF ALANGUAGE The exploitation of hapax legomena, i.e. word or lemma types which occur in acorpus only once, is usually overlooked in language description. These types cannot be systematically used for avast majority of analyses as they do not provide abasis for any type of generalization. On the other hand, the overall number of hapaxes can be used as an indicator of the lexical periphery of the language system. This paper suggests that the ratio between the number of hapaxes and the number of all types in relation to the growing corpus size (hapax-type ratio, HTR) can be used for delimitation of the lexical core of alanguage. It has been shown by previous research (Fengxiang 2010) that HTR in English has the shape of apipe or chibouque, which means that the rates of the emergence of new hapaxes and new types in the process of building acorpus differ before and after reaching acertain size. In ahypothetical small corpus (afew sentences) the hapax-type ratio will be equal to one (each wordtype is also ahapax). As texts are added to the corpus (up to afew million words), the hapax-type ratio decreases (the number of new words including hapaxes is continuously increasing but the majority of added tokens are new instances of words already present in the corpus) from its maximal value (=1) to alocal minimum. After reaching this turning point, extending the corpus increases the ratio because the number of hapaxes grows at afaster pace than the number of non-hapaxes (i.e. types with afrequency higher than one). This empirical finding tested on corpora of Czech and English brings us closer to the exact determination of the range of the core lexicon. Subsequently, we can deduce the approximate size of acorpus sufficient for compiling adictionary that covers the core lexicon. KEYWORDS corpus, quantitative linguistics, hapax legomenon, lexicon, token-type ratio KLÍČOVÁ SLOVA korpus, kvantitativní lingvistika, hapax legomenon, lexikon, token-type poměr 1. ÚVOD Vymezení toho, co můžeme považovat za jádro jazyka, je zásadní metodologická otázka nejen pro lingvistiku, ale také pro valnou část jejích aplikací jako je např. výuka nebo počítačové zpracování jazyka (NLP). Jedním zprvních výrazů snahy vyčlenit minimální objem jazykových elementů schopných pokrýt maximum komunikace je koncept tzv. Basic English (Ogden, 1930; Crystal, 1997, s. 358). Právě vtomto průkopnickém pokusu se ukázalo, že frekvence jevů (vtomto případě slov) musí hrát ve všech podobných snahách zásadní úlohu, což ostatně demonstrovali později svými 1 Tato studie vznikla vrámci Programu rozvoje vědních oblastí na Univerzitě Karlově č. P11 Český národní korpus, podprogram Český národní korpus.
10 ČASOPIS PRO MODERNÍ FILOLOGII 96, 2014, Č. 1 pracemi idalší badatelé (textové pokrytí jevů různé frekvence vangličtině sumarizují např. Francis— Kučera, 1982, nebo Waring— Nation, 1997). Lingvistická motivace pro upřesnění velikosti jádra jazyka vychází vpodstatě ze snahy zjistit, jaký rozsah popisu je přiměřený pro jazyk, který je (na rozdíl od praktických možností jakékoli deskripce) alespoň ve své potencialitě nekonečný. Vědomě nebo podvědomě vycházíme ztoho, že existuje jakási konečná množina prostředků, jejímž popisem zachytíme valnou většinu relevantních rysů daného subsystému jazyka ajejíž rozsah musí být kognitivně přiměřený, aby vůbec mohl být většinou mluvčích internalizován avyužíván. Korpusový výzkum jazyka je založen na předpokladu, že rozsáhlé areprezentativní vzorky jazyka věrně reflektují jazykovou realitu kolem nás (resp. že ji zkreslují ze všech dostupných metod nejméně). Vpřípadě lexikografie, okterou půjde vnašem příspěvku především, se domníváme, že nespecializovaný korpus je vedle informací operiferních jednotkách, které jsou kusé anesoustavné, dostatečným zdrojem dat ojádře slovní zásoby. Tradičním zdrojem informací opodobě slovní zásoby jsou slovníky. Srovnáme-li je ovšem skorpusy, zjistíme, že relativně často ve slovnících důležitá hesla nenacházíme (rozhodně častěji, než zjišťujeme vkorpusech absenci slov ve slovníku uvedených). Tyto rozdíly nepramení pouze znáhodných opomenutí na straně slovníkářů nebo zmálo precizního designu korpusů, což může vést kjejich nereprezentativnosti; na vině je zde vmnoha případech rozdílný přístup ktomu, co za jádrový prostředek považovat aco ne, tj. kde vést dělicí čáru mezi centrem aperiférií voblasti lexikonu. Je přitom zjevné, že ojádru lze uvažovat vsouvislosti srůznými kritérii. Jádro je možné vymezovat sohledem na systémovost, resp. anomálnost, tedy pomocí pojmů pražské školy jako centrum aperiférie (srov. Daneš, 1965; Čermák, 2011, s. 115), nebo prizmatem úzu, tedy co je běžné aco je neobvyklé. Zdalších vymezení je možné zmínit dělení sociolingvistické adialektologické, která vydělují části jazyka společné všem skupinám mluvčích (ať už je vymezujeme podle věku, pohlaví, vzdělání, profese nebo jinak) avšem nářečním oblastem vprotikladu kprostředkům sociálně či regionálně specifickým. Zde se zaměříme zplejády nastíněných možností na jádro vymezené frekvenčně, ato na úrovni lexikonu (přesněji na rovině jednoslovných lexémů). Frekvence jevu se přitom, jak víme, se systémovostí nemusí krýt (ačasto nekryje, srov. nesystémové vysoce frekventované jevy jako flexi slov být, člověk, rok; stupňovaní velký, dobře apod.). Didaktický pohled na celou problematiku (Waring— Nation, 1997; Laufer, 2010) zdůrazňuje perspektivu uživatele (zejména nerodilého mluvčího). Pohled ryze technický představují NLP aplikace, které definují jádro jazyka jako množinu prostředků, které je možné použít bez ohledu na jejich textové okolí (Zhang— Huang— Yu, 2004, s. 1121). Jelikož cílem tohoto textu je vymezit jádro pro účely lingvistického popisu, je třeba zformulovat definici vlastní. Vní lexikální jádro jazyka nepředstavuje nejmenší možnou skupinu prostředků, které jsou schopné naplňovat základní komunikační cíle, ale tu část jazyka, která by měla být popsána menším nebo středním slovníkem jazyka tak, abychom ho mohli považovat za deskriptivně přiměřený. Řádově se tedy pohybujeme mezi tisíci adesetitisíci jednotkami. Cílem výzkumu je proto najít lingvisticky opodstatněnou hranici mezi jevy jádrovými aperiferními, která by byla
VáCLAV CVRČEk 11 využitelná při popisu jazyka aumožňovala omezit rozsah lingvistických popisů při zachování jeho relativní úplnosti. Takováto definice přísnějšího čtenáře nemůže uspokojit, protože je jen velmi obtížně operacionalizovatelná. Cílem tohoto článku nicméně není podat teoretickou definici jádra jazyka, ale poukázat na empiricky doložitelný fakt systémového předělu mezi jednotkami různé frekvence, kterému lze přidělit interpretaci delimitátora jádra jazyka akterý by byl použitelný při konstruování budoucích slovníků ikorpusů.2 Je třeba si také uvědomit, že lexikální jádro jazyka odkazuje jak kformální stránce jednotek, tak kjejich významu. Vtomto příspěvku se zaměříme na formu, protože zjišťovat jádro sémantické je současnými nástroji velmi obtížné nebo dokonce nemožné. Měření budou prováděna jak na slovních tvarech, tak na lemmatech (základních slovníkových tvarech) ato především zdůvodu lepší porovnatelnosti výsledků mezi různými jazyky (snestejnou mírou flexe), ale také pro snazší srovnání těchto dvou druhů jednotek ajimi vymezených množin jádrových prostředků. Slovem tedy vtomto příspěvku rozumíme grafickou formální jednotku souvislého textu (shluk písmen oddělený zobou stran mezerami), která může mít podobu tvaru nebo lemmatu. 2. INTUITIVNÍ VYMEZENÍ JÁDRA JAZYKA Intuitivně bychom za lexikální jádro jazyka mohli považovat ty prostředky, které se vyskytují ve všech textech (nebo ve většině textů) daného korpusu, příp. ty, které užívá majorita autorů nebo mluvčích. Výsledky měření založené na těchto premisách jsou však překvapující. Ve stomilionovém korpusu angličtiny BNC je 4049 textů (nebo vzorků textů).3 Pouze jediné „slovo“ však najdeme ve všech těchto textech, ato je tečka (.), která vkorpusovém designu běžně získává samostatnou pozici jako kterékoli jiné grafické slovo. Přirozenou námitkou proti takovémuto postupu může být poukaz na to, že některé texty vBNC jsou příliš krátké. Zaměříme-li se na texty sdélkou více než 1000 slov (tokenů), zjistíme, že vtakto vymezených 3828 textech najdeme pouze 58 společných slov. Pokud omezíme výběr zkoumaných textů ještě více aprozkoumáme pouze ty, jejichž délka přesahuje hranici 10 000 slov, najdeme ve 2706 textech jenom 432 průnikových slov. Nahlíženo zjiné strany můžeme konstatovat, že přesně 951 slov se vyskytuje ve více než 50 % textů korpusu BNC. Situace včeštině je obdobná. Vrovněž stomilionovém korpusu SYN2010, který je svým designem zčásti podobný anglickému BNC, najdeme vrůzných textových typech celkem 2646 textů. Vkaždém znich po vyloučení interpunkce objevíme pouze 9 společných slov: a, být, na, s, se, ten, v, z, za. Ve všech textech sminimální velikostí 5000 tokenů najdeme pouze 22 slov ajenom 2126 slov se vyskytuje alespoň vpolovině textů celého korpusu. 2 Vztah rozsahu korpusu, který má být základem pro slovník, arozsahu tohoto slovníku je přitom zřejmý. 3 Vrámci korpusu BNC se vzájmu větší pestrosti textů objevují ineúplné části textů (maximální délka textu nebo jeho části je 45 tisíc tokenů).
12 ČASOPIS PRO MODERNÍ FILOLOGII 96, 2014, Č. 1 Je zjevné, že takto vymezené jádro jazyka neodpovídá ani vzdáleně potřebám lexikografické praxe. Je třeba počítat stím, že jádro zahrnuje minimálně všechna slova synsémantická (což jsou desítky až stovky slov) azákladní autosémantika (stovky, spíše však tisíce slov). Vsoučtu je možné očekávat, že cílovým řádem pro určení jádra jazyka jsou tisíce, spíše však desetitisíce lexémů (což rámcově odpovídá výše zmíněnému rozsahu středního slovníku). Ztoho je zřejmé, že rozsah jádra, ojehož vymezení se vtomto příspěvku pokoušíme, se výrazně odlišuje od rozsahu výběru jednotek, který je určován pedagogickými potřebami. Ogdenova Basic English ve svém původním návrhu zahrnovala 850 slov (Ogden, 1930). Můžeme tedy spekulovat odvou různých vymezeních— jádro určené sohledem na co nejmenší rozsah nutný kporozumění akprodukci ajádro vymezené pozorováním úzu adistribucí elementů vněm. Druhý zmíněný pohled na lexikální jádro, který bude výchozí pro další úvahy, je založen na následujících předpokladech. Každý text obsahuje prvky, které je možné považovat z hlediska celého jazyka za jádrové, aprvky periferní, které jsou specifické zmnoha příčin: zásadní je vliv autora ajeho idiolektu, úzká vazba na žánr, komunikační situaci nebo téma textu či diachronní aspekt (archaismy aneologismy). Předpokládáme přitom, že každý text má svoje specifická slova, zatímco slova jádrová jsou více méně společná všem textům (ačkoli se— jak jsme viděli výše— ve všech textech nemusí realizovat). Jinými slovy, lexikální inventář dvou textů se bude lišit mnohem pravděpodobněji velementech periferních než vjednotkách jádrových (tato úvaha už nemusí platit ocelcích, které jsou menší než text— odstavcích, větách apod., unich je pravděpodobná odlišnost jak vperiferních, tak vjádrových jevech, podrobněji viz níže). Pro účely vymezení jádra jazyka je vtomto příspěvku využit poměr hapaxů ktypům (tzv. hapax-type ratio, dále HTR). Pro lepší orientaci vtextu ipro sjednocení terminologie je dobré zopakovat jinak obecně známé definice použitých termínů. Kaž - dý výskyt slovního tvaru nebo lemmatu vkorpusu se nazývá token (říkáme např. že vkorpusu BNC je 111 milionů tokenů, tj. včetně interpunkce). Tokeny značíme podle notace zavedené např. vpublikaci H. Baayena (2001) písmenem N. Pokud nepočítáme jednotlivé realizace, ale pouze různá slova, mluvíme otypech (korpus SYN2010 při 121 milionech tokenech obsahuje 1,7 mil. typů slovních tvarů a786 tisíc typů lemmat). Jejich celkový počet při dané velikosti textu se značí V(N). Typ je specifická abstrakce nad textem, jedná se ojednotku languovou, která nabývá vlastností, jako je frekvence, aje ve své podstatě dekontextualizovaná (Cvrček, 2013). Typem můžou být jednotky různé úrovně; slovní tvar school tak má vBNC 29 410 výskytů (tokenů), zatímco lemma school (zahrnující tvary school, School, schools ad.) se vyskytuje sfrekvencí 52 471 tokenů. Poslední pojem— hapax (zřec. hapax legomenon, tedy „jednou řečené“)— označuje takové typy, které se vtextu nebo korpusu vyskytují právě jednou. Jejich celkový počet vtextu odélce N tokenů se značí V(1,N) aplatí, že suma všech typů je rovna počtu hapaxů aslov sfrekvencí vyšší než jedna. Hapaxy většinou nejsou vcentru pozornosti lingvistů, protože jejich využitelnost vběžných analýzách je minimálně sporná. Je-li kdispozici pouze jediný doklad daného typu (ať už jde oslovo nebo jev jiného druhu), je velmi obtížné na takovém základě provádět jakákoli zobecnění, zjišťovat jejich význam, funkci, typické užití nebo kontext. Jejich význam tkví zejména vjejich vztahu kcelkové distribuci typů vtextu nebo korpusu (viz např. Good-Tu-
VáCLAV CVRČEk 13 ringův odhad užívaný jako aproximace produktivity, Baayen, 2001, s. 57, aCvrček— Vondřička, 2013 apod.). Vkaždém textu je přitom hapaxů značné množství. Např. včeském překladu románu U. Eca Jméno růže od Z. Frýborta ocelkové délce 195 tisíc tokenů je zhruba 29 tisíc různých slovních tvarů. Ztoho přes 17 tisíc (zhruba 59,7 %) připadá na hapaxy. 3. VYMEZENÍ JÁDRA NA ZÁKLADĚ KORPUSOVÝCH DAT Myšlenková konstrukce pokusu použitá pro kvantitativní určení lexikálního jádra simuluje postup při budování korpusu, vjehož průběhu měříme poměr počtu hapaxů ke všem typům (HTR). Pro názornost si můžeme celý přístup ukázat na textu povídky K. Čapka Povětroň. Představme si, že se jedná oprvní text budovaného korpusu apo přidání každé věty budeme zjišťovat aktuální stav počtu typů ahapaxů: Prudký vítr ohýbá vnárazech stromy vnemocniční zahradě. Po přidání první věty, která obsahuje 10 tokenů (tečka na konci je vrámci tokenizace korpusů považována za zvláštní pozici), obsahuje náš korpus 9 různých typů (předložka vse opakuje dvakrát), atudíž 8 hapaxů; index HTR tedy začíná na hodnotě 8/9 = 0,89. Se zvětšováním korpusu odalší věty vtextu se hodnoty začínají měnit (viz tab. 1).4 Text/Korpus N V(N) V(1,N) HTR 1Prudký vítr ohýbá vnárazech stromy vnemocniční zahradě. 10 9 8 0,89 2Apokaždé se ty stromy tak hrozně rozčílí, uvádí je to vzoufalství, zmítají sebou jako zástup vpanice; 32 27 24 0,89 3nyní se zastavují atřesou se, to nás to prohnalo, tiše, neslyšíte nic? 49 37 32 0,86 4Běžme, běžme, už je to tu zas. 59 42 35 0,83 5Mladý člověk vbílém plášti se klackuje zahradou akouří si cigaretu. 72 51 43 0,84 6Patrně mladý doktor; 76 54 45 0,83 7vítr mu cuchá mladé vlasy abílý plášť pleská ve větru jako prapor. 90 64 53 0,828 8Jen si rvi acuchej, divoký větře; 99 69 57 0,826 tabulka 1: Přírůstek typů, hapaxů azměna HTR spřibývajícím textem (zdroj: K. Čapek— Povětroň). Vidíme, že po přidání druhé věty se HTR nemění (poměr hapaxů atypů zůstává stejný, ačkoli jejich absolutní hodnoty vzrostly). Spostupným růstem korpusu ale můžeme sledovat mírný pokles HTR, který je způsoben tím, že se běžná slova začínají opakovat (každé slovo— ito sebefrekventovanější— je při prvním vstupu do korpusu hapaxem, ale pak se velmi rychle zařazuje mezi slova sfrekvencí vyšší5). Ačkoli 4 Segmentace na věty vychází zprocesu automatické tokenizace korpusů řady SYN. 5 Pro jednotky sfrekvencí vyšší než 1 budeme vdalším textu používat alternativní zkrácené označení „nehapax“.
14 ČASOPIS PRO MODERNÍ FILOLOGII 96, 2014, Č. 1 tedy počet typů ihapaxů neustále roste, hodnota HTR klesá, což značí, že počet hapaxů neroste tak rychle jako počet nehapaxů. Na druhé straně do korpusu postupně přibývají slova, která jsou poměrně vzácná apokud se objeví, zůstávají na nejnižší možné frekvenční hladině, tj. zůstávají hapaxem. To by mohl být příklad slovního tvaru cuchej vposlední větě ukázky, který se vyskytuje iv1,3 miliardovém korpusu SYN pouze jednou, ato právě vtéto větě z Čapkovy povídky. Hodnoty samozřejmě výrazně ovlivňuje podoba zkoumaných jednotek. Vtomto ukázkovém případě jsme se zaměřili na slovní tvary, jiné výsledky bychom získali měřením na lemmatech, které mají po mnoha stránkách klexémům, okteré při určování lexikálního jádra jde především, samozřejmě blíž. Stejně tak je třeba odlišovat hodnoty naměřené při nastavení case-insensitive (tj. bez rozlišování velikostí písmen) acase-sensitive, což je použité nastavení všech pokusů prezentovaných zde idále. Vpředkorpusové éře (nebo vdobách, kdy korpusy dosahovaly jen velmi malých rozsahů) by lingvisté pravděpodobně předpokládali, že trend poklesu HTR bude setrvalý austálí se okolo hladiny, která zhruba odpovídá podílu hapaxů ke všem typům vcelém lexikonu. To by znamenalo, že graf vývoje HTR by měl podobu zhruba pís0.0e+00 2.0e+07 4.0e+07 6.0e+07 8.0e+07 1.0e+08 1.2e+08 0.44 0.46 0.48 0.50 0.52 0.54 HTR v korpusech SYN2010 a BNC (lemmata) Tokeny HTR SYN2010 BNC graf 1: Poměr počtu hapaxů kpočtu typů (lemmat) vkorpusech SYN2010 aBNC. Hodnoty jsou výsledkem průměru 60 nezávislých náhodných sestavení textů vkorpusech. Hodnoty na vodorovné ose označující velikost korpusu (N) mají formát exponenciálního čísla— např. 2.0e+07 tedy značí 2× 107, tj. 20mil. tokenů.
VáCLAV CVRČEk 15 mene „L“. Výsledky měření na rozsáhlém korpusu ovšem ukazují něco jiného. Graf 1 prezentuje hodnoty naměřené na korpusech SYN2010 aBNC. Abychom eliminovali vliv pořadí dokumentů (opusů) vkorpusu, vytvořili jsme šedesát nezávislých náhodných pořadí textů vobou korpusech avýsledky na nich naměřené zprůměrovali. HTR vgrafu 1 byl vypočítán zmnožství typů ahapaxů lemmat. Trend, který můžeme zgrafu 1 vyčíst, odpovídá tomu, že na počátku sestavování hypotetického korpusu je HTR nejvyšší (poměr je velmi blízký jedné, protože dokud je korpus velmi malý, objevuje se každé slovo pouze jednou, tzn. že každý typ je zároveň hapaxem).6 HTR následně velmi rychle klesá, až dosáhne po přidání několika milionů slov hodnoty nejnižší (lokální minimum). Toto minimum má vpřípadě českých lemmat hodnotu 0,4284 aobjevuje se v korpusu po dosažení velikosti zhruba 2,8 mil. tokenů; vprůměru to odpovídá 85 026 různým lemmatům a36 443 hapaxům. Vangličtině je lokální minimum posazeno výš, což souvisí sjejí odlišnou typologickou charakteristikou amá hodnotu 0,4626. Nastává při velikosti korpusu zhruba 0,8 mil. tokenů, což odpovídá vprůměru 30 519 různým lemmatům a14 147 hapaxům. Od tohoto okamžiku, kdy graf dosahuje lokálního minima, se spřidáváním dalších textů HTR opět zvyšuje (ikdyž trend je zde opoznání pomalejší než při poklesu vprvní fázi). Vysvětlení klesavě-stoupavé podoby charakteristiky HTR podobné dýmce souvisí stím, jaká slova ajakým tempem vkteré fázi do korpusu přibývají. Po celou dobu budování korpusu přibývají jak nová slova, tak hapaxy. Ve fázi poklesu hodnoty HTR se světší intenzitou projevuje přírůstek nových instancí slov vkorpusu už obsažených, zatímco ve fázi navazující za lokálním minimem podíl hapaxů roste rychleji než podíl nehapaxů, tedy proces přeměny hapaxů vtypy svyšší frekvencí než jedna se významně zpomaluje. Kpodobným výsledkům dospěl na jiných anglických datech např. Fengxiang, 2010. Ijeho grafy HTR vykazovaly specifický tvar, ke kterému budeme vnásledujícím textu odkazovat jako k„pipe-chart“. Odlišnost jeho přístupu kcelé problematice netkví vrozdílných výsledcích, ale vinterpretaci, jakou tomuto fenoménu přiřkl. Zatímco zde je průběh HTR využíván vsouvislosti surčením rozsahu lexikálního jádra, přístup aplikovaný ve Fengxiang (2010) slouží zejména koptimální konstrukci korpusů anástrojů pro účely NLP. Podobné grafy můžeme zkonstruovat pro různé jednotky; při porovnání HTR měřeného na anglických lemmatech aslovních tvarech můžeme sledovat některé odlišnosti. První znich je zvýšená hodnota HTR vcelém průběhu křivky zobrazující hodnoty pro lemmata, která je vysvětlitelná rozdílnou mohutností inventáře lemmat aslovních tvarů, což se projevuje ina jazyce stak chudou flexí, jako je angličtina. Druhou odlišností je umístění lokálního minima, které je nepatrně vzdálenější od počátku souřadné soustavy vpřípadě tvarů než ulemmat (viz graf 2). Za připomínku stojí skutečnost, že tento fenomén neintuitivního průběhu HTR nebyl pozorovatelný ještě vdobě vzniku prvních korpusů. Např. Brown korpus (Kučera— Francis, 1964), který obsahoval 1 milion slov, nebyl schopen oněm po6 Měření HTR probíhalo po úsecích ovelikosti 100 tisíc tokenů. Ztoho důvodu křivka HTR nezačíná na hodnotě jedna, ale níž, okolo 0.5.
16 ČASOPIS PRO MODERNÍ FILOLOGII 96, 2014, Č. 1 dat svědectví, protože bod zvratu je pozorovatelný až při mnohonásobně větších datech (nejde jen opozici lokálního minima, ale také ozjištění, že následná tendence je dlouhodobě rostoucí). Zároveň je třeba připomenout, že ani kvantitativní lingvistika nepředpokládala, že by existoval indikátor, který by měl vzávislosti na velikosti textu či korpusu takto proměnlivé tendence (type-token poměr nebo hapax-token poměr vykazují stabilně rostoucí tendence beze změny trendu na celých datech). Samotný bod zlomu (lokální minimum HTR) může být vysvětlen pomocí distinkce dvou typů periferních jednotek:7 hapaxy dočasné, tj. ty, jejichž frekvence je jednotková vjednom textu nebo korpusu, ale zvětšením zkoumaného materiálu odalší text by se velmi pravděpodobně zvýšila ijejich frekvence, ahapaxy permanentní, tj. ty, které jsou zhlediska jazyka skutečnou periférií. Hapaxy dočasné jsou tedy periferní pouze vurčitém okruhu textů (např. lexém sírový se objevuje právě jednou vrománu L. Fukse Vévodkyně akuchařka, vodborných žánrech je ale jinak celkem běžný), naproti tomu hapaxy permanentní jsou periferní vcelé zkoumané populaci (např. lexém sítkovice se vcelém korpusu SYN2010 objevuje pouze jednou vodborném textu Kniha omedovině od L. Dupala). Zatímco existence dočasných ha7 Mohli bychom vtéto souvislosti uvažovat také orůzných stupních perifernosti jednotek. graf 2: HTR měřený na anglických lemmatech (plná čára) aslovních tvarech (čárkovaně) vBNC (počet náhodných sestavení korpusu byl vobou případech šedesát). 0e+00 2e+07 4e+07 6e+07 8e+07 1e+08 0.46 0.48 0.50 0.52 0.54 HTR v korpusu BNC Tokeny HTR Lemmata Tvary
VáCLAV CVRČEk 17 paxů je tedy důsledkem nedostatečné velikosti zkoumaného vzorku jazyka, permanentní hapaxy představují jevy řídké vcelé populaci jazykových projevů. Lokální minimum vgrafu HTR vzniká tedy vmomentě budování korpusu, kdy drtivá většina dočasných hapaxů je vněm už obsažená asnovými přírůstky textů se pouze zvyšuje jejich frekvence azároveň narůstá počet hapaxů permanentních. Jelikož právě oodlišení těchto dvou typů periferních jednotek při určení rozsahu jádra lexikonu jde, můžeme lokální minimum anáslednou změnu trendu považovat za vhodnou aproximaci toho, jaký rozsah jádro má. Vtéto souvislosti je třeba zmínit, že při vymezování jádra lemmat hraje určitou roli použitý analyzátor textů (lemmatizátor). Vpřípadě běžných slov je lemmatem základní slovníkový tvar (tvarům kůň, koně, koním atp. je přiřazeno lemma kůň). Vpřípadě slov, která analyzátor nerozpozná, je lemmatem tvar samotný; to je ipřípad tvaru numulitových vkorpusu SYN2010, kterému by mělo být přiřazeno lemma numulitový, jež ovšem není obsaženo ve slovníku analyzátoru, atudíž je jako lemma uvýskytu tohoto tvaru uvedena forma numulitových. Pokud by došlo kidentifikaci všech tvarů adjektiva numulitový, zjistili bychom, že celková frekvence tohoto lemmatu by měla být 2 (vedle tvaru numulitových se objevuje itvar numulitové). Ačkoli se zmiňované adjektivum objevuje vkorpusu ve 2 tvarech, lemma numulitový nikdy nepřejde zkategorie hapaxů do kategorie nehapaxů, protože je nekorektně rozděleno mezi dvě lemmata. Situace včeštině je vobecných rysech podobná angličtině, pouze stou odlišností, že rozdíl vmohutnosti inventáře lemmat aslovních tvarů je nepoměrně větší; zatímco vangličtině je podle BNC poměr počtu různých slovních tvarů kpočtu různých lemmat zhruba 1,07 (776 tisíc : 722 tisíc), včeštině je podle korpusu SYN2010 tento poměr 2,17 (1706 tisíc : 786 tisíc).8 Ztoho důvodu může křivka reprezentující slovní tvary působit jako konstantní (nerostoucí ani neklesající), nicméně její trend vdruhé půlce je objektivně rostoucí, ačkoli to zgrafu nemusí být na první pohled patrné. Jistý rozdíl může působit také rozdílná diversita dat vkorpusech SYN2010 aBNC. Zatímco vanglickém BNC jsou zařazeny texty smaximální délkou 45 tisíc slov (vpřípadě, že zdrojový text byl delší, byla do korpusu vtělena pouze jeho část), při budování českého korpusu SYN2010 takové omezení aplikováno nebylo, což vede kponěkud hladšímu průběhu křivky (viz graf 3). Můžeme konstatovat, že přes nesporné typologické rozdíly mezi zkoumanými jazyky (orientační, nepublikované výsledky na korpusu současné italštiny vykazují obdobné vlastnosti), nacházíme ve všech případech shodnou tendenci kproměně průběhu funkce HTR zklesající vrostoucí. Vpřípadě obou jazyků byl vliv pořadí textů vyrušen jejich opakovaným náhodným výběrem anásledným průměrováním výsledků. Zároveň se ve shodě sintuicí ukazuje, že pro různé jednotky (lemmata vs. slovní tvary) vymezují grafy HTR různě rozsáhlé množiny jádrových forem. 8 Takováto statistika je přirozeně zkreslující, protože např. lemma scelkovou frekvencí 5výskytů nemůže mít víc než 5 různých slovních forem. Problematice objektivnějšího vyjádření míry flexe se věnuje oddíl 4 tohoto článku.
24 ČASOPIS PRO MODERNÍ FILOLOGII 96, 2014, Č. 1 hodnota (po dosažení 100 tisíc tokenů) kvůli relativně nízké variabilitě typů zhruba okolo 0,513, vpřípadě vzorkování po jednotlivých tokenech je to při stejné velikosti korpusu 0,619. Ito je způsobeno tím, že každý text je vždy zhlediska použitého slovníku (počtu typů) homogennější než náhodný vzorek slov nebo vět ostejné délce. Situace vangličtině (viz graf 5) je analogická české stím, že její výsledky vpřípadě vzorkování po tokenech ipo větách připomínají matematický model ještě víc než data zčeštiny. Odlišnosti mezi českými aanglickými výsledky můžeme přičíst na vrub jednak morfologické bohatosti acelkové variabilitě forem včeštině. Zatímco vangličtině je většina variability odvozena zlexikonu (rozdílné formy prezentují povětšinou rozdílné významy), včeštině za variabilitou repertoáru forem stojí morfologie. Specifické způsoby derivace, které jsou využívány zřídka, způsobují, že lemmata takto vytvořená jen obtížně překračují hranici dvou výskytů, což je tendence, která vangličtině nepůsobí zdaleka tak silně. 7. ZÁVĚRY Neintuitivní průběh HTR na datech rozsáhlých korpusů vyjevuje mnoho podstatných informací ojazyce akorpusech; nejpodstatnější znich je zřejmě demarkační linie (lokální minimum HTR), která by mohla být empiricky založeným vodítkem pro stanovení rozsahu jádra lexikonu. Je přitom třeba zdůraznit, že pokus popsaný výše není schopen odhalit, které prostředky za jádrové považovat akteré ne, ale pouze poukázat na rozsah centrálních jevů vlexikonu. Složení tohoto jádra je třeba odhalovat jinými metodami; jeví se přitom jako velmi pravděpodobné, že frekvence, příp. jiné, sofistikovanější ukazatele četnosti jako ARF (Savický— Hlaváčová, 2002), budou vtěchto oblastech hrát zásadní úlohu. Vymezení rozsahu jádra je také prvním krokem při úvahách ovelikosti korpusu, který je potřebný pro řešení různých druhů výzkumných úkolů. Pokud bychom se rozhodli sestavit korpus, který bude obsahovat všechny jádrové prostředky (jistotu mít nikdy nelze, ale svelkou pravděpodobností), musíme počítat snásobky rozsahu jádra. Pokud vymezíme jádro jako 85 tisíc nejfrekventovanějších českých lemmat, které jsou obsaženy už vkorpusu ovelikosti zhruba 3 mil. tokenů, musíme počítat sminimální velikostí korpusu alespoň 30krát (spíše však 100krát) větší, abychom tyto jádrové prostředky mohli srozumnou mírou jistoty analyzovat apopsat. Tvar HTR funkce (pipe-chart) zároveň naznačuje, že existují dosud neprozkoumané rozdíly mezi textem ajazykem. Pokud existují fenomény, jejichž trend se spřekročením určité hranice délky textu rapidně mění, je třeba vtomto světle revidovat iněkteré závěry kvantitativní lingvistiky. Výsledky měření, které jsou provedeny na nedostatečně rozsáhlých datech, můžou být tímto fenoménem ovlivněny, anejsou tedy schopné vypovídat ocelém jazyce, ale pouze otextech, na nichž bylo měření prováděno. Výsledky uvedených měření bychom proto sjistou mírou nadsázky mohli interpretovat jako specifický případ distinkce parole-langue. Klesající část grafu HTR by odpovídala vlastnostem textů, zatímco část rostoucí vypovídá ocelém jazyce (langue)
VáCLAV CVRČEk 25 nebo nějaké jeho části (představuje totiž vlastnosti korpusu, který je natolik rozsáhlý, že eliminuje idiosynkrazie jednotlivých autorů nebo textů). Zatímco úvodní hodnoty HTR reflektují vlastnosti textů, na nichž je měřen, hodnoty ke konci definičního oboru představují vlastnosti jazyka, zejména podíl jádrových aperiferních jednotek. Při srovnávání češtiny aangličtiny se potvrdila očekávaná typologická rozdílnost jazyků ajednotek vněm obsažených. Navržený koeficient flexe, který zohledňuje pouze jádrové prostředky (lemmata islovní tvary) by mohl sloužit jako základ pro efektivní kvantitativní srovnávání jazyků. Je přitom třeba znovu připomenout, že průzkum zahrnující pouze jednotlivá slova (anikoli víceslovné jednotky) je do značné míry zplošťující. Jelikož je ovšem repertoár bigramů či trigramů slov mnohonásobně větší než množina jednotlivých slov, bude třeba do zkoumání těchto jevů zapojit rozsáhlejší korpusy než SYN2010 aBNC. Specifický průběh HTR, který je závislý na dosažení určité nemalé hodnoty rozsahu korpusu, nás zároveň upozorňuje na důležitý aspekt celé problematiky kvantitativního akorpusového zkoumání jazyka. Při formulování závěrů bychom se zvýšenou pečlivostí měli dbát na to, abychom se vyjadřovali pouze otěch aspektech aoblastech jazyka, které jsme skutečně schopni pozorovat auchopovat. Ve světle předložených zjištění bychom neměli zapomínat na to, že budoucí korpusy, které svým rozsahem mnohonásobně předčí to, sčím můžeme pracovat dnes, můžou vypovídat ofenoménech, které si vsoučasnosti nejsme schopni ani představit. POUŽITÉ KORPUSY The British National Corpus, version 3 (BNC XML Edition). 2007. Distributed by Oxford University Computing Services on behalf of the BNC Consortium. Dostupný z: http://www.natcorp.ox.ac.uk/ Czech National Corpus— SYN2010. Institute of the Czech National Corpus FF UK, Praha 2010. Dostupný z: <http://www.korpus.cz>. LITERATURA Baayen, H. R. (2001): Word Frequency Distributions. Dordrecht/Boston/London: Kluwer Academic Publishers. Cvrček, V. (2013): Kvantitativní analýza kontextu. Praha: Nakladatelství Lidové noviny. Cvrček, V.— Vondřička. P. (2013): Nástroj pro slovotvornou analýzu jazykového korpusu. In: Gramatika akorpus 2012. Hradec Králové: Gaudeamus. Crystal, D. (1997): The Cambridge Encyclopedia of Language. Cambridge: Cambridge University Press. Čermák, F. (2011): Jazyk ajazykověda. Praha: Karolinum. Daneš, F. (1965): Vztah „centra“ a„periferie“ jakožto jazykové univerzálie. Jazykovědné aktuality, 2, s. 1–6. Fengxiang, F. (2010): An Asymptotic Model for the English Hapax/Vocabulary Ratio. Computational Linguistics, 36/4, s. 631–637. Francis, W. N.— Kučera, H. (1964): Brown Corpus Manual. Brown University. Providence (dostupné zhttp://icame.uib.no/brown/bcm.html) Francis, W. N.— Kučera, H. (1982): Frequency Analysis of English Usage. Boston: Houghton Mifflin Company. Laufer, B. (2010): Lexical threshold revisited: Lexical text coverage, learners’ vocabulary
26 ČASOPIS PRO MODERNÍ FILOLOGII 96, 2014, Č. 1 size and reading comprehension. Reading in aForeign Language, 22/1, s. 15–30. Ogden, C. K. (1930): Basic English. AGeneral Introduction with Rules and Grammar. London: Kegan Paul. Popescu, I. I.— Altmann, G. (2006): Some aspects of word frequencies. Glottometrics, 13, s. 23–46. Savický, P.— Hlaváčová, J. (2002): Measures of Word Commonness. In: Journal of Quantitative Linguistics, 9, s. 215–231. Waring, R.— Nation, P. (1997): Vocabulary size, text coverage, and word lists. In: N.Schmitt— M. McCarthy (eds.), Vocabulary: Description, Acquisition and Pedagogy. Cambridge: Cambridge University Press, s. 6–19. Zhang, H.— Huang, C.— Yu, S. (2004): Distributional consistency: Ageneral method for defining acore lexicon. In: Proceedings of the 4th International Conference on Language Resources and Evaluation (LREC2004), s. 1119–1222. Václav Cvrček | Ústav Českého národního korpusu, FFUK | nám. Jana Palacha 2, 116 38 Praha 1 [email protected]