scieee AI-readable full text Open interactive document viewer

Kvantitativní analýza ortografické variability v Korpusu rané anglické korespondence

Tichý, Ondřej

Abstract

27

Full text

Kvantitativní analýza ortografické variability vKorpusu rané anglické korespondence1 Ondřej Tichý ABSTRACT: Aquantitative analysis of spelling variation in the Corpus of Early English Correspondence (CEEC). The paper explores trends in spelling variation as reflected in Early English correspondence (15th–17th c.) on the material of the Corpus of Early English Correspondence (CEEC). Overall change in spelling variation has so far been commented on only in relatively general terms and never on quantitative grounds. There is, of course, no doubt about the general direction of the change (towards greater standardization, though not in astraightforward manner) and its basic characteristics, such as its slower pace in private documents compared to the spelling of professional publications, but the data to support the assertions as well as precise definitions of spelling variation or regularisation have not yet been, to our knowledge, provided. This paper introduces anovel methodology for the quantification of spelling variation and regularity, which allows amore objective assessment of its change and which also makes use of the metadata provided by the CEEC: such as gender, letter authenticity or relationship/kinship between the author and the recipient. The paper explores interactions of such variables from the diachronic perspective using quantified levels of spelling regularity. The measure introduced for this purpose is based on weighted information (Shannon) entropy, as ameasure of predictability of spellings of individual functionally defined types, and its calculation is partly based on the morphological tagging of the parsed version of the Corpus. KLÍČOVÁ SLOVA / KEY WORDS: korespondence, korpus, entropie, variace, ortografie correspondence, corpus, entropy, variation, spelling ÚVOD Dějiny anglické ortografie jsou popsány především jako dějiny utváření standardů adějiny postupné standardizace. Dosavadní práce se soustředily především na proces utváření: zjakých zdrojů čerpal, kdo byli jeho nositelé, jakým způsobem se rozšiřoval, na jeho systémový popis ana popis změn tohoto systému. Není přitom vzásadě sporu otom, že proces standardizace ortografie vede ke snižování ortografické variability aže vdějinách angličtiny, alespoň od pozdní střední angličtiny, se rozvíjející se standard postupně šíří, akolísavost anglického pravopisu tedy ipostupně klesá. Zřejmě proto, že tento trend je celkem očividný, dočkal se vodborné literatuře zatím spíše obecných komentářů, např.: 1 Tato práce vznikla za podpory projektu Kreativita aadaptabilita jako předpoklad úspěchu Evropy vpropojeném světě, reg. č.: CZ.02.1.01/0.0/0.0/16_019/0000734, financovaného zEvropského fondu pro regionální rozvoj. OPEN ACCESS 28 STUDIE ZAPLIKOVANÉ LINGVISTIKY  „as the fifteenth century progressed so auniversal stabilised orthography … was increasingly widely used” (Scragg, 46), „after 1550 we find a… greater stability and regularity of spelling in private documents”, “up to the final fixing of spelling circa 1650” (ibid., 68), případně „the 15th century saw asteady movement towards afixed spelling that very much resembles the spelling of Modern English” (Upward & Davidson, 2011, s.174). Stávající práce si klade za cíl formulovat metodologii pro kvantifikaci ortografické variability atradičně obecně popsaný trend potvrdit, respektive konfrontovat skorpusovými daty na úžeji vymezeném vzorku textů dopisů zlet 1410–1680. Jak jsme uvedli výše, byť trend samotný je zpochybnitelný jen stěží, kvantitativní metodologie umožní přesněji sledovat jeho výkyvy, porovnávat jeho vývoj mezi různými jazykovými varietami (privátní/neprivátní texty, nářečí, žánry) avneposlední řadě pomůže lépe definovat, co se konkrétně ortografickou variabilitou myslí. METODOLOGIE Vymezení variability může být jednoduché: Kvariabilitě dochází vždy, když „[existuje] více forem pro jeden význam, n. více významů pro jednu formu“ (Cvrček, 2017), oortografické variabilitě pak mluvíme, když pro jednu funkci užíváme více než jednu grafickou formu.2 Tuto definici je však třeba dále upřesnit: především které funkce máme na mysli? Za funkční budeme pro účely této práce považovat jen rozlišení vrámci jedné variety, ane rozdíly např.mezi dialekty. Jinými slovy, varietní tvary (ať již odrážející různou výslovnost, nebo různé pravopisné standardy) stejného slova považujeme za funkčně nerozlišené, atedy variantní. Např.(britské) <colour> a(americké) <color> považujeme za kolísání pravopisu, protože vrámci jedné variety nejde ofunkční rozlišení. Nezohledňujeme také ortografické rozlišení vyšších funkčních rovin, např.pragmatické nebo stylové. Takové rozlišení je vangličtině vrámci lexikálně-gramatických jednotek řídké, apokud se vyskytuje, jde především orozlišení pomocí archaických morfologických tvarů (např.kontrast slovesných tvarů 2.os. př. času <sayest> a<say>). Vpřípadě změn funkčních kategorií vprůběhu zkoumaného období, které vedly ke vzniku archaických tvarů (např.zde zmíněné formální ztrátě druhé osoby j. č. upřítomných slovesných tvarů), pak předpokládáme funkční rozlišení na úrovni flektivní gramatické morfologie vcelém sledovaném období. Naopak formy rozlišující funkce sémantické nebo gramatické za funkčně odlišné považujeme.3 2 Psanou formu jazyka považujeme vtomto smyslu za nezávislou na formě mluvené anedefinujeme tak variabilitu ortografie vzávislosti na mluvených formách. Vzhledem kpoužitému materiálu (ohledně spolehlivosti materiálu viz níže) také nerozlišujeme variabilitu grafickou agrafémickou, byť nám jde především otu druhou. 3 Jde nám přitom ale pouze orovinu konkrétních slov, výskytů, např.kolísání forem <dared> a<durst>, nikoliv orovinu systémovou, nezabýváme se tedy obecně např.variaOPEN ACCESS ONDŘEj TIchÝ 29 Takto vymezenou variabilitu můžeme kvantifikovat, např.velmi jednoduše vydělením počtu distinktních grafických tvarů (dále formy) počtem lexikálně-gramatických jednotek (dále typy4), tedy jako vliteratuře populární „counting of spellings“ (např.Crystal, s.394). Vkorpusové lingvistice ale takový postup těžko obstojí, mimo jiné zcela opomíjí četnost jednotlivých forem (dále tokeny). Jiným způsobem, jak na základě těchto veličin míru variability typů kvantifikovat, je kalkulovat podíl počtu forem na počet jejich výskytů (dále tokeny), takže čím více forem na počet tokenů by se vtextu objevilo, tím vyšší míru variability by text vykazoval. Pokud ale blíže prozkoumáme konkrétní data, zjistíme, že takto jednoduše pojatá kvantifikace často neodpovídá tomu, jak míru variability intuitivně chápeme. Jako příklad uveďme formy slova OTHER aminulého času slovesa SHOULD spolu spočty tokenů těchto forem ve dvou po sobě jdoucích dekádách (viz tabulku 1). Vpřípadě slova OTHER poměr mezi první adruhou dekádou šestnáctého století výrazně klesá z0,093 na 0,067, intuitivně bychom ale variabilitu druhé dekády označili zřejmě za vyšší. Naopak vpřípadě minulých tvarů slovesa SHOULD poměr mezi padesátými ašedesátými lety stejného století výrazně stoupá, intuitivně však formální kolísání spíše klesá. Tento způsob kvantifikace totiž pomíjí rozložení tokenů aforem. Jak ho zohlednit? OTHER 1500–09 1510–19 SHOULD-pret 1550–59 1560–69 nodder 1 — shold 8 7 nother 1 6 sholde 1 4 oder — 3 should 5 1 odyr — 2 shoulde — 1 other 39 57 shuld 10 1 othre 2 6 shulde 5 — celk. tokenů 43 74 29 14 forem/tokenů 0,093 0,067 0,172 0,357 Tabulka 1:Formy atokeny slova OTHER aminulého času slovesa SHOULD. Domníváme se, že intuitivně by míra variability nebo kolísání měla být tím vyšší, čím menší šanci máme, že odhadneme formu výskytu konkrétního typu vtextu— neboli je tím vyšší, sčím nižší pravděpodobností ji budeme schopni určit/odhadnout. Tato definice sice může naznačovat, že podíl forem ajejich tokenů je správnou mírou variability, protože jde ovyjádření pravděpodobnosti, nám však nejde opravděpodobnost výskytu jedné konkrétní formy, ale orozložení pravděpodobností (resp.omíru nejistoty ohledně) forem konkrétních typů vtextu. Míru nejistoty systému je možné vyjádřit tzv.informační nebo také Shannonovou entropií, přičemž entropii jednoho konkrétního typu definujeme jako „kde n je bilitou nesamostatných morfémů typu variantních koncovek préterita <-ed> vs. <-t(e)> apod. 4 Jak zuvedeného vyplývá, zde užívané lexikálně-gramatické jednotky zcela neodpovídají vkorpusové lingvistice běžně užívanému termínu typ, viz seznam užitých typů vpříloze 1. OPEN ACCESS 30 STUDIE ZAPLIKOVANÉ LINGVISTIKY  počet forem daného typu, f je frekvence formy (počet tokenů formy) at frekvence typu (počet tokenů všech forem daného typu)“. Ve výše zmíněných příkladech budou hodnoty entropie pro OTHER 0,176 (první dekáda) a0,363 (druhá dekáda), zatímco pro SHOULD 0,627 (padesátá léta) a0,552 (šedesátá léta). Tato čísla ukazují opačný aintuitivnější trend než prostý poměr forem atypů. Pokud chceme použít entropii jako míru variability vtextu, vněmž se vyskytuje více typů, znichž každý vykazuje vlastní míru entropie, nemůžeme entropie jednotlivých typů pouze jednoduše sčítat. Jednotlivé typy jsou vtextu zpravidla zastoupeny různě často, měly by tak kmíře variability přispívat různou měrou (např.entropie 0,58 za 213 tokenů 11 forem spojky IF by neměla mít stejnou váhu vcelkové entropii textu jako entropie 0,93 minulého času slovesa SHALL s5582 tokeny celkem v61 formách). Lze namítat, že počet tokenů je již započítán ventropii daného typu. To je sice pravda, představme si ale text (viz tabulku 2), který je tvořen 100 tokeny pouze dvou typů— jeden znich má pouze jednu formu, atedy nulovou entropii, vyskytuje se však vtextu v98 tokenech, druhý má dvě formy, znichž každá je vtextu reprezentována jedním tokenem, avykazuje tedy entropii zhruba 0,3. Pokud entropie pouze sečteme, bude výsledná entropie textu opět zhruba 0,3. Snížíme-li však vtextu počet tokenů prvního typu na 50 azároveň zvýšíme počet tokenů obou forem druhého typu na 25 za každou, získáme intuitivně podstatně variabilnější text, který by ale po prostém sečtení entropií obou typů vykazoval entropii stále shodnou— zhruba 0,3. Ztohoto důvodu nejprve entropie jednotlivých typů násobíme jejich relativní frekvencí aaž následně sčítáme, tím vuvedeném případě získáme váženou entropii prvního textu zhruba 0,006, zatímco vážená entropie druhého textu bude řádově vyšší, přibližně 0,15. tokenů formy entropie typu tokenů formy entropie typu text 1 text 1 text 2 text 2 typ 1 forma 1.1 98 0 50 0 typ 2 forma 2.1 1 0,3 25 0,3 forma 2.2 1 25 součet entropie 0,3 0,3 vážená entropie 0,006 0,15 Tabulka 2:Rozdílná agregace entropie. Míru variability textu tedy počítáme jako relativní frekvencí vážený součet entropií jednotlivých typů. Ktakto navržené míře se sluší dodat dvě důležité charakteristiky. Zaprvé platí to, že čím vyšší je její index, tím vyšší je měřená variabilita, přičemž hodnota 0 znamená nulovou variabilitu. Zadruhé kvůli vážení dílčích entropií jednotlivých typů jejich relativní frekvencí není výsledná míra vpravém smyslu mírou entropie, ale považujeme ji prostě za míru variability. OPEN ACCESS ONDŘEj TIchÝ 31 KORPUS AZPRACOVÁNÍ DAT Problém svyhledáváním variantních tvarů dle navržené metodologie vhistorických korpusech spočívá obvykle především vchybějícím značkování. Dostupné historické korpusy angličtiny nejsou lemmatizovány, natož aby měly značkované jednotlivé morfologické kategorie arozlišovaly tak lexikálně-gramatické jednotky definované výše. Jak tedy vkorpusu takové jednotky identifikovat avyhledat zároveň všechny jejich tvary? Ruční vyhledávání, případně značkování celého korpusu nebo jedné dostatečně velké části by vyžadovalo značnou časovou investici, rozhodli jsme se proto pracovat somezeným, ale specifickým vzorkem dat. Řada helsinských historických korpusů (Rissanen et al.) existuje vsyntakticky amorfologicky značkovaných verzích, které sice nejsou lemmatizovány ani nemají komplexně značkovány morfologické kategorie, mají ale značkovány alespoň slovní druhy. Výhodou použitého morfologického značkování této řady korpusů je, že ač jde primárně označkování slovních druhů (POS tagging), některé lexikální jednotky (především jde oslova gramatická nebo oslova zuzavřených slovních druhů, např.OTHER jako zájmeno či spojka) jsou značeny samostatně, avněkterých případech jsou dokonce značkovány jejich vybrané gramatické kategorie (např.pro sloveso DO je značeno zvlášť přítomné participium, pasivní participium, infinitiv, minulé tvary, imperativ, minulé participium aprézentní tvary, pro ostatní jednotky je ale morfologické značkování mnohem méně důkladné). Pragmaticky jsme tedy vybrali vzorek dat omezený na nejdetailněji značkované slovní druhy, resp.lexikální jednotky— konkrétně na slovesa BE, DO, HAVE, modální slovesa, předložku/ spojku FOR, existenciální THERE, spojky WHETHER aIF apříslovce OTHER aSUCH. Všechny výskyty odpovídající těmto značkám jsme ze značkované verze korpusu CEEC (PCEEC) spolu se všemi metadaty vyexportovali pomocí online korpusového manažeru ČNK Kontext. Celkem jsme tímto způsobem získali 238 659 tokenů v930 formách spolu spříslušnými metainformacemi. Ty bylo třeba ručně roztřídit do výše definovaných funkčních typů, resp.je dodatečně roztřídit vpřípadech, kdy značkování samotného korpusu nezachycuje celou morfologickou pestrost angličtiny 15.–17.století. Celkem jsme všechny výskyty roztřídili do 79 typů, např.modální slovesa, značkovaná všechna dohromady jako „MD“, jsme ručně dodatečně roztřídili na 26 typů, konkrétně na přítomné tvary, přítomné tvary 2.a3. os. sg., tvary préterita, tvary 2.os. sg. prét. sloves CAN, DARE, MAY, MUST, NEED, OWE, SHALL aWILL (ne všechny typy byly využity pro všechna slovesa).5 Jak jsme uvedli výše, korpus CEEC sestává zdopisů adíky tomu je také doplněn metadaty, která ke každému textu vkorpusu (dopisu) doplňují řadu sociolingvistických proměnných. Pro následující analýzu jsme se kromě doby sepsání dopisu rozhodli využít také metadat opohlaví autora, autenticitě dopisu (autograf, zapsaný jinou osobou) apříbuzenském vztahu autora apříjemce dopisu. Pro účely našeho výzkumu jsme kategorie metadat zjednodušili způsobem naznačeným vtabulce 3. 5 Přehled všech typů je uveden vpříloze 1. OPEN ACCESS 32 STUDIE ZAPLIKOVANÉ LINGVISTIKY  kód původní kategorie naše kategorie A (A/C) autograf autograf (autograph) Bautograf málo známé osoby C (C/A) kopie nebo dopis psaný písařem písařský (secretarial) D (D/A) autenticita neznámá neznámá (unknown) FN nejužší rodina rodina (family) FO širší rodina FS rodinný sloužící TC přátelé ostatní (others) T ostatní Tabulka 3:Zjednodušení kategorií metadat CEEC. Ne všechny kategorie jsou vkorpusu pochopitelně zastoupeny stejnou měrou. Pro naši analýzu je však důležité vzít rozdílné zastoupení metadat naznačené vnásledujících grafech vúvahu. Graf 1:Rozložení tokenů excerpovaných zdopisů psaných ženami (female) amuži (male). Jak je patrné zgrafu 1, zastoupení tokenů zdopisů psaných ženami, zjednodušeně řečeno zastoupení žen, je poměrně nízké, ato především vprvním, ale ivněkolika prostředních obdobích. Izdůvodu takového rozložení jsme se rozhodli data analyzovat nikoliv po obvyklejších dekádách, kde by rozsah dat zvláště vsociolingvisticky úzce definovaných kategoriích byl příliš malý, ani po Helsinským korpusem zavedených obdobích, která by data rozdělovala jen na čtyři neúplná období, ale kompromisně po třicetiletých úsecích, které mohou odpovídat např.generačním cyklům. 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 MALE 1430 15239 15584 8615 21580 31730 26536 36325 36743 FEMALE 56 5418 1982 827 1022 1735 6326 9726 14980 0 10000 20000 30000 40000 50000 60000 tokeny FEMALE MALE 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 others 1439 7011 4139 7045 19063 23633 22801 13458 25258 family 47 13646 13427 2397 3539 9832 10061 32593 26465 0 10000 20000 30000 40000 50000 60000 tokeny family others 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 unknonw 79 600 646 725 592 1091 1306 3418 5881 secretarial 1110 8218 4070 2033 7080 11108 8279 5241 5478 autograph 297 11839 12850 6684 14930 21266 23277 37392 40364 0 10000 20000 30000 40000 50000 60000 tokeny autograph secretarial unknonw OPEN ACCESS ONDŘEj TIchÝ 33 Jak je patrné zgrafů 2 a3, vprůběhu času se zvyšuje zastoupení autografů na úkor dopisů psaných písaři, zatímco zastoupení rodinných příslušníků mezi adresáty kolísá. Samotný výpočet variability za jednotlivé časové úseky asociolingvistické kategorie byl proveden vjazyce R.Jelikož rozsah zpracovaných dat se mezi časovými úseky výrazně odlišoval (zvlášť sohledem na některé sociolingvistické kategorie ajejich kombinace), přistoupili jsme vzájmu vyšší výpovědní hodnoty našich výsledků ke Graf 2:Rozložení tokenů vdopisech psaných samotnými autory (autograph) nebo písaři (secretarial). Graf 3:Rozložení tokenů vdopisech příbuzným (family) aostatním adresátům (others). 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 MALE 1430 15239 15584 8615 21580 31730 26536 36325 36743 FEMALE 56 5418 1982 827 1022 1735 6326 9726 14980 0 10000 20000 30000 40000 50000 60000 tokeny FEMALE MALE 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 others 1439 7011 4139 7045 19063 23633 22801 13458 25258 family 47 13646 13427 2397 3539 9832 10061 32593 26465 0 10000 20000 30000 40000 50000 60000 tokeny family others 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 unknonw 79 600 646 725 592 1091 1306 3418 5881 secretarial 1110 8218 4070 2033 7080 11108 8279 5241 5478 autograph 297 11839 12850 6684 14930 21266 23277 37392 40364 0 10000 20000 30000 40000 50000 60000 tokeny autograph secretarial unknonw 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 MALE 1430 15239 15584 8615 21580 31730 26536 36325 36743 FEMALE 56 5418 1982 827 1022 1735 6326 9726 14980 0 10000 20000 30000 40000 50000 60000 tokeny FEMALE MALE 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 others 1439 7011 4139 7045 19063 23633 22801 13458 25258 family 47 13646 13427 2397 3539 9832 10061 32593 26465 0 10000 20000 30000 40000 50000 60000 tokeny family others 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 unknonw 79 600 646 725 592 1091 1306 3418 5881 secretarial 1110 8218 4070 2033 7080 11108 8279 5241 5478 autograph 297 11839 12850 6684 14930 21266 23277 37392 40364 0 10000 20000 30000 40000 50000 60000 tokeny autograph secretarial unknonw OPEN ACCESS 34 STUDIE ZAPLIKOVANÉ LINGVISTIKY  značení konfidenčních intervalů6 založených na statistické metodě bootstrapping. Tato metoda umožňuje odhadnout přesnost pozorování pomocí opakovaného náhodného vzorkování dat. Konkrétně jsme kvýpočtům konfidenčních intervalů využili balíček boot (funkce boot aboot.ci) parametrizovaný na tisíc náhodných vzorků, metodu basic arozsah intervalu 95 % (viz Canty, 2017; Davison, 1997). Včásti věnované materiálu je třeba zmínit také problematičnost využití některých vkorpusu obsažených dat pro analýzu ortografie. Zcela odhlédnuto od problému autorství, respektive písařského autorství, je nutné vzít vpotaz ispolehlivost moderního přepisu, který nejprve proběhl zrukopisu do edic apoté zedic do korpusu. Autoři korpusu se pokusili zajistit co největší autentičnost textů, připouštějí ale, že vněkterých případech čerpali iznespolehlivých moderních edic (Nevala & Nurmi, sek. 2.3, 2.4). Spolehlivost edic tedy bude při dalším výzkumu ještě třeba dále prověřit. ANALÝZA Prvním krokem analýzy bylo srovnání výše navržené míry variability založené na vážené entropii typů smírou založenou na poměru forem atypů. Jak je patrné zgrafu4, obě míry ukazují klesající trend, respektive navzdory kolísání (vpřípadě entropie) potvrzují vyšší variabilitu na počátku sledovaného období než na jeho konci. Jak již bylo řečeno, opostupném prosazování standardizace pravopisu v15.–17.století nemůže být pochyb. Zajímavý je ale rozdíl vývoje především vprvních obdobích 1410–1469. Vyplývá zněj jednak to, že poměr forem atypů je výrazně závislý na velikosti vzorku— malé vzorky dat budou snadno tíhnout kvysoké variabilitě, což je další důvod, proč tuto míru nepoužívat. Vpřípadě míry založené na vážené entropii je nízká variabilita, respektive její nárůst, vysvětlitelná obtížněji, svou roli bude ale zřejmě hrát kromě malého vzorku dat (viz značný rozsah konfidenčních intervalů anásledující diskuse) isložení vzorku vtomto období (viz grafy 1–3): minimální zastoupení ženských autorů (4 %), převaha dopisů psaných písaři (75 %) aminimální zastoupení dopisů psaných vrámci rodiny (3 %). Jak ale vyplývá zdalší analýzy těchto proměnných, nelze těmito faktory vysvětlit překvapivě nízkou hodnotu vprvním období beze zbytku. Další analýzou bylo srovnání míry variability podle pohlaví autorů zachycené grafem 5. Zněj vyplývá, že zhruba vprvní polovině celého sledovaného období (tedy do roku 1530) kolísá pravopis žen méně než pravopis mužů, ve druhé polovině je srovnatelný. Vprvní polovině je ale zároveň zcela minimální zastoupení dopisů psaných přímo autorkami, neboť prakticky všechny dopisy žen jsou zapsány písaři (pravděpodobně tedy muži); viz ktomuto igraf 6 anásledná diskuse. Následně jsme srovnali variabilitu vzávislosti na tom, kdo dopis skutečně zapsal (graf 6). Podle očekávání kolísal— kromě prvních dvou období— pravopis samotných autorů dopisů více než pravopis písařů. 6 Jedná se oodhady přesnosti výsledků, které jsou statisticky odvozené zdat pozorování. Vgrafech níže jsou značeny vertikálními úsečkami nad apod datovými body. OPEN ACCESS ONDŘEj TIchÝ 35 Jako třetí proměnnou jsme srovnali variabilitu vdopisech členům rodiny aostatním (graf 7). Až na první období, kde šíře konfi denčních intervalů naznačuje minimální vzorek dat, ana jeden výkyv vletech 1500–1529 byl pravopis vdopisech psaných rodinným příslušníkům stejný nebo uvolněnější než vdopisech ostatním adresátům. Vposledních dvou částech analýzy jsme srovnávali souhru dvou proměnných. Graf 8 ilustruje zároveň vliv pohlaví avliv autenticity na vývoj variability. Ukazuje, že rozdělení na malé kategorie přináší riziko malých vzorků dat. Nejenže zvlášť vraných obdobích jsou konfi denční intervaly velmi široké, ale vprvním období jsou také všechny kategorie autorek na nulové hodnotě, což se zdá odporovat grafu 5, kde je sice variabilita ortografi e autorek vprvním období nízká, ale nenulová. Tímto proGraf 4:Variabilita ortografi e vyjádřená váženou entropií (total) apoměrem forem atypů (rel_total). Graf 5:Variabilita ortografi e dle pohlaví autorů. 0,4 total rel_total variabilita čas 0,3 0,2 0,1 0,0 1410–1439 1440–1469 1470–1499 1500–1529 1530–1559 1560–1589 1590–1619 1620–1649 1650–1679 f total m autograph unknown secretarial čas 0,4 variabilita 0,3 0,2 0,1 0,4 variabilita 0,3 0,2 0,1 1410–1439 1440–1469 1470–1499 1500–1529 1530–1559 1560–1589 1590–1619 1620–1649 1650–1679 čas 1410–1439 1440–1469 1470–1499 1500–1529 1530–1559 1560–1589 1590–1619 1620–1649 1650–1679 family others 0,4 variabilita 0,3 0,2 0,1 čas 1410–1439 1440–1469 1470–1499 1500–1529 1530–1559 1560–1589 1590–1619 1620–1649 1650–1679 OPEN ACCESS