Václav Cvrček, Zuzana Laubeová, David Lukeš, Petra Poukarová, Anna Řehořková, Adrian Jan Zasina: Registry v češtině
Abstract
132
Full text
VÁCLAV CVRČEK, ZUZANA LAUBEOVÁ, DAVID LUKEŠ, PETRA POUKAROVÁ, ANNA ŘEHOŘKOVÁ, ADRIAN JAN ZASINA: REGISTRY VČEŠTINĚ Praha: Nakladatelství Lidové noviny, 2020, 227 stran ISBN 978-80-7422-754-7 Jazyková variabilita je inherentním rysem jazyka, který prostupuje řadu oblastí jazykového zkoumání. Již od sedmdesátých let poukazují někteří badatelé na to, že žádný mluvčí nemluví ve všech situacích stejně avariabilita jazykových rysů (adále pak itextů) je podmíněna situačně afunkčně (např.Halliday— Hasan, 1976; Hymes, 1974). Mluvčí musí při formulaci textu činit rozhodnutí, která jsou podmíněna funkcí textu, tématem, vztahem mezi mluvčím aadresátem, mírou interakce asituačním zakotvením projevu či textu. Metodu, která umožňuje rozplést tuto souvztažnost ajazykovou komplexitu, definoval apoprvé aplikoval Douglas Biber ve své studii Variation in Speech and Writing (Biber, 1988) aposléze ji využil vmnoha dalších výzkumných projektech. Jeho badatelská práce se stala vzorem ainspirací ipro autorský tým této publikace. Autoři si kladou za cíl empiricky ametodicky rozšířit popis variability včeštině avyvinout vůbec první multidimenzionální model slovanského jazyka. Jejich monografie přehledně shrnuje postup při vývoji daného modelu adefinici registrů češtiny adále popisuje uplatnění modelu vaplikovaném výzkumu. Publikace je rozdělena do sedmi kapitol, je opatřena přílohou se soupisem výrazných rysů vjednotlivých dimenzích, seznamem použitých rysů aseznamy pro operacionalizaci rysů ajmenným rejstříkem. První kapitola slouží jako úvod do problematiky jazykové variability, resp.do jejího funkčního využití, objasňuje strukturu knihy azáměry jednotlivých kapitol. Za zmínku stojí ipoznámka na konci první kapitoly, která poskytuje odkazy na zdroje anástroje použité při realizaci MDA. Druhá kapitola představuje teoretická východiska multidimenzionální analýzy. Aplikovaná metoda vychází ze studie D.Bibera (1988): byla vyvinuta pro analýzu registrů vangličtině aod té doby byla jen smenšími úpravami použita adále badatelsky ověřena vřadě studií zaměřujících se ina specializované registry. Jádrem Biberovy metody je myšlenka, že jazyková variabilita je podmíněna funkčně asituačně. Jedná se vpodstatě oexplorativní metodu, která nám umožňuje zkoumat vztah mezi jazykovými rysy atextovými charakteristikami. Při koncipování metody se ale nepostupuje od funkčních vysvětlení (např.ve smyslu škál formální— neformální), ale výzkum je postaven na analýze výskytů, resp.souvýskytů jazykových rysů, které jsou determinovány komunikační situací afunkcí daného textu (s.13–15). Studie odkazuje na dosavadní poznatky české stylistiky aempirické lingvistiky, přičemž zmiňuje dvě perspektivy pohledu na text. Perspektivu vnitrotextovou, která vychází zjazykových prostředků použitých vtextu sdůrazem na to, že jejich výběr neprobíhá izolovaně či jednotlivě, ale jako „seskupení takovýchto jazykových prostředků, které realizují základní komunikační záměr původce jazykového projevu…“ (s.16). Druhá perspektiva zprostředkovává pohled vnětextový, kde jsou určující faktory stylu jako komunikační záměr, ráz komunikace, přítomnost anepřítomnost adresáta, mluvenost apsanost, resp.připravenost anepřipravenost. Toto rozlišení umožňuje autorům vymezit pozici registru jako útvaru, „který je rozkročen mezi Martina Berrocal OPEN ACCESS
MARTINA BERROCAL 133 vnětextovým avnitrotextovým pohledem“ (s.20). To znamená, že vněm zohledněn vztah mezi situačním kontextem, zvolenými jazykovými prostředky ajejich funkčním zapojením vtextu. Třetí kapitola umožňuje čtenáři nahlédnout do motivace autorů aseznámit se sjednotlivými kroky při zpracování multidimenzionálního modelu. Autoři jsou vedeni snahou opoznání toho, „jak texty variují, jaké jsou základní tendence (dimenze variability) ajaké rysy se na tom podílejí“, adále pak tím, „jak se vliv registru např.promítá do frekvenčních charakteristik různých rysů“ (s.21.). Výstupy zMDA dále umožňují poznat rozpětí variability českých textů, což je stěžejní voblasti designu korpusů apři koncepci vnitrotextové klasifikace textů vkorpusu. Následuje detailní aprecizní popis pracovního postupu celé analýzy, který zahrnuje sestavení korpusu, kompilaci jazykových rysů pro analýzu, operacionalizaci rysů, statistické vyhodnocení ainterpretaci výsledků. Samotná koncepce asestavení korpusu zahrnuje několik kroků arozhodnutí, které nelze zprostorových důvodů vtéto recenzi vyčerpávajícím způsobem popsat (s.24–33). Podstatné je, že pro účely MDA analýzy bylo třeba sestavit korpus, který by zachycoval šíři apestrost variability, přičemž reprezentativnost ve vztahu kpopulaci (celému jazyku— zde češtině) nebyla zas tak důležitá. Za účelem dosažení pestrosti bylo do korpusu zařazeno 3428 vzorků, přibližně 10,9 milionů tokenů. Vybrané texty pokrývají tři komunikační módy (psaný/wri, mluvený/spo ainternet /web), které jsou dále členěny na divize a(nad)třídy, přičemž každá třída obsahuje přibližně 200 tisíc tokenů. Autoři zdůvodňují užití vzorků potřebou zajistit vyhraněnost textů, atím ijejich jasnou pozici vrámci prostoru variability. Tato homogenita totiž udelších textů zpravidla chybí. Vpodstatě lze říci, že čím delší text, tím větší prostor pro různé jazykové prostředky atím větší různorodost textu, atudíž menší vyhraněnost. Druhým krokem vpracovním postupu MDA byl výběr jazykových rysů na různých jazykových úrovních (fonologické, morfologické, slovotvorné, lexikální, syntaktické, pragmatické itextové), které reprezentují variabilitu češtiny. Seznam rysů má základ vmluvnicích astylistických příručkách češtiny, vybraných úzce zaměřených studiích, arovněž vúvahách autorů, vnichž hraje nespornou roli ijazyková intuice. Při operacionalizaci (tj.formulaci korpusového dotazu aautomatické extrakci frekvencí daných jevů) se autoři snaží zajistit, aby byl do výsledku zahrnut daný rys vco největší šíři (maximálně možný počet relevantních případů) sco nejvyšší přesností (sminimálním počtem chyb při extrakci). Na základě těchto hledisek byly zanalýzy vyřazeny rysy svelmi nízkou frekvencí, vysokou chybovostí aminimálním podílem na variabilitě (např.gramatický rod). Vpodkapitole 3.4.2 (s.36–77) je uveden spíše technický popis toho, jak byly jednotlivé rysy extrahovány. Tato část ipřes svou techničnost má svůj význam, ato hned zněkolika důvodů. Za prvé slouží jako přesná adetailní dokumentace ve smyslu dobré badatelské praxe. Za druhé umožňuje čtenářům, kteří se skvantitativní akorpusovou lingvistikou spíše seznamují, nahlédnout do samého nitra práce sjazykovým korpusem. Za třetí, pro čtenáře, kteří skorpusovým bádáním jisté zkušenosti mají, může tento detailní popis sloužit jako inspirativní zdroj při koncepci vlastních výzkumných projektů. Podkapitola 3.5 Statistické vyhodnocení podává zdůvodnění výběru faktorové analýzy mezi metodami na redukci dimenzionality, osvětluje její základní principy OPEN ACCESS
134 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.1 ademonstruje krok za krokem její aplikaci. Faktorová analýza předpokládá, že mezi analyzovanými (jazykovými) rysy existují korelace, atudíž není nutno je analyzovat jednotlivě, nýbrž jako „balíček“ korelujících rysů, jejichž souvýskyt je podmiňován latentní proměnnou, která se projevuje jako faktor. Vstupem analýzy byly hodnoty (zpravidla frekvence) pro 122 jazykových rysů pro 3292 textů, které byly upraveny anormalizovány abylo přistoupeno kextrakci faktorů. Podkapitola dále zdůvodňuje metodicky klíčová rozhodnutí týkající se počtu extrahovaných faktorů, typu rotace (promax) ametody extrakce faktorů (GLS). Výstupem faktorové analýzy jsou dva typy informací, tzv.loading, který informuje ozapojenosti rysu vdaném faktoru (či dimenzi) afactor score, což „je charakteristika textu, která je odvozena od [jazykových] rysů vněm použitých“. Bude-li text obsahovat hodně rysů spozitivním loadingem amálo či žádné sloadingem negativním, bude mít vysoké factor score, anaopak (s.82). Tato data jsou zásadní pro interpretaci dimenzí, která je shrnuta vpodkapitole 3.5.5. Autoři zde dávají nahlédnout do procesu posuzování metod užívaných kurčování počtu dimenzí, jasně vysvětlují podmínky aproblémy aplikace, které neumožňují jejich využití učeského modelu. Dále detailně popisují (s.84–90) aodůvodňují vlastní postup při interpretaci dimenzí. Celý postup od kalkulace přes implementaci je dostupný knahlédnutí vrepozitáři Github. Ve čtvrté kapitole je krátce nastíněn způsob interpretace (korelujících) rysů ve vztahu kjednotlivým faktorům ajsou zde určeny příslušné krajní hodnoty ainertní rysy pro daný faktor (resp.dimenzi). Je prozkoumána variabilita subkorpusů Koditexu apříslušné rozdíly mezi nimi. Výsledky těchto srovnání lze také prostudovat ve vizualizačním nástroji vyvinutém pro účely MDA analýzy, který je volně dostupný na stranách Českého národního korpusu (www. korpus.cz/mda). Následuje podrobný popis dimenzí variability, který obsahuje jejich typické rysy, textové typy významné vdané dimenzi ailustrativní ukázky daných textů. Podkapitola 4.2 Srovnání sBiberovým modelem se zajisté lépe čte informovanému čtenáři, který automaticky asociuje Biberův model, nicméně ipro ty méně informované jsou cenné poznatky ohledně specifičnosti českého MDA modelu. Zajímavé je například vyčlenění 2.dimenze spontánní (+) vs. připravený (–) či 4.dimenze polytematický (+) vs. monotematický (–). Vdalší podkapitole (4.3) se autoři vrací kotázce vlivu délky vzorků (chunků) pro stanovení modelu češtiny. Na příkladu swebovými daty ukazují, že spolehlivost zařazení do dimenze je problematičtější vdimenzích, na kterých se podílejí méně časté jazykové rysy. Zatímco dimenze, na kterých se podílejí obecně časté rysy (frekvence substantiv, adjektiv, verb), jsou robustnější, atudíž ke zkreslení způsobené délkou vzorku méně náchylné (s.114–115). Ikdyž jsou dimenze pro popis variability díky své škálovosti ahierarchičnosti nesporně přínosné, dle autorů má jazykový popis prostřednictvím dimenzí několik nevýhod: zpracování osmi dimenzí se pohybuje na hranici kognitivních možností avurčitých oblastech jako např.klasifikace textu je jedno (jediné) označení žádoucí (s.116). Vpáté kapitole se tedy autoři dostávají kzáměru identifikace registrů češtiny, tzn.kvnitrotextově motivovanému popisu skupin (shluku) textů. Čtenář si jistě může klást otázku, kčemu takový popis slouží. Ve prospěch identifikace registrů hovoří, kromě výše zmíněných nevýhod dimenzí, ito, že shluknou-li se texty do skupin, lze vymezit jejich pozici avelikost (obecnost či specifičnost) aurčit jejich homogenitu OPEN ACCESS
MARTINA BERROCAL 135 (s.117). Pro identifikaci klastrů byla použita klastrovací metoda KMeans, počet klastrů byl určen pomocí balíku NbClust (R Core Team 2018) ajako nejvhodnější se ukázala metoda deseti klastrů, tj.10 registrů. Přehled registrů je popsán vpodkapitole 5.3. Pro každý registr je uvedeno jeho jméno, skládající se ze dvou částí. První je inspirována slohovým postupem, formátem či záměrem (s.119), druhá část se vztahuje kpozici klastru vprvní dimenzi (dynamický vs. statický) adruhý atribut kdalšímu výraznému rysu klastru vdalší dimenzi (např.analýza: statický monotematický registr, komentář: dynamický postojový registr). Popis registrů nám podává informace otom, kde se registr vdaných dimenzích nachází, jaké jazykové rysy jsou vněm významně zastoupeny akteré typy textů jsou pro tento registr typické. Izde je přiložena textová ukázka. Všesté kapitole uvádí autoři příklady aplikace multidimenzionálních modelu češtiny ve třech studiích. První studie měla posoudit, zda texty elicitované pro psycholingvistickou analýzu na základě čtyř scénářů dosahují kýžené variability. Udvou scénářů bylo zjištěno, že texty produkované na jejich základě se neodlišují natolik, aby mohly být spolehlivě použity vplánovaném výzkumu. Důležitým poznatkem této studie je, že při výzkumech zohledňujících jak jazykové, tak ipsychologické proměnné lze takovouto analýzu vstupů jen doporučit. Vdruhé studii se autoři zaměřují na to, do jaké míry je variabilita ovlivněná situací (registrem) ado jaké míry idiolektem daného mluvčího. Vstupem jsou výše zmíněné elicitované texty (dopisy). Vyhodnocení probíhalo čtyřmi způsoby: modelováním prostřednictvím tří statistických metod aporovnáváním rozdílů prostřednictvím vzdáleností mezi texty. Použití čtyř metod za stejným účelem umožňuje spolehlivou verifikaci výsledků, tzn.jestliže vyjde pomocí čtyř metod podobný výsledek, tak jsme snejvětší pravděpodobností postupovali správně. Studie dochází kzávěru, že registr se na variabilitě textu podílí významněji než idiolekt (poměr 2:1). Na základě těchto výsledků autoři doporučují, aby studie, které se zaměřují na výzkum idiolektu, pracovaly stexty pouze zjednoho registru, atím byl omezen jeho vliv na variabilitu. Třetí studie porovnává variabilitu dat ztradičních (reprezentativních) korpusů (zde korpus Koditex) ajazykových dat získaných zwebu (zde korpus Araneum Bohemicum Maximum). Vpodstatě jde oodpověď na otázku, zda jsou ve velkém objemu webových dat obsaženy všechny textové typy azda mohou webová data suplovat data mluvená. Zvýsledků vyplývá, že mezi daty zKoditexu azwebu je sice velký překryv, ale některá uživatelsky generovaná data jsou zastoupena jen částečně. Ukazuje se také, že běžně crawlovaná data nepokrývají celé spektrum jazykové variability. Podle autorů by při analýze webových dat měli badatelé počítat stím, že část variability pokrytá např.spontánními mluvenými rozhovory či autorskými texty, např.beletristickými, bude ve webovém korpusu chybět. Upozorňují dále na to, že některé chybějící webové (autorsky generované) textové typy je vhodné doplnit prostřednictvím specializovaných webových korpusů (Facebook, Twitter atd.). Závěrem lze říci, že tato publikace asní spojený výzkumný projekt jsou velkým přínosem kpoznání variability včeštině ačeských registrů. Daný model nejen splňuje svou deskriptivní funkci, ale také otevírá další perspektivy pro estimaci variability vaplikovaném výzkumu (kap. 6), což výrazně rozšiřuje dosavadní možnosti lingvistického bádání včeštině. Vneposlední řadě je třeba vyzdvihnout transparentnost OPEN ACCESS
136 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.1 prezentované studie voblasti dokumentace azpřístupnění relevantních dat, skriptů anástrojů, aocenit čtivost asrozumitelnost stylu publikace. Tato monografie, apředevším způsob badatelské práce vní zachycený může bezesporu sloužit dalším odborníkům jako příklad dobré vědecké praxe. LITERATURA Biber, D. (1988): Variation in Speech and Writing. Cambridge: Cambridge University Press. Halliday, M.A.K.— Hasan, R. (1976): Cohesion in English. London: Longman. Hymes, D. (1974): Foundations in sociolinguistics: An enthnographic approach. Philadelphia: University of Pennsylvania Press. Martina Berrocal | Institut für Slawistik und Kaukasusstudien, Friedrich-Schiller-Universität Jena | Ernst-Abbe-Platz 8, 07743 Jena ORCID ID: 0000-0003-4003-8516 [email protected] OPEN ACCESS