Workshop Corpus Linguistics or How to Do Statistics with L
Abstract
135
Full text
fILIP SmOLíK —EVA LEhEčKOVá, ADAm KŘíŽ —ŠTěPáN mATějKA 135 perimentů může být projekt studia morfologického primingu, vněmž se sleduje, zda prezentace slova vurčitém gramatickém tvaru, např. akuzativu, usnadňuje zpraco‑ vání jiného slova ve stejném tvaru. Experimenty zkoumají rovněž to, zda se efekty liší vzávislosti na způsobu realizace daných kategorií např. urůzných deklinačních tříd. Experimenty zde využívají úlohu detekce slova (lexical decision), při níž účastníci sle‑ dují zobrazená slova astisknutím tlačítka mají co nejrychleji rozhodnout, zda se jedná oskutečné slovo, nebo nikoliv. Tímto způsobem lze zajistit, že účastník si musí vyba‑ vit ado značné míry zpracovat zobrazené slovo, jinak by nemohl spolehlivě odpově‑ dět. Jednoduchá odpověď přitom dovoluje přesné aspolehlivé měření reakčního času. Další informace např. ovýzkumech realizovaných vlaboratoři, omožnostech po‑ dávání projektů aoprioritních tématech jsou průběžně aktualizovány na webových stránkách laboratoře <http://labels.ff.cuni.cz>, které získají vroce 2013 ianglickou verzi. Zájemci ovyužití laboratoře pro vlastní výzkum nebo okonzultace stýmem labo‑ ratoře najdou na těchto webových stránkách všechny potřebné kontaktní informace. Filip Smolík aEva Lehečková wORKSHOP CORPUS LINGUISTICS OR HOw TO DO STATISTICS wITH LANGUAGE Ve dnech 9.–11. července 2012 se vkampusu Univerzity vŘezně konal workshop sná‑ zvem Corpus Linguistics or How to Do Statistics with Language. Hlavní náplní workshopu bylo studenty abadatele voboru slovanských jazyků, kteří mají zájem při svém kor‑ pusovém výzkumu používat statistické metody, obeznámit sprogramemR. Infor‑ mace okonání workshopu byla avizována dvěma způsoby. Organizátorka workshopu Sandra Birzerová jednak uveřejnila prostřednictvím Deutscher Slavistenverband oznámení ouskutečnění pracovního semináře ajednak na seminář osobně pozvala kolegy zoboru ajejich studenty. Samotný workshop pak vedla Dagmar Divjaková, je‑ jíž pozvání bylo financováno organizací Vielberth ‑Stiftung— nadací, která podpo‑ ruje výzkumnou činnost řezenské univerzity. Dagmar Divjaková vsoučasnosti působí na Univerzitě vSheffieldu. Na Katedře ruských aslovanských studií (Department of Russian and Slavonic Studies) zastává roli ředitelky ruských apolských studií, dále spoluřídí Centrum pro jazykový výzkum (Centre for Linguistic Research) aje koordinátorkou etiky výzkumu vrámci Ústavu jazyků akultur (School of Languages and Cultures). Ve své vědecké práci primárně vychází ztzv. usage ‑based kognitivní lingvistiky. Její zájem spočívá vporozumění tomu, jak se naše kognitivní schopnosti podílejí na vzniku jazykových struktur avzorců, ave zkoumání toho, co musí jazyk poskytnout při připisování významu slovům akonstrukcím těm, kteří se jej učí. Dokladem její kognitivnělingvistické orientace je ifakt, že plní funkci viceprezidentky / zvolené prezidentky SCLA (Slavic Cognitive Linguistic Association— Slovanské asociace kognitivní lingvistiky) aže se nachází vredakční radě časopisu Cognitive Linguistics. Vědecký profil Dagmar Divja‑ kové doplňme oinformaci, že je členkou výboru BASEES (Britské asociace pro slovan‑ ská avýchodoevropská studia). Filip Smolík —Eva Lehečková, Adam Kříž —Štěpán Matějka
136 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2013 V Řezně tato kognitivní lingvistka představila zhruba třiceti účastníkům workshopu základy práce sprogramem R. Tento matematický program se těší stále větší oblibě mezi těmi vědci apracovníky, kteří potřebují ke své práci účinný software pro statistické analýzy atvorbu grafů. Lingvistika je právě jednou zoblastí, vníž se programRzačíná dostávat silněji do obecného povědomí. Kjeho velké popularitě přispívá zejména to, že je volně dostupný (jedná se otzv. open source software), je kompatibilní svíce operačními systémy (Windows, Linux, Macintosh) aje průběžně aktualizován vzávislosti na vývoji metod ve statistice. Na druhou stranu může ně‑ koho, kdo nemá sprogramováním mnoho zkušeností, překvapit neintuitivním uživa‑ telským prostředím. Pro výpočet jednotlivých funkcí jsou používány příkazové řádky avýsledné statistické analýzy dostáváme ve formě výstupních řádků. Příkazy vpro‑ gramuRse přitom řídí vnitřní logikou, kterou je nutno si osvojit. Kjejich zdárnému sestavení si též musíme zapamatovat podobu řady operátorů, funkcí ajejich argu‑ mentů. Každý, kdo se chystá využívat programR, je tedy odkázán ksoustředěnému studiu materiálu objasňujícího základní principy práce vtomto programu. Poměrně velké množství takového materiálu, zahrnujícího návody pro jednotlivé statistické výpočty, se nachází na internetu. Alternativu— avzhledem kjejí interaktivní povaze ji lze považovat snad iza vhodnější— kstudiu příslušného materiálu představují přednášky aworkshopy, na nichž se zacházení se softwarem přímo demonstruje. Do této kategorie spadal iworkshop Dagmar Divjakové. Statistické analýzy lze provádět na různých typech dat. Dagmar Divjaková se za‑ měřila ve svém výkladu na analýzu dat korpusových acelý workshop vpodstatě po‑ jala jako uplatnění programuRvkorpusově orientované lingvistice. První den workshopového cyklu byl zasvěcen samotným základům korpusové lin‑ gvistiky astatistiky. Dagmar Divjaková zasadila korpusovou lingvistiku do širokého lingvistického kontextu, vněmž ji vymezila vůči tzv. pohovkové (armchair) lingvis‑ tice, zamýšlela se nad jejím charakterem (kladla si otázku, zda je nástrojem, mode‑ lem, nebo teorií) azmínila hlavní pojmy, které jsou sní spojeny. Následně účastníky uvedla do základů statistiky. Účastník workshopu tedy nemusel disponovat téměř žádnými vstupními znalostmi ztěchto odvětví. Vše mu bylo srozumitelně vyloženo od základů. Po probrání hlavních termínů statistiky (např. modus, medián, korelace) se vdruhé půli dne účastníci workshopu seznamovali sprogramemRaučili se zadávat první příkazy (jak načítat soubory, jak zobrazovat názvy proměnných, jak zjistit medián daného vektoru apod.). Účastníci si mohli do programuRnahrát svůj vlastní sou‑ bor dat azkoušet příkazy na něm. Vmožnosti zpracovat si vprogramu svá data shledáváme velkou přednost tohoto workshopu. Vpřípadě, že vlastní soubor účast‑ níci neměli, jim Dagmar Divjaková kprocvičování příkazů poskytla soubory svoje. Také další dva dny workshopového cyklu se skládaly ze dvou částí. První půle dne byla spíše výkladová apraktická cvičení prostupující výkladem probíhala na datech, která připravila vedoucí workshopu. Vdruhé půli dne měli účastníci možnost nabyté poznatky aplikovat na datech vlastních. Náročnost statistických funkcí, onichž Dagmar Divjaková hovořila ajež účastníci vzápětí zkoušeli provádět na svých datech, se každým dnem zvyšovala. Probrány byly například výpočet t ‑testu, chí ‑kvadrát testu či lineárních regresních modelů.
ADAm KŘíŽ —ŠTěPáN mATějKA 137 Workshop nabídl velmi dobrou základní orientaci práce vprogramuR. Účastníci workshopu se seznámili spočítáním výše uvedených statistických funkcí. Vpřípadě jakýchkoli potíží při práci sprogramem se mohli obrátit na Dagmar Divjakovou, která jim daný problém pomohla vyřešit. Vzhledem ke zmiňovanému neintuitivnímu uži‑ vatelskému prostředí ake složitosti zápisu příkazů se tato možnost ukázala jako velmi vítaná. Problém workshopu je možné spatřovat vteoretickém výkladu, respektive vná‑ ročnosti probíraných témat. Ve svém výkladu Dagmar Divjaková objasňovala některé základní informace ohledně sbírání dat pro statistickou analýzu aněkteré elemen‑ tární statistické pojmy ametody (viz výše). Mimo to se však věnovala také poměrně pokročilým výpočtům, jako jsou právě např. lineární regresní modely. Tato jistá dis‑ proporce vnáročnosti probíraných okruhů mohla především těm, kteří ve statistice nejsou dostatečně zběhlí, činit jisté potíže. Na druhou stranu je vzhledem kdélce workshopu takovýto rychlejší postup vprobíraných tématech pochopitelný. Celkově lze workshop hodnotit pozitivně. Dagmar Divjaková uvedla jeho účast‑ níky do práce sprogramemRvelmi dobře. Účastníci workshopu se budou muset sprogramem samozřejmě seznamovat ještě delší čas, než se vněm budou schopni bez problémů orientovat anež vněm budou schopni používat pokročilé funkce. Nicméně poté, co si práci vprogramuRřádně osvojí (kčemuž by mělo přispět iprostudování literatury, kterou účastníkům Dagmar Divjaková doporučila), bude statistické zpra‑ cování dat vněm nejen časově úsporné, ale ielegantní. Řezenský workshop jim měl pouze usnadnit první kroky na cestě ktomuto cíli. Atento úkol zdárně naplnil. Adam Kříž aŠtěpán Matějka Adam Kříž —Štěpán Matějka