scieee AI-readable full text Open interactive document viewer

Korpusy v jazykovém vyučování

Šormová, Kateřina,Šebesta, Karel

Abstract

Publikace Korpusy v jazykovém vyučování je určena učitelům, studentům učitelství i dalším zájemcům o vyučování jazyka. V první části se čtenář seznámí s teoriemi osvojování jazyka a jazykovým výzkumem, jsou mu představeny nejznámější a největší korpusy angličtiny, češtiny a výběrově i dalších jazyků s důrazem na korpusy akviziční, zejména na projekt AKCES. Pozornost je zaměřena také na typy korpusů a jejich parametry, tedy velikost, vyváženost, autentičnost, strukturní a poziční atributy. V druhé části publikace je představena práce s korpusy Českého národního korpusu, vyhledávání pomocí rozhraní KonText a pomocí aplikací SyD, Morfio, KWords, Treq a ukázka zapojení frekvenční analýzy do jazykového vyučování. Poslední část publikace tvoří pracovní listy věnované využití korpusových dat v jazykovém vyučování. Součástí pracovních listů je i podrobný popis metodického postupu a řešení zadaných cvičení.

Full text

Tomáš Gráf Věra Hejhalová Barbora Kukrechtová Karel Šebesta Kateřina Šormová ISBN 978–80–7308–897–2 KORPUSY V JAZYKOVÉM VYUČOVÁNÍ / K. Šormová, K. Šebesta a kol. KORPUSY V JAZYKOVÉM VYUČOVÁNÍ Kateřina Šormová, Karel Šebesta a kol. práce filozofické fakulty univerzity karlovy Publikace Korpusy vjazykovém vyučování je určena učitelům, studentům učitelství idalším zájemcům ovyučování jazyka. V první části se čtenář seznámí steoriemi osvojování jazyka ajazykovým výzkumem, jsou mu představeny nejznámější anejvětší korpusy angličtiny, češtiny avýběrově idalších jazyků sdůrazem na korpusy akviziční, zejména na projekt AKCES. Pozornost je zaměřena také na typy korpusů ajejich parametry, tedy velikost, vyváženost, autentičnost, strukturní apoziční atributy. Vdruhé části publikace je představena práce skorpusy Českého národního korpusu, vyhledávání pomocí rozhraní KonText apomocí aplikací SyD, Morfio, KWords, Treq aukázka zapojení frekvenční analýzy do jazykového vyučování. Poslední část publikace tvoří pracovní listy věnované využití korpusových dat v jazykovém vyučování. Součástí pracovních listů je ipodrobný popis metodického postupu ařešení zadaných cvičení. Tomáš Gráf Věra Hejhalová Barbora Kukrechtová Karel Šebesta Kateřina Šormová ISBN 978–80–7308–897–2 KORPUSY V JAZYKOVÉM VYUČOVÁNÍ / K. Šormová, K. Šebesta a kol. KORPUSY V JAZYKOVÉM VYUČOVÁNÍ Kateřina Šormová, Karel Šebesta a kol. práce filozofické fakulty univerzity karlovy Publikace Korpusy vjazykovém vyučování je určena učitelům, studentům učitelství idalším zájemcům ovyučování jazyka. Vprvní části se čtenář seznámí steoriemi osvojování jazyka ajazykovým výzkumem, jsou mu představeny nejznámější anejvětší korpusy angličtiny, češtiny avýběrově idalších jazyků sdůrazem na korpusy akviziční, zejména na projekt AKCES. Pozornost je zaměřena také na typy korpusů ajejich parametry, tedy velikost, vyváženost, autentičnost, strukturní apoziční atributy. Vdruhé části publikace je představena práce skorpusy Českého národního korpusu, vyhledávání pomocí rozhraní KonText apomocí aplikací SyD, Morfio, KWords, Treq aukázka zapojení frekvenční analýzy do jazykového vyučování. Poslední část publikace tvoří pracovní listy věnované využití korpusových dat v jazykovém vyučování. Součástí pracovních listů je ipodrobný popis metodického postupu ařešení zadaných cvičení. filozofická fakulta univerzity karlovy, 2019 KORPUSY V JAZYKOVÉM VYUČOVÁNÍ Kateřina Šormová, Karel Šebesta a kol. Kniha vznikla díky podpoře projektu Zvýšení kvality vzdělávání a začleňování žáků s OMJ spojené s jeho radikální inovací (CZ.07.4.68/0.0/0.0/16_037/0000299) a Kreativita a adaptabilita jako předpoklad úspěchu Evropy v propojeném světě (CZ.02.1.01/0.0/0.0/16_019/0000734). Recenzovali Mgr. Svatava Škodová, Ph.D. doc. PhDr. Milan Hrdlička, CSc. Mgr. Jarmila Valková, Ph.D. © Tomáš Gráf, Věra Hejhalová, Barbora Kukrechtová, Karel Šebesta, Kateřina Šormová, 2019 ©Univerzita Karlova, Filozofická fakulta, 2019 Za obsah a jazykovou správnost odpovídají autoři Všechna práva vyhrazena ISBN 978-80-7308-897-2 (online : pdf) Obsah Úvod 7 Seznámení s korpusy a korpusovou lingvistikou 1. Korpusy, jejich typy; korpusy češtiny (Karel Šebesta) 11 2. Teorie osvojování jazyka a korpusový výzkum (Tomáš Gráf) 16 2.1. Korpus a jazykové testování 17 2.2. Žákovský korpus a jazyk pro specifické účely 19 2.3. Analýza žákovského jazyka 21 2.3.1. Gramatika 22 2.3.2. Slovní zásoba 24 2.3.3. Frazeologie 27 2.3.4. Diskurz 29 2.3.5. Pragmatika 31 2.3.6. Plynulost 32 3. Významné parametry korpusů (Karel Šebesta) 34 3.1. Velikost 34 3.2. Vyváženost 37 3.3. Autentičnost jazyka 40 3.4. Strukturní atributy 43 3.5. Poziční atributy – lingvistická (a chybová) anotace 44 4. Práce s korpusem (Věra Hejhalová) 47 4.1. Český národní korpus (ČNK) 47 4.1.1. Materiál/Obsah 47 4.1.2. Vyhledávač neboli korpusový manažer 47 4.1.3. Vyhledávání 48 4.1.4. Volba korpusu 49 4.1.5. Typ dotazu 49 4.1.6. Zadání dotazu 51 4.1.7. Specifikace kontextu 52 4.1.8. Omezení hledání 53 4.1.9. Výsledky hledání 54 4.2. Korpusové aplikace 60 4.2.1. Aplikace SyD 61 4.2.2. Aplikace Morfio 65 4.2.3. Aplikace KWords 67 4.2.4. Aplikace Treq 70 Využití korpusů ve výuce 5. Náměty pro strategie vyučování a pro tvorbu pracovních listů 75 5.1. Frekvenční analýza (Kateřina Šormová) 75 5.2. Pracovní listy (Barbora Kukrechtová) 78 5.2.1. Prostředí KonText 79 5.2.2. Morfio 89 5.2.3. SyD 93 5.2.4. KWords 96 Použitá literatura 103 Profily autorů 105 Rejstřík 107 Resumé / Summary 109 7 Úvod Milí čtenáři, právě jste otevřeli publikaci Korpusy vjazykovém vyučování. Je určena učitelům, studentům filologických oborů, jazykovým lektorům ivšem dalším zájemcům ojazyk ajeho vyučování. Při přípravě této příručky jsme měli na mysli dva cíle. Prvním bylo představení jazykového korpusu jako nástroje, jehož prostřednictvím můžeme zajímavým způsobem zkoumat jazyk, pohlížet na něj zrůzných úhlů pohledu avurčitém smyslu si sním ihrát. Zejména se zaměřujeme na korpusy akviziční, obsahující jazyková data zprojevů mluvčích, kteří se jazyk teprve učí. Druhým cílem bylo poskytnout Vám inspiraci vtom, jak můžeme jazykový korpus využít při výuce češtiny jako cizího/druhého jazyka. Ztoho důvodu tvoří poslední kapitolu příručky několik pracovních listů, které by Vám měly posloužit jako návodná ukázka aktivit, které lze na základě práce skorpusem do vyučování přinést. Budeme rádi, pokud Vás přivedou ktvorbě Vašich vlastních aktivit apracovních listů založených na korpusových datech. Přejeme Vám příjemné čtení aradost zpráce sjazykem. Autoři 14 korpusy v jazykovém vyučování To platí ipro korpusy češtiny, také česká korpusová lingvistika navazuje na dlouhou abohatou tradici jinak než elektronicky zpracovávaných sběrů. První snahy ovytvoření centrální národní instituce, která by koncentrovaně rozvíjela korpusové aktivity pro češtinu, se objevují přibližně od druhé poloviny 80. let. Vr.1994 vznikl na FF UK pod vedením F. Čermáka Ústav Českého národního korpusu, který budování korpusů českého jazyka, obecných ispeciálních, zaštiťuje. Vsoučasné době nabízí: – synchronní korpusy psaného jazyka řady SYN, – specializované korpusy psaného jazyka různého zaměření, včetně akvizičních (vizdále), – synchronní korpusy mluveného jazyka řady ORAL anový korpus OR‑ TOFON, – specializované korpusy mluveného jazyka různého zaměření, včetně akvizičních (vizdále), – diachronní korpus DIAKORP, – paralelní korpus InterCorp, – srovnatelné korpusy Aranea, psané jednojazyčné webové aspeciální korpusy jiných jazyků, než je čeština. Pro učitele češtiny jako cizího jazyka mají význam vedle korpusů akvizičních primárně obecné korpusy češtiny, tedy korpusy řady SYN aORAL, resp. ORTOFON, pro vyšší anejvyšší úrovně apro některé speciální účely je využitelný korpus paralelní– InterCorp. Vedle korpusů Českého národního korpusu je pro učitele významný rovněž Pražský závislostní korpus, budovaný Ústavem formální aaplikované lingvistiky MFF UK; zněj vycházejí iněkteré didaktické pomůcky zaměřené na výuku syntaxe. Korpusy akviziční navazují na neméně dlouhou tradici systematického sběru jazykových dat pro účely studia osvojování apozdějšího vývoje jazyka dětí předškolního iškolního věku, studia jazyka mládeže jako specifické jazykové variety, jazyka nerodilých mluvčích, jazyka mluvčích postižených jazykovou poruchouapod.3 Vroce 2005 byl pod vedením K. Šebesty zahájen projekt AKCES (Akviziční korpusy češtiny) při Ústavu českého jazyka ateorie komunikace FF UK, na jeho vytváření se však významně podílejí idalší pracoviště.4 3 Ktéto akviziční tradici sběrů vmezinárodním idomácím výzkumu ake vzniku prvních akvizičních korpusů počítačových podrobněji vizŠebesta, 2010. 4 Ústav teoretické akomputační lingvistiky, Ústav formální aaplikované lingvistiky MFF UK, Ústav Českého národního korpusu, Ústav jazykové aodborné přípravy UK adalší. seznámení skorpusy akorpusovou lingvistikou 15 Projekt AKCES je pojat poměrně široce:5 zahrnuje postupné vytváření databází anávazně budování korpusů psaných imluvených zaměřených na: a. jazyk dětí předškolního věku, b. jazyk dětí amládeže od 5 do 24let, c. jazyk nerodilých mluvčích češtiny, d. jazyk sociokulturně znevýhodněných skupin, e. jazyk krajanských komunit, f. jazyk ve vzdělávacím kontextu. g. Poskytuje podporu rovněž korpusům terapeutickým. Jednotlivé korpusy jsou zveřejňovány zčásti vrámci Českého národního korpusu, zčásti vrámci Centra jazykové výzkumné infrastruktury LINDAT/ CLARIN6 Ústavu formální aaplikované lingvistiky MFF UK. Pro výuku nerodilých mluvčích jsou relevantní zejména: – korpusy žákovské (jazyka nerodilých mluvčích); znich byly dosud vrámci Českého národního korpusu7 zveřejněny korpusy řady CZESL (polovina korpusu CZESL ‑PLAIN, korpusy CZESL ‑SGT aCZESL ‑MAN– druhý znich není dosud veřejně přístupný), vrámci Centra LINDAT/ CLARIN pak korpus AKCES 5; volně se knim řadí ičeská část korpusu MERLIN, zpracovaná vrámci samostatně financovaného německo- -italsko -českého projektu;8 – korpusy jazyka žáků ze sociokulturně znevýhodňujícího prostředí– zkorpusů zveřejněných vrámci Českého národního korpusu sem patří ccačtvrtina korpusu CZESL ‑PLAIN, připravuje se kzveřejnění srovnávací korpus Compar, jehož polovinu tvoří data mluvčích ze sociokulturně znevýhodněných komunit; zkorpusů zveřejněných vrámci LINDATu jsou to korpusy AKCES 4 amluvený korpus ROMi_1.0; – korpusy písemných imluvených projevů českých žáků– vrámci Českého národního korpusu byl zveřejněn korpus písemných prací žáků SKRIPT2012; jejich mluvené projevy jsou zachyceny zčásti ve školníchdialozích přepsaných azveřejněných vkorpusech SCHOLA 2010 (na stránkách ČNK) aAKCES 2 ver 2. 5 Podrobnější informace ocelém projektu jsou na stránkách http://akces.ff.cuni.cz/. 6 https://lindat.mff.cuni.cz/cs/ 7 https://kontext.korpus.cz/first_form 8 https://merlin -platform.eu/ 16 korpusy v jazykovém vyučování 2. Teorie osvojování jazyka akorpusový výzkum Nauka ojazykové akvizici se zabývá zkoumáním procesů osvojování mateřského či cizího jazyka. Jakkoliv doklady ospekulacích opodstatě tohoto procesu nacházíme již ve starověku, jako vědní obor asoučást aplikované lingvistiky se ustavuje až vpolovině 20. století, kdy nachází své místo vuniverzitních studijních programech. Jako každý vědecký obor pracuje inauka ojazykové akvizici skonkrétními daty aod 80. let 20. století tato data stále častěji pocházejí ztzv.akvizičních korpusů. Jde ospeciální typ jazykových korpusů, které si nejlépe představíme jako počítačově zpracované aprohledávatelné sbírky textů, jejichž původci jsou ti, kdo si jazyk osvojují: děti osvojující si mateřštinu nebo studenti (ať už vdětském, či dospělém věku) osvojující si další, zpravidla cizí, jazyk. Existují přitom různé typy těchto korpusů vzávislosti na médiu (psaný či mluvený korpus), typu jazyka (mateřský či cizí) či charakteristice mluvčího (dítě, dospělý, mluvčí sřečovou poruchou, rodilý či nerodilý mluvčí, mluvčí ze sociokulturně či jinak znevýhodněné komunityaj.). Společné pak mají tyto korpusy to, že zachycují tzv.mezijazyk, tedy jazyk ve vývojové fázi, která ještě nedosahuje úrovně obvyklé pro dospělého rodilého mluvčího. Akviziční korpusy jsou tak sbírkou dokladů otom, jak osvojování probíhá ajaké jsou typické rysy osvojovaného jazyka. Umožňují tak hledat odpověď na řadu klíčových otázek, kterými se nauka oakvizici zabývá, jako jsou například role jazykového transferu (tj.vlivu mateřštiny na osvojování cizího jazyka) aodlišnosti mezi mezijazykem ajazykem rodilého mluvčího, jakož iodlišnosti ve vyjadřování různých mluvčích. Je tak možné srovnávat jazykový projev studentů srůznou mateřštinou, kteří si ale osvojují stejný cizí jazyk (např.angličtinu). Tradiční výzkum voblasti jazykové akvizice často pracoval somezenými vzorky dat anezřídka isintuicí badatelů aučitelů cizích jazyků. Často tak byly výsledky výzkumu přijímány svýhradou, že se zjištěné skutečnosti mohou týkat právě jen onoho omezeného vzorku mluvčích anedají se zobecnit. Akviziční korpusy naproti tomu poskytují velké množství dat sesbírané od desítek, stovek či tisíců mluvčích aposkytuje tak rozsáhlou bázi pro empirické ověřování hypotéz svelkou možností zobecnění závěrů. Specifickým azřejmě inejběžnějším typem akvizičních korpusů jsou korpusy žákovské (angl. learner corpora). Jsou vystavěny ztextů nerodilých seznámení skorpusy akorpusovou lingvistikou 17 mluvčích, kteří se učí cizí jazyk. Jazyk, který vyprodukují, pak označujeme jako jazyk žákovský (jakkoliv nezáleží na věku studenta; žákem je označován každý, kdo se učí). Zdrojem textů mohou být psané školní práce, materiály zjazykových zkoušek, přepsané nahrávky mluveného projevu či záznamy řečových úloh sestavených za účelem vytvoření samotného korpusu. Vkvětnu 2018 čítal seznam Learner corpora around the world9 167 žákovských korpusů. Další korpusy budou jistě inadále vznikat. Dalším typem akvizičních korpusů jsou korpusy osvojování mateřštiny. Nejznámější znich, korpus CHILDES10 (Child Language Data Exchange Sys‑ tem), začal vznikat již vr.1984 ashromažďuje data ze 130 specializovaných korpusů dětské řeči v26 jazycích. Korpus se posléze připojil kprojektu Talk‑ Bank, který obsahuje korpusy akvizice mluvčích sporuchami řeči (afázie), korpusy osvojování cizích jazyků, korpusy jazyka ve školních třídách akorpusy pro konverzační analýzu. Akviziční korpusy se vybavují různými systémy anotace. Ty přejímají buď zobecné korpusové lingvistiky (např.anotace slovnědruhová), nebo vytvářejí vlastní anotační systémy zachycující specifické rysy akvizice (např.jazykové odchylky, chyby či jiná specifika). Takto vybavené korpusy pak umožňují sofistikované metody vyhledávání ana nich založené analytické postupy, které dokážou odkrýt charakteristické rysy vyvíjejícího se jazyka, na jejichž základě je nezřídka možné formulovat ipedagogické závěry. 2.1. Korpus ajazykové testování Využití korpusů pro účely jazykového testování je jedním znejnovějších příkladů aplikace jazykových korpusů aje to bezesporu oblast, kde se do budoucna očekává velká aktivita, ato především voblasti definování apopisování úrovní pokročilosti. Současný stav výzkumu vtéto oblasti vychází především zmožností sběru dat při jazykových zkouškách. Takto získané vzorky žákovského jazyka, unichž je školenými examinátory stanovena jazyková úroveň např.dle Společného evropského referenčního rámce (SERR), se analyzují například zhlediska četnosti určitých jevů ana základě těchto analýz je pak možné popsat, které jazykové prostředky jsou charakteristické pro danou úroveň pokročilosti. Lingvistům se tak daří reagovat na časté kritické hlasy, které si všímají, že Společný evropský referenční rámec není dostatečně specifický avrámci popisu dovedností na jednotlivých 9 Centre for English Corpus Linguistics (date of access): Learner Corpora around the World. Louvain -la -Neuve: Université catholique de Louvain, https://uclouvain.be/en/research- -institutes/ilc/cecl/learner -corpora -around -the -world.html. 10 https://childes.talkbank.org 18 korpusy v jazykovém vyučování úrovních užívá příliš obecný jazyk. Výsledky tohoto výzkumu mají potenciál přispět klepší srovnatelnosti. Zatím nejvýznamnějším anejrozsáhlejším počinem vtéto oblasti je projekt English Profile11 (organizovaný University of Cambridge, Cambridge University Press aCambridge English Language Assessment apodpořený Evropskou komisí). Zdat zjazykových zkoušek na všech úrovních angličtiny dle SERR byl sestaven korpus ana jeho základě pak seznamy slovní zásoby (English Vocabulary Profile) agramatiky (English Grammar Profile) typické pro jednotlivé úrovně SERR. Tuto bezplatnou databázi mohou využívat učitelé, studenti či autoři jazykových materiálů aověřit si, jaký konkrétní jazyk mluvčí různých úrovní angličtiny dokážou používat. Očekává se, že tento výzkum se zpětně promítne ido vývoje dokonalejších, empiricky založených technik zjišťování jazykové pokročilosti. Největším žákovským korpusem, který vznikl na základě sběru materiálů ztestů, je Cambridge Learner Corpus, který obsahuje vsoučasnosti přes 57 milionů slov psaného žákovského jazyka od více než čtvrt milionu mluvčích. Korpus je přitom inadále rozšiřován. Dalším významným projektem je The Longman Learners‘ Corpus, který poskytl podklady pro sestavení jazykových doporučení vžákovském slovníku Longman Active Study Dictionary. Mnoho nových výzkumných projektů nyní vzniká na základě mluveného korpusu žákovské angličtiny Trinity ‑Lancaster Corpus, který je sestaven znahrávek apřepisů ústních zkoušek zangličtiny při zkouškách Graded Examinations in Spoken English organizovaných Trinity College vLondýně. Zatím zde však jde pouze oúrovně B1–C1. Pro účely vývoje jazykových testů se však využívají ikorpusy jazyka rodilých mluvčích. Například T2K ‑SWAL Corpus je souborem akademických textů, které se analyzují zpohledu analýzy diskurzu ažánrů. Výsledek tohoto výzkumu vedl ksestavení Test of English as aForeign Language, TOEFL iBT. Největší výhodou využití korpusové lingvistiky voblasti jazykového testování je bezesporu to, že jazykové korpusy (ať už žákovského jazyka, nebo jazyka rodilých mluvčích) umožňují empiricky ověřit intuici tvůrců testových materiálů apřipravit tak testy, které ověřují odpovídající jazykovou úroveň. To se může dít nejen na základě výzkumu toho, co mluvčí skutečně vjazyce dokážou, ale itoho, kde se odchylují od běžných norem (např.je možné zkoumat, jaké chyby jsou typické pro různé úrovně pokročilosti). Tvůrci jazykových testů se přitom mohou opřít oseznamy slov ajazykových struktur vygenerovaných zžákovských korpusů pro jednotlivé úrovně pokročilosti amohou na datech zkorpusu rovněž zkoumat, jak různé typy úloh ovlivňují výkon vtestu ajak se určité gramatické či lexikální jevy 11 http://www.englishprofile.org seznámení skorpusy akorpusovou lingvistikou 19 vsouvislosti srostoucí pokročilostí proměňují. Cílem tohoto výzkumu je přispět ke zlepšování podoby avlastností jazykových testů. Pro účely jazykového testování se však dají využít ikorpusy běžné (pro angličtinu např.korpusy British National Corpus či Corpus of Contemporary American English), ato jako zdroj textů, které si mohou učitelé dle zadaných kritérií vyhledat avytvořit si tak testy na slovní zásobu či gramatiku. Takto získaná korpusová data jsou autentická ajazykově obvykle isprávná (co je vkorpusu vdaném registru či žánru frekventované, to zpravidla odpovídá zavedenému úzu/normě, atudíž odráží kodifikaci). 2.2. Žákovský korpus ajazyk pro specifické účely Jazykem pro specifické účely označujeme jazyk, který je užíván například vpracovním či akademickém prostředí akterý se řídí určitými pravidly příslušného funkčního stylu (např.styl odborný, publicistický aadministrativní), nezřídka je charakterizován ispecifickou slovní zásobou. Jeho znalost umožňuje uživatelům začlenit se do skupiny lidí, odborníků či profesionálů, kteří takový jazyk typicky používají akteří mají specifické komunikační potřeby azvyklosti. Jazyk pro specifické účely je od 60. let 20. století intenzivně zkoumán, což má mj.dopad ina jazykové vyučování, ato obzvláště pro angličtinu, která plní roli jazyka mezinárodní komunikace právě vprofesní oblasti. Je také vtomto ohledu nejlépe popsána. Existují tak četné učebnice odborného jazyka, slovníky, aplikace aspecializované jazykové kurzy. Rozlišuje se přitom mezi angličtinou pro pracovní účely (English for Occupational Purposes) aangličtinou pro účely akademické (English for Academic Purposes). Angličtina pro pracovní účely se nezaměřuje pouze na specifickou slovní zásobu (např.terminologii), ale především na to, jakým způsobem se vtěchto oblastech lidské činnosti komunikuje, aby komunikace byla efektivní apro dané účely vyhovující. To se týká jak jazyka psaného (např.obchodní korespondence, instruktážní texty), tak mluveného (např.komunikace lékařů spacienty, komunikace vleteckém provozu). Výzkum angličtiny pro akademické účely se zabývá celou škálou užití angličtiny vakademickém prostředí od interakcí mluvených (např.prezentace na konferencích) až po psaní akademických textů. Tato oblast je natolik široká, že se dále rozlišuje mezi angličtinou pro obecné apro specificky oborové akademické účely. Do této oblasti se nezřídka zahrnují ispecifické jazykové astudijní dovednosti anávyky (např.pořizování poznámek, práce sliteraturou, organizace textu), ale například iprezentační, rétorické techniky. Pedagogické úsilí vtéto nesmírně stratifikované oblasti pak směřuje především ktomu, aby byly naplněny potřeby studentů auživatelů jazyka vté které specializaci. 20 korpusy v jazykovém vyučování Korpusová lingvistika hraje vpopisu jazyka pro specifické účely nezastupitelnou roli. Disponuje totiž technikami, jak shromáždit dostatečně velké vzorky reprezentativních ukázek odborného jazyka, na jejichž základě je možné popsat jeho typické rysy. To je důležité jak pro tvorbu pedagogických materiálů, tak pro zkoumání projevu těch, kdo si tento jazyk osvojují vrámci jiného jazyka, než je jejich mateřština. Zkoumají se např.frekvenční vzorce vjednotlivých stylech aje tak možné velmi přesně určit, která specifická slovní zásoba je pro daný styl charakteristická. Na základě korpusu The Academic Corpus12 tak například vznikl seznam akademické slovní zásoby pro angličtinu (Academic Word List13), který je pro mezinárodní studenty neocenitelnou pomůckou při studiu akademické angličtiny apři psaní akademických textů. Využití pak samozřejmě nachází ipři výuce asestavování jazykových testů. Vedle textů napsaných rodilými mluvčími se však analyzují iakademické texty nerodilých mluvčích. Vznikají tak speciální žákovské korpusy akademického žákovského jazyka. Izde zcela převládají korpusy angličtiny. Jde obvykle odatabáze psaných úloh (esejů, písemných zkoušekatp.) vzniklých na univerzitách. Jazyk, který vdaném kontextu studenti používají, je charakteristický jak užitím terminologie, tak užitím specifických typů argumentace apostupů při výkladu. Jedním zprvních takových korpusů je International Corpus of Learner English (ICLE), který začal vznikat vBelgii, na Université catholique de Louvain, v80. letech 20. st. Práce na něm stále pokračuje, ač korpus vsoučasné době obsahuje eseje vrozsahu 3,7 milionu slov od pokročilých studentů angličtiny z16 různých zemí, respektive s16 rozdílnými mateřskými jazyky. Na stejném pracovišti se nyní rodí nový korpus akademické angličtiny snázvem Varieties of English for Academic Purposes (VESPA). Korpus je tvořen národními subkorpusy mluvčích srozdílnou mateřštinou. Je tak možné nejen zkoumat specifika vyvíjejícího se akademického jazyka ustudentů, ale zároveň srovnávat, do jaké míry může být jeho podoba ovlivněna mateřštinou. Dalšími významnými korpusy vtéto oblasti jsou British Academic Written English (BAWE) aamerický Michigan Corpus of Upper ‑level Student Papers (MICUSP) ajejich mluvené protějšky British Academic Spoken English (BASE) aMichigan Corpus of Academic Spoken English (MICASE). Tyto čtyři korpusy jsou přitom ze zhruba 80% tvořeny psaným projevem rodilých mluvčích, což umožňuje srovnávat jazyk cizojazyčných studentů sjazykem rodilých mluvčích. To je vžákovské korpusové lingvistice běžný přístup anezřídka jsou žákovské korpusy doplňovány okontrolní korpusy textů rodilých mluvčích, které jsou koncipovány tak, aby měly stejnou strukturu 12 https://www.victoria.ac.nz/lals/resources/academicwordlist/information/corpus 13 Pro češtinu je dostupný nástroj Akalex, vizwww.korpus.cz/akalex. seznámení skorpusy akorpusovou lingvistikou 21 apodobaly se kvůli srovnatelnosti vco největší možné míře. Korpus ICLE je takto doplněn oLouvain Corpus of Native English Essays (LOCNESS), tedy korpus stejně zadaných esejů psaných rodilými mluvčími. Takový přístup však skrývá ijedno zásadní úskalí, atím je implicitní předpoklad, že text rodilého mluvčího je zpodstaty věci dokonalejší. Stranou přitom zůstává, zda jsou vybraní autoři zřad rodilých mluvčích kvalitními autory. 2.3. Analýza žákovského jazyka V50. letech 20. století se někteří lingvisté14 zabývali výzkumem jazyka za účelem zdokonalení metod jeho výuky. Vycházeli přitom zpředpokladu, že je snazší naučit se jazyk, který je podobnější žákově mateřštině, aže podrobný popis podobností arozdílů mezi mateřským jazykem ajazykem cizím je užitečnou pomůckou pro výuku apro tvorbu jazykových učebnic. Předpokládali, že žáci budou chybovat vtěch aspektech, které jsou rozdílné, anaopak snazší pro ně budou ty rysy, které jsou si mezi jazyky podobné. Domnívali se, že když se výuka bude zaměřovat především na tyto odlišnosti, žáci vnich nebudou chybovat. Skutečnost se ukázala být složitější apostupným výzkumem se ukázalo, že výuka vycházející ze srovnávání jazyků není zárukou bezchybného projevu žáků. Toto období bylo rovněž počátkem zájmu ožákovský jazyk, ato především ochyby, kterých se žáci dopouštějí při psaní či mluvení. Chyby byly analyzovány ze všech stran alingvisté se je pokoušeli pochopit vnaději, že objeví důvod, proč žáci chybují, abudou tak moci vyvinout dokonalejší výukové metody, které žákům umožní nechybovat. Stále více lingvistů však upozorňovalo, že chyby jsou nedílnou součástí učení aže představují doklad ovývoji pokročilosti aotom, že učení se cizímu jazyku je systematický proces. Tuto teorii završil vroce 1972 americký lingvista Larry Selinker formulací teorie tzv.mezijazyka. Selinkerův mezijazyk je dynamický, proměnlivý systém, který se vžákově mysli formuje na základě jeho zkušeností sjazykem akterý mu umožňuje cizí jazyk používat. To je možné díky pravidlům, která si vytváří sám žák, ato na základě výuky, učení se, kontaktu sosvojovaným jazykem adalších faktorů. Existence mezijazyka je základním principem, zněhož vychází výzkum jazykové akvizice. Data pro tento výzkum pak pocházejí stále častěji zžákovských korpusů. Ty umožňují analyzovat osvojování gramatiky, slovní zásoby, frazeologie, diskurzu, stylistiky, pragmatiky asnástupem videokorpusů vbudoucnosti ivýzkum nonverbální komunikace. 14 Např.Robert Lado, Charles Fries, Pitt Corder. 22 korpusy v jazykovém vyučování 2.3.1. Gramatika Vcentru zájmu při zkoumání žákovského jazyka stojí gramatika aslovní zásoba, které jsou vnímány jako dva základní komponenty znalosti cizího jazyka. Cílem žákovské korpusové lingvistiky vtéto oblasti je popsat, jakým způsobem studenti používají gramatiku cizího jazyka, který se učí, astanovit příslušné pedagogické postupy, které ztěchto informací vyplývají. Žákovská korpusová lingvistika má tedy velmi blízko kpedagogice adidaktice apřispívá kvytváření tzv.pedagogických gramatik, tzn.popisů cizojazyčných gramatických systémů při současném zohlednění možných postupů při jejich výuce. Ktomu, aby mohla být zkoumána gramatika vžákovském jazyce za použití žákovských korpusů, musí být tyto korpusy doplněny oanotace. Anotace jsou značky, které lingvisté doplňují do korpusu proto, aby se vněm dal vyhledávat nejen konkrétní řetězec znaků (např.slovo), ale ispecifická jazyková informace např.oslovním druhu či přítomnosti chyby. Rozlišujeme tak především značkování morfologické achybové. Zatímco morfologické značkování je možné provést víceméně automaticky svyužitím počítačových programů, značkování chybové se provádí ručně aje značně náročné na čas. Při morfologickém značkování je každému slovu přiřazena informace oslovním druhu apříslušném jazykovém tvaru. Díky tomu můžeme při vyhledávání vkorpusu zadat např.české slovo bez astanovit přitom, chceme -li, aby výsledky vyhledávání zahrnuly slovo bez jako podstatné jméno, či jako předložku. Pro žákovské korpusy jsou pak typické značky chybové, které se přiřazují všem výskytům chyb vjazykovém projevu, ať už jsou na úrovni gramatické, pravopisné, lexikální, či jiné. Chybová anotace se často vkládá přímo do textu. Označuje se přitom chybný tvar ačasto se doplňuje isprávná varianta (tzv.emendace). Jako příklad uveďme systém užívaný pro chybové značkování korpusu ICLE (vizvýše). Tento systém využívá značky složené zpísmen. Ty se vkládají před chybně užitý tvar. Na prvním místě bývá označení typu chyby (tj.jde- -li opravopis, gramatiku, slovní zásobu, lexikálně -gramatický jev či slovosled). Ve větě označené Příklad 1 je ukázáno, jakým způsobem je možné označkovat chybné užití gramatického času vanglické větě. Student ve větě chybně užil přítomný čas, proto je před chybným tvarem slovesa live vložena značka (GVT). Ta označuje, že jde ogramatickou chybu (G) týkající se třídy sloves (V, anglicky verb) akategorie času (T, anglicky tense). Po slovesu je vložena emendace, tedy návrh anotátora na to, jak by mohla znít správná věta. Vtomto případě anotátor navrhuje, aby místo tvaru přítomného času slovesa live bylo užito předpřítomného průběhového času. seznámení skorpusy akorpusovou lingvistikou 23 původní věta: Ilive in Prague for ten years anotovaná věta: I(GVT) live $have been living$ in Prague for ten years Příklad 1: Ukázka chybové anotace anglické věty– gramatika Vtakto označkovaném korpusu je pak možné jednotlivé chybové značky vyhledávat anechat si zobrazit třeba právě všechny věty schybou vpoužití časů. Ty se pak dají dále analyzovat, případně je možné jich využít pro tvorbu cvičení pro výuku. Specifické uplatnění tyto postupy nacházejí při tzv.kontrastivní analýze mezijazyka, při níž se porovnává psaný nebo mluvený projev žáků sodlišnými mateřskými jazyky (např.angličtina Čechů aŠpanělů). Dají se tak odhalit podobnosti či rozdíly azkoumat, zčeho tyto rozdíly pramení. Častým zdrojem chyb přitom bývá tzv.jazykový transfer, kdy si žák přenáší do svého cizojazyčného projevu prvky ze své mateřštiny. Jako ukázka nám znovu může posloužit Příklad 1, uněhož se můžeme domnívat, že chybné užití přítomného času vangličtině pramení ztoho, že je vodpovídající větě včeštině používán právě přítomný čas (Bydlím vPraze už deset let.). Je -li označkován celý korpus, je možno přistoupit kanalýze chyb. Chyby se vyhledají aroztřídí do kategorií podle různých kritérií. Spoužitím statistických nástrojů je pak možné ověřovat hypotézy osouvislosti mezi chybovostí anejrůznějšími žákovskými proměnnými, jako jsou např.jazyková úroveň, věk, mateřský jazyk, délka studia nebo pobyt vzahraničí. Na základě chybové analýzy je pak možné sestavit katalogy chyb, které mohou být návodné pro výuku nebo se dají využít při psaní výukových materiálů. Jazykové učebnice aslovníky určené pro žáky angličtiny tak dnes nezřídka obsahují informace očastých chybách. Jsou návodné nejen pro žáky, ale ipro učitele. Existuje dokonce islovník chyb vangličtině,15 který obsahuje více než 2500 příkladů běžných chyb, vysvětlení daných jevů aukázky správného užití zBritish National Corpus. Zkoumat se ale nemusí pouze chyby. Srovnáváním jazyka rodilých mluvčích sjazykem žákovským je možné zjistit, co je pro žákovský jazyk charakteristické například frekvenčně, tj.které jevy se objevují častěji akteré méně často. Mluví se pak onadužívání či naopak menší míře používání určitých gramatických jevů. Takové analýzy jsou pak užitečné například pro výuku jazyka pro specifické účely (např.akademická angličtina, vizvýše). Jedním znejzajímavějších apro učitele angličtiny zřejmě inejužitečnějších využití žákovských korpusů voblasti gramatiky je projekt English 15 Turton, N.D. and J.B. Heaton (1996). Longman Dictionary of Common Errors. Harwich: Longman. 30 korpusy v jazykovém vyučování Ukázkovým příkladem využití korpusu vtomto směru je významná gramatika anglického jazyka Longman Grammar of Spoken and Written English.20 Vychází zkorpusu Longman Spoken and Written Corpus, který obsahuje 40 milionů slov z37 244 textů čtyř základních typů: konverzace, beletrie, žurnalistika aakademický text. Na jeho základě byl velmi přesně popsán například jazyk konverzace: bylo shledáno, že je bohatý na nevětné struktury, neúplné věty (vynechávají se například slova snízkou informační hodnotou) austálená víceslovná spojení, která plní různé funkce (např.mluvčí indikuje, že bude pokračovat vpromluvě, že se vrací kpůvodnímu tématuatp.). Obsahuje zároveň itzv.prostředky řečového managementu, které mluvčímu umožňují hovořit plynule. Sem patří např.výplňková slova avýplňkové pauzy, jejichž funkcí může být získání času pro plánování další promluvy nebo indikace, že mluvčí ještě současnou promluvu nedokončil. Tento výzkum inspiroval didaktiku cizích jazyků ktomu, aby se zaměřila nejen na tradiční výuku gramatiky založenou na psaném jazyce, ale ina jazykové prostředky charakteristické právě pro jazyk mluvený. Žákovská korpusová lingvistika pak vtéto oblasti zkoumá, do jaké míry tyto prostředky žáci využívají ajaké prostředky se naopak vjejich projevech vyskytují omezeně. Dalším zústředních témat je výzkum textové koherence. Jako koherenci označujeme sémantické, obsahové vztahy uvnitř diskurzu, které zajišťují jeho soudržnost, smysluplnost aplynulost. Mezi jednotlivými částmi koherentního textu totiž musí být patrná souvislost. Toho je možné dosáhnout používáním kohezních prvků, které explicitně naznačují, jak jsou jednotlivé úseky textu propojeny. Mezi tyto prvky patří například reference (odkazování na to, co již bylo řečeno, nebo na to, co bude vtextu následovat), konektory (spojovací výrazy vyjadřující logický vztah mezi jednotlivými částmi), substituce (použití jiného slova, které jasně odkazuje na to, co již bylo vyřčeno) atematicko -rematická struktura textu (tzv.aktuální členění větné). Výzkum koherence za použití korpusů je komplikovaný, neboť korpus neumožňuje zobrazit dlouhé úseky textu. Nejčastěji se proto pracuje právě sexplicitními kohezními prvky (obzvláště konektory), které je možno vkorpusu vyhledávat. Vžákovském jazyce se pak často zjišťuje, jak žáci tyto prostředky dokážou využít avjakých funkcích ajak jejich prostřednictvím vytvářejí strukturu textu. To má význam především při studiu avýuce akademického psaní. Ivtéto oblasti se využívají kontrastivní studie, které srovnávají texty žákovské stexty rodilých mluvčích. Pro vědecký text je též typické využívání rétorických prostředků pro zeslabování jistoty tvrzení (tzv.hedge) nebo jeho zesilování (tzv.booster). Ty se realizují použitím různých prostředků, např.modálních sloves (např.vý‑ 20 Biber, D., Stigg, J., Leech, G., Conrad, C. aE. Finegan. (1999) Longman Grammar of Spoken and Written English. Harlow: Pearson Education Limited. seznámení skorpusy akorpusovou lingvistikou 31 sledky mohou naznačovat, že…), adverbií (např.tento výsledek nejspíš vypovídá o…)aj. Itoto je oblast, kterou si nerodilý mluvčí píšící vědecký text vcizím jazyce musí osvojit. Vžákovských korpusech akademického jazyka pak můžeme zkoumat, do jaké míry se to daří avčem spočívají odlišnosti od textů rodilých mluvčích či kompetentnějších autorů. Častým zjištěním je, že méně zkušení autoři nadužívají určitých prostředků modalizace vědeckého textu anevyužívají dostatečně jiných možností. Vneposlední řadě lze žákovský text korpusově analyzovat izpohledu zastoupení osobních zájmen ačinného či trpného rodu azjistit tak, do jaké míry dokáže žák prezentovat objektivní, neosobní vědecký text ajaké prostředky dokáže využít, když jako autor do textu potřebuje vstoupit například prezentováním svého postoje. 2.3.5. Pragmatika Pragmatika studuje jazyk zpohledu mluvčího apříjemce ataké to, jakým způsobem tito uživatelé jazyka dosahují svých komunikačních záměrů. Zkoumá tedy, jaký záměr má mluvčí, když něco sděluje, ajak je jeho sdělení interpretováno příjemcem. To závisí na takových faktorech, jako je například kontext promluvy či vztah mezi mluvčím apříjemcem, roli hraje ipříslušná jazyková kultura. Tyto faktory pak spolu svýznamem slov ovlivňují význam adopad celého sdělení. Podle teorie řečových aktů, která stojí vcentru pozornosti pragmatiky, je možné promluvou nejen něco prostě sdělit, ale iněco chtít, kněčemu se zavázat, kněčemu vyjádřit svůj postoj, případně vyřčením způsobit nějakou změnu. Vžákovském jazyce je pak možné tyto řečové akty identifikovat azjistit, jaké prostředky pro jejich vyjádření mluvčí používá. Izde je výhoda korpusů především ve zpřístupnění velkého objemu dat kvýzkumu, který může být navíc prohledáván automatickými algoritmy za účelem identifikovat vzorce, které se vtextu objevují. Kdiskurzní apragmatické analýze korpusů musejí být korpusy anotovány. To je však značně časově náročný ane vždy příliš snadný úkol, především vzhledem knutnosti správně vystihnout ainterpretovat původní záměr mluvčího.21 Zkoumají se tak například funkce tzv.diskurzních částic, což jsou prostředky, které umožňují vrozhovoru udržovat kontakt mezi mluvčími (např.angl. you know nebo české víte) ajsou vkorpusech snadno vyhledatelné. Výzkum též dokládá, že užívání diskurzních částic přispívá ke zvýšení plynulosti mluveného projevu azvyšuje jeho přirozenost. Zhlediska funkčního se značkují například korpusy zabývající se výzkumem specifických textových žánrů aútvarů. Existují např.korpusy 21 Jeden zpříkladů pragmatické anotace korpusu je nástroj DART, více viz např. Weisser, M. (2018) How to Do Corpus Pragmatics on Pragmatically Annotated Data Speech acts and beyond. Studies in Corpus Linguistics: John Benjamins. 32 korpusy v jazykovém vyučování abstraktů (tj.krátkých shrnutí akademického textu). Vnich jsou identifikovány aoznačkovány příslušné rétorické kroky (např.zasazení tématu do kontextu, stanovení cíle studieatp.), následně pak mohou být tyto rétorické postupy zkorpusu extrahovány aje možné zkoumat, jakými jazykovými prostředky jsou realizovány. Žákovský jazyk se zde znovu obvykle srovnává sjazykem rodilých mluvčích, ale provádějí se isrovnání mezi různými vědeckými obory ve snaze zefektivnit tento typ psané komunikace. Studium pragmatiky ukazuje, že žák cizího jazyka musí kromě gramatiky aslovní zásoby ovládnout ipravidla komunikace, která jsou běžná pro sociokulturní prostředí, vněmž se tento jazyk používá. Nejde jen oto, aby žák dosáhl svého komunikačního cíle, ale také aby svým jazykovým projevem neporušoval běžné (např.zdvořilostní) normy adokázal pro svá sdělení volit prostředky, které odpovídají konkrétní situaci, vníž se komunikace odehrává. Jakkoliv je tato oblast důležitá pro výzkum ivýuku, korpusové studie vtéto oblasti jsou zatím omezené. 2.3.6. Plynulost Snástupem korpusů zachycujících mluvený jazyk, jež jsou sohledem na nutnost nahrát apřepsat texty náročnější na sestavení než korpusy psané, se korpusově začínají zkoumat icharakteristiky řeči. Jednou ztakových oblastí je výzkum plynulosti. Plynulost je obtížně definovatelný pojem, pod kterým si však nejsnáze představíme produkci řeči vdostatečném tempu abez velkého množství prvků, které bezprostředně nesouvisejí svýznamem sdělení, jako jsou např.různé projevy váhání. Tempo mluvy lze vkorpusech měřit pouze tehdy, pokud jsou dostupné ipůvodní nahrávky. Uvádí se obvykle ve slovech za minutu či slabikách za vteřinu. Upokročilých studentů angličtiny zjišťujeme průměrné tempo mluvy asi 150 slov za minutu, urodilých mluvčích pak více než 180 slov za minutu. Mezi jevy, které tzv.narušují plynulost projevu, se řadí kupříkladu vyplněné anevyplněné (tiché) pauzy (např.byl jsem eh unavený), opakované segmenty (např.nevím co se co se přesně stalo), nedokončené segmenty (např.byl jsem šel jsem tam pěšky), opravy (např.vzala mě nás na výlet), fragmentovaná slova (např.to nemu nemuselo být) aprodlužování slabik (např.řekl mi žeee). Také tyto jevy se vkorpusech značkují. Pak je možné zjistit nejen jejich frekvenci, ale ito, na jakém místě se vpromluvě vyskytují. Jedním zrozdílů mezi žákovským jazykem ajazykem rodilého mluvčího je to, že žáci častěji umísťují tyto prvky mezi jednotlivé části frází, které rodilí mluvčí zpravidla vyřknou najednou (např.velký eh význam má). Vypovídá to zřejmě otom, že rodilí mluvčí jsou schopni rychleji plánovat promluvu aprodukují tak delší celky azároveň váhají spíše na jejich začátcích než vjejich průběhu. seznámení skorpusy akorpusovou lingvistikou 33 Všechny tyto prvky lze srovnávat na různých úrovních pokročilosti ataké mezi žáky arodilými mluvčími. Zkoumat lze ito, jaký efekt má na plynulost ajejí součásti typ úlohy, který žáci řešili (např.šlo -li omonolog, dialog, projev spředchozí přípravou, popis obrázkuatp.). Tento výzkum pak krom studia pokročilosti arozdílů mezi žákovským arodilým jazykem přispívá ikpoznání, jakým způsobem je produkována řeč. Vdidaktice má tento výzkum význam především pro oblast testování, neboť poskytuje popis ukazatelů charakteristických pro plynulost projevu, což se uústních jazykových zkoušek nezřídka hodnotí azároveň je ijedním zparametrů popisovaných Společným evropským referenčním rámcem. Vtéto kapitole jsme se pokusili nastínit, co jsou akviziční korpusy ajak se využívají při výzkumu žákovského jazyka za účelem jeho poznání anavržení možných didaktických postupů. Akviziční korpusy umožňují zkoumat žákovský jazyk zrůzných pohledů, srovnávat, jak se mění na jednotlivých úrovních pokročilosti ajaké jazykové prostředky aprojevy tyto úrovně charakterizují. Dále umožňují srovnávání sjazykem rodilých mluvčích jako přirozeným cílem velké části žáků cizích jazyků avneposlední řadě poskytují iempiricky ověřená zjištění využitelná při tvorbě jazykových materiálů (učebnic, slovníků, aplikací), jazykových testů adidaktických postupů. Jakkoliv je žákovská korpusová lingvistika oborem mladým, přinesl již výzkum ve všech těchto oblastech cenné výsledky apředevším prokazuje, že akviziční korpusy mají velký výzkumný ipedagogický potenciál, zněhož mohou čerpat nejen badatelé, ale iučitelé, studenti atvůrci jazykových testů asylabů. 34 korpusy v jazykovém vyučování 3. Významné parametry korpusů Ukorpusů obecných se předpokládá, že směřují knaplnění určitých závazných parametrů. Jde zejména ovelikost avyváženost korpusu aoautentičnost jazykových dat, která korpus zahrnuje. Uvedené tři parametry zajišťují jeho reprezentativnost ve vztahu knormálnímu, obvyklému jazykovému úzu. Dalším důležitým parametrem je soustavné zaznamenávání informací opůvodu jednotlivých složek (textů), které jsou vněm zařazeny, ojejich autorech, žánru adalších údajů relevantních pro práci skorpusem. Tyto metatextové informace jsou přiřazeny všem strukturním jednotkám korpusu formou strukturních atributů. Kuvedeným parametrům přistupuje lingvistické značkování (lingvistická anotace), tj.připojování lingvistické interpretace kjednotlivým tokenům (výskytům, textovým pozicím) formou pozičních značek. Každé slovo tedy mívá přidělený základní slovníkový tvar adále značku, obvykle smorfologickými či méně často se syntaktickými informacemi. Korpusy speciální se vyznačují tím, že některý či některé ztěchto parametrů porušují, nenaplňují, případně ve snaze ojejich naplnění postupují specifickým způsobem, některé parametry rozšiřují (strukturní atributy, lingvistické značkování)apod.22 3.1. Velikost Obecné korpusy usilují omaximální možnou velikost. Čím větší objem jazykového materiálu zahrnují, tím větší je pravděpodobnost, že odrážejí reálný jazykový úzus aže budou využitelné iujevů méně frekventovaných. Větší velikost rovněž umožňuje, aby byly vkorpusu zahrnuty všechny relevantní variety daného jazyka vodpovídajících proporcích, tedy aby byl vyvážený aaby bylo možné považovat ho za reprezentativní vůči normálnímu, ob22 Ktematice obecných korpusů akorpusové lingvistiky podrobněji např.Mc Enery - Hardie (2012), kakvizičním korpusům, zvl. pro češtinu, Šebesta (2010), Šebesta - Škodová (2012), Štindlová (2011), kaktuálním datům onabídce korpusů pro češtinu akorpusů žákovských https://wiki.korpus.cz/doku.php/cnk:uvod, resp. Learner corpora around the world; ztěchto zdrojů tato iprvní kapitola převážně čerpají. seznámení skorpusy akorpusovou lingvistikou 35 vyklému užívání jazyka. Díky tomu mohou tyto korpusy dobře sloužit pro tvorbu slovníků, gramatik, thesaurů adalších referenčních knih. Velikost synchronních korpusů vposledních desetiletích rychle roste. Zatímco vpočátcích korpusové lingvistiky, v60. a70. letech minulého století, se velikost korpusů uváděla vmilionech tokenů (konkrétní výskyt každého slovního tvaru vtextu),23 udnešních korpusů se uvádí vmiliardách. Např.Český národní korpus jako zastřešující projekt zajišťující budování korpusů českého jazyka na Univerzitě Karlově zahrnuje kdatu vzniku tohoto textu relativně nově český synchronní korpus SYN verze 6 ovelikosti cca4 miliardy slov, patří tedy mezi tzv.korpusy velké (pohybující se vřádu stovek milionů až vmiliardách textových slov). Vedle toho rozlišujeme dnes ještě korpusy střední (obsahující řádově desítky milionů textových slov) akorpusy malé (pohybující se vřádu stovek tisíc textových slov). Isebevětší korpus je ovšem menší než web– největší existující avolně dostupný soubor textů. Iweb lze využívat jako korpus; byla vyvinuta rozhraní, která kvyužití webu jako korpusu slouží– např.WebCorp.24 Web jako korpus má některá specifika, která se mohou jevit jako výhody, nebo nevýhody, vzávislosti na cíli, který při vyhledávání sledujeme. Většinou je nepochybnou výhodou webu jako korpusu jeho velikost. Některé výrazy či kolokace, které jsou málo frekventované, mohou vobyčejném korpusu úplně chybět nebo mít jen mizivé zastoupení, totéž platí ioněkterých druzích málo frekventovaných pravopisných či jiných formálních odchylek či variant, málo frekventovaných typů užitíapod., které na webu– vzhledem kjeho velikosti– můžeme najít svyšší úspěšností než vkorpusu. Hlavním problémem webu jako korpusu je skutečnost, že nám podává jazykový materiál vnerozlišené směsi textů různých typů, není tedy možné posoudit ani jeho skladbu, ani kontext užití hledaných jevů. To se může jevit jako značná potíž např.vpřípadech, kdy hledáme velmi frekventované jazykové jevy apotřebujeme počet nalezených řádků redukovat podle nějakých lingvisticky relevantních kritérií. Dalším problémem je nestálost webu– web se neustále aprůběžně mění, výzkum, který na něm byl založen, tedy není možné replikovat nebo jen velmi obtížně. Výhodou standardního obecného korpusu ve srovnání swebem je tedy jeho promyšlené složení zrůzných typů textů vnáležitých proporcích, větší nebo menší míra jeho vyváženosti, jeho relativní ustálenost azaznamenávání metatextových informací. Žákovské korpusy se co do velikosti od korpusů obecných výrazně liší, přesněji řečeno, jsou vtomto ohledu podstatně pestřejší. Žákovské korpusy 23 Už zmiňovaný Brown Corpus obsahoval jeden milion slov, stejnou velikost měl irovněž zmiňovaný korpus britské angličtiny LOB corpus. 24 http://www.webcorp.org.uk/live/ 36 korpusy v jazykovém vyučování sobjemem několika (desítek) milionů textových slov najdeme vsoučasnosti pouze uangličtiny jako cizího jazyka. Dosud největší známý korpus je Chung‑ dahm Corpus, tvořený eseji, které napsali korejští studenti angličtiny na Chungdahm institutu, národním řetězci škol anglického jazyka, achybově anotovaný tutory. Eseje jsou uloženy jako stále doplňovaná databáze, nikoli korpus; ztéto databáze byl vyčleněn pro výzkumné účely velký objem dat jako Chungdahm Corpus ovelikosti přibližně 131 milionů slov (přesněji 130 754 tisíc slov) ve více než 860 esejích oprůměrné délce 152 slov (Han et al. 2010). Korpus této velikosti je však iuangličtiny spíše výjimkou. Co do velikosti následují The Cambridge Learner Corpus obsahující cca50 milionů textových slov (také ten je založen na esejích napsaných vrámci zkoušek angličtiny) aHKUST (The Hong Kong University of Science & Technology Learner Corpus) ovelikosti cca25 milionů slov. Ostatní korpusy angličtiny ikorpusy dalších jazyků se pohybují vpodstatně nižších hodnotách– jen výjimečně dosahují hodnoty 2 milionů slov nebo ji překračují. Mezi velikostně nejmenšími uváděnými korpusy jsou např.The Pilot Ara‑ bic Learner Corpus, korpus arabštiny užívané mluvčími angličtiny jako prvního jazyka, obsahující psané vyprávěcí texty mírně pokročilých apokročilých studentů arabštiny ocelkovém rozsahu 9 000 slov, nebo The PIKUST, korpus slovinštiny jako cizího jazyka, který obsahuje texty psané mluvčími 18 různých prvních jazyků, většinou chorvatštiny, srbštiny aruštiny, ocelkovém rozsahu 35 tisíc textových slov. Velikost žákovských korpusů sice postupně roste, podobně jako velikost korpusů obecných, ale podstatně nižším tempem. Menší objem žákovských korpusů je dán obtížností sběru dat afinanční ičasovou náročností jejich přepisu adalšího zpracování. První problém je spojen se skutečností, že je objem řečové produkce nerodilých mluvčích neporovnatelně menší než objem dat produkovaných mluvčími rodilými. Navíc se jedná oprodukci obtížně dostupnou– pokud jde např.opísemné práce psané pro školu, disponuje jimi škola anemusí je pro potřeby korpusu zpřístupnit. Umluvených projevů se sběry setkávají spodobnými problémy jako sběry pro mluvené korpusy jazyka rodilých mluvčích, jen stím rozdílem, že projev nerodilého mluvčího bývá mnohonásobně kratší než projev rodilého mluvčího acelkový objem mluvených projevů nerodilých mluvčích je rovněž neporovnatelně menší. Kobtížnostem sběru přistupuje fakt, že projevy nerodilých mluvčích se sbírají vpodobě nahrávek mluvených projevů nebo vpodobě rukopisů, vobou případech se tedy musí texty přepisovat. Zatímco umluvených projevů lze dnes, jde -li okvalitní nahrávky standardní mluvy, využít automatického přepisu, unerodilých mluvčích jde většinou onestandardní jazyková data, která automatické zpracování vdobré kvalitě neumožňují, přepisuje se tedy manuálně, příp.se automatický přepis následně upravuje. seznámení skorpusy akorpusovou lingvistikou 37 Je příznačné, že větších velikostí dosahují ty žákovské korpusy, které se mohou opřít ospolupráci se školami nebo které jsou přímo sjejich činností spojeny– srov. výše uvedený Chungdahm Corpus, zpracovávající produkci žáků řetězce škol Chungdahm, Cambridge Learner Corpus, rovněž obsahující produkci žáků při zkouškách, nebo HKUST, obsahující písemné práce vzniklé vrámci maturitních zkoušek zangličtiny. Totéž platí iovětších žákovských korpusech mluvených, jako je např.mluvená složka korpusu BICCEL (Bilingual Corpus of Chinese English Learners), která vychází znahrávek při národním testu mluvené angličtiny, korpus NICT JLE (Japanese Lear‑ ner English), také čerpající ztestů mluvené angličtiny, nebo korpus SWECCL (Spoken and Written English Corpus of Chinese Learners). České žákovské korpusy řady CZESL patří svou velikostí vporovnání sjinými jazyky kromě angličtiny, která má vtomto ohledu mimořádné postavení, ke korpusům standardním, či spíše větším. Pro badatelské ipedagogické účely se zkorpusů této řady nejspíše nabízí automaticky emendovaný, anotovaný (také chybově) alemmatizovaný korpus CZESL ‑SGT. Zahrnuje 8617 textů od 1965 různých autorů (to znamená, že od jednoho autora jsou vkorpusu zařazeny vprůměru zhruba čtyři texty). Objem jazykových dat činí 1148 tisíc tokenů (pozic), ztoho 958 tisíc slov a111 tisíc vět. Druhým korpusem téže řady sprovedenou emendací, anotací alemmatizací je CZESL ‑MAN; od CZESL ‑SGT se liší tím, že byl emendován manuálně achybová anotace byla provedena poloautomaticky svysokým podílem manuálního zpracování. Manuální emendace aanotace je spolehlivější než emendace aanotace automatická, ale také je časově výrazně náročnější. CZESL ‑MAN je proto zatím podstatně menší než korpus CZSL ‑SGT (obsahuje cca124 tisíc slov) anení volně přístupný. 3.2. Vyváženost Vyváženost obecných korpusů je vlastnost, oniž se tvůrci korpusů vnějaké míře snaží, míra jejího dosažení záleží ale na tom, jaká kritéria zvolí ajak se vyrovnají sobtížemi, které jsou stím spojeny. Vzhledem kvelmi variabilním možnostem využití korpusů není možné vyváženost korpusu opírat ovnitřní, lingvistická hlediska, ale okritéria vnější. Obecné korpusy vČeském národním korpusu se opíraly zpočátku ozřetel krecepci– ty typy textů, které byly častěji čteny větším počtem mluvčích daného jazyka, byly vkorpusu zastoupeny ve větší proporci než typy textů, které se četly méně. Struktura typů textů aproporce jejich zastoupení vsynchronních korpusech současné psané češtiny byly tedy zpočátku stanoveny na základě výzkumů čtenářské recepce. Vprvním korpusu řady SYN, SYN2000, tvořila většinu (dvě třetiny) textů publicistika, přibližně čtvrtinu texty odborné, zbytek texty imaginativní 38 korpusy v jazykovém vyučování (beletrie, především próza). Vkorpusu SYN2005 se tyto proporce na základě nových výzkumů recepce změnily– publicistika představovala pouze 1/3 velikosti korpusu, odborná literatura 27%, podíl beletrie vzrostl na 40%; podobné proporce byly zvoleny pro korpus SYN2010. Korpus SYN2015 toto rozdělení opustil, tři textové makrotypy (publicistika, odborná literatura abeletrie) jsou vněm zastoupeny rovným dílem. Všechny uvedené korpusy (včetně korpusu SYN2015) se pokládají za reprezentativní vtom smyslu, že zahrnují co nejširší spektrum různých typů veřejných psaných (tištěných) komunikátů, které jako celek reprezentují současnou psanou češtinu, nezachycují ji však vproporcích odpovídajících přesně jazykové populaci.25 Vřadě SYN byly kromě toho zveřejněny rovněž korpusy české publicistiky (SYN2006PUB, SYN2009PUB, SYN2013PUB), které reprezentativní ve vztahu kobecnému jazykovému úzu nejsou (zahrnují pouze texty zoblasti publicistiky). Zatím poslední korpus SYN verze 6 zahrnuje všechny starší synchronní psané korpusy řady SYN včetně korpusů české publicistiky ataké nový publicistický materiál, vzhledem kvelké převaze publicistické složky ho tedy rovněž nelze označit za vyvážený areprezentativní. Vyváženost (ataké velikost) asnimi spojená reprezentativnost se řeší samostatně adosahuje jiných hodnot ukorpusů psaného akorpusů mluveného jazyka. Materiál pro psané korpusy se snáze získává (pro korpusy řady SYN získává tvůrce naprostou většinu materiálu, přibližně 90%, přímo velektronické podobě od nakladatelů avydavatelů na základě smluv), zatímco získat materiál pro mluvené korpusy je obtížnější (data se sbírají formou audio či videonahrávek; větší podíl má běžná mluva) anáročné je ijeho další zpracování, především přepis. Proto se umluvených korpusů pohybujeme vobjemech podstatně nižších. Pro češtinu je zatím největším mluveným korpusem ORAL, zahrnující dřívější korpusy řady ORAL (ORAL2006, ORAL2008, ORAL2013) apřepisy nových nahrávek (ORAL ‑Z). Přepisy nahrávek převážně neformálních rozhovorů, které ho tvoří, mají celkový objem 5,4 milionu textových slov, vporovnání se stamilionovými objemy psaných korpusů tedy podstatně menší. Korpus také není vyvážený zteritoriálního hlediska (podíl rozhovorů zČech je vyšší). Vyvážený co do relevantních sociologických kritérií (pohlaví, věk, vzdělání, oblast pobytu vdětství) aztohoto hlediska reprezentativní je nejnovější mluvený korpus češtiny ORTOFON oobjemu 1 milion textových slov. Svyvážeností volně souvisí ivolba komponent, znichž se korpus skládá; někdejší Brown Corpus adalší korpusy jím vtomto ohledu inspirované (Lancaster ‑Oslo ‑Bergen Corpus, British National Corpus) se skládaly ze vzorků textů ostandardním rozsahu (Brown Corpus např.obsahoval 500 vzorků 25 http://wiki.korpus.cz/doku.php/cnk:syn2015 seznámení skorpusy akorpusovou lingvistikou 39 textů o2000 slovech). Soudobé korpusy, včetně obecných korpusů ČNK, se skládají zcelých textů. Lze říci, že reprezentativnost korpusu ve vztahu kběžnému, normálnímu jazykovému úzu je hodnota, kníž obecné korpusy snahou ovelikost avyváženost směřují, ikdyž jí nikdy plně nedosahují. Při práci skorpusem ovšem sledujeme často jen určitou specifickou oblast jazyka ajeho užívání, posuzujeme tedy přirozeně ireprezentativnost příslušného korpusu zhlediska jeho výzkumného cíle apodle populace textů, na niž je náš výzkum zaměřen. Užákovských korpusů ovyváženost ve smyslu úplného aproporcionálního zastoupení jednotlivých variet jazyka nerodilých mluvčích neusilujeme. Je to dáno tím, že ucizího jazyka, jeho osvojování aužívání se setkáváme sneporovnatelně vyšší variabilitou než ujazyka prvního atato variabilita je vázána na mimořádně vysoký počet významných proměnných, které při výzkumu ipři výuce potřebujeme brát vúvahu. Přinejmenším za současných technických podmínek apři současné velikosti žákovských korpusů není možné uvažovat ovyváženosti jakéhokoli žákovského korpusu ve vztahu kcelé populaci. Není to ani cílem jejich tvůrců. Hlavním cílem žákovských korpusů vtomto směru je umožnit studium variability žákovského jazyka (mezijazyka) ajeho užívání astudium vztahu této variability kco největšímu počtu sledovaných apečlivě zaznamenávaných proměnných. Při práci sžákovským korpusem tedy neočekáváme, že reprezentuje mezijazyk nerodilých mluvčích jako celek, to není dost dobře možné, ale že spolehlivě zaznamenává aumožňuje studovat užívání některé jeho variety ve vztahu kco největšímu počtu faktorů. Při posuzování kvality žákovského korpusu tak přihlížíme nejen kjeho velikosti, ale ktomu, zda obsahuje tu varietu mezijazyka žáků, která nás zajímá, ataké ktomu, kolik faktorů (akteré) ovlivňujících její užívání zaznamenává ajak podrobně. Nejčastěji to bývá první jazyk žáků (např.čeština žáků sprvním jazykem čínským) aúroveň ovládání cílového jazyka (zřídka jde ozačátečníky, častěji omírně pokročilé nebo pokročilé), téma (blízké, známé, citově zabarvené vs. vzdálené, neznámé, citově neutrální), žánr, způsob sběruapod. Korpusy řady CZESL26 byly budovány se snahou získat jazyková data vtakové skladbě, aby vnich byly zastoupeny všechny úrovně ovládání jazyka, od začátečníků po pokročilé, aaby vrepertoáru prvních jazyků studentů byly dostatečně zastoupeny tři jejich skupiny: jazyky slovanské, indoevropské neslovanské ajazyky neindoevropské, češtině vzdálené. Jednotlivé úrovně ovládání jazyka (podle SERR) askupiny prvních jazyků nejsou vtěchto korpusech zastoupeny rovnoměrně, korpusy tedy nejsou ztěchto 26 CZESL ‑PLAIN, CZESL ‑SGT, CZESL ‑MAN. 46 korpusy v jazykovém vyučování šel emendací manuální anávazně semiautomatickou anotací, rovněž včetně anotace chybové. Při hledání vkorpusu CZESL ‑SGT můžeme vyjít způvodního tvaru (word, kněmu je vázáno lemma, tag; ktypům vyhledávání vizdále) nebo ztvaru emendovaného (word1, lemma1, tag1), můžeme hledat typy chyb (err)apod. Zadáme -li např.word132 slova miluje, zobrazí se nám na pozici word jak užité tvary standardní, tak itvary chybové (míluje, milujút). Je potřeba upozornit, že uautomatické emendace aanotace musíme počítat snepřesnostmi aomyly, ato jak ve vlastní emendaci, tak vanotaci. Pokud jsme si toho ale vědomi, může nám korpus CZESL ‑SGT posloužit jako mimořádně bohatý zdroj dat pro výzkum ivýuku. 32 Viz dále. seznámení skorpusy akorpusovou lingvistikou 47 4. Práce skorpusem Vnásledující kapitole se seznámíme sněkolika korpusy češtiny ase základními způsoby vyhledávání vnich. 4.1. Český národní korpus (ČNK) 4.1.1. Materiál/Obsah Český národní korpus je projekt, který má za úkol vytváření dílčích korpusů češtiny. Obsahuje především korpusy psaného jazyka, ale také několik korpusů mluvené češtiny. Vsouhrnu se jedná onejobsáhlejší jazykový materiál, který je pro češtinu zpracován. Psané korpusy lze dělit na korpusy synchronní, které dokládají současný jazykový úzus, akorpusy diachronní, které zachycují jazyk vjeho vývoji. Nezanedbatelný je také mnohojazyčný paralelní korpus InterCorp, který nabízí zarovnané texty (překlady textů) ztéměř 40 jazyků. Kompletní přehled všech dostupných korpusů vč. jejich charakteristiky najdete na webu Českého národního korpusu.33 Pro výuku žáků sOMJ jsou relevantní především reprezentativní korpusy současné češtiny, např.SYN2015, nebo akviziční korpusy, např.žákovský korpus CZESL. Vzávislosti na cíli výuky apo zvážení jazykového původu žáků lze využít také texty paralelního korpusu InterCorp. 4.1.2. Vyhledávač neboli korpusový manažer ČNK využívá korpusový manažer KonText, dostupný zwebové stránky ČNK www.korpus.cz. KonText je umístěn vhorním menu vlevo. Lze jej využívat ibez registrace, po bezplatném zaregistrování je ale kdispozici více funkcí. 33 https://wiki.korpus.cz/doku.php/cnk:uvod 48 korpusy v jazykovém vyučování Obrázek 1: Úvodní stránka manažeru KonText 4.1.3. Vyhledávání Před vyhledáváním je třeba si ujasnit základní parametry, které ovlivňují jeho výsledek. Jedná se ovolbu korpusu, výběr typu dotazu, zadání dotazu, příp.specifikaci kontextu aomezení hledání. První tři jmenované kategorie jsou klíčové anelze je vynechat. Na volbě těchto tří kategorií také přímo závisí výsledek korpusové analýzy. Poslední dvě kategorie jsou fakultativní aumožňují přesnější zadání dotazu. Obrázek 2: Zadání dotazu vKonTextu seznámení skorpusy akorpusovou lingvistikou 49 4.1.4. Volba korpusu Vprvní řadě je třeba zvolit korpus, vněmž bude hledání probíhat. Výběrem pole spřednastaveným korpusem se otevře tabulka se štítky, podle nichž lze vkorpusech hledat. Pro lepší přehlednost je možné se orientovat podle seznamu korpusů na encyklopedii wiki.34 Každý ze štítků pod sebou skrývá nabídku všech relevantních korpusů, znichž si lze následně vybrat ten nejvhodnější. Obrázek 3: Výběr zdrojového korpusu 4.1.5. Typ dotazu Před zadáním vlastního dotazu je třeba vybrat jeho typ. Přednastavený je základní typ dotazu. Jedná se ointuitivní způsob zadání dotazu. Pokud je do pole dotazu zadáno slovo vzákladním tvaru (upodstatných jmen první pád jednotného čísla, usloves infinitiv, upřídavných jmen nestupňovaný tvar mužského roduapod.), zobrazí se výsledky obsahující všechny tvary hledaného slova (od slova mladý doklady obsahující všechny slovní tvary– mla‑ dými, mladým, mladéhoapod.). Pokud vzákladním typu dotazu zadáme konkrétní slovní tvar (např.mladými), budou výsledky analýzy zahrnovat pouze texty obsahující tento slovní tvar. Vzákladním dotazu lze zadávat islovní spojení, přičemž platí stejná pravidla jako ujednoslovných zadání. Usousloví vkonkrétním tvaru (např.svelkou pravděpodobností) budou výsledky obsahovat texty stímto konkrétním tvarem. Pro vyhledání všech tvarů sousloví je třeba zadat jeho komponenty vzákladním tvaru, tj.např.pro spojení svelkou pravděpodobností zadáme dotaz ve tvaru svelký pravděpodobnost. 34 https://wiki.korpus.cz/doku.php/cnk:uvod 50 korpusy v jazykovém vyučování Výsledky pak obsahují sousloví svelkou pravděpodobností, světší pravděpo‑ dobností, snejvětší pravděpodobností. Využití základního typu dotazu je tedy vhodné pro jednodušší dotazy adoporučuje se pro korpusové začátečníky. Jeho nevýhodou je, že nemůže obsahovat tzv.regulární znaky, tj.znaky mající zástupnou funkci (více oregulárních znacích obsahuje wiki35). Druhým typem dotazu je lemma. Do pole dotazu se zadává základní tvar slova ave výsledcích se zobrazují všechny tvary zvoleného slova. Výhodou dotazu typu lemma je, že umožňuje doplnit dotaz ospecifikaci slovního druhu, atím uněkterých slov zamezit vysoké chybovosti zdůvodu homonymie. Příkladem může být slovo stát, které včeštině existuje jako podstatné jméno isloveso. Třetím typem dotazu je fráze. Při volbě fráze se do pole dotazu zadává slovní spojení vkonkrétním tvaru, které je pak také vtémže tvaru zobrazeno ve výsledcích analýzy. Čtvrtým typem dotazu je slovní tvar. Do pole dotazu se zadává konkrétní slovní tvar, který je pak zobrazen ve výsledcích. Pokud je při tomto typu zadán neutrální slovní tvar (např.infinitiv), je na rozdíl od základního typu dotazu ve výsledcích zobrazen jen infinitiv, nikoli další slovní tvary. Slovní tvar je možné upřesnit volbou slovního druhu (např.mezi– předložka vs. podstatné jméno v6. pádě jednotného čísla). Utypů dotazů lemma aslovní tvar je na rozdíl od základního typu dotazu možné volit slovní druhy, atím eliminovat tvarovou homonymii. Předposledním nabízeným typem dotazu je část slova. Umožňuje vyhledat slovní tvary, které obsahují zadaný řetězec znaků, azahrnout do dotazu též regulární (tj.zástupné) znaky. Řetězcem znaků je myšlen pouhý sled znaků/písmen bez nároku na morfologické dělení (kořen slova, předpony, příponyatd.). Hledáme -li tedy pomocí tohoto typu dotazu slova spředponou před‑, bude ve výsledcích analýzy zobrazen též slovesný tvar přede od slovesa příst. Posledním typem dotazu je CQL (= corpus query language), což je dotazovací jazyk umožňující komplikovanější vyhledávání. Více kpráci sCQL najdete na wiki.36 Pro jednoduchou arychlou orientaci vrozdílech mezi typy dotazů slouží nápověda ve formě modrého pole sotazníkem, která uživateli poskytne rychlou charakteristiku zvoleného typu dotazu. 35 https://wiki.korpus.cz/doku.php/kurz:regularni_vyrazy 36 https://wiki.korpus.cz/doku.php/kurz:pokrocile_dotazy seznámení skorpusy akorpusovou lingvistikou 51 Obrázek 4: Volba typu dotazu 4.1.6. Zadání dotazu Po výběru typu dotazu je třeba dotaz formulovat. Vzávislosti na vybraném typu dotazu lze zadat základní nebo konkrétní slovní tvar, příp.použít vdotazu regulární znaky. Po výběru některých typů dotazů je zpřístupněno doplňkové okno umožňující definovat slovní druh. Uníže uvedeného příkladu je hledáno sloveso stát ve všech jeho tvarech (je tedy vyloučena homonymie spodstatným jménem stát). Obrázek 5: Zadání dotazu aspecifikace slovního druhu 52 korpusy v jazykovém vyučování 4.1.7. Specifikace kontextu Oddíl specifikace kontextu se využívá tehdy, pokud uživatel potřebuje ovlivnit kontext vyhledávaného výrazu nad rámec možností, které mu poskytuje zadání dotazu. Využívá se tehdy, pokud hledané slovo chceme vjeho nejbližším okolí rozšířit odalší slovo/slova, příp.pokud chceme další slovo/slova vokolí zvyhledávání vyloučit. Zadávat lze jak konkrétní slova/slovní tvary, tak kategorie slovních druhů. Specifikace kontextu také slouží tam, kde je třeba vyhledat víceslovné spojení, jehož komponenty nestojí pevně za sebou (ktomu slouží typ dotazu fráze). Po volbě specifikace kontextu se zadávací tabulka rozšíří oněkolik částí. Voddílu Filtrovat podle lemmatu je třeba nejprve určit, jaký kontext má být do vyhledávání zahrnut. Kontext se určuje vtokenech (jeden token = zjednodušeně jeden slovní tvar na daném místě), jejichž počet si uživatel volí vtabulce. Před údajem kpočtu tokenů uživatel vybírá, zda se počet zahrnutých tokenů týká jen části textu před hledaným slovem, tj.vlevo, nebo po hledaném slově, tj.vpravo, nebo na obě strany od hledaného slova, tj.vlevo ivpravo. Je možné zadávat slova vjejich základních tvarech, tj.lemmatech. Pole Lemma(ta) umožňuje vepsat jedno nebo více slov. Vtabulce na konci řádku je třeba vybrat, zda mají být zadaná slova obsažena všechna vzadaném kontextu, nebo zda může být vybráno kterékoli ze zadaných slov, příp.zda nemá být vybráno žádné. Při zadání jednoho slova znamená výběr všechny akteroukoli totéž. Uzadání všechna se ve výsledcích hledání zobrazí všechny úryvky textů, které obsahují hledaný výraz (vpoli Dotaz) azároveň také všechna zadaná slova vrámci nastaveného kontextu. Jako příklad uveďme podstatné jméno telefon zadané vpoli Dotaz, kněmuž jsou ve specifikaci kontextu uvedeny atributy chytrý amobilní. Výsledky pak budou zobrazovat jen ty úryvky textů, které obsahují všechna tři slova, tj.chytrý, mobilní, telefon. Uzadání kteroukoli se ve výsledcích hledání zobrazí všechny úryvky textů, které obsahují hledaný výraz (vpoli Dotaz) azároveň vždy alespoň jedno ze zadaných slov, ve výše uvedeném příkladu to tedy budou úryvky obsahující slovní spojení chytrý telefon amobilní telefon. Uzadání žádnou se ve výsledcích hledání zobrazí všechny úryvky textů, které obsahují hledaný výraz (vpoli Dotaz) azároveň neobsahují ani jedno ze zadaných slov, obsahují tedy telefon, ale nikoli chytrý ani mobilní. Volba žádnou má tedy funkci negativního filtru, jímž definujeme, sjakými slovy se slovo zadané vdotazu nemá vyskytovat. Voddílu Slovní druh se postupuje při zadávání stejně jako voddílu Fil‑ trovat podle lemmatu, jen stím rozdílem, že se nevypisují konkrétní slova vzákladním tvaru, ale volí se jen slovní druh/druhy jako kategorie. seznámení skorpusy akorpusovou lingvistikou 53 Obrázek 6: Specifikace kontextu 4.1.8. Omezení hledání Pokud se uživatel rozhodne, že nechce vyhledávat vcelém zvoleném korpusu, může své vyhledávání omezit. Texty jsou vkorpusu tříděny podle různých kritérií (podle textového druhu, žánru, typu média, pohlaví autoraapod.) ana základě těchto kritérií lze vybrat skupiny textů, které budou zanalýzy vyloučeny. Obrázek 7: Omezení hledání 54 korpusy v jazykovém vyučování Po vyplnění úvodní zadávací tabulky (ne všechny oddíly je třeba vždy vyplnit) azvolení tlačítka Hledat se spustí analýza. 4.1.9. Výsledky hledání Vnásledujícím textu bude popsána výsledková tabulka amožnosti dalšího zpracování zobrazených výsledků. Pro zde použité vzorové vyhledávání byl zvolen výchozí korpus SYN2015, typ dotazu Lemma, dotaz stát se specifikací slovního druhu sloveso. Ve výsledkové tabulce je zobrazeno shrnutí zadání dotazu apočet nalezených výsledků, tj.počet textů, vnichž se objevil slovní tvar odpovídající zadání. Kromě absolutního počtu výskytů slovního tvaru je uváděn také údaj i.p.m., což je relativní frekvence přepočítaná na celkovou velikost korpusu. Pro kvantifikaci se jedná orelevantnější údaj, než je frekvence absolutní. Výsledková tabulka obsahuje několik základních částí. Každý řádek (konkordance) je úryvkem textu, vněmž se hledané slovo vyskytuje. Vkaždém řádku lze odlišit několik typů údajů, které napříč řádky tvoří sloupce. Zleva se jedná oikonu umožňující nahlédnout do syntaktické struktury zvolené věty. Následuje bibliografický údaj ozdrojovém textu, po jehož výběru se zobrazí kompletní bibliografické informace otextu. Nejdůležitější je střední část obrazovky, která nabízí úryvky textů svycentrovaným klíčovým/hledaným slovem (KWIC). Pokud je potřeba zobrazení delšího kontextu, je to umožněno kliknutím na vybrané klíčové slovo. Defaultní nastavení korpusu zobrazuje 40 konkordancí. Pro zobrazení dalších je třeba se přesunout na další stránku výsledků. Obrázek 8: Výsledky hledání Zobrazením výsledkové tabulky ale práce skorpusem nekončí/nemusí končit. Výsledky lze ještě třídit afiltrovat nebo vnich dále hledat. Všechny nástroje pro zpracování výsledků aovládání vyhledávání jsou knalezení vhorním menu. Vnásledujícím textu si představíme ty nejdůležitější znich. seznámení skorpusy akorpusovou lingvistikou 55 Pomocí záložky Dotaz je možné vrátit se do úvodní zadávací tabulky azahájit tak nové hledání. Nabídka Předchozí dotazy zobrazí historii dosavadních dotazů (vrámci jednoho sezení) aumožní se vrátit ke starším vyhledáváním ajejich výsledkům. Vzáložce Korpusy– Dostupné korpusy je nabízen přehled všech korpusů ČNK, které je možné zvolit jako zdroje pro vyhledávání (obdobně vúvodní zadávací tabulce při volbě korpusu). ČNK umožňuje svým uživatelům vytvoření vlastních subkorpusů, tj.korpusů, které si uživatel definuje zdostupného textového materiálu ČNK sám. Pro vytvoření vlastního subkorpusu musí být relevantní důvod, protože výběrem textů do korpusu jsou významně ovlivněny výsledky hledání atím iinterpretace těchto výsledků. Pro vytvoření asprávu vlastních subkorpusů slouží nabídka Mé subkorpusy, Vytvořit vlastní subkorpus aVytvořit veřejný subkorpus. Vlastní subkorpus bude kdispozici jen danému uživateli, veřejný subkorpus lze nasdílet vybraným uživatelům, např.studentům ve třídě. Obrázek 9: Vytvoření vlastního subkorpusu Výsledky hledání lze uložit na vlastní zařízení, např.na disk počítače. Je tím umožněna práce sdaty ivrežimu offline. Ukládat lze vrůzných formátech, např.csv.xlsx.xml či.txt. Obrázek 10: Uložení výsledků hledání Svýsledky hledání, resp. jednotlivými konkordancemi, lze dále pracovat. Relevantní může být jejich promíchání (volba Promíchat) či výběr náhodného vzorku, jehož velikost určuje uživatel sám (volba Vzorek). Tuto volbu lze provést vpřípadech, kdy je počet nalezených konkordancí příliš vysoký na to, aby mohlo dojít kjeho manuálnímu zpracování. 62 korpusy v jazykovém vyučování riant vpsaném amluveném jazyce. Ostatní výsledky jsou roztříděné podle dalších kritérií ajsou knahlédnutí vzáložkách pod koláčovými grafy. Obrázek 24: SyD– výsledek vyhledávání porovnání tvarů bychom abysme Vzáložce Rozložení je možné nahlédnout do grafu znázorňujícího, vjakých textových typech ažánrech se zvolená varianta nachází. Po zvolení varianty 2 se graf přeskupí. Výsledky jsou opatřeny podrobným komentářem umožňujícím orientaci vproblematice interpretace těchto výsledků. Obrázek 25: SyD– typy textů Vnásledující záložce jsou graf týkající se psaného jazyka arozložení zvolených variant vtypech textů atextových žánrech zobrazeny podrobněji než vzáložce Rozložení. Pro ilustraci je vnásledujícím obrázku znázorněno rozložení podle žánrů. seznámení skorpusy akorpusovou lingvistikou 63 Obrázek 26: SyD– rozložení podle žánrů Záložka pro mluvený jazyk nabízí jiné kategorie třídění, např.podle pohlaví avěku mluvčího, podle jeho vzdělání či nářeční příslušnosti. Obrázek 27: SyD– třídění podle pohlaví avěku 64 korpusy v jazykovém vyučování Obrázek 28: SyD– třídění podle nářeční příslušnosti Poslední záložka nabízí nejčastější kolokace koběma variantám. Izde jsou výsledky opatřeny doprovodným vysvětlujícím textem. Více informací kpráci saplikací SyD je knalezení ve wiki.39 Obrázek 29: SyD– kolokace 39 https://wiki.korpus.cz/doku.php/manualy:syd seznámení skorpusy akorpusovou lingvistikou 65 4.2.2. Aplikace Morfio Aplikace Morfio je navržena tak, aby umožňovala odhalovat apozorovat slovotvorné pravidelnosti češtiny. Využívá korpusových dat kodhadování rozsahu aproduktivity slovotvorných modelů se zaměřením na odvozování. Vychází zpoznatků slovotvorby češtiny avyhledává dvojice (nebo vícečetné kombinace) slov, která se chovají stejně jako zadaný model. Ve výuce žáků sOMJ lze Morfio využít pro odhalování slovotvorných pravidel češtiny, pro uvědomění si jazykového systému aosvojení si nových slovotvorných postupů. Znalosti ze slovotvorby jsou při učení se každému jazyku mocným nástrojem pro rychlé obohacení slovní zásoby onová slova, ato na základě analogie, kterou slovotvorba disponuje. Vpřípadě slovotvorných produktů tak mluvíme opotenciální slovní zásobě, tj.slovní zásobě, kterou žák sice sám nikdy nepoužil ani se sní nesetkal, ale na základě znalosti slovotvorného pravidla dokáže slovo vytvořit apoužít. Práce sMorfiem tak představuje induktivní metodu výuky slovotvorby češtiny, která pracuje sjazykovým materiálem zábavnou formou. Východiskem práce sMorfiem je stanovení báze (základu slova) afor‑ mantů (částí slov, které podléhají změně). Při zadávání do vstupní tabulky lze využít jak kombinace písmen, tak regulárních znaků. Základem pro oba vzory může být tatáž konkrétní báze, např.škol‑, nebo báze libovolná, tvořená jen regulárními znaky.+, přičemž uživatel volí, zda tato báze, příp.zvolené formanty mají být stejné nebo odlišné pro oba vzory. Oběma vzorům lze přiřknout ještě zvolený slovní druh, je -li tento údaj relevantní (např.slovo končící na ‑í může příslušet krůzným slovním druhům, aproto lze slovní druh vybrat). Výběr slovního druhu se doporučuje především proto, aby se eliminovaly nežádoucí výsledky. Uněkterých bází dochází při spojení srůznými formanty ke změnám, snimiž Morfio počítá anazývá je alternace. Jedná se ozměny typu knih ‑aX kniž ‑ní; psá ‑t X psa ‑níapod. Důležité je, že ve vstupní tabulce není třeba vždy vyplňovat všechna zadávací pole, ale vždy jen taková, která jsou opodstatněná vzhledem kcíli analýzy. Východiskem je stanovení báze (základu slova) aformantů (částí slov, které podléhají změně). Základem slova škola (tj.bází) je škol‑, formantem je ‑a, přičemž ibez korpusu jsme sami schopni vytvořit další slova sjinými formanty od téže báze, např.školní, školský, školník, školeníapod. Díky Morfiu můžeme rychle odhalit, která slova jsou schopna stejné změny jako slovo vyhledávané. Drobnou nevýhodou aplikace Morfio je, že nedokáže rozeznat hranice morfémů (např.upředpony předjsou generována slova předevčírem, ale také předobrý). 66 korpusy v jazykovém vyučování Obrázek 30: Morfio Následující zadání umožňuje hledat dvojice slov, jejichž báze může být různá, ale která tvoří vždy dvojici, např.substantivum končící na ‑aatvořící adjektivum končící na ‑ní. Hledají se ave výsledcích se zobrazují lemmata. Alternace nebyly určeny. Obrázek 31: Morfio– zadání dotazu Výsledky analýzy se zobrazí ve formě několika záložek amohou mít různou míru využití pro různé účely. Každá zvýsledkových tabulek je opatřena doprovodným komentářem. Úvodní tabulka agraf představují souhrnné výsledky analýzy. Pro účely výuky se jeví nejvyužitelnější tabulka Výpis, nabízející nalezené páry, které jsou kandidáty na hledaný slovotvorný produkt (např.abeceda– abecední). Jednotlivé slovní tvary lze kliknutím aktivovat adostat se tak do korpusových textů, vnichž lze pozorovat konkrétní užití daného slovního tvaru. seznámení skorpusy akorpusovou lingvistikou 67 Obrázek 32: Morfio– souhrnné výsledky Obrázek 33: Morfio– záložka Výpis 4.2.3. Aplikace KWords KWords je aplikace umožňující analýzu až 20 vybraných textů, např.stejného textového druhu či žánru, při níž probíhá porovnání těchto vložených textů sreferenčním korpusem. Při analýze jsou vtextu vyhledávána klíčová slova (měří se relativní frekvence každého slovního tvaru aporovnává se srelativní frekvencí téhož slovního tvaru vreferenčním korpusu, čímž lze získat seznam slovních tvarů, které jsou ve vybraných textech užity výrazně častěji alze onich uvažovat jako oklíčových, resp. majících spojitost sdaným textových druhem, resp. žánrem). Texty lze vsoučasné době nahrávat včeštině nebo angličtině. Pro relevantní výsledky je však dobré zvážit volbu vhodného referenčního korpusu, snímž budou vložené texty porovnávány. Nabídku referenčních korpusů lze nalézt na wiki.40 Pro výuku žáků sOMJ však není angličtina relevantní aznabízených českých korpusů doporučujeme využít přednastavený referenční korpus SYN2015. 40 https://wiki.korpus.cz/doku.php/manualy:kwords 68 korpusy v jazykovém vyučování Práce saplikací je intuitivní. Po otevření aplikace na webové stránce je třeba vyplnit zadávací tabulku. Klíčové je zadání vlastního textu. Analyzovaný text by měl mít od několika set do několika tisíc znaků aje možné ho vložit dvěma způsoby. Text (nebo ivíce textů) lze přímo kopírovat do připraveného okna, nebo lze vpřípadě vkládání více textů užít tzv.multianalýzy, při níž se do korpusu jednotlivé texty nahrají. Druhým klíčovým krokem je zvolení referenčního korpusu, tedy korpusu, snímž se vlastní nahrané texty budou porovnávat. Na výběr je několik referenčních korpusů. Pro analýzu současných textů doporučujeme využívat např.SYN2015. Před zahájením analýzy je vhodné zvážit, zda zní nevyloučit některé/všechny nabízené slovní druhy, které jsou většinou vysokofrekvenční amohou výsledky analýzy znehodnotit, např.předložky, zájmena, spojkyapod. Vyloučení zanalýzy lze provést vtzv.stop -listu. Vlastní analýza probíhá na základě statistických měr; je možné zvolit jednu ze statistických měr nebo obě dvě zároveň. Analýza začne probíhat po stisku příkazu Analyzovat vlevé dolní části stránky. Obrázek 34: KWords– Zahájení analýzy Výsledky analýzy se zobrazují několika způsoby. Vzáložce Text je zobrazen analyzovaný text avšechna nalezená signifikantní slova jsou zbarvena červeně. Text lze tedy pročítat asoustředit se přitom na vyhledané výrazy. seznámení skorpusy akorpusovou lingvistikou 69 Obrázek 35: KWords– ukázka analýzy41 Výsledky analýzy jsou nabízeny také vjiných formách. Vzáložce Klíčová slova uživatel nalezne souhrnnou tabulku slovních tvarů vyhodnocených jako signifikantní pro zadaný text. Kromě seznamu je zde nabídnuta také hodnota statistické míry, podle které byl výpočet proveden, dále hodnota DIN, která uvádí míru relevance rozdílu mezi výskytem vzadaném textu avreferenčním korpusu (zde platí, že relevantní jsou slovní tvary shodnotou 75–100, přičemž čím je hodnota vyšší, tím je relevantnější). Uvygenerovaných slovních tvarů je také uvedena jejich frekvence vobou textových zdrojích. Obrázek 36: KWords– výsledek analýzy Další možností náhledu je distribuce zobrazující rozložení nalezených signifikantních slov vtextu aKeyword links, jenž zobrazuje vztahy mezi jednotlivými klíčovými slovy. Interpretace těchto dat je určena spíše pro odborníky azkušené korpusové uživatele, proto se těmto doplňkovým informacím nebudeme dále věnovat. Bližší popis pro zájemce lze nalézt na wiki. 41 Analyzovaný text pochází z: http://www.cesky -jazyk.cz/slohovky/pohadky/lez -ma -kratke- -nohy.html#axzz5IU96O5h7. 70 korpusy v jazykovém vyučování Poslední zřady je přehled konkordancí, tj.konkrétních míst vtextu vzobrazení KWIC. Po výběru konkordance se soupis rozšíří ovšechny konkordance svybraným slovním tvarem. Tento náhled je výhodný především proto, že shromáždí všechny výskyty vybraného slovního tvaru pod jednu konkordanci alze na něm, na rozdíl od náhledu lineárního textu, analyzovat chování vybraného slovního tvaru ve všech jeho výskytech najednou. Obrázek 37: KWords– přehled konkordancí Využití aplikace KWords ve výuce jazyka může být různorodé. Nabízí se možnost analýzy textových druhů ažánrů, na jejímž podkladu žáci samostatně vytvářejí vybraný textový druh či žánr. Zajímavou možností je analýza vlastních vytvořených textů atím reflexe vlastního idiolektu nebo porovnání textů stejného zadání od žáků sčeštinou jako mateřštinou ažáků sOMJ. 4.2.4. Aplikace Treq Aplikace Treq je databází překladových ekvivalentů. Protože je založena na textech paralelního korpusu InterCorp, funguje obousměrně pro jazykové páry čeština–cizí jazyk aangličtina–cizí jazyk. Cizí jazyky jsou zde nabízeny vrozsahu odpovídajícím jazykům zastoupeným vInterCorpu. Samotné vyhledávání probíhá vprvním kroku zvolením výchozího acílového jazyka. Vdruhém kroku musí být zvolen hledaný výraz. Vyhledávané slovo musí být slovo zjazyka označeného jako výchozí alze ho formulovat jako určitý slovní tvar, jako lemma, případně lze vyhledávat víceslovná spojení nebo užít při hledání regulárních výrazů či ignorovat malá avelká písmena (až na vyhledávání konkrétního slovního tvaru je uvšech výše jmenovaných potřeba danou kategorii zaškrtnout). Hledání lze provést ve všech textech InterCorpu nebo lze omezit zdrojové texty na beletristické jádro (texty ručně zkontrolované azarovnané) nebo některou zkolekcí (texty automaticky zarovnané). Výsledkem hledání je seznam překladových ekvivalentů. Proklikem jednotlivých ekvivalentů se uživatel dostane do korpusu InterCorp, který mu zobrazí zarovnané texty obsahující jak výraz jazyka výchozího, tak nabídnutý ekvivalent jazyka cílového. seznámení skorpusy akorpusovou lingvistikou 71 Na těchto kontextech lze ověřit, zda zvolený ekvivalent odpovídá nárokům hledaného ekvivalentu. Své využití najde Treq především tam, kde se žáci učí pracovat scizojazyčnými ekvivalenty ajejich výběrem ataké se synonymy. Treq sice nelze označit za slovník, protože mu chybí celá řada nezbytných lexikografických informací, ale na rozdíl od běžného slovníku disponuje velkou výhodou, kterou je propojení sautentickými texty ve formě konkordancí obsahujících vyhledaný ekvivalent. Zkontextů tak lze mnohdy vyčíst stejné nebo ještě bohatší informace ovýznamové apragmatické stránce jazykového ekvivalentu než ze slovníku. Uživatel si užíváním Trequ cvičí nejen své jazykové znalosti, ale isvůj jazykový cit asenzibilizuje se na práci stextovým materiálem ajeho výpovědní hodnotou. Následující obrázky nabízejí náhled úvodní zadávací stránky aplikace Treq, stránky svýsledky (nabídkou překladových ekvivalentů) astránky zobrazující konkordance InterCorpu uzvoleného ekvivalentu. Více informací oaplikaci Treq je knalezení na stránkách wiki.42 Obrázek 38: Treq– zadávací tabulka Obrázek 39: Treq– výsledek frekvenční analýzy 42 https://wiki.korpus.cz/doku.php/manualy:treq 78 korpusy v jazykovém vyučování Pořadí Vše Substantiva Adjektiva Slovesa Předložky Spojky 80 místo vlas dětský trvat 81 při skupina osobní bát 82 začít důvod volný tvrdit 83 protože světlo slavný postavit 84 podle možnost skvělý existovat 85 jiný hráč pracovní vydat 86 každý kolo prázdný líbit 87 druhý byt široký připadat 88 myslet výsledek určitý napsat 89 tenhle klub střední uvidět 90 náš rameno nutný zapomenout 91 takový Petr moderní ptát 92 dítě syn oblíbený poznat 93 mezi metr dnešní napadnout 94 nějaký srdce ruský koupit 95 jejich systém čistý působit 96 přijít přítel rodinný otočit 97 život začátek úspěšný milovat 98 však krok hezký číst 99 dostat akce jednotlivý chápat 100 hlava policie krajský pustit Tabulka 1: Nejfrekventovanější slova vkorpusu SYN2015 5.2. Pracovní listy Následující ukázkové pracovní listy obsahují čtyři části. Na první straně naleznete anotaci apopsaný postup práce spracovním listem. Druhou stranu tvoří samotný pracovní list, který lze namnožit arozdat žákům. Po pracovním listu následuje popis práce skorpusem snázornými snímky obrazovky. Na konec je zařazeno řešení úkolů. Pracovní listy obsahují jak cvičení, která vyžadují přímou práci skorpusem během výuky (hands -on), tak cvičení, která jsou založená na jazykových datech zkorpusu, ale přímou práci skorpusem během výuky nevyžadují (hands -off). Pracovní listy mají sloužit jako inspirace pro tvorbu vlastních korpusových cvičení.43 43 Podobné pracovní listy naleznete také pod odkazem https://www.korpus.cz/proskoly. využití korpusů ve výuce 79 5.2.1. Prostředí KonText Anotace Cvičení tohoto typu je vhodné zařadit do výuky, pokud dělá žákům problém rozlišovat význam podobných adjektiv aužívat je ve správných spojeních. Může jít jak oadjektiva, která mají jiný význam– zde např.zdravý azdra‑ votní, tak oadjektiva, která mají vněkterých kolokacích význam stejný, ale existují různá omezení– např.šedý ašedivý, kdy se některá substantiva mohou pojit jen sjedním adjektivem (šedá eminence). Cvičení také rozšiřují slovní zásobu. Pracovní list vyžaduje samostatnou práci skorpusovým rozhraním KonText aobsahuje tři úkoly, které vedou ktomu, aby si žák vhodné použití adjektiv osvojil sám pomocí vyhledávání typických kolokací, následně formulací pravidel jejich spojování se substantivy anakonec jejich použitím vtextu. Postup práce Před rozdáním pracovního listu je nutné žáky připravit na téma úkolů avhodně je motivovat kjejich vypracování. Vtomto případě může učitel sžáky mluvit otom, co sami dělají pro své zdraví ajaké existují zdravotní problémy. Kdiskuzi může využít předem připravený text, který bude obsahovat tematizovaná adjektiva, nebo jen otázku vnázvu pracovního listu. Po tomto úvodu učitel obrátí pozornost žáků kadjektivům zdravý azdra‑ votní azeptá se jich, jaký je vnich rozdíl akterá substantiva se snimi mohou pojit. Jako motivační prvek dobře slouží návodné obrázky (zdravé jídlo nebo tělesné aktivity X různá onemocnění, nemocniční personál). Odpovědi žáků lze zapisovat na tabuli formou myšlenkové mapy. Následně učitel rozdá žákům pracovní list. Ti pak splní první úkol dle schopnosti práce skorpusem sami, ve dvojicích nebo společně sučitelem. Před plněním je vhodné projít postup práce skorpusem. Žáci mohou první cvičení také dostat za domácí úkol. Vpřípadě, že žáci některým substantivům, která najdou, nerozumí, je třeba jejich význam osvětlit. Vhodné je využít předem připravené obrázky apříkladové věty. Příkladové věty mohou žáci sami najít kliknutím na pozitivní filtr (p/n) uvybraného substantiva vseznamu kolokátů, po kterém se jim objeví všechny věty sdaným adjektivem asubstantivem. Věty pocházejí zčeských textů, je třeba proto počítat stím, že mohou být pro žáky na nižší jazykové úrovni (asi do B2) nesrozumitelné amatoucí. Důležité je upozornit žáky také na gramatický rozdíl mezi měkkým adjektivem zdravotní atvrdým adjektivem zdravý. Tvary adjektiv si opět mohou ověřit kliknutím na pozitivní filtr udaného substantiva. Nalezené kolokace by během kontroly vždy měli číst se správnou koncovkou adjektiva (tj.zdravý rozum, zdravá výživa X zdravotní problém, zdravotní sestra). 80 korpusy v jazykovém vyučování Až si žáci najdou substantiva abude osvětlen jejich význam, měli by se sami nebo ve skupině pokusit zformulovat významovou definici. Mohou vymyslet příklady dalších kolokátů (některé jsou uvedeny včásti řešení). Druhý úkol žáci plní až po kontrole prvního. Opět je nutné, aby před začátkem práce rozuměli zadaným substantivům aaby adjektiva použili se správnou koncovkou. Třetí úkol mohou žáci plnit samostatně nebo ve dvojicích. Mohou soutěžit oto, který text bude nejvtipnější nebo ve kterém bude použito nejvíce spojení adjektiv asubstantiv. Učitel si může připravit začátek textu, na který budou žáci navazovat. Např.Když byla Klára malá, měla hodně zdravot‑ ních problémů. Kvůli nim často chyběla ve škole, atak ještě vdeseti letech neuměla dobře číst apsát… Texty poté mohou žáci přečíst vplénu nebo je učitel může vybrat aopravit. Texty si také žáci mohou opravit navzájem. využití korpusů ve výuce 81 Pracovní list ZDRAVÝ ŽIVOTNÍ STYL = ŽÁDNÉ ZDRAVOTNÍ PROBLÉMY? 1. Najděte vkorpusu SYN2015 deset nejčastějších substantiv po adjektivech zdravý azdravotní. Potom vysvětlete, co znamenají akdy se používají. zdravý zdravotní 1. 2. 3. 4. 5. 6. 7. 8. 9. 10. 2. Co ještě může být zdravé aco zdravotní? Přiřaďte anapište ksubstantivům adjektivum se správnou koncovkou: handicap, holčička, noha, obtíž, prohlídka, zub zdravý: zdravotní: 82 korpusy v jazykovém vyučování 3. Napište krátký text, ve kterém použijete vždy alespoň třikrát adjektivum zdravý azdravotní. Ke každému adjektivu musíte použít jiné substantivum. využití korpusů ve výuce 83 Postup práce skorpusem Postup 1 1. Vkorpusu SYN2015 zvolte Typ dotazu lemma ado okénka Dotaz napište hledané adjektivum (zdravý nebo zdravotní). Dále rozbalte možnost Spe‑ cifikovat kontext. Zde včásti Slovní druh zadejte Velikost kontextu vpravo 1 token. Jako slovní druh zvolte podstatné jméno. Tím najdete všechny věty, ve kterých bude hned vpravo vedle daného adjektiva podstatné jméno. Obrázek 41 84 korpusy v jazykovém vyučování 2. Až se vám zobrazí konkordance, vyberte možnost Kolokace, dále zvolte Vlastní. Jako Atribut si vyberte lemma, vkontextu od 0 do 1. Obrázek 42 3. Zobrazí se frekvenční seznam nejčastějších substantiv, která se pojí sdaným adjektivem astojí ve větě vždy hned vedle něj. Obrázek 43 využití korpusů ve výuce 85 Postup 2 1. Vkorpusu SYN2015 zvolte Typ dotazu lemma ado okénka Dotaz napište hledané adjektivum (zdravý nebo zdravotní). Obrázek 44 2. Až se vám zobrazí konkordance, vyberte možnost Kolokace, dále zvolte Vlastní. Jako Atribut si vyberte lemma, vkontextu od 0 do 3. Obrázek 45 86 korpusy v jazykovém vyučování 3. Zobrazí se vám frekvenční seznam nejčastějších slov následujících po daném adjektivu, ato až do třetí pozice od vlastního adjektiva. Protože jste na začátku nespecifikovali slovní druh, je třeba ze seznamu kolokátů ručně vybrat jen substantiva. Výhodou je, že najdete ikolokáty, které jsou dále od daného adjektiva (např.zdravý životní styl). Obrázek 46 4. Pokud chcete využít pozitivní filtr, klikněte na písmeno p ve sloupci filtr. Zde je příklad pozitivního filtru usubstantiva rozum vseznamu nejčastějších kolokátů adjektiva zdravý. Obrázek 47 využití korpusů ve výuce 87 Řešení: 1. Seznam deseti nejčastějších kolokátů zdravý první postup druhý postup rozum rozum výživa výživa strava styl stravování strava potravina potravina sebevědomí stravování jídlo jídlo jedinec jedinec životospráva sebevědomí bydlení bydlení zdravotní první postup druhý postup pojišťovna pojišťovna postižení postižení pojištění pojištění stav péče péče stav sestra sestra potíž potíž problém problém komplikace komplikace služba služba 94 korpusy v jazykovém vyučování Pracovní list DĚKUJU TI ZA DÁREK. DĚKUJI VÁM ZA POMOC. 1) Jak můžeme včeštině děkovat? 2) Co je typické pro psaní aco pro mluvení? Podívejte se do korpusu (https://syd.korpus.cz/). Pro psaní je typické: Pro mluvení je typické: 3) Doplňte do tabulky procenta zgrafů. varianta psaní mluvení děkuji děkuju 4) Zahrajte se spolužákem minidialog. Spolužákovi musíte vdialogu za něco poděkovat. 5) Napište krátký e ‑mail učiteli nebo učitelce. Ve ‑mailu musíte za něco poděkovat. využití korpusů ve výuce 95 Postup práce skorpusem Do jednoho okénka aplikace SyD zadejte tvar děkuji, do druhého děkuju. Nechte zaškrtnuté políčko a=A(nezáleží na tom, jestli je první písmeno malé nebo velké), ale nezaškrtávejte políčko lemma (chcete hledat jen tyto konkrétní tvary slovesa). Klikněte na tlačítko Porovnat varianty. Zobrazí se vám tento výsledek: Obrázek 49 Řešení 1. děkuji, děkuju (děkuju/imoc, díky, dík, díkec, ď) 2. Pro psaní je typické děkuji. Pro mluvení je typické děkuju. 3. varianta psaní mluvení děkuji 64,12% 20,27% děkuju 35,88% 79,73% varianta psaní mluvení děkuji 64,12% 20,27% děkuju 35,88% 79,73% 96 korpusy v jazykovém vyučování 5.2.4. KWords Anotace Cvičení tohoto typu pomáhají žákům při psaní textů určitého žánru nebo zadání. Pomocí srovnání příslušných textů (zde charakteristik) avyváženého referenčního korpusu, který obsahuje texty všech žánrů, mohou žáci sami zjistit, která slova jsou pro dané texty typická. Tato slova poté mohou vědomě použít při psaní vlastního textu. Lze vytvořit také offline variantu, kdy si učitel klíčová slova najde předem ažákům je pouze prezentuje. Třetí úkol ztohoto pracovního listu by tak nevyžadoval práci skorpusem ve výuce, ostatní úkoly mohou žáci plnit stejným způsobem. Postup práce Pracovní list by měl být zařazen do výukového bloku, během kterého si mají žáci osvojit dovednosti potřebné kpsaní textu určitého žánru. Tento pracovní list je věnován charakteristice, lze jej ovšem obměnit pro potřeby jakéhokoliv jiného žánru. Než žáci začnou spracovním listem pracovat, měli by se seznámit stím, jak charakteristika vypadá. Na začátku výukového bloku může učitel pomocí brainstormingu zjistit, co si žáci pod pojmem charakteristika vybaví (úkol 1). Sami se mohou pokusit formulovat, co by měla dobrá charakteristika obsahovat ajak by měla být strukturována. Své domněnky by si poté měli ověřit na vhodně zvolené příkladové charakteristice, kterou by si měli přečíst aspolečně sučitelem okomentovat zhlediska použité slovní zásoby, struktury iobsahu (úkol 2).44 Práce skorpusem může být zařazena na toto místo pro zpestření ajako alternativní způsob nacházení klíčových slov typických pro daný žánr. Učitel by se žáků nejprve měl zeptat, která klíčová slova nacházejí vpříkladovém textu. Žáci by si je měli vyznačit apoté společně sučitelem diskutovat otom, zda to jsou opravdu slova typická pro daný žánr. Dále je možné využít vlastní práci skorpusem. Učitel si předem připraví soubor textů daného žánru, které následně sžáky zanalyzuje pomocí aplikace KWords. Textů musí být několik, aby obsahovaly dostatek materiálu pro analýzu. Ideální je rozsah několika set až několika tisíc slov. Příliš dlouhé texty analyzuje program moc dlouho.45 Při vkládání je nutné odstranit informaci, odkud byly texty zkopírovány, jinak by se názvy stránek pravděpodobně objevily mezi klíčovými slovy. Žáci mohou samozřejmě najít texty sami během hodiny, vtom případě je ovšem třeba počí44 Okomentované příklady textů různých žánrů, které mají být žáci schopni napsat během maturity zčeštiny, naleznete například na stránce http://www.statnimaturita -cestina.cz. 45 Vtomto pracovním listu byly použity texty ze stránek http://www.statnimaturita -cestina. cz/charakteristika ahttp://www.cesky -jazyk.cz/slohovky/charakteristiky/#axzz5IEYwRMn2. využití korpusů ve výuce 97 tat svyšší časovou náročností. Výhodou je naopak to, že se žáci naučí hledat zdroje inspirace ataké budou během práce aktivnější. Alternativně může učitel shromáždit soubor prací žáků sčeštinou jako mateřštinou. Na žáky sOMJ může působit motivačně, že analyzují texty svých spolužáků. Analýzu mohou žáci provádět samostatně, jednodušší je ovšem práce vplénu. Výsledkem analýzy jsou texty sčerveně vyznačenými klíčovými slovy. Tato slova lze také zobrazit ve formě frekvenčního seznamu (vizpostup práce skorpusem). Žáci si mohou na výsledcích ověřit, zda se nalezená klíčová slova shodují sjejich představou oslovní zásobě typické pro daný žánr. Vklíčových slovech se nejspíš objeví slova ze skupiny vzhled, vlastnosti, zájmy, činnosti ajména. Pravděpodobně žáci naleznou také časová určení. Tato slova by měli shromažďovat do skupin aříct, proč se vcharakteristice objevují. Aplikace umožňuje také zobrazit, jak se jednotlivá klíčová slova propojují (vizpostup práce skorpusem). Na analýzu ainterpretaci výsledků by měla navázat vlastní produkce. Žáci by měli napsat vlastní charakteristiku apoužít např.deset klíčových slov, která nalezli. 98 korpusy v jazykovém vyučování Pracovní list 1. Co je typické pro žánr charakteristiky? Očem se vcharakteristi‑ kách nejčastěji píše? 2. Přečtěte si text charakteristiky. Najděte vní slova aobraty, které jsou pro charakteristiku typické. 3. Porovnejte vaplikaci KWords texty charakteristik sostatními texty. Najděte klíčová slova typická pro charakteristiku aseskupte je do skupin podle významu. Vymyslete pro každou skupinu název ado‑ plňte další příklady. např.vzhled: vlasy, nos, světlé 4. Napište vlastní charakteristiku apoužijte vní alespoň deset klí‑ čových slov. využití korpusů ve výuce 99 Postup práce skorpusem 1. Vstupní text, který chcete analyzovat (vtomto případě texty charakteristik vrozsahu alespoň 500 slov), zkopírujte do příslušného políčka aplikace KWords, které se rozbalí, když myší najedete na ikonu Vložte text. Jako referenční korpus ponechte SYN2015. Pomocí stop -listu můžete zanalýzy vyloučit všechna nabízená slova (zájmena, předložky, spojky, čísla). Ponechte zaškrtnuté ignorovat velikost písma. Nakonec klikněte na Analyzovat. Obrázek 50 2. Zobrazí se vám analyzovaný text sčerveně vyznačenými klíčovými slovy, tedy se slovy, která se vanalyzovaném textu vyskytují relativně častěji než vtextech zreferenčního korpusu.46 Obrázek 51 46 Příklad je text ze stránky http://www.statnimaturita -cestina.cz/charakteristika. 100 korpusy v jazykovém vyučování 3. Pokud chcete zobrazit klíčová slova jako frekvenční seznam, klikněte na záložku Klíčová slova vhorní liště. Zobrazí se vám jednak seznam, jednak barevný graf. Obrázek 52 4. Pokud kliknete na záložku Keyword links, zobrazí se vám graf, který znázorňuje, jak jsou jednotlivá klíčová slova propojena, tedy vjakém kontextu se vyskytují. Obrázek 53 využití korpusů ve výuce 101 Řešení Výsledky úkolů 2 a3 závisí na zvolených vzorových textech. Vtextech zvolených pro výše uvedenou analýzu byla nalezena tato klíčová slova: štíra, vážím, zábavný, studuje, Libor, náladu, hraní, světlé, humor, inteligentní, kluk, znamení, nos, zájmy, narodil, modré, školu, úsměvem, úsměv, vlasy, li‑ dem, pokaždé, rád, nedávno, Tomáš, člověka, Petr, vždy, často, opravdu, patří, člověk, oči Vnašem případě je na prvním místě slovo štíra, které odkazuje na znamení. Ztoho lze usuzovat, že se vcharakteristikách často mluví oznamení daného člověka. Na prvním místě je proto, že názvy znamení nejsou tak typické pro texty ostatních žánrů. Dalším slovem je vážím, jelikož zadání vybraných charakteristik znělo Charakteristika člověka, kterého si vážím. Ostatní slova lze shromáždit do skupin, např.vlastnosti (zábavný, inteligentní, hu‑ mor), vzhled (světlé vlasy, nos) nebo časová určení (pokaždé, nedávno, často), která ukazují na to, že součástí charakteristiky bývá ivyprávění nějakého zážitku, který nás sdaným člověkem pojí. Skupiny lze samozřejmě rozšiřovat odalší příklady. použitá literatura 103 Použitá literatura Cvrček, V. akol. (2010). Mluvnice současné češtiny. Praha: Karolinum. Čermák, F.– Schmiedtová, V. (2004): Český národní korpus– základní charakteristika aširší souvislosti. In: Národní knihovna, knihovnická revue 15, 2004, č.3., str.152–168. Čermák, F. (2011). Korpusy včera, dnes azítra. In: Korpusová lingvistika Praha 2011 2 Výzkum avýstavba korpusů (eds. F. Čermák akol.). Praha: Nakladatelství Lidové noviny. Český národní korpus– základní charakteristika aširší souvislosti. Národní knihovna, knihovnická revue, 15, 2004, č.3., str.152–168 Ellis, R. – Barkhuizen, G. (2005). Analysing Learner Language. Oxford: Oxford University Press. Granger, S. (2009). The contribution of learner corpora to second language acquisition and foreign language teaching: Acritical evaluation. In: Corpora and Language Teaching (ed. K. Aijmer). Amsterdam and Philadelphia: Benjamins, 2009, str.13–32. Han, N.-R. et al. (2010). Using an Error-Anotating Learner Corpus to Develop an ESL/ EFL Error Correction System. Dostupné online 13. 12. 2018: https://www.cs.rochester.edu/~tetreaul/han-lrec10-final.pdf McEnery, T. – Hardie, A. (2012). Corpus Linguistics. Method, Theory and Practice. Cambridge: Cambridge Universitřy Press. Sinclair, J. (Eagles, 1996). Preliminary recommendations on Corpus Typology. Dostupné zhttp://www.ilc.pi.cnr.it/EAGLES96/corpustyp/corpustyp.html. Slovník spisovného jazyka českého [online]. Dostupný zhttp://ssjc.ujc.cas.cz/ Šebesta, K. – Škodová, S. (2012). Čeština– cílový jazyk akorpusy. Liberec: Technická univerzita vLiberci. Šebesta, K. (2010). Korpusy češtiny aosvojování jazyka. In: Studie zaplikované lingvistiky / Studies in Applied Linguistics, 2, str.11–33. Štindlová, B. (2011). Žákovský korpus češtiny aevaluace jeho chybové anotace. Praha: FF UK. Šulc, M. (1999). Korpusová lingvistika. První vstup. Praha: Karolinum. Turton, N.D. and J.B. Heaton (1996). Longman Dictionary of Common Errors. Harwich: Longman. http://akces.ff.cuni.cz/ http://wiki.korpus.cz/doku.php/cnk:syn2015 https://wiki.korpus.cz/doku.php/cnk:uvod 110 korpusy v jazykovém vyučování king with the concordance listing and accompanying web apps, which are directly exploitable in work with students with different L1s, such as SyD, Morfio, KWords, and Treq. One of the book’s most interesting and useful aspects is the inclusion of sample practical worksheets. The authors have designed these to illustrate how corpus tools can be used for the development of teaching materials whilst bearing in mind the characteristic needs of the target group of students, i.e. the need of many of them to improve their knowledge of Czech in order to be able to succeed in the Czech educational system. The exercises include a variety of didactic approaches, and each worksheet is accompanied by a key which includes both the instructions for carrying out the task using one of the corpus tools and a possible solution. The book thus also offers highly practical concrete solutions for teachers who need to prepare language exercises to aid students’ progress in Czech as a second language. Kateřina Šormová, Karel Šebesta a kol. Korpusy v jazykovém vyučování Vydala Univerzita Karlova, Filozofická fakulta, nám. Jana Palacha 2, Praha 1 Obrázky Marek Šorm Typografická osnova František Štorm Sazba zpísma Skolar Dušan Neumahr Vyrobila Togga, spol. s r. o., Praha Vydání první, Praha 2019 Tomáš Gráf Věra Hejhalová Barbora Kukrechtová Karel Šebesta Kateřina Šormová ISBN 978–80–7308–897–2 KORPUSY V JAZYKOVÉM VYUČOVÁNÍ / K. Šormová, K. Šebesta a kol. KORPUSY V JAZYKOVÉM VYUČOVÁNÍ Kateřina Šormová, Karel Šebesta a kol. práce filozofické fakulty univerzity karlovy Publikace Korpusy vjazykovém vyučování je určena učitelům, studentům učitelství idalším zájemcům ovyučování jazyka. Vprvní části se čtenář seznámí steoriemi osvojování jazyka ajazykovým výzkumem, jsou mu představeny nejznámější anejvětší korpusy angličtiny, češtiny avýběrově idalších jazyků sdůrazem na korpusy akviziční, zejména na projekt AKCES. Pozornost je zaměřena také na typy korpusů ajejich parametry, tedy velikost, vyváženost, autentičnost, strukturní apoziční atributy. Vdruhé části publikace je představena práce skorpusy Českého národního korpusu, vyhledávání pomocí rozhraní KonText apomocí aplikací SyD, Morfio, KWords, Treq aukázka zapojení frekvenční analýzy do jazykového vyučování. Poslední část publikace tvoří pracovní listy věnované využití korpusových dat v jazykovém vyučování. Součástí pracovních listů je ipodrobný popis metodického postupu ařešení zadaných cvičení. Tomáš Gráf Věra Hejhalová Barbora Kukrechtová Karel Šebesta Kateřina Šormová ISBN 978–80–7308–897–2 KORPUSY V JAZYKOVÉM VYUČOVÁNÍ / K. Šormová, K. Šebesta a kol. KORPUSY V JAZYKOVÉM VYUČOVÁNÍ Kateřina Šormová, Karel Šebesta a kol. práce filozofické fakulty univerzity karlovy Publikace Korpusy vjazykovém vyučování je určena učitelům, studentům učitelství idalším zájemcům ovyučování jazyka. Vprvní části se čtenář seznámí steoriemi osvojování jazyka ajazykovým výzkumem, jsou mu představeny nejznámější anejvětší korpusy angličtiny, češtiny avýběrově idalších jazyků sdůrazem na korpusy akviziční, zejména na projekt AKCES. Pozornost je zaměřena také na typy korpusů ajejich parametry, tedy velikost, vyváženost, autentičnost, strukturní apoziční atributy. Vdruhé části publikace je představena práce skorpusy Českého národního korpusu, vyhledávání pomocí rozhraní KonText apomocí aplikací SyD, Morfio, KWords, Treq aukázka zapojení frekvenční analýzy do jazykového vyučování. Poslední část publikace tvoří pracovní listy věnované využití korpusových dat v jazykovém vyučování. Součástí pracovních listů je ipodrobný popis metodického postupu ařešení zadaných cvičení.