Víceslovné lexémy v syntaktickém kontextu
Abstract
63
Full text
Víceslovné lexémy vsyntaktickém kontextu Alexandr Rosen — Hana Skoumalová — Jiří Znamenáček ABSTRACT: Multi-word lexemes in syntactic context. We start with the assumption that (i) acorpus represents the use of language, i.e. linguistic performance, (ii) arule-based grammar represents language as asystem, i.e. linguistic competence, and (iii) corpus annotation represents the interface between the two. To detect and diagnose mismatches between the language use and the language system we use aconstraint-based grammar run as aconstraint solver on texts tagged and dependency-parsed by stochastic tools. The texts also have MWEs (multi-word expressions) identified and transformed into aconstituency-based format before the grammar is applied. We describe the role and results of the grammar, and its use to check texts annotated with morphosyntactic categories, syntactic structure and information about the status of relevant expressions as MWEs. The grammar also employs lexical resources such as avalency lexicon and adatabase of MWEs to make the checking more accurate and the annotation more informative. The results are represented as typed feature structures where MWE-related information can be shared by lexical and phrasal nodes. This allows for the annotation of MWEs as lexical units, independently of their analysis in terms of syntactic structure. Focusing on the interplay of MWEs with their syntactic context we analyse anumber of representative examples, pointing out the pros and cons of specific solutions and the whole approach. KLÍČOVÁ SLOVA / KEYWORDS: čeština, HPSG, syntax, treebank, víceslovné lexikální jednotky Czech, HPSG, syntax, treebank, multi-word expressions 1. ÚVOD Má smysl porovnávat podobu, jakou by jazyk měl mít podle slovníku agramatiky videalizované podobě abstraktních hesel apravidel, sjeho faktickým stavem podle písemných imluvených dokladů reálného užívání? Je to možné, zajímavé aužitečné? Kladná odpověď předpokládá, že existuje metoda, která takové porovnání jazykového systému aúzu umožňuje. Cílem tohoto příspěvku je představit jeden zmožných způsobů, jak takového porovnání dosáhnout, ato na příkladu víceslovných lexémů.1 Výběr tohoto nijak nepodstatného zákoutí jazyka není vůbec náhodný. Víceslovné lexémy lze totiž jen velmi obtížně uchopit jako lexémy nebo syntaktické konstrukce, atedy jako součást slovníku nebo gramatiky vtradičním slova smyslu. „Uchopit“ zde znamená nejen deskriptivně, teoreticky aformálně popsat, ale také softwarově implementovat vpodobě konkrétního slovníku agramatiky. Ktomu přistupuje ještě 1 Pro víceslovné lexémy se často používají ijiné názvy: víceslovné lexikální jednotky, frazeologismy, kolokace, frazémy, nebo idiomy. Tyto pojmy se někdy definují sdůrazem na různé specifické aspekty třídy víceslovných lexémů. Zde dáváme přednost termínu víceslovný lexém zejména zdůvodů úsporného vyjádření bez nutnosti užívat zkratky. OPEN ACCESS
64 STUDIE ZAPLIKOVANÉ LINGVISTIKY 2/2020 jejich různorodá povaha avariabilita daná nejen systémovými vlastnostmi, ale také nejrůznějšími odchylkami vúzu. Nejsme samozřejmě první, kdo se oněco takového snaží. Hlavní inspirací pro naši práci byl projekt PARSEME abohatá literatura vzniklá na jeho základě (Sailer & Markantonatou, 2018; Markantonatou, Ramisch, Savary & Vincze, 2018; Parmentier & Waszczuk, 2019), ale již před tímto projektem se mnozí čeští izahraniční lingvisté zabývali teoretickým popisem víceslovných lexémů (Čermák, 2007; Moon, 2007; Baldwin & Kim, 2010) ipraktickým sestavováním slovníků adatabází (Čermák et al., 1983–2009; Kopřivová & Hnátková, 2014), obohacováním valenčních slovníků ofrazémy (Przepiórkowski, Hajič, Hajnicz & Urešová, 2017; Kettnerová, Lopatková, Bejček & Barančíková, 2018), nebo anotací víceslovných výrazů vsyntakticky anotovaných korpusech (Bejček & Straňák, 2010; Lopatková, 2015). Vycházíme ztoho, že úzus je zachycen vjazykovém korpusu, zatímco systém je dán abstraktní gramatikou aslovníkem. Běžné automatické nástroje na lingvistickou anotaci textů vkorpusu (taggery, parsery) dnes počítají stím, že se jazyk vtextech může více či méně odlišovat od spisovné normy, ausilují ointerpretaci všech výrazů ajevů, aniž by odchylky nějak vyznačovaly. Anotace však může zachycovat úzus včetně těchto odchylek, ato ivlingvisticky definovaných pojmech. Představuje tak styčný bod mezi územ asystémem. Gramatika se slovníkem tak může text analyzovat azjišťovat, kde ajak se úzus asystém liší.2 Takto představená koncepce představuje ideální stav, kdy anotace správně popisuje text agramatika se slovníkem přesně abeze zbytku popisuje jazykový systém. Ve skutečnosti může disharmonie při analýze anotace signalizovat více možností: 1. odchylku úzu od systému, včetně odchylek, které lze považovat za chyby (tedy optimální, žádoucí výsledek); 2. chybu vanotaci textu; 3. chybu nebo opominutí vgramatice nebo slovníku. Ikdyž stanovit diagnózu disharmonie výběrem ztěchto tří možností není pro tuto metodu samozřejmé ani snadné, může být užitečný ipouhý signál, že anotace textů neodpovídá očekávání. Lze tak přispět kvývoji anotačních nástrojů, případně opravě anotace, nebo také kvývoji gramatiky adoplňování slovníku. Vtomto příspěvku se zaměříme nejprve (včásti 2) na popis dat adalších zdrojů, které využíváme vprojektu Mezi slovníkem agramatikou,3 tedy na anotované texty, jejich formát, postup anotace azpůsob porovnání sgramatikou aslovníkem. Včásti 3 2 Podobnou koncepci představuje spojení projektu Składnica (parsebank, tedy syntakticky anotovaný korpus— treebank, vytvořený syntaktickým analyzátorem— parserem) sprojektem Świgra (gramatika) (Woliński, 2019). 3 Příspěvek vznikl vrámci prací na projektu Mezi slovníkem agramatikou (Between Lexicon and Grammar) podpořeném Grantovou agenturou České republiky, reg. č.16-07473S. Tento projekt navazuje na projekt Treebank češtiny na základě gramatiky, podpořený ze stejného zdroje, reg. č.13-27184S (Jelínek et al., 2014; Jelínek, Petkevič, Rosen, Skoumalová & Vítovec, 2015; Petkevič, Rosen, Skoumalová & Vítovec, 2015; Rosen & Skoumalová, 2018). OPEN ACCESS
ALEXANDR ROSEN — HANA SKOUmALOVá — JIŘÍ ZNAmENáčEK 65 představíme naši taxonomii víceslovných jednotek, včásti 4 obsah aformu gramatiky aslovníku, včásti 5 pak probereme výsledky. Vzávěrečné diskusi (část 6) pak zdůrazníme silné stránky islabiny tohoto projektu. 2. DATA Při vývoji aplikací orientovaných na přirozený jazyk je dnes běžné využívat autentická jazyková data ivlingvistickém výzkumu, zejména vpodobě jazykových korpusů. Texty vnich obsažené jsou často vybaveny lingvistickou anotací, tedy např.údaji oslovním druhu amorfologických kategoriích každého slova, případně iojeho syntaktické funkci azapojení do syntaktické struktury věty. Někdy se anotují ifrazeologismy nebo tzv.pojmenované entity, tedy slova nebo slovní spojení, která odkazují na konkrétní osoby, místa, data audálosti. Všechny tyto druhy lingvistické anotace se provádějí téměř vždy automaticky, ato svyužitím stochastických modelů, vygenerovaných ze vzorově anotovaných textů (etalonu), případně islovníků. Takové metody mohou být dostatečně spolehlivé pro řadu účelů, ale jen výjimečně jsou zcela bez chyb. Navíc jsou postaveny před úkol anotovat (tj.analyzovat) reálné texty, které někdy neodpovídají nejen jazykové normě, ale ani etalonu. Istakovými případy se však tyto metody vypořádají, aniž by na výsledku bylo na první pohled patrné, že text neodpovídá očekávání. To může být často užitečné, pokud výsledek využívají prakticky zaměřené aplikace, ale ne vždy žádoucí, pokud nás zajímají právě odchylky od libovolně definovaného standardu. Důraz na empirická data amožnosti jejich využití pro praxi ivýzkum se tak střetává steoreticky motivovanou potřebou verifikovat hypotézy formálně vyjádřené pravidly gramatiky aslovníkem. Nespočetné doklady jazykového úzu se sice stávají součástí empirických modelů jazyka, ale tyto modely nejsou zhlediska lingvistické teorie dostatečně transparentní, nepracují slingvistickými pojmy anelze vnich ověřovat lingvistické hypotézy. Výsledkem aplikace empirických modelů na texty však je anotace, kterou lze ověřovat aanalyzovat pomocí gramatiky aslovníku vytvořených tradičními lingvistickými metodami. Anotace korpusu tak představuje styčný bod mezi langue aparole, mezi jazykem jako systémem vpodobě gramatiky aslovníku na jedné straně ajeho užitím, který představuje korpus, na straně druhé (Rosen, 2018). Víceslovné lexémy definujeme široce jako výrazy, které se skládají zvíce slovních tvarů avyznačují se alespoň některým zvíce typů idiomatičnosti. Zhlediska jazykového systému se nacházejí mezi dvěma póly: slovníkem agramatikou. Prostor mezi těmito póly je zaplněn víceslovnými lexémy nejrůznějších typů, které se jim navíc blíží či vzdalují vzávislosti na úhlu pohledu. Ustrnulá spojení jako např.třesky plesky se výrazně odlišují od konstrukcí typu honit vodu, ato zdůvodů morfologických, syntaktických, sémantických ipragmatických. Když se omezíme jen na formálně snadno pozorovatelné projevy těchto odlišností, tedy např.míru oné „ustrnulosti“, snadno se ujistíme, že kontext nemá na podobu ustrnulých spojení žádný vliv. Oproti tomu víceslovné lexémy, které lze samy osobě analyzovat jako syntaktické konstrukce svíce či méně pravidelnými vlastnostmi svých členů, se často začleňují do kontextu podobně jako syntaktické konstrukce formálně identické. Příklad (1) ukazuje triviální OPEN ACCESS
66 STUDIE ZAPLIKOVANÉ LINGVISTIKY 2/2020 možnost flexe anegace slovesa ve víceslovném lexému. Homonymní doslovné užití týchž lexémů vpříkladu (2) vykazuje stejné formální vlastnosti. Vpříkladu (3) se spojuje idiomatické adoslovné čtení vjedné koordinaci. (1) Tihle kluci nehoní vodu vnaleštěných meďourech.4 (2) Čeřidla honí vodu kolem lodí, aby nezamrzla.5 (3) Praktická Lundová ale nehoní vodu, nýbrž vraha. Její ohoz je stále stejný: svetr, džíny, holiny.6 Příklad (4) ukazuje, že víceslovné lexémy připouštějí vnitřní modifikaci, která může zesilovat nebo jinak kvalifikovat význam celého slovního spojení. Tento příklad lze interpretovat ijako kombinaci spojení honit vodu avelká voda. Příklad (5) ukazuje slovoslednou variaci apříklad (6) možnost diateze řídícího slovesa. (4) Ve mně by Sally potkala kluka, který přijel do Prahy zPlzně honit velkou vodu, což se mu moc nepovedlo.7 (5) Rychtecký by na lázeňské kolonádě vtomhle oblečku vodu honit nemohl.8 (6) VPraze se také honí voda; […]9 Všechny výše uvedené příklady dokládají značnou variabilitu některých víceslovných lexémů. Tato variabilita je přitom alespoň uněkterých víceslovných jednotek srovnatelná sjejich neidiomatickými obdobami, ajde tedy ovariabilitu očekávanou, která je dána propojením lexikálních agramatických specifikací. Proto je důležité modelovat víceslovné lexémy vteoretickém aformálním rámci, který spojení slovníku agramatiky umožňuje. Kromě této „očekávané“ variability, dané postavením víceslovných lexémů vsystému jazyka, existuje ivariabilita daná užíváním jazyka, kterou víceslovné lexémy sdílejí se všemi výrazy ajevy, jako jsou třeba „chyby“ způsobené performančními faktory vužívání jazyka nebo tvůrčí modifikace standardu. Podobně jako ujiných výrazů akonstrukcí lze proti sobě postavit systém aúzus akonfrontovat anotaci korpusu sgramatikou aslovníkem. 3. TAXONOMIE VÍCESLOVNÝCH VÝRAZŮ Abychom mohli víceslovné jednotky popsat arozpoznat vrůzných podobách akontextech, je nutné je klasifikovat podle více hledisek: 4 SYNv8 (Křen et al., 2019); Aha!, 21.10.2010. 5 SYNv8; Mladá fronta DNES, 2.3.2018, Liberecký kraj. 6 SYNv8; Magazín Víkend DNES, č.13/2013. 7 SYNv8; Vlasta, č.22/2011. 8 SYNv8; Bulvár, č.3/2014. 9 Karel Čapek: Ze života slov, Lidové noviny, 9.1.1934; http://ld.johanesville.net/capek-80-o- -umeni-a-kulture-iii?page=236. OPEN ACCESS
ALEXANDR ROSEN — HANA SKOUmALOVá — JIŘÍ ZNAmENáčEK 67 1. typ užití (např.přísloví, pranostika, přirovnání, citace, termín, víceslovné synsémantikum) 2. syntaktický typ (např.fráze jmenná, adjektivní, adverbiální, předložková, slovesná plnovýznamová nebo skategoriálním slovesem, složená spojka nebo předložka) 3. míra ustrnulosti (možnost užití variant nebo fragmentů základní podoby, slovosledná amorfologická omezení aomezení slovesných transformací) 4. typ idiomaticity (lexikální, morfologická, syntaktická, sémantická, pragmatická, statistická).10 Kromě toho určujeme uvíceslovných lexémů také jejich lemma, definici, zařazení podle stylu nebo registru jazyka, syntaktickou strukturu (strukturní vzorec, závislostní asložkový strom) avalenci. Až na valenci uvádíme jen specifikace, které jsou zhlediska standardní gramatiky neočekávané, takže např.uspojení Pandořina skříňka není uvedeno, že se nevyskytuje vobráceném slovosledu, protože to platí obecně pro všechny jmenné fráze podobného typu, tedy např.ipro dědečkovy brýle. Všechny tyto údaje jsou uvedeny vlexikální databázi, sníž mohou pracovat uživatelé iaplikace. Podrobnější popis databáze uvádí Hnátková et al. (2019). 4. POSTUP ANOTACE Databáze je jedním zvíce zdrojů, které se při anotaci využívají. Další znich jsou valenční slovník (Lopatková, Kettnerová, Bejček, Vernerová & Žabokrtský, 2016; Rosen & Skoumalová, 2018), tagger (Skoumalová, Hnátková & Petkevič, 2011) azávislostní parser (Jelínek, 2016), nástroj pro automatickou anotaci víceslovných lexémů vtextu (Hnátková, 2002) avneposlední řadě sada nástrojů, které tvoří páteř celého postupu automatické anotace azajišťují konverzi mezi různými formáty anotace atextových dat (Jelínek et al., 2014). Text se anotuje tímto postupem (některé méně podstatné kroky neuvádíme): 1. morfologická analýza (tagger); 2. anotace víceslovných lexémů; 3. závislostní syntaktická analýza (parser); 4. doplnění údajů ovíceslovných lexémech zdatabáze; 5. konverze do formátu typovaných sestav rysů asložkových stromů; 10 Pod idiomaticitou rozumíme odlišnost od standardního systémového chování celého víceslovného lexému nebo jednotlivých slov vněm obsažených. Jednotlivé typy idiomaticity se mohou vzájemně kombinovat, svýjimkou idiomaticity statistické dané obligatorností aproximitou, ukteré má víceslovný lexém vždy kompozicionální význam, aidiomaticity sémantické, kde možnost doslovného (kompozicionálního) čtení vylučujeme. Mezi víceslovné lexémy zahrnujeme pouze ty n-tice slov, které tvoří frázi, anebo složené synsemantikum. Neuvažujeme tedy taková frekventovaná spojení jako by se nebo bychom zítra. (Více viz Cvrček, 2013; Hnátková et al., 2017; Hnátková et al., 2018.) OPEN ACCESS
68 STUDIE ZAPLIKOVANÉ LINGVISTIKY 2/2020 6. doplnění údajů zvalenčního slovníku; 7. ověření adoplnění anotace pomocí gramatiky. Při tomto postupu na sebe navazují samostatné moduly, které mají za úkol provést vždy jeden krok anotace. Tím se náš přístup liší od jiných projektů, ve kterých byla identifikace víceslovných jednotek součástí gramatiky, ať už se jednalo osystémy založené na HPSG (Sailer & Richter, 2002; Richter & Sailer, 2014), nebo na LFG (Dyvik, Losnegaard & Rosén, 2019). Vnásledující části přiblížíme gramatiku, její funkci, obsah aformu. 5. GRAMATIKA Úkolem gramatiky vtomto projektu je vprvní řadě ověřit, zda úzus, zastoupený lingvisticky anotovanými texty sdůrazem na víceslovné lexémy, odpovídá pravidlům této gramatiky alexikálním specifikacím ze slovníku, společně představujícím jazyk jako systém. Negativní výsledek, tedy zjištění, že anotace textů neodpovídá pravidlům, může vkonkrétním případě znamenat inesprávnou anotaci nebo neadekvátní popis vgramatice či slovníku. Anotace, která obsahuje morfologickou asyntaktickou analýzu textů spolu sidentifikací víceslovných lexémů, prochází kontrolou formální ijazykové správnosti akonzistence. Anotace vyjadřující kompatibilní analýzu jsou obohaceny odalší informace: relevantní vlastnosti lexikálních kategorií jsou promítnuty do frázových uzlů, lexikální kategorie dostávají valenční rámce, které mají být naplněny větnými členy vdané větě. Uvíceslovných lexémů, které jsou jako takové anotovány jen vterminálních uzlech, se relevantní informace odaném lexému dostávají do vyšších složek. Toto sdílení informací ovíceslovném lexému mezi syntaktickými dcerami amatkami končí unejnižší složky, která obsahuje všechny součásti frazému, ikdyž může obsahovat ijiné podsložky. Kromě syntaktického modulu, který kontroluje syntaktickou strukturu amorfosyntaktické údaje obsažené vanotaci textů atuto analýzu doplňuje oinformace zvalenčního slovníku azterminálních uzlů složkového stromu, je součástí gramatiky také modul lexikální, který využívá lexikální hesla zexterního valenčního slovníku ageneruje valenční rámce pro slovesa vtextu, ato ve více verzích podle možných diatezí (viz Skoumalová, 2016). Gramatika je implementována vsystému Trale,11 formalismu určeném pro gramatiky založené na HPSG, lingvistické teorii pro modelování lingvistických výrazů jako strukturovaných sestav rysů (viz např.Pollard & Sag, 1994). Formát gramatického formalismu je kompatibilní sformátem analýzy aslovníkových hesel. Jednou znejdůležitějších vlastností této teorie iformalismu je pojetí gramatiky jako množiny omezení, která jsou kladena na výrazy jazyka. Nejde tedy omnožinu pravidel, která vprocedurálním smyslu pomocí syntaktických stromů generují nebo analyzují ře11 https://hpsg.hu-berlin.de/Software/Trale/, http://www.sfs.uni-tuebingen.de/hpsg/archive/projects/trale OPEN ACCESS
ALEXANDR ROSEN — HANA SKOUmALOVá — JIŘÍ ZNAmENáčEK 69 tězce slov. Výhodou takto pojaté gramatiky je kromě jiného imožnost ji interpretovat zároveň jako návod ksyntéze (generování) ianalýze. Vnašem projektu ji však interpretujeme právě jen jako omezení kladená na morfologickou asyntaktickou anotaci textu, včetně anotace víceslovných lexémů. Tím se nejvíc liší od typických aplikací lingvisticky formulovaných gramatik. Gramatika dostává na vstupu sestavy rysů, vytvořené stochastickými nástroji pro morfologickou asyntaktickou analýzu, doplněné ospecifikace víceslovných lexémů avalenčních rámců azkonvertované do náležité podoby. Proto neobsahuje žádná syntaktická pravidla bezkontextového typu afunguje jako constraint solver,12 přičemž omezení pocházejí ze tří zdrojů: data, slovník avlastní gramatika. Každá věta je na vstupu anotována jednoznačně, tj.odpovídá jí právě jeden syntaktický strom, který ani vjednom uzlu neobsahuje žádné nejednoznačné údaje. Víceznačné interpretace mohou vzniknout jen vdůsledku podrobnější taxonomie morfosyntaktických kategorií nebo nejistoty ohledně výběru valenčního rámce. 6. ANALYZOVANÉ PŘÍKLADY Na jedenácti větách, znichž většina obsahuje alespoň dva víceslovné lexémy, ukážeme výsledky aplikace gramatiky na anotované texty aproblémy stím spojené. Přitom se zaměříme hlavně na analýzu víceslovných lexémů vsyntaktickém kontextu. Ukaždé věty uvedeme její složkovou strukturu na vstupu do gramatiky, někdy ukážeme iúdaje ujednotlivých relevantních uzlů po průchodu gramatikou. Je důležité si uvědomit, že syntaktická struktura je dána stochastickou závislostní analýzou, transformovanou do složkového tvaru. Gramatika ji nemůže měnit, může ji jen kontrolovat adoplňovat údaje do uzlů struktury. Příklady obsahují víceslovné lexémy několika syntaktických typů. Uvádíme jejich seznam spolu sčísly příkladů, označením případné sémantické idiomatičnosti pomocí hvězdičky adoplněním typu příslovečného nebo přívlastkového určení (za znaménkem plus). Jmenná fráze široká veřejnost (7) sametová revoluce* (9) celou dobu (10) +čas děs ahrůza (11) klinická smrt (17) +termín svěcená voda (17) neřád neřádská (18) 12 Constraint solver je algoritmus a/nebo implementace algoritmu, který hledá řešení splňující všechna daná omezení. Ugramatiky to tedy neznamená, že gramatika něco analyzuje nebo generuje, ale aplikuje omezení daná gramatickými pravidly aslovníkem na vstupní data. Výsledkem je jednak verdikt osouladu vstupních dat spředpoklady gramatiky aslovníku, jednak potenciálně informativnější obsah výstupních dat. OPEN ACCESS
70 STUDIE ZAPLIKOVANÉ LINGVISTIKY 2/2020 Předložková fráze vdnešní době (7) +čas při vší úctě (9) +okolnost před koncem (12) +čas na plné obrátky* (12) +způsob před nedávnem (13) +čas na míru (14) +způsob vřadě případech (19) +okolnost Slovesná fráze skategoriálním slovesem mít nárok (8) dávat najevo (10) podat výkon (13) přivodit smrt (13) být nesvůj* (14) Slovesná fráze plnovýznamová chodit do práce (8) lhát si do kapsy* (9) Složená spojka ikdyž (8) (11) Složená předložka vduchu* (9) Adverbiální fráze pomalu, ale jistě (9) +způsob Následuje rozbor jednotlivých příkladů. (7) Proč vdnešní době vítězí ekonomický zájem jednotlivců nad zájmem široké veřejnosti?13 Příklad (7) obsahuje dva víceslovné lexémy, zvýrazněné vGrafu 1 podtržením. Kaž - dý znich má vsyntaktické analýze svoji složku, přičemž první znich obsahuje další neterminální uzel pro jmennou frázi. Na vstupu do gramatiky jsou však údaje ovíceslovných lexémech uvedeny jen uterminálních uzlů. Až gramatika je promítne do všech vyšších složek.14 ZGrafu 1 je už při zběžném prozkoumání patrné, že do subjektové části věty je chybně zahrnuta ipředložková fráze nad zájmem veřejnosti. Jde ochybu stochastického parseru, na niž by gramatika jako na možný problém mohla upozornit na zá13 SYNv8; Deníky Bohemia, 8.9.2009. 14 Syntaktická struktura vGrafu 1 ani vdalších grafech neobsahuje interpunkci. OPEN ACCESS
ALEXANDR ROSEN — HANA SKOUmALOVá — JIŘÍ ZNAmENáčEK 71 kladě valenčního rámce slovesa vítězit, vybaveného slotem pro předložkovou frázi spředložkou nad.15 Uzly stromu jsou označeny nikoli frázovou kategorií (NP, PP), ale funkcí: matrix je funkce pro nejvyšší uzel, reprezentující celou větu, head pro hlavu, tj.řídící větný člen (ve větě pro slovesnou frázi nebo sloveso, ve jmenné frázi pro řídící substantivum), subj pro podmět, advbPlain pro adverbiale (příslovečné určení), attrPlain pro atribut (přívlastek). Analytické tvary se synsémantiky (pomocnými slovy) se dělí na sHead (povrchovou hlavu), představující synsémantickou část, adHead (hloubkovou hlavu), zastupující autosématickou část tvaru. Díky tomuto řešení lze tutéž analýzu ze stejných dat zobrazit také jako závislostní strom, obsahující pouze terminální uzly. Je možné si vybrat mezi závislostmi hloubkovými (Graf 2), kde synsémantika jsou závislá na hloubkové hlavě, nebo povrchovými (Graf 3), kde je tomu naopak, arůznými 15 Problém analýzy předložkových frází vpodobném kontextu se objevuje idále vpříkladu (9). Graf 1:Složková struktura věty (7). Graf 2:Závislostní struktura věty (7) shloubkovými závislostmi vygenerovaná ze složkové struktury. Graf 3:Závislostní struktura věty (7) spovrchovými závislostmi vlinearizované podobě. OPEN ACCESS
78 STUDIE ZAPLIKOVANÉ LINGVISTIKY 2/2020 (13) Když před nedávnem podal sportovní výkon, bakterie jeho oslabený organismus napadla apostupně přivodila jeho smrt.28 Alternativní syntaktická analýza se slovesem asubstantivem vjediné, odalší větné členy nerozšiřitelné složce je vtěchto případech těžko představitelná (Graf 11). Považujeme to za další argument ve prospěch stávajícího řešení slexikálním asyntaktickým pohledem na víceslovné lexémy. Příklad (14) obsahuje jedno zvíce možných spojení se slovem nesvůj, které se kromě být může pojit také se slovesy cítit se, připadat si nebo vypadat, případně být použito samostatně ve stejném významu (15, 16). Svariabilitou součástí lexému se vdatabázi počítá, ale možnost užít slovo samostatně naráží na definici víceslovných lexémů. Kromě možnosti postulovat vtěchto případech elipsu přechodníku vsyntaktické struktuře se jako řešení nabízí možnost připustit jako variantu víceslovného lexému ijediné slovo. Tuto druhou možnost vrámci daného formalismu preferujeme. 28 SYNv8; Právo, 3.12.2002. Graf 10:Složková struktura věty (12). Graf 11:Složková struktura věty (13). OPEN ACCESS
ALEXANDR ROSEN — HANA SKOUmALOVá — JIŘÍ ZNAmENáčEK 79 (14) Byl evidentně nesvůj ze saka akalhot na míru.29 (15) Je tam ticho, hostů je málo apersonál stojí podél zdí, nesvůj znedostatku práce.30 (16) Trochu nesvůj si uvědomil, že se tam sním možná bude zacházet oněco přísněji než vtomto světě.31 Spojení na míru jako příslovečné nebo přívlastkové určení způsobu může být užito také jako složená předložka aplatí pro něj analogicky to, co bylo řečeno ospojení vduchu výše vpříkladu (9). Příklad (17), který je posledním příkladem zapadajícím do systému, obsahuje dvě jmenné fráze, znichž klinická smrt je označena jako termín adruhá, svěcená voda, je vestejné složce sfokalizátorem ani (Graf 13). 29 SYNv8; Deníky Bohemia, 15.9.2004. 30 SYN2015 (Křen et al., 2015); Hill, T. (2004). Kryptograf. Překlad: Demlová, M. Praha: Egmont. 31 SYN2015; Petersová, E. (2004). Neobyčejný benediktin. Překlad: Pošustová, S. Praha: Mladá fronta. Graf 12:Složková struktura věty (14). Graf 13:Složková struktura věty (17). OPEN ACCESS
80 STUDIE ZAPLIKOVANÉ LINGVISTIKY 2/2020 (17) Je vklinické smrti, té už nepomůže ani svěcená voda.32 Podobně jako uvěty (10) sverbonominálním spojením dát najevo rozhodla gramatika ivtomto příkladu, že neodpovídá valenčnímu rámci. Zde ale nešlo ovalenci víceslovného lexému, ale slovesa pomoci. Pád zájmena té byl totiž vpředchozí analýze chybně určen jako genitiv. Následují příklady, které odporují systému české syntaxe. Vpříkladu (18) je kromě víceslovné jednotky mít (něco) za sebou, která se nijak nevymyká zjazykového systému, použito spojení neřád neřádská. (18) Ten má určitě leccos za sebou, neřád neřádská.33 Vpřípadě věty (18) gramatika selhala anevydala žádný výsledek (proto se také graf liší— nepochází zvýstupu Tralu, ale zjeho vstupu). Důvodem je neshoda vrodu mezi slovem neřád ajeho adjektivním přívlastkem neřádská. Nicméně parser si světou poradil, adokonce je ive frázi neřád neřádská správně určena hlava apřívlastek. Ačkoli tato konstrukce odporuje české gramatice aje tedy nesystémová, je vžitá jako expresivní výraz, nebo spíše vzor, podle kterého se dají další výrazy tvořit (kluk ušatá, chlap mizerná atd.). Je tedy žádoucí vtomto případě uvolnit omezení daná gramatikou tak, aby věta nebyla označena za chybnou, ale uspojení neřád neřádská bylo vyznačeno, že není vsouladu se systémem. Poslední příklad ukazuje konstrukci, která se vymyká jazykovému systému aje ipociťována jako nesprávná, ale přesto se vtextech vyskytuje. Můžeme pouze spekulovat, jak ktéto chybě dochází— zda po záměně slova mnoha za slovo řadě pisatel zapomene opravit tvar případech na správný tvar případů, nebo jestli má vliv předložka v, která vyžaduje lokálovou rekci, anebo jestli někteří mluvčí jazyka začínají pociťovat tvar řadě vtéto konstrukci spíše jako číslovku. 32 SYNv8; Sport, 15.2.2017. 33 SYNv8; Šukšin, V. M. (1987). Červená kalina. Překlad: Psůtková Z. Praha: Lidové nakladatelství. Graf 14:Složková struktura věty (18). head head (2) má advbPlain (3) určitě obj (4) leccos advbPlain sHead (5) za dHead (6) sebou subj head (1) Ten apos head (8) neřád attrPlain (9) neřádská OPEN ACCESS
ALEXANDR ROSEN — HANA SKOUmALOVá — JIŘÍ ZNAmENáčEK 81 (19) Američané vřadě případech dokázali svou vstřícnost.34 Stejně jako vpředchozím případě iutéto věty gramatika nevydala žádný výsledek. Na rozdíl od předchozího případu ale nemá být gramatika opravena tak, aby nesystémovou konstrukci připustila, ale měla by na ni upozornit. 7. ZÁVĚRY Implementovali jsme aotestovali lingvisticky motivovanou složkovou gramatiku založenou na pravidlech scílem zkontrolovat adoplnit anotaci textů provedenou stochastickými nástroji. Ktomu gramatika využívá valenční slovník adatabázi víceslovných lemmat. Gramatika se interpretuje jako constraint solver, který považuje morfosyntakticky astrukturně anotované texty, pravidla gramatiky alexikální hesla za množinu omezení, která si nemají odporovat. Výsledky budou využity pro vytvoření korpusu sověřenou anotací. Součástí této anotace bude iinformace, které konstrukce nebo tvary jsou vrozporu sobecnými gramatickými pravidly. Na jejím základě bude možné statisticky vyhodnotit všechny případy, kdy je úzus vrozporu sgramatikou, ato na nejrůznějších typech jevů. Zde jsme se zaměřili na anotaci víceslovných lemmat vjedenácti větách, znichž většina obsahuje alespoň dvě taková lemmata. Ukázali jsme, jak gramatika doplňuje údaje ovíceslovných lemmatech do neterminálních uzlů ajak umožňuje kontrolu analýzy provedené stochastickými nástroji. Ikdyž se složková syntaktická struktura často liší od struktury, kterou bychom uvíceslovných lexémů očekávali, ukázali jsme přednosti dvojího pohledu. Lexikální pohled je vyjádřen informacemi vuzlech stromu asyntaktický jeho strukturou. Ikdyž jsme ukázali řadu typů víceslovných lexémů, některé typy (např.rčení) jsme nechali stranou kvůli zaměření na interakci lexémů se syntaktickým kontextem azprostorových důvodů. Jde zejména opříklady syntaktické, morfologické 34 SYNv8; Mladá fronta DNES, 8.7.1999. Graf 15:Složková struktura věty (19). subj (1) Američané head advbPlain sHead (2) v dHead sHead (3) řadě dHead (4) případech head (5) dokázali obj attrPlain (6) svou head (7) vstřícnost OPEN ACCESS
82 STUDIE ZAPLIKOVANÉ LINGVISTIKY 2/2020 alexikální idiomatičnosti, které se týkají např.neobvyklých valenčních vlastností (Když Pán Bůh dopustí, imotyka spustí. Lehce nabyl, lehce pozbyl.), elidovaného slovesa (My ovlku, vlk za dveřmi. Někdo holky, jinej vdolky. Svůj ksvému. Národ sobě.) nebo jinak neužívaných slov vneobvyklé syntaktické struktuře (láry fáry, třesky plesky, tintili vantili). Další vývoj gramatiky se zaměří dvěma směry: na vyšší pokrytí apřesnost kontrolovaných jevů astruktur ataké na automatickou diagnostiku případů, kdy anotace nesplňuje předpoklady gramatiky. SEZNAM LITERATURY Baldwin, T., & Kim, S.N. (2010). Multiword expressions. In N.Indurkhya & F.J.Damerau (Eds.), Handbook of Natural Language Processing, 2nd edition (s.267–292). Boca Raton, FL: CRC Press. Bejček, E., & Straňák, P. (2010). Annotation of multiword expressions in the Prague Dependency Treebank. Language Resources and Evaluation, 44(1–2), 7–21. Cvrček, V. (2013). Kvantitativní analýza kontextu. Studie zkorpusové lingvistiky, svazek 18. Praha: Nakladatelství Lidové noviny. Čermák, F., Hronek, J., Machač, J., Blatná, R., Churavý, M., Červená, V., Holub, J., Kopřivová, M., Kroupová, L., Mejstřík, V., Šára, M., & Trnková, A. (1983–2009). Slovník české frazeologie aidiomatiky (SČFI), svazek 1–4. Praha: Academia/Leda. Dyvik, H., Losnegaard, G.S., & Rosén, V. (2019). Multiword expressions in an LFG grammar for Norwegian. In Y.Parmentier & J.Waszczuk (Eds.), Representation and Parsing of Multiword Expressions: Current Trends (s.69–108). Berlin: Language Science Press. Hnátková, M. (2002). Značkování frazémů aidiomů vČeském národním korpusu spomocí Slovníku české frazeologie aidiomatiky. Slovo aslovesnost, 63(2), 117–126. Hnátková, M., Jelínek, T., Kopřivová, M., Petkevič, V., Rosen, A., Skoumalová, H., & Vondřička, P. (2017). Eye of aneedle in ahaystack. Multiword expressions in Czech: Typology and lexicon. In R. Mitkov (Ed.), Computational and Corpus-Based Phraseology (s.160–175). Berlin: Springer. Hnátková, M., Jelínek, T., Kopřivová, M., Petkevič, V., Rosen, A., Skoumalová, H., & Vondřička, P. (2018). Lepší vrabec vhrsti nežli holub na střeše. Víceslovné lexikální jednotky včeštině: typologie aslovník. Korpus— gramatika— axiologie, 9(17), 3–22. Hnátková, M., Jelínek, T., Kopřivová, M., Petkevič, V., Rosen, A., Skoumalová, H., & Vondřička, P. (2019). Lexical database of multiword expressions in Czech. In V.P.Zakharov (Ed.), Trudy meždunarodnoj konferencii „Korpusnaja lingvistika— 2019“ (s.9–16). St.Petersburg: Saint Petersburg University Press. Jelínek, T. (2016). Combining dependency parsers using error rates. In P.Sojka, A.Horák, I.Kopeček & K.Pala (Eds.), Text, Speech and Dialogue— Proceedings of the 19thInternational Conference TSD 2016 (s.82–92). Berlin: Springer. Jelínek, T., Petkevič, V., Rosen, A., Skoumalová, H., Vítovec, P., & Znamenáček, J. (2014). Agrammar-licensed treebank of Czech. In V.Henrich, E.Hinrichs, D. de Kok, P.Osenova & A.Przepiórkowski (Eds.), Proceedings of the Eleventh International Workshop on Treebanks and Linguistic Theories (TLT13) (s.218–229). Tübingen. Jelínek, T., Petkevič, V., Rosen, A., Skoumalová, H., & Vítovec, P. (2015). Taking care of orphans: Ellipsis in dependency and constituency-based treebanks. In M.Dickinson, E.Hinrichs, A.Patejuk & A.Przepiórkowski (Eds.), Proceedings of the Fourteenth International Workshop on Treebanks OPEN ACCESS
ALEXANDR ROSEN — HANA SKOUmALOVá — JIŘÍ ZNAmENáčEK 83 and Linguistic Theories (TLT14). (s.119–133). Warsaw: Institute of Computer Science, Polish Academy of Sciences. Kettnerová, V., Lopatková, M., Bejček, E., & Barančíková, P. (2018). Enriching VALLEX with light verbs: From theory to data and back again. The Prague Bulletin of Mathematical Linguistics, 111, 21–56. Kopřivová, M., & Hnátková, M.(2014). From dictionary to corpus. In V.Jesenšek & P.Grzybek (Eds.), Phraseology in Dictionaries and Corpora, Proceedings of EUROPHRAS 2012, Mednarodna knjižna zbirka ZORA 97 (s.155–168). Maribor: Mednarodna založba Oddelka za slovanske jezike in književnosti, Filozofska fakulteta, Univerza vMariboru. Křen, M., Cvrček, V., Čapka, T., Čermáková,A., Hnátková, M., Chlumská, L., Jelínek, T., Kováříková, D., Petkevič, V., Procházka, P., Skoumalová, H., Škrabal, M., Truneček, P., Vondřička, P., & Zasina, A. (2015). SYN2015: reprezentativní korpus psané češtiny. Praha: Ústav Českého národního korpusu FF UK. Dostupné zhttp://www.korpus.cz. Křen, M., Cvrček, V., Čapka, T., Čermáková, A., Hnátková, M., Chlumská, L., Jelínek, T., Kováříková, D., Petkevič, V., Procházka, P., Skoumalová, H., Škrabal, M., Truneček, P., Vondřička, P., & Zasina, A. (2019). Korpus SYN, verze 8 z12.12.2019. Praha: Ústav Českého národního korpusu FF UK. Dostupné zhttp:// www.korpus.cz. Lopatková, M. (2015). T-rovina PDT: Víceslovné výrazy (PDT 2.5, 3.0). Prezentace dostupná zhttps://ufal.mff.cuni.cz/~lopatkova/2015/ docs/12-t-mwe.pdf. Lopatková, M., Kettnerová, V., Bejček, E., Vernerová, A., & Žabokrtský, Z. (2016). Valenční slovník českých sloves VALLEX. Praha: Karolinum. Markantonatou, S., Ramisch, C., Savary, A., & Vincze, V. (2018). Multiword Expressions at Length and in Depth: Extended Papers from the MWE 2017 Workshop. Berlin: Language Science Press. Dostupné zhttps://langsci-press.org/ catalog/book/204. Parmentier, Y., & Waszczuk, J. (2019). Representation and Parsing of Multiword Expressions: Current Trends. Berlin: Language Science Press. Dostupné zhttps://langscipress.org/catalog/book/202. Petkevič, V., Rosen, A., Skoumalová, H., & Vítovec, P. (2015). Analytic morphology— merging the paradigmatic and syntagmatic perspective in atreebank. In J.Piskorski, L.Pivovarova, J.Šnajder, H.Tanev & R.Yangarber (Eds.), The 5th Workshop on BaltoSlavic Natural Language Processing (BSNLP 2015) (s.9–16). Hissar, Bulgaria. Pollard, C.J., & Sag, I.A. (1994). Head-Driven Phrase Structure Grammar. Chicago: University of Chicago Press. Przepiórkowski, A., Hajič, J., Hajnicz, E., & Urešová, Z. (2017). Phraseology in two Slavic valency dictionaries: Limitations and perspectives. International Journal of Lexicography, 30(1), 1–38. Richter, F., & Sailer, M. (2014). Idiome mit phraseologisierten Teilsätzen: Eine Fallstudie zur Formalisierung von Konstruktionen im Rahmen der HPSG. In A.Lasch & A.Ziem (Eds.), Grammatik als Netzwerk von Konstruktionen (s.291–312). Berlin: de Gruyter. Rosen, A. (2018). Coping with unruly language: Non-standard usage in acorpus. In E.Fuß, M.Konopka B.Trawinski, & U.H.Waßner (Eds.), Grammar and Corpora 2016 (s.271–287). Heidelberg: Heidelberg University Publishing. Rosen, A., & Skoumalová, H. (2018). No way to have your say out of the frame: Specifying valency of multi-word expressions. Prace Filologiczne, LXXII, 301–320. Sailer, M., & Markantonatou, S. (2018). Multiword expressions: Insights from amultilingual perspective. Berlin: Language Science Press. Dostupné zhttp://langsci-press.org/ catalog/book/184. Sailer, M., & Richter, F. (2002). Not for love or money: Collocations! In G.Jäger, P.Monachesi, G.Penn & S.Wintner (Eds.), Proceedings of Formal Grammar 2002 (s.149–160). Trento, Italy. Skoumalová, H. (2016). Slovníková pravidla pro využití slovníku VALLEX při tvorbě syntakticky anotovaného korpusu. In K.Skwarska & E.Kaczmarska (Eds.), OPEN ACCESS
84 STUDIE ZAPLIKOVANÉ LINGVISTIKY 2/2020 Výzkum slovesné valence ve slovanských zemích (s.131–147). Praha: Slovanský ústav AV ČR. Skoumalová, H., Hnátková, M., & Petkevič, V. (2011). Linguistic Annotation of Corpora in the Czech National Corpus. In V.Zacharov (Ed.), Trudy meždunarodnoj konferencii „Korpusnaja lingvistika— 2011“ (s.15–20). Sankt-Petěrburg: St.-Petersburg State University, Institute of Linguistic Studies. Woliński, M. (2019). Automatyczna analiza składnikowa języka polskiego. Warszawa: Wydawnictwa Uniwersytetu Warszawskiego. Alexandr Rosen | Ústav teoretické akomputační lingvistiky FF UK <[email protected]> Hana Skoumalová | Ústav teoretické akomputační lingvistiky FF UK <[email protected] > Jiří Znamenáček | Ústav informatiky achemie, Vysoká škola chemicko-technologická vPraze <[email protected]> OPEN ACCESS