Bohumil Zavadil osmdesátiletý
Abstract
317
Full text
issn 0008-7386 © filozofická fakulta, univerzita karlova vpraze ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.2, S. 309–314 LEMUR— DATABÁZE VÍCESLOVNÝCH LEXIKÁLNÍCH JEDNOTEK ZPRÁVA OELEKTRONICKÉ DATABÁZI Na podzim roku 2020 byl publikacemi Petkevič et al. (2020) aRosen et al. (2020) oficiálně ukončen čtyřletý projekt Mezi slovníkem agramatikou,1 jehož cílem bylo vytvořit reprezentativní databázi klasifikovaných víceslovných jednotek včeštině (dále VLJ) orozsahu nejméně 7000 hesel. Vprojektu tedy vznikla (i) databáze jakožto softwarový systém (ii) lingvistická typologie VLJ inspirovaná zahraniční adomácí literaturou arozsáhlými korpusovými daty. Oaktuálním stavu databáze atypologii víceslovných jednotek referoval za celý tým (Milena Hnátková, Tomáš Jelínek, Alexandr Rosen, Hana Skoumalová aVladimír Petkevič zÚstavu teoretické akomputační lingvistiky FF UK; Marie Kopřivová aPavel Vondřička zÚstavu Českého národního korpusu FF UK) vedoucí projektu Vladimír Petkevič na úterním semináři Ústavu Českého národního korpusu FF UK 8.prosince 2020.2 Víceslovnými jednotkami nazývají tvůrci databáze (slovníku) LEMUR ustálená významově jednotná spojení, která se skládají nejméně ze dvou slov psaných zvlášť. Hrají vjazyce významnou roli amnoho znich se vúzu vyskytuje nadprůměrně často. Vjazykovém systému jsou to jednotky nacházející se na pomezí slovníku agramatiky. Vliteratuře se označují různě (víceslovná pojmenování, víceslovné lexémy, slovní spojení, sousloví). Do databáze jsou zahrnuty také statisticky významné kolokace (srov.níže frekvenční/empirický přístup). Kbřeznu roku 2021 obsahuje databáze VLJ okolo 10 200 hesel astále se rozšiřuje, doplňuje aupřesňuje. Jednotlivá hesla jsou popisována aklasifikována na základě podrobné typologie VLJ, jež zachycuje jejich vlastnosti na těchto jazykových rovinách/ plánech: morfologie, syntax, sémantika, pragmatika, lexikon. Každá VLJ je charakterizována bohatým repertoárem vlastností scílem: — VLJ komplexně klasifikovat zhlediska jejího postavení vjazykovém systému češtiny; klasifikace je užitečná mj.pro zkvalitnění morfologické anotace asyntaktické analýzy jazykových korpusů, disambiguaci lexikálních významů, sémantické značkování, lexikografii alexikologii; — vbudoucnu propojit databázi skorpusy aumožnit tak anotovat korpusy víceslovnými jednotkami zdatabáze; — na základě anotace umožnit, aby se VLJ dala vkorpusu rozpoznat astudovat nejen ve své standardní, kanonické podobě, ale ivpodobě variant afragmentů různého typu (morfologických, syntaktických, lexikálních), ato na základě dotazů na různé vlastnosti VLJ a/nebo jejich kombinace. Vdatabázi LEMUR se autoři pokusili spojit dva přístupy (srov.Klégr, 2016): 1 Podpořila jej Grantová agentura České republiky, reg. č.16-07473S. 2 https://trnka.ff.cuni.cz/seminar. Vladimír Petkevič OPEN ACCESSOPEN ACCESS
310 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.2 — frazeologický/sémantický: VLJ jsou ustálené syntagmatické konstrukce vymezitelné svými charakteristickými vlastnostmi (top-down approach); — frekvenční/empirický: VLJ se vymezují podle frekvence výskytu ajeho statistické významnosti jako opakující se souvýskyty slov zjišťované analýzou korpusových dat (bottom-up approach). Výzkumný tým přitom vycházel ztěchto datových zdrojů: — Slovník české frazeologie aidiomatiky (Čermák et al., 1983–2009)— pro frazémy; — FRANTALEX— seznam frazémů akolokací (Milena Hnátková); — korpusy současné češtiny řady SYN vČeském národním korpusu. Zvolenou typologii inspirovala klasifikace VLJ navržená včlánku Baldwin et al. (2010) aautoři rovněž vycházeli znávrhu projektu PARSEME (http://typo.uni-konstanz.de/ parseme), který na tento článek navazuje. VLJ jsou vněm kategorizovány podle tří hlavních kritérií: a) syntaktická struktura b) ustrnulost/flexibilita c) idiomatičnost3 (včetně různých nepravidelností ve VLJ). Autoři LEMURu toto třídění přijali arozšířili se zřetelem (i) kosobitým vlastnostem češtiny: — morfologická idiomatičnost (daná velmi bohatou aspletitou morfologií češtiny) — syntaktická specifika (zvláště volný slovosled) (ii) kdvojí povaze databázových hesel: — jsou užitečná pro lidského uživatele — lze jich též využít vpočítačových aplikacích. Rozšíření zahrnuje tyto údaje avlastnosti: definici, charakteristické příklady, typ užití, fragmenty avarianty VLJ, styl/varietu VLJ arovněž podrobnější charakteristiku některých vlastností, zvláště těch, jež jsou typické pro češtinu. Velmi ambiciózní je zejména snaha zachytit fragmenty avarianty standardních VLJ. Při stanovení invariantu frazému ajeho variant odvozených od invariantu vycházejí autoři zjádra VLJ, které chápou buď jako kombinaci minimálně dvou lexikálních prvků, znichž jeden může být proměnlivý, anebo je to struktura, jejíž lexikální obsazení podléhá určitým omezením. Máme-li například standardní biblickou VLJ: Snáze projde velbloud uchem jehly než bohatý do Božího království, chápe se trojice slov velbloud uchem jehly jako její fragment ajejí modifikovaná podoba vkorpusu To by spíš velbloud vešel do království nebeského, než abych já navlékl nit uchem jehly jako její 3 Vdatabázi chápou autoři LEMURu idiomaticitu jako „obecnou vlastnost“ frazému, která se vztahuje krůzným jazykovým rovinám (lexikální, morfologické, syntaktické, pragmatické) azřetelům (frekvence). OPEN ACCESS
VLADIMÍR PETKEVIČ 311 aktualizující varianta. Kromě takovýchto fragmentů avariant hodlají autoři též zachytit takové VLJ, jež vznikly syntaktickými transformacemi ((de)pasivizace, (de) substantivizace, (de)adjektivizace) nebo syntaktickými modifikacemi ((ne)možností syntakticky rozvíjet určité slovo ve VLJ). Vcharakteristice VLJ se obecně předpokládá platnost standardních gramatických pravidel češtiny azachycují se pouze odchylky od těchto pravidel. Heslo VLJ vdatabázi LEMUR obsahuje tyto údaje (podrobnosti viz Petkevič et al., 2020): — lemma jednoznačně identifikující VLJ jak vdatabázi, tak vanotovaném korpusovém textu, například dostat_přes_kušnu; — superlemma jednoznačně sdružující skupinu nějakým způsobem příbuzných VLJ, identifikovaných svými lemmaty, např.čest_a_sláva (do příslušné skupiny patří třeba VLJ umírat pro čest aslávu, bojovat za čest aslávu…); — lemmata amorfologické vlastnosti jednotlivých komponent (slov) VLJ; — definice objasňující význam VLJ; — styl/varieta popisující VLJ podle stylu/registru: spisovný / kolokviální / nářeční / expresivní / slang / jiný; — typ užití charakterizující VLJ ztradičního frazeologického hlediska: přísloví / pranostika / přirovnání / citace / cizojazyčné spojení / termín / víceslovné synsémantikum / nespecifický slovesný frazém / neslovesný frazém / kvazifrazém / větný frazém / otevřený frazém / uzuální kolokace; — syntaktická struktura, vystižená těmito údaji: ■ syntaktický typ kategorizující VLJ podle syntaktické kategorie celé jednotky: jmenná skupina / adjektivní skupina / plnovýznamová slovesná fráze / slovesná fráze skategoriálním slovesem / adverbiální skupina / předložková skupina / složená předložka / složená spojka / složené citoslovce / klauze / souvětí / jiný složený výraz; ■ základní strukturní vzorec jako posloupnost kódovaných slovních druhů vyvozená ze syntaktického stromu VLJ; ■ syntaktický strom: závislostní ifrázový, obsahující ipříslušné syntaktické funkce; ■ adverbiální sémantický typ: místní určení / časové určení / určení způsobu / okolnostní určení; — ustálenost/flexibilita zachycená těmito údaji: ■ lexikální adalší varianty VLJ; VLJ se totiž zdaleka nemusí vyskytovat pouze ve své standardní podobě; ■ relevantní fragmenty standardní VLJ; ■ slovosledná specifika; ■ vnitřní modifikovatelnost: možnost syntakticky rozvíjet některou zkomponent VLJ; ■ syntaktické transformace: (ne)možnost nominalizace, (ne)možnost adjektivizace, (ne)možnost pasivizace či aktivní podoby; ■ morfologická omezení: morfologické zvláštnosti jednotlivých komponent (slov) VLJ dané právě jejich přítomností ve VLJ; OPEN ACCESS
312 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.2 — idiomatičnost dále členěná na idiomatičnost ■ lexikální: slova monokolokabilní / slova téměř monokolokabilní / negativa tantum / cizojazyčné výpůjčky / makaronismy / jiná; ■ morfologickou: morfologicky nestandardní tvary vyskytující se pouze vpříslušné VLJ; ■ syntaktickou: anakolut / atrakce / aposiopeze / elipsa / zvláštní valence / zvláštní slovosled / jiná; ■ sémantickou, odrážející míru významové kompozicionálnosti složek VLJ: plně kompozicionální / často kompozicionální / zřídka kompozicionální / nekompozicionální; ■ pragmatickou, charakterizující užití VLJ ve specifické situaci; ■ statistickou: nadprůměrně frekventovaná kolokace snápadně omezenou kolokabilitou. Softwarová koncepce lexikální databáze, kterou naprogramoval Pavel Vondřička, je dána především snahou zachytit variabilitu VLJ podle různých stupňů specifičnosti, např.variabilitu jednoho či více slovních tvarů konkrétního lexému, nebo variantní lexémy či různé tvary odlišných lexémů nebo frází různých typů apod. Návrh databáze počítal stím, že je nutno zachytit jak vlastnosti celé VLJ (např.syntaktický typ celé VLJ), tak vlastnosti jednotlivých komponent VLJ (např.morfologická idiomaticita je vlastností jedné komponenty VLJ); navíc například styl může záviset na konkrétní komponentě nebo být vlastností celé VLJ (např.kolokviální může být celá VLJ, ač obsahuje jen spisovná slova). Databáze je navíc koncipována se zřetelem ke dvěma cílům: lexikografickému (pro lidského uživatele) atechnickému (může například sloužit kautomatické syntaktické analýze). Variabilitu zachycují tři konstitutivní prvky ve struktuře lexikálního hesla: — sloty— jednotlivé komponenty VLJ (syntagmatická dimenze); — náplně zachycující možné typy, jež mohou být variantami komponenty; daný slot tak může být zaplněn několika různými náplněmi (dimenze paradigmatická); — vlastnosti/rysy— dvojice typu name=value, která se dá přiřadit heslu VLJ nebo konkrétnímu slotu či náplni. Slot je tedy výčet možných náplní, přičemž může být trojího druhu: — pevný/fixed— komponentu lze realizovat jen jedním zvyjmenovaných typů; — otevřený/open— komponentou může být libovolný lexém (vkonkrétním tvaru); — zčásti otevřený/semi-open— komponenta se obvykle realizuje jedním zlexémů vseznamu, ale někdy se mohou objevit synonyma nebo sémanticky příbuzné výrazy. Vdatabázovém hesle jsou zachyceny dva typy komponent: — jeden token zachycený slotem sjednou či více náplněmi, přičemž náplň definuje určitý typ pomocí pozičních atributů (lemma, tag); tag je vyjádřen jako prefix morfologicky značkovaného slova, např. OPEN ACCESS
VLADIMÍR PETKEVIČ 313 ■ určitý pád, singulár nebo plurál: lemma=“ryba“, tag=“NNF[SP]1“; ■ jakýkoli slovesný tvar: lemma=“stát“, tag=“V“; ■ jakékoli obecné adjektivum: tag=“AA“; Náplně tak reprezentují konkrétní typy, které rozpoznává syntaktický analyzátor; — fráze jsou zachyceny otevřenými sloty bez náplní; vlastnosti přiřazené slotu definují typ amorfologická omezení kladená na obsah slotu. Sloty tak mohou reprezentovat abstraktnější jednotky pro účely lexikografického popisu (pro lidské uživatele) nebo pokročilého automatického parsingu. Dokážou rovněž zachytit variabilní komponenty tvořené několika tokeny (např.variabilitu reflexivního slovesa/adjektiva/substantiva ajeho nereflexivního protějšku) astromové struktury závislostní ifrázové (sloty neterminální). Vdatabázovém hesle lze také prostřednictvím odkazu zachytit opakování téhož (variabilního) lexému, například ve VLJ Bůh dal, Bůh vzal, kde Bůh může být pouhou instancí proměnné X ve struktuře X dal, X vzal; dají se tak efektivně zachycovat typy VLJ vykazující danou strukturu. Vývoj databáze rozhodně není ukončeným projektem uzavřen, neboť — databáze se stále rozšiřuje jak extenzivně: doplňují se nová hesla zhlediska frazeologického ifrekvenčního, tak interně: zjemňuje/doplňuje/opravuje se popis již existujících neúplných hesel; — se zjemňuje či může zjemňovat sama lingvistická typologie, ato rozšiřováním repertoáru hodnot určité vlastnosti a/nebo doplňováním nových vlastností (např.původ přísloví/rčení, cizojazyčné ekvivalenty…); — vnejbližší době autorský tým plánuje propojit databázi skorpusy současné češtiny, což by umožňovalo využít potenciálu podrobného značkování databázových hesel ajejich (variantních) projevů pro vyhledávání vkorpusových textech. Vbudoucnu se autorský tým hodlá mimoto zaměřit na: — vyhledávání dalších VLJ vkorpusových datech, anotaci těchto VLJ ajejich zařazování do databáze LEMUR — zpřesňování představené typologie — publikaci dalších poznatků ovlastnostech VLJ, ato zvláště na datovém základě korpusů SYNv8, SYNv9. LITERATURA Baldwin, T.— Kim, S.N. (2010): Multiword Expressions. In: N.Indurkhya— F.J.Damerau (eds.), Handbook of Natural Language Processing, 2.vyd. Boca Raton: CRC Press, s.267–292. Čermák, F. et al. (1983–2009). Slovník české frazeologie aidiomatiky (SČFI), vol.1–4. Praha: Academia/Leda. Klégr, A. (2016): Lexikální kolokace: základní přehled ovývoji pojetí. OPEN ACCESS
314 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.2 Časopis pro moderní filologii, 98, 1, s.95–103. Petkevič, V.— Kopřivová, M.— Hnátková,M.— Jelínek, T.— Kopřiva,P.— Rosen, A.— Skoumalová,H.— Vondřička, P. (2020): Typologie víceslovných jednotek včeštině afrekvenční zastoupení jejich hlavních vlastností vžánrově vyváženém korpusu. Studie zaplikované lingvistiky, 2, s.37–62. Rosen, A.— Skoumalová, H.— Znamenáček, J. (2020): Víceslovné lexémy vsyntaktickém kontextu. Studie zaplikované lingvistiky, 2, s.63–84. Vladimír Petkevič | Ústav teoretické akomputační lingvistiky, Filozofická fakulta Univerzity Karlovy | Celetná 13, 110 00 Praha 1 ORCID ID: 0000-0003-0468-4158 [email protected] OPEN ACCESS