scieee AI-readable full text Open interactive document viewer

Databáze překladových ekvivalentů Treq

Škrabal,Michal,Vavřín, Martin

Abstract

245

Full text

ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2, S. 245–260 Databáze překladových ekvivalentů Treq1 Michal Škrabal (Praha)— Martin vavřín (Praha) THE TRANSLATION EQUIVALENTS DATABASE (TREQ) The aim of the paper is to introduce atool that has recently been developed at the Institute of the Czech National Corpus, the Treq Translation Equivalents Database, and to explore its possible uses. These range from simple, one-shot probes while searching for an equivalent expression for atarget language to more sophisticated and elaborate corpus-assisted translations. Asignificant advantage of Treq is the possibility of clicking on any equivalent and immediately verifying its individual occurrences in context— and thus being able to more easily distinguish relevant translation candidates from misleading ones. This utility, which is based on data stored in the InterCorp parallel corpus, is continually being upgraded and enriched with new functions (the recent integration of multi-word units, adding English as the primary language of the dictionaries, an improved interface, etc.), and the accuracy of results is growing as the volume of data continually increases. KEYWORDS InterCorp, Treq, translation equivalents, alignment KLÍČOVÁ SLOVA InterCorp, Treq, překladové ekvivalenty, zarovnání 1. KORPUS INTERCORP Korpus InterCorp (IC) je rozsáhlý paralelní synchronní korpus budovaný vÚstavu Českého národního korpusu již od roku 2005. Vposledních letech dochází ksystematickému rozšiřování korpusu každý rok aod roku 2013 (verze 6) jsou předchozí verze korpusu dostupné vrozhraní KonText. IC je složen zněkolika částí: ručně korigovaných beletristických textů skontrolovaným zarovnáním (tzv. jádro) atzv. kolekcí, jež obsahují texty zpracovávané nikoliv manuálně, ale automaticky. Jde otyto typy textů: 1 Tento článek vznikl při realizaci projektu Český národní korpus (LM2015044) financovaného Ministerstvem školství, mládeže atělovýchovy vrámci aktivity Projekty velkých infrastruktur pro VaVaI. Za cenné připomínky kčlánku chceme poděkovat svým kolegům Michalu Křenovi aAlexandru Rosenovi, jenž se zároveň podílel na návrhu arealizaci celého projektu Treq. Dále za podněty kvývoji tohoto nástroje vděčíme Elżbietě Kaczmarské, za technickou pomoc děkujeme Ondřeji Bojarovi aDavidu Marečkovi aza výpomoc sgrafickým zpracováním kolegovi Janu Kockovi. Vneposlední řadě patří naše poděkování též dvojici anonymních recenzentů tohoto článku. Michal Škrabal— Martin vavřín OPEN ACCESS 246 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2 — právní texty Evropské unie zkorpusu Acquis Communautaire, — publicistické články azpravodajství zwebových stránek Project Syndicate aVoxEurop (dříve PressEurop), — záznamy jednání zEvropského parlamentu zlet 2007–2011 zkorpusu Europarl, — filmové titulky ze serveru Open Subtitles. Aktuální IC v9 obsahuje kromě tzv. pivotního jazyka2— češtiny— dalších 39 jazyků, které jsou ovšem co do velikosti isložení zastoupeny nerovnoměrně: největším částí korpusu je anglická složka (necelých 120 milionů slovních tvarů, ztoho přes 21 milionů slov tvoří jádro), největším jádrem disponuje němčina (přes 31 milionů slov), ale některé jazyky ručně zpracované jádro vůbec nemají aobsahují pouze balíčky (např.vietnamština ocelkové velikosti necelých 1,5 milionu slov, tvořených výhradně filmovými titulky, aj.). Texty uvíce než poloviny jazyků jsou opatřeny morfologickou anotací (23 z39) alemmatizovány (20 z39). Celková velikost IC v9 činí více než 1,2 miliardy slovních tvarů, resp. přes půldruhé miliardy tokenů.3 2. DATABÁZE TREQ AMOŽNOSTI JEJÍHO VYUŽITÍ Nástroj Treq je poměrně nový, vodborném tisku dosud nepopsaný (sdílčí výjimkou Kaczmarska— Rosen, 2015); jeho prvotní verze (0.1 alpha) pochází ze září 2014,4 rychle si však získává oblibu mezi uživateli,5 zejména pro svou jednoduchost apřímočarost. Čerpá zdat IC, která se zpracovávají pomocí automatických nástrojů, popsaných vnásledující kapitole; výsledkem je databáze překladových ekvivalentů, která je uživatelům volně přístupná6 na webové stránce https://treq.korpus.cz. Kromě nejrozšířenějšího způsobu užití, kdy hledáme nějaký ekvivalent pro výraz ve výchozím jazyce (možná extenze tohoto základní použití je popsána dále, voddílu5), lze na protějšky nabízené Treqem pohlížet ijako na potenciální slovníkové ekvivalenty. Lexikografům se tak dostává do rukou nástroj, jenž jim vjediném okamžiku nabídne soupis kandidátů na protějšky vcílovém jazyce isfrekvencí těchto ekvivalencí (absolutní ivyjádřenou procentuálně); často přitom platí, že čím je tato frekvence vyšší, tím pravděpodobněji je daný kandidát funkčním ekvivalentem. Podstatnou výhodou je 2 Pivotním jazykem se rozumí centrální jazyk vdaném paralelním korpusu, vůči němuž jsou všechny texty vkorpusu zarovnávány. 3 Přesné složení korpusu najdete na stránkách: http://wiki.korpus.cz/doku.php/cnk:intercorp:verze9. Obecně oInterCorpu viz Čermák— Rosen, 2012, či Rosen, 2016. 4 Kverzím podrobněji viz Info overzi na stránce https://treq.korpus.cz/. 5 Za rok 2016 bylo na portálu www.korpus.cz evidováno přes 719 tisíc dotazů; nejhojněji využívaným nástrojem je KonText (svíce než 85 %), následovaný právě databází Treq (více než 70 tisíc dotazů, tj.bezmála 200 denně, což představuje necelých 10 % zcelkového počtu zadaných dotazů). 6 Samotné výsledky hledání jsou přístupné ibez registrace, stejně tak lze přejít do rozhraní KonText avidět nabízené ekvivalenty vjejich přirozeném prostředí. Pro plnohodnotnou práci stěmito daty vKonTextu je však nezbytné být přihlášen ke svému uživatelskému účtu. OPEN ACCESS MIChAL ŠkRABAL— MARTIN vAvŘÍN 247 možnost ověřit si jednotlivé realizace kteréhokoliv znich přímo vkontextu pomocí hypertextového odkazu— asnáze tak odlišit relevantní kandidáty od těch zavádějících.7 3. ZPRACOVÁNÍ DAT8 Při přípravě dat pro databázi Treq nejprve vybereme zcelého korpusu dané jazykové verze IC pouze věty, které jsou kčeštině zarovnány vpoměru 1 : 1. Výhradně jednoduchá zarovnání používáme proto, že obvykle bývají spolehlivější; zvláště vpřípadě automaticky zarovnaných textů tak můžeme předejít zanesení potenciálních chyb. Následuje automatické zarovnání po slovech vrámci těchto vět pomocí programu GIZA++ (Och— Ney, 2003).9 Dosavadní verze Trequ (0.1–1.1) využívaly zarovnání pomocí metody intersection; vznikají tak pouze dvojice, vnichž jedno slovo odpovídá jednomu ekvivalentu, např.: 7 Vytěžování dat zparalelních korpusů pro lexikografické účely je logickým postupem, tkvícím vsamotné povaze těchto dat. Přehled omožnostech extrakce dvoujazyčných slovníků zparalelních asrovnatelných korpusů podává Sharoff et al. (2013), srov.též diplomovou práci J. Tiedemanna (2000). Dílčí pokusy vtomto ohledu byly podniknuty také včeském prostředí, ato vpřípadě angličtiny (Čmejrek— Cuřín, 2001; srov.též Čmejrek, 1998, aCuřín, 1998), litevštiny (Skoumalová, 2008) či chorvatštiny (Jirásek, 2011). Kupř. poslední dva jmenovaní autoři se shodují na tom, že slovníky takto automaticky extrahované jsou pouhým východiskem pro následnou slovníkářskou práci, mohou ji však lexikografovi nemálo ulehčit. To ostatně potvrzuje inaše vlastní zkušenost: Treq je využíván při vytváření lotyšsko-českého slovníku (Škrabal, 2016b). — Potenciál databáze Treq pro lexikografické účely by si bezesporu zasloužil samostatnou studii, vtomto článku jej zmiňujeme pouze okrajově. 8 Srov. proces vzniku „statistických překladových slovníků“ (Kovář — Baisa — Jakubíček, 2016, s. 343n.). 9 Konkrétní instalace viz https://github.com/moses-smt/mgiza/tree/master/mgizapp. Využit byl též pomocný skript od Ondřeje Bojara. OPEN ACCESS 248 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2 Tzn. že vprvní větě první slovo ve zdrojovém jazyku (0) odpovídá prvnímu slovu vjazyku cílovém (0), druhé slovo (1) odpovídá třetímu slovu (2) atd. (srov.Rosen— Adamová— Vavřín, 2014; Kaczmarska— Rosen, 2015, s.164–165). Pro novou verzi (2.0) jsme se rozhodli kromě těchto jednoduchých zarovnání navíc využít metodu grow-diag-final-and, která umožňuje vytvářet ikomplikovanější zarovnání více slov na obou stranách překladu.10 Takové zarovnání pak může vypadat třeba takto: Oproti případu výše tu druhé slovo ve zdrojovém jazyku (1) neodpovídá pouze třetímu (2), ale též druhému ačtvrtému (1, 3) slovu vjazyku cílovém atd. Ztakovéhoto zarovnání následně vybíráme pomocí jednoduchého skriptu co největší množství kombinací slov, které toto zarovnání umožňuje (viz též příklad extrahovaných ekvivalentů níže). Vobou případech jsou zarovnané dvojice slov setříděny asečteny, výsledky automatické extrakce však už nejsou nijak revidovány auživateli jsou poskytnuty formou seznamu nalezených ekvivalentů zadaného výrazu, doplněných oabsolutní arelativní frekvenci. Vjakém poměru jsou frekvence nalezené vKonTextu stěmi zobrazovanými Treqem, ukazuje Tabulka 1. Ta vyčísluje různé typy dat vjednotlivých fázích jejich zpracování pro Treq zčesko-anglické složky IC v9 (víceslovná varianta). 10 Jednotlivé metody zarovnávání slov popisují asrovnávají např.Mareček, 2009, či Girgzdis et al., 2014. OPEN ACCESS MIChAL ŠkRABAL— MARTIN vAvŘÍN 249 Fáze zpracování Výsledná data Počet (vtisících) Core Subtitles Acquis Europarl VoxEurop Syndicate Celkem 0. Vstup Pozice v angličtině 25 149 66 790 29 626 17 384 3 123 4 387 146 458 Věty v angličtině 1 510 9 211 1 426 681 152 190 13 171 1. Zarovnání vět 1:1 Zarovnané věty lemmata 1 267 6 955 1 251 656 127 180 10 437 tvary 1 267 6 955 1 254 656 127 180 10 440 2. Zarovnání slov Nalezené ekvivalenty lemmata 15 785 41 189 19 344 12 812 1 670 3 352 94 153 tvary 15 538 41 445 19 656 12 899 1 598 3 344 94 479 3. Vytvoření slovníku Položky slovníku lemmata 3 235 6 697 1 441 1 213 547 550 13 682 tvary 4 639 9 276 2 056 1 946 670 873 19 460 4. Vyčištění slovníku Položky slovníku lemmata 2 775 5 375 1 133 1 061 461 458 11 263 tvary 3 966 7 146 1 722 1 760 566 750 15 909 tabulka 1.Zpracování dat pro česko-anglický slovník Po dílčích krocích lze sledovat postupný úbytek dat, která jsou ve výsledném slovníku použita. Vprvním kroku použijeme pouze zarovnání vět 1 : 1— tím přijdeme o20,7 % vět.11 Následně se vyberou na základě zarovnání zprogramu Giza++ jednoavíceslovné ekvivalenty. Vztah mezi velikostí původního korpusu apočtem vyextrahovaných ekvivalentů však nelze jasně předvídat, zvláště pak uvíceslovných ekvivalentů, kde vznikají nejrůznější kombinace stejných slov (viz tučně vysázené dvojice níže). Takto by např.vypadal abecedně řazený soupis česko-anglických párů extrahovaných zdruhé příkladové věty: a– and chybný— bad krok— move lidí— people naštvalo— angry považovalo— been widely regarded as považovalo za— been widely regarded as považovalo za— regarded a se— made Spoustu— lot of to— This to— very za— regarded a .— . 11 Vbudoucnu lze experimentovat rovněž sneparitním zarovnáváním. Další možné plány jsou naznačeny vsamotném závěru této studie. OPEN ACCESS 250 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2 Ve třetím kroku se vrámci celého textu sečtou řádky, které jsou stejné na obou stranách zarovnání. Tak získáme seznam afrekvenci ekvivalentů. Nakonec, vzávěrečném kroku, vyřadíme všechny protějšky obsahující interpunkci, čímž obdržíme finální verzi slovníku. Uvšech jazykových párů, kde je kdispozici lemmatizace na obou stranách zarovnání, aplikujeme stejný postup ina lemmatizovanou podobu dat (na počátek být stvořit vesmír .— in the beginning the universe be create .). 4. ROZHRANÍ Přístup ktakto extrahovaným datům pak zprostředkovává rozhraní Treq. Ve výchozím nastavení jsou protějšky hledaného výrazu řazeny sestupně podle četnosti; jejich relativní frekvence je uživatelovým primárním vodítkem: čím častěji se ekvivalent hledaného výrazu vyskytl ve srovnání sostatními ekvivalenty, tím vyšší je pravděpodobnost, že je funkční. Udostatečně velkých ažánrově pestrých korpusů má zajisté smysl uvádět frekvenci ekvivalentních párů zvlášť pro různé typy textů (beletrie, publicistika, právnické texty, filmové titulky suplující mluvený jazyk), tuto možnost Treq rovněž nabízí (pole Omezit na). Počínaje verzí 2 je možné do dotazovacího okénka zadávat víceslovné jednotky— ato vobou směrech— aočekávat výsledky jak jednoslovné, tak víceslovné, přičemž uživatelé mají na výběr mezi oběma možnostmi (spolu sjinými eventualitami, např.nerozlišováním mezi velkými amalými písmeny). Možnosti Trequ se tím podstatně rozšiřují: např.pro kombinaci angličtina-čeština lze nyní vyhledávat mnohé třídy slov: frázová slovesa, diskursní částice (discourse markers), fráze vobecném smyslu aj., vopačném směru např.reflexivní slovesa. Mimoto nynější výsledky více odpovídají reálnému jazykovému stavu: ekvivalenci lexémů ve zdrojovém acílovém jazyce nelze pochopitelně omezovat na „ideální“ poměr 1:1. Svíceslovnými výrazy získala na naléhavosti potřeba zakomponovat také dotazovací jazyk, který by umožňoval dotazy pomocí zástupných výrazů;12 dosud Treq vyhledával pouze přesné řetězce znaků. Kromě toho byl pro verzi 2 rozšířen primární jazyk slovníků zdosavadní češtiny na angličtinu: vedle oboustranných česko-cizojazyčných slovníků byly zdat vIC automaticky vygenerovány oboustranné slovníky anglicko-cizojazyčné. Možnost využívat Treq se tak otevírá mnohem širšímu publiku než dosud, uživatelé už nejsou limitováni nutností ovládat češtinu. Teoreticky lze vbudoucnu rozšířit primární jazyk na kterýkoliv jazyk vIC zastoupený; vtomto ohledu je nutno řídit se především zájmem apotřebami uživatelů. 12 Treq je postaven na databázovém systému MySQL, který využívá knihovnu regulárních výrazů vytvořenou Henrym Spencerem avyhovující standardu POSIX a(viz např.https:// garyhouston.github.io/regex/). Detailnější popis dotazovacího jazyka najdete vmanuálu knástroji Treq: http://wiki.korpus.cz/doku.php/manualy:treq. OPEN ACCESS MIChAL ŠkRABAL— MARTIN vAvŘÍN 251 5. DATABÁZE TREQ VPRAXI Další možné využití, jež mělo zároveň posloužit jako jakási „zatěžkávací zkouška“ nové verze Trequ (vté době dosud jen interně dostupného prototypu), bylo prezentováno vrámci kolokvia KOLT 2016, konaného loni vlistopadu (Škrabal, 2016a). Mottem daného kolokvia byl citát S. Johanssona (2007, s.1): (0) It has often been said that, through corpora, we can observe patterns in language which we were unaware of before […]. My claim is that this applies particularly to multilingual corpora. We can see how languages differ, what they share and— perhaps eventually— what characterises language in general. Protože neexistuje překlad Johanssonovy monografie do češtiny, požádali jsme své čtyři kolegy, vesměs anglisty nebo překladatele z/do angličtiny, oad hoc převod těchto tří vět. (1) Často se říká, že skrz korpusy je možné vjazyce nahlédnout pravidelnosti, které nám doposud zůstávaly skryty. Podle mě toto tvrzení platí dvojnásob vpřípadě korpusů vícejazyčných. Vyčteme znich, včem se jazyky liší, co sdílejí, aněkdy třeba iobecné vlastnosti jazyka jako takového. (2) Již bylo mnohokrát řečeno, že prostřednictvím korpusů můžeme vjazyce objevit vzorce, kterých jsme si do té doby nebyli vědomi. Domnívám se, že toto tvrzení platí dvojnásob ovícejazyčných korpusech. Můžeme vnich pozorovat, jak se jazyky liší, co sdílejí amožná nakonec iodhalit to, co charakterizuje jazyk jako takový. (3) Často se říká, že prostřednictvím korpusů můžeme vjazyce sledovat trendy, kterých jsme si dříve nebyli vědomi. Já tvrdím, že to platí zejména pro vícejazyčné korpusy. Vidíme, jak se jazyky od sebe liší, co mají společného, anakonec snad také to, co charakterizuje jazyk obecně. (4) Často se tvrdí, že pomocí korpusu lze vysledovat jazykové vzorce, kterých si jinak nejsme vědomi. Já tvrdím, že toto platí zejména na korpusy vícejazykové. Vidíme na nich, jak se jazyky vzájemně liší, včem jsou si podobné, asnad jejich pomocí nakonec zjistíme, co je pro jazyky charakteristické obecně. Variabilita je tu zjevná apochopitelná, asrostoucím počtem překladatelů by jistě nadále rostla, ale stejně tak bychom našli iopakující se překladatelská řešení; už na tomto vzorku jsou vedle odlišností patrné určité paralely, např.všichni čtyři zvolili sloveso platit, zato už každý sjinou předložkovou vazbou. Podobně bychom mohli srovnat ipřeklady strojové, generované automatickými překladači. Vybrali jsme tři, budované na statistických základech: Google Translator (GT),13 13 https://translate.google.cz/. OPEN ACCESS 252 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2 Microsoft Translator (MT), integrovaný do textového editoru Word,14 apřekladač Moses, vyvíjený Ústavem formální aaplikované lingvistiky MFF UK.15 (5) To často bylo říkal, že prostřednictvím korpusů, můžeme pozorovat vzory vjazyce, kterému jsme byli vědomi dříve. Můj požadavek je, že to platí zejména pro vícejazyčného korpusy. Můžeme vidět, jak jazyky se liší, co sdílejí a— možná nakonec— co charakterizuje jazykem obecně. (6) Často bylo řečeno, že prostřednictvím korpusy, můžeme sledovat vzorce vjazyce, který jsme nevěděli před. Moje tvrzení je, že to platí zejména pro vícejazyčné korpusů. Můžeme vidět, jak jazyků liší, co sdílejí a— možná nakonec— co je charakteristické pro jazyk obecně. (7) To často zaznělo, že prostřednictvím korpusů, můžeme pozorovat vzory vjazyce, kterému jsme byli vědomi. Žaloby je, že to platí zejména pro vícejazyčné corpora. Můžeme vidět, jak se liší jazyky, co sdílejí a— možná nakonec— co charakterizuje jazyk obecně. Vzásadě lze tvrdit, že jde oobstojné výsledky, které pro rámcovou představu osmyslu daného textu víceméně postačí. Náš zájem však netkví vpasivním porozumění cizímu textu, ale vaktivním, tvůrčím procesu převodu textu zjazyka zdrojového do cílového; zajímá nás, nakolik vtakovémto procesu mohou napomoci data zparalelního korpusu IC, ať už přes rozhraní KonText, či Treq. Na základě těchto dat jsme se pokusili vytvořit ad hoc překlad, který by se dal označit za corpus-assisted. Důležitá byla post-editační fáze překladu, kterou umožňují rovněž některé překladače (známi uvedených GT): uživatel si na úrovni jednotlivých slov či kolokací vybírá alternativní překladatelská řešení, vpřípadě anglicko-českého překladu jsou nabízeny kromě synonymních ekvivalentů ijiné pádové formy. Původní podobu si tak uživatel upravuje vsouladu se svou představou oideálním výsledku. Společným prvkem je tu jeho aktivní role: nezůstává jen pasivním příjemcem daného produktu, ale stává se činným post-editorem. Daný citát jsme si pro své potřeby rozčlenili do menších ucelených jednotek.16 Je nutno přiznat, že tato parcelace je do značné míry intuitivní azdaleka ne jediná možná. Neskrýváme tu ani předběžnou znalost zdrojového jazyka, nejde nám operspektivu badatelskou, ale spíše uživatelskou, osituaci, kdy se uživatel snaží tyto víceslovné jednotky, volněji či pevněji spojené, přeložit pomocí korpusových nástrojů. 14 Používáme verzi editoru Word 2007. Mimoto je MT kdispozici online na adrese https:// www.bing.com/translator. 15 Dostupný online na http://lindat.mff.cuni.cz/services/moses/. Všechny tři strojové překlady jsou citovány k3.12.2016. 16 Záměrně se tu vyhýbáme jakémukoliv bližšímu označení, byť se vanglickojazyčné odborné literatuře nabízejí mnohé, více či méně přesně definované, pojmy jako např.lexical bundles, lexical chunks, lexical clusters, patterns, N-grams aj. Srov.též přístup tzv. Linear Unit Gram mar, který nabízejí J. Sinclair aA. Mauranenová (2006). OPEN ACCESS MIChAL ŠkRABAL— MARTIN vAvŘÍN 253 Nezbytná je přitom jeho obeznámenost (byť jen elementární) sdaným zdrojovým jazykem, tak aby si znabízených kandidátů na ekvivalenty překládaného výrazu mohl správně vybrat. Vtomto ohledu je databáze Treq nástrojem sloužícím často kaktivaci pasivních znalostí či kpotvrzení uživatelových domněnek— ajako takovou je třeba ji brát cum grano salis. Vžádném případě ji nelze zaměňovat za regulérní slovník, měla by sloužit spíše jako jeho doplněk, který kýžené překladatelské řešení nenabízí automaticky, může však uživatele alespoň navést správným směrem. Oproti klasickým slovníkům odráží ve větší míře specifičnost některých případů mezijazykové ekvivalence, kromě frazeologičnosti např. též odlišnou slovnědruhovou platnost výrazu ajeho cizojazyčného ekvivalentu či jejich neparitní zarovnání (tj. v poměru 1 : n / n : 1). Zároveň nabízí nesrovnatelně bohatší exemplifikaci, všechny příklady nadto pocházejí z autentických, dále neupravovaných zdrojů. Námi rozparcelované věty vypadají takto: (0/1) It has often been said that, | through corpora, | we can observe | patterns in language | which we were unaware of before. (0/2) My claim is that | this applies particularly to | multilingual corpora. (0/3) We can see | how languages differ, | what they share | and— perhaps eventually— | what characterises language | in general. Jak vidno, jednotlivé úseky se od sebe dosti liší: kromě své délky též sémanticky, strukturně, mírou ustálenosti aj. Netučně jsou vysázeny jednak spojovací výrazy, jednak lexikální proměnné, které mohou variovat (ovšem ne libovolně abez jakýchkoliv omezení); zvýrazněno je pomyslné jádro daného sousloví, jež budeme hledat v(celém) korpusu InterCorp v9— English (Klégr et al., 2016): vrozhraní KonText nejčastěji pomocí typu dotazu Fráze (jednotlivé výrazy též pomocí Slovního tvaru; lze pochopitelně vždy využít také nejobecnější typ dotazu, tj.CQL), vrozhraní Treq prostým vepsáním dané fráze či slova (vzhledem kflektivnosti češtiny volíme zarovnání po slovních tvarech, tj.nevybíráme volbu Lemmata17; zaškrtnutu máme naopak volbu nerozlišovat velikost písmen), smožností využití výše zmíněných zástupných výrazů. Obecně platí, že se vždy snažíme najít co největší část tohoto sousloví; alze předpokládat, že počet dokladů bude klesat úměrně sdélkou daného dotazu— většinou půjde omalé počty výskytů: jednotky či pár desítek.18 Potvrzuje se to hned vúvodním případě: vstupní frázi, resp. její část has often been said najdeme vKonTextu pouze 9krát, přičemž všechny překlady (včetně toho posledního, nejvolnějšího) se zdají být relevantní: často se říká (2), často zaznělo (2), po 17 Dlužno podotknout, že zarovnání po lemmatech může přinést výsledky odlišné, nikoliv však zásadně. Snadná změna vnastavení dotazu umožňuje uživateli experimentovat sjednotlivými mody arozhodnout se, který mu vyhovuje více. 18 Považujeme za důležité znovu zopakovat, že to nemusí být apriori na škodu: naším cílem není žádná lingvistická či translatologická analýza, snažíme se vcítit do řadového uživatele překládajícího anglický text. OPEN ACCESS 260 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 2 Rosen, A. (2016): InterCorp— alook behind the façade of aparallel corpus. In: E.Gruszczyńska— A. Leńko-Szymańska (eds.), Polskojęzyczne korpusy równoległe. Polishlanguage Parallel Corpora. Warszawa: Instytut Lingwistyki Stosowanej, s.21–40. Rosen, A.— Adamová, M.— Vavřín, M. (2014): Extrakce lexikálních ekvivalentů zparalelního korpusu. In: Korpusová lingvistika Praha 2014. 20 let mapování češtiny. Abstrakty. Praha: Ústav Českého národního korpusu, s.177–179. Sharoff, S.— Rapp, R.— Zweigenbaum,P.— Fung, P. (eds.) (2013): Building and Using Comparable Corpora. Springer-Verlag: Berlin. Sinclair, J. M.— Mauranen, A. (2006): Linear Unit Grammar. Amsterdam— Philadelphia: John Benjamins Publishing Company. Skoumalová, H. (2008): Extracting dictionaries from parallel corpora. In: F.Čermák— R. Marcinkevičienė— E.Rimkutė— J.Zabarskaitė (eds.), Proceedings of The Third Baltic Conference on Human Language Technologies. Kaunas: Vytauto Didžiojo Universitetas, s.297–301. Škrabal, M. (2016a): Paralelně— víceslovně— lépe? Kmožnostem nové verze databáze překladových ekvivalentů Treq. In: Kolt 2016. Korpusy vkontrastivní lingvistice atranslatologii. Abstrakty. Praha: Ústav Českého národního korpusu. Cit.1. 2. 2017, dostupné z<http:// ucnk.ff.cuni.cz/kolt2016/KOLT2016_ abstrakty.pdf>. Škrabal, M. (2016b): Srovnávací aspekty lotyšského ačeského lexikonu: Materiály ksestavení lotyšsko-českého slovníku. Disertační práce. Praha: Filozofická fakulta Univerzity Karlovy. Tiedemann, J. (2000): Automatical Lexicon Extraction from Aligned Bilingual Corpora. Master’sthesis. Magdeburg: Otto-vonGuericke-Universität. Michal Škrabal | Ústav Českého národního korpusu, Filozofická fakulta Univerzity Karlovy | nám. Jana Palacha 2, 116 38 Praha 1 [email protected] Martin Vavřín | Ústav Českého národního korpusu, Filozofická fakulta Univerzity Karlovy | nám. Jana Palacha 2, 116 38 Praha 1 [email protected] OPEN ACCESS