Blýskání na lepší data z českých digitálních knihoven Libraries
Abstract
274
Full text
ČASOPIS PRO MODERNÍ FILOLOGII 105, 2023, Č.2, S. 274–292 Blýskání na lepší data zčeských digitálních knihoven1 Boris Lehečka (Brno) THERE ARE BETTER DATA AHEAD FROM CZECH DIGITAL LIBRARIES In the humanities, analysis of primary and secondary literature is an important area of research work. Besides language corpora, digital libraries, which digitized approximately 98.7 million pages in the Czech Republic between 1992 and 2022, can be considered asuitable source of written texts in recent years. The article presents an example from abroad and gives abrief overview of data sources in the Czech environment. It focuses on the recently completed DL4DH project, which aims to offer researchers access to large volumes of data from the Kramerius digital library in standardized formats (plain text, ALTO, CSV/TSV, TEI, JSON) not only through anew web application but also through aREST API. To make the subsequent analysis of the publications as easy as possible, the downloaded data can include enrichment data from the UDPipe and NameTag tools developed and operated by the LINDAT/CLARIAH-CZ research infrastructure. KLÍČOVÁ SLOVA velká data, digitální knihovna, digitální humanitní vědy, výzkumná infrastruktura, autorský zákon KEYWORDS big data, digital library, digital humanities, research infrastructure, copyright law DOI https://doi.org/10.14712/23366591.2023.2.7 1. ÚVOD Poslední dobou se objevuje stále více pozoruhodných výstupů aplikovaného výzkumu, které vzbuzují oprávněný zájem ze strany laické iodborné veřejnosti. Namátkou můžeme zmínit např.systém DALL·E2 (2022),2 který na základě slovního popisu generuje realisticky vypadající výtvarná díla (obrazy); Charles Translator for Ukraine (2022)3 určený pro strojový překlad mezi češtinou aukrajinštinou vreakci na ruskou agresi na Ukrajině ana příliv ukrajinských běženců do Česka; systém ChatGPT (2022),4 který písemně komunikuje suživatelem: odpovědi na kladené otázky 1 Tato studie vznikla vrámci Dlouhodobé koncepce pro rozvoj výzkumné organizace— Moravská zemská knihovna vBrně. 2 Viz též <https://openai.com/dall-e-2/>. 3 Viz též <https://www.mff.cuni.cz/cs/verejnost/aktuality/vedci-z-matfyzu-vyvinuli-automaticky-prekladac-mezi-cestinou-a-ukrajinstinou>. 4 Viz též <https://openai.com/blog/chatgpt/>.
BORIS LEHEČKA 275 vypadají věcně správně, názorně, edukativně, přičemž berou vpotaz fakta zpředchozí konverzace. Takový posun voblasti strojového učení aumělé inteligence by nebyl možný bez nových technologií, nových výpočetních metod azejména bez velkých objemů dat, která jsou pro trénování těchto technologií nezbytná.5 Podívejme se, jaké možnosti nabízí badatelům vtuto chvíli české prostředí: sjakými daty můžou badatelé pracovat ana základě jakých autorským zákonem daných pravidel. Uvedený přehled dostupných zdrojů anástrojů představuje pouze výběr zmnoha možností azaměřuje se specificky na digitální knihovny; kompendium rovněž nemusí sloužit pouze pro budování systémů sumělou inteligencí, ale najde uplatnění při jakémkoli výzkumu voblasti humanitních asociálních věd.6 2. DATA Zhlediska podoby dat pro výzkum můžeme rozlišovat mezi daty surovými azpracovanými. Aby bylo možné údaje využít pro konkrétní badatelský záměr, musí se vdrtivé většině případů nějakým způsobem zpracovat. Způsob amíra zpracování záleží na výzkumné otázce, na niž má analýza odpovědět. Za surová data může považovat například obrázky atexty zčeských digitálních knihoven. Ke strukturovaným datům se badatelé dostanou ve specializovaných repozitářích. Například vúložišti výzkumné infrastruktury LINDAT/CLARIAH-CZ najdeme zejména jazykově zpracovaná data,7 výzkumná infrastruktura Český sociálněvědní datový archiv (ČSDA) naproti tomu shromažďuje data zčeských sociálněvědních šetření, výzkumů veřejného mínění amezinárodních šetření sčeskou účastí.8 Přístup kdatům dostupným na internetu bývá primárně navržen tak, aby knim uživatel přistupoval prostřednictvím uživatelského rozhraní, obvykle webové aplikace. Další způsob představují webové aplikace navržené tak, aby se kdatům mohlo přistupovat automatizovaně pomocí programových prostředků. Vdřívějších dobách ktomu sloužily různé protokoly atechnologie, např.SOAP,9 vposlední době je populární programové rozhraní vkombinaci sarchitekturou REST, tzv.REST API.10 5 Větší objemy dat mají vliv nejen na větší relevantnost odpovědi, kterou systém vrací, ale také na to, že systémy mohou adekvátně reagovat na širší repertoár vstupů, které od uživatelů přicházejí. Nejnovější technologie si dokážou poradit se stovkami miliard slov amiliony parametrů. 6 Autor děkuje oběma anonymním recenzentům za jejich cenné připomínky anáměty. 7 Viz <https://lindat.mff.cuni.cz/repository/> a<https://bit.ly/cmf-lindat-riv-2020>. 8 Viz <https://www.soc.cas.cz/oddeleni/cesky-socialnevedni-datovy-archiv> a<https://bit. ly/cmf-csda-riv-2020>. 9 Data spolu srelevantními metadaty se přenášejí ve formátu XML; ostandard se stará konsorcium W3C, viz jednotlivé součásti <https://www.w3.org/TR/soap12-part0/>, <https:// www.w3.org/TR/soap12-part1/> a<https://www.w3.org/TR/soap12-part2/>. 10 Kpřenosu aúpravě dat se využívají standardní součásti protokolu HTTP; data se přenášejí obvykle ve formátu XML nebo JSON; dokumentaci programového rozhraní astandardizaci vtomto případě zaručuje specifikace OpenAPI (<https://swagger.io/specification/>).
276 ČASOPIS PRO MODERNÍ FILOLOGII 105, 2023, Č.2 3. ZAHRANIČNÍ ZKUŠENOSTI Vzahraničí mají repozitáře zaměřené na poskytování velkých objemů dat své místo již dlouhou řadu let. Jedním znich je projekt HathiTrust (2008–2023), který sdružuje zhruba 150 zahraničních knihoven, zejména zanglojazyčných zemí. Průběžně digitalizované publikace se stávají součástí jedné digitální knihovny, pojmenované HathiTrust Digital Library. Vroce 2022 obsahovala přibližně 17,1 mil. publikací, ztoho 6,57 mil. položek tvořila volná díla11 a10,55 mil. podléhala ochraně majetkových práv podle aktuálně platných autorských zákonů.12 Díla lze prohledávat na základě bibliografických metadat nebo vrámci automaticky rozpoznaného textu. Uživatelé mohou vytvářet apřípadně sdílet sostatními uživateli vlastní kolekce dokumentů. Pokud nejsou díla chráněna autorským právem, lze je prohlížet po jednotlivých stranách ve formě digitálních obrázků nebo prostého nestrukturovaného textu, případně je stáhnout ve formátu PDF stextovou vrstvou, např.prostřednictvím Google Books (vtomto případě jsou však obrázky černobílé, nikoli plně barevné). Badatelé mohou pracovat skolekcemi vybraných dokumentů, ale kvůli autorským právům mají přístup pouze kagregovaným datům ztěchto děl (např.kfrekvenci slovních tvarů na jednotlivých stranách). Uživatelé zpartnerských institucí projektu mají vrámci HathiTrust Research Center kdispozici nástroje pro další analýzu13 zvolené sady publikací. Jedná se orozpoznání pojmenovaných entit,14 tzv.„extrahované prvky“,15 identifikace témat metodou InPhO,16 počty tokenů (včetně morfologické analýzy) aslovní mraky.17 Tato metadata obsahují sumarizované údaje pro jednotlivé strany, resp.kompletní publikace, čímž je zaručeno, že nedochází kporušování autorských práv. Některé druhy sumarizačních výstupů se pravidelně aktualizují ajsou kdispozici všem zájemcům, např.geografická jména vanglojazyčné literatuře zlet 1701–2011 (Wilkens, 2020). Badatelé mají dále kdispozici programové knihovny vjazyce Python pro práci svytvořenými kolekcemi metadat. Pracovníci zpartnerských institucí mohou žádat ovytvoření samostatného virtuálního počítače snezbytným softwarem apřístupem ke všem textovým zdrojům HathiTrustu, které mohou pro svůj výzkum kombinovat svlastními daty ametadaty, případně softwarem. 11 Viz <https://cs.wikipedia.org/wiki/Volné_dílo>. 12 Pouhá dvě promile ztohoto objemu (přibližně 40 tis. publikací) tvoří dokumenty včeštině. 13 Viz <https://analytics.hathitrust.org>, zdrojové kódy jsou dostupné na <https://github. com/htrc>. 14 Viz <https://analytics.hathitrust.org/algorithms/Named_Entity_Recognizer>. 15 Viz <https://wiki.htrc.illinois.edu/display/COM/HTRC+Derived+Datasets>. 16 Viz <https://inpho.github.io/topic-explorer/>. 17 Viz <https://analytics.hathitrust.org/algorithms/Token_Count_and_Tag_Cloud_Creator>.
BORIS LEHEČKA 277 4. ČESKÉ PROSTŘEDÍ Včeském prostředí mají kprojektu HathiTrust velmi blízko digitální knihovny známé pod označením Kramerius.18 Než se této platformě, která je primárně určena pro digitalizované knihovní sbírky, monografie aperiodika, budeme věnovat podrobněji, zmíníme se odalších specializovaných zdrojích, které se dají využít pro badatelský výzkum zaměřený na české prostředí (jazykově iteritoriálně). 4.1 MANUSCRIPTORIUM Digitální knihovna Manuscriptorium (2023) umožňuje snadný přístup ksoustředěným informacím ohistorických fondech ze stovek paměťových institucí. Jedná se ocelosvětově největší digitální knihovnu zaměřenou na starší písemné dědictví, která obsahuje přes 154 tis. digitálních dokumentů různého typu (rukopisy, inkunábule, staré tisky, historické mapy aj.) avíce než 230 tis. katalogových záznamů. Vzhledem kpovaze digitalizovaných pramenů (převažují rukopisy astaré tisky) jsou kdispozici plné texty jen vomezené míře. Virtuální prostředí Manuscriptoria např.zajišťuje práci sdokumenty, jež jsou kompatibilní stechnologiemi IIIF,19 zlibovolného externího zdroje, ato díky integraci prohlížeče Mirador.20 Data každého digitalizátu jsou popsána dle schéma TEI P5 ENRICH,21 vrámci digitální knihovny má digitalizát přidělený identifikátor URI ajeho použití, popř. použití jeho metadat, podléhá různým druhům licence Creative Commons (CC). Aktuální prostředí umožňuje přihlášeným badatelům vytvářet vlastní kolekce dokumentů nebo jejich částí apřidávat kjednotlivým položkám poznámky. 4.2 MONASTERIUM Projekt Monasterium (2023) se věnuje digitalizovaným listinám, zajišťuje přístup kdigitálním dokumentům (přes 500 tis. listin) ze 176 evropských archivů,22 ztoho 11 českých. Pro metadata ojednotlivých listinách se používá specializovaný formát XML CEI.23 Badatelé mohou stahovat obrázky dokumentů ve formátu JPEG nebo PDF (ve vysokém rozlišení). Na stránkách projektu je také informace, že „[v]eškerá práva na zveřejňování arozšiřování reprodukcí listin vobrazové formě náleží jednotlivým vlastníkům archiválií“.24 Ne vždy je však zjednotlivých webových stránek sdigita18 Kramerius je původní označení opensourcové platformy, která slouží kpublikování digitálních publikací. 19 Viz <https://iiif.io>. 20 Viz <https://projectmirador.org>. 21 Viz <https://www.manuscriptorium.com/cs/tei-p5-enrich-schema-cs>. Jelikož však samotné dokumenty skořenovým elementem TEI neobsahují označení jmenného prostoru, neodpovídají dokumenty zManuscriptoria deklarovanému standardu. 22 Seznam institucí je dostupný zde: <https://www.monasterium.net/mom/fonds>. 23 Charters Encoding Initiative, viz <https://www.cei.lmu.de>. 24 Viz <https://www.monasterium.net/mom/terms-of-use>.
278 ČASOPIS PRO MODERNÍ FILOLOGII 105, 2023, Č.2 lizáty nebo zjejich zdrojových dat ve formátu CEI patrné, jaké licenční podmínky se musí při nakládání spramenem dodržovat, takže je jistější kontaktovat instituci, která danou listinu spravuje. 4.3 CZECH MEDIEVAL SOURCES ONLINE Webová aplikace Czech medieval sources FONTES (2023) obsahuje skeny sekundárních zdrojů (edic) pro studium dějin českého středověku (ke konci roku 2022 se jednalo o900 svazků ocelkovém objemu téměř 261 tis. stran). Většinou jde ovolná díla, unichž již uplynulo 70 let od úmrtí autora. Badatelé mají kdispozici digitální obrázky aplnotextové prohledávání. Publikace lze procházet po jednotlivých stranách. Centrum medievistických studií spravuje rovněž aplikaci HyperFontes (2023), digitální repertorium pramenů kčeskému středověku, tj.záznamy ainformace oautorech adílech bohemikálního charakteru. Tyto zdroje jsou součástí výzkumné infrastruktury středověkých araně novověkých bohemikálních pramenů MEMORIA, která se začlenila do velké výzkumné infrastruktury LINDAT/CLARIAH-CZ. 4.4 LINDAT/CLARIAH-CZ Výzkumná infrastruktura LINDAT/CLARIAH-CZ (2023), jejíž historie sahá do roku 2010, nabízí badatelům celou řadu specializovaných iobecně zaměřených zdrojů, mj.Bibliografii dějin Českých zemí (2013)— bibliografická data, velké množství prohledávatelných korpusů25 (např.ParCzech— česká parlamentní data zkompilovaná do korpusu slingvistickými anotacemi) nebo tematicky zaměřené zdroje (Vokabulář webový— textové, obrazové azvukové zdroje kpoznávání historické češtiny; Arne Novák— digitální knihovna prof. Arna Nováka, literárního vědce, kritika, historika aesejisty; Malach— digitální archiv orálně historických rozhovorů ap.). Významné těžiště představuje repozitář26 pro jazyková data anástroje na zpracování textu. Kjeho přednostem patří, že jsou uložená data inástroje opatřeny kvalitními metadaty včetně licenčních podmínek, takže je lze snadno dohledat, citovat apoužívat. Kdatům anástrojům slicencí, která neumožňuje bezplatné avolné sdílení, je možné přistoupit až po přihlášení krepozitáři. Lze využít přihlášení prostřednictvím institucionálního účtu uakademické instituce, která je součástí federace EduGAIN;27 obvykle je tedy možné se přihlásit pomocí účtu vsíti eduroam,28 vpřípadě potřeby lze požádat oindividuální přístup. Přihlášení je nezbytné pro badatele, kteří chtějí svá data vrepozitáři uložit. Ke konci roku 2022 obsahoval tento repozitář 492 položek, které se týkaly českého jazyka anesly ssebou obsah vpodobě přiložených souborů.29 25 Viz <https://lindat.mff.cuni.cz/services/kontext/corpora/corplist>. 26 Digitální úložiště spravované Lindatem vychází zopensourcového řešení DSpace (<https://dspace.lyrasis.org>); zdrojový kód je kdispozici vúložišti GitHub (<https://github. com/ufal/clarin-dspace>). 27 Viz <https://edugain.org>. 28 Viz <https://www.eduroam.cz>. 29 Viz dotaz <https://bit.ly/lindat-ceske-zdroje>. Pro ostatní jazyky bylo kdispozici 1406 položek, celkem LINDAT/CLARIAH-CZ evidoval 2099 položek.
BORIS LEHEČKA 279 Zhlediska práce sdaty jsou důležité také nástroje, které LINDAT/CLARIAH-CZ pro práci sjazykovými daty nabízí. Vzhledem kzaměření našeho článku upozorňujeme zejména na dva znich: UDPipe aNameTag, které lze využívat jako samostatné aplikace nebo prostřednictvím webové služby. Aplikace UDPipe 2 (Straka, 2016)30 texty tokenizuje, lemmatizuje aopatřuje morfologickou asyntaktickou anotací. Morfologická anotace má podobu jak pozičních značek,31 tak universal POS tags32 auniversal features,33 které vycházejí zmezinárodního standardu Universal Dependencies.34 Software samotný je kdispozici pod licencí Mozilla Public License 2.0,35 datové modely pro více než šedesát jazyků36 jsou dostupné pod licencí CC BY-NC-SA.37 Aplikace NameTag 2 (Straka, 2014)38 slouží kidentifikaci pojmenovaných entit (tj.jmen osob, institucí, geopolitických celků, časových údajů ap.). Datové modely39 existují pro pět jazyků. Pro program ajeho datové modely platí obdobné licenční podmínky jako upředchozího nástroje. 4.5 JAZYKOVé KORPUSY Na práci svelkými objemy dat se od svých počátků zaměřovaly jazykové korpusy. Jedná se o„rozsáhlý soubor autentických textů (psaných nebo mluvených) převedený do elektronické podoby vjednotném formátu tak, aby vněm bylo možné jednoduše vyhledávat jazykové jevy“.40 Často slouží jako lexikologický alexikografický nástroj, ale používají se ivjiných oblastech, které využívají texty jako zdroje poznání reality (historie, sociologie, psychologie apod.). Zpočátku vznikaly textové korpusy na základě tištěných předloh, později ina základě digitálních dokumentů avposlední době vznikají také korpusy sestavené ztextů dostupných na webových stránkách (viz např.projekt Aranea (Benko, 2014)). Vsoučasnosti existuje velké množství korpusů různých národních jazyků sobecným ispecifickým zaměřením na určité oblasti jazyka (poezie, historické texty, parlamentní projevy apod.). Budování korpusu pro český jazyk se ujal Ústav Českého národního korpusu FF UK, který mj.od roku 2000 co pět let zveřejňuje reprezentativní referenční korpus synchronní češtiny oobjemu cca 100 mil. slov; poslední verze SYN2020 (2020)41 obsa30 Zdrojový kód viz <https://github.com/ufal/udpipe>. 31 Viz <https://wiki.korpus.cz/doku.php/:seznamy:tagy>. 32 Viz <https://universaldependencies.org/u/pos/index.html>. 33 Viz <https://universaldependencies.org/u/feat/index.html>. 34 Viz <https://universaldependencies.org>. 35 Viz <https://www.mozilla.org/en-US/MPL/2.0/>. 36 Viz <https://ufal.mff.cuni.cz/udpipe/2/models>. 37 Viz <https://creativecommons.org/licenses/by-nc-sa/4.0/>. 38 Zdrojový kód viz <https://github.com/ufal/nametag>. 39 Viz <https://ufal.mff.cuni.cz/nametag/2/models>. 40 Viz <https://wiki.korpus.cz/doku.php/pojmy:korpus>. 41 Viz <https://wiki.korpus.cz/doku.php/cnk:syn2020>.
280 ČASOPIS PRO MODERNÍ FILOLOGII 105, 2023, Č.2 huje 121 826 797 pozic. Spojením výše uvedených synchronních korpusů spolu skorpusy publicistickými idosud nezpracovanými texty vzniká korpus SYN (2022), který ve verzi 1142 zroku 2022 obsahuje 6 067 313 960 pozic.43 Pro češtinu existuje také několik webových korpusů: Web Corpus of Czech (Spoustová, 2012)— zroku 2012, 628 332 859 pozic; Araneum Bohemicum Maximum (Czech, 15.04; Benko, 2015)44— zroku 2015, 3 198 768 569 pozic; nebo poslední Araneum Bohemicum IV Maximum (Czech, 20.03; Benko, 2020)45— zroku 2020, 7 103 994 584 pozic. Ke specializovaným zdrojům můžeme řadit např.Korpus českého verše (2021) (lemmatizovaný, foneticky, morfologicky, metricky astroficky anotovaný korpus české poezie 19.apočátku 20.století; 1689 básnických sbírek; 14 592 037 slov)46 nebo Staročeskou textovou banku (bez data) (transkribovaná nevyvážená kolekce textů staročeských literárních památek zobdobí přibližně mezi lety 1300 až 1500; 6 953 501 pozic) ap. Kpráci skorpusovými daty slouží specializované aplikace nazývané korpusové manažery. Všechny výše zmiňované zdroje využívají manažery, které vycházejí zvolně dostupné aplikace NoSketch Engine.47 Aplikace KonText48 ke konci roku 2022 přišla spřístupem ke korpusům pomocí programového rozhraní REST API.49 Programové rozhraní již delší dobu nabízí komerční produkt Sketch Engine.50 Výzkumná infrastruktura LINDAT/CLARIAH-CZ začlenila vroce 2019 mezi prezentační nástroje rovněž manažer TEITOK,51 určený pro tzv.„živé“ korpusy, které se průběžně mění ateprve vurčitých fázích vývoje se znich stávají verzované statické korpusy. TEITOK využívá pro korpusové dotazy volně dostupnou aplikaci IMS Open Corpus Workbench (CWB).52 42 Viz <https://wiki.korpus.cz/doku.php/cnk:syn:verze11>. 43 Kromě tohoto díla vznikají péčí ÚČNK idalší, více či méně specializované korpusy, např.Totalita (korpus psaného jazyka komunistického režimu, 15 350 741 pozic), CzeSL- -plain 2 (žákovský korpus češtiny nerodilých mluvčích, 2 320 678 pozic), ORAL (referenční korpus neformální mluvené češtiny, 6 361 707 pozic), DIAKORP (verzovaný korpus diachronní složky ČNK, 4 128 874 pozic) aj. 44 Dostupný pouze pro registrované uživatele. 45 Dostupný pouze pro registrované uživatele. 46 Veřejně dostupná data zrepozitáře na GitHubu (<https://github.com/versotym/corpusCzechVerse>) obsahují kvůli licenčním podmínkám pouze 1305 sbírek, 66 428 básní, 2 310 917 veršů, 12 636 867 slov, 15 399 220 pozic (tj.slov ainterpunkce). 47 Viz <https://nlp.fi.muni.cz/trac/noske>. 48 Viz <https://github.com/czcorpus/kontext>. 49 Viz <https://wiki.korpus.cz/doku.php/manualy:api> (základní informace) a<https:// github.com/czcorpus/kontext/wiki/HTTP-API (podrobná dokumentace). 50 Viz <https://www.sketchengine.eu/documentation/api-documentation/>. 51 Viz <https://www.teitok.org>; zdrojový kód: <https://gitlab.com/maartenes/TEITOK> a<https://github.com/ufal/teitok-tools>. 52 Viz <https://cwb.sourceforge.io>; zdrojový kód: <https://sourceforge.net/p/cwb/code/ HEAD/tree/>.
BORIS LEHEČKA 281 5. AUTORSKÝ ZÁKON Ať už badatel pracuje sjakýmikoli daty, na něž můžeme pohlížet jako na databázi nebo na autorské dílo, měl by dodržovat základní pravidla nakládání snimi daná autorským zákonem, tj.zákonem č.121/2000 Sb. (dále též AZ).53 Tato právní norma např.v§ 31 stanovuje pravidla pro užití citace nebo se v§ 92 vyjadřuje kvytěžování či zužitkovávání databází. Dne 5.ledna 2023 vstoupila vplatnost podstatná aktualizace AZ, která vychází zadaptace směrnice Evropského parlamentu aRady č.2019/790 ze dne 17.dubna 2019 oautorském právu aprávech sním souvisejících na jednotném digitálním trhu aozměně směrnic 96/9/ES a2001/29/ES.54 Schválené znění má mj.vliv na vytěžování textů adat za účelem získávání nových poznatků aobjevování nových trendů, jde zejména o§ 39c a§ 39d. § 39c: Licence krozmnožování díla pro účely automatizované analýzy textů nebo dat (1) Do práva autorského nezasahuje ten, kdo zhotoví rozmnoženinu díla za účelem automatizované analýzy textů nebo dat vdigitální podobě, prováděné za účelem získání informací, zahrnujících mimo jiné vzory, tendence asouvztažnosti; takto zhotovenou rozmnoženinu je oprávněn uchovat pouze po dobu nezbytnou pro účely této automatizované analýzy textů nebo dat. (2) Ustanovení odstavce 1 se nepoužije pro rozmnoženiny díla, jehož autor si užití podle odstavce 1 výslovně vyhradil vhodným způsobem; vpřípadě díla zpřístupněného podle § 18 odst. 2 strojově čitelnými prostředky. (3) Ustanoveními odstavců 1 a2 není dotčeno ustanovení § 39d. § 39d: Licence krozmnožování díla pro účely automatizované analýzy textů nebo dat kvědeckému výzkumu Do práva autorského nezasahuje a) vysoká škola, která jako součást své činnosti provádí vědecký výzkum, nebo právnická osoba, jejímž hlavním cílem je provádět vědecký výzkum nebo vykonávat vzdělávací činnost zahrnující rovněž vědecký výzkum, jestliže je vědecký výzkum této vysoké školy nebo právnické osoby prováděn tak, aby přístup kjeho výsledkům nebyl přednostně umožněn tomu, kdo na tuto vysokou školu nebo právnickou osobu vykonává rozhodující vliv, asoučasně tak, aby výzkum byl prováděn ve veřejném zájmu nebo na neziskovém základě nebo tak, že všechny zisky jsou zpětně investovány do vědeckého výzkumu této vysoké školy nebo právnické osoby, nebo b) instituce kulturního dědictví, zhotoví-li pro účely vědeckého výzkumu rozmnoženinu díla za účelem automatizované analýzy textů nebo dat vdigitální podobě, prováděné za účelem získání informací, zahrnujících mimo jiné vzory, tendence asouvztažnosti; takto zhotovenou rozmnoženinu je povinna uložit svhodnou úrovní zabezpečení amůže ji uchovávat pro účely vědeckého výzkumu, včetně ověření výsledků výzkumu. 53 Viz <https://www.zakonyprolidi.cz/cs/2000-121>. 54 Viz <https://eur-lex.europa.eu/legal-content/CS/TXT/?uri=CELEX:32019L0790>.
282 ČASOPIS PRO MODERNÍ FILOLOGII 105, 2023, Č.2 Ikdyž se bude právní praxe ve výkladu uvedených pasáží teprve ustalovat, zjednodušeně můžeme uvedené paragrafy chápat následovně: badatel (popř. badatelský tým) může pro svůj výzkum (automatizovanou analýzy textů nebo dat) pořídit kopii libovolných autorských děl, ale nesmí do nich zahrnout díla, unichž si autor takové využití nepřeje.55 Po dokončení výzkumu musí takto shromážděná díla nebo data odstranit. Instituce, které se zabývají výzkumem (tj.zejména vysoké školy), mohou také vytvářet kopie autorských děl pro účely automatizované analýzy textů nebo dat, ale na výsledky takového výzkumu se kladou některá omezení: zejména mají mít všechny další subjekty ktakovým výsledkům stejný přístup apřípadný zisk se investuje do dalšího výzkumu. Výjimečné postavení mají instituce kulturního dědictví, tj.archivy, veřejné knihovny amuzea.56 Pokud budou kopie autorských děl pro účely výzkumu dostatečně zabezpečené, mohou je pro tyto účely dlouhodobě uchovávat, mj.ipro ověření výsledků předchozího výzkumu. 6. DIGITÁLNÍ KNIHOVNY České digitální knihovny zpřístupňují digitalizované publikace jednotlivých institucí prostřednictvím opensourcové aplikace Kramerius.57 Ikdyž převažují monografie aperiodika, využívá se také pro zpřístupnění starých tisků, map, hudebnin, grafik, zvukových adalších typů dokumentů včetně tzv.borndigital58 publikací. Veškeré dokumenty jsou obohaceny opopisná metadata na úrovni titulu (odpovídající záznamu vknihovním katalogu), jednotlivých stran imezilehlých úrovní (ročník nebo číslo periodika apod.). Ke stranám jsou umonografií aperiodik kdispozici itextové přepisy, svýjimkou starých tisků, kde nástroje pro rozpoznání textu neposkytovaly kvalitní výsledky, ato zejména učeských tisků (pro latinu aněmčinu přepisy často existují). Uněkterých dokumentů jsou dostupná imetadata popisující logické části dokumentů, jako jsou kapitoly nebo články. Zhlediska objemu dat ajejich struktury (vyváženosti) mají digitální knihovny blízko kwebovým korpusům. Na rozdíl od webových stránek obsahují díla starší (de facto od počátků knihtisku) aautorsky chráněná, na druhou stranu vnich najdeme málo obsahu vytvářeného tak širokým spektrem tvůrců jako na internetu. Všechny základní knihovní jednotky (monografie, periodika ap.) ajejich strany jsou vsystému Kramerius identifikovány pomocí jedinečného perzistentního identi55 Pro tyto účely vznikne nejspíš specializovaný seznam děl, podobně jako vpřípadě děl nedostupných na trhu, viz <https://sdnnt.nkp.cz/sdnnt/home>. 56 Viz např.záznam přednášky Výjimky pro instituce kulturního dědictví dle směrnice oautorském právu na jednotném digitálním trhu, která se uskutečnila krátce po schválení evropské směrnice; dostupné z<https://invenio.nusl.cz/record/407829?ln=cs>. 57 Zdrojové kódy: <https://github.com/ceskaexpedice/kramerius/>. 58 Jedná se opublikace, které vznikly velektronické podobě ajejich tištěnou („papírovou“) verzi lze považovat za sekundární.
BORIS LEHEČKA 289 API. Specifikace je dostupná na stránkách DL4DH Feederu,85 vybrané příklady jsou kdispozici vrepozitáři zdrojového kódu na GitHubu86 aukázka je dostupná také ve veřejném pracovním prostoru aplikace Postman.87 6.3.1 OMEZENÍ APROBLéMY Jako většina aplikací, které pracují shistorickými daty (vpřípadě digitálních knihoven spublikacemi, které vznikaly vprůběhu několika staletí, azároveň sdaty, tj.skeny arozpoznáním, které vznikaly od roku 1992), je potřeba se ivpřípadě nástrojů DL4DH vypořádat stouto proměnlivostí. Vprvé řadě je to nízká kvalita vstupních dat, tj.digitálních obrazů publikací, případně různá kvalita automatického rozpoznání textu.88 To může být příčinou chyb při následných analýzách lingvistickými nástroji. Pokud unaskenovaného dokumentu není kdispozici rozpoznaný text ve formátu ALTO, nebude fungovat obohacení textu pomocí lingvistických nástrojů, které na tento typ vstupních dat spoléhají. Vtakovém případě je nutno kontaktovat kurátora sbírky adomluvit se na jejich rozpoznání pomocí aplikace pro OCR. Na práci lingvistických nástrojů má dále vliv kombinace několika jazyků vtextu. Ikdyž používané nástroje pro morfologickou analýzu (UDPipe 2), resp.pro rozpoznání pojmenovaných entit (NameTag 2), umějí analyzovat několik jazyků, správná aplikace vyžaduje nejprve identifikaci pasáží sodlišnými jazyky ajejich samostatné zpracování sodpovídajícím nastavením parametrů jednotlivých programů. Uložené dotazy, popř. data, jež těmto dotazům odpovídají, nelze považovat za stoprocentně replikovatelná, neboť může dojít kaktualizaci bibliografických metadat, knovému rozpoznání pomocí OCR, případně kanalýze textu novějšími verzemi lingvistických nástrojů, přičemž ani vjednom zuvedených případů se předchozí verze dat neuchovávají. 6.3.2 VÝHLEDY DO BUDOUCNA Ostrá verze nástrojů DL4DH byla spuštěna teprve počátkem roku 2023, proto lze stejně jako ujiných projektů očekávat, že projde zatěžkávací zkouškou vpodobě požadavků na přístup kvelkým datům ze strany badatelů voblasti humanitních asociálních věd. Nahrávají tomu také změny voblasti autorského práva, které umožňují využívat digitální kopie autorských děl pro automatizované analýzy, prováděné za účelem získání informací, zahrnujících mimo jiné vzory, tendence asouvztažnosti ivpřípadech, že jsou díla autorsky chráněna (za splnění určitých podmínek). Očekáváme jednak vylepšení funkcí zejména na straně uživatelského rozhraní, tj.DL4DH Feederu, jednak ve fázi přípravy dat ke zveřejnění. Může se na85 Viz <https://feeder.nkp.cz/swagger-ui/index.html>. 86 Viz <https://github.com/LIBCAS/DL4DH-Feeder>. 87 Viz <https://www.postman.com/winter-comet-20618/workspace/dl4dh-feeder>. 88 Na kvalitu OCR může mít vliv např.software, který nedokáže zpracovat text obrácený o90 stupňů, nebo volba nesprávného modelu (typu písma či jazyka) pro rozpoznávání.
290 ČASOPIS PRO MODERNÍ FILOLOGII 105, 2023, Č.2 příklad jednat ozapojení aplikací pro OCR (např.PERO OCR (bez data)) pro rozpoznání textu vpřípadě, že není kdispozici formát ALTO. Nebo využití novějších verzí nástrojů NameTag aUDPipe, jejichž aktualizace se vrámci infrastruktury LINDAT/CLARIAH-CZ připravuje. 7. ZÁVĚR Voblasti humanitních asociálních věd představuje významnou součást badatelské práce analýza primární asekundární literatury. Vedle jazykových korpusů lze vposledních letech za vhodné zdroje písemných pramenů považovat digitální knihovny, které včeských zemích vletech 1992–2022 digitalizovaly přibližně 98,7 mil. stránek. Zpracování tak velkého objemu dat ze strany badatelů se stává možné díky rozvoji počítačových technologií, novým přístupům kdatům inovým výpočetním metodám. Článek přibližuje dílčí zkušenosti ze zahraničí apřináší stručný přehled ozdrojích dat včeském prostředí. Zaměřuje se na nedávno dokončený projekt DL4DH, jehož cílem je nabídnout badatelům přístup kvelkým objemům dat zdigitálních knihoven Kramerius ve standardizovaných formátech (prostý text, ALTO, CSV/TSV, TEI, JSON) nejen prostřednictvím nové webové aplikace, ale ipomocí programového rozhraní REST API. Aby byla následná analýza publikací co nejsnazší, mohou být součástí stažených dat obohacující údaje znástrojů UDPipe aNameTag, které vyvíjí aprovozuje výzkumná infrastruktura LINDAT/CLARIAH-CZ. LITERATURA Lehečka, B.— Novák, D.— Kersch, F. et al. (2022): Metodika přípravy dat zdigitálních knihoven pro využití vdigitálních humanitních vědách. Knihovna AV ČR. Dostupné také z: http://invenio.nusl.cz/record/511549/files/ Metodika_DL4DH.pdf Richter, V. (2020): Zpřístupnění plných textů digitalizovaných knih aperiodik prostřednictvím Národní digitální knihovny. Informace— zpravodaj Knihovny AV ČR [online]. (2) [cit.2022-04-28]. Dostupné z: https://www.lib.cas.cz/casopis_informace/ zpistupneni-digi-ndk/ Standardy digitalizace (2018). In: Národní digitální knihovna [online]. Praha: Národní knihovna ČR [cit.2022-06-25]. Dostupné z: https://standardy.ndk.cz/ndk/standardydigitalizace/ Wilkens, M.— Ruan, G. (2020): Geographic Locations in English-Language Literature, 1701–2011 (1.0). [Dataset] [online]. 2020. HathiTrust Research Center [cit.2023-01-19]. Dostupné z: https://doi. org/10.13012/2K5C-RF13 ELEKTRONICKÉ ZDROJE Benko, V. (2014): Aranea: Yet Another Family of (Comparable) Web Corpora. In: P.Sojka— A.Horák— I.Kopeček— K.Pala (eds.), Text, Speech and Dialogue [online]. Cham: Springer International Publishing, Lecture Notes in Computer Science, s.247–256 [cit.2023-04-24]. Dostupné z: https://doi.org/ 10.1007/978-3-319-10816-2_31.
BORIS LEHEČKA 291 Benko, V. (2015): Araneum Bohemicum Maximum: verze 15.04 [online]. Praha: Ústav Českého národního korpusu FF UK [cit.2023-04-24]. Dostupné z: http://www.korpus.cz Benko, V. (2020): Araneum Bohemicum Maximum: verze 20.03 [online]. Bratislava: UNESCO Chair in Plurilingual and Multicultural Communication, Comenius University in Bratislava a[cit.2023-04-24]. Dostupné z: http://unesco.uniba.sk Bibliografie dějin Českých zemí [online] (2013). Praha: Historický ústav AV ČR [cit.2023-04-24]. Dostupné z: https://biblio.hiu.cas.cz Czech medieval sources FONTES [online] (2023). Praha [cit.2023-04-24]. Dostupné z: https:// sources.cms.flu.cas.cz Česká digitální knihovna: Národní agregátor digitálních knihoven [online] (2022). Praha: Knihovna AV ČR [cit.2022-06-25]. Dostupné z: https://www.czechdigitallibrary.cz DALL·E2 [online] (2022). San Francisco: OpenAI [cit.2023-04-24]. Dostupné z: https://labs. openai.com Digitální knihovna [online], bez data. Brno: Moravská zemská knihovna vBrně [cit.2023-04-24]. Dostupné z: https://www. digitalniknihovna.cz Europeana [online], bez data. [cit.2023-04-24]. Dostupné z: https://www.europeana.eu/cs HathiTrust: Digital Library [online] (2008–2023). [cit.2023-04-24]. Dostupné z: https://www. hathitrust.org HyperFontes: Metadatový modul databáze Czech Medieval Sources online [online] (2023). Praha: Centrum medievistických studií [cit.2023-04-24]. Dostupné z: https:// hyperfontes.cms.flu.cas.cz Charles Translator for Ukraine [online] (2022). Praha [cit.2023-04-24]. Dostupné z: https:// lindat.cz/translation ChatGPT [online] (2022). San Francisco: OpenAI [cit.2023-04-24]. Dostupné z: https://chat. openai.com Korpus českého verše [online] (2021). Praha: Ústav pro českou literaturu AV ČR, v. v. i. [cit.2023-04-24]. Dostupné z: https:// versologie.cz/v2/web_content/corpus.php LINDAT/CLARIAH-CZ: Digitální výzkumná infrastruktura pro jazykové technologie, umění ahumanitní vědy [online] (2023). Praha [cit.2023-04-24]. Dostupné z: https://lindat. cz/cs Manuscriptorium: Digital Library of Written Cultural Heritage [online] (2023). [cit.2023-04-24]. Dostupné z: https:// www.manuscriptorium.com/cs Monasterium [online] (2023). ICARUS [cit.2023-04-24]. Dostupné z: https://www. monasterium.net/mom/home PERO OCR: demonstration application [online], bez data. Brno: Vysoké učení technické vBrně [cit.2023-04-24]. Dostupné z: https://pero-ocr.fit.vutbr.cz Registr digitalizace: Evidence dokumentů digitalizovaných vČR [online] (2017). Praha: Národní knihovna ČR— Knihovna Akademie věd ČR— INCAD [cit.2023-04-24]. Dostupné z: https://www.registrdigitalizace.cz Registr Krameriů [online], bez data. Brno: Moravská zemská knihovna vBrně [cit.2023-04-24]. Dostupné z: https://registr. digitalniknihovna.cz Spoustová, J.— Spousta, M. (2012): CWC2011. Dostupné také z: http://hdl.handle.net/11858/ 00-097C-0000-0006-B847-6 Staročeská textová banka [online], bez data. Praha: Ústav pro jazyk český AV ČR, v. v. i., oddělení vývoje jazyka, verze dat 1.1.22 [cit.2023-04-24]. Dostupné z: https://korpus.vokabular.ujc.cas.cz/first_ form?corpname=STB-1.1.22.1 Straka M.— Straková, J. (2014): NameTag [online]. Praha: LINDAT/CLARIAH-CZ, digitální knihovna při Ústavu formální aaplikované lingvistiky, Matematicko- -fyzikální fakulta Univerzity Karlovy [cit.2023-04-24]. Dostupné z: http://hdl.handle.net/11858/ 00-097C-0000-0023-43CE-E Straka M.— Straková, J. (2016): UDPipe [online]. Praha: LINDAT/CLARIAH-CZ, digitální knihovna při Ústavu formální aaplikované lingvistiky, Matematicko- -fyzikální fakulta Univerzity Karlovy