O příbuznosti lingvistiky a biologie
Abstract
79
Full text
Opříbuznosti lingvistiky abiologie Hana Owsianková — Ondřej Kučera — Dan Faltýnek1 ABSTRACT: In this paper, we discuss the history and current state of research where linguistics and biology meet on the base of interdisciplinary approach. We would like to introduce the use of quantitative text features (entropy, vocabulary richness, etc.) and quantitative text laws (Zipf’s law, MenzerathAltman’s law) in the analysis of genetic text. We point out research in which similar text features of natural languages are observed on the genetic text. In particular, we focus on the field of molecular phylogenetics, the subject of which is to investigate the relationship of species and the reconstruction of the evolutionary tree of organisms. In the conclusion, we present step-by-step genetic analysis of interspecific relationships of selected crops of the Brassicaceae family using the Bag-ofwords model. Our aim is to stress that linguistic methods can be agood tool for gaining new knowledge about genetic texts, and we want to introduce amethod for mapping evolutional relationships. KEYWORDS: Bag-of-words, biology, genetics, linguistics, molecular phylogenetics ABSTRAKT: Vtomto článku se zabýváme historií asoučasným stavem výzkumu, vněmž se potkávají biologie aling vistika. Poukazujeme na výzkumy, při nichž jsou na genetickém textu pozorovány podobné vlastnosti jako na textech přirozených jazyků. Konkrétně se zaměřujeme na oblast molekulární fylogenetiky, jejímž předmětem zkoumání je rekonstrukce stromu příbuznosti organismů. Vzávěru vjednotlivých krocích prezentujeme genetickou analýzu mezidruhových vztahů vybraných kulturních plodin čeledi Brassicaceae (brukvovité) pomocí metody Bag-of-words. Našim cílem je ukázat, že lingvistické metody mohou být vhodným nástrojem kzískání nových poznatků také ogenetických textech, nově pak chceme představit metodu Bag-of-words využitelnou kmapování příbuzenských vztahů. KLÍČOVÁ SLOVA: Bag-of-words, biologie, genetika, lingvistika, molekulární fylogenetika ÚVOD Od přelomu osmnáctého adevatenáctého století, kdy byla vymezena jako vědní disciplína, se lingvistika ocitla hned několikrát vtěsném vztahu kbiologii, ato vsouvislosti sanalogizováním jazyka aživého ataké zdůvodu podobnosti metodologie obou disciplín, např.při popisu původu jazyků adruhů. Vzájemná inspirace obou disciplín byla vprůběhu času obousměrná, historickosrovnávací lingvistika se např.inspirovala teoretickým rámcem evoluční teorie, genetika využila analogie stextem při popisu DNA. Vtomto článku chceme shrnout vývoj kontaktu obou disciplín aupozornit na výhledy jejich dalšího setkávání. 1 Článek vznikl v rámci projektu Sinophone Borderlands Reg. no. CZ.02.1.01/0.0/0.0/16_0 19/0000791, Excellent research. OPEN ACCESS
80 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2020 Na vztah biologie alingvistiky bylo vlingvistice mnohokrát poukázáno. Na začátku připomeňme práci Augusta Schleichera (1869), který ovlivněn darwinismem považoval jazyk za vyvíjející se živý organismus. Schleicher ukázal, že darwinistický výklad evoluce založený na náhodné mutaci apřirozeném výběru se vztahuje nejen na organismy, ale také na jazyky. Tímto způsobem postavil na roveň přístup evoluční biologie ahistorickosrovnávací lingvistiky. Ovlivu darwinismu na lingvistiku, přijetí prací Schleichera dobovými biology ataké o„ztotožňování řeči spřírodninou“ později referuje Emanuel Rádl (2006, s.170–172; německý originál 1909). Rádl vztahy lingvistiky abiologie ovšem reflektuje zpozice dobové kritiky darwinismu aanalogie předmětu studia biologie ajazykovědy pojímá vkontextu vitalistické teorie, která je vzhledem kdnešnímu všeobecnému akceptování Darwinovy teorie neakceptovatelná (vyjmeme-li zdiskuse kreacionismus adnes známou paletu evolučních mechanismů doplňující koncept přirozeného výběru). Ovlivu darwinismu na českou lingvistiku píše Jan Petr (1982, 1988), všímá si především Jana Gebauera, který se sdarwinismem setkal prostřednictvím svého učitele Martina Hattaly— stejně jako on pojetí jazyka jako organismu odmítá, anaopak považuje jazyk za historický společenský jev, unějž je třeba zkoumat především jeho vnitřní psychickou stránku (ktomu viz Syllaba, 1983, s.25–27). Další výraznou inspiraci biologií můžeme nalézt uPražského lingvistického kroužku (PLK). Vjeho Tezích (Vachek, 1972, s.37) nacházíme vliv nomogenetického pojetí vývoje jazyka. Kroužek se vtomto směru nechává inspirovat antidarwinistickou koncepcí zákonem řízené evoluce ruského teoretického biologa aichtyologa L.S.Berga (1926)— teleologické pojetí jazyka se výrazně promítá do profilu pražského strukturalismu, který usiluje ostrukturní (tzn.systémový) popis nejen synchronních, ale také diachronních jevů, čímž se odlišuje od ostatních strukturalismů, především ženevského (viz Kořenský, 2008; Leška, 1986; Němec, 1989; Savický, 1991; Šoltys, 1991; Vachek, 1968). Teleologický výklad se týká především vysvětlení hláskových změn (Vachek, 1968; pro ilustraci viz vysvětlení vzniku hlásek ť aď vlivem fonologické pozice hlásky ň vHistorické mluvnici češtiny, Lamprecht— Šlosar— Bauer, 1986, s.88). Jedna znejvýraznějších osobností PLK, Roman Jakobson, znovu promlouvá ovztahu obou věd později, když analogizuje strukturu přirozeného jazyka astrukturu DNA (1971; ktomu viz Katz, 2008). Jakobson upozorňuje např.na dvojí artikulaci obou kódů— stejně jako jsou vpřirozeném jazyce věty členěny do slov, aty dále do morfémů/fonémů, které jakožto jednotky druhé artikulace nenesou význam, ale rozlišují jej, tak lze sekvence DNA členit na triplety aty pak na jednotlivé nukleotidy, přičemž tripletům je přisouzen význam vpodobě aminokyseliny anukleotidy význam nemají, jejich funkcí je rozlišovat triplety. Jakobson dále připodobňuje řetězce DNA ktextu zhlediska jejich linearity/sekvencionality. Svou teorii binárních opozic, aplikovanou např.na morfologický systém ruštiny (viz Jakobson, 1932), převedl na vztah protilehlých bází vDNA: cytosin— guanin, adenin— thymin (Jakobson, 1971, s.678–681). Dokonce mluví opružné stabilitě jazyka DNA (ibid., s.681). Analogii DNA ve vztahu kjazyku ajeho projevech vtextu dále rozvíjí např.Searles (2002) nebo Raible (2001). Soustavně se historickým souvislostem vztahů biologie alingvistiky věnoval Simeon Romportl (1989, 1994)— jazyk agenetický kód srovnává zhlediska komplexOPEN ACCESS
HANA OWSIANKOVá — ONDŘEJ KUČErA — DAN FALTÝNEK 81 nosti jejich struktury, upozorňuje na jejich hierarchičnost (jazykové plány, struktura genetického kódu) adiskrétnost veličin reprezentovaných vtextu (ve smyslu jazykových jednotek ade Saussurovy diskrétnosti jakožto vlastnosti jazykového znaku) (1989, s.261). Romportl ukazuje na podobnosti aodlišnosti vevoluci jazyka aživého— podobnosti např.zhlediska mutace jakožto prostředku vývoje nových forem (Romportl mluví otransformacích jazykových agenetických prvků), odlišností např.zhlediska niterného charakteru genetického textu oproti komunikační funkci jazyka. Vsouvislosti staxonomizací jazyků adruhů informuje okladistice (viz níže) aukazuje způsoby rekonstrukce genealogického stromu (1997, 1999). Na druhou stranu čeští biologové vyhledávají kontakt slingvistikou, např.voblasti sémiotického popisu procesů vživých organismech kolem sebe ustavil celou školu Anton Markoš (2003; Markoš & Švorcová, 2009). Podle Markoše je textům přirozených jazyků agenetickým textům společné to, že se jedná olineární záznam znaků (prvků) nesoucích informaci. Nezdůrazňuje ovšem samotnou povahu informace, ale především způsob, jakým je přečtena— hovoří oprocesech interpretace vbuňce, které formují výsledný fenotyp. Voblasti zoosémiotiky, při popisu systémů zvířecí komunikace, kriticky navazuje na Hockettův výčet charakteristických vlastností jazyka (1982, „language design features“) Lucie Čadková (2015)— na základě moderních poznatků okomunikaci zvířat upozorňuje především na to, že fyziologické vlastnosti organismu nelze pokládat za konstitutivní rysy jazyka aže kuniverzáliím lidského jazyka nemůžeme přistupovat jako kuniverzáliím jazyka obecně. Signalizační systémy mnohobuněčných bakteriálních konsorcií sloužící kvýstavbě kolonií popisují Jaroslav Čepl et al. (2010). Genetické predispozice jazyka (např.tzv.„jazykový gen“ FOXP2), jeho vznik aevoluci zkoumá biolingvistika, která má sčeským prostředím také kontakt (Augustyn, 2013; Berwick & Chomsky, 2011; Kosta & Krivochen, 2012). Programem biolingvistiky je především nalezení genetických dispozic člověka, vysvětlení jejich vztahu ke kognitivnímu zpracování řeči, rekonstrukce vývoje schopnosti řeči učlověka apopis odlišnosti zvířecí komunikace oproti lidské (Berwick & Chomsky 2016). TAXONOMIE Zhlediska dnešních vztahů biologie alingvistiky se nejdříve zastavíme umetod rekonstrukce vývoje organismů. Zkoumání příbuzenských vztahů je vsoučasné biologii úkolem nejen morfologie, ale také molekulární fylogenetiky, která rekonstruuje genetický strom na základě analýzy dlouhých řetězců genetického zápisu organismů. Původní taxonomizace (Linnæi, 1758) je založena na srovnávání morfologických znaků, tzn.celkové vnější stavby organismu— urostlin se jedná např.otvar, velikost abarvu plodu, květu nebo listu, velikost atvar semen, trichomů („chloupků“, výčnělků na pokožce rostlin) apod. Ktaxonomizaci jsou využívány také anatomické znaky, jako je stavba pletiv, např.typ cévních svazků, jejich počet apod. Zvažovány jsou také znaky chemické— obsah určité sloučeniny vorganismu. Proti taxonomizaci organismů na základě podobnosti výše zmíněných znaků (dále tělních ve smyslu fenotypických) se od padesátých let 20.stol. staví kladistika, která taxonomizaci OPEN ACCESS
82 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2020 provádí prostřednictvím rekonstrukce evolučních linií podobnosti (příbuznosti) znaků, na základě takového srovnání se pak evoluční biologové pokouší rekonstruovat průběh evoluce. To znamená, že kladistika rekonstruuje příbuznost linií na základě přítomnosti určitých znaků, které vyznačují evoluční oddělování skupin organismů (ktomu viz Hennig, 1966, 1975; Dupuis, 1984; Brinkman, 2001; ke kritice fylogenetické taxonomie viz Mayr, 1974; Wheeler, 2004). Taxonomizace fenotypická je postupně doplňována imetodami molekulární fylogenetiky (mezi něž patří ikladistika), která příbuznost druhů ajejich taxonomické zařazení zkoumá pomocí molekulárních znaků, tj.úseků DNA, RNA aproteinů. Určování příbuznosti druhů na základě molekulárních znaků— podobnosti řetězců DNA, RNA aproteinů— přináší oproti určování příbuznosti na základě morfologických adalších tělních znaků určité výhody. Tělní znaky se totiž vzájemně podmiňují (např.tvar semene, jeho chemické složení atvar kořene (např.Stace, 1989)). Tělních znaků je oproti tomu, co lze získat zlineární posloupnosti genetických textů, omezené množství. Oproti morfologickým znakům zde mluvíme otzv.genetických markerech— ty lze vymezit jako oblast genetické informace, kterou srovnávané organismy sdílí, ato isdiferencemi získanými vevoluci. Markery jsou oproti fenotypickým znakům proměnlivé spíše zhlediska toho, zda jsou brány zoblastí kódujících částí DNA, kde je jejich variabilita vázána na funkci řetězce, nebo zčástí nekódujících— ivtomto případě je ale míra jejich proměnlivosti různá, vzhledem ktomu, že inekódující části DNA mohou mít určitou funkci, např.vpodobě regulace genové exprese. Molekulární fylogenetika (nikoliv pouze kladistika) umožňuje porovnávat evolučně velmi vzdálené organismy, jejichž tělní znaky nevykazují dostatečnou podobnost kvzájemnému srovnávání sostatními, ale struktura jejich molekulárních znaků ano, nebo takové organismy, které mají velmi rozdílnou morfologii, ale jsou příbuzensky blízké (Flegr, 2005, s.439–442; podrobněji Page & Holmes, 1998). LINGVISTICKÉ METODY VANALÝZE GENETICKÉHO TEXTU Analýzou posloupnosti bází DNA či aminokyselin vproteinech neboli „genetických textů“ se zabývá bioinformatika, jejíž metody srozumitelně ipro laického čtenáře přibližuje F.Cvrčková (2006). Vzhledem ktomu, že centrální úlohu vanalýze genetických markerů hrají textualizované, tzn.jako texty zapsané, řetězce biopolymerů (proteinů, nukleových kyselin), se zároveň stává molekulární fylogenetika zájmem lingvistiky, která má sanalýzou textu zkušenosti. Výzkumné metody biologie alingvistiky jsou vzájemně přejímány. Např.kladistika jako molekulárně fylogenetická metoda je včetně dílčích postupů (např.Maximum parsimony, Maximum likelihood) postupně aplikována na analýzy slovesné kultury (Ross et al., 2013) ajazyka (Gray &Atkinson, 2003; Rexová et al., 2003, 2006; Forster & Renfrew, 2006; Grollemund &Hombert, 2012; Fangerau et al., 2013; Rabinovich et al., 2017). Naopak metody využívané současnou bioinformatikou často pocházejí zlingvistiky, jedná se např.oDamerau-Levenshteinovu vzdálenost (Damerau, 1964; Levenshtein, 1966). Obecně je Damerau-Levenshteinova vzdálenost definována jako minimální počet transformací jednoho řetězce (textu) na druhý. Transformací se rozumí vložení, OPEN ACCESS
HANA OWSIANKOVá — ONDŘEJ KUČErA — DAN FALTÝNEK 83 odstranění anahrazení části textu nebo změna její pozice vtextu. Čím méně je třeba transformací od výchozího textu ksrovnávanému, tím jsou si texty podobnější (Damerau, 1964; Levenshtein, 1966). Tato metoda byla navržena jako editační vzdálenost mezi texty— vyjadřovala množství ortografických změn, jimiž se dva texty odlišují. Použita byla také voblasti lexikostatistiky (glottochronologie) vsouvislosti srekonstrukcí genetického stromu jazyků na základě analýzy výpůjček, kčemuž je využíván tzv.Swadeshův seznam (Swadesh, 1952, 1955; Embleton, 2000)— obsahuje slova, která jsou odolná vůči jazykovým výpůjčkám: osobní zájmena, části těla, zvířata, slovesa základních činností, barvy, číslovky „jedna“ a„dvě“, nebeská tělesa atd. Množství rozdílů mezi slovy určuje vzdálenost mezi jazyky ve stromu (metodu představuje např.Skalička, 1967; Králík, 1976; Serva & Petroni, 2007). Voblasti biologie jsou tímto způsobem srovnávány konkrétní sekvence DNA ana základě jejich míry shody je vyjadřována příbuznost jednotlivých druhů ajimi zastupovaných skupin organismů. Částmi řetězce jsou vpřípadě analýzy genetických textů nukleové báze DNA nebo aminokyseliny proteinového řetězce. Dodejme, že kromě lingvistiky abiologie byla Damerau-Levenshteinova vzdálenost využita např.vmedicíně pro výzkum evoluční trajektorie chronické lymfocytární leukémie (Sutton et al., 2014). Další metodou, která je využívána pro analýzu podobnosti textů, je tzv.Bag-of- -words model. Tato metoda je využívána voblasti zpracování přirozeného jazyka (natural language processing), vyhledávání informací (information retrieval), počítačovém vidění (computer vision) aklasifikaci dokumentů (Toldo et al., 2009; Zhang et al., 2010). Pro analýzu genetických textů je převzata nověji (Bolshoy et al., 2010; Lovato, 2015). Metoda Bag-of-words spočívá vreprezentaci textu jeho slovy, bez ohledu na jejich pořadí vtextu, ale se zohledněním jejich frekvence. Umožňuje vyhodnocovat podobnost lexika textů azní vyvozovat podobnost tematickou, obsahovou, stylovou či autorskou. Vpřípadě našeho zájmu se jedná opodobnost textů genetických, znichž můžeme usuzovat na blízkost fylogenetickou (vývojovou, příbuzenskou). Vpřípadě textů genetických však nemáme přirozeně dány hranice slov, proto je kreprezentaci slova vgenetickém textu vhodné využít n-gramovou analýzu. Při ní jsou genetické texty segmentovány na stejně dlouhé části (substringy): dvoj-kombinace bází nebo aminokyselin (2-gram), troj-kombinace bází nebo aminokyselin (3-gram) atd. Tento nepřirozený zásah do struktury genetického textu můžeme podpořit zkušeností stím, že n-gramová analýza je citlivá na přirozené hranice jednotek (např.slov) apři vhodném užití velikosti n-gramu kopíruje výsledky analýzy přirozeně segmentovaného textu— dokládá to např.využití n-gramové analýzy při určování autorství, kdy tato technika dosahuje podobných výsledků jako určování autorství založené na přirozeně segmentovaném textu (Peng akol., 2003; viz také Faltýnek, 2017, s.72, kde jsou ukázány výsledky n-gramové analýzy textů srovnatelné svýsledky analýzy využívající dělení na slova). Každý organismus je vanalýze reprezentován řadou hodnot vyjadřujících přítomnost či nepřítomnost určitého slova (substringu) vjeho genetické sekvenci, nebo rozdílem ve frekvenci daného slova oproti dalším sekvencím. Takto reprezentované sekvence DNA jsou následně použity ve shlukové analýze, která podobnosti textů zobrazuje vgrafu hierarchického shlukování (dendrogramu). Vnávaznosti na Damerau-Levenshteinovu vzdálenost dodejme, že Bag-of-words model byl využit ke klasifikaci dat biomedicínského inženýrství, jako jsou výsledky OPEN ACCESS
84 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2020 vyšetření EEG nebo EKG (Wang et al., 2013). Jeho další aplikace slouží kdetekci infekce vorganismu na základě zastoupení různých tříd molekul T-receptorů (Lovato, 2015). VYUŽITÍ KVANTITATIVNÍCH VLASTNOSTÍ TEXTU VPOPISU GENETICKÉHO TEXTU Lingvistické metody jsou vanalýze genetických textů využívány vsouvislosti sřadou dalších výzkumů, nejen pro účely taxonomické. Dlouhou tradici mají např.výzkumy Zipfova zákona (Zipf, 1949), který formuluje vztah mezi počtem výskytů slova ajeho distribucí vtextu (obecněji vjazyce). Příkladem je jeho využití pro predikci funkce nekódující DNA (Niyogi & Berwick, 1995; Tsonis et al., 1997; Havlin et al., 1995; Mantegna et al., 1995) nebo kpopisu hierarchie genetického kódu (ve smyslu skladby rovin jako je fonetická, lexikální avětná, viz Matlach & Faltýnek, 2016, Faltýnek et al., 2019). Oprojevech tohoto zákona vtextu se dlouhodobě vedou diskuse, protože každý text, který je produktem libovolného systematického procesu, zákon projevuje: může se jednat ošifru, tzv.monkey typing— text vzniklý náhodnými úhozy do klávesnice, zápis činnosti nějakého technického zařízení (ktomu viz např.otázku projevů zákona vnáhodném textu Ferrer-i-Cancho & Elvevåg, 2010; shrnutí současného stavu výzkumu Zipfova zákona ajeho výhledy předkládá Piantadosi, 2014). Novější lingvistickou paralelu vsouvislosti sDNA představuje analýza projevů Menzerath-Altmannova zákona vgenetickém textu (Altmann, 1980). Verbální formulace zákona zní takto: čím větší je jazykový konstrukt, tím větší jsou jeho konstituenty ve své průměrné délce; jedná se např.ovelikost věty ve vztahu ke slovům, slova ke slabikám apod. To ukazují např.Ferrer-i-Cancho et al. (2013); Hřebíček (2002, 2007) ukazuje, že Zipfův zákon je variantou Menzerath-Altmannova zákona. Studie se zaměřují především na vztah velikosti apočtu chromozomů vgenomu (Baixeries et al., 2013; Hernández-Fernández et al., 2011), velikosti exonů ajejich počtu vgenu (Li, 2012; Nikolaou, 2014), další výzkumy studují vztah velikosti proteinových domén avelikosti proteinu (Shahzad et al., 2015). Vliv segmentace textu na výsledky analýzy projevů Menzerath-Altmannova zákona ukazují Benešová, Faltýnek aZámečník (2015) aBenešová (2014), voblasti výzkumu genetického textu stímto souvisí výběr srovnávaných jednotek (exon—intron, sekundární struktury apod.) avelikost n-gramů vstupujících do analýzy. Projevy těchto zákonů jsou většinou vykládány jako ekonomizační ve smyslu zákona nejmenšího úsilí (způsoby vysvětlení viz Piantadosi, 2014). Jako příklad lingvistické analýzy DNA slouží další výzkumy: komplexitu genetického textu (pravděpodobnost výskytu za sebou jdoucích částí řetězce) zkoumá Popovová, Segal aTrifonov (1996). Trifonov také upozorňuje na možnosti zkoumání raných stádií vzniku genetického kódu (Trifonov et al. 2001), za pozornost stojí též jeho práce sBerezovským zaměřená na popis struktury proteinů analogicky ke struktuře jazykové (Trifonov & Berezovski, 2002). Zemková zkoumá využití lingvistických metod vgenomice vširokém rozsahu např.na genetických textech parazitů (Zemková, 2016; Zemková et al., 2014). Ukazuje, že tyto texty mají vyšší míru opakuOPEN ACCESS
HANA OWSIANKOVá — ONDŘEJ KUČErA — DAN FALTÝNEK 85 jících se struktur. Systematický přehled použití lingvistických metod vmolekulární biologii předkládá Bolshoy (2003, 2010). Kvalitativní strukturou genomů aproteomů, např.přítomností textových motivů vrozsáhlých vzorcích proteinů, se zabýval Ohno (1992). Analogii mezi přirozenými jazyky agenetickým kódem, nikoliv ale na základě analýzy textu, popisuje také Ji (1997, 1999), Pattee aKull (2009), Barbieri (2006, 2008, 2015), Favareau (2009) aSharov (2010). Vsouvislosti sčeskou lingvistikou stojí za zmínku, že analogii přirozeného jazyka agenetického kódu představil Jakobson (1971), oněmž píšeme výše. Hovoří obázích DNA jako ofonémech, otripletech jako slovech agenech jako větách, mluví ale také osynonymii tripletů, fonologických opozicích bází, pružné stabilitě genetického kódu atd., což působilo vdiskusi sbiology určité rozpaky (Jacob et al., 1968). Na problémy spojené sanalogizováním jazyka agenetického kódu upozorňuje Markoš aFaltýnek (2011)— viz tradiční pojetí bází jako písmen, genů jako vět. Na základě experimentu založeném na mapování Zipfova zákona na mRNA diskutuje Matlach aFaltýnek (2016), základní předpoklady znakových vlastností genetického kódu ukazují Lacková, Faltýnek aMatlach (2017). MODELOVÁ ANALÝZA PŘÍBUZNOSTI DRUHŮ RODU BRASSICA ZA VYUŽITÍ METODY BAG-OF-WORDS Vzávěrečné části textu chceme představit modelovou analýzu fylogenetických vztahů pomocí lingvistické metody Bag-of-words popsané výše. Naším předpokladem je, že podobnost (atedy blízkost) mezi texty přirozeného jazyka nebo mezi texty DNA (sekvencemi) lze srovnávat na podobném principu, tj.na základě složek (slov, bází) obsažených vjednotce (věta/text, sekvence). Věnovat se budeme taxonomizaci čeledi Brassicaceae (brukvovité). Současná taxonomie zahrnuje 3700 rostlin, dále hovoří o338 rodech a25 tribech (tribus je novodobý taxon zařazený mezi čeleď arod) této čeledi (Al-Shehbaz et al., 2006; Bailey et al., 2006). Čeleď Brassicaceae, jmenovitě rostliny rodu Brassica, zahrnují řadu kulturně využívaných plodin, které jsou také vsouvislosti sjejich dlouhodobým šlechtěním morfologicky velmi odlišné. Jsou pěstovány pro list (B. oleracea), otevřený atvořící hlávky, kořen (B. rapa), isemena (B. napus). Vsouvislosti sodlišnými způsoby taxonomizace (morfologický/fenotypický × molekulární; viz výše) se tak čeleď Brassicaceae jeví být jako vhodný reprezentativní materiál kdemonstrování metod molekulární fylogenetiky, tzn.metod zohledňujících podobnost genetických markerů, anikoliv morfologických znaků. Pro analýzu jsme vybrali významné kulturní plodiny rodu Brassica— B. oleracea (brukev zelná), B. oleracea var. capitata (hlávkové zelí), B. oleracea var. alboglabra (čínská brokolice), B. oleracea var. botrytis (květák), B. rapa (brukev řepák vodnice), B. rapa var. chinensis (čínské zelí), B. rapa var. pekinensis (pekingské zelí), B. rapa var. oleifera (brukev řepák olejný), B. juncea (brukev sítinovitá), B. nigra (brukev černá), B. carinata (hořčice habešská), B. napus (brukev řepka). Pro vybrané druhy avariety jsme našli vzorky (viz Tabulku 1) vgenetické bance NCBI (National Center for Biotechnology Information)— jednalo se oITS marker (konkrétně nekódující úsek OPEN ACCESS
86 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2020 ribozomální RNA ITS1 5.8S ITS2), který je pro fylogenetické studie využíván pro svou variabilitu imezi blízce příbuznými druhy. Brukve patří mezi tzv.allopolyloidní rostliny (dochází unich ke znásobení chromozomových sad, které pochází od více druhů), proto je každý vybraný zástupce reprezentován několika vzorky. Druh/Vzorek 1 2 3 4 5 Brassica carinata DQ003688.1 DQ003689.1 DQ003690.1 DQ003691.1 DQ003692.1 Brassica juncea MG923961.1 MG923962.1 MG923963.1 MG923964.1 MG923965.1 Brassica napus DQ003657.1 DQ003658.1 DQ003659.1 DQ003660.1 DQ003661.1 Brassica nigra DQ003644.1 DQ003645.1 DQ003646.1 DQ003647.1 DQ003648.1 Brassica ol. alboglabra GQ891870.1 GQ891871.1 Brassica ol. botrytis AF128099.1 GQ891875.1 GQ891876.1 Brassica ol. capitata DQ003650.1 DQ003651.1 DQ003652.1 DQ003653.1 DQ003654.1 Brassica oleracea MG923981.1 MG923982.1 MG923983.1 MG923984.1 Brassica ra. chinensis AF128095.1 GQ202246.1 GQ202249.1 GQ202250.1 Brassica ra. oleifera GQ268061.1 GQ891873.1 GQ891874.1 Brassica ra. pekinensis GQ891872.1 GQ891880.1 GQ202251.1 AF128096.1 Brassica rapa MG923985.1 MG923986.1 MG923987.1 MG923988.1 MG923989.1 Tabulka 1:Seznam použitých vzorků pro jednotlivé druhy avariety rodu Brassica. Pro srovnání azhodnocení vhodnosti metody Bag-of-words pro fylogenetické studie jsme plodiny rodu Brassica nejprve podrobili standardizované bioinformatické metodě Multiple Sequence Alignment, která porovnává genetické sekvence na základě delecí, insercí, substitucí atransformací nukleotidů/aminokyselin. Použili jsme program webPRANK (https://www.ebi.ac.uk/goldman-srv/webprank/), který ke zhodnocení genetické podobnosti hledá vsekvencích fylogenetické vzory. Výsledky (viz Graf 1) jsou zobrazeny pomocí kladogramu adále graficky rozlišeny vzhledem ke genetickým vztahům hlavních druhových skupin rodu Brassica— Brassica olerace, Brassica rapa, Brassica nigra akřížením vzniklé Brassica napus (B. oleracea + B. rapa), Brassica carinata (B. oleracea + B. nigra) aBrassica juncea (B. rapa + B. nigra). Samotnou analýzu Bag-of-words jsme provedli následovně: Sekvence jsme rozdělili na 3-gramy, tedy subsekvence odélce tří nukleotidů (vbioinformatice užíván pojem k-mer). Subsekvence tripletů jsme dále použili jako „slova“ vBag-of-words analýze. Na základě zastoupení těchto „slov“ ajejich frekvence vjednotlivých sekvencích jsme pak měřili podobnost sekvencí. Jejich srovnání spočívá ve sloučení seznamů „slov“ srovnávaných „genetických textů“ areprezentací jednotlivých „textů“ číselnou řadou odpovídající zastoupení jednotlivých „slov“ vtzv.globálním slovníku (0— vtextu se slovo nevyskytuje, 1— vtextu se slovo vyskytuje jednou atd). Výsledné číselné řady představují vlastnosti textů vstupující do hierarchického shlukování. Rozdíly mezi jednotlivými vlastnostmi srovnávaných textů/objektů jsou reprezentovány jako vzdálenosti objektů, které jsou vgrafu vyznačeny pomocí počtu větvení adélky větví, na nichž se objekty nachází. Ksrovnání sekvencí jsme využili shlukovací metodu ward.D2 apro clustering eukleidovskou vzdálenost. OPEN ACCESS
HANA OWSIANKOVá — ONDŘEJ KUČErA — DAN FALTÝNEK 87 Graf 1:Multiple Sequence Alingment vybraných zástupců rodu Brassica pomocí programu webPRANK. Ve výše uvedeném grafu (viz Graf 2) můžeme pozorovat, že Bag-of-words model 3-gramů ITS markeru velmi dobře vyjadřuje příbuzenské vztahy druhů, jejich variet ahybridů rodu Brassica. Stejně jako při Multiple Sequence Alignment pozorujeme oddělení zástupců B. oleracea od zástupců B. rapa na samostatných větvích. Zdějin agrikultury zjišťujeme (viz Sadowski & Kole, 2011), že hlávkové zelí, květák ačínská brokolice mají společného předka, divokou brukev zelnou, kterou nacházíme na OPEN ACCESS