Výzkum CPACT: Komputační psycholingvistická analýza českého textu
Abstract
101
Full text
VÝZKUM CPACT: KOMPUTAČNÍ PSYCHOLINGVISTICKÁ ANALÝZA ČESKÉHO TEXTU Vladimír Petkevič Kučera, D., Havigerová, J.M., Haviger, J., Cvrček, V., Komrsková, Z., Lukeš, D., Jelínek,T., Urbánek, T., & Franková, J. (2018). Výzkum CPACT: Komputační psycholingvistická analýza českého textu. České Budějovice: Pedagogická fakulta Jihočeské univerzity. Kolektivní monografie, která je výstupem grantového projektu GAČR, reg. č. GA ČR 16-19087S, popisuje původní výzkum problematiky na pomezí psychologie alingvistiky, ato na základě rozsáhlých empirických elicitovaných jazykových dat. Tato data včeštině (klíčový aspekt!), zpracovaná metodami počítačové lingvistiky (morfologické značkování dat amultidimenzionální analýza), ajejich vytěžení demonstrují hlubinné souvislosti mluvčího jazyka ajeho psychologických (případně patologických) rysů. Stěžejní partií monografie je výzkum CPACT (Computational Psycholinguistic Analysis of Czech Text): Komputační psycholingvistická analýza českého textu (dále jen CPACT). Obecně lze výzkum včeském prostředí označit za průkopnický, aplikuje totiž metody počítačové (přesněji: korpusové) lingvistiky na české texty vrámci psychologického výzkumu aukazuje, jak se lidská psychika vosobnostních rysech člověka odráží vjeho jazykových projevech, ať už jako mluvčího či pisatele. Zpsychia trického hlediska umožňuje světší či menší mírou pravděpodobnosti odhalit psychické patologie: vpráci se psycholingvisticky rozebírá deprese jako jedna zhlavních nemocí moderní doby. Monografie je členěna na šest hlavních částí. Úvodní dvě jsou teoretické: 1.Úvod zahrnující podkapitolu 1.1 Vymezení základních pojmů, 2.Komputační lingvistika apsychologický výzkum. Ústřední kapitola 3.Výzkum CPACT podrobně popisuje provedený výzkum. Následuje stručný 4.Závěr svýhledy na návazný výzkum, citovaná (zcela relevantní!) 5.Literatura a6.Přílohy. Vúvodní podkapitole 1.1, nazvané Vymezení základních pojmů, je předvedena metoda výzkumu jako metoda komputačně-psycholingvistická. Definují se tu základní pojmy jako jazyk, registr, scénář, osobnostní charakteristiky, psychologický test pomocí dotazníku zkoumající osobnostní charakteristiky za použití různých škál (dotazníkových, testových…) Kapitola 2.Komputační lingvistika apsychologický výzkum je členěna do tří podkapitol: 2.1 Současná východiska komputační lingvistiky ajejí aplikace, 2.2 Komputační lingvistika vkontextu psychologického výzkumu: Současná témata avybrané přístupy a2.3 Problematika dotazníkového sebeposouzení aposouzení druhým vpsychologickém výzkumu. Kratičká podkapitola 2.1 Současná východiska komputační lingvistiky ajejí aplikace velmi stručně, leč koncizně seznamuje čtenáře soborem komputační lingvistika, jejími metodami ahlavními aplikacemi/podobory. Podkapitola 2.2 Komputační lingvistika vkontextu psychologického výzkumu: Současná témata avybrané přístupy nejprve vkrátkosti charakterizuje pojem psycholingvistika aspeciálně pak komputační psychoOPEN ACCESS
102 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2020 lingvistika. Dále popisuje možnosti zpracování textů pro potřeby psychologického výzkumu sdůležitým rozlišením tzv.uzavřených přístupů (přístup zvolený autory) aotevřených přístupů kvantitativní jazykové analýzy. Jsou rovněž uvedeny významné aplikace vtéto oblasti. Autoři dále uvádějí psychologicky relevantní osobnostní charakteristiky zjištěné na základě komputačnělingvistické analýzy (zmiňují se např.oklíčové roli funkčních slov či synsémantik), ato na bázi zejména anglofonních výzkumů, ale upozorňují rovněž na výzkumy realizované na jiných jazycích, mj.slovanských. Včeštině něco takového dosud chybělo atento nedostatek monografie více než napravuje. Podkapitola 2.3 Problematika dotazníkového sebeposouzení aposouzení druhým vpsychologickém výzkumu charakterizuje využití dotazníků vpsychologickém testování, jejich meze asouvisející problémy. Zaměřuje se na testování osobnostních charakteristik na základě sebeposouzení (self-report) aposuzování druhou osobou (other- -report). Probírá přítomnost/míru asymetrie mezi těmito variantami posuzování aupozorňuje mj.na možné zkreslení výsledků různými činiteli (sociální desirabilita, problematická interpretace konstruktů atermínů respondentem, specifika samotné introspekce/extraspekce, vztah posuzovatele kposuzovanému aj.). Podává přehled zahraničních psychologických modelů vztahujících se ktestování azasazuje tak výzkum CPACT avněm použité testování do celkového kontextu. Hlavní část monografie tvoří její 3.kapitola: Výzkum CPACT. Tento výzkum je velmi výstižně popsán ve čtyřech podkapitolách: 3.1 Úvod do výzkumu CPACT, 3.2 Výzkumný soubor ametody, 3.3 Charakteristika dat apráce sdaty, 3.4 Zpracování dat avýsledky výzkumu CPACT; podkapitoly 3.3 a3.4 jsou dále jemněji členěny. Vpopisu se jasně zračí interdisciplinarita výzkumu: vedle psychologicky zaměřených podkapitol jsou vkapitole 3 obsaženy ikapitoly počítačovělingvistické aobšírně pojednána aplikace počítačovělingvistických metod na jazykové projevy respondentů. Metodologicky tedy výzkum náleží do oboru psycholingvistika avyužívá počítačové analýzy přirozeného jazyka, který se parolově odráží vtextech respondentů. Na metodě je ovšem osobité, že spojení psychologického výzkumu akomputačních jazykovědných metod je včeském prostředí ojedinělé: autoři nejen propojili psychologii akomputačnělingvistickou analýzu textu, ale přišli isvlastní formou testování (úpravou testovacích baterií), přičemž vycházeli zčeských textů/testů. Projekt CPACT má dva hlavní cíle: (i) testovat včeštině hypotézy, jež vycházejí zvýzkumů provedených na angličtině apředpokládají vztah mezi psychologicky relevantními charakteristikami osob aformálními textovými parametry komunikátů těchto osob; (ii) analýzou jazykových dat zjišťovat další proměnné avztahy, jež dosud nebyly vzahraničních studiích publikovány. Je přitom jasné, že metody použité vzahraničních studiích nelze jen tak beze všeho převzít ajednoduše aplikovat na češtinu. Autoři tedy vypracovali pět pilotních studií, klíčových pro experimentální psychologický výzkum. Velmi vhodně byly stanoveny tři moduly: P200 (dvě stě duševně zdravých rodilých mluvčích češtiny reprezentujících obyvatelstvo České republiky zhlediska věku, pohlaví avzdělání), P20+ (podle plánu dvacet depresivních/úzkostných rodilých mluvčích češtiny, ve skutečnosti jich bylo shromážděno dvaasedmdesát (sic!)) aP2 (dva OPEN ACCESS
VLADIMÍr PETKEVIČ 103 posuzovatelé produkovaných textů). Vtéto souvislosti byly formulovány další cíle výzkumu: (iii) popsat analýzou vztahů (jejími autory byli dva vyškolení posuzovatelé) mezi jednotlivými proměnnými užívání textových parametrů udepresivních/úzkostných pacientů azjistit odlišnosti od zdravé populace (výzkum se zaměřil na deskripci, exploraci averifikaci); (iv) porovnat výsledky škálování svýsledky psychologických testů asvýsledky počítačovělingvistické analýzy (hlavně deskripce). Podkapitola 3.1 popisuje také harmonogram aprůběh výzkumu, elektronické rozhraní výzkumu aobsahuje soupis výzkumných pracovníků podílejících se na projektu. Podkapitola 3.2 detailně charakterizuje výzkumný modul P200 avýzkumný postup. Textový materiál tvořily dva řízené rozhovory adva psané dopisy lišící se opozicí (a) formálnost vs. neformálnost a(b) dominance vs. submisivita. Úkolem respondentů bylo: (I) sepsat 1.motivační dopis (žádost opřijetí do zaměstnání), 2.dopis zdovolené, 3.stížnost, 4.omluvný dopis, (II) 1.absolvovat přijímací pohovor, 2.vyprávět opříjemném zážitku. Pro psychologické testování byla sestavena původní testová baterie zahrnující 361 položek vytvořených na základě 11 psychologických testů. Příprava aadministrace testů jsou podrobně popsány a ilustrovány tabulkami aobrázky, někdy bohužel (vzhledem ke zmenšení) nečitelnými. Podkapitola 3.3 Charakteristika dat apráce sdaty obsahuje psychometrické charakteristiky použitých testů (3.3.1) atabulku spodrobným popisem škál testů. Rovněž popisuje osobnostní inventáře (BFI-44: Big Five Inventory aPSSI: Persönlichkeits- -Stilund Störungs-Inventar), dále dotazník úzkosti aúzkostlivosti (STAI X-2: State- -Trait Anxiety Inventory), Multimotivační mřížku (Multi-Motive Grid) arůzné škály adotazníky. Vpodkapitole 3.3.2 Lingvistická analýza textů je poskytnut přehled sledovaných textových (zvláště gramatických) kategorií apodán výklad ojednotlivých jazykových parametrech (gramatických, lexikálních) afrazémech arovněž okombinovaných textových parametrech. Rovněž je popsána automatická lingvistická analýza textů (větná segmentace, tokenizace, morfologická analýza amorfologická disambiguace), anotace frazémů adalší druhy zpracování vstupních textů. Velice důležité anesmírně zajímavé je na konci podkapitoly srovnání vybraných gramatických kategorií vtextech respondentů sobecnou situací vjazyce, reprezentovaném korpusem psaného jazyka SYN2005 (zkoumaného prizmatem žánrů beletrie, publicistiky aodborné literatury) akorpusem mluveného jazyka ORAL; oba korpusy jsou součástmi projektu Český národní korpus. Podíl slovních druhů velicitovaných textech se, jak bylo zjištěno, nejvíce blíží subkorpusu beletrie; texty od respondentů mají vyšší dějovost aspontánnost (vykazují větší zastoupení sloves, zato menší zastoupení substantiv aadjektiv). Byly porovnávány rovněž pády substantiv: opět jsou produkované texty nejbližší subkorpusu beletrie avyšším zastoupením akuzativu avokativu se blíží korpusu ORAL. OPEN ACCESS
104 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2020 Podkapitola 3.4 se věnuje zpracování dat avýsledkům výzkumu CPACT. Podkapitola 3.4.1 Statistická explorace vztahů mezi osobnostními charakteristikami atextovými parametry popisuje korekce nesprávně pozitivních (false positives) výsledků jednotlivých provedených testů (Šidákova korekce) adalší druhy korekcí. Rovněž uvádí výsledky korelační analýzy lingvistických parametrů šesti produkovaných textů vzhledem kpsychologickým testům ajejich škálám. Ukazuje se, že má smysl hledat vztahy mezi textovými parametry aosobnostními charakteristikami, neboť během výzkumu bylo zjištěno celkem 148 prokazatelných vztahů. Vpodkapitole 3.4.2 Zpracování výsledků dotazníkových variant sebeposouzení aposouzení druhou osobou se autoři zaměřují na asymetrii výsledků zmíněných dvou variant dotazníkového posouzení. Zkoumá se míra shody vposouzení určitých škál zhlediska jejich pozorovatelnosti aevaluativnosti atéž míra shody vposouzení sohledem na délku vztahu posuzovaného aposuzujícího. Při zpracování ainterpretaci dat utěchto dvou variant testování se uplatnily různé statistické procedury, přičemž výsledky ukázaly, že nejvyšší shodu mezi oběma typy posouzení vykazuje emoční citlivost jako významná osobnostní charakteristika. Zajímavé je, že škály neuroticismus apřecitlivělost na výrazné chování druhých vykazují signifikantní odlišnost mezi oběma variantami posouzení. Vpodkapitole 3.4.3 Rozsah registrové variability textů je podrobně popsán multidimenzionální model registrové variability aporovnány elicitované texty projektu CPACT skorpusem Koditex, obecně reprezentujícím variabilitu mluvených apsaných textů. Tento korpus je podrobně charakterizován arovněž je detailně popsána multidimenzionální analýza (multidimensional analysis— MDA) prizmatem hlavních dimenzí: 1. Dynamický extrém (+) vs. statický extrém (–) 2. Spontánní (+) vs. připravený (–) 3. Vyšší (+) vs. nižší (–) stupeň koheze 4. Polytematický (+) vs. monotematický (–) 5. Vyšší (+) vs. nižší (–) míra explicitní adresnosti 6. Obecný (+) vs. konkrétní (–) 7. Prospektivní (+) vs. retrospektivní (–) 8. Postojovost (+) vs. faktuálnost (–) Na bázi těchto dimenzí je model MDA porovnán srespondentskými daty podle různých typů testů/textů (motivační dopis, dopis zdovolené, stížnost, dopis somluvou, motivační pohovor, vyprávění opříjemném zážitku). Ukázalo se, že elicitované texty projektu CPACT nabývají očekávaných charakteristik (respondenti se ve svých odpovědích přibližovali požadovanému registru, vymezenému analýzou MDA, resp.snažili se vyhovět komunikační situaci). Podkapitola 3.4.4 Odraz osobnosti vtextu— rysy modelu Big Five zkoumá souvislosti mezi osobnostními psychologickými rysy (vycházejícími zmodelu Big Five, klasického pětidimenzionálního modelu osobnosti: neuroticismus (emocionální stabilita), extraverze, otevřenost zkušenosti, přívětivost, svědomitost) amorfosyntaktickými isémantickými charakteristikami češtiny dospělého obyvatelstva reprezentovaného texty od participantů výzkumu zkvótního souboru P200. Analýza celkem 1200 textů přinesla mimořádně zajímavé výsledky: OPEN ACCESS
VLADIMÍr PETKEVIČ 105 (i) čím vyšší je extraverze, tím vyšší je podíl zájmen (obecně, nejen například 1.osoby) apříčestí minulého vmluvené řeči (míněno patrně vaktivu); (ii) čím vyšší je neuroticismus, tím více se vyskytují zájmena v1.osobě atím méně neurčité číslovky (např.několik) atím chudší je slovní zásoba; (iii) čím vyšší je otevřenost, tím bohatší je slovní zásoba, anaopak klesá podíl interpunkce apočet emočních slov afrazémů, unichž nelze zjistit emoční příznak; (iv) svědomití lidé málo užívají hovorových aobecněčeských tvarů ataké tvarů negativních; naopak ve větší míře užívají substantiv, adjektiv, neurčitých číslovek aposesivních zájmen. Roste také deskriptivita textu aprokázal se itěsný vztah mezi svědomitostí avýskytem 2.osoby. Ve výzkumu bylo zjištěno 35 spolehlivých korelací, které se vpráci detailně probírají. Diskuse je mimořádně zajímavá ainterpretace průkopnická patrně ive světovém měřítku. Dosažené výsledky jsou koncizně shrnuty na konci podkapitoly 3.4.4.4. Bylo zejména zjištěno, že: vztahy mezi osobností atextem jsou obecnějazykové, tj.do značné míry nezávislé na konkrétních jazycích; osobnostní rysy se více promítají do textových charakteristik vkomunikačních situacích sneformálním rámcem ado charakteristik mluvených textů (oproti textům psaným). Podkapitola 3.4.5 Odraz osobnosti vtextu— projevy deprese obsahuje výsledky zkoumání respondentů vklinickém modulu P20+; jde konkrétně omanifestace aktuální deprese vpsaném textu. Tato manifestace je ovlivněna především pohlavím respondenta ataké jazykovým registrem spjatým sdanou komunikační situací. Jak vyplývá zvýzkumu, klíčovými apřitom spolehlivými příznaky deprese jsou urespondentů: (i) nadměrné užívání emočně nabitých slov (platí obecně, nejen včeštině); (ii) nadměrné užívání osobních zájmen (vsinguláru iplurálu), neurčitých číslovek afrazémů; (iii) menší užívání přítomných abudoucích slovesných tvarů aaktivních l-ových příčestí i— patrně— vyšší užívání pasivních konstrukcí vminulém čase; (iv) menší užívání vokativu adruhé osoby; (v) srostoucí mírou aktuálně prožívané deprese klesá konkrétnost aspecifičnost textu. Jsou to cenné údaje, neboť na základě takovýchto korelací se dají vytvářet prediktivní modely, umožňující identifikovat osoby ohrožené depresí. Opravdu pozoruhodné aobtížně předpokládatelné je zjištění, že nejsilnější prediktivní model deprese pro muže vychází zformálního řečového registru textu stížnosti, zato pro ženy zneformálního řečového registru textu dopisu zdovolené. Interdisciplinární výzkum uplatněný vprojektu CPACT pokládám za přímo modelový příklad ideální mezioborové kooperace. Vprojektu se výtečně snoubí vynikající expertiza psychologická alingvistická, která vedla— nepřekvapivě— knetriviálním aprůkopnickým výsledkům, daným zejména šťastně zvolenou metodologií, jejíž opodstatněnost se prokázala nade vši pochybnost. Zhlediska lingvistického je velmi potěšitelné sledovat, jak přínosná je jazykovědná multidimenzionální analýza nejen pro zkoumání jazyka samého, ale izhlediska tzv.vnější lingvistiky, tj.zhleOPEN ACCESS
106 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2020 diska přesahu kjiným oborům, zde kpsychologii. Rovněž jsem velice potěšen tím, jak plodně se uplatňují výsledky netriviálního gramatického značkování českých textů. Teoretické výsledky představují velmi dobrou základnu, na níž lze vdalším výzkumu plodně stavět. Tyto výsledky navíc nezůstanou, jak pevně doufám, pouze pokladnicí teorie, ale budou využity iprakticky, zvláště zřejmě vpsychodiagnostice. Je velmi sympatické, že autoři nikterak nezastírali obtížnost svého výzkumu, jež byla dána mj.složitou organizací alogistikou (mnoho respondentů, náročná elicitace různých typů textů…). Práce je průkopnická ive světovém měřítku. Přesvědčivě prokázala, jak je prospěšné jazykově zkoumat osobnostní rysy člověka nejen prostřednictvím angličtiny, ale ijazyka zjiné jazykové rodiny, který disponuje jinými gramatickými kategoriemi. Zhlediska jazykového stylu se text dobře čte, formulace jsou srozumitelné avěcné bez pleonasmů aredundancí. Text obsahuje mnoho odborných výrazů převzatých zangličtiny, pro něž patrně (bohužel!) neexistuje český ekvivalent. Vpsychologicky zaměřených studiích autoři někdy používají po mém soudu zbytečných anglicismů, které asi nejsou součástí odborného diskursu, např.facilitovat dostupnost (s.24), augmentovat nepodstatné detaily (s.38). Vtextech se občas objeví překlepy: texové markery; (navenek vyjádřené) chovaní (oboje na s.13), jisota (s.25); morfologicky spíše hyperkorektní varianty: jazykových jevů…, které nejsou apriori definované avychází (místo vycházejí); nevhodně opisné stupňování: více skryté charakteristiky (s.39); anglická slovesná valence: přístupy umožňují lépe diskutovat základní teorie (s.25); neobratné formulace: adále skutečnost, že to, že je někdo vhodným posuzovatelem předložené situace… (s.35); bylo pracováno se všemi pěti škálami (s.92)…; lexikální apravopisné chyby: Augustiánské aDescarteovské tradice adalší. Tyto nedostatky však příliš nebrání plynulému čtení, neboť nejsou četné. Na monografii se podíleli výše uvedení odborníci zrůzných oborů: psychologové, počítačoví lingvisté, statistikové, práce je tedy výsostně interdisciplinární, příklad interdisciplinární kooperace je tu čítankový. Velkým přínosem textu, jemuž nelze odborně nic vytknout, je logické členění jednotlivých studií (úvody, cíle, hypotézy, závěry se shrnutými výsledky), text se iproto snadno aplynule čte. Integrální součástí textů jsou obrázky, grafy, tabulky mj.súdaji ostatistických šetřeních, spřehledy testovacích baterií ad. Recenzovaná monografie, kterou vydala Pedagogická fakulta Jihočeské univerzity vČeských Budějovicích vroce 2018, zásadně přispívá kmodernímu psychologickému ilingvistickému výzkumu. Je názorným příkladem plodné mezioborové spolupráce arovněž velkou inspirací pro další psycholingvistický výzkum. VPraze 7.prosince 2019 Vladimír Petkevič | Ústav teoretické akomputační lingvistiky FFUK <[email protected]> OPEN ACCESS