8 6 Oksana Smirnova Több szóból álló terminusok korpuszvezérelt elemzése, Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian beleértve a „Risk” szót tartalmazó több szóból álló terminusok korpuszvezérelt elemzését angol, francia és litván nyelven OKSANA SMIRNOVA Mykolas Romeris Egyetem, Litvánia SIGITA RACKEVIČIENĖ Mykolas Romeris Egyetem, Litvánia KULCSSZAVAK: leíró terminológia, korpuszvezérelt elemzés, pénzügyi terminusok, terminuskivonás, terminusképzési mintázatok 1. BEVEZETÉS A számítástechnikai technológiák új lehetőségeket nyitottak a nyelvészeti kutatás előtt: a digitális korpuszok és a korpuszelemző szoftverek megkönnyítették a hozzáférést a nyelv legmélyebb struktúráihoz, valamint a különböző nyelvi egységek közötti kapcsolatokhoz, továbbá lehetővé tették használatuk sajátosságainak feltárását különböző szakterületeken és különböző időszakokban. Ezért a természetes nyelv korpuszvezérelt elemzését napjainkban a nyelvészet számos területén alkalmazzák: a lexikográfiában, a nyelvoktatásban, a gépi fordítás fejlesztésében, nyelvi adatbázisok összeállításában stb. A terminológiai kutatás is nagymértékben korpuszvezéreltté vált. A digitális korpuszok lehetővé teszik a terminológusok számára, hogy nagy mennyiségű dokumentummal dolgozzanak, megfigyeljék a szaknyelv sajátos jellemzőit, információt gyűjtsenek a terminusok tényleges használatáról és fejlődéséről, rögzítsék az új terminusokat, amelyek intuitív módon nem voltak érzékelhetők vagy előre jelezhetők, valamint több nyelv adatainak kontrasztív elemzését is elvégezzék. A korpuszelemző szoftverek, valamint az automatikus és félautomatikus terminuskivonó eszközök szintén hozzájárulnak a terminológia szabványosításához; például a szinonimák gyakoriságának számlálása hasznos eloszlási bizonyítékot szolgáltathat, nologists to revise terminographical information about terms in existing amely statisztikailag preferált terminusokra utal (Khurshid, Rogers 1992: 36). Így a digitális korpuszok lehetővé teszik terminológiai adatbázisok létrehozását és folyamatos frissítését.
8 7Terminologija | 2018 | 25 According to M. Teresa Cabré, M. Amor Montané and Rogelio Nazar, a modern terminológia célja a terminológiai értékkel rendelkező lexikai egységek formai, szemantikai és funkcionális leírásának elkészítése, to explain their relation with the rest of the units of the linguistic system. továbbá A terminológiai kutatás tárgya az „élő terminológia” (a szakosodott szövegekben természetes módon előforduló terminológia), valamint a terminusok használatának kommunikatív aspektusa, amely legjobban egy korpuszban jelenik meg (Cabré, Montané, Nazar 2012). A kutatás célja, tárgya és feladatai. A kutatás célja a korpusznyelvészet módszertanának alkalmazása az angol, francia és litván nyelvben a ‘risk’ szót fejfőnévként tartalmazó pénzügyi több szóból álló terminusok kivonására és formális szerkezetük elemzésére. E cél elérése érdekében a következő feladatokat tűztük ki: 1) a korpuszvezérelt leíró terminológia alapelveinek, ezen belül a kollokációs-kolligációs elemzés módszereinek vizsgálata; 2) az uniós pénzügyi tárgyú jogi aktusok korpuszainak összeállítása három nyelven (angolul, franciául és litvánul), valamint a korpuszvezérelt kutatáshoz megfelelő szoftver kiválasztása; 3) a leggyakoribb szavak kinyerése a vizsgált nyelvek korpuszaiból, valamint a további elemzéshez szükséges leggyakoribb kulcsszó (főnév) kiválasztása; 4) a kiválasztott kulcsszó kollokációs elemzésének elvégzése az angol korpuszban, valamint a kiválasztott kulcsszót a terminusok szemantikai és szintaktikai fejeként tartalmazó többszavas terminusok kinyerése az angol korpusz anyagából; 5) a kiválasztott angol terminusok francia és litván ekvivalenseinek meghatározása a párhuzamos angol–francia–litván korpuszban; 6) a kiválasztott többszavas terminusok formális szerkezetének kvantitatív elemzése, valamint annak meghatározása, hogy a vizsgált nyelvekben mely módosítási mintázatok és szintaktikai szerkezetek dominálnak. A kutatás adatai és hatóköre. A kutatás céljaira három egynyelvű four corpora of the EU documents of financial domain were compiled: korpuszt (angol, francia és litván), valamint egy párhuzamos korpuszt (EN-FR-LT) használtunk fel. A korpuszok méretei a következők: EN 802 933 szó, FR 940 655 szó, LT 639 279 szó. Összesen 210 pénzügyi
8 8 Oksana Smirnova Több szóból álló terminusok korpuszvezérelt elemzése Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian Beleértve a „risk” főnévvel mint fejfőnévvel rendelkező pénzügyi terminusokat, 210 pénzügyi terminust nyertek ki a korpuszokból: 70 angol terminust, valamint ezek francia és litván megfelelőit. A „risk” szó választását a korpusz adatai határozták meg, amelyek feltárták, hogy ez a szó volt a leggyakoribb a kiválasztott uniós dokumentumokban. 2. A KUTATÁS ELMÉLETI ALAPELVEI 2.1. Preskriptív és deskriptív terminológiamenedzsment A természetes nyelvi kutatásra szolgáló számítástechnikai technológiák fejlődése világosan megkülönböztette a hagyományos terminológiát a modern terminológiától. A terminológusoknak a terminus fogalmához, a terminusok forrásaihoz, a terminusok szabványosításához és más terminológiai siderably. Two directions of terminology research and management have kérdésekhez való hozzáállása megváltozott; két irányzatot különböztettek meg: a preskriptív terminológiát és a deskriptív terminológiát (Zeller 2005; Bielinskienė et al. 2015). A preskriptív terminológia képviselői a terminológiai szótárakon, adatbázisokon, jóváhagyott terminológiák jegyzékein és a szabványosítási elvekről szóló dokumentumokon alapuló terminológiai szabványosításra összpontosítanak. A preskriptív terminológiában egy terminus fogalmát az határozza meg, hogy az általa leírt fogalom milyen helyet foglal el a szakterület fogalmi hierarchikus rendszerében, és milyen kapcsolatban áll más fogalmakkal (Pearson 1998: 10; Marcinkevičienė 2000: 6). A preskriptív terminológia elvei szerint egy fogalom leírására egy terminust kell használni, mivel ez a kölcsönös megfelelés csökkenti a kétértelműség valószínűségét, megkönnyíti a kommunikációt, és egyidejűleg elősegíti a szakterület fogalmi hierarchikus rendszerének kialakítását. A deskriptív terminológusok elhatárolódnak a terminusfogalomra, a terminusok egyértelműségére, a hierarchikus fogalmi rendszer kialakítására és a szabványosításra vonatkozó szigorú állásponttól. A deskriptív terminológiában – a preskriptív terminológiával ellentétben – a kontextus létfontosságú szerepet játszik egy terminus elemzésében, és a terminust kontextusától függő lexikai egységként értelmezik. Céljuk nem az, hogy egy terminust bizonyos elvek szerint alakítsanak ki, hanem hogy rögzítsék annak használatát, formáinak változatosságát különböző szövegekben, valamint leírják sajátosságait, ezáltal alapot teremtve szabványosításához (Bielinskienė et al. 2015: 10–11). A technológiák fejlődése a különböző típusú szövegekben bemutatott információ hatalmas áramlásához, ezzel egyidejűleg pedig a bennük használt terminusok folyamatosan növekvő számához vezetett. Ebben a folyamatosan változó valóságban a termi-
8 9Terminologija | 2018 | 25 A terminológusok már nem képesek ellenőrzésük alatt tartani a terminológia gyors fejlődését, mivel a terminusok gyorsabban változnak, mint ahogy feldolgozzák őket. Ezért a terminológia kezelése a preskriptív módszertan helyett a leíráson alapuló rugalmasabb megközelítést igényel. A hangsúly a terminológia szabványosításáról a terminológia korpuszokban történő elemzésére helyeződött át (Bielinskienė et al. 2015: 11). A leíró terminológia vezetett a terminológia kommunikatív elméletének kialakulásához, amely a szakmai diskurzusokban használt élő terminológiára helyezi a hangsúlyt, és a terminusok használatának kommunikatív aspektusát emeli ki (Cabré, Montané, Nazar 2012). Ezen elmélet szerint a terminusok fő szerepe a szakértői tudás közvetítése; ezért „háromoldalú poliéderként foghatók fel, amelynek kognitív összetevője (a fogalom), nyelvi összetevője (a terminus) és kommunikatív összetevője (a helyzet)” van (Cabré, Montané, Nazar 2012: 1). A kommunikatív elméleten alapuló terminológiai kutatások nemcsak a szabványokban rögzített vagy hivatalos adatbázisokban található terminológia iránt érdeklődnek, hanem (és különösen) azok iránt a terminusok iránt is, amelyeket ténylegesen használnak a szaknyelvi szövegekben. Így a kommunikációs elmélet „nemcsak in vitro megközelítést alkalmaz, hanem az in vivo terminusok iránt is érdeklődik” (Cabré, Montané, Nazar 2012: 1–2). Az élő terminológia kutatása feltárja, hogy a terminusok hagyományos egyértelműségének fogalma (egy fogalom és a különböző nyelvekben használt konkrét terminusok közötti egy az egyhez megfelelés) a valós nyelvben nem megalapozott. A változatosság (szinonímia, többértelműség, körülírások, redundancia) nemcsak az általános nyelv egységeire, hanem a terminológiára is jellemző; ezért a fogalmakat és a terminusokat „dinamikus kölcsönhatásukban” kell vizsgálni (Cabré, Montané, Nazar 2012: 2–3). A terminusok használatára helyezett hangsúly a korpuszokat a modern terminológiai elemzés fő munkaterévé tette. A digitális korpuszok és a korpuszelemző szoftverek gazdag erőforrásokkal és eszközökkel bővítették a terminológiát, amelyek lehetővé teszik a terminológusok számára, hogy nagy mennyiségű dokumentumból terminusokat nyerjenek ki, megragadják egy adott szakterület terminológiájának legújabb változásait, elemezzék annak fejlődését, valamint feltárják az ugyanahhoz a szakterülethez tartozó terminusok közötti fogalmi kapcsolatokat. A korpuszok lehetővé teszik, hogy megbízható, statisztikai alapú, korábban egyáltalán nem hozzáférhető információkat szerezzünk a terminusok természetes nyelvi használatáról. Ezért a korpuszvezérelt módszertan vált a terminológiai kutatás és -menedzsment meghatározó módszertanává, amely nélkülözhetetlen eszköztárat biztosít (Zeller 2005; Cabré, Montané, Nazar 2012; Bielinskienė et al. 2015).
9 0 Oksana Smirnova Többszavas terminusok korpuszalapú elemzése, beleértve Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian 2.2. A korpuszalapú elemzés alapelvei: kollokációs és kolligációs módszerek A korpuszalapú terminuskivonást és -elemzést statisztikai és nyelvészeti módszerekkel végzik. A jelen kutatásban kollokációs és kolligációs módszereket alkalmaznak. Collocations refer to syntagmatic attraction between lexical units. AcTomas Lehecka (2015) szerint „a kollokáció fogalma azon az elképzelésen alapul, hogy egy nyelv minden szava bizonyos lexikai kontextusokat előnyben részesít másokkal szemben, azaz hogy bármely adott szó bizonyos szavakkal gyakrabban fordul elő együtt, mint másokkal” (Lehecka 2015: 2). A korpuszadatok statisztikai elemzését a szavak közötti vonzódás mértékének meghatározására használják; eredményei lehetővé teszik annak megállapítását, hogy mely szókapcsolatok fordulnak elő együtt szignifikánsan gyakrabban annál, mint ami véletlenszerűen várható lenne a szavak korpuszbeli összgyakorisága alapján (Lehecka 2015: 2). Ily módon megállapíthatók az elemzett korpuszban a kiválasztott szavak legjelentősebb kollokációi. Ezt a módszert leginkább a lexikai egységek kontextuális szemantikai elemzésére használják, mivel lehetővé teszi a vizsgált szavakkal együtt előforduló szavak teljes változatosságának megfigyelését, a domináns együtt-előfordulási mintázatok megállapítását, ezáltal pedig jelentésük kontextuális környezetük alapján történő leírását (Atkins, Rundell, Sato 2003: 340–341). A kollokációs elemzés a lexikográfusok nélkülözhetetlen eszközévé vált; széles körben alkalmazzák a számítógépes nyelvészetben is a gépi fordítás, a természetesnyelv-feldolgozás és más területek céljaira (Lehecka 2015). A kollokációs módszert gyakran a kolligációs módszerrel kombinálva alkalmazzák. A kolligáció fogalma egy lexikai egység és egy grammatikai minta vonzására utal, és azon a felfogáson alapul, hogy a szavakat bizonyos grammatikai mintákban részesítik előnyben, más grammatikai mintákat pedig elkerülnek (Sinclair 1998; Lehecka 2015). A kolligációs elemzés extended and encompass the relationship between the lexical unit and azt a pozíciót is jelentheti egy kifejezésben, tagmondatban, mondatban, szövegben vagy diskurzusban, ahol a lexikai egység használható (Hoey 2005: 49–52). A kolligációs elemzést széles körben alkalmazták a nyelvészeti vizsgálatokkal collocational analysis to study the meanings of near-synonyms as corpus kombinálva, amelyek feltárták, hogy ezeket gyakran eltérő lexikai és grammatikai kontextusokban használják (Lehecka 2015). Korpusznyelvészeti vizsgálatok
9 1Terminologija | 2018 | 25 eltérő kollokációs és kolligációs mintázat (Aston, have shown that even different senses of polysemous words may have difBurnard 1998). A kollokációs és kolligációs elemzések tehát bebizonyították, hogy a szemantikát és a grammatikát nem egymástól függetlenként kell kezelni, hanem szorosan figyelembe kell venni őket az elemzésekben, ugyanúgy, interconnected systems (Lehecka 2015). pragmatic aspect should also be mint a kollokációs és kolligációs, valamint a különböző szövegtípusokat (Butler preferences of a lexical unit vary significantly between different domains 2004: 157; Newman, Rice 2006). 2.3. A kollokációs-kolligációs módszer alkalmazása a terminuskivonásban és -elemzésben A kollokációs-kolligációs módszer többszavas terminusok kivonására is használható; különösen alkalmas terminológia, többek között előre kiválasztott kulcsszavak – a korpuszhoz tartozó szakterületre jellemző, potenciálisan terminológiai jelentőségű szavak – kinyerésére. Ez a módszertan azon a feltételezésen alapul, hogy az összetett terminusok már létező egyszerű terminusokból állnak (Nakagawa 2001). A korpuszelemző eszközök kivonják az előre kiválasztott kulcsszavakkal együtt előforduló szavakat, és lehetővé teszik a domináns kollokációk meghatározását. E kollokációk egy része olyan főnévi csoport, amelyeket nyelvészeti módszerekkel kell kiválasztani a kollokációs listákból. A kiválasztott főnévi csoportokat a korpuszadatok további elemzésére, valamint a kiválasztott főnévi csoportokból és esetleg további kollokátumokból álló többszavas terminusok kinyerésére használják. A jelen kutatásban a kinyert terminusokat kollokációs elemzési elvek alkalmazásával tovább elemzik, törekedve arra, hogy feltárják a terminológia formális struktúramodelljeit a vizsgált nyelvekben, valamint hozzájáruljanak a terminusképzési mintázatok kontrasztív többnyelvű vizsgálatához (vö. Janulevičienė, Rackevičienė 2014; Mockienė 2016). 3. KORPUSZOK FEJLESZTÉSE ÉS KIVÁLASZTÁSA A szoftver elemzéséről: egy adott szakterület dokumentumaiból álló According to M. Teresa Cabré, M. Amor Montané and Rogelio Nazar, korpusz összeállításának célja hármas. Először is, a terminológusoknak meg kell ismerkedniük a terminuskinyerés típusával, és statisztikai of language of the domain; secondly, a corpus is needed to perform terelemzéseket kell végezniük a terminusokon; és
9 2 Oksana Smirnova Többszavas terminusok korpuszvezérelt elemzése Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian Végül a szövegeket arra használják, hogy kiegészítő információkat nyerjenek a terminusokról, például szemantikai, szintaktikai vagy kollokációs támpontokat (Cabré, Montané, Nazar 2012: 3–4). Az összeállított korpusznak elegendő méretűnek és megfelelő minőségűnek kell lennie ahhoz, hogy a kiválasztott szakterület reprezentatívjának lehessen tekinteni. A korpusz méretére vonatkozóan nincsenek pontos követelmények; de a lehető legtöbb dokumentumot kell tartalmaznia, mivel minél nagyobb, annál megbízhatóbb következtetések vonhatók le a terminológia szakterületen belüli használatáról (Cabré, Montané, Nazar 2012: 4). Mindezeket a szempontokat figyelembe véve összeállították az uniós jogi aktusok angol, francia és litván nyelvű korpuszait. A jogi aktusokat az Európai Unió Hivatalos Lapjából töltötték le, amely szabadon megtekinthető online forrás. 101, az EU pénzügyi kérdéseire vonatkozó, a 2014–2017 közötti időszakban elfogadott jogi aktust gyűjtöttünk össze. A dokumentumokat egyszerű szöveggé alakítottuk, majd a terminusok kinyerése és elemzése céljából összehangoltuk. A szövegek összeállításához és összehangolásához, valamint a szükséges adatok kinyeréséhez három programot használtunk: az Laurence Anthony által létrehozott és tanúsított AntConc (2014), AntPConc (2017) és NOVA Text Aligner (2014) programokat. Az AntConc ingyenes, többplatformos eszközkészlet korpusznyelvészeti kutatások végzéséhez és adatvezérelt tanuláshoz, míg az AntPConc több nyelvből álló párhuzamos korpusz létrehozására szolgál. Mindkét program lehetővé teszi a kutató számára, hogy nagy mennyiségű adattal dolgozzon, és átfogó többnyelvű nyelvészeti elemzést végezzen. Az AntConc program által a felhasználók számára biztosított eszközök a következők: Word list, Collocates, Clusters, Keywords, Concordance, Concordance plot, File view tool. A jelen kutatásban az AntConc négy eszközét alkalmaztuk: • A Wordlist lehetővé tette a korpuszokban leggyakrabban előforduló szavak meghatározását; • Collocates enabled to determine the dominant collocates of the a „risk” szó, és mérik a „risk” szóhoz való szintagmatikai vonzódásuk mértékét; • Azok a klaszterek, amelyek lehetővé teszik a „risk” szót mint fejet tartalmazó, legdominánsabb többszavas terminusok feltárását; • Concordances gave a wide variety of samples illustrating the usage a szövegekben szereplő terminusok közül. Az AntConc program pillanatképe az 1. ábrán látható.
9 3Terminologija | 2018 | 25 A párhuzamos korpusz összeállítása előtt a három nyelven letöltött szövegeket manuálisan igazították a NOVA Text Aligner program segítségével. A szövegek igazítása után az AntpConc program segítségével párhuzamos korpuszt hoztak létre (lásd a 2. ábrát). 2. ábra. AntPConc program 1. ábra AntConc program
9 4 Oksana Smirnova Több szóból álló terminusok korpuszvezérelt elemzése, Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian beleértve az AntPConc programot is, amely lehetővé tette, hogy egyszerre jelenítsük meg a példákat három nyelven: a kiválasztott mondatra kattintva meg lehetett tekinteni a megfelelő mondatokat más nyelveken. A program lehetővé tette továbbá a kulcsszavak, valamint azok bal és jobb oldali kollokátumainak megkülönböztetését különböző színek használatával. azonban nem lehetett megtekinteni azt a dokumentumot, amelyből a példát kinyerték. A párhuzamos korpusz felhasználásával 70 angol terminus francia és litván megfelelőit nyerték ki. 4. KORPUSZELEMZÉS ÉS TERMINUSKINyERÉS A KÖVETKEZŐ HASZNÁLATÁVAL Az AntConc és AntpConc PROGRAMOK ESZKÖZEI 4.1. A korpuszok leggyakoribb szavainak meghatározása A pénzügyi dokumentumok korpuszában előforduló leggyakoribb szavak meghatározásához az AntConc program Word list eszközét használtuk. Ez biztosította a szógyakorisági eredményeket az angol, francia és litván korpuszokban, ami lehetővé tette a vizsgált nyelvek szógyakoriságainak összehasonlítását, valamint a 10 leggyakoribb szó háromnyelvű listájának összeállítását (lásd az 1. táblázatot). A Word list arról is információt nyújtott, hogy hány szóelőfordulás és szótípus volt a korpuszokban, valamint hozzáférést biztosított ahhoz a kontextushoz, amelyben a kifejezéseket használták (lásd az 1. táblázatot). 1. táblázat. A korpuszok 10 leggyakoribb szava EN (korpusz 802 933 szó LT korpusz, 24727 szótípus) szótípus) FR (940 655 szavas korpusz, 12365 szótípus) (639 279 szavas token, 9333 1. kockázat (3252), (1063), rizika risks risque (2855), (592) risques (997) rizikos (2549), riziką (536), rizikai (355), rizikas (4) 2. hitel (3183), credit (3307), kredito kreditas (8), kreditai (6), kreditais (3103), kreditų (52), kreditu credits (4), kreditus (3), kreditams (2) (18) credits (222) (29), kreditą (28), 3. market (1642), marché (1631), (229), rinkoje (226), rinką (76), rinkos (1355), rinkų (310), rinka rinkose (75), rinkai (51), markets (424) marches (484) rinkoms (18), rinkas (7), rinkomis (2)
101 Terminologija | 2018 | 25 6. táblázat A terminusok utópozitív módosítási mintáinak szintaktikai szerkezetei Szintaktikai szerkezetek EN FR LT „kockázat” + pp 13 pl.: az intézmény rendszer kockázata, a veszteség kockázata, terminus, pl.: 22 terminus, kockázata, risque de risque de concentration, risque de modèle crédit, – a pénzügyi „kockázat” –napon belüli + A 20 terminus, pl. : kockázat, – belső specifikus kockázat kockázat, „kockázat” + –korrelációs A + pp 4 terminus, pl. : specifikus kockázat, korrelációs kockázat, általános korrelációs kockázat – korreláció, jelentős ‘risk’ + pp + A –15 kifejezés, pl.: specifikus hitelkockázat – nyersanyagkockázat napi hitelkockázat, „kockáz- + pp hitelkockázat – 24 at” + pp + A + –9 terminus, pl. : órás napon belüli, 24 risque de liquidité órás napon belüli 1. diagram. A terminusok módosítási mintái
102 Oksana Smirnova Többszavas terminusok korpuszvezérelt elemzése Az Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian eredmények azt mutatják, hogy a prenominális módosítás domináns az angol és a litván nyelvben, míg a posztnominális módosítás a francia nyelvre jellemző. Litván nyelvben nem észleltek prenominális módosítási mintájú terminusokat. found in French, and no terms of postnominal modification patterns were Kizárólag az angol terminusok tartoztak mindkét típusba, noha az összes number of terms with postnominal modifiers is rather low. vizsgált terminus egy vagy több, főnévi, melléknévi vagy elöljárós szerkezetből álló módosítót tartalmaz, amelyek a terminológiai egységekben különböző pozíciókat foglalnak el. Az elemzés eredményei azt mutatják, hogy az angol és a litván terminusok domináns módosítói a főnevek és a melléknevek, míg a francia terminusokban a „risk” szót többnyire elöljárós szerkezetek módosítják. A 3 vagy több szóból álló terminusok módosítási szintjeik szerint tovább osztályozhatók (olyan terminusok, amelyek a fejfőnevet módosító módosítókat tartalmaznak, illetve olyan terminusok, amelyek más módosítókat módosító módosítókat tartalmaznak), de a korlátozott terjedelem miatt ezt az elemzést a tanulmány nem mutatja be. A táblázatokban összefoglalt eredmények azt is feltárják, hogy a terminusok alkotóelemeik számát tekintve különböznek egymástól. A terminushossz kvantitatív elemzését annak megállapítására végeztük el, hogy a vizsgált nyelvekben mi a terminusalkotóelemek domináns száma; eredményeit a 2. diagram mutatja be. A diagram két fő tendenciát tár fel. Először is, az uniós terminusalkotók tiszteletben tartják a nyelvi gazdaságosság fő követelményét (a terminusok rövidségét): mindhárom nyelvben a kétszavas terminusok vannak túlsúlyban. Másodszor, a 2. diagrammal ellentétben csak néhány angol és francia terminus áll kettő-háromnál több szóból. A terminusalkotó elemek számának
103Terminologija | 2018 | 25 A 4 vagy több szóból álló litván terminusok a kiválasztott adatok jelentős részét teszik ki (70-ből 17-et). The tendency of prevalence of two-word terms coincides with the tentendenciája, amelyet más terminológiai kutatók is megállapítottak. Az oktatási és tudományos terminológiai terület terminusainak automatikus kinyerésére és by Agnė Bielinskienė et al. revealed that most Lithuanian terms of this meghatározására irányuló kutatás: a két szóból álló terminusok az alkotmányjogi terminológiából automatikusan kinyert terminusjelöltek közül kiválasztott specialised corpus (Bielinskienė et al. 2015: 62). The contrastive research terminusok több mint kétharmadát tették ki; a Liudmila Mockienė által végzett kutatás három különböző nyelvben ugyanezt a tendenciát tárta fel. A vizsgált, alkotmányos jellegű angol, orosz és litván jogi aktusokban a kinyert többszavas terminusok többsége két terminuselemből állt: az angol többszavas terminusok 78,5%-át, az orosz többszavas terminusok 62%-át, a litván többszavas terminusoknak pedig 74,5%-át tették ki (Mockienė 2016: 43–45). Így a különböző területek és különböző nyelvek terminusalkotói általában ugyanahhoz az elvhez, a nyelvi gazdaságosság és a felhasználóbarátság elvéhez tartják magukat. 6. KÖVETKEZTETÉSEK Az egynyelvű korpuszok elemzésére használt AntCont és a párhuzamos korpuszok elemzésére használt AntpConc lehetővé tette az angol, francia és litván több szóból álló terminusok kivonását, amelyekben a „risk” szó a főnévi fej, a kutatás céljaira összeállított, pénzügyi szakterülethez tartozó uniós dokumentumok szakosított korpuszaiból. A kivonást a következő szakaszokban végezték: • az angol, francia és litván korpusz kulcsszavainak (a korpuszok által képviselt szakterületre jellemző, potenciális terminológiai relevanciával bíró szavak) kivonása, valamint a leggyakoribb kulcsszó (a „risk” szó) kiválasztása további elemzés céljából; • a „risk” szó kollokációinak, valamint a „risk” szót főnévi fejként tartalmazó, bal és/vagy jobb oldali kollokátumokkal rendelkező főnévi csoportoknak a kivonása az angol korpuszból; • terminológiai értékkel rendelkező lexikai egységek kiválasztása a kivont főnévi csoportok listájáról; • a kiválasztott angol terminusok francia és litván megfelelőinek megállapítása a párhuzamos angol–francia–litván korpuszban.
104 Oksana Smirnova Több szóból álló terminusok korpuszvezérelt elemzése, Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian beleértve A, Az alkalmazott módszertan alkalmasnak bizonyult a terminológia hatékony többnyelvű kivonására, amely terminológiai adatbázisok fejlesztésére/frissítésére vagy a terminusok tudományos elemzésére használható. A kivont terminusok formális szerkezetének elemzése néhány fő term formation tendencies in the investigated languages: • a prenominális módosítás domináns az angol és a litván nyelvben, míg a posztnominális módosítás a francia nyelvre jellemző; • az angol és a litván terminusok domináns módosítói főnevek és melléknevek, míg a francia terminusokban a „risk” szót többnyire prepozíciós kifejezések módosítják; • az összetevők száma szerinti leggyakoribb terminustípus a kétszavas terminus – ezek alkotják az angol, a francia és a litván TOp 70 listák terminusainak legnagyobb részét; ez azt mutatja, hogy az uniós terminusfejlesztők tiszteletben tartják a nyelv fő követelményét – guage economy (brevity of terms); • csak néhány angol és francia terminus áll több mint 2–3 szóból, míg a litván TOp 70 listában a 4 vagy több szót tartalmazó terminusok a kiválasztott adatok jelentős részét alkotják (70-ből 17-et). A formális szerkezet elemzésének eredményei feltárják a terminusképzés tendenciáit a vizsgált nyelvekben, és olyan terminológiai információkat szolgáltatnak, amelyek hasznosak lehetnek a terminusfejlesztők és a fordítók számára. A kutatásban megállapított szintaktikai mintázatok felhasználhatók automatikus nyelvészeti terminuskivonási módszerek kidolgozására, előre kiválasztott kulcsszavak nélkül. REFERENCES Aston g., Burnard L. 1998: The BNC Handbook. Exploring the British National Corpus with SARA, Edinburgh: Edinburgh University press. Atkins S., Rundell M., Sato H. 2003: The contribution of FrameNet to practical lexicography. – Internation al Journal of Lexicography 16(3), 333–357. Bielinskienė A., Boizou L, Grigonytė G., Kovalevskaitė J., Rimkutė E., Utka A. 2015: Lietuvių kalbos terminų automatinis atpažinimas ir apibrėžimas. Monografija, Kaunas: Vytauto Didžiojo universitetas. Butler C. S. 2004: Corpus studies and functional linguistic theories. – Functions of Language 11(2), 147–186. Cabré M. T., Montané M. A., Nazar R. 2012: Corpus-based Terminology Processing. TKE 2012 Tutorial. Available at http://terminus.iula.upf.edu/tke2012/. hoey M. 2005: Lexical Priming: A New Theory of Words and Language, London: Routledge. Janulevičienė V., Rackevičienė S. 2014: Formation of criminal law terms in English, Lithuanian and Norwegian. – LSP journal – Language for special purposes, professional communication, knowledge management and cognition 15(1), 4–20.
105Terminologija | 2018 | 25 Lehecka T. 2015: Collocation and colligation. – Handbook of Pragmatics Online. J.-O. Östman, & J. Verschueren (Eds.), Amsterdam: John Benjamins Publishing Company, 1–23. Khurshid A., Rogers M. 1992: Terminology management: a corpus-based approach. – Translating and the Computer 14, 33–44. Marcinkevičienė R. 2000: Terminografija ir tekstynas. – Terminologija 6, 5–23. Mockienė L. 2016: Formation of terminology of constitutional law in English, Lithuanian and Russian. Doctoral Thesis, Vilnius: Mykolas Romeris University. Nakagawa H. 2001: Experimental evaluation of ranking and selection methods in term extraction. – Recent Advances in Computational Terminology. D. Bourigault, Ch. Jacquenim and M.-C. L’homme (Eds.), Amsterdam/Philadelphia: John Benjamins Publishing Company, 303–325. Newman J., Rice S. 2006: Transitivity schemas of English EAT and DRINK in the BNC. – Corpora in Cognitive Linguistics: Corpus-Based Approaches to Syntax and Lexis. S.T. gries and A. Stefanowitsch (Eds.), Berlin/New York: Mouton de Gruyter, 225–260. pearson J. 1998: Terms in Context, Amsterdam/philadelphia: John Benjamins publishing Company. Sinclair J. 1998: The lexical item. – Contrastive Lexical Semantics. E. Weigand (Ed.), Amsterdam: John Benjamins Publishing Company, 1–24. Zeller I. 2005: Automatinis terminų atpažinimas ir apdorojimas. Daktaro disertacija, Kaunas: Vytauto Didžiojo universitetas, Vilnius: Lietuvių kalbos institutas. FORRÁSOK Az Európai Unió Hivatalos Lapja: https://eur-lex.europa.eu/oj/direct-access.html Aᴢ ELEMZÉSHEZ HASZNÁLT SZÁMÍTÓGÉPES SZOFTVᴇR Anthony L. 2014: AntConc (3.4.4w verzió) [Számítógépes szoftver]. Tokió, Japán: Waseda Egyetem. Elérhető: http://www.antlab.sci.waseda.ac.jp Anthony L. 2017: AntpConc (1.2.0 verzió) [Számítógépes szoftver]. Tokió, Japán: Waseda Egyetem. Elérhető: http://www.antlab.sci.waseda.ac.jp Supernova-soft. NOVA Text Aligner. Elérhető a https://nova-text-aligner.soft112.com/ oldalon. AZ ANGOL, FRANCIA ÉS LITVÁN NYELV TÖBBSZAVAS, rizika SZÓT TARTALMAZÓ TERMINUSAINAK ELEMZÉSE KORPUSZLINGVISZTIKAI MÓDSZEREKKEL A tanulmány a deskriptív terminológiakutatás alapelveit, valamint a rizika szót tartalmazó többszavas terminusok empirikus vizsgálatát mutatja be. A kutatás célja, hogy korpuszlingvisztikai módszerekkel terminusokat gyűjtsön az uniós pénzügyi szakterület dokumentumkorpuszaiból, és elemezze azok formai szerkezetét. A kutatás céljaira négy korpuszt állítottak össze: egy angol (802 933 szó), egy francia (940 655 szó) és egy litván nyelvű pénzügyi dokumentumkorpuszt (639 279 szó), valamint egy angol–francia–litván párhuzamos korpuszt. A korpuszokból 210 olyan terminust gyűjtöttek, amelyekben a rizika szó a fő összetevő: 70 angol terminust, valamint ezeknek ugyanennyi francia és litván nyelvű megfelelőjét. A rizika szó választását az indokolta, hogy ez a szó mindhárom nyelv korpuszaiban a leggyakoribb volt. mos – Terminų atpažinimui ir surinkimui buvo naudojamos dvi kompiuterinės prograAntConc és AntPConc. The work was carried out in the following stages: • a terminusok magját alkotó leggyakoribb szavak meghatározása az angol, francia és litván korpuszban, valamint egyikük (a rizika szó) kiválasztása további elemzésre;
106 Oksana Smirnova Corpus-Driven Analysis of Multi-Word Terms Including • a rizika Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian szó kollokációinak, valamint a rizika fő összetevőt és annak bal, illetve jobb oldali kollokátumait tartalmazó főnévi szerkezeteknek a meghatározása az angol nyelvű korpuszban; • a többszavas terminusoknak tekinthető főnévi szerkezetek kiválasztása; • a kiválasztott angol terminusok francia és litván megfelelőinek meghatározása. Az alkalmazott módszertan lehetővé tette a többszavas terminusok eredményes összegyűjtését többnyelvű szövegkorpuszokból. Ez alapot ad annak állítására, hogy a módszertan terminusok gyűjtésére és kutatására is alkalmazható. Az összegyűjtött terminusok formális szerkezetének elemzése számos fontos terminusképzési tendenciát tárt fel a vizsgált nyelvekben: • mindhárom vizsgált nyelvben a tagok száma szerint a kéttagú terminusok alkotják a domináns terminustípust; ez azt mutatja, hogy az uniós terminusalkotók követik a nyelvi gazdaságosság elvét, és arra törekszenek, hogy a lehető legrövidebb többszavas terminusokat alkossák meg; • csak néhány angol és francia terminusnak van 2–3-nál több tagja; ezzel szemben a 4 vagy több tagból álló litván terminusok az összegyűjtött terminusok csaknem egynegyedét teszik ki; • az angol és a litván nyelv terminusképzési modelljeiben a prepozicionális és a posztpozicionális módosítás dominál, míg a francia nyelvében a posztpozicionális módosítás; • az angol és a litván nyelv terminusainak többségében a függő tagok főnevek és melléknevek, míg a francia nyelvben elöljárós szerkezetek. A formális szerkezeti elemzés eredményei olyan információkat nyújtanak, amelyek hasznosak lehetnek a terminusok alkotói és a fordítók számára. A kutatás során meghatározott szintaktikai szerkezeti modellek alkalmazhatók olyan számítógépes nyelvészeti módszerek kidolgozására, amelyek előre kiválasztott kulcsszavak nélkül automatikusan felismerik a terminusokat. received on 2018-05-21 Oksana Smirnova Mykolas Romeris University 20 Ateities St., LT-08303 Vilnius E-mail:
[email protected] Sigita Rackevičienė Mykolas Romeris University 20 Ateities St., LT-08303 Vilnius E-mail:
[email protected]