8 Oksana Smirnova Corpus-gesteuerte Analyse von Mehrwörterbegriffen Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian einschließlich Corpus-gesteuerter Analyse von Mehrwörtern Begriffe mit dem Wort "Risk" in englischer, französischer und litauischer Sprache OKSANA SMIRNOVA Universität Mykolas Romeris, Litauen SIGITA RACKEVIČIENĖ Mykolas Romeris Universität, Litauen KEYWORDS: beschreibende Terminologie, corpus-gesteuerte Analyse, finanzielle Begriffe, Begriffsaufnahme, Begriffsbildungsmuster 1. Einleitung Computertechnologien haben der sprachwissenschaftlichen Forschung neue Möglichkeiten eröffnet: digitale Corpusund Corpus-Analysesoftware erleichterten den Zugang zu den tiefsten Sprachstrukturen und -beziehungen zwischen verschiedenen Spracheinheiten und ermöglichten es, Besonderheiten ihrer Verwendung in verschiedenen Bereichen über unterschiedliche Zeiträume aufzudecken. Daher wird die corpusgesteuerte Analyse natürlicher Sprache heutzutage in einem breiten Spektrum von linguistischen Bereichen angewendet: Lexikographie, Sprachunterricht, Entwicklung der maschinellen Übersetzung, Zusammenstellung linguistischer Datenbanken usw. Die Terminologieforschung ist ebenfalls weitgehend corpusgetrieben geworden. Digitale Korporen ermöglichen es Terminologen, mit einer großen Menge an Dokumenten zu arbeiten, besondere Merkmale einer spezialisierten Sprache zu beobachten, Informationen über die tatsächliche Verwendung von Begriffen und ihre Entwicklung zu sammeln, neue Begriffe zu erfassen, die nicht intuitiv gefühlt oder vorhergesagt werden könnten, sowie eine kontrastive Analyse von Daten mehrerer Sprachen durchzuführen. Corpus-Analysesoftware, automatische und halbautomatische Begriffsextraktionswerkzeuge tragen ebenfalls zur Standardisierung der Terminologie bei. Beispielsweise kann die Häufigkeitszählung von Synonymen nologists to revise terminographical information about terms in existing nützliche Verteilungsbeweise liefern, die statistisch bevorzugte Begriffe anzeigen (Khurshid, Rogers 1992: 36). So ermöglichen digitale Korporen Termidatenbanken und aktualisieren sie ständig.
8Terminologie | 2018 | 25 According to M. Teresa Cabré, M. Amor Montané and Rogelio Nazar, Das Ziel der modernen Terminologie ist es, formale, semantische und funktionale Beschreibungen von lexikalischen Einheiten zu erzeugen, die to explain their relation with the rest of the units of the linguistic system. sowohl terminologischen Wert als auch das Objekt der Terminologieforschung haben. Das Objekt der Terminologie ist die "lebende Terminologie" (Terminologie, die natürlich in spezialisierten Texten vorkommt) und der kommunikative Aspekt der Verwendung von Begriffen, die am besten in einem Korpus instanziert werden (Cabré, Montané, Nazar 2012). Ziel, Gegenstand und Ziele der Forschung. Ziel der Forschung ist es, die Methodik der Korpuslinguistik für die Extraktion und Formalstrukturanalyse von Finanzbegriffen mit mehreren Wörtern einschließlich des Wortes "Risiko" als Hauptnamen in Englisch, Französisch und Litauisch anzuwenden. Um dieses Ziel zu erreichen, wurden die folgenden Ziele festgelegt: 1) die Grundsätze der deskriptiven Korpus-gesteuerten Terminologie einschließlich der Methoden der Kollokations-Kolligationsanalysen zu analysieren; 2) Zusammenstellung von Corpus der Rechtsakte der EU im Finanzbereich in drei Sprachen (Englisch, Französisch und Litauisch) und Auswahl der für die Corpus-gesteuerte Forschung geeigneten Software; 3) die häufigsten Wörter aus den Corpus in den untersuchten Sprachen zu extrahieren und das häufigste Schlüsselwort (Namen) für die weitere Analyse auszuwählen; 4) eine Kollokationsanalyse des ausgewählten Schlüsselworts im englischen Korpus durchzuführen und mehrwörtige Begriffe einschließlich des ausgewählten Schlüsselworts als semantisches und syntaktisches Begriffsoberhaupt aus dem englischen Korpus zu extrahieren Englisches Korpusmaterial; 5) die Schaffung von französischen und litauischen Äquivalenten der ausgewählten englischen Begriffe im parallelen englisch-französisch-litauischen Korpus; 6) eine formale strukturelle quantitative Analyse der ausgewählten Mehrwort-Begriffe durchzuführen und festzustellen, welche Modifikationsmuster und syntaktischen Strukturen der Begriffe in den untersuchten Sprachen vorherrschen. Daten und Umfang der Forschung. Für die Zwecke der Forschung drei four corpora of the EU documents of financial domain were compiled: einsprachige Corpus (Englisch, Französisch und Litauisch) und ein paralleles Corpus (EN-FR-LT). Die Größen der Corpus sind wie folgt: EN 802 933 Wörter, FR 940 655 Wörter, LT 639 279 Wörter. Insgesamt wurden 210 Finanzierungsmittel bereitgestellt.
8 Oksana Smirnova Corpus-gesteuerte Analyse von Mehrwort-Begriffen, Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian darunter allgemeine Begriffe, darunter das Wort "Risiko" als Hauptnomen, die aus den Corpus extrahiert wurden: 70 englische Begriffe und ihre Äquivalente in Französisch und Litauisch. Die Wahl des Wortes "Risiko" wurde durch die Korpusdaten bestimmt, die ergaben, dass dieses Wort in den ausgewählten EU-Dokumenten am häufigsten vorkam. 2. Theoretische Grundsätze der Forschung 2.1 Verwaltung der präskriptiven und beschreibenden Terminologie Die Entwicklung der Computertechnologien für die Natursprachenforschung unterscheidet die traditionelle Terminologie deutlich von der modernen. Die Haltung der Terminologen gegenüber der Konzeption eines Begriffs, den Begriffsquellen, der Standardisierung von Begriffen und anderen siderably. Two directions of terminology research and management have terminologischen Fragen hat sich verändert, da unterschieden wird: präskriptive Terminologie und beschreibende Terminologie (Zeller 2005; Bielinskienė et al. 2015). Die Befürworter der präskriptiven Terminologie konzentrieren sich auf die Standardisierung der Terminologie auf der Grundlage von Terminologie-Wörterbüchern, Datenbanken, Listen genehmigter Terminologie und Dokumenten über Standardisierungsgrundsätze. In der präskriptiven Terminologie basiert die Konzeption eines Begriffs auf dem Platz des von ihm beschriebenen Konzepts im konzeptionellen hierarchischen System der Domäne und seiner Beziehung zu anderen Konzepten (Pearson 1998: 10; Marcinkevičienė 2000: 6). Nach den Prinzipien der präskriptiven Terminologie sollte ein Begriff verwendet werden, um ein Konzept zu beschreiben, da eine solche Gegenseitigkeit die Wahrscheinlichkeit von Mehrdeutigkeit verringert, die Kommunikation erleichtert und gleichzeitig die Entwicklung eines konzeptuellen hierarchischen Systems eines Domänens erleichtert. Deskriptive Terminologen distanzieren sich von der strengen Haltung gegenüber der Begriffskonzeption, der Unzweideutigkeit der Begriffe, der Entwicklung eines hierarchischen Konzeptsystems und der Standardisierung. In der deskriptiven Terminologie spielt ein Kontext im Gegensatz zur präskriptiven eine wichtige Rolle bei der Analyse eines Begriffs, und ein Begriff wird als lexikalische Einheit angenommen, die von seinem Kontext abhängt. Ihr Ziel ist es nicht, einen Begriff nach bestimmten Prinzipien zu bilden, sondern seine Verwendung, die Vielfalt seiner Formen in verschiedenen Texten aufzuzeichnen und seine Besonderheiten zu beschreiben, um so eine Grundlage für seine Standardisierung zu bilden (Bielinskienė et al. 2015: 10[…]11). Die Entwicklung der Technologien führte zu einem riesigen Informationsfluss, der in verschiedenen Arten von Texten präsentiert wurde, und gleichzeitig zu einer ständig wachsenden Anzahl von Begriffen, die in ihnen verwendet werden. In dieser sich ständig verändernden Realität
9Terminologija | 2018 | 25 Nologen sind nicht mehr in der Lage, die schnelle Entwicklung der Terminologie zu kontrollieren, da sich die Begriffe schneller ändern, als sie verarbeitet werden. Daher erfordert die Verwaltung der Terminologie einen flexibleren Ansatz, der eher auf der Beschreibung als auf der Rezeptemethode basiert. Der Schwerpunkt ist von der Standardisierung der Terminologie auf die Analyse der Terminologie in Corpus (Bielinskienė und al. 2015: 11). Die beschreibende Terminologie führte zur Entwicklung der kommunikativen Terminologie-Theorie, die den Fokus auf die lebendige Terminologie legt, die in spezialisierten Diskursen verwendet wird, und den Schwerpunkt auf dem kommunikativen Aspekt der Verwendung von Begriffen legt (Cabré, Montané, Nazar 2012). Nach dieser Theorie besteht die Hauptrolle der Begriffe darin, Fachwissen zu vermitteln. Sie werden somit als ein dreigliediges Polyeder konzipiert, das eine kognitive Komponente (den Begriff), eine linguistische Komponente (den Begriff) und eine kommunikative Komponente (die Situation) hat (Cabré, Montané, Nazar 2012: 1). Terminologische Studien, die auf der kommunikativen Theorie basieren, interessieren sich nicht nur für Terminologie, die durch Standards festgelegt oder in offiziellen Datenbanken gefunden wird, sondern auch (und insbesondere) für jene Begriffe, die tatsächlich in Sprachtexten für bestimmte Zwecke verwendet werden. Somit verfolgt die kommunikative Theorie […]nicht nur einen In-vitro-Ansatz, sondern interessiert sich auch für in-vivo-Begriffe[…] (Cabré, Montané, Nazar 2012: 1[…]2). Die Erforschung der lebenden Terminologie enthüllt, dass der traditionelle Begriff der Univocität von Begriffen (eins-zu-eins-Korrespondenz zwischen einem Konzept und bestimmten Begriffen in verschiedenen Sprachen) in der realen Sprache nicht gut begründet ist. Variation (Synonymie, Mehrdeutigkeit, Periphrasen, Redundanz) ist nicht nur für allgemeine Spracheinheiten, sondern auch für die Terminologie charakteristisch. Daher müssen Konzepte und Begriffe "in ihrem dynamischen Wechselwirkung" untersucht werden (Cabré, Montané, Nazar 2012: 2 […]3). Der Schwerpunkt auf der Verwendung von Begriffen hat die Korporen zum Hauptarbeitsraum der modernen Terminologieanalyse gemacht. Digitale Corpusund Corpus-Analysesoftware haben die Terminologie mit reichhaltigen Ressourcen und Werkzeugen verbessert, die es Terminologen ermöglichen, Begriffe aus einer großen Menge von Dokumenten zu extrahieren, die neuesten Änderungen in der Terminologie eines bestimmten Bereichs zu erfassen, seine Entwicklung zu analysieren sowie konzeptionelle Verbindungen zwischen Begriffen desselben Bereichs herzustellen. Corpora ermöglichen es, zuverlässige, statistisch basierte, zuvor völlig nicht verfügbare Informationen über den Begriffsgebrauch in natürlicher Sprache zu erhalten. Daher ist die corpusgesteuerte Methodik zur vorherrschenden Methodik geworden, die ein unentbehrliches Werkzeug für die Terminologieforschung und -verwaltung bietet (Zeller 2005; Cabré, Montané, Nazar 2012; Bielinskienė et al. 2015).
9 0 Oksana Smirnova Corpus-gesteuerte Analyse von Mehrwörterbegriffen einschließlich Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian 2.2 Corpus-gesteuerte Analyseprinzipien: Collokationsund Colligationsmethoden Die Corpus-gesteuerte Terminologie-Extraktion und -analyse werden mit statistischen und linguistischen Methoden durchgeführt. In der gegebenen Forschung werden kollokale und kolligale Methoden angewendet. Collocations refer to syntagmatic attraction between lexical units. AcLaut Tomas Lehecka (2015) basiert das Konzept der Kollokation auf der Vorstellung, dass jedes Wort in einer Sprache bestimmte lexikalische Kontexte gegenüber anderen bevorzugt, d.h. dass ein bestimmtes Wort tendenziell häufiger mit bestimmten Wörtern zusammenfällt als mit anderen (Lehecka 2015: 2). Die statistische Analyse von Korpusdaten wird verwendet, um den Grad der Anziehung zwischen Wörtern zu messen, und ihre Ergebnisse ermöglichen es zu bestimmen, welche Wortkombinationen deutlich häufiger zusammen erscheinen, als es durch Zufall erwartet würde, angesichts der Gesamtfrequenz der Wörter im Korpus (Lehecka 2015: 2). Auf diese Weise werden die bedeutendsten Kollokationen der ausgewählten Wörter im analysierten Korpus festgestellt. Diese Methode wird hauptsächlich für die kontextuelle semantische Analyse von lexikalischen Einheiten verwendet, da sie es ermöglicht, die gesamte Vielfalt der zusammenvorkommenden Wörter der untersuchten Wörter zu beobachten, die vorherrschenden Zusammenvorkommungsmuster zu ermitteln und somit ihre Bedeutungen basierend auf ihrer kontextuellen Umgebung zu beschreiben (Atkins, Rundell, Sato 2003: 340[…]341). Die Collokationsanalyse ist zu einem unverzichtbaren Werkzeug für Lexikographen geworden, sie wird auch in der computergestützten Linguistik für die Zwecke der maschinellen Übersetzung, der Verarbeitung natürlicher Sprache und anderer Bereiche ausgiebig angewendet (Lehecka 2015). Die Collokationsmethode wird häufig in Kombination mit der Colligationsmethode verwendet. Das Konzept der Kolligation bezieht sich auf die Anziehung einer lexikalischen Einheit und eines grammatikalischen Musters und basiert auf der Vorstellung, dass Wörter lieber in bestimmten grammatikalischen Mustern verwendet werden und andere extended and encompass the relationship between the lexical unit and grammatikalische Muster vermeiden (Sinclair 1998; Lehecka 2015). Colligationsanalyse kann die Position in einem Satz, einer Klausel, einem Satz, einem Text oder einem Diskurs sein, in dem die lexikalische Einheit verwendet werden kann (Hoey 2005: 49 […] 52). Colligationsanalyse wurde ausgiebig in Kombination mit linguistischen Studien collocational analysis to study the meanings of near-synonyms as corpus eingesetzt und hat gezeigt, dass sie oft in verschiedenen lexikalischen und grammatikalischen Kontexten verwendet werden (Lehecka 2015). Corpus-Linguistik-Untersuchungen
9 1Terminologija | 2018 | 25 kollokale und kolligative Muster (Aston, Burnard 1998). have shown that even different senses of polysemous words may have difSo haben collocationalund colligational-Analysen bewiesen, dass Semantik und Grammatik nicht als unabhängig voneinander behandelt werden sollten, sondern in den Analysen genauso eng berücksichtigt werden sollten wie interconnected systems (Lehecka 2015). pragmatic aspect should also be collocational und colligational und verschiedene Arten von Texten (Butler 2004: preferences of a lexical unit vary significantly between different domains 157; Newman, Rice 2006). 2.3 Anwendung der Collocation-Colligation-Methode bei der Terminologie-Extraktion und -Analyse Die Collocation-Colligation-Methode kann auch zur Extraktion von Mehrwörter verwendet werden; Es ist besonders geeignet für die Extraktion von Terminologie, einschließlich vorgewählte Schlüsselwörter […] Wörter mit potenzieller terminologischer Relevanz, die für die Domäne charakteristisch sind, zu der das Korpus gehört. Diese Methodik basiert auf der Annahme, dass komplexe Begriffe aus vorhandenen einfachen Begriffen bestehen (Nakagawa 2001). Corpus-Analysetools extrahieren zusammen auftretende Wörter der vorgewählten Schlüsselwörter und ermöglichen die Ermittlung der dominierenden Kollokationen. Ein Teil dieser Kollokationen sind Substantivphrasen, die mit linguistischen Methoden aus Kollokationslisten ausgewählt werden müssen. Die ausgewählten Substantivphrasen werden zur weiteren Analyse der Corpusdaten und zur Extraktion von Mehrwort-Begriffen verwendet, die aus den ausgewählten Substantivphrasen und möglicherweise zusätzlichen Collocates bestehen. In der gegebenen Forschung werden die extrahierten Begriffe unter Verwendung von Colligationsanalyseprinzipien weiter analysiert, um formale Strukturmodelle der Terminologie in den untersuchten Sprachen aufzudecken und zu kontrastierenden mehrsprachigen Studien von Begriffsbildungsmustern beizutragen (vgl. Janulevičienė, Rackevičienė 2014; Mockienė 2016). 3. Entwicklung der Korpora und der Auswahl Der Zweck der Zusammenstellung eines Korpus von Dokumenten eines According to M. Teresa Cabré, M. Amor Montané and Rogelio Nazar, bestimmten Bereichs ist dreierlei. Erstens müssen sich die Terminologen mit der Typ-Minologie-Extraktion vertraut machen und statistische of language of the domain; secondly, a corpus is needed to perform terAnalysen der Begriffe durchführen. und
2 Oksana Smirnova Corpus-Driven Analysis of Multi-Word Terms Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian Einschließlich werden schließlich Texte verwendet, um ergänzende Informationen über die Begriffe wie semantische, syntaktische oder kollokale Hinweise zu erhalten (Cabré, Montané, Nazar 2012: 3[…]4). Der zusammengestellte Korpus sollte von ausreichender Größe und Qualität sein, um als repräsentativ für den gewählten Bereich angesehen zu werden. Es gibt keine präzisen Anforderungen an die Größe eines Korpus. aber es sollte so viele Dokumente wie möglich enthalten, denn je größer es ist, desto zuverlässigere Schlussfolgerungen über die Terminologie Verwendung in der Domäne gemacht werden können (Cabré, Montané, Nazar 2012: 4). Unter Berücksichtigung all dieser Aspekte wurden die Korporen der EU-Rechtsakte in englischer, französischer und litauischer Sprache zusammengestellt. Die Rechtsakte wurden aus dem Amtsblatt der Europäischen Union heruntergeladen, der eine frei zugängliche Online-Quelle ist. 101 Rechtsakte zu finanziellen Fragen der EU, die im Zeitraum 2014-2017 erlassen wurden, wurden gesammelt. Die Dokumente wurden in Klartext umgewandelt und für die Extraktion von Begriffen und ihre Analyse ausgerichtet. Drei Programme wurden verwendet, um die Texte zu kompilieren, auszurichten und die notwendigen Daten daraus zu extrahieren: AntConc (2014), AntPConc (2017) von Laurence Anthony erstellt und zertifiziert und NOVA Text Aligner (2014). AntConc ist ein Freeware-Multiplattform-Toolkit für die Durchführung von Korpus-Linguistik-Forschung und datengesteuertem Lernen, während AntPConc für die Erstellung eines parallelen Korpus mehrerer Sprachen gedacht ist. Beide Programme ermöglichen es dem Forscher, mit einer großen Menge an Daten umzugehen und eine umfassende mehrsprachige linguistische Analyse durchzuführen. Die Tools, die vom AntConc-Programm für die Benutzer zur Verfügung gestellt werden, sind die folgenden: Wortliste, Collocates, Cluster, Schlüsselwörter, Konkordanz, Konkordanzplot, Dateivorschau-Tool. In der gegebenen Forschung wurden vier Werkzeuge von AntConc angewendet: • Wortliste, mit der die häufigsten Wörter in den Corpus ermittelt werden können; • Collocates enabled to determine the dominant collocates of the Wort "Risiko" und messen den Grad ihrer syntagmatischen Anziehungskraft auf das Wort "Risiko"; • Cluster dürfen die dominierendsten mehrwörtlichen Begriffe mit dem Wort "Risiko" als Hauptnamen angeben; • Concordances gave a wide variety of samples illustrating the usage der Begriffe in den Texten. Der Schnappschuss des AntConc-Programms ist in Abbildung 1 dargestellt.
3Terminologie | 2018 | 25 Bevor ein paralleles Korpus erstellt wurde, wurden die heruntergeladenen Texte in drei Sprachen manuell mit Hilfe des Programms NOVA Text Aligner ausgerichtet. Nach der Ausrichtung der Texte wurde mit dem AntpConc-Programm ein paralleles Korpus erstellt (siehe Abbildung 2). Abbildung 2. AntPConc-Programm Abbildung 1. AntConc-Programm
9 Oksana Smirnova Corpus-Gestützte Analyse von Mehrwörterbegriffen Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian einschließlich Das AntpConc-Programm ermöglichte es, die Beispiele aus drei Sprachen gleichzeitig darzustellen: Man konnte auf einen gewählten Satz klicken, um die Äquivalente in anderen Sprachen zu sehen. Das Programm ermöglichte auch die Unterscheidung der Schlüsselwörter und ihrer linken oder rechten Platzierung durch die Verwendung verschiedener Farben. Es war jedoch nicht möglich, das Dokument zu sehen, aus dem das Beispiel entnommen wurde. Anhand des parallelen Korpus wurden französische und litauische Äquivalente von 70 englischen Begriffen extrahiert. 4. CORPUS-Analyse und Verwendung der Begriffsentnahme Die Werkzeuge der Programme AntConc und AntpConc 4.1 Ermittlung der häufigsten Wörter in den Corpus Um die häufigsten Wörter im Korpus der Finanzdokumente zu ermitteln, wurde das Werkzeug Word-Liste des Programms AntConc verwendet. Es lieferte die Ergebnisse der Wortfrequenz in den englischen, französischen und litauischen Corpus, die es ermöglichte, die Wortfrequenz in den untersuchten Sprachen zu vergleichen und eine dreisprachige Liste der zehn häufigsten Wörter zu erstellen (siehe Tabelle 1). Die Wortliste lieferte auch Informationen über die Anzahl der Wortzeichen und Worttypen in den Corpus und gab Zugang zum Kontext, in dem die Begriffe verwendet wurden (siehe Tabelle 1). Tabelle 1 Die zehn häufigsten Wörter in den Corpus EN (Korpus) 802 933 Wort LT Token, 933 24727 Wortarten FR (Corpus 940 655 Wortmarken, 12365 Wortarten) (Corpus 639 279, Wortarten) 1. Risiken (3252), Risiken (1063), Risiken (2855), Risiken (592) Risiken Risiken (2549), (997) (536), Risiken (355), Risiken (4) 2. Kredit (3183), Kredit (3307), Kredit Kreditas (8), Kreditai (6), Kreditais (3103), Kreditų (52), Kreditkredite (4), Kreditus (3), Kreditams (2) (18) Kredite (222) (29), Kredit (28), 3. Markt (1643), Markt (1631), (229), Markt (226), Markt (76), Märkte (1355), Rinkų (310), Rinkose (75), Rinkais (51), Rinkmärkte (424) Marches (484) Rinkoms (182), Rinkas (7), Rinkomis (2)
101Terminologie | 2018 | 25 Tabelle 6. Syntaktische Strukturen der postnominalen Modifikationsmuster der Begriffe Syntatische Strukturen EN FR LT Risiko + S. 13 Begriffe, z. Risiko des Instituts, Konzentrationsrisiko, Modellrisiko B.: 22 Begriffe, z. B.: Kreditrisiko, Risiko für Verlustrisiko, das Finanzsystem, Risiko + A 20 Risiko innerhalb Begriffe, z. B. : des Fahrzeugs, spezifisches Risiko risiko intern, Risiko + A + pp spezifisches 4 Begriffe, z. B. : Korrelationsrisiko, Korrelationsrisiko, allgemeines Korrelationsrisiko signifikantes Risiko + pp + A 15 Begriffe, z. B. spezifisches Kreditrisiko über erste Materie tägliches Kreditrisiko, Risiko Risiko + + pp risque de crédit pp + A + 9 Begriffe, z. B. : […] intrajournalier à 24h risque de liquidité 24h, intrajournalier à Diagramm 1. Modifikationsmuster der Begriffe
Oksana Smirnova Corpus-Driven Analysis of Multi-Word Terms Including Die Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian Ergebnisse zeigen, dass die pränominalen Modifikationen in der englischen und litauischen Sprache dominieren, während die postnominalen Modifikationen für die französische Sprache charakteristisch sind. In der litauischen Sprache found in French, and no terms of postnominal modification patterns were wurden keine Präminalmodifikationsmuster festgestellt. Nur englische Begriffe number of terms with postnominal modifiers is rather low. waren von beiden Typen, obwohl alle untersuchten Begriffe einen oder mehrere Modifikatoren enthalten, die Substantiven, Adjektive oder Präpositionsphrasen sind, die in den terminologischen Einheiten unterschiedliche Positionen einnehmen. Die Ergebnisse der Analyse zeigen, dass die dominierenden Modifizierer der englischen und litauischen Begriffe Substantiven und Adjektive sind, während das Wort "Risiko" in den französischen Begriffen hauptsächlich durch Präpositionsphrasen modifiziert wird. Die Begriffe mit drei oder mehr Wörtern können weiter nach ihren Modifikationsstufen klassifiziert werden (begriffe mit Modifikatoren, die das Hauptnamen modifizieren, und Begriffe mit Modifikatoren, die andere Modifikatoren modifizieren), aber aufgrund des begrenzten Raumes wird diese Analyse in diesem Papier nicht vorgestellt. Die in den Tabellen zusammengefassten Ergebnisse zeigen auch, dass sich die Begriffe in der Anzahl ihrer Bestandteile unterscheiden. Die quantitative Analyse der Wortlänge wurde durchgeführt, um die vorherrschende Anzahl der Wortbestandteile in den untersuchten Sprachen festzustellen. Die Ergebnisse sind in Abbildung 2 dargestellt. Das Diagramm zeigt zwei Haupttendenzen. Erstens respektieren die EU-Terminentwickler die Hauptanforderung der Sprachökonomie (Kurzheit der Begriffe): Zweisprachige Begriffe sind in allen drei Sprachen weit verbreitet. Zweitens haben nur wenige englische und französische Begriffe mehr als 2-3 Wörter, während in Diagramm 2 Anzahl der
103Terminologie | 2018 | 25 Litauische Begriffe mit vier oder mehr Wörtern bilden einen bedeutenden Teil der ausgewählten Daten (17 von 70). The tendency of prevalence of two-word terms coincides with the tenBegriffsbestandteile, die von anderen Terminologieforschern festgelegt wurden. Die Forschung über die automatische Extraktion und Definition von by Agnė Bielinskienė et al. revealed that most Lithuanian terms of this Bildungsund Wissenschaftsterminologie-Domänen sind Zwei-Wort-Begriffe: sie bildeten mehr als zwei Drittel der aus dem Begriff Kandidaten ausgewählten specialised corpus (Bielinskienė et al. 2015: 62). The contrastive research Begriffe, die automatisch aus einer auf Verfassungsrecht-Terminologie von Liudmila Mockienė extrahiert wurden, enthüllten die gleiche Tendenz in drei verschiedenen Sprachen. In den untersuchten englischen, russischen und litauischen Rechtsakten verfassungsrechtlicher Art bestand die Mehrheit der extrahierten Mehrwort-Begriffe aus zwei Bestandteilen: sie machten 78,5% der englischen Mehrwort-Begriffe, 62% der russischen Mehrwort-Begriffe und 74,5% der litauischen Mehrwort-Begriffe aus (Mockienė 2016: 43-45). Daher neigen Entwickler von Begriffen verschiedener Domänen und verschiedener Sprachen dazu, sich an das gleiche Prinzip der Sprachökonomie und Benutzerfreundlichkeit zu halten. 6. Schlussfolgerungen Die Software AntCont, die für die monolinguale Corpus-Analyse verwendet wird, und AntpConc, die für die parallele Corpus-Analyse verwendet wird, ermöglichten die Extraktion von englischen, französischen und litauischen Mehrwort-Begriffen, einschließlich des Wortes "Risiko" als Hauptnamen, aus den spezialisierten Corpus der für die Zwecke der Forschung zusammengestellten EU-Dokumente im finanziellen Bereich. Die Extraktion erfolgte in den folgenden Phasen: • die Schlüsselwörter der englischen, französischen und litauischen Corpus (die Wörter mit potenzieller terminologischer Relevanz, die für die Domäne charakteristisch sind, die die Corpus repräsentieren) zu extrahieren und das häufigste Schlüsselwort (das Wort "Risiko") für die weitere Analyse zu wählen; • die Extraktion von Zusammenstellungen des Wortes "Risk" und Substantivphrasen, einschließlich des Wortes "Risk", da das Hauptsubstantiv mit links und/oder rechts aus dem englischen Korpus zusammenfällt; • Auswahl von lexikalischen Einheiten, die einen terminologischen Wert haben, aus der Liste der extrahierten Substantivphrasen; • Erstellung französischer und litauischer Äquivalente der ausgewählten englischen Begriffe im parallelen englisch-französisch-litauischen Korpus.
104 Oksana Smirnova Corpus-gesteuerte Analyse mehrwörtlicher Begriffe Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian einschließlich Die angewandte Methodik erwies sich als geeignet für eine effektive mehrsprachige Extraktion von Terminologie, die zur Entwicklung/Aktualisierung von Terminobasen oder zur wissenschaftlichen Analyse von Begriffen verwendet werden kann. Die formale Strukturanalyse der extrahierten Begriffe ergab einige wichtige term formation tendencies in the investigated languages: • die pränominalen Modifikationen sind in der englischen und litauischen Sprache vorherrschend, während die postnominalen Modifikationen für die englische und litauische Sprache charakteristisch sind. Französische Sprache; • die dominierenden Modifikatoren der englischen und litauischen Begriffe sind Substantiven und Adjektive, während das Wort "Risiko" in den französischen Begriffen hauptsächlich durch Präpositionsphrasen modifiziert wird; • die vorherrschende Begriffsart nach der Anzahl der Bestandteile sind Zweewort-Begriffe - sie bilden die größte Anzahl der Begriffe in den TOP-70-Listen in Englisch, Französisch und Litauisch; Das zeigt, dass die EU-Terminentententwickler die Hauptanforderung der guage economy (brevity of terms); • nur wenige englische und französische Begriffe haben mehr als 2-3 Wörter, während in der litauischen TOP 70-Liste Begriffe mit 4 oder mehr Wörtern einen bedeutenden Teil der ausgewählten Daten bilden (17 von 70). Die Ergebnisse der formalen Strukturanalyse offenbaren Trends in der Begriffsbildung in den untersuchten Sprachen und liefern terminologische Informationen, die für Begriffsentwickler und Übersetzer nützlich sein könnten. Die in der Forschung ermittelten syntaktischen Muster können für die Entwicklung automatischer linguistischer Methoden der Begriffsauswahl ohne vorher gewählte Schlüsselwörter verwendet werden. REFERENCES Aston g., Burnard L. 1998: The BNC Handbook. Exploring the British National Corpus with SARA, Edinburgh: Edinburgh University press. Atkins S., Rundell M., Sato H. 2003: The contribution of FrameNet to practical lexicography. – Internation al Journal of Lexicography 16(3), 333–357. Bielinskienė A., Boizou L, Grigonytė G., Kovalevskaitė J., Rimkutė E., Utka A. 2015: Lietuvių kalbos terminų automatinis atpažinimas ir apibrėžimas. Monografija, Kaunas: Vytauto Didžiojo universitetas. Butler C. S. 2004: Corpus studies and functional linguistic theories. – Functions of Language 11(2), 147–186. Cabré M. T., Montané M. A., Nazar R. 2012: Corpus-based Terminology Processing. TKE 2012 Tutorial. Available at http://terminus.iula.upf.edu/tke2012/. hoey M. 2005: Lexical Priming: A New Theory of Words and Language, London: Routledge. Janulevičienė V., Rackevičienė S. 2014: Formation of criminal law terms in English, Lithuanian and Norwegian. – LSP journal – Language for special purposes, professional communication, knowledge management and cognition 15(1), 4–20.
105Terminologija | 2018 | 25 Lehecka T. 2015: Collocation and colligation. – Handbook of Pragmatics Online. J.-O. Östman, & J. Verschueren (Eds.), Amsterdam: John Benjamins Publishing Company, 1–23. Khurshid A., Rogers M. 1992: Terminology management: a corpus-based approach. – Translating and the Computer 14, 33–44. Marcinkevičienė R. 2000: Terminografija ir tekstynas. – Terminologija 6, 5–23. Mockienė L. 2016: Formation of terminology of constitutional law in English, Lithuanian and Russian. Doctoral Thesis, Vilnius: Mykolas Romeris University. Nakagawa H. 2001: Experimental evaluation of ranking and selection methods in term extraction. – Recent Advances in Computational Terminology. D. Bourigault, Ch. Jacquenim and M.-C. L’homme (Eds.), Amsterdam/Philadelphia: John Benjamins Publishing Company, 303–325. Newman J., Rice S. 2006: Transitivity schemas of English EAT and DRINK in the BNC. – Corpora in Cognitive Linguistics: Corpus-Based Approaches to Syntax and Lexis. S.T. gries and A. Stefanowitsch (Eds.), Berlin/New York: Mouton de Gruyter, 225–260. pearson J. 1998: Terms in Context, Amsterdam/philadelphia: John Benjamins publishing Company. Sinclair J. 1998: The lexical item. – Contrastive Lexical Semantics. E. Weigand (Ed.), Amsterdam: John Benjamins Publishing Company, 1–24. Zeller I. 2005: Automatinis terminų atpažinimas ir apdorojimas. Daktaro disertacija, Kaunas: Vytauto Didžiojo universitetas, Vilnius: Lietuvių kalbos institutas. Quellen Amtsblatt der Europäischen Union: https: eur-lex.europa.eu/oj/direct-access.html COMPUTER SOTFWARE uSED FOR THE ANALYSiS Anthony L. 2014: AntConc (Version 3.4.4w) [Computer-Software]. Tokio, Japan: Die Universität Waseda. Erhältlich unter http: www.antlab.sci.waseda.ac.jp Anthony L. AntpConc (Version 1.2.0) [Computer Software 2017:]. Tokio, Japan: Die Universität Waseda. Erhältlich unter www.antlab.sci.waseda.ac.jp Supernova-soft. NOVA-Text-Aligner. Das ist ein Text-Aligner. Erhältlich unter https: www.nova-text-aligner.soft112.com. ANGLUS, PRANCūzų iR LiETuvių KALbų DAugiAžODžių TERMINų Su žODžiu rizika ANALizė TEKSTYNų LiNgviSTiKOS METODAiS pristatyje Straips empiromi deskriptyviosios terminologijos principai bei daugiažodžių terminų su žodžiu tyrimas, kurio tyrimo tikslas taikant tekstynų lingvistikos metodus, surinkti terminus iš finansų srities ES dokumentų tekstynų ir jų formali sandaros analizę atlikti. Tyrimo tikslams buvo sukaupti keturi tekstynai: finansų srities dokumentų anglų kalba (802 933 žodžiai), prancūzų kalba (940 655 žodžiai) ir lietuvių kalba (639 279 žodžiai) bei lygiagretusis anglųprancūzųlietu kalbų tekstynas. Iš tekstynų surinkta 210 terminų, kuriuose žodis rizika eina pagrindiniu dėmeniu: 70 englische terminų ir po tiek pat jų atitikmenų prancūzų ir lietuvių kalbomis. Žodžio rizika pasirinkimą lėmė tai, kad šis žodis waren dažniausias aller drei kalbų tekstynuose. mos […] AntConc ir AntPConc. Dirbta Terminų atpažinimui ir surinkimui buvo naudojamos dvi kompiuterinės progratokiais etapais: • dažniausių žodžių, galinčių būti terminų branduoliu, angliškame, prancūziškame ir lietuviškame tekstynuose nustatymas ir vieno iš jų (žodžio rizika) atrinkimas tolesnei analizei;
106 Oksana Smirnova Corpus-Driven Analysis of Multi-Word Terms Including • Wortžio Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian rizika kolokacijų ir daiktavardinių junginių su pagrindiniu dėmeniu rizika ir jo kairiaisiais bei dešiniaisiais kolokatais nustatymas angliškame tekstyne; • daiktavardinių junginių, laikytinų daugiažodžiais terminais, atrinkimas; • Atrinktų angliškų terminų prancūziškų ir lietuviškų atitikmenų nustatymas. (Atrinktų englischen Terminų prancūziškų ir lietuviškų atitikmenų nustatymas.) Pritaikyta metodologija leido rezultatyviai surinkti daugiažodžius terminus iš daugiakalbių tekstynų. Pritaikyta metodologija leido rezultatyviai surinkti daugiažodžius terminus iš daugiakalbių tekstynų. Tai duoda pagrindą teigti, kad ji gali būti taikoma terminų kaupimui bei tyrimams. Die formalen Sandaros-Analysen enthüllen einige der wichtigen Termine der Darybos-Tendenzen, die sich auf die Kalbose beziehen: • vyraujantis terminų tipas pagal dėmenų skaičių visose trijose tiriamose kalbose yra dvižodžiai terminai; tai, kad rodo ES terminų kūrėjai laikosi kalbos ekonomijos principo ir stengiasi kurti kuo trumpesnius daugiažodžius terminus; • tik keletas angliškų ir prancūziškų terminų turi daugiau kaip 23 dėmenis; tuo tarpu lietuviški terminai, susidedantys iš 4 ir daugiau dėmenų, sudaro beveik ketvirtadalį surinktų terminų; • englisch und litauisch-kalbische Terminus darybos modeliuose vyrauja prepozicinė ir postpozicinė modifikacija, o prancūzų kalbos postpozicinė modifikacija; • englische und litauische Kalb-Terminus-Abhangomieji dėmenys sind daiktavardžiai und būdvardžiai, o prancūzisches kalboje prielinksninės konstrukcijos. Die Ergebnisse der formalen Sandarosanalysen liefern Informationen, wie es sein kann, dass die Terminus für die Anwender und Verleger genutzt werden. Tyrimo metu nustatyti sintaksinių struktūrų modeliai gali būti taikomi, kuriant kompiuterinius lingvistinius metodus automatiniam terminų atpažinimui be iš anksto pasirinktų raktinių žodžių. Gauta 2018-05-21 (englisch) Oksana Smirnova Mykolo Romerio Universität Ateities g. 20, LT-08303 Vilnius E. Paštas
[email protected] Sigita Rackevičienė Mykolo Romerio Universität Ateities g. 20, LT-08303 Vilnius E. paštas
[email protected]