scieee AI-readable full text Open interactive document viewer

Extracting Lexical Units for Identifying Specialized Semantic Frames

Ana Ostroški Anić; Maja Lončar; Martina Pavić

Abstract

    The paper discusses the idea of using parallel corpora for the extraction of terminological units used to identify semantic frames of aviation, as the first step in developing a method for determining specialized semantic frames. The process of compiling the parallel corpus of texts taken from the Eur-Lex database using Sketch Engine tools is described first. The methodology of extracting term candidates and their manual verification is then presented, as well as the process of extracting and verifying relevant verbs. The results of term verification are discussed, with the focus on the role of verbs and verbal collocations in identifying relevant semantic frames and frame elements.

Full text

7 3Terminologija | 2019 | 26 doi.org/10.35321/term26-04 Extracting Lexical Units for Identifying Specjalistyczne ramy semantyczne1 AnA OstrOški Anić Instytut Języka i Językoznawstwa Chorwackiego MAjA LOnčAr Instytut Języka i Językoznawstwa Chorwackiego MArtinA PAvić Instytut Języka i Językoznawstwa Chorwackiego AbStrAct artykuł omawia ideę wykorzystania korpusów równoległych do ekstrakcji jednostek terminologicznych używanych do identyfikacji ram semantycznych lotnictwa jako pierwszy krok w opracowaniu metody wyznaczania specjalistycznych ram semantycznych. Najpierw opisano proces kompilacji korpusu równoległego tekstów zaczerpniętych z bazy danych Eur-Lex przy użyciu narzędzi Sketch Engine. Następnie przedstawiono metodologię ekstrakcji kandydatów na terminy i ich ręcznej weryfikacji, a także proces ekstrakcji i weryfikacji odpowiednich czasowników. Omówiono wyniki weryfikacji terminów, koncentrując się na roli czasowników i kolokacji czasownikowych w identyfikowaniu odpowiednich ram semantycznych i elementów ram. Słowa kluczowe: terminologia lotnicza, korpus angielsko-chorwacki, ramy semantyczne, wiedza specjalistyczna, terminologia. AnotAcIjA W artykule rozważa się, w jaki sposób korpusy równoległe mogą być wykorzystywane do wyodrębniania jednostek terminologicznych stosowanych do identyfikacji semantycznych ramek lotniczych. Jest to pierwszy etap opracowywania metody identyfikacji specjalistycznych ramek semantycznych. Najpierw opisano, w jaki sposób na podstawie bazy danych Eur-Lex i przy użyciu narzędzi Sketch Engine tworzony jest korpus równoległy. Następnie przedstawiono metody wyodrębniania wariantów terminów i ich ręcznej weryfikacji oraz 1 niniejszy artykuł opiera się na referacie „From parallel corpora to specialized semantic frames”, wygłoszonym podczas 3. międzynarodowej konferencji na temat terminologii Scientific, Administrative and Educational Dimensions of Termin ology w Wilnie w dniach 17–18 października 2019 r. Praca ta była w pełni finansowana przez Chorwacką Fundację Nauki w ramach projektu HrZZ-UIP-2017-05-7169. 7 4 Ana Ostroški Anić Extracting Lexical Units for Identifying proces selekcji i weryfikacji Maja Lončar Specialized Semantic Frames Martina Pavić odpowiednich czasowników. Omawiając wyniki weryfikacji terminów, szczególną uwagę poświęca się roli czasowników i połączeń wyrazowych, określa się odpowiednie ramy semantyczne i ich elementy. słowa kluczowe: terminologia lotnicza, korpus języka angielskiego i chorwackiego, ramy semantyczne, wiedza specjalistyczna, terminologia. WproWADzenIe Teoria semantyki ram (Fillmore 1976, 1982) znalazła liczne zastosowania w leksykografii i lingwistyce komputerowej, z których najbardziej znaną jest z pewnością baza wiedzy leksykalnej Framenet (Fillmore et al. 2003; ruppenhofer et al. 2017). Prace nad odwzorowaniem relacji między składnią a semantyką, czym zasadniczo jest Framenet, nie tylko zainspirowały podobne projekty dotyczące języków innych niż angielski, lecz także utorowały drogę badaniom nad wiedzą specjalistyczną i organizacją kategorii wiedzy specjalistycznej na podstawie ram semantycznych. niezależnie od tego, czy ściśle stosują metodologię Framenet, czy też wykorzystują zmodyfikowane podejście do identyfikowania i wyodrębniania ram semantycznych jako typów kategorii, projekty tworzone w celu opracowania zasobów przeznaczonych dla wyspecjalizowanych wspólnot wiedzy musiały uwzględniać specyfikę terminologii i języków do celów specjalistycznych w przeciwieństwie do języka ogólnego i jego użycia (Faber et al. 2006; 2009; L’Homme 2012). nie opracowano dotąd zasobu leksykalnego dla języka chorwackiego, który byłby całkowicie oparty na metodologii i inwentarzu semantycznym Framenet. niektóre ramy semantyczne zdefiniowano w ramach większej bazy danych metafor konceptualnych w języku chorwackim (Despot et al. 2019). Jednak baza danych ram semantycznych lotnictwa, opracowywana w ramach projektu badawczego Dynamicity of Specialized Knowledge Categories (DIKA, ihjj.hr/dika), jest pierwszą próbą stworzenia takiej wyspecjalizowanej bazy danych dla języka chorwackiego. projekt zajmuje się opisem poziomów konceptualnego i językowego wyspecjalizowanych kategorii wiedzy w ramach dynamicznej natury ram semantycznych. głównym rezultatem projektu jest wielojęzyczna terminologiczna baza danych, w której terminologia lotnicza jest definiowana w ramach semantycznych, obejmujących elementy ram, relacje konceptualne oraz terminologiczne jednostki figuratywne i frazeologiczne. Na potrzeby analizy semantycznej i syntaktycznej opracowano równoległy korpus tekstów angielskich i chorwackich z dziedziny ruchu lotniczego, który posłuży jako 7 5Terminologija | 2019 | 26 punkt wyjścia do ekstrakcji terminów i analizy terminów. Podobszar ten omawia ideę wykorzystania korpusów równoległych of air traffic has been chosen as the most representative aspect of the vast and interdisciplinary field of aviation. do ekstrakcji jednostek terminologicznych odnoszących się do określonych ram semantycznych lotnictwa, jako pierwszy etap opracowywania metody określania ram semantycznych i ich relacji konceptualnych w dziedzinie lotnictwa. Chociaż korpusy równoległe od dawna uznaje się za nieocenione źródła kandydatów na terminy do budowy różnego rodzaju zasobów specjalistycznych (Vintar 2000), dotychczas były one w niewielkim stopniu wykorzystywane w badaniach stosowanych odnoszących się do semantyki ramowej.2 Najpierw opisano proces kompilacji równoległego korpusu tekstów pobranych z bazy Eur-Lex przy użyciu narzędzi Sketch Engine. Następnie przedstawiono metodologię ekstrakcji kandydatów na terminy i ich ręcznej weryfikacji, a także proces ekstrakcji i weryfikacji odpowiednich czasowników. Przedstawiono i skomentowano wyniki weryfikacji terminów, po czym omówiono potencjalne wykorzystanie czasowników i kolokacji werbalnych w identyfikowaniu odpowiednich ram semantycznych i elementów ram w dziedzinie lotnictwa.3 1. pODStAwY tEoReTyCzNe We współczesnych środowiskach terminologicznych i LSP zasoby wiedzy specjalistycznej nie są już budowane wyłącznie wokół opisu relacji hierarchicznych, ponieważ uważa się, że nie odzwierciedlają one dynamicznej natury kategorii wiedzy (Faber et al. 2006; 2009; L’Homme, robichaud 2014). Co więcej, formalne rozróżnienie między słownikiem a leksykonem, na którym opiera się cała tradycyjna terminografia, wydaje się zacierać, ponieważ coraz więcej zasobów specjalistycznych wykorzystuje metody kompilacji i prezentacji wiedzy stosowane wcześniej przy tworzeniu zasobów języka ogólnego (L’Homme et al. 2016; L’Homme 2018). Zasoby leksykalne i semantyczne budowane na założeniach semantyki ramowej definiują wiedzę w kategoriach ram semantycznych jako rodzaju dynamicznych kategorii złożonych elementów i wzajemnych relacji. Każda rama semantyczna jest definiowana jako typ zdarzenia lub stanu wraz z jego uczestnikami, nazywanymi elementami ramy (FE). Ramy semantyczne są przywoływane przez 2 Korpusy równoległe z pewnością w pełni wykorzystałyby swój potencjał przy tworzeniu wielojęzycznych repozytoriów leksykalnych opartych na ramach semantycznych (boas 2005). 3 Dziękujemy anonimowym recenzentom za ich nieocenione uwagi i sugestie. 7 6 Ana Ostroški Anić Ekstrakcja jednostek leksykalnych W celu identyfikacji Maja Lončar Specialized Semantic Frames Martina Pavić jednostek leksykalnych, tj. słów w języku codziennym lub terminów w wiedzy specjalistycznej, które ucieleśniają elementy ramy. podstawowym kryterium odróżnienia jednej ramy od innej jest to, że wszystkie jednostki leksykalne powinny „przywoływać ten sam typ zdarzenia i dzielić ten sam inwentarz oraz konfigurację FE” (ruppenhofer et al. 2017: 384–385). ta metoda ustalania zakresu ram semantycznych i ich definicji mogłaby jednak zostać uznana za arbitralną, ponieważ nie wymaga wcześniejszego „przeglądu” dostępnych danych leksykalnych. Ponieważ wiele ram ma kompozycję przypominającą scenariusz, ich opis zwykle zaczyna się od wyboru odpowiednich czasowników (ruppenhofer et al. 2010), do których dodaje się właściwe argumenty zgodnie z adnotacją przykładów wyodrębnionych z korpusu. Chociaż jednostki leksykalne i elementy ramy są definiowane zgodnie z analizowanymi danymi korpusowymi, ramy semantyczne są mimo to w większości identyfikowane i nazywane intuicyjnie. Przy identyfikowaniu ram semantycznych pewnej wyspecjalizowanej dziedziny wiedzy bardziej odpowiednie byłoby najpierw wyznaczenie zakresu definiowanej wiedzy, co w pracy terminologicznej odbywa się poprzez identyfikację kluczowych pojęć i relacji pojęciowych w danej dziedzinie. badania terminologiczne ściśle śledziły rozwój językoznawstwa w ciągu ostatnich dwóch dekad i przesunęły swój teoretyczny punkt ciężkości na analizę procesów i zdarzeń jako bardziej dynamicznych struktur specjalistycznej wiedzy. dlatego stało się jasne, że terminy predykatywne (czasowniki, przymiotniki, przysłówki i pewne rzeczowniki) często oznaczają kluczowe pojęcia terminologii danej dziedziny (L’Homme 1998; Pimentel 2012; L’Homme, robichaud 2014). Na przykład terminy communicate, fly, take off i transport są zazwyczaj obecne w dziedzinie lotnictwa, podobnie jak terminy określające szereg procedur, które ontologicznie definiujemy jako procesy lub działania. Chociaż pojęcie terminologiczności jest dość dobrze rozumiane wśród terminologów, jeśli chodzi o określanie poziomu pojęciowego terminów, kryteria wyboru typów jednostek leksykalnych, które powinny zostać uwzględnione jako terminy w zasobie terminologicznym, nadal różnią się w zależności od analizowanej dziedziny i zastosowanych ram teoretycznych. Kryteria definiowania typów czasowników niosących znaczenie specjalistyczne, zaproponowane przez L’Homme (1998, 2015), są najczęściej przywoływane w literaturze terminologicznej, obok kryteriów Lorente i jej typologii czasowników w dyskursie specjalistycznym (2002, 2007). L’Homme wyróżnia trzy typy czasowników w tekstach specjalistycznych: czasowniki specyficzne dla 7 7Terminologija | 2019 | 26 guage.4 Czasowniki należące do pierwszego i drugiego typu można oznaczyć jako terminy, lecz czasowniki drugiego typu stanowią ciekawszą grupę do analizy terminologicznej, ponieważ zdarzają się przypadki, gdy nie jest jasne, czy znaczenie różni się wystarczająco od kanonicznego lub domyślnego ogólnego znaczenia słownikowego czasownika. określonej dziedziny (np. land, take off), czasowniki, które nabierają znaczenia specjalistycznego w danej dziedzinie (np. operate), oraz czasowniki ogólne lanthe criteria for deciding whether a verb takes on a new, specialized meaning in a given context should yet be more precisely defined. Kryteria decydowania o tym, czy czasownik można sklasyfikować jako termin, zależą, według L’Homme (1998, 2015), od jego argumentów oraz jego morfologicznej i semantycznej relacji do jednostek leksykalnych o tym samym znaczeniu, które definiuje się jako terminy. Krótko mówiąc, jeśli czasownik ma argumenty zdefiniowane jako terminy, prawdopodobnie sam jest terminem, jak w zdaniu Pilot pilotuje helikopter. Ponadto, jeśli rzeczownik takeoff jest zdefiniowany jako termin, czasownik take off również powinien być tak zdefiniowany. Zastosowaliśmy te kryteria w naszej analizie wyekstrahowanych czasowników, o której więcej powiedziano w sekcji 4. 2. MEtHoDS Aby opracować poprawną metodologię identyfikowania wyspecjalizowanych ramek semantycznych, należało podjąć kilka kroków. Po pierwsze, utworzono równoległy korpus angielsko-chorwacki. drugi etap obejmował ekstrakcję terminów i walidację list kandydatów na terminy. trzeci etap obejmował wyodrębnienie listy czasowników i analizę ich kolokacji mających znaczenie specjalistyczne. 2.1. Kompilacja korpusu korpus skompilowano na podstawie Katalogu aktów prawnych Unii Europejskiej, rozdział Polityka transportowa, podrozdział Transport lotniczy w języku angielskim i chorwackim. Spośród 220 dokumentów z podrozdziału Transport lotniczy wybrano 178 aktów prawnych posiadających wersje językowe zarówno w języku angielskim, jak i chorwackim. Teksty pobrano z bazy danych EUr-Lex,5 a następnie wprowadzono do modułu kompilacji korpusu Sketch Engine.6 Najprostszym sposobem utworzenia korpusu równoległego w Sketch Engine jest przesłanie danych 4 L’Homme (2015) dodatkowo klasyfikuje czasowniki języka ogólnego na czasowniki pomocnicze (za Leratem 2002) i czasowniki dyskursywne (zgodnie z klasyfikacją Lorente z 2002 roku). Zob. Pimentel (2017), gdzie przedstawiono najnowsze rozwinięcie tych dwóch podejść do typologii czasowników w tekstach specjalistycznych. 5 Dostępne pod adresem: https://eur-lex.europa.eu/browse/directories/legislation.html [dostęp: 05.09.2019]. 6 Dostępne pod adresem: https://www.sketchengine.eu/user-guide/user-manual/corpora/setting-up-parallel-corpora/ [dostęp: 05.09.2019]. 7 8 Ana Ostroški Anić Ekstrakcja jednostek leksykalnych do identyfikacji w Maja Lončar Specialized Semantic Frames Martina Pavić formacie tabelarycznym, takim jak arkusz kalkulacyjny (Excel). Arkusze kalkulacyjne muszą zawierać nazwy języków w pierwszym wierszu, a następnie wyrównane segmenty (słowa, zdania lub akapity) umieszczone obok siebie. Każdy dokument (akt prawny) przetworzono tak, aby uzyskać jedną kolumnę dla każdego języka. Aby to osiągnąć, punktory i numerowanie, a także nuplik merical part of tables in documents were removed. Each language in the źródłowy przetworzono na oddzielny korpus jednojęzyczny i wyrównano z odpowiadającym mu korpusem w drugim języku. Tabela 1. wielkość równoległego korpusu angielsko-chorwackiego ANGIELSKI CHORWACKI ANGIELSKI CHORWACKI tokeny 1,151,297 1,059,406 Zdania 72,045 75,638 Słowa 951,156 855,560 Dokumenty 178 178 Oprócz ekstrakcji najczęściej występujących terminów jednoi wielowyrazowych wykorzystywanych jako kandydaci na elementy ram semantycznych, korpus może być również używany do ekstrakcji terminów, definicji i przykładów kontekstu językowego, które zostaną wprowadzone do bazy terminologicznej AirFrame. korpus będzie również służył do analizy poziomu syntaktycznego terminów, tj. ich kolokacji, relacji frazeologicznych i konstrukcji predykatowo-argumentowych. 2.2. Ekstrakcja terminów i weryfikacja terminów Automatyczną ekstrakcję terminów przeprowadzono dla każdego języka, korzystając z opcji wyodrębnienia listy 1000 jednoi wielowyrazowych słów kluczowych. Korpus EUr-Lex English 2/2016 wykorzystano jako korpus referencyjny do ekstrakcji angielskich jedno­wyrazowych kandydatów terminologicznych, podczas gdy korpus English Web 2013 wykorzystano jako korpus referencyjny do ekstrakcji kandydatów terminologicznych wielowyrazowych. W przypadku ekstrakcji terminów w języku chorwackim możliwe były podobne rozwiązania. Korpus EUr-Lex croatian 2/2016 służył jako korpus referencyjny do ekstrakcji bardziej trafnych jedno­wyrazowych kandydatów terminologicznych, podczas gdy rozwiązanie to nie było możliwe w przypadku ekstrakcji słów kluczowych wieloterminowych. W związku z tym chorwacki Web hrWac 2.2. korpus wykorzystano zamiast niego. W celu sprawdzenia wiarygodności metody ręcznie zweryfikowano pierwszych 100 kandydatów terminologicznych z angielskiej listy terminów wielowyrazowych. Having checked their concordances, out of 100 term candidates, 70 were recognized as valid terms by a terminologist with ample experience in 7 9Terminologia | 2019 | 26 terminologia lotnicza. Lista angielskich słów kluczowych (lub terminów jedno­wyrazowych) składała się w dużej mierze ze skrótów lotniczych oraz kilku kluczowych terminów lotniczych. Następnie przeprowadzono ręczną analizę i weryfikację terminów obu angielskich i chorwackich list kandydatów na terminy wyekstrahowanych terminów. proces weryfikacji składał się z dwóch etapów: 1. usunięcia wszystkich skrótów oraz oczywistych słów i kolokacji języka ogólnego; oraz 2. przeanalizowania konkordancji pozostałych terminów w celu zweryfikowania, czy rzeczywiście były one terminami lotniczymi. Skróty są powszechnie używane w lotnictwie jako terminy, dlatego nieuwzględnienie ich w słowniku lub glosariuszu lotniczym byłoby rozumiane jako słaba prezentacja używanej terminologii lotniczej. Ponieważ jednak chcieliśmy uzyskać listę terminów lub konstrukcji wielowyrazowych, które mogłyby być używane do nazywania elementów ram semantycznych w lotnictwie, skróty jako leksykalne substytuty pełnych terminów nie były tutaj traktowane w tej samej funkcji. Poza tym nie było powodu, aby zachowywać skróty na chorwackich listach kandydatów na terminy, ponieważ w tekstach były one używane jako elementy języka obcego. 2.3. Ekstrakcja i analiza czasowników listy angielskich i chorwackich czasowników wyekstrahowano automatycznie za pomocą opcji Keywords w Sketch Engine. Czasowniki be, have i do nie zostały uwzględnione w korpusie angielskim, natomiast biti „beˮ, imati „haveˮ, moći „canˮ i morati „mustˮ pominięto w analizie korpusu chorwackiego. pierwsze 100 czasowników z każdej listy jest następnie analizowanych poprzez ręczną walidację ich szkiców słów. kolokacje uznane za terminy wielowyrazowe lub kolokacje o względnym znaczeniu dla terminologii lotniczej na podstawie ich częstotliwości są zapisywane w arkuszu programu Excel obok analizowanego czasownika. 3. wYnIKI I DYSKUSJA Ręczna weryfikacja terminów jednoi wielowyrazowych oraz angielskich i chorwackich kandydatów terminologicznych przyniosła zaskakujące wyniki dotyczące precyzji i kompletności automatycznego procesu ekstrakcji w programie Sketch Engine. Na przykład po pierwszym etapie weryfikacji terminów spośród 1000 terminów pozostało jedynie 400 jednowyrazowych terminów chorwackich, które nie były skrótami ani wyrazami języka ogólnego. Ostateczne listy terminów chorwackich składają się ze 199 terminów jednowyrazowych i 455 terminów wielowyrazowych. Angielskich terminów wielowyrazowych jest nieco więcej, ale nie tak wiele, jak można by się spodziewać. Po analizie pozostały 664 angielskie terminy wielowyrazowe, ale jedynie 148 juncker), słów w innych językach obcych, a nawet niektórych wyrazów funkcyjnych (np. zaimka this). algorytm ekstrakcji słów kluczowych i terminów 8 0 Ana Ostroški Anić Ekstrakcja jednostek leksykalnych na potrzeby Maja Lončar Specialized Semantic Frames Martina Pavić identyfikacji angielskich terminów jednowyrazowych, co daje znacząco słaby wynik wynoszący zaledwie 14.8% poprawnych terminów z początkowej listy angielskich terminów wielowyrazowych. Zgodnie z oczekiwaniami druga faza weryfikacji terminów ujawniła kilka problemów dotyczących terminologiczności kandydatów. Jeśli na liście pojawiały się zarówno rzeczownik, jak i przymiotnik odnoszące się do określonego pojęcia, zachowywano rzeczownik jako bardziej prototypową realizację terminu.7 Dotyczyło to w większym stopniu terminów chorwackich, ponieważ w języku angielskim rzeczownik i przymiotnik często mają tę samą formę morfologiczną, jak w następujących przykładach: kabina, kabinski „kabinaˮ, navigacija, navigacijski „nawigacja, nawigacyjnyˮ, helikopter, helikopterski „helikopterˮ, identifikacija, identifikacijski „identyfikacjaˮ. Podobnie, jeśli na listach pojawiały się zarówno przymiotnik, jak i przysłówek, zachowywano formę przymiotnikową: instrumentalni, instrumentalno „instrumentˮ, natomiast w przypadku różnicy czasownik/przymiotnik na liście zwykle pozostawiano czasownik: certificirati, certificiran „certify, certifiedˮ. Gdy pojawiały się dwa rzeczowniki odnoszące się do tego samego pojęcia, zachowywano oba, jeśli jeden odnosił się do czynności, a drugi do rezultatu, jak w przykładzie identifikacija i identificiranje „identificationˮ. Wydaje się, że w angielskich odpowiednikach nie występuje taka różnica. listy kandydujących terminów angielskich zawierały wiele informacji, które należało odfiltrować, takich jak nazwy państw, imiona i nazwiska (np. wielowyrazowych najwyraźniej rozpoznaje również elementy obcojęzyczne, tj. nieangielskie słowa w korpusie, jako terminy. można było tego uniknąć, gdyby frazy (we wszystkich językach UE), które zwykle pojawiają się na końcu każdego dokumentu, zostały usunięte przed dodaniem dokumentów do korpusu, lecz uznano, że łatwiej będzie później je ignorować na listach kandydatów. druga faza weryfikacji terminów dotycząca angielskich kandydatów terminologicznych wykazała, że największą pułapką zastosowanego algorytmu jest niezdolność do odróżnienia konstrukcji wielowyrazowych dwuod trzyczłonowych, co stanowi powszechny błąd w wielu statystycznych narzędziach do ekstrakcji terminów. Bound air i simulated engine są zatem częściami większych, poprawnych terminów wielowyrazowych bound air cargo i simulated engine failure (obie wersje pojawiły się w słownikach terminologicznych obok odpowiadających im przymiotników i czasowników odnoszących się do tego samego pojęcia (Sager 1990: 58). Jednakże oba zostałyby uwzględnione jako jednostki leksykalne powiązane z przywoływaną przez nie ramą semantyczną. the list), as well as instrument ground and crew compartment (instead of 7 this kind of reasoning is more in line with traditional terminology work, in which nouns had priority 8 1Terminologija | 2019 | 26 instrumental ground time and flight crew compartment). Niektóre wielowyrazowe kandydujące terminy formalnie wyglądają jak terminy właściwe i potrzeba specjalistycznej wiedzy dziedzinowej, aby oznaczyć je jako niepoprawne lub będące wynikami fałszywie dodatnimi, np.: visual flight > visual flight rules, providing air traffic > providing air traffic services, investigation authority > safety investigation authority, maximum take-off > maximum take-off mass, secondary surveillance > secondary surveillance radar. Krótsze wersje są często po prostu synonimami, jak controller licence w odniesieniu do air traffic controller licence. Kolejna grupa fałszywie dodatnich terminów wielowyrazowych obejmuje wyrażenia wielowyrazowe, które można by zaklasyfikować jako należące do języka ogólnego: relevant aircraft, individual aircraft, specific aircraft, large aircraft, present aircraft, height of cloud base, field of civil aviation, entire flying time lub specific training. Chociaż są to formy poprawne morfosyntaktycznie, nie odnoszą się do żadnego konkretnego pojęcia i dlatego nie można ich uznać za terminy. Po przeanalizowaniu wszystkich list otrzymaliśmy bardzo małą liczbę terminów jednowyrazowych: 199 terminów chorwackich i 148 terminów angielskich. Aby zweryfikować, czy wyodrębniono terminy, które można uznać za oznaczające „kluczowe” pojęcia w tej dziedzinie, przeanalizowano szkice słów dla pierwszych 10 terminów w każdym języku. Szkice słów to automatyczne, oparte na korpusie podsumowania wzorców gramatycznych i kolokacyjnych słów; stanowią one doskonałe źródło do generowania dużej liczby kandydatów na terminy w ich kontekście składniowym (Kilgarriff et al. 2014). Oprócz typowych kolokacji przymiotnik/rzeczownik (wet-leased aircraft) lub rzeczownik/rzeczownik (aircraft noise, aircraft position), kolokacje czasownikowe (operate an aircraft) i frazy przyimkowe (aircraft entering into) dostarczają nieocenionych informacji terminologicznych, szczególnie przydatnych terminologom i tłumaczom. najbardziej istotną dla tego celu relacją była relacja koordynacji między słowem docelowym a słowami z nim powiązanymi. Jak widać na rysunku 1, słowa powiązane z aircraft to occupant, terrain, vehicle, product, systems, content, loss, unit, engine, equipment i type. Porównaliśmy listę terminów skoordynowanych z listą terminów jednowyrazowych i zaznaczyliśmy te, które występowały na obu listach. drugim krokiem w weryfikacji wyników było porównanie najczęstszych kolokacji terminów w szkicach słów z kolokacjami z listy terminów wielowyrazowych. Gdy kolokacje ze szkicu słowa (np. aircraft identification lub aircraft operator na Rysunku 1) odpowiadały tym z listy terminów wyodrębnionych z korpusu, były również oznaczane jako jednostki leksykalne, które należało uwzględnić w opisie ramy semantycznej.