scieee AI-readable full text Open interactive document viewer

Extracting Lexical Units for Identifying Specialized Semantic Frames

Ana Ostroški Anić; Maja Lončar; Martina Pavić

Abstract

    The paper discusses the idea of using parallel corpora for the extraction of terminological units used to identify semantic frames of aviation, as the first step in developing a method for determining specialized semantic frames. The process of compiling the parallel corpus of texts taken from the Eur-Lex database using Sketch Engine tools is described first. The methodology of extracting term candidates and their manual verification is then presented, as well as the process of extracting and verifying relevant verbs. The results of term verification are discussed, with the focus on the role of verbs and verbal collocations in identifying relevant semantic frames and frame elements.

Full text

7 3Terminologija | 2019 | 26 doi.org/10.35321/term26-04 Extracting Lexical Units for Identifying Specializált szemantikai keretek1 AnA OstrOški Anić Horvát Nyelv és Nyelvészet Intézete MAjA LOnčAr Horvát Nyelv és Nyelvészet Intézete MArtinA PAvić Horvát Nyelv és Nyelvészet Intézete Összefoglaló A tanulmány a párhuzamos korpuszok használatának lehetőségét tárgyalja a repülés szemantikai kereteinek azonosítására használt terminológiai egységek kinyerésére, a specializált szemantikai keretek meghatározására szolgáló módszer kidolgozásának első lépéseként. Először az Eur-Lex adatbázisából származó szövegek párhuzamos korpuszának Sketch Engine eszközeivel történő összeállítási folyamatát ismertetjük. Ezt követően bemutatjuk a terminusjelöltek kinyerésének és kézi ellenőrzésének módszertanát, valamint a releváns igék kinyerésének és ellenőrzésének folyamatát. Megvitatjuk a terminusok ellenőrzésének eredményeit, különös tekintettel az igék és az igei kollokációk szerepére a releváns szemantikai keretek és keretelemek azonosításában. Kulcsszavak: repülési terminológia, angol–horvát korpusz, szemantikai keretek, specializált tudás, terminológia. AnotAcIjA A tanulmány azt vizsgálja, hogyan használhatók a párhuzamos korpuszok a légiközlekedési szemantikai keretek meghatározására alkalmazott terminológiai egységek kiválasztására. ez a speciális szemantikai keretek meghatározására szolgáló módszer kidolgozásának első szakasza. Elsőként azt mutatja be, hogyan állítanak össze az Eur-Lex adatbázis alapján, a Sketch Engine eszközeinek felhasználásával egy párhuzamos szöveggyűjteményt. Ezt követően bemutatjuk a terminusváltozatok kiválasztásának és kézi ellenőrzésének módszereit, valamint 1 e tanulmány alapjául a „From parallel corpora to specialized semantic frames” című, a Terminológia tudományos, közigazgatási és oktatási dimenziói című, 2019. október 17–18-án Vilniusban megrendezett 3. nemzetközi konferencián elhangzott előadás szolgál. A munkát teljes egészében a Horvát Tudományos Alapítvány támogatta a HrZZ-UIP-2017-05-7169 projekt keretében. 7 4 Ana Ostroški Anić Extracting Lexical Units for Identifying megfelelő igék Maja Lončar Specialized Semantic Frames Martina Pavić kiválasztásának és ellenőrzésének folyamata. A terminusok ellenőrzési eredményeinek tárgyalásakor különös figyelmet fordítanak az igék és a szókapcsolatok szerepére, meghatározzák a megfelelő szemantikai kereteket és azok elemeit. kulcsszavak: légiközlekedési terminológia, angol és horvát nyelvű korpusz, szemantikai keretek, szaktudás, terminológia. Bevezetés A Frame Semantics (Fillmore 1976, 1982) elméletét számos alkalommal alkalmazták a lexikográfiában és a számítógépes nyelvészetben; ezek közül minden bizonnyal a legismertebb a Framenet lexikai tudásbázis (Fillmore et al. 2003; Ruppenhofer et al. 2017). A szintaxis és a szemantika közötti kapcsolatok feltérképezését célzó munka, amely lényegében maga a Framenet, nemcsak az angolon kívüli más nyelvekkel foglalkozó hasonló projekteknek adott ösztönzést, hanem utat nyitott a specializált tudás, valamint a specializált tudáskategóriák szemantikai kereteken alapuló szervezésének kutatása előtt is. függetlenül attól, hogy szorosan követik-e a Framenet módszertanát, vagy módosított megközelítést alkalmaznak a szemantikai keretek kategóriatípusokként való azonosítására és körülhatárolására, a speciális tudásközösségek számára kialakított erőforrások létrehozására irányuló projekteknek figyelembe kellett venniük a terminológia sajátosságait, valamint a szaknyelvek kontextusát az általános nyelvvel és annak használatával szemben (Faber et al. 2006; 2009; L’Homme 2012). a horvát nyelv számára mindeddig nem fejlesztettek ki olyan lexikai erőforrást, amely teljes mértékben a Framenet módszertanán és szemantikai leltárán alapulna. bizonyos szemantikai kereteket a horvát nyelvben előforduló fogalmi metaforák nagyobb adatbázisának részeként határoztak meg (Despot et al. 2019). Egy, A specializált tudáskategóriák dinamizmusa (DIKA, ihjj.hr/dika) című kutatási projekt keretében fejlesztés alatt álló légiközlekedési szemantikaikeret-adatbázis azonban az első kísérlet egy ilyen, horvát nyelvre specializált adatbázis létrehozására. a projekt a specializált tudáskategóriák fogalmi és nyelvi szintjeinek leírásával foglalkozik a szemantikai keretek dinamikus természetén belül. a projekt legfontosabb eredménye egy többnyelvű terminológiai adatbázis, amelyben a légiközlekedési terminológiát szemantikai keretekben határozzák meg, beleértve a keretelemeket, a fogalmi kapcsolatokat, valamint a figuratív és frazeológiai terminológiai egységeket. A szemantikai és szintaktikai elemzés céljaira összeállítottak egy angol és horvát nyelvű, a légiforgalom területéhez tartozó szövegekből álló párhuzamos korpuszt, amely a kifejezések kinyerésének és elemzésének alapjául fog szolgálni, valamint 7 5Terminologija | 2019 | 26 kiindulópontként fog szolgálni a terminuskinyeréshez és a terminuselemzéshez. a tanulmány által tárgyalt alterület a párhuzamos of air traffic has been chosen as the most representative aspect of the vast and interdisciplinary field of aviation. korpuszok használatának gondolatát vizsgálja a légiközlekedés meghatározott szemantikai kereteire utaló terminológiai egységek kinyerésére, a légiközlekedés területén a szemantikai keretek és azok fogalmi kapcsolatainak meghatározására szolgáló módszer kidolgozásának első lépéseként. Bár a párhuzamos korpuszokat régóta a különféle szakosított erőforrások létrehozásához szükséges terminusjelöltek felbecsülhetetlen forrásainak tekintik (Vintar 2000), a Frame Semanticsre2 hivatkozó alkalmazott kutatásban eddig alig használták őket. először az Eur-Lex adatbázisból származó szövegekből összeállított párhuzamos korpusz Sketch Engine eszközeivel történő összeállításának folyamatát ismertetjük. Ezt követően bemutatjuk a terminusjelöltek kinyerésének és kézi ellenőrzésének módszertanát, valamint a releváns igék kinyerésének és ellenőrzésének folyamatát. Bemutatjuk és kommentáljuk a terminusok ellenőrzésének eredményeit, majd megvitatjuk az igék és az igei kollokációk lehetséges felhasználását a releváns szemantikai keretek és keretelemek azonosításában a légiközlekedés területén.3 1. ELMÉLETI HÁTTÉR A kortárs terminológiai és LSP-közösségekben a szakosított tudáserőforrások már nem kizárólag a hierarchikus kapcsolatok leírására épülnek, mivel úgy vélik, hogy ezek nem tükrözik a tudáskategóriák dinamikus természetét (Faber et al. 2006; 2009; L’Homme, robichaud 2014). Emellett a szótár és a lexikon közötti, a hagyományos terminográfia egészének alapjául szolgáló formális különbség mintha elmosódott volna, mivel egyre több szakosított erőforrás alkalmazza az általános nyelvi erőforrások létrehozásában egyébként használt összeállítási és tudásbemutatási módszereket (L’Homme et al. 2016; L’Homme 2018). A Frame Semantics előfeltevéseire épülő lexikai és szemantikai erőforrások a tudást szemantikai keretek formájában határozzák meg, amelyek bonyolult elemekből és kölcsönös kapcsolatokból álló dinamikus kategóriák. Minden szemantikai keret esemény vagy állapot egy típusaként van meghatározva, résztvevőivel együtt, amelyeket keretelemeknek (FE-knek) nevezünk. A szemantikai kereteket a 2 A párhuzamos korpuszok minden bizonnyal teljes mértékben kiaknázhatnák a szemantikai kereteken alapuló többnyelvű lexikai tárak létrehozásában (Boas 2005). 3 Köszönetet mondunk a névtelen bírálóknak felbecsülhetetlen értékű megjegyzéseikért és javaslataikért. 7 6 Ana Ostroški Anić Lexikai egységek kinyerése A keretelemeket Maja Lončar Specialized Semantic Frames Martina Pavić megtestesítő lexikai egységek, azaz a mindennapi nyelv szavai vagy a szakterületi tudás terminusai azonosításához. az egyik keret másiktól való elhatárolásának alapvető kritériuma az, hogy minden lexikai egységnek „ugyanazt az eseménytípust kell felidéznie, valamint a keretelemek (FE-k) azonos készletével és konfigurációjával kell rendelkeznie” (Ruppenhofer et al. 2017: 384–385). ez a módszer azonban, amellyel eljutunk a szemantikai keretek hatóköréhez és definícióikhoz, önkényesnek tekinthető, mivel nem igényli a rendelkezésre álló lexikai adatok előzetes „áttekintését”. Mivel sok keret forgatókönyvszerű felépítést követ, leírásuk általában a releváns igék kiválasztásával kezdődik (Ruppenhofer et al. 2010), amelyekhez a korpuszból kinyert példák annotációját követően megfelelő argumentumokat adnak hozzá. Bár a lexikai egységeket és a keretelemeket az elemzett korpusz adatai alapján határozzák meg, a szemantikai kereteket ennek ellenére többnyire intuitív módon azonosítják és nevezik el. Egy bizonyos szakmai tudásterület szemantikai kereteinek azonosításakor célszerűbb lenne először körülhatárolni a meghatározandó tudás terjedelmét, amit a terminológiai munkában a terület kulcsfogalmainak és fogalmi kapcsolatainak azonosításával végeznek el. A terminológiai kutatás az elmúlt két évtizedben szorosan követte a nyelvészet fejlődését, és elméleti fókuszát a folyamatok és események mint dinamikusabb szakmai tudásstruktúrák elemzésére helyezte át. Ezért világossá vált, hogy a predikatív terminusok (igék, melléknevek, határozószók és bizonyos főnevek) gyakran egy terminológiai terület kulcsfogalmait jelölik (L’Homme 1998; Pimentel 2012; L’Homme, robichaud 2014). Például a communicate, fly, take off és transport terminusok jellemzően jelen vannak a repülés területén, csakúgy, mint számos olyan eljárás terminusai, amelyeket ontológiailag folyamatokként vagy tevékenységekként határozunk meg. Bár a terminusjelleg fogalmát a terminológusok meglehetősen jól értik a terminusok fogalmi szintjének meghatározásakor, a terminológiai forrásban terminusként szerepeltetendő lexikai egységtípusok kiválasztásának kritériumai továbbra is különböznek az elemzett területtől és az alkalmazott elméleti kerettől függően. A szakirodalomban leggyakrabban az L’Homme (1998, 2015) által javasolt, speciális jelentést hordozó igetípusok meghatározására szolgáló kritériumokra hivatkoznak, Lorente kritériumai és a szakmai diskurzusban előforduló igék általa kidolgozott tipológiája (2002, 2007) mellett. L’Homme három igetípust különböztet meg a szakmai szövegekben: egy bizonyos területre jellemző igéket (pl. land, take off), a területen speciális jelentést nyerő igéket (pl. operate), valamint általános 7 7Terminologija | 2019 | 26 guage.4 Az első és a második típusba tartozó igék terminusként jelölhetők, a második típusba tartozó igék azonban érdekesebb csoportot képeznek a terminológiai elemzés szempontjából, mivel előfordul, hogy nem egyértelmű, vajon jelentésük kellően eltér-e az ige kanonikus vagy alapértelmezett, általános szótári jelentésétől. lanthe criteria for deciding whether a verb takes on a new, specialized meaning in a given context should yet be more precisely defined. Az L’Homme (1998, 2015) szerint annak kritériumai, hogy egy ige terminusként osztályozható-e, az argumentumaitól, valamint a terminusként meghatározott, azonos jelentésű lexikai egységekkel fennálló morfológiai és szemantikai kapcsolatától függnek. Röviden: ha egy igének terminusként definiált bővítményei vannak, akkor maga az ige is valószínűleg terminus, mint a The pilot flies the helicopter. mondatban. Továbbá, ha a takeoff főnév terminusként van definiálva, akkor a take off igét is terminusként kell definiálni. Ezeket a kritériumokat alkalmaztuk a kinyert igék elemzésében; erről bővebben a 4. szakaszban szólunk. 2. MÓDSZEREK Az érvényes módszertan kidolgozásához a specializált szemantikai keretek azonosítására több lépést kellett megtenni. Először létrehoztunk egy párhuzamos angol–horvát korpuszt. a második szakasz a terminuskivonásból és a terminusjelöltek listáinak validálásából állt. a harmadik lépés magában foglalta az igék listájának kivonását és a specializált jelentést hordozó kollokációik elemzését. 2.1. Korpusz-összeállítás A korpusz az Európai Unió jogi aktusainak jegyzékéből, a Közlekedéspolitika című fejezetből, a Légi közlekedés című alfejezet angol és horvát nyelvű anyagaiból került összeállításra. A Légi közlekedés alfejezet 220 dokumentumából 178 jogi aktust választottunk ki, amelyek mindkét (angol és horvát) nyelvi változatban rendelkezésre állnak. A szövegeket az EUr-Lex adatbázisból töltöttük le,5 majd bevittük a Sketch Engine korpusz-összeállító moduljába.6 A párhuzamos korpusz létrehozásának legegyszerűbb módja a Sketch Engine-ben az adatok feltöltése 4 L’Homme (2015) a köznyelvi igéket továbbá segédigékre (Lerat 2002 nyomán) és diskurzív igékre (Lorente és a 2002-es osztályozása nyomán) osztályozza. Lásd Pimentel (2017) e két, a specializált szövegekben előforduló igék tipológiájára vonatkozó megközelítés legújabb kidolgozását. 5 Elérhető: https://eur-lex.europa.eu/browse/directories/legislation.html [hozzáférés: 2019.09.05.]. 6 Elérhető itt: https://www.sketchengine.eu/user-guide/user-manual/corpora/setting-up-parallel-corpora/ [hozzáférés: 2019.09.05.]. 7 8 Ana Ostroški Anić Lexikai egységek kinyerése azonosításhoz táblázatos Maja Lončar Specialized Semantic Frames Martina Pavić formátumban, például táblázatkezelőben (Excel). A táblázatoknak az első sorban kell tartalmazniuk a nyelvek nevét, majd az egymáshoz igazított szegmenseket (szavakat, mondatokat vagy bekezdéseket) egymás mellett. Minden dokumentumot (jogi aktust) feldolgoztak úgy, hogy minden nyelvhez egy oszlop tartozzon. Ennek elérése érdekében a felsorolásjeleket és a számozást, merical part of tables in documents were removed. Each language in the valamint a nu forrásfájlt külön egynyelvű korpuszba dolgozták fel, és a másik nyelv megfelelő korpuszához igazították. 1. táblázat. Az angol–horvát párhuzamos korpusz mérete ANGOL HORVÁT ANGOL HORVÁT tokenek 1,151,297 1,059,406 Mondatok 72,045 75,638 Szavak 951,156 855,560 Dokumentumok 178 178 A szemantikai keretelemek jelöltjeiként használt leggyakoribb egyés többszavas terminusok kinyerése mellett a korpusz terminusok, definíciók és a nyelvi kontextus példáinak kinyerésére is használható, amelyeket az AirFrame terminológiai adatbázisába fognak bevinni. a korpusz a terminusok szintaktikai szintjének, azaz kollokációiknak, frazeológiai kapcsolataiknak és predikátum-argumentum szerkezeteiknek az elemzését is szolgálja majd. 2.2. Terminuskivonás és terminus-ellenőrzés Az automatikus terminuskivonást mindkét nyelv esetében úgy végezték el, hogy lehetőség legyen 1000 egyés többszavas kulcsszóból álló lista kivonására. Az EUr-Lex English 2/2016 korpuszt referencia-korpuszként használták az angol egyszavas terminusjelöltek kinyeréséhez, míg az English Web 2013 korpuszt a többszavas terminusjelöltek kinyeréséhez. Hasonló lehetőségek álltak rendelkezésre a terminusok horvát nyelvű kinyeréséhez. Az EUr-Lex croatian 2/2016 korpusz referencia-korpuszként szolgált a relevánsabb egyszavas terminusjelöltek kinyeréséhez, míg ez a lehetőség a több terminusból álló kulcsszavak kinyeréséhez nem állt rendelkezésre. Ezért helyette a horvát Web hrWac 2.2. korpuszt használták. A módszer megbízhatóságának tesztelése érdekében a többszavas terminusok angol listájáról származó első 100 terminusjelöltet manuálisan validálták. Having checked their concordances, out of 100 term candidates, 70 were recognized as valid terms by a terminologist with ample experience in 7 9Terminologija | 2019 | 26 repülési terminológia. Az angol kulcsszavak (vagy egyszavas terminusok) listája nagyrészt repülési rövidítésekből és néhány kulcsfontosságú repülési terminusból állt. Ezt követően elvégezték mind az angol, mind a horvát kinyert terminusjelöltek listáinak manuális elemzését és terminológiai ellenőrzését. az ellenőrzési folyamat két szakaszból állt: 1. az összes rövidítés, valamint a nyilvánvalóan általános nyelvi szavak és szókapcsolatok eltávolítása; valamint 2. a fennmaradó terminusok konkordanciáinak elemzése annak ellenőrzése céljából, hogy valóban repülési terminusok-e. A rövidítéseket a repülésben gyakran terminusként használják, ezért ha nem szerepelnének a repülési terminológia szótárában vagy szójegyzékében, az a használatban lévő repülési terminológia hiányos bemutatásának minősülne. Mivel azonban olyan terminusok vagy többszavas szerkezetek listáját kívántuk létrehozni, amelyek felhasználhatók a repülési szemantikai keretek elemeinek megnevezésére, a teljes terminusok lexikai helyettesítőiként funkcionáló rövidítéseket itt nem ugyanebben a funkcióban kezeltük. Ezen túlmenően nem volt indok a rövidítések megtartására a horvát terminusjelöltek listáiban, mivel a szövegekben idegen nyelvi elemként használták őket. 2.3. Az igék kinyerése és elemzése Az angol és horvát igék listáit automatikusan nyertük ki a Sketch Engine Keywords opciójának használatával. Az angol korpuszban a be, have és do igéket nem vettük figyelembe, míg a horvát korpuszban a biti „beˮ, imati „haveˮ, moći „canˮ és morati „mustˮ igéket kihagytuk az elemzésből. Ezután az egyes listák első 100 igéjét a szóvázlataik kézi ellenőrzésével elemzik. A repülési terminológia szempontjából több szóból álló terminusnak vagy viszonylag jelentős kollokációnak minősített kollokációkat gyakoriságuk alapján feljegyzik egy Excel-táblázatba az elemzett ige mellé. 3. EREDMÉNYEK ÉS MEGVITATÁSUK Az egyszavas és több szóból álló angol és horvát terminusjelöltek kézi terminus-ellenőrzése meglepő eredményeket hozott a Sketch Engine-ben végzett automatikus kinyerési folyamat pontosságát és visszahívását illetően. Például a terminusok ellenőrzésének első szakasza után 1000 terminusból csupán 400 olyan egyszavas horvát terminus maradt, amelyek nem voltak rövidítések vagy az általános nyelv szavai. A horvát terminusok végleges listái 199 egyszavas és 455 több szóból álló horvát terminusból állnak. Az angol több szóból álló terminusok száma valamivel nagyobb, de nem annyi, mint amennyire számítani lehetne. Az elemzés után 664 több szóból álló angol terminus maradt, de csak 148 juncker), más idegen nyelvek szavai, sőt néhány funkciószó is (pl. a this névmás). a kulcsszavak és többszavas terminusok kinyerésére szolgáló algoritmus láthatóan az idegen elemeket, azaz a korpuszban található 8 0 Ana Ostroški Anić Lexikai egységek kinyerése az egyszavas angol terminusok Maja Lončar Specialized Semantic Frames Martina Pavić azonosításához, ami az eredeti többszavas angol terminuslista mindössze 14.8%-os érvényes terminusarányával jelentősen gyenge eredményt ad. Ahogy az várható volt, a terminusellenőrzés második szakasza számos kérdést vetett fel a jelöltek terminusjellegével kapcsolatban. Ha egy adott fogalomra utaló főnév és melléknév egyaránt szerepelt a listán, a főnév maradt meg prototipikusabb terminusmegvalósulásként.7 ez inkább a horvát terminusok esetében volt így, mivel az angolban a főnév és a melléknév gyakran azonos morfológiai alakú, amint azt a következő példák mutatják: kabina, kabinski „cabinˮ, navigacija, navigacijski „navigation, navigationalˮ, helikopter, helikopterski „helicopterˮ, identifikacija, identifikacijski „identificationˮ. Hasonlóképpen, ha a listákon melléknév és határozószó is szerepelt, a melléknévi alakot tartottuk meg: instrumentalni, instrumentalno „instrumentˮ, míg az ige/melléknév különbsége esetén általában az igét tartottuk meg a listán: certificirati, certificiran „hitelesít, hitelesítettˮ. Amikor két, ugyanarra a fogalomra utaló főnév szerepelt, mindkettőt megtartottuk, ha egyikük a cselekvésre, a másik pedig az eredményre utalt, mint az identifikacija és identificiranje „azonosításˮ példájában. Úgy tűnik, hogy az angol megfelelőikben nem létezik ilyen különbség. az angol terminusjelöltek listái sok szűrendő információt tartalmaztak, például országneveket, személyneveket (pl. nem angol szavakat is terminusokként ismeri fel. ez elkerülhető lett volna, ha az egyes dokumentumok végén rendszerint megjelenő (az összes uniós nyelven szereplő) kifejezéseket a dokumentumok korpuszhoz való hozzáadása előtt törölték volna, de úgy döntöttek, hogy egyszerűbb később figyelmen kívül hagyni ezeket a jelöltek listáin. A második, az angol terminusjelöltekre vonatkozó terminusellenőrzési szakasz azt mutatta, hogy az alkalmazott algoritmus legnagyobb buktatója a kétés háromrészes többszavas szerkezetek megkülönböztetésének képtelensége, ami számos statisztikai terminuskinyerő eszközben gyakori hiba. A bound air és a simulated engine tehát a nagyobb, helyes többszavas terminusok, a bound air cargo és a simulated engine failure részei (mindkét változat megjelent a terminológiai szótárakban a megfelelő, ugyanarra a fogalomra utaló melléknevek és igék felett (Sager 1990: 58). Mindazonáltal mindkettő szerepelne az általuk előhívott szemantikai kerethez kapcsolódó lexikai egységként. the list), as well as instrument ground and crew compartment (instead of 7 this kind of reasoning is more in line with traditional terminology work, in which nouns had priority 8 1Terminologija | 2019 | 26 műszerföldi idő és repülőszemélyzeti rekesz). Egyes többszavas terminusjelöltek formailag valódi terminusoknak tűnnek, és annak megállapításához, hogy helytelenek vagy téves pozitív eredmények, szakterületi ismeretre van szükség, pl.: visual flight > visual flight rules, providing air traffic > providing air traffic services, investigation authority > safety investigation authority, maximum take-off > maximum take-off mass, secondary surveillance > secondary surveillance radar. A rövidebb változatok gyakran egyszerűen szinonimák, mint a controller licence az air traffic controller licence esetében. A téves pozitív többszavas terminusok egy másik csoportját olyan többszavas kifejezések alkotják, amelyekről megállapítható, hogy a köznyelvhez tartoznak: relevant aircraft, individual aircraft, specific aircraft, large aircraft, present aircraft, height of cloud base, field of civil aviation, entire flying time vagy specific training. Noha morfoszintaktikailag érvényes alakok, nem utalnak konkrét fogalomra, ezért nem tekinthetők terminusoknak. Az összes lista elemzése után egyetlen szóból álló terminusok nagyon kis számára jutottunk: 199 horvát és 148 angol terminusra. Annak ellenőrzésére, hogy kinyertük-e azokat a terminusokat, amelyek a szakterület „kulcsfontosságú” fogalmait jelölhetik, elemeztük a két nyelv első 10 terminusának szóvázlatait. A szóvázlatok a szavak grammatikai és kollokációs mintázatainak automatikus, korpuszból származó összefoglalói, és kiváló forrásként szolgálnak számos terminusjelölt szintaktikai kontextusban történő generálásához (Kilgarriff et al. 2014). A tipikus melléknév/főnév (wet-leased aircraft) vagy főnév/főnév (aircraft noise, aircraft position) kollokációkon kívül az igei kollokációk (operate an aircraft) és az elöljárós szerkezetek (aircraft entering into) felbecsülhetetlen terminológiai információt nyújtanak, amely a terminológusok és a fordítók számára a leghasznosabb. E célból a legrelevánsabb reláció a célszó és a kapcsolódó szavak közötti koordinációs reláció volt. Amint az az 1. ábrán látható, az aircraft szóhoz kapcsolódó szavak a következők: occupant, terrain, vehicle, product, systems, content, loss, unit, engine, equipment és type. Összehasonlítottuk a koordinált terminusok listáját az egyetlen szóból álló terminusok listájával, és megjelöltük azokat, amelyek mindkettőben szerepeltek. Az eredmények ellenőrzésének második lépése a szóvázlatokban szereplő kifejezések leggyakoribb kollokációinak összehasonlítása volt a többszavas terminusok listáján szereplőkkel. Amikor a szóvázlatból származó kollokációk (például az aircraft identification vagy az aircraft operator az 1. ábrán) megegyeztek a korpuszból kinyert terminusok listáján szereplőkkel, azokat szintén lexikai egységként jelölték meg, amelyeket be kellett illeszteni egy szemantikai keret leírásába.