scieee AI-readable full text Open interactive document viewer

Improving Compatibility of Terminological Collections with a Bridging Classification of Data Categories

Igor Kudashev

Full text

A terminológiai gyűjtemények kompatibilitásának javítása az adatkategóriák áthidaló osztályozásával BEVEZETÉS IGOR KUDASHEV University of Helsinki Annak ellenére, hogy létezik az adatkategóriák szabványosított készlete (ISO 12620:1999) és a terminológiai munka szabványosított módszerei (ISO 704:2000), továbbra is nehéz két különböző szervezetben létrehozott olyan terminológiai adatbázist találni, amelyek könnyen egyesíthetők lennének az adatok elvesztése vagy az egyes adatbázisok összeállításának eredeti elvei torzulása nélkül. Ennek legnyilvánvalóbb okai a következők: a nemzeti nyelvek és hagyományok eltérnek; - az LSP-domének eltérnek; az összeállítók háttere és megközelítése eltér; a technikai megoldások eltérnek. Ugyanakkor a terminológiai erőforrások és más adatfajták kezelésének egyik irányzata a szétszórt erőforrások nagyobb portálokká vagy szolgáltatásokká történő összesítése volt, rendszerint fizikai egyesítésük nélkül. Erre példa az EuroTermBank portál (http:// www.eurotermbank.com), amely több belső és külső terminológiai adatbázisban biztosít keresést, és összeállítást készíthet a találatokból. A felhasználói igények és az adatmennyiségek növekedésével szükségessé válik olyan fejlett keresés biztosítása, amely a bejegyzés valamennyi mezőjére kiterjed, nem csupán a címszavakra, valamint a bejegyzéseknek a felhasználói preferenciák szerinti testre szabása. Ebben a cikkben olyan adatkategória-osztályozást javaslunk, amely hídként szolgálhat terminológiai gyűjtemények között. Az osztályozás a különböző adatkategória-készletekkel rendelkező terminológiai gyűjtemények kezelésével kapcsolatos következő problémákat érinti: a terminológiai erőforrások aggregálása és egyesítése; az összes bejegyzésmezőt lefedő keresés megszervezése; a több gyűjteményből származó bejegyzéseknek a felhasználók preferenciái szerinti testre szabása. 36 Igor Kudashev | A terminológiai gyűjtemények kompatibilitásának javítása. A terminológiai adatbázis a tulajdonképpeni terminológiai adatokon kívül különböző típusú adatokat is tartalmazhat, például a forrásokra, a felhasználókra és a terminológiakezelési tranzakciókra vonatkozó információkat. Ebben a cikkben az LSP-kifejezések leírásához kapcsolódó adatkategóriák osztályozására összpontosítunk. MI AZ ADATKATEGÓRIA? A terminológiai adatbázisokban különböző adattípusokat különböző mezőkben helyeznek el. Az adatkategória egy adott adatmező specifikációjának eredménye (ISO 1087-2:2000: 13). A terminológusok különböző metaforákat használnak az adatkategória fogalmának magyarázatára. Az egyik metafora egy ruhásszekrényé, amelyben különböző fiókok szolgálnak a különböző típusú ruhák tárolására. Egy másik metafora a bevásárlókosár, amelyben minden árufajtát a saját csomagolásába csomagolnak, hogy ne keveredjenek össze. AZ ADATKATEGÓRIÁK KÖZÖTTI JELLEMZŐ ELTÉRÉSEK Az adatkategóriák az adatok osztályozásának eredményei. Az adatok sokféleképpen osztályozhatók, az osztályozó szemléletétől és a felhasználók igényeitől függően. A ruhásszekrény-metaforát használva elmondható, hogy a különböző ruhásszekrényekben különböző számú, esetleg eltérő alakú fiókok vannak. méret stb. A terminológiai adatbázisokban az adatkategóriák között legalább hatféle eltérés lehetséges: az adatkategóriák elnevezéseinek eltérése; az adatkategóriák „méretének” eltérése, azaz eltérő „granularitás”; az adatkategóriák „helyének” eltérése, azaz elhelyezkedésük eltérése a besorolási rendszerben; a besorolási elvek eltérése (átfedés); az adatkategóriák tartalmának eltérése; vegyes esetek. Az alábbiakban néhány példa szemlélteti a gyakori eltérések egy részét. 1. eset: az adat kategóriái eltérően vannak elnevezve. Példa: az egyik adatbázisban az adat kategóriáját note-nak, a másikban commentnek, a harmadikban remarknak, a negyedikben pedig NB-nek nevezik. Terminologija | 2009 | 16 37 2. eset: egy adat kategóriájának nevét eltérő értelemben használják. . s“ ss Példa: a data category synonym megfelelhet a „full synonym”, a „near-synonym”, illetve a „full or near-synonym” fogalmának. 3. eset: az adat kategóriáinak nevei „hamis barátok”. Példa: az angol abbreviation és acronym rövidítések az ISO-szabványban meghatározottak szerint (ISO 12620:1999: 6-7), valamint az orosz ab66pesuamypa és akpornum keresztirányban felelnek meg egymásnak (Kudashev 4 Hajutin 2003: 104-105). 4. eset: az adat kategóriáinak granulációja eltérő. Példa: az adat kategóriát, a terminus rövidített formáját az ISO 12620:1999 öt alosztályba sorolja (rövidítés, a terminus rövid formája, betűszó, mozaikszó és csonkolt terminus), az ISO 12616:2002 szabványban („Fordításorientált terminográfiaTM) azonban nincs ilyen felosztás. 5. eset: az adat kategóriák átfedése. Példa: az adat kategóriák, a példa és a kontextus átfednek. Néhány példa kontextus, és egyes kontextusok példaként szolgálhatnak, de a két kategória nem azonos. 6. eset: ugyanaz az adat kategória különböző tágabb kategóriák alá kerül. Példa: az adat kategóriát, a kontextust az ISO 12620:1999 fogalomhoz kapcsolódó adatnak tekinti, nyilvánvalóan azért, mert a kontextusok további információt nyújthatnak a fogalomról. A kontextusok gyakoribb funkciója azonban az, hogy információt nyújtsanak a terminushasználatról és a kollokációkról, ezért „sok adatbázis a kontextust terminushoz kapcsolódó kategóriaként sorolja be” (ISO 12620:1999: 25). 7. eset: az adatok nyelve, jelrendszere vagy jelölése eltér. másik, főnévként a harmadikban, grafikus szimbólumként pedig a negyedikben. 8. eset: az adat kategóriáinak azonos vagy hasonló értékeit eltérő jelentésekben és különböző kapcsolatokban használják. Példa: az ISO 12620:1999 terminuseredet-adatkategóriájában szereplő value neologism megnevezés kronológiai címkének hangzik, valójában azonban a terminus létrehozásakor alkalmazott módszertanra utal. 38 Igor Kudashev | A terminológiai... kompatibilitásának javítása Example: a part of speech may be coded as noun in one database, n. in 9. eset: a félig zárt osztályok értékei eltérnek az eltérő osztályozás miatt. Példa: az ISO 12620:1999-ben az of linguistic phenomena in different languages and different traditions. LSP-kifejezések „alsó stílusba” való tartozásának leírására szolgáló címkék között szerepel a slang register és a vulgar register. Nagyjából megfelelnek az orosz nyelvben a npogdeccuonajronbiū xeapzonusm (szakmai szleng) és a npogeccuonarvnoe npocmopeuue (szakmai köznyelv) címkéknek. Finnben azonban csak egy kategória létezik, az ammattislangi (szakmai szleng; lásd Sanastotyon kūsikirja 1989: 12). Azt is meg kell jegyezni, hogy egyes adatok a terminológiai gyűjteményekben implicit módon is kifejeződhetnek. I. példa: a „törölt” címke egyes esetekben való jelenléte, más esetekben pedig hiánya egy terminológiai gyűjteményben azt jelenti, hogy a címkével nem jelölt terminusok az aktív szaknyelvi készlethez tartoznak. 2. példa: ha két vagy több terminus ugyanabban a szócikkben szerepel, ez általában azt jelenti, hogy szinonimák vagy ekvivalensek. A terminológiai erőforrások adatainak cseréje vagy összesítése szükségessé teheti az ilyen implicit adatok explicitté tételét. Például, ha az adatokat statikus szócikkek helyett ontológia formájában tárolják, akkor az implicit információ a szócikkek „szétszerelése” során kerül mentésre. AZ ADATKATEGÓRIÁK ISO-SZABVÁNYÚ JEGYZÉKEI ÉS OSZTÁLYOZÁSAI Az ISO 12620:1999 terminológiai információk rögzítésére szolgáló adatkategóabout synonyms and equivalents mentioned above has to be made explicit riák egy halmazát határozza meg. Nem írja elő, hogy milyen adatkategóriákat kell használni, hanem inkább jegyzékként szolgál. Ezt az adatkategória-halmazt az ISOcat projekt (www.isocat.org) bővíti, amely széles körben elfogadott nyelvészeti adatkategóriákat dokumentál. Noha az ISOcat projekt kétségtelenül hasznos a nyelvészek számára, akik így jobb lehetőséget kapnak a nyelvészeti fogalmak kategorizálására és meghatározására, valamint a terminológiai adatbankok tervezői számára, akik egy átfogó jegyzékből kész adatkategóriákat választhatnak, valószínűtlen, hogy megoldást hoz az adatok cseréjének, összesítésének és a több adatbázisban végzett teljes szócikkes keresésnek a problémájára. Először is, nem akadályozhatja meg a terminológiai termékek összeállítóit abban, hogy az adatokat más módon osztályozzák, illetve hogy saját adatkategóriáikat használják. Terminologija | 2009 | 16 39 Másodszor, minél több adatkategóriát használnak a terminológiai gyűjteményekben, annál változatosabbá válnak, ami még nagyobb kihívást jelent az adatcsere szempontjából. Az adatkategóriák listája elméletileg végtelen, a gyakorlatban pedig igen terjedelmes. Például az ISOcat leltárban a terminológiához kapcsolódó adatkategóriák listája már meghaladja az 500 tételt. Az ISOcat projektben alkalmazott egyik gyakorlat ezt a számot sokszorosá- ra növelheti. A zárt és félig zárt osztályok értékeinek egyedi adatkategóriákként való bemutatására gondolunk. Például a register adatkategória olyan értékei, mint a vulgarRegister slangRegister stb. most már önálló adatkategóriákként jelennek meg. Hasonlóképpen, a reliabilityCode adatkategória a reliabilityCodel, reliabilityCode2 stb. kategóriákra van felosztva. Lehetnek eltérő vélemények arról, hogy ez gyakorlati szempontból ésszerű-e, de az adatok sokféleképpen szervezhetők, ezért nincsenek formális korlátozások az adatkategóriák egészen azokig a primitív osztályokig történő felosztására, amelyek csak az igen és a nem értéket fogadhatják el. Eközben az ISO 12620:1999 szabványban javasolt adatkategória-osztályozás több szempontból is problematikus. Először is vannak bizonyos következetlenségek az adatok fő felosztását illetően. A 6.2. szakasz (Az adatkategóriák tipológiája) szerint 6.2 (Az adatkategóriák tipológiája). az adatkategóriákat három fő csoportba sorolják: a terminusok és a terminusokkal kapcsolatos információk, a leíró adatok és az adminisztratív adatok. A D. mellékletben (Az adatkategóriák rendszeres felsorolása) azonban a második csoport elnevezése: a fogalomleíráshoz kapcsolódó adatkategóriák. Ugyanakkor ez a csoport tartalmazza a Megjegyzés alkategóriát is, amely „önmagában áll, mivel a többi kategória bármelyikéhez társítható, ezért nem rendelhető alá egyetlen másik konkrét alkategóriának sem” (ISO 12620:1999: 4). Ha feltételezzük, hogy a tervezett felosztás négy csoportot foglalt magában: a terminussal és a terminussal kapcsolatos információkat, a fogalommal kapcsolatos információkat, az adminisztratív adatokat és a Megjegyzést, ez a besorolás továbbra is számos kérdést vet fel. Hogy csak clear, however, that this realm of data categories needs proper structuring and classification in order to remain manageable and well-organized. néhányat említsünk: -Miért fogalmi adatok a példák és a kontextusok, nem pedig terminussal kapcsolatos adatok? Vö. a kontextusadat-kategória leírását: „Egy olyan szöveg vagy szövegrész, amelyben egy terminus előfordul” (ISO 12620:1999: 25). -Miért a szinonima és az ekvivalencia terminussal kapcsolatos adatok, miközben egyébként minden, a jelentéssel kapcsolatos dolog fogalommal kapcsolatos adat? Vö. az ekvivalenciafok adat kategóriájának leírását: „Az a mérték, amennyire két vagy több fogalom intenzi ói átfednek” (ISO 12620:1990: 21). 40 Igor Kudashev | A terminológiai kompatibilitás javítása... -Miért adminisztratív adatok az ellentétek és a homográfok, és miért nem terminusvagy fogalomközpontú adatok? -Miért (csupán) fogalomközpontú adatok az audio-, videóstb. anyagok? A terminológ- - What is the exact definition of administrative data? Why this class includes such heterogeneous categories? iai adatok fogalomközpontú és terminusközpontú adatokra történő felosztása technikai szempontból hasznos lehet, mert támogatja a fogalomorientált megközelítést, amely a szinonim terminusok ugyanahhoz a fogalomhoz való kapcsolásával csökkenti a terminusok közötti kapcsolatok számát. Az ilyen felosztás azonban általában, és különösen annak az ISO 12620:1999 szabványban történő megvalósítása kihívást jelenthet a terminológiai adatbázisok általános felhasználói — a fordítók és a szakterületi szakértők — számára. Valóban, nem könnyű megérteni, miért a szinonimákat a terminusközpontú adatok között kell keresni, az ellentéteket viszont az adminisztratív adatok, a példákat pedig a fogalomközpontú adatok között. Az általános felhasználók terminusokkal — szavakkal és szókapcsolatokkal — dolgoznak, ezért számukra természetesebb a terminus jelentéséről, egy terminus szinonimáiról, a terminushasználat példáiról stb. beszélni. Ez azt jelenti, hogy a több gyűjteményben végzett teljes bejegyzéses keresés biztosítását célzó adatkategória-osztályozásnak terminusorientáltnak, intuitívan egyértelműnek és általános nyelvészeti kategóriákon alapulónak kell lennie. AZ ADATKATEGÓRIÁK KÖZÖTTI ELTÉRÉSEK ÁTHIDALÁSA Az adatkategóriák közötti eltérések problémája leképezés segítségével oldható meg. Ha az eltérések névlegesek, például ha az adatkategóriák nevei különböznek, vagy ugyanazt a tartalmat eltérő módon mutatják be, közvetlen megfeleltetés alkalmazható az adatkategóriák között. A közvetlen megfeleltetés alkalmazását követően az összesített erőforrásban ugyanolyan pontossággal lehet keresni az adatokat, mint az eredeti adatbázisokban. Az adatkategóriák közötti lényegesebb különbségek megkövetelik egy közös nevező megtalálását az adatkategória-halmazok osztályozásai közötti megfeleltetés révén. A közös nevező használata némileg csökkenti a keresés pontosságát, de ez az egyetlen módja annak, hogy eltérő szerkezetű terminológiai erőforrásokban közös keresést biztosítsunk. Ha a felhasználó nem áll készen arra, hogy feláldozza a keresés pontosságát, minden egyes gyűjteményben külön keresést kell végeznie. Az adatcsere általános gyakorlatához hasonlóan egy köztes formátum, azaz az adatkategóriák valamiféle közvetítő osztályozásának használata hosszú távon hatékonyabb, mint a különböző osztályozások közötti többszörös megfeleltetés. Terminologija | 2009 | 16 41 A más osztályozások közötti közös interfészként szolgálni szándékozott adatkategória-osztályozás általános alapelvei a következők: 1. Mivel az osztályozás osztályai közös nevezőként szolgálnak, az absztrakció magasabb szintjén kell állniuk, mint a legtöbb „primitív” adatkategóriának, amelyeket nem bontanak tovább. Ugyanakkor az absztrakció szintje nem lehet túl magas, mivel a felhasználókat nem érdekelné a túl általános osztályozás. A gyakorlatban két absztrakciós szintű osztályozás elegendő. 2. Az osztályozásnak le kell fednie az LSP-kifejezések minden olyan típusát, amelyeket terminológiai adatbázisokban jellemzően leírnak, beleértve a terminuselemeket, a tulajdonneveket, a nomenklatúrát, az állandósult szókapcsolatokat stb. 3. Az osztályozásnak csak azokat az adatkategóriákat kell tartalmaznia, amelyek közvetlenül kapcsolódnak az LSP-kifejezések leírásához. A technikai és adminisztratív szempontok (pl. adathordozó, kódolások, források, megbízhatóság stb.) leírása ettől eltérő feladat. 4. Az osztályozásnak hierarchikusnak kell lennie, de ugyanazon absztrakciós szinten több felosztási alap alkalmazását is lehetővé kell tenni. 5. Az osztályozásnak bővíthetőnek kell lennie, vagyis a hierarchia minden szintjén tartalmaznia kell az „egyéb” kategóriát. Ezeket az alapelveket össze kell hangolni a fent említett felhasználóbarátság követelményével. Véleményünk szerint az adatok nyelvi funkciókon alapuló osztályozása ez utóbbi szempontból különösen erős jelölt. A nyelvi funkciókon alapuló összekapcsoló osztályozásban a hangsúly az adatkategóriák neveiről az általuk tartalmazott adatok funkciójára vagy funkcióira helyeződik át. Az itt tehető összehasonlítás egy könyvtár az alfabetikus és tárgyi katalógusaival. Az adatkategóriák nevei alapján történő keresés hasonló az alfabetikus katalógus segítségével végzett kereséshez. A cím némi támpontot ad a könyv tartalmáról, de néha félrevezető lehet. Emellett a felhasználók nem tudják kitalálni az összes lehetséges címet, amely egy bizonyos témát lefed. Az alfabetikus katalógus olyan esetekben hasznos, amikor a felhasználók biztosan tudják, hogy mely tételt vagy tételeket akarják megtalálni. A legtöbb könyvtárhasználó azonban a tárgyi katalógussal kezdi a keresést, mert előre nem tudja, hogy mely tételek tárgyalják az őt érdeklő témát. Terminológiai portál, amely több terminológiai gyűjteményt aggregál42 Igor Kudashev | A terminológiai... különböző adatkategória-készletekkel, ugyanazt a problémát veti fel a felhasználók számára, mint a könyvtár polcain található könyvek világa. A felhasználók tudják, milyen típusú információ érdekli őket (nyelvtan, jelentés, használat stb.), de nem feltétlenül tudják, hogy ez az információ milyen adatkategóriákban található meg. A különböző terminológiai gyűjteményekben hasonló típusú adatok eltérő adatmezőkben helyezkedhetnek el. Például egy LSP-kifejezés areális státuszára vonatkozó információ olyan mezőkben található meg, mint a használat, a regionális címke, a nyelvi szimbólum stb. Ha a keresés az adatok nyelvi funkcióin alapul, a felhasználóknak nem kell törődniük az adatkategóriák pontos elnevezésével. Csupán megadják, hogy az areális státuszra, jelentésre vagy szinonimákra vonatkozó információt keresnek, a terminológiamenedzsment-rendszer pedig megkeresi és megjeleníti a különböző adatbázisokban található teljes vagy rövidített szócikkeket, amelyek a megadott típusú információt tartalmazzák. A funkció szerinti keresést ki lehet és ki is kell egészíteni a mezők neve szerinti kereséssel azon felhasználók számára, akik pontosan tudják, mely mezőkben szeretnének keresni. információ. Például az example egy tipikus többfunkciós mező, amely különböData fields, like library items, may contain different kinds of linguistic ző arányokban tartalmazhat információt egy terminus alakjáról, jelentéséről és használatáról. Minden adatkategória leírható úgy, hogy egy vagy több funkcióval rendelkezik. Lehetővé kell tenni annak meghatározását is, hogy egy adott adatkategória milyen mértékben tükröz bizonyos funkciókat. Ez a jellemző lehet verbális (pl. elsődleges és másodlagos funkció) vagy numerikus (pl. 0—-100%). Egy adott adatkategória-halmaznak egy adott típushoz való hozzárendelésének legegyszerűbb módja az egységesítés és egy egyszerű megfeleltetési tábla készítése. A pontosabb, ugyanakkor the intermediate classification is to consider the contents of data fields of bonyolultabb megfeleltetés lehetővé tenné a szerkesztők számára, hogy meghatározzák az egyes adatmezők eltéréseit a globális megfeleltetési táblában használt értékektől. Például a kontextusok általában információt nyújtanak a terminus használatáról és jelentéséről. Ésszerű ezeket az információtípusokat belefoglalni a megfelelések globális táblázatába, mivel minden kontextusmezőre vonatkoznak. Egyes kontextusok azonban enciklopédikus információkat is tartalmazhatnak. Az enciklopédikus információk ilyen alkalmi használata helyileg, mezőszinten jelölhető. Terminologija | 2009 | 16 43 AZ ADATKATEGÓRIÁK OSZTÁLYOZÁSA AZ ADATOK NYELVI FUNKCIÓI ALAPJÁN Mivel az LSP-kifejezések nyelvi jelek, a rájuk vonatkozó információk feloszthatók a formájukra, jelentésükre, használatukra, más egységekhez való viszonyaikra, eredetükre és fejlődésükre vonatkozó információkra. Az alábbiakban ezen osztályok mindegyikét részletesen ismertetjük, és néhány, hozzájuk tartozó adatra példát is közlünkA formához kapcsolódó adatok Az LSP-kifejezéseknek két formájuk van — írott és szóbeli. Emellett az LSP-kifejezés formájához kapcsolódó adatok három osztályba sorolhatók: a kanonikus formához kapcsolódó adatok; az egység kialakulásához kapcsolódó vided. Please see Appendix 1 for the compact version of the classification. adatok; az egység ragozásával kapcsolatos adatok. A KANONIKUS ALAKKAL KAPCSOLATOS ADATOK A kanonikus alak az az alak, amelyben a címszó az adatbázisban szerepel. „Képviselőként” szolgál más alakok számára. Például a legtöbb európai nyelvben a főnevek kanonikus alakja az egyes számú alanyeset, az igéké pedig az infinitivus jelen ideje. A kanonikus alak kiválasztásának szabályai azonban nyelvenként és lexikográfiai hagyományonként eltérnek. Íme néhány példa az írott kanonikus alakhoz kapcsolódó adatokra: a kifejezés típusai írott alakjuk szerint (pl. teljes alak, rövidített alak, szimbólum, képlet stb.); az alak helyesírása; az alak helyesírási változatai; elválasztás, A szóbeli kanonikus formához kapcsolódó adatok példái: a kifejezés típusa a szóbeli formája szerint (pl. betűszó, mozaikszó); kiejtés; a forma kiejtési változatai; szótagolás. Amint látható, egyes adatkategóriák mind az írott, mind a szóbeli formákhoz kapcsolódhatnak. Például annak jelzése, hogy egy adott kifejezés betűszó, vagyis a teljes terminus kezdőbetűiből alkotott rövidített forma, amelyben ezeket a betűket egyenként ejtik ki (pl. United Nations — UN), mind az írott, mind a szóbeli formáról információt nyújt. Ezenkívül vonatkozhat 44 [gor Kudashev | A terminológiai... kompatibilitásának javítása - 4.1.8. Data related to register restrictions. <termUsage: restrictions: register > 4.1.9. Data related to professional group restrictions. <termUsage: restricciókra: szakmai csoport > 4.1.10. A kombinatorikai korlátozásokkal kapcsolatos adatok. <termUsage: restrictions: combinatory> 4.1.11. A megfelelőségi korlátozásokkal kapcsolatos adatok. <termUsage: restrictions: compliance> 4.2. A használat gyakoriságával kapcsolatos adatok. <termUsage: frequency> 5. A rendszerszerű kapcsolatokkal kapcsolatos adatok. <termRelations> 5.1. Szinonim kapcsolatokkal kapcsolatos adatok. <termRelations: synonymousRelation> 5.2. Antonim kapcsolatokkal kapcsolatos adatok. <termRelations: antonymousRelation> 5.3. Homonim kapcsolatokkal kapcsolatos adatok. <termRelations: homonymousRelation> 5.4. Paronim kapcsolatokkal kapcsolatos adatok. <termRelations: paronymousRelation> 5.5. Az általános relációkra vonatkozó adatok. <termRelations: genericRelation> 5.6. A rész-egész relációkra vonatkozó adatok. <termRelations: partitiveRelation> 5.7. A nem hierarchikus ontológiai relációkra vonatkozó adatok. <termRelations: non-hierarchicalOntologicalR elation> 5.8. Az ekvivalenciarelációkra vonatkozó adatok. <termRelations: equivalenceRelation> 6. A származásra és fejlődésre vonatkozó adatok. <termOriginAndDevelopment > 7. Az LSP-kifejezés leírásához kapcsolódó egyéb adattípusok <termOtherRelated Data > 2. FÜGGELÉK NÉHÁNY ISO 12620:1999-- ES ADATKATEGÓRIA TERMINOLÓGIAI ADATOK FUNKCIONÁLIS OSZTÁLYOZÁSÁBA TÖRTÉNŐ LEKÉPEZÉSÉNEK PÉLDÁJA A kategóriák rövidség kedvéért használt formális reprezentációjának feloldását lásd az I. függelékben. Az adat kategóriája után álló kérdőjel azt jelenti, hogy a megadott típusú adat jelenléte az adat kategóriájának értelmezésétől függ. Ha az alkategóriák pontosan ugyanúgy képezhetők le, mint a fölérendelt kategóriájuk, csak a fölérendelt kategória kerül leírásra. Terminologija | 2009 | 16 51 A terjedelmi korlátok miatt az ISO 12620:1999 szabvány adat-kategóriáinak csak az első alcsoportját tárgyaljuk. A.1 terminus Note: term (headword) lies outside the scope of classification which covers data categories related to the description of LSP expressions. However, Technikailag a term kategória azonos a terminus írott alakjával. Funkcionális osztályozás: nem alkalmazható vagy <termForm: writtenForm> A.2.1 terminustípus Megjegyzés: az ISO 12620:1999 szabványban ez a kategória magában foglalja az LSP-kifejezések különféle fajtáit, és különböző típusú adatokat tartalmazhat. További információért lásd az alkategóriákat. A.2.1.1 fő terminusbejegyzés Megjegyzés: a szócikk szerkezetére vonatkozó információ nem kapcsolódik az LSP-kifejezések leírásához. Ez a kategória azonban közvetve a preferenciát tükrözi. Funkcionális osztályozás: nem alkalmazható vagy <termUsage: restrictions: compliance> A.2.1.2 szinonima Megjegyzés: amikor a fő szócikkterminussal áll szemben, ez a kategória a preferenciát tükrözi. Elsődleges funkciója azonban a szinonim viszonyok tükrözése. Funkcionális osztályozás: <termRelations: synonymousRelation>; <termUsage: restrictions: compliance>? A.2.1.3 kvázi-szinonima Megjegyzés: as ugyanaz, mint az előző. Funkcionális osztályozás: <termRelations: synonymousRelation>; <termUsage: restrictions: compliance>? A.2.1.4 nemzetközi tudományos terminus Megjegyzés: e kategória és tartalmának értelmezésétől függően ez az adatkategória a megfelelésről és a nyelvi korlátozásokról szolgáltathat információt. eredet és fejlődés. Funkcionális osztályozás: <termUsage: restrictions: compliance>; <termUsage: restrictions: language>? ; <termQOriginAndDevelopment>? A.2.1.5 közhasználatú név Megjegyzés: a közhasználatú név egy nemzetközi tudományos kifejezés szinonimája, is amelyet in az általános közbeszédben használnak. Ez az adatkategória információkat nyújthat a nyilvántartással, a megfeleléssel és a szakmai csoporttal kapcsolatos korlátozásokról. 52 Igor Kudashev | Javítás Kompatibilitás of Terminológiai... Funkcionális osztályozás: <termUsage: restrictions: register>; <termUsage: restrictions: compliance- >; <termUsage: restrictions: professional Group>? A.2.1.6 internacionalizmus Megjegyzés: a tartalomtól függően ez az adatkategória a nyelvi korlátozásokkal, a terminusképzéssel, a keletkezéssel és a fejlődéssel kapcsolatos információkat tartalmazhat. Funkcionális osztályozás: <termUsage: restrictions: language>; <termForm: termFormation>7; <termQriginAndDevelopment>? A.2.1.7 teljes forma Megjegyzés: ez az adatkategória a terminus formája szerinti típusára vonatkozó információt tartalmaz. Funkcionális osztályozás: <termForm: term Type> A.2.1.8 a terminus rövidített formája Megjegyzés: a tartalomtól függően ez az adatkategória és valamennyi alkategóriája (A.2.1.8.1 rövidítés. A.2.1.8.2 a terminus rövid formája, A.2.1.8.3 betűszó, A.2.1.8.4 mozaikszó és A.2.1.8.5 csonkolt terminus) a terminus formája, szóbeli formája szerinti típusára, a terminusképzésre, eredetére és fejlődésére vonatkozó információt tartalmazhat. Funkcionális osztályozás: <termForm: termType>; <termForm: oralForm>7, <termForm: termFormation>? : <termOriginAndDevelopment> A.2.1.9 változat Megjegyzés: a tartalomtól függően ez az adatkategória a preferenciára, a terminusképzésre, eredetére és fejlődésére vonatkozó információt tartalmazhat. Funkcionális osztályozás: <termUsage: restrictions: compliance>; <termForm: termFormation>? ; <termQriginAndDevelopment>? A.2.1.10–A.2.1.14 (transzliterált forma, átírt forma, romanizált forma, szimbólum és képlet) Megjegyzés: ezek az adatkategóriák a terminus formája alapján annak típusáról nyújtanak információt. Funkcionális osztályozás: <termForm: termType> A.2.1.15–A.2.1.- 17 (egyenlet, logikai kifejezés, anyaggazdálkodási kategóriák) Megjegyzés: ezek az egységek nem lehetnek címszavak terminológiai Functional classification: not applicable. adatbázisokban. A.2.1.18 frazeológiai egység Megjegyzés: az ISO 12620:1999 szabványban ez a kategória három alkategóriára oszlik: kollokáció, állandósult kifejezés és szinonim kifejezés. A kollokáció nem tekinthető frazeológiai egységnek, mivel nem felel meg a szabványban megadott frazeológiai egység definíciójának. Terminologija | 2009 | 16 53 A szinonim frazéma kategóriája szükségtelennek tűnik. Ugyanez az információ két másik adatkategóriával is kifejezhető: állandósult kifejezés és szinonima. Functional classification: not applicable. A.2.1.18.1 kollokáció Megjegyzés: ez az adatkategória a kombinációs korlátozásokról nyújt információt. Funkcionális osztályozás: <termUsage: restrictions: combinatory> A.2.1.18.2 állandósult kifejezés Megjegyzés: ez az adatkategória a terminus típusáról nyújt információt a jelentésének a formájához való megfelelése alapján. Funkcionális osztályozás: <termMeaning: termType> A.2.18.3 szinonim kifejezés Megjegyzés: amint azt fentebb kifejtettük, ez a kategória valószínűleg szükségtelen. Használata esetén információt nyújt a terminus típusáról a jelentésének a formájával való megfelelése, valamint a szinonim kapcsolatok tekintetében. Funkcionális osztályozás: <termMeaning: termType>; <termRelations: synonymousRelation> A.2.1.19 szabványos szöveg Megjegyzés: a szabványos szövegek terminológiai adatbázisokban nem lehetnek címszavak. Functional classification: not applicable. A TERMINOLÓGIAI ADATKÉSZLETEK ÖSSZEEGYEZTETHETŐSÉGÉNEK JAVÍTÁSA AZ ADATKATEGÓRIÁK OSZTÁLYOZÁSÁNAK ALKALMAZÁSÁVAL Az információs és különösen a terminológiai erőforrások fejlesztésének egyik tendenciája az egyes adatbázisok nagy portálokká történő egyesítése és az ilyen portálok közötti kapcsolatok létrehozása. Erre példa lehet az EuroTermBank (http://www.curotermbank.com- ). Az információ mennyiségének és a felhasználók által az ilyen termékekkel szemben támasztott követelményeknek a növekedésével egyre nagyobb szükség van a kiterjesztett keresés biztosítására, amely a szótári szócikkek valamennyi mezőjére kiterjed, valamint annak lehetőségére, hogy csak azokat az információs kategóriákat jelenítsük meg, amelyek az adott pillanatban érdeklik a felhasználót. E feladatok megoldásához olyan adatkat-egória-osztályozásra van szükség, amely különböző struktúrájú terminológiai adatbázisok „közös nevezőjeként” alkalmazható. Az ilyen osztályozás fontos követelménye — az egyszerűsége és áttekinthetősége a terminológiai termékek egyszerű felhasználói számára. A cikkben tárgyalt, a nyelvi adatok funkcióin alapuló osztályozás ilyen „közös nevezővé”® válhat >4 Igor Kudashev | A terminológiai kompatibilitás javítása... AZ ADATOK OSZTÁLYOZÁSA MINT A TERMINOLÓGIAI GYŰJTEMÉNYEK KOMPATIBILITÁSÁNAK JAVÍTÁSÁT SZOLGÁLÓ ESZKÖZ. Az információs erőforrások fejlesztésének egyik jelenlegi irányzata általában az információs, különösen pedig a terminológiai gyűjtemények korábban széttagolt adatainak nagy portálokba történő egyesítése, valamint közös interfészek létrehozása. Példaként szolgálhat az EuroTermBank (http://www.eurotermbank.com). Az információ mennyiségének növekedésével és a felhasználók teljes értékű termékek iránti igényeivel párhuzamosan nő az igény egy kibővített keresés megvalósítására, amely valamennyi szótári szócikkre kiterjed, továbbá lehetővé teszi a felhasználókat jelenleg érdeklő információs kategóriák megjelenítését is. Ezek a feladatok az információs kategóriák olyan osztályozását igénylik, amely alapul szolgálhat a terminológiai adatok megfelelő strukturálásához. A teljes körű osztályozással szemben támasztott legfontosabb követelmények egyike a terminológiai termékek egyszerű felhasználói számára való egyszerűsége és érthetősége. A cikk a „közös nevező” szerepére pályázó egyik lehetséges jelöltet írja le — a nyelvészeti adatokon alapuló osztályozást. Beérkezett: 2009-10-14 Igor Kudashev University of Helsinki Palmenia Továbbképzési Központ Postafiók 239. (Paraatikentti 6) FIN-45100 Kouvola, Finnország E-mail: igor. [email protected] Terminologija | 2009 | 16 55