Paieškos sistemos „Google“ naudojimo galimybės tiriant kalbos reiškinius
Full text
266 Kalbos Kultūra | 81 SKAISTĖ ALEKSANDRAVIČIŪTĖ lietuvių kalbos institutas A GOOGLE KERESŐRENDSZER HASZNÁLATI LEHETŐSÉGEK NYELVI JELENSÉGEK VIZSGÁLATÁBAN A litván nyelvészek egyre gyakrabban jelzik tanulmányaikban, hogy bizonyos adatok – a használati példáktól a gyakorisági értékek számszerű kifejezéséig – gyűjtésekor valamely internetes keresőrendszert használtak. Leggyakrabban a legnagyobb Google keresőrendszert említik, amely azonban sajnos nem kellően alkalmas nyelvek vizsgálatára. ezért meglehetősen furcsa, hogy általában csak a Google-ra mint az egyik forrásra hivatkoznak, de nem adják meg a keresési módszert, és nem mélyednek el a keresőrendszer, illetve a nyelv bizonyos sajátosságaiban, amelyek megkönnyíthetik vagy megnehezíthetik a keresést, pontosíthatják vagy torzíthatják az eredményeket. A keresési módszer mind a használati példák gyűjtésekor, mind pedig különféle nyelvi jelenségek elterjedtségének vizsgálatakor fontos, amikor a számszerű kifejezéseknek jelentőségük van. A tanulmány a keresősor összeállításának alapelveit tárgyalja, figyelembe véve a keresőrendszer és a litván nyelv sajátosságait, amelyek meghatározzák a keresés sikerességét. A tanulmány egy 2007–2008-ban végzett, új jövevényszavak (a továbbiakban – Ns) relatív gyakoriságára vonatkozó kutatásra támaszkodik, amelynek fő célja az volt, hogy meghatározza a ritkának, közepes gyakoriságúnak és gyakorinak tekinthető Ns-ek közötti határokat. A munka abból a feltételezésből indult ki, hogy a kutatás során megállapított gyakorisági viszonyítási pontok később hasznosak lesznek más Ns-ek használatbeli elterjedtségének értékelésében is. ez a nyelvi normázási tevékenységben is hasznos lehet, ezért a cikk célja a keresési karakterlánc összeállítási módjának bemutatása. A kutatás anyagát a 2005–2006-os sajtóban és dokumentumokban, valamint (20 egyes számú és 5 2007 m. internete rasti Ns1 – iš viso 201. sąrašas labai įvairus: jame 33 veiks mažodžiai, 168 vardažodžiai, tarp kurių pasitaikė 25 trūktinos paradig mos többes számú főnév) szereplő, angol és más 1 szavak alkotják; a lista a Litván Nyelv Normázásának, Használatának, Oktatásának és Terjesztésének 2006–2015. évi programja alapján, a Litván Nyelvi Intézet Nyelvművelési Osztályán végzett „Az új litván nyelvi idegen szavak használatának vizsgálata: 1998–2008” című projekt kartotékájának felhasználásával készült.
s. alEKsaNDraVIčIūtĖ. A Google keresőrendszer használatának lehetőségei a nyelvi jelenségek vizsgálatában: 267 nyelv eredetéből származó Ns-ek. Megjegyzendő, hogy egyes, Ns-ként vizsgált szavak szerepelnek a Nemzetközi szavak szótárában (tŽŽ 2001), és nemzetközi szavaknak tekinthetők. Az internet rendkívül heterogén és folyamatosan változó tér. A kutatás során az internetes oldalakat sem témák, sem stílusok szerint nem osztották fel (bár a Google keresőrendszerében ez is lehetséges), mivel a Ns-ek általános használatbeli elterjedtségéről kívántak átfogó képet kialakítani. Az internetes diskurzus sajátos jellemzői miatt ebben a tanulmányban kissé általánosítva beszélünk, hangsúlyozzuk a feltételességet, jelentős figyelmet fordítunk a lehetséges hibákra, és sok helyütt a nyelvi intuícióra támaszkodunk. A tanulmány első részében a keresési karakterlánc összeállításának alapelveit mutatjuk be, mind az általánosakat, mind a konkrétan ismertetett kutatásra jellemzőket. A másodikban – a keresési mező leszűkítésének módjait és ennek szükségességét indokló okokat ismertetjük. 1. A KERESÉSI KARAKTERLÁNC ÖSSZEÁLLÍTÁSÁNAK ALAPELVEI A Google-keresést általában úgy végzik, hogy a keresőmezőbe beírják a keresett szó alapformáját. Ez a keresési mód részben elegendő a használati példák gyűjtéséhez, azonban valószínű, hogy jelentős részük észrevétlen maradhat, ami még kevésbé előnyös a szavak gyakoriságának vizsgálatakor, ahol a számszerű kifejezések fontosak. A probléma abból adódik, hogy a Google keresőrendszere részben felismeri, hogy a beírt szónak más alakjai is lehetnek, és ezeket is felveszi a találatok közé. Azonban mindenekelőtt a keresési algoritmus az egyszerű felhasználó számára nem teljesen világos; nem egyértelmű, hogy a szó hány és milyen alakja kerül be a találatok közé. másodszor, a keresőrendszer nem ismeri fel a szófajokat. tegyük fel, hogy az ige főnévi igenévi alakjának beírásakor a találatok között ugyanazon tőhöz tartozó főnevek is előfordulnak, például az autorizuoti szó beírásakor a rendszer olyan szövegeket is megjelenít, amelyekben az autorizacija szó szerepel. Az utóbbi két ok miatt célszerűbb valamivel összetettebb, a nyelvi kutatások szempontjából azonban hasznosabb keresést végezni. Különféle próbák során megállapították, hogy a legcélszerűbb a szó teljes ragozási paradigmáját vagy annak nagy részét beírni. A keresősort az korlátozza, hogy a Google keresőmezőjébe legfeljebb 32 jelentéssel bíró kulcsszó fér el.
268 Kalbos Kultūra | 81 Ajánlatos a szó ragozott alakjait idézőjelbe tenni, mert a Google rendszerében csak így értelmezhető a megjelölt szöveg pontos idézetként. A szó valamennyi ragozott alakját az or (angolul vagy) logikai kötőszó kapcsolja össze. Az így összeállított keresési karakterlánc a következőképpen néz ki: „akreditavimas” vagy „akreditavimo” vagy „akreditavimui” vagy „akreditavimą” vagy „akreditavimu” vagy „akreditavime” vagy „akreditavimai” vagy „akreditavimų” vagy „akreditavimams” vagy „akreditavimus” vagy „akreditavimais” vagy „akreditavimuose” A relatív Ns-gyakoriság említett vizsgálatát a Google keresőrendszer „litván nyelvű oldalakon” szűrőjének használatával végeztük, ezért már kritikát is kaptunk. Ezt azzal indokolták, hogy az információ mintegy kétharmada elvész, vagyis a használati példák megközelítőleg ennyi része, mivel nem minden internetes webhely tulajdonosa adja meg a webhelyek nyelvi metaadatait. a szavak relatív gyakoriságának vizsgálatához azonban ez teljes mértékben elegendő. továbbá e szűrő használata nélkül rendkívül nehéz elkülöníteni a keresőrendszer által angol nyelven megadott szövegeket, ezek akadályozzák a használati példák gyűjtését. ezért úgy véljük, hogy a litván nyelvű weboldalakon végzett keresés megfelelőbb, csak fontos, hogy ezt a korlátozást mindenütt következetesen alkalmazzuk. Írásjelek A Google keresőrendszere egyformán reagál bármilyen írásjelre, még akkor is, ha azok idézőjelben szerepelnek, és pontos idézetként kellene őket értelmezni. Vagyis a keresőmezőbe beírt „account‘as” kifejezést két különálló szóként értékeli, és összevonja az „account:as”, az „account as” vagy más hasonló esetekkel. A keresőrendszer ezen sajátossága két esetben fontos. Először, amikor az Ns két szóból áll, a rendszer nem teszi lehetővé az olyan írásváltozatok megkülönböztetését, mint az „ex post” és az „expost”; ez fontos lehet a kötőjelhasználat értékelésekor. Ezekben az esetekben a gyakorisági eredmények egybeolvadnak, azonban amikor a szavak összesített, nem pedig egyes írásváltozataik gyakoriságát hasonlítjuk össze, a keresés során nem szükséges az ilyen formákat egymástól megkülönböztetni. másodszor, amikor az Ns aposztróffal írt változatait vizsgálják, valamivel összetettebb problémákkal szembesülünk, mivel egyes litván toldalékok egybeesnek: a) egyes angol szavakkal (pl.: as – „mint”, is – „van”, us – „minket”); b) egyes litván szavakkal (az o kötőszóval, az į elöljárószóval, az ei, ai indulatszavakkal); c) diakritikus jelek nélkül („ékezetek nélkül”) leírt litván szavakkal (is – „iš”, as – „aš”).
s. alEKsaNDraVIčIūtĖ. A Google keresőrendszer használatának lehetőségei a nyelvi jelenségek vizsgálatában 269 a keresés során az utóbbi pontatlanságokat nagyon nehéz ellenőrizni, a szóvégi Ns ortográfiai egybeesését pedig a litván szavakkal egyáltalán nem lehet. Mindazonáltal azok az esetek, amikor az Ns után közvetlenül valamelyik említett, a ragozási formáns írásbeli kifejezésével egybeeső litván szó következik, nem olyan gyakoriak, hogy jelentősen befolyásolják a kutatási eredményeket. A keresési sort alkotó ragozott alakok kiválasztása Főnevek a főnévi Ns-ek vagy azok írásváltozatainak gyakoriságát vizsgálva a keresési sorba a legtöbb esetben a teljes eseti és számbeli ragozási paradigmát írták be. Kivételt képeztek a hiányos ragozási paradigmájú szavak (20 egyes számú és 5 többes számú főnév), valamint a többértelműség esetei (ezeket a tanulmány második része részletesebben tárgyalja). továbbá az ortográfiai egybeesés miatt más ragozott alakokkal, valamint csekély elterjedtsége miatt nem érdemes külön felvenni a megszólító esetet. így a főnevek ragozási paradigmájának csaknem egésze lefedhető. A főnévi Ns-ek ragozását illetően még tárgyalni kellene a nem problémás kérdését is. Egyes esetekben a nőnemet az Ns helyesírási változatának lehet tekinteni, például: googlė / gūglė / google‘ė / googl‘ė; puzlė / puzzlė / pūzlė; skypė / skaipė. Ezekben az Ns-ekben közös, hogy élettelen tárgyakat jelölnek, ezért a litván nyelvben nem ragozódnak nem szerint, továbbá az is, hogy autentikus alakjuk végén egy bár nem ejtett, de írásban jelölt -e végződés található, vö. google, puzzle, skype. A vizsgálat során megfigyelték, hogy ilyen esetekben a nőnemű alakok jóval ritkábbak, mint a hímneműek; ez az optimalitáselmélet azon feltevésével magyarázható, hogy „ellentmondás esetén a legkevésbé jelölt kategóriát választják” (Vaicekauskienė 2007: 177). A melléknevek, valamint az élő objektumokat jelölő főnevek hímés nőnemét szintén nem tekintették különálló lemmáknak, noha bizonyos jelentéskülönbség fennáll. Loreta Vaicekauskienė, aki részletesen vizsgálta az Ns-eket a litván nyelvben, megjegyzi, hogy „[a]zokban az esetekben, amikor egy főnév mindkét nemhez tartozó személyek megnevezésére használható, úgy tűnik, először a hímnem általánosítása történik meg, amelyből szükség esetén időnként nőnemű alakot képeznek” (Vaicekauskienė 2007: 175). A hímés nőnemű alakokat szintén nem tekintették különálló lemmáknak a Gyakorisági jelenlegi magától értetődő, hogy
270 Kalbos Kultūra | 81 Az írott litván nyelv szótára (DDrlKŽ 1998: XIV–XV, XVI). A keresési karakterláncok megalkotásakor ezt figyelembe kell venni, mivel a Google keresőrendszerrel dolgozva lehetetlen elkülöníteni a hímnemű és nőnemű ragozási formák egybeeséseit. Igék Az igék esete összetettebb, mivel az ige nyelvtani kategóriáinak száma jóval nagyobb. Mivel, amint azt korábban már említettük, a Google keresési karakterláncának hossza korlátozott, fel kell tenni a kérdést, hogy az ige mely formái a legreprezentatívabbak a gyakoriság szempontjából, és melyeket kell beilleszteni a keresési karakterláncba. a nagyobb igei disztribúció lefedése érdekében a keresősorba a leggyakrabban használt alakokat kell beírni. Ehhez adatokkal kell rendelkezni a nyelvtani kategóriák gyakoriságáról a litván nyelvben, lehetőleg az elektronikus diskurzusban (ED). Eddig az ED-t mint az írott és beszélt nyelv mellett önálló nyelvváltozatot szélesebb körben Asta Ryklienė vizsgálta, ám az általa választott kutatási módszertan nem szolgáltatja a szükséges adatokat a nyelvtani kategóriák ED-beli megoszlásáról. E szerző munkájának célja az ED összehasonlítása volt az írott és beszélt nyelvvel (Ryklienė 2001: 3), az írott nyelvben és az ED-ben a szófajok, valamint a szóalakok mennyiségi különbségeit pedig az e nyelvváltozatokban leggyakrabban használt ötven szó és szóalak jegyzékének összevetésével vizsgálták (Ryklienė 2001: 9). E tanulmány Vida Žilinskienė és Erika Rimkutė litván nyelvi szóalakhasználatra vonatkozó kutatásaira támaszkodik. Igaz, e szerzők munkái abban különböznek, hogy V. Žilinskienė E. Rimkutėvel ellentétben a szóalakok gyakoriságát vizsgálva két funkcionális stílust – a publicisztikai és a hivatalos stílust – hasonlítja össze. Abból a véleményből kiindulva, hogy az ED nyelve közelebb áll a publicisztikai, mint a hivatalos stílushoz, e tanulmány szerzője a publicisztikai stílus nyelvtani formáinak gyakoriságára vonatkozó statisztikára támaszkodik. V. Žilinskienė és E. Rimkutė adatai nagyon hasonlóak – az egyenes igei mód az esetek 92,12%-át (Žilinskienė 2002: 110), 91,5%-át foglalja magában. (rimkutė 2006: 35) az ige teljes disztribúciója; az ige ragozott formái – 55,48 százalék (Žilinskienė 2002: 110), 50,7 százalék (rimkutė 2006: 35); a főnévi igenév – 15,85 százalék (Žilinskienė 2002: 111). Igaz, E. rimkutė (2006: 35) némileg más formában adja meg a főnévi igenév elterjedtségét – állítása szerint a főnévi igenév a nem ragozott igei formák 33,6 százalékát teszi ki, amelyek teljes elterjedtsége 49,3 százalék.
s. alEKsaNDraVIčIūtĖ. A Google keresőrendszer használatának lehetőségei a nyelvi jelenségek vizsgálatában 271 főnévi igenevet és a szenvedő igenév atsižvelgiant į pastaruosius duomenis, į paieškos eilutę parankiausia įtraukti visas tiesioginės nuosakos asmenuojamąsias veiksmažodžio formas, hímnemű többes számú alanyesetét (az ortográfiai egyezést a főnévi igenévvel összehasonlítva). Mind a 26 grammatikai forma (összesen 21 jelentéshordozó keresőszó, mivel a harmadik személy minden igeidőben megegyezik) valamivel több mint felét teszi ki az ige teljes disztribúciójának. Példa a keresősorra: „baninti“ or „baninu“ or „banini“ or „banina“ or „baniname“ or „banina te“ or „baninau“ or „baninai“ or „banino“ or „baninome“ or „baninote“ or „baninsiu“ or „baninsi“ or „banins“ or „baninsime“ or „baninsite“ or „banindavau“ or „banindavai“ or „banindavo“ or „banindavome“ or „ba nindavote“ Amint korábban már említettük, a Google keresőrendszere nem veszi figyelembe az írásjeleket, és az aposztrófos írásváltozatokat két különálló szónak tekinti. Mivel a Google keresősorának hossza korlátozott, az aposztrófos igeírásváltozatok vizsgálatakor a keresősorból elhagyhatók a múltbeli gyakorisági idő ragozott formái, mivel a múltbeli gyakorisági idő V. Žilinskienė és E. Rimkutė adatai szerint az igeidők közül a legritkább. Természetesen, ha szükség van ugyanazon szó különböző írásváltozatai gyakoriságának összehasonlítására, szélesebb körű keresést is lehetne végezni, azaz több keresősor összeállításával. azonban a szavak, nem pedig azok ragozott alakjainak gyakoriságát összehasonlítva a tárgyalt módszer vélhetően elegendő. csak fontos mindenütt következetesnek lenni, és ugyanazokat a keresési kritériumokat alkalmazni valamennyi igére. Iš to, kas pasakyta šiame skyrelyje, aišku, kad paieškoje įmanoma aprėpti daugiau ar mažiau visą vardažodžių kaitybos paradigmą, o veiksmažodžių – csak valamivel több mint a ragozási paradigma felét, ezért elvész a jelentős összehasonlítási alap. Természetesen ki lehetne számítani az igék és a névszók gyakoriságarányának együtthatóját, ehhez azonban részletesebb ED-vizsgálatokra van szükség. Egyelőre nem lenne célszerű az egyes igék és névszók gyakoriságát összehasonlítani. tehát a névszók és az igék ragozott alakjainak eltérő mintanagysága miatt a gyakorisági vizsgálatokban célszerűbb őket két csoportra osztani.
272 Nyelvi Kultúra | 81 A használat internetes kereséssel történő vizsgálatakor a helyesírási változatok esetében a korpuszmódszerhez képest fordított műveletet végzünk, mivel a keresési karakterlánc összeállításakor mintegy előre meg kell jósolni, hogy az egyes szavaknak milyen helyesírási változatai lehetnek. A nyelvi jelenségek internetes keresésekor kerülni kell az angol eredetű szavak autentikus írásmódváltozatait, a keresési sorokban véletlenül előfordulókat pedig el kell távolítani. Az említett kutatás során megfigyelték, hogy ennek elmulasztása esetén szinte lehetetlen annyira leszűkíteni a keresési mezőt, hogy az eredmények közé ne kerüljenek angol nyelvű betétek vagy idézetnek tekinthető kifejezések. Például a baby vagy crazy szavak keresésekor nagyon sok olyan szöveget kapunk, amelyekben dalcímek szerepelnek: Baby one more time, Crazy stb. Hasonló a funky esete is, mivel ezzel nemcsak egy zenei stílust jelölnek, hanem egy korábban nagyon népszerű litván zenei együttest is. Mindazonáltal az ilyen szavak relatív gyakoriságának értékelésekor ezeket az írásmódváltozatokat figyelembe kell venni, mert a használatban meglehetősen gyakoriak. Olyan írásmódváltozatokat vizsgálnak, amelyek nyelvi intuíció alapján lehetségesnek tűnnek. Az ortográfiailag adaptálható idegen szóhoz a képzés szempontjából lehetséges ragozási végződéseket kapcsolják. Amikor az Ns ortográfiailag nem adaptálható, a ragozási végződéseket közvetlenül az Ns ragozhatatlan alakjához kapcsolják. Különlegesebb esetek azok, amikor a nem ragozott Ns alak magánhangzóra végződik, mert az Ns írásmódváltozatainak aposztróf nélküli vizsgálatakor az elmarad (kiderült, hogy a smileas, skypeas, googleas és a hozzájuk hasonló írásmódváltozatok a használatban ritkák). A mindeddig még nem standardizált nyelvi jelenségek vizsgálatakor gyakran felmerülhet a kérdés, hol húzódik a határ az írási hiba és az írásmódváltozat között. Ezt a határt a gyakorisági jellemző határozza meg. Például az említett Ns-vizsgálatban a 10 előfordulási eset határát el nem érő Ns írásmódváltozatokat nem vették figyelembe az egyes Ns-ek összesített gyakoriságának kiszámításakor, és írási hibáknak – a használat általános tendenciáit nem jelző, egyedi tévesztéseknek – tekintették. Igaz, ezt az elvet csak az 1000 előfordulási eset határát meghaladó szavakra alkalmazták, a ritkábbakra nem. Mindazonáltal néha az is jelentős lehet, hogy a vizsgált nyelvi jelenséget egyáltalán nem találták meg az interneten, vagy nem érte el a 10 előfordulási eset határát. Az ezen elvek alapján összeállított és kiválasztott írásmódváltozatok gyakoriságát jelölő számértékeket összeadják, és így megkapják a szó hozzávetőleges gyakoriságát. Az alábbiakban egy táblázat következik, amelyben a keresési eredmények feldolgozása világosabban látható.
s. alEKsaNDraVIčIūtĖ. A Google keresőrendszer használatának lehetőségei a nyelvi jelenségek vizsgálatában 273 1. TÁBLÁZAT. Az adatok NS gyűjtésének módja helyesírási változat A keresősor az egyes helyesírási változathoz NS A helyesírási változat gyakorisága puzlas „puzlas“ or „puzlo“ or „puzlui“ or „puzlą“ or „puzlu“ or „puzle“ or „puzlai“ or „puzlų“ or „puzlams“ or „puzlus“ or „puzlais“ or „puzluose“ puzlė „puzlė“ or „puzlės“ or „puzlei“ or „puzlę“ or „puzlėje“ 3210 or „puzlėms“ or „puzles“ or „puzlėmis“ or „puzlėse“ puzlis „puzlis“ or „puzlio“ or „puzliui“ or „puzlį“ or „puzliu“ or „puzlyje“ or „puzliai“ or „puzlių“ or 6430 „puzliams“ or „puzlius“ or „puzliais“ or „puzliuose“ puzzlė „puzzlė „puzzlėms“ or „puzzlėmis“ or „puzzlėse“ puzzlis „puzzlis“ or or „puzzlės“ or „puzzlei“ or „puzzlę“ or „puzzlė 458 je“ or „puzzlio“ or „puzzliui“ or „puzzlį“ or „puzzliu“ or „puzzlyje“ or „puzzliai“ or „puzzlių“ or „puzzliams“ or „puzzlius“ or „puzzliais“ or „puzzliuose“ pūzlė „pūzlė“ or „pūzlės“ or „pūzlei“ or „pūzlę“ or 711 „pūzlėje“ 239 or „pūzlėms“ or „pūzles“ or „pūzlėmis“ or „pūzlėse“ or „puzzlai“ or „puzzlų“ or „puzzlams“ or „puzzlus“ or „puzzlais“ puzzlas „puzzlas“ or „puzzlo“ or „puzzlui“ or „puzzlą“ or „puzz lu“ or „puzzluose“ pūzlis „pūzlis“ or „pūzlio“ or „pūzliui“ or „pūzlį“ or „pūzliu“ or „pūzlyje“ or „pūzliai“ or „pūzlių“ or „pūzliams“ or „pūzlius“ or „pūzliais“ or „pūzliuose“ puzzle‘as „puzzle’as“ or 315 „puzzle’o“ or „puzzle’ui“ or „puzzle’ą“ or „puzzle’u“ or „puzzle’e“ „puzzle’ais“ or or „puzzle’ai“ or „puzz le’ų“ or „puzzle’ams“ or „puzzle’us“ or 167 101 „puzzle’uose“ are 80 11 711 Minden vizsgált Ns számára hasonló táblázatot készítettek. Az első oszlopban az összes vizsgált Ns helyesírási változatot sorolják fel gyakoriság szerint rendezve, mert
274 Nyelvi kultúra | A 81. cikk eltekint annak mérlegelésétől, hogy az Ns melyik írásváltozata tekinthető címszónak (lemmának). a második oszlopban az egyes írásváltozatok keresési sorai szerepelnek, miután a keresési mezőt már leszűkítettük, azaz eltávolítottuk az összes többjelentésű alakot (lásd a 2. fejezetet). a harmadik oszlopban az egyes írásváltozatok gyakorisága van feltüntetve (ezek az adatok csak köztes jellegűek), amelyet később összeadnak, így megkapják a vizsgált szó hozzávetőleges gyakoriságát. csak ez utóbbi adatok jelentősek az Ns relatív gyakorisági határainak meghatározásakor (a táblázatban szereplő adatokat 2008 márciusa–áprilisa között gyűjtötték). 2. A KERESÉSI MEZŐ LESZŰKÍTÉSE Az angol nyelvű eredmények túlsúlya miatt Az angol homográf (azonos írású) szavak és az aposztróffal írt változatok problémája részben megoldható a „kivéve” logikai függvény használatával, amelyet a Google rendszerében a „” jellel jelölnek. ez azt jelenti, hogy a keresést nem végzik el azokon a weboldalakon, amelyeken előfordul az e jel után álló szó. ezért ha a keresési sor végén megadunk egyet az angol nyelv leggyakoribb szavai közül, és megjelöljük az említett jellel, jelentősen csökkenthető az angol nyelvű találatok száma. Az említett kutatásban mindenütt az angol nyelv egyik leggyakrabban használt szavára, az are2-re (van – a jelen idő többes szám harmadik személye) vonatkozó korlátozást alkalmaztak, de más választás is lehetséges. csak arra kell figyelmet fordítani, hogy e célra az angol szót különös gondossággal kell kiválasztani, mivel egyes leggyakoribb angol szavak ortográfiailag egybeeshetnek egyes litván szavakkal is (angl. it, be), ragozási végződésekkel (angl. is, as, a, I) vagy „hibás” írásmódú esetekkel (angl. is, as, I). ezenkívül az angol nyelv leggyakoribb szavainak jelentős része (a, the, of) segédfunkciót tölt be, és gyakran használják különféle címekben, amelyek litván internetes oldalakon is előfordulhatnak. ugyanez a korlátozás alkalmazandó minden olyan esetben is, amikor a keresési sort egy ragozhatatlan (eredeti vagy adaptált helyesírású) Ns-forma alkotja, függetlenül attól, hogy az adott szó mely nyelvből kerülhetett a litván nyelvbe. 2 Az angol nyelv 500 leggyakrabban használt szava: http://www.world-english. org/english500.htm (megtekintve: 2008. 06. 07.).
s. alEKsaNDraVIčIūtĖ. A Google keresőrendszer használatának lehetőségei a nyelvi jelenségek vizsgálatában 281 FORRÁSOK A www.google.lt keresőrendszer the 500 Most commonly used Words in the English language: http://www. world-english.org/english500.htm tŽŽ 2001 – Nemzetközi szavak szótára, Vilnius: alma littera. VDu A kortárs litván nyelv szövegtára: http://donelaitis.vdu.lt lItEratūra DDrlKŽ 1998: l. Grumadienė, V. Žilinskienė. A kortárs írott litván nyelv gyakorisági szótára, Vilnius: Litván Nyelvi Intézet. G a ive n i s K., Kei ny s s. 1990: Nyelvészeti terminusok szótára, Kaunas: Šviesa. Jakaitienė E. 1980: A litván nyelv lexikológiája, Vilnius: Mokslas. Jakaitienė E. 2005: Lexikográfia, Vilnius: Tudományos és Enciklopédiai Kiadóintézet. lKE 1999: A litván nyelv enciklopédiája, Vilnius: Tudományos és Enciklopédiai Kiadóintézet. Rimkutė E. 2002: Homofonikus alakok a mai litván nyelv korpuszában. – Lituanistica 2(50), 86–101. Rimkutė E. 2003: A morfológiai többértelműség tipológiája. – Lituanistica 4(56), 60–78. Rimkutė E. 2006: A morfológiai többértelműség korlátozása a számítógépes korpuszban. Doktori disszertáció, Kaunas. Rimkutė E., Grybinaitė A. 2004: A litván nyelv morfológiai többértelműségének leggyakoribb típusai és automatikus egyértelműsítésük. – Kalbų studijos 5, 74–78. Ryklienė A. 2001: Elektroninis diskursas: kalbos ypatybės ir stilius. Daktaro disertacijos santrauka, Vilnius. Vaicekauskienė L. 2007: Naujieji lietuvių kalbos svetimžodžiai. Kalbos politika ir vartosena, Vilnius: Lietuvių kalbos institutas. Žilinskienė V. 2002: Žodžių formų vartojimas lietuvių kalbos dalykinio ir publicistinio stilių duomenimis. – Lituanistica 1(49), 106–116. Gauta 2008 07 08
282 Kalbos Kultūra | 81 POSSIBILITIES OF USING tHE sEarcH sYstEM GOOGLE IN lINGuIstIc rEsEarcH Összefoglalás A tanulmány bemutatja azt a módszertant, amelynek segítségével a Google adatgyűjtési és -tárolási eszközként alkalmazható, valamint egy nyelvi jelenség interneten való elterjedése vizsgálható. A módszert egy olyan vizsgálat keretében írjuk le, amelynek célja az új jövevényszavak relatív gyakoriságának meghatározása 2007 és 2008 között. A cikk első része a lekérdezés helyének kitöltésére vonatkozó fő elveket ismerteti: az általános elveket, valamint az egyes leíró kutatásokra jellemző specifikus elveket. Ahelyett, hogy csupán a fő szóalakot írnánk be, javaslat született a szó teljes nyelvtani paradigmájának vagy annak jelentősebb részének megadására, figyelembe véve, hogy a Google lekérdezési mezőjében a kulcsszavak maximális száma 32. A második rész a keresési tartomány leszűkítésének módjait és annak okait ismerteti. Az ilyen típusú kutatás szükségszerűen szembesül a szavak és szóalakok kétértelműségének problémájával. A kétértelműség kifejezést azért választottuk, hogy elkerüljük az olyan specifikusabb kifejezésekkel való összetévesztést, mint a homonimák, homográfok, homofónok stb. Ezenfelül a fenti kifejezések magyarázata gyakran a szó fonetikai aspektusát hangsúlyozza, ami az internetes keresés szempontjából irreleváns. A fenti kifejezések bizonyos kétértelműségi esetekben nem kellően pontosak, például amikor az egyik szóalak helyesírása egybeesik ugyanazon szó egy másik alakjáéval. A keresés módszere fontos szerepet játszik a nyelvhasználat különféle példáinak összegyűjtésében, valamint gyakoriságuk vizsgálatában. A kölcsönszavak relatív gyakoriságának módszere szintén alkalmazható a nyelvi standardizálásban, például az új kölcsönszavak listáinak összeállításakor, amelyeket súlyos hibáknak tekintenek. sKaIstĖ alEKsaNDraVIčIūtĖ lietuvių kalbos institutas P. Vileišio g. 5, lt10308 Vilnius [email protected]
