This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.
Onderzoeksgebieden: taal van kinderen en jongeren, taalvoorkeuren, computationele linguïstiek.
DOI: doi.org/10.35321/all86-08
EUROPESE TAALGELIJKHEID IN HET DIGITALE TIJDPERK: DE CASUS LITOUWEN
Europese taalgelijkheid in het digitale tijdperk: de casus Litouwen
ANNOTATIE
Het artikel behandelt de huidige stand van de Litouwse taaltechnologieën en presenteert de situatie van de Europese taalgelijkheid in de digitale omgeving. Het onderzoekt kwantitatieve en kwalitatieve indicatoren die taalgelijkheid onthullen in de context van de Europese Unie, rekening houdend met het aantal sprekers, digitale taalhulpbronnen en technologieën en de ondersteuning daarvan, met bijzondere aandacht voor de casus Litouwen. Het artikel beoogt het werk dat reeds op het gebied van taaltechnologieën is verricht te schetsen en de hiaten en uitdagingen te identificeren die nog moeten worden aangepakt in het geval van het Litouws als officiële nationale en EU-taal. Het biedt het meest recente overzicht van de situatie van de Litouwse taaltechnologieën door middel van een analyse van digitale taalhulpbronnen en hulpmiddelen/diensten. De resultaten tonen aan dat er in de afgelopen tien jaar weliswaar een aantal veranderingen heeft plaatsgevonden, maar dat er nog steeds een tekort is aan taalhulpbronnen in het onderwijs en andere domeinen.
TREFWOORDEN: Europese talen, taalhulpbronnen, taalhulpmiddelen/diensten, taalgelijkheid, taaltechnologieën.
184
Acta Linguistica Lithuanica LXXXVI
Page 2
European Language Equality in the Digital Age: The Case of Lithuania
SAMENVATTING
In het artikel wordt geschreven over de toestand van de Litouwse taaltechnologieën en wordt de situatie van de Europese taalgelijkheid in de digitale omgeving uiteengezet. Er worden kwantitatieve en kwalitatieve indicatoren onderzocht die taalgelijkheid onthullen in de context van de Europese Unie, rekening houdend met het aantal sprekers, digitale taalhulpbronnen en technologieën en de ondersteuning daarvan, met bijzondere aandacht voor de analyse van de casus Litouwen. Dit artikel heeft tot doel het tot dusver verrichte werk op het gebied van taaltechnologieën te benadrukken en de hiaten te belichten en de uitdagingen bloot te leggen waarmee de officiële nationale en Europese Unie-taal — het Litouws — wordt geconfronteerd en die zij probeert op te lossen. Het artikel biedt een actueel overzicht van de toestand van de Litouwse taaltechnologieën door digitale taalhulpbronnen en hulpmiddelen/diensten te analyseren. De resultaten tonen aan dat er in de afgelopen 10 jaar aanzienlijke veranderingen hebben plaatsgevonden, maar dat er nog steeds een tekort is aan hulpbronnen in het onderwijs en andere domeinen.
KERNWOORDEN: Europese talen, taalhulpbronnen, taalhulpmiddelen/diensten, taalgelijkheid, taaltechnologieën.
INLEIDING
Taaltechnologieën zijn onderling verbonden en hebben (in)direct invloed op een aantal dagelijkse activiteiten: werk, onderwijs, communicatie enz. Taal ligt ten grondslag aan de meeste digitale hulpbronnen: mobiele apparaten, sociale netwerken, virtuele assistenten, vertaalhulpmiddelen, spellingcontrole enz. (Pastor et al. 2017: 19). Uiteraard komen deze ontwikkelingen niet alle Litouwse burgers in gelijke mate ten goede. We moeten erkennen dat technologieën die aan het Litouws zijn aangepast nog steeds ontbreken en dat sprekers vaak moeten terugvallen op het Engels. Dit is vooral belangrijk bij het beoordelen van de levensvatbaarheid en de kracht van een taal, omdat het gebrek aan taaltechnologieën uiteindelijk kan leiden tot een afname van het taalgebruik. De situatie van de Litouwse taaltechnologieën voldoet nog niet aan alle behoeften.
Volgens de gegevens van 2021 van het Litouwse Departement voor Statistiek gebruikt in de leeftijdsgroep van 16–74 jaar bijna 87% van de Litouwse bevolking het Internet (tegenover bijna 64,1% in 2011 en 74,4% in 2016), maar liefst 100% in de leeftijdsgroep van 16–24 jaar en 55,2% in de leeftijdsgroep van 65–74 jaar.¹ Volgens de gegevens van 2021 beschikt 81,4% van de huishoudens over een personal computer en 86,6% over toegang tot het Internet.² Het Internet wordt voornamelijk gebruikt voor het opzoeken van informatie, communicatie, vrijetijdsbesteding en bankieren: 79% van de bevolking van 16–74 jaar gebruikt
het Internet voor communicatie; 74% leest het nieuws; 71% gebruikt het Internet voor vrijetijdsbesteding (films of tv-programma’s bekijken, naar muziek luisteren, opnamen en games afspelen of downloaden); 68% gebruikt onlinebankdiensten. Ondertussen gebruikt 27% van de bevolking het Internet om te leren, zich professioneel te ontwikkelen of voor zelfstudie.³ Volgens de gegevens van 2021 gebruikt 82,2% van de 16–74-jarigen het Internet voor persoonlijke doeleinden; zo communiceert 65,2% via sociale netwerken en maakt 70,5% van de bevolking in real time contact (bijv. via Skype, Messenger, WhatsApp, Viber, Snapchat).⁴ In 2021 waren ongeveer 225.000 .lt-domeinen geregistreerd (tegenover ongeveer 139.000 in 2012 en ongeveer 188.000 in 2018), waarvan er meer dan 2.000 letters met Litouwse diakritische tekens (ė, ž enz.) bevatten. Bovendien behoort Litouwen nog steeds tot de koplopers op het gebied van glasvezel-Internet. In Litouwen bedraagt de dekking van het glasvezelnetwerk 46,8%.⁵
Op 13 oktober 2020 keurde de Seimas van de Republiek Litouwen een belangrijk document voor de Litouwse taal en haar toekomst goed, de Richtlijnen voor de ontwikkeling van de Litouwse taal in de digitale omgeving en de voortgang van taaltechnologieën voor 2021–2027.⁶ De Richtlijnen werden opgesteld door een werkgroep die was gevormd door de Staatscommissie van de Litouwse Taal. Deze Richtlijnen moeten helpen het volledige gebruik van het Litouws in de digitale omgeving te waarborgen en de status van het Litouws in de informatiemaatschappij vast te stellen en te handhaven. Hiervoor moeten digitale taalhulpbronnen — tekst- en spraakcorpora — worden uitgebreid, taaltechnologieën worden ontwikkeld en daarop gebaseerde openbare diensten worden gecreëerd, zodat geen enkele maatschappelijke groep of regio de digitale kloof hoeft te ervaren en vreemde talen gemakkelijker in de Litouwse samenleving kunnen integreren. Taaltechnologieën moeten helpen de banden tussen de Litouwse samenleving en de diaspora te versterken en de uitsluiting van de Litouwstalige gemeenschap in de mondiale kennismaatschappij te verminderen (Jaroslavienė, Miliūnaitė 2020).
De Richtlijnen formuleren de essentiële taken of uitdagingen van de Litouwse taaltechnologieën. Zij bepalen wat er in Litouwen in de nabije toekomst moet gebeuren en in welke richtingen moet worden gewerkt: 1. De deskundigheid van specialisten die op het gebied van taaltechnologieën werken vergroten en het vermogen van de samenleving om de door taaltechnologieën geboden mogelijkheden te benutten naar een hoger niveau tillen.
European Language Equality in the Digital Age: The Case of Lithuania
2. Open, betrouwbare, hoogwaardige en herbruikbare digitale taalhulpbronnen en andere digitale taaldatasets verzamelen en verrijken. 3. De infrastructuur voor taaltechnologieën ontwikkelen, de toepassing van taaltechnologieën in de publieke sector en openbare diensten bevorderen, en publiek beschikbare informatietechnologische oplossingen en hulpmiddelen creëren en verbeteren (Guidelines 2020).
Het is goed om te weten dat er aanzienlijke vooruitgang is geboekt bij het aanpassen van het Litouws aan de digitale omgeving: er zijn een aantal digitale taalhulpbronnen en basishulpmiddelen voor taalanalyse, complexe online-taaldiensten en de ontologie van de Litouwse taal ontwikkeld, en een aantal computerprogramma’s en hulpmiddelen is gelokaliseerd. Voor de samenleving relevante toegepaste computersoftware wordt in het Litouws vertaald en er wordt gewerkt aan de standaardisering van computertermen. Litouwse onderzoekers nemen actief deel aan samenwerkings- en mobiliteitsactiviteiten van internationale verenigingen, en er is een kern gevormd van Litouwse taalspecialisten die werkzaam zijn op het gebied van de toepassing van informatietechnologie en systematisch innovatieve werken op dit gebied ontwikkelen. Litouwen streeft er ook naar dat alle burgers volledige toegang hebben tot digitale oplossingen; daarom is het beleid voor de aanpassing ervan aan mensen met een beperking van groot belang (Guidelines 2020).
Het onderwerp van dit artikel zijn de digitale hulpbronnen en hulpmiddelen/diensten van de Litouwse taal. Het artikel beoogt gegevens over Litouwse digitale hulpbronnen te onderzoeken en de huidige stand van de ontwikkeling van het Litouws in de digitale omgeving te tonen, met inachtneming van de algemene Europese context. Dit doel omvat de volgende doelstellingen: 1) de status van de Litouwse taaltechnologieën in de meertalige Europese context bespreken; 2) de analyse uitvoeren van de empirische gegevens die in het onderzoek zijn verzameld; 3) de belangrijkste sterke en zwakke punten, kansen en bedreigingen bepalen die ten grondslag liggen aan de situatie van het Litouws in de digitale omgeving. De onderzoeksgegevens werden7 in 2021–2022 verzameld in het kader van het door de Europese Commissie gefinancierde project “European Language Equality”8 (hierna – ELE).
7 De auteur betuigt haar dank aan de Staatscommissie van de Litouwse Taal, de Universiteit van Vilnius, de Vytautas Magnus-universiteit en Tilde IT voor hun hulp bij het verzamelen van gegevens over taalhulpbronnen.
8 Vierentwintig officiële talen en meer dan 60 regionale en minderheidstalen vormen het weefsel van het taallandschap van de EU. Dit project beantwoordt aan deze oproep en legt de basis voor een strategische agenda en routekaart om digitale taalgelijkheid in Europa tegen 2030 werkelijkheid te maken. Het primaire doel van ELE is het voorbereiden van het European Language Equality Programme, in de vorm van een strategische onderzoeks-, innovatie- en implementatieagenda en een routekaart om tegen 2030 volledige digitale taalgelijkheid in Europa te bereiken. Dit programma werd gezamenlijk voorbereid met de gehele Europese gemeenschap van taaltechnologie, computationele linguïstiek en taalgerichte AI, evenals met vertegenwoordigers van relevante initiatieven en verenigingen, taalgemeenschappen
Straipsniai / Articles
187
Page 5
ANŽELIKA GAIDIENĖ, AURELIJA TAMULIONIENĖ
Het doel van de activiteiten voor het verzamelen van metadata was de componenten te achterhalen die bijdragen aan het niveau van technologische ondersteuning van de Litouwse taal.
In de eerste fase van het verzamelen van metadata richtten we ons op Litouwse taalhulpbronnen en technologieën, dat wil zeggen corpora, ook wel datasets genoemd (verzamelingen van onbewerkte of geannoteerde, mono-, bi- of meertalige, mono- of multimodale tekstsegmenten of documenten, audiotranscripties, scripts, audio- en video-opnamen enz., evenals leerderscorpora en gebarentaalcorpora); taalbeschrijvingen bestaande uit taalmodellen en computationele grammatica’s; lexicale/conceptuele hulpbronnen, bestaande uit computationele lexica, terminologische databases, gazetteers, ontologieën, termenlijsten, thesauri enz.; hulpmiddelen/diensten: diensten die via het web, andere netwerken of in de cloud worden aangeboden, maar ook downloadbare hulpmiddelen, broncode enz. (Giagkou, Piperidis 2021: 9). Hieronder vallen basistools voor NLP voor de Europese talen (morfologische analysatoren, POS-taggers, lemmatiseerders, parsers enz.), auteursmiddelen (bijv. spelling-, grammatica- en stijlcontroleprogramma’s), hulpmiddelen/diensten voor het zoeken, extraheren en delven van informatie, tekst- en spraakanalyse, automatische vertaling, begrip en generatie van natuurlijke taal, spraaktechnologieën enz. In de tweede fase werd een aanvullende ronde van metadata-verzameling uitgevoerd. Tijdens de tweede fase richtten we ons op het identificeren van LT-stakeholders in Europa en nationale en Europese LT-gerichte projecten, openbare financiering voor LT/NLP/AI of andere contextuele factoren die uit de voorlopige definitie van ELE naar voren konden komen (Giagkou, Piperidis 2021: 9).
De verzamelde Litouwse taalhulpbronnen werden beschreven aan de hand van één metadataformulier dat door alle leden van ELE moest worden ingevuld en de volgende verplichte en aanbevolen elementen bevatte. Verplichte elementen: type hulpbron (een classificatie van hulpbronnen in typen: corpora, lexicale/conceptuele hulpbronnen, grammatica’s/(taal)modellen, hulpmiddelen/diensten); naam van de hulpbron (een voor mensen leesbare naam of titel waaronder de hulpbron bekend is); landingspagina; beschrijving (een korte, vrije tekst die informatie over de hulpbron biedt); taal/talen (de taal/talen die door een corpus of lexicale/conceptuele hulpbron worden gedekt of de invoertaal van een hulpmiddel/dienst); subklasse van corpus; subklasse van lexicale/conceptuele hulpbron; subklasse van grammatica/model; mediatype(n) van onderdelen (alleen voor corpora en lexicale/conceptuele hulpbronnen); mediatype(n) van invoer (alleen voor hulpmiddelen/diensten); taalafhankelijk (alleen voor hulpmiddelen/diensten) enz. Aanbevolen elementen: korte naam van de hulpbron; financieringstype; publicatiejaar van de hulpbron; licentie; homepage van de bron; organisatie/aanbieder: de organisatie die verantwoordelijk is voor het aanbieden, beheren, onderhouden en beschikbaar stellen van de hulpbron; enz.
— en RML-groepen (meer informatie over het project beschikbaar op: https://european-language-equality.eu/about/).
188
Acta Linguistica Lithuanica LXXXVI
Page 6
European Language Equality in the Digital Age: The Case of Lithuania
1. EUROPESE TAALGELIJKHEID: IS ZIJ (ON)MOGELIJK?
Het taallandschap van de Europese Unie (hierna – de EU) is rijk en divers. Het bestaat uit 24 officiële talen en meer dan 60 nationale en regionale talen. Deze taalkundige en culturele diversiteit vormt een essentieel onderdeel van het erfgoed van elke staat, dat in de EU zeer wordt gewaardeerd en bevorderd, met bijzondere aandacht voor meertaligheid. Meertaligheid als EU-waarde wordt geleid door het motto “Verenigd in verscheidenheid”, dat voor het eerst in 2000 werd gebruikt.⁹ De EU besteedt bijzondere aandacht aan regionale of minderheidstalen, gedreven door haar inzet om deze te beschermen: “Het Europees Handvest voor regionale talen of talen van minderheden is het Europese verdrag voor de bescherming en bevordering van talen die door traditionele minderheden worden gebruikt. Samen met het Kaderverdrag inzake de bescherming van nationale minderheden vormt het de inzet van de Raad van Europa voor de bescherming van nationale minderheden”.¹⁰ De gelijkheid van de Europese talen wordt unaniem erkend als een van de grootste sterke punten van de EU. Zij brengt echter ook een aantal uitdagingen met zich mee, aangezien elke staat zich in een verschillende demografische, geopolitieke, culturele enz. situatie bevindt en onvermijdelijk met uiteenlopende barrières, waaronder taalkundige, wordt geconfronteerd; op het gebied van taaltechnologieën bestaat er een aanzienlijke kloof. Dit wordt ook benadrukt in de door het Europees Parlement aangenomen resolutie “Taalgelijkheid in het digitale tijdperk”.¹¹
De aantallen sprekers van de officiële EU-talen geven aan (zie Fig. 1) dat de volgende talen de vijf meest gesproken talen zijn: Engels (ongeveer 30%), Duits (17%), Frans (15%), Spaans (8%) en Italiaans (7%).
De gegevens over de dominante talen (de top vijf) veranderen niet wanneer alle talen van de EU worden geëvalueerd (zie bijvoorbeeld Fig. 2). Sinds het ontstaan van de EU is uitdrukkelijk verklaard dat Europa zijn taalkundige en culturele diversiteit behoudt; daarvoor worden aanzienlijke bedragen uitgetrokken (Rehm, Uszkoreit 2013: 12–14). De huidige situatie laat echter zien dat talen met minder sprekers nog steeds met verschillende taalbarrières worden geconfronteerd en dat voortdurend wordt besproken hoe deze taalongelijkheid met digitale middelen kan worden verminderd, aangezien het onmogelijk is zoveel EU-talen zonder technologische ondersteuning te leren.
⁹ Meer informatie beschikbaar op: https://european-union.europa.eu/principles-countries-history/symbols/eu-motto_lt.
¹⁰ Meer informatie beschikbaar op: https://www.coe.int/en/web/european-charter-regional-or-minority-languages?.
¹¹ Meer informatie beschikbaar op: https://www.europarl.europa.eu/doceo/document/TA-8-2018-0332_EN.html.
Straipsniai / Articles
189
Page 7
ANŽELIKA GAIDIENĖ, AURELIJA TAMULIONIENĖ
Fig. 1: Aantal sprekers van de officiële EU-talen 12
Als we de situatie van de Europese taalgelijkheid bekijken aan de hand van het aantal sprekers, zien we dat alle EU-talen als volgt kunnen worden gegroepeerd: de meest kwetsbare talen staan helemaal bovenaan (Fig. 2), en deze lijst van talen is vrij uitgebreid; relatief gezien zouden we een grens kunnen trekken tot aan het Ests. De middengroep wordt gevormd door talen die door een vrij klein aantal sprekers worden gesproken, maar die niettemin op grond van andere indicatoren van taaltechnologieën en technologische ondersteuning hogere posities innemen (Fig. 3). Onderaan zien we een lijst van officiële EU-talen die de sterkste positie innemen op basis van het aantal sprekers en andere indicatoren (zie verder). Ondanks het feit dat regionaal erkende talen op gelijke voet met andere EU-talen kunnen functioneren, mag de veronderstelling dat officiële talen de sterkste status hebben niet worden verworpen, en is de technologische kloof nog steeds zeer groot.
12 Gegevens afkomstig van: https://european-language-equality.eu/languages/.
190
Acta Linguistica Lithuanica LXXXVI
Page 8
European Language Equality in the Digital Age: The Case of Lithuania
Fig. 2: Aantal sprekers van de EU-talen
De meest recente gegevens uit 2022 over taalhulpbronnen en de steun die voor hun ontwikkeling is toegewezen (zie Fig. 3) tonen aan dat het Engels nog steeds de best ondersteunde taal is. Frans, Duits en Spaans concurreren eveneens en hun resultaten zijn in sommige dimensies vergelijkbaar met die van het Engels. Andere officiële EU-talen krijgen matige ondersteuning; sommige talen krijgen echter slechts geringe of geen ondersteuning. Nationale of regionale talen ontvangen eveneens fragmentarische ondersteuning; andere talen zijn grensgevallen wat het ondersteuningsniveau betreft. De analyse leidt tot de algemene conclusie dat geen enkele natuurlijke taal optimaal door technologieën wordt ondersteund, d.w.z. dat voor geen enkele taal het vereiste ondersteuningsniveau is bereikt, zelfs niet voor het Engels (Gaidienė, Tamulionienė 2022: 17).
Straipsniai / Articles
191
Page 9
ANŽELIKA GAIDIENĖ, AURELIJA TAMULIONIENĖ
Fig. 3: Stand van de technologische ondersteuning in 2022 (figuur uit: Gaidienė, Tamulionienė 2022: 17). Lichtgrijs: zwakke/geen ondersteuning; grijs: fragmentarische ondersteuning; donkergrijs: goede ondersteuning
192
Acta Linguistica Lithuanica LXXXVI
Page 10
European Language Equality in the Digital Age: The Case of Lithuania
In het kader van het ELE-project werd het voortgangsniveau dat sinds 2012 voor elke taal was bereikt, vergeleken (voor meer informatie, zie Vaišnienė, Zabarskaitė 2012). We kunnen zien (zie Fig. 4) dat het technologische niveau van talen opmerkelijk is veranderd (bijv. het wijdverbreide gebruik van virtuele assistenten en chatbots, verbeterde mogelijkheden voor tekstanalyse enz.). De resultaten van deze analyse tonen alleen de relatieve status van talen, niet de vooruitgang die voor een specifieke taal is geboekt. Op het gebied van taaltechnologie is in de afgelopen tien jaar opmerkelijke vooruitgang geboekt, maar de kloof tussen best ondersteunde en minder ondersteunde talen blijft duidelijk zichtbaar.
Fig. 4: Algemene stand van de technologische ondersteuning voor geselecteerde Europese talen (2022) (figuur uit: Gaidienė, Tamulionienė 2022: 18)
Het is moeilijk te zeggen of Europese taalgelijkheid haalbaar is. Er bestaat een grote kloof wanneer we het aantal sprekers, taalhulpbronnen en technologieën en de ondersteuning die zij genieten, vergelijken. In het rapport dat in het kader van het ELE-project is opgesteld, “Report on the state of Language Technology in 2030”, wordt erop gewezen dat twee punten bijzonder cruciaal zijn om tegen 2030 te bereiken: “1) Neurale taalmodellen en aanverwante technieken zijn essentieel om de vooruitgang in LT’s te handhaven. Daarom is het voor taalgelijkheid van cruciaal belang dat we neurale taalmodellen voor andere talen kunnen bouwen met dezelfde kwaliteit als voor het Engels; 2) Meertalige gegevens zijn het sleutelelement om dergelijke modellen in verschillende talen te trainen. We mogen niet als vanzelfsprekend aannemen dat grote hoeveelheden openbaar beschikbare corpora van goede kwaliteit gemakkelijk voor alle Europese talen kunnen worden verkregen; veeleer geldt het tegendeel.
Straipsniai / Articles
193
Page 11
ANŽELIKA GAIDIENĖ, AURELIJA TAMULIONIENĖ
De inspanning om ervoor te zorgen dat alle talen beschikken over grote hoeveelheden openbaar beschikbare corpora van goede kwaliteit, met inachtneming van kwesties van billijkheid, moet centraal staan in alle toekomstige inspanningen voor DLE”13”14. Het ELE-project besteedt hieraan meer aandacht; het is de bedoeling een gedetailleerd strategisch plan op te leveren waarin tegen 2030 specifieke acties worden vastgelegd.
2. BESCHIKBAARHEID VAN TAALGEGEVENS EN HULPMIDDELEN
Zoals eerder vermeld, werden de gegevens over de beschikbare digitale Litouwse taalhulpbronnen verzameld als onderdeel van het ELE-project. In totaal werden 218 digitale Litouwse taalhulpbronnen verzameld en beschreven. Het grootste deel bestaat uit lexicale/conceptuele hulpbronnen (139; 64%); hulpmiddelen/diensten (53; 24%) komen op de tweede plaats; corpora (24; 11%) nemen de derde positie in, terwijl grammatica-/taalmodellen15 (2; 1%) op de vierde plaats komen (zie Fig. 5).
15 Litouwen loopt achter wat betreft digitale hulpbronnen voor grammatica/taalmodellen; aangezien op dit gebied slechts enkele hulpbronnen werden geïdentificeerd, worden zij niet afzonderlijk in het artikel besproken.
194
Acta Linguistica Lithuanica LXXXVI
Page 12
European Language Equality in the Digital Age: The Case of Lithuania
Elke groep digitale hulpbronnen wordt in het artikel afzonderlijk besproken aan de hand van voorbeelden van de bekendste en grootste hulpbronnen, hulpmiddelen en elektronische diensten.
2.1. Lexicale/conceptuele hulpbronnen
Woordenboeken/lexica vormen het grootste deel van de lexicale/conceptuele hulpbronnen (77%); zij worden gevolgd door terminologische hulpbronnen (15%). Tot de lexicale/conceptuele hulpbronnen behoren ook ontologieën en wordnets (4%).
De meeste digitale woordenboeken zijn ontwikkeld door het Instituut voor de Litouwse Taal en zijn toegankelijk via het informatiesysteem voor Litouwse taalhulpbronnen E. KALBA16.
E. KALBA biedt toegang tot het meest recente descriptieve normatieve Woordenboek van de Standaardlitouwse Taal17, dat momenteel 74.062 trefwoorden bevat (alle woordenboekartikelen die beginnen met de letters B, C, Č, D, E, Ę, Ė, F, G, H, I, J, O, R, Z, Ž en het volledige nomenclatuur zijn online toegankelijk). Duizenden nieuwe woorden en nieuwe betekenissen worden aan het woordenboek toegevoegd; trefwoorden worden geïllustreerd met talrijke authentieke voorbeelden uit het werkelijke taalgebruik.
Andere eentalige descriptieve woordenboeken zijn eveneens beschikbaar in het informatiesysteem voor Litouwse taalhulpbronnen E. KALBA: Het Woordenboek van de Moderne Litouwse Taal18 (8th herziene en bijgewerkte editie, die 48.342 trefwoorden bevat) en Het Woordenboek van de Litouwse Taal19 (dat de woordenschat van de Litouwse taal weerspiegelt vanaf de 16the eeuw tot het einde van de 20the eeuw. Het woordenboek bevat 310.659 trefwoorden). E. KALBA biedt ook gespecialiseerde woordenboeken: de voortdurend bijgewerkte Database van Litouwse neologismen20 (met nieuwe woorden — leenwoorden en nieuwe vormingen —, woordgroepen en afkortingen of nieuwe betekenissen van woorden die vanaf het einde van de 20the eeuw in het Litouws zijn opgenomen en momenteel in het openbare taalgebruik voorkomen, evenals informatie over hun oorsprong, gebruik en standaardisering. Momenteel bevat zij meer dan 7.000 vermeldingen); Het Woordenboek van Synoniemen,21 Het Woordenboek van Antoniemen,22 The
Woordenboek van de fraseologie,23 het Vergelijkingenwoordenboek,24 enzovoort. We kunnen ook verschillende tweetalige woordenboeken vinden,25 bijvoorbeeld Litouws–Engels en Engels–Litouws; Litouws–Duits en Duits–Litouws; Litouws–Lets en Lets–Litouws, enzovoort.
Verschillende fichebakken behoren tot de categorie lexicons,26 bijvoorbeeld het Hoofdfichebestand, het Aanvullende Fichebestand en het Dialectfichebestand van Het Woordenboek van de Litouwse Taal, enzovoort.
Wat terminologische bronnen betreft, is De Termenbank van de Republiek Litouwen,27 inhoudelijk de grootste en betrouwbaarste bron van Litouwse termen, het meest bekend. Wetsbesluiten en terminologische glossaria zijn de belangrijkste bronnen van deze termenbank (er zijn meer dan 255.000 terminologische vermeldingen beschikbaar). De terminologiecollecties uit verschillende gebieden zijn in de bank opgenomen (in totaal 26 gebieden, zoals politiek, defensie, financiën, milieu, vervoer, cultuur, gezondheid enzovoort, die verder zijn onderverdeeld). De Termendatabase van de Litouwse Raad voor Normalisatie28 bevat een verzameling termen uit normen. Momenteel bevat deze 76.000 terminologische vermeldingen. Het informatiesysteem voor Litouwse taalbronnen RAŠTIJA.LT29 biedt zoekmogelijkheden in 32 terminologische glossaria. De terminologische gebieden hangen af van de glossaria: er zijn termen uit de elektrotechniek, informatica, management, taaldidactiek, wiskunde, metrologie, meteorologie enzovoort.
Er zijn weinig ontologieën en semantische netwerken in Litouwen. Er is de Algemene Ontologie van de Litouwse Taal, de vrij toegankelijke ontologie van Litouwse medische termen Snomed CT,30 de elektronische dienst E-terms,31 die ontologieën op de volgende gebieden omvat: De Ontologie van Termen voor de Menselijke Anatomie (7.500 termen), De Ontologie van Economische Termen (500 termen) en De Ontologie van Computerhardware en -onderdelen (1.000 termen). We hebben verschillende Litouwse woordnetwerken, die verder kunnen worden uitgebreid: LitWorNet32 (voor meer informatie,
26 “Een digitaal woordenboek (of lexicon) is een lijst van lemma’s (gewoonlijk afzonderlijke woorden of meerwoorduitdrukkingen), die optioneel met aanvullende informatie is verrijkt” (Pastor et. al. 2017: 29).
European Language Equality in the Digital Age: The Case of Lithuania
zie Vitkutė-Adžgauskienė et al. 2015) en WordNet33 (met 24.000 synsets, waarvan er 10.000 zijn gekoppeld aan de synsets in Princeton WordNet).
2.2. Tools/diensten
Tekst- en data-analyse vormen het grootste deel van de digitale tools/diensten (36%); daarop volgen spraakherkenning (15%), grammaticacontrole en spellingcontrole (8%), machinevertaling (6%) en andere. Wat tools/diensten betreft, moet worden toegevoegd dat deze taalafhankelijk zijn (98%), waarbij tekst (80%) het overheersende mediatype van de invoer is.
Allereerst verdienen de reeds ontwikkelde machinevertaalsystemen vermelding. “Tilde informacinės technologijos” UAB biedt de mogelijkheid om de meertalige machinevertalingstool op basis van neurale netwerken, Tilde Translator,34 gratis te gebruiken. Volgens de ontwikkelaars is “deze statistische machinevertalingstool de beste op de markt en aangepast aan de taalparen Litouws–Engels, Engels–Litouws, Lets–Engels en Engels–Lets. Het op regels gebaseerde machinevertaalsysteem voor vertalingen van het Lets naar het Russisch is eveneens beschikbaar voor gebruik”.35 Momenteel kunt u Tilde Translator gebruiken om vanuit het Litouws naar het Duits, Pools, Engels, Oekraïens en Russisch te vertalen.
Het machinevertaalsysteem ALPMAVIS is gratis beschikbaar voor gebruikers.36 Dit systeem omvat de volgende taalparen: Litouws–Engels–Litouws, Litouws–Frans–Litouws, Litouws–Duits–Litouws, Litouws–Pools–Litouws en Litouws–Russisch–Litouws. Het bovengenoemde systeem is aangepast aan de algemene, juridische en IT-sferen.37
Ook moeten de gratis vertaalsystemen worden genoemd die buiten Litouwen zijn ontwikkeld, bijvoorbeeld Google Translate, Microsoft Bing Translator, eTranslation enzovoort. Dit laatstgenoemde vertaalsysteem is gratis beschikbaar voor overheidsinstellingen en is beter geschikt voor het vertalen van administratieve en juridische teksten.
Er zijn verschillende diensten voor gebruikers ontwikkeld waarbij spraakherkenningstechnologie wordt ingezet om computers met de stem te bedienen, bijvoorbeeld Browser38 (navigeren
spraakbesturing); Controller39 (computerbesturing met de stem); Searcher40 (zoeken met de stem naar erfgoedbronnen van UNESCO); Recognizer41 (leren van spraakbesturing); Helper42 (spraakbesturing voor mensen met een beperking); Coaching Robot Controller43 (besturing van een humanoïde robot voor kinderen); Taxi Caller44; Caller45 (bellen naar telefooncontacten); Interlingual Communicator46 (Litouws–Chinees), enzovoort. Er is ook gratis een spraakherkenningstoepassing beschikbaar47 die spraak uit een vooraf opgenomen audiobestand of uit realtime dicteren omzet in tekst.
Sommige in Lithuania ontwikkelde diensten zijn uitgerust met spraaksynthesetechnologie, bijvoorbeeld Pronouncer48 (een audiowoordenboek van Litouwse neologismen); The Lithuanian Speech Synthesiser for the Blind49 (een met SAPI5 compatibele Litouwse spraaksynthesizer die hardop voorleest wat op een computerscherm wordt weergegeven); The Mobile Synthesiser for the Blind50; The Online News Reader51 (het verzamelen en voorlezen van nieuws met een gesynthetiseerde stem in het Litouws). Er is ook gratis een spraaksynthesetoepassing52 beschikbaar die tekst omzet in spraak.
De belangrijkste gratis opensourcetools voor de basisanalyse van digitale teksten in het Litouws zijn ontwikkeld in het kader van verschillende projecten in Lithuania, namelijk een segmentator, een lemmatisator, een morfologische analyzer, een woordsoorttagger, een syntactische parser, een spellingcontrole, een tekstnormalisator, een oplossing voor geavanceerd zoeken in Litouwse tekstindexen, een extractietool voor meerwoorduitdrukkingen enzovoort (Guidelines 2020).
Er zijn ook gratis opensourceoplossingen voor taalidentificatie en semantische analyse: de eenvoudige en aspectgebaseerde sentiment- (opinie-)analyzer,53 de haat
European Language Equality in the Digital Age: The Case of Lithuania
spraakherkenningstool,54 de dienst voor automatische documentsamenvatting,55 de tool voor herkenning van geïdentificeerde entiteiten (Guidelines 2020).
2.3. Corpora
Litouwen gaat door met het creëren en ontwikkelen van de algemene taalgegevens en -bronnen die nodig zijn voor de productie van taaltechnologieën en hun toepassingen. In Litouwen zijn er verschillende corpora, die worden gedomineerd door geannoteerde corpora (91%), waarbij tekst (96%) als mediatype van de onderdelen de overhand heeft.
Het Corpus van de Hedendaagse Litouwse Taal56 is het grootste corpus van de Litouwse taal. Het bevat 140.921.288 woorden (fictie – 11,6%, non-fictie – 14,2%, administratieve literatuur – 10%, publicaties – 63,8%, gesproken taal – 0,3%). De samenstelling van het corpus begon in 1992 en werd voor het laatst bijgewerkt in 2011.
Er zijn ook morfologisch en syntactisch geannoteerde corpora. De omvang van het Morfologisch geannoteerde Litouwse corpus MATAS57 bedraagt 1,6 miljoen woorden (36% teksten uit tijdschriften, 24% teksten uit wetenschappelijke literatuur, 19% teksten uit fictie, 2,8% administratieve teksten, 6,8% woordelijke verslagen van het Parlement van de Republiek Litouwen). Het corpus werd semi-automatisch samengesteld en de resultaten werden door taalkundigen beoordeeld. Het corpus bracht de grootschalige morfologische polysemie van de Litouwse taal aan het licht; bijna de helft van alle vormen is namelijk morfologisch polyseem. De nieuwste versie van het Litouwse Treebank ALKSNIS58 (ALKSNIS 3.0) bevat 3.643 syntactisch geannoteerde zinnen in het PML-formaat (Prague Mark-up Language).
In Litouwen zijn verschillende parallelle corpora opgezet. Het Parallel Corpus59 bevat Tsjechisch-Litouwse woorden (20,29%), Engels-Litouwse woorden (76,6%), Litouws-Tsjechische woorden (0,8%) en Litouws-Engelse woorden (2,31%). Het LILA parallel Corpus60 werd semi-automatisch samengesteld, waarbij teksten op alinea- en zinsniveau werden uitgelijnd. Het corpus bestaat uit teksten die in 1991 of later zijn gepubliceerd. De totale omvang van het corpus bedraagt 8.782.050 woorden:
Litouws-Letse teksten vormen het grootste deel (3,448,745 woorden), terwijl Lets-Litouwse teksten de helft van dat aantal omvatten (1,695,160 woorden). Een dergelijke asymmetrische samenstelling van de gegevens is het gevolg van het grotere aantal teksten dat de afgelopen jaren van het Litouws naar het Lets is vertaald dan omgekeerd.
Er zijn ook andere soorten corpora, bijvoorbeeld The Corpus of the Spoken Lithuanian Language,61The compendium of textbook texts KLASIUS62; The Corpus of the Old Lithuanian Language63; CorALit64: Corpus Academicum Lithuanicum, enzovoort.
De meeste corpora bieden open toegang tot hun gegevens.
Samenvattend hebben de productie en ontwikkeling van de bestaande digitale taalbronnen en hulpmiddelen/diensten in Litouwen aanzienlijke vooruitgang laten zien; er bestaan zelfs verschillende infrastructuren voor Litouwse taalbronnen en hulpmiddelen/diensten (E. KALBA, RAŠTĮJA.LT enzovoort), die gratis toegang bieden tot verschillende digitale woordenboeken, lexica enzovoort en diverse spraakgestuurde diensten, basisanalyses van digitale teksten in het Litouws, vrije opensourcetools enzovoort leveren. Er worden verschillende corpora en automatische vertaalsystemen geproduceerd en verder ontwikkeld. Niettemin is er een tekort aan multimediale taalgegevens, parallelle corpora gericht op automatische vertaling, diverse spraakcorpora enzovoort. Wat de tekstsemantiek betreft, bestaan er nog steeds hiaten, aangezien kwalitatief hoogwaardige wordnets, ontologieën enzovoort ontbreken. Het gebied van de grammatica is momenteel grotendeels verwaarloosd: er is een tekort aan digitale grammatica’s en andere technologische hulpmiddelen die kunnen bijdragen aan de ontwikkeling van taaltechnologieën en de verhoging van hun kwaliteit.
3. SITUATIE VAN HET LITOUWS IN DE DIGITALE OMGEVING: STERKTEN, ZWAKTEN, KANSEN EN BEDREIGINGEN
De status van het Litouws in de digitale omgeving werd geëvalueerd met inachtneming van de belangrijkste beschikbare databank met documenten, evenals nationale infrastructuren voor taalbronnen en -technologieën en de belangrijkste consortia, federaties en projecten. De belangrijkste documenten en bronnen worden uitvoerig beschreven (zie Guidelines 2020). Dit artikel beoogt ze in algemene bewoordingen te beschrijven om de oorsprong van de sterkten, zwakten, kansen en bedreigingen te traceren.
61 Available at: http://sakytinistekstynas.vdu.lt. 62 Available at: https://rastija.lt/resurso-katalogas/klasius-v2/. 63 Available at: http://coralit.lt/node/1. 64 Available at: http://coralit.lt.
200
Acta Linguistica Lithuanica LXXXVI
Page 18
European Language Equality in the Digital Age: The Case of Lithuania
3.1. De Litouwse overheid en andere staatsinstellingen ondersteunen verschillende programma’s ter bevordering van een breed scala aan taalkundig onderzoek en de verspreiding daarvan. De volgende documenten inzake taaltechnologiebeleid in Litouwen zijn van kracht: 1) The Guidelines for the Development of the Lithuanian Language in the Digital Environment and the Progress of Language Technologies for 2021–202765 (zie voor meer informatie pagina 2); 2) The Lithuanian Artificial Intelligence Strategy: A Vision for the Future (2018)66, uitgevaardigd door het Ministerie van Economie en Innovatie van de Republiek Litouwen. Het doel van de strategie is “dat Litouwen op basis van de bestaande middelen, ervaring en mogelijkheden een regionale leider wordt. De strategie beoogt het concurrentievermogen van Litouwen onder de EU-landen te vergroten en zijn succesvolle deelname aan het mondiale AI-ecosysteem te waarborgen” (AI Strategy 2018); 3) The strategy for Lithuania’s advancement “Lietuva 2030”.67 Deze strategie schetst de “visie en ontwikkelingsprioriteiten van de staat, evenals de richtingen voor de uitvoering daarvan tot 2030. Het is het belangrijkste planningsdocument waarmee rekening moet worden gehouden bij strategische beslissingen en bij het opstellen van staatsplannen of -programma’s” (Strategy 2012). Op 2 juli 2021 gaf de Europese Commissie groen licht voor het Lithuania’s recovery and resilience plan. “De transformerende impact van het plan van Litouwen is het resultaat van een sterke combinatie van hervormingen en investeringen die de specifieke uitdagingen van Litouwen aanpakken”.68
3.2. Litouwen beschikt over verschillende nationale infrastructuren voor technologie en taalkundige gegevens: 1) RAŠTIJA LT69 is het systeem van geïntegreerde Litouwse taal- en schrijfbronnen, producten en diensten, ontwikkeld door het Instituut voor Wiskunde en Informatica van de Universiteit van Vilnius: kennisbank, zoekhulpmiddelen enzovoort; 2) CLARIN–LT70 – het Litouwse nationale consortium (lid van CLARIN-ERIC), opgericht in 2015. Het bestaat momenteel uit 5 onderzoeksinstellingen: Vytautas Magnus University (coördinator), Kaunas University of Technology, Vilnius University, Mykolas Romeris University en het Baltic Institute of Advanced Technologies; 3) E. KALBA71 – het informatiesysteem voor Litouwse taalbronnen, beheerd door het Instituut voor de Litouwse Taal. In dit systeem vindt men negen eentalige en tien tweetalige woordenboeken, diverse bestanden en databanken
65 Available at: https://e-seimas.lrs.lt/portal/legalAct/lt/TAD/911407f20ee911ebbebdbd456d2fb030d.
66 Available at: https://eimin.lrv.lt/uploads/eimin/documents/files/DI_strategija_LT(1).pdf.
67 Available at: https://e-seimas.lrs.lt/portal/legalAct/lt/TAD/TAIS.425517.
68 Available at: https://ec.europa.eu/info/business-economy-euro/recovery-coronavirus/recovery-and-resilience-facility/lithuanias-recovery-and-resilience-plan_en.
69 Available at: https://raštija.lt.
70 Available at: http://clarin-lt.lt.
71 Available at: https://ekalba.lt.
Straipsniai / Articles
201
Page 19
ANŽELIKA GAIDIENĖ, AURELIJA TAMULIONIENĖ
(dialectenarchief; geoinformatiedatabase van Litouwse plaatsnamen enz.), evenals elektronische diensten (zoeken in het Netwerk van Betekenissen, E-Concepts, Opinieanalysator enz.); 4) SEMANTIKA72 – het Litouwse Informatiesysteem voor Syntactische en Semantische Analyse (LSSAIS), dat “een unieke infrastructuur voor taaltechnologie en staatsinformatiesysteem is die spraakherkenning en tekstan analysediensten voor de Litouwse taal biedt. Vytautas Magnus University is de beheerder van het informatiesysteem”.73
3.3. Belangrijkste consortia, federaties en projecten waartoe Lithuania behoort of waaraan het deelneemt. De vertegenwoordigers van European Federation of National Institutions for Language (EFNIL) in Lithuania zijn het Institute of the Lithuanian Language en de State Commission of the Lithuanian Language. De Federatie besteedt bijzondere aandacht aan de talen van de EU-lidstaten en de taalkundige diversiteit van Europe.74European Language Resource Coordination (ELRC) “beheert, onderhoudt en coördineert de relevante taalbronnen in alle officiële talen van de EU en de met CEF geassocieerde landen. Deze activiteiten zullen bijdragen aan de verbetering van de kwaliteit, dekking en prestaties van automatische vertaaloplossingen in de context van huidige en toekomstige digitale CEF-diensten”.75Common Language Resources and Technology Infrastructure (CLARIN-ERIC) is “een onderzoeksinfrastructuur die is ontstaan vanuit de visie dat alle digitale taalbronnen en -hulpmiddelen uit heel Europe en daarbuiten toegankelijk zijn via een onlineomgeving ter ondersteuning van onderzoekers in de geesteswetenschappen en sociale wetenschappen”.76 CLARIN-LT is een Litouws nationaal consortium dat wordt gecoördineerd door Vytautas Magnus University, die lid is van CLARIN-ERIC. European Language Grid (ELG) “ontwikkelt en implementeert een schaalbaar cloudplatform dat op eenvoudig te integreren wijze toegang biedt tot honderden commerciële en niet-commerciële Language Technologies voor alle Europese talen, met inbegrip van uitvoerbare hulpmiddelen en diensten, evenals datasets en bronnen”.77 Sinds 2019 wordt ELG in Lithuania vertegenwoordigd door het Institute of the Lithuanian Language. Het primaire doel van European Language Equality is “het opstellen van het European Language Equality Programme, in de vorm van een strategische agenda voor onderzoek, innovatie en implementatie, en een routekaart voor het bereiken van volledige digitale
72 Available at: https://www.semantika.lt.
73 Meer informatie beschikbaar op: https://www.semantika.lt/Help/About.
74 Meer informatie beschikbaar op: http://www.efnil.org.
75 Meer informatie beschikbaar op: https://www.lr-coordination.eu.
76 Meer informatie beschikbaar op: https://www.clarin.eu.
77 Meer informatie beschikbaar op: https://www.european-language-grid.eu.
202
Acta Linguistica Lithuanica LXXXVI
Page 20
European Language Equality in the Digital Age: The Case of Lithuania
taalgelijkheid in Europa tegen 2030”.⁷⁸ Sinds 2021 wordt ELE in Lithuania vertegenwoordigd door het Institute of the Lithuanian Language.
In de periode 2014–2020 werd de financiering voor de implementatie van oplossingen voor de Lithuanian language in de digitale ruimte ontvangen uit het Operational Programme for the EU Funds Investments, prioriteitsas 2 (Promoting the Information Society). In 2018 werden vijf projecten gestart: “Development of Lithuanian Speech-Controlled Services” (LIEPA–2), “Development of the Public Services of the Information System of Syntactic–Semantic Analysis of Lithuanian Texts” (SEMANTIKA–2), “Enhancement and Development of Machine Translation Systems and Localisation Services”, “Development of the Information System of Integrated Lithuanian Language and Written Resources (RAŠTIJA 2), en “Development of the Information System of Lithuanian Language Resources” (E. KALBA). Tegen het einde van 2020 waren in totaal 21 openbare e-diensten gecreëerd. Onderzoeks- en onderwijsinstellingen en ondernemingen waren de actiefste deelnemers aan het programma (Guidelines 2020). Naast de bovengenoemde projecten werden ook andere taaltechnologieprojecten uitgevoerd die werden gefinancierd uit EU-structuurfondsen, de European Commission, nationale projectfondsen enzovoort.
3.4. Een SWOT-analyse (sterkten, zwakten, kansen en bedreigingen) wordt gegeven in het Programme of the Lithuanian Language in Information Society for 2007–2010, dat is goedgekeurd door de Seimas of the Republic of Lithuania.⁷⁹ Het vormt een uitstekend uitgangspunt voor de analyse van de huidige situatie. Het is verheugend dat aanzienlijke vooruitgang is geboekt en dat de meeste zwakten of bedreigingen uit die periode al lang zijn weggenomen en vergeten. Er is aanzienlijke vooruitgang geboekt bij het aanpassen van de Lithuanian language aan de digitale omgeving: er zijn verschillende digitale taalbronnen en basishulpmiddelen voor taalanalyse ontwikkeld, complexe online taaldiensten gecreëerd, een ontologie van de Lithuanian language ontwikkeld en veel computerprogramma’s en hulpmiddelen gelokaliseerd. Voor de samenleving relevante computertoepassingen zijn gelokaliseerd en computertermen gestandaardiseerd. Lithuanian onderzoekers nemen actief deel aan en werken samen binnen de mobiliteitsactiviteiten van internationale verenigingen. Veel specialisten in de Lithuanian language richten zich op het gebied van informatietechnologie en ontwikkelen systematisch innovatief werk op dit terrein. Lithuania heeft er groot belang bij dat alle burgers volledige toegang hebben tot digitale oplossingen, waardoor het aanpassen van de toegang tot hulpbronnen voor personen met een handicap zeer belangrijk is (Gaidienė, Tamulionienė 2022: 17–18).
⁷⁸ Meer informatie beschikbaar op: https://european-language-equality.eu.
De algemene analyse van de huidige status van de Europese talen, de dagelijks opkomende innovaties, de groeiende behoeften van de samenleving enzovoort stellen nieuwe uitdagingen en openen nieuwe kansen, evenals nieuwe bedreigingen.
Litouwen beschikt nog steeds niet over voldoende taalbronnen in de elektronische omgeving voor een snellere integratie van de Litouwse taal en informatietechnologieën, noch over normen voor het beheer van de Litouwse taal met informatietechnologieën. Er bestaat een breed scala aan relevante software die nog niet is gelitouwiseerd en aangepast aan de behoeften van de samenleving; het is noodzakelijk het uniforme gebruik van computertermen, woordenschat en uitdrukkingen in software verder te waarborgen en aandacht te blijven besteden aan het gebruik van de gesproken Litouwse taal (spraak) in de elektronische, computer- en geautomatiseerde apparatenomgeving.
Op nationaal niveau is een duidelijk juridisch kader essentieel om een gelijke behandeling te waarborgen van onderzoek (niet-commercieel en commercieel) en innovatie die gebaseerd zijn op de automatische extractie en analyse van gegevens uit elektronische ongestructureerde informatiebronnen (teksten). Pas wanneer voldoende relevante bronnen zijn verzameld die de verschijnselen van de hedendaagse Litouwse taal weerspiegelen, zal het mogelijk zijn doeltreffende hulpmiddelen te ontwikkelen voor de toepassing van de Litouwse taal in informatietechnologieën. Bijzondere aandacht moet worden besteed aan de aanpassing aan de mogelijkheden en behoeften van alle consumenten, om sociale uitsluiting niet in te programmeren, wat gevolgen zou hebben voor de samenleving als geheel. Het is belangrijk Litouwse interfaces te creëren die de sociale linguïstische segregatie rechtstreeks zouden verminderen, het legale gebruik van software zouden bevorderen en de kloof met de oude EU-lidstaten op het gebied van het gebruik van informatietechnologie zouden verkleinen. Het is eveneens belangrijk voorwaarden te scheppen voor het gebruik van de Litouwse taal op computers, computergecontroleerde apparaten en computers die door gesproken Litouwse taal (spraak) worden bestuurd, en de middelen voor computerbesturing met de stem te verbeteren, zodat mensen met een handicap en andere personen onbeperkte toegang tot elektronische diensten hebben. Computationele linguïstiek en taaltechnologieën zijn als afzonderlijk vak nog niet verankerd in het Litouwse hogeronderwijssysteem. Geen enkele universiteit biedt taaltechnologische studies op alle niveaus aan. Dit moet veranderen (Gaidienė, Tamulionienė 2022).
In Litouwen moeten de competenties van specialisten die op het gebied van taaltechnologieën werken worden vergroot en moet het vermogen van de samenleving om de mogelijkheden van taaltechnologieën te benutten naar een hoger niveau worden gebracht. Het is eveneens belangrijk specialisten op te leiden die de bijzonderheden van taal- en informatietechnologieën kennen, fundamenteel en toegepast onderzoek te financieren en wetenschappelijke en technische infrastructuren te ondersteunen. Bovendien is het van cruciaal belang open, betrouwbare, hoogwaardige en duurzame digitale taalbronnen en andere digitale taaldatasets te verzamelen en de beschikbaarheid ervan te vergroten. Er bestaat behoefte aan de ontwikkeling van de taaltechnologische infrastructuur en de toepassing van taaltechnologieën
204
Acta Linguistica Lithuanica LXXXVI
Page 22
European Language Equality in the Digital Age: The Case of Lithuania
in de publieke sector en openbare diensten, onderwijs- en leerinstellingen, en aan de ontwikkeling en verbetering van publiek beschikbare IT-oplossingen en -hulpmiddelen. Litouwen moet nog actiever deelnemen aan de Europese Gemeenschap en andere internationale programma’s voor taaltechnologie. Het is belangrijk infrastructuren bij te werken met de noodzakelijke digitale bronnen, de hardware van de infrastructuur te upgraden en te onderhouden, infrastructuren te integreren in grotere nationale, Europese en internationale systemen voor taalbronnen en de openheid van de technologieën en de daarin opgeslagen gegevens te waarborgen (Guidelines 2020).
Samenvattend is de ontwikkeling van taaltechnologieën essentieel voor de Litouwse taal, evenals voor elke andere taal. Om op dit gebied welvaart te bereiken, moet Litouwen werken aan de ontwikkelingen die in dit artikel wel en niet aan bod zijn gekomen. Om de doelstellingen te bereiken, is het noodzakelijk de inspanningen van de staat, de wetenschap en het bedrijfsleven te bundelen.
CONCLUSIES
Na een overzicht van de situatie van de Litouwse taaltechnologieën in de meertalige Europese context en een systematische analyse van de Litouwse taalbronnen en hulpmiddelen/diensten kunnen we verschillende belangrijke conclusies formuleren over de status van de Litouwse taal in de digitale omgeving.
1. De resultaten tonen aan dat Litouwen sinds 2012 aanzienlijke vooruitgang heeft geboekt bij de ontwikkeling van diverse digitale taalbronnen en hulpmiddelen/diensten. Hoewel het Litouws wordt ingedeeld als een taal met een klein aantal sprekers, boekt het snel vooruitgang op het gebied van taaltechnologieën. Wat digitale bronnen en hulpmiddelen/diensten betreft, zijn er nog steeds gebieden die verdere vooruitgang vereisen.
Hoewel er al een aantal digitale bronnen voor de Litouwse taal beschikbaar zijn, moeten, gezien de eisen van taaltechnologieën en het publiek, nog nieuwe eentalige woordenboeken (woordenboeken van synoniemen, antoniemen, fraseologie enzovoort) en tweetalige woordenboeken worden ontwikkeld of bijgewerkt, evenals diverse lexicons. Ontologieën, wordnets en corpora moeten worden uitgebreid en vergroot; meertalige parallelle corpora die nodig zijn voor automatische vertaling moeten worden ontwikkeld enzovoort. Wat de terminologie betreft, zijn aanvullende en bijgewerkte compendia of termen nodig; de structuur en technologische oplossingen van terminologische databanken verschillen, waardoor het moeilijker wordt gegevens voor andere technologische oplossingen te benutten; er is ook een tekort aan open terminologische gegevens. Het Litouws heeft behoefte aan digitale grammatica’s, geannoteerde spraakdatabanken en andere bronnen die de vooruitgang van taaltechnologieën zouden versnellen.
Straipsniai / Articles
205
Page 23
ANŽELIKA GAIDIENĖ, AURELIJA TAMULIONIENĖ
2. In Litouwen is aanzienlijke vooruitgang geboekt op het gebied van taaltechnologieën, maar de innovaties die zich elke minuut aandienen, de groeiende behoeften enzovoort openen niet alleen nieuwe mogelijkheden en uitdagingen, maar tonen ook zwakke punten en bedreigingen.
2.1. De infrastructuur van taalbronnen met open toegang is in Litouwen nog steeds in ontwikkeling; de cultuur van het delen van gegevens stagneert nog steeds; kwesties rond licenties zijn nog altijd niet opgelost: de regelingen inzake intellectuele-eigendomsrechten en de AVG moeten flexibeler en toestemmender worden, zodat gegevens waarop intellectuele-eigendomsrechten rusten breder kunnen worden gebruikt voor de ontwikkeling van taaltechnologieën en -bronnen, zonder dat de belangen van auteurs worden geschaad.
2.2. In Litouwen ontbreken de vereiste personele middelen: er is een tekort aan IT-specialisten en onderzoekers die op het gebied van taaltechnologieën werken; er bestaan geen gespecialiseerde studieprogramma’s.
2.3. De ontwikkeling van Litouwse taaltechnologieën vereist krachtige nationale en internationale steun, waaronder relevante langetermijnprogramma’s voor taaltechnologie die onderzoek en bedrijfsleven op gelijke voorwaarden ondersteunen. Het is belangrijk nationale en internationale activiteiten op elkaar af te stemmen, met inachtneming van de onderzoeksinfrastructuur en onderzoeksprioriteiten.
2.4. Wat zou er in Litouwen gebeuren als de ontwikkeling van taaltechnologieën volledig zou stoppen? Waarom wordt door de EU herhaaldelijk benadrukt dat taalgelijkheid kan worden bereikt door de technologische ontwikkeling van alle EU-talen te bevorderen? Er bestaat brede overeenstemming over de kracht van taalkundige diversiteit en over de invloed van technologieën voor de moedertaal op de bescherming van taalkundige en culturele diversiteit. Als op dit gebied geen maatregelen worden genomen, zou de technologische en taalkundige kloof daarom groter worden en zou het prestige van de Litouwse taal afnemen; Litouwen zou niet langer concurrerend zijn op het gebied van kunstmatige intelligentie en andere geavanceerde technologieën; andere vreemde talen zouden geleidelijk de plaats van het Litouws in de digitale omgeving innemen.
REFERENCES
AI strategy 2018: The Lithuanian Artificial Intelligence Strategy: A vision for the future. Available at: https://eimin.lrv.lt/uploads/eimin/documents/files/DI_strategija_LT(1).pdf.
Gaidienė Anželika, Tamulionienė Aurellija 2022: Report on the Lithuanian Language. Available at: https://european-language-equality.eu/wp-content/uploads/2022/03/ELE___Deliverable_D1_23__Language_Report_Lithuanian_.pdf.
206
Acta Linguistica Lithuanica LXXXVI
Page 24
European Language Equality in the Digital Age: The Case of Lithuania
Giagkou Maria, Piperidis Stelios 2021: European Language Equality. Guidelines for T1.3 contributors. Internal to ELE network.
Guidelines 2020: The guidelines for the development of the Lithuanian language in the digital environment and the progress of language technologies for 2021–2027. Available at: https://www.e-tar.lt/portal/lt/legalAct/71152ab00eee11ebb74de75171d26d52.
Jaroslavienė Jurgita, Miliūnaitė Rita 2020: Beribis lietuvių kalbos pasaulis skaitmeninių išteklių sistemoje „E. kalba“. – Pasaulio lietuvis. Available at: https://pasauliolietuvis.lt/beribis-lietuviu-kalbos-pasaulis-skaitmeniniu-istekliu-sistemoje-e-kalba/.
Pastor Rafael Rivera 2017: European Parliament, Directorate-General for Parliamentary Research Services, Language equality in the digital age: towards a human language project, European Parliament. Available at: https://www.europarl.europa.eu/RegData/etudes/STUD/2017/598621/EPRS_STU(2017)598621_LT.pdf.
Rehm Georg, Uszkoreit Hans, editors, 2013: The META-NET Strategic Research Agenda for Multilingual Europe 2020, Springer, Heidelberg, New York, Dordrecht, London. Available at: https://lirias.kuleuven.be/retrieve/501271.
Strategy 2012: The Strategy for Lithuania’s Advancement “Lietuva 2030”. Available at: https://e-seimas.lrs.lt/portal/legalAct/lt/TAD/TAIS.412512.
Vaišnienė Daiva, Zabarskaitė Jolanta 2012: The Lithuanian language in the digital age, vol. 385, Springer. Available at: http://www.meta-net.eu/whitepapers/volumes/e-book/lithuanian.pdf.
Vitkutė-Adžgauskienė Daiva, Dainauskas Justinas Juozas, Amilevičius Darius, Utka Andrius 2015: Lietuvių kalbos žodžių tinklas – LitWordNet. – Darbai ir dienos 64, 101–114. Available at: https://cris6.vdu.lt/cris/bitstream/20.500.12259/27751/1/ISSN2335-8769_2015_N_64.PG_101-114.pdf.
Europos kalbų lygybė skaitmeniniame amžiuje: Lietuvos atvejis
SANTRAUKA
Straipsnyje rašoma apie lietuvių kalbos technologijų būklę, supažindinama su Europos kalbų lygybės skaitmeninėje terpėje situacija. Nagrinėjami kiekybiniai ir kokybiniai kalbų lygybę atskleidžiantys rodikliai Europos Sąjungos kontekste, atsižvelgiant į kalbėtojų,
Straipsniai / Articles
207
Page 25
ANŽELIKA GAIDIENĖ, AURELIJA TAMULIONIENĖ
skaitmeninių kalbos išteklių ir technologijų skaičių bei joms teikiamą paramą, ypatingą dėmesį skiriant Lietuvos atvejo analizei. Šiuo straipsniu siekiama pabrėžti iki šiol kalbų technologijų srityje atliktą darbą ir išryškinti spragas bei atskleisti išbandymus, su kuriais susiduria ir juos sprendžia oficiali nacionalinė ir Europos Sąjungos kalba – lietuvių kalba. Straipsnyje pateikiama naujausia lietuvių kalbos technologijų padėties apžvalga analizuojant skaitmeninius kalbos išteklius ir įrankius / paslaugas.
Gauti rezultatai rodo, kad nuo 2012 m. Lietuvoje padaryta didžiulė pažanga plėtojant įvairius skaitmeninius kalbos išteklius ir įrankius / paslaugas. Nors lietuvių kalba yra priskiriama prie mažai kalbėtojų turinčių kalbų, ji gana sparčiai tobulėja kalbos technologijų srityje. Nepaisant to, kad esama sukurta nemažai lietuvių kalbos skaitmeninių išteklių, atsižvelgiant į kalbos technologijų ir visuomenės poreikius, būtina kurti ir atnaujinti vienakalbius (sinonimų, antonimų, frazeologijos ir pan.) ir dvikalbius žodynus, įvairius leksikonus. Būtina gausinti ir plėsti įvairiais kalbos duomenimis ontologijas, žodžių tinklus, tekstynus, kurti mašininiam vertimui reikalingus keliakalbius lygiagrečiuosius tekstynus ir kt. Kalbant apie terminiją, trūksta daugiau ir naujesnių terminų rinkinių, terminų bazių struktūra ir technologiniai sprendimai skiriasi, o tai apsunkina galimybes panaudoti duomenis kitiems technologiniams sprendimams, taip pat trūksta atvirųjų terminologinių duomenų. Lietuvių kalbai labai trūksta skaitmeninių gramatikų, anotuotų garsynų ir kitų išteklių, kurie prisidėtų prie spartesnės kalbos technologijų pažangos.
Lietuvoje vis dar tvarkoma atvirųjų prieigų kalbos išteklių infrastruktūra, ne visai išspręsti licencijavimo klausimai – intelektinės nuosavybės teisių ir BDAR reglamentai, kurie turi būti lankstesni ir leidžiantys plačiau naudoti intelektinės nuosavybės teisėmis apsaugotus duomenis kalbos technologijų plėtrai ir išteklius taip, kad nebūtų pažeisti autorių interesai. Lietuvoje trūksta būtinųjų žmogiškųjų išteklių: trūksta kalbų technologijų IT specialistų, taip pat šios srities mokslininkų, nėra specializuotų studijų programų. Lietuvių kalbos technologijų plėtrai reikalinga stipri nacionalinė ir tarptautinė parama, įskaitant tam skirtas ilgalaikes kalbų technologijų programas, kurios vienodai remia tiek mokslinių tyrimų, tiek verslo veiklą. Svarbu sinchronizuoti nacionalinę ir tarptautinę veiklą, ypač mokslinių tyrimų infrastruktūros ir mokslinių tyrimų prioritetų atžvilgiu.
Įteikta 2022 m. gegužės 18 d.
ANŽELIKA GAIDIENĖ AURELIJA TAMULIONIENĖ Lietuvių kalbos institutas Petro Vileišio g. 5, LT–10308 Vilnius, Lietuva [email protected][email protected]