scieee AI-readable full text Open interactive document viewer

Przewodnik po zarządzaniu danymi w językoznawstwie

Jan, Wieczorek

Full text

po zarządzaniu danymi badawczymi w językoznawstwie Przewodnik JAN WIECZOREK Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie Autor: Jan Wieczorek Wersja: 1.0 Data i miejsce wydania: Kraków, wrzesień 2025 Projekt graficzny i skład: Papercut Licencja: Publikacja dostępna na licencji Creative Commons Uznanie autorstwa 4.0 Międzynarodowa (CC BY 4.0) DOI: 10.5281/zenodo.17233197 Zastrzeżenie: Za treść oraz warstwę merytoryczną przewodnika odpowiada wyłącznie autor. Egzemplarz bezpłatny. Publikacja dostępna online. Publikacja powstała w ramach zlecenia Ministra Nauki i Szkolnictwa Wyższego, realizowanego przez Narodowe Centrum Nauki w ramach krajowej koordynacji partnerstwa EOSC w latach 2024–2025. Zalecany sposób cytowania: Wieczorek, J. (2025). Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie (wersja 1.0), DOI: 10.5281/zenodo.17233197 Spis treści Wstęp Czym są dane badawcze w językoznawstwie Metadane: definicja i ich znaczenie Paradygmat FAIR w zarządzaniu danymi badawczymi Dlaczego zarządzanie danymi jest istotne dla językoznawstwa Dokumentacja Udostępnianie i długotrwałe przechowywanie danych Plan zarządzania danymi badawczymi 4 5 11 15 17 18 20 23 1 2 3 4 5 6 7 Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 4 Wstęp Przewodnik kierowany jest do wszystkich naukowców, którzy reprezentują dyscyplinę naukową językoznawstwa oraz szerzej – do naukowców, których zainteresowania badawcze wiążą się z analizą materiału językowego w rozmaitych jego odmianach (nagrania, transkrypcje, literatura piękna, teksty prasowe, media społecznościowe itd.). Jesteśmy przekonani, że znajdzie zainteresowanie zarówno wśród przedstawicieli nauk filologicznych, jak i badaczy zajmujących się analizą mediów i komunikacji, a także wśród badaczy posługujących się metodami jakościowymi w naukach społecznych. Przewodnik ma stanowić wprowadzenie do zagadnień związanych z zarządzaniem danymi badawczymi, jednak w odróżnieniu od innych materiałów pomocniczych, punktem wyjścia jest tu specyfika pracy z danymi charakterystycznymi dla badań językoznawczych. Aby nie zagubić się w bogactwie rozmaitych informacji dotyczących zarządzania danymi, zostały one przefiltrowane tak, by wspominać wyłącznie o rozwiązaniach i praktykach bliskich czytelnikowi wpisującemu się we wspomniany wyżej profil, mowa tu o relewantnych formatach danych, standardach metadanych, repozytoriach, infrastrukturach naukowych i dokumentach. Staraliśmy się, aby omawiane rozwiązania zostały przedstawione w oparciu o przykłady dobrze oddające realia i wyzwania, z jakimi mierzy się językoznawca zajmujący się zarządzaniem danymi. Życzymy przyjemnej lektury. Oddajemy niniejszą publikację w ręce Czytelników, by pomóc im we wdrożeniu praktyk związanych z zarządzaniem danymi w codziennej pracy naukowej oraz w uniknięciu błędów, mogących skutkować niepotrzebnymi komplikacjami. S D R W B H I H J K O E Z B N A D W E R T H J A K O Ś Ć Ą C B K L MĘ Ś Ż N J H L E A W R G S E EB A C Z E R T Ą Ś Ó E DW R TA W S W Ó D A N E KP IĄDAD E F C A Ć Z S Z L O GJ H DĘ H V FB J Ć I Ą Ó Z IP U AS K N AW Ł K C H L Y TK L NG L Ć IG F A N M D T AA Ę EAOARS R Z E Ś A O LÓ W Ś H Ó Ł A T U E O Ł P R ICD O S T Ę P N O Ś Ć R E I ZB U I S D H L G J E K I F U AOKJ X A N O T A C J A UM CKOF Ą B A M Ś Ę H B N E I JWRC Z G W F B S N R C O P AEPB N M Z Ą T U Ź D Ó W A T R UR T U Ó G L B Ć B J R D U I SÓ P L T K Z S K E Ś Z G Ó P L K A W O N T O L O G I E A D E Ć Ż U I W E R T U B C Ś Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 5 1 Termin „dane badawcze” funkcjonuje w środowisku naukowym powszechnie. Każdy naukowiec rozumie go intuicyjnie jako ze - staw informacji dotyczących przedmiotu badań, który posłuży do wyciągnięcia wniosków zawartych w wynikach badań. Upraszczając, można powiedzieć, że dane badawcze umożliwiają przeprowadzenie analiz, syntez i innych czynności poznawczych, które w efekcie pozwalają na weryfikację hipotezy lub odpowiedź na pytanie badawcze. Takie rozumienie danych badawczych jest zbieżne z definicją przyjętą przez Unię Europejską: Dane badawcze obejmują dane statystyczne, wyniki eksperymentów, pomiarów, obserwacji prowadzonych w terenie, wyniki ankiet, nagrania wywiadów i zdjęcia. Obejmują one także metadane, specyfikacje i inne obiekty cyfrowe. Dane badawcze różnią się od artykułów naukowych relacjonujących i komentujących ustalenia wynikające z badań naukowych będących ich źródłem1. Ustaliwszy, jak należy rozumieć termin dane badawcze, pomyślmy, jakiego rodzaju dane może w swojej pracy napotkać językoznawca lub naukowiec zajmujący się pokrewną tematyką. 1 Dyrektywa Parlamentu Europejskiego i Rady (UE) 2019/1024 z dnia 20 czerwca 2019 r. w sprawie otwartych danych i ponownego wykorzystywania informacji sektora publicznego Przykłady danych: Korpusy tekstów: Niewątpliwie, w pracy językoznawcy bardzo istotne są zbiory tekstów pisanych. Zbiory utworzone w oparciu o klarowne kryteria (np. autorstwo, czas powstania, gatunek, modalność, język lub jego odmianę, obszar oddziaływania, tematykę itp.) określane są mianem korpusów językowych lub tekstowych. Z perspektywy zarządzania danymi badawczymi korpusy mogą być postrzegane dwojako: (a) jako źródło danych, z których zostaną wypreparowane konkretne dane badawcze (np. listy frekwencyjne jednostek leksykalnych, dane statystyczne dotyczące cech gramatycznych, listy relewantnych cytatów) lub też (b) jako zbiór danych badawczych, który służy bezpośrednio analizie i wyciąganiu wniosków istotnych dla procesu naukowego. Ta druga perspektywa dotyczy raczej badań literaturoznawczych, ale może znaleźć również zastosowanie w przypadku lingwistycznej lub medioznawczej analizy dyskursu. Korpusy towarzyszą nam już od czasów przedcyfrowych, kiedy mogły przybierać formę zbiorów twórczości określonych autorów (np. wydania wierszy zebranych), zbiorów wycinków artykułów prasowych poświęconych pewnemu zjawisku lub zbiorów korespondencji prowadzonej między postaciami historycznymi czy też zestawów wypisów lub fiszek – szczególnie przydatnych w bieżącej pracy językoznawców. Współcześnie korpusy mają zazwyczaj formę elektroniczną, powstają prymarnie z myślą o prowadzeniu badań naukowych (choć mogą służyć również innym celom np. uczeniu algorytmów sztucznej inteligencji), a zawarty w nich materiał jest opisany za pomocą ustandaryzowanych metadanych. Sztandarowym przykładem tego typu zasobu jest Narodowy Korpus Języka Polskiego 2 . Obecnie bez trudności dotrzeć można również do korpusów wielojęzycznych, tworzonych w oparciu o rozmaite kryteria. Przykładem wielojęzycznego korpusu specjalistycznego może być DraCor3, zawierający bogaty zbiór dramatów. Szczególnie użytecznym rodzajem korpusów są korpusy anotowane (znakowane, oznaczone). Są to zbiory tekstów wzbogacone o dodatkową warstwę informacyjną. Informacje te mogą dotyczyć rozmaitych aspektów struktury lub znaczeń tekstów i języka. Przykładem może być anotacja morfologicznoskładniowa, która określa status morfologiczny lub składniowy 2 W tym miejscu warto przypomnieć rozróżnienie terminu korpus oraz wyszukiwarka korpusowa. W codziennej pracy używamy często skrótowo słowa korpus w odniesieniu do obu tych znaczeń, jednak na potrzeby precyzyjnej komunikacji jego odniesienie zawęża się do kolekcji tekstów wyselekcjonowanych i uporządkowanych według ściśle określonych kryteriów i opisanych ustandaryzowanymi metadanymi. Wyszukiwarka korpusowa to program komputerowy, który umożliwia eksplorację korpusu – jego przeglądanie, zadawanie zapytań, tworzenie statystyk itp. Można obrazowo stwierdzić, że korpus stanowi treść jakiegoś zasobu a wyszukiwarka korpusowa to sposób jego odczytywania. Zdarza się, że niektóre korpusy mają swoje dedykowane wyszukiwarki (np. Staropolskie apokryfy Nowego Testamentu) lub możliwy jest import korpusu do uniwersalnej przeglądarki korpusowej umożliwiającej przeglądanie różnych korpusów (np. Korpusomat, Kontext lub PELCRA obsługująca pierwotnie Narodowy Korpus Języka Polskiego, ale możliwa do wykorzystania również w innych korpusach) 3 https://dracor.org/ (dostęp: 09.06.2025 r.) Czym są dane badawcze w językoznawstwie Skuteczne zarządzanie danymi badawczymi wymaga od kierownika projektu lub data stewarda nie tylko uwzględnienia specyficznych wymagań wynikających z dobrych praktyk obowiązujących w danej dyscyplinie, lecz również cech charakterystycznych konkretnego zestawu danych. Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 6 każdego tokena 4 (np. część mowy, liczbę, rodzaj gramatyczny, funkcję składniową). Anotacja może dotyczyć również stylu, treści, pochodzenia, funkcji pragmatycznej oraz innych własciwości określonych jednostek tekstu (takich jak: token, słowo, zdanie, wypowiedź). Efektem przeprowadzenia prac anotacyjnych jest znaczne zwiększenie użyteczności badawczej tekstów, jednak ich przygotowanie wymaga zazwyczaj znaczących środków finansowych oraz jest czasochłonne. Dlatego właśnie efekty tych prac powinny być publikowane w sposób otwarty tak, by zwiększyć prawdopodobieństwo ponownego użycia zasobu. Publikacja taka przybiera najczęściej formę korpusu anotowanego. W tym miejscu warto wspomnieć o szczególnej kategorii korpusów, jaką są korpusy zrównoważone. Należą do nich takie zbiory tekstów, które zostały dobrane według ściśle określonych kryteriów odwzorowujących zróżnicowanie danego zasobu językowego. Zrównoważenie może dotyczyć przykładowo gatunków mowy, modalności komunikatów, czasu ich powstania czy płci uczestników aktu komunikacyjnego. Możliwości doboru kryteriów równoważenia istnieje wiele i są one determinowane metodologią przyjętą przez badaczy. Księga kodów, wytyczne anotacji: Prace anotacyjne prowadzone są zazwyczaj w kilku etapach. Istotny jest etap przygotowawczy, podczas którego formułowane są oczekiwania badawcze, określane kategorie informacji przypisywanych określonym jednostkom tekstowym, a następnie opracowywane instrukcje dla anotatorów. W ten sposób powstają dokumenty określane jako księgi kodów lub wytyczne anotacji. Dokumentacja ta jest wartościowa i potencjalnie możliwa do ponownego użycia. Wyobraźmy sobie sytuację, w której naukowcy tworzyli anotację pragmalingwistyczną dialogów transkrybowanych z telewizyjnych programów publicystycznych w kampanii wyborczej w 2015 roku. Przygotowanie księgi kodów lub wytycznych anotacji było prawdopodobnie procesem zajmującym kilka miesięcy 4 token – pojęcie używane w maszynowym przetwarzaniu języka (NLP) oraz językoznawstwie korpusowym oznaczające funkcjonalną operacyjnie jednostkę analizy. W trakcie używania narzędzi NLP teksty są dzielone na tokeny, które mogą obejmować swoim zakresem różne zakresy – jest to uzależnione od potrzeb badawczych. Zazwyczaj są to słowa, morfemy lub frazy, ale mogą być również całe zdania. i wymagającym zaangażowania dwóch lub trzech osób. Naukowcy chcący dokonać podobnej anotacji dialogów powstałych przy okazji wyborów w roku 2023 mogą użyć udokumentowanych instrukcji w celu przyspieszenia badań oraz obniżenia ich kosztów. Dostęp do księgi kodów umożliwia również przeprowadzenie analizy porównawczej lub badań panelowych. Warunkiem jest tu oczywiście otwarta dostępność dokumentacji oraz rzetelność jej przygotowania. Zasoby leksykalne: Osobną kategorię danych badawczych tworzonych przez i dla językoznawców są zasoby leksykalne, do których zaliczają się słowniki, leksykalne bazy danych, tezaurusy, leksykony. Zasoby leksykalne powstają często jako efekt wieloletnich prac zespołowych a możliwości ich wykorzystania jest wiele. Przykładem mogą być tutaj Słowosieć (plWordnet)5, Wielki Słownik Języka Polskiego6, Słownik Polszczyzny XVI wieku7, Merriam-Webster Dictionary8, Princeton Wordnet9. Niektóre z zasobów leksykalnych są często wykorzystywane w pracach informatycznych (np. wordnety, ontologie), inne kierowane są do użytkownika „ludzkiego” (Wielki Słownik Języka Polskiego), a jeszcze inne doskonale sprawdzają się w obu grupach zastosowań (np. niektóre wordnety – w tym Słowosieć). Istnieją również rodziny zasobów leksykalnych, które występują niejako przy okazji realizacji projektów badawczych, których tematyka wykracza daleko poza leksykografię czy językoznawstwo. Są to na przykład stop-listy – wykazy jednostek wyrazowych, które z rozmaitych przyczyn pomijane są podczas badań stylometrycznych lub automatycznej analizy treści (np. metodami modelowania tematycznego, ang. topic modeling). Badania takie mogą być przeprowadzane na potrzeby nie tylko filologów, lecz również osób zajmujących się analizą dyskursu medialnego, socjologów, kryminologów czy historyków. Stop-listy są zazwyczaj relatywnie krótkimi listami (od kilkudziesięciu do maksymalnie 5 http://plwordnet.pwr.wroc.pl/wordnet/ (dostęp: 09.06.2025 r.) 6 https://wsjp.pl/ (dostęp: 09.06.2025 r.) 7 https://spxvi.edu.pl/ (dostęp: 09.06.2025 r.) 8 https://www.merriam-webster.com/ (dostęp: 09.06.2025 r.) 9 https://wordnet.princeton.edu/ (dostęp: 09.06.2025 r.) kilkuset jednostek), których przygotowanie wymaga jednak wielu czasochłonnych eksperymentów. Listy te są również nieodzowne w przypadku potrzeby ponownego przeprowadzenia badań (np. w celu weryfikacji) oraz mogą służyć innym naukowcom planującym realizację pokrewnych tematycznie projektów. Nagrania audio: Osobną grupę zasobów intrygujących językoznawców są nagrania mowy. Zasoby te mogą służyć analizom akustycznym, prozodycznym, fonetycznym, dialektologicznym, ale również badaniom nurtu pragmalub socjolingwistycznego. Nagrania autentycznej, żywej mowy są również wykorzystywane do uczenia sztucznej inteligencji w zadaniach dotyczących rozpoznawania mowy, jej transkrypcji oraz w rozmaitych zastosowaniach przemysłowych. W przypadku nagrań mowy istotną cechą, warunkującą późniejsze ponowne wykorzystanie zasobu, jest jego jakość, rozumiana jako osiągnięcie wysokich parametrów technicznych, które mogą zależeć od specyfiki wykorzystanego sprzętu oraz umiejętności osoby odpowiedzialnej za nagrania. Wywiady (bazy danych): Zbiory zawierające nagrania oraz transkrypcje wywiadów są szcze - gólnym rodzajem danych badawczych. Można uznać, że stanowią specyficzną podgrupę nagrań mowy, jednak, o ile nagrania te powstają zazwyczaj w efekcie badania parametrów fonetycznych lub prozodycznych języka, o tyle nagrania wywiadów służą zazwyczaj udokumentowaniu pewnej treści, która podlega dalszej analizie. Mogą powstawać bardzo często przy okazji realizacji projektów naukowych w obszarach odległych od językoznawstwa (np. historii, etnologii, antropologii, socjologii), jednak opublikowanie ich w otwartych repozytoriach przykuwa często uwagę specjalistów zajmujących się językiem właśnie. W zależności od przyjętej przez twórców poszczególnych zasobów metody sporządzania zapisów wywiadów, dane te mogą zawierać cenne informacje na temat sposobu używania języka, pragmalingwistycznych aspektów komunikacji, stosowanej leksyki, aspektów dyskursologicznych, itd. Świetnym przykładem zbioru wywiadów użytecznych interdyscyplinarnie jest Documenting the American South10. 10 https://docsouth.unc.edu/index.html (dostęp; 09.06.2025 r.) Dane badawcze obejmują m. in. dane statystyczne, wyniki eksperymentów, pomiarów, obserwacji prowadzonych w terenie, kolekcje tekstów (np. dokumentów historycznych, dzieł literackich), wyniki ankiet, nagrania wywiadów i zdjęcia. Dane badawcze różnią się od artykułów naukowych, które relacjonują i komentują ustalenia wynikające z tych badań Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 7 Skany rękopisów lub starodruków: Cennym źródłem danych, szczególnie z perspektywy badań diachronicznych prowadzonych na zapisanych tekstach, są zdigitalizowane rękopisy i starodruki. W przypadku tego typu zasobów należy pamiętać, że stopień digitalizacji materiału ana - logowego może się znacznie różnić między różnymi zasobami. Niektóre mogą mieć charakter prostych skanów dokumentów, których w żaden sposób nie możemy edytować (np. kolekcja skanów średniowiecznych recept11), inne mogą dostarczać skanów i/lub ich transkrypcji uzupełnionych nawet o złożoną anotację (tu przykładem może być korpus tekstów osób uczących się języka niemieckiego – KoKo12). Powyższa lista rodzajów danych językoznawczych jest katalogiem otwartym, bez trudu możemy znaleźć ich dużo więcej w literaturze naukowej (np. Narzędzia cyfrowe w polonistycznej dydaktyce akademickiejzastosowania, możliwości, perspektywy 13 lub Digital Humanities in Poland from the perspective of the historical linguist of the Polish language: achievements, needs, demands14) lub też w repozytoriach danych badawczych (np. CLARIN-PL15) oraz w specjalistycznych katalogach (CLARIN Resource Families 16 ) i agregatorach (np. SSHOC marketplace17). 11 https://www.e-codices.ch/en (dostęp: 09.06.2025 r.) 12 https://clarin.eurac.edu/repository/xmlui/handle/20.500.12124/12 (dostęp: 09.06.2026 r.) 13 Beata Duda, Karolina Lisczyk, Narzędzia cyfrowe w polonistycznej dydaktyce akademickiej–zastosowania, możliwości, perspektywy, [w:] Forum Lingwistyczne 5/2018. 14 Magdalena Pastuch, Beata Duda, Karolina Lisczyk, Barbara Mitrenga, Joanna Przyklenk, Katarzyna Sujkowska–Sobisz ,Digital Humanities in Poland from the perspective of the historical linguist of the Polish language: achievements, needs, demands, [w:] Digital Scholarship in the Humanities 4/2018. 15 https://clarin-pl.eu/dspace/ (dostęp: 09.06.2025 r.) 16 https://www.clarin.eu/resource-families (dostęp: 09.06.2025 r.) 17 https://marketplace.sshopencloud.eu/ (dostęp: 09.06.2025 r.) Rodzaje danych badawczych oraz pozyskiwanie lub ponowne wykorzystanie dostępnych danych Dane cyfrowe i analogowe Współcześnie najczęściej wykorzystywane i tworzone dane badawcze mają charakter cyfrowy. Są to zasadniczo wszystkie dane tworzone za pomocą komputerów oraz oprogramowania informatycznego. W językoznawstwie najczęściej spotkamy korpusy tekstów, bazy leksykalne, ontologie, nagrania, wypełnione formularze ankietowe, transkrypcje, transliteracje, itd. Z praktyki naukowej wynika jednak, że niektóre przedsięwzięcia wymagają pracy z danymi niecyfrowymi (analogowymi): starodrukami, rękopisami, inskrypcjami wyrytymi w kamieniu lub drewnie. Dane tego typu wymagają specjalnego potraktowania w porównaniu z procedurami dotyczącymi danych cyfrowych. W przypadku badań finansowanych ze środków publicznych (na przykład NCN) wymagana jest cyfryzacja takiego materiału. Metodę cyfryzacji należy w takim przypadku opisać w planie zarządzania danymi. Wykorzystane techniki cyfryzacji powinny być adekwatne do tematu badań i charakteru artefaktu. Przykładowo – badania dotyczące inskrypcji nagrobnych nie wymagają skanowania trójwymiarowego płyt, na których zostały umieszczone. Wystarczające byłoby stworzenie cyfrowej transkrypcji tych inskrypcji, np. poprzez dokumentację zdjęciową. W przypadku materiałów audio oraz video zapisanych pierwotnie na nośnikach analogowych (taśmach magnetofonowych, płytach winylowych, taśmach VHS lub filmowych, fotografiach tradycyjnych), właściwą formą digitalizacji będzie przetworzenie ich do formatów cyfrowych akceptowanych w repozytoriach (np. wmv, mp3, mp4, avi, mpg, mpeg, png). Dane surowe oraz dane pochodne Innym powszechnie spotykanym rozróżnieniem danych badawczych jest ich klasyfikacja na dane surowe oraz dane pochodne (skompilowane, opracowane). Do pierwszej grupy zaliczymy wszelkie dane zebrane podczas realizacji projektu, które nie przeszły jeszcze analizy. Są to zazwyczaj dane nieuporządkowane, niepozwalające na wyciągnięcie bezpośrednich wniosków. Ich przykładem mogą być wyniki ankiet, zapisy wywiadów fokusowych, nieredagowane próbki tekstów pozyskanych na potrzeby korpusu, nagrania rozmów z użytkownikami dialektu. Dane pochodne są zazwyczaj efektem czasochłonnych analiz i procesu porządkowania danych surowych. Znajdziemy wśród nich takie zbiory jak: korpusy tekstów wyselekcjonowanych ze względu na precyzyjnie dobrane kryteria (często anotowanych dodatkowymi warstwami informacyjnymi), wiele rodzajów baz danych (np. zawierających wyniki ankiet, opracowanie wyników wywiadów prowadzonych w terenie), słowniki, mapy, opracowania statystyczne (wraz z wizualizacjami danych: diagramami, infografikami itp.). Rozróżnienie na dane surowe i pochodne może okazać się bardzo użyteczne zarówno z perspektywy badacza wytwarzającego dane, jak też użytkownika planującego ich ponowne wykorzystanie. „Dawca” powinien każdorazowo rozważyć dotyczące go zobowiązania wynikające z warunków finansowania projektu, ale też z ogólnych ram prawnych (np. prawa autorskiego, ochrony danych osobowych i danych wrażliwych, praw własności intelektualnej, itd.). W wielu przypadkach może się okazać, że nie istnieje żadna istotna przeszkoda, by otwarty dostęp został udzielony zarówno w odniesieniu do danych surowych, jak też przetworzonych. Przykładem takiej sytuacji jest korpus Chronopress18 (diachroniczny korpus zawierający wybór próbek tekstów prasowych okresu powojennego oraz PRL), który został zdeponowany w repozytorium CLARIN-PL w postaci danych surowych19 oraz (jako zbiór przetworzony) udostępniony poprzez dedyko18 https://chronopress.clarin-pl.eu/#/ (dostęp: 09.06.2025 r.) 19 https://clarin-pl.eu/dspace/handle/11321/260 (dostęp: 09.06.2025 r.) waną przeglądarkę korpusową na stronie Chronopress – Portal Tekstów Prasowych20. Zdarza się jednak, że występują istotne przeszkody wykluczające udostępnienie danych w postaci albo surowej, albo przetworzonej. Przykładem danych funkcjonujących wyłącznie w postaci surowej jest Narodowy Fotokorpus Języka Polskiego. Zdecydowanie częściej występuje jednak sytuacja, w której to właśnie dane surowe nie mogą zostać otwarcie udostępnione. Dane takie mogą zawierać szereg informacji osobowych, których anonimizacja przekreśliłaby ich naukową użyteczność. W innym przypadku publikacja może naruszyć warunki licencyjne lub prawa autorskie. Z sytuacją taką mamy często do czynienia w przypadku tworzenia modeli językowych, których udostępnienie mieści się w ramach prawnych, jednak udostępnienie wszystkich tekstów, które posłużyły do jego wytrenowania, byłoby już ich ewidentnym naruszeniem. Warto nadmienić, że w miarę możliwości należy publikować oba rodzaje danych wytworzonych w projektach badawczych. Dane surowe mogą być w przyszłości wykorzystane w innowacyjny sposób, który wykracza poza pierwotne zamiary czy dyscyplinę ich twórców. Dane pochodne mają zazwyczaj istotny walor poznawczy, ich wytworzenie mogło być kosztochłonne a stopień uporządkowania pozwolił na wysnucie wniosków przedstawionych jako publikacje naukowe. Kryterium rzetelności naukowej, replikowalności oraz ekonomiczności wskazuje zatem, że dane takie powinny być również udostępniane otwarcie. Formaty plików z danymi Czym jest format pliku? Współcześnie, wytwarzając dane badawcze w formie cyfrowej (lub digitalizując dane analogowe), zazwyczaj zapisujemy je w postaci plików, które mogą być przechowywane na nośnikach elektronicznych (lub w chmurze danych) a następnie przetwarzane za pomocą programów komputerowych. Pliki są ustandaryzowane pod względem sposobu zapisu informacji – standard ten nazywamy formatem. 20 https://chronopress.clarin-pl.eu/#/ (dostęp: 09.06.2025 r.) Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 8 Format pliku możemy odczytać zazwyczaj z nazwy pliku – jest to ciąg znaków umieszczony po kropce, np.: .mp3, .doc, .jpg, .txt. Czemu format jest ważny? Sposób zapisu informacji – format – determinuje w pewnym stopniu możliwość późniejszego wykorzystania utrwalonych danych badawczych. Format ten bywa narzucany przez narzędzia, które wykorzystujemy podczas zbierania lub wytwarzania danych. Powinniśmy mieć świadomość tego, z jakim formatem pracujemy i w jaki sposób wpływa on na możliwości dalszego (lub ponownego) wykorzystania danych. Formaty otwarte i zamknięte Formaty plików mogą być opatentowane i stanowić własność konkretnych przedsiębiorstw, które ustalają warunki korzystania z nich. Oznacza to, że zapisywanie lub odczytywanie informacji w danym formacie może wymagać skorzystania z płatnego oprogramowania. W ekstremalnych sytuacjach właściciel formatu może zdecydować o wycofaniu go z rynku. Decyzja taka spowodowałaby niemożność lub znaczne ograniczenie w odczytywaniu danych. Ten typ formatów określamy jako zamknięty. Istnieje jednak wiele formatów plików, które mają charakter otwarty. Oznacza to, że twórcy formatu postanowili opublikować jego pełną dokumentację na otwartej licencji21. Dzięki temu zapisanie lub otwarcie pliku nie wymaga korzystania z płatnego oprogramowania (choć pliki mogą być wciąż otwierane za pomocą takiego oprogramowania). Poniżej zamieszczamy tabelę zawierającą przykłady otwartych oraz zamkniętych formatów danych z podziałem na charakter zapisywanych informacji. 21 Jest to rodzaj licencji, za pomocą której dysponent praw autorskich deklaruje dostępność danego programu, dokumentu lub bazy danych szerokiemu gronu odbiorców. Licencja zawiera informacje na temat wymogów stawianych przez dysponenta praw (np. uznanie autorstwa). Licencja otwarta oznacza zazwyczaj bezpłatny dostęp do treści objętej licencją. RODZAJ PLIKU FORMAT ZAMKNIĘTY FORMAT OTWARTY tekstowy DOC, DOCX, PAGES TXT, ODT, HTML, XML, PDF, LaTeX, CSV archiwum RAR ZIP, 7z, TAR arkusze kalkulacyjne XLS, XLSX ODS, CSV audio WMA MP3, FLAC video WMV MKV, AV1 obraz BMP, PSD, MDI JPG, PNG, GIF, SVG prezentacje PPT, PPTX, KEY PDF, HTML, ODP Tab. 1. Przykłady zamkniętych oraz otwartych formatów danych Jaki format pliku wybrać? W przypadku otwartego udostępniania danych badawczych zdecydowanie zaleca się korzystanie z formatów otwartych. Wynika to z kilku przyczyn – przede wszystkim publikując w tych formatach, unikamy zmuszania przyszłego użytkownika do korzystania z płatnego oprogramowania. W ten sposób uniezależniamy odczyt informacji od przyszłych decyzji właściciela praw do formatu zamkniętego (wycofanie formatu z użytkowania, zmiany licencji itp.). Ponadto wiele repozytoriów danych badawczych oraz agencji finansujących badania wymaga danych zgodnych z standardem FAIR, co oznacza w praktyce wymóg upubliczniania danych w formatach otwartych lub otwieranych przy użyciu oprogramowania otwartego. Jednocześnie nie musimy unikać formatów zamkniętych podczas całego procesu zbierania i opracowywania informacji. Formaty zamknięte cieszą się bardzo dużą popularnością, ponieważ oprogramowanie korzystające z nich jest stale rozwijane przez firmy deweloperskie. Jeżeli zatem mamy możliwość korzystania z wygodnych narzędzi dostarczanych przez Microsoft, Apple, Adobe i innych dostawców, nie musimy tego unikać. Pamiętajmy jednak, żeby przed zdeponowaniem plików zadbać o zmianę formatu na otwarty. Konwersja taka nie jest zazwyczaj obciążona trudnościami technicznymi, jednak w przypadku dużego wolumenu danych może okazać się, że wymaga dużego nakładu pracy i czasu (niekiedy również poniesienia dodatkowych kosztów). Z powyższych względów należy przemyśleć już na etapie planowania projektu, jakich narzędzi i oprogramowania użyjemy, jakie formaty zostaną wykorzystane w czasie zbierania/wytwarzania danych oraz jakie działania zostaną podjęte, by spełnić wymagania repozytorium oraz agencji finansującej badania. Nasze plany dotyczące powyższych kwestii opisujemy w planie zarządzania danymi (DMP). Otwarta nauka: otwarty dostęp a otwarte dane badawcze Dziś mianem otwartej nauki (ang. Open Science) określa się ruch społeczności naukowej (nie tylko akademickiej!) działający na rzecz jak najszerszego, bezpłatnego dostępu do wiedzy, publikacji, danych, edukacji, narzędzi i metod będących efektem prac badaczy lub koniecznych do prowadzenia prac badawczych22. Imperatyw szerokiego dostępu wynika z przekonania o tym, że wiedza produkowana jako efekt procesu społecznego, finansowanego z publicznych środków, powinna być również publicznie dostępna. Często pojęcia otwarta nauka oraz otwarty dostęp (ang. Open Access) są używane wymiennie – to daleko idące uproszczenie wymaga jednak wyjaśnienia: otóż otwarty dostęp dotyczy publikacji, jest jednym z pięciu obszarów wyznaczających ramy otwartej wiedzy naukowej. Można zatem uznać, że podobnie jak otwarte dane badawcze, tak otwarty dostęp do publikacji naukowych są realizacją szerszego pojęcia otwartej nauki w odniesieniu do specjalistycznych obszarów (odpowiednio: danych badawczych i publikacji). Pełna lista filarów otwartego dostępu do wiedzy naukowej, wg UNESCO wygląda następująco: • Otwarte oprogramowanie i kod źródłowy: używanie technologii otwartego oprogramowania; • Otwarte dane badawcze: udostępnianie dostępnych danych na otwartych licencjach bez ograniczeń dostępu; 22 UNESCO Recommendation on Open Science (2021): https://www.unesco.org/en/ open-science/about (dostęp: 09.06.2025 r.) Ruch otwartej nauki dąży do zapewnienia bezpłatnego dostępu do wiedzy, publikacji, danych badawczych oraz narzędzi badawczych, opierając się na założeniu, że efekty badań finansowanych ze środków publicznych powinny być publicznie dostępne. Otwarty dostęp do publikacji i otwarte dane badawcze stanowią kluczowe filary tego ruchu, wspierane przez międzynarodowe inicjatywy i regulacje. Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 9 • Otwarty dostęp do publikacji: publikowanie wyników badań w sposób otwarty bez ograniczeń dostępu; • Otwarte zasoby edukacyjne: używanie bezpłatnych i otwartych materiałów dla edukacji i nauczania uniwersyteckiego; • Otwarty dostęp do sprzętu – dostęp do otwartego sprzętu, czyli takiego, którego specyfikacja techniczna, dokumentacja powstawania i replikowania dostępna jest na otwartych licencjach, zapewniając jak największej liczbie osób możliwość konstruowania, remiksowania i dzielenia się wiedzą na temat projektowania sprzętu23. Oprócz otwartego dostępu do wiedzy naukowej, UNESCO wyróżnia jeszcze trzy inne obszary Otwartej Nauki, są to: otwarte infrastruktury naukowe, otwarte zaangażowanie strony społecznej oraz otwarty dialog z innymi systemami wiedzy. W niniejszym opracowaniu skupimy się jednak wyłącznie na dostępie do wiedzy naukowej. Idee utożsamiane dziś z ruchem otwartej nauki sięgają daleko w przeszłość. W 1948 r. twórcy Powszechnej Deklaracji Praw Człowieka postanowili je uwzględnić w artykule 27: Każdy człowiek ma prawo do swobodnego uczestniczenia w życiu kulturalnym społeczeństwa, do korzystania ze sztuki, do uczestniczenia w postępie nauki i korzystania z jego dobrodziejstw24. Na początku XXI wieku ruch zaangażowany w popularyzację powyższych idei przyczynił się do przygotowania szeregu inicjatyw dążących do urzeczywistnienia postulatów otwartej nauki, których przykładami są: • Budapeszteńska Inicjatywa Otwartego Dostępu (ang. Budapest Open Access Initiative25, 2002), • Deklaracja z Bethesdy (ang. Bethesda Statement on Open Access Publishing26, 2003), 23 ibid. 24 https://www.unic.un.org.pl/dokumenty/deklaracja.php (dostęp: 09.06. 2025 r.) 25 https://www.budapestopenaccessinitiative.org/ (dostęp: 09.06. 2025 r.) 26 http://nrs.harvard.edu/urn-3:HUL.InstRepos:4725199 (dostęp: 09.06.2025 r.) Rys. 1. Filary otwartej nauki według UNESCO (https://unesdoc.unesco.org/ark:/48223/pf0000379949, data dostępu 09.06.2025 r.) • Deklaracja Berlińska w sprawie otwartego dostępu do wiedzy w naukach ścisłych i humanistycznych (ang. Berlin Declaration on Open Access to Knowledge in the Sciences and Humanities27, 2003). Wieloletnie wysiłki naukowców, popularyzatorów nauki oraz osób zarządzających tym sektorem doprowadziły do uwzględnienia danych badawczych w Dyrektywie Parlamentu Europejskiego i Rady (UE) 2019/1024 z dn. 20 VI 2019 r. w sprawie otwartych danych i ponownego wykorzystywania informacji sektora publicznego. Był to punkt zwrotny, ponieważ w dokumencie tym jednoznacznie uznano, że dane naukowe są dobrem publicznym. Obecnie zapewnienie dostępu do otwartych danych badawczych jest obowiązkiem formułowanym przez organizacje finansujące badania (np. NCN 28 , FNP 29 , ERC 30 ). Wymagania te znajdują uzasadnienie w politykach naukowych poszczególnych państw np. Finlandii31 czy Słowenii32. 27 https://openaccess.mpg.de/Berlin-Declaration (dostęp: 09.06.2025 r.) 28 https://www.ncn.gov.pl/sites/default/files/pliki/2019_04_03_pismo_dyrektora_NCN_zarzadzanie_danymi_naukowymi.pdf (dostęp: 09.06. 2025 r.) 29 W przypadku FNP możemy mówić nie o obowiązku, lecz o rekomendacji. 30 https://erc.europa.eu/sites/default/files/document/file/ERC_info_document- -Open_Research_Data_and_Data_Management_Plans.pdf (dostęp: 09.06.2025 r.) 31 https://avointiede.fi/en/policies-materials/policies-open-science-and-research- -finland/policy-open-access-scholarly (dostęp: 09.06. 2025 r.) 32 https://www.gov.si/assets/ministrstva/MVZI/Znanost/do-2020-Strategije-predpisi-in-drugi-dokumenti/National-strategy-of-open-access-to-scientific-publications- -and-research-data-in-Slovenia-2015-2020.pdf (dostęp: 09.06. 2025 r.) OTWARTA NAUKA otwarta wiedza naukowa otwarta infrastruktura naukowa otwarty dostęp do publikacji naukowych otwarte dane naukowe otwarte zasoby edukacyjne otwarte oprogramowanie I kod źródłowy otwarty dostęp do sprzętu otwarty dialog z innymi systemami wiedzy otwarte zaangażowanie stron społecznych Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 16 Narzędzia służące do oceny FAIR „Czy moje dane są FAIR?” – takie pytanie zadaje sobie zarówno wielu naukowców w odniesieniu do projektów dopiero planowanych, jak też ci badacze, którzy zmierzają do finalizacji prowadzonych prac. Nim omówimy metody uzyskania odpowiedzi na wspomniane pytanie, powinniśmy sobie uświadomić, że „bycie FAIR” oznacza mieszczenie się w pewnym spektrum. Ocena spełniania omawianych wymagań nie jest zero-jedynkowa. Wręcz przeciwnie – dane mogą być FAIR w różnym stopniu, co w znacznej mierze zależy od ich charakterystycznych właściwości. Wskazówek pozwalających na ocenę tego stopnia mogą dostarczyć zarówno narzędzia dostępne za pośrednictwem internetu, jak też listy kontrolne. Przykładem takiej listy jest „How FAIR are your data – checklist” zaprezentowana na letniej szkole organizowanej w ramach inicjatywy EUDAT46. Listę tę możemy potraktować jako łatwo dostępną metodę oceny naszych danych. Poniżej prezentujemy jej tłumaczenie: Lista kontrolna: How FAIR are your data Findable – odnajdywalne Należy zapewnić innym możliwość znalezienia twoich danych. Bogate metadane powinny być udostępniane online w przeszukiwalnym serwisie. Właściwe dane powinny posiadać trwały identyfikator (PID). • Twoje dane posiadają trwały identyfikator; • Twoje dane opisane są za pomocą bogatych metadanych; • Metadane są dostępne online w przeszukiwalnym serwisie, np. w katalogu lub repozytorium danych; • Rekord metadanych zawiera trwały identyfikator (PID). Accessible – dostępne Należy zapewnić ludziom i maszynom 47 możliwość dostępu do danych na jasnych warunkach lub, jeżeli to konieczne, z odpowiednimi zastrzeżeniami. Zasady FAIR nie oznaczają, że dane muszą być otwarte! Należy zapewnić dostęp do metadanych, nawet jeżeli dane nie są dostępne. 46 https://zenodo.org/records/5111307 (dostęp: 09.06.2025 r.) 47 Mowa tu przykładowo o agregatorach danych. • Trwały identyfikator prowadzi do danych lub opisujących je metadanych; • Protokół48, za pomocą którego można pobrać dane, korzysta z szeroko rozpowszechnionych standardów, np. http; • Jeżeli to konieczne, procedura uzyskiwania dostępu do danych może uwzględniać uwierzytelnienie lub autoryzację; • Metadane są dostępne nawet wtedy, kiedy same dane nie są dostępne. Interoperable – interoperacyjne Dane i metadane powinny uwzględniać szeroko rozpowszechnione formaty i standardy, aby umożliwić łączenie i wymianę danych. Twoje dane są zapisane w standardowym formacie, najlepiej otwartym. • Metadane są sporządzone według odpowiednich standardów; • Wykorzystywane są kontrolowane słowniki, słowa kluczowe lub ontologie, jeżeli to możliwe; • Wskazane są odpowiednie odnośniki i linki do innych, powiązanych zestawów danych. Reusable – możliwe do ponownego wykorzystania Do interpretacji i ponownego wykorzystania danych potrzebna jest wyczerpująca dokumentacja. Dane powinny być dostosowane do norm wypracowanych przez społeczności naukowe i udostępniane na jasno określonych licencjach, aby inni wiedzieli, jaki zakres ponownego wykorzystania jest dozwolony. • Dane są rzetelne i dobrze opisane, z uwzględnieniem odpowiednich atrybutów; • Dane posiadają jasno określone i dostępne licencje; • Dostępne są informacje na temat tego, w jaki sposób, kiedy i przez kogo dane zostały wytworzone lub zebrane i opracowane; • Dane i metadane są dostosowane do odpowiednich standardów dziedzinowych. 48 Protokół komunikacyjny – zbiór ścisłych reguł oraz kroków postępowania, które są automatycznie wykonywane przez urządzenia komunikacyjne w celu nawiązania łączności i wymiany danych. Narzędzia cyfrowe wspierające ocenę danych (FAIR) Środowiska naukowe wypracowały szereg narzędzi umożliwiających ocenę własnej wiedzy na temat zasad FAIR oraz samodzielną ocenę danych pod względem stopnia ich spełniania. Szczególnie warte polecenia są trzy z nich: • FAIR – Aware49 (narzędzie przygotowane i utrzymywane przez DANS – Data Archiving and Networked Services50) wypełnienie niezbyt długiego formularza pomoże nam ocenić własną znajomość zasad FAIR oraz stopień, w jakim zamierzamy je implementować w udostępnianych danych. W formularzu napotkamy szereg pytań dotyczących tego, czy jesteśmy świadomi istotnych aspektów poszczególnych wymagań a następnie zostaniemy poproszeni o zaznaczenie, jak bardzo jest prawdopodobne (w skali 1-10), że się do nich zastosujemy. Odpowiedź na pytania formularzowe nie powinna zająć nam więcej niż 15 minut. Po wysłaniu formularza otrzymamy ocenę naszej świadomości zasad FAIR (w skali 1-10) oraz potencjalnej zgodności danych (w skali 1 - 50). Kwestionariuszowi towarzyszy wykaz cennych źródeł, dzięki którym możemy znacznie pogłębić wiedzę lub zapoznać się z dobrymi praktykami. • FAIR Data Self Assessment Tool51 (narzędzie przygotowane i utrzymywane przez Australian Research Data Commons – ARDC 52 ) – kwestionariusz zawiera 12 pytań dotyczących kluczowych aspektów sposobu udostępniania danych badawczych. Aspekty te są bardzo konkretne, zostały opisane w przystępny sposób odwołujący się do doświadczeń i decyzji, które zna każdy naukowiec pracujący z danymi. Dzięki temu FAIR DSAT jest przystępnym narzędziem umożliwiającym szybką ocenę udostępnianych zasobów pod względem ich przystawalności do zasad FAIR. Dzięki dynamicznemu interfejsowi możemy również obserwować, jak bardzo każda z naszych odpowiedzi 49 https://fairaware.dans.knaw.nl/ (dostęp: 09.06.2025 r.) 50 https://dans.knaw.nl/en/about/ (dostęp: 09.06.2025 r.) 51 https://ardc.edu.au/resource/fair-data-self-assessment-tool/ (dostęp: 09.06.2025 r.) 52 https://ardc.edu.au/about-us (dostęp: 09.06.2025 r.) modyfikuje ostateczny wynik. Rozwiązanie to ma istotny walor edukacyjny, dzięki któremu możemy poznać wagę danego kryterium i odpowiednio naszych decyzji dotyczących sposobu zarządzania danymi. Końcowa ocena wyrażona jest za pomocą procentów, co wyraziście podkreśla trafność myślenia o „byciu FAIR” w kategoriach spektrum. • F-UJI53 – Automated FAIR Data Assessment Tool – jest to narzędzie umożliwiające automatyczną ocenę stopnia spełniania wymogów FAIR przez zasób zdeponowany w repozytorium. Narzędzie jest rozwijane w ramach projektu FAIRsFAIR54 powiązanego z EOSC. Ocena odbywa się w sposób automatyczny przy użyciu specjalnie opracowanych algorytmów. W tej chwili dostępne są algorytmy wielodziedzinowe – mniej precyzyjne oraz dwa algorytmy dziedzinowe – bardziej precyzyjne 55 . By skorzystać z narzędzia, wystarczy dysponować trwałym identyfikatorem (PID) zasobu lub jego adresem URL. Identyfikator (lub) adres należy wkleić w okienko wyszukiwarki i poczekać chwilę na wynik. Efektem procesu oceny jest kontrola siedemnastu kluczowych aspektów zasobu reprezentujących cztery fundamentalne cechy standardu FAIR (Findable, Accessible, Interoperable, Reusable). Ocena nie sprowadza się wyłącznie do zidentyfikowania ogólnego poziomu „bycia FAIR”, lecz umożliwia również sprawdzenie każdego z siedemnastu wspomnianych aspektów. Narzędzie może być bardzo przydatne podczas procesu szukania repozytorium dla danych, które chcemy opublikować. Usprawnia również kontrolę stabilności zasobu jakiś czas po jego publikacji. Dzięki F-UJI istnieje możliwość szybkiego sprawdzenia czy zasób wciąż spełnia wymogi FAIR. W trakcie powstawania niniejszego Przewodnika narzędzie było w zaawansowanym stadium testowym. 53 https://www.f-uji.net/ (dostęp: 09.06.2025 r.) 54 https://www.fairsfair.eu/ (dostęp: 09.06.2025 r.) 55 Dokładny opis algorytmów oraz czynników wpływających na ocenę zasobu jest zawarty na stronie narzędzia. Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 17 Na czym polega zarządzanie danymi badawczymi Na zarządzanie danymi badawczymi składa się zestaw czynności wymaganych od kierownika projektu, których celem jest zabezpieczenie trwałości danych oraz wypełnienie standardów ich dostępności. Wymagania te są określane precyzyjnie przez organizacje finansujące badania, a także uczelnie i instytucje zatrudniające naukowców. Dobrą praktyką oraz jednym z częściej występujących wymagań jest sporządzenie Planu Zarządzania Danymi (ang. Data Management Plan – DMP), który dokładnie omówiono w rozdziale siódmym Przewodnika. Nim przejdziemy do szczegółowego omówienia struktury dokumentu DMP, zastanówmy się, jakie cele przyświecają jego tworzeniu i wdrażaniu. 4 Dlaczego zarządzanie danymi jest istotne dla językoznawstwa Jakie korzyści płyną z efektywnego zarządzania danymi badawczymi 1. EFEKTYWNOŚĆ FINANSOWA: Wytworzenie rzetelnych danych jest kosztowne – angażuje środki finansowe i czas specjalistów. Dzięki sprawnemu zarządzaniu możemy z nich korzystać wielokrotnie oraz lepiej zaplanować wykorzystanie zasobów potrzebnych do wytworzenia i udostępnienia danych. Przykład: ponowne wykorzystanie tekstów anotowanych manualnie przez zespół ekspertów. 2. BEZPIECZEŃSTWO DANYCH OSOBOWYCH i DANYCH WRAŻLIWYCH: Niektóre dane mogą być z różnych powodów chronione (materiał dowodowy, dane niejawne, bezpieczeństwo osób wywiadowanych); przed ich udostępnieniem musimy mieć pewność, że nie naruszymy niczyich praw. Przykład: opis procedur bezpieczeństwa oraz udzielania dostępu do danych w DMP pozwala na ich konsekwentne stosowanie przez członków zespołu badawczego lub – w przypadku badań międzynarodowych – przez krajowe zespoły badawcze, ponadto DMP umożliwia właściwą ocenę przez administrację instytucji. 3. BEZPIECZEŃSTWO DANYCH: Zapewnienie warunków, żeby nie zaginęły lub nie zostały uszkodzone czy zniszczone w wyniku rozmaitych wydarzeń losowych. Przykład: tworzenia kopii zapasowych wytwarzanych danych zapobiegnie ich utracie podczas katastrofy naturalnej, która może uszkodzić dyski służbowego komputera. 4. WIDOCZNOŚĆ: dane muszą być wyszukiwalne i deponowane zgodnie z praktykami stosowanymi w danej dziedzinie. Przemyślane udostępnienie danych zwiększa ich widoczność, co przekłada się na większy wpływ na naukę oraz otoczenie i większe szanse na cytowanie. Przykład: nagrania mowy niewielkiego dialektu przeprowadzone w celu stworzenia leksykonu słownictwa podstawowego może posłużyć ponownie do badań z zakresu fonetyki. Zdeponowanie zasobu w repozytorium wyspecjalizowanym w udostępnianiu nagrań ułatwi ponowne wykorzystanie danych. 5. WERYFIKOWALNOŚĆ: większa widoczność i dostępność znacznie ułatwiają proces weryfikowania wyników badań – zarówno danych jak i publikacji, co przekłada się na zwiększenie zaufania do nich. 6. TRANSARENTNOŚĆ I RZETELNOŚĆ GOSPODROWANIA ŚRODKAMI PUBLICZNYMI: beneficjentom finansowania publicznego powinno zależeć, by podatnik wiedział, w jaki sposób zostały zainwestowane środki publiczne; by istniała społeczna kontrola wydatków; by istniała obywatelska kontrola wydatków, która sprzyja wzmocnieniu zaufania społecznego do nauki. 7. NAUKA OBYWATELSKA – wsparcie: dokumenty UNESCO wskazują, że nauka obywatelska jest jednym z czterech obszarów stanowiących otwartą naukę56 – obywatele oraz organizacje spoza sektora nauki muszą mieć dostęp do danych wytworzonych przez instytucjonalną naukę, w ten sposób warunkując rozwój społeczny. 8. WYDAJNOŚĆ: kiedy już wiemy, czym dysponujemy, możemy racjonalnie planować działania i budżetować środki (istotne dla podatnika, kierownictwa jednostek oraz naukowców, którzy identyfikują dane istniejące i brakujące). 9. WYRÓWNYWANIE SZANS: zwiększenie widoczności i dostępności rzetelnych danych badawczych wyrównuje szanse rozwoju między dużymi i małymi ośrodkami akademickimi (i nie tylko akademickimi) oraz między naukowcami na różnych etapach rozwoju kariery. 10. WZGLĘDY FORMALNE: spełnienie wymogów instytucji finansujących badania. 56 UNESCO Recommendation on Open Science (2021): https://www.unesco.org/en/ open-science/about (dostęp: 09.06.2025 r.) Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 18 Podstawowe zasady tworzenia dokumentacji są podobne bez względu na dyscyplinę naukową, w której sytuują się badania, jednak istnieją szczególne uwarunkowania, które należy wziąć pod uwagę w przypadku językoznawstwa. Historyczny i analogowy charakter danych Pierwsza grupa uwarunkowań wynika z faktu, że językoznawstwo jest dyscypliną rozwijającą się już relatywnie długo, a duży udział w pracach językoznawczych stanowią te utrzymane w perspektywie diachronicznej. Wynika z tego szereg konsekwencji przy - toczonych poniżej: • w porównaniu z innymi dyscyplinami często mamy do czynienia z danymi historycznym; zazwyczaj analogowymi, które nie zostały w żaden sposób zdigitalizowane lub zostały zdigitalizowane bardzo pobieżnie (np. prosty skan lub fotografia bez elementów transkrypcji); • standardy danych istnieją dopiero od niedawna, biorąc pod uwagę wiek dyscypliny; środowiskowa świadomość okoliczności pracy z tymi standardami jest niewielka; • niezależnie od analogowego charakteru danych dodatkowym utrudnieniem jest ich funkcjonowanie w bardzo zróżnicowanych formatach (np. ręcznie zapisywane fiszki, nagrania mowy na taśmach magnetofonowych, słowniki historyczne, wywiady spisywane); • niska (w stosunku do nauk technicznych i przyrodniczych) świadomość cyklu życia oraz obiegu danych, metod ich pozyskiwania, standardów opisu i licencji; 5 Dokumentacja Sprawne zarządzanie danymi badawczymi wymaga przygotowania takiej dokumentacji, która umożliwia nam kontrolowanie źródeł pochodzenia naszych danych oraz ich jakości. • niska świadomość tego, że zasoby danych również podlegają cytowaniom i liczą się do dorobku badacza. Przez dziesiątki lat dane badawcze (szczególnie surowe) były traktowane przez językoznawców nieco po macoszemu. Nie istniały żadne uniwersalne standardy ich opisu i przechowywania. Nie oznacza to, że standardów takich nie było zupełnie – istniały, lecz obowiązywały zazwyczaj wyłącznie w danym ośrodku. Często w postaci dobrych praktyk przekazywanych między pokoleniami kolejnych pracowników. Oznacza to, że chęć ponownego wykorzystania danych zgromadzonych w poprzednich dekadach (lub stuleciach!) może wiązać się z koniecznością kreatywnego dostosowania dawnych praktyk do dzisiejszych standardów. Warto w takiej sytuacji przywołać współczesne zasady zarządzania danymi, by ustalić obustronnie warunki korzystania z zasobów, które z dzisiejszej perspektywy są niestandardowe lub zostały niestandardowo przetworzone i opisane. Punktem odniesienia w ustalaniu takich warunków mogą być wytyczne tworzenia DMP lub standard opisu metadanych w repozytorium, w którym znajdują się zbiory danych o zbliżonym charakterze. Umożliwi nam to ustalenie tych cech danych, które będą nam potrzebne do dalszej pracy i ich prawidłowego opisu. Językoznawstwo jako dyscyplina humanistyczna Standardy dokumentacji i kontroli jakości ewoluowały przez wiele dekad jako efekt oddolnych działań naukowców, dostrzegających korzyści płynące z praktyk dziś uznawanych za realizację zasad FAIR. Praktyki te w znacznej mierze dotyczyły jednak środowisk badaczy posługujących się metodami odbiegającymi od tych powszechnie stosowanych w językoznawstwie. Duży wpływ na formowanie się powszechnie przyjmowanych standardów mieli przedstawiciele nauk ścisłych, technicznych i przyrodniczych posługujący się przede wszystkim metodami ilościowymi. Metody te są oczywiście również obecne w naukach humanistycznych, jednak rola metod jakościowych jest przynajmniej tak samo istotna – o ile nie ważniejsza, zwłaszcza w przypadku językoznawstwa (z wyjątkiem językoznawstwa kwantytatywnego). Z humanistycznej natury naszej dyscypliny może wynikać szereg konsekwencji istotnych z perspektywy zarządzania danymi: • duży nacisk na indywidualny kontakt badacza z materiałem (brak intersubiektywizmu badawczego) skutkuje brakiem mierników odnoszących do obiektywności danych; • dominacja badań jakościowych, prowadzonych na niewielkich próbkach danych sprawia, że wiele zasobów jest relatywnie niewielkich i niezrównoważonych z perspektywy reprezentatywności; • tradycja prowadzenia badań w terenie dokumentowanych często w postaci raportów i notatek, które są nieustandaryzowane z perspektywy opisu metadanymi lub możliwości maszynowego przetwarzania; • brak wypracowanych metod eliminowania błędów w interpretacji danych, które wynikają z daleko posuniętego indywidualizmu badawczego. Powyższe uwarunkowania wpływają na sposób postrzegania jakości danych i metadanych będących przedmiotem opisu planu Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 19 zarządzania danymi – w przypadku wytycznych NCN jest to pozycja druga: Dokumentacja i jakość danych. Szczegółowe omówienie tej kwestii można znaleźć w rozdziale siódmym Przewodnika. Dobre praktyki Niezależnie od specyfiki wiążącej się z dyscypliną językoznawstwa, warto wspomnieć o kilku praktykach znajdujących swoje zastosowanie w niemal wszystkich projektach badawczych: a) Dokumentowanie pochodzenia danych od momentu ich pozyskania lub wytworzenia Dokumentację na wstępnych etapach przygotowania danych można prowadzić w formie podobnej do dzienników laboratoryjnych. Warto już na samym początku zidentyfikować metadane potrzebne do należytego opisu, przygotować treść ewentualnych zgód lub określić inne okoliczności wymagające odnotowania, na których podstawie powstanie lista kontrolna (checklista). Lista ta ułatwi opracowanie metadanych i pomoże w utrzymaniu ich należytej jakości. W przygotowaniu listy należy uwzględnić podział na dane pierwotne oraz wtórne (używane ponownie). b) Sposób organizacji plików i zarządzanie ich różnymi wersjami Podczas wytwarzania danych badawczych należy przyjąć ustalenia, które pomogą nam w spójnym zarządzaniu plikami, posługiwaniu się ich nazewnictwem, grupowaniem w folderach, wersjonowaniem oraz udostępnianiem członkom zespołu. W tym celu warto skorzystać z porad przygotowanych przez Cambridge University 57 : • używaj folderów – należy korzystać z folderów w taki sposób, aby informacje na określony temat znajdowały się w jednym miejscu; • dostosuj się do istniejących procedur – sprawdź czy Twój zespół lub instytucja posiadają już sprawdzone procedury dotyczące organizacji plików i ich nazewnictwa lub wersjonowania, spróbuj wykorzystać je w pierwszej kolejności; • nazywaj foldery spójnie i konsekwentnie – nazywaj foldery według obszarów tematycznych, do których się odnoszą. Pozwala to uniknąć zamieszania we współdzielonych prze - 57 https://www.data.cam.ac.uk/data-management-guide/organising-your-data (dostęp: 09.06.2025 r.) strzeniach roboczych i ułatwia nawigację w systemie plików nowym osobom dołączającym do przestrzeni roboczej. Nie nazywajmy folderów według personaliów osób należących do zespołu – wprowadzi to sporo zamieszania w razie zmiany składu personalnego oraz utrudni orientowanie się w przestrzeni osobom z zewnątrz; • bądź konsekwentny – podczas opracowywania schematu nazewnictwa folderów ważne jest, aby po podjęciu decyzji o metodzie i trzymać się jej konsekwentnie. Jeśli możesz, spróbuj ustalić schemat nazewnictwa plików i folderów na samym początku realizacji projektu; • foldery zorganizuj hierarchicznie – zacznij od ograniczonej liczby folderów dla szerszych tematów, a następnie utwórz bardziej szczegółowe podfoldery w ramach tych folderów; • rozróżnij prace trwające i zakończone – gdy zaczniesz tworzyć wiele folderów i plików, warto zacząć myśleć o oddzieleniu starszych dokumentów od tych, nad którymi aktualnie pracujesz; • załóż folder „Moje dokumenty” – będzie on zarezerwowany dla plików, nad którymi aktywnie pracujesz. Co jakiś czas przenoś pliki, nad którymi już nie pracujesz, do innego folderu lub lokalizacji (np. folder na pulpicie komputera, na zewnętrznym dysku twardym lub w chmurze); • kopie zapasowe – upewnij się, że Twoje pliki – bez względu na ich lokalizację – mają regularnie tworzone kopie zapasowe; • segregowanie danych – regularnie przeglądaj swoje dane w celu oceny ich przydatności i wartości; nie przechowuj niepotrzebnych danych. c) Konwencje nazewnicze i wersjonowanie Konwencje nazewnicze służą zapewnieniu spójności nazwom plików i folderów. Dzięki nim nazwy plików będą czytelne zarówno dla wykonawców projektu, jak też dla nowych pracowników, osób spoza zespołu oraz przyszłych użytkowników. Konwencja nazewnictwa powinna uwzględniać następujące kategorie informacji: • słownik typu danych stosowanych w ramach nazw plików tak, by wszyscy używali ich w tym samym znaczeniu (np. GDL – guidelines, WYT – wytyczne, TEZ – tezaurus, STL – stop-lista); • interpunkcja – określone symbole (takie jak np. podkreślnik “_”) czy wielkie litery powinny być stosowane w konsekwentny sposób; • format daty – np. YYYYMMDD; • kolejność plików – pliki dotyczące tego samego tematu powinny pojawiać się obok siebie; • liczba zer wiodących (01, 001, 0001 etc.), jeśli w nazwach plików pojawiają się liczby. W naszym projekcie możemy zastosować również konwencję już istniejącą – na przykład obowiązującą w jednostce naukowej, opracowaną przez wydziałowego data stewarda lub wykorzystywaną na innych uczelniach. Przykład gotowej konwencji przyjętej w Queensland University of Technology: TILS Document Naming Convention58. Dzięki konsekwentnemu stosowaniu konwencji nazewniczej możemy zawrzeć wiele informacji o dokumencie już w samej jego nazwie. Pliki lub zbiory plików mogą jednak zawierać dane podlegające różnorodnym zmianom. Przykładowo: plik zawierający prosty tekst transkrypcji nagrania (ang. plain text) może zostać wzbogacony o strukturę xml zawierającą podział na kwestie wypowiadane przez osobę prowadzącą wywiad oraz właściwego mówcę. Dla lepszej orientacji warto rozróżnić obie wersje poprzez wprowadzenie odpowiedniej numeracji wersji – czyli wersjonowanie. Dodatkowo dokument zawierający dane powinniśmy wzbogacić o tabelę informującą o wprowadzonych zmianach między poszczególnymi wersjami, dacie wprowadzenia zmian, personaliach badacza odpowiedzialnego za nie itp. Tabela ta może wyglądać następująco: DATA NUMER WERSJI OPIS ZMIAN AUTOR ZMIAN 01.07.2024 r. 01 Plik pierwotny zawiera prostą transkrypcję nagrania (plain text) Jerzy Skryba 16.09.2024 r. 02 Tekst został wzbogacony o strukturę xml rozróżniającą mówcę od agenta prowadzącego wywiad Anna Znacznik Tab. 3. Przykładowa tabela z informacjami o wersjonowaniu dokumentu. 58 https://www.library.qut.edu.au/about/management/documents/QUTTILSDocNamingConvention.pdf (dostęp: 09.06.2025 r.) Plik readme Dobrą praktyką jest dołączanie do zestawu danych udostępnianych na zewnątrz pliku o nazwie readme. Jest to plik, który powinien być przeczytany przez każdą osobę, która skorzysta z naszych danych. Powinnien być swoistym przewodnikiem zapewniającym orientację w tym, czym nasze dane są, jakie konwencje zostały przyjęte, kto je wytworzył, czy są to dane pierwotne czy też wtórne, jakich zmian dokonywano w poszczególnych wersjach, w ramach jakiego projektu powstawały. Zazwyczaj plik readme zawiera najważniejsze metadane oraz dodatkowe informacje, które umożliwią przyszłemu użytkownikowi właściwe odczytanie i zrozumienie udostępnianego zasobu. Nic nie stoi na przeszkodzie, by w pliku readme zawrzeć pozdrowienia dla naszych przyszłych użytkowników. Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 20 Jak planować udostępnianie danych, uwzględniając zasady FAIR Naukowcom realizującym projekty finansowane ze źródeł publicznych zaleca się otwarte publikowanie danych badawczych zgodnie z paradygmatem FAIR (np. wytyczne UNESCO). Wstępnych decyzji dotyczących tego, w jaki sposób, gdzie, w jakim zakresie i na jakich zasadach dane zostaną udostępnione należy dokonać już na etapie planowania (więcej na ten temat: podrozdział Cykl życia danych badawczych). To właśnie wtedy powinniśmy sporządzić (lub zweryfikować) plan zarządzania danymi utworzony według schematu uwzględniającego wdrażanie paradygmatu FAIR (np. wytyczne NCN59). Temat ten został omówiony w podrozdziale Implementacja FAIR w praktyce językoznawcy oraz następujących dalej sekcjach niniejszego Przewodnika. W tym miejscu zwróćmy uwagę na absolutnie kluczowe aspekty, które warto przemyśleć jeszcze przed etapem sporządzania DMP: • widoczność danych: odpowiednią widoczność materiału zapewni zdeponowanie go w indeksowanym repozytorium; dodatkowo możemy przygotować tzw. data paper – artykuł naukowy (publikację) zawierający opis procesu powstawania, charakterystyki oraz sposobu wykorzystania zasobu; • zakres udostępnianych danych: należy przemyśleć sposób selekcji udostępnianego materiału oraz tryb jego publikowania: pełny (publikujemy w repozytorium metadane wraz z danymi) 59 https://www.ncn.gov.pl/sites/default/files/pliki/regulaminy/wytyczne_zarzadzanie_danymi.pdf (dostęp: 09.06.2025 r.) lub ograniczony (do repozytorium trafiają wyłącznie metadane z informacją o tym, kto dysponuje danymi i jakie warunki należy spełnić, by uzyskać do nich dostęp). Otwieranie danych może dotyczyć wszystkich wytworzonych danych lub wyłącznie tych powiązanych z publikacją – zależy to od polityki i wytycznych instytucji finansującej badania lub od woli naukowca; • czas: czy dane będą udostępnione po zakończeniu projektu? w jego trakcie? na jak długo? • ograniczenia: należy przeanalizować warunki wynikające z prawa autorskiego i praw pokrewnych, ochronę danych osobowych, umowy ze stronami trzecimi, dobro i bezpieczeństwo publiczne, potencjał komercjalizacji oraz wrażliwość danych; • powiązanie z publikacją wyników: niektóre wydawnictwa, konferencje lub organizacje finansujące badania wymagają opublikowania pełnych danych powiązanych z artykułem/książką/ referatem – w takiej sytuacji należy przemyśleć precyzyjnie moment, zakres, wersję oraz miejsce udostępnienia danych na potrzeby publikacji; • zgoda uczestników badań: należy uzyskać taką zgodę (o ile dotyczy), w zgodzie powinna być informacja o udostępnianu danych, w tym na jakiej licencji chcemy je udostępnić. Repozytoria: jak zapewnić długoterminową dostępność i integralność danych Przechowywanie danych w trakcie realizacji projektu wymaga takich warunków, które uwzględniają nie tylko bezpieczeństwo czy prawną charakterystykę danych, lecz również szereg praktycznych 6 Udostępnianie i długotrwałe przechowywanie danych Już na wczesnym etapie realizacji projektu naukowego warto podjąć decyzje dotyczące publikowania i archiwizacji danych badawczych. Odpowiednio przygotowane plany zarządzania danymi oraz wybór właściwego repozytorium gwarantują ich bezpieczeństwo, uporządkowanie i łatwą dostępność dla przyszłych użytkowników. Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 21 aspektów: np. dostęp członków zespołu badawczego oraz partnerów projektu, możliwość korzystania z narzędzi analitycznych, zgodność formatów z akceptowanymi przez narzędzia cyfrowe, selekcję na potrzeby publikacji naukowej itd. W praktyce oznacza to, że w trakcie realizacji projektu dane nie są udostępniane (lub udostępniana jest tylko część z nich). Należy jednak pamiętać, że w przypadku rozliczania projektu wymagającego uprzedniego opublikowania danych, należy je zdeponować w repozytorium cyfrowym spełniającym wymogi FAIR. W tym miejscu przyjrzyjmy się temu, czym repozytoria są i jak wybrać odpowiednie dla naszych danych. Czym jest repozytorium cyfrowe Repozytorium to rodzaj tradycyjnej biblioteki cyfrowej, w której przechowywane są uporządkowane dokumenty przeznaczone do udostępniania. Specyfiką repozytorium jest rodzaj dokumentów, jakie są w nim przechowywane. (...) Celem repozytorium jest ochrona i zachowanie tych zasobów. (Encyklopedia zarządzania60) W przypadku danych badawczych powyższa definicja wymaga uzupełnienia – zadaniem repozytorium jest nie tylko ochrona i zachowanie zasobów, lecz również zapewnienie im efektywnej widoczności w cyberprzestrzeni wykorzystywanej przez naukowców. Dzięki tej widoczności możliwe jest sprawdzenie, jakie zasoby już istnieją, ocena ich zawartości oraz warunków korzystania z nich. Rodzaje repozytoriów danych badawczych można wyróżnić, stosując dwa podstawowe kryteria61: a. Ze względu na charakter przechowywanych danych: • ogólne/wielotematyczne (interdyscyplinarne): dokumenty z różnych dziedzin, wielokrotne dokumentowanie przyrostu wiedzy w jakiejś kategorii; np. Zenodo, Most Wiedzy, RODBUK, RepOD; 60 https://mfiles.pl/pl/index.php/Repozytorium (dostęp: 09.06.2025 r.) 61 Tu prezentujemy uproszczoną typologię proponowaną w Encyklopedii Zarządzania, jednak inne źródła posługują się bardziej złożonymi klasyfikacjami. Na przykład rejestr repozytoriów re3data proponuje kilkanaście różnych typologii, w tym podział ze względu na dostęp do danych (otwarte, ograniczone, objęte embargiem oraz zamknięte). • dziedzinowe (tematyczne): uporządkowana wiedza dziedzinowa, wielokrotne dokumentowanie przyrostu wiedzy w jakiejś dyscyplinie; np. socjologii, psychiatrii, językoznawstwie itp., np. DraCor, repozytoria CLARIN ERIC, Repozytorium Danych Społecznych (ICM UW/IFIS PAN); b. Ze względu na sposób organizacji: • otwarte: dostęp do metadanych jest nieograniczony i otwarty, dostęp do danych zależy od ich cech indywidualnych; • instytucjonalne: limitowany dostęp nie tylko do danych, ale również do metadanych; służy celom wewnętrznym określonych instytucji, społeczności lub firmy; Jak już wspomniano wcześniej – zarządzanie danymi zgodnie ze standardami FAIR nie jest oceniane zero-jedynkowo. Zgodność ta może być mniejsza lub większa i ma charakter pewnego spektrum. Dla podniesienia współczynnika „bycia FAIR” niewątpliwie fundamentalną kwestią jest wybór odpowiedniego repozytorium. Zaleca się deponowanie danych w repozytoriach dziedzinowych i otwartych, dzięki czemu dane będą łatwiejsze do odnalezienia przez osoby zainteresowane określonym typem informacji oraz do zagregowania w systemach wyższego rzędu. Repozytorium: jak wybrać? Proces wyboru repozytorium jest ściśle uzależniony od charakte - ru danych oraz ich tematyki (dyscypliny naukowej) i wytycznych organizacji finansującej. W przypadku danych tekstowych wy - twarzanych przez językoznawców, proces wyboru może przybrać różną postać. Zaprezentujemy tutaj kilka z nich: a. Podążanie za przykładem Warto sprawdzić gdzie zestawy danych podobne do naszych są najczęściej deponowane. Jeżeli realizowany przez nas projekt zakłada wytworzenie danych pochodnych przy ponownym użyciu danych opublikowanych jako efekt innego projektu (ponowne użycie danych), warto rozważyć jako miejsce deponowania to samo repozytorium, z którego pobraliśmy pliki do ponownego użycia. Dotyczy to szczególnie repozytoriów, które mają wyraźnie określoną specjalizację, np. ORTOLANG dla danych dotyczących języka mówionego czy DraCor dla tekstów realizujących gatunek literacki dramatu. Zachowajmy jednak ostrożność – podążajmy za przykładami, które są warte naśladowania. W tym przypadku oznacza to sprawdzenie podstawowych cech repozytorium, na przykład czy spełnia ono zasady FAIR. b. Kwerenda w agregatorach metadanych Jeżeli nie korzystamy z danych pozyskanych z zewnątrz, warto poszukać podobnych zestawów danych za pomocą agregatorów metadanych takich jak SSHOC Marketplace, CLARIN VLO lub Europeana. Jeżeli odkryjemy, że jakieś repozytorium jest szczególnie często wybierane przez wytwórców danych podobnych do naszych, warto rozważyć skorzystanie z niego. Pamiętajmy jednak o ostrożności wspomnianej w poprzednim podpunkcie. c. Katalogi repozytoriów CLARIN ERIC Oferta infrastruktury CLARIN ERIC powstała z myślą o wszystkich naukowcach, którzy w badaniach wykorzystują materiał będący wytworem komunikacji człowieka w językach natural - nych – przy uwzględnieniu różnych modalności, sposobów utrwalenia, gatunków, czasów powstania oraz dyscyplin naukowych, których rozwojowi dane mają się przysłużyć. Kręgosłupem infrastruktury jest sieć węzłów – repozytoriów wyspecjalizowanych w różnych rodzajach danych. Wiele z tych węzłów oferuje również dostęp do zintegrowanych narzędzi analitycznych. Przykładowo – węzeł CLARIN-PL62 dysponuje repozytorium utworzonym w technologii DSpace oraz zapleczem kilkudziesięciu narzędzi, wśród których znajdziemy m.in. analizatory morfologiczne, aplikacje do badania stylometrii a także służące modelowaniu tematycznemu. Repozytorium jest wyspecjalizowane w gromadzeniu danych utworzonych w języku polskim oraz w innych językach słowiańskich lub opisujących te języki. Innym przykładowym węzłem CLARIN ERIC jest repozytorium Max Planck Institute for Psychonliguistics63 wyspecjalizowane nie tylko w przechowywaniu i udostępnia62 https://clarin-pl.eu/ (dostęp: 09.06.2025 r.) 63 https://archive.mpi.nl/tla/islandora/ (dostęp: 09.06.2025 r.) Najważniejsze funkcje repozytorium to ochrona i zachowanie danych oraz zapewnienie im efektywnej widoczności w cyberprzestrzeni. Repozytoria umożliwiają użytkownikom odnalezienie zasobów, ocenę ich zawartości i warunków korzystania z nich. Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 22 niu danych dotyczących psycholingwistyki, lecz utrzymujące też dane powiązane z językami zagrożonymi wymarciem. Pełen katalog węzłów CLARIN ERIC znajdziemy na oficjalnej stronie konsorcjum64. Dodatkowo możemy również skorzystać z centrów wiedzy CLARIN (CLARIN K-Centres) – jednostek oferujących eksperckie porady dotyczące wybranych aspektów przetwarzania danych językowych, zarządzania nimi i ich wytwarzania. Pełną ofertę trzydziestu dwóch centrów wraz z wygodną przeglądarką znajdziemy w katalogu CLARIN K-Centre65. Warto podkreślić, że europejscy naukowcy mogą korzystać z repozytoriów, zasobów, narzędzi oraz wiedzy eksperckiej oferowanej przez centra CLARIN ERIC całkowicie bezpłatnie. Infrastruktura jest finansowana w całości z publicznych środków pozyskiwanych z funduszy rządowych krajów będących członkami konsorcjum. d. Samodzielne przeszukiwania katalogu re3data W portalu re3data 66 możemy dokonywać samodzielnych wyszukiwań repozytoriów, kierując się wieloma kryteriami, w tym na przykład kryterium dyscypliny, kraju, schematu metadanych, licencji. Szczególnie przydatne może okazać się wyszukiwanie według dyscypliny naukowej uwzględniające nauki humanistyczne wraz z językoznawstwem. Re3data zawiera informacje na temat repozytoriów danych badawczych, znajdziemy w nim również inne źródła danych – na przykład biblioteki lub projekty. W tej sytuacji należy pamiętać o tym, że nie każde z nich będzie tak samo dobrze spełniać wymagania stawiane wobec miejsc długotrwałego przechowywania danych przez instytucje finansujące. Podczas procesu wyboru i oceny repozytoriów zwracajmy szczególną uwagę na następujące cechy: 64 https://www.clarin.eu/content/certified-b-centres (dostęp: 09.06.2025 r.) 65 https://www.clarin.eu/k-centre-catalogue (dostęp: 09.06.2025) 66 https://www.re3data.org/ (dostęp: 09.06.2025) • opis zasobu metadanymi i udostępnianie metadanych agregatorom (np. SSHOC, VLO, OpenAire); • nadawanie zasobom stałych identyfikatorów (PID, np. Handle lub DOI); • posiadanie certyfikatów poświadczające bezpieczeństwo i techniczną sprawność repozytoriów (np. CoreTrustSeal); • stosowanie standardu FAIR; • prowadzenie helpdesku – kanału komunikacji z użytkownikami repozytorium mającego na celu ich bieżące wsparcie. Ograniczenia w udostępnianiu danych badawczych Ograniczenia dotyczące udostępniania danych badawczych mogą wynikać z kilku przyczyn: technicznych, finansowych, prawnych. W praktyce udostępnianie większości danych badawczych wytwarzanych w projektach językoznawczych nie będzie ograniczane technicznie i finansowo. Dane te są relatywnie niewielkie (rzadko rozmiar zasobów przekracza kilkadziesiąt MB), a koszt ich cyfro - wego utrzymania jest nieporównywalnie niższy niż w przypadku danych gromadzonych w dyscyplinach technicznych czy nauk o życiu. Dodatkowo – w europejskiej cyberprzestrzeni funkcjonuje szereg infrastruktur wspierających otwarte deponowanie danych całkowicie bezpłatnie (np. DARIAH, OPERAS, CLARIN, RODBUK, Most Wiedzy, RepOD). Istotne ograniczenia mogą wyniknąć z prawnej charakterystyki wykorzystywanych przez nas danych. Przykładowo mogą to być następujące okoliczności: • ograniczenia licencyjne obowiązujące dane wytworzone przez kogoś innego i przeznaczone do ponownego użycia (ale już nie zezwalające na ponowną publikację czy modyfikację); • ograniczenia wynikające z ochrony danych osobowych (szczególnie gdy nie można przeprowadzić procesu pseudonimizacji lub anonimizacji); • ograniczenia wynikające z praw osób trzecich (np. gdy dostęp do danych został zakupiony lub dane zawierają materiał chroniony autorskim prawem majątkowym); • ograniczenia wynikające ze szczególnego charakteru danych (np. gdy mają status niejawnych lub są materiałem dowodowym w procesie sądowym); • ograniczenia wynikające z potencjału danych do komercjali - zacji – potencjał powinien zostać oceniony przez jednostkę badawczą a w razie zaistnienia określonych przesłanek, mogą zostać objęte czasowym embargiem (np. uczelnia zastrzega sobie wyłączność do korzystania z danych przez 5 lat, po których będą mogły być udostępnione w sposób otwarty); • ograniczenia wynikające z zaleceń komisji etyki badań na uczelni. W przypadku zaistnienia którejkolwiek z powyższych przesłanek, należy wypracować taki sposób udostępniania, by spełniona została zasada: As open as possible, as closed as necessary67 - otwarte tak bardzo, jak to możliwe, zamknięte na ile to konieczne. Oznacza to, że powinniśmy optymalizować stopień otwartości, ale nie za wszelką cenę – w przypadku wystąpienia określonych okoliczności należy szukać rozwiązań pośrednich. Na przykład publikować otwarcie wyłącznie metadane, dane pozostawiając do dyspozycji jednostki macierzystej wytwórcy. 67 https://rea.ec.europa.eu/open-science_en (dostęp: 09.06.2025) Udostępnianie danych w językoznawstwie rzadko napotyka ograniczenia techniczne czy finansowe, dzięki stosunkowo niewielkim rozmiarom danych oraz dostępności bezpłatnych europejskich infrastruktur do ich przechowywania. Największe bariery dotyczą aspektów prawnych, takich jak licencje, ochrona danych osobowych, prawa osób trzecich czy wytyczne komisji etyki. Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 23 7 Plan zarządzania danymi badawczymi Czym jest plan zarządzania danymi badawczymi Wspomniane w poprzednich częściach Przewodnika korzyści płynące z zarządzania danymi mają charakter ogólny – wynikają z oczekiwanych konsekwencji procesu świadomego zarządzania. Praktyki oraz zasady zarządzania danymi są w różnym stopniu usystematyzowane, jednak decyzje dotyczące zarządzania danymi powinny być spisane w formie dokumentu – planu zarządzania danymi (ang. Data Management Plan – DMP). Schematów DMP istnieje wiele – ich forma zależy zazwyczaj od instytucji finansującej badania, jednostki naukowej realizującej projekt lub nawet konkretnego zespołu badawczego, który wypracował już własne metody zarządzania. Przykładowe wytyczne określające, jakie informacje powinien zawierać plan można pobrać ze strony Science Europe 68 . Wytyczne te stanowią punkt wyjściowy do przygotowania schematów obowiązujących w wielu europejskich jednostkach naukowych czy instytucjach finansujących badania (m.in. NCN). Nim przejdziemy do bliższego omówienia przykładowych wytycznych, odpowiedzmy sobie na kilka pytań ogólnych. Na którym etapie badań należy tworzyć DMP? DMP powinno powstawać już na etapie przygotowania koncepcji badań. Posługując się terminologią dotyczącą cyklu życia 68 https://www.scienceeurope.org/our-priorities/open-science/research-data-management/ (dostęp: 09.06.2025 r.) danych badawczych, powinniśmy mówić o etapie planowania. Z perspektywy instytucji finansującej badania, DMP ma bardzo istotne znaczenie, ponieważ stanowi gwarancję, że wnioskujący badacz dokładnie przeanalizował kwestie pozyskiwania, przechowywania oraz udostępniania danych, z uwzględnieniem obowiązujących zaleceń. Czy mogę modyfikować DMP w trakcie realizacji projektu? Zdecydowanie tak. DMP powinien być „żywym” dokumentem – dostosowywanym w miarę rozwoju projektu. Istnieje duże prawdopodobieństwo, że trakcie realizacji zadań pojawi się konieczność podejmowania decyzji, które nie zostały przewidziane w fazie projektowania. Co więcej, nawet zaplanowane wcześniej działania mogą prowadzić do nieoczekiwanych skutków wpływających na sposób realizacji projektu, w tym zarządzanie danymi. Przykładowo, badacz analizujący pragmalingwistyczne czynniki mające wpływ na kształtowanie rozmów między psychologiem terapeutą a pacjentem zakładał na etapie planowania możliwość wykorzystania danych badawczych (transkrypcji rozmów) zgromadzonych w innym projekcie, realizowanym w ramach dyscypliny psychologii. Niestety, z powodu zastrzeżeń natury etycznej, zbiór danych został w międzyczasie wycofany z repozytorium. Na szczęście badaczowi – lingwiście udało się znaleźć inny zbiór danych, który zaspokaja jego potrzeby naukowe. Informacje dotyczącą zmiany wyboru wykorzystywanego zestawu danych powinny zostać ujęte w DMP. Każda zmiana w DMP powoduje utworzenie nowej wersji dokumentu, która oznaczana jest zgodnie z przyjętym systemem wersjonowania (np. 1.0, 1.1, 2.0). Wersja główna (zmiana pierwszej liczby) wskazuje na istotną modyfikację treści, natomiast wersja pomocnicza (zmiana drugiej liczby) odnosi się do drobnych korekt lub uzupełnień. Wszystkie wersje powinny być archiwizowane i dostępne do wglądu. Czy DMP podlega ocenie? W przypadku projektów finansowanych przez NCN plan zarządzania danymi podlega ocenie formalnej (dokonywanej przez pracowników NCN) oraz merytorycznej (dokonywanej przez ekspertów dziedzinowych) na etapie wnioskowania o finansowanie. Realizacja DMP podlega ocenie formalnej i merytorycznej w ramach raportu końcowego. W innych organizacjach finansujących mogą obowiązywać odmienne zasady, jednak potrzeba wdrażania procedur zarządzania danymi udokumentowana za pomocą DMP jest często spotykana i formułowana przynajmniej jako zalecenie. Jakie są korzyści z DMP z perspektywy naukowca realizującego projekt? Konieczność przygotowania DMP bywa postrzegana przez naukowców ubiegających się o finansowanie jako dodatkowa formalność obciążająca i tak mocno napięty grafik przyszłego kierownika projektu lub zespołu aplikującego. Pamiętajmy jednak, że współcześnie prowadzenie badań naukowych odbywa się w warunkach kształtowanych przez różnorodne ramy prawne (np. RODO), czynniki technologiczne, standardy wynikające z dbałości o etykę badań i efektywne wykorzystanie środków publicznych, a także konieczność sprostania oczekiwaniom społecznym. Obowiązkiem naukowca jest wzięcie pod uwagę tych złożonych uwarunkowań. Plan zarządzania danymi jest narzędziem, które Plan zarządzania danymi badawczymi (ang. Data Management Plan, DMP) to dokument, w którym naukowcy określają zasady pozyskiwania, przechowywania i udostępniania danych w ramach projektu badawczego. Tworzy się go już na etapie planowania badań, a następnie aktualizuje w trakcie ich trwania tak, by uwzględniał postęp i wyniki projektu. Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 24 skutecznie może pomóc w zorientowaniu się w tych wymaganiach i w ich realizacji. Brak znajomości kontekstu prawno – instytucjonalnego nie wynika ze złej woli naukowca, lecz często z braku świadomości – a to właśnie rodzi największe ryzyko. DMP pomaga więc unikać potencjalnych ryzyk związanych z gromadzeniem, przechowywaniem i udostępnianiem danych, wynikających z nieznajomości złożonych regulacji prawnych i instytucjonalnych69. Omówienie schematu DMP W Przewodniku wykorzystamy przykład schematu wdrożonego przez NCN. Wytyczne NCN zostały przygotowane na podstawie Wytycznych Science Europe 70 . Należy pamiętać, że wzory DMP i zasady ich wdrażania obowiązujące w innych instytucjach mogą się różnić. Nasz przykładowy schemat zawiera sześć głównych kategorii opisów, w każdej kategorii znajdziemy dwie subkategorie. Do każdego punktu przygotowano szereg pytań pomocniczych, których zadaniem jest ukierunkowanie osoby przygotowującej DMP. 1. Opis danych oraz pozyskiwanie lub ponowne wykorzystanie dostępnych danych 1.1 W jaki sposób będą pozyskiwane lub wytwarzane nowe dane lub ponownie wykorzystywane dane już istniejące? Warto rozważyć następujące kwestie: • Jakie standardy, metody i oprogramowanie posłużą do pozyskiwania lub wytwarzania nowych danych? • Jakie dane już istniejące (własne lub będące w posiadaniu strony trzeciej) zostaną ponownie wykorzystane? • W jaki sposób zostanie udokumentowane pochodzenie danych? 69 Korzyści płynące z przygotowania DMP z perspektywy badacza wyczerpująco omówiono na stronie internetowej konsorcjum CESSDA (Consortium of European Social Science Data Archives): Benefits of Data Management. Zasadniczo pokrywają się one z korzyściami wymienionymi w Przewodniku w części Korzyści płynące z wdrożenia zarządzania danymi w językoznawstwie. 70 https://scienceeurope.org/our-priorities/open-science/research-data-management/ (dostęp: 09.06.2025 r.) • Jak wyglądać będzie organizacja plików i zarządzanie ich różnymi wersjami? Komentarz: W tym punkcie należy opisać charakter danych oraz ich parametry, które mogą być użyteczne w całym procesie zarządzania danymi. Najważniejsze jest określenie, jakiego typu danych potrzebujemy w naszym projekcie oraz skąd mamy zamiar je pozyskać. Przykład: „W projekcie będą wykorzystywane dane tekstowe zawierające transkrypcje rozmów między użytkownikami języka kaszubskiego a agentem przeprowadzającym wywiad. Każdy wywiad będzie składał się z 10 wcześniej przygotowanych pytań wraz z odpowiedziami. Na pierwszym etapie zbierania danych zostaną wykonane nagrania, które zostaną następnie transkrybowane zgodnie z wybraną metodologią. Przewidujemy pozyskanie ok. 50 nagrań (i transkrypcji), z których każde będzie trwało ok. 1 godzinę. Pliki dźwiękowe będą zapisywane w formacie mp3, transkrypcje zostaną zapisane w formacie txt (plain text) oraz TEI (z podziałem na agenta oraz rozmówcę). W celu uzyskania jak najwyższej jakości danych zostaną podjęte następujące kroki: a) zespół będzie posługiwał się sprzętem nagrywającym przetestowanym we wcześniejszych podobnych projektach; b) nagrania będą przesłuchiwane i transkrybowane przez osobę niezależną od agenta sporządzającego wywiad najpóźniej w ciągu tygodnia od powstania nagrania; c) przed etapem właściwego zbierania materiału agenci przejdą specjalne szkolenie zaznajamiające ich z metodami prowadzenia wywiadów, obsługą sprzętu nagrywającego oraz przechowywaniem danych; d) każdy z agentów przeprowadzi przynajmniej jeden wywiad testowy w celu nabrania odpowiedniego doświadczenia; e) transkrypcja będzie przeprowadzona przez doświadczony zespół wykwalifikowanych anotatorów. W projekcie nie przewidujemy ponownego użycia danych badawczych powstałych w innych projektach. Pliki będą tworzyły zestawy złożone z trzech elementów: nagrania (mp3), prostego tekstu (txt), tekstu ustrukturyzowanego (TEI, xml). Każdy zestaw będzie zawarty w osobnym podfolderze o numerze zgodnym z datą przeprowadzenia wywiadu, w folderze zawierającym podfoldery znajdzie się kompletna lista wszystkich materiałów (txt), baza danych z metadanymi każdego pojedynczego pliku z danymi (csv) oraz plik readme (txt) z informacją o strukturze plików.” 1.2 Jakie dane (tj. rodzaje, formaty, objętości) będą pozyskiwane lub wytwarzane w projekcie? Warto rozważyć następujące kwestie: • Jaki rodzaj, format i objętość danych planują Państwo pozyskać, wytworzyć lub ponownie wykorzystać? Komentarz: należy uszczegółowić ilościowy i jakościowy aspekt informacji podanych we wcześniejszym podpunkcie. Doprecyzowanie tych informacji ma na celu zwrócenie uwagi na wolumen danych oraz format, w którym dane te będą zapisywane, a później przechowywane. Informacje te wpływają na oszacowanie kosztów przechowywania i udostępniania danych oraz wybór repozytorium. Przykład: W projekcie powstanie ok. 50 godzin nagrań rozmów w formacie mp3 (objętość ok. 100 MB) oraz ok. 50 plików z transkrypcjami w formacie txt (ok. 1 MB) i tyle samo siostrzanych plików TEI (ok. 5 MB). 2. Dokumentacja i jakość danych 2.1 Jakie metadane i dokumentacja (np. metodologia oraz sposoby pozyskiwania i organizacji danych) będą towarzyszyć danym w projekcie? Warto rozważyć następujące kwestie: • Jakie informacje należy uzupełnić, aby potencjalni użytkownicy (maszyny lub ludzie) byli w stanie w przyszłości odczytać i zinterpretować zebrane dane? • Czy możliwe jest ich maszynowe odczytanie? • W jaki sposób powstanie odpowiednia dokumentacja? • Jakie standardy środowiskowe (jeżeli w ogóle) posłużą do objaśnienia (meta)danych? • Jakie międzynarodowe standardy lub schematy (tj. Dublin Core, DDI) posłużą do organizacji metadanych? Komentarz: Bardzo ważnym elementem globalnego środowiska otwartych danych badawczych są maszynowe agregatory metadanych, które umożliwiają zbieranie informacji o zasobach zdeponowanych w poszczególnych repozytoriach, a następnie ich udostępnianie użytkownikom (np. CLARIN VLO, EOSC, SSHOC). Istnieją również przeglądarki korpusowe, które dają możliwość bezpośredniego dostępu do treści zasobów. Oznacza to, że na przykład za pośrednictwem jednej takiej przeglądarki możemy przejrzeć jednocześnie zawartość tysięcy korpusów (np. CLARIN Federated Content Search). Funkcje te są dostępne wyłącznie dla tych zasobów, których metadane oraz dane są odczytywalne maszynowo. W przypadku metadanych językoznawczych wypra - cowane zostały standardy, dzięki którym spełnienie wymagania maszynowej odczytywalności jest już właściwie oczywistością (niemal wszystkie repozytoria stosują wymóg ustrukturyzowanego opisu). Pamiętajmy, że w środowisku językoznawców wciąż bardzo popularna jest praca z danymi analogowymi, co wynika z pewnego dobrodziejstwa inwentarza. Dysponujemy ogromnymi kartotekami, zbiorami fiszek, wypisów, całych archiwów w postaci wydruków lub nawet manuskryptów. Jeśli zamierzamy korzystać z tego typu danych, należy uwzględnić tę informację w DMP i wziąć pod uwagę konieczność chociażby pobieżnej digitalizacji danych. W modelu idealnym digitalizacja polegałyby na sfotografowaniu/zeskanowaniu materiału źródłowego a następnie jego transkrypcji do edytowalnego formatu cyfrowego. Jeśli jednak realizacja naszego projektu nie wymaga dysponowania pełną transkrypcją, warto dokonać chociażby wspomnianej pobieżnej digitalizacji, która spełnia minimalne standardy 71 wymagane przez organizacje działające w paradygmacie otwartej nauki. Dane językowe, w postaci plików PDF, JPEG, PNG oraz innych formatach graficznych, nie będą możliwe do automatycznej eksploracji. Jednak ich udostępnienie w postaci odtwarzalnej za pomocą komputera przez człowieka wypełni kryterium dostępności w większym stopniu niż pierwotna forma papierowa źródła. 71 Zazwyczaj standardowe minimum oznacza, że zdigitalizowany materiał musi umożliwić weryfikację wniosków badawczych zaprezentowanych w powiązanej publikacji. Jeżeli udostępnione dane, w tym zdigitalizowane, nie będą wystarczająco dobrej jakości, może dojść do podważenia wniosków zawartych w samej publikacji. Przewodnik po zarządzaniu danymi badawczymi w językoznawstwie 25 Przykład: Zapisowi i nagraniu każdej rozmowy będzie towarzyszył opis metadanymi w standardzie CMDI oraz dodatkowymi metadanymi istotnymi z perspektywy późniejszej analizy (wiek osoby wywiadowanej, płeć, miejsce urodzenia, miejsce zamieszkania, narodowość, poziom znajomości języka polskiego). Na końcowym etapie projektu zasób zostanie zdeponowany w repozytorium CLARIN-PL, które wymaga opisu metadanymi całego zasobu w formacie CMDI (zapewniony zostanie opis na poziomie pojedynczych plików oraz na poziomie pełnego zasobu). Pliki tekstowe sporządzone w formacie txt oraz TEI są odczytywalne maszynowo. Są możliwe do wykorzystania w standardowych wyszukiwarkach korpusowych. Metadane w formacie CMDI są odczytywalne przez agregatory. Standard CMDI jest powszechnie używany w środowisku językoznawców i badaczy komunikacji, podlega stałej kuracji przez CLARIN ERIC. Załączone pliki readme powinny bez trudu dostarczyć wszelkich informacji potrzebnych do ponownego odczytania i zinterpretowania danych. 2.2 Jakie planują Państwo zastosować środki kontroli jakości? Warto rozważyć następujące kwestie: • W jaki sposób metody pozyskiwania, analizy i przetwarzania danych mogą wpływać na ich jakość? • W jaki sposób można wyeliminować błędy pomiarowe i problem stronniczości? • W jaki sposób zminimalizować ryzyko dotyczące poprawności danych? Komentarz: W tym podpunkcie powinniśmy skupić się na opisaniu metod zapewnienia naszym danym waloru obiektywizmu oraz rzetelności. W dziedzinie językoznawstwa rzadko wytwarzane są dane, które miałyby charakter wyłącznie ilościowy, dla których istnieje szereg miar, standardów pomiaru i procedur redukowania błędów. Należy zatem odnieść się do potencjalnych okoliczności, które mogą doprowadzić do subiektywizacji danych lub obniżenia ich rzetelności. W przypadku badań jakościowych, prowadzonych często w terenie – wśród użytkowników języków – lub na ekscerpcji fragmentów już istniejących tekstów, powinniśmy skupić się na: 1. kompetencjach badaczy zbierających dane (wypracowanie wytycznych, szkolenie i zadbanie o zdobycie odpowiedniego doświadczenia); 2. wewnętrznej kontroli jakości (zebrane dane powinny zostać sprawdzone pod względem zgodności z wytycznymi jeszcze przed etapem analizy i archiwizacji); 3. przygotowaniu wstępnej dokumentacji (opis dobrych praktyk, opis postępowania w sytuacjach niestandardowych, przygotowanie kwestionariuszy). Rzetelność i obiektywność danych jakościowych jest niemożliwa do oceny maszynowej a dokonanie właściwej oceny przez eksperta dziedzinowego wymaga złożonej i czasochłonnej analizy. Dlatego istotną odpowiedzialnością wytwórcy danych jest dołożenie wszelkich starań do spełnienia odpowiednich standardów. Te dane mogą być w przyszłości weryfikowane w procesie badawczym, którego charakter dziś trudno przewidzieć. Przykład: W podpunktach c – e umieszczonych w punkcie 1.1. niniejszego formularza omówiono procedurę przygotowania badaczy do zbierania materiału: „c) przed etapem właściwego zbierania materiału agenci przejdą specjalne szkolenie zaznajamiające ich z metodami prowadzenia wywiadów, obsługą sprzętu nagrywającego oraz przechowywaniem danych; d) każdy z agentów przeprowadzi przynajmniej jeden wywiad testowy w celu nabrania odpowiedniego doświadczenia; e) transkrypcja będzie przeprowadzona przez doświadczony zespół wykwalifikowanych anotatorów.” Pozyskiwane dane mają charakter jakościowy, nie będziemy zatem stosować miar ani określać liczbowych parametrów jakości. Posłużymy się dobrymi praktykami terenowego przeprowadzania wywiadów, które przez lata funkcjonują w środowisku językoznawców oraz badaczy nauk społecznych. 3. Przechowywanie i tworzenie kopii zapasowych podczas badań 3.1 W jaki sposób w trakcie projektu będą przechowywane dane i metadane? W jaki sposób będą tworzone ich kopie zapasowe? Warto rozważyć następujące kwestie: • Gdzie będą przechowywane dane i jaką dysponują Państwo pojemnością pamięci? • Jak wyglądają procedury tworzenia kopii zapasowych? • Czy potrzebne będą specjalne metody przenoszenia danych z urządzeń mobilnych, stanowisk terenowych lub sprzętu domowego na główny serwer w miejscu pracy? • Czy konieczna będzie digitalizacja danych analogowych lub wydanych w formie papierowej (takich jak mapy, fotografie, teksty), aby rozszerzyć możliwości ich rozpowszechniania? Komentarz: Opis zawarty w tym podpunkcie powinien być skupiony na kwestii przestrzeni i bezpieczeństwa przechowywania danych badawczych. W pierwszym kroku powinniśmy sprawdzić czy jednostka macierzysta ma opracowaną strategię przechowywania danych – jeśli tak, należy przytoczyć jej elementy relewantne dla realizacji naszego projektu. W opisie należy określić przybliżoną wielkość wytworzonych danych oraz wielkość przestrzeni potrzebnej do ich przechowywania. Zaleca się stosowanie zasady 3-2-1, a więc przechowywania danych badawczych w trzech kopiach, na co najmniej dwóch nośnikach, z czego jeden powinien być zlokalizowany poza siedzibą organizacji realizującej badanie. Najczęściej stosowane nośniki danych to: chmura danych, repozytoria, serwery lokalne, dyski SSD, dyski sieciowe, urządzenia lokalne (np. komputer służbowy). Każde z tych rozwiązań ma swoje zalety i wady, które zostały dokładnie omówione w przewodniku CESSDA Data Management Expert Guide72. Przechowywanie danych wyłącznie na nośnikach fizycznych może grozić nieodwracalną ich utratą (np. w wyniku klęski żywiołowej lub kradzieży nośnika), dlatego warto zadbać o wykonanie kopii danych przechowywanych w chmurze, repozytorium lub cyfrowej przestrzeni roboczej. Należy również dbać o spójne wersjonowanie zestawów danych, by wszystkie nośniki zawierały ich aktualną wersję. 72 https://dmeg.cessda.eu/Data-Management-Expert-Guide/4.-Store/Storage (dostęp: 09.06.2025 r.) Podczas planowania strategii przechowywania danych trzeba uwzględnić specjalistyczne wymagania i polityki, jeżeli zamierzamy przetwarzać dane osobowe oraz wrażliwe. W takim przypadku należy skontaktować się z inspektorem danych osobowych jednostki macierzystej w celu ustalenia możliwych rozwiązań. Przykład: Po dokonaniu nagrania wywiadu, plik dźwiękowy będzie przechowywany na komputerze służbowym agenta oraz deponowany w repozytorium danych naszej uczelni. Dodatkowo na potrzeby projektu wykorzystana zostanie przestrzeń robocza (chmura) udostępniana przez konsorcjum CLARIN- -PL. Kopie umieszczone w repozytorium i przestrzeni roboczej będą stanowiły całość razem z danymi zbieranymi przez agentów. Z przestrzeni roboczej nagrania będą pobierane przez anotatorów odpowiedzialnych za transkrypcje. Po dokonaniu transkrypcji plik tekstowy będzie również deponowany w repozytorium i przesyłany do przestrzeni roboczej. Raz w tygodniu kierownik projektu będzie kontrolował kompletność dokumentacji oraz harmonogram przesyłania plików – do momentu zakończenia etapu zbierania danych. Po zamknięciu tego etapu sporządzona zostanie wersja danych „ready to work” – będzie miała postać katalogu zawierającego nagrania, zanonimizowane transkrypcje, metadane nagrań i transkrypcji oraz readme. Katalog zostanie zdeponowany w repozytorium, przestrzeni roboczej CLARIN oraz na dysku sieciowym pracowni na terenie uczelni. To ta wersja danych będzie podlegała dalszej analizie i posłuży do przygotowania publikacji. Finalna postać danych gotowych do udostępnienia nie będzie zawierała danych osobowych ani wrażliwych. 3.2 W jaki sposób zostanie zapewnione bezpieczeństwo i ochrona danych wrażliwych w okresie trwania projektu? Warto rozważyć następujące kwestie: • W jaki sposób można będzie odzyskać dane utracone w wyniku incydentu? • Kto uzyska dostęp do danych w czasie trwania projektu i jak wyglądać będzie kontrola dostępu do danych, zwłaszcza w przypadku współpracy między kilkoma partnerami?