Cestovní zpráva - Research Data Alliance 20th Plenary Meeting & přidružené akce
Abstract
20. plenární zasedání Research Data Alliance (RDA P20) se konalo od 21. do 23. března 2023 ve švédském Göteborgu. Na konferenci se sešli výzkumní pracovníci, datoví vědci, tvůrci politik a správci dat z oborů z celého světa, aby se podělili o nové nápady a osvědčené postupy při využívání dat. Hlavní program P20 zahrnoval i přidružené akce naplánované na 20. a 24. března, zástupkyně NTK se zúčastnily mj. setkání pro lídry konsorcií DataCite (20. března) a ORCID (24. března). z nabídky přednášek se zaměřovaly zejména na témata spojená s perzistentními identifikátory a podařilo se jim získat cenné kontakty a informace, které pomohou zejména k naplňování cílů Národního centra pro perzistentní identifikátory.
Full text
1/11 Cestovní zpráva Research Data Alliance: 20th Plenary Meeting & přidružené akce Göteborg, Švédsko 18. – 25. března 2023 Účastnice: Petra Černohlávková (odd. 82 – Centrum repozitářů a správy metadat) Hana Heringová (ref. 821 – Národní centrum pro perzistentní identifikátory)
2/11 Účel cesty Účelem cesty byla účast na 20. plenárním zasedání organizace Research Data Alliance (dále RDA) a přidružených akcích. Třídenní hybridní konferenci pořádaly Chalmers University of Technology, University of Gothenburg a Swedish National Data Service (SND) a celkem se jí zúčastnilo 719 odborníků z celého světa. Ke konferenci bylo přidruženo celkem 13 odborných akcí od různých pořadatelů. Účelem cesty bylo se zúčastnit zejména akcí a přednášek s vazbou na perzistentní identifikátory, práci s metadaty a evidencí repozitářů a jejich atributů. Cílem cesty bylo dozvědět se o nových trendech v oblasti výzkumných dat a navázat osobní kontakty s ostatními institucemi využívajícími perzistentní identifikátory a služby DataCite a ORCID. Časový průběh cesty sobota 18. března: letecky cesta z Prahy do Göteborgu (odlet 11:55) neděle 19. března: schůzka se zástupkyní společnosti ORCID pondělí 20. března: účast na přidružené akci – DataCiteConnect úterý – čtvrtek 21. – 23. března: účast na Plenární schůzi RDA pátek 24. března: účast na přidružené akci – setkání lídrů konsorcií ORCID sobota 25. března: návrat z Göteborgu do Prahy (odlet 14:00) Průběh navštívené akce/jednání Neděle 19. března Schůzka se zástupkyní společnosti ORCID Paní Paloma Marín-Arraiza je kontaktní osobou pro vznik národního centra ORCID v ČR pod NTK. Prodiskutovaly jsme detaily dalších kroků vedoucích k úspěšnému spuštění českého národního centra/konsorcia ORCID, které je plánováno na červen 2023. Pondělí 20. března Přidružená akce – Výroční setkání DataCiteConnect pořádané organizací DataCite Letošní setkání DataCiteConnect poskytlo možnost všem zájemcům o problematiku perzistentních identifikátorů a jejich management se setkat a vyměnit si zkušenosti ohledně národních strategií pro perzistentní identifikátory (PIDs). Na akci krátce promluvili zástupci ORCID a DataCite o novinkách. Natasha Simons (ARDC, Austrálie) představila činnost a plánované výstupy pracovní skupiny pro národní strategie PIDs. Cílem setkání bylo podpořit komunitní výměnu zkušeností z různých zemí a získat zpětnou vazbu od účastníků, jak by mohl
3/11 DataCite jako poskytovatel PIDs přispět k formulaci národních strategií či politik. O své zkušenosti a informace o současném stavu se podělili zástupci ze 7 zemí: Německa, Nizozemí, Velké Británie, Austrálie, Kanady, Číny a ČR. Současný stav v ČR a plánovaný postup k sestavení strategie pro perzistentní identifikátory prezentovaly Petra Černohlávková a Hana Heringová. Úterý 21. března 9:00 – 10:30 Zahájení 20. plenárního zasedání RDA Tématem letošního plenárního zasedání bylo „desetiletí dat“. Organizace RDA totiž v letošním roce slavila 10 let své existence, takže přednášející zmiňovali význam RDA pro jejich práci – zejména možnost získat podněty a inspiraci odjinud, spolupracovat na společných tématech, čerpat ze zkušeností a talentu ostatních členů. Hlavním tématem tedy ve skutečnosti byla podpora spolupráce ve vědeckovýzkumných komunitách, což je hlavním posláním RDA. Lars Börjesson (Chalmers University of Technology, Švédsko) přivítal účastníky v Göteborgu a hovořil o službě e–commons Chalmersovy technické university, která usnadňuje výzkumníkům a doktorandům univerzity pracovat s daty. Hilary Hanahoe (Secretary General, RDA) přivítala účastníky a shrnula 10 let historie RDA. Madiareni Sulaiman (National Research and Innovation Agency – BRIN, Indonésie) hovořila o národním datovém repozitáři v Indonésii RIN Dataverse, který je možné využívat pro uložení dat kýmkoliv. Výzkumná data jsou v Indonésii regulována na celostátní úrovni v rámci regulace otevřených dat. Natasha Simons (Australian Research Data Commons, zkráceně ARDC) popsala vývoj práce její organizace ARDC v souvislosti s rostoucím významem výzkumných dat. ARDC konečně získala dlouhodobou podporu (na 2023–2028), má 90 zaměstnanců a je zapojena do několika partnerských projektů Wilhelm Widmark (Stockholm University, Švédsko) hovořil o ambicích Švédska kompletně přejít na open access do roku 2026/27. Od roku 2018 každoročně Asociace vyššího vzdělávání organizuje průzkum ohledně výzkumných dat, aby monitorovala pokrok. Zmínil existenci klíčových dokumentů pro implementaci otevřené vědy do každodenních procesů V&V&I: “National Roadmap for Open Science”, “Guidance to Roadmap” a tzv. “Orientation Guide” popisující, jaké nástroje jsou k dispozici. 11:00 – 12:00 Building RDA for the Future – Celebrating 10 years of the RDA V této panelové diskusi se sešli někteří ze zakladatelů RDA, kteří se podělili o své zkušenosti z počátků existence RDA a zhodnotili, jak se RDA během 10 let proměnila a kam se posunula. Panelisté byli doplněni o zástupce vědeckého prostředí, kteří se účastnili RDA Plenary Meeting poprvé, ale kterým komunita RDA na počátku jejich výzkumné kariéry výrazně pomohla a ovlivnila jejich práci s daty.
4/11 Coffee Break Rozhovor s Margaret O’Brien (University of Santa Barbara, Kalifornie, USA), která se podílí na provozu a rozvoji oborového repozitáře pro environmentální data EDIrepository.org. Pro repozitář byl vyvinut software/doplněk pro lepší vyhledávání jmen osob, tzv. “name reconciliation” – při vyhledávání osob zagreguje alternativní zápisy jména. Dále M. O’Brien zmínila nástavbu nad repozitářem – nástroj ezEML pro jednoduché vkládání dat do repozitáře přes uživatelské rozhraní. Repozitář má otevřený kód na GitHubu (https://github.com/EDIorg) a rovněž tak i nástroj ezEML (https://github.com/PASTAplus/ezEML). 13:00 – 14:00 Building Institutional Partnerships for the Future V této panelové diskusi se sešli zástupci z latinské Ameriky, kteří hovořili o svých několikaletých zkušenostech s budováním partnerství v Jižní Americe. Výsledkem společného úsilí je infrastruktura otevřených repozitářů jižní Ameriky La Referencia (https://www.lareferencia.info/) a vznik Ekvádorské korporace pro rozvoj výzkumu a akademie (zkráceně CEDIA, www.cedia.edu.ec), která přestavuje ekvádorskou národní výzkumnou a vzdělávací síť. Panelisté hovořili také o současném stavu správy dat, repozitářů a související podpory v Jižní Americe a diskutovali možnosti dalších kroků. Claudia Medeiros (Brazílie) se podělila s audiencí o přínos, který její první návštěva zasedání RDA přinesla její zemi. Na zasedání získala důležité informace, které pak přenesla do praxe ve své zemi, a také důležité kontakty, díky kterým se jí podařilo zajistit návštěvu zástupců RDA v São Paulu, kde nastartovali intenzivnější komunikaci o správě výzkumných dat a díky tomu se Brazílie výrazně posunula v oblasti FAIR dat a tvorba DMP se stala standardem. 14:00 – 15:30 Practical Approaches to Tracking and Communicating the Use of Research Data V této sekci byl prezentován výstup Data Usage Metrics Recommendations stejnojmenné pracovní skupiny RDA, který byl publikován v roce 2022. Dále bylo představeno vícero nových projektů a výzkumů, které se zabývají využitím citačních metrik výzkumných dat. Matthew Huys (DataCite) představil Make Data Count, globální iniciativu zaměřenou na hodnocení metrik pro otevřeně publikovaná výzkumná data, a COUNTER Code of Practice, který standardizuje generování a distribuci metrik k výzkumným datům. Wellcome Trust sponzoruje vznik globálního otevřeného datového citačního korpusu (Data Citation Corpus), který bude agregovat metadata z různých zdrojů (viz Obr.1 níže). Projekt k vytvoření zmiňovaného korpusu odstartoval 1. února 2023. DataCite také vyvinul DataCite Usage Tracker – v této chvíli je k dispozici v beta verzi, lze ho použít v repozitářích členských institucí vložením zhruba 10 řádků kódu. Nástroj sbírá údaje o počtu návštěv/shlédnutí (views) a stahování (downloads) z repozitářů a poté generuje měsíční reporty se statistikami. Lze o něj požádat na sup[email protected]rg.
5/11 Obr. 1: Projekt Open Data Citation Corpus 16:00 – 17:30 Pathways to national PID strategies: guidance to facilitate uptake and alignment John Aspler (Canadian Research Knowledge Network) hovořil o výhodách a potenciálních přínosech národní strategie PIDs (společné financování, budování komunity). Kanada má v tuto chvíli formulovanou politiku PIDs v rámci dokumentu “Roadmap for Open Science”. Alice Meadows (MoreBrains) se podělila o podněty z práce na cost-benefit analýzách ve Velké Británii, Austrálii a Kanadě. Společné rysy přístupu v těchto zemích jsou: úzké zapojení stakeholderů, robustní konsorcia vedená národními organizacemi, závazek k open / FAIR přístupu ze strany vlád, demonstrovaný finanční benefit, identifikace základní skupiny PIDs. Naopak rozdílné jsou: přístupy k financování výzkumu, bilingvní prostředí (Kanada), potřeby komunit původních obyvatel (Austrálie, Kanada). Shrnula i benefity PID strategií: analýzy ukazují významné úspory jak finanční, tak zejména časové; využití PIDs podporuje přechod k otevřenému výzkumu, spojuje komunitu a podporuje spravedlivější a udržitelnější národní ekosystém VaV. Gül Akcaova (SURF, Nizozemí) se podělila o zkušenost s nastavováním národní strategie, které měla vést “advisory group” složená z významných stakeholderů a pracovní skupina složená ze zástupců ostatních organizací a podporovatelů PIDs. Záhy narazili na první překážku – nedostatečně vymezené hranice mezi těmito dvě skupinami ohledně kompetencí a zodpovědnosti vůči definování strategie. Tuto situaci se jim podařilo vyřešit a před rokem vydali dokument “Towards the National PID Strategy” s doporučeními platnými na národní úrovni. Jako klíčové aspekty při tvoření národní PID strategie zdůraznila zmapování případů užití (co je potřeba trvale identifikovat a kde leží potenciální hodnota PIDs), jaké benefity užití konkrétních PIDs přináší pro výzkumníky, data stewardy a další aktéry VaVaI, a především kladla důraz na zapojení co nejširšího okruhu stakeholderů a otevřenou diskusi s nimi. Nizozemská pracovní
6/11 skupina se zaměřila na běžné případy použití, kde PIDs mohou přispět/již přispívají ke zlepšení kvality a efektivity sdílení a práce s výzkumnými informacemi, a zmapovala 6 základních případů: registrace a reportování výzkumu, znovupoužitelnost a reprodukovatelnost výzkumu, hodnocení výzkumu, žádosti o granty, profilování výzkumníků a hodnocení časopisů. Natasha Simons (ARDC, Austrálie) hovořila o ambicích Austrálie stát se ”data driven society” do roku 2030. Cost-benefit analýza australského prostředí od společnosti MoreBrains ukázala, že při správné integraci PIDs je možné ušetřit 38 tis. člověkodní za rok, které nyní výzkumníci tráví neefektivní administrativou a opakovaným zadáváním dat. V průběhu roku 2023 by měla být dokončena formulace národní strategie PIDs pro Austrálii. v únoru byla vytvořena “taskforce”, v červnu by měl být připraven návrh strategie a identifikován subjekt, který má vést implementaci strategie. Do října budou na základě zpětné vazby od stakeholderů pracovat na re–draftech. v listopadu by měla být hotová finální verze. Za nejdůležitější považují průběžnou konverzaci na národní úrovni se všemi aktéry V&V. Středa 22. března 9:00 – 10:30 – Expanding our horizons to new disciplines: harmonising on what is core to all Tato sekce vycházela převážně z práce zájmové skupiny RDA Physical Samples and Collections in the Research Data Ecosystem IG, jejímž cílem je nastavit FAIR principy pro fyzické vzorky, resp. zajistit reprodukovatelná a znovu použitelná data ze vzorků. Byl představen katalog iniciativ, které se zabývají katalogizací a PIDs pro fyzické vzorky: Catalogue of Groups/Projects Working on Physical samples and their Identifiers. Dále byli účastníci seznámeni se změnami ohledně identifikátoru pro fyzické vzorky IGSN (International Generic Sample Number), který se používá například v archeologii pro identifikaci sebraných artefaktů. Nová IGSN je nyní možné registrovat prostřednictvím nástrojů organizace DataCite. Existujícím IGSNs (systém handle) jsou přidělovány “aliasy” na DOI. Organizace IGSN změní své poslání na organizaci, která už neřeší přidělování PIDs, ale řeší spíše doporučení, standardy a best practice pro identifikaci vzorků. Při registraci IGSN prostřednictvím DataCite se využívá jako základ identické metadatové schéma pro přidělení DOI s doporučeními na jejich úpravy. Organizace IGSN si je vědoma odlišných potřeb na metadatový popis podle oboru, a proto chce být/bude platformou pro vyvíjení společných metadatových profilů pro jednotlivé obory. Kerstin Lehnert (Johnoson’s Space Center, Houston, USA) prezentovala projekt archivace analýz ze vzorků z vesmíru. Během svého příspěvku důrazně doporučila užívání PIDs v maximální možné míře pro různé typy entit. K. Lehnert poskytla také informaci o projektu Sampling Nature Research Coordination Network, jehož cílem je podpořit udržitelné praktiky ve výzkumu, sdílení a opakované využití fyzických vzorků. Projekt formuluje metadatové standardy, doporučení a školicí materiály. Soustřeďuje se mj. na nekurátorované sbírky vzorků a na prevenci proti jejich vyhození či zničení. V diskuzi byly zmíněny projekty WorldFAIR project, DISSCo (Distributed System of Scientific Collections), RSpace (Research Space) a také projekt „Enhancing
7/11 interoperability through use of PIDs in research platforms“ (podpořený z EOSC future), jehož cílem je integrace DOI (od DataCite) do digitální výzkumné platformy RSpace, která zahrnuje elektronický laboratorní notebook integrovaný se systémem správy vzorků. Coffee Break: Schůzka se Shawnem Rossem (ARDC, Austrálie) ohledně identifikátoru výzkumných aktivity RAiD (Research Activity iD). RAiD je zamýšlený pro identifikaci výzkumných projektů/záměrů/oblastí daného výzkumníka či týmu. Neváže se na zdroje financování – granty či účelovou podporu - na jeden RAiD může být navázáno i několik zdrojů financování. Přestože RAiD je poměrně nový, tak již výzkumnou obcí rezonuje a vzbuzuje zvědavost a zájem. Proto jsme na konferenci vyhledaly zástupce za účelem získání informací, které zatím nejsou dostupné na webu RAiD. ARCD nyní pracuje na vypracování koncepce organizace a řízení přidělování RAiD i jinými subjekty, zatím se hovoří o třech entitách: registrační autorita, registrační agentura a kontaktní body. Registrační autoritou je nyní ARDC, ale v příštích zhruba 3 letech se pravděpodobně přetransformuje do samostatné neziskové organizace po vzoru ORCID či DataCite. Registrační agentura bude podřízena ARCD a bude odpovědná za lokální provoz PostgreSQL databáze v Javě. Agentura by měla mít i možnost customizace fungování RAiD, zejména pak rozšiřování metadatového schématu. Kontaktní místem se rozumí osoba na univerzitě/výzkumné organizaci, která má práva vytvářet, upravovat a publikovat RAiD. Může jich být více. Je také možné rozlišovat mezi těmi, kteří mohou působit jako kurátoři a poskytovat podporu, a těmi, kteří mohou požádat a získat RAiD. Pro správu RAiD by měly existovat předdefinované role s přidělenými právy, ale jejich konečná granularita bude pravděpodobně předána k rozhodnutí na registrační agenturu. Získání RAiD je pro koncového uživatele zdarma, finanční model pro registrační agentury zatím nebyl stanoven a žádná zatím nebyla zřízena. Nyní se jedná s nizozemským SURF o zřízení první registrační agentura, která by měla sloužit EOSC. Zároveň se jedná, zda zůstane na handle nebo bude začleněno/využívat systému ePIC nebo DOI. 10:00 – 11:30 The Way to FAIR: from data collection to citation Přednáška představila jednak práci pracovní skupiny pro FAIR Data Maturity Model, ale zejména pracovní skupiny pro perzistentní identifikaci přístrojů. Tato pracovní skupina identifikovala dva potenciálně vhodné systémy pro perzistentní identifikaci přístrojů: ePIC (součástí handle.net registry), nebo DOIs (přes DataCite). Identifikace má zajistit jasnou návaznost dat na konkrétní přístroje, lépe zachytit výsledky výzkumu, napomoci plánování výzkumu a jeho logistiky a umožní produkovat mnohem bohatší metadata. Pracovní skupina pracovala na metadatovém schématu pro perzistentní identifikátor pro přístroje PIDINST.
8/11 Pedro Luiz Pizzigatti Corrêa (University of São Paulo, Brazílie) na základě zkušeností z projektu v Amazonii doporučil mj. dbát na kvalitu dat, být připraven na evoluci standardů, hardwaru a dalších částí výzkumného ekosystému, a být transparentní v užitých metodách. Charles Edward Catlett (Argonne National Laboratory, University of Chicago, USA) mluvil o projektu komplexního zkoumání prostředí/okolí (doprava – lidi, auta, drony atd., vzduch, hluk/zvuky, detekce záplav nebo požárů) prostřednictvím senzorů v ulicích Chicaga. V projektu bylo nutné dobře ošetřit data privacy. Senzory sbírají velké množství dat, takže bylo také potřeba vyhodnotit, jak s daty naložit – zda mají nějakou potenciální cílovou skupinu uživatelů a přidanou hodnotu pro výzkumníky či místní komunitu mimo tento projekt. Debora Pignatari Drucker (Embrapa Digital Agriculture, Brazílie) hovořila o projektu Airborne LIDAR, během kterého došlo dvakrát k ručnímu přepisu dat z přístrojů, které znamenalo enormní riziko vzniku chyby. Použití Kompletní integrace PIDINST do systémů a nástrojů užitých v projektu by toto riziko eliminovala. Stuart Chalk (University of North Florida) hovořil o use–case užití PIDs pro přístroje při chemické analýze. Vznesl otázku, co se vlastně má považovat za přístroj, jaká granularita by měla být nastavena při přidělování PID strojům – přístroje se opravují, nahrazují se jejich významné části, mají různou kalibraci. Dále poukázal na fakt, že spolu s měřením je třeba zaznamenávat i další faktory, které mohou ovlivnit výsledek měření jako např. vlhkost v laboratoři, celý kontext měření, aj. 15:30 – 18:00 RDA Plenary Session: Building Industrial Partnerships for the Future Tento blok byl věnován perspektivě komerce při práci s výzkumnými daty a možnostem spolupráce mezi soukromým a veřejným sektorem. Všichni panelisté byli zástupci ze soukromého sektoru: Ikea, Amazon, Oracle a AstraZeneca. Monica Lassi (Senior Data Governance Specialist, IKEA) hovořila o rozdílech v přístupu k datům mezi těmito dvěma světy, kdy poukázala na to, že oproti veřejné sféře si firmy již nyní dobře rozmýšlejí, jaká data potřebují dlouhodobě uchovávat. Dan Nygren (Education Lead, Nordics and Baltics, Amazon Web Services) mluvil o spolupráci AWS v oblasti Open Dat s veřejným sektorem na různých projektech: např. OCRE – Open Clouds for Research Environments, EOSC, Horizon Europe. Richard Pitts (Oracle for Research) hovořil o tom, že přístup open science a principu byznysu se nutně nemusí vylučovat. Popsal také projekt Oracle Open Data, který nabízí repozitářovou službu výzkumnému prostředí pro hostování dat a ke sdílení dat (~5 petabytů). Henric Rhedin (Director External Research & Exploration Coordination,Volvo Cars) podtrhnul význam výzkumných dat v automobilovém průmyslu a nutnost jasně určit jejich vlastnictví. Mimmi Sundler (Head of R&D Data & AI Governance & Policy, AstraZeneca) popsala, že dříve farmaceutické společnosti sdílely data hlavně ke zvýšení transparence v reakci na kritické kampaně zpochybňující jejich výzkumné metody. Podle její zkušenosti je při sdílení dat nutné dbát na interoperabilitu, jinak mají sdílená data jen omezené možnosti využití a je nutné lépe ošetřit regulace ohledně data privacy: pro farmaceutické firmy je sdílení dat činnost, kde musí pečlivě vyvažovat otevřenost, ale zároveň respektování místních regulací. Sdělila, že v současnosti jsou u farmaceutických firem už FAIR
9/11 principy zabudovány do procesů. Výzvu však představuje nejednotný přístup k tomu, jak anonymizovat data. Čtvrtek 23. března 8:00 – 9:00 – Meet–up na téma práce s daty v krizových situacích Na základě zkušenosti s invazí na Ukrajinu a zemětřesením v Turecku prof. Francis Crawley (Katolická univerzita v Lovani) navrhuje založit pracovní skupinu při RDA, která by se zabývala problematikou prací s daty v krizových situacích. Sběr dat je často během krize přerušen, je nutné dělat rozhodnutí na nekompletních datech a také rozhodnutí, která jsou svou povahou etická – např. nemůžeme zachránit všechny, koho tedy zachráníme? 11:00 – 12:30 Data Repository Attributes Working Group (DRAWG): Working Meeting Zástupci v názvu uvedené pracovní skupiny prezentovali přehled jejich dosavadní práce – seznam atributů repozitářů, které zmapovali a vyhodnotili za přínosné k evidenci. k jejich určení použili metodu „user stories“ ( “As a …, I would like to do …. in order to …”). Členové pracovní skupiny se rozhodli pro neobvyklý model získání zpětné vazby – požádali tři steakholdery (Andrew Treloar, Australian Research Data Commons, Olof Olsson, Swedish National Data Service, a Jennie Larkin, United States National Institutes of Health), aby jejich práci věcně zkritizovali během tohoto setkání. Poté byli účastníci rozděleni do skupin, kde diskutovali, jaké údaje / atributy o repozitářích potřebují znát různé typy uživatelů (knihovny, výzkumníci, nakladatelé ad.). Nakonec zástupce každé skupiny shrnul probíhající diskusi. Výstupy diskuse pak pracovní skupina zohlední při další práci. Pátek 24. března 9:00 – 16:30 ORCID consortia workshop Workshop se soustředil na integrace identifikátoru ORCID iD do systémů v členské základně konsorcií. Podle zkušenosti společnosti ORCID, pokud instituce neprodlouží své členství, je to prakticky vždy proto, že nemá integraci a tím pádem nemá z ORCID žádnou přidanou hodnotu. Zástupci společnosti ORCID představili svou činnost včetně základních statických údajů: existuje 27 konsorcií ORCID, na místě byli zástupci čtrnácti z nich; ORCID má 36 pracovníků; poskytují podporu členům a lídrům konsorcií s důrazem na podporu také v národních jazycích.