scieee AI-readable full text Open interactive document viewer

Ciclo de vida dos dados e ARGOS

Almeida, Bruno

Abstract

Apresentações realizadas no âmbito do Programa Onboarding para Novos Investigadores, realizado no âmbito do Centro de Competências em Gestão de Dados de Investigação do NOVA.ID (NOVA.ID-RDM-CC): Edição 1: NOVA FCSH, 01/07/2025. Edição 2: NOVA IHMT, 19/11/2025.

Full text

Ciclo de vida dos dados Bruno Almeida | NOVA FCSH [email protected] No âmbito do PNCADAI – Programa Nacional de Ciência Aberta e Dados Abertos de Investigação, inserido na Medida RE-C05-i08 – Ciência Mais Digital, do PRR – Plano de Recuperação e Resiliência. Ciclo de vida dos dados •Os dados de investigação têm um contexto que vai para além do momento da sua criação. •O ciclo de vida dos dados representa as diferentes fases da investigação e dos dados resultantes. designed by freepik 2 Ciclo de vida dos dados no RDMKit •Fases do ciclo de vida dos dados no RDMKit da Infraestrutura ELIXIR, em ciências da vida: •Planeamento •Recolha •Processamento •Análise •Preservação •Partilha •Reutilização https://rdmkit.elixir-europe.org/data_life_cycle 3 Planeamento 4 Planeamento •Definição da estratégia para os dados que irão ser criados e/ou reutilizados na investigação: •Que tipo de dados serão gerados, com que recursos, intervenientes, etc.? •Como será garantida a integridade dos dados, e gerido o acesso aos mesmos em diferentes momentos da investigação? •Que documentação dos dados é necessária para garantir a partilha e preservação a longo prazo? •As respostas a estas questões é formalizada através de um plano de gestão de dados (PGD). 5 Plano de gestão de dados designed by freepik •Documento que descreve como os dados serão produzidos, geridos e partilhados antes, durante e após a investigação. •É um documento “vivo”, devendo ser atualizado no decorrer da investigação. 6 Importância de criar um PGD •É um requisito de programas de financiamento (ex. Horizon Europe). •Facilita o planeamento e a orçamentação de recursos e equipamento. •Define papéis e responsabilidades na equipa do projeto. •Ajuda a identificar riscos e propor soluções na gestão de dados. •Facilita a partilha, preservação e reutilização dos dados. 7 Informação que deve constar num PGD •Informação geral sobre o projeto. •Descrição dos conjuntos de dados gerados ou reutilizados. •Descrição dos esquemas de metadados, das ontologias utilizadas e da documentação que acompanha os dados. •Armazenamento, salvaguarda e preservação. •Partilha e publicação dos dados. •Custos e recursos necessários para a GDI. •Questões éticas e legais (ex. dados sensíveis, propriedade intelectual e licenciamento dos dados). 8 Exemplos de PGD 9 PGD do projeto RARAA [Arqueologia] https://hdl.handle.net/1822/92462 PGD do projeto SAIL [Ciências da Terra] https://doi.org/10.5281/zenodo.4286209 Organização de ficheiros •Desenvolver uma convenção para nomear os ficheiros: •Dar preferência a nomes breves e informativos; •Manter a consistência na nomeação dos ficheiros; •Ordenar os elementos do nome do geral para o específico; •Usar hífens ou underscores para separar elementos do nome, evitar espaços em branco ou caracteres especiais; •Incluir datas no formato ISO 8601 (AAAAMMDD), se necessário com as horas (HHMMSS); •Indicar a versão do ficheiro no nome. 16 Organização de ficheiros: exemplos •Ficheiro de dados da experiência 2 em Helsínquia do projeto Honeybee, criado em 2 dez. 2020: •Nome de ficheiro: 20201202_HB_EXP2_HEL_DATA_V03.xls •Transcrição de entrevista com grupo de foco com consumidores, em 12 fev. 2010: •Nome do ficheiro: FG1_CONS_2010-02-12.rtf Data Sigla do projeto N.º da experiência Local Tipo Versão N.º do grupo de foco Tipo de participantes Data 17 Escolha de formatos de ficheiro •Sempre que possível, dar preferência a formatos: •Não proprietários; •Baseados em normas abertas, de utilização livre; •Mais utilizados na área de investigação; •Não comprimidos; •Não encriptados. •Na fase ativa da investigação (recolha, processamento e análise) é aceitável o uso de formatos proprietários, mas para a preservação, partilha e reutilização, devem ser convertidos ou exportados para formatos abertos. 18 Escolha de formatos de ficheiro Tipo de dados Preferenciais Aceitáveis Não recomendados Documentos de texto enriquecido ODT (. odt) Markdown (.md) LaTeX (.tex) PDF/A (. pdf) Office Open XML Document (.docx) Microsoft Word (. doc) Rich Text Format (.rtf) Outros tipos de PDF (. pdf) Documentos de texto simples Unicode text (.txt) Texto não Unicode (. txt) Dados tabulares CSV (. csv, .tsv) Office Open XML Workbook (.xlsx) Microsoft Excel (. xls) Áudio Matroska (.mka) FLAC (. flac) WAVE (. wav) MP3 (.mp3) Vídeo Matroska (.mkv) MPEG/MPG animation (. mpg, .mp4, .mjpeg) AVI (. avi) QuickTime (. mov, .qt) Metadados legíveis por máquina JSON (. json) XML (. xml) 19 Processamento 20 Processamento designed by freepik 21 •Fase de preparação dos dados para a análise: •Converter os dados para um formato acessível para análise; •Levar a cabo a curadoria dos dados. •No caso de dados importados de outras fontes, pode também ser necessário: •Alterar os formatos para integração com outros datasets; •Alterar os sistemas de codificação, ontologias ou vocabulários controlados utilizados; •Filtrar os dados para incluir apenas dados relevantes para a investigação. Importância do processamento dos dados •Permite assegurar a boa qualidade dos dados recolhidos e prepará-los para análise. •Fase essencial para a integração de dois ou mais conjuntos de dados de origens diferentes. •A documentação dos passos realizados no processamento é importante para a reprodutibilidade da investigação. 22 Questões a ter em conta •Os dados sensíveis devem ser anonimizados ou pseudonimizados. •Registo das etapas de codificação e de anonimização, por exemplo: •Formatos de codificação usados nos campos (ex. datas, nomes); •Significado dos campos vazios e de quaisquer valores especiais; •Relações entre campos de dados. 23 Anonimização e pseudonimização Dados em bruto Dados pseudonimizados Dados anonimizados João Silva, M, 1990 -01-01, Lisboa P001 , M, 1990, Lisboa Homem , 30-40 anos, Lisboa Sofia Marques, F, 1986 -01-01, Diabetes tipo 1, Grupo de tratamento A P001 , F, 1986 , Diabetes tipo 1, Grupo de tratamento A Mulher , 30-40 anos, Diabetes tipo 1, Grupo de tratamento A •Na pseudonimização, os dados que permitem identificar pessoas são substituídos por pseudónimos, sendo possível reidentificar as pessoas com dados adicionais (ex. tabela de mapeamento). •Na anonimização, os dados sensíveis são retirados e não é possível reidentificar as pessoas: •Dados anonimizados não são considerados dados pessoais. 24 Análise 25 Questões a ter em conta •Nem todos os dados devem ser preservados, apenas os que cumpram certos requisitos: •Dados que o financiador, editora ou instituição requeira serem preservados durante um período. •Dados para cumprimento de requisitos éticos ou legais (ex. dados de ensaios clínicos). •Dados únicos ou que não possam facilmente ser recriados (ex. fluxo de trabalho da análise dos dados). •Dados com grande potencial para serem reutilizados, ou com valor social, científico, histórico ou cultural. 32 Partilha 33 Partilha designed by freepik •Partilhar os dados significa dar a conhecer os dados a outrem. •A partilha dos dados não implica necessariamente o acesso aberto: •Acesso controlado, registado ou por pedido. •Acesso fechado (com metadados abertos). •A partilha pode ser realizada a qualquer momento do ciclo de vida dos dados: •O mais tardar, os dados devem ser partilhados para acompanhar publicações que recorram aos dados para chegar a conclusões. 34 Importância da partilha dos dados •A partilha dos dados é uma boa prática para garantir a sua preservação e disponibilização à comunidade científica. •Condição necessária para que a investigação seja reprodutível. •Diversos financiadores, editoras e instituições requerem a partilha dos dados sempre que possível. •No contexto da UE, os dados de investigação resultantes de financiamento público devem ser abertos por omissão, e compatíveis com os princípios FAIR. 35 Questões a ter em conta •No caso da partilha de dados no âmbito de investigação colaborativa: •Utilizar plataformas para armazenamento, partilha e acesso controlado aos dados preliminares. •Depositar os dados num repositório logo que possível (com embargo, se necessário). •Adotar práticas comuns de organização dos dados, dos formatos, da documentação e dos metadados. 36 Questões a ter em conta •No caso da partilha de dados para publicação: •Confirmar os direitos para partilha dos dados. •Considerar possíveis questões éticas, contratuais e legais sobre os dados (ex. dados pessoais, patentes). •Verificar os requisitos dos financiadores, editoras e instituições sobre a publicação e disponibilização de dados. •Tornar os dados citáveis, utilizando identificadores persistentes (ex. DOI). •Selecionar uma licença para a utilização dos dados. 37 Licenciamento de dados •Sempre que possível, selecionar uma licença que permita a reutilização ou modificação dos dados. •Como referência, selecionar uma licença compatível com a Open Definition (https://opendefinition.org/licenses/), por exemplo: •Creative Commons CC0-1.0 (domínio público). •Creative Commons Attribution CC-BY-4.0 (atribuição ao criador). •Creative Commons Attribution Share-Alike CC-BY-SA-4.0 (partilha igual). 38 Repositórios de dados: alternativas •Utilizar um repositório disciplinar, se possível (ex. PORTULAN CLARIN para as ciências da linguagem). •Utilizar o Zenodo, um repositório generalista gerido pelo CERN e com financiamento da Comissão Europeia. 39 Informação sobre repositórios de dados •Recorrer a diretórios para localizar repositórios confiáveis e obter mais informações: •Registry of Research Data Repositories: https://www.re3data.org/ •FAIRsharing: https://fairsharing.org/ 40 Reutilização 41