Full text
Universidade do Minho Escola de Engenharia Daniela Filipa Machado Lemos Regressão não linear em curvas de crescimento para parâmetros placentares em R dezembro 2023
Universidade do Minho Escola de Engenharia Daniela Filipa Machado Lemos Regressão não linear em curvas de crescimento para parâmetros placentares em R Dissertação de Mestrado Mestrado em Bioinformática Trabalho efetuado sob a orientação de Professora Doutora Ana Cristina da Silva Braga Professora Doutora Rosete Maria Amorim Novais Nogueira Cardoso dezembro 2023
Direitos de Autor e Condições de Utilização do Trabalho por Terceiros Este é um trabalho académico que pode ser utilizado por terceiros desde que respeitadas as regras e boas práticas internacionalmente aceites, no que concerne aos direitos de autor e direitos conexos. Assim, o presente trabalho pode ser utilizado nos termos previstos na licença abaixo indicada. Caso o utilizador necessite de permissão para poder fazer um uso do trabalho em condições não previstas no licenciamento indicado, deverá contactar o autor, através do RepositóriUM da Universidade do Minho. Licença concedida aos utilizadores deste trabalho: Atribuição-NãoComercial-SemDerivações CC BY-NC-ND https://creativecommons.org/licenses/by-nc-nd/4.0/ i
Agradecimentos Gostaria de expressar os meus sinceros agradecimentos a todos que contribuíram para a realização deste trabalho e para a conclusão bem-sucedida do meu mestrado. Primeiramente, quero expressar a minha gratidão à minha orientadora, Professora Doutora Ana Cristina Braga, pela amizade, orientação e apoio ao longo deste projeto. A sua disponibilidade, partilha de conhecimento e conselhos foram inestimáveis na condução deste estudo. Agradeço não apenas pela confiança que depositou em mim desde o início, mas também por me incentivar a abraçar desafios, a explorar novos caminhos e a acreditar no meu potencial. Também gostaria de agradecer à minha coorientadora, Professora Doutora Rosete Nogueira, pela sua amizade, apoio, conselhos e contribuições para este estudo. A sua orientação adicional enriqueceu profundamente esta investigação. Agradeço ao laboratório de Patologia Embrionária Fetal do Centro de Genética Clínica no Porto, por generosamente ceder os dados essenciais para a condução deste estudo. À minha família, principalmente ao meu pai, mãe e irmã, agradeço do fundo do coração pelo seu amor incondicional, encorajamento constante e apoio inabalável ao longo de toda a minha jornada académica. Sem vocês, nada disto teria sido possível. Ao meu namorado, quero expressar a minha gratidão pelo incentivo, apoio e carinho durante todos os momentos deste percurso. Aos meus amigos, quero agradecer pelo seu apoio contínuo, amizade e por todos os momentos ao longo destes anos. Este trabalho é dedicado a todos vocês, e estou profundamente grata por fazerem parte desta jornada. ii
Declaração de Integridade Declaro ter atuado com integridade na elaboração do presente trabalho académico e confirmo que não recorri à prática de plágio nem a qualquer forma de utilização indevida ou falsificação de informações ou resultados em nenhuma das etapas conducente à sua elaboração. Mais declaro que conheço e que respeitei o Código de Conduta Ética da Universidade do Minho. Universidade do Minho, Braga, dezembro 2023 Daniela Filipa Machado Lemos iii
Resumo Nos últimos anos, tem existido um crescente interesse na avaliação dos parâmetros biométricos da placenta e a sua relação com resultados obstétricos. Evidências têm sido publicadas sugerindo que as medidas da placenta e a sua evolução são capazes de refletir alterações no desenvolvimento do feto e até mesmo doenças do recém-nascido e do adulto. Tendo em conta, que os gráficos de crescimento desempenham um papel crucial na avaliação e vigilância da população pediátrica, surgiu o tema desta dissertação. O principal objetivo passa por estudar a aplicabilidade de modelos de regressão não linear em curvas de crescimento de parâmetros como o Diâmetro 1 (D1) e 2 (D2), Espessura (EP) e Peso placentar (PP) e Peso fetal (PF). Para isso, utilizou-se um conjunto de dados de parturientes portuguesas recolhidos no CGC (Centro de Genética Clínica), Porto. Neste estudo foi utilizada uma abordagem de regressão semiparamétrica para a construção de curvas de crescimento de referência. Esta metodologia utiliza os modelos aditivos generalizados para localização, escala e forma (GAMLSS), Lamda-Mu-Sigma (LMS), LMS com Box-Cox t (BCT) e LMS com Box-Cox-powe-exponential (BCPE), oferecendo vantagens distintas sobre os métodos tradicionais como a regressão quantílica. Uma das principais vantagens do GAMLSS é a sua flexibilidade para acomodar qualquer distribuição estatística, permitindo a modelação de vários parâmetros biométricos. Através da aplicação da metodologia proposta, foi demonstrado que com a utilização do método GAMLSS com BCT e P-splines para os parâmetros D1 e D2 e do método LMST para os parâmetros EP, PP e PF, podemos alcançar curvas de crescimento representativas. Além disso, foi desenvolvida uma aplicação web , disponível em https://placentalgrowth.shinyapps.io/uminho_pt/, utilizando o ambiente R. Permite que profissionais de saúde e investigadores analisem e interpretem as curvas de crescimento desenvolvidas com facilidade. Os resultados deste estudo fornecem informações importantes sobre o desenvolvimento da placenta e têm implicações significativas para a prática clínica em obstetrícia, permitindo o seu avanço e acompanhamento da saúde materno-fetal. Palavras-chave Placenta, Curvas de crescimento, Regressão não linear, GAMLSS, LMST iv
Abstract In recent years, there has been a growing interest in assessing the biometric parameters of the placenta and their relationship with obstetric outcomes. Evidence has been published suggesting that placental measures and their evolution can reflect changes in fetal development and even impact newborn and adult health. Considering the crucial role that growth charts play in the evaluation and monitoring of the paediatric population, the topic of this dissertation emerged. The main objective was to study the applicability of nonlinear regression models in growth curves for parameters such as Diameter 1 (D1) and 2 (D2), Thickness (PT), Placental weight (PW), and Fetal weight (FW). For this purpose, a dataset of Portuguese parturients collected at CGC (Center for Clinical Genetics), Porto, was used. This study employed a semi-parametric regression approach to construct reference growth curves. This methodology utilizes generalized additive models for location, scale, and shape (GAMLSS), LambdaMu-Sigma (LMS), LMS with Box-Cox t (BCT), and LMS with Box-Cox-power-exponential (BCPE), offering distinct advantages over traditional methods such as quantile regression. One of the key advantages of GAMLSS is its flexibility to accommodate any statistical distribution, allowing the modeling of various biometric parameters. Through the application of the proposed methodology, it was demonstrated that using the GAMLSS method with BCT and P-splines to D1 and D2 parameters and the LMST method to PT, PW, and FW parameters, representative growth curves can be achieved. Furthermore, a web application, available at https://placentalgrowth.shinyapps.io/uminho_pt/, was developed using the R environment. It enables healthcare professionals and researchers to easily analyze and interpret the developed growth curves. The results of this study provide valuable insights into placental development and have significant implications for clinical practice in obstetrics, promoting its advancement and the monitoring of maternal-fetal health. Keywords Placenta, Growth curves, Nonlinear regression, GAMLSS, LMST v
Conteúdo 1 Introdução 1 1.1 Enquadramento e motivação ............................. 1 1.2 Objetivos ....................................... 4 1.3 Estrutura da dissertação ............................... 5 2 Estado da arte 7 2.1 Placenta humana ................................... 7 2.1.1 Introdução histórica ............................. 7 2.1.2 Definição e características gerais ....................... 8 2.1.3 Implicações dos parâmetros placentares e fetais ............... 10 2.2 Curvas de crescimento ................................ 12 2.2.1 Introdução histórica ............................. 12 2.2.2 Regressão não linear ............................. 19 2.2.3 Definição e características gerais das curvas de crescimento ......... 20 2.2.4 Aplicação de curvas de crescimento em várias áreas ............. 21 2.3 Software R...................................... 24 2.3.1 Shiny .................................... 25 2.3.2 Pacotes ................................... 26 2.3.3 Aplicação do R ................................ 26 3 Regressão 28 3.1 Conceito e definição de regressão ........................... 28 3.2 Regressão linear ................................... 29 3.3 Regressão não linear ................................. 30 3.4 Regressão paramétrica, semi e não paramétrica .................... 32 3.4.1 Regressão paramétrica ............................ 32 vi
10 Resumo do desempenho do modelo final do D1, método GAMLSS com a função de alisamento P-splines e a distribuição BCT. São comparadas as percentagens nominais e de amostra em ou abaixo de cada percentil. ..................... 93 11 Métricas de desempenho do modelo para o D2 em diferentes métodos para diversas funções de alisamento e distribuições. A tabela exibe o R2, o MSE, o AIC e o BIC.. . 96 12 Resumo do desempenho do modelo final do D2, método GAMLSS com a função de alisamento P-splines e a distribuição BCT. São comparadas as percentagens nominais e de amostra em ou abaixo de cada percentil. ..................... 97 13 Métricas de desempenho do modelo para a EP em diferentes métodos para diversas funções de alisamento e distribuições. A tabela exibe o R2, o MSE, o AIC e o BIC.. . 100 14 Resumo do desempenho do modelo final da EP, método LMST com a função de alisamento P-splines . São comparadas as percentagens nominais e de amostra em ou abaixo de cada percentil. ...............................101 15 Métricas de desempenho do modelo para o PP em diferentes métodos para diversas funções de alisamento e distribuições. A tabela exibe o R2, o MSE, o AIC e o BIC.. . 105 16 Resumo do desempenho do modelo final do PP, método LMST com a função de alisamento P-splines . São comparadas as percentagens nominais e de amostra em ou abaixo de cada percentil. ...............................106 17 Métricas de desempenho do modelo para o PF em diferentes métodos para diversas funções de alisamento e distribuições. A tabela exibe o R2, o MSE, o AIC e o BIC.. . 109 18 Resumo do desempenho do modelo final do PF, método LMST com a função de alisamento P-splines . São comparadas as percentagens nominais e de amostra em ou abaixo de cada percentil. ...............................109 xiii
Acrónimos R2Coeficiente de Determinação. AIC Akaike’s Information Criterion /Critério de Informação de Akaike. AVAS Additivity and Variance Stabilization /Aditividade e Estabilização da Variância. BCCG Box-Cox Cole-Green . BCPE Box-Cox Power Exponential . BCT Box-Cox t . BIC Bayesian Information Criterion /Critério de Informação Bayesiano. CCD Centro de Controlo e Prevenção de Doenças. CG Algoritmo Cole e Green. CGC Centro de Genética Clínica. CV Coeficiente de Variação. D1 Maior Diâmetro da Placenta. D2 Menor Diâmetro da Placenta. DP Desvio Padrão. EMV Estimação de Máxima Verosimilhança. EP Espessura Placentar. FPET Fractional Polynomials and Exponential Transformation /Polinómios Fracionários e Transformação Exponencial. xiv
GAIC Generalized Akaike Information Criterion/Critério de Informação de Akaike Generalizado . GAM Generalized Additive Models/Modelos Generalizados Aditivos. GAMLSS Generalized Additive Models for Location, Scale and Shape /Modelos Aditivos Generalizados para a Localização, Escala e Forma. GLM Generalised Linear Model/Modelo Linear Generalizado. HRY Método Healy-Rasbash-Yang. IDE ( Integrated Development Environment / Ambiente de Desenvolvimento Integrado. IG Idade-Gestacional. IQR Interquartile Range /Amplitude Interquartil. JSU Johnson’s SU . LMS Lamda-Mu-Sigma. LMSP Lambda-Mu-Sigma Box-Cox-power-exponential . LMST Lambda-Mu-Sigma Box-Cox t . MADAM Mean and Dispersion Additive Models /Modelos Aditivos de Média e Dispersão. MSE Mean Square Error /Erro Quadrático Médio. MST Média da Soma Total dos Quadrados. MV Máxima Verosimilhança. PF Peso Fetal. PN Peso ao Nascer. PP Peso Placentar. R-PF Rácio Peso Fetal/Peso Placentar. R-PP Rácio Peso Placentar/Peso Fetal. xv
R-PPN Rácio Peso Placentar ao Nascimento. RS Algoritmo Rigby e Stasinopoulos. UI User interface /Interface do Utilizador. VCG Validação Cruzada Generalizada. xvi
Capítulo 1 Introdução Este primeiro capítulo marca o início da dissertação, cujo foco recai sobre o desenvolvimento de modelos de curvas de crescimento utilizando métodos de regressão não linear, com ênfase na sua aplicação a parâmetros placentares. Este estudo é realizado no contexto da dissertação de Mestrado em Bioinformática da Universidade do Minho e tem como objetivo principal avaliar a utilidade destes modelos na deteção precoce de complicações fetais. Inicialmente, é estabelecido o enquadramento conceitual abrangente e motivação relativamente ao tema da dissertação. Posteriormente, são delineados os objetivos a serem alcançados ao longo desta investigação e, por fim, é apresentada uma visão detalhada da estrutura deste documento. Este capítulo inicial desempenha um papel fundamental ao estabelecer as bases que sustentarão a exploração e análise ao longo desta dissertação. 1.1 Enquadramento e motivação O desenvolvimento fetal é altamente dependente de vários fatores genéticos, nutricionais e ambientais. Durante este período, especialmente em estágios iniciais, ocorrem interações complexas entre genes e fatores ambientais durante a diferenciação das células e evolução dos tecidos [Balasundaram and Avulakunta,2022]. Estas interações desempenham um papel importante não apenas no comportamento humano, mas também na suscetibilidade a doenças. Assim, o reconhecimento precoce de falhas no crescimento pode evitar o risco de distúrbios fetais e doenças em adulto. Nas últimas décadas, medidas fetais e neonatais têm sido utilizadas para avaliar o desenvolvimento do feto. Recentemente, tem-se verificado um interesse crescente na avaliação dos parâmetros biométricos da placenta e a sua relação com o resultado obstétrico [Siskovicova et al.,2023,Njeze et al.,2020, Mohamed et al.,2022,Nogueira et al.,2019]. A placenta é um órgão altamente complexo e importante para manter e continuar uma gravidez saudável, pois transfere e troca oxigénio e nutrientes necessários para o feto [Burton and Jauniaux,2015]. À medida que o feto cresce, ocorrem muitas mudanças na 1
forma e função da placenta que refletem as necessidades do feto em diferentes estágios de crescimento [Asgharnia et al.,2008]. Qualquer distúrbio na normal sequência do desenvolvimento e crescimento pode levar a discrepâncias dos aspetos placentares e fetais, por isso, a sua monitorização é vital [Cardoso, 2020]. Existem evidências que sugerem que a forma e o tamanho da placenta são fatores que podem estar estatisticamente associados a complicações na gravidez, como, por exemplo, restrições no crescimento fetal, redução dos movimentos fetais e saúde a longo prazo do indivíduo [Ashwal et al.,2022,Vişan et al., 2020,Almog et al.,2011,Barker et al.,2011,Eriksson et al.,2011,Cardoso,2020]. Quando os parâmetros biométricos da placenta são adequadamente estudados podem ser muito úteis na resolução de vários casos de mortalidade perinatal e doenças neonatais. Assim, atualmente, têm existido inúmeras solicitações de estudos patológicos placentares e a sua compreensão tem sido muito importante para perceber e expandir a utilidade dos exames à placenta [Akhavan et al.,2022,Loverro et al.,2022]. Sabe-se que o diâmetro placentar (D1 ou D2), espessura placentar (EP), peso placentar (PP) e peso fetal (PF) são parâmetros importantes na avaliação da função da placenta e do crescimento fetal [Cardoso,2020,Hayward et al.,2016]. Portanto, avanços na compreensão destes parâmetros em função da idade-gestacional (IG) poderá ter um grande impacto na recognição precoce de distúrbios fetais. No entanto, o relativo desinteresse pelo estudo da placenta quando comparado ao estudo fetal é responsável pela existência de uma grande lacuna na compreensão do significado biológico das lesões placentárias relacionadas ao contexto perinatal e neonatal [Nogueira et al.,2019]. Portugal é um exemplo onde a patologia placentária continua a ser uma subespecialidade da patologia cirúrgica subvalorizada, ineficazmente manuseada e não partilhada clinicamente [Cardoso,2020]. Nesse sentido, surgiu a necessidade de investigar e produzir ferramentas que permitam a elaboração de um diagnóstico dos parâmetros biométricos da placenta. Para tal, são utilizados modelos de curvas de crescimento que conseguem descrever mudanças, como o peso e diâmetro da placenta, ao longo do tempo (IG), permitindo que a informação seja combinada em alguns (geralmente 3 ou 4) parâmetros com interpretação biológica [Vitezica et al.,2010]. As curvas de percentis do peso ao nascer (PN) são amplamente conhecidas e utilizadas na prática clínica para monitorizar o crescimento fetal e classificar o risco de algumas condições fetais [Deter et al., 1986]. Porém, estudos referentes às curvas de percentis direcionadas para dados placentares como o PP,D1,D2 eEP são muito raros. Os estudos acerca das curvas de percentis fetais e placentares maioritariamente referem-se a uma IG superior a 24 semanas e algumas dessas informações podem já estar desatualizadas [Nogueira et al.,2019]. Desse modo, o estudo e atualização da informação relacionada com estas curvas de crescimento é importante para evitar riscos durante a gravidez. Embora seja ne2
cessário existir evidências adicionais, as curvas de percentis são pertinentes para o acompanhamento do crescimento fetal e a sua otimização e compreensão pode permitir uma intervenção prematura em contextos adversos fetais. Modelos de regressão não linear são amplamente utilizados no contexto da modelação das curvas de crescimento devido à sua robustez em comparação com modelos de regressão linear. Vários investigadores conduziram comparações de modelos não lineares para ajustar efetivamente uma ampla gama de curvas de crescimento [Borghi et al.,2006,Numan et al.,2021]. A vantagem destas técnicas está na capacidade de combinar medidas longitudinais em poucos parâmetros facilmente interpretáveis, simplificando a análise [Vitezica et al.,2010]. A regressão quantílica Koenker [2005] é uma abordagem popular para ajustar curvas de crescimento e tem sido aplicada em estudos sobre parâmetros placentares, como o trabalho realizado por Alves et al. [2022]. Este método não paramétrico permite ajustar diferentes percentis da distribuição, em vez de se concentrar apenas na média, como na regressão padrão [Waldmann,2018]. No entanto, uma limitação dessa metodologia é que o processo de estimação pode resultar em cruzamento das curvas de percentis, uma vez que as estimativas para cada percentil são determinadas de forma independente [Borghi et al.,2006]. Várias tentativas foram feitas na literatura para abordar este problema, mas essas abordagens frequentemente requerem esforços adicionais e podem não ser adequadas com base no problema específico que está a ser abordado. Além disso, as curvas de percentis estimadas nas caudas da distribuição de dados podem manifestar uma instabilidade substancial, tornando a sua interpretação complexa e compromete a sua confiabilidade [Nakamura et al.,2022]. Neste estudo, foram utilizados modelos de regressão semiparamétrica dentro da estrutura dos modelos aditivos generalizados para localização, escala e forma (GAMLSS), conforme proposto por Rigby and Stasinopoulos [2005], para ajustar com precisão as curvas de crescimento de referência para vários parâmetros como D1,D2,EP,PP, e PF. Os dados para construir e testar os modelos gerados foram recolhidos no Laboratório de Patologia Embrionária Fetal do Centro de Genética Clínica (CGC) no Porto. Estes envolvem a população de parturientes portuguesas de diferentes regiões. Esta investigação oferece contribuições significativas para o estudo da análise de parâmetros placentares e modelação de curvas de crescimento. Destaca a importância dos parâmetros biométricos da placenta nos resultados obstétricos e na saúde fetal. Além disso, introduz a aplicação da estrutura GAMLSS e métodos LMS para a estimação precisa e flexível de curvas de crescimento de percentis para parâmetros placentares. Os resultados esclarecem a estabilidade dessas curvas, particularmente 3
nas extremidades da distribuição de dados, proporcionando informações valiosas para a avaliação clínica e aprimoramento dos resultados na gravidez. Portanto, a motivação central deste trabalho, foi a preocupação com a melhoria dos diagnósticos de reconhecimento precoce de distúrbios fetais. Nessa sequência, na presente dissertação, serão implementadas curvas de crescimento que poderão ser úteis de diversas formas e promover avanços no acompanhamento placentar e fetal, esclarecendo a avaliação da função da placenta e cuidados perinatais. Por conseguinte, este estudo poderá fornecer de alguma forma alívio psicossocial às famílias e contribuir para um aumento do sucesso perinatal e taxa de natalidade. Assim, face às ferramentas disponíveis e aos dados recolhidos pelo CGC, de parturientes portuguesas de diferentes regiões, pretende-se desenvolver uma aplicação web , acessível aos profissionais de saúde, que permita compreender e prevenir possíveis problemas fetais. 1.2 Objetivos O principal objetivo desta dissertação passa por estudar a aplicabilidade de modelos de regressão não linear em curvas de crescimento de parâmetros biométricos placentares. Tendo como finalidade, o desenvolvimento de uma aplicação web que poderá auxiliar os profissionais de saúde no diagnóstico precoce de complicações fetais. Com base neste pressuposto, também se tem o objetivo secundário de responder à seguinte questão: “Podemos determinar a evolução do feto e prevenir complicações futuras através da evolução dos parâmetros placentares?”. Mais especificamente, este trabalho abordará os seguintes objetivos científicos e tecnológicos: • Realizar uma revisão abrangente do estado da arte na área de curvas de crescimento e a sua aplicação em parâmetros placentares; • Adquirir conhecimento a nível da modelação utilizando técnicas de regressão não linear paramétrica, não paramétrica e semiparamétrica; • Realizar o tratamento e preparação dos dados; • Explorar os pacotes/funções existentes a nível do software R; • Aplicar as técnicas de regressão não linear aos dados para construir as curvas de crescimento dos parâmetros placentares; 4
• Desenvolver uma aplicação web interativa para disponibilizar os resultados aos profissionais de saúde; • Analisar os resultados obtidos, discutindo as suas implicações clínicas e possíveis melhorias. 1.3 Estrutura da dissertação Esta dissertação desenvolve-se ao longo de nove capítulos. No Capítulo 1 é apresentada uma introdução ao tema em estudo, destacando as principais razões que motivaram a sua investigação. Além disso, são apresentados os objetivos a alcançar e uma visão geral da estrutura desta dissertação. No Capítulo 2 é apresentado o estado da arte, onde é revista a bibliografia dos principais temas abordados ao longo desta dissertação. Começando por uma contextualização ao conceito de placenta, bem como a sua evolução histórica e estudos relacionados. Posteriormente, apresentam-se as curvas de crescimento, incluindo a sua história, as suas designações nos mais diferenciados estudos e a sua aplicação na biologia e medicina. Por último, é abordado o software R, desde a sua contextualização, designação e aplicação. No Capítulo 3 é introduzida a teoria e conceitos relacionados à regressão. Começando com uma definição abrangente de regressão e prosseguindo para a exploração da regressão linear e não linear. Além disso, é discutida as distinções entre regressão paramétrica, não paramétrica e semiparamétrica. Este capítulo cria os fundamentos necessários para a compreensão das metodologias de modelação que serão abordadas posteriormente. Este capítulo estabelece uma base para compreender as metodologias de modelação posteriores. No Capítulo 4 são abordados detalhadamente os métodos utilizados no desenvolvimento das curvas de crescimento. Começando com considerações metodológicas, discutindo aspetos distributivos e de alisamento. Em seguida, é dada uma explicação de como os métodos foram selecionados e é realizada uma revisão metodológica desses métodos. Além disso, são explorados os critérios de qualidade de ajuste, que serão utilizados na seleção de modelos. Este capítulo é fundamental para entender as metodologias de construção das curvas de crescimento. No Capítulo 5 é descrita a preparação dos dados que serviram de base para a análise e modelação das curvas de crescimento. Isso inclui a apresentação do conjunto de dados utilizado e o processo de pré-processamento, abordando a seleção de variáveis, tratamento de valores ausentes e discrepantes. No Capítulo 6 é detalhado o desenvolvimento da aplicação web “PlacentalGrowth”. É explorada 5
a estratégia de desenvolvimento, as ferramentas utilizadas e a arquitetura da aplicação. São também descritas as funções e eventos reativos que tornam a aplicação interativa e dinâmica, fornecendo aos utilizadores uma plataforma para análise das curvas de crescimento. No Capítulo 7 são apresentados os resultados obtidos ao longo desta investigação. Inclui uma análise exploratória dos dados, testes de significância entre género para os vários parâmetros placentares, como diâmetros e pesos. As curvas de crescimento desenvolvidas e, a aplicação web . No Capítulo 8 é realizada a discussão dos resultados obtidos, destacando as principais descobertas e discutindo as implicações dos resultados. Este capítulo proporciona uma visão abrangente do estudo e o seu impacto. No Capítulo 9 são resumidas as conclusões deste estudo e delineados possíveis caminhos para investigações futuras. Este capítulo encerra a dissertação, destacando a contribuição do estudo para o campo da obstetrícia e indicando como ele pode continuar a evoluir. 6
de curvas de crescimento. A Tabela 1sumariza os vários métodos que já foram utilizados/desenvolvidos na literatura. Métodos de discretização sem suposições de distribuição Entre os métodos que estimam os percentis separadamente agrupando por idades e sem suposições de distribuição, o trabalho de Hamill et al. [1977] pode ser citado como as primeiras curvas de crescimento a serem testadas. Estas foram derivadas dividindo os dados em grupos de idade de um ano, calculando sete percentis do 5.º ao 95.º em cada grupo e, em seguida, usando Splines cúbicas para alisar cada percentil ao longo da idade. Mais tarde, Gasser et al. [1984] e Guo et al. [1990] aplicaram o alisamento de núcleo em regressão a percentis empíricos. No ano de 2000, o Centro de Controlo e Prevenção de Doenças (CCD) [Kuczmarski et al.,2002] construiu curvas de crescimento utilizando um método de duas etapas. Na primeira, diversos métodos foram testados para modelar percentis empíricos em diferentes medidas de crescimento e faixas etárias. Modelação linear de 3 parâmetros foi aplicada para comprimento-para-idade, peso-para-idade e circunferência craniana-para-idade. Para altura-para-idade, um modelo não linear foi escolhido, enquanto peso-paracomprimento e peso-para-altura utilizaram um polinómio de quinto grau [Guo et al.,1992]. Em crianças acima de 24 meses, o alisamento dos percentis empíricos envolveu inicialmente uma regressão robusta ponderada localmente, seguida por uma regressão polinomial [Cleveland,1979]. Na segunda etapa, foi realizada uma aproximação a posteriori Lamda-Mu-Sigma (LMS) [Cole and Green,1992] desses percentis alisados para calcular os z-scores . Métodos de discretização com suposições de distribuição Dentro dos métodos que estimam os percentis separadamente usando o agrupamento por faixas etárias com suposições de distribuição, existiram diversos trabalhos que contribuíram para o seu desenvolvimento. Em 1965, Tanner et al. [1966] assumiram que a altura era normalmente distribuída ao longo da infância para construir as curvas. Os percentis foram estimados em conjunto e as variâncias foram ajustadas utilizando o método de Healy et al. [1962] para compensar o seu aumento devido ao agrupamento dos dados e, para alisar as curvas de percentis, foi utilizado o método Eye fitting . Já Niklasson et al. [1991], usaram o ajuste polinomial para alisamento das curvas da média e desvio padrão (DP), estimadas sob normalidade ou suposição de normalidade. A transformação de potência Box-Cox [Box and Cox,1964] foi a base para alguns métodos propostos para a construção de referências de crescimento, dada a sua capacidade de “normalizar” os dados num 13
grau razoável em termos de assimetria. Cole [1988] propôs a primeira versão do método LMS usando agrupamento de idade. No seu método, os λda Box-Cox foram estimados pela máxima verosimilhança (MV) e a variação específica da idade da distribuição foi expressa pelo coeficiente de variação, permitindo assim caracterizar qualquer curva de percentis e calcular facilmente os z-scores . Idade tratada continuamente, sem suposições de distribuição Koenker and Bassett [1978] estimaram os percentis separadamente considerando a idade como uma variável contínua e introduzindo o conceito de quantis de regressão, onde a curva α-quantil era a função linear. O seu método minimizou uma soma ponderada de resíduos positivos com peso α, e os resíduos negativos foram tornados positivos e ponderados por (1 - α). Outros métodos baseados nos quantis de regressão foram propostos [Ducharme et al.,1995,Wellek and Merz,1995], mas estimando os percentis em conjunto. Para os percentis estimados em conjunto, existem vários trabalhos em termos de métodos não paramétricos. O método Healy-Rasbash-Yang (HRY) de Healy et al. [1988] estimou cada percentil como uma curva aproximada e alisou cada percentil utilizando uma função polinomial, no entanto, isto constituiu uma fraqueza do método, pois é inflexível. Pan et al. [1990] conseguiu ultrapassar esta dificuldade utilizando polinómios grafted . Mais tarde, Heagerty and Pepe [1999] propuseram uma versão restrita dos quantis de regressão que eliminou o problema do cruzamento de quantis (por exemplo, percentil) que surge ao modelar vários quantis simultaneamente. O cruzamento de quantis acontece quando ocorre uma falha da função quantílica condicional estimada em obedecer à restrição de monotonicidade necessária [Park et al.,2021]. Idade tratada continuamente, com suposições de distribuição Para os percentis estimados em conjunto e para os quais a normalidade é assumida e a idade é tratada como uma variável contínua, o trabalho de Aitkin [1987] pode ser destacado. Ele estimou a média com um modelo de regressão linear e a variância residual sobre a média com um modelo log-linear, usando a estimativa de MV.Royston and Wright [1998] propuseram uma classe mais flexível de funções composta por polinómios fracionários de baixa ordem para cada um dos parâmetros de uma distribuição móduloexponencial-normal (MEN). Já Rigby and Stasinopoulos [2000] propuseram o uso da subclasse de modelos aditivos de média e dispersão (MADAM) para modelar a média e a variância (ou log-variância), incluindo funções paramétricas ou não paramétricas alisadas da idade para a construção de percentis relacionados à idade. Tango 14
[1998] propôs uma regressão não paramétrica baseada no procedimento de aditividade e estabilização da variância (AVAS), mas, em última análise, usando a suposição normal para construir os percentis. Quando o uso da distribuição Normal deixou de ser tão usual, o uso de famílias de distribuições mais flexíveis para a construção de curvas de crescimento começou a ser investigado. Cole and Green [1992] estenderam o método LMS de Cole [1988] que se ajusta à assimetria, para permitir que os dados possam ser analisados continuamente. Wade and Ades [1994] desenvolveram um método semelhante para ajustar percentis com tendências de idade na transformação Box-Cox , e a média e as funções de DP foram especificadas por funções paramétricas exponenciais. Sorribas et al. [2000] propuseram um método paramétrico baseado na distribuição-S para construir curvas de percentis alisadas ao longo das idades. Thompson and Theron [1990] produziram percentis com base na família Johnson de distribuições de 4 parâmetros que especificam localização, escala e dois parâmetros de forma. Eles modelaram os parâmetros de localização e escala utilizando polinómios na idade e os parâmetros de forma como constantes e ajustaram o modelo por MV.Royston and Wright [1998] também propuseram um método completamente paramétrico, o método de polinómios fracionários e transformação exponencial (FPET). Rigby and Stasinopoulos [2005] propuseram uma classe de modelos estatísticos univariados — modelos aditivos generalizados para a localização, escala e forma (GAMLSS) — que podem ser aplicados a dados que apresentam distribuições assimétricas e/ou com curtose contínua, ou discreta. Eles propuseram também o método LMS com distribuição Box–Cox t (LMST) de estimativa de percentis para uma variável de resposta exibindo assimetria e curtose maior do que 3, baseado na distribuição Box–Cox t (BCT). Para ultrapassar a limitação da BCT causada pelo fato de apenas lidar com dados com leptocurtose, Rigby and Stasinopoulos [2004b] desenvolveram uma distribuição mais flexível, a distribuição Box-Cox-power-exponential (BCPE), que consegue modelar qualquer tipo de curtose. Esta generalização do método LMS ficou conhecida como método LMSP. Ambos os métodos LMST eLMSP fornecem modelos altamente flexíveis para localização, escala, assimetria e curtose da variável de resposta usando o GAMLSS [Borghi et al.,2006]. Cada um dos quatro parâmetros podem ser modelados usando funções paramétricas (por exemplo, polinómio fracionário) ou não paramétricas (por exemplo, Splines cúbicas) da variável explicativa, por exemplo, a idade. O ajuste do modelo é obtido pela MV (penalizada). Desse modo, é fornecida uma fórmula simples para calcular percentis e z-scores . Covariáveis ou fatores adicionais podem também ser incluídos no modelo, se necessário, permitindo ajustes nos parâmetros, especialmente µ, para outras variáveis explicativas (por exemplo, sexo, altura dos pais, etc.) [Borghi et al.,2006]. 15
Métodos que incorporam correlações Existe pouco desenvolvimento no sentido de ajustar curvas de crescimento com medidas correlacionadas, pois a maioria dos métodos existentes é baseada em gráficos transversais [Borghi et al.,2006]. Modelos de efeito misto podem ser usados para modelar as curvas de crescimento, pois permitem o particionamento da variância para a contribuição da variabilidade [Borghi et al.,2006]. Laird and Ware [1982] no seu trabalho, abordam modelos de efeitos aleatórios de dois estágios para o crescimento e as estimativas empíricas de Bayes de parâmetros num modelo específico. Este método assume que os dados são normalmente distribuídos e que a inferência baseada em dados não normais deve ser feita somente após uma transformação de normalização. Goldstein [1986] propôs o uso de modelos multiníveis para resolver problemas longitudinais, incluindo os apresentados por estudos de crescimento. A classe de modelos de efeito misto ou modelos de efeito aleatório permite estruturas complexas de covariância e também para variáveis explicativas que dependem da idade. Já Wade and Ades [1998] propuseram um método de MV baseado em LMS para as curvas de crescimento relacionadas à idade que incorporam modelação explícita de correlações. Foram comparadas cinco estruturas de correlação diferentes combinadas com cinco modelos para a mediana, e o método de “verosimilhança de perfil” [Matthews,1988] foi usado para a construção de intervalos de confiança com um algoritmo iterativo [Borghi et al.,2006]. Apesar da presença de uma forte estrutura de correlação, os resultados mostraram que a incorporação de uma estrutura de correlação na função de verosimilhança teve pouco efeito na escolha do modelo para a curva média ou nos percentis ajustados. Além disso, a precisão com que os percentis foram estimados não foi afetada em nenhum grau clinicamente importante quando as correlações foram incorporadas. Visão geral dos métodos utilizados nas curvas de crescimento Tal como foi descrito na Subsecção 2.2.1, existem vários métodos para construir os gráficos de crescimento dependentes da idade. Os percentis empíricos com idade categorizada fornecem uma aproximação discreta para os percentis populacionais [Chen and Morgan,2005]. No entanto, as curvas de percentis contínuas são mais precisas e atraentes. Os primeiros métodos começaram por ajustar curvas alisadas em quantis de amostra de grupos de idade segmentados. Porém, estes métodos não são robustos a valores discrepantes. É preciso uma dimensão grande de amostra para estimar os percentis em cada faixa etária com precisão adequada e a segmentação pode perder informações de grupos próximos [Chen and Morgan,2005]. 16
Tabela 1: Métodos para a construção de curvas de crescimento. Adaptado de: Borghi et al. [2006]. Método Estimação percentis Método de ajuste da curva Suposições de distribuição Métodos de discretização sem suposições de distribuição knot splines fixas [Hamill et al.,1977] Separadamente knot splines fixas * Nenhuma Eye fitting (peso/idade) [Roede,1985] Separadamente Eye fitting * Nenhuma Regressão de núcleo [Gasser et al.,1984], [Guo et al.,1990] Separadamente Estimação de núcleo * Nenhuma CCD (Passo 1 e 2) [Kuczmarski et al.,2002] Separadamente Linear de 3 parâmetros * Nenhuma Juntamente Splines cúbicas * Box–Cox normal Métodos de discretização com suposições de distribuição Eye fitting (peso/idade) [Tanner et al.,1966] Juntamente Eye fitting † Normal Normalização Box–Cox [Van’t Hof et al.,1985] Juntamente Eye fitting † Box–Cox normal LMS, versão 1 [Cole,1988] Juntamente Splines cúbicas ou outros † Box–Cox normal Estabilização variância (altura/idade) [Chinn,1992] Juntamente Polinômios † Normal Ajuste polinomial [Niklasson et al.,1991] Juntamente Polinômios † Normal Idade tratada continuamente, sem suposições de distribuição Regressão quantílica [Koenker and Bassett,1978] Separadamente Regressão quantílica * Nenhuma HRY [Healy et al.,1988] Juntamente Polinómios * Nenhuma HRY adaptado [Pan et al.,1990] Juntamente Polinómios grafted * Nenhuma Estimativa da densidade do núcleo [Rossiter,1991] Juntamente Estimativa da densidade do núcleo ‡ Nenhuma Curvas de quantis não gaussianas [Ducharme et al.,1995] Juntamente Densidade do núcleo do vizinho mais próximo de cdf condicional ‡ Nenhuma Continuação da tabela na próxima página 17
Tabela 1: Continuação da tabela da página anterior. Método Estimação percentis Método de ajuste da curva Suposições de distribuição Curvas de quantis não gaussianas [Wellek and Merz,1995] Juntamente Função monotónica de 4 parâmetros (média) e linear (dispersão) † Nenhuma Quantis de regressão [Heagerty and Pepe,1999] Juntamente Splines naturais † Nenhuma Idade tratada continuamente, com suposições de distribuição Modelos multiníveis [Goldstein,1986] Juntamente Estimativa de ML de modelos lineares e não lineares † Normal Aitkin [Aitkin,1987] Juntamente Modelos lineares † Normal Thompson e Theron [Thompson and Theron,1990] Juntamente Polinômios † Sistema Johnson LMS, versão 2 [Cole and Green,1992] Juntamente Splines cúbicos † Box-Cox normal Wade e Ades [Wade and Ades,1994] Juntamente Funções exponenciais † Box-Cox normal Wade e Ades (correlações) [Wade and Ades,1998] Juntamente ML exponencial; polinomial † Box-Cox normal FPET [Royston and Wright,1998] Juntamente Polinómios fracionários † (Módulo)-exponencial-normal AVAS [Tango,1998] Juntamente Regressão não paramétrica AVAS † Normal MADAM [Rigby and Stasinopoulos,2000] Juntamente Funções paramétricas ou não paramétricas (MADAM) † Normal Distribuição S [Sorribas et al.,2000] Juntamente Polinômios † Distribuição S GAMLSS [Rigby and Stasinopoulos,2005] Juntamente Linear paramétrico ou aditivo não paramétrico † Vários LMST [Rigby and Stasinopoulos,2004a] Juntamente Splines cúbicas ou polinômios (fracionários) † BCT LMSP [Rigby and Stasinopoulos,2004b] Juntamente Splines cúbicas ou polinômios (fracionários) † BCPE * Aplicado aos percentis. † Aplicado a parâmetros distributivos. ‡ Percentis calculados a partir do ajuste da densidade. 18
Para evitar a segmentação, Cole and Green [1992] desenvolveram uma abordagem semiparamétrica baseada na transformação Box-Cox a partir do método LMS que resolve equações de verosimilhança penalizadas. Devido à falta de expectativa finita para algumas das derivadas da log-verosimilhança penalizada, as soluções destas equações podem ser sensíveis a um ponto inicial [Chen and Morgan,2005]. Existe também a questão de saber se a transformação Box-Cox é boa o suficiente para a suposição de distribuição especificada, por exemplo, a normalidade [Chen and Morgan,2005]. Por isso, foi criada uma forma alternativa para contornar esta situação, a regressão quantílica, um método não paramétrico. Este método não coloca nenhuma suposição de distribuição de antemão e também é relativamente fácil acomodar outras covariáveis além da idade [Chen and Morgan,2005]. Ajusta diferentes quantis de distribuição em vez de apenas a média como na regressão não linear padrão [Nakamura et al.,2022]. No entanto, também apresenta desvantagens, nomeadamente no processo de estimação que pode resultar num cruzamento das curvas de percentis, uma vez que as estimativas para cada percentil são determinadas de forma independente. Para superar esse desafio, foram desenvolvidos modelos de regressão semiparamétrica, como os GAMLSS, que permitem a estimação precisa de curvas de crescimento para parâmetros placentares e podem ser aplicados a dados que apresentam distribuições assimétricas e/ou com curtose. Como tal, este método apresenta-se como uma boa sugestão de ajustamento para as curvas de crescimento. 2.2.2 Regressão não linear Os gráficos de crescimento podem ter problemas associados, principalmente se forem construídos com base na suposição que as medidas são normalmente distribuídas. Esta suposição pode levar a erros, pois os dados utilizados nas curvas de crescimento geralmente não são normalmente distribuídos. De forma a resolver este contratempo são utilizados modelos de regressão não linear para ajustar as curvas de crescimento, pois a regressão permite quantificar a relação entre uma variável de resposta e algumas covariáveis [Yu et al.,2003]. A análise de dados de crescimento longitudinal requer metodologias estatísticas específicas que envolvem o ajuste de modelos não lineares aos parâmetros [Anchieta et al.,2003]. Ajustar curvas de crescimento a dados longitudinais envolve a descrição e o resumo do processo de crescimento com um número limitado de parâmetros. Esses parâmetros caracterizam o padrão de crescimento e têm o mesmo significado para todos os indivíduos, permitindo comparações entre indivíduos e grupos [Anchieta et al., 2003]. Por isso, é importante obter modelos matemáticos representativos do comportamento dos dados de crescimento. 19
2.2.3 Definição e características gerais das curvas de crescimento O crescimento pode ser definido como o processo pelo qual os indivíduos mudam de tamanho e forma durante um determinado período. O seu estudo é realizado a partir de medições sequenciais no mesmo indivíduo em intervalos regulares e usando dados em série para estabelecer padrões comportamentais [Anchieta et al.,2003]. Um problema atual que pode ser atenuado pelo estudo do crescimento, são as taxas de mortalidade perinatal. Estas taxas são particularmente altas nas grandes populações de países de rendimento médio e baixo, onde ocorrem 98% das mortes neonatais do mundo, razão pela qual existem esforços internacionais para disponibilizar a tecnologia de ultrassom para essas sociedades [Kiserud et al.,2018]. É de grande importância frisar também que os intervalos de referência atualmente disponíveis para a biometria ultrassonográfica fetal são derivados na maioria de populações únicas em sociedades industrializadas com aplicabilidade incerta num mundo de variação étnica [Kiserud et al.,2018]. Demonstrando assim, a necessidade da existência de gráficos de crescimento fetal e infantil para uso internacional. Se para além desses gráficos fosse possível desenvolver uma referência com parâmetros biométricos placentares, estas taxas de mortalidade perinatal poderiam ser ainda mais reduzidas e seria possível detetar complicações precoces na gravidez e evitar vários problemas futuramente. No sentido de auxiliar a visualização do crescimento de uma forma simples e intuitiva, são utilizadas curvas de crescimento. As curvas de crescimento são um método estatístico frequentemente usado na análise de dados em que as mesmas unidades experimentais são observadas ao longo do tempo [Kshirsagar and Smith,1995]. São uma ferramenta gráfica poderosa e no caso da descrição do desenvolvimento infantil, conseguem exibir o tamanho da criança numa série de idades e, em simultâneo, a sua taxa de crescimento ou velocidade de crescimento ao longo do tempo, com base na inclinação da curva [Cole, 2012]. Portanto, as curvas de crescimento são usadas para avaliar o bem-estar e tomar decisões sobre intervenções em indivíduos, em termos de estratégias de alimentação e práticas de cuidados com a saúde, por exemplo [Lampl,2012]. Desde o seu primeiro surgimento no século XVIII, o uso de gráficos do crescimento expandiu-se para incluir a exibição do padrão de crescimento de grupos de crianças, bem como indivíduos, e o gráfico tornouse uma ferramenta importante na triagem de saúde infantil e avaliação clínica pediátrica [Cole,2012]. Estes gráficos têm sido tradicionalmente usados para fornecer um ponto de referência para responder à questão de quão bem uma criança individual está a “crescer” por inferência da sua posição no resumo estatístico [Lampl,2012]. Como qualquer equipamento médico, o seu uso tem limitações que devem ser bem compreendidas. 20
O conhecimento de como os gráficos de crescimento são construídos pode ajudar na compreensão de quais perguntas eles podem ou não responder e a sua interpretação geralmente requer uma comparação entre diferentes medidas simultâneas ou sucessivas ao longo do tempo [Wright,2002]. É importante ter em consideração que os gráficos de crescimento não podem fazer um diagnóstico, mas podem fornecer pistas importantes, bem como garantias vitais. O gráfico de crescimento europeu, consiste em 7 linhas de percentis (3, 10, 25, 50, 75, 90, 97) [Cole,1994]. Cada linha no percentil n marca o peso ou altura abaixo do qual n% das crianças dessa idade e género caem (por exemplo, 25% das crianças estão abaixo ou no 25.º percentil) [Wright,2002]. O percentil 50 representa a mediana da população, enquanto os percentis 3 e 97 são, respetivamente, dois DP acima e abaixo da mediana [Wright,2002]. A distância entre cada linha de percentil (2/3 de um DP) é conhecida como espaço percentil. O percentil mais baixo, o 3, foi escolhido para identificar medidas extremamente baixas. Dessa forma, os gráficos de percentis apenas permitem dizer onde cada medida coloca uma criança relativamente a outras crianças na mesma idade. Estes são descritos como sendo “transversais”, pois são construídos usando diferentes crianças em cada idade de medição e são, na verdade, uma série de distribuições normais unidas por linhas, como podemos observar na Figura 3[Wright,2002]. Assim, embora muitas vezes chamadas “curvas de crescimento”, as linhas não descrevem o crescimento ao longo do tempo em indivíduos, pois a base em que se baseiam, não fornece uma compreensão do processo dinâmico pelo qual o crescimento realmente ocorre ou a biologia do crescimento [Lampl,2012]. Apesar de existir uma grande aplicação das curvas de crescimento em várias áreas, o pressuposto da sua interpretação é igual. Ou seja, a leitura dos vários percentis nas curvas é analisada da mesma forma, quer seja do peso infantil ao longo da sua idade, como foi esclarecido anteriormente, ou do peso placentar ao longo da IG, ou qualquer outro parâmetro. 2.2.4 Aplicação de curvas de crescimento em várias áreas Ao longo dos anos, uma ampla aplicação das curvas de crescimento nos mais diversos campos das ciências sociais e da vida tem ocorrido. Na literatura podem ser encontrados vários estudos que relacionam o conceito das curvas de crescimento aplicado a diversas áreas da biologia e da medicina [Thompson et al., 2007,Nogueira et al.,2019,Almog et al.,2011,Anchieta et al.,2003,Kiserud et al.,2018,Kaplan and Gürcan,2018,Nakamura et al.,2022]. Demonstrando assim, a atualidade deste método e a existência de uma grande evidência científica. 21
Figura 3: Gráfico de crescimento. Representa uma série de distribuições normais em idades diferentes com linhas conectando a mediana (50.º percentil) e outros percentis. Adaptado de: Wright [2002]. Começando pela temática abordada nesta dissertação, aplicação de curvas de crescimento para parâmetros placentares, Thompson et al. [2007] foram os primeiros a produzir curvas de percentis de referência da população norueguesa para o PP e a percecionar a razão entre o PN e o PP. Estatisticamente, medianas, quartis inferiores, quartis superiores e intervalos interquartis foram calculados para cada semana gestacional completa. De forma a obter a normalidade para as faixas etárias e ser possível construir as curvas de percentis, foi utilizado o método LMS de Cole and Green [1992]. Para permitir a natureza cúbica geral dos percentis placentares, os modelos foram ajustados aos pontos percentuais que incluíam um termo linear, um quadrado e um cúbico. Todos os termos do modelo foram estatisticamente significativos (P < 0,0001). A natureza das curvas de razão levou à inclusão de um termo linear e um quadrado e os termos do modelo ajustaram-se bem às curvas. Em outro estudo dentro da mesma temática Nogueira et al. [2019], conseguiram produzir valores de referência para o PP,PF,R-PP eR-PPN em gestações unifetais em função da IG. Com estes valores foram produzidas tabelas e curvas de percentis dos parâmetros placentares para a população portuguesa e foi possível concluir que as curvas podem servir de referência também para outras populações. Que os diâmetros da placenta podem prever o volume placentar e podem ajudar a estimar o R-PP e o RPPN pré-natal. E que existe uma associação significativa entre as medidas da placenta e a avaliação da função placentar (relacionada ao tamanho e volume) e a sua implicação no crescimento fetal, auxiliando os médicos na prevenção de riscos à vida fetal e melhorando a saúde materno-infantil. Quanto ao método estatístico para a criação das curvas de crescimento, foram utilizados métodos de regressão linear estatisticamente significativos (P < 0,0001). Já Almog et al. [2011] estabeleceram curvas de percentis com parâmetros placentares utilizando 22
permite determinar se o modelo é linear ou não linear. A escolha entre a regressão linear e a não linear é um ponto crucial na modelação estatística, pois irá determinar o quão bem o modelo se irá ajustar aos dados e o quão preciso este será a capturar as relações entre as variáveis. Ambas as abordagens têm as suas aplicações e limitações, e a decisão irá depender essencialmente da natureza dos dados. 3.2 Regressão linear A regressão linear é um modelo estatístico fundamental e amplamente utilizado pela comunidade científica durante grande parte do último século devido à sua simplicidade e facilidade de interpretação [WU and QIU,2021b]. Este modelo é uma ferramenta valiosa para compreender e quantificar a relação entre uma variável resposta e um conjunto de covariáveis, mesmo que essa relação possa não capturar exatamente a complexidade subjacente. Supondo existir p+1 variáveis, representadas como (y, x1, x2, . . . , xp), onde a variável yé selecionada como a resposta, enquanto as demais variáveis são tratadas como preditoras ou covariáveis [WU and QIU,2021b]. Se se considerar um conjunto de dados de dimensão n, pode-se denotar como (yi, xi1, xi2, . . . , xip), i = 1,2, . . . , n. Um modelo de regressão linear está expresso na Equação 3.1 [WU and QIU,2021b]. yi=β0+β1xi1+. . . +βpxip +εi=xT iβ+εi, i = 1,2, . . . , n ou E(yi) = xT iβ, (3.1) Aqui, yié a resposta para o indivíduo i,βé o vetor dos parâmetros desconhecidos, xij representa o j-ésimo preditor para o indivíduo i,xi= (1, xi1, . . . , xip)Té uma matriz de todos os preditores, β= (β0, . . . , βp)Té um vetor de parâmetros de regressão, e εisão erros aleatórios com média zero, i= 1,2, . . . , n [WU and QIU,2021b]. No modelo linear (Equação 3.1), pressupõe-se que a relação entre a resposta e os preditores é linear. Essa linearidade permite interpretar os parâmetros de regressão βj, como o efeito do preditor xina resposta y, ou seja, uma mudança de uma unidade em xiestá associada a uma mudança de βjunidades em y[WU and QIU,2021b]. Além disso, essa forma linear possibilita derivar a distribuição de ycom base na distribuição assumida para εe estudar as propriedades das estimativas dos parâmetros [WU and QIU, 2021b]. Na prática, a suposição de uma relação linear pode ser razoável e útil, especialmente quando alguns preditores são transformados. 29
3.3 Regressão não linear Os modelos de regressão linear têm sido amplamente adotados devido à sua simplicidade, o que representou uma vantagem significativa numa época anterior à disponibilidade de computadores modernos. No entanto, é importante notar que estes modelos frequentemente limitam-se a fornecer uma descrição dos dados observados, sem necessariamente procurar uma compreensão mais profunda dos processos subjacentes que geraram esses dados. Em essência, os modelos lineares tendem a enfatizar o ajuste aos dados observados. Em contrapartida, os modelos de regressão não linear têm como objetivo principal a compreensão dos processos subjacentes à geração dos dados. Eles oferecem várias vantagens relativamente aos modelos lineares. Em primeiro lugar, estes modelos podem fornecer previsões mais precisas quando extrapoladas para fora do intervalo dos dados observados. Em segundo lugar, os parâmetros em modelos não lineares frequentemente têm interpretações físicas naturais, tornando mais acessível a compreensão dos resultados. Terceiro, modelos não lineares podem ser mais parcimoniosos em termos de parâmetros, ou seja, requerem menos parâmetros para se ajustarem eficazmente aos dados. Porém, é crucial destacar que em muitas situações práticas, os mecanismos subjacentes à geração dos dados permanecem desconhecidos. Nestes casos, os modelos lineares podem ser uma escolha mais apropriada, uma vez que se concentram na descrição direta dos dados observados, evitando suposições substanciais sobre a natureza do processo gerador. É importante notar que, ao contrário dos modelos lineares, os modelos não lineares geralmente não possuem soluções analíticas diretas para a estimativa de parâmetros. Portanto, a obtenção de estimativas de parâmetros em modelos não lineares geralmente requer o uso de algoritmos iterativos [WU and QIU, 2021b]. Além disso, ao ajustar modelos não lineares, a escolha de valores iniciais adequados para os algoritmos iterativos desempenha um papel crucial, pois algumas funções de verosimilhança podem apresentar múltiplos modos, tornando o processo de otimização desafiador [WU and QIU,2021b]. Seja yia resposta e xi=(xi1, . . . , xip)Tos preditores para o indivíduo i, onde i= 1,2, . . . , n. Um modelo geral de regressão não linear pode ser expresso como na Equação 3.2 [WU and QIU,2021b]. yi=h(xi,β) + εi, i = 1,2, . . . , n (3.2) Nesta equação, hé uma função não linear conhecida, βé um vetor de parâmetros de regressão e εi é o erro aleatório. As suposições para um modelo de regressão não linear padrão são as mesmas de um modelo linear padrão, ou seja, (i) os erros εisão independentes, (ii) os erros εitêm média zero e 30
variância constante σ2, e (iii) os erros εisão normalmente distribuídos [WU and QIU,2021b]. A inferência estatística para um modelo de regressão não linear pode ser baseada no método dos mínimos quadrados ou no método da verosimilhança. O estimador dos mínimos quadrados ordinários para o parâmetro βenvolve a minimização da soma dos quadrados n ∑ i=1 (yi−g(xi,β))2. Isso pode ser alcançado resolvendo a seguinte Equação 3.3 de estimação [WU and QIU,2021b]. n ∑ i=1 ∂g (xi,β) ∂β[yi−g(xi,β)] = 0 (3.3) Um algoritmo iterativo, como o método de Newton-Raphson, é frequentemente necessário para resolver a equação acima. Alternativamente, sob a suposição de normalidade para os erros, ou seja, por exemplo, εii.i.d. ∼ N(0, σ2), a Estimação de Máxima Verosimilhança (EMV) de βpode ser obtida maximizando a função de verosimilhança como na Equação 3.4 [WU and QIU,2021b]. L(β, σ2|y)= n ∏ i=1 1 √2πσ2exp [−(yi−g(xi,β))2 2σ2].(3.4) Portanto, a EMV de βsatisfaz a equação 3.5 de verosimilhança [WU and QIU,2021b]. ∂log L(β, σ2|y) ∂β= 0,(3.5) Para modelos de regressão não linear, o estimador dos mínimos quadrados ordinários de βtambém é o mesmo que o EMV de β, e a estimação para um modelo de regressão não linear é análoga à de um modelo de regressão linear [WU and QIU,2021b]. Para modelos de regressão não linear, não estão disponíveis expressões analíticas ou de formato fechado para estimativas de parâmetros. No entanto, a inferência estatística ainda pode ser realizada com base nos resultados assintóticos padrão dos métodos de verosimilhança sob as condições de regularidade usuais [WU and QIU,2021b]. Ou seja, sob algumas condições de regularidade, as EMV dos parâmetros do modelo são consistentes, assintoticamente normais e assintoticamente mais eficientes. Intervalos de confiança e testes de hipóteses podem ser baseados na normalidade assintótica das EMV. Portanto, com a disponibilidade de computadores e software modernos, a inferência estatística para modelos não lineares não oferece mais dificuldades do que para modelos lineares. 31
3.4 Regressão paramétrica, semi e não paramétrica Para distinguir entre os três tipos de modelos de regressão, considere-se um cenário onde existe uma variável de resposta denotada como Y, com duas variáveis explicativas, x1ex2[Mahmoud,2019]. Podese expressar o modelo de regressão que elucida a associação entre a variável resposta e essas duas variáveis explicativas da seguinte forma [Mahmoud,2019]: Y=f1(x1, β1) + f2(x2, β2) + ε(3.6) Aqui, β1eβ2representam parâmetros que precisam de ser estimados, εum termo de erro aleatório ef1(·)ef2(·)são funções que delineiam as relações. 3.4.1 Regressão paramétrica Os modelos de regressão paramétricos são caracterizados por um vetor de parâmetros (β) de dimensão finita p, uma forma funcional pré-definida (f(·)), e uma distribuição predefinida para ε[Mahmoud,2019]. O objetivo principal da sua utilização passa por estimar o vetor de parâmetros. Estes modelos são apropriados quando há um conhecimento prévio sobre a relação entre as variáveis, uma vez que eles impõem uma estrutura rígida e bem definida. No entanto, essa simplicidade também significa que eles podem ser limitados em termos de flexibilidade. Se a forma funcional escolhida não corresponder à verdadeira relação subjacente, as previsões do modelo podem ser imprecisas. Portanto, é fundamental realizar verificações de validação, geralmente com base na análise dos resíduos, para garantir que as suposições do modelo estão corretas. Embora os modelos paramétricos sejam amplamente utilizados devido à sua interpretabilidade e simplicidade, é essencial ter em mente que a escolha da forma funcional deve ser fundamentada num entendimento da relação entre as variáveis, de modo a obter resultados confiáveis. 3.4.2 Regressão não paramétrica Os modelos de regressão não paramétricos distinguem-se fundamentalmente dos modelos paramétricos pela forma como concebem a estrutura do modelo. Ao contrário dos modelos paramétricos, nos quais a estrutura do modelo é rigidamente predefinida, os modelos não paramétricos não se vinculam a uma estrutura de modelo previamente estabelecida. Estes modelos são caracterizados por explorar um domínio onde o conjunto de parâmetros pertence 32
a um subconjunto de um espaço vetorial de dimensão infinita, e o objetivo principal é estimar esse vetor de parâmetros de dimensão infinita [Mahmoud,2019]. Nestes modelos, a relação entre as variáveis explicativas e a variável resposta permanece desconhecida. Aplicando na Equação 3.6, tanto f1quanto f2são funções desconhecidas. Estas funções podem assumir qualquer forma, seja uma relação linear ou não linear, porém são desconhecidas para quem as esteja a estudar. É o conjunto de dados que ditará a estrutura do modelo de regressão e as características das funções f1ef2[Mahmoud,2019]. Em contraste, na regressão paramétrica, a forma exata do modelo utilizado para ajustar os dados é conhecida, como, por exemplo, uma simples reta de regressão linear. Os modelos não paramétricos oferecem a liberdade de ultrapassar os limites convencionais. São a escolha predileta quando a verdadeira natureza da relação é desconhecida ou quando se deseja evitar a imposição de restrições sobre o modelo. 3.4.3 Regressão semiparamétrica Os modelos semiparamétricos encontram um equilíbrio entre as suposições rígidas dos modelos paramétricos e a flexibilidade dos modelos não paramétricos. Embora à primeira vista possam parecer semelhantes aos modelos não paramétricos, os modelos semiparamétricos possuem características distintas, concentrando-se principalmente na componente finita de β, enquanto os modelos não paramétricos concentram-se principalmente na estimativa do parâmetro de dimensão infinita [Mahmoud,2019]. Esta distinção torna frequentemente o processo de estimação nos modelos semiparamétricos estatisticamente mais acessível em comparação com os seus homólogos totalmente não paramétricos. Os modelos paramétricos, embora sejam simples e de fácil uso, tendem a simplificar excessivamente e, portanto, podem não representar adequadamente a complexidade dos dados. Os modelos semiparamétricos conseguem conciliar a interpretabilidade com a capacidade de oferecer uma representação mais fiel. Dentro do domínio dos modelos de regressão semiparamétricos, existe uma gama diversificada de estruturas. Uma é uma forma de análise de regressão em que uma parte dos preditores não assume formas predeterminadas e a outra assume formas conhecidas com a variável resposta [Mahmoud,2019]. Por exemplo, no modelo descrito na Equação 3.6,f1pode ser conhecido (suponha-se linear) e f2desconhecido. Esta situação pode ser formulada da seguinte forma [Mahmoud,2019]: Y=β0+β1x1+f(x2) + ε(3.7) Aqui, a relação entre x1e a resposta é assumida como linear, enquanto a relação entre a resposta e x2é desconhecida. 33
Em resumo, a escolha do modelo de regressão depende da complexidade da relação entre as variáveis e do nível de conhecimento prévio sobre essa relação. Os modelos paramétricos são diretos, mas dependem de suposições específicas. Os modelos não paramétricos oferecem flexibilidade, mas podem sofrer de problemas de dimensionalidade. Os modelos semiparamétricos fornecem um meio-termo, combinando as vantagens de ambas as abordagens. Logo, estes fatores devem ser cuidadosamente considerados ao selecionar um modelo de regressão para a análise de dados. 34
Capítulo 4 Métodos para a construção das curvas de crescimento Este capítulo aborda a metodologia fundamental para a construção das curvas de crescimento. Começase com considerações metodológicas que ajudam a compreender os aspetos distributivos dos dados e as técnicas de alisamento necessárias para obter as curvas. A seleção dos métodos apropriados é abordada com critérios específicos e uma revisão abrangente dos métodos disponíveis. Destaca-se o GAMLSS, explorando o seu modelo estatístico, algoritmos, estimação de hiperparâmetros, técnicas de alisamento e distribuições. Além disso, apresenta-se o método LMS e as suas extensões, LMST eLMSP, que oferecem abordagens alternativas. Explica-se como estimar percentis e avaliar a qualidade dos ajustes, abrangendo uma gama dispersa de critérios. Ao longo deste capítulo, são fornecidas informações detalhadas, ferramentas e pacotes essenciais para o desenvolvimento de curvas de crescimento, fornecendo um guia para explorar e compreender a metodologia que sustenta a construção das curvas de crescimento para os parâmetros biométricos da placenta. 4.1 Considerações metodológicas O desenvolvimento das curvas de crescimento requer uma análise das propriedades de distribuição dos dados. Em casos de parâmetros amplamente estudados na literatura, como o crescimento e o peso de crianças, o conhecimento prévio pode servir como base para esse processo. No entanto, quando se trata de parâmetros relacionados à placenta, o desafio é ampliado, uma vez que esse é um campo de estudo relativamente pouco explorado. 4.1.1 Aspetos distributivos Os métodos que se fundamentam em pressupostos distributivos têm ganho uma relevância crescente devido à sua capacidade de gerar z-scores e estimativas mais precisas dos percentis extremos. No entanto, é essencial assegurar uma concordância adequada entre a distribuição dos dados e os pressupostos 35
distributivos inerentes ao método selecionado. Tipicamente, as distribuições são caracterizadas com base em três estatísticas fundamentais: a média, o DP (ou o coeficiente de variação (CV)) e a assimetria [Borghi et al.,2006]. Contudo, reconhece-se cada vez mais a importância potencial da curtose, na obtenção de estimativas precisas dos percentis extremos. Uma vez que as distribuições são descritas pelos quatro momentos — média, DP, assimetria e curtose — é de extrema importância que estas estatísticas sejam analisadas previamente nos dados antes de serem efetuadas suposições. No contexto deste estudo, que analisa parâmetros ao longo da IG, é essencial que estas estatísticas sejam avaliadas para cada IG. É de salientar que modelar a curtose por meio de extrapolação pode ser desafiador, devido à informação esparsa geralmente disponível nas caudas. 4.1.2 Aspetos de alisamento Determinar o nível ideal de alisamento necessário para uma estimativa adequada dos percentis é uma tarefa de grande complexidade. Desconsiderar o alisamento pode resultar em curvas de crescimento excessivamente irregulares, mesmo em casos com amostras numerosas. No contexto do estudo do crescimento placentário, esse fenómeno surge devido à variabilidade da amostragem ao longo das diferentes IG, bem como da influência de valores discrepantes remanescentes e da variabilidade nas medições. As técnicas de alisamento são aplicadas com o objetivo de mitigar esses efeitos, sem distorcer os verdadeiros padrões de crescimento subjacentes. No entanto, uma aplicação excessiva de alisamento pode achatar os picos e vales característicos dos padrões de crescimento biológico, o que, em última análise, resulta em curvas de crescimento ajustadas enviesadas. É fundamental destacar que a seleção da função de alisamento é tão crucial quanto a escolha da distribuição utilizada. A determinação de qual método de alisamento aplicar requer uma avaliação cuidadosa, considerando as características específicas dos dados e os objetivos da análise. Além disso, é importante mencionar que a adequação do alisamento deve ser ajustada para se adaptar às diferentes IG, uma vez que as características da amostra podem variar ao longo do período gestacional. 4.2 Seleção de métodos A construção de curvas de crescimento requer uma seleção cuidadosa de métodos que considerem as características do conjunto de dados em análise e as suas futuras aplicações. Como tal, são necessários critérios que orientem a seleção dos métodos. 36
4.2.1 Critérios para a seleção dos métodos No contexto da construção de curvas de crescimento, a seleção de métodos adequados desempenha um papel fundamental, sendo essencial considerar criteriosamente as características do conjunto de dados em questão e as futuras aplicações das curvas de crescimento de referência. Portanto, neste estudo, a escolha dos métodos para desenvolver as curvas de crescimento levou em consideração diversos critérios, com o objetivo de orientar de forma fundamentada todo o processo de seleção. Os critérios foram os seguintes: •Precisão na estimação de percentis extremos: A obtenção de estimativas precisas para os percentis nas caudas da distribuição é um desafio complexo, principalmente devido à escassez de dados nessa região. Este desafio requer métodos que sejam capazes de oferecer essa precisão e por isso, que dependam de uma distribuição subjacente. •Evitar o cruzamento de curvas de percentis: Garantir que os percentis não se cruzem é essencial para a integridade das curvas de crescimento. Para atingir esse objetivo, torna-se imperativo calcular simultaneamente os percentis, evitando qualquer sobreposição que comprometa a interpretação adequada das curvas. •Retrotransformações: Os métodos selecionados devem permitir retrotransformações de forma a ser possível o cálculo direto de percentis e z-scores , tornando a interpretação dos dados mais acessível e direta. •Curtose: São preferíveis métodos capazes de lidar com a curtose, além da assimetria. A curtose pode manifestar-se em certas medições, e um modelo incorreto poderá distorcer os percentis ajustados resultantes. Além desses critérios principais, também foram considerados critérios secundários que complementam o processo de seleção de métodos. A compatibilidade com ferramentas de diagnóstico é crucial para avaliar a qualidade do ajuste dos métodos e garantir que os resultados sejam confiáveis. A eficiência computacional também desempenha um papel importante, especialmente ao comparar métodos igualmente qualificados, garantindo que o processo de construção das curvas seja eficaz em termos de recursos computacionais. Por último, a flexibilidade de aplicação é um critério que permite que o método seja aplicado a diversas medições, garantindo que as curvas de crescimento sejam abrangentes e aplicáveis a uma variedade de contextos. 37
Em resumo, a seleção dos métodos para construção das curvas de crescimento neste estudo é guiada por critérios rigorosos, abordando tanto os desafios fundamentais de precisão e integridade das curvas como critérios secundários que consideram a qualidade, eficiência e aplicabilidade dos métodos escolhidos. Isso assegura a utilidade das curvas de crescimento resultantes para aplicações futuras. 4.2.2 Métodos Para a seleção dos métodos mais adequados para a construção das curvas de crescimento, foi realizada uma revisão abrangente da literatura sobre os métodos utilizados para este fim. Os detalhes dessa revisão podem ser encontrados na Secção 2.2, na qual os métodos são listados na Tabela 1. A avaliação dos métodos foi meticulosa e baseada nos critérios delineados na Subsecção 4.2.1. Nessa análise, priorizouse a inclusão apenas de métodos que considerassem a idade como uma variável contínua, bem como aqueles que se baseassem em suposições de distribuição explícitas e conseguissem estimar percentis simultaneamente. A lista final de métodos considerados para a construção das curvas de crescimento inclui: •Método GAMLSS:Este método tem uma estrutura abrangente para ajustar modelos de regressão, nos quais a distribuição da variável resposta pode ser contínua ou discreta e apresentar alta assimetria e curtose [Stasinopoulos and Rigby,2007]. O método GAMLSS oferece a flexibilidade necessária para incorporar distribuições complexas e capturar a variação em diferentes momentos da distribuição. •Método LMS:Este método resume a distribuição por meio de três curvas, que descrevem a mediana, o CV, e a assimetria. A assimetria é expressa por meio de uma transformação de potência Box-Cox [Cole and Green,1992]. Através do uso da verosimilhança penalizada, essas três curvas são ajustadas por meio de uma regressão não linear. O grau de alisamento necessário pode ser quantificado em termos de parâmetros de alisamento ou graus de liberdade equivalentes. •Método LMST:Este método é uma extensão do método LMS, mas utilizando a distribuição BCT [Rigby and Stasinopoulos,2004a] . •Método LMSP:Este método é outra extensão do método LMS, mas utilizando a distribuição BCPE [Rigby and Stasinopoulos,2004b]. Esta seleção criteriosa de métodos servirá como base para a construção das curvas de crescimento no contexto deste estudo. 38
Além disso, o GAMLSS também integra o conceito de termos aditivos. Ou seja, ao avaliar a influência das variáveis explicativas no preditor para um determinado parâmetro de distribuição, somamos os seus efeitos individuais [Stasinopoulos et al.,2017]. Essa aditividade permite-nos decompor a relação complexa entre os parâmetros e as variáveis explicativas em componentes mais compreensíveis. Importante salientar que o conceito de aditividade não exclui a possibilidade de interações entre esses termos. Na Figura 5é possível visualizar uma classificação dos diferentes termos aditivos nos GAMLSS. Os termos aditivos podem ser paramétricos (esquerda do diagrama), de alisamento (centro) ou efeitos aleatórios (direita). Os termos aditivos paramétricos incluem tanto termos paramétricos lineares quanto não lineares. Os termos aditivos de alisamento são divididos em duas categorias distintas: termos aditivos penalizados e outros termos de alisamento. Os efeitos aleatórios estão conectados aos termos de alisamento penalizados, indicando que podem ser tratados como alisadores penalizados, mas também podem fornecer informações adicionais sobre os alisadores penalizados quando considerados como efeitos aleatórios. 4.3.5 Alisamento Os alisadores são ferramentas essenciais para modelar as relações entre as variáveis explicativas e a variável preditora. Originalmente, os alisadores eram utilizados para estimar o valor esperado condicional (ou média) de ydado xsem assumir uma forma funcional paramétrica, permitindo que os dados revelassem a relação funcional [Stasinopoulos et al.,2017]. Com o tempo, esse conceito foi estendido a qualquer parâmetro de localização (por exemplo, mediana) da distribuição de ye, mais geralmente, começaram a ser utilizados para a estimativa de quantis. Os alisadores podem ser categorizados em dois grupos, univariados e multivariados, dependendo se uma ou várias variáveis explicativas estão envolvidas [Stasinopoulos et al.,2017]. Nos casos em que apenas é utilizada uma variável explicativa, x, é empregue um alisador univariado denotado como s(x). Estes alisadores capturam os principais efeitos não lineares das variáveis explicativas individuais nos parâmetros de distribuição. Ao lidar com várias variáveis explicativas, como x1ex2, entramos no domínio dos alisadores multivariados que capturam os efeitos de interações não lineares entre as variáveis. Os alisadores podem ser ainda divididos em dois tipos principais com base nos seus princípios subjacentes e estruturas de penalização: •Alisadores Penalizados: Usam penalizações quadráticas nos parâmetros do modelo para regu45
Termos aditivos Paramétrico Alisamento Efeitos aleatórios Linear Não Linear Penalizado Outros Polinómios Polinómio fracionário Polinómio por partes B-splines P-splines Splines cúbicas Ridge-lasso P-categorizada Univariado Multivariado GMRF Coeficientes variáveis Produtos tensoriais Thin plate splines Redes neurais Árvores de decisão Loess MARS Figura 5: Diagrama ilustrando os diversos termos aditivos que podem ser ajustados no modelo GAMLSS. Adaptado de Stasinopoulos et al. [2017]. lar o grau de alisamento aplicado. •Alisadores Não Penalizados: Em contraste, estes alisadores adotam estratégias diferentes, como penalizações locais ou não quadráticas, para moldar as funções de alisamento. Um alisador univariado simples é uma generalização do modelo de regressão linear simples e pode ser expresso como um modelo estatístico [Stasinopoulos et al.,2017]: E(Yi) = α+s(xi),para i= 1, ..., n (4.7) Aqui, s(xi)representa uma função arbitrária que assume-se existir, enquanto αé uma constante que frequentemente pode ser absorvida na função s(xi). Essencialmente, s(xi)captura a tendência 46
subjacente que se pretende estimar a partir dos dados. Embora a escolha de s(xi)seja arbitrária, alisadores específicos, como Splines cúbicas, assumem que s(xi)possui derivadas contínuas de primeira e segunda ordem, tornando-os úteis para modelar tendências complexas. A adequação dos alisadores pode ser abordada de diferentes maneiras, desde estimadores locais que se concentram em pontos de dados próximos até à incorporação de penalizações. Embora sejam frequentemente referidos como não paramétricos, é importante reconhecer que os alisadores de facto estimam parâmetros e apresentam um parâmetro dominante que dita o grau de alisamento dos dados - o parâmetro de alisamento. Dentro do contexto dos modelos GAMLSS, foi optado por utilizar nesta investigação métodos univariados de alisamento penalizado, como splines penalizados ( P-splines ) e Splines cúbicas. Adicionalmente, foram testadas outras técnicas de alisamento, como redes neurais e Loess . P-splines As splines penalizadas, conhecidas como P-splines , são uma técnica estatística introduzida por Eilers and Marx [1996]. São utilizadas para modelar relações complexas entre variáveis, especialmente em modelos estatísticos como o GAMLSS. A ideia-chave por trás das P-splines é garantir o alisamento na modelação, penalizando os coeficientes das funções de base B-spline [Stasinopoulos and Rigby,2007]. Num contexto GAMLSS, onde θrepresenta qualquer vetor de parâmetros de distribuição, o modelo assume a forma θ=Z(x)γ[Stasinopoulos and Rigby,2007]. Aqui, Z(x)é uma matriz de delineamento de base de dimensões n×qassociada à variável explicativa x, geralmente definida em qnós diferentes, principalmente no intervalo de x. O vetor γ, com dimensões q×1, contém coeficientes sujeitos a restrições estocásticas. Essas restrições são impostas para garantir o nível desejado de alisamento. Em particular, as restrições em γseguem uma distribuição, como Dγ∼N(0, λ−1I), ou equivalente, γ∼N(0, λ−1K−1), onde K=DTD. A matriz Dtem dimensões (q−r)×qe calcula as diferenças de ordem rdo vetor γde qdimensões. Portanto, para definir uma P-spline , precisamos de considerar vários parâmetros, incluindo o número e posicionamento de nós (q) para determinar quantos nós são colocados ao longo do eixo x. O grau do polinómio por partes usado nas funções de base B-spline , a ordem das diferenças, que dita o tipo de penalização aplicada aos coeficientes das funções de base B-spline . E por fim, a quantidade desejada de alisamento, que pode ser expressa em termos de graus de liberdade equivalentes (df) ou o parâmetro de alisamento (λ). 47
Splines cúbicas As splines cúbicas são uma técnica amplamente abordada na literatura [REINSCH,1967,Green and Silverman,1993,Hastie and Tibshirani,1986]. Utilizam funções de base semelhantes às das P-splines , no entanto, usam polinómios por partes de grau 3. Embora estes dois alisadores sejam semelhantes, diferem em dois aspetos-chave, nas P-splines , os nós são equidistantes ao longo do eixo x, e o alisamento é controlado aplicando uma penalização aos parâmetros γ[Stasinopoulos et al.,2017]. Por outro lado, nas splines cúbicas os nós estão em valores distintos da variável xe o alisamento é obtido penalizando a segunda derivada da função [Stasinopoulos et al.,2017]. No contexto das splines cúbicas dentro do GAMLSS, é assumido no modelo 4.2 que as funções h(t) são duas vezes continuamente diferenciáveis, sendo maximizada uma verosimilhança penalizada, representada por l, sujeita a termos de penalização que assumem a forma λ∫∞ −∞ [h′′(t)]2dt [Stasinopoulos and Rigby,2007]. A solução para as funções de maximização h(t)são todas splines cúbicas naturais, e, portanto, podem ser expressas como combinações lineares das suas funções naturais de base spline cúbica. Redes neurais As redes neurais, conhecidas pela sua notável flexibilidade, representam uma ferramenta para ajustar modelos de regressão não linear. Estes modelos, como descritos nos trabalhos de Bishop [1995], Jensen and Kendall [1993], Ripley [2007], têm uma sobreparametrização que os dota da capacidade de aproximar praticamente qualquer função contínua. No entanto, têm um grau de complexidade e desafios em termos de interpretação, diferenciando-os dos modelos de alisamento tradicionais. Outra característica peculiar desta técnica é o ajuste de modelos finais distintos quando valores iniciais diferentes são escolhidos [Stasinopoulos et al.,2017]. Para garantir a reprodutibilidade deste método, é prudente definir uma seed de geração aleatória no início do ajuste, permitindo assim a recriação do mesmo modelo ajustado. Além disso, para otimizar o processo de modelação e mitigar potencialmente o sobreajuste, pode-se utilizar o argumento “ decay ” — um parâmetro de alisamento. O argumento “ size ”, que especifica o número de variáveis ocultas, também desempenha um papel fundamental na modelação do comportamento da rede neural. Em essência, as redes neurais podem ser comparadas a modelos enigmáticos de “caixa-preta”, proficientes em aplicações práticas, mas muitas vezes carentes de transparência e facilidade de interpretação [Stasinopoulos et al.,2017]. Esta opacidade decorre da sua flexibilidade, que permite capturar interações complexas de alto nível entre variáveis explicativas. 48
Loess O alisador de dispersão ponderada localmente, comummente referido como Loess , é uma técnica utilizada para alcançar o alisamento de regressão local. Introduzido por Cleveland and Devlin [1988], o Loess é uma ferramenta valiosa para modelar curvas ou superfícies alisadas quando se lida com variáveis dependentes e uma ou mais variáveis explicativas contínuas. Para uma única variável explicativa, o Loess utiliza um algoritmo padrão caracterizado pelos seguintes passos-chave [Stasinopoulos et al.,2017]: 1. Definição da largura ou extensão da janela para x, para determinar a extensão na qual as observações próximas a um determinado valor de xinfluenciam o processo de alisamento. 2. Os valores xsão ordenados, e o foco muda para cada valor xindividualmente. 3. Atribuição de pesos às observações utilizando uma função de núcleo para atribuir maior importância às observações com valores xmais próximos do valor xde interesse. 4. Ajuste de uma regressão polinomial usando mínimos quadrados ponderados, obtendo assim os valores ajustados da variável dependente no valor xde interesse. 5. Os passos 3 e 4 são repetidos para cada valor xno conjunto de dados. A culminação desse processo envolve traçar uma curva alisada conectando os valores ajustados da variável dependente em relação a x, revelando assim as relações locais nos dados. 4.3.6 Distribuições Na estrutura do GAMLSS, a forma de distribuição assumida para a variável de resposta y, caracterizada por f(yi|µi, σi, νi, τi), pode abranger uma ampla e versátil gama. Esta função de densidade de probabilidade é intencionalmente deixada não especificada, sem uma distribuição explícita fornecida. Embora geralmente englobe parâmetros associados à localização, escala, assimetria e curtose, essa generalização não é universal. No contexto da implementação R do GAMLSS, a única estipulação é que a função log f(yi|µi, σi, νi, τi) e as suas primeiras derivadas (e, opcionalmente, segundas derivadas e derivadas cruzadas esperadas) relativamente a cada um dos parâmetros dentro de θdevem ser computacionalmente alcançáveis. Embora derivadas explícitas sejam preferidas, a utilização de derivadas numéricas permanece uma alternativa viável. Essencialmente, o algoritmo de ajuste utilizado para modelos GAMLSS depende apenas dessa informação, garantindo versatilidade e adaptabilidade na modelação de várias formas de distribuição. 49
Na tabela do Apêndice Aestão representadas uma variedade de famílias de um, dois, três e quatro parâmetros de distribuições contínuas implementadas no pacote gamlss. Durante este estudo foi optado por utilizar apenas as distribuições Box-Cox Cole-Green (BCCG), Box-Cox t (BCT), Box-Cox Power Exponential (BCPE) e Johnson’s SU (JSU). As funções de ligação para cada uma das distribuições foram as predefinidas. A decisão para a escolha destas distribuições baseou-se na revisão da literatura que pode ser consultada na Secção 2.2. Distribuição BCCG A distribuição BCCG é apropriada para lidar com dados com assimetria positiva ou negativa [Stasinopoulos et al.,2008]. Cole and Green [1992] foram uns dos primeiros a adotar esta distribuição, usando-a para modelar os três parâmetros por meio de funções de alisamento não paramétricas ligadas a uma única variável explicativa [Stasinopoulos et al.,2017]. Assumindo que Yé uma variável aleatória positiva seguindo a distribuição BCCG (BCCG (µ, σ, ν)), define-se a variável aleatória transformada Z usando a seguinte equação [Rigby et al.,2019]: z= 1 σν [(Y µ)ν−1]se ν = 0 1 σlog (Y µ)se ν = 0 (4.8) Aqui, 0< Y < ∞,µ > 0,σ > 0, e −∞ < ν < ∞. Presume-se que a variável aleatória Z esteja sujeita a uma distribuição normal padrão truncada [Rigby et al.,2019]. A condição 0< Y < ∞ garante que Yνseja real para todos os ν, levando ao intervalo −1/(σν)< Z < ∞se ν > 0e −∞ < Z < −1/(σν)se ν < 0. Essa exigência torna necessária a distribuição normal padrão truncada para Z Rigby et al. [2019]. Consequentemente, a função de densidade de probabilidade de Yé dada por [Stasinopoulos et al.,2008]. fY(y|µ, σ, ν) = yν−1exp (−1 2z2) µνσ√2πϕ (1 σ|ν|)(4.9) A variável Z é determinada pela Equação 4.8, e ϕ() representa a função de distribuição acumulada de uma distribuição normal padrão [Stasinopoulos et al.,2008]. As funções de ligação dos parâmetros µ, σ eνsão log, log e identidade, respetivamente. 50
Distribuição BCT Considerando Ycomo uma variável aleatória positiva seguindo a distribuição BCT (BCT (µ, σ, ν, τ)) introduzida por Rigby and Stasinopoulos [2006]. A distribuição é caracterizada pela variável aleatória transformada Z especificada na Equação 4.8, onde Z segue uma distribuição t truncada com graus de liberdade τ> 0, tratada como um parâmetro contínuo [Stasinopoulos et al.,2008]. A seguinte equação fornece a função de densidade de probabilidade de Y. fY(y|µ, σ, ν, τ) = yν−1fT(Z) µνσFT(1 σ|ν|)(4.10) Para valores positivos de Y, com µeσpositivos e −∞ < ν < ∞, a variável aleatória Zé determinada pela Equação 4.8.fT(t)eFT(t)são respetivamente a função de densidade de probabilidade e a função de distribuição acumulada de uma variável aleatória Tcaracterizada por uma distribuição t padrão com um parâmetro de graus de liberdade τ > 0[Stasinopoulos et al.,2008]. As funções de ligação dos parâmetros µ, σ, ν eτsão log, log, identidade e log, respetivamente. Distribuição BCPE Considerando uma variável aleatória positiva Ycom uma distribuição BCPE (BCPE (µ, σ, ν, τ)), introduzida por Rigby and Stasinopoulos [2004b]. Esta distribuição é descrita pela variável aleatória transformada Z, dada pela Equação 4.8, com Z assumindo uma distribuição exponencial de potência padrão truncada com um parâmetro de potência τ > 0, considerado como um parâmetro contínuo [Stasinopoulos et al., 2008]. A função de densidade de probabilidade de Y, denominada pela Equação 4.10, está relacionada com fT(t)eFT(t), a função de densidade de probabilidade e a função de distribuição acumulada de uma variável Tseguindo uma distribuição exponencial de potência padrão [Stasinopoulos et al.,2008]. As funções de ligação dos parâmetros µ, σ, ν eτsão log, log, identidade e log, respetivamente. Distribuição JSU A distribuição Johnson SU, introduzida por Johnson em 1949, oferece uma distribuição de probabilidade flexível adequada para várias aplicações. Na sua parametrização original, a distribuição Johnson SU é caracterizada por dois parâmetros-chave: νeτ[Stasinopoulos et al.,2008]. O parâmetro νdesempenha um papel crucial na determinação da assimetria da distribuição. Quando ν > 0, indica assimetria negativa, enquanto ν < 0representa assimetria positiva. Já o parâmetro τ 51
controla a curtose da distribuição. Tipicamente, τdeve assumir valores positivos, geralmente acima de 1. À medida que τ→ ∞, a distribuição Johnson SU converge para a função de densidade normal padrão. Essa distribuição é particularmente adequada para lidar com dados com leptocurtose, que exibem caudas pesadas e excesso de curtose [Stasinopoulos et al.,2008]. A função de densidade de probabilidade da distribuição original de Johnson Su é denotada como JSUo(µ, σ, ν, τ). fY(y|µ, σ, ν, τ) = τ σ 1 (r2+ 1)1 2 1 √2πexp [−1 2z2],(4.11) Para, −∞ < y < ∞,onde −∞ < µ < ∞, σ > 0,−∞ < ν < ∞,eτ > 0, e onde: z=ν+τsinh−1(r) = ν+τlog [r+(r2+ 1)1 2],(4.12) Onde r= (y−µ)/σ, e Z∼NO(0,1). Além disso, E(Y) = µ−σω1/2 sinh(ν/τ)e Var(Y) = σ21 2(ω−1)[ωcosh(2ν/τ) + 1], onde ω=exp (1/τ2). As funções de ligação dos parâmetros µ, σ, ν eτsão identidade, log, identidade e log, respetivamente. 4.4 LMS e as suas extensões LMST e LMSP O método LMS, desenvolvido inicialmente por Cole [1988] e subsequentemente refinado por Cole and Green [1992], é uma ferramenta para construir curvas percentílicas, particularmente no contexto de modelar uma variável de resposta Yrelativamente a uma única variável explicativa x(por exemplo, idade) [Stasinopoulos et al.,2017]. O método LMS é especialmente vantajoso porque acomoda a suposição de uma distribuição específica para a variável Y. Isso permite a estimativa simultânea de curvas percentílicas para vários percentis (p) sem cruzamentos. Além disso, os modelos LMS facilitam prontamente o cálculo de percentis, yp(x), dados valores específicos de pex, ou os z-scores , dando yex[Stasinopoulos et al., 2017]. Dentro do GAMLSS, o método LMS pode ser integrado presumindo que a variável de resposta segue a distribuição BCCG, adaptada a dados que apresentam assimetria positiva ou negativa com Y > 0como representado na Equação 4.8. Rigby and Stasinopoulos [2004b,2006] expandiram o método LMS, que aborda inerentemente a assimetria, mas não a curtose nos dados, introduzindo duas extensões importantes: as distribuições BCT eBCPE para Y. Essas extensões deram origem aos métodos de estimação percentílica LMST e LMSP, respetivamente. Mais detalhes sobre estas distribuições podem ser consultados na Secção 4.3.6. 52
No contexto da estimação percentílica para Ydado x, o modelo GAMLSS é formulado da seguinte forma: Y∼ D(µ, σ, ν, τ) g1(µ) = s1(u) g2(σ) = s2(u) g3(ν) = s3(u) g4(τ) = s4(u) u=xξ (4.13) Aqui, Dgeralmente representa a distribuição BCCG,BCT ou BCPE, para a qual µ,σ,νeτsão a mediana aproximada, coeficiente de variação aproximado, parâmetros de assimetria e curtose da distribuição, respetivamente [Stasinopoulos et al.,2017]. As funções g(·)correspondem a funções de ligação apropriadas, enquanto as funções s(·)indicam funções de alisamento não paramétricas. A transformação de potência para x, ou seja, xξ, é muitas vezes necessária quando a variável de resposta apresenta um crescimento rápido nas fases iniciais ou finais, ajudando a alinhar a escala xcom o ajuste da curva. 4.5 Estimativa de percentis A estimativa de percentis desempenha um papel fundamental na compreensão e modelação do crescimento, particularmente na avaliação de como diversos fatores afetam a distribuição de variáveis relacionadas ao crescimento ao longo do tempo como, por exemplo, o peso. Nesta investigação a estimação dos percentis é feita a partir do pacote gamlss. No cerne da estimativa de percentis estão duas variáveis contínuas-chave: •Variável Resposta: Esta é a variável em estudo, para a qual as curvas de percentis são procuradas. Pode ser qualquer medida como o peso, o diâmetro, ou a espessura. •Variável Explicativa: Normalmente, esta é a variável independente associada à variável resposta relacionada ao crescimento, frequentemente a idade no contexto do desenvolvimento humano. Um percentil específico 100ppara uma variável contínua aleatória Yé definido como yp, onde Prob(Y≤yp) = p. Em termos matemáticos, yp=F−1 Y(p), representando a função de distribuição cumulativa inversa de Yem p. Considerando o percentil condicional de Ydada a variável explicativa X=x, ou seja, yp(x) = F−1 Y|x(p). Variando x, uma curva de percentil 100pde yp(x)contra xé obtida. Diferentes percentis podem ser usados para construir diversas curvas de percentis. Neste estudo, 53
foram utilizados os seguintes valores para os percentis: 100p= (3,10,25,50,75,90,97). É importante ter em consideração que um z-score , dado os valores de yex, é definido por z= Φ−1[FY|x(y)], onde Φ−1é distribuição cumulativa inversa da distribuição normal padrão. Para os valores de yexutilizados na estimativa de um modelo, os z-score são os resíduos de um modelo GAMLSS ajustado. Enfatizando a estreita conexão entre a estimativa de percentis e técnicas de modelação estatística. Na prática, uma abordagem eficaz para gerar curvas de crescimento de percentis de referência para populações envolve uma combinação de metodologias. 4.6 Critérios de qualidade de ajuste A avaliação da qualidade de ajuste dos modelos é uma etapa fundamental em qualquer análise estatística, desempenhando um papel crucial na validação e interpretação dos resultados obtidos, uma vez que a qualidade do ajuste irá influenciar diretamente a confiabilidade das estimativas e a utilidade das curvas de referência geradas. Esta visa responder a perguntas fundamentais, tais como: Quão bem o modelo se ajusta aos dados observados? Em que medida as previsões do modelo se aproximam dos valores reais? Os pressupostos do modelo são cumpridos? Para realizar uma avaliação abrangente da qualidade de ajuste, existe uma variedade de critérios, métricas e ferramentas disponíveis na literatura. No contexto deste estudo, adotou-se uma abordagem que inclui uma série de critérios quantitativos e ferramentas gráficas. Entre os critérios e métricas considerados, destaca-se o Coeficiente de Determinação (R2), o Erro Quadrático Médio (MSE), o Critério de Informação de Akaike (AIC), o Critério de Informação Bayesiano (BIC), as estatísticas Z, o worm plot e os gráficos de resíduos (resíduos quantílicos em relação aos valores ajustados, resíduos quantílicos em relação ao índice, estimativa de densidade e gráfico Q-Q normal). A combinação destes critérios quantitativos e ferramentas gráficas oferece uma abordagem completa para avaliar a qualidade do ajuste dos modelos de crescimento, garantindo a confiabilidade das curvas de referência resultantes. 4.6.1 Coeficiente de Determinação O coeficiente de determinação, frequentemente referido como R-quadrado ou R2, desempenha um papel significativo na análise estatística e na modelação da regressão. Apesar da ausência de uma métrica universal para avaliar o desempenho de um modelo, o R2destaca-se como uma escolha bem estabelecida 54
revelando áreas onde a distribuição ajustada ou os parâmetros do modelo podem necessitar de ajustes [Stasinopoulos et al.,2017]. Uma “minhoca” plana no gráfico significa um modelo bem ajustado, enquanto desvios dessa forma indicam potenciais modificações necessárias para melhorar a precisão. Esta ferramenta de diagnóstico é particularmente útil para orientar o processo de modelação, especialmente em cenários em que desvios locais do modelo podem ter implicações substanciais. Em conclusão, o worm plot é uma ferramenta valiosa de diagnóstico na modelação estatística, auxiliando na avaliação da qualidade de ajuste do modelo e destacando áreas onde podem ser necessárias melhorias. A sua aplicação é particularmente relevante na modelação de curvas de referência de crescimento condicionadas à idade e fornece um meio eficaz para aumentar a fiabilidade dos modelos estatísticos. Tabela 2: Descrição da forma do worm plot relativamente aos resíduos e à distribuição ajustada quando um modelo está mal ajustado aos dados. Adaptado de Stasinopoulos et al. [2017]. Forma do worm plot (ou a sua curva ajustada) Resíduos Distribuição ajustada Nível: acima da origem Média muito alta Localização ajustada muito baixa Nível: abaixo da origem Média muito baixa Localização ajustada muito alta Linha: declive positivo Variância muito alta Escala ajustada muito baixa Linha: declive negativo Variância muito baixa Escala ajustada muito alta Forma ’U’ Assimetria positiva Assimetria ajustada muito baixa Forma ’U’ invertida Assimetria negativa Assimetria ajustada muito alta Forma ’S’ com a esquerda curvada para baixo Leptocurtose Caudas da distribuição ajustada pesadas Forma ’S’ com a esquerda curvada para cima Platicurtose Caudas da distribuição ajustada leves Gráficos de resíduos A análise de resíduos é um componente crucial na modelação estatística, permitindo-nos avaliar a qualidade do ajuste de um modelo e identificar potenciais violações das suposições do modelo. Como parte do diagnóstico do modelo, é importante verificar os gráficos dos resíduos quantílicos normalizados associados ao modelo. Neste estudo foram analisados quatro gráficos-chave produzidos pela função plot() do pacote gamlss. Os gráficos são os seguintes: •Resíduos em relação aos valores ajustados do parâmetro µ:Este gráfico indica os resíduos em relação aos valores ajustados do parâmetro µ, que representa a localização ou média 61
da variável resposta. Este gráfico ajuda a avaliar se o modelo capta adequadamente a tendência nos dados. Um modelo bem ajustado deve exibir uma dispersão aleatória de resíduos em torno da linha horizontal em zero, sem um padrão discernível [Stasinopoulos et al.,2017]. •Resíduos em relação a um índice ou uma covariável especificada: Este gráfico permite examinar os resíduos em relação a um índice ou a uma covariável especificada. É particularmente útil quando se avalia a influência de variáveis preditoras específicas nos resíduos. Se surgir um padrão relacionado com a covariável, isso pode sugerir que o modelo não considera totalmente os efeitos dessa covariável, o que pode levar à necessidade de um aperfeiçoamento do modelo [Stasinopoulos et al.,2017]. •Estimativa de densidade pelo método do núcleo dos resíduos: Este gráfico fornece informações sobre a distribuição dos resíduos do modelo. Um modelo bem ajustado deve ter resíduos que se aproximam de uma distribuição normal, resultando numa estimativa de densidade pelo método do núcleo simétrica centrada em torno de zero [Stasinopoulos et al.,2017]. Desvios da normalidade, como assimetria ou caudas pesadas, podem ser detetados através deste gráfico. Se forem observados desvios significativos, isso pode indicar que as suposições do modelo, especialmente em relação à distribuição de erros, precisam de ser reavaliadas. •Gráfico QQ-Normal dos resíduos: Este gráfico permite avaliar se os resíduos seguem uma distribuição normal padrão, para tal o gráfico deve ser linear com uma interceção em 0 e um gradiente de 1 [Stasinopoulos et al.,2017]. Os quantis observados dos resíduos são comparados com os quantis esperados de uma distribuição normal. Um modelo bem ajustado produzirá pontos alinhados ao longo de uma linha diagonal. Desvios desta linha diagonal podem indicar desvios da normalidade nos resíduos. Em suma, a utilização de gráficos informativos de resíduos auxilia na avaliação da adequação do modelo e na identificação de áreas onde podem ser necessárias melhorias, contribuindo para a interpretabilidade do modelo. 4.7 Pacotes O pacote gamlss possui várias funções para ajustar os GAMLSS [gamlss]. Este pacote para ajustar um modelo GAMLSS utiliza a função principal gamlss() e contém métodos para lidar com os objetos gamlss ajustados [Stasinopoulos et al.,2017]. 62
A função gamlss(), oferece uma abordagem versátil para a modelação estatística que vai além das capacidades de funções tradicionais como a função gam() do pacote gam. Enquanto gam() está limitado a modelar distribuições pertencentes à família exponencial, gamlss() é mais abrangente, acomodando uma variedade mais ampla de famílias de distribuição. Além disso, permite modelar os quatro parâmetros associados a uma distribuição: µ, σ, ν, τ, e expressá-los como funções de variáveis explicativas. Ao executar a função gamlss(), é retornado um objeto gamlss que representa um modelo GAMLSS ajustado. É utilizado o algoritmo RS, que é vantajoso devido à sua capacidade de convergência sem necessidade de valores iniciais precisos para µ, σ, ν, τ, tornando-o adequado para conjuntos de dados maiores. Para construir um modelo com a função gamlss(), é necessário definir argumentos essenciais. O argumento “ formula ” representa a fórmula padrão do modelo R para o preditor do parâmetro µ, com a resposta à esquerda de um operador ∼, enquanto “ sigma.formula ”, “ nu.formula ” e “ tau.formula ” lidam com os parâmetros σ, ν, τ, respetivamente. “ family ” designa a família de distribuição da variável resposta e “ data ” refere-se ao conjunto de dados. Também é possível escolher entre os algoritmos RS,CG, ou mixed para a estimativa. Outra função importante do pacote gamlss, que foi utilizada neste estudo, é a lms(), que foi criada para simplificar a seleção automática de um tipo apropriado de estimativa de percentis com o método LMS fornecido pelo modelo 4.13. Esta função determina a distribuição da variável de resposta, os graus de liberdade adequados para todos os parâmetros da distribuição e o cálculo do parâmetro de potência ξ. É importante observar que a função lms() é apenas aplicável quando há uma única variável explicativa. Ela aceita diversos argumentos, como “ y ” que representa a variável resposta, “ x ” que indica a variável explicativa, “ families ” que contém uma lista de famílias padrão (BCCG,BCT eBCPE), “ data ” que contém os dados de interesse, ” cent ”que define os valores dos percentis para os quais as curvas são avaliadas e “ method.pb ” que define o método usado na estimativa local dos parâmetros de alisamento. De forma a ser possível guardar os valores dos percentis calculados nos modelos GAMLSS ou LMS, LMST eLMSP para posterior uso na aplicação web desenvolvida, foi utilizada a função centiles.pred() do pacote gamlss. Dando os valores de x a esta função, os valores dos percentis desejados e o modelo ajustado, ela calcula uma matriz contendo os valores dos percentis para y . Outro pacote utilizado durante este estudo foi o gamlss.ggplots, uma extensão do pacote ggplot2. Foi projetado para aprimorar a visualização e representação gráfica de modelos de regressão não lineares ajustados com o pacote gamlss. O pacote ggplot2 também foi utilizado para a representação gráfica dos dados na análise exploratória. O pacote moments, foi utilizado para calcular estatísticas dos dados como a assimetria e a curtose. 63
4.8 Visão geral da metodologia implementada na construção das curvas de crescimento Ao longo deste capítulo foi abordada detalhadamente a metodologia utilizada na construção das curvas de crescimento. A metodologia é dividida em várias secções interconectadas, que delineiam o processo desde a revisão dos métodos até à avaliação da qualidade dos ajustes. Na Figura 6é possível visualizar um resumo da metodologia implementada. Inicialmente foi realizada uma revisão crítica dos métodos existentes para a construção das curvas de crescimento, presente na Secção 2.2. Em seguida, de acordo com essa revisão e tendo em consideração os critérios presentes na Subsecção 4.2.1, foram selecionados alguns métodos: GAMLSS,LMS,LMST eLMSP. Cada um destes métodos oferece abordagens únicas para modelar as curvas de crescimento. Foram selecionadas quatro técnicas de alisamento: P-splines , Splines Cúbicas, Redes Neurais e Loess . Cada uma dessas técnicas é projetada para capturar diferentes padrões de crescimento. Dentro de cada método, foram exploradas distribuições específicas que melhor se adequam ao contexto deste estudo. Isso inclui as distribuições BCCG,BCT,BCPE eJSU. Estas distribuições desempenham um papel fundamental na representação das características dos dados. Por fim, foram selecionados vários critérios de qualidade de ajuste, incluindo o R2, o MSE, o AIC, oBIC, estatísticas Z, Worm plots , e gráficos de resíduos. Estes critérios fornecem informações sobre a adequação dos modelos escolhidos aos dados observados. Esta metodologia foi, portanto, aplicada a vários modelos, com o intuito de identificar o modelo mais apropriado para cada um dos parâmetros em estudo, nomeadamente D1,D2,EP,PP, e PF. É relevante observar que seguiu uma ordem específica de procedimentos. Inicialmente, foram avaliadas várias funções de alisamento num modelo GAMLSS, sem a imposição de uma distribuição específica para o modelo. Estas funções de alisamento são conhecidas pela sua capacidade de flexibilidade ao ajustar curvas, sem a necessidade de predefinir uma forma específica para a função subjacente, Currie and Durban [2002]. A justificação para esta abordagem reside na simplificação do processo de modelação. Incorporar simultaneamente as funções de alisamento e as distribuições aumentaria consideravelmente a complexidade do processo de modelação. Cada combinação adicional de função de alisamento e distribuição exigiria mais cálculos e ajustes. Ao separar estes dois aspetos, é possível simplificar o processo de seleção do modelo. Posteriormente, foram testadas diversas distribuições em combinação com a função de alisamento escolhida, utilizando diferentes métodos. Por fim, foi avaliada a qualidade de ajuste de cada modelo. 64
Revisão de métodos para a construção das curvas de crescimento GAMLSS LMS LMST LMSP BCCG BCT BCPE BCCG BCT BCPE P-splines Splines cúbicas Redes neurais Loess R2 MSE AIC BIC Critérios de qualidade de ajuste Worm plots Gráficos de resíduos Métodos Distribuições Funções de alisamento Diagnóstico Estatísticas Z JSU Figura 6: Diagrama ilustrando a metodologia aplicada para a construção das curvas de crescimento neste estudo. 65
Capítulo 5 Preparação dos dados para análise e modelação Neste capítulo, é apresentada a metodologia utilizada para preparar e analisar os dados relativos aos parâmetros biométricos da placenta utilizados nesta investigação. Começa-se por explorar a origem do conjunto de dados, que se baseia num estudo anterior de Nogueira et al. [2019], abrangendo um amplo espectro de informações sobre a placenta e recém-nascidos. Em seguida, é detalhado o processo de préprocessamento dos dados, que incluiu a seleção de variáveis de interesse, tratamento de valores ausentes e discrepantes, resultando num conjunto coeso de 2064 observações com 11 variáveis relevantes. Este conjunto de dados é o alicerce fundamental para a modelação subsequente das curvas de crescimento, que serão exploradas nos capítulos seguintes. 5.1 Conjunto de dados Neste estudo, foram modeladas e otimizadas curvas de crescimento para vários parâmetros placentares em função da IG, para a população portuguesa. O conjunto de dados utilizado para construir e testar os modelos gerados, foi em parte aplicado num estudo anterior de Nogueira et al. [2019]. O conjunto de dados utilizado no estudo de Nogueira et al. [2019], começou por uma análise de 7321 amostras de placenta. Essas amostras foram meticulosamente submetidas ao Laboratório de Patologia Embrionária-Fetal, localizado no CGC, Unilabs, Porto, Portugal. O principal objetivo foi realizar um exame histopatológico, para confirmar, ou revelar lesões potenciais que possam esclarecer resultados obstétricos. A informação recolhida dos relatórios patológicos da placenta abrangeu um período de quatro anos, de 1 de janeiro de 2014 a 31 de dezembro de 2017. Os relatórios incluíram um amplo intervalo de IG, variando de 12 a 41 semanas. Os parâmetros biométricos da placenta foram recolhidos de relatórios de autópsia de placentas e fetos. Além disso, também foram reunidos detalhes biométricos sobre recém-nascidos por meio das solicitações clínicas associadas a exames patológicos da placenta. Os aspetos biométricos considerados incluíram parâmetros como peso e espessura da placenta, forma e diâmetro da placenta, comprimento do cordão umbilical, diâmetros do cordão umbilical e tipo de inserção. Ademais, foram 66
registados meticulosamente parâmetros fetais, como o peso e o género. Foram considerados alguns critérios na seleção das amostras, tendo sido garantido que o conjunto de dados obedecesse a condições específicas: IG conhecida, mulher da população portuguesa, gravidez única ≥12 semanas de gestação, critérios rigorosos para amostras de placenta, parâmetros de óbito fetal meticulosamente documentados e registos precisos de peso ao nascer. Foram excluídos meticulosamente casos que não se alinhavam com esses critérios, como mãe não portuguesa, casos de gestações múltiplas ou gestações únicas resultantes de tecnologias de reprodução assistida, e casos envolvendo doenças maternas crónicas conhecidas como diabetes ou hipertensão. Para mais informações acerca destes critérios, consultar Nogueira et al. [2019]. Após exclusão de amostras seguindo estes critérios, resultou num novo conjunto de dados composto por 1951 amostras de placenta. Para este estudo, o conjunto de dados foi estendido, tendo sido introduzidos novos casos que tiveram em consideração os critérios inicialmente delineados por Nogueira et al. [2019]. O conjunto de dados final em estudo contou com um conjunto de n= 2092 amostras de placenta. Dentro dessas 2092 amostras é possível encontrar 22 variáveis que poderão ser utilizadas neste estudo, no Apêndice Bé possível verificar informações acerca de todas as variáveis deste conjunto de dados, como, a sua descrição, tipo (escala de medida) e codificação quando a variável apresentada é categórica nominal. Esta codificação foi previamente realizada em outro estudo [Nogueira et al.,2019], e para as amostras adicionadas ao conjunto de dados pré-existente foi tida em consideração a codificação pré-definida. Além disso, este conjunto de dados passou por um procedimento de pré-processamento de forma a permitir uma exploração mais abrangente dos dados. 5.2 Pré-processamento Foi realizado um processo abrangente de pré-processamento do conjunto de dados da placenta. O objetivo deste pré-processamento foi preparar os dados brutos para análise estatística e modelação posterior, eliminando erros, valores ausentes e valores discrepantes, garantindo a qualidade e a confiabilidade dos dados. Dado o escopo deste estudo, começou-se por selecionar um subconjunto das variáveis disponíveis que eram de interesse para a análise e posterior modelação para a construção das curvas de crescimento. Dentro das 22 variáveis disponíveis (informações no Apêndice B), foram selecionadas 11 variáveis de interesse. Estas variáveis incluíram “local”, “GA” (idade gestacional), “MaternalAge” (idade da mãe), “Obstetriccontext” (paridade da mãe), “Fetalweight” (peso fetal), “Fetalgender” (género fetal), “Placen67
talweight” (peso placentar), “Diameter1” (diâmetro 1), “Diameter2” (diâmetro 2), “Placentalthickness” (espessura placentar) e “Placentalshape” (forma placentar). Numa primeira análise do conjunto de dados foi possível verificar que existiam alguns registos com valores de “999”, estes casos indicam falta de informação para essa variável. Portanto, foi optado por recodificar essas entradas como NA’s, ou seja, como valores omissos. Procedeu-se então à contagem do número de valores omissos, encontrando-se 22 valores (1,1% dos dados totais). Dada a quantidade mínima e ausência de um padrão destes valores, optou-se por remover todos os casos com valores omissos para pelo menos uma variável [Acuña and Rodriguez,2004]. Além disso, foi verificado se existiam linhas duplicadas no conjunto de dados. Foram encontradas 7 linhas duplicadas, que foram removidas. Esta remoção garantiu a integridade dos dados, evitando duplicações indesejadas. Para manter a qualidade dos dados e evitar que valores extremos afetassem as análises dos dados e posteriores modelos, realizou-se a deteção de valores discrepantes em algumas variáveis selecionadas, incluindo D1,D2,PP,EP ePF. A presença de valores discrepantes pode ter implicações significativas na interpretação dos resultados e, portanto, a abordagem adotada foi baseada em boas práticas estatísticas e considerações biológicas específicas. Para identificar os valores discrepantes, foram utilizados diagramas em caixa, uma ferramenta comummente utilizada na deteção visual de valores discrepantes em conjuntos de dados. Esta técnica fornece uma representação gráfica que destaca a dispersão dos dados e a presença de pontos que se desviam significativamente do padrão geral [Krzywinski and Altman, 2014]. Os diagramas em caixa das variáveis em estudo estão presentes na Figura 7. A sua análise permitiu uma avaliação clara da distribuição dos dados e destacou a presença de pontos discrepantes em quatro variáveis cruciais para esta investigação: D1,D2,PP eEP. Uma consideração importante neste estudo é o facto de os dados serem biológicos, mais precisamente, dados relacionados à placenta. Em estudos biológicos, é possível que os valores discrepantes possam não ser simples erros de medição, mas sim reflexões de variações naturais ou eventos biológicos excecionais. Portanto, foi optado por uma abordagem conservadora, removendo apenas os valores discrepantes mais severos. O processo de remoção dos valores discrepantes severos foi realizado conforme a seguinte metodologia: 1. Cálculo dos quartis (Q1 e Q3) e a amplitude interquartil (IQR) para cada variável (D1,D2,PP,EP ePF) utilizando a função quantile() do software R. 2. Em seguida, foi determinado os limites inferior e superior para a remoção dos valores discrepantes. Qualquer valor abaixo de Q1−3×IQR ou acima de Q3+3×IQR foi considerado um valor 68
discrepante severo sendo removido do conjunto de dados. Esta abordagem foi escolhida para preservar a integridade dos dados, ao mesmo tempo, em que reconhece a possibilidade de que os valores discrepantes possam conter informações biológicas valiosas. Com esta técnica, foram removidos apenas dois valores discrepantes severos dos dados. No final deste processo de pré-processamento, obteve-se um conjunto de dados limpo, consistente e dimensionado para análises subsequentes, contendo 2064 observações e 11 variáveis de interesse. Estes dados preparados serviram como base para a modelação e otimização das curvas de crescimento para os parâmetros placentares relativamente à IG na população portuguesa. 0 2 4 6 8 10 12 14 16 18 20 22 24 26 28 30 32 Diâmetro 1 Diâmetro 2 Diâmetro (cm) (a) Diâmetro 1 e Diâmetro 2 0 100 200 300 400 500 600 700 800 900 −0.4 −0.2 0.0 0.2 0.4 Peso placentar (g) (b) Peso placentar 0.0 0.5 1.0 1.5 2.0 2.5 3.0 3.5 4.0 4.5 5.0 5.5 6.0 6.5 7.0 7.5 8.0 8.5 9.0 9.5 10.0 10.5 11.0 11.5 12.0 12.5 13.0 13.5 −0.4 −0.2 0.0 0.2 0.4 Espessura placentar (cm) (c) Espessura placentar 0 500 1000 1500 2000 2500 3000 3500 4000 4500 −0.4 −0.2 0.0 0.2 0.4 Peso fetal (g) (d) Peso fetal Figura 7: Diagramas de caixa para as variáveis D1,D2,PP,EP ePF. 69
Capítulo 6 Desenvolvimento da aplicação web Neste capítulo, é descrito detalhadamente a metodologia utilizada para o desenvolvimento da aplicação web “PlacentalGrowth” que serve como peça central desta investigação. Esta aplicação foi desenvolvida para permitir aos utilizadores analisar as curvas de crescimento de parâmetros placentares em função da IG. A aplicação oferece uma interface intuitiva que facilita a leitura, visualização e interação com os dados, além de calcular rácios relevantes para análise obstétrica. Com ênfase na usabilidade e acessibilidade, a aplicação foi construída no ambiente R, utilizando o pacote shiny para criar uma experiência interativa. Neste capítulo explora-se a arquitetura da aplicação, as funções reativas e os elementos da interface que garantem uma análise dinâmica e amigável para o utilizador. 6.1 Estratégia de desenvolvimento e ferramentas Foi desenvolvida uma aplicação web com recursos que permitem a análise de curvas de crescimento de referência de parâmetros placentares. Existem módulos para leitura, visualização e interação dos pontos adicionados nos gráficos das curvas de crescimento, leitura e visualização de informações relativas ao paciente e aos dados do processo e cálculo de rácios importantes para a análise de possíveis resultados obstétricos. A aplicação web desenvolvida, visa, portanto, implementar vários recursos que permitam a interpretação dos parâmetros D1,D2,PP,EP ePF em função da IG para assim ser possível realizar um relatório acerca do desenvolvimento da placenta. O desenvolvimento desta aplicação web teve como principal preocupação a facilidade de uso para o utilizador, sendo assim uma aplicação fácil de utilizar onde o utilizador não precisa de ter conhecimentos de nenhum tipo de linguagem de programação e proporcionando ao mesmo tempo, uma visualização gráfica dos dados e resultados, para que assim possam ser facilmente interpretáveis. Foi desenvolvida de forma a que todos os resultados, estejam presentes em forma de texto, tabela ou gráfico e que esses mesmos resultados possam ser transferidos para utilizações futuras. A linguagem de programação escolhida para o desenvolvimento da aplicação foi o R [TEAM,2005], 70
amostras foram recolhidas, indicando uma diversidade geográfica. Os números variam substancialmente entre os diferentes locais. Por exemplo, o local com o maior número de amostras é no Tâmega com 447 amostras, enquanto dos Açores existe apenas uma amostra. Quanto à paridade da mãe, Figura 10b, esta variável foi analisada quanto à sua distribuição nos dados amostrais. Os resultados revelaram uma variação no número de filhos das mães representadas neste estudo. A maioria das mães (875) tem um filho, seguidas por 629 mães com dois filhos e 415 com três filhos. Um número significativo de casos (133) possui valores desconhecidos para esta variável. Em relação, ao género do feto, Figura 10c, os dados mostram que a maioria das amostras (947) corresponde a fetos do sexo masculino, enquanto 862 amostras são de fetos do sexo feminino. Além disso, 14 amostras apresentam ambiguidade no género fetal, e 241 amostras têm o género do feto classificado como desconhecido. A análise da forma da placenta, Figura 10d, revela que a maioria (1839) das placentas apresenta uma forma normal (simples). Existem também casos menos comuns de placenta bilobada/polilobada (116) e placenta circunmarginada/circunvalada (106). A categoria “Membranácea” é a menos frequente (3). 0 100 200 300 400 Acores Alto Ave Alto Douro Alto Minho Baixo Vouga Barreiro/Montijo Boa Nova Castelo Branco CH Algarve CH Nordeste CHULC Cligest Cova Beira CS Boavista CUF Porto Douro e Vouga Faro Gaia Guarda HAL Castelo Branco HBA HGO Hluz HNS Rosário Hosp. Arrábida Gaia Hosp. Infante D. Pedro Hospor HP Algarve MAC Madeira Matosinhos Médio Ave Nordeste Ordem da Trindade Padre Américo Vale do Sousa PV/VC SAMS Santarém SB Sul e Ilhas SCM Espinho Tâmega Tâmega Sousa V. I. N. Sra da Lapa Vila Real Viseu Localização Contagem (a) Locais de recolha das amostras 0 250 500 750 123459 Paridade da mãe Contagem (b) Paridade da mãe 0 250 500 750 0 1 2 9 Género Contagem (c) Género do feto 0 500 1000 1500 0123 Forma da placenta Contagem (d) Forma da placenta Figura 10: Gráficos de barras para as variáveis, local, paridade da mãe, género do feto e forma da placenta. 77
O histograma da idade materna, Figura 11a, indica a distribuição das idades das mães nas observações do estudo. Este histograma revela que a maioria das mães tem idades compreendidas entre 25 e 40 anos, com o intervalo de 30 a 35 anos sendo o mais frequente, com aproximadamente 630 observações. Nota-se também que a distribuição é assimétrica, com um pico significativo na faixa etária de 30 a 35 anos. Quanto às variáveis efetivamente utilizadas neste estudo, é analisada a IG, a variável explicativa, e várias variáveis resposta, incluindo D1,D2,PP,EP ePF. A IG (12 a 41 semanas), representada no histograma da Figura 11b sugere uma distribuição do número de amostras por intervalo de IG assimétrica, tendo alguns intervalos com um número de amostras mais baixo. 0 200 400 600 10 20 30 40 50 Idade Materna (anos) Frequência (a) Idade materna 0 100 200 300 400 10 20 30 40 Idade gestacional (semanas) Frequência (b) Idade gestacional Figura 11: Histogramas para as variáveis idade materna e IG. As restantes variáveis foram analisadas na Figura 12 por gráficos de dispersão, uma ferramenta eficaz para explorar a disposição das amostras e compreender o comportamento dessas variáveis, para assim ser possível encontrar o modelo que melhor as representa. Para estas variáveis também é possível consultar tabelas com as estatísticas descritivas como a dimensão da amostra (N), média, desvio padrão (DP), mínimo (Min), máximo (Max), mediana, assimetria e curtose para cada IG (12–41 semanas). Quanto ao D1, Figura 12a, o gráfico de dispersão revela uma associação linear positiva. À medida que a IG aumenta, há uma tendência geral de aumento no valor do D1. Isso sugere uma possível relação positiva entre estas duas variáveis, indicando que, em média, o D1 tende a aumentar à medida que a gestação avança. Analisando a Tabela 3, é possível confirmar a relação positiva entre a IG e o D1 visualizada no gráfico 12a, indicando um desenvolvimento progressivo da placenta. Por exemplo, na semana 12, a média do D1 foi de 6,07 ±1,65 cm e esse valor aumentou gradualmente para 19,07 ± 3,92 cm na semana 41. Esse aumento substancial no D1 ao longo da gestação é acompanhado por um aumento leve na variabilidade dos dados, conforme indicado pelos valores do DP. A análise da mediana 78
complementa essas observações, mostrando uma tendência de aumento similar. É notável que os valores de assimetria permanecem próximos de zero na maioria das IG, sugerindo distribuições aproximadamente simétricas dos dados. Isso indica que o crescimento do D1 é equilibrado. Adicionalmente, a maioria dos valores de curtose está acima de 3, refletindo caudas mais pesadas (leptocurtose) que a distribuição Normal. Tabela 3: Estatísticas descritivas do D1 em cada IG. A tabela inclui os valores de dimensão da amostra (N), média, desvio padrão (DP), mínimo (Min), máximo (Max), mediana, assimetria e curtose. GA N Média DP Min Max Mediana Assimetria Curtose 12 54 6,07 1,65 2,00 12,00 6,00 0,42 5,10 13 64 6,57 1,52 4,00 9,00 7,00 -0,10 1,98 14 73 7,11 1,63 4,00 12,00 7,00 0,42 3,15 15 80 7,57 1,44 4,00 12,00 8,00 0,14 3,12 16 82 8,12 1,48 4,00 11,00 8,00 -0,46 3,64 17 76 9,41 1,55 6,00 14,00 9,00 0,45 3,82 18 80 9,20 1,73 4,00 17,00 9,00 0,65 7,59 19 82 10,06 1,95 5,00 14,00 10,00 -0,16 2,42 20 76 11,10 1,81 7,00 17,00 11,00 0,19 3,94 21 78 11,76 1,91 6,00 18,00 12,00 0,25 3,84 22 75 11,71 2,24 5,50 18,00 12,00 -0,03 3,26 23 80 12,66 2,38 8,00 22,00 13,00 0,84 4,97 24 70 12,84 2,32 9,00 19,00 13,00 0,75 3,67 25 49 12,61 2,48 7,00 18,50 13,00 -0,17 2,70 26 43 13,01 2,99 8,50 24,00 12,00 1,51 6,28 27 36 14,75 2,73 9,50 23,00 14,00 1,34 5,02 28 61 13,88 2,68 9,00 25,50 14,00 1,21 7,00 29 44 14,17 2,28 10,00 19,00 14,00 0,07 2,30 30 47 14,68 2,89 8,50 22,50 14,50 0,41 3,58 31 57 15,63 3,63 8,50 29,00 16,00 0,94 5,32 32 70 16,82 4,15 11,00 31,00 16,00 1,39 4,96 33 74 16,46 3,63 11,00 29,00 16,00 1,20 4,79 34 73 17,20 3,66 11,50 29,00 17,00 1,36 5,03 35 76 18,60 4,31 11,00 32,00 17,75 0,97 3,71 36 80 17,27 2,74 12,50 27,00 17,00 0,94 4,69 37 77 18,23 3,17 12,00 29,00 18,00 1,01 4,71 38 77 18,23 3,71 13,00 30,00 17,00 1,23 4,10 39 75 18,03 3,14 13,00 26,00 18,00 0,52 2,76 40 81 18,53 2,59 10,00 25,00 18,00 0,02 3,82 41 74 19,07 3,92 12,50 32,00 18,00 1,42 4,95 No gráfico de dispersão para o D2 em relação à IG, Figura 12b, observa-se uma tendência semelhante ao D1. À medida que a IG aumenta, há uma tendência geral de aumento no valor de D2. Isso sugere uma associação linear entre as variáveis, indicando que o D2 tende a aumentar à medida que a gestação progride. As estatísticas descritivas para o D2 são apresentadas na Tabela 4. Ao analisar os dados, 79
uma tendência clara se destaca: à medida que a IG avança, o D2 aumenta progressivamente. Esse aumento progressivo é coerente com o crescimento contínuo da placenta para acomodar as crescentes necessidades do feto em desenvolvimento. Por exemplo, na semana 12, a média do D2 foi de 4,37 ± 1,59 cm, e esse valor aumentou gradualmente para 16,59 ±3,03 cm na semana 41. Esse aumento notável é acompanhado por um ligeiro aumento na variabilidade dos dados, indicado pelo DP. A análise da mediana indica uma tendência de aumento similar. Quanto à assimetria, é possível verificar que os seus valores permaneçam próximos de zero na maioria das IG, sugerindo distribuições aproximadamente simétricas dos dados. Adicionalmente, a maioria dos valores de curtose está entre 2 e 5, o que indica que essas distribuições são mais concentradas no centro do que a distribuição normal. Tabela 4: Estatísticas descritivas do D2 em cada IG. A tabela inclui os valores de dimensão da amostra (N), média, desvio padrão (DP), mínimo (Min), máximo (Max), mediana, assimetria e curtose. GA N Média DP Min Max Mediana Assimetria Curtose 12 54 4,37 1,59 2,00 8,00 4,00 0,69 2,81 13 64 5,02 1,55 1,50 9,00 5,00 0,44 3,17 14 73 5,18 1,29 2,00 8,00 5,00 -0,07 2,93 15 80 5,74 1,48 2,50 10,00 6,00 0,02 2,70 16 82 6,26 1,58 2,00 9,00 6,00 -0,32 2,74 17 76 7,41 1,70 4,00 12,00 7,00 0,13 2,47 18 80 7,27 1,72 2,00 11,00 7,00 -0,25 2,82 19 82 8,24 1,91 3,00 12,50 8,00 -0,14 3,09 20 76 8,80 1,76 4,00 12,50 9,00 -0,10 2,76 21 78 9,53 1,80 4,00 13,00 10,00 -0,47 3,16 22 75 9,57 2,09 5,00 15,00 10,00 -0,09 2,72 23 80 10,78 2,05 5,00 16,00 11,00 -0,19 3,09 24 70 10,84 2,15 7,00 18,00 10,75 0,61 3,76 25 49 10,55 2,28 6,00 17,00 11,00 0,04 2,96 26 43 10,87 2,35 6,00 16,00 11,00 0,25 2,48 27 36 12,69 2,47 8,00 19,00 12,00 0,92 3,59 28 61 11,62 2,46 7,00 18,00 12,00 0,17 2,71 29 44 12,30 2,18 8,00 16,50 12,00 0,04 1,85 30 47 12,42 2,73 6,00 21,00 12,00 0,47 4,24 31 57 13,19 3,35 6,00 25,00 13,00 1,08 5,46 32 70 14,29 3,16 8,00 25,00 13,25 1,29 5,13 33 74 13,81 2,93 8,00 25,00 14,00 0,83 4,98 34 73 15,23 3,49 10,00 27,00 14,00 1,57 5,26 35 76 15,72 2,92 8,00 24,00 15,00 0,56 3,63 36 80 15,14 2,75 10,00 28,00 15,00 1,41 7,91 37 77 15,20 2,67 11,50 30,00 15,00 2,73 14,64 38 77 15,69 2,70 10,00 24,00 15,00 0,96 4,25 39 75 15,54 2,48 12,00 23,00 15,00 0,94 3,87 40 81 16,25 2,04 9,00 21,50 16,50 -0,34 4,05 41 74 16,59 3,03 10,00 26,50 16,00 0,83 4,50 80
Relativamente à EP, o gráfico de dispersão (Figura 12c) mostra uma relação menos clara com a IG. Embora haja alguma variação, não é evidente uma tendência de aumento ou diminuição da EP. Isso pode indicar que a espessura da placenta é influenciada por outros fatores além da IG. No que diz respeito às estatísticas descritivas presentes na Tabela 5, é possível verificar que existe um aumento na EP ao longo da IG, no entanto, este aumento não é tão significativo como para o D1 ou o D2. Uma vez que a EP aumentou até às 41 semanas, aproximadamente 110% do seu valor inicial médio, em contraste com o D2 que aumentou 279%. Os valores do DP indicam também uma variabilidade menor comparativamente às variáveis já analisadas. Quanto à assimetria, os dados são aproximadamente simétricos e apresentam leptocurtose indicado pelos valores maiores do que 3 de curtose e por isso, apresentam caudas pesadas. Tabela 5: Estatísticas descritivas da EP em cada IG. A tabela inclui os valores de dimensão da amostra (N), média, desvio padrão (DP), mínimo (Min), máximo (Max), mediana, assimetria e curtose. GA N Média DP Min Max Mediana Assimetria Curtose 12 54 1,26 0,46 0,50 2,80 1,20 0,99 4,65 13 64 1,28 0,40 0,50 2,50 1,20 0,43 3,50 14 73 1,41 0,39 0,50 2,20 1,50 0,04 2,57 15 80 1,56 0,43 0,70 3,00 1,50 0,88 4,70 16 82 1,66 0,52 0,50 3,50 1,50 0,95 5,30 17 76 1,76 0,47 0,50 3,00 1,73 0,28 3,43 18 80 1,87 0,60 1,00 4,50 1,70 1,75 7,23 19 82 1,87 0,63 1,00 4,00 1,80 0,99 4,06 20 76 1,78 0,40 0,75 3,00 1,80 0,21 3,39 21 78 1,95 0,46 0,30 3,00 2,00 -0,49 3,92 22 75 1,88 0,52 1,00 3,00 1,90 0,48 2,88 23 80 1,97 0,48 1,20 3,50 2,00 0,85 3,46 24 70 1,94 0,55 1,20 4,00 2,00 1,71 6,94 25 49 2,04 0,55 0,90 3,50 2,00 0,83 3,80 26 43 2,17 0,62 1,10 4,00 2,00 0,66 3,58 27 36 2,11 0,65 1,00 4,00 2,00 1,52 5,48 28 61 2,23 0,58 1,50 4,00 2,00 0,88 3,46 29 44 2,31 0,61 1,20 4,00 2,25 0,79 4,02 30 47 2,17 0,54 0,80 4,00 2,00 0,67 5,49 31 57 2,43 0,69 1,50 5,00 2,30 1,38 5,47 32 70 2,30 0,67 1,00 5,00 2,25 1,75 7,78 33 74 2,54 0,67 1,25 5,00 2,50 0,98 4,65 34 73 2,48 0,60 1,00 4,50 2,50 0,34 4,24 35 76 2,44 0,59 1,00 4,00 2,50 0,88 3,85 36 80 2,44 0,52 1,50 3,70 2,50 0,06 2,59 37 77 2,50 0,70 1,50 5,00 2,50 1,12 4,24 38 77 2,63 0,64 1,50 5,00 2,50 0,84 4,38 39 75 2,65 0,68 1,50 5,00 2,50 0,73 3,77 40 81 2,66 0,64 1,50 5,00 2,50 1,00 4,21 41 74 2,64 0,56 1,25 4,00 2,50 0,02 2,89 81
No gráfico de dispersão para o PP (Figura 12d), há uma tendência de aumento no PP à medida que a IG avança, sugerindo uma relação positiva. Com base nas estatísticas descritivas do PP (Tabela 6), é possível verificar que a média do PP aumenta significativamente com a IG, com valores oscilando entre 35,79 ±23,39 g e 474,42 ±107,05 g. Além disso, o DP, varia de forma considerável nos diferentes grupos de IG, refletindo níveis variados de variabilidade, especialmente nos estágios finais da gestação. Os valores mínimo e máximo do PP também mostram variações notáveis, como, por exemplo, nas 38 semanas pode variar entre 240g e 995g. Quanto à assimetria e curtose, esses valores também variam, indicando diferentes assimetrias e formas das distribuições dos dados. Alguns grupos apresentam distribuições muito assimétricas e um elevado grau de leptocurtose como é o caso das 17 semanas. Tabela 6: Estatísticas descritivas do PP em cada IG. A tabela inclui os valores de dimensão da amostra (N), média, desvio padrão (DP), mínimo (Min), máximo (Max), mediana, assimetria e curtose. GA N Média DP Min Max Mediana Assimetria Curtose 12 54 35,79 23,39 6,0 143 33,0 2,19 9,99 13 64 41,64 16,92 8,0 109 42,0 0,77 5,55 14 73 51,12 17,84 12,3 90 49,0 0,28 2,48 15 80 59,80 22,32 16,0 148 57,0 0,98 5,25 16 82 71,22 24,14 12,0 145 70,0 0,26 3,86 17 76 94,13 37,66 33,0 300 88,5 2,47 13,88 18 80 95,46 31,43 32,0 250 95,5 1,46 8,76 19 82 113,24 35,99 24,0 214 113,0 0,06 3,06 20 76 126,98 44,19 36,0 360 120,5 1,93 11,88 21 78 140,67 37,14 42,0 230 143,0 -0,12 3,27 22 75 143,86 39,01 64,0 302 140,0 0,94 5,64 23 80 171,16 43,22 52,0 327 172,5 0,14 4,76 24 70 169,29 55,58 73,0 398 153,0 1,28 5,80 25 49 180,57 70,16 73,0 343 185,0 0,25 2,33 26 43 190,67 71,35 85,0 379 190,0 0,51 2,70 27 36 216,25 73,59 72,0 466 220,0 0,65 5,13 28 61 206,80 68,81 86,0 355 203,0 0,37 2,44 29 44 254,61 88,80 123,0 510 241,5 0,70 3,12 30 47 249,10 77,00 88,0 435 247,0 0,22 2,89 31 57 280,81 90,19 94,0 496 294,0 -0,00 2,78 32 70 310,73 89,20 148,0 582 305,5 0,83 3,84 33 74 334,62 88,02 153,0 524 328,0 0,25 2,55 34 73 344,96 79,02 163,0 580 345,0 0,29 3,29 35 76 373,38 123,47 177,0 890 355,0 1,42 6,12 36 80 360,07 79,82 224,0 590 349,5 0,71 3,11 37 77 378,03 89,35 222,0 682 360,0 1,00 4,27 38 77 428,03 135,38 240,0 995 404,0 1,52 6,22 39 75 445,96 126,36 255,0 905 435,0 0,99 4,31 40 81 473,92 89,09 301,0 863 458,0 1,28 6,60 41 74 474,42 107,05 290,0 738 459,5 0,42 2,62 82
Por fim, o PF, representado na 12e, mostra uma tendência clara de aumento à medida que a IG avança. Isso é consistente com o desenvolvimento progressivo normal do feto. Observando a Tabela 7, em geral, verificou-se também um aumento notável. Na semana 12, o PF apresentou uma média de 23,77 ±38,60 g. À medida que a gestação progride, essa média aumenta significativamente, atingindo 3301,55 ±503,92 g na semana 41. Além disso, a mediana também segue essa tendência de aumento, indicando uma consistência desses resultados. A análise da assimetria mostra que, em geral, as distribuições dos dados são assimétricas devido a valores maiores que zero. Isso sugere uma maior concentração de valores menores relativamente à média, o que é coerente com o crescimento gradual do feto. A curtose, também apoia essa observação, mostrando vários valores superiores a 3. Tabela 7: Estatísticas descritivas do PF em cada IG. A tabela inclui os valores de dimensão da amostra (N), média, desvio padrão (DP), mínimo (Min), máximo (Max), mediana, assimetria e curtose. GA N Média DP Min Max Mediana Assimetria Curtose 12 54 23,77 38,60 5,70 281,00 16,25 5,84 38,42 13 64 28,72 20,61 6,00 173,00 27,00 5,44 38,84 14 73 45,15 16,87 10,50 92,00 46,00 0,13 2,81 15 80 68,09 32,09 12,00 193,40 70,50 0,57 4,53 16 82 100,71 43,87 14,00 191,00 98,35 0,11 2,39 17 76 164,23 52,08 33,00 315,00 168,00 -0,20 3,76 18 80 204,88 57,37 63,00 335,00 209,50 -0,32 3,53 19 82 259,97 84,90 29,00 449,00 269,00 -0,75 3,88 20 76 329,46 78,18 77,00 571,00 328,00 -0,34 4,77 21 78 401,82 83,96 110,00 567,00 409,50 -0,98 4,65 22 75 484,57 139,03 146,00 1305,00 489,00 2,38 17,93 23 80 558,34 104,50 313,00 833,00 562,50 -0,16 3,49 24 70 637,01 143,01 319,00 1118,00 642,50 0,05 4,11 25 49 673,89 334,22 135,00 2310,00 732,00 2,15 12,92 26 43 710,84 293,23 356,00 1880,00 640,00 2,23 9,24 27 36 910,90 189,81 470,00 1300,00 954,50 -0,46 3,02 28 61 934,85 267,50 297,00 1500,00 980,00 -0,32 2,85 29 44 1213,39 486,86 426,00 3100,00 1102,50 1,43 6,58 30 47 1267,34 349,70 540,00 2300,00 1275,00 0,34 3,33 31 57 1483,28 356,88 630,00 2380,00 1470,00 -0,09 3,02 32 70 1749,09 482,69 402,00 3765,00 1740,00 0,90 6,96 33 74 1928,49 388,52 755,00 3330,00 1960,00 0,14 4,99 34 73 2133,40 443,35 1190,00 3000,00 2100,00 -0,08 2,21 35 76 2334,57 558,02 1460,00 4470,00 2270,00 1,33 5,81 36 80 2456,01 453,46 1535,00 3420,00 2445,00 0,16 2,49 37 77 2574,39 515,95 1730,00 4780,00 2450,00 2,14 9,73 38 77 2826,90 576,36 1830,00 4800,00 2720,00 1,02 4,26 39 75 2890,00 584,18 1520,00 4535,00 2830,00 0,19 2,94 40 81 3245,64 468,57 2280,00 4745,00 3230,00 0,09 3,06 41 74 3301,55 503,92 2280,00 4880,00 3312,50 0,28 3,04 83
2 4 6 8 10 12 14 16 18 20 22 24 26 28 30 32 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 Idade gestacional (semanas) Diâmetro 1 (cm) (a) Diâmetro 1 2 4 6 8 10 12 14 16 18 20 22 24 26 28 30 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 Idade gestacional (semanas) Diâmetro 2 (cm) (b) Diâmetro 2 0.5 1.0 1.5 2.0 2.5 3.0 3.5 4.0 4.5 5.0 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 Idade gestacional (semanas) Espessura placentar (cm) (c) Espessura placentar 0 100 200 300 400 500 600 700 800 900 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 Idade gestacional (semanas) Peso placentar (g) (d) Peso placentar 0 500 1000 1500 2000 2500 3000 3500 4000 4500 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 Idade gestacional (semanas) Peso fetal (g) (e) Peso fetal Figura 12: Gráficos de dispersão representando a relação entre a IG e vários parâmetros (D1,D2,PP,EP ePF). Cada ponto nos gráficos representa uma observação individual de uma amostra de 2064 placentas. Foi também realizada uma avaliação da normalidade das variáveis, que serão utilizadas para construir as curvas de crescimento, D1,D2,PP,EP ePF. A normalidade é uma suposição fundamental em muitas análises estatísticas, e a sua validade desempenha um papel crucial na interpretação dos resultados. Na Figura 13 é possível visualizar os gráficos Q-Q e na Tabela 8estão disponíveis os resultados do teste de Shapiro-Wilk, com um nível de significância de 0,05, para a normalidade das variáveis. Os resultados sugerem que as distribuições de todas as variáveis não seguem uma distribuição normal, como indicado 84
por desvios visuais nos gráficos Q-Q e valores-p significativamente baixos no teste de Shapiro-Wilk, < 2×10−16 para todas as variáveis, exceto o D2 que teve um valor-p de 6×10−15. Logo, há uma rejeição clara da normalidade. É importante destacar que qualquer desvio da normalidade pode ter implicações nas análises estatísticas subsequentes, e, portanto, a sua consideração é fundamental para uma interpretação precisa dos resultados deste estudo. 0 10 20 30 −2 0 2 Quantis teóricos Quantis da amostra (a) Diâmetro 1 0 10 20 30 −2 0 2 Quantis teóricos Quantis da amostra (b) Diâmetro 2 0 1 2 3 4 5 −2 0 2 Quantis teóricos Quantis da amostra (c) Espessura placentar 0 500 1000 −2 0 2 Quantis teóricos Quantis da amostra (d) Peso placentar −2500 0 2500 5000 −2 0 2 Quantis teóricos Quantis da amostra (e) Peso fetal Figura 13: Gráficos Q-Q para a avaliação de normalidade de D1,D2,PP,EP ePF. 85
Tabela 8: Resultados do teste de Shapiro-Wilk para a avaliação da normalidade de D1,D2,PP,EP ePF. Variável Valor-p Diâmetro 1 <2×10−16 Diâmetro 2 6×10−15 Espessura placentar <2×10−16 Peso placentar <2×10−16 Peso fetal <2×10−16 7.2 Testes de significância entre géneros Na análise estatística realizada visando identificar diferenças estatisticamente significativas entre as médias dos parâmetros D1,D2,PP,EP ePF para fetos femininos e masculinos em cada IG, foi aplicado o teste-t de Student, com um nível de significância de 0,05. Os valores-p resultantes de cada teste-t podem ser encontrados no Apêndice C. Estes valores têm como propósito indicar se as divergências nas médias das variáveis entre os grupos de fetos femininos e masculinos possuem relevância estatística, ou seja, se o valor-p é inferior a 0,05. Além disso, para uma representação visual dos valores médios e os seus intervalos de confiança de 95%, é possível consultar a Figura 14. Os resultados obtidos apresentam diferentes graus de significância. Em certas IG e variáveis, foram constatadas diferenças estatisticamente significativas entre os géneros feminino e masculino. Por exemplo, para o D1, observou-se uma diferença estatisticamente significativa na semana 39 (valor-p = 0,04). Já para o D2, verificaram-se tais diferenças nas semanas 12 (valor-p = 0,009), 14 (valor-p = 0,03) e 39 (valor-p = 0,006). A EP apresentou diferenças estatisticamente significativas nas semanas 14 (valor-p = 0,02), 20 (valor-p = 0,04) e 40 (valor-p = 0,02). Por fim, o PF revelou diferenças significativas nas semanas 16 (valor-p = 0,009) e 40 (valor-p = 0,002). Importante mencionar que o PP não apresentou diferenças significativas em nenhuma IG. 86
Tabela 10: Resumo do desempenho do modelo final do D1, método GAMLSS com a função de alisamento P-splines e a distribuição BCT. São comparadas as percentagens nominais e de amostra em ou abaixo de cada percentil. Percentil nominal 3 10 25 50 75 90 97 GAMLSS (BCT) 3,05 10,37 25,05 50,29 75,63 90,02 96,75 7.3.2 Diâmetro 2 No desenvolvimento das curvas de crescimento do parâmetro D2, começou-se por realizar uma minuciosa avaliação do desempenho de várias funções de alisamento, sem associar nenhuma distribuição específica ao modelo. A Tabela 11 sintetiza os resultados dessa avaliação. As redes neurais sobressaíram com um R2 de 0,723, no entanto, os outros parâmetros tiveram um desempenho pior comparativamente aos outros modelos com MSE de 4,588, AIC de 9424 e BIC de 9525. De modo geral, as P-splines apresentaram um ajuste melhor com um R2de 0,722, MSE de 4,568, AIC de 9407 e BIC de 9454. As splines cúbicas e Loess tiveram um desempenho semelhante com valores de R2de 0,721 e 0,720, MSE de 4,568 e 4,570, AIC de 9414 e 9417 e BIC de 9447 e 9449. Além dessas métricas tradicionais, aplicaram-se critérios de diagnóstico gráficos. Na Figura 18, é possível visualizar os critérios referentes à função de alisamento P-splines , que se assemelham de uma forma geral aos critérios de todas as outras funções de alisamento testadas. O worm plot revela a presença de diversos pontos fora dos intervalos de confiança de 95%, sugerindo que o ajuste pode ser inadequado. Além disso, a forma em S indica a existência de leptocurtose. As estatísticas Z também indicam possíveis inadequações no modelo, com muitos valores de |Z|>2. No que diz respeito aos gráficos de resíduos, para o gráfico relativo aos valores ajustados, os resíduos formam padrões verticais distintos e apresentam um desvio notável da normalidade. Após determinar a função de alisamento mais adequada, foram avaliadas diferentes distribuições, conforme detalhado na Tabela 11. Na generalidade todos os modelos indicaram um bom desempenho, nomeadamente o GAMLSS com BCT eLMST. Estes modelos apresentaram valores de R2de 0,765 e 0,768, MSE de 4,398 e 4,394, AIC de 9029 e 9014 e BIC de 9142 e 9142. Quanto aos restantes modelos, os valores das métricas não diferiram substancialmente e apresentaram de modo geral um bom ajuste e parcimónia. À primeira vista, qualquer um destes modelos poderia representar a natureza dos dados. Ao analisar os resultados das técnicas de diagnóstico gráficas, observamos que o modelo BCT, ilustrado na Figura 19, se destacou com um ajuste notável. O worm plot apresentou pontos e uma 93
825 860 1081 1210 1295 1303 1377 1459 1543 1596 1666 1739 1935 −3 −2 −1 0 1 2 3 −4 −2 0 2 4 Unit normal quantile Deviation (a) Worm plot 11.5 to 15.5 15.5 to 17.5 17.5 to 20.5 20.5 to 23.5 23.5 to 26.5 26.5 to 30.5 30.5 to 33.5 33.5 to 36.5 36.5 to 39.5 39.5 to 41.5 Z1 Z2 Z3 Z4 Z−Statistics (b) Estatísticas Z 4 6 8 10 12 14 16 −2 0 2 4 6 Against Fitted Values Fitted Values Quantile Residuals 0 500 1000 1500 2000 −2 0 2 4 6 Against index index Quantile Residuals −4 −2 0 2 4 6 0.0 0.2 0.4 Density Estimate Quantile. Residuals Density −3 −2 −1 0 1 2 3 −2 0 2 4 6 Normal Q−Q Plot Theoretical Quantiles Sample Quantiles (c) Resíduos Figura 18: Critérios de avaliação de qualidade de ajuste ( worm plot , estatísticas Z e gráficos de resíduos) para o modelo GAMLSS do D2 com apenas a função de alisamento P-splines . linha de ajuste próximos da linha de referência horizontal, com mais de 95% dos pontos nos intervalos de confiança. As estatísticas Z também indicaram um bom ajuste, com apenas dois valores de |Z|>2para Z4. Quanto aos resíduos, continuaram a exibir um comportamento em linhas verticais para os valores ajustados, indicando heterogeneidade na variância dos resíduos em diferentes partes da faixa de valores ajustados. Apresentaram também uma aproximação da normalidade, como pode-se constatar pelos dois gráficos inferiores em 19c. 94
1295 1935 2019 −0.6 −0.3 0.0 0.3 0.6 −4 −2 0 2 4 Unit normal quantile Deviation (a) Worm plot 11.5 to 14.5 14.5 to 17.5 17.5 to 19.5 19.5 to 22.5 22.5 to 24.5 24.5 to 28.5 28.5 to 32.5 32.5 to 34.5 34.5 to 37.5 37.5 to 39.5 39.5 to 41.5 Z1 Z2 Z3 Z4 Z−Statistics (b) Estatísticas Z 4 6 8 10 12 14 16 −3 −1 1 2 3 Against Fitted Values Fitted Values Quantile Residuals 0 500 1000 1500 2000 −3 −1 1 2 3 Against index index Quantile Residuals −4 −2 0 2 0.0 0.1 0.2 0.3 0.4 Density Estimate Quantile. Residuals Density −3 −2 −1 0 1 2 3 −3 −1 1 2 3 Normal Q−Q Plot Theoretical Quantiles Sample Quantiles (c) Resíduos Figura 19: Critérios de avaliação de qualidade de ajuste ( worm plot , estatísticas Z e gráficos de resíduos) para o modelo GAMLSS do D2 com a função de alisamento P-splines e a distribuição BCT. O modelo LMST, presente no Apêndice E, para o worm plot não apresentou um ajuste tão bom quanto oGAMLSS com BCT, como pode-se ver pela forma ligeiramente em S, indicando possível platicurtose, no entanto, para as estatísticas Z não apresentou nenhum valor de |Z|acima de dois, indicando um bom ajuste. Os resíduos têm um comportamento como GAMLSS BCT e aproximação à normalidade. O modelo GAMLSS com JSU também teve um bom ajuste, identificado pelo worm plot semelhante a LMST. Para os restantes modelos, os ajustes não foram tão promissores, dado que foi possível verificar várias inadequações nos diversos diagnósticos. Os modelos GAMLSS com BCCG,BCPE eLMS eLMSP apresentaram para os worm plot formas claras em S, que indicam leptocurtose para BCCG, BCPE,LMS eLMSP. As estatísticas Z também apresentaram várias situações em que |Z|>2, nome95
adamente BCCG eLMS que mostraram 6 casos. LMSP, não apresentou nenhuma inadequação para as estatísticas Z. No que diz respeito aos resíduos, estes mostraram o mesmo comportamento em linhas verticais no gráfico dos valores ajustados e uma aproximação à normalidade. Tabela 11: Métricas de desempenho do modelo para o D2 em diferentes métodos para diversas funções de alisamento e distribuições. A tabela exibe o R2, o MSE, o AIC e o BIC. R2MSE AIC BIC Funções de alisamento P-splines 0,722 4,568 9407 9454 Splines cúbicas 0,721 4,568 9414 9447 Redes neurais 0,723 4,588 9424 9525 Loess 0,720 4,570 9417 9449 Distribuições GAMLSS (BCCG) 0,763 4,404 9046 9151 GAMLSS (BCT) 0,765 4,398 9029 9142 GAMLSS (BCPE) 0,761 4,399 9033 9145 GAMLSS (JSU) 0,762 4,407 9065 9140 LMS 0,763 4,404 9046 9151 LMST 0,768 4,394 9014 9142 LMSP 0,764 4,392 9014 9134 A Figura 20 exibe as curvas de crescimento de percentis geradas pelo modelo mais promissor, que combina GAMLSS com BCT e P-splines . Estas curvas refletem o comportamento dos dados, representados pelos pontos em cinzento no gráfico. Os valores numéricos correspondentes a cada percentil em diferentes intervalos gestacionais podem ser encontrados no Apêndice E. Como avaliação final do modelo, a Tabela 12 apresenta as percentagens da amostra que se encontram no mesmo valor ou abaixo de cada uma das curvas ajustadas. É notável a proximidade entre as percentagens nominais e as observadas na amostra, indicando um bom ajuste das curvas de percentis. As curvas de crescimento de percentis para o segundo melhor modelo podem ser consultadas no Apêndice Ee são visualmente semelhantes àquelas obtidas com o GAMLSS. 96
2 4 6 8 10 12 14 16 18 20 22 24 26 28 30 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 Idade gestacional (semanas) Diâmetro 2 (cm) 3 10 25 50 75 90 97 Figura 20: Valores observados do D2 representados em função da IG para o modelo final GAMLSS com a função de alisamento P-splines e a distribuição BCT, com sete curvas de percentis ajustadas (3º, 10º, 25º, 50º, 75º, 90º e 97º). Tabela 12: Resumo do desempenho do modelo final do D2, método GAMLSS com a função de alisamento P-splines e a distribuição BCT. São comparadas as percentagens nominais e de amostra em ou abaixo de cada percentil. Percentil nominal 3 10 25 50 75 90 97 GAMLSS (BCT) 3,00 9,21 24,37 49,08 74,61 90,07 96,56 7.3.3 Espessura placentar No processo de desenvolvimento das curvas de crescimento para a EP, realizou-se uma análise abrangente do desempenho de várias funções de alisamento, sem a imposição de uma distribuição específica no modelo como pode ser visualizado na Tabela 13. Para as P-splines , observou-se um R2de 0,342, um MSE de 1,698, um AIC de 3506 e um BIC de 3545. As redes neurais apresentaram um R2de 0,343, um MSE de 1,700, um AIC de 3513 e um BIC de 3581. No caso das splines cúbicas e de Loess , registou-se um R2de 0,341 e 0,340, um MSE de 1,699 e 1,700, um AIC de 3508 e 3509 e um BIC de 3541 e 3541. As P-splines indicam um melhor ajuste geral, apesar de as redes neurais terem um R2 ligeiramente mais elevado, as outras métricas apresentam, resultados menos favoráveis. Analisando os critérios de diagnóstico gráficos para a função de alisamento P-splines , na Figura 21 , é possível notar que estes se assemelham aos critérios aplicados a todas as outras funções de alisamento testadas. 97
98 289 347 537 565 743 913 1022 −1 0 1 −4 −2 0 2 4 Unit normal quantile Deviation (a) Worm plot 11.5 to 15.5 15.5 to 17.5 17.5 to 20.5 20.5 to 23.5 23.5 to 26.5 26.5 to 30.5 30.5 to 33.5 33.5 to 36.5 36.5 to 39.5 39.5 to 41.5 Z1 Z2 Z3 Z4 Z−Statistics (b) Estatísticas Z 1.2 1.4 1.6 1.8 2.0 2.2 2.4 2.6 −2 0 2 4 Against Fitted Values Fitted Values Quantile Residuals 0 500 1000 1500 2000 −2 0 2 4 Against index index Quantile Residuals −2 0 2 4 0.0 0.2 0.4 Density Estimate Quantile. Residuals Density −3 −2 −1 0 1 2 3 −2 0 2 4 Normal Q−Q Plot Theoretical Quantiles Sample Quantiles (c) Resíduos Figura 21: Critérios de avaliação de qualidade de ajuste ( worm plot , estatísticas Z e gráficos de resíduos) para o modelo GAMLSS da EP com apenas a função de alisamento P-splines . O gráfico worm plot chama a atenção para a presença de vários pontos que se encontram fora dos intervalos de confiança de 95%. Este cenário sugere que o ajuste do modelo pode ser inadequado. Ademais, a curvatura no gráfico sugere a possível presença de leptocurtose, uma característica que requer atenção. Outra abordagem utilizada envolveu o uso de estatísticas Z, nas quais muitos valores de |Z| excederam o limiar de 2, conforme indicado pelos quadrados presentes nos círculos. Esta observação sugere que o modelo pode apresentar inadequações relativamente a vários aspetos, incluindo variância, assimetria e curtose. No que se refere aos gráficos de resíduos, estes mostraram um comportamento com linhas verticais ao longo do gráfico em relação aos valores ajustados e exibiram um desvio notável relativamente à suposição de normalidade. 98
Após a função de alisamento mais apropriada ser identificada, passou-se a examinar diversas distribuições, conforme descrito na Tabela 13. Os vários modelos apresentaram métricas muito semelhantes entre si, por exemplo, GAMLSS com BCT eJSU eLMST eLMSP com um valor de R2de 0,390, indicando que os modelos conseguiram capturar 39% da variação nos dados, sugerindo um ajuste razoável. Quanto aos restantes valores destes modelos, MSE variou entre 1,551 e 1,553, AIC entre 3205 e 3211 e BIC de 3262 a 3288. Para os restantes modelos, GAMLSS com BCCG eBCPE eLMSP apresentaram métricas ligeiramente menos favoráveis, no entanto, tiveram ajustes também razoáveis. Ao examinar-se os resultados das análises gráficas de diagnóstico, nota-se que o modelo LMST, que está representado na Figura 22, destacou-se com um bom desempenho. 1012 1076 1596 −0.4 0.0 0.4 −4 −2 0 2 4 Unit normal quantile Deviation (a) Worm plot 11.5 to 15.5 15.5 to 17.5 17.5 to 20.5 20.5 to 23.5 23.5 to 26.5 26.5 to 30.5 30.5 to 33.5 33.5 to 36.5 36.5 to 39.5 39.5 to 41.5 Z1 Z2 Z3 Z4 Z−Statistics (b) Estatísticas Z 1.2 1.4 1.6 1.8 2.0 2.2 2.4 2.6 −3 −1 1 2 3 Against Fitted Values Fitted Values Quantile Residuals 0 500 1000 1500 2000 −3 −1 1 2 3 Against index index Quantile Residuals −4 −2 0 2 0.0 0.1 0.2 0.3 0.4 Density Estimate Quantile. Residuals Density −3 −2 −1 0 1 2 3 −3 −1 1 2 3 Normal Q−Q Plot Theoretical Quantiles Sample Quantiles (c) Resíduos Figura 22: Critérios de avaliação de qualidade de ajuste ( worm plot , estatísticas Z e gráficos de resíduos) para o modelo LMST da EP com a função de alisamento P-splines . 99
O worm plot sugeriu um bom ajuste do modelo, uma vez que a maioria dos pontos está entre as faixas de confiança elípticas aproximadas de 95%. As estatísticas Z também apontaram para um bom ajuste, sem nenhum valor de |Z|>2. Relativamente aos resíduos, eles ainda mostraram uma tendência de exibir um comportamento em linhas verticais em relação aos valores ajustados. Além disso, observou-se uma aproximação à normalidade, como evidenciado pelos dois gráficos inferiores na Figura 22c. Já o modelo GAMLSS com BCT, disponível no Apêndice F, apresentou um ajuste ligeiramente menos satisfatório quando comparado ao LMST, como evidenciado por dois valores de |Z|>2para as estatísticas Z, porém o worm plot e os resíduos apresentaram uma disposição praticamente igual a LMST. Os modelos GAMLSS com BCPE eJSU eLMSP também tiveram um diagnóstico favorável com worm plots e resíduos semelhantes aos de LMST, mas as estatísticas Z apresentaram mais casos de inadequações. Por outro lado, para os modelos GAMLSS com BCCG eLMS, os ajustes não se mostraram tão promissores. Os worm plot mostraram uma curvatura em forma de S indicando leptocurtose e as estatísticas Z apresentaram muitos casos em que |Z|>2, por exemplo, para BCCG em que existem 11 casos. Já os resíduos tiveram o mesmo comportamento que os outros modelos. Tabela 13: Métricas de desempenho do modelo para a EP em diferentes métodos para diversas funções de alisamento e distribuições. A tabela exibe o R2, o MSE, o AIC e o BIC. R2MSE AIC BIC Funções de alisamento P-splines 0,342 1,698 3506 3545 Splines cúbicas 0,341 1,699 3508 3541 Redes neurais 0,343 1,700 3513 3581 Loess 0,340 1,700 3509 3541 Distribuições GAMLSS (BCCG) 0,379 1,574 3254 3316 GAMLSS (BCT) 0,390 1,553 3211 3283 GAMLSS (BCPE) 0,378 1,553 3211 3274 GAMLSS (JSU) 0,390 1,551 3205 3262 LMS 0,379 1,574 3254 3316 LMST 0,390 1,552 3210 3288 LMSP 0,390 1,551 3205 3262 100
A Figura 23 ilustra as curvas de crescimento de percentis geradas pelo modelo mais promissor, LMST. Estas curvas representam precisamente o comportamento dos dados, ilustrados pelos pontos em cinzento no gráfico. Os detalhes numéricos específicos em relação a cada percentil em diferentes IG, estão disponíveis no Apêndice F. A Tabela 14 destaca as percentagens da amostra que coincidem com ou estão abaixo de cada uma das curvas ajustadas. A notável concordância entre as percentagens nominais e as observações na amostra sugere um bom ajuste das curvas de percentis. Para visualizar as curvas de crescimento de percentis do segundo melhor modelo, consulte o Apêndice F. É importante notar que estas curvas são visualmente similares àquelas obtidas com o modelo LMST, reforçando a qualidade do ajuste de ambos os modelos. 0 1 1 2 2 3 3 4 4 5 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 Idade gestacional (semanas) Espessura placentar (mm) 3 10 25 50 75 90 97 Figura 23: Valores observados da EP representados em função da IG para o modelo final LMST com a função de alisamento P-splines , com sete curvas de percentis ajustadas (3º, 10º, 25º, 50º, 75º, 90º e 97º). Tabela 14: Resumo do desempenho do modelo final da EP, método LMST com a função de alisamento P-splines . São comparadas as percentagens nominais e de amostra em ou abaixo de cada percentil. Percentil nominal 3 10 25 50 75 90 97 LMST 3,59 8,67 27,33 49,32 74,37 89,83 96,27 101
7.3.4 Peso placentar No processo de desenvolvimento das curvas de crescimento do parâmetro PP, iniciou-se com uma análise de várias funções de alisamento, sem vincular uma distribuição específica ao modelo. A Tabela 15 resume os resultados dessa avaliação. As P-splines apresentaram o maior valor de R2de 0,783, e valores de MSE,AIC eBIC de 11,480, 23621 e 23659, respetivamente. Os restantes modelos, apresentaram valores iguais de R2e os modelos splines cúbicas e Loess apresentaram valores iguais para as restantes métricas, MSE de 11,470, AIC de 23622 e 23623 e BIC de 23655. As redes neurais, tiveram valores um pouco mais altos de MSE,AIC eBIC de 11,510, 23637 e 23705. Além destas métricas, aplicaramse critérios de diagnóstico gráficos. Na Figura 24, é possível examinar os critérios relacionados à função de alisamento P-splines , que se assemelham aos critérios de todas as outras funções de alisamento testadas. 201 815 897 1016 1038 1158 1224 1339 1382 −2.5 0.0 2.5 −4 −2 0 2 4 Unit normal quantile Deviation (a) Worm plot 11.5 to 15.5 15.5 to 17.5 17.5 to 20.5 20.5 to 23.5 23.5 to 26.5 26.5 to 30.5 30.5 to 33.5 33.5 to 36.5 36.5 to 39.5 39.5 to 41.5 Z1 Z2 Z3 Z4 Z−Statistics (b) Estatísticas Z 100 200 300 400 500 −2 0 2 4 6 8 Against Fitted Values Fitted Values Quantile Residuals 0 500 1000 1500 2000 −2 0 2 4 6 8 Against index index Quantile Residuals −202468 0.0 0.2 0.4 0.6 Density Estimate Quantile. Residuals Density −3 −2 −1 0 1 2 3 −2 0 2 4 6 8 Normal Q−Q Plot Theoretical Quantiles Sample Quantiles (c) Resíduos Figura 24: Critérios de avaliação de qualidade de ajuste ( worm plot , estatísticas Z e gráficos de resíduos) para o modelo GAMLSS do PP com apenas a função de alisamento P-splines . 102
Tabela 17: Métricas de desempenho do modelo para o PF em diferentes métodos para diversas funções de alisamento e distribuições. A tabela exibe o R2, o MSE, o AIC e o BIC. R2MSE AIC BIC Funções de alisamento P-splines 0,914 14,540 29897 29952 Splines cúbicas 0,914 14,530 29909 29943 Loess 0,914 14,530 29914 29945 Distribuições GAMLSS (BCT) 0,961 13,100 26696 26872 GAMLSS (JSU) 0,968 13,100 26788 26918 LMST 0,962 13,110 26679 26874 0 500 1000 1500 2000 2500 3000 3500 4000 4500 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 Idade gestacional (semanas) Peso fetal (g) 3 10 25 50 75 90 97 Figura 29: Valores observados do PF representados em função da IG para o modelo final LMST com a função de alisamento P-splines , com sete curvas de percentis ajustadas (3º, 10º, 25º, 50º, 75º, 90º e 97º). Tabela 18: Resumo do desempenho do modelo final do PF, método LMST com a função de alisamento P-splines . São comparadas as percentagens nominais e de amostra em ou abaixo de cada percentil. Percentil nominal 3 10 25 50 75 90 97 LMST 3,30 11,39 25,44 48,35 74,81 90,65 97,63 109
7.4 Aplicação web Após a escolha das curvas de crescimento de percentis mais adequadas para os parâmetros D1,D2,EP, PP ePF, foi desenvolvida uma aplicação web , tal como descrito no Capítulo 6. Esta aplicação permite aos utilizadores explorar e analisar interativamente as curvas de referência para os vários parâmetros. Antes de entrar-se em detalhes sobre os resultados que podem ser obtidos através desta aplicação, é importante entender a estrutura e as funcionalidades da aplicação. A aplicação “PlacentalGrowth” foi projetada com uma estrutura intuitiva e amigável para facilitar a sua utilização por profissionais de saúde e investigadores. Ao iniciar a aplicação, o utilizador é recebido com um modal de boas-vindas que fornece uma breve introdução e explica o que pode ser feito na aplicação, como pode ser visualizado na Figura 30. Figura 30: Modal de Boas-Vindas — Introdução à aplicação. O modal de boas-vindas é o ponto de partida para o utilizador, orientando-o sobre como utilizar a aplicação para analisar vários parâmetros ao longo da IG. Ele oferece uma visão geral das funcionalidades e recursos disponíveis. Além disso, a página inicial da aplicação, ilustrada na Figura 31, serve como um recurso informativo para o utilizador, proporcionando-lhe contexto sobre a aplicação e o projeto que levou ao seu desenvolvimento. Para ilustrar a utilização da aplicação, considere-se um estudo de caso hipotético envolvendo uma paciente grávida. 110
Figura 31: Visão geral da Página Inicial da aplicação. O utilizador pode dar início à análise, através da página “Gráficos”, visível na Figura 32, onde é solicitado que insira informações do processo do paciente em estudo. Para este estudo de caso consideraram-se os seguintes dados iniciais: Número de processo — 549667, Nome — Maria Silva, Idade — 34 anos e Data de avaliação — 09/10/2023. É possível também adicionar informações extra que sejam relevantes, neste caso não foi necessário. Figura 32: Página Gráficos — Introdução das informações do processo do paciente na aba “Informações”. 111
Posteriormente à inserção das informações do paciente, o utilizador pode prosseguir para a inclusão dos parâmetros que serão analisados. Na Figura 33, é possível visualizar a introdução das informações do processo para o parâmetro D1 e o respetivo gráfico da curva de crescimento com os pontos adicionados pelo utilizador. Esta aplicação oferece ao utilizador a flexibilidade de adicionar esses pontos de duas maneiras: via carregamento de um ficheiro CSV ou manualmente. Neste caso, já existia informação prévia da paciente para as 14 e 25 semanas de gestação, por isso, foi carregado um ficheiro CSV. Ao selecionar a opção “Sim” e escolhendo o ficheiro, a aplicação processa os dados do CSV e exibe-os na forma de pontos adicionados aos gráficos das curvas de crescimento. Além disso, o utilizador consegue inserir pontos manualmente, permitindo uma personalização completa dos dados. Por exemplo, neste estudo de caso, acrescentaram-se manualmente pontos de dados referentes à 33.ª semana de gestação. Na Figura 33, está ilustrado como o utilizador pode visualizar as curvas de crescimento de referência com os pontos adicionados pelo utilizador para o parâmetro D1. A aplicação permite a interação com os pontos, fornecendo informações detalhadas quando o utilizador adiciona um ponto. Por exemplo, quando o utilizador adicionar o ponto relativo à 33.ª semana para o D1, aparece a seguinte mensagem “O ponto encontra-se entre o 25.º e o 50.º percentil”, a informar o percentil onde o ponto caiu. É também possível eliminar pontos dos gráficos, caso o utilizar se engane, reiniciar completamente as entradas e gráficos e guardar os pontos adicionadas aos gráficos num ficheiro CSV para posterior análise, selecionando a caixa “Deseja salvar os pontos num ficheiro CSV?”. Figura 33: Página Gráficos — Introdução dos dados para o parâmetro D1 e visualização do gráfico com a curva de crescimento. 112
Após todas as informações e pontos serem adicionados na página “Gráficos”, as suas informações podem ser consultadas na página “Informações”. Esta página oferece uma visão detalhada e tabular de todas as informações associadas aos pontos adicionados pelo utilizador aos gráficos de crescimento placentar. Para cada ponto inserido, a página “Informações” exibe tabelas detalhadas que incluem informações essenciais, como a IG, o valor do parâmetro em estudo (por exemplo, D1) e o percentil correspondente. Isso permite ao utilizador aceder rapidamente aos detalhes de cada ponto e compreender como eles se posicionam nas curvas de referência. A interface da tabela é projetada para ser intuitiva e de fácil leitura. O utilizador pode navegar pelas tabelas conforme a ordem no qual os pontos foram inseridos ou com base em qualquer uma das outras colunas da tabela, facilitando a localização e comparação de dados específicos. Na Figura 34 é possível verificar a tabela de informações do caso de estudo para o parâmetro D1. Figura 34: Página Informações — Visualização da tabela de informações para o parâmetro D1. É também possível fazer uma análise mais aprofundada das métricas críticas relacionadas ao desenvolvimento da placenta durante a gravidez. Na página “Rácios” o utilizador consegue calcular e examinar dois rácios fundamentais: o rácio PF/PP (Peso Fetal/Peso Placentar) e o rácio PP/PF (Peso Placentar/- Peso Fetal). Na Figura 35, é possível visualizar o cálculo dos rácios relacionados a este estudo de caso. Para calcular estes rácios o utilizador deve escolher os valores que deseja incluir no cálculo dos rácios. Esta seleção é feita clicando nas linhas correspondentes à IG desejada e ao valor do parâmetro, PP ou PF. As linhas selecionadas serão destacadas em azul, indicando que estão prontas para o cálculo. Uma 113
vez que os valores forem escolhidos, basta clicar no botão “Calcular Rácios”. A aplicação processará instantaneamente os dados selecionados e calculará os dois rácios mencionados acima, proporcionando uma análise imediata dos resultados. Os valores dos rácios calculados são apresentados numa tabela, tornando-os facilmente acessíveis e prontos para interpretação. Figura 35: Página Rácios — Visualização da tabela com os valores dos rácios calculados. A aplicação “PlacentalGrowth” oferece uma funcionalidade que permite aos utilizadores criar relatórios em PDF abrangentes contendo todas as informações e análises realizadas durante a sua sessão na aplicação. Este relatório é uma ferramenta valiosa para documentar e compartilhar os resultados da análise de parâmetros placentares ao longo da gestação. O Relatório em PDF Inclui: •Informações: Informações acerca da aplicação e dados do processo do paciente. •Gráficos das curvas de crescimento de referência: Todos os gráficos exibidos na página “Gráficos”, incluindo os pontos adicionados pelo utilizador, são automaticamente incluídos no relatório em PDF. Isso permite ao utilizador capturar visualmente o crescimento da placenta e do feto ao longo da gestação. •Tabelas de Informações: As tabelas da página “Informações” que apresentam dados detalhados dos pontos adicionados aos gráficos também fazem parte do relatório. Isso inclui alguns dados da aba “Informações”, os valores de IG e parâmetros correspondentes e o percentil onde cada ponto caiu. 114
•Tabela de Rácios Calculados: Se o utilizador realizar cálculos de rácios na página “Rácios”, a tabela dos rácios calculados também será incluída no relatório em PDF. Após concluir a análise e interação com a aplicação, o utilizador pode clicar no botão “Transferir relatório PDF” na página “Gráficos”. O relatório em PDF será automaticamente gerado com base em todas as informações inseridas e ações realizadas durante a sessão do utilizador. O relatório é salvo no formato PDF, tornando-o facilmente acessível e legível numa variedade de dispositivos. O relatório gerado neste estudo de caso está disponível para consulta no Apêndice H. Por fim, o utilizador pode consultar a página de “Ajuda” da aplicação, ilustrada na Figura 36. Nesta página é possível consultar um guia de utilização que fornece uma explicação detalhada de como utilizar a aplicação “PlacentalGrowth”. Este guia está disponível para consulta na aplicação ou no repositório do GitHub. Figura 36: Página Ajuda — Guia de utilização da aplicação. 115
Capítulo 8 Discussão Ao longo do tempo, o desenvolvimento de curvas de percentis para o PF em relação à IG tem sido realizado para fornecer orientações valiosas aos profissionais de saúde e pais relativamente ao crescimento e desenvolvimento de fetos e recém-nascidos [Grantz,2021,Aybuke et al.,2023]. Os resultados do presente estudo mostram que também é possível produzir curvas de percentis para parâmetros placentares como D1,D2,EP ePP, para tirar conclusões adicionais sobre o bem-estar do feto, uma vez que estudos anteriores demonstram uma associação estatisticamente significativa entre a forma e o tamanho da placenta e complicações durante a gravidez, bem como os resultados de saúde a longo prazo dos indivíduos [Shehata et al.,2011,Mitsuda et al.,2020]. A análise exploratória dos dados, apresentada na Secção 7.1, forneceu uma base para o desenvolvimento dessas curvas de percentis. O objetivo principal deste estudo é a exploração dos parâmetros placentares e construção das curvas de crescimento. Contudo, é importante destacar que, a análise de outras variáveis, como o local de recolha das amostras, paridade da mãe, género do feto, forma da placenta e idade materna, também desempenham um papel relevante, fornecendo uma visão mais abrangente do contexto e da natureza das variáveis envolvidas. Há estudos que demonstraram que o peso da placenta pode ser influenciado por estas variáveis [Wallace et al.,2013,Haavaldsen et al.,2011,Asgharnia et al.,2008]. Os dados geográficos mostraram uma ampla gama de regiões e hospitais em Portugal, onde as amostras foram recolhidas, evidenciando diversidade geográfica. No que diz respeito à paridade da mãe, a distribuição nos dados amostrais mostra variação no número de filhos das mães representadas neste estudo, mas a maioria tem apenas um filho. No que se refere ao género do feto, os dados revelam que a maioria das amostras corresponde a fetos do sexo masculino, no entanto, só existem 85 amostras de diferença entre os dois géneros. A análise da forma da placenta revela que a maioria das placentas apresenta uma forma normal. Quanto à idade materna, a maioria das mães tem idades compreendidas entre 25 e 40 anos. Também foi possível observar tendências claras na análise exploratória das variáveis de interesse, 116
como D1,D2,EP,PP, e PF, em relação à IG. À medida que a IG aumenta, observou-se um crescimento progressivo em D1,D2,PP, e PF, sugerindo uma correlação positiva entre essas variáveis e a IG. Observou-se também um aumento da variabilidade com o aumento da IG, indicado pelos valores crescentes de DP, o que é algo expectável, pois à medida que se aproxima do fim da gravidez existe mais diferenças entre os fetos e placentas. O aumento nos valores médios ao longo das semanas é apoiado pelas estatísticas descritivas, incluindo média, mediana, assimetria e curtose. Vale destacar que a assimetria próxima de zero sugere uma distribuição aproximadamente simétrica dos dados, enquanto a curtose com valores superiores a 3 indica distribuições com concentração em torno da média e apresentam caudas mais pesadas em comparação com a distribuição normal. As estatísticas desejadas são uma média de 0, variância de 1, assimetria de 0 e curtose de 3. AEP apresentou um aumento menos pronunciado, indicando uma relação mais complexa com a IG. A assimetria e a curtose das distribuições da EP indicaram uma assimetria positiva e leptocurtose na maioria dos casos. As observações para todos os parâmetros estão alinhadas com estudos anteriores que destacam o desenvolvimento progressivo da placenta e do feto ao longo da gestação [Turco and Moffett, 2019,DiPietro et al.,2015]. A presença de curtose positiva nos dados indica a necessidade de utilização de métodos que possam abordá-la, como o método GAMLSS implementado, para evitar percentis ajustados distorcidos [Borghi et al.,2006]. Além disso, é importante destacar que a normalidade das variáveis de resposta foi avaliada, e os resultados indicaram que as distribuições não seguem estritamente uma distribuição normal. Isso tem implicações nas análises estatísticas subsequentes, e é crucial considerar essa não normalidade ao interpretar os resultados. Estas tendências dos parâmetros são de grande importância, uma vez que podem servir como referência para profissionais de saúde e futuros estudos na área da obstetrícia. Considerando a associação conhecida entre o género do feto e o peso ao nascer, pode ser importante categorizar as curvas de percentis em curvas específicas para o género feminino e masculino. Embora alguns estudos concluam não haver diferenças significativas no peso placentar entre neonatos do género masculino e feminino [Tamayev et al.,2020,Asgharnia et al.,2008,Nogueira et al.,2019], foi encontrado alguns casos onde existiu diferenças significativas. Para o D1, observou-se uma diferença estatisticamente significativa na semana 39, para o D2 nas semanas 12, 14 e 39 e para o PF nas semanas 16 e 40. O PP não apresentou diferenças significativas em nenhuma amostra. Apesar de ter sido identificado algumas diferenças de género estatisticamente significativas em relação aos parâmetros em certas IG, é importante reconhecer que essas variações foram relativamente limitadas, representando apenas 6,2% dos casos totais. Este cenário sugere que, em geral, as curvas de percentis para parâmetros placentares 117
podem ser consideradas um conjunto único, independentemente do género fetal e, por isso, foi optado por não categorizar as curvas por género. Para o desenvolvimento das curvas de crescimento foi importante selecionar o melhor método para ajustar os dados, pois curvas de percentis imprecisas podem levar a interpretações incorretas sobre o desenvolvimento da placenta/feto, resultando em cuidados clínicos subótimos. Conforme os critérios para a seleção de métodos, presentes na Secção 4.2, os métodos GAMLSS,LMS,LMST eLMSP foram testados nos dados. Inicialmente, diferentes funções de alisamento, P-splines , Splines cúbicas, Redes neurais e Loess foram avaliadas num modelo GAMLSS, sem nenhuma suposição de distribuição, uma vez que são conhecidas pela sua flexibilidade para ajustar curvas sem escolher antecipadamente uma forma rígida para a função subjacente [Currie and Durban,2002]. A justificação para esta abordagem reside na simplificação do processo de modelação, pois incorporar simultaneamente as funções de alisamento e as distribuições aumentaria consideravelmente a complexidade do processo de modelação. Analisando os resultados para todos os parâmetros, é possível verificar que as P-splines destacaramse como a função de alisamento preferencial para ajustar os dados. No entanto, as diferenças com as restantes funções de alisamento foram mínimas na maioria dos casos, as P-splines apresentaram um desempenho notável em todos os critérios avaliados e, por isso, foram selecionadas para inclusão nos modelos testados para todos os métodos e parâmetros em estudo. As P-splines oferecem vantagens sobre outros alisadores, como as splines cúbicas, devido à sua eficiência computacional, permitindo que os modelos sejam ajustados a conjuntos de dados maiores [Currie and Durban,2002]. Após a identificação da função de alisamento mais apropriada, procedeu-se ao teste de várias distribuições em diferentes métodos. Diferentemente da função de alisamento escolhida, que permaneceu constante para ajustar os diversos parâmetros em análise, a seleção dos métodos e distribuições específicas para o modelo global variou para cada parâmetro. No contexto do parâmetro D1, a procura por um modelo eficaz e uma distribuição apropriada revelou dois modelos que se destacaram notavelmente: o GAMLSS com a distribuição BCT e o modelo LMST que também utiliza a distribuição BCT. Este destaque é fundamentado pelos valores elevados de R2e na redução dos erros, refletidos nos valores relativamente baixos de MSE,AIC eBIC. Além disso, a análise dos gráficos de diagnóstico confirmou a qualidade desses modelos. Dessa forma, optou-se pelo modelo GAMLSS com a distribuição BCT para representar a curva de crescimento de percentis de referência para o parâmetro D1, devido ao seu bom desempenho. Esta curva de percentis conseguiu capturar com precisão o comportamento dos dados, e a concordância entre as percentagens nominais e da amostra sugerem um bom ajuste do modelo. 118
Capítulo 9 Conclusões e trabalho futuro Ao longo deste estudo, foi realizada uma exploração detalhada dos parâmetros placentares e o seu impacto na saúde materna e fetal. Foram feitas análises abrangentes, desenvolvidas abordagens metodológicas inovadoras e esses conhecimentos foram aplicados para a construção das curvas de crescimento de referência no intervalo das 12 às 41 semanas de gestação. Os resultados obtidos revelaram informações importantes sobre o desenvolvimento placentar e o PF ao longo da gravidez, representando uma contribuição significativa para a comunidade médica, especialmente para obstetras e clínicos gerais. Estas curvas de percentis fornecem informações valiosas sobre o desenvolvimento embrionário e placentar, e têm o potencial de serem úteis na identificação precoce de problemas de saúde fetal. À medida que se enfrenta desafios contemporâneos relacionados à baixa taxa de natalidade e ao aumento da idade materna, a promoção da saúde placentar, fetal e infantil torna-se uma prioridade fundamental. As curvas de percentis desenvolvidas oferecem uma compreensão detalhada de como os parâmetros D1,D2,EP,PP ePF evoluem ao longo da gravidez. Além disso, estas curvas representam padrões populacionais que podem ser particularmente relevantes no contexto do resultado fetal. No desenvolvimento das curvas de crescimento, foi constatado que a aplicação de modelos GAMLSS eLMST, aliados à função de alisamento P-splines e distribuição BCT, oferecem uma boa abordagem para modelar os parâmetros placentares e fetais, evidenciado por critérios promissores de qualidade de ajuste e permitindo assim, a criação de curvas de percentis de referência precisas. Mais precisamente, a utilização do método GAMLSS com BCT e P-splines para modelar os parâmetros D1 eD2 e do método LMST com P-splines para modelar os parâmetros EP,PP ePF. Além disso, a aplicação web “PlacentalGrowth” desenvolvida representa um marco na acessibilidade e usabilidade desse conhecimento, tornando-o disponível para profissionais de saúde e investigadores de maneira simples e interativa. A possibilidade de gerar relatórios personalizados, calcular rácios importantes e fornecer informações detalhadas sobre cada ponto de dados adicionado à aplicação aprimora a capacidade de tomar decisões informadas. 125
Um dos principais desafios encontrados nesta investigação foi a relativa escassez de estudos existentes na área de parâmetros biométricos placentares. Antes deste estudo, as curvas de crescimento placentar para IG compreendidas entre 12 e 41 semanas, para a população portuguesa e para os parâmetros D1,D2,EP,PP ePF, utilizando metodologias como o GAMLSS ou o LMST eram amplamente inexploradas. Portanto, a literatura limitada e as metodologias estabelecidas neste campo específico colocaram desafios na elaboração de comparações e na validação dos resultados. No entanto, a abordagem pioneira deste estudo preenche uma lacuna crucial na literatura, oferecendo informações valiosas sobre os padrões de crescimento placentar e o seu significado clínico. Entretanto, reconhece-se que, apesar das conquistas, este trabalho enfrenta limitações, e há caminhos para investigações futuras. É fundamental continuar a refinar as metodologias e expandir as amostras de estudo para aprimorar a precisão e aplicabilidade das curvas de crescimento de referência placentares e fetais. Numa perspetiva de trabalho futuro, poderia ser realizada uma investigação mais ampla e inclusiva para aprimorar a precisão das curvas de crescimento de referência. A inclusão de amostras mais diversificadas de gestantes, abrangendo diferentes grupos étnicos, idades gestacionais e condições médicas, pode permitir uma compreensão mais completa das variações no desenvolvimento placentar e fetal. A integração de mais parâmetros placentares, além dos parâmetros explorados nesta dissertação, dado que a inclusão de outros parâmetros placentares relevantes pode permitir a elaboração de diagnósticos mais precisos. A expansão da aplicação “PlacentalGrowth” para fornecer suporte adicional aos profissionais de saúde, como a integração de sistemas de registo médicos eletrónicos que guardem os dados dos processos estudados na aplicação, para assim aprimorar a acessibilidade e utilidade desta ferramenta. Explorar e analisar de uma maneira mais aprofundada os rácios R-PP eR-PF dada a sua importância biológica documentada na literatura. E por fim, estudar a relação de outras variáveis com o desenvolvimento placentar como, por exemplo, a paridade ou a idade da mãe, para tentar perceber se existem outros fatores que influenciem os parâmetros placentares. Em última análise, esta dissertação reforça a importância da investigação dos parâmetros placentares, enfatizando como a combinação de estatísticas, modelação matemática e desenvolvimento de aplicações pode resultar em avanços significativos na medicina e na saúde materna e fetal. Apesar dos desafios enfrentados, os resultados obtidos demonstraram a viabilidade e eficácia da abordagem desenvolvida. Espera-se que este trabalho possa inspirar futuras investigações e, ao mesmo tempo, beneficiar diretamente as vidas das gestantes e os seus bebés, promovendo uma gravidez saudável e segura. É importante reconhecer que este estudo não é o ponto final, mas sim um ponto de partida. 126
Bibliografia Edgar Acuña and Caroline Rodriguez. The treatment of missing values and its effect on classifier accuracy. In Classification, Clustering, and Data Mining Applications , pages 639–647. Springer Berlin Heidelberg, 2004. Murray Aitkin. Modelling variance heterogeneity in normal regression using glim. Journal of the Royal Statistical Society: Series C (Applied Statistics) , 36:332–339, 1987. Hirotugu Akaike. Information theory and an extension of the maximum likelihood principle. 2nd International Symposium on Information Theory , pages 267–281, 1973. C. Akantziliotou, R.A. Rigby, and D.M. Stasinopoulos. A framework for modelling overdispersed count data, including the poisson-shifted generalized inverse gaussian distribution. Computational Statistics & Data Analysis , 53:381–393, 2008. Setareh Akhavan, Sedigheh Borna, Alireza Abdollahi, Mamak Shariat, and Narges Zamani. Pathologic examination of the placenta and its benefits in treatment plan or follow-up of patients: a cross-sectional study. European Journal of Medical Research , 27:1–5, 2022. B. Almog, F. Shehata, S. Aljabri, I. Levin, E. Shalom-Paz, and A. Shrim. Placenta weight percentile curves for singleton and twins deliveries. Placenta , 32:58–62, 2011. Samuel Alves, Ana Cristina Braga, and Rosete Nogueira. Percentile growth curves for placenta measures: A dynamic shiny application. Computational Science and Its Applications – ICCSA 2022 Workshops , pages 543–554, 2022. LM Anchieta, CC Xavier, EA Colosimo, and MF Souza. Weight of preterm newborns during the first twelve weeks of life. Braz J Med Biol Res , 36:761–770, 2003. M. Asgharnia, N. Esmailpour, M. Poorghorban, and Z. Atrkar-Roshan. Placenta weight and its association with maternal and neonatal characteristics. Acta Medica Iranica , 46:467–472, 2008. 127
Muhammad Ashfaq, Muhammad Zahoor Janjua, and Muhammad Aslam Channa. Effect of gestational diabetes and maternal hypertension on gross morphology of placenta. Journal of Ayub Medical College Abbottabad , 17, 2005. Eran Ashwal, Jasmine Ali-Gami, Amir Aviram, Stefania Ronzoni, Elad Mei-Dan, John Kingdom, and Nir Melamed. Contribution of second trimester sonographic placental morphology to uterine artery doppler in the prediction of placenta-mediated pregnancy complications. J. Clin. Med. , 11:6759, 2022. Yazici Aybuke, Buyuktiryaki Mehmet, Sari Fatma Nur, Akin Mustafa Senol, Ertekin Omer, and Alyamac Dizdar Evrim. Comparison of different growth curves in the assessment of extrauterine growth restriction in very low birth weight preterm infants. Archives de Pédiatrie , 30:31–35, 2023. Rebecca N. Baergen. Manual of pathology of the human placenta . Springer New York, NY, 2nd edition, 2011. Palanikumar Balasundaram and Indirapriya Darshini. Avulakunta. Human Growth and Development . StatPearls Publishing, Treasure Island (FL), 2022. DJP Barker, C. Osmond, KL Thornburg, Eero Kajantie, and Johan G. Eriksson. The lifespan of men and the shape of their placental surface at birth. Placenta , 32:783–787, 2011. Benjamin Baumer and Dana Udwin. R markdown. WIREs Computational Statistics , 7:167–177, 2015. Chris Beeley. Web application development with R using Shiny . Packt Publishing Ltd, 2016. Christopher M. Bishop. Neural networks for pattern recognition . Oxford university press, 1995. Hossein Bonakdari and Mohammad Zeynoddin. Chapter 5 - goodness-of-fit & precision criteria. In Stochastic Modeling , pages 187–264. Elsevier, 2022. Elaine Borghi, Mercedes de Onis, Cutberto Garza, Jan Van den Broeck, Edward A. Frongillo, Laurence Grummer-Strawn, S. Van Buuren, H. Pan, L. Molinari, Reynaldo Martorell, et al. Construction of the world health organization child growth standards: Selection of methods for attained growth curves. Statistics in Medicine , 25:247–265, 2006. George EP Box and David R. Cox. An analysis of transformations. Journal of the Royal Statistical Society: Series B (Methodological) , 26:211–243, 1964. 128
Ivo Brosens, Robert Pijnenborg, Lisbeth Vercruysse, and Roberto Romero. The ”great obstetrical syndromes”are associated with disorders of deep placentation. American Journal of Obstetrics and Gynecology , 204:193–201, 2011. Emily Burns. More than clinical waste? placenta rituals among australian home-birthing women. The Journal of Perinatal Education , 23:41–49, 2014. Graham J. Burton and Eric Jauniaux. What is the placenta? American Journal of Obstetrics and Gynecology , 213:S6.e1, S6–8, 2015. Stef van Buuren and Miranda Fredriks. Worm plot: a simple diagnostic device for modelling growth reference curves. Statistics in Medicine , 20:1259–1277, 2001. Rosete Maria Amorim Novais Nogueira Cardoso. A Multicenter Study of Singleton Placentas Biometric Parameters and Fetal Weight In Function of Gestational-Age . PhD thesis, Universidade do Minho, 2020. Joseph E. Cavanaugh and Andrew A. Neath. The akaike information criterion: Background, derivation, properties, application, interpretation, and refinements. WIREs Computational Statistics , 11, 2019. Colin Chen and J. P. Morgan. Growth charts of body mass index (bmi) with quantile regression. Algorithmic Mathematics and Computer Science , 5:114–120, 2005. Davide Chicco, Matthijs J Warrens, and Giuseppe Jurman. The coefficient of determination r-squared is more informative than smape, mae, mape, mse and rmse in regression analysis evaluation. Peerj computer science , 7, 2021. S. Chinn. A new method for calculation of height centiles for preadolescent children. Annals of Human Biology , 19:221–232, 1992. Tae Yeong Choi, Hye Min Lee, Won Kyoung Park, So Yeong Jeong, and Hwa Sook Moon. Spontaneous abortion and recurrent miscarriage: A comparison of cytogenetic diagnosis in 250 cases. Obstetrics & Gynecology Science , 57:518, 2014. William S. Cleveland. Robust locally weighted regression and smoothing scatterplots. Journal of the American Statistical Association , 74:829–836, 1979. William S. Cleveland and Susan J. Devlin. Locally weighted regression: an approach to regression analysis by local fitting. Journal of the American statistical association , 83:596–610, 1988. 129
T. J. Cole. Do growth chart centiles need a face lift? BMJ , 308:641–642, 1994. T. J. Cole. The development of growth references and growth charts. Annals of Human Biology , 39: 382–394, 2012. T. J. Cole and P. J. Green. Smoothing reference centile curves: The lms method and penalized likelihood. Statistics in Medicine , 11:1305–1319, 1992. Timothy J. Cole. Fitting smoothed centile curves to reference data. Journal of the Royal Statistical Society: Series A (Statistics in Society) , 151:385–406, 1988. Iain D Currie and Maria Durban. Flexible smoothing with p-splines: a unified approach. Statistical Modelling , 2:333–349, 2002. Ralph B. D’agostino, Albert Belanger, and Ralph B. D’Agostino Jr. A suggestion for using powerful and informative tests of normality. The American Statistician , 44:316–321, 1990. Russel L. Deter, War K. Rossavik, Ronald B. Harrist, HAalock, and Frank P. Mathematic modeling of fetal growth: development of individual growth curve standards. Obstet. Gynecol. , 68:156–161, 1986. Janet A. DiPietro, Kathleen A. Costigan, and Kristin M. Voegtline. Studies in fetal behavior: Revisited, renewed, and reimagined. Monographs of the Society for Research in Child Development , 80:vii, 2015. dplyr. Cran - package dplyr, 2023. URL https://CRAN.R-project.org/package=dplyr. Acedido em: 23-07-2023. DT. Cran - package dt, 2023. URL https://CRAN.R-project.org/package=DT. Acedido em: 20-08-2023. Gilles R Ducharme, Ali Gannoun, Marie-Claude Guertin, and Jean-Claude Jequier. Reference values obtained by kernel-based estimation of quantile regressions. Biometrics , 51:1105–1116, 1995. Paul H. C. Eilers and Brian D. Marx. Flexible smoothing with B-splines and penalties. Statistical Science , 11:89–121, 1996. Johan G. Eriksson, Eero Kajantie, Kent L. Thornburg, Clive Osmond, and David JP Barker. Mothers body size and placental size predict coronary heart disease in men. European Heart Journal , 32:2297–2303, 2011. 130
Adolfo Fernandes, Altemir Braga, Djair Frade, Jhennifer Nascimento, Joana Oliveira, and Dandara Medeiros. An overview of the development of a new probability distribution: Odd log-logistic skew t-student. Brazilian Journal of Development , 7:30536–30555, 2021. Christopher Flatley, Pol Sole-Navais, Marc Vaudel, Øyvind Helgeland, Dominika Modzelewska, Stefan Johansson, Bo Jacobsson, and Pål Njølstad. Placental weight centiles adjusted for age, parity and fetal sex. Placenta , 117:87–94, 2022. Jennifer Vanessa Freeman. The construction of growth reference curves for British children, 1990 . PhD thesis, University of London, 1995. gamlss. Cran - package gamlss, 2023. URL https://cran.r-project.org/web/packages/ gamlss/index.html. Acedido em: 28-01-2023. Christopher Gandrud. Reproducible research with R and R studio . Chapman and Hall/CRC, 2018. Marc Garel, Lloyd Izard, Marthe Vienne, David Nerini, Badr Al Ali, Christian Tamburini, and Séverine Martini. A ready-to-use logistic verhulst model implemented in r shiny to estimate growth parameters of microorganisms. bioRxiv , 2022. Th Gasser, W. Köhler, HG Müller, A. Kneip, R. Largo, L. Molinari, and A. Prader. Velocity and acceleration of height growth using kernel estimation. Annals of Human Biology , 11:397–411, 1984. ggplot2. Cran - package ggplot2, 2022. URL https://cran.r-project.org/web/packages/ ggplot2/index.html. Acedido em: 28-01-2023. Harvey Goldstein. Efficient statistical modelling of longitudinal data. Annals of human biology , 13:129–141, 1986. Katherine L. Grantz. Fetal growth curves: Is there a universal reference? Obstetrics and Gynecology Clinics of North America , 48:281–296, 2021. P. J. Green and Bernard W. Silverman. Nonparametric Regression and Generalized Linear Models . Chapman & Hall/CRC, 1993. Shumei Guo, Alex F. Roche, Richard N. Baumgartner, W. Cameron Chumlea, and Alan S. Ryan. Kernel regression for smoothing percentile curves: reference data for calf and subscapular skinfold thicknesses in Mexican Americans. The American Journal of Clinical Nutrition , 51:908S–916S, 1990. 131
Shumei Guo, Roger M. Siervogel, Alex F. Roche, and Wm Cameron Chumlea. Mathematical modelling of human growth: A comparative study. American Journal of Human Biology , 4:93–104, 1992. C Haavaldsen, SO Samuelsen, and A Eskild. The association of maternal age with placental weight: a population-based study of 536 954 pregnancies. BJOG: An International Journal of Obstetrics & Gynaecology , 118:1470–1476, 2011. Fawzia A. Habib. Prediction of low birth weight infants from ultrasound measurement of placental diameter and placental thickness. Annals of Saudi medicine , 22:312–314, 2002. Peter V. Hamill, Terence A Drizd, Clifford L. Johnson, Robert B. Reed, and Alex F. Roche. Nchs growth curves for children birth-18 years. Vital Health Stat 11 , pages 1–74, 1977. Trevor Hastie and Robert Tibshirani. Generalized additive models. Statistical Science , 1:297–310, 1986. Christina E. Hayward, Samantha Lean, Colin P. Sibley, Rebecca L. Jones, Mark Wareing, Susan L. Greenwood, and Mark R. Dilworth. Placental adaptation: What can we learn from birthweight:placental weight ratio? Frontiers in Physiology , 7:28, 2016. Patrick J. Heagerty and Margaret S. Pepe. Semiparametric estimation of regression quantiles with application to standardizing weight for height and age in us children. Journal of the Royal Statistical Society: Series C (Applied Statistics) , 48:533–551, 1999. MJR Healy, J. Rasbash, and Min Yang. Distribution-free estimation of age-related centiles. Annals of human biology , 15:17–22, 1988. MJR Healy et al. The effect of age grouping on the distribution of a measurement affected by growth. American Journal of Physical Anthropology , 20:49–50, 1962. Elisa Henning, Marcelo Savio Ramos, Rogério de Aguiar, Ivanete Zuchi Siple, and Luciane Mulazani dos Santos. Para além da computação estatística: o uso do ambiente r para o ensino de métodos numéricos. RENOTE , 14, 2016. JL Jensen and Wilfrid S Kendall. Networks and chaos-statistical and probabilistic aspects , volume 50. CRC Press, 1993. Selçuk Kaplan and Eser Kemal Gürcan. Comparison of growth curves using non-linear regression function in japanese quail. Journal of Applied Animal Research , 46:112–117, 2018. 132
T. Yee Khong, Eoghan E. Mooney, Ilana Ariel, Nathalie CM Balmus, Theonia K. Boyd, Marie-Anne Brundler, Hayley Derricott, Margaret J. Evans, Ona M. Faye-Petersen, John E. Gillan, et al. Sampling and definitions of placental lesions amsterdam placental workshop group consensus statement. Archives of Pathology and Laboratory Medicine , 140:698–713, 2016. Torvid Kiserud, Alexandra Benachi, Kurt Hecher, Rogelio González Perez, José Carvalho, Gilda Piaggio, and Lawrence D. Platt. The world health organization fetal growth charts: concept, findings, interpretation, and application. American Journal of Obstetrics and Gynecology , 218:S619–S629, 2018. Roger Koenker. Quantile Regression . Econometric Society Monographs. Cambridge University Press, 2005. Roger Koenker and Gilbert Bassett. Regression quantiles. Econometrica , 46:33–50, 1978. Andréa Cristina Konrath, Silvio Aparecido da Silva, Elisa Henning, Luciane Mulazani dos Santos, Rodrigo Gabriel de Miranda, and Robert Wayne Samohyl. Desenvolvimento de aplicativos web com r e shiny: inovações no ensino de estatística. Abakós , 6:55–71, 2018. Martin Krzywinski and Naomi Altman. Visualizing samples with box plots. Nat. Methods , 11:119–120, 2014. Anant Kshirsagar and William Smith. Growth Curves , volume 145. CRC Press, 1st edition, 1995. Robert J. Kuczmarski, Cynthia L. Ogden, Shumei S. Guo, Laurence M. Grummer-Strawn, Katherine M. Flegal, Zuguo Mei, Rong Wei, Lester R. Curtin, Alex F. Roche, and Clifford L. Johnson. 2000 CDC growth charts for the united states: methods and development. Vital Health Stat. 11 , (246):1–190, 2002. Nan M. Laird and James H. Ware. Random-effects models for longitudinal data. Biometrics , 38:963–974, 1982. Michelle Lampl. Limitation of growth chart curves in terms of individual growth biology . Springer, New York, NY, 2012. Youngjo Lee, John A Nelder, and Yudi Pawitan. Generalized linear models with random effects: unified analysis via H-likelihood , volume 153. CRC Press, 2018. Lawrence D. Longo and Lawrence P. Reynolds. Some historical aspects of understanding placental development, structure and function. International Journal of Developmental Biology , 54:237–255, 2010. 133
Maria Teresa Loverro, Edoardo Di Naro, Vittorio Nicolardi, Leonardo Resta, Salvatore Andrea Mastrolia, Federico Schettini, Manuela Capozza, Matteo Loverro, Giuseppe Loverro, and Nicola Laforgia. Pregnancy complications, correlation with placental pathology and neonatal outcomes. Frontiers in Clinical Diabetes and Healthcare , 2, 2022. Hamdy FF Mahmoud. Parametric versus semi and nonparametric regression models, 2019. David E. Matthews. Likelihood-based confidence intervals for functions of many parameters. Biometrika , 75:139–144, 1988. Saskia Middeldorp. Thrombophilia and pregnancy complications: Cause or association? Journal of Thrombosis and Haemostasis , 5:276–282, 2007. Naomi Mitsuda, Naw Awn JP, Masamitsu Eitoku, Nagamasa Maeda, Mikiya Fujieda, Narufumi Suganuma, Michihiro Kamijima, Shin Yamazaki, Reiko Kishi, Nobuo Yaegashi, et al. Association between maternal hemoglobin concentration and placental weight to birthweight ratio: The japan environment and children’s study (jecs). Placenta , 101:132–138, 2020. Mariam L. Mohamed, Magda M. Elbeily, Maisara M. Shalaby, Yara H. Khattab, and Omima T. Taha. Umbilical cord diameter in the prediction of foetal growth restriction: a cross sectional study. J. Obstet. Gynaecol. , 42:1117–1121, 2022. Luiz R. Nakamura, Thiago G. Ramires, Ana J. Righetto, Rodrigo R. Pescim, Fernanda V. Roquim, Taciana V. Savian, and Dimitrios M. Stasinopoulos. Cattle reference growth curves based on centile estimation: A gamlss approach. Computers and Electronics in Agriculture , 192:106572, 2022. Joseph E. Neath, Andrew A. e Cavanaugh. The bayesian information criterion: background, derivation, and applications. WIREs Computational Statistics , 4:199–203, 2012. J. A. Nelder and R. W. M. Wedderburn. Generalized linear models. Journal of the Royal Statistical Society. Series A (General) , 135:370–384, 1972. A. Niklasson, A. Ericson, JG Fryer, J. Karlberg, C. Lawrence, and P. Karlberg. An update of the swedish reference standards for weight, length and head circumference at birth for given gestational age (19771981). Acta Paediatrica , 80:756–762, 1991. Ngozi R. Njeze, Joseph O. Ogbochukwu, and Josephat M. Chinawa. Correlation of ultrasound placental diameter & thickness with gestational age. Pakistan Journal of Medical Science Q. , 36:1058–1062, 2020. 134