scieee AI-readable full text Open interactive document viewer

Modelação estatística: um estudo na gestão empresarial local

Silva, Vítor Hugo Araújo da

Abstract

Com o desenvolvimento económico, populacional e social em geral, a quantidade de resíduos, em particular os resíduos urbanos, está a aumentar de forma significativa. Sendo uma das problemáticas a nível nacional e mundial, é necessário adotar medidas de forma que essas quantidades sejam reduzidas e valorizadas. A VITRUS AMBIENTE, EM, S.A. é uma empresa pública que atua a vários níveis na gestão empresarial local, nomeadamente na Gestão de Resíduos Urbanos assegurando a recolha de resíduos no concelho de Guimarães. Em 2016 foi implementado um projeto pioneiro, denominado de "Pay-As-You-Throw" (PAYT), no Centro Histórico da cidade de Guimarães, cuja entidade gestora é a VITRUS, sendo o Serviço de Higiene Urbana o responsável pela implementação das medidas necessárias para o sucesso deste projeto. Este trabalho foca-se, especificamente, na Gestão de Resíduos com o objetivo de modelar e prever o comportamento da produção de Resíduos Urbanos nas áreas de atuação da empresa. Assim, são desenvolvidos modelos estatísticos num contexto de Modelos de Regressão Linear (numa abordagem de modelação simples e múltipla) e de análise de Séries Temporais para estimar e prever, nos períodos observados, a produção de resíduos nas zonas dos circuitos de recolha indiferenciada e na zona piloto de implementação do sistema PAYT. O principal objetivo deste trabalho consiste em avaliar a influência de fatores que estejam relacionados com as quantidades de resíduos recolhidos nas zonas afetas ao Serviço de Higiene Urbana e, também, analisar a evolução das respetivas quantidades produzidas. Desta forma, numa primeira fase, são identificados, com recurso a Modelos de Regressão Linear, os fatores que influenciam, numa perspetiva empresarial, as quantidades de resíduos produzidas na zona piloto de implementação do sistema PAYT e possíveis tendências e padrões sazonais, para uma posterior melhoria das ações de gestão a implementar pela empresa. São também aplicados modelos de previsão em Séries Temporais para a estimação e a previsão da produção de resíduos num horizonte futuro de curto prazo (semanalmente) relativos à recolha indiferenciada em contentores de profundidade, em diversas freguesias do concelho, e na recolha indiferenciada e seletiva no Centro Histórico de Guimarães intramuros. As metodologias utilizadas servem de apoio para a gestão e processo de tomada de decisões da empresa relativamente à Gestão de Resíduos Urbanos, com o intuito de melhorar os serviços prestados à população tendo sempre como fundamento a preservação do meio ambiente.

Full text

Vítor Hugo Araújo da Silva Modelação Estatística: um estudo na Gestão Empresarial Local outubro de 2019 UMinho | 2019 Vítor Hugo Araújo da Silva Modelação Estatística: um estudo na Gestão Empresarial Local Universidade do Minho Escola de Ciências Vítor Hugo Araújo da Silva Modelação Estatística: um estudo na Gestão Empresarial Local Dissertação de Mestrado Mestrado em Estatística Trabalho efetuado sob a orientação da Professora Doutora Arminda Manuela Andrade Pereira Gonçalves e do Mestre João Pedro de Oliveira Martins Castro Universidade do Minho Escola de Ciências outubro de 2019 DIREITOS DE AUTOR E CONDIÇÕES DE UTILIZAÇÃO DO TRABALHO POR TERCEIROS Este é um trabalho académico que pode ser utilizado por terceiros desde que respeitadas as regras e boas práticas internacionalmente aceites, no que concerne aos direitos de autor e direitos conexos. Assim, o presente trabalho pode ser utilizado nos termos previstos na licença abaixo indicada. Caso o utilizador necessite de permissão para poder fazer um uso do trabalho em condições não previstas no licenciamento indicado, deverá contactar o autor, através do RepositóriUM da Universidade do Minho. Licença concedida aos utilizadores deste trabalho Atribuição CC BY https://creativecommons.org/licenses/by/4.0/ Agradecimentos “A persistˆencia ´e o caminho do ˆexito.” (Charles Chaplin) ` A Professora Arminda Manuela, por todos os conhecimentos que me transmitiu desde o primeiro dia. Ser˜ao poucas as palavras para lhe agradecer tudo o que fez por mim. Ao Dr. Jo˜ao Pedro Castro pela ajuda demonstrada ao longo da orienta¸c˜ao deste est´agio. Palavras de agradecimento ao Dr. Daniel Pinto e ao V´ıtor Pinheiro, um enorme obrigado, pelo apoio incans´avel, por valorizarem e a apostarem meu trabalho e nas minhas capacidades enquanto uma mais valia na empresa. Agradecimentos `a Laura Jota por toda a preocupa¸c˜ao e por toda a ajuda prestada nas diversas tarefas, n˜ao s´o na constru¸c˜ao dos resultados pretendidos mas tamb´em na elabora¸c˜ao de toda a disserta¸c˜ao. Foi uma das melhores companhias deste est´agio! A todos os colegas da VITRUS que diretamente e indiretamente, colaboraram comigo durante o est´agio, palavras de gratid˜ao por toda a ajuda demonstrada. ` A minha irm˜a e aos meus pais, por todo o esfor¸co que fazem e fizeram, durante todo o meu percurso, para que nada me faltasse, por toda a compreens˜ao e motiva¸c˜ao! Aos meus av´os, por sempre se interessarem e quererem ajudar, sempre e a toda a hora! Por ´ultimo, mas n˜ao menos importante, agradecimentos `a minha fam´ılia, por todo o apoio incondicional demonstrado desde sempre, por apostarem sempre em mim e por nunca cruzarem os bra¸cos nas adversidades. A todos aqueles que contribuem para o meu crescimento a n´ıvel pessoal e profissional e por incentivarem a arriscar! iii DECLARAÇÃO DE INTEGRIDADE Declaro ter atuado com integridade na elaboração do presente trabalho académico e confirmo que não recorri à prática de plágio nem a qualquer forma de utilização indevida ou falsificação de informações ou resultados em nenhuma das etapas conducente à sua elaboração. Mais declaro que conheço e que respeitei o Código de Conduta Ética da Universidade do Minho. vi Resumo Com o desenvolvimento econ´omico, populacional e social em geral, a quantidade de res´ıduos, em particular os res´ıduos urbanos, est´a a aumentar de forma significativa. Sendo uma das problem´aticas a n´ıvel nacional e mundial, ´e necess´ario adotar medidas de forma que essas quantidades sejam reduzidas e valorizadas. A VITRUS AMBIENTE, EM, S.A. ´e uma empresa p´ublica que atua a v´arios n´ıveis na gest˜ao empresarial local, nomeadamente na Gest˜ao de Res´ıduos Urbanos assegurando a recolha de res´ıduos no concelho de Guimar˜aes. Em 2016 foi implementado um projeto pioneiro, denominado de “Pay-As-You-Throw” (PAYT), no Centro Hist´orico da cidade de Guimar˜aes, cuja entidade gestora ´e a VITRUS, sendo o Servi¸co de Higiene Urbana o respons´avel pela implementa¸c˜ao das medidas necess´arias para o sucesso deste projeto. Este trabalho foca-se, especificamente, na Gest˜ao de Res´ıduos com o objetivo de modelar e prever o comportamento da produ¸c˜ao de Res´ıduos Urbanos nas ´areas de atua¸c˜ao da empresa. Assim, s˜ao desenvolvidos modelos estat´ısticos num contexto de Modelos de Regress˜ao Linear (numa abordagem de modela¸c˜ao simples e m´ultipla) e de an´alise de S´eries Temporais para estimar e prever, nos per´ıodos observados, a produ¸c˜ao de res´ıduos nas zonas dos circuitos de recolha indiferenciada e na zona piloto de implementa¸c˜ao do sistema PAYT. O principal objetivo deste trabalho consiste em avaliar a influˆencia de fatores que estejam relacionados com as quantidades de res´ıduos recolhidos nas zonas afetas ao Servi¸co de Higiene Urbana e, tamb´em, analisar a evolu¸c˜ao das respetivas quantidades produzidas. Desta forma, numa primeira fase, s˜ao identificados, com recurso a Modelos de Regress˜ao Linear, os fatores que influenciam, numa perspetiva empresarial, as quantidades de res´ıduos produzidas na zona piloto de implementa¸c˜ao do sistema PAYT e poss´ıveis tendˆencias e padr˜oes sazonais, para uma posterior melhoria das a¸c˜oes de gest˜ao a implementar pela empresa. S˜ao tamb´em aplicados modelos de previs˜ao em S´eries Temporais para a estima¸c˜ao e a previs˜ao da produ¸c˜ao de res´ıduos num horizonte futuro de curto prazo (semanalmente) relativos `a recolha indiferenciada em contentores de profundidade, em diversas freguesias do concelho, e na recolha indiferenciada e seletiva no Centro Hist´orico de Guimar˜aes intramuros. As metodologias utilizadas servem de apoio para a gest˜ao e processo de tomada de decis˜oes da empresa relativamente `a Gest˜ao de Res´ıduos Urbanos, com o intuito de melhorar os servi¸cos prestados `a popula¸c˜ao tendo sempre como fundamento a preserva¸c˜ao do meio ambiente. Palavras-chave: Gest˜ao de Res´ıduos, Reciclagem, PAYT, Modela¸c˜ao, Regress˜ao Linear, Previs˜ao, S´eries temporais. vii xiv Lista de Figuras 1.1 Sede da VITRUS AMBIENTE, exemplo da reabilita¸c˜ao urbana, situada no centro da cidade de Guimar˜aes (reproduzido de VITRUS AMBIENTE (2019b))...................................... 2 1.2 Impacto de cada servi¸co na fatura¸c˜ao da empresa (adaptado de VITRUS AMBIENTE (2019b)). . . . . . . . . . . . . . . . . . . . . . . . . . . 3 1.3 Organograma da empresa (reproduzido de VITRUS AMBIENTE (2018)). . 5 1.4 Mapa do concelho de Guimar˜aes, com as respetivas freguesias e uni˜ao de freguesias representadas (reproduzido de VITRUS AMBIENTE (2018)). . . 8 1.5 Ilustra¸c˜ao relativa ao mapa da zona de implementa¸c˜ao do projeto piloto PAYT, no Centro Hist´orico intramuros (reproduzido de VITRUS AMBIENTE(2019a)). ................................. 10 1.6 Contentores oferecidos aos utilizadores dos sistema PAYT na zona piloto, como incentivo `a separa¸c˜ao de res´ıduos (reproduzido de VITRUS AMBIENTE(2019a)). ................................. 11 1.7 Autocolantes utilizados nos sacos n˜ao autorizados (reproduzido de VITRUS AMBIENTE (2019a)). . . . . . . . . . . . . . . . . . . . . . . . . . . 14 1.8 Representa¸c˜ao da zona piloto, de alargamento em 2019 e alargamento num futuro pr´oximo do sistema PAYT na cidade de Guimar˜aes (reproduzido de VITRUS AMBIENTE (2019a)). . . . . . . . . . . . . . . . . . . . . . . . . . 16 3.1 Representa¸c˜ao gr´afica dos dados relativos `a hereditariedade (Galton, 1889), com a respetiva reta de regress˜ao. . . . . . . . . . . . . . . . . . . . . . . . . 25 xv 4.1 Representa¸c˜ao da simula¸c˜ao de um ru´ıdo branco e respetivas FAC e FACP emp´ıricas...................................... 51 5.1 Simula¸c˜ao de um processo autorregressivo e respetivas FAC e FACP emp´ıricas. 60 5.2 Simula¸c˜ao de um processo de m´edias m´oveis e respetivas FAC e FACP emp´ıricas...................................... 61 5.3 Simula¸c˜ao de um processo autorregressivo e de m´edias m´oveis, ARMA(2,2) e respetivas FAC e FACP emp´ıricas. . . . . . . . . . . . . . . . . . . . . . . 63 5.4 Simula¸c˜ao de um processo autorregressivo e de m´edias m´oveis integrado, ARIMA(2,1,1) e respetivas FAC e FACP emp´ıricas. . . . . . . . . . . . . . 64 5.5 Simula¸c˜ao de um processo autorregressivo e de m´edias m´oveis integrado sazonal, SARIMA(2,1,1)(1,1,1)12 e respetivas FAC e FACP emp´ıricas. . . 66 6.1 Evolu¸c˜ao das quantidades de res´ıduos indiferenciados, recolhidos por ano. . 77 6.2 Evolu¸c˜ao das quantidades de res´ıduos indiferenciados por tipo de recolha. . 77 6.3 Diagramas em caixa de bigodes da produ¸c˜ao de res´ıduos semanal dos circuitos (1 a 12) de recolha operados pela VITRUS. . . . . . . . . . . . . . . 79 6.4 Diagramas de dispers˜ao da produ¸c˜ao de res´ıduos semanal dos circuitos (1 a 12) de recolha operados pela VITRUS. . . . . . . . . . . . . . . . . . . . . . 80 6.5 Representa¸c˜ao gr´afica da evolu¸c˜ao da produ¸c˜ao de res´ıduos. . . . . . . . . . 83 6.6 Diagramas de caixa com bigodes relativos `as quantidades de res´ıduos, produzidas mensalmente. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 84 6.7 Evolu¸c˜ao do n´umero de sacos vendidos, por litragem, conforme o tipo de utilizador (esquerda: UD, direita: UND). . . . . . . . . . . . . . . . . . . . 85 6.8 Gr´aficos relativos `a evolu¸c˜ao das compras efetuadas pelos utilizadores conforme a litragem do saco. . . . . . . . . . . . . . . . . . . . . . . . . . . . . 86 6.9 Evolu¸c˜ao do n´umero de deposi¸c˜oes ilegais na zona piloto de implementa¸c˜ao dosistemaPAYT. ................................ 87 7.1 Histograma e QQ plot dos res´ıduos do modelo obtido para os res´ıduos indiferenciados. .................................... 96 7.2 Histograma e QQ plot dos res´ıduos do modelo obtido para os res´ıduos seletivos. 97 xvi 8.1 S´erie dos logaritmos das quantidades recolhidas em contentores de profundidade, ap´os diferencia¸c˜ao de 1. ª ordem (d= 1), e respetivas FAC e FACP estimadas......................................109 8.2 S´erie dos logaritmos das quantidades recolhidas em contentores de profundidade, ap´os diferencia¸c˜ao de 1. ª ordem e ajustamento da parte sazonal, e respetivas FAC e FACP estimadas. . . . . . . . . . . . . . . . . . . . . . . . 110 8.3 S´erie dos res´ıduos para a s´erie dos logaritmos das quantidades de res´ıduos indiferenciados em contentores, ap´os ajustamento do modelo SARIMA, e respetivo histograma, FAC e FACP estimadas. . . . . . . . . . . . . . . . . 112 8.4 Previs˜oes (no per´ıodo de teste), pontuais e intervalares (90%), e estimativas pontuais (entre a 16. ª semana de 2016 e a 34. ª semana de 2019) obtidas atrav´es do modelo SARIMA, sobrepostas `a s´erie das quantidades de res´ıduos indiferenciados em contentores de profundidade. . . . . . . . . . . . . . . . . 113 8.5 S´erie dos logaritmos das quantidades recolhidas de res´ıduos seletivos, no CHG, sem aplica¸c˜ao de diferencia¸c˜ao (d= 0), e respetivas FAC e FACP estimadas......................................114 8.6 S´erie dos res´ıduos das quantidades recolhidas de res´ıduos seletivos, no CHG, sem diferencia¸c˜ao aplicada e ajustamento da parte sazonal, e respetivas FAC e FACP estimadas. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 115 8.7 S´erie dos res´ıduos para a s´erie dos logaritmos das quantidades de res´ıduos seletivos no CHG, ap´os ajustamento do modelo SARIMA, e respetivo histograma, FAC e FACP estimadas. . . . . . . . . . . . . . . . . . . . . . . . 117 8.8 Previs˜oes (no per´ıodo de teste), pontuais e intervalares (90%), e estimativas pontuais (entre a 9. ª semana de 2016 e a 38. ª semana de 2018) obtidas atrav´es do modelo SARIMA, sobrepostas `a s´erie das quantidades de res´ıduos seletivos no CHG. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 118 8.9 S´erie dos logaritmos das quantidades recolhidas de res´ıduos indiferenciados, no CHG, ap´os diferencia¸c˜ao de 1. ª ordem (d= 1), e respetivas FAC e FACP estimadas......................................119 xvii 8.10 S´erie dos res´ıduos das quantidades recolhidas de res´ıduos seletivos, no CHG, ap´os aplica¸c˜ao de uma diferencia¸c˜ao de 1. ª ordem (d= 1), e ajustamento da parte sazonal, e respetivas FAC e FACP estimadas. . . . . . . . . . . . . 120 8.11 S´erie dos res´ıduos para a s´erie dos logaritmos das quantidades de res´ıduos indiferenciados no CHG, ap´os ajustamento do modelo SARIMA, e respetivo histograma, FAC e FACP estimadas. . . . . . . . . . . . . . . . . . . . . . . 122 8.12 Previs˜oes (no per´ıodo de teste), pontuais e intervalares (90%), e estimativas pontuais (entre a 9. ª semana de 2016 e a 38. ª semana de 2018) obtidas atrav´es do modelo SARIMA, sobrepostas `a s´erie das quantidades de res´ıduos indiferenciados no CHG. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 123 xviii Lista de Tabelas 1.1 Tipos de recolha efetuados nos circuitos de recolha indiferenciada. . . . . . 9 1.2 Descri¸c˜ao dos estabelecimentos pertencentes `as tipologias estabelecidas nos utilizadores n˜ao dom´esticos (UND). . . . . . . . . . . . . . . . . . . . . . . . 11 1.3 Litragem dos sacos vendidos para os res´ıduos respetivos. . . . . . . . . . . . 12 1.4 Pre¸c´ario (em euros) estipulado para a diversidade de sacos adquiridos pelos utilizadores, conforme a litragem adquirida (L)................. 12 3.1 TabelaANOVA. ................................. 36 4.1 Transforma¸c˜oes usuais de Box-Cox. . . . . . . . . . . . . . . . . . . . . . . . 53 5.1 Padr˜oes te´oricos das FAC e FACP dos modelos de previs˜ao em s´eries temporais........................................ 67 6.1 Evolu¸c˜ao anual das quantidades de res´ıduos indiferenciados (em toneladas), por tipo de recolha. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 76 6.2 Estat´ısticas descritivas dos circuitos de recolha indiferenciada no per´ıodo observado...................................... 78 6.3 Descri¸c˜ao das vari´aveis em estudo, relativamente ao sistema PAYT, implementado no Centro Hist´orico intramuros. . . . . . . . . . . . . . . . . . . . 81 6.4 Estat´ısticas descritivas relativas `as vari´aveis em estudo do circuito PAYT (mensais)...................................... 83 6.5 Evolu¸c˜ao da produ¸c˜ao mensal de res´ıduos no Centro Hist´orico intramuros, zona piloto do sistema PAYT. . . . . . . . . . . . . . . . . . . . . . . . . . . 84 xix 6.6 Quantidades de sacos vendidas, anualmente, na globalidade, conforme a litragemdesacos.................................. 85 6.7 Teste de correla¸c˜ao de Spearman para avaliar a associa¸c˜ao entre as vari´aveis (n. º de sacos vendidos) e o n´umero de deposi¸c˜oes ilegais. . . . . . . . . . . . 88 7.1 Regress˜ao Linear Simples, tendo como vari´avel resposta SELETIVO eINDIFERENCIADO, respetivamente. . . . . . . . . . . . . . . . . . . . . . . . . . . 90 7.2 Modelo de regress˜ao linear m´ultipla para a produ¸c˜ao de res´ıduos indiferenciados........................................ 92 7.3 Modelo de regress˜ao linear m´ultipla para a produ¸c˜ao de res´ıduos seletivos. . 94 7.4 Valores obtidos ap´os modela¸c˜ao do modelo sazonal final, dos res´ıduos indiferenciados. .................................... 99 7.5 Modelo de regress˜ao linear m´ultipla para a produ¸c˜ao de res´ıduos indiferenciados com combina¸c˜ao das vari´aveis sazonais. . . . . . . . . . . . . . . . . . 100 7.6 Modelo de regress˜ao linear m´ultipla para a produ¸c˜ao de res´ıduos indiferenciados com combina¸c˜ao das vari´aveis sazonais e vari´aveis obtidas por regress˜ao linear simples. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 101 7.7 Valores obtidos ap´os modela¸c˜ao do modelo sazonal final, dos res´ıduos seletivos.103 7.8 Modelo de regress˜ao linear m´ultipla para a produ¸c˜ao de res´ıduos seletivos com combina¸c˜ao das vari´aveis sazonais. . . . . . . . . . . . . . . . . . . . . 104 7.9 Modelo de regress˜ao linear m´ultipla para a produ¸c˜ao de res´ıduos seletivos com combina¸c˜ao das vari´aveis sazonais e vari´aveis obtidas por regress˜ao linearsimples....................................105 8.1 Ajustamento de v´arios modelos para a parte sazonal, ap´os escolha da ordem de diferencia¸c˜ao regular, `a s´erie dos logaritmos das quantidades recolhidas em contentores de profundidade. . . . . . . . . . . . . . . . . . . . . . . . . 110 8.2 Ajustamento de v´arios modelos para a parte regular, ap´os escolha da ordem de diferencia¸c˜ao regular e das ordens da parte sazonal, `a s´erie dos logaritmos das quantidades de res´ıduos indiferenciados em contentores de profundidade.111 xx 8.3 Resultados da estima¸c˜ao do modelo SARIMA aplicado `a s´erie dos logaritmos das quantidades de res´ıduos indiferenciados em contentores de profundidade.111 8.4 Ajustamento de v´arios modelos para a parte sazonal, ap´os escolha da ordem de diferencia¸c˜ao regular, `a s´erie dos logaritmos das quantidades recolhidas em contentores de profundidade. . . . . . . . . . . . . . . . . . . . . . . . . 115 8.5 Ajustamento de v´arios modelos para a parte regular, ap´os escolha da ordem de diferencia¸c˜ao regular e das ordens da parte sazonal, `a s´erie dos logaritmos das quantidades de res´ıduos seletivos no CHG. . . . . . . . . . . . . . . . . 116 8.6 Resultados da estima¸c˜ao do modelo SARIMA aplicado `a s´erie dos logaritmos das quantidades de res´ıduos seletivos no CHG. . . . . . . . . . . . . . . . . 116 8.7 Ajustamento de v´arios modelos para a parte sazonal, ap´os escolha da ordem de diferencia¸c˜ao regular, `a s´erie dos logaritmos das quantidades recolhidas de res´ıduos indiferenciados no CHG. . . . . . . . . . . . . . . . . . . . . . . 120 8.8 Ajustamento de v´arios modelos para a parte regular, ap´os escolha da ordem de diferencia¸c˜ao regular e das ordens da parte sazonal, `a s´erie dos logaritmos das quantidades de res´ıduos indiferenciados no CHG. . . . . . . . . . . . . . 121 8.9 Resultados da estima¸c˜ao do modelo SARIMA aplicado `a s´erie dos logaritmos das quantidades de res´ıduos indiferenciados no CHG. . . . . . . . . . . . . . 121 8.10 Medidas de avalia¸c˜ao calculadas para as s´eries estudadas, no per´ıodo de treino e no per´ıodo de teste respetivo, com base nos resultados obtidos na aplica¸c˜ao do m´etodo de previs˜ao. . . . . . . . . . . . . . . . . . . . . . . . . 124 8.11 Tabela com os respetivos intervalos de previs˜ao, valores previstos e valores reais para cada s´erie em estudo, respetivamente. . . . . . . . . . . . . . . . 125 A.1 Distribui¸c˜ao dos circuitos de recolha indiferenciada pelas freguesias. . . . . 136 B.1 Regress˜ao Linear Simples, tendo como vari´avel resposta papel. . . . . . . . 137 B.2 Regress˜ao Linear Simples, tendo como vari´avel resposta plastico. . . . . . 138 B.3 Regress˜ao Linear Simples, tendo como vari´avel resposta vidro. . . . . . . . 139 C.1 Modelo de regress˜ao linear m´ultipla para a produ¸c˜ao de res´ıduos de papel/- cart˜ao........................................141 xxi C.2 Modelo de regress˜ao linear m´ultipla para a produ¸c˜ao de res´ıduos de vidro. . 142 C.3 Modelo de regress˜ao linear m´ultipla para a produ¸c˜ao de res´ıduos de pl´astico.142 C.4 Valores calculados a partir do modelo sazonal inicial, dos res´ıduos indiferenciados e seletivos, respetivamente. . . . . . . . . . . . . . . . . . . . . . . . . 143 xxii Lista de abreviaturas ADF – Augmented Dickey-Fuller (em portuguˆes, Dickey-Fuller Aumentado) AIC – Akaike Information Criterion (em portuguˆes, Crit´erio de Informa¸c˜ao de Akaike) ANOVA – Analysis of Variance (em portuguˆes, An´alise de Variˆancia) AR – Autoregressive (em portuguˆes, Autorregressivo) ARIMA – Autoregressive Integrated Moving Average (em portuguˆes, Autorregressivo e de M´edias M´oveis Integrado) ARMA – Autoregressive Moving Average (em portuguˆes, Autorregressivo e de M´edias M´oveis) BIC – Bayesian Information Criterion (em portuguˆes, Crit´erio de Informa¸c˜ao Bayesiano) BLUE – Best Linear Unbiased Estimators (em portuguˆes, Melhor Estimador N˜ao Enviesado) CHG – Centro Hist´orico de Guimar˜aes CMG – Cˆamara Municipal de Guimar˜aes DF – Dickey-Fuller EAM – Erro Absoluto M´edio EAMN – Erro Absoluto M´edio Na¨ ıve EAMNS – Erro Absoluto M´edio Na¨ ıve Sazonal EEAM – Erro Escalado Absoluto M´edio EMQ – Estimadores de M´ınimos Quadrados EPA – Environmental Protection Agency EPAM – Erro Percentual Absoluto M´edio EQM – Erro Quadr´atico M´edio xxiii Cap´ıtulo 1. Introdu¸c˜ao tores localizados por todo o concelho, operando em cerca de 44 freguesias no munic´ıpio de Guimar˜aes. Pouco tempo ap´os o in´ıcio da sua atividade, foi adjudicado ao SHU o servi¸co de limpeza p´ublica, nomeadamente a limpeza de caminhos pedestres e da pista de cicloturismo. Em 2016 o SHU, ficou tamb´em respons´avel pela recolha de RU no Centro Hist´orico de Guimar˜aes (CHG), circuito este onde ´e efetuada a recolha seletiva de res´ıduos e ´e designado de Circuito PAYT (Pay-As-You-Throw). Tendo ainda em conta o organograma da VITRUS (Figura 1.3), o SHU encontra-se segmentado em dois setores principais: o servi¸co de recolha de res´ıduos e a limpeza p´ublica. Para a concretiza¸c˜ao destes servi¸cos existe um quadro de colaboradores alargado, com as seguintes distin¸c˜oes: – Equipas que trabalham diretamente nos servi¸cos, motoristas e assistentes operacionais: 71 colaboradores diretos; – Cargos de coordena¸c˜ao e chefia: 2 colaboradores diretos; – Cargos administrativos e t´ecnicos: 1 colaborador direto. O SHU possui ainda um estaleiro de apoio `as atividades realizadas diariamente, que serve de garagem e armaz´em e, ainda, agrega a oficina e o parque de lavagem. No servi¸co de oficina ´e realizada toda a repara¸c˜ao e manuten¸c˜ao dos equipamentos, ferramentas e materiais e ´e no parque de lavagem que ocorre a higieniza¸c˜ao dos ve´ıculos, equipamentos e materiais. No estaleiro tamb´em existe o servi¸co de lavandaria onde ´e efetuada a higieniza¸c˜ao e manuten¸c˜ao dos uniformes onde, por´em, este servi¸co est´a afeto a todos os servi¸cos da VITRUS. Mais se acrescenta que o SHU possui uma frota de viaturas pesadas e ligeiras, de carga, viaturas de apoio `a recolha e outras auxiliares. N˜ao tendo sido realizada nenhuma aquisi¸c˜ao no ano de 2018, o n´umero que comp˜oe a frota sob al¸cada da VITRUS ´e de 17 viaturas. 1.3 Recolha de Res´ıduos Urbanos: o caso de Guimar˜aes O modelo de gest˜ao de res´ıduos em Portugal ´e da responsabilidade dos munic´ıpios, ao abrigo do Decreto-Lei n. º 73/2011, de 17 de junho. A gest˜ao de res´ıduos ´e uma ´area onde urge a cria¸c˜ao de pol´ıticas de redu¸c˜ao de custos e de diminui¸c˜ao de produ¸c˜ao de res´ıduos nas ´areas de implementa¸c˜ao. O concelho de Guimar˜aes, situado no Norte de Portugal, na sub-regi˜ao do Vale do Ave, apresenta uma ´area total de 241 km2distribu´ıda por um total de 48 freguesias (Figura 1.4). De acordo com o Instituto Nacional de Estat´ıstica (INE), a popula¸c˜ao deste concelho ´e composta por 158 124 habitante sendo que, tamb´em, ´e composto por 66 790 alojamentos. 6 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local No munic´ıpio de Guimar˜aes, a entidade respons´avel pelo servi¸co em alta ´e a Resinorte, sendo o sistema em baixa tutelado pelo munic´ıpio de Guimar˜aes. A Resinorte providencia a recolha seletiva em toda a ´area do concelho, com exce¸c˜ao do CHG, o tratamento e a valoriza¸c˜ao dos res´ıduos recolhidos. Esta entidade gere, ainda, os ecocentros existentes no concelho uma vez que ´e nestes locais que qualquer mun´ıcipe, assim como o SHU, pode depositar materiais em fim de vida para posterior valoriza¸c˜ao. A presta¸c˜ao de servi¸cos, por parte do SHU, consiste essencialmente na recolha e transporte de RU integrando o sistema em baixa referido, anteriormente. Nos locais onde opera como entidade gestora, o SHU presta tamb´em um servi¸co de recolha a pedido, que consiste na recolha de res´ıduos que n˜ao podem ser recolhidos nos circuitos normais, devido `a sua forma, volume ou carater´ısticas. ` A recolha deste tipo de res´ıduos (volumosos, res´ıduos verdes, etc.) denomina-se de recolha de monstros. A VITRUS opera, por delega¸c˜ao de competˆencias do Munic´ıpio de Guimar˜aes, na recolha de res´ıduos urbanos em 38 freguesias do concelho onde as recolhas s˜ao distribu´ıdas por doze circuitos de recolha de res´ıduos indiferenciados e um circuito de recolha indiferenciada e recolha seletiva, respetivamente. O servi¸co afeto `a recolha de RU ´e o Servi¸co de Higiene Urbana que, `a data, apresenta cerca de 60 colaboradores afetos a este tipo de servi¸co. As recolhas nos circuitos de recolha de RU indiferenciados s˜ao efetuadas em contentores de profundidade ou por recolha porta a porta com deposi¸c˜ao de saco perdido. Na Tabela A.1 (Apˆendice A) ´e poss´ıvel analisar, de forma detalhada, as freguesias afetas a cada circuito de recolha de RU indiferenciado. O circuito onde ´e efetuada a recolha seletiva de res´ıduos ´e designado de Circuito PAYT. Em 2016, este sistema, implementado no Centro Hist´orico intramuros, ´e caraterizado pela recolha de res´ıduos porta a porta em saco apropriado e fornecido pela VITRUS. Circuitos de recolha indiferenciada Para Martinho & Gon¸calves (1999), a escolha do sistema de deposi¸c˜ao a adotar ´e condicionada por diversos fatores, desde o clima, os aspetos geogr´aficos, o volume e tipo de res´ıduos a recolher, o tipo de habita¸c˜ao e urbaniza¸c˜ao, a frequˆencia e celeridade da recolha, a distˆancia e o tipo de tratamento, valoriza¸c˜ao ou elimina¸c˜ao que se pretende para os res´ıduos, os h´abitos, as atitudes e as carater´ısticas dos produtores de res´ıduos, o tipo de recipientes e ve´ıculos a utilizar e os recursos financeiros e humanos dispon´ıveis. Neste caso, real¸ca-se que por diversos fatores ´e imposs´ıvel efetuar a recolha de res´ıduos com um s´o sistema o que leva `a cria¸c˜ao de uma variedade de sistemas de recolha que permitam que cada comunidade utilize a que mais se adequa `as suas necessidades tendo em conta os fatores a reter. 7 Cap´ıtulo 1. Introdu¸c˜ao Figura 1.4: Mapa do concelho de Guimar˜aes, com as respetivas freguesias e uni˜ao de freguesias representadas (reproduzido de VITRUS AMBIENTE (2018)). Tipos de recolha O sistema de recolha porta a porta atrav´es de saco perdido traduz-se na deposi¸c˜ao na via p´ublica, por parte do produtor, do saco, em frente `a sua habita¸c˜ao, para posterior recolha por parte do SHU. Neste caso, os produtores, s´o podem depositar os sacos na via p´ublica a determinadas horas e, devidamente acondicionados, de forma a permitir uma higieniza¸c˜ao da via p´ublica. Neste estudo, ser˜ao considerados/analisados quatro circuitos onde ´e efetuada a recolha porta a porta: Circuitos 9, 10, 11 e 12. A recolha em contentores de profundidade ´e realizada em contentores, colocados em locais estrat´egicos, pr´oximos das habita¸c˜oes onde a popula¸c˜ao se desloca para depositar os seus res´ıduos. Usualmente, este m´etodo ´e utilizado na impossibilidade de efetuar uma recolha porta a porta. Neste estudo, ser˜ao estudados cinco circuitos cuja metodologia adotada ´e, exclusivamente, a recolha em contentores de profundidade: Circuitos 1, 2, 4, 5 e 6. A recolha mista consiste na combina¸c˜ao das duas anteriores, uma vez que o circuito afeta diversas freguesias cujas necessidades divergem e ´e ent˜ao necess´aria uma alternˆancia na metodologia a adotar para a recolha dos res´ıduos. Neste caso s˜ao trˆes circuitos com esse tipo de recolha: Circuitos 3, 7 e 8. A Tabela 1.1 resume os tipos de recolha, anteriormente discriminados, nos circuitos de recolha indiferenciada em estudo. 8 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local Tabela 1.1: Tipos de recolha efetuados nos circuitos de recolha indiferenciada. C1 C2 C3 C4 C5 C6 C7 C8 C9 C10 C11 C12 Contentores de profundidade Ö Ö Ö Ö Ö Porta a porta Ö Ö Ö Ö Mista Ö Ö Ö 1.4 Sitema PAYT: o caso de Guimar˜aes Em abril de 2016 foi implementado, em Guimar˜aes, um projeto piloto denominado de projeto PAYT (Pay-as-you-Throw). Este projeto consiste na implementa¸c˜ao de um tarif´ario calculado de forma proporcional `a quantidade de res´ıduos produzida que segundo Freitas (2013) pode ser uma medida eficaz para os objetivos da pol´ıtica de gest˜ao de res´ıduos, na medida em que constitui um claro incentivo, por via financeira, para promover a separa¸c˜ao na origem e aumentar as taxas de Res´ıduos S´olidos Urbanos. A zona de implementa¸c˜ao do sistema est´a adjacente `a zona intramuros classificada como patrim´onio mundial da humanidade, inserida na Uni˜ao de Freguesias de Oliveira, S˜ao Paio e S˜ao Sebasti˜ao, que constitui a principal e mais central freguesia do Munic´ıpio de Guimar˜aes. A ´area de implementa¸c˜ao, ilustrada na Figura 1.5, tem uma ´area igual a 0,170 km2e ´e caraterizada por uma elevada densidade de constru¸c˜ao predominada pela habita¸c˜ao e pelo com´ercio. Inicialmente a ´area era constitu´ıda por um total de 32 arruamentos mas, ap´os a entrada em vigor da tarifa PAYT e por se situarem numa zona fronteira que divide o Centro Hist´orico intra do extra muro, alguns utilizadores requisitaram a ades˜ao ao sistema tarif´ario PAYT e o n´umero de arruamentos foi aumentado para 34. Esta inclus˜ao foi considerada ap´os pedido especial de 10 lojistas do centro comercial do Toural, com morada fiscal no Largo do Toural e 2 utilizadores dom´esticos do Largo Navarro de Andrade. 9 Cap´ıtulo 1. Introdu¸c˜ao Figura 1.5: Ilustra¸c˜ao relativa ao mapa da zona de implementa¸c˜ao do projeto piloto PAYT, no Centro Hist´orico intramuros (reproduzido de VITRUS AMBIENTE (2019a)). A implementa¸c˜ao deste sistema imprimiu uma nova dinˆamica da gest˜ao de res´ıduos, no qual o utilizador ´e tratado de acordo com a sua efetiva produ¸c˜ao de res´ıduos, vendo isso repercutido na tarifa a pagar. Este sistema tarif´ario tem como princ´ıpio o conceito poluidor-pagador e, por isso, penaliza a produ¸c˜ao de res´ıduos indiferenciados e incentiva a redu¸c˜ao, reutiliza¸c˜ao e o aumento da separa¸c˜ao da fra¸c˜ao recicl´avel na origem. Neste contexto, a operacionaliza¸c˜ao do sistema PAYT alterou o tarif´ario associado ao sistema de recolha de res´ıduos e vai de encontro `as novas Diretivas Europeias para a gest˜ao de res´ıduos, o que contribui para uma atua- ¸c˜ao “mais verde” e ambientalmente sustent´avel do mun´ıcipe conduzindo para um sistema de gest˜ao de res´ıduos urbanos mais sustent´avel e pr´oximo das metas muito espec´ıficas e ambiciosas na ´area dos res´ıduos. A implementa¸c˜ao deste projeto compreendeu uma monitoriza¸c˜ao cont´ınua e uma rela- ¸c˜ao de proximidade com a popula¸c˜ao, com resolu¸c˜oes c´eleres das necessidades apontadas por todos os utilizadores. Desde a sua implementa¸c˜ao, o projeto PAYT foi tamb´em auxiliado por fortes a¸c˜oes/campanhas de sensibiliza¸c˜ao e educa¸c˜ao ambiental e pela agiliza¸c˜ao do processo de controlo e fiscaliza¸c˜ao para posterior recolha do n´umero de deposi¸c˜oes ilegais na zona de interven¸c˜ao. A distin¸c˜ao dos utilizadores ´e efetuada por Utilizadores Dom´esticos (UD) e Utilizadores N˜ao-Dom´esticos (UND). Na Tabela 1.2 s˜ao apresentados os estabelecimentos que comp˜oem as diferentes tipologias constantes dos UND. 10 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local Tabela 1.2: Descri¸c˜ao dos estabelecimentos pertencentes `as tipologias estabelecidas nos utilizadores n˜ao dom´esticos (UND). Tipologia Estabelecimentos Tipologia A Caf´e, bar e padaria Tipologia B Restaurantes Tipologia C Lojas de venda a retalho (roupa, sapatos e outos artigos) e prestador de servi¸cos Tipologia D Hotel, hostel, alojamento local Tipologia E Institui¸c˜oes sociais, institutos e associa¸c˜oes locais. A VITRUS, nomeadamente o SHU ´e respons´avel pela deposi¸c˜ao, recolha e transporte dos res´ıduos urbanos produzidos no Centro Hist´orico. A Resinorte ´e a empresa respons´avel pelo tratamento e valoriza¸c˜ao deste res´ıduo. Atendendo `a morfologia urbana, ao tipo de produtores e caracter´ısticas da ´area, a VITRUS disp˜oe de diferentes solu¸c˜oes para a deposi¸c˜ao e recolha de res´ıduos no Centro Hist´orico: – Recolha seletiva e indiferenciada porta a porta em todas as residˆencias/mistas e junto a todas as entidades (restaurantes, bares, hot´eis, mercados, com´ercio, servi¸cos, etc): ·Disponibiliza¸c˜ao gratuita de contentores de pequena capacidade (25 ou 45 litros (Figura 1.6)); ·Disponibiliza¸c˜ao gratuita de sacos pr´oprios para deposi¸c˜ao dos res´ıduos seletivos (sacos de 50 e 100 litros); ·Sacos PAYT para venda com diferentes litragens (15 litros, 30 litros, 50 litros e 100 litros); – Recolha pontual de res´ıduos a pedido: recolha efetuada mediante pedido pr´evio do mun´ıcipe, de car´ater ocasional e realizada em local e data acordada. Figura 1.6: Contentores oferecidos aos utilizadores dos sistema PAYT na zona piloto, como incentivo `a separa¸c˜ao de res´ıduos (reproduzido de VITRUS AMBIENTE (2019a)). 11 Cap´ıtulo 1. Introdu¸c˜ao Para deposi¸c˜ao de res´ıduos no CHG, atendendo `a obrigatoriedade das normas do sistema PAYT e a todas as necessidades dos utilizadores, a VITRUS disp˜oe de diferentes solu¸c˜oes para deposi¸c˜ao dos res´ıduos, por exemplo sacos para deposi¸c˜ao de res´ıduos com diferentes volumetrias (Tabela 1.3). Tabela 1.3: Litragem dos sacos vendidos para os res´ıduos respetivos. Litragem Indiferenciado Papel/ Cart˜ao Pl´astico Vidro 15 litros Ö 30 litros Ö Ö Ö Ö 50 litros Ö Ö Ö Ö 100 litros Ö Ö Ö O sistema tarif´ario PAYT em Guimar˜aes foi elaborado segundo as recomenda¸c˜oes da Entidade Reguladora do Servi¸co de ´ Aguas e Res´ıduos (ERSAR), que sugere uma tarifa fixa e uma vari´avel, de forma a repercutirem os custos por todos os utilizadores. A tarifa fixa ´e aplicada baseada nos custos fixos da opera¸c˜ao e pela disponibilidade do servi¸co e a tarifa vari´avel assenta na produ¸c˜ao de res´ıduos. Desta forma, ´e aplicado aos utilizadores do CHG uma tarifa de disponibilidade (componente fixa) mais tarifa vari´avel. A tarifa de disponibilidade continuou a ser faturada juntamente com a fatura da ´agua e a cobran¸ca da tarifa vari´avel passou a taxar o volume de res´ıduos indiferenciados produzidos segundo um sistema de sacos pr´e-pago. Os residentes e comerciantes passaram a estar obrigados a adquirirem sacos para os Res´ıduos Indiferenciados (RI) e apenas os RI que s˜ao colocados nestes sacos s˜ao recolhidos normalmente pelos colaboradores. A utiliza¸c˜ao de outro saco que n˜ao o autorizado para deposi¸c˜ao desta fra¸c˜ao de res´ıduos ´e recolhido ap´os ser iniciado o processo de fiscaliza¸c˜ao. Os sacos tˆem diferentes capacidades, entre 15 e 100 litros, e o pre¸co do saco corresponde `a por¸c˜ao dos custos de transporte e tratamento envolvido na elimina¸c˜ao desse res´ıduo. A Tabela 1.4 apresenta os pre¸cos em vigor dos diferentes sacos, colocados ao dispor, para posterior compra dos utilizadores com substitui¸c˜ao da tarifa vari´avel. Tabela 1.4: Pre¸c´ario (em euros) estipulado para a diversidade de sacos adquiridos pelos utilizadores, conforme a litragem adquirida (L). Tipo de utilizador Pre¸co por capacidade - sacos PAYT 15 L 30 L 50 L 100 L Utilizador Dom´estico L≤240 0,173 0,345 0,575 1,150 240 <L<720 0,174 0,348 0,580 1,160 720 ≤L < 1200 0,177 0,354 0,590 1,180 L≥1200 0,182 0,360 0,600 1,200 Utilizador N˜ao Dom´estico 0,174 0,348 0,580 1,160 A n´ıvel do controlo e fiscaliza¸c˜ao, segundo a legisla¸c˜ao em vigor, com base no artigo 69. º , n. º 2, do Regulamento do Servi¸co de Gest˜ao de Res´ıduos Urbanos, publicado no Di´ario da 12 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local Rep´ublica, 2. ª s´erie, n. º 52, de 15 de mar¸co de 2016, sob o Edital n. º 248/2016, compete `a VITRUS a fiscaliza¸c˜ao e a instru¸c˜ao dos processos de contraordena¸c˜ao cabendo `a Entidade Titular, a Cˆamara Municipal de Guimar˜aes (CMG), o processamento e a aplica¸c˜ao das coimas. O servi¸co de fiscaliza¸c˜ao ambiental atua junto da popula¸c˜ao numa atitude preventiva e, em casos de reincidˆencia, de forma coerciva, no sentido de fazer cumprir o Regulamento Municipal do Servi¸co de Gest˜ao de Res´ıduos Urbanos. Em caso de reincidˆencia e ap´os advertˆencia verbal, ´e enviado um of´ıcio personalizado ao infrator identificado a informar que se encontra a infringir e a solicitar que proceda `a regulariza¸c˜ao da situa¸c˜ao. As deposi¸c˜oes ilegais consistem no acondicionamento de res´ıduos em sacos n˜ao autorizados, dentro do CHG ou fora da ´area de controlo. Tamb´em se considera como deposi¸c˜ao ilegal a incorreta separa¸c˜ao dos res´ıduos e a deposi¸c˜ao, mesmo sendo em saco autorizado, fora do hor´ario estipulado, especificamente, a equipa afeta a esta fun¸c˜ao cumpre o seguinte procedimento: 1. Observar e registar a situa¸c˜ao an´omala; 2. Identifica¸c˜ao do autor da deposi¸c˜ao ilegal; 3. Desloca¸c˜ao `a morada do infrator; 4. A¸c˜ao pedag´ogica e advertˆencia verbal: informar e avisar o prevaricador do ato il´ıcito praticado e as devidas coimas previstas; 5. Em caso de reincidˆencia, elabora¸c˜ao de of´ıcio; 6. Envio de of´ıcio ao infrator identificado; 7. Acompanhamento e verifica¸c˜ao da altera¸c˜ao comportamental. Na sequˆencia da implementa¸c˜ao do sistema PAYT, v´arios autores defendem que as deposi¸c˜oes ilegais e a migra¸c˜ao de res´ıduos s˜ao a principal problem´atica e merecem especial aten¸c˜ao. Desde a implementa¸c˜ao do sistema PAYT no CHG, verificam-se alguns comportamentos desviantes praticados pelos utilizadores dom´esticos e n˜ao-dom´esticos, sendo as mais relevantesa deposi¸c˜ao ilegal em sacos n˜ao autorizados e a deposi¸c˜ao ilegal fora do Centro Hist´orico. Assim, para este tipo de comportamentos, inicialmente ´e afixado um autocolante de “Saco N˜ao Autorizado”. Esta medida revelou-se eficaz, na medida que explicava o motivo da n˜ao recolha do saco. Foram registadas situa¸c˜oes em que, posteriormente `a n˜ao recolha de res´ıduos indiferenciados e respetiva coloca¸c˜ao do autocolante, o saco n˜ao conforme era colocado num saco PAYT para ser recolhido, ou seja, a mensagem era passada. Paralelamente procedia-se ao registo mensal dos sacos n˜ao autorizados no momento da recolha. Desta forma, para estes comportamentos considerados desviantes, foram desenvolvidos outros mecanismos, com o objetivo de aferir o m´aximo de informa¸c˜ao, nomeadamente os 13 Cap´ıtulo 1. Introdu¸c˜ao locais, a parte do dia e os dias da semana onde se verificam. Com isto, em janeiro de 2017, criou-se e distribuiu-se pelas equipas de recolha trˆes autocolantes distintos (Figura 1.7) e folhas de registo para anotar os autocolantes usados diariamente, possibilitando um registo a montante mais fi´avel. Figura 1.7: Autocolantes utilizados nos sacos n˜ao autorizados (reproduzido de VITRUS AMBIENTE (2019a)). Com todos estes dados recolhidos e analisados ´e poss´ıvel conhecer de forma detalhada o comportamento dos prevaricadores, para desta forma atuar, nomeadamente com o policiamento estrat´egico da Pol´ıcia Municipal e com rondas mais intensas. Tendo em considera¸c˜ao as problem´aticas identificadas e com base num plano estruturado, ´e um dos focos a melhoria gradual do projeto PAYT, atrav´es de um trabalho cont´ınuo para garantir a total efic´acia e universalidade do servi¸co. Assim, ao longo do tempo, s˜ao aplicadas v´arias estrat´egias e mecanismos para identificar, fiscalizar e controlar os comportamentos PAYT. Rondas di´arias na ´area intramuros do CHG: tˆem como principal intuito acompanhar de forma muito pr´oxima os comportamentos dos utilizadores PAYT. Para al´em de possibilitar um acompanhamento di´ario das ocorrˆencias do CHG, designadamente, identifica¸c˜ao de prevaricadores e dados sobre as deposi¸c˜oes ilegais. Empowerment do cidad˜ao: Esta metodologia consiste num conjunto de t´ecnicas sociopedag´ogicas que colocam em pr´atica dois instrumentos fundamentais, os mecanismos de “escuta” da popula¸c˜ao e os mecanismos de “participa¸c˜ao”: – O mecanismo de ”escuta”refere-se `as t´ecnicas que s˜ao necess´arias para ouvir a popula- ¸c˜ao, observar o seu comportamento e obter dados sobre a efic´acia de funcionamento do projeto; – O mecanismo de ”participa¸c˜ao”refere-se `as t´ecnicas que s˜ao necess´arias para pˆor a popula¸c˜ao a participar ativamente no pr´oprio projeto, sobretudo no que diz respeito `a sua adapta¸c˜ao `a realidade social em que este se deseja implantar. 14 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local Esta estrat´egia tem-se revelado bastante prof´ıcua e traduziu-se na elabora¸c˜ao de inqu´eritos aos diferentes utilizadores, com o objetivo de percecionar a opini˜ao dos moradores e comerciantes do CHG em rela¸c˜ao `a implementa¸c˜ao do sistema. Tamb´em foram efetuadas a¸c˜oes de sensibiliza¸c˜ao individuais com explica¸c˜oes sobre o funcionamento do sistema , a realiza¸c˜ao de workshops para promover a redu¸c˜ao, reutiliza¸c˜ao e reciclagem de res´ıduos e a distribui¸c˜ao de newsletters de forma a criar uma linha direta de comunica¸c˜ao entre o projeto e os seus utilizadores. A¸c˜oes corretivas: Para os utilizadores n˜ao cumpridores identificados, em primeira instˆancia dirige-se de imediato ao infrator para advertir e perceber o contexto do comportamento observado. Esta a¸c˜ao ´e transversal ao longo do tempo e ´e colocada em pr´atica a partir do momento, em que se identifica um utilizador infrator. Policiamente estrat´egico: No ˆambito da parceria estabelecida entre a VITRUS e a Pol´ıcia Municipal s˜ao desenvolvidas v´arias a¸c˜oes de policiamento estrat´egico nos locais considerados mais problem´aticos. Estas a¸c˜oes tˆem como principal objetivo o vis´ıvel controlo e fiscaliza¸c˜ao por parte da figura de autoridade e acessoriamente a poss´ıvel identifica¸c˜ao de infratores em flagrante delito. Relativamente `a recolha de sacos n˜ao autorizados, no ano de 2016, a recolha de sacos n˜ao autorizados, de uma forma geral, era feita no per´ıodo m´aximo de 48 horas desde a sua deposi¸c˜ao. Ao longo do mˆes de fevereiro de 2017, colocaram-se em pr´atica algumas experiˆencias em rela¸c˜ao `a recolha dos sacos n˜ao autorizados. Inicialmente defendia-se que quanto mais imediata for a recolha pior ´e a rea¸c˜ao do autor da infra¸c˜ao, compreendendo que o comportamento ilegal tinha exatamente o mesmo tratamento do que o comportamento legal, ou seja, era igualmente recolhido quer estivesse a cumprir ou n˜ao. Desta forma, as entidades competentes decidiram transformar o saco de res´ıduos indiferenciados num objeto incomodativo para a popula¸c˜ao, n˜ao recolhendo durante alguns dias. Com a implementa¸c˜ao desta medida alguns utilizadores queixaram-se e denunciavam os autores dos sacos n˜ao autorizados, outros recolhiam o seu saco n˜ao autorizado de forma discreta, outros ainda contribu´ıam para aumentar o monte de sacos n˜ao autorizados, de forma dolosa ou negligente. Posto isto, foi alterada, de forma radical, a estrat´egia de recolha no mesmo timing do envio dos primeiros of´ıcios e do policiamento estrat´egico. No sentido de transparecer ainda mais a mudan¸ca comportamental verificada. Tendo por base a conclus˜ao retirada de que comportamento negativo gera comportamento negativo, da mesma forma, comportamento positivo gera comportamento positivo, e para tal os sacos n˜ao autorizados passaram a ser recolhidos de forma mais c´elere, tornando o local visivelmente mais educado. Por ´ultimo, em rela¸c˜ao `a atribui¸c˜ao de um refor¸co positivo e tendo como princ´ıpio advertir os n˜ao cumpridores e parabenizar os cumpridores, foi desenvolvida a iniciativa de atribuir um d´ıstico aos UND e um certificado aos UD acompanhado de um vale com a 15 Cap´ıtulo 2. Enquadramento –South Kingstown, Rhode: Neste munic´ıpio, em 1994, foi implementado um sistema de etiquetas que eram adquiridas pelos cidad˜aos a 1 u.m., com a finalidade de as colocar nos sacos de deposi¸c˜ao com um limite de 125 litros por saco. Os resultados traduziram-se numa taxa de reciclagem de 40%; –Fort Collins, Colorado: Em 1995, foi implementado um sistema tarif´ario baseado no volume de res´ıduos recolhidos onde, a deposi¸c˜ao de res´ıduos recicl´aveis era gratuita. A reciclagem aumentou para os 79% em residˆencias unifamiliares comparativamente com os 53% do ano anterior. Europa Os sistemas PAYT j´a s˜ao bastante usados no Norte e Centro da Europa, nomeadamente na Su´ı¸ca, ´ Austria, Alemanha, It´alia, Dinamarca e Holanda. Utilizando como referˆencia o estudo Association of Cities & Regions for Recycling and for sustainable Resource Management, elaborado por Dohogne (2016), s˜ao apresentados de seguida os casos com maior relevˆancia na implementa¸c˜ao de sistemas PAYT na Europa: –Interza, B´elgica: Em 2004, foi implementado em Interza, na B´elgica, com uma popula¸c˜ao de 82 425 habitantes e 33 235 habita¸c˜oes, um sistema de sacos pr´e-pagos e pre¸co por volume dos res´ıduos recicl´aveis. Esta metodologia carateriza-se pelo pagamento de sacos de res´ıduos indiferenciados com um valor muito superior ao estipulado para os sacos destinados aos res´ıduos seletivos. Este sistema permitiu uma redu¸c˜ao de 25% nos RU ou equipar´aveis; –Maastricht, Holanda: No Munic´ıpio de Maastricht, na Holanda, com uma popula¸c˜ao abrangida de 122 481 habitantes e um n´umero de habita¸c˜oes igual a 67 281, inaugurou-se em 2001 o projeto com um sistema de sacos pr´e-pagos com um pre¸co estipulado para sacos de 50 litros e a utiliza¸c˜ao de contentores para deposi¸c˜ao de res´ıduos seletivos a t´ıtulo gratuito. Verificou-se um aumento significativo nos res´ıduos seletivos e mais de 50% de separa¸c˜ao nos res´ıduos biodegrad´aveis; –Ume˚a, Su´ecia: Para uma popula¸c˜ao de 119 613 habitantes e 55 943 habita¸c˜oes, em 1996, foi delineado e implementado um sistema de frequˆencia, volume e peso que se caraterizava pela varia¸c˜ao de um pre¸co para uma recolha bimensal de contentor de 4 m3at´e aos contentores de 8 m3. As tarifas s˜ao aplicadas a condom´ınios ou conjunto de habita¸c˜oes t´erreas. N˜ao ´e aplicada qualquer taxa¸c˜ao para res´ıduos seletivos. Verificou-se uma diminui¸c˜ao de 23% dos RU e aumento de 25% na reciclagem nos primeiros dois anos de implementa¸c˜ao. Comparando 1996 e 2014, houve uma diminui¸c˜ao de 44% dos RU e um aumento de 360% na separa¸c˜ao de res´ıduos; –Zollernalbkeries/Zollernalbdistrict, Alemanha: Na Alemanha, no munic´ıpio de Zollernallbkeries, iniciou-se um projeto PAYT em 1998 para uma popula¸c˜ao igual a 184 611 habitantes e 80 123 habita¸c˜oes. Baseado num sistema por frequˆencia e, 22 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local posteriormente, em 2001, num sistema por peso, ´e cobrada uma taxa por unidade de medida (kg) e isen¸c˜ao de pagamento tratando-se de res´ıduos seletivos. Verificou-se ent˜ao uma diminui¸c˜ao dos RU no ano de implementa¸c˜ao e aumento dos materiais recicl´aveis recolhidos nos ecopontos; –Munic´ıpio de Treviso, It´alia: No ano de 2014, no munic´ıpio italiano de Tresivo, foi aplicado um sistema baseado na frequˆencia de recolha dos contentores de RU, para uma popula¸c˜ao de 83 652 habitantes e de 41 951 habita¸c˜oes. ´ E aplicada uma tarifa para contentores de RU de 30 litros e isen¸c˜ao no caso de res´ıduos seletivos. Verificou-se uma diminui¸c˜ao de 80% na produ¸c˜ao de RU entre 2012 e 3014. A taxa de reciclagem aumentou ligeiramente; –Munic´ıpio de Besan¸con, Fran¸ca: Em 2012, no munic´ıpio de Besan¸con, em Fran¸ca, foi adotado um sistema baseado no volume, peso e frequˆencia. Para uma popula¸c˜ao de 176 339 habitantes e 84 873 habita¸c˜oes, a tarifa varia conforme a localiza¸c˜ao do utilizador e a tipologia de contentor, isto ´e, a tarifa consiste no somat´orio de um valor fixo pela recolha quinzenal com o valor vari´avel consoante o peso de res´ıduos depositados e um valor fixo respeitante `a taxa de recolha. De real¸car que para os res´ıduos seletivos n˜ao h´a qualquer custo associado. Os RU tiveram uma redu¸c˜ao de 23% e os recicl´aveis um aumento de 17%; –Munic´ıpio de Innsbruck, ´ Austria: Para 127 944 habitantes distribu´ıdos em 60 234 habita¸c˜oes, em 1995, foi aplicado um sistema baseado no volume, onde o utilizador paga um determinado valor por litro nos RU ou, ent˜ao, os utilizadores podem comprar sacos de 60 litros por um determinado valor fixado pela entidade gestora. Neste caso, os RU reduziram 13% e os recicl´aveis aumentaram 38%. Por todo o planeta, existem comunidades onde os tarif´arios PAYT se encontram implementados ou est˜ao em fase de implementa¸c˜ao. Para Reichenbach (2008), os ´ultimos 20 anos foram fundamentais para o desenvolvimento t´ecnico da implementa¸c˜ao de solu¸c˜oes em sistemas PAYT, onde come¸caram a ser agrupadas condi¸c˜oes de melhoramento que permitem a diminui¸c˜ao na produ¸c˜ao de res´ıduos e o aumento da recolha seletiva, que levou a um acr´escimo no n´umero de pa´ıses europeus e mundiais a adotar este sistema inovador na ´area da Gest˜ao de Res´ıduos Urbanos. 2.2 Aplica¸c˜oes A n´ıvel da Gest˜ao de Res´ıduos Urbanos, v´arios autores aplicam metodologias estat´ısticas com vista `a tomada de decis˜ao. No estudo de Rimaityt˙e et al. (2012) s˜ao selecionados m´etodos de previs˜ao para prever a produ¸c˜ao de Res´ıduos S´olidos Urbanos. Os dados deste estudo dizem respeito `a cidade de Kaunas, na Lituˆania. As previs˜oes relativas `a produ¸c˜ao de RSU foram baseadas na atividade econ´omica da cidade, por modelos de regress˜ao e 23 Cap´ıtulo 2. Enquadramento por modelos de s´eries temporais. Relativamente aos modelos de s´eries temporais foram utilizados os modelos SARIMA (Modelo Autorregressivo Integrado de M´edias M´oveis Sazonal), modelos de alisamento exponencial e a combina¸c˜ao dos dois referidos. Estes m´etodos foram aplicados a dados semanais, i.e., `a produ¸c˜ao semanal de res´ıduos, e a previs˜ao foi feita para um horizonte de um ano. As conclus˜oes retiradas deste estudo basearam-se na precis˜ao das previs˜oes obtidas para cada uma das metodologias e para a combina¸c˜ao das duas, respetivamente. Concluiu-se que a combina¸c˜ao de um modelo SARIMA com o modelo de alisamento exponencial apresenta uma alta precis˜ao devido ao valor do seu erro percentual absoluto m´edio (MAPE). A combina¸c˜ao destas metodologias incorporou a influˆencia de valores aleat´orios e uma tendˆencia crescente. Os autores defendem que este foi um modelo ´util na medida que se obtiveram boas previs˜oes nos valores semanais da produ¸c˜ao de res´ıduos. J´a Song & He (2014) prop˜oem modelos de s´eries temporais de forma a efetuar previs˜oes para a produ¸c˜ao di´aria de RSU na cidade de Seattle no estado americano de Washington. Os dados para modela¸c˜ao completavam cerca de 1001 observa¸c˜oes das quais 901 para treino e 100 para teste. Neste estudo, foram aplicadas trˆes metodologias, para posterior compara¸c˜ao. De forma a comparar a efic´acia das trˆes metodologias, os autores recorreram `a REQM (Raiz do Erro Quadr´atico M´edio) e ao MAPE, concluindo que a mais eficaz foi o modelo SARIMA de sazonalidade di´aria. Em Navarro-Esbr´ı (2002) s˜ao apresentados dois m´etodos de previs˜ao, um m´etodo baseado no modelo SARIMA, segundo a metodologia de Box & Jenkins. No outro m´etodo ´e utilizada a an´alise de sistemas n˜ao lineares, onde se assume que o sistema de produ¸c˜ao de RSU ´e um sistema dinˆamico discreto e extrai as taxas de produ¸c˜ao de res´ıduos para uma posterior modela¸c˜ao. As t´ecnicas utilizadas permitem a previs˜ao para um horizonte temporal pretendido. Nesse estudo os dados para modela¸c˜ao dizem respeito `as cidades de Thessaloniki (Gr´ecia), Valencia (Espanha) e Castell´on (Espanha), que foram analisados e modelados, conforme o planeamento e a posterior recolha de res´ıduos. De forma a avaliar as previs˜oes dos dois m´etodos utilizados, os autores recorrem ao REQM e ao MAPE. Os modelos SARIMA foram os mais adequados uma vez que a t´ecnica com recurso a sistemas n˜ao lineares, de uma forma geral, obt´em um pior ajustamento. Assim, os modelos SARIMA apresentam um melhor ajustamento para este tipo de modela¸c˜ao. 24 Cap´ıtulo 3 Modelos de Regress˜ao Linear A an´alise de regress˜ao consiste numa t´ecnica estat´ıstica utilizada para analisar o comportamento de uma vari´avel de interesse, designada de vari´avel resposta ou vari´avel dependente, como fun¸c˜ao de outras covari´aveis, designadas de vari´aveis explicativas, vari´aveis independentes ou covari´aveis. Esta t´ecnica tem como fundamento a descri¸c˜ao de rela¸c˜oes entre vari´aveis e a estima¸c˜ao ou previs˜ao de valores da vari´avel de interesse para valores, por vezes, n˜ao observados das covari´aveis em estudo. O termo ”regress˜ao” remonta a Galton (1889), que o empregou pela primeira vez num estudo que relacionava a altura entre pais e filhos (Figura 3.1). Nesse estudo, Galton concluiu que embora existisse uma tendˆencia para pais altos terem filhos altos e pais baixos terem filhos baixos, os filhos de pais excecionalmente altos (baixos) n˜ao eram t˜ao altos (baixos) como os seus pais. 64 66 68 70 72 62 64 66 68 70 72 74 Altura média dos pais (polegadas) Altura dos filhos (polegadas) Figura 3.1: Representa¸c˜ao gr´afica dos dados relativos `a hereditariedade (Galton, 1889), com a respetiva reta de regress˜ao. Foi desta forma, que o cientista, primo de Charles Darwin, descobriu que a altura os filhos tendia para a altura m´edia da popula¸c˜ao. Mais tarde, a teoria de Galton foi confir25 Cap´ıtulo 3. Modelos de Regress˜ao Linear mada por um dos seus disc´ıpulos, Karl Pearson, que denominou o fen´omeno descoberto por ”regress˜ao para a m´edia”. Desde essa ´epoca at´e hoje, muitos estudos foram realizados, muitas descobertas e adapta¸c˜oes foram feitas, mas por quest˜oes hist´oricas, o termo ”regress˜ao” permaneceu. Hoje em dia o termo regress˜ao ´e comummente utilizado quando surge a necessidade de estudar uma rela¸c˜ao funcional entre uma ou mais vari´aveis covari´aveis e a vari´avel resposta. Esta rela¸c˜ao ´e representada por um modelo estoc´astico, isto ´e, por uma equa¸c˜ao que associa a vari´avel dependente ou resposta com a(s) vari´avel(eis) independente(s). A uma equa¸c˜ao de regress˜ao que contenha apenas um preditor chama-se equa¸c˜ao de regress˜ao simples ou univariada. A uma equa¸c˜ao que contenha mais do que um preditor d´a-se o nome de equa¸c˜ao de regress˜ao m´ultipla. Independentemente do modelo ser simples ou m´ultiplo, pode ainda ser linear (equa¸c˜ao da reta ou do plano) ou n˜ao linear (equa¸c˜ao exponencial, logar´ıtmica, etc.). Esta t´ecnica ´e utilizada nas diversas ´areas cient´ıficas nas quais se pode encontrar aplica- ¸c˜oes da mesma, desde a Agricultura, Medicina, Biologia, Economia, Sociologia, Psicologia, Engenharia e demais ´areas. Os conte´udos apresentados nas diversas sec¸c˜oes deste Cap´ıtulo tˆem como principal suporte os contributos de Sen & Srivastava (2012) e Fahrmeir & Kneib (2013). 3.1 Regress˜ao Linear M´ultipla Considere-se um modelo de regress˜ao que contenha pcovari´aveis e cuja fun¸c˜ao de regress˜ao seja linear, ou seja, um modelo da forma: yi=β0+β1xi1+β2xi2+. . . +βjxij +. . . +βpxip +i, i = 1, . . . , n (3.1) onde yi´e a vari´avel resposta do i-´esimo elemento da amostra, xij, j = 1, . . . , p, s˜ao os correspondentes valores (fixos) das covari´aveis, β0, β1, . . . , βps˜ao os parˆametros desconhecidos ei´e o erro aleat´orio associado ao elemento ida amostra. O modelo 3.1 ´e denominado por modelo de regress˜ao linear m´ultipla e pode ser visto como a soma de duas componentes, uma determin´ıstica dada por β0+β1xi1+. . .+βpxip = Pp j=0 βjxij com xi0= 1,∀i= 1, . . . , n e outra aleat´oria dada por i. A componente determin´ıstica, mesmo dependendo de parˆametros desconhecidos, ´e considerada fixa, enquanto que a componente aleat´oria admite uma distribui¸c˜ao de probabilidade que usualmente se sup˜oe ser Normal, sendo esta uma condi¸c˜ao que permite a elabora¸c˜ao de testes de hip´oteses e obten¸c˜ao de intervalos de confian¸ca. Recorrendo `a nota¸c˜ao matricial ´e poss´ıvel reescrever o modelo de regress˜ao linear m´ultipla definido na equa¸c˜ao 3.1 como Y=Xβ +(3.2) 26 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local onde, Y=      y1 y2 . . . yn       ,X=      1x11 . . . x1p 1x21 . . . x2p . . .. . ..... . . 1xn1. . . xnp       ,β=      β0 β1 . . . βp       ,=      1 2 . . . n       .(3.3) Na forma matricial, representa-se por Yo vetor n×1 das observa¸c˜oes da vari´avel resposta, por Xa matriz de planeamento n×(p+ 1) constitu´ıda pelas observa¸c˜oes das covari´aveis, por βo vetor (p+1)×1 dos coeficientes de regress˜ao e por o correspondente vetor n×1 dos termos do erro. Segundo Fahrmeir & Kneib (2013), o modelo da equa¸c˜ao 3.1 pressup˜oe, para al´em da existˆencia de uma rela¸c˜ao matem´atica linear entre as vari´aveis, da verifica¸c˜ao de um conjunto de condi¸c˜oes, denominadas ”Condi¸c˜oes de Gauss Markov”: 1. Os erros s˜ao vari´aveis aleat´orias de valor m´edio nulo, isto ´e, E() = 0n×1, fazendo com que E(Y) = Xβ; 2. Os erros s˜ao vari´aveis aleat´orias n˜ao correlacionadas de variˆancia constante, isto ´e, E(T) = σ2In×n, o que implica que Cov(Y) = E(T) = σ2In×n. Nestes modelos os parˆametros s˜ao de f´acil interpreta¸c˜ao, onde o parˆametro β0representa o valor esperado da vari´avel resposta (Y) quando todas as vari´aveis explicativas (xj, j =...,p) s˜ao nulas e cada um dos parˆametros βjindica qual a varia¸c˜ao do valor esperado de Ypor cada incremento unit´ario da vari´avel xjquanto todas as outras covari´aveis se mantˆem constantes. No entanto, apesar das f´aceis interpreta¸c˜oes, os parˆametros s˜ao desconhecidos, pelo que se torna de extrema importˆancia conhecer uma t´ecnica para os estimar. Uma forma de obter essas estimativas ´e o M´etodo de M´ınimos Quadrados, desenvolvido por Legendre (1805), que consiste na minimiza¸c˜ao da soma do quadrado dos erros, isto ´e, minimizar a fun¸c˜ao: SQE =SQE(β0, . . . , βp) = n X i=1 2= n X i=1 (yi− p X j=0 βjxij)2.(3.4) A resolu¸c˜ao deste problema de otimiza¸c˜ao, numa fase inicial, passa por encontrar os valores dos parˆametros que anulam as derivadas parciais da fun¸c˜ao 3.4, ou seja, os valores de βj com j= 0, . . . , p que s˜ao solu¸c˜ao da equa¸c˜ao: ∂SQE ∂βk = 0 ⇔ n X i=1 2(yi− p X j=0 βjxij)(−xik) = 0 (3.5) ⇔ n X i=1 yixik = p X j=0 βj n X i=1 xijxik,com k= 0, . . . , p. 27 Cap´ıtulo 3. Modelos de Regress˜ao Linear O sistema de p+ 1 equa¸c˜oes lineares a p+ 1 inc´ognitas, obtido na equa¸c˜ao 3.5, pode ser reescrito na forma matricial, da seguinte forma (XTX)β=XTY.(3.6) Neste caso, se a matriz XTXfor invert´ıvel, o vetor dos estimadores de m´ınimos quadrados dos coeficientes de regress˜ao linear ´e dado por ˆ β= (XTX)−1(XTY).(3.7) Caso a matriz XTXn˜ao seja invert´ıvel, verifica-se a existˆencia de multicolinearidade, i.e, uma ou mais vari´aveis que s˜ao combina¸c˜ao linear entre si. Nestes casos, as vari´aveis que resultam da combina¸c˜ao linear de outras devem ser retiradas do modelo. Para a verifica¸c˜ao do valor do zero da derivada com um m´ınimo de SQE, s˜ao descritas as defini¸c˜oes de valores ajustados e de res´ıduos, respetivamente. Os valores ajustados s˜ao os valores que, em cada (p+ 1)-´uplo observado (xi0, xi1, . . . , xip), se encontram sobre o hiperplano (p+ 1)-dimensional ajustado, isto ´e, os valores que verificam ˆyi=Pp j=0 ˆ βjxij, i = 1, . . . , n. Numa perspetiva matricial, tem-se ˆ Y=      ˆy1 ˆy2 . . . ˆyn       .(3.8) Os res´ıduos correspondem `as estimativas dos termos de erro e s˜ao dados pelas diferen¸cas entre os valores observados e os valores ajustados ei=yi−ˆyi, para i= 1, . . . , n, o que em nota¸c˜ao matricial pode ser reescrito como e=      e1 e2 . . . en       =Y−ˆ Y=Y−Xˆ β.(3.9) Com estas defini¸c˜oes prova-se que os res´ıduos s˜ao ortogonais `a matriz de planeamento, isto ´e, que se verifica a igualdade XTe= 0(p+1)×1, pois tem-se que XTe=XT(Y−ˆ Y) = XT(Y−Xˆ β) = XTY−XTXˆ β(3.10) eXTY−XTXˆ βcorresponde ao vetor nulo de dimens˜ao (p+ 1) ×1, pois corresponde ao conjunto das equa¸c˜oes normais. Note-se que se todas as colunas da matriz de planeamento s˜ao ortogonais ao vetor dos res´ıduos e se a coluna do termo constante tem todos os elementos iguais `a unidade, ent˜ao facilmente se conclui que a soma dos res´ıduos ´e nula, 28 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local ou seja, n X i=1 ei= 0.(3.11) A ortogonalidade entre as colunas da matriz Xe o vetor de res´ıduos etem como consequˆencia a ortogonalidade entre estes e o vetor de valores ajustados, uma vez que ˆ Y e =ˆ βXTe=ˆ βT0(p+1)×1= 0.(3.12) Uma vez comprovada a ortogonalidade dos res´ıduos em rela¸c˜ao `a matriz de planeamento, torna-se poss´ıvel a verifica¸c˜ao de que os estimadores de m´axima verosimilhan¸ca correspondem a um m´ınimo da fun¸c˜ao representada em 3.4. Para tal, tendo como base a equa¸c˜ao 3.4 em nota¸c˜ao matricial: SQE =(Y−Xβ)T(Y−Xβ) =(Y−Xˆ β+Xˆ β−Xβ)T(Y−Xˆ β+Xˆ β−Xβ) =(Y−Xˆ β)T(Y−Xˆ β) + 2( ˆ β−β)TXT(Y−Xˆ β) +(ˆ β−β)T(XTX)( ˆ β−β).(3.13) Com o resultado acima demonstrado de que os res´ıduos s˜ao ortogonais `a matriz de planeamento verifica-se a igualdade 2(ˆ β−β)TXT(Y−Xˆ β)= 2(ˆ β−β)TXTe= 0, pelo que SQE pode ser simplificada em SQE =(Y−Xˆ β)T(Y−Xˆ β)+(ˆ β−β)T(XTX)( ˆ β−β).(3.14) O primeiro termo da express˜ao 3.14, (Y−Xˆ β)T(Y−Xˆ β), n˜ao depende de βe o segundo termo, (ˆ β−β)T(XTX)( ˆ β−β)´e n˜ao negativo uma vez que n˜ao ´e mais do que a soma de quadrados. Assim, o m´ınimo da fun¸c˜ao ´e atingido no ponto que anular o segundo termo da soma, isto ´e, β=ˆ β. A combina¸c˜ao das condi¸c˜oes de ”Gauss-Markov”com o pressuposto da normalidade dos erros tem-se que Ytem distribui¸c˜ao Normal com E(Y) = Xβ eCov(Y) = σ2I[n×n], pelo que a verosimilhan¸ca da amostra ´e dada por: L(y1, . . . , yn;β, σ2) = n Y i=1  1 √2πσexp  −1 2σ2(yi− p X j=0 βjxij)2  .(3.15) Linearizando e simplificando a equa¸c˜ao 3.15 ´e obtida uma fun¸c˜ao sim´etrica `a fun¸c˜ao obtida em 3.4. Uma vez que a maximiza¸c˜ao de −SQE(β) ´e equivalente `a minimiza¸c˜ao de SQE(β), os estimadores de m´ınimos quadrados para βs˜ao tamb´em os seus estimadores de m´axima 29 Cap´ıtulo 3. Modelos de Regress˜ao Linear verosimilhan¸ca, quando as observa¸c˜oes tˆem distribui¸c˜ao Normal. 3.1.1 Propriedades dos estimadores Os estimadores de m´ınimos quadrados, sob a validade das ”Condi¸c˜oes de Gauss Markov”, gozam de boas propriedades estat´ısticas (Fahrmeir & Kneib, 2013). Considere-se um estimador ˆ θpara um parˆametro θ. Este ´e considerado centrado, quando E(ˆ θ) = θ. Na Regress˜ao Linear, verificada a primeira condi¸c˜ao constante das ”Condi¸c˜oes de Gauss Markov”, ´e estabelecida a nulidade do valor esperado dos erros, para que se chegue `a conclus˜ao que ˆ βs˜ao estimadores centrados para β, uma vez que E(ˆ β) = (XTX)−1(XT)E(Y)=(XTX)−1(XTX)β=β.(3.16) Considerando que os erros para al´em de verificarem a primeira condi¸c˜ao, verificam tamb´em a segunda, isto ´e, admitindo que os erros, apresentam valor m´edio nulo e s˜ao vari´aveis aleat´orias n˜ao correlacionadas de variˆancia constante (σ2), ent˜ao conclui-se que a matriz de covariˆancias dos estimadores de m´ınimos quadrados ´e dada por: Cov(ˆ β) = Cov[(XTX)−1XTY] = [(XTX)−1XT]Cov(Y)[(XTX−1XT)]T =[(XTX)−1XT]σ2In×n[(XTX)−1XT]T= (3.17) =σ2(XTX)−1XTX(XTX)−1=σ2(XTX)−1. ´ E ainda garantida a consistˆencia dos estimadores de m´ınimos quadrados sempre que a soma dos elementos da diagonal principal da matriz (XTX)−1tenda para zero, `a medida que a dimens˜ao amostral se aproxima do infinito, o que ´e equivalente a escrever lim n→+∞tr((XTX)−1)=0. O Teorema de Gauss-Markov garante que os estimadores de m´ınimos quadrados (EMQ) s˜ao os estimadores lineares centrados de variˆancia m´ınima. Desta forma, os EMQ do modelo de regress˜ao m´ultipla s˜ao estimadores BLUE (Best Linear Unbiased Estimators) ou seja, de entre todos os estimadores lineares centrados s˜ao aqueles que possuem variˆancia m´ınima. De real¸car que as propriedades apresentadas s˜ao v´alidas independentemente da matriz de planeamento e da distribui¸c˜ao de probabilidade dos erros aleat´orios, que refor¸ca o facto de que o m´etodo dos m´ınimos quadrados produz bons estimadores em condi¸c˜oes muito gerais. Ent˜ao, sem a verifica¸c˜ao do pressuposto da normalidade dos erros aleat´orios considera-se que os EMQ s˜ao estimadores BLUE, ou seja, dentro da classe dos estimadores lineares s˜ao centrados e de variˆancia m´ınima. Se se admitir a normalidade dos res´ıduos, ou seja, os erros aleat´orios s˜ao vari´aveis aleat´orias independentes e indenticamente distribu´ıdas `a distribui¸c˜ao Normal, onde ∼N(0, σ2), 30 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local pode-se concluir que os EMQ s˜ao estimadores de variˆancia m´ınima n˜ao s´o dentro da classe dos estimadores lineares, mas tamb´em dentro da classe dos estimadors n˜ao lineares. 3.1.2 Estima¸c˜ao de σ2 O resultado obtido na equa¸c˜ao 3.17, na Subsec¸c˜ao 3.1.1, depende do valor de σ2, que geralmente ´e desconhecido e que necessita de ser estimado. A estima¸c˜ao deste parˆametro pode ser realizada com recurso `a soma dos quadrados dos res´ıduos Pn i=1 e2 i, usualmente denominada como soma de quadrados dos erros e denominada por SQE. Para a obten¸c˜ao dos resultados pretendidos defina-se a matriz He a matriz M, respetivamente, que tˆem um papel fundamental na dedu¸c˜ao de algumas das propriedades que se apresentam. A matriz H´e uma matriz n×n, tal que H=X(XTX)−1XT.(3.18) Esta matriz permite enfatizar o facto de que cada um dos valores ajustados pode ser escrito como fun¸c˜ao linear do valores observados, uma vez que: ˆ Y=Xˆ β=X(XTX)−1XTY=HY (3.19) Sendo Ha matriz que transforma Yem ˆ Y´e usualmente designada por matriz hat. A matriz M´e tamb´em uma matriz de dimens˜oes n×ndefinida como M=In−H(3.20) e que, consequentemente, verifica MX = (In−H)X=X−X(XTX)−1XTX=X−X= 0n×(p+1).(3.21) Esta matriz, `a semelhan¸ca de H, permite enfatizar o facto de que cada um dos res´ıduos se pode escrever como fun¸c˜ao linear dos erros aleat´orios, uma vez que e=Y−ˆ Y=Y−HY =MY =M(Xβ +) = M.(3.22) Acrescente-se que qualquer uma das duas matrizes acima definidas, HeM, ´e uma matriz sim´etrica e idempotente. Durante a estima¸c˜ao de σ2, ´e necess´ario evidenciar que se M= (mij) ´e a matriz sim´etrica e idempotente definida na express˜ao 3.20, ent˜ao verifica-se n X i=1 e2 i=T=TMTM =TM = n X i=1 mii2 i+ n X i,j=1 i6=j mijij. 31 Cap´ıtulo 3. Modelos de Regress˜ao Linear assumindo-se que a transforma¸c˜ao das respostas Y(λ) tem distribui¸c˜ao Normal multivariada com matriz de valor m´edio Xβ e matriz de covariˆancias σ2In. Com este pressuposto, facilmente se verifica que a fun¸c˜ao de densidade Y(λ) ´e dada por f(Y(λ))f(Y(λ)) = exp −1 2σ2(Y(λ)−Xβ)T(Y(λ)−Xβ) (2πσ2)n 2 . Se se denotar por J(λ, Y) o jacobiano da transforma¸c˜ao de Yem Y(λ), a densidade de Y´e dada por L(λ, β, σ2|Y,X) = f(Y) = exp −1 2σ2(Y(λ)−Xβ)T(Y(λ)−Xβ) (2πσ2)n 2 J(λ, Y).(3.31) Assumindo que λ´e fixo, os estimadores de m´axima verosimilhan¸ca de (β(λ), σ2(λ)) s˜ao dados por ˆ β(λ) = (XTX)−1XY (λ) e ˆ σ2(λ) = Y(λ)THY (λ) n,(3.32) em que H´e a matriz hat. Substituindo na express˜ao 3.31 os valores (β(λ), σ2(λ) pelos valores obtidos na express˜ao 3.32 e tendo em conta que J(λ, Y ) = Qn i=1 λ−1, obt´em-se a fun¸c˜ao de logverosimilhan¸ca maximizada sobre (β(λ), σ2(λ), com λfixo, dada por: log L(λ|Y, X, ˆ β(λ),ˆ σ2(λ)=C−n 2log ˆ σ2(λ)+(λ−1) n X i=1 log(yi).(3.33) Basta agora maximizar a fun¸c˜ao 3.33 para se obter uma estimativa para λ. A fun¸c˜ao 3.30 pode ainda ser modificada de forma a acomodar valores n˜ao positivos de Y: y(λ) = ((y+λ2)λ1−1 λ1, λ16= 0 log(y+λ2), λ1= 0 (3.34) em que λ= (λ1, λ2)T. Na pr´atica, escolhe-se para λ2o valor que garante que y+λ2>0 qualquer que seja ye para λ1o valor que maximiza a fun¸c˜ao 3.33. Uma vez estabilizada a variˆancia e verificados os restantes pressupostos das ”Condi¸c˜oes de Gauss Markov”, falta ainda verificar o pressuposto da normalidade dos res´ıduos, visto que toda a inferˆencia estat´ıstica por detr´as do modelo de regress˜ao linear se baseia tamb´em neste pressuposto. As representa¸c˜oes gr´aficas mais usuais para a valida¸c˜ao deste pressuposto s˜ao o histograma e o papel de probabilidade. A primeira ´e a imagem estat´ıstica da fun¸c˜ao densidade, pelo que a sua representa¸c˜ao sugere a da fun¸c˜ao densidade da popula¸c˜ao subjacente `a amostra, neste caso a distribui¸c˜ao dos res´ıduos. A segunda, usualmente denominada por QQ-plot, consiste na representa¸c˜ao dos quantis te´oricos da distribui¸c˜ao que se assume para os res´ıduos contra os quantis emp´ıricos destes. Assim, no primeiro caso, quanto mais pr´o38 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local ximo da forma de sino, carater´ıstica ds distribui¸c˜ao Normal, estiver a representa¸c˜ao gr´afica, menor a probabilidade de que o pressuposto em causa n˜ao se verifique. J´a no segundo caso, espera-se a n˜ao viola¸c˜ao do pressuposto quando os pares de pontos do gr´afico se posicionam em torno da bissetriz dos quadrantes ´ımpares. Complementando a an´alise gr´afica, existem os testes de ajustamento. Estes permitem uma verifica¸c˜ao menos subjetiva do pressuposto. Existem v´arios testes de ajustamento, sendo os mais utilizados o de Shapiro-Wilk e o de Kolmogorov-Smirnov. Note-se que nem sempre as representa¸c˜oes gr´aficas permitem detetar a viola¸c˜ao de determinados pressupostos. Por outro lado, os testes de ajustamento quando aplicados a amostras de dimens˜ao elevada podem conduzir `a rejei¸c˜ao da normalidade, mesmo quando a distribui¸c˜ao subjacente aos dados ´e muito pr´oxima da Normal. Assim sendo, o mais adequado, quando se pretende verificar o pressuposto da normalidade dos res´ıduos, ´e combinar uma verifica¸c˜ao visual com uma verifica¸c˜ao anal´ıtica. A falha do pressuposto da normalidade n˜ao ´e condi¸c˜ao suficiente para que as inferˆencias realizadas no decorrer da constru¸c˜ao do modelo linear n˜ao sejam v´alidas. Na verdade, Sen & Srivastava (2012) demonstram que uma vez garantidas as ”Condi¸c˜oes de GaussMarkov”, se se verificar que o m´aximo da diagonal da matriz hat ´e pr´oximo de zero, ent˜ao as distribui¸c˜oes das estat´ısticas de teste teF, apresentadas na Sec¸c˜ao 3.1.3, mantˆem-se e, consequentemente, os resultados dos referidos testes n˜ao devem ser postos em causa. Na pr´atica n˜ao ´e f´acil definir o valor max i=1,...,n(Hii) a partir do qual podemos afirmar que os resultados dos testes s˜ao ainda v´alidos, mesmo que a normalidade dos res´ıduos falhe. No entanto, considera-se que 0,2 ´e um valor suficientemente pequeno para garantir que os resultados s˜ao ainda v´alidos, pelo que mesmo que os res´ıduos n˜ao sejam normais se a desigualdade max i=1,...,n(Hii)<0,2 se verificar, os resultados obtidos mant´em-se fi´aveis. Note-se que a transforma¸c˜ao Box-Cox anteriormente mencionada n˜ao serve apenas para estabilizar a variˆancia, mas tamb´em para estandardizar os res´ıduos. Todavia, esta transforma¸c˜ao pode afetar a rela¸c˜ao existente entre as vari´aveis dependentes e independentes, fazendo com que esta deixe de ser linear, situa¸c˜oes em que o mais adequado ´e transformar tamb´em as covari´aveis. Como esta situa¸c˜ao n˜ao se verificou no decorrer do presente trabalho, n˜ao se ir´a detalhar aqui. 3.1.5 Qualidade do modelo e an´alise de R2 Na Sec¸c˜ao 3.1.3, j´a se viu que ´e poss´ıvel decompor a variabilidade total da amostra (SQT) na soma de quadrados residual (SQE), com a soma de quadrados devida `a regress˜ao (SQR). Com base nesta decomposi¸c˜ao, expressa na equa¸c˜ao 3.25, define-se coeficiente de determina¸c˜ao, (R2), como a percentagem de varia¸c˜ao da amostra que ´e explicada pelo modelo de regress˜ao, o que se traduz na express˜ao R2=SQR SQT = 1 −SQE SQT .(3.35) 39 Cap´ıtulo 3. Modelos de Regress˜ao Linear Se a soma de quadrados residual toma o valor m´ınimo de zero (SQE = 0), ent˜ao o coeficiente de determina¸c˜ao ´e unit´ario (R2= 1) e estamos perante um ajustamento perfeito. J´a quando ´e a soma de quadrados de regress˜ao que se anula (SQR = 0), o valor da soma de quadrados residual ´e m´aximo, coincidindo com o valor da variabilidade total da amostra e, consequentemente, o valor do coeficiente de determina¸c˜ao ´e nulo. Neste cen´ario, o modelo linear em nada contribui para explicar a variabilidade das observa¸c˜oes. Assim sendo, ´e intuitivo compreender que o coeficiente de determina¸c˜ao est´a compreendido entre 0 e 1 e que quanto mais pr´oximo estiver da unidade, melhor ´e o ajustamento do modelo. Contudo, um valor elevado de R2n˜ao implica necessariamente que o modelo de regress˜ao esteja bem ajustado, uma vez que a adi¸c˜ao de uma nova vari´avel aumenta sempre o seu valor, mesmo que essa vari´avel n˜ao seja estatisticamente significativa. Por outro lado, se a variˆancia dos termos de erro for de facto elevada porque faltam vari´aveis no modelo, este coeficiente tende a ser reduzido, o que n˜ao significa necessariamente que o modelo esteja mal ajustado. Desta forma, o coeficiente de determina¸c˜ao n˜ao s´o deve ser utilizado como precau¸c˜ao como deve ser encarado como uma medida da utilidade do modelo e n˜ao como medida da qualidade do seu ajustamente. Note-se que existem outros indicadores que medem a qualidade do ajustamento, como o coeficiente de determina¸c˜ao ajustado ou o Crit´erio de Informa¸c˜ao de Akaike. Qualquer um deles tem a vantagem de levar em conta o n´umero de covari´aveis utilizadas, mas ambos tˆem a desvantagem da perda do compromisso entre a soma dos quadrados dos erros e a soma dos quadrados da regress˜ao. Assim, estas duas medidas apenas s˜ao ´uteis quando se pretende comparar dois ou mais modelos, n˜ao evidenciando qualquer informa¸c˜ao quando calculadas para um ´unico modelo. 3.1.6 Predi¸c˜ao Uma aplica¸c˜ao muito importante de um modelo de regress˜ao ´e a previs˜ao de novas ou futuras observa¸c˜oes de Y, correspondentes a determinadas combina¸c˜oes das covari´aveis, ou seja, estimar o valor da vari´avel Y?quando o conjunto de covari´aveis toma valores at´e ent˜ao desconhecidos Y?=x?β+?, em que ?tem distribui¸c˜ao Normal, N(0, σ2). No entanto, o mais usual n˜ao ´e se queira uma estimativa pontual para a predi¸c˜ao de novas observa¸c˜oes, mas sim uma estimativa intervalar. A constru¸c˜ao da vari´avel fulcral que est´a na base de c´alculo do intervalo de confian¸ca pretendido baseia-se na estandardiza¸c˜ao do erro de predi¸c˜ao, vari´avel que ´e combina¸c˜ao linear do vetor dos estimadores de m´ınimos quadrados e do termo de erro ?, ambos normalmente distribu´ıdos e independentes. O erro padr˜ao, dado por ˆ Y?−Y?=x?T (ˆ β−β)−?, ´e uma vari´avel aleat´oria com distribui¸c˜ao Normal de valor m´edio nulo, j´a que se tem: Eˆ Y?−Y?=Ex?T (ˆ β−β)−?=x?T E(β−β)= 0 (3.36) 40 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local e variˆancia igual ao erro quadr´atico m´edio de ˆ Y?, ou seja, variˆancia igual a: V ar ˆ Y?−Y?=EQM(ˆ Y?) = Eh(ˆ Y?−Y?)2i=Eˆ Y?−Y?ˆ Y?−Y?T =Ex?T ˆ β−β−?x?T ˆ β−β−?T= =Ex?T ˆ β−β−?ˆ β−βT x?−?T = =Ehx?T (ˆ β−β)( ˆ β−β)Tx?−x?T (ˆ β−β)?T −?(ˆ β−β)Tx?+??T i =Ehx?T (ˆ β−β)( ˆ β−β)Tx?−x?T (ˆ β−β)?T −?(ˆ β−β)Tx?i+E??T = =x?T Cov(βT)x?T +Cov(?)= =x?T σ2(XXT)−1x?+σ2=σ2x?T (XXT)−1x?+ 1.(3.37) Desta forma, a vari´avel ˆ Y?−Y? √σ2[x?T (XXT)−1x?+1] r(n−p−1)S2 σ2 n−p−1 =ˆ Y?−Y? Spx?T (XXT)−1x?+ 1 (3.38) tem distribui¸c˜ao tde Student com n−p−1 graus de liberdade e, consequentemente, o intervalo equilibrado de (1 −α)100% de confian¸ca para Y?´e dado por ˆ Y?−tn−p−q,1−α 2Sqx?T (XXT)−1x?+ 1; ˆ Y?+tn−p−q,1−α 2Sqx?T (XXT)−1x?+ 1 (3.39) em que tn−p−1;1−α 2designa, como habitualmente, o quantil de ordem α 2da distribui¸c˜ao t de Student com n−p−1 graus de liberdade. 3.2 Modela¸c˜ao da Sazonalidade A componente de sazonalidade (St) incorporada num modelo de regress˜ao pretende representar uma variabilidade peri´odica. Tal pode corresponder a um aumento/decr´escimo que ocorre regularmente em determinados per´ıodos do ano, originando oscila¸c˜oes que se repetem. Muitos dados s˜ao recolhidos mensalmente, tendo usualmente a s´erie temporal associada uma forte componente sazonal, podendo esta ser explicada, por exemplo, por causas naturais, tais como as esta¸c˜oes do ano ou outros fatores que influenciam de forma direta os valores obtidos Na abordagem descrita por Gon¸calves & Alpuim (2011), baseada nos modelos lineares, a componente sazonal γt, toma doze valores diferentes, λi,i= 1,...,12, cada um associado a um mˆes e expressam o desvio positivo ou negativo dos dados derivado ao efeito do mˆes. Este efeito ´e descrito com o aux´ılio de onze vari´aveis indicatrizes e a soma dos coeficientes 41 Cap´ıtulo 3. Modelos de Regress˜ao Linear deve, no total, ser igual a zero. A componente sazonal ´e representada pela combina¸c˜ao linear de onze covari´aveis, γtdefinidas por: γt=         1 se os dados no tempo tcorrespondem ao mˆes i,i= 2,...,12 −1 se os dados no tempo tcorrespondem ao mˆes 1 0 caso contr´ario. (3.40) A componente sazonal relativa ao mˆes 1 pode ser obtida a partir da seguinte f´ormula ˆ λ⊥=− 12 X i=2 ˆ λi.(3.41) O modelo de regress˜ao integra duas componentes: uma relativa `a componente com vari´aveis indicatrizes, S, associadas `a componente sazonal e, por fim, um erro estoc´astico. Com isto, o modelo com indicadores sazonais pode ser escrito como Yt=Tt+β1D1+. . . +βsDs+t,(3.42) onde Ttrepresenta a tendˆencia (em fun¸c˜ao de tsem o termo constante, β0), β1, . . . , βs s˜ao os coeficientes que refletem os sefeitos sazonais e Di(i= 1, . . . , s) s˜ao as svari´aveis indicatrizes que representam os diferentes per´ıodos sazonais: tomam o valor 1 quando o tempo tpertence ao per´ıodo ie 0 nos casos restantes, ent˜ao βis´o ´e tido em considera¸c˜ao para observa¸c˜oes registadas nesse mˆes. Intuitivamente, este modelo pode ser visto como um modelo linear onde existe um n´ıvel distinto para cada per´ıodo, que representa o seu efeito. 42 Cap´ıtulo 4 S´eries Temporais Neste Cap´ıtulo s˜ao abordadas algumas das no¸c˜oes sobre S´eries Temporais e Processos Estoc´asticos para compreens˜ao dos t´opicos abordados. 4.1 Conceito de S´erie Temporal Designa-se de s´erie temporal um conjunto de observa¸c˜oes medidas de forma ordenada no tempo. Essas medi¸c˜oes podem ser feitas continuamente no tempo ou apenas em momentos espec´ıficos, geralmente igualmente espa¸cados: dias, meses, trimestres ou anos. Defini¸c˜ao 1. Uma s´erie temporal consiste num conjunto de observa¸c˜oes medidas sequencialmente no tempo. Desta forma, considerem-se o conjunto de observa¸c˜oes Yt1, Yt2, . . . , Ytn nos per´ıodos t1, t2, . . . , tncontados a partir de uma determinada origem. As s´eries temporais podem ser cont´ınuas (Yt, t ∈R) ou discretas (Yt, t = 1,2, . . . , n) e, segundo Chatfield (2000, 2004), as s´eries s˜ao assim designadas independentemente da natureza da vari´avel medida. Acrescente-se que, as s´eries temporais podem tamb´em ser classificadas em univariadas, se s˜ao constitu´ıdas por observa¸c˜oes de uma s´o vari´avel, e em multivariadas, se se observarem mais vari´aveis em cada instante. Na an´alise de s´eries temporais cont´ınuas, de uma forma geral, estas s˜ao transformadas em s´eries discretas com intervalos de tempo iguais. Este procedimento, de uma forma geral, n˜ao resulta numa perda significativa de informa¸c˜ao sob a condi¸c˜ao de o intervalo de amostragem ser suficientemente pequeno. Regra geral, os dados de s´eries temporais tˆem uma propriedade muito peculiar: observa¸c˜oes sucessivas s˜ao correlacionadas e, ent˜ao, a an´alise desses dados deve ter em conta a ordem em que as observa¸c˜oes s˜ao recolhidas. De facto, no caso de s´eries temporais univariadas, cada observa¸c˜ao pode ser vista como bivariada, considerando que a segunda vari´avel corresponde ao tempo em que esta ´e observada (Chatfield, 2000). Conforme Box (2013) e Chatfield (2000), o estudo de s´eries temporais s´erie tem como objetivos principais: 43 Cap´ıtulo 4. S´eries Temporais 1. descrever os dados usando estat´ısticas descritivas e/ou m´etodos gr´aficos e compreender o mecanismo gerador da s´erie, ou seja, procurar encontrar raz˜oes que justifiquem o comportamento da s´erie, monitorizar a sua trajet´oria, analisar periodicidades relevantes nos dados, etc.; 2. encontrar um modelo estat´ıstico adequado para descrever a evolu¸c˜ao da s´erie temporal. S˜ao v´arios os modelos propostos, entre os quais se destacam os modelos ARIMA; 3. prever o comportamento futuro da s´erie, o que pode revelar-se extremamente ´util na constru¸c˜ao e execu¸c˜ao de planos a curto, m´edio ou longo prazos e/ou no controlo de um determinado processo. Estas previs˜oes podem ser a 1-passo, se realizadas apenas para a observa¸c˜ao seguinte, ou multi-passos, se englobam v´arias observa¸c˜oes futuras. Para Persons (1919), a varia¸c˜ao de uma s´erie temporal pode ser decomposta em 4 componentes: a tendˆencia (T), a componente sazonal (S), a componente c´ıclica (C) e a componente irregular/residual (E). Por sua vez, o autora Alpuim (1998) descreve-as como: Tendˆencia (T) ´e a inclina¸c˜ao que a s´erie temporal apresenta ao longo do tempo, podendo esta ser linear ou n˜ao, crescente ou decrescente. A tendˆencia pode ser consequˆencia do facto dos valores observados dependerem de uma componente determin´ıstica que ´e fun¸c˜ao mon´otona do tempo, embora para muitos autores esta possa ser de natureza estoc´astica; Sazonalidade (S) corresponde a um padr˜ao de aumento e diminui¸c˜ao que ocorre regularmente na s´erie em per´ıodos espec´ıficos, originando oscila¸c˜oes que se repetem. O movimento dentro de um per´ıodo tem, ent˜ao, dura¸c˜ao fixa e ´e atribu´ıdo a fatores “sazonais”, i.e., relacionados com aspetos do calend´ario (e.g., os meses ou trimestres de um ano ou os dias de uma semana). A sazonalidade pode ser classificada como aditiva, se n˜ao depende do n´ıvel da s´erie, ou multiplicativa, quando ´e proporcional ao mesmo (Chatfield, 2000); Componente c´ıclica (Ctrata-se de um padr˜ao de flutua¸c˜ao que n˜ao apresenta qualquer periodicidade definida (i.e., a sua dura¸c˜ao n˜ao ´e fixa e, portanto, o seu comprimento varia frequentemente de ciclo para ciclo) nem causa atribu´ıda a fatores “sazonais”. Generalizando, os ciclos s˜ao qualquer componente n˜ao-sazonal que apresenta um padr˜ao reconhec´ıvel; Aleatoriedade (E) ´e a componente que cont´em qualquer varia¸c˜ao n˜ao explicada pelas componentes anteriores e representa o ru´ıdo aleat´orio. Quando esta componente ´e modelada por um processo estoc´astico de vari´aveis aleat´orias n˜ao correlacionadas e identicamente distribu´ıdas, ´e denominada como um ru´ıdo branco; Na generalidade, os m´etodos para a an´alise de s´eries temporais baseiam-se na decomposi¸c˜ao da varia¸c˜ao da s´erie nas componentes verificadas anteriormente. Considere-se Yt 44 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local como o valor da s´erie temporal no tempo t,Tta tendˆencia no tempo t,Sta componente sazonal no tempo teEta componente irregular no tempo t. Acrescente-se que a presen¸ca de uma componente c´ıclica (C) encontra-se incorporada na tendˆencia . Considere-se o modelo de decomposi¸c˜ao aditivo que descreve cada valor da s´erie temporal como sendo a soma das suas componentes, ou seja, Yt=Tt+St+Et,(4.1) enquanto que no modelo de decomposi¸c˜ao multiplicativo cada observa¸c˜ao ´e o produto dessas mesmas componentes, Yt=Tt×St×Et.(4.2) Um modelo aditivo ´e apropriado quando a magnitude das oscila¸c˜oes sazonais n˜ao varia com o n´ıvel da s´erie. No entanto, se estas aumentam ou diminuem proporcionalmente com a tendˆencia da s´erie, ent˜ao um modelo multiplicativo ´e o mais adequado (Wheelwright, 1998). A decomposi¸c˜ao multiplicativa ´e predominante, na medida que a maioria das s´eries em estudo apresentam uma varia¸c˜ao sazonal que obedece ao n´ıvel da s´erie. Nesses casos ´e aplicada uma transforma¸c˜ao dos dados, nomeadamente a transforma¸c˜ao logar´ıtmica, de forma a converter um modelo multiplicativo num modelo aditivo. Desta forma, aplicando a transforma¸c˜ao logar´ıtimica em 4.2 obt´em-se log Yt= log Tt+ log St+ log Et.(4.3) Desta forma obt´em-se um modelo multiplicativo por ajustamento de um modelo aditivo ao logaritmo dos dados. Note que um modelo de decomposi¸c˜ao multiplicativo n˜ao deve ser implementado para s´eries temporais de valores negativos ou nulos (Caiado, 2011). Os modelos de decomposi¸c˜ao aditivo e multiplicativo n˜ao s˜ao as ´unicas formas de decompor uma s´erie temporal e, com a sua combina¸c˜ao, podem origem a outros modelos que incluem rela¸c˜oes tanto aditivas como multiplicativas. A t´ıtulo de exemplo, o resultado dessa combina¸c˜ao pode originar um modelo multiplicativo com erros aditivos expresso por Yt=Tt×St+Et.(4.4) Cleveland & Terpenning (1982) introduziram uma ferramenta proveitosa com vista `a decomposi¸c˜ao de s´eries temporais: os gr´aficos de decomposi¸c˜ao. Estes gr´aficos permitem visualizar graficamente as v´arias componentes (Wheelwright, 1998). No ambiente R, segundo Hyndman (2019), aplicando a fun¸c˜ao decompose, a s´erie temporal ´e dividida em trˆes componentes: sazonalidade (S), tendˆencia (T) e aleatoriedade (E). Na pr´atica esta fun¸c˜ao torna-se vantajosa na medida que possibilita a avalia¸c˜ao das diversas componentes de forma distinta e, desta forma, auxiliar na identifica¸c˜ao do comportamento das mesmas. 45 Cap´ıtulo 4. S´eries Temporais 4.2 Processos Estoc´asticos Considerando um processo estoc´astico {Y(t), t ∈ T }, uma s´erie temporal ´e um conjunto de observa¸c˜oes do processo estoc´astico em instantes t1, t2, . . . , tn. Generalizando, considera-se tinteiro (i.e., t= 0,±1,±2, . . . ) e as observa¸c˜oes s˜ao feitas em intervalos de tempo regulares, isto ´e, com a mesma amplitude (Alpuim, 1998). Defini¸c˜ao 2. Um processo estoc´astico ´e qualquer fam´ılia ou cole¸c˜ao de vari´aveis aleat´orias Y(t), t ∈ T, em que T´e um conjunto de ´ındices representando o tempo. O conjunto de ´ındices Tdesigna-se de espa¸co de parˆametros e o contradom´ınio das vari´aveis aleat´orias Y(t) ´e definido de espa¸co de estados, representado por S. Quanto `a natureza de T, se T=Zou T=Ndiz-se que o processo ´e de tempo discreto e se T=R ou, mais comummente, T=R+diz-se que o processo ´e de tempo cont´ınuo. Para caracterizar um processo estoc´astico deve-se especificar a distribui¸c˜ao de probabilidade conjunta de nvari´aveis aleat´orias (Y(t1), . . . , Y (tn)) para todos os inteiros ne quaisquer pontos t1, . . . , tn. Contudo, esta forma de definir um processo estoc´astico ´e complexa e, na pr´atica, ´e inexequ´ıvel. Com isto, uma alternativa mais acess´ıvel para descrever um processo estoc´astico ´e atrav´es dos momentos do processo, em particular os primeiro e segundo momentos, designados por valor m´edio µ(t) = E[Y(t)] e fun¸c˜ao de autocovariˆancia γ(t1, t2) = E[(Y(t1)−µ(t1))(Y(t2)−µ(t2))], respetivamente. A variˆancia σ2(t) = V ar[Y(t)] ´e um caso particular da fun¸c˜ao de autocovariˆancia (quando t1=t2) mas, por si s´o n˜ao ´e suficiente para definir os segundos momentos de uma sequˆencia de vari´aveis aleat´orias (Chatfield, 2003). A s´erie de valores observados, que comp˜oem a s´erie temporal, ´e considerada apenas uma ´unica realiza¸c˜ao (ou trajet´oria) de um processo estoc´astico, de entre todas as poss´ıveis. Geralmente, na an´alise de s´eries temporais ´e pretendida a inferˆencia sobre um processo estoc´astico desconhecido tendo como informa¸c˜ao dispon´ıvel uma ´unica realiza¸c˜ao observada (Cordeiro, 2011). Os processos estoc´asticos dividem-se se em estacion´arios e n˜ao estacion´arios. Na presente Sec¸c˜ao, s˜ao apresentados os dois tipos de estacionariedade (forte e fraca), alguns procedimentos que permitem transformar processos n˜ao estacion´arios em estacion´arios e outras ferramentas essenciais para a posterior modela¸c˜ao das s´eries temporais: as fun¸c˜oes de autocorrela¸c˜ao (FAC), fun¸c˜oes de autocorrela¸c˜ao parcial, (FACP) e o processo de ru´ıdo branco. 4.2.1 Processos Estoc´asticos Estacion´arios Em termos gerais, os processos estacion´arios refletem a situa¸c˜ao em que o sistema se apresenta num estado de equil´ıbrio estat´ıstico em torno de um n´ıvel m´edio fixo, ou seja, tem propriedades probabil´ısticas que s˜ao est´aveis ou invariantes ao longo do tempo (Murteira, 2000). As Defini¸c˜oes 3 e 4, segundo Menezes (2019), apresentam os conceitos 46 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local de processo estoc´astico estritamente estacion´ario (ou fortemente estacion´ario) e processo estoc´astico de 2. ª ordem (ou fracamente estacion´ario). Defini¸c˜ao 3. Um processo estoc´astico {Y(t), t ∈ T } diz-se estritamente estacion´ario (ou fortemente estacion´ario) se e s´o se a distribui¸c˜ao conjunta de (Y(t1), . . . , Y (tn)) ´e igual `a distribui¸c˜ao conjunta de (Y(t1+δ), . . . , Y (tn+δ)) qualquer que seja o n-´uplo (t1, . . . , tn) e para qualquer δ, ou seja, F(Y(t1),...,Y (tn))(y1, . . . , yn) = F(Y(t1+δ),...,Y (tn+δ))(y1, . . . , yn) em todos os pontos (y1, . . . , yn). Pode dizer-se que um processo fortemente estacion´ario usufrui da propriedade de que a distribui¸c˜ao de um qualquer conjunto de margens se mant´em a mesma, quando estas s˜ao sujeitas a uma transla¸c˜ao no tempo (Alpuim, 1998). A estacionariedade no sentido estrito ´e uma propriedade demasiado exigente e, na maioria dos casos, de dif´ıcil verifica¸c˜ao. Os processos estacion´arios de 2. ª ordem (ou fracamente estacion´arios) obedecem a uma propriedade mais fraca mas que, grosso modo, descreve o mesmo tipo de comportamento (Murteira, 2000). Defini¸c˜ao 4. Um processo {Y(t), t ∈ T } diz-se estacion´ario de 2. ª ordem (ou fracamente estacion´ario) se e s´o se todos os momentos at´e `a 2. ª ordem de (Y(t1), . . . , Y (tn)) existem e s˜ao iguais aos momentos correspondentes at´e `a 2. ª ordem de (Y(t1+δ), . . . , Y (tn+δ)). Logo, num processo fracamente estacion´ario: 1. o valor m´edio n˜ao depende de t:µ(t) = µ; 2. a variˆancia n˜ao depende de t:σ2(t) = σ2; 3. a covariˆancia de Y(t1)eY(t2)depende apenas do desfasamento D(t2−t1): Cov[Y(t1), Y (t2)] = γ(|t2−t1|). Considere-se que os momentos at´e `a 2. ª ordem existem e s˜ao finitos, logo se Y(t) ´e estritamente estacion´ario e os seus momentos at´e `a 2. ª ordem s˜ao finitos, ent˜ao Y(t) tamb´em ´e estacion´ario de 2. ª ordem. Acrescente-se que a rec´ıproca pode n˜ao se verificar . Na apresenta¸c˜ao dos pr´oximos conceitos, considerem-se apenas processos estacion´arios de 2. ª ordem, designados por processos estacion´arios, e Yta representar um processo estoc´astico, independentemente do tempo t. Defini¸c˜ao 5. Para um processo estacion´ario, define-se a fun¸c˜ao de autocovariˆancia γk=Cov[Yt, Yt+k] = E[(Yt−µ)(Yt+k−µ)], que mede a intensidade com que covariam (se acompanham) pares de valores do processo separados por um intervalo (lag) de amplitude k. 47 Cap´ıtulo 4. S´eries Temporais desde ent˜ao, este tem sido um dos testes mais usados no estudo da estacionariedade de s´eries temporais. Desta forma, considere-se um processo definido por Yt=φYt−1+t,−1≤φ≤1,(4.12) onde t´e um ru´ıdo branco. Este processo ´e estacion´ario se |φ|<1 (trata-se de um processo autorregressivo de ordem 1, como se ver´a na Sec¸c˜ao 5.1.1). No entanto, quando φ= 1 este processo ´e um passeio aleat´orio o que, como foi visto anteriormente, equivale a fazer uma diferencia¸c˜ao de 1. ª ordem. Assim, se φ= 1, pode dizer-se que a s´erie ´e n˜ao estacion´aria. O processo descrito pela equa¸c˜ao 4.12 pode ser escrito na forma das diferen¸cas, ou seja, Yt=φYt−1+t⇔Yt−Yt−1=φYt−1−Yt−1+t ⇔ ∇Yt= (φ−1)Yt−1+t ⇔ ∇Yt=δYt−1+t,(4.13) onde δ=φ−1 e t´e um processo estacion´ario. Com isto e, neste caso, um processo mais complexo que o apresentado em 4.12 ´e definido por Yt=φ1Yt−1+φ2Yt−2+···+φpYt−p+t,(4.14) Assim, repetindo o processo apresentado 4.13, tem-se ∇Yt=δYt−1+ p−1 X j=1 γj∇Yt−j+t,(4.15) onde δ=Pp i=1 φi−1, γj=−Pp i=j+1 φi,∇Yt−j=Yt−j−Yt−j−1et´e um ru´ıdo branco. Esta decomposi¸c˜ao separa o modelo 4.14 em dois termos: Yt−1e as p−1 primeiras diferen- ¸cas. No caso em que Yt´e I(1) (passeio aleat´orio), esta separa¸c˜ao envolve uma componente I(1) e p−1 componentes I(0) (estacion´arias). Na terminologia comum, diz-se que o modelo original foi aumentado por p−1 componentes de primeiras diferen¸cas, dando origem `a designa¸c˜ao ADF (p−1). Para o modelo 4.15, a existˆencia de uma raiz unit´aria ´e garantida se Pp i=1 φi= 1, isto ´e, se δ= 0. Assim, as hip´oteses a testar s˜ao, tamb´em neste caso, H0:δ= 0 vs H1:δ < 0 e a n˜ao rejei¸c˜ao da hip´otese nula implica a n˜ao estacionariedade de Yt. Como este teste ´e unilateral `a esquerda, a hip´otese nula ´e rejeitada a um n´ıvel de significˆancia αse a estat´ıstica de teste for inferior ou igual ao quantil (1 −α)100% da distribui¸c˜ao correspondente (valor cr´ıtico). 54 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local Al´em da equa¸c˜ao 4.15, s˜ao propostas duas outras equa¸c˜oes ∇Yt=a0+δYt−1+ p−1 X j=1 γj∇Yt−j+t,(4.16) ∇Yt=a0+a1t+δYt−1+ p−1 X j=1 γj∇Yt−j+t,(4.17) cuja diferen¸ca reside, novamente, na presen¸ca ou ausˆencia de uma constante a0e/ou de um termo determin´ıstico a1t. Um dos principais problemas do teste ADF ´e decidir qual o n´umero de termos a incluir na equa¸c˜ao a ser testada, ou seja, o valor de p. Para este estudo ´e utilizada a estrat´egia baseada na regra proposta por Ng & Perron (1995) que consiste, numa primeira etapa, em definir um limite m´aximo para p,pmax. Numa segunda etapa calcula-se o teste ADF considerando p=pmax e, se o valor absoluto da estat´ıstica tpara testar a significˆancia da diferen¸ca de ordem pfor maior do que 1,6, define-se p=pmax e prossegue-se com o teste, caso contr´ario reduz-se pem uma unidade e repete-se o processo. Segundo Schwert (2002) pode determinar-se pmax por pmax ="12 T 1001/4#, onde [x] representa a parte inteira de xeTo n´umero de observa¸c˜oes. Esta ser´a a estrat´egia adotada para definir o valor de p. Teste de KPSS O teste de KPSS permite avaliar a estacionariedade de um processo. No entanto, neste caso, as hip´oteses a testar s˜ao diferentes do teste ADF, ou seja, H0: O processo ´e estacion´ario vs H1: O processo ´e n˜ao estacion´ario. Se se considerar o processo Yt, a equa¸c˜ao deste teste decomp˜oe Ytnuma soma de trˆes componentes: uma tendˆencia determin´ıstica (Tt), um passeio aleat´orio (µt) e um erro estacion´ario (ut), ou seja, Yt=Tt+µt+ut,(4.18) µt=µt−1+t,(4.19) onde t´e um ru´ıdo branco. Este teste ´e unilateral `a direita e, portanto, a hip´otese nula ´e rejeitada a um n´ıvel de significˆancia αse a estat´ıstica de teste for superior ou igual ao quantil (1 −α)100% da distribui¸c˜ao correspondente (valor cr´ıtico). 55 Cap´ıtulo 4. S´eries Temporais 56 Cap´ıtulo 5 M´etodos de Previs˜ao em S´eries Temporais Segundo Cordeiro (2011), a distin¸c˜ao entre modelo, representa¸c˜ao matem´atica da estrutura estoc´astica de uma s´erie temporal atrav´es de uma equa¸c˜ao ou sistema de equa¸c˜oes, e m´etodo, procedimento para calcular previs˜oes, nem sempre foi clara. Sabe-se que um modelo estat´ıstico determina um processo gerador dos dados que, tem como finalidade, a obten¸c˜ao de toda a distribui¸c˜ao de probabilidade para um momento futuro. Para al´em das previs˜oes pontuais para um determinado horizonte temporal, um modelo tamb´em permite o c´alculo de previs˜oes intervalares (intervalos de previs˜ao), para um n´ıvel de confian¸ca associado. Um m´etodo de previs˜ao ´e um procedimento para calcular previs˜oes a partir de valores presentes e passados. Como tal, pode ser simplesmente um algoritmo e n˜ao depender de um modelo de probabilidade subjacente ou, alternativamente, surgir da identifica¸c˜ao de um modelo espec´ıfico para os dados fornecidos e da localiza¸c˜ao de previs˜oes condicionadas a esse modelo (Chatfield, 2000). A escolha do m´etodo depende de uma variedade de considera¸c˜oes, tais como o objetivo do c´alculo das previs˜oes, o tipo de s´erie temporal em estudo e respetivas componentes, a dimens˜ao da s´erie temporal, o horizonte de previs˜ao, o conhecimento e experiˆencia do analista e, tamb´em, a disponibilidade dos programas inform´aticos. Tendo conhecimento sobre a diversidade de m´etodos de previs˜ao que se podem aplicar a uma s´erie temporal, cada um com as suas capacidades e limita¸c˜oes, deve escolher-se o m´etodo que pare¸ca mais adequado. Na presente disserta¸c˜ao ´e estudada a abordagem cl´assica de Box-Jenkins. 57 Cap´ıtulo 5. M´etodos de Previs˜ao em S´eries Temporais 5.1 A Metodologia Box-Jenkins Box & Jenkins (1970) introduziram uma abordagem pr´atica e sistem´atica para a constru¸c˜ao de modelos SARIMA (Seasonal Autoregressive Integrated Moving Average), baseada nos trabalhos de Yule (1926) e Wold (1938), conhecida como metodologia Box-Jenkins. Esta metodologia trata-se de um processo de modela¸c˜ao iterativo dividido em trˆes fases: identifica¸c˜ao do modelo, estima¸c˜ao dos parˆametros e an´alise de diagn´ostico (ou valida¸c˜ao do modelo). Este processo ´e tipicamente repetido v´arias vezes at´e que um modelo satisfat´orio seja selecionado. A ideia que sustenta a identifica¸c˜ao do modelo ´e que, se uma s´erie temporal ´e gerada a partir de um processo SARIMA, ent˜ao deve ter algumas propriedades te´oricas de autocorrela¸c˜ao. Desta forma, ao comparar os padr˜oes emp´ıricos de autocorrela- ¸c˜ao com os te´oricos, ´e frequentemente poss´ıvel identificar um ou v´arios potenciais modelos para a s´erie temporal a estudar. Box & Jenkins (1970) propuseram, ent˜ao, usar a fun¸c˜ao de autocorrela¸c˜ao (FAC) e a fun¸c˜ao de autocorrela¸c˜ao parcial (FACP) como ferramentas b´asicas para identificar as ordens do modelo SARIMA (Zhang, 2003). Os modelos SARIMA, introduzidos por Box & Jenkins (1970), permitem modelar e prever s´eries temporais estacion´arias e n˜ao estacion´arias, descrevendo a s´erie Ytcomo fun¸c˜ao dos seus valores passados e como combina¸c˜ao linear de uma sucess˜ao de choques aleat´orios. Nos modelos SARIMA classificam-se em : modelo autorregressivo (AR), que considera que o comportamento da s´erie pode ser explicado atrav´es do seu passado; o modelo de m´edias m´oveis (MA), que explica a s´erie temporal atrav´es de uma sucess˜ao de choques aleat´orios; e ainda o modelo autorregressivo e de m´edias m´oveis (ARMA), que, tal como o nome indica, se trata de uma combina¸c˜ao dos dois modelos anteriores. Estes modelos s˜ao ´uteis para s´eries estacion´arias, revelando-se, ent˜ao, insuficientes para modelar casos de n˜ao estacionariedade. Nesses casos, deve optar-se pelos modelos integrados (ARIMA) ou, para s´eries que apresentam sazonalidade, pelos equivalentes sazonais (SARIMA). A metodologia Box-Jenkins ´e um processo iterativo que auxilia na escolha do modelo SARIMA que melhor descreve a s´erie temporal em estudo. Na primeira etapa, pretende-se identificar, atrav´es da an´alise da representa¸c˜ao gr´afica dos dados e das respetivas FAC e FACP emp´ıricas, o modelo SARIMA mais apropriado. Os parˆametros do modelo selecionado s˜ao estimados na segunda etapa (estima¸c˜ao) e avaliados quanto `a sua significˆancia na fase de diagn´ostico. Na terceira etapa avalia-se o comportamento dos res´ıduos, que se deve assemelhar a um ru´ıdo branco. Estas trˆes etapas s˜ao aplicadas iterativamente at´e que o modelo final n˜ao possa ser melhorado. Contudo, a fase correspondente `a identifica¸c˜ao do modelo ´e bastante subjetiva e complexa, resultando, v´arias vezes, em modelos distintos para uma mesma an´alise. De forma a contornar esta situa¸c˜ao, os softwares j´a possuem algoritmos automatizados de sele¸c˜ao, que permitem n˜ao s´o que a metodologia possa ser utilizada por leigos, mas tamb´em que os resultados obtidos por diferentes analistas sejam os mesmos. Uma das, e maiores, vanta58 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local gens destes modelos ´e que estes tˆem em considera¸c˜ao uma das principais carater´ısticas dos dados de s´eries temporais: a dependˆencia temporal (autocorrela¸c˜ao). Com isto, afirma-se que os modelos SARIMA s˜ao apropriados quando se pode assumir que existe algum tipo de rela¸c˜ao entre o passado e o futuro, sendo, no entanto, isso que os torna pouco recomendados para previs˜oes a longo prazo e/ou previs˜oes de s´eries com mudan¸cas bruscas de comportamento. 5.1.1 Modelos de Processos Estacion´arios Considera-se que uma s´erie estacion´aria fica completamente definida pelas suas fun- ¸c˜oes m´edia, variˆancia e de autocorrela¸c˜ao. Fazendo uso desta caracter´ıstica, pretende-se, com a metodologia Box-Jenkins, identificar um modelo com base no comportamento da fun¸c˜ao de autocorrela¸c˜ao emp´ırica. Os processos ARMA s˜ao considerados como um grupo bastante diversificado e de grande fiabilidade na modela¸c˜ao de in´umeras s´eries temporais estacion´arias. Contudo, para a modela¸c˜ao de s´eries que apresentem oscila¸c˜oes bruscas ao longo do tempo, este tipo de processos ´e insuficiente. No entanto, os processos ARMA tˆem especial importˆancia na modela¸c˜ao de s´eries n˜ao estacion´arias, uma vez que estas s˜ao facilmente convertidas em estacion´arias atrav´es de transforma¸c˜oes adequadas. Processo Autorregressivo (AR) Os processos autorregressivos, que pertencem `a classe dos modelos mais utilizados no estudo de s´eries temporais estacion´arias, baseiam-se no pressuposto de que a observa¸c˜ao da vari´avel no instante tse relaciona, de forma linear, com as observa¸c˜oes nos instantes anteriores. Assim, o processo Ytdiz-se um processo autorregressivo de ordem p, AR(p), quando satisfaz a equa¸c˜ao Yt=φ1Yt−1+φ2Yt−2+···+φt−pYt−p+t,(5.1) onde t´e um ru´ıdo branco de m´edia nula, independente de Yt−kpara todo o k≥1. De facto, Ytpode ser considerada como uma vari´avel dependente que ´e explicada atrav´es de uma regress˜ao linear m´ultipla, em que as observa¸c˜oes em pinstantes anteriores funcionam como covari´aveis e φis˜ao os coeficientes de cada Yt−i. Alternativamente, a representa¸c˜ao de um processo AR(p) pode ser feita atrav´es do operador atraso Bk, que se define como sendo BkYt=Yt−k. Com efeito, a equa¸c˜ao 5.1 pode ser reescrita como Φp(B)Yt=t,(5.2) onde Φp(B)=1−φ1B−φ2B2− ··· − φpBp´e o polin´omio autorregressivo de ordem p. Tendo em considera¸c˜ao as pra´ızes (reais ou complexas), G−1 1, G−1 2, . . . , G−1 p, da equa¸c˜ao caracter´ıstica Φp(B) = 0, torna-se poss´ıvel fatorizar o polin´omio autorregressivo do seguinte 59 Cap´ıtulo 5. M´etodos de Previs˜ao em S´eries Temporais modo Φp(B) = p Y i=1 (1 −GiB).(5.3) Para que o processo seja estacion´ario ´e condi¸c˜ao necess´aria e suficiente que as ra´ızes da equa¸c˜ao caracter´ıstica sejam todas de m´odulo maior do que a unidade, ou, de forma equivalente, que |Gi|<1, para i= 1,2, . . . , p. Qualquer processo autorregressivo que seja estacion´ario ´e tamb´em invert´ıvel, o que, em termos pr´aticos, significa que a dependˆencia do passado se vai atenuando `a medida que o passado se torna mais remoto. Portanto, se o processo Yt´e um processo AR(p), ent˜ao a sua fun¸c˜ao de autocorrela¸c˜ao parcial, φkk, ´e igual a zero para todo o k > p. Assim, a FACP de um processo AR(p) apresenta, graficamente, uma queda brusca para zero a partir do lag p+ 1, enquanto que a respetiva FAC tem um decaimento exponencial ou sinusoidal amortecido para zero. Na Figura 5.1 encontra-se representado um processo autorregressivo de ordem 1, AR(1), e as respetivas FAC e FACP emp´ıricas. Simulação de um processo autorregressivo de ordem 1, AR(1) Tempo w 0 20 40 60 80 100 −4 −2 0 2 0 5 10 15 20 −0.2 0.0 0.2 0.4 0.6 0.8 1.0 Lag FAC 5 10 15 20 −0.2 0.0 0.2 0.4 0.6 Lag FACP Figura 5.1: Simula¸c˜ao de um processo autorregressivo e respetivas FAC e FACP emp´ıricas. Processo de M´edias M´oveis (MA) Diz-se que o processo Yt´e um processo de m´edias m´oveis de ordem q, MA(q), quando assume a express˜ao Yt=t+θ1t−1+θ2t−2+···+θqt−q(5.4) 60 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local ou Yt= Θq(B)t,(5.5) onde t´e um ru´ıdo branco de m´edia nula e Θq(B) = 1 + θ1B+θ2B2+··· +θqBq´e o polin´omio de m´edias m´oveis de ordem q. Pretende-se, atrav´es destes processos, exprimir Ytem termos de um processo mais simples, como ´e o ru´ıdo branco. Assim, um processo de m´edias m´oveis de ordem qdefine-se, em cada instante t, como a m´edia ponderada das q+ 1 observa¸c˜oes de um processo de ru´ıdo branco. Desta forma, gra¸cas `a estacionariedade intr´ınseca ao ru´ıdo branco, os processos de m´edias m´oveis s˜ao sempre estacion´arios. Adicionalmente, um processo de m´edias m´oveis ´e invert´ıvel se puder ser escrito como um processo autorregressivo estacion´ario de ordem infinita. Para garantir a invertibilidade do processo, basta que, `a semelhan¸ca do que acontece no caso da estacionariedade de processos autorregressivos, as ra´ızes da equa¸c˜ao caracter´ıstica Θq(B) = 0 se encontrem todas fora do c´ırculo unit´ario, isto ´e, sejam, em m´odulo, todas superiores a 1 (Metcalfe & Cowpertwait, 2009). Na Figura 5.2 encontra-se representado um processo de m´edias m´oveis de ordem 1, MA(1), e as respetivas FAC e FACP emp´ıricas. Simulação de um proceso de médias móveis de ordem 1, MA(1) Tempo w 0 20 40 60 80 100 −2 −1 0 1 2 3 0 5 10 15 20 −0.2 0.0 0.2 0.4 0.6 0.8 1.0 Lag FAC 5 10 15 20 −0.3 −0.1 0.0 0.1 0.2 0.3 Lag FACP Figura 5.2: Simula¸c˜ao de um processo de m´edias m´oveis e respetivas FAC e FACP emp´ıricas. Se o processo Yt´e um processo MA(q), ent˜ao a sua fun¸c˜ao de autocorrela¸c˜ao, ρk, ´e igual a zero para todo o k > q, e, ent˜ao, a FAC de um processo MA(q) apresenta, graficamente, 61 Cap´ıtulo 5. M´etodos de Previs˜ao em S´eries Temporais uma queda brusca para zero a partir do lag q+ 1. No que respeita `a FACP, esta exp˜oe um decaimento exponencial ou sinusoidal amortecido para zero tendo, portanto, a mesma estrutura que a FAC de um processo AR(q). Processo Autorregressivo e de M´edias M´oveis (ARMA) Os processos estacion´arios e invert´ıveis podem ser representados tanto na forma autorregressiva quer na forma de m´edias m´oveis. No entanto, ´e poss´ıvel que qualquer um destes processos tenha uma representa¸c˜ao com um n´umero excessivo de parˆametros, o que pode conduzir a uma perda de eficiˆencia na sua estima¸c˜ao (Caiado, 2011). Caso se afirme, pode construir-se um modelo mais parcimonioso que inclua tanto termos autorregressivos como de m´edias m´oveis. Este modelo designa-se de processo misto autorregressivo e de m´edias m´oveis de ordens peqe representa-se por ARMA(p, q). Ent˜ao o processo Ytdiz-se um processo autorregressivo e de m´edias m´oveis de ordens peq, ARMA(p, q), se satisfaz a equa¸c˜ao Yt=φ1Yt−1+···+φpYt−p+t+θ1t−1+···+θqt−q(5.6) ou a equa¸c˜ao Φp(B)Yt= Θq(B)t,(5.7) onde t´e um ru´ıdo branco de m´edia nula, independente de Yt−kpara todo o k≥1, Φp(B)=1−φ1B− ··· − φpBpe Θq(B) = 1 + θ1B+··· +θqBqs˜ao os polin´omios autorregressivo e de m´edias m´oveis de ordens peq, respetivamente. A FAC e a FACP de um processo ARMA(p, q) resultam da combina¸c˜ao das respetivas fun¸c˜oes dos processos AR(p) e MA(q). Recorde-se que a FAC de um processo MA(q) ´e insignificante a partir do lag q+ 1, o mesmo acontecendo para a FACP de um processo AR(p) depois do lag p. Dado que o processo ARMA(p, q) ´e uma combina¸c˜ao dos processos AR(p) e MA(q), a estacionariedade e a invertibilidade do processo ficam garantidas se as ra´ızes das equa¸c˜oes caracter´ısticas Φp(B) = 0 e Θq(B) = 0 s˜ao, em m´odulo, maiores do que a unidade. De facto, estes processos generalizam os processos anteriormente mencionados e, por exemplo, um processo ARMA(p, 0) ´e equivalente a um processo AR(p), o mesmo acontecendo com um ARMA(0, q) relativamente a um MA(q). Na Figura 5.3 encontra-se representado um processo autorregressivo e de m´edias m´oveis, ARMA(1,2), e as respetivas FAC e FACP emp´ıricas. Este processo ´e estacion´ario e invert´ıvel. 62 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local Simulação de um processo ARMA(2,1) Tempo w 0 20 40 60 80 100 −4 −2 0 2 0 5 10 15 20 −0.2 0.0 0.2 0.4 0.6 0.8 1.0 Lag FAC 5 10 15 20 −0.2 0.0 0.2 0.4 0.6 Lag FACP Figura 5.3: Simula¸c˜ao de um processo autorregressivo e de m´edias m´oveis, ARMA(2,2) e respetivas FAC e FACP emp´ıricas. 5.1.2 Modelos de Processos N˜ao Estacion´arios Numa perspetiva pr´atica, a maioria das s´eries temporais ´e n˜ao estacion´aria. Quando tal sucede, ´e necess´aria a remo¸c˜ao, nos dados, as fontes de varia¸c˜ao n˜ao estacion´arias (e.g., tendˆencia, sazonalidade), de forma a possibilitar o ajustamento de um modelo estacion´ario. Como se verificou anteriormente, se a s´erie temporal observada for n˜ao estacion´aria na m´edia, pode aplicar-se uma (ou v´arias) diferencia¸c˜ao (regular) `a mesma. Portanto, se se substituir Ytpor ∇dYtna equa¸c˜ao 5.7, ´e obtido um modelo capaz de descrever s´eries n˜ao estacion´arias (modelo ARIMA). Este tipo de modelo ´e designado de modelo “integrado”, uma vez que o modelo estacion´ario que ´e ajustado aos dados diferenciados deve ser somado ou“integrado”de forma a devolver um modelo para os dados n˜ao estacion´arios. Acrescentese que estes modelos podem, `a semelhan¸ca dos modelos ARMA, ser generalizados para incluir termos sazonais, dando origem aos modelos SARIMA. Processo Autorregressivo Integrado de M´edias M´oveis (ARIMA) O processo Ytdiz-se um processo autorregressivo e de m´edias m´oveis integrado, ARIMA(p, d, q), quando assume a express˜ao (1 −φ1B−···−φpBp)(1 −B)dYt= (1 + θ1B+···+θqBq)t(5.8) 63 Cap´ıtulo 5. M´etodos de Previs˜ao em S´eries Temporais temporal pode existir mais do que um modelo que verifique os diferentes crit´erios de avalia¸c˜ao do diagn´ostico, o que torna penosa a tarefa de escolher o melhor modelo. Assim sendo, devem procurar-se crit´erios de sele¸c˜ao de modelos que ponderem as estat´ısticas baseadas nos res´ıduos do modelo ajustado. Um crit´erio plaus´ıvel para escolher o melhor modelo SARIMA passaria na escolha do modelo que fornece a menor soma dos quadrados dos erros (ou erro quadr´atico m´edio) ou o maior valor para a fun¸c˜ao de verosimilhan¸ca. Contudo, esta abordagem nem sempre funciona porque, frequentemente, o erro quadr´atico m´edio pode ser reduzido e a fun¸c˜ao de verosimilhan¸ca aumentada simplesmente pelo aumento do n´umero de parˆametros no modelo. De forma a solucionar esta quest˜ao, a fun¸c˜ao de verosimilhan¸ca deve ser penalizada por cada parˆametro adicional no modelo, ou seja, se o parˆametro extra n˜ao melhorar o valor da fun¸c˜ao de verosimilhan¸ca mais do que o valor da penaliza¸c˜ao, esse parˆametro n˜ao deve ser acrescentado ao modelo (Wheelwright, 1998). Os crit´erios, baseados na fun¸c˜ao de verosimilhan¸ca, existentes na literatura, s˜ao diversos, sendo os mais utilizados o crit´erio de informa¸c˜ao de Akaike (AIC) e o crit´erio de informa¸c˜ao Bayesiano (BIC, Bayesian Information Criterion). Estes crit´erios incorporam duas componentes, uma que consiste no logaritmo da fun¸c˜ao de verosimilhan¸ca, que decresce quando o n´umero de parˆametros estimados aumenta, e outra mais “penalizadora”, que aumenta `a medida que o n´umero de parˆametros tamb´em aumenta. O que estes crit´erios consideram ´e, ent˜ao, uma situa¸c˜ao de equil´ıbrio entre as duas componentes. Crit´erio de Informa¸c˜ao de Akaike (AIC) Considere-se que um modelo com m=p+q+P+Qparˆametros foi ajustado a uma s´erie com nobserva¸c˜oes. Akaike (1974), com objetivo de avaliar a qualidade do ajustamento, introduziu um crit´erio baseado na quantidade de informa¸c˜ao, definido por AIC = −2 log L+ 2m, (5.17) onde L´e a fun¸c˜ao de verosimilhan¸ca. De salientar que nem todos os softwares estat´ısticos possuem a capacidade de determinar o AIC ou a fun¸c˜ao de verosimilhan¸ca Le, por isso, nem sempre ´e poss´ıvel encontrar o AIC exato para um determinado modelo. Contudo, uma aproxima¸c˜ao ´util para o AIC ´e obtida atrav´es da aproxima¸c˜ao −2 log L≈n(1 + log 2π) + nlog σ2,(5.18) onde σ2representa a variˆancia dos res´ıduos. Esta variˆancia ´e facilmente estimada por qualquer software estat´ıstico, permitindo, assim, que o AIC possa ser encontrado aproximadamente atrav´es da f´ormula AIC ≈n(1 + log 2π) + nlog ˆσ2+ 2m. (5.19) 70 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local ` As vezes, o primeiro termo em 5.19 ´e omitido por ser igual para todos os modelos. O AIC n˜ao tem muito significado por si s´o e, por isso, s´o ´e ´util em compara¸c˜ao com o AIC de outro modelo ajustado ao mesmo conjunto de dados. Desta forma deve escolher-se o modelo que tenha o menor AIC, tendo em considera¸c˜ao que uma diferen¸ca de valores de duas unidades (2) ou menos n˜ao ´e substancial. Nesses casos, deve optar-se pelo modelo mais simples, seja pela parcim´onia, ou para obter um melhor ajustamento do modelo. Crit´erio de informa¸c˜ao Bayesiano (BIC) Schwarz et al. (1978), prop˜oe o crit´erio de informa¸c˜ao Bayesiano, definido como BIC = −2 log L+mlog(n),(5.20) onde L´e a fun¸c˜ao de verosimilhan¸ca, m´e o n´umero de parˆametros do modelo e n´e a dimens˜ao da amostra. Contrariamente ao AIC, o BIC depende da dimens˜ao da amostra (n) pelo que, para log(n)>2, isto ´e, para uma amostra de dimens˜ao superior a 7, a penaliza¸c˜ao do BIC ´e superior `a penaliza¸c˜ao do AIC. Como consequˆencia, a minimiza¸c˜ao do BIC leva, em geral, `a sele¸c˜ao de modelos com um menor n´umero de parˆametros do que os obtidos pela minimiza¸c˜ao do crit´erio AIC, evitando, de certa forma, a sobrestima¸c˜ao do n´umero de componentes. 5.1.5 Previs˜ao Numa fase posterior, ap´os a escolha do modelo que melhor descreve a s´erie temporal, pode prosseguir-se para o c´alculo de previs˜oes, sejam estas pontuais ou intervalares. As previs˜oes pontuais podem ser facilmente determinadas fazendo uso da pr´opria express˜ao do modelo escolhido. De facto, para obter previs˜oes a h-passos, isto ´e, para um instante t+h, basta calcular a esperan¸ca condicionada aos valores observados, ou seja, E[Yt+h|Y1, Y2, . . . , Yt]. Iniciando o processo para uma previs˜ao a 1-passo, isto ´e, para h= 1, e repetindo-o para h= 2,3, . . . , ´e, ent˜ao, poss´ıvel obter todas as previs˜oes pretendidas. Os intervalos de previs˜ao usuais s˜ao constru´ıdos com base em estimativas do desvio padr˜ao das pr´oprias previs˜oes. Partindo, assim, do pressuposto que os erros s˜ao independentes e seguem uma distribui¸c˜ao Normal, a previs˜ao intervalar para o instante t+h´e dada por ˆyt+h|t−z1−α 2ˆσh,ˆyt+h|t+z1−α 2ˆσh,(5.21) onde z´e o quantil da distribui¸c˜ao Normal padr˜ao, 1 −αcorresponde ao n´ıvel de confian¸ca do intervalo e ˆσh´e a estimativa do desvio padr˜ao da previs˜ao para o passo h. Numa perspetiva generalizada, os intervalos de previs˜ao aumentam conforme o horizonte de previs˜ao, h, aumenta. Contudo, em modelos estacion´arios (isto ´e, com d= 0) as sucess˜oes dos limites inferiores e superiores s˜ao convergentes e, portanto, para horizontes distantes, os intervalos de previs˜ao ter˜ao amplitudes idˆenticas (Hyndman & Athanasopoulos, 2018). 71 Cap´ıtulo 5. M´etodos de Previs˜ao em S´eries Temporais A literatura apresenta mais detalhes sobre estes e outros processos para a obten¸c˜ao de previs˜oes pontuais e intervalares, respetivamente, sendo que se aconselha as conclus˜oes apresentadas em Box & Jenkins (2016). 5.2 Avalia¸c˜ao de Modelos de Previs˜ao Na previs˜ao de s´eries temporais existe uma diversidade de m´etodos para o efeito. Estes m´etodos podem envolver diferentes parˆametros de uma complexidade consider´avel como tamb´em se podem caracaterizar pela sua simplicidade e f´acil assimila¸c˜ao. No entanto, a complexidade de um m´etodo n˜ao significa uma melhoria na qualidade das previs˜oes ent˜ao Yokuma & Armstrong (1995) descrevem uma s´erie de fatores que devem ser considerados no momento de escolha do m´etodo de previs˜ao que, segundo Chatfield (2000) abrangem a precis˜ao das previs˜oes, a facilidade de utiliza¸c˜ao, a interpreta¸c˜ao e implementa¸c˜ao, a poupan¸ca de custos, a flexibilidade e outros demais fatores consider´aveis nesta op¸c˜ao. As medidas de avalia¸c˜ao tratam-se, na maioria dos casos, do maior crit´erio de sele¸c˜ao de um m´etodo de previs˜ao onde ´e poss´ıvel avaliar a efic´acia de um determinado modelo ou m´etodo de previs˜ao de forma que demonstre a capacidade de reprodu¸c˜ao da s´erie temporal em an´alise e obten¸c˜ao de previs˜oes que se revelem o mais precisas poss´ıvel. No exerc´ıcio de previs˜ao deve-se ter em considera¸c˜ao a escolha da amostra de treino com o objetivo de ajustar o modelo e a escolha da amostra de teste de forma a verificar a sua qualidade preditiva. Contudo, um bom modelo de previs˜ao n˜ao significa que seja aquele que se ajuste bem aos dados da amostra de treino. A avalia¸c˜ao da precis˜ao das suas previs˜oes s´o pode ser efetuada com uma amostra de observa¸c˜oes que n˜ao tenha sido utilizada na sua estima¸c˜ao, isto ´e, a avalia¸c˜ao ter´a de ser realizada com recurso a uma amostra de teste. Como tal, uma s´erie temporal ´e usualmente dividida em s´erie de treino, usada para estimar o modelo, e s´erie de teste, para avaliar as previs˜oes. Desta forma, ao considerar uma uma s´erie temporal de dimens˜ao n,{Y1, Y2, . . . , Yn}, e um horizonte temporal de previs˜ao, h, tem-se a seguinte parti¸c˜ao da s´erie Y1, Y2, . . . , Yn−h |{z } s´erie de treino , Yn−h+1, . . . , Yn | {z } s´erie de teste . A dimens˜ao da s´erie de teste depende da dimens˜ao da amostra e do horizonte temporal pretendido para previs˜ao, logo ´e aconselhado escolher uma s´erie de teste de dimens˜ao igual ou superior ao horizonte temporal pretendido. Na pr´atica s˜ao consideradas duas formas de avaliar a qualidade preditiva: –Previs˜ao a 1-passo: prevˆe uma unidade temporal `a frente (h= 1) da ´ultima observa¸c˜ao, ou seja, se Yt´e a observa¸c˜ao no instante teˆ Yta sua estimativa obtida usando as observa¸c˜oes Y1, Y2, . . . , Yt−1, ent˜ao ˆ Yt´e a previs˜ao a 1-passo de Yt; –Previs˜ao a multipassos: utilizando todas as observa¸c˜oes at´e ao tempo t(inclusive), ´e obtida a previs˜ao h-passos `a frente, ˆ Yt+h|t. Generalizando, a previs˜ao a hpassos `a 72 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local frente (previs˜ao multi-passos), ˆyt+h, corresponde `a previs˜ao para yt+hobtida usando as mesmas observa¸c˜oes, y1, y2, . . . , yt−1. Os erros de previs˜ao indicam se a metodologia de previs˜ao ´e apropriada, sendo, por isso, importante medir a sua magnitude (Cordeiro, 2011). Um erro de previs˜ao trata-se da diferen¸ca entre o valor observado e a sua previs˜ao, sendo estes indicadores da qualidade da metodologia de previs˜ao aplicada. O erro de previs˜ao (a h-passos) pode ser escrito como et+h=Yt+h−ˆ Yt+h|t. Caso se considere uma previs˜ao a 1-passo (h= 1) o erro de previs˜ao a 1-passo ´e dado por et=Yt−ˆ Yt. 5.2.1 Medidas de Avalia¸c˜ao Neste estudo s˜ao utilizadas quatro medidas para se proceder `a avalia¸c˜ao da qualidade preditiva das metodologias aplicadas: o Erro Quadr´atico M´edio (EQM), o Erro Absoluto M´edio (EAM), o Erro Percentual Absoluto M´edio (EPAM) e o Erro Escalado Absoluto M´edio (EEAM). O Erro Quadr´atico M´edio (EQM) consiste no quadrado do valor m´edio dos desvios entre os valores observados e as previs˜oes para os instantes 1,2, . . . , n, ou seja, EQM = 1 n n X t=1 e2 t=1 n n X t=1 (Yt−ˆ Yt)2. Esta medida, caracterizada pela dependˆencia da escala dos dados, ´e calculada atrav´es do erro de previs˜ao a 1-passo, et=Yt−ˆ Yt.´ E frequente que a raiz do erro quadr´atico m´edio, REQM = √EQM, seja preferida em rela¸c˜ao ao EQM uma vez que permite redu¸c˜ao da grandeza dos valores para a mesma escala dos dados. Visto que se Yt=ˆ Ytse obt´em EQM = 0, na compara¸c˜ao entre m´etodos de previs˜ao, considera-se que o m´etodo mais preciso ´e o que apresenta menor EQM e, tratando-se da raiz do EQM, aquele que detenham menor valor de REQM. Note-se que estas medidas descritas s˜ao mais sens´ıveis `a presen¸ca de outliers em compara¸c˜ao, por exemplo, ao Erro Absoluto M´edio (EAM) EAM = 1 n n X t=1 |et|=1 n n X t=1 Yt−ˆ Yt. O erro percentual absoluto m´edio, EPAM, consiste na percentagem m´edia do erro de previs˜ao em conformidade com a grandeza das observa¸c˜oes. Esta medida define-se como: EPAM = 1 n n X t=1  Yt−ˆ Yt Yt×100 (%) . Note-se que se Yt=ˆ Yttem-se EPAM = 0% logo, quanto menor for o EPAM mais preciso ´e o m´etodo de previs˜ao. Esta medida n˜ao pode ser calculada quando existem zeros na s´erie e, quando as observa¸c˜oes se aproximam de zero, o EPAM apresenta valores 73 Cap´ıtulo 5. M´etodos de Previs˜ao em S´eries Temporais extremos. O Erro Escalado Absoluto M´edio, EEAM, permite a compara¸c˜ao relativa de qualquer m´etodo de previs˜ao com o m´etodo na¨ ıve (referˆencia). O EEAM define-se como EEAM = 1 n n X t=1 |qt|=1 n n X t=1  Yt−ˆ Yt 1 n−1Pn t=2 |Yt−Yt−1| . Nesta medida, o erro escalado, qt, ´e resultado do quociente entre o erro de previs˜ao, et=Yt−ˆ Yt, e o erro absoluto m´edio da previs˜ao na¨ ıve, EAMN = Pn t=2 |Yt−Yt−1|/(n− 1). Caso se verifique sazonalidade nas s´eries em estufo, o denominador do erro escalado dever´a ser substitu´ıdo pelo erro absoluto m´edio da previs˜ao na¨ ıve sazonal, EAMNs = Pn t=s+1 |Yt−Yt−s|/(n−s), onde s= 12. Acrescente-se que o EEAM pode ser empregado de forma a comparar a qualidade preditiva de s´eries com diferentes escalas, visto que a grandeza qtse caracteriza pela independˆencia da escala dos dados. Caso se verifiquem valores de EEAM superiores a 1, estes indicam que as previs˜oes para o m´etodo adotado s˜ao menos precisas, em m´edia, do que as na¨ ıve e, por isso, quanto mais pr´oximo de zero maior ser´a a precis˜ao do m´etodo. Ent˜ao, na compara¸c˜ao entre diferentes m´etodos de previs˜ao, considera-se que o mais preciso ´e o que apresenta o menor EEAM. 74 Cap´ıtulo 6 An´alise Explorat´oria de Dados Neste Cap´ıtulo ´e apresentada uma an´alise preliminar dos dados fornecidos pelo SHU da VITRUS referentes aos circuitos de recolha de res´ıduos indiferenciados, distribu´ıdos pelas 44 freguesias do munic´ıpio de Guimar˜aes e pela recolha indiferenciada e seletiva efetuada no Centro Hist´orico de Guimar˜aes intramuros (sistema PAYT). Tamb´em ´e apresentada uma an´alise de dados referente aos tipos de recolha dos res´ıduos em contentores de profundidade, porta a porta ou recolha mista, nos circuitos de recolha indiferenciada em estudo (nas freguesias do munic´ıpio). O objetivo principal destas an´alises ´e avaliar o comportamento e a distribui¸c˜ao das diferentes vari´aveis em estudo, de forma a permitir uma aplica¸c˜ao mais adequada das metodologias de modelos de Regress˜ao Linear e de modelos de S´eries Temporais. 6.1 Circuitos de recolha indiferenciada A VITRUS ´e respons´avel pela recolha dos res´ıduos indiferenciados em 44 freguesias do concelho de Guimar˜aes. Inicialmente, o SHU era respons´avel pela recolha em seis circuitos. Com o decorrer dos anos o n´umero de circuitos tem vindo a aumentar e, neste momento, o SHU opera em doze circuitos de recolha indiferenciada (ver Apˆendice A, Tabela A.1). Nestes servi¸cos de recolha indiferenciada h´a trˆes tipos de recolha: recolha de contentores de profundidade, recolha porta a porta e a recolha mista. Os dados relativos aos circuitos de recolha indiferenciada foram extra´ıdos a 30 de agosto de 2019 e contˆem a informa¸c˜ao relativa `as pesagens di´arias obtidas de res´ıduos indiferenciados, nos respetivos circuitos, conforme a tipologia de recolha. Os dados, numa fase preliminar, foram transformados em observa¸c˜oes semanais, por circuito de recolha, com o intuito de efetuar uma an´alise descritiva de forma a descrever e compreender o comportamento destas vari´aveis. Acrescente-se que, em particular, a vari´avel respetiva `a recolha de res´ıduos indiferenciados em contentores de profundidade ser´a, posteriormente, analisada via modelos de S´eries Temporais com o objetivo de se obterem previs˜oes a longo prazo. O per´ıodo observado foi entre a 16. ª semana de 2016 (semana de 17 de abril) e a 34. ª 75 Cap´ıtulo 6. An´alise Explorat´oria de Dados semana de 2019 (semana de 18 de agosto). Todos os circuitos associados aos contentores de profundidade, os primeiros a serem adjudicados pela VITRUS, contˆem informa¸c˜ao desde 2016 Analisando os resultados descritos na Tabela 6.1, relativamente aos circuitos de contentores de profundidade (Circuitos 1, 2, 4, 5 e 6), comprova-se um aumento anual da quantidade de res´ıduos indiferenciados, `a exce¸c˜ao do circuito 6 que apresenta um decr´escimo entre 2017 e 2018 de 308,48 toneladas. Em rela¸c˜ao aos circuitos porta a porta (Circuitos 9, 10, 11 e 12), cujos dados s˜ao observados desde 2017, verifica-se um decr´escimo nos Circuitos 9, 11 e 12 entre 2017 e 2018. Apenas o Circuito 10 apresenta um aumento das quantidades recolhidas de res´ıduos indiferenciados. Por ´ultimo, na recolha mista (Circuitos 3, 7 e 8), o Circuito 3 apresenta um aumento ao longo dos trˆes anos apresentados, devendo-se ao facto de numa fase inicial, em 2016, a maioria dos res´ıduos eram recolhidos em contentores de profundidade sendo que, em 2017, ap´os o incremento da recolha porta a porta neste circuito ´e verificado um aumento nas quantidades de res´ıduos recolhidos. J´a os Circuitos 7 e 8, observados desde 2017, tamb´em apresentam um aumento significativo nas quantidades recolhidas. As conclus˜oes descritas tamb´em podem ser observadas na Figura 6.1. De uma forma geral, ´e not´orio o aumento da produ¸c˜ao de res´ıduos indiferenciados nos circuitos de recolha indiferenciada, operados pelo SHU da VITRUS. Tabela 6.1: Evolu¸c˜ao anual das quantidades de res´ıduos indiferenciados (em toneladas), por tipo de recolha. Contentores de profundidade Porta a porta Mista 2016 2017 2018 2016 2017 2018 2016 2017 2018 C1 3166,28 4416,16 4556,30 C9 - 1253,56 1158,80 C3 2586,70 3965,32 4082,98 C2 3089,86 4393,44 4651,96 C10 - 989,30 1109,74 C7 - 930,18 1135,90 C4 1776,84 2487,44 3332,22 C11 - 468,84 682,32 C8 - 588,16 1222,58 C5 2316,78 3609,88 4250,72 C12 - 889,58 622,88 C6 588,60 1418,68 1110,20 Total 10938,36 16325,60 17901,40 - 3601,28 3573,74 2586,70 5483,66 6441,46 Pela Figura 6.2 ´e not´orio que no per´ıodo observado a recolha de contentores de profundidade (Circuitos 1, 2, 4 e 5) ´e respons´avel pelas elevadas quantidades de res´ıduos indiferenciados recolhidos. Este gr´afico tamb´em indica que a recolha mista (Circuitos 3, 7 e 8) tem valores inferiores em rela¸c˜ao aos outros tipos de recolha, uma vez que o n´umero de circuitos afetos a esta recolha s˜ao menores em compara¸c˜ao aos restantes. Pode-se afirmar, ainda, que a recolha de contentores de profundidade evolui de forma crescente, contrariamente `a recolha porta a porta (Circuitos 9, 10, 11 e 12) e `a recolha mista que evoluem de uma forma mais ou menos constante ao longo do tempo, desde o ano de 2018. Note-se que as recolhas de contentores de profundidade e mista, respetivamente, apresentam uma evolu¸c˜ao crescente ao longo dos anos. A recolha porta a porta apresenta um ligeiro decr´escimo nas quantidades recolhidas entre os anos de 2017 e 2018. 76 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local 0 1000 2000 3000 4000 C1 C2 C3 C4 C5 C6 C7 C8 C9 C10 C11 C12 Circuitos Quantidade de resíduos (ton) Ano 2016 2017 2018 Figura 6.1: Evolu¸c˜ao das quantidades de res´ıduos indiferenciados, recolhidos por ano. Tempo (semanas) Quantidade recolhida (ton.) 0 100 200 300 400 500 2017 2018 2019 Contentor de profundidade Porta−a−porta Mista Figura 6.2: Evolu¸c˜ao das quantidades de res´ıduos indiferenciados por tipo de recolha. De acordo com a Tabela 6.2, os circuitos que detˆem um valor m´edio de produ¸c˜ao de 77 Cap´ıtulo 6. An´alise Explorat´oria de Dados res´ıduos indiferenciados superior s˜ao o Circuito 1 e o Circuito 2. De real¸car que o Circuito 3, 4 e 5, tamb´em apresentam valores elevados, podendo dever-se ao facto de terem sido os circuitos pioneiros na recolha de res´ıduos, operados pelo SHU. Em rela¸c˜ao aos Circuitos 6, 7, 8, 9 e 10, o SHU apresenta uma produ¸c˜ao m´edia de 20 toneladas semanais. J´a os Circuitos 11 e 12 detˆem um valor m´edio semanal entre as 15 e as 16 toneladas, aproximadamente. S˜ao verificados valores omissos nos dados de alguns circuitos, uma vez que s´o s˜ao verificadas observa¸c˜oes no ano de 2017. Tabela 6.2: Estat´ısticas descritivas dos circuitos de recolha indiferenciada no per´ıodo observado. M´ınimo M´aximo M´edia 1. º Quartil Mediana 3. º Quartil Desvio Padr˜ao NA’s Circuito 1 69,04 108,30 86,01 82,67 85,20 90,48 6,29 1 Circuito 2 28,38 106,50 85,02 81,90 84,93 88,86 7,21 0 Circuito 3 17,98 111,50 76,34 69,82 75,24 82,49 10,50 0 Circuito 4 15,32 82,24 55,29 46,43 53,09 65,36 10,69 0 Circuito 5 0,00 98,82 72,99 64,04 73,93 81,04 11,14 0 Circuito 6 0,00 52,20 21,13 16,32 18,38 27,76 8,86 3 Circuito 7 0,00 29,94 20,40 19,84 21,38 23,23 5,85 37 Circuito 8 0,00 31,22 22,27 20,70 23,10 24,39 4,35 62 Circuito 9 0,00 42,46 22,16 19,58 21,22 23,84 5,17 37 Circuito 10 0,00 35,28 19,67 17,44 19,58 21,82 4,37 37 Circuito 11 0,00 37,58 15,92 11,76 13,98 19,34 6,42 63 Circuito 12 0,00 42,66 15,48 10,56 12,82 22,07 8,55 37 De facto, de acordo com as Figuras 6.3 e 6.4, verifica-se que a recolha de contentores de profundidade ´e superior `as recolha porta a porta e recolha mista, tendo esses circuitos uma elevada dispers˜ao. De real¸car que, tal como referido anteriormente, os Circuitos 1 e 2 s˜ao os que detˆem uma maior produ¸c˜ao de res´ıduos sendo not´orio o elevado valor mediano nestes circuitos. Em rela¸c˜ao `a presen¸ca de outliers, real¸ca-se que apenas nos circuitos 4 e 5 n˜ao se verifica a presen¸ca de outliers. O gr´afico da Figura 6.4 sugere uma tendˆencia crescente na produ¸c˜ao de res´ıduos indiferenciados nos Circuitos 3, 4 e 5 ao longo do tempo observado. Tamb´em, a partir dos diagramas de caixa com bigodes verifica-se uma baixa dispers˜ao dos Circuitos 8 a 11. 78 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local C1 C2 C3 C4 C5 C6 C7 C8 C9 C10 C11 C12 0 20 40 60 80 100 Circuitos de recolha indiferenciada Quantidade de resíduos (ton) Figura 6.3: Diagramas em caixa de bigodes da produ¸c˜ao de res´ıduos semanal dos circuitos (1 a 12) de recolha operados pela VITRUS. 79 Cap´ıtulo 6. An´alise Explorat´oria de Dados comportamento sazonal na venda mensal de sacos de 30, 50 e 100 litros, sendo estes tamb´em os sacos mais adquiridos por este tipo de utilizadores. O n´umero de sacos de 15 litros apresentam uma evolu¸c˜ao significativa, mas t´enue em compara¸c˜ao aos restantes. A Figura 6.8 apresenta os gr´aficos relativos `a evolu¸c˜ao anual, desde o in´ıcio da implementa¸c˜ao do sistema PAYT, da compra de sacos conforme a sua litragem. Daqui se retira que os utilizadores dom´esticos compram com regularidade sacos de 15 e 30 litros, respetivamente, uma vez que detˆem uma maior n´umero de compras em compara¸c˜ao com os utilizadores n˜ao dom´esticos. J´a os sacos de 50 e 100 litros s˜ao adquiridos, aproximadamente na sua totalidade, pelos utilizadores n˜ao dom´esticos, sendo observ´avel um valor residual nos utilizadores dom´esticos em rela¸c˜ao `a compra desta litragem de sacos. Refirase tamb´em o aumento do n´umero de vendas relativas aos sacos de 15 litros nos dois tipos de utilizadores e o aumento do n´umero de sacos de 30 litros nos utilizadores dom´esticos. Nas restantes litragens verificam-se decr´escimos no n´umero de vendas, situa¸c˜ao que se dever´a ter em conta uma vez que pode ser influenciada por uma variedade de fatores, desde a mudan¸ca de habita¸c˜ao por parte dos utilizadores, quebras de stock ou at´e mesmo a prevarica¸c˜ao que ter´a como consequˆencia as deposi¸c˜oes ilegais. 0 5000 10000 15000 20000 15 lt. 30 lt. 50 lt. 100 lt. Litragem de sacos N.º de sacos vendidos Ano 2016 2017 2018 Utilizadores Domésticos 0 5000 10000 15000 20000 15 lt. 30 lt. 50 lt. 100 lt. Litragem de sacos N.º de sacos vendidos Ano 2016 2017 2018 Utilizadores Não Domésticos Figura 6.8: Gr´aficos relativos `a evolu¸c˜ao das compras efetuadas pelos utilizadores conforme a litragem do saco. Relativamente `as deposi¸c˜oes ilegais ´e verificada, pela Figura 6.9, uma tendˆencia crescente ao longo do tempo, situa¸c˜ao que dever´a servir de mote para uma agiliza¸c˜ao na fiscaliza¸c˜ao de forma a garantir a higieniza¸c˜ao e a disciplina¸c˜ao dos utilizadores. 86 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local 0 5 10 15 20 25 30 0 100 200 300 400 500 Tempo (meses) N.º de deposições ilegais Figura 6.9: Evolu¸c˜ao do n´umero de deposi¸c˜oes ilegais na zona piloto de implementa¸c˜ao do sistema PAYT. Para avaliar a associa¸c˜ao entre as vari´aveis relativas ao n´umero de sacos vendidos aos utilizadores e o n´umero de deposi¸c˜oes ilegais, foi aplicado o Teste de Correla¸c˜ao de Spearman (Spearman, 1987). Este teste foi utilizado uma vez que se tratam de vari´aveis quantitativas discretas. A Tabela 6.7 apresenta o coeficiente de correla¸c˜ao de Spearman, ρs, e o respetivo valor de prova da aplica¸c˜ao do Teste de correla¸c˜ao de Spearman para um n´ıvel de significˆancia de 10% (α= 0,10). Daqui se retira que apenas as vari´aveis SAC30UD eSAC100UND n˜ao apresentam correla¸c˜oes significativas com a vari´avel respeitante `as deposi¸c˜oes ilegais. Das vari´aveis restantes, retiram-se as seguintes interpreta¸c˜oes dos coeficientes de correla¸c˜ao de Spearman: – A vari´avel SAC15UD apresenta uma correla¸c˜ao positiva significativa com DEP, com um coeficiente de correla¸c˜ao igual a 0,580, o que significa que cada saco de 15 litros s˜ao adquirido pelos UD permite o acr´escimo de 0,580 ao valor esperado do n´umero de deposi¸c˜oes ilegais; – A vari´avel SAC15UND apresenta uma correla¸c˜ao positiva significativa com DEP, o que significa que os sacos de 15 litros s˜ao adquiridos pelos UND contribuem para o aumento de 0,374 do valor esperado do n´umero de deposi¸c˜oes ilegais; – A vari´avel SAC30UD apresenta uma correla¸c˜ao negativa significativa com DEP, com um coeficiente de correla¸c˜ao igual a -0,569, o que significa que a venda de sacos de 15 litros aos UND contribui num decr´escimo de -0,569 do valor esperado do n´umero de deposi¸c˜oes ilegais. 87 Cap´ıtulo 6. An´alise Explorat´oria de Dados – A vari´avel SAC50UD apresenta uma correla¸c˜ao positiva significativa com DEP, com um coeficiente de correla¸c˜ao igual a 0,362, o que significa que cada saco de 50 litros adquirido pelos UD contribui num acr´escimo de 0,362 ao valor esperado do n´umero de deposi¸c˜oes ilegais; – A vari´avel SAC50UND apresenta uma correla¸c˜ao positiva significativa com DEP, que permite concluir que a venda de sacos de 50 litros aos UND permite um acr´escimo de 0,288 ao valor esperado de deposi¸c˜oes ilegais, por cada saco vendido; – A vari´avel SAC100UD apresenta uma correla¸c˜ao negativa significativa com DEP, com um coeficiente de correla¸c˜ao igual a -0,393, ou seja, cada saco de 100 litros adquirido pelos UD permite o decr´escimo de -0,393 ao valor esperado das deposi¸c˜oes ilegais. Tabela 6.7: Teste de correla¸c˜ao de Spearman para avaliar a associa¸c˜ao entre as vari´aveis (n. º de sacos vendidos) e o n´umero de deposi¸c˜oes ilegais. SAC15UD SAC15UND SAC30UD SAC30UD SAC50UD SAC50UND SAC100UD SAC100UND Valor de prova <0,001 0,032 <0,001 0,267 0,039 0,105 0,024 0,605 rs0,580 0,374 -0,569 0,199 0,362 0,288 -0,393 0,093 88 Cap´ıtulo 7 Aplica¸c˜ao de Modelos de Regress˜ao Linear Os Modelos de Regress˜ao Linear tˆem como principal objetivo avaliar o efeito de uma ou mais vari´aveis (covari´aveis) sobre uma vari´avel de interesse (vari´avel resposta). Os resultados obtidos na aplica¸c˜ao da Regress˜ao Linear Simples apenas nos indicam poss´ıveis vari´aveis para integrar o modelo de Regress˜ao Linear M´ultipla pois, na pr´atica, podem mudar as vari´aveis significativas do modelo devido a poss´ıveis associa¸c˜oes entre as covari´aveis. Aprofundando a abordagem adotada no decorrer deste Cap´ıtulo, foram formulados modelos de regress˜ao para a sazonalidade com recurso a indicadores sazonais, baseados nos modelos obtidos via regress˜ao linear m´ultipla, com o objetivo de modelar os dados fornecidos conforme os per´ıodos sazonais no per´ıodo observado. 7.1 Regress˜ao Linear Simples Tendo em vista a influˆencia que as covari´aveis tˆem na produ¸c˜ao de res´ıduos indiferenciados e seletivos, foram aplicados modelos de Regress˜ao Linear Simples aos dados em estudo. Foram estimados 21 modelos de Regress˜ao Linear Simples, para cada uma das vari´aveis resposta em estudo, respetivamente. A Tabela 7.1 apresenta as estimativas dos parˆametros dos modelos de Regress˜ao Linear Simples, os erros padr˜ao das estimativas dos parˆametros, os valores de prova e respetivo coeficiente de determina¸c˜ao (R2), tendo como vari´aveis resposta: INDIFERENCIADO eSELETIVO. De forma a verificar poss´ıveis rela¸c˜oes na produ¸c˜ao de res´ıduos recicl´aveis/seletivos (papel/cart˜ao, pl´asticos e vidro) apresentam-se no Apˆendice B, nas Tabelas B.1, B.2 e B.3, os resultados obtidos ap´os aplica¸c˜ao de Regress˜ao Linear Simples. Acrescenta-se que, durante o desenvolvimento da tem´atica no presente Cap´ıtulo, ser´a considerado um n´ıvel de significˆancia de 10% (α= 0,10). Da an´alise dos resultados apresentados na Tabela 7.1 (onde se encontram as estimativas dos parˆametros do modelo, os erros padr˜ao das estimativas dos parˆametros, o valor de 89 Cap´ıtulo 7. Aplica¸c˜ao de Modelos de Regress˜ao Linear prova e o coeficiente de determina¸c˜ao (R2)) ´e poss´ıvel concluir que as covari´aveis significativas na explica¸c˜ao da produ¸c˜ao de res´ıduos res´ıduos indiferenciados, s˜ao significativas as covari´aveis MTH,SAC15UD,SAC30UND,SAC50UND,SAC100UND,TAC,TBC,FRT,REC30 eREC50. Tabela 7.1: Regress˜ao Linear Simples, tendo como vari´avel resposta SELETIVO eINDIFERENCIADO, respetivamente. Regress˜ao Linear Simples SELETIVO INDIFERENCIADO Vari´avel Estimativas ˆσp-valor R2Estimativas ˆσp-valor R2 MTH ˆ β0= 23,844 1,910 <0,001 0,013 ˆ β0= 43,610 3,308 <0,001 0,200 ˆ β1= 0,06 0,100 0,524 ˆ β1= 0,472 0,17 0,009 SAC15UD ˆ β0=23,984 2,252 <0,001 0,007 ˆ β0=43,538 4,04 <0,001 0,135 ˆ β1=0,002 0,005 0,652 ˆ β1=0,021 0,01 0,035 SAC15UND ˆ β0=23,994 1,580 <0,001 0,017 ˆ β0=48,504 2,985 <0,001 0,051 ˆ β1=0,019 0,026 0,475 ˆ β1=0,064 0,049 0,205 SAC30UD ˆ β0=25,180 3,459 <0,001 0,000 ˆ β0=56,128 6,598 <0,001 0,016 ˆ β1=-0,001 0,007 0,938 ˆ β1=-0,010 0,014 0,484 SAC30UND ˆ β0=19,963 2,532 <0,001 0,123 ˆ β0=41,470 4,822 <0,001 0,140 ˆ β1=0,017 0,008 0,045 ˆ β1=0,036 0,016 0,032 SAC50UD ˆ β0=25,184 1,541 <0,001 0,002 ˆ β0=50,507 2,954 <0,001 0,007 ˆ β1=-0,012 0,055 0,829 ˆ β1=0,050 0,105 0,636 SAC50UND ˆ β0=10,858 2,914 <0,001 0,444 ˆ β0=26,066 5,836 <0,001 0,397 ˆ β1=0,010 0,002 <0,001 ˆ β1=0,018 0,004 <0,001 SAC100UD ˆ β0=25,626 1,138 <0,001 0,035 ˆ β0=52,187 2,221 <0,001 0,006 ˆ β1=-0,162 0,153 0,296 ˆ β1=-0,128 0,298 0,671 SAC100UND ˆ β0=11,054 2,361 <0,001 0,545 ˆ β0=28,955 5,238 <0,001 0,394 ˆ β1=0,019 0,003 <0,001 ˆ β1=0,032 0,007 <0,001 UDC ˆ β0=23,063 6,075 <0,001 0,003 ˆ β0=49,628 11,694 <0,001 0,001 ˆ β1=0,027 0,087 0,759 ˆ β1=0,029 0,168 0,864 TAC ˆ β0=12,037 4,218 0,007 0,238 ˆ β0=31,484 8,528 <0,001 0,158 ˆ β1=0,687 0,221 0,004 ˆ β1=1,074 0,446 0,022 TBC ˆ β0=5,872 5,217 0,269 0,306 ˆ β0=23,452 10,894 0,039 0,180 ˆ β1=0,794 0,215 0,001 ˆ β1=1,174 0,449 0,013 TCC ˆ β0=22,888 2,076 <0,001 0,037 ˆ β0=51,087 4,067 <0,001 0,001 ˆ β1=0,143 0,131 0,284 ˆ β1=0,038 0,256 0,883 TDC ˆ β0=18,017 2,945 <0,001 0,162 ˆ β0=45,767 6,089 <0,001 0,032 ˆ β1=0,907 0,370 0,020 ˆ β1=0,771 0,766 0,322 TEC ˆ β0=25,792 3,235 <0,001 0,003 ˆ β0=54,228 6,208 <0,001 0,006 ˆ β1=-0,127 0,448 0,780 ˆ β1=-0,376 0,86 0,665 KMS ˆ β0=23,986 2,210 <0,001 0,007 ˆ β0=46,333 4,133 <0,001 0,060 ˆ β1=0,001 0,001 0,645 ˆ β1=0,003 0,002 0,167 FRT ˆ β0=8,700 3,494 0,018 0,420 ˆ β0=20,964 6,799 0,004 0,407 ˆ β1=0,834 0,176 <0,001 ˆ β1=1,576 0,342 <0,001 DEP ˆ β0=25,449 2,078 <0,001 0,003 ˆ β0=46,788 3,88 <0,001 0,059 ˆ β1=-0,002 0,007 0,776 ˆ β1=0,018 0,013 0,172 REC30 ˆ β0=24,304 1,123 <0,001 0,030 ˆ β0=40,903 2,013 <0,001 0,156 ˆ β1=0,003 0,003 0,341 ˆ β1=0,012 0,005 0,023 REC50 ˆ β0=23,676 1,185 <0,001 0,078 ˆ β0=47,760 2,116 <0,001 0,204 ˆ β1=0,002 0,001 0,116 ˆ β1=0,007 0,003 0,008 REC100 ˆ β0=24,703 1,215 <0,001 0,078 ˆ β0=50,646 2,322 <0,001 0,014 ˆ β1=0,001 0,002 0,782 ˆ β1=0,003 0,004 0,510 90 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local J´a na explica¸c˜ao da produ¸c˜ao de res´ıduos seletivos na zona piloto de implementa¸c˜ao do sistema PAYT s˜ao: SAC30UND,SAC50UND,SAC100UND,TAC,TBC,TDC eFRT. Nesta an´alise n˜ao s˜ao ajustados um modelos de Regress˜ao Linear Simples com a covari´avel OFERECE uma vez que, tratando-se de uma vari´avel qualitativa nominal, n˜ao ´e apropriada para este tipo de modela¸c˜ao. 7.2 Regress˜ao Linear M´ultipla O objetivo da an´alise de regress˜ao m´ultipla ´e determinar se as covari´aveis explicam o comportamento da vari´avel dependente. No presente estudo pretende-se prever mudan¸cas da vari´avel respetiva `a produ¸c˜ao de res´ıduos indiferenciados e seletivos (vari´aveis resposta), respetivamente, associadas a mudan¸cas das covari´aveis j´a consideradas. Verificadas as principais conclus˜oes retiradas da an´alise explorat´oria efetuada aos dados do PAYT, o presente Cap´ıtulo incidir´a na aplica¸c˜ao das metodologias aos mesmos, isto ´e, ser˜ao formulados modelos de regress˜ao m´ultipla, para posterior aux´ılio na tomada de decis˜ao. Definidas as vari´aveis resposta e respetivas covari´aveis (covari´aveis), ´e formulado o modelo completo, com todas as vari´aveis em estudo. Posto isto, ´e aplicado o m´etodo regressivo (backward elimination), onde s˜ao eliminadas, de forma iterativa, as vari´aveis detentoras de maior valor de prova (vari´avel `a qual corresponde a estat´ısticas de teste com valor absoluto mais baixo), at´e obter um modelo em que todas as covari´aveis sejam significativas ao n´ıvel de significˆancia considerado. Este m´etodo ´e utilizado de forma a obter um modelo de regress˜ao que detenha as covari´aveis relevantes no estudo do comportamento da vari´avel resposta, com uma boa percentagem de explica¸c˜ao da variabilidade dos dados. Uma vez efetuado este passo, ´e necess´aria a an´alise do comportamento dos res´ıduos dos respetivos modelos. Desta forma ´e pretendido que se verifiquem, al´em da m´edia nula e variˆancia constante, a normalidade e a independˆencia dos res´ıduos. No presente estudo, os pressupostos da m´edia nula e variˆancia constante dos res´ıduos s˜ao avaliados de forma anal´ıtica e gr´afica, respetivamente, mas para a verifica¸c˜ao da condi¸c˜ao exigida `a m´edia, caso os pressupostos de independˆencia e normalidade dos res´ıduos n˜ao sejam rejeitados, recorre-se a um teste tpara o valor m´edio. A condi¸c˜ao da normalidade/gaussianidade dos res´ıduos ´e avaliada a partir de um histograma dos res´ıduos que dever´a assemelhar-se ao comportamento da fun¸c˜ao densidade de uma distribui¸c˜ao Normal. De uma forma mais cuidada, complementando `a an´alise gr´afica, o teste de Shapiro-Wilk poder´a ser realizado sob a hip´otese nula da normalidade dos erros. De forma a avaliar a independˆencia dos erros, uma vez que s˜ao estimados modelos via regress˜ao linear, utiliza-se a estat´ıstica de Durbin-Watson, que n˜ao rejeita a hip´otese de independˆencia quando toma valores pr´oximos de 2. Tamb´em a observa¸c˜ao da FAC e da FACP dos res´ıduos deve servir de complemento `a informa¸c˜ao sobre os res´ıduos. Nesta Sec¸c˜ao ser˜ao apresentados os principais resultados ap´os a modela¸c˜ao dos dados respetivos `a produ¸c˜ao de res´ıduos indiferenciados e seletivos. De uma forma detalhada, 91 Cap´ıtulo 7. Aplica¸c˜ao de Modelos de Regress˜ao Linear tamb´em foram modelados os dados relativos `a produ¸c˜ao de res´ıduos de papel/cart˜ao, pl´asticos e vidro, de forma a inferir sobre quais vari´aveis dever˜ao ter uma aten¸c˜ao especial no que respeita `a gest˜ao do sistema implementado. S˜ao apresentadas as estimativas dos parˆametros do modelo, os erros padr˜ao das estimativas dos parˆametros, o valor de prova e o coeficiente de determina¸c˜ao ajustado (R2 a), para cada tipo de res´ıduo. Ap´os a formula¸c˜ao dos respetivos modelos ser´a apresentada a devida an´alise de res´ıduos, com base nos pressupostos estudados, com vista `a valida¸c˜ao dos modelos. Note que no Apˆendice C, nas Tabelas C.1, C.2 e C.3, s˜ao apresentados os valores obtidos ap´os modela¸c˜ao dos dados relativos aos res´ıduos de papel/cart˜ao, vidro e pl´astico, respetivamente. Real¸ca-se que, para todas as decis˜oes, ´e considerado um n´ıvel de significˆancia de 10%. 7.2.1 Res´ıduos indiferenciados Ao analisar a Tabela 7.2 conclui-se que as vari´aveis MTH,SAC50UD,FRT e a n˜ao entrega, de forma gratuita, de sacos para a reciclagem, OFERECE:1, s˜ao significativas na explica¸c˜ao da produ¸c˜ao de res´ıduos indiferenciados na zona em estudo. A vari´avel MTH contribui para um aumento de 1,118 toneladas na produ¸c˜ao mensal de res´ıduos urbanos indiferenciados, que se traduz numa tendˆencia crescente no tempo observado. J´a a vari´avel SAC50UD contribui para um decr´escimo de 0,138 toneladas na produ¸c˜ao de res´ıduos indiferenciados, a vari´avel FRT contribui para um aumento de 1,653 toneladas e, caso a entidade respons´avel n˜ao entregue sacos para reciclagem, de forma gratuita, aos utilizadores, correspondente `a vari´avel OFERECE:1, verifica-se um acr´escimo de 12,930 toneladas na produ¸c˜ao mensal de res´ıduos indiferenciados. Em rela¸c˜ao ao valor observado do coeficiente de determina¸c˜ao ajustado, R2 a, concluise que 66,8% da variabilidade da produ¸c˜ao de res´ıduos indiferenciados ´e explicada pelo respetivo modelo de regress˜ao m´ultipla. Tabela 7.2: Modelo de regress˜ao linear m´ultipla para a produ¸c˜ao de res´ıduos indiferenciados. INDIFERENCIADO Estimativas ˆσValor de prova ˆ β0=−2,713 8,850 0,042 MTH ˆ β1= 1,118 0,262 <0,001 SAC50UD ˆ β2=−0,138 0,075 0,076 FRT ˆ β3= 1,653 0,277 <0,001 OFERECE:1 ˆ β4= 12,930 4,658 0,010 R2 a= 0,668 Neste caso, o modelo de regress˜ao linear m´ultipla, pode ser expresso por INDt=β0+β1MTHt+β2SAC50UDt+β3FRTt+β4OFERECE(1)t+t(7.1) 92 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local onde t= 1,...,33 representa os meses, INDta quantidade de res´ıduos indiferenciados produzidos e t´e um erro estoc´astico. 7.2.2 Res´ıduos seletivos Pela Tabela 7.3, conclui-se que as vari´aveis MTH,SAC15UD,SAC30UD,UDC,TAC,TBC ,TDC, TEC,KMS,FRT,REC30 e ,REC100, s˜ao significativas na explica¸c˜ao da produ¸c˜ao de res´ıduos seletivos na zona em estudo. A vari´avel MTH contribui para um decr´escimo de -0,440 toneladas na produ¸c˜ao mensal de res´ıduos urbanos indiferenciados, que se representa por uma pequena tendˆencia decrescente ao longo do tempo no per´ıodo observado. Em rela¸c˜ao aos sacos de res´ıduos indiferenciados, a vari´avel SAC15UD e a vari´avel SAC30UD provocam um decr´escimo de -0,017 e -0,038 toneladas, respetivamente. Em rela¸c˜ao aos utilizadores que compram sacos, por cada utilizador dom´estico(UDC) verifica-se um aumento de 0,230 toneladas na produ¸c˜ao de res´ıduos seletivos. Em rela¸c˜ao aos utilizadores n˜ao dom´esticos, real¸ca-se os da tipologia A (TAC) que contribuem para um decr´escimo de 0,478 toneladas por cada utilizador que compra sacos. J´a os das tipologias B, D e E contribuem para um aumento de 0,426, 1,105 e 0,793 toneladas, por cada utilizador, respetivamente. Em rela¸c˜ao `a quilometragem e ao n´umero de vezes que a viatura se desloca `a esta¸c˜ao de triagem, verifica-se que por cada incremento unit´ario na vari´avel KMS a produ¸c˜ao de res´ıduos seletivos aumenta 0,003 toneladas e na vari´avel FRT aumenta 1,222 toneladas. Os sacos para reciclagem de 30 litros, REC30, contribuem para um aumento de 0,007 toneladas na produ¸c˜ao mensal por cada unidade adquirida. J´a os sacos de 100 litros, REC100, contribuem para um decr´escimo de -0,003 toneladas por cada unidade adquirida pelos utilizadores. Em rela¸c˜ao ao valor observado do coeficiente de determina¸c˜ao ajustado, R2 a, conclui-se que 79,9% da variabilidade da produ¸c˜ao de res´ıduos seletivos ´e explicada pelo respetivo modelo de regress˜ao m´ultipla. 93 Cap´ıtulo 7. Aplica¸c˜ao de Modelos de Regress˜ao Linear Tabela 7.3: Modelo de regress˜ao linear m´ultipla para a produ¸c˜ao de res´ıduos seletivos. SELETIVO Estimativas ˆσValor de prova ˆ β0=−3,851 5,298 0,042 MTH ˆ β1=−0,440 0,188 0,030 SAC15UD ˆ β2=−0,017 0,008 0,046 SAC30UD ˆ β3=−0,038 0,013 0,008 UDC ˆ β4= 0,230 0,118 0,065 TAC ˆ β5=−0,478 0,227 0,048 TBC ˆ β6= 0,426 0,225 0,073 TDC ˆ β7= 1,105 0,282 0,001 TEC ˆ β8= 0,793 0,304 0,017 KMS ˆ β9= 0,003 0,001 0,016 FRT ˆ β10 = 1,222 0,244 <0,001 REC30 ˆ β11 = 0,007 0,003 0,039 REC100 ˆ β11 =−0,003 0,002 0,087 R2 a= 0,799 Assim, o modelo de regress˜ao linear m´ultipla para os res´ıduos seletivos ´e dado por SELt=β0+β1MTHt+β2SAC15UDt+β3SAC30UDt+β4UDCt+β5T ACt +β6TBCt+β7TDCt+β8TECt+β9KMSt+β10F RTt+β11REC30t +β12REC100t+t.(7.2) onde t= 1,...,33 representa os meses, SELta quantidade de res´ıduos seletivos produzidos et´e um erro estoc´astico. Ainda sobre os res´ıduos seletivos e de uma forma mais discriminada, segundo as conclus˜oes retiradas das Tabelas C.1, C.2 e C.3, no Apˆendice C, os modelos de regress˜ao linear m´ultipla para os res´ıduos de papel/cart˜ao, vidro e pl´astico, respetivamente, s˜ao dados por PAPt=β0+β1SAC15UDt+β2SAC30UDt+β3SAC30UNDt+β4UDCt+β5TACt +β6TDCt+β7TECt+β8KMSt+β9FRTt+β10OFERECE(1)t +β11REC50t+t,(7.3) V IDt=β0+β1SAC15UDt+β2SAC30UDt+β3SAC30UNDt+β4UDCt+β5TDCt +β6FRTt+β7DEPt+β8REC30t+β9REC100t+t,(7.4) PLAt=β0+β1MTH +β2SAC15UDt+β3SAC30UDt+β4UDCt+β5T ACt +β6TDCt+β7TECt+β8F RTt+β9OFERECE(1)t+β10REC50t +β11REC100t+t,(7.5) 94 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local onde t= 1,...,33 representa os meses, PAPt,V IDtePLAtrepresentam a quantidade de res´ıduos de papel, vidro e pl´astico produzidos e t´e um erro estoc´astico. Em rela¸c˜ao aos modelos apresentados nas equa¸c˜oes 7.3, 7.4 e 7.5 relativos `a produ¸c˜ao de papel/cart˜ao, pl´astico e vidro, ´e importante referir que apenas o modelo ajustado aos dados da produ¸c˜ao de res´ıduos de pl´astico apresenta presen¸ca de componente de tendˆencia, onde se verifica um decr´escimo de -0,048 toneladas na produ¸c˜ao mensal de res´ıduos de pl´astico. Na an´alise da Tabela C.1 (Apˆendice C) verifica-se que a covari´avel que mais contribui para o valor m´edio da produ¸c˜ao de res´ıduos de papel/cart˜ao ´e OFERECE:1, de onde se conclui que a n˜ao entrega gratuita de sacos para a reciclagem influencia a produ¸c˜ao mensal de res´ıduos de papel/cart˜ao em cerca de 2,643 toneladas. O coeficiente de determina¸c˜ao ajustado tem um valor igual a 0,526, isto ´e, cerca de 52,6% da variabilidade da produ¸c˜ao de res´ıduos de papel/cart˜ao ´e explicada pelo modelo definido em 7.3. Em rela¸c˜ao `a produ¸c˜ao de res´ıduos de vidro, a covari´avel FRT tem coeficiente em valor absoluto elevado, que permite concluir que ´e a que mais contribui para o valor esperado da produ¸c˜ao de res´ıduos de vidro, ou seja, a produ¸c˜ao de res´ıduos de vidro aumenta cerca de 0,705 toneladas com o acr´escimo unit´ario ao n´umero de fretes. O coeficiente de determina¸c˜ao ajustado tem um valor igual a 0,857, isto ´e, cerca de 85,7% da variabilidade da produ¸c˜ao de res´ıduos de vidro ´e explicada pelo modelo definido em 7.4. Por ´ultimo, a covari´avel FRT tem coeficiente em valor absoluto elevado de valor igual a 0,273, de onde se constanta que ´e a que mais contribui para o valor esperado da produ¸c˜ao de res´ıduos de pl´astico, ou seja, a produ¸c˜ao de res´ıduos de pl´astico aumenta cerca de 0,273 toneladas com o acr´escimo unit´ario ao n´umero de fretes. O coeficiente de determina¸c˜ao ajustado tem um valor igual a 0,877, isto ´e, cerca de 87,7% da variabilidade da produ¸c˜ao de res´ıduos de vidro ´e explicada pelo modelo definido em 7.5. 7.2.3 An´alise de res´ıduos Para validar os modelos ´e necess´ario efetuar uma an´alise dos res´ıduos. De forma a cumprir os pressupostos das ”Condi¸c˜oes de Gauss-Markov”, estes devem apresentar um comportamento pr´oximo de uma distribui¸c˜ao Normal, de m´edia nula e variˆancia constante, e n˜ao apresentarem correla¸c˜ao temporal. Relativamente aos res´ıduos do modelo de regress˜ao obtido para os dados relativos `a produ¸c˜ao de res´ıduos indiferenciados, pela Figura 7.1, numa an´alise visual poderemos considerar os res´ıduos como gaussianos devido ao seu comportamento sim´etrico no histograma e pela proximidade dos pontos, no QQ plot, `a reta y=xrespeitante `a bissetriz dos quadrantes´ımpares (1. º quadrante). Complementando esta conclus˜ao, o teste de Shapiro Wilk para a normalidade n˜ao rejeita a hip´otese de normalidade (valor de prova de 0,426). Analisando o gr´afico de dispers˜ao dos res´ıduos versus valores estimados (Figura 7.1), ´e not´oria a distribui¸c˜ao uniforme em torno do res´ıduo zero, o que leva a crer que os erros tˆem m´edia nula e variˆancia constante. De facto, o teste tpara o valor m´edio confirma 95 Cap´ıtulo 7. Aplica¸c˜ao de Modelos de Regress˜ao Linear 7.3.2 Res´ıduos seletivos Analisando agora os dados relativos `as quantidades de res´ıduos seletivos produzidos, define-se o seguinte modelo SELt=β0+β1(ABR)t+β2(JUN)t+β3(JUL)t+β4(AGO)t+β5(SET)t +β6(OUT)t+β7(NOV )t+β8(DEZ)t+β9(JAN)t+β10(FEV )t +β11(MAR)t+t,(7.10) onde t= 1,...,33 representa os meses, SELta quantidade de res´ıduos seletivos produzidos et´e um erro estoc´astico. De forma an´aloga aos res´ıduos indiferenciados, o modelo definido pela equa¸c˜ao 7.10 foi ajustado `a s´erie dos dados relativos `a produ¸c˜ao de res´ıduos seletivo no CHG. Assim, a Tabela C.4 (Apˆendice C) apresenta as estimativas dos coeficientes, valores de prova e respetivo coeficiente de determina¸c˜ao do modelo. A existˆencia de coeficientes sazonais estatisticamente n˜ao significativos no modelo 7.10, leva a aplicar o m´etodo regressivo ao modelo inicial, de forma a encontrar o modelo que se ajuste melhor aos dados. Ap´os a aplica¸c˜ao do referido m´etodo, foi obtido o seguinte modelo SELt=β0+β1(ABR)t+β2(JUL)t+β3(AGO)t+β4(SET)t++β5(DEZ)t+β6(FEV )t+t, (7.11) onde t= 1,...,33 representa os meses, SELta quantidade de res´ıduos seletivos produzidos et´e um erro estoc´astico. A Tabela 7.7 apresenta as estimativas dos coeficientes, erros padr˜ao, valores de prova e o coeficiente de determina¸c˜ao. Verifica-se que existe um decr´escimo significativo nos meses de abril, dezembro e fevereiro iguais a 4,383, 5,250 e 6,880 toneladas, respetivamente. J´a nos meses de julho, agosto e setembro verificam-se aumentos de valor igual a 4,890, 8,450 e 3,670 toneladas, respetivamente. O modelo final, via m´etodo regressivo, det´em um coeficiente de determina¸c˜ao ajustado, R2 a, igual a 0,621 , ou seja, cerca de 62,1% da variabilidade da produ¸c˜ao de res´ıduos seletivos ´e explicada pelas vari´aveis sazonais. De forma an´aloga aos res´ıduos indiferenciados, tamb´em foi formulado um modelo resultante da combina¸c˜ao das vari´aveis constantes da equa¸c˜ao 7.3 com as vari´aveis sazonais. 102 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local Tabela 7.7: Valores obtidos ap´os modela¸c˜ao do modelo sazonal final, dos res´ıduos seletivos. SELETIVO Estimativas ˆσValor de prova ˆ β0= 24,709 0,636 <0,001 ABR ˆ β1=−4,383 1,952 0,033 JUL ˆ β2= 4,890 1,952 0,012 AGO ˆ β3= 8,457 1,952 <0,001 SET ˆ β4= 3,637 1,952 0,074 DEZ ˆ β5=−5,250 1,952 0,012 FEV ˆ β6=−6,880 2,310 0,006 R2 a= 0,621 Desta forma, atendendo `a Tabela 7.8 verifica-se que, ap´os aplica¸c˜ao do m´etodo regressivo no modelo completo, as vari´aveis correspondente aos meses (MTH) e ao n´umero de sacos de 30 litros oferecidos (REC30) n˜ao foram inclu´ıdas e, tamb´em, a remo¸c˜ao das vari´aveis indicatrizes correspondentes aos meses de julho JUL, dezembro DEZ e fevereiro FEV, pelo que no modelo obtido s˜ao consideradas as vari´aveis respeitantes aos meses de abril ABR, agosto AGO e setembro SET. Interpretando os valores das estimativas dos coeficientes tem-se que os sacos de 15 litros adquirido por UD (SAC15UD) provocam um decr´escimo de -0,016 toneladas por cada saco adquirido. Tamb´em os res´ıduos seletivos decrescem cerca de -0,010 e -0,004 toneladas por cada saco de 30 litros adquirido por UD e por cada saco de reciclagem de 100 litros oferecido aos utilizadores. J´a a diversidade de tipologias que comp˜oem os UND influenciam a produ¸c˜ao de res´ıduos seletivos. Neste caso, ´e verificado um aumento de 0,474, 0,539 e 0,740 toneladas por cada aumento unit´ario dos utilizadores das tipologias B, D e E que compram sacos. A quilometragem tamb´em influencia as pesagens, concluindo-se que por cada quil´ometro percorrido s˜ao recolhidas 0,003 toneladas de res´ıduos seletivos. Em rela¸c˜ao `a sazonalidade ´e verificado um decr´escimo de 6,220 toneladas nas pesagens de res´ıduos seletivos, quando se trata do mˆes de abril e aumentos de 4,004 e 2,810 toneladas, aquando os meses de agosto e setembro, respetivamente. O modelo, agora formulado, apresenta um coeficiente de determina¸c˜ao ajustado, R2 a igual a 0,714 , o que determina que 71,41% da variabilidade da produ¸c˜ao mensal de res´ıduos seletivos ´e explicada pelo modelo. Desta forma, a equa¸c˜ao do modelo ´e dada por SELt=β0+β1(SAC15UD)t+β2(SAC30UD)t+β3(T BC)t+β4(T DC)t +β5(TEC)t+β6(KMS)t+β7(FRT )t+β8(REC100)t+β9(ABR)t +β10(AGO)t+β11(SET )t+t,(7.12) onde t= 1,...,33 representa os meses, SELta quantidade de res´ıduos seletivos produzidos et´e um erro estoc´astico. 103 Cap´ıtulo 7. Aplica¸c˜ao de Modelos de Regress˜ao Linear Tabela 7.8: Modelo de regress˜ao linear m´ultipla para a produ¸c˜ao de res´ıduos seletivos com combina¸c˜ao das vari´aveis sazonais. SELETIVO Estimativas ˆσValor de prova ˆ β0=−1,419 5,260 0,095 SAC15UD ˆ β1=−0,016 0,005 0,003 SAC30UD ˆ β2=−0,010 0,006 0,094 TBC ˆ β3= 0,474 0,174 0,013 TDC ˆ β4= 0,539 0,234 0,032 TEC ˆ β5= 0,740 0,281 0,016 KMS ˆ β6= 0,003 0,001 0,006 FRT ˆ β7= 0,651 0,180 0,002 REC100 ˆ β8=−0,004 0,001 0,026 ABR ˆ β9=−6,220 1,740 0,002 AGO ˆ β10 = 4,004 1,980 0,056 SET ˆ β11 = 2,810 1,511 0,077 R2 a= 0,714 Partindo para outra metodologia, considerando as vari´aveis significativas ap´os aplica- ¸c˜ao do modelo de regress˜ao linear simples `as duas vari´aveis resposta, como se pode verificar atrav´es da Tabela 7.1 ´e pretendida a formula¸c˜ao de um modelo de regress˜ao linear m´ultipla que resulte da combina¸c˜ao das covari´aveis estatisticamente significativas com as covari´aveis correspondentes aos indicadores sazonais. Tal como nos anteriores ´e utilizado o m´etodo regressivo para sele¸c˜ao das vari´aveis que melhor expliquem a vari´avel resposta. Desta forma ´e obtido o seguinte modelo SELt=β0+β1(T BC)t+β2(ABR)t+β3(JUL)t+β4(AGO)t +β5(SET )t+β6(NOV )t+β7(DEZ)t+β8(FEV )t+t,(7.13) onde t= 1,...,33 representa os meses, SELta quantidade de res´ıduos indiferenciados produzidos e t´e um erro estoc´astico. Os principais resultados do modelo formulado est˜ao apresentados na Tabela 7.9. Deste novo modelo, verifica-se uma maior reten¸c˜ao do n´umero de vari´aveis sazonais. Em rela¸c˜ao `as vari´aveis restantes existe, apenas, uma vari´avel significativa, correspondente ao n´umero de UND da tipologia B que por cada acr´escimo ao seu n´umero aumenta, consequentemente, cerca de 0,401 toneladas na produ¸c˜ao de res´ıduos seletivos. Destaca-se ent˜ao o poder explicativo das vari´aveis indicatrizes dos indicadores sazonais na produ¸c˜ao dos res´ıduos seletivos. Neste caso as vari´aveis correspondentes aos meses de julho (JUL), agosto (AGO) e setembro (SET) aumentam as pesagens de res´ıduos seletivos na ordem dos 4,171, 7,337 e 3,854 toneladas, respetivamente. J´a os meses de abril ABR, novembro (NOV), dezembro (DEZ) e fevereiro (FEV) provocam uma diminui¸c˜ao da produ¸c˜ao de 104 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local res´ıduos seletivos de valores iguais a 3,899, 3,934, 3,697 e 4,515 toneladas, respetivamente. De real¸car que este modelo tem um coeficiente de determina¸c˜ao ajustado igual a 0,614, ou seja, cerca de 61,4% da variabilidade da produ¸c˜ao de res´ıduos seletivos ´e explicada pelo modelo. Tabela 7.9: Modelo de regress˜ao linear m´ultipla para a produ¸c˜ao de res´ıduos seletivos com combina¸c˜ao das vari´aveis sazonais e vari´aveis obtidas por regress˜ao linear simples. SELETIVO Estimativas ˆσValor de prova ˆ β0= 15,158 4,680 0,003 TBC ˆ β1= 0,401 0,195 0,050 ABR ˆ β2=−3,899 1,792 0,040 JUL ˆ β3= 4,171 1,875 0,036 AGO ˆ β4= 7,337 1,942 0,001 SET ˆ β5= 3,854 1,794 0,042 NOV ˆ β6=−3,934 1,827 0,042 DEZ ˆ β7=−3,697 1,873 0,060 FEV ˆ β8=−4,515 2,290 0,060 R2 a= 0,614 105 Cap´ıtulo 7. Aplica¸c˜ao de Modelos de Regress˜ao Linear 106 Cap´ıtulo 8 Aplica¸c˜ao de M´etodos de Previs˜ao Depois de efetuada a an´alise explorat´oria aos dados facultados pela VITRUS, o passo seguinte ´e a aplica¸c˜ao das metodologias aos dados, que, neste caso, correspondem a modelos de previs˜ao para s´eries temporais. Muitos estudos fundamentam-se, essencialmente pela metodologia de Box-Jenkins que ser´a aplicada aos dados referentes `a recolha de contentores de profundidade e aos dados relacionados com a recolha seletiva e indiferenciada, respetivamente, de res´ıduos na ´area de implementa¸c˜ao do sistema PAYT. A formula¸c˜ao do modelo SARIMA compreende as trˆes fases constantes na metodologia Box-Jenkins: identifica¸c˜ao, estima¸c˜ao e diagn´ostico. Para o primeiro passo ´e necess´aria a estacionariza¸c˜ao da s´erie, por meio de transforma¸c˜oes apropriadas, tanto em rela¸c˜ao `a m´edia como `a variˆancia. Desta forma, e como a estabiliza¸c˜ao da variˆancia deve ser efetuada em primeiro lugar, procede-se `a transforma¸c˜ao logar´ıtmica (mais usual) dos dados. Relativamente `a ordem de diferencia¸c˜ao, com vista `a estabiliza¸c˜ao da m´edia, esta ´e escolhida e fundamentada com base na an´alise gr´afica (da s´erie e das FAC e FACP emp´ıricas) e nos testes de estacionariedade (ADF e KPSS). Efetuadas as devidas transforma¸c˜oes `a s´erie em estudo numa s´erie estacion´aria, identificando a ordem de diferencia¸c˜ao regular, d, ´e necess´ario estimar a componente sazonal. Para tal, come¸ca-se por determinar o per´ıodo sazonal, s, atrav´es da an´alise das FAC e FACP da s´erie estacion´aria e, de seguida, estimam-se v´arios modelos, fazendo variar os valor de P,D, e Q(ordens da parte sazonal), usualmente entre 0 e 1. A escolha das ordens, P,DeQtem sempre em considera¸c˜ao a significˆancia dos parˆametros associados e no crit´erio AIC. Saliente-se que, cado o intervalo de confian¸ca associado a P= 1 incluir o valor 1, se deve optar por uma diferencia¸c˜ao sazonal, ou seja, pelo modelo que considera P= 0 e D= +1. Por ´ultimo, identificam-se as ordens peq, comparando o comportamento das FAC e FACP emp´ıricas com o das FAC e FACP te´oricas. Na medida que se deve realizar uma escolha mais cuidada, devem sempre ser explorados modelos ”vizinhos”, sendo estes analisado tanto em rela¸c˜ao `a significˆancia dos parˆametros como ao comportamento dos res´ıduos. Quando em d´uvida, a escolha entre dois ou mais modelos SARIMA fundamenta107 Cap´ıtulo 8. Aplica¸c˜ao de M´etodos de Previs˜ao se no crit´erio AIC, tendo sempre em mente que, se os AIC diferem em apenas duas unidades, se escolhe o modelo mais parcimonioso, ou seja, aquele com menor n´umero de parˆametros. A an´alise de res´ıduos, quando aplic´avel, tem como finalidade a verifica¸c˜ao do comportamento dos res´ıduos e se estes se aproximam ao de um ru´ıdo branco. Desta forma ´e pretendido que se verifiquem, al´em da m´edia nula e variˆancia constante, a gaussianidade e a independˆencia dos erros. De forma a avaliar os pressupostos de m´edia nula e variˆancia constante, a representa¸c˜ao gr´afica dos res´ıduos ´e ´util mas, para al´em disso, para a verifica¸c˜ao da condi¸c˜ao exigida `a m´edia, caso os pressupostos de independˆencia e normalidade dos erros n˜ao sejam rejeitados, pode recorrer-se ao teste tpara o valor m´edio. A condi¸c˜ao de normalidade dos res´ıduos ´e valiada a partir de um histograma dos res´ıduos que dever´a aproximar-se de um comportamento da fun¸c˜ao densidade de uma distribui¸c˜ao Normal. No entanto, de uma forma mais rigorosa, complementando `a an´alise gr´afica, podem utilizar-se testes estat´ısticos, sendo o mais comum, para amostras de grandes dimens˜oes, o teste de Kolmogorov-Smirnov sob a hip´otese nula da normalidade dos erros. Para avaliar a independˆencia dos erros, s˜ao utilizadas diferentes metodologias dependendo do m´etodo de previs˜ao aplicado. De facto, quando se estima um modelo SARIMA, recomenda-se a utiliza¸c˜ao de um teste de Portmanteau, sendo um dos mais utilizados o teste de Ljung-Box, que testa se as primeiras kautocorrela¸c˜oes s˜ao simultaneamente nulas. Como tal, e caso de rejei¸c˜ao da hip´otese nula conclui-se que o modelo escolhido n˜ao ´e apropriado. Real¸ca-se que, para todas as decis˜oes, ´e considerado um n´ıvel de significˆancia de 10%. 8.1 Caso I: Recolha de contentores de profundidade Inicia-se o estudo com a identifica¸c˜ao de um modelo SARIMA onde, o primeiro passo, consiste na estacionariza¸c˜ao da s´erie em estudo. Desta forma, ap´os a estabiliza¸c˜ao da variˆancia, atrav´es da transforma¸c˜ao logar´ıtimica ´e, ent˜ao, necess´ario definir a ordem de diferencia¸c˜ao regular para a estabiliza¸c˜ao da m´edia. ´ E aplicada uma diferencia¸c˜ao de 1. ª ordem (d= 1) onde, consequentemente, a s´erie passa a ser estacion´aria em m´edia (Figura 8.1). De forma a sustentar a afirma¸c˜ao, fundamentada com a an´alise gr´afica, s˜ao aplicados dois testes de estacionariedade – o teste ADF e o teste KPSS – `a s´erie ap´os diferencia¸c˜ao. O teste ADF ´e realizado, sob a hip´otese nula de que a s´erie n˜ao ´e estacion´aria, e conclui-se que a hip´otese nula ´e rejeitada de onde se confirma que a s´erie dos res´ıduos ´e estacion´aria enquanto no teste KPSS, a rejei¸c˜ao da hip´otese nula implica a n˜ao estacionariedade da s´erie. A escolha do n´umero de lags para o teste ADF, ou seja, do valor de p, tem por base a regra proposta por Ng & Perron (1995). O mesmo n´umero de lags ´e utilizado para o teste KPSS. 108 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local tempo (em semanas) log(CONT) −0.3 −0.2 −0.1 0.0 0.1 0.2 2017 2018 2019 0.0 0.1 0.2 0.3 0.4 −0.2 0.0 0.2 0.4 0.6 0.8 1.0 lag FAC 0.1 0.2 0.3 0.4 −0.3 −0.2 −0.1 0.0 0.1 lag FACP Figura 8.1: S´erie dos logaritmos das quantidades recolhidas em contentores de profundidade, ap´os diferencia¸c˜ao de 1. ª ordem (d= 1), e respetivas FAC e FACP estimadas. Conforme a distribui¸c˜ao associada a cada um dos testes, a estacionariedade ´e confirmada, em ambos os casos, se a estat´ıstica de teste for inferior ao valor cr´ıtico que, para um n´ıvel de significˆancia de 10% ´e de -5,773 e 0,347 para os testes ADF e KPSS, respetivamente. Desta forma, conclui-se que, a um n´ıvel de significˆancia de 10%, ap´os uma diferencia¸c˜ao de 1. ª ordem, a s´erie ´e estacion´aria em m´edia. Ap´os a transforma¸c˜ao da s´erie original numa s´erie estacion´aria em m´edia e em variˆancia, o passo seguinte consiste no ajuste da parte sazonal do modelo, que ´e verificada pela Figura 8.1 pela representa¸c˜ao gr´afica da s´erie como na FAC correspondente. A periodicidade ´e, aparentemente, semanal, e, portanto, considera-se s=365,25 7≈52,18 ≈52. Estes valores relativos `a sazonalidade s˜ao derivados do facto de existirem anos bissextos (366 dias) e com 53 semanas.Desta forma, este ajuste da sazonalidade ir´a permitir uma melhor formula¸c˜ao do modelo SARIMA. Neste estudo os anos estudados s˜ao considerados anos comuns, ou seja, anos com 365 dias. A identifica¸c˜ao das restantes ordens (P,DeQ) ´e explorada atrav´es da combina¸c˜ao de v´arias possibilidades, fazendo variar P,DeQentre os valores de 0 e 1 (Tabela 8.1). De acordo com os resultados obtidos, o modelo que resulta no menor AIC ´e o que considera P= 0, D= 0 e Q= 1 e, desta forma, estas s˜ao as ordens escolhidas para a parte sazonal do modelo. De real¸car que, estas ordens n˜ao s˜ao imut´aveis e, de acordo com as necessidades futuras, estas poder˜ao ser alteradas (aumentadas ou reduzidas). 109 Cap´ıtulo 8. Aplica¸c˜ao de M´etodos de Previs˜ao Tabela 8.1: Ajustamento de v´arios modelos para a parte sazonal, ap´os escolha da ordem de diferencia¸c˜ao regular, `a s´erie dos logaritmos das quantidades recolhidas em contentores de profundidade. Modelo ˆν1ˆη1AIC SARIMA(0,1,0)(1,0,0)52 0,123 - -432,63 SARIMA(0,1,0)(0,1,1)52 - -1,000 -240,62 SARIMA(0,1,0)(1,0,1)52 -0,592 0,739 -430,90 SARIMA(0,1,0)(0,1,0)52 - - -217,81, SARIMA(0,1,0)(0,0,1)52 - 0,129 -432,71 SARIMA(0,1,0)(1,1,0)52 -0,572 - -238,28 SARIMA(0,1,0)(1,1,1)52 -0,158 -0,998 -239,41 Verifique-se pela Figura 8.2 o comportamento dos res´ıduos ap´os o ajustamento da parte sazonal. tempo (em semanas) log(CONT) 2016.5 2017.0 2017.5 2018.0 2018.5 2019.0 −0.3 −0.2 −0.1 0.0 0.1 0.2 0.0 0.1 0.2 0.3 0.4 −0.4 0.0 0.2 0.4 0.6 0.8 1.0 lag FAC 0.1 0.2 0.3 0.4 −0.3 −0.2 −0.1 0.0 0.1 lag FACP Figura 8.2: S´erie dos logaritmos das quantidades recolhidas em contentores de profundidade, ap´os diferencia¸c˜ao de 1. ª ordem e ajustamento da parte sazonal, e respetivas FAC e FACP estimadas. Por ´ultimo, na identifica¸c˜ao de um modelo SARIMA, ´e necess´ario escolher as ordens p eq, atrav´es da compara¸c˜ao das FAC e das FACP emp´ıricas com as FAC e FACP te´oricas dos v´arios modelos conhecidos. De facto, de acordo com a Tabela 5.1, as FAC e FACP da Figura 8.2 sugerem o ajustamento de um modelo AR(3), ou, alternativamente, de um MA(1), ao res´ıduos obtidos ap´os estima¸c˜ao da parte sazonal. Contudo, al´em destes modelos, s˜ao tamb´em ajustados modelos “vizinhos”, de forma a realizar uma escolha mais 110 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local cuidada (Tabela 8.2). Ao analisar a Tabela 8.2, verifica-se que, para os modelos que consideram P= 0, D= 0 e Q= 1, os AIC s˜ao pr´oximos em rela¸c˜ao ao valor apresentado. De notar que quando D= 1 verifica-se um aumento significativo do AIC, levando `a exclus˜ao deste modelo. Relativamente ao modelo com um maior n´umero de parˆametros, este inclui um coeficiente n˜ao significativo para o n´ıvel de significˆancia considerado e, desta forma, n˜ao dever´a ser considerado. Ent˜ao, analisando os valores obtidos relativos aos modelos com igual n´umero de parˆametros, seleciona-se o que det´em menor AIC. Assim, o modelo escolhido ´e SARIMA(0,1,2)(0,0,1)52. Tabela 8.2: Ajustamento de v´arios modelos para a parte regular, ap´os escolha da ordem de diferencia¸c˜ao regular e das ordens da parte sazonal, `a s´erie dos logaritmos das quantidades de res´ıduos indiferenciados em contentores de profundidade. Modelo ˆ φ1ˆ φ2ˆ φ3ˆ θ1ˆ θ2ˆη1AIC SARIMA(0,1,1)(0,0,1)52 – – – -0,820 – 0,211 -488,30 SARIMA(1,1,1)(0,0,1)52 0,177 – – -0,860 – 0,192 -490,18 SARIMA(1,1,0)(0,0,1)52 -0.345 – – – – 0,145 -450,96 SARIMA(0,1,0)(0,0,1)52 – – – – – 0,129 -432,71 SARIMA(0,1,2)(0,0,1)52 – – – -0,659 -0,171 0,192 -490,96 SARIMA(1,1,2)(0,0,1)52 -0,166 – – -0,500 -0,300 0,195 -489,15 SARIMA(2,1,0)(0,0,1)52 -0,447 -0,288 – – – 0,155 -462,85 SARIMA(0,1,2)(0,1,1)52 – – – -0,855 0,009 -1,000 -294,64 SARIMA(3,1,1)(0,0,1)52 0,127 -0,124 -0,093 -0,805 – 0,218 -489,04 * o coeficiente n˜ao ´e estatisticamente significativo, para um n´ıvel de significˆancia α= 10%. Os resultados da estima¸c˜ao do modelo escolhido podem ser consultados, em mais detalhe, na Tabela 8.3. Tabela 8.3: Resultados da estima¸c˜ao do modelo SARIMA aplicado `a s´erie dos logaritmos das quantidades de res´ıduos indiferenciados em contentores de profundidade. Modelo final: SARIMA(0,1,2)(0,0,1)52 AIC =−490,96 ˆσ2=0,002 θ1θ2η1 estimativa −0,659 −0,171 0,192 erro padr˜ao 0,081 0,077 0,087 De forma a validar o modelo escolhido ´e necess´ario realizar uma an´alise dos res´ıduos. Estes devem apresentar, idealmente, um comportamento pr´oximo de uma distribui¸c˜ao Normal, de m´edia nula e variˆancia constante, e n˜ao apresentar correla¸c˜ao temporal. O histograma da Figura 8.3 sugere, aparentemente, que os res´ıduos tˆem distribui¸c˜ao Normal, e de forma complelenta, o teste de Kolmogorov-Smirnov n˜ao rejeita a hip´otese de normalidade (valor de prova de 0,215) dos res´ıduos. Tamb´em, de acordo com a representa¸c˜ao gr´afica da s´erie dos res´ıduos (Figura 8.3) esta apresenta uma distribui¸c˜ao uniforme em 111 Cap´ıtulo 8. Aplica¸c˜ao de M´etodos de Previs˜ao Na Figura 8.8 encontram-se representadas as previs˜oes (no per´ıodo de teste, isto ´e, da 39. ª semana de 2018 `a 1. ª semana de 2019), pontuais e intervalares, e as estimativas pontuais (do per´ıodo da 9. ª semana de 2016 `a 38. ª semana de 2018) obtidas atrav´es do modelo final, nas unidades originais, sobrepostas `a s´erie em estudo. A Figura 8.8 sugere que a qualidade preditiva do modelo ´e melhor na s´erie de treino do que na s´erie de teste, uma vez que se verifica uma descida at´ıpica nas quantidades de res´ıduos indiferenciados na s´erie original que o modelo n˜ao seria capaz de explicar o fen´omeno dadas as observa¸c˜oes do passado. Em rela¸c˜ao aos intervalos e previs˜ao, afirma-se que a sua taxa de cobertura ´e, neste caso, de 40%, uma vez que 6 observa¸c˜oes da s´erie de teste pertencem ao interior dos mesmos. Tempo (semanas) Resíduos seletivos (ton) 0 5 10 15 20 2017 2018 2019 Série observada Estimativas Previsões Intervalos de previsão (90%) Figura 8.8: Previs˜oes (no per´ıodo de teste), pontuais e intervalares (90%), e estimativas pontuais (entre a 9. ª semana de 2016 e a 38. ª semana de 2018) obtidas atrav´es do modelo SARIMA, sobrepostas `a s´erie das quantidades de res´ıduos seletivos no CHG. Res´ıduos indiferenciados Por ´ultimo, modelando a s´erie temporal respeitante `as quantidades de res´ıduos indiferenciados, recolhidos de forma semanal no CHG (zona piloto de implementa¸c˜ao do sistema PAYT) inicia-se o processo com a identifica¸c˜ao de um modelo SARIMA onde, o primeiro passo, consiste na estacionariza¸c˜ao da s´erie em estudo. Numa primeira instˆancia, ´e efetuada a estabiliza¸c˜ao da variˆancia, atrav´es da transforma¸c˜ao logar´ıtimica e, conse118 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local quentemente, ´e necess´ario definir a ordem de diferencia¸c˜ao regular para a estabiliza¸c˜ao da m´edia. ´ E aplicada uma diferencia¸c˜ao de 1. ª ordem (d= 1) onde, consequentemente, a s´erie passa a ser estacion´aria em m´edia (Figura 8.9). De facto, esta conclus˜ao ´e suportada, n˜ao s´o pela an´alise gr´afica, mas tamb´em pelos dois testes de estacionariedade utilizados - o teste ADF e o teste KPSS. Neste caso, para 3 lags, as estat´ısticas de teste s˜ao -9,551 e 0,525 para os testes ADF e KPSS, respetivamente, o que leva a concluir, a um n´ıvel de significˆancia de 10%, que, ap´os uma diferencia¸c˜ao de 1. ª ordem, a s´erie ´e estacion´aria em m´edia. Assim que a s´erie original ´e transformada numa s´erie estacion´aria, o passo seguinte ´e ajustar a parte sazonal do modelo. Numa primeira instˆancia, pela an´alise da FAC da Figura 8.9, considera-se um per´ıodo s= 52, valor este derivado de s≈52,18 devido aos anos bissextos e/ou com 53 semanas. Desta forma, este ajuste da sazonalidade ir´a permitir uma melhor formula¸c˜ao do modelo SARIMA. Neste estudo os anos estudados s˜ao considerados anos comuns, isto ´e, anos com 365 dias. tempo (em semanas) log(IND) −1.0 −0.5 0.0 0.5 1.0 2017 2018 0.0 0.1 0.2 0.3 0.4 −0.4 0.0 0.2 0.4 0.6 0.8 1.0 lag FAC 0.1 0.2 0.3 0.4 −0.3 −0.2 −0.1 0.0 0.1 lag FACP Figura 8.9: S´erie dos logaritmos das quantidades recolhidas de res´ıduos indiferenciados, no CHG, ap´os diferencia¸c˜ao de 1. ª ordem (d= 1), e respetivas FAC e FACP estimadas. A identifica¸c˜ao das ordens da parte sazonal (P, D, Q) ´e analisada pela combina¸c˜ao das v´arias possibilidades, ou seja, trata-se de um processo iterativo, onde se varia P,DeQ entre 0 e 1 (Tabela 8.7). Posto isto, e de acordo com os resultados obtidos, o modelo que resulta no menor AIC ´e o que considera P= 1, D= 0 e Q= 0 sendo, portanto, estas as 119 Cap´ıtulo 8. Aplica¸c˜ao de M´etodos de Previs˜ao ordens selecionadas para a parte sazonal do modelo. Refira-se que estas n˜ao s˜ao imut´aveis e que, de acordo com as necessidades futuras, podem ser alteradas. Tabela 8.7: Ajustamento de v´arios modelos para a parte sazonal, ap´os escolha da ordem de diferencia¸c˜ao regular, `a s´erie dos logaritmos das quantidades recolhidas de res´ıduos indiferenciados no CHG. Modelo ˆν1ˆη1AIC SARIMA(0,1,0)(1,0,0)52 – 0,176 54,45 SARIMA(0,1,0)(0,1,1)52 – -0,297 74,87 SARIMA(0,1,0)(1,0,1)52 0,949 -0,848 64,66 SARIMA(0,1,0)(0,1,0)52 – – 74,98 SARIMA(0,1,0)(0,0,1)52 – 0,136 64,99 SARIMA(0,1,0)(1,1,0)52 -0,273 – 74,87 SARIMA(0,1,0)(1,1,1)52 -0,261 -0,013 76,87 Tempo (semenas) log(SEL) −1.0 −0.5 0.0 0.5 1.0 2017 2018 0.0 0.1 0.2 0.3 0.4 −0.4 0.0 0.2 0.4 0.6 0.8 1.0 Lag FAC 0.1 0.2 0.3 0.4 −0.4 −0.3 −0.2 −0.1 0.0 0.1 Lag FACP Figura 8.10: S´erie dos res´ıduos das quantidades recolhidas de res´ıduos seletivos, no CHG, ap´os aplica¸c˜ao de uma diferencia¸c˜ao de 1. ª ordem (d= 1), e ajustamento da parte sazonal, e respetivas FAC e FACP estimadas. Na Figura 8.10 pode ver-se o comportamento dos res´ıduos ap´os o ajustamento da parte sazonal. O ´ultimo passo para a identifica¸c˜ao de um modelo SARIMA ´e a escolha das ordens peq, utilizando como ferramenta as FAC e FACP emp´ıricas. De facto, atrav´es da compara¸c˜ao das FAC e FACP da Figura 8.10 com as FAC e FACP te´oricas (ver Tabela 5.1), 120 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local ´e poss´ıvel reconhecer-se o comportamento de um modelo MA(1), ou, alternativamente, de um AR(3). No entanto, al´em destes modelos, s˜ao tamb´em ajustados modelos “vizinhos”, de forma a realizar uma escolha mais pensada (ver Tabela 8.8). Analisando a Tabela 8.8, dos nove modelos formulados, verifica-se que trˆes deles n˜ao s˜ao adequados devido `a n˜ao significˆancia de alguns dos seus coeficientes. Com isto, A escolha entre os outros modelos foi realizada, com base no AIC e, de facto, de entre os modelos, opta-se, ent˜ao, pelo que det´em menor valor de AIC, ou seja, o modelo SARIMA(1, 1, 2)(1,0,0)52. Tabela 8.8: Ajustamento de v´arios modelos para a parte regular, ap´os escolha da ordem de diferencia¸c˜ao regular e das ordens da parte sazonal, `a s´erie dos logaritmos das quantidades de res´ıduos indiferenciados no CHG. Modelo ˆ φ1ˆ φ2ˆ θ1ˆ θ2ˆν1ˆη1AIC SARIMA(0,1,1)(1,0,1)52 – – -0,800 – 0,908 −0,741∗10,45 SARIMA(2,1,0)(1,0,1)52 -0,563 -0,381 – – 0,994 -0,931 24,41 SARIMA(0,1,0)(1,0,1)52 – – – – 0,949 -0,848 64,66 SARIMA(0,1,2)(1,0,1)52 – – -0,721 −0,116∗0,875∗ −0,701∗11,25 SARIMA(1,1,2)(1,0,1)52 0,911 – -1,719 0,719 0,896 -0,721 11,61 SARIMA(0,1,1)(0,0,1)52 – – -0,810 – – 0,221 12,24 SARIMA(0,1,1)(1,0,0)52 – – -0,812 – 0,291 – 10,54 SARIMA(1,1,1)(0,0,1)52 0,147∗– -0,876 – – 0,217∗12,62 SARIMA(1,1,2)(1,0,0)52 -0,815 – 0,145 -0,822 0,280 – 4,61 * o coeficiente n˜ao ´e estatisticamente significativo, para um n´ıvel de significˆancia α= 10%. Os resultados da estima¸c˜ao deste modelo podem ser consultados, em mais detalhe, na Tabela 8.9. Tabela 8.9: Resultados da estima¸c˜ao do modelo SARIMA aplicado `a s´erie dos logaritmos das quantidades de res´ıduos indiferenciados no CHG. Modelo final: SARIMA(1,1,2)(1,0,0)52 AIC = 4,61 ˆσ2=0,054 ˆ φ1ˆ θ1ˆ θ2ˆν1 estimativa −0,815 0,145 -0,822 0,280 erro padr˜ao 0,066 0,070 0,064 0,114 De forma a validar o modelo escolhido deve realizar-se uma an´alise dos res´ıduos (ver Figura 8.11). Idealmente, estes devem apresentar um comportamento pr´oximo de uma distribui¸c˜ao Normal, de m´edia nula e variˆancia constante, e n˜ao ser correlacionados no tempo. De acordo com a representa¸c˜ao gr´afica da s´erie dos res´ıduos (Figura 8.11), considera-se que esta apresenta uma distribui¸c˜ao (relativamente) uniforme em torno do res´ıduo zero, o que sugere que os erros tˆem m´edia nula e variˆancia constante. A m´edia nula, numa perspetiva anal´ıtica, pode ser verificada pelo teste tpara a m´edia de onde se obt´em um 121 Cap´ıtulo 8. Aplica¸c˜ao de M´etodos de Previs˜ao valor de prova igual a 0,972 comprovando, desta forma, o pressuposto em an´alise. Al´em disso, o histograma da Figura 8.11 sugere que, apesar da existˆencia de algumas observa¸c˜oes discrepantes, os res´ıduos tˆem uma distribui¸c˜ao Normal, o que ´e comprovado pela aplica¸c˜ao do teste de Kolmogorov-Smirnov, com um valor de prova de 0,111. Admite-se, assim, que os erros seguem uma distribui¸c˜ao Normal de m´edia nula e variˆancia constante. Quanto `a independˆencia, o teste de Ljung-Box ´e aplicado `a s´erie dos res´ıduos onde k varia entre 5 e 35 (kcorresponde ao n´umero de autocorrela¸c˜oes a serem testadas como grupo). Segundo os resultados do teste, a hip´otese de independˆencia n˜ao ´e rejeitada para nenhum dos valores de k, apresentando valores de prova entre 0,215 (k= 6) e 0,843 (k= 40). Note-se que as FAC e FAC estimadas dos res´ıduos (Figura 8.11) assemelham-se `as FAC e FACP de um ru´ıdo branco e, portanto, pode admitir-se a independˆencia dos erros. Tempo (semanas) log(IND) −1.0 −0.5 0.0 0.5 2017 2018 Resíduos Frequência relativa −1.0 −0.5 0.0 0.5 0.0 0.5 1.0 1.5 2.0 0.0 0.1 0.2 0.3 0.4 −0.2 0.0 0.2 0.4 0.6 0.8 1.0 Lag FAC 0.1 0.2 0.3 0.4 −0.15 −0.05 0.05 0.15 Lag FACP Figura 8.11: S´erie dos res´ıduos para a s´erie dos logaritmos das quantidades de res´ıduos indiferenciados no CHG, ap´os ajustamento do modelo SARIMA, e respetivo histograma, FAC e FACP estimadas. Na Figura 8.12 encontram-se representadas as previs˜oes (no per´ıodo de teste: 39. ª semana de 2018 `a 1 ª semana de 2019), pontuais e intervalares, e as estimativas pontuais (no per´ıodo compreendido entre a 9. ª semana de 2016 e a 38 ª semana de 2018) obtidas atrav´es do modelo final, nas unidades originais, sobrepostas `a s´erie em estudo. Em rela¸c˜ao aos intervalos e previs˜ao, afirma-se que a sua taxa de cobertura ´e, neste caso, de 60%, uma vez que apenas 9 observa¸c˜oes da s´erie de teste pertencem ao interior 122 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local dos mesmos. Tempo (semanas) Resíduos indiferenciados (ton) 0 5 10 15 20 25 30 35 2017 2018 2019 Série observada Estimativas Previsões Intervalos de previsão (90%) Figura 8.12: Previs˜oes (no per´ıodo de teste), pontuais e intervalares (90%), e estimativas pontuais (entre a 9. ª semana de 2016 e a 38. ª semana de 2018) obtidas atrav´es do modelo SARIMA, sobrepostas `a s´erie das quantidades de res´ıduos indiferenciados no CHG. 8.3 Avalia¸c˜ao dos Modelos de Previs˜ao Formulados os modelos de previs˜ao aos dados fornecidos, ´e necess´aria a identifica¸c˜ao dos modelos que melhor se adequaram `a situa¸c˜ao em estudo. Para efeitos comparativos s˜ao utilizadas quatro medidas de avalia¸c˜ao: o EQM e a sua correspondente na mesma escala dos dados, REQM, o EPAM, o e o EEAM. Para al´em destas medidas terem sido calculadas para a s´erie de teste, para as respetivas 15 observa¸c˜oes em cada s´erie temporal, s˜ao tamb´em determinadas para a s´erie de treino, a partir dos res´ıduos do modelo em quest˜ao. Os resultados podem ser consultados na Tabela 8.10. Da an´alise da Tabela 8.10, verifica-se que o melhor modelo que melhor explica o comportamento dos dados (s´erie de treino) foram os estimados para os res´ıduos seletivos na zona de implementa¸c˜ao do PAYT pelo que, no entanto, em respeito `a previs˜ao (s´erie de teste) ´e a que apresenta o pior resultado. J´a em rela¸c˜ao `as s´eries dos res´ıduos indiferenciados em contentores de profundidade e na zona de implementa¸c˜ao do PAYT, pode-se afirmar que estes detˆem o melhor modelo ajustado `a s´erie de teste do que na s´erie de treino. 123 Cap´ıtulo 8. Aplica¸c˜ao de M´etodos de Previs˜ao Tabela 8.10: Medidas de avalia¸c˜ao calculadas para as s´eries estudadas, no per´ıodo de treino e no per´ıodo de teste respetivo, com base nos resultados obtidos na aplica¸c˜ao do m´etodo de previs˜ao. S´erie de treino S´erie de teste S´erie EQM REQM EPAM EEAM EQM REQM EPAM EEAM CONT 271,187 16,468 3,511 0,639 206,806 14,381 3,571 0,467 SEL 3,202 1,789 23,473 0,414 13,633 3,692 69,687 0,363 IND 7,804 2,793 16,488 0,579 1,654 1,286 7,965 0,723 Uma vez avaliada a precis˜ao das previs˜oes realizadas (pontuais), ´e fundamental compreender a efic´acia das previs˜oes intervalares. Teoricamente, os intervalos de previs˜ao s˜ao calculadas a uma confian¸ca de 90%, o que significa que 90% dos intervalos deve incluir a observa¸c˜ao observada (real). Com isto, considera-se que as previs˜oes intervalares mais eficazes s˜ao aquelas cuja taxa de cobertura efetiva mais se aproxima de 90%. Note-se que os intervalos de previs˜ao s˜ao obtidos com base na s´erie de teste, para cada s´erie distinta onde, neste estudo, contˆem apenas 15 observa¸c˜oes e, desta forma, a an´alise das taxas de cobertura deve ser cuidada. Nas trˆes s´eries em estudo – CONT,SEL eIND – s˜ao calculadas as taxas de cobertura de valor igual a 40%, 40% e 60%, respetivamente. Com isto ´e not´orio que o modelo formulado para a s´erie correspondente `a produ¸c˜ao de res´ıduos indiferenciados na zona de implementa¸c˜ao do sistema PAYT apresenta melhores resultados. 124 Modela¸c˜ao Estat´ıstica: um estudo na Gest˜ao Empresarial Local Tabela 8.11: Tabela com os respetivos intervalos de previs˜ao, valores previstos e valores reais para cada s´erie em estudo, respetivamente. CONT SEL IND Intervalo de predi¸c˜ao Valor Previsto Valor Real Intervalo de predi¸c˜ao Valor Previsto Valor Real Intervalo de predi¸c˜ao Valor Previsto Valor Real (325,117 ; 337,321) 331,219 337,200 (2,300 ; 6,667) 4,484 2,360 (12,376 ; 14,463) 13,419 13,880 (327,413 ; 339,617) 333,515 314,020 (4,357 ; 8,725) 6,541 10,880 (13,072 ; 15,159) 14,115 11,520 (329,027 ; 341,231) 335,129 318,000 (3,757 ; 8,124) 5,940 3,800 (12,782 ; 14,869) 13,826 15,440 (326,765 ; 338,969) 332,867 318,660 (2,931 ; 7,299) 5,115 7,820 (12,972 ; 15,059) 14,015 13,420 (334,013 ; 346,217) 340,115 319,320 (2,236 ; 6,604) 4,420 3,880 (12,666 ; 14,753) 13,710 12,160 (330,435 ; 342,639) 336,537 312,400 (4,320 ; 8,688) 6,504 6,920 (12,649 ; 14,737) 13,693 12,740 (333,233 ; 345,639) 339,335 324,760 (0,921 ; 5,288) 3,105 2,060 (12,384 ; 14,471) 13,428 13,460 (332,958 ; 345,162) 339,060 326,380 (3,480 ; 7,848) 5,664 2,040 (12,249 ; 14,336) 13,293 12,180 (332,840 ; 345,044) 338,942 331,180 (0,768 ; 5,135) 2,951 5,640 (10,967 ; 13,054) 12,011 14,500 (333,118 ; 345,322) 339,220 337,220 (3,982 ; 8,350) 6,166 9,500 (12,303 ; 14,390) 13,347 14,240 (330,492 ; 342,696) 336,594 342,240 (0,588 ; 4,956) 2,772 1,840 (12,181 ; 14,268) 13,225 12,580 (335,077 ; 347,281) 341,179 353,560 (3,861 ; 8,228) 6,044 2,400 (14,008 ; 16,095) 15,052 13,540 (337,559 ; 349,763) 343,661 348,860 (2,092 ; 6,460) 4,276 10,880 (12,605 ; 14,693) 13,649 13,020 (335,336 ; 347,540) 341,438 363,520 (3,216 ; 7,584) 5,400 2,080 (12,796 ; 14,883) 13,839 13,340 (326,509 ; 338,713) 332,611 337,700 (1,224 ; 5,591) 3,408 11,620 (12,851 ; 14,939) 13,895 13,780 125 Cap´ıtulo 8. Aplica¸c˜ao de M´etodos de Previs˜ao 126 Cap´ıtulo 9 Conclus˜ao O presente estudo permitiu a cria¸c˜ao de uma base de conhecimentos acerca da Gest˜ao de Res´ıduos em contexto local, nomeadamente sobre a implementa¸c˜ao de um sistema inovador denominado de Pay-As-You-Throw em que o cidad˜ao paga unicamente aquilo que produz. Este trabalho focou-se na an´alise e modela¸c˜ao de dados via modelos de Regress˜ao Linear, nomeadamente no estudo dos fatores que influenciam as quantidades de res´ıduos indiferenciados e seletivos, respetivamente, produzidas na zona de implementa¸c˜ao do sistema PAYT. Desta forma verificou-se a presen¸ca de uma tendˆencia crescente na produ¸c˜ao de res´ıduos indiferenciados e uma decrescente na produ¸c˜ao de res´ıduos seletivos. Real¸ca-se que a produ¸c˜ao de res´ıduos indiferenciados est´a relacionada de forma negativa com a venda de sacos de 50 litros, a utilizadores dom´esticos, com o n´umero de fretes, isto ´e, o n´umero de vezes que a viatura de desloca da zona de atua¸c˜ao `a esta¸c˜ao de triagem. Caso a VITRUS opte por n˜ao oferecer sacos para a reciclagem, a produ¸c˜ao destes res´ıduos poder´a aumentar significativamente, uma vez que h´a falta informa¸c˜ao e de medidas pedag´ogicas para a importˆancia da reciclagem. A produ¸c˜ao de res´ıduos seletivos est´a associada linearmente, de forma negativa, com o n´umero de sacos de 15 e 30 litros vendidos a utilizadores dom´esticos. Em rela¸c˜ao ao n´umero de utilizadores que compraram sacos, real¸ca-se a associa¸c˜ao linear negativa com o n´umero de utilizadores n˜ao dom´esticos, da tipologia A, que compram sacos, ou seja, estes utilizadores s˜ao grandes produtores de res´ıduos indiferenciados. Em rela¸c˜ao aos das tipologias B, D e E verifica-se uma rela¸c˜ao positiva, ou seja, s˜ao estes que influenciam de forma significativa a produ¸c˜ao de res´ıduos seletivos. J´a a quilometragem efetuada e o n´umero de fretes realizados contribuem para o aumento da recolha de res´ıduos seletivos. O n´umero de sacos de 30 litros para a reciclagem, oferecidos aos utilizadores, contribuem de forma positiva, contrariamente aos de 100 litros que detˆem uma rela¸c˜ao negativa com a produ¸c˜ao de res´ıduos seletivos. Esta situa¸c˜ao observada nos sacos de 100 litros poder´a estar relacionada com poss´ıveis quebras de stock ou outros fatores que influenciam a produ¸c˜ao de uma forma direta. 127