scieee AI-readable full text Open interactive document viewer

Modelos Empíricos de Pós-Dupla Seleção por LASSO: Discussões para Estudos do Transporte Aéreo

Oliveira, Alessandro V. M.

Abstract

O presente trabalho apresenta e discute formas de estimação por regressão regularizada e seleção de modelos com uso do método LASSO – Least Absolute Shrinkage and Selection Operator. O LASSO é reconhecido como um dos principais métodos de aprendizado supervisionado aplicados à econometria de alta dimensionalidade, permitindo trabalhar com grandes volumes de dados e múltiplos controles correlacionados. São abordadas questões conceituais relacionadas às consequências da alta dimensionalidade na econometria moderna e ao princípio da esparsidade, que fundamenta procedimentos de regularização. O estudo examina os principais modelos de pós-dupla seleção e pós-regularização, incluindo variações aplicadas a modelos de variáveis instrumentais. Também é apresentada uma breve descrição do pacote de rotinas lassopack, suas sintaxes e exemplos de modelos HD, HDS (High-Dimension Sparse) e IV-HDS, com combinações envolvendo estimadores de efeitos fixos. Por fim, discute-se o potencial de aplicação da abordagem em pesquisas voltadas ao transporte aéreo, com destaque para um estudo empírico sobre eficiência operacional de companhias aéreas e consumo de combustível de aeronaves.

Full text

CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 1 Modelos Empíricos de Pós-Dupla Seleção por LASSO: Discussões para Estudos do Transporte Aéreo Alessandro V. M. Oliveira Instituto Tecnológico de Aeronáutica Instituto Tecnológico de Aeronáutica. Praça Marechal Eduardo Gomes, 50. 12.280-250 - São José dos Campos, SP - Brasil. E-mail address: ales[email protected]. Resumo: O presente trabalho apresenta e discute formas de estimação por regressão regularizada e seleção de modelos com uso do método LASSO – Least Absolute Shrinkage and Selection Operator. O LASSO é reconhecido como um dos principais métodos de aprendizado supervisionado aplicados à econometria de alta dimensionalidade, permitindo trabalhar com grandes volumes de dados e múltiplos controles correlacionados. São abordadas questões conceituais relacionadas às consequências da alta dimensionalidade na econometria moderna e ao princípio da esparsidade, que fundamenta procedimentos de regularização. O estudo examina os principais modelos de pós-dupla seleção e pósregularização, incluindo variações aplicadas a modelos de variáveis instrumentais. Também é apresentada uma breve descrição do pacote de rotinas lassopack, suas sintaxes e exemplos de modelos HD, HDS (High-Dimension Sparse) e IV-HDS, com combinações envolvendo estimadores de efeitos fixos. Por fim, discute-se o potencial de aplicação da abordagem em pesquisas voltadas ao transporte aéreo, com destaque para um estudo empírico sobre eficiência operacional de companhias aéreas e consumo de combustível de aeronaves. Palavras-chave: aprendizado de máquina, métodos de regularização, econometria de alta dimensionalidade, pós-lasso, variáveis instrumentais. I. INTRODUÇÃO A popularização da internet e o avanço dos meios digitais na sociedade proporcionou o advento da proliferação dos chamados dados em grande volume – conhecidos como “Big Data”. Nesse contexto, não apenas o número de observações contidas em diversas bases de dados aumenta consideravelmente a cada ano, mês, dia, hora e minuto, como também surgem mais e mais formas de se mensurar fenômenos – o que se traduz em conjuntos cada vez maiores de fatores explicativos passíveis de consideração nas análises quantitativas. Isso deu luz à chamada Estatística de “Alta Dimensão” – High-Dimensional Statistics, vide Giraud (2014), e Bühlmann & de Geer (2011). Em estatística, o termo “dimensionalidade” está atrelado ao número de atributos existente nos dados. Assim, dados, ou modelos, em alta dimensão são aqueles em que o número de variáveis é consideravelmente maior do que o utilizado na análise multivariada tradicional, gerando desafios importantes em termos computacionais e de interpretação de modelos. Sirimongkolkasem & Drikvandi (2019) e Liu, Xu & Li (2020) descrevem que a existência de dados de alta dimensão em campos como tecnologia da informação, astronomia, neurociência e bioinformática, em aplicações em genômica, análise de dados de ressonância magnética funcional, análise de dados de saúde em grande escala, análise de texto e imagem, dentre diversas outras, forçou o desenvolvimento de novos métodos de análise estatística. Um dos métodos desenvolvidos para lidar com a dimensionalidade dos dados é o LASSO. O acrônimo LASSO (também referenciado como “Lasso” e “lasso”) é utilizado em estatística para designar “Least Absolute Shrinkage and Selection Operator”, ou, traduzindo literalmente, “Operador de Encolhimento Absoluto Mínimo e Seleção”. Trata-se de um termo que deixa apenas implícito o que o modelo realmente faz, sendo que o mais apropriado seria denominá-lo de “Operador de Seleção e Encolhimento da Soma dos Valores Absolutos ao Mínimo”. Trata-se de um método de análise de regressão que possibilita, simultaneamente à tradicional estimação dos parâmetros de mínimos quadrados, realizar: 1. o “encolhimento” de coeficientes, ou seja, a redução em módulo dos valores das estimativas, também conhecido como “regularização” e; 2. a seleção de variáveis, ou seja, a redução da dimensão do modelo, mantendo-se apenas um subconjunto do rol inicial de regressores. CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 2 Essas duas tarefas realizadas pelo LASSO - regularização e seleção -, são feitas simultaneamente no mesmo procedimento de otimização executado para se obter os coeficientes estimados 1 . Assim, ao encontrar a solução para os coeficientes que atende à restrição de soma dos valores absolutos dos mesmos, o LASSO ao mesmo tempo obtém coeficientes com valores menores em módulo, e obtém valores zerados para um subconjunto deles. Dessa forma, pode-se classificar o LASSO como um tipo de estimador de Mínimos Quadrados Restritos, cuja restrição força os coeficientes a tenderem a zero. Nesse sentido, trata-se de um procedimento de inferência estatística conservador, ao reduzir as chances de falsos positivos nas análises. O LASSO tem origem em trabalhos pioneiros de Santosa e Symes (1986) e Frank e Friedman (1993), mas se tornou muito utilizado a partir do clássico estudo do professor da Universidade de Stanford Robert Tibshirani (1996), “Regression shrinkage and selection via the lasso”, publicado no periódico britânico Journal of the Royal Statistical Society: Series B (Methodological). No livro de Hastie, Tibshirani & Wainwright (2015), escrito quase vinte anos após a publicação do artigo, os autores refletem: “O laço [em português, com ç] é uma corda longa com uma volta em uma das pontas, usada para pegar cavalos e gado. Em sentido figurado, o método “laça” os coeficientes do modelo” (p. 8). “Laçar”, nesse sentido, é selecionar apenas algumas variáveis dentre as disponíveis. Assim, trata-se de um método em que o pesquisador, de certa forma, automatiza a seleção das variáveis em sua especificação de modelo – em vez de proceder com a seleção manual, conhecida como seleção de subconjunto (“subset selection”). O LASSO é reconhecido universalmente como um dos métodos utilizados na área de aprendizado de máquinas (machine learning). Diz-se que o LASSO é uma das formas de de aprendizado supervisionado, ou seja, aquele em que um algoritmo trabalha sobre uma variável pré-definida de resposta que está contida nos dados – a variável dependente – e um objetivo específico – prever a variável dependente a partir de uma lista de variáveis independentes. Diz-se que os dados são “anotados” com as respostas, ou “rotulados” com as classes. De fato, para se proceder com uma estimação por LASSO, há que se primeiro especificar o regressando e todos os candidatos a regressores do modelo. Assumindo-se esparsidade, é possível, como veremos, interpretar que o modelo reduzido é mais eficaz em representar a realidade e fazer previsões. A abordagem de aprendizado supervisionado se distingue, por exemplo, do chamado “aprendizado nãosupervisionado”, em que as respostas ou rótulos nos dados não são previamente conhecidos ou disponíveis, e tudo o que se busca encontrar são padrões nos dados, ou seja, uma representação que produza alguma informação sintética dos mesmos, como por exemplo, uma em uma análise de agrupamentos (clusters). II. SELEÇÃO DE MODELOS E O PRINCÍPIO DA PARCIMÔNIA Segundo Burnham & Anderson (2004), uma frase famosa atribuída a Albert Einstein diz: “Tudo deve ser feito o mais simples possível, mas não mais simples.” (p. 30, livre tradução). Os autores argumentam que o sucesso na análise estatística de dados reais, e na inferência resultante dessa análise, muitas vezes depende da escolha do modelo de melhor aproximação aos dados. Modelos parcimoniosos deveriam ser perseguidos pelos pesquisadores, de forma a obter uma aproximação precisa da informação estrutural nos dados disponíveis, e que isso não deveria ser visto como uma busca pelo “modelo verdadeiro”. Akaike (1974) sugere que a modelagem e a seleção de modelos estão essencialmente relacionadas à “arte da aproximação”, que é “um elemento básico da atividade intelectual humana” (Akaike 1974, p. 716). Perguntam Burnham & Anderson (2004) “Se o ajuste é melhorado por um modelo com mais parâmetros, onde devemos parar?”. Em outras palavras, existe uma regra de parada na inserção de mais variáveis em um modelo? Trata-se de uma questão clássica, constatada na medida em que se descobriu que estatísticas de ajuste como o R2 em geral aumentam com o número de variáveis adicionadas aos modelos – o que gera uma consequência não desejada de incentivo à inserção de complexidade desnecessária pelos pesquisadores. O chamado “Princípio da Parcimônia” advém de Box e Jenkins (1970), que sugere que a tarefa de especificação deveria levar a um modelo com “(...) o menor número possível de parâmetros para representação adequada dos dados.” (p. 17). Segundo Burnham & Anderson (2004), os estatísticos enxergar o princípio da parcimônia como um balanceamento (trade-off) entre viés e variância. Viés seria o quão distante nosso modelo prevê os dados utilizados na estimação – dados amostrais, in-sample predictions – quando obtidas muitas amostras. Variância seria o quanto nosso modelo erra nas previsões, na medida em que usamos dados fora da amostra (out-of-sample predictions). A Figura 1 ilustra esse trade-off, problema esse que, de certa forma, está presente 1 Note que o LASSO requer um procedimento prévio de padronização das variáveis, ou seja, transformação de maneira a obter média igual a zero e desvio padrão igual a 1. CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 3 em todos os métodos de seleção de modelo. Dizem os autores, que, em geral, o viés diminui (curva vermelha) e a variância das previsões fora da amostra aumenta (curva azul), na medida em que a complexidade do modelo, medida por sua dimensão (número de parâmetros 𝑝) aumenta. Frequentemente, podemos usar o número de parâmetros em um modelo como uma medida do grau de estrutura exigido dos dados. Modelos parcimoniosos alcançam um balanço adequado entre viés e variância, localizando um modelo de complexidade ideal, ótima, ditado pelo ponto de mínimo da curva de erro total, em preto. Um nível de complexidades abaixo do ideal gera o subajuste (underfitting), enquanto que um nível acima gera o sobreajuste (overfitting). Figura 1 – Tradeoff entre Viés e Variância (Burnham & Anderson, 2004, p. 31 e ethen8181.github.io/machine-learning/regularization/regularization.html) III. A MALDIÇÃO DA DIMENSIONALIDADE Segundo Giraud (2014), conjuntos de dados estatísticos estão crescendo rapidamente em muitos domínios devido ao desenvolvimento de avanços tecnológicos que ajudam a coletar dados com um grande número de variáveis para melhor compreender um determinado fenômeno de interesse. Uma das principais características dos dados modernos é que eles geralmente são obtidos a partir de coletas simultâneas de milhares a milhões de informações em cada objeto ou indivíduo. Esses dados são considerados de “alta dimensão”, e que também induzem o uso de modelos de “alta dimensão”. Temos um problema de estimação em alta dimensão quando o número de preditores (dimensões) 𝑝 é grande - Ahrens, Hansen & Schaffer (2020). Em casos extremos, e cada vez mais observados em muitas áreas do conhecimento, o pesquisador se defronta com dados altamente dimensionais em que 𝑝 é de magnitude comparável, ou até mesmo muito maior que o tamanho da amostra 𝑛 – Liu, Xu & Li (2020) –, caso este em que a estimação por Mínimos Quadrados Ordinários (OLS) é inviabilizada pela simples falta de graus de liberdade no procedimento para se estimar o modelo completo. Temos assim, pelo menos duas formas de enquadrar a alta dimensão dos dados: uma absoluta (𝑝 grande) e outra relativa (𝑝 grande quando comparado a 𝑛, em geral maior que este). Há também o caso extremo em que a maldição da dimensionalidade é aguda, com o número de variáveis explicativas é muito maior do que o número de pontos de dados (𝑝≫𝑛, caso denominado de “short, fat data problem”, vide Clarke & Chu, 2014). Denotaremos os modelos (ou dados) de alta dimensão com a sigla “HD”, a partir de sua classificação absoluta, ou seja, independente de estarmos ou não em uma situação de falta de graus de liberdade suficientes para a estimação de parâmetros. O matemático norte-americano Richard E. Bellman cunhou a expressão “Maldição da Dimensionalidade” ao descrever o problema causado pelo aumento exponencial de volume associado à adição de dimensões extras a um espaço matemático, com implicações sobre o tempo computacional de métodos de solução numérica na área de programação dinâmica. Assim, na medida em que o número de dimensões aumenta, a quantidade de dados que um modelo necessita para propiciar generalizações dos fenômenos aumenta exponencialmente. E, adicionalmente, o valor adicionado por uma dimensão a mais inserida na resolução de um problema pode ser Número de Parâmetros CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 4 muito menor em comparação com a sobrecarga que ele adiciona ao modelo ou algoritmo que o irá analisar. A maldição da dimensionalidade em geral se refere a vários fenômenos que possivelmente surgem ao se analisar, e mesmo organizar, dados em espaços de alta dimensão. Sirimongkolkasem & Drikvandi (2019) argumentam que fenômenos dimensionalmente amaldiçoados ocorrem em domínios não apenas da análise numérica, mas também na amostragem, combinatória, aprendizado de máquina, mineração de dados e bancos de dados. Dizem os autores que o tema comum desse tipo de problema é que, para obter um resultado estatisticamente significante, sólido e confiável, a quantidade de dados necessária para suportar o resultado geralmente cresce exponencialmente com a dimensionalidade. III.1. EXEMPLO I: MICRODADOS DE QUESTIONÁRIOS JUNTO A PASSAGEIROS Para ilustrar um pouco a questão da dimensionalidade, suponha que tenhamos dados obtidos a partir de uma coleta de questionários (survey) junto a passageiros em um aeroporto. Trata-se de um exemplo baseado em questionários reais, aplicados nos últimos anos no Brasil – surveys da Fundação Instituto de Pesquisas Econômicas, FIPE, em 2009, e da Empresa de Planejamento e Logística S.A. EPL, em 2014. Em nosso exemplo fictício, foram obtidos 500 questionários em um dado dia, contendo as mais diversas informações socioeconômicas e comportamentais dos passageiros, com a finalidade de se estudar o seu comportamento de consumo de viagens aéreas. Dentre os atributos coletados, temos os listados a seguir. Para alguns deles, imagine que a informação é obtida complementando-se com uma consulta a fontes secundárias de dados – por exemplo, o passageiro em geral não saberia responder qual o tipo de aeronave que irá embarcar, mas essa informação pode ser obtida consultando-se posteriormente a aeronave utilizada em seu voo. Dados da viagem • Aeroporto da pesquisa • Segmento de Viagem • Tipo de voo • Par de aeroportos do voo Perna de voo • Hora do voo • Tipo da aeronave a ser utilizada Dados de perfil do passageiro • Par OD real • Nacionalidade • Gênero • Idade • Renda • Número de dependentes • Ocupação • Escolaridade • Quantas viagens por ano faz por avião? • Quantas viagens não urbanas/rotineiras faz por ano faz por outros modos de transporte? • Número de viagens domésticas nos últimos 12 meses • Número de viagens internacionais nos últimos 12 meses • Realizou viagens por outro modo de transporte neste trecho de viagem? Dados econômicos da compra efetuada • Companhia aérea/par de aeroportos/dia/hora escolhidos • Número de conexões de voo • Número de escalas de voo • Companhias aéreas/par de aeroportos/dia/hora ofertados nesse mercado • Pesquisou passagem aérea em outros dias ou outros aeroportos? CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 5 • Voo codeshare ou de parceria? • Preço da passagem • Tem programa de milhagem nessa companhia aérea? • Tem programa de milhagem em outras companhias aéreas? • Comprou usando milhas? • Quantas milhas gastou? • Despachou bagagem? • Valor da taxa de despacho de bagagem • Valor da taxa de remarcação • Outras taxas pagas • Dias de antecedência da compra da passagem • Quem pagou a passagem aérea? Dados comportamentais • Tempo de trajeto terrestre até o aeroporto de origem • Tempo de trajeto terrestre a partir do aeroporto de destino • Tempo de permanência no aeroporto • Tipo de check-in • Modo de acesso ao aeroporto de origem • Modo de acesso a partir do aeroporto de destino • Motivo da viagem • Comprou algo no aeroporto? • Total de gastos no aeroporto Ao observar o conjunto de dados coletados dessa nossa pesquisa fictícia junto a cada um dos 500 entrevistados, podemos chegar rapidamente à conclusão de que muito mais de 500 variáveis podem ser construídas a partir dessas informações. Por exemplo, só de categorias de dados de perfil (gênero, ocupação, etc.), poderíamos chegar a umas dezenas de dummies, aplicando o chamado “one-hot encoding” – ou seja, a transformação de cada categoria em variáveis binárias distintas (colunas da matriz de dados), contendo o valor “1” caso o indivíduo pertença àquela categoria, e “0”, caso não pertença. Suponha que, apenas considerando as variáveis de perfil, obtivéssemos 50 dummies. Já as categorias temporais, como dias de antecedência de compra, e hora do voo, poderiam ser representadas por, digamos, 120 dummies de dias de antecedência e 24 dummies de hora de partida do voo – ou, a depender da modelagem, 24 × 7 = 168 dummies, para contar a semana cheia. Se considerarmos o one-hot encoding para cada par de aeroportos ou cidades, poderíamos ter centenas deles, a depender da amostragem. Digamos que fossem 150 os pares de aeroporto de origem - aeroporto de destino do passageiro, 250 pares de cidade efetiva (real) de origem - cidade efetiva (real) de destino do passageiro e mais uns 50 pares de aeroporto de origem-destino do voo. Temos que, somente com essas dummies geradas, chegaríamos a 788 dimensões, o que inviabilizaria a estimação por Mínimos Quadrados Ordinários. Temos configurado um problema de alta dimensionalidade. Uma nota importante diz respeito à “armadilha da variável dummy” (dummy variable trap). É classicamente conhecido que o uso de dummies para todas as categorias de uma variável qualitativa gera problemas de inversibilidade da matriz no estimador de Mínimos Quadrados. Por exemplo, em uma regressão com intercepto, se incluirmos uma dummy de sexo feminino e outra de sexo masculino, representativos da variável “gênero” com duas categorias coletadas, teremos a impossibilidade da obtenção das estimativas por conta da colinearidade perfeita entre essas variáveis. Esse certamente também é o caso do exemplo dado acima, da survey fictícia junto a passageiros. Para cada variável categórica, uma categoria terá que ser deixada como “caso de referência” ou “caso base”, ou seja, não será reportado e forçará que cada um dos coeficientes das demais categorias sejam interpretados relativamente a ele. Esse é um problema distinto do problema da alta dimensionalidade reportado acima, mas igualmente gera a impossibilidade da estimação por mínimos quadrados. Entretanto, como veremos, alguns estimadores de regularização, como o LASSO, lidam normalmente com variáveis perfeitamente colineares – na verdade, dropam uma (ou mais) delas CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 6 automaticamente –, não sendo necessário informar uma categoria de referência quando da inicialização da rotina. III.2. EXEMPLO II: DADOS AGREGADOS DE DEMANDA POR VIAGENS Ainda para ilustrar a questão da dimensionalidade em dados do transporte aéreo, suponha algumas situações de agregação de dados em um estudo de demanda por viagens aéreas no Brasil. Primeiramente, considere dados agregados ao nível nacional. Essa é a antítese do caso dos microdados de passageiros, vistos no Exemplo I. Um estudo estudo econométrico com esse tipo de dados agregados poderia conter o número de passageiros voados (ou o total de passageiros-quilômetros transportados) como regressando, rodado contra fatores como a renda média brasileira, o preço (ou yield) médio das empresas aéreas, e talvez um conjunto de alguns outros controles, como variáveis dummies representativa de eventos exógenos, dentre outros. Em suma, teríamos um modelo com poucos dados, mas também com poucos regressores. Continuando no exemplo da demanda por viagens aéreas, suponha agora que temos dados agregados ao nível do par de cidades. Um estudo de demanda ao nível do par de cidades iria requerer a observabilidade, no mínimo, da renda média na origem e destino dos mercados servidos – ou alguma média desses valores –, e o preço médio das passagens aéreas nesses mercados, mas também a distância entre origem e destino. Diversos outros fatores específicos das rotas poderiam ser considerados, como outras características relevantes das cidades envolvidas – desemprego, desigualdade de renda, número de frequências de voo, congestionamento dos aeroportos envolvidos, etc. – o que poderia levar o estudo a ter um conjunto mais amplo de regressores. Se fosse um painel de dados – pares de cidades observadas ao longo do tempo –, dummies (ou efeitos fixos) de pares de cidade e de períodos poderiam ser utilizados, dentre outras possibilidades. Se o nível de agregação fosse o par de aeroportos, em vez do par de cidades, seria fundamental ter o controle de variáveis indicativas da concorrência aeroportuária, ou seja, do quanto as condições de preço e outros atributos de um par de aeroportos poderia influenciar a demanda de outro par de aeroportos dentro de uma mesma região de múltiplos aeroportos. Esses controles levariam a um aumento adicional na sobrecarga da dimensionalidade dos modelos. Por fim, para fins de comparação com o Exemplo I, imagine a nossa survey fictícia, ou seja, que tivéssemos o luxo de poder de coletar microdados de passageiros. A pesquisa junto a passageiros em aeroportos aplica um questionário diversas de questões do perfil, atitude e hábitos de consumos dos entrevistados, que proporciona um verdadeiro “zoom in” da observabilidade, uma análise microscópica da realidade de cada passageiro, em vez de uma agregação onde toda essa informação extremamente relevante é perdida. Para realizar um estudo de demanda nesse nível de desagregação, teríamos que desenvolver um problema de escolha discreta – probit, logit, e suas vertentes mais modernas –, onde todas as alternativas de consumo à disposição do passageiro deveriam ser controladas – outras ofertas da mesma companhia aérea naquele par de aeroportos e em pares de aeroportos adjacentes, e outras ofertas das demais companhias aéreas naquele mercado de viagens. Assim, adicionalmente às características socioeconômicas e comportamentais, o banco de dados da pesquisa deveria conter todas as informações do ambiente competitivo específico de cada situação de consumo. Podemos observar, com a ilustração do problema de estimação da demanda por viagens, que, alterando o nível de agregação dos dados, a dimensionalidade necessariamente irá aumentar – de um banco de dados com poucas variáveis, pode-se chegar a estudos com centenas e mesmo milhares delas – o que requer um conjunto de dados mais amplo. O incremento da dimensionalidade traz consigo o aumento da complexidade inerente ao fenômeno, quando observado em alto nível de desagregação, o individual – um problema estudado pela microeconometria. Em nosso exemplo, o problema da dimensionalidade não chega a inviabilizar a estimação tradicional, dado que o número de dimensões requeridas cresce menos rapidamente do que o número de dados obtidos para estudo. Ou seja, com um aumento das amostras, é possível prosseguir com o desenvolvimento de modelos econométricos. Em algumas áreas do conhecimento, entretanto, essa problemática pode, efetivamente, se transformar em uma maldição da dimensionalidade, com a necessidade de dados crescendo exponencialmente com o número de dimensões adicionais inseridas. Por outro lado, a existência de muitas dimensões em um modelo econométrico em qualquer área pode gerar problemas importantes de estimação, como multicolinearidade, interpretabilidade e sobreajuste. CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 7 IV. CONSEQUÊNCIAS DA ALTA DIMENSIONALIDADE Banks (2019) apresenta três descrições aproximadamente equivalentes da “maldição da dimensionalidade”: 1. para o tamanho amostral 𝑛 fixo, na medida em que 𝑝 aumenta, os dados se tornam esparsos; 2. na medida em que 𝑝 aumenta, o número de modelos possíveis explode; 3. para um 𝑝 alto, a maioria das bases de dados se torna multicolinear. Comecemos com o último ponto destacado por Banks (2019). Um dos efeitos prováveis da estimação de modelos HD – e mesmo em situações em que o número de parâmetros não é tão elevado em relação ao tamanho da amostra –, é a geração, ou agravamento, do problema de multicolinearidade. Multicolinearidade é a situação em que duas ou mais variáveis preditoras em um modelo estatístico estão linearmente relacionadas – Gujarati & Porter (2011) e Wooldridge (2016). Em um caso extremos de multicolinearidade, teríamos a chamada “colinearidade perfeita” entre regressores. Suponha o caso em uma regressão linear de 𝑌 em 𝑋1 e 𝑋2, onde 𝛽0 é o intercepto, 𝛽1 e 𝛽2 são parâmetros de inclinação, e 𝜀 é o erro aleatório. Suponha uma colinearidade perfeita simples, em que 𝑋1=𝑋2. Nesse caso, poderíamos ter, equivalentemente: 𝑌=𝛽0+𝛽1𝑋1+𝛽2𝑋2+𝜀, (1) ou 𝑌=𝛽0+(𝛽1+𝛽2)𝑋1+0𝑋2+𝜀, (2) ou 𝑌=𝛽0+0𝑋1+(𝛽1+𝛽2)𝑋2+𝜀, (3) ou 𝑌=𝛽0+(𝛽1+𝑘)𝑋1+(𝛽2−𝑘)𝑋2+𝜀. (4) Ou seja, qualquer soma de 𝛽1 e 𝛽2 poderia ser “encontrada” pelo estimador em uma solução, inclusive com termos compensados entre parâmetros usando uma constante 𝑘. Nesse último caso, poderia ocorrer de haver troca de sinal, sendo esse efeito compensado no outro coeficiente, que ficaria “inflado” em termos absolutos. Essa possibilidade gera o que os manuais de econometria se referem a uma “instabilidade” dos parâmetros devido à multicolinearidade. Pode haver, assim, a estimação de coeficientes com valores absolutos altos, sendo que o valor de um compensa o valor do outro. Em nosso caso acima de colinearidade perfeita, não será possível estimar os coeficientes por OLS. Entretanto, em um caso onde a colinearidade entre regressores é alta, mas não perfeita, fenômenos similares podem ocorrer, prejudicando a inferência estatística. Assim, a vigência de multicolinearidade alta em uma amostra de dados pode resultar em um aumento da variância dos coeficientes de regressão, o que gera uma estimativa instável dos valores dos parâmetros. Nesse caso, a instabilidade dos parâmetros se manifesta em algumas situações: 1. os coeficientes às vezes parecem ser coeficientes insignificantes, mas na realidade são relações significativas entre um coeficiente preditor com o coeficiente de resposta – risco de falso negativo por aumento da variância estimada do coeficiente, com identificação errônea de preditores relevantes; 2. os valores dos coeficientes dos regressores podem variar bastante de uma amostra para outra – quando se obtém uma nova amostra, ou mesmo quando se efetua pequenas alterações nos dados, como o experimento de descarte de algumas observações; 3. a remoção de um termo afeta bastante o valor absoluto dos demais regressores. Em suma, em um modelo econométrico, a multicolinearidade severa torna-se um problema porque ela pode aumentar a variância das estimativas dos coeficientes e tornar as estimativas muito sensíveis a pequenas alterações no modelo. O resultado pode ser que as estimativas dos coeficientes serão instáveis e difíceis de interpretar. Em alguns casos, como vimos, dois ou mais coeficientes são estimados com valores altos com sinais opostos que se compensam e se um deles for descartado, um grande impacto é ocasionado no(s) outros(s). A multicolinearidade mina o poder estatístico da análise, podendo fazer com que os coeficientes mudem de sinal, tornando mais difícil especificar o modelo correto e menos confiável o modelo final escolhido. CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 8 O uso de dados HD pode não apenas levar à identificação errônea de preditores relevantes dentro de uma regressão por conta da multicolinearidade, mas também pode impactar a capacidade do modelo de extrapolar além do intervalo da amostra com a qual foi construído – isto é, aumenta o risco do chamado “sobreajuste” (overfitting). Em estatística, o sobreajuste ocorre quando um modelo consegue efetuar previsões que são muito próximas aos valores observados de um determinado conjunto de dados utilizados para a estimação do modelo – ou seja, produz excelentes previsões dentro da amostra –, mas que perde desempenho em previsões utilizando dados adicionais ou observações futuras – ou seja, produz previsões fora da amostra consideradas piores ou abaixo do esperado. Em geral um modelo que padece de sobreajuste contém mais parâmetros do que pode ser justificado pelos dados e, assim, temos que esse tipo de problemática é mais comum de emergir com dados HD. Segundo Burnham & Anderson (2004), no cerne do problema do sobreajuste está o uso de muitas variáveis irrelevantes, que acabam captando, sem o pesquisador saber, um efeito espúrio contido nos resíduos, apresentando esse efeito nos resultados como se essa variação representasse a estrutura do modelo subjacente aos dados. Na existência de dados HD, é relativamente fácil para o pesquisador incorrer no problema do sobreajuste. Segundo Tibshirani (1996), existem duas razões pelas quais o analista de dados geralmente não fica satisfeito com as estimativas OLS. A primeira é a precisão da previsão: as estimativas OLS geralmente têm baixo viés, mas grande variância – ou seja, erram muito facilmente as previsões fora da amostra. O autor explica que a precisão da previsão pode, às vezes, ser melhorada reduzindo ou definindo como 0 alguns coeficientes – o procedimento do LASSO que ele propõe no artigo. “Ao fazer isso, sacrificamos o modelo com um pouco de viés para reduzir a variância dos valores previstos e, portanto, podemos melhorar a precisão geral da previsão” - Tibshirani (1996, p. 267, livre tradução). A segunda razão dos analistas não ficarem satisfeitos com o OLS, segundo Tibshirani (1996) é a interpretação dos modelos. “Com um grande número de preditores, muitas vezes gostaríamos de determinar um subconjunto menor que exibe [apenas] os efeitos mais fortes” (1996, p. 267, livre tradução). De fato, como vimos ao discutir multicolinearidade, a especificação de muitas variáveis em um modelo pode aumentar o risco que algumas delas tenham correlação linear entre si, o que torna mais complexo de interpretar o efeito isolado – chamado de “efeito ceteris paribus” – de cada uma delas. Temos configurado mais um desafio para os pesquisadores que trabalham com dados e modelos de alta dimensão. Para concluir, temos que o uso de dados HD configura um conjunto de armadilhas para os pesquisadores da área. Em especial, a redundância informacional no uso de variáveis regressoras, que dá origem a problemas de multicolinearidade, sobreajuste e comprometem a interpretabilidade dos modelos. Idealmente, os modelos de regressão deveriam se valer de variáveis preditoras que correlacionam altamente com o regressando, mas se correlacionam no muito pouco entre si. Isso incrementa a qualidade da interpretação ceteris paribus dos coeficientes. Um modelo assim ideal é por vezes chamado de modelo com “baixo ruído” e será capaz de fazer previsões confiáveis em várias amostras de conjuntos de variáveis retiradas da mesma população estatística. O bioestatístico da Johns Hopkins Bloomberg School of Health Jeff Leek descreve o outro lado da moeda da maldição da dimensionalidade, conhecido como “bênção da dimensionalidade” (blessing of dimensionality): “Basicamente, uma vez que um número cada vez maior de medições é feito nas mesmas observações, há uma estrutura inerente a essas observações. Se você tirar vantagem dessa estrutura, conforme a dimensionalidade do seu problema aumenta, você obtém melhores estimativas da estrutura em seus dados de alta dimensão - uma bela bênção!” (Leek, 2015). Ilustra o ponto partir de uma ilustração: “Como exemplo, suponha que façamos medições em 10 pessoas. Começamos fazendo uma medida (pressão arterial), depois outra (altura), depois outra (cor do cabelo) e continuamos indo e indo até termos um milhão de medidas nessas mesmas 10 pessoas. A bênção ocorre porque as medições dessas 10 pessoas estarão todas relacionadas entre si. Se 5 das pessoas forem mulheres e 5 ou homens, então qualquer medida que tenha uma relação com sexo estará altamente correlacionada com qualquer outra medida que tenha uma relação com sexo. Portanto, conhecendo um pequeno pedaço de informação, você pode aprender muito sobre muitas das diferentes medições” (Leek, 2015). A bênção da dimensionalidade nos permite discorrer sobre as vantagens de se possuir dados HD: tendo em mãos um conjunto mais completo de controles para fenômenos observáveis e não observáveis. Sabendo da existência de “nuisance variables” (“variáveis de incômodo”) – ou seja, fatores latentes subjacentes ao problema investigado, mas que são “indesejados” no sentido de não serem de interesse para o pesquisador em um determinado estudo, e que em que podem ser, ou em geral são, correlacionados com a(s) variável(is) independente(s) hipotética de interesse em seu estudo. Essas variáveis de incômodo podem, por exemplo, ser características não-observáveis dos indivíduos de um painel ou cross-section participantes em estudo, ou qualquer influência não intencional do pesquisador, em uma manipulação experimental (Salkind, 2010), ou dos indivíduos sob análise, ou mesmo de fatores outros não antecipados. Haig (1992) descreve que essas são CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 9 “variáveis terceiras” (pois interferem na relação entre X e Y) e que são denominadas de “nuisance” na medida em que são controladas estatisticamente de alguma forma no estudo, de maneira a permitir a inferência de causalidade das variáveis de interesse. Quando o controle estatístico de variáveis terceiras não é realizado, ou é efetuado de maneira insatisfatório, em geral encontra-se na literatura a denominação de “confounding variable” (variável de confusão de efeitos) para essas variáveis – variáveis latentes que, ao falhar em controlar, prejudicam a validade interna de um experimento e/ou as análises de relação de causalidade e impossibilitando inferências ceteris paribus (efeitos isolados de uma variável). De posse de dados HD, as possibilidades de controles de efeitos não observáveis aumenta consideravelmente, por meio de dummies de clusters de indivíduos semelhantes, efeitos fixos de indivíduos em uma estrutura de painel de dados, efeitos temporais, ou outras formas de controle que são específicas de cada caso. O número de controles utilizados pode ser elevado, a depender da complexidade do fenômeno, mas pelo fato de haver a possibilidade de serem incluídos no estudo e permitirem o controle das variáveis terceiras, melhoram qualitativamente as inferências estatísticas – o que é uma das vertentes da bênção da dimensionalidade. Um ponto adicional que reforça a relevância dos controles HD é a possibilidade de traçar um paralelo entre o tratamento de fatores não observáveis e o propósito do teste RESET de Ramsey, tradicionalmente utilizado em econometria. Enquanto o primeiro busca incorporar diretamente múltiplos controles que representem heterogeneidades observáveis e não observáveis, o segundo avalia indiretamente se tais fatores latentes ou não linearidades permanecem não controlados no modelo. O teste RESET, ao introduzir potências dos valores ajustados para verificar se ainda há explicação adicional da variável dependente, sinaliza possíveis omissões de variáveis ou formas funcionais inadequadas, muitas vezes associadas a efeitos de variáveis não observadas. Já a ampliação dimensional com efeitos fixos, dummies de grupos ou controles temporais fornece mecanismos empíricos para capturar essas complexidades estruturais e reduzir o viés por variáveis omitidas. Em síntese, o teste RESET aponta a insuficiência de controle sobre não linearidades e fatores latentes, ao passo que os dados HD representam a via prática para superá-la. V. PRINCÍPIO DA ESPARSIDADE Uma forma de lidar com dados HD seria a chamada “seleção de subconjunto” (subset selection), conforme discute Tibshirani (1996). A seleção de subconjunto refere-se à tarefa de encontrar um pequeno subconjunto das variáveis independentes disponíveis a partir de buscas exaustivas e visando atender a algum critério préselecionado. Uma das formas de seleção de subconjunto é a stepwise regression, tipo de regressão “passo-apasso” muito criticada, seja em sua forma automática – usando algoritmo – ou em sua forma manual – experimentação de modelos feita corriqueiramente pelos pesquisadores – no senso comum, o chamado “tira e põe” de variáveis. Modernamente, já é bastante conhecida a impropriedade de comportamentos de especificação ad-hoc de modelos denominados como “data fishing” ou “p-hacking” – quando se faz uso indevido da análise de dados para encontrar padrões em dados que podem ser apresentados como estatisticamente significativos, aumentando e subestimando dramaticamente o risco de falsos positivos e também relatando apenas aqueles que apresentam resultados significativos. Em relação a procedimentos automáticos, conforme observa Smith (2018), em um artigo com trocadilhos denominado “Step away from stepwise” (“Afaste-se do passo-a-passo”), um problema fundamental da regressão stepwise é que alguma variável explicativa real que tem efeitos causais na variável dependente pode não ser estatisticamente significativa, enquanto uma variável não observada e sem interesse direto na análise pode ser coincidentemente significativa. Como resultado, o modelo pode se ajustar bem aos dados dentro da amostra, mas se sair mal fora da amostra. Tibshirani (1996) destaca que a seleção de subconjuntos pode até fornecer modelos interpretáveis, mas também pode ser extremamente variável porque é um processo discreto - os regressores são ou retidos ou eliminados do modelo. Diz o autor que “Pequenas alterações nos dados podem resultar na seleção de modelos muito diferentes e isso pode reduzir a precisão da previsão”. Um artifício comumente utilizado por esse tipo de abordagem que busca que lidar com dados HD é o princípio ou pressuposto de “esparsidade” (sparsity) dos modelos. Esparsidade é o equivalente da ideia do senso comum em que “menos é mais”. Mais formalmente, pode-se dizer que esparsidade se refere ao fenômeno de que “uma estrutura de dados subjacente pode ser explicada principalmente por poucos de muitos recursos” – Sirimongkolkasem & Drikvandi (2019). Por exemplo, se temos um conjunto elevado de variáveis potencialmente explicativas de um determinado regressando, ao utilizar o pressuposto de esparsidade estamos assumindo que apenas um subconjunto reduzido desses regressores realmente pode ajudar na predição do modelo. De uma maneira mais estrita, poderíamos assumir que a esparsidade também CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 16 Com a ideia de um PGD em situações de dados HD, torna-se interessante deixar claro os tipos de variáveis que estamos trabalhando. Essa tarefa de “rotulação de regressores” em diferentes tipos não é imprescindível, mas colabora na melhor compreensão das possibilidades dos estimadores e rotinas computacionais disponíveis para a redução da dimensionalidade dos modelos. Utilizaremos alguns desses rótulos, listados a seguir, incorrendo no risco de abusar da ideia. VII.1. QUANTO À PARTICIPAÇÃO EFETIVA NO PGD Essa distinção utiliza categorização aplicada na literatura dos estimadores por média de modelos (“Model Averaging”), advinda de Danilov & Magnus (2004): • variáveis “focais” (focus variables), que também podem ser chamadas de variáveis “de geração”: são variáveis que são sempre incluídas no modelo, pois devem provavelmente pertencer ao PGD por alguma razão teórica ou de outra esfera, como estudos anteriores e evidência anedótica – digamos que a grande maioria dos especialistas no fenômeno não teria dúvida quanto a esse pertencimento; Danilov & Magnus (2004) explicitamente dizem que são “variáveis explicativas que queremos no modelo (...) independentemente dos valores 𝑡 encontrados dos parâmetros 𝛽 (...)” (p. 29). Variáveis focais em princípio não devem penalizadas em procedimentos de regularização de parâmetros. • variáveis “auxiliares” (auxiliary variables), ou variáveis “de experimentação”, “de teste”: são variáveis explicativas adicionais às variáveis focais, e que se tem dúvida quanto à sua inclusão no modelo, ou seja, quanto ao seu pertencimento no PGD. Em geral interessa a inferência quanto a essa variável por se tratar de uma variável de interesse para o estudo, e um teste de hipótese da sua significância estatística é o que se procura primariamente realizar. Mas também podem ser variáveis utilizadas em experimentos de verificação de robustez de um modelo principal onde não estão contidas. Por princípio de conservadorismo da análise, variáveis de experimentação devem sempre ser expostas à penalização/seleção de modelos, no caso de procedimentos de regularização de parâmetros. Uma característica tanto de variáveis focais quanto auxiliares é que ambas tipicamente têm os seus coeficientes estimados reportados nas tabelas de resultados dos estudos. Em contraste, como veremos abaixo, existem variáveis “de incômodo” que tipicamente não temos interesse em interpretar seus coeficientes estimados, e, portanto, são omitidas das tabelas de resultados. Adicionalmente, ao conjunto união de variáveis focais e variáveis auxiliares denominamos “variáveis de baixa dimensão”, como também discutiremos na sequência. VII.2. QUANTO À FUNÇÃO E INTERPRETAÇÃO NO MODELO • variável “de interesse”, “de políticas”, “de tratamento”: esses regressores em geral são variáveis auxiliares (para testar se uma política ou tratamento de fato produziu efeitos), mas também podem ser variáveis focais – quando se tem certeza dos seus impactos, mas busca-se quantificar a intensidade de seus efeitos, ou mesmo analisar seu sinal. Importante enfatizar que, em um estudo de inferência de causalidade – isto é um estudo econométrico de interpretação de relações, e não de previsão –, a(s) variável (variáveis) de interesse são em geral regressoras, não se confundindo com os regressandos, que são as variáveis nas quais desejamos decompor os efeitos por meio da regressão. • variáveis “terceiras” ou “fatores de confusão” (confounding factors): são fatores não observados, latentes, e subjacentes ao problema investigado – ou seja, integram o PGD –, e que em que podem ser, ou em geral são, correlacionados com a(s) variável(is) independente(s) de interesse. Podem ser, por exemplo, características invariantes no tempo não-mensuradas dos indivíduos de um painel ou cross-section de participantes em um estudo, ou qualquer influência não intencional do pesquisador, em uma manipulação experimental (Salkind, 2010), ou dos indivíduos sob análise, ou mesmo de fatores outros não antecipados. Haig (1992) descreve que essas são “variáveis terceiras”, pois interferem na relação de causalidade entre X e Y, mas que, por serem correlacionadas com X e Y, mas não observáveis, trazem ruído na estimação do efeito de X em Y. • controles ou “variáveis de incômodo” (nuisance variables): são variáveis dummy, proxies ou outros artifícios que o pesquisador insere na equação para endereçar a questão da existência de variáveis terceiras no PGD. São denominadas de “nuisance” (“de incômodo”) na medida em que devem ser CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 17 controladas estatisticamente de alguma forma no estudo, tão somente para viabilizar a inferência de causalidade das variáveis de interesse, sendo os seus parâmetros estimados (“nuisance parameters”, como em Basu, 2011) em geral de interpretação com pouco interesse direto ou mesmo prejudicada. Por isso tipicamente os coeficientes estimados dessas variáveis não são reportados nas tabelas de resultados dos estudos – ou seja, são omitidos nos artigos. Em geral, qualquer parâmetro que interfere na análise de outro, mas que a informação obtida diretamente dele é sem relevância direta para o problema, pode ser considerado um “parâmetro de incômodo” (Basu, 2011, p. 279). Uma variável também pode deixar de ser “nuisance” caso se torne objeto de estudo. Quando o controle estatístico de variáveis terceiras não é realizado, ou é efetuado de maneira insatisfatório, em geral encontra-se na literatura a denominação de “confounding variable” (variável de confusão de efeitos) para essas variáveis – variáveis latentes que, ao falhar em controlar, prejudicam a validade interna de um experimento e/ou as análises de relação de causalidade e impossibilitando inferências ceteris paribus (efeitos isolados de uma variável). VII.3. QUANTO À DIMENSIONALIDADE • variáveis de alta dimensão (high-dimension variables), também chamadas de “controles de alta dimensão”: o mesmo que “controles” ou “nuisance variables”, para o caso de um problema de alta dimensionalidade. De posse de dados HD, as possibilidades de controles de efeitos não observáveis aumenta consideravelmente, por meio de dummies de agrupamentos de indivíduos semelhantes, efeitos fixos de indivíduos em uma estrutura de painel de dados, efeitos temporais, ou outras formas de controle que são específicas de cada caso. O número de controles utilizados pode ser elevado, a depender da complexidade do fenômeno – e por isso surge a necessidade de regularização –, mas pelo fato de haver a possibilidade de serem incluídos no estudo e permitirem o controle das variáveis terceiras, melhoram qualitativamente as inferências estatísticas – o que é uma das vertentes da “bênção da dimensionalidade”. • variáveis de baixa dimensão (low-dimension variables): no caso de um problema de alta dimensionalidade, toda variável que não se enquadra como variável de incômodo (“nuisance”) é uma variável de “baixa dimensão”, podendo ser focal ou auxiliar. Assim ao conjunto união de variáveis focais e variáveis auxiliares, em geral estamos nos referindo ao conjunto completo de “variáveis de baixa dimensão”. Em suma, essas são variáveis de especificação do modelo, e que cuja estimação será beneficiada com a inclusão dos controles HD. VII.4. QUANTO À REGULARIZAÇÃO • variáveis penalizadas: variáveis cujo coeficiente está sujeito ao procedimento de encolhimento pela imposição da restrição de regularização. • variáveis não penalizadas: em alguns arcabouços empíricos, o pesquisador pode configurar o problema de modo a selecionar apenas um subconjunto das variáveis existentes para sofrerem a penalização da regularização. Cria-se, assim, subconjuntos das “variáveis penalizadas” e “variáveis não penalizadas”. VII.5. QUANTO À INCLUSÃO NO CONJUNTO ATIVO DO LASSO • variáveis ativas: variáveis mantidas no “conjunto ativo” de variáveis – ou seja, as variáveis penalizadas cujo coeficiente estimado é não nulo após a regularização. Inclui também as variáveis que foram não penalizadas, seja por decisão do pesquisador, ou por necessidade do modelo – por exemplo, as variáveis endógenas em um procedimento IV-LASSO são sempre ativas, como veremos mais adiante. • variáveis inativadas: No âmbito do LASSO, algumas das variáveis penalizadas podem ser inativadas, ou seja, ter seu coeficiente reduzido ao valor zero, sendo, assim, equivalente a dizer que foram variáveis “não selecionadas” pelo LASSO. Assim, temos o resultado adicional da regressão penalizada realizada pelo LASSO, onde apenas um subconjunto dos coeficientes originais mantémse não nulo – apesar de com valores absolutos inferiores –, enquanto os demais tornam-se nulos. A CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 18 “seleção”, nesse caso, se dá por inativação (anulação) de um conjunto de coeficientes, de forma que as respectivas variáveis são consideradas fora do modelo final, selecionado. A inativação é também conhecida como “exclusão do conjunto ativo”, ou “dispensa da variável” (Tibshirani, 2013, p. 1481); consistente com a terminologia de “conjunto ativo” de Ahrens, Hansen & Schaffer (2020), a inativação significa que a variável, embora inicialmente pertencente ao conjunto de regressores sob consideração, não mais pertence ao modelo final, por ter tido o seu coeficiente zerado no processo de penalização realizado pelo LASSO. No procedimento de regularização, todos os coeficientes são penalizados de forma a encolher. Entretanto, alguns deles permanecem no conjunto ativo (“variáveis ativas”), enquanto que uma grande parte deles é inativada (“variáveis inativas”), produzindo-se uma solução esparsa – isto é, com vários coeficientes zerados. Penalização não implica necessariamente em inativação. Terem sido inativadas não significa que apenas essas variáveis foram “penalizadas”. Outro ponto a se enfatizar é que, como veremos mais adiante, no conceito do PDS-LASSO algumas das variáveis – penalizadas ou não penalizadas – podem ter seu resultado de estimação pós-dupla seleção sendo não estatisticamente significantes, o que não implica em dizer que foram penalizadas; a rejeição no teste de hipóteses desenvolvido na pós-seleção não significa penalização – procedimento esse feito antes desse passo. VIII. PROCEDIMENTOS DE ESTIMAÇÃO PÓS-LASSO Os procedimentos de estimação pós-LASSO aqui apresentados têm por objetivo oferecer métodos robustos para inferência sobre o efeito de uma variável de efeito de tratamento (genericamente, uma variável de interesse do estudo) na presença de muitos regressores em um modelo com resíduos possivelmente não gaussianos e heteroscedásticos. Nessa análise, os autores permitem que o número de regressores seja maior do que o tamanho da amostra – modelo de alta dimensionalidade (HD). Para tornar a inferência informativa viável, assumem que o modelo seja aproximadamente esparso – o princípio da esparsidade; isso, segundo os autores, é equivalente a possibilitar que o efeito dos fatores de confusão (variáveis terceiras, confounding factors) possa ser controlado com apenas um pequeno erro de aproximação, incluindo um número relativamente pequeno dessas variáveis cujas identidades são desconhecidas – isto é, não observadas. Explicam os autores que a possibilidade de controlar essas variáveis dessa maneira torna possível a estimação do efeito do tratamento (variável de interesse) selecionando aproximadamente o conjunto correto de regressores. No que se segue, discutiremos esses procedimentos com mais detalhe. Na área de aplicações em LASSO em problemas econômicos, um conjunto de autores norte-americanos produziu uma sequência de publicações de artigos científicos sobre o tema ao longo dos anos 2010. Em particular, na área de estimação pós-lasso, destacamos os autores: • Alexandre Belloni (Duke University); • Christian B. Hansen (University of Chicago); e • Victor Chernozhukov (MIT). Os estudos desses autores focam no procedimento de regularização por Lasso, utilizando metodologias que visam manter sua vantagem principal, referente à redução da dimensionalidade com seleção de modelos, mas reduzir o viés inerente a esse procedimento – problema que levanta preocupações quanto à qualidade da inferência estatística de causalidade permitida pelos modelos. Destaca-se, como textos de embasamento teórico na área, os seguintes artigos: • Pós-Dupla Seleção por Lasso (Post-Double Selection, denotado como “PDS-LASSO” nas rotinas do lassopack, um pacote de regressão regularizada desenvolvido para o software Stata, usado para esse tipo de estimação). ▪ citação: Belloni, Chernozhukov e Hansen (2014a); ▪ artigo “Inference on treatment effects after selection among high-dimensional controls”. Iremos nos referir a esse artigo como “BCH14”; ▪ publicado na The Review of Economic Studies. • Pós-Regularização (Post-Regularization, que indicaremos como “PR-LASSO”, denotado como “Metodologia CHS” no lassopack). ▪ citação: Chernozhukov, Hansen e Spindler (2015); ▪ artigo “Post-selection and post-regularization inference in linear models with many controls and instruments”. Iremos nos referir a esse artigo como “CHS15”; CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 19 ▪ publicado na American Economic Review. • LASSO com Variáveis Instrumentais (Instrumental Variables LASSO, denotado como “IVLASSO” nas rotinas do lassopack). ▪ citação: Belloni, Chen, Chernozhukov & Hansen (2012); ▪ artigo “Sparse models and methods for optimal instruments with an application to eminent domain”. Iremos nos referir a esse artigo como “BCCH12”; ▪ publicado na Econometrica. Antes de prosseguirmos, vale uma nota: no presente trabalho, usamos as siglas BCH14, CHS15 e BCCH12 apenas para facilitar a menção aos estudos da área, dado que os autores foram profícuos em produzir artigos científicos publicados e não-publicados – o que pode ser confuso para acompanhar. Entretanto, essas siglas não são utilizadas na literatura da área, servindo apenas de finalidade didática na exposição dos trabalhos. VIII.1. ARCABOUÇO GERAL Para melhor descrever o problema, utilizaremos a estrutura geral apresentada em BCH14. Começando com a definição do tipo de modelo de regressão. BCH14 assumem um “modelo parcialmente linear” (partiallylinear model, PLM). Segundo Härdle, Liang & Gao (2012) “modelos parcialmente lineares” (PLM) são “modelos de regressão nos quais a resposta depende de algumas covariáveis linearmente, mas de outras covariáveis não parametricamente.” (abstract). Dizem os autores que os PLMs são modelos que generalizam as técnicas de regressão linear padrão. Os PLM são mais flexíveis que o modelo tradicional, dado que, sendo semiparamétricos – ou seja, contêm tanto componentes paramétricos quanto não paramétricos –, permitem que o fenômeno a ser modelado contenha relações não lineares com variáveis que não são observáveis, ou afetam o problema de uma forma funcional não observável ou não modeláveis da forma padrão. Assuma, por exemplo, o seguinte modelo parcialmente linear: 𝑦𝑖=𝛼𝑑𝑖+𝑔0(𝑥𝑖)+𝜀𝑖 (14) 𝑑𝑖=𝑚0(𝑥𝑖)+𝑢𝑖 (15) onde 𝑦𝑖 é a variável dependente, 𝑖 representa a 𝑖-ésima observação, 𝑑𝑖 é uma variável de interesse e 𝑥𝑖= (𝑥1,…,𝑥𝑝) é um vetor 𝑝-dimensional que engloba todos os controles, podendo ser de alta dimensão. 𝑔0(𝑥𝑖) é uma função dos controles e 𝜀𝑖 é o termo de erro aleatório. A grande questão relacionada ao PLM é que 𝑔0(𝑥𝑖) é uma função desconhecida, ou seja, uma parte do processo gerador dos dados de 𝑦𝑖 que o pesquisador tem que aproximar de alguma forma, por exemplo, com o uso de variáveis de controle. Importante observar que a componente de interesse em (14) não precisa ser necessariamente um escalar, tendo sido definido dessa forma apenas para simplificar a exposição. Ao contrário, pode haver uma especificação mais completa dessas variáveis de “baixa dimensão” – low dimension variables, variáveis indispensáveis que estariam em um modelo de baixa dimensão de qualquer forma. Com a presença da componente desconhecida de alta dimensão 𝑔0(𝑥𝑖), estimar os parâmetros da(s) variável (variáveis) de interesse torna-se o grande desafio. Deseja-se tecer inferências estatísticas sobre o efeito ceteris paribus de 𝑑 em 𝑦, sendo assim 𝛼 o coeficiente mais importante que procuramos estimar. A componente não-paramétrica 𝑔0(𝑥𝑖) modela como “fatores de confusão” (confounding factors) surgem no problema. Esses fatores de confusão são em geral fatores latentes, não observáveis, e que são possivelmente correlacionados com 𝑑𝑖. A segunda equação modela justamente a dependência da variável de interesse com relação aos controles, como em BCH14 e Chernozhukov et al (2018). Comentam Chernozhukov et al (2018), que “esta equação não é de interesse per se, mas é importante para caracterizar e remover o viés de regularização” (p. C2). Os fatores de confusão 𝑥𝑖 afetam tanto a variável de interesse 𝑑𝑖 por meio da função 𝑚0(𝑥𝑖) e a variável dependente principal 𝑦𝑖 por meio da função 𝑔0(𝑥𝑖). Definem os autores como espaço dos “parâmetros de incômodo” (nuisance parameters) sendo 𝜂0, igual a: 𝜂0=(𝑚0,𝑔0) (16) Ao utilizar controles, a proposta de um modelo em alta dimensão seria aproximar à função 𝑔0(𝑥𝑖) – e a função 𝑚0(𝑥𝑖) – por meio de um elevado conjunto de variáveis – nesse caso denominadas de “variáveis de CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 20 incômodo” (nuisance variable), que possibilitarão a estimativa de “parâmetros de incômodo” (nuisance parameters). A esse conjunto de parâmetros, soma-se os parâmetros da função 𝑚0(𝑥𝑖). Assim, no exemplo dado por BCH14 podemos perceber que, em uma regressão contendo uma variável interesse (ou mais delas), mas em um arcabouço marcado pela alta dimensionalidade, a existência de um conjunto alto de fatores não-observáveis a serem controlados nessa regressão torna o problema mais desafiador. Sendo eles correlacionados com a variável de interesse, temos um problema a ser endereçado pelo procedimento de estimação. Não controlar esses fatores na regressão principal geraria um grande problema de viés de variáveis omitidas, em particular por endogenia devido à correlação com esses fatores de confusão. A proposta de um modelo econométrico em alta dimensão que desejasse minimizar o problema de variáveis omitidas seria a de controlar esses fatores de confusão diversos tipos de controles. Dentre esses controles, podemos listar: • Efeitos fixos das unidades de painel, para controlar fatores específicos individuais que sejam invariantes ao tempo – procedimento clássico do estimador de efeitos fixos, em geral não sujeito a penalização por LASSO; • Efeitos temporais, para controlar fatores específicos de cada período de tempo de um painel ou dados agrupados, para controlar as mudanças coletivas das unidades do painel; • variáveis proxies para efeitos não observáveis de fenômenos mais complexos; • variáveis defasadas ou em diferenças, utilizando a dimensão temporal e/ou espacial; • variáveis de one-hot encoding (dummies) de categorias representativas das unidades de painel e seus possíveis agrupamentos; • termos de ordem superior e interações de todas as variáveis acima listadas. A estimação de parâmetros dessas diversas variáveis não seria de interesse direto do pesquisador - por isso são chamados de “nuisance parameters” -, mas um recurso para aproximar a uma função desconhecida, nãoparamétrica, e assim controlar efeitos não observáveis para viabilizar uma identificação consistente do efeito da variável de interesse. Por serem variáveis de alta dimensão, algum procedimento de redução da dimensionalidade deve ser aplicado aos controles utilizados, sendo que a proposta dos autores é o uso de modelos de Pós-Regularização/Seleção do tipo LASSO para se “procurar fatores de confusão” nos dados (BCH14, p. 639). VIII.2. PÓS-DUPLA SELEÇÃO POR LASSO (PDS-LASSO) Para a descrição do modelo de BCH14, usaremos tanto a discussão apresentada no próprio artigo, quanto a versão simplificada apresentada no site do lassopack 3 . Suponha o seguinte problema de estimação, equivalente a (14) e (15): 𝑦𝑖=𝛼𝑑𝑖+𝑥𝑖′𝛽+𝜀𝑖 (17) 𝑑𝑖=𝑥𝑖′𝛾+𝑢𝑖 (18) onde 𝑦𝑖 é a variável dependente, 𝑖 representa a 𝑖-ésima observação, 𝑑𝑖 é uma variável de interesse e 𝑥𝑖= (𝑥1,…,𝑥𝑝) é um vetor 𝑝-dimensional que engloba todos os controles de alta dimensão, 𝛽 e 𝛾 são vetores de parâmetros, e 𝜀𝑖 é o termo de erro aleatório. Novamente, por simplificação utiliza-se apenas uma variável de baixa dimensão – ou seja, uma variável além dos controles, nesse caso a variável de interesse –, o que não precisa ser o caso em aplicações práticas. Importante salientar que o pesquisador não observa/não conhece o conjunto verdadeiro, esparso, de controles e, por isso, têm que encarar o tradeoff viés-variância: usar poucos controles ou os controles errados e incorrer no viés de variáveis omitidas; ou usar muitos controles e incorrer em sobreajuste. Utilizar uma abordagem de estimação em alta-dimensão é relevante nesse caso, pois os controles 𝑥𝑖 permitem estimar adequadamente a complexidade do fenômeno subjacente aos dados. Assumindo esparsidade não observável, o pesquisador nesse caso pretende aproximar-se ao máximo da estimação do modelo verdadeiro, mas sem incorrer em variância desnecessária, produzindo modelos pouco generalizáveis. Com 3 Ver statalasso.github.io/docs/pdslasso_models. CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 21 base nesse desafio, a principal ideia relativa à abordagem de BCH14 é utilizar o modelo de regularização/seleção LASSO para selecionar quais controles 𝑥𝑖 efetivamente utilizar, e assim promover uma estimação consistente de 𝛼, que é o parâmetro da variável de interesse. Essa abordagem foi denominada de metodologia de “Pós-Dupla Seleção” por LASSO (PDS-LASSO). O algoritmo do PDS-LASSO utiliza três passos, sendo os dois primeiros de regularização/seleção e o último, uma regressão final. O algoritmo é o seguinte (BCH14, p. 610): • Passo I (Primeira Seleção de Modelos): estimar uma regressão LASSO contendo 𝑦𝑖 como a variável dependente e as variáveis de controle 𝑥𝑖 como regressores penalizados; • Passo II (Segunda Seleção de Modelos): estimar uma regressão LASSO contendo 𝑑𝑖 como a variável dependente e, novamente, as variáveis de controle 𝑥𝑖 como regressores penalizados; • Passo III (Estimação Final): rodar uma regressão linear contendo 𝑦𝑖 como a variável dependente, e, como regressores, 𝑑𝑖 e também a união do conjunto de variáveis 𝑥𝑖 selecionados nos Passos I e II. Note que a abordagem PDS-LASSO envolve selecionar, primeiramente, os controles que os dados mostram serem mais relacionados à variável principal 𝑦. Ou seja, temos o objetivo de redução do problema (e maldição) da dimensionalidade alta na regressão principal nesse primeiro passo – o que seria de se esperar de um procedimento de uma etapa utilizando LASSO, para encontrar o balanceamento ótimo do binômio viésvariância. Entretanto, a metodologia introduz um segundo passo, onde se busca encontrar os controles relevantes explicativos – ou simplesmente correlacionados – com a variável de interesse, 𝑑, também utilizando regularização. Esse segundo passo possui a interpretação de que a primeira regularização não seria suficiente para encontrar os fatores de confusão que permitiriam estimar de maneira consistente o efeito ceteris paribus da variável de interesse na equação principal (17). Assumindo em (18) que 𝑑 sofre de multicolinearidade com os controles de alta dimensão, pode ocorrer de que o primeiro procedimento não selecione alguns desses controles colineares com 𝑑. Na omissão desses controles colineares – os não selecionados pelo primeiro LASSO –, não teríamos garantida a inexistência de viés de variável omitida ao rodar a equação principal. A estimação, nesse caso, sofreria de problema de endogeneidade da variável 𝑑, causando problemas de inferência quanto à causalidade de sua relação com 𝑦. Sendo assim, o Passo II se faz necessário, onde são identificados, além de um conjunto de controles possivelmente já selecionado no Passo I, mas também um conjunto adicional que havia sido inativado, ou seja, regularizado até ficar nulo na primeira seleção de modelos por LASSO. Por fim, a regressão do Passo III possibilita a geração dos usuais resultados de Mínimos Quadrados – com ou sem outros procedimentos estatísticos possíveis, como controle de heteroscedasticidade, efeitos fixos, uso de variáveis instrumentais, etc. Esses resultados são produzidos com uso apenas do conjunto de controles selecionados nos dois passos anteriores – redução da dimensionalidade. Importante notar que o procedimento final (Passo III) permite a suavização do “viés de atenuação” incorrido pela inserção de viés que a regularização provoca, dado que retomamos uma estimação não penalizada em última instância. Adicionalmente, o procedimento tradicional produz a geração de erros padrões das estimativas e possibilita testes de hipóteses – o que não é possibilitado facilmente pela regressão regularizada. 4 Em termos mais formais, ao discutir as características de sua metodologia, BCH14 apresentam resultados teóricos a respeito das propriedades do estimador da variável de interesse resultante (𝑑𝑖). Pode-se listar essas características do PDS-LASSO da seguinte forma: • possibilita a seleção de variável imperfeita em qualquer uma das duas etapas de seleção; enfatizam que a principal característica atrativa do método proposto é que ele permite a seleção imperfeita dos controles; • permite que os erros sejam não-gaussianos e heteroscedásticos; • o estimador é “consistente raiz-𝑛” (root-𝑛 consistent, ou √𝑛-consistent), o que significa que, mesmo com a incerteza (e possível incorreta) parametrização da componente não-paramétrica do modelo 4 Hastie, Tibshirani & Friedman (2009), p. 12: “Os erros padrão para as estimativas de mínimos quadrados vêm das fórmulas usuais. Não existe uma fórmula tão simples para o LASSO (..)”. Os autores utilizam bootstrap para obter estimativas dos erros padrões. Goeman, Meijer & Chaturvedi (2018, p.18) discutem “É uma pergunta muito natural pedir erros padrão dos coeficientes de regressão ou outras quantidades estimadas. Em princípio, esses erros padrões podem ser facilmente calculados, e. usando o bootstrap.” e também “Quaisquer cálculos baseados em bootstrap podem apenas fornecer uma estimativa da variância das estimativas. Estimativas confiáveis de viés somente estão disponíveis se estimativas confiáveis não enviesadas estiverem disponíveis, o que normalmente não é o caso em situações em que estimativas penalizadas são utilizadas.” CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 22 parcialmente linear, a probabilidade de desvio do parâmetro estimado e o parâmetro verdadeiro (viés) obedece uma distribuição de probabilidades de ordem 𝑁−1/2, ou seja é função do inverso da raiz quadrada de N (tamanho da amostra), tendendo a zero na maioria das aproximações assintóticas (Robinson, 1988). • possibilita uma inferência estatística que é válida uniformemente – ou seja, fornece intervalos de confiança estáveis – em um número alto de classes de modelos; que “são válidos uniformemente em uma grande classe de modelos” (p .608). Em contraste, os estimadores de seleção pós-modelo padrão (de seleção única) falham em fornecer essa “inferência uniforme” e, dessa forma, os testes de hipótese não mantêm uma mesma distribuição de probabilidades assintótica ao longo do espaço de parâmetros, como por exemplo, uma mesma probabilidade assintótica de rejeição da hipótese nula, mesmo em casos simples com um número pequeno e fixo de controles. Aliás, argumentam que esse é o principal resultado teórico do artigo (p. 615, equação 2.10), onde demonstram que o estimador PDS obedece a uma distribuição assintótica que é Normal Padrão, ou seja ~𝑁(0,1), sob condições de esparsidade aproximadas, uniformemente dentro de um rico conjunto de processos geradores de dados estudados. • ainda acerca da inferência uniforme, ao realizar a seleção em dois passos – a “dupla seleção” – contribui-se com a redução do viés de variáveis omitidas, sendo assim possível realizar uma inferência de maior qualidade após a seleção do modelo. • atinge os limites de eficiência semiparamétrica em algumas condições. Newey (1990) define “limites de eficiência”, como a perda de eficiência que pode resultar de uma abordagem semiparamétrica, em vez de uma abordagem paramétrica, a ser utilizada em um estudo empírico. VIII.2.1. Exemplo empírico de PDS-LASSO (BCH14) BCH14 utilizam o estudo de Donohue III & Levitt (2001), sobre o efeito do aborto na criminalidade nos Estados Unidos, para motivar a metodologia PDS-LASSO. Reproduzimos abaixo trechos inteiros da discussão dessa ilustração (BCH14, p. 636-640), com a finalidade didática de exposição da abordagem. “O problema básico em estimar o impacto causal do aborto sobre o crime é que as taxas de aborto em nível estadual não são distribuídas aleatoriamente e parece provável que haverá (outros) fatores associados tanto às taxas de aborto quanto de criminalidade. É claro que qualquer associação entre a taxa de aborto atual e a taxa de crime atual provavelmente será espúria. No entanto, mesmo se olharmos para, digamos, a relação entre a taxa de aborto de 18 anos no passado e a taxa de criminalidade entre as pessoas atualmente com 18 anos, a falta de atribuição aleatória torna difícil estabelecer uma relação causal sem controles adequados. Um fator de confusão óbvio é a existência de diferenças persistentes de estado para estado em políticas, atitudes e dados demográficos que provavelmente estão relacionados ao aborto em nível estadual geral e às taxas de criminalidade. Também é importante controlar com flexibilidade as tendências agregadas. Por exemplo, pode ser o caso de que as taxas de criminalidade nacional tenham caído durante algum período, enquanto as taxas de aborto nacionais estavam aumentando, mas essas tendências foram impulsionadas por fatores completamente diferentes. Sem controlar essas tendências, seria errôneo associar a redução da criminalidade ao aumento do aborto. Além dessas diferenças gerais entre os estados federativos e períodos, há outras características que variam ao longo tempo, como renda em nível estadual, policiamento ou uso de drogas, para citar algumas que podem estar associadas ao crime atual e ao aborto anterior.” (BCH14, pp. 636-637, com grifos próprios e tradução livre). BCH14, em seu exemplo, utilizam o modelo de Donohue III e Levitt (2001), que estimam os determinantes das taxas de criminalidade em nível estadual nos Estados Unidos entre 1985 a 1997. Dizem os autores: “Para lidar com esses fatores de confusão, Donohue III e Levitt (2001) estimam um modelo para as taxas de crimes em nível estadual de 1985 a 1997, no qual eles condicionam vários desses fatores. Sua especificação básica é 𝑦𝑐𝑖𝑡=𝛼𝑐𝛼𝑐𝑖𝑡+𝑤𝑖𝑡′𝛽𝑐+𝛿𝑐𝑖+𝑦𝑐𝑡+𝜀𝑐𝑖𝑡 (Eq. 6.45) onde i indexa estados, t indexa tempos, c ∈ {violento, propriedade, assassinato} indexa o tipo de crime, 𝛿𝑐𝑖 são efeitos específicos estaduais e que controlam quaisquer características específicas do estado invariáveis no tempo, 𝑦𝑐𝑡 são efeitos específicos que controlam com CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 23 flexibilidade quaisquer tendências agregadas, 𝑤𝑖𝑡 são um conjunto de variáveis de controle para controlar fatores de confusão em nível estadual, 𝛼𝑐𝑖𝑡 é uma medida da taxa de aborto relevante para o tipo de crime c, e 𝑦𝑐𝑖𝑡 é a taxa de criminalidade para o tipo de crime c. Para o conjunto de controles específicos estaduais e que variam ao longo tempo (componente 𝑤𝑖𝑡), Donohue III e Levitt (2001) usam o log de prisioneiros defasados per capita, o log de policiais per capita defasados, a taxa de desemprego, a renda per capita, a taxa de pobreza, a generosidade do AFDC [Aid to Families with Dependent Children, um programa federal] no tempo t-15, uma dummy para a lei de armas ocultas, e o consumo de cerveja per capita.(...).” (BCH14, p. 637, com grifos próprios e tradução livre e com remoção das notas de rodapé). BCH14 conferem elevada importância para o procedimento de efeitos fixos de indivíduo e temporais. Adicionalmente, buscam controlar fatores não observáveis por meio da extração da primeira diferença das variáveis: “(...) Dada a importância aparentemente óbvia de controlar os efeitos de estado e tempo, consideramos esses efeitos em todos os modelos que estimamos. Optamos por eliminar os efeitos de estado por meio da diferenciação em vez de incluir um conjunto completo de dummies de estado, mas incluir um conjunto completo de dummies de tempo em cada modelo. Assim, estimaremos modelos da forma 𝑦𝑐𝑖𝑡−𝑦𝑐𝑖𝑡−1=𝛼𝑐(𝛼𝑐𝑖𝑡−𝛼𝑐𝑖𝑡−1)+𝑧𝑐𝑖𝑡 ′𝜅𝑐+𝑔𝑐𝑡+𝜂𝑐𝑖𝑡 (Eq. 6.46) onde 𝑔𝑐𝑡 são efeitos de tempo. Usamos os mesmos dados em nível de estado que Donohue III e Levitt (2001), mas excluímos Alasca, Havaí e Washington, D.C., o que dá uma amostra com 48 observações transversais e 12 observações de séries temporais para um total de 576 observações. Com essas exclusões, nossas estimativas de linha de base usando os mesmos controles de (6.45) são bastante semelhantes às relatadas em Donohue III e Levitt (2001). (...)” (BCH14, p. 637, com grifos próprios e tradução livre e com remoção das notas de rodapé). Note que os autores mencionam que possuem uma motivação teórico-empírica para usar a diferenciação (primeira-diferença), em vez de níveis. No apêndice eles discutem os resultados utilizando níveis e empregando efeitos fixos. A discussão mais relevante no que tange o ponto da alta dimensionalidade em BCH14 está na seguinte passagem: “Nosso principal ponto de partida de Donohue III e Levitt (2001) é que permitimos um conjunto 𝑧𝑐𝑖𝑡 muito mais rico do que o permitido por 𝑤𝑖𝑡 no modelo (6.45). Nosso 𝑧𝑐𝑖𝑡 inclui termos de ordem superior e interações das variáveis de controle definidas acima. Além disso, colocamos as condições iniciais e as diferenças iniciais de 𝑤𝑖𝑡 e 𝛼𝑐𝑖𝑡, e médias internas estaduais [within-state averages] de 𝑤𝑖𝑡 dentro do nosso vetor de controles 𝑧𝑐𝑖𝑡. Esse acréscimo abre a possibilidade de que possa haver alguma característica de um estado que está associada tanto à sua taxa de crescimento do aborto quanto à sua taxa de crescimento do crime. Por exemplo, ter níveis inicialmente elevados de aborto pode estar associado a altas taxas de crescimento no aborto e baixas taxas de crescimento no crime. A falha em controlar esse fator poderia levar a atribuir erroneamente o efeito desse fator inicial, talvez impulsionado por políticas ou dados demográficos em nível estadual, ao efeito do aborto. Finalmente, permitimos tendências mais gerais, permitindo uma tendência quadrática agregada em 𝑧𝑐𝑖𝑡, bem como interações dessa tendência quadrática com variáveis de controle. Isso nos dá um conjunto de 284 variáveis de controle para selecionar, além dos 12 efeitos de tempo que incluímos em cada modelo.” (BCH14, pp. 638, nota de rodapé 24, com grifos próprios e tradução livre). Em uma nota de rodapé, os autores esclarecem: “As identidades exatas dos 284 controles potenciais estão disponíveis mediante solicitação. Consiste em termos lineares e quadráticos de cada variável contínua em 𝑤𝑖𝑡, interações de cada variável em 𝑤𝑖𝑡, níveis iniciais e diferenças iniciais de 𝑤𝑖𝑡e 𝛼𝑐𝑖𝑡, as médias internas (within) estaduais de 𝑤𝑖𝑡 e interações dessas variáveis com uma tendência quadrática.” (BCH14, pp. 638, nota de rodapé 24, com grifos próprios e tradução livre). Com relação ao papel dos controles efetuados, os autores observam que: CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 24 “Observe que a interpretação das estimativas do efeito do aborto do modelo (6.45) como causal depende da crença [do pesquisador] de que não existem termos de ordem superior das variáveis de controle, nem termos de interação e nem variáveis adicionais excluídas que estão associadas tanto às taxas de crime quanto à taxa de aborto. Assim, controlar um grande conjunto de variáveis conforme descrito acima é desejável do ponto de vista de tornar essa crença mais plausível. Ao mesmo tempo, controlar de forma ingênua diminui nossa capacidade de identificar o efeito da variável de interesse e, portanto, tende a fazer estimativas muito menos precisas.” Interessante o comentário dos autores sobre os resultados obtidos: “O resultado de estimar o efeito do aborto condicional ao conjunto completo de 284 controles potenciais descritos acima é dado na terceira linha da Tabela 2 [do artigo BCH14]. Como esperado, todos os coeficientes são estimados de forma muito imprecisa. Claro, muito poucos pesquisadores considerariam o uso de 284 controles com apenas 576 observações devido exatamente a esse problema.” (BCH14, pp. 638, nota de rodapé 24, com grifos próprios e tradução livre). Abaixo inserimos a Tabela 2 de BCH14, para dar uma ideia mais clara dos resultados obtidos pelos autores do estudo: Figura 4 – Print da Tabela de resultados do exemplo empírico de BCH14 (p. 638) BCH14 ainda discutem o que chamam de “tradeoff” entre controlar muitas ou poucas variáveis em uma especificação econométrica de problema com dados e modelo HD: “Estamos diante de um tradeoff entre o controle de muito poucas variáveis, o que pode nos deixar imaginando se incluímos controles suficientes para [manter] a exogeneidade da variável de tratamento e o controle de tantas variáveis que seríamos incapazes de aprender de uma maneira mecânica sobre o efeito do tratamento. Os métodos de seleção de variáveis desenvolvidos neste artigo oferecem uma solução para essa tensão. A estrutura esparsa assumida mantém que há um conjunto pequeno o suficiente de variáveis que alguém poderia aprender sobre o tratamento, mas adiciona flexibilidade substancial ao caso usual, onde um pesquisador considera apenas algumas variáveis de controle, permitindo que este conjunto seja encontrado pelos dados de um grande conjunto de controles. Assim, a abordagem deve complementar a análise de especificação cuidadosa usual, fornecendo ao pesquisador uma maneira eficiente e orientada por dados para procurar um pequeno conjunto de fatores de confusão influentes entre um amplo conjunto de variáveis de confusão em potencial escolhido de maneira sensata.” “No exemplo do aborto, usamos o estimador pós-seleção dupla (...) para cada uma de nossas variáveis dependentes. Para o crime violento, oito variáveis são selecionadas na equação do aborto, e nenhuma variável é selecionada na equação do crime. Para o crime contra a propriedade, nove variáveis são selecionadas na equação do aborto, e três são selecionadas na equação do crime. Para o homicídio, nove variáveis são selecionadas na equação do aborto e nenhuma foi selecionada na equação do crime.” (BCH14, pp. 638-639, com grifos próprios, tradução livre e com remoção das notas de rodapé). CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 25 Os resultados dos autores utilizando PDS-LASSO são também imprecisos, mas eles promovem o seguinte balanço final: “Acreditamos que o exemplo nesta seção ilustra como podemos usar técnicas modernas de seleção de variáveis para complementar a análise de causalidade em economia. No exemplo do aborto, podemos pesquisar entre um grande conjunto de controles e transformações de variáveis ao tentar estimar o efeito do aborto sobre o crime. A consideração de um grande conjunto de controles torna mais plausível o pressuposto subjacente de exogeneidade da taxa de aborto condicional a variáveis observáveis, enquanto os métodos que desenvolvemos nos permitem produzir um modelo final de dimensão administrável. Curiosamente, vemos que se tiraria conclusões bastante diferentes das estimativas obtidas usando a seleção formal de variáveis. Olhando para as variáveis selecionadas, também podemos ver que esta mudança na interpretação está sendo conduzida pelo método de seleção de variáveis selecionando diferentes variáveis (...) do que normalmente são considerados.” (BCH14, pp. 640, com grifos próprios e tradução livre). VIII.3. PÓS-REGULARIZAÇÃO POR LASSO (PR-LASSO) A metodologia de “Pós-Regularização” – Post-Regularization, aqui denominada de PR-LASSO, mas denominada de “Metodologia CHS” pelo pacote lassopack – é o conjunto de procedimentos descritos em CHS15. A PR-LASSO é bastante relacionada com a metodologia PDS-LASSO, dado que a dupla seleção por LASSO é feita em ambas as técnicas. Entretanto, ao contrário do PDS-LASSO, o PR-LASSO não utiliza os controles selecionados pelo LASSO no passo final, de regressão OLS pós-regularização. Há um procedimento intermediário, no qual esses controles selecionados são usados para a previsão dentro da amostra, visando construir versões ortogonalizadas da variável dependente e das variáveis causais exógenas de interesse. Essas versões ortogonalizadas são calculadas tendo por base os valores e os coeficientes estimados dos controles selecionados. Há duas versões do estimador: • a primeira usa os coeficientes estimados da regressão LASSO, construindo “Variáveis ortogonalizadas pelo LASSO” (LASSO-orthogonalized variables). As variáveis ortogonalizadas são calculadas a partir da diferença entre a variável original e a previsão a partir dos coeficientes estimados pelo LASSO. • a segunda usa os coeficientes estimados em uma regressão pós-LASSO, ou seja, para cada um dos passos de seleção de modelo, aplica o estimador OLS para obter coeficientes, construindo “Variáveis ortogonalizadas pelo pós-LASSO” (post-LASSO-orthogonalized variables). As variáveis ortogonalizadas são calculadas a partir da diferença entre a variável original e a previsão a partir dos coeficientes estimados pelo OLS pós-LASSO. De acordo com CHS15, citando Belloni & Chenozukhov (2013), os resultados teóricos da abordagem independem se usamos o estimador LASSO ou o estimador pós-LASSO para o procedimento por eles sugeridos (CHS15, p. 4). Demonstram os autores que o OLS pós-LASSO (ou estimador pós-LASSO) desempenha tão bem quanto o estimador LASSO sob suposições adicionais moderadas. Ou seja, sugerem que qualquer uma das versões do estimador pode ser usada na abordagem de dupla-seleção. O procedimento CHS15 é importante como uma possibilidade de checagem da robustez dos resultados apresentados pelo PDS-LASSO. Mais do que isso, o procedimento, por reduzir a dimensão da análise para focar apenas no regressando e na(s) variável (variáveis) de interesse, o que tem influenciado artigos mais recentes dos autores que utilizam outros algoritmos em um procedimento denominado de “Double Machine Learning” – vide Chernozhukov et al (2018). Por fim, cumpre dizer que o procedimento CHS15 também pode ser aplicado no contexto de regularização por instrumentos (CHS15, p. 487, por exemplo, Algoritmo 1), conforme veremos a seguir com o IV-LASSO. CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 32 sujeito a 𝛽𝑗=0 𝑠𝑒 𝛽𝑗=0, onde 𝛽𝑗 é um estimador esparso de primeira etapa, nesse caso, o LASSO. Dessa forma, a pós-estimativa OLS trata o estimador da primeira etapa como uma técnica genuína de seleção de modelo. Utilizando um modelo LASSO com regularização orientada por teoria, Belloni e Chernozhukov (2013) mostraram que a pósestimativa OLS, também conhecida como “pós-LASSO”, atinge as mesmas taxas de convergência que o LASSO e pode superar o LASSO em situações onde a seleção de modelo consistente é viável. Vide discussão em BCCH12. IX.4. DADOS EM PAINEL Nas rotinas do lassopack (pdslasso e ivlasso) é possível efetuar a estimação com procedimento de estimador de efeitos fixos, quando a estrutura de dados for em painel. Essa opção de efeitos fixos é equivalente a especificar dummies específicos de painel não penalizado, ou seja, atribuir a cada indivíduo do painel uma variável binária one-hot encoding e que não sejam sujeitas a regularização/inativação pelo LASSO. Entretanto, o procedimento das rotinas é computacionalmente mais rápido e mais preciso do que o uso de dummies, dado que utiliza o tradicional passo de transformação “within” do estimador de efeitos fixos, onde se extrai a média interna de cada variável – nesse caso, não há estimativa de constante e nem dos parâmetros de efeitos fixos. A variável de painel usada pela opção fe é a variável de painel previamente definida por xtset – comando do Stata para esse tipo de designação. • PDS-LASSO com regressão de efeitos fixos para dados em painel: ivlasso y x1 (x2-x10 c1-c5000), fe IX.5. ESCOLHA DOS PARÂMETROS DE AJUSTE Um ponto fundamental de modelagem de qualquer procedimento de regularização diz respeito à escolha do(s) hiperparâmetro(s) de penalização de variáveis. Ou seja, a seleção dos parâmetros de ajuste de uma maneira otimizada torna-se questão vital de confiabilidade das estimativas produzidas pelas rotinas. Dizem Ahrens, Hansen & Schaffer (2020): “Qual método é mais apropriado depende dos objetivos e da configuração efetuada, particularmente do objetivo da análise (previsão ou identificação do modelo), restrições computacionais, e se e como o pressuposto de resíduos independente e identicamente distribuídos (i.i.d.) é violado.” (p. 184, tradução livre) Consistente com as discussões em BCCH12, BCH14 e CHS15 – e outros trabalhos na área de pós-dupla seleção por LASSO –, Ahrens, Hansen & Schaffer (2020) discorrem que a lassopack oferece três abordagens para selecionar o valor “ótimo” de 𝜆 – e também 𝛼, no caso de um modelo de Rede Elástica. As abordagens utilizadas no lassopack, denominadas de escolha dos hiperparâmetros “conduzidas pelos dados” (data-driven approach), são as seguintes: • Abordagem do critério de informação: critérios como o de Akaike (Akaike Information Criterion, AIC), e o Bayesiano (Bayesian Information Criterion, BIC), e equivalentes estendidos – por exemplo, o EBIC –, calculados a partir da rotina lasso2. • Abordagem da validação cruzada (“cross validation”, CV): objetivo de otimizar o desempenho de previsão fora da amostra do modelo. As validações cruzadas dos tipos “K-fold” e “rolling” – tanto para dados de painel quanto para série temporal – são implementadas na rotina cvlasso. O problema da abordagem CV é que ela pode ser bastante demandante em termos computacionais. Discutem os autores que “Se o objetivo da análise for identificar o modelo verdadeiro, o BIC e o EBIC fornecem uma escolha melhor do que o K-fold CV, porque existem condições sob hipóteses fortes, mas bem compreendidas, nas quais o BIC e o EBIC são consistentes na seleção de modelos.” • Abordagem “rigorosa” (rigourous), ou orientada pela teoria (theory-driven): Consistente com Chernozhukov, Hansen e Spindler (2016), utiliza-se o termo “rigoroso” para enfatizar que o arcabouço é baseado em teoria, na medida em que fornece parâmetros de penalização que garantem a taxa ótima de convergência para previsão e estimativa de parâmetros. A abordagem também produz modelos cujo tamanho é da mesma ordem que o modelo verdadeiro Ahrens, Hansen & Schaffer (2020, p. 190). Sua origem está em BCCH12, que parte do pressuposto de que a variância do termo de erro CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 33 é desconhecida e propõem uma metodologia denominada de “LASSO rigoroso” (ou “LASSO viável” – rigorous LASSO ou feasible LASSO), que se baseia em um algoritmo iterativo para estimar a penalização ótima, sendo também válido na presença de erros não gaussianos e heteroscedásticos. Em um outro estudo, Belloni et al. (2016) realizam uma extensão desse modelo para uma estimação com dados em painel. A penalização rigorosa é a forma utilizada de se obter o parâmetro de ajuste nas rotinas pdslasso e ivlasso do lassopack. A sub-rotina utilizada para implementar a penalização rigorosa é o comando rlasso. IX.6. OUTROS MODELOS DE REGULARIZAÇÃO DO LASSOPACK Conforme discutem Ahrens, Hansen & Schaffer (2020), as rotinas do lassopack (pdslasso e ivlasso) permitem rodar diversos outros modelos de regularização. É possível rodar regressão RIGDE, Elastic Net (Rede Elástica), Adaptive LASSO, Square root LASSO, Rigorous LASSO, Rigorous Square Root LASSO, com ou sem estimador de efeitos fixos, variáveis instrumentais e controles de heteroscedasticidade. X. APLICAÇÕES RECENTES NA LITERATURA PUBLICADA E NÃO PUBLICADA Apesar de ainda estar apenas no início de desenvolvimento, a literatura empírica que utiliza modelos de Pós-Dupla Seleção por LASSO (“PDS-LASSO”), Pós-Regularização (“PR-LASSO”, mais conhecido como “metodologia CHS”) e Pós-Regularização de Modelos de Variáveis Instrumentais com LASSO (“IVLASSO”), mostra sinais de que em breve deve ser bastante ampla e variada. Em uma pesquisa de referências em outubro de 2020, foram encontrados pouco mais de duas dezenas de trabalhos que utilizam a técnica, sendo que a maioria ainda não foi publicada. Trata-se de uma área emergente e possivelmente vibrante. Abaixo listamos alguns desses trabalhos. • Azoulay, Greenblatt & Heggeness (2019) investigam, com uso de PDS-LASSO, o efeito de uma exposição relativamente curta e intensa, à pesquisa de fronteira nas trajetórias de carreira de inovadores potenciais? Os autores pertencem ao MIT Sloan School of Management, e U.S. Census Bureau. O estudo é um documento de trabalho do National Bureau of Economic Research - NBER, nos Estados Unidos. • Barrera-Osorio, Gertler, Nakajima & Patrinos (2020) investigam com uso de PDS-LASSO, a promoção de envolvimento dos pais em escolas mexicanas. Os autores pertencem à Vanderbilt University, University of California/Berkeley, Harvard University e World Bank. • Berggren & Nilsson (2020) examinam como a variação no anti-semitismo entre países pode ser explicada pelo grau de liberdade econômica. Os autores pertencem à University of Economics, República Tcheca, e Lund University, Sweden. • Blevins & Kawata (2019) examinam o impacto da orfandade nos resultados de aprendizagem entre as meninas e • meninos na África Subsaariana, condicionada à matrícula escolar. Os autores utilizam PDS-LASSO; pertencem à Hiroshima University e University of Tokyo. • Cullen (2020), da University of Oxford, investiga com uso de PDS-LASSO, o fenômeno da subnotificação de violência por parceiro íntimo na Nigéria e Ruanda. • Dean & Jayachandran (2019) investigam, com uso de PDS-LASSO, a mudança de atitude da família para promover o emprego feminino na Índia. Os autores pertencem ao Institute on Behavior and Inequality, na Alemanha, e à Northwestern University (EUA). • Fluchtmann, Glenny, Harmon & Maibom (2020) investigam com PDS-LASSO se homens e mulheres se candidatam aos mesmos empregos, para entendem as diferenças de gênero no mercado de trabalho. Os autores pertencem à OECD, University of Copenhagen e Aarhus University. • Heß, Jaimovich & Schündeln (2018) estudam, com uso de PDS-LASSO, os efeitos dos projetos de desenvolvimento nas redes econômicas da Gâmbia Rural. Artigo publicado na Review of Economic Studies (Advance access publication) 2020. Os autores pertencem à Goethe University Frankfurt e Universidad de Talca. CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 34 • Hill (2020) é uma tese de doutorado do MIT, defendida em maio de 2020. O estudo utiliza PDSLASSO para investigar as forças econômicas que influenciam a criação de pesquisas acadêmicas e conhecimentos científicos básicos. • Jinks, Kniesner, Leeth & Sasso (2020) estudam com PDS-LASSO o caso do Texas, que é o único estado que não exige que os empregadores tenham cobertura de seguro de compensação dos trabalhadores. Os autores pertencem a University of Illinois at Chicago, University of Illinois at Chicago, Bentley University, e DePaul University, todas nos Estados Unidos. • Kiessling & Norris (2020) utilizam PDS-LASSO para estudar os efeitos de longo prazo de colegas na saúde mental de um estudante. Os autores pertencem, respectivamente, ao Max Planck Institute for Research on Collective Goods, da Dinamarca, e University of Strathclyde, no Reino Unido. • Macchiavello, Menzel, Rabbani & Woodruff (2020) estudam a participação feminina em funções gerenciais no setor de vestuário em Bangladesh. Os autores pertecem à London School of Economics (LSE), CEGGE-EI de Praga, University of Dhaka, de Bangladesh e Universidade de Oxford. O trabalho consta como documento de trabalho do National Bureau of Economic Research - NBER, nos Estados Unidos. • McKelway (2019), estuda a participação no mercado de trabalho de mulheres na Índia, utilizado PDSLASSO. O trabalho é fruto de sua tese de doutorado defendida no MIT em 2020. • Menzel & Woodruff (2019) é um documento de trabalho de autores da CERGE-EI de Praga e da University of Oxford. A aplicação de PDS-LASSO para selecionar controles é na área de diferenças salariais entre gêneros e mobilidade do trabalho. • Nguyen (2020) é uma tese da University of Chicago, defendida em agosto de 2020, na área de Economia do Trabalho. O autor compara estimativas OLS, LASSO e PDS-LASSO. • Peng (2019) é um documento de trabalho postado na plataforma ArXiv que investiga efeitos endógenos heterogêneos para identificar líderes e seguidores em redes de pessoas. Apesar do estudo não utilizar a metodologia BCCH14, utiliza um método próprio para selecionar instrumentos. • Ricci et al (2020) utilizam PDS-LASSO em estudos de medicina, para estudar efeitos de complicação abrangente em cirurgia pancreática. Participaram da pesquisa diversos autores da Universitaria Di Bologna, Itália. XI.1. APLICAÇÃO AO TRANSPORTE AÉREO Um dos estudos recentes aplicados ao transporte aéreo que utiliza métodos de regressão regularizada é o de Oliveira et al. (2021). Os autores empregam o método LASSO para estimar a eficiência no consumo de combustível no transporte aéreo, levando em conta a gestão dinâmica de frotas (Dynamic Fleet Management, DFM). Eles propõem um modelo econométrico que integra dados detalhados de frota, rede de rotas, preços de combustível e variáveis meteorológicas, com o objetivo de identificar os efeitos causais dos sinais de preço sobre decisões de substituição de aeronaves e eficiência operacional. O trabalho parte do reconhecimento de que a eficiência energética das companhias aéreas depende não apenas de fatores tecnológicos, mas também de estratégias operacionais e gerenciais, muitas delas não observáveis diretamente. Por isso, os autores enfatizam o desafio de controlar tais fatores latentes, que afetam simultaneamente o consumo de combustível e a resposta das empresas aos choques de preços. Os autores desenvolvem uma metodologia econométrica de alta dimensionalidade baseada no uso do LASSO e de sua versão instrumental (IV-LASSO), inspirada em Belloni, Chernozhukov e Hansen (2012, 2014a,b). Essa abordagem é projetada para lidar com milhares de variáveis correlacionadas, selecionando apenas aquelas que explicam de forma informativa as variações não observáveis associadas às operações aéreas. O LASSO atua como um mecanismo de regularização que permite capturar a heterogeneidade operacional entre aeronaves, rotas e companhias sem comprometer a estabilidade do modelo, identificando subconjuntos parcimoniosos de controles relevantes. Isso é particularmente importante diante da elevada correlação entre variáveis técnicas (como configuração da frota, idade média e densidade de assentos) e variáveis de mercado (como carga transportada e distância média). Os autores também utilizam o IV-LASSO para tratar potenciais problemas de endogeneidade, permitindo a seleção automática dos instrumentos mais relevantes em um conjunto extenso de candidatos. Essa estrutura fornece inferências mais robustas sobre o efeito causal dos preços de combustível, evitando o viés decorrente de instrumentos fracos e reduzindo o sobreajuste. O modelo desenvolvido pelos autores incorpora controles CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 35 de DFM representados pela participação de cada matrícula de aeronave nos pares de cidades, variável que reflete as capacidades operacionais específicas de cada companhia aérea. No total, 1.272 controles desse tipo foram considerados, dos quais 405 (31,8%) foram mantidos pelo LASSO, representando os efeitos realmente informativos relacionados à gestão dinâmica da frota. Dessa forma, o método atua como um filtro que elimina as influências espúrias desses fatores não observáveis, estabilizando os coeficientes principais e reduzindo o viés por variáveis omitidas. Em síntese, os autores efetuam uma aplicação que combina procedimentos de regularização e identificação causal para analisar as relações entre preços de combustível, gestão de frota e eficiência operacional. Os autores discutem que a adoção do LASSO e de sua versão com variáveis instrumentais promovem a precisão das estimativas e o poder explicativo do modelo, ao permitir que a especificação incorpore um número elevado de controles correlacionados e mantenha a consistência dos resultados. Assim, a integração entre regularização e inferência causal utilizada por Oliveira et al. (2021) pode permitir capturar heterogeneidades operacionais não observáveis e gerar estimativas provavelmente mais consistentes dos determinantes da eficiência energética no transporte aéreo. XI. CONSIDERAÇÕES FINAIS O presente trabalho visou apresentar, de uma maneira didática, uma discussão acerca dos Modelos de PósDupla Seleção e Pós-Regularização por LASSO apresentados recentemente em uma sequência de trabalhos por Alexandre Belloni, Christian B. Hansen e Victor Chernozhukov. Apresentou-se também um conjunto de rotinas denominadas de “lassopack” (Ahrens, Hansen & Schaffer, 2019, 2020) e disponíveis para o software Stata para uso de pesquisadores com dados e modelos de alta dimensão (HD). Busca-se disseminar o conhecimento nessa área, propiciando um uso mais intenso da metodologia na literatura econômica nacional. As limitações do uso do LASSO são bem conhecidas na literatura, e por esse motivo é importante concluir este trabalho com uma breve menção a elas. Em termos formais, o uso do método LASSO em modelos econométricos deve ser entendido principalmente como um instrumento para estimar a parte de incômodo (nuisance) de um problema e não como um procedimento confiável de seleção de variáveis. Isso ocorre porque o LASSO não é consistente em seleção de variáveis, isto é, ele não garante a identificação exata do verdadeiro conjunto de regressoras relevantes à medida que o tamanho amostral cresce. Zhao e Yu (2006) demonstram que essa inconsistência decorre do não atendimento de uma condição estrutural específica do conjunto de regressoras, denominada Irrepresentable Condition. Essa condição estabelece que as variáveis irrelevantes não podem ser excessivamente correlacionadas com as variáveis relevantes do modelo, pois, quando isso ocorre, as primeiras podem ser “representadas” como combinações lineares das segundas. Em outras palavras, se as variáveis fora do modelo verdadeiro forem altamente correlacionadas com as que pertencem a ele, o LASSO tende a confundir sua contribuição, incluindo regressoras espúrias ou excluindo variáveis importantes. Nesses casos, o método permanece útil para predição, mas não para inferência causal. Qualquer tentativa de interpretação ou inferência sobre os parâmetros de alta dimensionalidade selecionados pelo LASSO exigiria que o método fosse perfeito na seleção do modelo, o que não ocorre, exceto sob hipóteses altamente irreais. Em termos práticos, seu papel é reduzir dimensionalidade e controlar variáveis potencialmente correlacionadas com o termo de erro, permitindo estimativas mais robustas dos parâmetros de interesse. Assim, o LASSO deve ser interpretado como uma ferramenta auxiliar de regularização, adequada para selecionar controles em contextos de alta dimensionalidade, mas não para definir as variáveis focais de um modelo cujo objetivo é a inferência estrutural. CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 36 REFERÊNCIAS REFERÊNCIAS DE TEÓRICAS DA METODOLOGIA HDS E SELEÇÃO POR LASSO Ahrens, A., Hansen, C. B., & Schaffer, M. (2019). PDSLASSO: Stata module for post-selection and post-regularization OLS or IV estimation and inference. Ahrens, A., Hansen, C. B., & Schaffer, M. E. (2020). LASSOPACK: Model selection and prediction with regularized regression in Stata. The Stata Journal, 20(1), 176-235. Akaike, H. (1974). A new look at the statistical model identification. IEEE transactions on automatic control, 19(6), 716723. Amemiya, T. (1974). The nonlinear two-stage least-squares estimator. Journal of Econometrics, 2, 105-110. Anderson, T. W., & Rubin, H. (1949). Estimation of the parameters of a single equation in a complete system of stochastic equations. The Annals of Mathematical Statistics, 20(1), 46-63. Angrist, J., & Frandsen, B. (2019). Machine labor (No. w26584). National Bureau of Economic Research. Angrist, J. D., & Krueger, A. B. (1995). Split-sample instrumental variables estimates of the return to schooling. Journal of Business & Economic Statistics, 13(2), 225-235. Arlot, S., & Celisse, A. (2010). A survey of cross-validation procedures for model selection. Statistics surveys, 4, 40-79. Athey, S. (2018). The impact of machine learning on economics. In The economics of artificial intelligence: An agenda (pp. 507-547). University of Chicago Press. Bach, P., Chernozhukov, V., & Spindler, M. (2018). Valid Simultaneous Inference in High-Dimensional Settings (with the hdm package for R). arXiv preprint arXiv:1809.04951. Banks, D. (2019) Modern data science: an overview. Lectures, Duke University. Basu, D. (2011). On the elimination of nuisance parameters. In Selected Works of Debabrata Basu (pp. 279-290). Springer, New York, NY. Belloni, A., & Chernozhukov, V. (2011). High dimensional sparse econometric models: An introduction. In Inverse Problems and High-Dimensional Estimation (pp. 121-156). Springer, Berlin, Heidelberg. Belloni, A., Chen, D., Chernozhukov, V., & Hansen, C. (2012). Sparse models and methods for optimal instruments with an application to eminent domain. Econometrica, 80(6), 2369-2429. Belloni, A., Chernozhukov, V., & Hansen, C. (2011). Lasso methods for gaussian instrumental variables models. Working Paper. Belloni, A., Chernozhukov, V., & Hansen, C. (2013). Inference for high-dimensional sparse econometric models. in Acemoglu, D., Arellano, M., & Dekel, E. Advances in Economics and Econometrics, CUP: Cambridge. Belloni, A., Chernozhukov, V., & Hansen, C. (2014a). Inference on treatment effects after selection among highdimensional controls. The Review of Economic Studies, 81(2), 608-650. Belloni, A., Chernozhukov, V., & Hansen, C. (2014b). High-dimensional methods and inference on structural and treatment effects. Journal of Economic Perspectives, 28(2), 29-50. Belloni, A., Chernozhukov, V., & Kato, K. (2013). Robust inference in high-dimensional approximately sparse quantile regression models (No. CWP70/13). cemmap working paper. Belloni, A., Chernozhukov, V., & Wang, L. (2011). Square-root lasso: pivotal recovery of sparse signals via conic programming. Biometrical, 98(4), 791-806. Belloni, A., Chernozhukov, V., & Wei, Y. (2016). Post-selection inference for generalized linear models with many controls. Journal of Business & Economic Statistics, 34(4), 606-619. Belloni, A., Chernozhukov, V., Chetverik, D., Hansen, C., & Kato, K. (2018). High-dimensional econometrics and regularized GMM. arXiv preprint arXiv:1806.01888. Belloni, A., Chernozhukov, V., Hansen, C., & Kozbur, D. (2016). Inference in high-dimensional panel models with an application to gun control. Journal of Business & Economic Statistics, 34(4), 590-605. Bergmeir, C., Hyndman, R. J., & Koo, B. (2018). A note on the validity of cross-validation for evaluating autoregressive time series prediction. Computational Statistics & Data Analysis, 120, 70-83. Bickel, P. J., Ritov, Y. A., & Tsybakov, A. B. (2009). Simultaneous analysis of Lasso and Dantzig selector. The Annals of statistics, 37(4), 1705-1732. Bühlmann, P. (2013). Statistical significance in high-dimensional linear models. Bernoulli, 19(4), 1212-1242. Bühlmann, P., & Van De Geer, S. (2011). Statistics for high-dimensional data: methods, theory and applications. Springer Science & Business Media. Burman, P., Chow, E., & Nolan, D. (1994). A cross-validatory method for dependent data. Biometrika, 81(2), 351-358. Burnham, K., & Anderson, D. (2004). Model selection and multi-model inference. Second. NY: Springer-Verlag. Cameron, A. C. (2019). Machine Learning Methods in Economics. Machine Learning, (1/67). Carrasco, M. (2012). A regularization approach to the many instruments problem. Journal of Econometrics, 170(2), 383398. Chamberlain, G. (1987). Asymptotic efficiency in estimation with conditional moment restrictions. Journal of Econometrics, 34(3), 305-334. Chernozhukov, V., & Hansen, C. (2005). An IV model of quantile treatment effects. Econometrica, 73(1), 245-261. CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 37 Chernozhukov, V., & Hansen, C. (2008). The reduced form: A simple approach to inference with weak instruments. Economics Letters, 100(1), 68-71. Chernozhukov, V., Chetverikov, D., & Kato, K. (2013). Gaussian approximations and multiplier bootstrap for maxima of sums of high-dimensional random vectors. The Annals of Statistics, 41(6), 2786-2819. Chernozhukov, V., Hansen, C., & Spindler, M. (2015). Instrumental Variables Estimation with Very Many Instruments and Controls. Chernozhukov, V., Hansen, C., & Spindler, M. (2015). Post-selection and post-regularization inference in linear models with many controls and instruments. American Economic Review, 105(5), 486-90. Chernozhukov, V., Hansen, C., & Spindler, M. (2016). High-dimensional metrics in R. arXiv preprint arXiv:1603.01700. Chernozhukov, V., Härdle, W. K., Huang, C., & Wang, W. (2020). LASSO-Driven Inference in Time and Space. Annals of Statistics. Future Edition. Chernozhukov, V., Hausman, J. A., & Newey, W. K. (2019). Demand analysis with many prices (No. w26424). National Bureau of Economic Research. Chernozhukov, V., Newey, W. K., & Robins, J. (2018). Double/de-biased machine learning using regularized Riesz representers (No. CWP15/18). Cemmap Working Paper. Chernozhukov, V., Chetverikov, D., Demirer, M., Duflo, E., Hansen, C., Newey, W., & Robins, J. (2018). Double/debiased machine learning for treatment and structural parameters. The Econometrics Journal 21, pp. C1-C68. Clarke, B., & Chu, J. H. (2014). Generic feature selection with short fat data. Journal of the Indian Society of Agricultural Statistics. Indian Society of Agricultural Statistics, 68(2), 145. Correia, S. (2019). FTOOLS: Stata module to provide alternatives to common Stata commands optimized for large datasets. Dicker, L. H. (2016). Ridge regression and asymptotic minimax estimation over spheres of growing dimension. Bernoulli, 22(1), 1-37. Dobriban, E., & Wager, S. (2018). High-dimensional asymptotics of prediction: Ridge regression and classification. The Annals of Statistics, 46(1), 247-279. Frank, L. E., & Friedman, J. H. (1993). A statistical view of some chemometrics regression tools. Technometrics, 35(2), 109-135. Friedman, J., Hastie, T., & Tibshirani, R. (2010). Regularization paths for generalized linear models via coordinate descent. Journal of statistical software, 33(1), 1. Friedman, J., Hastie, T., Höfling, H., & Tibshirani, R. (2007). Pathwise coordinate optimization. The annals of applied statistics, 1(2), 302-332. Fu, W. J. (1998). Penalized regressions: the bridge versus the lasso. Journal of computational and graphical statistics, 7(3), 397-416. Geisser, S. (1975). The predictive sample reuse method with applications. Journal of the American statistical Association, 70(350), 320-328. Gillen, B. J., Montero, S., Moon, H. R., & Shum, M. (2019). BLP-2LASSO for aggregate discrete choice models with rich covariates. The Econometrics Journal, 22(3), 262-281. Hansen, C., & Kozbur, D. (2014). Instrumental variables estimation with many weak instruments using regularized JIVE. Journal of Econometrics, 182(2), 290-308. Hastie, T., Tibshirani, R., & Friedman, J. (2009). The elements of statistical learning: data mining, inference, and prediction. Springer Science & Business Media. Hastie, T., Tibshirani, R., & Wainwright, M. (2015). Statistical learning with sparsity: the lasso and generalizations. CRC press. Hoerl, A. E., & Kennard, R. W. (1970). Ridge regression: Biased estimation for nonorthogonal problems. Technometrics, 12(1), 55-67. Hsu, D., Kakade, S. M., & Zhang, T. (2012, June). Random design analysis of ridge regression. In Conference on learning theory (pp. 9-1). Huang, J., Ma, S., & Zhang, C. H. (2008). Adaptive Lasso for sparse high-dimensional regression models. Statistica Sinica, 1603-1618. Hurvich, C. M., & Tsai, C. L. (1989). Regression and time series model selection in small samples. Biometrika, 76(2), 297-307. Hyndman, R. J., & Athanasopoulos, G. (2018). Forecasting: principles and practice. OTexts. Jing, B. Y., Shao, Q. M., & Wang, Q. (2003). Self-normalized Cramér-type large deviations for independent random variables. The Annals of probability, 31(4), 2167-2215. Leek, J. (2015). A blessing of dimensionality often observed in high-dimensional data sets, Disponível em simplystatistics.org. Liu, H., Xu, X., & Li, J. J. (2020). A bootstrap lasso+ partial ridge method to constructo confidence intervals for parameters in high-dimensional sparse linear models. Statistica Sinica, 30, 1333-1355. Lockhart, R., Taylor, J., Tibshirani, R. J., & Tibshirani, R. (2014). A significance test for the lasso. Annals of statistics, 42(2), 413. Ludwig, J., & Mullainathan, S. (2018). Human decisions and machine predictions. The Quarterly Journal of Economics, 237, 293. Luo, Y. (2014). Selecting informative moments via lasso. Working paper, Massachusetts Institute of Technology. CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 38 Meinshausen, N., & Bühlmann, P. (2010). Stability selection. Journal of the Royal Statistical Society: Series B (Statistical Methodology), 72(4), 417-473. Meinshausen, N., Meier, L., & Bühlmann, P. (2009). P-values for high-dimensional regression. Journal of the American Statistical Association, 104(488), 1671-1681. Mullainathan, S., & Spiess, J. (2017). Machine learning: an applied econometric approach. Journal of Economic Perspectives, 31(2), 87-106. Newey, W. K. (1990). Efficient instrumental variables estimation of nonlinear models. Econometrica: Journal of the Econometric Society, 809-837. Pantazis, Y., Lagani, V., Charonyktakis, P., & Tsamardinos, I. (2018). Multiple Equivalent Solutions for the Lasso. arXiv preprint arXiv:arXiv:1710.04995, v2. Robinson, P. M. (1988). Root-N-consistent semiparametric regression. Econometrica: Journal of the Econometric Society, 931-954. Santosa, F., & Symes, W. W. (1986). Linear inversion of band-limited reflection seismograms. SIAM Journal on Scientific and Statistical Computing, 7(4), 1307-1330. Schwarz, G. (1978). Estimating the dimension of a model. The annals of statistics, 6(2), 461-464. Semenova, V., Goldman, M., Chernozhukov, V., & Taddy, M. (2017). Estimation and Inference about Heterogeneous Treatment Effects in High-Dimensional Dynamic Panels. arXiv e-prints, arXiv-1712. Shao, J. (1993). Linear model selection by cross-validation. Journal of the American statistical Association, 88(422), 486-494. Shi, Z. (2016). Econometric estimation with high-dimensional moment equalities. Journal of Econometrics, 195(1), 104119. Smith, G. (2018). Step away from stepwise. Journal of Big Data, 5(1), 32. Song, R., Kosorok, M. R., & Fine, J. P. (2009). On asymptotically optimal tests under loss of identifiability in semiparametric models. Annals of statistics, 37(5A), 2409. Staiger, D., & Stock, J. H. (1997). Instrumental variables regression with weak instruments. Econometrica, 65(3), 557586. Stone, M. (1977). An asymptotic equivalence of choice of model by cross‐validation and Akaike's criterion. Journal of the Royal Statistical Society: Series B (Methodological), 39(1), 44-47. Tibshirani, R. (1996). Regression shrinkage and selection via the Lasso. Journal of the Royal Statistical Society: Series B (Methodological), 58(1), 267-288. Tibshirani, R. (1997). The lasso method for variable selection in the Cox model. Statistics in medicine, 16(4), 385-395. Tikhonov, A. N. (1963). On the solution of ill-posed problems and the method of regularization. In Doklady Akademii Nauk (Vol. 151, No. 3, pp. 501-504). Russian Academy of Sciences. Uckat, H. (2020). Womens Promotion and Intra-Household Bargaining: Evidence from Bangladesh. Working Paper - University of Oxford. Urminsky, O., Hansen, C., & Chernozhukov, V. (2016). Using double-lasso regression for principled variable selection. Available at SSRN 2733374. Urminsky, O., Hansen, C., & Chernozhukov, V. (2019). The Double-Lasso Method for Principled Variable Selection. Varian, H. R. (2014). Big data: New tricks for econometrics. Journal of Economic Perspectives, 28(2), 3-28. Wasserman, L., & Roeder, K. (2009). High dimensional variable selection. Annals of statistics, 37(5A), 2178. Weilenmann, B., Seidl, I., & Schulz, T. (2017). The socio-economic determinants of urban sprawl between 1980 and 2010 in Switzerland. Landscape and Urban Planning, 157, 468-482. Wooldridge, J. M. (2016). Introductory Econometrics, 6th ed.; Cengage Learning: Boston, MA, USA, 240-252. Wuthrich, K., & Zhu, Y. (2020). Omitted variable bias of Lasso-based inference methods: A finite sample analysis. Available at arXiv:1903.08704v6. Yamada, H. (2017). The Frisch–Waugh–Lovell theorem for the lasso and the ridge regression. Communications in Statistics-Theory and Methods, 46(21), 10897-10902. Yang, Y. (2005). Can the strengths of AIC and BIC be shared? A conflict between model indentification and regression estimation. Biometrika, 92(4), 937-950. Zhang, Y., Li, R., & Tsai, C. L. (2010). Regularization parameter selections via generalized information criterion. Journal of the American Statistical Association, 105(489), 312-323. Zhao, P., & Yu, B. (2006). On model selection consistency of Lasso. Journal of Machine learning research, 7(Nov), 2541-2563. Zou, H. (2006). The adaptive lasso and its oracle properties. Journal of the American statistical association, 101(476), 1418-1429. Zou, H., & Hastie, T. (2005). Regularization and variable selection via the elastic net. Journal of the royal statistical society: series B (statistical methodology), 67(2), 301-320. Zou, H., & Zhang, H. H. (2009). On the adaptive elastic-net with a diverging number of parameters. Annals of statistics, 37(4), 1733. Zou, H., Hastie, T., & Tibshirani, R. (2007). On the “degrees of freedom” of the lasso. The Annals of Statistics, 35(5), 2173-2192. CAER | Communications in Airline Economics Research, 201717804h, 2021. @ 2021 Center for Airline Economics, Brazil. 39 REFERÊNCIAS DE APLICAÇÕES DA METODOLOGIA PDS-LASSO Azoulay, P., Greenblatt, W. H., & Heggeness, M. L. (2019). Long-term Effects from Early Exposure to Research: Evidence from the NIH" Yellow Berets'' (No. w26069). National Bureau of Economic Research. Barrera-Osorio, F., Gertler, P., Nakajima, N., & Patrinos, H. (2020). Promoting Parental Involvement in Schools: Evidence from Two Randomized Experiments in Mexico. Berggren, N., & Nilsson, T. (2020). Economic Freedom and Antisemitism (No. 1357). Working Paper. Blevins, B. K., & Kawata, K. (2019). The orphan impact: HIV-AIDS and student test scores from sub-Saharan Africa. Educational Review, 1-24. Cullen, C. A. (2020). Method Matters: Underreporting of Intimate Partner Violence in Nigeria and Rwanda. World Bank Policy Research Working Paper, (9274). Dean, J. T., & Jayachandran, S. (2019, May). Changing Family Attitudes to Promote Female Employment. In AEA Papers and Proceedings (Vol. 109, pp. 138-42). Derksen, L., Leclerc, C. M., & Souza, P. C. (2019). Searching for Answers: The Impact of Student Access to Wikipedia (No. 1236). University of Warwick, Department of Economics. Fluchtmann, J., Glenny, A. M., Harmon, N., & Maibom, J. (2020). The Gender Application Gap: Do men and women apply for the same jobs?. Mimeo University of Copenhagen. Gujarati, D. N., & Porter, D. C. (2011). Econometria Básica. Quinta Edição. Porto Alegre: AMGH Editora. Heß, S., Jaimovich, D., & Schündeln, M. (2018). Development projects and economic networks: Lessons from rural Gambia. The Review of Economic Studies. Hill, R. (2020). Essays on the economics of science and innovation (Doctoral dissertation, Massachusetts Institute of Technology). Jinks, L., Kniesner, T. J., Leeth, J., & Sasso, A. T. L. (2020). Opting out of workers’ compensation: Non-subscription in Texas and its effects. Journal of Risk and Uncertainty, 1-24. Kashlak, A. B., & Kong, L. (2017). A concentration inequality based methodology for sparse covariance estimation. arXiv preprint arXiv:1705.02679. Kiessling, L., & Norris, J. (2020). The long-run effects of peers on mental health. MPI Collective Goods Discussion Paper, (2020/12). Macchiavello, R., Menzel, A., Rabbani, A., & Woodruff, C. (2020). Challenges of Change: An Experiment Promoting Women to Managerial Roles in the Bangladeshi Garment Sector (No. w27606). National Bureau of Economic Research. McKelway, M. (2019). Vicious and Virtuous Cycles: Self-Efficacy and Employment of Women in India. Unpublished manuscript. Menzel, A., & Woodruff, C. (2019). Gender wage gaps and worker mobility: Evidence from the garment sector in Bangladesh (No. w25982). National Bureau of Economic Research. Nguyen, H. (2020). Topics and methods in Labor Economics (Doctoral dissertation, University of Chicago). Oliveira, A. V. M., Narcizo, R. R., Caliari, T., Morales, M. A. V., & Prado, R. (2021). Estimating fuel-efficiency while accounting for dynamic fleet management: Testing the effects of fuel price signals and fleet rollover. Transportation Research Part D: Transport and Environment, 95, 102820. Peng, S. (2019). Heterogeneous endogenous effects in networks. arXiv preprint arXiv:1908.00663. Ricci, C., Ingaldi, C., Grego, D., Alberici, L., Raffele, E., Pagano, N., Mosconi, C., Marco, M., Palloni, A., Brandi, G., Minni, F., & Casadei, R. (2020). The use of comprehensive complication Index® in pancreatic surgery: a comparison with the Clavien-Dindo system in a high volume center. HPB (in press). Thu, T., Nguyen, K., Hoang, H., Vo, X., & Nguyen, L. (2019). Dynamic Entrepreneurship, Planned Innovation and Firm Performance: Evidence from Vietnam. Emerging Markets Finance and Trade. Woodruff, C., Macchiavello, R., Menzel, A., & Rabbani, A. (2020). Challenges of Change: An Experiment Promoting Women to Managerial Roles in the Bangladeshi Garment Sector. Communications in Airline Economics Research (CAER), ISSN 2965-8225, é uma publicação de acesso aberto de artigos acadêmicos do Núcleo de Economia do Transporte Aéreo, do Instituto Tecnológico de Aeronáutica (ITA) (NECTAR-ITA). Essa série de estudos está voltada para análises dos aspectos econômicos da indústria de transporte aéreo no Brasil. Os trabalhos publicados na CAER são produzidos seguindo padrões rigorosos de cientificidade e reprodutibilidade, submetidos a uma avaliação interna criteriosa, mas não passam por revisão externa por pares. A publicação tem por objetivo ser uma plataforma para pesquisadores e estudantes da área Economia do Transporte Aéreo que os possibilite apresentar à sociedade a relevância de seus estudos, contribuindo com o desenvolvimento da economia brasileira.