scieee AI-readable full text Open interactive document viewer

Métodos de classificação supervisionada: aplicação ao Síndrome de Williams

Carla Filipa Sampaio Azevedo

Full text

Carla Azevedo M´ etodos de Classificac¸ ˜ ao Supervisionada: Aplicac¸ ˜ ao ao S´ındrome de Williams Departamento de Matem´ atica Faculdade de Ciˆ encias da Universidade do Porto 16 de Setembro de 2014 Carla Azevedo M´ etodos de Classificac¸ ˜ ao Supervisionada: Aplicac¸ ˜ ao ao S´ındrome de Williams Tese submetida ` a Faculdade de Ciˆ encias da Universidade do Porto para obtenc¸ ˜ ao do grau de Mestre em Matem´ atica Orientador: Prof. Doutor Joaquim Pinto da Costa Co-orientador: Prof.ł Doutora Ana Rita Gaio Departamento de Matem´ atica Faculdade de Ciˆ encias da Universidade do Porto 16 de Setembro de 2014 ` A minha m˜ ae, madrinha e av´ o... i Agradecimentos V´ arias foram as pessoas que contribu´ ıram para o desenvolvimento deste trabalho e portanto quero agradecer a todos aqueles que de alguma forma me ajudaram e apoiaram. Agradec¸o aos meus orientadores todo o aux´ ılio prestado nestes ´ ultimos meses em que fui aqui estudante. Quero agradecer em primeiro lugar ` a Professora Ana Rita Gaio, porque me deu os melhores conselhos e porque foi a sua energia invej´ avel que me levou realmente a gostar da ´ area em que estou e irei trabalhar daqui para a frente e ao Professor Joaquim Costa uma vez que me transmitiu conhecimentos de muita utilidade e que me permitiram atingir a pr´ oxima meta. Agredec¸o tamb´ em as suas cr´ ıticas construtivas que me fizeram crescer bastante enquanto estudante nestes ´ ultimos tempos. Agradec¸o tamb´ em aos meus professores que contribu´ ıram a v´ arios n´ ıveis na minha formac¸ ˜ ao, em especial ` a Professora Margarida Brito que sempre se mostrou dispon´ ıvel para toda e qualquer d´ uvida e ` a Professora Maria Jo˜ ao Rodrigues que me acompanhou ao longo destes cinco anos. Muito obrigada por me terem sempre mostrado o lado mais humano de ser Professor. Deixo tamb´ em um agradecimento especial ` a Liliana Maia que sempre se mostrou dispon´ ıvel para me ajudar e ensinar tudo o que podia e a quem deixo os votos de maior sucesso na sua vida profissional, bem como ` a Professora Adriana Sampaio, j´ a que sem ela este trabalho n˜ ao teria sido poss´ ıvel. Deixo tamb´ em um agradecimento muito especial ao Pedro Jo˜ ao por ter sido um dos principais respons´ aveis pela minha motivac¸ ˜ ao e inspirac¸ ˜ ao nestes cinco anos. N˜ ao existe para mim melhor exemplo de algu´ em que ama realmente o que faz o que ´ e de certa forma contagiante. Por fim, mas n˜ ao menos importante, agradec¸o muito ` a minha fam´ ılia e amigos toda a paciˆ encia e companheirismo durante este percurso. Deixo um agradecimento especial ` as minhas colegas e amigas de mestrado, Rita e Elisa, que partilharam sempre as suas preocupac¸ ˜ oes e sucessos comigo e aos meus amigos do mestrado “vizinho” principalmente ` a Carla, Miguel e como n˜ ao podia deixar de ser, ao Joel que durante estes dois anos me ajudou e ouviu, mostrando-se sempre dispon´ ıvel para me auxiliar e dar ˆ animo. A todos o meu obrigada! Carla Filipa Sampaio Azevedo ii Resumo ´ E cada vez mais importante compreender a relac¸ ˜ ao existente entre certas doenc¸as e o que se passa no nosso c´ erebro, de forma a conseguir-se um bom diagn´ ostico para os indiv´ ıduos nos quais essas doenc¸as se manifestam. Neste trabalho foi abordado um conjunto de t´ ecnicas matem´ aticas e de imagem de forma a identificarmos as regi˜ oes cerebrais mais importantes na manifestac¸ ˜ ao do S´ ındrome de Williams, uma doenc¸a rara, estudando as diferenc¸as de volume que existem entre indiv´ ıduos do grupo cl´ ınico e controlos. Outro objetivo foi averiguar se existe um bom modelo de classificac¸ ˜ ao que consiga identificar bem esses indiv´ ıduos. A primeira abordagem utiliza M´ aquinas de Vetores de Suporte, uma t´ ecnica de classificac¸ ˜ ao supervisionada cada vez mais usada nos dias de hoje em v´ arias ´ areas. Este m´ etodo foi estudado em detalhe e cuidadosamente aplicado ao problema descrito de forma a criar um modelo que consiga prever a classe de um novo indiv´ ıduo. De forma a aplicarmos esta t´ ecnica, utiliz´ amos Validac¸ ˜ ao Cruzada - um m´ etodo estat´ ıstico que divide a amostra total em v´ arias partic¸ ˜ oes e ajustando v´ arios modelos nos permite obter o que apresenta melhor performance. O outro tipo de abordagem consistiu na an´ alise dos voxels das imagens de ressonˆ ancia magn´ etica. As diferenc¸as estruturais do c´ erebro entre casos cl´ ınicos e controlos foram analisadas atrav´ es de um m´ etodo designado por Morfometria Baseada em Voxels (VBM, em inglˆ es). Esta an´ alise permitiu identificar as ´ areas cerebrais que apresentam diferenc¸as estatisticamente significativas quanto ao volume da substˆ ancia cinzenta e branca nos dois grupos de indiv´ ıduos estudados. Por fim, essas ´ areas foram ainda utilizadas para testar um modelo linear de m´ aquinas de vetores de suporte aplicado aos voxels dessas regi˜ oes, usando o software PRoNTo (vers˜ ao v1.1). Esta ´ ultima an´ alise foi repetida para os voxels de todo o c´ erebro. Neste trabalho conseguiu-se uma identificac¸ ˜ ao clara das ´ areas do c´ erebro relacionadas com a manifestac¸ ˜ ao do S´ ındrome de Williams atrav´ es das t´ ecnicas de classificac¸ ˜ ao aplicadas. iii Abstract The understanding of the relationship between certain diseases and what happens in our brain is becoming increasingly important. It will allow the achievement of a proper diagnosis for individuals with those diseases. In this work, we approached a set of mathematical and image techniques in order to identify the most important brain areas in the manifestation of Williams syndrome, a rare disease, studying the volume differences that exist between individuals in the clinical group and healthy controls. Another objective was to determine whether a good classification model for these individuals exist. The first approach used support vector machines, a supervised classification technique that has been increasingly used in various research fields. This method was studied in detail and carefully applied to the problem described above in order to create a model that was able to predict the class of any new individual. In order to apply this technique, we used Cross Validation - a statistical method that divides the total sample into several partitions and that adjusts the sub-models to thereby obtain the one with better performance. The other approach involved voxels analysis of MRI. Structural brain differences between cases and controls were analyzed using a method called Voxel Based Morphometry (VBM). This analysis allowed us for the identification of cerebral areas presenting statistically significant differences with respect to the volume of gray and white matter, in the two studied groups of individuals. Finally, these areas were also used to test a linear support vector machine model applied to the voxels of these regions, using the software PRoNTo, version v1.1. This last analysis was repeated for voxels of the entire brain. Through the applied classification techniques, this work was able to clearly identify the brain areas where the study should be focus whenever the Williams Syndrome is concerned. iv Lista de Tabelas 3.1 Tabela de custos (objetivo 1). . . . . . . . . . . . . . . . . . . . . . . . . . . 52 3.2 Tabela de valores de gama (objetivo 1). . . . . . . . . . . . . . . . . . . . . 54 3.3 Tabela da variac¸ ˜ ao dos valores do coeficiente (objetivo 1). . . . . . . . . . . 55 3.4 Tabela de variac¸ ˜ ao do parˆ ametro grau (objetivo 1). . . . . . . . . . . . . . . 57 3.5 Tabela da variac¸ ˜ ao do parˆ ametro gama (objetivo 3). . . . . . . . . . . . . . 71 4.1 Regi˜ ao onde o volume no c´ erebro poder´ a ser menor nos casos que nos controlos. ..................................... 80 4.2 Regi˜ oes cerebrais onde o volume poder´ a ser menor nos controlos que nos casos........................................ 81 v Lista de Figuras 1.1 Uma fronteira n˜ ao linear transforma-se numa fronteira linear num espac¸o de maiores dimens˜ oes.............................. 7 1.2 Visualizac¸ ˜ ao do hiperplano ´ otimo........................ 7 1.3 Representac¸ ˜ ao de poss´ ıveis hiperplanos separadores . . . . . . . . . . . . 12 1.4 Visualizac¸ ˜ ao do hiperplano ´ otimo e da m´ axima margem da figura anterior . 14 1.5 Visualizac¸ ˜ ao dos vetores de suporte. . . . . . . . . . . . . . . . . . . . . . . 14 1.6 Um classificador linear consegue separar qualquer permutac¸ ˜ ao de trˆ es pontos n˜ ao colineares de duas classes diferentes . . . . . . . . . . . . . . . 18 1.7 Influˆ encia da dimens˜ ao VC no risco emp´ ırico e garantido . . . . . . . . . . 19 1.8 Visualizac¸ ˜ ao da distˆ ancia entre dois hiperplanos . . . . . . . . . . . . . . . 24 1.9 Influˆ encia da adic¸ ˜ ao de observac¸ ˜ oes na definic¸ ˜ ao do hiperplano de m´ axima margem...................................... 27 1.10 Visualizac¸ ˜ ao de observac¸ ˜ oes que se situam do lado errado da margem e/ouhiperplano.................................. 28 1.11 Vari´ aveisdeafrouxamento ........................... 29 1.12 Visualizac¸ ˜ ao de um conjunto de dados n˜ ao linearmente separ´ avel . . . . . 32 1.13 Transformac¸ ˜ ao das observac¸ ˜ oes no espac¸o de entrada para o espac¸o das caracter´ ısticas .................................. 32 2.1 Esquema de Validac¸ ˜ ao Cruzada em 5-dobras . . . . . . . . . . . . . . . . . 41 2.2 Esquema de Validac¸ ˜ ao Cruzada “deixar um fora” . . . . . . . . . . . . . . . 42 vi 3.1 MVS - n´ ucleo linear (objetivo 1): visualizac¸ ˜ ao das classes por cor e dos vetores de suporte por cruzes. . . . . . . . . . . . . . . . . . . . . . . . . . 53 3.2 MVS - n´ ucleo radial (objetivo 1): visualizac¸ ˜ ao das classes por cor e dos vetores de suporte por cruzes. . . . . . . . . . . . . . . . . . . . . . . . . . 55 3.3 MVS - n´ ucleo sigm´ oide (objetivo 1): visualizac¸ ˜ ao das classes por cor e dos vetores de suporte por cruzes. . . . . . . . . . . . . . . . . . . . . . . . 57 3.4 MVS - n´ ucleo polinomial (objetivo 1): visualizac¸ ˜ ao das classes por cor e dos vetores de suporte por cruzes. . . . . . . . . . . . . . . . . . . . . . . . 58 3.5 MVS - n´ ucleo linear (objetivo 2): visualizac¸ ˜ ao das classes por cor e dos vetores de suporte por cruzes. . . . . . . . . . . . . . . . . . . . . . . . . . 66 3.6 MVS - n´ ucleo radial (objetivo 2): visualizac¸ ˜ ao das classes por cor e dos vetores de suporte por cruzes. . . . . . . . . . . . . . . . . . . . . . . . . . 69 3.7 MVS - n´ ucleo radial (objetivo 3): visualizac¸ ˜ ao das classes por cor e dos vetores de suporte por cruzes. . . . . . . . . . . . . . . . . . . . . . . . . . 72 4.1 Visualizac¸ ˜ ao do sistema de coordenadas tridimensional no c´ erebro. . . . . 77 4.2 Representac¸ ˜ ao de uma parte do c´ erebro onde se situam diferenc¸as significativas de volume entre casos e controlos . . . . . . . . . . . . . . . . . . 80 4.3 Representac¸ ˜ ao de uma parte do c´ erebro onde se situam diferenc¸as significativas de volume entre os dois grupos de indiv´ ıduos............ 81 5.1 Resultados para a an´ alise de todo o c´ erebro. ................. 85 5.2 Resultados para a an´ alise das regi˜ oes resultantes da an´ alise da MorfometriabaseadaemVoxels. ............................. 86 vii 4 Estrutura da Dissertac¸ ˜ ao No cap´ ıtulo 1 apresenta-se de forma aprofundada a teoria das M´ aquinas de Vetores de Suporte. Esta teoria serve de base ao Cap´ ıtulo 5. No cap´ ıtulo 2 estudamos a teoria dos M´ etodos de Validac¸ ˜ ao Cruzada mais comuns. No cap´ ıtulo 3 efetua-se uma an´ alise descritiva e explorat´ oria das vari´ aveis no estudo e aplicam-se m´ aquinas de vetores de suporte e m´ etodos de Validac¸ ˜ ao Cruzada ` a resoluc¸ ˜ ao dos objetivos enunciados na introduc¸ ˜ ao. No cap´ ıtulo 4 explora-se de forma breve todo o processo utilizado pelo SPM8 no pr´ e-processamento de imagens de ressonˆ ancia magn´ etica e a an´ alise de morfometria referida. No cap´ ıtulo 5 apresentam-se e interpretam-se os resultados da an´ alise das imagens cerebrais realizada pelo PRoNTo que utilizaram um m´ etodo de classificac¸ ˜ ao linear bin´ aria suportado pelas M´ aquinas de Vetores de Suporte. Por fim, termina-se com uma secc¸ ˜ ao de conclus˜ oes. Cap´ıtulo 1 M´ aquinas de Vetores de Suporte “The support vector network implements the following idea: Map the input vectors into a very high dimensional feature space Zthrough some non-linear mapping chosen a priori. Then construct an optimal separating hyperplane in this space.” Vladimir Vapnik in COLT interview As M´ aquinas de Vetores de Suporte (Support Vector Machine, em inglˆ es) tˆ em vindo a tornar-se um m´ etodo bastante utilizado nos ´ ultimos tempos. A teoria est´ a associada a um conjunto de t´ ecnicas de classificac¸ ˜ ao supervisionada que, devido ` a sua eficiˆ encia em v´ arios campos e relativamente simples manuseamento, tem vindo a suscitar uma crescente curiosidade no assunto. Este m´ etodo apresenta em geral resultados muito satisfat´ orios e tem vindo a merecer preferˆ encia em relac¸ ˜ ao o outros m´ etodos como as redes neuronais ou a discriminac¸ ˜ ao linear, por exemplo [Hearst, 1998]. Cada vez mais utilizado, o M´ etodo das M´ aquinas de Vetores de Suporte ´ e amplamente usado em classificac¸ ˜ ao de imagens, reconhecimento de caracteres e diagn´ ostico de doenc¸as, entre muitos outros. Mais ` a frente, neste cap´ ıtulo, ser´ a utilizado este m´ etodo para diagn´ ostico numa doenc¸a rara: S´ ındrome de Williams. Neste trabalho, vamos apresentar o M´ etodo das M´ aquinas de Vetores de Suporte (MVS) em detalhe e aplic´ a-lo a um problema de an´ alise discriminante onde o objetivo ´ e prever a classe de uma vari´ avel resposta bin´ aria a partir de outras vari´ aveis, vari´ aveis de entrada. Na aplicac¸ ˜ ao desta t´ ecnica de an´ alise supervisionada, existem dois passos fundamentais. Numa primeira fase de treino, o algoritmo modela os dados com classificac¸ ˜ ao 5 CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 6 j´ a conhecida. Posteriormente, h´ a a fase de teste em que o modelo encontrado analisa novos dados e ´ e avaliada a sua performance. As M´ aquinas de Vetores de Suporte destacam-se neste campo como uma das t´ ecnicas mais adequadas e elegantes, fornecendo resultados muito bons devido ` a sua grande eficiˆ encia. Mais ainda, as MVS possuem outras caracter´ ısticas muito atrativas que tˆ em vindo a influenciar o seu crescente uso [Smola and Bartlett, 2000]. Entre estas est´ a a boa capacidade de generalizac¸ ˜ ao, que se mede pela eficiˆ encia em classificar dados de teste. Deste modo, na classificac¸ ˜ ao evita-se o sobre-ajustamento aos dados, “overfitting”. O facto de apresentar robustez em grandes dimens˜ oes ´ e tamb´ em uma grande vantagem. Al´ em disso, a teoria das MVS est´ a bem definida e fundamentada na Matem´ atica e na Estat´ ıstica. Vapnik e Chernovenkis apresentaram os resultados desta metodologia h´ a mais de cinco d´ ecadas, fundamentados na Teoria da Aprendizagem Estat´ ıstica [Vapnik, 2000]. No entanto, as aplicac¸ ˜ oes pr´ aticas das MVS s˜ ao recentes, tendo tido in´ ıcio na d´ ecada de 90. 1.1 Ideias Fundamentais Quando as M´ aquinas de Vetores de Suporte foram introduzidas em aplicac¸ ˜ oes pr´ aticas, causaram um enorme impacto e surpresa em profissionais da ´ area da estat´ ıstica e de m´ etodos de aprendizagem. Isto foi devido em grande parte ` a sua boa performance em termos de resultados e ao facto da metodologia usada ser nova e portanto pouco abordada. O m´ etodo referido al´ em de eficiente, prima pela sua simplicidade, uma vez que se aplica um m´ etodo linear ao conjunto de dados cuja ideia base ´ e formar uma fronteira entre as classes de forma a que a margem que as separa seja maximizada. As MVS transportam os dados do espac¸o original dos valores de entrada, para um espac¸o cuja dimens˜ ao ´ e superior ` a original e n˜ ao linearmente relacionado com o primeiro. Assim, os dados podem estar bem separados e ´ e poss´ ıvel determinar fronteiras simples, como podemos ver na figura 1.1. Procura-se ent˜ ao um hiperplano que separe as duas classes e maximize a margem existente, ou seja, um plano que deva estar t˜ ao distanciado das classes quanto poss´ ıvel. O hiperplano que obedece a esta condic¸ ˜ ao diz-se hiperplano ´ otimo e pode ser escrito CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 7 Figura 1.1: Uma fronteira n˜ ao linear (` a esquerda) transforma-se numa fronteira linear num espac¸o de dimens˜ ao superior (` a direita) (adaptado de [Markowetz et al., 2003]) como combinac¸ ˜ ao linear de algumas observac¸ ˜ oes ` as quais chamamos vetores de suporte [Torgo, 2011], [James et al., 2013]. Figura 1.2: Visualizac¸ ˜ ao do hiperplano ´ otimo entre duas classes, vetores de suporte e margem m´ axima.1 Notemos que, para que tudo isto acontec¸a, ´ e necess´ ario que as MVS encontrem func¸ ˜ oes - func¸ ˜ oes n´ucleo (func¸ ˜ oes kernel, em inglˆ es)- no espac¸o original (espac¸o das vari´ aveis) que coincidam com o produto interno no espac¸o de dimens˜ ao superior. 1Imagem retirada de http://docs.opencv.org/doc/tutorials/ml/introduction to svm/introduction to svm.html CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 8 Assim, caso exista uma func¸ ˜ ao n´ ucleo, o processo ´ e bastante facilitado. A ideia de encontrar um hiperplano que separa os dados t˜ ao bem quanto poss´ ıvel enquanto permite algumas violac¸ ˜ oes nesta separac¸ ˜ ao, pareceu bastante diferente das aproximac¸ ˜ oes cl´ assicas de classificac¸ ˜ ao como a regress˜ ao log´ ıstica e a an´ alise discriminante linear [Hearst, 1998], por exemplo. Al´ em disso, a ideia de usar um n´ ucleo para expandir o espac¸o das caracter´ ısticas de forma a encontrar fronteiras n˜ ao lineares entre as classes pareceu ser uma caracter´ ıstica al´ em de fora do comum, excepcional. A primeira quest˜ ao prende-se ent˜ ao em saber de onde proveio este m´ etodo inovador. 1.2 M´ etodo do N´ucleo As M´ aquinas de Vetores de Suporte surgiram devido aos problemas apresentados pelo m´ etodo do n´ ucleo que comec¸ou a ser utilizado em problemas de previs˜ ao h´ a quase 50 anos. Na categoria deste tipo de m´ etodos incluem-se os que utilizam func¸ ˜ oes n´ ucleo. Em geral, as func¸ ˜ oes n´ ucleo tˆ em a seguinte forma: K(x, x0) = g(d(x, x0)) σ(1.1) onde d(x, x0)representa uma “distˆ ancia” entre xex0,σum parˆ ametro regulador e g(z)´ e uma func¸ ˜ ao decrescente [Friedman, 2006]. Desenvolvido por Nadaraya (1964) e Watson (1964) o m´ etodo do n´ ucleo apresentava elevadas desvantagens computacionais, uma vez que para efetuar uma previs˜ ao era necess´ ario analisar toda a base de dados, sendo que o M´ etodo das M´ aquinas de Vetores de Suporte apareceu como uma esp´ ecie de alternativa. No m´ etodo do n´ ucleo, fixa-se uma regi˜ ao tendo em conta um determinado volume a considerar; isto ´ e, o n´ umero de vizinhos Kde um indiv´ ıduo numa regi˜ ao depende do volume que se est´ a a considerar: K=K(V). Assim, depois de definido este volume e considerando uma determinada observac¸ ˜ ao Xi, verifica-se qual ´ e a classe mais representada nesse volume e atribui-se essa classe ao indiv´ ıduo, no caso de um n´ ucleo uniforme [J. P. Costa, 2011]. Segundo Friedman [Friedman, 2006], considerando como regi˜ ao um hipercubo de dimens˜ ao p, com aresta he centrado num ponto x, vem que: CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 9 K=K(V) = n X i=1 Kx−Xi h= n X i=1 πiˆpi(x) onde πirepresenta a probabilidade a priori de xpertencer ` a classe ieˆpi(x)´ e a func¸ ˜ ao densidade de probabilidade de x. No m´ etodo do n´ ucleo, assumem-se estimadores para as func¸ ˜ oes densidade de probabilidade. Tendo em conta a equac¸ ˜ ao anterior, tem-se que o estimador da func¸ ˜ ao densidade de probabilidade para uma observac¸ ˜ ao xque pertence a uma classe wj´ e dado por: ˆpj(x) = 1 nj·hpX Xi∈wj Kx−Xi h Tem-se portanto que a probabilidade a posteriori de um determinado indiv´ ıduo pertencer ` a classe wj´ e dada por: ˆ P(wj|x) = πjˆpj(x) Plπlˆpl(x)=PXi∈wjK(x−Xi h) Pn l=1 K(x−Xi h) O estimador apresentado pode ser assumido como uma m´ edia ponderada de y0 is caso seja definido da seguinte forma: ˆy(x) = ˆ E[y|x] = Fn(x) = Pn i=1 yiK(x, xi) Pn i=1 K(x, xi) onde K(x, xi)denota um peso que ´ e dependente da localizac¸ ˜ ao dos seus parˆ ametros x exi. ´ E a esta func¸ ˜ ao peso que chamamos func¸ ˜ ao n´ ucleo. Assumimos que esta func¸ ˜ ao ´ e estritamente positiva [Friedman, 2006]. Como supramencionado, para fazer uma previs˜ ao ´ e necess´ ario examinar toda a base de dados, o que envolve muito uso da mem´ oria RAM. Dada a sua capacidade computacional reduzida, este m´ etodo caiu em desuso na pr´ atica. Tome-se em atenc¸ ˜ ao que aqui existem apenas estimadores sendo estes pouco interpret´ aveis. N˜ ao obstante, a maior limitac¸ ˜ ao ´ e estat´ ıstica: a performance depende muito da distˆ ancia entre xexiusada. Como forma de contornar este problema, surgiram as M´ aquinas de Vetores de Suporte. Inicialmente, foram introduzidas para o caso de duas classes, por´ em j´ a existem v´ arias estrat´ egias para um n´ umero de classes superior a dois, como veremos mais ` a frente. CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 10 Uma M´ aquina de Vetores de Suporte ´ e conhecida como sendo um classificador do n´ ucleo pesado [Friedman, 2006], na medida em que apenas acrescenta ao estimador do m´ etodo do n´ ucleo um parˆ ametro αi, obtendo-se desta forma: ˆy(x) = sign( ˆ E[y|x]) = sign n X i=1 αiyiK(x, xi)! O objetivo ser´ a ent˜ ao que quase todos os coeficientes αisejam zero. Neste m´ etodo, a ideia base ´ e formar uma fronteira entre as classes, de modo que a margem que as separa seja maximizada usando func¸ ˜ oes n´ ucleo no espac¸o de dimens˜ ao inicial que sejam iguais a um produto interno noutro espac¸o de dimens˜ ao superior. Assim sendo, as m´ aquinas transportam os dados de treino para um espac¸o cuja dimens˜ ao ´ e superior ` a dimens˜ ao inicial para que neste novo espac¸o, os dados possam estar bem separados e possa ser poss´ ıvel determinar fronteiras (atrav´ es de um produto interno efectuado neste espac¸o). Em resumo, caso exista uma func¸ ˜ ao n´ ucleo, K(x, xi), no espac¸o de dimens˜ ao inicial ` a qual lhe corresponda um produto interno num espac¸o de dimens˜ ao superior, o algoritmo de aprendizagem passa a usar apenas K(x, xi), facilitando assim todos os c´ alculos. 1.3 Conceitos fundamentais: Classificador de M´ axima Margem usando um Hiperplano Separador Como referido, o nosso objetivo ser´ a ent˜ ao separar duas classes de observac¸ ˜ oes, atrav´ es do Hiperplano ´ Otimo. Num espac¸o de dimens˜ ao m, um hiperplano ´ e um subespac¸o afim de dimens˜ ao m−1. Por exemplo, em duas dimens˜ oes, um hiperplano ´ e um subespac¸o unidimensional. Em trˆ es dimens˜ oes, um hiperplano ´ e um subespac¸o de dimens˜ ao 2. Por outras palavras, uma reta e um plano, respetivamente. Para uma dimens˜ ao m > 3a noc¸ ˜ ao de um subespac¸o de dimens˜ ao m−1ainda se aplica. Generalizando, a equac¸ ˜ ao: β0+β1x1+β2x2+... +βmxm= 0 (1.2) CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 11 com β0, β1, ..., βm∈R, define um hiperplano mdimensional em Rm. Da mesma forma, se um vetor de dimens˜ ao m,X= (x1, x2, ..., xm), satisfaz a equac¸ ˜ ao do hiperplano definida, ent˜ ao este vetor pertence ao hiperplano. Suponhamos agora que Xn˜ ao satisfaz a equac¸ ˜ ao do hiperplano que definimos. Temos ent˜ ao que Xou cai no lado do hiperplano definido por: β0+β1x1+β2x2+... +βmxm>0(1.3) Ou no outro lado do hiperplano: β0+β1x1+β2x2+... +βmxm<0(1.4) Podemos ent˜ ao pensar que o hiperplano definido em (1.2) divide o espac¸o de dimens˜ ao mem duas metades. Se agora quisermos saber onde se situa um ponto qualquer, basta sabermos que sinal tem a func¸ ˜ ao que define o hiperplano [James et al., 2013]. Suponhamos ent˜ ao que temos uma matriz de dados Xde dimens˜ ao n×mque consiste de nobservac¸ ˜ oes de treino num espac¸o de dimens˜ ao me que todas as observac¸ ˜ oes contˆ em uma etiqueta que as colocam numa de duas classes: yi∈ {−1,1}para i= 1, ..., n onde -1 representa uma classe e a outra ´ e representada por 1. Temos tamb´ em um vetor de dimens˜ ao mcom caracter´ ısticas observadas, x∗= (x∗ 1, ..., x∗ m)T. Como suprareferido, o objetivo ser´ a encontrar um classificador baseado nos dados de treino que ir´ a classificar corretamente uma nova observac¸ ˜ ao de teste. Suponhamos que ´ e poss´ ıvel construir um hiperplano que separa as observac¸ ˜ oes de treino perfeitamente de acordo com a sua classe. Para ser de mais f´ acil visualizac¸ ˜ ao, a figura a seguir ilustra a situac¸ ˜ ao em duas dimens˜ oes. Como ´ e esperado, existem infinitas possibilidades para o plano separador: CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 12 Figura 1.3: Representac¸ ˜ ao de 7 poss´ ıveis hiperplanos separadores.1 Como podemos verificar atrav´ es da figura, no caso para duas classes que s˜ ao linearmente separ´ aveis, existem infinitas escolhas para um plano que as separe. Uma nova observac¸ ˜ ao que caia “abaixo” de um destes hiperplanos ser´ a colocada na classe dos quadrados. Por outro lado, se cair “acima” destes, ser´ a colocada na classe dos c´ ırculos. Ser´ a portanto essa a regra de decis˜ ao executada por um classificador, neste caso. Considerando ent˜ ao a forma como definimos o hiperplano, vem que: β0+β1xi1+β2xi2+... +βmxim >0se yi= 1 (1.5) e β0+β1xi1+β2xi2+... +βmxim <0se yi=−1(1.6) Equivalentemente, temos que: yi(β0+β1xi1+β2xi2+... +βpxim)>0para i= 1, ..., n. (1.7) Note-se que esta simplificac¸ ˜ ao se deve ao facto de que yi∈ {−1,1}. 1Imagem retirada de http://computersciencesource.wordpress.com/2010/01/29/year-2-machinelearning-support-vector-machines/ CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 13 Se um hiperplano separador existe, podemos us´ a-lo para construir um classificador que surge muito naturalmente: um novo indiv´ ıduo ´ e colocado numa classe dependendo de que lado do hiperplano cai. Esta foi a situac¸ ˜ ao descrita acima: uma nova observac¸ ˜ ao x∗´ e classificada de acordo com o sinal de f(x∗) = β0+β1x∗ 1+β2x∗ 2+... +βmx∗ m. Se f(x∗)´ e positivo, ent˜ ao x∗ pertencer´ a` a classe com etiqueta 1. Se f(x∗)´ e negativo, ent˜ ao pertencer´ a` a classe com etiqueta −1. Mais ainda, se o valor de f(x∗)´ e muito superior a zero, ent˜ ao a observac¸ ˜ ao encontrase longe do hiperplano. Pelo contr´ ario, se f(x∗)for pr´ oxima de zero, ent˜ ao x∗encontra-se muito pr´ oxima do hiperplano e por consequˆ encia podemos ter mais certeza acerca da classe atribu´ ıda no primeiro caso que no ´ ultimo. Podemos portanto inferir acerca da “magnitude” de f(x∗)j´ a que o hiperplano considerado ´ e linear [James et al., 2013]. Se os dados com que estamos a trabalhar puderem ser perfeitamente separados usando um hiperplano, ent˜ ao como na figura 1.3, existem infinitos hiperplanos capazes de separar as duas classes. Assim, temos de ter uma regra de decis˜ ao que nos ajude a encontrar qual dos hiperplanos poss´ ıveis ´ e o hiperplano a usar. Ou, de outra forma, quais s˜ ao os valores de βieβ0(i∈ {1, ..., n}) mais convenientes. Parece ´ obvio que o Hiperplano ´ Otimo (tamb´ em chamado de Hiperplano de M´ axima Margem) ´ e o hiperplano separador que se encontra mais longe das observac¸ ˜ oes de treino e que separa as duas classes. Este hiperplano ´ e encontrado quando se consideram as distˆ ancias perpendiculares de cada observac¸ ˜ ao de treino a um dado hiperplano separador. A margem ´ e a distˆ ancia m´ ınima das observac¸ ˜ oes ao hiperplano. O hiperplano ´ otimo ser´ a aquele cuja margem ser´ a maior. Sumariando, podemos ent˜ ao classificar uma nova observac¸ ˜ ao teste x∗baseandonos no lado do hiperplano ´ otimo onde esta caiu conforme o sinal de f(x∗). 1Imagem retirada de http://computersciencesource.wordpress.com/2010/01/29/year-2-machinelearning-support-vector-machines/ CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 20 que estes corrompem a qualidade do treino e como consequˆ encia, inflacionam o risco garantido. Surpreendentemente, valores muito altos de hconduzem tamb´ em a resultados fracos, o que estar´ a de certa forma relacionado com o efeito de sobre-ajustamento/overfitting, ou seja, quando o classificador se molda excessivamente ao conjunto de treino podendo por isso vir a ter um desempenho fraco na altura de avaliar casos novos. OPrinc´ıpio da Minimizac¸ ˜ ao do Risco Estrutural vai portanto passar pela gest˜ ao ponderada destes dois efeitos, procurando os valores ´ otimos para os quais o erro de generalizac¸ ˜ ao ´ e m´ ınimo. Embora estes dois teoremas caracterizem o risco funcional de forma razoalvelmente completa, na pr´ atica esta caracterizac¸ ˜ ao apresenta alguns problemas: calcular os limites descritos n˜ ao ´ e uma tarefa f´ acil e pode haver problemas tamb´ em quando a dimens˜ ao VC de uma classe de func¸ ˜ oes ´ e desconhecida ou infinita [Muller et al., 2001]. Apesar de na literatura haver outra forma de definir os limites apresentados, bem como outras medidas da complexidade, a maior parte apresenta os mesmos problemas. Uma das consequˆ encias mais importantes deste princ´ ıpio ´ e o Teorema de Vapnik da margem de separac¸ ˜ ao que ser´ a apresentado de seguida. Estes limites fornecem tamb´ em um suporte te´ orico importante na formulac¸ ˜ ao de estrat´ egias para a gerac¸ ˜ ao de classificadores. Mais, os resultados da Teoria da Aprendizagem Estat´ ıstica suportam assim as ideias apresentadas no cap´ ıtulo anterior. 1.4.2 Dimens˜ ao Vapnik–Chervonenkis e Margem Recordando o que vimos no primeiro cap´ ıtulo desta secc¸ ˜ ao, a margem de um classificador ´ e definida como sendo a menor distˆ ancia entre os dados do conjunto de treino e o hiperplano utilizado na separac¸ ˜ ao desses dados em classes. O teorema a seguir apresentado relaciona a dimens˜ ao VC de func¸ ˜ oes de decis˜ ao e a margem do classificador. Teorema 3 (Vapnik).Dado um classificador linear G(x) = sign(w·x+b)num espac¸o de dimens˜ ao m, a sua dimens˜ ao VC, h, sobre um conjunto de treino onde todos os dados pertencem ` a esfera de raio Rverifica: h≤min R2 ρ2, m + 1(1.16) CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 21 onde ρ´ e a margem do hiperplano. Repare-se que atrav´ es deste resultado vem que a dimens˜ ao VC de um conjunto de func¸ ˜ oes lineares pode ser menor que m+1 como foi referido atr´ as em que n˜ ao se levava em conta a margem [Smola and Bartlett, 2000]. Este teorema completa portanto a noc¸ ˜ ao de dimens˜ ao VC para fronteiras lineares. Segundo este teorema, daqui retiramos raz˜ oes para acreditar que o hiperplano ´ otimo em termos de performance ´ e aquele que assegura maior margem de separac¸ ˜ ao entre as duas classes no conjunto de treino, j´ a que minimiza a dimens˜ ao VC impondo dessa forma uma maior restric¸ ˜ ao ao risco funcional. Vejamos agora outras noc¸ ˜ oes importantes para o estudo: Teorema 4. Seja ρa margem de um classificador ftal que f(xi) = (xi·w+b). Entende-se por margem: ρ= min iyif(xi)tal que ρ > 0(1.17) e seja Rρ(f)o erro marginal de ftal que este ´ e definido como o n´ umero de observac¸ ˜ oes do conjunto de treino que tˆ em margem menor do que ρ: Rρ(f) = 1 n n X i=1 |yif(xi)|< ρ (1.18) onde n´ eon´ umero de total de dados de treino. Seja ainda Go conjunto de func¸ ˜ oes g(x) = sign(f(x)) = sign(w·x+b)tal que kwk ≤ Λekxk ≤ Υpara algum Υ,Λ>0. Para todas as distribuic¸ ˜ oes P, com probabilidade de pelo menos 1−λsobre n dados e para qualquer ρ > 0eλ∈(0,1), a probabilidade de uma observac¸ ˜ ao de teste ser classificada de forma errada segundo P´ e limitada superiormente por Rρ(g) + sc nΥ2Λ2 ρ2ln2n+ ln 1 ρ(1.19) onde c ´ e uma constante e o ´ ultimo termo ´ e um termo de confianc¸a. Este limite n˜ ao se refere a um ´ unico classificador mas sim a um conjunto deles treinados em diferentes conjuntos de dados gerados com a mesma distribuic¸ ˜ ao de probabilidade P. Verifica-se ent˜ ao que: CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 22 1) O risco funcional ´ e limitado pela soma do erro marginal com um termo de confianc¸a e tende para 0 quando n→ ∞. 2) O termo de confianc¸a pode ser minimizado mantendo-se ΥeΛpequenos e maximizando a margem ρ. 3) Apesar da maximizac¸ ˜ ao da margem levar a um termo de confianc¸a mais pequeno, permitimos que o erro marginal se torne maior, uma vez que ´ e mais dif´ ıcil obedecer ` a restric¸ ˜ ao de todos os dados de treino estarem distantes de uma margem maior que o hiperplano separador. 4) Um valor de ρbaixo, conduz-nos a um erro marginal menor, no entanto o termo de confianc¸a aumenta. O hiperplano que se procura ´ e ent˜ ao o que tem margem ρalta e comete poucos erros marginais, minimizando-se assim o erro sobre as observac¸ ˜ oes de treino e de teste. O hiperplano que possui esta margem ´ e portanto o hiperplano ´ otimo. 1.5 M´ aquinas de Vetores de Suporte com Margens R´ıgidas Consideremos o problema de classificac¸ ˜ ao mais simples, com apenas duas vari´ aveis de sa´ ıda. Suponhamos que se deseja classificar objetos m-dimensionais x= (x1, x2, ..., xm) nas classes +1 e -1, sendo que, o conjunto de treino consiste de nobservac¸ ˜ oes tais que xi∈Rm. Vejamos primeiro o caso em que as classes s˜ ao linearmente separ´ aveis. Esta abordagem foi quase de forma impl´ ıcita estudada at´ e aqui. As MVS obtidas nestes casos designam-se por M´ aquinas de Vetores de Suporte com margens r´ıgidas. 1.5.1 Casos Linearmente Separ´ aveis Mais uma vez, suponhamos que temos um conjunto de treino constitu´ ıdo por N pares (x1, y1),(x2, y2), ..., (xN, yN)onde xi∈Rmeyi∈ {−1,1}a etiqueta da classe de cada indiv´ ıduo considerado no conjunto. Esse conjunto ´ e linearmente separ´ avel se ´ e poss´ ıvel separar as duas classes por pelo menos um hiperplano. Quando estamos nesta situac¸ ˜ ao dizemos que o classificador ´ e linear e podem ser definidos pela equac¸ ˜ ao do CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 23 hiperplano w·x+b= 0 sendo como j´ a vimos w·xum produto escalar entre os vetores wex,wo vetor normal ao hiperplano e bum termo de confianc¸a. O par (w, b)´ e determinado na fase de treino. Tamb´ em como j´ a vimos, esta equac¸ ˜ ao divide o espac¸o de entrada em duas regi˜ oes:    w·x+b > 0 w·x+b < 0(1.20) E, finalmente, a classificac¸ ˜ ao realizada ser´ a:    yi= +1,se w·xi+b > 0 yi=−1,se w·xi+b < 0(1.21) Assim, um conjunto de treino ´ e linearmente separ´ avel se ´ e poss´ ıvel encontrar pelo menos um par (w, b), isto ´ e, um hiperplano que separe completamente as duas classes e uma func¸ ˜ ao ˆ f(x) = yif(x)que consiga classificar qualquer elemento do conjunto [Burges, 1998]. Note-se que: 1) Deve-se escolher o classificador com o menor risco emp´ ırico. No caso do conjunto de dados linearmente separ´ avel esta condic¸ ˜ ao ´ e com certeza satisfeita para pelo menos um par (w, b)definido pela equac¸ ˜ ao anterior do hiperplano. 2) O classificador deve satisfazer a restric¸ ˜ ao de pertencer a uma fam´ ılia com dimens˜ ao VC pequena. Ora, pelo resultado que relaciona o risco funcional com a margem de separac¸ ˜ ao entre as observac¸ ˜ oes e o hiperplano separador (Teorema 4), basta para satisfazer esta condic¸ ˜ ao. Definimos atr´ as margem da seguinte forma: ρ= min i(yif(xi)) com ρ > 0(1.22) E como j´ a referimos, de entre todos os classificadores que minimizam o risco emp´ ırico, deve-se escolher o que possui maior margem, o hiperplano ´ otimo. CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 24 1.5.2 Construc¸ ˜ ao do Hiperplano ´ Otimo para Margens R´ıgidas Vejamos agora como construir o hiperplano ´ otimo de uma MVS linear para conjuntos linearmente separ´ aveis. Alterando os parˆ ametros webde forma a que os pontos mais pr´ oximos do hiperplano separador satisfac¸am |w·x+b|= 1, obtemos a representac¸ ˜ ao can´ onica do hiperplano. Assim:    w·xi+b≥+1,se yi= +1 w·xi+b≤ −1,se yi=−1para i= 1, ..., n (1.23) caracteriza os classificadores lineares que separam o conjunto de treino com uma margem positiva. Assim sendo, n˜ ao existem pontos entre w·x+b= 0 ew·x+b=±1.´ E portanto este o motivo pelo que chamamos ` as MVS assim obtidas, M´ aquinas de Vetores de Suporte de margens r´ ıgidas. Suponhamos agora que escolhemos um ponto x1que se situa sobre w·x+b=−1 e um ponto x2que se situa sobre w·x+b= +1. Suponhamos tamb´ em que x1intercepta a reta perpendicular a x2como ilustrado na figura seguinte: Figura 1.8: Visualizac¸ ˜ ao da distˆ ancia dentre os hiperplanos referidos (adaptada de [Hearst, 1998]). CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 25 Obtemos assim o seguinte sistema:    w·x1+b=−1 w·x2+b= +1 (1.24) Tomando b= 0 j´ a que estamos a considerar a representac¸ ˜ ao can´ onica temos, equivalentemente, w·(x2−x1) = 2. Como wex2−x1s˜ ao ortogonais ao hiperplano separador por definic¸ ˜ ao, podemos escrever: |w·(x2−x1)|=kwk×kx2−x1k(1.25) Como j´ a vimos que w·(x2−x1)=2e juntando com esta ´ ultima equac¸ ˜ ao obtida, ficamos com a norma kx2−x1k=2 kwkque mede a distˆ ancia entre os dois hiperplanos, 2 kwk. Vejamos tamb´ em que a distˆ ancia entre o hiperplano w·x+b= 0 e cada um dos hiperplanos referidos ´ e1 kwk, como ilustrado na figura. Encontra-se o hiperplano ´ otimo minimizando kwkpois ´ e o que leva a uma maximizac¸ ˜ ao da margem. Note-se que suposemos que a margem ´ e sempre superior ` a distˆ ancia 1 kwk. Isto conduz-nos ao seguinte problema de otimizac¸ ˜ ao quadr´ atica [Friedman, 2006]: Minimizar kwk2 Sujeito a yi(w·xi+b)−1≥0,para i= 1, ..., n Este problema, denominado em otimizac¸ ˜ ao um problema de programac¸ ˜ ao quadr´ atica, ´ e ent˜ ao reduzido a uma forma que pode ser resolvida de forma simples introduzindo uma func¸ ˜ ao Lagrangiana definida em termos de webque ´ e a apresentada de seguida: L(w, b, α) = 1 2kwk2− n X i=1 αi(yi(w·xi+b)−1) (1.26) onde os αis˜ ao denominados multiplicadores de Lagrange. O problema passa ent˜ ao a ser a minimizac¸ ˜ ao de we de be a maximizac¸ ˜ ao dos αi. Os pontos ´ otimos desta equac¸ ˜ ao s˜ ao obtidos pela resoluc¸ ˜ ao de δL δb = 0 eδL δw = 0 que levam aos seguintes resultados: n X i=1 αiyi= 0 (1.27) CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 26 w= n X i=1 αiyixi(1.28) Substituindo estes dois resultados na func¸ ˜ ao Lagrangiana definida obtemos o problema de otimizac¸ ˜ ao dual: Maximizar Pn i=1 αi−1 2Pn i=1 Pn j=1 αiαjyiyjxi·xj Sujeito a αi≥0ePn i=1 αiyi= 0, para i= 1, ..., n Ap´ os o c´ alculo do valor ´ otimo 1α∗, procede-se ao c´ alculo de w∗eb∗por substituic¸ ˜ ao nas condic¸ ˜ oes anteriores. Estes valores ir˜ ao definir o hiperplano ´ otimo. Portanto, tentamse encontar os valores de α∗de forma a determinar (w∗, b∗). Demonstra-se que os α∗assumem valores positivos para dados de treino que s˜ ao vetores de suporte. Para os outros dados de treino, os α∗s˜ ao nulos. Como consequˆ encia, o hiperplano ´ otimo ´ e apenas determinado pelos vetores de suporte e por essa raz˜ ao, s˜ ao considerados os exemplos mais informativos. Os restantes dados n˜ ao ter˜ ao portanto interferˆ encia na determinac¸ ˜ ao e definic¸ ˜ ao do hiperplano ´ otimo. Isto vai de encontro ao que j´ a se tinha referido nos dois primeiros cap´ ıtulos. Uma vez fixos os valores de w∗eb∗, o classificador extra´ ıdo ´ e definido pela seguinte func¸ ˜ ao: g(x) = sign(f(x)) = sign(X xi∈V α∗ iyixi·x+b∗) =    +1,se Pxi∈Vα∗ iyixi·x+b∗>0 −1,se Pxi∈Vα∗ iyixi·x+b∗<0 (1.29) onde Vdesigna o conjunto dos vetores de suporte. Daqui, verifica-se que a classificac¸ ˜ ao de uma nova observac¸ ˜ ao xapenas requer o c´ alculo do produto interno entre xe cada um dos vetores de suporte. ´ E f´ acil ver que o classificador aqui apresentado n˜ ao ´ e no entanto eficaz quando encontramos outro tipo de bases de dados n˜ ao separ´ aveis linearmente. Desta forma, surge a extens˜ ao da teoria apresentada para conjuntos de dados mais gerais suavizando as restric¸ ˜ oes das margens de separac¸ ˜ ao que aqui apresentamos. 1Note-se que os valores ´ otimos est˜ ao representados com o s´ ımbolo * CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 27 1.6 M´ aquinas de Vetores de Suporte com Margens Suaves Neste cap´ ıtulo veremos a teoria que suporta outro tipo de conjunto de dados e, apesar dos classificadores gerados continuarem a ser lineares no espac¸o inicial, iremos permitir que alguns erros de classificac¸ ˜ ao possam ocorrer. De facto, poder´ a valer a pena n˜ ao classificar bem algumas observac¸ ˜ oes de forma a obtermos melhores resultados nas restantes observac¸ ˜ oes. Figura 1.9: ` A esquerda, duas classes de observac¸ ˜ oes s˜ ao separadas pelo hiperplano de m´ axima margem. ` A direita, uma observac¸ ˜ ao da classe dos c´ ırculos azuis foi adicionada conduzindo a uma mudanc¸a do hiperplano de m´ axima margem (linha ponteada). Agora, o hiperplano de m´ axima margem obtido est´ a representado pela linha preta a cheio (adaptado de [James et al., 2013]). O classificador de margem suave faz exatamente isto. Em vez de procurar a maior margem poss´ ıvel e portanto que cada observac¸ ˜ ao esteja do lado correto do hiperplano e da margem, permite que algumas observac¸ ˜ oes estejam do lado incorreto da margem ou at´ e do lado incorreto do hiperplano. Da´ ı a designac¸ ˜ ao de margem “suave”. Assim, a margem diz-se suave se pode ser violada por algumas das observac¸ ˜ oes de treino. Clarificando, algumas observac¸ ˜ oes poder˜ ao estar no lado errado da margem e outras, n˜ ao apenas no lado errado da margem mas tamb´ em no lado errado do hiperplano. De facto, quando n˜ ao existe um hiperplano separador, esta situac¸ ˜ ao ´ e inevit´ avel. CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 28 Figura 1.10: A observac¸ ˜ ao contornada a amarelo situa-se no lado errado da margem enquanto que a observac¸ ˜ ao rodeada a castanho se encontra tanto do lado errado da margem como do hiperplano (adaptado de [Muller et al., 2001]). Observac¸ ˜ oes que se situam no lado errado do hiperplano correspondem a observac¸ ˜ oes de treino que s˜ ao mal classificadas. De forma a conseguirmos contornar o problema, introduzem-se-se vari´ aveis de afrouxamento ζ(slack, em inglˆ es) que medem a distˆ ancia das observac¸ ˜ oes (xi, yi)em relac¸ ˜ ao aos hiperplanos w·x+b=±1e s˜ ao definidas pelas seguintes equac¸ ˜ oes [Friedman, 2006]: Quando yi= +1: ζi(w, b) =    0,se w·xi+b≥1 1−w·xi+b, se w·xi+b < 1 (1.30) Quando yi=−1: ζi(w, b) =    0,se w·xi+b≤ −1 1 + w·xi+b, se w·xi+b > −1 (1.31) Estas vari´ aveis “suavizam” as restric¸ ˜ oes que foram de certa forma impostas na CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 29 determinac¸ ˜ ao do hiperplano ´ otimo admitindo a ocorrˆ encia de algumas observac¸ ˜ oes mal classificadas. A interpretac¸ ˜ ao destas ´ e a seguinte: a vari´ avel de afrouxamento ζidiz-nos onde se encontra a i-´ esima observac¸ ˜ ao relativamente ` a margem e ao hiperplano. Se ζi= 0, ent˜ ao a i-´ esima observac¸ ˜ ao est´ a no lado correto da margem. Se ζi≥0, ent˜ ao a i-´ esima observac¸ ˜ ao situa-se no lado errado da margem e diz-se que violou a margem. Se ζi≥1, ent˜ ao a observac¸ ˜ ao situa-se no lado errado do hiperplano. Figura 1.11: Vari´ aveis de afrouxamento (adaptado de [Betancourt, 2005]). Note-se que, tal como na situac¸ ˜ ao abordada no caso dos dados linearmente separ´ aveis, neste caso tamb´ em se procura maximizar a margem de separac¸ ˜ ao evitando o maior n´ umero de observac¸ ˜ oes mal classificadas. Esta maximizac¸ ˜ ao ´ e realizada atrav´ es da minimizac¸ ˜ ao de kwktal como foi feito atr´ as. 1.6.1 Construc¸ ˜ ao do Hiperplano ´ Otimo para Margens Suaves A determinac¸ ˜ ao do hiperplano ´ otimo ir´ a aqui consistir em encontrar (w∗, b∗)que minimize (w, b) = kwk2+C n X i=1 ζi(w, b)(1.32) onde C´ e um parˆ ametro n˜ ao negativo. Introduz-se portanto uma penalizac¸ ˜ ao por violac¸ ˜ ao da margem. CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 36 K(xi, xj) = tanh(axT ixj+r)(1.44) onde aers˜ ao parˆ ametros constantes com qualquer sinal. A obtenc¸ ˜ ao de um classificador utilizando M´ aquinas de Vetores de Suporte envolve portanto a escolha de uma func¸ ˜ ao n´ ucleo adequada, al´ em de parˆ ametros desta func¸ ˜ ao e do algoritmo para a determinac¸ ˜ ao do hiperplano ´ otimo. A escolha do n´ ucleo e dos parˆ ametros associados a este tˆ em um enorme impacto no desempenho do classificador obtido pois s˜ ao estes parˆ ametros que definem a fronteira de decis˜ ao a utilizar [Muller et al., 2001]. Existem por isso t´ ecnicas para seleccionar o melhor modelo. A que iremos utilizar no pr´ oximo cap´ ıtulo de aplicac¸ ˜ ao pr´ atica ser´ a a Validac¸ ˜ ao Cruzada. Mais ` a frente, no cap´ ıtulo de aplicac¸ ˜ ao pr´ atica, estes n´ ucleos ser˜ ao estudados com maior pormenor bem como a escolha dos parˆ ametros. 1.8 M´ aquinas de Vetores de Suporte para mais de duas classes At´ e aqui a discuss˜ ao esteve limitada ao caso em que fazemos classificac¸ ˜ ao bin´ aria, isto ´ e, classificac¸ ˜ ao num conjunto com duas classes. Podemos depois estender ao caso mais geral onde temos um n´ umero arbitr´ ario de classes. O conceito de hiperplano separador no qual as MVS se baseiam n˜ ao se aplica naturalmente quando temos mais de duas classes. Exitem no entanto duas maneiras populares de estender as MVS para o caso em que temos T-classes: one-versus-one (um contra um) e one-versus-all (um contra todos). 1.8.1 Classificac¸ ˜ ao Um-Contra-Um Suponhamos que queremos realizar classificac¸ ˜ ao usando MVS e que existem mais que duas classes. Este tipo de classificac¸ ˜ ao “um-contra-um” constr´ oi T 2!M´ aquinas de Vetores de Suporte, cada uma das quais compara um par de classes. Por exemplo, uma s´ o MVS compara a t-´ esima classe codificada como +1 com a t0-´ esima classe codificada como -1. CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 37 Classificamos uma observac¸ ˜ ao teste usando cada um dos T 2!classificadores e contamos o n´ umero de vezes que a observac¸ ˜ ao teste ´ e atribu´ ıda a cada uma das T classes. A classificac¸ ˜ ao final ´ e feita de acordo com a classe onde a observac¸ ˜ ao teste caiu mais frequentemente [James et al., 2013]. Este m´ etodo tem a desvantagem de n˜ ao ser poss´ ıvel prever limites no erro de generalizac¸ ˜ ao atrav´ es do seu uso e o tempo de treino pode ser longo. Conduz tamb´ em a regi˜ oes de indefinic¸ ˜ ao. 1.8.2 Classificac¸ ˜ ao Um-Contra-Todos A aproximac¸ ˜ ao “um-contra-todos” ´ e uma alternativa para aplicar as MVS ao caso em que temos mais que duas classes. Ajustamos TM´ aquinas de Vetores de Suporte, comparando uma das Tclasses ` as restantes T−1classes de cada vez. Seja β0t, β1tx∗ 1, β2tx∗ 2, . . . , βptx∗ mos parˆ ametros que resultam de ajustar uma MVS comparando a classe tcodificada como +1 ` as restantes, codificadas como -1. Seja x∗uma observac¸ ˜ ao teste. Atribu´ ımos ` a observac¸ ˜ ao a classe para a qual β0t+ β1tx∗ 1+β2tx∗ 2+. . . +βptx∗ m´ e maior, uma vez que isto conduz a um n´ ıvel mais alto de confianc¸a que a observac¸ ˜ ao teste pertenc¸a ` at-´ esima classe em vez de a qualquer outra classe [James et al., 2013]. 1.9 Vantagens e Inconvenientes do uso das MVS A selecc¸ ˜ ao do melhor n´ ucleo para os dados que se quer analisar n˜ ao ´ e obviamente um processo simples sendo a cr´ ıtica feita pelos especialistas da ´ area. Outros autores queixam-se tamb´ em da capacidade computacional exigida pelo problema de programac¸ ˜ ao quadr´ atica. N˜ ao obstante, as vantagens do uso deste m´ etodo s˜ ao imensas e entre as mais referenciadas est´ a o facto de n˜ ao serem muitos parˆ ametros a ajustar durante a fase de treino, a possibilidade de trabalhar com v´ arios e alternativos conjuntos de dados, bem como a possibilidade de poder controlar explicitamente o compromisso entre a complexidade do classificador e a dimens˜ ao do erro. CAP´ ITULO 1. M ´ AQUINAS DE VETORES DE SUPORTE 38 O facto de se recorrer apenas a uma parte dos padr˜ oes de treino para definir a func¸ ˜ ao de decis˜ ao faz com que o m´ etodo se mostre mais indiferente a alguns dos problemas computacionais j´ a apresentados. Cap´ıtulo 2 Validac¸ ˜ ao Cruzada Para aplicar o m´ etodo das M´ aquinas de Vetores de Suporte (como veremos no pr´ oximo cap´ ıtulo) s˜ ao criadas duas subamostras da amostra completa, denominadas como amostra de treino e amostra de teste. Como referimos no cap´ ıtulo anterior, o conjunto de treino ´ e usado para determinar o modelo. Esta fase chama-se fase de treino. J´ a o conjunto de teste ´ e usado para fazer previs˜ ao atrav´ es do modelo obtido com os dados de treino, isto ´ e, testa-se se o modelo obtido anteriormente ´ e capaz de classificar adequadamente as observac¸ ˜ oes da amostra de teste (novas observac¸ ˜ oes). Podemos estimar o erro de treino e de teste medindo o qu˜ ao ajustado ´ e o nosso modelo aos dados de treino e posteriormente o seu desempenho nos novos dados. O erro estimado na fase de teste pode ser altamente vari´ avel dependendo precisamente das observac¸ ˜ oes que est˜ ao inclu´ ıdas no conjunto de treino e de teste, como esclareceremos de seguida. Al´ em disso, como apenas se consideram as observac¸ ˜ oes que est˜ ao inclu´ ıdas na amostra de treino para ajustar o modelo, o m´ etodo tende a ter pior performance quando aplicado apenas a algumas observac¸ ˜ oes – observac¸ ˜ oes de teste. Isto sugere que o erro total para o modelo ajustado em todos os dados tende a ser sobrestimado pelo erro do conjunto de teste [Hastie et al., 2009]. Seymour Geisser, um estat´ ıstico cujos trabalhos incidiram sobre a an´ alise de m´ etodos estat´ ısticos de previs˜ ao, foi o pioneiro da t´ ecnica de Validac¸ ˜ ao Cruzada que abordamos nesta secc¸ ˜ ao [Christensen and Johnson, 2007]. AValidac¸ ˜ ao Cruzada ´ e um m´ etodo estat´ ıstico que tem por base uma amostra de dados que se divide segundo uma partic¸ ˜ ao: uns dados s˜ ao usados para treinar o modelo 39 CAP´ ITULO 2. VALIDAC¸ ˜ AO CRUZADA 40 e os restantes para o testar. Dentro deste m´ etodo podemos encontrar muitas variantes. A que aqui iremos abordar por ser muito popular e tamb´ em porque foi a utilizada na aplicac¸ ˜ ao pr´ atica ´ e o m´ etodo de Validac¸ ˜ ao Cruzada em k-dobras (k−fold, em inglˆ es) que consiste em dividir um conjunto de amostras de tamanho nem kgrupos com tamanho igual (no pior dos casos, aproximadamente igual). Das kpartes, k−1ser˜ ao utilizadas para treinar o modelo, enquanto que a parte que foi exclu´ ıda ser´ a utilizada para o testar. O processo ´ e repetido kvezes. E, em cada repetic¸ ˜ ao, ensaia-se e valida-se o modelo. No fim, ser´ a calculada a m´ edia dos resultados obtidos em cada uma das kvalidac¸ ˜ oes realizadas [Kohavi et al., 1995]. 2.1 Validac¸ ˜ ao Cruzada em k-dobras Sumariando o que descrevemos, este m´ etodo envolve dividir aleatoriamente o conjunto de observac¸ ˜ oes em kgrupos (ou folds, em inglˆ es) de tamanho aproximadamente igual. Um dos grupos ´ e usado como conjunto teste e o m´ etodo ´ e ajustado nos restantes k−1grupos. De seguida, calcula-se, por exemplo, o erro quadr´ atico m´ edio no caso de regress˜ ao ou a percentagem de observac¸ ˜ oes mal classificadas no caso de classificac¸ ˜ ao, nas observac¸ ˜ oes exclu´ ıdas (de teste) e repete-se depois este procedimento kvezes. De cada vez, um grupo diferente de observac¸ ˜ oes ´ e usado como conjunto de teste [Hastie et al., 2009]. Este processo resulta em kestimativas do erro de teste: E1, ..., Ek, onde Eirepresenta o erro associado ao grupo ionde i= 1,2, ..., k [Hastie et al., 2009]. Este valor ´ e, no fundo, o res´ ıduo dado pela diferenc¸a entre o valor real e o previsto. A estimativa da Validac¸ ˜ ao Cruzada k-dobras ´ e calculada pela m´ edia desses valores: V C(k) = 1 k k X i=1 Ei(2.1) CAP´ ITULO 2. VALIDAC¸ ˜ AO CRUZADA 41 Figura 2.1: Esquema de uma Validac¸ ˜ ao Cruzada 5-dobras. Um conjunto de tamanho n´ e aleatoriamente separado em 5 grupos distintos. Um desses grupos ´ e escolhido para amostra de teste (rosa) e os outros quatro (azul) formam a amostra de treino. No procedimento seguinte, outro grupo dos que foram exclu´ ıdos formar´ a a amostra de teste e o processo repete-se 5 vezes. Iremos verificar que a Validac¸ ˜ ao Cruzada “deixar um fora” apresentada de seguida ´ e um caso particular da Validac¸ ˜ ao Cruzada em k-dobras onde k´ e igual a n. Segundo [James et al., 2013], em geral, na pr´ atica deve usar-se a Validac¸ ˜ ao Cruzada em k-dobras com k= 5 ou k= 10 porque conduz-nos a mais vantagens. A vantagem mais ´ obvia ´ e computacional. A Validac¸ ˜ ao Cruzada “deixar um fora” requer o ajustamento do m´ etodo de aprendizagem nvezes o que o torna mais custoso computacionalmente em especial quando n´ e muito grande, enquanto que, por exemplo, usar Validac¸ ˜ ao Cruzada em 10-dobras requer ajustar o procedimento de aprendizagem apenas 10 vezes, o que em geral ´ e um procedimento mais aceit´ avel. Existem tamb´ em outras vantagens n˜ ao computacionais que suportam o uso da Validac¸ ˜ ao Cruzada em 5-dobras ou 10-dobras em amostras grandes que veremos no ´ ultimo subcap´ ıtulo. 2.2 Validac¸ ˜ ao Cruzada “deixar um fora” A Validac¸ ˜ ao Cruzada “deixar um fora” ´ e um m´ etodo de Validac¸ ˜ ao Cruzada deixando apenas uma observac¸ ˜ ao exclu´ ıda para testar o modelo. Neste caso, como supramen- CAP´ ITULO 2. VALIDAC¸ ˜ AO CRUZADA 42 cionado, k=nonde o n´ umero de partes ´ e igual ao n´ umero de elementos da amostra. Por exemplo, para um conjunto de dados com Nobservac¸ ˜ oes, executam-se Nexperiˆ encias. Para cada uma delas, utilizam-se N−1indiv´ ıduos de treino e apenas um ´ e deixado para teste. Figura 2.2: Esquema de uma Validac¸ ˜ ao Cruzada “deixar um fora”. Ao conjunto com 11 observac¸ ˜ oes ´ e repetidamente retirado um elemento, neste caso retirou-se em primeiro lugar o elemento 6 que serve como amostra de teste. O resto das observac¸ ˜ oes, num total de 10, servir˜ ao como amostra de treino. No passo seguinte, outra observac¸ ˜ ao ser´ a retirada e repete-se o processo 11 vezes. Este m´ etodo ´ e muito bom, quase imparcial j´ a que retira um elemento de cada vez, no entanto a sua principal desvantagem ´ e apresentar uma alta taxa de variˆ ancia [Kohavi et al., 1995]. Mais concretamente, a Validac¸ ˜ ao Cruzada “deixar um fora” consiste em dividir a amostra em duas partes, mas em vez de se criarem duas amostras de tamanho significativamente compar´ avel, ´ e usada uma ´ unica observac¸ ˜ ao (x1, y1)para o conjunto de teste e as restantes observac¸ ˜ oes {(x2, y2), ..., (xn, yn)}comp˜ oem o total da amostra de treino. O m´ etodo de aprendizagem ´ e ajustado em n−1observac¸ ˜ oes de treino, e a previs˜ ao ˆy1 CAP´ ITULO 2. VALIDAC¸ ˜ AO CRUZADA 43 ´ e realizada para a observac¸ ˜ ao que foi exclu´ ıda. Por exemplo, uma vez que a observac¸ ˜ ao (x1, y1)n˜ ao foi usada no processo de ajustamento, o erro quadr´ atico m´ edio, (y1−ˆy1)2, fornece uma estimativa do erro de teste praticamente n˜ ao enviesada [James et al., 2013]. No entanto, esta ´ e uma estimativa pobre porque ´ e altamente vari´ avel dado que ´ e baseada apenas numa observac¸ ˜ ao (x1, y1). Podemos repetir o procedimento seleccionando (x2, y2)para formar a amostra teste, treinando agora o modelo com n−1observac¸ ˜ oes: {(x1, y1),(x3, y3), ..., (xn, yn)}e calculando de novo (y2−ˆy2)2. Repetindo este processo nvezes, produzem-se nerros, E1, ..., En. A estimativa “deixar um fora” para o erro do teste ´ e a m´ edia dessas nestimativas de erros de teste obtida para cada observac¸ ˜ ao: V C(n) = 1 n n X i=1 Ei(2.2) A Validac¸ ˜ ao Cruzada realizada desta forma apresenta vantagens interessantes, uma delas ´ e um vi´ es pequeno: ajustamos repetidamente o m´ etodo de aprendizagem usando conjuntos de treino que contˆ em n−1observac¸ ˜ oes, quase tantas como a amostra total. Consequentemente, a Validac¸ ˜ ao Cruzada “deixar um fora” tende a n˜ ao sobrestimar os dados. Al´ em disso, o uso deste tipo de Validac¸ ˜ ao Cruzada ir´ a manter sempre os mesmos resultados, j´ a que n˜ ao existe aleatoriedade na escolha dos indiv´ ıduos para a amostra treino e amostra teste [Hastie et al., 2009]. A Validac¸ ˜ ao Cruzada “deixar um fora” tem no entanto a desvantagem de ter uma implementac¸ ˜ ao custosa, uma vez que o modelo tem de ser ajustado nvezes e n˜ ao ´ e indicado para amostras grandes. Deve-se portanto fazer uso desta t´ ecnica apenas quando n˜ ao existem muitos dados dispon´ ıveis [J. P. Costa, 2011]. Qualquer uma destas t´ ecnicas pode ser usada com qualquer tipo de m´ etodo preditivo, como ´ e o caso das M´ aquinas de Vetores de Suporte. A Validac¸ ˜ ao Cruzada serve para evitar os casos de overfitting e de certa forma estudarmos a robustez dos resultados, determinando tamb´ em o qu˜ ao ajustado est´ a o nosso modelo no caso de aplicac¸ ˜ ao a novos dados. CAP´ ITULO 2. VALIDAC¸ ˜ AO CRUZADA 44 2.3 Algumas considerac¸ ˜ oes importantes A Validac¸ ˜ ao Cruzada em k-dobras com k < n apresenta vantagens computacionais ao contr´ ario de se usar a Validac¸ ˜ ao Cruzada “deixar um fora” quando estamos na presenc¸a de uma amostra de tamanho consider´ avel. Uma das vantagens de se usar a Validac¸ ˜ ao Cruzada em k-dobras neste tipo de situac¸ ˜ oes, ´ e o facto das estimativas serem mais precisas para o erro de teste. J´ a vimos que a Validac¸ ˜ ao Cruzada “deixar um fora” conduz-nos a estimativas n˜ ao enviesadas do erro de teste, uma vez que o conjunto de treino cont´ em n−1observac¸ ˜ oes que ´ e quase o total da amostra, portanto, podemos retirar daqui a ideia de que se n˜ ao usarmos esta t´ ecnica podemos estar a sobre-estimar o erro de teste. Na verdade, ao usarmos a Validac¸ ˜ ao Cruzada em k-dobras, para k= 5 ou k= 10, iremos encontrar um vi´ es interm´ edio, dado que cada conjunto de treino cont´ em (k−1)n kobservac¸ ˜ oes que s˜ ao bastante menos que as usadas por Validac¸ ˜ ao Cruzada “deixar-um-fora” em geral1, mas bastantes mais que as usadas na amostra de teste [Kohavi et al., 1995]. A acrescentar temos que em termos da reduc¸ ˜ ao do vi´ es, ´ e claro que a Validac¸ ˜ ao Cruzada “deixar um fora” ´ e prefer´ ıvel ` a Validac¸ ˜ ao Cruzada em k-dobras. No entanto, devemos tamb´ em preocupar-nos com a variˆ ancia. De facto, a Validac¸ ˜ ao Cruzada “deixar um fora” conduz a uma maior variˆ ancia do que a Validac¸ ˜ ao Cruzada em k-dobras, com k < n. Quando usamos a validac¸ ˜ ao “deixar um fora” estamos de facto a realizar a m´ edia de nmodelos ajustados, cada um dos quais ´ e treinado num conjunto de observac¸ ˜ oes quase idˆ entico. Al´ em disso, estes modelos s˜ ao altamente correlacionados (positivamente) uns com os outros. Contrariamente, quando usamos a Validac¸ ˜ ao Cruzada em k-dobras com k < n estamos a fazer a m´ edia dos outputs de kmodelos ajustados que s˜ ao de alguma forma menos correlacionados (ou mesmo n˜ ao correlacionados) uns com os outros, dado que a sobreposic¸ ˜ ao entre os conjuntos de treino de cada modelo ´ e menor [James et al., 2013]. Uma vez que a m´ edia de muitas quantidades correlacionadas (positivamente) tem maior variˆ ancia do que quantidades que n˜ ao estejam muito correlacionadas, a estimativa do erro de teste resultante da Validac¸ ˜ ao Cruzada “deixar um fora” tende a ter maior variˆ ancia do que a estimativa do erro de teste resultante da Validac¸ ˜ ao Cruzada em kdobras [James et al., 2013]. Assim, existe uma relac¸ ˜ ao entre o vi´ es e a variˆ ancia associada com cada escolha de kna Validac¸ ˜ ao Cruzada em k-dobras. Geralmente, dadas estas considerac¸ ˜ oes, devemos usar a Validac¸ ˜ ao Cruzada em k1Note-se que estamos a referir-nos a amostras grandes CAP´ ITULO 2. VALIDAC¸ ˜ AO CRUZADA 45 dobras usando k= 5 ou k= 10, uma vez que estes valores tendem a produzir uma estimativa do erro de teste que n˜ ao sofre nem de excesso de alto vi´ es nem de variˆ ancia demasiado alta. Este resultado encontra-se provado empiricamente [Kohavi et al., 1995], [James et al., 2013], [Breiman and Spector, 1992]. CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS52 em cada uma, verificou-se qual ´ e a melhor func¸ ˜ ao n´ ucleo para o caso em estudo. O estudo foi iniciado tendo em conta a func¸ ˜ ao n´ucleo linear: K(u, v) = u0∗v(3.1) Inerente a esta func¸ ˜ ao n´ ucleo existe apenas um parˆ ametro que pode ser variado - o parˆ ametro custo (corresponde ao parˆ ametro cost no comando svm()). A grelha de variac¸ ˜ ao definida para este custo assume 10 valores com intervalos de 0.5, como apresentado na seguinte tabela: Custos 12345678910 0.5 1 1.5 2 2.5 3 3.5 4 4.5 5 Tabela 3.1: Tabela de custos. O menor erro m´ edio obtido foi 14.3%, estando associado a qualquer custo testado maior ou igual a 1. Custos superiores a 10 n˜ ao foram testados dado o reduzido tamanho da amostra. Lembramos tamb´ em que quando o custo ´ e muito grande, arricamo-nos a perder as propriedades de generalizac¸ ˜ ao do classificador, porque este tentar´ a ajustar os pontos de treino o melhor poss´ ıvel, inclu´ ındo poss´ ıveis erros dos dados. Ser´ a ent˜ ao um cuidado a ter em conta. Um custo de 0.5 (ou menor) implica mais um indiv´ ıduo mal classificado no modelo final. Segue ent˜ ao que com esta func¸ ˜ ao n´ ucleo, obtivemos a seguinte tabela de previs˜ ao: Classes Previstas Classes Originais 0 1 Total 016 3 19/19 (100%) 12 14 16/16 (100%) Total 18/18 (100%) 17/17 (100%) 35/35 (100%) Os cinco indiv´ ıduos onde o modelo erra s˜ ao o 1, 2, 10, 12 e 15. De entre estes, os indiv´ ıduos 1, 12 e 15 s˜ ao casos e foram classificados como controlos e o contr´ ario para os indiv´ ıduos 2 e 10. Ap´ os averiguac¸ ˜ ao, notou-se que estes indiv´ ıduos com S´ ındrome de Williams, apesar de doentes, apresentam volumes muito semelhantes aos observados nos controlos. O mesmo se passa para os indiv´ ıduos 2 e 10. CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS53 Atrav´ es do gr´ afico seguinte, podemos ver a distribuic¸ ˜ ao dos indiv´ ıduos por classes (a vermelho os casos e a preto os controlos) e tamb´ em quais foram os indiv´ ıduos utilizados como vetores de suporte (identificados com uma cruz). Como pretendemos obter um gr´ afico de dispers˜ ao bidimensional (que nos permita visualizar as observac¸ ˜ oes dos dados) o gr´ afico apresentado escolhe as duas componentes principais com maior variˆ ancia. Por outras palavras, os dados s˜ ao interpretados usando o m´ etodo das componentes principais, no qual se pretende reduzir a dimens˜ ao do espac¸o das vari´ aveis, criando-se um novo conjunto de vari´ aveis artificiais que representem razoavelmente o conjunto inicial de vari´ aveis recolhidas. + + o + ++ o o + + + + o + +o o + o o + o + + o oo o o + o o +o + −2e+05 0e+00 2e+05 4e+05 −6000 −4000 −2000 0 2000 4000 cmdscale(dist(base1[, −6]))[,1] cmdscale(dist(base1[, −6]))[,2] Figura 3.1: MVS - n´ ucleo linear (objetivo 1): visualizac¸ ˜ ao das classes por cor e dos vetores de suporte por cruzes. S˜ ao utilizadas aqui 18 observac¸ ˜ oes como vetores de suporte na criac¸ ˜ ao do modelo. Seguidamente, foi efetuado o estudo deste m´ etodo considerando a func¸ ˜ ao n´ucleo radial: K(u, v) = exp(−gama ∗ |u−v|2)(3.2) Aqui podem ser variados os parˆ ametros gama ecusto. A grelha correspondente ao parˆ ametro custo foi a considerada anteriormente. A grelha para a variac¸ ˜ ao do parˆ ametro gama foi a seguinte: CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS54 Gama 1 2 3 4 5 6 7 8 9 10 11 5e-04 0.0404 0.0803 0.1202 0.1601 0.2 0.2399 0.2798 0.3197 0.3596 0.3995 Tabela 3.2: Tabela de valores de gama. O parˆ ametro foi variado em pequenos intervalos de valores em torno do valor por defeito do parˆ ametro gama que ´ e1 5= 0.2(1 vonde vrepresenta o n´ umero de vari´ aveis utilizadas na previs˜ ao). O parˆ ametro gama mede o n´ ıvel de influˆ encia associado a cada observac¸ ˜ ao de treino. O menor erro que se conseguiu obter tendo em conta a variac¸ ˜ ao dos parˆ ametros para esta func¸ ˜ ao n´ ucleo foi um erro nulo e portanto a classificac¸ ˜ ao dos indiv´ ıduos foi realizada com total sucesso. Inerentes a este erro nulo est˜ ao bastantes combinac¸ ˜ oes de parˆ ametros gama e custo pelo que, como n˜ ao se encontra impl´ ıcita a escolha de uma combinac¸ ˜ ao, escolheu-se a primeira combinac¸ ˜ ao que surgiu com este valor para o erro e com menor valor em termos de custo: custo de 2 e gama de 0.3995. Seguem outras quatro combinac¸ ˜ oes a t´ ıtulo de curiosidade: Combinac¸ ˜ oes Custo 2.5 3 3.5 4 Gama 0.3197 0.3197 0.2399 0.2798 E, mais uma vez, a visualizac¸ ˜ ao das classes e vetores de suporte de acordo com esta func¸ ˜ ao n´ ucleo: CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS55 + + + + ++ + + + + + + + + +o + + + + + + + + o ++ + + + + o +o + −2e+05 0e+00 2e+05 4e+05 −6000 −4000 −2000 0 2000 4000 cmdscale(dist(base1[, −6]))[,1] cmdscale(dist(base1[, −6]))[,2] Figura 3.2: MVS - n´ ucleo radial (objetivo 1): visualizac¸ ˜ ao das classes por cor e dos vetores de suporte por cruzes. S˜ ao utilizados 24 vetores de suporte com a aplicac¸ ˜ ao desta func¸ ˜ ao n´ ucleo. De seguida foi testada a func¸ ˜ ao n´ucleo sigm´ oide. Esta ´ e traduzida pela seguinte express˜ ao: K(u, v) = tanh(gama ∗u0∗v+coeficiente)(3.3) Quando considerada esta func¸ ˜ ao n´ ucleo, os parˆ ametros a variar s˜ ao o gama, o custo e o coeficiente. Os dois primeiros assumem exatamente as mesmas grelhas definidas para as anteriores func¸ ˜ oes n´ ucleo estudadas. J´ a o parˆ ametro coeficiente foi variado com intervalos de 0.05 de acordo com a tabela seguinte: Coeficiente 1 2 3 4 5 6 7 -0.15 -0.1 -0.05 0 0.05 0.1 0.15 Tabela 3.3: Tabela da variac¸ ˜ ao dos valores do coeficiente. ´ E de notar que o coeficiente ´ e o ´ unico parˆ ametro que pode assumir valores negativos. CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS56 Tendo em conta esta func¸ ˜ ao n´ ucleo, a combinac¸ ˜ ao de parˆ ametros correspondente ao menor erro m´ edio, 11.4%, e tendo em conta o parˆ ametro custo mais baixo ´ e a seguinte: custo com valor 0.5, gama de 0.2 e coeficiente de -0.1. Note-se que o coeficiente associado ao menor erro ´ e o segundo menor valor da grelha de coeficientes. Neste contexto, fez-se variar o coeficiente em 14 valores diferentes com intervalos de 0.05 de forma a compreender a variabilidade do erro de acordo com o aumento da grelha de ccoeficientes. Concluiu-se que a combinac¸ ˜ ao escolhida foi a mesma e portanto um aumento de coeficientes n˜ ao melhora o erro. A tabela de predic¸ ˜ ao para esta func¸ ˜ ao n´ ucleo ´ e ent˜ ao: Classes Previstas Classes Originais 0 1 Total 016 2 18/18 (100%) 12 15 17/17 (100%) Total 18/18 (100%) (17/17) (100%) 35/35 (100%) De facto, esta func¸ ˜ ao n´ ucleo s´ o traz a vantagem de classificar corretamente mais um indiv´ ıduo do que no n´ ucleo linear errando na classificac¸ ˜ ao dos indiv´ ıduos 2, 10, 12 e 15. Ou seja, desta vez o indiv´ ıduo 1, caso, foi classificado corretamente e este modelo ´ e pouco melhor que a classificac¸ ˜ ao no espac¸o original. Obteve-se tamb´ em o gr´ afico da dispers˜ ao dos dados: CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS57 + + o + ++ + o + + + + + + +o + + o o + o + + o ++ + + + + o +o + −2e+05 0e+00 2e+05 4e+05 −6000 −4000 −2000 0 2000 4000 cmdscale(dist(base1[, −6]))[,1] cmdscale(dist(base1[, −6]))[,2] Figura 3.3: MVS - n´ ucleo sigm´ oide (objetivo 1): visualizac¸ ˜ ao das classes por cor e dos vetores de suporte por cruzes. Foram aqui utilizados 26 indiv´ ıduos como vetores de suporte. Por fim, foi efetuado o estudo deste m´ etodo considerando a func¸ ˜ ao n´ucleo polinomial: K(u, v)=(gama ∗u0∗v+coeficiente)degree (3.4) Neste caso, existem quatro parˆ ametros que podem ser variados: custo,gama, coeficiente egrau. Os trˆ es primeiros foram variados como at´ e aqui. O parˆ ametro grau foi variado em 4 valores como mostra a seguinte tabela: Grau 1 2 3 4 1 2 3 4 Tabela 3.4: Tabela de variac¸ ˜ ao do parˆ ametro grau. O menor erro obtido foi novamente nulo pelo que, para este erro, obteve-se novamente bastantes combinac¸ ˜ oes de parˆ ametros diferentes. Aqui, a combinac¸ ˜ ao escolhida CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS58 dever´ a ser aquela que apresenta menor valor para o parˆ ametro grau. Assim, tendo em conta esta condic¸ ˜ ao e seleccionando mais uma vez a combinac¸ ˜ ao que aparece com menor custo, temos portanto que os parˆ ametros escolhidos foram: custo de 1, gama com valor igual a 0.3998, coeficiente de 0.2 e por fim, grau 2. Para visualizac¸ ˜ ao tal como nas outras func¸ ˜ oes n´ ucleo segue o seguinte gr´ afico: o + o + ++ + + + + + + + o +o + o + + + o + + o oo o + + + o +o + −2e+05 0e+00 2e+05 4e+05 −6000 −4000 −2000 0 2000 4000 cmdscale(dist(base1[, −6]))[,1] cmdscale(dist(base1[, −6]))[,2] Figura 3.4: MVS - n´ ucleo polinomial (objetivo 1): visualizac¸ ˜ ao das classes por cor e dos vetores de suporte por cruzes. S˜ ao utilizadas 23 observac¸ ˜ oes como vetores de suporte, apenas menos um que o modelo para a func¸ ˜ ao n´ ucleo radial definida. Tal como na func¸ ˜ ao n´ ucleo radial, a func¸ ˜ ao n´ ucleo polinomial de grau 2 classifica bem 100% dos indiv´ ıduos. Assim, constata-se que a func¸ ˜ ao n´ ucleo que dever´ a ser aplicada a futuras previs˜ oes ser´ a a radial ou a polinomial, pois os resultados s˜ ao ´ otimos tanto com uma como com a outra. Por uma quest˜ ao de simplificac¸ ˜ ao em termos de quantidade de parˆ ametros e por ser mais vezes e facilmente utilizada, vamos considerar a func¸ ˜ ao n´ ucleo radial colocando no comando svm(),kernel = “radial”,cost = 2 egamma = 0.3995. Do output desta func¸ ˜ ao, como j´ a verific´ amos, s˜ ao necess´ arios 24 vetores de suporte para a definic¸ ˜ ao das fronteiras: CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS59 Parameters: SVM-Type: C-classification SVM-Kernel: radial cost: 2 gamma: 0.3995 Number of Support Vectors: 24 que de facto s˜ ao muitos, j´ a que a amostra ´ e constitu´ ıda por 35 indiv´ ıduos. E, a previs˜ ao das classes realizadas atrav´ es deste modelo foi ent˜ ao: Classes Previstas Classes Originais 0 1 Total 018 0 18/18 (100%) 10 17 17/17 (100%) Total 18/18 (100%) (17/17) (100%) 35/35 (100%) Verifica-se portanto que este modelo utilizando a func¸ ˜ ao n´ ucleo radial com os parˆ ametros descritos ´ e capaz de atribu´ ır a classe correta a uma nova observac¸ ˜ ao, j´ a que erro de previs˜ ao ´ e nulo. N˜ ao ´ e demais mencionar que poder-se-ia utilizar a func¸ ˜ ao n´ ucleo polinomial para realizar a mesma classificac¸ ˜ ao. Vejamos agora a performance do classificador MVS na classificac¸ ˜ ao, tendo em conta as vari´ aveis posteriorcingulate volume efrontalpole volume (dada a visualizac¸ ˜ ao s´ o ser poss´ ıvel bidimensionalmente) e fixando um volume total intracranial m´ edio de 1388317 ml, um volume m´ edio para o precuneus de 18853 ml e um volume m´ edio para aG pariet inf −Angular volume de 11742 ml. Estes valores dos volumes amostrais m´ edios podem ser consultados na secc¸ ˜ ao de an´ alise explorat´ oria das vari´ aveis. CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS60 0 1 1000 1500 2000 2500 3000 5000 6000 7000 8000 o o o ox x x x x x x x x x x x x x x x x x x x xx x x x x x x x x x SVM classification plot frontalpole postcingulate Tem-se tamb´ em o gr´ afico que mostra a performance do classificador para G pariet Inf− Angular volume eprecuneus volume para o volume m´ edio das restantes vari´ aveis: 0 1 14000 18000 22000 26000 8000 10000 12000 14000 16000 o o o o x x x x x x x x x x x x x x x x x x x x x x x x x x x xx x x SVM classification plot precuneus GparietInfangular Por fim, o mesmo gr´ afico que mostra a performance para o classificador para posteriorcingulate volume eG pariet Inf −Angular volume para o volume m´ edio das restantes vari´ aveis que podem ser consultados no cap´ ıtulo de an´ alise das vari´ aveis: CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS61 0 1 8000 10000 12000 14000 16000 5000 6000 7000 8000 o o o o x x x x x x x x x x x x x x x x x x x x x x x x x x x x x x x SVM classification plot GparietInfangular postcingulate ´ E poss´ ıvel ver, atrav´ es destes gr´ aficos, a fronteira de decis˜ ao que serve para separar os indiv´ ıduos das duas classes no contraste entre a cor azul e a rosa e visualizar a dispers˜ ao dos indiv´ ıduos tendo em conta as duas vari´ aveis consideradas. Atrav´ es do c´ alculo dos valores de decis˜ ao para cada indiv´ ıduo, verificamos que foi atribu´ ıdo um valor positivo aos indiv´ ıduos cuja classe ´ e 1 e negativo aos indiv´ ıduos controlo. Vejamos, por exemplo, os cinco primeiros valores: 1 0.99993307 2 -1.00010912 3 -0.99982332 4 -0.34797567 5 0.95036375 ´ E importante tamb´ em avaliar a sensibilidade e especificidade do modelo. Entendese por sensibilidade a taxa de verdadeiros positivos, ou seja, a capacidade de um teste detetar corretamente os indiv´ ıduos com doenc¸a. A especificidade ´ e a taxa de verdadeiros negativos, isto ´ e, a capacidade de um teste excluir corretamente os individuos sem doenc¸a. Com os resultados aqui obtidos obtivemos valores para a especificidade e sensibilidade iguais a 100%. Para analisar a importˆ ancia de todas as vari´ aveis no modelo de classificac¸ ˜ ao da func¸ ˜ ao n´ ucleo radial apresentado, analis´ amos o erro obtido retirando ao modelo completo cada uma das vari´ aveis ` a vez. O modelo errou na classificac¸ ˜ ao de um indiv´ ıduo CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS68 3.3.3 Resultados com as vari´ aveis estandardizadas Seguindo o mesmo esquema, estandardizamos as vari´ aveis do objetivo 2. Conclu´ ımos que os mesmos resultados se verificam para o n´ ucleo linear a partir de um custo de 2 inclusiv´ e. O estudo pode ser interpretado como acima, n˜ ao acrescentando portanto nova informac¸ ˜ ao ao que aqui j´ a foi referido. 3.3.4 Resultados com as vari´ aveis em proporc¸ ˜ ao Para concluir a an´ alise do objetivo 2, tal como no objetivo 1, trabalhamos com os dados em proporc¸ ˜ ao, ou seja, divindo todas as vari´ aveis de volume pelo volume total intracranial de cada um dos indiv´ ıduos. Desta vez, podemos retirar daqui informac¸ ˜ oes adicionais: 1) A aplicac¸ ˜ ao do n´ ucleo linear apenas obt´ em uma classificac¸ ˜ ao de 100% quando recorremos a um custo de 9.5 ou superior, o que ´ e um pouco elevado para o caso que estamos a estudar. 2) Aplicando um n´ ucleo radial obtemos 100% de sucesso para v´ arios parˆ ametros. Escolhendo o de custo mais baixo obtemos duas combinac¸ ˜ oes poss´ ıveis de serem usadas: custo de 0.5 e gama de 0.1796 ou custo de 0.5 e gama de 0.1995. Vejamos algumas considerac¸ ˜ oes interessantes que ocorreram durante o estudo com a primeira combinac¸ ˜ ao descrita: custo de 0.5 e gama de 0.1796. Verificamos que todos os 35 indiv´ ıduos da amostra s˜ ao vetores de suporte: CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS69 + ++ + ++ + + + ++ + +++ + + + + + + + ++ + + + + + + + + + + + −0.010 −0.005 0.000 0.005 0.010 0.015 0.020 −0.002 0.000 0.002 0.004 0.006 cmdscale(dist(base3[, −11]))[,1] cmdscale(dist(base3[, −11]))[,2] Figura 3.6: MVS - n´ ucleo radial para os parˆ ametros descritos: visualizac¸ ˜ ao das classes por cor e dos vetores de suporte por cruzes. A regra de decis˜ ao foi a mesma: valores positivos para os doentes e negativo para os n˜ ao doentes. Os demais resultados obtidos n˜ ao comprometem de nenhuma forma as conclus˜ oes que foram retiradas sem este procedimento. 3) Aplicando um n´ ucleo sigm´ oide ou polinomial conseguimos classificar bem todos os indiv´ ıduos como acontece para o n´ ucleo radial e mesmo para o linear. Mais uma vez, os resultados para este objetivo s˜ ao excelentes e os resultados afirmam que utilizando as vari´ aveis mais importantes conseguimos classificar corretamente um novo indiv´ ıduo com um n´ ucleo linear associado a um custo m´ ınimo de 9.5. Caso queiramos obter uma fronteira associada a um custo menor, o n´ ucleo radial com os parˆ ametros descritos parecem ser as melhores opc¸ ˜ oes. A aplicac¸ ˜ ao das MVS associadas a um n´ ucleo radial tem-se revelado bastante eficiente em todas as situac¸ ˜ oes vistas at´ e aqui. CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS70 3.4 Objetivo 3 3.4.1 An´ alise Descritiva e Explorat´ oria das Vari´ aveis Por fim, neste ´ ultimo objetivo, as vari´ aveis utilizadas s˜ ao as seguintes: 1. parietal_volume (Volume da regi˜ ao parietal de cada indiv´ ıduo) 2. calcarine_volume (Volume da regi˜ ao pericalcarina de cada indiv´ ıduo) 3. VolumeTotalIntracranial (Volume total intracranial de cada indiv´ ıduo) Todas os volumes est˜ ao apresentados em mililitros. J´ a definimos no objetivo 1 a vari´ avel que traduz o volume total intracranial de cada indiv´ ıduo. A an´ alise gr´ afica de cada uma das vari´ aveis (cont´ ınuas) sugere n˜ ao existirem problemas para o estudo dado que as vari´ aveis apresentam relativa simetria. Para uma melhor e mais completa an´ alise, podem consultar-se as tabelas do Anexo IV. Pela an´ alise dos boxplot existe evidˆ encia de que estas vari´ aveis contribuem significativamente para explicar a resposta, n˜ ao existem problemas de multicolinearidade entre as vari´ aveis nem valores de VIF que possam dar problemas. Por fim, vejamos ent˜ ao a importˆ ancia das vari´ aveis na resposta: 0 1 parietal 0.7843137 0.7843137 calcarine 0.6928105 0.6928105 volume 0.8823529 0.8823529 A que mais pesa para explicar o diagn´ ostico da doenc¸a ´ e o volume, seguido pela regi˜ ao parietal e por fim a calcarina. 3.4.2 Resultados O procedimento para este ´ ultimo objetivo em tudo se assemelha ao que foi realizado para os outros dois. Seguem ent˜ ao os principais resultados. CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS71 Aplicamos inicialmente as M´ aquinas de Vetores de Suporte aliadas a um n´ ucleo linear tendo obtido um erro de 14.5% e est´ a associado a um custo de 1 ou superior. ´ E de realc¸ar que este parˆ ametro foi variado como nos outros dois objetivos anteriores. Quando recorremos a um n´ ucleo radial o erro passa a ser de aproximadamente 8.6% com apenas trˆ es indiv´ ıduos mal classificados. V´ arios parˆ ametros poderiam aqui ter sido usados, no entanto e em linha com o que j´ a aplicamos nos objetivos anteriores, foi escolhida a combinac¸ ˜ ao com um valor de custo mais baixo. O parˆ ametro gama foi variado como se mostra na seguinte tabela: Gama 1 2 3 4 5 0.0004833333 0.06705333 0.1336233 0.2001933 0.2667633 6 7 8 9 10 11 0.3333333 0.3999033 0.4664733 0.5330433 0.5996133 0.6661833 Tabela 3.5: Tabela da variac¸ ˜ ao do parˆ ametro gama. A combinac¸ ˜ ao escolhida foi um custo de 3.5 e um valor para gama de 0.6661833. Aplicando um n´ ucleo sigm´ oide, com a tabela dos coeficientes variada como anteriormente, em nada se melhora a classificac¸ ˜ ao realizada usando um n´ ucleo linear; obt´ em-se a mesma percentagem de erro, 14.3%. Quanto ` as M´ aquinas de Vetores de Suporte associadas a um n´ ucleo polinomial, o erro ´ e o mesmo que para a func¸ ˜ ao n´ ucleo radial e os melhores parˆ ametros foram um custo de 0.5, gama de 0.6664733, coeficiente de 0 e grau 3. Poderia ter sido escolhida outra qualquer combinac¸ ˜ ao associada ao mesmo valor de erro, no entanto esta ´ e a de grau menor. Os indiv´ ıduos cuja classificac¸ ˜ ao o modelo errou, ´ e a mesma que para a func¸ ˜ ao n´ ucleo radial. Assim sendo, vamos ent˜ ao apresentar alguns pormenores do estudo com a func¸ ˜ ao n´ ucelo radial. CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS72 + + + + + + + o + + + + ++ + o o + + + + + + + o o + + ++o + oo o −2e+05 0e+00 2e+05 4e+05 −8000 −4000 0 2000 4000 6000 cmdscale(dist(base[, −4]))[,1] cmdscale(dist(base[, −4]))[,2] Figura 3.7: MVS - n´ ucleo radial: visualizac¸ ˜ ao das classes por cor e dos vetores de suporte por cruzes. Foram usados 26 vetores de suporte neste modelo. Segue agora a performance do classificador MVS na classificac¸ ˜ ao tendo em conta as vari´ aveis parietal e calcarina (` a esquerda) e parietal e volume (` a direita), fixando as restantes vari´ aveis na sua m´ edia: 0 1 6000 7000 8000 9000 10000 75000 80000 85000 90000 95000 o o o oo o o o o x x x x x x x x x x x x x x xx xx x x x x x x x x SVM classification plot vtot part 0 1 1100000 1300000 1500000 1700000 75000 80000 85000 90000 95000 o o o o o o o o o x x x x x x x x x x xx x x xx x x x x x x x x x x SVM classification plot volume part CAP´ ITULO 3. APLICAC¸ ˜ AO DAS MVS NO DIAGN ´ OSTICO DO S´ INDROME DE WILLIAMS73 Por fim, fomos averiguar quais as vari´ aveis mais importantes na classificac¸ ˜ ao retirando uma a uma tal como j´ a realizado para os outros objetivos. Verificou-se que na ausˆ encia tanto da vari´ avel parietal como da vari´ avel calcarina o modelo errava em 5 indiv´ ıduos. Quando foi retirado o volume total intracranial, o modelo errou a classificac¸ ˜ ao de 9 indiv´ ıduos. Portanto, o volume ´ e a vari´ avel mais importante para esta classificac¸ ˜ ao seguida pelas duas restantes, parietal e calcarina. 3.4.3 Resultados com as vari´ aveis estandardizadas Ap´ os realizarmos a tarefa com as vari´ aveis estandardizadas, verificamos que os resultados pioram bastante. A melhor classificac¸ ˜ ao conseguida realiza-se com recurso ao n´ ucleo radial ou polinomial uma vez mais e est´ a associada a um erro de cerca de 22.9%, o que corresponde a 8 indiv´ ıduos mal classificados. Assim, ponderando estes resultados, podemos suspeitar que as dispers˜ oes distintas nas vari´ aveis originais podem estar a influenciar negativamente a classificac¸ ˜ ao e o n˜ ao reconhecimento de um algoritmo totalmente eficaz como aconteceu no objetivo 1 e 2. 3.4.4 Resultados com as vari´ aveis em proporc¸ ˜ ao Com a utilizac¸ ˜ ao das vari´ aveis em proporc¸ ˜ oes o nosso estudo ficou reduzido a apenas duas vari´ aveis. Com o uso de todas as func¸ ˜ oes n´ ucleo obtivemos sempre 5 indiv´ ıduos mal classificados o que corresponde a um sexto da amostra total e a um erro de 14.3%. Neste objetivo ´ e´ obvio o peso da vari´ avel volume total intracranial no modelo de classificac¸ ˜ ao. Assim sendo, devemos considerar as trˆ es vari´ aveis para obter melhor classificac¸ ˜ ao. ´ E tamb´ em de notar que 5 indiv´ ıduos mal classificados n˜ ao ´ e um mau resultado, no entanto justifica-se pela dimens˜ ao da amostra. Aqui, a adic¸ ˜ ao de mais vari´ aveis significativas no modelo ´ e um passo importante a considerar. Cap´ıtulo 4 Mapeamento Estat´ıstico Param´ etrico O estudo do c´ erebro tem suscitado h´ a muitos anos muita curiosidade por parte dos especialistas, no entanto, h´ a ainda muita investigac¸ ˜ ao por realizar. As imagens de ressonˆ ancia magn´ etica, IRM (Magnetic Ressonance Imaging, em inglˆ es), s˜ ao adquiridas por uma t´ ecnica que se baseia na emiss˜ ao de sinais de Ressonˆ ancia Magn´ etica e absorc¸ ˜ ao das ondas de r´ adio com uma frequˆ encia definida por amostras colocadas num campo magn´ etico [Buxton, 2009],[Gil and Geraldes, 1987]. Atrav´ es desta t´ ecnica obtˆ em-se imagens internas de uma forma n˜ ao invasiva e sem agentes de contraste, onde ´ e poss´ ıvel distinguir excelentemente os tecidos moles, tais como a substˆ ancia branca e a cinzenta, e fornecer dados tanto em duas dimens˜ oes como em trˆ es dimens˜ oes [Moser, 2009]. Esta t´ ecnica tornou-se indispens´ avel nos diagn´ osticos por neuroimagem, tanto pelas vantagens anteriormente apresentadas como pelo facto de ser flex´ ıvel, sendo poss´ ıvel a obtenc¸ ˜ ao de diferentes tipos de imagens com diferentes contrastes dependendo da forma de aquisic¸ ˜ ao da imagem [Buxton, 2009]. A obtenc¸ ˜ ao de IRM estrutural ou convencional usa a aquisic¸ ˜ ao de imagens em trˆ es planos diferentes (axial, coronal e sagital). Sabendo os parˆ ametros usados na aquisic¸ ˜ ao, ´ e poss´ ıvel a reconstruc¸ ˜ ao da estrutura cerebral em trˆ es dimens˜ oes [Buxton, 2009]. Esta modalidade ´ e muito utilizada em estudos cl´ ınicos. Grande parte dessa utilizac¸ ˜ ao deve-se ` a possibilidade de selecionar e analisar regi˜ oes anat´ omicas no c´ erebro (segmentac¸ ˜ ao) e de estimar o c´ alculo de volumes [West et al., 2012]. A IRM estrutural ´ e´ util e padronizada para elaborac¸ ˜ ao de diferentes an´ alises e diagn´ osticos (por exemplo, detec¸ ˜ ao, caracterizac¸ ˜ ao e determinac¸ ˜ ao da evoluc¸ ˜ ao do estado da les˜ ao, controlo da resposta terapˆ eutica assim como determinac¸ ˜ ao da recorrˆ encia); no 75 CAP´ ITULO 4. MAPEAMENTO ESTAT´ ISTICO PARAM ´ ETRICO 76 entanto, estas n˜ ao devem ser analisadas sem nenhum complemento, pois a avaliac¸ ˜ ao de alterac¸ ˜ oes dos tumores e les˜ oes podem levar a diagn´ osticos precipitados [Moser, 2009]. O SPM8 (Statistical Parametric Mapping) ´ e um software que foi desenvolvido pelo laborat´ orio de imagem do University College London. Neste trabalho o SPM8 foi utilizado para avaliar as diferenc¸as estruturais em v´ arias regi˜ oes cerebrais entre casos e controlos atrav´ es de um m´ etodo designado por Morfometria baseada em voxels, VBM (VoxelBased-Morphometry, em inglˆ es) que usa sequˆ encias de imagens do c´ erebro tiradas ao longo do tempo (aquisic¸ ˜ oes) [Penny et al., 2011]. A an´ alise VBM permite identificar as ´ areas que diferem estatisticamente no volume da substˆ ancia cinzenta ou branca entre os dois grupos cl´ ınicos comparando voxel a voxel. As pequenas diferenc¸as de volume s˜ ao desprezadas porque estamos ` a procura de grande sensibilidade no teste [Uddin et al., 2011]. Este cap´ ıtulo sumaria de forma breve as ideias e procedimentos usados na an´ alise das ressonˆ ancias magn´ eticas do c´ erebro desde a sua transformac¸ ˜ ao, ` a modelac¸ ˜ ao e inferˆ encia dos resultados. Aqui, a inferˆ encia a realizar ser´ a acerca das diferenc¸as que se expressam quando comparamos os dois grupos cl´ ınicos (casos e controlos), em termos de volume das regi˜ oes cerebrais. De forma a identificar a localizac¸ ˜ ao de regi˜ oes nas estruturas cerebrais, os dados s˜ ao mapeados num espac¸o anat´ omico normalizado. Assim, antes de efetuarmos uma modelac¸ ˜ ao estat´ ıstica, temos primeiro que realinhar e normalizar as imagens no espac¸o MNI (Montreal Neurological Institute) - espac¸o m´ edio de 152 c´ erebros [Poldrack et al., 2011]. 4.1 Introduc¸ ˜ ao ` a Problem´ atica do Estudo Primeiramente, precisamos de definir imagem de ressonˆ ancia magn´ etica. Uma imagem n˜ ao ´ e mais do que uma matriz de n´ umeros que corresponde a localizac¸ ˜ oes espaciais. A cada elemento da imagem chamamos voxel que ´ e uma unidade espacial tridimensional. Assim, quando trabalhamos a imagem, geralmente estamos a executar na matriz alguma operac¸ ˜ ao matem´ atica. De forma a especificar as caracter´ ısticas espaciais da imagem temos de usar um sistema de coordenadas. A matriz de dados de um c´ erebro ´ e geralmente tridimensional de forma a que cada dimens˜ ao na matriz corresponda a uma dimens˜ ao no espac¸o. Assim, no sistema de coordenadas ortogonal, Oxyz, o eixo dos xx0srepresenta a dimens˜ ao esquerda-direita, o eixo dos yy0sa dimens˜ ao anterior-posterior e por fim o eixo dos zz0s CAP´ ITULO 4. MAPEAMENTO ESTAT´ ISTICO PARAM ´ ETRICO 77 que representa a dimens˜ ao inferior-superior [Poldrack et al., 2011]. Figura 4.1: Visualizac¸ ˜ ao do sistema de coordenadas no c´ erebro. Na matriz de dados, um voxel espec´ ıfico pode ser indexado como [xvox, yvox, zvox] onde estas trˆ es coordenadas especificam a sua posic¸ ˜ ao em cada dimens˜ ao da matriz. Estas coordenadas fazem ent˜ ao a ligac¸ ˜ ao entre as estruturas cerebrais e as coordenadas na imagem. Ao sistema de coordenadas original chamamos espac¸o nativo da imagem que difere entre aquisic¸ ˜ oes. Em neuroimagem ´ e necess´ ario combinar os dados entre indiv´ ıduos. Para isso, utiliza-se o espac¸o comum MNI referido, alinhando as aquisic¸ ˜ oes/imagens [Penny et al., 2011]. As transformac¸ ˜ oes espaciais que se aplicam nas imagens correspondem a transformac¸ ˜ oes que tentam reduzir componentes de variˆ ancia indesejada nas s´ eries de voxels. Estas componentes s˜ ao introduzidas por movimentos ou diferenc¸as de forma entre os indiv´ ıduos [Penny et al., 2011]. Para reduzir o efeito dessas componentes ´ e necess´ ario realinhar e normalizar os dados. O realinhamento envolve a estimac¸ ˜ ao de seis parˆ ametros de uma transformac¸ ˜ ao afim de corpo r´ ıgido que minimiza as diferenc¸as entre cada aquisic¸ ˜ ao e uma imagem de referˆ encia usada pelo programa. A transformac¸ ˜ ao ´ e depois aplicada usando interpolac¸ ˜ ao de cada imagem. A estimac¸ ˜ ao da transformac¸ ˜ ao afim ´ e geralmente efetuada por uma expans˜ ao em s´ erie de Taylor de primeira ordem usando as derivadas espaciais das imagens [Penny et al., 2011]. Para reduzir as diferenc¸as da forma cerebral nestes indiv´ ıduos, ´ e necess´ aria uma normalizac¸ ˜ ao. CAP´ ITULO 5. RECONHECIMENTO DE PADR ˜ OES EM IMAGENS USANDO PRONTO84 O PRoNTo ´ e ainda um programa muito recente, desenvolvido apenas h´ a aproximadamente dois anos e portanto ainda n˜ ao se encontra muito desenvolvido. As M´ aquinas de Vetores de Suporte apenas est˜ ao dispon´ ıveis para classificac¸ ˜ ao no caso em que a vari´ avel resposta ´ e bin´ aria. Para informac¸ ˜ oes adicionais, consultar [Schrouff et al., 2013]. Para a an´ alise, os dados de entrada s˜ ao ent˜ ao todas as aquisic¸ ˜ oes de todos os indiv´ ıduos. Assume-se que os dados de neuroimagem foram previamente pr´ e-processados usando o SPM ou outro software semelhante de an´ alise de neuro-imagem. Esta t´ ecnica ir´ a ent˜ ao realizar uma comparac¸ ˜ ao voxel a voxel para realizar a classificac¸ ˜ ao. Este m´ etodo que aqui utilizamos est´ a portanto diretamente integrado com o m´ etodo anterior, VBM. Foi utilizada Validac¸ ˜ ao Cruzada “deixar um fora”, como descrito em cap´ ıtulos anteriores. Apesar de poderem ser programados outros n´ ucleos, optamos por usar apenas as MVS lineares para este estudo uma vez que conduziu a resultados muito bons. Aqui, o n´ ucleo ser´ a uma matriz de Namostras por Mcaracter´ ısticas correspondentes aos voxels de cada indiv´ ıduo da amostra, no nosso caso, 35 indiv´ ıduos. 5.1 Resultados Os melhores resultados foram obtidos para um custo de 1 (valor por defeito) e foram considerados bastante satisfat´ orios e relevantes. Inicialmente foram averiguados os resultados de uma an´ alise de todos os voxels do c´ erebro de todos os indiv´ ıduos dos dois grupos. CAP´ ITULO 5. RECONHECIMENTO DE PADR ˜ OES EM IMAGENS USANDO PRONTO85 Figura 5.1: Resultados para a an´ alise de todo o c´ erebro. Verificou-se que apenas dois indiv´ ıduos foram mal classificados o que resulta num erro de apenas 5.7%. Os indiv´ ıduos que n˜ ao foram colocados na sua classe foram o indiv´ ıduo 13 (caso) e o indiv´ ıduo 23 (controlo). O gr´ afico mostra a func¸ ˜ ao de decis˜ ao que foi realizada pelo classificador: os indiv´ ıduos cuja func¸ ˜ ao apresentava valores abaixo de 0.5 foram classificados como casos e para valores acima de 0.5 foram classificados como controlos. Atrav´ es do mapa de pesos (canto inferior esquerdo) podemos ver quais as regi˜ oes que mais contribu´ ıram para esta classificac¸ ˜ ao - regi˜ oes a vermelho, seguidas pelas regi˜ oes a amarelo. As regi˜ oes a azul escuro foram as que pouco ou nada contribu´ ıram para esta distinc¸ ˜ ao. Por fim, retiramos tamb´ em a imagem anat´ omica do c´ erebro que foi utilizada para esta an´ alise: toda a regi˜ ao excepto a regi˜ ao a preto. Usando o mapa dos pesos e um mapa de estruturas, indentificaram-se as seguintes ´ areas como as que mais contribuiram para o modelo de classificac¸ ˜ ao: CAP´ ITULO 5. RECONHECIMENTO DE PADR ˜ OES EM IMAGENS USANDO PRONTO86 1) Temporal Mid R 2) Calcarine_L 3) Angular_R 4) Angular_L 5) Temporal_Inf_R bem como as que menos contribuiram: 1) Occipital_Mid_L 2) Occipital_Mid_R 3) Parietal_Inf_L 4) Parietal_Inf_R 5) Frontal_Mid_R 6) Rectus_R Esta an´ alise de comparac¸ ˜ ao voxel a voxel sugeriu que existem verdadeiras diferenc¸as em termos de volume cerebral entre os indiv´ ıduos dos dois grupos, revelando-se bastante eficiente como t´ ecnica de diagn´ ostico. Conduzimos tamb´ em uma an´ alise apenas para as regi˜ oes que se mostraram significativas no estudo utilizando Morfometria baseada em Voxels: Figura 5.2: Resultados para a an´ alise das regi˜ oes resultantes da an´ alise da Morfometria baseada em Voxels. CAP´ ITULO 5. RECONHECIMENTO DE PADR ˜ OES EM IMAGENS USANDO PRONTO87 Aqui foram apenas utilizados para a an´ alise os voxels das dezassete regi˜ oes fornecidas pelo VBM no cap´ ıtulo anterior. A regi˜ ao Temporal-Sup-L foi a que revelou ser a mais importante para a classficac¸ ˜ ao nesta parte. Pelo contr´ ario, a regi˜ ao Occipital foi a que menos contribuiu para a discriminac¸ ˜ ao. O algoritmo errou na classificac¸ ˜ ao de quatro indiv´ ıduos estando portanto associado um erro aproximado de 11.4%. O classificador apresentou a mesma regra de decis˜ ao que a apresentada acima. Os indiv´ ıduos 5 e 16 que fazem parte do grupo dos casos foram classificados como indiv´ ıduos saud´ aveis. J´ a os indiv´ ıduos 29 e 30 que fazem parte do grupo de controlo, foram classificados como casos. Os voxels destes indiv´ ıduos nestas regi˜ oes parecem ent˜ ao n˜ ao servir para exprimir um diagn´ ostico correto. Dever-se-ia portanto nestes indiv´ ıduos aumentar as regi˜ oes em estudo para conseguir um diagn´ ostico eficiente. Conclus˜ ao O estudo realizado serve de mais uma prova da boa aplicabilidade das M´ aquinas de Vetores de Suporte a estudo de diagn´ ostico em amostras de tamanho reduzido. As t´ ecnicas aplicadas levaram ` a concretizac¸ ˜ ao dos objetivos propostos ao in´ ıcio e abrem portas a outras investigac¸ ˜ oes na ´ area que sirvam para um melhor e maior conhecimento acerca do S´ ındrome de Williams. Utilizando as M´ aquinas de Vetores de Suporte para as vari´ aveis do objetivo 1 desta dissertac¸ ˜ ao, verificou-se que com um modelo de n´ ucleo radial (custo de 2 e gama de 0.3995) obtivemos uma classificac¸ ˜ ao 100 % correta de todos os indiv´ ıduos. Poder´ ıamos tamb´ em ter utilizado um n´ ucleo polinomial j´ a que com este se obtiveram os mesmos resultados. Utilizou-se Validac¸ ˜ ao Cruzada “deixar-um-fora” em todas as simulac¸ ˜ oes. Mais ainda, o estudo realizado com a estandardizac¸ ˜ ao das vari´ aveis conduziu-nos praticamente aos mesmos resultados. Aplic´ amos tamb´ em estes m´ etodos ` as vari´ aveis em proporc¸ ˜ ao, uma vez que uma das vari´ aveis dispon´ ıveis era o volume total intracranial de todos os indiv´ ıduos. Aqui, o melhor resultado tamb´ em se obteve utilizando um n´ ucleo radial (custo de 2 e gama de 0.4496) sendo que o modelo errou apenas a classificac¸ ˜ ao de um indiv´ ıduo, o que correspondeu a um erro de cerca de 2.8 %. Daqui obtivemos que as vari´ aveis mais importantes para a classificac¸ ˜ ao s˜ ao, de facto, o volume total intracranial dos indiv´ ıduos bem como o volume da regi˜ ao do precuneus e do p´ olo frontal porque quando retiradas do modelo completo conduziam ao maior erro encontrado: 4 indiv´ ıduos mal classificados. Seguiu-se a vari´ avel do volume da regi˜ ao parietal angular inferior pois quando retirada do modelo final, este errou na classificac¸ ˜ ao de dois indiv´ ıduos, e por fim, a vari´ avel do cingulado posterior errando apenas num indiv´ ıduo. O facto do volume total intracranial ser a vari´ avel de maior contribuic¸ ˜ ao na classificac¸ ˜ ao realizada n˜ ao ´ e surpreendente pois j´ a existem estudos que o afirmam. No entanto, serve de confirmac¸ ˜ ao. 89 90 Aplicando novamente as M´ aquinas de Vetores de Suporte ` as vari´ aveis do objetivo 2 foi obtido um modelo com n´ ucleo linear (de custo 2) que classificou bem todos os indiv´ ıduos. Este ´ e um caso raro em dados reais. O mesmo foi conseguido para as vari´ aveis estandardizadas. No estudo com as vari´ aveis utilizadas em proporc¸ ˜ ao, obtevese um modelo linear com um custo superior ou igual a 9.5, o que ´ e demasiado elevado para a amostra em quest˜ ao. De qualquer forma, com um custo inferior, a classificac¸ ˜ ao apenas errou num indiv´ ıduo. A utilizac¸ ˜ ao de um modelo com n´ ucleo radial (custo de 0.5 e gama de 0.1796) conduziu ` a mesma percentagem de sucesso, 100 %. Utilizando outros dos parˆ ametros obtidos e descritos no cap´ ıtulo 3, pudemos obter igualmente os mesmos resultados. Verificou-se aqui que as vari´ aveis de volume das regi˜ oes da am´ ıgdala, cingulado anterior, temporal superiore p´ olo temporal n˜ ao tˆ em qualquer interferˆ encia nesta classificac¸ ˜ ao podendo ser exclu´ ıdas do modelo final sem qualquer preju´ ızo. A vari´ avel volume total intracranial foi a mais importante na classificac¸ ˜ ao, mais um vez, seguida pelas restantes vari´ aveis: volume da regi˜ ao occipitotemporal, dorsomedial, precuneus, retrospenial, ´ ınsula e orbitofrontal. O modelo errou na classificac¸ ˜ ao de dois indiv´ ıduos e em apenas um, respetivamente, quando estas vari´ aveis foram retiradas do modelo final. A an´ alise do objetivo 3 revelou que as vari´ aveis utilizadas, por terem dispers˜ oes diferentes, podiam estar a influenciar negativamente a classificac¸ ˜ ao. Neste caso s´ o fez sentido utilizar as vari´ aveis em proporc¸ ˜ ao. Assim, o melhor resultado revelou ser um erro de 14.3%, que correspondeu a errar na classificac¸ ˜ ao de cinco indiv´ ıduos. Apesar de o erro n˜ ao ter sido exageradamente alto, se considerarmos o tamanho amostral, este resultado n˜ ao se revelou fortemente satisfat´ orio. As vari´ aveis do volume da regi˜ ao parietal e da fissura calcarina pareceram apresentar a mesma importˆ ancia na classificac¸ ˜ ao. A an´ alise da morfometria baseada em voxels sugeriu que nas seguintes regi˜ oes possa haver diferenc¸as significativas de volume: regi˜ ao occipital (volume que poder´ a ser menor nos casos), cerebelo, precuneus, circunvoluc¸ ˜ oes lingual, angular, hipocampal, regi˜ ao pericalcarina, circunvoluc¸ ˜ ao temporal superior e regi˜ ao paracentral. Nestas ´ ultimas sete regi˜ oes os resultados apontam para que os controlos saud´ aveis apresentem menor volume. Esta an´ alise foi realizada comparando todos os voxels a partir de um teste-t, ap´ os todas as aquisic¸ ˜ oes serem pr´ e-processadas. Por fim, utilizaram-se apenas os voxels das imagens das regi˜ oes supramencionadas no PRoNTo. Foi efetuada uma an´ alise de classificac¸ ˜ ao atrav´ es de um modelo linear de M´ aquinas de Vetores de Suporte. O algoritmo errou na classificac¸ ˜ ao de quatro indiv´ ıduos (que corresponde a um erro de 11.4%). A regi˜ ao temporal superior foi a que mais 91 contribuiu para a classificac¸ ˜ ao obtida. Realizou-se tamb´ em este estudo para todos os voxels do c´ erebro. Os resultados foram muito bons, verificando-se apenas dois indiv´ ıduos mal classificados. Aqui, as regi˜ oes que mais contribuiram para a classificac¸ ˜ ao foram o volume da regi˜ ao temporal, da fissura calcarina e angular. As que menos contribu´ ıram foram a occipital, parietal, frontal e circunvoluc¸ ˜ ao recta. Deve-se ent˜ ao centrar o estudo nas vari´ aveis mais importantes em termos de diagn´ ostico aqui sugeridas, nomeadamente na regi˜ ao temporal superior, calcarina e parietal angular que aparecem como muito importantes em todos os procedimentos realizados. Os resultados revelam-se assim congruentes para regi˜ oes que devem ser consideradas aquando de um correcto diagn´ ostico de um novo paciente. Trabalho Futuro Estes resultados constituem a base para uma pesquisa m´ edica mais aprofundada nas ´ areas cerebrais que se revelaram de maior significˆ ancia. De facto, os resultados obtidos por aplicac¸ ˜ ao de M´ aquinas de Vetores de Suporte nas vari´ aveis dos volumes das regi˜ oes do objetivo 3 poder˜ ao ser melhorados atrav´ es da inclus˜ ao de mais vari´ aveis significativas. O erro obtido, apesar de n˜ ao satisfat´ orio, n˜ ao foi considerado de todo um mau resultado. Pretende-se ainda no futuro aplicar o mesmo tipo de metodologia de forma ao diagn´ ostico da Esclerose M´ ultipla, descobrindo novamente em que ´ areas cerebrais importar´ a focar o estudo m´ edico. Lista de S´ımbolos Esta secc¸ ˜ ao apresenta a terminologia mais importante utilizada neste trabalho de forma a tornar mais simples e flu´ ıda a leitura deste. Esta encontra-se pela ordem em que aparece a partir da secc¸ ˜ ao 3 do cap´ ıtulo 1 at´ e ao final do cap´ ıtulo 2. X= (x1, ..., xm)- Vetor de observac¸ ˜ oes da amostra treino de dimens˜ ao m mDimens˜ ao de X yConjunto das etiquetas de X βConstantes associadas ` a definic¸ ˜ ao do hiperplano x∗- Observac¸ ˜ ao da amostra teste ˆy=f(x)- Func¸ ˜ ao de previs˜ ao Remp(f)- Risco emp´ ırico de f R(f)- Risco funcional de f C(.)- Func¸ ˜ ao custo SConjunto de treino (particionado em S0eS1) nN´ umero de observac¸ ˜ oes da amostra treino PFunc¸ ˜ ao de probabilidade gFunc¸ ˜ ao do tipo sinal definida GConjunto de todas as func¸ ˜ ao do tipo g =G(S)- N´ umero de func¸ ˜ oes do tipo sinal que o algoritmo de aprendizagem tem capacidade de induzir sobre Spor G dimV C - Dimens˜ ao Vapnik-Chervonenkis 93 100 101 Anexo II As seguintes tabelas realizam uma an´ alise descritiva e gr´ afica de cada uma das vari´ aveis: 102 103 104 A sua an´ alise encontra-se no cap´ ıtulo de An´ alise Explorat´ oria e Descritiva do Objetivo 1. 105 Boxplots para an´ alise de efeitos brutos: 0 1 5000 6000 7000 8000 posteriorcingulate 0 1 14000 18000 22000 26000 precuneus 0 1 1000 1500 2000 2500 3000 frontalpole 0 1 8000 10000 12000 14000 16000 G_pariet−inf_Angular 0 1 1200000 1400000 1600000 1800000 VolumeTotalIntracranial 106 Tabela dos valores de multicolinearidade entre as vari´ aveis: Tabela dos valores de VIF: Anexo III As seguintes tabelas apresentam a an´ alise descritiva e gr´ afica de cada uma das vari´ aveis do objetivo 2: 107 108 109 116 Boxplots para an´ alise de efeitos brutos: 0 1 75000 80000 85000 90000 95000 parietal 0 1 6000 7000 8000 9000 10000 11000 calcarine Tabela dos valores de multicolinearidade das vari´ aveis do objetivo 3: 117 Tabela dos valores de VIF: