Aplicaciones del caos determinista a la detección de outliers
Abstract
In this paper the authors show that techniques employed in the prediction of chaotic time series can also be applied to detection of outliers. A definition of outlier lS provided and a theorem on hypothesis testing is also proved.
Full text
REVISTA DB LA ACADBMIA CANARIA DE CIENCIAS Folia Canariensis Academiae Scientiarum
Rev.Acad.Canar.Cienc., IV (núms. y 2) ,45-53 (1992) APLICACIONES DEL CAOS DETERMINISTA A LA DETECCION DE OUTLIERS Fernando Fernández Rodríguez. Departamento de Economía Aplicada. José Miguel Pacheco Castelao. Departamento de Matemáticas. Universidad de Las Palmas de Gran Canaria. ABSTRACT In this paper the authors show that techniques employed in the prediction of chaotic time series" can also be applied to detection of outliers. A definition of outlier" lS provided and a theorem on hypothesis testing is also proved. Introducción Conceptos y definiciones básicas Una definición intuitiva de outlier en una serie temporal de datos es la siguiente: Una observación cuya discordancia con los restantes valores es excesiva con. relación al modelo explicativo seleccionado para la serie. él. Cuando se intentan efectuar predicciones sobre una serie temporal, la presencia de outliers es siempre un problema. Sin embargo, se probará que el desarrollo de métodos predictivos para series caóticas (Farmer y Sidorowich (1987)) permite formular 45
criterios de detección de outliers y de zonas turbulentas en las series. El instrumento esencial en teoría de la predicción es el espacio de fases, construído de la siguiente manera: Dados una serie temporal finita {x , ..... ,x} y dos enteros 1 N positivos m y T, para cada i en su rango de valores posibles se define la m-historia con retardo T como: X m,T ( ) = x , x ....... ,x l ! !-T !-"['(m-U Normalmente; en las aplicaciones se tomará T = 1. El entero m se conoce como dimensión ~ inmersión Las m-historias son vectores de un espacio m-dimensional real, que es precisamente el espacio de fases asociado a la serie dada. Si la serie no est¿ muestreada en un ruido, una selección adecuada de m y T permitirá -'por 10 general - reconocer que las m-historias forman un atractor extraño reflejo de alguna dinámica determinista subyacente en la serie. Tales series se denominan series caóticas . El teorema de Takens (Takens (1981)) indica que si un sistema dinámico n-dimensional es estudiado a través de un único observable - la serie temporal - entonces de modo genérico, la dinámica que se reconstruye en el espacio de fases es equivalente a la del sistema original siempre que m > 2n. En Fernández (1992) se presentan diversos procedimientos de encontrar la dimensión de inmersión adecuada para una serie temporal. La reconstrucción de la ley dinámica no lineal que genera una serie se realiza por ajuste de un vector ~ de parámetros y de una función f minimizando la suma de los errores cuadráticos el.' En Casdagli 4ú
(1989) se estudian diferentes formas para la relación funcional f. La reconstrucción global de una dinámica determinista pUede fracasar según el número de datos disponibles. Ello es evidente si hay muy pocos, pero un número elevado producirá problemas de sobredeterminación del número de parámetros del modelo que en nada disminuyen los errores de predicción (Farmer y Sidorowich (1988». Por esta razón se han introducido las técnicas de predicción por analogías mediante representaciones locales de la dinámica que permiten mejorar en muchos casos las predicciones a corto plazo. Sean la serie temporal y su dimensión de inmersión m. Dada la m-historia del último elemento de la serie, x: ' se considera el conjunto de las k m-historias más próximas a ella dentro del espacio de fases (ver en Fernández (1992) los detalles y formalización): { x":, .... . . ,x": I d = 11 x": - xm 11 son los k menores JI Jk 1 JI N valores obtenidos al calcular la distancia entre x~ y las restantes m-historias del espacio de fases } De esta forma, la predicción x ~ X se formula N N+l mediante alguna interpolación del tipo x = ~ ( N+l entre los valores consecutivos a los X.. Tomando las precauciones JI pertinentes, esto es, Vk , N - j > s , es posible formular la k predicción x ~ x de modo análogo. N N+s La expresión funcional más simple para tfI la da el cálculo del s baricentro de los puntos x. Jt S 47
Se pueden generalizar combinaciones lineaies convexas predictores simpliciales .... simp X = N+s k L a,x, l~l l Jl+s este predictor considerando Nos referimos con ello a los k donde L '\ 1=1 = 1 Una primera alternativa en este sentido será suponer que los puntos más próximos al x: en el espacio de fases deben influir más en la predicción. Estaremos considerando en este caso que ex.;:::;; I (lId) I I k 1: (l/d l) 1 =1 donde m .. - X. U JI Una segunda alternativa. interesa..'1te cuando la ley diná.T.ica que genera los datos va cambiando paulatinamente con el tiempo, es considerar que a. l es función decreciente de N - ji t es decir, que la influencia de cada m-historia del pasado tiene una influencia en el predictor que va disminuyendo con el transcurso del tiempo. Para obtener una predicción independiente de cualquier consideración sobre ios puntos del espacio de fases, se puede considerar un predictor simplicial con coeficientes aleatorios obtenido del modo siguiente: Se muestrean r veces k números aleatorios A • I se consideran el predictor j\ en una distribución uniforme y cada vez • • los coeficientes oc =A / LA, ! I ! Con ello se construye t =1 simplicial siguiente promediando sobre las r relaciones del muestreo: .... ~i!oimp 1 r k x = L L a, x, N+, r I Ji + • p=l i =1 P P P 48
Se plantean los siguientes problemas abiertos: ¿ influye decisivamente el valor r en los resultados de la predicción ? ¿ Es posible hallar un valor óptimo de k ? Detección dinámica de outlÍers Para una serie temporal caótica el horizonte dentro del cual es posible realizar predicciones viene cuantificado a través de los exponentes de Lyapunov y la entropía de Kolmogorov (Schuster (1988)). Sin embargo, las series que aparecen en las aplicaciones están generadas -además de por una dinámica interna por "shocks" ruidosos exógenos de naturaleza imprevisible. Es el ejemplo de ciertas series financieras ( Bajo, Fernández y Sos villa (1992a)). Aunque la reconstrucción global de la dinámica que genera la serie no sea viable, es posible separar la parte determinista de los outliers producidos por los "shocks" exógenos. Ello es cierto independientemente del modelo seleccionado para explicar la dinámica determinista. Se dirá, por tanto, que el método de detección de outliers es robusto. Definición "Se dice que el dato X de la serie temporal 1 {x , .... x} es un outlier dinámico si la predicción por analogías 1 N a partir de la m-historia un valor e > O prefijado". m X 1-1 se efectua con un error mayor que Nótese que en esta definición existe un componente sub jetivo en la elección del valor E. Esta selección se hará de acuerdo con el contenido y significado de los datos que conforman la serie. 49
a 0.0 ~------~------~--~--~------,--------t~.1 b 0.03 0.02 0.01 0.00 Outllers dinámicos obtenidos en una serie financiera donde se considera un nIvel de deteccl.on € situado en 0.02. a) Serie financiera de tipo de cambio con pago aplazado de un mes. b) Errores en dlmenslon de Inmerslon 5. La distribución de los errores e es desconocida de antemano I y la detección de outliers se traduce, por tanto, en estudiar la distribución de los errores formular los contrastes de hipótesis adecuados. Debido a la sencillez matemática del predictor simplicial las hipótesis sobre la distribución de la serie original de datos x I pueden traducirse facilmente a hipótesis sobre ios errores el; ello permite establecer contrastes acerca de la distribución original de los elementos de la serie. El caso de más interés, por sus implicaciones prácticas, consiste en distinguir un ruido blanco de una dinámica determinista endógena no lineal y por tanto predecible a corto plazo. Tal es el caso de muchas series financieras (Bajo, Fernández y Sosvilla (1992b)). Sea la serie {Xl' con un espacio de fases m-dimensional; se considera la predicción baricéntrica con k 50
m-historias de x N+l Si la serie '"bar X N+l está generada por variables independientes idénticamente distribuidas N(O,O'), el error Abar e: =x -X =x N+l N+l N+l N+l es una variable aleatoria que sigue una distribución donde la desviación típica es aleatorias N(O,O' ), 1 O' :::: 1 = 0'( 1 + 1 )1/2 k Del razonamiento anterior se deduce inmediatamente el siguiente Teorema "Dada una serie temporal {X, .... ,X} , el siguiente contraste 1 N de hipótesis permite discriminar entre la procedencia puramente aleatoria de la serie o la existencia de una dinámica no lineal endógena determinista: H La variable e sigue una distribución N(O,O' ) o N+l 1 * * " La variable e sigue una distribución N( 0,0' ) con O' < O' n+l 1 Para investigar, en la práctica, si la distribución de los errores de un número n de predicciones se corresponde con la de la hipótesis H, se considera un nivel 01. de significación y se define o una región crítica R para una i con n-1 grados de libertad. 51
REFERENCIAS Bajo, O. j F. Fernández y S. Sosvilla (l992a) "Chaotic Behaviour in Exchange-Rate Series: First Result for the Peseta-U.S. Dollar Case". De próxima aparición en Economics Letters. (1992b) "Volatilidad y predecibilidad en las series del tipo de cambio peseta-dolar: Un enfoque basado en el caos determinista". De próxima aparición en Revista Española de Economía. Casdagli, M. (1989) "Nonlinear Prediction of Chaotic Time Series" Physica º 35, 335-356. Farmer,J.D. y J. Sidorowich (1987) "Predicting Chaotic Time Series", Physical Review Letters. Vol 59, 8, 845-848. (1988) "Exploiting Chao s to Prédict the Future and Reduce Noise". In Evolution, Learning and Cognition. Editado por Y.C. Lee, World Scientific Press, pp 27. Fernández, F. (1992) "El problema de la predicción en series temporales: Aplicaciones del caos determinista". Tesis Doctoral. Departamento de Economía Aplicada. Universidad de Las Palmas de G.C. Rosado, F. (1990) "Selection of multivariate influencial observations". COMPSTAT -9th Symposium on Computational Statistic. Schuster, H.G. (1988) Deterministic Chaos. An Introduction. VCH. Weinheim. 52