scieee AI-readable full text Open interactive document viewer

Una introducción a las técnicas de muestreo

Pérez Carballido, Sofía

Abstract

[ES] Imaginemos un trabajo tan “sencillo” como un estudio sobre una determinada población. Para ello, se necesita, en la mayoría de los casos, la selección de una muestra y es aquí donde surgen las primeras cuestiones: ¿cómo seleccionar la muestra?, ¿de qué tamaño?, ¿qué importancia tienen los individuos de la población en este proceso? Las solución a estas y otras preguntas similares le corresponden al Muestreo. En 1934 el profesor J. Neyman publica en Londres lo que se considera el primer trabajo científico sobre muestreo. Hoy, 87 años después, el uso de las técnicas de muestreo está extendido a diversos campos de estudio y gracias a las nuevas tecnologías, en los últimos años las técnicas de muestreo han evolucionado notablemente. En el Capítulo 1 de este trabajo se recorre un pequeño viaje a través de la historia del Muestreo. En el Capítulo 2 se aborda el problema de muestreo en general, definiendo los conceptos más bá sicos, clasificando los distintos tipos de Muestro y mostrado la construcción de los estimadores de Horvitz-Thompson y Hansen-Hurwitz. En los Capítulos 3, 4, 5 y 6 estudiaremos el muestreo aleatorio simple, el muestreo aleatorio estratificado, el muestreo sistemático y el muestreo por conglomerados, respectivamente. Finalmente en el Capítulo 7 presentamos una aplicación a datos reales de una base de datos del alumnado del Máster Interuniversitario en Técnicas Estadísticas con la que ilustramos los distintos métodos de muestreo. Incluimos además un pequeño estudio de simulación para comparar el error cometido por estos métodos en ciertas situaciones.

Full text

Traballo Fin de Grao Una introducción a las técnicas de muestreo Sofía Pérez Carballido 2020 / 2021 UNIVERSIDADE DE SANTIAGO DE COMPOSTELA GRAO DE MATEMÁTICAS Traballo Fin de Grao Una introducción a las técnicas de muestreo Sofía Pérez Carballido 2020 / 2021 UNIVERSIDADE DE SANTIAGO DE COMPOSTELA Trabajo propuesto Área de Conocimiento: Estadística e Investigación Operativa Título: Una introducción a las técnicas de muestreo Breve descrición del contenido Este trabajo tiene por objetivo hacer una revisión exhaustiva de los diferentes procedimientos de muestreo, sus características y sus usos. Comenzaremos por una revisión histórica que nos permita establecer una imagen global del origen y la evolución de esta rama de la Estadística a lo largo de los años. Una vez establecido el marco histórico formalizaremos qué es un proceso de muestreo y pasaremos a detallar los distintos tipos. En esta parte trataremos también los criterios existentes para la selección de un plan de muestreo, así como las distintas técnicas de determinación del tamaño muestral. Para finalizar intentaremos explotar un aspecto más aplicado de este área llevando a la práctica, a pequeña escala y dentro de nuestras posibilidades, un estudio en el que se implementen algunos de los esquemas anteriormente descritos. III Índice general Resumen VI 1. CONTEXTO HISTÓRICO DEL MUESTREO 1 2. EL PROBLEMA DE MUESTREO 5 2.1. CONCEPTOSBÁSICOS................................ 5 2.2. MÉTODOSDEMUESTREO ............................. 7 2.3. ESTIMADORES .................................... 10 2.3.1. Distribución en el muestreo de un estimador . . . . . . . . . . . . . . . . . . 12 2.3.2. Propiedades de un estimador . . . . . . . . . . . . . . . . . . . . . . . . . . 13 2.3.3. Construcción de estimadores insesgados. Estimador de Horvitz-Thompson y Hansen-Hurwitz ................................ 14 3. MUESTREO ALEATORIO SIMPLE 21 3.1. MUESTREO ALEATORIO SIMPLE SIN REEMPLAZAMIENTO . . . . . . . . . 21 3.1.1. Estimadores y sus varianzas . . . . . . . . . . . . . . . . . . . . . . . . . . 22 3.2. MUESTREO ALEATORIO SIMPLE CON REEMPLAZAMIENTO . . . . . . . . . 25 3.2.1. Estimadores y sus varianzas . . . . . . . . . . . . . . . . . . . . . . . . . . 25 3.3. COMPARACIÓN ENTRE MUESTREO ALEATORIO SIMPLE SIN Y CON REEMPLAZAMIENTO.................................. 26 4. MUESTREO ALEATORIO ESTRATIFICADO 29 4.1. MUESTREO ALEATORIO ESTRATIFICADO SIN REEMPLAZAMIENTO . . . . 30 4.1.1. Estimadores y sus varianzas . . . . . . . . . . . . . . . . . . . . . . . . . . 30 4.2. MUESTREO ALEATORIO ESTRATIFICADO CON REEMPLAZAMIENTO . . . 32 4.2.1. Estimadores y sus varianzas . . . . . . . . . . . . . . . . . . . . . . . . . . 32 4.3. AFIJACIÓN....................................... 33 5. MUESTREO SISTEMÁTICO 35 5.1. ESTIMADORES .................................... 36 V VI ÍNDICE GENERAL 6. MUESTREO POR CONGLOMERADOS 39 6.1. Diferencias entre conglomerado y estrato . . . . . . . . . . . . . . . . . . . . . . . 40 6.2. Estimadores y sus varianzas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 41 7. ESTUDIO DE UN CASO PRÁCTICO 45 7.1. La base de datos y su depuración . . . . . . . . . . . . . . . . . . . . . . . . . . . . 45 7.2. Objetivos del estudio y análisis de la base de datos . . . . . . . . . . . . . . . . . . 48 7.3. Aplicación de los métodos de muestreo . . . . . . . . . . . . . . . . . . . . . . . . 50 7.4. Pequeño estudio de simulación . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 55 Agradecimientos 57 Apéndice 58 Referencias 77 Resumen Imaginemos un trabajo tan “sencillo” como un estudio sobre una determinada población. Para ello, se necesita, en la mayoría de los casos, la selección de una muestra y es aquí donde surgen las primeras cuestiones: ¿cómo seleccionar la muestra?, ¿de qué tamaño?, ¿qué importancia tienen los individuos de la población en este proceso? Las solución a estas y otras preguntas similares le corresponden al Muestreo. En 1934 el profesor J. Neyman publica en Londres lo que se considera el primer trabajo científico sobre muestreo. Hoy, 87 años después, el uso de las técnicas de muestreo está extendido a diversos campos de estudio y gracias a las nuevas tecnologías, en los últimos años las técnicas de muestreo han evolucionado notablemente. En el Capítulo 1 de este trabajo se recorre un pequeño viaje a través de la historia del Muestreo. En el Capítulo 2 se aborda el problema de muestreo en general, definiendo los conceptos más básicos, clasificando los distintos tipos de Muestro y mostrado la construcción de los estimadores de Horvitz-Thompson y Hansen-Hurwitz. En los Capítulos 3, 4, 5 y 6 estudiaremos el muestreo aleatorio simple, el muestreo aleatorio estratificado, el muestreo sistemático y el muestreo por conglomerados, respectivamente. Finalmente en el Capítulo 7 presentamos una aplicación a datos reales de una base de datos del alumnado del Máster Interuniversitario en Técnicas Estadísticas con la que ilustramos los distintos métodos de muestreo. Incluimos además un pequeño estudio de simulación para comparar el error cometido por estos métodos en ciertas situaciones. Abstract Let us imagine a simple task: a study on a population. Such an study requires, in most cases, the selection of a sample, and here the first question arise: how to select the sample?, not only how, but which size should it be? or how important are the individuals of the population in this process?. The solutions to these and other similar questions can be answered using the sampling theory. In 1934, Professor J. Neyman published in London the first scientific work about sampling. Today, 87 years later, the use of sampling techniques is widespread in various fields of study and thanks to new technologies, sampling techniques have evolved considerably in recent years. Chapter 1 includes a short journey through the history of sampling. Chapter 2 deals with the sampling problem itself, its formalisation, defining the most basic concepts, classifying the different types VII 6CAPÍTULO 2. EL PROBLEMA DE MUESTREO Marco: lista de las unidades de muestreo. Será más completo cuanto mejor cubra la población objetivo, i.e., la diferencia entre la población objetivo y el marco deberá ser lo suficientemente pequeña para permitir que se haga Inferencia acerca de la población objetivo a partir de una muestra obtenida del marco. Esta diferencia se denomina error de cobertura. Muestra: colección de unidades de muestreo obtenidas a partir de un marco o marcos. Denotamos una muestra de tamaño npor s={u1,...,un}. Recordemos que cada uipuede ser una unidad elemental o compuesta dependiendo del método de muestreo escogido. Espacio muestral: conjunto de todas las posibles muestras que se pueden obtener, se denota por S. Para ilustrar y facilitar la comprensión de todos estos conceptos, utilizaremos el siguiente ejemplo: imaginemos que queremos realizar un estudio sobre adolescentes de entre 12 y 18 años del ayuntamiento de Narón, esta sería nuestra población objetivo. Cada uno/a de los/as jóvenes es un elemento sobre el que se realizarán las mediciones. Como es habitual en este tipo de estudios no se establece contacto con toda la población, por lo que se reduce el número de jóvenes sobre los/as que podremos tomar las mediciones, esta es ahora la población investigada. Es decir, la población investigada será el subconjunto de la población objetivo al que tenemos acceso para realizar las mediciones (si por ejemplo decidimos tener acceso a estos/as jóvenes a través de los/as matriculados/as en los institutos, podría haber jóvenes no escolarizados/as; o si tenemos acceso a ellos/as a través de redes sociales, podría haber jóvenes que no participen en ninguna red social). Si decidimos acceder a ellos a través los institutos, los/as jóvenes, en este caso alumnos/as, estarán agrupados/as por instituto, estas serán nuestras unidades compuestas, cada unidad compuesta está constituida por varias unidades elementales, i.e., por varios/as alumnos/as. La lista de las unidades constituye el marco, en este ejemplo un listado de los/as alumnos/as, si se tienen unidades elementales o los institutos, si se tienen unidades compuestas. Las unidades que seleccionemos, bajo unos criterios establecidos, formarán la muestra sobre la que se desarrollará el estudio. Para resumir, en este ejemplo, tenemos: Elemento: joven adolescente entre 12 y 18 años de Narón. Población objetivo: total de jóvenes del ayuntamiento. Población investigada: jóvenes matriculados/as en institutos. Unidad elemental: alumno/a. Unidad compuesta: instituto. Marco: listado de alumnos/as y/o institutos. Muestra: alumnos/as y/o institutos seleccionados. Espacio muestral: conjunto de todas las posibles muestras, es decir, de todas las posibles formas de escoger alumnos/as o institutos (dependiendo del tipo de unidad de muestreo de interés). 2.2. MÉTODOS DE MUESTREO 7 2.2. MÉTODOS DE MUESTREO Ante la diversidad de poblaciones que nos podemos encontrar, según como queramos o necesitemos enfrentarnos a ellas y en base al estudio que se pretenda realizar, surgen varios métodos de muestreo. Para clasificar los diferentes métodos de muestreo, podemos atender a varios criterios: si la población de estudio es finita o infinita, si el mecanismo empleado para obtener una muestra es probabilístico o no probabilístico, y si la forma de selección de las unidades para formar parte de la muestra es con o sin reemplazamiento. Si consideramos toda esta casuística tenemos las siguientes categorías: 1. Población finita e infinita. La clasificación más sencilla y trivial según el tamaño de la población objetivo. Existen entonces dos posibles métodos de muestreo: Muestreo para poblaciones finitas: se conoce el tamaño total de la población. Muestreo para poblaciones infinitas: se desconoce el tamaño de la población. 2. Probabilístico o no probabilístico. Muestreo probabilístico: se da cuando puede calcularse previamente la probabilidad de obtener cada una de las muestras que es posible seleccionar. Para ello es necesario que esta selección pueda ser considerada como un experimento aleatorio. Esta aleatoriedad no es una característica que pertenece a la muestra, sino al proceso de muestreo que se utiliza para obtenerla, ver Azorín-Poch (1969). En el muestreo probabilístico se pueden controlar o medir los errores así como la representatividad de la muestra. También se conoce la probabilidad que tienen los elementos de ser seleccionados para formar parte de una muestra. Dentro del muestreo probabilístico podemos encontrar los siguientes tipos: • Muestreo aleatorio simple: en este método de muestreo se establece un tamaño muestral fijo, n, que garantiza que la probabilidad de obtener cualquier muestra de tamaño nes la misma y consecuentemente, todas las unidades tienen la misma probabilidad de ser seleccionadas para formar parte de la muestra, ver Azorín-Poch (1969) y Cid-Cid y cols. (1999). Si en el ejemplo ilustrativo que planteamos en la sección anterior sobre los jóvenes del ayuntamiento de Narón, aplicásemos este método de muestreo, para un tamaño muestral fijado, seleccionaríamos de forma aleatoria a los/as alumnos/as de todos los institutos a partir de un listado conjunto. Pese a ser el método más utilizado, tener un tamaño muestral fijo hace que sea necesario disponer de un marco de las unidades muy concreto y detallado, lo que dificulta en ocasiones la obtención de la muestra. Para solventar estas dificultades se desarro- 8CAPÍTULO 2. EL PROBLEMA DE MUESTREO llan otros métodos, que como veremos más adelante, en ocasiones requieren de este muestreo aleatorio simple para su funcionamiento. • Muestreo aleatorio estratificado: para aplicar este método de muestreo, se divide a la población en conjuntos llamados estratos, caracterizados porque en cada uno de ellos los elementos son homogéneos entre sí, pero heterogéneos con los demás estratos. Se entiende como elementos homogéneos aquellos que tienen una determinada característica común, y elementos heterogéneos cuando esa característica difiere. Denominamos el muestreo estratificado como aleatorio porque dentro de cada uno de los estratos se seleccionan las unidades de forma aleatoria simple, se verá en profundidad este método en el Capítulo 4. En el mismo ejemplo de los jóvenes, si se desea por ejemplo realizar un estudio sobre la aceptación de actividades extraescolares entre el alumnado, nos puede interesar dividir a los alumnos en estratos, siendo la característica común de cada estrato el número de actividades a las que asiste cada alumno, por ejemplo, tenemos un estrato para cero actividades, otro estrato para una, otro estrato para dos y por último un estrato para alumnos que asisten a más de dos actividades extraescolares. Una vez definidos los estratos, se escogería un número (generalmente proporcional al tamaño del estrato) n1,n2,...,nhde alumnos en cada estrato para formar la muestra, de manera que n1+n2+...+nh=n. • Muestreo sistemático: con este método, a partir de la selección aleatoria de la primera unidad, y aplicando lo que se conoce una regla sistemática, se seleccionan el resto de unidades para la muestra. Esta regla consiste en, una vez seleccionada la primera unidad, la segunda se obtiene sumando kunidades (o dando un salto de kunidades) a la posición de la primera y así sucesivamente. Para el ejemplo empleado hasta ahora, se elabora una lista por orden alfabético de los jóvenes del ayuntamiento matriculados en algún instituto y se selecciona un alumno al azar. El siguiente se selecciona sumando kunidades, y así sucesivamente. Cómo seleccionar la primera unidad y cómo seleccionar k, lo veremos en detalle en el Capítulo 5. • Muestreo por conglomerados: en este método de muestreo la población está agrupada en conjuntos llamados conglomerados, dentro de los cuales las unidades son heterogéneas, pues se busca que un conglomerado represente a la población. Esta es la principal diferencia entre estrato y conglomerado, se explica en detalle en la Sección 6.1. La agrupación de las unidades en conglomerados se realiza generalmente por criterios de proximidad geográfica o divisiones territoriales, de las cuales ya se conoce información. De forma aleatoria se seleccionan los conglomerados para formar parte de la muestra, este caso sirve de ilustración de un muestreo realizado sobre unidades compuestas, los conglomerados. 2.2. MÉTODOS DE MUESTREO 9 En el ejemplo sobre el que estamos trabajando, realizar un muestreo por conglomerados consistiría en elegir, por ejemplo, como conglomerados los institutos, serían nuestras unidades compuestas pues cada conglomerado está formado por varios alumnos, las unidades elementales. Se cumple que esta agrupación de las unidades en conglomerados está establecida previa al muestreo y que un instituto pueda representar a la población, en él encontraremos diversidad de jóvenes de entre 12 y 18 años. Muestreo no probabilístico: no conocemos la probabilidad que tienen los elementos de ser seleccionados para formar parte de la muestra. Debido a ello, no se tiene la certeza de que las muestras sean representativas y no se pueden realizar procedimientos inferenciales adecuados sobre la población. Dentro del muestreo no probabilístico podemos encontrar entre otros los siguientes tipos: • Muestreo por cuotas: para este método de muestreo se seleccionan las unidades muestrales considerando las variables que se van a estudiar, y se determina la cantidad o cuota de unidades que cumplen unas características previamente fijadas en base únicamente al conocimiento ”experto“ que el investigador tiene de la población. Es importante que cada unidad se encuentre en uno y solo uno de los subgrupos que forman las cuotas. • Muestreo bola de nieve: este método de muestreo es aplicado en poblaciones pequeñas y difíciles de localizar. Para seleccionar la muestra se parte de una unidad sobre la que se pueden medir las variables objeto de estudio. A partir de esta unidad se localizan las demás unidades de la población. Si queremos realizar un estudio acerca de los jóvenes de Narón que practican natación, una vez seleccionado un/a joven nadador/a con su ayuda se localizan los/as demás jóvenes que practican este deporte. • Muestreo por conveniencia: este método de muestreo se caracteriza por seleccionar las unidades de la muestra por la facilidad de acceso a ellas. Un estadístico desea hacer un estudio sobre el uso de las tecnologías para enseñar Matemáticas, contacta con un/a amigo/a que es profesor de Matemáticas en un instituto de Narón para utilizar a sus alumnos/as como muestra, esta situación sería un claro ejemplo de uso del muestreo por conveniencia. 3. Forma de selección de las unidades. Dentro de esta clasificación podemos atender a dos criterios. El primero de ellos se basa en la probabilidad de selección en cada extracción de las unidades para formar parte de la muestra, que puede ser igual o desigual. Ya hemos visto que en el caso de que los elementos de una población tengan la misma probabilidad de ser seleccionados para una muestra, dicha muestra será representativa de la población. El segundo criterio se basa en la mecánica de selección de las unidades, que puede ser con o sin reemplazamiento. Con reemplazamiento consiste en que una vez extraída una unidad es 10 CAPÍTULO 2. EL PROBLEMA DE MUESTREO devuelta a la población, por lo que cada unidad podrá aparecer más de una vez en la muestra y mientras que sin reemplazamiento, consiste en que una vez extraída la unidad no es devuelta a la población, por lo que cada unidad solo podrá aparecer una única vez en la muestra. Combinando las cuatro características, tenemos estos métodos de muestreo: muestreo con reemplazamiento y probabilidades iguales; muestreo con reemplazamiento y probabilidades desiguales; muestreo sin reemplazamiento y probabilidades iguales y muestreo sin reemplazamiento y probabilidades desiguales. Atendiendo a los criterios anteriormente mencionados, para nuestro trabajo nos enfrentaremos al muestreo en poblaciones finitas y de carácter probabilístico. Garantizar que la muestra sea representativa de la población, nos permitirá obtener unos resultados rigurosos. Ilustramos en el siguiente esquema la clasificación de los métodos de muestreo. Resaltamos en el mismo, los métodos de muestreo que abordaremos a lo largo del trabajo. MUESTREO Población finita Población infinita Probabilístico No probabilístico · Muestreo aletatorio simple · Muestreo aleatorio estratificado · Muestreo por conglomerados · Muestreo sistemático Figura 2.1: clasificación de los métodos de muestreo. 2.3. ESTIMADORES Una de las principales tareas e intereses de la Inferencia Estadística es la estimación. La estimación consiste en, dada una población que sigue una cierta distribución de probabilidad dependiente de uno o varios parámetros, aproximar los posibles valores que pueden tomar estos parámetros poblacionales a partir de la información proporcionada por la muestra. 2.3. ESTIMADORES 11 Sea U={U1,U2,...,UN}la población; una muestra de tamaño nextraída de una población U de tamaño N, se denotará como s={u1,u2,...,un}. Y el espacio muestral de tamaño nscomo S= {s1,...,sns}, siendo nsel número de posibles muestras de tamaño nque se pueden formar en la población de tamaño N. Sobre el espacio muestral definimos la distribución de probabilidad, que denominaremos como distribución conjunta de la muestra. Esta distribución asigna a cada muestra la probabilidad que tiene de ser elegida: P:S→[0,1], que verifica: P(si)≥0∀i∈ {1,...,ns}y ns ∑ i=1 P(si) = 1. El hecho de poder calcular esta probabilidad es lo que define que un muestreo sea probabilístico, ver Sánchez-Crespo (1984) para más detalles. Una variable aleatoria Xes cualquier característica de interés que se puede medir sobre los elementos de la población. Los parámetros poblacionales son valores uni o multidimensionales que caracterizan el comportamiento de la variable de interés en algún aspecto relevante (media, varianza, probabilidad de éxito, proporción...). Nuestro objetivo en esta sección será estudiar como estimar un parámetro poblacional que denotaremos genéricamente por θ, a partir de la información contenida en la muestra. Suponiendo que la variable Xes continua, los parámetros más comunes a estimar son: total poblacional: T=θ(X1,...,XN) = ∑N i=1Xiy media poblacional: µ=θ(X1,...,XN) = 1 N∑N i=1Xi. En el caso de que la variable Xsea discreta, como por ejemplo si una unidad de la muestra pertenece o no a una determinada clase A, podemos definir los siguientes parámetros poblacionales: proporción de clase (proporción de elementos de la población que pertenecen a la clase A) y total de clase (total de elementos de la población que pertenecen a la clase A). Supongamos que Aitoma el valor 1 si una unidad pertenece a la clase Ay 0 si no pertenece a la clase A, entonces nos interesa: proporción de clase: B=θ(A1,...,AN) = ∑N i=1Ai Ny total de clase: A=θ(A1,...,AN) = ∑N i=1Ai. Para más información acerca de la elección de estos parámetros como los más relevantes puede consultarse Pérez-López (2010) , Cid-Cid y cols. (1999) o Alba y Ruiz (2006). 12 CAPÍTULO 2. EL PROBLEMA DE MUESTREO Resumimos en la siguiente tabla los parámetros que serán de aquí en adelante los parámetros de interés para cada uno de los métodos de muestreo que desarrollaremos: Xes continua Xes discreta Total poblacional: T= N ∑ i=1 XiProporción de clase: B= N ∑ i=1 Ai N Media poblacional: µ=1 N N ∑ i=1 XiTotal de clase: A= N ∑ i=1 Ai Tabla 2.1: parámetros poblacionales de interés según la variable Xsea continua o discreta. A partir de los datos y/o características observadas de la variable Xsobre las unidades de la muestra, construimos los estadísticos. Los estadísticos son funciones de variables aleatorias. Un estimador, bθ, es un estadístico que se utiliza para inferir el valor del parámetro poblacional θdesconocido, es decir, el que queremos estimar. Formalizamos el concepto de estimador, bθ, para el parámetro poblacional, θ, como la función que asocia a cada muestra sel valor numérico bθ(s(X)) = bθ(X1,X2,...,Xn), donde s(X) = {X1,X2,...,Xn} denota el conjunto de los valores que toma la variable Xsobre las unidades de la muestra. Considerando el espacio muestral S, obtenemos el conjunto S(X) = {s(X),s∈S}y podemos formalizar el estimador como la aplicación: bθ:S(X)⊂Rn→Rp (X1,...,Xn)→bθ(s(X)) = bθ(X1,...,Xn) = t, donde pserá la dimensión del parámetro (si p=1 será unidimensional, si p=2 bidimensional, ..., si p=nn-dimensional). 2.3.1. Distribución en el muestreo de un estimador Con la necesidad de conocer más los estimadores estudiamos en este apartado sus distribuciones en el muestreo. Se define la distribución de probabilidad de una variable aleatoria como la función que asigna una probabilidad a los valores que puede tomar dicha variable, Pérez-López (2010). Cada estimador bθtoma determinados valores a partir de cada una de las muestras del espacio muestral, la probabilidad de que tome un cierto valor depende de la probabilidad asociada a las muestras. Obtendremos la distribución de probabilidad en el muestreo para nuestro estimador cuando conozcamos todos los valores que puede tomar y sus probabilidades asociadas. Definimos como W={t∈R/∃s(X) = (X1,X2,...,Xn)∈S(X)que cumple bθ(s(X)) = t} el conjunto de todos los valores posibles del estimador. 2.3. ESTIMADORES 13 Dado que diferentes muestras sidel espacio muestral Spuedan dar lugar al mismo valor del estimador, la probabilidad de que el estimador tome dicho valor se define como la suma de las probabilidades de las muestras que dan lugar a ese valor para el estimador: PW(bθ(X1,X2,...,Xn) = t) = ∑{si/bθ(si(X))=t}P(si). Al par {W,PW}se le denomina distribución del estimador en el muestreo. 2.3.2. Propiedades de un estimador Una vez que ya sabemos qué es un estimador, estamos interesados en encontrar un estimador preciso. Se define la precisión de un estimador como lo bien (o mal) que las estimaciones realizadas se ajustan a los verdaderos valores de los parámetros. Con el fin de estudiar la precisión del estimador, definimos las siguientes características: media del estimador E(bθ) = ∑Sbθ(si)P(si), varianza del estimador Var(bθ) = E(bθ−E(bθ))2=E(bθ2)−E(bθ)2, error de muestreo σ(bθ) = +qVar(bθ).(2.1) error relativo de muestro o coeficiente de variación CV (bθ) = σ(bθ) E(bθ), sesgo del estimador Sesgo(bθ) = E(bθ)−θy error cuadrático medio del estimador ECM(bθ) = E(bθ−θ)2=Var(bθ)+Sesgo(bθ)2.(2.2) Definición 2.1. Diremos que el estimador bθes insesgado si: sesgo(bθ) = 0, esto es si E(bθ)−θ=0 o equivalentemente E(bθ) = θ. En caso contrario diremos que el estimador es sesgado, ver Cid-Cid y cols. (1999). Definición 2.2. Diremos que estimador bθde θes consistente si bθconverge en probabilidad a θ cuando el tamaño de la muestra tiende al tamaño de la población, esto es, 14 CAPÍTULO 2. EL PROBLEMA DE MUESTREO l´ ım n→N P(|bθ−θ|<ε) = 1∀ε<0. Así, un estimador será consistente si cuando se observa toda la población la estimación coincide exactamente con el valor del parámetro a estimar. En tal caso, si se incrementa el tamaño muestral hasta Nla muestra coincidirá con la población y el error cuadrático será cero, ver Cid-Cid y cols. (1999). Definición 2.3. Diremos que un estimador es más, menos o igual de eficiente en comparación con otro, si el cociente de sus respectivas varianzas es superior, menor o igual a la unidad, ver AzorínPoch (1969). Un buen estimador es aquel que cumple las propiedades de insesgadez, consistencia y eficiencia. Según Alba y Ruiz (2006), si queremos comparar estimadores insesgados, será mejor bθique bθj para estimar θsi Var(bθi)<Var(bθj); mientras que si queremos comparar estimadores sesgados, será mejor bθique bθjpara estimar θsi ECM(bθi)<ECM(bθj). 2.3.3. Construcción de estimadores insesgados. Estimador de Horvitz-Thompson y Hansen-Hurwitz Como ya hemos comentado anteriormente, y podemos observar en la tabla 2.1, los parámetros más comunes a estimar y sobre los que ponemos atención en este trabajo son: el total poblacional, la media poblacional, el total de clase y la proporción de clase. Atendiendo a la naturaleza de estos parámetros, vamos a expresar de forma general un parámetro poblacional como θ=∑N i=1Yi, siendo Nel tamaño de la población. Para cada caso, Yiviene dado por Yi=                Xipara el total poblacional, Xi Npara la media poblacional, Aipara el total de clase, Ai Npara la proporción de clase. (2.3) Según Pérez-López (2010) los estimadores bθcon mejores propiedades para estimar θson estimadores lineales de la forma bθ= n ∑ i=1 ωiYi,(2.4) que sean insesgados y donde los valores ωi, denominados pesos, se caracterizan por: medir la importancia del efecto que añade cada unidad muestral uial estimador, ωi=1 si todas las unidades añaden el mismo efecto a la formación del estimador, si las unidades de muestreo son compuestas, los pesos ωiregulan el efecto que añaden al estimador asociándolo al número de unidades elementales que contiene cada una de las unidades compuestas, 2.3. ESTIMADORES 15 además del tamaño de la unidad compuesta, en caso de serlo, los pesos también pueden depender del orden de colocación de las unidades en la muestra y de la probabilidad que tiene cada unidad de pertenecer a la misma según el método de muestreo empleado. Para construir los estimadores tenemos que tener en cuenta si la selección de la muestra se hace mediante un diseño muestral sin o con reemplazamiento. Por este motivo surgen los estimadores de Horvitz-Thompson (sin reemplazamiento) y Hansen-Hurwitz (con reemplazamiento), que explicamos a continuación. Estimador de Horvitz-Thompson Consideremos una población de tamaño Ny una muestra s={u1,...,un}seleccionada mediante un diseño muestral sin reemplazamiento, i.e., cada unidad solo puede pertenecer a la muestra como máximo una vez. Para representar la pertenencia a la muestra de una unidad uise define para cada i∈ {1,...,N}el indicador de pertenencia, Ii, como la variable aleatoria dada por: Ii=   1 si ui∈scon probabilidad πi, 0 si ui/∈scon probabilidad 1−πi. Obsérvese que Ii∈Ber(πi), con πi=P(ui∈s). De forma análoga, para un par de unidades {ui,uj} con i=jse define para cada i,j∈ {1,...,N}, el indicador de pertenencia como: Ii·Ij=   1 si {ui,uj} ∈ scon probabilidad πi j, 0 si {ui,uj}/∈scon probabilidad 1−πi j. Donde πiyπi j denotan, respectivamente, la probabilidad de que la unidad uipertenezca a la muestra y que las unidades {ui,uj}pertenezcan simultáneamente a la muestra. Estos indicadores de pertenencia verifican las siguientes propiedades: 1. E(Ii) = 1πi+0(1−πi) = πi. 2. E(I2 i) = 12πi+02(1−πi) = πi. 3. Var(Ii) = E(I2 i)−E(Ii)2=πi(1−πi). 4. E(Ii·Ij) = 1πi j +0(1−πi j) = πi j con i=j. 5. Cov(Ii,Ij) = E(Ii·Ij)−E(Ii)E(Ij) = πi j −πiπjcon i=j.1. Para que el estimador lineal dado en (2.4) sea insesgado, se tiene que cumplir que E(bθ) = θ. Veámoslo: 1) Introducimos el indicador de pertenencia, trasladando de este modo la aleatoriedad de YiaIiy empleando la linealidad de la esperanza: 1Como podemos ver en Cid-Cid y cols. (1999) se define la covarianza entre dos variables aleatorias XeYcomo Cov(X,Y) = E[(X−E[X])(Y−E[Y])] = E[X·Y]−E[X]E[Y] 22 CAPÍTULO 3. MUESTREO ALEATORIO SIMPLE Probabilidad igual de selección de una unidad: como acabamos de ver en el espacio muestral, el número de muestras posibles de tamaño nes CN,n=N n. Fijando una unidad uide la muestra, las posibles muestras que podemos tener vienen de seleccionar n−1 elementos de los N−1 elementos que quedan en la población. Así, el número de muestras posibles que se pueden formar bajo está condición es CN−1,n−1=N−1 n−1. Podemos calcular entonces que la probabilidad de una unidad de ser seleccionada es πi=P(ui∈s) = casos favorables casos posibles =N−1 n−1 N n=n N. Probabilidad de que un par de unidades (ui,uj)sea seleccionado: siendo CN,n=N nel tamaño del espacio muestral, sabemos que el número de muestras posibles que se pueden formar de manera que contenga el par de unidades (ui,uj)es CN−2,n−2=N−2 n−2. Ya que para este caso fijando el par de unidades (ui,uj), las posibles muestras que podemos tener vienen de seleccionar n−2 elementos de los N−2 elementos restantes de la población. Entonces la probabilidad de que un par de unidades sea seleccionado es πi j =P((ui,uj)∈s) = casos favorables casos posibles =N−2 n−2 N n=n(n−1) N(N−1). 3.1.1. Estimadores y sus varianzas Recordemos que el estimador insesgado óptimo para un muestreo sin reemplazamiento del parámetro poblacional θ=∑N i=1Yies el estimador de Horvitz-Thompson, bθHT = N ∑ i=1 Yi πi , siendo πila probabilidad de que una unidad pertenezca a la muestra, que tiene un valor de πi=n N, ver sección 2.3.3 para más detalles. A partir del estimador de Horvitz-Thompson, podemos deducir los estimadores para los parámetros de interés introducidos en la sección 2.3.3. Total: θ=T= N ∑ i=1 Xi=⇒Yi=Xi=⇒bθ=b T= n ∑ i=1 Xi πi = n ∑ i=1 Xi n/N=N1 n n ∑ i=1 Xi.(3.1) Media: θ=µ= N ∑ i=1 Xi N=⇒Yi=Xi N=⇒bθ=bµ= n ∑ i=1 Xi/N πi = n ∑ i=1 Xi/N n/N=1 n n ∑ i=1 Xi.(3.2) Proporción: θ=B= N ∑ i=1 Ai N=⇒Yi=Ai N=⇒bθ== n ∑ i=1 Ai/N n/N=1 n n ∑ i=1 Ai.(3.3) Total de clase: θ=A= N ∑ i=1 Ai=⇒Yi=Ai=⇒bθ=b A= n ∑ i=1 Ai n/N=N1 n n ∑ i=1 Ai=Nb B.(3.4) 3.1. MUESTREO ALEATORIO SIMPLE SIN REEMPLAZAMIENTO 23 A partir de (2.7) y sustituyendo los valores de πi=n N,πi j =n(n−1) N(N−1)eYicorrespondiente para cada caso (véase (2.3) para mas detalles), podemos calcular la varianza para los estimadores (3.1), (3.2), (3.3) y (3.4): Total: Var(b T) = N ∑ i=1 X2 i n N1−n N+2 N ∑ i=1 N ∑ j>i XiXj n N n Nn(n−1) N(N−1)−n N n N. Operando 1−n N/n N=yn(n−1) N(N−1)−n N n N/n N n N=n−N n(N−1), podemos escribir la expresión de la varianza de una forma más sencilla: Var(b T) = n N N ∑ i=1 X2 i+n−N n(N−1)2 N ∑ i=1 N ∑ j>i XiXj. Ahora como la varianza es invariante ante cambios de localización, tenemos: Var(b T) = N−n n N ∑ i=1 (Xi−µ)2+n−N n(N−1)2 N ∑ i=1 N ∑ j>i (Xi−µ)(Xj−µ). Haciendo uso de la expresión vista en (2.9), en este casoYi=Xi−µy sabiendo que 2∑N i=1∑N j>iYiYj= −∑N j=iYi, entonces −2∑N i=1∑N j>i(Xi−µ)(Xj−µ) = −∑N j=i(Xi−µ)(Xj−µ) = ∑N i=1(Xi−µ)2− (∑N i=1(Xi−µ))2=∑N i=1(Xi−µ)2ya que (∑N i=1(Xi−µ))2= (∑N i=1Xi−Nµ)2=0. Podemos ahora expresar Var(b T) = N−n n N ∑ i=1 (Xi−µ)2−2∑N i=1∑N j>i(Xi−µ)(Xj−µ) N−1!= =N−n n N ∑ i=1 (Xi−µ)2+∑N i=1(Xi−µ)2 N−1!. Sacando factor común N ∑ i=1 (Xi−µ)2se escribe Var(b T) = N−n n"1+1 N−1N ∑ i=1 (Xi−µ)2#=N(N−n) n 1 N−1 N ∑ i=1 (Xi−µ)2= =N(N−n) nS2 c=N21−n NS2 c n, donde S2 c=1 N−1 N ∑ i=1 (Xi−µ)2,(3.5) es la cuasivarianza. Así la varianza para el estimador del total es Var(b T) = N2(1−n N)S2 c n.(3.6) 24 CAPÍTULO 3. MUESTREO ALEATORIO SIMPLE Media: b T=Nbµ=⇒bµ=b T N=⇒Var(bµ) = Var b T N!=1 N2Var(b T) = 1 N2N2(1−n N)S2 c n. Así la varianza para el estimador de la media es Var(bµ) = (1−n N)S2 c n.(3.7) Según la información sobre los parámetros de interés recogida en la Tabla 2.1, nos quedaría por calcular los estimadores de la proporción y el total de clase, para los que necesitamos desarrollar la fórmula de la cuasivarianza S2 c. Partimos de la fórmula de S2 cque hemos visto en (3.5), S2 c=1 N−1 N ∑ i=1 (Xi−µ)2=1 N−1 N ∑ i=1 (Ai−B)2. Aplicando la identidad notable (a−b)2y la propiedad de asociatividad de la suma, se tiene: S2 c=1 N−1 N ∑ i=1 (A2 i−2BAi+B2) = 1 N−1 N ∑ i=1 A2 i−2 N ∑ i=1 BAi+ N ∑ i=1 B2!. Utilizando ahora que: ∑N i=1A2 i=∑N i=1Aiya que Ai=0 ó Ai=1 (veáse la sección 2.3 para más información), por tanto ∑N i=1Ai=NB ya que B=1 N∑N i=1Ai, −2B∑N i=1Ai=−2B(NB) = −2NB2y ∑N i=1B2=NB2, tenemos S2 c=1 N−1(NB −2NB2+NB2). Seguimos operando y llegamos al valor final para la cuasivarianza: S2 c=1 N−1(NB −2NB2+NB2) = 1 N−1(NB −NB2) = 1 N−1NB(1−B) = 1 N−1NBQ.(3.8) Estamos ya en condiciones de calcular la varianza para los estimadores de la proporción y el total de clase. Partiendo de las expresiones de las varianzas de los estimadores del total (3.6), de la media (3.7) y del valor para la cuasivarianza (3.8), obtenemos: Proporción: Var(b B) = (1−n N)S2 c n= (1−n N) 1 N−1NBQ n=N N−1 1 n(1−n N)BQ. Total de clase: Var(b A) = N2(1−n N)S2 c n=N2(1−n N) 1 N−1NBQ n=N3 N−1 1 n(1−n N)BQ. 3.2. MUESTREO ALEATORIO SIMPLE CON REEMPLAZAMIENTO 25 3.2. MUESTREO ALEATORIO SIMPLE CON REEMPLAZAMIENTO En este caso, el objetivo del muestreo aleatorio simple con reemplazamiento es obtener una muestra de unidades seleccionadas aleatoriamente con reemplazamiento de la población. Estas unidades son unidades elementales y una vez extraída una unidad se devuelve a la población, pudiendo ser elegida más de una vez. En este caso una muestra con elementos repetidos sí es posible. La probabilidad de que una unidad sea seleccionada para la muestra es Pi=1 N, siendo Nel tamaño de la población. Para todas las unidades esta probabilidad es la misma. Por este motivo, todas las muestras serán equiprobables, i.e., la probabilidad de obtener una muestra cualquiera es P(u1,...,un) = ∏n i=1Pi=1 Nn. 3.2.1. Estimadores y sus varianzas Recordemos que en este caso el estimador insesgado óptimo para un muestreo con reemplazamiento del parámetro poblacional θ=∑N i=1Yies el estimador de Hansen-Hurwitz, bθHH = N ∑ i=1 Yi nPi , siendo Pila probabilidad de que una unidad pertenezca a la muestra, que como acabamos de ver tiene un valor de Pi=1 N, ver sección 2.3.3 para más detalles. Según los valores que toma Yidados en (2.3) deducimos los siguientes estimadores: Total: θ=T= N ∑ i=1 Xi=⇒Yi=Xi=⇒bθ=b T= n ∑ i=1 Xi nPi = n ∑ i=1 Xi n/N=N1 n n ∑ i=1 Xi.(3.9) Media: θ=µ= N ∑ i=1 Xi N=⇒Yi=Xi N=⇒bθ=bµ= n ∑ i=1 Xi/N nPi = n ∑ i=1 Xi/N n/N=1 n n ∑ i=1 Xi.(3.10) Proporción: θ=B= N ∑ i=1 Ai N=⇒Yi=Ai N=⇒bθ=b B= n ∑ i=1 Ai/N n/N=1 n n ∑ i=1 Ai.(3.11) Total de clase: θ=A= N ∑ i=1 Ai=⇒Yi=Ai=⇒bθ=b A= n ∑ i=1 Ai n/N=N1 n n ∑ i=1 Ai=Nb B.(3.12) En (2.10) hemos visto que la fórmula de la varianza del estimador de Hansen-Hurwitz, viene dada por Var(bθHH ) = 1 n N ∑ i=1Yi Pi −θ2 Pi. A partir de ella y sustituyendo los valores de Pi=1 N,θeYicorrespondiente para cada caso, podemos deducir la varianza para los estimadores (3.9), (3.10), (3.11) y (3.12) de los distintos parámetros de interés: 26 CAPÍTULO 3. MUESTREO ALEATORIO SIMPLE Total: Var(b T) = 1 n N ∑ i=1Xi Pi −T2 Pi=1 n N ∑ i=1Xi 1/N−T21 N=1 n N ∑ i=1 (NXi−T)21 N= =1 n N ∑ i=1 (NXi−Nµ)21 N=1 n N ∑ i=1 N2(Xi−µ)21 N=N2 n 1 N N ∑ i=1 (Xi−µ)2, donde denotamos S2=1 N N ∑ i=1 (Xi−µ)2(3.13) Entonces la fórmula para la varianza del estimador del total es: Var(b T) = N2S2 n.(3.14) Media: b T=Nbµ=⇒bµ=b T N=⇒Var(bµ) = Var b T N!=1 N2Var(b T) = 1 N2N2(1−n N)S2 n. Entonces la varianza para el estimador de la media es: Var(bµ) = S2 n.(3.15) Sabiendo que S2 c=1 N−1∑N i=1(Xi−µ)2(3.5) y que S2=1 N∑N i=1(Xi−µ)2(3.13). Entonces S2 c= N N−1S2y como S2 c=1 N−1BQ (3.8) podemos escribir S2=BQ. Ahora a partir de las fórmulas de la varianza para los estimadores del total (3.14) y la media (3.15) podemos calcular ahora las varianzas para los estimadores de: Proporción: Var(b B) = S2 n= N−1 NS2 c n= N−1 N NBQ N−1 n=BQ n. Total de clase: Var(b A) = N2S2 n=N2N−1 NS2 c n=N2N−1 N NBQ N−1 n=N2BQ n. 3.3. COMPARACIÓN ENTRE MUESTREO ALEATORIO SIMPLE SIN Y CON REEMPLAZAMIENTO Para comparar el muestreo aleatorio simple sin y con reemplazamiento, lo haremos atendiendo al error de muestreo. Recordemos la definición vista en (2.1) para el error de muestreo: σ(bθ) = +qVar(bθ). Ofrecerá mejores resultados el método de muestreo con un error de muestreo menor, i.e., aquel que tenga una varianza del estimador menor. 3.3. COMPARACIÓN ENTRE MUESTREO ALEATORIO SIMPLE SIN Y CON REEMPLAZAMIENTO27 Usaremos la notación VarSR yVarCR para referirnos a la varianza del método sin reemplazamiento y con reemplazamiento respectivamente. Veamos ahora en primer lugar lo que ocurre con la varianza del estimador de la media: VarSR(bµ) VarCR(bµ)=(1−n N)S2 c n S2 n =(1−n N)N N−1S2 n S2 n = N−n N−1S2 n S2 n =⇒N−n N−1<1. Deducimos que VarSR(bµ)<VarCR(bµ). Para el resto de estimadores ocurrirá lo mismo, así, la varianza siempre será menor en el muestreo sin reemplazamiento. Para el total: VarSR(b T) VarCR(b T)=N2(1−n N)S2 c n N2S2 n =(1−n N)N N−1S2 n S2 n = N−n N−1S2 n S2 n =⇒N−n N−1<1. Para la proporción: VarSR(b B) VarCR(b B)= N N−11 n(1−n N)BQ BQ n = N−n N−1BQ n BQ n =⇒N−n N−1<1. Para el total de clase: VarSR(b A) VarCR(b A)= N3 N−11 n(1−n N)BQ N2BQ n =N2N−n N−1BQ n N2BQ n =⇒N−n N−1<1. Podemos concluir entonces que el muestreo aleatorio sin reemplazamiento ofrece mejores resultados, en términos de error de muestreo, que con reemplazamiento. Para tener una visión general de todos los desarrollos realizados acerca del muestreo aleatorio simple presentamos un resumen en las siguientes tablas: Estimador Varianza Total b T=N1 n n ∑ i=1 XiVar(b T) = N2(1−n N)S2 c n Media bµ=1 n n ∑ i=1 XiVar(bµ) = (1−n N)S2 c n Proporción b B=1 n n ∑ i=1 AiVar(b B) = N N−1 1 n(1−n N)BQ Total de clase b A=Nb B Var(b A) = N3 N−1 1 n(1−n N)BQ Tabla 3.1: estimadores y varianzas para el muestreo aleatorio simple sin reemplazamiento. 28 CAPÍTULO 3. MUESTREO ALEATORIO SIMPLE Estimador Varianza Total b T=N1 n n ∑ i=1 XiVar(b T) = N2S2 n Media bµ=1 n n ∑ i=1 XiVar(bµ) = S2 n Proporción b B=1 n n ∑ i=1 AiVar(b B) = BQ n Total de clase b A=Nb B Var(b A) = BQ n Tabla 3.2: estimadores y varianzas para el muestreo aleatorio simple con reemplazamiento. Capítulo 4 MUESTREO ALEATORIO ESTRATIFICADO Cuando se desea realizar muestreo sobre una población heterogénea, dividirla en subpoblaciones lo más homogéneas posibles podría facilitar la construcción de la muestra. Entendiendo como población heterogénea aquella en la que la totalidad de individuos no presenta una característica de estudio común y entendiendo como subpoblaciones homogéneas, subconjuntos cuyos elementos tienen al menos una característica común, que cubren a la población por completo y que son disjuntos entre sí. Este proceso de subdivisión de la población es la idea sobre la que nace el muestreo estratificado y que busca homogeneizar la población, Mendenhall y cols. (2006). Sea U={U1,U2,...,UN}una población heterogénea de tamaño N; se divide en Lsubpoblaciones homogéneas disjuntas, que se denominarán estratos Eh={Uh1,Uh2,...,UhNh}={Uhi}h=1,...,Lde tamaños N1,...,NLtales que N=∑L h=1Nh. De cada estrato se extrae de forma independiente una submuestra, que denotaremos por mhcon h=1,...,Ly tamaño nh, i.e., en cada submuestra habrá nh unidades de cada uno de los Lestratos en los que se ha subdividido la población. Entonces, una muestra estratificada s, está formada por la unión de las mLsubmuestras s=SL h=1mhtal que n=∑L h=1nh. En la Figura 4.1 hemos elaborado un esquema que ilustra el proceso de selección de una muestra aleatoria estratificada. 29 30 CAPÍTULO 4. MUESTREO ALEATORIO ESTRATIFICADO m1m2mL tamaño N1tamaño Nh tamaño N3 tamaño N2 tamaño N tamaño nh tamaño n1tamaño n2 Población U Muestra estratificada s tamaño n ... ... E1EL E2E3 Figura 4.1: proceso de selección de una muestra estratificada. 4.1. MUESTREO ALEATORIO ESTRATIFICADO SIN REEMPLAZAMIENTO Una vez dividida la población en estratos, de forma independiente en cada uno de ellos seleccionamos mediante muestreo aleatorio simple sin reemplazamiento cada submuestra mh. En este caso estaremos ante el muestreo aleatorio estratificado sin reemplazamiento. 4.1.1. Estimadores y sus varianzas En este contexto, el parámetro poblacional θpuede expresarse como la suma de los valores de la variable de estudio en cada uno de los estratos, por lo que tenemos la expresión θ= L ∑ h Nh ∑ i Yhi. Este parámetro poblacional será aproximado por el estimador, bθ, expresado como la suma de las estimaciones realizadas mediante muestreo aleatorio simple en cada uno de los estratos, es decir, la suma extendida a todos los estratos del estimador lineal insesgado de Horvitz-Thompson: bθ= L ∑ h nh ∑ i Yhi πhi ,(4.1) donde πhi =nh Nhes la probabilidad de que la unidad uhi pertenezca a la submuestra mhde nhunidades elegidas entre las Nhdel estrato h-ésimo, Eh. A partir del estimador dado en (4.1) y según los valores de Yhi dada en (2.3) para cada caso, podemos construir los siguientes estimadores: Total: θ=T=⇒Yhi =Xhi =⇒bθ=b Tst = L ∑ h=1 nh ∑ i=1 Xhi πhi = L ∑ h=1 nh ∑ i=1 Xhi nh/Nh = L ∑ h=1 Nh 1 nh nh ∑ i=1 Xhi.(4.2) 4.1. MUESTREO ALEATORIO ESTRATIFICADO SIN REEMPLAZAMIENTO 31 Media: θ=µ=⇒Yhi =Xhi N=⇒bθ=bµst = L ∑ h=1 1 N nh ∑ i=1 Xhi πhi = L ∑ h=1 1 N nh ∑ i=1 Xhi nh/Nh = L ∑ h=1 Nh N 1 nh nh ∑ i=1 Xhi = L ∑ h=1 Wh 1 nh nh ∑ i=1 Xhi.(4.3) El términoWh=Nh/Nrecibe el nombre de coeficientes de ponderación que cumplen ∑L h=1Wh= ∑L h=1Nh N=∑L h=1Nh N=N/N=1. Proporción: θ=B=⇒Yhi =Ahi N=⇒bθ=b Bst = L ∑ h=1 1 N nh ∑ i=1 Ahi πhi = L ∑ h=1 1 N nh ∑ i=1 Ahi nh/Nh = L ∑ h=1 Nh N 1 nh nh ∑ i=1 Ahi = L ∑ h=1 Whb Bh.(4.4) Total de clase: θ=A=⇒Yhi =Ahi =⇒bθ=b Ast = L ∑ h=1 nh ∑ i=1 Ahi πhi = L ∑ h=1 nh ∑ i=1 Ahi nh/Nh = L ∑ h=1 Nh 1 nh nh ∑ i=1 Ahi = L ∑ h=1 Nhb Bh.(4.5) La varianza de los estimadores total, media, proporción y total de clase, será la suma de las varianzas de las estimaciones para cada estrato, ya que el muestreo es realizado de forma independiente en cada uno de los estratos. Para calcular estas varianzas, solo necesitamos partir de las fórmulas de la varianza para los estimadores en el caso de muestreo aleatorio simple sin reemplazamiento que podemos encontrar en la Tabla 3.1 y de las expresiones de los estimadores que acabamos de calcular en (4.2), (4.3), (4.4) y (4.5). Siendo Qh=1−Bh. Total: Var(b Tst ) = L ∑ h=1 N2 h(1−nh Nh )S2 ch nh . Media: Var(bµst) = L ∑ h=1 W2 h(1−nh Nh )S2 ch nh . Proporción: Var(b Bst ) = L ∑ h=1 W2 h Nh Nh−1(1−nh Nh )BhQh nh . Total de clase: Var(b Ast ) = L ∑ h=1 N2 h Nh Nh−1(1−nh Nh )BhQh nh . 38 CAPÍTULO 5. MUESTREO SISTEMÁTICO Capítulo 6 MUESTREO POR CONGLOMERADOS Enfrentarnos a un proceso de muestreo en ocasiones genera demasiado coste (económico o de recursos) para obtener un marco que liste los elementos de la población, por ello previamente se recurre a la opción de dividirla en subconjuntos llamados conglomerados, para los cuales es más fácil obtener un marco que los liste. La idea, es que estos subconjuntos de la población, los conglomerados, sean heterogéneos, de tal forma que presenten una diversidad similar a la de la población, Cid-Cid y cols. (1999), y sean a la vez homogéneos entre ellos, pues da igual el conglomerado que se observe, se busca que todos representen fielmente a la población. Por lo general la división de la población en conglomerados no depende de la característica objeto de estudio sino de divisiones geográficas o territoriales para las cuales ya se conoce información, ver Pérez-López (2010). Existen varios tipos de muestreo por conglomerados: monoetápico: se obtiene la muestra seleccionando ciertos conglomerados de forma aleatoria, por lo tanto la muestra contendrá la totalidad de las unidades elementales de cada conglomerado; bietápico: una vez seleccionados los conglomerados de forma aleatoria, se divide cada conglomerado en subconglomerados y posteriormente se seleccionan algunos de ellos de forma aleatoria para formar parte de la muestra. En este procedimiento, se obtiene una muestra formada por las submuestras de cada uno de los subconglomerados. La muestra contendrá solo algunas de las unidades elementales de cada conglomerado; polietápico: generalización del caso bietápico a un número mayor de dos etapas. Sea U={U1,U2,...,UN}una población de tamaño N, tenemos los elementos de la población agrupados en Mconglomerados, que denotamos por CM. Una muestra por conglomerados, s, de tamaño nestará formada por mconglomerados, Cm, que se seleccionan de forma aleatoria entre los CMconglomerados en los que hemos dividido a la población. Suponiendo todos los conglomerados de igual tamaño, nc, se tiene que la población es de tamaño N=Mnc. De forma análoga una muestra 39 40 CAPÍTULO 6. MUESTREO POR CONGLOMERADOS es de tamaño n=mnc, el número de conglomerados en la muestra por su tamaño. Se entiende así que por ser los conglomerados grupos de unidades elementales, son unidades compuestas. En la Figura 6.1 se ilustra la división de la población en conglomerados y el proceso de selección de una muestra por conglomerados. Población U, de tamaño N dividida en CMconglomerados Muestra s, de tamaño n formada por Cmconglomerados .. .. . . . . .. .. .. .. .. .. .. .. .. .. . . .. .. . . .. .. .. .. .. .. .. .. . . .. .. .. .. .. .. C1 C1 C2 C2 C3 C3 C4 CM CM−1 C5 Cm Figura 6.1: proceso de selección de una muestra por conglomerados. 6.1. Diferencias entre conglomerado y estrato Llegados a este punto se hace necesario establecer las diferencias entre estrato y conglomerado, y por tanto entre el muestreo aleatorio estratificado y el muestreo por conglomerados, ya que ambos conllevan la subdivisión de la población en grupos. Veamos las principales diferencias según PérezLópez (2010) y Mendenhall y cols. (2006): un único conglomerado representa a la población, un estrato no; todos los estratos tienen representación en la muestra, los conglomerados no; se busca que los estratos sean lo más homogéneos posible, pero que difieran lo máximo posible de los demás estratos, es decir que sean heterogéneos entre ellos (heterogéneos “entre” y homogéneos “dentro”); para el caso de los conglomerados se busca lo contrario, que sean heterogéneos para representar a la población lo máximo posible y homogéneos entre ellos para que no importe qué conglomerado escoger (heterogéneos “dentro” y homogéneos “fuera”). 6.2. ESTIMADORES Y SUS VARIANZAS 41 ♦ ♦ ♦ • ▲ • ▲ ▲ ⋆ ⋆ ■ ■ ■ • ⋆♦ ♦ ♦♦ • • •• ■ ■ ■ ■ ▲ ▲ ▲ ▲ ⋆ ⋆ ⋆ ⋆ Figura 6.2: población subdividida en conglomerados (izquierda) y en estratos (derecha). Se ha elaborado la Figura 6.2 para ilustrar y facilitar la comprensión por parte del lector de las diferencias anteriormente explicadas entre estratos y conglomerados. 6.2. Estimadores y sus varianzas Por simplificar y por sencillez analizaremos el caso en que los conglomerados son todos del mismo tamaño y el muestreo se realiza en una etapa, es decir, muestreo por conglomerados monoetápico. Para este método de muestreo, el parámetro poblacional θse expresa de forma genérica como: θ= M ∑ i nc ∑ j Yi j. Suponiendo que se realiza muestreo aleatorio sin reemplazamiento para la elección de los conglomerados, el parámetro poblacional θserá aproximado por el estimador de Horvitz-Thompson definido en (2.8), que toma la forma: bθ= m ∑ i ∑nc jYi j πi =1 πi m ∑ i nc ∑ j Yi j, donde πi=m Mes la probabilidad de que el conglomerado Cipertenezca a la muestra sformada por m conglomerados escogidos entre los Mconglomerados de la población. A partir de este estimador y con cálculos análogos a los realizados para los muestreos vistos anteriormente, presentamos los estimadores para los parámetros de interés: el total, la media, la proporción y el total de clase. Total: θ=T=⇒Yi j =Xi j =⇒bθ=b T=M m m ∑ i nc ∑ j Xi j =M mnc m ∑ i 1 nc nc ∑ j Xi j = =Mnc 1 m m ∑ i µi. (6.1) Media: θ=µ=⇒Yi j =Xi j Mnc =⇒bθ=bµ=M m m ∑ i nc ∑ j Xi j Mnc =1 m m ∑ i 1 nc nc ∑ j Xi j = =1 m m ∑ i µi. (6.2) 42 CAPÍTULO 6. MUESTREO POR CONGLOMERADOS Proporción: θ=B=⇒Yi j =Ai j Mnc =⇒bθ=b B=M m m ∑ i nc ∑ j Ai j Mnc =1 m m ∑ i 1 nc nc ∑ j Ai j = =1 m m ∑ i Bi. (6.3) Total de clase: θ=A=⇒Yi j =Ai=⇒bθ=b A=M m m ∑ i nc ∑ j Ai j =Mnc m m ∑ i 1 nc nc ∑ j Ai j = =Mnc 1 m m ∑ i Bi=Mncb B. (6.4) Como hemos dicho anteriormente para la selección de los conglomerados empleamos muestreo aleatorio sin reemplazamiento, por lo tanto las fórmulas de las varianzas de los estimadores para los parámetros de interés vistos en (6.1) y (6.2) vienen derivadas de las fórmulas de las varianzas para dicho muestreo que podemos encontrar en la Tabla 3.1. Para este caso sustituimos el valor de S2 c, que para este muestreo recibe el nombre de cuasivarianza entre conglomerados, por S2 c=∑M i∑nc j(µi−µ)2 M−1. Total: Var(b T) = M2n2 c(1−m M)S2 c mnc .(6.5) Media: Var(bµ) = (1−m M)S2 c mnc .(6.6) A partir de las fórmulas de la varianza de los estimadores del total (6.5) y la media (6.6) deducimos las varianzas de los estimadores (6.3) y (6.4), donde ahora la cuasivarianza toma el valor S2 c=nc M−1∑M i(Bi−B)2. Proporción: Var(b B) = (1−m M) nc M−1∑M i(Bi−B)2 mnc = (1−m M)∑M i(Bi−B)2 m(M−1). Total de clase: Var(b A) = M2n2 c(1−m M)∑M i(Bi−B)2 m(M−1). Para tener una visión general de todos los desarrollos realizados acerca del muestreo aleatorio sistemático presentamos un resumen en la siguiente tabla: 6.2. ESTIMADORES Y SUS VARIANZAS 43 Estimador Varianza Total b T=Mnc 1 m m ∑ i µiVar(b T) = M2n2 c(1−m M)S2 c mnc Media bµ=1 m m ∑ i µiVar(bµ) = (1−m M)S2 c mnc Proporción b B=1 m m ∑ i BiVar(b B) = (1−m M)∑M i(Bi−B)2 m(M−1) Total de clase b A=Nb B Var(b A) = M2n2 c(1−m M)∑M i(Bi−B)2 m(M−1) Tabla 6.1: estimadores y varianzas para el muestreo por conglomerados. 44 CAPÍTULO 6. MUESTREO POR CONGLOMERADOS Capítulo 7 ESTUDIO DE UN CASO PRÁCTICO En este Capítulo presentamos un estudio sobre un conjunto de datos con el que vamos a ilustrar los diferentes métodos de muestreo vistos a lo largo de este trabajo. Para poder realizar esta tarea hemos tenido que llevar a cabo una serie de procedimientos previos, como son la obtención de la base de datos, la depuración de los datos facilitados, la creación/definición de variables de interés a partir de los datos iniciales y finalmente la implementación y aplicación de los distintos métodos de muestreo. Además, para finalizar, se realiza un pequeño estudio de simulación y se presentan las conclusiones y resultados junto con un breve apartado de opciones de mejora. 7.1. La base de datos y su depuración Para realizar el estudio utilizamos datos del Máster Interuniversitario en Técnicas Estadísticas (MTE) impartido por la Universidade de Santiago de Compostela, la Universidade de A Coruña y la Universidade de Vigo. Estos datos fueron previamente anonimizados por la organización del MTE, y la información se nos proporciono en tres ficheros que describimos a continuación, listando las distintas variables y explicando la información que contienen: Fichero con información personal •id_persona: código único que identifica a cada individuo, •correo: dominio de correo electrónico utilizado por cada individuo, •egresado: si el individuo es alumno/a o egresado/a, •titulación: titulación de acceso al MTE, •especialidad: especialidad de la titulación de acceso al MTE, •uniprod: universidad de procedencia del alumno/a, •unimat: universidad en la que el/la alumno/a formalizó la matrícula en el MTE. Fichero con calificaciones •id_persona: código único que identifica a cada individuo, 45 46 CAPÍTULO 7. ESTUDIO DE UN CASO PRÁCTICO •materia: asignaturas cursadas cuyos posibles valores son: Estadística Aplicada, Introducción a la Teoría de Juegos, Modelos de Probabilidad, Modelos de Regresión, Muestreo, Programación Lineal y Entera y el Trabajo de Fin de Máster, •nota: calificación numérica y/o información acerca de las materias cursadas (convalidada, matrícula de honor, no presentado, ...). Fichero con datos del TFM •id_persona: código único que identifica a cada individuo, •id_tutor: código único que identifica a cada un de los/as tutores/as de Trabajos de Fin de Máster, •universidad: universidad o empresa a la que está vinculado/a el/la tutor/a. La primera tarea antes de realizar el estudio fue depurar estos ficheros y unificarlos en una única base de datos que cubriese nuestras necesidades. Para ello se siguió el procedimiento que detallamos a continuación: 1. Comprobar que tenemos el mismo número y los mismos individuos en todos los ficheros (arrange por id_persona). No fue es así, por lo que se solicitó nueva información para completarla. 2. Depurar el fichero de calificaciones. a) Para cada individuo se separa la calificación en dos columnas, una con la calificación numérica (7.6) y otra con la descripción (Notable). b) Se sustituyen los valores faltantes en las calificaciones por NA. c) Se crea una función para eliminar calificaciones repetidas de una misma asignatura y un mismo individuo, dicha función consiste en los siguientes pasos: 1) localiza las filas repetidas por id_persona, 2) si hay varias calificaciones numéricas, elige la más alta, 3) si todas son NA, se deja NA, 4) si hay algún NA a la vez que calificación numérica, se deja la calificación numérica más alta. 3. Una vez depurado el fichero de calificaciones, se fusionó con el fichero de información personal, creando una base de datos usando la función merge . Se vuelve a comprobar que tenemos la información para todos los individuos. 4. Depurar el fichero de los TFM: solo nos interesa la universidad asociada al TFM, para ello utilizaremos los/as tutores/as, es decir, la universidad del TFM será la del tutor/a o la del/a tutor/a principal si hubiese varios. Para ello: 7.1. LA BASE DE DATOS Y SU DEPURACIÓN 47 a) se crea una base de datos con los/as alumnos/as y se separa en dos grupos, uno con los que tienen un/a único/a tutor/a, en cuyo caso la universidad del TFM será la del tutor y otro con los/as que tienen varios/as tutores/as. b) En el grupo de varios/as tutores/as se computa el número de tutores/as que tiene cada individuo usando la función table, concluyendo que todos los individuos tienen dos tutores. 1) Todos los individuos salvo ocho tienen dos tutores/as de la misma universidad. Para esos casos ésa será la universidad asociada al TFM. 2) Para los ocho casos restantes, como tenemos la base de datos ordenada por id_persona, estamos ante la siguiente situación: id_persona 1 id_tutor 1 uiversidad 1 id_persona 1 id_tutor 2 uiversidad 2 id_persona 2 id_tutor 3 uiversidad 1 id_persona 2 id_tutor 4 uiversidad 2 ... ... ... Así, elegimos como la universidad asociada a los TFM para ellos la universidad que aparece asociada al primer tutor de cada individuo. 3) Una vez establecida la universidad asociada a los TFM para los individuos del grupo de varios/as tutores/as se junta esta información con la obtenida en 4. a) de tutores/as únicos/as. 5. Se realiza una última fusión de la base de datos de los TFM con la base de datos del punto 3. Finalmente ya tenemos la base de datos preparada y depurada para poder trabajar con ella y aplicar distintos procedimientos. Se pueden ver las primeras filas de la base de datos en la Figura 7.1. Figura 7.1: primeras filas de la base de datos final, ya depurada y estructurada sobre la que se realizará todo el estudio. 54 CAPÍTULO 7. ESTUDIO DE UN CASO PRÁCTICO 4. ¿Qué proporción de alumnos/as cursa la materia de Muestreo? En la Tabla 7.6 vemos el porcentaje de individuos que cursan la materia de Muestreo, como podemos comprobar, el porcentaje poblacional es bajo y además las estimaciones obtenidas infraestiman ese valor. Muestra Porcentaje Valor poblacional 12.46% Aleatoria simple sin reemplazamiento 3.99% Aleatoria simple con reemplazamiento 2.74% Aleatoria estratificada sin reemplazamiento 2.99% Aleatoria estratificada con reemplazamiento 2.49% Sistemática 2.99% Por conglomerados 2.99% Tabla 7.6: porcentaje de individuos que cursan Muestreo. 5. ¿Cuál es la calificación media de las materias? Mostramos las estimaciones de las notas medias para cada uno de los métodos de muestreo en la Tabla 7.7 y sus errores cuadráticos medios en la Tabla 7.8, cuya definición puede verse en (2.2). Materia Población MAS MASR MAE MAER MS MC Estadística aplicada 7.32 7.29 7.22 7.33 7.28 7.30 7.08 Intro. Teoría de Juegos 8.14 8.30 8.25 8.14 8.25 7.92 8.25 Mod. Probabilidad 6.83 6.83 6.61 6.79 6.75 6.16 6.90 Mod. Regresión 7.27 7.39 7.30 7.51 7.44 7.21 7.14 Muestreo 7.17 7.45 7.56 7.17 7.32 7.06 7.06 Prog. Lin. y Entera 7.71 7.69 7.54 7.77 7.83 7.59 7.79 Tabla 7.7: calificaciones medias de las materias, donde MAS: Muestreo aleatorio simple sin reemplazamiento, MASR: Muestreo aleatorio simple con reemplazamiento, MAE: Muestreo aleatorio estratificado sin reemplazamiento, MAER: Muestreo aleatorio estratificado con reemplazamiento, MS: Muestreo sistemático , MC: Muestreo por conglomerados, Intro. Teoría de Juegos: Introducción a la Teoría de Juegos, Mod. Probabilidad: Modelos de Probabilidad, Mod. Regresión: Modelos de Regresión y Prog. Lin. y Entera: Programación Lineal y Entera. 7.4. PEQUEÑO ESTUDIO DE SIMULACIÓN 55 Materia MAS MASR MAE MAER MS MC Estadística aplicada 0.047 0.905 0.015 0.113 0.037 5.780 Intro. Teoría de Juegos 2.598 1.289 0.006 1.348 4.471 1.187 Mod. Probabilidad 0.003 4.785 0.188 0.612 4.836 0.450 Mod. Regresión 1.599 0.133 5.940 2.910 0.368 1.691 Muestreo 8.121 15.449 0.0001 2.260 1.095 1.220 Prog. Lin. y Entera 0.059 2.985 0.270 1.254 1.576 0.532 Tabla 7.8: errores cuadráticos medios cometidos en las calificaciones medias de las materias, multiplicados por 100, donde MAS: Muestreo aleatorio simple sin reemplazamiento, MASR: Muestreo aleatorio simple con reemplazamiento, MAE: Muestreo aleatorio estratificado sin reemplazamiento, MAER: Muestreo aleatorio estratificado con reemplazamiento, MS: Muestreo sistemático, MC: Muestreo por conglomereados, Intro. Teoría de Juegos: Introducción a la Teoría de Juegos, Mod. Probabilidad: Modelos de Probabilidad, Mod. Regresión: Modelos de Regresión y Prog. Lin. y Entera: Programación Lineal y Entera. 7.4. Pequeño estudio de simulación Para finalizar hemos realizado un estudio de simulación para ilustrar el grado de precisión de los distintos métodos. Se han generado 500 muestras de tamaño n=100 para cada uno de los métodos de muestreo. Con estas muestras estimamos la calificación media de la materia de Muestreo y el error cuadrático medio del estimador media muestral bajo los distintos escenarios, para así conocer con mayor precisión del error cometido. La estimación de la calificación media se lleva a cabo calculando la media muestral para cada una de las 500 muestras, de forma que tenemos la distribución del estimador para cada método de muestreo (véase la Figura 7.4). En la Tabla 7.9 se recogen las medias y desviaciones típicas así como el error cuadrático medio asociado. Muestra Calificación media Desviación típica ECM Aleatoria simple sin reemplazamiento 7.173 0.228 0.073 Aleatoria simple con reemplazamiento 7.166 0.252 0.063 Aleatoria estratificada sin reemplazamiento 7.149 0.191 0.037 Aleatoria estratificada con reemplazamiento 7.124 0.216 0.049 Sistemática 7.169 0.190 0.036 Por conglomerados 7.095 0.332 0.116 Tabla 7.9: estimación de la calificación media de Muestreo en las 500 muestras, junto con la desviación típica y el error cuadrático medio computado con muestras de tamaño n=100. 56 CAPÍTULO 7. ESTUDIO DE UN CASO PRÁCTICO A la vista de la Figura 7.4, en general, estamos obteniendo estimaciones para la media centradas en el valor poblacional de la misma. No ocurre esto para el muestreo sistemático, que como podemos comprobar en su gráfica, este método de muestreo solo estima 4 valores para la media debido a los posibles valores que puede tomar la semilla δ∈ {1,2,3,4}(ver Sección 7.3, muestra sistemática). A pesar de ello podemos observar en la Tabla 7.9 que es el método de muestreo con menor error cuadrático medio. Le siguen con menor error cuadrático medio ambos muestreos estratificados y las “peores estimaciones” para la media vendrían dadas por el muestreo por conglomerados, cuyo error cuadrático medio es el más alto. Figura 7.4: histograma de calificaciones medias de la materia Muestreo para cada una de las 500 muestras simuladas de tamaño n=100. Opciones de mejora Para ver el comportamiento de los distintos métodos podríamos hacer el estudio de simulación para diferentes tamaños muestrales (n=20,50,100,500,1000), así comprobaríamos también si alguno tiene especiales problemas para muestras pequeñas o si al variar los tamaños muestrales se reduce el error, aproximándose según este aumente, el estimador al valor poblacional. Por otra parte, podríamos considerar más variables y estimadores como el de la proporción o el de la varianza. Un estudio más amplio permitiría profundizar más sobre las características de cada tipo de muestreo. También se podrían proponer otros criterios de error para validar los resultados, además del error cuadrático medio, como puede ser el error absoluto. Agradecimientos Me gustaría agradecer en primer lugar, a mi tutora, Maribel Borrajo García, por aceptar mi propuesta, por guiarme y ayudarme con tanta paciencia a lo largo de este trabajo, así como su ayuda para conseguir la base de datos utilizada. También quiero agradecer a Julio González Díaz, coordinador del Máster Interuniversitario en Técnicas Estadísticas (MTE) por permitirme emplear datos del mismo y a María José Ginzo Villamayor por el trabajo realizado en anonimizar y proporcionarme los datos que me han permitido aplicar las técnicas de muestreo aprendidas. 57 Código de R para el análisis de datos realizado en el Capítulo 7 #Lectura de la base de datos y carga de paquetes library(dplyr) library(stringr) library(ggplot2) library(gridExtra) datos <- read.csv("BBDD_MTE_TFG_muestreo.csv") ################################################################################ ### ANALISIS DE LA BASE DE DATOS ############################################### #Agrupación por universida de procedencia USC= datos[which(datos$uniprod==’Universidad de Santiago de Compostela’),] UDC= datos[which(datos$uniprod==’Universidad de Coruña’),] UVIGO = datos[which(datos$uniprod==’Universidade de Vigo’),] OTRAS = datos[which(datos$uniprod!=’Universidad de Santiago de Compostela’ & datos$uniprod!=’Universidad de Coruña’ & datos$uniprod!=’Universidade de Vigo’),] #Egresados length(which(datos$egresado==1)) length(which(datos$egresado==0)) #Notas medias notas_medias = colMeans((datos %>% select(starts_with("Nota"))), na.rm = TRUE) #Especialidades (table(datos$especialidad)) df_especialidades <- data.frame(Categoria =c("Matemáticas", 59 60 CAPÍTULO 7. ESTUDIO DE UN CASO PRÁCTICO "Ciencias políticas y sociales", "Ciencias experimentales", "Ciencias de la salud","Economía", "Ingenierías", "Sin dato") ,Total=c(218,45,46,9,45,34,7)) #Correo mas utilizado correo_ = table(datos$correo)[which.max(table(datos$correo))]*100/401 #Procedencia mas comun y porcentaje universidades gallegas procedencia = table(datos$uniprod)[which.max(table(datos$uniprod))] length((which(datos$uniprod==’Universidad de Santiago de Compostela’)))/ length(datos$uniprod)*100 length((which(datos$uniprod==’Universidad de Coruña’)))/ length(datos$uniprod)*100 length((which(datos$uniprod==’Universidade de Vigo’)))/ length(datos$uniprod)*100 (100 -length((which(datos$uniprod==’Universidad de Santiago de Compostela’)))/ length(datos$uniprod)*100 -length((which(datos$uniprod==’Universidad de Coruña’)))/ length(datos$uniprod)*100 -length((which(datos$uniprod==’Universidade de Vigo’)))/ length(datos$uniprod)*100) #Porcentaje convalidaciones si especialidad=Matematicas & uniprod=USC matematicas = datos[which(datos$especialidad == "Matemáticas" & datos$uniprod == "Universidad de Santiago de Compostela"),] infos_notas = matematicas %>% select(starts_with("Info")) infos_notas = infos_notas[,-7] for (c in colnames(infos_notas)){ cat(c, ":", (length(which( infos_notas[,c] == "CONV"))/nrow(matematicas))*100, "\n")} #Tendencia tfg length(which(datos$universidad == "USC" & datos$uniprod == "Universidad de Santiago de Compostela")) / length((which(datos$uniprod==’Universidad de Santiago de Compostela’)))*100 length(which(datos$universidad == "UDC" & 7.4. PEQUEÑO ESTUDIO DE SIMULACIÓN 61 datos$uniprod==’Universidad de Coruña’)) / length((which(datos$uniprod==’Universidad de Coruña’)))*100 length(which(datos$universidad == "UVIGO" & datos$uniprod==’Universidade de Vigo’)) / length((which(datos$uniprod==’Universidade de Vigo’))) *100 #Porcentaje que cursan muestreo cursan_muestreo = (401-sum(is.na(datos$Info.Nota.M)))/length(datos$Nota.M)*100 ################################################################################ ### MUESTREO ALEATORIO SIMPLE SIN REMPLAZAMIENETO############################### nrow(datos) set.seed(2304) muestreo_AS <- sample_n(datos,size = 100) #Notas medias notas_medias_AS = colMeans((muestreo_AS %>% select(starts_with("Nota"))), na.rm = TRUE) #Correo mas utilizado correo_AS = table(muestreo_AS$correo)[which.max(table(muestreo_AS$correo))] #Procedencia mas comun procedencia_AS = table(muestreo_AS$uniprod)[which.max(table(muestreo_AS$uniprod))] #Porcentaje convalidaciones si especialidad=Matematicas & uniprod=USC matematicas_AS = muestreo_AS[which(muestreo_AS$especialidad == "Matemáticas" & muestreo_AS$uniprod == "Universidad de Santiago de Compostela"),] infos_notas_AS = matematicas_AS %>% select(starts_with("Info")) infos_notas_AS = infos_notas_AS[,-7] for (c in colnames(infos_notas_AS)){ cat(c, ":",length(which( infos_notas_AS[,c] == "CONV"))/nrow(matematicas_AS)*100, "\n")} #Porcentaje que cursan muestreo 62 CAPÍTULO 7. ESTUDIO DE UN CASO PRÁCTICO cursan_muestreo_AS=(100-sum(is.na(muestreo_AS$Info.Nota.M)))/ length(datos$Nota.M)*100 ################################################################################ ### MUESTREO ALEATORIO SIMPLE CON REMPLAZAMIENETO############################### nrow(datos) set.seed(2304) muestreo_ASR <- sample_n(datos,size = 100, replace=TRUE) table(muestreo_ASR$id_persona) #unidades repetidas #Notas medias notas_medias_ASR = colMeans((muestreo_ASR %>% select(starts_with("Nota"))), na.rm = TRUE) #Correo mas utilizado correo_ASR = table(muestreo_ASR$correo)[which.max(table(muestreo_ASR$correo))] #Procedencia mas comun y universidades gallegas procedencia_ASR = table(muestreo_ASR$uniprod)[which.max(table(muestreo_ASR$uniprod))] #Porcentaje convalidaciones si especialidad=Matematicas & uniprod=USC matematicas_ASR = muestreo_ASR[which(muestreo_ASR$especialidad == "Matemáticas" & muestreo_ASR$uniprod == "Universidad de Santiago de Compostela"),] infos_notas_ASR = matematicas_ASR %>% select(starts_with("Info")) infos_notas_ASR = infos_notas_ASR[,-7] for (c in colnames(infos_notas_ASR)){ cat(c, ":",length(which( infos_notas_ASR[,c] == "CONV"))/nrow(matematicas_ASR) *100, "\n")} #Porcentaje que cursan muestreo cursan_muestreo_ASR=(100-sum(is.na(muestreo_ASR$Info.Nota.M)))/ length(datos$Nota.M)*100 7.4. PEQUEÑO ESTUDIO DE SIMULACIÓN 63 ################################################################################ ### MUESTREO ALEATORIO ESTRATIFICADO SIN REMPLAZAMIENTO######################### #Creacion de estratos (universidades) #Tamano muestra = 100 #Tamano de las submuestras proporcional al tamano de los estratos por univerisades #(tamano estrtatos)*(tamano muestra)/tamano poblacion tamano_s1=round(length((which(datos$uniprod==’Universidad de Santiago de Compostela’ )))*100/length(datos$uniprod)); tamano_s1 tamano_s2=round(length((which(datos$uniprod==’Universidad de Coruña’)))*100/ length(datos$uniprod)); tamano_s2 tamano_s3=round(length(which(datos$uniprod==’Universidade de Vigo’))*100/ length(datos$uniprod))+1; tamano_s3 tamano_s4 = round(length(which(datos$uniprod!=’Universidad de Santiago de Compostela’ & datos$uniprod!=’Universidad de Coruña’ & datos$uniprod!=’Universidade de Vigo’))*100/length(datos$uniprod)); tamano_s4 #Seleccion de las unidades para formar parte de la muestra. Formacion de las #submuestras con MAS SIN reemplazamiento set.seed(2304) s1=sample_n(datos[which(datos$uniprod==’Universidad de Santiago de Compostela’),] ,size= tamano_s1) set.seed(2304) s2=sample_n(datos[which(datos$uniprod==’Universidad de Coruña’),], size= tamano_s2) set.seed(2304) s3=sample_n(datos[which(datos$uniprod==’Universidade de Vigo’),], size= tamano_s3) set.seed(2304) s4=sample_n(datos[which(datos$uniprod!=’Universidad de Santiago de Compostela’ & datos$uniprod!=’Universidad de Coruña’ & datos$uniprod!=’Universidade de Vigo’),],size= tamano_s4) #Muestra estratificada muestreo_E <- rbind(s1,s2,s3,s4) #Notas medias notas_medias_E = colMeans((muestreo_E %>% select(starts_with("Nota"))), na.rm = TRUE) 70 CAPÍTULO 7. ESTUDIO DE UN CASO PRÁCTICO error_mas_500 = mean((medias_500_mas - mu)^2 ); error_mas_500 ################################################### #500 muestras aleatorias simples con remplazamiento set.seed(2304) matASR <- matrix(NA, nrow = 100, ncol = 500) dat <- data.frame j=16 #datos$Nota.M for (i in 1:500) { idx <- sample(1:(dim(datos)[1]),size = 100, replace=TRUE ) matASR[,i ] <- datos[idx,j] } medias_500_masr = apply(matASR,2,mean,na.rm=TRUE) mean(medias_500_masr) sd(medias_500_masr) mu = mean(datos$Nota.M, na.rm=TRUE) error_masr_500 = mean((medias_500_masr - mu)^2 ); error_masr_500 ########################################################## #500 muestras aleatorias estratificadas sin remplazamiento set.seed(2304) matE <- matrix(NA, nrow = 100, ncol = 500) dat <- data.frame j=16 #datos$Nota.M for (i in 1:500) { #Estratos s1=sample(1:(dim(USC)[1]),size = tamano_s1, replace=FALSE) 7.4. PEQUEÑO ESTUDIO DE SIMULACIÓN 71 s2=sample(1:(dim(UDC)[1]),size = tamano_s2, replace=FALSE) s3=sample(1:(dim(UVIGO)[1]),size = tamano_s3, replace=FALSE) s4=sample(1:(dim(OTRAS)[1]),size = tamano_s4, replace=FALSE) idx <- c(s1,s2,s3,s4) matE[,i ] <- datos[idx,j] } medias_500_mae = apply(matE,2,mean,na.rm=TRUE) mean(medias_500_mae) sd(medias_500_mae) mu = mean(datos$Nota.M, na.rm=TRUE) error_mae_500 = mean((medias_500_mae - mu)^2 ); error_mae_500 ########################################################## #500 muestras aleatorias estratificadas con remplazamiento set.seed(2304) matER <- matrix(NA, nrow = 100, ncol = 500) dat <- data.frame j=16 #datos$Nota.M for (i in 1:500) { #Estratos s1=sample(1:(dim(USC)[1]),size = tamano_s1, replace=TRUE) s2=sample(1:(dim(UDC)[1]),size = tamano_s2, replace=TRUE) s3=sample(1:(dim(UVIGO)[1]),size = tamano_s3, replace=TRUE) s4=sample(1:(dim(OTRAS)[1]),size = tamano_s4, replace=TRUE) idx <- c(s1,s2,s3,s4) matER[,i ] <- datos[idx,j] } 72 CAPÍTULO 7. ESTUDIO DE UN CASO PRÁCTICO medias_500_maer = apply(matER,2,mean,na.rm=TRUE) mean(medias_500_maer) sd(medias_500_maer) mu = mean(datos$Nota.M, na.rm=TRUE) error_maer_500 = mean((medias_500_maer - mu)^2 ); error_maer_500 ########################## #500 muestras sistematicas set.seed(2304) matS <- matrix(NA, nrow = 100, ncol = 500) dat <- data.frame j=16 #datos$Nota.M for (i in 1:500) { #N tamano de la poblacion N = length(datos$id_persona) #n tamano de la muestra 100 n=100 #salto k = floor(N/n) #semilla delta_valores = seq(1,k,1) delta = sample(delta_valores, size=1) #Selecion de las unidades para fromar parte de la muestra idx <- seq(delta,delta+99*k,k); matS[,i ] <- datos[idx,j] } medias_500_ms= apply(matS,2,mean,na.rm=TRUE) mean(medias_500_ms) sd(medias_500_ms) mu = mean(datos$Nota.M, na.rm=TRUE) 7.4. PEQUEÑO ESTUDIO DE SIMULACIÓN 73 error_ms_500 = mean((medias_500_ms[] - mu)^2 ); error_ms_500 ########################### #500 muestras conglomerados set.seed(2304) matC <- matrix(NA, nrow = 100, ncol = 500) dat <- data.frame j=16 #datos$Nota.M for (i in 1:500) { #Conglomerados congl <- sample(1:length(conglomerados),4) idx <- do.call("rbind",rbind(conglomerados[congl])) matC[,i ] <- idx[,j] } medias_500_mc = apply(matC,2,mean,na.rm=TRUE) mean(medias_500_mc) sd(medias_500_mc) mu = mean(datos$Nota.M, na.rm=TRUE) error_mc_500 = mean((medias_500_mc - mu)^2 ); error_mc_500 ############################################################### ######################## Graficas ############################# #Grafico de barras especialidades ggplot(df_especialidades)+ geom_bar(aes(x=Categoria, y=Total, fill=Categoria), stat="identity") + labs(y="", x= "") + theme(axis.text.x = element_blank(), 74 CAPÍTULO 7. ESTUDIO DE UN CASO PRÁCTICO axis.ticks.x = element_blank()) #Graficos base de datos. Descriptiva por grupos #Fila 1 table(datos$uniprod) unis <- c("Universidad de Santiago de Compostela", "Universidad de Coruña", "Universidad de Vigo", "Otras") df <- data.frame(Universidad = factor(unis, levels=c("Universidad de Santiago de Compostela", "Universidad de Coruña", "Universidad de Vigo", "Otras")), total=c(240,37,22,102)) plot1<-ggplot(df, aes(y="",x=total, fill=Universidad))+ geom_bar(width = 1, stat = "identity") + labs(y="", x= "",title="Universidad de procedencia") + geom_text(aes(x = c(50,113,145,285), label = c("25.45%","5.48%", "9.22%", "59.85%")),y ="", check_overlap = TRUE) + theme_void()+ theme(legend.position = "bottom", legend.title = element_blank(), legend.text = element_text(size=15), plot.title = element_text(size = 20)) + guides(fill = guide_legend(nrow=1, byrow = TRUE)) #Fila 2 table(datos$egresado) df2 <- data.frame(Egresado=c("Egresados/as", "Alumnos/as"), total=c(191,210)) plot2<-ggplot(df2, aes(y="",x=total, fill=Egresado))+ geom_bar(width = 1, stat = "identity") + labs(y="", x= "",title="Egresados/as-Alumnos/as") + geom_text(aes(x = c(100,300), label = c(191,210)), y ="", check_overlap=TRUE) + theme_void()+ theme(legend.position = "bottom", legend.title = element_blank(), legend.text = element_text(size=15), plot.title = element_text(size = 20)) + guides(fill = guide_legend(nrow=1, byrow = TRUE)) 7.4. PEQUEÑO ESTUDIO DE SIMULACIÓN 75 #Fila 3 table(datos$correo) df3 <- data.frame(Correo=c("gmail.com", "hotmail.com","usc.es","udc.es", "uvigo.es","Otros"), total=c(204,71,58,24,3,41)) plot3<-ggplot(df3, aes(y="",x=total, fill=Correo))+ geom_bar(width = 1, stat = "identity") + labs(y="", x= "",title="Dominio de correo electronico") + geom_text(aes(x = c(300,165,35,74,4,105), label = c("50.87%","17.70%", "14.64%","5.98%","0.74%","10.22%")), y ="", check_overlap = TRUE) + theme_void()+ theme(legend.position = "bottom", legend.title = element_blank(), legend.text = element_text(size=15), plot.title = element_text(size = 20)) + guides(fill = guide_legend(nrow=1, byrow = TRUE)) grid.arrange(plot1,plot2,plot3) #Histogramas simulación medias_simulacion <- c(medias_500_mas, medias_500_masr, medias_500_mae, medias_500_maer, medias_500_ms, medias_500_mc) muestreos_simulacion <- c( rep("Muestreo aleatorio simple sin reemplazamiento",500), rep("Muestreo aleatorio simple con reemplazamiento",500), rep("Muestreo aleatorio estratificado sin reemplazamiento",500), rep("Muestreo aleatorio estratificado con reemplazamiento",500), rep("Muestreo sistemático",500), rep("Muestreo por conglomerados",500)) df_simulacion <- data.frame(calificaciones = medias_simulacion, tipos = factor(muestreos_simulacion, levels = c( "Muestreo aleatorio simple sin reemplazamiento", "Muestreo aleatorio simple con reemplazamiento", "Muestreo aleatorio estratificado sin reemplazamiento", "Muestreo aleatorio estratificado con reemplazamiento", 76 CAPÍTULO 7. ESTUDIO DE UN CASO PRÁCTICO "Muestreo sistemático", "Muestreo por conglomerados"))) ggplot(df_simulacion, aes(x = calificaciones, fill = tipos))+ geom_histogram(colour="black", bins = 20) + geom_vline(xintercept = mu , size = 1.5) + facet_wrap(~tipos, scales = "free") + theme(legend.position = "none") + labs(y = "", x = "Calificaciones") ################################################################################ Referencias Alba, V., y Ruiz, N. (2006). Muestreo estadístico en poblaciones finitas. Septem Ediciones. Azorín-Poch, F. (1969). Curso de muestreo y aplicaciones. Aguilar. Bethlehem, J. (2009). The rise of survey sampling. Statistics Netherlands. Cid-Cid, A. I., Delgado-Manríquez, C. A., y Leguey-Galán, S. (1999). Introducción al muestreo en poblaciones finitas. Editorial Nuevas Estructuras. Fernández-García, F. R., y Mayor-Gallego, J. A. (1995). Muestreo en poblaciones finitas: curso básico. EUB. Graunt, J. (1662). Natural and political observations upon the bills of mortality. Martyn, London. Hansen, M. H., y Hurwitz, W. N. (1943). On the theory of sampling from finite populations. The Annals of Mathematical Statistics,14(4), 333–362. Horvitz, D. G., y Thompson, D. J. (1952). A generalization of sampling without replacement from a finite universe. Journal of the American statistical Association,47(260), 663–685. Kiaer, A. N. (1895). Observations et expériences concernant des dénombrements représentatifs. Bulletin of the International Statistical Institute,XI(2), 176–183. Mendenhall, W., Scheaffer, R. L., y Lyman Ott, R. (2006). Elementos de muestreo. Editorial Paraninfo. Neyman, J. (1934). On the two different aspects of the representative method: the method of stratifaied sampling and the metohd of purprosive selection. Journal of the Royal Statistical Society, 97, 558–606. Pérez-López, C. (2005). Muestreo estadístico: conceptos y problemas resueltos. Pearson Pretince Hall. Pérez-López, C. (2010). Técnicas de muestreo estadístico. Ibergaceta. Sheldon, M. R. (2010). A first course in probability. Pearson Prenttice Hall. Sánchez-Crespo, J. (1984). Curso intensivo de muestreo en poblaciones finitas. INE. 77