scieee AI-readable full text Open interactive document viewer

Modelos probabilísticos. Variables aleatorias discretas

Gamero-Burón, Carlos,Iranzo-Acosta, José Luis

Full text

Parcialmente financiado a través de PIE13-024 (UMA) Modelos probabilísticos Variables aleatorias discretas Carlos Gamero Burón José Luis Iranzo Acosta Departamento de Economía Aplicada Universidad de Málaga Parcialmente financiado a través del PIE13-024 (UMA) Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 2 Estadística I Bloque II GRADO EN ADMINISTRACIÓN Y DIRECCIÓN DE EMPRESAS VARIABLE ALEATORIA Y MODELOS PROBABILÍSTICOS Tema 4. PROBABILIDAD Tema 5. VARIABLE ALEATORIA Tema 6. MODELOS PROBABILÍSTICOS PARA VARIABLES ALEATORIAS DISCRETAS Tema 7. MODELOS PROBABILÍSTICOS PARA VARIABLES ALEATORIAS CONTINUAS Tema 6: MODELOS PROBABILÍSTICOS PARA VARIABLES ALEATORIAS DISCRETAS 6.1. Introducción 6.2. Distribución binomial 6.3. Distribución de Poisson 6.4. Distribución Hipergeométrica 6.5. Distribución multinomial Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 3 6.1. INTRODUCCIÓN Hasta ahora hemos introducido funciones matemáticas [f(x) y F(x)] para representar distribuciones de probabilidad de variables aleatorias. Ahora estudiaremos las distribuciones de probabilidad más importantes (las de mayor uso) que sirven de modelos para explicar la realidad del experimento aleatorio que estamos estudiando. Un modelo probabilístico es una representación matemática deducida de un conjunto de supuestos con el doble propósito de estudiar los resultados de un experimento aleatorio y predecir su comportamiento futuro, cuando se realiza bajo las mismas condiciones dadas inicialmente. Dentro de los modelos de distribuciones discretas vamos a ver los siguientes: 1. Distribución Binomial 2. Distribución Poisson 3. Distribución Hipergeométrica 4. Distribución Multinomial (modelo multivariante) Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 4 6.2. DISTRIBUCIÓN BINOMIAL Aplicaciones: control de calidad, ventas, marketing, medicina, etc. Experimento binomial: Ejemplo: ξ = ”Arrojar una moneda n veces” Características del experimento binomial: Sólo hay dos resultados posibles en cada prueba (prueba de Bernoulli) éxito = ocurrencia del suceso (sacar cara) fracaso = no ocurrencia (sacar cruz). El experimento se repite n veces (n pruebas) dándose que: 1. n es finito 2. las n pruebas son independientes entre sí. 3. P(éxito)=p se mantiene constante prueba a prueba P(fracaso)=1-p Variable aleatoria: X=”número de éxitos (caras) al realizar n lanzamientos” X es una variable discreta: 0,1,2, , x n = … Función de cuantía: ( ) ( ) x f P X x = = ( , ) X B n p ∼ ⇔ 0,1,2,..., ( ) 0 en el resto. x n x n p q x n f x x −   =   =    Es una distribución biparamétrica (n y p) Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 5 Deducción de f(x): ξ = ”Arrojar una moneda n veces” es un experimento binomial X=”nº de caras que se obtienen” “Cara”=”éxito”=E y “Cruz”=”fracaso”=F El resultado global en n pruebas sucesivas, suponiendo que primero ocurren los x éxitos y después n x − fracasos, puede escribirse así: x n x EE E FF F − … …   La probabilidad de este suceso concreto sería: ( )  ( ) ( ) ( ) ( ) ( ) ( ) por independencia veces veces x n x x n x P EE EFF F P E P E P E P F P F P F pp pqq q p q − − = = = = … … ⋯ ⋯ ⋯ ⋯   Da igual el orden en que aparezcan los x éxitos y los n x − fracasos. Cualquier permutación con x éxitos y n x − fracasos es válida: , ! !( )! n x n x n n P k x x n x −   = = =   −   Todas las ordenaciones i H son equiprobables con ( ) . x n x i P H p q − = La probabilidad de que ocurran x éxitos en n pruebas será la probabilidad de que ocurra cualquiera de esas ordenaciones: ( ) ( )  ( ) ( ) ( ) 1 2 1 2 por ser disjuntas x n x k k P X x P H H H P H P H P H kp q − = = = + + + = ∪ ∪⋯∪ ⋯ Luego la probabilidad buscada vendría dada por: ( ) ! 0,1,2,..., . !( )! x n x n P X x p q x n x n x − = = = − Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 6 Función de distribución: ( ) 0 0 si 0 ( ) 0,1,2,..., 1 1 si i x i n i i x n F x P X x p q x n i x n =− = <     = ≤ = = −      ≥  ∑ Podemos utilizar F(x) para calcular la probabilidad de que X tome un valor concreto: ( ) ( ) ( 1). P X x F x F x = = − − Características de la distribución binomial: • Función generatriz de momentos: ( ) 0 ( ) ( ) con . x n n tX tx t Xx M t E e e f x pe q t = =   = = = + −∞ < < +∞   ∑ A partir de ella podemos obtener: • Esperanza: [ ] . E X np µ = = El número medio de éxitos en n pruebas se obtiene multiplicando n por la probabilidad de éxito. • Varianza: [ ] 2 Var X npq σ = = µ y 2 σ dependen sólo de n y de p , los parámetros del modelo Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 7 • Forma de la distribución: 0 0.05 0.1 0.15 0.2 0.25 0.3 0 1 2 3 4 5 6 7 8 9 10 f(x) x B (10;0,5) 0 0.05 0.1 0.15 0.2 0.25 0.3 0.35 012345678910 f(x) x B (10;0,2) 0 0.05 0.1 0.15 0.2 0.25 0.3 0.35 012345678910 f(x) x B (10;0,8) 0,5 p q = = p q < p q > Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 8 Aunque p sea distinto de q, cuando n crece la distribución tiende a hacerse simétrica. Si n tiende a infinito, la distribución binomial tiende a aproximarse a una distribución normal 0.000 0.005 0.010 0.015 0.020 0.025 0.030 0.035 0.040 0.045 0.050 50 60 70 80 90 100 110 120 f(x) x B(900;0,1) Cálculo exacto de probabilidades: • Puede llevarse a cabo mediante el uso de programas estadísticos (Excel, SPSS, STATA, etc.). • También existen tablas estadísticas que recogen los valores que toman la función de cuantía y la función de distribución para determinados valores de n y p (véase Anexo 5.1) • Manejo de tablas: Importante: Sean ( , ) X B n p ∼ e ( ,1 ) Y B n p − ∼ Relación entre funciones de cuantía: ( ) ( ) P X x P Y n x = = = − Relación entre funciones de distribución: ( ) ( ) ( ) 1 ( 1) X X Y Y F x P X x P Y n x F n x = ≤ = ≥ − = − − − grande p q n ≠ Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 9 Aproximación de probabilidades binomiales: • Cuando n es grande, pueda usarse la distribución normal para aproximar probabilidades binomiales. • Cuando n es grande, en determinadas situaciones, también se pueden aproximar utilizando la distribución de Poisson. Propiedad reproductiva Si 1 2 y X X son dos variables aleatorias independientemente distribuidas según una 1 ( , ) B n p y 2 ( , ), B n p respectivamente (importante, con la misma probabilidad de éxito p), entonces: 1 2 1 2 ( , ). X X X B n n p = + + ∼ Luego la distribución binomial se reproduce por adición de variables aleatorias binomiales independientes con la misma probabilidad de éxito p, respecto al parámetro n. Demostración: ( ) 1 2 1 2 1 2 1 2 por independecia de y ( ) t X X tX tX tX tX tX X X X M t E e E e E e e E e E e +           = = = ⋅ = ⋅ =            ( ) ( ) ( ) 1 2 1 2 1 2 ( ) ( ) = n n n n t t t X X M t M t pe q pe q pe q + = = + + + Esta es la función generatriz de momentos de una 1 2 ( , ) B n n p + por lo que, por el Teorema de la Unicidad, se concluye que 1 2 1 2 ( , ). X X X B n n p = + + ∼ Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 16 Ejemplo 2: El número de llamadas recibidas en un minuto en una línea telefónica sigue una distribución de Poisson con media igual a 4. Calcular: a) Probabilidad de que no se reciba ninguna llamada en dos minutos. b) Probabilidad de que no se reciba ninguna llamada en un intervalo de treinta segundos. Resolución: "número de llamadas recibidas en un minu to" (4) X X P = ∼ 4 4 0,1,2,... ( ) ! 0 en el resto. x ex f x x − =  =   Para resolver este ejercicio, aplicaremos la propiedad reproductiva: a) "número de llamadas recibidas en dos min utos" Y = En este caso, 2 α = de manera que (2 4), Y P ⋅ ∼ es decir, (8). Y P ∼ 8 8 ( ) 0,1,2,... ! y e f y y y − = = ( ) 8 0 8 0 (0) 0,0003 0! e P Y f − = = = = b) "número de llamadas recibidas en treinta segundos" Z = En este caso, 1 2 α = de manera que 1 4 , 2 Z P   ⋅     ∼ es decir, (2). Z P ∼ 2 2 ( ) 0,1,2,... ! y e f z z z − = = ( ) 2 0 2 0 (0) 0,1353. 0! e P Z f − = = = = Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 17 Ejemplo 3: Suponga que la llegada de vehículos a un cruce puede modelizarse por un proceso de Poisson. Si la probabilidad de que no pase ningún vehículo en un minuto es 0,135, se pide: ¿Cuál es la probabilidad de que pase más de un vehículo en dos minutos? Resolución: "Nº de vehículos que llegan a un cruce e n 1 minuto" X = ( ) X P µ ∼ con ( ) para 0,1,2,... ! x e f x x x µ µ − = = Desconocemos el valor de la media, pero el enunciado proporciona un dato que permite calcularla: 0 tomando logaritmos ( 0) 0,135 0,135 ln(0,135) 2 0! e P X e µµ µµ µ −− = = → = = → − = → ≃  "Nº de vehículos que llegan a un cruce e n 2 minutos" Y = La variable Y es la suma de dos variables aleatorias, 1 X y 2 , X que se pueden suponer independientes y que se distribuyen según una Poisson (2). i X P ∼ Por la propiedad reproductiva de la distribución de Poisson se tiene que: 1 2 (2 ) (4) Y X X P Y P µ = + → ∼ ∼ con 4 4 ( ) para 0,1,2,... ! y e f y y y − = = La probabilidad solicitada es:  4 0 4 1 tablas 4 4 ( 1) 1 ( 1) 1 ( 0) ( 1) 1 0,9084. 0! 1! e e P Y P Y P Y P Y − − > = − ≤ = − = − = = − − = Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 18 Aproximación de la distribución binomial a partir de la Poisson • El uso de una distribución para aproximar a otra es una práctica bastante común en probabilidad y Estadística. La idea consiste en buscar situaciones en las que una distribución (como la de Poisson), cuyas probabilidades son relativamente fáciles de calcular, tiene valores que se encuentran razonablemente cercanos a las de otra distribución (como la binomial) cuyas probabilidades implican cálculos más complicados. • La distribución de Poisson puede servir para obtener valores aproximados de las probabilidades binomiales, cuando n es muy grande, p muy pequeño y np permanece constante. • En las aplicaciones prácticas se reemplaza habitualmente el modelo binomial por el de Poisson cuando, simultáneamente, 50 n ≥ y 0,1. p ≤ • La aproximación es cada vez mejor a medida que n crece y p decrece. 0.000 0.020 0.040 0.060 0.080 0.100 0.120 0.140 0.160 0.180 0.200 0 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 f(x) x B(500;0,01) P(5) Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 19 Ejemplo 4: Una máquina produce piezas en grandes cantidades y se sabe que la proporción de piezas defectuosas es p=0,01. Se toma una muestra aleatoria de 100 piezas. ¿Cuál es la probabilidad de que se obtengan 2 defectuosas? "número de piezas defectuosas en una mue stra de 100" X n ≡ = (100;0,01) X B ∼ ( ) 2 98 100 2 0,01 0,99 0,1849 2 P X   = = ⋅ =     Utilizando la aproximación de Poisson con 100 0,01 1: µ = ⋅ = ( ) 1 2 1 2 0,1839 2! e P X − = =≃ El modelo de Poisson da una buena aproximación del modelo binomial. Ejemplo 5 : Una compañía de seguros ha descubierto que alrededor del 0,1% de la población tiene cierto tipo de accidente cada año. Si los 10.000 asegurados fueran seleccionados aleatoriamente en la población, ¿cuál sería la probabilidad de que no más de 5 tengan este tipo de accidente en el próximo año? "número de accidentados en una muestra d e 10000" X n = = (10000;0,001) X B ∼ ( ) 51000 0 10000 5 0,001 0,999 x x x x P X x = − =   ≤ = ⋅     ∑ Esta probabilidad resulta difícil de calcular. Podemos utilizar la aproximación de Poisson con 10000 0,001 10: µ = ⋅ = Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 20 ( )  10 5 tablas 0 10 5 (5) 0,0671. ! x x x e P X F x − = = ≤ = = ∑ ≃ Ejemplo 6: Una compañía de seguros ha realizado estudios que muestran que el 0,003% de los habitantes de una gran ciudad fallece cada año como resultado de un determinado tipo de accidente cubierto por sus pólizas. Calcule: a) La probabilidad de que la compañía tenga que pagar a más de tres de los 10000 asegurados que tiene en esa ciudad. b) El número esperado de accidentes del tipo mencionado entre sus asegurados. Resolución: "Nº de asegurados que fallecen en un gru po de =10000" X n = (fallecimiento) 0,00003 P p = = (10000;0,00003) X B ∼ 10000 10000 ( ) 0,00003 0,00097 para 0,1,2,...,1000 0 x x f x x x −   = =     a) ( 3) P X > Dada la problemática de cálculo, aproximaremos la distribución binomial por la distribución de Poisson. Se dan las condiciones para hacerlo ya que 10000 n = es suficientemente grande y 0,00003, p = suficientemente pequeña. La distribución de Poisson que utilizaremos para la aproximación será aquella que tiene la misma media que la binomial, es decir, 10000 0,00003 0,3, np µ = = ⋅ = de manera que (0,3): P X P ∼  0,3 3 0 (0,3) ( 3) 1 ( 3) 1 ( 3) 1 0,0003 ! P P P x x Ptablas xP e P X P X P X x − = = > = − ≤ − ≤ = − = ∑ ≃ b) [ ] 0,3 E X np µ = = = accidentes del tipo considerado mortales esperados. Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 21 6.4. DISTRIBUCIÓN HIPERGEOMÉTRICA Aplicaciones: control de calidad y aceptación de muestras. Experimento aleatorio hipergeométrico: La distribución hipergeométrica es una alternativa a la distribución binomial cuando las pruebas no son independientes (muestreo sin reposición). Cuando el muestreo o la selección de elementos de la muestra se hace sin reposición, la probabilidad de éxito no permanece constante como sucedía en el caso binomial. Ejemplo: Supongamos una caja con N=50 lámparas en la cual hay k defectuosas. Si realizamos el experimento de sacar una muestra de tamaño n=10 para comprobar si funcionan o no y el muestreo es sin reposición, la probabilidad de que una lámpara sea defectuosa queda modificada por el resultado de las anteriores extracciones La distribución de probabilidad de la variable X que da el número de éxitos (número de elementos con una determinada característica) en la muestra de tamaño n obtenida sin reposición de una población de tamaño N es la distribución hipergeométrica. Función de cuantía: Sea una población de tamaño N dividida en dos subpoblaciones disjuntas de tamaños k y N k − (los que poseen la característica de interés y los que no). Llamemos p a la proporción de elementos de la población que poseen la característica ( p = k / N ). Se selecciona una muestra aleatoria sin reemplazamiento de tamaño n , con . n N ≤ Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 22 X=”número de elementos con la característica de interés en una muestra de tamaño n extraída de una población de tamaño N” La función de cuantía viene dada por: ( ) max 0, ( ) min( , ) ( ) 0 en el resto. Np N Np x n x n N Np x n Np N f x n −       −    − − ≤ ≤  =         Ésta es la distribución hipergeométrica, que depende de tres parámetros N, n y p, con N y n siendo enteros positivos y 0 1. p < < Notación abreviada: ( ) , , X H N n p ∼ La fórmula de la función de cuantía se obtiene como aplicación de la Regla de Laplace : N n       = número de casos posibles. Es el número de muestras distintas de tamaño n obtenidas de la población total de tamaño N. Np x       = número de formas posibles de obtener x elementos de la subpoblación que posee la característica de interés, que tiene Np elementos. N Np n x −     −   = número de formas posibles de obtener n x − elementos de la segunda subpoblación, que tiene N Np − elementos. Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 23 Np N Np x n x −       −    = número de casos favorables. Es el número de formas distintas de obtener una muestra con x elementos de la primera subpoblación (la que posee la característica) y n x − de la segunda. La función de cuantía no es válida para 1,2, , x n = … , sino para ( ) max 0, ( ) min( , ). n N Np x n Np − − ≤ ≤ ¿A qué se deben estas limitaciones en el valor de x ? - el número x de éxitos tiene que ser menor o igual que el número de elementos de la muestra ( n ), pero también tiene que ser menor o igual que el número de elementos con la característica de interés presentes en la población ( Np ). De ahí que min( , ). x n Np ≤ - Por otro lado, el número de éxitos debe ser mayor o igual que cero, pero también el número de fracasos en la muestra debe ser menor o igual que el número de elementos de la población que no poseen la característica de interés ( ) ( ). n x N Np − ≤ − Por ello, ( ) max 0, ( ) . x n N Np ≥ − − Características de la distribución hipergeométrica: • Media: ( ) E x np = La esperanza matemática es la misma que la de la distribución binomial • Varianza: 2 1 N n npq N σ − = − La varianza del modelo hipergeométrico es menor que la del binomial ya que el factor 1 N n N − − es menor que la unidad. Este factor recibe el nombre de factor de corrección en muestreo con poblaciones finitas . Representa la reducción en la varianza por muestrear sin reposición en poblaciones finitas. Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 24 Como este factor tiende a 1 cuando N tiende a infinito, se tiene que, para N suficientemente grande comparado con n, ambas distribuciones, la binomial y la hipergeométrica, tienden a hacerse idénticas por lo que, en ese caso, es poco relevante que la muestra de tamaño n sea con reposición o sin reposición. En la práctica se toma como límite 0,1 0,1. n n N N <⇒< Ejemplos: (1) Se extrae con reposición una muestra de n=3 de una población de N=20. La probabilidad de éxito (tener una determinada característica) es 1/2. Tenemos pues que N=20, p=1/2, n=3. Al efectuarse el muestreo con reposición, la probabilidad de éxito se mantiene constante en cada extracción por lo que se trata de una distribución binomial. (2) Imaginemos ahora que en esa misma población la extracción para la muestra se hace sin reposición (extracciones no independientes). Ahora los datos son N=20, p=1/2, Np=10, n=3. En esta situación, la probabilidad de éxito cambia de extracción a extracción: en la primera extracción es 10/20, en la segunda es 9/19 y en la tercera es 8/18. En este caso, la variable que recoge el número de éxitos sigue una distribución hipergeométrica. (3) Pero si resultara que tenemos una población con N=1000 y Np=10, entonces, en el caso de extracción sin reposición, la probabilidad de éxito en la primera extracción sería 10/1000 y en la segunda 9/999, luego las diferencias son pequeñas (probabilidad casi constante). En este caso podríamos utilizar la distribución binomial en lugar de la hipergeométrica, sin cometer errores de gran magnitud. Ejemplo 1: Un fabricante de automóviles compra los motores a una compañía donde se fabrican bajo estrictas especificaciones. El fabricante recibe un lote de 40 motores. Su plan para aceptar el lote consiste en seleccionar 8, de manera aleatoria y someterlos a prueba. Si encuentra que ninguno de los motores presenta serios defectos, el fabricante acepta el lote, de otra forma lo rechaza. Si el lote contiene dos motores con serios defectos ¿Cuál es la probabilidad de que sea aceptado? Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 25 Resolución: "nº de motores defectuosos con 8, 40 y 2 " X n N Np = = = = El muestreo es sin reposición (no tiene sentido lo contrario) por lo que: ( ) 40;2;0,05 X H ∼ con x=0,1,2 2 38 8 ( ) 0,1,2 40 8 Np N Np x n x x x f x x N n −             − −       = = =             y 0 en el resto. El lote es aceptado si no tiene ningún defecto: 2 38 38! 1 0 8 992 8!30! (0) ( 0) 0,6359 40! 40 1560 8!32! 8 f P x    ⋅       = = = = = =       Ejemplo 2: Un fabricante asegura que sólo el 1% de su producción total se encuentra defectuosa. Supóngase que tiene 1000 artículos y se seleccionan 25 al azar para inspeccionarlos. Si el fabricante se encuentra en lo correcto. ¿Cuál es la probabilidad de observar dos o más artículos defectuosos en la muestra? Resolución: "nº de artículos defectuosos con de 25, extraida de una población con 1000 y 0,01" = = = = X n N p Al no haber reposición, esta variable se distribuye según una hipergeométrica: ( ) 1000;25;0,01 X H ∼ con x=0,1,2,…,10 Estadística I [MODELOS PROBABILÍSTICOS PARA V.A. DISCRETA] 32 ( ) obtenga 5 votos (5,0,5) (5,5,0) (5,4,1) (5, 1,4) (5,3,2) (5,2,3) P A f f f f f f = + + + + + Resulta más fácil calcular esta probabilidad si tenemos en cuenta que las distribuciones marginales de las variables que intervienen en una distribución multinomial son distribuciones binomiales. Por tanto: 5 5 1 1 10 (10;0,1) ( 5) (0,1) (0,9) 0,0015. 5 X B P X   → = = =     ∼