scieee AI-readable full text Open interactive document viewer

Fundamentos de la teoría de la decisión y de la teoría de la estimación estadística

Doménech Massons, José M.

Abstract

Doménech Massons, José M.

Full text

/ JOSE M. DOFIENECH MASSONS No es la uniformidad sino la variabilidad el atributo fundamental que carateriza a la naturaleza. No es la rigidez sino el azar quien está en la base de los hechos psicol6gicos o biológicos. En la naturaleza,el azar hace que la variabilidad entre los individuos sea la regla. La estadlstica es el Gnico instrumento matemdtico adeeuado para analizar datos de fenómenos c~ ya característica fundamental es la variabilidad. No es posible estudiar la variabilidad con un solo individuo. De ahl que la formulaci6n estadística de un problema no pueda ser una formulación a nivel individual sino que debe ser una formulaci6n a nivel de grupo. Lo61 d_isefios e~$~tiJAe~ eaon pr~blemoa forrnriladsa w nivel de grupo. En canescuoricta, una ves tratadois estndfsticcríno~ te los datos obtenidos, las conclusiones de estos diseños no pug den ser conclusiones a nivel individual sino que son conclusiones a nivel de grupo. Esto quiere decir, por ejemplo, que si con un diseño experimental se demuestra la euperioridad de un tratamiento X respecto a otro tratamiento A, el resultado que obtendremos al aplicar el tratamiento X a toda la población, en media, serd superior al resultado que hubieramos obtenS4o al aplicar el tratamient~ k a toda la poblaci6n; sin embargo para ciertos individuos el tratamiento A serd superior al X. En este artEculo se desarrollan dos problemas fundamentales que estudia la estadfstica: los Problemas de Estima- = y los Problemas de Decisi6n. Con fines didsctidos este estudio se particulariza a caracteres cualitativos. La Teorra de la Estimaci6n se desarrolla a partir del caso particular de una proporcibn. La e rfa de la Decisidn se desarrolla a partir del caso particular de la prueba de comparaci8n de una proporci6n observada a una proporcidn tebrica. Sin embargo la generalización a otros casos es inmediata. 11.'- CONCEPTO DE PROPORCION Sea un cierto aspecto 5 que se observa Veces en una muestra de individuos. Se define como progorci6n observad~ de individuos con el aspecto &, al cociente : A la proporci6n observada de individuos de la muestra que no presentan el aspecto 5, se la designa por q, y valer - (2) qO= 1-P, A la verdadera proporci6n de individuos, de la poblaci6n origen de la muestra, qye presenta el aspecto A, se la designa por E y a su complemento a l se lo designa por 9 111.- CONCEPTO DE INTERVALO DE PROBABILIDAD 1-Q! Tanto para la Teorfa de la Estimación como para la Teorfa de la decisión es necesario resolver el siguiente e importante problema de predicción mediante la Teorla de 1a.Probabilidad: conocer el intervalo donde fluctuan las proporciones E, observadas en muestras de tamaño n_ procedentes de una poblacX6n caracterizada por una proporción E. El siguiente experimento .permite .resolver dicho pro- . . blema . Se tiene una poblacibri que contiene una proporción e conocida de bolas blancas y el resto q=l-~ son bolas negras. Se extrae un conjunto muy grande de muestras con gl bolas cada una (muestras de tamaño III) y se tabulan y representan graficamente el conjunto de las proporciones Eo Observadas de bolas blancas observadas en cada una de estas muestras. Nuevamente se extrae un conjunto muy grande de muestras, ahora con r~~ bolas cada una (n2 mayor que n ) y se tabu- -1 lan y representan graficamente el conjunto de proporciones de bolas balncas observadas en cada una de estas muestras. E0 Y así sucesivamente se extraen conjuntos muy grandes de muestras pero cada vez compuestas de un nGrnero de bolas mayor que los anteriores y se represcnton graflcamento el conjunto de proporciones de bolas blancas observasas en coda conjunto de muestras. 5 La figura 1 ilustra estas representaciones grsficas par$ conjuntos de muestras de tamaño pl= 10, n2=20 y ~1'40, cuondo en la población origen de estas muestras hay la mitad de bolas blancas y la otra mitad de bolas negras (g=q=0.5). La obseryac'i6n de estas representaciones gtdf icas permite sacar las siguientes conclusiones: a,- En todas las gráficas la proporciones observa¿ae E0 se agrupan alrededor del valor g ipro~orcibn de bolas blancas que contiene la poblacibn origen de las muestras). b.- Cuando aument? el número de bolas que hay en las muestras, las proporciones observadas están E0 más agrupadas alrededor del valor e. El conjunto de proporciones observadas po es cada vez menos disperso ii medida que el tamaño-2 de las rnueatras aumenta. Este concepto de dispersidn se cuantifica mediante el f~dicegP ' llamado desviaci6n tipo. ' Por ejemplo, si las muestras proceden de una poblacion que contiene una proporcidn p0.5 de bolas blancas y el resto c~=1-p=8.5 de bolas negras, cuando n-10 la desviaci6n tipo de las proporciones observadas vale: c.- Si las muestras son grandes, se ve como estas gráficas sinbtricas alrededor de un eje vertical que pasa por el valor y tienen la misma forma de "campana". La diferencia entre ellas está en que las "campanas" son mas estrechas a medida que correspondan a muestras mas grandes. Este único modelo que siguen todas las graficas rec>be el nombre de modelo o ley normal. Esta ley ha sido estudiada por Laplace y Gauss, hace varios siglos. Teorema PunUamental Se demest~.a que el desvibe , a cada lodo del punto central e, que deja dentro el 95% de las proporciernes & observadas - Flirtiinc1611 de las proporciones po dc bola\ hinncas obscrvadaq coniirne una proporritin de botas bianws p = O5 en las muestras, se obtiene multipllcando elvz~or constante zq -1.96 por la desviacidn tipo tycorrespondiente. Es decir: P El desvio 6? que deja dentro el998 de las 52 Se Obtiene multiplicando =2.58 por dicha desviaci6n tipo. En general estos valores constantes se simbalizan por g,, y el deevio g Yieno dado por: En la tabla 1 se dan los valores mas importantes de ' -* en funci6n de* y en la figup 2 se ilustra el desvio e. \ 1 - e - e 4 PP figura2 TABLA 1 El valord representa laxantidad, en tantos por uno, de pro7 porciones observadas que estdn fuera del intervalo alrededor de p, definido por dicho desvío 2. Condicionss de aplicación La f6rmula (4) y los valores qq dados en la tabla 1, son vdlidos exclusivamente para distribuciones que siguen el rnx delo normal. Se Comprueba experimentalmente que la diatrihucidn de las proporciones observadao sigue un modelo normal cuando se cumple que los productos y 3 son iguales o superiores a 5. Estas muestras reciben el nombre de muestras grandes. Este Teorema Fundamental se demuestra a partir de la Teorfa de la Probabilidad (*) y es un caso particular de un importante teorema llamado Teorema Llmite Central. Definici6n de Intervalo de Probabilidad Se define intervalo de probabilidad todo intervalo, eim6trico alrededor de E, que contenga gran parte de las proporciones observadas en muestras de tamaiio extraidas al azar de una población caracterizada por la proporción p. El intervalo alrededor de E, definido por el desvfo e, que contiene el 95% de las proporciones observadas, recibe - el nombre de intervalo de probabilidad del 95%. En general, recibe el nombre de intervalo de probabilidad 1-b( , aquel intervalo que contiene el l-o( (en tantos por uno) iie las proporciones observadas p,,, es decir, aquel intervalo que sólo deja fuera una pequeña proporcit3n de las proporciones observadas En el intervalo probabilidad 1-4 , el valor O( indica la probabilidad de observar, en una muestra precedente de la poblaci6n e, una proporcign observada po fuera de dicho inter- - ("1 Un estudio detallado puede verse en la obra (1) de la Bdblbograffa Seleccionada va lo. Una idea importante es que un intervaio de probabilidad nunca podrd contener todas las proporciones que pueden observarse.en las muestras. Para definir el intervalo de probabilidad siempre debe excluirse una proporción4 , tan peque ña como queramos, de casos extremos. La estadística analiza fenómenos cuya regla fundamental es la variabilidad. Si queremos dar un intervalo en el que se encuentran los valores da un cierto cardctor, medido en una población de individuos, la variabilidad puede hacer que en algGn individuo este carácter tome un valor excepcionalmente grande o excepcionalmente pequeño. La estadística busca un intervalo que sea lo mds pg queño posible pero que a la vez contenga la máxima información posible (el máximo número de casos posible). Para lograrlo se debe prescindir de unos pocos casos extremos que agrandan mucho el intervalo sin casi aportar información. Por convenio se ha aceptado universalmente dar intervalos que contengan el 95% de los individuos. De esta definición y de la observaci6n de la figura 2 se deduce fdcilmente la fórmula del intervalo de probabilidad : de A.. Las muestras deben ser ~l intervalo de probabilidad 1-4 permite predecir, aceptando el riesgo &de equivocarnos, el intervalo en el cual estar5 contenida la proporci6n po observada en una cierta. nuastra de tamaño p procedente una poblacibn careoterizada ~or la proporción p. Generalizacidn El concepto de intervalo de probabilidad se generaliza flsilrnente a otras caracterPetfcae estadgeticas. Por eje^ / plo si se estudia un caracter cuantitativo, el intervalo de probabilidad que permite predecir con riesgo o( , el intervalo en el cual estard contenida la media observada en una muestra de tamafio E, procedente de una poblacidn caracterizada por una media 5 y una desviación tipo 0- , vie.ne dado por (6). I C. de A.: Las muestras deben ser I 1 grondee i n) 30). J Ejemplo 1 Dada una población que contiene un 50% de bolas blancas y un 50% de bolas negras, predecir el intervalo en el que se encontrar5 el 952 de las proporciones observadas en muestras de 40 bolas ex'traldas, no exhaustivamente y al azar, de dicha población. Aplicando la fórmula (5) se obtiene el intervalo pedido : IV. - TEORIA DE LA ESTIMACION ESTADISTICA a Un problema de estimación consiste en hallar, con determinada precisión, el verdadero valor de un pariiniarro (proporción, media, variancia, etc. calculada con todos los individuos de una población), a partir solamente de la información contanida en una mueetra representativa (*) de la poblncibn. * La obtención de una muestra representativa es un problema de nattirjileza estadlstlca cuya ~uluuiGii ~ul-xccta es que la alaccidn de los individuos de la muestra excluya cualquier sistembtica. Esto se logra mediante una elección al azar. Hipbtesis nula e Hipótesis alternativa La figura 5 esquematiza el planteo general de este problema de decií idn . Flip~fcsLr n111n (llel: La iiiucstra prtrcde de In población A. llipolesis a1trrnalA.a (H,): La tnuestra proqdc de una población ,Y dc diícrcntc coiiiposici6n quo la poblacan A. figura 5 Hay dos hipótesis posibles. La hipdtesis principal es la hipotesis pula H , según la cual la muestra procede de la poblacidn 5. En este caso la diferencia existente entre las proporciones p y p ha sido producida por la influencia del O azar. Cuando hiE6tesis nula es falsa significa que la muestra procede de una poblacidn 5 caracterizada por una proporcidn px desconocida, diferente de la proprocibn p. Esta hipbtesis, complementaria a la anterior, recibe el nombre de .hipBtesis alternativa. Prueba de d~cisidn La prueba es muy sencilla y est5 ilustrada en la figura 6. Las priiebas de decisi6n estadfstica están basadas en la hipdtesis nula. Si la muestra procede de la poblacidn E, la pr$ porcidn go observada en ella estara dentro del intervalo de pro - habilidad, es decir den-o del intervalo en el que se encuentran la mayor parte de las proporciones observadas en muestras de t'amaiio procedentes de la poblacidn p. Cuando la proporcidn observada po está fuera del intcr valo de probabilidad, lo mgs verosímil esque la muestra proceda de una poblaci6n px diferente de la población E. En este caso la decisidn a tomar es la de quedarse con la hipótesis alternativa. Ver si po estd dentro o fuera del intervalo de probab' lidad equivale a ver si la diferencia, en valor absoluto, entre g y po es menor o mayor que el desvfo e: - Dividiendo ambos miembros por la raiz cuadrada: Si llamamos 5 al primer miembro, se obtiene una prueba de decisidn estadística llamada prueba de comparacidn de una ~roporción observada a una proproción te6rica. ]Esta prueba, por estar basada en el intervalo de probabilidad, serd valida para muestras grandes. PRUEBA DE COMPARaCTON DE UNA PROPORCfON OBSERVADA po EN UNA MUESTRA DE TAMAWO n, A UNA PROPORCION TEORICA p z < z4 : Nada se opone en aceptar la hipdtesis nula. I z) zd : Rechazo de la hipdtesis nula con un riesgo d . Condicioncs de aplicación: La prueba es s61o vdli da para muestras grandes (np y nq mayores o igua: les a 5). Cuando la conclusi6n estadística es rechazar Ho con riesgo O(, y sólo en este caso, le corresponde la siguiente concluaiAn experimental: Si po) p podemos afirmar con riesgo d que la muestra procede de nna población px mepor que E. - S~.E>,(? poGemos afirmar con riesgo 4 que Pa muestra pr,roc.de de una población px menor que E. - Esta afirmación es evidente, ya que por ejemplo, si po es menor que e, tinto que se ha demostrado que no puede proceder de 2, es lógico qie roce da de una población caracterizada por una proporci6n px me?or que la proporción E. - Nótese que una prueba cuando concluye aceptar Ulr afirma sdlo que px es diferente de p. - Para saber en que cantidad p es mayor o menor que p, X es necesario conocer el valor px. ~stoes un problema de naturaleza diferente pero que ya ha =do estudiado: basta estimar p, a partir de p. Se trata de un problema de estimacidn que se - resuelve mediante el intervalo de confianza. Los riesgos asociados a una decisibn estadfstica Hay s610 dos posibilidades de equivocarse al tomar la decisión: Cuando se toma la decisi6n de aceptar Hl, puede ser que tio sea verdadera. Este error recibe el nombre de Error tipo 1. La probabilidad de cometer un error tipo 1 se llama riesgo* - o riesgo de primera especie. Cuando se toma la decisión de aceptar H , puede ser que H1 sea verdadera. Este error recibe el nombre de Error tipo 11. La probabilidad de cometer un error tipo 11 se llama riesgo - p o riego de segunda especie. El riesgo* es conocido y se fija a priori. En la prue ba anteriorla probabilidad de que una proporci6n observada se e' cuentre fuera del intervalo de probabilidad (zona de aceptacibn de H1l procediendo de la población e (Ho verdadera) viene dada por el valorMasociado al intervalo de probabilidad. Esta probabilidad es la que se define como riesgo o( o riesgo de primera especie. De ahP la fra~e se rechaza la híabtesis nula con rj~sqo d. Las frases se rechaza Ho al nivel de significacibnd o se rechaza Ho al nivel de confianza 1-4, son equivalentes y expresan el mismo concepto de riesgo o( . El riesgo f? es siempre desconocido. El hecho de observar una proporci6n p dentro del intervalo de probabilidad, indio ca un resultado queño esta en contradiccidn con la hipbtesis nu la, pero en ningun caso prueba que Ho sea verdadera. - En efecto, es posible que, debido a la influencia del azar, una p?!oporcibn po observada en una muestra procedente de la población px, caigrdentro del intervalo de probabilidad E Czona de no rocha20 de Ho). Esto ocurre mds a menudo cuando px tiene un valor prdximo a p. la probabilidad de que esto pase,lla mada riesgo p o riesgo de segunda especie' siempre se desconoce Ya que la proporciBn px es tambien desconocida. - Una frase equivalente a la de nada se opone en aceptar la hipdtesis nula es la diferencia encontrada no es significativa. Un estudio detallado del riesgo P se hace en uno de los siguientes apartados. Se define como Potencia de una prueba de decisión -estadística el valor 1-/3 . Si el riesgo @ indica la probabilidad de equivocarse al. aceptar Ho, la potencia es la probabilidad complementaria al reiggo p. decir la potencia caracteriza la capacidad que tiene una prueba de decisidn estadlstica.,de no equivocarse al aceptar Ho. Pruebas bilaterales y pruebas unilaterales Se aplica una prueba bilateral o prueba de dos colas cuando se tiene la hip6tesis alternativa: la población 5 es diferente de la población 5. La prueba de decisión descrita es una prueba bilateral ya que la hipbtesis alternativa (doble) era que la proporcidn px podía ser superior o inferior a la proporcibn e (p, diferenteae E). La figura 7a ilustra esta prueba para un rzsgo o( ~0.05. Cuando la hipdtesis alternatcva (simpie) es que la caracterfstica estudiada en la poblacion es gujerior a la de la poblacibn , se t~ata de una prueba unilsteral o prueba de una cola por la derecha, tal como ilustra la figura 7b. PRUEBA BILATERAL CON RIESGO ct = 0.05 Ho: PO = P Hi: PO# P Se acepta HI cuando cl valor de PO está fuera del intervalo pi fps. PRUEBA UNILATERAL CON RIESGO U .= 0.05 Hn: PO =P Hi: PO > P Se acepta Hi cuando el valor de po es mayor que p,. PRUEBA UNILATERAL CON RIFSGO ct = 0.05 Ho: PO = P HI: PO <p Se acepta HI cuando el valor de po es menor que pi. Pi P l figc1t-a 7 Cuando la hipdtesis alternativa (simple) es que la caracterfstica estudiada en la poblacion 5 es inferior a la caracterfstica de la poblacidn E, se trata de una eruet.ir unilateral por la izquierda, tal como ilustra la figura 7c para el mismo riesgo 4=0.05. Las pruebas unilaterales se diferencian de las bilaterales, entre otras razones por el hecho de que el riesgo a( está situado en uno de los dos lados, en el correspondiente a la zona de aceptacfon de H1, ya que el riesgod indica la probabilidad de que una observada procedente de E caiga en dicha zona. De ahf se dedduce (*) que para realizar una prueba unilateral basta comparar el valor & calculado en la prueba con el valor z2@ correspondiente a dos veces el riesgo fijado. La tabla 2 da los valores con que se deben comparar 2 según la prueba sea bilateral o unilateral. TABLA 2 RIESGO DE PRIMERA ESPECIE PRUEaA BILATERAL =M PRUEBA UNILATERAL z2d Actitud explicativa y actitud pragmdtica ¿En que caSos se aplica una prueba bilateral y en cudles se aplica una prueba unilateral? 108 1.65 1.28 (1 Un estudio más detallado puede verse en la obra (3) pp. 75 y sig., cuya referencia se encuentra en la bibliografLa selec* cionada. 5% 1.96 1.65 1% 2.58 2.33 t l%o 3.29 3.09 Este aspecto, poco discutido en las obras de estadística, es muy importante. Para comprenderlo se necesitan definir dos actitudes fundamentales que pueden adoptarse ante un problema experimental. Se esta en actitud explicativa cuando se tratan estadi? ticamente datos de problemas de investigación fundamental. Por ejenip10,si se elabora un nuevo método audiovisual de enseñanza 5 en investigación fundamental tan interesante e; demostrar que X es mis eficaz que un metodo de referencia A. Para analizar los datos de este experimento con actitud explicatiya, se aplicará una prueba bilateral, ya que la hipdtesis alternativa planteada es doble. Aunque el equipo de investigación a priori piense que 5 cs mds eficaz que 5, la prueba a aplicar debe ser bilateral ya que si finalizado el experimento se observara una diferencia significativa en sentido contrario, el investigador no dudard en concluir que & es mas eficaz que %. Se está en actitud pragmática cuando se tratan estadlst' camente problemas de investiaación aplicada. Continuando con el ejemplo anterior, la Dirección de un Centro de Enseñanza que emplea el curso A, para decidir la compra del curso estard sólo interesada en saber si el curso 5 es más eficaz que el A. Probar que X es menos eficaz que no le interesa en absoluto. Se trata de un problema de investigación aplicada. Para analizar los datos de este experimento, en actitud prLtgmática, se aplicará una prueba unilateral, ya que la hipótesis alternativa planteada es simple. En Psicología Experimental, las pruebas bilaterales son las más utilizadas ya que el investigador adopta una actitud explicativa ante la mayor parte de los problemas. Determinación del número de individuos necesarios para limitar el riesgo Y1 concepto dei riesgo4 y su interpretación grdfica han quedado claros con las anteriores explicacioaes. Ahora se aborda el estudio y la interpretacion grafica del riesgo P en el caso paz ticular de la prueba unihateral de comparacion de una proporcibn observada a una proporción tebrica. En caso de utilizar otras. pruebas las fbrmulas son diferentes -(*) pero los conceptos aquí definidos permanecen invariables. La prueba unilateral de comparación de una proporción observada a una proporci6n teorica, resuelve el problema esquematizado en-la figura 8. Los valores E, po, y n_ son datos conocidos. El valor px, correspondiente a iahipótesis alternativa, es siempre descozcido. La prueba consiste en ver si el valor po está dentro o fuera del intervalo de probabilidad de p. En la Sueba unilateral se trata de ver si po estd a la derecha o a la izquierda de S - Cfigura 9a). Se llegan a las siguientes conclusiones: p,gt : Nada se opone en aceptar Ho po >e : Se rechaza tio con riesgo Cuando la conclusidn de la prueba es nada se opone en (*) El problema de la determinación del número de individuos necesario, para las pruebas de decisión estadfstica m&s usudles, puede estudiarse en DOMENECH MASSONS, J. M. : 1.létodos Estadísticos para la InvestigaciÓn en Ciencias Humanas.-Herder Barcelona, 1975. . . Se obtiene: b.- En una muestra de n=233 neurdticos el cuestionario X ha diagnosticado correctamente a01 de ellos. 2tiene eficacia diferente de A? Si se acepta 4 =O. 05, aplicando (14) para comparar po=aOk/233=~. 86 con p=O. DO, se obtiene: z= (0.86-0.801/ 40.8x0.2/233 = 2.32) 1.96 Conclunib_n_~c7<&9&1~a~r Se acepta H1 con riasclo 0.05 . Conclusi6n experimens: Puesto que p = 0.86 es supeO rior a p=0.80, y la diferencia encontrada es significativa, el rendimiento de E es superior al rendimiento de 5. c.- ¿En qu6 cantidad el rendimiento del cuestionarlo 5 es superior al del cuestionario A? Basta estimar la proporcián px de diacjnosticos correctos del cuestionario E, a partir de laproporci6n p =0.86 obserO vada en la muestra de n.233 neuróticos. Aceptando un riesgo O( =p= ~0.05 y aplicando (5) se obtiene: El rendimiento de 5 esta situado entre 0.82 y 0.90, es decir el rendimiento del cuestionario 5 sera superior entre un 2 % y un 10 % respecto al rendimiento del cuestionario A. d.- Una vez demostrada estadfsticam~nte la superioridad del cuestionario 5, el Grupo de InvcstigacLón dcsea verdcrlo a un GabinetPsicológico que emplea el'cucstiondrio 5. Antes de comprarlo el Director de dicho Gabinete desea realizar un experimento para probar qlie la eficacia del cuestionario 5 es supe- rior a la del cuestionario A. ¿Cuántos individuos debe haber en la muestra? Se trata de asegurar una cierta potencia a la prueba unilateral (actitud pragmática) de comparación de una proporción cbservada a una proporción te6rica. El Director del Gabinete psicolbqico evalúa&= +0.07, ya que considera importante adoptar 5 si como mfnimo detecta un 7% mas de neurbticos que A, y acepta unos riesgos o( =o =O. 05. Sustituyendo valores en (16) se obtiene: e.- En 1.3 muestra de n=302 neur6ticos el cuestionario 5 ha diagnosticado correctamente 254. ~5 es más eficaz que Si se acepLa o( =0.05, aplicando (14) pero teniendo en cuenta que se trata de una prueba unilateral de comparación de po=254/302=0.84 con p=0.80, se obtiene: ~l valor z= 1.74 es superior a z2* =1.65 y además po= =0.84 es superior a p=0.80. Conclusión: El cuestionario g es más eficaz que el cuestionario A. VI.- BIBLIOGRAFIA SELECCIONADA (1) BONET, E: Fonaments d'Estadfstica. Teide. Barcelona, 1974 (2) DIXON-MASY: Introducci6ii al andlisis ostadfstico. Castillo. Madrid, 1966 (3) DOMENECH MASSO~S, J.M. : Métodos Estadísticos para la Investigacibn en Ciencias Humanas. ~erder . Barcelona, 1975.