Estimación bootstrap con datos secuenciales
Abstract
En esta memoria proponemos como alternativa la aplicación de métodos Bootstrap para la estimación con datos secuenciales. Para ello realizaremos una revisión de los procedimientos bootstrap para diseños de tamaño fijo y se consideran también algunas cuestiones acerca de los desarrollos de Edgeworth a través de los cuales se muestra cómo las aproximaciones bootstrap pueden mejorar las normales. Particularmente interesante es el estudio de la consistencia de los procedimientos bootstrap basada en la métrica de Mallows. Tras una revisión del procedimiento de construcción de intervalos de confianza basado en la dualidad test de hipótesis e intervalos de confianza, analizamos las propiedades de la distribución empírica b.
Full text
UNIVERSIDAD DE LAS PALMAS DE GRAN CANARIA DEPARTAMENTO DE MATEMÁTICAS TESIS DOCTORAL ESTIMACIÓN BOOTSTRAP CON DATOS SECUENCIALES MARÍA DEL PINO QUINTANA MONTESDEOCA UNIVERSIDAD DE LAS PALMAS DE GRAN CANARIA, 2003
DON PEDRO SAAVEDRA SANTANA, Catedrático de Universidad del Área de Conocimiento de Estadística e Investigación Operativa del Departamento de Matemáticas de la Universidad de Las Palmas de Gran Canaria y DON ANGELO SANTANA DEL PINO, Titular de Universidad del Área de Conocimiento de Estadística e Investigación Operativa del Departamento de Matemáticas de la Universidad de Las Palmas de Gran Canaria, CERTIFICAN: Que la presente memoria titulada ESTIMACIÓN BOOTSTRAP CON DATOS SECUENCIALES ha sido realizada bajo la dirección de ambos por la Licenciada en Matemáticas (Especialidad de Estadística e Investigación Operativa) Doña María del Pino Qmntana Montesdeoca, y constituye su Tesis para optar al grado de Doctora en Matemáticas. Y para que así conste, en cumplimiento de la legislación vigente y a los efectos oportunos a que haya lugar, firmamos la presente en Las Palmas de Gran Canaria, a 4 de abril de dos mil tres. FDO.: PEDRO SAAVEÓFJÁ SANTANA FDO.: ÁNGEL TANA DEL PlNO FDO.: M^ DEL PINO QUINTANA MONTESDEOCA
Es mi deseo expresar al profesor Dn D. Pedro Saavedra Santana y al profesor Dr. D. Angelo Santana del Pino mi más sincera gratitud por la entrega, entusiasmo, dedicación, apoyo j tiempo invertido en la dirección de esta memoria. Sus valiosas aportaciones, enseñant^as, consejos y críticas asi como sus palabras de ánimo han hecho posible la consecución de este trabajo. Este agradecimiento lo hago extensivo a mis compañeros del Departamento de Matemáticas, en especial a los profesores Juan José Gon^iále:^ y Carmen Nieves Hemánde;^ por su apoyo, ayuda y entrega en las tareas de investigación comunes. A Euciapor su ánimos de día a día, a Eduardo, a Kodri, a Nicanor y a muchos más que tengo en mi pensamiento. Quiero dar las gracias también a mis amigos, a mis padres, a mi Juan por su apoyo y comprensión y, en especial a mi hermana Juana Teresa por haber estado a mi lado en todo momento.
A mi hermana
índice Prólogo i Capítulo 1. Contrastes secuenclales 1.1. Introducción. 1 1.2. Desarrollo histórico de los métodos secuenclales. 3 1.3. Visión general de los procedimientos secuenclales. 5 1.4. Test de razón de versosimilitud secuencial: Identidad de Wald. 8 1.5. Plan secuencial truncado. 14 1.6. Plan secuencial restringido. 18 1.7. El test triangular de Whitehead. 19 1.8. Doble test triangular. 23 1.9. Contrastes secuenclales basados en la realización repetida de contrastes de significación: Contrastes RST bilaterales. 1.10. Métodos RST basados en la función del gasto o consumo de la probabilidad de error de tipo I: Contrastes bilaterales. 25 38 Capítulo 2: El bootstrap con diseños de tamaño fijo 2.1. Introducción. 45 2.2. Distribución de remuestreo. 46 2.3 El bootstrap en la regresión. 50 2.4. El bootstrap y los desarrollos de Edgeworth. 51 2.5. Consistencia del bootstrap mediante las métricas de Mallows. 53 Capítulo 3. El bootstrap en diseños secuenclales. 3.1. El problema de la inferencia con datos secuenclales. 59 3.2. Métodos basados en la dualidad test de hipótesis-intervalo de 60 confianza.
3.3. Distribución empírica en diseños secuenciales. 62 3.4. Aproximación bootstrap con datos secuenciales para la media de una distribución. 3.5. Aproximación bootstrap con datos secuenciales para proporciones. Capítulo 4. Aplicaciones a tres estudios biomédicos 4.1. Evaluación de la efectividad del recubrimiento de catéteres con antibióticos. 4.2. Evaluación de los genotipos HLA como predictores de la diabetes 4.3. Evaluación de un marcador basado en ultrasonidos como predictor de la osteoporosis. 92 95 97 Bibliografía. 101
Prólogo El análisis de poblaciones requiere a menudo seleccionar muestras representativas de las mismas a partir de la cuales puedan realizarse inferencias válidas para todo el conjunto poblacional. Cuando en un estudio, el número de elementos de la muestra es fijado a priori y por tanto independiente de los datos observados, se dice que el estudio es de tamaño fijo. Las técnicas aleatorias de muestreo unidas a un tamaño muestral suficiente permiten que la muestra represente adecuadamente a la población de referencia. Esta representatividad es necesaria para la validez de los procedimientos inferenciales. Sin duda, la mayor parte de los procedimientos de análisis estadístico de datos está desarrollada para diseños de tamaño fijo. Es posible que esto se deba originariamente al influjo de R. Fisher, quien realizó una notable contribución a la formulación y desarrollo de los métodos clásicos de estadística inferencial y de análisis de datos. Durante varios años estuvo a cargo del diseño de experimentos y el análisis de datos en la estación agrícola experimental de Rothamsted (Londres). Allí desarrolló los modelos del análisis de la varianza en el contexto de experimentos agrícolas. La naturaleza de estos estudios era tal, que los tratamientos a comparar se asignaban de modo simultáneo a las unidades muéstrales (parcelas), siendo también simultánea la recolección de datos y el análisis de los mismos. Tal característica de simultaneidad es la regla en la mayor parte de los estudios experimentales (químicos, biológicos, industriales, etc.). Los estudios observacionales, a pesar de presentar dificultades que en los experimentales pueden ser obviadas, participan generalmente de esta característica de simultaneidad. En los ensayos clínicos sin embargo, la caracteristica de simultaneidad es más la excepción que la regla. Habitualmente, la incorporación de pacientes en los ensayos clínicos se realiza de forma lenta, siendo frecuente que haya datos disponibles para el análisis cuando sólo se ha incorporado al mismo una pequeña proporción de los previstos para la totalidad del ensayo. ¿Qué
hacer si un análisis intermedio de éstos evidencia que uno de los tratamientos es superior al resto?. El principio ético ñindamental en el ejercicio de la medicina consiste en ofertar a cada paciente el mejor tratamiento posible para su enfermedad. La aleatorización en un ensayo clínico (asignar al azar los diversos tratamientos evaluados en el curso del ensayo) podría ser éticamente dudosa salvo que haya incertidumbre acerca de cual es el mejor tratamiento. Un nuevo tratamiento puede ser muy prometedor, pero también podría producir efectos adversos graves que habría que determinar en el curso del estudio. Si un análisis intermedio de datos pone claramente de manifiesto la superioridad de alguno de los tratamientos comparados, los investigadores deberían detener el ensayo y ofertar a todos los pacientes el tratamiento que se haya revelado superior. Esto significa que, cuando se prevé lentitud en la incorporación de pacientes al estudio, podría ser aconsejable establecer en el protocolo del ensayo la realización de análisis intermedios (looks) con grupos de datos (generalmente del mismo tamaño) que pudieran conducir a una finalización del ensayo antes de alcanzar el tamaño muestral inicialmente previsto. Cualquier diseño de este tipo recibe el nombre de diseño secuencial. Parece claro que una de las ventajas es la posibilidad de concluir el estudio reduciendo el tamaño muestral. En un estudio de diseño secuencial pues, el tamaño muestral es una variable aleatoria la cual recibe el nombre de regla de parada. En general, éste depende de los datos que sucesivamente van observándose. Habitualmente la regla de parada está determinada por un contraste de hipótesis. Así por ejemplo, en un ensayo con dos grupos paralelos, cuyo objetivo es decidir si la tasa de respuestas favorables de un tratamiento experimental es superior a un control, podríamos cada vez que se incorporan Im nuevos pacientes {m por brazo de tratamiento), contrastar si alguno de los tratamientos es significativamente superior al resto. En caso de que así fuera, el ensayo se detendría. Aquí por tanto, la regla de parada está marcada por los sucesivos contrastes. Cualquier investigador familiarizado con los contrastes de hipótesis sabe perfectamente que 11
si se aplica reiteradamente un test con significación nominal a, la significación global del contraste es superior (o muy superior) al a fijado. Por tanto, los contrastes secuenciales requieren una metodología específica que garanticen la significación prevista. En el primer capítulo de esta memoria veremos que, para una significación y potencia especificada, el tamaño muestral esperado para un test secuencial es generalmente menor que el requerido para el contraste análogo de tamaño fijo. La aproximación secuencial ha estado presente a lo largo de la historia de la experimentación. Los trabajos de Huyghens, BemouUi, DeMoivre, Laplace y otros sobre sistemas de juegos pueden considerarse precursores de los métodos secuenciales. La teoría moderna de análisis secuencial se debe a A. Wald y a G. Bamard, quienes habían participado en grupos consultivos industriales para la producción y desarrollo de armamento desde 1943 y durante la Segunda Guerra Mundial. Sin duda, el trabajo más relevante fiae el de Wald (1947) relacionado con el test secuencial de razón de probabilidades (SPRT). Armitage (1954, 1958, 1975) y Bross (1952, 1958) ñieron pioneros en el uso de los métodos secuenciales en el campo de la medicina, especialmente en los ensayos clínicos comparativos. Sus trabajos no tuvieron inicialmente una buena aceptación, debido a que no eran prácticos para la continuación del estudio. Aquí es donde posiblemente radica la mayor dificultad de los diseños secuenciales, a saber: la validez de los datos obtenidos para realizar inferencias sobre los parámetros de los modelos. En los diseños de tamaño fijo se busca que la muestra seleccionada sea un reflejo razonable de la población de referencia. Esto significa que las distribuciones de las variables a nivel poblacional se transmitan aproximadamente a la muestra. Así por ejemplo, si el 20% de una población es hipertensa, una muestra representativa de ésta debe garantizar que la prevalencia de hipertensión en la muestra sea aproximadamente de esa magnitud. En muchos estudios, el tamaño muestral se determina en orden a garantizar, con una cierta probabilidad, que el error máximo en la estimación de un parámetro de interés sea menor que una cota especificada por el investigador. Una muestra aleatoria, con tamaño 111
Estimación bootstrap con datos secuenciales de parada que indica, tras cada inspección, si se puede tomar ya una decisión y por tanto se puede terminar el proceso, o si por el contrario, se debe continuar reuniendo información. Existen numerosas e importantes razones para recurrir al proceso de toma de datos y análisis de resultados de manera secuencial. Un claro ejemplo de ello son las consideraciones éticas que se suscitan en el contexto de los ensayos clínicos destinados a la comparación de tratamientos alternativos para una determinada enfermedad. En estos ensayos, frecuentemente, los pacientes se incluyen en el estudio a lo largo de un periodo de tiempo tan dilatado, que se llega a disponer de resultados de los primeros pacientes cuando aún no se ha completado el tamaño muestral previsto para todo el ensayo. Tales datos podrían aportar suficiente información para confirmar la superioridad de uno de los tratamientos evaluados, por lo que no sería éticamente justificable asignar a ninguno de los siguientes pacientes al tratamiento que se ha revelado como el menos eficaz. Los procedimientos secuenciales resultan también de interés desde el punto de vista económico. Así ocurre, por ejemplo, en estudios de control de calidad cuando la inspección supone la destrucción de la unidad muestral, en cuyo caso interesa finalizar el muestreo lo antes posible, sobre todo, si es evidente que el lote va a ser aceptado. En este sentido, es de destacar que el análisis secuencial permite reducir el número medio de datos requeridos en la realización del contraste respecto al diseño de tamaño fijo, para un mismo nivel de significación y una potencia dada para una alternativa especificada. Otro aspecto de interés en el uso de procedimientos secuenciales es el administrativo, dado que el realizar análisis intermedios permite asegurar que el experimento se está ejecutando como se había planificado. Además, la pronta disposición y análisis de los primeros resultados del experimento permiten comprobar las suposiciones realizadas al diseñar el ensayo o experimento, lo que permite advertir y, en su caso, corregir aspectos que no se tuvieron en cuenta al iniciar el mismo.
Contrastes secuenciales Los métodos habituales de la inferencia estadística, contrastes de hipótesis y estimación de parámetros, desarrollados para diseños con tamaño de muestra fijo no resultan adecuados en un procedimiento secuencial en el que se realizan exámenes sucesivos de los datos acumulados y existe la posibilidad de la finalización anticipada del mismo, o de algún cambio en su diseño original. A las dificultades que ya per se presenta la realización reiterada de contrastes de significación en los sucesivos instantes de inspección, se une la presencia de reglas de parada que dependen de los datos observados y que dan lugar a que los tamaños muéstrales de los diseños secuenciales sean aleatorios, lo que modifica las propiedades de los estimadores, en particular introduciendo sesgos en los mismos. El uso en este contexto de métodos pensados para diseños de tamaño fijo conduce a una mala evaluación de los niveles de significación y potencia y por tanto a una incorrecta interpretación de los resultados. Los métodos estadísticos concebidos específicamente para tener en cuenta las inspecciones sucesivas de los datos a lo largo de un estudio se engloban bajo el término análisis secuencial. Algunos autores reservan este término para estudios en que se realiza un análisis de datos {análisis intermedio) cada vez que se dispone de una nueva observación, y utilizan el término análisis secuencial en grupos cuando los análisis intermedios se realizan tras cada grupo de m observaciones {m>\). 1.2. Desarrollo histórico de los métodos secuenciales. La teoría clásica del diseño experimental trata básicamente con experimentos cuyo tamaño de muestra es fijo, posiblemente porque los pioneros en la materia, particularmente R. A. Fisher, trabajaron en la investigación agrícola, donde los resultados de un ensayo se obtenían bastante tiempo después de que el experimento se hubiera diseñado e iniciado. En este sentido, resulta
Estimación bootstrap con datos secuenciales interesante preguntarse cómo habría evolucionado la estadística teórica si Fisher hubiera trabajado en investigación médica o industrial. Gran parte de la metodología estadística utilizada en el diseño y análisis de ensayos clínicos, tiene su origen en principios desarrollados en el contexto de ensayos agrícolas durante los años veinte. Una de las diferencias importantes entre éstos y los ensayos clínicos se encuentra en la naturaleza de la acumulación de los datos. En el campo de la agricultura un ensayo se rige por el patrón natural de las estaciones. El ensayo se diseña, los datos muestran la evolución del crecimiento de los cultivos, que son recolectados simultáneamente, con lo cual en el momento de realizar el análisis ya están disponibles todos los datos pertinentes. Si resulta insuficiente la información para aportar una clara conclusión, entonces se planea un nuevo experimento para la próxima estación. Por el contrario, los datos de un ensayo clínico se acumulan gradualmente durante un periodo que puede llegar a durar meses o años, con lo que los resultados de los primeros pacientes incluidos para el estudio pueden estar ya disponibles para la interpretación mientras aún se continúa incluyendo pacientes en el estudio y asignándoles aleatoriamente uno de los tratamientos. Otro campo en el que el análisis secuencial ha jugado un papel importante es el control estadístico de la calidad, cuyo inicio data de 1924 cuando ingenieros norteamericanos de la Bell Telephone se ocuparon de diseñar un procedimiento para detectar unidades defectuosas en el proceso industrial. El objetivo inicial del control estadístico de la calidad fue la detección de estas unidades, bien para su desecho bien para su reciclaje pero, en cualquier caso, para impedir que una unidad mal fabricada pudiera incidir negativamente en la fabricación de otras piezas, si era una unidad componente, o en el grado de satisfacción del cliente, si se trataba de un producto final. En este sentido, una pieza defectuosa representaba para la empresa un coste adicional que necesitaba ser controlado. Para ello, se procedía mediante un plan de inspección con muestreo secuencial, basado en el Test Secuencial de Wald (1947) cuyo tamaño de muestra, en principio una variable aleatoria, quedaba fijado bien cuando el lote se aceptase, bien cuando
Contrastes secuenciales fuese rechazado. Con el tiempo, el control de calidad ha dejado de ser exclusivo de los procesos industriales, inundando el mundo de los servicios. En este sentido, instituciones financieras, universidades, hospitales, etc., han integrado este tipo de control como un medio más que permita contribuir a garantizar un nivel de calidad de manera continua. La teoría moderna del análisis secuencial surge con los trabajos de Abraham Wald (1947) en Estados Unidos y de George Bamand (1946) en Gran Bretaña, quienes participaron como asesores en grupos de investigación industrial para el desarrollo y producción de armas, desde 1943, y durante la Segunda Guerra Mundial. En particular, el trabajo desarrollado por Wald (1947) sobre el Test de Razón de Verosimilitud Secuencial se convirtió en la herramienta de referencia para el posterior desarrollo de los procedimientos secuenciales de análisis de datos. 1.3. Visión general de los procedimientos secuenciales. Si bien, como hemos visto, son muy variados los campos de investigación en que los métodos estadísticos secuenciales resultan de aplicación inmediata vamos a centramos, para fijar ideas, en el campo de los ensayos clínicos. En este contexto, uno de los problemas más usuales es el de comparar un nuevo tratamiento para una enfermedad (tratamiento experimental) con un tratamiento preexistente (control). Normalmente esta comparación se concreta en la construcción de un modelo estadístico de las respuestas de los pacientes, dependiente de un parámetro de interés 6 que mide la diferencia en eficacia entre ambos tratamientos. El problema fundamental puede plantearse como un contraste de la hipótesis nula 11^:0 = 0 de que ambos tratamientos son equivalentes frente a la alternativa de que existen diferencias entre ambos, H^.ditQ. Frecuentemente, la hipótesis alternativa que se desea poner a prueba es //j : ^ > O, que el tratamiento experimental sea superior al control.
Estimación bootstrap con datos secuenciales Los métodos de análisis secuencial se basan en el uso de dos estadísticos, que denominaremos Zk e Ik que miden, respectivamente, la ventaja del tratamiento experimental sobre el control en el ^-ésimo instante de inspección, y la cantidad de información sobre el parámetro 9 disponible en ese momento. En cada instante de inspección, la regla para decidir si HQ debe aceptarse o rechazarse (y por tanto parar el procedimiento), o bien si debe continuarse con la toma de datos se construye siguiendo alguna de las dos siguientes aproximaciones: • Métodos basados en el establecimiento de barreras en el plano {Z,l): los sucesivos valores de los estadísticos Zk e h se van representando en el plano {Z,l); mientras se mantengan dentro de ciertas fronteras predefinidas, la toma de datos continúa. Cuando se alcance alguna de las barreras, el procedimiento se detiene, decidiendo por Ho o H\ según cuál sea la Irontera rebasada. Estos métodos, entre los que cabe citar el procedimiento secuencial abierto, el restringido y el test triangular de Whitehead se derivan del test de razón de verosimilitudes secuencial original de Wald (1947). • Métodos basados en la realización repetida de contrastes de significación. Según que la cantidad de información (número de datos) disponible en cada inspección pueda prefijarse o no de antemano podemos agrupar estos métodos en dos categorias: - Métodos con niveles de información predefinidos: estos métodos predeterminan el número máximo K de inspecciones que se van a realizar a los datos, así como el número m de datos que se debe observar cada vez. En la A:-ésima inspección se realiza un contraste de significación con un nivel de significación nominal «Jt. El haber fijado de antemano el valor de K permite elegir los valores de los ak de forma que se garantice un nivel de significación a global, también predeterminado. El valor de m se elige para garantizar una potencia especificada 1-/3 para alguna alternativa de interés 0=S. Existen muchas formas de elegir los <%, lo que da lugar a numerosos
Contrastes secuenciales contrastes en esta categoría, entre los que podemos citar el de Pocock, O'Brien & Fleming y Wang & Tsiatis, - Métodos con niveles de información arbitrarios: dada la naturaleza de muchos ensayos clínicos (y de otros procedimientos de muestreo secuenciales) a veces es difícil, o imposible, a priori determinar cuál va a ser el número máximo de inspecciones que se va a poder realizar; o cuáles van a ser los números de datos disponibles en las sucesivas inspecciones. Cuando el nivel de información que va a estar disponible en cada inspección es impredecible, los métodos secuenciales más apropiados son los basados en Xas funciones de gasto del error tipo I. Suponiendo que /max es la cantidad máxima de información que eventualmente se podría llegar a alcanzar durante el desarrollo del procedimiento secuencial, la función de gasto a{t) representa el nivel de significación que se alcanzaría si el método secuencial terminase cuando la cantidad total de información acumulada a lo largo del mismo es una proporción t de /max.. Si a es el nivel de significación que se desea alcanzar en el ensayo, la fiinción a{t) debe ser creciente desde O en t=Q hasta oren t=\. De esta forma, a[t) es el nivel de significación que se emplea (se gasta) en una inspección en que se ha conseguido reunir una proporción t de la información máxima posible para todo el procedimiento. Una vez que el ensayo se pone en marcha, en la késima inspección se calculan t y el correspondiente nivel de significación a{t). Son posibles muchos perfiles para esta función. Así, por ejemplo, dado que cuanto más pequeño sea el valor de a{t) más dificil será rechazar HQ, funciones de gasto que tomen valores muy pequeños cuando t es pequeño hacen muy dificil rechazar HQ cuando hay poca información. Cada uno de estos métodos tiene sus ventajas e inconvenientes. Con las convenientes adaptaciones permiten contrastar hipótesis bilaterales o unilaterales. Cuando la hipótesis nula es falsa, el número de inspecciones requeridas hasta rechazarla es menor que en un diseño con muestra de tamaño fijo. A su vez.
Estimación bootstrap con datos secuenciales existen también versiones de estos contrastes que permiten aceptar relativamente pronto la hipótesis nula en caso de ser cierta. En general, en los contrastes secuenciales, y esta es su principal ventaja, los tamaños de muestra hasta la terminación del procedimiento (y la consecuente aceptación o rechazo de Ho) son, en media, inferiores al tamaño de muestra que se necesitaría en un diseño de tamaño fijo con un nivel de significación y potencia equivalentes. Como contrapartida, el tamaño de muestra máximo puede ser superior al del diseño de tamaño fijo, por lo que habrá de valorarse adecuadamente la posibilidad de que el test secuencial proceda hasta alcanzar su tamaño máximo. En cada caso, el investigador habrá de evaluar su problema particular (con los condicionantes extemos al mismo en cuanto a la facilidad con que se pueden o no alcanzar los sucesivos tamaños muéstrales en cada inspección, y los momentos en que éstas pueden llevarse a cabo), y los pros y contras de cada uno de estos métodos para elegir el más adecuado a su caso. 1.4. Test de Razón de Verosimilitud Secuencia!. Identidad de Wald. Fue Abraham Wald quien introdujo la expresión análisis secuencial hacia principios de los años cuarenta. En sus trabajos describe una nueva técnica para contrastar una hipótesis nula simple fi-ente a una alternativa simple, consistente en tomar unidades, una tras otra, de una muestra de tamaño aleatorio y (utilizando la razón de verosimilitudes) decidir si la información disponible en cada momento resultaba suficiente para clasificar la densidad de la población en una de dos categorías, o si por el contrario se requería observar una nueva unidad de la muestra. El método propuesto permite controlar el error de tipo I así como la potencia del procedimiento de contraste, y al estar basado en el Test de Razón de Verosimilitudes de Neyman-Pearson recibe el nombre de test de razón de verosimilitudes secuencial {SequentialProbability Ratio Test: S.P.R.T).
Contrastes secuenciales Para ilustrar la idea de este test, consideremos la familia de funciones de densidad f¡[x); i = \,l y el contraste de hipótesis HQ-.X-/^ frente a H^-.X-fiPara la secuencia de observaciones X^,---,X„, no necesariamente independientes*, definimos el cociente: i=ux)=j"^^f"'^;l (1.1) y el SPRT tiene la forma: Aceptar H^ si Á„ < A, rechazar H^ si Áf, > B y tomar una nueva observación si /l„ e {A,B), siendo A y B constantes especificadas. De modo que, la regla de parada tiene la forma N = min|«; Á„ g {A,B)j. Los valores A y B pueden obtenerse fijando la significación y potencia del test. En efecto, sea: B„={{x„-,x„);Á.^{A,B),r = l,-,n-\;Á„>B] entonces a=P,{A^>B) = f^P,{N=n,\>B) = f^\f,„{x„-,x„)cix,-dx„ n=l B •O «=1 B ti b Análogamente, sea A„ = j(jCj,...,xJ ;A, G {A,B),r^\,---,n-V,?i„ < Jl] . Se tiene pues: * Identidad de Wald.
Estimación bootstrap con datos secuenciales n=l n=\ A„ ^AY,foM^-,x„)dx,-dx„= A-P,[X^<Á)^ A-{\-a) Se obtiene, entonces, que Ay B deben satisfacer las expresiones: a<U\-P) , P<A{\-a){\.2) (1.2) y donde se ha supuesto que 2^^(^=«)=2^ J fi„{x^,--;x„)ck^---dx„=\, con /=0,1, esto es, la regla de parada es finita con probabilidad uno. Si las trayectorias del proceso {A„,«£N] fiiesen continuas y N < <>°, obviamente ^r^-A ó ^i^=B. En tal caso, las desigualdades (1.2) serían exactamente igualdades. De este modo: a = i^; l-/? = ^íl^ (1.3) B-A ^ B-A ^ ^ En el caso particular de que X,, • • •, X„, sean independientes e idénticamente distribuidas, podemos expresar (1.1) como: A„=n^íw (1.4) y definiendo, entonces Z^,--,Z^ son también variables aleatorias independientes e rt idénticamente distribuidas, siendo log/í.„(X) = Vz, =R„. 1=1 10
Contrastes secuenciales En este caso, en términos de R„ el SPRT puede expresarse como sigue: En n cada etapa se calcula R„ = ¿^ ^i; entonces si log A = a<R„ se acepta HQ, si 1=1 log 5 = 6 > i?„ se rechaza, ysia<R„<bse toma una nueva observación Z„+i. Rn b a * (l,^i) 1 * (2,«2) 2 Rechazar Ho * {n,R„) Aceptar HQ n ... b _ a La sucesión de variables aleatorias {7?„;«e N} constituyen un recorrido aleatorio, con 7?„ = i?„_, + Z„, en el cual ay b son barreras absorbentes. Luego, si el SPRT termina con probabilidad uno, entonces a = Po (Rechazar//Q) y l-y5 = i^(Rechazar//o) son las probabilidades de que se produzca la absorción cuando la partícula tiene una posición Rn ^ b. Si bien hemos construido aquí el SPRT para contrastar hipótesis simple frente a alternativa simple, resulta sencillo adaptarlo para el contraste de hipótesis unilaterales del tipo HQ:0<>0Q frente a H^-.dyd^. Teniendo en cuenta que la probabilidad de decidir a favor de //o es máxima para 6 = 0^, será suficiente con especificar la significación para ^ = ^^, y la potencia \-P{d^) para la alternativa d = d^>df^. Sobel & Wald (1949) prueban que el SPRT resulta óptimo también para contrastes unilaterales en el caso de la familia de distribuciones uniparamétricas de tipo exponencial. Una de las propiedades más interesantes del SPRT es que el muestreo finaliza con probabilidad uno, tal y como se establece en el siguiente resultado: 11
Estimación bootstrap con datos secuenciales Señalemos, por último, que la introducción del concepto de nivel de información 4 permite que estos contrastes puedan generalizarse para su uso no sólo en diseños secuenciales en que las observaciones se van tomando una a una, sino para diseños en que las observaciones se van tomando en grupos. 1.6. Plan Secuencial Restringido. El SPRT y el Plan Secuencial Truncado pueden adaptarse fácilmente a contrastes bilaterales de la forma HQ:6 = 0Q frente a H^:0^6(^,áQ modo que se alcancen unos objetivos de nivel de significación y potencia predeterminados. Sin embargo, en caso de rechazar HQ, el test no nos dice nada del sentido de la diferencia. Sin embargo hay ocasiones, por ejemplo, cuando se comparan dos tratamientos experimentales en un ensayo clínico, en que es importante decidir no sólo si son o no equivalentes, sino cuál de ellos es mejor. El plan secuencial restringido permite la realización del test bilateral mediante la realización de dos contrastes unilaterales, cada uno de ellos con una potencia prefijada 1-yapara la alternativa correspondiente. Al igual que el test truncado, presenta también una cota superior para el tamaño máximo de la muestra. Si, como en el caso anterior, K es la inspección en que se alcanza el tamaño máximo de muestra, la regla de parada para este test es la siguiente: Mientras k<K, si Sk > a + b-Ik se para y se acepta que 0>do; si Sk<-ab-Ik se para y se acepta que d< do; si a - bik < Sk < -a + b-h se para y se acepta Ho:0=0o; en otro caso se continúa hasta la siguiente inspección. Cuando k = K, si Sk > a + bh, se para y se acepta que 9>do; si Sk <-a - bIk, se para y se acepta que 6< do; en otro caso se para y se acepta Ho. 18
Contrastes secuenciales Gráficamente: 1.7. El test triangular de Whitehead Este es un contraste unilateral cuyos orígenes se encuentran en el contraste secuencial de H^.d-Q frente a H^:0>0 cuando se considera que la trayectoria del proceso S es continua. Las cotas superior e inferior para el contraste así definido quedan determinadas por las rectas: M(/)= — log 1 \ v2ay + —/, l(I)=—log — +—/, 4 ^' d \2a) 4 (1.13) siendo O < / <Í8/^^ jlog(l/2cir), y el procedimiento secuencial termina en el instante en que, por primera vez, la trayectoria supera la cota superior, S{]) > u(I), o queda por debajo de la cota inferior, S(T) < 1(1). Puesto que el proceso es continuo, la primera condición que se cumpla lo hará con igualdad, y por lo tanto el contraste finaliza rechazando Ho si S(T) = u{I) y aceptando si 5(7) = /(i). 19
Estimación bootstrap con datos secuenciales Gráficamente: (a/c, 2a) donde a ={2/S)\og{l/2a) yc^ S/4. El contraste así descrito fue desarrollado por Lorden (1976), que lo llamó 2-SPRT, y probó que con las cotas que se han definido, y considerando que las trayectorias del proceso S(I) pueden observarse de modo continuo, el nivel de significación es a y la potencia para ^ =í5^es exactamente \-a. Posteriormente, Whitehead & Stratton (1983), haciendo uso de un resultado debido a Siegmund (1979, 1985) y considerando que el proceso S(I) puede aproximarse mediante un movimiento browniano, adaptaron este contraste a la situación mucho más realista de que las trayectorias del proceso S{I) sólo pueden ser observadas en instantes discretos. Para ello realizan una corrección en las cotas que definen el contraste, consistente en restar el valor esperado del salto que podría producirse en el movimiento browniano durante el tiempo en que éste no está siendo observado. Dicho valor, entre las inspecciones ^-1 y A: viene dado por 0.583^4 ~h-i • De esta forma el efecto neto de esta corrección es un acercamiento mutuo de las cotas superior e inferior, que adoptan una forma que recuerda a un árbol de navidad. Con esta modificación de las cotas el test triangular de Whitehead adopta la forma: Tras laj-ésima inspección, j = \^ ",K-\: - Si Sj >uj = a + cij - 0.583 J7~-7~7, ^l contraste se para, y se rechaza HQ. 20
Contrastes secuenciales — Si Sj < Ij = -a + 3clj + 0.583 J/^ ~ ^/-\ > ^^ contraste se para y se acepta Ho - En cualquier otro caso, se continúa con la inspección j+1. • Si se alcanza la K-ésima inspección y SK ^ UK se rechaza Ho; en caso contrario se acepta Ho. Gráficamente: Whitehead demuestra que las probabilidades de que el proceso Sj observado en tiempo discreto alcance las cotas corregidas, son aproximadamente las mismas de que el proceso en tiempo continuo alcance las cotas sin corregir, conservándose así los niveles de significación y potencia de aquel caso. En el supuesto particular de que los niveles de información considerados estén igualmente espaciados, siendo IK = /max, entonces Ij = (j/K)ImaK, en elj-ésimo análisis, con j=\, ',K. Las cotas superior e inferior para Sj serán ahora, respectivamente, sin más que sustituir en las expresiones anteriores: 2ÍJ-Vo.58r&+^-^/„ M, = — log. '--|-(¿) K 4 K + 0.583j^ +—-^4^ 21
Estimación bootstrap con datos secuenciales Si tenemos en cuenta que las cotas coinciden en el último análisis, esto es UK=IK, igualando las dos expresiones anteriores para7=Á" y despejando /max, se obtiene: /4-0.583' „, /n.^'^'^^^ • + 81og , 5' Así pues, fijados ay K, se puede obtener el valor /max y a partir de él los valores de las cotas anteriores Ujy Ij, j=\,'' ',K, de tal forma que para el contraste unilateral de HQ:0 = O con K análisis, se alcanza un nivel de significación aproximadamente igual a a y una potencia aproximada de I-a para una alternativa 0-0. Whitehead & Stratton (1983) generalizan el problema para contrastes con significación a, en ^=0 y una potencia 1-y^en O =ó, cuando a^/3. Para ello, en primer lugar observan que un test de tamaño fijo con nivel de significación a y potencia l-/3en 0=ó tiene potencia \-aen 0=(^S, siendo 20)-'(1-a) Como las curvas de potencia para los test de tamaño fijo y para los test secuenciales en grupos son muy próximas, si el test triangular se construye como antes, pero utilizando ahora 5 = ^5 en lugar de ^en la fórmula de /max, se obtiene un test cuya potencia es aproximadamente X-fi^n 6=5. Cuando los incrementos de información entre inspecciones son desiguales (situación bastante común en los ensayos clínicos, en que ocurre que el número de sujetos finalmente observados en cada inspección puede llegar a diferir notablemente de lo planificado al comienzo del ensayo) el test de Whitehead permite mantener aproximadamente los niveles de significación y potencia especificados al comienzo del ensayo. 22
Contrastes secuenciales Una característica fundamental del Test Triangular es que sólo requiere de cálculos elementales para determinar los valores de las cotas y, sólo con ello, dicho contraste consigue satisfacer con bastante precisión, y bajo secuencias de información bastante generales (Jermison & TumbuU, 1999), los requerimientos preestablecidos sobre las probabilidades de ambos tipos de error. Los procedimientos secuenciales basados en el uso áe funciones del gasto o consumo de la probabilidad de error, que veremos posteriormente, se comportan mejor que el test triangular ante incrementos muy desiguales en el nivel de información entre inspecciones, pero como contrapartida requieren del apoyo de técnicas de cálculo numérico para obtener los sucesivos valores de las cotas. Asimismo, debemos indicar que el test Triangular no conduce a obtener la mejor reducción posible en el tamaño de muestra esperada, debido a que su tamaño de muestra máximo es bastante alto, ya que el tamaño muestral final requerido por el test depende del patrón de tamaños de muestra que se vaya observando en los sucesivos análisis intermedios. En este sentido, los ya citados contrastes basados en el consumo de la probabilidad de error tipo I necesitan menores tamaños medios de muestra. 1.8. Doble Test Triangular. Del mismo modo que en el caso del Plan Secuencial Restringido, es posible adaptar el test triangular para realizar un contraste bilateral de la hipótesis //()•. ^ = ^0, que permita además decidir unívocamente entre las dos alternativas ^>Oy^<O.El parámetro 6 podría medir, por ejemplo, la diferencia entre un tratamiento experimental y un control, e interesaría saber si el experimental es significativamente mejor o peor que el control. Whitehead & Stratton (1983), y posteriormente Whitehead (1997), consiguen este objetivo mediante la construcción del contraste doble triangular. Éste se compone de dos tests triangulares diseñados para contrastar la hipótesis nula //„: ^ = O, cada uno de ellos con una significación od2; el primero de dichos contrastes tiene como alternafiva H^:d>Q, con potencia 1-yffen 6 =+5; para el segundo, la alternativa 23
Estimación bootstrap con datos secuenciales es H^:6<0, siendo su potencia también l-y^ en 6=-d. Las inspecciones continúan hasta que ambos contrastes hayan llegado a una conclusión, rechazando HQ si ambos contrastes han rechazado O = Q y aceptándola en otro caso. Este contraste tiene la ventaja adicional de que si HQ es cierta, dicha hipótesis se aceptará relativamente pronto. En términos de los estadísticos Score, Sj conj =1," ',K, y utilizando niveles de información igualmente espaciados, el contraste triangular unilateral de ^ = O frente a ^> O tiene como cotas superior e inferior para Sj, en eiy-ésimo análisis: w =-=-log o /. =-4iog Í-V (-] 0.583. ^max ^ ^ J J K 4 K " + 0.583 J^ + —-^7„ V ^ 4 K " siendo ^= 20-'(\-c(/2)S/[(^-\\-a/2)+^-'i\-j3)] y donde: Jmax '^--(¿)- 2 0.583 4K J_ Asimismo, las cotas superior e inferior del contraste 0= Q frente a ^< O se obtienen de modo análogo como l'j = -Ij y Uj = -Uj, respectivamente. Combinando estos contrastes adecuadamente se obtiene la siguiente regla de parada: • Tras el grupo j = 1, , K-1, — Si \Sj\> Uj se para y se rechaza HQ. — Si Si < I i para algún i<j y Si > -I i para algún i <j, se para y se acepta — En otro caso se continúa con el grupo j+1. 24
Contrastes secuenciales Tras el grupo K: - 5/15^1 > UK se para y se rechaza HQ. - En otro caso se para y se acepta HQ. Gráficamente: o O _ CN O O O c9 - Tratamiento experimental significativamente mejor ^^^^-"""7^ ^^^t—'—" " ^í ''''^^•'•'^'^^ _—-"T-"^ ' ' ''"^-^''''^ «C—' 1 ''1^-'^^'^ ••••-... 'í)'>^ No hay diferencia ...-•'" Cv.,,^^ significativa '^^"^-^^-—^ ' ^^'^^^•^ ~~" ""'~~~"~~-^^-~—' ^""^""•^^^ "--^ \ '-^ ^^^.^^^ Tratamiento experimental —~"^^~^^^:ÍÍ^ significativamente peor 400 1.9. Contrastes secuenciales basados en la realización repetida de contrastes de significación: Contrastes RST bilaterales. Los métodos secuenciales vistos hasta ahora se basan en el establecimiento de barreras en el plano (5,/); las sucesivas observaciones se van representando en dicho plano y la decisión final depende de la barrera alcanzada. Una aproximación diferente al análisis secuencial de datos es la que ofrece la realización repetida de contrastes de significación (RST, Repeated Signiftcance Tests). Este procedimiento, introducido por Armitage (1958, 1969, 1971) presupone que en cada etapa de inspección, k, de los datos se lleva a cabo un contraste de significación a nivel a¿. Es preciso tener en cuenta el hecho evidente de que si todos estos contrastes se realizaran con una significación de, digamos, 0.05 a medida que aumenta el número de inspecciones aumenta la probabilidad de que 25
Estimación bootstrap con datos secuenciales alguno de los contrastes dé significativo, aún cuando la hipótesis nula puesta a prueba sea verdadera. La única manera de evitar este problema es elegir los valores de ak adecuadamente para que el nivel de significación global para todo el contraste (esto es, la probabilidad de rechazar en alguna etapa HQ siendo cierta) se mantenga en un nivel controlado a. Dos son las formas principales de conseguir este objetivo: planificar a priori el número máximo de inspecciones a realizar, así como el tamaño de muestra en cada inspección, y distribuir el error a entre todas ellas; o bien, si no es posible anticipar el número de inspecciones que se van a realizar, ó los tamaños de muestra, definir a priori una ñmción de consumo del error tipo I (a-spending) y en cada inspección, una vez que se conoce el nivel de información (tamaño de muestra) efectivamente alcanzado, determinar a partir de dicha función el nivel a del contraste de significación a realizar. Trataremos en primer lugar los contrastes de la primera categoría. Los primeros procedimientos RST introducidos por Armitage consideraban que los datos iban estando disponibles uno a uno, y que tras cada observación era posible realizar un contraste de significación. Posteriormente Pocock (1977), O'Brien & Fleming (1979), y Wang & Tsiatis (1981) generalizaron este método para la realización de contrastes bilaterales cuando la toma de datos se produce secuencialmente en grupos de igual tamaño. Emerson & Fleming (1989), y Pampallona & Tsiatis (1994) desarrollaron una variación del mismo para la realización de contrastes unilaterales. En los procedimientos descritos por estos autores se fija a priori el número máximo de inspecciones K. En cada análisis intermedio kF=l, ,K se calcula un estadístico estandarizado, Zk, a partir de los primeros k grupos de observaciones. En el caso bilateral la regla de parada en los contrastes RST es de la forma: • Tras observar el grupo k^ 1, ,K-1: - Si \Zk\ > Ck se para y se rechaza HQ; - en caso contrario se continúa con el grupo j+\. 26
Contrastes secuenciales • Tras observar el grupo K: - Si \ZK\ ^ CK separa y se rechaza HQ, - en caso contrario se para y se acepta HQ. El estadístico Zk es usualmente el pivote natural que se utiliza en los contrastes equivalentes con muestra de tamaño fijo. A modo de ejemplo, supongamos que tras un adecuado proceso de aleatorización, dos grupos de pacientes son sometidos a dos tratamientos Ay B,y que las respuestas observadas para cada tratamiento son normales e independientes, con X^ = N{ju^, a) y Xg ^N{fig,<7), y que se desea contrastar H^ -.ii^-ji^ fi-ente a H^-.fi^i^iig. Cuando se dispone de los datos de los pacientes de los k primeros grupos, a razón de m pacientes por grupo en cada tratamiento, el estimador de la diferencia 6 = /x^- Ha es X^*' - X]^^. Y se define el estadístico estandarizado Z¿ como: m-k m-k \l2mkc7^ Z,= '=' , '•-' , k = \,2,-,K Cuando los valores de c¿ de la regla de parada son de la forma: c,^C^{K,aA){jlKf \A-l/2 se obtiene el contraste definido originalmente por Wang & Tsiatis. Si se escoge A= 0.5 se obtiene el contraste de Pocock y si A = O resulta el de O'Brien & Fleming. La sucesión de valores críticos [c^,---,c^^ se determina de modo que se alcance globalmente un nivel de significación, especificado al inicio del ensayo. Como puede apreciarse en la expresión anterior, el test de Pocock se caracteriza por unos valores Ck constantes. El test de O'Brien & Fleming produce valores Ck que van decreciendo y que son mayores que los de Pocock en las primeras inspecciones. Otros valores de A producen perfiles intermedios: 27 ,- , ^ - 9 i^^-^^
Estimación bootstrap con datos secuenciales Aunque en nuestros contrastes la región de continuación es de la forma (-c¿,c¿), los resultados que se muestran a continuación son válidos para cualquier región de la forma (a^ bk) donde los extremos no tienen por qué ser iguales en valor absoluto. La determinación de los niveles de significación y la potencia requieren el cálculo de la probabilidad de que en alguna etapa k el estadístico Zk caiga fuera de la región de continuación. En particular, llamemos: U,g{a„b„...,a,,b,) = Pg[a, <Z,<b„...,a^_,<Z,_,<b,_„Z, >b,) (1.19) L^g{a„b„...,a^,b^) = Pg{a^<Z, <b„...,a,_,<Z,_,<b^_„Z, <a,) (1.20) a las probabilidades, bajo 0, de que el test termine en la etapa k con la salida de Zk, respectivamente, por encima o por debajo de {ak, bk). Para calcular estas probabilidades observemos que la densidad de Z\ es: g,{z;e) = (i>[z-e4T,) (1.21) siendo ^[x] = QX^Í-X^ 12\Nlñ la densidad de la normal estándar. De (1.18) se sigue que para k = l,---,K, la densidad condicional de Zk, dado Zj = Zj,---,Zj^_j = z^_^ depende sólo de z^_^ y es igual a: (1.22) Por tanto, si construimos: g,{z;d)=t'g,_,{u;e)f,{u,z;e)du, k = 2,-,K (1.23) entonces gk(z;0) representa la densidad de Z¿, supuesto que el procedimiento secuencial ha llegado hasta el grupo k. Asimismo, si denotamos como p(k, z; 0) la 34
Contrastes secuenciales densidad conjunta ÚQky Zk cuando k es la etapa en que termina el test, se sigue que: p{k,z;d) = \ I u\ (^-^^^ A partir de estas funciones puede calcularse: U,^,[a„b,,-,a,A)=l^p{k,z;e)dz=[^g,{z;e)dz (1.25) L,g{a„b„...,a„b,)= ^^p{k,z;e)dz =^^g^{z;e)dz (1.26) Las ecuaciones (1.21), (1.22) y (1.23) permiten evaluar numéricamente, de forma recursiva, las integrales que aparecen en (1.25) y (1.26), mediante un adecuado método de cuadratura, tal como, por ejemplo, el método de Simpson. Una vez que se dispone de un algoritmo eficiente para el cálculo de las probabilidades Uk,^a\,b\,..., ak,bk) y Lk,d^aub\,..., ak,bk) es fácil calcular numéricamente los niveles críticos para los distintos métodos secuenciales en los que es válida la distribución conjunta canónica de los estadísticos de contraste. Por ejemplo, en el caso del test de Pocock, para contrastar la hipótesis nula ju = JUQ, cuando se observan datos procedentes de una población N(ju,d), con crconocida, los niveles de información son de la forma /¿^ = n,^ /cr^, y el estadístico estandarizado es: Z,=(X^''-ju,)^„ k = \,-,K. (1.27) Considerando 6= jil-^ es fácil comprobar que los Z^ siguen la distribución conjunta canónica (1.14). La región de continuación de este contraste es de la forma (-c, c). Por tanto la probabilidad ores: 35
Estimación bootstrap con datos secuenciales a = Pg^o (Rechazar H^) = P^^g [ Ü {\Z^ \ > c] (1-28) Z^»=o {\^k\> c) = £{4,o(-c,c,....,-c,c) + t/^o(-c,c,....,-c,c)} í:=l k=l Si se tiene en cuenta la forma de las trayectorias de Z^,--,Zj. es fácil observar que el error tipo I disminuye a medida que el valor de c aumenta. Así pues, fijados el nivel de significación ory el número máximo de grupos K, el valor c = Cp(K, á) puede obtenerse numéricamente mediante un sencillo algoritmo de búsqueda que vaya variando el valor de c en el cálculo numérico de las expresiones (1.25) y (1.26) hasta que se cumpla (1.28). De igual forma, una vez fijado el valor de c para conseguir el nivel de significación a, puede calcularse también la potencia para una alternativa 6 =S simplemente hallando el valor numérico de: 1 - y^ = Po=s (Rechazar H,) = ¿P,^, (|Z, \>c) = (1.29) /t=i Si 0 =5 es mayor que cero y suficientemente grande, la probabilidad de que la trayectoria de las Z, quede por debajo de -c puede despreciarse, y la expresión de la potencia se reduce a: l-;5 = |;c/,,(-c,c,....,-c,c) (1.30) k=\ Asimismo, si 6 =-8 es negativo y suficientemente grande en valor absoluto, la potencia se reduce a: 1-;5 = ¿Z,,_^(-C,C,....,-C,C) (1.31) k=\ 36
Contrastes secuenciales Si se desea evaluar el tamaño máximo de muestra necesario para realizar el test con un nivel de significación a, una potencia 1-yapara una alternativa 6=5 prefijada, y un número máximo K de inspecciones, será preciso determinar el valor /max para el que (1.30) o (1.31) alcanzan el valor 1-/9 prefijado cuando /¿ = {k/K)l^^ . Esta tarea también puede llevarse a cabo también fácilmente de modo numérico toda vez que dichas expresiones son crecientes con /maxPor último, el tamaño máximo de muestra se determina despejándolo de la expresión de /max como inverso de la varianza del estimador de 0. Así, en el caso que estamos considerando, como /^^ = n^^ ¡a'^, se sigue que el número máximo de observaciones a tomar es n^^ = cr^I^^, y el número de observaciones por inspección es « = n^^ ¡K . Como en general este valor no será entero, se toma como norma redondearlo al entero superior, para garantizar una potencia igual o ligeramente superior a la preespecificada. Todo lo dicho hasta aquí se aplica a contrastes secuenciales con grupos de idéntico tamaño en cada instante de observación. Cuando los tamaños de grupo son variables, Jennison & TumbuU (1999) realizan, para los distintos contrastes introducidos hasta ahora, un estudio exhaustivo del efecto de disponer de distintos niveles de información en cada instante de observación. Para ello consideran que dichos niveles son de la forma: Ij=n(jlKfI^,, j=l, ,K, Aquí TT controla el nivel de información final y juega un papel influyente en la potencia del contraste, como era de esperar: si ;r<l el tamaño final alcanzado es inferior al planificado y el test pierde potencia; por el contrario, si ;r >1 se dispone de tamaños de muestra mayores y la potencia observada puede ser mayor que la planificada. Por su parte, el exponente r afecta el distanciamiento entre los niveles de información: si r = 1, los tamaños de los grupos son iguales; si r <1 se producen apelotonamientos en los primeros instantes de observación (grupos de tamaño más grande inicialmente); y si r >1 se comienza inicialmente con grupos 37
Estimación bootstrap con datos secuenciales más pequeños que van siendo progresivamente mayores en los sucesivos instantes de observación. Se observa que cuando r<\ el nivel de significación global disminuye, y cuando r> 1 aumenta. En cualquier caso, tanto el incremento como la disminución son muy ligeros. De esta forma, la conclusión es que aunque los tamaños de los grupos sean desiguales, si la desigualdad no es excesiva, ello no tendrá, en general, demasiado efecto sobre la significación y la potencia del test secuencial. Sin embargo, si es previsible que haya diferencias muy grandes en los tamaños de los grupos, o que éstos sean absolutamente impredecibles, es mejor utilizar otros métodos de contraste secuencial para grupos, entre los que cabe citar el método de \SL función del gasto o consumo de la probabilidad de error de tipo I, que trataremos más adelante. 1.10. Métodos RST basados en la Función del Gasto o Consumo de la Probabilidad de Error de Tipo I: contrastes bilaterales. Los contrastes descritos hasta ahora están originalmente diseñados para un número predeterminado y fijo, K, de grupos de observaciones de igual tamaño y que dan lugar a niveles de información igualmente espaciados {/j,---,/^]. En la práctica, en el curso de un ensayo clínico no siempre es posible cumplir con este objetivo, ya que es frecuente que en los sucesivos instantes de inspección no se disponga de muestras del mismo tamaño (debido a que la tasa de reclutamiento de pacientes puede ser muy variable en el tiempo, puede haber sujetos que abandonen el ensayo antes de su finalización, etc.); a veces la información acumulada puede invitar a cambiar la frecuencia con que se revisan los datos en algún punto durante el curso del ensayo; podría ocurrir que se produzca un reclutamiento más lento de lo anticipado, lo que forzaría a la extensión del ensayo y, por tanto, a aumentar el número de instantes de inspección. 38
Contrastes secuenciales El procedimiento que vamos a describir a continuación es suficientemente flexible para tratar con secuencias de información impredecibles, y garantiza un nivel de significación exactamente igual a a cualquiera que sea la sucesión de niveles de información observados. Dicho método tiene la ventaja, además, de no requerir un número máximo de análisis fijados a priori. Supondremos, como hemos hecho en secciones anteriores, que el test secuencial se refiere a vm parámetro desconocido 6, que en los sucesivos análisis intermedios se dispone de estimadores 0^' con niveles de información /,=(var(^(^^))", y que los estadísticos estandarizados 2^=^^*',//^ para contrastar ^0 siguen la distribución conjunta canónica (1.14) (bien de modo exacto para datos normales, o bien de modo aproximado para otro tipo de datos). Los métodos secuenciales basados en el consumo o gasto de la probabilidad de error tipo I requieren la utilización de una función que permita ir cuantificando precisamente cuánta de esa probabilidad se ha ido consumiendo o gastando en las sucesivas inspecciones a lo largo de un estudio, hasta que se produce su conclusión. Presentamos este método en el contexto del contraste bilateral de la hipótesis HQ:0 = O, utilizando el método exacto para garantizar el nivel de significación sugerido por Slud & Wei (1982). Estos autores proponen fijar, antes de comenzar el estudio, el número máximo de análisis, K (se supone que no es posible planificar el número de observaciones en cada inspección), y el error de tipo I, que se reparte en probabilidades 7t^,---,7i¡. cuya suma total vale a. A medida que se van observando los sucesivos niveles de información /,,•••, /j^ se van calculando, condicionados por dichos valores, los valores críticos Cj para los estadísticos estandarizados Zj, de tal modo que, para cada7=l, v^: Pe-_,(\Z,\<c„-,\z._\<Cj_,\Zj\>c.) = 7t. (1.32) El contraste procede de acuerdo con la regla de parada habitual: 39
Estimación bootstrap con datos secuenciales Rechazar Ho en elj-ésimo análisis si \Zj \>Cj,j=l;',K, o parar y aceptar Ho si no ha sido rechazada en el análisis K. Así, Tüj representa la probabilidad de parar en la 7-ésima inspección rechazando HQ cuando es cierta; por ello TÜJ recibe el nombre de error gastado o consumido en la etapa j. Nótese que este error no tiene por qué coincidir con el nivel de significación nominal 2{l-0(cy)} en el y-ésimo análisis intermedio cuando se emplea la aproximación de los contrastes de significación repetidos con niveles de información predefinidos. Como n:^-\-—\-7t^ =a,\Q. tasa global de error de tipo I es exactamente a. La condición P(\Zx\>C\)= Kx cuando 6= O implica que el primer valor crítico es simplemente: Ci=0"^(l-;ri/2). (1.33) El cálculo de los restantes valores críticos necesita de la resolución de (1.32) paray=2, ,Ar. Para ello, definiendo: G.(Z;^) = P4|ZJ|<C„--,|Z,_,|<C,_„Z,>Z) (1.34) los valores de c* se pueden obtener recursivamente resolviendo: G,[c,;tí)=Kjl, k = 2,-,K (1.35) Si llamamos gi^z, ^ a la derivada de Gk{z, 9) respecto a z, entonces gk{z, 9) es también la densidad de Z¿ condicionada a que el procedimiento secuencial ha llegado hasta la A:-ésima inspección. Cuando los {Z,,---,Zj5.) siguen la distribución conjunta canónica (1.14), las ecuaciones (1.21), (1.22) y (1.23) permiten evaluar numéricamente la integral de g]J<^z, 9) y por tanto obtener el valor c¿ que cumple: fg,(z;0)Jz = ^ (1.36) 40
Contrastes secuenciales La única diferencia con el procedimiento delineado en el epígrafe 1.9 es que allí los valores de los Ik eran conocidos a priori, mientras que ahora debe esperarse a cada inspección para conocer el valor de /¿. Asimismo, la potencia para 0ó puede obtenerse numéricamente como 7r^[S)-\ \-/rj^[S) donde: ^,{^)- Csd^-'^)'^'+ [sA^-^^)^^' k = l,-,K (1.37) Aunque el método propuesto por Slud & Wei contiene ya la idea clave del gasto o consumo de error tiene, sin embargo, ciertas limitaciones. Dado que el número máximo de análisis se fija al inicio del estudio, resulta difícil adaptarlo a tasas de recopilación de información inesperadamente altas o bajas y, por tanto, alcanzar el requerimiento de potencia deseado. Asimismo, se podría preferir variar el consumo de error en algún análisis, en respuesta a los niveles de información observados. Por ejemplo, si hay poca información disponible en el primer análisis, debido a la lenta incorporación o al retardo en la respuesta de los pacientes, resulta razonable reducir TTI, reservando el error de tipo I para etapas posteriores en las que se cuente con un mayor nivel de información. El método introducido por Lan & DeMets (1983) y generalizado posteriormente por Kim & DeMets (1987) solventa estos problemas haciendo depender el consumo de error tipo I del nivel de información disponible en cada etapa, y estableciendo una regla de muestreo que hace que el procedimiento continúe hasta alcanzar un nivel máximo de información preespecificado o, si ello no es posible, adaptando el consumo del error a las irregularidades que se van produciendo en el calendario de inspecciones. En el método propuesto por Lan & DeMets (1983), que asume que el ensayo puede continuar hasta alcanzar un nivel de información máximo predefinido /max, el error de tipo I se reparte de acuerdo con una función de consumo de error, a*{t), no decreciente y que verifica que cir*(0) = 0 y a*{t) = a para t>l. El valor a*[í) indica la cantidad de error de tipo I acumulado que se deberá consumir cuando se haya obtenido una fi-acción t de la 41
Estimación bootstrap con datos secuenciales información máxima prevista /maxSe asume que mientras no se produzca una condición de parada que lleve a rechazar o aceptar HQ, el procedimiento debe continuar hasta alcanzar el nivel de información I^^ momento en que se detiene definitivamente el proceso. Ello obliga a que si, por ejemplo, los pacientes entran en el ensayo a una tasa inferior de la prevista, los organizadores del mismo deberán prolongar en el tiempo la duración del estudio. La ñmción de consumo de error a*[t) y el nivel de información máximo /máx han de ser seleccionados antes de iniciar el estudio. Los errores de tipo I asignados a cada análisis son entonces: 7ü,^a*{IJI^^) ^,=«^*(/;/4ax)-«^*(/MA.J, 7 = 2,3,... y los valores críticos Cj se van calculando sucesivamente de manera que satisfagan (1.32), de modo análogo al procedimiento de Slud & Wei (1982). Ahora K es el valor más pequeño de j para el cual Ij > /maxDado que, por definición, a*[lfr /I^^ ) = cc, tenemos que ;rj + • • • + ;r^ = or y la tasa global de error de tipo I es exactamente a, tal como se deseaba. Ha habido un gran número de propuestas para la forma de la función de gasto de error de tipo I, a*{t). Lan & DeMets (1983) señalan que la ñmción: a*{t) = O si t=0 2-20(z^/Ví) si 0<í<l produce valores críticos próximos a los del contraste de O'Brien & Fleming, cuando los tamaños de grupos son iguales. Para obtener valores similares a los de las cotas de Pocock, Lan & DeMets (1983) proponen: a*{t) = mm{oAog[l+(e-l)t],a} 42
Contrastes secuenciales Por último, Lan & DeMets (1987) y Jennison & TumbuU (1989, 1990) proponen la familia indexada por el parámetro p>Q: a*{t) = vmn^at^ ,a\ Una selección adecuada del parámetro p da lugar a que esta familia de funciones produzca cotas muy similares a las de los contrastes de Pocock (p =1), O'Brien & Fleming (yO =3) y Wang & Tsiatis (por ejemplo p -2 da cotas similares a las de Wang & Tsiatis para A=0.25). Jennison & Tumbull (1999) muestran que con los contrastes basados en esta función para el gasto de error en el caso de observar niveles de información igualmente espaciados, y eligiendo adecuadamente el valor de p se consiguen ventajas sobre los tests citados, concretamente tamaños máximos de muestra menores que aquellos, a la vez que tamaños medios de muestra similares o inferiores. Para conseguir que este método alcance una potencia prefijada para una alternativa concreta, hay que tener en cuenta que bajo ^ = O la distribución conjunta de Zj, • • •, Z^, condicionada a /¡, • • •, 7^^,, depende sólo de las proporciones A/^max'• • •'^/r/^max • ^^r tanto los valorcs críticos c^,---,Cf. son funciones de estas proporciones. A su vez, cuando dt^Qi, la distribución de Z^,--,Zfr depende de los niveles de información absolutos I^,---,!/^. Si bien existe un efecto de la forma en que se produce la sucesión de los niveles de información observados, puede comprobarse empíricamente que este efecto es muy pequeño, y es fundamentalmente el valor de /max el que finalmente determina la potencia del método. Por ello, una forma conveniente y sencilla de conseguir que el test tenga una potencia muy próxima a la deseada consiste en anticipar un número máximo de inspecciones K y suponer que los niveles de información van a estar equiespaciados (esto es, h = (MQ/max), y calcular el valor de /max que con esta secuencia de niveles de información producirá la potencia deseada para la alternativa de interés. 43
Estimación bootstrap con datos secuenciales 2.3. £1 bootstrap en la regresión En este epígrafe haremos una breve revisión del uso del bootstrap en los modelos de regresión con diseño de tamaño fijo en el que nos basaremos para proponer en el siguiente capítulo su uso en diseños secuenciales. Consideremos por tanto un modelo de regresión de la forma: Y,=g,{l3) + er, i = \,-,n (2.7) siendo gi{P) una función conocida del parámetro vectorial desconocido p. Supondremos que e^,---,e„ es una muestra aleatoria de una distribución de probabilidad F, tal que E\^e^= \x• F[dx) = Q. Para el conjunto de datos observados Y^,---,Y^, se considera una estimación del vector desconocido y^por algún método específico, tal como el de mínimos cuadrados. Sea pues ¡3 el vector que minimiza: TÁY.-SÁP)! (2-8) El objetivo ahora es obtener la distribución de probabilidad del estimador ^. Esta puede fácilmente aproximarse por el bootstrap de acuerdo con el siguiente algoritmo: i. Sea F„ la función de distribución empírica correspondiente a los residuales centrados. Esto es: sean los residuales é¡-Y¡-g¡{pj y ii. De F^ se extrae una muestra aleatoria el,---,e„. A partir de ésta se generan Y* = g.{^P^ + e.. iii. Utilizando nuevamente el método de mínimos cuadrados se obtiene una realización bootstrap y5* minimizando: 50
El bootstrap con diseños de tamaño fijo T1^:-SÁP)1 (2-9) Repetidas observaciones bootstrap \^0'';Í = \,---,B\ proporcionarán la aproximación bootstrap buscada. La repercusión práctica de este procedimiento es indudable. En los modelos de regresión no lineal proporcionan aproximaciones a la distribución de probabilidad de pivotales, a través de los cuales es posible obtener intervalos de confianza para P, tales como íy^-£'ry§ |j/sdíy^j. Si el modelo es lineal, aparentemente no son tan necesarias las aproximaciones bootstrap toda vez que el estimador fi es lineal en las observaciones, por lo que el efecto del teorema central del límite puede proporcionar una aproximación a su distribución de probabilidad. Veremos no obstante en el siguiente epígrafe a través de los desarrollos de Edgeworth como las aproximaciones bootstrap pueden ser mejores que la aproximación normal. 2.4. El Bootstrap y los desarrollos de Edgeworth En el epígrafe anterior hemos mostrado como a través del bootstrap puede simplificarse notablemente la obtención de la distribución de probabilidad de algunos estadísticos. El efecto del teorema central del límite sobre estadísticos lineales o la normalidad asintótica de los estimadores de máxima verosimilitud, dan aproximaciones a la distribución de tales estadísticos. El bootstrap puede mejorar tales aproximaciones en el sentido de que los errores de aproximación son menores. En orden a mostrar estas ideas, consideremos un pivotal T^ con distribución asintótica normal estándar. En casos regulares, su distribución de probabilidad admite un desarrollo de la forma:
Estimación bootstrap con datos secuenciales G{x) = P{T„ < x) = ^{x) + n-'^^q{x)(f>{x) + 0{n-') (2.10) siendo q(x) un polinomio de grado dos. A lo largo de esta memoria, O y ^ representan la función de distribución y fimción de densidad respectivamente de la distribución normal estándar. Para una muestra aleatoria Xj,---,X„ de una distribución de probabilidad con media // y varianza a^, el pivotal T„ =4ni^X-ju) a tiene distribución asintótica normal estándar. La validez del desarrollo anterior requiere la siguiente condición (de Cramer): E[x/1 < oo y lim sup cp^^ [t) <1 siendo (p^ la función característica de X¡. Este desarrollo pone de manifiesto que el error de aproximar la distribución probabilística del pivotal T^ por la distribución normal estándar (su distribución asintótica) es del orden rf^''^, lo que supone que la opción clásica de la aproximación normal puede ser de escasa validez, sobre todo, para tamaños muéstrales relativamente cortos. En este contexto, veamos como las aproximaciones bootstraps pueden mejorar la aproximación normal. El estimador bootstrap de G obviamente tiene el desarrollo: G{x) = P(T:<x\X„--,X„) = ^{x) + n-"'g{x)(P{x) + 0^(n-') (2.11) siendo T* la versión bootstrap de r„ obtenida de la muestra X,, • • •, X„, y ^ es la versión de q que resulta de sustituir los parámetros por sus estimaciones. 52
El bootstrap con diseños de tamaño fijo Habitualmente, q-q + 0 in^^^\. De los desarrollos de G y su aproximación bootstrap G , puede fácilmente obtenerse la siguiente expresión: G{x)-G{x) = P(T:<x\X„-,X„)-P{T„<x) = 0^(n') (2.12) Ello significa que el error de la aproximación bootstrap a la distribución del pivotal r„ es de orden «"' en probabilidad. Podemos por tanto concluir este epígrafe con la afirmación de que el bootstrap no sólo puede permitir aproximar la distribución probabilística de estadísticos de interés cuando la obtención de ésta es compleja, sino que además permite mejorar la aproximación normal de los clásicos estadísticos lineales. 2.5. Consistencia del bootstrap mediante las métricas de Mallows. La consistencia del método bootstrap requiere la definición de una métrica d definida sobre un conjunto de distribuciones de probabilidad, de tal forma que la distancia entre la distribución del estadístico R„ y la de su versión bootstrap i?* tienda a cero para n tendiendo a infinito. Revisamos en esta sección la consistencia del bootstrap basada en la métrica de Mallows. Definimos en primer lugar la distancia de un conjunto de distribuciones de probabilidad sobre un espacio de Banach. Veremos también un resultado debido a Bickel & Freedman (1981), el cual establece la equivalencia de la convergencia según la métrica de Mallows, con la convergencia débil. Consideremos un espacio de Banach B cuya norma denotamos por || • ||, y sea Tp -Tp{B) el conjunto de las medidas de probabilidad 7definidas sobre la correspondiente CF-álgebra de Borel cr[B) que verifican f||x|| Y(dx)<oo. La métrica de Mallows se define en Tp del modo siguiente: Dado a,J3sT 53
Estimación bootstrap con datos secuenciales dÁcc,P) = i£[E[{X-Yy^'" (2.13) Los siguientes lemas, debidos a Bickel & Freedman, establecen las propiedades básicas de la métrica d^ Lema 2.2. i. El ínfimo al que hace referencia la definición de la métrica de Mallows es accesible. ii. dp es una métrica sobre r^. Definición. Sea «„,«£r„. Se dice que a^ converge débilmente a la medida a (cir„=>flr) si a„{H)^>a{H) para cualquier He(7{B), tal que a{dH) = 0 (dH representa la fi-ontera de H). El siguiente lema da caracterizaciones de la métrica de Mallows. Lema 2.3. Sean a„,«Grp. Entonces, dp[a„,a) -^0, « —> c» , es equivalente a cada una de las siguientes condiciones: i. «„ :=í> « y J ||jc||^ a„ (dx) -^ [ ||jc||^ a{dx). ii. «„ => « y ||jc||^ es uniformemente a„ -integrable. iii. \^{x)da^—> \^{x)da, para cualquier función continua <p{x), tal que <z)(x) = (9(||xf). En lo que sigue emplearemos la siguiente notación: sean Uy Vvariables aleatorias con valores en el espacio de Banach B. Por dp[U,V) representamos la distancia entre las distribuciones ÚQ U y V respectivamente, supuesto que éstas pertenecen a T . Una propiedad de escalamiento para la métrica de Mallows es la siguiente: 54
El bootstrap con diseños de tamaño fijo d^{aU,aV) = \a\-d^{U,V) (2.14) Consideremos ahora 5 = R y p=2. Dada una muestra aleatoria X,,---,X„ de xma distribución de probabilidad F, tal que \x^F{dx) < oo . Es fácil probar que F^^> F casi seguramente, siendo F^ la distribución empírica correspondiente. Para probar este resultado basta comprobar que ^„^i(l/"^)' var(/(X; < x) j < o». Esto es obvio dado que var(/(X,. <xfj = F{x)-{\-F[x))<\, lo cual prueba la convergencia de la serie anterior y por tanto, FA^) = {\ln)Yj{X,<x)^E[l{X,<x)] = F{x), - (2.15) además, \x^F^ (¿¿c) -^ \x^F[dx). En efecto, \x'F„{dx) = ^Y^^^X^^E[xfy\x'F{dx), (2.16) casi seguramente. Aplicando entonces el lema 2.3. se establece que dAF„,F\-^0, casi seguramente cuando n-^o°. Ello significa que, para diseños de tamaño fijo, la distribución empírica es un estimador consistente de la verdadera distribución de probabilidad, de acuerdo con la métrica de Mallows. A través del siguiente lema (también de Bickel & Freedman), puede examinarse la consistencia del método bootstrap aplicado a determinados estadísticos. Lema 2.4. Sea B un espacio de Hilbert con producto interior (•,), y p=l. Supongamos que IJ • son independientes y que también, V. son independientes perteneciendo ambas sucesiones a Fj. Entonces: 55
Estimación bootstrap con datos secuenciales ''.{Tj-.'J.Zl/h^lM'J.y,)' (2-") Lema 2.5. Sea B ^m espacio de Hilbert con producto interior (•, •), y p=2. Sean Uy F variables aleatorias con valores en B, y con norma L^ finita. Entonces d^{U,V)'=d^(U-E[u],V-E[v]f+\E[U]-E[vf (2.18) Consideremos ahora una muestra aleatoria Xj, • • •, X„ de una distribución de probabilidad F con media fi y varianza finita <j^. Consideremos el estadístico Z^=yfn{^X-ju) el cual tiene asintóticamente distribución de probabilidad A'^(0,(T) . La versión bootstrap del estadístico es Z'^ = 4n {^X* - x\. Entonces, de acuerdo con los lemas 2.4. y 2.5 y la propiedad de escalamiento: casi seguramente, para « —> oo. Este estudio de consistencia puede fácilmente extenderse a estadísticos pivotales de la forma V« (X-//)/cr, siendo naturalmente la versión bootstrap de este estadístico y¡ñ(^X* -xVá^, donde á^ ={l/n)^"^^(^X¡-X^ . En el epígrafe 2.3. se consideró la aproximación bootstrap a los modelos de regresión. Para el caso de modelos de regresión lineal, Freedman (1981) aproxima la distribución probabilística del estadístico 4n{p„-p\ por el procedimiento bootstrap que se describe en el referido epígrafe, y prueba la consistencia del método utilizando técnicas similares a las que hemos mostrado para el caso del 56
El bootstrap con diseños de tamaño fijo estadístico Z„. Franke & Hárdle (1992) utilizan también el bootstrap en el contexto de la estimación de la función de densidad espectral para procesos estacionarios lineales. Utilizando la representación asintótica del periodograma para procesos lineales, obtienen una versión bootstrap de un cierto pivotal y prueban la consistencia del método de una forma similar al que utiliza Freedman para los modelos de regresión lineal. Parece atractivo pensar en la extensión de estos procedimientos a diseños secuenciales. Esto presenta sin embargo enormes dificultades debido a que los tamaños N son aleatorios. No parece además que sea práctico evaluar los procedimientos secuenciales en función de sus propiedades asintóticas debido a que el objetivo de tales procedimientos es generalmente reducir los tamaños muéstrales. En el siguiente capítulo propondremos el uso del bootstrap para aproximar la distribución de probabilidad de pivotales ordinarios sobre los que se puedan determinar intervalos de confianza para los parámetros de interés. Allí expondremos de forma empírica la validez de las aproximaciones mediante estudios de simulación. 57
El bootstrap en diseños secuenciales 3. El bootstrap en diseños secuenciales 3.1. El problema de la inferencia con datos secuenciales Tal como se mostró en el primer capítulo, los diseños secuenciales pueden ser preferibles a los de tamaño fijo en el sentido de que, para unos mismos requerimientos de significación y potencia, conducen a un tamaño muestral esperado inferior al que correspondería a un diseño de tamaño fijo. En algunos estudios tales como los de control de calidad, el objetivo generalmente consiste únicamente en aceptar o no un cierto lote de ítems mediante un contraste de hipótesis. En los ensayos clínicos sin embargo se requiere generalmente, una vez completada la recolección de datos, hacer inferencias acerca de los parámetros de interés. Los diseños secuenciales pueden resultar problemáticos en el sentido de que estimadores que son insesgados cuando se basan en datos obtenidos a través de diseños de tamaño fijo, presentan sesgos cuando éstos se han obtenido de modo secuencial. La normalidad asintótica de muchos pivotales puede también dejar de ser válida. Emerson & Fleming (1990) proponen un método de estimación de la media de una distribución normal con varianza conocida basado en datos obtenidos a través de un diseño de grupos secuenciales. En este capítulo proponemos el uso del bootstrap para aproximar la distribución de probabilidad de los pivotales a través de los cuales puedan obtenerse los intervalos de confianza para parámetros de interés frecuente en ensayos clínicos. Ilustraremos los procedimientos mediante reglas de parada basadas en los procedimientos de Wang & Tsiatis, los cuales fiíeron descritos en la sección 1.9. La base de cualquier procedimiento bootstrap es la elección de una adecuada distribución de remuestreo. En el contexto de un diseño de tamaño fijo, la distribución empírica puede ser una elección adecuada como vimos en el capítulo anterior. Lamentablemente, las propiedades de la distribución empírica no se mantienen por lo general en el contexto de un diseño secuencial. En la sección 3.3 se analiza la distribución empírica como estimador de la distribución generadora de los 59
Estimación bootstrap con datos secuenciales datos. Damos una forma de consistencia en probabilidad, aunque tal resultado no tiene mucho valor práctico, en el sentido de que el objetivo fundamental de los diseños secuenciales es hacer un contraste sobre el parámetro de interés con el mínimo número de datos. Damos también otro resultado a través del cual puede examinarse como la varianza de la regla de parada influye en el sesgo de la distribución empírica, lo cual se muestra también mediante simulación de una regla de parada basada en el procedimiento de Pocock. Utilizaremos el bootstrap para aproximar la distribución de probabilidad de varios pivotales a través de los cuales pueden obtenerse intervalos de confianza para parámetros de frecuente interés en los ensayos clínicos. Hacemos en primer lugar una revisión de un procedimiento de construcción de intervalos de confianza basado en datos obtenidos a través de diseños secuenciales. 3.2. Métodos basados en la dualidad test de hipótesis-intervalo de confíanza Dado que la aproximación normal dada por el teorema de Anscombe y Doeblin es muy poco precisa, revisamos en esta sección los métodos exactos basados en la dualidad de contrastes de hipótesis e intervalos de confianza. Este método requiere la definición de una relación de orden para el estadístico {N,T), donde A'^ representa la etapa de parada y 7 el test estadístico. El método requiere conocer la forma de la distribución F. Emerson & Fleming (1990) consideran el caso en el que las observaciones X¡j = N{ju,a), para i = l,---,K, j-\,---,m¡. Veremos en primer lugar este procedimiento para diseños de tamaño fijo. Un intervalo de confianza para un parámetro 6 puede definirse como el conjunto de todos los valores del parámetro conjeturados en la hipótesis nula que no serían rechazados para el valor observado de un adecuado test estadístico T. Más concretamente, sea Tun test estadístico para el contraste HQ:6=6Q. Para tal contraste determinamos un región de aceptación AQ , tal que 60
El bootstrap en diseños secuenciales Empirical Real Figura 3.1.a. Distribución A^(85;15) y la esperanza de la empírica bajo la hipótesis nula en un procedimiento de Pocock. • Empirical • Real 140 Figura S.l.b. Distribución 7V(90;15) y la esperanza de la empírica bajo una alternativa en un procedimiento de Pocock. 67
Estimación bootstrap con datos secuenciales • Empirical Real Figura 3.I.C. Distribución exponencial de parámetro 5 y la esperanza de su empírica bajo la hipótesis nula en un procedimiento de Pocock. I,U ,9- ,8- ,7- ,6- ,5- ,4- ,3- ,2- ,10,0 J^^^^^""^^^^ /^ / II / / / / 1 1 1 1 1 Empirical Real 10 15 20 25 30 Figura 3.1 .d. Distribución exponencial de parámetro 5 y la esperanza de su empírica bajo una alternativa en un procedimiento de Pocock. 68
El bootstrap en diseños secuenciales Teorema 3.5. Sea {X„: «€N} una sucesión de variables aleatorias independientes e idénticamente distribuidas, tales que £'[X¿] = // y var(J;^) = <T^. Sea N una variable aleatoria con valores en Z tal que {A'^ = n\ es un suceso determinado por X,,---,X„ y es independiente de X„+,,X„+2r" para todo «=1,2,..., y supongamos que £'[A'^]<<» y E N 1 EK-H E[{S,-N/if] = a'E[N] < oo. Entonces, (3.8) siendo 5„=XL^*- Demostración. k-\ {N> ky =[J{N = j} es independiente de X|^,X¡^_^_^,•••. Por tanto, las 7=1 variables X¿ y l[N>k) son independientes. Sea Y¡^=Xi^-ju. Entonces: {i:=/4l=42:=/^1+4z.s.//^] = E[N]. E[Y,'] +E '^Y/,l{N>max{j,k)) Veamos que el último término es nulo. En efecto Xr/./(iV>max(y,¿)) j*k k-\ = 2Y^E k=2 Y,l{N>k)-^Yj 7=1 = ^llllE[Y/j{N>k)] = 2f^E[Yj{N>k)-{S,_,-ik-l)-^)] k=2 2t,{E[Yj{N>k)S,_,]-{k-\).ju-E[Y,l{N>k)]} i=2 Obsérvese que l{N>k) está determinada por Xj,• • •,X¿_i, por lo que: 69
Estimación bootstrap con datos secuenciales E[Yj{N>k)S,_,'] = E[l{N>k)S,_,E[Y,\X„...,X,_,'^ = Q Además, por ser 1^ independiente de I{k > N) E[Yj{N>k)\ = Q y E[Y,\S,_,] = E[Y,'\=Q Portante, E Y,YjYj(N>m2o^{j,k)) = 0 Lo cual completa la demostración. Corolario 3.6. En las mismas condiciones del teorema 3.5 y siendo además var( A^) < oo, se tiene: vai{Sj,) = (T^E[N] + ju^ var{N) + 2juE[{S^ -NJU)(N-E[N])~\ (3.9) 3.4. Aproximación bootstrap con datos secuenciales para la media de una distribución En esta sección consideraremos el problema de estimar un intervalo de confianza para la media de una distribución de probabilidad basado en datos obtenidos a través de un diseño secuencial. Para la construcción del intervalo utilizamos el método de los pivotales y proponemos un procedimiento bootstrap para aproximar la distribución probabilística del pivotal correspondiente. Examinamos la validez del procedimiento y realizamos un estudio de simulación, en el cual comparamos el método bootstrap propuesto con el de Emerson & Fleming descrito en 3.2. 70
El bootstrap en diseños secuenciales 3.4.1. Aproximación bootstrap Consideremos el parámetro iJ, = \x-F{dx) correspondiente a una distribución F, con varianza (T'=J(x-//fF(í¿x) y sea N;X„-,X, un conjunto de datos obtenidos de F a través de un diseño secuencial siendo A^^ la regla de parada. En orden a obtener un intervalo de confianza para fi definimos el pivotal: T^ = _S^-N_ji •yfÑ (3.10) donde Sf, = ZÍiXi, X = S^¡N y al ={\/N)j:f^i(X,-xf. Para grandes valores de A^ y siempre y cuando éste sea fijo, la distribución de T¡^ puede aproximarse por la t de Student o la normal. De acuerdo con las consideraciones de la sección 2.4, las aproximaciones bootstrap serían mejores que la normal. En cualquier caso, no cabe esperar grandes valores de N si los datos proceden de un ensayo clínico secuencial. Además, la naturaleza aleatoria de A'^ conduce a falta de normalidad en T^. La figura 3.2. muestra la fianción de densidad del pivotal para el caso en el que los datos se hayan extraído de la A^(90;15) utilizando el procedimiento de Pocock para contrastar H^ : // = 85 . Una simple observación de la gráfica, la tabla de percentiles que se muestra a continuación y el contraste de normalidad de Kolmogorov-Smimov (p=0.001) conduce a descartar similitudes con las distribuciones t o normal. P5 -1.4283 PÍO -1.0192 P25 -.03983 P50 0.3107 P75 0.9771 P90 1.5534 P95 1.9119 71
Estimación bootstmp con datos secuenciales ,b- ,4- ,3- ,2- ,10,0 1 ' '^~ 1 A \ \ \ 1—^'~' 1 Figura 3.2. Densidad del pivotal T¡^ obtenida por estimación de núcleo. Proponemos un método de aproximación bootstrap para la distribución de probabilidad de T^. Dada la aleatoriedad de N, no son válidos los métodos clásicos de evaluación de la aproximación bootstrap. En el epígrafe 3.4.2 haremos una valoración del método basada en una descomposición del pivotal T¡^. El algoritmo propuesto es el siguiente: Paso 1. De X^,X2,---,Xf^, definir la distribución de remuestreo. Una posible distribución es la empírica Fyv(x). Paso 2. Utilizando la misma regla de parada que dio lugar a la muestra X^,X2,---,X^, obtener de la distribución de remuestreo B muestras bootstrap 1(. Hf Ifi 1^ N ,Xi ,X2,---,X^.. Paso 3. Obtener B valores del pivotal bootstrap definido por: r. N S*-N -S^/N ^ * (3.11) 72
El bootstrap en diseños secuenciales Los B valores bootstrap proporcionarán una aproximación a la distribución de probabilidad de T^. De acuerdo con la identidad de Wald, £[5^]= £[A/^]-//. Por tanto, la esperanza del numerador del pivotal 7^ es cero. Si se utiliza como distribución de remuestreo la función de distribución empírica, E, f-^,'] = S^^/N. De esta forma, utilizando nuevamente la identidad de Wald y teniendo en cuenta que E, [^*] = S,^/N, se obtiene: E,[SI,] = E,[N*}S,/N (3.12) Como se indicó en la sección 3.3, la regla de parada puede conducir a una estimación sesgada de la media de la distribución, ju, pero simultáneamente produce el mismo tipo de sesgo en la distribución empírica. En realidad, //^ = \xFfj[dx)=Sfj/N. Este sesgo influye directamente en el estadístico S*^.. En la figura 3.1.b se observa que la distribución empírica sobrestima la distribución real. Esto obviamente conduce a que Sj^/N sobrestimará a // y el estadístico S'^. tenderá a producir valores mayores que S^j. Sin embargo, ambas sobrestimaciones tienden a compensarse. En efecto: E[S,-N-JU']=E.[SI.-N'-SJN] = 0 (3.13) además, de acuerdo con el teorema 3.5, vax{S^-N-ju) = C7^-E[N] (3.14) var.(5;.-7V^5JiV) = (T^£.[iV*]. (3.15) 73
Estimación bootstrap con datos secuenciales De esta forma, los denominadores de ambos pivotales estiman en el mismo modo la desviación estándar de los numeradores. En el siguiente epígrafe haremos una valoración más detallada de la aproximación bootstrap. 3.4.2. Evaluación de la aproximación bootstrap Mostramos ahora una evaluación empírica de cómo la distribución del pivotal r^. aproxima la de T^. Sustituyendo á^ por <7y mediante una elemental aplicación del teorema del valor medio tenemos: r _S,-Nju 1 (Ty]E[N] 2(7E[Nf^ •{S^-Nju){N-E[N]) (3.16) Nótese que el segundo término es de orden E[N] mientras que el del —1/9 primero es £'[A'^] . Obviamente se tiene: CT,¡É[Ñ] = 0 (3.17) var a,[E[Ñ]^ = 1 (3.18) La aproximación análoga del pivotal bootstrap es: N' ~ 'N ^im'^^Á^'^''-""^^"'"-^"'^^ '""' lo que implica también: 74
El bootstrap en diseños secuenciales E,[(si. -S,)/á,^E.[N']\ = O (3.20) r var. Sfj--SN á,,mx] = 1 (3.21) Por tanto, la falta de centralidad en el cero de ambos pivotales es atribuible a los segundos términos, más concretamente a la covarianza entre S^^ - Nju y N. El mismo razonamiento cabe para el análogo bootstrap. Parece claro en este punto la importancia de que la regla de parada bootstrap imite la regla de parada original. Supóngase ahora que la regla de parada está determinada por un contraste unilateral del tipo //(,:// = //(, frente a i/, ://>//„. Si la hipótesis alternativa es manifiestamente cierta (//>//(,), cualquier test de la familia de Wang & Tsiatis (particularmente el de Pocock) parará en pocas etapas. Si por el contrario, la hipótesis nula se mantiene, previsiblemente el test alcance la inspección máxima. Esto implica una correlación negativa entre A'^ y 5^ - Nju lo cual se mostrará en un estudio de simulación posteriormente. Obsérvese que cuando la hipótesis nula falla, la distribución empírica tiene manifiestos sesgos tal como se ha mostrado en los epígrafes anteriores. En el caso que nos ocupa vimos que sobrestimaba la distribución original. Esto supone que si se usa el mismo criterio de parada, los datos se apartarán aún más de la hipótesis nula lo que sugiere que la distribución de probabilidad del tiempo de parada bootstrap está desplazada a la izquierda en relación con la del tiempo de parada original. Véase por tanto que mantener el mismo criterio de parada en el contexto bootstrap que en el original no conduce a que la distribución del tiempo de parada bootstrap imite a la del tiempo de parada real. Este hecho es no obstante compensado por una mayor distancia entre S*^. y N JUQ la cual aparece en la forma de los procedimientos de Wang & Tsiatis. En definitiva, aunque la distribución de probabilidad de A^' no imite a la de A^, la 75
Estimación bootstrap con datos secuenciales distribución de {^S*^. -S^^MN'-E,^N'~^ si imita a la de [Sfj -Nju){^N-E\N\^, lo cual es la clave de la validez de la aproximación bootstrap. Esto se pondrá de manifiesto con el estudio de simulación. 3.4.3. Estudio de simulación Consideremos la distribución N{^ju,a = \5) y la hipótesis nula Í/Q : // = 85. Para contrastar esta hipótesis hemos utilizado el procedimiento de Pocock con número máximo de looks A=8 y tamaño por look /w=20. El valor crítico C=2.5 proporciona una significación global para el test de 0.05. El procedimiento se repitió 30.000 veces, tomando //=85 (hipótesis nula cierta). Esto proporciona una aproximación a la distribución de probabilidad del pivotal T^^. La densidad se ajustó mediante estimación de núcleo. Para obtener su aproximación bootstrap se utilizó como regla de parada la misma que para los datos originales, pero muestreando de la distribución empírica. La figura 3.3.a muestra simultáneamente las ñinciones de densidad de probabilidad de ambos pivotales, las cuales difícilmente pueden ser distinguidas. El mismo estudio se repitió tomando como valor real del parámetro // = 90 y manteniendo como hipótesis nula Í/Q : // = 85. Se obtuvieron asimismo las estimaciones de los pivotales T^ y 7^. cuyas fianciones de densidad se representan conjuntamente en la figura 3.3.b. Las figuras 3.3.c y 3.3.d muestran las densidades de estos pivotales para el caso //(,:// = 5 estando los datos generados por distribuciones exponenciales de parámetro 5 y 7 respectivamente. 76
El bootstrap en diseños secuenciales Dado que la distribución ^ TjKN7t¡) está concentrada alrededor de la unidad, podemos considerar la aproximación: k-8(z;.,';.7('^'^.))-2"..^.V('^^')-' p-2^) Por tanto, para iV fijo, se tiene que: \og{pJp) = N[^;^{\-7t,)l{N7r,) + {\-7t,)l{N7r,)) (3.26) Este resultado sugiere que para el diseño secuencial consideremos el pivotal: R, = . log^.-log/^ (3.27) La distribución empírica correspondiente a cada muestra observada í^,,---,}^jv, para / = 1,2 es 6(1,^;^^)'<^ondeprevisiblemente ;r,jv es un estimador no centrado para ;r^. A pesar de esto, proponemos un procedimiento bootstrap para aproximar la distribución probabilística de los pivotales T^ y R^^. 3.5.1. Aproximación bootstrap para el pivotal T^. Paso 1. Para cada i = 1,2, considerar como distribución de remuestreo la Paso 2. Utilizando la misma regla de parada que se utilizó con la distribución original, obtener un conjunto de datos bootstrap | N*, Y*j ;i = \,2;j = 1,---,N] . 83
Estimación bootstrap con datos secuenciales Paso 3. Del conjunto de datos bootstrap, obtener por el método de Monte Cario la distribución de probabilidad del pivotal: ^w-ViV - - —^JY (J.2») Un conjunto de B valores de 7^ proporcionarán la aproximación buscada. En orden a justificar la aproximación propuesta, expresaremos el pivotal 7]y en la forma alternativa: TM= ^^-^ ¡TT (3-29) siendo Sj^=^ (YIJ-YJJ). De la identidad de Wald se obtiene de forma inmediata: E[s^-N{^,-7r,)] = 0 (3.30) Análogamente, el pivotal bootstrap puede expresarse por: ^NI—, . . . .-11/2 i^j.Ji; donde ahora S*^. =^ _ (^^',-^2^) • Aplicando, a continuación, la identidad de Wald para las distribuciones bootstrap, resulta: £.[5;.-AA*(^,^-^,^)] = 0 84
El bootstrap en diseños secuenciales Podemos obtener también expresiones para la varianza de los numeradores, aplicando el teorema 3.5. Así pues, var(5^-iV(;r,-;r2)) = {;ri(l-;r,) + ;r2(l-;r2)}£[iV] (3.32) Obviamente, en el contexto bootstrap se tiene: var.(5;.-A^*(^,^-^2^))={#,^(l-^,^) + ;r2^(l-i-2,;,)}£[iV] (3.33) De esta forma y para ambos pivotales, los denominadores estiman la desviación estándar de los numeradores. Mediante un estudio de simulación, en el subepígrafe 3.5.4 hacemos una evaluación empírica de la aproximación bootstrap propuesta. 3.5.2. Aproximación bootstrap para elpivotal R,^ Paso 1. Para cada / = 1,2, considerar como distribución de remuestreo la Paso 2. Utilizando la misma regla de parada que se utilizó con la distribución original, obtener un conjunto de datos bootstrap | N*, Y*j; / = 1,2; y = 1, • • •, A'^j . Paso 3. Del conjunto de datos bootstrap, obtener por el método de Monte Cario la distribución de probabilidad del pivotal: K- = , •°8^»-'°g^" (3.34) >/('-*.X)/(A'X»XI-*«-)/('V*.X) 85
Estimación bootstrap con datos secuenciales Un conjunto de B valores de R*^ proporcionarán la aproximación buscada. 3.5.3. Evaluación del procedimiento bootstrap para el riesgo relativo Justificamos en este subepígrafe la aproximación bootstrap propuesta para el pivotal del riesgo relativo. Sea nuevamente: l0g(;3Jp) = l0g%^-l0g-^^=> '-^ NK, NTT, (3.35) Según se vio anteriormente, dado que la distribución de ^ =]^i,j {^^i) está concentrada alrededor de la unidad, consideramos la aproximación: iog(z:=,^V(^^'))-i:i=.^V(^^')-i (3.36) Ello significa que: ^0ÚP.IP)-X-.Y,J{N7r,)-^]j,J{Nn,) (3.37) Por tanto: i?„« logyd^ -iog/7 _ Z,=.^,.A'~2i=iM^ ' ^{\-K,)l{NK,) + {\-7C,)l[Nn,) TyfÑ (3.38) siendo <T = J{\ — ^i )l^\ + (l ~ ^2 )/^2 • De esta forma;: R. CJ^E[Ñ]plE[N] y[Ñ/E[Ñ] z:.^.A-z;.^./^] (^yjE[Ñ] 86
El bootstrap en diseños secuenciales R. f^N lo [W^ 7t, 7t^ (iV-£[iV]) Mediante la identidad de Wald, es inmediato probar que el primer término de la descomposición anterior tiene media cero. Asimismo, de acuerdo con el teorema 3.5, la varianza correspondiente es uno. El segundo término es de orden inferior en relación con E\N\ . Para diseños de tamaño fijo el término correspondiente sería nulo. Con diseños secuenciales, este término contribuye a desviar el centro de gravedad de R¡^. La versión bootstrap obviamente tiene la forma: ^^4^ 24 (i4^)' Z '^ y* V^ y* y j (A/*-Í;[ÍV']) (3.39) Un análisis comparativo de las descomposiciones obtenidas para Rj^ y R^. justifica la validez de la aproximación en los mismos términos que el realizado en la sección 3.5. S.5.4. Estudio de simulación Para ;r, = KJ=^.1 se ha realizado un estudio de simulación tomando K=% (número máximo de inspecciones) y 777=20 (20 observaciones por grupo e inspección). La regla de parada es la proporcionada por el procedimiento de Pocock para contrastar H^:K^=n.^. El valor crítico C=2A5 proporciona una significación de 0.05. Para los datos obtenidos hemos determinado la distribución de los pivotales T¡^ y R^ y sus aproximaciones bootstrap T^. y R*^., las cuales se muestran en la figura 3.5.a y 3.5.b. El mismo estudio de simulación se ha repetido 87
Estimación bootstrap con datos secuenciales pero con ^r, = 0.7, K^ = 0.8 y la hipótesis nula i/g: ;r, = ;r2. Los resultados para los pivotales T^ y T\ se muestran en la figura 3.5.c, mientras que para los pivotales Rf^ y R*. aparecen en 3.5.d. Bootstrap Real Figura 3.5.a. Densidades de probabilidad para 7^ y 7" . . Los datos están generados por el procedimiento de Pocock bajo HQ . Bootstrap Real Figura 3.5.b. Densidades de probabilidad para 7?^ y R .. Los datos están generados por el procedimiento de Pocock bajo HQ . 88
El bootstrap en diseños secuenciales Bootstrap Figura 3.5.C. . Densidades de probabilidad para T^ y T . . Los datos están generados por el procedimiento de Pocockpara ^j = 0.7 y ;r2=0.8. Bootstrap Real Figura 3.5.d. Densidades de probabilidad para R¡^ y R .. Los datos están generados por el procedimiento de Pocock para Tt^ = 0.7 y fTj^ 0.8 . 89
Aplicaciones a tres estudios hiomédicos 4. Aplicaciones a tres estudios biomédicos Presentamos ahora tres estudios biomédicos a los cuales aplicaremos los procedimientos secuenciales desarrollados a lo largo de esta memoria. El primero es un ensayo clínico cuyo objetivo fue evaluar la eficacia de un cierto catéter en la reducción de la tasa de colonización y bacteriemia en pacientes ingresados en unidades de cuidados intensivos. El segundo estudio tenía como objetivo establecer el valor pronóstico del grupo de genes HLA para la enfermedad diabética. En el último se analizan determinaciones basadas en ultrasonidos (QUS) como marcadores de la enfermedad osteoporótica. Todos los estudios se desarrollaron originalmente de acuerdo con diseños de tamaño fijo. De sus correspondientes bases de datos se realizaron submuestreos secuenciales utilizando los procedimientos de Wang & Tsiatis descritos en el primer capítulo. Considerados en su diseño original y para sus correspondientes variables principales de valoración, en todos se había obtenido significación estadística, por lo que cabía esperar que los tiempos de parada correspondientes a los submuestreos secuenciales se alcanzaran antes de agotar los datos disponibles. Esta conjetura se basó en el hecho de que para las diferencias observadas en los estudios originales, nivel de significación del 5% y potencia del 95%, los tamaños muéstrales requeridos para los diseños de tamaño fijo eran menores a los disponibles en las bases de datos. De las consideraciones expuestas en el primer capítulo, los tamaños esperados para los diseños secuenciales serían a su vez inferiores a los requeridos para los diseños de tamaño fijo. En todos los tres estudios se alcanzó finalmente el tiempo de parada antes de agotar los datos disponibles. Para el submuestreo secuencial los datos se mantuvieron en el mismo orden que aparecían en las correspondientes bases de datos. Para los parámetros de interés, se obtuvieron los intervalos de confianza utilizando los procedimientos bootstrap propuestos en el tercer capítulo de esta memoria. Vx, 91
Estimación bootstrap con datos secuenciales 4.1. Estudio 1: Evaluación de la efectividad del recubrimiento de catéteres con antibióticos. A los pacientes ingresados en las unidades de cuidados intensivos (UCI) se les inserta habitualmente un catéter a través del cual reciben los tratamientos prescritos. Estos catéteres son frecuentemente colonizados por agentes microbianos los cuales pueden pasar a la sangre produciendo una sepsis en el paciente. Con el fin de evitar esta colonización, se ha diseñado un catéter que permite su recubrimiento con antibióticos. Para evaluar su eficacia se han desarrollado diversos ensayos clínicos en los cuales se analiza fiindamentalmente si se logra una disminución en las colonizaciones de los catéteres y de ahí, de bacteriemias en los pacientes. Sobre uno de estos ensayos hemos aplicado los procedimientos secuenciales desarrollados en esta memoria. En el estudio considerado participaron nueve hospitales españoles y se diseñó originalmente como un ensayo clínico de tamaño fijo con dos grupos paralelos, donde un total de 284 pacientes ingresados en las Unidades de Cuidados Intensivos (UCI) ñieron aleatorizados a recibir un catéter impregnado en antibiótico o un catéter control. Resultaron evaluables finalmente 139 pacientes en el grupo con catéter impregnado y 145 en el control. Como veremos posteriormente, la tasa de catéteres colonizados en el grupo impregnado se redujo aproximadamente a la mitad en relación a la del grupo control. Sin embargo, no hubo diferencias significativas entre las tasas de bacteriemias de ambos grupos. La siguiente tabla resume el perfil de los pacientes incluidos en el estudio por grupo experimental en el momento de la aleatorización. 92
Aplicaciones a tres estudios biomédicos Tabla 4.1. Características de los pacientes y catéteres Edad media Sexo, Hombre/Mujer Media APACHE II (admisión) Pacientes Médicos Quirúrgicos Traumatológicos Localización del catéter Vena subclavia Vena yugular interna Duración de la cateterización (media en días) Impregnado ín=139) 61 + 16 93/46 16 + 7 87 35 17 63 (45%) 76 (55%) 10 + 5 Control ín=145) 59 ±18 91/54 15±6 89 37 19 64 (44%) 81 (56%) 11 ±5 p-valor .4 .5 .5 .9 .8 .5 De esta tabla se concluye que ambos grupos experimentales son perfectamente comparables. Esto permite atribuir las diferencias que surjan entre los parámetros de evaluación a los tratamientos recibidos y no a eventuales factores de confusión. La tabla 4.2 muestra las tasas de colonización de catéteres y las de bacteriemia en pacientes por grupo de tratamiento. Puede observarse una evidente reducción de la colonización en el grupo experimental frente al control. Sin embargo, la reducción en las tasas de bacteriemias no resultó ser significativa. Tabla 4.2. Tasas de colonización y bacteriemia Impregnado (n=137) Control (n=145) Riesgo Relativo (IC 95%) Catéteres colonizados Bacteriemia 28 (20,4%) 5 (3,6%) 60(41,4%) 8 (5,5%) 0.49 (0.34 - 0.72) 0.66(0.22-1.97) Si partiendo de los datos de este estudio admitimos que la tasa de catéteres colonizados en el grupo impregnado es del 20% y en el control del 40%, con 130 93
Estimación bootstrap con datos secuenciales Como puede observarse, si para este estudio se hubiese elegido un diseño secuencial, en todos los casos el tamaño muestral alcanzado cuando el procedimiento se detiene es inferior al tamaño muestral requerido por el diseño de tamaño fijo. La ventaja relativa es mayor para aquellos diseños que requerían a priori un tamaño de muestra mayor (i.e. en el caso en que se pretende detectar ima diferencia media más pequeña). Ello se debe a que se ha rechazado la hipótesis nula ya que, obviamente, en caso de haberse aceptado, el tamaño final alcanzado en el contraste secuencial hubiese superado al necesario en un diseño de tamaño fijo. Asimismo observamos que a menor número de inspecciones, mayores son los tamaños finales de muestra requeridos, tal como se había señalado en el primer capítulo. 100
Bibliografía Bibliografía 1. Anderson, T.W. (1959). A modification of the sequential probability ratio test to reduce the sample size. Ann. Math. Statist., 31, 165-197. 2. Araiitage, P. (1954). Sequential tests in prophylactic and therapeutic triáis. Quart. J. Med., 23, 255-274. 3. Armitage, P. (1958). Sequential methods in clinical triáis. Am. J. Pub. Health, 48, 1395-1402. 4. Armitage, P. (1975). Sequential Medical Triáis. (2" Edición). Blackwell Scientific Publications, Oxford. 5. Armitage, P., McPherson, C.K. and Rowe, B.C. (1969). Repeated significance tests on accumulating data. J.R. Statist. Soc., A, 132, 235-244. 6. Anscombe, F.J. (1952). Large sample theory of sequential estimation. Proc. Cambrige Philos. Soc, 48, 600-607. 7. Bamard, G. A. (1946). Sequential tests in industrial statistics. J. Roy. Statist. Soc. Suppl., 8, 1-26. 8. Bickel, P. and Freedman, D. (1981). Soma asymptotic theory for the bootstrap. Ann. Statist., 9, 1196-1217. 9. Bowman, A., Hall, P. and Prvan, T. (1998). Banthwith selection for the smoothing of distribution functions, Biometrika, 85, 799-808. 10. Bross, 1. (1952). Sequential medical plans. Biometrics, 8, 188-205. 11. Bross, 1. (1958). Sequential clinical triáis. J. Chronic Deseases, 8, 349-365. 12. DeMets, D.L. and Lan, K.K.G. (1984). An overview of sequential methods and their application in clinicals triáis. Commun. Statist.: Theor. Meth., 13, 2315-2338. 13. DeMets, D.L. and Ware, J.H. (1980). Group sequential methods for clinical triáis with one-side hypothesis. Biometrika, 67, 651-660. 14. DeMets, D.L. and Ware, J.H. (1982). Asymmetric group sequential boundaries for monitoring clinical triáis. Biometrika, 69, 661-663. 15. Doeblin, W. (1938). Sur deux problémes de M. Kolmogoroff concemat les chainas dénombrablas, Bull. Soc. Math. France, 66, 218-220 101
Bibliograjia 16. Efron, B. (1979). Boostrap methods: another look at the jackknife. The Annals ofStatistics, 7, 1-26. 17. Efron, B. and Tibshirani, R.J. (1993). An Introduction to the Bootstrap. Chapman & Hall. New York. 18. Emerson, S.S. and Fleming, T.R. (1989). Symmetric group sequential designs. Biometrics, 45, 905-923. 19. Emerson, S.S. and Fleming, T.R. (1990). Parameter estimation foUowing group sequential hypothesis testing. Biometrika, 11, 875-892. 20. Franke, J. and Hárdle, W. (1992). On bootstrapping kemel spectral estimates. The Annals ofStatistics, 20, 121-145. 21.Freedman, D.A. (1981). Bootstrapping regression models. The Annals of Statistics,9, 1218-1228. 22. Glüer C, F.t.I.Q.U.C. Group. (1996). Quantitative ultrasound technique for the assessment of osteoporosis: expert agreement on current status. J Bone Miner Res ,11, 707-730. 23. Hall, P. (1992). The Bootstrap and Edgeworth Expansión. Springer-Verlag. 24. Jennison, C. and Tumbull, B.W. (1983). Confídence intervals for binomial parameter following a multistage test with application to MIL-STD 105D and medical triáis. Technometrics, 25, 49-58. 25. Jennison, C and Tumbull, B.W. (2000). Group Sequential Methods with Applications to Clinical Triáis. Chapman & Hall/Crc. London. 26. BCim, K. and DeMets, D.L. (1987). Design and analysis of group sequential tests based on the type I error spending rate ñinction. Biometrika, 74,149-154. 27. Lorden, G. (1976). 2-SPRT's and the modified Keifer-Weiss problem of minimizing an expected sample size. Ann. Statist., 4, 281-291. 28. McPherson, C.K. and Armitage, P. (1971). Repeated significance tests on accumulating data when the nuil hypothesis is not true. J.R. Statist. Soc, A, 134, 15-25. 29. O'Brien, P.C. and Fleming, T.R. (1979). A múltiple testing procedure for clinical triáis. Biometrics, 35, 549-556. 102
Bibliografía 30. Pampallona, S. and Tsiatis, A.A. (1994). Group sequential designs for onesided and two-sided hypothesis testing with provisión for early stopping in favor of the nuil hypothesis. J. Statist. Planning andInference, 4,1, 19-35. 31. Pocock, S.J. (1977). Group sequential methods in the design and analysis of clinical triáis. Biometrika, 64, 2, 191-199. 32. Rohatgi, V.K. (1976). An Introduction to Probability Theory and Mathematical Statistics. Wiley. 33. Serrano-Ríos M, Gutiérrez-López MD and Pérez-Bravo F. (1996). HLA-DR, DQ and anti-GAD antibodies in fírst degree relatives of type I diabetes mellitus. Diabetes Res Clin Pract, 34, Suppl:S,133-139. 34. Setién Baranda F, Coto E, Menéndez Díaz J, Martínez-Naves E, Álvarez Martínez V and López-Larrea, (1994). C. HLA class II and susceptibility and resistance to insulin-dependent diabetes mellitus in a population from the northwest of Spain. Eur JImmunogenet, 21, 219-229. 35. Siegmund, D. (1979). Corrected diffiísion approximations in certain random walk problems. Advances in Apllied Probability, 11, 701-719. 36. Siegmund, D. (1985). Sequential Analysis: Tests and Confidence Intervals. Springer-Verlag, New York. 37. Sobel, M. and Wald, A. (1949). A sequential decisión procedure for choosing one of three hypothesis conceming the unknown mean of a normal distribution. Ann. Math. Statist., 20, 502-522. 38. Slud, E.V. and Wei, L.J. (1982). Two-sample repeated signifícance tests based on the modified Wilcoxon statistic. J. Amer. Statist. Assoc., 11, 862-868. 39. Vicario JL, Martínez-Laso J and Corell A. (1992). Comparison between HLADRB and DQ DNA sequences and classic serological markers as type I (insulin-dependent) diabetes mellitus predictive risk markers in the Spanish population. Diabetologia, 35, 475-481. 40. Wald, A. (1947). Sequential Analysis, New York: Wiley. 41. Whitehead, J. (1997). The design and Analysis of Sequential Clinical Triáis. (Revised 2"^ Edition). John Wiley & Sons Ltd. Chichester. 42. Whitehead, J. and Stratton, I. (1983). Group sequential clinical triáis with triangular continuation regions. Biometrics, 39, 227-236. 103
Bibliografía 43. Woodroofe, M. (1992). Estimation after sequential testing: a simple approach for a truncated sequential probability ratio test. Biometrika, 79, 2, 347-353. 104