scieee AI-readable full text Open interactive document viewer

Repositorio Institucional de Documentos

Abstract

El trabajo se estructura en cuatro grandes apartados: introducción, material y método, análisis de los resultados y conclusiones. En el primero se analiza la evolución y el contenido de la World Wide Web y sirve para establecer el marco conceptual del estudio, en el que también se trata de los sistemas de recuperación de información tradicionales, valorando su influencia en las herramientas de recuperación de la Web. El trabajo se plantea como objetivos: conocer el funcionamiento de los principales buscadores de la World Wide Web ante diferentes tipos de búsquedas, valorar su utilidad en búsquedas de recursos sobre temas especializados y conocer las características de la información recuperada. Se evalúan los principales motores (Google, MSN, Teoma, WiseNut y Yahoo) y metabuscadores (Dogpile, Excite, IXQuick, Profusión, Search, SurfWax y Vivisimo) mediante el lanzamiento de seis búsquedas relacionadas con el campo de la Documentación. Se analizan los cincuenta primeros resultados utilizando indicadores que permiten valorar diferentes características de los registros que aparecen en los listados de recursos recuperados; el funcionamiento de los buscadores en las diferentes búsquedas; diferentes aspectos relacionados con los programas de búsqueda y recuperación; con la base de datos; la precisión técnica, la cobertura, el solapamiento y la ordenación de los resultados. Se estudian además otras propiedades de la información, en función de su interés comercial, institucional, para la investigación , etc.; la tipología documental y el formato de los ficheros. Vidal Bordes, Francisco Javier; Salvador Oliván, José Antonio

Full text

T esis Doctoral Evaluación del funcionamiento y r ecuperación de información textual de los principales motor es de búsqueda y metabuscador es genéricos de la W orld W ide W eb Memoria presentada por Francisco Javier V idal Bordes en la Facultad de Filosofía y Letras de la Universidad de Zaragoza para optar al título de Doctor . Director: Dr . José Antonio Salvador Oliván 2008 A la memoria de Antonio Vidal Bordes i EVALUACIÓN DEL FUNCIONAMIENTO Y RECUPERACIÓN DE INFORMACIÓN TEXTUAL DE LO S PRINCIPALES MOTORES DE BÚSQUEDA Y METABUS CADORES GENÉR ICOS DE LA WORLD WIDE WEB ÍNDICE GENERAL ............................................................................................................ i I. INTRODUCC IÓN Introducción y objetivos ........................................................................................................ 1 1. Internet y la World Wide Web ....................................................................................... 9 1.1. La red Internet .................................................................................................... 9 1.1.1. Breve introducción histórica ...................................................................... 9 1.1.1.1. Primeras investigaciones. Las redes y los protocolos ..................... 10 1.1.1.2. Los servicios y sus protocolos. Las prim eras herramientas de recuperación de información en Internet ........................................ 12 1.2. La World Wide Web........................................................................................... 20 1.2.1. Orígenes de la World Wide Web ............................................................... 21 1.2.2. Características técnicas y problemas de la información en la Web ........... 23 2. Los buscadores de información de la WWW en el contexto de los sistemas de recuperación de la información. Procesos, funciones y problemas ............................ 36 2.1. Los Sistemas de Recuperación de la Información y los buscadores Web.......... 36 2.2. Procesos de lo s SRI y su repercusión en las herramientas de recuperación Web. ................................................................................................................... 41 2.2.1. Formación de la base de datos ................................................................... 42 2.2.2. El análisis documental ............................................................................... 43 2.2.2.1. La descripción ................................................................................ 43 2.2.2.2. La Indización .................................................................................. 44 2.2.2.3. La clasificación .............................................................................. 46 2.2.2.4. El resumen ...................................................................................... 47 2.2.3. La búsqueda y recuperación de información ............................................. 48 2.3. Los buscadores de información Web .................................................................. 53 2.3.1. Orígenes de los principales motores de búsqueda y metabuscadores ........ 54 2.3.2. Definición y clasificación .......................................................................... 60 2.3.2.1. Directorios ...................................................................................... 63 2.3.2.2. Motores de búsqueda...................................................................... 66 2.3.2.3. Metabuscadores .............................................................................. 70 2.3.2.4. Los agentes inteligentes ................................................................. 73 ii 2.3.3. Principales componentes y funcionamiento .............................................. 74 2.3.3.1. El robot o crawler ........................................................................... 75 2.3.3.2. El índice ......................................................................................... 77 2.3.3.3. La base de datos ............................................................................. 81 2.3.3.4. Los programas de búsqueda y recuperación de la inform ación ..... 93 2.3.3.5. Identificación de los problemas de recuperación de información en la Web ........................................................................................ 97 3. La evaluación de los sistemas de recuperación de la información y las herramientas de búsqueda de la WWW ................................................................ 103 3.1. Concepto y fines de la evaluación. El proceso de evaluación ............................ 103 3.1.1. Concepto de evaluación ............................................................................. 103 3.1.2. Fines y objetivos ........................................................................................ 105 3.1.3. Proceso de evaluación ................................................................................ 107 3.2. Tendencias en la evaluación de SRI ................................................................... 108 3.3. La evaluación de los SRI. Indicadores ............................................................... 113 3.4. La evaluación de las herramientas de búsqueda de la World Wide Web. Estado de la cuestión e indicadores utilizados. .............................................. 121 3.4.1. Estado de la cuestión .................................................................................. 121 3.4.2. Propuestas de evaluación e indicadores de los buscadores de la Web....... 142 II. MATERIAL Y MÉTODO ............................................................................................. 159 1. Los indicadores de evaluación, valores y medidas a aplicar ............................ 161 2. Selección de Motores de búsqueda y metabuscadores ..................................... 165 3. Test de evaluación ................................................................................................ 167 3.1. Modos de búsqueda ...................................................................................... 167 3.2. Temas de búsqueda y sintaxis ....................................................................... 167 3.3. Ejecución de las búsquedas........................................................................... 169 3.4. Recopilación y análisis de datos ................................................................... 171 III. RESULTADOS Y ANÁLISIS ..................................................................................... 179 1. Datos de la muestra .................................................................................................. 179 1.1. Total recursos recuperados por m otores de búsqueda y metabuscadores ........... 179 1.2. Total recursos analizados.................................................................................... 182 2. El software de recuperación .................................................................................... 183 2.1. Análisis del funcionamiento de los motores en los distintos tipos de búsqueda ................................................................................................................... 18 3 2.1.1. Capacidad de búsqueda ............................................................................. 183 2.2. Análisis de la presentación de los resultados y la inform ación de los registros recuperados ........................................................................................................ 186 iii 2.2.1. Análisis del uso de metainformación en fu nción de la coincidencia de los títulos de la etiqueta <title > y del listado de recuperación 187 2.2.2. Términos de búsqueda destacados ............................................................ 190 2.2.3. Recursos dependientes .............................................................................. 194 2.2.4. Enlaces a páginas de contenido publicitario en los listados ...................... 197 3. Los componentes de los bu scadores y característ icas de la información recuperada ................................................................................................................ 200 3.1. Aspectos relacionados con el robot o crawler..................................................... 200 3.1.1. Profundidad de indización del sitio web ................................................... 200 3.2. Aspectos relacionados con el índice de los buscadores ...................................... 209 3.2.1. Duplicados................................................................................................. 209 3.2.2. Enlaces inactivos ....................................................................................... 212 3.3. Aspectos relacionados con la base de datos ........................................................ 215 3.3.1. Análisis de las carac terísticas de la información recuperada .................... 215 3.3.1.1. Actualización de la información proporcionada ............................. 215 3.3.1.2. Carácter de la información ............................................................. 218 3.3.1.3. Tipo de fichero ............................................................................... 222 3.3.1.4. Tipología documental .. ................ ................ ................ ................. .. 2 23 3.3.1.4.1. Análisis indi vidualizado de las búsquedas............................ 224 3.3.1.4.1.1. Búsqueda de un término ................................................. 224 3.3.1.4.1.2. Búsqueda utilizando el lenguaje natural ......................... 230 3.3.1.4.1.3. Búsqueda con operadores de existencia ......................... 236 3.3.1.4.1.4. Búsqueda booleana ......................................................... 242 3.3.1.4.1.5. Búsqueda de frase ........................................................... 247 3.3.1.4.1.6. Búsqueda por campo ...................................................... 253 4. Cobertura y solapamiento ....................................................................................... 266 4.1. Análisis de páginas únicas y solapamiento ......................................................... 266 4.1.1. Páginas únicas por motor de búsqueda...................................................... 269 4.1.2. Solapamiento entre buscadores. Análisis por búsquedas .......................... 272 4.1.2.1. Búsqueda de un térm ino ........................ ......................................... 273 4.1.2.2. Búsqueda utilizando el lenguaje natural ......................................... 274 4.1.2.3. Búsqueda con operadores de existencia ......................................... 275 4.1.2.4. Búsqueda booleana ......................................................................... 277 4.1.2.5. Búsqueda de frase ........................................................................... 278 4.1.2.6. Búsqueda por campo ...................................................................... 279 5. Análisis de la precisión técnica ................................................................................ 283 5.1. Búsqueda de un término ..................................................................................... 283 5.2. Búsqueda utilizando el lenguaje natural ............................................................. 285 iv 5.2.1. Análisis individualizado de los motores de búsqueda ............................... 286 5.2.2. Análisis comparativo de los motores de búsqueda .................................... 308 5.2.3. Análisis individualizado por metabuscadores ........................................... 315 5.2.4. Análisis comparativo de los metabuscadores ............................................ 343 5.3. Búsqueda con operadores de existencia ............................................................. 351 5.3.1. Análisis individualizado por motores de búsqueda ................................... 351 5.3.2. Análisis comparativo de los motores de búsqueda .................................... 367 5.3.3. Análisis individualizado por metabuscadores ........................................... 373 5.3.4. Análisis comparativo de los metabuscadores ............................................ 393 5.4. Búsqueda booleana ............................................................................................. 399 5.4.1. Análisis individualizado por motores de búsqueda ................................... 399 5.4.2. Análisis comparativo de los motores de búsqueda .................................... 406 5.4.3. Análisis individualizado por metabuscadores ........................................... 409 5.4.4. Análisis comparativo de los metabuscadores ............................................ 419 5.5. Búsqueda de frase ............................................................................................... 422 5.5.1. Análisis individualizado por motores de búsqueda ................................... 422 5.5.2. Análisis comparativo de los motores de búsqueda .................................... 426 5.5.3. Análisis individualizado por metabuscadores ........................................... 427 5.5.4. Análisis comparativo de los metabuscadores ............................................ 431 5.6. Búsqueda por campo ........................................................................................... 432 6. Análisis de la ordenación de resultados o ranking ................................................ 436 6.1. Utilización de la metainformación ................................................................ 436 6.2. Frecuencia y peso del término de búsqueda en las páginas recuperadas ............ 438 6.3. Correlación entre la frecuencia de aparición del término de búsqueda y el peso con la ordenación de los resultados de búsqueda ....................................... 454 IV. CONCLUSIONES ........................................................................................................ 457 BIBLIOGRAFÍA ................................................................................................................. 47 1 v Agradecimientos Quiero agradecer a todas las personas que de un modo u otro han posibilitado la realización del presente trabajo. En primer lugar tengo que dar las gracias al Profesor José Antonio Salvador Oliván, por su confianza en mí, al proponerme la realización de un trabajo tan interesante y por su inestimable colaboración en la resolución de cuantos problemas se m e han ido planteando en las diferentes fases de su realización. También tengo que agradecer el apoyo prestado a personas como José Mª Meléndez Vidal, que inicialmente me facilitó la consulta de los primeros trabajos en for- mato electrónico, y a Jorge Vidal Serrano por sus propuestas para facilitar la lectura de este trabajo. Tampoco puedo olvidarme del grupo de am igos que se prestaron de forma voluntaria para la realización de las búsquedas en los diferentes buscadores. En este sen- tido, quiero agradecer a Mª del Carmen Montolio, Susana Casaña Oliver, Blanca Angulo, Jorge Vidal Serrano, Domingo Bel Gaudó, Luis Fatás Fernández, Ernesto Her nández Mareca, José Romero Sánchez y al profesor Vicente Ramón Palerm, el entusiasmo con el que participaron en las dos sesiones de esta fase. No puedo olvidarme de todas aquellas personas que han estado cerca de mí, animándom e y facilitándome lo necesario para que este trabajo saliera adelante. Así pues, debo dar las gracias a Matilde Cantín Luna, Directora de la Biblioteca María Moliner de la Facultad de Filosofía y Letras de la Universidad de Zaragoza por facilitarm e el uso de sus instalaciones para llevar a cabo la parte práctica de la evaluación, a Antonio Cubillo, Operador Informático de la Facultad de Filosofía y Letras, por su cooperación en el al- macenam iento de la documentación electrónica en el Servidor de la Facultad, y a Agustín Urdangarín, director del Centro de Document ación Científica de la Universidad de Zara- goza, por su colaboración en la solución a alguno de los problemas informáticos que sur- gieron a lo largo del trabajo, y al Profesor Angel López Molinero, de la Facultad de Cien- cias por sus consejos para la realización del material gráfico. También quiero mencionar, por su constante apoyo y ánimo recibido a lo largo del trabajo, al Profesor Francisco Marco Simón y a su m ujer, Cristina y a su hija, Cristina Marco. Finalmente, he de dar las gracias a mi familia, que desde el principio han mostrado todo su apoyo y comprensión, facilitándom e la realización de este trabajo. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 6 establecer los criterios e indicadores de evaluación, cuyos valores nos permitirán cuanti- ficar determinados aspectos relacionados con su funcionamiento y recuperación. Planteamos una metodología centrada en el análisis de los aspectos relacionados con los objetivos propuestos, que sea simp le pero consistente, de manera que permita, como hemos señalado, no sólo realizar comp araciones entre los sistemas, sino también repetirse cada cierto tiempo, y observar su evolución. Para la obtención de los datos que nos han de servir de muestra en el análisis, lanzamos diferentes tipos de búsqueda. La primera se basa en la recuperación de docu- mentos que traten sobre un término de búsqueda. La segunda es una sucesión de términos que corresponde a una búsqueda en lenguaje natural. Para analizar su funcionamiento ante búsquedas avanzadas hemos realizado una tercera búsqueda basada en el uso de ope- radores booleanos, la cuarta incluye operadores de existencia, la quinta, es una búsqueda de frase y la sexta es una búsqueda en el cam po título. Un estudio de evaluación previo al presente trabajo 7 , nos permitió observar la especificidad de la mayoría de trabajos de evaluación de estas herramientas, centrándose en la valoración de determinados criterios y fundamentalmente en la precisión, ya que se considera uno de los aspectos más importantes en los sistemas de recuperación de infor- mación. Por otro lado advertimos la necesidad de desarrollar una metodología que permi- tiera valorar estas herramientas atendiendo tanto a las características como al funciona- miento de sus com ponentes. Para evitar o al menos minimizar la subjetividad, utilizaremos una metodología basada en valores estadísticos. El presente estudio se estructura básicamente en tres grandes apartados. En el primero de ellos, de carácter introductorio, analizamos el marco contextual en el que se halla la información, es decir, la red Internet y la World Wide Web, prestando especial atención tanto al origen y la evolución como a las características de la información y ser- vicios que contienen. El siguiente punto de interés lo componen los principales sistemas que se utilizan para recuperarla, es decir los buscadores y sus clases, su funcionamiento, ocupándonos también de los sistemas de recuperación de información tradicionales, ya 7 SALVADOR OLIVÁN, José Antonio y VIDAL BORDES, Fco. Javier. (2000) Introducción 7 que suponen el origen de las herramientas Web, aunque ambos desempeñan sus funcio- nes ante colecciones documentales sensiblemente diferentes. Esto nos lleva a analizar los factores internos y externos que influyen en la recuperación de recursos web. Al final del apartado introductorio abordamos el tema de la evaluación de los sistemas de recupera- ción, fundamentalmente de los buscadores de Internet, analizando experiencias previas que recogemos en el estado de la cuestión, y que a su vez nos han servido para seleccio- nar los indicadores utilizados en nuestra evaluación. El segundo apartado se ocupa de explicar la metodología adoptada para la eva- luación, dedicando el tercer apartado a exponer y analizar los resultados, de los que se extraen las conclusiones que reflejamos en el apartado final. 9 1. Internet y la World Wide Web 1.1. La red Internet La red Internet, cuyo término responde a la contracción de Internetworking of computers, es una red de ordenadores conectados siguiendo una arquitectura distribuida, que está formada por la interconexión de diversas redes de ordenadores de todo el mundo que utilizan protocolos de comunicación TCP/IP y soporta diferentes tipos de platafor- mas. El Federal Networking Council (FNC) definió en 1995 Internet, como un siste- ma de información global que está interconectado por un único espacio de direcciones basado en el Internet Protocol (IP) o sus futuras extensiones o adiciones, capaz de sopor- tar comunicaciones que usen el conjunto Transmission Control Protocol/Internet Protocol (TCP/IP), sus futuras extensiones o adicione s y otros protocolos compatibles, y propor- ciona, utiliza o facilita el acceso público o privado, a servicios de alto nivel basados en la infraestructura de comunicaciones. Nogales (1999a) recoge una definición m uy acertada del ISOC, en la que se hace referencia no sólo a lo que es, sino tam bién a lo que supone. Así, Internet es una: “red global de redes que permite a toda clase de ordenadores comunicarse y compartir servicios de forma directa y transparente a través de buena parte del mundo. Puesto que Internet es un potencial enormemente valioso que ofrece tantas posibilidades para tantas personas y organizaciones, también const ituye un re curso global y compartido de información y conocimiento, y un medio de colaboración y cooperación entre innume- rables comunidades diferentes”. Podemos destacar, por tanto, entre sus funciones básicas, el constituir un sistema de comunicación y de información, lo que permite conectarse a la red, prácticamente des- de cualquier ordenador personal, tanto para difundir com o para acceder a la inform ación. 1.1.1. Breve introducción histórica Aunque no es objetivo prioritario de nuestra investigación tratar de la historia de Internet, una visión histórica desde sus orígenes hasta la actualidad puede ayudarnos a comprender mejor tanto el concepto y su situación actual, como la variedad de servicios que la componen. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 10 1.1.1.1. Primeras investigaciones. Las redes y los protocolos Existe en la actualidad un importante número de estudios dedicados a analizar la red Internet desde distintos puntos de vista. El profesor Ubieto Artur (1995) y Alonso Berrocal y otros (2004), en sus respectivas obras sobre el tema, dedican un interesante capítulo a explicar la gestación del fenóm eno Internet. La red Internet como la conocemos en la actualidad, es fruto tanto de la evolu- ción de las redes y protocolos de comunicación, como de programas informáticos, y su éxito a finales de los 80, coincide con la aparición de la Web y la adquisición de un ma- yor carácter comercial, frente a su utilidad inicial, más relacionada con el ámbito militar y científico. Aunque no hay acuerdo unánime sobre la fecha que marca el inicio de Internet, algunos autores la sitúan a inicios de los años 60 con Robert Taylor, director de la oficina de técni cas de proceso de datos de ARPA 8 y del Computer Research Program, quien em- pezó a investigar la posibilidad de conectar ordenadores de diferentes centros de investi- gación. Poco después, en 1964 Paul Baran, de l laboratorio de in vestigación americano RAND Corporation, desarrolla los conceptos de redes de comunicación distribuida, for- madas por varios nodos interconectados sin que exista uno central, y de conmutación de paquetes, que se des arrollarán más adelante en el seno de ARPA, financiando proyectos de investigación dedicados a la informática, a la tecnología y al tratamiento de la infor- mación. Los primeros frutos en la creación de la red darán lugar a ARPANET 9 en 1969, constituyéndose en el elemento aglutinante de las investigaciones desarrolladas hasta el mom ento y aún de las que tendrán lugar en años posteriores. Para Leiner (1997) los orí- genes hay que situarlos en 1962, cuando Joseph Carl Robnett Licklider, del MIT (Massa- chussets Institute of Technology), planteó la posibilidad de llevar a cabo una red interco- nectada globalmente que permitiera el acceso desde cualquier lugar a datos y programas desarrollando la idea posteriormente, con su paso a ARPA. 8 Institución americana dedicada al desarrollo de proy ectos de investigación que ha ido cam biando de nom- bre varias veces consecutivas, entre AR PA y DARPA (Defense Advanced Research Projects Agency), que es como se la conoce en la actualidad. 9 Inicialmente la constituyeron nodos localizados en la Universidad de California, Los Ang eles, (UCLA), el Instituto de In vestigación de Stanfo rd, la Universidad d e California, en Santa Bárbara, y la Un iversidad de Utah. La red ARPANET dejó de funcionar en 1991. Introducción 11 Leonard Kleinrock también se ocupaba desde 1961 de desarrollar la conmuta- ción de paquetes, método de telecomunicación que resultó fundamental y que llevado a la práctica en 1967 por Lawrence G. Roberts, de DARPA, permitió conectar dos ordenado- res remotos a través de la línea telefónica para el intercambio de datos. Por otro lado, en el NPL (National Physical Laboratory), Donald Davies y Roger Scantlebury se ocupaban a su vez de la investigación en redes de transm isión. En 1972 se produce la primera demostración pública de la red a cargo de Robert E. Kahn en la International Coference on Computer Communications, y ya en 1988, la red Internet alcanza una mayor popularidad, con la creación de redes locales y privadas que favorecerán la introducción de contenidos m ás variados, y de un uso más comercial. Al margen de estos aspectos puntuales, respecto a la evolución técnica, un hecho importante es la adopción en 1983 como estándar del conjunto de protocolos de comuni- cación TCP/IP (Transmission Control Protocol/Internet Protocol) 10 , más seguro que su antecesor NCP (Network Control Protocol). Esto, unido al desarrollo de las pasarelas entre redes (Gateway), permitió la convivencia de distintas tecnologías y diferentes redes. El trabajo fue f ruto de la colaboración e ntre Robert E. Kahn y Vinton Cerf de la Univer- sidad de Stanford. Los protocolos OSI (X.25, X.400, X.500) 11 , que se venían utilizando en la déca- da de los 80 en las redes académicas y de investigación europeas, fueron sustituidos por servicios basados en protocolos TCP/IP. De aquí que algunos autores sitúen en 1983 la fecha de nacim iento de Internet, ya que es cuando se generaliza el uso de este protocolo, cuyo nombre, además, contiene dicho término. De hecho, en los años 80 se observa un gran interés en el desarro llo de redes e n universidades americanas (USENET, BITNET, etcétera), que a lo largo de esta década irán uniéndose entre si, para favorecer el inter- cambio de inform ación. 10 Siglas que significan Transm ission Control Protocol/Internet Protocol, que en 1978 sustituyen al Proto- colo NCP (Ne twork Control Protoc ol) en el que se aprecian limitaciones. 11 Sanz considera las c onexiones que se realizaban desde el Departam ento de Ingeniería Telemática de la Escuela Superior de Ingenieros de Telecomunica ciones de la Universida d Politécnica de Madrid con la red EUnet, y a través de ella con la USENET americana, como pioneras en el uso de Internet desde Espa ña. Los servicios que se obtenían se basaban en la m ensajería elect rónica y en grupos de noticias. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 12 La unión de ARPANET con otras redes, tanto americanas (NSFNet 12 a m ediados de los 80 o la Nationa l Research and Education Net, NREN) 13 , como europeas (EUNet) 14 y de otros países asiáticos, además de la creación y conexión a finales de esta década, de otras redes científicas regionales 15 , supuso un paso adelante en el desarrollo de la red, al alcanzar contenidos y fines favorables a la docencia e investigación. ARPANET acabará dividiéndose en dos redes, una de carácter m ilitar (MILNET) y otra para fines científicos y de investigación (NSFNet). Pese a la desaparición de la red A RPANET en 1988, Internet cuenta ya con una gran popularidad, incrementada en los años nove nta, en los que se aprecia un gran interés por conectarse de forma particular y acceder a los diferentes servicios soportados por la red. 1.1.1.2. Los servicios y sus protocolos. Las primeras herramientas de re- cuperación de información en Internet La mayoría de servicios de la red utilizan la estructura cliente-servidor, que con- siste en la existencia de un ordenador con una serie de programas que le permiten actuar como servidor, al que el usuario se conecta desde el ordenador que contiene el programa cliente, y mediante el cuál puede solicitar bien un documento, una información, un servi- cio, etcétera. Para que la comunicación pueda producirse, ambos han de estar conectados a la red. De aquí que el primer servicio de la red suponía perm itir la conexión entre dife- rentes servidores. El correo electrónico se venía utilizando desde 1972 gracias al trabajo de Ray Tomlinson, que se ocupó de desarrollar un program a de gestión del correo. Posteriormen- 12 La National Science Foundation Network fue creada en 1985 conectando inicialm ente a cinco centros estadounidenses, posibilitando poco después la conexión al resto de la co munidad científica. 13 Red que surg ió con objetivos claros de impulsar el uso y desarrollo de las nuevas tecnolog ías en el ámbi- to educativo, a todos sus niveles, así como posibilitar la infraestructura necesaria para alcanzar e stos obje- tivos. 14 En 1982, unía Ho landa, Dinamarca, Suecia y Reino Un ido. Inicialmente tiene carácter académico pasan- do después a tener una dedicación más come rcial. 15 En Europa ex istían entre otras NORDUnet en lo s países nórdicos, INRIA en Francia , CNUCE en Italia, UCL en Reino Unido y CWI en Holanda. En 1984 surgen JANET en Reino Uni do, DFN en Alem ania y SUNET en Suecia. Dos años más tarde SURFnet en Holanda, en 1987 SWITCH en Suiza y al año sigui en- te RedIRIS en España y GARR en Italia. (Sanz, M. A.) Introducción 13 te se utilizó además para poner en contacto a equipos de personas que se inscribían en los llamados Grupos de discusión y Listas de distribución o de correo 16 . A finales de los años 70 se había creado, en el seno de la Universidad de Duke, en Carolina del Norte, la red USENET 17 centrada en favorecer el desarrollo de los grupos de discusión o Newsgroups 18 . Los protocolos utilizados por estos servicios varían; así, el correo electrónico utilizaba inicialmente el protocolo SMTP (Simple Mail Transfer Protocol) adoptando posteriormente el protocolo MIME (Multipurpose Internet Mail Extensions) que se m an- tiene en la actualidad, y que permite el enví o y recepción de ficheros con distintos forma- tos. Dos nuevos protocolos de correo aparecen en los años 80, el POP (Post Office Proto- col) que facilita la gestión del correo en los ordenadores personales y no en servidores específicos como hasta entonces y el IMAP (Internet Message Access Protocol), interfaz gráfica que mantiene los mensajes en el servidor. Las news utilizaron inicialmente el pro- tocolo UUCP (Unix to Unix Copy), y desd e 1984 el protocolo NNTP (Network News Transfer Protocol). Aunque inicialmente estos servicios requerían programas específicos para acce- der a ellos, por ejemplo LISTSERV y Majordom o para los grupos de discusión, actual- mente son accesibles a través de la Web mediante los navegadores que se usan habitual- mente. Para localizar direcciones de correo se utilizaron tanto el programa Netfind, ser- vidores WHOIS y los directorios X.500, que por problemas de actualización fueron per- diendo interés, por lo que se derivó, hacia las llamadas “páginas blancas”, elaboradas con direcciones electrónicas de particulares, con los datos enviados por los propios interesa- 16 En 1975 Steve Walker crea la primera Lista de correo ( mailing list ) 17 Contracción de “ User’s Network” se refería tanto a la red como al servicio que a través de la línea telefó- nica permitía el intercambio de información especializada mediante un programa de mensajería electrónica. Posteriormente utilizó la red Intern et. Los mensajes se depositaban en un servidor a modo de tablón de anuncios, por lo que podía ser consultado l ibreme nte. 18 El motor de búsqueda Google permite actualmente acceder a la base de datos de USE NET para realizar búsquedas de documentación relacionada con estos grupos. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 14 dos, y las “páginas amarillas”, con direcciones de empresas. Podemos mencionar en este sentido los directorios BigFoot 19 , Four11 20 y W hoWhere 21 . Por otro lado, el servicio de transferencia de ficheros (FTP) entre ordenadores se desarrolla en los 90 22 junto con la conexión Telnet a ordenadores remotos, si bien, los orígenes del protocolo FTP se remontan a principios de los 70. Se denomina File Transfer Protocol (FTP) tanto a la aplicación como al servicio que permite la transferencia de ficheros entre ordenadores, facilitando a los usuarios au- torizados (User FTP), realizar un intercambio de ficheros entre distintos ordenadores, y a todo tipo de usuarios (anonymous FTP), la simple transferencia de ficheros al ordenador propio. Los servidores FTP pueden contener documentos en formato ASCII (American Standard Code for Information Interchange), PostScript, SGML, programas de ordenador y ficheros de imágenes y sonido (García Camarero, 2001). Para facilitar la búsqueda de ficheros en este tipo de servidores, se creó en 1990 Archie 23 , accesible al p úblico desde 1992. S u capacidad de búsqueda en un gran número de servidores seleccionados es una de sus principales características. Constaba de una base de datos, de actualización quincenal en la que se registraban los nombres de archi- vos localizados en sitios FTP anónimos de Internet, otra de descripción del software, y un sencillo interfaz que se debía configurar en cada conexión. Para aligerar su trabajo se creó una red de servidores que contenían copias de la base de datos. Es te servicio se utili- zaba fundamentalmente mediante una conexión Telnet, un cliente Archie o también a través del correo electrónico 24 . Su utilización mediante programas cliente de carácter gráfico como Wsarchie facilitó en gran medida su mayor difusión. A pesar de todo, la capacidad de recuperación de información seguía siendo lim itada. 19 Facilita las búsquedas de personas de EEUU. Puede accede rse a través de la Web en la dirección http://Search.bigfo ot.com 20 Actualmente pertenece a Yahoo. 21 Actualmente lo controla Lycos. 22 Existe cierta confusión entre las fecha s que ofrecen determinados investigadores sobre estos servicios debido a que se tra ta de sistemas que pueden tener su origen e xperimental en años anterior es pero que o bien se dan a co nocer más tarde o bien es posteriormente cuando ad quieren interés o vigencia en la red. 23 Evolucionó al buscador ArchiePlex, siendo sustituido en la actualidad por el buscador FTPSearch (Ubie- to, 2002). 24 Para más inform ación sobre el funcionam iento de estas herrami entas véase la obra de Gilster (1996). Introducción 15 Para realizar una conexión Telnet se requiere una aplicación como NCSA Telnet u otra similar, que permita la conexión de un ordenador a otro más potente o host, convir- tiendo al ordenador que inicia la conexión en un Terminal, lo que hace posible la interac- tuación entre ordenadores, la compartición de aplicaciones y la gestión de un gran núme- ro de datos, por lo que este tipo de conexiones se utilizó desde un principio, fundamental- mente para acceder a bases de datos y a catálogos de bibliotecas. En este sentido, hemos de señalar la existencia de herramientas como Hytelnet (Hypertext browser for telnet- accesible sites) 25 y LIBS 26 que facilitaban el acceso, mediante Telnet u otro tipo de co- nexión, a los catálogos de un gran número de bibliotecas de forma directa o a través del protocolo Z.39.50. Les caracteriza el facilitar la búsqueda de recursos mediante la nave- gación a través de enlaces. Importa destacar el hecho de que los lenguajes hipertextuales 27 comienzan a te- ner aplicación en Internet. El siguiente paso en este sentido se dará con el sistema Gop- her. Según Paul Gilster (1996) el programa Gopher y la tecnología que le acompaña aparecen en 1991 en el seno de la Universidad de Minnesota, en EEUU, como método de organización y recuperación de información relacionada con esta institución, extendién- dose posteriormente como sistem a de navegaci ón por la red, ya que permitía la conexión entre distintos servidores de información mediante la activación de enlaces y el acceso a diferentes recursos. Basado en la estructura cliente-servidor, soporta el protocolo y pro- grama de consulta del mismo nom bre, con la peculiaridad de permitir el acceso a docu- mentos en formato texto, imagen o sonido, pero de forma aislada, es decir, sin integrarlos en un mismo docum ento. La información disponible en este tipo de servidores se caracteriza por aparecer organizada jerárquicamente por temas, con documentos que pueden estar alojados en un 25 Programa perm itía acceder no sólo a sesiones Telnet en determ inados servidores Telnet, Gopher, WAIS y World Wide Web, s ino también a OPACS que no e ran accesibles a través de la W eb. El directorio Web- CATS (http://www.li ghts.com /webcats/) siguió sus pasos entre 1995-2000 y en la actualidad se accede desde el Directorio Libdex (http://www.libdex.com ) 26 (Library Internet Browsing Software). Inform ación sobre este program a puede obtenerse en el trabajo de Stanton y Hooper (1992). 27 Lenguaje que se est aba estudia ndo desde 1945 por Vannevar Bush, posteriormente por Ted Nel son que lo aplica en la creación de textos no lineales. Dou glas Egelbart lo aplicó a textos en red. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 22 lenguaje HTML (HiperText Markup Language) y el protocolo de transmisión HTTP (HiperText Transfer Protocol). En 1993 la compañía NCSA (National Cente r for Superco mputing Applica tions) y la Universidad de Illinois presentan Mosaic, un navegador de visualización gráfica que soportaba plataformas con diversos sistemas operativos (MS W indows, Macintosh y esta- ciones de trabajo UNIX con X- Windows) que evolucionará tras la denominación Naviga- tor, a Netscape, actualmente Mozilla. En 1995 aparece la primera versión de Explorer, de la compañía Microsoft. Desde entonces estos programas no han dejado de evolucionar y en sus últimas versiones ofrecen, además de la propia herramienta de navegación, otras utilidades como editores de páginas web, programas de acceso a News, al correo electró- nico, al Chat, etcétera, permitiendo no sólo el acceso a servidores Web sino también co- nexiones Telnet, Gopher, etcétera. En los últimos años ha proliferado el uso de programas gráficos, de sonido, vi- deo, multimedia y de comunicación en tiempo real. Así el popular Chat, término con que se expresa la técnica conocida como IRC (Internet Relay Chat), utilizado desde 1988, tiene su origen en lo que se conocía como Talk, que perm itía la comunicación en tiempo real entre dos o más personas a través de m ensajes escritos. Internet Phone es otra herra- mienta de este tipo, que facilita la comunicación mediante voz, siendo cada vez más utili- zados otra serie de programas que facilitan el contacto audiovisual entre varias personas, permitiendo servicios com o la videoconferencia. Las tecnologías relacionadas con la imagen y el sonido, y su difusión a través de la red, como la tecnología multicast, basada en el envío de imágenes y sonido a las máqui nas desde las que se solicita, pueden ser las que obtengan un mayor desarrollo en los próximos años, ya que hasta la actualidad se han visto limitadas por el insuficiente ancho de banda que las soporta. Para su visualización se utilizan programas como NetMeeting de la compañía Microsoft, o bien otros de carác- ter comercial com o CUseeMe, etcétera. Por otro lado, hemos de señalar que la utilización del lenguaje HTML y la adop- ción de sistemas gráficos ha permitido ir dejando atrás la utilización de com andos para la consulta de bases de datos, siendo sustituidos por los denominados “botones” y otros elementos de carácter hipertextual. Finalmente, otros aspectos técnicos que han influido de form a notoria en el desa- rrollo de la Web, fueron la evolución de los ordenadores personales, las redes LAN (Lo- cal Area Network) y el desarrollo del Sistem a de Nombres de Dom inio (DNS). Introducción 23 1.2.2. Características técnicas y problemas de la inf ormación en la Web La forma de acceder a los recursos que la Web ofrece es variada, pero general- mente se realiza: por medio de la activación de enlaces a partir de una determinada pági- na de inicio, técnica que forma parte del con cepto de “navegación” ya que permite ir de una página a otra; por medio de los enlaces facilitados en los mensajes de correo o en información de las News, etcétera; m ediante la introducción de una dirección URL (Uni- form Resource Locutor) en la ventana prevista para ello que ofrecen los navegadores 39 ; utilizando algunos de los portales especialmente diseñados para acceder a los servicios de Internet, por ejem plo las páginas de la mayoría de universidades así como las dependien- tes de empresas privadas como Terra, etcétera, o a través de búsquedas mediante sistemas de recuperación de recursos, ya sean directorios, agentes de búsqueda, o buscadores. Al conectarnos a cualquiera de los recursos alojados en los diferentes servidores, en nuestro navegador aparece la dirección URL perteneciente al sitio, página o recurso web. Estas conexion es son posib les gr acias a los servidores DNS (Domain Name Sys- tem). Los servidores DNS comenzaron a utilizarse en 1984 para facilitar la conexión entre ordenadores. Constan de una base de datos distribuida que contiene nombres de dominios de Internet que son traducidos a su correspondiente dirección IP 40 , que es el número asignado a cada máquina conectada a la red. Aunque inicialmente a cada má- quina o grupo de máquinas se le aplicaba un nombre de dominio, en la actualidad una máquina puede tener varios dominios y un gr upo de máquinas contener una misma direc- ción, como es el caso de servicios amplios. Las direcciones de Internet contienen el protocolo (ftp, telnet, gopher, news, http, etcétera), seguido de la dirección del ordenador al que nos queremos conectar, es 39 Actualmente determinados navegadores como Netscape y otros, han inc orporado a e sta ventana sus p ro- pios motores de búsqueda, por lo que además de una direcci ón URL admite n la inserción de términos de búsqueda q ue recuperan los d ocumentos o sitios web que los contienen. 40 La expresión consta de cuatro números separados entre ellos por un p unto, cuyos valor es van de 0 a 255 (por ej.: 199.72.1.1). InterNIC fue la pri mera em presa que se ocupó de la distribución de la num eración tanto en el ámbi to americano com o en otros países, bien m ediante el contacto con enti dades responsables o a través de empresas multinacionales. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 24 decir, el dominio del ordenador servidor. Este dominio está representado por una direc- ción IP a la que corresponde un determ inado nombre de dom inio. Los DNS que se utilizan en las conexiones Web constan de varios niveles. De derecha a izquierda podemos observar que el primer nivel, no siempre presente, puede represen tar al pa ís al qu e pertenec e el cará cter de l a información de l sitio we b. El res to de niveles o subdominios contiene información sobre la institución que aloja las páginas web y el nombre de la máquina (Hostname) en que se alojan. Por ejemplo, en Estados Unidos, existen una serie de dominios genéricos de máximo nivel que indican el carácter de la información que contienen, bien sea comercial (.com), militar (.mil), educativo (.edu) o gubernamental (.gov) y otros más recientes relacionados con el ocio (.rec), in- dustria aeroespacial (.aero), empresas (.biz), cooperativas (.coop), museos (.museum ), etcétera. Algunos de estos se utilizan también en otros países, además de los dominios geográficos relacionados con su nombre, por ejemplo .uk para Reino Unido, .fr para Francia, .es para España 41 . Los recursos Web pueden ubicarse en diferentes directorios y subdirectorios del servidor, lo que influye en que estas direcciones Web sean más o me- nos amplias en función del nivel jerárquico de la carpeta en el que dicho recurso se en- cuentra. Estos niveles suelen separarse mediante el signo slash “/” y se sitúan a la derecha del primer nivel. Estas direcciones siguen una organizan jerárquica. Una dirección genérica suele acabar con la indicación del dominio de m áximo nivel, por ejem plo http://www.unizar.es/index.html pero una dirección más específica puede contener a con- tinuación los nombres de los directorios y subdirectorios en los que se encuentra un do- cumento. Siguiendo el esquema anteriormente señalado, la dirección de la página Web del Defensor Universitario de la Universidad de Zaragoza (http://www.unizar.es/defensor _universitario/), aparece en primer lugar el protocolo (http) seguido por un primer bloque hasta el primer signo de slahs que contiene de derecha a izquierda el nombre del dominio de máxim o nivel (.es), al que precede el nombre del dominio de segundo nivel, relacio- nado con la organización (unizar). Le sigue al bloque el nombre del directorio en el que se encuentran las páginas de esta institución (/defensor_universitario/). Esta expresión 41 Existe una ord en ministerial, la número 6100 de 21 de m arzo de 2000 que regula en España el sistema de asignación de nom bres de domini o. Introducción 25 completa constituye la URL de la página principal de acceso a la información que ofrece este servicio. Las direcciones URL contienen pues el protocolo de comunicación o transmi- sión, representado por el tipo de servidor (http, para documentos hipertextuales; ftp, para ficheros o programas, etcétera); en segundo lugar el nombre del protocolo Internet sepa- rado del anterior por dos puntos y dos barras (Ej.: ftp o www, aunque no siempre apare- ce); el nombre del servidor o del dominio, tam bién conocido como host (Ej.: unizar.es) y el nombre del directorio y de la página (/defensor_universitario/intermediainform a.htm). Además los navegadores, en servidores que contienen una página de inicio, in- terpretan que hay que abrir la mism a página independientemente de que se exprese este término en su dirección. Así, se accederá al mismo recurso al teclear http://www.unizar.es que http://www.unizar.es/inicio. Dicho aspecto lo hemos tenido en cuenta a la hora de comparar distintos aspectos del rendimiento de los motores de bús- queda, como son el solapamiento de recursos, cuyo cálculo se basa en la comparación de direcciones URL idénticas. Estas direcciones pueden estar formadas además por caracteres que para su codi- ficación requieran una notación especial. Este problema aparece frecuentemente en los multibuscadores, que añaden o sustituyen signos de las URL de los recursos por otros. Por ejemplo es frecuente la sustitución del signo tilde “~”, que se utiliza para señalar di- rectorios personales, por su valor codificado %7E. Su finalidad es evitar conflictos de interpretación por los navegadores. En otras ocasiones añaden cadenas de términos en las que se expresa una acción, por ejemplo “search=” o bien el signo de interrogación “? ” junto a los parámetros de búsqueda. Uno de los principales problemas que plantean los nombres de dominio, del sitio y de la página es su falta de continuidad, es decir que se modifican cuando se cambia un sitio o página web a otro servidor, o cuando se cambia el nombre del servidor o los nom- bres de los directorios que contienen los sitios o páginas web, o simplem ente cuando la página deja de existir. La no actualización automática de los enlaces que apuntan a estos recursos provoca problemas de acceso. Para solucionarlo se han propuesto un URL 42 per- 42 Abreviatura de Uniform Resource Locator según las RFC (Request for Com me nts) 1738. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 26 sistente, el PURL (Persistent Uniform Res ource Locator) o el DOI (Digital Object Identi- fier) promovido inicialmente por una asociación americana de editores. También hay otras soluciones que están previstas en el software de mantenim iento de los sitios web, aunque unas y otras propuestas no term inan de imponerse. Cuando el navegador no localiza una dirección, devuelve al usuario un mensaje de error, generalmente con un número. Así, el error 404 indica que la dirección es inco- rrecta, el recurso no está disponible, ha cambiado de ubicación o ya no existe. El error 403 indica que el recurso no es accesible de forma libre. Otras incidencias pueden ser debidas a que el recurso se encuentre demasiado solicitado en un determinado m omento o que, por diversas circunstancias, se supere el tiem po de conexión. En el ámbito internacional, el organismo que se ocupa de coordinar y gestionar los nombres y números de los diferentes dom inios es el ICANN (Internet Corporation for Assigned Names and Numbers) 43 . De la solicitud de dominios de segundo nivel, por ejemplo (.com.es) se ocupa el DYNS (Dynamic Network Services) 44 o Red.es dominios 45 en el caso de España. El acceso a los recursos generalmente suele ser libre y gratuito, siendo necesa- rio, en algunas ocasiones, una simple inscripción. Otras veces el acceso es restringido y puede exigirse el pago de una cuota o suscripc ión como es el caso de los sitios Web que, por ejemplo, permiten el acceso a determinadas bases de datos y revistas electrónicas. También hay servidores de acceso mixto que permiten la consulta y utilización libre de una parte de sus recursos, limitando la consulta del resto. Estas limitaciones tienen tam- bién sus repercusiones en los motores de búsqueda cuyas arañas no pueden acceder a determinados recursos para indizarlos, por lo que son difíciles de localizar para el usua- rio, de aquí que formen parte de la denominada W eb oculta. Desde el punto de vista terminológico, los servidores Web contienen lo que se denomina “sedes web”, const ituidas, además de por una URL, por un conjunto de pági- nas web. Pueden formar parte de un único serv idor o de varios, aunque existen casos en 43 http://www.icann.org 44 http://dyndns.org 45 Entidad pública empresarial delegada p ara la gesti ón del registro de nombres de dominio en In ternet bajo el código “.es”. Introducción 27 que un mismo servidor aloja distintos sitios web. Codina (2000) las define como entida- des digitales identificadas por una URL que contiene uno o m ás recursos. Aguillo (1999) define la página web como fichero o conjunto de ficheros infor- máticos que constituyen un documento en lenguaje de maquetación hipertextual (Hyper- text Markup Language o HTML), es decir hipertextual y multimedia, identificable a tra- vés de la red con un URL propio, una direcci ón e n l a Web. Una definición pos terior de este autor (Aguillo 2000) matiza y aclara la anterior, al definirla como “unidad de visua- lización que produce un navega dor WWW cuando interpreta una direcci ón URL de un documento HTML o sim ilar con todos los ficheros asociados”. Por tanto, una página web está formada por un fichero electrónico y los que lo acompañan, bien en forma de imagen o sonido, y que además, y esto es más importante, es identificable a través de un URL propio, por lo que, cada documento con dirección propia es una página web. Cada uno de estos componente s pueden ser documentos del tipo PDF (Portable Document Format), Office, o imágenes de tipo JPEG (Joi nt Photographic Exp erts Group), TIFF (Tagged Image File Format), P NG (Portable Network Graphics), o bien imágenes en movimiento en formato MPEG (Moving Picture Experts Group), MOV- Quicktime, AVI (Audio Video Interleave). Para sonidos se utilizan ficheros midi o WAV (Windows Wave), entre otros. Los elementos integrantes tamb ién pueden presentarse en formato comprim ido, generalmente en formato ZIP. La existencia de esta variedad de documentos, se debe en parte a la fuerte presencia que en los últimos años están teniendo los medios audiovisuales en la W eb. Como hemos señalado, estas páginas se realizan generalmente mediante progra- mas editores que utilizan un lenguaje de marcas denominado HTML (HiperText Markup Language), del que existen diferentes versiones, o mediante el lenguaje XML (Extensible Markup Language) más actual, derivados ambos de SGML (Standard Generalized Mar- kup Language). Estas marcas permiten tanto formatear el documento y dotarlo de imáge- nes y sonidos, que son ficheros con extensiones propias, como crear enlaces a diferentes partes del documento o a otros documentos. Para ello utilizan los elementos propios co- mo anclas y enlaces. Proporcionan además al documento una estructura que es aprove- Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 28 chada por determinados sistemas de búsqueda de información para elaborar sus índices, extrayendo información de determinadas partes como el título, el cuerpo o las etiquetas Meta 46 . El lenguaje HTML se caracteriza por su fácil aplicación, lo que explica, en par- te, el gran éxito de la Web en cuanto a producción de información. Sin embargo, como aspectos negativos, hay que señalar que no facilita la descripción de los documentos, pues un gran número de páginas se hallan desprovistas de algo tan básico para su locali- zación como es el título, el autor o la filiación, por no mencionar uno de los aspectos a los que a menudo se refieren los investigadores como posible solución a mu chos de los problemas que plantean los motores en la recuperación de información: el mínimo uso de los metadatos. Esta situación ha dado lugar al surgimiento de iniciativas que, aprove- chando el lenguaje de marcas, permiten una descripción cuya finalidad es obtener unos resultados más precisos en las búsquedas de información 47 . El problema puede ser solucionado con la adopción de un nuevo modelo de re- presentación de la información, el RDF (Res ource Description Framework), que admite metadatos de recursos en XML y de otros lenguajes, así como de recursos que contienen identificadores URI (Uniform Resource Identifiers). No sólo permite realizar una des- cripción de la página web, de una parte de ella o de un recurso que la integre, sino que también posibilita vincular conceptos, lo que va a permitir que las herramientas de bús- queda preparadas para ello, recuperen información m ás precisa al facilitar el cruce de datos y términos de diferentes índices 48 . Los creadores de páginas web son conscientes de las limitaciones del lenguaje HTML en cuanto a las posibilidades de ampli ación, de mejora en el diseño de las páginas y de estructuración del propio documento y de la información. El lenguaje XML da ma- yor importancia a las partes constitutivas del documento y a sus datos, lo que permite 46 Para más inform ación sobre la aplicación de este lenguaje en herram ientas de búsqueda puede consultar- se el trabajo de Hu y otros (2001b). 47 En el ámbito de la Unión Europea hem os de destacar el proyecto Renardus basado en la utilización de Metadatos que ha dado lugar a la existencia d el bus c ador del mismo nombre que permite recuperar recur- sos de interés académico, principalmente en lengua inglesa. Utiliza diversos directorios de calidad y orga- niza los recursos del directorio de acuerdo con la clas ificación de Dewey. Má s información puede obtener- se en <http://www.renardus.org> 48 Para más inform ación véase Manola, F. y Millar, E. (2003) Introducción 29 superar los inconvenientes del HTML, añadiendo ventajas como facilitar el desarrollo del comercio electrónico y de la recuperación e intercambio de inform ación. En este sentido, hay que mencionar la función de indización automática de la información contenida en sus etiquetas, que le permite reconocer el tipo de información que contiene, es decir, si se trata de un título, autor, palabra clave, etcétera. Dado que XML está basado en un están- dar abierto, no hay problemas de incom patibilidad entre sistemas operativos. Finalmente, otro lenguaje que se va imponiendo tras serle otorgado por el W3C 1999 el estatus de “Recomendación” es XHTML que se caracteriza por sintetizar las ventajas de los dos anteriores. Al margen de estos aspectos que tratan de desarrollar y mejorar la W eb, es fácil comprender el éxito de un medio que pone al alcance del usuario instrumentos de fácil e inmediato acceso, que además permiten de forma sencilla la realización de todo tipo de documentos, simples y complejos, y que además integra otros servicios de Internet como el correo electrónico, consulta de noticias o news, descargas de program as y archivos, etcétera. La integración de diferentes servicios de Internet con sus respectivos servidores se produce gracias a una serie de pasarelas que utilizan un software específico como es el caso de CGI (Common Gateway Interface), ASP (Active Server Pages), y PHP (Hiper- text Preprocessor) que añaden estas mismas terminaciones a sus páginas. La tecnología plug-in que, mediante pequeños programas, f acilita la visualización de gran número de elementos multim edia. Hay que señalar también por su importancia los programas que se realizan con Java y VRML (Virtual Reality Modeling Language) especializado en re- creaciones virtuales. Es de destacar la facilidad de uso tanto de las aplicaciones necesarias para los di- ferentes tipos de conexiones de Internet, com o de los programas navegadores, que facili- tan el uso del resto de servicios de la red. En este sentido hemos de referirnos a pro- yectos, como el Proyecto Oxígeno, que se lleva a cabo en el MIT y que trata de desarro- llar tecnologías que faciliten la navegación. Este aspecto, junto con el desarrollo de la Web semántica, a la que más adelante nos referiremos, y la tendencia hacia la integración no sólo de diferentes utilidades de Internet, sino de un número menor de herramientas con mayores capacidades y con la posibilidad de concentrar diferentes funciones, son los aspectos que marcan el desarrollo de los últimos años de la W eb. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 30 Su expansión es tal que ya se puede conectar a ella a través de otras gamas de aparatos distintas al ordenador personal, como son la televisión, el teléfono móvil o las agendas electrónicas. Por tanto, es un hecho que la Web está en continua evolución, lo que le confiere un gran dinamismo que influye, como no podía ser de otro modo, en todo su contenido. El éxito y acogida de la Web ha sido tal que está siendo cada vez más utilizada por servicios de búsqueda y distribuidores de bases de datos 49 para ofrecer sus servicios mediante éste sistema gráfico que facilita la interactividad. Lo mism o ocurre con las bi- bliotecas, ya que ofrecen no sólo información y diferentes servicios como el acceso a sus catálogos y bases de datos a través de servidores web, sino la consulta de documentos de todo tipo en formato digital. Así, para Rodríguez (2002:178) la Web es “un servicio de transferencia de información en línea que permite distribuir texto, im agen y sonido, posi- bilita la comunicación, facilita la realización de transacciones y entretenimiento…” La mayor parte de estudios que se refieren a la Web aluden a su carácter infor- mativo. Pero ¿cóm o es la información que contiene? Para contestar a esta pregunta, anali- zamos a continuación cómo esta dispuesta la información en la W eb y las características más destacadas de las páginas web. Uno de los aspectos fundamentales de la información en la Web, y a la que tal vez en parte debe su éxito, es el carácter distribuido de la información, con recursos de acceso totalmente libre y gratuito aunque, como hemos visto, existen otros de acceso res- tringido, e incluso de pago. Podemos citar en uno y otro sentido el acceso a bases de da- tos, a catálogos de bibliotecas y a revistas y libros electrónicos, así como a otro tipo de documentos de carácter científico como son: publicaciones de congresos, tesis doctorales y trabajos de investigación relacionados con todas las m aterias. Otro de los aspectos destacables de la información en la Web, al que constante- mente se hace referencia, es el gran número de documentos existente y en constante cre- 49 Muchas son las bases de datos, en su mayor parte de acceso restringido, que se ofrecen a través de Inter- net. Para el campo de la Docum entación hem os de seña lar la incorporación de la base de dat os LISA del Cambridge Scientific Abstracts, accesible a través de Internet Database Service en la dirección http://www.csa1.co.uk Introducción 31 cimiento 50 . Ello es debido a que en este medio, crear y dar a conocer la información es tan sencillo, que cada vez es mayor el número de personas que publican documentos, no siempre de buena calidad tanto en la forma como en el contenido. Por otro lado, existen grandes intereses comerciales cada vez más patentes, lo que influye en la existencia de un gran cúmulo de páginas de este tipo. No obstante hay que hablar también de la existencia de una parte importante de documentos de alto nivel científico. Un estudio de Jiménez Piano (2000), aporta datos en este sentido, al señalar que el 83% de la información de la Web es de carácter comercial, frente a un 6% de carácter científico. Un trabajo posterior de Lossau, (2004), estima en veintidós billones, el número de páginas de contenido cien- tífico existentes en la Web, incluyendo a las existentes en la W eb Invisible. Como vemos, los servidores web pueden contener información y obedecer a fi- nes de lo m ás variado. Así, podem os observar la convivencia de servidores como los dis- puestos por las universidades y centros de investigación, cuyo fin principal puede ser dar a conocer información relacionada con la propia institución, y con la producción científi- ca propia, con un marcado carácter de difusión de información y otros pertenecientes al ámbito empresarial, con un enfoque más comerc ial. Otros se centran más en ofrecer una serie de servicios, ya sea de localización y acceso a información específica, por ejemplo sobre viajes, economía, etcétera, o a determinado software, material audiovisual, ocio, etcétera. En este contexto, resulta llamativo el contraste entre la existencia de una amplia variedad de recursos, que van desde los grandes y sofisticados servicios web, a los servi- dores con simp les páginas de texto colocadas por usuarios a nivel particular. No obstante, un estudio de Lawrence y Giles (1999) menciona el alto valor científico de los contenidos de la web, lo que unido al relativamente bajo núm ero de servidores con este tipo de in- formación, podría hacer viable la indización de la información de carácter científico. Por otro lado, cada vez es más frecuente, que tanto los proveedores de las bases de datos en línea como las grandes firmas distribuidoras de publicaciones periódicas a texto completo, utilicen la Web para acceder, mediante suscripción, a sus servicios. Con 50 Delgado Martínez (2001) estimaba el núm ero de página s web en 1.200 millones. Otro estudio (Bergm an, 2001) señala la existencia de un billón de docum entos en la Web visible y 550 billones en 200.000 sitios web de la Web oculta. Estim aciones más recientes para la web visible, recogidas por D . Sullivan (20 05), señalan una cifra s uperior a 11,5 billones de páginas. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 38 de datos juegan un papel fundamental tanto el “diccionario de datos” que contiene toda la información relativa a los campos de la base de datos, como el índice invertido, formado por los términos que aparecen en los diferentes campos y por la información del docu- mento que los contiene. El segundo componente básico de estos sistemas lo constituyen los programas de gestión y recuperación, en los que radican una serie de funciones fundamentales en la recuperación tales como: soportar la lógica booleana, a través de las expresiones AND, OR y NOT; operadores de proximidad como NEAR y ADJ; de presencia o ausencia, me- diante los signos m odificadores (+) y (-); truncamientos mediante el signo asterisco (*) o interrogación (?); perm itir la búsqueda por campos; redefinir una búsqueda y finalm ente, facilitar una serie de técnicas como la ordenación o ranking, la equiparación exacta o Best m atch, el uso de modelos de recuperación como los probabilísticos o vectoriales así como técnicas de inteligencia artificial aplicadas a la recuperación de información. Como tercer componente Moscoso señala el software de interfaz “que es el que condiciona y determina la com unicación entre usuarios y el sistema”. Lancaster (1979) y Kent (1971), de una forma más específica señalan las si- guientes funciones de los SRI: ! Identificar la información relevante para el usuario. ! Analizar su contenido. ! Representar el contenido de forma que sea accesible mediante las consul- tas del usuario. ! Analizar las consultas del usuario y en su caso transformarlas para con- sultar de forma eficiente la base de datos. ! Permitir la búsqueda. ! Recuperar la información relevante. ! De ser necesario, permitir ajustes en la búsqueda para lanzarla de nuevo. Estas funciones las llevan a cabo una serie de subsistemas que Lancaster deno- mina subsistema documental, de indización, de vocabulario, de búsqueda, de usuario o interface y subsistema de com paración. Chowdury (1999:2), por su parte, señala tres subsistemas principales en los SRI: el subsistem a documental, el de los usuarios y el de búsqueda/recuperación. Estos subsis- temas se ocupan del análisis de documentos y organización de la información, es decir, de la creación de la base de datos; de analizar las preguntas de los usuarios, de la búsque- Introducción 39 da en la base de datos y de la recuperación. Para este autor, su objetivo es recopilar y organizar la información de uno o más temas para facilitarla al usuario, tan pronto como la solicite. Schwartz (1998) señala que los usuarios de estos sistemas raramente entienden o tienen en cuenta los mecanismos, y más raram ente aún, hacen completo uso de las capa- cidades que facilitan las herramientas de búsqueda. Esto es así a pesar de que una buena recuperación de información depende tanto de la pregunta como del buen m anejo de los sistemas. Desde el punto de vista histórico, debemos señalar que en la RI tienen lugar pro- cedimientos tan tradicionales como el sistema de tarjetas perforadas, pero es a partir de los años 50, con la aparición de los SRI Automatizados 69 (SRI) y más concretamente con la generalización de los procesadores de texto a partir de los 70, cuando alcanzan una mayor importancia, ya que estos nuevos sistemas van a ser utilizados tanto en bibliotecas, para la descripción, clasificación y búsqueda de docum entos; en los archivos; en las bases de datos en línea y en los CD-ROM. En esta década sitúa Moya (2002) el punto de parti- da de la Moderna Recuperación de la Inform ación, que adquiere un gran auge en los años 80 con el desarrollo de técnicas avanzadas como la ordenación por relevancia y la indiza- ción a texto completo. Para Salton, la Moderna Recuperación de la Información arranca de 1955 en una primera etapa, marcada por el uso de bases de datos bibliográficas y refe- renciales, que dura hasta 1975, fecha a partir de la que se ponen en práctica tanto técnicas de recuperación desarrolladas en el periodo anterior, como son los modelos basados en el espacio vectorial 70 y probabilístico, como nuevos lenguajes de búsqueda que facilitarán el acceso directo al recurso buscado. Dichas técnicas y modelos se irán aplicando a los SRI accesibles a través de In- ternet adaptándose en unos casos y desarrollándolos en otros. 69 Cleverdon y Mills (1963) definen a los Sistem as de Recuperación de la Información com o una organiza- ción completa para obtener, almacenar y facilitar inform ación. Les caracteriza además la existencia de personal capaz de evaluar la información antes d e ofrecerla al solicitante así como la existencia de un índi- ce de materias para facilitar la búsqued a. 70 Utilizado inicialmente por Salton en la evaluació n del Sistema Sm art. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 40 Posteriormente, con la aparición de la Web, se han ido probando continuamente nuevos sistemas que han dado lugar a la existencia de un numeroso y variado número de herramientas que tratan de hacer posible la RI. De este modo, los antecedentes m ás directos de las actuales herramientas de bús- queda web son los buscadores que se venían utilizando en Internet, a los que se les han ido aplicando las técnicas resultantes de la investigación en el campo de los SRI, cuyo desarrollo y mejora, a lo largo de los últim os años, ha sido constante. Así, las herramien- tas web han heredado de aquellos sistemas sus capacidades de almacenamiento y recupe- ración de información y han incorporado de la investigación aquellas técnicas que facili- tan un mejor desarrollo de las funciones para las que han sido diseñadas. Podemos citar en este sentido técnicas de recuperación como la equiparación (best-match), la Retroali- mentación por relevancia (Relevance Feedback), que permite reformular las búsquedas y la Clasificación automática (Data Clustering) con el fin de mejorar la recuperación. A pesar de todo, y tal vez debido a que nos encontram os en el mom ento inicial de su puesta en marcha, estas herramientas, presentan en la recuperación una serie de problem as, a los que deben hacer frente y solucionar. Abadal (2001) señala que el acceso y recuperación de la información en la Web “descansa sobre sistemas informáticos, básicamente sistemas de gestión de bases de da- tos, complementados con sistemas de navegación hipertextuales”. Esta frase sintetiza de forma clara cuál es el nivel de desarrollo en el que se encuentran actualmente estos sis- temas. De acuerdo con el modo de navegación por la red, este autor clasifica las herra- mientas de acceso y recuperación de la información de la siguiente forma: Sistemas de navegación de tipo jerárquico, sistemas de navegación hipertextuales y SRI. De estos sistemas nos interesan tanto los sistemas de clasificación de tipo jerárquico, dado que en ellos la información se estructura jerárquicam ente en clases y subclases, como es el caso de los Directorios, como los SRI, mediante los cuales se interroga a la base de datos por medio de un motor de búsqueda en el que se insertan los términos sobre los que se quiere obtener información, bien de forma aislada o mediante el uso de operadores y otras op- ciones de búsqueda. Esta variedad de sistemas da lugar a que la búsqueda de información en la Web se realice principalmente por medio de dos técnicas: la selección de hiperenlaces y la Introducción 41 interrogación de las bases de datos 71 . Algunos de estos sistemas, como AltaVista, Yahoo, etcétera, integran los dos modos de búsqueda. La consulta de las bases de datos de los buscadores se realiza, como en el resto de sistemas, de varias formas: bien insertando el término o términos en la ventana de bús- queda, ya sea de forma aislada o mediante operadores; realizando una búsqueda por fra- se; utilizando el lenguaje natural o con la ayuda de un tesauro. El motor lanza la consulta sobre el índice y presenta una página de resultados generalmente ordenados por relevan- cia. No obstante, hasta presentar los resultados, estos sistemas llevan a cabo con la información que extraen o que se les proporciona, como en el caso de los metabuscado- res, una serie de procesos, cuyo objetivo es facilitar, de forma rápida, la necesidad de información planteada por el usuario. El uso de estas técnicas, unido a otras características de estos sistemas, como son la interactividad, deberían dar lugar a la formación de instrumentos válidos para re- cuperar información relevante, pero el escaso tratamiento documental de la documenta- ción existente en la Web, y otras características que presenta la información en este me- dio, dificultan su efectividad. Por tanto debemo s pensar en los procedimientos relaciona- dos con la descripción como una de las soluciones para la mejora del funcionamiento de estas herramientas. En este sentido hemos de señalar el importante papel de los sistemas de metadatos y las iniciativas de un gran número de bibliotecas, bases de datos y orga- nismos como OCLC (Online Computer Library Center) que incorporan registros de re- cursos electrónicos a sus catálogos, así como otras iniciativas en el seno de la Web que constituyen auténticas bases de datos para recuperar recursos web. 2.2. Procesos de los SRI y s u repercusión en las herramientas de recuperación Web De todos es conocido que las bases de datos contienen registros formados por los datos que almacenan. Estos datos son indizados, dando lugar a índices de palabras 71 Baeza-Yates y Riviero-Neto (1999) añ aden además una tercera técnica basada en la simple activación de enlaces, para ir de un documento a otro Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 42 clave o de frases. En las bases de datos textuales o referenciales, sobre éstos índices se lanza la búsqueda, con la intención de localizar los documentos o referencias que contie- nen o se relacionan con los términos solicitados, siendo presentados en una pantalla de resultados. De aquí que las funciones más impor tantes sean la formación de la base de datos, la indización, la búsqueda y recuperación. Estas funciones se realizan de un m odo relacionado, de ahí su carácter de sistema. Su adecuado funcionamiento les ha de permitir alcanzar el fin para el que han sido diseñados: recuperar la información precisa. De aquí que la recuperación de inform ación haya adqui rido una gran importancia ya que se ocupa tanto de la representación, de la organización y del acceso a la información. (Abadal y Codina, 2005:29). A continuación nos referimos, de forma breve, a cada una de las funciones que se desarrollan en estos sistemas, para ponerlos en relación con los SRI de la W eb. 2.2.1. Formación de la base de datos La formación de las bases de datos se lleva a cabo de acuerdo con una serie de principios como puede ser el carácter científico de la información que contienen, así co- mo los propios de las empresas gestoras y creadoras de dichas bases de datos, que deci- den dedicarse a compilar información de uno o má s temas. La cobertura tiene que ver con su contenido y ha de posibilitar la obtención de un conjunto, lo más completo posible, de referencias, y en su caso documentos, sobre el tema de búsqueda. Como indica Abad (2004:98) puede verse influenciada por otros aspectos como: “el periodo de tiempo sobre el que el sistema puede proporcionar información retrospectivamente (cobertura tempo- ral), la procedencia geográfica (cobertura geográfica), los idiomas en los que están escri- tos los documentos (cobertura idiom ática) y el tipo de documento (libro, inform e, carta) ...” En la evaluación de bases de datos, indicadores para valorar la cobertura son el alcance y continuidad de los contenidos, la exhaustividad de la cobertura, la exclusividad de la cobertura o solapamiento y la puntualidad en la actualización del sistema de infor- mación (Abad, 2004). La formación de la base de datos es uno de los aspectos más importantes en las herramientas Web. Los motores de búsqueda básicamente contienen la información que han ido obteniendo las arañas de los servidores Web, desplazándose, a través de enlaces, a las páginas de interés. Otra parte es fruto de los envíos de información sobre determi- nadas páginas por parte de sus creadores o responsables. El número de consultas es tan Introducción 43 amplio que hace necesario la existencia de distintas versiones de sus bases de datos, a las que denominan espejos o m i rrors, que al alojarse en diferentes dom inios pueden presentar variantes en función del país al que pertenece dicho dom inio. En la Web se utilizan diferentes métodos para calcular la cobertura de los busca- dores. Bharat y Broder (1998) mencionan el Melee’s Indexing Coverage Analysis (MICA), basado en el recuento de páginas web por dom inio y, por otro lado, el utilizado en el sitio web especializado en analizar motores de búsqueda conocido como Search Engine Watch 72 que reali za esta funci ón a través del motor Seach Engine EKG y propo- nen otro m étodo basado en análisis estadístico, llevándolo a cabo m ediante el lanzamien- to de dos tandas de diez mil consultas cada una. Según estos autores, este método no pro- porciona valores absolutos sino estimados y a partir de ellos se llega a valorar el número de documentos existentes en la W eb. 2.2.2. El análisis documental Como señalan Peña y otros (2002:212) el análisis documental consiste en: La selección, almacenamiento y organización de ideas informativamente rele- vantes para facilitar su localización posterior. Incluye técnicas tradicionales de la docu- mentación como catalogación, indización, clasificación y resumen; y no tradicionales como indización automática, extracto automático y evaluación de concordancia ( mat- ching , en terminología inglesa). Estas técnicas se agrupan en lo que se denomina análisis formal y de contenido, formando parte del primero la catalogación o descripción bibliográfica y del segundo la indización, clasificación y resumen. 2.2.2.1. La descripción La descripción de un recurso o documento trata de representar, mediante un re- gistro, dicho recurso, que al formar parte de una base de datos, permite su recuperación e identificación. 72 http://www.searchenginewatch.com Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 44 En los sistemas de recuperación modernos, la estructuración de la información en campos facilita considerablemente la recuperación. Sin embargo, en el ámbito de los motores de búsqueda de la W eb, el análisis formal es prácticamente inexistente, ya que la mayoría de recursos carecen de elementos descriptivos, o bien, la metainformación que pueden contener tanto los documentos com o los registros, no es tan descriptiva ni está tan normalizada como la que por ejemplo caracteriza a la catalogación bibliográfica o a la descripción de registros de bases de datos. No obstante cada vez están adquiriendo mayor im portancia sistemas de metada- tos que tratan de hacer frente a este problema como Dublin Core, TEI, etcétera, aunque, la mayor utilización del lenguaje XML y de sistemas como RDF, basado en su sintaxis, ha de contribuir a obtener una recuperación m ás precisa. 2.2.2.2. Indización El diccionario de Documentación define la indización como: “Técnica del Análisis Documental que describe y representa el contenido de las fuentes de información documentales mediante un número limitado de conceptos extraí- dos del texto de los documentos (palabras clave) o de vocabularios controlados (clasifica- ciones, listas de materia, tesauros), que van a permitir el control y la recuperación de la información de un conjunto documental dado.” Consiste en asignar al documento una serie de términos o descriptores, que ex- presan su contenido, con el fin de facilitar su localización y acceso. Esto se puede hacer partiendo de un índice de clasificación ya elaborado (lenguaje precoordinado) o bien, en el caso de la indización basada en el lenguaje libre (lenguajes postcoordinados), en el que los propios términos permiten elaborar el índice. El uso de un lenguaje u otro da lugar, en el primer caso, a la indización elaborada, y por otro, a la indización libre, siendo esta úl- tima la m ás habitual entre los motores de búsqueda de la W eb. Este tipo de indización es más am plia al superar la indización basada en el contenido. Por otro lado, como indica Lancaster (1998), la indización puede ser exhaustiva o específica. Aunque la primera trata de utilizar el mayor número de descriptores de un documento, en la Web, se ve superada por el funcionamiento de los buscadores que indi- zan a texto completo. La específica, por su parte, trata de expresar de forma más concreta el contenido del recurso. Puede ser realizada por personas o bien de form a automática. En las herramientas de búsqueda se utilizan ambos tipos de indización, correspondiendo la primera a los directorios y la segunda a los buscadores. Introducción 45 Como señala Delgado (2001) la indización automática utiliza varios modelos que han sido recogidos por Ingwersen (1994) a los que denomina: unitérmino, en el sen- tido ya asignado por Taube a mediados de siglo; unitérmino ponderado; unitérmino en contexto, pr incipalmente utilizado e n la realización índices KWIC y KWOK, y finalmen- te la indización estructurada, que como indica Vianello (2004:240) “La representación resultante puede ser expresada a través de espacios vectoriales o clustering.” Caracteriza a la indización automática la aplicación de determinados algoritmos que tienen como finalidad representar lo más fielmente posible el contenido del docu- mento para facilitar su recuperación. En la indización automática los términos y frases que se extraen, no siempre son representativos sino que más bien son indicativos de que los documentos contienen di- chos términos, lo que unido a la no utilización de sistemas estructurados, da lugar a un exceso de ruido en la recuperación. Para evitar este problema, y también para facilitar la ordenación por relevancia, a estos términos se les aplican una serie de valores como pueden ser los basados en cálcu- los de frecuencias que otorgan un peso a un térm ino en función de su frecuencia en el documento o en la base de datos. Los cálculos se basan en la ley de Zipf, posteriormente desarrollada por otros autores como Gerard Salton (1983), Rijsbergen (1979) y otros, dando lugar a conceptos como el de “ponder ación de frecuencia inversa de un documen- to” (FID o IDF en el ámbito anglófono) y “frecuencia absoluta de un término” (FT o TF), que en ocasiones se utilizan de forma combin ada. Los cálculos son asignados a los térmi- nos que finalmente representan el contenido del documento para favorecer tanto la recu- peración de documentos relevantes com o su ordenación. Las técnicas aplicadas a la indización tienen pues como finalidad, permitir se- leccionar los documentos más representativos en relación con la ecuación de búsqueda y colocarlos en los primeros puestos de la lista de resultados. Es decir, tratan de proporcio- nar la mayor precisión en los resultados. Le Loarer (1994) distingue entre indización pla- na, cuando todos los términos que se extraen tienen igual im portancia; ponderada, cuando se da mayor importancia a unos términos que a otros; por roles o facetada y estructurada. Dejando al margen ésta últim a, a la que acabamos de referirnos, la indización por roles, según Vianello (2004) requiere para su correcto funcionamiento su aplicación a dominios específicos que permitan apoyarse en repertorios terminológicos muy especializados. De aquí que su aplicación a los buscadores generales de la W eb ofrezca grandes dificultades. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 46 El resultado de este proceso es la generación de un índice invertido, que se utili- zará en la recuperación, aunque como esta autora indica, su elaboración puede realizarse siguiendo diferentes técnicas: técnica del fichero inverso, los ficheros de patrones de bits, árboles de PAT y grafos. Por otro lado, el gran desarrollo alcanzado en los últimos años en el campo de la lingüística computacional por la semántica léxica se ha hecho notar como señala Vianello (2004:244) en los sistemas de recuperación mu ltilingüe; en la elaboración de resúmenes automáticos; en la aplicación de clasificaciones documentales y en la traducción automá- tica. Fruto de todo ello son los analizadores lingüísticos que permiten analizar docum en- tos electrónicos para extraer información muy útil de cara a su localización. Otras herra- mientas que son fruto del desarrollo de la investigación en este campo y que ya empiezan a utilizarse en el ámbito de la Web son las ontologías, que a grandes rasgos podemo s de- cir que se dedican a la clasificación no de términos sino de conceptos. Vianello (2004:249) menciona en este sentido las iniciativas denominadas FrameNet 73 , proyecto de la Universidad de Berkeley y WordNet 74 . En España estudios de este tipo se están llevando a cabo por Subirats y Petruck, de la Universidad Autónom a de Barcelona. 2.2.2.3. Clasificación Según el Diccionario de las ciencias docum entales, clasificar es: “la operación que consiste en agrupar uno o varios elementos en un conjunto o clase en virtud de al menos una propiedad o atributo que tienen en común.” En el ámbito de las Ciencias de la Documentación, la citada obra define la clasi- ficación bibliográfica o documental com o: “la operación de agrupar los documentos según su tema –clasificación biblio- gráfica- o su contexto de producción –clasificación archivística.” Para su realización se requiere un sistema o esquema de clasificación anterior- mente establecido. 73 http://www.icsi.berkeley.edu/~framenet/ 74 http://www.cogsci.princeton.edu/%7Ewn/ Introducción 47 Algunos de los problemas que presenta la indización libre pueden resolverse bien con la indización controlada o con los lenguajes clasificatorios. De aquí que en des- cripciones bibliográficas se utilicen am bos. La Clasificación es un tipo de indización controlada, ya que requiere de la exis- tencia de un índice clasificatorio. En el ámbito bibliográfico se han venido utilizando fundamentalm ente las clasificaciones decimales como la Universal Decimal Classifica- tion (CDU), la Dewey Decimal Classifica tion (DDC) y la Library of Congress Classifica- tion (LCC). A efectos de indización, entre sus características destaca el carácter unívoco de sus elementos, es decir, un elem ento clasificatorio significa una cosa, y sólo una. En las herramientas de recuperación de la Web, la clasificación se utiliza fun- damentalm ente en el ámbito de los Directorios y de las bibliotecas electrónicas para or- ganizar los recursos de forma temática. El problema es que unos y otros aplican clasifica- ciones de elaboración propia, alejándose de la idea de universalidad. Los motores de búsqueda, en muchos casos incorporan directorios temáticos, bien de elaboración propia o por empresas asociadas, cuyo uso se ha ido haciendo más problemático a medida que han ido aumentando los contenidos de la web. No obstante, existen directorios que utilizan mecanismos automáticos para clasificar los recursos o páginas web 75 . 2.2.2.4. El resumen Las definiciones de este término que ofrecen diferentes autores y que recoge el Diccionario de las Ciencias Documentales tienen en común el referirse a él com o: “la representación concisa, en lenguaje del autor, de las ideas principales del documento original analizado, evitando cualquier apreciación o juicio crítico” La realización de resúmenes se ha venido efectuando tradicionalmente por per- sonas especializadas, fundamentalm ente del campo de la documentación así como por los 75 Véase como ejem plo el directorio Scorpion accesible en la dirección <http://orc.rsch.oclc.org:6109> Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 54 deficiente recuperación de información en este medio. Estudiaremos a continuación, tras una breve introducción histórica y un análisis de sus principales com ponentes, cómo los buscadores se enfrentan a este y otros problem a y las soluciones que han ido planteando. 2.3.1. Orígenes de los principales motores de búsqueda y metabus- cadores Al tratar de Internet en la parte inicial del capítulo, nos hemos referido a algunas de las primeras herramientas de búsqueda que se utilizaban para recuperar información de la red. Dichas herramientas se consideran los precedentes inmediatos de las utilizadas en la Web. Resulta interesante observar la evolución de estas herram ientas, ya que podemos apreciar cómo a lo largo de este proceso se han ido fraguando gran parte de las caracterís- ticas que actualmente mantienen tanto los directorios como los mo tores de búsqueda más utilizados actualmente, y lo que es más importante, cóm o cada una de estas herramientas trata de solucionar los problemas que se les van planteando en relación con la recupera- ción de información. En este sentido, hemos de hacer notar, que desde los comienzos de la Web, aprovechando su carácter hipertextual, en los sistemas de búsqueda se adoptaron las téc- nicas de búsqueda basadas en la activación de enlaces o navegación. Esto dio lugar a la creación en 1994 de directorios de elaboración manual como EINetGalaxy 79 que contenía principalmente recursos Telnet y Gopher, o GENVL (Generate Virtual Library) aunque ambos con un número muy limitado de opciones de búsqueda de recursos y con proble- mas de actualización. En 1995 apareció el directorio Yahoo (Yet Another Hierarchical Officious Ora- cle), que basaba la formación de su base de datos en el envío por parte de los interesados, de información sobre webs tem áticas o páginas web particulares, aplicando posteriormen- te programas rastreadores, aunque las páginas seguían siendo analizadas y clasificadas por especialistas. Este aspecto, unido a un mayor desarrollo de las clasificaciones, supuso un claro avance respecto a los anteriorm ente señalados. 79 http://www.galaxi.com Introducción 55 Les siguieron otras iniciativas dirigidas hacia la especialización por materias de estas herram ientas com o es el caso de SOSIG 80 para ciencias sociales, EEVL 81 para inge- niería y Biz/ed 82 para ciencias económ icas y empresariales. Los directorios, en muchos casos, iban acompañados además por formularios que permitían la búsqueda en sus índices. Los SRI web, basados fundamentalmente en la utilización de este último modo de búsqueda, tienen como antecedentes, en el ámbito de la Web, a los motores Harvest 83 y ALIWEB 84 (Archie-Like Indexing of the WEB). Basados en el sistema WAIS, son los más claros antecedentes de los actuales motores de búsqueda, aunque se vieron inmedia- tamente superados por los primeros buscadores, como es el caso de World Wide Web Wanderer, caracterizados por el mayor uso de los programas araña o spiders, que se utili- zaban como medio fundamental para la form ación de las bases de datos de direcciones URL. Wanderer, World Wide Web Worm , JumpStation 85 y Repository-Based Software Engineering (RBSE) surgen a finales de 19 93. Fr ente a la ordenaci ón ale atoria de los registros que ofrecían los dos prim eros, el tercero ya aplicaba un mecanismo basa- do en la relevancia. (Sonnenreich, 1997). Pronto se pensó en la posibilidad de consultar de form a simultánea estas bases de datos, y así, en 1994 se realiza el primer proyecto de creación de un m etabuscador, al que se denominó GIOSS (Glossary-of-Servers Serv er), al que siguió el sist ema D iscover, que permitía buscar en más de 500 servidore s WAIS. Un año más tarde, Bri an Pi nkerton, de la Universidad de Washington, crea una herramienta de escritorio que dará lugar al 80 http://sosig.ac.uk 81 http://www.eevl.ac.uk 82 http://www.bized.ac.uk 83 Fue cancelado en agosto de 1998 (Am at 1999b). 84 Lanzado en 1993, actualmente carece de mantenimiento. Se basaba en la formación de índices mediante la información aportad a por los prop ios responsables del web. Más información sobre ambos buscadores puede consultarse en: KOSTER, M. ALIWEB ( Archie-Like Indexing of the Web). Computer Networks and ISDN Systems , vol . 27, 1995: pp. 175-182, y sobre Harvest véase Bowm an, C. y otros. The Harvest information discovery and acces system. Computer Ne tworks and ISDN Systems , vol. 28, 1995: pp. 119- 125. 85 Considerado el primer buscador para autores com o Jenkins y otros. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 56 metabuscador WebCrawler 86 , caracterizado por incorporar la indización a texto comple- to. En el seno de la Universidad Carnegie Mellon, surge en 1994 el buscador Lycos, que desarrollará los sistemas existentes y ampliará la capacidad de sus bases de datos indizando una gran cantidad de páginas, con lo que adquirió cierta importancia. En 1995 se lanzan InfoSeek 87 y Excite, que tiene sus orígenes en el proyecto denominado Archi- text, caracterizado por recuperar, además, recursos relacionados con los términos de bús- queda. También en 1995 surg en Northern Light 88 y AltaVista 89 . Sonnenreich (1997) se- ñala que éste último destacaba por su rapidez, por permitir tanto el uso del lenguaje natu- ral como de operadores booleanos, así como búsquedas en las news, recuperación de imágenes con texto y la búsqueda en determinados campos como el de título. HotBot e Inktomi se lanzan en 1996 destacando el primero por su capacidad al indizar más de diez millones de páginas diarias y el segundo por elaborar un directorio de forma automática con la intervención humana para valorar la calidad de sus recursos. Les siguieron Ask- Jeeves en 1997 y Google en 1998. El primero se caracteriza por permitir realizar pregun- tas directas y el segundo por el hecho de presentar resultados relevantes ordenados me- diante técnicas basadas en el análisis de enlaces. En 1999 aparecen el motor de búsqueda AllTheWeb, que además de una mayor calidad en la recuperación de recursos, aportó la inclusión de recursos que dependían de otros, y el directorio Open Directory que pronto facilitará asistencia a la mayoría de bus- cadores importantes como AltaVista, AO L Search, Dogphile, HotBot, Lycos, MetaCraw- ler y Netscape (Sherman, 2000). En el año 2000, surge Teoma que será a dquirido por AskJeeves al año siguiente. Este buscador plantea una mayor selección de recursos, facilitando la intervención de expertos que proponen y valoran recursos específicos. 86 http://metacrawler.cs.was hington.edu:8080/ home.htm l 87 Actualmente Go. 88 Actualmente de pago. 89 Fuera de servicio en la actualidad. Introducción 57 De form a simultánea se siguieron desarrollando listados de recursos organizados por temas, que dan lugar a valiosos instrumentos de recuperación como el World Wide Web Virtual Libray 90 , primera lista alfabética de materias puesta a disposición del públi- co por el CERN, el BUBL 91 Subject Tree, NISS Information Gateway 92 y Galaxy 93 , al- gunos de los cuales, como indica Winship (1995) llevan asociado el modo de búsqueda por palabras clave. La tendencia en los últimos años ha seguido siendo la creación de múltiples herramientas de búsqueda. Es de destacar el desarrollo de herramientas especializadas tanto en una materia, como en ámbitos territoriales o lingüísticos. En este sentido debe- mos mencionar la aparición del metabuscador SurfWax 94 que no sólo permite dirigir las búsquedas a un campo especializado, sino que se constituye como herramienta de bús- queda en diversas fuentes, incluidos algunos contenidos de la W eb invisible como pueden ser las bases de datos. Los buscadores no han permanecido estancados a lo largo de su existencia sino que, como hemos observado, se trata de herramientas en constante evolución, que gene- ralmente han ido haciendo frente a los problemas que se les plantean mediante la incor- poración de nuevas posibilidades de búsqueda, de técnicas de indización, de recuperación y de ordenación de resultados. Especial menc ión merece el desarrollo alcanzado en técni- cas de análisis de enlaces, pues además de Google lo utilizan HotBot, Excite o Clever 95 . IBM quiere ir más allá y está desarrollando un programa que permitirá a los robots reco- rrer la red, evitando los sitios irrelevantes 96 . Otro aspecto a considerar es el que tiene que ver con la trayectoria de estas herramientas, ya que los motores de búsque da no sólo han venido aumentando sino que también se han dado casos de desaparición o han sido absorbidos por otros, como en el caso de W orld Wide Web Worm, anteriormente citado o el de OpenText, que se especia- 90 http://vlib.org 91 http://bubl .ac.uk 92 http.//www.niss.ac.uk 93 http://www.galaxy.com . Adquirido en 2001 por First Search 94 http://www.surfwax.com 95 http://www.alm aden.ibm.com /cs/k53/clever.html 96 El programa se llam a Focused Crawler, caracterizado por efectuar análisis de enlaces. Se puede incorpo- rar a los buscadores añadiéndoles más funcionali dad. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 58 lizó en información económica y financiera bajo la denominación Livelink Pinstripe has- ta su desaparición; o como Northern Light que ha pasado a ofrecer sólo su colección es- pecial de pago. Otros casos de absorción más recientes son los de AltaVista y AllT- heWeb 97 . HotBot y Excite, se han convertido en m etabuscadores. En la mayoría de casos, los motores de búsqueda tratan de obtener un rendi- miento comercial mediante la inclusión de publicidad en sus páginas o utilizan otras prácticas comerciales como asegurar la aparición de páginas web en los primeros lugares del listado de búsquedas o en un lugar destacado junto al resto de recursos recuperados. Buscadores como Lycos ofrecen en sus contratos, además su inclusión en los índices de otros buscadores que utilizan su base de da tos, rápida indización, permanencia asegurada en los índices y actualización del contenido. Por otro lado, pueden asegurase también una serie de ingresos mediante técnicas com o el pay per click 98 . Este carácter mercantil va a jugar un papel muy importante en el funcionamiento de los motores ya que da mayores posibilidades de recuperación a empresas que pagan por ser fácil y rápidamente localizables sus productos, en detrimento de una recuperación de mayor precisión e interés científico. Hay que tener en cuenta además la exis tencia de buscadores como AllTheWeb e Inktomi, que facilitan sus índices, para ser utilizados por otros buscadores como Lycos, HotBot, Terra.com, Overture, Infospace, Excite y Dogpil e, en el caso del primero de los buscadores y el segundo a HotBot, About.com , MSN, Espotting.com, LookSmart, Sone- raplaza, Goo y Bluewin 99 , asegurando la visibilidad en el 70% de las búsquedas. Otra característica actual es el estableci miento de alianzas, compras y ventas, para compartir bases de datos. El directorio Yahoo controla desde marzo de 2003 Inkto- mi 100 , y desde octubre del mismo año, Lycos y Ho tBot y Ov erture (que a su vez había comprado Go, AltaVista y AllTheWeb). 97 AllTheWeb fue absorbido en 2004 por Overture, que a su vez l o adquirió Yahoo!. AltaVi sta tam bién fue absorbido por la mism a compañía en 2003 y desde 2004 utiliza la m isma base de datos de Yahoo!. 98 Técnica comercial que consiste en que las compañ ías q ue lo contratan paga n un canon a los buscadores cada vez que un usuario accede a su página web al activar un enlace de la página de resultados de la bús- queda realizada. 99 Datos que ofrece Lycos en http://insit e.lycos.com /inclusion/se archenginessubm it.as [Consultado en m ayo de 2004]. 100 Inktomi previam ente colaboró con MSN y HotBot. Introducción 59 AskJeeves compró los buscadores Teo ma en 2001, pasando a denominarse Ask, y Excite, que es actualmente un metabuscador que utiliza recursos proporcionados por Google, Yahoo, AllTheWeb, Inktomi, AskJeewes y l os directorios LookS mart, Ab out, Open Directory, Teoma y Overture. Además, estas fusiones pueden dar lugar, como en el caso de Yahoo, a la forma- ción de nuevas herramientas de búsqueda más potentes, como es el lanzamiento de su nuevo motor de búsqueda YahooSearch. Este carácter dinámico tanto en lo técnico, con la continua incorporación de nuevas técnicas de mejora en la búsqueda, como en lo empresarial, con continuos conve- nios, compras y ventas entre ellos, exigen tanto al usuario como al especialista en RI un conocimiento actualizado de su evolución ya que es primordial para saber, en función de estas fusiones, a cuáles se les está dando una mayor importancia, cuál la puede ir per- diendo, etcétera. Exigen además la necesidad constante de replantearse m odificaciones en la evaluación de motores de búsqueda y su realización de forma periódica para poder constatar los cam bios que les afectan. Otro tema es la interpretación de el porqué se pro- ducen estas fusiones y compras. Desde nuestro punto de vista se trata de hacer frente al continuo desarrollo de determinadas herramientas que, por sus prestaciones, minim izan las existentes, por lo que la única manera de hacerles frente es mediante la ampliación o unión de las más pequeñas. También las mayores exigencias tanto de software como de hardware, hace que sea necesaria una continua inversión que no todas las empresas pue- den soportar. Google, junto a Yahoo y MSN, son los motor es en los que s e aprecia una mayor expansión que en los últimos tiempos, incorporando el primero de ellos nuevos espacios de búsqueda como Google Scholar 101 , para recuperar principalmente información de ca- rácter científico, Google Plans, para búsquedas de carácter geográfico 102 , y en la actuali- dad se encuentra desarrollando un proyecto de digitalización de 15 millones de libros impresos entre 1850 y 1950 existentes en 4 bibliotecas americanas, una británica y otra española. 101 La versión beta de esta herramienta pue de consultarse en http://scholar.google.com 102 Se accede a la versión beta en la dirección: http://maps.google.com Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 60 En la actualidad, como señala Chaín (2004), se están utilizando otras técnicas avanzadas de búsqueda que se basan en Algoritmos Genéticos y en la inteligencia artifi- cial aplicada al procesamiento del lenguaje natural, enfocados a mejorar la interacción hombre-m áquina y que posiblemente sea la tecnología que en los próximos años acabe implem entándose en los nuevos sistemas. 2.3.2. Definición y clasificación Chowdhury (1999) define de forma genera l a los buscadores como un servic io de recuperación de información que consiste en una base de datos, que contiene princi- palmente recursos disponibles en la Web. En un trabajo publicado en 2001 distingue en- tre Motores de búsqueda, Directorios, Bibliotecas virtuales y Bases de datos especializa- das. Poulter (1997) por su parte, aporta alguna novedad en su definición al señalar que se trata de servicios de recuperación que contienen una o más bases de datos, con la descripción de recursos disponibles en la Web, programas de búsqueda y una interfaz de usuario. En relación con la terminología, hemos de señalar que no hay unanimidad res- pecto a la denominación de éstas herramientas. Nos encontramos con que existen térmi- nos y expresiones distintas referidas a estos servicios, si bien debemos señalar que tanto Servicios como Herramientas de búsqueda son los términos más comúnmente aceptados para referirse tanto a Buscadores y Bibliotecas Virtuales como a Bases de datos, utilizán- dose el primero de estos tres para referirse a Motores de búsqueda, Directorios. Nosotros, siguiendo a Oppenheim (2000) lo utilizaremos también para englobar a los Metabuscado- res. Chu y Rosenthal (1996) los denominan Ayudantes para búsquedas Web (Web search aids), comprendiendo tanto Catálogos, Directorios, Índices, Motores de búsqueda o Bases de datos Web. Para estos autores, los motores de búsqueda deben permitir al me- nos, que el propio usuario elabore su petición de búsqueda, frente a otras herramientas que permiten buscar información a través de caminos predefinidos o siguiendo estructu- ras jerárquicas. Introducción 61 Para Oppenheim (2000) todos son moto res de búsqueda, diferenciando entre Robots, como AltaVista, Excite 103 , Lycos, HotBot y Go; Directorios, como Yahoo 104 , SOSIG 105 , EEVL 106 , Biz/Ed 107 y UK Directory 108 ; Metabuscadores como MetaCraw- ler 109 , Dogpile 110 , Profusion 111 , Ixquick 112 , Vivísimo 113 y finalmente, Herramientas de software. Estas últimas son programas que se instalan individualmente en los ordenado- res y que posibilitan acciones como guardar los resultados de las búsquedas en el propio disco duro o informarnos tanto de enlaces inactivos como de recursos duplicados. En este sentido, menciona W ebsleuth, Copernic 98 114 , f.Search 1.3.1 115 y Query-N Metasearch. Hock (1999) se refiere a Finding tools “Herramientas de Búsqueda” como ex- presión que abarca tanto a Motores de búsqueda (Search engines) como a Directorios (Directories). En cambio para Ljoland (2000) una cosa son los motores de búsqueda web, dentro de los cuales sitúa a los m etabuscadores y otra los directorios. Green (1999), en función de sus capacidades técnicas, distingue entre buscado- res de primera y segunda generación. Sitúa en el primer apartado a los anteriores a abril de 1998, iniciando Direct Hit 116 los de segunda generación. Concretamente éste último, incorporaba una tecnología que le permitía aprender de otras búsquedas, guardar infor- mación de los registros activados por los usuarios en búsquedas previas y así aumentar el valor de la relevancia cuando se recuperaran de nuevo. 103 Actualmente es un metabuscador y pertenece a Askjeeves. 104 En la actualidad cuenta tanto con un buscador al que den omi na Yahoo! S earch <http://search.ya hoo.com>com o con un direct orio, Yahoo Directory <> aunque habitualmente se utiliza la página de acceso general al portal que integra ambas herramientas así como otro tipo de servicios. http://www.y ahoo.com 105 Especializado en Ciencias Sociales es accesible en http://www.sosig.ac.com 106 Especializado en matemáticas e ingeni ería es accesible en http://www.eevl.ac.uk 107 Especializado en economía y turism o accesible en http://www.bized.ac.uk 108 Accesible en http://www.ukdirectory.co.uk 109 Accesible en http://www.metacrawler.com 110 Accesible en http://www.dogpil e.com 111 Accesible en http://p16.profusion.com 112 Accesible en http://www.ixqui ck.com 113 Accesible en http://vivisimo.com 114 Puede descargarse en http://www.copernic.com 115 Puede descargarse en http://www.karai.com /software/fsearch 116 Fue clausurado en 2002. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 62 Hay aspectos técnicos que diferencian a unos de otros ya que por ejemplo, mien- tras los de primera generación forman sus índices a partir de la visita de los “robots” a sitios web, analizando la localización y frecuencia de las palabras, los más modernos ba- san su ranking 117 de resultados en diferentes aspectos como la cantidad de veces que es visitado un sitio web. Los recursos obtenidos, en este sentido, tratan de responder tanto a los criterios de búsqueda como al hecho de ser muy visitados o utilizados. Otro aspecto que los distingue es que mientras que los primeros no consideran el contexto de los tér- minos de búsqueda sino que hacen búsquedas literales de los términos, los de segunda generación permiten hacer búsquedas tanto utilizando el lenguaje natural como búsque- das conceptuales. Los motores que utilizan estas tecnologías, fundamentalmente Google y Teoma, utilizan además el análisis de enlaces lo que les permite conocer, en el primero de ellos, los recursos que reciben un mayor número de enlaces, es decir, lo que equival- dría a ser los más citados en los cálculos de impacto, y el segundo de ellos trata de ofre- cer recursos de calidad al detectar los considerados com o “autoridad” en una m ateria. Siguiendo con la clasificación, Tramullas (2002) se refiere a los motores de ter- cera generación que se caracterizan por utilizar, en la recuperación, operaciones basadas tanto en el cálculo vectorial como en el análisis de enlaces. Aguillo (1998) distingue entre Índices y Buscadores o Motores de búsqueda. Maldonado y Fernández (2000) distinguen entre Motores de búsqueda e Índices temáti- cos. Abadal (2001) los denomina Localizadores de recursos, entre los que distingue Índi- ces temáticos, Buscadores o Robots y Metabuscadores. Por su contenido, establece dife- rencias entre Localizadores generales y especializados, subdividiendo estos últimos a su vez según se ocupen de un tema, ámbito geográfico, de determinados tipos de documen- tos o de un ámbito lingüístico concreto. Aunque más adelante nos ocuparemos de una forma más específica de unos y otros, conviene señalar que hay dos aspectos fundam entales que distinguen a buscadores temáticos de los automáticos: Por una lado, respecto a la formación de sus bases de datos, los motores la forman mediante la visita indiscriminada y generalmente no selectiva, de servidores Web por parte del robot, frente a los buscadores temáticos cuyos recursos son 117 Aguillo (2001) señala la existencia de criterios co merciales en el modo en que determinados buscad ores realizan sus listados. Introducción 63 seleccionados por personas que se ocupan de su mantenimiento. Por otro lado, desde el punto de vista de la técnica de la búsqueda, la forma preferente de consulta de sus bases de datos, consiste en los buscadores automátic os en el lanzamiento de los términos expre- sados en el formulario de búsqueda, mientras que en los temáticos es necesario un exa- men, análisis o selección de términos o materias de las listas que ofrecen. Estas técnicas se conocen como Interrogación y Exploración respectivamente. Este último término, que puede ser utilizado junto a Examen, concuerda bien con la característica de estos directo- rios de contener más referencias de sitios web susceptibles de exploración que de visuali- zación directa de lo documentos individuales y por eso suelen recoger las direcciones de las páginas principales de un sitio web. Aunque Yahoo aún lo mantiene, inicialm ente los grandes buscadores como Al- taVista, Lycos, etcétera, presentaban en las páginas principales ambas formas de búsque- da. La tendencia actual ya no es tanto mantener ambos modos de búsqueda en la mism a página del buscador sino separar ambos modos de consulta mediante interfaces distintos, accesibles a través de distinta URL. Hay casos como Google que busca al mismo tiempo en la base de da tos del Di- rectorio, o como Lycos que indica, tras una búsqueda, las categorías del directorio en el que encontrar recursos relacionados con la expresión de búsqueda. Otros utilizan interfa- ces visuales y combinan ambos tipos de búsqueda, ya que requieren primero la interroga- ción de la base de datos y la exploración posterior. En los casos en que acompañan a los motores de búsqueda, podemos decir que se trata de herramientas complementarias, que en determinadas búsquedas y para diferen- tes usuarios, puede ser un modo más adecuado de localizar información, ya que general- mente se ofrece con un m ayor grado de contextualización. 2.3.2.1. Directorios El término Directorio es una traducción del inglés Directory que junto con la expresión classified lists, denomina a los buscadores caracterizados por clasificar los re- gistros almacenados en su base de datos bien en grupos temáticos, que a su vez pueden subdividirse en otros más específicos, o bien mediante clasificaciones como la CDU, la de Dewey u otras. Esta labor, com o hemos dicho, la realizan especialistas que seleccio- nan dichos recursos de la Web o de los envíos que los particulares realizan, para que sean incluidas sus páginas. Cada directorio puede tener una política de selección determinada Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 70 2.3.2.3. Metabuscadores Ante el distinto funcionamiento y la s limitaciones que supone para los motores ofrecer una cobertura total de la docum entación existente en la Web, los metabuscadores aportan, entre otros aspectos, una mayor exhaustividad. Para ello utilizan las bases de datos de diferentes motores de búsqueda. En primer lugar debemos distinguir entre metabuscadores 142 y multibuscadores, ya que a veces ambos términos se utilizan de form a indistinta. Los primeros surgen entre 1995 y 1996 como es el caso de Mamma 143 , Dogpile 144 y MetaCrawler 145 . Se caracterizan porque la búsqueda se lanza de forma simu ltánea sobre distintos buscadores, siendo re- comendable utilizar operadores comunes o no usarlos. En los multibuscadores, la bús- queda se hace de forma secuencial, es decir un buscador tras otro y los resultados apare- cen separados por motores. Algunos metabuscadores permiten seleccionar los buscadores sobre los que se lanzará la búsqueda. MetaCrawler reformula la pregunta, de forma que pueda ser proce- sada por cada buscador y presenta los resultados de una form a unificada. Para la ordena- ción utiliza su propio algoritmo 146 que valora el ranking asignado por el buscador, el nú- mero de buscadores que contiene el recurso, etcétera. Los metabuscadores ofrecen como ventajas y la realización de búsquedas en múltiples buscadores mediante una única interface y la eliminación de duplicados. Sin embargo, las búsquedas complejas no siempre se realizan como el usuario las plantea sino en función de las capacidades que el meta buscador tenga para lanzar la búsqueda de forma simultánea sobre los motores que utiliza, ya que no todos soportan la misma sin- taxis. Además de esta simplificación, se reducen las opciones para mejorar las búsquedas que presentan los buscadores de forma independiente, limitándose también la capacidad de interacción pueden ser completas ya que todos lo motores no soportan una mism a sin- taxis. A pesar de ello, para autores como Chignell y otros (1999), resuelven el problema 142 Chowdury (2001) los considera com o un subgrupo de los m otores de búsqueda. 143 http://www.mam ma.com 144 http://www.dogpi le.com 145 Lanzaba las búsquedas sobre Galaxy, InfoSeek, Lycos, WebCrawler y Yahoo. Posteriormente añadió OpenText. Actualmente pertenece a InfoSpace. Accesible en http://www.metacrawler.com 146 Algoritm o denomi nado “Normal ize-Distribute-Sum ” Introducción 71 de la baja exhaustividad que se observa en los buscadores, apoyándose en la idea de que ningún motor de búsqueda por si sólo ofrece más del 45% de recursos relevantes existen- tes en la Web. No obstante, Chignell y otros (1999) señalan la existencia de una segunda gene- ración de metabuscadores, que tienen en cuenta tanto el tipo de pregunta como la materia, la estrategia de búsqueda, etcétera para seleccionar los buscadores a los que enviar la búsqueda. De aquí nuestro interés por compar arlos con los motores de búsqueda para ver hasta qué punto son útiles en búsquedas sim ples y complejas sobre temas especializados. En este sentido, Dreilinger y Howe (1997) señalan tres componentes fundamen- tales: o Un mecanismo de envío que se ocupa de seleccionar el servidor y el m otor o motores a los que se lanza la consulta. o Agentes del interfaz: se ocupan de interactuar con cada mo tor de búsqueda y de reformular la consulta de forma que sea correctamente interpretada por cada motor de búsqueda. Finalmente interpretan los resultados que proceden de cada motor. o Mecanismo de presentación de resultados: se ocupa de integrar los resul- tados procedentes de los distintos motores, ordenarlos, y en su caso, eli- minar duplicados y verificar los enlaces. Existen diversas clases de metabuscadores, ya que unos lanzan las búsquedas de forma automática sobre los buscadores, mientras que en otros casos como All-in-one 147 es necesaria la intervención del usuario. No obstante, existen casos como ProFusion 148 que integra ambos métodos. Otra diferencia puede ser el que realicen su función en un 147 http://www.alonesearch.com/multibib/ 148 http://www.profusion.com Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 72 servidor propio o utilicen el cliente, como es el caso de Copernic 149 , WebSeeker 150 y otros. Entre los más utilizados, podem os mencionar MetaCrawler 151 , Dogpile 152 y Pro- Fusion. Vivísimo 153 , e Ixquick 154 pueden considerarse como más actuales y de una tecno- logía más avanzada. MetaCrawler se caracteriza por la alta especificidad en la expresión de búsqueda, que permite el uso de la lógica booleana, la aplicación de algoritm os de ranking y agrupamiento, o la extracción de térm inos para especificar la búsqueda. Dogpi- le por ordenar por relevancia los resultados. Por otro lado podemos citar SurfWax 155 y Copernic 156 que recuperan incluso en la web oculta. El segundo cuenta con dos versiones, una libre y otra de pago; EZ2Find 157 que incorpora la opción de búsquedas por categorías especializadas; y Fazzle 158 que per- mite ordenar los resultados por diferentes conceptos y utilizar operadores booleanos, con lo cual podemos observar cómo algunas de las limitaciones que se apuntan para estas herramientas, com ienzan a ser superadas. Hay que señalar además el metabuscador NECI, desarrollado inicialmente en el Instituto de Investigación NEC, y que en la actualidad se denomina Inquirus 159 que trata de mejorar los resultados ofrecidos por otros metabuscadores en cuanto a precisión y efi- ciencia, mediante el análisis de los documentos, la detección de duplicados, mejora del algoritmo de ranking y la precisión, analizando tanto la información más próxima com o facilitando la elaboración de expresiones de búsqueda más precisas y finalmente, desta- cando la presencia de los términos de búsqueda en los recursos recuperados. (Lawrence y Giles, 1998d). 149 http://www.copernic.com 150 http://www.bl uesquirrel.com /products/webseeker/ 151 http://www.metacrawler.com 152 http://www.dogpi le.com 153 http://vivisimo.com 154 http://www.Ixqui ck.com 155 http://www.surfwax.com 156 http://www.copernic.com 157 http://www.ez2www.com 158 http://www.fazzle.com 159 http://www.i nquirus.com Introducción 73 Westerra (1997) señala que por sus características, los metabuscadores pueden ser las herramientas del futuro una vez superen aspectos como son: una mejor interpreta- ción de los términos de búsqueda, la posibilidad de poder hacer las búsquedas en los bus- cadores de acuerdo con la sintaxis que cada uno soporta y la provisión de resultados completos y ordenados. En la actualidad se están observando los primeros pasos en este sentido, ya que como señalan Chignell y otros (1999), se han venido desarrollando nuevos metabuscado- res que discriminan entre diferentes buscadores en función del tipo de búsqueda, del tipo de usuario e incluso de la materia de búsqueda 160 . Otras veces, un programa intermedio analiza las consultas y las transforma de manera que sean “entendibles” para cada uno de los motores (Hu, W . Chen y Yeh, Jyh-Haw 2002). Otras iniciativas como la propuesta por Gravano y otros (1997) tratan de esta- blecer un protocolo, al que denomina STARTS, cuya util ización por pa rte de los m otores facilitaría una m ayor homogeneidad en los resultados. No obstante, com o indican Hu, W . Chen y Yeh, Jyh-Haw (2002), este protocolo apenas se está utilizando. En cualquier caso se trata de herramientas a tener en cuenta ya que como señala Notess, el metabuscador Excite permite aumentar, de forma simple, el resultado de las búsquedas en torno al 50%. 2.3.2.4. Los agentes inteligentes Los agentes inteligentes de búsqueda como WiseW ire o Nano Espacio Custom Search 161 , pueden ser otra de las tendencias en recuperación de la información web en los próximos años. Básicamente podemos decir que son programas que se ejecutan directa- mente en los ordenadores personales y que realizan periódicamente y de forma automáti- ca, las funciones para las que han sido programados. Se denominan inteligentes porque “aprenden” a través de su uso, lo que les permite aplicar la información que van acumu- lando para realizar mejor trabajos repetitivos. Así, basta con que un usuario utilice estos agentes para la recuperación de información una vez, para que posteriormente sea el pro- 160 Para más información sobre m etabuscadores que dirige n las búsquedas hacia motores especializado s en los temas de consult a, véase el trabajo de A. Sugiura y O. Etzioni (2000). 161 Se caracteriza por utilizar algoritmos de inteligencia artificial. Accesible en http:/www.necuse.com Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 74 pio programa, a través del perfil de usuario que va generando, quién se ocupe de buscar la información que le interesa y proporcionarla con la frecuencia con la que el usuario la demande 162 . Entre los más conocidos se encuentran Copernic 163 , BullsEye 164 y EZSearch 165 . 2.3.3. Principales compone ntes y funcionamiento Los buscadores que se utilizan habitualment e en la Web son sistemas de recupe- ración que llevan a cabo miles de búsquedas al mismo tiempo, en bases de datos am plias y variadas, com puestas por diferentes tipos de documentos y con una arquitectura que se caracteriza por su complejidad, potencia y robustez. Cabe mencionar en este sentido los clusters o grupo de ordenadores interconectados que facilitan la rápida consulta de los índices, enviando los resultados a un ordenador encargado de ordenar los registros facili- tados por los diferentes ordenadores, para finalm ente facilitarlos al usuario. La com plejidad de estos procesos hace necesario que nos detengamos a analizar el funcionamiento de estas herramientas, de sus componentes más importantes, ya que conociendo con mayor profundidad est os aspectos, estaremos en mejor disposición pa ra establecer una serie de criterios enfocados a valorar si efectivamente desarrollan su co- metido de fo rma correcta y útil. En este sentido, podemos preguntarnos ¿Qué se espera de estas herramientas en las búsquedas de documentos? Desde el punto de vista de la Ingeniería del Software, Ges-Chen Hu y otros (2001a) señalan, en primer lugar, la efectividad y eficiencia del sistema en la localización y ordenación de documentos, teniendo en cuenta además, la cobertura, la actualidad, la imparcialidad en el acceso a los docum entos, la expresividad y utilidad de los resultados de búsqueda, la facilidad de uso de la interface y finalm ente, la adaptabilidad del sistema a las consultas del usuario. 162 Más información sobre las posibilidades de recupe ración de información de estos mecanism os puede consultarse en el trabajo de Berrocal, Figuerola, Zazo y R odríguez (2003). 163 http://www.copernic.com 164 http://www.inteliseek.com 165 http://www.americansys.com Introducción 75 Un punto de vista distinto supone conocer las funciones que llevan a cabo. Así, Gordón, M. y Pathak, P. (1999) señalan que los motores de búsqueda facilitan tres aspec- tos: reúnen un conjunto de páginas web sobre las cuales el buscador puede recuperar la información; representan dichas páginas de m odo que se permita conocer su contenido; y por último, perm iten plantear búsquedas que, m ediante algoritmos de recuperación, inten- tan recuperar información relevante. Estas funciones son llevadas a cabo por sus compo- nentes principales, que como todo sistema de recuperación de la información, está com- puesto por la base de datos, por el software que se ocupa de su form ación y ges tión, y que facilita la recuperación, y por la interfaz de búsqueda. De cara a facilitar la consulta para todo tipo de usuarios, estas herramientas ofrecen cada vez interfaces más simples, y sue- len ser evaluados de forma específica. 2.3.3.1. El robot o crawler En relación con el software de formación y gestión de la base de datos, uno de los elementos más importantes son las denominadas “arañas”, robots o crawlers. Básica- mente se trata de programas informáticos que se conectan a los servidores web, llevando a cabo una serie de instrucciones relacionadas con el modo en que han sido programadas para, por ejemplo, escanear su contenido y ser posteriormente indizado. Su otra función importante, consiste en la elaboración de un listado de direcciones URL extraídas de los recursos que visita, para examinarlas posteriormente. Este listado contiene además, las direcciones URL enviadas a los buscadores por los responsables o creadores de páginas o sitios web, para que sus páginas sean indizad as. También recurren a servidores y páginas web que recogen novedades, los sitios más vis itados, grupos de noticias y listas de distri- bución. Otros programas (Lynx, Java.net, Comp re hensive Perl Archive Network) les permiten llevar a cabo sus funciones independien temente del tipo de servidor, del tipo de recurso de red, o de la aplicación con que se encuentren. Google, en este sentido, utiliza un servidor de direcciones URL del que parten los robots para visitar las páginas, enviando posteriormente la información extraída a un servidor de almacenamiento, donde se comprime y se le asigna un código identificativo. Esto facilita su recuperación y consulta, bien en línea, o en la versión guardada en mem o- ria. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 76 Una vez que el robot se dirige y visita el recurso, comprueba si ya lo ha visitado anteriormente, y en caso afirmativo, revisa si ha habido cambios, y si ha sido así, actuali- za los datos que tiene de dicho recurso. El orden de las direcciones en el listado de lugares a visitar puede verse influido por las directrices del motor de búsqueda. Entraría aquí en funcionamiento la programa- ción prevista para los recursos de pago, que requieren aparecer de forma rápida y mejor colocados en el ranking de resultados. El modo de trabajo de estos robots puede hacer posible que en una búsqueda en- contremos las páginas enviadas por los creadores, las páginas más consultadas pero, a pesar de todo, hay una parte importante de la Web que les resulta inaccesible, al menos de forma inmediata, bien sea por no haber sido localizadas por el robot o por no haber sido enviadas por sus creadores para su indización. Aún las que se envían sin mediar un contrato económico para ser visitadas por las arañas, pueden tardar de seis a ocho sema- nas en ser indexadas. Otras limitaciones al trabajo de estos programas pueden venir im- puestas por los mantenedores de los servidores, bien a través de los ficheros robot.txt, que controlan y, en su caso, impiden el acceso a determinados recursos a los robots, o su indicación en una etiqueta Meta 166 de la página en HTML. Otros aspectos técnicos que pueden limitar su cometido son: la existencia de marcos en las páginas web, la genera- ción de páginas dinámicas, de mapas de imág enes y de páginas protegidas (Baeza-Yates y otros 1999). Todo ello da lugar a la denom inada “Web oculta”. Continuando con el modo de trabajo de estos programas, Baeza-Yates y otros (1999), señalan que los más rápidos superan lo s diez millones de visitas diarias a páginas Web. Pero no todos funcionan del mismo modo ya que pueden estar program ados para dirigirse a determinados sitios web y una vez allí, extraer sólo la información de una par- te determinada o de todo el sitio o página web, es decir, su programación les permite rea- 166 Véase Koster (1994) Introducción 77 lizar una extracción intensiva, con mayor profundidad en las páginas, o bien extensiva, tratando de recolectar algo de información de la totalidad de páginas del sitio 167 . Los programas más avanzados permiten centrar sus visitas en sitios que contie- nen determinadas palabras clave o en páginas de una cierta importancia, aunque no todas las herramientas los im plementan. Todo esto se refleja en la indización, que puede tener un componente en unos casos selectivo, en otros jerárquico, dando más importancia a la indización de las páginas de los niveles superiores, mientras que en otros se realiza con mayor detenimiento sobre los documentos situados en niveles inferiores. Así pues, del trabajo del robot consideramos interesante para la evaluación co- nocer hasta qué punto desciende en la jerarquía de los servidores y sitios web, es decir, si lo hace con mayor o menor profundidad. 2.3.3.2. El índice Para facilitar la consulta a la base de datos, hemos de destacar la labor realizada por el programa de indización , que realiza una extracción de términos del documento para formar un índice invertido, esto es, un listado de raíces de palabras, de términos, de frases, etcétera, que apuntan a los documentos que los contienen. Como hemos visto an- teriormente al hablar de la indización, se caracterizan por la eliminación de palabras va- cías y por la aplicación de una serie de valoraciones basadas en frecuencias de términos, calculando el número de veces que aparece un término en un documento o en la base de datos, el lugar en que aparece tanto en la frase como en el texto, etcétera. En determina- dos casos también pueden hacer intervenir el análisis de hiperenlaces. Otros aspectos que varían en función de l motor tienen que ver con la conversión de los términos a mayúsculas y minúsculas, utilización de las etiquetas HTML en la indi- zación para indizar títulos, direcciones URL, etcétera. 167 La investigació n en este campo se está centra ndo en la actualidad en la aplicación de técnicas basadas en el uso d e la inteligencia artificial. En este sen tido puede consu ltarse el trabajo de Nick, Z. Z. y Themis, P. (2001). Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 78 La obtención de resultados en una búsqueda se ve facilitada y condicionada, en- tre otros aspectos, por el modo en que se ha realizado la indización. A pesar de su impor- tancia, contamos con poca información sobre el modo en que indizan o el ritm o al que lo hacen. En un estudio de Schwartz (1998) se señala que AltaVista indizaba unos seis mi- llones de recursos diarios. Además, en determinados motores comerciales es frecuente la creación de un segundo índice, que apunta a recursos de pago y que se ofrecen en lugares destacados del listado de recursos recuperados. Hernández (1999b) denomina analizador o indexador al programa que facilita la extracción de las palabras del contenido, y señala la existencia de diferentes filtros que dirigen el modo en que se ha de realizar dicha indización. El fichero inverso que se gene- ra es gestionado por una base de datos que soporta las consultas del usuario. El texto se extrae generalmente del título, de los títulos de los principales apartados, de las etiquetas Meta, de los hiperenlaces y, según el buscador, de una parte variable del texto. El pro- blema de este tipo de extracción es que no todos los buscadores utilizan los programas que permiten identificar el título, autor, etcétera, del resto de contenido, lo que influye de forma negativa en la precisión de la recuperación. De aquí que sólo una información co- rrectamente etiquetada, puede permitir obtener resultados de mayor precisión. Por ello hemos querido valorar cómo recuperan actualmente los principales buscadores cuando se les indica que busquen determinadas palabras en el título. Es por eso que en la evaluación hemos utilizado una búsqueda por campo, que nos puede dar datos sobre su funciona- miento. Cada buscador realiza la indización de un m odo propio, por ejemplo Google in- diza los documentos que va almacenando creando registros que contienen las palabras, información sobre su posición en el texto, sobre el tamaño de la letra y el uso de mayús- culas. Realiza además un análisis de enlaces que se utilizará tanto para alimentar al servi- dor de direcciones URL como para realizar cálculos de relevancia. El análisis de hiperen- laces ha adquirido un gran desarrollo en los últimos años, especialmente desde la publi- cación del estudio de Brin y Page (1998) en el que se expone el PageRank model, del que más adelante nos ocuparem os. El fichero inverso puede actualizarse con una periodicidad variable (de 24 horas a varias semanas), por lo que puede haber cambi os no registrados en la base de datos. De aquí que haya casos de información aún no incluida o direcciones que han cambiado o Introducción 79 desaparecido, etcétera. (Olvera 1999c). Debemos tratar de conocer, si no con qué fre- cuencia los buscadores automáticos actualizan este índice, sí al menos cuál lo hace con mayor asiduidad. Un modo de saberlo es analizando la validez de las direcciones URL que se ofrecen tras una búsque da, pues en vi rtud de su mayor o menor índic e de co- nexión, podemos afirm ar un valor de actualización. La incorporación de nuevos términos o datos se lleva a cabo en cada actualiza- ción. Google lo hace mensualm ente y según Notess (2002), reindiza diariamente los ser- vidores que varían frecuentemente sus contenidos. Su correcto funcionamiento requiere pues, diferentes tareas de mantenimiento. Así, para eliminar páginas, buscadores como WW Lib-TNG, desarrollado en la Universidad inglesa de Wolverham pton, utilizan archi- vos históricos en los que se registran la s veces que un determinado enlace no ha podido utilizarse, y a partir de un determinado número de veces, la página se borra de la base de datos. Por supuesto se tiene en cuenta que los problemas no sean debidos al estado de la red. Este autor demuestra en otros estudios 168 que motores como MSN, HotBot y otros recuperaban documentos colgados en la Web en las últim as 48 horas. Desde el punto de vista lingüístico, la utilización por algunos motores de mapas conceptuales o la indización de las propias preguntas, son soluciones planteadas para resolver el problema de la polisem ia y la homonimia. (Peña y otros. 2002). Por otro lado, la Web está formada por diferentes tipos de documentos, bien sean textuales, sonoros o audiovisuales sobre los que, en la medida de lo posible, los pro- gramas indizadores tratan de extraer información, para facilitar su recuperación. Al mis- mo tiempo van surgiendo herramientas de búsqueda especializadas en estos tipos de ar- chivos. No obstante, hay que tener en cuenta que no todos los recursos o todo su conteni- do pueden ser indizados, no sólo por el amplio número existente y la variada tipología, sino por el carácter especial de su contenido, como por ejem plo ocurre con las fórmulas o ciertas representaciones gráficas. Buscadores como Google, MSN y Yahoo indi zan archivos de diferente fu ente y tipo documental como son los grupos de noticias (Usenet), documentos PDF, Power- 168 Véase la página web http:// www.notess.com /search/stats/freshness.shtml Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 86 minados aspectos de la indización; cuál es el operador de búsqueda que utiliza cada mo- tor de forma implícita, ya que ello incide muy directamente en los resultados; cuáles son los operadores que soporta, tanto booleanos como de cercanía, si permite truncamientos, si se puede consultar por palabra clave, frase o lenguaje natural, si es sensible al empleo de mayúsculas o minúsculas, así como algunas características de la búsqueda avanzada o por campos. Presentamos a continuación diferentes aspectos que tienen que ver con la recuperación, y especialmente con la ordenación de los resultados de búsqueda. Los motores de búsqueda utilizan recursos específicos que permiten modificar el funcionamiento automático de las búsquedas. MSN utiliza un “Generador de búsquedas” además de permitir utilizar alguna de las opciones anteriormente señaladas, permite refi- nar al añadir otro término de búsqueda a los resultados, restringirlos a un sitio, dominio, obtener vínculos, etcétera. Permite ordenar los resultados por fechas o por popularidad. Para calcular la relevancia se sirve de parámetros como la procedencia de la consulta, es decir, calcula este valor en función del lugar desde el que se realiza la búsqueda. Por su parte, los metabuscadores ofrecen, como en el caso de Ixquick, una búsqueda avanzada universal, es decir que analiza la ecuación de búsqueda y, en la medida de lo posible la transforma para que pueda ser entendida por la mayoría de buscadores; una búsqueda global, es decir en todo el mundo y en cualquier idioma; y un refinamiento avanzado, que permite no volver a ver resultados visualizados previamente así como centrar la búsqueda en determinados recursos recuperados y rechazar otros. Además señala con estrellas el número de buscadores que recupera determinado recurso entre los diez primeros. Final- mente, ofrece diferentes opciones personalizables, como la posibilidad de destacar los términos de búsqueda en los resultados, etcétera. Otras características le permiten corre- gir términos escritos de forma incorrecta y ordenar los resultados por relevancia o por motor de búsqueda. Además ofrece una serie de enlaces relacionados que permiten tanto centrar como filtrar la búsqueda, y un histórico, con las 15 últimas búsquedas lanzadas. Finalmente, como opción a destacar, permite la búsqueda de recursos indicando la fecha de publicación. 175 Véase en este sentido las recomendaciones que hace Greg Notess (2000b) para consultar Google utili- zando operadores booleanos. Introducción 87 Ixquick, para enfocar la búsqueda, facilita diversas categorías que recogen los recursos relacionados con aspectos específicos. Se basa en la coincidencia de los térmi- nos de búsqueda en los recursos recuperados. Además, se pueden aplicar filtros por do- minio, idiom a de los recursos y fecha. Generalmente, se pueden utilizar además de los términos de búsqueda, con los operadores correspondientes, otros elementos com o: los signos “más” (+) para forzar la aparición del término al que preceden y “menos” (-) para excluirlo; paréntesis; trunca- mientos; comillas en las búsquedas por frase y la coma (,) para separar los apellidos del nombre, en el caso de búsquedas de nombres propios. Como sistemas interactivos que son, la efectividad de la búsqueda también de- pende de los objetivos del usuario (Arms, 2001) y de su formación. Así, en función de los resultados que obtenga, podrá redirigir o plantear la búsqueda, intentando obtener otros más relevantes. Es por ello que conocer interfaz de búsqueda y el lenguaje de interrogación del motor es indispensable no sólo para consultar adecuadamente la base de datos, sino tam- bién para obtener unos resultados más precisos. Estos sistemas se basan en el modelo de recuperación booleano extendido y en algunos casos en el vectorial. En el primer caso los operadores pueden ser implícitos, cuando el sistem a interpreta que se utilizan los operadores AND o bien OR entre los tér- minos de consulta, y explícitos cuando han de introducirse expresamente por el usuario. La mayoría de motores de búsqueda de la Web utilizan el operador AND de forma implí- cita. El modelo vectorial es menos utilizado ya que como señalan Berry y Browne (1999:67), los motores que utilizan técnicas basadas en espacios vectoriales reconocen a los operadores booleanos como palabras vacías en la ventana de búsqueda, permitiendo en algunos casos la búsqueda en campos. Igualmente es im portante valorar en estos sistemas de recuperación la importan- cia de la representación de la búsqueda, ya que puede basarse en el modo convencional de acumulación de términos, o en otros más evolucionados, como son las búsquedas ex- presadas mediante el lenguaje natural, que exige la estructura semántica de la frase o la representación vectorial de los términos, a los que se les adjudica un valor según su im - portancia. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 88 Además la búsqueda en los motores se puede realizar mediante palabras clave, frases, utilizando truncamientos, expresiones del lenguaje natural y otra serie de operado- res, además de los booleanos, y de cercanía. Algunos buscadores especializados facilitan la consulta mediante tesauros 176 y la búsqueda por campos. Pero cada una de estos tipos de búsquedas puede plantear problemas. En este sentido Delgado (2001:46) señala el defectuoso funcionamiento de la búsqueda booleana en buscadores Web al desactivar con su uso la ordenación por relevancia. Por otro lado, la utilización del lenguaje natural en la consulta puede influir en la recuperación de un mayor número de recursos, debido a los problemas que por ejem plo plantea el uso de términos sinónimos y homónimo s. Tal vez por esto y por su incipiente desarrollo, su uso no se ha generalizado y sólo determinados buscadores como AskJeeves lo utilizaban. Respecto a los resultados de la búsqueda, una vez el motor compara los términos de búsqueda de la ecuación de búsqueda y el índice, presenta un listado de resultados con información sobre cada uno de ellos. Teoma los ofrece en cuatro apartados: en prim er lugar mu estra una serie de luga- res comerciales; a continuación el apartado “Refine” que contiene recursos que se ofre- cen a modo de sugerencia por si son del interés del usuario; en tercer lugar el apartado denominado “Results” que contiene el gran grupo de recursos; y finalmente el apartado “Resources” que son recursos compilados por expertos en la materia. Coloca en lugares relevantes recursos de empresas que por su carácter comercial quieren aparecer en los primeros lugares de búsqueda. Se distinguen porque se les asigna la etiqueta Sponsored by. Utilizan para ello las bases de datos de Overture, Sprinks y FindWhat. De aquí que nos hayamos planteado la n ecesidad de valorar como funcionan los buscadores ante diferentes tipos de búsqueda, cuando se utilizan opciones de búsqueda avanzada como la búsqueda booleana, por frase, por campo, o con en operador de exis- tencia (+). 176 Véase por ejemplo ERIC (Ed ucation Resources Information Centre) en http://www.eric.ed.g ov/ Introducción 89 Si todo se desarrolla correctamente, constituye la piedra de toque para valorar la utilidad de estas herramientas, en tanto en cuanto sean susceptibles de colocar entre los primeros lugares los recursos más relacionados con la búsqueda y resolver el problema de necesidad de información planteado. Por tanto, en esta página o páginas, dos aspectos son fundamentales: por un lado la presentación o descripción de los recursos, que se realiza con el fin de ayudar al usua- rio a decidir si un recurso es de su interés, y por otro la ordenación o ranking. Respecto al primero de ellos, generalmente suele aparecer el título que puede servir de enlace con el recurso, un resumen descriptivo del contenido, la dirección URL y otra información, que varía en función de cad a buscador, como puede ser: el índice de relevancia, el tamaño del archivo, la fecha de creación, la fecha de entrada en la base de datos, lengua o idioma. Junto a estos resultados aparecen, de form a destacada, otra serie de recursos de carácter comercial, cuya frecuencia trataremos de valorar en la evaluación. Otra característica de los listados es la aparición destacada de recursos depen- dientes que aparecen colocados de forma más adentrada respecto a los márgenes, que el resto de recursos de los cuales dependen. El resumen descriptivo presenta, de forma destacada, generalmente en negrita, los términos de búsqueda junto al conjunto de la frase o frases en que aparecen. No hay uniformidad en el contenido entre unos y otros, ya que por ejemplo, Infoseek mostraba los 300 pr imeros caracter es del cuerpo de la p ágina HTML, Lycos, en función de su bre- vedad seleccionaba entre las veinte primeras líneas o el 20 % del texto. AltaVista y Hot- Bot utilizaban la etiqueta Meta “description” para extraer el resumen, aunque lo más usual en la actualidad es la extracción de frases en las que aparece el término o términos de búsqueda. Dada la importancia que esta primera información tiene para el usuario, ya que en función de ella ha de decidir el interés del recurso, en la evaluación trataremos de va- lorar la utilidad de estos aspectos, analizando la frecuencia de aparición de los términos de búsqueda, la frecuencia de aparición de r ecursos comerciales y de recursos dependien- tes. Respecto a la ordenación, el gran número de recursos que suele aparecer hace que sea un aspecto fundamental, ya que el usua rio no suele consultar más allá de las tres primeras páginas de resultados. Esto requiere un buen funcionamiento de los algoritmos que intervienen. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 90 Excite ofrece dos opciones para ordenar los resultados, bien por buscador o por relevancia. Otra opción permite destacar en el contenido de los recursos recuperados, los términos solicitados. Courtois y Berry (1999) han observado que los resultados se ordenan de acuerdo con el cumplimiento de ciertos criterios como la cantidad de palabras de la expresión de búsqueda localizadas en el documento, dando mayor importancia a los docum entos de menor tamaño que las contienen, a la proximidad de los términos y a su ubicación en el documento. Además, aunque la fórmula exacta para la ordenación varía de unos motores a otros, la localización de las palabras, bien en el título o en etiquetas Meta, puede tener más peso que su aparición en el texto. La valoración de un aspecto u otro puede influir en la diferenciación entre buscadores, ya que mientras algunos de ellos excluyen en la indi- zación la metainform ación, otros sí la utilizan. En la evaluación trataremos de precisar qué motores utilizan la metainfo rmación en el ranking así como la frecuencia de aparición de los términos y su peso. En determ inados motores, la frecuencia relativa, es decir, el valor que representa la repetición de una palabra en la base de datos, también incide en la ordenación de los resultados. Los algoritmos que se aplican suelen ser secretos, si bien, en algunos casos pue- den deducirse. Podemos decir que en función de estos algoritmos se realiza el cálculo de la relevancia. En la mayoría de casos se aplica una ordenación basada en los términos del pro- pio recurso, pero Google utiliza además aspectos externos al documento como son los enlaces. Este buscador ordena los resultados teniendo en cuenta no sólo de la valoración de los aspectos mencionados anteriormente, sino añadiendo además una serie de valores que asigna en función de la existencia de enlaces de otras páginas que apunten hacia ellas, así como la importancia de estas páginas, que a su vez se valora por el número y calidad de enlaces que les señalan. Este algoritmo se denomina PageRank, y aunque en muchos casos ofrece buenos resultados, se ha criticado que favorece e impulsa la recupe- ración de recursos ya conocidos, en detrimento de los nuevos recursos. (Savoy y Picard, 2001). Así, la colocación de una página en los primeros puestos de resultados requiere cierto tiempo, hasta que el recurso es conocido y a su vez enlazado por otras páginas im- portantes. Introducción 91 WebQuery es otro algoritmo que de basa en cálculos de enlaces y actúa basán- dose en un conjunto de páginas que ordena en función de sus enlaces con otras 177 . Finalmente, como señalan Baeza-Yates y otros (1999), Kleinberg diseñó HITS (Hyperlink Induced Topic Search). Este algoritmo es utilizado por el buscador Clever, de IBM, actualmente en proceso experimental y por Teoma. El algoritmo, para facilitar la recuperación de recursos de calidad, distingue entre páginas autoridad, que son las que reciben un gran número de enlaces y páginas concentradoras o páginas eje, que contienen un importante número de enlaces a otras páginas, fundamentalmente de las consideradas “autoridad”. A estos valores añade otros cálculos basados en los métodos utilizados nor- malm ente como la frecuencia y la proximidad de térm inos. Este buscador utiliza dos tecnologías, por un lado la denominada Subject- Specific Popularity, que detecta comunidades de recursos en la Web en torno a una mate- ria y las coloca en los primeros lugares de las búsquedas. Por otro lado, Dinamic descrip- tions, basa su técnica en el análisis del contexto de los términos de búsqueda, lo que le permite mostrar resultados que aunque no contengan los términos de búsqueda, sí que tratan sobre el tema objeto de búsqueda. Wisenut aplica el algoritmo context-sensitive ranking que valora tanto los enlaces com o el contenido del documento. El cálculo de la relevancia se presta también a otras valoraciones. En primer lu- gar se suele valorar la posición de los térm inos según se encuentren en las etiquetas Meta, en los títulos, bien sea teniendo en cuenta la proximidad entre términos, o por la frecuen- cia, que actúa de forma inversamente proporciona l al valor del término en la base de da- tos. Se utilizan, además, valores de corrección según el lugar que ocupa el término dentro del texto, siendo mayor su valor si forma parte del título o de la cabecera del documento y cuanto más cerca del inicio del documento se encuentre. Como señala Notess (1999c) un valor más real es e l que s e aplica comparando la aparición del término con el número total de palabras que contiene un documento, lo que evita el problema de dar mayor valor a los documentos más grandes. Este autor señala además, como factor a tener en cuenta en la ordenación, la aparición del término de bús- queda en el URL, lo que suele tener en los motores una importancia especial, al igual que 177 Para más inform ación véase Li, Y. (1998) Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 92 ocurre con los términos que actúan como anclas de hiperenlaces hacia otras páginas, que a su vez reciben enlaces de otras. Google utiliza esta técnica valorando además, como acabamos de ver, si las páginas a las que se dirigen los enlaces tienen cierto prestigio. En otros casos, se basa en el número de enlaces que apuntan a un determinado recurso, en las páginas más visitadas, etcétera. Otras técnicas que se utilizan para mejorar la relevancia se basan en cálculos vectoriales, en las técnicas de agrupamiento o Clustering y en la retroalimentación de la relevancia (Relevance Feedback). El tema de la ordenación, por su importancia, ha dado lugar a un amplio número de trabajos dedicados al estudio del posicionamiento en los motores de búsqueda 178 . Es- tos estudios se centran en analizar cómo ordenan los motores los resultados de búsqueda y en base a qué características deciden qué recursos colocar en las primeras posiciones. Los criterios que utilizan están muy relacionados con lo anteriormente señalado. Por otro lado existe una corriente de estudio centrada en el análisis del ranking. Nosotros proponemos una valoración del ranking en función de la utilización de las eti- quetas Meta Key y Description, y de la frecuen cia y peso de los términos de búsqueda en las páginas recuperadas, y trataremos de analizar si hay correlación entre estas variables y la ordenación. Por tanto, a tenor del análisis de las diferentes partes de los buscadores Web, nos interesa analizar la respuesta de estas herra mientas ante los distintos tipos de búsquedas, de aquí que cada una de las búsquedas sea diferente (búsqueda por un término, varios términos, con operadores de existencia, booleana, por frase y por campo). Valoraremos así las capacidades de los programas de búsqueda y recuperación que soportan los dife- rentes buscadores. Del funcionamiento del robot analizaremos la profundidad de rastreo de los si- tios web, fundamentalmente en cuanto a la profundidad de extracción de información de los servidores web, nos ocuparemos de actualización, valorando la existencia de enlaces con error y duplicados. En relación con la base de datos, la estimación de su tamaño en función de la cobertura sobre las búsquedas planteadas, las características de la informa- 178 Véase por ejemplo el trabajo de L. Codina y M. C. Marcos (2005). Introducción 93 ción recuperada y la recuperación de páginas únicas y solapamiento entre buscadores. Otros aspectos a analizar son la precisión técnica y el ranking. 2.3.3.5. Identificación de los pr oblemas de recuperación de infor- mación en la Web Hemos visto con anterioridad, en el apartado dedicado a las características téc- nicas y problemas de la información en la W eb, alguno de los aspectos que van a incidir de forma negativa en la recuperación de dicha información y a los que los sistemas de recuperación tienen que hacer frente como son el gran número de docum entos existentes, su carácter cambiante y efímero, la variedad de formatos en los que aparece, no siempre legibles por todos los sistemas, el gran interés comercial, su escasa descripción, etcétera. También hemos mencionado al ocuparnos de las partes que constituyen los sis- temas de recuperación Web, aquellos que dependen exclusivamente de ellos mism os, como son los problemas relacionados con los índices, con la actualización de las bases de datos, etcétera. Tramullas y Olvera (2001) mencionan problem as como : la limitada cobertura de los motores, que por ejemplo, en el caso de HotBot no superaba el 32% del total de re- cursos existentes; la actualización de sus índices, que no se produce de forma automática, siendo más lenta en información menos solicitada, ya que determinados buscadores rele- gan estos servidores a los últimos lugares del orden de visita, resultando más frecuente- mente actualizados los que contienen información que se consulta periódicamente. Los motores no reflejan la variabilidad espacial y temporal de las páginas web, provocando la aparición del error 404, el acceso a las páginas se suele hacer de forma independiente a su contexto inform ativo, es decir, sin señalar si determinada página pertenece a un docu- mento electrónico mayor, y por último, la programación de los robots, que incide en la limitación para localizar información en los servidores más allá de un determinado nivel de la estructura de la W eb. De los cuatro problemas que Martínez (2002) señala en relación con la recupe- ración de la información, dos dependen del us uario (la formulación adecuada de la pre- gunta y la interactividad con la interface de usuario) y otros dos del funcionamiento del motor (inadecuada indización de los documento s y la limitada actualización de los índi- ces del motor). Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 94 Hípola y Vargas-Quesada (1999b) han criticado el desfase de estas herramientas y su actualización irregular. Lawrence y Giles (1998c) señalan como problemas los periodos de inactividad, baja cobertura, interfaz poco consistente, bases de datos anticuadas, pobre ranking de relevancia, baja precisión y dificultades con las técnicas de spam . A modo de resumen, planteamos a continuación una sistematización de mayor profundidad de los factores externos e internos que intervienen en la deficiente recupera- ción de la información que presentan estas herramientas. Entre lo factores externos, podemos señalar como más importantes: la cantidad de información existente en la Web, el limitado acceso a la información existente que estas herramientas proporciona, como en el caso de la Web Invisible, el carácter dinámi- co de la información en la Web, y la falta de estructuración de los recursos. Un trabajo de Lawrence y Giles (1999) indicaba respecto al tamaño de la Web, que en julio de ese año estaban a disposición del público 800 millones de páginas aloja- das en tres millones de servidores, y que los seis principales motores de búsqueda cubrían un 60% de los recursos, siendo Northern Light el más destacado con el 16%. El gabinete de estudios americano, Cyveillance cifraba en tonces en dos billones, el número de docu- mentos accesibles, aumentando la cifra en siete millones diarios. Señalan, además, que Google cuenta con la base de datos más comp leta estimada en un billón de páginas. Pero estos datos han quedado anticuados en muy poco tiempo pues un estudio más actual de Gulli y Signorini (2005) estima en 11,5 billones, el número de páginas indizadas y que por tanto forman parte de la Web visible. Tal cantidad de información dificulta y hace prácticamente imposible su total indización ya que exige un gran despliegue de medios, y más si tenemos en cuenta el importante núm ero de consultas diarias que soportan. Este aspecto incide en la limitación de acceso al total de los recursos existentes en la Web y exige tanto una selección de recursos como una especialización por materias. Respecto al segundo punto, es decir el que se refiere a la Web Invisible, es un hecho que los motores de búsqueda no pueden controlar toda la información de la Web. Existe además una gran cantidad de recursos de difícil acceso para los buscadores auto- máticos, que es lo que constituye la Web Invisible. Introducción 95 La Web invisible está formada principalmente por todos aquellos recursos que requieren la identificación del usuario para su acceso, como es el caso de las Intranets; toda la información alojada en servidores que impiden el acceso a los robots de búsque- da; la información alojada en marcos o frames y las páginas dinámicas, como por ejem- plo las que se generan al extraer información de una base de datos 179 , un diccionario in- teractivo, etcétera, que generan diferentes direcciones URL y que suelen alojarse tempo- ralmente en el disco duro del usuario, impidiendo, de este modo, su indización por los motores. Como ya hemo s visto al tratar del trabajo de los Crawlers o arañas, determina- dos servidores Web, que no desean que los mo tores indicen sus páginas, utilizan tanto un protocolo de exclusión, que consiste en un documento denominado robots.txt, que se ubi- ca en los servidores y contiene instrucciones sobre los ficheros a los que los robots tienen o no acceso, como una etiqueta Meta, con indicaciones dirigidas a los robots 180 . Otra información de interés que escapa a los buscadores es la contenida en ser- vidores que ofrecen noticias de actualidad que requieren una constante actualización. Finalmente hay que considerar en este apartado a los sitios y páginas que los ro- bots no indizan en un sitio web, normalmente porque supera la capacidad para la que han sido programados, y las páginas o sitios hacia los que no apunta ningún enlace. Un estudio de Lyman y Varian, citado por Tramullas (2002:602) recoge cifras referidas al año 2000 en las que muestra que la web visible podría contener unos 2,5 bi- llones de páginas 181 y la web oculta quinientos cincuenta millones. También son intere- 179 Por ejemplo las bases de datos de Access, Oracle, SQL y otras. Sin embargo, com o señala Salazar (2005:139) “Google ya está llegando a acuerdos partic ular es con bases de datos pa ra que su buscador pue- da indicar el contenido de éstas.” En este sentido, ya ofrece acceso a una peque ña parte de la base de datos WorldCat de OCLC (Online Computer Library Center), esto es a tan sólo dos mi llones de los cincuenta y ocho millones de registros que contiene. Tam bién da acceso a la base de datos de la Biblioteca Nacional de Medicina de Esta dos Unidos (NCBI). Yahoo también facilita acceso a bases de datos de la Biblioteca del Congreso de EEUU, de la Universidad de California en los Ángeles, la Radio Pública Naci onal de EEUU, la Universidad de Michigan y el Pro- yecto Gutenberg así com o a otras bases de datos de pago (Financial Times, The Wall Street Journal, The New England Journal of Medicine, las publicaciones del IEEE, etcétera). Todas ellas requieren para su acceso al documento pagar una cuota de suscripción. 180 Los comandos y etiquetas específicas destinadas a lo s robots pued en consultarse en la siguiente página web: <http://www.robo tstxt.org/wc/exclusion.html> 181 Cifra muy superior a la apuntada anteriormente por Lawrence y Giles, que se acerca más a la aportada por Cyveillance Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 102 lenguaje XML aporta soluciones, como el uso de etiquetas para contener información específica. Estas iniciativas por un lado, y la constante evolución de los motores de búsque- da, que tendrán que irse adaptando a estos nuevos sistemas descriptivos, por otro, permite pensar que la recuperación de la información en la Web debe de ir mejorando constante- mente, sin perjuicio de irse desarrollando otras iniciativas como es el caso de buscadores especializados, catálogos de recursos, agentes inteligentes, bibliotecas digitales, etcétera. La constante preocupación por la recuperación efectiva ha dado lugar al desarro- llo del concepto de web semántica, concepto creado por Tim Berners-Lee. El proyecto en la actualidad trata de desarrollar sistemas de descripción y consulta a través de estándares que permita describir, buscar y encontrar recursos de una forma norm alizada. En la actualidad, los desarrolladores de los motores de búsqueda, conscientes del problema de la falta de precisión en la recuperación, tratan de resolverlo de diferentes formas, bien mediante el desarrollo de algoritm os basados en la popularidad, como en Google, o mediante otras opciones de búsqueda avanzada, en AltaVista, Lycos, HotBot o Yahoo. Otras opciones utilizan el filtrado automático como es la opción “More like this” y otras similares. La ordenación por relevancia es otro aspecto de gran importancia en la recupe- ración. Su importancia viene dada por el hecho de que el usuario pocas veces consulta más de dos páginas de resultados, por lo que si una determinada herramienta quiere ser útil para el usuario, ha de ofrecer en los primeros puestos los resultados más relevantes. Para ello los buscadores han de aplicar técnicas de valoración por relevancia. Arms (2001:211) se refiere a que el problema del deficiente funcionamiento de los buscadores en este aspecto puede ser debido a que los algoritmos de ranking no tienen suficiente información en la que basar sus resultados. Los metabuscadores también tratan de solucionar algunos de estos problemas mediante técnicas que valoran el contexto en el que se encuentran los términos de bús- queda en el documento, la identificación tanto de páginas que ya no existen como de las que no contienen los términos de búsqueda, localización de páginas duplicadas, mejora del ranking y de la precisión. (Lawrence y Giles, 1998d). Es por esto que hay que valorar tanto la precisión como el ranking u ordenación de registros, ya que dichas técnicas no siempre se utilizan o lo hacen de forma eficiente. Introducción 103 Para ello, en la evaluación valoraremos aspectos como la precisión técnica y analizare- mos tanto la función que la metainformación puede jugar en la ordenación como las fre- cuencias y peso de los términos de búsqueda. 3. La evaluación de los sistemas de recuperación de la informa- ción y la s herramientas de búsque da de la World Wide Web . 3.1. Concepto y fines de la evaluación. El proceso de evaluación Según Ingwersen (1992) la Recuperación de la Información como disciplina científica se ocupa de diseñar, construir y probar sistemas de recuperación que faciliten el acceso a la misma. De aquí el amplio número de estudios que se dedica a la evaluación de dichos sistemas. En el presente capítulo vamos a exponer el contexto en el que tienen lugar los trabajos de evaluación de los SRI ya que en él se enmarcan los estudios de evaluación de los buscadores web, analizaremos las experiencias más importantes desarrolladas sobre estas herramientas y finalmente, trataremos de los indicadores seleccionados para llevar a cabo nuestro trabajo de evaluación. 3.1.1. Concepto de evaluación El Diccionario de la Real Academia 196 dice en sus dos primeras acepciones que evaluar es: “Señalar el valor de una cosa. Estim ar, apreciar, calcular el valor de una cosa”. Ello supone efectuar una medición, que bien puede ser global o basada en la va- loración de diferentes elementos, lo que requiere el establecimiento de un sistema de me- dida. Pero en la evaluación de los buscadores web no existen estándares que puedan ser utilizados para expresar sus puntos fuertes y débiles o para compararlos cuantitativa- mente. Tampoco hay unos criterios establecidos que sirvan como referencia en la evalua- ción sino que, como veremos al tratar sobre el estado de la cuestión, se utilizan diferentes parámetros en función de lo que se quiere evaluar. Además se recurre a medidas y méto- dos utilizados en la evaluación de otros sistemas de recuperación de información. En este Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 104 sentido, la utilización del método estadístico es el más recomendable, ya que facilita, mediante la recogida, análisis, y comparación de datos, suficientes elementos objetivos para valorar los aspectos de interés. La evaluación requiere también contrastar los datos obtenidos con los objetivos de estos servicios y juzgar hasta qué punto se cum plen. Desde el punto de vista de los especialistas en Recuperación de la Información, Lancaster (1992) señala que es: “esencialmente un procedimiento de diagnóstico (y eventualme nte terapéutico) en el que interesa la identificación del origen de los fallos del sistema”. En un trabajo anterior 197 indica que la evaluación de un sistema ha de hacerse valorando si alcanza sus objetivos, si es eficiente en este aspecto y si se justifica su exis- tencia. Resulta interesante esta visión de Lancaster por cuanto requiere un detenido aná- lisis de las partes del sistema; saber por qué se dan esos resultados, y ponerlo en conoci- miento de los desarrolladores de estas herramientas para buscar soluciones que mejoren los resultados. En este sentido, nuestro objetivo es también ofrecer una valoración impar- cial que permita conocer, tanto a los investigadores como a los especialistas en RI, el rendimiento de estas herram ientas en búsquedas de inform ación especializada. Desde el punto de vista práctico, se trata tanto de una herramienta de investiga- ción, de toma de decisiones y de gestión, que permite no sólo conocer el alcance de algu- no de los problemas que afectan a los Sistemas de búsqueda, sino también plantear su posible solución o mejora. Va a facilitar la tom a de decisiones tanto a los desarrolladores del sistema como a los usuarios, ya que en función de la valoración de sus fortalezas y debilidades, pueden decidir si usarlas o no y seleccionar la más conveniente. Como herramienta de gestión va a servir para plantearse su futuro, su posible desarrollo, la di- rección a seguir, etcétera. Finalmente, como herramienta de investigación permite, utili- zando el método científico, analizar y valorar un acontecimiento, un hecho, un objeto, en este caso los buscadores de información de la Web. Steiner (1979) ha señalado además, 196 Diccionario de la Lengua Españo la. 21ª ed. Madrid, Rea l Academia Española, 1992. 197 Lancaster (1971). Introducción 105 su valor como herramienta de control respecto a la consecución de los objetivos marca- dos. Abad (2002:671) define la evaluación como : “un proceso mediante el cual se intenta obtener un juicio de valor o una apre- ciación de la bondad de un objeto, de una actividad, de un proceso o de sus resultados. Esto es, la puesta en práctica de un procedimiento con el que poner de relieve las cualida- des, ventajas y debilidades de aquello que se evalúa”. No obstante nos parece más acertada la expresada en un trabajo posterior (2005:41) al referirse a la evaluación tam bién como: “proceso que tiene como objetivo la realización del diagnóstico de una situación determinada cuy o resultado será la emisión de un juicio de va lor acerca del funcio na- miento, calidad, aceptación o cualquier otra cualidad de un sistema de inform ación.” En este caso, deja abierta la evaluación, pudiéndose centrar en la valoración de la cualidad o cualidades de su funcionam iento que, en cada caso, interese analizar. Por otro lado, esta autora señala la necesidad de un referente con el que compa- rar, que será distinto de acuerdo con los fines que persiga la evaluación. Dado que este aspecto no es posible en la evaluación de buscadores web, por las características dinámi- cas de este medio, se suele recurrir al método com parativo entre distintos sistemas para destacar alguno de ellos. Desde un punto de vista más específico, para Harter y Hert (1997) la evaluación es un proceso que trata de valorar la efectividad de un servicio o sistema y en qué medida se cumplen sus m etas y objetivos. Como resumen y en opinión de Hernon (1998), evaluar un sistema es el proceso de identificar o recabar datos acerca de actividades y servicios específicos, estableciendo criterios por los que pueda calcularse su bondad o acierto y determinarse la calidad de la actividad o servicio, y el grado en que éstos logran sus m etas y objetivos. 3.1.2. Fines y objetivos Aunque algunas de las definiciones anteriores llevan im plícitas información so- bre para qué se evalúa, es interesante profundizar algo más en este aspecto. Abad, en una monografía reciente (2005:20) señala que la evaluación suele responder a alguna de las siguientes razones: Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 106 1. Medir la consecución de los objetivos previam ente establecidos. 2. Disponer de un instrumento para diagnosticar los puntos débiles en el fun- cionamiento. 3. Facilitar el proceso de la toma de decisiones. 4. Permitir la comparación entre sistemas mediante la construcción de estánda- res de referencia. 5. Justificar la existencia de los servicios y sistem as de información. De este m odo se consigue valorar la eficaci a, la eficiencia o el impacto de un de- terminado servicio; valorar la correcta realización de los procesos; tratar de responder bien a la calidad de los procesos o a la corrección de la realización de las operaciones documentales; finalmente, las dos siguientes razones facilitan la toma de decisiones, aun- que en el ámbito de la Web, es difícil poder establecer estándares de referencia y sirve para justificar el mantenimiento de un servicio o su mejora. Se tiene en cuenta la satisfac- ción del colectivo al que va destinado y se ha de justificar el cump limiento de sus objeti- vos y el mantenimiento de la calidad, etcétera. Desde nuestro punto de vista, al tratar de valorar su funcionamiento, nos parecen de especial interés las razones señaladas en pri- mero, segundo y quinto lugar. Consideram os también importante la tercera razón, ya que ha de suponer una intención de mejora por parte de los desarrolladores de los sistemas que obtengan los peores resultados. De lo anterior, hemos de destacar la idea de que de- bemos conocer en prim er lugar para qué evaluamos. En nuestro caso, éstas serían las razones para la evaluación: -Conocer si son útiles en búsquedas de información científica y cuál o cuáles lo son más. -Conocer si su funcionamiento es correcto. En este sentido, hemos de apuntar que es nuestra intención valorar tanto la reali- zación de las operaciones documentales que llevan a cabo los buscadores y metabuscado- res de la Web, como su correcto funcionamiento y utilidad, especialmente en recupera- ción especializada, y establecer comparaciones que permitan seleccionar los m ás útiles. Introducción 107 Abad ha estudiado el tipo de evaluación correspondiente a cada una de las fases de lo que denomina “ciclo vital” de los sistemas de información 198 . Nuestra experiencia se relaciona con la fase de funcionamiento o rutina, que se caracteriza por un funciona- miento fluido del sistema y unos usuarios más o menos fieles. La finalidad de la evalua- ción en esta fase es valorar si el sistema cumple con las metas y objetivos propuestos, y cómo los cumple. Las investigaciones pueden centrarse en evaluar el comportamiento de los componentes del sistema o en el funcionamiento global. Entre los primeros señala el input del sistem a y el proceso documental. Respecto a los segundos, se refiere a la efica- cia 199 de la recuperación, la eficiencia y la satisfacción. Esta segunda tendencia está más centrada en la valoración del funcionamiento desde el punto de vista del usuario. Crawford (1996) y Abad (2005) coinciden en que la evaluación ha de recoger in- formación que facilite la toma de decisiones y la justificación y defensa de los recursos empleados. Señalan además que ha de determinar la calidad del servicio, resolver en la medida de lo posible los problemas que se presentan y descubrir las bases para nuevas mejoras. Estos fines coinciden plenamente con los que nos hemos planteado al evaluar los motores web, ya que seguir este planteamiento nos permitirá seleccionar los buscado- res que ofrecen una mayor calidad ante búsquedas sobre temas especializados y conocer cuáles son los que menos acusan los problemas detectados en estas herramientas, lo que ha de servir además para f acilitar su mejora. 3.1.3. Proceso de evaluación Como acabamos de ver, la mayoría de autores especializados en evaluar siste- mas de recuperación de la información, se refieren a la evaluación como un proceso. Abad señala las siguientes etapas, que tratarem os de seguir: 1. Obtener los datos sobre la situación actual del sistem a a evaluar. 2. Decidir los criterios según los que se evaluará el sistema y definir los indica- dores para la obtención de resultados. 3. Recoger los datos sobre los aspectos a evaluar. 198 Señala como fases en las que se puede evaluar: Planificación, Viabilidad, Diseño, Im plantación y Fun- cionamiento o Rutina. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 108 4. Comparar los hallazgos obtenidos con una situación de referencia o estándar. 5. Emitir un juicio de valor basado en el análisis de las diferencias y similitudes entre la situación observada y la situación de referencia. 6. Averiguar el origen de las diferencias encontradas. 7. Establecer unas acciones y recomendaciones para la mejora. La evaluación es un proceso complejo en el que como indican Large y otros (1999) se ha de tener en cuenta tanto el punto de vista mecánico, el humano y la utilidad para un grupo determinado. Los basados en el punto de vista del usuario utilizan m edidas que tratan de valorar su satisfacción con los resultados. Nosotros nos ocupamo s de evaluar los procesos de formación de la base de da- tos, la composición de índices y las capacidades de búsqueda y recuperación, por lo que deberemos utilizar los parám etros que nos permitan valorarlos. 3.2. Tendencias en la evaluación de SRI Antes de referirnos a los indicadores, debemos tener claro qué tipo de evalua- ción queremos llevar a cabo. La evaluación de SRI tradicionales se ha abordado princi- palmente desde dos puntos de vista: el del sistem a y el del usuario. Inicialmente se cen- traron tanto en medir la validez de sus índices y comparar la recuperación basada en el lenguaje natural con la ofrecida mediante vocabularios controlados, (Cleverdon 1966, Lancaster 1968, Aitchison 1969-1970, Keen y Digger 1972, etcétera), como en valorar la efectividad de los sistemas, midiendo la relevancia de la información recuperada, o el comportam iento de un determinado program a o herramienta de búsqueda. Sin embargo para Salton (1983), una correcta evaluación debe contemplar am- bas perspectivas y Rijsbergen (1979) piensa que la evaluación del Sistema de Recupera- ción de Información debe reflejar la capacidad del sistema para satisfacer al usuario. La corriente actual trata pues de integrar ambas tendencias considerando tan válida una co- mo la otra, ya que por ejemplo, tan importante puede ser conocer la opinión de un usuario 199 Entendida como “capa cidad del sistem a de recuperar inform ación relevante para el usuario.” Abad (2005:143). Introducción 109 respecto a determinada característica de un sistema de recuperación como la actualiza- ción o la cobertura de su base de datos. Tanto Ingwersen (1992) como Ellis (1992) señala tres grandes bloques respecto a la investigación en torno a la Recuperación de la Información, a saber: el clásico o al- gorítmico, el orientado a usuarios y el modelo cognitivo. Este último tiene en cuenta as- pectos relacionados tanto con el sistema como con el usuario. Harter y Hert en un importante estudio publicado en 1997 se ocupan de analizar con cierta profundidad diferentes planteamie ntos, problemas y métodos de la evaluación de SRI, y reducen a dos las tendencias im portant es en este campo: la clásica y la orienta- da al usuario. La primera se ocupa de los algoritmos y estructuras de datos necesarios para optimizar la eficacia de las búsquedas y la segunda se centra en el usuario, en anali- zar su interacción con el sistema de recuperación, y en el papel de las fuentes de conoci- miento implicadas en la Recuperación de la Información. Estos autores consideran que ha de darse mayor im portancia a la interacción usuario y sistem a. La corriente tradicional tiene sus más claros antecedentes en las experiencias desarrolladas en el Proyecto Cranfield, puesto en marcha por Cleverdon en 1957, para el que se señalan dos etapas, Cranfield I (1957-1962) y Cranfield II (1963-1966), de las que surgieron fundamentalmente un marco teórico, una metodología y unas herramientas bá- sicas para la evaluación de SRI. Entre éstas últimas, se estableció la necesidad de contar con una colección de documentos fuente; señalar una serie de valores para medir la efec- tividad de los sistemas, teniendo en cuenta la recuperación de documentos relevantes y la exhaustividad, estableciendo como m edidas la exhaustividad y la precisión. Estos estudios tuvieron una aplicación inmediata en la evaluación de sistemas como SMART, realizado por Salton des de inicios de los 60, la base de datos MEDLARS (Medical Literature Analysis and Retrieval System) llevado a cabo por Lancaster entre 1966 y 1967 200 , o el caso de la base de datos STAIRS (Storage and Information Retrieval System) evaluada por Blair y Maron en 1985. 200 Abad (200 2) señala que el tr abajo de Lancas ter “pus o en evidencia que en el contexto real no sólo e ra necesario conocer la eficacia del sistema, sino que debían explorar la s causas que conducían al éxito y al fracaso de la recuperación”. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 110 Como hemos señalado, los principales valores en que se basaban estas evalua- ciones son la exhaustividad y la relevancia. Su valoración correspondía a expertos ya que podían juzgar de forma m ás exacta el valor de los documentos o referencias recuperadas. Las críticas a esta tendencia arrancan con Doyle (1964), quién señaló su carácter subjetivo. Posteriormente Ellis (1984) reparó en las dificultades a la hora de definir la relevancia. Harter y Hert (1997) por su parte, centran sus críticas en la ausencia del usua- rio en la evaluación, en las dificultades que plantea el criterio de la relevancia, y en que las experiencias son poco reales por lo que los resultados no pueden compararse con otros basados en consultas y usuarios reales. Korfhage (1997) va más allá, al plantear que no está claro que exhaustividad y precisión sean m edidas significativas para el usuario. Estas críticas se han visto superadas en el ámbito de las experiencias TREC (Text REtrieval Conferences), que se celebran anualmente desde 1992 y cuya metodolo- gía para la evaluación de sistemas de recuperación, establece la existencia de una am plia colección de documentos y unos procedimientos normalizados, dirigidos a evaluar, fun- damentalm ente, los algoritmos que utilizan estas herramientas, así como los contenidos de las bases de datos, su comportamiento ante diferentes búsquedas, utilización de tesau- ros, recuperación de información en idiomas específicos, los mecanism os de recupera- ción a través de la voz y la incorporación del punto de vista hum ano. Pero tampoco las experiencias TREC han estado exentas de críticas, pues como recoge Chaín (2004:184) diferentes autores han mostrado su desacuerdo en basar la eva- luación en juicios de relevancia, en el modo en que se seleccionan los temas de búsqueda y en los juicios poco realistas para usuarios reales. Craswell, Bailey y Hawking (1999) se han referido a la diferencia entre los sistemas TREC que recuperan recursos planos frente a los hipertextuales de los sistemas Web, lo que puede influir en los juicios de relevancia al no valorar positivamente páginas que enlazan con otras que sí son relevantes. Tam poco están de acuerdo los investigadores en que la valoración de la relevancia deba hacerse respecto a la materia y no a la calidad del r ecurso. Blair (2002) ha criticado la forma de Introducción 111 calcular la exhaustividad 201 ya que en su opinión se ofrecen valores superiores a la reali- dad. No obstante, esta corriente también ha dejado su impronta, como veremos, en los estudios de evaluación de buscadores Web llevados a cabo por Ding y Marchionini, Chu y Rosenthal, Clarke y W illett, y Leighton y Srivastava. Respecto a la tendencia centrada en el usuario, para Olvera (1998:26): “[...] trata de representar los problemas de información, comportamiento en l as búsquedas y componente s humanos d e los sistem as de información en situaciones reales. Se nutre princi palmente de la ps icología cognitiva y emplea métodos de las ciencias so- ciales [...]”. En este tipo de investigaciones entran en juego aspectos que tienen que ver con el comportamiento mental de los usuarios y de las características de sus búsquedas de información, teniendo en cuenta tanto al individuo como los contextos sociales y organi- zativos (Olvera 1998). Este enfoque ha sido analizado en diferentes trabajos de autores como Inwersen (1982), Saracevic y Kantor (1988), Spink y otros (1996), Borlund (2000), y por Su (1994) que lo ha aplicado a los sistem as de recuperación de la W eb. En un traba- jo de 1989 ya utilizó variables com o las aptitudes técnicas y características personales. Esta tendencia ha ido ganando importancia en los últim os años dado que el usua- rio tienen cada vez un acceso más directo a estos sistemas, ganando protagonismo en este aspecto, de manera que las evaluaciones cada vez se han venido preocupando más de expresar la opinión del usuario y su grado de satisfacción. Criterios a tener en cuenta son los aportados por Keen, que recogen Martínez y Rodríguez (2004a): la cobertura, entendida como la proporción de los documentos rele- vantes conocidos que el usuario ha recupe rado; la novedad, que contempla los documen- tos recuperados relevantes desconocidos para el usuario; la exhaustividad relativa y el esfuerzo de exhaustividad. 201 La metodología que se emplea se basa en la constitución de una colec ción de recursos relevantes fruto de una pr im era búsqueda en los diferentes buscad ores a evaluar, que se utiliza para comparar la recupera- ción individual de los diferentes buscadores. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 118 Como vemos, en función del punto de vista desde el que se aborde la evalua- ción, se utilizan diferentes medidas. En este sentido, Peña y otros (2002) proponen, según se trate de evaluar el sistem a en sí: exhaustividad, precisión, fracaso y sus valores; el sis- tema desde el punto de vista del usuario: exhaustividad relativa, precisión del usuario, esfuerzo de exhaustividad, cobertura y novedad, o los procesos, proponiendo, en este caso, la evaluación de la realimentación. Martínez y Rodríguez (2003) han sistematizado los diferentes aspectos que se han utilizado para evaluar SRI, valorando su necesidad y utilidad. Hacen un repaso de las medidas tradicionales, es decir tanto de las basadas en la relevancia (precisión, exhausti- vidad, tasa de fallo y factor de generalidad) como las orientadas al usuario (cobertura, novedad, exhaustividad relativa y esfuerzo de exhaustividad) y otras medidas alternati- vas, también denominadas de valor simple, que se basan en cálculos probabilísticos como el Modelo de Swet, basado en cálculos de probabilidad de que los registros recuperados correspondan a documentos relevantes, el Modelo de Robertson, sim ilar al anterior en sus objetivos, el Modelo de Cooper, que trata de me dir el ahorro de esfuerzo en la consulta de los listados de resultados de una búsqueda, las medidas SMART, etcétera. Como ve- mos se trata de métodos que utilizan la probabilidad para valorar la exhaustividad y la precisión, basándose en aspectos muy específicos. De la serie de medidas que analizan para medir la efectividad de la recuperación, presentan como valores positivos: el poder ser medidas de forma intuitiva, mediante cálculos simples; (la precisión; la exhaustivi- dad; la cobertura y la usabilidad), junto a otras menos utilizadas o que no inciden en la valoración de la efectividad como son el fo rmato de presentación, el contenido, el tiempo y el coste de la búsqueda. En todos estos valores, estos autores aprecian un cierto grado de subjetividad. Respecto a la usabilidad, Harter y Hert (1997) la definen como la capacidad del sistema para facilitar una ejecución efectiva, eficiente y satisfactoria de la labor del usua- rio. Las medidas son: la exactitud, el porcentaje de errores, la recuperación, las percep- ciones del usuario sobre la facilidad de uso y su satisfacción. Como señala Johnson, pos- teriores investigaciones han analizado las relaciones de estas medidas con las capacida- des cognitivas del usuario. Jonhson y otros (2001) citan como aspectos a evaluar: la cobertura, la precisión, el tiempo de respuesta, la utilidad, la presentación de los resultados y el esfuerzo del usuario para obtener resultados satisfactorios. Dentro de la utilidad y valor de los recur- Introducción 119 sos consideran: la calidad, la consistencia de los resultados y los recursos inactivos, ca- ducados y duplicados. Abad (2005) sigue la tendencia que señala que la evaluación de estos sistemas en entornos reales, puede abordarse desde el punto de vista del propio sistema o del usua- rio. En el primer caso se trata de poner de manifiesto el rendimiento del sistema en la recuperación y establece como indicadores para ello la precisión, la exhaustividad, un análisis de fallos, en los que se tiene en cuenta diversos aspectos que tienen que ver con las necesidades de información, con la búsqueda, con el conocimiento del sistema y con la interacción del usuario con el sistema. Otros aspectos que deben valorarse son los fa- llos de precisión, de exhaustividad así como el ruido, el silencio, el índice de irrelevancia o de generalidad. El otro punto de vista debe permitir la adaptación del sistema a las ne- cesidades y al entorno de usuarios al que presta su servicio. Una de las propuestas más completas la ofrecen Abadal y Codina (2005:193) al agrupar los criterios en tres grupos en función de que tengan que ver con la base de datos (el contenido), con el sistema de recuperación de la información (el continente) o con la gestión o administración de la base de datos. En el primer apartado contemplan la necesi- dad de expresar el grado de exactitud y precisión, valorando aspectos como los errores gramaticales o de omisión, la fiabilidad de datos y los registros duplicados. Respecto al alcance y cobertura, se han de analizar estos aspectos tanto desde el punto de vista temá- tico como geográfico y lingüístico, el grado de inclusión, la estructura, el tam año y el nivel de crecimiento. Por otro lado ha de valorarse, respecto a la actualización, tanto el grado de ésta como el periodo que tarda en actualizarse. El último aspecto de la base de datos se refiere a la consistencia, que ha de ponderarse tanto en relación con la cataloga- ción como con el análisis de contenido. En cuanto al sistema de recuperación de la in- formación, los criterios a tener en cuenta son: las prestaciones del lenguaje de interroga- ción, la precisión, la exhaustividad, el tiempo de respuesta, la utilidad, los formatos de visualización y el interfaz. Por último, respecto a la gestión de la base de datos se debe evaluar su documentación, la atención al usua rio, el precio y sistema de facturación y el sistema de distribución. Desde nuestro punto de vista, estos autores son los que con mayor claridad seña- lan los problemas que puede plantear aplicar una metodología propia de los SRI tradicio- nales a los buscadores de la W eb. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 120 Así, teniendo en cuenta la opinión de distintos teóricos sobre el tema que seña- lan como requisito imprescindible para la evaluación, conocer los objetivos del sistema a evaluar, y dado que generalmente se trata de perm itir recuperar información útil al usua- rio, que sólo él, en función de sus necesidad es de información puede juzgar, nuestra eva- luación se enfoca a la valoración, desde un punto de vista técnico, que permita interpretar si es correcto el funcionamiento de estas herramientas, sino también su utilidad en bús- quedas especializadas, pudiendo el usuario, posteriorm ente calibrar de una forma perso- nal, la utilidad de los recursos recuperados. Por lo que nos acercamos a Cooper (1973) para quien el objetivo de un sistema de recuperación es, o debería ser, recuperar docu- mentos útiles y no solam ente relevantes. Respecto a los criterios, han de estar estrechamente relacionados con los objeti- vos de la evaluación, ya que puede ir enfocada a valorar una determinada parte del siste- ma, como puede ser la base de datos, o incluso un determinado parámetro, como por ejemplo la ordenación, etcétera. Además hay que tener en cuenta la metodología que se aplica, ya que muchas de estas propuestas van acompañadas de determinados medios, como pueden ser una determinada colección de búsqueda, unas determinadas herramien- tas que facilitan ese tipo de evaluación, etcétera. Podemos apreciar que no todos los criterios son aplicables a los buscadores web, ya que, sobre todo en el aspecto de la gestión, es m ucha la diferencia entre unos sistem as y otros. Lo mismo podemos decir de la consistencia o del grado de exactitud, ya que los registros no son creados por personas dependientes de la empresa que mantiene el busca- dor, sino que, de existir, los datos son introducidos por personas ajenas a la compañía que mantiene el buscador. Por eso es necesario realizar una propuesta de criterios más acorde con el medio en el que nos encontramos. En este sentido, deberemos tener en cuenta las recomendaciones sobre los parámetros a utilizar empleados por diferentes autores en sus estudios, muchos de ellos caracterizados por la aplicación de algunos de estos criterios. Será necesario analizar las distintas experiencias realizadas, aspecto del que nos ocupa- remos en el siguiente apartado. Además de valorar su adecuación a estos nuevos sistemas, deberemos seleccio- nar los criterios que nos permitan valorar nuestros puntos de interés, que como hemos apuntado, tienen que ver con el funcionamiento y con la utilidad de estas herramientas en búsquedas especializadas. Así, nos planteamos evaluar estos servicios porque ante tal variedad y número de buscadores, a menudo surgen dudas sobre cuál o cuáles pueden ser Introducción 121 los más idóneos, atendiendo a su correcto func ionamiento general, a su correcta recupe- ración mediante diferentes tipos de búsqueda, a su actualización, a su indización de los sitios web o de las propias páginas, a la me nor recuperación de duplicados, de recursos no activos, etcétera. Cada uno de estos aspectos requerirá sus elem entos de ponderación. 3.4. La evaluación de las herramientas de búsqueda de la World Wide Web. Estado de la cuestión e Indicadores utilizados 3.4.1. Estado de la cuestión En el siguiente apartado nos ocuparemos de los diferentes trabajos publicados sobre evaluación de los buscadores con el fin de apreciar tanto los enfoques desde los que se han realizado, los criterios utilizados y la metodología y resultados, aspectos que, en la medida de lo posible, y siempre que persigan los mism os objetivos, trataremos de aplicar en nuestra evaluación. Aunque hay un gran número de trabajos de evaluación sobre diferentes aspectos de los buscadores, no todos intentan aplicar las directrices que se trazan a partir de los estudios teóricos, echándose de menos en este cam po, una metodología estándar propia al respecto, siendo necesario recurrir a experiencias de diferentes servicios y sistemas de información científica, para encontrar un m étodo de evaluación que pueda ser aplicado a estas herramientas. La evaluación de los motores de búsqueda se ha abordado desde diferentes pers- pectivas: la matemática (Mizzaro), la de ingeniería mecánica e industrial y la informática (Can, Nuray y Sevdik, Gwizdka y Chignell, Nasios y otros, Rousseau, Bharat y Broder, Brin y Page, Courtois y Berry, Figuerola, Zazo y Berrocal, Leighton y Srivastava, Picard y Saboy, Thelwall, Jansen y Pooch); desde el punto de vista de la biblioteconomía, la bibliometría, las ciencias de la inform ación y documentación, (Aguillo, Bar-Ilan, Chu y Rosenthal, Notess, Johnson, Griffiths y Ha rtley, Ljosland, Martínez, M aldonado y Sán- chez, Olvera, Oppenheim y otros, Snyder y Rosenbaum , Vaughan, Westera, Winship), así como los que desarrollan su labor en laboratorios de investigación o forman parte de gru- pos multidisciplinares (Lawrence y Giles, etcétera). De aquí que podamos afirmar que la evaluación de los buscadores tiene un m arcado carácter interdisciplinar. En uno o en otro sentido, los puntos de interés de los investigadores en recupe- ración de la información en la Web giran en torno a los motores y su efectividad; aspecto sobre el que existe un amplio número de trabajos que se presentan tanto en reuniones, Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 122 jornadas y congresos monográficos, publicándose en revistas especializadas y en la Web. Ejemplo de ello son las conferencias TREC. A partir de la séptima edición, celebrada en 1999 Hawking ha presentado importantes estudios que tratan de comparar los algoritmos utilizados en sistemas TREC con los utilizados en la Web. Otros autores se han ocupado de estudiar desde el punto de vista teórico aspectos relacionados con el tratamiento y de- sarrollo de nuevas técnicas y algoritmos de recuperación (como el agrupamiento de re- cursos relacionados, técnicas de filtrado, etcétera) así com o con la clasificación de recur- sos manual y automática, la elaboración automática de índices y resúmenes, la búsqueda de elementos multimedia, el uso de agentes inteligentes y el desarrollo futuro y tenden- cias posibles, siendo la evaluación de los sistem as de recuperación uno de los temas m ás tratados. Es difícil sistematizar el amplio número de estudios desarrollado a lo largo de los últimos años en torno a la evaluación de los buscadores de información de la Web, sin embargo, Gordon y Pathak (1999) señalan dos grandes grupos: por un lado el que contie- ne las evaluaciones que denomina testimoniales, y por otro, las cuantitativas. Las prime- ras son las que se publican en la prensa o por empresas relacionadas con la industria in- formática, que mediante test, comp aran: la velocidad de recuperación de información de los motores, la facilidad de uso y el diseño de interfaces. También evalúan aspectos más técnicos como : la posibilidad de utilizar operadores en las ecuaciones de búsqueda, la valoración de los recursos que contiene la base de datos y el tiempo que les cuesta indizar nuevas páginas. En este sentido podemos señalar los trabajos de Morville, Rosenfeld y Janes (1996), Overton (1996), Courtois y ot ros (1996), Steinberg (1996) Calafia (1997), Slot (1997) y Lake (1997). En el otro grupo de trabajos se comp ara la efectividad entre los motores de bús- queda, siguiendo los métodos tradicionales de evaluación que se proponen en recupera- ción de la información. En este grupo se encuentran los trabajos más importantes sobre el tema, que tratan de medir aspectos como la relevancia, la pertinencia o la interfaz de usuario. (Winship 1995, Ding y Marchionini 1996, Leighton 1996-1999). Su (2003) en una brillante sistematización de los estudios de evaluación, esta- blece dos etapas. La primera, que compre ndería los años 1995 y 1996, caracterizada por una serie de trabajos enfocados a orientar y facilitar la elección a los usuarios, ocupándo- se de las características de los motores y capacidades de búsqueda, así como por la exis- tencia de otros estudios, que aunque presentan una metodología más o menos elaborada, Introducción 123 no alcanzan resultados homogéneos, ya que varían los criterios de evaluación tanto en número como en tipo. Critica la forma en que se desarrollan los test, ya que en muchos casos proceden de consultas reales, otras son elaboradas y otras responden a intereses personales o sim- plemente no se indica. El núm ero de consultas para la evaluación varía entre dos y diez. En resumen, pone de manifiesto la falta de una metodología de evaluación sis- temática y com ún que contemple a los usuarios. La segunda etapa, entre 1997 y 2000 se caracteriza por unos estudios con crite- rios mejor definidos y una metodología basada en criterios estadísticos y m ayor sistema- tización. En este periodo las medidas más empleadas son por este orden, la precisión, la validez de enlaces, el solapamiento, la exhaustividad, la cobertura, la ordenación por re- levancia, teniendo en cuenta tanto el punto de vista del usuario como el funcionamiento del sistema. Otros valores usados son el tiempo de búsqueda y de respuesta, la actualidad, el coste, etcétera. Martínez (2002) clasifica los estudios de evaluación en: explícitos e implícitos. Los primeros contemplan aspectos externos al motor como pueden ser: el tamaño del índice, audiencia, el mayor o menor uso para realizar búsquedas, la porción de la página indexada y la fidelidad. Los implícitos, junto a medidas basadas en la relevancia, se ocu- pan de analizar los enlaces fallidos, el solapamiento y el acierto único. Este autor se ha referido, además a la disparidad y dispersión tanto en los estudios de evaluación como en los resultados. Hawking y otros (2001a), desde la perspectiva de las experiencias TREC, evalú- an la calidad de los motores web. Para ello toman las preguntas de los logs de dos de ellos. Analizan veinte buscadores, de los cuáles dos son m etabuscadores (MetaCrawler e Inquirus) y un directorio (LookSmart) mediante 54 consultas sobre diferentes temas. Se valoran los veinte primeros resultados. La relevancia, basada en el contenido textual, es juzgada por las personas que realizan la investigación utilizando valores binarios. Evalú- an fundamentalmente la efectividad de los algoritmos de recuperación de documentos, valorando, en la lista de recuperación, la posición de los documentos relevantes. Utilizan sólo los enlaces activos, no penalizando la recuperación de recursos a los que no se puede acceder ya que esto les permite establecer comp araciones con resultados obtenidos en sistemas evaluados utilizando la metodología TREC. No obstante se apartan de ella en Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 124 otros aspectos como el prescindir del uso de una colección estándar. Los resultados muestran diferencias en la recuperación entre los diferentes motores, y respecto a la pre- cisión de los cinco primeros resultados, observan que no está en relación con la mayor cobertura del índice de determinados buscadores. Los mejores buscadores utilizan algo- ritmos cuya efectividad se aproxim a a la de los sistemas TREC. Metodológicamente estos autores señalan la dificultad de realizar evaluaciones que puedan ser repetidas ante la inexistencia de una colección estándar de recursos web que lo facilite. Señalan además que se ha de tener en cuenta al plantear la evaluación, las necesidades de información (según se trate de una pregunta directa, búsqueda de un re- curso único, de una selección de documentos o de una necesidad de recuperación exhaus- tiva de recursos sobre un tema) ya que, en función de ellas, la técnica utilizada será dife- rente. Igualmente señalan la recomendación de repetirla cada cierto tiempo, así como la necesidad de establecer unas medidas que sirvan de media y com o punto de comparación. Desde nuestro punto de vista, se trata de una metodología muy interesante pero plantea problemas por su carácter restrictivo, al centrar su interés fundamentalm ente en valorar la efectividad, sin analizar otros aspectos que nos parecen deben tenerse en cuenta como son el solapam i ento, valoración de enlaces fallidos, actualización, etcétera. Coincidimos con estos autores en que es difícil, si no imposible, establecer una metodología única para evaluar los motores de búsqueda, ya que los estudios se realizan desde diferentes puntos de vista, tanto en función de la formación del evaluador, (espe- cialista en ciencias de la computación, especialista en Documentación, bibliotecario, et- cétera), como de la orientación, dependiendo de si el objetivo es valorar la satisfacción del usuario o plasmar hasta qué punto es correcto su funcionamiento. Estas necesidades pueden ser a su vez tan específicas que, dependiendo de ellas, puede establecerse una metodología concreta. Es normal que esto haya sido así, y que cada uno haya optado por aplicar una determinada perspectiva y los conocimientos e incluso fórmulas propias del área de investigación a la que se dedica. En función de tanta variedad podemos afirmar que prácticamente existen tantos métodos de evaluación com o trabajos se han realizado. Sin em bargo, una perspectiva de diez años en el funcionamiento y evaluación de estos motores sí puede darnos unas pautas y unos indicadores suficientemente representa- tivos para poder evaluarlos, pudiendo seleccionar los criterios m ás importantes que sirvan Introducción 125 tanto a usuarios y desarrolladores, y que en definitiva, nos ayuden a cumplir los objetivos de nuestra evaluación. Exponemos a continuación, ordenados cronol ógicamente, los trabajos más inte- resantes relacionados con la evaluación de los buscadores, ya que alguno de ellos es de obligada referencia, tanto por su importancia a nivel teórico como metodológico. En el caso de autores que han realizado diferentes trabajos de evaluación, hemos preferido pre- sentarlos unos a continuación de otros para observar mejor, en su caso, la evolución me- todológica utilizada en cada uno de los trabajos. Uno de los primeros trabajos es el de Winship (1995), quien com paró los moto- res World Wide Web Worm, WebCrawler, Lycos, Harvest y los directorios Galaxy y Yahoo. Analizó tanto el contenido y la formación de la base de datos, valorando si indi- zaban las direcciones URL, los títulos, los resúmenes, el texto completo así como el ta- maño y la posibilidad de envío de direcciones por parte de usuarios, la interface, las op- ciones de búsqueda, la recuperación, y sus prestaciones, tendiendo en cuenta además, los mecanism os de control por parte del usuario, el contenido de los registros y el control sobre el modo de ordenación, considerando en este sentido, el número de documentos recuperados y su presentación. Lycos y Harvest obtuvieron los m ejores resultados. Lycos y OpenText fueron los buscadores q ue obtuvieron m ejor puntua ción en la evaluación realizada por Courtois, Baer y Stark (1995) que trataba de averiguar cuáles de los motores existentes (CUIW 3, Catalog, Harvest, Lycos, OpenText, WebCrawler, W3W orm y Yahoo) recuperaban recursos fundamentales referidos a tres temas de bús- queda. También valoraron positivamente a WebCra wler por su rapidez y flexibilidad para elaborar la consulta. El mism o año comenzaron a realizarse los estudios de Leighton (1995) basados en la precisión y tiempo de respuesta utilizando los diez primeros registros. No analizan la exhaustividad, dado el tamaño de la Web y la disposición desestructurada de la infor- mación. Valoran la relevancia, los recursos únicos y la validez de los enlaces (enlaces activos, duplicados, existencia de copias en mirrors, etcétera) de InfoSeek, Lycos, Web- Crawler y World W ide Web Worm mediante ocho búsquedas. Lycos e InfoSeek obtuvie- ron la mejor valoración en cuanto a tiempo de respuesta y precisión, calculando esta úl- tima en función de su adecuación a los térm inos de búsqueda. En 1997 desarrolló estos estudios junto a Srivastava, analizando los veinte primeros resultados de quince consultas lanzadas sobre AltaVista, HotBot, Excite, InfoSeek y Lycos, siendo AltaVista, Excite e Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 126 InfoSeek los mejor valorados, mientras que HotBot respondía mejor a consultas estructu- radas, frente a Lycos que destacaba en búsquedas no estructuradas y breves. Finalmente, en el trabajo de 1999 se analizaron los primeros veinte recursos ob- tenidos en quince búsquedas lanzadas sobre AltaVista, Excite, HotBot, InfoSeek y Lycos. Valoran los recursos asignándoles diferente categoría según se ajusten a la búsqueda y cumplan las perspectivas esperadas por el usuario. En esta evaluación se centran en valo- rar la capacidad de los motores de búsqueda para colocar el mayor número de docum en- tos relevantes entre los veinte primeros resultados. De las quince consultas, diez son preguntas de referencia realizadas por estu- diantes, cuatro fueron extraídas de un estudio anterior (Leighton y Srivastava, 1997) y una se ocupa de localizar información sobre una determinada persona. Las preguntas son de tres tipos: siete están realizadas mediante una mera acumulación de palabras; otras siete son estructuradas y la última contiene el nombre de la persona sobre la que se busca información. Establecieron cuatro categorías de relevancia. Se centran en la valoración de este aspecto porque consideran que para los estudiantes universitarios es más impor- tante que la exhaustividad. Los mejores resultados se dieron en AltaVista, Excite e InfoSeek, destacando Lycos en búsquedas simples y no estructuradas y HotBot en las búsquedas estructuradas. Llegan a la conclusión de que evaluar la relevancia es uno de los mayores problemas a los que se enfrentan los estudios sobre motores de búsquedas, ya que en este estudio de- muestran la diferente puntuación que puede adquirir un motor según lo que se entienda por relevancia. Insisten en la necesidad de establecer una metodología correcta para la evaluación objetiva de los motores de búsqueda, de manera que no se les perjudique ni beneficie. Lycos y OpenText obtuvieron los mejores resultados en el trabajo realizado por Ding y Marchionini (1996) en el que se evaluaron tres buscadores, mediante cinco pre- guntas, valorándose relevancia y el solapamiento, en función de los veinte primeros re- sultados. Otros aspectos que se tuvieron en cuenta fueron la base de datos, la calidad del índice, la funcionalidad y la usabilidad. En los resultados no se detectaron grandes dife- rencias entre unos motores y otros. En el mismo año, un estu dio bastante limitado, de D. B. Meghabghab y G. V. Meghabghab (1996) analiza la efectividad, por medio de la precisión, de Yahoo, Info- Introducción 127 seek, Lycos, Excite y WebCrawler, obteniendo los tres primeros, por este orden, los me- jores resultados. Leonard (1996) analizó la exactitud de resultados, facilidad de uso y posibilida- des de la búsqueda avanzada mediante quince búsquedas en diecinueve motores de bús- queda, llegando a la conclusión de que AltaVista era el motor que mejores resultados ofrecía. Davis (1996) se centró en el tamaño del índice y otros aspectos relacionados con la recuperación de la información, observando los mejores resultados en AltaVista, Hot- Bot e InfoSeek. Ese año, también Slot (1996) evaluó dieciséis buscadores centrándose en el tiempo de respuesta y la interface, siendo AltaVista y Yahoo los que ofrecían mejores resultados. Un análisis específico de las posibilidades de búsqueda sitúa también a Alta- Vista como el m ejor valorado. Es importante el trabajo de Stobart y Kerridge (1996) sobre la fidelidad del usuario al sistema de búsqueda, señalando que los aspectos por los que mantienen su fi- delidad son, por este orden: la velocidad, el tam año y la costumbre. Chu y Rosenthal (1996) compararon la capacidad y el rendimiento de los moto- res AltaVista, Excite y Lycos. Para valorar el primer aspecto, utilizaron la lógica boolea- na, truncamientos, búsquedas por campo, palabra o frase. Para analizar el rendimiento se basaron en la cobertura, la precisión, el tiempo de respuesta, el esfuerzo del usuario y la presentación de los documentos. Utilizaron preguntas realizadas por usuarios a un servi- cio de referencia, observando que AltaVista superaba en estos aspectos a los otros dos motores. Venditto (1996) eva luó AltaVista, InfoSeek, Lycos, OpenText, WebCrawler y World W ide Web Worm mediante un important e número de tem as de búsqueda a lo largo de dos semanas. Se estudió la relevancia de los veinticinco primeros resultados. La efec- tividad la calculó teniendo en cuenta en la recuperación la existencia de los sitios web más interesantes y conocidos relacionados con cada tema. Los mejores resultados se al- canzaron en búsquedas simples, siendo mayores las diferencias en las búsquedas comp le- jas. InfoSeek dio los resultados mejores en cuanto a relevancia y AltaVista en cuanto a la exhaustividad. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 134 ta búsquedas. Eliminaron las páginas que no contienen los términos de la búsqueda y en Northern Light, los registros de la Colección Especial. Calcularon la cobertura, el solapamiento, la actualización de la base de datos y la indización de la W eb alcanzada por los m otores, advirtiendo que, respecto a un estudio anterior, en el que se calculaba en una tercera parte la indización de la web visible, ahora era sensiblemente m enor. El solapamiento se mantuvo a un bajo nivel. La cobertura estimada, fruto de combinar los resultados de varios buscadores fue del 42%, cifra que puede mejorarse mediante metabuscadores como MetaCrawler. Analizaron también la cobertura de los motores respecto al tamaño estimado de la web, obteniendo los mejores resultados, por este orden: Northern Light, Snap y AltaVista. La menor cobertura se observó en Lycos y Euroseek. Otros aspectos de los que se ocuparon fueron la indización y la actualización, analizando además de registros no válidos, el tiempo que tardan en indizar páginas nue- vas o actualizadas, estableciendo en ciento ochenta y seis la media de días que tarda un motor en indiza r estas pági nas. Los que más tardaron fueron Snap y Yahoo, y los que menos Northern Light, InfoSeek y AltaVista. Gwizdka y Chignell (1999) siguieron el planteamiento de Cleverdon (1966), que proponía como criterios de evaluación la cobertura, el tiempo de búsqueda, la exhaustivi- dad, la precisión, la presentación y el esfuerzo del usuario, aunque desestiman el tiempo de respuesta y la exhaustividad, el primero por estar sujeto a variaciones en función del estado de la red y la segunda por la constante variación de la inform ación en la Web, por su gran volumen y por su carácter dinámi co, aspectos, que dificultan su m edición. Además, proponen para la precisión valorar la utilidad de los enlaces que con- tienen los recursos recuperados, utilizando lo que denominan “usefull precision”. Otros valores para la precisión, son la precisión total, que valora la estimación objetiva otorga- da a los registros recuperados, la mejor precisión (best precision), que tiene en cuenta sólo los recursos más relevantes, y la precisión objetiva, calculada en función de la exis- tencia en los documentos de los térm inos de consulta. Calculan además el ranking, el esfuerzo de usuario y la cobertura, valorando, en este sentido, el número total de recur- sos, la cobertura relativa y el solapam iento. Compararon AltaVista, HotBot e Infoseek en relación con la recuperación en el ámbito com ercial y de organizaciones de seis dominios, de los cuales, cuatro son de dife- Introducción 135 rentes países (Alemania, Austria, Polonia y Reino Unido) y los otros dos responden a los dominios comercial (.com) e institucional (.org). Utilizaron cuatro temas de búsqueda, en diferentes idiomas en función del dominio. Los mejores resultados en cuanto a precisión y cobertura, los alcanzó AltaVista. Otros resultados de interés señalaron un mal funcio- namiento del algoritm o de ranking y un bajo solapam iento. En un trabajo pu blicado el mismo añ o M.H. Chignell, J. Gwizdka, y C. Bodner, (1999) trataron de demostrar mediante dos nuevas evaluaciones, los cambios en la recu- peración en función de que las búsquedas se lancen en distintos días y horas, teniendo en cuanta adem ás la cobertura geográfica y de diferentes dominios de Internet. En el primer caso utilizaron los motores Exci te, In foseek y HotBot y en el segundo AltaVista, Info- seek y HotBot. Esta segunda evaluación tuvo en cuenta la cobertura geográfica, y temáti- ca analizando los recursos recuperados de Alem ania, Austria, Polonia y Reino Unido, así como los recursos con dominio relativo a instituciones (.org) y los de carácter comercial (.com). Como en el trabajo anterior, valoraron distintos tipos de precisión. Como conclu- sión establecen la variación de los resultados en la recuperación dependiendo del contex- to. Maldonado Martínez, A. y Fernández Sánchez, E. (2000) evaluaron las posibili- dades de búsqueda que soportan los buscadores Yahoo, Excite, Lycos, InfoSeek, AltaVis- ta, Hotbot, Herdworld, AOL Netfind y Northern Ligth, valorando: si sop ortan diferentes tipos de búsqueda booleana; si permiten acotar la búsqueda; si contienen un directorio y si permiten la búsqueda por campos, la visualización de índices y el control de vocabula- rio. Los resultados indicaron que Northern Light es el que más posibilidades abarcaba, tanto en general como en cuanto a aspectos relacionados con la recuperación de informa- ción, entre los que se valora: la posibilidad de búsqueda dentro de un conjunto, la orde- nación temática de registros, la posibilidad de realizar búsquedas por campos, la visuali- zación de los índices de los campos existentes y contar con herramientas de control de vocabulario. Estas autoras publicaron en 1998 un estudio descriptivo de los principales buscadores desde el punto de vista documental, atendiendo tanto a la recogida y análisis de la información como a la búsqueda y resultados. Analizaron los buscadores AltaVista, Excite, Lycos, WebCrawler, HotBot, InfoSeek, lo s ín dices Magellan, Galaxy, LookS- Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 136 mart, Yahoo y los de orientación hispana, Ole 208 , ¿Dónde? 209 , Ozu.com 210 , Ozu.es 211 , Elcano 212 , Biwe 213 , Hispavista 214 , Trovator 215 , Tarantula 216 y Sol 217 , de los que, estos tres últimos son m otores. Westerra (2000) evaluó las interfaces de búsqueda de AltaVista, Google y Hot- Bot diferenciando entre capacidades básicas y especiales. AltaVista destacó en ambas, mientras que Google sólo lo hizo en las básicas y HotBot en las especiales. Uno de los estudios de mayor relieve es el publicado por Johnson, Griffiths y Harley (2001) en el que proponen un marco para la evaluación de motores de búsqueda desde el punto de vista de la satisfacción del usuario, señalando como puntos a analizar: la efectividad, la eficiencia, la utilidad de los resultados y la interacción con el sistema. Para ello se proponen medidas como la preci sión y el ranking, una serie de valores basa- dos en el tiempo de respuesta y, respecto a la recuperación, una serie de medidas que tratan de poner de relieve la utilidad del sistema, como son, la valoración de los enlaces y de la recuperación en general. Respecto a la interacción del usuario con el sistema, se valoró la satisfacción con la interface teniendo en cuenta las posibilidades de formulación de la consulta, modificación y visualización. Finalmente, respecto a los resultados, se analizaron aspectos, como la posibilidad de manipulación y la visualización. Los trabajos de evaluación más recientes tratan de especializarse en determina- dos aspectos. De este modo, Amat (2002:337) ha analizado la formación de la base de datos, la indización y la recuperación de diecisiete sistem as españoles de recuperación de información distribuida en Internet, valorando su similitud en la formación de los índices con el esquema Dublín Core, las opciones y mecanism os de recuperación de los sistemas analizados y su cobertura relativa, concluyendo que “no se pueden considerar válidas 208 http://www.ole.es 209 http://www.donde.uji .es 210 http://www.ozu.com 211 http://www.ozu.es 212 http://www.elcano.es 213 http://biwe.cesat.es 214 http://www.hispavista.com 215 http://trovator.co m bios.es 216 http://www.tarantula.com.m x 217 http://www.sol.es Introducción 137 “islas de información filtrada” ya que “ofrecen escaso acceso a poca información insufi- cientemente representada”. Griesbaum (2004) ha evaluado la efectividad de tres motores de búsqueda: Al- taVista, Google y Lycos, todos ellos en su versión alem ana 218 . Como vi ene siend o habi- tual, analizan los veinte primeros resultados de un total de cincuenta consultas. En lo me- todológico, para valorar estas herramientas, parten de una colección tanto de registros como de consultas, contem plando además los criterios y m edidas para valorar la relevan- cia. La valoración de este aspecto se lleva a cabo por un jurado compuesto por veintinue- ve personas. Los temas de consulta se extraen del log de dos buscadores, distintos del evaluado, y en su caso, se traducen al alemán. Google obtuvo los mejores resultados, seguido muy de cerca por Lycos. Un trabajo de Vaughan y Telwall (2004) ha estudiado la cobertura en la recupe- ración de recursos de carácter comercial de distintos países (Estados Unidos, China, Sin- gapur y Taiwan) de Google, AltaVista y AllTheWeb, constatando una mayor recupera- ción de recursos de Estados Unidos debido al modo de trabajo de los programas que for- man las bases de datos. Otro aspecto que en la actualidad ha cobrado una gran importancia es el análisis del ranking destacando los trabajos de Courtois y Berry (1999) y de Vaughan y Thelval (2004). De la importancia que tienen los estudios de ranking, del que más adelante nos ocuparemos, es fiel reflejo el realizado por Vaughan (2004) en el que se estudia el com- portamiento de Google, AltaVista y Teoma. Es interesante desde el punto de vista meto- dológico ya que critica el uso de los valores de precisión y exhaustividad y proponen en su lugar medidas como la correlación entre el ranking valorado por personas y el ranking del motor de búsqueda a lo que denomina “ca lidad del ranking de resultados” (Quality of result ranking). Frente a la exhaustividad propone valorar la recuperación de páginas si- tuadas en los primeros lugares del ranking. El buscador que obtuvo los mejores resulta- dos fue Google. 218 http://www.AltaVista.de, http://www.Google.de y http://www.Ly cos.de Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 138 Del contenido de todos estos trabajos se desprende la existencia de una disper- sión de criterios en la evaluación, que puede ser fruto de la necesidad por parte de los investigadores de buscar nuevos indicadores, como es el caso de Stobart y Kerridge (1996) quienes proponían, además de los valores tradicionales, valorar la fidelidad del usuario, o Leonard (1996) y Zorn y otros (1996), que se ocuparon de las posibilidades de las búsquedas avanzadas. Davis (1996) se interesó por el tamaño del índice, Slot (1996) por el tiempo de respuest a y la interface, mientras que Thunender, H. y Erwing, J. (1998) lo hicieron sobre el tiempo que tardan en indizar una página y el nivel jerárquico del sitio Web al que descienden los robots. Sobre la tendencia a utilizar aspectos aisl ados en la evaluación de los motores de búsqueda, hay que señalar que se mantiene hasta nuestros días. Basta con citar los traba- jos de Stimson (1999) dedicados a comparar la recuperación de nombres de empresas en motores de búsqueda comerciales y no comerciales, obteniendo en ambos buenos resul- tados, por lo que recomienda no descartar ni unos ni otros en este tipo de búsquedas. Los primeros pueden ofrecer información recopilada de diferentes fuentes, mientras que los motores no comerciales recuperan recursos con información de la web de la empresa y otras páginas de información general. Hay que decir también que los buscadores comer- ciales facilitan búsquedas de información más específica gracias a sus avanzadas opcio- nes. Por otro lado hay que señalar una intensa corriente de evaluaciones basadas en el cálculo de la relevancia de los mo tores de búsqueda que se plasma en los trabajos de Ding, W. y Marchio nini, G. (1996), Leighton, H. V. (1996), Leighton, H. V. y Srivastava, J. (1997 y 1999), Venditto, G. (1996) y Tomaiuolo, N. G. y Packer, J. G. (1996). No sólo por el tratamiento teórico previo, sino también por su metodología des- taca el trabajo de Chu, H. y Rosenthal, M. (1996) que proponen una selección de criterios (cobertura, exhaustividad, precisión, tiempo de respuesta y esfuerzo de usuario) donde se compaginan los dos puntos de vista desde los que se han venido haciendo los trabajos de evaluación de Sistemas de Recuperación de la Información. Este trabajo ha influido cla- ramente en la realización de otros experimentos de gran interés como los desarrollados por M. Gordon y P. Pathak (1999), S. Lawrence y L. Giles (1998-1999). Respecto a las evaluaciones en las que se aplica una metodología que hace espe- cial incidencia en expresar tam bién el punto de vista del usuario, destacamos los trabajos Introducción 139 de Su, L. T. (1997 y 2003) así como los de Johns on, F. C., Griffiths, J. R. y Hartley, R. J. (2001). Existe otra tendencia, llevada a cabo por autores como G. Notess 219 , D. Sulli- van 220 o I. Aguillo 221 , que en distintos sitios Web, recogen y publican datos, que actuali- zan continuamente, sobre determinados aspectos del funcionamiento de los buscadores más importantes. Estos sitios constituyen un lugar de referencia obligado para conocer determinados aspectos y características tanto de las herramientas de búsqueda como de la recuperación de inform ación en la Web, aunque en el caso de Aguillo, sus técnicas están más relacionadas con la Ciberm etría. Respecto a la metodología, los distintos trabajos demuestran que no existe un método estándar sino que, la mayoría de trabajos utiliza un procedimiento y criterios dis- tintos así como medidas variables. Aún en el caso de experiencias de tanta importancia como las desarrolladas en las conferencias TREC, la metodología empleada está conti- nuamente sujeta a variaciones y a continuas críticas. Por ello, para elaborar una evalua- ción consistente, pensamos que es conveniente detenernos en valorar la metodología uti- lizada en los trabajos más relevantes. En este sentido hemos de referirnos a uno los trabajos de Oppenheim , C., Mo- rris, A. y Macknight, C. (2000), en el que se sistematizan los estudios más destacados dentro de cuatro grupos: 1. Los que utilizan el método de Cranfiel d, cuando se conoce la existencia de un pequeño número de páginas referentes al tema de búsqueda, que además son conocidas por el investigador. Se contem plan en este grupo los trabajos de Both Delezar-Tiedman y el Proyecto Erdos llevado a cabo por Bar-Ilan en 1998. 2. Los que usan el método anterior más el cálculo de la exhaustividad relativa. Este parámetro se calcula sumando los recursos relevantes recuperados en una serie de búsquedas, considerando que representa el universo de recursos relevantes en compara- ción con los registros recuperados por un motor sobre el que se ha lanzado la búsqueda. Este valor ha recibido críticas por parte de Fricke (1998) y otros autores. 219 http://searchenginessh owdown.com 220 http://www.searchenginewatch.com Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 140 Estudios de este tipo son los de Chu y Rosenthal (1996), Ding y Marchinioni (1996), Gauch y Wang (1996), Tomaiuolo y Packer (1996), Westerra (1996), Leighton y Srivastava (1997), Clarke y Willett (1997), Gonçalves y otros (1998), Megahaghab y otros (1998), caracterizándose por utilizar términos más am plios de búsqueda. 3. Los que utilizan el método Cranfield más el cálculo de la exhaustividad esti- mada, basada en una estimación estadística del número de probables recursos existentes en la web. En este grupo tenemos los trabajos de Bharat y Broder desarrollados en los años 1998 y 1999 y los de Lawrence y Giles (1999). 4. Los que eliminan el cálculo de la exhaustividad. Sitúa en este apartado los trabajos de Feldman (1998) que analiza y estudia las características de AltaVista, Excite, Lycos, HotBot, InfoSeek, Northern Light , SavvySearch, Inference Find y AskJeewes. Kimm el (1996), incide en la cobertura y en las características de los registros. Cita tam- bién los trabajos de Tunender y Ervin sobre indización y recuperación, en los que se aprecia una insuficiencia e inconsistencia en la indización de motores como Lycos, Info- Seek, AltaVista, Yahoo y Excite. Se hallan también en este grupo los trabajos que tratan de establecer alternativas a la precisión en la evaluación de los motores, basándose en el cálculo de la amplitud de búsqueda estimada (ESL o Estimated Search Lenght) así como los de Agata y otros (1997). A pesar de todo, Oppenheim, Morris y Mc knight (2000) se refieren a la poca consistencia de los trabajos de evaluación de los motores de búsqueda en la Web, así co- mo a la imposibilidad de aplicar el método de Cranfield, dada la dificultad de calcular la exhaustividad, lo que impide una correcta comparación de resultados obtenidos por unos investigadores y otros. Estos autores señalan además, como hecho a tener en cuenta en la evaluación, que los motores de búsqueda, del mismo modo que la Web, están cambiando continua- mente, por lo que los resultados de las evaluaciones son válidas por un periodo de tiempo limitado, y que, como gran parte de los investigadores reconocen, los resultados que sus 221 http://www.cindoc.csic.es/cy bermetrics Introducción 141 trabajos ofrecen, son indicativos de las prestaciones de los motores de búsqueda en el mom ento en que se realizan. Esto indica que este tipo de evaluaciones son efímeras, por lo que han de repetirse cada cierto tiempo y actualizarse de forma constante para com- probar si los resultados han variado, valorar el dinam ismo de la Web o si han sido corre- gidos los posibles problem as detectados. De aquí la importancia que tiene el diseño de un método que facilite una valoración objetiva, basada en criterios científicos, y que de un modo fácil, perm ita su repetición periódica. Johnson y otros (2001) recogen en su trabajo alguno de los problemas que plan- tean las evaluaciones de motores web realizadas siguiendo el mét odo de Cranfield, refi- riéndose además a las dificultades en la utilización de valores como la exhaustividad y la precisión, la falta de estandarización en las medidas que afectan a estos valores en unos experimentos y otros, lo que dificulta la comparación entre diversos estudios e incluso las diferencias de concepto de relevancia que se aplican. Finalmente, se refieren a la necesi- dad de estudiar los motores para que las búsquedas no favorezcan a unos y otros, hacién- dolas de un modo estándar. Llegan a la conclusión de que hay que valorar cuáles son los criterios que pueden interesar al usuario en relación con los motores de búsqueda, anali- zando el impacto que tienen en sus valoraciones aspectos como la velocidad de proceso, la calidad de los resultados, etcétera. Podemos ver hasta aquí las tendencias de evaluación que se han desarrollado hasta la fecha. En ellas se observa la clara influencia de estudios de evaluación de Siste- mas de Recuperación de la Información anteriores y la importancia de la opinión del usuario en la valoración tanto de los resultados como de la interface y opciones de bús- queda. Pero a pesar de todo, no debemos olvida r que se trata de ámbitos de recuperación diferentes por lo que los indicadores de unos y otros se han ido distanciando. Debemos estudiar y proponer un método que nos permita comparar diversas herramientas para valorar su utilidad, seleccionar las mejores y, si es posible, que permita comparar los resultados con los de otros estudios, al menos para conocer su evolución. Para ello deberemos seleccionar los criterios necesarios que nos permitan alcanzar los objetivos propuestos. En función de ellos seleccionaremos y propondremos los indicado- res de evaluación que nos resulten necesarios. Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web 142 3.4.2. Propuestas de evaluación e indicadores de los motores de búsqueda de la Web Es un hecho que hay una serie de criterios comúnm ente aceptados por la comu- nidad científica que nos permiten contrastar las capacidades de los SRI, pero es evidente que los buscadores de la Web, por sus características y las de su entorno, requieren una adaptación de aquellos, además de la utilización de otros más relacionados con el propio funcionamiento de estas herram ientas. La mayoría de autores han intentado aplicar técnicas y m étodos de evaluación de estos sistemas de recuperación a las herramientas web, pero no debemos olvidar que en el primer caso se trata de sistemas que contie nen bases de datos con información estructu- rada, acomodándose perfectamente a los docum entos que indizan, mientras que en la Web, son herramientas que surgen para facilitar la localización de información en un medio donde ésta aparece de forma poco estructurada y, a menudo, con un escaso valor informativo. Por tanto, es ésta una de las difere ncias por l as que es necesari o plantearse si dichas técnicas, métodos e incluso los criterios de valoración que acabamos de ver, son aplicables a la evaluación de las herramientas web. Por otro lado, los avances técnicos han podido influir en que algunos criterios com o el “tiempo de conexión” hayan quedado desfasados o, en otros casos, como en el de la exhaustividad, muy utilizada en sistemas más estructurados y especializados como pueden ser las bases de datos en soporte CD- ROM, no se adaptan a estos sistem as. Nos ocupamos a continuación de las propuestas elaboradas por diferentes auto- res que se han ocupado de ofrecer, de una forma sistemática, una serie de criterios a tener en cuenta en la evaluación de los m otores web. Una de las primeras propuestas en este sentido es la realizada por David Jakob (1995) que propone los siguientes aspectos a valorar: 1. Facilidad de uso. 2. Rapidez en las búsquedas. 3. Posibilidad de realizar búsquedas básicas y complejas con operadores boolea- nos. 4. Búsquedas mediante partes de una palabra y truncamientos. 5. Utilización de búsquedas por frase y por térm inos próximos. 6. Permitir al usuario dar m ayor importancia a un término de búsqueda. Introducción 143 7. Control por el usuario de búsquedas con términos en mayúsculas y minúscu- las. 8. Utilización de tesauros. 9. Permitir al usuario indicar el máxim o número de registros a recuperar. 10. Indización a texto completo, mejor que sobre determinadas partes del recur- so (aunque el usuario pueda controlar sobre qué cam pos limitar la búsqueda). 11. Proporcionar información que incluya el título y el URL del recurso. 12. Ofrecer una fácil interpretación de los resultados con marcadores de la rele- vancia o un listado ordenado según su im portancia. 13. Indicar cuándo fue indexado el recurso. 14. Actualizar la base de datos periódicamente para eliminar recursos no activos y caducados. 15. Permitir al usuario registrar direcciones URL no incluidas en la base de da- tos. En este caso, más que de criterios, este autor presenta una serie de características que estas herramientas deberían cumplir. En la actualidad, dada su evolución, la mayoría de aspectos han sido superados. Podemos apreciar la gran importancia que se da a todo lo relacionado con la búsqueda y recuperación, analizando también algunos aspectos del funcionamiento como la indización y la actualización de la base de datos, aunque olvida elementos como la formación de ésta y la ordenación. Koch (1996) desde un punto de vista muy general señala siete grandes aspectos que una evaluación de servicios de búsqueda debe analizar, a saber: el tamaño, la cober- tura, la actualización, la formación, la indización, la recuperación, y el interfaz de usua- rio. Chu y Rosenthal (1996) proponen para las herramientas de la Web los siguientes criterios de evaluación: 1. Composición de los índices, ya que en su elaboración radica el éxito de una búsqueda en un determinado motor. Exige un c onocimiento de: la cobertura, la frecuen- cia de actualización y la parte de la página web sobre la que se realiza la indización. Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 246 Gráfico 3.3-12. Metabus cadores. Búsqueda 4. Tip ología documental 0 5 10 15 20 25 E x c it e I xq u ic k P r o f u si o n S e a r ch Viv is im o P ágin a ht m l com ú n B as e d at os acc e s o a r e g is t r o s b iblio g r . B ib liot e ca D ig it al R e p o s it o r io D ir e ct o r io B u s cado r R e vis t a e le ct r ó nica B ib liog r af ía L is t a d e r e cu r s o s w e b Ar t ícu lo/In f . e s p e cializ ada Ar t ícu lo d e r e v. E le ct r ó n ica Co n g r e s o /T r abajo con g r e s o Cap ítu lo d e m o n . Ar t . d e E n cic lop e d ia E n t r e vis t a D icc ion ar io N o t ici as B lo g co m ú n e s p e cializ ado L is t a d e co r r e o P r o ye cto Cu r s o o in f . d e cu r s o F AQ N o r m as Resultados y análisis 247 3.3.1.4.1.5. Búsqueda de frase Tabla 3.3.1-15. Motores . Búsqueda 5. Tipología documental Google MSN Teoma (Ask) WiseNut Yahoo Página html común 2 (4,1%) 4 (8%) 4 (8,2%) 3 (6%) Página html en blanco 1 (2%) Página html en lengua s orientales 1 (2%) Imagen Base de datos a texto completo libre Base datos acceso restringido Base datos acceso a registros bibliogr. Biblioteca Digital Repositorio Directorio 2 (4,1%) 1 (2%) 2 (4%) Buscador 1 (2%) Agente de búsqueda Normas Lista de correo Revista electrónica E-libro 1 (2%) Presentación Bibliografía 4 (8,2%) 4 (8%) 2 (4,1%) 3 (6%) Lista de recursos web 3 (6 ,1%) 4 (8%) 6 (12,2%) 7 (14%) Artículo/Inf. especializada 1 (2%) 5 (10%) 5 (10,2%) 7 (14%) Artículo de rev. Electrónica 1 (2%) Congreso/Trabajo congreso 1 (2%) 4 (8%) 4 (8,2%) Monografía Capítulo de mon. 1 (2%) 2 (4%) 1 (2%) Art. de Enciclopedia 1 (2%) 1 (2%) 1 (2%) 1 (2%) Entrevista Diccionario 1 (2%) 1 (2%) 1 (2%) Noticias 2 (4,1%) 1 (2%) 1 (2%) 2 (4%) Blog o pág. personal 2 (4%) Blog común especializado Página registro Lista de correo Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 248 Google MSN Teoma (Ask) WiseNut Yahoo Discurso Proyecto 23 (46%) 14 (28%) 18 (36,7%) 15 (30%) Curso o inf. de curso 5 (10,2%) 4 (8%) 3 (6,1%) 6 (12%) Resumen Repositorio FAQ 1 (2%) 2 (4%) 3 (6%) Normas 1 (2%) 1 (2%) Examen Registro Banco de datos Repositorio Total En esta búsqueda, el tipo documental más frecuente son los proyectos de investiga- ción. Google recupera un total de veintitrés recursos de este tipo, WiseNut dieciocho, Yahoo quince y MSN catorce. En relación con los artículos, llama la atención el descenso de este tipo do cumental respecto al resto de búsquedas; Yahoo, con siete, es el buscador que más recursos de este tipo recupera, seguido por MSN y W iseNut, ambos con cinco. Los siguientes tipos en importancia son, de nuevo, las listas de recursos web y la in - formación so bre cursos, ambos con Yahoo a la cabeza. Google recupera un libro electró- nico y MSN y WiseNut recuperan un mayor número de recursos relacionados con congre- sos. MSN facilita el acceso a capítulos de monografías. MSN es el único buscador que facilita páginas en blanco en esta búsqueda. Resultados y análisis 249 Gráfico 3.3-13 Motores. Búsqueda 5. Tipol ogía documental 0 5 10 15 20 25 Goog le MSN W iseNu t Ya h oo P ági na html c omú n P ági na html e n bla nco P ági na html e n le ngu as orienta le s D irec torio B usc ador E-libro B ibli ografía Lista de recurs os w eb A rtícul o/Inf. es pec ial izada A rtícul o de rev. Elec trónic a Congres o/Tr aba jo congres o Capítu lo de mon. A rt. de Enci clope dia D icc ionario N otic ias B log o pá g. pe rsona l P royecto Curso o inf. de cu rso FA Q N orma s Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 250 Tabla 3.3.1-16. Metabuscad ores. Búsqueda 5. Tipología docu mental Dogpile Excite Ixquick Profusion Search Surfwax Vivisimo Página html común 10 (20,4%) 7 (16,7%) 2 (5,1%) 2 (4,1%) 3 (6,1%) Página html en blanco 1 (2%) 1 (2%) Página html en lengua s orientales Imagen Base de datos a texto completo libre 1 (2,4%) Base datos acceso restringido Base datos acceso a registros bibliogr. Biblioteca Digital Repositorio Directorio 3 (6,1%) 3 (7,1%) 1 (2,6%) 1 (2%) Buscador 3 (6,1%) Agente de búsqueda Normas Lista de correo Revista electrónica E-libro 1 (2%) Presentación Bibliografía 4 (8,2%) 3 (7,1%) 2 (5,1%) 3 (6,1%) 3 (6,1%) Lista de recursos web 4 (8,2%) 3 (7,1%) 2 (5,1%) 4 (8,2%) 4 (8,2%) Artículo/Inf. especializada 5 (10,2%) 7 (16,7%) 2 (5,1%) 1 (2%) 18 (36,7%) Artículo de rev. Electrónica 1 (2,4%) 1 (2,6%) Congreso/Trabajo congreso 1 (2,4%) 1 (2,6%) 6 (12,2%) 1 (2%) Monografía Capítulo de mon. 1 (2,6%) 1 (2%) Art. de Enciclopedia 1 (2%) 1 (2,4%) 2 (5,1%) 1 (2%) 1 (2%) Entrevista Diccionario 1 (2%) 1 (2,4%) 1 (2,6%) Noticias 2 (4,1%) 2 (4,8%) 3 (7,7%) 2 (4,1%) Blog o pág. personal 1 (2,6%) 5 (10,2%) Blog común especializado 4 (10,3%) Página registro Lista de correo Discurso Proyecto 11 (26,2%) 14 (35,9%) 22 (44,9%) 5 (10,2%) Resultados y análisis 251 Dogpile Excite Ixquick Profusion Search Surfwax Vivisimo Curso o inf. de curso 1 (2%) 4 (8,2%) Resumen Repositorio FAQ 3 (6,1%) 1 (2,4%) 2 (5,1%) 3 (6,1%) 1 (2%) Normas Examen 1 (2%) Registro Banco de datos Repositorio Los metabuscadores reflejan una situación si milar a la de los buscadores, y en rela- ción con el acceso páginas con información sobre proyectos de investigación, Search re - cupera veintidós, Profusion cat orce e Ixquick once. Excite no recupera recursos de este tipo. El número de páginas HTML es superior a los facilitados por lo s motores de bús- queda. El metabuscador Vivisimo desta ca en la recu peración de artículos especializados, al recuperar dieciocho, seguido a gran distanci a por Ixquick con siete. También hay que destacar que es el único metabuscador que facilita el acceso a un libro electrónico. Los proyectos, ocup an en esta búsqueda un lugar destacado, como pode mos apre- ciar en Search que recupera veintidós, seguido por Profusion e Ixquick. Otro indicador de interés es la información relativa a Congresos, destacando el me- tabuscador Search con s eis. Excite facilita más páginas en HTML y listados proporcionados por otros buscado- res. Search y Vivisimo facilitan en esta búsqueda el acceso a una página en blanco. Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 252 Gráfico 3.3-14 . Metabuscadores. Búsqued a 5. Tipología documental 0 5 10 15 20 25 Exci te Ixquick P rofusion Se arch Vivisimo P ági na ht ml com ún P ági na ht ml en b lanc o B ase de da tos a tex to compl eto libre D irecto rio B usc ador E-libro B iblio grafía Lista de rec ursos we b A rtículo/ Inf. esp eci alizada A rtículo de rev. Elec trónica Congreso /Tr aba jo congres o Capítulo de mon. A rt. de E nci clope dia D icc iona rio N otici as B log o pá g. pe rsonal B log c om ún es pec ial izado P royecto Curso o in f. de cu rso FA Q Exam en Resultados y análisis 253 3.3.1.4.1.6. Búsqueda por campo Tabla 3.3.1-17. Motores . Búsqueda 6. Tipología documental Google MSN Teoma (Ask) WiseNut Yahoo Página html común 3 (6,3%) 5 (10,2%) 1 (3,7%) 5 (10%) Página html en blanco Página html en lengua s orientales Imagen Base de datos a texto completo libre Base datos acceso restringido 1 (2,1%) Base datos acceso a registros bibliogr. Biblioteca Digital 1 (2%) Repositorio Directorio 2 (4,2%) 2 (4,1%) 2 (4%) Buscador 1 (2%) 1 (3,7%) Agente de búsqueda Normas 1 (2%) Lista de correo Revista electrónica 1 (2,1%) 2 (4%) E-libro 2 (4,2%) 2 (4,1%) 2 (4%) Presentación Bibliografía 4 (8,3%) 2 (4,1%) 4 (14,8%) 4 (8%) Lista de recursos web 8 (16 ,7%) 8 (16,3%) 2 (7,4%) 14 (28%) Artículo/Inf. especializada 7 (14,6%) 14 (28,6%) 11 (40,7%) 3 (6%) Artículo de rev. Electrónica 1 (2%) Congreso/Trabajo congreso 6 (12,5%) 2 (4,1%) 1 (3,7%) Monografía Capítulo de mon. 3 (6,3%) 2 (4,1%) 1 (3,7%) 2 (4%) Art. de Enciclopedia 2 (4,2%) 1 (2%) 2 (4%) Entrevista Diccionario 1 (2%) Noticias 1 (2,1%) 1 (2%) 4 (14,8%) 1 (2%) Blog o pág. personal 2 (7,4%) Blog común especializado 1 (2%) Página registro Lista de correo 1 (2%) Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 254 Google MSN Teoma (Ask) WiseNut Yahoo Discurso Proyecto 4 (8,3%) 3 (6,1%) 5 (10%) Curso o inf. de curso 4 (8,3%) 2 (4,1%) 5 (10%) Resumen Repositorio 1 (2%) FAQ Normas Examen Registro Banco de datos Repositorio Total En esta búsqueda, la recuperación de los motores se centra en facilitar artículos y ofrecer listados con recursos web. En este sentido, los buscadores Yahoo, Google y MSN ofrecen, por este orden, el mayor número de este tipo de listados. El mayor número de artículos de información especializada lo recupera MSN con catorce, seguido de WiseNut con once y Google con siete. MSN se diferencia poco de los demás buscadores aunque es el único que facilita el acceso a bibliotecas digitales, normas, blogs especializados y listas de correo. Yahoo es e l único que rec upera artículos d e revistas electrónicas, facilita entradas de diccionario y el acceso a repositorios. Su recuperación se centra más en ofrecer lista- dos con recursos, páginas en HTML, inform ación sobre proyectos y cursos, y acceso a recursos bibliográficos. Google, al margen de lo antes señalado , s e caracteriza en esta búsqueda por la recu- peración de páginas con i nformación sobre Congresos y bases de datos de acceso restrin- gido, y junto a Yahoo, por recuperar revistas electrónicas. La recuperación de WiseNut se caracteriza ad emás de por el alto número de artícu- los, por ofrecer pocas páginas en HTML y un mayor acceso a noticias y blogs personales. Resultados y análisis 255 Gráfico 3.3-15. Motores. Búsqueda 6. Tipología documental 0 2 4 6 8 10 12 14 Googl e MSN W iseNut Yahoo P ágina ht ml c om ún B ase da tos a cc es o res tringido B iblioteca D igital D irectorio B uscador N or ma s Revista e lec trónic a E-libro B ibliografía Lis ta de recu rsos w eb A r tícu lo/Inf. es pec ial izada A r tícu lo de rev. Elec trónica Congres o/Tr ab ajo cong reso Capítu lo de mon . A r t. de Enci clop edia D icciona rio N oticias B log o pág. pers onal B log común es pec ial izado Lis ta de correo P roy ecto Curso o inf. d e c ur so Repos itorio Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 262 Google es el buscador que recupera un mayor número de artículos de información especializada, seguido por las listas de recu rsos web, por las pági nas HTML, por proyec- tos, cursos o información de cursos, documentación sobre congresos, noticias y finalmen- te acceso a diccionarios. Supera a Yahoo en recuperación de presentaciones y proyectos. De forma similar a Google, MSN recupera , aunque en menor número, artículos y páginas HTML comunes, pero recupera un mayor número de recursos relacionados con revistas electrónicas, congresos y sobre todo facilita mayor acceso a blogs particulares. Sin embargo es inferior en la recuperación sobre cursos. Yahoo sigue a Google en la obt ención de ar tículos, listados de recursos web y pro- yectos de investigación, pero le supera en la recuperación de libros electrónicos e infor- mación de cursos. Teoma destaca por ser el buscador que más accesos ofrece a bibliotecas digitales, pero también es el buscador que recupera mayor número de páginas en blanco, lo que supone un funcionamiento defectuoso. WiseNut de staca en la recuperación de noticias, mostrándose aceptable en el resto de tipología docum ental. Por tanto, teniendo en cuenta la tipología que puede ser más interesante en recupe- ración de recursos especializados, esto es artículos, bibliotecas digitales, revistas y libros electrónicos, información sobre congresos, artículos de enciclopedias y entradas de dic- cionario, blogs especializados y proyectos de investigación, el mejor comportamiento corresponde a Google, seguido de Yahoo y de MSN. Tabla 0-2 Metabuscad ores. Tipología documental de las seis búsquedas Dogpile Excite I xquick Pr ofusion Search Surfwax Vivisimo Total Página html común 29 35 32 10 30 17 34 187 Página html en blanco 2 1 2 1 2 1 3 12 Página html en lengua s orientales 0 0 0 0 0 0 0 0 Imagen 1 1 0 0 0 1 0 3 Base de datos a texto completo libre 1 1 1 0 1 0 0 4 Base datos acceso restringido 0 0 2 0 1 1 0 4 Resultados y análisis 263 Dogpile Excite I xquick Pr ofusion Search Surfwax Vivisimo Total Base datos acceso a registros bibliogr. 0 1 0 2 1 0 1 5 Biblioteca Digital 3 8 7 8 4 1 11 42 Repositorio 0 0 0 1 0 0 0 1 Directorio 1 16 11 5 4 8 0 45 Buscador 5 10 5 5 2 2 4 33 Agente de búsqueda 1 0 0 0 0 0 1 2 Normas 0 0 0 0 0 0 0 0 Revista electrónica 0 2 2 2 4 1 0 11 E-libro 0 1 3 1 1 0 1 7 Presentación 0 1 1 3 3 0 0 8 Bibliografía 7 18 13 14 24 3 11 90 Lista de recursos web 18 28 21 17 42 4 47 177 Artículo/Inf. especializada 26 74 41 34 56 7 72 310 Artículo de rev. Electrónica 0 0 1 2 1 1 0 5 Congreso/Trabajo congreso 3 4 5 7 13 2 20 54 Monografía 0 0 0 0 0 0 0 0 Capítulo de mon. 5 7 7 5 9 1 11 45 Art. de Enciclopedia 3 6 7 7 12 2 4 41 Entrevista 1 2 1 2 1 0 1 8 Diccionario 4 3 1 3 2 0 5 18 Noticias 3 10 8 5 10 13 0 49 Blog o pág. personal 7 5 3 9 12 1 13 50 Blog común especializado 2 6 3 6 3 3 3 26 Página registro 0 0 0 0 0 0 0 0 Lista de correo 0 2 0 3 0 0 0 5 Discurso 0 1 0 0 0 0 0 1 Proyecto 2 4 13 17 29 0 9 74 Curso o inf. de curso 1 9 3 8 12 1 13 47 Resumen 0 0 0 0 0 0 1 1 Repositorio 0 0 0 0 0 0 0 0 FAQ 0 3 2 2 4 1 3 15 Normas 0 0 0 0 0 0 1 1 Examen 1 1 1 0 2 0 0 5 Registro 0 0 0 0 0 0 0 0 Banco de datos 0 0 0 0 0 0 0 0 Repositorio 0 0 0 0 0 0 0 0 Total 126 260 196 179 285 71 269 1386 Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 264 También entre los metabuscadores la tip ol ogía documental más común en este tipo de búsquedas corresponde a artículos con información especializada, a páginas comunes en HTML y a listas de recursos Web. Excite destaca por ofrecer un mayor número de accesos a artículos especializados , así como a directorios y buscadores. Esto unido a la importancia de los recursos biblio- gráficos, hace que sea un metabuscador a tener en cuenta para recuperar obras de referen- cia. Vivisimo es el segundo metabuscador que más artículos recupera, destacando ade- más por ser el que mayor número de accesos a bibliotecas digitales proporciona. Otros tipos documentales en los que so bresale son las listas de recursos, la inform ación de con- gresos, acceso a capítulos de monografías, blogs y la información sobre cursos. Search es el tercer metabuscador en recuperación de artículos. En el resto de tipolo- gía documental se puede comparar a Excite, pero le supera en accesos a revistas el ectró- nicas, presentaciones del tipo PowerPoint, bibliografías, información de congresos, capí- tulos de monografí as, artículos de enciclopedia, listas de recursos web, pero sobre todo en la recuperación de proyectos. Ixquick supera al resto, en libros electrónicos. Profusion se asemeja a los mejores metabuscadores en cuanto a la recuperaci ón de proyectos de investigación y acceso a bibliotecas d igitales. En resumen, E xcite es el m etabuscador que m ejor comb ina la recuperación de re- cursos de interé s directo, como puede ser el acceso a artículos de información especiali- zada con el acceso a otros recursos de referencia. Search es el metabuscador que ofrece mayor cantidad de recursos de todo tipo, sin centrarse tanto en la recuperación de artícu- los especializados. Surfwax es el metabuscador que peores cifras alcanza en la recupera- ción de tipología documental propia de la información especializada, mientras que Vivi- simo es un metabuscador que, ofreciendo un importante acceso a artículos especializados y a bibliotecas digitales, facilita la recuperación de otros tipos documentales de tipo más informativo, com o puede ser la información de cursos, listas de recursos e información sobre Congresos. Resultados y análisis 265 Gráfico 3.3-18. Metabus cadores. Tipología docum ental de las seis búsqued as 0 10 20 30 40 50 60 70 80 D o g p i l e E x c i t e I x q u i c k P r o f u s i o n S ea rc h S u r f w a x V i vi s i m o P á g in a h tml c omún P á gi na h tm l e n b la nc o P á g i n a h tm l en leng ua s o r i e n ta les I m a gen B a s e d e d a to s a tex to c ompl e to l ib r e B a se da tos a c c e s o r es tr in gi d o B a s e d a tos a c c e s o a re gi s tr os b i b li og r . B i bl io te c a D ig ita l R e po s i to rio D i r e c to r i o B u sc a do r A g e n te d e b ú s qu e da N o r m a s R e v ista e l e c tr ón i c a E -l ib r o P r e s enta c ió n B ib li og r a fí a L i s ta d e r e c u r s o s w eb A rtíc u lo / I nf. es pec i a l iza da A r tíc ul o d e re v . E l e c tr ó n i c a C o ng r e s o/ T r a b a j o c on gre s o Mo no gra fía C a p ítu lo d e m o n. A r t. de E nc ic lo pedi a E n tr ev ista D i c c io na r io N oti c i a s B l o g o pá g. p e r son a l B l o g c omún e s p e c i a l iza do P á gi n a r e gi s tr o L ista d e c o r r e o D isc u r s o P r o y ec to C u r s o o i n f. de c urs o R e s u me n R epo s ito r i o F A Q N o r m a s E x a m e n R e g i s tr o B a nc o d e da to s Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 266 4. Cobertura y solapamiento de los buscadores 4.1. Análisis de páginas únicas y solapamiento Para valorar la cobertura entre buscadores se examina el total de páginas recupera- das por cada bus cador en cada una de las búsquedas (generalmente cincuenta resultados, a excepción de los motores que en determ inadas búsquedas no llegan a recuperar cin- cuenta resultados, o simplemente no funcionan ante una determinada búsqueda). En fun- ción de los listados de las URL y del m otor que los recupera y se extraen los datos relati- vos a los recursos que recuperan bien sea un s ólo motor, dos, tres y así hasta el total de buscadores evaluados. Tabla 4.1-1. Motores de búsq ueda y metabuscadores (Base = total excluidos duplicados y errore s) Búsqueda 1 (Término único) Búsqueda 2 (Lenguaje natural) Búsqueda 3 (Operadores de existen- cia) Búsqueda 4 (Búsqueda boo- leana) Búsqueda 5 (Búsqueda de frase) Búsqueda 6 (Bús- queda por campo) Total en las seis búsquedas Páginas recupera- das Frec. % Frec. % Frec. % Frec. % Frec. % Fre c. % Frec. % 1 buscador 113 55,1 161 66,3 212 74,1 160 72,4 137 65,9 167 71,1 950 47,5 2 buscadores 26 12,6 26 10,7 28 9,8 33 14,9 26 12,5 45 19,1 184 9,2 3 buscadores 19 9,2 14 5,8 16 5,6 20 9,0 15 7,2 8 3,4 92 4,6 4 buscadores 12 5,8 12 4,9 7 2,4 6 2,7 8 3,8 3 1,3 48 2,4 5 buscadores 15 7,3 16 6,6 12 4,2 0 0 6 2,9 4 1,7 53 2,6 6 buscadores 11 5,3 6 2,5 6 2,1 1 0,5 4 1,9 3 1,3 31 1,5 7 buscadores 2 0,9 3 1,2 4 1,4 1 0,5 5 2,4 5 2,1 20 1 8 buscadores 6 2,9 3 1,2 1 0,3 0 0 6 2,9 0 0 16 0,7 9 buscadores 0 0 0 0 0 0 0 0 1 0,5 0 0 1 0,05 10 buscadores 0 0 1 0,4 0 0 0 0 0 0 0 0 1 0,05 11 buscadores 0 0 1 0,4 0 0 0 0 0 0 0 0 1 0,05 12 buscadores 1 0,4 0 0 0 0 0 0 0 0 0 0 1 0,05 Total páginas únicas 205 100 243 100 286 100 221 100 208 100 235 100 1998 100 Total pág. potencialmente relevantes 485 485 476 323 412 366 2547 Una vez sup rimidas las páginas repetidas en cada motor y aquellas a las que no se pudo acceder (enlaces rotos), contamos con un total de 2.547 páginas útiles de las que 1998 (7 8,4%) son páginas únicas, es decir aparecen una sola vez. A partir de estas cifras, podemos calcular el porcentaje de solapamiento que corresponde a los recursos cuya Resultados y análisis 267 URL aparece más de una vez. Así pues, el so lapamiento estimado para todos los temas de búsqueda es el 21,6%. Por otro lado tenemos que casi el 47,5% de los recursos es recuperado por un bus- cador. En otras experie ncias similares, como la llevada a cabo por Bar-Ilan (1998), el porcentaje de r ecursos recuperados por un buscador fue del 75%, siendo en nuestro caso mayor el solapamiento en función de la utilización de metabuscadores en la evaluación, ya que la utilización de las bases de datos de los motores da como resultado la recupera- ción de recursos compartidos por ambos tipos de buscadores. Gráfico 4.1-1. Solapamiento 21,6% Sol apa m i ento 78 ,4 % P á gina s única s No obstante este solapamiento es inferior al observado en trabajos anteriores, en los que se obtuvo un porcentaje del 24,6%. (Salvador y Vidal, 2000). De las 1998 páginas únicas, 950 (47,5%) fuer on recuper adas p or un único motor de búsqueda, 184 (9,2%) páginas fueron recuperadas por dos motores y 92 (4,6%) por tres motores. Las búsqueda s con m en or solapamiento son, por este orden la booleana y la bús- queda por campo. El menor solapamiento se observa en la búsqueda con operadores de existencia. En la búsquedas por término único, sólo uno de los resultados fue recuperado por los doce buscadores. En la búsqueda que utiliza lenguaje natural, once de ellos recupera- Tabla 4.1.-2. Total páginas únicas Páginas potencialmente relevantes 2.547 Páginas únicas 1.998 Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 268 ron el mismo recurso. Otro fue recuperado por diez. En la búsqueda por frase, fueron nueve los motores que recuperaron un m ismo recurso. Gráfico 4.1-2. Registros único s en las diferentes búsquedas 0% 20% 40% 60% 80% 100% B ú s q u e d a 1 ( T é r m i n o ú n i c o ) B ú s q u e d a 2 ( L e n g u a j e n a t u r a l ) B ú s q u e d a 3 ( O p e r a d o r e s de e x i s t e n c i a ) B ú s q u e d a 4 ( B ú s q u e d a b o o l e a n a ) B ú s q u e d a 5 ( B ú s q u e d a d e f r a s e ) B ú s q u e d a 6 ( B ú s q u e d a p o r c a m p o ) T o t a l 1 2 m o t o r e s 1 1 m o t o r e s 1 0 m o t o r e s 9 m o t o r e s 8 m o t o r e s 7 m o t o r e s 6 m o t o r e s 5 m o t o r e s 4 m o t o r e s 3 m o t o r e s 2 m o t o r e s 1 m o t o r El gráfico 4.1-2 recoge los resultados analiza dos por porcentajes, y permite apreciar que el mayor índice de recursos recuperados p or un solo motor corresponde a las búsque- das en las que se utilizan operadores de existencia, seguida de la búsqueda bolean y la búsqueda por campo. Por otro lado, vemos que el porcentaje de recurso compartidos por dos buscadores es muy si milar en t odas las bú squedas, aunque es algo mayor en la búsqueda booleana y por campo. Finalmente, el porcentaje de recursos recuperados por tres motores es mayor en las búsquedas booleana y en la que se utilizó únicamente un térm ino. Análisis global El solapamiento observado entre los buscad ores evaluados (21,6%) resulta elevado, en c omparación con otros t rabajos de evalu ación llevados a cabo con anterioridad, pero dado que en ellos no se utilizaron metabuscadores, este valor da idea de la relación entre las bases de datos de estas herramient as. Así mismo se observa que los motores recuperan un mayor número de recurso s únicos en las búsquedas por campo y c on operadores de existencia. Resultados y análisis 269 4.1.1. Páginas únicas por motor de búsqueda La distribución de páginas únicas por buscador y búsqueda aparece recogida en las siguientes tablas. Esto nos permite conocer cuáles son los buscadores que recuperan un mayor número de páginas únicas, la influencia en este sentido del tipo de búsqueda y si los datos son constantes. Tabla 4.1.1-1. Motores. Páginas única s (Base=Excluidos duplicados y errores) Búsqueda 1 (Término único) Búsqueda 2 (Lenguaje natural) Búsqueda 3 (Operadores de existencia) Búsqueda 4 (Búsqueda booleana) Búsqueda 5 (Búsqueda de frase) Búsqueda 6 (Búsqueda por campo) Total Google 23 (20,4%) 22 (13,7%) 28 (13,2%) 20 (12,5%) 18 (3,1%) 15 (8,4%) 126 (13%) MSN 17 (14,7%) 23 (14,3%) 35 (16,5%) 31 (19,4%) 14 (10,2%) 26 (14,5%) 146 (15,1%) Teoma (Ask) 16 (13,8%) 24 (14,9%) 31 (14,6%) Sin resultados Sin resultados Sin resultados 71 (7,3%) WiseNut 25 (21,6%) 31 (19,5%) 30 (14,2%) Sin resultados 13 (9,5%) 15 (8,4%) 114 (11,8%) Yahoo 13 (11,2%) 26 (16,1%) 29 (13,7%) 26 (16,3%) 22 (16,1%) 24 (13,4%) 140 (14,5%) Total 94 (100%) 126 (100%) 153 (100%) 77 (100%) 67 (100%) 80 (100%) 597 (100%) Tabla 4.1.1-2. Metabuscadores. Páginas únicas (Base=Excluidos duplicad os y errores) Búsqueda 1 (Término único) Búsqueda 2 (Lenguaje natural) Búsqueda 3 (Opera- dores de existencia) Búsqueda 4 (Búsqueda booleana) Búsqueda 5 (Búsqueda de frase) Búsqueda 6 (Búsqueda por campo) Total Dogpile 3 (2,6%) 8 (5,0%) 2 (0,9%) Sin resultados Sin resultado s Sin resultados 13 (1,3%) Excite 11 (9,5%) 10 (6,2%) 11 (5,2%) 20 (12,5%) 14 (10,2%) 27 (15,1%) 93 (9,6%) Ixquick 2 (1,7%) 3 (1,9%) 11 (5,2%) 2 (1,3%) 8 (5,8%) 4 (2,2%) 30 (3,1%) Profusion 1 (0,9%) 3 (1,9%) Sin resultados 15 (9,4%) 8 (5,8%) 22 (12,3%) 49 (5%) Search 0 1 (0,6%) 6 (2,8%) 3 (1,9%) 6 (4,4%) 19 (10,6%) 35 (3,6%) Surfwax 0 7 (4,3%) 18 (8,5%) Sin resultados Sin resultado s Sin resultados 25 (2,5%) Vivisimo 2 (1,7%) 3 (1,9%) 11 (5,2%) 43 (26,9%) 34 (24,8%) 27 (15,1%) 120 (12,4%) Total 19 (100%) 35 (100%) 59 (100%) 83 (100%) 70 (100%) 99 (100%) 365 (100%) Tabla 4.1.1-3. Total de pá ginas únicas por búsqued a Total 113 (100%) 161 (100%) 212 (100%) 160 (100%) 137 (100%) 179 (100%) 962 (100%) Esta última tabla, que suma los resultados de las dos tablas anteriores, muestra que la búsqueda que ofrece un mayor número de páginas únicas (212), recuperadas por un sólo buscador es la que utiliza los operadores de existencia, seguida por la búsqueda por campo con 179. En tercer lugar está la búsqueda de varios términos con 161 páginas úni- cas, seguida de la búsqueda booleana con 160. Las menores cifras de recursos únicos, es Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 270 decir donde hay más solapamiento corresponden a la búsqueda por frase (137) y a la bús- queda por término único (113). Por otro lado, si observamos en las tablas anteriores las cifras totales por buscador, podemos observar que el motor de búsqu eda que más páginas únicas recupera es MSN con 146, seguido por Yahoo con 140. En tercer lugar aparece Google con 126, y en cuar- to y quinto puesto están WiseNut y Teoma. Gráfico 4.1-3. Motores. Registros únicos por búsqueda 0 5 10 15 20 25 30 35 Goo gl e MSN T eoma (A sk) WiseNu t Yah oo B úsque da 1 (T érmi no ún ico) B úsque da 2 (Lengu aje na tural) B úsque da 3 (Op eradore s de exi stenc ia) B úsque da 4 (B úsque da boole ana ) B úsqu eda 5 (B úsque da de frase) B úsque da 6 (B úsque da por cam po) Atendiendo al gráfico que muestra los resultados alcanzados por cada buscador en las seis búsquedas podemos observar que en la búsqueda por un término, a la que corres- ponde la barra azul, WiseNut recupera e l mayor número de recursos únicos (25), seguido por Google con 23. Los motores con menor número de recursos únicos en ésta búsqueda son por este orden Yahoo, Te oma y MSN, siendo estos a los que corresponde un mayor solapamiento. En la segunda búsqueda, representada por la barra color granate, sigue siendo Wi- seNut el motor con mayor número de páginas únicas (31), seguido por Yahoo con 26, correspondiendo el mayor solapamiento a Google, MSN y Teom a. En la búsqueda con operadores de existencia, es MSN el motor que más recursos únicos recupera (35), seguido por Teoma y WiseNut. El mayor solapamiento lo r egistran Google y Yahoo. Resultados y análisis 271 En la cuarta búsqueda, MSN con 31 recursos únicos es de nuevo el buscador con más recursos únicos; le sigue Yahoo con 26 y Google con 20 que pasa a ser en este caso el que registra mayor solapamiento. En la búsqueda por frase, es Yahoo con 22 el motor con más recursos únicos, se- guido por Google con 18 y MSN con 14. WiseNut recuperó trece recursos únicos, siendo estos últimos a los que corresponde un mayor solapamiento. La búsqu eda por campo, sitúa de nuevo a MSN con 26 recursos únicos en primer lugar, seguido de Yahoo con 24 y WiseNut y Google con 15 son los que registran un ma- yor solapamiento. Gráfico 4.1-4. Metabuscadores. Registros únicos por búsqueda 0 5 10 15 20 25 30 35 40 45 Dogpi l e Ex c i te I x qu i ck Profu si on Searc h Su rf w a x V i vi si m o Bús q ue d a 1 (T ér mi no ún i co) Bús q ue d a 2 (L eng uaje n at u r al ) Bús q ue d a 3 (Op era dor es d e exi sten ci a) Bús q ue d a 4 (Bú sq ued a bo ol ea n a) Bús q ue d a 5 (Bú sq ued a de fr ase) Bús q ue d a 6 (Bú sq ued a po r cam po ) En l os metabuscadores, podemos observar tanto en Vivisimo como en Excite, Pro- fusion y Search, un mayor número de recurs os únicos en las búsquedas avanzadas. Los datos más destacados corresponden a la búsqueda booleana, en la que Vivisimo recupera 43 recursos únicos, a la búsqueda por frase, con 34 y a la búsque da por campo co n 27. Los metabuscadores con mayor solapam i ento en estas búsquedas son Ixquick y Search. Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 278 4.1.2.5. Búsqueda de frase Tabla 4.1.2-5. Solapamiento (Base=registros operati vos y no duplicados) En la búsqueda por frase llama la atención el aumento de las cifras de solapamien- to, lo que puede ser debido a la especificidad de la búsqueda. En general, los motores se solapan de forma semejante entr e si . De st aca el solapamiento de MSN con WiseNut (10,6%) y con Google (8,7%). El menor solapamiento se da entre este busca dor y Yahoo (5,3%). Respecto al solapamiento de motores con los metabuscadores, podemos observar unos índices más o menos si milares, que sólo destacan en el caso de Yahoo con Excite (10,6%) o de Google con Search (10,1%). En el otro extremo destaca Vivisimo, siendo, en esta búsqueda, el metabuscador con menor sol apamiento entre las herramientas anali- zadas. Entre los metabuscadores, se mantienen los altos porcentajes y sólo disminuyen en el caso de Vivisimo. Google MSN Teoma (Ask) (Sin resultados) WiseNut Yahoo Dogpile (Sin resultados) Excite Ixquick Profu- sion Search S urfwax (Sin resultados) V ivisimo Google - 18 (8,7%) 17 (8,2%) 16 (7,7%) 19 (9,1%) 17 (8,2%) 18 (8,7%) 21 (10,1%) 3 (1,4%) MSN 18 (8,7%) - 22 (10,6%) 11 (5,3%) 16 (7,7%) 15 (7,2%) 17 (8,2%) 19 (9,1%) 5 (2,4%) Teoma (Ask) (Sin resultados) WiseNut 17 (8,2%) 22 (10,6%) - 13 (6,3%) 11 (5,3%) 14 (6,7%) 15 (7,2%) 22 (10,6%) 7 (3,4%) Yahoo 16 (7,7%) 11 (5,3%) 13 (6,3%) - 22 (10,6%) 17 (8,2%) 15 (7,2%) 20 (9,6%) 5 (2,4%) Dogpile (Sin resultados) Excite 19 (9,1%) 16 (7,7%) 11 (5,3%) 22 (10,6%) - 25 (12%) 20 (9,6%) 22 (10,6%) 4 (1,9%) Ixquick 17 (8,2%) 15 (7,2%) 14 (6,7%) 17 (8,2%) 25 (12%) - 23 (11,1%) 19 (9,1%) 8 (3,8%) Profusion 18 (8,7%) 17 (8,2%) 15 (7,2%) 15 (7,2%) 20 (9,6%) 23 (11,1%) - 22 (%) (10,6%) 4 (1,9%) Search 21 (10,1%) 19 (9,1%) 22 (10,6%) 20 (9,6%) 22 (10,6%) 19 (9,1%) 22 (10,6%) - 6 (2,9%) Surfwax (Sin resultados) Vivisimo 3 (1,4%) 5 (2,4%) 7 (3,4%) 5 (2,4%) 4 (1,9%) 8 (3,8%) 4 (1,9%) 6 (2,9%) - Resultados y análisis 279 4.1.2.6. Búsqueda por campo Tabla 4.1.2-6. Solapamiento (Base=registros operati vos y no duplicados) Google MSN Teoma (Ask) (Sin resulta- dos) WiseNut Yahoo Dogpile (Sin resulta- dos) Excite Ixquick Profu- sion Search Surfwax (Sin resulta- dos) Vivisimo Google - 15 (6,1%) 0 23 (9,3%) 13 (5,3%) 14 (5,7%) 0 12 (4,9%) 17 (6,9%) MSN 15 (6,1%) - 0 12 (4,9%) 7 (2,8%) 10 (4%) 2 (0,8%) 12 (4,9%) 13 (5,3%) Teoma (Ask) (Sin resultados) WiseNut 0 0 - 0 4 (1,6%) 0 0 13 (5,3%) 0 Yahoo 23 (9,3%) 12 (4,9%) 0 - 9 (3,6%) 8 (3,2%) 0 10 (4%) 11 (4,5%) Dogpile (Sin resultados) Excite 13 (5,3%) 7 (2,8%) 4 (1,6%) 9 (3,6%) - 14 (5,7%) 0 14 (5,7%) 11 (4,5%) Ixquick 14 (5,7%) 10 (4%) 0 8 (3,2%) 14 (5,7%) - 1 (0,4%) 9 (3,6%) 12 (4,9%) Profusion 0 2 (0,8%) 0 0 0 1 (0,4%) - 0 0 Surfwax ( Sin resultados) Search 12 (4,9%) 12 (4,9%) 13 (5,3%) 10 (4%) 14 (5,7%) 9 (3,6%) 0 - 11 (4,5%) Vivisimo 17 (6,9%) 13 (5,3%) 0 11 (4,5%) 11 (4,5%) 12 (4,9%) 0 11 (4,5%) - En la búsqueda por campo se obs erva un alto solapamiento de Google y Yahoo (9,3%), siendo representativo el que mantiene con MSN (6%) y éste con Yahoo (4,9%). Con WiseNut no hay solapamiento, en ningún caso. Respecto al solapamiento con los metabusca dores, lo primero que llama la atención es que WiseNut, que apenas tiene solapamiento, alcanza un índice del 5,3% con Search. Google se solapa con Vivisimo (6,9%), con Ixquick (5,7%), con Excite (5,3%) y con Search (4,9%). MSN se solapa con Vivisi mo, Search e Ixquick. El solapamiento de Yahoo con el resto de metabuscadores es similar, a excepción de Profusión, con el que no hay solapamiento. Entre los metabuscadores, Excite se solapa con Ixquick, Profusion y Vivisimo, pero no hay solapamiento con Profusion, que en esta búsqueda apenas tiene solapamiento tan- Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 280 to con buscadores como con metabuscadores. Vi visimo e s, en esta ocasión el metabusca- dor con mayor solapam iento con el resto. Análisis global Tabla 4.1.2-7. Solapamiento (Base=registros operativos y no duplicados en las seis búsquedas) La presente tabla muestra el solapamiento entre motores de búsqueda y metabusca- dores teniendo en cuenta los cincuenta primeros recursos recuperados en las seis búsque- das. El primer problema al que nos enfrentamos en el análisis de los datos es que hay búsquedas en las que los buscadores no recupera ron recursos, lo que da lugar a que en estos casos, las cifras de solapamiento sean bajas. Esto ocurre sobre todo con Teoma, Surfwax y Dogpile que no recuperaron en tres de las búsquedas. También, aunque en menor medida se aprecia en WiseNut y P rof usión que no r ecuperaron en una de l as bús- quedas. Por tanto, nos centraremos en valorar el solapamiento entre buscadores y metabus- cadores que recupera ron recursos en todas las búsquedas, lo que nos perm itirá conocer el mejor modo de combinarlos para obtener búsquedas más completas. Las cantidades que Google M SN Teoma (Ask) WiseNut Yahoo Dogpile Excite Ixquick Profusion Search Surfwax Vivisimo Google 53 (11,7%) 14 (6,3%) 26 (7,8%) 83 (17,2%) 31 (7,5%) 68 (10,7%) 56 (8,9%) 39 (8,5%) 92 (11,6%) 4 (2,4%) 40 (7,2%) MSN 53 (10,4%) - 9 (4,1%) 33 (9,9%) 39 (8%) 29 (7%) 41 (6,4%) 45 (7,1%) 47 (10,3%) 86 (10,8%) 6 (3,7%) 62 (11,1%) Teoma (Ask) 14 (2,7%) 9 (2%) - 4 (1,2%) 17 (3,5%) 32 (7,7%) 32 (5%) 25 (3,9%) 24 (5,2%) 13 (1,6%) 4 (2,4%) 45 (8,1%) WiseNut 26 (5,1%) 33 (7,3%) 4 (1,8%) - 20 (4,1%) 13 (3,1%) 22 (3,4%) 40 (6,3%) 26 (5,7%) 76 (9,6%) 29 (17,9%) 42 (7,5%) Yahoo 83 (16,4%) 39 (8,6%) 17 (7,7%) 20 (6%) - 30 (7,2%) 71 (11,2%) 50 (7,9%) 43 (9,4%) 88 (11,1%) 2 (1,2%) 39 (7%) Dogpile 31 (6,1%) 29 (6,4%) 32 (14,6%) 13 (3,9%) 30 (6,2%) - 70 (11%) 48 (7,8%) 31 (6,7%) 62 (7,8%) 11 (6,7%) 56 (10%) Excite 68 (13,4%) 41 (9,1%) 32 (14,6%) 22 (6,6%) 71 (14,7%) 70 (16,9%) - 103 (16,4%) 61 (13,3%) 98 (12,4%) 9 (5,5%) 58 (10,4%) Ixquick 56 (11%) 45 (10%) 25 (11,4%) 40 (12%) 50 (10,3%) 48 (11,6%) 103 (16,2%) - 66 (14,4%) 91 (11,5%) 33 (20,3%) 69 (12,4%) Profusion 39 (7,7%) 47 (10,4%) 24 (10,9%) 26 (7,8%) 43 (8,9%) 31 (7,5%) 61 (9,6%) 66 (10,5%) - 72 (9,1%) 11 (6,7%) 36 (6,4%) Search 92 (18,2%) 86 (19,1%) 13 (5,9%) 76 (22,9%) 88 (18,2%) 62 (15%) 98 (15,4%) 91 (14,5%) 72 (15,7%) - 28 (17,2%) 83 (14,9%) Surfwax 4 (0,7%) 6 (1,3%) 4 (1,8%) 29 (8,7 2 (0,4%) 11 (2,6%) 9 (1,4%) 33 (5,2%) 11 (2,4%) 28 (3,5%) - 25 (4,5%) Vivisimo 40 (7,9%) 62 (13,7%) 45 (20,5%) 42 (12,6 39 (8%) 56 (13,5%) 58 (9,1%) 69 (11%) 36 (7,8%) 83 (10,5%) 25 (15,4%) - 505 450 219 331 482 413 633 626 456 789 162 555 Resultados y análisis 281 aparecen en la tabla indican el número t otal de recursos con solapamiento recogido en las seis búsquedas entre las herramientas de búsqueda correspondientes. Los porcentajes se han calculado sobre el total de recursos solapados que corresponden a cada herramienta de búsqueda, que es la cifra que aparece al final de las columnas. Teniendo en cuenta lo anterior, podemos apreciar que las herramientas de búsqueda en las que se da un mayor sol apamiento son los metabuscadores. En este sentido, Search es la herramienta de búsqueda con mayor solapamiento (789 recursos), seguido de Excite con 633 e Ixquick con 626, correspondiendo el menor solapamiento de los metabuscado- res que recuperan en todas las búsquedas a Vivisimo. Entre los buscadores e s MSN el que menos solapamiento presenta seguido de Ya- hoo, siendo Google el que más resultados solapados ofrece. MSN tiene mayor solapamiento con Google que con Yahoo y con los metabuscado- res Search y Vivisimo, con los que coincide en la recuperación de 86 resultados, un 19,1% y 62 (13,7%) páginas respectivamente. Co rresponde a Exci te la recuperación del menor número de recursos comunes, esto es 41 (9,1%). Google tiene el mayor solapamiento con Yahoo, con el que coincide en 83 páginas, (16,4%) y con el metabuscador Search, con el que coincide en 92 páginas (18,2%). El menor solapamiento lo obtiene con MSN y con el metabuscador Vivisimo. De for ma recíproca, Yahoo tiene un alto solapamiento con Google, 83 (16.4%) des- cendiendo considerabl emente el que mantiene con MSN 39 (8%). Con Search y Excite también mantiene un alto solapamiento, al coincidir en 88 recursos con el primer caso, (18,2%) y en 71 (14,7%) con el segundo. El menor solapamiento de este motor se da con Vivisimo. Teoma regist ra el mayor s olapamiento con Google y Yahoo así como con el meta- buscador Vivisimo, con el que llama la atenci ón el hecho de que coincidan en la recupe- ración de 45 recursos (8,1%) e n tan sólo tres de las consultas en las que Teoma aportó resultados, cifras que en proporción, resultan elevadas. El mayor solapamiento de W iseNut se da con MSN y Google y con el metabusca- dor Search. Dogpile es con el que menor coincidencia de resultados existe. Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 282 En cuanto a los m etabuscadores, Excite tiene un solapamiento en torno al 11% con Yahoo y con Google, disminuyendo al 6,4% con MSN. Con los metabuscadores el sola- pamiento es mayor ya que alcanza un 16,2% con Ixquick y un 15,4% con Search, des- cendiendo a un 9,1% con Vivisimo. Ixquick tiene un solapamiento similar con los tres buscadores que recuperaron en las seis búsquedas, esto es Google, Yahoo y MSN con porcentajes del 8,9%, 7,9% y 7,1% respectivamente. Como ya hemos señalado, hay un alto solapamiento con el metabusca- dor Excite y también con Search (14,5%). Con Vivisimo el porcentaje disminuye al 11%. El solapamiento de Search es similar con los tres buscadores, oscilando entre el 10,8% con MSN y el 11,6% de Google, aspecto que se repite en los metabuscadores con los que los porcentajes van del 10,5% con Vivisimo al 12,4 con Excite. Finalmente Viv isimo alcanza su ma yor solapamiento con MSN (11,1%), siendo muy similar al obtenido con Google y Yahoo (7,2% y 7% respectivamente). Search es el metabuscador con el que más so lapamiento existe (14,9%), seguido de Ixquick (12,4%) y Excite (10,4%). De todas estas cifras podem os deducir que una buena combinación para obtener re- sultados distintos y posiblemente más completos sea la combinación de Google con MSN o de Yahoo con MSN, puesto que son los que ofrecen menos solapam iento entre ellos. Respecto a los metabuscadores, el que mejor se complementa con el resto de bus- cadores, y que por t anto es aconsejable en búsquedas exhaustivas es Vivisimo, si bien, hay que tener en cuenta su solapamiento con MSN. En este mismo sentido, también po- demos decir que resulta menos aconse j able el uso de Excite y Search. Por otro lado, también debemos de tener en cuenta, al valorar el solapamiento entre buscadores, que se deben considerar además otros aspectos como por ejemplo el carácter de la información, ya que un bajo solapamiento por si sólo no puede ser del todo definiti- vo en la elección de dos o más herramientas complem entarias puesto que puede ocurrir que alguna de ellas recupere preferentemente recursos comerciales o de otro tipo, y no de investigación. Resultados y análisis 283 5. Análisis de la precisión técnica Para el análisis de la precisión técnica en la primera búsqueda, nos basamos en las frecuencias con las que aparece el tér mino en los documentos recuperados, que es la metodología utilizada por los investigadores que se han ocupado de estudiar este aspec- to. En el resto de las búsquedas, dado que prácticamente no se recuperan recursos con- teniendo todos los términos, optamos por analizar las frecuencias con las que aparecen de forma individual determinados términos o frases de búsqueda. 5.1. Búsqueda de un término Para el cálculo de la precisión técnica en esta búsqueda utilizaremos la fórmula propuesta por B ar-Ilan (19 98) que calcula la precisión hallando el tanto por ciento que se obtiene al dividir el número de docum entos que contienen el término de búsqueda por el número de docum entos accesibles. Para ello se basa en los resultados ofrecidos en la búsqueda de un término. De aq uí qu e es te cálculo sólo se pueda aplicar a la primera búsqueda. La s iguiente tabla recoge l os datos aportados en dicha búsqueda por los buscado- res evaluados. Tabla 5.1-1. Búsqueda 1. Recursos anali zados Recursos que contienen el término de búsqueda: 206 (38,2%) Recursos que no contienen el término de búsqueda en el texto: 316 (58,7%) Recursos a los que no se pudo acceder por dar error: 16 (2,9%) Total recursos analizados 538 (100% ) En base a estos datos, la frecuencia técn ica de las herramientas de búsqueda anali- zadas es del 38,2%, muy inferior a la obtenida por Bar-Ilan (7 7,2%), para quién esta alta precisión, como expresa en sus conclusiones fue motivo de sorpresa, por lo que plantea la necesidad de más investigación en este aspecto, y que trate de responder por qué los usuarios se quejan de la poca precisión frente a los resultados por él obtenidos. La diferencia de valores obtenidos entre el trabajo de Bar-Ilan y el nuestro puede ser debida a los términos de búsqueda, ya que este autor utiliza en su trabajo un término muy específico, concretamente el apellido “Erdos” para recuperar registros relacionados Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 284 con este matem ático. Este tipo de búsquedas c on un térm ino tan concreto re quiere de los buscadores una alta precisión ya que es difícil recuperar, como ocurre con otros térmi- nos, palabras derivadas o lingüísticamente relacionadas que utilicen la misma raíz. En nuestro caso al tratarse del término “Sof tbot”, los buscadores recuperaron un gran nú- mero de recursos con el término en plural , que aunque la valoración de la precisión técnica no han sido dados por válidos, no es tan e specífico como el anterior. Por tanto, podemos observar la existenci a de va riacione s en los resultados, en función de los tér- minos, por lo que una vez más hemos de tener en cuenta que los datos son indicativos, y que para establecer conclusiones categóricas, es necesar io segui r investigando y utilizar para las comparaciones resultados obtenidos utilizando los mismos términos. No obs- tante nuestros datos sirven para precisar la opinión de Bar-Ilan en cuanto a su extrañeza respecto a los resulta dos sobre la precisión en su búsqueda. En cualquier caso, y además, teniendo en cuenta que se trata de una muestra redu- cida, los datos son suficientemente reveladores de la poca precisión técnica que caracte- riza a estas herramientas de búsqueda, utilizan do términos relativam ente específicos. Los datos que arrojan de forma individual los buscadores son los siguientes: Tabla 5.1-2. Motores. Frecu encia de aparición del término “softbot” Google MSN Teoma (Ask) WiseNut Yahoo Recursos que contienen el término de bús- queda 24 (48%) 13 (26%) 11 (22%) 11 (22% ) 25 (50%) Recursos que no lo contienen 26 (52%) 31 (62%) 36 (72%) 36 (72%) 22 (44%) Recursos a los que no se pudo acceder 0 6 (12%) 3 (6%) 3 (6%) 3 (6%) Total recursos analizados 50 (100%) 50 (100%) 50 (100%) 50 (100%) 50 (100%) Desde este punto de vista, se aprecia una mejora en los resultados al alcanzar, en los mejores casos, una precisión técnica en torno al 50%, como es el caso de Yahoo y Google. No obstante hay que señalar que estos valores siguen estando por debajo de lo que corres pondería a herramientas de búsqueda en las que se requiere, al realizar bús- quedas especializadas, resultados de una mayor precisión. Por otro lado, los peores resultados, con altos porcentajes de recursos que no con- tienen el término de búsqueda, corresponden a MSN, seguido de Teoma y WiseNut. Esto puede ser debido a que recuperan un important e número de páginas que contienen el término en plural , lo que, además de un problema de recuperación, supone una no- table falta de precisión. Resultados y análisis 285 Tabla 5.1-3. Metabuscadore s. Frecuencia de aparición del término “softbot” Dogpile Excite I xquick Profusion Search Surfwax Vivisimo Recursos que contienen el término de búsqueda 19 (38%) 32 (64%) 10 (31,2%) 21 (51,2%) 20 (40%) 3 (20%) 17 (34%) Recursos que no lo contie- nen 30 (60%) 17 (34%) 21 (65,6%) 19 (46,3%) 29 (58%) 12 (80%) 32 (64%) Recursos a los que no se pudo acceder 1 (2%) 1 (2%) 1 (3,1%) 1 (2,4%) 1 (2%) 0 1 (2%) Total recursos analizados 50 (100%) 50 (100%) 32 (100%) 41 (100%) 50 (100%) 15 (100%) 50 (100%) Excite es el metabuscador con mayor precisión técnica ya que presenta un porcen- taje superior al de los motores, por lo que constituye una herramienta de búsqueda a tener en cuenta en búsquedas que requieran una alta precisión técnica. Sólo Profusión supera tímidamente el 50%, correspondiendo los peores resultados a Surfwax con el 20%. 5.2. Búsqueda utilizan do el lenguaje natural En las siguientes búsquedas hemos anal izado tanto el número de documentos que no contienen los términos de búsqueda como la frecuencia de aparición de los términos en cada recurso, para lo que, dado que los resultados apenas ofrecen algún recurso con todos los términos de búsqueda solicitados, hemos descompuesto los términos de la s búsquedas por palabras y frases. Los términos y frases seleccionados en los que hemos basado el análisis son los siguientes: Búsqueda completa: 1. best-match information retrieval in web search engines Términos y frases: 2. best 3. match 4. best-match 5. information retr ieval 6. web search 7. web search engines 8. search engines Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 286 Ofrecemos en primer lugar un análisis individual de los resultados relac ionados con cada uno de los buscadores, para presentar a co ntinuación, un análisis comparativo entre ellos. 5.2.1. Análisis individualizado de l os motores de búsqueda Las siguientes tablas muestran el comportamiento de los buscadores en cuanto a la frecuencia de aparición de los té rminos de búsqueda en los recursos recuperados. Dado que como hemos indicado, prácticamente ninguna de estas herramientas recuperó pági- nas conteniendo todos los términos solicitados en las búsquedas de más de un término, teniendo en cuenta la metodología que diferentes autores utilizan para valorar la preci- sión técnica, nos pareció interesante valor ar en qué medida, los recursos contenían algu- no de los términos o frases de búsqueda. La primera tabla que se muestra a continuación del nombre de cada buscador re- coge el número de recursos analizados en cada búsqueda. A continuación, las demás tablas muestran, en la primera columna el número de veces que aparece un término o frase en un recurso. Así, cuando no aparecen los términos en las páginas, el resultado es cero. La segunda columna recoge el número de recursos en los que aparece. La tercera indica el porcentaje que ese número supone entre los recursos recuperados. Google Tabla 5.2.1-1. Nº de recursos analizados Nº Recursos 50 Tabla 5.2.1-2. Frecuencia y nº de recur sos en los que aparecen los términos “ best-match information retriev al in web search engines” Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 50 100% Como podemos apreciar, en esta segunda búsqueda Google no recupera páginas con todos los términos. Resultados y análisis 287 Tabla 5.2.1-3. Frecuencia y nº de rec ursos en los que aparece el término “ best” Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 10 20% 1 16 32% 2 7 14% 3 5 10% 4 4 8% 5 3 6% 9 4 8% 10 1 2% Total 50 100% El porcentaje de páginas que no contiene este término (20%), es elevado y sensi- blemente superior al que ofrecen MSN (8%), W iseNut (12%) y Yahoo (14%) lo que indica que este buscador valora en menor medida que el resto no tiene en cuenta en la recuperación la aparición de los términos de búsqueda en los documentos que recupera. Por otro lado, llama la atención el alto número de docum ent os en los que el térm ino sólo aparece una vez (16 documentos). Tabla 5.2.1-4. Frecuencia y nº de rec ursos en los que aparece el término “ match” Nº de v eces que aparecen los términos Nº de recursos Porcentaje 0 12 24% 1 14 28% 2 8 16% 3 6 12% 4 2 4% 12 1 2% 15 2 4% 18 4 8% 39 1 2% Total 50 100% En relación con el término “match“, los resultados de la presente tabla muestran dos grupos, el primero de ellos formado por documentos con frecuencias bajas, no su- perando cuatro apariciones por documento (el 60% de los recuperados) y u n segu ndo grupo (el 14% de los documentos) con frecuencias de aparición entre 12 y 18 veces por Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 294 MSN ofrece en esta ocasión frecuencias similares a las de Google, superándole és- te al recuperar recursos sin los términos, frente a 32 de MSN. Tabla 5.2.1-17. Frecuencia y nº de recurs os en los que aparecen los términos “ w eb s earch engines" Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 40 80% 1 6 12% 2 1 2% 3 2 4% 32 1 2% Total 50 100% Como ocurre con Goog le, también MSN recupera un alto número de recursos sin los tres términos. En general la recuperación de estos términos es similar en Google, con una recu- peración de recursos con frecuencias bajas y en el otro extremo, la recuperación de al- gún recurso en el que los térm inos aparecen con una frecuencia elevada (32 veces). Tabla 5.2.1-18. Frecuencia y nº de recurs os en los que aparecen los términos “ search engines" Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 21 42% 1 1 2% 3 2 4% 4 1 2% 5 1 2% 7 1 2% 8 2 4% 10 2 4% 11 1 2% 12 3 6% 13 1 2% 15 1 2% 18 2 4% 21 2 4% 27 1 2% 33 1 2% Resultados y análisis 295 Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 35 2 4% 36 1 2% 42 1 2% 49 1 2% 57 1 2% 73 1 2% Total 50 100% También en estos términos el comportamiento es similar a Google, si bien MSN ofrece un mayor número de páginas con diferentes frecuencias de aparición de los tér- minos. Destaca además por la recuperación de un recurso en el que estos términos apa- recen en 73 ocasiones. En resumen, la precisión técnica en MS N es en esta búsqueda, aunque es muy s i- milar en algunos términos a Google, superándolo en cuanto a porcentajes de páginas que contienen los términos de búsqueda, y en la variedad de frecuencias que muestran los documentos recuperados. Al margen de la recuperación con el término compuesto, best-match que no es muy fr ecuente en los recursos recuperados, como se ha demostra- do en el comportamiento con el resto de términos, este buscador da importancia a la existencia de los términos de búsqueda en los docum entos que recupera. Teoma (Ask) Tabla 5.2.1-19. Nº de recursos analizados Nº Recursos 50 Tabla 5.2.1-20. Frecuencia y nº de recurs os en los que aparecen los términos “ best-match informa- tion retrieval in web search engines” Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 50 100% Como en los buscadores anteriores, Teoma tampoco recupera páginas con todos los términos de la búsqueda Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 296 Tabla 5.2.1-21. Frecuencia y nº de recu rsos en los que aparece el término “ best" Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 12 24% 1 13 26% 2 7 14% 3 6 12% 4 8 16% 5 1 2% 7 1 2% 9 1 2% 10 1 2% Total 50 100% Teoma es el motor que menos recursos con e ste término recupera, y se caracteriza por una recuperación en dos grupos. En el primero de ellos, con muy bajas frecuencias, que correspondería al 90% de los recursos recuperados, con frecuencias no superan los cuatro casos, y el segundo grupo (8%) sólo aparece en una ocasión. Tabla 5.2.1-22. Frecuencia y nº de recu rsos en los que aparece el término “ match” Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 15 30% 1 15 30% 2 10 20% 3 3 6% 4 2 4% 5 1 2% 10 1 2% 12 1 2% 15 1 2% 39 1 2% Total 50 100% Teoma sigue mostrando el comportamiento en dos grupos, si bien, en esta oca- sión, si que recup era un recurso con alta frecuencia de aparición del término (39 veces), que también aparecía en los buscadores anteriores. El alto número de recursos sin el término de búsqueda influye en su baja precisión técnica. Resultados y análisis 297 Tabla 5.2.1-23. Frecuencia y nº de recu rsos en los que aparece el término “ best-match" Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 38 76% 1 10 20% 3 1 2% 9 1 2% Total 50 100% Teoma destaca en esta ocasión por la recuperación de un mayor número de recur- sos (10) en los que el térm ino compuesto aparece una vez, pero también hay que desta- car la recuperación de un recurso en el que aparece en 9 ocasiones. Tabla 5.2.1-24. Frecuencia y nº de recurs os en los que aparecen los términos “ information retrieval" Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 27 54% 1 7 14% 4 1 4% 5 2 4% 6 1 2% 12 1 2% 13 2 4% 15 2 4% 16 2 4% 19 1 2% 22 1 2% 24 1 2% 35 1 2% Total 50 100% Dentro de las características señaladas, aunque Teoma sigue mostrando un alto número de recursos en los que los términos de búsqueda no aparecen, en esta ocasión supera las frecuencias mostradas por Google, aunque sin alcanzar los datos de MSN. Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 298 Tabla 5.2.1-25. Frecuencia y nº de recurs os en los que aparecen los términos “ w eb s earch" Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 22 44% 1 10 20% 2 2 4% 3 2 4% 4 3 6% 5 1 2% 6 1 2% 7 2 4% 8 1 2% 9 1 2% 11 1 2% 14 2 4% 21 1 2% 52 1 2% Total 50 100% El comportamiento es similar al observado en los términos an teriores, destacando respecto a los anteriores por el número de páginas (10) en las que los términos de nuevo la recuperación de páginas en las que aparecen tan sólo en una ocasión. Tabla 5.2.1-26. Frecuencia y nº de recurs os en los que aparecen los términos “ w eb s earch engines” Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 28 56% 1 8 16% 2 6 12% 4 2 4% 5 1 2% 7 2 4% 12 1 2% 14 1 2% 32 1 2% Total 50 100% También aquí mantiene las características observadas anteriormente en cuanto a la compensación entre el alto número de resultados con bajas frecuencias y los recursos Resultados y análisis 299 con frecuencias superio res. Recupera en esta ocasión un m ayor número de recursos con estos términos que Google y MSN. Tabla 5.2.1-27. Frecuencia y nº de recurs os en los que aparecen los términos “ search engines" Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 16 32% 1 2 4% 2 3 6% 3 3 6% 5 1 2% 6 2 4% 7 1 2% 10 1 2% 11 3 6% 16 1 2% 17 1 2% 18 1 2% 19 1 2% 23 1 2% 26 1 2% 30 1 2% 33 1 2% 36 1 2% 38 1 2% 39 1 2% 42 1 2% 46 1 2% 57 1 2% 65 1 2% 77 1 2% 81 1 2% 114 1 2% Total 50 100% Teoma (Ask) recupera un importante número de recursos con frecuencias altas, destacando por la recuperación de un recurso en que los términos aparecen en 114 oca- siones. Por otro lado, se mantiene como el resto en cuanto a recursos con menores fre- cuencias. Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 300 En definitiva, Teoma (Ask) tiene para esta búsqueda un comportamiento sim ilar a Google, al que supera, al igual que al resto, en el caso del término “ best-match” y en la recuperación de un menor número de recursos que no contienen los términos de bús- queda analizados. WiseNut Tabla 5.2.1-28. Nº de recursos analizados Nº Recursos 50 Tabla 5.2.1-29. Frecuencia y nº de recurs os en los que aparecen los términos “ best-match informa- tion retrieval in web search engines “ Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 50 100% WiseNut tampoco recupera páginas con todos los términos de la búsqueda. Tabla 5.2.1-30. Frecuencia y nº de recu rsos en los que aparece el término “ best " Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 6 12% 1 12 24% 2 11 22% 3 6 12% 4 2 4% 5 1 2% 6 3 6% 7 1 2% 9 2 4% 11 1 2% 12 1 2% 14 1 2% 16 1 2% 35 1 2% 38 1 2% Total 50 100% Resultados y análisis 301 WiseNut y MSN son los buscadores en los que menor es el número de páginas re- cuperadas que no contiene el término de búsqueda. En general, este último recupera un gran número de recursos en los que el térmi no aparece una vez (17) frente a 6 recursos en WiseNut. Éste a su vez recupera más r ecursos en los que el término aparece 2 y 3 veces, aunque WiseNut recupera menor número de recurs os de altas frecuencias de apa- rición del término que MSN. Sin embargo recupera dos documentos de 35 y 38 casos, que no recuperó aquél. Tabla 5.2.1-31. Frecuencia y nº de recu rsos en los que aparece el término “ match" Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 9 18% 1 21 42% 2 15 30% 3 2 4% 6 1 2% 8 1 2% 19 1 2% Total 50 100% WiseNut tiene en esta ocasió n un comportamiento m ás irregular que el observado respecto al término anterior, destacan do el alto núm ero de recursos en los que el térm ino aparece en el texto sólo en una o dos ocasiones. Tabla 5.2.1-32. Frecuencia y nº de recu rsos en los que aparece el término “ best-match" Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 49 98% 1 1 2% Total 50 100% WiseNut sól o recup era un recurso en el que el término compuesto aparece una vez, s iendo similar a MSN, si bien en el documento recuperado por éste, el término apa- recía dos veces. Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 302 Tabla 5.2.1-33. Frecuencia y nº de recurs os en los que aparecen los términos “ information retrieval" Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 47 94% 1 1 2% 3 1 2% 19 1 2% Total 50 100% WiseNut sólo recupera tres registros con estos términos, ofreciendo en este senti- do el peor resultado en comparación, no sólo con los anteriores, sino con el resto de motores de búsqueda. Tabla 5.2.1-34. Frecuencia y nº de recurs os en los que aparecen los términos “ w eb s earch" Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 41 82% 1 2 4% 2 1 2% 3 1 2% 4 1 2% 6 1 2% 12 1 2% 13 1 2% 18 1 2% Total 50 100% Las frecuencias d e recuperación de páginas que no contienen los términos de bús- queda son también en esta ocasión las más elevadas, lo que confir m a la baja precisión técnica de este m otor. Tabla 5.2.1-35 . Frecuencia y nº de recurs os en los que aparecen los tér minos “ w eb se arch engines" Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 47 94% 2 2 4% 11 1 2% Total 50 100% Resultados y análisis 303 Como en los términos anteriores, corresponden a este buscador los mayores por- centajes de recursos sin los términos de búsqueda. Tabla 5.2.1-36. Frecuencia y nº de recurs os en los que aparecen los términos “ search engines" Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 35 70% 1 5 10% 2 3 6% 11 1 2% 13 1 2% 25 1 2% 34 1 2% 36 1 2% 42 1 2% 70 1 2% Total 50 100% WiseNut también aquí destaca por el alto porcentaje de recursos que no contienen estos términos (70%), lo que unido a la mayor recuperación de recursos con bajas fre- cuencias, da lugar a una baja precisión técnica. En resumen, debemos mencionar en primer lugar el desigual comportamiento de este buscador en la recuperación de documentos con los diferentes términos de búsque- da analizados. Las diferencias observadas por ejemplo entre la recuperación de los dos primeros términos, tal vez puedan ser debidas a la distinta frecuencia con que pueden aparecer estos términos en los documentos ya que el segundo término ( match ) es más específico. No obstante, la recuperación de un único recurso con el término “ best- match ” nos permite afirmar que existe un deficiente funcionamiento en este motor en relación con términos compuestos. Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 310 cumentos de frecuencias con valores más bajos. WiseNut se caracteriza por la recupera- ción de muchos documentos en los que el término aparece en pocas ocasiones y una variedad de documentos en los que aparece muy frecuentemente. Yahoo tiene un com- portamiento más variado, destacando por la recuperación de un documento en el que el término se utiliza en cuarenta o casiones. En la recuperación de este término hay cierta relación con lo señalado para el an- terior, sobre todo en MSN y Yahoo s i bien se observa un crecimiento en la recuperación de documentos en los que el término aparece solo en una ocasión o dos, como podemos apreciar en WiseNut. Google y Teoma recupe ran en esta ocasión más recursos con m a- yores frecuencias de aparición del término. Gráfico 5.2.2-2. Motores. Frecuencia del término “ match” 0 5 10 15 20 25 Google MSN Teoma (A sk) WiseNu t Yahoo 0 1 2 3 4 5 6 7 8 10 12 14 15 16 18 19 25 39 Nº de veces que aparece el término Nº d e recu rsos Resultados y análisis 311 En este caso llama la atención el alto número de recursos que no contienen el tér- mino compuesto. Teoma es el buscador que recupera más páginas con el término segui- do de Yahoo y Google, aunque todos ellos con una recuperación más que discreta, más aún si tenemos en cuenta que se trata de los términos más específicos de la búsqueda, lo que indica una baja precisión en la recuperación realizada por estas herramientas. Gráfico 5.2.2-3. Motores. Frecuencia del término “best-match” 0 10 20 30 40 50 Goog le MSN Teoma (A sk) W iseNu t Yah oo 0 1 2 3 8 9 Gráfico 5.2.2-4. Motores. Frecuencia de los términos “information retrieval” 0 5 10 15 20 25 30 35 40 45 50 Google MSN Teoma (Ask) WiseNut Yahoo 012345 689 10 11 12 13 15 16 17 18 19 22 23 24 25 27 28 29 30 35 38 40 47 87 90 Nº de recu rsos Nº de recu rsos Nº de veces que aparece el término Nº de veces que aparece el término Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 312 En la gráfica podemos observar que los valores de las frecuencias de aparición de estos términos en los documentos recuperados son variables alternando documentos de bajas frecuencias con otros de altas. Por otro lado el comportamiento d e los motores es desigual, destacando el caso de WiseNut por los pocos recursos que contienen el térmi- no. Google cas i alcanza el valor d e cinco repeticiones en un mismo documento en va- rios de ellos mientras que en MSN, Teoma y Yahoo apenas aparecen tres veces en algu- nos de los documentos. Sin Embargo MSN y Yahoo recuperan otros documentos con altas frecuencias de aparición. Por otro lado Teoma recupera el mayor número de pági- nas en las que los términos aparecen sólo una vez. La recuperación de documentos con estos términos es similar a la a nterior aunq ue se aprecia un leve aumento de las frecuencias. También podemos hablar de la existencia de una cierta similitud entre los buscadores, aunque Teoma destaca en la recuperación Gráfico 5.2.2-5. Moto res. Frecuencia de los términos “web search” 0 5 10 15 20 25 30 35 40 45 Go ogl e MSN T eoma (A sk) W iseNut Yahoo 0 1 2 3 4 5 6 7 8 9 10 11 12 13 14 17 18 19 21 24 52 Nº de recu rsos Nº de veces que aparece el término Resultados y análisis 313 de más pági nas e n las que los términos aparecen con poca frecuencia, y por ser el motor que recupera un menor número de recursos que no contienen estos términos. Además, junto a Yahoo, es el motor que más variedad de frecuencias obtiene. Corresponden a WiseNut los peores resultados. De nuevo lo más destacado es la escase z de páginas que contienen los términos. Teoma y Yahoo son los motores con mayor número de páginas con los términos y ma- yor variedad de frecuencias. Todos los buscadores a excepción de WiseNut r ecuperan un recurso con la frecuencia más alta (32). MSN recupera un escaso número de páginas con los términos, y en su mayor parte sólo aparece la frase una vez. Estos términos son más frecuentes en los documentos recuperados pues sólo en WiseNut de staca el número de recursos que no los contienen. Corresponde a Yahoo una mayor precisión técnica ya que ofrece el menor número de páginas que no contienen los términos d e búsqued a al mismo ti empo que facilita un importante número de recursos con frecuencias de aparición variadas. En la misma línea, pero con mayor número de páginas sin los temas de búsqueda, podemos situar a MSN y Teoma, destacando éste último por recuperar el recurso con mayor fr ecuencia. La recuperación de Google tiene menos en cuenta la aparición de los términos. Gráfico 5.2.2-6. Motores. Frecuencia de los térmi nos “web search engines” 0 5 10 15 20 25 30 35 40 45 50 Goo gle MSN T eoma (A sk) WiseNut Yahoo 012345 79 11 12 14 32 Nº de recu rsos Nº de veces que aparece el término Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web 314 En la presente gráfica podemos obser var que a excepción de WiseNut, la existen- cia de estos términos en los recursos recuperados es más frecuente que los inmediata- mente anteriores. La mayor precisión técnica corresponde a Yahoo y Teoma que son los que menor número de recursos recuperan sin los términos de búsqueda así como por la recuperación de un mayor número de documen tos con las frecuencias más elevadas. Gráfico -5.2.2-7. M otores.Frecuencia de los términos “search engines” 0 5 10 15 20 25 30 35 Go o g le M SN T e o m a ( A s k ) Wis e Nu t Y a h o o 01 2345 678 10 11 12 13 14 15 16 17 18 19 20 21 23 25 26 27 30 32 33 34 35 36 38 39 40 42 46 49 51 57 65 70 73 77 81 11 4 N º de ve ce s q u e apar e ce e l t é r m in o Nº de recu rsos Resultados y análisis 315 En definitiva, y dado que no se recuperaron recursos con todos los términos, si te- nemos en cuenta las expresiones más especí ficas de la búsqueda como es el caso de “best-match”, “information retrieval” y “web search engines”, es muy poca la diferen- cia, a excepción del bajo comportam iento observado en WiseNut, que hay entre los mo- tores de búsqueda, pues aunque en relación con los últim os términos podríamos destacar a Yahoo, por la recuperación del término “best-match” destaca Teoma (Ask). 5.2.3. Análisis individualizado por metabuscado res Dogpile Tabla 5.2.3-1. Nº de recursos analizados Nº Recursos 43 Tabla 5.2.3-2. Frecuencia y nº de recur sos en los que aparecen los términos “ best-match information retrieval in w eb seacrh e ngines” Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 43 100% El metabuscador Dogpile no recupera páginas con todos los términos de la bús- queda. Tabla 5.2.3-3. Frecuencia y nº de rec ursos en los que aparece el término “ best" Nº de v eces que apare- cen los términos Nº de recursos Porcentaje 0 12 27,9% 1 6 14% 2 9 20,9% 3 5 11,6% 4 5 11,6% 5 1 2,3% 8 1 2,3% 9 1 2,3% 10 1 2,3% 12 1 2,3% 13 1 2,3% Total 43 100% [Document text truncated for crawler view.]