Full text
T esis Doctoral
Evaluación del funcionamiento y
r ecuperación de información textual
de los principales motor es de
búsqueda y metabuscador es genéricos
de la W orld W ide W eb
Memoria presentada por
Francisco Javier V idal Bordes
en la Facultad de Filosofía y Letras de la Universidad de Zaragoza
para optar al título de Doctor .
Director: Dr . José Antonio Salvador Oliván
2008
A la memoria de
Antonio Vidal Bordes
i
EVALUACIÓN DEL FUNCIONAMIENTO Y RECUPERACIÓN DE
INFORMACIÓN TEXTUAL DE LO S PRINCIPALES MOTORES DE
BÚSQUEDA Y METABUS CADORES GENÉR ICOS DE LA WORLD
WIDE WEB
ÍNDICE GENERAL ............................................................................................................ i
I. INTRODUCC IÓN
Introducción y objetivos ........................................................................................................ 1
1. Internet y la World Wide Web ....................................................................................... 9
1.1. La red Internet .................................................................................................... 9
1.1.1. Breve introducción histórica ...................................................................... 9
1.1.1.1. Primeras investigaciones. Las redes y los protocolos ..................... 10
1.1.1.2. Los servicios y sus protocolos. Las prim eras herramientas de
recuperación de información en Internet ........................................ 12
1.2. La World Wide Web........................................................................................... 20
1.2.1. Orígenes de la World Wide Web ............................................................... 21
1.2.2. Características técnicas y problemas de la información en la Web ........... 23
2. Los buscadores de información de la WWW en el contexto de los sistemas de
recuperación de la información. Procesos, funciones y problemas ............................ 36
2.1. Los Sistemas de Recuperación de la Información y los buscadores Web.......... 36
2.2. Procesos de lo s SRI y su repercusión en las herramientas de recuperación
Web. ................................................................................................................... 41
2.2.1. Formación de la base de datos ................................................................... 42
2.2.2. El análisis documental ............................................................................... 43
2.2.2.1. La descripción ................................................................................ 43
2.2.2.2. La Indización .................................................................................. 44
2.2.2.3. La clasificación .............................................................................. 46
2.2.2.4. El resumen ...................................................................................... 47
2.2.3. La búsqueda y recuperación de información ............................................. 48
2.3. Los buscadores de información Web .................................................................. 53
2.3.1. Orígenes de los principales motores de búsqueda y metabuscadores ........ 54
2.3.2. Definición y clasificación .......................................................................... 60
2.3.2.1. Directorios ...................................................................................... 63
2.3.2.2. Motores de búsqueda...................................................................... 66
2.3.2.3. Metabuscadores .............................................................................. 70
2.3.2.4. Los agentes inteligentes ................................................................. 73
ii
2.3.3. Principales componentes y funcionamiento .............................................. 74
2.3.3.1. El robot o crawler ........................................................................... 75
2.3.3.2. El índice ......................................................................................... 77
2.3.3.3. La base de datos ............................................................................. 81
2.3.3.4. Los programas de búsqueda y recuperación de la inform ación ..... 93
2.3.3.5. Identificación de los problemas de recuperación de información
en la Web ........................................................................................ 97
3. La evaluación de los sistemas de recuperación de la información y las
herramientas de búsqueda de la WWW ................................................................ 103
3.1. Concepto y fines de la evaluación. El proceso de evaluación ............................ 103
3.1.1. Concepto de evaluación ............................................................................. 103
3.1.2. Fines y objetivos ........................................................................................ 105
3.1.3. Proceso de evaluación ................................................................................ 107
3.2. Tendencias en la evaluación de SRI ................................................................... 108
3.3. La evaluación de los SRI. Indicadores ............................................................... 113
3.4. La evaluación de las herramientas de búsqueda de la World Wide Web.
Estado de la cuestión e indicadores utilizados. .............................................. 121
3.4.1. Estado de la cuestión .................................................................................. 121
3.4.2. Propuestas de evaluación e indicadores de los buscadores de la Web....... 142
II. MATERIAL Y MÉTODO ............................................................................................. 159
1. Los indicadores de evaluación, valores y medidas a aplicar ............................ 161
2. Selección de Motores de búsqueda y metabuscadores ..................................... 165
3. Test de evaluación ................................................................................................ 167
3.1. Modos de búsqueda ...................................................................................... 167
3.2. Temas de búsqueda y sintaxis ....................................................................... 167
3.3. Ejecución de las búsquedas........................................................................... 169
3.4. Recopilación y análisis de datos ................................................................... 171
III. RESULTADOS Y ANÁLISIS ..................................................................................... 179
1. Datos de la muestra .................................................................................................. 179
1.1. Total recursos recuperados por m otores de búsqueda y metabuscadores ........... 179
1.2. Total recursos analizados.................................................................................... 182
2. El software de recuperación .................................................................................... 183
2.1. Análisis del funcionamiento de los motores en los distintos tipos de
búsqueda ................................................................................................................... 18 3
2.1.1. Capacidad de búsqueda ............................................................................. 183
2.2. Análisis de la presentación de los resultados y la inform ación de los registros
recuperados ........................................................................................................ 186
iii
2.2.1. Análisis del uso de metainformación en fu nción de la coincidencia
de los títulos de la etiqueta <title > y del listado de recuperación 187
2.2.2. Términos de búsqueda destacados ............................................................ 190
2.2.3. Recursos dependientes .............................................................................. 194
2.2.4. Enlaces a páginas de contenido publicitario en los listados ...................... 197
3. Los componentes de los bu scadores y característ icas de la información
recuperada ................................................................................................................ 200
3.1. Aspectos relacionados con el robot o crawler..................................................... 200
3.1.1. Profundidad de indización del sitio web ................................................... 200
3.2. Aspectos relacionados con el índice de los buscadores ...................................... 209
3.2.1. Duplicados................................................................................................. 209
3.2.2. Enlaces inactivos ....................................................................................... 212
3.3. Aspectos relacionados con la base de datos ........................................................ 215
3.3.1. Análisis de las carac terísticas de la información recuperada .................... 215
3.3.1.1. Actualización de la información proporcionada ............................. 215
3.3.1.2. Carácter de la información ............................................................. 218
3.3.1.3. Tipo de fichero ............................................................................... 222
3.3.1.4. Tipología documental .. ................ ................ ................ ................. .. 2 23
3.3.1.4.1. Análisis indi vidualizado de las búsquedas............................ 224
3.3.1.4.1.1. Búsqueda de un término ................................................. 224
3.3.1.4.1.2. Búsqueda utilizando el lenguaje natural ......................... 230
3.3.1.4.1.3. Búsqueda con operadores de existencia ......................... 236
3.3.1.4.1.4. Búsqueda booleana ......................................................... 242
3.3.1.4.1.5. Búsqueda de frase ........................................................... 247
3.3.1.4.1.6. Búsqueda por campo ...................................................... 253
4. Cobertura y solapamiento ....................................................................................... 266
4.1. Análisis de páginas únicas y solapamiento ......................................................... 266
4.1.1. Páginas únicas por motor de búsqueda...................................................... 269
4.1.2. Solapamiento entre buscadores. Análisis por búsquedas .......................... 272
4.1.2.1. Búsqueda de un térm ino ........................ ......................................... 273
4.1.2.2. Búsqueda utilizando el lenguaje natural ......................................... 274
4.1.2.3. Búsqueda con operadores de existencia ......................................... 275
4.1.2.4. Búsqueda booleana ......................................................................... 277
4.1.2.5. Búsqueda de frase ........................................................................... 278
4.1.2.6. Búsqueda por campo ...................................................................... 279
5. Análisis de la precisión técnica ................................................................................ 283
5.1. Búsqueda de un término ..................................................................................... 283
5.2. Búsqueda utilizando el lenguaje natural ............................................................. 285
iv
5.2.1. Análisis individualizado de los motores de búsqueda ............................... 286
5.2.2. Análisis comparativo de los motores de búsqueda .................................... 308
5.2.3. Análisis individualizado por metabuscadores ........................................... 315
5.2.4. Análisis comparativo de los metabuscadores ............................................ 343
5.3. Búsqueda con operadores de existencia ............................................................. 351
5.3.1. Análisis individualizado por motores de búsqueda ................................... 351
5.3.2. Análisis comparativo de los motores de búsqueda .................................... 367
5.3.3. Análisis individualizado por metabuscadores ........................................... 373
5.3.4. Análisis comparativo de los metabuscadores ............................................ 393
5.4. Búsqueda booleana ............................................................................................. 399
5.4.1. Análisis individualizado por motores de búsqueda ................................... 399
5.4.2. Análisis comparativo de los motores de búsqueda .................................... 406
5.4.3. Análisis individualizado por metabuscadores ........................................... 409
5.4.4. Análisis comparativo de los metabuscadores ............................................ 419
5.5. Búsqueda de frase ............................................................................................... 422
5.5.1. Análisis individualizado por motores de búsqueda ................................... 422
5.5.2. Análisis comparativo de los motores de búsqueda .................................... 426
5.5.3. Análisis individualizado por metabuscadores ........................................... 427
5.5.4. Análisis comparativo de los metabuscadores ............................................ 431
5.6. Búsqueda por campo ........................................................................................... 432
6. Análisis de la ordenación de resultados o ranking ................................................ 436
6.1. Utilización de la metainformación ................................................................ 436
6.2. Frecuencia y peso del término de búsqueda en las páginas recuperadas ............ 438
6.3. Correlación entre la frecuencia de aparición del término de búsqueda y el
peso con la ordenación de los resultados de búsqueda ....................................... 454
IV. CONCLUSIONES ........................................................................................................ 457
BIBLIOGRAFÍA ................................................................................................................. 47 1
v
Agradecimientos
Quiero agradecer a todas las personas que de un modo u otro han posibilitado
la realización del presente trabajo. En primer lugar tengo que dar las gracias al Profesor
José Antonio Salvador Oliván, por su confianza en mí, al proponerme la realización de
un trabajo tan interesante y por su inestimable colaboración en la resolución de cuantos
problemas se m e han ido planteando en las diferentes fases de su realización.
También tengo que agradecer el apoyo prestado a personas como José Mª
Meléndez Vidal, que inicialmente me facilitó la consulta de los primeros trabajos en for-
mato electrónico, y a Jorge Vidal Serrano por sus propuestas para facilitar la lectura de
este trabajo.
Tampoco puedo olvidarme del grupo de am igos que se prestaron de forma
voluntaria para la realización de las búsquedas en los diferentes buscadores. En este sen-
tido, quiero agradecer a Mª del Carmen Montolio, Susana Casaña Oliver, Blanca Angulo,
Jorge Vidal Serrano, Domingo Bel Gaudó, Luis Fatás Fernández, Ernesto Her nández
Mareca, José Romero Sánchez y al profesor Vicente Ramón Palerm, el entusiasmo con el
que participaron en las dos sesiones de esta fase.
No puedo olvidarme de todas aquellas personas que han estado cerca de mí,
animándom e y facilitándome lo necesario para que este trabajo saliera adelante. Así pues,
debo dar las gracias a Matilde Cantín Luna, Directora de la Biblioteca María Moliner de
la Facultad de Filosofía y Letras de la Universidad de Zaragoza por facilitarm e el uso de
sus instalaciones para llevar a cabo la parte práctica de la evaluación, a Antonio Cubillo,
Operador Informático de la Facultad de Filosofía y Letras, por su cooperación en el al-
macenam iento de la documentación electrónica en el Servidor de la Facultad, y a Agustín
Urdangarín, director del Centro de Document ación Científica de la Universidad de Zara-
goza, por su colaboración en la solución a alguno de los problemas informáticos que sur-
gieron a lo largo del trabajo, y al Profesor Angel López Molinero, de la Facultad de Cien-
cias por sus consejos para la realización del material gráfico. También quiero mencionar,
por su constante apoyo y ánimo recibido a lo largo del trabajo, al Profesor Francisco
Marco Simón y a su m ujer, Cristina y a su hija, Cristina Marco.
Finalmente, he de dar las gracias a mi familia, que desde el principio han
mostrado todo su apoyo y comprensión, facilitándom e la realización de este trabajo.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
6
establecer los criterios e indicadores de evaluación, cuyos valores nos permitirán cuanti-
ficar determinados aspectos relacionados con su funcionamiento y recuperación.
Planteamos una metodología centrada en el análisis de los aspectos relacionados
con los objetivos propuestos, que sea simp le pero consistente, de manera que permita,
como hemos señalado, no sólo realizar comp araciones entre los sistemas, sino también
repetirse cada cierto tiempo, y observar su evolución.
Para la obtención de los datos que nos han de servir de muestra en el análisis,
lanzamos diferentes tipos de búsqueda. La primera se basa en la recuperación de docu-
mentos que traten sobre un término de búsqueda. La segunda es una sucesión de términos
que corresponde a una búsqueda en lenguaje natural. Para analizar su funcionamiento
ante búsquedas avanzadas hemos realizado una tercera búsqueda basada en el uso de ope-
radores booleanos, la cuarta incluye operadores de existencia, la quinta, es una búsqueda
de frase y la sexta es una búsqueda en el cam po título.
Un estudio de evaluación previo al presente trabajo 7 , nos permitió observar la
especificidad de la mayoría de trabajos de evaluación de estas herramientas, centrándose
en la valoración de determinados criterios y fundamentalmente en la precisión, ya que se
considera uno de los aspectos más importantes en los sistemas de recuperación de infor-
mación. Por otro lado advertimos la necesidad de desarrollar una metodología que permi-
tiera valorar estas herramientas atendiendo tanto a las características como al funciona-
miento de sus com ponentes.
Para evitar o al menos minimizar la subjetividad, utilizaremos una metodología
basada en valores estadísticos.
El presente estudio se estructura básicamente en tres grandes apartados. En el
primero de ellos, de carácter introductorio, analizamos el marco contextual en el que se
halla la información, es decir, la red Internet y la World Wide Web, prestando especial
atención tanto al origen y la evolución como a las características de la información y ser-
vicios que contienen. El siguiente punto de interés lo componen los principales sistemas
que se utilizan para recuperarla, es decir los buscadores y sus clases, su funcionamiento,
ocupándonos también de los sistemas de recuperación de información tradicionales, ya
7 SALVADOR OLIVÁN, José Antonio y VIDAL BORDES, Fco. Javier. (2000)
Introducción
7
que suponen el origen de las herramientas Web, aunque ambos desempeñan sus funcio-
nes ante colecciones documentales sensiblemente diferentes. Esto nos lleva a analizar los
factores internos y externos que influyen en la recuperación de recursos web. Al final del
apartado introductorio abordamos el tema de la evaluación de los sistemas de recupera-
ción, fundamentalmente de los buscadores de Internet, analizando experiencias previas
que recogemos en el estado de la cuestión, y que a su vez nos han servido para seleccio-
nar los indicadores utilizados en nuestra evaluación.
El segundo apartado se ocupa de explicar la metodología adoptada para la eva-
luación, dedicando el tercer apartado a exponer y analizar los resultados, de los que se
extraen las conclusiones que reflejamos en el apartado final.
9
1. Internet y la World Wide Web
1.1. La red Internet
La red Internet, cuyo término responde a la contracción de Internetworking of
computers, es una red de ordenadores conectados siguiendo una arquitectura distribuida,
que está formada por la interconexión de diversas redes de ordenadores de todo el mundo
que utilizan protocolos de comunicación TCP/IP y soporta diferentes tipos de platafor-
mas.
El Federal Networking Council (FNC) definió en 1995 Internet, como un siste-
ma de información global que está interconectado por un único espacio de direcciones
basado en el Internet Protocol (IP) o sus futuras extensiones o adiciones, capaz de sopor-
tar comunicaciones que usen el conjunto Transmission Control Protocol/Internet Protocol
(TCP/IP), sus futuras extensiones o adicione s y otros protocolos compatibles, y propor-
ciona, utiliza o facilita el acceso público o privado, a servicios de alto nivel basados en la
infraestructura de comunicaciones.
Nogales (1999a) recoge una definición m uy acertada del ISOC, en la que se
hace referencia no sólo a lo que es, sino tam bién a lo que supone. Así, Internet es una:
“red global de redes que permite a toda clase de ordenadores comunicarse y
compartir servicios de forma directa y transparente a través de buena parte del mundo.
Puesto que Internet es un potencial enormemente valioso que ofrece tantas posibilidades
para tantas personas y organizaciones, también const ituye un re curso global y compartido
de información y conocimiento, y un medio de colaboración y cooperación entre innume-
rables comunidades diferentes”.
Podemos destacar, por tanto, entre sus funciones básicas, el constituir un sistema
de comunicación y de información, lo que permite conectarse a la red, prácticamente des-
de cualquier ordenador personal, tanto para difundir com o para acceder a la inform ación.
1.1.1. Breve introducción histórica
Aunque no es objetivo prioritario de nuestra investigación tratar de la historia de
Internet, una visión histórica desde sus orígenes hasta la actualidad puede ayudarnos a
comprender mejor tanto el concepto y su situación actual, como la variedad de servicios
que la componen.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
10
1.1.1.1. Primeras investigaciones. Las redes y los protocolos
Existe en la actualidad un importante número de estudios dedicados a analizar la
red Internet desde distintos puntos de vista. El profesor Ubieto Artur (1995) y Alonso
Berrocal y otros (2004), en sus respectivas obras sobre el tema, dedican un interesante
capítulo a explicar la gestación del fenóm eno Internet.
La red Internet como la conocemos en la actualidad, es fruto tanto de la evolu-
ción de las redes y protocolos de comunicación, como de programas informáticos, y su
éxito a finales de los 80, coincide con la aparición de la Web y la adquisición de un ma-
yor carácter comercial, frente a su utilidad inicial, más relacionada con el ámbito militar
y científico.
Aunque no hay acuerdo unánime sobre la fecha que marca el inicio de Internet,
algunos autores la sitúan a inicios de los años 60 con Robert Taylor, director de la oficina
de técni cas de proceso de datos de ARPA 8 y del Computer Research Program, quien em-
pezó a investigar la posibilidad de conectar ordenadores de diferentes centros de investi-
gación. Poco después, en 1964 Paul Baran, de l laboratorio de in vestigación americano
RAND Corporation, desarrolla los conceptos de redes de comunicación distribuida, for-
madas por varios nodos interconectados sin que exista uno central, y de conmutación de
paquetes, que se des arrollarán más adelante en el seno de ARPA, financiando proyectos
de investigación dedicados a la informática, a la tecnología y al tratamiento de la infor-
mación. Los primeros frutos en la creación de la red darán lugar a ARPANET 9 en 1969,
constituyéndose en el elemento aglutinante de las investigaciones desarrolladas hasta el
mom ento y aún de las que tendrán lugar en años posteriores. Para Leiner (1997) los orí-
genes hay que situarlos en 1962, cuando Joseph Carl Robnett Licklider, del MIT (Massa-
chussets Institute of Technology), planteó la posibilidad de llevar a cabo una red interco-
nectada globalmente que permitiera el acceso desde cualquier lugar a datos y programas
desarrollando la idea posteriormente, con su paso a ARPA.
8 Institución americana dedicada al desarrollo de proy ectos de investigación que ha ido cam biando de nom-
bre varias veces consecutivas, entre AR PA y DARPA (Defense Advanced Research Projects Agency), que
es como se la conoce en la actualidad.
9 Inicialmente la constituyeron nodos localizados en la Universidad de California, Los Ang eles, (UCLA), el
Instituto de In vestigación de Stanfo rd, la Universidad d e California, en Santa Bárbara, y la Un iversidad de
Utah. La red ARPANET dejó de funcionar en 1991.
Introducción
11
Leonard Kleinrock también se ocupaba desde 1961 de desarrollar la conmuta-
ción de paquetes, método de telecomunicación que resultó fundamental y que llevado a la
práctica en 1967 por Lawrence G. Roberts, de DARPA, permitió conectar dos ordenado-
res remotos a través de la línea telefónica para el intercambio de datos.
Por otro lado, en el NPL (National Physical Laboratory), Donald Davies y Roger
Scantlebury se ocupaban a su vez de la investigación en redes de transm isión.
En 1972 se produce la primera demostración pública de la red a cargo de Robert
E. Kahn en la International Coference on Computer Communications, y ya en 1988, la
red Internet alcanza una mayor popularidad, con la creación de redes locales y privadas
que favorecerán la introducción de contenidos m ás variados, y de un uso más comercial.
Al margen de estos aspectos puntuales, respecto a la evolución técnica, un hecho
importante es la adopción en 1983 como estándar del conjunto de protocolos de comuni-
cación TCP/IP (Transmission Control Protocol/Internet Protocol) 10 , más seguro que su
antecesor NCP (Network Control Protocol). Esto, unido al desarrollo de las pasarelas
entre redes (Gateway), permitió la convivencia de distintas tecnologías y diferentes redes.
El trabajo fue f ruto de la colaboración e ntre Robert E. Kahn y Vinton Cerf de la Univer-
sidad de Stanford.
Los protocolos OSI (X.25, X.400, X.500) 11 , que se venían utilizando en la déca-
da de los 80 en las redes académicas y de investigación europeas, fueron sustituidos por
servicios basados en protocolos TCP/IP. De aquí que algunos autores sitúen en 1983 la
fecha de nacim iento de Internet, ya que es cuando se generaliza el uso de este protocolo,
cuyo nombre, además, contiene dicho término. De hecho, en los años 80 se observa un
gran interés en el desarro llo de redes e n universidades americanas (USENET, BITNET,
etcétera), que a lo largo de esta década irán uniéndose entre si, para favorecer el inter-
cambio de inform ación.
10 Siglas que significan Transm ission Control Protocol/Internet Protocol, que en 1978 sustituyen al Proto-
colo NCP (Ne twork Control Protoc ol) en el que se aprecian limitaciones.
11 Sanz considera las c onexiones que se realizaban desde el Departam ento de Ingeniería Telemática de la
Escuela Superior de Ingenieros de Telecomunica ciones de la Universida d Politécnica de Madrid con la red
EUnet, y a través de ella con la USENET americana, como pioneras en el uso de Internet desde Espa ña.
Los servicios que se obtenían se basaban en la m ensajería elect rónica y en grupos de noticias.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
12
La unión de ARPANET con otras redes, tanto americanas (NSFNet 12 a m ediados
de los 80 o la Nationa l Research and Education Net, NREN) 13 , como europeas (EUNet) 14
y de otros países asiáticos, además de la creación y conexión a finales de esta década, de
otras redes científicas regionales 15 , supuso un paso adelante en el desarrollo de la red, al
alcanzar contenidos y fines favorables a la docencia e investigación. ARPANET acabará
dividiéndose en dos redes, una de carácter m ilitar (MILNET) y otra para fines científicos
y de investigación (NSFNet).
Pese a la desaparición de la red A RPANET en 1988, Internet cuenta ya con una
gran popularidad, incrementada en los años nove nta, en los que se aprecia un gran interés
por conectarse de forma particular y acceder a los diferentes servicios soportados por la
red.
1.1.1.2. Los servicios y sus protocolos. Las primeras herramientas de re-
cuperación de información en Internet
La mayoría de servicios de la red utilizan la estructura cliente-servidor, que con-
siste en la existencia de un ordenador con una serie de programas que le permiten actuar
como servidor, al que el usuario se conecta desde el ordenador que contiene el programa
cliente, y mediante el cuál puede solicitar bien un documento, una información, un servi-
cio, etcétera. Para que la comunicación pueda producirse, ambos han de estar conectados
a la red. De aquí que el primer servicio de la red suponía perm itir la conexión entre dife-
rentes servidores.
El correo electrónico se venía utilizando desde 1972 gracias al trabajo de Ray
Tomlinson, que se ocupó de desarrollar un program a de gestión del correo. Posteriormen-
12 La National Science Foundation Network fue creada en 1985 conectando inicialm ente a cinco centros
estadounidenses, posibilitando poco después la conexión al resto de la co munidad científica.
13 Red que surg ió con objetivos claros de impulsar el uso y desarrollo de las nuevas tecnolog ías en el ámbi-
to educativo, a todos sus niveles, así como posibilitar la infraestructura necesaria para alcanzar e stos obje-
tivos.
14 En 1982, unía Ho landa, Dinamarca, Suecia y Reino Un ido. Inicialmente tiene carácter académico pasan-
do después a tener una dedicación más come rcial.
15 En Europa ex istían entre otras NORDUnet en lo s países nórdicos, INRIA en Francia , CNUCE en Italia,
UCL en Reino Unido y CWI en Holanda. En 1984 surgen JANET en Reino Uni do, DFN en Alem ania y
SUNET en Suecia. Dos años más tarde SURFnet en Holanda, en 1987 SWITCH en Suiza y al año sigui en-
te RedIRIS en España y GARR en Italia. (Sanz, M. A.)
Introducción
13
te se utilizó además para poner en contacto a equipos de personas que se inscribían en los
llamados Grupos de discusión y Listas de distribución o de correo 16 .
A finales de los años 70 se había creado, en el seno de la Universidad de Duke,
en Carolina del Norte, la red USENET 17 centrada en favorecer el desarrollo de los grupos
de discusión o Newsgroups 18 .
Los protocolos utilizados por estos servicios varían; así, el correo electrónico
utilizaba inicialmente el protocolo SMTP (Simple Mail Transfer Protocol) adoptando
posteriormente el protocolo MIME (Multipurpose Internet Mail Extensions) que se m an-
tiene en la actualidad, y que permite el enví o y recepción de ficheros con distintos forma-
tos. Dos nuevos protocolos de correo aparecen en los años 80, el POP (Post Office Proto-
col) que facilita la gestión del correo en los ordenadores personales y no en servidores
específicos como hasta entonces y el IMAP (Internet Message Access Protocol), interfaz
gráfica que mantiene los mensajes en el servidor. Las news utilizaron inicialmente el pro-
tocolo UUCP (Unix to Unix Copy), y desd e 1984 el protocolo NNTP (Network News
Transfer Protocol).
Aunque inicialmente estos servicios requerían programas específicos para acce-
der a ellos, por ejemplo LISTSERV y Majordom o para los grupos de discusión, actual-
mente son accesibles a través de la Web mediante los navegadores que se usan habitual-
mente.
Para localizar direcciones de correo se utilizaron tanto el programa Netfind, ser-
vidores WHOIS y los directorios X.500, que por problemas de actualización fueron per-
diendo interés, por lo que se derivó, hacia las llamadas “páginas blancas”, elaboradas con
direcciones electrónicas de particulares, con los datos enviados por los propios interesa-
16 En 1975 Steve Walker crea la primera Lista de correo ( mailing list )
17 Contracción de “ User’s Network” se refería tanto a la red como al servicio que a través de la línea telefó-
nica permitía el intercambio de información especializada mediante un programa de mensajería electrónica.
Posteriormente utilizó la red Intern et. Los mensajes se depositaban en un servidor a modo de tablón de
anuncios, por lo que podía ser consultado l ibreme nte.
18 El motor de búsqueda Google permite actualmente acceder a la base de datos de USE NET para realizar
búsquedas de documentación relacionada con estos grupos.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
14
dos, y las “páginas amarillas”, con direcciones de empresas. Podemos mencionar en este
sentido los directorios BigFoot 19 , Four11 20 y W hoWhere 21 .
Por otro lado, el servicio de transferencia de ficheros (FTP) entre ordenadores se
desarrolla en los 90 22 junto con la conexión Telnet a ordenadores remotos, si bien, los
orígenes del protocolo FTP se remontan a principios de los 70.
Se denomina File Transfer Protocol (FTP) tanto a la aplicación como al servicio
que permite la transferencia de ficheros entre ordenadores, facilitando a los usuarios au-
torizados (User FTP), realizar un intercambio de ficheros entre distintos ordenadores, y a
todo tipo de usuarios (anonymous FTP), la simple transferencia de ficheros al ordenador
propio. Los servidores FTP pueden contener documentos en formato ASCII (American
Standard Code for Information Interchange), PostScript, SGML, programas de ordenador
y ficheros de imágenes y sonido (García Camarero, 2001).
Para facilitar la búsqueda de ficheros en este tipo de servidores, se creó en 1990
Archie 23 , accesible al p úblico desde 1992. S u capacidad de búsqueda en un gran número
de servidores seleccionados es una de sus principales características. Constaba de una
base de datos, de actualización quincenal en la que se registraban los nombres de archi-
vos localizados en sitios FTP anónimos de Internet, otra de descripción del software, y un
sencillo interfaz que se debía configurar en cada conexión. Para aligerar su trabajo se
creó una red de servidores que contenían copias de la base de datos. Es te servicio se utili-
zaba fundamentalmente mediante una conexión Telnet, un cliente Archie o también a
través del correo electrónico 24 .
Su utilización mediante programas cliente de carácter gráfico como Wsarchie
facilitó en gran medida su mayor difusión. A pesar de todo, la capacidad de recuperación
de información seguía siendo lim itada.
19 Facilita las búsquedas de personas de EEUU. Puede accede rse a través de la Web en la dirección
http://Search.bigfo ot.com
20 Actualmente pertenece a Yahoo.
21 Actualmente lo controla Lycos.
22 Existe cierta confusión entre las fecha s que ofrecen determinados investigadores sobre estos servicios
debido a que se tra ta de sistemas que pueden tener su origen e xperimental en años anterior es pero que o
bien se dan a co nocer más tarde o bien es posteriormente cuando ad quieren interés o vigencia en la red.
23 Evolucionó al buscador ArchiePlex, siendo sustituido en la actualidad por el buscador FTPSearch (Ubie-
to, 2002).
24 Para más inform ación sobre el funcionam iento de estas herrami entas véase la obra de Gilster (1996).
Introducción
15
Para realizar una conexión Telnet se requiere una aplicación como NCSA Telnet
u otra similar, que permita la conexión de un ordenador a otro más potente o host, convir-
tiendo al ordenador que inicia la conexión en un Terminal, lo que hace posible la interac-
tuación entre ordenadores, la compartición de aplicaciones y la gestión de un gran núme-
ro de datos, por lo que este tipo de conexiones se utilizó desde un principio, fundamental-
mente para acceder a bases de datos y a catálogos de bibliotecas. En este sentido, hemos
de señalar la existencia de herramientas como Hytelnet (Hypertext browser for telnet-
accesible sites) 25 y LIBS 26 que facilitaban el acceso, mediante Telnet u otro tipo de co-
nexión, a los catálogos de un gran número de bibliotecas de forma directa o a través del
protocolo Z.39.50. Les caracteriza el facilitar la búsqueda de recursos mediante la nave-
gación a través de enlaces.
Importa destacar el hecho de que los lenguajes hipertextuales 27 comienzan a te-
ner aplicación en Internet. El siguiente paso en este sentido se dará con el sistema Gop-
her.
Según Paul Gilster (1996) el programa Gopher y la tecnología que le acompaña
aparecen en 1991 en el seno de la Universidad de Minnesota, en EEUU, como método de
organización y recuperación de información relacionada con esta institución, extendién-
dose posteriormente como sistem a de navegaci ón por la red, ya que permitía la conexión
entre distintos servidores de información mediante la activación de enlaces y el acceso a
diferentes recursos. Basado en la estructura cliente-servidor, soporta el protocolo y pro-
grama de consulta del mismo nom bre, con la peculiaridad de permitir el acceso a docu-
mentos en formato texto, imagen o sonido, pero de forma aislada, es decir, sin integrarlos
en un mismo docum ento.
La información disponible en este tipo de servidores se caracteriza por aparecer
organizada jerárquicamente por temas, con documentos que pueden estar alojados en un
25 Programa perm itía acceder no sólo a sesiones Telnet en determ inados servidores Telnet, Gopher, WAIS
y World Wide Web, s ino también a OPACS que no e ran accesibles a través de la W eb. El directorio Web-
CATS (http://www.li ghts.com /webcats/) siguió sus pasos entre 1995-2000 y en la actualidad se accede
desde el Directorio Libdex (http://www.libdex.com )
26 (Library Internet Browsing Software). Inform ación sobre este program a puede obtenerse en el trabajo de
Stanton y Hooper (1992).
27 Lenguaje que se est aba estudia ndo desde 1945 por Vannevar Bush, posteriormente por Ted Nel son que
lo aplica en la creación de textos no lineales. Dou glas Egelbart lo aplicó a textos en red.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
22
lenguaje HTML (HiperText Markup Language) y el protocolo de transmisión HTTP
(HiperText Transfer Protocol).
En 1993 la compañía NCSA (National Cente r for Superco mputing Applica tions)
y la Universidad de Illinois presentan Mosaic, un navegador de visualización gráfica que
soportaba plataformas con diversos sistemas operativos (MS W indows, Macintosh y esta-
ciones de trabajo UNIX con X- Windows) que evolucionará tras la denominación Naviga-
tor, a Netscape, actualmente Mozilla. En 1995 aparece la primera versión de Explorer, de
la compañía Microsoft. Desde entonces estos programas no han dejado de evolucionar y
en sus últimas versiones ofrecen, además de la propia herramienta de navegación, otras
utilidades como editores de páginas web, programas de acceso a News, al correo electró-
nico, al Chat, etcétera, permitiendo no sólo el acceso a servidores Web sino también co-
nexiones Telnet, Gopher, etcétera.
En los últimos años ha proliferado el uso de programas gráficos, de sonido, vi-
deo, multimedia y de comunicación en tiempo real. Así el popular Chat, término con que
se expresa la técnica conocida como IRC (Internet Relay Chat), utilizado desde 1988,
tiene su origen en lo que se conocía como Talk, que perm itía la comunicación en tiempo
real entre dos o más personas a través de m ensajes escritos. Internet Phone es otra herra-
mienta de este tipo, que facilita la comunicación mediante voz, siendo cada vez más utili-
zados otra serie de programas que facilitan el contacto audiovisual entre varias personas,
permitiendo servicios com o la videoconferencia. Las tecnologías relacionadas con la
imagen y el sonido, y su difusión a través de la red, como la tecnología multicast, basada
en el envío de imágenes y sonido a las máqui nas desde las que se solicita, pueden ser las
que obtengan un mayor desarrollo en los próximos años, ya que hasta la actualidad se han
visto limitadas por el insuficiente ancho de banda que las soporta. Para su visualización
se utilizan programas como NetMeeting de la compañía Microsoft, o bien otros de carác-
ter comercial com o CUseeMe, etcétera.
Por otro lado, hemos de señalar que la utilización del lenguaje HTML y la adop-
ción de sistemas gráficos ha permitido ir dejando atrás la utilización de com andos para la
consulta de bases de datos, siendo sustituidos por los denominados “botones” y otros
elementos de carácter hipertextual.
Finalmente, otros aspectos técnicos que han influido de form a notoria en el desa-
rrollo de la Web, fueron la evolución de los ordenadores personales, las redes LAN (Lo-
cal Area Network) y el desarrollo del Sistem a de Nombres de Dom inio (DNS).
Introducción
23
1.2.2. Características técnicas y problemas de la inf ormación en la
Web
La forma de acceder a los recursos que la Web ofrece es variada, pero general-
mente se realiza: por medio de la activación de enlaces a partir de una determinada pági-
na de inicio, técnica que forma parte del con cepto de “navegación” ya que permite ir de
una página a otra; por medio de los enlaces facilitados en los mensajes de correo o en
información de las News, etcétera; m ediante la introducción de una dirección URL (Uni-
form Resource Locutor) en la ventana prevista para ello que ofrecen los navegadores 39 ;
utilizando algunos de los portales especialmente diseñados para acceder a los servicios de
Internet, por ejem plo las páginas de la mayoría de universidades así como las dependien-
tes de empresas privadas como Terra, etcétera, o a través de búsquedas mediante sistemas
de recuperación de recursos, ya sean directorios, agentes de búsqueda, o buscadores.
Al conectarnos a cualquiera de los recursos alojados en los diferentes servidores,
en nuestro navegador aparece la dirección URL perteneciente al sitio, página o recurso
web. Estas conexion es son posib les gr acias a los servidores DNS (Domain Name Sys-
tem).
Los servidores DNS comenzaron a utilizarse en 1984 para facilitar la conexión
entre ordenadores. Constan de una base de datos distribuida que contiene nombres de
dominios de Internet que son traducidos a su correspondiente dirección IP 40 , que es el
número asignado a cada máquina conectada a la red. Aunque inicialmente a cada má-
quina o grupo de máquinas se le aplicaba un nombre de dominio, en la actualidad una
máquina puede tener varios dominios y un gr upo de máquinas contener una misma direc-
ción, como es el caso de servicios amplios.
Las direcciones de Internet contienen el protocolo (ftp, telnet, gopher, news,
http, etcétera), seguido de la dirección del ordenador al que nos queremos conectar, es
39 Actualmente determinados navegadores como Netscape y otros, han inc orporado a e sta ventana sus p ro-
pios motores de búsqueda, por lo que además de una direcci ón URL admite n la inserción de términos de
búsqueda q ue recuperan los d ocumentos o sitios web que los contienen.
40 La expresión consta de cuatro números separados entre ellos por un p unto, cuyos valor es van de 0 a 255
(por ej.: 199.72.1.1). InterNIC fue la pri mera em presa que se ocupó de la distribución de la num eración
tanto en el ámbi to americano com o en otros países, bien m ediante el contacto con enti dades responsables o
a través de empresas multinacionales.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
24
decir, el dominio del ordenador servidor. Este dominio está representado por una direc-
ción IP a la que corresponde un determ inado nombre de dom inio.
Los DNS que se utilizan en las conexiones Web constan de varios niveles. De
derecha a izquierda podemos observar que el primer nivel, no siempre presente, puede
represen tar al pa ís al qu e pertenec e el cará cter de l a información de l sitio we b. El res to de
niveles o subdominios contiene información sobre la institución que aloja las páginas
web y el nombre de la máquina (Hostname) en que se alojan. Por ejemplo, en Estados
Unidos, existen una serie de dominios genéricos de máximo nivel que indican el carácter
de la información que contienen, bien sea comercial (.com), militar (.mil), educativo
(.edu) o gubernamental (.gov) y otros más recientes relacionados con el ocio (.rec), in-
dustria aeroespacial (.aero), empresas (.biz), cooperativas (.coop), museos (.museum ),
etcétera. Algunos de estos se utilizan también en otros países, además de los dominios
geográficos relacionados con su nombre, por ejemplo .uk para Reino Unido, .fr para
Francia, .es para España 41 . Los recursos Web pueden ubicarse en diferentes directorios y
subdirectorios del servidor, lo que influye en que estas direcciones Web sean más o me-
nos amplias en función del nivel jerárquico de la carpeta en el que dicho recurso se en-
cuentra. Estos niveles suelen separarse mediante el signo slash “/” y se sitúan a la derecha
del primer nivel.
Estas direcciones siguen una organizan jerárquica. Una dirección genérica suele
acabar con la indicación del dominio de m áximo nivel, por ejem plo
http://www.unizar.es/index.html pero una dirección más específica puede contener a con-
tinuación los nombres de los directorios y subdirectorios en los que se encuentra un do-
cumento. Siguiendo el esquema anteriormente señalado, la dirección de la página Web
del Defensor Universitario de la Universidad de Zaragoza (http://www.unizar.es/defensor
_universitario/), aparece en primer lugar el protocolo (http) seguido por un primer bloque
hasta el primer signo de slahs que contiene de derecha a izquierda el nombre del dominio
de máxim o nivel (.es), al que precede el nombre del dominio de segundo nivel, relacio-
nado con la organización (unizar). Le sigue al bloque el nombre del directorio en el que
se encuentran las páginas de esta institución (/defensor_universitario/). Esta expresión
41 Existe una ord en ministerial, la número 6100 de 21 de m arzo de 2000 que regula en España el sistema de
asignación de nom bres de domini o.
Introducción
25
completa constituye la URL de la página principal de acceso a la información que ofrece
este servicio.
Las direcciones URL contienen pues el protocolo de comunicación o transmi-
sión, representado por el tipo de servidor (http, para documentos hipertextuales; ftp, para
ficheros o programas, etcétera); en segundo lugar el nombre del protocolo Internet sepa-
rado del anterior por dos puntos y dos barras (Ej.: ftp o www, aunque no siempre apare-
ce); el nombre del servidor o del dominio, tam bién conocido como host (Ej.: unizar.es) y
el nombre del directorio y de la página (/defensor_universitario/intermediainform a.htm).
Además los navegadores, en servidores que contienen una página de inicio, in-
terpretan que hay que abrir la mism a página independientemente de que se exprese este
término en su dirección. Así, se accederá al mismo recurso al teclear
http://www.unizar.es que http://www.unizar.es/inicio. Dicho aspecto lo hemos tenido en
cuenta a la hora de comparar distintos aspectos del rendimiento de los motores de bús-
queda, como son el solapamiento de recursos, cuyo cálculo se basa en la comparación de
direcciones URL idénticas.
Estas direcciones pueden estar formadas además por caracteres que para su codi-
ficación requieran una notación especial. Este problema aparece frecuentemente en los
multibuscadores, que añaden o sustituyen signos de las URL de los recursos por otros.
Por ejemplo es frecuente la sustitución del signo tilde “~”, que se utiliza para señalar di-
rectorios personales, por su valor codificado %7E. Su finalidad es evitar conflictos de
interpretación por los navegadores. En otras ocasiones añaden cadenas de términos en las
que se expresa una acción, por ejemplo “search=” o bien el signo de interrogación “? ”
junto a los parámetros de búsqueda.
Uno de los principales problemas que plantean los nombres de dominio, del sitio
y de la página es su falta de continuidad, es decir que se modifican cuando se cambia un
sitio o página web a otro servidor, o cuando se cambia el nombre del servidor o los nom-
bres de los directorios que contienen los sitios o páginas web, o simplem ente cuando la
página deja de existir. La no actualización automática de los enlaces que apuntan a estos
recursos provoca problemas de acceso. Para solucionarlo se han propuesto un URL 42 per-
42 Abreviatura de Uniform Resource Locator según las RFC (Request for Com me nts) 1738.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
26
sistente, el PURL (Persistent Uniform Res ource Locator) o el DOI (Digital Object Identi-
fier) promovido inicialmente por una asociación americana de editores. También hay
otras soluciones que están previstas en el software de mantenim iento de los sitios web,
aunque unas y otras propuestas no term inan de imponerse.
Cuando el navegador no localiza una dirección, devuelve al usuario un mensaje
de error, generalmente con un número. Así, el error 404 indica que la dirección es inco-
rrecta, el recurso no está disponible, ha cambiado de ubicación o ya no existe. El error
403 indica que el recurso no es accesible de forma libre. Otras incidencias pueden ser
debidas a que el recurso se encuentre demasiado solicitado en un determinado m omento o
que, por diversas circunstancias, se supere el tiem po de conexión.
En el ámbito internacional, el organismo que se ocupa de coordinar y gestionar
los nombres y números de los diferentes dom inios es el ICANN (Internet Corporation for
Assigned Names and Numbers) 43 . De la solicitud de dominios de segundo nivel, por
ejemplo (.com.es) se ocupa el DYNS (Dynamic Network Services) 44 o Red.es dominios 45
en el caso de España.
El acceso a los recursos generalmente suele ser libre y gratuito, siendo necesa-
rio, en algunas ocasiones, una simple inscripción. Otras veces el acceso es restringido y
puede exigirse el pago de una cuota o suscripc ión como es el caso de los sitios Web que,
por ejemplo, permiten el acceso a determinadas bases de datos y revistas electrónicas.
También hay servidores de acceso mixto que permiten la consulta y utilización libre de
una parte de sus recursos, limitando la consulta del resto. Estas limitaciones tienen tam-
bién sus repercusiones en los motores de búsqueda cuyas arañas no pueden acceder a
determinados recursos para indizarlos, por lo que son difíciles de localizar para el usua-
rio, de aquí que formen parte de la denominada W eb oculta.
Desde el punto de vista terminológico, los servidores Web contienen lo que se
denomina “sedes web”, const ituidas, además de por una URL, por un conjunto de pági-
nas web. Pueden formar parte de un único serv idor o de varios, aunque existen casos en
43 http://www.icann.org
44 http://dyndns.org
45 Entidad pública empresarial delegada p ara la gesti ón del registro de nombres de dominio en In ternet
bajo el código “.es”.
Introducción
27
que un mismo servidor aloja distintos sitios web. Codina (2000) las define como entida-
des digitales identificadas por una URL que contiene uno o m ás recursos.
Aguillo (1999) define la página web como fichero o conjunto de ficheros infor-
máticos que constituyen un documento en lenguaje de maquetación hipertextual (Hyper-
text Markup Language o HTML), es decir hipertextual y multimedia, identificable a tra-
vés de la red con un URL propio, una direcci ón e n l a Web. Una definición pos terior de
este autor (Aguillo 2000) matiza y aclara la anterior, al definirla como “unidad de visua-
lización que produce un navega dor WWW cuando interpreta una direcci ón URL de un
documento HTML o sim ilar con todos los ficheros asociados”.
Por tanto, una página web está formada por un fichero electrónico y los que lo
acompañan, bien en forma de imagen o sonido, y que además, y esto es más importante,
es identificable a través de un URL propio, por lo que, cada documento con dirección
propia es una página web.
Cada uno de estos componente s pueden ser documentos del tipo PDF (Portable
Document Format), Office, o imágenes de tipo JPEG (Joi nt Photographic Exp erts
Group), TIFF (Tagged Image File Format), P NG (Portable Network Graphics), o bien
imágenes en movimiento en formato MPEG (Moving Picture Experts Group), MOV-
Quicktime, AVI (Audio Video Interleave). Para sonidos se utilizan ficheros midi o WAV
(Windows Wave), entre otros. Los elementos integrantes tamb ién pueden presentarse en
formato comprim ido, generalmente en formato ZIP. La existencia de esta variedad de
documentos, se debe en parte a la fuerte presencia que en los últimos años están teniendo
los medios audiovisuales en la W eb.
Como hemos señalado, estas páginas se realizan generalmente mediante progra-
mas editores que utilizan un lenguaje de marcas denominado HTML (HiperText Markup
Language), del que existen diferentes versiones, o mediante el lenguaje XML (Extensible
Markup Language) más actual, derivados ambos de SGML (Standard Generalized Mar-
kup Language). Estas marcas permiten tanto formatear el documento y dotarlo de imáge-
nes y sonidos, que son ficheros con extensiones propias, como crear enlaces a diferentes
partes del documento o a otros documentos. Para ello utilizan los elementos propios co-
mo anclas y enlaces. Proporcionan además al documento una estructura que es aprove-
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
28
chada por determinados sistemas de búsqueda de información para elaborar sus índices,
extrayendo información de determinadas partes como el título, el cuerpo o las etiquetas
Meta 46 .
El lenguaje HTML se caracteriza por su fácil aplicación, lo que explica, en par-
te, el gran éxito de la Web en cuanto a producción de información. Sin embargo, como
aspectos negativos, hay que señalar que no facilita la descripción de los documentos,
pues un gran número de páginas se hallan desprovistas de algo tan básico para su locali-
zación como es el título, el autor o la filiación, por no mencionar uno de los aspectos a
los que a menudo se refieren los investigadores como posible solución a mu chos de los
problemas que plantean los motores en la recuperación de información: el mínimo uso de
los metadatos. Esta situación ha dado lugar al surgimiento de iniciativas que, aprove-
chando el lenguaje de marcas, permiten una descripción cuya finalidad es obtener unos
resultados más precisos en las búsquedas de información 47 .
El problema puede ser solucionado con la adopción de un nuevo modelo de re-
presentación de la información, el RDF (Res ource Description Framework), que admite
metadatos de recursos en XML y de otros lenguajes, así como de recursos que contienen
identificadores URI (Uniform Resource Identifiers). No sólo permite realizar una des-
cripción de la página web, de una parte de ella o de un recurso que la integre, sino que
también posibilita vincular conceptos, lo que va a permitir que las herramientas de bús-
queda preparadas para ello, recuperen información m ás precisa al facilitar el cruce de
datos y términos de diferentes índices 48 .
Los creadores de páginas web son conscientes de las limitaciones del lenguaje
HTML en cuanto a las posibilidades de ampli ación, de mejora en el diseño de las páginas
y de estructuración del propio documento y de la información. El lenguaje XML da ma-
yor importancia a las partes constitutivas del documento y a sus datos, lo que permite
46 Para más inform ación sobre la aplicación de este lenguaje en herram ientas de búsqueda puede consultar-
se el trabajo de Hu y otros (2001b).
47 En el ámbito de la Unión Europea hem os de destacar el proyecto Renardus basado en la utilización de
Metadatos que ha dado lugar a la existencia d el bus c ador del mismo nombre que permite recuperar recur-
sos de interés académico, principalmente en lengua inglesa. Utiliza diversos directorios de calidad y orga-
niza los recursos del directorio de acuerdo con la clas ificación de Dewey. Má s información puede obtener-
se en <http://www.renardus.org>
48 Para más inform ación véase Manola, F. y Millar, E. (2003)
Introducción
29
superar los inconvenientes del HTML, añadiendo ventajas como facilitar el desarrollo del
comercio electrónico y de la recuperación e intercambio de inform ación. En este sentido,
hay que mencionar la función de indización automática de la información contenida en
sus etiquetas, que le permite reconocer el tipo de información que contiene, es decir, si se
trata de un título, autor, palabra clave, etcétera. Dado que XML está basado en un están-
dar abierto, no hay problemas de incom patibilidad entre sistemas operativos. Finalmente,
otro lenguaje que se va imponiendo tras serle otorgado por el W3C 1999 el estatus de
“Recomendación” es XHTML que se caracteriza por sintetizar las ventajas de los dos
anteriores.
Al margen de estos aspectos que tratan de desarrollar y mejorar la W eb, es fácil
comprender el éxito de un medio que pone al alcance del usuario instrumentos de fácil e
inmediato acceso, que además permiten de forma sencilla la realización de todo tipo de
documentos, simples y complejos, y que además integra otros servicios de Internet como
el correo electrónico, consulta de noticias o news, descargas de program as y archivos,
etcétera.
La integración de diferentes servicios de Internet con sus respectivos servidores
se produce gracias a una serie de pasarelas que utilizan un software específico como es el
caso de CGI (Common Gateway Interface), ASP (Active Server Pages), y PHP (Hiper-
text Preprocessor) que añaden estas mismas terminaciones a sus páginas. La tecnología
plug-in que, mediante pequeños programas, f acilita la visualización de gran número de
elementos multim edia. Hay que señalar también por su importancia los programas que se
realizan con Java y VRML (Virtual Reality Modeling Language) especializado en re-
creaciones virtuales.
Es de destacar la facilidad de uso tanto de las aplicaciones necesarias para los di-
ferentes tipos de conexiones de Internet, com o de los programas navegadores, que facili-
tan el uso del resto de servicios de la red. En este sentido hemos de referirnos a pro-
yectos, como el Proyecto Oxígeno, que se lleva a cabo en el MIT y que trata de desarro-
llar tecnologías que faciliten la navegación. Este aspecto, junto con el desarrollo de la
Web semántica, a la que más adelante nos referiremos, y la tendencia hacia la integración
no sólo de diferentes utilidades de Internet, sino de un número menor de herramientas
con mayores capacidades y con la posibilidad de concentrar diferentes funciones, son los
aspectos que marcan el desarrollo de los últimos años de la W eb.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
30
Su expansión es tal que ya se puede conectar a ella a través de otras gamas de
aparatos distintas al ordenador personal, como son la televisión, el teléfono móvil o las
agendas electrónicas.
Por tanto, es un hecho que la Web está en continua evolución, lo que le confiere
un gran dinamismo que influye, como no podía ser de otro modo, en todo su contenido.
El éxito y acogida de la Web ha sido tal que está siendo cada vez más utilizada
por servicios de búsqueda y distribuidores de bases de datos 49 para ofrecer sus servicios
mediante éste sistema gráfico que facilita la interactividad. Lo mism o ocurre con las bi-
bliotecas, ya que ofrecen no sólo información y diferentes servicios como el acceso a sus
catálogos y bases de datos a través de servidores web, sino la consulta de documentos de
todo tipo en formato digital. Así, para Rodríguez (2002:178) la Web es “un servicio de
transferencia de información en línea que permite distribuir texto, im agen y sonido, posi-
bilita la comunicación, facilita la realización de transacciones y entretenimiento…”
La mayor parte de estudios que se refieren a la Web aluden a su carácter infor-
mativo. Pero ¿cóm o es la información que contiene? Para contestar a esta pregunta, anali-
zamos a continuación cómo esta dispuesta la información en la W eb y las características
más destacadas de las páginas web.
Uno de los aspectos fundamentales de la información en la Web, y a la que tal
vez en parte debe su éxito, es el carácter distribuido de la información, con recursos de
acceso totalmente libre y gratuito aunque, como hemos visto, existen otros de acceso res-
tringido, e incluso de pago. Podemos citar en uno y otro sentido el acceso a bases de da-
tos, a catálogos de bibliotecas y a revistas y libros electrónicos, así como a otro tipo de
documentos de carácter científico como son: publicaciones de congresos, tesis doctorales
y trabajos de investigación relacionados con todas las m aterias.
Otro de los aspectos destacables de la información en la Web, al que constante-
mente se hace referencia, es el gran número de documentos existente y en constante cre-
49 Muchas son las bases de datos, en su mayor parte de acceso restringido, que se ofrecen a través de Inter-
net. Para el campo de la Docum entación hem os de seña lar la incorporación de la base de dat os LISA del
Cambridge Scientific Abstracts, accesible a través de Internet Database Service en la dirección
http://www.csa1.co.uk
Introducción
31
cimiento 50 . Ello es debido a que en este medio, crear y dar a conocer la información es
tan sencillo, que cada vez es mayor el número de personas que publican documentos, no
siempre de buena calidad tanto en la forma como en el contenido. Por otro lado, existen
grandes intereses comerciales cada vez más patentes, lo que influye en la existencia de un
gran cúmulo de páginas de este tipo. No obstante hay que hablar también de la existencia
de una parte importante de documentos de alto nivel científico. Un estudio de Jiménez
Piano (2000), aporta datos en este sentido, al señalar que el 83% de la información de la
Web es de carácter comercial, frente a un 6% de carácter científico. Un trabajo posterior
de Lossau, (2004), estima en veintidós billones, el número de páginas de contenido cien-
tífico existentes en la Web, incluyendo a las existentes en la W eb Invisible.
Como vemos, los servidores web pueden contener información y obedecer a fi-
nes de lo m ás variado. Así, podem os observar la convivencia de servidores como los dis-
puestos por las universidades y centros de investigación, cuyo fin principal puede ser dar
a conocer información relacionada con la propia institución, y con la producción científi-
ca propia, con un marcado carácter de difusión de información y otros pertenecientes al
ámbito empresarial, con un enfoque más comerc ial. Otros se centran más en ofrecer una
serie de servicios, ya sea de localización y acceso a información específica, por ejemplo
sobre viajes, economía, etcétera, o a determinado software, material audiovisual, ocio,
etcétera. En este contexto, resulta llamativo el contraste entre la existencia de una amplia
variedad de recursos, que van desde los grandes y sofisticados servicios web, a los servi-
dores con simp les páginas de texto colocadas por usuarios a nivel particular. No obstante,
un estudio de Lawrence y Giles (1999) menciona el alto valor científico de los contenidos
de la web, lo que unido al relativamente bajo núm ero de servidores con este tipo de in-
formación, podría hacer viable la indización de la información de carácter científico.
Por otro lado, cada vez es más frecuente, que tanto los proveedores de las bases
de datos en línea como las grandes firmas distribuidoras de publicaciones periódicas a
texto completo, utilicen la Web para acceder, mediante suscripción, a sus servicios. Con
50 Delgado Martínez (2001) estimaba el núm ero de página s web en 1.200 millones. Otro estudio (Bergm an,
2001) señala la existencia de un billón de docum entos en la Web visible y 550 billones en 200.000 sitios
web de la Web oculta. Estim aciones más recientes para la web visible, recogidas por D . Sullivan (20 05),
señalan una cifra s uperior a 11,5 billones de páginas.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
38
de datos juegan un papel fundamental tanto el “diccionario de datos” que contiene toda la
información relativa a los campos de la base de datos, como el índice invertido, formado
por los términos que aparecen en los diferentes campos y por la información del docu-
mento que los contiene.
El segundo componente básico de estos sistemas lo constituyen los programas
de gestión y recuperación, en los que radican una serie de funciones fundamentales en la
recuperación tales como: soportar la lógica booleana, a través de las expresiones AND,
OR y NOT; operadores de proximidad como NEAR y ADJ; de presencia o ausencia, me-
diante los signos m odificadores (+) y (-); truncamientos mediante el signo asterisco (*) o
interrogación (?); perm itir la búsqueda por campos; redefinir una búsqueda y finalm ente,
facilitar una serie de técnicas como la ordenación o ranking, la equiparación exacta o
Best m atch, el uso de modelos de recuperación como los probabilísticos o vectoriales así
como técnicas de inteligencia artificial aplicadas a la recuperación de información.
Como tercer componente Moscoso señala el software de interfaz “que es el que
condiciona y determina la com unicación entre usuarios y el sistema”.
Lancaster (1979) y Kent (1971), de una forma más específica señalan las si-
guientes funciones de los SRI:
! Identificar la información relevante para el usuario.
! Analizar su contenido.
! Representar el contenido de forma que sea accesible mediante las consul-
tas del usuario.
! Analizar las consultas del usuario y en su caso transformarlas para con-
sultar de forma eficiente la base de datos.
! Permitir la búsqueda.
! Recuperar la información relevante.
! De ser necesario, permitir ajustes en la búsqueda para lanzarla de nuevo.
Estas funciones las llevan a cabo una serie de subsistemas que Lancaster deno-
mina subsistema documental, de indización, de vocabulario, de búsqueda, de usuario o
interface y subsistema de com paración.
Chowdury (1999:2), por su parte, señala tres subsistemas principales en los SRI:
el subsistem a documental, el de los usuarios y el de búsqueda/recuperación. Estos subsis-
temas se ocupan del análisis de documentos y organización de la información, es decir,
de la creación de la base de datos; de analizar las preguntas de los usuarios, de la búsque-
Introducción
39
da en la base de datos y de la recuperación. Para este autor, su objetivo es recopilar y
organizar la información de uno o más temas para facilitarla al usuario, tan pronto como
la solicite.
Schwartz (1998) señala que los usuarios de estos sistemas raramente entienden o
tienen en cuenta los mecanismos, y más raram ente aún, hacen completo uso de las capa-
cidades que facilitan las herramientas de búsqueda. Esto es así a pesar de que una buena
recuperación de información depende tanto de la pregunta como del buen m anejo de los
sistemas.
Desde el punto de vista histórico, debemos señalar que en la RI tienen lugar pro-
cedimientos tan tradicionales como el sistema de tarjetas perforadas, pero es a partir de
los años 50, con la aparición de los SRI Automatizados 69 (SRI) y más concretamente con
la generalización de los procesadores de texto a partir de los 70, cuando alcanzan una
mayor importancia, ya que estos nuevos sistemas van a ser utilizados tanto en bibliotecas,
para la descripción, clasificación y búsqueda de docum entos; en los archivos; en las bases
de datos en línea y en los CD-ROM. En esta década sitúa Moya (2002) el punto de parti-
da de la Moderna Recuperación de la Inform ación, que adquiere un gran auge en los años
80 con el desarrollo de técnicas avanzadas como la ordenación por relevancia y la indiza-
ción a texto completo. Para Salton, la Moderna Recuperación de la Información arranca
de 1955 en una primera etapa, marcada por el uso de bases de datos bibliográficas y refe-
renciales, que dura hasta 1975, fecha a partir de la que se ponen en práctica tanto técnicas
de recuperación desarrolladas en el periodo anterior, como son los modelos basados en el
espacio vectorial 70 y probabilístico, como nuevos lenguajes de búsqueda que facilitarán el
acceso directo al recurso buscado.
Dichas técnicas y modelos se irán aplicando a los SRI accesibles a través de In-
ternet adaptándose en unos casos y desarrollándolos en otros.
69 Cleverdon y Mills (1963) definen a los Sistem as de Recuperación de la Información com o una organiza-
ción completa para obtener, almacenar y facilitar inform ación. Les caracteriza además la existencia de
personal capaz de evaluar la información antes d e ofrecerla al solicitante así como la existencia de un índi-
ce de materias para facilitar la búsqued a.
70 Utilizado inicialmente por Salton en la evaluació n del Sistema Sm art.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
40
Posteriormente, con la aparición de la Web, se han ido probando continuamente
nuevos sistemas que han dado lugar a la existencia de un numeroso y variado número de
herramientas que tratan de hacer posible la RI.
De este modo, los antecedentes m ás directos de las actuales herramientas de bús-
queda web son los buscadores que se venían utilizando en Internet, a los que se les han
ido aplicando las técnicas resultantes de la investigación en el campo de los SRI, cuyo
desarrollo y mejora, a lo largo de los últim os años, ha sido constante. Así, las herramien-
tas web han heredado de aquellos sistemas sus capacidades de almacenamiento y recupe-
ración de información y han incorporado de la investigación aquellas técnicas que facili-
tan un mejor desarrollo de las funciones para las que han sido diseñadas. Podemos citar
en este sentido técnicas de recuperación como la equiparación (best-match), la Retroali-
mentación por relevancia (Relevance Feedback), que permite reformular las búsquedas y
la Clasificación automática (Data Clustering) con el fin de mejorar la recuperación. A
pesar de todo, y tal vez debido a que nos encontram os en el mom ento inicial de su puesta
en marcha, estas herramientas, presentan en la recuperación una serie de problem as, a los
que deben hacer frente y solucionar.
Abadal (2001) señala que el acceso y recuperación de la información en la Web
“descansa sobre sistemas informáticos, básicamente sistemas de gestión de bases de da-
tos, complementados con sistemas de navegación hipertextuales”. Esta frase sintetiza de
forma clara cuál es el nivel de desarrollo en el que se encuentran actualmente estos sis-
temas.
De acuerdo con el modo de navegación por la red, este autor clasifica las herra-
mientas de acceso y recuperación de la información de la siguiente forma: Sistemas de
navegación de tipo jerárquico, sistemas de navegación hipertextuales y SRI. De estos
sistemas nos interesan tanto los sistemas de clasificación de tipo jerárquico, dado que en
ellos la información se estructura jerárquicam ente en clases y subclases, como es el caso
de los Directorios, como los SRI, mediante los cuales se interroga a la base de datos por
medio de un motor de búsqueda en el que se insertan los términos sobre los que se quiere
obtener información, bien de forma aislada o mediante el uso de operadores y otras op-
ciones de búsqueda.
Esta variedad de sistemas da lugar a que la búsqueda de información en la Web
se realice principalmente por medio de dos técnicas: la selección de hiperenlaces y la
Introducción
41
interrogación de las bases de datos 71 . Algunos de estos sistemas, como AltaVista, Yahoo,
etcétera, integran los dos modos de búsqueda.
La consulta de las bases de datos de los buscadores se realiza, como en el resto
de sistemas, de varias formas: bien insertando el término o términos en la ventana de bús-
queda, ya sea de forma aislada o mediante operadores; realizando una búsqueda por fra-
se; utilizando el lenguaje natural o con la ayuda de un tesauro. El motor lanza la consulta
sobre el índice y presenta una página de resultados generalmente ordenados por relevan-
cia.
No obstante, hasta presentar los resultados, estos sistemas llevan a cabo con la
información que extraen o que se les proporciona, como en el caso de los metabuscado-
res, una serie de procesos, cuyo objetivo es facilitar, de forma rápida, la necesidad de
información planteada por el usuario.
El uso de estas técnicas, unido a otras características de estos sistemas, como
son la interactividad, deberían dar lugar a la formación de instrumentos válidos para re-
cuperar información relevante, pero el escaso tratamiento documental de la documenta-
ción existente en la Web, y otras características que presenta la información en este me-
dio, dificultan su efectividad. Por tanto debemo s pensar en los procedimientos relaciona-
dos con la descripción como una de las soluciones para la mejora del funcionamiento de
estas herramientas. En este sentido hemos de señalar el importante papel de los sistemas
de metadatos y las iniciativas de un gran número de bibliotecas, bases de datos y orga-
nismos como OCLC (Online Computer Library Center) que incorporan registros de re-
cursos electrónicos a sus catálogos, así como otras iniciativas en el seno de la Web que
constituyen auténticas bases de datos para recuperar recursos web.
2.2. Procesos de los SRI y s u repercusión en las herramientas de
recuperación Web
De todos es conocido que las bases de datos contienen registros formados por
los datos que almacenan. Estos datos son indizados, dando lugar a índices de palabras
71 Baeza-Yates y Riviero-Neto (1999) añ aden además una tercera técnica basada en la simple activación de
enlaces, para ir de un documento a otro
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
42
clave o de frases. En las bases de datos textuales o referenciales, sobre éstos índices se
lanza la búsqueda, con la intención de localizar los documentos o referencias que contie-
nen o se relacionan con los términos solicitados, siendo presentados en una pantalla de
resultados. De aquí que las funciones más impor tantes sean la formación de la base de
datos, la indización, la búsqueda y recuperación. Estas funciones se realizan de un m odo
relacionado, de ahí su carácter de sistema. Su adecuado funcionamiento les ha de permitir
alcanzar el fin para el que han sido diseñados: recuperar la información precisa. De aquí
que la recuperación de inform ación haya adqui rido una gran importancia ya que se ocupa
tanto de la representación, de la organización y del acceso a la información. (Abadal y
Codina, 2005:29).
A continuación nos referimos, de forma breve, a cada una de las funciones que
se desarrollan en estos sistemas, para ponerlos en relación con los SRI de la W eb.
2.2.1. Formación de la base de datos
La formación de las bases de datos se lleva a cabo de acuerdo con una serie de
principios como puede ser el carácter científico de la información que contienen, así co-
mo los propios de las empresas gestoras y creadoras de dichas bases de datos, que deci-
den dedicarse a compilar información de uno o má s temas. La cobertura tiene que ver con
su contenido y ha de posibilitar la obtención de un conjunto, lo más completo posible, de
referencias, y en su caso documentos, sobre el tema de búsqueda. Como indica Abad
(2004:98) puede verse influenciada por otros aspectos como: “el periodo de tiempo sobre
el que el sistema puede proporcionar información retrospectivamente (cobertura tempo-
ral), la procedencia geográfica (cobertura geográfica), los idiomas en los que están escri-
tos los documentos (cobertura idiom ática) y el tipo de documento (libro, inform e, carta) ...”
En la evaluación de bases de datos, indicadores para valorar la cobertura son el
alcance y continuidad de los contenidos, la exhaustividad de la cobertura, la exclusividad
de la cobertura o solapamiento y la puntualidad en la actualización del sistema de infor-
mación (Abad, 2004).
La formación de la base de datos es uno de los aspectos más importantes en las
herramientas Web. Los motores de búsqueda básicamente contienen la información que
han ido obteniendo las arañas de los servidores Web, desplazándose, a través de enlaces,
a las páginas de interés. Otra parte es fruto de los envíos de información sobre determi-
nadas páginas por parte de sus creadores o responsables. El número de consultas es tan
Introducción
43
amplio que hace necesario la existencia de distintas versiones de sus bases de datos, a las
que denominan espejos o m i rrors, que al alojarse en diferentes dom inios pueden presentar
variantes en función del país al que pertenece dicho dom inio.
En la Web se utilizan diferentes métodos para calcular la cobertura de los busca-
dores. Bharat y Broder (1998) mencionan el Melee’s Indexing Coverage Analysis
(MICA), basado en el recuento de páginas web por dom inio y, por otro lado, el utilizado
en el sitio web especializado en analizar motores de búsqueda conocido como Search
Engine Watch 72 que reali za esta funci ón a través del motor Seach Engine EKG y propo-
nen otro m étodo basado en análisis estadístico, llevándolo a cabo m ediante el lanzamien-
to de dos tandas de diez mil consultas cada una. Según estos autores, este método no pro-
porciona valores absolutos sino estimados y a partir de ellos se llega a valorar el número
de documentos existentes en la W eb.
2.2.2. El análisis documental
Como señalan Peña y otros (2002:212) el análisis documental consiste en:
La selección, almacenamiento y organización de ideas informativamente rele-
vantes para facilitar su localización posterior. Incluye técnicas tradicionales de la docu-
mentación como catalogación, indización, clasificación y resumen; y no tradicionales
como indización automática, extracto automático y evaluación de concordancia ( mat-
ching , en terminología inglesa).
Estas técnicas se agrupan en lo que se denomina análisis formal y de contenido,
formando parte del primero la catalogación o descripción bibliográfica y del segundo la
indización, clasificación y resumen.
2.2.2.1. La descripción
La descripción de un recurso o documento trata de representar, mediante un re-
gistro, dicho recurso, que al formar parte de una base de datos, permite su recuperación e
identificación.
72 http://www.searchenginewatch.com
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
44
En los sistemas de recuperación modernos, la estructuración de la información
en campos facilita considerablemente la recuperación. Sin embargo, en el ámbito de los
motores de búsqueda de la W eb, el análisis formal es prácticamente inexistente, ya que la
mayoría de recursos carecen de elementos descriptivos, o bien, la metainformación que
pueden contener tanto los documentos com o los registros, no es tan descriptiva ni está tan
normalizada como la que por ejemplo caracteriza a la catalogación bibliográfica o a la
descripción de registros de bases de datos.
No obstante cada vez están adquiriendo mayor im portancia sistemas de metada-
tos que tratan de hacer frente a este problema como Dublin Core, TEI, etcétera, aunque,
la mayor utilización del lenguaje XML y de sistemas como RDF, basado en su sintaxis,
ha de contribuir a obtener una recuperación m ás precisa.
2.2.2.2. Indización
El diccionario de Documentación define la indización como:
“Técnica del Análisis Documental que describe y representa el contenido de las
fuentes de información documentales mediante un número limitado de conceptos extraí-
dos del texto de los documentos (palabras clave) o de vocabularios controlados (clasifica-
ciones, listas de materia, tesauros), que van a permitir el control y la recuperación de la
información de un conjunto documental dado.”
Consiste en asignar al documento una serie de términos o descriptores, que ex-
presan su contenido, con el fin de facilitar su localización y acceso. Esto se puede hacer
partiendo de un índice de clasificación ya elaborado (lenguaje precoordinado) o bien, en
el caso de la indización basada en el lenguaje libre (lenguajes postcoordinados), en el que
los propios términos permiten elaborar el índice. El uso de un lenguaje u otro da lugar, en
el primer caso, a la indización elaborada, y por otro, a la indización libre, siendo esta úl-
tima la m ás habitual entre los motores de búsqueda de la W eb. Este tipo de indización es
más am plia al superar la indización basada en el contenido.
Por otro lado, como indica Lancaster (1998), la indización puede ser exhaustiva
o específica. Aunque la primera trata de utilizar el mayor número de descriptores de un
documento, en la Web, se ve superada por el funcionamiento de los buscadores que indi-
zan a texto completo. La específica, por su parte, trata de expresar de forma más concreta
el contenido del recurso. Puede ser realizada por personas o bien de form a automática. En
las herramientas de búsqueda se utilizan ambos tipos de indización, correspondiendo la
primera a los directorios y la segunda a los buscadores.
Introducción
45
Como señala Delgado (2001) la indización automática utiliza varios modelos
que han sido recogidos por Ingwersen (1994) a los que denomina: unitérmino, en el sen-
tido ya asignado por Taube a mediados de siglo; unitérmino ponderado; unitérmino en
contexto, pr incipalmente utilizado e n la realización índices KWIC y KWOK, y finalmen-
te la indización estructurada, que como indica Vianello (2004:240) “La representación
resultante puede ser expresada a través de espacios vectoriales o clustering.”
Caracteriza a la indización automática la aplicación de determinados algoritmos
que tienen como finalidad representar lo más fielmente posible el contenido del docu-
mento para facilitar su recuperación.
En la indización automática los términos y frases que se extraen, no siempre son
representativos sino que más bien son indicativos de que los documentos contienen di-
chos términos, lo que unido a la no utilización de sistemas estructurados, da lugar a un
exceso de ruido en la recuperación.
Para evitar este problema, y también para facilitar la ordenación por relevancia,
a estos términos se les aplican una serie de valores como pueden ser los basados en cálcu-
los de frecuencias que otorgan un peso a un térm ino en función de su frecuencia en el
documento o en la base de datos. Los cálculos se basan en la ley de Zipf, posteriormente
desarrollada por otros autores como Gerard Salton (1983), Rijsbergen (1979) y otros,
dando lugar a conceptos como el de “ponder ación de frecuencia inversa de un documen-
to” (FID o IDF en el ámbito anglófono) y “frecuencia absoluta de un término” (FT o TF),
que en ocasiones se utilizan de forma combin ada. Los cálculos son asignados a los térmi-
nos que finalmente representan el contenido del documento para favorecer tanto la recu-
peración de documentos relevantes com o su ordenación.
Las técnicas aplicadas a la indización tienen pues como finalidad, permitir se-
leccionar los documentos más representativos en relación con la ecuación de búsqueda y
colocarlos en los primeros puestos de la lista de resultados. Es decir, tratan de proporcio-
nar la mayor precisión en los resultados. Le Loarer (1994) distingue entre indización pla-
na, cuando todos los términos que se extraen tienen igual im portancia; ponderada, cuando
se da mayor importancia a unos términos que a otros; por roles o facetada y estructurada.
Dejando al margen ésta últim a, a la que acabamos de referirnos, la indización por roles,
según Vianello (2004) requiere para su correcto funcionamiento su aplicación a dominios
específicos que permitan apoyarse en repertorios terminológicos muy especializados. De
aquí que su aplicación a los buscadores generales de la W eb ofrezca grandes dificultades.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
46
El resultado de este proceso es la generación de un índice invertido, que se utili-
zará en la recuperación, aunque como esta autora indica, su elaboración puede realizarse
siguiendo diferentes técnicas: técnica del fichero inverso, los ficheros de patrones de bits,
árboles de PAT y grafos.
Por otro lado, el gran desarrollo alcanzado en los últimos años en el campo de la
lingüística computacional por la semántica léxica se ha hecho notar como señala Vianello
(2004:244) en los sistemas de recuperación mu ltilingüe; en la elaboración de resúmenes
automáticos; en la aplicación de clasificaciones documentales y en la traducción automá-
tica. Fruto de todo ello son los analizadores lingüísticos que permiten analizar docum en-
tos electrónicos para extraer información muy útil de cara a su localización. Otras herra-
mientas que son fruto del desarrollo de la investigación en este campo y que ya empiezan
a utilizarse en el ámbito de la Web son las ontologías, que a grandes rasgos podemo s de-
cir que se dedican a la clasificación no de términos sino de conceptos. Vianello
(2004:249) menciona en este sentido las iniciativas denominadas FrameNet 73 , proyecto
de la Universidad de Berkeley y WordNet 74 . En España estudios de este tipo se están
llevando a cabo por Subirats y Petruck, de la Universidad Autónom a de Barcelona.
2.2.2.3. Clasificación
Según el Diccionario de las ciencias docum entales, clasificar es:
“la operación que consiste en agrupar uno o varios elementos en un conjunto o
clase en virtud de al menos una propiedad o atributo que tienen en común.”
En el ámbito de las Ciencias de la Documentación, la citada obra define la clasi-
ficación bibliográfica o documental com o:
“la operación de agrupar los documentos según su tema –clasificación biblio-
gráfica- o su contexto de producción –clasificación archivística.”
Para su realización se requiere un sistema o esquema de clasificación anterior-
mente establecido.
73 http://www.icsi.berkeley.edu/~framenet/
74 http://www.cogsci.princeton.edu/%7Ewn/
Introducción
47
Algunos de los problemas que presenta la indización libre pueden resolverse
bien con la indización controlada o con los lenguajes clasificatorios. De aquí que en des-
cripciones bibliográficas se utilicen am bos.
La Clasificación es un tipo de indización controlada, ya que requiere de la exis-
tencia de un índice clasificatorio. En el ámbito bibliográfico se han venido utilizando
fundamentalm ente las clasificaciones decimales como la Universal Decimal Classifica-
tion (CDU), la Dewey Decimal Classifica tion (DDC) y la Library of Congress Classifica-
tion (LCC).
A efectos de indización, entre sus características destaca el carácter unívoco de
sus elementos, es decir, un elem ento clasificatorio significa una cosa, y sólo una.
En las herramientas de recuperación de la Web, la clasificación se utiliza fun-
damentalm ente en el ámbito de los Directorios y de las bibliotecas electrónicas para or-
ganizar los recursos de forma temática. El problema es que unos y otros aplican clasifica-
ciones de elaboración propia, alejándose de la idea de universalidad.
Los motores de búsqueda, en muchos casos incorporan directorios temáticos,
bien de elaboración propia o por empresas asociadas, cuyo uso se ha ido haciendo más
problemático a medida que han ido aumentando los contenidos de la web. No obstante,
existen directorios que utilizan mecanismos automáticos para clasificar los recursos o
páginas web 75 .
2.2.2.4. El resumen
Las definiciones de este término que ofrecen diferentes autores y que recoge el
Diccionario de las Ciencias Documentales tienen en común el referirse a él com o:
“la representación concisa, en lenguaje del autor, de las ideas principales del
documento original analizado, evitando cualquier apreciación o juicio crítico”
La realización de resúmenes se ha venido efectuando tradicionalmente por per-
sonas especializadas, fundamentalm ente del campo de la documentación así como por los
75 Véase como ejem plo el directorio Scorpion accesible en la dirección <http://orc.rsch.oclc.org:6109>
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
54
deficiente recuperación de información en este medio. Estudiaremos a continuación, tras
una breve introducción histórica y un análisis de sus principales com ponentes, cómo los
buscadores se enfrentan a este y otros problem a y las soluciones que han ido planteando.
2.3.1. Orígenes de los principales motores de búsqueda y metabus-
cadores
Al tratar de Internet en la parte inicial del capítulo, nos hemos referido a algunas
de las primeras herramientas de búsqueda que se utilizaban para recuperar información
de la red. Dichas herramientas se consideran los precedentes inmediatos de las utilizadas
en la Web.
Resulta interesante observar la evolución de estas herram ientas, ya que podemos
apreciar cómo a lo largo de este proceso se han ido fraguando gran parte de las caracterís-
ticas que actualmente mantienen tanto los directorios como los mo tores de búsqueda más
utilizados actualmente, y lo que es más importante, cóm o cada una de estas herramientas
trata de solucionar los problemas que se les van planteando en relación con la recupera-
ción de información.
En este sentido, hemos de hacer notar, que desde los comienzos de la Web,
aprovechando su carácter hipertextual, en los sistemas de búsqueda se adoptaron las téc-
nicas de búsqueda basadas en la activación de enlaces o navegación. Esto dio lugar a la
creación en 1994 de directorios de elaboración manual como EINetGalaxy 79 que contenía
principalmente recursos Telnet y Gopher, o GENVL (Generate Virtual Library) aunque
ambos con un número muy limitado de opciones de búsqueda de recursos y con proble-
mas de actualización.
En 1995 apareció el directorio Yahoo (Yet Another Hierarchical Officious Ora-
cle), que basaba la formación de su base de datos en el envío por parte de los interesados,
de información sobre webs tem áticas o páginas web particulares, aplicando posteriormen-
te programas rastreadores, aunque las páginas seguían siendo analizadas y clasificadas
por especialistas. Este aspecto, unido a un mayor desarrollo de las clasificaciones, supuso
un claro avance respecto a los anteriorm ente señalados.
79 http://www.galaxi.com
Introducción
55
Les siguieron otras iniciativas dirigidas hacia la especialización por materias de
estas herram ientas com o es el caso de SOSIG 80 para ciencias sociales, EEVL 81 para inge-
niería y Biz/ed 82 para ciencias económ icas y empresariales.
Los directorios, en muchos casos, iban acompañados además por formularios
que permitían la búsqueda en sus índices.
Los SRI web, basados fundamentalmente en la utilización de este último modo
de búsqueda, tienen como antecedentes, en el ámbito de la Web, a los motores Harvest 83
y ALIWEB 84 (Archie-Like Indexing of the WEB). Basados en el sistema WAIS, son los
más claros antecedentes de los actuales motores de búsqueda, aunque se vieron inmedia-
tamente superados por los primeros buscadores, como es el caso de World Wide Web
Wanderer, caracterizados por el mayor uso de los programas araña o spiders, que se utili-
zaban como medio fundamental para la form ación de las bases de datos de direcciones
URL.
Wanderer, World Wide Web Worm , JumpStation 85 y Repository-Based
Software Engineering (RBSE) surgen a finales de 19 93. Fr ente a la ordenaci ón ale atoria
de los registros que ofrecían los dos prim eros, el tercero ya aplicaba un mecanismo basa-
do en la relevancia. (Sonnenreich, 1997).
Pronto se pensó en la posibilidad de consultar de form a simultánea estas bases
de datos, y así, en 1994 se realiza el primer proyecto de creación de un m etabuscador, al
que se denominó GIOSS (Glossary-of-Servers Serv er), al que siguió el sist ema D iscover,
que permitía buscar en más de 500 servidore s WAIS. Un año más tarde, Bri an Pi nkerton,
de la Universidad de Washington, crea una herramienta de escritorio que dará lugar al
80 http://sosig.ac.uk
81 http://www.eevl.ac.uk
82 http://www.bized.ac.uk
83 Fue cancelado en agosto de 1998 (Am at 1999b).
84 Lanzado en 1993, actualmente carece de mantenimiento. Se basaba en la formación de índices mediante
la información aportad a por los prop ios responsables del web. Más información sobre ambos buscadores
puede consultarse en: KOSTER, M. ALIWEB ( Archie-Like Indexing of the Web). Computer Networks
and ISDN Systems , vol . 27, 1995: pp. 175-182, y sobre Harvest véase Bowm an, C. y otros. The Harvest
information discovery and acces system. Computer Ne tworks and ISDN Systems , vol. 28, 1995: pp. 119-
125.
85 Considerado el primer buscador para autores com o Jenkins y otros.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
56
metabuscador WebCrawler 86 , caracterizado por incorporar la indización a texto comple-
to.
En el seno de la Universidad Carnegie Mellon, surge en 1994 el buscador Lycos,
que desarrollará los sistemas existentes y ampliará la capacidad de sus bases de datos
indizando una gran cantidad de páginas, con lo que adquirió cierta importancia. En 1995
se lanzan InfoSeek 87 y Excite, que tiene sus orígenes en el proyecto denominado Archi-
text, caracterizado por recuperar, además, recursos relacionados con los términos de bús-
queda.
También en 1995 surg en Northern Light 88 y AltaVista 89 . Sonnenreich (1997) se-
ñala que éste último destacaba por su rapidez, por permitir tanto el uso del lenguaje natu-
ral como de operadores booleanos, así como búsquedas en las news, recuperación de
imágenes con texto y la búsqueda en determinados campos como el de título. HotBot e
Inktomi se lanzan en 1996 destacando el primero por su capacidad al indizar más de diez
millones de páginas diarias y el segundo por elaborar un directorio de forma automática
con la intervención humana para valorar la calidad de sus recursos. Les siguieron Ask-
Jeeves en 1997 y Google en 1998. El primero se caracteriza por permitir realizar pregun-
tas directas y el segundo por el hecho de presentar resultados relevantes ordenados me-
diante técnicas basadas en el análisis de enlaces.
En 1999 aparecen el motor de búsqueda AllTheWeb, que además de una mayor
calidad en la recuperación de recursos, aportó la inclusión de recursos que dependían de
otros, y el directorio Open Directory que pronto facilitará asistencia a la mayoría de bus-
cadores importantes como AltaVista, AO L Search, Dogphile, HotBot, Lycos, MetaCraw-
ler y Netscape (Sherman, 2000).
En el año 2000, surge Teoma que será a dquirido por AskJeeves al año siguiente.
Este buscador plantea una mayor selección de recursos, facilitando la intervención de
expertos que proponen y valoran recursos específicos.
86 http://metacrawler.cs.was hington.edu:8080/ home.htm l
87 Actualmente Go.
88 Actualmente de pago.
89 Fuera de servicio en la actualidad.
Introducción
57
De form a simultánea se siguieron desarrollando listados de recursos organizados
por temas, que dan lugar a valiosos instrumentos de recuperación como el World Wide
Web Virtual Libray 90 , primera lista alfabética de materias puesta a disposición del públi-
co por el CERN, el BUBL 91 Subject Tree, NISS Information Gateway 92 y Galaxy 93 , al-
gunos de los cuales, como indica Winship (1995) llevan asociado el modo de búsqueda
por palabras clave.
La tendencia en los últimos años ha seguido siendo la creación de múltiples
herramientas de búsqueda. Es de destacar el desarrollo de herramientas especializadas
tanto en una materia, como en ámbitos territoriales o lingüísticos. En este sentido debe-
mos mencionar la aparición del metabuscador SurfWax 94 que no sólo permite dirigir las
búsquedas a un campo especializado, sino que se constituye como herramienta de bús-
queda en diversas fuentes, incluidos algunos contenidos de la W eb invisible como pueden
ser las bases de datos.
Los buscadores no han permanecido estancados a lo largo de su existencia sino
que, como hemos observado, se trata de herramientas en constante evolución, que gene-
ralmente han ido haciendo frente a los problemas que se les plantean mediante la incor-
poración de nuevas posibilidades de búsqueda, de técnicas de indización, de recuperación
y de ordenación de resultados. Especial menc ión merece el desarrollo alcanzado en técni-
cas de análisis de enlaces, pues además de Google lo utilizan HotBot, Excite o Clever 95 .
IBM quiere ir más allá y está desarrollando un programa que permitirá a los robots reco-
rrer la red, evitando los sitios irrelevantes 96 .
Otro aspecto a considerar es el que tiene que ver con la trayectoria de estas
herramientas, ya que los motores de búsque da no sólo han venido aumentando sino que
también se han dado casos de desaparición o han sido absorbidos por otros, como en el
caso de W orld Wide Web Worm, anteriormente citado o el de OpenText, que se especia-
90 http://vlib.org
91 http://bubl .ac.uk
92 http.//www.niss.ac.uk
93 http://www.galaxy.com . Adquirido en 2001 por First Search
94 http://www.surfwax.com
95 http://www.alm aden.ibm.com /cs/k53/clever.html
96 El programa se llam a Focused Crawler, caracterizado por efectuar análisis de enlaces. Se puede incorpo-
rar a los buscadores añadiéndoles más funcionali dad.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
58
lizó en información económica y financiera bajo la denominación Livelink Pinstripe has-
ta su desaparición; o como Northern Light que ha pasado a ofrecer sólo su colección es-
pecial de pago. Otros casos de absorción más recientes son los de AltaVista y AllT-
heWeb 97 . HotBot y Excite, se han convertido en m etabuscadores.
En la mayoría de casos, los motores de búsqueda tratan de obtener un rendi-
miento comercial mediante la inclusión de publicidad en sus páginas o utilizan otras
prácticas comerciales como asegurar la aparición de páginas web en los primeros lugares
del listado de búsquedas o en un lugar destacado junto al resto de recursos recuperados.
Buscadores como Lycos ofrecen en sus contratos, además su inclusión en los índices de
otros buscadores que utilizan su base de da tos, rápida indización, permanencia asegurada
en los índices y actualización del contenido. Por otro lado, pueden asegurase también una
serie de ingresos mediante técnicas com o el pay per click 98 .
Este carácter mercantil va a jugar un papel muy importante en el funcionamiento
de los motores ya que da mayores posibilidades de recuperación a empresas que pagan
por ser fácil y rápidamente localizables sus productos, en detrimento de una recuperación
de mayor precisión e interés científico.
Hay que tener en cuenta además la exis tencia de buscadores como AllTheWeb e
Inktomi, que facilitan sus índices, para ser utilizados por otros buscadores como Lycos,
HotBot, Terra.com, Overture, Infospace, Excite y Dogpil e, en el caso del primero de los
buscadores y el segundo a HotBot, About.com , MSN, Espotting.com, LookSmart, Sone-
raplaza, Goo y Bluewin 99 , asegurando la visibilidad en el 70% de las búsquedas.
Otra característica actual es el estableci miento de alianzas, compras y ventas,
para compartir bases de datos. El directorio Yahoo controla desde marzo de 2003 Inkto-
mi 100 , y desde octubre del mismo año, Lycos y Ho tBot y Ov erture (que a su vez había
comprado Go, AltaVista y AllTheWeb).
97 AllTheWeb fue absorbido en 2004 por Overture, que a su vez l o adquirió Yahoo!. AltaVi sta tam bién fue
absorbido por la mism a compañía en 2003 y desde 2004 utiliza la m isma base de datos de Yahoo!.
98 Técnica comercial que consiste en que las compañ ías q ue lo contratan paga n un canon a los buscadores
cada vez que un usuario accede a su página web al activar un enlace de la página de resultados de la bús-
queda realizada.
99 Datos que ofrece Lycos en http://insit e.lycos.com /inclusion/se archenginessubm it.as [Consultado en m ayo
de 2004].
100 Inktomi previam ente colaboró con MSN y HotBot.
Introducción
59
AskJeeves compró los buscadores Teo ma en 2001, pasando a denominarse Ask,
y Excite, que es actualmente un metabuscador que utiliza recursos proporcionados por
Google, Yahoo, AllTheWeb, Inktomi, AskJeewes y l os directorios LookS mart, Ab out,
Open Directory, Teoma y Overture.
Además, estas fusiones pueden dar lugar, como en el caso de Yahoo, a la forma-
ción de nuevas herramientas de búsqueda más potentes, como es el lanzamiento de su
nuevo motor de búsqueda YahooSearch.
Este carácter dinámico tanto en lo técnico, con la continua incorporación de
nuevas técnicas de mejora en la búsqueda, como en lo empresarial, con continuos conve-
nios, compras y ventas entre ellos, exigen tanto al usuario como al especialista en RI un
conocimiento actualizado de su evolución ya que es primordial para saber, en función de
estas fusiones, a cuáles se les está dando una mayor importancia, cuál la puede ir per-
diendo, etcétera. Exigen además la necesidad constante de replantearse m odificaciones en
la evaluación de motores de búsqueda y su realización de forma periódica para poder
constatar los cam bios que les afectan. Otro tema es la interpretación de el porqué se pro-
ducen estas fusiones y compras. Desde nuestro punto de vista se trata de hacer frente al
continuo desarrollo de determinadas herramientas que, por sus prestaciones, minim izan
las existentes, por lo que la única manera de hacerles frente es mediante la ampliación o
unión de las más pequeñas. También las mayores exigencias tanto de software como de
hardware, hace que sea necesaria una continua inversión que no todas las empresas pue-
den soportar.
Google, junto a Yahoo y MSN, son los motor es en los que s e aprecia una mayor
expansión que en los últimos tiempos, incorporando el primero de ellos nuevos espacios
de búsqueda como Google Scholar 101 , para recuperar principalmente información de ca-
rácter científico, Google Plans, para búsquedas de carácter geográfico 102 , y en la actuali-
dad se encuentra desarrollando un proyecto de digitalización de 15 millones de libros
impresos entre 1850 y 1950 existentes en 4 bibliotecas americanas, una británica y otra
española.
101 La versión beta de esta herramienta pue de consultarse en http://scholar.google.com
102 Se accede a la versión beta en la dirección: http://maps.google.com
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
60
En la actualidad, como señala Chaín (2004), se están utilizando otras técnicas
avanzadas de búsqueda que se basan en Algoritmos Genéticos y en la inteligencia artifi-
cial aplicada al procesamiento del lenguaje natural, enfocados a mejorar la interacción
hombre-m áquina y que posiblemente sea la tecnología que en los próximos años acabe
implem entándose en los nuevos sistemas.
2.3.2. Definición y clasificación
Chowdhury (1999) define de forma genera l a los buscadores como un servic io
de recuperación de información que consiste en una base de datos, que contiene princi-
palmente recursos disponibles en la Web. En un trabajo publicado en 2001 distingue en-
tre Motores de búsqueda, Directorios, Bibliotecas virtuales y Bases de datos especializa-
das.
Poulter (1997) por su parte, aporta alguna novedad en su definición al señalar
que se trata de servicios de recuperación que contienen una o más bases de datos, con la
descripción de recursos disponibles en la Web, programas de búsqueda y una interfaz de
usuario.
En relación con la terminología, hemos de señalar que no hay unanimidad res-
pecto a la denominación de éstas herramientas. Nos encontramos con que existen térmi-
nos y expresiones distintas referidas a estos servicios, si bien debemos señalar que tanto
Servicios como Herramientas de búsqueda son los términos más comúnmente aceptados
para referirse tanto a Buscadores y Bibliotecas Virtuales como a Bases de datos, utilizán-
dose el primero de estos tres para referirse a Motores de búsqueda, Directorios. Nosotros,
siguiendo a Oppenheim (2000) lo utilizaremos también para englobar a los Metabuscado-
res.
Chu y Rosenthal (1996) los denominan Ayudantes para búsquedas Web (Web
search aids), comprendiendo tanto Catálogos, Directorios, Índices, Motores de búsqueda
o Bases de datos Web. Para estos autores, los motores de búsqueda deben permitir al me-
nos, que el propio usuario elabore su petición de búsqueda, frente a otras herramientas
que permiten buscar información a través de caminos predefinidos o siguiendo estructu-
ras jerárquicas.
Introducción
61
Para Oppenheim (2000) todos son moto res de búsqueda, diferenciando entre
Robots, como AltaVista, Excite 103 , Lycos, HotBot y Go; Directorios, como Yahoo 104 ,
SOSIG 105 , EEVL 106 , Biz/Ed 107 y UK Directory 108 ; Metabuscadores como MetaCraw-
ler 109 , Dogpile 110 , Profusion 111 , Ixquick 112 , Vivísimo 113 y finalmente, Herramientas de
software. Estas últimas son programas que se instalan individualmente en los ordenado-
res y que posibilitan acciones como guardar los resultados de las búsquedas en el propio
disco duro o informarnos tanto de enlaces inactivos como de recursos duplicados. En este
sentido, menciona W ebsleuth, Copernic 98 114 , f.Search 1.3.1 115 y Query-N Metasearch.
Hock (1999) se refiere a Finding tools “Herramientas de Búsqueda” como ex-
presión que abarca tanto a Motores de búsqueda (Search engines) como a Directorios
(Directories).
En cambio para Ljoland (2000) una cosa son los motores de búsqueda web,
dentro de los cuales sitúa a los m etabuscadores y otra los directorios.
Green (1999), en función de sus capacidades técnicas, distingue entre buscado-
res de primera y segunda generación. Sitúa en el primer apartado a los anteriores a abril
de 1998, iniciando Direct Hit 116 los de segunda generación. Concretamente éste último,
incorporaba una tecnología que le permitía aprender de otras búsquedas, guardar infor-
mación de los registros activados por los usuarios en búsquedas previas y así aumentar el
valor de la relevancia cuando se recuperaran de nuevo.
103 Actualmente es un metabuscador y pertenece a Askjeeves.
104 En la actualidad cuenta tanto con un buscador al que den omi na Yahoo! S earch
<http://search.ya hoo.com>com o con un direct orio, Yahoo Directory <> aunque habitualmente se utiliza la
página de acceso general al portal que integra ambas herramientas así como otro tipo de servicios.
http://www.y ahoo.com
105 Especializado en Ciencias Sociales es accesible en http://www.sosig.ac.com
106 Especializado en matemáticas e ingeni ería es accesible en http://www.eevl.ac.uk
107 Especializado en economía y turism o accesible en http://www.bized.ac.uk
108 Accesible en http://www.ukdirectory.co.uk
109 Accesible en http://www.metacrawler.com
110 Accesible en http://www.dogpil e.com
111 Accesible en http://p16.profusion.com
112 Accesible en http://www.ixqui ck.com
113 Accesible en http://vivisimo.com
114 Puede descargarse en http://www.copernic.com
115 Puede descargarse en http://www.karai.com /software/fsearch
116 Fue clausurado en 2002.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
62
Hay aspectos técnicos que diferencian a unos de otros ya que por ejemplo, mien-
tras los de primera generación forman sus índices a partir de la visita de los “robots” a
sitios web, analizando la localización y frecuencia de las palabras, los más modernos ba-
san su ranking 117 de resultados en diferentes aspectos como la cantidad de veces que es
visitado un sitio web. Los recursos obtenidos, en este sentido, tratan de responder tanto a
los criterios de búsqueda como al hecho de ser muy visitados o utilizados. Otro aspecto
que los distingue es que mientras que los primeros no consideran el contexto de los tér-
minos de búsqueda sino que hacen búsquedas literales de los términos, los de segunda
generación permiten hacer búsquedas tanto utilizando el lenguaje natural como búsque-
das conceptuales. Los motores que utilizan estas tecnologías, fundamentalmente Google
y Teoma, utilizan además el análisis de enlaces lo que les permite conocer, en el primero
de ellos, los recursos que reciben un mayor número de enlaces, es decir, lo que equival-
dría a ser los más citados en los cálculos de impacto, y el segundo de ellos trata de ofre-
cer recursos de calidad al detectar los considerados com o “autoridad” en una m ateria.
Siguiendo con la clasificación, Tramullas (2002) se refiere a los motores de ter-
cera generación que se caracterizan por utilizar, en la recuperación, operaciones basadas
tanto en el cálculo vectorial como en el análisis de enlaces.
Aguillo (1998) distingue entre Índices y Buscadores o Motores de búsqueda.
Maldonado y Fernández (2000) distinguen entre Motores de búsqueda e Índices temáti-
cos. Abadal (2001) los denomina Localizadores de recursos, entre los que distingue Índi-
ces temáticos, Buscadores o Robots y Metabuscadores. Por su contenido, establece dife-
rencias entre Localizadores generales y especializados, subdividiendo estos últimos a su
vez según se ocupen de un tema, ámbito geográfico, de determinados tipos de documen-
tos o de un ámbito lingüístico concreto.
Aunque más adelante nos ocuparemos de una forma más específica de unos y
otros, conviene señalar que hay dos aspectos fundam entales que distinguen a buscadores
temáticos de los automáticos: Por una lado, respecto a la formación de sus bases de datos,
los motores la forman mediante la visita indiscriminada y generalmente no selectiva, de
servidores Web por parte del robot, frente a los buscadores temáticos cuyos recursos son
117 Aguillo (2001) señala la existencia de criterios co merciales en el modo en que determinados buscad ores
realizan sus listados.
Introducción
63
seleccionados por personas que se ocupan de su mantenimiento. Por otro lado, desde el
punto de vista de la técnica de la búsqueda, la forma preferente de consulta de sus bases
de datos, consiste en los buscadores automátic os en el lanzamiento de los términos expre-
sados en el formulario de búsqueda, mientras que en los temáticos es necesario un exa-
men, análisis o selección de términos o materias de las listas que ofrecen. Estas técnicas
se conocen como Interrogación y Exploración respectivamente. Este último término, que
puede ser utilizado junto a Examen, concuerda bien con la característica de estos directo-
rios de contener más referencias de sitios web susceptibles de exploración que de visuali-
zación directa de lo documentos individuales y por eso suelen recoger las direcciones de
las páginas principales de un sitio web.
Aunque Yahoo aún lo mantiene, inicialm ente los grandes buscadores como Al-
taVista, Lycos, etcétera, presentaban en las páginas principales ambas formas de búsque-
da. La tendencia actual ya no es tanto mantener ambos modos de búsqueda en la mism a
página del buscador sino separar ambos modos de consulta mediante interfaces distintos,
accesibles a través de distinta URL.
Hay casos como Google que busca al mismo tiempo en la base de da tos del Di-
rectorio, o como Lycos que indica, tras una búsqueda, las categorías del directorio en el
que encontrar recursos relacionados con la expresión de búsqueda. Otros utilizan interfa-
ces visuales y combinan ambos tipos de búsqueda, ya que requieren primero la interroga-
ción de la base de datos y la exploración posterior.
En los casos en que acompañan a los motores de búsqueda, podemos decir que
se trata de herramientas complementarias, que en determinadas búsquedas y para diferen-
tes usuarios, puede ser un modo más adecuado de localizar información, ya que general-
mente se ofrece con un m ayor grado de contextualización.
2.3.2.1. Directorios
El término Directorio es una traducción del inglés Directory que junto con la
expresión classified lists, denomina a los buscadores caracterizados por clasificar los re-
gistros almacenados en su base de datos bien en grupos temáticos, que a su vez pueden
subdividirse en otros más específicos, o bien mediante clasificaciones como la CDU, la
de Dewey u otras. Esta labor, com o hemos dicho, la realizan especialistas que seleccio-
nan dichos recursos de la Web o de los envíos que los particulares realizan, para que sean
incluidas sus páginas. Cada directorio puede tener una política de selección determinada
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
70
2.3.2.3. Metabuscadores
Ante el distinto funcionamiento y la s limitaciones que supone para los motores
ofrecer una cobertura total de la docum entación existente en la Web, los metabuscadores
aportan, entre otros aspectos, una mayor exhaustividad. Para ello utilizan las bases de
datos de diferentes motores de búsqueda.
En primer lugar debemos distinguir entre metabuscadores 142 y multibuscadores,
ya que a veces ambos términos se utilizan de form a indistinta. Los primeros surgen entre
1995 y 1996 como es el caso de Mamma 143 , Dogpile 144 y MetaCrawler 145 . Se caracterizan
porque la búsqueda se lanza de forma simu ltánea sobre distintos buscadores, siendo re-
comendable utilizar operadores comunes o no usarlos. En los multibuscadores, la bús-
queda se hace de forma secuencial, es decir un buscador tras otro y los resultados apare-
cen separados por motores.
Algunos metabuscadores permiten seleccionar los buscadores sobre los que se
lanzará la búsqueda. MetaCrawler reformula la pregunta, de forma que pueda ser proce-
sada por cada buscador y presenta los resultados de una form a unificada. Para la ordena-
ción utiliza su propio algoritmo 146 que valora el ranking asignado por el buscador, el nú-
mero de buscadores que contiene el recurso, etcétera.
Los metabuscadores ofrecen como ventajas y la realización de búsquedas en
múltiples buscadores mediante una única interface y la eliminación de duplicados. Sin
embargo, las búsquedas complejas no siempre se realizan como el usuario las plantea
sino en función de las capacidades que el meta buscador tenga para lanzar la búsqueda de
forma simultánea sobre los motores que utiliza, ya que no todos soportan la misma sin-
taxis. Además de esta simplificación, se reducen las opciones para mejorar las búsquedas
que presentan los buscadores de forma independiente, limitándose también la capacidad
de interacción pueden ser completas ya que todos lo motores no soportan una mism a sin-
taxis. A pesar de ello, para autores como Chignell y otros (1999), resuelven el problema
142 Chowdury (2001) los considera com o un subgrupo de los m otores de búsqueda.
143 http://www.mam ma.com
144 http://www.dogpi le.com
145 Lanzaba las búsquedas sobre Galaxy, InfoSeek, Lycos, WebCrawler y Yahoo. Posteriormente añadió
OpenText. Actualmente pertenece a InfoSpace. Accesible en http://www.metacrawler.com
146 Algoritm o denomi nado “Normal ize-Distribute-Sum ”
Introducción
71
de la baja exhaustividad que se observa en los buscadores, apoyándose en la idea de que
ningún motor de búsqueda por si sólo ofrece más del 45% de recursos relevantes existen-
tes en la Web.
No obstante, Chignell y otros (1999) señalan la existencia de una segunda gene-
ración de metabuscadores, que tienen en cuenta tanto el tipo de pregunta como la materia,
la estrategia de búsqueda, etcétera para seleccionar los buscadores a los que enviar la
búsqueda. De aquí nuestro interés por compar arlos con los motores de búsqueda para ver
hasta qué punto son útiles en búsquedas sim ples y complejas sobre temas especializados.
En este sentido, Dreilinger y Howe (1997) señalan tres componentes fundamen-
tales:
o Un mecanismo de envío que se ocupa de seleccionar el servidor y el m otor
o motores a los que se lanza la consulta.
o Agentes del interfaz: se ocupan de interactuar con cada mo tor de búsqueda
y de reformular la consulta de forma que sea correctamente interpretada
por cada motor de búsqueda. Finalmente interpretan los resultados que
proceden de cada motor.
o Mecanismo de presentación de resultados: se ocupa de integrar los resul-
tados procedentes de los distintos motores, ordenarlos, y en su caso, eli-
minar duplicados y verificar los enlaces.
Existen diversas clases de metabuscadores, ya que unos lanzan las búsquedas de
forma automática sobre los buscadores, mientras que en otros casos como All-in-one 147
es necesaria la intervención del usuario. No obstante, existen casos como ProFusion 148
que integra ambos métodos. Otra diferencia puede ser el que realicen su función en un
147 http://www.alonesearch.com/multibib/
148 http://www.profusion.com
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
72
servidor propio o utilicen el cliente, como es el caso de Copernic 149 , WebSeeker 150 y
otros.
Entre los más utilizados, podem os mencionar MetaCrawler 151 , Dogpile 152 y Pro-
Fusion. Vivísimo 153 , e Ixquick 154 pueden considerarse como más actuales y de una tecno-
logía más avanzada. MetaCrawler se caracteriza por la alta especificidad en la expresión
de búsqueda, que permite el uso de la lógica booleana, la aplicación de algoritm os de
ranking y agrupamiento, o la extracción de térm inos para especificar la búsqueda. Dogpi-
le por ordenar por relevancia los resultados.
Por otro lado podemos citar SurfWax 155 y Copernic 156 que recuperan incluso en
la web oculta. El segundo cuenta con dos versiones, una libre y otra de pago; EZ2Find 157
que incorpora la opción de búsquedas por categorías especializadas; y Fazzle 158 que per-
mite ordenar los resultados por diferentes conceptos y utilizar operadores booleanos, con
lo cual podemos observar cómo algunas de las limitaciones que se apuntan para estas
herramientas, com ienzan a ser superadas.
Hay que señalar además el metabuscador NECI, desarrollado inicialmente en el
Instituto de Investigación NEC, y que en la actualidad se denomina Inquirus 159 que trata
de mejorar los resultados ofrecidos por otros metabuscadores en cuanto a precisión y efi-
ciencia, mediante el análisis de los documentos, la detección de duplicados, mejora del
algoritmo de ranking y la precisión, analizando tanto la información más próxima com o
facilitando la elaboración de expresiones de búsqueda más precisas y finalmente, desta-
cando la presencia de los términos de búsqueda en los recursos recuperados. (Lawrence y
Giles, 1998d).
149 http://www.copernic.com
150 http://www.bl uesquirrel.com /products/webseeker/
151 http://www.metacrawler.com
152 http://www.dogpi le.com
153 http://vivisimo.com
154 http://www.Ixqui ck.com
155 http://www.surfwax.com
156 http://www.copernic.com
157 http://www.ez2www.com
158 http://www.fazzle.com
159 http://www.i nquirus.com
Introducción
73
Westerra (1997) señala que por sus características, los metabuscadores pueden
ser las herramientas del futuro una vez superen aspectos como son: una mejor interpreta-
ción de los términos de búsqueda, la posibilidad de poder hacer las búsquedas en los bus-
cadores de acuerdo con la sintaxis que cada uno soporta y la provisión de resultados
completos y ordenados.
En la actualidad se están observando los primeros pasos en este sentido, ya que
como señalan Chignell y otros (1999), se han venido desarrollando nuevos metabuscado-
res que discriminan entre diferentes buscadores en función del tipo de búsqueda, del tipo
de usuario e incluso de la materia de búsqueda 160 . Otras veces, un programa intermedio
analiza las consultas y las transforma de manera que sean “entendibles” para cada uno de
los motores (Hu, W . Chen y Yeh, Jyh-Haw 2002).
Otras iniciativas como la propuesta por Gravano y otros (1997) tratan de esta-
blecer un protocolo, al que denomina STARTS, cuya util ización por pa rte de los m otores
facilitaría una m ayor homogeneidad en los resultados. No obstante, com o indican Hu, W .
Chen y Yeh, Jyh-Haw (2002), este protocolo apenas se está utilizando.
En cualquier caso se trata de herramientas a tener en cuenta ya que como señala
Notess, el metabuscador Excite permite aumentar, de forma simple, el resultado de las
búsquedas en torno al 50%.
2.3.2.4. Los agentes inteligentes
Los agentes inteligentes de búsqueda como WiseW ire o Nano Espacio Custom
Search 161 , pueden ser otra de las tendencias en recuperación de la información web en los
próximos años. Básicamente podemos decir que son programas que se ejecutan directa-
mente en los ordenadores personales y que realizan periódicamente y de forma automáti-
ca, las funciones para las que han sido programados. Se denominan inteligentes porque
“aprenden” a través de su uso, lo que les permite aplicar la información que van acumu-
lando para realizar mejor trabajos repetitivos. Así, basta con que un usuario utilice estos
agentes para la recuperación de información una vez, para que posteriormente sea el pro-
160 Para más información sobre m etabuscadores que dirige n las búsquedas hacia motores especializado s en
los temas de consult a, véase el trabajo de A. Sugiura y O. Etzioni (2000).
161 Se caracteriza por utilizar algoritmos de inteligencia artificial. Accesible en http:/www.necuse.com
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
74
pio programa, a través del perfil de usuario que va generando, quién se ocupe de buscar
la información que le interesa y proporcionarla con la frecuencia con la que el usuario la
demande 162 .
Entre los más conocidos se encuentran Copernic 163 , BullsEye 164 y EZSearch 165 .
2.3.3. Principales compone ntes y funcionamiento
Los buscadores que se utilizan habitualment e en la Web son sistemas de recupe-
ración que llevan a cabo miles de búsquedas al mismo tiempo, en bases de datos am plias
y variadas, com puestas por diferentes tipos de documentos y con una arquitectura que se
caracteriza por su complejidad, potencia y robustez. Cabe mencionar en este sentido los
clusters o grupo de ordenadores interconectados que facilitan la rápida consulta de los
índices, enviando los resultados a un ordenador encargado de ordenar los registros facili-
tados por los diferentes ordenadores, para finalm ente facilitarlos al usuario.
La com plejidad de estos procesos hace necesario que nos detengamos a analizar
el funcionamiento de estas herramientas, de sus componentes más importantes, ya que
conociendo con mayor profundidad est os aspectos, estaremos en mejor disposición pa ra
establecer una serie de criterios enfocados a valorar si efectivamente desarrollan su co-
metido de fo rma correcta y útil.
En este sentido, podemos preguntarnos ¿Qué se espera de estas herramientas en
las búsquedas de documentos? Desde el punto de vista de la Ingeniería del Software,
Ges-Chen Hu y otros (2001a) señalan, en primer lugar, la efectividad y eficiencia del
sistema en la localización y ordenación de documentos, teniendo en cuenta además, la
cobertura, la actualidad, la imparcialidad en el acceso a los docum entos, la expresividad y
utilidad de los resultados de búsqueda, la facilidad de uso de la interface y finalm ente, la
adaptabilidad del sistema a las consultas del usuario.
162 Más información sobre las posibilidades de recupe ración de información de estos mecanism os puede
consultarse en el trabajo de Berrocal, Figuerola, Zazo y R odríguez (2003).
163 http://www.copernic.com
164 http://www.inteliseek.com
165 http://www.americansys.com
Introducción
75
Un punto de vista distinto supone conocer las funciones que llevan a cabo. Así,
Gordón, M. y Pathak, P. (1999) señalan que los motores de búsqueda facilitan tres aspec-
tos: reúnen un conjunto de páginas web sobre las cuales el buscador puede recuperar la
información; representan dichas páginas de m odo que se permita conocer su contenido; y
por último, perm iten plantear búsquedas que, m ediante algoritmos de recuperación, inten-
tan recuperar información relevante. Estas funciones son llevadas a cabo por sus compo-
nentes principales, que como todo sistema de recuperación de la información, está com-
puesto por la base de datos, por el software que se ocupa de su form ación y ges tión, y que
facilita la recuperación, y por la interfaz de búsqueda. De cara a facilitar la consulta para
todo tipo de usuarios, estas herramientas ofrecen cada vez interfaces más simples, y sue-
len ser evaluados de forma específica.
2.3.3.1. El robot o crawler
En relación con el software de formación y gestión de la base de datos, uno de
los elementos más importantes son las denominadas “arañas”, robots o crawlers. Básica-
mente se trata de programas informáticos que se conectan a los servidores web, llevando
a cabo una serie de instrucciones relacionadas con el modo en que han sido programadas
para, por ejemplo, escanear su contenido y ser posteriormente indizado. Su otra función
importante, consiste en la elaboración de un listado de direcciones URL extraídas de los
recursos que visita, para examinarlas posteriormente. Este listado contiene además, las
direcciones URL enviadas a los buscadores por los responsables o creadores de páginas o
sitios web, para que sus páginas sean indizad as. También recurren a servidores y páginas
web que recogen novedades, los sitios más vis itados, grupos de noticias y listas de distri-
bución.
Otros programas (Lynx, Java.net, Comp re hensive Perl Archive Network) les
permiten llevar a cabo sus funciones independien temente del tipo de servidor, del tipo de
recurso de red, o de la aplicación con que se encuentren.
Google, en este sentido, utiliza un servidor de direcciones URL del que parten
los robots para visitar las páginas, enviando posteriormente la información extraída a un
servidor de almacenamiento, donde se comprime y se le asigna un código identificativo.
Esto facilita su recuperación y consulta, bien en línea, o en la versión guardada en mem o-
ria.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
76
Una vez que el robot se dirige y visita el recurso, comprueba si ya lo ha visitado
anteriormente, y en caso afirmativo, revisa si ha habido cambios, y si ha sido así, actuali-
za los datos que tiene de dicho recurso.
El orden de las direcciones en el listado de lugares a visitar puede verse influido
por las directrices del motor de búsqueda. Entraría aquí en funcionamiento la programa-
ción prevista para los recursos de pago, que requieren aparecer de forma rápida y mejor
colocados en el ranking de resultados.
El modo de trabajo de estos robots puede hacer posible que en una búsqueda en-
contremos las páginas enviadas por los creadores, las páginas más consultadas pero, a
pesar de todo, hay una parte importante de la Web que les resulta inaccesible, al menos
de forma inmediata, bien sea por no haber sido localizadas por el robot o por no haber
sido enviadas por sus creadores para su indización. Aún las que se envían sin mediar un
contrato económico para ser visitadas por las arañas, pueden tardar de seis a ocho sema-
nas en ser indexadas. Otras limitaciones al trabajo de estos programas pueden venir im-
puestas por los mantenedores de los servidores, bien a través de los ficheros robot.txt,
que controlan y, en su caso, impiden el acceso a determinados recursos a los robots, o su
indicación en una etiqueta Meta 166 de la página en HTML. Otros aspectos técnicos que
pueden limitar su cometido son: la existencia de marcos en las páginas web, la genera-
ción de páginas dinámicas, de mapas de imág enes y de páginas protegidas (Baeza-Yates
y otros 1999). Todo ello da lugar a la denom inada “Web oculta”.
Continuando con el modo de trabajo de estos programas, Baeza-Yates y otros
(1999), señalan que los más rápidos superan lo s diez millones de visitas diarias a páginas
Web.
Pero no todos funcionan del mismo modo ya que pueden estar program ados para
dirigirse a determinados sitios web y una vez allí, extraer sólo la información de una par-
te determinada o de todo el sitio o página web, es decir, su programación les permite rea-
166 Véase Koster (1994)
Introducción
77
lizar una extracción intensiva, con mayor profundidad en las páginas, o bien extensiva,
tratando de recolectar algo de información de la totalidad de páginas del sitio 167 .
Los programas más avanzados permiten centrar sus visitas en sitios que contie-
nen determinadas palabras clave o en páginas de una cierta importancia, aunque no todas
las herramientas los im plementan.
Todo esto se refleja en la indización, que puede tener un componente en unos
casos selectivo, en otros jerárquico, dando más importancia a la indización de las páginas
de los niveles superiores, mientras que en otros se realiza con mayor detenimiento sobre
los documentos situados en niveles inferiores.
Así pues, del trabajo del robot consideramos interesante para la evaluación co-
nocer hasta qué punto desciende en la jerarquía de los servidores y sitios web, es decir, si
lo hace con mayor o menor profundidad.
2.3.3.2. El índice
Para facilitar la consulta a la base de datos, hemos de destacar la labor realizada
por el programa de indización , que realiza una extracción de términos del documento
para formar un índice invertido, esto es, un listado de raíces de palabras, de términos, de
frases, etcétera, que apuntan a los documentos que los contienen. Como hemos visto an-
teriormente al hablar de la indización, se caracterizan por la eliminación de palabras va-
cías y por la aplicación de una serie de valoraciones basadas en frecuencias de términos,
calculando el número de veces que aparece un término en un documento o en la base de
datos, el lugar en que aparece tanto en la frase como en el texto, etcétera. En determina-
dos casos también pueden hacer intervenir el análisis de hiperenlaces.
Otros aspectos que varían en función de l motor tienen que ver con la conversión
de los términos a mayúsculas y minúsculas, utilización de las etiquetas HTML en la indi-
zación para indizar títulos, direcciones URL, etcétera.
167 La investigació n en este campo se está centra ndo en la actualidad en la aplicación de técnicas basadas
en el uso d e la inteligencia artificial. En este sen tido puede consu ltarse el trabajo de Nick, Z. Z. y Themis,
P. (2001).
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
78
La obtención de resultados en una búsqueda se ve facilitada y condicionada, en-
tre otros aspectos, por el modo en que se ha realizado la indización. A pesar de su impor-
tancia, contamos con poca información sobre el modo en que indizan o el ritm o al que lo
hacen. En un estudio de Schwartz (1998) se señala que AltaVista indizaba unos seis mi-
llones de recursos diarios.
Además, en determinados motores comerciales es frecuente la creación de un
segundo índice, que apunta a recursos de pago y que se ofrecen en lugares destacados del
listado de recursos recuperados.
Hernández (1999b) denomina analizador o indexador al programa que facilita la
extracción de las palabras del contenido, y señala la existencia de diferentes filtros que
dirigen el modo en que se ha de realizar dicha indización. El fichero inverso que se gene-
ra es gestionado por una base de datos que soporta las consultas del usuario. El texto se
extrae generalmente del título, de los títulos de los principales apartados, de las etiquetas
Meta, de los hiperenlaces y, según el buscador, de una parte variable del texto. El pro-
blema de este tipo de extracción es que no todos los buscadores utilizan los programas
que permiten identificar el título, autor, etcétera, del resto de contenido, lo que influye de
forma negativa en la precisión de la recuperación. De aquí que sólo una información co-
rrectamente etiquetada, puede permitir obtener resultados de mayor precisión. Por ello
hemos querido valorar cómo recuperan actualmente los principales buscadores cuando se
les indica que busquen determinadas palabras en el título. Es por eso que en la evaluación
hemos utilizado una búsqueda por campo, que nos puede dar datos sobre su funciona-
miento.
Cada buscador realiza la indización de un m odo propio, por ejemplo Google in-
diza los documentos que va almacenando creando registros que contienen las palabras,
información sobre su posición en el texto, sobre el tamaño de la letra y el uso de mayús-
culas. Realiza además un análisis de enlaces que se utilizará tanto para alimentar al servi-
dor de direcciones URL como para realizar cálculos de relevancia. El análisis de hiperen-
laces ha adquirido un gran desarrollo en los últimos años, especialmente desde la publi-
cación del estudio de Brin y Page (1998) en el que se expone el PageRank model, del que
más adelante nos ocuparem os.
El fichero inverso puede actualizarse con una periodicidad variable (de 24 horas
a varias semanas), por lo que puede haber cambi os no registrados en la base de datos. De
aquí que haya casos de información aún no incluida o direcciones que han cambiado o
Introducción
79
desaparecido, etcétera. (Olvera 1999c). Debemos tratar de conocer, si no con qué fre-
cuencia los buscadores automáticos actualizan este índice, sí al menos cuál lo hace con
mayor asiduidad. Un modo de saberlo es analizando la validez de las direcciones URL
que se ofrecen tras una búsque da, pues en vi rtud de su mayor o menor índic e de co-
nexión, podemos afirm ar un valor de actualización.
La incorporación de nuevos términos o datos se lleva a cabo en cada actualiza-
ción. Google lo hace mensualm ente y según Notess (2002), reindiza diariamente los ser-
vidores que varían frecuentemente sus contenidos. Su correcto funcionamiento requiere
pues, diferentes tareas de mantenimiento. Así, para eliminar páginas, buscadores como
WW Lib-TNG, desarrollado en la Universidad inglesa de Wolverham pton, utilizan archi-
vos históricos en los que se registran la s veces que un determinado enlace no ha podido
utilizarse, y a partir de un determinado número de veces, la página se borra de la base de
datos. Por supuesto se tiene en cuenta que los problemas no sean debidos al estado de la
red.
Este autor demuestra en otros estudios 168 que motores como MSN, HotBot y
otros recuperaban documentos colgados en la Web en las últim as 48 horas.
Desde el punto de vista lingüístico, la utilización por algunos motores de mapas
conceptuales o la indización de las propias preguntas, son soluciones planteadas para
resolver el problema de la polisem ia y la homonimia. (Peña y otros. 2002).
Por otro lado, la Web está formada por diferentes tipos de documentos, bien
sean textuales, sonoros o audiovisuales sobre los que, en la medida de lo posible, los pro-
gramas indizadores tratan de extraer información, para facilitar su recuperación. Al mis-
mo tiempo van surgiendo herramientas de búsqueda especializadas en estos tipos de ar-
chivos. No obstante, hay que tener en cuenta que no todos los recursos o todo su conteni-
do pueden ser indizados, no sólo por el amplio número existente y la variada tipología,
sino por el carácter especial de su contenido, como por ejem plo ocurre con las fórmulas o
ciertas representaciones gráficas.
Buscadores como Google, MSN y Yahoo indi zan archivos de diferente fu ente y
tipo documental como son los grupos de noticias (Usenet), documentos PDF, Power-
168 Véase la página web http:// www.notess.com /search/stats/freshness.shtml
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
86
minados aspectos de la indización; cuál es el operador de búsqueda que utiliza cada mo-
tor de forma implícita, ya que ello incide muy directamente en los resultados; cuáles son
los operadores que soporta, tanto booleanos como de cercanía, si permite truncamientos,
si se puede consultar por palabra clave, frase o lenguaje natural, si es sensible al empleo
de mayúsculas o minúsculas, así como algunas características de la búsqueda avanzada o
por campos. Presentamos a continuación diferentes aspectos que tienen que ver con la
recuperación, y especialmente con la ordenación de los resultados de búsqueda.
Los motores de búsqueda utilizan recursos específicos que permiten modificar el
funcionamiento automático de las búsquedas. MSN utiliza un “Generador de búsquedas”
además de permitir utilizar alguna de las opciones anteriormente señaladas, permite refi-
nar al añadir otro término de búsqueda a los resultados, restringirlos a un sitio, dominio,
obtener vínculos, etcétera. Permite ordenar los resultados por fechas o por popularidad.
Para calcular la relevancia se sirve de parámetros como la procedencia de la consulta, es
decir, calcula este valor en función del lugar desde el que se realiza la búsqueda. Por su
parte, los metabuscadores ofrecen, como en el caso de Ixquick, una búsqueda avanzada
universal, es decir que analiza la ecuación de búsqueda y, en la medida de lo posible la
transforma para que pueda ser entendida por la mayoría de buscadores; una búsqueda
global, es decir en todo el mundo y en cualquier idioma; y un refinamiento avanzado, que
permite no volver a ver resultados visualizados previamente así como centrar la búsqueda
en determinados recursos recuperados y rechazar otros. Además señala con estrellas el
número de buscadores que recupera determinado recurso entre los diez primeros. Final-
mente, ofrece diferentes opciones personalizables, como la posibilidad de destacar los
términos de búsqueda en los resultados, etcétera. Otras características le permiten corre-
gir términos escritos de forma incorrecta y ordenar los resultados por relevancia o por
motor de búsqueda. Además ofrece una serie de enlaces relacionados que permiten tanto
centrar como filtrar la búsqueda, y un histórico, con las 15 últimas búsquedas lanzadas.
Finalmente, como opción a destacar, permite la búsqueda de recursos indicando la fecha
de publicación.
175 Véase en este sentido las recomendaciones que hace Greg Notess (2000b) para consultar Google utili-
zando operadores booleanos.
Introducción
87
Ixquick, para enfocar la búsqueda, facilita diversas categorías que recogen los
recursos relacionados con aspectos específicos. Se basa en la coincidencia de los térmi-
nos de búsqueda en los recursos recuperados. Además, se pueden aplicar filtros por do-
minio, idiom a de los recursos y fecha.
Generalmente, se pueden utilizar además de los términos de búsqueda, con los
operadores correspondientes, otros elementos com o: los signos “más” (+) para forzar la
aparición del término al que preceden y “menos” (-) para excluirlo; paréntesis; trunca-
mientos; comillas en las búsquedas por frase y la coma (,) para separar los apellidos del
nombre, en el caso de búsquedas de nombres propios.
Como sistemas interactivos que son, la efectividad de la búsqueda también de-
pende de los objetivos del usuario (Arms, 2001) y de su formación. Así, en función de los
resultados que obtenga, podrá redirigir o plantear la búsqueda, intentando obtener otros
más relevantes.
Es por ello que conocer interfaz de búsqueda y el lenguaje de interrogación del
motor es indispensable no sólo para consultar adecuadamente la base de datos, sino tam-
bién para obtener unos resultados más precisos.
Estos sistemas se basan en el modelo de recuperación booleano extendido y en
algunos casos en el vectorial. En el primer caso los operadores pueden ser implícitos,
cuando el sistem a interpreta que se utilizan los operadores AND o bien OR entre los tér-
minos de consulta, y explícitos cuando han de introducirse expresamente por el usuario.
La mayoría de motores de búsqueda de la Web utilizan el operador AND de forma implí-
cita.
El modelo vectorial es menos utilizado ya que como señalan Berry y Browne
(1999:67), los motores que utilizan técnicas basadas en espacios vectoriales reconocen a
los operadores booleanos como palabras vacías en la ventana de búsqueda, permitiendo
en algunos casos la búsqueda en campos.
Igualmente es im portante valorar en estos sistemas de recuperación la importan-
cia de la representación de la búsqueda, ya que puede basarse en el modo convencional
de acumulación de términos, o en otros más evolucionados, como son las búsquedas ex-
presadas mediante el lenguaje natural, que exige la estructura semántica de la frase o la
representación vectorial de los términos, a los que se les adjudica un valor según su im -
portancia.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
88
Además la búsqueda en los motores se puede realizar mediante palabras clave,
frases, utilizando truncamientos, expresiones del lenguaje natural y otra serie de operado-
res, además de los booleanos, y de cercanía. Algunos buscadores especializados facilitan
la consulta mediante tesauros 176 y la búsqueda por campos.
Pero cada una de estos tipos de búsquedas puede plantear problemas. En este
sentido Delgado (2001:46) señala el defectuoso funcionamiento de la búsqueda booleana
en buscadores Web al desactivar con su uso la ordenación por relevancia.
Por otro lado, la utilización del lenguaje natural en la consulta puede influir en la
recuperación de un mayor número de recursos, debido a los problemas que por ejem plo
plantea el uso de términos sinónimos y homónimo s. Tal vez por esto y por su incipiente
desarrollo, su uso no se ha generalizado y sólo determinados buscadores como AskJeeves
lo utilizaban.
Respecto a los resultados de la búsqueda, una vez el motor compara los términos
de búsqueda de la ecuación de búsqueda y el índice, presenta un listado de resultados con
información sobre cada uno de ellos.
Teoma los ofrece en cuatro apartados: en prim er lugar mu estra una serie de luga-
res comerciales; a continuación el apartado “Refine” que contiene recursos que se ofre-
cen a modo de sugerencia por si son del interés del usuario; en tercer lugar el apartado
denominado “Results” que contiene el gran grupo de recursos; y finalmente el apartado
“Resources” que son recursos compilados por expertos en la materia.
Coloca en lugares relevantes recursos de empresas que por su carácter comercial
quieren aparecer en los primeros lugares de búsqueda. Se distinguen porque se les asigna
la etiqueta Sponsored by. Utilizan para ello las bases de datos de Overture, Sprinks y
FindWhat.
De aquí que nos hayamos planteado la n ecesidad de valorar como funcionan los
buscadores ante diferentes tipos de búsqueda, cuando se utilizan opciones de búsqueda
avanzada como la búsqueda booleana, por frase, por campo, o con en operador de exis-
tencia (+).
176 Véase por ejemplo ERIC (Ed ucation Resources Information Centre) en http://www.eric.ed.g ov/
Introducción
89
Si todo se desarrolla correctamente, constituye la piedra de toque para valorar la
utilidad de estas herramientas, en tanto en cuanto sean susceptibles de colocar entre los
primeros lugares los recursos más relacionados con la búsqueda y resolver el problema
de necesidad de información planteado.
Por tanto, en esta página o páginas, dos aspectos son fundamentales: por un lado
la presentación o descripción de los recursos, que se realiza con el fin de ayudar al usua-
rio a decidir si un recurso es de su interés, y por otro la ordenación o ranking.
Respecto al primero de ellos, generalmente suele aparecer el título que puede
servir de enlace con el recurso, un resumen descriptivo del contenido, la dirección URL y
otra información, que varía en función de cad a buscador, como puede ser: el índice de
relevancia, el tamaño del archivo, la fecha de creación, la fecha de entrada en la base de
datos, lengua o idioma. Junto a estos resultados aparecen, de form a destacada, otra serie
de recursos de carácter comercial, cuya frecuencia trataremos de valorar en la evaluación.
Otra característica de los listados es la aparición destacada de recursos depen-
dientes que aparecen colocados de forma más adentrada respecto a los márgenes, que el
resto de recursos de los cuales dependen.
El resumen descriptivo presenta, de forma destacada, generalmente en negrita,
los términos de búsqueda junto al conjunto de la frase o frases en que aparecen. No hay
uniformidad en el contenido entre unos y otros, ya que por ejemplo, Infoseek mostraba
los 300 pr imeros caracter es del cuerpo de la p ágina HTML, Lycos, en función de su bre-
vedad seleccionaba entre las veinte primeras líneas o el 20 % del texto. AltaVista y Hot-
Bot utilizaban la etiqueta Meta “description” para extraer el resumen, aunque lo más
usual en la actualidad es la extracción de frases en las que aparece el término o términos
de búsqueda.
Dada la importancia que esta primera información tiene para el usuario, ya que
en función de ella ha de decidir el interés del recurso, en la evaluación trataremos de va-
lorar la utilidad de estos aspectos, analizando la frecuencia de aparición de los términos
de búsqueda, la frecuencia de aparición de r ecursos comerciales y de recursos dependien-
tes.
Respecto a la ordenación, el gran número de recursos que suele aparecer hace
que sea un aspecto fundamental, ya que el usua rio no suele consultar más allá de las tres
primeras páginas de resultados. Esto requiere un buen funcionamiento de los algoritmos
que intervienen.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
90
Excite ofrece dos opciones para ordenar los resultados, bien por buscador o por
relevancia. Otra opción permite destacar en el contenido de los recursos recuperados, los
términos solicitados.
Courtois y Berry (1999) han observado que los resultados se ordenan de acuerdo
con el cumplimiento de ciertos criterios como la cantidad de palabras de la expresión de
búsqueda localizadas en el documento, dando mayor importancia a los docum entos de
menor tamaño que las contienen, a la proximidad de los términos y a su ubicación en el
documento. Además, aunque la fórmula exacta para la ordenación varía de unos motores
a otros, la localización de las palabras, bien en el título o en etiquetas Meta, puede tener
más peso que su aparición en el texto. La valoración de un aspecto u otro puede influir en
la diferenciación entre buscadores, ya que mientras algunos de ellos excluyen en la indi-
zación la metainform ación, otros sí la utilizan.
En la evaluación trataremos de precisar qué motores utilizan la metainfo rmación
en el ranking así como la frecuencia de aparición de los términos y su peso.
En determ inados motores, la frecuencia relativa, es decir, el valor que representa
la repetición de una palabra en la base de datos, también incide en la ordenación de los
resultados.
Los algoritmos que se aplican suelen ser secretos, si bien, en algunos casos pue-
den deducirse. Podemos decir que en función de estos algoritmos se realiza el cálculo de
la relevancia.
En la mayoría de casos se aplica una ordenación basada en los términos del pro-
pio recurso, pero Google utiliza además aspectos externos al documento como son los
enlaces. Este buscador ordena los resultados teniendo en cuenta no sólo de la valoración
de los aspectos mencionados anteriormente, sino añadiendo además una serie de valores
que asigna en función de la existencia de enlaces de otras páginas que apunten hacia
ellas, así como la importancia de estas páginas, que a su vez se valora por el número y
calidad de enlaces que les señalan. Este algoritmo se denomina PageRank, y aunque en
muchos casos ofrece buenos resultados, se ha criticado que favorece e impulsa la recupe-
ración de recursos ya conocidos, en detrimento de los nuevos recursos. (Savoy y Picard,
2001). Así, la colocación de una página en los primeros puestos de resultados requiere
cierto tiempo, hasta que el recurso es conocido y a su vez enlazado por otras páginas im-
portantes.
Introducción
91
WebQuery es otro algoritmo que de basa en cálculos de enlaces y actúa basán-
dose en un conjunto de páginas que ordena en función de sus enlaces con otras 177 .
Finalmente, como señalan Baeza-Yates y otros (1999), Kleinberg diseñó HITS
(Hyperlink Induced Topic Search). Este algoritmo es utilizado por el buscador Clever, de
IBM, actualmente en proceso experimental y por Teoma. El algoritmo, para facilitar la
recuperación de recursos de calidad, distingue entre páginas autoridad, que son las que
reciben un gran número de enlaces y páginas concentradoras o páginas eje, que contienen
un importante número de enlaces a otras páginas, fundamentalmente de las consideradas
“autoridad”. A estos valores añade otros cálculos basados en los métodos utilizados nor-
malm ente como la frecuencia y la proximidad de térm inos.
Este buscador utiliza dos tecnologías, por un lado la denominada Subject-
Specific Popularity, que detecta comunidades de recursos en la Web en torno a una mate-
ria y las coloca en los primeros lugares de las búsquedas. Por otro lado, Dinamic descrip-
tions, basa su técnica en el análisis del contexto de los términos de búsqueda, lo que le
permite mostrar resultados que aunque no contengan los términos de búsqueda, sí que
tratan sobre el tema objeto de búsqueda. Wisenut aplica el algoritmo context-sensitive
ranking que valora tanto los enlaces com o el contenido del documento.
El cálculo de la relevancia se presta también a otras valoraciones. En primer lu-
gar se suele valorar la posición de los térm inos según se encuentren en las etiquetas Meta,
en los títulos, bien sea teniendo en cuenta la proximidad entre términos, o por la frecuen-
cia, que actúa de forma inversamente proporciona l al valor del término en la base de da-
tos. Se utilizan, además, valores de corrección según el lugar que ocupa el término dentro
del texto, siendo mayor su valor si forma parte del título o de la cabecera del documento
y cuanto más cerca del inicio del documento se encuentre.
Como señala Notess (1999c) un valor más real es e l que s e aplica comparando la
aparición del término con el número total de palabras que contiene un documento, lo que
evita el problema de dar mayor valor a los documentos más grandes. Este autor señala
además, como factor a tener en cuenta en la ordenación, la aparición del término de bús-
queda en el URL, lo que suele tener en los motores una importancia especial, al igual que
177 Para más inform ación véase Li, Y. (1998)
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
92
ocurre con los términos que actúan como anclas de hiperenlaces hacia otras páginas, que
a su vez reciben enlaces de otras. Google utiliza esta técnica valorando además, como
acabamos de ver, si las páginas a las que se dirigen los enlaces tienen cierto prestigio. En
otros casos, se basa en el número de enlaces que apuntan a un determinado recurso, en las
páginas más visitadas, etcétera.
Otras técnicas que se utilizan para mejorar la relevancia se basan en cálculos
vectoriales, en las técnicas de agrupamiento o Clustering y en la retroalimentación de la
relevancia (Relevance Feedback).
El tema de la ordenación, por su importancia, ha dado lugar a un amplio número
de trabajos dedicados al estudio del posicionamiento en los motores de búsqueda 178 . Es-
tos estudios se centran en analizar cómo ordenan los motores los resultados de búsqueda
y en base a qué características deciden qué recursos colocar en las primeras posiciones.
Los criterios que utilizan están muy relacionados con lo anteriormente señalado.
Por otro lado existe una corriente de estudio centrada en el análisis del ranking.
Nosotros proponemos una valoración del ranking en función de la utilización de las eti-
quetas Meta Key y Description, y de la frecuen cia y peso de los términos de búsqueda en
las páginas recuperadas, y trataremos de analizar si hay correlación entre estas variables
y la ordenación.
Por tanto, a tenor del análisis de las diferentes partes de los buscadores Web, nos
interesa analizar la respuesta de estas herra mientas ante los distintos tipos de búsquedas,
de aquí que cada una de las búsquedas sea diferente (búsqueda por un término, varios
términos, con operadores de existencia, booleana, por frase y por campo). Valoraremos
así las capacidades de los programas de búsqueda y recuperación que soportan los dife-
rentes buscadores.
Del funcionamiento del robot analizaremos la profundidad de rastreo de los si-
tios web, fundamentalmente en cuanto a la profundidad de extracción de información de
los servidores web, nos ocuparemos de actualización, valorando la existencia de enlaces
con error y duplicados. En relación con la base de datos, la estimación de su tamaño en
función de la cobertura sobre las búsquedas planteadas, las características de la informa-
178 Véase por ejemplo el trabajo de L. Codina y M. C. Marcos (2005).
Introducción
93
ción recuperada y la recuperación de páginas únicas y solapamiento entre buscadores.
Otros aspectos a analizar son la precisión técnica y el ranking.
2.3.3.5. Identificación de los pr oblemas de recuperación de infor-
mación en la Web
Hemos visto con anterioridad, en el apartado dedicado a las características téc-
nicas y problemas de la información en la W eb, alguno de los aspectos que van a incidir
de forma negativa en la recuperación de dicha información y a los que los sistemas de
recuperación tienen que hacer frente como son el gran número de docum entos existentes,
su carácter cambiante y efímero, la variedad de formatos en los que aparece, no siempre
legibles por todos los sistemas, el gran interés comercial, su escasa descripción, etcétera.
También hemos mencionado al ocuparnos de las partes que constituyen los sis-
temas de recuperación Web, aquellos que dependen exclusivamente de ellos mism os,
como son los problemas relacionados con los índices, con la actualización de las bases
de datos, etcétera.
Tramullas y Olvera (2001) mencionan problem as como : la limitada cobertura de
los motores, que por ejemplo, en el caso de HotBot no superaba el 32% del total de re-
cursos existentes; la actualización de sus índices, que no se produce de forma automática,
siendo más lenta en información menos solicitada, ya que determinados buscadores rele-
gan estos servidores a los últimos lugares del orden de visita, resultando más frecuente-
mente actualizados los que contienen información que se consulta periódicamente. Los
motores no reflejan la variabilidad espacial y temporal de las páginas web, provocando la
aparición del error 404, el acceso a las páginas se suele hacer de forma independiente a
su contexto inform ativo, es decir, sin señalar si determinada página pertenece a un docu-
mento electrónico mayor, y por último, la programación de los robots, que incide en la
limitación para localizar información en los servidores más allá de un determinado nivel
de la estructura de la W eb.
De los cuatro problemas que Martínez (2002) señala en relación con la recupe-
ración de la información, dos dependen del us uario (la formulación adecuada de la pre-
gunta y la interactividad con la interface de usuario) y otros dos del funcionamiento del
motor (inadecuada indización de los documento s y la limitada actualización de los índi-
ces del motor).
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
94
Hípola y Vargas-Quesada (1999b) han criticado el desfase de estas herramientas
y su actualización irregular.
Lawrence y Giles (1998c) señalan como problemas los periodos de inactividad,
baja cobertura, interfaz poco consistente, bases de datos anticuadas, pobre ranking de
relevancia, baja precisión y dificultades con las técnicas de spam .
A modo de resumen, planteamos a continuación una sistematización de mayor
profundidad de los factores externos e internos que intervienen en la deficiente recupera-
ción de la información que presentan estas herramientas.
Entre lo factores externos, podemos señalar como más importantes: la cantidad
de información existente en la Web, el limitado acceso a la información existente que
estas herramientas proporciona, como en el caso de la Web Invisible, el carácter dinámi-
co de la información en la Web, y la falta de estructuración de los recursos.
Un trabajo de Lawrence y Giles (1999) indicaba respecto al tamaño de la Web,
que en julio de ese año estaban a disposición del público 800 millones de páginas aloja-
das en tres millones de servidores, y que los seis principales motores de búsqueda cubrían
un 60% de los recursos, siendo Northern Light el más destacado con el 16%. El gabinete
de estudios americano, Cyveillance cifraba en tonces en dos billones, el número de docu-
mentos accesibles, aumentando la cifra en siete millones diarios. Señalan, además, que
Google cuenta con la base de datos más comp leta estimada en un billón de páginas. Pero
estos datos han quedado anticuados en muy poco tiempo pues un estudio más actual de
Gulli y Signorini (2005) estima en 11,5 billones, el número de páginas indizadas y que
por tanto forman parte de la Web visible.
Tal cantidad de información dificulta y hace prácticamente imposible su total
indización ya que exige un gran despliegue de medios, y más si tenemos en cuenta el
importante núm ero de consultas diarias que soportan.
Este aspecto incide en la limitación de acceso al total de los recursos existentes
en la Web y exige tanto una selección de recursos como una especialización por materias.
Respecto al segundo punto, es decir el que se refiere a la Web Invisible, es un
hecho que los motores de búsqueda no pueden controlar toda la información de la Web.
Existe además una gran cantidad de recursos de difícil acceso para los buscadores auto-
máticos, que es lo que constituye la Web Invisible.
Introducción
95
La Web invisible está formada principalmente por todos aquellos recursos que
requieren la identificación del usuario para su acceso, como es el caso de las Intranets;
toda la información alojada en servidores que impiden el acceso a los robots de búsque-
da; la información alojada en marcos o frames y las páginas dinámicas, como por ejem-
plo las que se generan al extraer información de una base de datos 179 , un diccionario in-
teractivo, etcétera, que generan diferentes direcciones URL y que suelen alojarse tempo-
ralmente en el disco duro del usuario, impidiendo, de este modo, su indización por los
motores.
Como ya hemo s visto al tratar del trabajo de los Crawlers o arañas, determina-
dos servidores Web, que no desean que los mo tores indicen sus páginas, utilizan tanto un
protocolo de exclusión, que consiste en un documento denominado robots.txt, que se ubi-
ca en los servidores y contiene instrucciones sobre los ficheros a los que los robots tienen
o no acceso, como una etiqueta Meta, con indicaciones dirigidas a los robots 180 .
Otra información de interés que escapa a los buscadores es la contenida en ser-
vidores que ofrecen noticias de actualidad que requieren una constante actualización.
Finalmente hay que considerar en este apartado a los sitios y páginas que los ro-
bots no indizan en un sitio web, normalmente porque supera la capacidad para la que han
sido programados, y las páginas o sitios hacia los que no apunta ningún enlace.
Un estudio de Lyman y Varian, citado por Tramullas (2002:602) recoge cifras
referidas al año 2000 en las que muestra que la web visible podría contener unos 2,5 bi-
llones de páginas 181 y la web oculta quinientos cincuenta millones. También son intere-
179 Por ejemplo las bases de datos de Access, Oracle, SQL y otras. Sin embargo, com o señala Salazar
(2005:139) “Google ya está llegando a acuerdos partic ular es con bases de datos pa ra que su buscador pue-
da indicar el contenido de éstas.” En este sentido, ya ofrece acceso a una peque ña parte de la base de datos
WorldCat de OCLC (Online Computer Library Center), esto es a tan sólo dos mi llones de los cincuenta y
ocho millones de registros que contiene. Tam bién da acceso a la base de datos de la Biblioteca Nacional de
Medicina de Esta dos Unidos (NCBI).
Yahoo también facilita acceso a bases de datos de la Biblioteca del Congreso de EEUU, de la Universidad
de California en los Ángeles, la Radio Pública Naci onal de EEUU, la Universidad de Michigan y el Pro-
yecto Gutenberg así com o a otras bases de datos de pago (Financial Times, The Wall Street Journal, The
New England Journal of Medicine, las publicaciones del IEEE, etcétera). Todas ellas requieren para su
acceso al documento pagar una cuota de suscripción.
180 Los comandos y etiquetas específicas destinadas a lo s robots pued en consultarse en la siguiente página
web: <http://www.robo tstxt.org/wc/exclusion.html>
181 Cifra muy superior a la apuntada anteriormente por Lawrence y Giles, que se acerca más a la aportada
por Cyveillance
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
102
lenguaje XML aporta soluciones, como el uso de etiquetas para contener información
específica.
Estas iniciativas por un lado, y la constante evolución de los motores de búsque-
da, que tendrán que irse adaptando a estos nuevos sistemas descriptivos, por otro, permite
pensar que la recuperación de la información en la Web debe de ir mejorando constante-
mente, sin perjuicio de irse desarrollando otras iniciativas como es el caso de buscadores
especializados, catálogos de recursos, agentes inteligentes, bibliotecas digitales, etcétera.
La constante preocupación por la recuperación efectiva ha dado lugar al desarro-
llo del concepto de web semántica, concepto creado por Tim Berners-Lee. El proyecto en
la actualidad trata de desarrollar sistemas de descripción y consulta a través de estándares
que permita describir, buscar y encontrar recursos de una forma norm alizada.
En la actualidad, los desarrolladores de los motores de búsqueda, conscientes del
problema de la falta de precisión en la recuperación, tratan de resolverlo de diferentes
formas, bien mediante el desarrollo de algoritm os basados en la popularidad, como en
Google, o mediante otras opciones de búsqueda avanzada, en AltaVista, Lycos, HotBot o
Yahoo. Otras opciones utilizan el filtrado automático como es la opción “More like this”
y otras similares.
La ordenación por relevancia es otro aspecto de gran importancia en la recupe-
ración. Su importancia viene dada por el hecho de que el usuario pocas veces consulta
más de dos páginas de resultados, por lo que si una determinada herramienta quiere ser
útil para el usuario, ha de ofrecer en los primeros puestos los resultados más relevantes.
Para ello los buscadores han de aplicar técnicas de valoración por relevancia.
Arms (2001:211) se refiere a que el problema del deficiente funcionamiento de
los buscadores en este aspecto puede ser debido a que los algoritmos de ranking no tienen
suficiente información en la que basar sus resultados.
Los metabuscadores también tratan de solucionar algunos de estos problemas
mediante técnicas que valoran el contexto en el que se encuentran los términos de bús-
queda en el documento, la identificación tanto de páginas que ya no existen como de las
que no contienen los términos de búsqueda, localización de páginas duplicadas, mejora
del ranking y de la precisión. (Lawrence y Giles, 1998d).
Es por esto que hay que valorar tanto la precisión como el ranking u ordenación
de registros, ya que dichas técnicas no siempre se utilizan o lo hacen de forma eficiente.
Introducción
103
Para ello, en la evaluación valoraremos aspectos como la precisión técnica y analizare-
mos tanto la función que la metainformación puede jugar en la ordenación como las fre-
cuencias y peso de los términos de búsqueda.
3. La evaluación de los sistemas de recuperación de la informa-
ción y la s herramientas de búsque da de la World Wide Web .
3.1. Concepto y fines de la evaluación. El proceso de evaluación
Según Ingwersen (1992) la Recuperación de la Información como disciplina
científica se ocupa de diseñar, construir y probar sistemas de recuperación que faciliten el
acceso a la misma. De aquí el amplio número de estudios que se dedica a la evaluación
de dichos sistemas.
En el presente capítulo vamos a exponer el contexto en el que tienen lugar los
trabajos de evaluación de los SRI ya que en él se enmarcan los estudios de evaluación de
los buscadores web, analizaremos las experiencias más importantes desarrolladas sobre
estas herramientas y finalmente, trataremos de los indicadores seleccionados para llevar a
cabo nuestro trabajo de evaluación.
3.1.1. Concepto de evaluación
El Diccionario de la Real Academia 196 dice en sus dos primeras acepciones que
evaluar es: “Señalar el valor de una cosa. Estim ar, apreciar, calcular el valor de una cosa”.
Ello supone efectuar una medición, que bien puede ser global o basada en la va-
loración de diferentes elementos, lo que requiere el establecimiento de un sistema de me-
dida.
Pero en la evaluación de los buscadores web no existen estándares que puedan
ser utilizados para expresar sus puntos fuertes y débiles o para compararlos cuantitativa-
mente. Tampoco hay unos criterios establecidos que sirvan como referencia en la evalua-
ción sino que, como veremos al tratar sobre el estado de la cuestión, se utilizan diferentes
parámetros en función de lo que se quiere evaluar. Además se recurre a medidas y méto-
dos utilizados en la evaluación de otros sistemas de recuperación de información. En este
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
104
sentido, la utilización del método estadístico es el más recomendable, ya que facilita,
mediante la recogida, análisis, y comparación de datos, suficientes elementos objetivos
para valorar los aspectos de interés. La evaluación requiere también contrastar los datos
obtenidos con los objetivos de estos servicios y juzgar hasta qué punto se cum plen.
Desde el punto de vista de los especialistas en Recuperación de la Información,
Lancaster (1992) señala que es:
“esencialmente un procedimiento de diagnóstico (y eventualme nte terapéutico)
en el que interesa la identificación del origen de los fallos del sistema”.
En un trabajo anterior 197 indica que la evaluación de un sistema ha de hacerse
valorando si alcanza sus objetivos, si es eficiente en este aspecto y si se justifica su exis-
tencia.
Resulta interesante esta visión de Lancaster por cuanto requiere un detenido aná-
lisis de las partes del sistema; saber por qué se dan esos resultados, y ponerlo en conoci-
miento de los desarrolladores de estas herramientas para buscar soluciones que mejoren
los resultados. En este sentido, nuestro objetivo es también ofrecer una valoración impar-
cial que permita conocer, tanto a los investigadores como a los especialistas en RI, el
rendimiento de estas herram ientas en búsquedas de inform ación especializada.
Desde el punto de vista práctico, se trata tanto de una herramienta de investiga-
ción, de toma de decisiones y de gestión, que permite no sólo conocer el alcance de algu-
no de los problemas que afectan a los Sistemas de búsqueda, sino también plantear su
posible solución o mejora. Va a facilitar la tom a de decisiones tanto a los desarrolladores
del sistema como a los usuarios, ya que en función de la valoración de sus fortalezas y
debilidades, pueden decidir si usarlas o no y seleccionar la más conveniente. Como
herramienta de gestión va a servir para plantearse su futuro, su posible desarrollo, la di-
rección a seguir, etcétera. Finalmente, como herramienta de investigación permite, utili-
zando el método científico, analizar y valorar un acontecimiento, un hecho, un objeto, en
este caso los buscadores de información de la Web. Steiner (1979) ha señalado además,
196 Diccionario de la Lengua Españo la. 21ª ed. Madrid, Rea l Academia Española, 1992.
197 Lancaster (1971).
Introducción
105
su valor como herramienta de control respecto a la consecución de los objetivos marca-
dos.
Abad (2002:671) define la evaluación como :
“un proceso mediante el cual se intenta obtener un juicio de valor o una apre-
ciación de la bondad de un objeto, de una actividad, de un proceso o de sus resultados.
Esto es, la puesta en práctica de un procedimiento con el que poner de relieve las cualida-
des, ventajas y debilidades de aquello que se evalúa”.
No obstante nos parece más acertada la expresada en un trabajo posterior
(2005:41) al referirse a la evaluación tam bién como:
“proceso que tiene como objetivo la realización del diagnóstico de una situación
determinada cuy o resultado será la emisión de un juicio de va lor acerca del funcio na-
miento, calidad, aceptación o cualquier otra cualidad de un sistema de inform ación.”
En este caso, deja abierta la evaluación, pudiéndose centrar en la valoración de
la cualidad o cualidades de su funcionam iento que, en cada caso, interese analizar.
Por otro lado, esta autora señala la necesidad de un referente con el que compa-
rar, que será distinto de acuerdo con los fines que persiga la evaluación. Dado que este
aspecto no es posible en la evaluación de buscadores web, por las características dinámi-
cas de este medio, se suele recurrir al método com parativo entre distintos sistemas para
destacar alguno de ellos.
Desde un punto de vista más específico, para Harter y Hert (1997) la evaluación
es un proceso que trata de valorar la efectividad de un servicio o sistema y en qué medida
se cumplen sus m etas y objetivos.
Como resumen y en opinión de Hernon (1998), evaluar un sistema es el proceso
de identificar o recabar datos acerca de actividades y servicios específicos, estableciendo
criterios por los que pueda calcularse su bondad o acierto y determinarse la calidad de la
actividad o servicio, y el grado en que éstos logran sus m etas y objetivos.
3.1.2. Fines y objetivos
Aunque algunas de las definiciones anteriores llevan im plícitas información so-
bre para qué se evalúa, es interesante profundizar algo más en este aspecto. Abad, en una
monografía reciente (2005:20) señala que la evaluación suele responder a alguna de las
siguientes razones:
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
106
1. Medir la consecución de los objetivos previam ente establecidos.
2. Disponer de un instrumento para diagnosticar los puntos débiles en el fun-
cionamiento.
3. Facilitar el proceso de la toma de decisiones.
4. Permitir la comparación entre sistemas mediante la construcción de estánda-
res de referencia.
5. Justificar la existencia de los servicios y sistem as de información.
De este m odo se consigue valorar la eficaci a, la eficiencia o el impacto de un de-
terminado servicio; valorar la correcta realización de los procesos; tratar de responder
bien a la calidad de los procesos o a la corrección de la realización de las operaciones
documentales; finalmente, las dos siguientes razones facilitan la toma de decisiones, aun-
que en el ámbito de la Web, es difícil poder establecer estándares de referencia y sirve
para justificar el mantenimiento de un servicio o su mejora. Se tiene en cuenta la satisfac-
ción del colectivo al que va destinado y se ha de justificar el cump limiento de sus objeti-
vos y el mantenimiento de la calidad, etcétera. Desde nuestro punto de vista, al tratar de
valorar su funcionamiento, nos parecen de especial interés las razones señaladas en pri-
mero, segundo y quinto lugar. Consideram os también importante la tercera razón, ya que
ha de suponer una intención de mejora por parte de los desarrolladores de los sistemas
que obtengan los peores resultados. De lo anterior, hemos de destacar la idea de que de-
bemos conocer en prim er lugar para qué evaluamos.
En nuestro caso, éstas serían las razones para la evaluación:
-Conocer si son útiles en búsquedas de información científica y cuál o cuáles lo
son más.
-Conocer si su funcionamiento es correcto.
En este sentido, hemos de apuntar que es nuestra intención valorar tanto la reali-
zación de las operaciones documentales que llevan a cabo los buscadores y metabuscado-
res de la Web, como su correcto funcionamiento y utilidad, especialmente en recupera-
ción especializada, y establecer comparaciones que permitan seleccionar los m ás útiles.
Introducción
107
Abad ha estudiado el tipo de evaluación correspondiente a cada una de las fases
de lo que denomina “ciclo vital” de los sistemas de información 198 . Nuestra experiencia
se relaciona con la fase de funcionamiento o rutina, que se caracteriza por un funciona-
miento fluido del sistema y unos usuarios más o menos fieles. La finalidad de la evalua-
ción en esta fase es valorar si el sistema cumple con las metas y objetivos propuestos, y
cómo los cumple. Las investigaciones pueden centrarse en evaluar el comportamiento de
los componentes del sistema o en el funcionamiento global. Entre los primeros señala el
input del sistem a y el proceso documental. Respecto a los segundos, se refiere a la efica-
cia 199 de la recuperación, la eficiencia y la satisfacción. Esta segunda tendencia está más
centrada en la valoración del funcionamiento desde el punto de vista del usuario.
Crawford (1996) y Abad (2005) coinciden en que la evaluación ha de recoger in-
formación que facilite la toma de decisiones y la justificación y defensa de los recursos
empleados. Señalan además que ha de determinar la calidad del servicio, resolver en la
medida de lo posible los problemas que se presentan y descubrir las bases para nuevas
mejoras. Estos fines coinciden plenamente con los que nos hemos planteado al evaluar
los motores web, ya que seguir este planteamiento nos permitirá seleccionar los buscado-
res que ofrecen una mayor calidad ante búsquedas sobre temas especializados y conocer
cuáles son los que menos acusan los problemas detectados en estas herramientas, lo que
ha de servir además para f acilitar su mejora.
3.1.3. Proceso de evaluación
Como acabamos de ver, la mayoría de autores especializados en evaluar siste-
mas de recuperación de la información, se refieren a la evaluación como un proceso.
Abad señala las siguientes etapas, que tratarem os de seguir:
1. Obtener los datos sobre la situación actual del sistem a a evaluar.
2. Decidir los criterios según los que se evaluará el sistema y definir los indica-
dores para la obtención de resultados.
3. Recoger los datos sobre los aspectos a evaluar.
198 Señala como fases en las que se puede evaluar: Planificación, Viabilidad, Diseño, Im plantación y Fun-
cionamiento o Rutina.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
108
4. Comparar los hallazgos obtenidos con una situación de referencia o estándar.
5. Emitir un juicio de valor basado en el análisis de las diferencias y similitudes
entre la situación observada y la situación de referencia.
6. Averiguar el origen de las diferencias encontradas.
7. Establecer unas acciones y recomendaciones para la mejora.
La evaluación es un proceso complejo en el que como indican Large y otros
(1999) se ha de tener en cuenta tanto el punto de vista mecánico, el humano y la utilidad
para un grupo determinado. Los basados en el punto de vista del usuario utilizan m edidas
que tratan de valorar su satisfacción con los resultados.
Nosotros nos ocupamo s de evaluar los procesos de formación de la base de da-
tos, la composición de índices y las capacidades de búsqueda y recuperación, por lo que
deberemos utilizar los parám etros que nos permitan valorarlos.
3.2. Tendencias en la evaluación de SRI
Antes de referirnos a los indicadores, debemos tener claro qué tipo de evalua-
ción queremos llevar a cabo. La evaluación de SRI tradicionales se ha abordado princi-
palmente desde dos puntos de vista: el del sistem a y el del usuario. Inicialmente se cen-
traron tanto en medir la validez de sus índices y comparar la recuperación basada en el
lenguaje natural con la ofrecida mediante vocabularios controlados, (Cleverdon 1966,
Lancaster 1968, Aitchison 1969-1970, Keen y Digger 1972, etcétera), como en valorar la
efectividad de los sistemas, midiendo la relevancia de la información recuperada, o el
comportam iento de un determinado program a o herramienta de búsqueda.
Sin embargo para Salton (1983), una correcta evaluación debe contemplar am-
bas perspectivas y Rijsbergen (1979) piensa que la evaluación del Sistema de Recupera-
ción de Información debe reflejar la capacidad del sistema para satisfacer al usuario. La
corriente actual trata pues de integrar ambas tendencias considerando tan válida una co-
mo la otra, ya que por ejemplo, tan importante puede ser conocer la opinión de un usuario
199 Entendida como “capa cidad del sistem a de recuperar inform ación relevante para el usuario.” Abad
(2005:143).
Introducción
109
respecto a determinada característica de un sistema de recuperación como la actualiza-
ción o la cobertura de su base de datos.
Tanto Ingwersen (1992) como Ellis (1992) señala tres grandes bloques respecto
a la investigación en torno a la Recuperación de la Información, a saber: el clásico o al-
gorítmico, el orientado a usuarios y el modelo cognitivo. Este último tiene en cuenta as-
pectos relacionados tanto con el sistema como con el usuario.
Harter y Hert en un importante estudio publicado en 1997 se ocupan de analizar
con cierta profundidad diferentes planteamie ntos, problemas y métodos de la evaluación
de SRI, y reducen a dos las tendencias im portant es en este campo: la clásica y la orienta-
da al usuario. La primera se ocupa de los algoritmos y estructuras de datos necesarios
para optimizar la eficacia de las búsquedas y la segunda se centra en el usuario, en anali-
zar su interacción con el sistema de recuperación, y en el papel de las fuentes de conoci-
miento implicadas en la Recuperación de la Información. Estos autores consideran que ha
de darse mayor im portancia a la interacción usuario y sistem a.
La corriente tradicional tiene sus más claros antecedentes en las experiencias
desarrolladas en el Proyecto Cranfield, puesto en marcha por Cleverdon en 1957, para el
que se señalan dos etapas, Cranfield I (1957-1962) y Cranfield II (1963-1966), de las que
surgieron fundamentalmente un marco teórico, una metodología y unas herramientas bá-
sicas para la evaluación de SRI. Entre éstas últimas, se estableció la necesidad de contar
con una colección de documentos fuente; señalar una serie de valores para medir la efec-
tividad de los sistemas, teniendo en cuenta la recuperación de documentos relevantes y la
exhaustividad, estableciendo como m edidas la exhaustividad y la precisión.
Estos estudios tuvieron una aplicación inmediata en la evaluación de sistemas
como SMART, realizado por Salton des de inicios de los 60, la base de datos MEDLARS
(Medical Literature Analysis and Retrieval System) llevado a cabo por Lancaster entre
1966 y 1967 200 , o el caso de la base de datos STAIRS (Storage and Information Retrieval
System) evaluada por Blair y Maron en 1985.
200 Abad (200 2) señala que el tr abajo de Lancas ter “pus o en evidencia que en el contexto real no sólo e ra
necesario conocer la eficacia del sistema, sino que debían explorar la s causas que conducían al éxito y al
fracaso de la recuperación”.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
110
Como hemos señalado, los principales valores en que se basaban estas evalua-
ciones son la exhaustividad y la relevancia. Su valoración correspondía a expertos ya que
podían juzgar de forma m ás exacta el valor de los documentos o referencias recuperadas.
Las críticas a esta tendencia arrancan con Doyle (1964), quién señaló su carácter
subjetivo. Posteriormente Ellis (1984) reparó en las dificultades a la hora de definir la
relevancia. Harter y Hert (1997) por su parte, centran sus críticas en la ausencia del usua-
rio en la evaluación, en las dificultades que plantea el criterio de la relevancia, y en que
las experiencias son poco reales por lo que los resultados no pueden compararse con
otros basados en consultas y usuarios reales. Korfhage (1997) va más allá, al plantear que
no está claro que exhaustividad y precisión sean m edidas significativas para el usuario.
Estas críticas se han visto superadas en el ámbito de las experiencias TREC
(Text REtrieval Conferences), que se celebran anualmente desde 1992 y cuya metodolo-
gía para la evaluación de sistemas de recuperación, establece la existencia de una am plia
colección de documentos y unos procedimientos normalizados, dirigidos a evaluar, fun-
damentalm ente, los algoritmos que utilizan estas herramientas, así como los contenidos
de las bases de datos, su comportamiento ante diferentes búsquedas, utilización de tesau-
ros, recuperación de información en idiomas específicos, los mecanism os de recupera-
ción a través de la voz y la incorporación del punto de vista hum ano.
Pero tampoco las experiencias TREC han estado exentas de críticas, pues como
recoge Chaín (2004:184) diferentes autores han mostrado su desacuerdo en basar la eva-
luación en juicios de relevancia, en el modo en que se seleccionan los temas de búsqueda
y en los juicios poco realistas para usuarios reales. Craswell, Bailey y Hawking (1999) se
han referido a la diferencia entre los sistemas TREC que recuperan recursos planos frente
a los hipertextuales de los sistemas Web, lo que puede influir en los juicios de relevancia
al no valorar positivamente páginas que enlazan con otras que sí son relevantes. Tam poco
están de acuerdo los investigadores en que la valoración de la relevancia deba hacerse
respecto a la materia y no a la calidad del r ecurso. Blair (2002) ha criticado la forma de
Introducción
111
calcular la exhaustividad 201 ya que en su opinión se ofrecen valores superiores a la reali-
dad.
No obstante, esta corriente también ha dejado su impronta, como veremos, en
los estudios de evaluación de buscadores Web llevados a cabo por Ding y Marchionini,
Chu y Rosenthal, Clarke y W illett, y Leighton y Srivastava.
Respecto a la tendencia centrada en el usuario, para Olvera (1998:26):
“[...] trata de representar los problemas de información, comportamiento en l as
búsquedas y componente s humanos d e los sistem as de información en situaciones reales.
Se nutre princi palmente de la ps icología cognitiva y emplea métodos de las ciencias so-
ciales [...]”.
En este tipo de investigaciones entran en juego aspectos que tienen que ver con
el comportamiento mental de los usuarios y de las características de sus búsquedas de
información, teniendo en cuenta tanto al individuo como los contextos sociales y organi-
zativos (Olvera 1998). Este enfoque ha sido analizado en diferentes trabajos de autores
como Inwersen (1982), Saracevic y Kantor (1988), Spink y otros (1996), Borlund (2000),
y por Su (1994) que lo ha aplicado a los sistem as de recuperación de la W eb. En un traba-
jo de 1989 ya utilizó variables com o las aptitudes técnicas y características personales.
Esta tendencia ha ido ganando importancia en los últim os años dado que el usua-
rio tienen cada vez un acceso más directo a estos sistemas, ganando protagonismo en este
aspecto, de manera que las evaluaciones cada vez se han venido preocupando más de
expresar la opinión del usuario y su grado de satisfacción.
Criterios a tener en cuenta son los aportados por Keen, que recogen Martínez y
Rodríguez (2004a): la cobertura, entendida como la proporción de los documentos rele-
vantes conocidos que el usuario ha recupe rado; la novedad, que contempla los documen-
tos recuperados relevantes desconocidos para el usuario; la exhaustividad relativa y el
esfuerzo de exhaustividad.
201 La metodología que se emplea se basa en la constitución de una colec ción de recursos relevantes fruto
de una pr im era búsqueda en los diferentes buscad ores a evaluar, que se utiliza para comparar la recupera-
ción individual de los diferentes buscadores.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
118
Como vemos, en función del punto de vista desde el que se aborde la evalua-
ción, se utilizan diferentes medidas. En este sentido, Peña y otros (2002) proponen, según
se trate de evaluar el sistem a en sí: exhaustividad, precisión, fracaso y sus valores; el sis-
tema desde el punto de vista del usuario: exhaustividad relativa, precisión del usuario,
esfuerzo de exhaustividad, cobertura y novedad, o los procesos, proponiendo, en este
caso, la evaluación de la realimentación.
Martínez y Rodríguez (2003) han sistematizado los diferentes aspectos que se
han utilizado para evaluar SRI, valorando su necesidad y utilidad. Hacen un repaso de las
medidas tradicionales, es decir tanto de las basadas en la relevancia (precisión, exhausti-
vidad, tasa de fallo y factor de generalidad) como las orientadas al usuario (cobertura,
novedad, exhaustividad relativa y esfuerzo de exhaustividad) y otras medidas alternati-
vas, también denominadas de valor simple, que se basan en cálculos probabilísticos como
el Modelo de Swet, basado en cálculos de probabilidad de que los registros recuperados
correspondan a documentos relevantes, el Modelo de Robertson, sim ilar al anterior en sus
objetivos, el Modelo de Cooper, que trata de me dir el ahorro de esfuerzo en la consulta
de los listados de resultados de una búsqueda, las medidas SMART, etcétera. Como ve-
mos se trata de métodos que utilizan la probabilidad para valorar la exhaustividad y la
precisión, basándose en aspectos muy específicos. De la serie de medidas que analizan
para medir la efectividad de la recuperación, presentan como valores positivos: el poder
ser medidas de forma intuitiva, mediante cálculos simples; (la precisión; la exhaustivi-
dad; la cobertura y la usabilidad), junto a otras menos utilizadas o que no inciden en la
valoración de la efectividad como son el fo rmato de presentación, el contenido, el tiempo
y el coste de la búsqueda. En todos estos valores, estos autores aprecian un cierto grado
de subjetividad.
Respecto a la usabilidad, Harter y Hert (1997) la definen como la capacidad del
sistema para facilitar una ejecución efectiva, eficiente y satisfactoria de la labor del usua-
rio. Las medidas son: la exactitud, el porcentaje de errores, la recuperación, las percep-
ciones del usuario sobre la facilidad de uso y su satisfacción. Como señala Johnson, pos-
teriores investigaciones han analizado las relaciones de estas medidas con las capacida-
des cognitivas del usuario.
Jonhson y otros (2001) citan como aspectos a evaluar: la cobertura, la precisión,
el tiempo de respuesta, la utilidad, la presentación de los resultados y el esfuerzo del
usuario para obtener resultados satisfactorios. Dentro de la utilidad y valor de los recur-
Introducción
119
sos consideran: la calidad, la consistencia de los resultados y los recursos inactivos, ca-
ducados y duplicados.
Abad (2005) sigue la tendencia que señala que la evaluación de estos sistemas
en entornos reales, puede abordarse desde el punto de vista del propio sistema o del usua-
rio. En el primer caso se trata de poner de manifiesto el rendimiento del sistema en la
recuperación y establece como indicadores para ello la precisión, la exhaustividad, un
análisis de fallos, en los que se tiene en cuenta diversos aspectos que tienen que ver con
las necesidades de información, con la búsqueda, con el conocimiento del sistema y con
la interacción del usuario con el sistema. Otros aspectos que deben valorarse son los fa-
llos de precisión, de exhaustividad así como el ruido, el silencio, el índice de irrelevancia
o de generalidad. El otro punto de vista debe permitir la adaptación del sistema a las ne-
cesidades y al entorno de usuarios al que presta su servicio.
Una de las propuestas más completas la ofrecen Abadal y Codina (2005:193) al
agrupar los criterios en tres grupos en función de que tengan que ver con la base de datos
(el contenido), con el sistema de recuperación de la información (el continente) o con la
gestión o administración de la base de datos. En el primer apartado contemplan la necesi-
dad de expresar el grado de exactitud y precisión, valorando aspectos como los errores
gramaticales o de omisión, la fiabilidad de datos y los registros duplicados. Respecto al
alcance y cobertura, se han de analizar estos aspectos tanto desde el punto de vista temá-
tico como geográfico y lingüístico, el grado de inclusión, la estructura, el tam año y el
nivel de crecimiento. Por otro lado ha de valorarse, respecto a la actualización, tanto el
grado de ésta como el periodo que tarda en actualizarse. El último aspecto de la base de
datos se refiere a la consistencia, que ha de ponderarse tanto en relación con la cataloga-
ción como con el análisis de contenido. En cuanto al sistema de recuperación de la in-
formación, los criterios a tener en cuenta son: las prestaciones del lenguaje de interroga-
ción, la precisión, la exhaustividad, el tiempo de respuesta, la utilidad, los formatos de
visualización y el interfaz. Por último, respecto a la gestión de la base de datos se debe
evaluar su documentación, la atención al usua rio, el precio y sistema de facturación y el
sistema de distribución.
Desde nuestro punto de vista, estos autores son los que con mayor claridad seña-
lan los problemas que puede plantear aplicar una metodología propia de los SRI tradicio-
nales a los buscadores de la W eb.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
120
Así, teniendo en cuenta la opinión de distintos teóricos sobre el tema que seña-
lan como requisito imprescindible para la evaluación, conocer los objetivos del sistema a
evaluar, y dado que generalmente se trata de perm itir recuperar información útil al usua-
rio, que sólo él, en función de sus necesidad es de información puede juzgar, nuestra eva-
luación se enfoca a la valoración, desde un punto de vista técnico, que permita interpretar
si es correcto el funcionamiento de estas herramientas, sino también su utilidad en bús-
quedas especializadas, pudiendo el usuario, posteriorm ente calibrar de una forma perso-
nal, la utilidad de los recursos recuperados. Por lo que nos acercamos a Cooper (1973)
para quien el objetivo de un sistema de recuperación es, o debería ser, recuperar docu-
mentos útiles y no solam ente relevantes.
Respecto a los criterios, han de estar estrechamente relacionados con los objeti-
vos de la evaluación, ya que puede ir enfocada a valorar una determinada parte del siste-
ma, como puede ser la base de datos, o incluso un determinado parámetro, como por
ejemplo la ordenación, etcétera. Además hay que tener en cuenta la metodología que se
aplica, ya que muchas de estas propuestas van acompañadas de determinados medios,
como pueden ser una determinada colección de búsqueda, unas determinadas herramien-
tas que facilitan ese tipo de evaluación, etcétera.
Podemos apreciar que no todos los criterios son aplicables a los buscadores web,
ya que, sobre todo en el aspecto de la gestión, es m ucha la diferencia entre unos sistem as
y otros. Lo mismo podemos decir de la consistencia o del grado de exactitud, ya que los
registros no son creados por personas dependientes de la empresa que mantiene el busca-
dor, sino que, de existir, los datos son introducidos por personas ajenas a la compañía que
mantiene el buscador. Por eso es necesario realizar una propuesta de criterios más acorde
con el medio en el que nos encontramos. En este sentido, deberemos tener en cuenta las
recomendaciones sobre los parámetros a utilizar empleados por diferentes autores en sus
estudios, muchos de ellos caracterizados por la aplicación de algunos de estos criterios.
Será necesario analizar las distintas experiencias realizadas, aspecto del que nos ocupa-
remos en el siguiente apartado.
Además de valorar su adecuación a estos nuevos sistemas, deberemos seleccio-
nar los criterios que nos permitan valorar nuestros puntos de interés, que como hemos
apuntado, tienen que ver con el funcionamiento y con la utilidad de estas herramientas en
búsquedas especializadas. Así, nos planteamos evaluar estos servicios porque ante tal
variedad y número de buscadores, a menudo surgen dudas sobre cuál o cuáles pueden ser
Introducción
121
los más idóneos, atendiendo a su correcto func ionamiento general, a su correcta recupe-
ración mediante diferentes tipos de búsqueda, a su actualización, a su indización de los
sitios web o de las propias páginas, a la me nor recuperación de duplicados, de recursos
no activos, etcétera. Cada uno de estos aspectos requerirá sus elem entos de ponderación.
3.4. La evaluación de las herramientas de búsqueda de la World
Wide Web. Estado de la cuestión e Indicadores utilizados
3.4.1. Estado de la cuestión
En el siguiente apartado nos ocuparemos de los diferentes trabajos publicados
sobre evaluación de los buscadores con el fin de apreciar tanto los enfoques desde los que
se han realizado, los criterios utilizados y la metodología y resultados, aspectos que, en la
medida de lo posible, y siempre que persigan los mism os objetivos, trataremos de aplicar
en nuestra evaluación.
Aunque hay un gran número de trabajos de evaluación sobre diferentes aspectos
de los buscadores, no todos intentan aplicar las directrices que se trazan a partir de los
estudios teóricos, echándose de menos en este cam po, una metodología estándar propia al
respecto, siendo necesario recurrir a experiencias de diferentes servicios y sistemas de
información científica, para encontrar un m étodo de evaluación que pueda ser aplicado a
estas herramientas.
La evaluación de los motores de búsqueda se ha abordado desde diferentes pers-
pectivas: la matemática (Mizzaro), la de ingeniería mecánica e industrial y la informática
(Can, Nuray y Sevdik, Gwizdka y Chignell, Nasios y otros, Rousseau, Bharat y Broder,
Brin y Page, Courtois y Berry, Figuerola, Zazo y Berrocal, Leighton y Srivastava, Picard
y Saboy, Thelwall, Jansen y Pooch); desde el punto de vista de la biblioteconomía, la
bibliometría, las ciencias de la inform ación y documentación, (Aguillo, Bar-Ilan, Chu y
Rosenthal, Notess, Johnson, Griffiths y Ha rtley, Ljosland, Martínez, M aldonado y Sán-
chez, Olvera, Oppenheim y otros, Snyder y Rosenbaum , Vaughan, Westera, Winship), así
como los que desarrollan su labor en laboratorios de investigación o forman parte de gru-
pos multidisciplinares (Lawrence y Giles, etcétera). De aquí que podamos afirmar que la
evaluación de los buscadores tiene un m arcado carácter interdisciplinar.
En uno o en otro sentido, los puntos de interés de los investigadores en recupe-
ración de la información en la Web giran en torno a los motores y su efectividad; aspecto
sobre el que existe un amplio número de trabajos que se presentan tanto en reuniones,
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
122
jornadas y congresos monográficos, publicándose en revistas especializadas y en la Web.
Ejemplo de ello son las conferencias TREC. A partir de la séptima edición, celebrada en
1999 Hawking ha presentado importantes estudios que tratan de comparar los algoritmos
utilizados en sistemas TREC con los utilizados en la Web. Otros autores se han ocupado
de estudiar desde el punto de vista teórico aspectos relacionados con el tratamiento y de-
sarrollo de nuevas técnicas y algoritmos de recuperación (como el agrupamiento de re-
cursos relacionados, técnicas de filtrado, etcétera) así com o con la clasificación de recur-
sos manual y automática, la elaboración automática de índices y resúmenes, la búsqueda
de elementos multimedia, el uso de agentes inteligentes y el desarrollo futuro y tenden-
cias posibles, siendo la evaluación de los sistem as de recuperación uno de los temas m ás
tratados.
Es difícil sistematizar el amplio número de estudios desarrollado a lo largo de
los últimos años en torno a la evaluación de los buscadores de información de la Web, sin
embargo, Gordon y Pathak (1999) señalan dos grandes grupos: por un lado el que contie-
ne las evaluaciones que denomina testimoniales, y por otro, las cuantitativas. Las prime-
ras son las que se publican en la prensa o por empresas relacionadas con la industria in-
formática, que mediante test, comp aran: la velocidad de recuperación de información de
los motores, la facilidad de uso y el diseño de interfaces. También evalúan aspectos más
técnicos como : la posibilidad de utilizar operadores en las ecuaciones de búsqueda, la
valoración de los recursos que contiene la base de datos y el tiempo que les cuesta indizar
nuevas páginas. En este sentido podemos señalar los trabajos de Morville, Rosenfeld y
Janes (1996), Overton (1996), Courtois y ot ros (1996), Steinberg (1996) Calafia (1997),
Slot (1997) y Lake (1997).
En el otro grupo de trabajos se comp ara la efectividad entre los motores de bús-
queda, siguiendo los métodos tradicionales de evaluación que se proponen en recupera-
ción de la información. En este grupo se encuentran los trabajos más importantes sobre el
tema, que tratan de medir aspectos como la relevancia, la pertinencia o la interfaz de
usuario. (Winship 1995, Ding y Marchionini 1996, Leighton 1996-1999).
Su (2003) en una brillante sistematización de los estudios de evaluación, esta-
blece dos etapas. La primera, que compre ndería los años 1995 y 1996, caracterizada por
una serie de trabajos enfocados a orientar y facilitar la elección a los usuarios, ocupándo-
se de las características de los motores y capacidades de búsqueda, así como por la exis-
tencia de otros estudios, que aunque presentan una metodología más o menos elaborada,
Introducción
123
no alcanzan resultados homogéneos, ya que varían los criterios de evaluación tanto en
número como en tipo.
Critica la forma en que se desarrollan los test, ya que en muchos casos proceden
de consultas reales, otras son elaboradas y otras responden a intereses personales o sim-
plemente no se indica. El núm ero de consultas para la evaluación varía entre dos y diez.
En resumen, pone de manifiesto la falta de una metodología de evaluación sis-
temática y com ún que contemple a los usuarios.
La segunda etapa, entre 1997 y 2000 se caracteriza por unos estudios con crite-
rios mejor definidos y una metodología basada en criterios estadísticos y m ayor sistema-
tización.
En este periodo las medidas más empleadas son por este orden, la precisión, la
validez de enlaces, el solapamiento, la exhaustividad, la cobertura, la ordenación por re-
levancia, teniendo en cuenta tanto el punto de vista del usuario como el funcionamiento
del sistema. Otros valores usados son el tiempo de búsqueda y de respuesta, la actualidad,
el coste, etcétera.
Martínez (2002) clasifica los estudios de evaluación en: explícitos e implícitos.
Los primeros contemplan aspectos externos al motor como pueden ser: el tamaño del
índice, audiencia, el mayor o menor uso para realizar búsquedas, la porción de la página
indexada y la fidelidad. Los implícitos, junto a medidas basadas en la relevancia, se ocu-
pan de analizar los enlaces fallidos, el solapamiento y el acierto único. Este autor se ha
referido, además a la disparidad y dispersión tanto en los estudios de evaluación como en
los resultados.
Hawking y otros (2001a), desde la perspectiva de las experiencias TREC, evalú-
an la calidad de los motores web. Para ello toman las preguntas de los logs de dos de
ellos. Analizan veinte buscadores, de los cuáles dos son m etabuscadores (MetaCrawler e
Inquirus) y un directorio (LookSmart) mediante 54 consultas sobre diferentes temas. Se
valoran los veinte primeros resultados. La relevancia, basada en el contenido textual, es
juzgada por las personas que realizan la investigación utilizando valores binarios. Evalú-
an fundamentalmente la efectividad de los algoritmos de recuperación de documentos,
valorando, en la lista de recuperación, la posición de los documentos relevantes. Utilizan
sólo los enlaces activos, no penalizando la recuperación de recursos a los que no se puede
acceder ya que esto les permite establecer comp araciones con resultados obtenidos en
sistemas evaluados utilizando la metodología TREC. No obstante se apartan de ella en
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
124
otros aspectos como el prescindir del uso de una colección estándar. Los resultados
muestran diferencias en la recuperación entre los diferentes motores, y respecto a la pre-
cisión de los cinco primeros resultados, observan que no está en relación con la mayor
cobertura del índice de determinados buscadores. Los mejores buscadores utilizan algo-
ritmos cuya efectividad se aproxim a a la de los sistemas TREC.
Metodológicamente estos autores señalan la dificultad de realizar evaluaciones
que puedan ser repetidas ante la inexistencia de una colección estándar de recursos web
que lo facilite. Señalan además que se ha de tener en cuenta al plantear la evaluación, las
necesidades de información (según se trate de una pregunta directa, búsqueda de un re-
curso único, de una selección de documentos o de una necesidad de recuperación exhaus-
tiva de recursos sobre un tema) ya que, en función de ellas, la técnica utilizada será dife-
rente. Igualmente señalan la recomendación de repetirla cada cierto tiempo, así como la
necesidad de establecer unas medidas que sirvan de media y com o punto de comparación.
Desde nuestro punto de vista, se trata de una metodología muy interesante pero
plantea problemas por su carácter restrictivo, al centrar su interés fundamentalm ente en
valorar la efectividad, sin analizar otros aspectos que nos parecen deben tenerse en cuenta
como son el solapam i ento, valoración de enlaces fallidos, actualización, etcétera.
Coincidimos con estos autores en que es difícil, si no imposible, establecer una
metodología única para evaluar los motores de búsqueda, ya que los estudios se realizan
desde diferentes puntos de vista, tanto en función de la formación del evaluador, (espe-
cialista en ciencias de la computación, especialista en Documentación, bibliotecario, et-
cétera), como de la orientación, dependiendo de si el objetivo es valorar la satisfacción
del usuario o plasmar hasta qué punto es correcto su funcionamiento. Estas necesidades
pueden ser a su vez tan específicas que, dependiendo de ellas, puede establecerse una
metodología concreta. Es normal que esto haya sido así, y que cada uno haya optado por
aplicar una determinada perspectiva y los conocimientos e incluso fórmulas propias del
área de investigación a la que se dedica.
En función de tanta variedad podemos afirmar que prácticamente existen tantos
métodos de evaluación com o trabajos se han realizado.
Sin em bargo, una perspectiva de diez años en el funcionamiento y evaluación de
estos motores sí puede darnos unas pautas y unos indicadores suficientemente representa-
tivos para poder evaluarlos, pudiendo seleccionar los criterios m ás importantes que sirvan
Introducción
125
tanto a usuarios y desarrolladores, y que en definitiva, nos ayuden a cumplir los objetivos
de nuestra evaluación.
Exponemos a continuación, ordenados cronol ógicamente, los trabajos más inte-
resantes relacionados con la evaluación de los buscadores, ya que alguno de ellos es de
obligada referencia, tanto por su importancia a nivel teórico como metodológico. En el
caso de autores que han realizado diferentes trabajos de evaluación, hemos preferido pre-
sentarlos unos a continuación de otros para observar mejor, en su caso, la evolución me-
todológica utilizada en cada uno de los trabajos.
Uno de los primeros trabajos es el de Winship (1995), quien com paró los moto-
res World Wide Web Worm, WebCrawler, Lycos, Harvest y los directorios Galaxy y
Yahoo. Analizó tanto el contenido y la formación de la base de datos, valorando si indi-
zaban las direcciones URL, los títulos, los resúmenes, el texto completo así como el ta-
maño y la posibilidad de envío de direcciones por parte de usuarios, la interface, las op-
ciones de búsqueda, la recuperación, y sus prestaciones, tendiendo en cuenta además, los
mecanism os de control por parte del usuario, el contenido de los registros y el control
sobre el modo de ordenación, considerando en este sentido, el número de documentos
recuperados y su presentación. Lycos y Harvest obtuvieron los m ejores resultados.
Lycos y OpenText fueron los buscadores q ue obtuvieron m ejor puntua ción en la
evaluación realizada por Courtois, Baer y Stark (1995) que trataba de averiguar cuáles de
los motores existentes (CUIW 3, Catalog, Harvest, Lycos, OpenText, WebCrawler,
W3W orm y Yahoo) recuperaban recursos fundamentales referidos a tres temas de bús-
queda. También valoraron positivamente a WebCra wler por su rapidez y flexibilidad para
elaborar la consulta.
El mism o año comenzaron a realizarse los estudios de Leighton (1995) basados
en la precisión y tiempo de respuesta utilizando los diez primeros registros. No analizan
la exhaustividad, dado el tamaño de la Web y la disposición desestructurada de la infor-
mación. Valoran la relevancia, los recursos únicos y la validez de los enlaces (enlaces
activos, duplicados, existencia de copias en mirrors, etcétera) de InfoSeek, Lycos, Web-
Crawler y World W ide Web Worm mediante ocho búsquedas. Lycos e InfoSeek obtuvie-
ron la mejor valoración en cuanto a tiempo de respuesta y precisión, calculando esta úl-
tima en función de su adecuación a los térm inos de búsqueda. En 1997 desarrolló estos
estudios junto a Srivastava, analizando los veinte primeros resultados de quince consultas
lanzadas sobre AltaVista, HotBot, Excite, InfoSeek y Lycos, siendo AltaVista, Excite e
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
126
InfoSeek los mejor valorados, mientras que HotBot respondía mejor a consultas estructu-
radas, frente a Lycos que destacaba en búsquedas no estructuradas y breves.
Finalmente, en el trabajo de 1999 se analizaron los primeros veinte recursos ob-
tenidos en quince búsquedas lanzadas sobre AltaVista, Excite, HotBot, InfoSeek y Lycos.
Valoran los recursos asignándoles diferente categoría según se ajusten a la búsqueda y
cumplan las perspectivas esperadas por el usuario. En esta evaluación se centran en valo-
rar la capacidad de los motores de búsqueda para colocar el mayor número de docum en-
tos relevantes entre los veinte primeros resultados.
De las quince consultas, diez son preguntas de referencia realizadas por estu-
diantes, cuatro fueron extraídas de un estudio anterior (Leighton y Srivastava, 1997) y
una se ocupa de localizar información sobre una determinada persona. Las preguntas son
de tres tipos: siete están realizadas mediante una mera acumulación de palabras; otras
siete son estructuradas y la última contiene el nombre de la persona sobre la que se busca
información. Establecieron cuatro categorías de relevancia. Se centran en la valoración
de este aspecto porque consideran que para los estudiantes universitarios es más impor-
tante que la exhaustividad.
Los mejores resultados se dieron en AltaVista, Excite e InfoSeek, destacando
Lycos en búsquedas simples y no estructuradas y HotBot en las búsquedas estructuradas.
Llegan a la conclusión de que evaluar la relevancia es uno de los mayores problemas a
los que se enfrentan los estudios sobre motores de búsquedas, ya que en este estudio de-
muestran la diferente puntuación que puede adquirir un motor según lo que se entienda
por relevancia. Insisten en la necesidad de establecer una metodología correcta para la
evaluación objetiva de los motores de búsqueda, de manera que no se les perjudique ni
beneficie.
Lycos y OpenText obtuvieron los mejores resultados en el trabajo realizado por
Ding y Marchionini (1996) en el que se evaluaron tres buscadores, mediante cinco pre-
guntas, valorándose relevancia y el solapamiento, en función de los veinte primeros re-
sultados. Otros aspectos que se tuvieron en cuenta fueron la base de datos, la calidad del
índice, la funcionalidad y la usabilidad. En los resultados no se detectaron grandes dife-
rencias entre unos motores y otros.
En el mismo año, un estu dio bastante limitado, de D. B. Meghabghab y G. V.
Meghabghab (1996) analiza la efectividad, por medio de la precisión, de Yahoo, Info-
Introducción
127
seek, Lycos, Excite y WebCrawler, obteniendo los tres primeros, por este orden, los me-
jores resultados.
Leonard (1996) analizó la exactitud de resultados, facilidad de uso y posibilida-
des de la búsqueda avanzada mediante quince búsquedas en diecinueve motores de bús-
queda, llegando a la conclusión de que AltaVista era el motor que mejores resultados
ofrecía.
Davis (1996) se centró en el tamaño del índice y otros aspectos relacionados con
la recuperación de la información, observando los mejores resultados en AltaVista, Hot-
Bot e InfoSeek.
Ese año, también Slot (1996) evaluó dieciséis buscadores centrándose en el
tiempo de respuesta y la interface, siendo AltaVista y Yahoo los que ofrecían mejores
resultados. Un análisis específico de las posibilidades de búsqueda sitúa también a Alta-
Vista como el m ejor valorado.
Es importante el trabajo de Stobart y Kerridge (1996) sobre la fidelidad del
usuario al sistema de búsqueda, señalando que los aspectos por los que mantienen su fi-
delidad son, por este orden: la velocidad, el tam año y la costumbre.
Chu y Rosenthal (1996) compararon la capacidad y el rendimiento de los moto-
res AltaVista, Excite y Lycos. Para valorar el primer aspecto, utilizaron la lógica boolea-
na, truncamientos, búsquedas por campo, palabra o frase. Para analizar el rendimiento se
basaron en la cobertura, la precisión, el tiempo de respuesta, el esfuerzo del usuario y la
presentación de los documentos. Utilizaron preguntas realizadas por usuarios a un servi-
cio de referencia, observando que AltaVista superaba en estos aspectos a los otros dos
motores.
Venditto (1996) eva luó AltaVista, InfoSeek, Lycos, OpenText, WebCrawler y
World W ide Web Worm mediante un important e número de tem as de búsqueda a lo largo
de dos semanas. Se estudió la relevancia de los veinticinco primeros resultados. La efec-
tividad la calculó teniendo en cuenta en la recuperación la existencia de los sitios web
más interesantes y conocidos relacionados con cada tema. Los mejores resultados se al-
canzaron en búsquedas simples, siendo mayores las diferencias en las búsquedas comp le-
jas. InfoSeek dio los resultados mejores en cuanto a relevancia y AltaVista en cuanto a la
exhaustividad.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
134
ta búsquedas. Eliminaron las páginas que no contienen los términos de la búsqueda y en
Northern Light, los registros de la Colección Especial.
Calcularon la cobertura, el solapamiento, la actualización de la base de datos y
la indización de la W eb alcanzada por los m otores, advirtiendo que, respecto a un estudio
anterior, en el que se calculaba en una tercera parte la indización de la web visible, ahora
era sensiblemente m enor.
El solapamiento se mantuvo a un bajo nivel. La cobertura estimada, fruto de
combinar los resultados de varios buscadores fue del 42%, cifra que puede mejorarse
mediante metabuscadores como MetaCrawler. Analizaron también la cobertura de los
motores respecto al tamaño estimado de la web, obteniendo los mejores resultados, por
este orden: Northern Light, Snap y AltaVista. La menor cobertura se observó en Lycos y
Euroseek.
Otros aspectos de los que se ocuparon fueron la indización y la actualización,
analizando además de registros no válidos, el tiempo que tardan en indizar páginas nue-
vas o actualizadas, estableciendo en ciento ochenta y seis la media de días que tarda un
motor en indiza r estas pági nas. Los que más tardaron fueron Snap y Yahoo, y los que
menos Northern Light, InfoSeek y AltaVista.
Gwizdka y Chignell (1999) siguieron el planteamiento de Cleverdon (1966), que
proponía como criterios de evaluación la cobertura, el tiempo de búsqueda, la exhaustivi-
dad, la precisión, la presentación y el esfuerzo del usuario, aunque desestiman el tiempo
de respuesta y la exhaustividad, el primero por estar sujeto a variaciones en función del
estado de la red y la segunda por la constante variación de la inform ación en la Web, por
su gran volumen y por su carácter dinámi co, aspectos, que dificultan su m edición.
Además, proponen para la precisión valorar la utilidad de los enlaces que con-
tienen los recursos recuperados, utilizando lo que denominan “usefull precision”. Otros
valores para la precisión, son la precisión total, que valora la estimación objetiva otorga-
da a los registros recuperados, la mejor precisión (best precision), que tiene en cuenta
sólo los recursos más relevantes, y la precisión objetiva, calculada en función de la exis-
tencia en los documentos de los térm inos de consulta. Calculan además el ranking, el
esfuerzo de usuario y la cobertura, valorando, en este sentido, el número total de recur-
sos, la cobertura relativa y el solapam iento.
Compararon AltaVista, HotBot e Infoseek en relación con la recuperación en el
ámbito com ercial y de organizaciones de seis dominios, de los cuales, cuatro son de dife-
Introducción
135
rentes países (Alemania, Austria, Polonia y Reino Unido) y los otros dos responden a los
dominios comercial (.com) e institucional (.org). Utilizaron cuatro temas de búsqueda, en
diferentes idiomas en función del dominio. Los mejores resultados en cuanto a precisión
y cobertura, los alcanzó AltaVista. Otros resultados de interés señalaron un mal funcio-
namiento del algoritm o de ranking y un bajo solapam iento.
En un trabajo pu blicado el mismo añ o M.H. Chignell, J. Gwizdka, y C. Bodner,
(1999) trataron de demostrar mediante dos nuevas evaluaciones, los cambios en la recu-
peración en función de que las búsquedas se lancen en distintos días y horas, teniendo en
cuanta adem ás la cobertura geográfica y de diferentes dominios de Internet. En el primer
caso utilizaron los motores Exci te, In foseek y HotBot y en el segundo AltaVista, Info-
seek y HotBot. Esta segunda evaluación tuvo en cuenta la cobertura geográfica, y temáti-
ca analizando los recursos recuperados de Alem ania, Austria, Polonia y Reino Unido, así
como los recursos con dominio relativo a instituciones (.org) y los de carácter comercial
(.com). Como en el trabajo anterior, valoraron distintos tipos de precisión. Como conclu-
sión establecen la variación de los resultados en la recuperación dependiendo del contex-
to.
Maldonado Martínez, A. y Fernández Sánchez, E. (2000) evaluaron las posibili-
dades de búsqueda que soportan los buscadores Yahoo, Excite, Lycos, InfoSeek, AltaVis-
ta, Hotbot, Herdworld, AOL Netfind y Northern Ligth, valorando: si sop ortan diferentes
tipos de búsqueda booleana; si permiten acotar la búsqueda; si contienen un directorio y
si permiten la búsqueda por campos, la visualización de índices y el control de vocabula-
rio. Los resultados indicaron que Northern Light es el que más posibilidades abarcaba,
tanto en general como en cuanto a aspectos relacionados con la recuperación de informa-
ción, entre los que se valora: la posibilidad de búsqueda dentro de un conjunto, la orde-
nación temática de registros, la posibilidad de realizar búsquedas por campos, la visuali-
zación de los índices de los campos existentes y contar con herramientas de control de
vocabulario. Estas autoras publicaron en 1998 un estudio descriptivo de los principales
buscadores desde el punto de vista documental, atendiendo tanto a la recogida y análisis
de la información como a la búsqueda y resultados. Analizaron los buscadores AltaVista,
Excite, Lycos, WebCrawler, HotBot, InfoSeek, lo s ín dices Magellan, Galaxy, LookS-
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
136
mart, Yahoo y los de orientación hispana, Ole 208 , ¿Dónde? 209 , Ozu.com 210 , Ozu.es 211 ,
Elcano 212 , Biwe 213 , Hispavista 214 , Trovator 215 , Tarantula 216 y Sol 217 , de los que, estos tres
últimos son m otores.
Westerra (2000) evaluó las interfaces de búsqueda de AltaVista, Google y Hot-
Bot diferenciando entre capacidades básicas y especiales. AltaVista destacó en ambas,
mientras que Google sólo lo hizo en las básicas y HotBot en las especiales.
Uno de los estudios de mayor relieve es el publicado por Johnson, Griffiths y
Harley (2001) en el que proponen un marco para la evaluación de motores de búsqueda
desde el punto de vista de la satisfacción del usuario, señalando como puntos a analizar:
la efectividad, la eficiencia, la utilidad de los resultados y la interacción con el sistema.
Para ello se proponen medidas como la preci sión y el ranking, una serie de valores basa-
dos en el tiempo de respuesta y, respecto a la recuperación, una serie de medidas que
tratan de poner de relieve la utilidad del sistema, como son, la valoración de los enlaces y
de la recuperación en general. Respecto a la interacción del usuario con el sistema, se
valoró la satisfacción con la interface teniendo en cuenta las posibilidades de formulación
de la consulta, modificación y visualización. Finalmente, respecto a los resultados, se
analizaron aspectos, como la posibilidad de manipulación y la visualización.
Los trabajos de evaluación más recientes tratan de especializarse en determina-
dos aspectos. De este modo, Amat (2002:337) ha analizado la formación de la base de
datos, la indización y la recuperación de diecisiete sistem as españoles de recuperación de
información distribuida en Internet, valorando su similitud en la formación de los índices
con el esquema Dublín Core, las opciones y mecanism os de recuperación de los sistemas
analizados y su cobertura relativa, concluyendo que “no se pueden considerar válidas
208 http://www.ole.es
209 http://www.donde.uji .es
210 http://www.ozu.com
211 http://www.ozu.es
212 http://www.elcano.es
213 http://biwe.cesat.es
214 http://www.hispavista.com
215 http://trovator.co m bios.es
216 http://www.tarantula.com.m x
217 http://www.sol.es
Introducción
137
“islas de información filtrada” ya que “ofrecen escaso acceso a poca información insufi-
cientemente representada”.
Griesbaum (2004) ha evaluado la efectividad de tres motores de búsqueda: Al-
taVista, Google y Lycos, todos ellos en su versión alem ana 218 . Como vi ene siend o habi-
tual, analizan los veinte primeros resultados de un total de cincuenta consultas. En lo me-
todológico, para valorar estas herramientas, parten de una colección tanto de registros
como de consultas, contem plando además los criterios y m edidas para valorar la relevan-
cia. La valoración de este aspecto se lleva a cabo por un jurado compuesto por veintinue-
ve personas. Los temas de consulta se extraen del log de dos buscadores, distintos del
evaluado, y en su caso, se traducen al alemán. Google obtuvo los mejores resultados,
seguido muy de cerca por Lycos.
Un trabajo de Vaughan y Telwall (2004) ha estudiado la cobertura en la recupe-
ración de recursos de carácter comercial de distintos países (Estados Unidos, China, Sin-
gapur y Taiwan) de Google, AltaVista y AllTheWeb, constatando una mayor recupera-
ción de recursos de Estados Unidos debido al modo de trabajo de los programas que for-
man las bases de datos.
Otro aspecto que en la actualidad ha cobrado una gran importancia es el análisis
del ranking destacando los trabajos de Courtois y Berry (1999) y de Vaughan y Thelval
(2004).
De la importancia que tienen los estudios de ranking, del que más adelante nos
ocuparemos, es fiel reflejo el realizado por Vaughan (2004) en el que se estudia el com-
portamiento de Google, AltaVista y Teoma. Es interesante desde el punto de vista meto-
dológico ya que critica el uso de los valores de precisión y exhaustividad y proponen en
su lugar medidas como la correlación entre el ranking valorado por personas y el ranking
del motor de búsqueda a lo que denomina “ca lidad del ranking de resultados” (Quality of
result ranking). Frente a la exhaustividad propone valorar la recuperación de páginas si-
tuadas en los primeros lugares del ranking. El buscador que obtuvo los mejores resulta-
dos fue Google.
218 http://www.AltaVista.de, http://www.Google.de y http://www.Ly cos.de
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
138
Del contenido de todos estos trabajos se desprende la existencia de una disper-
sión de criterios en la evaluación, que puede ser fruto de la necesidad por parte de los
investigadores de buscar nuevos indicadores, como es el caso de Stobart y Kerridge
(1996) quienes proponían, además de los valores tradicionales, valorar la fidelidad del
usuario, o Leonard (1996) y Zorn y otros (1996), que se ocuparon de las posibilidades de
las búsquedas avanzadas. Davis (1996) se interesó por el tamaño del índice, Slot (1996)
por el tiempo de respuest a y la interface, mientras que Thunender, H. y Erwing, J. (1998)
lo hicieron sobre el tiempo que tardan en indizar una página y el nivel jerárquico del sitio
Web al que descienden los robots.
Sobre la tendencia a utilizar aspectos aisl ados en la evaluación de los motores de
búsqueda, hay que señalar que se mantiene hasta nuestros días. Basta con citar los traba-
jos de Stimson (1999) dedicados a comparar la recuperación de nombres de empresas en
motores de búsqueda comerciales y no comerciales, obteniendo en ambos buenos resul-
tados, por lo que recomienda no descartar ni unos ni otros en este tipo de búsquedas. Los
primeros pueden ofrecer información recopilada de diferentes fuentes, mientras que los
motores no comerciales recuperan recursos con información de la web de la empresa y
otras páginas de información general. Hay que decir también que los buscadores comer-
ciales facilitan búsquedas de información más específica gracias a sus avanzadas opcio-
nes.
Por otro lado hay que señalar una intensa corriente de evaluaciones basadas en
el cálculo de la relevancia de los mo tores de búsqueda que se plasma en los trabajos de
Ding, W. y Marchio nini, G. (1996), Leighton, H. V. (1996), Leighton, H. V. y Srivastava,
J. (1997 y 1999), Venditto, G. (1996) y Tomaiuolo, N. G. y Packer, J. G. (1996).
No sólo por el tratamiento teórico previo, sino también por su metodología des-
taca el trabajo de Chu, H. y Rosenthal, M. (1996) que proponen una selección de criterios
(cobertura, exhaustividad, precisión, tiempo de respuesta y esfuerzo de usuario) donde se
compaginan los dos puntos de vista desde los que se han venido haciendo los trabajos de
evaluación de Sistemas de Recuperación de la Información. Este trabajo ha influido cla-
ramente en la realización de otros experimentos de gran interés como los desarrollados
por M. Gordon y P. Pathak (1999), S. Lawrence y L. Giles (1998-1999).
Respecto a las evaluaciones en las que se aplica una metodología que hace espe-
cial incidencia en expresar tam bién el punto de vista del usuario, destacamos los trabajos
Introducción
139
de Su, L. T. (1997 y 2003) así como los de Johns on, F. C., Griffiths, J. R. y Hartley, R. J.
(2001).
Existe otra tendencia, llevada a cabo por autores como G. Notess 219 , D. Sulli-
van 220 o I. Aguillo 221 , que en distintos sitios Web, recogen y publican datos, que actuali-
zan continuamente, sobre determinados aspectos del funcionamiento de los buscadores
más importantes. Estos sitios constituyen un lugar de referencia obligado para conocer
determinados aspectos y características tanto de las herramientas de búsqueda como de la
recuperación de inform ación en la Web, aunque en el caso de Aguillo, sus técnicas están
más relacionadas con la Ciberm etría.
Respecto a la metodología, los distintos trabajos demuestran que no existe un
método estándar sino que, la mayoría de trabajos utiliza un procedimiento y criterios dis-
tintos así como medidas variables. Aún en el caso de experiencias de tanta importancia
como las desarrolladas en las conferencias TREC, la metodología empleada está conti-
nuamente sujeta a variaciones y a continuas críticas. Por ello, para elaborar una evalua-
ción consistente, pensamos que es conveniente detenernos en valorar la metodología uti-
lizada en los trabajos más relevantes.
En este sentido hemos de referirnos a uno los trabajos de Oppenheim , C., Mo-
rris, A. y Macknight, C. (2000), en el que se sistematizan los estudios más destacados
dentro de cuatro grupos:
1. Los que utilizan el método de Cranfiel d, cuando se conoce la existencia de un
pequeño número de páginas referentes al tema de búsqueda, que además son conocidas
por el investigador. Se contem plan en este grupo los trabajos de Both Delezar-Tiedman y
el Proyecto Erdos llevado a cabo por Bar-Ilan en 1998.
2. Los que usan el método anterior más el cálculo de la exhaustividad relativa.
Este parámetro se calcula sumando los recursos relevantes recuperados en una serie de
búsquedas, considerando que representa el universo de recursos relevantes en compara-
ción con los registros recuperados por un motor sobre el que se ha lanzado la búsqueda.
Este valor ha recibido críticas por parte de Fricke (1998) y otros autores.
219 http://searchenginessh owdown.com
220 http://www.searchenginewatch.com
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
140
Estudios de este tipo son los de Chu y Rosenthal (1996), Ding y Marchinioni
(1996), Gauch y Wang (1996), Tomaiuolo y Packer (1996), Westerra (1996), Leighton y
Srivastava (1997), Clarke y Willett (1997), Gonçalves y otros (1998), Megahaghab y
otros (1998), caracterizándose por utilizar términos más am plios de búsqueda.
3. Los que utilizan el método Cranfield más el cálculo de la exhaustividad esti-
mada, basada en una estimación estadística del número de probables recursos existentes
en la web.
En este grupo tenemos los trabajos de Bharat y Broder desarrollados en los años
1998 y 1999 y los de Lawrence y Giles (1999).
4. Los que eliminan el cálculo de la exhaustividad. Sitúa en este apartado los
trabajos de Feldman (1998) que analiza y estudia las características de AltaVista, Excite,
Lycos, HotBot, InfoSeek, Northern Light , SavvySearch, Inference Find y AskJeewes.
Kimm el (1996), incide en la cobertura y en las características de los registros. Cita tam-
bién los trabajos de Tunender y Ervin sobre indización y recuperación, en los que se
aprecia una insuficiencia e inconsistencia en la indización de motores como Lycos, Info-
Seek, AltaVista, Yahoo y Excite.
Se hallan también en este grupo los trabajos que tratan de establecer alternativas
a la precisión en la evaluación de los motores, basándose en el cálculo de la amplitud de
búsqueda estimada (ESL o Estimated Search Lenght) así como los de Agata y otros
(1997).
A pesar de todo, Oppenheim, Morris y Mc knight (2000) se refieren a la poca
consistencia de los trabajos de evaluación de los motores de búsqueda en la Web, así co-
mo a la imposibilidad de aplicar el método de Cranfield, dada la dificultad de calcular la
exhaustividad, lo que impide una correcta comparación de resultados obtenidos por unos
investigadores y otros.
Estos autores señalan además, como hecho a tener en cuenta en la evaluación,
que los motores de búsqueda, del mismo modo que la Web, están cambiando continua-
mente, por lo que los resultados de las evaluaciones son válidas por un periodo de tiempo
limitado, y que, como gran parte de los investigadores reconocen, los resultados que sus
221 http://www.cindoc.csic.es/cy bermetrics
Introducción
141
trabajos ofrecen, son indicativos de las prestaciones de los motores de búsqueda en el
mom ento en que se realizan. Esto indica que este tipo de evaluaciones son efímeras, por
lo que han de repetirse cada cierto tiempo y actualizarse de forma constante para com-
probar si los resultados han variado, valorar el dinam ismo de la Web o si han sido corre-
gidos los posibles problem as detectados. De aquí la importancia que tiene el diseño de un
método que facilite una valoración objetiva, basada en criterios científicos, y que de un
modo fácil, perm ita su repetición periódica.
Johnson y otros (2001) recogen en su trabajo alguno de los problemas que plan-
tean las evaluaciones de motores web realizadas siguiendo el mét odo de Cranfield, refi-
riéndose además a las dificultades en la utilización de valores como la exhaustividad y la
precisión, la falta de estandarización en las medidas que afectan a estos valores en unos
experimentos y otros, lo que dificulta la comparación entre diversos estudios e incluso las
diferencias de concepto de relevancia que se aplican. Finalmente, se refieren a la necesi-
dad de estudiar los motores para que las búsquedas no favorezcan a unos y otros, hacién-
dolas de un modo estándar. Llegan a la conclusión de que hay que valorar cuáles son los
criterios que pueden interesar al usuario en relación con los motores de búsqueda, anali-
zando el impacto que tienen en sus valoraciones aspectos como la velocidad de proceso,
la calidad de los resultados, etcétera.
Podemos ver hasta aquí las tendencias de evaluación que se han desarrollado
hasta la fecha. En ellas se observa la clara influencia de estudios de evaluación de Siste-
mas de Recuperación de la Información anteriores y la importancia de la opinión del
usuario en la valoración tanto de los resultados como de la interface y opciones de bús-
queda. Pero a pesar de todo, no debemos olvida r que se trata de ámbitos de recuperación
diferentes por lo que los indicadores de unos y otros se han ido distanciando.
Debemos estudiar y proponer un método que nos permita comparar diversas
herramientas para valorar su utilidad, seleccionar las mejores y, si es posible, que permita
comparar los resultados con los de otros estudios, al menos para conocer su evolución.
Para ello deberemos seleccionar los criterios necesarios que nos permitan alcanzar los
objetivos propuestos. En función de ellos seleccionaremos y propondremos los indicado-
res de evaluación que nos resulten necesarios.
Evaluación de la recuperación de informaci ón de los principales motores y m etabuscadores de la Web
142
3.4.2. Propuestas de evaluación e indicadores de los motores de
búsqueda de la Web
Es un hecho que hay una serie de criterios comúnm ente aceptados por la comu-
nidad científica que nos permiten contrastar las capacidades de los SRI, pero es evidente
que los buscadores de la Web, por sus características y las de su entorno, requieren una
adaptación de aquellos, además de la utilización de otros más relacionados con el propio
funcionamiento de estas herram ientas.
La mayoría de autores han intentado aplicar técnicas y m étodos de evaluación de
estos sistemas de recuperación a las herramientas web, pero no debemos olvidar que en el
primer caso se trata de sistemas que contie nen bases de datos con información estructu-
rada, acomodándose perfectamente a los docum entos que indizan, mientras que en la
Web, son herramientas que surgen para facilitar la localización de información en un
medio donde ésta aparece de forma poco estructurada y, a menudo, con un escaso valor
informativo. Por tanto, es ésta una de las difere ncias por l as que es necesari o plantearse si
dichas técnicas, métodos e incluso los criterios de valoración que acabamos de ver, son
aplicables a la evaluación de las herramientas web. Por otro lado, los avances técnicos
han podido influir en que algunos criterios com o el “tiempo de conexión” hayan quedado
desfasados o, en otros casos, como en el de la exhaustividad, muy utilizada en sistemas
más estructurados y especializados como pueden ser las bases de datos en soporte CD-
ROM, no se adaptan a estos sistem as.
Nos ocupamos a continuación de las propuestas elaboradas por diferentes auto-
res que se han ocupado de ofrecer, de una forma sistemática, una serie de criterios a tener
en cuenta en la evaluación de los m otores web.
Una de las primeras propuestas en este sentido es la realizada por David Jakob
(1995) que propone los siguientes aspectos a valorar:
1. Facilidad de uso.
2. Rapidez en las búsquedas.
3. Posibilidad de realizar búsquedas básicas y complejas con operadores boolea-
nos.
4. Búsquedas mediante partes de una palabra y truncamientos.
5. Utilización de búsquedas por frase y por térm inos próximos.
6. Permitir al usuario dar m ayor importancia a un término de búsqueda.
Introducción
143
7. Control por el usuario de búsquedas con términos en mayúsculas y minúscu-
las.
8. Utilización de tesauros.
9. Permitir al usuario indicar el máxim o número de registros a recuperar.
10. Indización a texto completo, mejor que sobre determinadas partes del recur-
so (aunque el usuario pueda controlar sobre qué cam pos limitar la búsqueda).
11. Proporcionar información que incluya el título y el URL del recurso.
12. Ofrecer una fácil interpretación de los resultados con marcadores de la rele-
vancia o un listado ordenado según su im portancia.
13. Indicar cuándo fue indexado el recurso.
14. Actualizar la base de datos periódicamente para eliminar recursos no activos
y caducados.
15. Permitir al usuario registrar direcciones URL no incluidas en la base de da-
tos.
En este caso, más que de criterios, este autor presenta una serie de características
que estas herramientas deberían cumplir. En la actualidad, dada su evolución, la mayoría
de aspectos han sido superados.
Podemos apreciar la gran importancia que se da a todo lo relacionado con la
búsqueda y recuperación, analizando también algunos aspectos del funcionamiento como
la indización y la actualización de la base de datos, aunque olvida elementos como la
formación de ésta y la ordenación.
Koch (1996) desde un punto de vista muy general señala siete grandes aspectos
que una evaluación de servicios de búsqueda debe analizar, a saber: el tamaño, la cober-
tura, la actualización, la formación, la indización, la recuperación, y el interfaz de usua-
rio.
Chu y Rosenthal (1996) proponen para las herramientas de la Web los siguientes
criterios de evaluación:
1. Composición de los índices, ya que en su elaboración radica el éxito de una
búsqueda en un determinado motor. Exige un c onocimiento de: la cobertura, la frecuen-
cia de actualización y la parte de la página web sobre la que se realiza la indización.
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
246
Gráfico 3.3-12. Metabus cadores. Búsqueda 4. Tip ología documental
0
5
10
15
20
25
E x c it e I xq u ic k P r o f u si o n S e a r ch Viv is im o
P ágin a ht m l com ú n
B as e d at os acc e s o a r e g is t r o s b iblio g r .
B ib liot e ca D ig it al
R e p o s it o r io
D ir e ct o r io
B u s cado r
R e vis t a e le ct r ó nica
B ib liog r af ía
L is t a d e r e cu r s o s w e b
Ar t ícu lo/In f . e s p e cializ ada
Ar t ícu lo d e r e v. E le ct r ó n ica
Co n g r e s o /T r abajo con g r e s o
Cap ítu lo d e m o n .
Ar t . d e E n cic lop e d ia
E n t r e vis t a
D icc ion ar io
N o t ici as
B lo g co m ú n e s p e cializ ado
L is t a d e co r r e o
P r o ye cto
Cu r s o o in f . d e cu r s o
F AQ
N o r m as
Resultados y análisis
247
3.3.1.4.1.5. Búsqueda de frase
Tabla 3.3.1-15. Motores . Búsqueda 5. Tipología documental
Google MSN Teoma
(Ask)
WiseNut Yahoo
Página html común 2 (4,1%) 4 (8%) 4 (8,2%) 3 (6%)
Página html en blanco 1 (2%)
Página html en lengua s orientales 1 (2%)
Imagen
Base de datos a texto completo libre
Base datos acceso restringido
Base datos acceso a registros bibliogr.
Biblioteca Digital
Repositorio
Directorio 2 (4,1%) 1 (2%) 2 (4%)
Buscador 1 (2%)
Agente de búsqueda
Normas
Lista de correo
Revista electrónica
E-libro 1 (2%)
Presentación
Bibliografía 4 (8,2%) 4 (8%) 2 (4,1%) 3 (6%)
Lista de recursos web 3 (6 ,1%) 4 (8%) 6 (12,2%) 7 (14%)
Artículo/Inf. especializada 1 (2%) 5 (10%) 5 (10,2%) 7 (14%)
Artículo de rev. Electrónica 1 (2%)
Congreso/Trabajo congreso 1 (2%) 4 (8%) 4 (8,2%)
Monografía
Capítulo de mon. 1 (2%) 2 (4%) 1 (2%)
Art. de Enciclopedia 1 (2%) 1 (2%) 1 (2%) 1 (2%)
Entrevista
Diccionario 1 (2%) 1 (2%) 1 (2%)
Noticias 2 (4,1%) 1 (2%) 1 (2%) 2 (4%)
Blog o pág. personal 2 (4%)
Blog común especializado
Página registro
Lista de correo
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
248
Google MSN Teoma
(Ask)
WiseNut Yahoo
Discurso
Proyecto 23 (46%) 14 (28%) 18 (36,7%) 15 (30%)
Curso o inf. de curso 5 (10,2%) 4 (8%) 3 (6,1%) 6 (12%)
Resumen
Repositorio
FAQ 1 (2%) 2 (4%) 3 (6%)
Normas 1 (2%) 1 (2%)
Examen
Registro
Banco de datos
Repositorio
Total
En esta búsqueda, el tipo documental más frecuente son los proyectos de investiga-
ción. Google recupera un total de veintitrés recursos de este tipo, WiseNut dieciocho,
Yahoo quince y MSN catorce. En relación con los artículos, llama la atención el descenso
de este tipo do cumental respecto al resto de búsquedas; Yahoo, con siete, es el buscador
que más recursos de este tipo recupera, seguido por MSN y W iseNut, ambos con cinco.
Los siguientes tipos en importancia son, de nuevo, las listas de recursos web y la in -
formación so bre cursos, ambos con Yahoo a la cabeza. Google recupera un libro electró-
nico y MSN y WiseNut recuperan un mayor número de recursos relacionados con congre-
sos. MSN facilita el acceso a capítulos de monografías.
MSN es el único buscador que facilita páginas en blanco en esta búsqueda.
Resultados y análisis
249
Gráfico 3.3-13 Motores. Búsqueda 5. Tipol ogía documental
0
5
10
15
20
25
Goog le MSN W iseNu t Ya h oo
P ági na html c omú n
P ági na html e n bla nco
P ági na html e n le ngu as orienta le s
D irec torio
B usc ador
E-libro
B ibli ografía
Lista de recurs os w eb
A rtícul o/Inf. es pec ial izada
A rtícul o de rev. Elec trónic a
Congres o/Tr aba jo congres o
Capítu lo de mon.
A rt. de Enci clope dia
D icc ionario
N otic ias
B log o pá g. pe rsona l
P royecto
Curso o inf. de cu rso
FA Q
N orma s
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
250
Tabla 3.3.1-16. Metabuscad ores. Búsqueda 5. Tipología docu mental
Dogpile Excite Ixquick Profusion Search Surfwax Vivisimo
Página html común 10 (20,4%) 7 (16,7%) 2 (5,1%) 2 (4,1%) 3 (6,1%)
Página html en blanco 1 (2%) 1 (2%)
Página html en lengua s orientales
Imagen
Base de datos a texto completo
libre
1 (2,4%)
Base datos acceso restringido
Base datos acceso a registros
bibliogr.
Biblioteca Digital
Repositorio
Directorio 3 (6,1%) 3 (7,1%) 1 (2,6%) 1 (2%)
Buscador 3 (6,1%)
Agente de búsqueda
Normas
Lista de correo
Revista electrónica
E-libro 1 (2%)
Presentación
Bibliografía 4 (8,2%) 3 (7,1%) 2 (5,1%) 3 (6,1%) 3 (6,1%)
Lista de recursos web 4 (8,2%) 3 (7,1%) 2 (5,1%) 4 (8,2%) 4 (8,2%)
Artículo/Inf. especializada 5 (10,2%) 7 (16,7%) 2 (5,1%) 1 (2%) 18
(36,7%)
Artículo de rev. Electrónica 1 (2,4%) 1 (2,6%)
Congreso/Trabajo congreso 1 (2,4%) 1 (2,6%) 6 (12,2%) 1 (2%)
Monografía
Capítulo de mon. 1 (2,6%) 1 (2%)
Art. de Enciclopedia 1 (2%) 1 (2,4%) 2 (5,1%) 1 (2%) 1 (2%)
Entrevista
Diccionario 1 (2%) 1 (2,4%) 1 (2,6%)
Noticias 2 (4,1%) 2 (4,8%) 3 (7,7%) 2 (4,1%)
Blog o pág. personal 1 (2,6%) 5 (10,2%)
Blog común especializado 4 (10,3%)
Página registro
Lista de correo
Discurso
Proyecto 11 (26,2%) 14 (35,9%) 22 (44,9%) 5 (10,2%)
Resultados y análisis
251
Dogpile Excite Ixquick Profusion Search Surfwax Vivisimo
Curso o inf. de curso 1 (2%) 4 (8,2%)
Resumen
Repositorio
FAQ 3 (6,1%) 1 (2,4%) 2 (5,1%) 3 (6,1%) 1 (2%)
Normas
Examen 1 (2%)
Registro
Banco de datos
Repositorio
Los metabuscadores reflejan una situación si milar a la de los buscadores, y en rela-
ción con el acceso páginas con información sobre proyectos de investigación, Search re -
cupera veintidós, Profusion cat orce e Ixquick once. Excite no recupera recursos de este
tipo.
El número de páginas HTML es superior a los facilitados por lo s motores de bús-
queda.
El metabuscador Vivisimo desta ca en la recu peración de artículos especializados, al
recuperar dieciocho, seguido a gran distanci a por Ixquick con siete. También hay que
destacar que es el único metabuscador que facilita el acceso a un libro electrónico.
Los proyectos, ocup an en esta búsqueda un lugar destacado, como pode mos apre-
ciar en Search que recupera veintidós, seguido por Profusion e Ixquick.
Otro indicador de interés es la información relativa a Congresos, destacando el me-
tabuscador Search con s eis.
Excite facilita más páginas en HTML y listados proporcionados por otros buscado-
res.
Search y Vivisimo facilitan en esta búsqueda el acceso a una página en blanco.
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
252
Gráfico 3.3-14 . Metabuscadores. Búsqued a 5. Tipología documental
0
5
10
15
20
25
Exci te Ixquick P rofusion Se arch Vivisimo
P ági na ht ml com ún
P ági na ht ml en b lanc o
B ase de da tos a tex to
compl eto libre
D irecto rio
B usc ador
E-libro
B iblio grafía
Lista de rec ursos we b
A rtículo/ Inf. esp eci alizada
A rtículo de rev. Elec trónica
Congreso /Tr aba jo congres o
Capítulo de mon.
A rt. de E nci clope dia
D icc iona rio
N otici as
B log o pá g. pe rsonal
B log c om ún es pec ial izado
P royecto
Curso o in f. de cu rso
FA Q
Exam en
Resultados y análisis
253
3.3.1.4.1.6. Búsqueda por campo
Tabla 3.3.1-17. Motores . Búsqueda 6. Tipología documental
Google MSN Teoma
(Ask)
WiseNut Yahoo
Página html común 3 (6,3%) 5 (10,2%) 1 (3,7%) 5 (10%)
Página html en blanco
Página html en lengua s orientales
Imagen
Base de datos a texto completo libre
Base datos acceso restringido 1 (2,1%)
Base datos acceso a registros bibliogr.
Biblioteca Digital 1 (2%)
Repositorio
Directorio 2 (4,2%) 2 (4,1%) 2 (4%)
Buscador 1 (2%) 1 (3,7%)
Agente de búsqueda
Normas 1 (2%)
Lista de correo
Revista electrónica 1 (2,1%) 2 (4%)
E-libro 2 (4,2%) 2 (4,1%) 2 (4%)
Presentación
Bibliografía 4 (8,3%) 2 (4,1%) 4 (14,8%) 4 (8%)
Lista de recursos web 8 (16 ,7%) 8 (16,3%) 2 (7,4%) 14 (28%)
Artículo/Inf. especializada 7 (14,6%) 14 (28,6%) 11 (40,7%) 3 (6%)
Artículo de rev. Electrónica 1 (2%)
Congreso/Trabajo congreso 6 (12,5%) 2 (4,1%) 1 (3,7%)
Monografía
Capítulo de mon. 3 (6,3%) 2 (4,1%) 1 (3,7%) 2 (4%)
Art. de Enciclopedia 2 (4,2%) 1 (2%) 2 (4%)
Entrevista
Diccionario 1 (2%)
Noticias 1 (2,1%) 1 (2%) 4 (14,8%) 1 (2%)
Blog o pág. personal 2 (7,4%)
Blog común especializado 1 (2%)
Página registro
Lista de correo 1 (2%)
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
254
Google MSN Teoma
(Ask)
WiseNut Yahoo
Discurso
Proyecto 4 (8,3%) 3 (6,1%) 5 (10%)
Curso o inf. de curso 4 (8,3%) 2 (4,1%) 5 (10%)
Resumen
Repositorio 1 (2%)
FAQ
Normas
Examen
Registro
Banco de datos
Repositorio
Total
En esta búsqueda, la recuperación de los motores se centra en facilitar artículos y
ofrecer listados con recursos web. En este sentido, los buscadores Yahoo, Google y MSN
ofrecen, por este orden, el mayor número de este tipo de listados. El mayor número de
artículos de información especializada lo recupera MSN con catorce, seguido de WiseNut
con once y Google con siete. MSN se diferencia poco de los demás buscadores aunque es
el único que facilita el acceso a bibliotecas digitales, normas, blogs especializados y listas
de correo.
Yahoo es e l único que rec upera artículos d e revistas electrónicas, facilita entradas
de diccionario y el acceso a repositorios. Su recuperación se centra más en ofrecer lista-
dos con recursos, páginas en HTML, inform ación sobre proyectos y cursos, y acceso a
recursos bibliográficos.
Google, al margen de lo antes señalado , s e caracteriza en esta búsqueda por la recu-
peración de páginas con i nformación sobre Congresos y bases de datos de acceso restrin-
gido, y junto a Yahoo, por recuperar revistas electrónicas.
La recuperación de WiseNut se caracteriza ad emás de por el alto número de artícu-
los, por ofrecer pocas páginas en HTML y un mayor acceso a noticias y blogs personales.
Resultados y análisis
255
Gráfico 3.3-15. Motores. Búsqueda 6. Tipología documental
0
2
4
6
8
10
12
14
Googl e MSN W iseNut Yahoo
P ágina ht ml c om ún
B ase da tos a cc es o res tringido
B iblioteca D igital
D irectorio
B uscador
N or ma s
Revista e lec trónic a
E-libro
B ibliografía
Lis ta de recu rsos w eb
A r tícu lo/Inf. es pec ial izada
A r tícu lo de rev. Elec trónica
Congres o/Tr ab ajo cong reso
Capítu lo de mon .
A r t. de Enci clop edia
D icciona rio
N oticias
B log o pág. pers onal
B log común es pec ial izado
Lis ta de correo
P roy ecto
Curso o inf. d e c ur so
Repos itorio
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
262
Google es el buscador que recupera un mayor número de artículos de información
especializada, seguido por las listas de recu rsos web, por las pági nas HTML, por proyec-
tos, cursos o información de cursos, documentación sobre congresos, noticias y finalmen-
te acceso a diccionarios. Supera a Yahoo en recuperación de presentaciones y proyectos.
De forma similar a Google, MSN recupera , aunque en menor número, artículos y
páginas HTML comunes, pero recupera un mayor número de recursos relacionados con
revistas electrónicas, congresos y sobre todo facilita mayor acceso a blogs particulares.
Sin embargo es inferior en la recuperación sobre cursos.
Yahoo sigue a Google en la obt ención de ar tículos, listados de recursos web y pro-
yectos de investigación, pero le supera en la recuperación de libros electrónicos e infor-
mación de cursos.
Teoma destaca por ser el buscador que más accesos ofrece a bibliotecas digitales,
pero también es el buscador que recupera mayor número de páginas en blanco, lo que
supone un funcionamiento defectuoso.
WiseNut de staca en la recuperación de noticias, mostrándose aceptable en el resto
de tipología docum ental.
Por tanto, teniendo en cuenta la tipología que puede ser más interesante en recupe-
ración de recursos especializados, esto es artículos, bibliotecas digitales, revistas y libros
electrónicos, información sobre congresos, artículos de enciclopedias y entradas de dic-
cionario, blogs especializados y proyectos de investigación, el mejor comportamiento
corresponde a Google, seguido de Yahoo y de MSN.
Tabla 0-2 Metabuscad ores. Tipología documental de las seis búsquedas
Dogpile Excite I xquick Pr ofusion Search Surfwax Vivisimo Total
Página html común 29 35 32 10 30 17 34 187
Página html en blanco 2 1 2 1 2 1 3 12
Página html en lengua s orientales 0 0 0 0 0 0 0 0
Imagen 1 1 0 0 0 1 0 3
Base de datos a texto completo
libre
1 1 1 0 1 0 0 4
Base datos acceso restringido 0 0 2 0 1 1 0 4
Resultados y análisis
263
Dogpile Excite I xquick Pr ofusion Search Surfwax Vivisimo Total
Base datos acceso a registros
bibliogr.
0 1 0 2 1 0 1 5
Biblioteca Digital 3 8 7 8 4 1 11 42
Repositorio 0 0 0 1 0 0 0 1
Directorio 1 16 11 5 4 8 0 45
Buscador 5 10 5 5 2 2 4 33
Agente de búsqueda 1 0 0 0 0 0 1 2
Normas 0 0 0 0 0 0 0 0
Revista electrónica 0 2 2 2 4 1 0 11
E-libro 0 1 3 1 1 0 1 7
Presentación 0 1 1 3 3 0 0 8
Bibliografía 7 18 13 14 24 3 11 90
Lista de recursos web 18 28 21 17 42 4 47 177
Artículo/Inf. especializada 26 74 41 34 56 7 72 310
Artículo de rev. Electrónica 0 0 1 2 1 1 0 5
Congreso/Trabajo congreso 3 4 5 7 13 2 20 54
Monografía 0 0 0 0 0 0 0 0
Capítulo de mon. 5 7 7 5 9 1 11 45
Art. de Enciclopedia 3 6 7 7 12 2 4 41
Entrevista 1 2 1 2 1 0 1 8
Diccionario 4 3 1 3 2 0 5 18
Noticias 3 10 8 5 10 13 0 49
Blog o pág. personal 7 5 3 9 12 1 13 50
Blog común especializado 2 6 3 6 3 3 3 26
Página registro 0 0 0 0 0 0 0 0
Lista de correo 0 2 0 3 0 0 0 5
Discurso 0 1 0 0 0 0 0 1
Proyecto 2 4 13 17 29 0 9 74
Curso o inf. de curso 1 9 3 8 12 1 13 47
Resumen 0 0 0 0 0 0 1 1
Repositorio 0 0 0 0 0 0 0 0
FAQ 0 3 2 2 4 1 3 15
Normas 0 0 0 0 0 0 1 1
Examen 1 1 1 0 2 0 0 5
Registro 0 0 0 0 0 0 0 0
Banco de datos 0 0 0 0 0 0 0 0
Repositorio 0 0 0 0 0 0 0 0
Total 126 260 196 179 285 71 269 1386
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
264
También entre los metabuscadores la tip ol ogía documental más común en este tipo
de búsquedas corresponde a artículos con información especializada, a páginas comunes
en HTML y a listas de recursos Web.
Excite destaca por ofrecer un mayor número de accesos a artículos especializados ,
así como a directorios y buscadores. Esto unido a la importancia de los recursos biblio-
gráficos, hace que sea un metabuscador a tener en cuenta para recuperar obras de referen-
cia.
Vivisimo es el segundo metabuscador que más artículos recupera, destacando ade-
más por ser el que mayor número de accesos a bibliotecas digitales proporciona. Otros
tipos documentales en los que so bresale son las listas de recursos, la inform ación de con-
gresos, acceso a capítulos de monografías, blogs y la información sobre cursos.
Search es el tercer metabuscador en recuperación de artículos. En el resto de tipolo-
gía documental se puede comparar a Excite, pero le supera en accesos a revistas el ectró-
nicas, presentaciones del tipo PowerPoint, bibliografías, información de congresos, capí-
tulos de monografí as, artículos de enciclopedia, listas de recursos web, pero sobre todo en
la recuperación de proyectos.
Ixquick supera al resto, en libros electrónicos. Profusion se asemeja a los mejores
metabuscadores en cuanto a la recuperaci ón de proyectos de investigación y acceso a
bibliotecas d igitales.
En resumen, E xcite es el m etabuscador que m ejor comb ina la recuperación de re-
cursos de interé s directo, como puede ser el acceso a artículos de información especiali-
zada con el acceso a otros recursos de referencia. Search es el metabuscador que ofrece
mayor cantidad de recursos de todo tipo, sin centrarse tanto en la recuperación de artícu-
los especializados. Surfwax es el metabuscador que peores cifras alcanza en la recupera-
ción de tipología documental propia de la información especializada, mientras que Vivi-
simo es un metabuscador que, ofreciendo un importante acceso a artículos especializados
y a bibliotecas digitales, facilita la recuperación de otros tipos documentales de tipo más
informativo, com o puede ser la información de cursos, listas de recursos e información
sobre Congresos.
Resultados y análisis
265
Gráfico 3.3-18. Metabus cadores. Tipología docum ental de las seis búsqued as
0
10
20
30
40
50
60
70
80
D o g p i l e E x c i t e I x q u i c k P r o f u s i o n S ea rc h S u r f w a x V i vi s i m o
P á g in a h tml c omún P á gi na h tm l e n b la nc o P á g i n a h tm l en leng ua s o r i e n ta les
I m a gen B a s e d e d a to s a tex to c ompl e to l ib r e B a se da tos a c c e s o r es tr in gi d o
B a s e d a tos a c c e s o a re gi s tr os b i b li og r . B i bl io te c a D ig ita l R e po s i to rio
D i r e c to r i o B u sc a do r A g e n te d e b ú s qu e da
N o r m a s R e v ista e l e c tr ón i c a E -l ib r o
P r e s enta c ió n B ib li og r a fí a L i s ta d e r e c u r s o s w eb
A rtíc u lo / I nf. es pec i a l iza da A r tíc ul o d e re v . E l e c tr ó n i c a C o ng r e s o/ T r a b a j o c on gre s o
Mo no gra fía C a p ítu lo d e m o n. A r t. de E nc ic lo pedi a
E n tr ev ista D i c c io na r io N oti c i a s
B l o g o pá g. p e r son a l B l o g c omún e s p e c i a l iza do P á gi n a r e gi s tr o
L ista d e c o r r e o D isc u r s o P r o y ec to
C u r s o o i n f. de c urs o R e s u me n R epo s ito r i o
F A Q N o r m a s E x a m e n
R e g i s tr o B a nc o d e da to s
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
266
4. Cobertura y solapamiento de los buscadores
4.1. Análisis de páginas únicas y solapamiento
Para valorar la cobertura entre buscadores se examina el total de páginas recupera-
das por cada bus cador en cada una de las búsquedas (generalmente cincuenta resultados,
a excepción de los motores que en determ inadas búsquedas no llegan a recuperar cin-
cuenta resultados, o simplemente no funcionan ante una determinada búsqueda). En fun-
ción de los listados de las URL y del m otor que los recupera y se extraen los datos relati-
vos a los recursos que recuperan bien sea un s ólo motor, dos, tres y así hasta el total de
buscadores evaluados.
Tabla 4.1-1. Motores de búsq ueda y metabuscadores (Base = total excluidos duplicados y errore s)
Búsqueda 1
(Término
único)
Búsqueda 2
(Lenguaje
natural)
Búsqueda 3
(Operadores
de existen-
cia)
Búsqueda 4
(Búsqueda boo-
leana)
Búsqueda 5
(Búsqueda de
frase)
Búsqueda
6 (Bús-
queda por
campo)
Total en las seis
búsquedas
Páginas recupera-
das
Frec. % Frec. % Frec. % Frec. % Frec. % Fre
c.
% Frec. %
1 buscador 113 55,1 161 66,3 212 74,1 160 72,4 137 65,9 167 71,1 950 47,5
2 buscadores 26 12,6 26 10,7 28 9,8 33 14,9 26 12,5 45 19,1 184 9,2
3 buscadores 19 9,2 14 5,8 16 5,6 20 9,0 15 7,2 8 3,4 92 4,6
4 buscadores 12 5,8 12 4,9 7 2,4 6 2,7 8 3,8 3 1,3 48 2,4
5 buscadores 15 7,3 16 6,6 12 4,2 0 0 6 2,9 4 1,7 53 2,6
6 buscadores 11 5,3 6 2,5 6 2,1 1 0,5 4 1,9 3 1,3 31 1,5
7 buscadores 2 0,9 3 1,2 4 1,4 1 0,5 5 2,4 5 2,1 20 1
8 buscadores 6 2,9 3 1,2 1 0,3 0 0 6 2,9 0 0 16 0,7
9 buscadores 0 0 0 0 0 0 0 0 1 0,5 0 0 1 0,05
10 buscadores 0 0 1 0,4 0 0 0 0 0 0 0 0 1 0,05
11 buscadores 0 0 1 0,4 0 0 0 0 0 0 0 0 1 0,05
12 buscadores 1 0,4 0 0 0 0 0 0 0 0 0 0 1 0,05
Total páginas
únicas
205 100 243 100 286 100 221 100 208 100 235 100 1998 100
Total pág.
potencialmente
relevantes
485 485 476 323 412 366 2547
Una vez sup rimidas las páginas repetidas en cada motor y aquellas a las que no se
pudo acceder (enlaces rotos), contamos con un total de 2.547 páginas útiles de las que
1998 (7 8,4%) son páginas únicas, es decir aparecen una sola vez. A partir de estas cifras,
podemos calcular el porcentaje de solapamiento que corresponde a los recursos cuya
Resultados y análisis
267
URL aparece más de una vez. Así pues, el so lapamiento estimado para todos los temas de
búsqueda es el 21,6%.
Por otro lado tenemos que casi el 47,5% de los recursos es recuperado por un bus-
cador. En otras experie ncias similares, como la llevada a cabo por Bar-Ilan (1998), el
porcentaje de r ecursos recuperados por un buscador fue del 75%, siendo en nuestro caso
mayor el solapamiento en función de la utilización de metabuscadores en la evaluación,
ya que la utilización de las bases de datos de los motores da como resultado la recupera-
ción de recursos compartidos por ambos tipos de buscadores.
Gráfico 4.1-1. Solapamiento
21,6%
Sol apa
m i ento
78 ,4 %
P á gina s
única s
No obstante este solapamiento es inferior al observado en trabajos anteriores, en los
que se obtuvo un porcentaje del 24,6%. (Salvador y Vidal, 2000).
De las 1998 páginas únicas, 950 (47,5%) fuer on recuper adas p or un único motor de
búsqueda, 184 (9,2%) páginas fueron recuperadas por dos motores y 92 (4,6%) por tres
motores.
Las búsqueda s con m en or solapamiento son, por este orden la booleana y la bús-
queda por campo. El menor solapamiento se observa en la búsqueda con operadores de
existencia.
En la búsquedas por término único, sólo uno de los resultados fue recuperado por
los doce buscadores. En la búsqueda que utiliza lenguaje natural, once de ellos recupera-
Tabla 4.1.-2. Total páginas únicas
Páginas potencialmente
relevantes
2.547
Páginas únicas 1.998
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
268
ron el mismo recurso. Otro fue recuperado por diez. En la búsqueda por frase, fueron
nueve los motores que recuperaron un m ismo recurso.
Gráfico 4.1-2. Registros único s en las diferentes búsquedas
0%
20%
40%
60%
80%
100%
B ú s q u e d a 1
( T é r m i n o
ú n i c o )
B ú s q u e d a 2
( L e n g u a j e
n a t u r a l )
B ú s q u e d a 3
( O p e r a d o r e s
de
e x i s t e n c i a )
B ú s q u e d a 4
( B ú s q u e d a
b o o l e a n a )
B ú s q u e d a 5
( B ú s q u e d a
d e f r a s e )
B ú s q u e d a 6
( B ú s q u e d a
p o r c a m p o )
T o t a l
1 2 m o t o r e s
1 1 m o t o r e s
1 0 m o t o r e s
9 m o t o r e s
8 m o t o r e s
7 m o t o r e s
6 m o t o r e s
5 m o t o r e s
4 m o t o r e s
3 m o t o r e s
2 m o t o r e s
1 m o t o r
El gráfico 4.1-2 recoge los resultados analiza dos por porcentajes, y permite apreciar
que el mayor índice de recursos recuperados p or un solo motor corresponde a las búsque-
das en las que se utilizan operadores de existencia, seguida de la búsqueda bolean y la
búsqueda por campo.
Por otro lado, vemos que el porcentaje de recurso compartidos por dos buscadores
es muy si milar en t odas las bú squedas, aunque es algo mayor en la búsqueda booleana y
por campo. Finalmente, el porcentaje de recursos recuperados por tres motores es mayor
en las búsquedas booleana y en la que se utilizó únicamente un térm ino.
Análisis global
El solapamiento observado entre los buscad ores evaluados (21,6%) resulta elevado,
en c omparación con otros t rabajos de evalu ación llevados a cabo con anterioridad, pero
dado que en ellos no se utilizaron metabuscadores, este valor da idea de la relación entre
las bases de datos de estas herramient as. Así mismo se observa que los motores recuperan
un mayor número de recurso s únicos en las búsquedas por campo y c on operadores de
existencia.
Resultados y análisis
269
4.1.1. Páginas únicas por motor de búsqueda
La distribución de páginas únicas por buscador y búsqueda aparece recogida en las
siguientes tablas. Esto nos permite conocer cuáles son los buscadores que recuperan un
mayor número de páginas únicas, la influencia en este sentido del tipo de búsqueda y si
los datos son constantes.
Tabla 4.1.1-1. Motores. Páginas única s (Base=Excluidos duplicados y errores)
Búsqueda 1
(Término
único)
Búsqueda 2
(Lenguaje
natural)
Búsqueda 3
(Operadores de
existencia)
Búsqueda 4
(Búsqueda
booleana)
Búsqueda 5
(Búsqueda de
frase)
Búsqueda 6
(Búsqueda por
campo)
Total
Google 23
(20,4%)
22
(13,7%)
28
(13,2%)
20
(12,5%)
18
(3,1%)
15
(8,4%)
126
(13%)
MSN 17
(14,7%)
23
(14,3%)
35
(16,5%)
31
(19,4%)
14
(10,2%)
26
(14,5%)
146
(15,1%)
Teoma
(Ask)
16
(13,8%)
24
(14,9%)
31
(14,6%)
Sin resultados Sin resultados Sin resultados 71
(7,3%)
WiseNut 25
(21,6%)
31
(19,5%)
30
(14,2%)
Sin resultados 13
(9,5%)
15
(8,4%)
114
(11,8%)
Yahoo 13
(11,2%)
26
(16,1%)
29
(13,7%)
26
(16,3%)
22
(16,1%)
24
(13,4%)
140
(14,5%)
Total 94
(100%)
126
(100%)
153
(100%)
77
(100%)
67
(100%)
80
(100%)
597
(100%)
Tabla 4.1.1-2. Metabuscadores. Páginas únicas (Base=Excluidos duplicad os y errores)
Búsqueda 1
(Término
único)
Búsqueda 2
(Lenguaje
natural)
Búsqueda 3 (Opera-
dores de existencia)
Búsqueda 4
(Búsqueda
booleana)
Búsqueda 5
(Búsqueda de
frase)
Búsqueda 6
(Búsqueda
por campo)
Total
Dogpile 3
(2,6%)
8
(5,0%)
2
(0,9%)
Sin resultados Sin resultado s Sin resultados 13
(1,3%)
Excite 11
(9,5%)
10
(6,2%)
11
(5,2%)
20
(12,5%)
14
(10,2%)
27
(15,1%)
93
(9,6%)
Ixquick 2
(1,7%)
3
(1,9%)
11
(5,2%)
2
(1,3%)
8
(5,8%)
4
(2,2%)
30
(3,1%)
Profusion 1
(0,9%)
3
(1,9%)
Sin resultados 15
(9,4%)
8
(5,8%)
22
(12,3%)
49
(5%)
Search 0 1
(0,6%)
6
(2,8%)
3
(1,9%)
6
(4,4%)
19
(10,6%)
35
(3,6%)
Surfwax 0 7
(4,3%)
18
(8,5%)
Sin resultados Sin resultado s Sin resultados 25
(2,5%)
Vivisimo 2
(1,7%)
3
(1,9%)
11
(5,2%)
43
(26,9%)
34
(24,8%)
27
(15,1%)
120
(12,4%)
Total 19
(100%)
35
(100%)
59
(100%)
83
(100%)
70
(100%)
99
(100%)
365
(100%)
Tabla 4.1.1-3. Total de pá ginas únicas por búsqued a
Total 113
(100%)
161
(100%)
212
(100%)
160
(100%)
137
(100%)
179
(100%)
962
(100%)
Esta última tabla, que suma los resultados de las dos tablas anteriores, muestra que
la búsqueda que ofrece un mayor número de páginas únicas (212), recuperadas por un
sólo buscador es la que utiliza los operadores de existencia, seguida por la búsqueda por
campo con 179. En tercer lugar está la búsqueda de varios términos con 161 páginas úni-
cas, seguida de la búsqueda booleana con 160. Las menores cifras de recursos únicos, es
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
270
decir donde hay más solapamiento corresponden a la búsqueda por frase (137) y a la bús-
queda por término único (113).
Por otro lado, si observamos en las tablas anteriores las cifras totales por buscador,
podemos observar que el motor de búsqu eda que más páginas únicas recupera es MSN
con 146, seguido por Yahoo con 140. En tercer lugar aparece Google con 126, y en cuar-
to y quinto puesto están WiseNut y Teoma.
Gráfico 4.1-3. Motores. Registros únicos por búsqueda
0
5
10
15
20
25
30
35
Goo gl e MSN T eoma
(A sk)
WiseNu t Yah oo
B úsque da 1
(T érmi no ún ico)
B úsque da 2
(Lengu aje na tural)
B úsque da 3
(Op eradore s de
exi stenc ia)
B úsque da 4
(B úsque da
boole ana )
B úsqu eda 5
(B úsque da de
frase)
B úsque da 6
(B úsque da por
cam po)
Atendiendo al gráfico que muestra los resultados alcanzados por cada buscador en
las seis búsquedas podemos observar que en la búsqueda por un término, a la que corres-
ponde la barra azul, WiseNut recupera e l mayor número de recursos únicos (25), seguido
por Google con 23. Los motores con menor número de recursos únicos en ésta búsqueda
son por este orden Yahoo, Te oma y MSN, siendo estos a los que corresponde un mayor
solapamiento.
En la segunda búsqueda, representada por la barra color granate, sigue siendo Wi-
seNut el motor con mayor número de páginas únicas (31), seguido por Yahoo con 26,
correspondiendo el mayor solapamiento a Google, MSN y Teom a.
En la búsqueda con operadores de existencia, es MSN el motor que más recursos
únicos recupera (35), seguido por Teoma y WiseNut. El mayor solapamiento lo r egistran
Google y Yahoo.
Resultados y análisis
271
En la cuarta búsqueda, MSN con 31 recursos únicos es de nuevo el buscador con
más recursos únicos; le sigue Yahoo con 26 y Google con 20 que pasa a ser en este caso
el que registra mayor solapamiento.
En la búsqueda por frase, es Yahoo con 22 el motor con más recursos únicos, se-
guido por Google con 18 y MSN con 14. WiseNut recuperó trece recursos únicos, siendo
estos últimos a los que corresponde un mayor solapamiento.
La búsqu eda por campo, sitúa de nuevo a MSN con 26 recursos únicos en primer
lugar, seguido de Yahoo con 24 y WiseNut y Google con 15 son los que registran un ma-
yor solapamiento.
Gráfico 4.1-4. Metabuscadores. Registros únicos por búsqueda
0
5
10
15
20
25
30
35
40
45
Dogpi l e Ex c i te I x qu i ck Profu si on Searc h Su rf w a x V i vi si m o
Bús q ue d a 1
(T ér mi no ún i co)
Bús q ue d a 2
(L eng uaje n at u r al )
Bús q ue d a 3
(Op era dor es d e
exi sten ci a)
Bús q ue d a 4
(Bú sq ued a
bo ol ea n a)
Bús q ue d a 5
(Bú sq ued a de
fr ase)
Bús q ue d a 6
(Bú sq ued a po r
cam po )
En l os metabuscadores, podemos observar tanto en Vivisimo como en Excite, Pro-
fusion y Search, un mayor número de recurs os únicos en las búsquedas avanzadas. Los
datos más destacados corresponden a la búsqueda booleana, en la que Vivisimo recupera
43 recursos únicos, a la búsqueda por frase, con 34 y a la búsque da por campo co n 27.
Los metabuscadores con mayor solapam i ento en estas búsquedas son Ixquick y Search.
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
278
4.1.2.5. Búsqueda de frase
Tabla 4.1.2-5. Solapamiento (Base=registros operati vos y no duplicados)
En la búsqueda por frase llama la atención el aumento de las cifras de solapamien-
to, lo que puede ser debido a la especificidad de la búsqueda. En general, los motores se
solapan de forma semejante entr e si . De st aca el solapamiento de MSN con WiseNut
(10,6%) y con Google (8,7%). El menor solapamiento se da entre este busca dor y Yahoo
(5,3%).
Respecto al solapamiento de motores con los metabuscadores, podemos observar
unos índices más o menos si milares, que sólo destacan en el caso de Yahoo con Excite
(10,6%) o de Google con Search (10,1%). En el otro extremo destaca Vivisimo, siendo,
en esta búsqueda, el metabuscador con menor sol apamiento entre las herramientas anali-
zadas.
Entre los metabuscadores, se mantienen los altos porcentajes y sólo disminuyen en
el caso de Vivisimo.
Google MSN Teoma
(Ask)
(Sin
resultados)
WiseNut Yahoo Dogpile
(Sin
resultados)
Excite Ixquick Profu-
sion
Search S urfwax
(Sin
resultados)
V
ivisimo
Google - 18
(8,7%)
17
(8,2%)
16
(7,7%)
19
(9,1%)
17
(8,2%)
18
(8,7%)
21
(10,1%)
3
(1,4%)
MSN 18
(8,7%)
- 22
(10,6%)
11
(5,3%)
16
(7,7%)
15
(7,2%)
17
(8,2%)
19
(9,1%)
5
(2,4%)
Teoma
(Ask)
(Sin
resultados)
WiseNut 17
(8,2%)
22
(10,6%)
- 13
(6,3%)
11
(5,3%)
14
(6,7%)
15
(7,2%)
22
(10,6%)
7
(3,4%)
Yahoo 16
(7,7%)
11
(5,3%)
13
(6,3%)
- 22
(10,6%)
17
(8,2%)
15
(7,2%)
20
(9,6%)
5
(2,4%)
Dogpile
(Sin
resultados)
Excite 19
(9,1%)
16
(7,7%)
11
(5,3%)
22
(10,6%)
- 25
(12%)
20
(9,6%)
22
(10,6%)
4
(1,9%)
Ixquick 17
(8,2%)
15
(7,2%)
14
(6,7%)
17
(8,2%)
25
(12%)
- 23
(11,1%)
19
(9,1%)
8
(3,8%)
Profusion 18
(8,7%)
17
(8,2%)
15
(7,2%)
15
(7,2%)
20
(9,6%)
23
(11,1%)
- 22
(%)
(10,6%)
4
(1,9%)
Search 21
(10,1%)
19
(9,1%)
22
(10,6%)
20
(9,6%)
22
(10,6%)
19
(9,1%)
22
(10,6%)
- 6
(2,9%)
Surfwax
(Sin
resultados)
Vivisimo 3
(1,4%)
5
(2,4%)
7
(3,4%)
5
(2,4%)
4
(1,9%)
8
(3,8%)
4
(1,9%)
6
(2,9%)
-
Resultados y análisis
279
4.1.2.6. Búsqueda por campo
Tabla 4.1.2-6. Solapamiento (Base=registros operati vos y no duplicados)
Google MSN Teoma
(Ask)
(Sin
resulta-
dos)
WiseNut Yahoo Dogpile
(Sin
resulta-
dos)
Excite Ixquick Profu-
sion
Search Surfwax
(Sin
resulta-
dos)
Vivisimo
Google - 15
(6,1%)
0 23
(9,3%)
13
(5,3%)
14
(5,7%)
0 12
(4,9%)
17
(6,9%)
MSN 15
(6,1%)
- 0 12
(4,9%)
7
(2,8%)
10
(4%)
2
(0,8%)
12
(4,9%)
13
(5,3%)
Teoma
(Ask)
(Sin
resultados)
WiseNut 0 0 - 0 4
(1,6%)
0 0 13
(5,3%)
0
Yahoo 23
(9,3%)
12
(4,9%)
0 - 9
(3,6%)
8
(3,2%)
0 10
(4%)
11
(4,5%)
Dogpile
(Sin
resultados)
Excite 13
(5,3%)
7
(2,8%)
4
(1,6%)
9
(3,6%)
- 14
(5,7%)
0 14
(5,7%)
11
(4,5%)
Ixquick 14
(5,7%)
10
(4%)
0 8
(3,2%)
14
(5,7%)
- 1
(0,4%)
9
(3,6%)
12
(4,9%)
Profusion 0 2
(0,8%)
0 0 0 1
(0,4%)
- 0 0
Surfwax
( Sin
resultados)
Search 12
(4,9%)
12
(4,9%)
13
(5,3%)
10
(4%)
14
(5,7%)
9
(3,6%)
0 - 11
(4,5%)
Vivisimo 17
(6,9%)
13
(5,3%)
0 11
(4,5%)
11
(4,5%)
12
(4,9%)
0 11
(4,5%)
-
En la búsqueda por campo se obs erva un alto solapamiento de Google y Yahoo
(9,3%), siendo representativo el que mantiene con MSN (6%) y éste con Yahoo (4,9%).
Con WiseNut no hay solapamiento, en ningún caso.
Respecto al solapamiento con los metabusca dores, lo primero que llama la atención
es que WiseNut, que apenas tiene solapamiento, alcanza un índice del 5,3% con Search.
Google se solapa con Vivisimo (6,9%), con Ixquick (5,7%), con Excite (5,3%) y
con Search (4,9%). MSN se solapa con Vivisi mo, Search e Ixquick. El solapamiento de
Yahoo con el resto de metabuscadores es similar, a excepción de Profusión, con el que no
hay solapamiento.
Entre los metabuscadores, Excite se solapa con Ixquick, Profusion y Vivisimo, pero
no hay solapamiento con Profusion, que en esta búsqueda apenas tiene solapamiento tan-
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
280
to con buscadores como con metabuscadores. Vi visimo e s, en esta ocasión el metabusca-
dor con mayor solapam iento con el resto.
Análisis global
Tabla 4.1.2-7. Solapamiento (Base=registros operativos y no duplicados en las seis búsquedas)
La presente tabla muestra el solapamiento entre motores de búsqueda y metabusca-
dores teniendo en cuenta los cincuenta primeros recursos recuperados en las seis búsque-
das.
El primer problema al que nos enfrentamos en el análisis de los datos es que hay
búsquedas en las que los buscadores no recupera ron recursos, lo que da lugar a que en
estos casos, las cifras de solapamiento sean bajas. Esto ocurre sobre todo con Teoma,
Surfwax y Dogpile que no recuperaron en tres de las búsquedas. También, aunque en
menor medida se aprecia en WiseNut y P rof usión que no r ecuperaron en una de l as bús-
quedas.
Por tanto, nos centraremos en valorar el solapamiento entre buscadores y metabus-
cadores que recupera ron recursos en todas las búsquedas, lo que nos perm itirá conocer el
mejor modo de combinarlos para obtener búsquedas más completas. Las cantidades que
Google M SN Teoma
(Ask) WiseNut Yahoo Dogpile Excite Ixquick Profusion Search Surfwax Vivisimo
Google
53
(11,7%)
14
(6,3%)
26
(7,8%)
83
(17,2%)
31
(7,5%)
68
(10,7%)
56
(8,9%)
39
(8,5%)
92
(11,6%)
4
(2,4%)
40
(7,2%)
MSN 53
(10,4%)
-
9
(4,1%)
33
(9,9%)
39
(8%)
29
(7%)
41
(6,4%)
45
(7,1%)
47
(10,3%)
86
(10,8%)
6
(3,7%)
62
(11,1%)
Teoma
(Ask)
14
(2,7%)
9
(2%)
-
4
(1,2%)
17
(3,5%)
32
(7,7%)
32
(5%)
25
(3,9%)
24
(5,2%)
13
(1,6%)
4
(2,4%)
45
(8,1%)
WiseNut 26
(5,1%)
33
(7,3%)
4
(1,8%)
-
20
(4,1%)
13
(3,1%)
22
(3,4%)
40
(6,3%)
26
(5,7%)
76
(9,6%)
29
(17,9%)
42
(7,5%)
Yahoo 83
(16,4%)
39
(8,6%)
17
(7,7%)
20
(6%)
-
30
(7,2%)
71
(11,2%)
50
(7,9%)
43
(9,4%)
88
(11,1%)
2
(1,2%)
39
(7%)
Dogpile 31
(6,1%)
29
(6,4%)
32
(14,6%)
13
(3,9%)
30
(6,2%)
-
70
(11%)
48
(7,8%)
31
(6,7%)
62
(7,8%)
11
(6,7%)
56
(10%)
Excite 68
(13,4%)
41
(9,1%)
32
(14,6%)
22
(6,6%)
71
(14,7%)
70
(16,9%)
-
103
(16,4%)
61
(13,3%)
98
(12,4%)
9
(5,5%)
58
(10,4%)
Ixquick 56
(11%)
45
(10%)
25
(11,4%)
40
(12%)
50
(10,3%)
48
(11,6%)
103
(16,2%)
-
66
(14,4%)
91
(11,5%)
33
(20,3%)
69
(12,4%)
Profusion 39
(7,7%)
47
(10,4%)
24
(10,9%)
26
(7,8%)
43
(8,9%)
31
(7,5%)
61
(9,6%)
66
(10,5%)
-
72
(9,1%)
11
(6,7%)
36
(6,4%)
Search 92
(18,2%)
86
(19,1%)
13
(5,9%)
76
(22,9%)
88
(18,2%)
62
(15%)
98
(15,4%)
91
(14,5%)
72
(15,7%)
-
28
(17,2%)
83
(14,9%)
Surfwax 4
(0,7%)
6
(1,3%)
4
(1,8%)
29
(8,7
2
(0,4%)
11
(2,6%)
9
(1,4%)
33
(5,2%)
11
(2,4%)
28
(3,5%)
-
25
(4,5%)
Vivisimo 40
(7,9%)
62
(13,7%)
45
(20,5%)
42
(12,6
39
(8%)
56
(13,5%)
58
(9,1%)
69
(11%)
36
(7,8%)
83
(10,5%)
25
(15,4%)
-
505 450 219 331 482 413 633 626 456 789 162 555
Resultados y análisis
281
aparecen en la tabla indican el número t otal de recursos con solapamiento recogido en las
seis búsquedas entre las herramientas de búsqueda correspondientes. Los porcentajes se
han calculado sobre el total de recursos solapados que corresponden a cada herramienta
de búsqueda, que es la cifra que aparece al final de las columnas.
Teniendo en cuenta lo anterior, podemos apreciar que las herramientas de búsqueda
en las que se da un mayor sol apamiento son los metabuscadores. En este sentido, Search
es la herramienta de búsqueda con mayor solapamiento (789 recursos), seguido de Excite
con 633 e Ixquick con 626, correspondiendo el menor solapamiento de los metabuscado-
res que recuperan en todas las búsquedas a Vivisimo.
Entre los buscadores e s MSN el que menos solapamiento presenta seguido de Ya-
hoo, siendo Google el que más resultados solapados ofrece.
MSN tiene mayor solapamiento con Google que con Yahoo y con los metabuscado-
res Search y Vivisimo, con los que coincide en la recuperación de 86 resultados, un
19,1% y 62 (13,7%) páginas respectivamente. Co rresponde a Exci te la recuperación del
menor número de recursos comunes, esto es 41 (9,1%).
Google tiene el mayor solapamiento con Yahoo, con el que coincide en 83 páginas,
(16,4%) y con el metabuscador Search, con el que coincide en 92 páginas (18,2%). El
menor solapamiento lo obtiene con MSN y con el metabuscador Vivisimo.
De for ma recíproca, Yahoo tiene un alto solapamiento con Google, 83 (16.4%) des-
cendiendo considerabl emente el que mantiene con MSN 39 (8%). Con Search y Excite
también mantiene un alto solapamiento, al coincidir en 88 recursos con el primer caso,
(18,2%) y en 71 (14,7%) con el segundo. El menor solapamiento de este motor se da con
Vivisimo.
Teoma regist ra el mayor s olapamiento con Google y Yahoo así como con el meta-
buscador Vivisimo, con el que llama la atenci ón el hecho de que coincidan en la recupe-
ración de 45 recursos (8,1%) e n tan sólo tres de las consultas en las que Teoma aportó
resultados, cifras que en proporción, resultan elevadas.
El mayor solapamiento de W iseNut se da con MSN y Google y con el metabusca-
dor Search. Dogpile es con el que menor coincidencia de resultados existe.
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
282
En cuanto a los m etabuscadores, Excite tiene un solapamiento en torno al 11% con
Yahoo y con Google, disminuyendo al 6,4% con MSN. Con los metabuscadores el sola-
pamiento es mayor ya que alcanza un 16,2% con Ixquick y un 15,4% con Search, des-
cendiendo a un 9,1% con Vivisimo.
Ixquick tiene un solapamiento similar con los tres buscadores que recuperaron en
las seis búsquedas, esto es Google, Yahoo y MSN con porcentajes del 8,9%, 7,9% y 7,1%
respectivamente. Como ya hemos señalado, hay un alto solapamiento con el metabusca-
dor Excite y también con Search (14,5%). Con Vivisimo el porcentaje disminuye al 11%.
El solapamiento de Search es similar con los tres buscadores, oscilando entre el
10,8% con MSN y el 11,6% de Google, aspecto que se repite en los metabuscadores con
los que los porcentajes van del 10,5% con Vivisimo al 12,4 con Excite.
Finalmente Viv isimo alcanza su ma yor solapamiento con MSN (11,1%), siendo
muy similar al obtenido con Google y Yahoo (7,2% y 7% respectivamente). Search es el
metabuscador con el que más so lapamiento existe (14,9%), seguido de Ixquick (12,4%) y
Excite (10,4%).
De todas estas cifras podem os deducir que una buena combinación para obtener re-
sultados distintos y posiblemente más completos sea la combinación de Google con MSN
o de Yahoo con MSN, puesto que son los que ofrecen menos solapam iento entre ellos.
Respecto a los metabuscadores, el que mejor se complementa con el resto de bus-
cadores, y que por t anto es aconsejable en búsquedas exhaustivas es Vivisimo, si bien,
hay que tener en cuenta su solapamiento con MSN. En este mismo sentido, también po-
demos decir que resulta menos aconse j able el uso de Excite y Search.
Por otro lado, también debemos de tener en cuenta, al valorar el solapamiento entre
buscadores, que se deben considerar además otros aspectos como por ejemplo el carácter
de la información, ya que un bajo solapamiento por si sólo no puede ser del todo definiti-
vo en la elección de dos o más herramientas complem entarias puesto que puede ocurrir
que alguna de ellas recupere preferentemente recursos comerciales o de otro tipo, y no de
investigación.
Resultados y análisis
283
5. Análisis de la precisión técnica
Para el análisis de la precisión técnica en la primera búsqueda, nos basamos en las
frecuencias con las que aparece el tér mino en los documentos recuperados, que es la
metodología utilizada por los investigadores que se han ocupado de estudiar este aspec-
to. En el resto de las búsquedas, dado que prácticamente no se recuperan recursos con-
teniendo todos los términos, optamos por analizar las frecuencias con las que aparecen
de forma individual determinados términos o frases de búsqueda.
5.1. Búsqueda de un término
Para el cálculo de la precisión técnica en esta búsqueda utilizaremos la fórmula
propuesta por B ar-Ilan (19 98) que calcula la precisión hallando el tanto por ciento que
se obtiene al dividir el número de docum entos que contienen el término de búsqueda
por el número de docum entos accesibles. Para ello se basa en los resultados ofrecidos en
la búsqueda de un término. De aq uí qu e es te cálculo sólo se pueda aplicar a la primera
búsqueda.
La s iguiente tabla recoge l os datos aportados en dicha búsqueda por los buscado-
res evaluados.
Tabla 5.1-1. Búsqueda 1. Recursos anali zados
Recursos que contienen el término de búsqueda: 206 (38,2%)
Recursos que no contienen el término de búsqueda
en el texto: 316 (58,7%)
Recursos a los que no se pudo acceder por dar
error: 16 (2,9%)
Total recursos analizados 538 (100% )
En base a estos datos, la frecuencia técn ica de las herramientas de búsqueda anali-
zadas es del 38,2%, muy inferior a la obtenida por Bar-Ilan (7 7,2%), para quién esta alta
precisión, como expresa en sus conclusiones fue motivo de sorpresa, por lo que plantea
la necesidad de más investigación en este aspecto, y que trate de responder por qué los
usuarios se quejan de la poca precisión frente a los resultados por él obtenidos.
La diferencia de valores obtenidos entre el trabajo de Bar-Ilan y el nuestro puede
ser debida a los términos de búsqueda, ya que este autor utiliza en su trabajo un término
muy específico, concretamente el apellido “Erdos” para recuperar registros relacionados
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
284
con este matem ático. Este tipo de búsquedas c on un térm ino tan concreto re quiere de los
buscadores una alta precisión ya que es difícil recuperar, como ocurre con otros térmi-
nos, palabras derivadas o lingüísticamente relacionadas que utilicen la misma raíz. En
nuestro caso al tratarse del término “Sof tbot”, los buscadores recuperaron un gran nú-
mero de recursos con el término en plural , que aunque la valoración de la precisión
técnica no han sido dados por válidos, no es tan e specífico como el anterior. Por tanto,
podemos observar la existenci a de va riacione s en los resultados, en función de los tér-
minos, por lo que una vez más hemos de tener en cuenta que los datos son indicativos, y
que para establecer conclusiones categóricas, es necesar io segui r investigando y utilizar
para las comparaciones resultados obtenidos utilizando los mismos términos. No obs-
tante nuestros datos sirven para precisar la opinión de Bar-Ilan en cuanto a su extrañeza
respecto a los resulta dos sobre la precisión en su búsqueda.
En cualquier caso, y además, teniendo en cuenta que se trata de una muestra redu-
cida, los datos son suficientemente reveladores de la poca precisión técnica que caracte-
riza a estas herramientas de búsqueda, utilizan do términos relativam ente específicos.
Los datos que arrojan de forma individual los buscadores son los siguientes:
Tabla 5.1-2. Motores. Frecu encia de aparición del término “softbot”
Google MSN Teoma
(Ask) WiseNut Yahoo
Recursos que
contienen el
término de bús-
queda
24 (48%) 13 (26%) 11 (22%) 11 (22% ) 25 (50%)
Recursos que no
lo contienen 26 (52%) 31 (62%) 36 (72%) 36 (72%) 22 (44%)
Recursos a los
que no se pudo
acceder
0 6 (12%) 3 (6%) 3 (6%) 3 (6%)
Total recursos
analizados 50 (100%) 50 (100%) 50 (100%) 50 (100%) 50 (100%)
Desde este punto de vista, se aprecia una mejora en los resultados al alcanzar, en
los mejores casos, una precisión técnica en torno al 50%, como es el caso de Yahoo y
Google. No obstante hay que señalar que estos valores siguen estando por debajo de lo
que corres pondería a herramientas de búsqueda en las que se requiere, al realizar bús-
quedas especializadas, resultados de una mayor precisión.
Por otro lado, los peores resultados, con altos porcentajes de recursos que no con-
tienen el término de búsqueda, corresponden a MSN, seguido de Teoma y WiseNut.
Esto puede ser debido a que recuperan un important e número de páginas que contienen
el término en plural , lo que, además de un problema de recuperación, supone una no-
table falta de precisión.
Resultados y análisis
285
Tabla 5.1-3. Metabuscadore s. Frecuencia de aparición del término “softbot”
Dogpile Excite I xquick Profusion Search Surfwax Vivisimo
Recursos que
contienen el
término de
búsqueda
19 (38%) 32 (64%) 10 (31,2%) 21 (51,2%) 20 (40%) 3 (20%) 17 (34%)
Recursos que
no lo contie-
nen
30 (60%) 17 (34%) 21 (65,6%) 19 (46,3%) 29 (58%) 12 (80%) 32 (64%)
Recursos a
los que no se
pudo acceder
1 (2%) 1 (2%) 1 (3,1%) 1 (2,4%) 1 (2%) 0 1 (2%)
Total recursos
analizados 50 (100%) 50 (100%) 32 (100%) 41 (100%) 50 (100%) 15 (100%) 50 (100%)
Excite es el metabuscador con mayor precisión técnica ya que presenta un porcen-
taje superior al de los motores, por lo que constituye una herramienta de búsqueda a
tener en cuenta en búsquedas que requieran una alta precisión técnica.
Sólo Profusión supera tímidamente el 50%, correspondiendo los peores resultados
a Surfwax con el 20%.
5.2. Búsqueda utilizan do el lenguaje natural
En las siguientes búsquedas hemos anal izado tanto el número de documentos que
no contienen los términos de búsqueda como la frecuencia de aparición de los términos
en cada recurso, para lo que, dado que los resultados apenas ofrecen algún recurso con
todos los términos de búsqueda solicitados, hemos descompuesto los términos de la s
búsquedas por palabras y frases.
Los términos y frases seleccionados en los que hemos basado el análisis son los
siguientes:
Búsqueda completa:
1. best-match information retrieval in web search engines
Términos y frases:
2. best
3. match
4. best-match
5. information retr ieval
6. web search
7. web search engines
8. search engines
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
286
Ofrecemos en primer lugar un análisis individual de los resultados relac ionados
con cada uno de los buscadores, para presentar a co ntinuación, un análisis comparativo
entre ellos.
5.2.1. Análisis individualizado de l os motores de búsqueda
Las siguientes tablas muestran el comportamiento de los buscadores en cuanto a la
frecuencia de aparición de los té rminos de búsqueda en los recursos recuperados. Dado
que como hemos indicado, prácticamente ninguna de estas herramientas recuperó pági-
nas conteniendo todos los términos solicitados en las búsquedas de más de un término,
teniendo en cuenta la metodología que diferentes autores utilizan para valorar la preci-
sión técnica, nos pareció interesante valor ar en qué medida, los recursos contenían algu-
no de los términos o frases de búsqueda.
La primera tabla que se muestra a continuación del nombre de cada buscador re-
coge el número de recursos analizados en cada búsqueda. A continuación, las demás
tablas muestran, en la primera columna el número de veces que aparece un término o
frase en un recurso. Así, cuando no aparecen los términos en las páginas, el resultado es
cero. La segunda columna recoge el número de recursos en los que aparece. La tercera
indica el porcentaje que ese número supone entre los recursos recuperados.
Google
Tabla 5.2.1-1. Nº de recursos analizados
Nº Recursos 50
Tabla 5.2.1-2. Frecuencia y nº de recur sos en los que aparecen los términos
“ best-match information retriev al in web search engines”
Nº de v eces
que apare-
cen los
términos
Nº de
recursos
Porcentaje
0 50 100%
Como podemos apreciar, en esta segunda búsqueda Google no recupera páginas
con todos los términos.
Resultados y análisis
287
Tabla 5.2.1-3. Frecuencia y nº de rec ursos en los que aparece el término “ best”
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 10 20%
1 16 32%
2 7 14%
3 5 10%
4 4 8%
5 3 6%
9 4 8%
10 1 2%
Total 50 100%
El porcentaje de páginas que no contiene este término (20%), es elevado y sensi-
blemente superior al que ofrecen MSN (8%), W iseNut (12%) y Yahoo (14%) lo que
indica que este buscador valora en menor medida que el resto no tiene en cuenta en la
recuperación la aparición de los términos de búsqueda en los documentos que recupera.
Por otro lado, llama la atención el alto número de docum ent os en los que el térm ino sólo
aparece una vez (16 documentos).
Tabla 5.2.1-4. Frecuencia y nº de rec ursos en los que aparece el término “ match”
Nº de v eces
que aparecen
los términos
Nº de recursos Porcentaje
0 12 24%
1 14 28%
2 8 16%
3 6 12%
4 2 4%
12 1 2%
15 2 4%
18 4 8%
39 1 2%
Total 50 100%
En relación con el término “match“, los resultados de la presente tabla muestran
dos grupos, el primero de ellos formado por documentos con frecuencias bajas, no su-
perando cuatro apariciones por documento (el 60% de los recuperados) y u n segu ndo
grupo (el 14% de los documentos) con frecuencias de aparición entre 12 y 18 veces por
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
294
MSN ofrece en esta ocasión frecuencias similares a las de Google, superándole és-
te al recuperar recursos sin los términos, frente a 32 de MSN.
Tabla 5.2.1-17. Frecuencia y nº de recurs os en los que aparecen los términos “ w eb s earch engines"
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 40 80%
1 6 12%
2 1 2%
3 2 4%
32 1 2%
Total 50 100%
Como ocurre con Goog le, también MSN recupera un alto número de recursos sin
los tres términos.
En general la recuperación de estos términos es similar en Google, con una recu-
peración de recursos con frecuencias bajas y en el otro extremo, la recuperación de al-
gún recurso en el que los térm inos aparecen con una frecuencia elevada (32 veces).
Tabla 5.2.1-18. Frecuencia y nº de recurs os en los que aparecen los términos “ search engines"
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 21 42%
1 1 2%
3 2 4%
4 1 2%
5 1 2%
7 1 2%
8 2 4%
10 2 4%
11 1 2%
12 3 6%
13 1 2%
15 1 2%
18 2 4%
21 2 4%
27 1 2%
33 1 2%
Resultados y análisis
295
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
35 2 4%
36 1 2%
42 1 2%
49 1 2%
57 1 2%
73 1 2%
Total 50 100%
También en estos términos el comportamiento es similar a Google, si bien MSN
ofrece un mayor número de páginas con diferentes frecuencias de aparición de los tér-
minos. Destaca además por la recuperación de un recurso en el que estos términos apa-
recen en 73 ocasiones.
En resumen, la precisión técnica en MS N es en esta búsqueda, aunque es muy s i-
milar en algunos términos a Google, superándolo en cuanto a porcentajes de páginas
que contienen los términos de búsqueda, y en la variedad de frecuencias que muestran
los documentos recuperados. Al margen de la recuperación con el término compuesto,
best-match que no es muy fr ecuente en los recursos recuperados, como se ha demostra-
do en el comportamiento con el resto de términos, este buscador da importancia a la
existencia de los términos de búsqueda en los docum entos que recupera.
Teoma (Ask)
Tabla 5.2.1-19. Nº de recursos analizados
Nº Recursos 50
Tabla 5.2.1-20. Frecuencia y nº de recurs os en los que aparecen los términos “ best-match informa-
tion retrieval in web search engines”
Nº de v eces
que apare-
cen los
términos
Nº de
recursos
Porcentaje
0 50 100%
Como en los buscadores anteriores, Teoma tampoco recupera páginas con todos
los términos de la búsqueda
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
296
Tabla 5.2.1-21. Frecuencia y nº de recu rsos en los que aparece el término “ best"
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 12 24%
1 13 26%
2 7 14%
3 6 12%
4 8 16%
5 1 2%
7 1 2%
9 1 2%
10 1 2%
Total 50 100%
Teoma es el motor que menos recursos con e ste término recupera, y se caracteriza
por una recuperación en dos grupos. En el primero de ellos, con muy bajas frecuencias,
que correspondería al 90% de los recursos recuperados, con frecuencias no superan los
cuatro casos, y el segundo grupo (8%) sólo aparece en una ocasión.
Tabla 5.2.1-22. Frecuencia y nº de recu rsos en los que aparece el término “ match”
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 15 30%
1 15 30%
2 10 20%
3 3 6%
4 2 4%
5 1 2%
10 1 2%
12 1 2%
15 1 2%
39 1 2%
Total 50 100%
Teoma sigue mostrando el comportamiento en dos grupos, si bien, en esta oca-
sión, si que recup era un recurso con alta frecuencia de aparición del término (39 veces),
que también aparecía en los buscadores anteriores. El alto número de recursos sin el
término de búsqueda influye en su baja precisión técnica.
Resultados y análisis
297
Tabla 5.2.1-23. Frecuencia y nº de recu rsos en los que aparece el término “ best-match"
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 38 76%
1 10 20%
3 1 2%
9 1 2%
Total 50 100%
Teoma destaca en esta ocasión por la recuperación de un mayor número de recur-
sos (10) en los que el térm ino compuesto aparece una vez, pero también hay que desta-
car la recuperación de un recurso en el que aparece en 9 ocasiones.
Tabla 5.2.1-24. Frecuencia y nº de recurs os en los que aparecen los términos “ information retrieval"
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 27 54%
1 7 14%
4 1 4%
5 2 4%
6 1 2%
12 1 2%
13 2 4%
15 2 4%
16 2 4%
19 1 2%
22 1 2%
24 1 2%
35 1 2%
Total 50 100%
Dentro de las características señaladas, aunque Teoma sigue mostrando un alto
número de recursos en los que los términos de búsqueda no aparecen, en esta ocasión
supera las frecuencias mostradas por Google, aunque sin alcanzar los datos de MSN.
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
298
Tabla 5.2.1-25. Frecuencia y nº de recurs os en los que aparecen los términos “ w eb s earch"
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 22 44%
1 10 20%
2 2 4%
3 2 4%
4 3 6%
5 1 2%
6 1 2%
7 2 4%
8 1 2%
9 1 2%
11 1 2%
14 2 4%
21 1 2%
52 1 2%
Total 50 100%
El comportamiento es similar al observado en los términos an teriores, destacando
respecto a los anteriores por el número de páginas (10) en las que los términos de nuevo
la recuperación de páginas en las que aparecen tan sólo en una ocasión.
Tabla 5.2.1-26. Frecuencia y nº de recurs os en los que aparecen los términos “ w eb s earch engines”
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 28 56%
1 8 16%
2 6 12%
4 2 4%
5 1 2%
7 2 4%
12 1 2%
14 1 2%
32 1 2%
Total 50 100%
También aquí mantiene las características observadas anteriormente en cuanto a la
compensación entre el alto número de resultados con bajas frecuencias y los recursos
Resultados y análisis
299
con frecuencias superio res. Recupera en esta ocasión un m ayor número de recursos con
estos términos que Google y MSN.
Tabla 5.2.1-27. Frecuencia y nº de recurs os en los que aparecen los términos “ search engines"
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 16 32%
1 2 4%
2 3 6%
3 3 6%
5 1 2%
6 2 4%
7 1 2%
10 1 2%
11 3 6%
16 1 2%
17 1 2%
18 1 2%
19 1 2%
23 1 2%
26 1 2%
30 1 2%
33 1 2%
36 1 2%
38 1 2%
39 1 2%
42 1 2%
46 1 2%
57 1 2%
65 1 2%
77 1 2%
81 1 2%
114 1 2%
Total 50 100%
Teoma (Ask) recupera un importante número de recursos con frecuencias altas,
destacando por la recuperación de un recurso en que los términos aparecen en 114 oca-
siones. Por otro lado, se mantiene como el resto en cuanto a recursos con menores fre-
cuencias.
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
300
En definitiva, Teoma (Ask) tiene para esta búsqueda un comportamiento sim ilar a
Google, al que supera, al igual que al resto, en el caso del término “ best-match” y en la
recuperación de un menor número de recursos que no contienen los términos de bús-
queda analizados.
WiseNut
Tabla 5.2.1-28. Nº de recursos analizados
Nº Recursos 50
Tabla 5.2.1-29. Frecuencia y nº de recurs os en los que aparecen los términos “ best-match informa-
tion retrieval in web search engines “
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 50 100%
WiseNut tampoco recupera páginas con todos los términos de la búsqueda.
Tabla 5.2.1-30. Frecuencia y nº de recu rsos en los que aparece el término “ best "
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 6 12%
1 12 24%
2 11 22%
3 6 12%
4 2 4%
5 1 2%
6 3 6%
7 1 2%
9 2 4%
11 1 2%
12 1 2%
14 1 2%
16 1 2%
35 1 2%
38 1 2%
Total 50 100%
Resultados y análisis
301
WiseNut y MSN son los buscadores en los que menor es el número de páginas re-
cuperadas que no contiene el término de búsqueda. En general, este último recupera un
gran número de recursos en los que el térmi no aparece una vez (17) frente a 6 recursos
en WiseNut. Éste a su vez recupera más r ecursos en los que el término aparece 2 y 3
veces, aunque WiseNut recupera menor número de recurs os de altas frecuencias de apa-
rición del término que MSN. Sin embargo recupera dos documentos de 35 y 38 casos,
que no recuperó aquél.
Tabla 5.2.1-31. Frecuencia y nº de recu rsos en los que aparece el término “ match"
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 9 18%
1 21 42%
2 15 30%
3 2 4%
6 1 2%
8 1 2%
19 1 2%
Total 50 100%
WiseNut tiene en esta ocasió n un comportamiento m ás irregular que el observado
respecto al término anterior, destacan do el alto núm ero de recursos en los que el térm ino
aparece en el texto sólo en una o dos ocasiones.
Tabla 5.2.1-32. Frecuencia y nº de recu rsos en los que aparece el término “ best-match"
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 49 98%
1 1 2%
Total 50 100%
WiseNut sól o recup era un recurso en el que el término compuesto aparece una
vez, s iendo similar a MSN, si bien en el documento recuperado por éste, el término apa-
recía dos veces.
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
302
Tabla 5.2.1-33. Frecuencia y nº de recurs os en los que aparecen los términos “ information retrieval"
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 47 94%
1 1 2%
3 1 2%
19 1 2%
Total 50 100%
WiseNut sólo recupera tres registros con estos términos, ofreciendo en este senti-
do el peor resultado en comparación, no sólo con los anteriores, sino con el resto de
motores de búsqueda.
Tabla 5.2.1-34. Frecuencia y nº de recurs os en los que aparecen los términos “ w eb s earch"
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 41 82%
1 2 4%
2 1 2%
3 1 2%
4 1 2%
6 1 2%
12 1 2%
13 1 2%
18 1 2%
Total 50 100%
Las frecuencias d e recuperación de páginas que no contienen los términos de bús-
queda son también en esta ocasión las más elevadas, lo que confir m a la baja precisión
técnica de este m otor.
Tabla 5.2.1-35 . Frecuencia y nº de recurs os en los que aparecen los tér minos “ w eb se arch engines"
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 47 94%
2 2 4%
11 1 2%
Total 50 100%
Resultados y análisis
303
Como en los términos anteriores, corresponden a este buscador los mayores por-
centajes de recursos sin los términos de búsqueda.
Tabla 5.2.1-36. Frecuencia y nº de recurs os en los que aparecen los términos “ search engines"
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 35 70%
1 5 10%
2 3 6%
11 1 2%
13 1 2%
25 1 2%
34 1 2%
36 1 2%
42 1 2%
70 1 2%
Total 50 100%
WiseNut también aquí destaca por el alto porcentaje de recursos que no contienen
estos términos (70%), lo que unido a la mayor recuperación de recursos con bajas fre-
cuencias, da lugar a una baja precisión técnica.
En resumen, debemos mencionar en primer lugar el desigual comportamiento de
este buscador en la recuperación de documentos con los diferentes términos de búsque-
da analizados. Las diferencias observadas por ejemplo entre la recuperación de los dos
primeros términos, tal vez puedan ser debidas a la distinta frecuencia con que pueden
aparecer estos términos en los documentos ya que el segundo término ( match ) es más
específico. No obstante, la recuperación de un único recurso con el término “ best-
match ” nos permite afirmar que existe un deficiente funcionamiento en este motor en
relación con términos compuestos.
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
310
cumentos de frecuencias con valores más bajos. WiseNut se caracteriza por la recupera-
ción de muchos documentos en los que el término aparece en pocas ocasiones y una
variedad de documentos en los que aparece muy frecuentemente. Yahoo tiene un com-
portamiento más variado, destacando por la recuperación de un documento en el que el
término se utiliza en cuarenta o casiones.
En la recuperación de este término hay cierta relación con lo señalado para el an-
terior, sobre todo en MSN y Yahoo s i bien se observa un crecimiento en la recuperación
de documentos en los que el término aparece solo en una ocasión o dos, como podemos
apreciar en WiseNut. Google y Teoma recupe ran en esta ocasión más recursos con m a-
yores frecuencias de aparición del término.
Gráfico 5.2.2-2. Motores. Frecuencia del término “ match”
0
5
10
15
20
25
Google MSN Teoma
(A sk)
WiseNu t Yahoo
0 1 2 3 4 5 6 7 8
10 12 14 15 16 18 19 25 39
Nº de veces que aparece el término
Nº d e
recu rsos
Resultados y análisis
311
En este caso llama la atención el alto número de recursos que no contienen el tér-
mino compuesto. Teoma es el buscador que recupera más páginas con el término segui-
do de Yahoo y Google, aunque todos ellos con una recuperación más que discreta, más
aún si tenemos en cuenta que se trata de los términos más específicos de la búsqueda, lo
que indica una baja precisión en la recuperación realizada por estas herramientas.
Gráfico 5.2.2-3. Motores. Frecuencia del término “best-match”
0
10
20
30
40
50
Goog le MSN Teoma (A sk) W iseNu t Yah oo
0
1
2
3
8
9
Gráfico 5.2.2-4. Motores. Frecuencia de los términos “information retrieval”
0
5
10
15
20
25
30
35
40
45
50
Google MSN Teoma (Ask) WiseNut Yahoo
012345 689 10 11 12 13 15 16 17
18 19 22 23 24 25 27 28 29 30 35 38 40 47 87 90
Nº de
recu rsos
Nº de
recu rsos
Nº de veces
que aparece
el término
Nº de veces que aparece el término
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
312
En la gráfica podemos observar que los valores de las frecuencias de aparición de
estos términos en los documentos recuperados son variables alternando documentos de
bajas frecuencias con otros de altas. Por otro lado el comportamiento d e los motores es
desigual, destacando el caso de WiseNut por los pocos recursos que contienen el térmi-
no. Google cas i alcanza el valor d e cinco repeticiones en un mismo documento en va-
rios de ellos mientras que en MSN, Teoma y Yahoo apenas aparecen tres veces en algu-
nos de los documentos. Sin Embargo MSN y Yahoo recuperan otros documentos con
altas frecuencias de aparición. Por otro lado Teoma recupera el mayor número de pági-
nas en las que los términos aparecen sólo una vez.
La recuperación de documentos con estos términos es similar a la a nterior aunq ue
se aprecia un leve aumento de las frecuencias. También podemos hablar de la existencia
de una cierta similitud entre los buscadores, aunque Teoma destaca en la recuperación
Gráfico 5.2.2-5. Moto res. Frecuencia de los términos “web search”
0
5
10
15
20
25
30
35
40
45
Go ogl e MSN T eoma (A sk) W iseNut Yahoo
0 1 2 3 4 5 6 7 8 9 10 11 12 13 14
17 18 19 21 24 52
Nº de
recu rsos
Nº de veces que aparece el término
Resultados y análisis
313
de más pági nas e n las que los términos aparecen con poca frecuencia, y por ser el motor
que recupera un menor número de recursos que no contienen estos términos. Además,
junto a Yahoo, es el motor que más variedad de frecuencias obtiene. Corresponden a
WiseNut los peores resultados.
De nuevo lo más destacado es la escase z de páginas que contienen los términos.
Teoma y Yahoo son los motores con mayor número de páginas con los términos y ma-
yor variedad de frecuencias. Todos los buscadores a excepción de WiseNut r ecuperan
un recurso con la frecuencia más alta (32). MSN recupera un escaso número de páginas
con los términos, y en su mayor parte sólo aparece la frase una vez.
Estos términos son más frecuentes en los documentos recuperados pues sólo en
WiseNut de staca el número de recursos que no los contienen. Corresponde a Yahoo una
mayor precisión técnica ya que ofrece el menor número de páginas que no contienen los
términos d e búsqued a al mismo ti empo que facilita un importante número de recursos
con frecuencias de aparición variadas. En la misma línea, pero con mayor número de
páginas sin los temas de búsqueda, podemos situar a MSN y Teoma, destacando éste
último por recuperar el recurso con mayor fr ecuencia. La recuperación de Google tiene
menos en cuenta la aparición de los términos.
Gráfico 5.2.2-6. Motores. Frecuencia de los térmi nos “web search engines”
0
5
10
15
20
25
30
35
40
45
50
Goo gle MSN T eoma
(A sk)
WiseNut Yahoo
012345 79 11 12 14 32
Nº de
recu rsos
Nº de veces que aparece el término
Evaluación de la recuperación de inform ación de los principales motores y metabuscadores de la Web
314
En la presente gráfica podemos obser var que a excepción de WiseNut, la existen-
cia de estos términos en los recursos recuperados es más frecuente que los inmediata-
mente anteriores. La mayor precisión técnica corresponde a Yahoo y Teoma que son los
que menor número de recursos recuperan sin los términos de búsqueda así como por la
recuperación de un mayor número de documen tos con las frecuencias más elevadas.
Gráfico -5.2.2-7. M otores.Frecuencia de los términos “search engines”
0
5
10
15
20
25
30
35
Go o g le M SN T e o m a ( A s k ) Wis e Nu t Y a h o o
01 2345 678 10 11 12 13 14 15
16 17 18 19 20 21 23 25 26 27 30 32 33 34 35
36 38 39 40 42 46 49 51 57 65 70 73 77 81 11 4
N º de ve ce s q u e apar e ce e l t é r m in o
Nº de
recu rsos
Resultados y análisis
315
En definitiva, y dado que no se recuperaron recursos con todos los términos, si te-
nemos en cuenta las expresiones más especí ficas de la búsqueda como es el caso de
“best-match”, “information retrieval” y “web search engines”, es muy poca la diferen-
cia, a excepción del bajo comportam iento observado en WiseNut, que hay entre los mo-
tores de búsqueda, pues aunque en relación con los últim os términos podríamos destacar
a Yahoo, por la recuperación del término “best-match” destaca Teoma (Ask).
5.2.3. Análisis individualizado por metabuscado res
Dogpile
Tabla 5.2.3-1. Nº de recursos analizados
Nº Recursos 43
Tabla 5.2.3-2. Frecuencia y nº de recur sos en los que aparecen los términos “ best-match information
retrieval in w eb seacrh e ngines”
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 43 100%
El metabuscador Dogpile no recupera páginas con todos los términos de la bús-
queda.
Tabla 5.2.3-3. Frecuencia y nº de rec ursos en los que aparece el término “ best"
Nº de v eces
que apare-
cen los
términos
Nº de recursos Porcentaje
0 12 27,9%
1 6 14%
2 9 20,9%
3 5 11,6%
4 5 11,6%
5 1 2,3%
8 1 2,3%
9 1 2,3%
10 1 2,3%
12 1 2,3%
13 1 2,3%
Total 43 100%
[Document text truncated for crawler view.]