scieee AI-readable full text Open interactive document viewer

OpenAlex: características, ventajas y limitaciones de una alternativa abierta para la recuperación y el análisis de la producción científica

Borrego, Ángel; Urbano, Cristóbal

Abstract

Resumen: OpenAlex es una base de datos bibliográfica abierta que surge como alternativa a las plataformas comerciales tradicionales, especialmente en un contexto de transformación de los sistemas de evaluación científica hacia modelos más transparentes y basados en datos abiertos. Este trabajo analiza sus características, fuentes de información, entidades principales, ventajas y limitaciones. Los resultados revelan un elevado volumen de registros que carecen de resumen, afiliaciones y referencias, deficiencias en la identificación de tipologías documentales e idiomas y problemas en el control de autoridades y versiones. Aunque OpenAlex ha sido adoptado en iniciativas relevantes y muestra resultados comparables a los obtenidos con bases de datos comerciales en determinados productos de evaluación, las lagunas en sus metadatos y la falta de homogeneidad obligan a un intenso trabajo de depuración de datos que aconseja un uso cauteloso. El estudio concluye que la mejora de la calidad de los datos requeriría de tres líneas de actuación: incrementar el compromiso de las editoriales para completar los metadatos en fuentes primarias, crear estructuras de coordinación que puedan canalizar el papel de los usuarios institucionales y dimensionar el proyecto con un equipo humano suficiente y procedimientos fiables que puedan dar respuesta a las tareas internas de control de calidad de los datos y a las solicitudes de asistencia formuladas por los usuarios.

Full text

OpenAlex: características, ventajas y limitaciones de una alternativa abierta para la recuperación y el análisis de la producción científica Ángel Borrego; Cristóbal Urbano Universitat de Barcelona Facultat d’Informació i Mitjans Audiovisuals Centre de Recerca en Informació, Comunicació i Cultura (CRICC) Melcior de Palau, 140; 08014 Barcelona ORCID: 0000-0002-6462-3966; 0000-0003-0935-6436 [email protected]; [email protected] Fecha de publicación: 4 de diciembre de 2025, v1. Depositado en Zenodo con DOI: 10.5281/zenodo.17818799. CC-BY Atribución/Reconocimiento 4.0 Internacional. Este preprint no ha sido revisado por pares antes de su difusión. Cualquier comentario será bienvenido. Resumen OpenAlex es una base de datos bibliográfica abierta que surge como alternativa a las plataformas comerciales tradicionales, especialmente en un contexto de transformación de los sistemas de evaluación científica hacia modelos más transparentes y basados en datos abiertos. Este trabajo analiza sus características, fuentes de información, entidades principales, ventajas y limitaciones. Los resultados revelan un elevado volumen de registros que carecen de resumen, afiliaciones y referencias, deficiencias en la identificación de tipologías documentales e idiomas y problemas en el control de autoridades y versiones. Aunque OpenAlex ha sido adoptado en iniciativas relevantes y muestra resultados comparables a los obtenidos con bases de datos comerciales en determinados productos de evaluación, las lagunas en sus metadatos y la falta de homogeneidad obligan a un intenso trabajo de depuración de datos que aconseja un uso cauteloso. El estudio concluye que la mejora de la calidad de los datos requeriría de tres líneas de actuación: incrementar el compromiso de las editoriales para completar los metadatos en fuentes primarias, crear estructuras de coordinación que puedan canalizar el papel de los usuarios institucionales y dimensionar el proyecto con un equipo humano suficiente y procedimientos fiables que puedan dar respuesta a las tareas internas de control de calidad de los datos y a las solicitudes de asistencia formuladas por los usuarios. 1. Introducción Los índices de citas como herramienta para la búsqueda de bibliografía científica tienen su origen en 1963, con la creación por Eugene Garfield del Science Citation Index con una cobertura inicial de 613 revistas y 1,4 millones de citas (Urbano, 2016). Esta base de datos no solo proporcionó un innovador sistema de recuperación de la información basado en las citas que permitía rastrear la influencia y conexión entre investigaciones, sino que revolucionó la forma de evaluar la ciencia al permitir medir la visibilidad de las publicaciones. La cobertura de la base de datos se amplió con la creación del Social Sciences Citation Index y del Arts and Humanities Citation Index que quedaron finalmente integrados en una plataforma que adoptó el nombre de Web of Science. 2 Durante años, Web of Science mantuvo una posición prácticamente exclusiva en la evaluación de la ciencia a nivel internacional, siendo la principal fuente para el análisis de citas y la medición del impacto de las publicaciones académicas. Esta hegemonía comenzó a declinar en 2004 con la aparición de Scopus, una base de datos desarrollada por Elsevier que amplió la cobertura de revistas, especialmente en ciencias sociales y humanidades, así como de publicaciones no anglosajonas (Mongeon & Paul-Hus, 2016). También en 2004 apareció Google Scholar, una herramienta gratuita con un enfoque distinto, basado en la indexación automática a texto completo de una amplia gama de documentos académicos disponibles en la web, incluyendo artículos, informes, libros o tesis. A diferencia de las bases de datos bibliográficas tradicionales, Google Scholar ofrece una alternativa de alcance masivo, aunque con menor control sobre la calidad de las fuentes (Orduña-Malea et al., 2016). En 2009, surgió Microsoft Academic, un motor de búsqueda que buscaba competir con Google Scholar. Aunque en sus primeros años tuvo un desarrollo limitado y fue suspendido temporalmente, el proyecto fue relanzado en 2016 con mejoras en su cobertura y capacidades de análisis semántico. A pesar de estas mejoras, Microsoft anunció1 el cierre definitivo de Microsoft Academic en mayo de 2021 (Chawla, 2021). Poco después del cierre de Microsoft Academic, OurResearch, una organización sin ánimo de lucro conocida por haber creado Unpaywall —una extensión de navegador que indexa versiones gratuitas y legales en acceso abierto de artículos científicos— anunció el lanzamiento de OpenAlex2. OpenAlex se define como una base de datos bibliográfica abierta que toma su nombre de la Biblioteca de Alejandría y que tiene por objetivo ofrecer una alternativa sostenible, accesible y de código abierto para el análisis de la producción científica global, heredando parte del modelo y los datos de Microsoft Academic Graph. Su lanzamiento se produjo a inicios de 2022 (Chawla, 2022). En septiembre de 2025, Our Research anunció un cambio en el nombre de su marca3, que pasaba a ser OpenAlex, con dos proyectos bajo su paraguas: Unpaywall y Unsub, una herramienta, ésta última, orientada a la evaluación de suscripciones a paquetes de revistas y la valoración de opciones de cancelación. Decir que OpenAlex es una fuente abierta significa que sus datos son accesibles de forma libre y gratuita para cualquier usuario que desee consultarlos, analizarlos o reutilizarlos. A diferencia de Web of Science o Scopus, OpenAlex permite la consulta y descarga de su información sin necesidad de pagar una suscripción. Además, su infraestructura técnica y sus modelos de datos están documentados públicamente, lo que favorece la transparencia y el desarrollo de nuevas herramientas (Priem et al., 2022). OpenAlex se financia gracias a ayudas, donaciones y clientes premium. En febrero de 2024, el ministerio francés de Educación Superior e Investigación anunció una aportación económica a OpenAlex4, al considerarla una infraestructura crucial para la ciencia abierta, 1 https://www.microsoft.com/en-us/research/articles/microsoft-academic-to-expand-horizonswith-community-driven-approach/ 2 https://blog.ourresearch.org/were-building-a-replacement-for-microsoft-academic-graph/ 3 https://blog.openalex.org/were-now-openalex/ 4 https://www.ouvrirlascience.fr/french-ministry-of-higher-education-and-research-partners-withopenalex-to-develop-a-fully-open-bibliographic-tool/ 3 al tiempo que proclamaba su compromiso para mejorar los datos de OpenAlex, en particular los relativos a la investigación francesa. Un mes más tarde, en marzo de 2024, OpenAlex anunció la recepción de 7,5 millones de dólares de la Fundación Arcadia5. En paralelo, OpenAlex percibe ingresos de suscriptores premium que gozan de actualizaciones más frecuentes de la base de datos para su descarga completa, consultas ilimitadas a su API y un servicio de asistencia prioritario6. En definitiva, OpenAlex funciona como un proyecto sin ánimo de lucro que sostiene sus operaciones mediante donaciones y suscripciones a servicios premium. Es una incógnita si este modelo será sostenible a largo plazo7 o si acabará por dejar de operar o volver al modelo tradicional de las empresas comerciales (Cao et al., 2025). OpenAlex se utiliza para la elaboración del CWTS Leiden Ranking Open Edition8 y, en Francia, instituciones como la Universidad de La Sorbona9 o el Centre National de la Recherche Scientifique (CNRS)10 han anunciado su adopción como fuente de datos alternativa a Scopus y Web of Science. El interés por OpenAlex ha crecido notablemente en el contexto de la Declaración de Barcelona sobre la Información Abierta de Investigación11, presentada en abril de 2024. Esta declaración propone una transformación del sistema de evaluación científica, promoviendo el uso de indicadores más transparentes, abiertos y alineados con los principios de la ciencia abierta. En este marco, OpenAlex se ha identificado como una alternativa estratégica al ofrecer datos bibliográficos libres y auditables. 2. Fuentes de OpenAlex OpenAlex se alimenta de una combinación de fuentes abiertas. Aunque las dos principales son Microsoft Academic Graph y Crossref12, el proyecto está abierto a muchas otras, con importantes incorporaciones recientes como DataCite13. Crossref es una organización sin ánimo de lucro fundada en el año 2000 con el objetivo de facilitar la identificación y vinculación persistente de contenidos científicos en línea. Su función principal es actuar como una agencia de registro de DOIs (Digital Object Identifiers) para publicaciones académicas. Los DOIs se utilizan para identificar de forma única objetos digitales (artículos, conjuntos de datos, informes, monografías, etc.). El DOI permanece fijo durante toda la vida del documento y está vinculado a sus metadatos, incluida la URL, lo que proporciona acceso al documento. Se supone que referirse a un documento en línea mediante su DOI ofrece un enlace más estable que utilizar únicamente 5 https://blog.openalex.org/ourresearch-receives-7-5m-grant-from-arcadia-to-establish-openalexa-milestone-development-for-open-science/ 6 https://help.openalex.org/hc/en-us/articles/24397762024087-Pricing 7 El hecho de que en mayo de 2025 el CEO de OpenAlex, Jason Priem, convocara un webinar para exponer su visión sobre la sostenibilidad del proyecto es una buena muestra de que los usuarios se formulan preguntas de fondo al respecto. La grabación está disponible en el perfil YouTube de OurResearch (https://youtu.be/CZ5Q9To1zCc?si=k7Pht-pz8Q0D8ky) 8 https://open.leidenranking.com 9 https://www.sorbonne-universite.fr/en/news/sorbonne-university-unsubscribes-web-science 10 https://www.cnrs.fr/en/update/cnrs-has-unsubscribed-scopus-publications-database 11 https://barcelona-declaration.org 12 https://help.openalex.org/hc/en-us/articles/24397285563671-About-the-data 13 https://datacite.org/blog/datacite-metadata-is-now-integrated-in-openalex/ 4 su URL. Para que esto ocurra, las editoriales deben actualizar los metadatos en caso de un cambio en la URL, de manera que el DOI apunte a la nueva dirección. Crossref es una fuente fundamental para OpenAlex porque proporciona metadatos sobre los contenidos académicos registrados por las editoriales: título del documento, autores, afiliaciones, revista, fecha de publicación, referencias, etc. Al tratarse de una fuente abierta, los metadatos de Crossref pueden ser reutilizados libremente. No obstante, la calidad de los metadatos en Crossref depende directamente de la información que proporcionan las editoriales, ya que Crossref no realiza tareas de depuración ni de curación de esos datos. En consecuencia, la precisión y fiabilidad de los metadatos están condicionadas por la calidad del contenido suministrado por las editoriales que participan en el sistema14. Algunas editoriales pueden entregar metadatos incompletos, lo que deriva en registros parciales que no reflejan toda la información relevante de una publicación. En casos más graves, la ausencia de controles de verificación puede dar lugar a la inclusión de metadatos erróneos, e incluso falsos, lo que afecta a la fiabilidad de los sistemas que dependen de estos datos, como es el caso de OpenAlex. Un estudio de Besançon et al. (2024) reveló la inclusión en Crossref de referencias “furtivas” (sneaked) registradas como metadatos de artículos científicos en los que en realidad no aparecían, aprovechando la relación de confianza entre las editoriales y Crossref. Un análisis de tres revistas de una misma editorial identificó al menos un 9 % de referencias “clandestinas”. Aunque no figuraban en los artículos publicados, estas citas depositadas en Crossref se propagaban a los registros de plataformas que la emplean como fuente de datos. 3. Entidades de OpenAlex En OpenAlex, las entidades son las unidades fundamentales que estructuran y organizan la información bibliográfica dentro de la base de datos. Cada entidad representa un tipo de objeto relacionado con la producción científica y está interconectada con otras para reflejar el ecosistema completo de la investigación. OpenAlex emplea nueve tipos de entidades: works, authors, sources, institutions, topics, keywords, publishers, funders y geo. A continuación, comentaremos las principales características de las seis primeras mediante ejemplos obtenidos a través de consultas a la versión web de la base de datos realizadas durante las dos últimas semanas de noviembre de 2025. 3.1 Trabajos (works) Son las publicaciones académicas individuales, como artículos, capítulos, libros, informes o ficheros de datos. Cada trabajo incluye información sobre el título, los autores, la fuente o la fecha de publicación, así como relaciones de citación con otros trabajos (referencias citadas y citas recibidas). En noviembre de 2025, OpenAlex indexa 271,3 millones de trabajos a los que se puede añadir un “expansion pac” (xpac) con 192 millones de registros adicionales, con metadatos de menor calidad, procedentes de DataCite y de repositorios institucionales (Figura 1). 14 https://www.crossref.org/documentation/principles-practices/ 5 Figura 1. Trabajos disponibles en OpenAlex 3.1.1 Resúmenes Limitándonos a la versión estándar (sin añadir el xpac), hay que señalar que un 40% de los registros (107,3 millones) carecen de resumen15. La presencia del resumen depende de si la fuente original lo proporciona y si puede distribuirse legalmente. No todas las editoriales comparten los resúmenes de los artículos en los metadatos que envían a Crossref u otras fuentes que OpenAlex utiliza, sino que en muchos casos los publican solo en su propia web. Además, algunos resúmenes están protegidos por derechos de autor, por lo que OpenAlex no puede compartirlos. Un estudio de van Eck y Waltman (2025) sobre el depósito en Crossref de resúmenes de artículos durante los años 2023 y 2024 reveló que editoriales como Elsevier, Taylor & Francis, IEEE o American Chemical Society no habían depositado ninguno en esos dos años. 3.1.2 Tipologías documentales La identificación de la tipología documental de los trabajos en OpenAlex es a menudo problemática. Un estudio de una muestra de 6,6 millones de registros (Mongeon et al., 2025) encontró más de 300.000 casos de publicaciones clasificadas como “artículo” o “revisión” en OpenAlex pero a las que se había asignado otra tipología documental en Web of Science. Casi todos los casos verificados manualmente apuntaron a una clasificación errónea en OpenAlex. Este trabajo no consideró los casos de discrepancias en los que Web of Science clasificaba un texto un “artículo” mientras que OpenAlex lo hacía como “revisión”, o viceversa. La inclusión de este tipo de discrepancias incrementa de manera notable la divergencia entre ambas fuentes. Una búsqueda en OpenAlex de documentos que incluyan en el título la expresión “new editor in chief” recupera 1.751 resultados16. Aunque cabe esperar que la mayoría de estos textos sean editoriales, lo cierto es que solo el 20% (350 registros) están clasificados como tales, mientras que la mayoría (74%, 1.301 registros) son considerados artículos. Por otro lado, resulta discutible que para un correcto análisis de la actividad científica tenga sentido incluir las guías temáticas de biblioteca (libguides), que cuentan con más de 1,7 millones de registros17, pese a que no son una expresión clara de comunicación de resultados de investigación, o agrupar bajo el tipo “paratext” una amalgama poco reconocible de más de 3,8 millones de registros18. Por contra, no se incluyen las patentes. 15 https://openalex.org/works?page=1&filter=has_abstract:false 16 https://openalex.org/works?page=1&filter=display_name.search:new+editor+in+chief 17 https://openalex.org/works?filter=type:types/libguides 18 https://openalex.org/works?filter=type:types/paratext 6 3.1.3 Idiomas La determinación de la lengua de los documentos también es conflictiva. El trabajo ya citado de Mongeon et al. (2025) analizó la precisión en la identificación del idioma de los documentos comparando el inglés con otras lenguas, pero sin entrar a cotejar de manera detallada otros idiomas. Aunque se observaron algunas discrepancias, éstas fueron menos comunes que en el caso de las tipologías documentales y no se identificó una ventaja clara de Web of Science sobre OpenAlex o viceversa. Otro análisis manual de la completitud y precisión de los metadatos lingüísticos de una muestra de 6.836 artículos en OpenAlex (Céspedes et al., 2025) evidenció que esta fuente ofrece una cobertura lingüística más equilibrada que Web of Science, aunque se detectaron errores en la identificación del idioma de los documentos que provocaban una sobreestimación del inglés en la base de datos. Ambos trabajos ponen de manifiesto que los errores en la correcta identificación de la lengua de los documentos obedecen a dos circunstancias: las equivocaciones del algoritmo de detección de idiomas de OpenAlex con lenguas que guardan una cierta similitud y el hecho de que algunas revistas publican artículos y resúmenes simultáneamente en diversos idiomas. 3.1.4 Referencias Un cuarto metadato conflictivo son las referencias. Limitándonos a la versión estándar de OpenAlex (sin xpac), una búsqueda de documentos sin referencias (reference count = 0)19 recupera el 64% de los registros en la base de datos (173,5 millones). Un trabajo de Culbert et al. (2025) basado en 16,8 millones de publicaciones recientes indexadas por tres bases de datos concluyó que OpenAlex presentaba cifras promedio de referencias por fuente y niveles de cobertura interna comparables a los de Web of Science y Scopus. No obstante, mientras que OpenAlex incluía 586 millones de referencias para estos registros, Web of Science alcanzaba los 725 millones y Scopus los 727 millones. En la misma línea, Thelwall y Jiang (2025) concluyeron que OpenAlex es adecuado para el análisis de citas en la mayoría de los campos. Otro estudio de Scheidsteger et al. (2025) comparó los índices de citación normalizados por campo obtenidos de OpenAlex con los calculados por tres bases de datos comerciales: Web of Science, Scopus y Dimensions. El estudio se centró en cerca de 335.000 artículos publicados entre 2013 y 2017 por 48 universidades alemanas en cuatro grandes áreas temáticas. Aunque se observó una concordancia general a nivel de artículo, también se detectaron diferencias significativas cuando se desglosaron los datos por universidad y área temática. En este punto hay que señalar que, al crear el registro de un trabajo, OpenAlex no recoge las referencias de documentos que no están indexados previamente en la base de datos. Es decir, las referencias citadas en un documento pueden remitir a otros documentos indexados en la base de datos o a documentos no indexados. En Web of Science o Scopus, estas últimas referencias son añadidas a la base de datos con carácter secundario: los documentos no se recuperan en una consulta sobre documentos fuente de la indexación por citas, pero sí que se identifican como citas. En OpenAlex estas referencias se pierden. 19 https://openalex.org/works?page=1&filter=referenced_works_count:0 7 El trabajo más citado entre los recuperados a una consulta de documentos sin referencias es “R: A Language and Environment for Statistical Computing”20, un documento de literatura gris bien estructurado en secciones que cuenta con un apartado de referencias con nueve documentos que quedan invisibilizados en OpenAlex. Este ejemplo es una buena muestra de la apertura de OpenAlex a un abanico de tipos documentales mucho más amplio que las bases de datos comerciales que indizan por citas, pero al tiempo pone de manifiesto la incapacidad de procesar de forma consistente las referencias de todos los documentos. La Figura 2 muestra otro ejemplo de esta pérdida de referencias. En la parte superior izquierda (A), se observa un registro de OpenAlex correspondiente a un documento que, según esta fuente, incluye cinco referencias bibliográficas21. En la parte superior derecha (B), se observan estas cinco referencias22. Finalmente, en la parte inferior (C), se observan las nueve referencias bibliográficas incluidas en el artículo original23. Se puede comprobar que sólo las referencias 1, 2, 6, 7 y 8 del documento fuente han sido incorporadas al registro de OpenAlex. Se han perdido tres referencias de documentos del Departamento de Educación de los Estados Unidos y una referencia de una monografía (la 9 en el documento original) a pesar de que sí está indexada en OpenAlex24. Figura 2. (A) Registro en OpenAlex; (B) Referencias en el registro de OpenAlex; (C) Referencias en el documento original 20 https://openalex.org/works/w2582743722 21 https://openalex.org/works/w4416039086 22 https://openalex.org/works?page=1&filter=cited_by:w4416039086 23 https://doi.org/10.51583/ijltemas.2025.1410000050 24 https://openalex.org/works/w2135943618 8 3.2 Autores (authors) En OpenAlex es habitual encontrar autores con perfiles duplicados. Por ejemplo, en su página inicial OpenAlex sugiere a “Claudia Goldin”, economista estadounidense galardonada con el Premio Nobel en 2023, como ejemplo de búsqueda por autora. Sin embargo, el uso de este ejemplo revela la dispersión de sus publicaciones en tres perfiles (Figura 3). Figura 3. Perfiles de Claudia Goldin en OpenAlex OpenAlex ofrece un formulario para solicitar la corrección de perfiles de autores25: modificar la forma del nombre; combinar múltiples perfiles correspondientes a un mismo autor; eliminar publicaciones correspondientes a otros autores; o incorporar publicaciones ausentes. No obstante, la capacidad de respuesta a dichas peticiones por parte de OpenAlex es actualmente muy baja, por lo que muchas quedan en estado “open” durante meses26. 25 https://help.openalex.org/hc/en-us/articles/27283405287319-How-can-I-fix-errors-in-anOpenAlex-author-profile 26 Este es el caso de la “request” con Id 5410 que hicimos el 27 de agosto de 2025, que sigue sin resolverse el 30 de noviembre de 2025. Desconocemos si los usuarios premium gozan de tiempos de respuesta mejores. 9 3.3 Instituciones (institutions) Un problema frecuente en los registros de OpenAlex es la ausencia de afiliaciones institucionales. Según un estudio de Zhang et al. (2024), más del 60 % de los registros en OpenAlex carecen total o parcialmente de información institucional, una carencia especialmente común en los metadatos de publicaciones antiguas y en disciplinas de ciencias sociales y humanidades. Un segundo problema radica en que algunas de las afiliaciones asignadas a determinados documentos son erróneas, una cuestión menos explorada en la literatura ya que requiere una verificación manual de los metadatos. Bordignon (2024) se planteó hasta qué punto la producción bibliográfica de la École des Ponts27 —una escuela de ingeniería francesa que forma parte del Institut Polytechnique de París— recogida en Web of Science, Scopus o HAL estaba indexada en OpenAlex y en qué medida las publicaciones recuperadas al buscar la producción de este centro en OpenAlex estaban correctamente asignadas. Los resultados ponían de manifiesto la exhaustividad de OpenAlex, que recuperaba el 93% de la producción de la École des Ponts, pero también su escasa precisión: un 24% de los documentos recuperados al buscar la producción de este centro en OpenAlex correspondían a otras instituciones. La Figura 4 muestra un ejemplo de una publicación en la que, al extraer los metadatos de afiliación institucional, el algoritmo de OpenAlex ha combinado la afiliación del autor con instituciones mencionadas en el apartado de financiación y con otras —como una farmacéutica surcoreana— sin relación aparente con el documento. Estas afiliaciones incorrectas se extienden a los perfiles de los autores, de manera que es habitual encontrar perfiles de autores en OpenAlex con decenas de afiliaciones institucionales, con muchas de las cuáles el autor no ha tenido ninguna vinculación28. Figura 4. (A) Documento original29; (B) Registro en OpenAlex que recoge como afiliaciones instituciones presentes en el apartado de financiación y otras sin relación con el documento30 27 https://ecoledesponts.fr 28 Así sucede, por ejemplo, con los autores de este artículo: para Ángel Borrego (https://openalex.org/authors/a5079282617) constan ocho “past institutions” erróneas; para Cristóbal Urbano (https://openalex.org/authors/a5065832938) once. 29 https://doi.org/10.14198/DOXA2024.48.11 30 https://openalex.org/works/w4402770154