Full text
OS LLM KG Authors OS corpora (papers, data, code) LLM-assisted extraction (nodes + edges) Answer with OS source anchors Curation-Loop (Human-in-the-Loop) KG Update OUR APPROACH A CONTRADICTION RESISTS RESOLUTION, YET INVITES COMPLEMENTARITY. 2 CORE QUESTION is founded on and extends the guiding thoughts of RCR to promote responsible conduct of research, share reliable data, minimise waste of resources, and foster innovation. Open Science In contrast, general-purpose optimize for scale via probabilistic training on vast (non-)scientific data—fast to deploy, but with limited provenance and higher hallucination risk. LLMs AI-driven research is shaped by two different logics: Bridging Open Science and Large Language Models CORE PROBLEM Coupling two logics: Open Science acts as a provenanceaware KG gatekeeper that steers LLMs; conversely, LLMs lift OS corpora into structured, versioned knowledge graphs (no base-model fine-tuning). Enhancing Research Accuracy through Knowledge Graphs How can the two different logics—epistemic governance (source first) vs. probabilistic compression at scale (scale first)—coexist and be utilised responsibly in research? Wilder Nicolaus: [email protected] Marie Alavi: [email protected] Nicolaus Wilder Marie Alavi Julia Priess-Buchheit USE (Researchers using LLMs) PRODUCTION (Researchers producing KGs) Awareness Completeness Preventing plagiarism RCR Originality Explainability Reliability Reproducibility Trust in Science Opennes Ethics Honesty Preventing redundancy Accountability Validity Fairness Factivity Responsibility Reciprocity Preventing fabrication Preventing falsification Transparency Sharing Interpretability Safety Traceability Equity Reusability Integrity Quality Confidentiality FAIR-R Data confidentiality Data protection Consistecy Data quality 1 OS regulates the search space (provenance, FAIR-R, RCR), LLMs fill it with generative elasticity. OS corpora KG layer (ontology + instances) Versioning (Log changes) Context selection via the KG LLM generates answer from context Benefits Risks & Governance Coverage bias (KG) License‑aware retrieval Graph/prompt injection defenses Update drift/ errors (rollback) Multilingual equity Faster orientation with verifiable sources Lower hallucination via provenance gating Clearer credit No base-model retraining or finetuning required Traceable process Reusable (works across domains) Literature: (1) Alavi, M., Wilder, N., & Priess-Buchheit, J. (2024). Promoting Open Science in times of Artificial Intelligence: Do we grasp the interplay? World Conference of Research Integrity (WCRI), Athens, Greece. Zenodo. https://doi.org/10.5281/zenodo.11562117 (2) Khorashadizadeh, H., Amara, F. Z., Ezzabady, M. et al. (2024). Research trends for the interplay between large language models and knowledge graphs. 10.48550/arXiv.2406.08223. (3) Verhulst, Stefaan and Zahuranec, Andrew and Chafetz, Hannah, Moving Toward the FAIR-R principles: Advancing AI-Ready Data (March 04, 2025). Available at SSRN: https://arxiv.org/abs/2405.04333 18 Awareness Completeness Preventing plagiarism RCR Originality Explainability Reliability Reproducibility Trust in Science Openness Ethics Honesty Preventing redundancy Accountability Validity Fairness Factivity Responsibility Reciprocity Preventing fabrication Preventing falsification Transparency Sharing Interpretability Safety Traceability Equity Reusability Integrity Quality Confidentiality FAIR-R Data confidentiality Data protection Consistency Data quality