Always already AI-ready. Sammlungsdaten in Zeiten von KI
Abstract
Folien zum Vortrag auf der Herbsttagung 2025 der Fachgruppe Dokumentation (Programm unter https://web.archive.org/web/20250927070459/https://www.museumsbund.de/wp-content/uploads/2025/09/fg-doku25-programm-herbsttagung.pdf).
Full text
Always already AI-ready. Sammlungsdaten in Zeiten von KI DOI: 10.5281/zenodo.17270516 Alexander Winkler (digiS) ✉ [email protected] 0000-0002-9145-7238 @[email protected] 6. Oktober 2025 (Herbsttagung 2025 der Fachgruppe Dokumentation des DMB)
Sammlungsdaten Training von KI KI-gestützte Erschließung Nutzung von KI-Modellen
Sammlungsdaten Training von KI KI-gestützte Erschließung Nutzung von KI-Modellen
Sammlungsdaten Training von KI KI-gestützte Erschließung Nutzung von KI-Modellen
Sammlungsdaten Training von KI KI-gestützte Erschließung Nutzung von KI-Modellen Wie werden aus Sammlungsdaten Trainingsdaten? [email protected] | Michelle Dahlmanns, [email protected] Fragezeichen, CC BY 4.0
Was sind KI-Trainingsdaten?
Back in the olden days: Ground Truth für OCR GT4HistOCR umfasst 313.173 Zeilenschnipsel aus alten Drucken mit Transkription (je eine Bildund Textdatei). Springmann, Uwe, Christian Reul, Stefanie Dipper, and Johannes Baiter. 2018. “Ground Truth for Training OCR Engines on Historical Documents in German Fraktur and Early Modern Latin.” Journal for Language Technology and Computational Linguistics 33 (1): 97–114. https://doi.org/10.21248/jlcl.33.2018.220 (hieraus auch die Schnipsel oben).
Jina CLIP: Text und Bild in einem semantischen Raum aus: Koukounas, A., Mastrapas, G., Günther, M., Wang, B., Martens, S., Mohr, I., Sturua, S., Akram, M. K., Martínez, J. F., Ognawala, S., Guzman, S., Werk, M., Wang, N., & Xiao, H. (2024). Jina CLIP: Your CLIP Model Is Also Your Text Retriever (No. arXiv:2405.20204). arXiv. https://doi.org/10.48550/arXiv.2405.20204 zu LAION-400M: https://laion.ai/blog/laion-400-open-dataset/
LAION400M Screenshot von http://gallerytest.christoph-schuhmann.de/photos/picture.php?/100009/category/4&metadata
https://huggingface.co/datasets/Codatta/MM-Food-100K MM-Food-100K ● 1 Million Bilder, davon 100.000 frei ● strukturierte Metadaten ● Finetuning von vLLMs (Kalorien, Zutaten, Gerichte)
Was ist die Rolle der Kulturerbeeinrichtungen?
Herausforderungen ● digitalisierte Sammlungen verhältnismäßig klein ● Anwendungsszenarien und Trainingspipelines vielfältig und kaum vorhersehbar ● heterogene Zielpublika
Herausforderungen ● digitalisierte Sammlungen verhältnismäßig klein ● Anwendungsszenarien und Trainingspipelines vielfältig und kaum vorhersehbar ● heterogene Zielpublika ● Aggregation ermöglichen durch Standardisierung ● Generisch hohe Datenqualität ● Kompatibilität mit diversen Community-Standards mitdenken Folgen
Datenlebenszyklus für KI-Training Brewer, W., Widener, P., Anantharaj, V., Wang, F., Beck, T., Shankar, A., & Oral, S. (2025). Data Readiness for Scientific AI at Scale. https://doi.org/10.1145/3750720.3757282
Datenlebenszyklus für KI-Training Brewer, W., Widener, P., Anantharaj, V., Wang, F., Beck, T., Shankar, A., & Oral, S. (2025). Data Readiness for Scientific AI at Scale. https://doi.org/10.1145/3750720.3757282
Datenlebenszyklus für KI-Training Brewer, W., Widener, P., Anantharaj, V., Wang, F., Beck, T., Shankar, A., & Oral, S. (2025). Data Readiness for Scientific AI at Scale. https://doi.org/10.1145/3750720.3757282
Datenlebenszyklus für KI-Training Brewer, W., Widener, P., Anantharaj, V., Wang, F., Beck, T., Shankar, A., & Oral, S. (2025). Data Readiness for Scientific AI at Scale. https://doi.org/10.1145/3750720.3757282 Aufgabe von Sammlungen: Qualitativ hochwertige Daten FAIR, offen und mit möglichst geringen Hürden verfügbar machen.
Dimensionen der Datenqualität (Bruce/Hillmann 2004) ●Accessibility (ohne technische oder intellektuelle Hürden zugänglich) ● Accuracy (formal und inhaltlich korrekt) ●Completeness (möglichst vollständige Information zu möglichst allen Objekten) ●Conformance to expectations (orientiert an Bedarfen der Zielcommunities) ●Consistency and coherence (einheitliches Datenmodell und dessen konsistente Anwendung) ●Provenance (Angaben zur Herkunft der Information) ● Timeliness (Aktualität der Metadaten) Bruce, T. R., & Hillmann, D. I. (2004). The Continuum of Metadata Quality: Defining, Expressing, Exploiting. ALA Editions. https://ecommons.cornell.edu/handle/1813/7895
Collections as data for AI: Wie sollten Datenangebote für KI-Anwendungen aussehen?
Sollten wir das wollen? ● KI-gestütztes Informationsretrieval: Was die KI nicht kennt, gibt es nicht im Internet (analog aktuell zu Google) ● GLAM-Daten sind hochwertig (korrekt, transparent lizenziert und mit Provenienzangaben versehen, Biases können reflektiert werden) ● GLAMs können selbst von KI-Anwendungen profitieren (Objektbeschreibung, Verschlagwortung etc.) ● KI-Anwendungen in Forschung und Vermittlung benötigen GLAM-Daten
Collections as data “While the specifics of how to develop, provide access to, and support the use of collections-as-data will vary, any digital material can potentially be made available as data that are amenable to computational use. Data use and reuse can be encouraged with appropriate licensing and non-proprietary formats, particularly when data is made accessible in many different ways and access is designed to meet community needs and is mindful of ethical concerns.” Vancouver Statement, S. 1-2
Unsicherheiten vermeiden durch klare Lizenzierung ● maschinenlesbare (URIs, z.B. https://creativecommons.or g/publicdomain/zero/1.0/) Lizenzen für Metadaten (lido:recordRights) und Objekte (lido:rightsResource) ● bei CC BY* mit Angabe der Rechteinhabenden (lido:rightsHolder) Creative Commons, Creative Commons heart logo, marked as public domain, more details on Wikimedia Commons
Collections as data “While the specifics of how to develop, provide access to, and support the use of collections-as-data will vary, any digital material can potentially be made available as data that are amenable to computational use. Data use and reuse can be encouraged with appropriate licensing and non-proprietary formats, particularly when data is made accessible in many different ways and access is designed to meet community needs and is mindful of ethical concerns.” Vancouver Statement, S. 1-2
Daten sollten FAIR sein … ● Auffindbar durch Metadaten ● zugänglich durch Identifikatoren und Protokolle ● interoperabel durch standardisierte Formate und Vokabulare ● nachnutzbar durch offene Lizenzen, Beachtung von Community-Standards und durch Provenienzangaben SangyaPundir, FAIR data principles, CC BY-SA 4.0
SangyaPundir, FAIR data principles, CC BY-SA 4.0 Mensch ● Datenangebote auf Website verlinken ● Metadaten sichtbar machen ● Datenangebote nachweisen (z.B. Wikidata oder Wissensgraphen der NFDI) ● Daten auf Huggingface, Kaggle ● Daten auf Zenodo oder anderen einschlägig indizierten Repositorien Maschine ● maschinenlesbare Metadaten in <meta>-Block verknüpfen ●RFC 9727 ./well-known/api-catalog ● Datenangebote maschinenlesbar beschreiben (z.B. dcat, DataCite)
SangyaPundir, FAIR data principles, CC BY-SA 4.0 ● Datendumps zum Download ● offene, standardisierte und gut dokumentierte und gut sichtbare Schnittstellen ● programmatischer Zugriff auf maschinenlesbare Metadaten und Objektdaten
● etablierte Datenformate (CSV, JSON, LIDO-XML) verwenden ● fachfremde Nutzer:innen mitbedenken (vereinfachte CSV ergänzend zu LIDO?) ● Verwendung gängiger kontrollierter Vokabulare ● Vokabular über URIs einbinden SangyaPundir, FAIR data principles, CC BY-SA 4.0
● etablierte Dateiformate (CSV, JSON, LIDO-XML) verwenden ● fachfremde Nutzer:innen mitbedenken (vereinfachte CSV ergänzend zu LIDO?) ● Verwendung gängiger kontrollierter Vokabulare ● Vokabular über URIs einbinden SangyaPundir, FAIR data principles, CC BY-SA 4.0
● etablierte Dateiformate (CSV, JSON, LIDO-XML) verwenden ● fachfremde Nutzer:innen mitbedenken (vereinfachte CSV ergänzend zu LIDO?) ● Verwendung gängiger kontrollierter Vokabulare ● Vokabular über URIs einbinden ● Daten möglichst strukturiert und standardisiert erfassen (z.B. Maße) SangyaPundir, FAIR data principles, CC BY-SA 4.0