scieee AI-readable full text Open interactive document viewer

Vom Gelehrten zum Problem - Maschinelle Datierung von Leibniz-Handschriften: Die Anwendung von Deep-Learning-Verfahren zur Unterstützung der historisch-kritischen Editionsarbeit

Westphal, Tim; Tormo Romero, Mario; Santi, Marco

Abstract

Vortragsfolien für die Präsentation des Projekts.Abstract:Seit Beginn der Arbeit an einer historisch-kritischen Edition Gottfried Wilhelm Leibniz im Jahr 1901 bildet die Datierung des umfangreichen handschriftlichen Nachlasses eine große editorische Hürde. Rund 100.000 Blätter aus der Hand des letzten Universalgelehrten dokumentieren eine über fünf Jahrzehnte reichende intellektuelle Entwicklung, wobei einem Großteil der Schriftstücke eine zeitgenössische Datierung fehlt. Traditionelle Methoden der Datierung sind für einen Korpus dieser Dimension unzureichend: Die manuelle Bestimmung durch Expertinnen ist angesichts der Materialmenge praktisch nicht zu bewältigen, und auch die Wasserzeichenanalyse erlaubt nur grobe Annäherungen im Bereich von Jahrzehnten. Der Beitrag erprobt, inwieweit bildgestützte Deep-Learning-Modelle diese Lücke schließen können und ob diese dabei eine editorisch nutzbare Genauigkeit erreichen. Wünschenswert ist eine maximale Abweichung von ±1 Jahr. Im Mittelpunkt steht die Frage, ob Deep-Learning-Modelle die feinen intra-personalen Schreibdrifts eines einzelnen Autors über fast fünf Jahrzehnte abbilden können. Anders als bestehende Arbeiten, die meist das Alter verschiedener Schreiber klassifizieren, zielt der Ansatz auf die Detektion des schreibereigenen Stilwandels innerhalb Leibniz‘ Werk. Der weitläufige Nachlass von Leibniz bietet hierfür eine geeignete Grundlage. Es wird bewusst auf Transkription oder OCR verzichtet, so werden die besonderen Herausforderungen von Leibniz‘ Schriftbild (Überarbeitungen, Streichungen, wechselnde Sprachen) umgangen. Um sicherzustellen, dass die Modelle schriftbezogene und nicht materialbedingte Merkmale lernen, werden verschiedene Normalisierungsschritte durchgeführt: Zeilenweise Segmentierung und Binarisierung eliminieren Papierstruktur und Tintenintensität als Faktoren. Als Datenbasis dienen ca. 600 Seiten aus dem Zeitraum 1669-1716: 400 datierte Briefe sowie 200 Seiten wissenschaftlicher Ausarbeitungen. Das Material wurde so gewählt, dass für jedes Jahr Vorlagen verfügbar sind. Es werden verschiedene Deep-Learning-Architekturen entwickelt und evaluiert, die relevante Merkmale direkt aus den Bilddaten lernen. Anders als klassische Ansätze der digitalen Paläographie mit manueller Merkmalsextraktion wird auf ein Ende-zu-Ende-Lernverfahren gesetzt. Ziel des Projekts ist die Entwicklung von Ansätzen zur hochauflösenden Datierung frühneuzeitlicher Gelehrtenhandschriften für den Einsatz in der alltäglichen editorischen Praxis. Die entwickelte modulare Pipeline ermöglicht flexibel konfigurierbare Experimente und legt besonderen Wert auf Visualisierung und Erklärbarkeit der Ergebnisse. Das Projekt positioniert sich an der Schnittstelle von Digital Humanities und Computer Vision und zeigt, wie klassisches maschinelles Lernen die traditionelle editorische Arbeit ergänzen kann. Es entsteht in Kooperation zwischen der Leibniz-Arbeitsstelle der BBAW, dem DH-Referat TELOTA und dem KI-Servicezentrum des Hasso-Plattner-Instituts in Potsdam.

Full text

https://hpi.de/ki-servicezentrum/ ÜBERSICH T Vier KI-Servicezentrum im Bund Ziel: Barrieren der Implementierung von KI-Anwendungen in Gesellschaft und Wirtschaft reduzieren 1 KI Serviczentrum Berlin Brandenburg 2 Forschung Bildung Infrastruktur Beratung AISC FORSCHUNG •KI-Methoden Forschung •KIBetriebsforschung 3 INFRASTRUKT UR Training •64 NVIDIA H100 GPU Inferenz •40 NVIDIA A30 GPU ARM Server •Ampere Altra Max M128-30 CPU •2 x NVIDIA L40 GPUs GPU Server •AMD Epyc CPU •8 x NVIDIA L40S GPU aisc.hpi.de Zugangsanfrage •Zugang kostenfrei •Kein Produktionsbetrieb ⚬Daten sollten anonymisiert oder synthetisiert sein ⚬Kein Hosting von Produkten •Reporting & Veröffentlichung durch Nutzende •Altrechte bleiben bei Nutzenden •Neurechte bleiben bei Nutzenden ⚬Einräumen von Nutzungsrechten für Forschung und Lehre Edge •ARMv8 CPU •NVIDIA Jetson AGX Module Neuromorph •288 SpiNNaker2 Chips Speicher •1.5 PB NVMe Netwerk •400 Gb/s Infiniband •200 Gb/s Ethernet 4 Talks •Gastvorträge zu Forschung und Innovation tele-task.de/series/ 1463 Work shops •Praxisnahe Themen •Beispielthemen: Speech2summary, Docker für ML, semantische Suche aimaker.communit y MOOCs •ChatGPT: Was bedeutet generative KI für unsere Gesellschaft? •Profitable KI •KI Biases verstehen und vermeiden open.hpi.de/channels/ai-servicecenter BILDUN G Newsletter 5 BERATU NG KI-Sprechstunde •Beantwortung von Fragen: ⚬zu KI-Infrastruktur ⚬zu KI-Modellen & Frameworks ⚬Zu KI-Anwendungsfällen KI-Pilotprojekte •Co-Entwicklung eines Prototyps •Bewerbung alle drei Monate •Auswahlkriterien z.B. KI-Reife, Gemeinwohl •Veröffentlichung der Ergebnisse Kooperationen •Gemeinsam organisierte Netzwerktreffen Jetzt bewerben! github.com/aihpi/leichte-sprache Bisherige KI-Pilotprojekte •Generierung Mathematik-Problemen •Generierung Leichter Sprache •Generierung von Upcycling Vorschlägen •Reduzierung von Food Waste •Datierung mittels Handschrift Sprechstunde buchen 6 Leibniz-Edition, Reihe VIII: Naturwissenschaftliche, medizinische und technische Schriften Bereits erschienene Bände:! ! VIII, 1 = 1668–1676, Berlin 2009! VIII, 2 = 1668–1676, Berlin 2016! VIII, 3 = Mechanik 1: Akustik, Elastizität, Festigkeit, Stoß (1671-1705), Berlin 2021! VIII, 4 = Mechanik 2: Akustik, Elastizität, Festigkeit, Statik, Stoß (1676-1715), Berlin 2024! https://leibnizp2.bbaw.de/de/leibniz-online! 1 Der Leibniz’sche Nachlass Weitgehend geschlossen überliefert: Gottfried-Wilhelm-Leibniz-Bibliothek in Hannover! Umfang: allein in der GWLB etwa 100.000 Blatt! Stephan Waldhoff, „Quellenkunde“! in Beiderbeck F., Li W., Waldhoff S. (Hrsg.): ! Gottfried Wilhelm Leibniz. Rezeption, Forschung, Ausblick Stuttgart 2020, S. 29–165! 2 Beispiel einer transparenten „Datierungsbegründung“ (LSB VIII, 4 N. 28, S. 111–116)! ! ! ! 3 Vom Gelehrten zum Problem Maschinelle Datierung von Leibniz-Handschriften: Die Anwendung von Deep-Learning-Verfahren zur Unterstützung der historischkritischen Editionsarbeit 2 Inhalt Hintergrund und Forschungsstand Fragestellung Technische Umsetzung Ausblick 3 Hintergrund und Forschungsstand Herausforderung: Granularitätslücke bei der automatisierten Handschriftendatierung Traditionelle Ansätze zur Datierung etwa mittelalterlicher Manuskripte über die Identifikation von Schreibern, bewegen sich im Bereich ±50–100 Jahre Genauigkeit Writer Aging und forensische Handschriftenanalyse erreichen im besten Fall DekadenGranularität praktisches Maximum bei 10-30 Jahre breiten Kategorien→ Neuere Deep-Learning-Ansätze zwar erfolgversprechend Praktisch meist Dekaden-Bins (10-25 Jahre) als Klassifikationseinheiten→ Mangel an absolut datierten Referenzmanuskripten oft zentrale Herausforderung Bspw. Dead-Sea-Scrolls-Projekt (Popović et al., 2024):→ Kombiniert 24 Radiokarbondatierungen mit Schriftmerkmalen 4 Formulierung der Forschungsfrage 1. Ansatz: Wann wurde das Manuskript geschrieben? Recherche und Methodik von klassischen Datierungs-Ansätzen geprägt, kaum für → spezifische Problem adaptierbare Ansätze 2. Ansatz: Wie alt war Leibniz beim Verfassen der Dokumente? Führte zu paläographischen und forensischen Ansätzen, die aber auch zu ungenau für → das die angestrebte Anwendung sind Bisherige Methoden nicht geeignet für sinnvollen Einsatz bei Datierung der LeibnizDokumente, nur wenig Forschung zur automatisierten Datierung einer Schreiberhand Bewusster Verzicht auf OCR/HTR Fokus auf Schrift als Merkmalsträger→ 5 Technische Herausforderung Vielen offene Fragen: Welche Modellarchitektur erfasst die feinen Veränderungen im Schriftbild am besten?→ Welche Vorverarbeitung ist sinnvoll? RGB, Graustufen oder Binarisierung?→ Arbeiten wir mit ganzen Seiten oder segmentieren wir Zeilen?→ Evaluation verschiedener Kombinationen und Ansätze erforderlich Problem: train_model_v3_FINAL_REALLY_THIS_ONE.py model_new_aug_WORKING.py experiment_resnet_maybe_final.py Experimente nicht reproduzierbar, Ergebnisse nicht vergleichbar, fehlende Übersicht→ Daher Ansatz für systematisches Experimentieren benötigt Modulare Pipeline mit Jupyter Notebooks als zentrale Schnittstelle→ Möglichst automatische und vergleichbare Datenerhebung→ CLI mit Stapelverarbeitung: →python -m ScriptDater.main --ids 003 006 999 6 Pipeline: Verwendete Bibliotheken Preprocessing Line segmentation Kraken mit Standard-Modell→ Augmentations Albumentations→ Binarization SBB Eynollah, konvertiert zu PyTorch→ Modeling Deep Learning Framework PyTorch→ zusätzliche Architekturkomponenten pytorch-image-models → Tracking & Explainability Automatisches Experiment tracking MLflow→ Explainability Captum (GradCAM, Integrated Gradients, Saliency)→ Architekturdiagramme TorchViz→ 7 Pipeline: Architektur Ziel: modular erweiterbare und möglichst flexible Pipeline DATASET Ganze Seite vs. Zeilensegmentierung→ Graustufen, Binarisierung, Rotationskorrektur→ Augmentation-Strategien→ Caching→ Splits (training/validation/testing)→ MODEL Konfiguration und Verwaltung von Backbone, Neck und Task-Head→ TRAINING Konfiguration und Definition von Loss, Optimizer und Training-Loop→ EVALUATION Wie gut lernt das Modell?→ EXPERIMENT Extraktion der Konfiguration aus den Notebooks, Orchestrierung, Tracking→ EXPLAINABILITY Was lernt das Modell?→ VISUALIZATION Erstellung von Grafiken→ 8 Pipeline: Workflow 9 Pipeline: Notebook-basierte Experimente Konfiguration der Experimente in Jupyter Notebooks mit strukturierten Markdown-Tabellen Baseline: Standardvorgabe→ Value: angepasster Parameter, überschreibt Baseline→ Extraktion in Config-Objekte und Validierung mit pydantic→ 10 Pipeline: Input Page-level Ganze Seite als Input (z.B. 800×1200px 224×224px)→ Layout und Gesamterscheinung erfasst→ Geeignet für grobgranulare Merkmale→ Line-level Segmentierte Zeilen einzeln (224×224px) Fokus auf Schriftbild ohne Layout-Kontext→ Line-Patches Mehrere Patches pro Zeile (z.B. 6× 224×224px) Detailanalyse einzelner Buchstaben/Wörter→ Höchste Granularität→ Memory-intensiv, längeres Training→ 17 Pipeline: MLflow-Tracking 18 Pipeline: Zusammenfassung Ermöglicht systematisches Experimentieren Notebook-basierte Config mit automatischer Extraktion→ Drei Modi: Page / Line / Line-Patches→ Flexibel konfigurierbar: 700+ Architekturen testbar→ Unterstützt Klassifikation, Regression und Hybride Fragestellungen→ Automatische Dokumentation HTML Reports nach jedem Run→ MLflow tracked alles (Parameter, Metriken, Artefakte)→ Explainability→ 19 Erste Ergebnisse Separate Tests (vor Pipeline-Integration) Simple CNN, verschiedene Preprocessing-Strategien → MAE: 6-8 Jahre erreicht → Aber: Nicht reproduzierbar, keine Tracking→ Pipeline läuft seit letzter Woche - erste Zahlen! Baseline (Random Guessing) MAE: ~13 Jahre→ Ohne Lernen, nur zufällige Vorhersagen→ Zeigt Schwierigkeit des Problems (48 Klassen, 1669-1716)→ 20 Erste Ergebnisse Simple CNN, Line-Level, Patches, Binarisiert, 50 Epochen MAE: 8.4 Jahre (CI: 8.3-8.4) → RMSE: 12.4 Jahre (größere Fehler kommen vor) → Genauigkeiten: → • ±1 Jahr: 29% • ±2 Jahre: 36% • ±5 Jahre: 52% • ±10 Jahre: 69% • ±15 Jahre: 81% Ehrliche Einschätzung Pipeline-Infrastruktur steht und funktioniert → Training-Code hat noch Bugs (Memory-Management, Stabilität) → Systematisches Experimentieren jetzt möglich→ 21 Ausblick: Webapp 22 Ausblick: Nächste Schritte Kurzfristig Bugs im Training-Loop fixen (Stabilität, Memory-Optimierung)→ Systematische Experimente mit Pipeline→ • Ordinal Loss Functions Abstand der Vorhersagen bei Training berücksichtigen→ • Moderne Architekturen und Backbones testen: u. a. DINOv3, ConvNeXt, EfficientNetX X • Hybrid-Ansätze: CNN (lokal) + Transformer (global) • Verschiedene Augmentation-Strategien testen • Lernstrategie evaluieren Zusammensetzung der Batches (contrastive learning)→ Mittelfristig Modell-Performance verbessern→ • Ensemble-Methoden (mehrere Modelle kombinieren) bpsw. Coarse-To-Fine→ • Cross-Validation für robustere Metriken • Uncertainty Estimation Wie sicher ist das Modell?→ • Calibration - Sind die Confidence-Werte verlässlich? 23 Ausblick: Weitere Möglichkeiten Vision Language Models (VLMs) Versuch: Qwen-VL Finetuning→ Problem: Instabile Konvergenz, zu kleine Datenmenge für VLM-Finetuning→ Self-Supervised Pretraining Vision Transformers (ViT) mit Masked Autoencoding (MAE)→ Ziel: Lernen von allgemeinen Schriftmerkmalen ohne Labels→ Ähnlich BERT für Text: Maskiere Patches, rekonstruiere sie→ Status: Erste Experimente durchgeführt, noch nicht in Pipeline integriert→ Vorteil: Könnte mit undatierten Handschriften vor-trainiert werden→ Feature Engineering & Metadaten Inhaltliche Informationen (Korrespondenzpartner, Thema, Ort)→ Paläographische Features (Buchstabenformen, Ligaturen)→ 24 Vielen Dank für die Aufmerksamkeit!