Full text
https://hpi.de/ki-servicezentrum/ ÜBERSICH T Vier KI-Servicezentrum im Bund Ziel: Barrieren der Implementierung von KI-Anwendungen in Gesellschaft und Wirtschaft reduzieren 1
KI Serviczentrum Berlin Brandenburg 2 Forschung Bildung Infrastruktur Beratung AISC
FORSCHUNG •KI-Methoden Forschung •KIBetriebsforschung 3
INFRASTRUKT UR Training •64 NVIDIA H100 GPU Inferenz •40 NVIDIA A30 GPU ARM Server •Ampere Altra Max M128-30 CPU •2 x NVIDIA L40 GPUs GPU Server •AMD Epyc CPU •8 x NVIDIA L40S GPU aisc.hpi.de Zugangsanfrage •Zugang kostenfrei •Kein Produktionsbetrieb ⚬Daten sollten anonymisiert oder synthetisiert sein ⚬Kein Hosting von Produkten •Reporting & Veröffentlichung durch Nutzende •Altrechte bleiben bei Nutzenden •Neurechte bleiben bei Nutzenden ⚬Einräumen von Nutzungsrechten für Forschung und Lehre Edge •ARMv8 CPU •NVIDIA Jetson AGX Module Neuromorph •288 SpiNNaker2 Chips Speicher •1.5 PB NVMe Netwerk •400 Gb/s Infiniband •200 Gb/s Ethernet 4
Talks •Gastvorträge zu Forschung und Innovation tele-task.de/series/ 1463 Work shops •Praxisnahe Themen •Beispielthemen: Speech2summary, Docker für ML, semantische Suche aimaker.communit y MOOCs •ChatGPT: Was bedeutet generative KI für unsere Gesellschaft? •Profitable KI •KI Biases verstehen und vermeiden open.hpi.de/channels/ai-servicecenter BILDUN G Newsletter 5
BERATU NG KI-Sprechstunde •Beantwortung von Fragen: ⚬zu KI-Infrastruktur ⚬zu KI-Modellen & Frameworks ⚬Zu KI-Anwendungsfällen KI-Pilotprojekte •Co-Entwicklung eines Prototyps •Bewerbung alle drei Monate •Auswahlkriterien z.B. KI-Reife, Gemeinwohl •Veröffentlichung der Ergebnisse Kooperationen •Gemeinsam organisierte Netzwerktreffen Jetzt bewerben! github.com/aihpi/leichte-sprache Bisherige KI-Pilotprojekte •Generierung Mathematik-Problemen •Generierung Leichter Sprache •Generierung von Upcycling Vorschlägen •Reduzierung von Food Waste •Datierung mittels Handschrift Sprechstunde buchen 6
Leibniz-Edition, Reihe VIII: Naturwissenschaftliche, medizinische und technische Schriften Bereits erschienene Bände:! ! VIII, 1 = 1668–1676, Berlin 2009! VIII, 2 = 1668–1676, Berlin 2016! VIII, 3 = Mechanik 1: Akustik, Elastizität, Festigkeit, Stoß (1671-1705), Berlin 2021! VIII, 4 = Mechanik 2: Akustik, Elastizität, Festigkeit, Statik, Stoß (1676-1715), Berlin 2024! https://leibnizp2.bbaw.de/de/leibniz-online! 1
Der Leibniz’sche Nachlass Weitgehend geschlossen überliefert: Gottfried-Wilhelm-Leibniz-Bibliothek in Hannover! Umfang: allein in der GWLB etwa 100.000 Blatt! Stephan Waldhoff, „Quellenkunde“! in Beiderbeck F., Li W., Waldhoff S. (Hrsg.): ! Gottfried Wilhelm Leibniz. Rezeption, Forschung, Ausblick Stuttgart 2020, S. 29–165! 2
Beispiel einer transparenten „Datierungsbegründung“ (LSB VIII, 4 N. 28, S. 111–116)! ! ! ! 3
Vom Gelehrten zum Problem Maschinelle Datierung von Leibniz-Handschriften: Die Anwendung von Deep-Learning-Verfahren zur Unterstützung der historischkritischen Editionsarbeit
2 Inhalt Hintergrund und Forschungsstand Fragestellung Technische Umsetzung Ausblick
3 Hintergrund und Forschungsstand Herausforderung: Granularitätslücke bei der automatisierten Handschriftendatierung Traditionelle Ansätze zur Datierung etwa mittelalterlicher Manuskripte über die Identifikation von Schreibern, bewegen sich im Bereich ±50–100 Jahre Genauigkeit Writer Aging und forensische Handschriftenanalyse erreichen im besten Fall DekadenGranularität praktisches Maximum bei 10-30 Jahre breiten Kategorien→ Neuere Deep-Learning-Ansätze zwar erfolgversprechend Praktisch meist Dekaden-Bins (10-25 Jahre) als Klassifikationseinheiten→ Mangel an absolut datierten Referenzmanuskripten oft zentrale Herausforderung Bspw. Dead-Sea-Scrolls-Projekt (Popović et al., 2024):→ Kombiniert 24 Radiokarbondatierungen mit Schriftmerkmalen
4 Formulierung der Forschungsfrage 1. Ansatz: Wann wurde das Manuskript geschrieben? Recherche und Methodik von klassischen Datierungs-Ansätzen geprägt, kaum für → spezifische Problem adaptierbare Ansätze 2. Ansatz: Wie alt war Leibniz beim Verfassen der Dokumente? Führte zu paläographischen und forensischen Ansätzen, die aber auch zu ungenau für → das die angestrebte Anwendung sind Bisherige Methoden nicht geeignet für sinnvollen Einsatz bei Datierung der LeibnizDokumente, nur wenig Forschung zur automatisierten Datierung einer Schreiberhand Bewusster Verzicht auf OCR/HTR Fokus auf Schrift als Merkmalsträger→
5 Technische Herausforderung Vielen offene Fragen: Welche Modellarchitektur erfasst die feinen Veränderungen im Schriftbild am besten?→ Welche Vorverarbeitung ist sinnvoll? RGB, Graustufen oder Binarisierung?→ Arbeiten wir mit ganzen Seiten oder segmentieren wir Zeilen?→ Evaluation verschiedener Kombinationen und Ansätze erforderlich Problem: train_model_v3_FINAL_REALLY_THIS_ONE.py model_new_aug_WORKING.py experiment_resnet_maybe_final.py Experimente nicht reproduzierbar, Ergebnisse nicht vergleichbar, fehlende Übersicht→ Daher Ansatz für systematisches Experimentieren benötigt Modulare Pipeline mit Jupyter Notebooks als zentrale Schnittstelle→ Möglichst automatische und vergleichbare Datenerhebung→ CLI mit Stapelverarbeitung: →python -m ScriptDater.main --ids 003 006 999
6 Pipeline: Verwendete Bibliotheken Preprocessing Line segmentation Kraken mit Standard-Modell→ Augmentations Albumentations→ Binarization SBB Eynollah, konvertiert zu PyTorch→ Modeling Deep Learning Framework PyTorch→ zusätzliche Architekturkomponenten pytorch-image-models → Tracking & Explainability Automatisches Experiment tracking MLflow→ Explainability Captum (GradCAM, Integrated Gradients, Saliency)→ Architekturdiagramme TorchViz→
7 Pipeline: Architektur Ziel: modular erweiterbare und möglichst flexible Pipeline DATASET Ganze Seite vs. Zeilensegmentierung→ Graustufen, Binarisierung, Rotationskorrektur→ Augmentation-Strategien→ Caching→ Splits (training/validation/testing)→ MODEL Konfiguration und Verwaltung von Backbone, Neck und Task-Head→ TRAINING Konfiguration und Definition von Loss, Optimizer und Training-Loop→ EVALUATION Wie gut lernt das Modell?→ EXPERIMENT Extraktion der Konfiguration aus den Notebooks, Orchestrierung, Tracking→ EXPLAINABILITY Was lernt das Modell?→ VISUALIZATION Erstellung von Grafiken→
8 Pipeline: Workflow
9 Pipeline: Notebook-basierte Experimente Konfiguration der Experimente in Jupyter Notebooks mit strukturierten Markdown-Tabellen Baseline: Standardvorgabe→ Value: angepasster Parameter, überschreibt Baseline→ Extraktion in Config-Objekte und Validierung mit pydantic→
10 Pipeline: Input Page-level Ganze Seite als Input (z.B. 800×1200px 224×224px)→ Layout und Gesamterscheinung erfasst→ Geeignet für grobgranulare Merkmale→ Line-level Segmentierte Zeilen einzeln (224×224px) Fokus auf Schriftbild ohne Layout-Kontext→ Line-Patches Mehrere Patches pro Zeile (z.B. 6× 224×224px) Detailanalyse einzelner Buchstaben/Wörter→ Höchste Granularität→ Memory-intensiv, längeres Training→
17 Pipeline: MLflow-Tracking
18 Pipeline: Zusammenfassung Ermöglicht systematisches Experimentieren Notebook-basierte Config mit automatischer Extraktion→ Drei Modi: Page / Line / Line-Patches→ Flexibel konfigurierbar: 700+ Architekturen testbar→ Unterstützt Klassifikation, Regression und Hybride Fragestellungen→ Automatische Dokumentation HTML Reports nach jedem Run→ MLflow tracked alles (Parameter, Metriken, Artefakte)→ Explainability→
19 Erste Ergebnisse Separate Tests (vor Pipeline-Integration) Simple CNN, verschiedene Preprocessing-Strategien → MAE: 6-8 Jahre erreicht → Aber: Nicht reproduzierbar, keine Tracking→ Pipeline läuft seit letzter Woche - erste Zahlen! Baseline (Random Guessing) MAE: ~13 Jahre→ Ohne Lernen, nur zufällige Vorhersagen→ Zeigt Schwierigkeit des Problems (48 Klassen, 1669-1716)→
20 Erste Ergebnisse Simple CNN, Line-Level, Patches, Binarisiert, 50 Epochen MAE: 8.4 Jahre (CI: 8.3-8.4) → RMSE: 12.4 Jahre (größere Fehler kommen vor) → Genauigkeiten: → • ±1 Jahr: 29% • ±2 Jahre: 36% • ±5 Jahre: 52% • ±10 Jahre: 69% • ±15 Jahre: 81% Ehrliche Einschätzung Pipeline-Infrastruktur steht und funktioniert → Training-Code hat noch Bugs (Memory-Management, Stabilität) → Systematisches Experimentieren jetzt möglich→
21 Ausblick: Webapp
22 Ausblick: Nächste Schritte Kurzfristig Bugs im Training-Loop fixen (Stabilität, Memory-Optimierung)→ Systematische Experimente mit Pipeline→ • Ordinal Loss Functions Abstand der Vorhersagen bei Training berücksichtigen→ • Moderne Architekturen und Backbones testen: u. a. DINOv3, ConvNeXt, EfficientNetX X • Hybrid-Ansätze: CNN (lokal) + Transformer (global) • Verschiedene Augmentation-Strategien testen • Lernstrategie evaluieren Zusammensetzung der Batches (contrastive learning)→ Mittelfristig Modell-Performance verbessern→ • Ensemble-Methoden (mehrere Modelle kombinieren) bpsw. Coarse-To-Fine→ • Cross-Validation für robustere Metriken • Uncertainty Estimation Wie sicher ist das Modell?→ • Calibration - Sind die Confidence-Werte verlässlich?
23 Ausblick: Weitere Möglichkeiten Vision Language Models (VLMs) Versuch: Qwen-VL Finetuning→ Problem: Instabile Konvergenz, zu kleine Datenmenge für VLM-Finetuning→ Self-Supervised Pretraining Vision Transformers (ViT) mit Masked Autoencoding (MAE)→ Ziel: Lernen von allgemeinen Schriftmerkmalen ohne Labels→ Ähnlich BERT für Text: Maskiere Patches, rekonstruiere sie→ Status: Erste Experimente durchgeführt, noch nicht in Pipeline integriert→ Vorteil: Könnte mit undatierten Handschriften vor-trainiert werden→ Feature Engineering & Metadaten Inhaltliche Informationen (Korrespondenzpartner, Thema, Ort)→ Paläographische Features (Buchstabenformen, Ligaturen)→
24 Vielen Dank für die Aufmerksamkeit!