scieee AI-readable full text Open interactive document viewer

Textdigitalisierung

stoekl ben ezra, daniel

Full text

107 Textdigitalisierung Daniel Stökl Ben Ezra https://orcid.org/0000-0001-5668-493X Abstract Textdigitalisierung beschreibt die Konvertierung digitaler Bilddaten beschrifteter Objekte in maschinenlesbare Texte. Keywords HTR, OCR, Layoutanalyse, Handschriften, Maschinelles Lernen, Neuronale Netzwerke 1. Einleitung Als Textdigitalisierung möchten wir hier die Konvertierung digitaler Bilder beschrifteter Objekte jedweder Art (Handschriften, Inschriften, Keilschrifttafeln, Drucke, etc.) in maschinenlesbare Texte bezeichnen, wobei „Text“ weit über Buchstabensequenz hinausgeht. Datenbanken mit Volltextsuchoptionen in retrodigitalisierten Drucken wie JSTOR (seit 1994) oder Google-Books (seit 2004) haben die Arbeitsweise in allen wissenschaftlichen Fächern grundlegend verändert. Die letzten zehn Jahre haben durch den bahnbrechenden Fortschritt in der automatischen Dokumentenanalyse v. a. im maschinellen Lernen (machine learning) die Möglichkeiten revolutioniert, auch für Forschende nicht nur schwierige Drucke der wichtigsten Kulturschriften, sondern sogar historische Handschriften automatisch zu analysieren. Transkription ist nicht die einzige Analyseebene. Gerard Genette (1982) hat die Bedeutung des Layouts und der Nicht-Haupttextabschnitte für das (Vor)verständnis von Texten eindrücklich herausgearbeitet. Layout enthält kritische Informationen, wie z. B. die Unterscheidung zwischen Titel und Haupttext, Haupttext und Anmerkungen, Sprechern bei Dramen, Versen bei Dichtung oder Textverbindungen bei Übersetzungen oder Kommentaren. Auch Wahl von und Wechsel in Schriftart, -schnitt, -breite, -lage (normal, kursiv, schräg), -stärke, -farbe, Drucktypen, Alphabeten sind essentielle Informationsträger, die die Analysetiefe eines analysierten Textes über die einfache Buchstabensequenz maßgeblich vertiefen können (Beinert 2021). Dazu kommen Möglichkeiten, über maschinelle Paläographie, Layoutuntersuchung und Kodikologie all diese feinen Unterschiede zur Netzwerkanalyse, Datierung und Verortung der Einzelobjekte auszuwerten. Über dieses big data gewinnen die traditionellen Hilfswissenschaften eine völlig neue Stellenbedeutung. Daniel Stökl Ben Ezra: Textdigitalisierung, in: Christopher A. Nunn und Frederike van Oorschot (Hrsg.): Kompendium Computational Theology 1. Forschungspraktiken in den Digital Humanities, Heidelberg: heiBOOKS, 2024, S. 107–125. DOI: https://doi.org/10.11588/heibooks.1459.c21906 Daniel Stökl Ben Ezra108 Der hier vorliegende Aufsatz wird nach einigen kurzen Einleitungsfragen zur Bildund Textkodierung, Neuronalen Netzwerken sowie zu existierenden Programmen zunächst auf die Layoutanalyse und die Leseordnung, dann auf Computerpaläographie und Texterkennung eingehen. Die Diskussion verläuft in permanenter Interaktion mit der in der Informatik „Bildverarbeitung“ genannten Disziplin (Maier et al. 2021). 2. Kodierung von Bildern Computer können nur die Werte 0 und 1 unterscheiden. Sowohl Texte als auch Bilder müssen also zunächst als Sequenzen von Nullen und Einsen dargestellt werden. Gewöhnlich wird das Bild mit einem Raster in eine Tabelle/Matrix mit Zeilen und Spalten übertragen, in der jede Zelle einen Wert für einen Bildpunkt (Pixel) enthält. Hochauflösende Bilder haben mehr Pixel für die gleiche Objektoberfläche als Bilder mit niedriger Auflösung. Das einfachste Bildformat sind schwarz-weiß Bilder, die für jedes Pixel nur 0 oder 1, also beispielsweise Vordergrund (Tinte) oder Hintergrund (Papier), kennen. Das führt, vor allem bei niedriger Auflösung oder starker Vergrößerung, zu den bekannten Treppenstufen (Abb. 1). Abb. 1 Abraham Lincoln als Graustufenbild mit den Werten auf einer Skala von 0 – 255. Wer feiner nuancieren möchte, verwendet Graustufenbilder, die Zwischenstufen ermöglichen. 0 steht weiterhin für Schwarz, doch statt 1 wird nun 255 für Weiß verwendet und alle Zahlen dazwischen bezeichnen Grauwerte, je nachdem ob sie näher an Weiß oder an Schwarz sind. Dies sind sogenannte 8-Bit Bilder, also eine Kombination von acht Speicherzellen (Bits) für jedes Pixel (256 = 28). Wer noch feiner abstufen Textdigitalisierung 109 möchte, kann auch umfangreichere Graustufenskalierungen verwenden und dann mit Werten von 0 bis 65555 (16-Bit – 216) oder mehr arbeiten. Wiederum wird der tiefste Wert für Schwarz und der höchste Wert für Weiß verwendet, und die dazwischenliegenden Werte stellen die möglichen Graustufen dar. Für Farbbilder wird eine Kombination von drei übereinanderliegenden Graustufenbildern mit einer 8-Bit Skala von 0 – 255 verwendet, deren Farbkomposition (z. B. rot-grün-blau = RGB) für unsere Augen die Mischfarben erzeugt, z. B. violett, braun, orange oder rosa. Statt RGB können auch andere Farbkanäle verwendet werden, z. B. Cyan, Magenta und Gelb, wie in Farbdruckern. Und wie bei Graustufenbildern kann man statt einer 8-Bit Skala auch eine wesentlich feinere 16-Bit Skala wählen. Je größer Höhe und Breite, Auflösung oder Farbenskala, desto mehr Speicher braucht ein Bild. Um Platz zu sparen oder größere Geschwindigkeit bei der Verarbeitung zu gewinnen, werden Bilddaten oft komprimiert. Jeder Kameraoder Scannerhersteller hat sein firmeneigenes Format (Raw). Bei Export wird dies gewöhnlich in TIFF-, PNGoder JPEG-Bilddateien konvertiert. Je nach Kompression benötigen TIFF und PNG wesentlich mehr Speicherraum als JPEG Bilddateien (Extension jpg), die mit einem Kompressionsalgorithmus erzeugt werden, der mehr Informationsverlust in Kauf nimmt, um weniger Speicherraum einzunehmen. Dies erzeugt sogenannte Artefakte, die man bei starker Vergrößerung leicht daran erkennen kann, dass das Bild wie Badezimmerkacheln aussieht. Bei guter Bildauflösung (mindestens 30 Pixel für ein ‚a‘ oder ‚א‘, bei komplexeren Schriften wie chinesisch wesentlich mehr) reichen jpgs für Layoutanalyse und Texterkennung heutzutage oft aus. Automatische Paläographie oder Schreiberzuordnung erreicht bei TIFFund PNG-Dateien bessere Ergebnisse. 3. Kodierung von Texten Auch Text ist im Computer als Sequenzen von 0 und 1 abgespeichert. Früher, als Speicher noch wesentlich teurer war als heute, wurden für alle Varianten zusammen für jedes Zeichen nur 8 Bit reserviert, sodass Computer nur 256 unterschiedliche Werte (Kodepunkte) kannten, die je nach sprachlicher oder geographischer Arbeitsumgebung immer nur eine Auswahl von Lateinisch, Griechisch, Kyrillisch oder Hebräisch darstellen konnten. Dies war die sogenannte Extended ASCII-Tabelle. Ein zusätzlicher Code in der Textdatei gab dabei an, welche Alphabete durch die Rohzahlen in der Datei gemeint waren. So konnte man sowohl in Deutschland wie auch in Bulgarien, Israel oder Saudi-Arabien mit den lokalen Alphabeten arbeiten, aber nie mit allen Schriften gleichzeitig. Komplexere Schriften, bei denen die Gesamtzahl der Zeichen größer als 256 war, wie z. B. Chinesisch, waren unmöglich. Wenn der Schlüsselcode unbekannt war, half nur ein Ausprobieren der Kodierungen, bis der Text lesbar dargestellt war. Diese Begrenzung auf 256 unterschiedliche Zeichen war für philologische Arbeiten in Daniel Stökl Ben Ezra110 der Theologie, wo neben Griechisch und Hebräisch oft auch Syrisch, Arabisch, Armenisch, Georgisch oder Koptisch, manchmal auch Akkadisch, Ägyptisch, Äthiopisch oder Sanskrit verwendet wurden, eine große Herausforderung. Die Einführung des Unicode-Standards seit 1991 hat einen großen Schritt zur Lösung dieses Problems beigetragen. Ähnlich wie bei den Graustufenbildern mit feinerer Nuancierung wurde zunächst einfach der für jedes Zeichen reservierte Speicher von 8 Bit auf 16 Bit verdoppelt, was 216 = 65,536 unterschiedliche Kodepunkte in der Tabelle ermöglicht. 2022 konnten mit dieser auch als UTF-8 bezeichneten Kodierung insgesamt 161 Schriften in einer einzigen Tabelle definiert werden. Auch wenn dies ein großer Schritt vorwärts war, sind damit noch nicht alle Schwierigkeiten für die digitale Modellierung historischer Schriften gelöst: Beispielsweise gibt es noch keinen Unicode für die babylonische Vokalisierung hebräischer Texte und Ägyptisch oder Akkadisch sind bislang nur zum Teil standardisiert. Eine Auseinandersetzung mit den Feinheiten von Unicode sei allen Geisteswissenschaftler*innen angeraten, denn die zu lösenden Grundfragen von Schriftkodierung sind trickreich. Auf weitere Fragen wie Leseordnung bei bidirektionalen Texten, die Hebräisch und Lateinisch mischen, oder Zeichenkombinationskodierung kommen wir unten bei der Texterkennung zurück. 4. Neuronale Netzwerke Der rasante Fortschritt in der automatischen Dokumentenanalyse der letzten Jahre hat fünf voneinander abhängige Hauptursachen: Hardware (Speicher, Geschwindigkeit), Software (Neuronale Netzwerke), Trainingsdatenmengen, Massendigitalisierung und Open-Source-Politik. Prozessoren sind viel schneller geworden und können noch dazu durch gewachsene Arbeitsspeicher wesentlich größere Datenmengen gleichzeitig verarbeiten. Auch Festplattenspeicher und Internetdatentransmission (Glasfaser) sind preislich billiger und qualitätsmäßig um vieles besser als noch vor zehn Jahren. Massendigitalisierungsprojekte von kulturell bedeutenden Handschriftensammlungen, Archiven und Bibliotheken haben zu einer Flut von Bilddaten geführt. Das Interesse verschiedener Großkonzerne an der Verarbeitung großer schriftlicher und mündlicher Textmengen (Google-Books, Youtube, Netflix, Zoom), haben nicht nur bekannte Algorithmen verbessert sondern auch derer neue entwickelt. Ein Teil dieser Algorithmen ist in open-source Paketen der wichtigsten Programmiersprachen öffentlich frei zugänglich (z. B. pytorch von Facebook, TensorFlow von Google). Dazu kommen schließlich verschiedene Forschungsprojekte, die ihre Trainingsdaten mit offenen Lizenzen veröffentlicht haben, und somit anderen Akteuren ermöglichen, mit ihnen neue Algorithmen zu entwickeln oder zu optimieren. Für fast alle Etappen automatischer Dokumentenanalyse werden unterschiedliche Formen sogenannter künstlicher neuronaler Netzwerke verwendet. Das Grund- Textdigitalisierung 111 prinzip war seit Rosenblatt 1958 bekannt, doch erst die oben erwähnte Konstellation vom simultanen Fortschritt bei Hardware, Software, Daten und open-source hat zu ihrem schwindelerregenden Siegeszug geführt, angefangen mit Jürgen Schmidhubers und Yann LeCuns Arbeiten in den frühen 90ern). Das Grundprinzip ist eine sehr komplexe Formel mit Tausenden, Millionen oder sogar Milliarden von Parametern, die vom Computer in einem „Training“ genannten Lernprozess selbst optimiert werden. Das Endergebnis einer trainierten Netzwerk-Architektur wird als „Modell“ bezeichnet, da es die Fragestellung mathematisch modelliert (Abb. 2). Künstliche neuronale Netzwerke emulieren in gewisser Weise die Ar beitsweise von Gehirnen. Die drei relevantesten Netzwerktypen sind zur Zeit Convolutional Neural Networks (CNN), Recurrent Neural Networks (RNN) und Transformers (die deutschen Termini sind ungebräuchlich). Das wichtigste gemeinsame Prinzip ist die Einbeziehung des Kontextes für jeden Datenpunkt. CNNs sind besonders für Bilder interessant, weil hier ein Datenpunkt (d. h. ein Pixel) im Kontext eines Rechtecks betrachtet wird. So kann der Computer z. B. abstrakte Konzepte wie Kurven unterschiedlicher Krümmung und Linien in unterschiedlichen Winkeln und Ausrichtungen und Kombinationen lernen. RNNs sind für Sequenzen wie Audioaufnahmen oder Texte besonders interessant, da sie darin flexibel sind zu lernen, wieviel Kontext für ein gewisses Phänomen einzubeziehen ist. Bei längeren Sequenzen verwendet man dafür gerne sogenannte LSTMs, Long-Short Term Memory Neural Networks. Im Deeplearning werden mehrere Ebenen von CNNs und RNNs miteinander verbunden, so dass äußerst komplexe Architekturen entstehen, die große Datenmengen und oft viel Zeit benötigen, um trainiert zu werden, aber auch hervorragende Ergebnisse liefern, sowohl für Layoutanalyse als auch für Transkription und viele andere Aufgaben wie zum Beispiel Klassifikation. Transformer sind vor allem über die jüngsten Großen Sprachmodelle (Large Language Models, LLMs) wie BERT (Bidirectional Encoder Representations from Transformers) und GPT (Generative Pre-Trained Transformer) bekannt geworden. Bei richtiger Konfiguration und optimalem Lernprozess können sie lernen, Layoutanalyse gleichzeitig mit der Transkription auszuführen, Eigennamen zu erkennen (Named Entity Recognition), die entstandenen Texte zu übersetzen oder zusammenzufassen oder sogar Fragen zu beantworten. Beim Trainieren unterscheidet man zwischen überwachten (supervised), selbstüberwachten (self-supervised) und nicht-überwachten (unsupervised) Trainingsprozessen. Beim überwachten Trainingsprozess zeigt man dem Computer viele Fragen mit den dazugehörigen Antworten und der Computer versucht, schrittweise die Parameter der Formel zu optimieren. Frage-Antwort Paare richten sich nach dem Lernziel und können je nach Aufgabe grundsätzlich ganz unterschiedlich sein: (1) das Bild einer Textzeile und die dazugehörige Transkription. (2) das Bild einer Handschriftenseite und die dazugehörigen Polygone des Layouts. (3) das Bild einer Buchseite und die dazugehörige Drucktype, etc. Sowohl Frage als auch Antwort werden natürlich als eine Zahl (Skalar), Zahlensequenz (Vektor) o. ä. dargestellt, denn etwas Anderes Daniel Stökl Ben Ezra112 kennen Computer nicht. Am Anfang sind alle Parameter zufällig initialisiert. Nach jedem Lernvorgang (Fragestellung – Antwortberechnung) wird die Distanz zur richtigen Antwort gemessen und die Parameter werden so angepasst, dass die berechnete Antwort der richtigen näherkommt. Wenn dies möglich ist (und es ist nicht immer so), spricht man davon, dass das Modell konvergiert. In regelmäßigen Abständen wird die Computerformel einem Test ausgesetzt, in dem ihr Fragen-Antwort Paare vorgelegt werden, ohne dass der Computer aus ihnen lernt, also ohne Formelveränderung, sondern nur um die augenblickliche Präzision des gegenwärtigen Modells zu ermitteln. Die Kunst ist es, die Netzwerkarchitektur so zu formulieren, dass sie mit möglichst wenig Trainingsmaterial und in der schnellstmöglichen Rechenzeit die besten Modelle erreichen kann. Das Training wird zumeist dann abgebrochen, wenn der Benutzer anhand der Testergebnisse feststellt, dass der Computer sich nicht weiter verbessert. Abschließend wird jenes Modell gespeichert, welches im Vergleich die besten Ergebnisse lieferte. Abb. 2 Beispielschema eines neuronales Netzwerks mit einer eindimensionalen Eingabe-Schicht (mit vier Variablen), die über ein komplexes Netz zu einer Ausgabe-Schicht mit zwei Variablen führt. Jede der Linien ist eine mathematische Operation, deren Parameter optimiert werden müssen. Auch der Trainingsprozess ist nicht uniform. Vielleicht hilft die folgende bildliche Vorstellung: Ein Raumschiff soll so weit wie möglich durch ein komplexes Höhlenlabyrinth fliegen, darf aber immer nur Wendungen in einem gewissen Winkel vornehmen und muss dann eine gewisse Distanz in diese Richtung vorwärtsfliegen. Ist die gewählte Distanz zu kurz, krebst das Raumschiff in der großen Eingangshöhle Textdigitalisierung 113 herum, ohne einen der Eingänge zu finden. Ist die Distanz zu groß gewählt, kann das Raumschiff nicht durch enge Kurven hindurchkommen. Winkel und Distanz gehören hier zu den Hyperparametern des Trainingsvorgangs, vielleicht am ehesten mit der Lernrate (orig. „Learning rate“) zu vergleichen. Beim selbst-überwachten Trainingsprozess berechnet der Computer selbst die Antworten automatisch aus den Fragen. Zum Beispiel zeigt man dem Computer eine große Anzahl Bilder von Handschriftenzeilen, von denen ein Teil geschwärzt ist, und von ihm wird verlangt, ein Ersatzbild vorzuschlagen, wie der geschwärzte Zeilenabschnitt ausgesehen haben könnte. Mit Hilfe einer Analyse des Unterschiedes zwischen dem Computervorschlag und dem Originalbild wird das Modell optimiert. Hier lernt der Computer allmählich selbst das Prinzip, welche Pixelcluster gewöhnlich zwischen welchen anderen Pixelclustern stehen. Selbst-überwachtes Training wird manchmal als Vortraining vor überwachtem Training verwendet, weil es erlaubt Grundprinzipien vorher zu lernen und die Menge an Trainingsdaten mit händisch erstellten Antworten zu verringern. Eine Gefahr ist die Überanpassung (orig. „Overfitting“). Das kann man vergleichen mit einem Schüler, der die Antworten zu den Übungsfragen auswendig lernt, ohne das zugrundeliegende Prinzip zu begreifen. Er wird die Übungsfragen nahezu perfekt beantworten können, aber nicht dazu befähigt, ungesehene Fragen zu lösen. Dies kann z. B. geschehen, wenn das Trainingskorpus nicht der Netzwerkarchitektur angepasst ist (zu wenig Trainingsmaterial für eine zu komplexe Fragestellung) oder wenn die Lernrate, mit der der Computer die Parameter nach jedem Lernvorgang anzupassen versucht, zu hoch oder zu niedrig gesetzt ist. Natürlich haben wir hier nur einige wenige Hyperparameter beschreiben können. 5. Existierende Programme Bis vor wenigen Jahren arbeiteten die meisten an OCR interessierten Firmen und Gelehrten mit kommerziellen Programmen wie ABBYY Finereader, das sehr erfolgreich mit modernen englischen oder deutschen Texten umgehen konnte, aber an handschriftlichem Material oder selteneren Druckschriften wie den syrischen Alphabeten, für die der Markt zu klein erschien, völlig scheiterte. Googles weit verbreitetes opensource Programm Tesseract wird nur für OCR aber nicht für HTR empfohlen.1 Heutzutage (Juli 2023) gibt es mehrere Programme, die mit großem Erfolg zur Massendigitalisierung auch handschriftlichen Materials eingesetzt werden. Seit 2016 ermöglicht Transkribus über eine komplexe JAVA-App oder eine simplifizierte Web-App die automatische Layoutanalyse und Transkription von Schrift1 FAQ: https://tesseract-ocr.github.io/tessdoc/FAQ.html#can-i-use-tesseract-for-handwriting-recogni tion, zuletzt aufgerufen am 15. 06. 2024. Daniel Stökl Ben Ezra114 objekten, die manuelle Korrektur von Layoutanalyse und Erkennung sowie das Trainieren von eigenen Transkriptionsmodellen anhand der eingegebenen Daten mit ausgezeichneten Resultaten (Kahle et al. 2017, Mühlberger et al. 2019). Das ursprünglich in mehreren europäischen Forschungsprojekten entwickelte Programm wurde 2019 in Form einer europäischen Genossenschaft kommerzialisiert.2 Zurzeit zahlen Benutzer*innen pro Seite für automatische Layoutanalyse und/oder automatische Texterkennung. Die Plattform und trainierte Modelle sind dementsprechend closedsource. Andere kommerzielle Programme sind z. B. Ocelus und Calfa (Vidal Gorène 2021a). Auf der open-source Seite war das von Thomas Breuel (2008) entwickelte OCRopus/ocropy ein entscheidender Schritt nach vorne. Obgleich es, wie der Name schon sagt, nur für OCR entwickelt worden war, setzte unser Pariser Team es mit Hilfe von Marcus Liwicki seit 2015 auch für Handschriftenerkennung ein. Allerdings brauchten interessierte Personen Programmierkenntnisse. Es gab nur eine sehr rudimentäre Möglichkeit, Transkriptionen einzugeben, nur für gerade Zeilen und nur eine sehr einfache Segmentierung. Dafür wird seit 2018 eScriptorium um Benjamin Kiesslings Kraken entwickelt (Kiessling et al. 2019, Stokes et al. 2021). Es ist das bislang einzige open-source Programm für Handschriftenanalyse mit ergonomischer Nutzungsoberfläche für Layoutund Transkriptionskorrektur sowie Text-Alignierung. Es kann direkt auf Linux und Mac-OS und per WSL (Windows Subsystem for Linux) auch auf Windows Rechnern installiert werden. Um in einer Forschungsgruppe zusammen an den gleichen Dokumenten arbeiten zu können braucht man einen Server. Wer Layoutoder Transkriptions-Modelle trainieren möchte, braucht eine GPU mit ausreichend Arbeitsspeicher. 6. Layout-Analyse Computergestützte Layout-Analyse hat zwei Ziele. Zum einen ist sie – bislang – ein notwendiger Schritt vor der Texterkennung. Zum anderen enthält das Layout essentielle Informationen für die Hierarchie, Leseordnung (s. u.), unterschiedliche Texttypen, Unterscheidung von Bild und Text, etc. So kann die Layoutanalyse auch nach der Texterkennung noch einmal eine wichtige Rolle für das Textverständnis spielen. Früher benutzte man für die Layoutanalyse vielfach morphologische Operationen, um unterschiedliche Textblöcke und Zeilen zu erkennen. Heute wird dies quasi überall von neuronalen Netzwerkarchitekturen übernommen, die sowohl die Segmentierung von Blöcken und ihre Einteilung in Typen (Spalte, Kopfzeile, Marginalie, Illustration, Tabelle, Apparat etc.) als auch die Erkennung von Zeilen und ihre 2 S. https://readcoop.eu/a-short-history-of-transkribus-with-gunter-muhlberger, zuletzt aufgerufen am 15. 06. 2024. Textdigitalisierung 115 Einteilungen in Typen (Haupttextzeile, interlineare Zeile) und die Schreibrichtung (horizontal, vertikal, auf dem Kopf) bewerkstelligen (Abb. 3). Dabei legt eine sogenannte Segmentierungsontologie fest, welche Blockund Zeilentypen für welche Phänomene zur Anwendung kommen können. Zonen müssen übrigens nicht unbedingt Text blöcke sein. Benutzer können die Bildsegmentierung auch zur Ortung von Bibliotheksstempeln, Münzen, Illustrationen o. ä. benutzen. Für die Blocksegmentierung gibt es zurzeit zwei unterschiedliche Ansätze. Der eine Ansatz benutzt Prinzipien für die Objekterkennung wie Ampeln oder Schilder bei selbstfahrenden Autos (Clérice 2022). Dieser Ansatz funktioniert sehr gut bei Textobjekten mit ausschließlich rechteckigen Blöcken, die genau ohne Rotation digitalisiert worden sind. Bei komplexerem Layout, z. B. L-förmigen Blöcken, oder bei kleinen Rotationen gibt es jedoch schnell Probleme. Der andere Ansatz ist ein Pixelklassifikator (Kiessling 2020). Alle Bildpixel werden keiner, einer oder mehreren gewünschten Regionstypen zugewiesen. Anschließend wird die Pixelwolke für jeden Regionstyp ermittelt und daraus ein oder mehrere Polygone rekonstruiert. Dieser Ansatz kommt besser mit komplexem Layout oder rotierten Digitalisaten zurecht, hat aber den Nachteil, Pixelgrupppen des gleichen Abb. 3 Vollautomatische Layoutsegmentierung und Transkription des Genizahfragmentes Cambridge, T.-S. 10 J 12 16 mit eScriptorium, erstellt im HTR4PGP Projekt Daniel Stökl Ben Ezra122 Künstlichen Intelligenz (S. 673 – 712). Berlin/Boston: De Gruyter. https://doi. org/10.1515/9783110659948-015 [zuletzt aufgerufen am 15. 06. 2024]. Miyagawa, S., Bulert, K., Büchler, M., & Behlmer, H. (2019). Optical character recognition of typeset Coptic text with neural networks, Digital Scholarship in the Humanities, 34(1), 35 – 41. https://doi.org/10.1093/llc/fqz023 [zuletzt aufgerufen am 15. 06. 2024]. Miyagawa, S., Zeldes, A., Büchler, M., Behlmer, H., & Griffitts, T. (2018). Building Linguistically and Intertextually Tagged Coptic Corpora with Open Source Tools. In Suzuki, Ch. (Hrsg.), Proceedings of the 8th Conference of Japanese Association for Digital Humanities. Leveraging Open Data (S. 139 – 141). Tokyo: Center for Open Data in the Humanities. Miyagawa, S. (2020). Digitization of Coptic Manuscripts and Digital Humanities. Tools and Methods for Coptic Studies, The International Journal of Levant Studies, 2, 29 – 61. Mühlberger, G., Seaward, L., Terras, M., Ares Oliveira, S., Bosch, V., Bryan, M., Colutto, S., Déjean, H., Diem, M., Fiel, S., Gatos, B., Greinoecker, A., Grüning, T., Hackl, G., Haukkovaara, V., Heyer, G., Hirvonen, L., Hodel, T., Jokinen, M., Kahle, Ph., Kallio, M., Kaplan, F., Kleber, F., Labahn, R., Lang, E. M., Laube, S., Leifert, G., Louloudis, G., McNicholl, R., Jean-Meunier, L., Michael, J., Mühlbauer, E., Philipp, N., Pratikakis, I., Puigcerver Pérez, J., Putz, H., Retsinas, G., Romero, V., Sablatnig, R., Joan-Sánchez, A., Schofield, Ph., Sfikas, G., Sieber, Ch., Stamatopoulos, N., Strauß, T., Terbul, T., Toselli, A. H., Ulreich, B., Villegas, M., Vidal, E., Walcher, J., Weidemann, M., Wurster, H., & Zagoris, K. (2019). Transforming scholarship in the archives through handwritten text recognition, Journal of Documentation, 75(5), 954 – 976. Nikolaidou, K., Seuret, M., Mokayed, H., Liwicki, M. (2022). A survey of historical document image datasets, International Journal of Document Analysis and Recognition, 25(4), 305 – 338. Quirós, L., & Vidal, E. (2022). Reading order detection on handwritten documents, Neural Computer Applications 34(12), 9593 – 9611. Rosenblatt, F. (1958). The perceptron: A probabilistic model for information storage and organization in the brain, Psychological Review, 65(6), 386 – 408. https://doi. org/10.1037/h0042519 [zuletzt aufgerufen am 15. 06. 2024]. Scius-Bertrand, A., Ströbel, Ph., Volk, M., Hodel, T., & Fischer, A. (2023). The Bullinger Dataset. A Writer Adaptation Challenge. In ICDAR 2023: Document Analysis and Recognition. Conference Proceedings, 1 (S. 397 – 410). San José: Springer. https:// doi.org/10.1007/978-3-031-41676-7_23 [zuletzt aufgerufen am 15. 06. 2024]. Seuret, M., Nicolau, A., Rodríguez, D.-S., Weichselbaumer, N., Stutzmann, D., Mayr, M., Maier, A., & Christlein, V. (2021). ICDAR 2021 Competition on Historical Document Classification. In Lladós, J., Lopresti, D., Seiichi, U. (Hrsg.), Document Analysis and Rcognition. ICDAR 2021 (S. 618 – 634). Lausanne: Springer. https:// doi.org/10.1007/978-3-030-86337-1_41 [zuletzt aufgerufen am 15. 06. 2024]. Textdigitalisierung 123 Smith, D., Murel, J., Parkes-Allen, J., & Miller, M. T. (2023). Automatic Collation for Diversifying Corpora. Commonly Copied Texts as Distant Supervision for Handwritten Text Recognition. In Computational Humanities Research Conference. CEUR Workshop Proceedings 2023 (S. 206 – 221). Paris: Computational Humanities Research. URL: https://ceur-ws.org/Vol-3558/paper1708.pdf [zuletzt aufgerufen am 15. 05. 2024]. Stokes, P., Kiessling, B., Tissot, R., Gargem E., & Stökl Ben Ezra, D. (2021). The eScriptorium VRE for Manuscript Cultures. In C. Clivaz, & G. V. Allen (Hrsg.), Ancient Manuscripts and Virtual Research Environments (o. S.) [= Classics@Journal 18(1)]. URL: https://classics-at.chs.harvard.edu/classics18-stokes-kiessling-stokl-benezra-tissot-gargem [zuletzt aufgerufen am 15. 06. 2024]. Stökl Ben Ezra, D., Brown-DeVost, B., Dershowitz, N., Pechorin, A., & Kiessling, B. (2020). Transcription Alignment for Highly Fragmentary Historical Manuscripts. The Dead Sea Scrolls. In International Conference on Frontiers in Handwriting Recognition (S. 361 – 366). Dortmund: IEEE Xplore. https://doi.org/10.1109/ ICFHR2020.2020.00072 [zuletzt aufgerufen am 15. 06. 2024]. Stökl Ben Ezra, D., & Lapin, H. (im Druck). From HTR to Digital Critical Scholarly Edition. Reflexions on the Use of Machine Learning. Computational and Digital Humanities in the Sofer Mahir Project. In U. Henny-Krahmer et al. (Hrsg.), Machine Learning and Data Mining for Digital Scholarly Editions. Norderstedt: Books on Demand [= SIDE]. Stökl Ben Ezra, D., Lapin, H., Brown DeVost, B., & Jablonski, P. (2022a). HTR2CritEd. A Semi-Automatic Pipeline to Produce a Critical Digital Edition of Literary Texts with Multiple Witnesses out of Text Created through Handwritten Text Recognition. In Digital Humanities 2022. Responding to Asian Diversity (S. 690 – 691). Tokyo: DH2022 Local Organizing Committee. URL: https://dh2022.dhii.asia/ dh2022bookofabsts.pdf [zuletzt aufgerufen am 15. 06. 2024]. Stökl Ben Ezra, D., Rustow, M., & Witty, D. (2022b). Segmentation Mode for Archival Documents with Highly Complex Layout. In Conference Documents anciens et reconnaissance automatique des écritures manuscrites. École national des chartes, Paris: YouTube. URL: https://www.youtube.com/watch?v=dE1XUXiuitU (7:07 – 7:30) [zuletzt aufgerufen am 15. 06. 2024]. Ströbel, Ph., Hodel, T., Fischer, A., Scius, A., Wolf, B., Janka, A., Widmer, J., Scheurer, P., & Volk, M. (2023). Bullingers Briefwechsel zugänglich machen. Stand der Handschriftenerkennung. In A. Busch, & P. Trilcke (Hrsg.), DHd 2023. Open Humanities, Open Culture (S. 98 – 102). Belval/Trier: Zenodo. https://doi.org/10.5281/ zenodo.7688631 [zuletzt aufgerufen am 15. 06. 2024]. Wolf, L., Littman, R., Mayer, N., German, T., Dershowitz, N., Shweka, R., & Choueka, Y. (2010). Identifying Join Candidates in the Cairo Genizah, International Journal of Computer Vision, 94(1), 118 – 135. Daniel Stökl Ben Ezra124 Weiterführende Literatur Camps, J.-B., Vidal-Gorène, Ch., & Vernet, M. (2021). Handling Heavily Abbreviated Manuscripts. HTR Engines vs Text Normalisation Approaches. In E. H. Barney Smith & U. Pal (Hrsg.), Document Analysis and Recognition – ICDAR 2021 Workshops. ICDAR 2021 (S. 306 – 316). Cham: Springer [= Lecture Notes in Computer Science, 12917]. https://doi.org/10.1007/978-3-030-86159-9_21 [zuletzt aufgerufen am 15. 06. 2024]. Chagué, A., & Thibault, C. (2023). I’m here to fight for ground truth. HTR-United, a solution towards a common for HTR training data. In Digital Humanities 2023. Collaboration as Opportunity. Graz: Zenodo. https://doi.org/10.5281/ zenodo.8107449 [zuletzt aufgerufen am 15. 06. 2024]. Perdiki, E. (2023). List of manuscripts containing John Chrysostom’s Homilies and the relevant manual transcriptions, 1(2). Zenodo. https://doi.org/10.5281/ zenodo.8102662 [zuletzt aufgerufen am 15. 06. 2024]. Popović, M., Dhali, M. A., & Schomaker, L. (2023). Artificial intelligence based writer identification generates new evidence for the unknown scribes of the Dead Sea Scrolls exemplified by the Great Isaiah Scroll (1QIsaa), PLoS ONE, 16(4. e0249769), 1 – 28. https://doi.org/10.1371/journal.pone.0249769 [zuletzt aufgerufen am 15. 06. 2024]. Thibault, C. (2022). You Actually Look Twice At it (YALTAi). Using an object detection approach instead of region segmentation within the Kraken engine, Journal of Data Mining and Digital Humanities, 1 – 13. https://doi.org/10.48550/ arXiv.2207.11230 [zuletzt aufgerufen am 15. 06. 2024]. Vidal-Gorène, Ch., Dupin B., Decours-Perez A., & Riccioli T. (2021a). A Modular and Automated Annotation Platform for Handwritings. Evaluation on UnderResourced Languages. In Lladós, J., Lopresti, D., Seiichi, U. (Hrsg.), Document Analysis and Rcognition. ICDAR 2021 (S. 507 – 522). Lausanne: Springer. https:// doi.org/10.1007/978-3-030-86334-0_33 [zuletzt aufgerufen am 15. 06. 2024]. Vidal-Gorène, Ch., & Decours-Perez, A. (2021b) A Computational Approach of Armenian Paleography. In E. H. Barney Smith & U. Pal (Hrsg.), Document Analysis and Recognition – ICDAR 2021 Workshops. ICDAR 2021 (S. 295 – 305). Cham: Springer [= Lecture Notes in Computer Science, 12917]. https://doi.org/10.1007/978-3-03086159-9_20 [zuletzt aufgerufen am 15. 06. 2024]. Wick, Ch., Reul, Ch., & Puppe, F. (2018). Comparison of OCR Accuracy on Early Printed Books using the Open Source Engines Calamari and OCRopus, Journal of Language Technology and Computational Linguistics, 33(1), 79 – 96. Textdigitalisierung 125 Bildnachweise Abb. 1: Abraham Lincoln als Graufstufenbild. CC0. Das Bild dürfte ursprünglich auf Leon Harmon zurückgehen, der 1971 herausfinden wollte, auf wieviel visuelle Information ein Bild verzichten kann, um noch erkennbar zu sein. Abb. 2: Wikipedia © „BrunelloN“ CC-BY-SA 4.0 Abb. 3: Screenshot Daniel Stökl Ben Ezra. Handschrift © CC-BY Cambridge University Library Funded by the European Union (ERC, MiDRASH, Project No. 101071829). Views and opinions expressed are however those of the author(s) only and do not necessarily reflect those of the European Union or the European Research Council Executive Agency. Neither the European Union nor the granting authority can be held responsible for them.