Allgemeine Semantische Annotation - GeMTeX Annotationsrichtlinie
Abstract
This repository hosts the semantic annotation guidelines of the German Medical Text Corpus (GeMTeX) project. The guidelines are written to instruct annotators how to annotate clinical German texts with SNOMED CT concepts and connect them via unlabeled, unidirectional relations. More information can be found in: Hofenbitzer et al., 2025: Introducing Medical Semantic Annotation Guidelines for German Clinical Documentation with SNOMED CT Publication Poster
Full text
Allgemeine Semantische Annotation GeMTeX Annotationsrichtlinie Justin Hofenbitzer1, Christina Lohr2, Andrea Riedel3, Jutta Romberg4, Jakob Faller3, Sarah Riepenhausen5, Miriam Schechner6, Markus Wolfien7,8, Peter Klügl9, Jazia Omeirat10, Jacqueline Lammert1, Stefan Schulz9, Martin Boeker1, Luise Modersohn1 1Technische Universität München, 2Universität Leipzig, 3Friedrich-Alexander Universität Erlangen-Nürnberg, 4Charité Berlin, 5Universität Münster, 6Ludwig-Maximilian-Universität München, 7Technische Universität Dresden, Medizinische Fakultät, 8Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI), Dresden, 9Averbis, 10Universitätsklinikum Essen justin.hofen[email protected] Version 2.3.0: 06.11.2025
Inhaltsverzeichnis 1 Einleitung und Motivation 2 2 Grundbegriffe und Annotationsmaximen 4 2.1 Grundbegriffe................................. 4 2.2 Annotationsmaximen............................. 7 2.3 Linguistische Besonderheiten . . . . . . . . . . . . . . . . . . . . . . . . . 11 3 Annotation von Konzepten 13 3.1 Semantik der Konzeptannotation . . . . . . . . . . . . . . . . . . . . . . 13 3.2 SNOMED CT Semantic Tags . . . . . . . . . . . . . . . . . . . . . . . . 17 3.3 KonzepteinSNOMEDCT.......................... 18 3.3.1 Core-Konzepte ............................ 18 3.3.2 Modifier-Konzepte .......................... 23 3.3.3 Qualifier-Konzepte . . . . . . . . . . . . . . . . . . . . . . . . . . 26 3.4 Familiäre Erkrankungen . . . . . . . . . . . . . . . . . . . . . . . . . . . 34 4 Das No-Human Layer: Markierung von ausschließlich maschinell annotierten Bereichen 35 5 Das Hinzufügen von Relationen 36 5.1 Inhaltliche Relationen . . . . . . . . . . . . . . . . . . . . . . . . . . . . 36 5.2 Relationen bei familiären Erkrankungen . . . . . . . . . . . . . . . . . . 37 5.3 Kausalrelationen ............................... 37 5.4 Anaphorische Relationen . . . . . . . . . . . . . . . . . . . . . . . . . . . 37 5.5 Messwertrelationen.............................. 38 5.6 Schrankenrelationen.............................. 38 5.7 Koordinationsrelationen . . . . . . . . . . . . . . . . . . . . . . . . . . . 39 5.8 Faktualitätsrelationen . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 39 5.9 Temporalrelationen.............................. 40 6 Annotationspragmatik: Komplette Beispielannotationen und Grenzfälle 42 7 Kurationshinweise 45 1
1 Einleitung und Motivation Im klinischen Alltag wird nach wie vor eine Vielzahl von Texten erstellt und verwaltet. Da Texte als unstrukturierte Daten gelten, ist die statistische Auswertung oder Weiterverabeitung der enthaltenen Daten äußerst aufwändig. Das Forschungsgebiet, das sich mit dieser Problematik beschäftigt, nennt sich Computerlinguistik oder auch Natural Language Processing (NLP) und fokussiert die automatische Verarbeitung natürlicher Sprache. Methoden in diesem Forschungsgebiet reichen von regelbasierter Neurosymbolik bis hin zu maschinellem Lernen. Zur Entwicklung und Evaluation dieser Methoden im klinischen Kontext werden geeignete Trainingsdaten gebraucht, insbesondere im deutschen Sprachraum. Zu diesem Zweck wurde im Rahmen der Medizininformatikinitiative (MII) das Projekt GeMTeX1(German Medical Text Corpus) ins Leben gerufen. Ziel des Projektes ist es, klinische Texte aus der Routineversorgung mit Metadaten anzureichern und für die Forschung zur Verfügung zu stellen. An dem Projekt sind zahlreiche Forschungseinrichtungen und Universitätskliniken aus ganz Deutschland beteiligt. Sechs Universitätskliniken sind annotierende Standorte: Die Charité in Berlin, das Universitätsklinikum Carl Gustav Carus Dresden, das Universitätsklinikum Erlangen, das Universitätsklinikum Essen, das Universitätsklinikum Leipzig und das TUM Klinikum München. Jeder dieser sechs Standorte extrahiert und annotiert nach den gleichen Richtlinien bis zu 10.000 klinische Dokumente. Auf diese Weise soll eine variantenreiche Sammlung unterschiedlichster klinischer Dokumente entstehen, die mit diversem medizinischem Hintergrund und hoher Varianz in Formulierung, Krankheitsverläufen und anderen Merkmalen die deutsche klinische Sprache abbildet. Grundlage für die Annotation der klinischen Dokumente ist die derzeit jeweils aktuelle Vollversion der englischsprachigen International Edition der umfassendsten klinischen ontologiegestützten Terminologie SNOMED CT2. Mit Hilfe von SNOMED CT werden Textspannen in den GeMTeX-Texten direkt gegroundet, also mit einer standardisierten Bedeutung versehen. So wird beispielsweise dem Wort Tilidin das SNOMED CT Konzept “SCTID: 373562008 | Tilidine (substance)” zugeordnet und ist direkt wieder auffindbar. Relationen werden anschließend zwischen semantisch verflochtenen Konzepten gezogen3. Die praktische Umsetzung der semantischen Annotation findet maßgeblich in dem Annotationstool INCEpTION4statt5. Die Annotationskräfte bekommen von der Averbis Health Discovery6maschinell vorannotierte, reale Klinikdokumente mit Patientenbezug, die zuvor de-identifiziert wurden. Ein Recommender-System von ID Logik schlägt für jede annotierte Textspanne alternative SNOMED CT Konzepte vor. Die Annotationskräfte müssen entsprechend der Qualität der Vorannotationen diese korrigieren oder löschen und den Text nach nicht erkannten Spannen durchsuchen. Zur Findung des korrekten 1https://www.medizininformatik-initiative.de/de/gemtex-medizinische-texte-fuer-dieforschung-automatisiert-erschliessen 2https://www.bfarm.de/DE/Kodiersysteme/Terminologien/SNOMEDCT-CT/_node.html 3Wichtig: Es werden nicht die SNOMED CT inhärenten Relationen annotiert (s. Abschnitt 5). 4https://inception-project.github.io 5Nähere Informationen zu INCEpTION befinden sich im GeMTeX De-Identifizierungsguide: https: //zenodo.org/records/11502329 6https://averbis.com/health-discovery/ 2
SNOMED CT Konzepts, wird empfohlen, über den Webbrowser den SNOMED CT International SNOMED CT Browser7für den Zugriff auf die englischsprachige International Edition zu verwenden. 7https://browser.ihtsdotools.org/? 3
2 Grundbegriffe und Annotationsmaximen 2.1 Grundbegriffe Begriff Definition Adjazenz Direkte Nachbarschaft zweier Einheiten (z.B. zweier Tokens oder SNOMED CT Konzepte). Ambiguität Eine sprachliche Mehrdeutigkeit, die sich nicht oder nur durch Kontextoder Hintergrundwissen auflösen lässt. Anapher Ein zurückverweisendes sprachliches Element innerhalb eines Textes. Annotat Eine mit einer SNOMED CT Concept ID bzw. einem SNOMED CT Konzept versehene Textspanne. (Semantische) Domäne Technisch-formal: Die Menge aller zur Annotation zulässigen Konzepte. Pragmatisch: Grundsätzlich alle SNOMED CT Konzepte mit Ausnahme von Konzepten unter “SCTID: 243796009 | Situation with explicit context (situation)”. Fokussiert werden sollen jedoch die in diesem Richtlinie hervorgehobenen Konzeptgruppen. Faktualität Faktualität beschreibt den Wahrheitsgehalt von Aussagen. Oft sind Trigger-Wörter, wie z.B. “vermutlich”, für einen modifizierten Wahrheitswert einer Aussage verantwortlich. Koordination Syntaktisches Phänomen, wo zwei oder mehr sprachliche Einheiten durch eine Konjunktion oder Listenelemente getrennt sind, dabei aber dieselbe syntaktische Funktion erfüllen. Koordinierte Einheiten Sprachliche Einheiten, die dem syntaktischen Phänomen “Koordination” unterliegen. Koordinationsprädikat Eine Textspanne, die sich strukturell wie inhaltlich auf koordinierte Einheiten bezieht oder diese näher definiert. Negation Negation ist eine spezielle Art der Faktualität. Der Wahrheitswert von Aussagen wird invertiert: Wahre Aussagen werden falsch, falsche Aussagen werden wahr. Relation Inhaltliche Verknüpfung zwischen genau zwei Annotaten. Satz Eine Aneinanderreihung von Tokens, die einen abgeschlossenen Gedanken ausdrückt und zumindest aus einem Subjekt und einem Prädikat besteht. SCTID In diesem Richtlinie wird die Abkürzung SCTID verwendet, um auf die Kombination aus SNOMED CT Concept ID und SNOMED CT FSN zu referenzieren. SNOMED CT Concept ID Der numerische Identifikator eines SNOMED CT Konzepts. SNOMED CT Eine ontologie-basierte Terminologie, die eine systematische Beschreibung klinischer und medizinischer Prozeduren, Substanzen oder sonstiger Vorgänge, inklusive vieler Synonyme in verschiedenen Sprachen beinhaltet und miteinander in Beziheung setzt. SNOMED CT Fully Specified Name (FSN) Der SNOMED CT FSN ist eine eindeutige Beschreibung des zugrundeliegenden klinischen Konzepts bestehend aus einem Deskriptor und dem SNOMED CT Semantic Tag. SNOMED CT Konzept Eine in SNOMED CT vorhandene Einheit, die eine konkrete Semantik hat. Ein Konzept kann durch die Annotation einer Textspanne zugewiesen werden. Ein SNOMED CT Konzept setzt sich aus einer SNOMED CT Concept ID und einem SNOMED CT FSN zusammen. SNOMED CT Konzepte sind präkoordiniert, wenn sie sich aus mehreren Konzepten zusammensetzen. SNOMED CT Semantic Tag Alle SNOMED CT FSNs enden mit einem semantic tag in Klammern hinter dem Deskriptor. Sie geben an, zu welcher inhaltlichen Gruppe ein Konzept gehört. Textspanne Eine Sequenz von im Text aneinandergereihten Tokens, mindestens jedoch genau ein Token. Token Kleinste annotationsrelevante Einheit. Ein Token ist eine durch Leerzeichen oder sonstige Trennzeichen (z. B. “,”, “-”, “<”, “.”, etc.) limitierte aneinandergereihte Zeichenkette. Tabelle 1: Definitionen wichtiger Begriffe 4
Symbol Bedeutung Hinweis {x|P(x)}Menge Der Ausdruck beschreibt eine Menge, deren Elemente x alle die Eigenschaft P(x) besitzen. A⊆BA ist eine Teilmenge von B Jedes Element in A ist auch in B. A⊂BA ist eine strikte Teilmenge von B Jedes Element in A ist auch in B, aber A und B sind nicht dieselbe Menge. A∩BDie Schnittmenge zwischen A und B Die Menge der Elemente, die sowohl in A als auch in B sind. ∅Die leere Menge Die Menge ohne Elemente. A=BA ist ungleich B Die Mengen A und B sind nicht identisch. |A|Kardinalität der Menge A Die Anzahl von Elementen in A x∈Ax ist ein Element in A x ist ein Element, A ist eine Menge und x ist Teil von A x < y Ungleichheitszeichen (kleiner als) x ist kleiner als y. ∀Universalquantor ∀x∈A(P(x)) bedeutet: “Für alle Elemente x in der Menge A gilt die Eigenschaft P(x).” ∧Logisches UND P∧Qbedeutet, dass sowohl P als auch Q wahr sind. ∨Logisches ODER P∨Qbedeutet, dass mindestens eines der beiden wahr ist. ¬Logische NEGATION ¬Pbedeutet, dass P falsch ist. →Logisches KONDITIONAL P→Qbedeutet, wenn P wahr ist, ist auch Q wahr. ⇔Logisches BIKONDITIONAL P⇔Qbedeutet, dass P genau dann wahr ist, wenn Q auch wahr ist. 1 oder 0 Wahrheitswerte 1: Eine Aussage ist wahr; 0: Eine Aussage ist falsch. JPKDenotation/Interpretation JPKist die Bedeutung oder Interpretation von P. Tabelle 2: Definitionen formaler Symbole, die in diesem Richtlinie verwendet werden. 5
Annotationsbeispiele werden in diesem Richtlinie wie in (1) dargestellt: Eine annotierte Textspanne wird mindestens im Satzkontext eingebettet und durch eckige Klammern umrahmt sowie fett geschrieben. Hinter dieser Textspanne befindet sich ein Buchstabe, der auf das genaue SNOMED CT Konzept hinweist, mit dem die Textspanne annotiert wurde. Das SNOMED CT Konzept wird wiederum unter dem Satz dargestellt und besteht aus der SNOMED CT Concept ID und dem SNOMED CT Fully Specified Name (FSN). Das konkrete Beispiel (2) veranschaulicht, dass die Konzeptbezeichnung “SCTID: 386661006 | Fever (finding)” aus der SNOMED CT Concept ID “386661006” und dem SNOMED CT FSN “Fever (finding)” besteht. (1) Ich bin ein [Annotationsbeispiel](a.). a. SCTID: SNOMED CT Concept ID | Deskriptor (SNOMED CT Semantic Tag) (2) Der Betroffene hat [Fieber](a.). a. SCTID: 386661006 | Fever (finding) Relationen zwischen zwei Konzepten werden durch einen Pfeil zwischen den beiden Konzepten dargestellt und mit dem Label −→ rx,y versehen. Der erste tiefgestellte Buchstabe meint das Startund der zweite das Zielkonzept der Relation. Das ist beispielhaft dargestellt in (3). (3) Die [Körpergröße](a.) beträgt [155](b.) [cm](c.). a. SCTID: 1153637007 | Body height (observable entity) b. 155.0 c. SCTID: 258672001 | Centimeter (qualifier value) −→ ra,b −→ rb,c Hinweis In dieser Richtlinie werden teilweise formale Ausdrücke verwendet. Die logischen Formeln sind zum Lesen des Guides nicht notwendig, sondern dienen lediglich der Verständnisunterstützung. Eine Übersicht über die in dieser Richtlinie verwendeten formalen Symbole findet sich in Tab. 2. 6
2.2 Annotationsmaximen Um die Komplexität der semantischen Konzeptannotation mit SNOMED CT abzufedern, werden sechs Annotationsmaximen eingeführt, die beim Annotationsprozess stets umzusetzen sind. Folgende Annotationsmaximen werden eingeführt: 1. Concept before Structure! 2. Better Together! 3. Identify the Meaning! 4. Stack with Care! 5. In doubt? Be broad! 6. Three Minutes Max! Annotationsmaxime I. Concept before Structure! Die erste Maxime besagt, dass die zu annotierende Textspanne immer durch die verfügbaren SNOMED CT Konzepte bestimmt wird. So entsprechen beispielsweise die Textspannen “von der Leiter gefallen”, “Arthrose im rechten Knie”, “Diabetes mellitus Typ 1” oder “Ascaris lumbricoides” jeweils einem einzelnen SNOMED CT Konzept und nicht einer Kombination aus verschiedenen Codes (s. (4), (5), (6) und (7)). Zumeist wird ein Konzept also eine größere Anzahl von Tokens umspannen. (4) Bei Pt. ist [Arthrose am rechten Knie](a.) bekannt. a. SCTID: 323321000119100 | Osteoarthritis of right knee joint (disorder) (5) Fr. Schubert ist [von der Leiter gefallen](a.). a. SCTID: 86591008 | Fall from ladder (event) (6) [Diabetes mellitus Typ 1](a.) wird vermutet. a. SCTID: 46635009 | Diabetes mellitus type 1 (disorder) (7) Wir gehen von einem [Ascaris lumbriciodes](a.) aus. a. SCTID: 19061001 | Ascaris lumbricoides (organism) Annotationsmaxime II. Better Together! Die Konzeptannotation kann hin und wieder tückisch sein, da oft nicht klar ist, wo die inhaltlichen und textuellen Grenzen liegen. Die zweite Maxime Better Together! gibt hierfür klare Regeln an die Hand: Adjazent und Sinnhaft: Jede annotierte Textspanne sollte eine möglichst spezifische Bedeutung haben sowie eine sinnhafte, abgeschlossene textuelle Einheit darstellen. In diesem Zusammenhang spielt Adjazenz oder textuelle Nachbarschaft, also die relative Position mehrerer Tokens im Text, eine erhebliche Rolle. Nebeneinanderstehende sprachliche Einheiten (Adjazenz), deren Bedeutung mit einem SNOMED CT Konzept darstellbar ist (Sinnhaftigkeit), sollten wenn möglich gemeinsam annotiert werden. Sind zwei sprachliche Einheiten nicht zusammenhängend, sondern durch dritte Konzepte oder Satzgrenzen getrennt, so sollen sie nicht gemeinsam, sondern einzeln annotiert werden. 7
Idealerweise sollte der Satz Patientin kommt mit verletzter linker Hand also wie in (8) annotiert werden. (8) Patientin kommt mit [verletzter linker Hand](a.). a. SCTID: 11791321000119108 | Injury of left hand (disorder) Pragmatik: Sinnhaftigkeit vor Adjazenz: Alle Texte, die im Rahmen von GeMTeX annotiert werden, unterziehen sich einer maschinellen Vorannotation, d.h., dass die Texte schon SNOMED CT Annotate enthalten. Sollte die Vorannotation inhaltlich korrekte, aber kurzspanniger Konzeptannotationen liefern, so sollen diese angenommen werden. Dies gilt auch, wenn eigentlich eine längerspannige Annotation möglich gewesen wäre (z.B. aufgrund von Adjazenz). Demnach wären die Beispiele (9)-(11) äquivalent zur Musterlösung (8). (9) Patientin kommt mit [verletzter](a.) [linker Hand](b.). a. SCTID: 417163006 | Traumatic or non-traumatic injury (disorder) b. SCTID: 85151006 | Structure of left hand (body structure) (10) Patientin kommt mit [verletzter](a.) [linker](b.) [Hand](c.). a. SCTID: 417163006 | Traumatic or non-traumatic injury (disorder) b. SCTID: 7771000 | Left (qualifier value) c. SCTID: 85562004 | Hand structure (body structure) (11) Patientin kommt mit [verletzer [linker](b.) Hand](a.). a. SCTID: 125599006 | Injury of hand (disorder) b. SCTID: 7771000 | Left (qualifier value) Zusammengefasst sagt Maxime II aus, dass Spannen möglichst zusammenhängend annotiert werden sollen, wenn sie adjazent und sinnhaft sind. Sollte dies nicht möglich sein, so darf auf kurzspannige Konzepte zurückgegriffen werden. Gleiches gilt, wenn die Vorannotation äquivalente, aber kurzspannigere Annotationen vorschlägt: Diese sind dann zu akzeptieren. Annotationsmaxime III. Identify the Meaning! Textspannen sollen ausschließlich anhand ihrer tatsächlichen Bedeutung annotiert werden. Der Kontext muss bei jeder Annotation berücksichtigt werden. Anaphern sind ebenfalls mit ihrer intendierten Bedeutung zu annotieren (s. Beispiel (12)). (12) Die Rhythmusstörungen wurden mit [Amiodaron](a.) behandelt. Der Pat. hat [das Medikament](a.) wegen NW eigenmächtig abgesetzt. a. SCTID: 774551007 | Product containing only amiodarone (medicinal product) Ambiguitäten / Mehrdeutigkeiten sind möglichst nach dem Kontext oder medizinischem Wissen aufzulösen. Falls das nicht möglich ist, sollen alle plausiblen Konzepte zu dieser Textspanne vergeben werden, (sog. gestapelte Annotationen oder Stacked Annotations 8
und dabei detaillierter ist als c(s. (30)). Inhaltliche Kompatibiltät zwischen einer Textspanne und einem Konzept liegt dann vor, wenn TS eine Instanz von cist, äquivalent zu cist oder eine Subklasse von cdarstellt (s. (31)). In allen anderen Fällen, ist die Annotation unzutreffend oder inkorrekt und somit nicht zu wählen. (28) a. {Fever,Clinical Finding, Early bancroftian filariasis} ⊂ CP b. {Aseptic Fever, Bancroftian filarial fever} ⊂ CT c. {Fever,Fever due to infection,Aseptic Fever,Bancroftian filarial fever} ⊂Clinical Finding d. Bancroftian filarial fever ∈ {Fever, Early bancroftian filariasis} (29) J[TS](C∗)K= 1 : C∗=∅ 0 : sonst (30) C∗={c∈De∧kompatibel(TS, c)∧ ∀c′∈C(kompatibel(T S, c′)→detail(c′)≤ detail(c))} (31) Jkompatibel(TS, c)K= 1 : Instanz(TS, c)∨Äquivalenz(TS, c)∨Subklasse(T S, c) 0 : sonst a. JInstanz(TS, c)K=T S ∈ {x|x=spezifisches, individuelles Vorkommen von c} b. JÄquivalenz(T S, c)K=TS ∈ {x|xist bedeutungsgleich zu c} c. JSubklasse(TS, c)K=T S ∈ {x|x⊂c} Hinweis Die Bedingung in (31-c) erlaubt es, einer Textspanne ein Elternkonzept des (vermutlich) eigentlich korrekten Konzepts zuzuweisen. Somit gilt eine solche Annotation als korrekt, obwohl sie etwas unscharf ist. Es empfiehlt sich, solche Spannen mit der lokalen Annotationsleitung zu diskutieren. Wäre die Textspanne “Fieber” in Beispiel (32) mit dem Konzept “SCTID: 9619006 | Aseptic fever” annotiert, so wäre die Annotation unzutreffend. Dieses Konzept ist zwar Teil der semantischen Domäne und auch detaillierter als das Konzept “SCTID: 386661006 | Fever (finding)”. Es ist jedoch nicht mit der Textspanne kompatibel, da keine Informationen darüber existieren, ob der Betroffene aseptisches Fieber hat oder nicht. Formal trifft auch keine der in (31) eingeführten Kompatibilitätsbedingungen zu: Die Textspanne “Fieber” ist keine Instanz von “SCTID: 9619006 | Aseptic fever”, da “Fieber” kein spezifisches oder individuelles Vorkommen des Konzepts ist, sondern eine sehr generelle Beschreibung eines medizinischen Zustands. Textspanne und Konzept sind nicht äquivalent, da sie nicht bedeutungsgleich sind. Zuletzt lässt sich noch feststellen, dass “Fieber” auch keine Subklasse bzw. Teilmenge des Konzepts “SCTID: 9619006 | Aseptic fever” darstellt, tatsächlich ist das Gegenteil wahr.8Das Beispiel verdeutlicht auch, dass spezi8Das Beispiel illustriert auch, dass es andersherum weniger problematisch wäre. Würde man für die Textspanne “aseptisches Fieber” das SNOMED CT Konzept “SCTID: 386661006 | Fever (finding)” vergeben, wäre es zwar nicht spezifisch genug. Es würde der Kompatibilitätsbedingung in (31) aufgrund der Definition (31-c) jedoch genügen. Denn: Die Texspanne “aseptisches Fieber” ist eine Subklasse des Konzepts “SCTID: 386661006 | Fever (finding)”. 15
fischere Konzepte nur dann zu wählen sind, wenn sie auch durch den Text ausgedrückt werden (vgl. Maxime III). (32) Der Betroffene hat [Fieber](a.). a. SCTID: 386661006 | Fever (finding) Da die Anzahl an spezifischen Elternoder Terminalkonzepten in SNOMED CT immens ist, wird im restlichen Kapitel eine Auswahl an allgemeinen Elternkonzepten bzw. Semantic Tags erläutert und spezifischere Elternkonzepte und Terminalkonzepte werden beispielhaft aufgeführt. Während die in den Richtlinie n aufgeführten Konzepte nicht exhaustiv sind, so gelten die Konzeptgruppen, die eingeführt werden, als Richtschnur für die Annotation. Formal denotieren sie und ihre Tochterkonzepte die semantische Domäne Deder GeMTeX-Annotation (vgl. (25)). 16
3.2 SNOMED CT Semantic Tags Ein elementarer Baustein, um herauszufinden, ob ein SNOME D Konzept zur markierten Spanne passt (also kompatibel ist), sind die SNOMED CT Semantic Tags. Sie sind immer in Klammern im SNOMED CT FSN zu finden und geben an, zu welcher Konzeptgruppe ein bestimmtes SNOMED CT Konzept gehört. Grundsätzlich kann man hier meist seiner Intuition folgen: Wird beispielsweise im Text über eine vorhandene Krankheit oder eine Diagnose gesprochen, sollte das Konzept in der Regel den Semantic Tag “(finding)” oder “(disorder)” vorweisen. Die Tags “(body structure)” oder “(qualifier)” wären hier eher unangebracht. Abbildung 2: Das Konzept “SCTID: 125666000 | Burn (disorder)” im SNOMED CT International SNOMED CT Browser. Beispiel (33) illustriert, dass Semantic Tags elementar sind, um das korrekte Konzept zu finden: Es gibt in SNOMED CT zwei sehr ähnlich klingende Konzepte zur Verbrennung: “SCTID: 125666000 | Burn (disorder)” und “SCTID: 48333001 | Burn injury (morphologic abnormality)”. Der Semantic Tag “(disorder)” zeigt, dass das Konzept (a.) zur Gruppe der Disorders (auf deutsch kommt die Umschreibung abnormale klinische Zustände /Erkrankungen /Störungen sehr nah) gehört. Wie im folgenden Kapitel 3.3 näher beschrieben, gehört diese Gruppe von Konzepten zu den Core Konzepten, die insbesondere dann verwendet werden sollen, wenn Krankheitsbilder oder Diagnosen beschrieben werden. Zweiteres Konzept gehört zu der Gruppe “(morphologic abnormality)”, was in der Regel für die Beschreibung von z.B. Gewebeveränderungen als Folge einer Verbrennung verwendet werden kann (z.B. in Radiologieoder Pathologieberichten). Je nach Briefkontext kann der Semantic Tag also dabei helfen, das korrekte Konzept zu identifizieren. (33) Der Patient leidet unter einer [[Verbrennung](a.)](b.). a. SCTID: 125666000 | Burn (disorder) b. SCTID: 48333001 | Burn injury (morphologic abnormality) Hinweis Natürlich reichen die SNOMED CT Semantic Tags nicht aus, um zu bestimmen, ob ein Konzept das richtige ist oder nicht. Weitere Hilfe bietet der SNOMED CT International SNOMED CT Browser: Schaut man sich den Eintrag des Konzepts “SCTID: 125666000 | Burn (disorder)” an, so wird das Konzept “SCTID: 48333001 | Burn injury (morphologic abnormality)” als Axiom für die assoziierte Morphologie angezeigt (s. Abb. 2). Daraus lässt sich schließen, dass letzteres Konzept wirklich nur in den Fällen verwendet werden sollte, wenn tatsächlich von der morphologischen Veränderung die Rede ist. 17
3.3 Konzepte in SNOMED CT In diesem Abschnitt werden die für die semantische Annotation in GeMTeX drei relevanten Konzepttypen eingeführt: Core-Konzepte (Kap. 3.3.1), Modifier-Konzepte (Kap. 3.3.2) und Qualifier-Konzepte (Kap. 3.3.3). Core-Konzepte gelten als die relevanteste Konzeptgruppe und ihre Entitäten sollten möglichst vollständig annotiert werden. Modifier-Konzepte sind etwas weniger relevant, kodieren aber dennoch wichtige medizinische Informationen. Qualifier-Konzepte tragen am wenigsten Relevanz, eignen sich oft jedoch sehr gut, um Coreoder Modifier-Konzepte zu spezifizieren. Alle Annotationsbeispiele in dieser Rubrik sind nicht vollständig, sondern fokussieren jeweils das Konzept, das illustriert werden soll. Vollständig annotierte Satzbeispiele lassen sich in Kap. 6 finden. 3.3.1 Core-Konzepte Core-Konzepte umfassen die größten und klinisch relevantesten Konzepte und gliedern sich in folgende vier Kategorien: Condition,Procedure,Medikationen & Substanzen sowie Observables. Core-Konzepte sind in der Regel voll definiert, beinhalten somit bereits viele hinreichende und notwendige Bedingungen und sind daher der Grundbaustein für die semantische Annotation. 3.3.1.1 Condition SNOMED CT Definition |Condition | steht für gesundheitsrelevante Phänomene, Ereignisse, Prozesse oder Zustände im weitesten Sinn. In SNOMED CT sind das die Inhalte der Hierarchien unter “SCTID: 404684003 | Clinical finding (finding)”, “SCTID: 64572001 | Disease (disorder)” und “SCTID: 272379006 | Event (event)”. Ausgeschlossen sind allerdings die, die durch Personen des Gesundheitswesens willentlich ausgelöst werden (s. Procedures). |Clinical finding| repräsentiert das Ergebnis einer klinischen Beobachtung, Einschätzung oder Beurteilung. Es enthält normale und abnormale klinische Zustände (z.B. |asthma|, |headache|, |normal breath sounds|). Die Hierarchie unter |clinical finding| enthält Konzepte, die für Diagnosen zu verwenden sind. |Disorders| sind permanente oder vorübergehende abnormale klinische Zustände mit zugrundeliegendem pathologischem Prozess, die ggf. unter Behandlung stehen. |Events| sind Vorkommnisse, die die Gesundheit oder die Versorgung beeinflussen, allerdings - wie eingangs schon erwähnt - keine Prozeduren oder Interventionen. Verwendbare Semantic Tags: (finding), (disorder), (event) Condition umfasst Clinical Findings,Disorders und Events. Damit beinhaltet Condition alles, was einen Patienten in seinem Organismus oder seinem Lebensumfeld charakterisiert. Dazu gehören Krankheiten, Symptome, Befunde oder Phänotypen. Zu Condition gehört umgangssprachlich also alles, was jemand hat oder mit jemanden geschieht mit der Ausnahme von Procedures (s. 3.3.1.2). Je ein Beispiel für ein Clinical Finding, Disorder und Event finden sich in den Beispielen (34), (35) und (36). 18
(34) Sympomatik: [Anarthrie](a.). a. SCTID: 48257004 | Anarthria (finding) (35) Pat. leidet unter [spastischer Paraplegie Typ 2] (a.). a. SCTID: 723622007 | X-linked spastic paraplegia type 2 (disorder) (36) Betroffene wurde [von Hund gebissen](a.). a. SCTID: 217697000 | Dog bite (event) 3.3.1.2 Procedure SNOMED CT Definition |Procedure| repräsentiert Maßnahmen oder Prozeduren der Krankenversorgung. Hierunter fallen nicht nur invasive Prozeduren, sondern auch die Verabreichung von Arzneimitteln, bildgebende Verfahren, Schulungen, Therapien und administrative Prozeduren (z.B. |appendectomy|, |physiotherapy|, | subcutaneous injection|). In SNOMED CT finden sich Prozeduren unter “SCTID: 71388002 | Procedure (procedure)” Verwendbare Semantic Tags: (procedure), (regime/therapy) Procedures sind alle Untersuchungen und Maßnahmen, die einem Patienten widerfahren (s. (37)). (37) Nach erfolgreicher [Blutabnahme](a.) wurde die [Implantation](b.) durchgeführt. a. SCTID: 82078001 | Collection of blood specimen for laboratory (procedure) b. SCTID: 782902008 | Implantation procedure (procedure) 3.3.1.3 Pharmaceutical/Biological Product & Substance SNOMED CT Definition |Pharmaceutical/biological product| repräsentiert pharmazeutische Produkte (z.B. |amoxicillin 250mg capsule|, |paracetamol + codeine tablet|) |Substance| repräsentiert allgemeine Substanzen, die chemischen Bestandteile von pharmazeutischen und biologischen Produkten, Körpersubstanzen, Nahrungsbestandteile und Diagnostika (z.B. |methane|, |insulin|, |albumin|) Verwendbare Semantic Tags: (product), (medicinal product), (clinical drug), (medicinal product form), (substance) Medikationen und anderweitige Substanzen werden als Pharmaceutical/Biological Product oder Substance annotiert. Ein Element der Kategorie Pharmaceutical/Biological Product kann informell definiert werden als alles, was einen Beipackzettel hat. Pharmazeutische Produkte sollen grundsätzlich anhand ihrer Wirkstoffe mit dem SNOMED CT Semantic Tag “(medicinal product)” annotiert werden. Diese Konzepte finden sich unter “SCTID: 763158003 | Medicinal product (product)” und sind stets nach dem Schema 19
“Product containing X, Y, ...” aufgebaut. In manchen Fällen ist die Entscheidung hier sehr einfach, s. Bsp. (38). (38) Die Pt.in nahm selbstständig [Aspirin](a.) ein. a. SCTID: 774656009 | Product containing only aspirin (medicinal product) In anderen Situationen kann die Annotation schwieriger sein. Die Produktnamen Voltaren oder Vokanamet sind nicht in SNOMED CT enthalten. Auch solche Spannen sollen mit einem Konzept annotiert werden, das den Semantic Tag “(medicinal product)” trägt. Da Voltaren aus dem Wirkstoff Diclofenac besteht und Vokanamet aus Canagliflozin und Metformin, sind die Spannen mit den in (39) und (40) dargestellten Konzepten hinreichend genau annotiert. (39) Der Patientin wird [Voltaren](a.) verschrieben. a. SCTID: 3775563008 | Product containing only diclofenac (medicinal product) (40) Wir verschreiben [Vokanamet](a.). a. SCTID: 775026006 | Product containing only canagliflozin and metformin (medicinal product) Hinweis Sollte ein Produkt aus mehreren Wirkstoffen bestehen und es gibt kein passendes präkoordiniertes Konzept in SNOMED CT, so werden die beiden Wirkstoffe gestackt. Dabei ist darauf zu achten, dass die gestackten Konzepte nicht das Wort only im Deskriptor tragen. Die Annotation von Textspannen mit einem Konzept mit dem Semantic Tag “(substance)” soll lediglich dann erfolgen, wenn eine Textspanne im Briefkontext nicht als Produkt, sondern explizit als Substanz verstanden werden soll (vgl. (41)). (41) Die Analyse zeigte, dass [Methylprednisolon](a.) im Blut der Pt. war. a. SCTID: 116593003 | Methylprednisolone (substance) Angaben zu Mengen, Dosierungsoder Vergabeformen sollen nicht durch die Annotatoren, sondern lediglich durch die maschinelle Vorannotation annotiert werden. Diese Briefbereiche sollen mit dem No_Human-Layer in INCEpTION markiert werden (s. Abschnitt 4). 20
3.3.1.4 Observables SNOMED CT Definition |Observable entity| repräsentiert eine Frage oder Untersuchung, die zu einer Antwort oder einem Ergebnis führen kann, (z.B. | systolic blood pressure|, |color of iris|, |gender|) |Staging and scales| repräsentiert Bewertungsschemata und Tumorstadiensysteme (z.B. |Glasgow ComaScale|, |FIGO staging system of gynecological malignancy|) Verwendbare Semantic Tags: (observable entity), (staging scale), (assessment scale), (tumor staging), (finding) Unter Observables fallen alle Untersuchungen oder erfragbaren und beobachtbaren Parameter, die in einem definierten Ergebnis oder Messwerten resultieren und oft auch eine Einheit besitzen. Staging and Scales beschreibt und umfasst die Bewertungen von Krankheitsstadien und Schwerebzw. Risikograden und so auch verschiedene Testskalen (assessment scales). Textspannen, die Scores enthalten, sollen grundsätzlich als observable entities und nicht als assessment scale annotiert werden, da viele Skalen auf mehr als einen Testscore mappen. Ein Beispiel ist der Aachen Aphasie Test: Das Konzept “SCTID: 273251005 | Aachen aphasia test (assessment scale)” ist eine Skala, die den Skalenparameter “SCTID: 714474007 | Aachen Aphasia Test score (observable entity)” enthält. Nur letzterer wird für die Annotation verwendet, da dieser präziser ist (vgl. auch (42)). (42) Das [Geschlecht](a.), die [Sauerstoffkonzentration](b.) und die Ergebnisse des [Glasgow Coma Score](c.) des Patienten werden nachstehend aufgelistet. a. SCTID: 263495000 | Gender (observable entity) b. SCTID: 250772006 | Oxygen concentration (observable entity) c. SCTID: 248241002 | Glasgow coma score (observable entity) Es ist auch zu beachten, dass es zu vielen Observable-Konzepten gleichnamige FindingKonzepte gibt, z.B. zu “SCTID: 75367002 | Blood pressure (observable entity)” das Konzept “SCTID: 392570002 | Blood pressure finding (finding)”. Finding-Konzepten ist nur dann Vorrang vor Observable Entity Konzepten zu geben, wenn sie den im Text beschriebenen Sachverhalt genauer abbilden. Das kann zum Beispiel der Fall sein, wenn das Finding-Konzept eine Kombination aus Observable Entity Konzept und Qualifier Konzept ist (z.B. “SCTID: 81010002 | Decreased systolic arterial pressure (finding)”). Eine Faustregel ist: Steht die Messung eines bestimmten Wertes im Vordergrund, so wählt man das Observable; Ist das Messergebnis interpretiert, so wählt man das Finding. Allgemein gilt: Für alle Annotationen mit einem Observable-Konzept gibt es im Text in der Regel einen qualitativen oder quantitativen Wert, in letzterem Fall meist auch eine Einheit (vgl. (43)). Für viele Beobachtungen gibt es keine Observable-Konzepte, insbesondere bei Laboruntersuchungen. Hier schreibt SNOMED CT vor, ersatzweise passende Procedure-Konzepte (unter “SCTID: 386053000 | Evaluation procedure (procedure)”) zu verwenden. Beispielsweise: Bei der Textspanne “Leukozyten 8000 / µl” (als Teil des Blutbildes) wird “Leukozyten” mit “SCTID: 767002 | White blood cell count (procedu21
re)” annotiert. Bei der Spanne “Glucose im Urin 15 mg/dl” wird “Glucose im Urin” mit “SCTID: 30994003 | Glucose measurement, urine (procedure)” annotiert. (43) Der [Blutzuckerwert](a.) des Patienten betrug [135](b.) [mg/dl](c.) bei der morgendlichen Messung a. SCTID: 434912009 | Blood glucose concentration (observable entity) b. 135.0 c. SCTID: 258797006 | Milligram/deciliter (qualifier value) 22
3.3.2 Modifier-Konzepte Modifikatoren beschreiben Kernkonzepte näher und beantworten damit z.B. welche anatomische Struktur involviert ist, welche Geräte dabei zum Einsatz kommen oder welche Organismen an einer Erkrankung beteiligt sind, aber auch Substanzen und externe Faktoren wie elektrische Spannung oder Strahlung. Für die Annotation sind folgende ModifierKonzepte definiert: Body Structures,Physical Objects und Organisms. 3.3.2.1 Body Structure SNOMED CT Definition |Body structure| repräsentiert normale und abnorme anatomischen Strukturen (z.B. |mitral valve structure|, |adenosarcoma|) Verwendbare Semantic Tags: (body structure), (morphologic abnormality) Body Structures sind alle Teile des Körpers, von großen Strukturen wie dem Kopf oder Organen wie dem Gehirn, bis hin zu Gewebe. Wie in den Grundregeln zur Annotation beschrieben, soll die Annotation genau so spezifisch sein, wie es der Text zulässt (s. (44)). Körperteile sollen stets als Body Structure, bei pathologischen Befunden ggf. als Specimen annotiert werden. Die meisten anatomischen Stukturen finden sich in SNOMED CT doppelt, z.B. “SCTID: 56459004 | Foot structure (body structure)” und “SCTID: 302545001 | Entire foot (body structure)”. Ersteres bezieht sich auf die benannten Strukturen, aber auch beliebige Teile davon. Generell ist bei Lokalisationsangaben der ersteren Sorte von Konzepten (mit “structure” im Deskriptor) der Vorzug zu geben. Die Konzepte, die “entire” beinhalten, sind nur dann zu verwenden, wenn auch tatsächlich eine gesamte Körperstruktur erfasst wird. Das kann z.B. bei Amputationen wichtig sein. So meint eine Amputation am Fuß wohl eine Amputation eines beliebigen Teils der gesamten Fußstruktur (also: “SCTID: 56459004 | Foot structure (body structure)”). Die Amputation des Fußes beschreibt jedoch die Amputation des gesamten Fußes (also: “SCTID: 302545001 | Entire foot (body structure)”). In den meisten Fällen erübrigt sich aber die Annotation anatomischer Strukturen, weil diese in Core-Konzepten enthalten sind (z.B.: “SCTID: 723312009 | Amputation of right foot (procedure)”) . (44) Wir untersuchten [Kopf](a.) und [Haut](b.). a. SCTID: 69536005 | Head structure (body structure) b. SCTID: 39937001 | Skin structure (body structure) 3.3.2.2 Physical Object SNOMED CT Definition |Physical object| repräsentiert natürliche und durch den Menschen hergestellte materielle Gegenstände(z.B. |vena cava filter|, |implant device|, |automobile|) Verwendbare Semantic Tags: (physical object) Geräte und andere Gegenstände, die transplantiert, eingesetzt oder anderweitig in Diagnostik und Therapie verwendet werden können, fallen unter das Elternkonzept Physical Object (s. (45-a)). In gewissen Fällen muss auf die Formulierung geachtet werden: 23
In (45-c) ist der Herzschrittmacher tatsächlich in der Patientin und sollte deswegen als Finding ausgelegt werden. In (46) handelt es sich nur um eine Empfehlung zu dem Gerät und es sollte daher als Physical Object annotiert werden. Bei der Spirale verhält es sich parallel: Die Spirale in Beispiel (45) ist in der Patientin vorhanden und müsste daher als Finding ausgelegt werden. Es gibt allerdings kein solches Konzept in SNOMED CT. Daher sollte auf die SNOMED CT Axiome von verwandten Termen zurückgegriffen werden. Abb. 3 zeigt, dass das Konzept (45-c) u.a. das Axiom “hat Interpretation →Present” aufweist. Klickt man auf dieses Axiom, gelangt man zum Qualifierkonzept “SCTID: 52101004 | Present (qualifier value)”. Dieses Konzept sollte also über die Textspanne als präzisierende Annotation gestackt werden (s. Annotationsmaxime IV; mehr zu Qualifierkonzepten findet sich in Abschnitt 3.3.3).9 (45) Die Patientin besitzt [[Spirale](a.)](b.) und [Herzschrittmacher](c.). a. SCTID: 312082008 | Contraceptive coil (physical object) b. SCTID: 52101004 | Present (qualifier value) c. SCTID: 441509002 | Cardiac pacemaker in situ (finding) (46) Dem Patienten wird zu einem [Herzschrittmacher](a.) geraten. a. SCTID: 424921004 | Permanent cardiac pacemaker, device (physical object) Abbildung 3: Screenshot zu SNOMED CT Axiomen. 3.3.2.3 Organismen SNOMED CT Definition |Organism| repräsentiert Organismen, die in der Humanoder Veterinärmedizin von Bedeutung sind. (z.B. |streptococcus pyogenes|, |beagle|, |texon cattle breed|) Verwendbare Semantic Tags: (organism) Organisms beschreiben alle Arten von Organismen wie Bakterien, Viren, Pilze und Parasiten (s. (47)). Darüber hinaus können, wie in (48), auch größere Organismen vorkommen. Es gilt: Sollten spezifischere Informationen im Text vorhanden sein, wie z.B. 9Es wird deutlich, dass Physical Objects, die tatsächlich im Körper vohanden sind, grds. auch mit dem hier genannten Konzept “SCTID: 52101004 | Present (qualifier value)” zusätzlich annotiert werden sollten, sofern es kein präkoordiniertes Konzept gibt. 24
Faktualität: Differentialdiagnosen: Eine Differentialdiagnose nennt die Erkrankungen mit nahezu identischer Symptomatik zur Verdachtsdiagnose. Die Differentialdiagnosen selbst sind mit ihren jeweiligen SNOMED CT Konzepten zu annotieren. Ein Trigger-Wort, das auf die Existenz einer Differentialdiagnose hinweist (z.B. “DD” in (64)) ist mit “SCTID: 47965005 | Differential diagnosis (contextual qualifier) (qualifier value)” zu annotieren. (64) Der Patient hat [Rheuma(a.)], [DD](b.):[Psoriasisarthritis](c.. a. SCTID: 396332003 | Rheumatism (disorder b. SCTID: 47965005 | Differential diagnosis (contextual qualifier) (qualifier value) c. SCTID: 156370009 | Psoriatic arthritis (disorder) Faktualität: Assertionssicherheit: Grundsätzlich wird bei der Annotation angenommen, dass Konzepte weder negiert noch anderweitig in ihrer Faktualität modifiziert sind, sofern der Text keine expliziten Gegenschlüsse zulässt. Tab. 4 illustriert die zu annotierenden SNOMED CT Konzepte für Faktualitätstrigger zur Assertionssicherheit (=(Un)Sicherheit von Aussagen) im Text. Die Tabelle ist wie eine Skala geordnet: Die Extrema sind mit höchster Sicherheit belegt, einmal im positiven (z.B. eine Erkrankung ist bestätigt) und einmal im negativen Sinne (z.B. eine Erkrankung ist ausgeschlossen). Dazwischen findet sich eine positive (z.B. “wahrscheinlich”) und eine negative Stufe (z.B. “unwahrscheinlich”) von Unsicherheit. Im Default-Fall, also der Annahme, dass etwas vorliegt, soll kein Triggerwort annotiert werden. Beispiel (65) zeigt, wie Faktualitäten noch ausgedrückt werden können. (65) [Laut Patient](a.) bestand [Divertikulitis](b.). a. SCTID: 410592001 | Probably present (qualifier value) b. SCTID: 307496006 | Diverticulitis (disorder) Sollte ein Negationspartikel direkter Nachbar eines Faktualitätsmarkers sein, so kann ein gemeinsames Konzept verwendet werden, s. (66). Komposita, die gerne im Deutschen vorkommen, erzwingen oft eine gestackte Annotation, s. (67). (66) Ein Tonsillenstein ist [nicht wahrscheinlich](a.). a. SCTID: 410593006 | Probably not present (qualifier value) (67) Es besteht [[Leukämieverdacht](a.)](b.). a. SCTID: 93143009 | Leukemia, disease (disorder) b. SCTID: 410592001 | Probably present (qualifier value) Empfehlungen und Indikationen: Eine weitere Faktualität ist die Empfehlung. Sollte eine Prozedur im Text empfohlen worden sein, so kann sie entweder als recommended oder als indicated annotiert werden. Während ersteres sich auf Guideline-Empfehlungen bezieht, meint das letztere medizinisch notwendige Empfehlungen (s. Tab. 5). Es gilt: Grundsätzlich sind Entscheidungen und Behandlungen als medizinisch notwendig einzustufen. Lediglich bei expliziten Nennungen von Guidelines o.ä. sollte auf das Konzept 31
Sicherheit einer Assertion Faktualitätstrigger SNOMED CT Textbeispiel Sehr Sicher (+) Status post (St.p.), Zustand nach (Z.n.), bestätigt, eindeutig, zweifellos, sicher, bekannt, ... SCTID: 410605003 | Confirmed present (qualifier value) Tonsillenstein konnte [bestätigt](.) werden. Sicher (+) DEFAULT vorliegen, bestehen, ... ∅Tonsillenstein liegt vor. Weniger Sicher (+) Verdacht auf (V.a.), wahrscheinlich, sicherlich, mit hoher Wahrscheinlichkeit, tendenziell, vermutlich, möglicherweise, eventuell, gegebenenfalls, Konjunktiv, ... SCTID: 410592001 | Probably present (qualifier value) Tonsillenstein liegt [wahrscheinlich](.) vor. Weniger Sicher (-) unwahrscheinlich, unerwartbar, Konjunktiv, ... SCTID: 410593006 | Probably not present (qualifier value) Ein Tonsillenstein ist [unwahrscheinlich](.). (Sehr) Sicher (-) Ausschluss von, ausgeschlossen, widerlegt, Kein Anhalt von, Kein Nachweis von, ... SCTID: 410516002 | Known absent (qualifier value) Die Tonsillensteindiagnose wurde [widerlegt](.). Tabelle 4: GeMTeX Faktualitätsskala (Sicherheit) nach SNOMED CT “SCTID: 897015005 | Recommended (qualifier value)” zurückgegriffen werden. Vergangenheit von klinischen Zuständen ode Prozeduren: Krankheiten oder Prozeduren können in klinischen Dokumenten als vergangen oder vorüber gekennzeichnet sein oder sie liegen einfach schon etwas in der Vergangenheit. Ein klassisches Triggerwort ist hierfür “Zustand nach”. In einem solchen Fall wird das Triggerwort mit “SCTID: 410513005 | In the past (qualifier value)” annotiert (s. (68)). (68) [[Z.n.](a.)](b.) [Vasektomie](c.):[Unauffällig](d.). a. SCTID: 410605003 | Confirmed present (qualifier value) b. SCTID: 410513005 | In the past (qualifier value) c. SCTID: 22523008 | Vasectomy (procedure) d. SCTID: 17621005 | Normal (qualifier value) 32
Konzept Bedeutung/ Verwendung Textbeispiel SCTID: 410535002 | Indicated (qualifier value) DEFAULT: Eine Behandlung ist medizinisch geboten Die Behandlung wird [aufgrund der klin. Verf. empfohlen](.). SCTID: 897015005 | Recommended (qualifier value) Eine Behandlung ist von Best Practices oder Guidelines empfohlen, aber nicht obligatorisch (Nur verwenden, wenn explizit Guidelines oder Best-Practices o.ä. genannt werden.) Eine Grippe-Impfung wird [von StIKo empfohlen](.). Tabelle 5: Faktualitätsmarker zur Empfehlung & Planung. Hinweis Kindkonzepte von “SCTID: 243796009 | Situation with explicit context (situation)” sind von der GeMTeX Annotation ausgeschlossen und sollen nicht benutzt werden. 3.3.3.6 Weitere Qualifier-Konzepte Es gibt in SNOMED CT noch zahlreiche weitere Qualifiers, die bei der Annotation Anwendung finden können. Ein Beispiel für eine solche Kategorie ist “SCTID: 272099008 | Descriptor (qualifier value)”, die sich in zahlreiche Tochterkonzepte aufgliedert. So findet sich unter dieser Kategorie z.B. das Konzept “SCTID: 14803004 | Transitory (qualifier value)”, das ein zeitlich begrenztes Auftreten eines Findings beschreibt, wie in (69); Oder das Konzept “SCTID: 281302008 | Above reference range (qualifier value)”, das i.d.R. einen Messwert beschreibt, der explizit über einem Referenzwert liegt (s. (70)). Generell soll den Qualifier-Konzepten der Vorzug gegeben werden, die selbst innerhalb von SNOMED CT Konzeptdefinitionen vorkommen. Veranschaulichen lässt sich das mittels des Tabs “References” im SNOMED CT International SNOMED CT Browser. (69) Es war ein [passagerer](a.) Diabetes Mellitus. a. SCTID: 14803004 | Transitory (qualifier value) (70) Messung [erhöht](a.). a. SCTID: 281302008 | Above reference range (qualifier value) 33
3.4 Familiäre Erkrankungen Es kann vorkommen, dass in einem klinischen Dokument familiäre (Vor-)Erkrankungen aufgezählt werden. Um diese klar von den Erkrankungen des Patienten zu trennen, müssen sie in den Texten gesondert markiert werden. In GeMTeX sollen grundsätzlich keine Personen annotiert werden. Bei der Familienanamnese machen wir hierbei eine Ausnahme und annotieren Familienmitglieder, sofern sie im Zusammenhang mit einer Erkrankung oder Behandlung genannt werden. Dafür sollen SNOMED CT Konzepte unter “SCTID: 303071001 | Person in the family (person)” verwendet werden (s. (71)). Sollte keine Person genannt, aber dennoch klar sein, dass es sich um familiäre Erkrankungen handelt, so ist das eben genante generische Konzept “SCTID: 303071001 | Person in the family (person)” zu verwenden (s. (72)). In Kapitel 5 wird verdeutlicht, dass Erkrankung und ihre Zugehörigkeit zur Familie durch eine Relation miteinander verbunden werden sollen. (71) Der [Vater](a.) des Betroffenen litt unter einem [Katarakt li.](b.). a. SCTID: 9947008 | Natural father (person) b. SCTID: 816119002 | Cataract of left eye (disorder) (72) [In der Familie](a.) der Betroffenen gab es einen Fall von [Knochenmarkskrebs.](b.). a. SCTID: 303071001 | Person in the family (person) b. SCTID: 445738007 | Myelodysplastic/myeloproliferative disease (disorder) Hinweis Auch bei Familienanamnese gilt, dass Kindkonzepte von “SCTID: 243796009 | Situation with explicit context (situation)” nicht für die Annotation zu verwenden sind. 34
4 Das No-Human Layer: Markierung von ausschließlich maschinell annotierten Bereichen Um den zeitlichen Aufwand der manuellen Annotationsarbeiten gering zu halten, sind vor allem nicht-narrative Bereiche eines klinischen Texts von der Annotation ausgenommen. Folgende Bereiche sollen nicht annotiert werden: •Lange Aufzählungen von Laborwerten •Dosierungsoder Vergabeangaben von Medikamenten •Lange Aufzählungen von Medikamenten •Tabellen •ICD-Codes •Dokumentstrukturen / Abschnittsüberschriften (z.B. die Überschrift “Diagnose”) Die Annotationskräfte haben die Wahl zwischen zwei Vorgehensweisen: (A) Sie können existierende Vorannotation löschen oder (B) das sog. No-Human Layer über die betreffenden Bereiche ziehen. Beide Varianten sind äquivalent. Variante A: Löschung von Vorannotation: Sollten die oben genannten Teile eines Dokuments vorannotiert sein, so kann die betreffende Vorannotation gelöscht werden. Hierbei ist sicherzustellen, dass alle Konzepte von der jeweiligen Textstelle entfernt wurden. Variante B: Das No-Human Layer: Eine Alternative zur Löschung bietet das Ziehen des No-Human Layers, um eindeutig kennzuzeichnen, dass ein Bereich nicht von Menschen überprüft wurde. In INCEpTION muss dazu zunächst oben rechts im Drop-Down Menü von dem Layer Concept zum Layer No_Human gewechselt werden (s. Abb. 4). Abbildung 4: Auswahl des No_Human Layers in INCEpTION. Es wird geraten, die Varianten situativ effizient einzusetzen: So kann es zum Beispiel sinnvoll sein, eine Vorannotation eines ICD-10 Codes einfach zu löschen, da das in wenigen Klicks erledigt ist. Eine lange Liste von Laborwerten kann andererseits ein guter Fall für das No-Human Layer sein. 35
5 Das Hinzufügen von Relationen Neben den eingeführten Konzepten, die über Spannen im Text annotiert und nach SNOMED CT gegroundet werden, sollen diese in der semantischen Annotation von GeMTeX auch durch Relationen miteinander verbunden werden. Es gibt nur eine generische Art der Relation, hier dargestellt als −→ rx∈De,y∈De, die keine Labels besitzt und grundsätzlich nur zwei Annotate xund ymiteinander verbindet. Im folgenden werden die Grundregeln der semantischen Relationsannotation für GeMTeX erläutert. Hinweis In den folgenden Abschnitten wird eine jeweils präferierte Relationsrichtung angegeben. Dieser sollte grundsätzlich gefolgt werden. Sollte dies zu komplex werden, können Relationen per Default auch von links nach rechts gezogen werden. 5.1 Inhaltliche Relationen Die grundlegendste Bedingung für das Ziehen einer Relation zwischen zwei Annotaten im Text ist die inhaltliche Kohärenz. Zwei Annotate müssen inhaltlich zusammenhängen, sodass eine Relation gezogen werden soll. Inhaltliche Kohärenz meint hier, dass zwei oder mehr Konzepte unbedingt gemeinsam interpretiert werden müssen, um den Sinn hinter der tatsächlichen Aussage im Dokument begreifen zu können. Beispiel (73) illustriert einen solchen Fall: Da es kein gemeinsames Konzept für eine transitorische ischämische Attacke der linken Hemisphäre gibt, müssen die Konzepte getrennt voneinander annotiert werden. Um die Interpretation des Befunds komplett zu ermöglichen, werden die beiden Konzepte durch eine Relation miteinander verbunden. Die präferierte Richtung der Relation geht von den Core Konzepten auf Modifier oder Qualifier Konzepte und von Modifier Konzepten auf Qualifier Konzepte. Sollten zwei gleichrangige Konzepte miteinander verbunden werden, so ist die Relationsrichtung von links nach rechts zu wählen. (73) Wir berichten über eine [linkshemisphärielle](a.) [TIA](b.). a. SCTID: 72792008 | Left cerebral hemisphere structure (body structure) b. SCTID: 266257000 | Transient ischemic attack (disorder) −→ rb,a 36
5.2 Relationen bei familiären Erkrankungen Sollten Erkrankungen nicht beim Patienten, sondern bei Familienangehörigen vorkommen, so ist die Krankheit mit dem zugehörigen Familienangehörigen zu verbinden. Wie in (74) dargestellt, ist die präferierte Relationsrichtung ausgehend von der Person zur Krankheit. (74) Der [Vater](a.) des Betroffenen litt unter einem [Katarakt li.](b.). a. SCTID: 9947008 | Natural father (person) b. SCTID: 816119002 | Cataract of left eye (disorder) −→ ra,b 5.3 Kausalrelationen Stehen zwei Konzepte in einer offensichtlichen kausalen Beziehung zueinander, muss eine Relation zwischen den beiden gezogen werden. Eine offensichtliche kausale Beziehung liegt dann vor, wenn die Kausalität explizit ausgedrückt wird, z.B. durch eine kausale Konjunktion wie “weil” oder “wegen”. Darüberhinaus muss eines der Konzepte die Ursache für das andere Konzept sein. Die präferierte Relationsrichtung beginnt an der Ursache und endet beim Resultat. (75) Pt. aufgenommen mit [akutem Myokardinfarkt](a.) wg. [arteriosklerot. Gefäßerkr.](b.). a. SCTID: 57054005 | Acute myocardial infarction (disorder) b. SCTID: 72092001 | Arteriosclerotic vascular disease (disorder) −→ rb,a 5.4 Anaphorische Relationen Anaphern sollen stets mit dem Konzept verbunden werden, auf das sie sich beziehen. Das Beispiel (76) zeigt, dass beide Spannen mit demselben SNOMED CT Konzept annotiert wurden. Zusätzlich sollen sie durch eine Relation miteinander verbunden werden. Die präferierte Relationsrichtung geht von der konkreten Nennung auf die anaphorische Referenz. (76) Pt. wurde [Voltaren](a.) verschrieben. Pt. hat [das Medikament](a.) nicht genommen. a. SCTID: 775563008 | Product containing only diclofenac (medicinal product) −→ ra,b 37
5.5 Messwertrelationen Im Kontext von Observable Entities kommen oft Messwerte und Einheiten vor. Diese sind stets in eine Relation miteinander zu bringen. Dabei sollte die Relation vom Observable Entity zu dem Messwert und vom Messwert zur Einheit gerichtet sein (vgl. (77)). Sollte eines der drei Merkmale im Text nicht vorhanden sein, so ist dennoch eine Relation zwischen den verbliebenen zwei Merkmalen zu ziehen. (77) Die [Herzfrequenz](a.) liegt bei [55](b.) [bpm](c.). a. SCTID: 364075005 | Heart rate (observable entity) b. (55.0) c. SCTID: 258983007 | Beats/minute (qualifier value) −→ ra,b −→ rb,c 5.6 Schrankenrelationen Sobald ein Wertebereich bzw. eine Spanne zwischen zwei Messwerten, Daten oder auch Graden angegeben ist, muss eine Relation ausgehend von der unteren Schranke zur oberen Schranke gezogen werden (s. Bsp. (78) und (79)). (78) Der Patient war von [23.10.](a.)-[31.10.21](b.) in stationärer Behandlung. a. SCTID: 410672004 | Date property (qualifier value) (2021-10-23) b. SCTID: 410672004 | Date property (qualifier value) (2021-10-31) −→ ra,b (79) Sie erlitt [[Verbrennungen 2.](a.) - 3. Grades](b.). a. SCTID: 403191005 | Partial thickness burn (disorder) b. SCTID: 403192003 | Full thickness burn (disorder) −→ ra,b Sollte eine Messwertrelation und die Schrankenrelation zusammenfallen, ist die Komplexität wie folgt zu reduzieren: Die erste Relation geht von der Observable Entity zur unteren Schranke. Die zweite Relation zeigt von der unteren zur oberen Schranke. Die letzte Relation zeigt von der oberen Schranke zur Einheit (vgl. (80)). 38
(80) [Syst. Blutdr.](a.) höchstens zwischen [146](b.) und [120](c.) [mmHg](d.). a. SCTID: 271649006 | Systolic blood pressure (observable entity) b. 146.0 c. 120.0 d. SCTID: 259018001 | Millimeter of mercury (qualifier value) −→ ra,c −→ rc,b −→ rb,d 5.7 Koordinationsrelationen In Kapitel 2 wird im Rahmen von Maxime II auf (syntaktische) Koordination eingegangen. Die Regel definiert, dass koordinierte Einheiten getrennt voneinander und vom Koordinationsprädikat, auf das sie sich beziehen, annotiert werden müssen. Dies ist auch in Beispiel (21) dargestellt, hier in vollständiger Annotation als (81) widergegeben. Es wird deutlich, dass die koordinierten Einheiten “Kopf” und “Ohren” getrennt voneinander annotiert werden, ebenso wie das Koordinationsprädikat “drittgradig verbrannt”, welches den Sachverhalt der koordinierten Einheiten näher bestimmt. Eine Relation soll nun ausgehend vom Koordinationsprädikat auf die beiden koordinierten Einheiten gezogen werden - es ist nicht notwendig, eine Relation zwischen den koordinierten Einheiten zu ziehen. (81) [Kopf](a.) und [Ohren](b.) [drittgradig verbrannt](c.). a. SCTID: 69536005 | Head structure (body structure) b. SCTID: 117590005 | Ear structure (body structure) c. SCTID: 1403192003 | Full thickness burn (disorder) −→ ra,c −→ rb,c 5.8 Faktualitätsrelationen Faktualitätsanzeiger und Negationspartikel modifizieren oder invertieren die Semantik bestimmter Ausdrücke und haben daher massive Auswirkungen auf die korrekte Interpretation von Aussagen. Um diesem Beitrag gerecht zu werden, muss von Faktualitätsoder Negationspartikeln eine Relation auf jedes Annotat gezogen werden, das von ihnen modifiziert wird. Sollten mehrere Annotate von der Modifizierung betroffen sein, so ist eine Relation zu jedem dieser Annotate zu ziehen. Das Beispiel (82) illustriert die Annotation von Faktualitäten. (82) [Wahrscheinlich](a.) liegt eine [Läsion im Auge](b.) vor. a. SCTID: 410592001 | Probably present (qualifier value) b. SCTID: 301905003 | Lesion of eye (disorder) −→ ra,b 39
In (83) wird ein Fall illustriert, wo eine Negation mehrere Konzepte modifiziert: Der Satz sagt aus, dass weder intrakranielle noch intracerebrale Traumata vorliegen, ohne zu spezifizieren, ob weitere Traumata vorliegen. Folglich modifiziert die Negation hier die beiden Lokalisationsangaben, die wiederum die Traumata näher spezifizieren. Es ist also von “keine” ausgehend je eine Relation zu den beiden Lokalisationsangaben zu ziehen. Da die beiden Lokalisationsangaben mit dem Konzept der Traumata koordiniert sind, ist weiterhin je eine Relation von “Traumata” zu den beiden Lokalitäten zu ziehen. (83) [Kopf-CT](a.) ergab [keine](b.) [intrakr.](c.) oder [intracer.](d.) [Traumata](e.). a. SCTID: 303653007 | Computed tomography of head (procedure) b. SCTID: 410516002 | Known absent (qualifier value) c. SCTID: 128319008 | Intracranial structure (body structure) d. SCTID: 12738006 | Brain structure (body structure) e. SCTID: 417746004 | Traumatic injury (disorder) −→ rb,c −→ rb,d −→ re,c −→ re,d 5.9 Temporalrelationen Temporalrelationen können ausschließlich durch ein Triggerwort ausgelöst werden, das Vor-, Gleichoder Nachzeitigkeit ausdrückt (vgl. Abschnitt 3.3.3.1). Kommt ein solches Triggerwort vor (z.B. “vor” in Bsp. (84)), so ist eine Relationskette nach dem folgenden Prinzip zu bilden: •VORZEITIG(Konzept A, Konzept B) und Konzept A findet vor Konzept B statt. •GLEICHZEITIG(Konzept A, Konzept B) und Konzept A steht vor Konzept B im Text. •NACHZEITIG(Konzept A, Konzept B) und Konzept A findet nach Konzept B statt. Im Falle der Vorzeitigkeit ist also zunächst eine Relation vom Triggerwort zum früher stattfindenden Konzept zu ziehen. Anschließend ist eine Relation vom früher zum später stattfindenden Konzept zu ziehen. Bei der Nachzeitigkeit verhält es sich analog (Also: Der Trigger zeigt auf das später stattfindende Konzept, welches wiederum auf das früher stattfindende Konzept zeigt). Bei Gleichzeitigkeit entspricht die präferierte Relationsrichtung der Leserichtung (von links nach rechts). Jeweils ein Beispiel für die Temporalrelation ist in den nachfolgenden Beispielen (84), (85) und (86) dargestellt. (84) [Vor](a.) der [OP](b.) wird ein [ambulantes EKG](c.) durchgeführt. a. SCTID: 272113006 | Before values (qualifier value) b. SCTID: 5387713003 | Surgical procedure (procedure) c. SCTID: 164850009 | Ambulatory electrocardiogram (procedure) 40