Zum Hauptinhalt springen

5. Data Guard – Datenschutz in Aktion

5.1 Was ist der Data Guard?​

Der Data Guard ist die zentrale Datenschutz- und Sicherheitskomponente von GovAI. Er prüft alle Eingaben auf personenbezogene und sensible Daten, bevor diese an ein externes KI-Modell gesendet werden – vollautomatisch und transparent.

Kernprinzip: Externe KI-Modelle erhalten zu keinem Zeitpunkt Zugriff auf Originaldaten. Die Rückführung pseudonymisierter Daten auf die Originale erfolgt ausschließlich innerhalb der GovAI-Plattform.

Rechtlicher Hinweis

Die De-Identifizierung im Data Guard ist technisch als Pseudonymisierung einzuordnen (DSGVO Art. 4 Nr. 5). Ein Re-Identifizierungsschlüssel verbleibt in der Plattform. Pseudonymisierte Daten gelten nach DSGVO weiterhin als personenbezogen. Der Data Guard reduziert das Risiko erheblich, ersetzt aber keine Rechtsgrundlage für die Datenübermittlung.

5.2 Der Verarbeitungspfad (End-to-End)​

Nutzereingabe
↓
[1] PII-Erkennung (SLM + Regex-Regeln)
↓
[2] Pseudonymisierung: "Max Mustermann" → "[gYkPXYLm8g3NwI]"
↓
[3] Externes KI-Modell erhält nur pseudonymisierte Anfrage
↓
[4] KI-Antwort enthält Platzhalter statt Originaldaten
↓
[5] Interne Re-Kontextualisierung: "[gYkPXYLm8g3NwI]" → "Max Mustermann"
↓
Nutzer sieht Antwort mit Originaldaten

Details zum Prozess:

  1. Analyse: Jede Texteingabe (inkl. OCR-Text aus Dokumenten/Bildern) wird durch das PII-Erkennungsmodul analysiert.
  2. Klassifizierung: Erkannte sensible Daten werden mit ihrem PII-Typ benannt.
  3. Pseudonymisierung: Erkannte Daten werden durch strukturierte Platzhalter ersetzt (z. B. {{redacted:UUID}}). Das Mapping Platzhalter ↔ Originalwert verbleibt ausschließlich in der Plattform.
  4. Übermittlung: Nur pseudonymisierte Inhalte verlassen GovAI in Richtung externer Modelle.
  5. Re-Kontextualisierung: Die Modellantwort mit Platzhaltern wird intern zurückübersetzt, bevor sie dem Nutzer angezeigt wird.
Konsistenz im Chatverlauf

Innerhalb eines Chats wird dasselbe PII-Vorkommen stets durch denselben Platzhalter ersetzt. Das Modell sieht den gesamten Chatverlauf nur in pseudonymisierter Form. GovAI hält intern sowohl die pseudonymisierten Texte als auch das vollständige Redact-Mapping für den gesamten Verlauf vor.

5.3 Erkannte PII-Typen (Mindestumfang)​

Der Data Guard erkennt mindestens folgende Datenkategorien automatisch:

PII-TypBeispiele
NamenVor- und Nachnamen, Doppelnamen, Namensvarianten
TelefonnummernNational und international, mit/ohne Vorwahl, mit Leerzeichen/Bindestrichen
E-Mail-AdressenAlle gängigen Formate (lokaler Teil + Domain, Subdomains, verschiedene TLDs)
IP-AdressenIPv4, perspektivisch IPv6
KreditkartennummernVISA, MasterCard und weitere (typische Längen und Formate)

Erkennungsmodalitäten:

ModalitätBeschreibung
Chat-TextDirekte Texteingaben und Konversationsverläufe
FreitextfelderEingaben in Assistenten und Werkzeugen
DokumentePDF, DOCX, PPTX, XLSX (max. 10 MB)
Bilder mit Text (OCR)JPG, JPEG, PNG (max. 10 MB) – Bildinhalte selbst werden nie übertragen

Mehrsprachigkeit: Die PII-Erkennung funktioniert mehrsprachig. Sprachunabhängige Muster (E-Mail, Telefon, IP-Adressen) werden unabhängig von der Sprache erkannt. Auch Personennamen in nicht-deutschsprachigen Texten werden erkannt.

Erweiterbarkeit: Über Regex-Regeln können organisationsspezifische Muster ergänzt werden.

5.4 Eigene Erkennungsmuster (Regex-Regeln)​

Administratoren können zusätzliche Erkennungsmuster für organisationsspezifische sensible Daten konfigurieren:

Verwaltung: Einstellungen → Erweiterungen → Regex-Regeln

Typische Anwendungsfälle:

  • Aktenzeichen (z. B. AZ-\d{4}/\d{4})
  • Personalnummern (z. B. P\d{6})
  • Interne Klassifizierungskennzeichnungen (z. B. VS-NfD, Vertraulich)
  • Organisationsspezifische IDs

Regex-Treffer werden wie Standard-PII behandelt: Pseudonymisieren / Zulassen / Verwerfen.

Fehlerhafte Regex-Regeln

Eine fehlerhafte Regex-Regel (z. B. unvollständige Klammer) führt nicht zum Ausfall der gesamten PII-Pipeline. Die übrigen Regeln bleiben wirksam. Testen Sie neue Regeln vor dem Produktiveinsatz.

5.5 Die drei Handlungsoptionen​

Data Guard – Erkennung und Handlungsoptionen

Wenn der Data Guard aktiv ist und sensible Daten erkennt, wird ein Dialog mit drei Optionen angezeigt:

OptionBeschreibungEmpfohlener Einsatz
🔴 VerwerfenDie Anfrage wird nicht gesendet. Neu formulieren ohne personenbezogene Daten.Bei versehentlicher Eingabe echter Daten
🟡 ZulassenAnfrage wird trotz Warnung unverändert gesendet.Nur für Testdaten (z. B. „Max Mustermann") oder nachweislich freigegebene Inhalte
🟢 PseudonymisierenSensible Daten werden ersetzt, nur pseudonymisierte Anfrage geht ans Modell. Originaldaten erscheinen in der Antwort wieder.Empfohlen für produktive Nutzung mit sensiblen Inhalten
Verantwortung verbleibt beim Nutzenden

Die finale Entscheidung liegt bei Ihnen. Der Data Guard ist ein Hilfsmittel – keine Garantie für vollständige Erkennung. Insbesondere bei unstrukturierten Inhalten, schlechter OCR-Qualität oder ungewöhnlichen Schreibweisen kann es zu Fehlerkennungen (False Negatives) kommen.

5.6 Data Guard-Einstellungen (Konfigurationsmodi)​

Für jeden Chat, jedes Werkzeug und jeden Assistenten kann der Data Guard-Modus individuell konfiguriert werden:

ModusBeschreibungWer entscheidet
DeaktiviertKeine PII-Prüfung; Anfrage geht unverändert ans Modell–
VoreingestelltStandard: Nutzende können den Data Guard selbst aktivieren oder deaktivierenNutzende
PermanentImmer aktiv, nicht deaktivierbar; optional erzwungene PseudonymisierungSystem

Erzwungene Pseudonymisierung (bei Permanent): Wenn konfiguriert, können Nutzende sensible Inhalte nur noch pseudonymisieren oder verwerfen – „Zulassen" ist nicht möglich.

Für Administratoren

Die Konfiguration erfolgt unter Einstellungen → Feature-Einstellungen → Chats/Werkzeuge/Assistenten (Schnelleinstellungen oder vollständige Konfiguration). Empfehlung für Produktivbetrieb: Permanent mit erzwungener Pseudonymisierung.

5.7 Data Guard bei Datei-Uploads​

Der Data Guard greift auch bei Datei-Uploads. Textuelle Inhalte aus Dokumenten und Bildern werden von dem Data Guard auf die selbe Weise geprüft wie Chat-Eingaben.

Für die Option "Text aus Bildern extrahieren" gilt: Bilder werden intern per OCR in Text umgewandelt. Das Originalbild wird nie an ein externes Modell übermittelt – nur der extrahierte Text.

Data Guard bei Bildern

Bilder, welche über die Option "Bilder hochladen" angehangen werden können nicht vom Data Guard geprüft werden. Etwaige Gesichter oder einer Person zuordenbare Merkmale werden nicht geschwärzt oder in sonstiger Weise unkenntlich gemacht. Die Verantwortung für die Prüfung personenbezogener, rein visueller Inhalte liegt bei den Nutzenden. Laden Sie nur Bilder hoch, die für die KI-Verarbeitung freigegeben sind – prüfen Sie im Zweifelsfall mit Ihrer Datenschutzstelle oder IT.

5.8 Nachweis der De-Identifizierung​

Für Compliance-Zwecke stellt GovAI folgende Nachweise bereit:

  • Architekturdiagramm mit End-to-End-Datenfluss (Original → Pseudonymisiert → Antwort → Re-Kontextualisiert)
  • Sequenzdiagramm für den Kernpfad (Request → Redact → Provider → Response → Unredact → UI)
  • Testprotokolle mit PII-Korpus (auf Anfrage)

Details: Kap. 12 – Sicherheit & Compliance.