Zum Inhalt springen

Dokumente für ChatGPT anonymisieren: Anleitung für Word und PDF

Bevor ein Vertrag oder eine Akte in ChatGPT geht, müssen drei Arten von Daten heraus: Kennungen wie Namen und IBANs, verborgene Dateidaten wie Kommentare und Metadaten und Details, an denen man die Person auch ohne Namen erkennt. Mit festen Platzhaltern versteht die KI den Text trotzdem.

Daniel Seuffer

· 7 Min. Lesezeit

Ersetzen Sie vor der Eingabe in ChatGPT alle direkten Kennungen wie Namen, Adressen, Geburtsdaten, IBANs, Steuer-IDs und Aktenzeichen durch einheitliche Platzhalter wie [PERSON_1]. Verallgemeinern Sie Details, an denen man die Person auch ohne Namen erkennt, entfernen Sie Kommentare, Änderungen und Metadaten und kopieren Sie nur den bereinigten Text in den Chat. Solange Sie die Zuordnung der Platzhalter aufbewahren, ist das Dokument pseudonymisiert und nicht anonym (Art. 4 Nr. 5 DSGVO).

Welche Daten müssen aus dem Dokument heraus?

Personenbezogen ist jede Angabe, über die sich eine Person identifizieren lässt. Beim Bereinigen hilft es, drei Gruppen zu unterscheiden: direkte Kennungen, indirekte Kennungen und Daten, die in der Datei stecken, ohne im Text sichtbar zu sein.

Direkte Kennungen

Diese Angaben identifizieren eine Person für sich allein. Ersetzen Sie jede durch einen Platzhalter, der die Art der Angabe verrät, damit die KI den Text weiter richtig versteht.

AngabeBeispielPlatzhalter
NameMarkus Kowalski[PERSON_1]
Firma, OrganisationBrenner Bau GmbH[ORG_1]
AdresseLindenweg 4, 36037 Fulda[LOC_1]
Geburtsdatum14.03.1968[DATE_1]
IBANDE89 3704 0044 0532 0130 00[IBAN_1]
Steuer-ID12 345 678 901[ID_1]
VersichertennummerA123456789[ID_2]
Aktenzeichen3 O 128/25[ID_3]
E-Mail-Adressem.kowalski@example.de[EMAIL_1]
Telefonnummer0661 123456[PHONE_1]

Alle Beispielwerte sind erfunden. Achten Sie auf Formen, die eine einfache Suche übersieht: „Herrn Kowalski“, „Kowalskis Schreiben“, den Vornamen allein, Initialen wie „M. K.“ und den Namen als Teil einer E-Mail-Adresse.

Indirekte Kennungen und Kontext

Auch ohne Namen kann ein Text auf genau eine Person zeigen. Ein seltener Beruf in einem kleinen Ort, ein Unfall mit Datum und Straße oder die Rolle als Geschäftsführer eines bekannten Familienunternehmens reichen oft aus. Die DSGVO berücksichtigt dafür in Erwägungsgrund 26 alle Mittel, mit denen eine Person „direkt oder indirekt“ identifiziert werden kann, ausdrücklich auch das sogenannte Aussondern, also das Herausgreifen einer einzelnen Person aus einer Gruppe.

Die Bundesrechtsanwaltskammer formuliert es für Kanzleien in ihren Hinweisen zum KI-Einsatz (Stand Dezember 2024, Seite 4) so: „Dabei reicht es regelmäßig nicht, Namen und Anschriften von Mandanten zu entfernen, wenn sich Mandatsinformationen aus dem Kontext ergeben können.“ Fragen Sie bei jedem Detail, ob die KI es für die Aufgabe braucht. Aus „die einzige Kinderärztin in Neuhof“ wird „eine Ärztin in einer Kleinstadt“, aus „am 12. Mai 2025“ wird „im Frühjahr“, wenn der genaue Tag keine Rolle spielt.

Versteckte Daten in Word-Dateien

Eine DOCX-Datei enthält mehr als den sichtbaren Text. Microsoft nennt in seiner Anleitung zur Dokumentprüfung unter anderem diese Fundstellen:

  • Kommentare und Überarbeitungsmarkierungen aus nachverfolgten Änderungen, in denen gelöschter Text weiter steht
  • Dokumenteigenschaften wie Autor, Manager und Unternehmen sowie die Namen der Bearbeiter
  • Kopf- und Fußzeilen, Wasserzeichen und ausgeblendeten Text
  • Dateipfade und Namen von Vorlagen

Beim Bau unseres Word-Add-ins mussten wir neben dem Fließtext jede Kopf- und Fußzeile, jede Fußnote und jede Endnote einzeln durchsuchen lassen, weil Word diese Bereiche getrennt vom Haupttext ablegt. Wer von Hand arbeitet, prüft sie deshalb ebenfalls einzeln.

Versteckte Daten in PDFs

PDFs können Kommentare, Metadaten und ausgeblendete Ebenen enthalten, wie Adobe in seiner Anleitung zum Schwärzen beschreibt. Zwei Fallen kommen häufig vor. Ein schwarzer Balken, der als Form über den Text gelegt wurde, verdeckt nur die Anzeige; der Text darunter lässt sich weiter markieren und kopieren. Und gescannte PDFs mit Texterkennung (OCR) enthalten eine unsichtbare Textebene unter dem Bild, die beim Schwärzen des Bildes stehen bleiben kann. Dauerhaft entfernt werden Inhalte erst mit einer echten Schwärzungsfunktion, etwa „PDF schwärzen“ in Acrobat Pro.

Manuell anonymisieren in Word, Schritt für Schritt

Für ein einzelnes kurzes Dokument reicht Word selbst. Die Menüpfade beziehen sich auf Word für Microsoft 365 unter Windows.

  1. Kopie anlegen. Speichern Sie das Dokument über „Datei“, „Speichern unter“ als Kopie. Microsoft empfiehlt das ausdrücklich, weil sich entfernte Daten nicht immer wiederherstellen lassen.
  2. Zuordnung notieren. Notieren Sie in einer separaten Datei jeden Originalwert mit seinem Platzhalter: „Markus Kowalski = [PERSON_1]“. Jede Person bekommt im ganzen Dokument genau einen Platzhalter.
  3. Suchen und Ersetzen. Öffnen Sie auf der Registerkarte „Start“ den Befehl „Ersetzen“ oder drücken Sie Strg+H. Tragen Sie den Originalwert unter „Suchen nach“ und den Platzhalter unter „Ersetzen durch“ ein. Laut Microsoft ist „Ersetzen“ sicherer als „Alle ersetzen“, weil Sie so jede Fundstelle einzeln sehen. Suchen Sie danach noch einmal nach dem Nachnamen allein, um gebeugte Formen und Kurzformen zu finden. Auch die Reihenfolge zählt. Ersetzen Sie „Anna“ vor „Anna Müller“, bleibt „[PERSON_1] Müller“ stehen. Unsere eigene Wiederherstellung sucht deshalb immer zuerst den längsten Wert.
  4. Kontext kürzen. Lesen Sie den Text einmal vollständig und verallgemeinern Sie Details, die eine Person ohne Namen erkennbar machen.
  5. Dokumentprüfung ausführen. Diese Funktion wird oft „Dokumentinspektor“ genannt. Wählen Sie „Datei“, „Info“, „Auf Probleme überprüfen“ und dann „Dokument prüfen“. Starten Sie mit „Prüfen“ und wählen Sie bei jedem Fund „Alle entfernen“.
  6. Text kopieren statt Datei hochladen. Markieren Sie den bereinigten Text, kopieren Sie ihn und fügen Sie ihn in ChatGPT ein. Was Sie in Kommentaren, Eigenschaften oder ausgeblendetem Text übersehen haben, bleibt so in der Datei auf Ihrem Rechner.
  7. Originalwerte wiederherstellen. Ersetzen Sie in der Antwort der KI die Platzhalter anhand Ihrer Zuordnung wieder durch die Originalwerte.

Bei einem PDF kopieren Sie den Text zuerst in ein leeres Word-Dokument und arbeiten dort weiter. Liefert das Kopieren keinen Text, ist das PDF ein reiner Scan. Dann brauchen Sie zuerst eine Texterkennung. Nach Scans werden wir in Gesprächen früh gefragt. Oft genügt es, beim Scannen die Texterkennung (OCR) einzuschalten; handschriftliche Notizen erkennt aber auch sie nur unzuverlässig.

Wo die Handarbeit an Grenzen stößt

Die manuelle Methode funktioniert, solange das Dokument kurz und die Zahl der Personen klein ist. Schon ein übersehener Genitiv bringt den Namen doch in den Prompt. Eine vergessene Durchwahl in der Fußzeile verrät die Person ebenso. Bei mehreren Bearbeitern oder Dokumenten passen die Platzhalter schnell nicht mehr zusammen. Dann ist [PERSON_1] im Vertrag der Käufer und in der Mail der Notar. Das Wiederherstellen hängt an Ihrer Zuordnung. Sie ist selbst eine Sammlung personenbezogener Daten, die Sie getrennt und geschützt aufbewahren müssen. Wer den Text über die Zwischenablage weitergibt, verliert außerdem oft die Formatierung von Tabellen und Nummerierungen. Für eine Steuerberatungskanzlei, mit der wir gesprochen haben, war genau das bei Notarverträgen in Word eine der beiden Hürden. Daraus ist unser Word-Add-in entstanden. Es ersetzt die Werte direkt im Dokument, ohne Umweg über die Zwischenablage.

Checkliste vor dem Absenden an ChatGPT

  1. Alle Namen von Personen und Firmen sind ersetzt, auch gebeugte Formen, Vornamen und Initialen.
  2. Adressen, Geburtsdaten, IBANs, Steuer-IDs, Versichertennummern, Aktenzeichen, E-Mail-Adressen und Telefonnummern sind ersetzt.
  3. Jede Person und jeder Wert hat genau einen Platzhalter, der die Art der Angabe verrät.
  4. Seltene Berufe, kleine Orte, genaue Daten und auffällige Ereignisse sind verallgemeinert, soweit die Aufgabe es zulässt.
  5. Kopf- und Fußzeilen, Fußnoten und Tabellen sind geprüft.
  6. Änderungen sind angenommen oder abgelehnt, Kommentare und Dokumenteigenschaften sind entfernt.
  7. Im PDF ist geschwärzter Text tatsächlich entfernt und lässt sich nicht mehr markieren.
  8. Sie geben den bereinigten Text weiter, nicht die Originaldatei.
  9. Die Zuordnung von Platzhaltern zu Originalwerten liegt getrennt und geschützt.

Dokumente mit Deckname pseudonymisieren

Deckname erkennt Namen, Organisationen, Orte, Datumsangaben, IBANs, E-Mail-Adressen, Telefonnummern, Aktenzeichen und Kennnummern in deutschen Texten mit einem eigenen Modell auf Servern in Deutschland. Derselbe Wert bekommt im ganzen Dokument denselben Platzhalter. Die Zuordnung wird verschlüsselt gespeichert; jede Sitzung erzeugt einen Prüfbericht ohne Klartexte. Es gibt drei Wege:

  • In Word. Das Add-in Deckname für Word läuft unter Windows, Mac und im Web. Sie lassen das geöffnete Dokument analysieren, prüfen die Funde im Seitenbereich und ersetzen sie durch Platzhalter wie [PERSON_1], während Absätze, Tabellen und Formatierung erhalten bleiben. Die Antwort der KI fügen Sie im Seitenbereich ein und erhalten sie mit den Originalwerten zurück. Kommentare liest das Add-in nicht. Bei aktiver Änderungsverfolgung schreibt es nichts in das Dokument. Die Dokumentprüfung aus Schritt 5 bleibt deshalb Ihre Aufgabe.
  • Im Web-Portal. Sie fügen Text ein oder laden PDF, DOCX oder TXT bis 10 MB hoch, wählen die Kategorien und kopieren das Ergebnis. Die Antwort der KI stellen Sie in derselben Sitzung wieder her. Gescannte PDFs ohne Textebene lehnt das Web-Portal ab.
  • Per API. Für wiederkehrende Abläufe gibt es eine OpenAI-kompatible API, die Texte vor dem Sprachmodell pseudonymisiert und die Antwort danach wiederherstellt.

Die Funde prüfen und nach indirekten Hinweisen suchen müssen Sie auch mit Deckname selbst. Was mit Texten, Dokumenten und Zuordnungen auf dem Server geschieht, steht auf der Seite Sicherheit.

Ist das Dokument danach anonym?

Für Sie nicht, solange Sie die Zuordnung aufbewahren. Wer Kennungen durch Platzhalter ersetzt und die Zuordnung aufbewahrt, pseudonymisiert im Sinne von Art. 4 Nr. 5 DSGVO. Diese Vorschrift verlangt, dass die zusätzlichen Informationen gesondert aufbewahrt werden und technischen und organisatorischen Maßnahmen unterliegen. Nach Erwägungsgrund 26 sind pseudonymisierte Daten Informationen über eine identifizierbare Person; die DSGVO gilt also weiter. Ob der Text für einen Empfänger ohne Zuordnung anonym ist, hängt vom Einzelfall ab. Die Hintergründe erklärt der Beitrag Pseudonymisierung vs. Anonymisierung.

Für Berufsgeheimnisträger kommt § 203 StGB hinzu. Nach den Hinweisen der BRAK sollen Mandantendaten vor der Nutzung von KI „falls möglich“ anonymisiert oder verschlüsselt werden. Was das für Kanzleien, Steuerberatung und Praxen bedeutet, steht im Beitrag § 203 StGB und KI. Welche ChatGPT-Tarife welche Daten verwenden, zeigt der Beitrag ChatGPT datenschutzkonform nutzen.

Quellen

  1. Art. 4 Nr. 5 und Erwägungsgrund 26 DSGVO (EUR-Lex)
  2. BRAK, Hinweise zum Einsatz von künstlicher Intelligenz, Stand Dezember 2024
  3. § 203 StGB
  4. Microsoft Support, Entfernen von ausgeblendeten Daten und persönlichen Informationen durch Überprüfen von Dokumenten
  5. Microsoft Support, Suchen und Ersetzen von Text
  6. Adobe, Vertrauliche Informationen entfernen (Acrobat)

Dieser Beitrag informiert allgemein und ersetzt keine Rechtsberatung.

Daniel Seuffer

Über Daniel Seuffer

Lead Engineer, InnoGE

Daniel Seuffer ist Lead Engineer bei der InnoGE GmbH in Fulda und entwickelt Software für Kundinnen und Kunden aus dem Mittelstand.

Deckname

Ersetzt Namen, IBANs und Aktenzeichen durch Platzhalter, bevor ein Text an die KI geht, und setzt die Originalwerte danach wieder ein.

14 Tage kostenlos testen

Probieren Sie Deckname an einem Beispieltext aus.

14 Tage mit allen Funktionen, ohne Kreditkarte. Für den Test ist ein Beispieltext eingebaut. Echte Mandanten- oder Patientendaten verarbeiten Sie erst mit einem Abonnement.