Vom Umgang mit KI und personenbezogene Daten: Reichen gängige Anonymisierungsmethoden noch aus?

Michael Jessen-Lieberum

Blogbeitrag

|

22.09.2026

Derzeit führt der vom Bundesministerium für Digitales und Staatsmodernisierung (BMDS) eingerichtete „Marktplatz der KI-Möglichkeiten“ bereits 399 KI-Systeme, die in der Verwaltung eingesetzt werden könn(t)en. Nach einer aktuellen Studie nutzen rund 90 Prozent der Rechtsanwältinnen und Rechtsanwälte in Deutschland mindestens ein KI-Werkzeug in ihrer täglichen Arbeit. In diesem Zusammenhang stellen sich für Behörden und Anwaltschaft ähnliche Fragen: Was darf mit personenbezogenen Daten geschehen, wenn heutige Sprachmodelle (LLMs) ins Spiel kommen?

 

In der Verwaltung geht es dabei unter anderem um die Frage, ob und inwieweit die Daten der Beschäftigten für das Training eigener KI-Systeme verwendet werden dürfen. Aus Sicht der Anwaltschaft ist zu überlegen, ob eine Anonymisierung von Dokumenten, bei der mandatsbezogene Identifikatoren – etwa Name und Anschrift – geschwärzt werden, bereits ausreicht, um als Berufsgeheimnisträger die Verschwiegenheitspflichten nicht zu verletzen.

 

Wenn die Behörden KI entwickelt

 

Bereits unter dem Gesichtspunkt der Daten-Souveränität kann die Entwicklung eigener KI-Systeme in der Verwaltung sinnvoll sein. In Betracht kommen Anwendungen für die Personalverwaltung selbst, beispielsweise für Beihilfe- und Dienstreiseangelegenheiten, für Beurteilungen oder das Disziplinarrecht. Wer solche Systeme selbst trainieren will, braucht jedoch Daten. In der Personalverwaltung sind dies vor allem Beschäftigtendaten.

 

Die europäische Verordnung über künstliche Intelligenz (KI-VO) ordnet Systeme für die Personalverwaltung meist als sogenannte Hochrisiko-KI-Systeme nach Art. 6 Abs. 2 i. V. m. Anh. III Nr. 4 lit. b KI-VO ein, wobei eine solche Einstufung in jedem Einzelfall zu prüfen ist. Für diese Systeme gelten ab dem 2. August 2027 besondere Dokumentations-, Qualitätsmanagement- und Konformitätspflichten, die auch eine Behörde treffen, wenn sie als Anbieterin eines KI-Systems auftritt. Hinzu kommen die Anforderungen des Art. 10 KI-VO an die Qualität der verwendeten Trainingsdaten: Diese müssen möglichst repräsentativ, fehlerfrei und vollständig sein.

 

Die eigentliche Hürde liegt im Datenschutzrecht: Eine wirksame Einwilligung der Beschäftigten in die Datenverarbeitung nach Art. 7 Datenschutz-Grundverordnung (DSGVO) wird aufgrund der Hierarchie in einem Dienstverhältnis regelmäßig an der fehlenden Freiwilligkeit scheitern (Art. 7 Abs. 4 DSGVO). Auch das Gebot der Informiertheit dürfte angesichts intransparenter Trainingssysteme schwierig zu erfüllen sein. Ebenso wird ein Widerruf der Einwilligung nach Art. 7 Abs. 3 DSGVO kaum umzusetzen sein, weil einmal antrainierte Daten kaum mehr aus einem KI-Modell entfernt werden können.

 

Das Training mit Beschäftigtendaten wird zudem nicht von § 26 Abs. 1 S. 1 Bundesdatenschutzgesetz (BDSG) gedeckt sein. Danach kann eine Datenverarbeitung zum Zweck des Beschäftigungsverhältnisses zwar grundsätzlich zulässig sein. Das KI-

Training stellt aber keinen solchen Zweck dar. Die Generalklausel des § 3 BDSG und die entsprechenden Vorschriften der Landesdatenschutzgesetze erlauben wiederum nur Verarbeitungen von geringer Intensität, an der es beim Training eines KI-Systems fehlt.

 

Auch ein externer Anbieter darf die Beschäftigtendaten, die ihm als Auftragsverarbeiter überlassen werden, zur Verbesserung seines KI-Systems nicht nutzen. Die Interessen der Beschäftigten überwiegen, weil sie mit einer solchen Verwendung nicht rechnen müssen – im Fall von Beamtinnen und Beamten etwa aufgrund der Vertraulichkeit der Personalakte.

 

Als gangbarer Weg bleibt damit lediglich das Training mit anonymisierten Beschäftigtendaten: Die Anonymisierung selbst kann als geringfügiger Eingriff auf Art. 6 Abs. 1 UAbs. 1 lit. e DSGVO i. V. m. § 3 BDSG oder der jeweiligen Landesgeneralklausel gestützt werden. Für identifizierbare personenbezogene Daten müsste der Gesetzgeber hingegen eine Rechtsgrundlage schaffen, die der Verwaltung nicht nur die Aufgabe zuweist, KI-Systeme zu entwickeln, sondern ihr auch die Befugnis einräumt, hierfür auf die Daten ihrer Beschäftigten zurückzugreifen.

 

Für Behörden, die ein KI-Projekt in der Personalverwaltung planen, folgt daraus zweierlei: Sie müssen die Anonymisierung der Trainingsdaten als rechtliche Voraussetzung des gesamten Vorhabens von Beginn an in die Projektplanung einbeziehen. Wird ein System eines externen Anbieters eingesetzt, sollte der Auftragsverarbeitungsvertrag daraufhin überprüft werden, ob er eine Nutzung der eingegebenen Daten zu Trainingszwecken ausschließt.

 

Wenn Anonymisierung nicht mehr genügt

 

Aber wann können Daten überhaupt als anonymisiert gelten? Bis heute wird häufig – so auch in der Anwaltschaft – davon ausgegangen, dass Schwärzungen der direkten Identifikatoren wie Name, Anschrift oder Berufsbezeichnung bereits ausreichen, um die Unterlagen zu anonymisieren, um sodann auf eine gesonderte Geheimhaltungsvereinbarung mit dem Anbieter zu verzichten.

 

Derartige Schwärzungen gehen auf eine traditionelle Vorstellung der Geheimhaltung zurück, die sich als „praktische Obskurität“ beschreiben lässt. Man geht davon aus, dass der Aufwand einer De-Anonymisierung eines geschwärzten Dokuments in keinem wirtschaftlich sinnvollen Verhältnis zum Ertrag steht, wenn die direkten Identifikatoren entfernt wurden. Das Dokument bleibt zwar theoretisch rekonstruierbar, praktisch gesehen ist es aber obskur.

 

Diese Rechnung geht im Jahr 2026 nicht länger auf. Aktuelle Studien zum Einsatz von LLMs zeigen, dass bereits heute handelsübliche Sprachmodelle erhebliche Trefferquoten bei der De-Anonymisierung erreichen: In einer Untersuchung der ETH Zürich und der Entwickler hinter dem Sprachmodell Claude von Anthropic ordnete ein Sprachmodell beispielsweise ein gutes Drittel von rund 89.000 LinkedIn-Profilen korrekt anonymen Nutzerbeiträgen in einem anderen Internetforum zu.  [Link zur Studie].

Eine klassische – und händische – Schlagwortsuche erreichte unter gleichen Bedingungen eine Trefferquote von lediglich 4,2 Prozent.

 

Wer nur vermeintlich anonymisierte Unterlagen in ein cloudbasiertes Sprachmodell lädt, das geschwärzte Namen aber anhand der verbliebenen Quasi-Identifikatoren – also auf den ersten Blick nebensächlicher Sachverhaltsangaben wie eines Branchenbezugs oder stilistischer Ausdrucksmerkmale – erkennen kann, riskiert, seine Verschwiegenheitspflichten zu verletzen. Für Anwältinnen und Anwälte sind diese in § 43 a Abs. 2 der Bundesrechtsanwaltsordnung (BRAO) geregelt. Daneben droht auch eine Strafbarkeit wegen der Verletzung von Privatgeheimnissen nach § 203 Abs. 1 Nr. 3 Strafgesetzbuch (StGB).

 

Händische Anonymisierungsversuche reichen nicht mehr

 

In Zeiten der breiten Verfügbarkeit großer Sprachmodelle muss sich der Geheimnisschutz damit von händischen Anonymisierungsversuchen in eine rechtsgeschäftliche Absicherung verlagern:

 

· Gesichert zulässig bleibt der Einsatz cloudbasierter Sprachmodelle für Rechtsanwälte und andere Berufsgeheimnisträger nur auf Grundlage einer Vereinbarung mit dem Anbieter, etwa nach § 43e BRAO, flankiert durch die Verpflichtung des Anbieters nach § 203 Abs. 4 StGB, die Verschwiegenheit, Strafbarkeitshinweis, Textform und die Erstreckung auf Subunternehmer umfasst.

· Wo eine solche Vereinbarung nicht zu erreichen ist, muss im Einzelfall der Mandant einwilligen. Eine bloß einseitige Zusicherung des KI-Anbieters in Allgemeinen Geschäftsbedingungen oder Datenschutzhinweisen reicht hingegen nicht aus.

 

Rechtsanwältinnen und Rechtsanwälte und andere Berufsgeheimnisträger müssen ihre bestehenden Verträge dahingehend überprüfen. Die regulären Verbraucherabonnements der großen Anbieter erfüllen die Anforderungen des § 43e BRAO (oder § 203 Abs. 4 StGB) in aller Regel nicht.

Meine Empfehlung

  • Behörden oder Berufsgeheimnisträger sollten beim KI-Einsatz die Anforderungen an eine ausreichende Anonymisierung stets mit Blick auf den aktuellen technischen Stand bestimmen.
  • Solange es an einer Rechtsgrundlage fehlt, die der Verwaltung sowohl die Aufgabe der KI-Entwicklung überträgt als auch die Befugnis zum Rückgriff auf die Daten ihrer Beschäftigten ausdrücklich verleiht, ist ein KI-Training mit den eigenen Datenbeständen mit erheblichen rechtlichen Risiken verbunden.

Der Kopf hinter dem Beitrag.

Rechtsanwalt Michael Lieberum in der Kanzlei DOMBERT Rechtsanwaelte

Diese Themen wurden auch auf der diesjährigen Herbstakademie der Deutschen Stiftung für Recht und Informatik (DSRI) behandelt: Rechtsanwalt Jessen-Lieberum sprach im Panel „KI in Berufen und Branchen“ zum Ende der praktischen Obskurität und den Folgen für das anwaltliche Berufsrecht, Rechtsanwalt Frenken erläuterte im Panel „Verwaltung“ die rechtlichen Voraussetzungen für ein Training von KI-Systemen auf behördeneigenen Datenbeständen.

 

Sie haben dazu Aufsätze verfasst, die im Tagungsband der Herbstakademie erschienen sind: Bernzen/Heinze/Steinrötter (Hrsg.), Digitalwirtschaft 2030 – IT-Recht am Wendepunkt?, Tagungsband DSRI-Herbstakademie 2026, C.H. Beck 2026.

DOMBERT Rechtsanwälte

Unsere Tätigkeit umfasst alle Rechtsfragen und Konflikte, in denen der Staat, Kommunen oder Behörden beteiligt sind.