Wie KIs Daten de-anonymisieren
Wer anonym im Netz schreibt, ist nicht unbedingt anonym. Das zeigt eine aktuelle Studie der ETH Zürich. Forschende ließen Sprachmodelle wie ChatGPT, Gemini und Grok pseudonyme Profile auf Reddit und Hacker News analysieren und mit realen Identitäten auf LinkedIn abgleichen. Die KI suchte dafür nach biografischen Merkmalen wie Beruf, Interessen und Herkunft sowie nach Mustern im Schreibstil. Diese Modelle sind gut darin, Muster zu erkennen und große Datenmengen zu vergleichen. Bei Hacker News konnten so 67 Prozent der untersuchten Profile korrekt einer Identität zugeordnet werden, bei Reddit waren es bis zu 52 Prozent.
Das wirft nicht nur die Frage auf, wie anonym man im Internet noch sein kann und was das mit sich bringt, es stellt auch allgemein Anonymisierung von Daten in anderen Bereichen in Frage.
Wie anonym sind anonymisierte Forschungsdaten noch?
Gerade bei sensiblen Daten wie medizinischen Forschungsdaten ist die Fähigkeit von KI, Informationen zu kombinieren und Zusammenhänge herzustellen, kritisch zu betrachten. Gesundheitsinformationen können für die Forschung enorm wertvoll sein. Gleichzeitig gehören sie zu den sensibelsten personenbezogenen Daten überhaupt. Und selbst wenn Namen, Adressen oder andere eindeutige Identifikationsmerkmale entfernt werden, können beispielsweise seltene Erkrankungen, besondere körperliche Merkmale, Berufe oder die Kombination mehrerer Informationen eine Re-Identifikation ermöglichen. Je mehr Daten verfügbar werden und je leistungsfähiger die Technologien zu ihrer Auswertung werden, desto schwieriger wird es gleichzeitig, Forschungsdaten offen zu teilen und gleichzeitig die Privatsphäre der betroffenen Personen zu schützen.
Wie viel Schutz ist notwendig?
Das grundlegende Ziel von Wissenschaft ist es, neue Erkenntnisse zu gewinnen und bestehendes Wissen kritisch zu überprüfen. Open Science geht einen Schritt weiter: Forschungsergebnisse, Daten und Methoden sollen möglichst offen zugänglich und nachnutzbar sein. So können andere Forschende Ergebnisse nachvollziehen, Daten erneut auswerten und für neue Fragestellungen nutzen. Doch „offen“ bedeutet nicht automatisch „für alle frei verfügbar“. Manche Forschungsdaten können öffentlich zugänglich gemacht werden. Andere benötigen eine Anonymisierung oder einen kontrollierten Zugang. Und manche Daten können aufgrund rechtlicher, ethischer oder vertraglicher Rahmenbedingungen gar nicht veröffentlicht werden. Forschungsdaten sollen dabei so offen wie möglich, aber so geschützt wie notwendig sein: „as open as possible, as closed as necessary“. Wie viel Schutz notwendig ist, ist allerdings keine statische Größe. Neue technologische Möglichkeiten, können diese Grenze verschieben.
Wer entscheidet, was offen sein kann?
Diese Entscheidung beginnt lange vor der Veröffentlichung. Schon bei der Planung eines Forschungsprojekts stellen sich Fragen: Welche Daten werden erhoben? Auf welcher rechtlichen Grundlage? Wo werden sie gespeichert? Wer darf darauf zugreifen? Wie werden sie dokumentiert? Können sie später geteilt werden – und wenn ja, unter welchen Bedingungen?
Mit KI kommt eine weitere Ebene hinzu. Denn technische Entwicklungen können verändern, welche Rückschlüsse sich aus vorhandenen Daten ziehen lassen. Im medizinischen Bereich ist es deshalb besonders interessant, wie KI eingesetzt werden kann, ohne sensible Patient:innendaten unnötig offenzulegen, etwa durch lokal betriebene Sprachmodelle oder Systeme, bei denen nur aggregierte Ergebnisse an ein KI-Modell weitergegeben werden.
Forschungsdaten brauchen professionelles Management
Zwischen dem Wunsch nach möglichst offener Wissenschaft, der Chance KI für wissenschaftlichen Fortschritt zu nutzen und dem notwendigen Schutz sensibler Daten liegen damit zahlreiche Entscheidungen. Sie betreffen nicht nur Datenschutz, sondern den gesamten Lebenszyklus von Forschungsdaten, von ihrer Erhebung und Dokumentation über Speicherung und Zugriffsrechte bis zur Veröffentlichung, Nachnutzung und Archivierung.
Genau hier setzt der Universitätskurs Data Steward an. Er vermittelt Kompetenzen für professionelles Forschungsdatenmanagement und beschäftigt sich unter anderem mit FAIR Data und Open Science, Datenschutz und Datensicherheit sowie Repositorien und der nachhaltigen Bereitstellung von Forschungsdaten.
Tipp: Online-Infoevent
Informieren Sie sich bei unserem kostenlosen Online-Infoevent am 19. November 2026 von 17.00 Uhr bis 18.00 Uhr.
Hier geht es zur Anmeldung zum Online-Infoevent Data Steward