Czy Twoje dane są naprawdę anonimowe?
Usunięcie kolumny z nazwiskiem to nie anonimizacja.
Wydaje się bezpieczne: usuń nazwiska, może adresy e-mail, i udostępnij plik. Ale zgodnie z RODO testem nie jest „czy usunąłem oczywiste identyfikatory?" — lecz „czy tę osobę nadal można wyodrębnić?". Bardzo często odpowiedź brzmi: tak, bo pozostawione szczegóły nadal wskazują jedną osobę. Ta strona wyjaśnia, dlaczego — wraz ze źródłami pierwotnymi.
Test prawny: rozsądnie prawdopodobna identyfikacja
Motyw 26 RODO wyznacza granicę. Dane są anonimowe tylko wtedy, gdy osoba jest niezidentyfikowana lub już niemożliwa do zidentyfikowania, przy uwzględnieniu wszelkich rozsądnie prawdopodobnych sposobów jej wyodrębnienia — przez kogokolwiek, nie tylko przez Ciebie. Jeśli ponowna identyfikacja pozostaje rozsądnie możliwa, dane nadal są danymi osobowymi i RODO nadal obowiązuje, bez względu na to, ile kolumn z nazwiskami usunąłeś.
Dlaczego resztki identyfikują ludzi: quasi-identyfikatory
Quasi-identyfikator to pole, które samo w sobie nie jest unikalne, ale w połączeniu staje się identyfikujące. Żadne z poniższych nie jest „nazwiskiem" — a jednak razem wskazują konkretne osoby:
| Kombinacja pozostawiona w danych | Co powoduje | Źródło |
|---|---|---|
| Kod pocztowy + data urodzenia + płeć | Jednoznacznie identyfikuje ~87% populacji USA | Sweeney, 2000 |
| Sama data urodzenia + płeć | Zakodowane w każdym numerze PESEL | Struktura PESEL |
| Rzadkie stanowisko + małe miasto | Często wskazuje jedną osobę | Ryzyko małych grup |
Dowody w źródłach pierwotnych
Motyw 26 RODO
Dane są anonimowe tylko wtedy, gdy osoba jest „niezidentyfikowana lub już niemożliwa do zidentyfikowania" — przy uwzględnieniu wszelkich rozsądnie prawdopodobnych sposobów jej wyodrębnienia. Jeśli ponowna identyfikacja pozostaje rozsądnie możliwa, dane nadal są danymi osobowymi.
Badanie 87%
Latanya Sweeney wykazała, że kombinacja 5-cyfrowego kodu pocztowego, daty urodzenia i płci jednoznacznie identyfikuje około 87% populacji USA — a żadna z tych danych nie jest „nazwiskiem".
Sweeney, L. (2000). Simple Demographics Often Identify People Uniquely. Carnegie Mellon University.
k-anonimowość
Zbiór jest k-anonimowy, gdy każdy rekord jest nieodróżnialny od co najmniej k−1 innych po quasi-identyfikatorach. Gdy k = 1, rekord stoi sam, a osoba jest możliwa do ponownej identyfikacji — usunięcie kolumny z nazwiskiem nie podnosi k.
Sweeney, L. (2002). k-anonymity: a model for protecting privacy.
k-anonimowość w jednym zdaniu
Rekord jest chroniony tylko wtedy, gdy ukrywa się w tłumie: co najmniej k osób ma te same quasi-identyfikatory. Gdy pasuje tylko jedna osoba (k = 1), rekord jest możliwy do ponownej identyfikacji — a usunięcie kolumny z nazwiskiem w żaden sposób nie podnosi k. Prawdziwa anonimizacja to usuwanie lub uogólnianie quasi-identyfikatorów, aż tłum będzie wystarczająco duży, a nie samo wymazywanie oczywistych pól.
Co z tym zrobić
Traktuj quasi-identyfikatory jak cele pierwszej kategorii: datę urodzenia, kod pocztowy, rzadkie stanowiska, pracodawcę oraz identyfikatory strukturalne jak PESEL (który koduje datę urodzenia i płeć w cyfrach). Amaze wykrywa i maskuje dane osobowe — w tym polskie identyfikatory i nazwiska w różnych przypadkach — lokalnie, na Twoim komputerze, więc pola, które faktycznie identyfikują ludzi, nie prześlizgną się.