AmazeAmaze

Czy Twoje dane są naprawdę anonimowe?

Usunięcie kolumny z nazwiskiem to nie anonimizacja.

Wydaje się bezpieczne: usuń nazwiska, może adresy e-mail, i udostępnij plik. Ale zgodnie z RODO testem nie jest „czy usunąłem oczywiste identyfikatory?" — lecz „czy tę osobę nadal można wyodrębnić?". Bardzo często odpowiedź brzmi: tak, bo pozostawione szczegóły nadal wskazują jedną osobę. Ta strona wyjaśnia, dlaczego — wraz ze źródłami pierwotnymi.

Test prawny: rozsądnie prawdopodobna identyfikacja

Motyw 26 RODO wyznacza granicę. Dane są anonimowe tylko wtedy, gdy osoba jest niezidentyfikowana lub już niemożliwa do zidentyfikowania, przy uwzględnieniu wszelkich rozsądnie prawdopodobnych sposobów jej wyodrębnienia — przez kogokolwiek, nie tylko przez Ciebie. Jeśli ponowna identyfikacja pozostaje rozsądnie możliwa, dane nadal są danymi osobowymi i RODO nadal obowiązuje, bez względu na to, ile kolumn z nazwiskami usunąłeś.

Dlaczego resztki identyfikują ludzi: quasi-identyfikatory

Quasi-identyfikator to pole, które samo w sobie nie jest unikalne, ale w połączeniu staje się identyfikujące. Żadne z poniższych nie jest „nazwiskiem" — a jednak razem wskazują konkretne osoby:

Kombinacja pozostawiona w danych Co powoduje Źródło
Kod pocztowy + data urodzenia + płeć Jednoznacznie identyfikuje ~87% populacji USA Sweeney, 2000
Sama data urodzenia + płeć Zakodowane w każdym numerze PESEL Struktura PESEL
Rzadkie stanowisko + małe miasto Często wskazuje jedną osobę Ryzyko małych grup

Dowody w źródłach pierwotnych

Motyw 26 RODO

Dane są anonimowe tylko wtedy, gdy osoba jest „niezidentyfikowana lub już niemożliwa do zidentyfikowania" — przy uwzględnieniu wszelkich rozsądnie prawdopodobnych sposobów jej wyodrębnienia. Jeśli ponowna identyfikacja pozostaje rozsądnie możliwa, dane nadal są danymi osobowymi.

Rozporządzenie (UE) 2016/679, motyw 26

Badanie 87%

Latanya Sweeney wykazała, że kombinacja 5-cyfrowego kodu pocztowego, daty urodzenia i płci jednoznacznie identyfikuje około 87% populacji USA — a żadna z tych danych nie jest „nazwiskiem".

Sweeney, L. (2000). Simple Demographics Often Identify People Uniquely. Carnegie Mellon University.

k-anonimowość

Zbiór jest k-anonimowy, gdy każdy rekord jest nieodróżnialny od co najmniej k−1 innych po quasi-identyfikatorach. Gdy k = 1, rekord stoi sam, a osoba jest możliwa do ponownej identyfikacji — usunięcie kolumny z nazwiskiem nie podnosi k.

Sweeney, L. (2002). k-anonymity: a model for protecting privacy.

k-anonimowość w jednym zdaniu

Rekord jest chroniony tylko wtedy, gdy ukrywa się w tłumie: co najmniej k osób ma te same quasi-identyfikatory. Gdy pasuje tylko jedna osoba (k = 1), rekord jest możliwy do ponownej identyfikacji — a usunięcie kolumny z nazwiskiem w żaden sposób nie podnosi k. Prawdziwa anonimizacja to usuwanie lub uogólnianie quasi-identyfikatorów, aż tłum będzie wystarczająco duży, a nie samo wymazywanie oczywistych pól.

Co z tym zrobić

Traktuj quasi-identyfikatory jak cele pierwszej kategorii: datę urodzenia, kod pocztowy, rzadkie stanowiska, pracodawcę oraz identyfikatory strukturalne jak PESEL (który koduje datę urodzenia i płeć w cyfrach). Amaze wykrywa i maskuje dane osobowe — w tym polskie identyfikatory i nazwiska w różnych przypadkach — lokalnie, na Twoim komputerze, więc pola, które faktycznie identyfikują ludzi, nie prześlizgną się.