AmazeAmaze
← Wróć do bloga

Jak zanonimizować dane, zanim wkleisz je do ChatGPT, Claude i Gemini

7 min czytania

Aby zanonimizować dane dla ChatGPT, Claude czy Gemini, zamień każdą daną osobową — imiona i nazwiska, adresy e-mail, numery telefonów, numery identyfikacyjne — na neutralne znaczniki zanim tekst opuści Twoje urządzenie, a następnie wklej do modelu wersję zredagowaną. Jeśli potrzebujesz prawdziwych wartości z powrotem, zachowaj prywatną tabelę mapowań, aby przywrócić je lokalnie w odpowiedzi. Dobrze zrobione — model nigdy nie zobaczy ani jednego szczegółu pozwalającego na identyfikację.

W skrócie

  • Konsumenckie plany ChatGPT, Claude i Gemini mogą domyślnie wykorzystywać Twoje rozmowy do trenowania modeli — musisz się z tego wypisać, a nawet usunięte czaty bywają przechowywane.
  • Wklejenie danych klienta czy pacjenta do publicznego modelu to ujawnienie ich stronie trzeciej (zwykle też transfer do USA), które wymaga podstawy prawnej z RODO.
  • Rozwiązanie jest proste: usuń dane osobowe lokalnie, przed wklejeniem, np. Jan Kowalski → [OSOBA], 85010212345 → [PESEL].
  • Zachowaj odwracalne mapowanie, aby lokalnie podstawić prawdziwe wartości z powrotem w odpowiedzi modelu.
  • Amaze robi dokładnie to — wykrywa i maskuje dane na urządzeniu, a prywatny klucz pozwala przywrócić oryginały. Twoje dane nigdy nie opuszczają Twojego urządzenia.

Jakie ryzyko niesie wklejanie danych osobowych do chatbota AI?

W chwili, gdy wklejasz umowę, notatkę medyczną albo zgłoszenie klienta do chatbota, ten tekst trafia na serwery, nad którymi nie masz kontroli — a w planach konsumenckich może być przechowywany, przeglądany przez ludzi i wykorzystany do trenowania kolejnego modelu.

  • OpenAI (ChatGPT). Domyślnie treści z planów konsumenckich (Free, Plus, Go, Pro) mogą służyć do ulepszania modeli, chyba że wyłączysz trening w Data Controls. Produkty biznesowe — ChatGPT Team, Enterprise i API — domyślnie nie są wykorzystywane do treningu (OpenAI: jak wykorzystywane są Twoje dane).
  • Anthropic (Claude). Po zmianie zasad obowiązującej od września 2025 czaty i sesje kodowania w planach Free, Pro i Max służą do trenowania Claude, chyba że się wypiszesz — a jeśli wyrazisz zgodę, okres retencji wydłuża się do pięciu lat (wobec 30 dni, gdy odmówisz). Produkty komercyjne (Claude for Work, Government, Education oraz dostęp przez API via Amazon Bedrock czy Google Vertex AI) są z tego wyłączone (Anthropic: aktualizacja warunków konsumenckich).
  • Google (Gemini). Część rozmów jest przeglądana przez ludzi i może być przechowywana nawet do trzech lat, odłączona od Twojego konta — a według stron pomocy samego Google te przejrzane rozmowy nie znikają nawet po usunięciu aktywności (Centrum prywatności aplikacji Gemini).

„Usunięte” nie zawsze znaczy „nie istnieje”. W sporze New York Times przeciwko OpenAI nakaz sądu z maja 2025 zmusił OpenAI do zachowania logów ChatGPT, które normalnie zostałyby usunięte — w tym usuniętych czatów w planach Free, Plus, Pro i Team — wbrew żądaniom usunięcia zgłaszanym przez użytkowników (odpowiedź OpenAI). Obowiązek później zawężono, ale wniosek pozostaje: gdy dane opuszczą Twoje urządzenie, ich cykl życia przestaje zależeć od Ciebie.

To nie teoria. W kwietniu 2023 inżynierowie Samsunga wkleili do ChatGPT firmowy kod źródłowy półprzewodników i notatki z wewnętrznych spotkań; firma w reakcji zakazała używania narzędzi generatywnej AI na swoich urządzeniach (Bloomberg).

Czy zgodnie z RODO można wysyłać dane osobowe do ChatGPT?

Wklejenie danych osobowych do publicznego modelu to ujawnienie ich stronie trzeciej — czynność przetwarzania, która wymaga podstawy prawnej z art. 6 RODO — a ponieważ dostawcy ci mają siedzibę w USA, zwykle jest to również transfer międzynarodowy regulowany przez rozdział V (art. 44–49 RODO). Bez umowy powierzenia i odpowiednich zabezpieczeń transferu trudno to uzasadnić w przypadku danych klientów, pacjentów czy pracowników.

Jest jednak czyste wyjście. Jeśli tekst nie zawiera danych osobowych, większość tych obowiązków odpada, bo zgodnie z motywem 26 RODO przepisy nie mają zastosowania do informacji anonimowych. Usunięcie danych osobowych przed wklejeniem jest więc najprostszą drogą do zgodności. Szersze omówienie tego, kiedy dane naprawdę przestają być osobowe, znajdziesz w tekstach anonimizacja vs pseudonimizacja oraz maskowanie danych vs anonimizacja vs pseudonimizacja. Jeśli pracujesz na materiałach objętych tajemnicą, sięgnij po czy prawnicy mogą używać ChatGPT z danymi klientów?.

Jak zanonimizować dane przed wklejeniem do modelu?

Proces ma cztery kroki, a cała wrażliwa część dzieje się na Twoim komputerze:

  1. Wykryj dane osobowe. Znajdź każde imię i nazwisko, e-mail, numer telefonu, adres i identyfikator w tekście.
  2. Zamaskuj je znacznikami. Zamień każdą wartość na neutralną etykietę, tak by zdanie pozostało czytelne.
  3. Wklej zredagowaną wersję do ChatGPT, Claude lub Gemini i wykonaj swoją pracę.
  4. Przywróć prawdziwe wartości lokalnie w odpowiedzi modelu, korzystając z prywatnego mapowania — tylko jeśli ich potrzebujesz.

Tak wygląda maskowanie na prawdziwym fragmencie:

Przed (nigdy tego nie wklejaj):

Klient Jan Kowalski (PESEL 85010212345, [email protected], +48 512 345 678) kwestionuje fakturę FV/2026/114 dla swojej firmy NIP 521-30-51-000.

Po (można bezpiecznie wkleić):

Klient [OSOBA] (PESEL [PESEL], e-mail [EMAIL], telefon [TELEFON]) kwestionuje fakturę [SPRAWA] dla swojej firmy NIP [NIP].

Pole po polu:

  • Jan Kowalski → [OSOBA]
  • 85010212345 → [PESEL]
  • [email protected] → [EMAIL]
  • +48 512 345 678 → [TELEFON]
  • 521-30-51-000 → [NIP]

Model wciąż może przygotować odpowiedź, streścić spór albo zaproponować sformułowania — po prostu nigdy nie dowiaduje się, kim jest klient.

Redagować ręcznie czy narzędziem?

Można to zrobić ręcznie, ale znajdź-i-zamień to właśnie miejsce, w którym redakcja zawodzi: pomija identyfikatory w nietypowym formacie, przeocza trzecie wystąpienie nazwiska, a w polskim tekście ignoruje odmianę, przez co Kowalskiego i Kowalskim prześlizgują się nawet po tym, jak wyłapiesz Kowalski. Narzędzie stworzone do tego zadania jest pewniejsze.

Ręczne znajdź-i-zamieńLokalne narzędzie do anonimizacji (Amaze)Wklejenie surowych danych do modelu
Gdzie przetwarzane są daneTwoje urządzenieTwoje urządzenieSerwery strony trzeciej
Wyłapuje każde wystąpienieŁatwo przeoczyćAutomatyczniend.
Obsługuje polskie ID (PESEL, NIP, REGON, KRS)Musisz je znaćWbudowanend.
Radzi sobie z odmianą nazwiskZwykle pomijanaTaknd.
Odwracalne (przywrócenie oryginałów)Ręcznie, podatne na błędyPrywatny klucz / mapowaniend.
Ryzyko wobec RODONiskie, jeśli dokładnieNiskieWysokie
SzybkośćWolno, dokument po dokumencieJednym kliknięciemSzybko, ale niebezpiecznie

Jak odzyskać prawdziwe wartości po odpowiedzi AI?

Skorzystaj z odwracalnego mapowania. Podczas maskowania narzędzie zapisuje, że [OSOBA] oznaczała Jan Kowalski, a [PESEL] oznaczał 85010212345, w prywatnym pliku mapowania, który zostaje na Twoim komputerze. Gdy model zwróci odpowiedź pełną znaczników [OSOBA] i [EMAIL], uruchamiasz krok odwrotny lokalnie, a prawdziwe wartości wracają na swoje miejsce — dostawca AI nigdy ich nie dotknął.

Ta praca w obie strony to różnica między pseudonimizacją (odwracalną, z chronionym kluczem przechowywanym osobno) a nieodwracalną anonimizacją. Obie trzymają identyfikatory z dala od modelu; mapowanie pozwala jedynie dokończyć pracę po Twojej stronie. Pamiętaj tylko, że spójne znaczniki wciąż mogą umożliwić ponowną identyfikację, jeśli rekord jest wystarczająco unikalny na podstawie pozostałych pól — maskuj więc dokładnie, nie tylko oczywiste nazwisko.

Które typy danych zawsze maskować?

Co najmniej wszystko, co identyfikuje osobę wprost lub w połączeniu z innymi polami. Amaze wykrywa 13 kategorii od pierwszego uruchomienia: osoby, firmy, lokalizacje, daty, e-mail, telefon, PESEL, NIP, REGON, KRS, IBAN, loginy i hasła — czyli dane, które realnie pojawiają się w dokumentach prawnych, medycznych i obsługi klienta w Europie.

FAQ

Czy ChatGPT trenuje się na tym, co wklejam? W planach konsumenckich (Free, Plus, Go, Pro) może, chyba że wyłączysz trening modelu w Data Controls. ChatGPT Team, Enterprise i API domyślnie nie są wykorzystywane do treningu. Najbezpieczniej założyć, że każdy publiczny chatbot może zapisać i przejrzeć dane wejściowe — dlatego redaguj najpierw.

Czy wystarczy wyłączyć historię czatów albo trening? Ogranicza to ryzyko, ale go nie eliminuje. Dane wciąż mogą być przesłane i tymczasowo przechowane, może dojść do przeglądu przez człowieka, a — jak pokazał nakaz zabezpieczenia w sprawie NYT przeciwko OpenAI — obowiązek prawny może unieważnić usunięcie. Usunięcie danych osobowych, zanim opuszczą urządzenie, to jedyna kontrola, która nie zależy od ustawień dostawcy.

Czy dane dla Claude i Gemini anonimizuję tak samo? Tak. Schemat „zamaskuj, potem wklej” jest niezależny od dostawcy — działa identycznie dla ChatGPT, Claude, Gemini czy dowolnego innego modelu, bo ochrona odbywa się na Twoim komputerze, zanim wkleisz.

Czy zamaskowane dane to nadal dane osobowe w rozumieniu RODO? Jeśli mapowanie zostanie zniszczone i nic w pozostałym tekście nie pozwala zidentyfikować osoby, dane są anonimowe i poza zakresem RODO (motyw 26). Jeśli zachowasz odwracalny klucz, to pseudonimizacja i dane pozostają osobowe (art. 4 pkt 5) — wciąż znacznie bezpieczniej niż wklejanie surowych identyfikatorów.

Anonimizuj lokalnie z Amaze

Amaze wykrywa i maskuje dane osobowe — w tym PESEL, NIP, REGON, KRS, IBAN oraz polskie imiona i nazwiska w odmianie — w całości na Twoim komputerze, zanim jakikolwiek tekst trafi do ChatGPT, Claude czy Gemini. Zamaskuj jednym kliknięciem, pracuj w dowolnym narzędziu AI, a potem przywróć oryginały lokalnie swoim prywatnym kluczem. Działa nawet w pełni offline (tryb air-gap), więc podczas przetwarzania dokumentu nie ma żadnego połączenia wychodzącego. Wklejaj spokojnie — Twoje dane nigdy nie opuszczają Twojego urządzenia.

Zobacz cały obieg pracy: Zanim wkleisz — bezpieczny obieg pracy z AI rozkłada pętlę anonimizuj → użyj → przywróć na trzy kroki wraz z diagramem.

Część przewodnika: jak korzystać z AI bez wycieku danych klientów.