AmazeAmaze
← Wróć do bloga

Jak korzystać z AI bez wycieku danych klientów i osobowych

9 min czytania

Możesz bezpiecznie korzystać z ChatGPT, Claude i Gemini z wrażliwymi materiałami, jeśli zanonimizujesz dane osobowe lokalnie zanim trafią do modelu — zamień każde nazwisko, e-mail, numer identyfikacyjny i adres na placeholder na własnym urządzeniu, wykonaj prompt, a potem odtwórz oryginalne wartości w odpowiedzi prywatnym kluczem. Model widzi wyłącznie [PERSON], [EMAIL] i [PESEL], więc nie ma czego wyciekać, przechowywać ani trenować — i żadne dane osobowe nie przekraczają granicy.

Ten jeden ruch — lokalna anonimizacja z odwracalnym odtworzeniem — jest różnicą między wzrostem produktywności a naruszeniem ochrony danych podlegającym zgłoszeniu. To strona-hub naszego klastra o bezpiecznym korzystaniu z AI z danymi wrażliwymi; poniżej wyjaśniamy ryzyko, kto jest narażony, jak dokładnie działa rozwiązanie, i linkujemy do każdego pogłębionego poradnika.

W skrócie (TL;DR)

  • Domyślne ustawienia działają przeciwko Tobie. W kontach konsumenckich OpenAI, Anthropic i Google wykorzystują Twoje rozmowy do trenowania lub ulepszania modeli, dopóki aktywnie się na to nie wypiszesz — a retencja może trwać latami.
  • RODO podąża za danymi. Wklejenie danych klienta do narzędzia AI hostowanego w USA to transfer transgraniczny w rozumieniu rozdziału V RODO i zwykle wymaga podstawy prawnej i zabezpieczeń, których nie masz.
  • Rozwiązaniem jest lokalna anonimizacja. Usuń dane osobowe na własnym komputerze przed wysłaniem promptu; AI pracuje na placeholderach; oryginały odtwarzasz potem prywatnym kluczem.
  • Anonimizuj, nie tylko „uważaj”. Ręczna redakcja przecieka przez metadane, nagłówki i błąd ludzki. Zautomatyzowane maskowanie na urządzeniu jest powtarzalne i audytowalne.
  • Amaze robi to lokalnie — wykrywa imiona i nazwiska, e-maile, telefony, IBAN, loginy/hasła oraz polskie identyfikatory (PESEL, NIP, REGON, KRS), w całości na Twoim urządzeniu, w pełni odwracalnie.

Dlaczego wklejanie danych klienta do ChatGPT, Claude czy Gemini jest ryzykowne?

Nakładają się na siebie trzy rodzaje ryzyka.

1. Dostawcy domyślnie przechowują i trenują na treściach konsumenckich. W planach osobistych (nie-biznesowych) Twoje prompty nie są prywatnym brudnopisem:

  • OpenAI (ChatGPT Free/Plus/Pro): rozmowy są wykorzystywane do ulepszania modeli, dopóki nie wyłączysz opcji „Improve the model for everyone” w Data Controls.
  • Anthropic (Claude Free/Pro/Max): od aktualizacji warunków konsumenckich z sierpnia 2025 czaty i sesje kodowania mogą być używane do trenowania i przechowywane nawet przez pięć lat, o ile się nie wypiszesz.
  • Google (Gemini Apps): aktywność jest domyślnie włączona, rozmowy mogą być przechowywane miesiącami, a recenzenci-ludzie mogą czytać próbki — sprawdzone rozmowy bywają przechowywane nawet do trzech lat, odłączone od konta i nie są usuwane, gdy skasujesz historię.

Plany biznesowe i enterprise (ChatGPT Enterprise/Team, Claude for Work, API) zasadniczo nie trenują domyślnie na Twoich danych — ale większość profesjonalistów wkleja wrażliwy tekst do konsumenckiego okna czatu, nie do zarządzanego konta enterprise.

2. To transfer transgraniczny. Rozdział V RODO (art. 44–46) mówi, że dane osobowe mogą opuścić EOG tylko na podstawie decyzji o adekwatności, odpowiednich zabezpieczeń takich jak standardowe klauzule umowne (SCC), albo wąskiego wyjątku. Wklejenie pliku klienta do modelu hostowanego w USA to transfer. Bez właściwych dokumentów taki transfer jest po prostu niezgodny z prawem — niezależnie od tego, jak dobra była odpowiedź.

3. Poufność i tajemnica zawodowa. Dla zawodów regulowanych problem jest większy niż samo RODO. Prawnicy są związani tajemnicą zawodową; lekarze — tajemnicą lekarską; audytorzy i bankowcy — tajemnicą umowną i ustawową. Podanie identyfikowalnej sprawy klienta do zewnętrznego modelu może samo w sobie naruszyć te obowiązki, jeszcze zanim wkroczy regulator.

Kto jest najbardziej narażony?

Jeśli Twoja praca dotyczy identyfikowalnych informacji o innych osobach, jesteś w grupie ryzyka. Narażenie — i rozwiązanie — wygląda tak:

ZawódCo wyciekaZagrożony obowiązekRozwiązanie: lokalna anonimizacja
PrawnicyNazwiska klientów, akta spraw, kwoty ugódTajemnica zawodowa (adwokacka/radcowska)Maskuj strony i identyfikatory przed pracą z AI
Ochrona zdrowiaNazwiska pacjentów, diagnozy, PESELTajemnica lekarska, dane o zdrowiu (kategoria szczególna)Anonimizuj dane pacjenta przed użyciem AI do notatek czy pism
HRAkta pracowników, wynagrodzenia, notatki dyscyplinarnePrawo pracy + RODOAnonimizuj przed analizą CV lub skarg z pomocą AI
Finanse / księgowośćNIP, IBAN, transakcje, rachunki klientówTajemnica bankowa/skarbowa, RODOUsuń numery kont i ID przed analizą AI
IOD / complianceWszystko, w skali organizacjiRozliczalność (art. 5 ust. 2)Ustal politykę: AI tylko na danych zanonimizowanych, ze śladem audytowym

Na czym polega rozwiązanie? Anonimizuj lokalnie, odtwarzaj kluczem

Niezawodny schemat ma cztery kroki, a najważniejszy szczegół to gdzie dzieje się każdy z nich.

  1. Wykryj dane osobowe na urządzeniu. Lokalne narzędzie skanuje dokument, zbiór danych lub prompt i znajduje identyfikatory — nazwiska, e-maile, telefony, adresy, numery krajowe, numery kont.
  2. Zastąp spójnymi tokenami. Każda wartość staje się placeholderem, a ta sama wartość zawsze mapuje się na ten sam token, dzięki czemu tekst pozostaje spójny, a model nadal potrafi na nim rozumować.
  3. Wyślij do AI zamaskowany tekst. Model dostaje tylko placeholdery. Nie ma żadnych danych osobowych do zalogowania, przechowania czy trenowania.
  4. Odtwórz oryginały lokalnie. Prywatny klucz mapowania — przechowywany wyłącznie na Twoim komputerze — zamienia placeholdery z powrotem na oryginały w odpowiedzi AI.

Przed / po: konkretny przykład

Surowy tekst, którego nigdy nie wolno wkleić w tej postaci:

„Podsumuj spór dotyczący Jana Kowalskiego ([email protected], PESEL 85010212345) w sprawie faktury NIP 521-30-51-000.”

Co faktycznie widzi model:

„Podsumuj spór dotyczący [PERSON] ([EMAIL], [PESEL]) w sprawie faktury [NIP].”

Mapowanie tokenów (Jan Kowalski → [PERSON], [email protected] → [EMAIL], 85010212345 → [PESEL], 521-30-51-000 → [NIP]) zostaje na Twoim urządzeniu. AI zwraca podsumowanie o [PERSON]; odtwarzasz je lokalnie i czytasz prawdziwe nazwiska — dostawca nigdy ich nie zobaczył.

To anonimizacja z perspektywy dostawcy połączona z odwracalnym kluczem z Twojej perspektywy. Warto dokładnie zrozumieć, gdzie to leży między anonimizacją a pseudonimizacją — bo to zmienia Twoje obowiązki wynikające z RODO. Zobacz anonimizacja vs pseudonimizacja.

Anonimizacja na urządzeniu vs w chmurze — czy miejsce maskowania ma znaczenie?

Tak, i to jest sedno całego podejścia. Niektóre narzędzia „do redakcji” wysyłają Twój dokument do swojej chmury, żeby wykryć dane osobowe — co oznacza, że surowe, niezanonimizowane dane opuszczają Twój komputer, zanim zostaną zamaskowane. Właśnie przesunąłeś wyciek o jeden krok w górę.

Anonimizacja na urządzeniu (lokalna) wykonuje wykrywanie i maskowanie na Twoim własnym sprzęcie. Wrażliwy tekst nigdy nie opuszcza budynku. To jedyny wariant, który realnie zmniejsza powierzchnię ataku i chroni przed dodatkowym transferem transgranicznym. Pełne porównanie znajdziesz w anonimizacja PII na urządzeniu vs w chmurze.

Rób / nie rób przy korzystaniu z AI z danymi wrażliwymi

RóbNie rób
Anonimizuj dane osobowe lokalnie przed promptemNie wklejaj surowych danych klienta „z nadzieją”, że dostawca je usunie
Używaj spójnych tokenów, by tekst pozostał użytecznyNie polegaj na ręcznym znajdź-i-zamień (pomija metadane, nagłówki, odmienione nazwiska)
Trzymaj klucz odtwarzający na własnym urządzeniuNie przechowuj mapowania obok danych ani w chmurze
Anonimizuj dokumenty i zbiory danych przed użyciem AINie zakładaj, że skasowanie historii czatu usuwa sprawdzone dane
Sprawdź, czy reszta nie pozwala ponownie zidentyfikować osobyNie traktuj „usunięto nazwisko” jak „zanonimizowano” — kombinacje wciąż identyfikują
Ustal politykę organizacji + ślad audytowy (dla IOD)Nie polegaj na ocenie każdego pracownika przypadek po przypadku

Punkt „kombinacje wciąż identyfikują” łatwo zlekceważyć: kod pocztowy, data urodzenia i stanowisko potrafią wskazać jedną osobę nawet bez nazwiska. To ryzyko ponownej identyfikacji i dlatego maskowanie na poziomie pól musi być dokładne — zobacz ryzyko ponownej identyfikacji.

Anonimizacja dokumentów i zbiorów danych, nie tylko promptów

Ta sama zasada skaluje się poza okno czatu:

  • Dokumenty (Word, PDF, Excel): maskuj nazwiska, ID i kwoty, zachowując formatowanie, aby AI mogło podsumować lub przetłumaczyć umowę, nigdy nie widząc stron.
  • Zbiory danych (CSV, JSON): anonimizuj kolumny z danymi osobowymi, zanim podasz arkusz do analizy AI lub udostępnisz go partnerowi. Czym w ogóle jest „kolumna z PII”? Zacznij od czym są dane osobowe (PII).
  • Identyfikatory strukturalne: numery krajowe (PESEL, NIP, REGON, KRS), IBAN-y, loginy i hasła wymagają wykrywania wzorców, nie tylko listy nazwisk.

Idź głębiej: kompletny klaster

Ta strona-filar linkuje do każdego poradnika w klastrze „bezpieczne korzystanie z AI z danymi wrażliwymi”. Zacznij tutaj, a potem wejdź w ten, który pasuje do Twojej sytuacji:

FAQ

Czy w ogóle mogę korzystać z AI z danymi klientów? Tak — o ile model nigdy nie otrzyma identyfikowalnych danych osobowych. Zanonimizuj je lokalnie, wyślij prompt z placeholderami, odtwórz odpowiedź na swoim urządzeniu. AI pracuje na zanonimizowanym tekście, więc nie ma czego wyciekać.

Czy wypisanie się z trenowania nie wystarczy? Pomaga, ale nie jest strategią zgodności. Opt-out działa per konto, łatwo o nim zapomnieć, nie usuwa danych już wykorzystanych i — co kluczowe — nie cofa transgranicznego transferu ani naruszenia poufności. Niewysyłanie danych osobowych w ogóle jest znacznie silniejsze.

Czy zamaskowane dane to nadal „dane osobowe” w rozumieniu RODO? Z perspektywy dostawcy AI, jeśli widzi on wyłącznie nieodwracalne placeholdery, ta perspektywa jest faktycznie zanonimizowana. Ponieważ zachowujesz klucz odtwarzający, samo mapowanie jest pseudonimizacją i po Twojej stronie pozostaje danymi osobowymi — więc trzymaj klucz chroniony i lokalnie. Zobacz anonimizacja vs pseudonimizacja.

A co z biznesowymi lub enterprise planami AI? Plany enterprise/API zasadniczo nie trenują domyślnie na Twoich danych, co zmniejsza ryzyko trenowania — ale nie znoszą obowiązku poufności ani kwestii transferu transgranicznego, a większość ludzi i tak używa konsumenckich okien czatu. Lokalna anonimizacja chroni Cię niezależnie od planu.

Czy lokalna anonimizacja działa offline? Tak. Ponieważ wykrywanie i maskowanie działają na Twoim urządzeniu, działają przy odłączonej sieci — żaden dokument nie opuszcza komputera podczas przetwarzania.

Korzystaj z AI bezpiecznie — maskuj lokalnie z Amaze

Amaze wykrywa i maskuje dane osobowe w całości na Twoim komputerze, zanim choćby jeden znak trafi do ChatGPT, Claude czy Gemini. Rozpoznaje 13 kategorii od ręki — osoby, firmy, lokalizacje, daty, e-mail, telefon, IBAN, login, hasło oraz polskie identyfikatory PESEL, NIP, REGON i KRS — w tym polskie nazwiska we wszystkich przypadkach gramatycznych. Zamaskuj jednym kliknięciem, pracuj w dowolnym narzędziu AI, a potem odtwórz oryginały lokalnie prywatnym kluczem mapowania. Działa offline, zachowuje formatowanie dokumentów i generuje raport audytowy dla Twojego IOD.

Korzystaj z AI bez wycieku danych klientów — pobierz Amaze na Maca lub Windows i trzymaj wrażliwe dane na swoim komputerze, nie w modelu.