Kto czyta twoje czaty z towarzyszem AI? Jak naprawdę działa moderacja

Prywatność i bezpieczeństwo

Większości tego, co piszesz do towarzysza AI, nie czyta żaden człowiek. Część tak, a zasady, kiedy, zwykle są zakopane w polityce prywatności. Oto jak te warstwy do siebie pasują.

Za linki na tej stronie możemy otrzymać prowizję. Nigdy nie zmienia to oceny.

„Moderacja” brzmi jak jedna rzecz. W aplikacjach z towarzyszem to co najmniej cztery, działające z różną prędkością i angażujące różnych ludzi.

Cztery warstwy

Cztery warstwy moderacji w aplikacjach z towarzyszem AI: filtry na każdej wiadomości, automatyczne flagowanie rozmów, przegląd oflagowanych treści przez ludzi oraz wnioski prawne lub organów ścigania

Każda warstwa widzi mniej treści, ale bardziej szczegółowo.

1. Filtry w czasie rzeczywistym. Każda wiadomość, którą wysyłasz, i każda odpowiedź, którą pisze model, może zostać sprawdzona przez automatyczne klasyfikatory, zanim się pojawi. Wychwytują zakazane kategorie: wszystko z udziałem małoletnich, pewne treści przemocowe, sygnały samookaleczenia, i albo blokują wiadomość, łagodzą odpowiedź, albo pokazują ostrzeżenie. Stąd biorą się odmowy i karty kryzysowe. Nasz tekst o filtrach treści wyjaśnia, dlaczego czasem włączają się w środku sceny.

2. Flagowanie na poziomie rozmowy. Osobno systemy mogą oceniać całe rozmowy lub konta pod kątem wzorców: powtarzające się próby obejścia filtra, nękanie, oznaki małoletniego korzystającego z aplikacji dla dorosłych. Flaga to nie kara, tylko notatka, że człowiek może spojrzeć.

3. Przegląd przez ludzi. Pracownicy zespołów zaufania i bezpieczeństwa, często u podwykonawców, przeglądają ułamek oflagowanych rozmów, zgłoszeń użytkowników i odwołań. Niektóre firmy próbkują też zwykłe rozmowy, by sprawdzić jakość lub trenować modele. To warstwa, którą polityki prywatności opisują frazami typu „aby ulepszać nasze usługi” lub „aby egzekwować nasze warunki”.

4. Wnioski prawne. Sądy, policja i regulatorzy mogą żądać danych na podstawie nakazów prawnych. Firmy odpowiadają zgodnie ze swoją polityką i lokalnym prawem.

Co zwykle wywołuje spojrzenie człowieka

WyzwalaczDlaczego
Treści z udziałem małoletnichObowiązek prawny w większości krajów, często zgłaszane dalej
Sygnały samookaleczenia lub samobójstwaProtokoły kryzysowe wymagane dziś prawem w kilku stanach USA
Groźby wobec prawdziwych osóbPotencjalna realna szkoda
Twoje własne zgłoszenie lub prośba do wsparciaPoprosiłeś kogoś, by spojrzał
Powtarzające się próby obejścia filtraEgzekwowanie regulaminu
Losowe próbkowanie jakościUlepszanie produktu, jeśli polityka na to pozwala

Co dodają nowe przepisy

Amerykańskie ustawy o chatbotach towarzyszących, zaczynając od Nowego Jorku w 2025 roku i Kalifornii w 2026 roku, wymagają od aplikacji wykrywania wypowiedzi o myślach samobójczych i samookaleczeniu oraz kierowania użytkowników do służb kryzysowych. Kalifornia wymaga też od firm raportowania o ich protokołach. W praktyce oznacza to więcej automatycznego monitorowania najbardziej wrażliwych rozmów, a nie mniej. Szczegóły w tekście prawo dotyczące towarzyszy AI w USA.

Jak czytać politykę pod tym kątem

Przeszukaj politykę prywatności i regulamin pod kątem:

  • „review”, „moderate”, „human” (przegląd, moderacja, człowiek): czy ludzie czytają rozmowy i dlaczego.
  • „contractors” lub „service providers” (podwykonawcy, dostawcy usług): czy recenzenci pracują dla kogoś innego.
  • „improve”, „train” (ulepszać, trenować): czy zwykłe czaty są próbkowane.
  • „law enforcement”, „legal process”, „court order” (organy ścigania, postępowanie prawne, nakaz sądu): kiedy dane są wydawane i czy wymagany jest nakaz sądu.

Staranna polityka wymienia wyzwalacze i mówi, że recenzenci widzą rozmowy tylko wtedy, gdy to konieczne. Mglista polityka, która pozwala pracownikom na dostęp do „wszystkich treści w dowolnym celu biznesowym”, też ci coś mówi. Nasze cztery kontrole prywatności obejmują resztę dokumentu.

Praktyczne wnioski

  • Pisz tak, jakby recenzent mógł to przeczytać, bo w niewielkiej liczbie przypadków przeczyta.
  • Nie wpisuj w czatach danych identyfikujących inne osoby, zwłaszcza w dosłownych scenach: recenzent czytający oflagowaną rozmowę widzi i je.
  • Jeśli filtr zadziała błędnie w fikcji, notatka poza postacią zwykle to rozwiązuje, a kłótnia w roli może wywołać więcej flag.
  • Jeśli najbardziej zależy ci na tym, kto może czytać twoje czaty, jedyną konfiguracją, w której nie może nikt inny, jest towarzysz działający na twoim własnym komputerze, zobacz uruchamianie towarzysza AI lokalnie.

Moderacja to nie to samo co inwigilacja. W zdecydowanej większości rozmów nic i nikt nie zagląda poza automatyczny filtr. Ale o wyjątkach decyduje polityka, a nie ciepło aplikacji, i warto je znać, zanim będą potrzebne.

Najczęstsze pytania

Czy pracownicy czytają moje czaty z dziewczyną AI?

Zwykle nie rutynowo, ale większość aplikacji zastrzega sobie to prawo. Pracownicy zwykle widzą rozmowy, które oflagowały systemy automatyczne, zostały zgłoszone, dotyczyły prośby do wsparcia albo zostały wybrane do próby w celu ulepszenia produktu. Polityka prywatności powinna mówić, który przypadek obowiązuje.

Co się stanie, jeśli zostanę oflagowany?

Większość flag nie prowadzi do niczego, co zauważysz, albo do zablokowanej wiadomości lub ostrzeżenia. Powtarzające się lub poważne naruszenia mogą prowadzić do zawieszenia konta. Treści z udziałem małoletnich lub realnych gróźb mogą być zgłaszane organom.

Czy policja może dostać moje czaty z towarzyszem AI?

Może o nie poprosić firmę, a firmy wykonują ważne nakazy prawne. Przegląd Mozilli z 2024 roku wykazał, że większość twórców romantycznych chatbotów deklarowała, że może udostępniać dane organom, czasem bez nakazu sądu. Zakładaj, że wszystko, co jest przechowywane, może zostać ujawnione.