„Moderacja” brzmi jak jedna rzecz. W aplikacjach z towarzyszem to co najmniej cztery, działające z różną prędkością i angażujące różnych ludzi.
Cztery warstwy

Każda warstwa widzi mniej treści, ale bardziej szczegółowo.
1. Filtry w czasie rzeczywistym. Każda wiadomość, którą wysyłasz, i każda odpowiedź, którą pisze model, może zostać sprawdzona przez automatyczne klasyfikatory, zanim się pojawi. Wychwytują zakazane kategorie: wszystko z udziałem małoletnich, pewne treści przemocowe, sygnały samookaleczenia, i albo blokują wiadomość, łagodzą odpowiedź, albo pokazują ostrzeżenie. Stąd biorą się odmowy i karty kryzysowe. Nasz tekst o filtrach treści wyjaśnia, dlaczego czasem włączają się w środku sceny.
2. Flagowanie na poziomie rozmowy. Osobno systemy mogą oceniać całe rozmowy lub konta pod kątem wzorców: powtarzające się próby obejścia filtra, nękanie, oznaki małoletniego korzystającego z aplikacji dla dorosłych. Flaga to nie kara, tylko notatka, że człowiek może spojrzeć.
3. Przegląd przez ludzi. Pracownicy zespołów zaufania i bezpieczeństwa, często u podwykonawców, przeglądają ułamek oflagowanych rozmów, zgłoszeń użytkowników i odwołań. Niektóre firmy próbkują też zwykłe rozmowy, by sprawdzić jakość lub trenować modele. To warstwa, którą polityki prywatności opisują frazami typu „aby ulepszać nasze usługi” lub „aby egzekwować nasze warunki”.
4. Wnioski prawne. Sądy, policja i regulatorzy mogą żądać danych na podstawie nakazów prawnych. Firmy odpowiadają zgodnie ze swoją polityką i lokalnym prawem.
Co zwykle wywołuje spojrzenie człowieka
| Wyzwalacz | Dlaczego |
|---|---|
| Treści z udziałem małoletnich | Obowiązek prawny w większości krajów, często zgłaszane dalej |
| Sygnały samookaleczenia lub samobójstwa | Protokoły kryzysowe wymagane dziś prawem w kilku stanach USA |
| Groźby wobec prawdziwych osób | Potencjalna realna szkoda |
| Twoje własne zgłoszenie lub prośba do wsparcia | Poprosiłeś kogoś, by spojrzał |
| Powtarzające się próby obejścia filtra | Egzekwowanie regulaminu |
| Losowe próbkowanie jakości | Ulepszanie produktu, jeśli polityka na to pozwala |
Co dodają nowe przepisy
Amerykańskie ustawy o chatbotach towarzyszących, zaczynając od Nowego Jorku w 2025 roku i Kalifornii w 2026 roku, wymagają od aplikacji wykrywania wypowiedzi o myślach samobójczych i samookaleczeniu oraz kierowania użytkowników do służb kryzysowych. Kalifornia wymaga też od firm raportowania o ich protokołach. W praktyce oznacza to więcej automatycznego monitorowania najbardziej wrażliwych rozmów, a nie mniej. Szczegóły w tekście prawo dotyczące towarzyszy AI w USA.
Jak czytać politykę pod tym kątem
Przeszukaj politykę prywatności i regulamin pod kątem:
- „review”, „moderate”, „human” (przegląd, moderacja, człowiek): czy ludzie czytają rozmowy i dlaczego.
- „contractors” lub „service providers” (podwykonawcy, dostawcy usług): czy recenzenci pracują dla kogoś innego.
- „improve”, „train” (ulepszać, trenować): czy zwykłe czaty są próbkowane.
- „law enforcement”, „legal process”, „court order” (organy ścigania, postępowanie prawne, nakaz sądu): kiedy dane są wydawane i czy wymagany jest nakaz sądu.
Staranna polityka wymienia wyzwalacze i mówi, że recenzenci widzą rozmowy tylko wtedy, gdy to konieczne. Mglista polityka, która pozwala pracownikom na dostęp do „wszystkich treści w dowolnym celu biznesowym”, też ci coś mówi. Nasze cztery kontrole prywatności obejmują resztę dokumentu.
Praktyczne wnioski
- Pisz tak, jakby recenzent mógł to przeczytać, bo w niewielkiej liczbie przypadków przeczyta.
- Nie wpisuj w czatach danych identyfikujących inne osoby, zwłaszcza w dosłownych scenach: recenzent czytający oflagowaną rozmowę widzi i je.
- Jeśli filtr zadziała błędnie w fikcji, notatka poza postacią zwykle to rozwiązuje, a kłótnia w roli może wywołać więcej flag.
- Jeśli najbardziej zależy ci na tym, kto może czytać twoje czaty, jedyną konfiguracją, w której nie może nikt inny, jest towarzysz działający na twoim własnym komputerze, zobacz uruchamianie towarzysza AI lokalnie.
Moderacja to nie to samo co inwigilacja. W zdecydowanej większości rozmów nic i nikt nie zagląda poza automatyczny filtr. Ale o wyjątkach decyduje polityka, a nie ciepło aplikacji, i warto je znać, zanim będą potrzebne.