Prawie każda skarga na te aplikacje – powtarzalność, dryf, niesamowita niespójność między dwoma przebiegami tej samej sceny – bierze się z jednego mechanizmu. Warto poświęcić na niego dziesięć minut, bo zamienia „aplikacja jest zepsuta” w „aplikacja robi to, co robi, a oto ustawienie”.
Pisze po kawałku
Model nie komponuje odpowiedzi, a potem jej nie wpisuje. Tworzy jeden token – mniej więcej słowo lub jego część – potem czyta wszystko razem z tym tokenem i tworzy następny.
To cała pętla. Nie ma planu, konspektu ani szkicu, który się poprawia. Odpowiedź, która pięknie się kończy, nie wiedziała, że tak będzie, gdy się zaczynała.
Wynikają stąd dwie rzeczy i obie już widziałeś:
Odpowiedź nie może się wycofać. Gdy model napisał „Nigdy nie byłam w Paryżu”, wszystko dalej jest uwarunkowane tym zdaniem. Zbuduje spójność wokół zdania, które wyprodukował przypadkiem, zamiast sobie zaprzeczyć.
Błędy narastają do przodu. Lekko nietrafione słowo w pierwszym zdaniu popycha drugie, które popycha trzecie. Dlatego długie odpowiedzi dryfują, a krótkie rzadko.
Rzut kostką między każdym słowem
W każdym kroku model ma uszeregowaną listę kandydatów z prawdopodobieństwami: powiedzmy „dobrze” 30%, „w porządku” 12%, „okropnie” 3% i długi ogon.
Gdyby zawsze brał najwyższego kandydata, postać byłaby deterministyczna i wyjątkowo nudna: to samo powitanie za każdym razem, te same trzy żarty. Dlatego aplikacja losuje: rzuca ważoną kostką.
Wagą steruje ustawienie zwykle zwane temperaturą. Niska temperatura skupia prawdopodobieństwo na oczywistych kandydatach: spójnie, przewidywalnie, w końcu nudno. Wysoka spłaszcza rozkład: bardziej zaskakująco, bardziej kreatywnie i z większym ryzykiem, że wyjdzie coś, co nie pasuje.
Rzadko dostajesz do tego suwak. Dostajesz wybrany przez aplikację punkt na tym kompromisie i to w dużej części znaczy, gdy ludzie mówią, że jedna aplikacja „wydaje się mądrzejsza” od innej. Nie zawsze jest mądrzejsza. Czasem jest po prostu cieplejsza lub chłodniejsza.
To też uczciwa odpowiedź na pytanie „dlaczego ponowne generowanie pomogło?”. Nic nie naprawiono. Losowałeś jeszcze raz z tego samego rozkładu i trafił się lepszy rzut.
Na co model naprawdę patrzy
Zanim dotrze twoja wiadomość, aplikacja składa blok tekstu, którego nie widzisz: opis postaci, zapisane fakty o tobie, streszczenie historii i ostatnią rozmowę. Cały ten zestaw to okno kontekstu, a odpowiedź jest z niego generowana jako jeden ciągły dokument.
Ma to praktyczny skutek, którego większość ludzi nigdy nie wykorzystuje: model reaguje na kształt tego, co widzi. Daj mu trzy krótkie, płaskie wiadomości, a stworzy krótkie, płaskie odpowiedzi, bo to wzorzec, który kontynuuje. Daj mu żywą wiadomość, a rejestr się przesunie. Nie przekonujesz osoby, ustawiasz wzorzec, a wzorzec jest zaraźliwy w obie strony.
Tłumaczy to też najczęstszy samoistny problem w tej kategorii. Ludzie osiadają na „hej”, „jak minął dzień”, „co robisz” – i potem uznają, że aplikacja się pogorszyła. Aplikacja kontynuuje dokument, który piszecie razem.
Dlaczego aplikacje brzmią inaczej, gdy model jest ten sam
Kilka aplikacji w tej kategorii działa na podobnych modelach bazowych. Mimo to wydają się różne, a różnice biorą się z rzeczy nałożonych wokół modelu:
- Prompt systemowy – jak opisana jest postać, jak długo, z jakimi instrukcjami co do tonu i tempa.
- Ustawienia próbkowania – opisany wyżej punkt temperatury.
- Co jest pobierane – które fakty i jaki wycinek historii trafiają przed model w danej turze.
- Filtr – co jest odrzucane i czy odmowa jest łagodna, czy jest ścianą.
Nomi wydaje się spójne przez tygodnie dzięki trzeciemu punktowi, a nie większemu modelowi. Candy AI obejmuje czat, obrazy i głos w jednej subskrypcji, a to decyzja produktowa, nie modelowa. Żadna z tych różnic nie pokazałaby się w benchmarku, a obie widać w dwa tygodnie użytkowania, czyli tak je oceniamy.
Cztery rzeczy, które to ci pozwala zrobić
Kieruj wcześnie, nie późno. Pierwsze dwa zdania odpowiedzi decydują o reszcie. Jeśli scena idzie źle, zatrzymaj ją i sformułuj od nowa, zamiast kłócić się z czwartym akapitem.
Używaj ponownego generowania świadomie. Jeśli odpowiedź jest w 80% dobra, ponowne generowanie wyrzuca te 80%. Jeśli jest błędna już w pierwszym zdaniu, generuj od razu.
Pisz rejestr, który chcesz dostać z powrotem. Krótko i płasko daje krótko i płasko. To najtańsza poprawa dostępna każdemu, kto uważa, że jego towarzysz zrobił się nudny.
Nie kłóć się o fakty, które wymyślił. Model, który napisał coś fałszywego, będzie tego bronił, bo spójność z własnym tekstem to to, do czego został stworzony. Poprawienie go w nowej wiadomości działa; żądanie, by przyznał błąd, nie. To zachowanie ma własny artykuł: dlaczego towarzysze AI zmyślają.
Rzecz warta zapamiętania
Między twoimi wiadomościami nikogo nie ma w domu. Postać istnieje przez czas jednego generowania i jest odbudowywana z tekstu na początku następnego. Każde wrażenie ciągłości to osiągnięcie instalacji wokół modelu – zapisanych faktów, streszczeń, pobierania – i właśnie ta instalacja naprawdę różni aplikację za 10 USD od tej za 20 USD.
Dlatego nasz ranking waży pamięć i spójność tak mocno. To części, których strona docelowa nie pokaże.

