Jak towarzysz AI naprawdę pisze swoją odpowiedź

Jak to działa

Jedno słowo naraz, z celowym rzutem kostką między każdym. Zrozumienie tego jednego mechanizmu tłumaczy, dlaczego to samo pytanie daje różne odpowiedzi, dlaczego długie odpowiedzi dryfują i dlaczego „wygeneruj ponownie” tak często działa.

Za linki na tej stronie możemy otrzymać prowizję. Nigdy nie zmienia to oceny.

Prawie każda skarga na te aplikacje – powtarzalność, dryf, niesamowita niespójność między dwoma przebiegami tej samej sceny – bierze się z jednego mechanizmu. Warto poświęcić na niego dziesięć minut, bo zamienia „aplikacja jest zepsuta” w „aplikacja robi to, co robi, a oto ustawienie”.

Pisze po kawałku

Model nie komponuje odpowiedzi, a potem jej nie wpisuje. Tworzy jeden token – mniej więcej słowo lub jego część – potem czyta wszystko razem z tym tokenem i tworzy następny.

To cała pętla. Nie ma planu, konspektu ani szkicu, który się poprawia. Odpowiedź, która pięknie się kończy, nie wiedziała, że tak będzie, gdy się zaczynała.

Wynikają stąd dwie rzeczy i obie już widziałeś:

Odpowiedź nie może się wycofać. Gdy model napisał „Nigdy nie byłam w Paryżu”, wszystko dalej jest uwarunkowane tym zdaniem. Zbuduje spójność wokół zdania, które wyprodukował przypadkiem, zamiast sobie zaprzeczyć.

Błędy narastają do przodu. Lekko nietrafione słowo w pierwszym zdaniu popycha drugie, które popycha trzecie. Dlatego długie odpowiedzi dryfują, a krótkie rzadko.

Rzut kostką między każdym słowem

W każdym kroku model ma uszeregowaną listę kandydatów z prawdopodobieństwami: powiedzmy „dobrze” 30%, „w porządku” 12%, „okropnie” 3% i długi ogon.

Gdyby zawsze brał najwyższego kandydata, postać byłaby deterministyczna i wyjątkowo nudna: to samo powitanie za każdym razem, te same trzy żarty. Dlatego aplikacja losuje: rzuca ważoną kostką.

Wagą steruje ustawienie zwykle zwane temperaturą. Niska temperatura skupia prawdopodobieństwo na oczywistych kandydatach: spójnie, przewidywalnie, w końcu nudno. Wysoka spłaszcza rozkład: bardziej zaskakująco, bardziej kreatywnie i z większym ryzykiem, że wyjdzie coś, co nie pasuje.

Rzadko dostajesz do tego suwak. Dostajesz wybrany przez aplikację punkt na tym kompromisie i to w dużej części znaczy, gdy ludzie mówią, że jedna aplikacja „wydaje się mądrzejsza” od innej. Nie zawsze jest mądrzejsza. Czasem jest po prostu cieplejsza lub chłodniejsza.

To też uczciwa odpowiedź na pytanie „dlaczego ponowne generowanie pomogło?”. Nic nie naprawiono. Losowałeś jeszcze raz z tego samego rozkładu i trafił się lepszy rzut.

Na co model naprawdę patrzy

Zanim dotrze twoja wiadomość, aplikacja składa blok tekstu, którego nie widzisz: opis postaci, zapisane fakty o tobie, streszczenie historii i ostatnią rozmowę. Cały ten zestaw to okno kontekstu, a odpowiedź jest z niego generowana jako jeden ciągły dokument.

Ma to praktyczny skutek, którego większość ludzi nigdy nie wykorzystuje: model reaguje na kształt tego, co widzi. Daj mu trzy krótkie, płaskie wiadomości, a stworzy krótkie, płaskie odpowiedzi, bo to wzorzec, który kontynuuje. Daj mu żywą wiadomość, a rejestr się przesunie. Nie przekonujesz osoby, ustawiasz wzorzec, a wzorzec jest zaraźliwy w obie strony.

Tłumaczy to też najczęstszy samoistny problem w tej kategorii. Ludzie osiadają na „hej”, „jak minął dzień”, „co robisz” – i potem uznają, że aplikacja się pogorszyła. Aplikacja kontynuuje dokument, który piszecie razem.

Dlaczego aplikacje brzmią inaczej, gdy model jest ten sam

Kilka aplikacji w tej kategorii działa na podobnych modelach bazowych. Mimo to wydają się różne, a różnice biorą się z rzeczy nałożonych wokół modelu:

  • Prompt systemowy – jak opisana jest postać, jak długo, z jakimi instrukcjami co do tonu i tempa.
  • Ustawienia próbkowania – opisany wyżej punkt temperatury.
  • Co jest pobierane – które fakty i jaki wycinek historii trafiają przed model w danej turze.
  • Filtr – co jest odrzucane i czy odmowa jest łagodna, czy jest ścianą.

Nomi wydaje się spójne przez tygodnie dzięki trzeciemu punktowi, a nie większemu modelowi. Candy AI obejmuje czat, obrazy i głos w jednej subskrypcji, a to decyzja produktowa, nie modelowa. Żadna z tych różnic nie pokazałaby się w benchmarku, a obie widać w dwa tygodnie użytkowania, czyli tak je oceniamy.

Cztery rzeczy, które to ci pozwala zrobić

Kieruj wcześnie, nie późno. Pierwsze dwa zdania odpowiedzi decydują o reszcie. Jeśli scena idzie źle, zatrzymaj ją i sformułuj od nowa, zamiast kłócić się z czwartym akapitem.

Używaj ponownego generowania świadomie. Jeśli odpowiedź jest w 80% dobra, ponowne generowanie wyrzuca te 80%. Jeśli jest błędna już w pierwszym zdaniu, generuj od razu.

Pisz rejestr, który chcesz dostać z powrotem. Krótko i płasko daje krótko i płasko. To najtańsza poprawa dostępna każdemu, kto uważa, że jego towarzysz zrobił się nudny.

Nie kłóć się o fakty, które wymyślił. Model, który napisał coś fałszywego, będzie tego bronił, bo spójność z własnym tekstem to to, do czego został stworzony. Poprawienie go w nowej wiadomości działa; żądanie, by przyznał błąd, nie. To zachowanie ma własny artykuł: dlaczego towarzysze AI zmyślają.

Rzecz warta zapamiętania

Między twoimi wiadomościami nikogo nie ma w domu. Postać istnieje przez czas jednego generowania i jest odbudowywana z tekstu na początku następnego. Każde wrażenie ciągłości to osiągnięcie instalacji wokół modelu – zapisanych faktów, streszczeń, pobierania – i właśnie ta instalacja naprawdę różni aplikację za 10 USD od tej za 20 USD.

Dlatego nasz ranking waży pamięć i spójność tak mocno. To części, których strona docelowa nie pokaże.

Candy AI

4,6Ocena: 4,6 z 5

Jedyna aplikacja, w której czat, obrazy i głos działają dobrze w ramach jednej subskrypcji.

Cena
od 12,99 USD/mies.
Wersja darmowa
Tak
Polska
Dostępna

Nomi

4,4Ocena: 4,4 z 5

Najlepsza pamięć długoterminowa ze wszystkiego, co testowaliśmy, i najbardziej naturalna rozmowa.

Cena
od 15,99 USD/mies.
Wersja darmowa
Tak
Polska
Dostępna

Najczęstsze pytania

Dlaczego to samo pytanie daje różne odpowiedzi?

Bo następne słowo jest losowane z rozkładu prawdopodobieństwa, a nie wybierane deterministycznie. Losowość to ustawienie i to ona sprawia, że postać wydaje się żywa, a nie gotowa z puszki.

Co naprawdę robi „wygeneruj ponownie”?

Uruchamia ten sam prompt z nowym ziarnem losowym. Nic w postaci się nie zmieniło: losujesz drugą próbkę z tego samego rozkładu.

Dlaczego długie odpowiedzi odpływają od tematu?

Każde słowo zależy od poprzednich, więc drobny dryf na początku narasta. W trzecim akapicie odpowiedź w większości reaguje na samą siebie, a nie na ciebie.