Ludzie zakładają, że aplikacja z towarzyszem AI to jedna inteligencja, która potrafi mówić, rysować i mówić. To trzy lub cztery osobne systemy połączone przez aplikację, a większość frustracji w tej części produktu bierze się ze szwów między nimi.
Trzy silniki, jeden interfejs
Model językowy obsługuje rozmowę. Tworzy tekst i nic więcej.
Model obrazów to zupełnie inny system, zwykle model dyfuzyjny. Dostaje opis tekstowy i tworzy obraz. Nigdy nie widział twojej rozmowy.
System mowy zamienia tekst na dźwięk. Też osobny, też ślepy na wszystko poza zdaniem, które mu przekazano.
Kiedy prosisz towarzyszkę o selfie, dzieje się tak: model językowy pisze krótki opis żądanego obrazu, aplikacja dodaje zapisane tagi wyglądu postaci, ten połączony prompt trafia do modelu obrazów i wraca obraz. Czat reaguje potem na obraz, którego nie widzi, na podstawie opisu, który sam napisał.
Ten przekaźnik jest źródłem niemal każdej skargi na multimedia w tej kategorii.
Dlaczego twarz ciągle się zmienia
Bo model dyfuzyjny nie wyszukuje twojej postaci, tylko generuje kogoś pasującego do opisu. „Długie ciemne włosy, zielone oczy, około dwudziestu pięciu lat” opisuje miliony twarzy i za każdym razem dostajesz inną.
Aplikacje rozwiązują to w różnym stopniu:
- Zapisane tagi wyglądu: ten sam opisowy ciąg za każdym razem. Tanio i tylko z grubsza spójnie.
- Obraz wzorcowy warunkujący każde generowanie. Znacznie lepiej, i zwykle tak działają aplikacje, w których twarze pozostają rozpoznawalne.
- Dostrojony model dla każdej postaci: najbardziej spójne i zdecydowanie najdroższe, więc zwykle tylko w wyższych planach.
To realna różnica warta sprawdzenia w wersji darmowej przed zapłatą. Wygeneruj cztery obrazy tej samej postaci w różnych sytuacjach. Jeśli dostaniesz cztery różne kobiety, żadna subskrypcja tego nie naprawi. Spójność postaci między obrazami to duża część powodu, dla którego Candy AI prowadzi w naszym rankingu i dla którego dobrze wypada Secret Desires, która buduje wygląd, głos i osobowość razem i dodaje krótkie wideo.
Dlaczego multimedia są zawsze limitowane
Tekst jest tani. Wygenerowanie odpowiedzi na czacie kosztuje operatora ułamek centa.
Obraz kosztuje wyraźnie więcej za jedno generowanie. Głos jest rozliczany za sekundę dźwięku. Wideo jest dramatycznie droższe niż jedno i drugie.
Ta różnica kosztów to cała przyczyna struktury cen, którą widzisz w tej kategorii: hojne limity wiadomości, ciasne limity obrazów, minuty głosu sprzedawane osobno, wideo zarezerwowane dla wyższych planów. To nie sztuczny niedobór, który ma cię skłonić do dopłaty; to faktyczny kształt rachunku, jaki dostaje operator, przerzucony dalej.
Dlatego „bez limitu” na tym rynku prawie zawsze oznacza bez limitu tekstu. Przeczytaj to tak, a strony z cennikami nagle mają sens. Rachunek jest w ile naprawdę kosztuje generowanie obrazów.
Co dodaje głos i ile kosztuje
Głos zmienia doświadczenie bardziej, niż większość ludzi się spodziewa. Czytanie wiadomości i jej słyszenie to dwie różne rzeczy, a różnica jest większa, niż sugeruje opis techniczny.
Dwie rzeczy do sprawdzenia przed zapłatą:
Opóźnienie. Trzysekundowa pauza przed każdą odpowiedzią całkiem psuje iluzję. Sprawdź to w wersji darmowej lub próbnej, a nie na filmie demo.
Czy to rozmowa, czy wiadomość. Notatki głosowe, w których postać czyta odpowiedź na głos, są częste i tanie. Rozmowy w czasie rzeczywistym, w których mówisz, a ona odpowiada, to inny produkt i zwykle inny plan. Nomi wymienia rozmowy głosowe wśród funkcji; wiele aplikacji pisze „głos”, a ma na myśli notatki.
Czego obrazy nie zrobią
Dwa ograniczenia, które warto znać, zanim się rozczarujesz:
Dłonie, tekst i drobne detale pozostają zawodne w każdym generatorze w tej kategorii. Nikt tego nie rozwiązał, a aplikacja obiecująca inaczej opisuje swój najlepszy wynik, a nie przeciętny.
Obraz nie zna twojej sceny. Model czatu pisze jednozdaniowy prompt, więc wszystko, czego w nim nie ma, przepada: pokój, który opisałeś, w co była ubrana trzy wiadomości temu, pora dnia. Jasne sformułowanie prośby naprawia więcej niż jakiekolwiek ustawienie.
Jak ocenić stronę multimedialną w jeden wieczór
Wykorzystaj cały limit wersji darmowej w jednej sesji, a nie po jednym obrazie dziennie. Testujesz cztery rzeczy:
- Spójność: cztery obrazy, ta sama postać, różne sytuacje.
- Wierność promptowi: poproś o coś konkretnego i zobacz, ile przetrwa.
- Opóźnienie: i dla obrazów, i dla głosu.
- Co wlicza się do limitu: czy nieudane lub odrzucone generowanie też cię kosztuje.
Ostatnia rzecz jest najsłabiej opisana i najbardziej irytująca do odkrycia po zapłacie. Razem z resztą tego, co naprawdę zawierają wersje darmowe, to coś, co wychodzi dopiero wtedy, gdy używasz produktu porządnie.

