Zacznij od zmiany mającej uzasadnienie

Eksperyment potrzebuje jasnego pytania. Inny kolor przycisku wybrany według gustu może dać wynik, ale nie wyjaśnić istotnego problemu klienta. Zacznij od hipotezy dotyczącej przyczyny: być może ludzie porzucają rezerwację, bo nie rozumieją następnego kroku. Następnie przygotuj wariant odpowiadający na to przypuszczenie, aby porównanie wspierało rzeczywistą decyzję o sposobie obsługi.

Zadbaj o możliwość interpretacji. Można porównywać całe projekty, lecz jeśli jednocześnie zmieniają się tekst, układ i oferta, wynik dotyczy całego pakietu. Nie powie, który szczegół spowodował różnicę. Dobierz zakres do decyzji, zamiast przyjmować, że każdy test musi zmieniać dokładnie jeden wizualny element. Ważna jest jasność tego, czego próbujesz się dowiedzieć.

Ustal użyteczny wynik przed startem

Wybierz główny miernik odpowiadający celowi. Jeśli chodzi o ukończone rezerwacje, dodatkowe kliknięcia mogą być tylko sygnałem pośrednim. Wyższy współczynnik konwersji bywa przydatny, ale zdefiniuj zarówno liczoną czynność, jak i grupę uwzględnianą w mianowniku. Inne definicje potrafią dać odmienne odpowiedzi na podstawie tej samej aktywności użytkowników w badanej usłudze.

Dodaj kilka wskaźników ostrzegających o niepożądanych skutkach. Większej liczbie rezerwacji mogą towarzyszyć dodatkowe rezygnacje lub prośby o pomoc. Nie wybieraj zwycięzcy dopiero po zakończeniu według najkorzystniejszej liczby. Uzgodnij wcześniej, co ma znaczenie i co sprawi, że pozornie pozytywny wynik okaże się nieodpowiedni dla firmy albo dla osób korzystających z oferty.

Przykład zapisów na zajęcia

Wyobraź sobie fikcyjną pracownię ceramiczną porównującą dwa opisy kursu dla początkujących. Oba prowadzą do tego samego kursu w tej samej cenie. Jeden używa krótkiego akapitu, drugi jaśniej przedstawia przygotowanie i dostępne materiały. Główne pytanie dotyczy tego, czy poprawiony opis pomaga właściwym odwiedzającym ukończyć rezerwację odpowiadającą ich potrzebom i oczekiwaniom wobec zajęć.

Pracownia obserwuje także późniejsze pytania i rezygnacje związane z niezrozumieniem zakresu kursu. To poglądowe wybory, a nie obiecane rezultaty. Jeżeli tekst zwiększa zapisy przez tworzenie mylnego oczekiwania, pozorna poprawa nie służy celowi. Eksperyment ma wspierać decyzję o dobrej usłudze, a nie nagradzać same kliknięcia niezależnie od dalszych konsekwencji dla uczestnika.

Zadbaj o przydział i porównywalność

Losowy przydział pomaga tworzyć porównywalne grupy bez wybierania osób według preferencji związanej z wynikiem. Ustal jednostkę przydziału: człowieka, konto albo inny odpowiedni obiekt. Uwzględnij powroty i współdzielone konta. Traktowanie każdego działania tej samej osoby jako niezależnego uczestnika może zniekształcić analizę i dać większą pozorną pewność, niż rzeczywiście wynika z informacji.

Porównuj w podobnych warunkach, zwykle w tym samym okresie. Pokazanie jednej wersji w tym tygodniu, a drugiej w następnym miesza zmianę projektu z popytem, kampaniami i wydarzeniami. Jeśli warianty wpływają na siebie, na przykład przez wspólne konto współpracowników, potrzebny może być inny plan badania. Taka sytuacja wymaga dokładniejszego przygotowania i odpowiedniej wiedzy.

Sprawdź pomiar przed interpretacją

Przetestuj poprawne ładowanie obu wersji i spójne zapisywanie ważnych zdarzeń. Błąd pomiaru potrafi wyglądać jak wada produktu. Analityka internetowa pomaga rozumieć definicje zdarzeń, ale osobno sprawdź zbieranie danych eksperymentu. Ogólny panel nie musi poprawnie uwzględniać przydziału, warunków udziału ani tego, które osoby naprawdę zobaczyły dany wariant podczas wizyty na stronie.

Zwróć uwagę na nieoczekiwane różnice wielkości grup i brakujące wpisy. Mogą wskazywać problem konfiguracji lub zapisu. Nie tłumacz od razu każdej anomalii zachowaniem klientów. Najpierw wyjaśnij jakość danych. Inaczej rozbudowane obliczenie statystyczne może dostarczyć bardzo precyzyjnej odpowiedzi dla porównania, które od początku nie miało prawidłowej podstawy i nie odpowiadało zaplanowanemu eksperymentowi.

Zaplanuj próbę i zasady zakończenia

Nie ma uniwersalnej liczby wizyt ani dni zapewniającej wiarygodność każdego testu. Plan zależy od obecnej częstości wyniku, zmiany wartej wykrycia i wybranej analizy. Małe różnice często wymagają więcej informacji, niż niewielka strona zbierze w użytecznym czasie. Zanim uruchomisz porównanie, oceń, czy metoda w ogóle pasuje do twojego ruchu i pytania.

Nie kończ zwykłego testu o ustalonej próbie przy pierwszym atrakcyjnym wyniku po ciągłym podglądaniu. Zmienia to jego właściwości dotyczące błędów. Odpowiednie metody sekwencyjne pozwalają planować bieżące decyzje, ale wymagają własnych reguł. Pilne przerwanie zepsutego doświadczenia różni się też od ogłoszenia zwycięzcy. Zapisz przyczynę takiego działania i wpływ na możliwy wniosek.

Połącz niepewność z praktycznym znaczeniem

Przedstaw szacowaną różnicę wraz z niepewnością odpowiednią do analizy, zamiast ograniczać się do etykiety wygranej. Efekt wykrywalny statystycznie może być zbyt mały, by uzasadnić dodatkową złożoność. Wynik nierozstrzygający nie dowodzi identyczności wersji. Może oznaczać, że dostępny materiał nie pozwala odróżnić efektów, które są istotne dla decyzji stojącej przed zespołem.

Uwzględnij odbiorców, urządzenia i okres badania. Sukces w jednych warunkach nie obiecuje tego samego wszędzie i zawsze. Nie przeszukuj wielu nieplanowanych podgrup, aż jedna wypadnie korzystnie. Takie wzorce mogą podsunąć nowe pytanie. Wymagają jednak odpowiedniej analizy, zanim staną się podstawą pewnego twierdzenia o tym, komu dana wersja pomaga lub przeszkadza.

Zakończ decyzją i zapisem

Zachowaj hipotezę, wersje, warunki udziału, przydział, mierniki, plan analizy, daty, przerwy i wniosek. Wyjaśnij, czy wdrażasz wariant, badasz dalej, czy zostajesz przy obecnym rozwiązaniu. Zapisz też rezultat negatywny i nierozstrzygający. Może zapobiec ponownemu traktowaniu tego samego założenia jako obiecującego pomysłu, chociaż zespół nie zdobył od tamtej pory nowych informacji.

Przy małej liczbie odpowiednich użytkowników obserwacja pracy z prototypem może lepiej odpowiedzieć na następne pytanie. Test A/B ma wartość, gdy możliwe są uczciwe porównanie i dostateczna ilość danych. Jego celem jest poprawa decyzji, a nie nadanie naukowego brzmienia każdej preferencji projektowej, zanim ktokolwiek odważy się uprościć mały element obsługi.

Częste pytania

Czy test A/B ma sens na małej stronie?

Czasem tak, ale mały ruch może utrudnić wykrycie użytecznych różnic w rozsądnym okresie. Określ efekt, który ma znaczenie, i potrzebną ilość informacji. Rozmowy lub obserwacja zadania mogą lepiej pomóc znaleźć problem, zanim większy eksperyment stanie się praktyczny.

Czy wygrywa wersja z wyższym procentem?

Nie automatycznie. Sprawdź jakość danych, niepewność, planowaną analizę i możliwe skutki uboczne. Surowa różnica może wynikać z przypadku albo błędu konfiguracji. Nawet wiarygodna poprawa musi być dostatecznie duża i użyteczna, aby uzasadnić zmianę w twojej sytuacji.

Źródła i dalsza lektura