Mit einer begründeten Änderung beginnen
Ein Experiment braucht eine klare Frage. Eine andere Knopffarbe zu testen, weil sie jemandem besser gefällt, erklärt noch kein wichtiges Kundenproblem. Beginne mit einer Hypothese: Vielleicht brechen Menschen eine Buchung ab, weil der nächste Schritt unklar ist. Daraus entsteht eine Variante, die genau diese vermutete Schwierigkeit gezielt bearbeiten soll.
Halte die spätere Deutung überschaubar. Ganze Entwürfe können verglichen werden. Ändern sich jedoch Text, Aufbau und Angebot gleichzeitig, betrifft das Ergebnis dieses gesamte Paket. Es erklärt nicht, welche einzelne Änderung den Unterschied verursacht hat. Wähle den Umfang passend zur Entscheidung, statt anzunehmen, jedes Experiment müsse genau ein einziges sichtbares Gestaltungsmerkmal verändern.
Das sinnvolle Ergebnis vorab festlegen
Wähle eine Hauptkennzahl, die zum gewünschten Ergebnis passt. Geht es um abgeschlossene Buchungen, sind zusätzliche Klicks möglicherweise nur ein Zwischenschritt. Eine höhere Conversion Rate kann relevant sein. Definiere aber sowohl die gezählte Handlung als auch die betrachtete Gruppe. Unterschiedliche Definitionen können aus derselben Aktivität verschiedene Aussagen und scheinbare Gewinner erzeugen.
Ergänze wenige Kontrollgrößen für unerwünschte Folgen. Mehr Buchungen können beispielsweise mit mehr Absagen oder Rückfragen einhergehen. Bestimme den Sieger nicht nachträglich anhand der freundlichsten Zahl. Vereinbare vor dem Start, was zählt und welche Beobachtung einen scheinbar positiven Effekt trotzdem unbrauchbar machen würde. Die Kennzahlen sollen den Zweck schützen und nicht nur Erfolg darstellen.
Ein Beispiel für Kursbuchungen
Ein fiktives Keramikstudio vergleicht zwei Erklärungen zum Inhalt eines Anfängerkurses. Beide führen zum gleichen Kurs und Preis. Eine Variante nutzt einen kurzen Fließtext, die andere erklärt Vorbereitung und enthaltene Materialien deutlicher. Die Hauptfrage lautet, ob der neue Text geeigneten Besuchern hilft, eine zu ihren Erwartungen passende Buchung tatsächlich abzuschließen.
Das Studio betrachtet außerdem spätere Fragen und Absagen wegen missverstandener Kursinhalte. Diese Auswahl dient der Veranschaulichung und verspricht kein Ergebnis. Entstehen zusätzliche Buchungen durch falsche Erwartungen, wäre der scheinbare Fortschritt für den eigentlichen Zweck wenig hilfreich. Der Versuch soll eine bessere Entscheidung über das Angebot ermöglichen und nicht ausschließlich mehr Klicks belohnen.
Die Zuteilung und Vergleichbarkeit sichern
Zufällige Zuteilung hilft, vergleichbare Gruppen zu schaffen, ohne Menschen nach einer ergebnisrelevanten Vorliebe auszuwählen. Lege fest, was zugeteilt wird: eine Person, ein Konto oder eine andere passende Einheit. Beachte wiederholte Besuche und gemeinsam genutzte Konten. Jede Handlung derselben Person wie einen unabhängigen Teilnehmenden zu behandeln kann die Auswertung verzerren und falsche Sicherheit erzeugen.
Vergleiche möglichst unter denselben Bedingungen, meist im gleichen Zeitraum. Läuft eine Variante diese Woche und die andere nächste Woche, vermischen sich Nachfrage, Kampagnen und andere Ereignisse mit der Änderung. Beeinflussen sich Varianten gegenseitig, etwa durch gemeinsam genutzte Konten, braucht der Versuch möglicherweise einen anderen Aufbau. Für solche Fälle ist eine genauere fachliche Planung sinnvoll.
Die Erfassung vor der Deutung prüfen
Kontrolliere, ob beide Varianten richtig laden und wichtige Ereignisse gleichartig erfasst werden. Ein Messfehler kann wie ein Produktproblem aussehen. Nutze Webanalyse, um Ereignisse zu verstehen, prüfe aber die Datensammlung des Experiments gesondert. Ein allgemeines Dashboard berücksichtigt nicht automatisch Zuteilung, Teilnahmebedingungen oder die Frage, wer die jeweilige Variante wirklich gesehen hat.
Achte auf unerwartete Unterschiede der Gruppengrößen und fehlende Einträge. Dahinter können Aufbau- oder Erfassungsfehler stehen. Erkläre nicht jede Auffälligkeit sofort mit Kundenverhalten. Kläre zuerst die Datenqualität. Sonst liefert eine aufwendige statistische Rechnung womöglich eine sehr genaue Antwort auf einen Vergleich, dessen Grundlage von Anfang an ungeeignet oder fehlerhaft war.
Umfang und Abbruchregeln planen
Es gibt keine allgemeine Zahl an Besuchen oder Tagen, die jeden A/B-Test zuverlässig macht. Die Planung hängt vom bisherigen Ergebnisniveau, der relevanten Veränderung und dem gewählten Auswertungsverfahren ab. Kleine Unterschiede brauchen oft mehr Informationen, als eine kleine Website in sinnvoller Zeit sammeln kann. Prüfe deshalb vorab, ob die Methode überhaupt zu deiner Situation passt.
Beende einen üblichen Test mit fest geplanter Stichprobe nicht beim ersten erfreulichen Zwischenstand nach ständigem Nachschauen. Das verändert seine Fehlereigenschaften. Geeignete sequentielle Verfahren können laufende Entscheidungen ermöglichen, benötigen aber eigene Regeln. Eine defekte Nutzungserfahrung aus dringendem Anlass zu stoppen ist außerdem etwas anderes, als einen Sieger zu erklären. Dokumentiere Anlass und Folgen für die Aussage.
Unsicherheit und praktischen Nutzen gemeinsam betrachten
Berichte die geschätzte Veränderung mit der zur Methode passenden Unsicherheit und nicht nur mit einem Gewinneretikett. Ein statistisch erkennbarer Effekt kann zu klein sein, um zusätzliche Komplexität zu rechtfertigen. Ein offenes Ergebnis beweist umgekehrt keine Gleichheit. Vielleicht reichen die vorhandenen Hinweise schlicht nicht aus, um die für eure Entscheidung wichtigen Unterschiede zu erkennen.
Betrachte Zielgruppe, Geräteverteilung und Zeitraum. Ein positives Ergebnis in einem Umfeld verspricht nicht denselben Effekt überall und dauerhaft. Durchsuche nicht beliebig viele ungeplante Untergruppen, bis eine davon günstig aussieht. Solche Muster können eine neue Frage anregen. Bevor daraus eine sichere Behauptung wird, müssen jedoch die Besonderheiten dieser nachträglichen Suche angemessen berücksichtigt werden.
Mit einer Entscheidung und einem Nachweis abschließen
Halte Hypothese, Varianten, Teilnahmebedingungen, Zuteilung, Kennzahlen, Auswertungsplan, Zeitraum, Unterbrechungen und Schlussfolgerung zusammen fest. Erkläre, ob ihr eine Variante übernehmt, weiter untersucht oder beim bestehenden Ansatz bleibt. Bewahre auch negative und offene Ergebnisse auf. Sie verhindern, dass das Team dieselbe Annahme später ohne neue Hinweise erneut als besonders vielversprechende Idee behandelt.
Bei wenig passender Nutzung kann die Beobachtung eines Prototyps die nächste Frage besser beantworten. Ein A/B-Test ist nützlich, wenn ein fairer Vergleich und ausreichend Informationen möglich sind. Sein Zweck ist eine bessere Entscheidung. Er ist kein notwendiges Gütesiegel, das jeder gestalterischen Vorliebe angehängt werden muss, bevor eine kleine Verbesserung ausprobiert werden darf.
Häufige Fragen
Kann ich eine kleine Website mit einem A/B-Test prüfen?
Möglicherweise. Wenige passende Besuche können es jedoch schwer machen, relevante Unterschiede in sinnvoller Zeit zu erkennen. Bestimme zuerst, welcher Effekt zählt und welche Informationsmenge gebraucht wird. Gespräche oder Aufgabenbeobachtung eignen sich manchmal besser, um das eigentliche Problem zu finden.
Gewinnt automatisch die Variante mit dem höheren Prozentwert?
Nein. Prüfe Datenqualität, Unsicherheit, geplante Auswertung und mögliche Nachteile. Ein roher Unterschied kann durch Zufall oder Aufbaufehler entstehen. Selbst eine verlässliche Verbesserung muss außerdem groß und nützlich genug sein, um die Änderung in eurem konkreten Fall zu rechtfertigen.