VezertVezert
Zurück zu Ressourcen

A/B Testing: wann es sich lohnt, was es kostet und was Sie vorher brauchen

A/B-Testing aus Sicht des Zahlenden: benötigter Traffic, Testdauer, Priorisierung nach Seitentyp und wie sich SEO-Split-Testing in der Praxis unterscheidet.

Aktualisiert November 20, 20269 minLena Tarhonska · Co-founder & CEO at Vezert
A/B Testing: wann es sich lohnt, was es kostet und was Sie vorher brauchen

A/B Testing ist ein Verfahren, bei dem zwei Fassungen einer Seite gleichzeitig ausgespielt werden, der Traffic zwischen ihnen aufgeteilt wird und die Fassung bleibt, die mehr von dem Ergebnis liefert, das zählt.

A/B Testing bedeutet, zwei Fassungen einer Seite gleichzeitig auszuspielen, den Traffic zwischen ihnen aufzuteilen und die zu behalten, die mehr von dem Ergebnis liefert, das Sie interessiert. Die Mechanik ist einfach und oft erklärt. Worüber der Erfolg entscheidet, ist nicht die Mechanik, sondern ob Sie genug Traffic haben, damit die Antwort überhaupt etwas bedeutet.

Die meisten Texte zum Thema stammen von den Firmen, die die Werkzeuge verkaufen, und lassen deshalb die Frage aus, ob Sie überhaupt testen sollten. Dieser beginnt dort, denn für einen großen Teil der Websites lautet die ehrliche Antwort: noch nicht.

Wann sich A/B Testing lohnt und wann nicht

Die Schwelle setzt die Rechnung, nicht die Begeisterung. Um eine realistische Verbesserung zu erkennen, etwa ein Fünftel mehr Conversions, brauchen Sie rund 100 Conversions je Variante, bevor sich das Ergebnis vom Zufall trennt. Das sind 200 Conversions pro Test, und bei 2 % Conversion Rate bedeutet es etwa 10 000 Sitzungen auf der getesteten Seite.

Darunter scheitern Tests nicht laut. Sie liefern einen Gewinner, der Rauschen ist, Sie liefern ihn aus, und der Effekt taucht in den Monatszahlen nie auf. Zwei Runden davon, und das Team schließt daraus, Testen funktioniere nicht, obwohl es das Testen bei dieser Menge war.

Die Rechnung dahinter sollte man einmal gesehen haben, statt sie zu glauben. Der Stichprobenrechner von Evan Miller nimmt Ihre eigene Ausgangsrate und den kleinsten Zuwachs, auf den Sie reagieren würden, und nennt Ihnen die nötigen Besucher je Variante.

Die Zahl, die alles entscheidet

Rund 200 Conversions pro Test, etwa 100 je Variante, bevor sich ein Ergebnis bei realistischer Effektgröße vom Zufall trennt. Bei 2 % Conversion Rate sind das 10 000 Sitzungen auf der getesteten Seite. Wer Ihnen ein Testprogramm verkauft, ohne nach Ihren Sitzungszahlen zu fragen, verkauft Ihnen Münzwürfe.

Was vor dem ersten Test stehen muss

Drei Dinge, jedes in Stunden statt Wochen erledigt. Fehlt eines, entstehen Ergebnisse, mit denen Sie nichts anfangen können, und das ist teurer als gar nicht zu testen, weil die Schlüsse danach ein Jahr lang zitiert werden. Die Zahl in der Hypothese ist das, was ein flaches Ergebnis davor bewahrt, im Rückblick als kleiner Erfolg umgedeutet zu werden. Ohne sie berichtet jedes Team jeden Ausgang als Bestätigung dessen, was es ohnehin vorhatte.

Eine Conversion-Messung, die aus jedem Pfad genau einmal auslöst, von Hand geprüft. Eine Basislinie von mindestens acht Wochen, damit Sie wissen, wie normale Schwankung aussieht. Und eine schriftliche Hypothese mit einer Zahl darin: nicht «ein kürzeres Formular wird besser laufen», sondern «das Formular von neun auf vier Felder zu kürzen hebt die Abschlüsse um mindestens 15 %».

Was Sie zuerst testen, nach Seitentyp

Niemand hat den Traffic, alles zu testen, also zählt die Reihenfolge mehr als die Liste. Die Tabelle unten zeigt, womit wir je Seitentyp beginnen, aus Audits statt aus der Theorie, samt der ungefähren Menge, die für eine saubere Antwort binnen eines Monats nötig ist. Die Sitzungszahlen in der Tabelle gelten für eine Conversion Rate um 2 %. Liegen Sie deutlich darüber, sinken sie entsprechend, und eine Seite mit 5 % braucht knapp die Hälfte. Rechnen Sie mit Ihrer eigenen Rate, bevor Sie einen Test einplanen.

Das Muster dahinter: Der erste Test auf einer Seite sollte ein Weglassen sein, kein Hinzufügen. Weglassen ist schneller gebaut, leichter zu deuten und gewinnt öfter, weil die meisten Seiten mehr tragen, als sie brauchen.

SeitentypErster TestWarum er meist gewinntNötige Sitzungen
FormularseiteZwei Felder entfernenJedes Feld ist eine Entscheidung im Zweifel~4 000/Monat
PreisseiteSpanne statt «Kontakt aufnehmen»Nimmt den Grund zu gehen und zu vergleichen~6 000/Monat
LeistungsseiteBelege neben die AufforderungIm Moment der Frage fehlt der Glaube~5 000/Monat
KategorieseiteFilter auf die drei genutzten kürzenAuswahllähmung, nicht fehlende Funktionen~8 000/Monat
CheckoutGesamtkosten einen Schritt früher zeigenSpäte Kosten sind Abbruchgrund Nummer eins~3 000 Bestellungen/Monat

Wie lange ein Test bei Ihrem Traffic dauert

Teilen Sie die nötigen Sitzungen durch Ihre Wochensitzungen auf dieser Seite und runden Sie auf volle Wochen auf. Auf Wochen, weil Traffic werktags anders läuft als am Wochenende, und ein Abbruch mitten in der Woche das Ergebnis in Richtung der zufällig enthaltenen Tage kippt. Und planen Sie das Ende ein, bevor Sie starten. Ein Test ohne festgelegtes Enddatum läuft, bis jemand ein Ergebnis sehen will, und das ist fast immer der Moment, in dem die Zahlen zufällig günstig aussehen.

Zwei Regeln halten laufende Tests ehrlich. Sehen Sie das Ergebnis nicht vor dem geplanten Ende an, denn Sie werden an einem Hoch stoppen und es Erfolg nennen. Und lassen Sie nicht zwei Tests gleichzeitig auf demselben Pfad laufen, sofern Ihr Werkzeug die Wechselwirkung nicht abbildet.

Wie sich SEO-Split-Testing davon unterscheidet

SEO-Split-Testing beantwortet eine andere Frage und funktioniert anders. Statt Nutzer zu teilen, teilen Sie Seiten: Die Hälfte einer Menge ähnlicher Templates bekommt die Änderung, die andere nicht, und Sie vergleichen den organischen Traffic der Gruppen über mehrere Wochen. In der Praxis heißt das auch, dass die beiden Testarten nicht gegeneinander laufen sollten: Ein Nutzer-Split und ein Seiten-Split auf demselben Template gleichzeitig machen beide Ergebnisse unbrauchbar.

Der Grund ist, dass eine Suchmaschine eine Fassung einer URL sieht und nicht zwei, weshalb eine Aufteilung auf Nutzerebene keinen Ranking-Effekt messen kann. Das entkräftet zugleich die übliche Sorge. Die Dokumentation von Google zum Website-Testing sagt ausdrücklich, dass A/B-Tests bei normaler Umsetzung keine Rankingstrafe nach sich ziehen.

SEO-Tests brauchen mehr Geduld: mindestens vier bis sechs Wochen und wenigstens zwanzig vergleichbare Seiten, bevor der Vergleich trägt.

Was Sie nicht testen sollten und warum Buttonfarben immer wiederkommen

Die Beispiele, die am hartnäckigsten kursieren, sind die fotogenen, und die Buttonfarbe ist das schlimmste davon. Sie hält sich, weil eine berühmte Fallstudie von 2009 einen großen Zuwachs zeigte und weil sie am leichtesten zu ändern ist. In unseren Audits war sie nie der größte Hebel einer Seite. Wer bei knappem Traffic trotzdem Farben testen will, testet in Wahrheit die Geduld des Teams. Nach zwei ergebnislosen Runden wird nicht die Auswahl der Tests hinterfragt, sondern das Testen selbst.

Die Regel, die am meisten Zeit spart: Testen Sie nichts, was Sie ohnehin ausliefern würden. Ist die aktuelle Fassung kaputt, unlesbar oder widerspricht sie der Anzeige, die den Besucher gebracht hat, dann reparieren Sie sie. Ein Test auf einer kaputten Seite misst, welche kaputte Fassung weniger schlecht ist.

Überspringen Sie außerdem alles, was die Zahl bei Ihrer Menge nicht plausibel um ein Fünftel bewegen kann.

Wie Sie das Ergebnis lesen, ohne sich zu täuschen

Ein Test hat drei mögliche Ausgänge, und die meisten Teams planen nur einen davon ein. Ein klarer Gewinner ist der seltene Fall. Ein klarer Verlierer ist tatsächlich nützlich, weil er zeigt, dass die Annahme hinter der Seite falsch ist. Und ein flaches Ergebnis, der häufigste Fall, heißt, die Änderung war für Ihre Menge zu klein, nicht dass die Idee falsch war. Halten Sie außerdem fest, wer die Entscheidung trifft. Ein Ergebnis ohne benannten Entscheider bleibt liegen, und liegen gebliebene Ergebnisse sind der häufigste Grund, warum Testprogramme nach einem halben Jahr einschlafen.

Schreiben Sie die Deutungsregel vor dem Start auf: Welche Zahl gilt als Erfolg, welche als flach, und was tun Sie in jedem Fall. Hinterher zu entscheiden ist der Weg, auf dem ein flaches Ergebnis im Rückblick zum kleinen Erfolg wird.

Die Arbeit der Nielsen Norman Group zu quantitativen Studien behandelt die Stichprobenfrage ausführlicher.

Was am häufigsten schiefgeht

Die Fehler, die wir sehen, wiederholen sich, und keiner davon ist statistischer Natur. Sie betreffen den Ablauf, weshalb ein besseres Werkzeug sie selten behebt.

  • An einem guten Tag früh stoppen, womit aus einem Münzwurf eine Entscheidung wird
  • Etwas so Kleines testen, dass selbst ein echter Effekt bei Ihrer Menge unsichtbar bliebe
  • Zwei Dinge gleichzeitig ändern und lernen, welches Paar gewonnen hat statt welche Änderung
  • Das erwartete Ergebnis nie aufschreiben, sodass jeder Ausgang als Erfolg berichtet wird
  • Über eine Saisonspitze testen und den Schluss auf das restliche Jahr anwenden

«Die Tests, aus denen wir etwas lernen, sind die, bei denen wir aufgeschrieben hatten, was wir erwarten, und danebenlagen.» - Conversion-Verantwortlicher bei Vezert

Was A/B Testing im Betrieb kostet

Das Werkzeug ist der kleinste Posten. Ein brauchbares Testwerkzeug kostet bei den Mengen, die die meisten B2B-Sites haben, zwischen 0 und 200 € im Monat, und die kostenlose Stufe mehrerer Anbieter reicht für einen Test zur Zeit. Der eigentliche Aufwand steckt im Bau und in der Auswertung.

Rechnen Sie mit drei bis acht Stunden je Test für die Umsetzung auf einer normalen Seite, plus einer Stunde, um das Ergebnis sauber zu lesen. Zu Agentursätzen sind das 400 € bis 1 200 € pro Test, und ein Programm mit einem Test im Monat liegt bei etwa 1 000 € bis 2 500 € inklusive Werkzeug und Reporting.

Ein Posten steht nie im Angebot: die Entscheidungszeit. Programme sterben deutlich häufiger an ungelesenen Ergebnissen als an schlechten Werkzeugen.

Womit Sie anfangen

Schafft Ihre wichtigste Seite 10 000 Sitzungen im Monat, beginnen Sie mit dem Weglass-Test aus der Tabelle und schreiben Sie die erwartete Zahl zuerst auf. Schafft sie das nicht, stecken Sie dasselbe Budget in Traffic und nutzen Sie ein systematische Conversion-Optimierung, um die Probleme zu finden, die keinen Test brauchen, um offensichtlich zu sein. Und rechnen Sie damit, dass die ersten drei Tests vor allem den Ablauf klären und nicht die Conversion Rate. Das ist kein verlorener Aufwand, sondern die Voraussetzung dafür, dass die Tests danach etwas bedeuten.

Das meiste, was ein erstes Audit findet, ist ohnehin nicht testbar. Es ist kaputt, und Kaputtes repariert man, statt es zu testen. Unsere Conversion-Optimierung trennt beides, bevor irgendetwas gebaut wird.

Ähnliche Artikel

Entdecke weitere Artikel zu verwandten Themen

Explore All Articles

Häufige Fragen

Antworten auf typische Fragen zu diesem Thema