So nutzen Sie den A/B-Test Rechner
Der A/B-Test Rechner ermöglicht Ihnen eine fundierte statistische Auswertung Ihrer Split-Tests und Optimierungsexperimente. Ob im E-Commerce, Lead-Marketing oder Produktmanagement – mit diesem Werkzeug überprüfen Sie, ob gemessene Leistungsunterschiede zweier Varianten tatsächlich echt sind oder lediglich auf Zufall beruhen:
- Besucherzahlen eingeben — Tragen Sie die Anzahl der Besucher (Sessions oder Nutzer) für die Kontrollgruppe (Variante A) und die Testgruppe (Variante B) in die entsprechenden Felder ein.
- Conversions erfassen — Geben Sie die Anzahl der erfolgreichen Aktionen (z. B. Käufe, Klicks, Anmeldungen oder Downloads) für beide Varianten ein.
- Signifikanzniveau & Testrichtung festlegen — Wählen Sie das gewünschte Konfidenzniveau (standardmäßig 95 % bzw. $\alpha = 0{,}05$) sowie die zweiseitige oder einseitige Testrichtung.
- Ergebnisse analysieren — Der A/B-Test Rechner berechnet in Echtzeit die Conversion-Rates, die absolute Differenz, den relativen Uplift, den Z-Wert sowie den p-Wert und liefert eine eindeutige Entscheidung zur Nullhypothese.
Formeln & statistische Methodik des A/B-Tests
Der A/B-Test Rechner verwendet standardisierte mathematische Verfahren der schließenden Statistik (Inferenzstatistik), basierend auf dem Z-Test für zwei unabhängige Anteile:
1. Berechnung der Conversion-Rates
Für beide Testgruppen wird zunächst die beobachtete Conversion-Rate ermittelt:
$$p_A = \frac{\text{Conversions}_A}{\text{Besucher}_A} = \frac{c_A}{n_A}, \quad p_B = \frac{\text{Conversions}_B}{\text{Besucher}_B} = \frac{c_B}{n_B}$$
Der relative Uplift (Verbesserungsrate) von Variante B gegenüber Variante A berechnet sich wie folgt:
$$\text{Uplift} = \frac{p_B - p_A}{p_A} \times 100%$$
2. Gepoolter Stichprobenanteil & Standardfehler
Unter der Nullhypothese ($H_0$), dass kein Unterschied zwischen den Varianten existiert ($p_A = p_B$), wird der gepoolte Gesamtanteil $p$ berechnet:
$$p = \frac{c_A + c_B}{n_A + n_B}$$
Der Standardfehler ($SE$) der Differenz zweier unabhängiger Anteile ergibt sich aus:
$$SE = \sqrt{p(1 - p) \left(\frac{1}{n_A} + \frac{1}{n_B}\right)}$$
3. Z-Wert & Signifikanzentscheidung
Die Prüfgröße (Z-Statistik) misst den Abstand zwischen den Conversion-Rates in Einheiten des Standardfehlers:
$$Z = \frac{p_B - p_A}{SE} = \frac{p_B - p_A}{\sqrt{p(1 - p)\left(\frac{1}{n_A} + \frac{1}{n_B}\right)}}$$
Anschließend bestimmt der A/B-Test Rechner anhand der Standardnormalverteilung den p-Wert:
- Bei einem zweiseitigen Test: $p\text{-Wert} = 2 \times (1 - \Phi(|Z|))$
- Ist der $p\text{-Wert} \le \alpha$, wird die Nullhypothese verworfen: Das Ergebnis ist statistisch signifikant.
Praxisbeispiel: Optimierung einer Checkout-Seite
Ein Online-Händler aus Deutschland testet einen vereinfachten Ein-Schritt-Checkout (Variante B) gegen den bestehenden dreistufigen Prozess (Kontrollgruppe A):
- Kontrollgruppe A: $n_A = 10.000\text{ Besucher}$, $c_A = 300\text{ Käufe}$ $\rightarrow p_A = 3{,}00%$
- Testvariante B: $n_B = 10.000\text{ Besucher}$, $c_B = 360\text{ Käufe}$ $\rightarrow p_B = 3{,}60%$
- Relativer Uplift: $+20{,}00%$
- Gepoolter Anteil: $p = \frac{300 + 360}{20.000} = 0{,}033$ (3,30 %)
- Standardfehler: $SE = \sqrt{0{,}033 \times 0{,}967 \times \left(\frac{1}{10.000} + \frac{1}{10.000}\right)} \approx 0{,}002526$
- Z-Wert: $Z = \frac{0{,}036 - 0{,}030}{0{,}002526} \approx 2{,}375$
- p-Wert: $p \approx 0{,}0175$
Da der p-Wert ($0{,}0175$) deutlich unter dem Signifikanzniveau $\alpha = 0{,}05$ liegt, bestätigt der A/B-Test Rechner, dass Variante B statistisch signifikant besser performt. Die Entscheidung für den Rollout ist datengestützt abgesichert.
Typische Fallstricke bei A/B-Tests vermeiden
Um verlässliche Erkenntnisse aus Experimenten zu ziehen, sollten Sie folgende Punkte beachten:
- Peeking vermeiden: Brechen Sie Tests nicht vorzeitig ab, nur weil nach wenigen Tagen ein signifikantes Ergebnis aufblinkt. Zufällige Schwankungen zu Beginn führen sonst zu teuren Fehlentscheidungen.
- Vollständige Wochenzyklen testen: Nutzer verhalten sich am Wochenende oft anders als an Werktagen. Lassen Sie Tests stets mindestens 1 bis 2 volle Wochen laufen.
- Ausreichende Stichprobengröße sichern: Bei geringen Traffic-Zahlen oder minimalen Unterschieden benötigt das Experiment genügend Laufzeit, um statistische Power zu garantieren.
- Nur eine Hypothese pro Test prüfen: Verändern Sie pro Variante möglichst nur ein klares Element, um die Ursache des Uplifts eindeutig zuordnen zu können.
Nutzen Sie den A/B-Test Rechner, um Ihre Hypothesen vor der Implementierung mathematisch zu validieren und den Erfolg Ihrer Optimierungsmaßnahmen transparent nachzuweisen.