Kostenloser Rechner

A/B-Test Signifikanz berechnen: Ist dein Ergebnis echt?

Prüfe, ob der Unterschied zwischen Original und Variante statistisch signifikant ist. Klassisch per z-Test und bayesianisch als Wahrscheinlichkeit, dass die Variante besser ist.

Von Chris Dengler · die Formeln, mit denen wir bei Convertlab arbeiten

Dein Ergebnis erscheint hier

Gib deine Zahlen ein und klicke auf „Jetzt berechnen“.

Chris Dengler
Chris Dengler

Gründer von Convertlab

„Für mich entscheidet nicht die Meinung, sondern die Statistik. Nur weil eine Variante kurzfristig besser aussieht, heißt das noch nicht, dass sie wirklich überlegen ist.“

1.000+

A/B-Tests

€15M+

Mehrumsatz

5x

ROI-Garantie

Warum das wichtig ist

Nicht die Meinung entscheidet, sondern die Statistik

Nach ein paar Tagen sieht eine Variante oft wie der klare Gewinner aus. Ohne ausreichende Datenbasis schwanken Ergebnisse aber stark. Wer zu früh entscheidet, setzt Zufallstreffer live, die später Umsatz kosten.

Wir werten Tests bei Convertlab bayesianisch aus: Die Wahrscheinlichkeit, dass B besser ist als A, lässt sich direkt in eine Business-Entscheidung übersetzen. Der Rechner zeigt dir zusätzlich den klassischen p-Wert.

Und ein Test ohne Gewinner ist kein verlorener Test: Ein signifikanter Downlift zeigt klar, welche Annahme nicht stimmt. Daraus entstehen bessere Hypothesen.

Formel

z-Test für zwei Anteile

z = (CR_B − CR_A) ÷ √( p̄ · (1 − p̄) · (1/n_A + 1/n_B) )

p̄ = gepoolte Conversion Rate beider Gruppen. Der p-Wert ist zweiseitig.

Bayesianisch

P(B > A) mit Beta-Verteilung je Variante

Zeigt direkt, wie wahrscheinlich die Variante besser ist. So werten wir bei Convertlab aus.

So nutzt du das Ergebnis
  1. 1Lege Haupt-KPI und Laufzeit vor dem Start fest, nicht erst, wenn das Ergebnis gut aussieht.
  2. 2Lass Tests mindestens zwei volle Wochen laufen, damit Wochentags-Effekte ausgeglichen sind.
  3. 3Ein signifikanter Uplift mit sehr wenigen Conversions ist fragil: Schau auf die absolute Datenbasis.
FAQ

Häufige Fragen

Ab wann ist ein A/B-Test signifikant?

Üblich ist ein Signifikanzniveau von 95 %: Der p-Wert liegt dann unter 0,05. Das heißt, ein so großer Unterschied wäre ohne echten Effekt nur in weniger als 5 % der Fälle zufällig entstanden.

Was ist der Unterschied zwischen frequentistischer und bayesianischer Auswertung?

Frequentistisch fragt: Wie wahrscheinlich ist dieses Ergebnis, wenn es keinen Unterschied gibt? Bayesianisch fragt: Wie wahrscheinlich ist es, dass B besser ist als A? Beide sind valide; die bayesianische Sicht ist für Business-Entscheidungen oft leichter zu interpretieren.

Wie berechnet man den p-Wert eines A/B-Tests?

Aus den Conversion Rates beider Varianten und der gepoolten Conversion Rate wird der z-Wert berechnet; der p-Wert ist die Wahrscheinlichkeit, einen mindestens so großen Unterschied rein zufällig zu sehen. Der Rechner oben macht das automatisch und zweiseitig.

Darf ich einen Test stoppen, sobald er signifikant ist?

Besser nicht. Wer laufend auf Signifikanz schaut und beim ersten grünen Ergebnis stoppt, erhöht die Fehlerquote deutlich. Plane die Stichprobe vorab und werte zum geplanten Zeitpunkt aus.

Was mache ich mit einem nicht signifikanten Test?

Prüfe Trends in sekundären Kennzahlen wie Funnel-Schritten. Ist die Hypothese stark, iteriere die Variante oder teste in dieselbe Richtung weiter. Auch ein Ergebnis ohne Gewinner liefert Erkenntnisse.

Unsicher, ob deine Tests valide sind?

Wir prüfen Setup, Targeting und Auswertung deiner A/B-Tests im kostenlosen Erstgespräch.

Chris Dengler

Chris Dengler

Gründer, Convertlab