Bayesianische Statistik im A/B-Testing: Einfach erklärt

Gründer, Convertlab
17 Min. Lesezeit
Bayesianische Statistik im A/B-Testing: Einfach erklärt

Kurz zusammengefasst

  • ▶Bayesianische Statistik macht A/B-Test-Ergebnisse direkt interpretierbar. Statt abstrakter p-Werte liefert sie Wahrscheinlichkeiten: „Variante B ist mit 96 Prozent Wahrscheinlichkeit besser.“ Das ist die Aussage, die du als Entscheider brauchst.
  • ▶Frequentistische Methoden sind nicht falsch, aber weniger praxisnah. Der klassische Ansatz beantwortet eine andere Frage als die, die du stellen willst. Bayesianische Statistik passt besser zu realen Business-Entscheidungen.
  • ▶Statistische Sicherheit ist nicht verhandelbar. Nur weil eine Variante kurzfristig besser aussieht, heißt das nicht, dass sie tatsächlich überlegen ist. Ohne ausreichende Datenbasis sind Ergebnisse nicht belastbar.
  • ▶Die Testdauer bestimmst du nicht am Kalender, sondern an den Daten. Starre Laufzeiten sind wenig sinnvoll. Entscheidend ist die Stichprobengröße und die Stärke des gemessenen Effekts.
  • ▶Seriöses A/B-Testing ist kein Marketing-Buzzword. Es ist ein datengetriebener Prozess mit sauberer Methodik. Statistik entscheidet, nicht Bauchgefühl.

Warum Statistik im A/B-Testing nicht optional ist

Ich sehe auf Social Media regelmäßig Aussagen wie „Dieses eine Element hat 20 Prozent mehr Conversion gebracht.“ Ohne Kontext. Ohne Stichprobengröße. Ohne statistische Sicherheit.

Aus meiner Erfahrung sind solche Aussagen oft nicht belastbar. Für mich ist seriöses A/B-Testing ein datengetriebener Prozess mit sauberer Methodik, kein Marketing-Buzzword.

Das Thema Statistik im A/B-Testing schreckt viele ab. Es klingt nach Uni, nach Formeln, nach Komplexität. Aber es ist die Grundlage dafür, dass du mit deinen Tests tatsächlich bessere Entscheidungen triffst und nicht nur denkst, dass du es tust.

In über 1.000 A/B-Tests habe ich gelernt: Die statistische Auswertung entscheidet darüber, ob ein Testergebnis eine echte Erkenntnis ist oder eine zufällige Schwankung. Und dieser Unterschied kostet oder bringt reales Geld.

Mein Zugang zum Thema ist nicht rein akademisch. Meine Masterarbeit am Lehrstuhl für Marketing an der FAU Erlangen-Nürnberg beschäftigte sich mit statistischen A/B-Tests, konkret mit der Frage, wie ein Aufruf zum Blutspenden gestaltet sein muss, um möglichst viele Menschen zur Handlung zu motivieren. Die Verbindung aus Hypothesenbildung und messbarer Validierung fasziniert mich seitdem.

Das Problem: „Das sieht besser aus“ ist keine Auswertung

Bevor wir in die Methodik einsteigen, möchte ich ein grundlegendes Missverständnis ausräumen, das ich in der Praxis ständig sehe.

Statistische Signifikanz bedeutet, dass ein gemessener Unterschied mit hoher Wahrscheinlichkeit nicht zufällig entstanden ist, sondern tatsächlich durch die getestete Veränderung verursacht wurde. Nur weil eine Variante kurzfristig besser aussieht oder höhere Werte zeigt, heißt das noch nicht, dass sie wirklich überlegen ist. Ohne ausreichende Datenbasis können Ergebnisse stark schwanken.

Ein Beispiel: Dein Test läuft seit drei Tagen. Variante B hat eine Conversion Rate von 3,8 Prozent, die Kontrolle liegt bei 3,2 Prozent. Das sieht nach einem Gewinner aus, oder? Aber mit nur 400 Conversions pro Variante ist die Wahrscheinlichkeit hoch, dass dieser Unterschied morgen komplett anders aussieht. Vielleicht war Montag ein guter Tag für Variante B. Vielleicht hat eine Werbekampagne die Zielgruppe verzerrt.

Statistische Auswertung sorgt dafür, dass Entscheidungen auf belastbaren Erkenntnissen beruhen und nicht auf zufälligen Momentaufnahmen. Und hier kommt der Unterschied zwischen frequentistischem und bayesianischem Ansatz ins Spiel.

Frequentistisch vs. bayesianisch: Zwei Denkschulen

In der Statistik gibt es zwei grundlegend verschiedene Ansätze, um A/B-Testergebnisse auszuwerten. Beide sind mathematisch valide, aber sie beantworten unterschiedliche Fragen.

KriteriumFrequentistischBayesianisch
Grundfrage„Wie wahrscheinlich sind diese Daten, wenn es keinen echten Unterschied gibt?“„Wie wahrscheinlich ist es, dass Variante B besser ist, gegeben die Daten?“
Ergebnisp-Wert (z. B. p = 0,03)Wahrscheinlichkeit (z. B. 97 Prozent)
Interpretation„Wenn kein Unterschied existiert, würden wir dieses Ergebnis in 3 Prozent der Fälle sehen.“„Variante B ist mit 97 Prozent Wahrscheinlichkeit besser als die Kontrolle.“
StichprobengrößeMuss vorher fix berechnet werdenKann dynamisch angepasst werden
VorwissenWird ignoriertKann über Prior einbezogen werden
TestdauerFix bis zur geplanten StichprobeFlexibler, dynamische Evaluation möglich
Typischer Fehler„Peeking“ (zu früh auswerten)Zu starke Priors verzerren Ergebnisse

Der entscheidende Unterschied liegt in der Frage, die beantwortet wird. Die frequentistische Methode fragt: „Wie wahrscheinlich sind meine Daten unter der Annahme, dass es keinen Unterschied gibt?“ Die bayesianische Methode fragt: „Wie wahrscheinlich ist es, dass Variante B besser ist, basierend auf den Daten, die ich beobachtet habe?“

Wenn du als Shopbetreiber eine Entscheidung treffen musst, willst du die zweite Frage beantwortet haben. Nicht die erste. Genau deshalb arbeiten wir mit bayesianischer Statistik.

Bayesianische Statistik: Das Prinzip einfach erklärt

Das Grundprinzip der bayesianischen Statistik lässt sich ohne Formeln erklären. Und genau das werde ich tun.

Der Kern: Überzeugungen mit Daten aktualisieren.

Stell dir vor, du testest einen neuen Produkttitel auf deiner Shopify-Produktseite. Bevor der Test startet, hast du eine Vorstellung davon, wie groß der Effekt sein könnte. Vielleicht denkst du: „Ein neuer Titel wird vermutlich keinen riesigen Unterschied machen, aber vielleicht ein paar Prozent.“ Das ist dein Prior, deine Ausgangsüberzeugung.

Jetzt läuft der Test und die Daten kommen rein. Mit jedem Tag, mit jeder neuen Conversion, aktualisiert die bayesianische Methode deine Überzeugung. Die Daten verschieben den Prior in Richtung der Realität. Das Ergebnis ist der Posterior, deine aktualisierte Überzeugung basierend auf echten Daten.

In drei Schritten:
  • ▶Prior: Deine Ausgangsannahme. Kann neutral sein (kein Vorwissen) oder informiert (basierend auf ähnlichen Tests oder Branchendaten).
  • ▶Likelihood: Die beobachteten Daten aus dem laufenden Test.
  • ▶Posterior: Die aktualisierte Wahrscheinlichkeit, die Prior und Daten kombiniert. „Variante B ist mit 94 Prozent Wahrscheinlichkeit besser.“

Das Schöne daran: Das Ergebnis ist direkt als Geschäftsentscheidung nutzbar. Du bekommst keine abstrakte Zahl wie einen p-Wert, den die meisten Entscheider ohnehin falsch interpretieren. Du bekommst eine konkrete Wahrscheinlichkeit.

Key Takeaway
Bayesianische Statistik sagt dir nicht: „Wenn kein Effekt existiert, wäre dieses Ergebnis in 4 Prozent der Fälle zu erwarten.“ Sie sagt dir: „Basierend auf deinen Daten ist Variante B mit 96 Prozent Wahrscheinlichkeit besser.“ Das ist die Aussage, die du für eine Businessentscheidung brauchst.

Warum wir bei Convertlab bayesianisch arbeiten

Ich konzentriere mich hauptsächlich auf bayesianische Auswertung. Aus meiner Erfahrung lässt sich damit sehr gut arbeiten, insbesondere in realen Business-Kontexten, wo Entscheidungen oft probabilistisch getroffen werden müssen.

Ich sehe beide Ansätze als valide. Aber für unsere Arbeit hat sich die bayesianische Methodik als besonders praktikabel erwiesen. Und zwar aus mehreren konkreten Gründen:

  • Direkt interpretierbare Ergebnisse. Wenn ich einem Kunden sage „Variante B hat einen p-Wert von 0,04“, muss ich danach zehn Minuten erklären, was das bedeutet. Und die Erklärung ist kontraintuitiv. „Variante B ist mit 96 Prozent Wahrscheinlichkeit besser und bringt voraussichtlich zwischen 5 und 15 Prozent mehr Revenue pro Nutzer“ ist sofort verständlich.
  • Flexibilität bei der Testdauer. Im frequentistischen Ansatz ist es ein statistischer Fehler, einen Test vor Erreichen der geplanten Stichprobengröße auszuwerten, das sogenannte „Peeking-Problem“. Bayesianische Methoden erlauben dynamische Evaluation, ohne die statistische Validität zu gefährden.
  • Einbeziehung von Vorwissen. Wenn wir bei einem Kunden bereits 30 Tests auf Produktseiten durchgeführt haben, wissen wir ungefähr, welche Effektgrößen realistisch sind. Dieses Wissen können wir als Prior einbeziehen, was zu robusteren Ergebnissen führt.
  • Bessere Kommunikation mit Stakeholdern. Business-Entscheidungen sind probabilistisch. „96 Prozent Wahrscheinlichkeit, dass wir mehr Umsatz machen“ ist eine Sprache, die jeder Geschäftsführer versteht. „p < 0,05“ ist es nicht.

Mehr zum Thema systematisches Testing findest du in CRO-Prozess Schritt-für-Schritt.

Wie du bayesianische Testergebnisse richtig interpretierst

Die Ergebnisse eines bayesianischen A/B-Tests enthalten in der Regel folgende Informationen:

KennzahlBedeutungBeispiel
GewinnwahrscheinlichkeitWahrscheinlichkeit, dass eine Variante die beste ist„Variante B: 96 Prozent“
Erwarteter UpliftGeschätzter Effekt auf die Haupt-KPI„+8,3 Prozent ARPU“
Credible Interval (95 %)Bereich, in dem der wahre Effekt mit 95 % Sicherheit liegt„+3,2 % bis +13,1 %“
Expected LossErwarteter Verlust bei falscher Variantenwahl„0,12 % Revenue per User“

Die Gewinnwahrscheinlichkeit ist der zentrale Wert. Ab welcher Schwelle du eine Variante als Gewinner deklarierst, hängt von deinem Risikoappetit ab. In unseren Projekten arbeiten wir typischerweise mit einer Schwelle von 90 bis 95 Prozent.

Das Credible Interval ist das bayesianische Pendant zum Konfidenzintervall. Es sagt dir: „Der wahre Effekt liegt mit 95 Prozent Wahrscheinlichkeit in diesem Bereich.“ Wenn das Intervall die Null einschließt (z. B. -2 Prozent bis +8 Prozent), ist der Effekt noch nicht klar genug, um eine Entscheidung zu treffen.

Der Expected Loss ist besonders nützlich. Er beantwortet die Frage: „Wie viel Umsatz verliere ich im Schnitt, wenn Variante B doch nicht besser ist?“ Ist der Expected Loss sehr klein, ist das Risiko der Implementierung gering, selbst wenn die Gewinnwahrscheinlichkeit „nur“ bei 88 Prozent liegt.

Für mich entscheidet nicht die Meinung, sondern die Statistik. Ein Test gilt als gewonnen, wenn die vorher definierten Haupt-KPIs statistisch signifikant verbessert werden. Bauchgefühl oder kurzfristige Trends spielen in der Entscheidung keine Rolle.

Stichprobengröße und Testdauer: Wann ist ein Test aussagekräftig?

Eine der häufigsten Fragen in unseren Kundengesprächen: „Wie lange muss der Test laufen?“

Die ehrliche Antwort: Es kommt darauf an. Ich bin überzeugt, dass starre Laufzeiten wenig sinnvoll sind. Entscheidend ist immer die Datenbasis, nicht der Kalender.

Zur Planung nutze ich Sample-Size-Calculator, die auf Basis der aktuellen Conversion Rate und des erwarteten Effekts eine notwendige Stichprobengröße berechnen. Gleichzeitig betrachte ich Tests immer dynamisch. Traffic kann sich während der Laufzeit verändern, und auch die Stärke des gemessenen Effekts beeinflusst, wie schnell statistische Sicherheit erreicht wird.

Aus meiner Erfahrung liegt die typische Dauer bei etwa vier bis sechs Wochen. Es gibt jedoch auch Tests, die bereits nach zwei Wochen klare Ergebnisse liefern, während andere, insbesondere bei geringerem Traffic, bis zu drei Monate laufen können.

Faustregeln für die Testdauer:
  • ▶Mindestens einen vollständigen Wochenzyklus (sieben Tage), um Wochentags-Effekte auszugleichen.
  • ▶Mindestens 200 bis 400 Conversions pro Variante als absolute Untergrenze, je nach erwartetem Effekt.
  • ▶Bei kleinen erwarteten Effekten (unter 5 Prozent) brauchst du deutlich mehr Daten als bei großen.
  • ▶Saisonale Effekte beachten: Ein Test, der über Black Friday läuft, liefert keine repräsentativen Ergebnisse für den Normalbetrieb.

Für Shops mit weniger Traffic empfehle ich, den Fokus auf größere Veränderungen zu legen, die messbarere Effekte erzeugen. Je kleiner der erwartete Effekt, desto mehr Daten brauchst du. Mehr dazu in A/B-Testing für Shopify: Tools, Setup und erste Tests.

Typische Fehler bei der statistischen Auswertung

Conversion-Optimierung ist komplexer, als viele zunächst erwarten. Erfolgreiches Testing erfordert Kompetenzen in Datenanalyse, Statistik, Design und Entwicklung. Die statistische Auswertung ist dabei der Bereich, in dem die meisten Fehler passieren.

1

Zu früh auswerten (Peeking). Du schaust am dritten Tag auf die Ergebnisse und siehst einen Uplift von 15 Prozent. Du stoppst den Test und implementierst. Zwei Wochen später ist die Conversion Rate wieder auf dem alten Niveau. Bayesianische Methoden reduzieren dieses Risiko, eliminieren es aber nicht vollständig. Warte, bis die Gewinnwahrscheinlichkeit und das Credible Interval stabil sind.

2

Nur auf Conversion Rate schauen. In unserem Ansatz ist der ARPU die zentrale Kennzahl, weil er Conversion Rate und Average Order Value kombiniert. Wir hatten einen Test, bei dem die Conversion Rate stieg, aber der AOV sank. Das Ergebnis: weniger Umsatz trotz mehr Conversions.

3

Sekundäre Metriken ignorieren. Wenn ein Test kein klares Ergebnis bei der Haupt-KPI liefert, analysiere ich Trends in sekundären Kennzahlen wie Funnel-Schritten oder Zwischenmetriken. Ein Test kann auf dem Papier inconclusive sein, aber wertvolle Erkenntnisse liefern.

4

Unrealistische Erwartungen an Effektgrößen. Aussagen wie „+40 Prozent Conversion Rate durch einen Button-Farbwechsel“ sind fast nie belastbar, weil Stichprobengröße oder statistische Sicherheit nicht ausreichend berücksichtigt wurden.

5

Keine klare Haupt-KPI vor Teststart definieren. Entscheide vor dem Test, welche Metrik über Erfolg oder Misserfolg bestimmt. Nicht nachher. Wer nach dem Test die Metrik wechselt, die am besten aussieht, betreibt Data Mining, nicht A/B-Testing.

Mehr zu häufigen Testing-Fehlern in A/B-Testing-Fehler vermeiden und in Conversion Rate berechnen: Formel, Benchmarks und typische Fehler.

Tools und Setup: Bayesianische Auswertung in der Praxis

Wir arbeiten hauptsächlich mit dem Testing-Tool Varify. Für mich ist ein entscheidender Vorteil, dass Varify mit Google-Analytics-Daten arbeitet, statt eigene Daten zu sammeln. Dadurch entstehen extrem flexible Auswertungsmöglichkeiten.

Die Testvarianten lassen sich auf nahezu alle Metriken und Dimensionen in GA4 analysieren. Das erlaubt eine Tiefe in den Auswertungen, die im Vergleich zu anderen Tools herausragend ist.

Was du brauchstWarum
Testing-Tool mit bayesianischer EngineVarify, VWO und andere bieten bayesianische Auswertung nativ an
Sauberes GA4-SetupOhne korrekte Events und Conversion-Tracking sind alle Ergebnisse wertlos
Google Tag ManagerFür Custom Events, Enhanced E-Commerce Tracking und saubere Datenerfassung
Korrektes Consent-SetupCookie-Consent beeinflusst die Datenerfassung massiv. Bei vielen Kunden erreichen wir Zustimmungsraten von über 95 Prozent

Ein wichtiges Prinzip in unserem Setup ist, dass wir Varianten bereits während des Tests so entwickeln, dass sie später schnell implementiert werden können. Gerade bei Shopify achten wir darauf, dass der Großteil des Codes bereits direkt im Shop vorhanden ist und das Testing-Tool hauptsächlich die Ausspielung steuert. Dadurch können wir erfolgreiche Varianten sehr schnell live bringen.

Key Takeaway
Wenn du wissen willst, wie unser gesamtes Framework aufgebaut ist, empfehle ich dir einen Blick auf unser Double Diamond CRO Framework und den Artikel CRO für Shopify.

A/B-Tests sauber statistisch auswerten und bessere Entscheidungen treffen?

Wir bringen bayesianische Methodik in dein Testing-Setup – mit klaren Hypothesen, sauberer Datenbasis und Ergebnissen, die du als Entscheider direkt umsetzen kannst.

Erstgespräch sichern
Chris Dengler

Chris Dengler

Gründer, Convertlab

Häufig gestellte Fragen

Bayesianische Statistik aktualisiert eine Ausgangsannahme (Prior) mit beobachteten Daten (Likelihood), um eine aktualisierte Wahrscheinlichkeit (Posterior) zu berechnen. Im A/B-Testing bedeutet das: Du bekommst eine direkte Aussage wie „Variante B ist mit 95 Prozent Wahrscheinlichkeit besser.“ Das ist praxisnäher als ein abstrakter p-Wert.

Die frequentistische Methode fragt: „Wie wahrscheinlich sind diese Daten, wenn kein Effekt existiert?“ Die bayesianische Methode fragt: „Wie wahrscheinlich ist es, dass Variante B besser ist, gegeben die Daten?“ Beide sind mathematisch valide, aber die bayesianische Frage passt besser zu realen Geschäftsentscheidungen.

Du brauchst kein Statistik-Studium, aber ein Grundverständnis ist notwendig. Die wichtigsten Konzepte: statistische Signifikanz, Stichprobengröße, Gewinnwahrscheinlichkeit und Credible Interval. Gute Testing-Tools wie Varify nehmen dir die Berechnung ab, aber die Interpretation bleibt bei dir.

Das hängt vom Risikoappetit ab. In unseren Projekten arbeiten wir typischerweise mit einer Schwelle von 90 bis 95 Prozent. Zusätzlich betrachten wir den Expected Loss: Wenn der potenzielle Verlust bei Fehlentscheidung minimal ist, kann auch eine Wahrscheinlichkeit von 88 Prozent ausreichen.

Die typische Dauer liegt bei vier bis sechs Wochen. Es gibt Tests, die nach zwei Wochen klare Ergebnisse liefern, und andere, die bei geringem Traffic bis zu drei Monate brauchen. Entscheidend ist die Datenbasis, nicht der Kalender. Mindestens einen vollständigen Wochenzyklus und 200 bis 400 Conversions pro Variante solltest du einplanen.

Der Prior ist deine Ausgangsannahme vor dem Test. Er kann neutral sein (kein Vorwissen) oder informiert (basierend auf früheren Tests). In unserer Arbeit nutzen wir informierte Priors, wenn wir bei einem Kunden bereits viele Tests durchgeführt haben und realistische Effektgrößen einschätzen können.

Ja, das ist ein Vorteil gegenüber dem frequentistischen Ansatz. Bayesianische Methoden erlauben eine dynamische Evaluation, ohne die statistische Validität grundsätzlich zu gefährden. Trotzdem solltest du nicht nach drei Tagen eine Entscheidung treffen, denn auch bayesianische Ergebnisse brauchen eine Mindestdatenbasis.

Wir arbeiten mit Varify, das GA4-Daten nutzt und bayesianische Auswertung unterstützt. VWO und AB Tasty bieten ebenfalls bayesianische Engines. Wichtig ist ein sauberes Tracking-Setup mit GA4 und Google Tag Manager.

Der Expected Loss beantwortet die Frage: „Wie viel verliere ich im Schnitt, wenn ich die falsche Variante wähle?“ Ein Expected Loss von 0,1 Prozent Revenue pro Nutzer bedeutet: Selbst im Worst Case ist der Verlust minimal. Das hilft bei der Entscheidungsfindung, wenn die Gewinnwahrscheinlichkeit knapp unter der Schwelle liegt.

Es gibt keine „verlorenen“ Tests. Ein signifikanter Downlift ist oft sogar wertvoller als ein neutrales Ergebnis, weil er klar zeigt, dass bestimmte Annahmen nicht funktionieren. Bei inconclusive Tests analysieren wir sekundäre Kennzahlen und nutzen die Erkenntnisse für neue Hypothesen.

Chris Dengler

Über den Autor: Chris Dengler

Chris ist CRO-Stratege und Gründer von Convertlab. Mit über 1.000 durchgeführten A/B-Tests und dem selbst entwickelten Double Diamond Framework hat er Shopify Brands im DACH-Raum zu nachweislich messbarem Wachstum verholfen.