Kurz zusammengefasst
- Ein A/B-Test ist nicht „gewonnen", weil eine Zahl besser aussieht. Er ist gewonnen, wenn die vorher definierte Haupt-KPI statistisch sauber verbessert wird. Statistik entscheidet, nicht Bauchgefühl.
- Flat Tests sind kein Misserfolg. Sie zeigen dir, dass deine Annahme falsch war. Das ist ein echtes Learning, wenn die Hypothese stark war.
- Verlierer-Tests sind oft wertvoller als Gewinner. Weil sie dich zwingen, deine Annahmen zu hinterfragen und in eine neue Richtung zu denken.
- Die KPI entscheidet über die Interpretation. ARPU ist in vielen Shops die bessere Primary Metric als Conversion Rate, weil er den wirtschaftlichen Effekt abbildet.
- Auswertung ist nicht das Ende, sondern der Anfang. Jedes Testergebnis fließt in die nächste Hypothese. Genau das macht Testing so wertvoll.
Warum die Auswertung wichtiger ist als der Test selbst
Aus über 1.000 A/B-Tests weiß ich: Die meisten Teams investieren 90 Prozent ihrer Energie in die Vorbereitung und Umsetzung eines Tests, und vielleicht zehn Prozent in die Auswertung. Dabei entscheidet genau die Auswertung darüber, ob du aus einem Test lernst oder nicht.
Ich bin überzeugt, dass man im A/B-Testing nichts als selbstverständlich betrachten darf. Nutzerverhalten ist oft unintuitiv. Es kommt immer wieder vor, dass wir Varianten entwickeln, von denen ich überzeugt bin, dass sie funktionieren müssen, und sie tun es nicht. Selbst wenn sie optisch überzeugend wirken oder bei Wettbewerbern erfolgreich waren.
Diese Erfahrung hat mich gelehrt, dass saubere Auswertung und ehrliche Interpretation wichtiger sind als ein „schönes" Ergebnis. Denn ein falsch interpretiertes Ergebnis ist schlimmer als gar kein Test: Du triffst eine Entscheidung auf Basis von Rauschen und hältst sie für Erkenntnis.
Wann ist ein A/B-Test „gewonnen"?
Für mich entscheidet nicht die Meinung, sondern die Statistik. Ein Test gilt als gewonnen, wenn die vorher definierten Haupt-KPIs statistisch signifikant verbessert werden.
Was bedeutet das konkret?
Statistische Signifikanz bedeutet, dass ein gemessener Unterschied mit hoher Wahrscheinlichkeit nicht zufällig entstanden ist, sondern tatsächlich durch die getestete Veränderung verursacht wurde. Nur weil eine Variante kurzfristig besser aussieht oder höhere Werte zeigt, heißt das noch nicht, dass sie wirklich überlegen ist. Ohne ausreichende Datenbasis können Ergebnisse stark schwanken.
Statistische Auswertung sorgt dafür, dass Entscheidungen auf belastbaren Daten basieren, nicht auf Hoffnung. Ich lege großen Wert darauf, dass Erfolg klar messbar ist. Bauchgefühl oder kurzfristige Trends spielen in der Entscheidung keine Rolle. Entscheidend ist die Datenbasis.
Szenario 1: Klarer Uplift – was jetzt?
Der schönste Moment im Testing: Die Variante gewinnt. Klar, statistisch sauber, auf der richtigen KPI. Was passiert danach?
Wenn ein Test erfolgreich ist, empfehle ich in den meisten Fällen die Implementierung der Gewinner-Variante. Die finale Entscheidung erfolgt natürlich gemeinsam mit dem Kunden.
Ein wichtiges Prinzip in unserem Setup ist, dass wir Varianten bereits während des Tests so entwickeln, dass sie später schnell und sauber implementiert werden können. Das spart Zeit und verhindert, dass ein gewonnener Test wochenlang „in der Warteschlange" steht und der Uplift nicht realisiert wird.
Wie groß muss der Uplift sein?
Es gibt keine universelle Antwort. Aber ich empfehle, den Uplift immer im Kontext zu betrachten:
- Relativer Uplift: Wie viel Prozent Verbesserung auf die KPI?
- Absoluter Impact: Was bedeutet das in Euro für den Shop?
- Konfidenz: Wie sicher ist das Ergebnis statistisch?
Der größte Uplift, den wir bei einem einzelnen A/B-Test mit ausreichender Datenbasis gemessen haben, lag bei über 50 Prozent. Das war ein Test auf Produktseiten bei einem Kunden, bei dem wir gezielte Optimierungen auf ausgewählten Bestseller-Seiten vorgenommen haben. Solche Ergebnisse sind selten, zeigen aber, welches Potenzial in gut durchdachter Optimierung steckt.
Szenario 2: Flat Test – kein klares Ergebnis
Das ist das Szenario, das die meisten Teams verunsichert. Der Test zeigt keinen statistisch signifikanten Unterschied. Weder besser noch schlechter. Was nun?
Ich sehe inconclusive Tests nicht als Misserfolg, sondern als Teil des Lernprozesses. Wenn ein Test kein klares Ergebnis liefert, gehe ich so vor:
- Schritt 1Sekundäre Kennzahlen analysieren. Hat sich etwas an Funnel-Schritten, Zwischenmetriken oder Segmenten verändert? Manchmal ist der Effekt da, aber nicht auf der primären KPI sichtbar.
- Schritt 2Die Hypothese prüfen. War die Hypothese stark genug? Basierte sie auf echten Daten und einem psychologischen Mechanismus? Oder war es eher eine Vermutung?
- Schritt 3Entscheiden: Iterieren oder weitergehen. Wenn die Hypothese stark ist und die sekundären Kennzahlen Trends zeigen, testen wir weiter. Wenn die Hypothese schwach war, gehen wir zum nächsten Punkt der Roadmap.
| Flat Test mit schwacher Hypothese | Flat Test mit starker Hypothese |
|---|---|
| Hypothese basiert auf „Idee“ ohne Datengrundlage | Hypothese basiert auf Research, Daten, psychologischem Mechanismus |
| Keine Bewegung auf keiner Metrik | Sekundäre Kennzahlen zeigen Trends |
| → Hypothese verwerfen, nächsten Punkt der Roadmap testen | → Iterieren, Variante verfeinern, erneut testen |
Entscheidend ist für mich die Stärke der zugrunde liegenden Hypothese. Wenn ich überzeugt bin, dass das Konzept Potenzial hat, testen wir weiter.
Szenario 3: Die Variante verliert
Der Test zeigt ein statistisch signifikantes negatives Ergebnis. Die Variante ist schlechter als die Kontrolle.
Für viele Teams fühlt sich das wie ein Scheitern an. Für mich ist es das Gegenteil: Ein sauberer Verlierer-Test ist extrem wertvoll, weil du etwas Echtes über deine Nutzer lernst.
Ein konkretes Beispiel aus unserer Praxis: Wir hatten einen Cart-Optimierungstest mit einer Variante, die in vielen Bereichen verbessert war, aber eine Versandkosten-Information entfernt hatte. Das Ergebnis war eine bessere Conversion Rate, aber ein niedrigerer durchschnittlicher Bestellwert. Auf Conversion Rate hätte der Test „gewonnen". Auf ARPU hat er verloren.
Das Learning war entscheidend für die nächsten drei Tests, die dann erfolgreich waren. Ohne den Verlierer hätten wir diese Erkenntnis nicht gehabt.
Wann ein Verlierer kein Learning ist
Es gibt eine Ausnahme: Wenn der Test technische Probleme hatte (Flicker, Tracking-Fehler, QA-Mängel), dann ist das Ergebnis nicht interpretierbar. Deshalb ist Quality Assurance so wichtig. Viele überprüfen Tests nur oberflächlich, ohne sicherzustellen, dass Varianten auf allen Geräten, Browsern und Betriebssystemen korrekt ausgespielt werden.
Die richtige KPI: Warum ARPU oft besser ist als Conversion Rate
Die Wahl der KPI entscheidet fundamental darüber, wie du ein Testergebnis interpretierst. Dasselbe Testergebnis kann auf einer KPI als Gewinner und auf einer anderen als Verlierer aussehen.
Ich empfehle, den Average Revenue per User (ARPU) als primäre KPI zu verwenden, weil er sowohl Conversion Rate als auch Average Order Value berücksichtigt. Eine steigende Conversion Rate bringt nichts, wenn der Warenkorbwert gleichzeitig sinkt.
Als Denkmodell:
ARPU ≈ Conversion Rate × Average Order Value
Beispiel: Gleicher Test, unterschiedliche Interpretation
| Variante | Conversion Rate | Ø Bestellwert | ARPU | Ergebnis |
|---|---|---|---|---|
| A (Kontrolle) | 3,0 % | 80 € | 2,40 € | Referenz |
| B (Test) | 3,5 % | 65 € | 2,28 € | CR: +17 % ✓ | ARPU: −5 % ✗ |
Auf Conversion Rate: Variante B gewinnt (+17 Prozent). Auf ARPU: Variante B verliert (−5 Prozent). Für mich ist die Antwort eindeutig: ARPU, weil du am Ende des Tages Umsatz pro Besucher maximieren willst, nicht Klicks. Mehr dazu: Conversion Rate berechnen und Benchmarks.
Bayesianisch vs. frequentistisch: Wie wir auswerten
Wir arbeiten in der Regel mit bayesianischer Statistik. Für mich ist dieser Ansatz besonders praxisnah, weil er Wahrscheinlichkeiten direkt interpretierbar macht und Entscheidungsprozesse unterstützt. Ich sehe beide Ansätze als valide, aber für unsere Arbeit hat sich die bayesianische Methodik als besonders praktikabel erwiesen.
Was heißt das in der Praxis?
Bei der frequentistischen Methode fragst du: „Wie wahrscheinlich wäre dieses Ergebnis, wenn es keinen echten Unterschied gäbe?" Das ist der p-Wert.
Bei der bayesianischen Methode fragst du: „Wie wahrscheinlich ist es, dass Variante B besser ist als Variante A?" Das ist die Posterior-Wahrscheinlichkeit. Für Business-Entscheidungen ist die zweite Frage oft nützlicher, weil sie direkt beantwortbar ist.
| Aspekt | Frequentistisch | Bayesianisch |
|---|---|---|
| Fragestellung | Wie wahrscheinlich ist dieses Ergebnis unter der Nullhypothese? | Wie wahrscheinlich ist B besser als A? |
| Ergebnis | p-Wert (z.B. p < 0,05) | Wahrscheinlichkeit (z.B. 95 %) |
| Interpretation | Indirekt, oft missverstanden | Direkt, intuitiver |
| Flexibilität | Feste Stichprobengröße nötig | Dynamisches Peeking möglich |
| Unser Einsatz | Für Validierung und Referenz | Primäre Auswertungsmethode |
Wir nutzen Varify als Testing-Tool, das mit Google-Analytics-Daten arbeitet und dadurch extrem flexible Auswertungsmöglichkeiten ermöglicht. Die Testvarianten lassen sich auf nahezu alle Metriken und Dimensionen in GA4 analysieren. Mehr zum Tool-Setup: A/B-Testing für Shopify.
Daniel Kahneman beschreibt in „Thinking, Fast and Slow" eindrucksvoll, wie stark kognitive Verzerrungen menschliche Urteile über Wahrscheinlichkeiten beeinflussen. Das gilt auch für die Interpretation von Testergebnissen: Wir sehen Muster, wo keine sind, und überschätzen kleine Stichproben.
Sekundäre Kennzahlen: Die zweite Ebene der Auswertung
Die primäre KPI entscheidet, ob ein Test gewonnen hat. Aber die sekundären Kennzahlen erklären, warum.
Kennzahlen, die ich bei jeder Auswertung zusätzlich prüfe:
- Add-to-Cart-Rate: Hat die Variante die Hemmschwelle zum Warenkorb gesenkt?
- Checkout-Start-Rate: Kommen mehr Nutzer bis zum Checkout?
- Checkout-Completion-Rate: Schließen mehr Nutzer den Kauf ab?
- Average Order Value: Kaufen Nutzer anders (mehr oder weniger pro Bestellung)?
- Bounce Rate / Engagement: Ändert sich das Verhalten auf der Seite grundsätzlich?
Außerdem segmentiere ich fast immer nach:
- Mobile vs. Desktop: In vielen Projekten liegt der mobile Traffic-Anteil bei über 90 Prozent. Ein Test, der auf Desktop gewinnt, aber auf Mobile verliert, hat ein völlig anderes Bild als der Durchschnitt suggeriert.
- Neu vs. Bestandskunden: Erstbesucher reagieren auf Vertrauenssignale anders als wiederkehrende Käufer.
- Traffic-Quelle: Paid-Nutzer und Organic-Nutzer verhalten sich unterschiedlich.
Mehr zum Thema KPIs: CRO-Prozess Schritt für Schritt.
Vom Ergebnis zur nächsten Hypothese: Der Lernzyklus
A/B-Test-Ergebnisse auswerten ist nicht das Ende, sondern der Anfang des nächsten Tests. Jedes Ergebnis fließt bei uns zurück in den Lernzyklus:
- 01
Ergebnis dokumentieren
Was genau wurde getestet? Was war das Ergebnis auf Primary und Secondary KPIs?
- 02
Learning formulieren
Was haben wir über die Nutzer gelernt? Nicht „der Test hat nicht funktioniert“, sondern „Nutzer in Segment X reagieren auf Y nicht wie erwartet.“
- 03
Hypothese aktualisieren
Muss die ursprüngliche Hypothese angepasst werden? Gibt es eine neue Richtung?
- 04
Roadmap anpassen
Ändert das Learning die Prioritäten der nächsten Tests?
Dieser Zyklus ist der Kern unseres Double Diamond Frameworks. In der Analysephase entstehen Hypothesen, in der Umsetzungsphase werden sie getestet, und die Ergebnisse fließen zurück in neue Analysen.
Es gibt immer etwas zu optimieren. Aber nur dann, wenn du aus jedem Test lernst, nicht nur aus den gewonnenen.
Bei einem unserer Kunden im Subscription-Bereich konnten wir bereits im ersten Test die Subscription-Rate um knapp 40 Prozent steigern. Aber die drei Tests davor waren Flat Tests. Erst das Learning aus diesen drei Tests hat den vierten Test erfolgreich gemacht.
Wenn du Hypothesen sauber strukturieren willst: A/B-Testing-Hypothesen formulieren.
Deine A/B-Tests liefern keine klaren Ergebnisse?
In unserem kostenlosen CRO-Audit analysieren wir deinen Shop und zeigen dir, wo dein größtes Optimierungspotenzial liegt – konkret, datenbasiert und ohne Buzzwords.
Kostenlosen CRO-Audit anfordern
Chris Dengler
Gründer, Convertlab
Häufig gestellte Fragen
Prüfe zuerst die primäre KPI auf statistische Signifikanz. Analysiere dann sekundäre Kennzahlen und Segmente. Formuliere ein Learning und leite daraus die nächste Hypothese ab.
Signifikanz bedeutet, dass ein gemessener Unterschied mit hoher Wahrscheinlichkeit nicht zufällig ist. Ohne Signifikanz ist dein Ergebnis möglicherweise nur Rauschen.
Ein Flat Test zeigt keinen statistisch signifikanten Unterschied zwischen Kontrolle und Variante. Das ist kein Misserfolg, sondern ein Learning: Deine Hypothese war in dieser Form nicht stark genug.
Nie nur, weil er nach ein paar Tagen 'schlecht aussieht'. Die typische Laufzeit liegt bei vier bis sechs Wochen. Entscheidend ist die statistische Aussagekraft, nicht der Kalender.
In vielen Shops ja. ARPU berücksichtigt Conversion Rate und Warenkorbwert gemeinsam. Eine steigende Conversion Rate bei sinkendem AOV bedeutet weniger Umsatz pro Nutzer.
Analysiere sekundäre Kennzahlen, formuliere ein Learning und prüfe, ob eine Iteration sinnvoll ist. Ein sauberer Verlierer mit starker Hypothese ist wertvoller als ein Gewinner ohne Begründung.
Die bayesianische Methode fragt direkt 'Wie wahrscheinlich ist B besser als A?' und ist intuitiver interpretierbar. Die frequentistische Methode arbeitet mit p-Werten. Wir nutzen primär den bayesianischen Ansatz.
Add-to-Cart-Rate, Checkout-Start-Rate, Checkout-Completion-Rate, AOV und Bounce Rate. Zusätzlich segmentieren nach Mobile vs. Desktop und Neu vs. Bestandskunden.
Halte fest: Was wurde getestet, welche Hypothese lag zugrunde, was war das Ergebnis auf Primary und Secondary KPIs, und welches Learning ergibt sich daraus. Das Learning fließt in die nächste Hypothese.
Das hängt vom Shop ab. Entscheidend ist nicht die Anzahl, sondern die Qualität der Hypothesen und die Konsequenz der Umsetzung. Viele kleine, hypothesengetriebene Tests summieren sich langfristig.

Über den Autor: Chris Dengler
Chris ist CRO-Stratege und Gründer von Convertlab. Mit über 1.000 durchgeführten A/B-Tests und dem selbst entwickelten Double Diamond Framework hat er Shopify Brands im DACH-Raum zu nachweislich messbarem Wachstum verholfen.
