Kurz zusammengefasst
- Eine Hypothese ist keine Idee. Sie ist eine überprüfbare Aussage mit klarer Veränderung, erwartetem Ergebnis und psychologischer Begründung. Ohne Hypothese testest du blind.
- Das Wenn-Dann-Weil-Framework gibt Struktur. „Wenn wir X ändern, dann passiert Y, weil Z." Dieses Format zwingt dich, vor dem Test nachzudenken, statt einfach loszulegen.
- Das „Weil" ist der wichtigste Teil. Es verbindet deine Änderung mit einem psychologischen Mechanismus oder einem Daten-Insight. Ohne „Weil" hast du eine Vermutung, keine Hypothese.
- Gute Hypothesen entstehen aus Research, nicht aus Brainstorming. Quantitative Daten, qualitative Analysen und Motivfeldanalysen liefern das Fundament. Aus über 1.000 A/B-Tests weiß ich: Die besten Tests basieren auf echten Erkenntnissen.
- Priorisierung entscheidet über den ROI. Nicht jede Hypothese verdient einen Test. Ein strukturiertes Scoring-Modell stellt sicher, dass du zuerst die Tests mit dem größten erwarteten Impact umsetzt.
Warum die Hypothese über Erfolg oder Misserfolg entscheidet
Ich bin überzeugt, dass die Qualität deiner Hypothesen den größten Einfluss auf den Erfolg deines gesamten Testing-Programms hat. Nicht das Tool, nicht das Budget, nicht die Menge an Traffic. Sondern die Frage, die du vor jedem Test beantwortest: Warum genau sollte diese Veränderung funktionieren?
Aus über 1.000 A/B-Tests weiß ich, dass die meisten erfolglosen Testprogramme nicht an schlechter Umsetzung scheitern. Sie scheitern, weil sie ohne klare Hypothesen testen. Jemand hat eine Idee, die „gut klingt", und schon wird umgesetzt. Statistik entscheidet, nicht Bauchgefühl, das ist mein Grundsatz. Aber Statistik kann nur dann sinnvolle Antworten liefern, wenn du die richtige Frage stellst.
Der häufigste Fehler, den ich bei Shopbetreibern sehe, ist fehlende Priorisierung. Viele Shops testen Ideen ohne klare Strategie oder Roadmap und investieren dadurch Zeit und Ressourcen in Tests mit geringem Potenzial. Das Ergebnis: viel Aufwand, wenig Ergebnis, Frustration.
Genau deshalb habe ich in meiner Arbeit das Wenn-Dann-Weil-Framework zum Standard gemacht. Es zwingt mich und mein Team, jede Testidee in eine strukturierte, überprüfbare Aussage zu übersetzen, bevor auch nur eine Zeile Code geschrieben wird.
Was eine gute A/B-Testing-Hypothese ausmacht
Eine Hypothese ist keine Idee. Eine Idee klingt so: „Lass uns die Produktseite überarbeiten." Eine Hypothese klingt anders. Sie enthält drei Elemente:
Die drei Bausteine einer Hypothese:
- Eine konkrete, beobachtbare Veränderung (Was ändern wir?)
- Ein messbares erwartetes Ergebnis (Was soll passieren?)
- Eine datenbasierte oder psychologische Begründung (Warum erwarten wir das?)
Der entscheidende Unterschied zwischen CRO und „einfach mal ein paar Buttons umstellen" liegt genau hier: in der Systematik und Datenbasis. Conversion Rate Optimierung basiert auf echten Erkenntnissen aus Datenanalysen, Nutzerverhalten und Research. In der Praxis entstehen die wenigsten relevanten Optimierungspotenziale aus spontanen Ideen.
Wenn ich eine Hypothese formuliere, prüfe ich sie immer gegen diese Kriterien:
- Spezifisch: Nicht „die Seite verbessern“, sondern eine konkrete Änderung an einem konkreten Element.
- Messbar: Die erwartete Wirkung muss sich in einer KPI ausdrücken lassen, idealerweise im Average Revenue per User (ARPU), weil er Conversion Rate und Average Order Value kombiniert.
- Begründet: Es gibt einen nachvollziehbaren Grund, warum die Änderung wirken sollte, basierend auf Daten, Psychologie oder qualitativen Insights.
- Widerlegbar: Der Test kann zeigen, dass die Hypothese falsch war. Genau das macht A/B-Testing so wertvoll.
Das Wenn-Dann-Weil-Framework erklärt
Das Framework ist simpel in der Struktur, aber kraftvoll in der Anwendung. Es besteht aus genau einem Satz:
Wenn wir [konkrete Veränderung beschreiben], dann erwarten wir [messbares Ergebnis], weil [datenbasierte oder psychologische Begründung].
Jeder Teil hat eine klare Funktion:
| Bestandteil | Funktion | Beispiel |
|---|---|---|
| Wenn | Definiert die Testvariante. Was genau ändern wir? | „Wenn wir auf der Produktseite echte Kundenbewertungen mit Bildern oberhalb des Folds anzeigen...“ |
| Dann | Definiert die erwartete Wirkung auf eine messbare KPI. | „...dann steigt die Add-to-Cart-Rate um mindestens 5 Prozent...“ |
| Weil | Liefert die Begründung. Warum sollte das funktionieren? | „...weil Social Proof mit visuellen Elementen Vertrauen stärkt und Unsicherheit bei Neukunden reduziert.“ |
Das „Wenn" zwingt dich zur Präzision. Es reicht nicht, „die Produktseite optimieren" zu wollen. Du musst exakt benennen, was sich ändert.
Das „Dann" zwingt dich zur Messbarkeit. Wenn du nicht sagen kannst, welche KPI sich verändern soll, weißt du nicht, worauf du testest.
Das „Weil" ist der Teil, den die meisten weglassen. Und genau das macht den Unterschied zwischen einem echten A/B-Test und einem Ratespiel. Aus meiner Erfahrung entstehen die besten Optimierungsideen nicht aus Design-Überlegungen, sondern aus psychologischem Verständnis.
Woher kommt das „Wenn"? Research als Fundament
Eine Hypothese kann nur so gut sein wie die Datenbasis, auf der sie steht. Deshalb beginnt in unserem Double Diamond CRO Framework jedes Projekt mit einer umfassenden Analysephase, bevor auch nur ein einziger Test aufgesetzt wird.
In dieser Phase gehe ich gemeinsam mit meinem Team mehrere strukturierte Schritte durch:
Quantitative Analyse: Über Dashboards auf Basis von Google Analytics 4 analysieren wir den gesamten Funnel, von der Werbeanzeige bis zum Kaufabschluss. Wir identifizieren Drop-Off-Raten, Conversion-Schritte und die größten Hebel. Wo verlieren wir die meisten Nutzer? Welche Seitentypen haben das größte Potenzial?
Qualitative Analyse: Session-Recordings, Heatmaps, Klickanalysen und Kundenumfragen liefern ein Verständnis für das „Warum" hinter den Zahlen. Die Zahl sagt dir, dass 68 Prozent der Nutzer die Produktseite verlassen. Aber erst die qualitative Analyse zeigt dir, warum: vielleicht fehlen Größenangaben, vielleicht ist der Preis nicht sofort sichtbar, vielleicht fehlt Vertrauen.
Motivfeldanalyse: Hier nutze ich den Motivkompass von Dirk Eilert. Er hilft dabei, die emotionalen Beweggründe der Zielgruppe zu verstehen: Sicherheit, Status, Zugehörigkeit oder Kontrolle. Ich sehe in unseren Projekten immer wieder, dass Hypothesen deutlich präziser werden, sobald man versteht, was Nutzer eigentlich erreichen wollen.
Funnel-Analyse: Wir betrachten den gesamten Weg des Nutzers, nicht nur einzelne Seiten. Brüche und Inkonsistenzen zwischen Werbeanzeige, Landingpage, Produktseite und Checkout sind oft die größten Hebel.
Aus all diesen Erkenntnissen entstehen Findings. Und aus Findings entstehen Hypothesen. Das ist der entscheidende Punkt: Die Hypothese wird nicht erfunden, sie wird aus Daten abgeleitet.
Mehr dazu, wie der gesamte Research-Prozess funktioniert, findest du in unserem Artikel Wie ein bewährter CRO-Prozess Schritt für Schritt funktioniert.
Woher kommt das „Weil"? Psychologische Mechanismen verstehen
Das „Weil" ist der Teil der Hypothese, der am meisten Wissen voraussetzt. Es reicht nicht zu sagen: „Weil es dann besser aussieht." Du brauchst einen Mechanismus, der erklärt, warum sich Nutzerverhalten ändern sollte.
Ich bin überzeugt, dass man Nutzerverhalten nur dann wirklich verändern kann, wenn man die dahinterliegenden Motive versteht. Im Grunde basiert jede unserer Hypothesen auf psychologischen Mechanismen. Wir kombinieren Daten aus Research, Nutzerverhalten, qualitative Insights und Motivkompass-Analysen. Psychologie ist kein separater Schritt, sondern integraler Bestandteil unseres gesamten Vorgehens.
| Psychologischer Mechanismus | Typische „Weil“-Begründung |
|---|---|
| Social Proof | „...weil Bewertungen mit echten Kundenbildern Vertrauen erzeugen und Unsicherheit bei Neukunden reduzieren.“ |
| Verlustaversion | „...weil Menschen stärker auf mögliche Verluste reagieren als auf gleich große Gewinne.“ |
| Anchoring | „...weil ein höherer Referenzwert den tatsächlichen Preis psychologisch günstiger wirken lässt.“ |
| Cognitive Load | „...weil weniger Entscheidungsoptionen die kognitive Belastung senken und schnellere Kaufentscheidungen ermöglichen.“ |
| Reaktanz | „...weil provokative oder einschränkende Botschaften in dominanzorientierten Zielgruppen Interesse erzeugen.“ |
| Vertrauen / Sicherheit | „...weil sichtbare Garantien und Rückgabebedingungen das wahrgenommene Risiko reduzieren.“ |
Die TÜV-Zertifizierung in Verkaufspsychologie hat mir und meinem Team geholfen, diese Mechanismen systematisch in unsere Arbeit zu integrieren. Dadurch können wir Hypothesen deutlich gezielter entwickeln und die Wahrscheinlichkeit erhöhen, tatsächlich messbare Ergebnisse zu erzeugen.
Daniel Kahneman beschreibt in „Thinking, Fast and Slow" viele dieser grundlegenden Mechanismen menschlicher Entscheidungsprozesse. Ich empfehle das Buch jedem, der im E-Commerce Hypothesen formulieren will.
Praxisbeispiele: Schwache vs. starke Hypothesen
Theorie allein hilft nicht. Deshalb zeige ich dir konkrete Beispiele aus der Praxis, wie sich schwache Testideen in starke Hypothesen verwandeln lassen.
Beispiel 1: Produktseite
„Wir sollten die Produktseite umgestalten.“
„Wenn wir auf den Top-20-Produktseiten eine Versand-Progress-Bar oberhalb des Add-to-Cart-Buttons anzeigen, dann steigt der durchschnittliche Warenkorbwert um mindestens 8 Prozent, weil ein sichtbarer Schwellenwert für kostenlosen Versand den Anchoring-Effekt nutzt und Kunden motiviert, den Warenkorbwert gezielt zu erhöhen.“
Beispiel 2: Warenkorb
„Der Warenkorb braucht ein Redesign.“
„Wenn wir im Warenkorb ein Cross-Sell-Modul mit kontextbezogenen Produktempfehlungen einbauen, dann steigt der Average Revenue per User um mindestens 5 Prozent, weil kontextuelle Empfehlungen im Moment der höchsten Kaufbereitschaft den Cognitive-Ease-Effekt nutzen und die Entscheidung für Zusatzprodukte erleichtern.“
Beispiel 3: Vertrauenselemente
„Wir brauchen mehr Trust-Badges.“
„Wenn wir unterhalb des Preises auf der Produktseite eine kompakte Zeile mit Rückgabegarantie, Versanddauer und Zahlungsarten anzeigen, dann steigt die Add-to-Cart-Rate bei Neukunden um mindestens 4 Prozent, weil Erstbesucher ein höheres wahrgenommenes Kaufrisiko haben und sichtbare Sicherheitssignale dieses Risiko nachweislich reduzieren.“
Bei Löwenkind konnten wir den ARPU um über 92 Prozent steigern und die Conversion Rate von drei bis vier Prozent auf konstant sechs bis sieben Prozent erhöhen. Kein einzelner Test hat dieses Ergebnis erzielt. Es waren viele kleine, hypothesengetriebene Verbesserungen, die sich über Monate summiert haben. Ähnlich wie das Prinzip aus „Atomic Habits": Viele kleine Optimierungen ergeben langfristig große Resultate. Mehr dazu in unserer Case Study Löwenkind.
Hypothesen priorisieren: Welchen Test zuerst?
Nicht jede Hypothese verdient sofort einen Test. Aus meiner Erfahrung ist eine gute Priorisierung einer der größten Erfolgshebel im CRO, weil sie entscheidet, worauf Zeit und Ressourcen eingesetzt werden.
Für die Priorisierung nutze ich ein eigenes Scoring-Modell. Konkret erstellen wir je Seitentyp im Shop, beispielsweise Produktseiten, Kategorieseiten, Warenkorb oder Startseite, eine Liste von Hypothesen. Jede Hypothese erhält einen Score, der sich aus mehreren Faktoren zusammensetzt:
| Faktor | Frage | Gewichtung |
|---|---|---|
| Erwarteter Impact | Wie stark könnte sich die KPI verbessern? | Hoch |
| Reichweite | Wie viele Nutzer sind betroffen? | Hoch |
| Evidenzqualität | Basiert die Hypothese auf starken Daten oder einer Vermutung? | Mittel |
| Problembedeutung | Wie kritisch ist das Problem für den Gesamtumsatz? | Mittel |
| Umsetzungsaufwand | Wie komplex ist die technische Implementierung? | Niedrig (invers) |
Dadurch entsteht ein klares Ranking innerhalb jedes Bereichs. Entscheidungen werden nicht nach Bauchgefühl getroffen, sondern strukturiert priorisiert. Das Ergebnis ist eine Testing-Roadmap: ein konkreter Plan, welche Tests in welcher Reihenfolge umgesetzt werden.
Ich empfehle dringend, zuerst auf den Seiten zu testen, die den höchsten Traffic und die größten Drop-Off-Raten haben. In den meisten Shopify-Shops sind das Produktseiten und der Warenkorb. Mehr dazu in unserem Artikel Shopify Shop optimieren.
Was passiert, wenn die Hypothese widerlegt wird?
Das ist eine Frage, die mir sehr oft gestellt wird. Und meine Antwort überrascht viele: Ein widerlegter Test ist kein gescheiterter Test.
Ich erlebe regelmäßig überraschende Testergebnisse. Es kommt immer wieder vor, dass wir Varianten entwickeln, von denen ich überzeugt bin, dass sie funktionieren müssen, und sie tun es nicht. Aber genau das ist eine der wichtigsten Erkenntnisse im A/B-Testing: Nutzerverhalten ist oft unintuitiv.
Wenn ein Test kein klares Ergebnis liefert, analysiere ich zunächst Trends in sekundären Kennzahlen wie Funnel-Schritten oder Zwischenmetriken. Entscheidend ist für mich die Stärke der zugrunde liegenden Hypothese. Wenn ich überzeugt bin, dass das Konzept Potenzial hat, testen wir weiter, entweder durch Iterationen der bestehenden Variante oder durch neue Experimente in dieselbe Richtung.
Mein Grundsatz:
Ein inconclusive oder negativer Test liefert immer dann Wert, wenn die Hypothese stark war. Denn dann lernst du etwas Echtes über deine Nutzer: dass deine Annahme falsch war. Das ist wertvoller als jeder „gewonnene" Test ohne klare Hypothese.
Bei einem Cart-Optimierungstest hatten wir beispielsweise eine Variante entwickelt, die in vielen Bereichen verbessert war, und trotzdem hat sie nicht gewonnen. Das Learning daraus war entscheidend für die nächsten drei Tests, die dann erfolgreich waren.
Es gibt immer etwas zu optimieren. Aber nur dann, wenn du aus jedem Test lernst, nicht nur aus den gewonnenen.
Die häufigsten Fehler bei der Hypothesenformulierung
Aus über 1.000 A/B-Tests und der Begleitung zahlreicher E-Commerce-Unternehmen habe ich die immer gleichen Fehler gesehen. Hier sind die fünf häufigsten:
1. Kein „Weil“
Die Hypothese beschreibt eine Änderung und ein Ergebnis, aber keine Begründung. Ohne „Weil" ist es eine Vermutung, kein testbarer Zusammenhang. Das „Weil" zwingt dich, deine Annahmen offenzulegen, und genau das macht eine Hypothese falsifizierbar.
2. Zu vage formuliert
„Wenn wir die Seite verbessern, dann steigt die Conversion." Das ist keine Hypothese. Welche Seite? Welche Verbesserung? Welche Conversion-Metrik? Präzision ist Pflicht.
3. Hypothese ohne Datengrundlage
Jemand hat „eine Idee" und will sie testen. Aber es gibt keinen Datenpunkt, der die Idee stützt. Ich halte solche Tests für Ressourcenverschwendung. Die besten Hypothesen entstehen aus Research, nicht aus Brainstorming-Sessions.
4. Zu viele Änderungen in einem Test
Wenn du fünf Dinge gleichzeitig änderst, weißt du am Ende nicht, was gewirkt hat. Jede Hypothese sollte idealerweise eine zentrale Veränderung beschreiben. So bleiben Ergebnisse interpretierbar und die Learnings klar.
5. Falsche KPI gewählt
Viele testen auf die Conversion Rate, obwohl der ARPU die bessere Metrik wäre. Denn eine höhere Add-to-Cart-Rate bringt nichts, wenn der durchschnittliche Bestellwert sinkt. Ich empfehle, den Average Revenue per User als primäre KPI zu verwenden, weil er sowohl Conversion Rate als auch Average Order Value berücksichtigt.
Ein strukturierter CRO-Prozess verhindert die meisten dieser Fehler automatisch, weil jede Hypothese durch mehrere Qualitätsfilter läuft, bevor sie getestet wird.
Bereit für hypothesengetriebenes Testing?
Lass uns in einem kostenlosen CRO-Audit die größten Hebel für deinen Shopify Store identifizieren. Basierend auf Daten, nicht Meinungen. Mit einer klaren Test-Roadmap für die nächsten 6 Monate.
Erstgespräch anfragen
Chris Dengler
Gründer, Convertlab
Häufig gestellte Fragen
Eine A/B-Testing-Hypothese ist eine überprüfbare Aussage, die beschreibt, welche Veränderung welches Ergebnis erzeugen soll und warum. Sie ist wichtig, weil sie dem Test eine klare Richtung gibt und sicherstellt, dass du aus dem Ergebnis lernst, egal ob der Test gewinnt oder verliert.
Das Framework besteht aus drei Teilen: „Wenn“ definiert die konkrete Veränderung, „dann“ beschreibt das erwartete messbare Ergebnis, und „weil“ liefert die psychologische oder datenbasierte Begründung. Dieser Dreiklang stellt sicher, dass jeder Test auf einer nachvollziehbaren Logik basiert.
Technisch ja, aber ich rate dringend davon ab. Hypothesen ohne Datengrundlage sind im Grunde Ratespiele. Aus unserer Erfahrung mit über 1.000 Tests zeigt sich klar, dass researchbasierte Hypothesen eine deutlich höhere Erfolgsquote haben.
Ich empfehle den Average Revenue per User (ARPU), weil er Conversion Rate und durchschnittlichen Bestellwert kombiniert. Eine steigende Add-to-Cart-Rate allein sagt wenig aus, wenn der Warenkorbwert gleichzeitig sinkt.
Das hängt vom Traffic ab. In den meisten Shopify-Shops empfehle ich, einen bis maximal drei Tests gleichzeitig zu fahren, um ausreichend Daten pro Test zu sammeln. Entscheidend ist die Priorisierung, damit du zuerst die Hypothesen mit dem höchsten erwarteten Impact testest.
Die typische Laufzeit liegt bei vier bis sechs Wochen. Es gibt Tests, die bereits nach zwei Wochen klare Ergebnisse liefern, andere brauchen bei geringerem Traffic bis zu drei Monate. Entscheidend ist die statistische Aussagekraft, nicht das Datum.
Zunächst sekundäre Kennzahlen analysieren. Dann prüfen, ob die Hypothese stark genug war. Wenn ja, iterieren und eine verfeinerte Variante testen. Ein inconclusive Test mit einer starken Hypothese ist wertvoller als ein „gewonnener“ Test ohne klare Begründung.
Es hilft enorm. Hypothesen werden deutlich präziser, wenn du die psychologischen Mechanismen hinter Kaufentscheidungen verstehst. Der Motivkompass, Social Proof, Verlustaversion oder Anchoring sind Konzepte, die in fast jedem Shop anwendbar sind.
Das Framework ist ein Baustein innerhalb der Analysephase. In unserem Double Diamond Framework entsteht die Hypothese nach der Research-Phase und vor der Priorisierung. Sie bildet die Brücke zwischen Erkenntnis und Test.
Ja, sogar besonders gut. Gerade bei wenig Traffic ist es entscheidend, keine Tests zu verschwenden. Eine starke Hypothese mit klarer Begründung erhöht die Wahrscheinlichkeit, dass der Test ein verwertbares Ergebnis liefert.

Über den Autor: Chris Dengler
Chris ist CRO-Stratege und Gründer von Convertlab. Mit über 1.000 durchgeführten A/B-Tests und dem selbst entwickelten Double Diamond Framework hat er Shopify Brands im DACH-Raum zu nachweislich messbarem Wachstum verholfen.
