Statistische Signifikanz beim A/B-Testing: Was sie bedeutet und warum sie entscheidend ist

Gründer, Convertlab
18 Min. Lesezeit
Statistische Signifikanz beim A/B-Testing

Kurz zusammengefasst:

Kurz zusammengefasst

  • ✅ Statistische Signifikanz ist die Grundlage für belastbare A/B-Test-Entscheidungen. Sie zeigt, ob ein gemessener Unterschied mit hoher Wahrscheinlichkeit real ist oder nur zufällig entstanden ist. Ohne sie triffst du Entscheidungen auf Basis von Rauschen.
  • ✅ Das Signifikanzniveau bestimmt, wie sicher du sein willst. In den meisten E-Commerce-Kontexten reichen 95 Prozent. Entscheidend ist, dass du das Niveau vor dem Test festlegst und nicht nachträglich anpasst.
  • ✅ Die Stichprobengröße entscheidet über die Aussagekraft deines Tests. Zu wenige Daten führen zu falschen Schlüssen. Sample-Size-Calculator helfen bei der Planung, aber Flexibilität bleibt wichtig.
  • ✅ Bayesianische Statistik macht Ergebnisse direkt interpretierbar. Statt abstrakter p-Werte liefert sie konkrete Wahrscheinlichkeiten. Aus über 1.000 Tests wissen wir: Dieser Ansatz passt besser zu realen Business-Entscheidungen.
  • ✅ Der häufigste Fehler ist nicht fehlende Signifikanz, sondern voreiliges Abbrechen. Tests brauchen Zeit und Daten. Wer zu früh Schlüsse zieht, implementiert Veränderungen, die keinen echten Effekt haben.

Warum statistische Signifikanz kein Nice-to-have ist

Ich sehe es in fast jedem Erstgespräch mit neuen Kunden: Da wurde ein A/B-Test aufgesetzt, nach einer Woche hat Variante B „besser ausgesehen", und die Änderung wurde live geschaltet. Klingt effizient. Ist aber einer der teuersten Fehler, den du im E-Commerce machen kannst.

Statistische Signifikanz bedeutet, dass ein gemessener Unterschied zwischen zwei Varianten mit hoher Wahrscheinlichkeit nicht durch Zufall entstanden ist, sondern tatsächlich durch die getestete Veränderung verursacht wurde. Nur weil eine Variante kurzfristig bessere Werte zeigt, heißt das noch nicht, dass sie wirklich überlegen ist. Ohne ausreichende Datenbasis können Ergebnisse stark schwanken.

Aus über 1.000 A/B-Tests bei ConvertLab kann ich dir sagen: Die Statistik entscheidet, nicht das Bauchgefühl. Ich habe Dutzende Fälle erlebt, in denen eine Variante nach zwei Wochen klar vorne lag, nach vier Wochen plötzlich hinter dem Original zurückfiel, und nach sechs Wochen ein komplett anderes Bild zeigte. Wer nach Woche zwei implementiert hätte, hätte Umsatz verloren.

Key Takeaway
Statistik ist im A/B-Testing nicht optional. Sie ist die einzige Methode, um belastbar zwischen echtem Effekt und zufälliger Schwankung zu unterscheiden. Daten, nicht Meinungen.

Mein eigener Zugang zum Thema ist dabei kein rein praktischer. In meiner Masterarbeit an der FAU Erlangen-Nürnberg habe ich gemeinsam mit der Uniklinik A/B-Tests zu Blutspende-Aufrufen durchgeführt. Dort habe ich gelernt, wie entscheidend wissenschaftliche Methodik für valide Ergebnisse ist. Dieses Prinzip übertrage ich auf jeden einzelnen Test, den wir heute im E-Commerce umsetzen.

Was statistische Signifikanz beim A/B-Testing wirklich bedeutet

Bevor wir tiefer einsteigen, müssen wir den Begriff sauber definieren. Denn ich erlebe oft, dass „statistische Signifikanz" entweder missverstanden oder zu vereinfacht dargestellt wird.

Die Definition

Statistische Signifikanz beschreibt die Wahrscheinlichkeit, dass ein beobachteter Unterschied zwischen zwei Varianten nicht durch Zufall entstanden ist. In der Praxis heißt das: Wenn du eine Conversion Rate von 3,2 Prozent bei der Kontrollgruppe und 3,8 Prozent bei der Testvariante misst, sagt dir statistische Signifikanz, ob dieser Unterschied belastbar ist oder ob du ihn genauso gut durch eine zufällige Schwankung erklären könntest.

Was sie nicht bedeutet

Statistische Signifikanz sagt dir nicht, dass die Testvariante besser ist. Sie sagt dir, dass der gemessene Unterschied mit hoher Wahrscheinlichkeit real ist. Das klingt ähnlich, ist aber ein entscheidender Unterschied.

Statistische Signifikanz bedeutetStatistische Signifikanz bedeutet nicht
Der gemessene Unterschied ist wahrscheinlich nicht zufälligDie Testvariante ist definitiv besser
Bei wiederholtem Test würdest du ein ähnliches Ergebnis erwartenDer gemessene Uplift wird exakt so in Zukunft eintreten
Die Datenbasis ist ausreichend für eine belastbare AussageExterne Faktoren wie Saisonalität sind ausgeschlossen
Du kannst eine fundierte Entscheidung treffenDie Entscheidung ist risikofrei

Ich bin überzeugt, dass dieses Verständnis fundamental ist. Wenn du statistische Signifikanz als „Garantie" interpretierst, wirst du irgendwann enttäuscht sein. Wenn du sie als „belastbare Entscheidungsgrundlage" siehst, nutzt du sie richtig.

Der p-Wert: einfach erklärt und richtig eingeordnet

Der p-Wert ist das Herzstück der frequentistischen Statistik und vermutlich die am häufigsten missverstandene Kennzahl im A/B-Testing.

Was der p-Wert wirklich aussagt

Technisch gesprochen: Der p-Wert gibt die Wahrscheinlichkeit an, den beobachteten Unterschied (oder einen größeren) zu messen, unter der Annahme, dass kein tatsächlicher Unterschied existiert. Das heißt: Wie wahrscheinlich ist es, dass du diese Daten siehst, obwohl beide Varianten eigentlich gleich gut sind?

Ein p-Wert von 0,05 bedeutet: Es gibt eine fünfprozentige Wahrscheinlichkeit, dieses Ergebnis rein durch Zufall zu beobachten, wenn die Varianten in Wirklichkeit identisch wären.

Warum der p-Wert kontraintuitiv ist

Das Problem: Die meisten Menschen wollen wissen „Wie wahrscheinlich ist es, dass Variante B besser ist?" Der p-Wert beantwortet aber eine andere Frage, nämlich „Wie wahrscheinlich sind diese Daten, wenn es keinen Unterschied gibt?"

Aus meiner Erfahrung: Genau an dieser Stelle entsteht in der Praxis die größte Verwirrung. Shopbetreiber interpretieren einen p-Wert von 0,03 als „97 Prozent Wahrscheinlichkeit, dass B besser ist". Das ist mathematisch falsch. Es ist einer der Gründe, warum wir bei ConvertLab hauptsächlich mit bayesianischer Statistik arbeiten, die genau diese intuitivere Frage beantwortet.

p-Wert in der Praxis

Trotz seiner Schwächen bleibt der p-Wert nützlich, weil die meisten Testing-Tools ihn standardmäßig ausgeben. Entscheidend ist, dass du ihn richtig einordnest:

  • p < 0,05: Konventionell signifikant. Der Unterschied ist wahrscheinlich real.
  • p < 0,01: Stark signifikant. Hohe Sicherheit.
  • p > 0,10: Nicht signifikant. Der Unterschied könnte leicht zufällig sein.
  • p zwischen 0,05 und 0,10: Grauzone. Mehr Daten sammeln oder sekundäre Metriken prüfen.

Signifikanzniveau festlegen: 90, 95 oder 99 Prozent?

Das Signifikanzniveau, auch Konfidenzniveau genannt, legst du vor dem Test fest. Es bestimmt, wie streng du deine Entscheidungskriterien setzt.

Die drei üblichen Stufen

KonfidenzniveauFehlerwahrscheinlichkeit (Alpha)Wann sinnvoll
90 Prozent10 ProzentExplorative Tests mit geringem Risiko, erste Richtungsentscheidungen
95 Prozent5 ProzentStandard für die meisten E-Commerce-Tests, guter Kompromiss aus Sicherheit und Praktikabilität
99 Prozent1 ProzentHochrisiko-Änderungen, Checkout-Umbauten, Pricing-Tests

Meine Empfehlung

In den meisten Projekten arbeiten wir mit einem Konfidenzniveau von 95 Prozent. Das ist der Industriestandard und bietet einen guten Kompromiss: sicher genug, um teure Fehlentscheidungen zu vermeiden, aber nicht so streng, dass du Monate auf Ergebnisse warten musst.

Bei bestimmten Tests, etwa im Checkout oder bei Preisänderungen, gehen wir bewusst auf 99 Prozent. Wenn eine falsche Entscheidung direkt Umsatz kostet, muss die Sicherheit höher sein.

Key Takeaway
Das Signifikanzniveau legst du vor dem Test fest. Nicht danach. Wenn du erst nach der Auswertung entscheidest, ob 90 oder 95 Prozent „reichen", betreibst du keine Statistik mehr, sondern Cherry-Picking.

Stichprobengröße berechnen: Wie viele Daten brauchst du wirklich?

Eine der häufigsten Fragen, die ich von Shopbetreibern höre: „Wie lange muss der Test laufen?" Die ehrliche Antwort: Das hängt von deiner Stichprobengröße ab, und die lässt sich berechnen.

Was die Stichprobengröße beeinflusst

Drei Faktoren bestimmen, wie viele Datenpunkte du brauchst:

  1. Deine aktuelle Conversion Rate: Je niedriger sie ist, desto mehr Daten brauchst du, um einen Unterschied sicher zu erkennen.
  2. Der erwartete Effekt (Minimum Detectable Effect): Je kleiner der Unterschied, den du erkennen willst, desto mehr Daten sind nötig.
  3. Das gewählte Signifikanzniveau: Je strenger (99 statt 95 Prozent), desto größer muss die Stichprobe sein.

Ein Rechenbeispiel

Beispiel: Conversion Rate 3%, erwarteter Uplift 10%
  • Bei 95% Konfidenzniveau: ca. 35.000 Besucher pro Variante (70.000 gesamt)
  • Bei 5.000 Besuchern/Tag: mindestens 14 Tage Laufzeit
  • Bei 90% Konfidenzniveau: ca. 27.000 Besucher pro Variante

Zur Planung nutze ich Sample-Size-Calculator, die auf Basis der aktuellen Conversion Rate und des erwarteten Effekts eine notwendige Stichprobengröße berechnen. Gleichzeitig betrachte ich Tests immer dynamisch, denn Traffic kann sich während der Laufzeit verändern.

Minimum-Voraussetzungen für A/B-Testing

Ich orientiere mich nicht am Traffic, sondern an den Conversion-Events. Aus meiner Erfahrung kann A/B-Testing ab etwa 500 bis 1.000 Bestellungen pro Monat Sinn machen, vorausgesetzt, ein Product-Market-Fit ist bereits vorhanden. Bei Shops mit höherem Average Order Value kann Testing auch bei weniger Bestellungen funktionieren, wenn ausreichend Traffic vorhanden ist. Wenn du wissen willst, ob dein Shop die Grundvoraussetzungen erfüllt, findest du mehr dazu in Shopify Shop optimieren: Die wichtigsten Hebel.

Die häufigsten Fehler bei der statistischen Auswertung

Aus über 1.000 Tests kenne ich die typischen Stolperfallen. Und ich kann dir sagen: Selbst erfahrene Teams machen diese Fehler, wenn sie nicht aufpassen.

Fehler 1: Tests zu früh abbrechen

Der Klassiker. Nach drei Tagen sieht Variante B „signifikant besser" aus, und der Test wird gestoppt. Das Problem: In der Anfangsphase sind Schwankungen enorm. Was nach drei Tagen wie ein klarer Sieger aussieht, kann sich nach zwei Wochen komplett umkehren.

Die typische Testlaufzeit liegt bei uns bei etwa vier bis sechs Wochen. Es gibt Tests, die bereits nach zwei Wochen klare Ergebnisse liefern, während andere, insbesondere bei geringerem Traffic, bis zu drei Monate laufen können. Ich bin überzeugt, dass starre Laufzeiten wenig sinnvoll sind. Entscheidend ist immer die Datenbasis, nicht der Kalender.

Fehler 2: Auf den falschen KPI schauen

Ein Test gilt als gewonnen, wenn die vorher definierten Haupt-KPIs statistisch signifikant verbessert werden. Ich habe es erlebt, dass ein Cart-Optimierungstest eine bessere Conversion Rate zeigte, aber einen schlechteren Average Order Value. Erst als wir den ARPU als primäre Metrik betrachteten, also Conversion Rate mal durchschnittlichen Warenkorbwert, wurde das Gesamtbild klar.

Fehler 3: Signifikanzniveau nachträglich ändern

Wenn dein Test bei 95 Prozent nicht signifikant ist, darfst du nicht einfach auf 90 Prozent umschalten und das Ergebnis als „signifikant" verkaufen. Das ist statistischer Betrug an dir selbst.

Fehler 4: Nur eine Metrik isoliert betrachten

Wenn ein Test kein eindeutiges Ergebnis liefert, analysiere ich zunächst Trends in sekundären Kennzahlen wie Funnel-Schritten oder Zwischenmetriken. Entscheidend ist auch die Stärke der zugrunde liegenden Hypothese. Wenn ich überzeugt bin, dass das Konzept Potenzial hat, testen wir weiter, entweder durch Iterationen der bestehenden Variante oder durch neue Experimente in dieselbe Richtung.

Fehler 5: Externe Faktoren ignorieren

Saisonalität, Marketingkampagnen, Feiertage: All das beeinflusst dein Testergebnis. Ein Test, der über den Black-Friday-Zeitraum läuft, zeigt ein anderes Nutzerverhalten als im Januar. Deshalb kontrollieren wir immer den Kontext.

FehlerKonsequenz
Test zu früh abbrechenFalsch-positive Ergebnisse, Umsatzverlust durch falsche Implementierung
Falscher primärer KPIOptimierung in die falsche Richtung, z.B. höhere CR bei niedrigerem AOV
Signifikanzniveau nachträglich senkenErgebnisse sind nicht mehr belastbar
Nur eine Metrik betrachtenGesamteffekt wird nicht erkannt
Externe Faktoren ignorierenSaisonale Effekte werden als Testeffekte interpretiert

Wenn du tiefer in typische Testfehler einsteigen willst, empfehle ich meinen Artikel Die häufigsten A/B-Testing-Fehler und wie du sie vermeidest.

Bayesianisch vs. frequentistisch: Welcher Ansatz passt besser?

Bei der statistischen Auswertung von A/B-Tests gibt es zwei grundlegende Denkschulen. Beide sind mathematisch valide, aber sie beantworten unterschiedliche Fragen und eignen sich für unterschiedliche Kontexte.

Frequentistischer Ansatz

Der klassische Ansatz arbeitet mit p-Werten und festen Signifikanzniveaus. Er beantwortet die Frage: Wie wahrscheinlich sind diese Daten, wenn es keinen Unterschied gibt? Vorteil: klar definierte Regeln. Nachteil: Die Aussage ist für viele Entscheider schwer zu greifen.

Bayesianischer Ansatz

Bayesianische Statistik macht Wahrscheinlichkeiten direkt interpretierbar. Statt eines p-Werts bekommst du eine Aussage wie: „Variante B ist mit 96 Prozent Wahrscheinlichkeit besser als Variante A." Das ist die Frage, die du als Shopbetreiber eigentlich stellen willst.

Wir arbeiten bei ConvertLab hauptsächlich mit bayesianischer Statistik. Entscheidungen im E-Commerce werden oft probabilistisch getroffen, und genau dafür liefert die bayesianische Methodik die passendere Sprache.

KriteriumFrequentistischBayesianisch
KernfrageWie wahrscheinlich sind die Daten bei keinem Effekt?Wie wahrscheinlich ist es, dass B besser ist?
Ergebnisp-Wert (abstrakt)Gewinnwahrscheinlichkeit (direkt interpretierbar)
TestendeFeste Stichprobengröße im VorausFlexibler, Ergebnis wird laufend aktualisiert
PraxistauglichkeitGut für akademische StrengeBesser für Business-Entscheidungen
Vorwissen nutzenNeinJa (Prior-Verteilungen)

Wer tiefer in die bayesianische Methodik einsteigen will, findet die Details in Bayesianische Statistik im A/B-Testing: Einfach erklärt.

So interpretierst du A/B-Test-Ergebnisse richtig

Die Statistik liefert dir Zahlen. Aber Zahlen allein treffen keine Entscheidungen. Aus meiner Erfahrung scheitert die Interpretation häufiger an der Einordnung als an der Berechnung.

Schritt 1: Primären KPI prüfen

Ist der primäre KPI statistisch signifikant verbessert? Bei uns ist das in den meisten Fällen der ARPU, also der Average Revenue Per User. Diese Metrik verbindet Conversion Rate und durchschnittlichen Warenkorbwert und gibt dir ein Gesamtbild statt einer isolierten Zahl.

Schritt 2: Sekundäre Metriken prüfen

Was machen die einzelnen Funnel-Schritte? Steigt die Add-to-Cart-Rate, aber sinkt der Checkout-Abschluss? Dann hast du vielleicht ein Problem weiter unten im Funnel, das der primäre KPI allein nicht zeigt. Über den Google Tag Manager tracken wir gezielt zusätzliche Events, die standardmäßig nicht in Analytics vorhanden sind.

Schritt 3: Segmente analysieren

Sieht das Ergebnis auf Mobile anders aus als auf Desktop? Gibt es Unterschiede zwischen Neukunden und Bestandskunden? Mit unserem Setup über Varify und Google Analytics 4 können wir Testvarianten auf nahezu alle Metriken und Dimensionen analysieren. Diese Tiefe ist entscheidend, denn ein Gesamtergebnis kann Teileffekte verbergen.

Schritt 4: Kontext einordnen

Lief eine große Marketingkampagne parallel? War ein Feiertag im Testzeitraum? Hat sich die Traffic-Zusammensetzung verändert? All das beeinflusst die Interpretation.

Schritt 5: Entscheidung treffen

Am Ende steht immer die Frage: Implementieren, iterieren oder verwerfen? Ein signifikanter Uplift bei ausreichender Datenbasis bedeutet implementieren. Ein inconclusive Ergebnis bei starker Hypothese bedeutet iterieren. Ein signifikanter Downlift ist oft sogar wertvoller als ein neutrales Ergebnis, weil er klar zeigt, dass bestimmte Annahmen nicht funktionieren. Mehr zur strukturierten Auswertung findest du in A/B-Test-Ergebnisse richtig auswerten.

Statistische Signifikanz in der Praxis: Unser Setup

Theorie ist das eine. In der Praxis braucht es ein Setup, das saubere statistische Auswertungen überhaupt ermöglicht.

Unser Testing-Tool: Varify

Wir arbeiten hauptsächlich mit Varify. Ein entscheidender Vorteil ist, dass Varify mit Google-Analytics-Daten arbeitet, statt eigene Daten zu sammeln. Dadurch sind extrem flexible Auswertungsmöglichkeiten möglich. Die Testvarianten lassen sich auf nahezu alle Metriken und Dimensionen in GA4 analysieren, was im Vergleich zu anderen Tools mehr Tiefe erlaubt.

Technische Sauberkeit als Voraussetzung

Ich bin überzeugt, dass Performance beim Testing niemals leiden darf. Deshalb setzen wir Varianten technisch so um, dass möglichst viel Code direkt im Shop geladen wird und nicht über externe Testing-Tools. Dadurch vermeiden wir Flicker-Effekte und Ladezeiten, die Ergebnisse verfälschen könnten.

Ein weiterer kritischer Punkt ist das Targeting. Wenn beispielsweise ein Test im Warenkorb stattfindet, sollten nur Nutzer einbezogen werden, die tatsächlich den Warenkorb sehen. Zu breites Targeting verwässert Daten und nimmt Ergebnissen die Aussagekraft.

Quality Assurance

Quality Assurance ist für mich eines der wichtigsten Elemente im gesamten A/B-Testing-Prozess. Ohne saubere QA weißt du nicht, ob Varianten korrekt ausgespielt werden, und damit sind Testergebnisse im Zweifel wertlos. Bereits ein kleiner technischer Fehler kann große Auswirkungen auf die Daten haben.

Das Double Diamond Framework

All das, von der Hypothese über den Testaufbau bis zur statistischen Auswertung, ist eingebettet in unser Double Diamond CRO Framework. Die erste Phase identifiziert die richtigen Probleme und entwickelt priorisierte Hypothesen. Die zweite Phase sorgt für saubere Umsetzung, QA und statistische Auswertung. Wenn du den gesamten CRO-Prozess verstehen willst, empfehle ich CRO-Prozess Schritt-für-Schritt.

Deine A/B-Tests auf dem nächsten Level?

Wir zeigen dir, wie du statistische Signifikanz richtig nutzt und aus echten Daten echte Entscheidungen ableitest.

Erstgespräch sichern
Chris Dengler

Chris Dengler

Gründer, Convertlab

Häufig gestellte Fragen

Statistische Signifikanz bedeutet, dass ein gemessener Unterschied zwischen zwei Varianten mit hoher Wahrscheinlichkeit nicht zufällig entstanden ist. Sie ist die Grundlage dafür, dass Entscheidungen auf belastbaren Daten beruhen und nicht auf Momentaufnahmen oder Bauchgefühl.

Die Berechnung basiert auf der Stichprobengröße, den gemessenen Conversion Rates und dem gewählten Signifikanzniveau. In der Praxis nutzen die meisten Testing-Tools diese Berechnung automatisch. Bei ConvertLab arbeiten wir mit bayesianischer Statistik über Varify und GA4, was die Ergebnisse direkt als Gewinnwahrscheinlichkeiten ausgibt.

Ein p-Wert unter 0,05 gilt als Industriestandard für statistische Signifikanz. Bei risikoreichen Änderungen wie Checkout-Umbauten empfehle ich einen p-Wert unter 0,01. Wichtig: Der p-Wert allein sagt nicht, ob eine Variante gut ist - er sagt nur, ob der Unterschied wahrscheinlich real ist.

Das hängt von deiner aktuellen Conversion Rate und dem erwarteten Effekt ab. Grob kalkuliert brauchst du bei einer Conversion Rate von 3 Prozent und einem gewünschten Uplift von 10 Prozent etwa 35.000 Besucher pro Variante. Bei ConvertLab empfehlen wir mindestens 500 bis 1.000 Bestellungen pro Monat als Grundvoraussetzung.

Konfidenzniveau und Signifikanzniveau sind zwei Seiten derselben Medaille. Ein Konfidenzniveau von 95 Prozent entspricht einem Signifikanzniveau (Alpha) von 5 Prozent. Das eine beschreibt die Sicherheit, das andere die Fehlerwahrscheinlichkeit.

Bayesianische Statistik liefert direkt interpretierbare Wahrscheinlichkeiten - zum Beispiel: Variante B ist mit 96 Prozent Wahrscheinlichkeit besser. Das ist die Aussage, die Shopbetreiber für Business-Entscheidungen brauchen. Mehr dazu in unserem Artikel zu bayesianischer Statistik im A/B-Testing.

Die Laufzeit hängt vom Traffic und den Conversion-Events ab. Typisch sind vier bis sechs Wochen. Es gibt Tests mit klaren Ergebnissen nach zwei Wochen, andere laufen bis zu drei Monate. Entscheidend ist die Datenbasis, nicht der Kalender. Starre Laufzeiten sind wenig sinnvoll.

Ein nicht signifikantes Ergebnis ist kein Misserfolg. Prüfe zunächst sekundäre Metriken und Segmente. Wenn die Hypothese stark ist, iteriere die Variante. Wie du Hypothesen entwickelst, die bessere Testergebnisse liefern, zeige ich in meinem Leitfaden zu A/B-Test-Hypothesen.

Bei frequentistischen Tests ist das problematisch, weil die Stichprobengröße im Voraus festgelegt sein sollte. Bei bayesianischen Methoden ist ein vorzeitiges Auswerten weniger kritisch, da die Wahrscheinlichkeiten laufend aktualisiert werden. Trotzdem empfehle ich, mindestens zwei volle Wochen laufen zu lassen, um Wochentags-Effekte abzudecken.

Sie ist die Grundlage für belastbare Ergebnis-Zuordnung. Ohne statistische Signifikanz weißt du nicht, ob ein gemessener Uplift real war oder zufällig. Bei ConvertLab haben wir eine ROI-Garantie mit Faktor 5, die innerhalb von sechs Monaten erreicht werden muss. Mehr dazu in CRO-ROI berechnen.

Chris Dengler

Über den Autor: Chris Dengler

Chris ist CRO-Stratege und Gründer von Convertlab. Mit über 1.000 durchgeführten A/B-Tests und dem selbst entwickelten Double Diamond Framework hat er Shopify Brands im DACH-Raum zu nachweislich messbarem Wachstum verholfen.