Tools

A/B Test Signifikanz Rechner

Mit diesem A/B Test Signifikanz Rechner sehen Sie in Sekunden, ob Ihr Ergebnis statistisch signifikant ist: p Wert, Konfidenz, Uplift, Konfidenzintervall und die Wahrscheinlichkeit, dass B besser ist als A. Planen Sie vor dem Start auch die nötige Stichprobengröße und Testdauer. Kostenlos, ohne Anmeldung.

Läuft im Browser; Zahlen werden nicht gespeichert.
Varianten
Konfidenzniveau
Testart

Besucher: eindeutige Nutzer im Test. Conversions: Nutzer, die das Ziel erreicht haben. Nehmen Sie beide Zahlen aus demselben Zeitraum.

Sobald Sie Zahlen eingeben, prüft der Rechner hier die Traffic Verteilung (SRM) und die Datenmenge. Die SRM Prüfung setzt eine gleichmäßige Aufteilung voraus.

Uplift von B gegenüber A
0

Besucher und Conversions eingeben; das Ergebnis erscheint sofort.

0
0
0
0
0
0
0
0
Conversion Rate und Konfidenzintervall
A0
B0
Talha Aslan Verfasst vonTalha AslanOnline Marketing Berater, Google Partner Zuletzt aktualisiert

A/B Test Signifikanz Rechner: So funktioniert es

  1. 1Zahlen der Varianten eintragen

    Geben Sie für A (Kontrolle) und B die Besucher im Test und die Conversions ein. Der Rechner liest 12.000 und 12000 gleich. Für eine dritte Version klicken Sie dann auf + Variante C.

  2. 2Konfidenz und Testart wählen

    Für die meisten Marketingtests sind 95 % Konfidenz und ein zweiseitiger Test ein guter Start. Legen Sie beides vor dem Teststart fest und ändern Sie es nach dem Blick auf das Ergebnis nicht mehr.

  3. 3Badge und Uplift lesen

    Das Badge zeigt, ob der Unterschied signifikant ist. Die große Zahl ist also der relative Uplift von B gegenüber A, die Zeile darunter das Konfidenzintervall dazu.

  4. 4Datenprüfung beachten

    Bei ungleich verteiltem Traffic erscheint eine SRM Warnung, bei zu wenigen Conversions eine Hinweiszeile zur Datenmenge. Solange eine Warnung steht, trauen Sie dem Ergebnis deshalb nicht.

  5. 5Den nächsten Test vorab planen

    Im Reiter Stichprobe tragen Sie aktuelle Conversion Rate, MDE und Besucher pro Tag ein; Sie erhalten die nötigen Besucher pro Variante und eine auf volle Wochen aufgerundete Dauer.

Formeln im A/B Test Rechner

Der Rechner nutzt den Z Test für zwei Anteile. Die Wahrscheinlichkeiten der Normalverteilung berechnet er ohne externe Bibliothek mit den Näherungen von W. J. Cody und P. J. Acklam in doppelter Genauigkeit.

Conversion Ratep = Conversions / Besucher
Relativer Uplift(pB - pA) / pA
Gepoolte Ratep̄ = (cA + cB) / (nA + nB)
z Wertz = (pB - pA) / √(p̄ × (1 - p̄) × (1/nA + 1/nB))
p WertZweiseitig: 2 × (1 - Φ(|z|)); einseitig: 1 - Φ(z)
Konfidenzintervall des Uplifts[(pB - pA) ± z(1 - α/2) × √(pA(1 - pA)/nA + pB(1 - pB)/nB)] / pA
Beobachtete PowerΦ(|z| - z(1 - α/2))
Wahrscheinlichkeit, dass B gewinntΦ((mB - mA) / √(vA + vB)); m und v sind Mittelwert und Varianz von Beta(c + 1, n - c + 1)
SRM Prüfungχ² = Σ (beobachtet - erwartet)² / erwartet; gleichmäßige Aufteilung, Freiheitsgrade = Varianten - 1
Stichprobe pro Varianten = [z(1 - α/2) × √(2p̄(1 - p̄)) + z(1 - β) × √(p1(1 - p1) + p2(1 - p2))]² / (p2 - p1)²

Bei drei Varianten und im Reiter Stichprobe ab drei Varianten teilt der Rechner α durch die Zahl der Vergleiche (Bonferroni). Beim einseitigen Test zeigt er statt eines Intervalls eine Untergrenze mit z(1 - α) und berechnet die beobachtete Power als Φ(z - z(1 - α)).

Beispielrechnungen zur A/B Test Signifikanz

Die Zeilen sind Rechenbeispiele; mit denselben Zahlen zeigt der Rechner genau diese Werte in den Karten und im Badge.

A: Besucher / ConversionsB: Besucher / ConversionsEinstellungUpliftp WertKonfidenzBadge
12.000 / 48012.000 / 56495 %, zweiseitig+17,5 %0,007999,2 %Signifikant
10.000 / 50010.000 / 54095 %, zweiseitig+8,0 %0,202779,7 %Nicht signifikant
10.000 / 50010.000 / 56095 %, zweiseitig+12,0 %0,058394,2 %Nicht signifikant
10.000 / 50010.000 / 56095 %, einseitig+12,0 %0,029197,1 %Signifikant
8.000 / 4008.000 / 33095 %, zweiseitig-17,5 %0,008099,2 %Signifikant
20.000 / 60019.000 / 65099 %, zweiseitig+14,0 %0,018398,2 %Nicht signifikant

Zeile drei und vier nutzen dieselben Daten: Der einseitige Test halbiert den p Wert. Auch der Rückgang in Zeile fünf ist signifikant, B verliert also. In der letzten Zeile meldet der Rechner zusätzlich SRM, denn die Aufteilung 20.000 zu 19.000 weicht stärker von einer gleichmäßigen Verteilung ab, als der Zufall erklärt (p < 0,0001).

Benötigte Besucher pro Variante

Für 95 % Konfidenz, 80 % Power, zweiseitigen Test und zwei Varianten; der MDE ist ein relativer Uplift. Die Werte entsprechen dem Reiter Stichprobe im Rechner.

Aktuelle Conversion RateMDE 5 %MDE 10 %MDE 20 %
1 %637.010163.09542.693
2 %315.20680.68221.109
3 %207.93853.21113.914
5 %122.12431.2348.158
10 %57.76314.7513.841

Für die Gesamtzahl multiplizieren Sie dann mit der Anzahl der Varianten. Ein halb so großer MDE vervierfacht die nötige Stichprobe ungefähr.

Was zeigt ein A/B Test Signifikanz Rechner wirklich?

Ein A/B Test Signifikanz Rechner zeigt, ob der Unterschied in der Conversion Rate zwischen zwei Versionen echt ist oder nur Zufall. Sie spielen zwei Überschriften, zwei Anzeigentexte oder zwei Preisdarstellungen im selben Zeitraum an getrennte Besuchergruppen aus. Danach tragen Sie für jede Version Besucher und Conversions ein. Aus diesen vier Zahlen berechnet das Tool p Wert, Konfidenz und ein Konfidenzintervall für den Uplift.

Die Rechnung beantwortet allerdings nicht die Frage „Welche Version ist besser?“. Sie beantwortet eine engere Frage: Bliebe der Unterschied sehr wahrscheinlich bestehen, wenn Sie die Daten neu sammeln? Zum Beispiel kann B 17,5 % mehr Conversions bringen; bei kleiner Stichprobe verschwindet derselbe Abstand aber in der Woche darauf. Deshalb empfehle ich, drei Ausgaben gemeinsam zu lesen:

  • Badge: Ist der Unterschied bei Ihrem Konfidenzniveau signifikant?
  • Konfidenzintervall: In welchem Bereich liegt der echte Uplift?
  • Datenprüfung: Ist der Traffic gleichmäßig verteilt, reichen die Daten?

Läuft der Test über Anzeigen, braucht er sauberes Tracking. Mit dem UTM Generator kennzeichnen Sie zum Beispiel den Traffic jeder Variante getrennt und vermeiden später vermischte Quellen.

Was bedeuten p Wert und Konfidenzniveau?

Der p Wert ist die Wahrscheinlichkeit, einen mindestens so großen Unterschied zu sehen, wenn A und B in Wahrheit gleich gut wären. Ein p Wert von 0,0079 heißt also: Zwei gleichwertige Versionen lägen nur etwa 8 von 1.000 Mal so weit auseinander. Bei 95 % Konfidenz vergleicht der Rechner ihn mit der Schwelle 0,05; liegt er darunter, zeigt das Badge „Signifikant“.

Die Karte Konfidenz zeigt 1 minus p Wert. Das heißt allerdings nicht „B ist mit 99,2 % Wahrscheinlichkeit besser“; diese Lesart ist ein verbreiteter Fehler. Das Statement der American Statistical Association zu p Werten betont zwei Punkte:

  • Ein p Wert misst weder die Größe eines Effekts noch seine Bedeutung.
  • Geschäftsentscheidungen sollten nicht nur davon abhängen, ob ein p Wert eine Schwelle unterschreitet.

Daher zeige ich neben dem p Wert das Konfidenzintervall des Uplifts. Reicht es von +4,6 % bis +30,4 %, ist der Uplift signifikant, der echte Effekt kann aber klein oder groß sein. Vergleichen Sie vor der Entscheidung vor allem das untere Ende, also das pessimistische Szenario, mit Ihrem Geschäftsziel.

Wie planen Sie die Stichprobe vor dem A/B Test Signifikanz Rechner?

Die halbe Arbeit mit einem A/B Test Signifikanz Rechner passiert vor dem Start. Der Reiter Stichprobe braucht vier Angaben: aktuelle Conversion Rate, minimal nachweisbaren Effekt (MDE), Konfidenzniveau und Power. Die Power ist die Chance, einen tatsächlich vorhandenen Unterschied zu entdecken; üblicher Standard in der Statistik sind 80 %.

Die Logik ist einfach: Kleine Unterschiede brauchen viele Daten. Rechenbeispiel: Um bei 5 % Conversion Rate einen relativen Uplift von 10 % mit 95 % Konfidenz und 80 % Power zu erkennen, brauchen Sie 31.234 Besucher pro Variante. Bei 20 % Ziel sinkt der Bedarf auf 8.158. Kurz gesagt vervierfacht ein halbierter MDE die Stichprobe ungefähr.

Mit den Besuchern pro Tag rechnet das Tool die Stichprobe in eine Dauer um und rundet auf volle Wochen auf. So kommen Werktage und Wochenende in beiden Varianten gleich oft vor. Ist die Dauer zu lang, haben Sie drei Hebel:

  • Testen Sie eine mutigere Änderung, also einen größeren MDE.
  • Schicken Sie mehr Traffic in den Test; für die bezahlte Seite hilft mein Artikel zum Google Ads Budget.
  • Messen Sie ein Ziel weiter oben im Funnel, zum Beispiel den Warenkorb statt des Kaufs.

Warum führt frühes Abbrechen zu falschen Gewinnern?

Die teuerste Gewohnheit bei A/B Tests: täglich auf das Ergebnis schauen und stoppen, sobald das Dashboard „signifikant“ meldet. Jeder zusätzliche Blick gibt dem Zufall eine weitere Chance auf einen falschen Gewinner. Im Beispielszenario aus Evan Millers Artikel How Not To Run an A/B Test steigt die Rate falscher Treffer dadurch von vermeintlichen 5 % auf 26,1 %.

Laut derselben Quelle muss die angezeigte Signifikanz bei 10 Zwischenblicken auf 1,0 % sinken, damit das echte Niveau bei 5 % bleibt. In der Praxis hat sich ein Ablauf in drei Schritten bewährt:

  1. Legen Sie Stichprobe und Dauer vor dem Start im Reiter Stichprobe fest.
  2. Beobachten Sie während des Tests nur technische Probleme, etwa Ladefehler und SRM Warnungen.
  3. Lesen Sie das Ergebnis einmal, sobald die geplante Besucherzahl erreicht ist, und entscheiden Sie dann.

Zudem kann der Effekt eines Gewinners nach den ersten Wochen nachlassen, sobald der Neuheitseffekt verfliegt. Deshalb beobachte ich die Conversion Rate nach größeren Änderungen noch einige Wochen weiter.

Was tun bei einer SRM Warnung?

Ein Sample Ratio Mismatch (SRM) liegt vor, wenn Sie den Traffic gleichmäßig aufteilen wollten, die Besucherzahlen der Varianten aber stärker auseinanderliegen, als der Zufall erlaubt. Der Rechner prüft das mit einem Chi Quadrat Test und zeigt ab p < 0,01 eine Warnung in der Datenprüfung. Eine Aufteilung von 20.000 zu 19.000 wirkt zum Beispiel harmlos, ist bei diesem Volumen aber eine echte Abweichung.

Laut dem SRM Leitfaden von Microsoft Research zeigen etwa 6 % der A/B Tests bei Microsoft einen SRM; das Team nutzt vor der Auswertung sogar die strengere Schwelle p < 0,0005. Typische Ursachen sind:

  • Fehler im Code, der Nutzer den Varianten zuteilt.
  • Besucher, die bei der Weiterleitung auf die Variante verloren gehen.
  • Eine Variante, die langsam lädt oder abbricht, sodass ihre Besuche im Tracking fehlen.
  • Ein Consent Banner, das in einer Variante anders erscheint und die Einwilligungsrate verschiebt.

Solange SRM besteht, ist der p Wert nicht verlässlich. Finden Sie zuerst die Ursache, beheben Sie sie und starten Sie den Test neu. Wie Tracking und Einwilligung zusammenspielen, erkläre ich im DSGVO Leitfaden für Websites. Teilen Sie den Traffic bewusst ungleich auf, etwa 90/10, passt diese Prüfung nicht; dann ignorieren Sie die Warnung.

Warum braucht eine dritte Variante die Bonferroni Korrektur?

Mit + Variante C vergleicht der Rechner B und C jeweils getrennt mit A. Jeder Vergleich gibt dem Zufall eine weitere Chance; bei zwei Vergleichen steigt die Fehlerquote von 5 % insgesamt auf fast 10 %. Die Bonferroni Korrektur teilt deshalb die Signifikanzschwelle durch die Zahl der Vergleiche. Bei 95 % Konfidenz prüft das Tool also jeden Vergleich mit α = 0,025.

Rechenbeispiel: A hat 5.000 Besucher und 150 Conversions, B 5.100 und 180, C 4.950 und 190. C erreicht +27,9 % Uplift bei p = 0,0214; das liegt unter 0,025, folglich ist C signifikant. B kommt dagegen auf +17,6 %, aber p = 0,1346 und bleibt damit nicht signifikant. Oben zeigt der Rechner die Variante mit der höchsten Rate; im Diagramm steht neben jeder Variante ihr Uplift gegenüber A samt p Wert.

Die Korrektur hat ihren Preis: Sie senkt die Power, also braucht jede Variante mehr Besucher für denselben Effekt. Daher wendet auch der Reiter Stichprobe dieselbe Korrektur an, sobald Sie mehr Varianten wählen. Bei knappem Traffic teste ich lieber zwei starke Ideen als drei mittelmäßige.

Wie lesen Sie die Bayes Wahrscheinlichkeit P(B > A)?

Die Karte P(B > A) beantwortet eine andere Frage als der klassische Test: Wie wahrscheinlich ist es nach den vorliegenden Daten, dass die echte Conversion Rate von B über der von A liegt? Für jede Variante bildet das Tool eine Beta(Conversions + 1, Besucher - Conversions + 1) Verteilung und nähert die Differenz mit einer Normalverteilung an. Weil die Ausgangsannahme flach ist, bevorzugt der Rechner keine Variante.

Stakeholdern lässt sich diese Zahl am leichtesten erklären, denn „B ist mit 99,6 % Wahrscheinlichkeit besser“ versteht jeder. Trotzdem habe ich zwei Einwände:

  • Eine hohe Wahrscheinlichkeit kann mit einem winzigen Uplift einhergehen; lesen Sie sie zusammen mit dem Konfidenzintervall.
  • Auch der Bayes Ansatz schützt nicht vor frühem Abbrechen; die vorab festgelegte Stichprobe gilt hier ebenso.

Die Karte Beobachtete Power dient dagegen nur der Information, nicht der Planung. Sie hängt direkt am p Wert und belegt im Nachhinein nicht, dass ein Test groß genug war. Für neue Tests zählt immer die Power Einstellung im Reiter Stichprobe.

Wie testen Sie sauber in Google Ads und auf Landingpages?

In Google Ads teilen Experimente Traffic und Budget, sodass Sie Kampagnenänderungen sicher prüfen können. Google empfiehlt in seinen Hilfeseiten eine Aufteilung von 50 %, eine Laufzeit von mindestens 4 bis 6 Wochen und das Abwarten von 1 bis 2 Conversion Zyklen. Außerdem verwirft Google die Daten der ersten 7 Tage als Anlaufphase. Zur Gegenprobe tragen Sie Klicks und Conversions aus dem Experimentbericht in diesen Rechner ein.

Bei Landingpage Tests müssen Sie zudem die SEO schützen. Google Search Central empfiehlt für die Laufzeit diese Regeln:

  • Zeigen Sie dem Googlebot keine anderen Inhalte als den Besuchern, denn das wäre Cloaking.
  • Liegen Varianten unter eigenen URLs, setzen Sie auf allen ein Canonical Tag zur Originalseite.
  • Testen Sie per Weiterleitung, nutzen Sie eine temporäre 302 statt einer dauerhaften 301 Weiterleitung.
  • Nach dem Test schalten Sie den Gewinner live und entfernen den Testcode.

Für Kunden richte ich diesen Ablauf im Rahmen der Google Ads Betreuung ein. Die Conversion Seite beschreibe ich Schritt für Schritt im Artikel zur Conversion Rate Optimierung für Firmenwebsites. Wie sich ein Gewinner auf die Werbeprofitabilität auswirkt, zeigt Ihnen zusätzlich der ROAS Rechner.

Häufige Fehler bei der A/B Test Auswertung

  • FehlerSitzungen oder Seitenaufrufe als Besucher eintragenBesser soÖffnet eine Person mehrere Sitzungen, sind die Beobachtungen nicht unabhängig und der p Wert fällt zu klein aus. Tragen Sie daher eindeutige Nutzer ein.
  • FehlerEinstellungen nach dem Blick auf das Ergebnis ändernBesser soLegen Sie deshalb Konfidenzniveau und Testart vor dem Start fest. Wer nach dem Ergebnis auf einseitig umstellt, macht Signifikanz künstlich leicht.
  • FehlerMit wenigen Conversions entscheidenBesser soUnter 10 Conversions in einer Variante trägt die Normalapproximation nicht mehr, und der Rechner warnt. Sammeln Sie weiter Daten, bevor Sie entscheiden.
  • FehlerKonfidenz als Gewinnchance lesenBesser so99,2 % Konfidenz bedeutet nicht, dass B mit 99,2 % Wahrscheinlichkeit besser ist. Diese Frage beantwortet die Karte P(B > A).
  • FehlerVerschiedene Zeiträume vergleichenBesser soA im September gegen B im Oktober ist kein A/B Test, weil Saisoneffekte den Unterschied überdecken. Lassen Sie beide Varianten an denselben Tagen mit zufällig geteiltem Traffic laufen.

Häufig gestellte Fragen

Ein Gewinner braucht genug passenden Traffic.

A/B Tests lohnen sich nur mit qualifiziertem Traffic. Steigern wir Ihre Conversion Rate mit Google Ads Kampagnentests und Landingpage Tests auf Basis echter Daten.

Google Ads Service ansehen
WhatsApp Jetzt anrufen