Kostenloses Tool

Signifikanzrechner für A/B-Tests

Dein Test ist abgeschlossen – aber hat die Variante wirklich gewonnen? Gib Besucher und Conversions für jede Version ein und sieh den p-Wert, das Konfidenzintervall und ein Urteil in klaren Worten. Alles wird während der Eingabe in deinem Browser berechnet.

+20.0%

Die Variante schlägt die Kontrolle – der Unterschied ist statistisch signifikant.

p = 0.0283 bei 95 % Konfidenz

Rate Kontrolle
5.00%
Rate Variante
6.00%
p-Wert
0.0283
Spanne des Unterschieds
+0.1% … +1.9%

Die Mathematik

Wie die statistische Signifikanz eines A/B-Tests berechnet wird

Der Rechner führt einen Zwei-Anteile-z-Test durch, den Standardtest zum Vergleich zweier Conversion-Raten:

  • Conversion-Raten: p₁ = conversions A ÷ visitors A und p₂ = conversions B ÷ visitors B.
  • Gepoolte Rate, unter der vorläufigen Annahme, dass A und B gleich sind: p = (conversions A + conversions B) ÷ (visitors A + visitors B).
  • Standardfehler des Unterschieds: SE = √[p(1 − p) × (1/n₁ + 1/n₂)].
  • Teststatistik: z = (p₂ − p₁) ÷ SE. Der p-Wert ist die Wahrscheinlichkeit eines mindestens so weit von null entfernten z, wenn es keinen echten Unterschied gäbe.

Rechenbeispiel: die Standardeingaben

  • A: 250 Conversions bei 5.000 Besuchern = 5,00 %. B: 300 bei 5.000 = 6,00 %. Das ist eine relative Steigerung von 20 %.
  • Gepoolte Rate: 550 ÷ 10.000 = 0,055.
  • SE = √(0,055 × 0,945 × (1/5.000 + 1/5.000)) ≈ 0,00456.
  • z = 0,01 ÷ 0,00456 ≈ 2,19, was einen zweiseitigen p-Wert von 0,0283 ergibt.

0,0283 liegt unter 0,05, bei 95 % Konfidenz ist B also ein signifikanter Gewinner. Bei 99 % Konfidenz nicht: Dafür muss p unter 0,01 liegen.

Das Ergebnis lesen

Was p-Wert, Steigerung und Konfidenzintervall dir jeweils sagen

  • p-Wert. Wie überraschend die Lücke wäre, wenn A und B tatsächlich identisch wären. Er sagt nichts darüber, wie groß der Effekt ist. Eine winzige, nutzlose Steigerung kann bei genug Traffic einen winzigen p-Wert haben.
  • Steigerung. Die relative Veränderung von A zu B: (6,00 % − 5,00 %) ÷ 5,00 % = +20 % im Beispiel. Sie ist deine beste Einzelschätzung, aber sie schwankt.
  • Konfidenzintervall. Die Spanne der echten Unterschiede, die zu den Daten passen, in Prozentpunkten. Für das Beispiel bei 95 % reicht es von etwa +0,1 bis +1,9 Punkten: B ist besser, aber der echte Gewinn könnte irgendwo zwischen fast nichts und fast dem Doppelten des Gemessenen liegen. Nutze es, um zu entscheiden, ob sich die Änderung lohnt, nicht nur, ob sie echt ist.

Wenn das Intervall die Null überschreitet, ist das Ergebnis auf diesem Konfidenzniveau nicht signifikant. Bei 99 % reicht das Intervall des Beispiels von −0,2 bis +2,2 Punkten, und genau deshalb scheitert es dort.

Stichprobengröße

Warum dieselbe Steigerung signifikant sein kann oder nicht

Dasselbe Ergebnis von 5 % → 6 % (eine Steigerung von 20 %) mit unterschiedlich vielen Besuchern pro Variante:

Besucher pro Variantezp-Wert (zweiseitig)95-%-Intervall (Punkte)
1.0000,980,327−1,0 bis +3,0
2.5001,550,121−0,3 bis +2,3
5.0002,190,028+0,1 bis +1,9
10.0003,100,002+0,4 bis +1,6
20.0004,39< 0,0001+0,6 bis +1,4

Ein „nicht signifikantes“ Ergebnis bei 1.000 Besuchern heißt nicht, dass B keinen Unterschied gemacht hat. Es heißt, dass der Test zu klein war, um es zu sagen. Berechne vor dem Start mit dem Stichprobenrechner, wie viel Traffic du brauchst: Eine Steigerung von 20 % bei 5 % Basis braucht 8.156 Besucher pro Variante bei 95 % Konfidenz und 80 % Teststärke.

Vor dem Ausliefern

Prüfungen, bevor du einem signifikanten Ergebnis traust

  • Du hast die geplante Stichprobe erreicht. Beim ersten Mal aufzuhören, wenn p unter 0,05 fällt, treibt falsch positive Ergebnisse weit über 5 %. Lies das Ergebnis einmal ab, bei der vorab gewählten Stichprobengröße.
  • Die Aufteilung stimmt mit deiner Einstellung überein. Bei einem 50/50-Test sind 5.000 gegen 4.700 Besucher zu ungleich, um Zufall zu sein (Chi-Quadrat p ≈ 0,002). Ein Sample Ratio Mismatch bedeutet meist, dass eine Weiterleitung, ein Bot-Filter oder ein Tracking-Fehler die Besucher einer Variante verliert, und den Conversion-Raten ist nicht zu trauen.
  • Er lief ganze Wochen. Besucher an Werktagen und am Wochenende konvertieren unterschiedlich; ein Test, der mitten in der Woche endet, übergewichtet manche Tage.
  • Die Steigerung lohnt sich. Sieh dir das untere Ende des Intervalls an. Wenn der kleinste plausible Gewinn die Änderung nicht rechtfertigen würde, ist ein signifikantes Ergebnis kein Grund, sie auszuliefern.
  • Du hast nicht danach gesucht. Einen flachen Test so lange nach Gerät, Land und Quelle aufzuschneiden, bis ein Segment signifikant wird, ist ein zuverlässiger Weg, ein falsch positives Ergebnis zu finden. Teste ein Segment nur, wenn du es geplant hattest.

Kein Gewinner

Was tun, wenn das Ergebnis nicht signifikant ist

  • Prüfe, ob der Test den Effekt überhaupt finden konnte. Wenn du weniger Besucher hattest, als der Stichprobenrechner verlangt, hatte der Test zu wenig Teststärke, und das ehrliche Urteil lautet „unbekannt“, nicht „kein Unterschied“.
  • Lies das Intervall. Ein Intervall von −0,3 bis +2,3 Punkten schließt einen großen Verlust aus, lässt aber einen lohnenden Gewinn möglich. Das kann das Ausliefern einer risikoarmen Änderung trotzdem rechtfertigen – als Ermessensentscheidung, nicht als Testergebnis.
  • Verlängere den Test nicht immer weiter. Traffic hinzuzufügen, bis er signifikant wird, ist Peeking mit Zusatzschritten. Plane stattdessen einen neuen Test mit einer größeren Änderung oder einer stärker besuchten Seite.
  • Finde heraus, warum sich nichts bewegt hat. Sieh dir Session Replays von Besuchern in jeder Variante an und prüfe, wo der Funnel sie verliert. Eine Variante, die niemand bemerkt hat, ist ein anderes Problem als eine, die Menschen bemerkt und ignoriert haben.

FAQ

Über statistische Signifikanz

Was bedeutet statistische Signifikanz eigentlich?

Sie bedeutet, dass der gemessene Unterschied wahrscheinlich kein Zufall ist. Ein p-Wert von 0,03 besagt: Wären die beiden Versionen tatsächlich identisch, würdest du eine so große (oder größere) Lücke in etwa 3 % der Fälle sehen. Das ist ein Beleg dafür, dass sich etwas verändert hat – kein Beweis und kein Maß dafür, wie groß die Veränderung ist.

Welcher p-Wert zählt als Gewinner?

Die Konvention ist p unter 0,05, was 95 % Konfidenz entspricht. Leg die Messlatte auf 99 %, wenn die Änderung teuer auszuliefern oder schwer rückgängig zu machen ist, und akzeptiere 90 % bei risikoarmen Textänderungen, bei denen schnell ungefähr richtig zu liegen mehr wert ist, als langsam sicher zu sein.

Kann ich den Test stoppen, sobald er signifikant wird?

Nein. Wiederholt nachzusehen und beim ersten grünen Ergebnis aufzuhören – sogenanntes Peeking – treibt falsch positive Ergebnisse stark in die Höhe. Lege die Stichprobengröße vor dem Start fest, lass den Test so lange laufen und lies das Ergebnis dann einmal ab. Der Stichprobenrechner liefert dir diese Zahl.

Sendet dieser Rechner meine Daten irgendwohin?

Nein. Der gesamte Test läuft mit reinem JavaScript in deinem Browser. Nichts, was du eingibst, wird hochgeladen, protokolliert oder gespeichert, und die Seite funktioniert nach dem Laden auch offline.

Wie berechnet man die statistische Signifikanz eines A/B-Tests?

Mit einem Zwei-Anteile-z-Test. Berechne jede Conversion-Rate, die gepoolte Rate über beide Varianten und den Standardfehler √[p(1 − p)(1/n₁ + 1/n₂)]. Teile den Unterschied der Raten durch den Standardfehler, um z zu erhalten, und rechne z in einen p-Wert um. 250/5.000 gegen 300/5.000 ergibt z ≈ 2,19 und einen zweiseitigen p-Wert von 0,028, signifikant bei 95 %.

Was ist ein p-Wert beim A/B-Testing?

Die Wahrscheinlichkeit, einen mindestens so großen Unterschied wie den gemessenen zu sehen, wenn beide Versionen tatsächlich gleich gut abgeschnitten hätten. Ein p-Wert von 0,03 bedeutet, dass eine so große Lücke allein durch Zufall in etwa 3 % der Fälle auftreten würde. Er ist nicht die Wahrscheinlichkeit, dass B besser ist, und er misst nicht die Größe des Effekts.

Warum ist mein Test nicht signifikant, obwohl B besser konvertiert hat?

Meist, weil die Stichprobe für die Größe des Unterschieds zu klein ist. Ein Ergebnis von 5 % → 6 % ist mit 2.500 Besuchern pro Variante nicht signifikant (p = 0,12), mit 5.000 aber schon (p = 0,028). Prüfe die geplante Stichprobengröße, bevor du ein flaches Ergebnis als „kein Effekt“ liest.

Sollte ich einen einseitigen oder zweiseitigen Test nutzen?

Zweiseitig, es sei denn, du hast vor dem Test entschieden, dass ein Verlust und keine Veränderung zur selben Entscheidung führen würden. Einseitig halbiert den p-Wert, wenn B vorn liegt (0,028 wird im Standardbeispiel zu 0,014) – deshalb ist es nicht legitim, nach dem Blick auf die Daten darauf umzusteigen.

Kann ich diesen Rechner für mehr als zwei Varianten nutzen?

Ja, indem du jede Variante einzeln mit der Kontrolle vergleichst. Jeder zusätzliche Vergleich erhöht die Wahrscheinlichkeit eines falschen Gewinners, nutze also pro Vergleich eine strengere Schwelle: Bei zwei Varianten gegen die Kontrolle teste jede mit 97,5 % statt 95 % Konfidenz.

Verwandt

Mehr von PulsePanda

Sieh, warum der Gewinner gewonnen hat

Ein p-Wert sagt dir, dass sich etwas verändert hat. Session Replay, Heatmaps und Funnels von PulsePanda zeigen dir, was Menschen tatsächlich getan haben.

Kostenlos starten