Was bedeutet statistische Signifikanz eigentlich?
Sie bedeutet, dass der gemessene Unterschied wahrscheinlich kein Zufall ist. Ein p-Wert von 0,03 besagt: Wären die beiden Versionen tatsächlich identisch, würdest du eine so große (oder größere) Lücke in etwa 3 % der Fälle sehen. Das ist ein Beleg dafür, dass sich etwas verändert hat – kein Beweis und kein Maß dafür, wie groß die Veränderung ist.
Welcher p-Wert zählt als Gewinner?
Die Konvention ist p unter 0,05, was 95 % Konfidenz entspricht. Leg die Messlatte auf 99 %, wenn die Änderung teuer auszuliefern oder schwer rückgängig zu machen ist, und akzeptiere 90 % bei risikoarmen Textänderungen, bei denen schnell ungefähr richtig zu liegen mehr wert ist, als langsam sicher zu sein.
Kann ich den Test stoppen, sobald er signifikant wird?
Nein. Wiederholt nachzusehen und beim ersten grünen Ergebnis aufzuhören – sogenanntes Peeking – treibt falsch positive Ergebnisse stark in die Höhe. Lege die Stichprobengröße vor dem Start fest, lass den Test so lange laufen und lies das Ergebnis dann einmal ab. Der Stichprobenrechner liefert dir diese Zahl.
Sendet dieser Rechner meine Daten irgendwohin?
Nein. Der gesamte Test läuft mit reinem JavaScript in deinem Browser. Nichts, was du eingibst, wird hochgeladen, protokolliert oder gespeichert, und die Seite funktioniert nach dem Laden auch offline.
Wie berechnet man die statistische Signifikanz eines A/B-Tests?
Mit einem Zwei-Anteile-z-Test. Berechne jede Conversion-Rate, die gepoolte Rate über beide Varianten und den Standardfehler √[p(1 − p)(1/n₁ + 1/n₂)]. Teile den Unterschied der Raten durch den Standardfehler, um z zu erhalten, und rechne z in einen p-Wert um. 250/5.000 gegen 300/5.000 ergibt z ≈ 2,19 und einen zweiseitigen p-Wert von 0,028, signifikant bei 95 %.
Was ist ein p-Wert beim A/B-Testing?
Die Wahrscheinlichkeit, einen mindestens so großen Unterschied wie den gemessenen zu sehen, wenn beide Versionen tatsächlich gleich gut abgeschnitten hätten. Ein p-Wert von 0,03 bedeutet, dass eine so große Lücke allein durch Zufall in etwa 3 % der Fälle auftreten würde. Er ist nicht die Wahrscheinlichkeit, dass B besser ist, und er misst nicht die Größe des Effekts.
Warum ist mein Test nicht signifikant, obwohl B besser konvertiert hat?
Meist, weil die Stichprobe für die Größe des Unterschieds zu klein ist. Ein Ergebnis von 5 % → 6 % ist mit 2.500 Besuchern pro Variante nicht signifikant (p = 0,12), mit 5.000 aber schon (p = 0,028). Prüfe die geplante Stichprobengröße, bevor du ein flaches Ergebnis als „kein Effekt“ liest.
Sollte ich einen einseitigen oder zweiseitigen Test nutzen?
Zweiseitig, es sei denn, du hast vor dem Test entschieden, dass ein Verlust und keine Veränderung zur selben Entscheidung führen würden. Einseitig halbiert den p-Wert, wenn B vorn liegt (0,028 wird im Standardbeispiel zu 0,014) – deshalb ist es nicht legitim, nach dem Blick auf die Daten darauf umzusteigen.
Kann ich diesen Rechner für mehr als zwei Varianten nutzen?
Ja, indem du jede Variante einzeln mit der Kontrolle vergleichst. Jeder zusätzliche Vergleich erhöht die Wahrscheinlichkeit eines falschen Gewinners, nutze also pro Vergleich eine strengere Schwelle: Bei zwei Varianten gegen die Kontrolle teste jede mit 97,5 % statt 95 % Konfidenz.