Kostenloses Tool

Stichprobenrechner für A/B-Tests

Bevor du ein Experiment startest, finde heraus, wie viele Besucher jede Variante braucht, damit das Ergebnis wirklich belastbar ist. Gib deine Zahlen ein, und der Rechner aktualisiert sich sofort, alles in deinem Browser.

31,232
benötigte Besucher pro Variante
62,464 Besucher insgesamt über zwei Varianten

Was die Zahl bestimmt

Warum sich die Stichprobengröße so stark verändert

Eine niedrige Basis kostet Traffic

Je seltener die Conversion, desto mehr Besucher braucht es, um eine echte Änderung von Rauschen zu unterscheiden. Grob gesagt: Halbierst du deine Basis-Conversion-Rate, verdoppelt sich der Traffic, den jede Variante braucht.

Der nachweisbare Effekt ist der große Hebel

Der minimal nachweisbare Effekt geht quadriert in die Formel ein und dominiert daher alles andere. Eine Steigerung von 5 % statt 10 % nachweisen zu wollen, kostet etwa viermal so viel Traffic – entscheide, welche Größe eines Gewinns deine Entscheidung tatsächlich ändern würde, und teste darauf.

Die Laufzeit vor dem Start festlegen

Rechne die Zahl oben in ganze Wochen Traffic um und lass den Test so lange laufen. Aufzuhören, sobald ein Ergebnis signifikant wird, ist der häufigste Grund, warum Teams Änderungen ausliefern, die nicht halten.

Die Formel

Wie die Stichprobengröße für A/B-Tests berechnet wird, Schritt für Schritt

Der Rechner nutzt die Standardformel für die Stichprobengröße beim Vergleich zweier Conversion-Raten. Für jede Variante gilt:

n = (zα/2 + zβ)² × [p₁(1 − p₁) + p₂(1 − p₂)] ÷ (p₂ − p₁)²

  • p₁ ist deine Basis-Conversion-Rate als Bruchzahl.
  • p₂ ist die Rate, die du erkennen können willst: die Basis, erhöht um den minimal nachweisbaren Effekt, also p₂ = p₁ × (1 + MDE).
  • zα/2 ergibt sich aus dem Konfidenzniveau, zweiseitig: 1,645 bei 90 %, 1,96 bei 95 %, 2,576 bei 99 %.
  • zβ ergibt sich aus der Teststärke: 0,842 bei 80 %, 1,282 bei 90 %, 1,645 bei 95 %.

Rechenbeispiel: die Standardeingaben

5 % Basis, 10 % relative Steigerung, 95 % Konfidenz und 80 % Teststärke:

  • p₁ = 0,05 und p₂ = 0,05 × 1,10 = 0,055, der zu erkennende Unterschied ist also 0,005.
  • (1,96 + 0,8416)² = 2,8016² ≈ 7,849.
  • p₁(1 − p₁) + p₂(1 − p₂) = 0,0475 + 0,051975 = 0,099475.
  • n = 7,849 × 0,099475 ÷ 0,005² ≈ 31.231,0, aufgerundet auf 31.232 Besucher pro Variante.

Zwei Varianten brauchen insgesamt 62.464 Besucher. Das ist die Zahl, die der Rechner anzeigt, bevor du etwas änderst.

Auf einen Blick

Stichprobengröße pro Variante für gängige Basisraten

Benötigte Besucher pro Variante bei 95 % Konfidenz und 80 % Teststärke. Lies in der Zeile die relative Steigerung ab, die du erkennen willst.

Basisrate5 % Steigerung10 % Steigerung20 % Steigerung30 % Steigerung
1 %637.014163.09442.69119.824
2 %315.20780.68021.1069.795
5 %122.12331.2328.1563.778
10 %57.76114.7493.8391.772
20 %25.5806.5071.680769

Zwei Muster fallen auf. Halbierst du die Steigerung, die du erkennen willst, vervierfacht sich die Stichprobe ungefähr. Und ein Schritt mit niedriger Conversion, etwa eine Kaufrate von 1 %, braucht ein Vielfaches des Traffics eines Schritts mit 10 %, etwa eines Klicks zur Preisseite.

Testdauer

Wie lange sollte ein A/B-Test laufen?

Rechne die Stichprobengröße vor dem Start in eine Dauer um:

days = visitors per variant × number of variants ÷ daily visitors who enter the test

Runde dann auf ganze Wochen auf. Besucher an Werktagen und am Wochenende verhalten sich unterschiedlich, sodass ein Test, der mitten in der Woche endet, manche Tage übergewichtet.

  • Mit den Standardwerten (insgesamt 62.464 Besucher) und 2.000 berechtigten Besuchern pro Tag: 31,2 Tage, also 5 Wochen laufen lassen.
  • Mit 5.000 berechtigten Besuchern pro Tag: 12,5 Tage, also 2 Wochen laufen lassen.
  • Mit 800 berechtigten Besuchern pro Tag: 78 Tage. Das ist ein Zeichen, eine größere Änderung oder eine stärker besuchte Seite zu testen (siehe unten).

Zähle nur Besucher, die die getestete Seite oder den getesteten Schritt tatsächlich erreichen, nicht den gesamten Traffic der Website. Ein Checkout-Test erfasst nur Menschen, die den Checkout erreichen.

Lass den Test auch bei viel Traffic mindestens eine volle Woche laufen. Leg das Enddatum vorab fest und hör nicht früher auf, weil das Ergebnis am dritten Tag signifikant aussieht. Wiederholt nachzusehen und beim ersten signifikanten Wert aufzuhören, treibt die Rate falsch positiver Ergebnisse weit über das gewählte Konfidenzniveau.

Konfidenz und Teststärke

Was Konfidenzniveau und statistische Teststärke mit der Zahl machen

Konfidenz schützt vor falsch positiven Ergebnissen: einen Gewinner auszurufen, obwohl es keinen echten Unterschied gibt. Bei 95 % zeigt ein Test zweier identischer Varianten in etwa 5 % der Fälle ein „signifikantes“ Ergebnis.

Teststärke schützt vor falsch negativen Ergebnissen: einen echten Effekt zu übersehen. Bei 80 % Teststärke erkennt der Test eine tatsächliche Steigerung genau in Höhe deines minimal nachweisbaren Effekts in 8 von 10 Fällen.

Beides zu erhöhen kostet Traffic. Mit 5 % Basis und 10 % Steigerung:

KonfidenzTeststärkePro Variantevs. Standard
90 %80 %24.601−21 %
95 %80 %31.232Standard
95 %90 %41.812+34 %
99 %80 %46.470+49 %

Einseitige vs. zweiseitige Tests

Das Konfidenzniveau hier ist zweiseitig: Der Test kann die Variante als besser oder schlechter als die Kontrolle erkennen. Ein einseitiger Test bei 95 % nutzt z = 1,645, denselben Wert wie zweiseitig bei 90 %, und braucht daher dieselben 24.601 Besucher pro Variante. Diese Ersparnis ist nur ehrlich, wenn du „schlechter“ und „kein Unterschied“ gleich behandeln würdest. Wenn eine unterlegene Variante dein Handeln ändern würde, bleib beim zweiseitigen Test.

Häufige Fehler

Fehler, die die Stichprobengröße verfälschen

  • Relativer vs. absoluter Effekt. Der minimal nachweisbare Effekt ist hier relativ. Eine Rate von 5 % auf 6 % zu bringen, ist eine relative Steigerung von 20 % (8.156 pro Variante). Würdest du 1 eingeben, hieße das 5 % auf 5,05 %, was etwa 3 Millionen pro Variante erfordert.
  • Die falsche Einheit zählen. Die Stichprobengröße zählt die Einheit, die du zufällig zuteilst und die konvertiert. Wenn du Varianten pro Besucher zuteilst, zähle Besucher, nicht Sessions oder Seitenaufrufe. Wiederholte Sessions derselben Person sind keine unabhängigen Stichproben.
  • Mehr als zwei Varianten. Die Zahl gilt pro Variante, ein A/B/C-Test braucht also das Dreifache. Jeder zusätzliche Vergleich mit der Kontrolle erhöht außerdem die Wahrscheinlichkeit eines falschen Gewinners; eine gängige Lösung ist, die Fehlerrate auf die Vergleiche aufzuteilen und etwa jeden von zwei Vergleichen mit 97,5 % statt 95 % zu testen.
  • Verwässerter Traffic. Wenn nur ein Teil der einbezogenen Besucher die Änderung überhaupt sieht, wird der echte Effekt verwässert, und der Test hat zu wenig Teststärke. Beziehe Menschen an der Stelle ein, an der sich die Varianten tatsächlich unterscheiden.
  • Den Test während der Laufzeit ändern. Eine Variante zu bearbeiten, die Traffic-Aufteilung zu ändern oder auf halbem Weg eine Variante hinzuzufügen, setzt die Uhr zurück.

Wenig Traffic

Was tun, wenn die Stichprobengröße mehr Traffic verlangt, als du hast

  • Teste eine größere Änderung. Eine neu gestaltete Preisseite kann die Conversion plausibel um 20–30 % bewegen; eine Buttonfarbe nicht. Größere Effekte brauchen viel kleinere Stichproben.
  • Miss einen Schritt mit höherer Conversion. Teste den Klick zur Registrierung statt der bezahlten Conversion und bestätige dann den nachgelagerten Effekt über einen längeren Zeitraum.
  • Akzeptiere 90 % Konfidenz bewusst. Das spart etwa ein Fünftel des Traffics, im Tausch gegen mehr falsch positive Ergebnisse. Halte die Abwägung vor dem Teststart schriftlich fest.
  • Verzichte ganz auf A/B-Tests. Bei kleinen Websites findet man das Problem meist schneller, wenn man sich Session Replays von Menschen ansieht, die abspringen, und prüft, wo der Funnel leckt, als mit einem Test, der nie Signifikanz erreicht.

Wenn der Test seine volle Laufzeit hinter sich hat, prüfe das Ergebnis mit dem Signifikanzrechner für A/B-Tests.

FAQ

Über die Stichprobengröße

Wie wird die Stichprobengröße für einen A/B-Test berechnet?

Dieses Tool nutzt die Standardformel für zwei Anteile auf Basis deiner Basis-Conversion-Rate, des minimal nachweisbaren Effekts, des gewählten Konfidenzniveaus und der statistischen Teststärke, um die benötigten Besucher pro Variante zu schätzen.

Was ist ein minimal nachweisbarer Effekt?

Der minimal nachweisbare Effekt ist die kleinste relative Änderung der Conversion-Rate, die der Test zuverlässig erkennen soll. Kleinere Effekte erfordern größere Stichproben.

Warum braucht mein Test so viele Besucher?

Niedrigere Basisraten, kleinere Effekte, höhere Konfidenz und höhere Teststärke erhöhen alle die nötige Stichprobengröße, um falsch positive und falsch negative Ergebnisse zu vermeiden.

Wie lautet die Formel für die Stichprobengröße eines A/B-Tests?

Pro Variante gilt n = (z für Konfidenz + z für Teststärke)² × [p₁(1 − p₁) + p₂(1 − p₂)] ÷ (p₂ − p₁)², wobei p₁ die Basisrate ist und p₂ die um den minimal nachweisbaren Effekt erhöhte Basis. Bei 95 % Konfidenz und 80 % Teststärke sind die z-Werte 1,96 und 0,842; 5 % Basis und 10 % Steigerung ergeben 31.232 Besucher pro Variante.

Was ist die statistische Teststärke bei einem A/B-Test?

Die Teststärke ist die Wahrscheinlichkeit, dass der Test einen Effekt erkennt, wenn er in der angegebenen Größe tatsächlich existiert. 80 % Teststärke ist der übliche Standard: Entspricht die echte Steigerung deinem minimal nachweisbaren Effekt, findet der Test sie in 8 von 10 Fällen und übersieht sie in 2. Die Teststärke auf 90 % zu erhöhen, verringert die Fehltreffer, braucht aber etwa 34 % mehr Besucher.

Wie lange sollte ein A/B-Test laufen?

Teile die gesamte Stichprobe (Besucher pro Variante mal Anzahl der Varianten) durch die täglichen Besucher, die in den Test kommen, und runde dann auf ganze Wochen auf. Lass ihn mindestens eine volle Woche laufen, damit jeder Wochentag vertreten ist, und leg das Enddatum vor dem Start fest, statt aufzuhören, sobald das Ergebnis zum ersten Mal signifikant aussieht.

Ist der minimal nachweisbare Effekt relativ oder absolut?

Relativ. Ein Effekt von 10 % bei 5 % Basis bedeutet, eine Bewegung von 5 % auf 5,5 % zu erkennen. Um 5 % auf 6 % zu erkennen, gib 20 ein.

Kann ich diesen Rechner für mehr als zwei Varianten nutzen?

Ja. Das Ergebnis gilt pro Variante, also multipliziere es mit der Anzahl der Varianten einschließlich der Kontrolle. Mehrere Varianten mit der Kontrolle zu vergleichen, erhöht die Wahrscheinlichkeit eines falschen Gewinners, erwäge also für jeden Vergleich ein strengeres Konfidenzniveau.

Verwandt

Mehr von PulsePanda

Führe den Test durch und sieh dir dann die Sessions an

PulsePanda kombiniert deine Experimente mit Session Replay, Heatmaps, Funnels und Feedback, damit du das Warum hinter dem Gewinn verstehst.

Kostenlos starten