Strumento gratuito

Calcolatore della dimensione del campione per test A/B

Prima di lanciare un esperimento, scopri quanti visitatori servono a ogni variante perché il risultato sia davvero affidabile. Inserisci i tuoi numeri e il calcolatore si aggiorna all'istante, tutto nel tuo browser.

31,232
visitatori necessari per variante
62,464 visitatori in totale tra le due varianti

Cosa determina il numero

Perché la dimensione del campione varia così tanto

Una baseline bassa costa traffico

Più la conversione è rara, più visitatori servono per distinguere un cambiamento reale dal rumore. In linea di massima, dimezzare il tasso di conversione di base raddoppia il traffico necessario a ogni variante.

L'effetto rilevabile è la leva principale

L'effetto minimo rilevabile entra nella formula al quadrato, quindi domina tutto il resto. Voler rilevare un aumento del 5% invece del 10% costa circa quattro volte il traffico: decidi quale dimensione di miglioramento cambierebbe davvero la tua decisione, e testa per quella.

Stabilisci la durata prima di iniziare

Converti il numero qui sopra in settimane intere di traffico, poi esegui il test per tutto quel tempo. Fermarsi appena un risultato diventa significativo è il modo più comune in cui i team rilasciano modifiche che poi non reggono.

La formula

Come si calcola la dimensione del campione di un test A/B, passo dopo passo

Il calcolatore usa la formula standard della dimensione del campione per confrontare due tassi di conversione. Per ogni variante:

n = (zα/2 + zβ)² × [p₁(1 − p₁) + p₂(1 − p₂)] ÷ (p₂ − p₁)²

  • p₁ è il tuo tasso di conversione di base, espresso come frazione.
  • p₂ è il tasso che vuoi essere in grado di rilevare: la baseline aumentata dell'effetto minimo rilevabile, quindi p₂ = p₁ × (1 + MDE).
  • zα/2 deriva dal livello di confidenza, bilaterale: 1,645 al 90%, 1,96 al 95%, 2,576 al 99%.
  • zβ deriva dalla potenza: 0,842 all'80%, 1,282 al 90%, 1,645 al 95%.

Esempio svolto: i valori predefiniti

Una baseline del 5%, un aumento relativo del 10%, confidenza al 95% e potenza all'80%:

  • p₁ = 0,05 e p₂ = 0,05 × 1,10 = 0,055, quindi la differenza da rilevare è 0,005.
  • (1,96 + 0,8416)² = 2,8016² ≈ 7,849.
  • p₁(1 − p₁) + p₂(1 − p₂) = 0,0475 + 0,051975 = 0,099475.
  • n = 7,849 × 0,099475 ÷ 0,005² ≈ 31.231,0, arrotondato per eccesso a 31.232 visitatori per variante.

Due varianti richiedono 62.464 visitatori in totale. È la cifra che il calcolatore mostra prima che tu cambi qualsiasi valore.

In sintesi

Dimensione del campione per variante con le baseline più comuni

Visitatori necessari per variante con confidenza al 95% e potenza all'80%. Leggi in orizzontale per l'aumento relativo che vuoi rilevare.

Tasso di baseAumento del 5%Aumento del 10%Aumento del 20%Aumento del 30%
1%637.014163.09442.69119.824
2%315.20780.68021.1069.795
5%122.12331.2328.1563.778
10%57.76114.7493.8391.772
20%25.5806.5071.680769

Spiccano due schemi. Dimezzare l'aumento che vuoi rilevare quadruplica circa il campione. E un passaggio con una conversione bassa, come un tasso di acquisto dell'1%, richiede un traffico diverse volte superiore rispetto a un passaggio al 10%, come un clic verso la pagina dei prezzi.

Durata del test

Quanto dovrebbe durare un test A/B?

Trasforma la dimensione del campione in una durata prima del lancio:

days = visitors per variant × number of variants ÷ daily visitors who enter the test

Poi arrotonda per eccesso a settimane intere. I visitatori dei giorni feriali e del fine settimana si comportano in modo diverso, quindi un test che termina a metà settimana dà troppo peso ad alcuni giorni.

  • Con i valori predefiniti (62.464 visitatori in totale) e 2.000 visitatori idonei al giorno: 31,2 giorni, quindi esegui il test per 5 settimane.
  • Con 5.000 visitatori idonei al giorno: 12,5 giorni, quindi esegui il test per 2 settimane.
  • Con 800 visitatori idonei al giorno: 78 giorni. È il segnale che conviene testare una modifica più grande o una pagina più frequentata (vedi sotto).

Conta solo i visitatori che raggiungono davvero la pagina o il passaggio testato, non il traffico totale del sito. Un test sul checkout include solo le persone che arrivano al checkout.

Anche con molto traffico, esegui il test per almeno una settimana intera. Decidi la data di fine in anticipo e non fermarti prima perché il risultato sembra significativo al terzo giorno. Controllare ripetutamente e fermarsi alla prima lettura significativa fa salire il tasso di falsi positivi ben oltre il livello di confidenza che hai scelto.

Confidenza e potenza

Come il livello di confidenza e la potenza statistica influiscono sul numero

La confidenza protegge dai falsi positivi: dichiarare un vincitore quando non c'è una vera differenza. Al 95%, un test tra due varianti identiche mostra un risultato “significativo” circa il 5% delle volte.

La potenza protegge dai falsi negativi: non accorgersi di un effetto reale. Con una potenza dell'80%, se l'aumento reale è esattamente il tuo effetto minimo rilevabile, il test lo rileva 8 volte su 10.

Aumentare l'una o l'altra costa traffico. Con una baseline del 5% e un aumento del 10%:

ConfidenzaPotenzaPer variantevs. predefinito
90%80%24.601−21%
95%80%31.232predefinito
95%90%41.812+34%
99%80%46.470+49%

Test unilaterali e bilaterali

Il livello di confidenza qui è bilaterale: il test può trovare la variante migliore o peggiore del controllo. Un test unilaterale al 95% usa z = 1,645, lo stesso valore del bilaterale al 90%, quindi richiede gli stessi 24.601 visitatori per variante. Questo risparmio è onesto solo se tratteresti allo stesso modo “peggiore” e “nessuna differenza”. Se una variante perdente cambierebbe ciò che fai, mantieni il test bilaterale.

Errori comuni

Errori che rendono sbagliata la dimensione del campione

  • Effetto relativo e assoluto. L'effetto minimo rilevabile qui è relativo. Portare un tasso dal 5% al 6% è un aumento relativo del 20% (8.156 per variante). Inserire 1 significherebbe dal 5% al 5,05%, che richiede circa 3 milioni per variante.
  • Contare l'unità sbagliata. La dimensione del campione conta l'unità che randomizzi e che converte. Se assegni le varianti per visitatore, conta i visitatori, non le sessioni o le visualizzazioni di pagina. Le sessioni ripetute di una stessa persona non sono campioni indipendenti.
  • Più di due varianti. La cifra è per variante, quindi un test A/B/C ne richiede il triplo. Ogni confronto aggiuntivo con il controllo aumenta anche la probabilità di un falso vincitore; una soluzione comune è dividere il tasso di errore tra i confronti, ad esempio testando ciascuno di due confronti al 97,5% invece che al 95%.
  • Traffico diluito. Se solo una parte dei visitatori inclusi vede davvero la modifica, l'effetto reale si annacqua e il test ha una potenza insufficiente. Includi le persone nel punto in cui le varianti differiscono davvero.
  • Modificare il test mentre è in corso. Modificare una variante, cambiare la ripartizione del traffico o aggiungere una variante a metà strada fa ripartire da zero.

Poco traffico

Cosa fare quando la dimensione del campione richiede più traffico di quello che hai

  • Testa una modifica più grande. Una pagina dei prezzi riprogettata può plausibilmente spostare la conversione del 20–30%; il colore di un pulsante no. Effetti più grandi richiedono campioni molto più piccoli.
  • Misura un passaggio con una conversione più alta. Testa il clic verso la registrazione invece della conversione a pagamento, poi conferma l'effetto a valle su un periodo più lungo.
  • Accetta consapevolmente una confidenza del 90%. Risparmia circa un quinto del traffico in cambio di più falsi positivi. Metti per iscritto il compromesso prima che il test inizi.
  • Non fare affatto un test A/B. Per i siti piccoli, guardare le registrazioni delle sessioni delle persone che abbandonano e verificare dove perde il funnel di solito trova il problema più in fretta di un test che non può raggiungere la significatività.

Quando il test ha completato tutta la sua durata, verifica il risultato con il calcolatore di significatività per test A/B.

FAQ

Informazioni sulla dimensione del campione

Come si calcola la dimensione del campione di un test A/B?

Questo strumento usa la formula standard per due proporzioni basata sul tuo tasso di conversione di base, sull'effetto minimo rilevabile, sul livello di confidenza scelto e sulla potenza statistica per stimare i visitatori necessari per variante.

Cos'è l'effetto minimo rilevabile?

L'effetto minimo rilevabile è la più piccola variazione relativa del tasso di conversione che vuoi che il test sia in grado di rilevare in modo affidabile. Effetti più piccoli richiedono campioni più grandi.

Perché il mio test ha bisogno di così tanti visitatori?

Tassi di base più bassi, effetti più piccoli, confidenza più alta e potenza più alta aumentano tutti la dimensione del campione necessaria per evitare falsi positivi e falsi negativi.

Qual è la formula per la dimensione del campione di un test A/B?

Per variante, n = (z per la confidenza + z per la potenza)² × [p₁(1 − p₁) + p₂(1 − p₂)] ÷ (p₂ − p₁)², dove p₁ è il tasso di base e p₂ è la baseline aumentata dell'effetto minimo rilevabile. Con confidenza al 95% e potenza all'80% i valori di z sono 1,96 e 0,842; una baseline del 5% e un aumento del 10% danno 31.232 visitatori per variante.

Cos'è la potenza statistica in un test A/B?

La potenza è la probabilità che il test rilevi un effetto quando esiste davvero, della dimensione che hai specificato. Una potenza dell'80% è il valore predefinito abituale: se l'aumento reale è pari al tuo effetto minimo rilevabile, il test lo trova 8 volte su 10 e lo manca 2 volte. Portare la potenza al 90% riduce gli errori ma richiede circa il 34% di visitatori in più.

Quanto dovrebbe durare un test A/B?

Dividi il campione totale (visitatori per variante moltiplicati per il numero di varianti) per i visitatori giornalieri che entrano nel test, poi arrotonda per eccesso a settimane intere. Esegui il test per almeno una settimana intera così ogni giorno della settimana è rappresentato, e fissa la data di fine prima di iniziare invece di fermarti quando il risultato sembra significativo per la prima volta.

L'effetto minimo rilevabile è relativo o assoluto?

Relativo. Un effetto del 10% su una baseline del 5% significa rilevare uno spostamento dal 5% al 5,5%. Per rilevare dal 5% al 6%, inserisci 20.

Posso usare questo calcolatore per più di due varianti?

Sì. Il risultato è per variante, quindi moltiplicalo per il numero di varianti, controllo incluso. Confrontare più varianti con il controllo aumenta la probabilità di un falso vincitore, quindi valuta un livello di confidenza più rigoroso per ogni confronto.

Correlati

Altro da PulsePanda

Esegui il test, poi guarda le sessioni

PulsePanda abbina i tuoi esperimenti a registrazione delle sessioni, heatmap, funnel e feedback, così capisci il perché dietro la vittoria.

Inizia gratis