Strumento gratuito

Calcolatore di significatività per test A/B

Il tuo test è finito, ma la variante ha davvero vinto? Inserisci visitatori e conversioni di ogni versione e vedi il p-value, l'intervallo di confidenza e un verdetto in parole semplici. Tutto viene calcolato nel tuo browser mentre scrivi.

+20.0%

La variante batte il controllo: la differenza è statisticamente significativa.

p = 0.0283 con confidenza al 95%

Tasso del controllo
5.00%
Tasso della variante
6.00%
p-value
0.0283
Intervallo della differenza
+0.1% … +1.9%

La matematica

Come si calcola la significatività statistica di un test A/B

Il calcolatore esegue uno z-test per due proporzioni, il test standard per confrontare due tassi di conversione:

  • Tassi di conversione: p₁ = conversions A ÷ visitors A e p₂ = conversions B ÷ visitors B.
  • Tasso combinato, assumendo per il momento che A e B siano uguali: p = (conversions A + conversions B) ÷ (visitors A + visitors B).
  • Errore standard della differenza: SE = √[p(1 − p) × (1/n₁ + 1/n₂)].
  • Statistica del test: z = (p₂ − p₁) ÷ SE. Il p-value è la probabilità di ottenere una z almeno così lontana da zero se non ci fosse una vera differenza.

Esempio svolto: i valori predefiniti

  • A: 250 conversioni su 5.000 visitatori = 5,00%. B: 300 su 5.000 = 6,00%. È un aumento relativo del 20%.
  • Tasso combinato: 550 ÷ 10.000 = 0,055.
  • SE = √(0,055 × 0,945 × (1/5.000 + 1/5.000)) ≈ 0,00456.
  • z = 0,01 ÷ 0,00456 ≈ 2,19, che dà un p-value bilaterale di 0,0283.

0,0283 è sotto 0,05, quindi con confidenza al 95% B è un vincitore significativo. Con confidenza al 99% non lo è: servirebbe un p sotto 0,01.

Leggere il risultato

Cosa ti dicono il p-value, l'aumento e l'intervallo di confidenza

  • p-value. Quanto sarebbe sorprendente lo scarto se A e B fossero davvero identici. Non dice nulla su quanto sia grande l'effetto. Un aumento minimo e inutile può avere un p-value minimo con abbastanza traffico.
  • Aumento. La variazione relativa da A a B: (6,00% − 5,00%) ÷ 5,00% = +20% nell'esempio. È la tua stima singola migliore, ma è rumorosa.
  • Intervallo di confidenza. L'intervallo delle differenze reali compatibili con i dati, in punti percentuali. Per l'esempio al 95% va da circa +0,1 a +1,9 punti: B è migliore, ma il guadagno reale potrebbe essere qualsiasi cosa da quasi nulla a quasi il doppio di quanto hai misurato. Usalo per decidere se vale la pena rilasciare la modifica, non solo se è reale.

Se l'intervallo attraversa lo zero, il risultato non è significativo a quel livello di confidenza. Al 99% l'intervallo dell'esempio va da −0,2 a +2,2 punti, ed è proprio per questo che lì non supera il test.

Dimensione del campione

Perché lo stesso aumento può essere significativo o no

Lo stesso risultato dal 5% al 6% (un aumento del 20%), con un numero diverso di visitatori per variante:

Visitatori per variantezp-value (bilaterale)Intervallo al 95% (punti)
1.0000,980,327da −1,0 a +3,0
2.5001,550,121da −0,3 a +2,3
5.0002,190,028da +0,1 a +1,9
10.0003,100,002da +0,4 a +1,6
20.0004,39< 0,0001da +0,6 a +1,4

Un risultato “non significativo” con 1.000 visitatori non significa che B non abbia fatto alcuna differenza. Significa che il test era troppo piccolo per dirlo. Calcola il traffico che ti serve prima del lancio con il calcolatore della dimensione del campione: un aumento del 20% su una baseline del 5% richiede 8.156 visitatori per variante con confidenza al 95% e potenza all'80%.

Prima di rilasciare

Controlli da fare prima di fidarti di un risultato significativo

  • Hai raggiunto il campione previsto. Fermarsi la prima volta che p scende sotto 0,05 fa salire i falsi positivi ben oltre il 5%. Leggi il risultato una sola volta, alla dimensione del campione che hai scelto in anticipo.
  • La ripartizione è quella che hai impostato. In un test 50/50, 5.000 contro 4.700 visitatori è una differenza troppo grande per essere casuale (chi-quadrato p ≈ 0,002). Una discrepanza nel rapporto del campione di solito significa che un reindirizzamento, un filtro per i bot o un bug di tracciamento sta perdendo i visitatori di una variante, e i tassi di conversione non sono affidabili.
  • Ha coperto settimane intere. I visitatori dei giorni feriali e del fine settimana convertono in modo diverso; un test che termina a metà settimana dà troppo peso ad alcuni giorni.
  • Vale la pena avere quell'aumento. Guarda l'estremo inferiore dell'intervallo. Se il guadagno minimo plausibile non ripagherebbe la modifica, un risultato significativo non è un motivo per rilasciarla.
  • Non sei andato a cercarlo. Suddividere un test piatto per dispositivo, paese e sorgente finché un segmento non diventa significativo è un modo sicuro per trovare un falso positivo. Testa un segmento solo se l'avevi pianificato.

Nessun vincitore

Cosa fare quando il risultato non è significativo

  • Verifica se il test poteva rilevare l'effetto. Se avevi meno visitatori di quanti ne chiede il calcolatore della dimensione del campione, il test aveva una potenza insufficiente e il verdetto onesto è “sconosciuto”, non “nessuna differenza”.
  • Leggi l'intervallo. Un intervallo da −0,3 a +2,3 punti esclude una perdita importante ma lascia possibile un guadagno interessante. Può comunque giustificare il rilascio di una modifica a basso rischio, come scelta ragionata più che come risultato del test.
  • Non continuare a prolungare il test. Aggiungere traffico finché non diventa significativo è peeking con qualche passaggio in più. Pianifica invece un nuovo test con una modifica più grande o una pagina più frequentata.
  • Scopri perché non si è mosso nulla. Guarda le registrazioni delle sessioni dei visitatori di ogni variante e verifica dove il funnel li perde. Una variante che nessuno ha notato è un problema diverso da una che le persone hanno notato e ignorato.

FAQ

Informazioni sulla significatività statistica

Cosa significa davvero significatività statistica?

Significa che la differenza che hai misurato difficilmente è un caso. Un p-value di 0,03 dice che, se le due versioni fossero davvero identiche, vedresti uno scarto così grande (o più grande) circa il 3% delle volte. È una prova che qualcosa è cambiato, non una certezza, e non misura quanto sia grande il cambiamento.

Quale p-value indica un vincitore?

La convenzione è p sotto 0,05, che corrisponde a una confidenza del 95%. Alza l'asticella al 99% quando la modifica è costosa da rilasciare o difficile da annullare, e accetta il 90% per piccole modifiche ai testi a basso rischio, dove avere ragione più o meno in fretta vale più che essere certi lentamente.

Posso fermare il test non appena diventa significativo?

No. Controllare ripetutamente e fermarsi al primo risultato positivo (il cosiddetto peeking) gonfia molto i falsi positivi. Decidi la dimensione del campione prima del lancio, arriva fino a quella, poi leggi il risultato una sola volta. Il calcolatore della dimensione del campione ti dà quel numero.

Questo calcolatore invia i miei dati da qualche parte?

No. L'intero test viene eseguito nel tuo browser con semplice JavaScript. Niente di ciò che scrivi viene caricato, registrato o salvato, e la pagina funziona offline una volta caricata.

Come si calcola la significatività statistica di un test A/B?

Usa uno z-test per due proporzioni. Calcola ciascun tasso di conversione, il tasso combinato delle due varianti e l'errore standard √[p(1 − p)(1/n₁ + 1/n₂)]. Dividi la differenza tra i tassi per l'errore standard per ottenere z, e converti z in un p-value. 250/5.000 contro 300/5.000 dà z ≈ 2,19 e un p-value bilaterale di 0,028, significativo al 95%.

Cos'è un p-value nei test A/B?

La probabilità di osservare una differenza grande almeno quanto quella che hai misurato se le due versioni avessero in realtà lo stesso rendimento. Un p-value di 0,03 significa che uno scarto così grande comparirebbe circa il 3% delle volte solo per caso. Non è la probabilità che B sia migliore, e non misura la dimensione dell'effetto.

Perché il mio test non è significativo se B ha convertito meglio?

Di solito perché il campione è troppo piccolo per la dimensione della differenza. Un risultato dal 5% al 6% non è significativo con 2.500 visitatori per variante (p = 0,12) ma lo è con 5.000 (p = 0,028). Controlla la dimensione del campione prevista prima di leggere un risultato piatto come “nessun effetto”.

Dovrei usare un test unilaterale o bilaterale?

Bilaterale, a meno che tu non abbia deciso prima del test che una perdita e nessun cambiamento porterebbero alla stessa decisione. Il test unilaterale dimezza il p-value quando B è in vantaggio (0,028 diventa 0,014 nell'esempio predefinito), ed è per questo che passarci dopo aver visto i dati non è legittimo.

Posso usare questo calcolatore per più di due varianti?

Sì, confrontando separatamente ogni variante con il controllo. Ogni confronto aggiuntivo aumenta la probabilità di un falso vincitore, quindi usa una soglia più rigorosa per ogni confronto: con due varianti contro il controllo, testa ciascuna al 97,5% di confidenza invece che al 95%.

Correlati

Altro da PulsePanda

Scopri perché il vincitore ha vinto

Un p-value ti dice che qualcosa è cambiato. La registrazione delle sessioni, le heatmap e i funnel di PulsePanda ti dicono cosa hanno fatto davvero le persone.

Inizia gratis