Cosa significa davvero significatività statistica?
Significa che la differenza che hai misurato difficilmente è un caso. Un p-value di 0,03 dice che, se le due versioni fossero davvero identiche, vedresti uno scarto così grande (o più grande) circa il 3% delle volte. È una prova che qualcosa è cambiato, non una certezza, e non misura quanto sia grande il cambiamento.
Quale p-value indica un vincitore?
La convenzione è p sotto 0,05, che corrisponde a una confidenza del 95%. Alza l'asticella al 99% quando la modifica è costosa da rilasciare o difficile da annullare, e accetta il 90% per piccole modifiche ai testi a basso rischio, dove avere ragione più o meno in fretta vale più che essere certi lentamente.
Posso fermare il test non appena diventa significativo?
No. Controllare ripetutamente e fermarsi al primo risultato positivo (il cosiddetto peeking) gonfia molto i falsi positivi. Decidi la dimensione del campione prima del lancio, arriva fino a quella, poi leggi il risultato una sola volta. Il calcolatore della dimensione del campione ti dà quel numero.
Questo calcolatore invia i miei dati da qualche parte?
No. L'intero test viene eseguito nel tuo browser con semplice JavaScript. Niente di ciò che scrivi viene caricato, registrato o salvato, e la pagina funziona offline una volta caricata.
Come si calcola la significatività statistica di un test A/B?
Usa uno z-test per due proporzioni. Calcola ciascun tasso di conversione, il tasso combinato delle due varianti e l'errore standard √[p(1 − p)(1/n₁ + 1/n₂)]. Dividi la differenza tra i tassi per l'errore standard per ottenere z, e converti z in un p-value. 250/5.000 contro 300/5.000 dà z ≈ 2,19 e un p-value bilaterale di 0,028, significativo al 95%.
Cos'è un p-value nei test A/B?
La probabilità di osservare una differenza grande almeno quanto quella che hai misurato se le due versioni avessero in realtà lo stesso rendimento. Un p-value di 0,03 significa che uno scarto così grande comparirebbe circa il 3% delle volte solo per caso. Non è la probabilità che B sia migliore, e non misura la dimensione dell'effetto.
Perché il mio test non è significativo se B ha convertito meglio?
Di solito perché il campione è troppo piccolo per la dimensione della differenza. Un risultato dal 5% al 6% non è significativo con 2.500 visitatori per variante (p = 0,12) ma lo è con 5.000 (p = 0,028). Controlla la dimensione del campione prevista prima di leggere un risultato piatto come “nessun effetto”.
Dovrei usare un test unilaterale o bilaterale?
Bilaterale, a meno che tu non abbia deciso prima del test che una perdita e nessun cambiamento porterebbero alla stessa decisione. Il test unilaterale dimezza il p-value quando B è in vantaggio (0,028 diventa 0,014 nell'esempio predefinito), ed è per questo che passarci dopo aver visto i dati non è legittimo.
Posso usare questo calcolatore per più di due varianti?
Sì, confrontando separatamente ogni variante con il controllo. Ogni confronto aggiuntivo aumenta la probabilità di un falso vincitore, quindi usa una soglia più rigorosa per ogni confronto: con due varianti contro il controllo, testa ciascuna al 97,5% di confidenza invece che al 95%.