STRUMENTO 07 / TEST

← Tutti gli strumenti

Calcolatore Test A/B

Pianifica la dimensione del campione prima di partire. Verifica la significatività dopo. Entrambe le metà del testing in un solo strumento.

%
%
L'incremento più piccolo che vale la pena rilevare
/giorno
Campione per variante visitatori necessari
Campione totale entrambe le varianti
Conversioni per variante attese al tasso base
Giorni di durata con il tuo traffico
Durata rispetto a un budget di test di 30 giorni

Hai già fatto il test?

Verifica se il tuo risultato è significativo

Solo numeri grezzi: visitatori e conversioni per variante. A è il tuo controllo, B è il cambiamento.

CVR A controllo
CVR B variante
Incremento relativo IC 95% —
P-value a due code
Confidenza

Come funziona la formula della dimensione del campione

Il calcolatore usa l'approssimazione standard per un test a due varianti con significatività del 95% e potenza dell'80%:

n = 16 × p(1−p) ÷ δ²

dove p è il tuo tasso di conversione di partenza in decimale e δ è l'incremento assoluto che vuoi rilevare, quindi δ = p × MDE. Con i valori di default: p è 0,02, un incremento relativo del 20% rende δ = 0,004, e la formula dà 19.600 visitatori per variante. Con 500 visitatori giornalieri per variante, sono 40 giorni di test. La durata esce dritta da un calcolo che puoi fare prima di costruire qualsiasi cosa.

Verificare i risultati finiti: lo z-test

z = (p₂ − p₁) ÷ √( p̄(1−p̄)(1/n₁ + 1/n₂) )

Per un test finito il calcolatore fonde entrambe le varianti in un unico tasso combinato , chiede quanto è grande il divario osservato rispetto al rumore che ti aspetteresti con queste dimensioni del campione, e converte quello z-score in un p-value a due code. Sotto lo 0,05 il risultato supera la soglia convenzionale del 95%. La lettura dell'incremento porta con sé un intervallo di confidenza al 95%: l'intervallo in cui plausibilmente si trova l'incremento vero. Un test significativo il cui intervallo sfiora lo zero è una vittoria reale ma forse minuscola, quindi leggi l'intervallo, non solo il verdetto.

Cosa significano davvero significatività e potenza

La significatività del 95% vuol dire che, se davvero non c'è differenza tra le varianti, dichiarerai un vincitore per errore circa 1 volta su 20. La potenza dell'80% vuol dire che, se l'incremento è reale e grande quanto il tuo MDE, il test lo coglierà 4 volte su 5, e lo mancherà una volta. Nessuna delle due è una garanzia. Sono tassi di errore con cui hai accettato di convivere, e reggono solo se fissi la dimensione del campione in anticipo e leggi il risultato una volta sola, alla fine.

La trappola del poco traffico

La dimensione del campione scala con l'inverso del quadrato dell'effetto. Rileva un incremento grande la metà e ti serve quattro volte il traffico. È per questo che i piccoli negozi che copiano la cultura del testing dei grandi finiscono con test che non si chiudono mai: un MDE del 5% con una base del 2% richiede oltre 300.000 visitatori per variante. Se qui i giorni tornano in mesi, la risposta non è più pazienza. Alza l'MDE e testa cambiamenti abbastanza grandi da superarlo.

Meno test, più coraggiosi

Con poco traffico, il tuo calendario di test dovrebbe contenere una manciata di grandi cambiamenti per trimestre: un'offerta diversa, un hero ricostruito, un nuovo modo di presentare il prezzo. Ognuno o sposta il numero in modo visibile o ti insegna qualcosa di reale. Dieci micro-test che finiscono tutti senza conclusione non ti insegnano nulla, se non che il tuo traffico non regge i micro-test. Adatta l'ambizione del cambiamento al traffico che hai davvero.

DOMANDE FREQUENTI

Quanto deve durare un test A/B?
Finché non raggiunge la dimensione del campione richiesta, e mai meno di una settimana intera anche se il campione lo permetterebbe. Il traffico si comporta in modo diverso di martedì rispetto al sabato, quindi un test che vede solo una parte del ciclo settimanale misura il calendario, non la variante. Due settimane piene sono il minimo pratico per la maggior parte dei siti. Arrotonda la durata a settimane intere.
Che dimensione del campione mi serve per un test A/B?
Dipende dal tuo tasso di conversione di partenza e dal miglioramento più piccolo che vuoi rilevare. Con una base del 2%, rilevare un incremento relativo del 20% richiede circa 19.600 visitatori per variante con le impostazioni standard. Dimezza l'effetto che vuoi rilevare e il campione necessario quadruplica più o meno, ed è per questo che inseguire piccoli incrementi con poco traffico funziona di rado.
Perché non posso fermare il test appena raggiunge la significatività?
Perché controllare di continuo e fermarsi alla prima lettura significativa gonfia parecchio il tasso di falsi positivi. Un test sbirciato ogni giorno può mostrare significatività a un certo punto anche quando non c'è nessuna differenza reale. Decidi la dimensione del campione e la durata prima di partire, poi lascialo girare. La matematica regge solo se valuti una volta sola, alla fine.
Come scelgo l'effetto minimo rilevabile?
Impostalo sull'incremento più piccolo che cambierebbe davvero una decisione, poi verifica se il tuo traffico se lo può permettere. Con poco traffico, un MDE del 10% produce test che durano mesi, quindi testa cambiamenti più grossi: nuovi titoli, nuove offerte, nuovi layout di pagina che potrebbero plausibilmente spostare le cose del 20% o più. I test di rifinitura sono un lusso dei siti ad alto traffico.
Cosa significa davvero il p-value?
È la probabilità di vedere un divario grande almeno così tra le varianti se fossero davvero identiche. Un p-value di 0,03 significa: se il cambiamento non facesse nulla, solo 3 test su 100 mostrerebbero una differenza così grande per puro caso. Non è la probabilità che B sia migliore, e non dice nulla su quanto sia grande la vittoria. Abbinalo all'incremento e al suo intervallo di confidenza prima di agire.
Queste regole valgono per i test sulle creatività pubblicitarie?
Solo in parte. Le piattaforme pubblicitarie non dividono il traffico in modo equo, ottimizzano la distribuzione verso la variante che sembra migliore all'inizio, quindi la statistica pulita di qui non si applica mai del tutto. Tratta i test sulle creatività come indicativi: dai a ogni variante abbastanza budget per uscire dalla fase di apprendimento, confronta sulla tua metrica principale, e accetta più incertezza di quanta ne comporti un test fatto bene su una landing page.

Vuoi il ragionamento dietro i numeri?

Un breakdown di paid ads a settimana. Gratis.

Quello per cui le agenzie si fanno pagare: teardown, setup, framework. Pensato per gli ecommerce che vogliono scalare.

Ricevi le analisi gratis