Calculadora de significancia de test A/B.
¿Tu test A/B ya tiene un ganador o todavía es azar? Esta calculadora toma los visitantes y conversiones de cada variante y calcula el uplift, la confianza estadística y si la diferencia es significativa, con una visualización de cuánto se solapan las dos distribuciones. Mientras menos se solapan, más seguro es que el resultado sea real. Implementar un ganador que en realidad no lo era es un error caro; esta herramienta te frena a tiempo.
Tus variantes
Usa el total acumulado de cada variante durante el periodo del test.
Resultado
Uplift de la variante B
+30,0%.
Conversión A
5,00%
Conversión B
6,50%
Confianza
95,8%
SignificativoGanador
B
Cuánto se solapan A y B
Cómo leer la significancia.
La significancia estadística responde una pregunta: ¿la diferencia entre A y B es real o pudo salir por azar? El estándar de la industria es un 95% de confianza, que equivale a un valor p de 0,05. Bajo ese umbral, todavía no puedes declarar un ganador con tranquilidad.
Dos advertencias: no mires el test todos los días para "parar cuando gana" (eso infla los falsos positivos), y asegúrate de tener muestra suficiente. Un uplift enorme con pocos datos casi nunca es significativo. Esta calculadora usa un test de dos colas, el más conservador.
Preguntas frecuentes sobre tests A/B.
¿Qué significa 95% de confianza?
Que hay solo un 5% de probabilidad de que la diferencia observada entre A y B se deba al azar. Es el umbral estándar para declarar un resultado significativo y tomar una decisión.
¿Cuántos visitantes necesito?
Depende de tu tasa de conversión base y del tamaño del efecto que quieras detectar. En general, mientras más pequeña la diferencia esperada, más muestra necesitas. Con conversiones bajas, los tests requieren miles de visitantes por variante.
¿Puedo detener el test cuando ya gana una versión?
No es recomendable. Mirar el test repetidamente y parar apenas cruza el 95% infla los falsos positivos. Define de antemano la duración o el tamaño de muestra y respétalo.
¿Qué hago si no llego a significancia?
Deja correr más tiempo, aumenta el tráfico a la prueba, o acepta que el cambio no tuvo un efecto detectable. Un test no concluyente también es información: te evita implementar algo que no mueve la aguja.
El siguiente paso
Testear es aprender y nosotros lo hacemos sistema.
Calcular es el primer paso. Convertir esos números en crecimiento medible es lo que hace Futture, todos los días. Conversemos tu caso.