Skip to main content
CalculadoraFunciona en tu navegadorGratis · Sin registro

Calculadora de test A/B para cold email

Deja de declarar ganadores con 50 emails. Introduce envíos y respuestas de dos variantes y obtén un valor p real, intervalos de confianza, un veredicto en lenguaje claro y el número de emails que necesitas enviar antes de fiarte del resultado. Gratis y sin registro.

Resultados del test

Introduce los emails enviados y los resultados de cada variante. Todo se actualiza en vivo.

Variante A (control)

Variante B (retadora)

Planifica el próximo test

Cuántos emails por variante necesitas antes de empezar, con una potencia del 80%.

3%

Sigue la tasa observada de la variante A hasta que la muevas. Usa tu tasa histórica si planificas desde cero.

20%

Una mejora relativa del 20% sobre un 3% significa detectar un 3.60% o más.

Comparte este test

Todos los datos van codificados en el enlace, así que quien lo abra ve el mismo resultado.

Significancia

Introduce las dos variantes para ver el resultado

Añade los emails enviados y las respuestas de A y de B. Obtendrás las tasas, el p-valor, un intervalo de confianza y un veredicto en lenguaje claro.

Tamaño de muestra necesario

Por variante

13,914

20% de mejora sobre un 3%

Emails totales

27,828

95% de confianza, 80% de potencia

Tamaño de muestra según el efecto mínimo detectable
Mejora mínima detectablePor varianteTotal
10%53,211106,422
20%13,91427,828
30%6,45512,910
50%2,5185,036
Nada sale de tu navegadorSin cuenta ni correo electrónicoUso ilimitado
Cómo funciona

Cómo usar Calculadora de test A/B

  1. 01

    Introduce las dos variantes

    Elige la métrica que estás probando (respuestas, respuestas positivas o aperturas) y añade los emails enviados y los resultados de la variante A y la variante B. Escoge un nivel de confianza del 90, 95 o 99 %.

  2. 02

    Lee el veredicto

    Obtienes la tasa de cada variante con su intervalo, la diferencia absoluta y la relativa, el estadístico z, el valor p bilateral y si el test es significativo en el nivel que elegiste.

  3. 03

    Planifica el tamaño de muestra

    Fija tu tasa base y la mejora más pequeña que merece la pena detectar. El planificador muestra los emails por variante con un poder del 80 %, y cuántos más necesitas si la ventaja actual es real.

Por qué 50 emails por variante no te dicen nada

Las tasas de respuesta del cold email son pequeñas, normalmente entre el 1 % y el 5 %, y eso es lo que complica las pruebas. Si la variante A consigue 2 respuestas de 50 emails y la variante B consigue 4, B parece el doble de buena. En realidad es una diferencia de dos respuestas, y la calculadora mostrará un valor p muy por encima de 0,05: una brecha de ese tamaño o mayor aparece en buena parte de los tests en los que ambas variantes son idénticas. Cuanto más baja es la tasa base, más emails hacen falta para que una diferencia real se separe del ruido.

Usa el planificador de tamaño de muestra antes de empezar. Con una tasa de respuesta base del 3 %, detectar una mejora relativa del 20 % (del 3 % al 3,6 %) con un 95 % de confianza y un 80 % de poder necesita unos 14.000 emails por variante. Detectar una mejora del 50 % (del 3 % al 4,5 %) necesita unos 2.500 por variante, y duplicar la tasa (del 3 % al 6 %) necesita unos 750. Por eso la mayoría de los tests de cold email deberían buscar cambios grandes y no pulir detalles.

La estadística detrás del veredicto

La calculadora ejecuta una prueba z de dos proporciones. La tasa de cada variante son los resultados divididos entre los emails enviados. Bajo la hipótesis nula de que ambas variantes comparten una única tasa real, agrupa las dos muestras, calcula el error estándar de la diferencia y expresa la diferencia observada como un estadístico z. El valor p bilateral es la probabilidad de ver una diferencia al menos así de grande en cualquier dirección si no hubiera ninguna diferencia real. La función de distribución normal estándar se evalúa en el navegador con la aproximación de Abramowitz y Stegun, precisa hasta unos siete decimales.

  • Significativo quiere decir valor p por debajo de alfa, donde alfa es 0,10, 0,05 o 0,01 para una confianza del 90, 95 o 99 %.
  • El intervalo de confianza de la diferencia usa la varianza propia de cada variante. Si excluye el cero, el test es significativo en ese nivel.
  • El efecto mínimo detectable (MDE) es la mejora relativa más pequeña que tu muestra puede detectar de forma fiable. Un MDE menor implica muchísimos más emails, ya que el tamaño de muestra escala con el inverso del cuadrado de la diferencia.
  • Un poder del 80 % significa que, si la mejora real es igual al MDE, cuatro de cada cinco tests alcanzarán la significancia. El quinto se perderá un ganador real.
  • La herramienta avisa cuando una variante tiene menos de 5 resultados esperados, punto en el que la aproximación normal se vuelve tosca y el valor p se debe leer como una pista y no como una prueba.

El problema de mirar antes de tiempo y qué conviene probar

Revisar los resultados cada día y parar en cuanto la p baja de 0,05 es la forma más común de estropear un test de cold email. El ruido aleatorio cruza esa línea a menudo de camino a ninguna parte, así que un equipo que mira diez veces tiene una tasa de falsos positivos mucho más alta que el 5 % que cree tener. Fija el tamaño de muestra con el planificador, envíalo y evalúa una sola vez. Si tienes que mirar antes, trata cualquier cifra por debajo de la muestra planificada como una tendencia, que es justo como lo describe el veredicto.

Prueba una variable cada vez y empieza por las que más mueven las tasas. Las líneas de asunto cambian las aperturas y, de forma indirecta, las respuestas. La primera línea y la frase central de valor son las que más cambian las respuestas. La llamada a la acción cambia el porcentaje de respuestas positivas más que el total de respuestas, así que mide respuestas positivas cuando la pruebes. La hora de envío, el nombre del remitente y la longitud del email solo merecen prueba una vez asentado el mensaje. Mantén todo lo demás idéntico entre las dos ramas, la lista incluida.

Ejecutar un test A/B dentro de una secuencia

En una secuencia de varios pasos, reparte a los prospectos entre variantes al nivel de la campaña y mantenlos en la misma variante en cada paso, para que un seguimiento nunca mezcle tonos. Mide la métrica en el mismo punto para ambas ramas, por ejemplo las respuestas en los 7 días siguientes al paso uno, y cuenta las respuestas de toda la secuencia si la variable es el primer email, ya que los seguimientos heredan su contexto.

Divide a partes iguales. Las divisiones desiguales son válidas, pero ralentizan la rama pequeña y el test entero. Segmenta la lista en dos mitades parecidas en sector, cargo y tamaño de empresa, o aleatoriza prospecto a prospecto. Cuando un test sea significativo, promociona al ganador, convierte al ganador anterior en el nuevo control y empieza el siguiente test. ColdBox se encarga de la división, mantiene a cada prospecto atado a su variante en todos los pasos e informa de las respuestas por variante, así que los números que pegas aquí salen directos de la vista de campaña.

Preguntas frecuentes

Preguntas sobre Calculadora de test A/B

Respuestas directas, sin relleno. ¿Sigues con dudas? Nuestro equipo de entregabilidad responde en un par de horas.

Habla con una persona

Depende de tu tasa base y de la mejora más pequeña que te importe. Con una tasa de respuesta del 3 %, una mejora relativa del 50 % necesita unos 2.500 emails por variante con un 95 % de confianza y un 80 % de poder, mientras que una mejora del 20 % necesita unos 14.000 por variante. Usa el planificador con tu propia tasa base en vez de una regla general, ya que una base del 1 % necesita alrededor del triple.

Es la probabilidad de ver una diferencia al menos tan grande como la tuya si las dos variantes fueran en realidad idénticas. Un valor p de 0,03 significa que una brecha de este tamaño aparecería por azar en unos 3 de cada 100 tests sin ninguna diferencia real. No es la probabilidad de que la variante B sea mejor, que es la lectura errónea más habitual.

El 95 % es el valor por defecto habitual y un equilibrio justo para cold email. Usa el 90 % cuando el cambio sea barato de revertir y prefieras avanzar más rápido asumiendo más falsos positivos. Usa el 99 % cuando la decisión sea cara, por ejemplo cambiar una secuencia que usa todo un equipo, y puedas permitirte la muestra mayor que exige.

Ir por delante no es lo mismo que estar demostrado. Con tasas de respuesta bajas, una ventaja de unas pocas respuestas cabe de sobra dentro de la variación aleatoria. El veredicto compara tu valor p con el umbral del nivel de confianza que elegiste. La sección de cuántos emails más faltan estima lo que costaría confirmar esa ventaja si es real.

Puedes, y la calculadora lo admite, pero trata las tasas de apertura con cuidado. Las funciones de privacidad de los clientes de correo más grandes precargan las imágenes e inflan las aperturas, lo que añade ruido que no tiene nada que ver con tu línea de asunto. Las aperturas sirven para una lectura rápida y orientativa de los asuntos; decide sobre respuestas o respuestas positivas siempre que puedas.

La diferencia absoluta es la brecha en puntos porcentuales, por ejemplo del 3,0 % al 3,6 % son 0,6 puntos. La mejora relativa divide esa brecha entre la tasa base, así que el mismo cambio es una mejora del 20 %. La planificación del tamaño de muestra usa la mejora relativa porque escala bien entre tasas base distintas, mientras que el intervalo de confianza se muestra en puntos absolutos.

Un resultado significativo sobre una división limpia es buena evidencia, pero los efectos se diluyen a medida que cambian las listas, las temporadas y los buzones. Promociona al ganador, déjalo como nuevo control y repite la prueba con el siguiente lote. Si el segundo test coincide, el cambio es real. Si no coincide, puede que te haya tocado el falso positivo de uno entre veinte que permite un 95 % de confianza.

Start Free Today

Ejecuta cada test sobre una división limpia, de forma automática.

ColdBox reparte a los prospectos entre variantes al azar, los mantiene fijos en todos los pasos e informa de la tasa de respuesta por variante, así que pegas números reales y no suposiciones. Prueba gratis de 7 días, sin tarjeta.

Free trialNo credit cardSetup in 5 minutes