La variante B muestra una tasa mayor. Antes de publicarla para todos, revisa qué se decidió antes de empezar, quién entró al experimento y cuánta incertidumbre queda.

Escribe una hipótesis que pueda fallar

“Probemos otro formulario” describe una tarea. Una hipótesis conecta una fricción observada, un cambio y un resultado esperado. Por ejemplo: “Las personas abandonan porque no entienden para qué pedimos su teléfono. Explicar su uso junto al campo aumentará las solicitudes completas sin reducir su calidad”.

Deja esa frase escrita antes del diseño y conserva la evidencia que la originó: consultas a soporte, entrevistas o errores del formulario. Si al terminar cualquier movimiento puede contarse como un éxito, la hipótesis era demasiado flexible. Microsoft recomienda formular hipótesis evaluables y elegir métricas capaces de confirmarlas o refutarlas. Revisa sus criterios previos al experimento.

Elige una métrica principal, por ejemplo solicitudes válidas por usuario elegible. Agrega límites para aspectos que no deberían deteriorarse, como errores o calidad comercial. Esas métricas de resguardo permiten detectar un formulario que consigue más envíos a costa de llenar ventas con contactos inutilizables.

Decide qué mejora justificaría el cambio

Usa datos históricos comparables para estimar la tasa base. Después distingue dos preguntas: qué mejora vale la pena para el negocio y qué mejora puede detectar el experimento con sus recursos. El efecto mínimo detectable depende del tamaño de muestra y del método. No conviene fijarlo tan alto que el test ignore mejoras comercialmente valiosas.

Ejemplo inventado: la tasa base es 4% y una mejora a 4,8% justificaría mantener la implementación. La diferencia es 0,8 puntos porcentuales, equivalente a 20% de aumento relativo. No significa sumar veinte puntos a la tasa.

Para planificar una comparación de dos proporciones independientes, bilateral, con nivel de significación de 5%, potencia de 80% y reparto igual, una aproximación normal requiere unas 10.320 personas por variante. La potencia es la probabilidad de detectar el efecto planteado si existe. Es un cálculo ilustrativo: otros métodos, métricas o dependencias cambian la muestra. Kohavi y Longbotham explican la relación entre muestra, potencia y duración.

Planifica el plazo y quién verá cada versión

Con 1.000 usuarios nuevos elegibles diarios, reunir unos 20.640 tomaría aproximadamente 21 días. Eso supone que todo ese tráfico entra al test y no repite usuarios ya contados. Considera además la ventana necesaria para observar conversiones tardías. Las sesiones totales de Analytics no equivalen automáticamente a personas disponibles para el experimento.

Fija un horizonte que permita reunir la muestra y cubrir ciclos habituales, como semanas completas. Documenta qué harás si el tráfico resulta menor al previsto. Evita prolongar la prueba solo porque el resultado todavía no alcanza el umbral que esperabas.

Asigna las variantes al azar, al mismo tiempo y de forma estable para cada unidad elegida. En un sitio puede ser un identificador de usuario; en un producto colaborativo podría requerirse otra unidad. Las cookies y los cambios de dispositivo tienen limitaciones que debes registrar. Microsoft detalla estas decisiones de asignación.

Monitorea errores sin perseguir un ganador

Una prueba con horizonte fijo se evalúa según el cierre planificado. Revisar cada mañana y detenerla apenas aparece una diferencia favorable altera el procedimiento estadístico: el umbral pensado para una evaluación final deja de tener la misma interpretación al repetir intentos.

Si necesitas decisiones anticipadas, usa un método secuencial diseñado para ello, con reglas de parada y análisis definidos desde el inicio. No basta con que una herramienta actualice el reporte en tiempo real. Microsoft advierte que las mediciones repetidas requieren considerar las comparaciones múltiples y las revisiones anticipadas. Su guía distingue monitoreo e interpretación durante la prueba.

Puedes detectar un botón roto y detener el experimento para proteger a los usuarios. Registra esa interrupción como un problema de ejecución. Tampoco cambies la métrica principal por la que quedó mejor: explorar veinte métricas o muchos segmentos ofrece más oportunidades de encontrar ruido favorable. Define ajustes para comparaciones confirmatorias y trata los hallazgos exploratorios como nuevas hipótesis.

Comprueba que los datos permiten comparar

Antes de leer el aumento, revisa cuántas unidades quedaron en cada variante. Un desbalance incompatible con el reparto previsto se conoce como SRM, por su nombre en inglés, Sample Ratio Mismatch. Se evalúa con una prueba estadística sobre los conteos; mirar un porcentaje cercano a 50/50 no basta, porque también importa el tamaño de muestra. Microsoft explica cómo detectarlo y diagnosticarlo.

Si aparece una alerta, investiga antes de interpretar conversiones. Puede haber una redirección que pierde usuarios, errores al unir registros o filtros distintos entre variantes. No arregles el reparto eliminando filas hasta que los grupos parezcan iguales.

Haz una revisión concreta: abre ambas experiencias en móvil, completa la acción y sigue el evento hasta el reporte. Comprueba que la definición de conversión sea idéntica. Si B registra dos envíos por persona y A solo uno, la diferencia puede venir de la medición. Superar el chequeo de reparto tampoco acredita por sí solo toda la instrumentación.

Decide usando el efecto y su incertidumbre

Al cierre, muestra las tasas, la diferencia y un intervalo de confianza adecuado al método. El intervalo expresa la incertidumbre de la estimación bajo sus supuestos; no es una promesa del resultado futuro. La recomendación de acompañar el efecto con intervalos forma parte de la guía de análisis de Kohavi y Longbotham.

Compara ese rango con cero y con la mejora mínima que justificaba el trabajo. Si incluye pérdidas y ganancias relevantes, el resultado es inconcluso. Si una diferencia estadísticamente detectable es demasiado pequeña para cubrir mantenimiento y operación, podría no convenir implementarla. “No encontramos evidencia suficiente” tampoco significa “las versiones son iguales”.

Con poco tráfico, vuelve a la fricción: observa tareas reales, entrevista usuarios y revisa consultas comerciales. Esa evidencia puede orientar un cambio y su seguimiento, aunque no permite anunciar un aumento causal de conversión. Guarda la hipótesis, la ejecución, el resultado y la decisión. Así, incluso una prueba inconclusa deja claro qué se aprendió y qué falta resolver.

Antes de declarar un ganador
  • La hipótesis, métrica principal y resguardos se definieron antes del test.
  • El efecto mínimo y la muestra corresponden a una decisión comercial.
  • La duración, asignación y regla de cierre quedaron documentadas.
  • No quedan alertas de reparto ni errores de medición sin explicar.
  • El análisis considera intervalos y comparaciones múltiples.
  • La decisión distingue mejora útil, deterioro y resultado inconcluso.
Pregunta para tu equipo

¿Qué resultado te haría descartar tu variante favorita?

Escríbelo antes de lanzar la prueba. Esa regla será más útil cuando el reporte muestre una diferencia pequeña.

Fuentes primarias consultadas

Para profundizar.