MarketingHablemos

Insight

Resultados binarios en experimentos de incrementalidad: por qué el bloqueo con inferencia CMH es la apuesta correcta.

La posición de IDO es directa: para experimentos de incrementalidad donde el resultado es binario — conversión sí/no, compra sí/no, visita sí/no — la combinación de diseño por bloqueo con inferencia basada en el estadístico Cochran-Mantel-Haenszel (CMH) constituye hoy el marco más defendible. No porque sea elegante, sino porque resuelve simultáneamente tres problemas que en la práctica se abordan por separado y mal: la minimización de varianza en el diseño, la imposibilidad de estimar esa varianza sin sesgo, y la validez de los intervalos de confianza en muestras finitas. Los resultados de Azriel, Krieger y Kapelner lo demuestran con rigor bajo el modelo no paramétrico de Neyman, y las implicaciones para la medición de incrementalidad en marketing son más profundas de lo que una lectura superficial sugiere.

El problema que casi nadie formula bien

Cuando un equipo de marketing monta un test de incrementalidad con resultado binario, la pregunta habitual es «¿cuántas observaciones necesito?». Esa pregunta presupone que sabemos estimar la varianza del estimador de diferencia de medias. No la sabemos — al menos no sin sesgo. Azriel, Krieger y Kapelner demuestran que, dado que la varianza depende de probabilidades de éxito desconocidas, la estimación insesgada de la varianza es imposible [2]. Esto no es un tecnicismo: significa que cualquier cálculo de potencia estándar que asuma una estimación plug-in de la varianza está mal fundamentado desde la raíz. La práctica habitual de insertar tasas de conversión históricas en una fórmula de tamaño muestral ignora que el objeto que se estima no admite estimación insesgada.

Dos estimadores conservadores que sí funcionan

Los autores desarrollan dos caminos. El primero es una generalización del estadístico CMH, aplicable a cualquier diseño balanceado. El segundo es una extensión del estimador de varianza de Robins, específica para diseños de bloqueo [2]. Ambos son conservadores — sobreestiman la varianza verdadera — pero ese conservadurismo tiene una propiedad crucial: bajo alternativas locales, el estimador CMH es asintóticamente ajustado (tight), lo que significa que la sobreestimación desaparece a medida que crece la muestra. Dicho de otro modo, los intervalos de confianza basados en CMH son válidos en muestras finitas y convergen a los más estrechos posibles asintóticamente. No estamos comprando seguridad a costa de potencia permanente; la pagamos solo mientras la muestra es pequeña.

Diseño sin bloqueo: balance de covariables dependiente del azar de la aleatorización; varianza no minimizada; inferencia válida solo asintóticamente con estimadores estándar que pueden subestimar la varianza verdadera.

Diseño con bloqueo + CMH: balance de covariables garantizado por construcción; varianza asintóticamente mínima; inferencia conservadora en muestras finitas y ajustada asintóticamente [2].

Cuando el experimento vive en el espacio: spillover como amenaza al diseño óptimo

El marco de Azriel et al. asume que los resultados potenciales de una unidad no dependen de la asignación de tratamiento de otras unidades — el supuesto SUTVA. Creemos que la mayor amenaza práctica a este supuesto en experimentos de marketing es el spillover espacial. Watson et al. demuestran que cuando intervenciones se administran en el espacio, los efectos se derraman entre unidades experimentales y los estimandos causales son funcionales lineales de un kernel de spillover cuya forma es identificable bajo aleatorización por conglomerados, pero cuyo nivel no lo es — queda aliasado con el intercepto y el efecto directo, independientemente del tamaño muestral [1]. Esto tiene una consecuencia directa para quien diseña un experimento de bloqueo geográfico: el bloqueo puede minimizar la varianza del estimador, pero si los bloques son geográficamente contiguos, el sesgo por spillover puede dominar la ganancia en varianza.

Lanzamientos graduales y la tentación del diseño escalonado

Muchos equipos de marketing no pueden aleatorizar de golpe: los lanzamientos de producto son graduales, las activaciones regionales secuenciales. Esto conduce naturalmente a diseños de adopción escalonada. Bordino, Berrett y Klopp estudian la estimación en estos diseños y proponen un algoritmo espectral que, en lugar de completar el tensor de datos faltantes, apunta directamente al funcional de interés [3]. Sus garantías exhiben una transición de fase en el número de capas: agregar más oleadas de adopción mejora la estimación solo cuando hay suficientes unidades de tratamiento disponibles. La implicación práctica es que un diseño escalonado con muchas oleadas pero pocas unidades por oleada puede ser peor que un diseño más simple con menos fases y más unidades por fase.

La ganancia de agregar capas en un diseño escalonado no es monótona: depende del número de unidades tratadas, no de la cantidad de fases [3].

La tesis integrada

Reuniendo las tres fuentes, la posición que defendemos es esta: para experimentos de incrementalidad con resultados binarios, el diseño de bloqueo con inferencia CMH es simultáneamente óptimo en varianza, conservador en muestras finitas y asintóticamente ajustado [2]. Pero ese diseño debe auditarse contra spillover espacial antes de su ejecución, usando herramientas como el level leverage [1]. Y cuando las restricciones operativas imponen un lanzamiento escalonado, la decisión de cuántas fases incluir debe regirse por el número de unidades disponibles por fase, no por la conveniencia del calendario [3]. No hay un diseño universalmente correcto. Hay un marco de decisión que empieza por el resultado (binario o continuo), sigue con la geometría (espacial o no, escalonada o simultánea), y cierra con la inferencia (conservadora, no plug-in). Ese marco ya existe en la literatura. Lo que falta es adoptarlo.

Fuentes consultadas

  1. Samuel I. Watson, Penny Hancock, Jack Fraser-Govil, Kieran DeWalt, and Thomas A. Smith. Embracing Spillover: Spatial Effects in Experiments. arXiv:2607.06506, 2026.
  2. David Azriel, Abba M. Krieger, and Adam Kapelner. Optimal Designs with Robust Inference for Binary Treatment Effects. arXiv:2607.05768, 2026.
  3. Alberto Bordino, Thomas B. Berrett, and Olga Klopp. Direct and efficient estimation of bilinear forms in staggered tensor panels. arXiv:2607.06330, 2026.

Seguir leyendo

Piezas del mismo hilo de trabajo.

  • La causalidad en marketing espacial descansa sobre supuestos que nadie auditaMedición

    La causalidad en marketing espacial descansa sobre supuestos que nadie audita. Qué revisar antes de fiarte de tus modelos geográficos. Análisis de medición.

    Leer el artículo →
  • La medición causal no tiene un resultado: tiene un multiverso de resultados, y la mayoría de los equipos elige uno sin saber por quéMedición

    Cada decisión de especificación en un modelo causal produce una conclusión diferente. Este artículo explica por qué el problema es epistémico, no técnico.

    Leer el artículo →
  • El nivel del kernel no se identifica: por qué la medición de incrementalidad necesita supuestos explícitos, no más datosMedición

    Tres líneas de evidencia muestran que más datos no resuelven la no identificación en kernels de spillover: el sesgo de publicación infla efectos entre 5 y…

    Leer el artículo →
  • La crisis silenciosa de la medición causal: por qué la mayoría de los equipos miden ruido disfrazado de señalMedición

    La mayoría de los equipos confunden un lift positivo con causalidad real. Este artículo explica por qué y qué condiciones analíticas lo provocan.

    Leer el artículo →
  • Difference-in-discontinuities e instrumentos para elasticidad: qué identifican realmente y qué dejan sin resolverMedición

    Qué identifican realmente IV, DiD y difference-in-discontinuities en marketing, y qué dejan sin resolver. Guía honesta de instrumentos de medición causal.

    Leer el artículo →
  • Adopción escalonada como instrumento de medición causal: lo que se gana y lo que se pierde al escalonar tratamientosMedición

    La adopción escalonada como instrumento de medición causal en marketing. Qué se gana y qué se asume al usarla para atribuir impacto real.

    Leer el artículo →