# La medición incremental exige elegir el nivel de garantía estadística antes de tocar los datos

> Published: 2026-09-18T15:11:16.995+00:00
> Updated: 2026-09-18T15:12:10.953+00:00

---

## La medición incremental exige elegir el nivel de garantía estadística antes de tocar los datos

Creemos que el problema central de la medición en marketing no es la falta de datos ni la sofisticación de los modelos, sino la ausencia de una decisión explícita sobre qué nivel de garantía estadística se acepta antes de ejecutar un experimento. La mayoría de las plataformas comerciales operan en el nivel más débil de inferencia bayesiana —coherencia posterior sin control de errores tipo I— y eso convierte cada test en un ejercicio de confirmación de sesgos, no de descubrimiento causal. Mientras ese déficit no se resuelva, añadir más canales, más creatividades o más algoritmos adaptativos solo multiplica el ruido disfrazado de señal.

## La jerarquía que casi nadie recorre

Schultzberg y Frånberg demuestran que la inferencia bayesiana para A/B testing no es un método sino una **familia de configuraciones** con propiedades estadísticas fundamentalmente distintas. La parada posterior con prior plano **reproduce exactamente el peeking ingenuo**: el analista mira los resultados cuando quiere, para cuando le gustan, y declara victoria. Eso no es un bug de implementación; es la consecuencia lógica de operar en el nivel 1 de su jerarquía [Fuente 1]. Subir al nivel 2 —parada por factor de Bayes— requiere una decisión organizacional, no solo técnica: acotar tasas de falsos positivos bajo monitoreo continuo. Y el nivel 3, que ofrece control de tasa de descubrimiento falso mediante prior empírico, se vuelve inaccesible cuando los corpus están seleccionados por ganador o las métricas son heterogéneas entre experimentos [Fuente 1].

## Nivel 1 (default de plataformas comerciales): coherencia posterior sin garantías de error. Equivale a peeking ingenuo con prior plano [Fuente 1].

**Nivel 2 (factor de Bayes)**: casi-óptimo para una amplia clase de funciones de coste, incluyendo la mayoría propuestas en la literatura de A/B testing. Controla falsos positivos bajo monitoreo continuo [Fuente 1].

## Más covariables no es mejor diseño

La intuición de que incluir muchas covariables reduce varianza tiene un límite formal más restrictivo de lo que la práctica asume. Cytrynbaum establece un teorema de imposibilidad: ningún diseño puede aproximarse al límite de eficiencia semiparamétrica de forma uniforme a menos que la dimensión de covariables satisfaga *d ≪ log n* [Fuente 3]. Incluso en experimentos con miles de unidades, esa condición permite solo un puñado de covariables. La respuesta que propone —diseños por minimización de discrepancia que controlan desequilibrios sobre clases de funciones de complejidad restringida— reduce varianza relativa a la aleatorización por pares emparejados en los doce experimentos publicados donde se valida [Fuente 3]. La lección para equipos de medición: el diseño del experimento merece tanta ingeniería como el modelo de atribución que vendrá después.

Un caso que ilustra la trampa de la sustracción ingenua viene de los sistemas de recomendación a escala. Vlontzos et al. muestran que las ventanas de atribución difieren entre usuarios tratados (ventana de respuesta directa corta) y usuarios en holdback (ventana de múltiples días), y que esa asimetría hace que **la sustracción ingenua de efectos de tratamiento sea inválida** para estimar incrementalidad [Fuente 8]. Su arquitectura causal con cabeza tratada y cabeza orgánica, combinada con una política de targeting dual-threshold, entrega recomendaciones solo cuando la probabilidad de stream tratado es alta y la de stream orgánico es baja [Fuente 8]. Esto no es un refinamiento marginal: es la diferencia entre medir valor real y contabilizar actividad que hubiera ocurrido de todas formas.

El problema se replica en la atribución de contenido visual. Liu, Padmanabhan y Viswanathan documentan que la estimación pooled de efectos de atributos visuales **mezcla preferencia de audiencia y efecto creativo**, dos componentes que pueden tener signos opuestos para el mismo atributo [Fuente 7]. Su marco DIRECT —basado en descomposición Mundlak between-within y double machine learning— separa la selección entre creadores del efecto causal de cambiar el estilo dentro de un creador [Fuente 7]. Sin esa descomposición, un equipo creativo podría recibir recomendaciones exactamente contrarias a lo que su audiencia específica recompensa.

Dubé, Morozov, She y Tuchman aportan evidencia experimental de que los display ads **modifican creencias sobre precio y calidad incluso cuando el texto del anuncio no revela directamente ninguno de esos atributos** [Fuente 2]. Separando el canal de visibilidad del canal de actualización de creencias, muestran que la visibilidad explica la mayor parte del efecto, pero la actualización de creencias explica una parte estadística y económicamente significativa [Fuente 2]. La implicación para medición es directa: los modelos de atribución que solo capturan respuesta directa pierden una fracción real del efecto causal. Y el hallazgo de que los anunciantes pueden encontrar óptimo ocultar información del producto —incluso cuando esta supera las expectativas— desafía la premisa de que más información en el anuncio equivale a mejor rendimiento [Fuente 2].

**81%–88%** — Recuperación del efecto verdadero por el estimador crudo intra-versión (Tribbia muestra que el estimador crudo recupera entre el 81% y el 88% del efecto verdadero; métodos ingenuos recuperan solo el 62%–63% [Fuente 5].)

## Cuando no hay experimento: variación intra-versión y error de medición

El estimador intra-versión de Tribbia explota mejoras de calidad no uniformes entre capacidades de un modelo de IA como fuente de variación causal, sin manipulación experimental entre versiones [Fuente 5]. Lo que nos parece más valioso no es la cifra de recuperación en sí, sino la demostración de que un ajuste de desatenuación por errores en variables —usando un ratio de fiabilidad test-retest de 0,861— corrige el estimado a 1,017 con intervalo bootstrapped que contiene el efecto verdadero [Fuente 5]. La lección es generalizable: cuando la experimentación es imposible, la variación natural dentro de un sistema puede servir, pero solo si se trata con rigor el error de medición.

Y el error de medición es más grave de lo que la profesión suele admitir. Meyer et al. encuentran que para casi la mitad de las variables de la CPS ASEC —una de las encuestas más rigurosamente probadas de Estados Unidos—, el sesgo supera el 40% y eliminarlo requeriría cambiar más del 80% del total verdadero. La fuente dominante no es la no respuesta, como se asume convencionalmente, sino el **error de medición** entre los respondentes [Fuente 9]. Si eso ocurre en encuestas gubernamentales con décadas de refinamiento, la pregunta para cualquier equipo de medición de marketing es obvia: ¿qué fracción de tu señal es artefacto de cómo preguntas o registras?

## Tres frentes que complican el panorama

Tres desarrollos recientes complican el panorama de medición de formas que no pueden ignorarse. Primero, Ponte y Ferecatu demuestran que la personalización mediante bandits permite a terceros inferir segmentos de consumidores, y proponen un presupuesto de riesgo de privacidad basado en privacidad diferencial. Su hallazgo de que la estrategia dinámica de gasto del presupuesto es especialmente valiosa en experimentos largos y complejos sugiere que la privacidad no es una restricción binaria sino un recurso asignable entre experimentos [Fuente 4]. Segundo, Kato, Honma y Kato proponen GMMM para medir la presencia de marca en respuestas de motores generativos —un canal donde la exposición no es directamente observable y las probabilidades de noticia deben estimarse—, extendiendo la lógica del Marketing Mix Modeling al territorio de GEO y GEM [Fuente 12]. Tercero, Adusumilli, Gu y Tao muestran que en experimentos adaptativos compuestos, el g-modeling de Empirical Bayes sigue siendo válido incluso bajo tamaños muestrales endógenos, mientras que el f-modeling basado en la fórmula de Tweedie **puede producir reglas sesgadas** [Fuente 10]. La implicación práctica: si usas bandits adaptativos y luego aplicas herramientas estándar de f-modeling sin corrección, estás inyectando sesgo en tu estimación.

## Tres decisiones que se toman antes de recoger un solo dato

La lectura que hacemos de este cuerpo de evidencia es que la medición incremental seria exige tres decisiones que se toman antes de recoger un solo dato: el nivel de garantía estadística que se acepta (y el precio que se paga por cada nivel), la estructura del diseño experimental (incluyendo cuántas covariables son realmente admisibles), y la definición precisa del estimando causal (que casi nunca es la diferencia cruda entre tratamiento y control). Cualquier discusión sobre atribución que no comience por ahí está construyendo sobre arena.

## Fuentes consultadas

- Mårten Schultzberg and Mattias Frånberg. Bayesian Inference Procedures for A/B Testing: An Overview. [arXiv:2608.12949](https://arxiv.org/abs/2608.12949v1), 2026.

- Efectos causales de la publicidad sobre creencias y comportamiento: evidencia experimental de display ads. [ver](https://www.nber.org/papers/w35596#fromrss)

- Max Cytrynbaum. The Limits of Experimental Design: Covariate Balance Beyond Low Dimension. [arXiv:2608.18057](https://arxiv.org/abs/2608.18057v1), 2026.

- Gilian R. Ponte and Alina Ferecatu. A Privacy Budgeting Framework for Online Experimentation. [arXiv:2608.19944](https://arxiv.org/abs/2608.19944v1), 2026.

- John Tribbia. Identifying Model Quality Effects on User Engagement: A Within-Version Causal Estimator with Synthetic Data Validation. [arXiv:2608.17187](https://arxiv.org/abs/2608.17187v1), 2026.

- Seonghun Lee. Logistic Regression Equivalent Weights for Survey Inference: Construction and Asymptotic Properties. [arXiv:2608.22732](https://arxiv.org/abs/2608.22732v1), 2026.

- Yizhi Liu, Balaji Padmanabhan, and Siva Viswanathan. DIRECT: Decomposing Audience Preference and Creative Effect in Visual Content Analytics. [arXiv:2608.26584](https://arxiv.org/abs/2608.26584v1), 2026.

- Athanasios Vlontzos, David Gustafsson, Michael O'Riordan, and Ciarán M. Gilligan-Lee. Incremental Recommendation via Causal Models. [arXiv:2608.26804](https://arxiv.org/abs/2608.26804v1), 2026.

- Error de encuesta: anatomía, descomposición y fuentes dominantes de sesgo. [ver](https://www.nber.org/papers/w35680#fromrss)

- Karun Adusumilli, Jiaying Gu, and Junfan Tao. Empirical Bayes for compound adaptive experiments. [arXiv:2609.17158](https://arxiv.org/abs/2609.17158v1), 2026.

- Lorenzo Muñoz, Stephane Hess, Thomas O. Hancock, and Georges Sfeir. Using machine learning metrics to provide deeper insights into the performance of choice models. [arXiv:2609.20655](https://arxiv.org/abs/2609.20655v1), 2026.

- Masahiro Kato, Daiki Honma, and Taka Kato. Generative Marketing Mix Modeling: A Causal Inference Framework Linking GEO and GEM to Business Impact. [arXiv:2609.11915](https://arxiv.org/abs/2609.11915v1), 2026.
