# La atribución causal no es un problema de datos: es un problema de diseño

> Published: 2026-09-23T18:36:28.308+00:00
> Updated: 2026-09-23T18:37:24.884+00:00

---

## La atribución causal no es un problema de datos: es un problema de diseño

Creemos que la industria de marketing ha invertido la jerarquía de prioridades en medición: dedica la mayor parte de su esfuerzo a recolectar más datos y sofisticar modelos de atribución estadística, cuando la evidencia reciente demuestra que las decisiones de diseño experimental —qué se aleatoriza, cómo se asigna, cuándo se detiene— determinan de forma mucho más radical la validez causal de cualquier conclusión. Un modelo perfecto sobre datos mal diseñados produce certezas falsas. Un diseño riguroso con un modelo parsimonioso produce decisiones defendibles.

- >40% — Sesgo en casi la mitad de las variables de ingreso y programas sociales de la CPS ASEC
- 62% → 2% — Reducción de tasa de inconclusión de PitG a DPitG en simulación de moneda justa

## El sesgo no vive donde creemos que vive

La intuición dominante en la práctica de encuestas y medición de marketing es que el problema principal de sesgo reside en quién responde y quién no: la no-respuesta. Meyer, Mittag, Wu, Tatarka y Langetieg desmontan esta intuición con dos décadas de datos administrativos vinculados a la CPS ASEC. Su hallazgo es contundente: la **fuente dominante de sesgo es el error de medición** entre los respondentes que sí participan, no la ausencia de los que no lo hacen [Fuente 2]. Para casi la mitad de las variables analizadas, el sesgo supera el 40 por ciento y corregir todo el error individual requeriría cambiar más del 80 por ciento del total verdadero [Fuente 2]. Si esto ocurre en una de las encuestas más antiguas y rigurosamente probadas de Estados Unidos, la lectura que hacemos es directa: los datos auto-reportados en marketing —clics, encuestas post-compra, declaraciones de intención— cargan un error de medición que ningún volumen de muestra resuelve. Más datos del mismo tipo no reducen el sesgo; cambian la precisión de una estimación equivocada.

## Práctica estándar: aleatorización completa balanceada (50/50 fijo) o pareamiento por bloques, estimación por diferencia de medias. Se percibe como el diseño 'más limpio'.

**Resultado minimax**: la aleatoriedad en la proporción realizada de tratados es informativa cuando los resultados son acotados. El estimador óptimo es una regresión no convencional del resultado centrado en el punto medio del soporte sobre el tratamiento recentrado, sin intercepto [Fuente 6].

## Cuándo parar: el sesgo de confirmación como defecto de arquitectura

La decisión de cuándo detener un experimento es tan estructural como la asignación misma. Kazin analiza el problema del *early peeking* en tests secuenciales y documenta que el algoritmo HDI+ROPE —ampliamente recomendado en la comunidad bayesiana aplicada— acopla la regla de parada al criterio de decisión, lo que permite que un intervalo de densidad posterior amplio satisfaga el criterio con muestras tempranas no representativas, generando un **coste sistemático de falsos positivos** [Fuente 8]. El algoritmo PitG resuelve el sesgo de confirmación desacoplando parada y decisión, pero a costa de una tasa de inconclusión del 62% cuando la hipótesis nula es verdadera [Fuente 8]. DPitG cierra esta brecha exigiendo simultáneamente precisión y veredicto concluyente, reduciendo la inconclusión del 62% al 2% con un coste mediano de solo el 5% de muestras adicionales [Fuente 8]. La lección para equipos de experimentación en marketing es concreta: la regla de parada no es un detalle operativo, es parte del diseño causal.

La experimentación adaptativa —donde el algoritmo reasigna tráfico entre variantes según resultados intermedios— es cada vez más común en plataformas de marketing digital. Adusumilli, Gu y Tao demuestran que no todas las herramientas de Empirical Bayes sobreviven a este entorno. El **g-modeling** mantiene su validez incluso cuando asume incorrectamente que los datos fueron recolectados de forma exógena; los analistas pueden aplicar técnicas estándar actuando como si los tamaños muestrales no fueran endógenos [Fuente 3]. La fórmula de Tweedie estándar de **f-modeling**, en cambio, **puede producir reglas sesgadas bajo muestreo adaptativo** [Fuente 3]. Esta distinción es operativamente crítica: muchos equipos usan shrinkage empírico-bayesiano sobre datos de bandits multi-brazo sin verificar qué familia de estimadores están aplicando.

Caetano, Callaway, Payne y Sant'Anna atacan un problema ubicuo en la medición de incrementalidad: qué hacer cuando las covariables de control son ellas mismas afectadas por el tratamiento. La práctica habitual de **simplemente eliminar los controles malos es frecuentemente desaconsejable**, ya que puede generar sesgo en la estimación del efecto de tratamiento [Fuente 11]. Pero incluirlos como covariables post-tratamiento también viola los supuestos de identificación. Los autores proponen dos caminos: condicionar en valores pre-tratamiento del control malo —lo que conduce naturalmente al estimador de Callaway y Sant'Anna (2021)— o desarrollar estimadores de imputación y aprendizaje automático doblemente desesgado bajo una condición de no-confusión de la covariable [Fuente 11]. Ambos se extienden a adopción escalonada, el diseño más común en rollouts de marketing por geografía o cohorte temporal.

El marco GMMM de Kato, Honma y Kato extiende el Marketing Mix Modeling al problema de atribuir resultados de negocio a la presencia de marca en motores generativos, diferenciando GEO (presencia orgánica) y GEM (colocaciones patrocinadas) [Fuente 5]. La contribución conceptual es legítima: la exposición en respuestas generadas no se registra en datos de marketing estándar. Sin embargo, la validación del método es enteramente por simulación, no con datos observacionales de mercado [Fuente 5]. La lectura que hacemos es que GMMM señala correctamente la brecha de medición, pero la comunidad debería resistir la tentación de adoptar marcos causales cuyos supuestos identificadores —particularmente las probabilidades de noticia no observadas— no han sido confrontados con evidencia de campo.

El problema de las probabilidades de noticia en GMMM es análogo al de covariables estimadas en primera etapa: el error de la primera estimación se propaga a la inferencia causal final si no se corrige [Fuente 5].

Muñoz, Hess, Hancock y Sfeir demuestran que modelos con **log-likelihood similares pueden exhibir matrices de confusión sustancialmente distintas** [Fuente 4]. La métrica de ajuste global no detecta dónde un modelo confunde sistemáticamente alternativas entre sí. Esto tiene implicaciones directas para la evaluación de modelos de atribución: un MMM que ajuste bien en agregado puede estar redistribuyendo crédito entre canales de forma espuria, y solo una evaluación a nivel de alternativa individual —como la matriz de confusión probabilística propuesta— revela esos trade-offs [Fuente 4]. La evaluación fuera de muestra de estas matrices revela desplazamientos en las predicciones a nivel de alternativa que impactan significativamente el rendimiento de pronóstico [Fuente 4].

## El argumento unificado

El hilo que conecta estos hallazgos es que la causalidad en medición de marketing no se obtiene por acumulación de señal, sino por disciplina de diseño. El diseño de la asignación importa más que el tamaño de la muestra [Fuente 6]. La regla de parada es parte del diseño causal, no una decisión operativa posterior [Fuente 8]. La elección del estimador empírico-bayesiano determina si el resultado es válido o sesgado bajo adaptación [Fuente 3]. Las covariables de control requieren tratamiento explícito según su estatus causal, no eliminación por conveniencia [Fuente 11]. Y las métricas de evaluación deben operar al nivel de granularidad al que se toman las decisiones, no al nivel agregado al que se reportan [Fuente 4]. Cada una de estas decisiones es una decisión de diseño que precede al dato. La atribución causal rigurosa empieza antes de recoger la primera observación.

## Fuentes consultadas

- Publicidad, claims estratégicos y precios: atribución de éxitos y fracasos al anunciante o al rival. [ver](https://www.nber.org/papers/w35770#fromrss)

- Error de encuesta: anatomía, descomposición y fuentes dominantes de sesgo. [ver](https://www.nber.org/papers/w35680#fromrss)

- Karun Adusumilli, Jiaying Gu, and Junfan Tao. Empirical Bayes for compound adaptive experiments. [arXiv:2609.17158](https://arxiv.org/abs/2609.17158v1), 2026.

- Lorenzo Muñoz, Stephane Hess, Thomas O. Hancock, and Georges Sfeir. Using machine learning metrics to provide deeper insights into the performance of choice models. [arXiv:2609.20655](https://arxiv.org/abs/2609.20655v1), 2026.

- Masahiro Kato, Daiki Honma, and Taka Kato. Generative Marketing Mix Modeling: A Causal Inference Framework Linking GEO and GEM to Business Impact. [arXiv:2609.11915](https://arxiv.org/abs/2609.11915v1), 2026.

- Peter Hull. Optimal Experimental Design and Estimation when Potential Outcomes are Bounded. [arXiv:2608.09812](https://arxiv.org/abs/2608.09812v1), 2026.

- Jeremy Lin and Tianchen Qian. Micro-randomized Trials with Categorical Treatments and Binary Proximal Outcome: Causal Effect Estimation and Sample Size Calculation. [arXiv:2608.05135](https://arxiv.org/abs/2608.05135v1), 2026.

- Eyal A. Kazin. Precision and Decisiveness as Goals: Reliable Sequential Hypothesis Testing with a Dual Stopping Criterion. [arXiv:2608.05301](https://arxiv.org/abs/2608.05301v1), 2026.

- Simone Ciardulli, Nicole Fontana, Simone Vantini, and Francesca Ieva. Generalized propensity score weighting for functional causal inference framework. [arXiv:2608.03200](https://arxiv.org/abs/2608.03200v1), 2026.

- Keaven M. Anderson and Alison Pedley. Two-Stage Design with Sample Size Re-estimation Using gsDesign. [arXiv:2608.03456](https://arxiv.org/abs/2608.03456v1), 2026.

- Carolina Caetano, Brantly Callaway, Stroud Payne, and Hugo Sant'Anna. Difference-in-differences with &#34;bad controls&#34;. [arXiv:2608.03881](https://arxiv.org/abs/2608.03881v1), 2026.

- Minxing Zheng, Wenbin Zhou, and Shixiang Zhu. Beyond Prediction: Conformal Inference for Latent Distributional Parameters. [arXiv:2608.03607](https://arxiv.org/abs/2608.03607v1), 2026.
