# La crisis silenciosa de la medición causal: por qué la mayoría de los equipos miden ruido disfrazado de señal

> Published: 2026-07-31T17:06:43.818866+00:00
> Updated: 2026-08-04T08:31:54.885+00:00

---

## La crisis silenciosa de la medición causal: por qué la mayoría de los equipos miden ruido disfrazado de señal

Creemos que la mayor amenaza para la medición de incrementalidad no es técnica sino epistemológica: los equipos confunden robustez aparente —un p-valor bajo, un lift positivo— con evidencia causal sólida, ignorando que sus conclusiones dependen de decisiones analíticas que rara vez explicitan y de sesgos estructurales que rara vez corrigen. El cuerpo de evidencia reciente demuestra que la distancia entre lo que se cree medir y lo que efectivamente se identifica es mucho mayor de lo que la industria admite.

## El efecto que reportas depende de la especificación que elegiste

La lectura que hacemos del marco de Saraceno y Calcagnì es incómoda pero necesaria: cuando un analista elige una ventana temporal, un conjunto de controles o una transformación de la variable dependiente, no está tomando una decisión menor de implementación sino definiendo el resultado. Su análisis de multiverso muestra que los resúmenes escalares convencionales —estimaciones puntuales, p-valores— pueden ocultar cómo se distribuye la incertidumbre inferencial a través de las especificaciones alternativas. No es que exista *un* efecto verdadero envuelto en ruido; es que el propio espacio de especificaciones admisibles genera una geometría de resultados cuya dispersión puede ser enorme. Los baricentros de Fréchet y las medidas de dispersión sobre el espacio de distribuciones que proponen revelan simultáneamente la variación del efecto y la variación de la incertidumbre, información que los reportes estándar de incrementalidad sencillamente pierden [Fuente 1].

Si tu reporte de lift incremental no incluye un análisis de sensibilidad a especificaciones alternativas, estás presentando una conclusión, no evidencia.

## Lo que se asume: el análisis estándar de ensayo por conglomerados controla la contaminación entre unidades.

Lo que demuestra el marco: ese análisis es un caso especial de anclaje implícito cuyo sesgo por contaminación tiene forma cerrada — y casi nunca se reporta [Fuente 2].

## El spillover que no modelas te devora el estimador

Watson et al. formalizan algo que muchos equipos de experimentación intuyen pero pocos resuelven: en experimentos espaciales, los efectos se derraman entre unidades y la forma del kernel de spillover es identificable bajo aleatorización por conglomerados, pero su nivel no lo es. Este nivel queda aliasado con el intercepto y el efecto directo, independientemente del tamaño muestral. La implicación es demoledora: todo estimador descansa necesariamente en un supuesto de anclaje que fija ese nivel, y el sesgo resultante se descompone exactamente en tres términos —nivel, error de forma y filtración— cada uno computable antes de recoger un solo dato [Fuente 2].

El escalar de *level leverage* que introducen Watson et al. resume en un único número la exposición de cada estimando al nivel no identificado, el sesgo de nivel exacto y el coste en varianza de estimar el nivel en vez de anclarlo. Que esta información sea computable antes de la recolección de datos transforma el diseño experimental: deja de ser una negociación sobre tamaño muestral y se convierte en una auditoría de supuestos estructurales [Fuente 2].

## Diseño antes que análisis: el bloqueo como decisión causal

Azriel, Krieger y Kapelner demuestran que para resultados binarios —tasa de conversión, indicador de compra— cualquier diseño balanceado que satisfaga una condición de balance de covariables es asintóticamente óptimo en varianza. Los diseños de bloqueo satisfacen esta condición bajo supuestos de suavidad moderados. Pero aquí viene el matiz que importa: la varianza depende de probabilidades de éxito desconocidas y su estimación insesgada es imposible. Los estimadores conservadores que proponen —la generalización del estadístico CMH y la extensión del estimador de Robins— son simultáneamente conservadores en muestras finitas y asintóticamente ajustados [Fuente 3]. La industria tiende a tratar el diseño experimental como un problema resuelto por calculadoras de potencia; este trabajo muestra que la elección de diseño y la elección de estimador de varianza son decisiones entrelazadas con consecuencias directas sobre la validez de los intervalos de confianza.

## El sesgo de publicación distorsiona tu prior más de lo que crees

Ganong, Garg y Kasy construyen un toolkit para analistas que necesitan predecir el tamaño de un efecto en un nuevo contexto a partir de estudios previos. Su hallazgo central es brutal: el sesgo de publicación no es un problema teórico de journals académicos sino una distorsión operativa. Cuando un equipo de marketing calibra sus expectativas de lift basándose en benchmarks publicados o en casos de estudio seleccionados, está heredando un sesgo que puede multiplicar por 5 a 8 el efecto real [Fuente 6]. Su método de corrección por selectividad es aplicable incluso con tan solo tres estudios previos, y la reponderación por covariables hace explícitos los supuestos de transporte de efectos entre contextos — algo que la práctica habitual de 'importar benchmarks' rara vez hace.

- 12 %–21 % — El efecto medio corregido por selectividad como proporción de la media simple en los ejemplos empíricos de Ganong, Garg y Kasy
- 63–70 segundos — Reducción en tiempos totales de desplazamiento de EMS atribuida al programa de congestión de NYC mediante diseño DiD-RD

## Las covariables generadas por IA no son datos observados

Duan y Pelger documentan que el uso de LLMs para generar covariables —sentimiento, clasificaciones, expectativas— puede invalidar la inferencia downstream cuando los errores sistemáticos del modelo distorsionan las condiciones de momento del estimador. Las fuentes de error son específicas y nombradas: alucinación y sesgo de anticipación. Incluso tras corrección, las características generadas permanecen como proxies ruidosos cuyos perfiles de error varían entre modelos y entre prompts [Fuente 9]. Su marco AI-PI exige un conjunto de calibración etiquetado humanamente y concentra esas etiquetas costosas en las regiones donde las características generadas son menos fiables. La posición de IDO aquí es directa: cualquier pipeline de medición que incorpore features generadas por IA sin un protocolo de calibración humana está inyectando sesgo sistemático en su estimación causal.

## La identificación cuasi-experimental requiere pensar en estructura, no en recetas

Dos trabajos del cuerpo canónico ilustran que la elección de diseño de identificación no es intercambiable. Chikish et al. muestran que en el caso del programa de precios de congestión de Nueva York, una directiva concurrente del FDNY confunde los estimadores estándar de diferencia en diferencias pero no el diseño de diferencia en discontinuidades basado en la frontera geográfica de la calle 60. El diseño DiD-RD aisla el efecto causal explotando la cuasi-aleatoriedad de la proximidad al límite [Fuente 5]. En paralelo, Haddad et al. demuestran que los diseños de variables instrumentales transversales y de diferencia en diferencias identifican la elasticidad relativa pero no los patrones de sustitución — lo que llaman el problema del coeficiente faltante, donde los controles por observables absorben mecánicamente la sustitución [Fuente 8].

Akram et al. aportan otra lección crítica para la experimentación: el efecto de una intervención depende del entorno social del sujeto. En su experimento, solo los hogares del brazo de aprendizaje con vecinos también del brazo de aprendizaje mostraron cambio sostenido un año después, con mejoras en salud infantil de 0,08 desviaciones estándar. Ni el aprendizaje propio ni el social bastaron solos [Fuente 7]. La implicación para geo-tests o experimentos por mercado es que los efectos de tratamiento pueden depender de la densidad de exposición en el entorno, un factor que rara vez se modela.

## Lo que esto significa para equipos que miden incrementalidad

La posición de IDO se construye sobre la convergencia de estas líneas de evidencia. Primero: reportar un único número de lift incremental sin explorar el multiverso de especificaciones es presentar certidumbre ficticia [Fuente 1]. Segundo: ignorar la estructura de spillover en diseños geográficos o por conglomerados introduce un sesgo cuantificable antes de recoger datos — y cuantificarlo es responsabilidad del diseñador, no un ejercicio post-hoc [Fuente 2]. Tercero: los benchmarks de la industria heredan un sesgo de publicación que puede inflar el efecto esperado entre 5 y 8 veces [Fuente 6]. Cuarto: la incorporación de features generadas por IA en pipelines de medición requiere calibración humana explícita o el estimador es inconsistente [Fuente 9]. Quinto: la adopción escalonada —lanzamientos por mercado, activaciones regionales— tiene una estructura tensorial con una transición de fase en la ganancia de agregar capas que depende del número de unidades de tratamiento, no solo del tamaño muestral total [Fuente 4]. La medición causal rigurosa no es un problema de herramientas sino de disciplina inferencial.

## Fuentes consultadas

- Giovanni Saraceno and Antonio Calcagnì. Towards a Geometric Characterization of Multiverse Analysis. arXiv:2607.11345, 2026.

- Samuel I. Watson, Penny Hancock, Jack Fraser-Govil, Kieran DeWalt, and Thomas A. Smith. Embracing Spillover: Spatial Effects in Experiments. arXiv:2607.06506, 2026.

- David Azriel, Abba M. Krieger, and Adam Kapelner. Optimal Designs with Robust Inference for Binary Treatment Effects. arXiv:2607.05768, 2026.

- Alberto Bordino, Thomas B. Berrett, and Olga Klopp. Direct and efficient estimation of bilinear forms in staggered tensor panels. arXiv:2607.06330, 2026.

- Diferencia en discontinuidades (*difference-in-discontinuities*): identificación en experimentos naturales con fronteras geográficas

- Síntesis de literatura y corrección del sesgo de selección en meta-análisis aplicado

- Aprendizaje experiencial y social: evidencia de un experimento de campo sobre adopción de comportamiento

- Inferencia causal para elasticidad de demanda: variables instrumentales, diferencia en diferencias y el problema del coeficiente faltante

- Inferencia con covariables generadas por IA: sesgo sistemático, ruido y el marco AI-PI
