El efecto que reportas depende de la especificación que elegiste
La lectura que hacemos del marco de Saraceno y Calcagnì es incómoda pero necesaria: cuando un analista elige una ventana temporal, un conjunto de controles o una transformación de la variable dependiente, no está tomando una decisión menor de implementación sino definiendo el resultado. Su análisis de multiverso muestra que los resúmenes escalares convencionales —estimaciones puntuales, p-valores— pueden ocultar cómo se distribuye la incertidumbre inferencial a través de las especificaciones alternativas. No es que exista un efecto verdadero envuelto en ruido; es que el propio espacio de especificaciones admisibles genera una geometría de resultados cuya dispersión puede ser enorme. Los baricentros de Fréchet y las medidas de dispersión sobre el espacio de distribuciones que proponen revelan simultáneamente la variación del efecto y la variación de la incertidumbre, información que los reportes estándar de incrementalidad sencillamente pierden [1].
Lo que se asume: el análisis estándar de ensayo por conglomerados controla la contaminación entre unidades.
Lo que demuestra el marco: ese análisis es un caso especial de anclaje implícito cuyo sesgo por contaminación tiene forma cerrada — y casi nunca se reporta [2].
El spillover que no modelas te devora el estimador
Watson et al. formalizan algo que muchos equipos de experimentación intuyen pero pocos resuelven: en experimentos espaciales, los efectos se derraman entre unidades y la forma del kernel de spillover es identificable bajo aleatorización por conglomerados, pero su nivel no lo es. Este nivel queda aliasado con el intercepto y el efecto directo, independientemente del tamaño muestral. La implicación es demoledora: todo estimador descansa necesariamente en un supuesto de anclaje que fija ese nivel, y el sesgo resultante se descompone exactamente en tres términos —nivel, error de forma y filtración— cada uno computable antes de recoger un solo dato [2].
El escalar de level leverage que introducen Watson et al. resume en un único número la exposición de cada estimando al nivel no identificado, el sesgo de nivel exacto y el coste en varianza de estimar el nivel en vez de anclarlo. Que esta información sea computable antes de la recolección de datos transforma el diseño experimental: deja de ser una negociación sobre tamaño muestral y se convierte en una auditoría de supuestos estructurales [2].
Diseño antes que análisis: el bloqueo como decisión causal
Azriel, Krieger y Kapelner demuestran que para resultados binarios —tasa de conversión, indicador de compra— cualquier diseño balanceado que satisfaga una condición de balance de covariables es asintóticamente óptimo en varianza. Los diseños de bloqueo satisfacen esta condición bajo supuestos de suavidad moderados. Pero aquí viene el matiz que importa: la varianza depende de probabilidades de éxito desconocidas y su estimación insesgada es imposible. Los estimadores conservadores que proponen —la generalización del estadístico CMH y la extensión del estimador de Robins— son simultáneamente conservadores en muestras finitas y asintóticamente ajustados [3]. La industria tiende a tratar el diseño experimental como un problema resuelto por calculadoras de potencia; este trabajo muestra que la elección de diseño y la elección de estimador de varianza son decisiones entrelazadas con consecuencias directas sobre la validez de los intervalos de confianza.
El sesgo de publicación distorsiona tu prior más de lo que crees
Ganong, Garg y Kasy construyen un toolkit para analistas que necesitan predecir el tamaño de un efecto en un nuevo contexto a partir de estudios previos. Su hallazgo central es brutal: el sesgo de publicación no es un problema teórico de journals académicos sino una distorsión operativa. Cuando un equipo de marketing calibra sus expectativas de lift basándose en benchmarks publicados o en casos de estudio seleccionados, está heredando un sesgo que puede multiplicar por 5 a 8 el efecto real [6]. Su método de corrección por selectividad es aplicable incluso con tan solo tres estudios previos, y la reponderación por covariables hace explícitos los supuestos de transporte de efectos entre contextos — algo que la práctica habitual de 'importar benchmarks' rara vez hace.
Las covariables generadas por IA no son datos observados
Duan y Pelger documentan que el uso de LLMs para generar covariables —sentimiento, clasificaciones, expectativas— puede invalidar la inferencia downstream cuando los errores sistemáticos del modelo distorsionan las condiciones de momento del estimador. Las fuentes de error son específicas y nombradas: alucinación y sesgo de anticipación. Incluso tras corrección, las características generadas permanecen como proxies ruidosos cuyos perfiles de error varían entre modelos y entre prompts [9]. Su marco AI-PI exige un conjunto de calibración etiquetado humanamente y concentra esas etiquetas costosas en las regiones donde las características generadas son menos fiables. La posición de IDO aquí es directa: cualquier pipeline de medición que incorpore features generadas por IA sin un protocolo de calibración humana está inyectando sesgo sistemático en su estimación causal.
La identificación cuasi-experimental requiere pensar en estructura, no en recetas
Dos trabajos del cuerpo canónico ilustran que la elección de diseño de identificación no es intercambiable. Chikish et al. muestran que en el caso del programa de precios de congestión de Nueva York, una directiva concurrente del FDNY confunde los estimadores estándar de diferencia en diferencias pero no el diseño de diferencia en discontinuidades basado en la frontera geográfica de la calle 60. El diseño DiD-RD aisla el efecto causal explotando la cuasi-aleatoriedad de la proximidad al límite [5]. En paralelo, Haddad et al. demuestran que los diseños de variables instrumentales transversales y de diferencia en diferencias identifican la elasticidad relativa pero no los patrones de sustitución — lo que llaman el problema del coeficiente faltante, donde los controles por observables absorben mecánicamente la sustitución [8].
Akram et al. aportan otra lección crítica para la experimentación: el efecto de una intervención depende del entorno social del sujeto. En su experimento, solo los hogares del brazo de aprendizaje con vecinos también del brazo de aprendizaje mostraron cambio sostenido un año después, con mejoras en salud infantil de 0,08 desviaciones estándar. Ni el aprendizaje propio ni el social bastaron solos [7]. La implicación para geo-tests o experimentos por mercado es que los efectos de tratamiento pueden depender de la densidad de exposición en el entorno, un factor que rara vez se modela.
Lo que esto significa para equipos que miden incrementalidad
La posición de IDO se construye sobre la convergencia de estas líneas de evidencia. Primero: reportar un único número de lift incremental sin explorar el multiverso de especificaciones es presentar certidumbre ficticia [1]. Segundo: ignorar la estructura de spillover en diseños geográficos o por conglomerados introduce un sesgo cuantificable antes de recoger datos — y cuantificarlo es responsabilidad del diseñador, no un ejercicio post-hoc [2]. Tercero: los benchmarks de la industria heredan un sesgo de publicación que puede inflar el efecto esperado entre 5 y 8 veces [6]. Cuarto: la incorporación de features generadas por IA en pipelines de medición requiere calibración humana explícita o el estimador es inconsistente [9]. Quinto: la adopción escalonada —lanzamientos por mercado, activaciones regionales— tiene una estructura tensorial con una transición de fase en la ganancia de agregar capas que depende del número de unidades de tratamiento, no solo del tamaño muestral total [4]. La medición causal rigurosa no es un problema de herramientas sino de disciplina inferencial.
Fuentes consultadas
- Giovanni Saraceno and Antonio Calcagnì. Towards a Geometric Characterization of Multiverse Analysis. arXiv:2607.11345, 2026.
- Samuel I. Watson, Penny Hancock, Jack Fraser-Govil, Kieran DeWalt, and Thomas A. Smith. Embracing Spillover: Spatial Effects in Experiments. arXiv:2607.06506, 2026.
- David Azriel, Abba M. Krieger, and Adam Kapelner. Optimal Designs with Robust Inference for Binary Treatment Effects. arXiv:2607.05768, 2026.
- Alberto Bordino, Thomas B. Berrett, and Olga Klopp. Direct and efficient estimation of bilinear forms in staggered tensor panels. arXiv:2607.06330, 2026.
- Diferencia en discontinuidades (difference-in-discontinuities): identificación en experimentos naturales con fronteras geográficas
- Síntesis de literatura y corrección del sesgo de selección en meta-análisis aplicado
- Aprendizaje experiencial y social: evidencia de un experimento de campo sobre adopción de comportamiento
- Inferencia causal para elasticidad de demanda: variables instrumentales, diferencia en diferencias y el problema del coeficiente faltante
- Inferencia con covariables generadas por IA: sesgo sistemático, ruido y el marco AI-PI
Seguir leyendo
Piezas del mismo hilo de trabajo.
La medición causal no tiene un resultado: tiene un multiverso de resultados, y la mayoría de los equipos elige uno sin saber por quéMedición
Cada decisión de especificación en un modelo causal produce una conclusión diferente. Este artículo explica por qué el problema es epistémico, no técnico.
Leer el artículo →La causalidad en marketing espacial descansa sobre supuestos que nadie auditaMedición
La causalidad en marketing espacial descansa sobre supuestos que nadie audita. Qué revisar antes de fiarte de tus modelos geográficos. Análisis de medición.
Leer el artículo →El nivel del kernel no se identifica: por qué la medición de incrementalidad necesita supuestos explícitos, no más datosMedición
Tres líneas de evidencia muestran que más datos no resuelven la no identificación en kernels de spillover: el sesgo de publicación infla efectos entre 5 y…
Leer el artículo →Resultados binarios en experimentos de incrementalidad: por qué el bloqueo con inferencia CMH es la apuesta correctaMedición
Resultados binarios en experimentos de incrementalidad: por qué el bloqueo con inferencia CMH es la apuesta correcta. Di.
Leer el artículo →Adopción escalonada como instrumento de medición causal: lo que se gana y lo que se pierde al escalonar tratamientosMedición
La adopción escalonada como instrumento de medición causal en marketing. Qué se gana y qué se asume al usarla para atribuir impacto real.
Leer el artículo →Difference-in-discontinuities e instrumentos para elasticidad: qué identifican realmente y qué dejan sin resolverMedición
Qué identifican realmente IV, DiD y difference-in-discontinuities en marketing, y qué dejan sin resolver. Guía honesta de instrumentos de medición causal.
Leer el artículo →