El error no es ruido: alucinación y sesgo de anticipación como distorsión estructural
La intuición habitual frente al error de medición es que el ruido atenúa coeficientes pero no invalida la dirección del efecto. Duan y Pelger documentan que los errores de los LLMs rompen esa intuición: la alucinación genera contenido sin anclaje en los datos de entrada, y el sesgo de anticipación incorpora información futura en la caracterización del presente [9]. Ambos mecanismos producen errores dependientes del input, lo que significa que la distorsión no se promedia a cero al aumentar la muestra. Las condiciones de momento del estimador downstream quedan violadas, y la consistencia se pierde sin importar cuántas observaciones se acumulen.
Incluso tras corrección, las características generadas permanecen como proxies ruidosos cuyos perfiles de error varían entre modelos y entre prompts [9]. No existe una covariable generada por IA que sea estable por defecto.
Sin AI-PI: la covariable generada entra directamente como observable, el sesgo dependiente del input se propaga al estimador causal, y aumentar la muestra no resuelve el problema.
Con AI-PI: un conjunto de calibración humano ancla el sesgo, la ponderación adaptativa diversifica el riesgo entre modelos, y el diseño óptimo de calibración maximiza la eficiencia del etiquetado escaso.
AI-PI: la arquitectura de corrección que el campo necesitaba
El marco AI-PI propuesto por Duan y Pelger estructura la solución en tres piezas que se refuerzan mutuamente. Primero, una corrección de sesgo específica por momento calibrada contra un conjunto etiquetado humanamente de tamaño reducido. Segundo, una ponderación adaptativa que combina de forma óptima múltiples pares modelo-prompt, explotando la variación entre ellos en lugar de tratarla como molestia. Tercero, un diseño óptimo del conjunto de calibración que concentra las costosas etiquetas humanas en las regiones donde las características generadas son menos fiables [9]. Los autores establecen consistencia y normalidad asintótica, permitiendo diseños de etiquetado adaptativos, ajuste cruzado del pipeline LLM, y GMM sobreidentificado [9].
La interacción con diseños observacionales: acumulación de fragilidades
El problema de las covariables generadas por IA se agrava cuando el diseño de identificación ya descansa sobre supuestos de sustitución o anclaje. Haddad et al. muestran que bajo sustitución homogénea condicional en observables, los diseños de IV transversal y diferencia en diferencias identifican la elasticidad relativa pero no los patrones de sustitución —el llamado problema del coeficiente faltante, donde los observables absorben mecánicamente la sustitución [8]. Si esos observables son en realidad covariables generadas por un LLM con sesgo dependiente del input, el coeficiente faltante ya no solo es irrecuperable: el propio estimado de elasticidad relativa queda contaminado por un error que ninguna corrección estándar dentro del diseño DiD o IV puede limpiar.
Un riesgo paralelo emerge en los diseños espaciales. Watson et al. demuestran que en experimentos con spillover, el nivel del kernel de spillover queda aliasado con el intercepto y el efecto directo, y que todo estimador descansa en un supuesto de anclaje cuyo sesgo se descompone en tres términos: nivel, error de forma y filtración [2]. Si las covariables que informan la especificación del kernel —por ejemplo, una clasificación de zonas geográficas generada por IA— arrastran alucinación, el error de forma del kernel se amplifica sin que el investigador disponga de señales para detectarlo, porque el sesgo de nivel ya consume sus grados de libertad diagnósticos.
El multiverso como instrumento de vigilancia
Aquí es donde la propuesta de Saraceno y Calcagnì cobra relevancia práctica directa. Su marco distribucional-geométrico representa cada especificación como una distribución sobre un espacio de salida común y estudia vecindarios locales, diámetros y baricentros de Fréchet [1]. Cuando una o varias especificaciones del multiverso incluyen covariables generadas por IA y otras no, la geometría del multiverso puede revelar si esas especificaciones se agrupan como outliers en el espacio métrico o si su inclusión desplaza el baricentro de forma desproporcionada. El marco retiene simultáneamente la variación del efecto y la variación de la incertidumbre, información que los resúmenes escalares convencionales pueden perder [1]. Creemos que esta capacidad convierte al análisis de multiverso geométrico en un diagnóstico natural para evaluar cuánto dependen las conclusiones de la calidad de las covariables generadas.
12 %–21 % — Efecto medio corregido por selectividad respecto a la media simple en los ejemplos empíricos de Ganong, Garg y Kasy ([6])
La lección del sesgo de publicación: no confiar en promedios sin corrección
Ganong, Garg y Kasy muestran que la media no corregida puede sobreestimar el efecto verdadero entre aproximadamente 5 y 8 veces [6]. La analogía con las covariables de IA es directa: así como la literatura publicada no es una muestra aleatoria de todos los estudios realizados, las covariables que un LLM genera no son una muestra aleatoria de las mediciones posibles. El sesgo de selección en la publicación y el sesgo dependiente del input en los LLMs comparten una estructura: ambos son sistemáticos, ambos sobreviven al aumento de muestra, y ambos requieren una corrección externa calibrada con datos de mayor calidad —sea un conjunto de estudios no publicados o un conjunto de etiquetas humanas.
Posición de IDO: tres principios operativos
Nuestra lectura de este cuerpo de evidencia se traduce en tres principios para cualquier equipo de medición que integre covariables generadas por IA.
Primero, nunca tratar una salida de LLM como observable directo en una ecuación de momentos sin un conjunto de calibración humano. El marco AI-PI demuestra que esto es condición necesaria para restaurar la consistencia [9].
Segundo, someter toda especificación que incluya covariables generadas a un análisis de multiverso geométrico [1], comparando explícitamente con especificaciones que usen solo variables directamente observadas. Si el baricentro de Fréchet se desplaza de forma material al incluir las covariables de IA, la conclusión debe considerarse frágil.
Tercero, en diseños donde la identificación ya depende de supuestos de anclaje —como los spillover espaciales [2] o los modelos de sustitución homogénea [8]—, la carga de validación de las covariables generadas debe ser más exigente, no menos, porque el error se propaga a través de canales que el investigador no puede diagnosticar con los datos experimentales solos.
La promesa de los LLMs como herramienta de extracción de covariables es real: permiten operar sobre texto, imágenes y señales no estructuradas a un coste marginal cercano a cero. Pero la inferencia causal no tolera costes marginales cercanos a cero en la calidad de las variables. El marco AI-PI de Duan y Pelger es, hasta donde conocemos, la primera respuesta formalmente rigurosa a esta tensión. Adoptarlo no es opcional para quien pretenda hacer incrementalidad con datos parcialmente generados por modelos de lenguaje.
Fuentes consultadas
- Giovanni Saraceno and Antonio Calcagnì. Towards a Geometric Characterization of Multiverse Analysis. arXiv:2607.11345, 2026.
- Samuel I. Watson, Penny Hancock, Jack Fraser-Govil, Kieran DeWalt, and Thomas A. Smith. Embracing Spillover: Spatial Effects in Experiments. arXiv:2607.06506, 2026.
- David Azriel, Abba M. Krieger, and Adam Kapelner. Optimal Designs with Robust Inference for Binary Treatment Effects. arXiv:2607.05768, 2026.
- Alberto Bordino, Thomas B. Berrett, and Olga Klopp. Direct and efficient estimation of bilinear forms in staggered tensor panels. arXiv:2607.06330, 2026.
- Diferencia en discontinuidades (difference-in-discontinuities): identificación en experimentos naturales con fronteras geográficas. ver
- Síntesis de literatura y corrección del sesgo de selección en meta-análisis aplicado. ver
- Aprendizaje experiencial y social: evidencia de un experimento de campo sobre adopción de comportamiento. ver
- Inferencia causal para elasticidad de demanda: variables instrumentales, diferencia en diferencias y el problema del coeficiente faltante. ver
- Inferencia con covariables generadas por IA: sesgo sistemático, ruido y el marco AI-PI. ver
Seguir leyendo
Piezas del mismo hilo de trabajo.
Qué es un modelo de atribución en marketing: una lectura desde la causalidad y sus límitesMedición
Los modelos de atribución asignan crédito a puntos de contacto, pero la mayoría miden correlación, no causalidad. Una lectura crítica de sus límites…
Parte de alguna de las mismas fuentes que este artículo.
Leer el artículo →La medición causal no tiene un resultado: tiene un multiverso de resultados, y la mayoría de los equipos elige uno sin saber por quéMedición
Cada decisión de especificación en un modelo causal produce una conclusión diferente. Este artículo explica por qué el problema es epistémico, no técnico.
Leer el artículo →La crisis silenciosa de la medición causal: por qué la mayoría de los equipos miden ruido disfrazado de señalMedición
La mayoría de los equipos confunden un lift positivo con causalidad real. Este artículo explica por qué y qué condiciones analíticas lo provocan.
Leer el artículo →La causalidad en marketing espacial descansa sobre supuestos que nadie auditaMedición
La causalidad en marketing espacial descansa sobre supuestos que nadie audita. Qué revisar antes de fiarte de tus modelos geográficos. Análisis de medición.
Leer el artículo →Marketing digital con inteligencia artificial: no es automatización cosmética, es infraestructura de conocimientoIA y marketing
El marketing con IA real no es sumar chatbots: es construir sistemas que razonan sobre evidencia, persisten conocimiento y asignan valor a cada decisión.
Leer el artículo →Los recomendadores con LLMs necesitan explicar sus decisiones tanto como acertarlasEcommerce
Los recomendadores con LLMs necesitan explicar sus decisiones tanto como acertarlas. Transparencia como ventaja en el ecommerce con inteligencia artificial.
Leer el artículo →