# La infraestructura de evaluación con LLMs está rota: qué significa para el marketing que depende de ella

> Published: 2026-09-18T14:56:09.916+00:00
> Updated: 2026-09-18T14:57:04.553+00:00

---

## La infraestructura de evaluación con LLMs está rota: qué significa para el marketing que depende de ella

Creemos que la industria del marketing basado en IA está construyendo sobre un instrumento de medición que no mide de forma estable. Los jueces LLM —usados para evaluar creatividades, puntuar leads, filtrar contenido— no son instrumentos congelados: su comportamiento cambia entre días sin que el operador lo sepa. Esto no es un problema técnico menor; es una fractura en la base epistémica de cualquier pipeline automatizada que use un LLM como árbitro.

## El instrumento que se mueve bajo tus pies

Zhu y Zhang auditan de forma preregistrada un supuesto que casi nadie explicita: que el mismo request enviado al mismo nombre de modelo produce el mismo resultado al día siguiente. En **52.988 intentos de request auditados**, ninguna de las dos campañas preregistradas superó la fase de validación del instrumento [Fuente 1]. La implicación es directa: si usas un LLM como juez para scoring de contenido, evaluación de creatividades o clasificación de leads, tu instrumento no es reproducible.

Tres mecanismos explican esta inestabilidad según los autores: un mapeo de etiqueta a significado que sesga las lecturas con tanta fuerza como la señal real, brechas entre candidatos de varios órdenes de magnitud, y la propia infraestructura compartida que introduce variabilidad no controlada [Fuente 1]. Para un equipo de marketing, esto significa que el A/B test que evalúas con un juez LLM el lunes puede darte un ranking diferente el miércoles — no porque tu contenido haya cambiado, sino porque el juez sí lo hizo.

- 0,400 — Concordancia Spearman dentro de la misma ventana temporal (umbral requerido: 0,90)
- 0,78 — Concordancia de replays byte-idénticos al día siguiente (umbral requerido: 0,99)

## La optimización de prompts tiene un problema de obesidad, no de inteligencia

Los optimizadores evolutivos de prompts —la tecnología que promete encontrar automáticamente el mejor prompt para tus campañas— sufren de lo que Liu et al. llaman **prompt bloat**: cada iteración añade reglas y advertencias, produciendo prompts hasta 3× más largos sin mejora proporcional en precisión [Fuente 2]. La lectura que hacemos es que más instrucciones no equivalen a mejor rendimiento; equivalen a más ruido y mayor costo de inferencia.

ESPO ataca esto con tres fases — diagnóstico estructural de errores, generación de candidatos con sesgos independientes, y selección por estabilidad bootstrap [Fuente 2]. Lo que nos interesa no es ESPO en sí, sino lo que revela: que la selección entre candidatos de prompt es **inestable** si no se controla explícitamente. Combina esto con la inestabilidad de los jueces LLM documentada en [Fuente 1] y tienes un sistema donde tanto el optimizador como el evaluador son ruidosos.

El prompt bloat es el equivalente en IA de la inflación de decks de PowerPoint: más slides no hacen mejor la presentación.

## ECE estándar: agrupa predicciones en bins discretos. Imposible de estimar con precisión garantizada sin supuestos. La herramienta que todo el mundo usa.

**rankECE**: compara vecinos de probabilidad cercana. Mejor proxy teórico y empírico para la miscalibración real. La herramienta que casi nadie usa todavía.

## Destilación como puente entre razonamiento y operación

Liu et al. demuestran que un LLM teacher puede generar etiquetas de relación estructuradas y razonamientos en lenguaje natural que supervisan un clasificador compacto. El resultado: un student de 15,5M parámetros que alcanza AUC 0,924 en un benchmark de 8.352 pares anotados por humanos, usando únicamente dos embeddings precomputados de 768 dimensiones en inferencia — sin llamadas a LLM [Fuente 4]. Para marketing de producto, esto significa que la recomendación de trade-up puede operar a escala de cientos de millones de pares sin el costo prohibitivo de inferencia LLM directa.

Dutta y Moharir introducen un punto que creemos central para cualquier operación de marketing que delegue decisiones a agentes: **un agente puede producir una respuesta correcta mediante una traza de computación inválida** [Fuente 9]. La precisión de respuesta sola no detecta este fallo. Trace Integrity exige siete propiedades — explícita, ejecutable, válida respecto al esquema, fiel al operador, reproducible, consistente con la respuesta y auditable — para considerar que una traza es fiable [Fuente 9].

Este criterio conecta directamente con la distinción de Quinto et al. entre derive (computación determinista) e infer (juicio mediado por LLM, no determinista y sujeto a revisión) [Fuente 7]. Si tu workflow de marketing no distingue cuándo el sistema calcula y cuándo el sistema opina, no puedes auditar dónde falló ni por qué. La persistencia semántica de workflows — tratarlos como objetos de conocimiento inspeccionables, reanudables y revisables — deja de ser una elegancia arquitectónica y se convierte en requisito operacional.

TRACE, el método de Tao et al. para asignación de crédito por turno en agentes de largo horizonte, ataca otro ángulo del mismo problema: las recompensas de resultado son escasas, de alta varianza y potencialmente engañosas cuando las trayectorias son largas [Fuente 6]. Un episodio fallido puede contener acciones útiles que reciben ventaja negativa injustamente. Para agentes de marketing que ejecutan campañas multi-paso, esto significa que entrenar solo con el resultado final — la conversión se produjo o no — destruye señal valiosa sobre qué pasos intermedios funcionaron.

## La posición que defendemos

La convergencia de estas líneas de investigación apunta a una tesis incómoda: la capa de evaluación y control de los sistemas de IA aplicados a marketing es más frágil que la capa de generación. Sabemos generar contenido, puntuar leads, recomendar productos. Lo que no sabemos hacer de forma fiable es verificar que esas operaciones son estables entre días [Fuente 1], que los prompts que las gobiernan no se inflan sin ganancia [Fuente 2], que las probabilidades predichas están calibradas con garantías reales [Fuente 5], y que las trazas de ejecución son auditables [Fuente 9]. Creemos que el próximo diferencial competitivo en marketing con IA no está en generar más, sino en medir mejor lo que ya se genera.

## Fuentes consultadas

- Haoyaun Zhu and Jie Zhang. Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints. [arXiv:2609.04198](https://arxiv.org/abs/2609.04198v1), 2026.

- Lihao Liu, Peng Tang, Kunwar Yashraj Singh, and Shabnam Ghadar. ESPO: Error-Structured Prompt Optimization via Diagnose, Diversify, and Stabilize. [arXiv:2609.04197](https://arxiv.org/abs/2609.04197v1), 2026.

- Quoc H. Nguyen, Ali Lafzi, Abhijeet Phatak, Siddharth Pratap Singh, Rohit Upadhyay, Yogananda Domlur Seetharama, and Chittaranjan Tripathy. RegionFed: Federated Learning for Personalized Query Understanding in Heterogeneous Retail Environments. [arXiv:2609.05403](https://arxiv.org/abs/2609.05403v1), 2026.

- Siliang Liu, Mohammad Ghasemi, Sapan Patel, and Amin Banitalebi-Dehkordi. Distill Globally, Adapt Locally: Reasoning Distillation and Product-Type Test-Time Training for Scalable Trade-Up Recommendation. [arXiv:2609.05363](https://arxiv.org/abs/2609.05363v1), 2026.

- Anirban Chatterjee and Rina Foygel Barber. A Ranking Approach for Measuring Calibration. [arXiv:2609.13100](https://arxiv.org/abs/2609.13100v1), 2026.

- Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge, Hao Cheng, Mike Hang Wang, Jianfeng Gao, and Sharon Li. TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents. [arXiv:2607.13988](https://arxiv.org/abs/2607.13988v1), 2026.

- Emanuele Quinto, Carlo Andrea Rozzi, and Francesco Zanitti. Workflow as Knowledge: Semantic Persistence for LLM-Mediated Workflows. [arXiv:2607.08740](https://arxiv.org/abs/2607.08740v1), 2026.

- Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, and Juan Carlos Niebles. Evidence-Backed Video Question Answering. [arXiv:2607.11862](https://arxiv.org/abs/2607.11862v1), 2026.

- Srimonti Dutta and Akshata Kishore Moharir. Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems. [arXiv:2608.26036](https://arxiv.org/abs/2608.26036v1), 2026.
