# La auditabilidad como requisito no negociable para agentes LLM en marketing

> Published: 2026-08-30T06:23:08.266+00:00
> Updated: 2026-08-30T06:23:59.608+00:00

---

## La auditabilidad como requisito no negociable para agentes LLM en marketing

Creemos que la próxima frontera competitiva en marketing automatizado no es la precisión de los agentes LLM, sino su auditabilidad. Un agente que genera el segmento correcto, la creatividad ganadora o el presupuesto óptimo por una ruta de computación opaca e irreproducible no es un activo: es un riesgo operativo disfrazado de eficiencia. La evidencia reciente en Trace Integrity, persistencia semántica de workflows y asignación densa de crédito converge en una misma dirección: sin trazabilidad computacional verificable, el despliegue de agentes en marketing es una apuesta, no una decisión informada.

## La respuesta correcta no basta: el Structure Gap en operaciones de marketing

Dutta y Moharir identifican lo que denominan **Structure Gap**: el desfase entre el razonamiento en lenguaje natural que produce un agente y los programas a nivel de operador que los sistemas del mundo real requieren [Fuente 1]. La consecuencia práctica es demoledora para marketing: un agente puede devolver la audiencia correcta para una campaña programática mediante una traza de computación inválida —filtros mal aplicados, joins sobre campos equivocados, lógica de segmentación que no respeta el esquema del CDP— y la métrica estándar de precisión de respuesta no detectará el fallo. Si después esa misma lógica se reutiliza en otra campaña o se escala a otro mercado, el error se propaga sin control.

La evaluación por *answer accuracy* es al agente LLM lo que el CTR es a la creatividad: una señal parcial que confundimos con validación completa.

La propuesta de Trace Integrity exige siete propiedades simultáneas en la traza de computación: que sea explícita, ejecutable, válida respecto al esquema, fiel al operador, reproducible, consistente con la respuesta y auditable [Fuente 1]. En la lectura que hacemos desde IDO, estas propiedades no son un estándar académico remoto: son el contrato mínimo que cualquier equipo de marketing debería exigir a un agente antes de permitirle modificar pujas, crear audiencias o generar reportes sobre datos estructurados. Sin ese contrato, la automatización opera bajo fe ciega.

## derive: computación determinista sobre estado disponible. No involucra juicio del LLM. Un cálculo de ROAS sobre datos de campaña es un derive: reproducible, verificable, sin ambigüedad [Fuente 3].

**infer**: juicio mediado por el LLM bajo contexto declarado, no determinista, sujeto a revisión. La selección de tono para una creatividad basada en el perfil de audiencia es un infer: depende del contexto inyectado y de la política del modelo [Fuente 3].

## Workflows LLM: el problema no es ejecutar, es recordar y justificar

A medida que los flujos de marketing incorporan herramientas externas, puntos de aprobación humana y ramificación condicional —pensemos en un workflow que genera copy, lo pasa por brand safety, ajusta según resultados de A/B test y finalmente publica—, la gestión deja de ser un problema de ejecución y se convierte en un problema de representación del conocimiento. Quinto, Rozzi y Zanitti (2025) proponen el modelo **Workflow-as-Knowledge**, donde los workflows son objetos inspeccionables, reanudables y revisables, no secuencias efímeras que dejan trazas parciales [Fuente 3].

Esta distinción entre derive e infer tiene implicaciones directas para la gobernanza de marketing automatizado. Cuando un workflow falla o produce un resultado inesperado —un presupuesto mal asignado, una creatividad fuera de marca—, la capacidad de identificar si el error provino de una computación determinista defectuosa o de un juicio no determinista del modelo cambia radicalmente la respuesta del equipo. Sin esta separación semántica, la depuración de un flujo de marketing multi-paso es arqueología, no ingeniería [Fuente 3].

Tao et al. (2025) documentan un problema que resuena con fuerza en el entrenamiento de agentes para marketing: las recompensas basadas únicamente en el resultado final son escasas, de alta varianza y potencialmente engañosas en trayectorias largas [Fuente 4]. Trasladado a nuestro dominio: un agente que gestiona una campaña multi-canal a lo largo de decenas de decisiones —ajuste de pujas, redistribución de presupuesto, selección de creatividades, pausa de ad sets— y que solo recibe señal al cierre de campaña (CPA final, ROAS total) no puede aprender qué decisiones intermedias fueron valiosas y cuáles destructivas.

Los autores señalan explícitamente que un episodio fallido puede contener muchas acciones útiles que acercaron al agente al objetivo; asignarles ventaja negativa idéntica al error final perjudica el aprendizaje [Fuente 4]. TRACE propone representar cada llamada a herramienta como una transición de estado y asignar crédito denso por turno, no solo por resultado. Para marketing, esto significa que un agente que redistribuyó bien el presupuesto en los turnos 3 a 7 pero falló en el turno 8 al elegir la creatividad equivocada debería recibir señal positiva por lo primero y negativa por lo segundo, no un castigo uniforme.

Evaluar un agente de campaña solo por el ROAS final es como evaluar a un media buyer solo por el resultado del último mes: se pierde toda la información de proceso.

## La capa visual no es excepción: evidencia verificable en análisis de video

El mismo patrón de exigencia de auditabilidad aparece en el dominio visual. Wang et al. (2025) documentan una **disociación crítica** entre la precisión en QA y la percepción visual real en Video LLMs: el modelo responde correctamente sobre el contenido del video sin demostrar que realmente percibe lo que dice percibir [Fuente 2]. Para equipos de marketing que usan modelos de video para análisis de creatividades, revisión de spots o comprensión de sesiones de usuario grabadas, esta disociación invalida la confianza en el análisis automatizado.

La propuesta E-VQA exige que el modelo produzca simultáneamente una respuesta semántica y evidencia espacio-temporal precisa: segmentos temporales y máscaras de segmentación densa [Fuente 2]. En la práctica, esto significa que si un agente afirma que el logo aparece durante los primeros 3 segundos del spot, debe acompañar esa afirmación con la localización exacta del objeto en cada frame. Sin ese anclaje, el análisis automatizado de video es texto generado sobre imágenes, no comprensión visual demostrada.

## La posición de IDO: trazabilidad como estándar de despliegue

Las cuatro líneas de investigación que hemos examinado convergen en un argumento unitario: la precisión de salida —ya sea una respuesta textual, un resultado de campaña o un análisis de video— es condición necesaria pero radicalmente insuficiente para el despliegue responsable de agentes LLM en marketing. Creemos que el estándar mínimo viable incluye tres capas: trazas de computación auditables según las siete propiedades de Trace Integrity [Fuente 1], separación semántica entre operaciones deterministas y juicios no deterministas del modelo [Fuente 3], y señal de crédito granular que permita atribuir valor a cada decisión intermedia del agente [Fuente 4]. Quien despliegue agentes sin estas capas no está automatizando marketing: está delegando decisiones económicas a una caja negra y esperando que funcione.

## Fuentes consultadas

- Srimonti Dutta and Akshata Kishore Moharir. Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems. [arXiv:2608.26036](https://arxiv.org/abs/2608.26036v1), 2026.

- Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, and Juan Carlos Niebles. Evidence-Backed Video Question Answering. [arXiv:2607.11862](https://arxiv.org/abs/2607.11862v1), 2026.

- Emanuele Quinto, Carlo Andrea Rozzi, and Francesco Zanitti. Workflow as Knowledge: Semantic Persistence for LLM-Mediated Workflows. [arXiv:2607.08740](https://arxiv.org/abs/2607.08740v1), 2026.

- Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge, Hao Cheng, Mike Hang Wang, Jianfeng Gao, and Sharon Li. TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents. [arXiv:2607.13988](https://arxiv.org/abs/2607.13988v1), 2026.
