El problema de la recompensa tardía: por qué un agente que 'acertó la campaña' no necesariamente aprendió bien
Cuando una agencia evalúa un agente de IA por el resultado final — la campaña funcionó o no funcionó —, está aplicando lo que en aprendizaje por refuerzo se llama outcome reward. Tao et al. (2025) demuestran que esta señal es problemática en trayectorias largas por tres razones concretas: la señal llega solo al final de secuencias extensas (escasez), pequeñas variaciones tardías cambian el resultado de forma desproporcionada (alta varianza), y un episodio fallido puede contener muchas acciones útiles que quedan penalizadas injustamente (señal engañosa) [1]. Trasladado a una agencia: si un agente ejecutó correctamente la segmentación de audiencia, generó copies adecuados y eligió bien los canales, pero falló en el último paso de configuración de pujas, evaluar todo el flujo como 'fracaso' destruye información valiosa sobre qué sí funcionó.
La solución propuesta por TRACE — asignar crédito denso por turno usando las transiciones entre llamadas a herramientas como puntos de evaluación [1] — tiene una implicación directa para agencias que construyen o adoptan agentes: cada interacción del agente con una herramienta (el CRM, la plataforma de ads, el generador de creatividades) debería ser un punto de evaluación independiente, no un eslabón opaco en una cadena que solo se juzga al final. La lectura que hacemos es que las agencias que diseñen sus agentes con tool-call boundaries explícitas tendrán mejor visibilidad sobre dónde falla el proceso y, crucialmente, mejor capacidad de entrenamiento iterativo.
derive (determinista): calcular el CPA de una campaña a partir de datos de la plataforma. El agente aplica una fórmula; el resultado es verificable y repetible [Fuente 2].
infer (no determinista): decidir que el copy B es más relevante para el segmento joven basándose en el contexto disponible. Esto es juicio del LLM, sujeto a revisión y potencialmente diferente en cada ejecución [2].
El problema de la recompensa tardía: por qué un agente que 'acertó la campaña' no necesariamente aprendió bien
Cuando una agencia evalúa un agente de IA por el resultado final — la campaña funcionó o no funcionó —, está aplicando lo que en aprendizaje por refuerzo se llama outcome reward. Tao et al. (2025) demuestran que esta señal es problemática en trayectorias largas por tres razones concretas: la señal llega solo al final de secuencias extensas (escasez), pequeñas variaciones tardías cambian el resultado de forma desproporcionada (alta varianza), y un episodio fallido puede contener muchas acciones útiles que quedan penalizadas injustamente (señal engañosa) [1]. Trasladado a una agencia: si un agente ejecutó correctamente la segmentación de audiencia, generó copies adecuados y eligió bien los canales, pero falló en el último paso de configuración de pujas, evaluar todo el flujo como 'fracaso' destruye información valiosa sobre qué sí funcionó.
La solución propuesta por TRACE — asignar crédito denso por turno usando las transiciones entre llamadas a herramientas como puntos de evaluación [1] — tiene una implicación directa para agencias que construyen o adoptan agentes: cada interacción del agente con una herramienta (el CRM, la plataforma de ads, el generador de creatividades) debería ser un punto de evaluación independiente, no un eslabón opaco en una cadena que solo se juzga al final. La lectura que hacemos es que las agencias que diseñen sus agentes con tool-call boundaries explícitas tendrán mejor visibilidad sobre dónde falla el proceso y, crucialmente, mejor capacidad de entrenamiento iterativo.
Quinto, Rozzi y Zanitti (2025) señalan que los sistemas de workflows existentes tratan los flujos como secuencias de pasos que producen resultados y dejan trazas, pero dificultan la inspección, reanudación y revisión de procesos en curso — especialmente cuando interviene un LLM con juicio no determinista [2]. Una agencia de marketing que despliega un agente para gestionar campañas multicanal se enfrenta exactamente a este problema: el agente toma decisiones intermedias (qué segmento priorizar, qué variante de copy descartar, cuándo escalar presupuesto) que son actos de juicio, no cómputos deterministas. Si el workflow se evapora tras la ejecución, no hay forma de auditar ese juicio ni de aprender de él.
La distinción derive / infer propuesta en el modelo Workflow-as-Knowledge [2] es, creemos, el marco conceptual que las agencias necesitan para decidir dónde confían en la automatización total y dónde insertan puntos de aprobación humana. Todo paso derive puede automatizarse con confianza; todo paso infer debería ser, como mínimo, inspeccionable a posteriori. La persistencia semántica del workflow — que el flujo sea un objeto de conocimiento reanudable y revisable, no una traza muerta — es lo que convierte a un agente en un sistema operable a escala de agencia.
Las agencias manejan cantidades crecientes de contenido en video — creatividades, UGC, análisis competitivo, sesiones de usuario. Wang et al. (2025) identifican una disociación crítica en los Video LLMs: pueden acertar la respuesta textual a una pregunta sobre un video sin haber percibido realmente el contenido visual relevante [3]. Para una agencia, esto significa que un agente que 'analiza' un spot publicitario y produce un informe textual convincente puede estar fabricando coherencia narrativa sin anclaje en lo que realmente muestra el video.
La propuesta E-VQA exige que el modelo produzca simultáneamente una respuesta semántica y evidencia espacio-temporal precisa — segmentos temporales y máscaras de segmentación densa [3]. Creemos que este doble requisito (respuesta + grounding verificable) debería ser el estándar mínimo para cualquier agente de agencia que opere sobre contenido audiovisual. Un agente que dice 'el producto aparece en los primeros 3 segundos del spot' debería poder señalar exactamente dónde y en qué frames, no solo afirmarlo.
La tesis operativa para agencias
Reuniendo las tres líneas: un agente de IA útil para una agencia de marketing no es el que ejecuta más pasos sin intervención, sino el que (1) permite evaluar cada paso de forma independiente en lugar de juzgar solo por el resultado final [1], (2) distingue explícitamente entre computación determinista y juicio no determinista, manteniendo el workflow como objeto inspeccionable y reanudable [2], y (3) cuando opera sobre contenido visual, produce evidencia verificable y anclada, no solo respuestas textuales plausibles [3]. La autonomía sin estas tres propiedades no es eficiencia — es opacidad con velocidad. Y la opacidad, en un negocio donde el cliente paga por el criterio profesional de la agencia, es un riesgo existencial que ningún ahorro de horas justifica.
Fuentes consultadas
- Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge, Hao Cheng, Mike Hang Wang, Jianfeng Gao, and Sharon Li. TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents. arXiv:2607.13988, 2026.
- Emanuele Quinto, Carlo Andrea Rozzi, and Francesco Zanitti. Workflow as Knowledge: Semantic Persistence for LLM-Mediated Workflows. arXiv:2607.08740, 2026.
- Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, and Juan Carlos Niebles. Evidence-Backed Video Question Answering. arXiv:2607.11862, 2026.
Seguir leyendo
Piezas del mismo hilo de trabajo.
Asignación de crédito y persistencia semántica: dos piezas que el marketing automatizado necesita resolver antes de escalar agentesIA y marketing
Asignación de crédito y persistencia semántica: dos piezas que el marketing automatizado debe resolver antes de escalar agentes. IA aplicada a marketing.
Leer el artículo →Marketing digital con inteligencia artificial: no es automatización cosmética, es infraestructura de conocimientoIA y marketing
El marketing con IA real no es sumar chatbots: es construir sistemas que razonan sobre evidencia, persisten conocimiento y asignan valor a cada decisión.
Parte de alguna de las mismas fuentes que este artículo.
Leer el artículo →La asignación de crédito, la persistencia semántica y la evidencia visual: tres problemas técnicos que el marketing con IA aún no sabe que tieneIA y marketing
El marketing con IA arrastra tres déficits sin resolver: atribución en flujos agénticos, pérdida de conocimiento entre workflows y análisis de vídeo sin…
Leer el artículo →El marketing automatizado necesita agentes que muestren su trabajo, no solo que den respuestasIA y marketing
El marketing automatizado necesita agentes que muestren su trabajo. Por qué la trazabilidad, no la autonomía, hace confiable la IA aplicada a marketing.
Leer el artículo →El agente de código fiable no es el que más sabe, sino el que menos decideDesarrollo con IA
Cada decisión delegada al LLM que podría resolverse de forma determinista reduce la fiabilidad del agente. Este análisis explica por qué y cómo corregirlo.
Leer el artículo →El agente de comercio que no protege su memoria no merece la confianza que pideEcommerce
El agente de comercio que no protege su memoria no merece la confianza que pide. Seguridad y estado en el ecommerce con IA agéntica. Análisis técnico.
Leer el artículo →