MarketingHablemos
Edición · es

Insight

El copy que funciona ya no es el que seduce: es el que sobrevive al escrutinio de máquinas y al autoengaño de quien lo escribe.

Por qué la eficacia del copy depende de auditar los sistemas RAG, los agentes de compra y los procesos internos que lo evalúan, antes de redactar.

Creemos que la persuasión publicitaria enfrenta una crisis de infraestructura, no de talento. Los sistemas que alimentan la investigación creativa (RAG), los agentes que intermedian compras y los propios equipos que evalúan su trabajo introducen distorsiones medibles que ningún brief brillante puede compensar si no se reconocen primero. La tesis de IDO es directa: antes de escribir mejor copy, hay que auditar las tuberías que lo informan, los entornos que lo entregan y los procesos internos que lo aprueban.

Tu investigación de audiencia puede estar mintiendo sin saberlo

Los equipos de copy que sintetizan opiniones de usuario mediante herramientas RAG —para extraer insights de reseñas, menciones sociales o feedback— operan sobre un mecanismo de recuperación que privilegia la similitud con la consulta, no la representatividad de lo que la gente realmente piensa. Thakur et al. documentan que la recuperación estándar por similitud coseno puede silenciar opiniones minoritarias y producir una respuesta que aparenta consenso sin serlo [1]. Un brief construido sobre esa síntesis sesgada arrastra el error hasta la pieza final: el copy habla a una mayoría que quizá no existe tal como se la describe.

Pero el sesgo de representatividad no es el único problema. Ning y Li demuestran que un sistema RAG puede devolver respuestas materialmente distintas tras una simple expansión del índice, sin que cambie el modelo, el prompt ni la política de recuperación. Lo llaman accuracy-blind answer churn: la precisión global apenas se mueve mientras las respuestas individuales mutan [2]. Para un equipo de copy, esto significa que el briefing que se generó el lunes puede contradecir el que se genere el jueves, y ninguna métrica de calidad del sistema lo señalará.

Una réplica con DeepSeek encontró 8,75 pp de exceso de churn incluso cuando la precisión exacta subió 3 puntos [2]. El problema no es la dirección del cambio: es su invisibilidad.

43 %
Reducción mínima del error distribucional lograda por WARP frente a recuperación estándar
Variantes adaptadas al dominio, en tres dominios de reseñas con 35 000 documentos y 156 consultas [1]
86 %
Comparaciones decididas en que jueces LLM prefirieron respuestas generadas con WARP (k ≤ 5)
Panel de cinco jueces LLM [1]
10,25 pp
Exceso de churn semántico normalizado entre snapshots del índice
Frente a un cambio de precisión exacta de solo −1,50 pp, en 400 preguntas de Natural Questions [2]

Copy para humanos: brevedad, impacto emocional inmediato, jerarquía visual. El primer resultado captura la atención escasa.

Copy para agentes IA: exhaustividad, declaración explícita de atributos diferenciales, consistencia entre listado y página de destino. Los agentes procesan texto literal, no subtexto [3].

Los nudges no desaparecen con los agentes: se desplazan

Halimeh et al. evaluaron 3 600 agentes en 21 600 simulaciones de compra y encontraron que los agentes IA son susceptibles tanto a nudges automáticos (selecciones por defecto) como a nudges reflexivos (señales de influencia social) [4]. El hallazgo que más importa al copy es que activar el razonamiento extendido del agente no produce robustez general: reduce la susceptibilidad a nudges por defecto pero incrementa la susceptibilidad a nudges de influencia social reflexivos [4]. Más razonamiento desplaza el canal de influencia sin eliminarlo.

Para el redactor esto plantea una pregunta incómoda: ¿estamos escribiendo para persuadir a una persona, o para sobrevivir al filtro de un agente que es vulnerable a mecanismos de diseño que ni siquiera controlamos?

Kim y Newman documentan lo que llaman Creative Endowment Effect: los creadores seleccionan y envían un mayor número de ideas de baja calidad cuando evalúan su propia producción que cuando evalúan ideas ajenas. El efecto se observó en tres tareas, en dos dominios creativos diferentes, y —esto es lo crítico— informar a los participantes de la existencia del sesgo no lo eliminó [10]. La intervención informacional fracasa. Lo que sí funcionó fue el distanciamiento temporal: revisitar las ideas varios meses después aumentó la selectividad [10].

Y cuando el equipo recurre a un LLM como juez de calidad del copy, aparece otro sesgo: Zhang y Li muestran que el tono del prompt de evaluación puede desplazar el umbral de aprobación/rechazo del modelo sin mejorar la calidad del juicio. El mecanismo no es una mejora evaluativa sino un desplazamiento del punto operativo de severidad [5]. En 32 contrastes modelo-tono, el mayor cambio en NDCG@10 fue de apenas 0,011, pero un Kendall's τ tan bajo como 0,743 indica que la reordenación de piezas evaluadas no es nula [5]. Un prompt amable no genera un juez más sabio: genera un juez más laxo.

Lo que no sabemos es tan importante como lo que sabemos

Tannenbaum auditó 317 interacciones de asistentes IA comerciales y encontró que en los 67 episodios orientados a compra retenidos, hubo cero compromisos explícitos de compra, cero reportes de compra completada y cero declaraciones de abandono [8]. El contenido de la recomendación es observable; la decisión posterior del comprador, no. Solo 18 de 67 episodios (26,9 %) contienen un turno de usuario posterior dentro de la misma misión de compra [8]. Usar la profundidad de conversación como proxy de conversión sobreestima la disponibilidad de seguimiento en un 27,8 % [8].

Del mismo modo, Żatuchin demuestra que la presencia de una marca en respuestas de LLM no es un estado binario ni estático: los motores sin búsqueda web seguían añadiendo marcas nunca vistas en la ejecución 15 en el 86–92 % de las celdas analizadas, con repertorios medianos de 15 a 31 organizaciones por pregunta [9]. Una sola consulta captura entre el 62 y el 77 % del repertorio de cinco ejecuciones [9]. Medir visibilidad de marca con una sola ejecución es medir con un termómetro roto.

La posición de IDO

Creemos que el copy basado en evidencia no empieza en la línea de texto: empieza en la auditoría de las fuentes que informan ese texto, en el reconocimiento de que los entornos de entrega están bifurcándose entre humanos y agentes con lógicas de selección distintas, y en la aceptación de que ni el talento creativo ni la consciencia del sesgo protegen contra la sobrevaluación del propio trabajo [10]. La persuasión con base empírica exige tres disciplinas simultáneas: verificar que la investigación de audiencia no esté fabricando consensos artificiales [1], escribir para dos lectores —el humano que siente y el agente que compara atributos [3]— y establecer protocolos de selección creativa que sustituyan la revisión en caliente por distanciamiento temporal [10]. No es más glamuroso. Pero es más honesto y, si la evidencia sostiene lo que promete, más eficaz.

Fuentes consultadas

  1. Aman Singh Thakur, Aditya Agrawal, Alwarappan Nakkiran, and Alex Karlsson. WARP: Wasserstein-Aligned RAG for Population Opinions. arXiv:2608.22859, 2026.
  2. Jingjie Ning and Xueqi Li. Same Agent, Different Answers: A Repeat-Aware Audit of Corpus-Induced Answer Churn in Retrieval-Augmented QA. arXiv:2608.22856, 2026.
  3. Davood Wadi and Yu Ma. Does Rank Still Matter? Position Bias When AI Agents Shop on Our Behalf. arXiv:2608.22697, 2026.
  4. Haya Halimeh, Sascha Kaltenpoth, Kevin Bösch, and Oliver Müller. A Dual-Process Perspective on Nudge Susceptibility in LLM-Based GUI Agents. arXiv:2609.19843, 2026.
  5. Tian Zhang and Meng Li. Should I Be Polite to My LLM Relevance Judge? Tone as a Severity Operating-Point Shift. arXiv:2609.09703, 2026.
  6. Leon Houf and Christiane Schwieren. Going Beyond the In-/Out-Group Dichotomy: Investigating Altruism towards Middle-Groups. arXiv:2609.09046, 2026.
  7. Benedict Guttman-Kenney and Walter W. Zhang. Buy Now, Pay Later: Academic Insights and Open Policy Questions. arXiv:2609.09323, 2026.
  8. Benjamin Tannenbaum. Purchase Advice and Observable Buyer Responses in Real AI Conversations. arXiv:2609.09878, 2026.
  9. Dmitrij Żatuchin. Repeated Queries Exhaust an LLM's Brand Recommendations but Not Its Sources. arXiv:2609.05059, 2026.
  10. Jin Kim and George E. Newman. Creators Have Difficulty Abandoning Ideas They Generated. arXiv:2609.05115, 2026.