Tu investigación de audiencia puede estar mintiendo sin saberlo
Los equipos de copy que sintetizan opiniones de usuario mediante herramientas RAG —para extraer insights de reseñas, menciones sociales o feedback— operan sobre un mecanismo de recuperación que privilegia la similitud con la consulta, no la representatividad de lo que la gente realmente piensa. Thakur et al. documentan que la recuperación estándar por similitud coseno puede silenciar opiniones minoritarias y producir una respuesta que aparenta consenso sin serlo [1]. Un brief construido sobre esa síntesis sesgada arrastra el error hasta la pieza final: el copy habla a una mayoría que quizá no existe tal como se la describe.
Pero el sesgo de representatividad no es el único problema. Ning y Li demuestran que un sistema RAG puede devolver respuestas materialmente distintas tras una simple expansión del índice, sin que cambie el modelo, el prompt ni la política de recuperación. Lo llaman accuracy-blind answer churn: la precisión global apenas se mueve mientras las respuestas individuales mutan [2]. Para un equipo de copy, esto significa que el briefing que se generó el lunes puede contradecir el que se genere el jueves, y ninguna métrica de calidad del sistema lo señalará.
Una réplica con DeepSeek encontró 8,75 pp de exceso de churn incluso cuando la precisión exacta subió 3 puntos [2]. El problema no es la dirección del cambio: es su invisibilidad.
Copy para humanos: brevedad, impacto emocional inmediato, jerarquía visual. El primer resultado captura la atención escasa.
Copy para agentes IA: exhaustividad, declaración explícita de atributos diferenciales, consistencia entre listado y página de destino. Los agentes procesan texto literal, no subtexto [3].
Los nudges no desaparecen con los agentes: se desplazan
Halimeh et al. evaluaron 3 600 agentes en 21 600 simulaciones de compra y encontraron que los agentes IA son susceptibles tanto a nudges automáticos (selecciones por defecto) como a nudges reflexivos (señales de influencia social) [4]. El hallazgo que más importa al copy es que activar el razonamiento extendido del agente no produce robustez general: reduce la susceptibilidad a nudges por defecto pero incrementa la susceptibilidad a nudges de influencia social reflexivos [4]. Más razonamiento desplaza el canal de influencia sin eliminarlo.
Para el redactor esto plantea una pregunta incómoda: ¿estamos escribiendo para persuadir a una persona, o para sobrevivir al filtro de un agente que es vulnerable a mecanismos de diseño que ni siquiera controlamos?
Kim y Newman documentan lo que llaman Creative Endowment Effect: los creadores seleccionan y envían un mayor número de ideas de baja calidad cuando evalúan su propia producción que cuando evalúan ideas ajenas. El efecto se observó en tres tareas, en dos dominios creativos diferentes, y —esto es lo crítico— informar a los participantes de la existencia del sesgo no lo eliminó [10]. La intervención informacional fracasa. Lo que sí funcionó fue el distanciamiento temporal: revisitar las ideas varios meses después aumentó la selectividad [10].
Y cuando el equipo recurre a un LLM como juez de calidad del copy, aparece otro sesgo: Zhang y Li muestran que el tono del prompt de evaluación puede desplazar el umbral de aprobación/rechazo del modelo sin mejorar la calidad del juicio. El mecanismo no es una mejora evaluativa sino un desplazamiento del punto operativo de severidad [5]. En 32 contrastes modelo-tono, el mayor cambio en NDCG@10 fue de apenas 0,011, pero un Kendall's τ tan bajo como 0,743 indica que la reordenación de piezas evaluadas no es nula [5]. Un prompt amable no genera un juez más sabio: genera un juez más laxo.
Lo que no sabemos es tan importante como lo que sabemos
Tannenbaum auditó 317 interacciones de asistentes IA comerciales y encontró que en los 67 episodios orientados a compra retenidos, hubo cero compromisos explícitos de compra, cero reportes de compra completada y cero declaraciones de abandono [8]. El contenido de la recomendación es observable; la decisión posterior del comprador, no. Solo 18 de 67 episodios (26,9 %) contienen un turno de usuario posterior dentro de la misma misión de compra [8]. Usar la profundidad de conversación como proxy de conversión sobreestima la disponibilidad de seguimiento en un 27,8 % [8].
Del mismo modo, Żatuchin demuestra que la presencia de una marca en respuestas de LLM no es un estado binario ni estático: los motores sin búsqueda web seguían añadiendo marcas nunca vistas en la ejecución 15 en el 86–92 % de las celdas analizadas, con repertorios medianos de 15 a 31 organizaciones por pregunta [9]. Una sola consulta captura entre el 62 y el 77 % del repertorio de cinco ejecuciones [9]. Medir visibilidad de marca con una sola ejecución es medir con un termómetro roto.
La posición de IDO
Creemos que el copy basado en evidencia no empieza en la línea de texto: empieza en la auditoría de las fuentes que informan ese texto, en el reconocimiento de que los entornos de entrega están bifurcándose entre humanos y agentes con lógicas de selección distintas, y en la aceptación de que ni el talento creativo ni la consciencia del sesgo protegen contra la sobrevaluación del propio trabajo [10]. La persuasión con base empírica exige tres disciplinas simultáneas: verificar que la investigación de audiencia no esté fabricando consensos artificiales [1], escribir para dos lectores —el humano que siente y el agente que compara atributos [3]— y establecer protocolos de selección creativa que sustituyan la revisión en caliente por distanciamiento temporal [10]. No es más glamuroso. Pero es más honesto y, si la evidencia sostiene lo que promete, más eficaz.
Fuentes consultadas
- Aman Singh Thakur, Aditya Agrawal, Alwarappan Nakkiran, and Alex Karlsson. WARP: Wasserstein-Aligned RAG for Population Opinions. arXiv:2608.22859, 2026.
- Jingjie Ning and Xueqi Li. Same Agent, Different Answers: A Repeat-Aware Audit of Corpus-Induced Answer Churn in Retrieval-Augmented QA. arXiv:2608.22856, 2026.
- Davood Wadi and Yu Ma. Does Rank Still Matter? Position Bias When AI Agents Shop on Our Behalf. arXiv:2608.22697, 2026.
- Haya Halimeh, Sascha Kaltenpoth, Kevin Bösch, and Oliver Müller. A Dual-Process Perspective on Nudge Susceptibility in LLM-Based GUI Agents. arXiv:2609.19843, 2026.
- Tian Zhang and Meng Li. Should I Be Polite to My LLM Relevance Judge? Tone as a Severity Operating-Point Shift. arXiv:2609.09703, 2026.
- Leon Houf and Christiane Schwieren. Going Beyond the In-/Out-Group Dichotomy: Investigating Altruism towards Middle-Groups. arXiv:2609.09046, 2026.
- Benedict Guttman-Kenney and Walter W. Zhang. Buy Now, Pay Later: Academic Insights and Open Policy Questions. arXiv:2609.09323, 2026.
- Benjamin Tannenbaum. Purchase Advice and Observable Buyer Responses in Real AI Conversations. arXiv:2609.09878, 2026.
- Dmitrij Żatuchin. Repeated Queries Exhaust an LLM's Brand Recommendations but Not Its Sources. arXiv:2609.05059, 2026.
- Jin Kim and George E. Newman. Creators Have Difficulty Abandoning Ideas They Generated. arXiv:2609.05115, 2026.