MarketingHablemos
Edición · es

Insight

El sesgo no se corrige con consciencia: una tesis sobre las trampas reales del proceso creativo en copy.

Creemos que el mayor riesgo del copy contemporáneo no es la falta de creatividad, sino la incapacidad estructural de los equipos creativos para evaluar con rigor lo que producen. El problema no está en generar: está en seleccionar. Y ese problema se agrava —no se resuelve— cuando se incorporan herramientas de IA al flujo sin auditar los sesgos que introducen en la evaluación.

Creemos que el mayor riesgo del copy contemporáneo no es la falta de creatividad, sino la incapacidad estructural de los equipos creativos para evaluar con rigor lo que producen. El problema no está en generar: está en seleccionar. Y ese problema se agrava —no se resuelve— cuando se incorporan herramientas de IA al flujo sin auditar los sesgos que introducen en la evaluación.

Intervención habitual en agencias: sesiones de feedback donde se pide al equipo "ser más crítico" con sus propuestas, asumiendo que la información basta para corregir el juicio.

Lo que muestra la evidencia: el distanciamiento temporal —revisitar las ideas meses después— sí aumenta la selectividad. La información sobre el sesgo, no [1].

0,011
Mayor cambio absoluto medio en NDCG@10 entre 32 contrastes modelo-tono
El efecto sobre ranking es menor que sobre calibración, pero Kendall's τ tan bajo como 0,743 indica que la reordenación no es nula [6].
10,25 pp
Exceso de churn semántico normalizado en 400 preguntas (Natural Questions)
Mientras la precisión exacta solo cambió −1,50 puntos. Replicado con DeepSeek: 8,75 pp de exceso incluso con precisión subiendo 3,00 puntos [9].
0 / 67
Episodios con compromiso explícito de compra o declaración de abandono en interacciones con asistentes IA
En 67 episodios orientados a compra retenidos de 317 interacciones históricas [3].

La IA como juez de copy hereda los sesgos del prompt, no los elimina

Muchos equipos ya usan modelos de lenguaje para evaluar copies, seleccionar variantes o puntuar mensajes antes de pasar a producción. Zhang y Li demuestran que el tono con que se formula el prompt de evaluación desplaza el umbral de aprobación o rechazo del modelo juez sin mejorar la calidad del juicio [6]. El mecanismo no es sutil: lo que cambia es el punto operativo de severidad. Un prompt más cortés produce un modelo más laxo; uno más seco, un modelo más estricto. Pero en ninguno de los dos casos el modelo se vuelve mejor evaluador: simplemente mueve el listón.

Si el equipo creativo ya sesga su propia evaluación [1] y luego valida con un LLM cuyo umbral depende de cómo se le pregunta [6], tenemos dos capas de distorsión apiladas sin un solo correctivo real.

Wadi y Ma aportan una pieza que redefine qué significa "buen copy" en entornos de compra agentada: los agentes IA pueden ingerir una página completa de resultados de una sola vez, eliminando la escasez de atención secuencial que hace valiosas las posiciones altas para los humanos [8]. El copy de listado, en este contexto, debe ser exhaustivo y preciso, no necesariamente breve o de impacto emocional inmediato. Los agentes procesan texto literal, no subtexto. Ningún atributo clave puede quedar implícito o inferible.

Halimeh et al. complican este cuadro mostrando que los agentes IA sí son susceptibles a nudges digitales —tanto automáticos como reflexivos— y que el razonamiento extendido no equivale a mayor robustez general: reduce la susceptibilidad a nudges por defecto pero la incrementa ante señales de influencia social reflexivas [7]. La persuasión no desaparece cuando el interlocutor es artificial; cambia de canal.

La inestabilidad de las fuentes RAG mina la investigación de copy

Ning y Li documentan que un sistema RAG puede devolver respuestas materialmente distintas tras una expansión del índice, incluso cuando todo lo demás permanece constante [9]. En su estudio preregistrado con 400 preguntas, el exceso de churn semántico fue de 10,25 puntos porcentuales mientras la precisión exacta solo cambió −1,50 puntos. Para un equipo de copy que usa RAG como fuente de investigación o briefing, esto significa que la base factual de un texto puede ser diferente si se consulta el lunes o el viernes, sin que ninguna métrica de calidad global lo señale.

La pertenencia no se activa con un solo marcador

Houf y Schwieren (N = 376) encuentran que compartir un solo marcador de identidad con un grupo no diferencia a ese grupo del out-group: es tratado de manera indistinguible [5]. Solo cuando se acumulan dos marcadores compartidos —y con exposición repetida al contexto grupal— emerge un trato diferenciado. Para copy de comunidad o campañas de pertenencia, la implicación es que un mensaje anclado en un único rasgo compartido ("eres emprendedor como nosotros") probablemente no active la respuesta de in-group que el copy busca. La acumulación de señales de identidad y la reexposición son condiciones necesarias, no opcionales.

Tannenbaum audita 317 interacciones de asistentes IA comerciales y encuentra que en los 67 episodios orientados a compra: cero compromisos explícitos de compra, cero reportes de compra completada, cero declaraciones de abandono [3]. Esto no demuestra que los asistentes no persuaden; demuestra que no tenemos la infraestructura de medición para saberlo. El contenido de la recomendación es observable; la decisión posterior del comprador, no. Cualquier afirmación sobre la eficacia persuasiva del copy servido por asistentes IA opera, hoy, en un vacío evidencial que la industria debería reconocer antes de extraer conclusiones de negocio.

La posición de IDO es que la persuasión con base empírica exige, primero, reconocer dónde la base empírica no existe. El sesgo de dotación creativa no se corrige con información [1]. El juicio de un LLM se desplaza con el tono del prompt [6]. Las fuentes RAG mutan sin aviso [9]. La pertenencia no se activa con un solo marcador [5]. Y la medición de persuasión en asistentes IA es, por ahora, un agujero negro observacional [3]. No se trata de trucos. Se trata de construir procesos que asuman estas limitaciones como dato de diseño, no como molestia que se ignora hasta la siguiente campaña fallida.

Fuentes consultadas

  1. Jin Kim and George E. Newman. Creators Have Difficulty Abandoning Ideas They Generated. arXiv:2609.05115, 2026.
  2. Dmitrij Żatuchin. Repeated Queries Exhaust an LLM's Brand Recommendations but Not Its Sources. arXiv:2609.05059, 2026.
  3. Benjamin Tannenbaum. Purchase Advice and Observable Buyer Responses in Real AI Conversations. arXiv:2609.09878, 2026.
  4. Benedict Guttman-Kenney and Walter W. Zhang. Buy Now, Pay Later: Academic Insights and Open Policy Questions. arXiv:2609.09323, 2026.
  5. Leon Houf and Christiane Schwieren. Going Beyond the In-/Out-Group Dichotomy: Investigating Altruism towards Middle-Groups. arXiv:2609.09046, 2026.
  6. Tian Zhang and Meng Li. Should I Be Polite to My LLM Relevance Judge? Tone as a Severity Operating-Point Shift. arXiv:2609.09703, 2026.
  7. Haya Halimeh, Sascha Kaltenpoth, Kevin Bösch, and Oliver Müller. A Dual-Process Perspective on Nudge Susceptibility in LLM-Based GUI Agents. arXiv:2609.19843, 2026.
  8. Davood Wadi and Yu Ma. Does Rank Still Matter? Position Bias When AI Agents Shop on Our Behalf. arXiv:2608.22697, 2026.
  9. Jingjie Ning and Xueqi Li. Same Agent, Different Answers: A Repeat-Aware Audit of Corpus-Induced Answer Churn in Retrieval-Augmented QA. arXiv:2608.22856, 2026.