# El copy que funciona en sistemas de IA no es el que suena bien: es el que declara la intención satisfecha

> Published: 2026-09-23T18:36:13.615+00:00
> Updated: 2026-09-23T18:37:03.604+00:00

---

## El copy que funciona en sistemas de IA no es el que suena bien: es el que declara la intención satisfecha

Creemos que la persuasión escrita atraviesa un cambio de régimen. El interlocutor del copy ya no es solo un humano con sesgos atencionales conocidos; es, cada vez más, un sistema de recuperación que decide si tu marca existe antes de que el comprador la vea. En ese contexto, la evidencia empírica reciente apunta a una dirección incómoda para los creativos: el copy que declara con precisión qué intención satisface supera al copy que suena elegante, y la revisión propia de ese copy está estructuralmente sesgada. La buena noticia es que los mecanismos de fricción y de evaluación también se están cartografiando con rigor suficiente para actuar.

## La visibilidad ante motores de IA se gana con presencia recuperable, no con estilo

El dato más revelador del estudio de Tannenbaum sobre 34 960 observaciones de prompts no marcados es la diferencia abismal entre estar presente y no estarlo en la ruta de recuperación. Cuando ni la marca ni su dominio aparecen en esa ruta, GPT la menciona el 2,8 % de las veces y Gemini el 3,8 %. Cuando el dominio propio aparece —sin necesidad de fan-out adicional—, GPT salta a 49,0 % y Gemini a 58,4 % [Fuente 1]. La lectura que hacemos es directa: antes de preocuparte por el tono de tu copy, asegúrate de que el contenido exista donde los motores lo encuentran. La relevancia recuperable precede a la persuasión.

El modelo logístico de Tannenbaum alcanza AUC de 0,963 en GPT y 0,942 en Gemini en holdout cronológico, lo que significa que la visibilidad de marca en respuestas de IA es predecible, no aleatoria [Fuente 1].

## Copy de relevancia temática: 'Zapatilla de trail con suela Vibram y membrana impermeable' — describe el producto, coincide con keywords, pero no declara qué problema resuelve ni para quién.

Copy de intención satisfecha: 'Para corredores que necesitan tracción en roca mojada sin sacrificar sensibilidad en bajada' — explicita la intención de compra que el producto cierra, que es la señal que los sistemas de ranking valoran más [Fuente 4].

## El comprador agente cambia la jerarquía de señales

Wadi y Ma aleatorizaron el orden de cien listados de hoteles en 5 000 sesiones de agentes IA y encontraron que la posición —el factor dominante en comportamiento humano de búsqueda— deja de ser monotónicamente predictiva cuando el comprador es un agente [Fuente 6]. Los agentes examinan con mayor profundidad, nunca abandonan la tarea, y convergen en el mismo listado independientemente del orden. Lo que sí importa: los atributos declarados en la página de resultados. Esto invierte la prioridad clásica del copy de producto en marketplaces: la completitud y diferenciación de atributos declarados pasa a ser más relevante que la puja por posición alta.

El estudio cubre un solo dominio (hoteles) y los propios autores advierten sobre la generalización [Fuente 6]. Pero la dirección es consistente con la evidencia de Koushik et al. sobre el valor de la articulación explícita de atributos.

Kim y Newman documentan lo que llaman Creative Endowment Effect: los creadores seleccionan y envían más ideas de baja calidad cuando evalúan su propia producción que cuando evalúan la de otros, incluso bajo incentivos económicos que penalizan el envío de ideas malas [Fuente 7]. El hallazgo más incómodo es que informar a los participantes de la existencia de este sesgo no lo elimina. Lo que sí lo reduce es el distanciamiento temporal: revisitar las ideas meses después aumenta la selectividad. Para un equipo de copy, esto implica que la revisión propia inmediata de un texto recién escrito es un proceso estructuralmente comprometido, y que ningún briefing sobre sesgos cognitivos lo corrige.

Y si recurres a un LLM como juez de tus variantes de copy, el problema muta pero no desaparece. Liu et al. muestran que la diferencia de puntuación entre variantes puede oscilar hasta 98 puntos porcentuales simplemente por el orden en que se presentan al modelo evaluador, con un efecto de posición residual de 24,22 puntos tras controlar todo lo demás [Fuente 5]. Zhang y Li añaden que el tono del prompt de evaluación desplaza el umbral de severidad del modelo sin mejorar la calidad del juicio [Fuente 12]. Un equipo que evalúa titulares con un LLM sin controlar posición y tono del prompt está seleccionando variantes por artefacto, no por mérito.

- 40,2 pp (GPT) / 49,0 pp (Gemini) — Incremento medio en tasa de mención cuando el dominio propio es expuesto, sin fan-out de marca
- 24,22 pp — Efecto residual de posición en evaluaciones LLM pairwise tras controlar texto, candidatos y juez

## Simulación de audiencia antes de gastar presupuesto real

Benomar et al. proponen un marco donde agentes LLM equipados con perfiles de usuario generan predicciones sobre el efecto de variantes experimentales, reduciendo sustancialmente los tamaños muestrales necesarios para A/B tests sin sacrificar validez estadística [Fuente 2]. El método se mantiene robusto incluso ante predicciones inexactas, según los autores. La implicación para flujos de copy es concreta: hipótesis sobre mensajes, encuadres o tonos podrían pre-filtrarse mediante simulación antes de comprometer tráfico real, pero —y esto es crítico— los mismos sesgos de posición y severidad documentados en [Fuente 5] y [Fuente 12] aplicarían si esos agentes-persona evaluaran variantes sin calibración.

## Fuentes consultadas

- Benjamin Tannenbaum. From Prompt to Recommendation: A Fitted Stage Model of Brand Visibility in AI Search. [arXiv:2609.23162](https://arxiv.org/abs/2609.23162v1), 2026.

- Ziyad Benomar, Aymen Al Marjani, Paul Missault, and Saab Mansour. Augmented Hypothesis Testing with Persona-Based LLM Simulations. [arXiv:2609.24629](https://arxiv.org/abs/2609.24629v1), 2026.

- Xiao Liu, Yanwei Song, Srivaths Ranganathan, Yuan Chen, Zheyun Feng, Parker Steenburgh, Jochen Klingenhoefer, Nathan Lasche, Gergo Varady, and Tim Steele. Explainable Recommendations at Scale: LLM Rationales for YouTube Music Artist Discovery. [arXiv:2609.23877](https://arxiv.org/abs/2609.23877v1), 2026.

- Girish A. Koushik, Swapnil Bhosale, Samarth Agrawal, Hadeel Sadany, Constantin Orasan, Xiatian Zhu, and Diptesh Kanojia. Beyond Relevance: Structured Semantic Supervision for Product Search with LLM-Augmented Annotations. [arXiv:2609.23646](https://arxiv.org/abs/2609.23646v1), 2026.

- You Liu, Yue Liu, Quanchao Lu, and Nick Shipilov. OSCAR: Order-aware Scoring and Calibration for AI Rankings. [arXiv:2609.24128](https://arxiv.org/abs/2609.24128v1), 2026.

- Davood Wadi and Yu Ma. Does Rank Still Matter? Position Bias When AI Agents Shop on Our Behalf. [arXiv:2608.22697](https://arxiv.org/abs/2608.22697v1), 2026.

- Jin Kim and George E. Newman. Creators Have Difficulty Abandoning Ideas They Generated. [arXiv:2609.05115](https://arxiv.org/abs/2609.05115v1), 2026.

- Dmitrij Żatuchin. Repeated Queries Exhaust an LLM's Brand Recommendations but Not Its Sources. [arXiv:2609.05059](https://arxiv.org/abs/2609.05059v1), 2026.

- Benjamin Tannenbaum. Purchase Advice and Observable Buyer Responses in Real AI Conversations. [arXiv:2609.09878](https://arxiv.org/abs/2609.09878v1), 2026.

- Benedict Guttman-Kenney and Walter W. Zhang. Buy Now, Pay Later: Academic Insights and Open Policy Questions. [arXiv:2609.09323](https://arxiv.org/abs/2609.09323v1), 2026.

- Leon Houf and Christiane Schwieren. Going Beyond the In-/Out-Group Dichotomy: Investigating Altruism towards Middle-Groups. [arXiv:2609.09046](https://arxiv.org/abs/2609.09046v1), 2026.

- Tian Zhang and Meng Li. Should I Be Polite to My LLM Relevance Judge? Tone as a Severity Operating-Point Shift. [arXiv:2609.09703](https://arxiv.org/abs/2609.09703v1), 2026.

## La posición de IDO

Creemos que el oficio de escribir copy comercial se está bifurcando. Existe un copy para humanos que sigue las reglas de siempre —emoción, concreción, ritmo—, pero existe un copy para sistemas de recuperación que exige una disciplina diferente: declarar la intención satisfecha, no solo la relevancia; asegurar presencia recuperable antes de buscar elegancia; y evaluar con protocolos que controlen los sesgos del evaluador, sea humano o artificial. La marca que no aparece en la ruta de recuperación de un motor de IA tiene un 2,8 % de probabilidad de ser mencionada [Fuente 1]. Ningún titular brillante compensa esa invisibilidad. Y la marca que sí aparece pero describe en vez de resolver sigue perdiendo frente a la que articula el porqué del encaje [Fuente 4]. La persuasión con base empírica no es un truco retórico; es la decisión de escribir para el sistema completo —humano y máquina— con la evidencia que ya tenemos.
