# El efecto medio no existe: por qué la UX de productos con IA debe diseñarse para la heterogeneidad

> Published: 2026-10-03T11:10:02.120147+00:00
> Updated: 2026-10-03T19:24:07.65657+00:00

---

## El efecto medio no existe: por qué la UX de productos con IA debe diseñarse para la heterogeneidad

Creemos que el error más caro en el diseño de productos con IA es razonar con efectos promedio. Las doce piezas de evidencia que manejamos apuntan en la misma dirección. El valor de una herramienta, de una explicación, de una divulgación o incluso del modelo subyacente cambia según quién la usa, para qué tarea y con cuánto conocimiento previo. Diseñar para el usuario medio en productos con IA equivale a diseñar para alguien que no existe.

El caso más limpio procede de un ensayo controlado aleatorizado con 100 participantes, 50 diseñadores de producto y 50 gestores de producto, que realizaron tres tareas estandarizadas con o sin acceso a Figma Make [Fuente 1]. La cifra agregada es atractiva. La lectura que hacemos se centra en otro dato: las ganancias fueron mayores entre los gestores de producto, y para los diseñadores profesionales los beneficios resultaron dependientes de la tarea [Fuente 1]. Un solo número esconde dos productos distintos: uno que amplía quién puede diseñar y otro que solo a veces acelera a quien ya sabe hacerlo.

- ≈20% — menos tiempo de finalización con Figma Make, entre quienes completaron las tareas
- 73–74% — acuerdo de signo entre los rankings de KNOWSIM y los juicios humanos, en 705 sesiones humano-IA

Cuando se varía el tipo de tarea, ocurre lo mismo. Graphionale convierte los razonamientos lineales de un LLM en grafos de argumentos interactivos, y en un estudio con N=204 los razonamientos gráficos no mejoraron la decisión de forma uniforme [Fuente 10]. En tareas de razonamiento verbal mejoraron la calibración de confianza, aunque los participantes los percibieron como más exigentes cognitivamente y menos satisfactorios [Fuente 10]. La interfaz que más ayuda no es la que más gusta, y además depende de la modalidad.

Con la divulgación de uso de IA pasa lo mismo: las reacciones varían según la audiencia y el tipo de contenido, de modo que una única etiqueta no sirve para todos los contextos [Fuente 3].

## Medir lo que se mueve, no lo que se esperaba

La heterogeneidad no es solo entre personas. También aparece entre métricas. En una interfaz híbrida de gestión de contenidos con un agente conectado por MCP (N=73), la asistencia de IA redujo de forma significativa los clics, las navegaciones y el desplazamiento, pero el tiempo de tarea no difirió entre condiciones [Fuente 11]. Los autores sugieren que el beneficio real de estas interfaces es reducir el esfuerzo de interacción, no aumentar la velocidad [Fuente 11]. Un equipo que solo midiera tiempo concluiría que el agente no aporta nada.

## Las entrevistas moderadas por IA igualan en profundidad a las humanas, cubren más temas y, con presupuesto constante, recuperan más necesidades del cliente [Fuente 4].

Esa riqueza adicional no produce mejores predicciones cuantitativas en los gemelos digitales frente a entrevistas estáticas, y los participantes suenan más comprometidos emocionalmente con un humano [Fuente 4].

## Simular al usuario medio es simular a nadie

Si los efectos dependen del usuario, también deben hacerlo las herramientas de evaluación. KNOWSIM modela de forma explícita el estado de conocimiento del usuario como un grafo de unidades de información con prerrequisitos. Al aplicarlo a 9 LLMs muestra que el mejor modelo cambia según el nivel de conocimiento del usuario: son interacciones aptitud-tratamiento que la evaluación estándar no detecta [Fuente 12]. En simulación de usuarios con agentes, el contenido actitudinal predijo las reacciones mucho mejor que los perfiles demográficos [Fuente 5]. Lo mismo se observa en los gemelos digitales construidos con entrevistas, que superan a las personas basadas solo en datos demográficos [Fuente 4]. La demografía es la forma más barata de fingir que se ha segmentado.

## Donde la regla sí debe ser fija

Defender la heterogeneidad no significa renunciar a los invariantes. El trabajo sobre arquitectura de elección en interfaces financieras ofrece el contrapunto que nos parece correcto. Define la equidad como una restricción verificable mediante conteo de pasos de navegación, entradas obligatorias y confirmaciones: ningún componente del flujo de salida debe superar a su equivalente en el flujo de entrada [Fuente 6]. Este criterio no depende de quién sea el usuario, y justamente por eso protege a todos.

Salir nunca debe costar más que entrar.— [Fuente 6]

Nuestra posición, por tanto, separa dos capas. Los suelos éticos deben ser universales y auditables. La capa adaptativa debe responder al modelo mental, al rol y al conocimiento de cada usuario. Nielsen Norman Group sostiene que los modelos mentales sobre la IA dictan cómo se usa [Fuente 2]. Weiss estructura la colaboración en dos ejes, autonomía e iniciativa, que dan lugar a patrones distintos: instrucción, delegación, asistencia y cocreación [Fuente 7]. Leemos ambos marcos como un mandato práctico. No hay que elegir un patrón para el producto, sino decidir qué patrón corresponde a qué usuario en qué tarea, y medir cada combinación con la métrica que realmente cambia.

## Fuentes consultadas

- Remy Stewart, Olabode Anise, Andrew Hogan, and Augustus Griffin. Does AI Save Time on Product Design? A Randomized Controlled Experiment of AI Prompt-to-Design Workflows. [arXiv:2609.26725](https://arxiv.org/abs/2609.26725v1), 2026.

- Modelos mentales de IA en usuarios: precisión, uso y diseño de sistemas. [ver](https://www.nngroup.com/articles/ai-functionality-study-guide/?utm_source=rss&utm_medium=feed&utm_campaign=rss-syndication)

- Divulgación del uso de IA: el marco PACED y efectos sobre confianza y autenticidad percibida. [ver](https://www.nngroup.com/articles/disclose-ai-paced/?utm_source=rss&utm_medium=feed&utm_campaign=rss-syndication)

- Yuting Deng, Jingxuan Liu, Olivier Toubia, and Naman Jain. AI-Moderated Interviews for Market Research and Digital Twins Calibration. [arXiv:2609.29143](https://arxiv.org/abs/2609.29143v1), 2026.

- Ljubisa Bojic, Tijana Stanic, Joerg Matthes, Agariadne Dwinggo Samala, Bojana Dinic, and Jue Wang. Thinking Less to Simulate Better: Intuitive Prompting Improves LLM Agents Simulating Individual Social Media Reactions, Including Unfamiliar Content. [arXiv:2609.30563](https://arxiv.org/abs/2609.30563v1), 2026.

- Oluwadamilola Awakan, Tawan Aroonwechkul, Roshan Gunjoor, Supriya Khadka, and Sanchari Das. Redesigning Trust: Replacing Dark Patterns with Fair Choice Architecture in Financial Interfaces. [arXiv:2609.30475](https://arxiv.org/abs/2609.30475v1), 2026.

- Michael Weiss. Human-AI Collaboration: From Paradoxes to Patterns. [arXiv:2609.36481](https://arxiv.org/abs/2609.36481v1), 2026.

- Xinyi Zhang, Jingting He, Zicheng Zhu, and Yuxin Su. ASIDE: From Conflict Participants to Co-Observers Through Dyadic Spectator Reflection. [arXiv:2608.05690](https://arxiv.org/abs/2608.05690v1), 2026.

- Xinshuang Liu, Runfa Blark Li, Shaoxiu Wei, Xin Lin, and Truong Nguyen. Unified Agent: Managing Interactions across Devices. [arXiv:2608.05729](https://arxiv.org/abs/2608.05729v1), 2026.

- Xinru Wang, Zhexuan Ma, Ming Yin, Shuai Ma, and Thomas W Malone. Graphionale: How Graph Visualizations of LLM Rationales Affect Human Decision Making. [arXiv:2608.27932](https://arxiv.org/abs/2608.27932v1), 2026.

- Gavin Dizon, Tyrone Justin Sta Maria, Jordan Aiko Deja, and Yasuyuki Sumi. Delegating or Doing? Understanding User Behavior in Hybrid Human-Agent Interfaces. [arXiv:2608.19551](https://arxiv.org/abs/2608.19551v1), 2026.

- Yoonjoo Lee, Hyoungwook Jin, Tae Soo Kim, Shaoyang Zhang, Philippe Laban, and Q. Vera Liao. KnowSim: Evaluating Information Calibration in LLM Assistants with User Simulators that Learn. [arXiv:2608.17150](https://arxiv.org/abs/2608.17150v1), 2026.
