# El diseñador como arquitecto de criterio: por qué el control sobre sistemas IA se ejerce evaluando, no especificando

> Published: 2026-08-30T06:23:31.499+00:00
> Updated: 2026-08-30T06:25:16.289+00:00

---

## El diseñador como arquitecto de criterio: por qué el control sobre sistemas IA se ejerce evaluando, no especificando

Creemos que la transformación más profunda que la IA generativa impone al diseño UX no es la automatización de pantallas ni la generación de código, sino la obsolescencia del modelo de especificación determinista. El diseñador que antes entregaba un archivo Figma con comportamientos exactos ahora debe entregar algo radicalmente distinto: criterios de evaluación que codifiquen juicio sobre el usuario, y contexto curado que incline la producción del modelo lejos de la mediocridad estadística. Esta tesis no es especulativa; emerge de la convergencia de al menos cuatro líneas de evidencia recientes que, leídas juntas, dibujan un nuevo perfil profesional: el diseñador como arquitecto de criterio y curador de contexto.

## La ruptura: de lo determinista a lo probabilístico

Nielsen Norman Group lo formula con claridad quirúrgica: en sistemas no basados en IA, la expectativa es que ingeniería y QA lean las especificaciones del diseñador e implementen los comportamientos exactos especificados. Los sistemas de IA generativa son **probabilísticos** — el modelo toma decisiones de diseño sin que el diseñador pueda anticipar cada caso posible [Fuente 12]. El ejemplo que ofrecen es revelador en su aparente trivialidad: ante «¿Qué tiempo hace hoy?», la IA puede decir «es poco probable que llueva» cuando la probabilidad es del 30%, técnicamente correcto pero pragmáticamente inútil para alguien que decide si lleva paraguas. El fallo no es de ingeniería; es de criterio. Y el criterio faltante es el del diseñador.

La respuesta que propone Nielsen Norman Group es que la competencia clave del diseñador en la era IA es la **crítica**: articular criterios de evaluación bien definidos que codifiquen el entendimiento de las necesidades del usuario, el juicio de diseño fundamentado en investigación y los estándares de calidad de la respuesta del sistema [Fuente 12]. Estos criterios reemplazan las especificaciones de comportamiento exacto. La lectura que hacemos es que esto no es una degradación del rol — es una elevación. El diseñador pasa de describir píxeles a prescribir juicio.

## El contexto como entregable

Nielsen Norman Group define contexto como todo lo que el modelo puede ver cuando realiza el trabajo: la solicitud del usuario, más las instrucciones, estándares, ejemplos e información de fondo que la acompañan [Fuente 5]. Un modelo entrenado sobre miles de pantallas de búsqueda producirá una pantalla de búsqueda *promedio* — conoce cómo luce el software en general, pero no conoce a los usuarios específicos, el dominio ni los hallazgos de investigación del equipo. **Si ese conocimiento no está en el contexto, el modelo diseña sin él** [Fuente 5]. Esta frase debería inquietar a cualquier equipo de producto que haya invertido meses en research y luego deje que un LLM genere interfaces sin acceso a esos hallazgos.

El término propuesto — **UX-Context Design** — designa la práctica de usar conocimiento UX (usuarios, dominio, estándares, hallazgos de investigación) para informar el diseño generado por IA mediante su incorporación sistemática al contexto que el modelo recibe [Fuente 5]. El diseñador se convierte en curador y arquitecto del contexto que guía la producción automatizada. Esto converge con la evolución descrita por Nielsen Norman Group de *prompt engineering* a *context engineering*: los prompts por sí solos son insuficientes; lo que importa es una colección concisa de orientación específica [Fuente 10]. La **arquitectura de contexto** aplica principios de arquitectura de información — disciplina madura de UX — al diseño de sistemas IA [Fuente 10]. Es una transferencia metodológica, no una invención desde cero.

Nótese la ironía productiva: la arquitectura de información, que muchos equipos consideraban una competencia legacy, resulta ser exactamente la disciplina que estructura el contexto de agentes IA.

## La tensión autonomía-control en agentes: evidencia empírica

Si el diseñador define criterios y contexto, alguien necesita también definir **límites**. El estudio de Yan con 113 participantes no técnicos [Fuente 2] ofrece datos concretos sobre la tensión entre delegar al agente y mantener control humano. Tres condiciones — aprobación humana acción por acción (HITL), revisión automática (AUTO) y políticas definidas por adelantado (POLICY) — revelaron que las políticas pre-configuradas bloquearon menos *overreach* que la supervisión caso a caso.

Creemos que esto constituye lo que podemos llamar la **brecha preferencia-compromiso**: los usuarios prefieren reglas genéricas que les ahorren interrupciones (POLICY redujo las interrupciones en tiempo de ejecución de 18.0 a 10.9 [Fuente 2]), pero esas mismas reglas degradan su capacidad de detener al agente cuando actúa fuera de mandato. El diseño de sistemas agénticos debe asumir que comodidad y seguridad no son el mismo eje. Las cuatro lecciones de diseño de agentes que documentó Nielsen Norman Group a partir de su estudio con Qwen — soportar descubribilidad, reutilizar patrones familiares, manejar datos personales con cuidado y proteger la autonomía del usuario [Fuente 7] — adquieren aquí un peso empírico adicional: la protección de la autonomía no es un principio aspiracional, es una variable con efecto medible.

- −20.1 pp — Diferencia en bloqueo de overreach: POLICY vs. HITL
- −14.5 pp — Diferencia en bloqueo de overreach: POLICY vs. AUTO

## Del disclaimer a la inspección

**Transparencia accionable**: el sistema expone mecanismos para que el usuario inspeccione clusters de perspectivas, compare resúmenes por postura y aplique reescrituras conscientes del sesgo directamente en la interfaz — como hace AutoJourn [Fuente 3].

## El problema metodológico: ¿cómo investigar lo que cambia con cada respuesta?

Zhu et al. señalan que los métodos HCI convencionales — prototipos estáticos, transcripciones, entrevistas — presentan limitaciones específicas para sistemas IA: los prototipos estáticos ofrecen oportunidades limitadas para estudiar la interacción con sistemas IA en vivo, y las transcripciones revelan poco sobre cómo los usuarios formulan, revisan y dudan sobre los prompts antes de enviarlos [Fuente 6]. La plataforma HARP que proponen permite colocar participantes en escenarios simulados controlados con agentes IA configurables, registrando tiempo de composición del prompt, latencia de respuesta, eliminaciones y pausas de pulsación de teclas [Fuente 6]. Esto nos parece una contribución metodológica de primer orden: no se puede ejercer criterio de diseño sobre un sistema si no se puede observar cómo los usuarios realmente interactúan con él, incluyendo lo que teclean y borran antes de enviar.

Nielsen Norman Group documenta un fenómeno que complica toda esta arquitectura de criterio: los **vibe architects**, personas no desarrolladoras que construyen sistemas IA agénticos complejos basándose en intuición desarrollada a través de horas de experimentación, YouTube y Reddit, logrando transformar flujos de trabajo sin conocer con exactitud cómo están haciendo lo que hacen [Fuente 9]. La IA generativa está permitiendo que la capacidad técnica de las personas supere su conocimiento técnico formal de maneras que ninguna tecnología anterior había logrado [Fuente 9]. Esto crea una paradoja para el diseño UX: ¿cómo diseñas onboarding y documentación para usuarios cuyo modelo mental del sistema es fundamentalmente intuitivo y experimental, no formal? La brecha entre capacidad lograda y comprensión formal crea riesgos de fiabilidad y gobernanza que el diseño debe mitigar [Fuente 9].

Hay una conexión que la fuente no traza pero que nos parece ineludible: los vibe architects necesitan exactamente el tipo de transparencia accionable que AutoJourn implementa [Fuente 3]. Sin ella, construyen sobre cajas negras con confianza infundada.

## Lo que esto exige ahora

Nielsen Norman Group identifica un problema organizacional que amplifica todo lo anterior: los equipos de UX rara vez pierden conversaciones de presupuesto porque su trabajo carezca de valor, sino porque reportan de forma inadecuada — comunican actividad y métricas de usabilidad mientras los ejecutivos operan en términos de ingresos, costes, riesgo, velocidad y retención [Fuente 8]. Si el nuevo entregable de UX es contexto curado [Fuente 5] y criterios de evaluación [Fuente 12], la incapacidad de demostrar su impacto en resultados de negocio es doblemente letal: el trabajo es ya más abstracto, y si además se reporta como actividad en vez de resultado, la categorización como centro de coste es inevitable. La solución pasa por institucionalizar baselines — mediciones iniciales que permitan calibrar mejora [Fuente 8] — no solo de métricas de usabilidad, sino de la calidad de las decisiones que el modelo toma cuando recibe contexto curado frente a cuando no lo recibe.

Y la competencia subyacente a todo esto — el **product sense**, definido por Nielsen Norman Group como predecir qué decisiones de producto tendrán éxito basándose en patrones aprendidos a través de la experimentación, y saber cuándo esos patrones aplican [Fuente 4] — es precisamente lo que un modelo de lenguaje no tiene. El modelo produce el promedio estadístico. El diseñador con product sense sabe cuándo el promedio es inadecuado. Esta es la razón última por la que el rol no desaparece: alguien tiene que saber qué contexto falta, qué criterio aplicar, y cuándo el patrón aprendido no transfiere al caso presente.

## Fuentes consultadas

- Sikiru Ademola Adewale, Sunday D. Ubur, Nikitha Donekal Chandrashekar, Onyeka Emebo, and Denis Gračanin. EmoSay: Artificial Intelligence-Driven Text-to-Emotional-Speech System for Affective Communication in Extended Reality. [arXiv:2608.26566](https://arxiv.org/abs/2608.26566v1), 2026.

- Ting Yan. Do User-Authored Permission Policies Improve Protection Against AI Agent Overreach?. [arXiv:2608.27443](https://arxiv.org/abs/2608.27443v1), 2026.

- Himel Ghosh, Ahmed Mosharafa, and Georg Groh. AutoJourn: Multi-Perspective Summarisation, Bias Detection and Bias Neutralisation for LLM-Generated News in Automated Journalism. [arXiv:2607.18983](https://arxiv.org/abs/2607.18983v1), 2026.

- Definición de 'product sense' y su relevancia en la era de la IA. [ver](https://www.nngroup.com/articles/product-sense-definition/?utm_source=rss&utm_medium=feed&utm_campaign=rss-syndication)

- UX-Context Design: el contexto como entregable UX en interfaces generadas por IA. [ver](https://www.nngroup.com/articles/ux-context-design/?utm_source=rss&utm_medium=feed&utm_campaign=rss-syndication)

- Zeshu Zhu, Natalie Friedman, Kevin Weatherwax, and Emily Eiben. HARP: The Human--AI Research Platform. [arXiv:2607.20773](https://arxiv.org/abs/2607.20773v1), 2026.

- Diseño de agentes IA para usuarios: lecciones de estudios de usabilidad. [ver](https://www.nngroup.com/articles/designing-ai-agents/?utm_source=rss&utm_medium=feed&utm_campaign=rss-syndication)

- Reporte de UX orientado a resultados de negocio: métricas y baselines. [ver](https://www.nngroup.com/articles/reporting-ux-business-outcomes/?utm_source=rss&utm_medium=feed&utm_campaign=rss-syndication)

- Vibe architects: usuarios no técnicos como constructores de sistemas IA agénticos. [ver](https://www.nngroup.com/articles/vibe-architects/?utm_source=rss&utm_medium=feed&utm_campaign=rss-syndication)

- Arquitectura de contexto: principios de arquitectura de información aplicados a sistemas IA. [ver](https://www.nngroup.com/articles/context-architecture/?utm_source=rss&utm_medium=feed&utm_campaign=rss-syndication)

- Economía conductual aplicada al diseño UX: fricción, motivación y brecha intención-acción. [ver](https://www.nngroup.com/articles/behavioral-economics-for-ux/?utm_source=rss&utm_medium=feed&utm_campaign=rss-syndication)

- Crítica de diseño como competencia central en sistemas IA: de especificaciones deterministas a criterios de evaluación. [ver](https://www.nngroup.com/articles/ai-era-critique/?utm_source=rss&utm_medium=feed&utm_campaign=rss-syndication)
