# Estructura primero, LLM después: la tesis de que los agentes de código necesitan andamiaje determinista

> Published: 2026-07-20T06:23:17.902224+00:00
> Updated: 2026-07-21T16:04:10.453178+00:00

---

## Estructura primero, LLM después: la tesis de que los agentes de código necesitan andamiaje determinista

La evidencia reciente converge en una idea incómoda para quienes apuestan por agentes generalistas cada vez más grandes: en tareas con semántica de dominio explícita, inyectar estructura determinista —compilación a pseudocódigo, bibliotecas de primitivos, agentes especializados— supera de forma consistente al enfoque de dejar que el LLM 'resuelva todo'. Creemos que el próximo salto de productividad en desarrollo asistido por IA no vendrá de modelos más potentes, sino de mejores andamiajes que acotan lo que el modelo debe decidir.

## El coste oculto de la generalidad

Borman et al. construyen un agente especialista para transformar diagramas BPMN en flujos de trabajo ejecutables y lo enfrentan a Roo y Cline, dos agentes generalistas. El resultado no es marginal: el especialista reduce los errores de llamada a herramientas en un factor de 3×, elimina por completo las iteraciones de reparación y recorta el consumo de tokens de generación en más del 95% [Fuente 1]. Dicho de otro modo, los generalistas no solo son menos precisos —son drásticamente más caros de operar para la misma tarea estructurada.

Los autores de Borman et al. no generalizan a tareas de dominio abierto — y hacen bien. La tesis no es que los generalistas sean inútiles; es que donde existe semántica de dominio explícita, el generalismo es un desperdicio cuantificable.

- ~9-20 pp — Ventaja del agente especialista en exactitud de uso de herramientas sobre los generalistas
- 2-4× — Reducción de latencia ajustada por penalización del especialista frente a generalistas
- 70,4 → 86,4 → 92,8 — Progresión de rendimiento en dominio Bank al añadir compilación y runtime PG (tres brazos)
- 100% — Corrección en rechazos lograda en dominio Bank con los tres brazos primarios

## Compilar antes de razonar: SOPs como pseudocódigo ejecutable

Yu et al. atacan un problema distinto —agentes que deben seguir SOPs empresariales de largo horizonte y críticos para la seguridad— pero llegan a una conclusión estructuralmente idéntica: compilar las restricciones del SOP en pseudocódigo ejecutable y ejecutar con una máquina de pila guiada por programa (runtime PG) produce ganancias que el LLM solo, por poderoso que sea, no alcanza [Fuente 3]. La lectura que hacemos es que la compilación actúa como un 'contrato' que delimita el espacio de decisión del modelo en cada paso, en lugar de pedirle que mantenga en contexto toda la prosa del procedimiento.

## Modelos fuertes con runtime PG: contrastes positivos consistentes (58:19 y 75:31 pares discordantes). La guía de programa amplifica su capacidad existente [Fuente 3].

**Modelos débiles con runtime PG**: la guía de programa los perjudica. El andamiaje no compensa carencias fundamentales de razonamiento del modelo base [Fuente 3].

## Human-in-the-loop como andamiaje de diseño

Salangsingha et al. aplican el mismo principio de acotamiento a la generación de GUIs con AI Prototyper para Figma. Su pipeline descompone la solicitud en características discretas, recupera componentes de una biblioteca de 32 primitivos y renderiza capas editables [Fuente 2]. Pero el diferenciador clave no es técnico en el sentido clásico: es el paso de edición human-in-the-loop que permite revisar, modificar o extender la lista de características *antes* del renderizado [Fuente 2]. Esto convierte al humano en un verificador de la descomposición, no del artefacto final — un punto de intervención mucho más eficiente.

En su evaluación preliminar, los participantes que usaron AI Prototyper completaron más prototipos en una ventana de tiempo fija que quienes trabajaban manualmente, y expertos valoraron los prototipos generados por IA más alto en nueve dimensiones de calidad [Fuente 2]. No disponemos de tamaños de muestra —los autores califican la evaluación como preliminar [Fuente 2]—, pero el patrón arquitectónico (RAG + biblioteca de primitivos + intervención humana en la descomposición) es coherente con lo que vemos en los otros dos trabajos: el LLM opera mejor cuando su espacio de acción está pre-estructurado.

Hay un matiz crítico que los propios autores señalan: los generalistas generan código de forma inconsistente tanto en funcionalidad como en calidad [Fuente 1]. Esto no es solo un problema de rendimiento bruto; es un problema de mantenibilidad industrial. Un agente que resuelve el 80% de los casos pero produce artefactos impredecibles genera deuda técnica que el equipo humano hereda sin visibilidad clara.

## La implicación práctica para equipos de desarrollo

Tres trabajos independientes, tres dominios distintos (transformación BPMN, SOPs empresariales, prototipado GUI), una conclusión convergente: el andamiaje determinista —ya sea compilación a pseudocódigo [Fuente 3], agentes especializados con semántica de dominio explícita [Fuente 1], o pipelines de descomposición con bibliotecas acotadas [Fuente 2]— reduce errores, costes y latencia de forma medible. La guía de Yu et al. lo sintetiza con claridad: compilar primero; habilitar el paginado de frame activo solo después de verificar la disciplina del modelo [Fuente 3]. Creemos que esta máxima se generaliza: antes de escalar el modelo, diseñar el contorno de lo que el modelo necesita decidir.

Ninguno de estos trabajos afirma que los agentes generalistas sean irrelevantes para tareas de dominio abierto [Fuente 1]. La tesis tiene límites — y reconocerlos es parte de defenderla con rigor.

## Fuentes consultadas

- Harris Borman, Herman Wandabwa, Fusun Yu, Sandeepa Kannangara, Justin Liu, Anna Leontjeva, and Ritchie Ng. Beyond Generalist LLMs: Specialist Agentic Systems for Structured Code Workflow Execution. arXiv:2607.14456, 2026.

- Tawatchai Salangsingha, Sami Ashkan, Md Zia Ullah, and Iain McGregor. AI Prototyper: A Figma Plugin for Decomposition-Based GUI Prototyping with LLMs. arXiv:2607.14830, 2026.

- Chenglin Yu, Li Yin, Ying Yu, Qingxin Fan, RunyangRay Zhong, Hongxia Yang, and Ming Li. Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents. arXiv:2607.11346, 2026.
