MarketingHablemos

Insight

Estructura primero, LLM después: la tesis de que los agentes de código necesitan andamiaje determinista.

La evidencia reciente converge en una idea incómoda para quienes apuestan por agentes generalistas cada vez más grandes: en tareas con semántica de dominio explícita, inyectar estructura determinista —compilación a pseudocódigo, bibliotecas de primitivos, agentes especializados— supera de forma consistente al enfoque de dejar que el LLM 'resuelva todo'. Creemos que el próximo salto de productividad en desarrollo asistido por IA no vendrá de modelos más potentes, sino de mejores andamiajes que acotan lo que el modelo debe decidir.

El coste oculto de la generalidad

Borman et al. construyen un agente especialista para transformar diagramas BPMN en flujos de trabajo ejecutables y lo enfrentan a Roo y Cline, dos agentes generalistas. El resultado no es marginal: el especialista reduce los errores de llamada a herramientas en un factor de 3×, elimina por completo las iteraciones de reparación y recorta el consumo de tokens de generación en más del 95% [1]. Dicho de otro modo, los generalistas no solo son menos precisos —son drásticamente más caros de operar para la misma tarea estructurada.

~9-20 pp
Ventaja del agente especialista en exactitud de uso de herramientas sobre los generalistas
[1]
2-4×
Reducción de latencia ajustada por penalización del especialista frente a generalistas
[1]
70,4 → 86,4 → 92,8
Progresión de rendimiento en dominio Bank al añadir compilación y runtime PG (tres brazos)
[3]
100%
Corrección en rechazos lograda en dominio Bank con los tres brazos primarios
[3]

Compilar antes de razonar: SOPs como pseudocódigo ejecutable

Yu et al. atacan un problema distinto —agentes que deben seguir SOPs empresariales de largo horizonte y críticos para la seguridad— pero llegan a una conclusión estructuralmente idéntica: compilar las restricciones del SOP en pseudocódigo ejecutable y ejecutar con una máquina de pila guiada por programa (runtime PG) produce ganancias que el LLM solo, por poderoso que sea, no alcanza [3]. La lectura que hacemos es que la compilación actúa como un 'contrato' que delimita el espacio de decisión del modelo en cada paso, en lugar de pedirle que mantenga en contexto toda la prosa del procedimiento.

Modelos fuertes con runtime PG: contrastes positivos consistentes (58:19 y 75:31 pares discordantes). La guía de programa amplifica su capacidad existente [Fuente 3].

Modelos débiles con runtime PG: la guía de programa los perjudica. El andamiaje no compensa carencias fundamentales de razonamiento del modelo base [3].

Human-in-the-loop como andamiaje de diseño

Salangsingha et al. aplican el mismo principio de acotamiento a la generación de GUIs con AI Prototyper para Figma. Su pipeline descompone la solicitud en características discretas, recupera componentes de una biblioteca de 32 primitivos y renderiza capas editables [2]. Pero el diferenciador clave no es técnico en el sentido clásico: es el paso de edición human-in-the-loop que permite revisar, modificar o extender la lista de características antes del renderizado [2]. Esto convierte al humano en un verificador de la descomposición, no del artefacto final — un punto de intervención mucho más eficiente.

En su evaluación preliminar, los participantes que usaron AI Prototyper completaron más prototipos en una ventana de tiempo fija que quienes trabajaban manualmente, y expertos valoraron los prototipos generados por IA más alto en nueve dimensiones de calidad [2]. No disponemos de tamaños de muestra —los autores califican la evaluación como preliminar [2]—, pero el patrón arquitectónico (RAG + biblioteca de primitivos + intervención humana en la descomposición) es coherente con lo que vemos en los otros dos trabajos: el LLM opera mejor cuando su espacio de acción está pre-estructurado.

La implicación práctica para equipos de desarrollo

Tres trabajos independientes, tres dominios distintos (transformación BPMN, SOPs empresariales, prototipado GUI), una conclusión convergente: el andamiaje determinista —ya sea compilación a pseudocódigo [3], agentes especializados con semántica de dominio explícita [1], o pipelines de descomposición con bibliotecas acotadas [2]— reduce errores, costes y latencia de forma medible. La guía de Yu et al. lo sintetiza con claridad: compilar primero; habilitar el paginado de frame activo solo después de verificar la disciplina del modelo [3]. Creemos que esta máxima se generaliza: antes de escalar el modelo, diseñar el contorno de lo que el modelo necesita decidir.

Ninguno de estos trabajos afirma que los agentes generalistas sean irrelevantes para tareas de dominio abierto [1]. La tesis tiene límites — y reconocerlos es parte de defenderla con rigor.

Fuentes consultadas

  1. Harris Borman, Herman Wandabwa, Fusun Yu, Sandeepa Kannangara, Justin Liu, Anna Leontjeva, and Ritchie Ng. Beyond Generalist LLMs: Specialist Agentic Systems for Structured Code Workflow Execution. arXiv:2607.14456, 2026.
  2. Tawatchai Salangsingha, Sami Ashkan, Md Zia Ullah, and Iain McGregor. AI Prototyper: A Figma Plugin for Decomposition-Based GUI Prototyping with LLMs. arXiv:2607.14830, 2026.
  3. Chenglin Yu, Li Yin, Ying Yu, Qingxin Fan, RunyangRay Zhong, Hongxia Yang, and Ming Li. Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents. arXiv:2607.11346, 2026.