# El agente de código fiable no se construye: se restringe, se valida por trayectoria y se recorta con presupuesto

> Published: 2026-09-20T06:23:20.493+00:00
> Updated: 2026-09-20T06:24:15.744+00:00

---

## El agente de código fiable no se construye: se restringe, se valida por trayectoria y se recorta con presupuesto

Creemos que la ingeniería de agentes de código ha entrado en una fase donde el diferencial competitivo no está en la capacidad generativa del modelo, sino en la infraestructura determinista que lo rodea: los sistemas de restricción que acotan su autonomía, los protocolos de validación que evalúan trayectorias completas y no componentes aislados, y las estrategias de gestión de contexto que preservan la fiabilidad sin inflar costes. Los equipos que traten al LLM como el producto, en lugar de tratarlo como un componente dentro de un harness disciplinado, producirán agentes frágiles que fallan exactamente donde más importa: en los flujos multi-paso, de largo horizonte, con restricciones de seguridad.

Creemos que la ingeniería de agentes de código ha entrado en una fase donde el diferencial competitivo no está en la capacidad generativa del modelo, sino en la infraestructura determinista que lo rodea: los sistemas de restricción que acotan su autonomía, los protocolos de validación que evalúan trayectorias completas y no componentes aislados, y las estrategias de gestión de contexto que preservan la fiabilidad sin inflar costes. Los equipos que traten al LLM como el producto, en lugar de tratarlo como un componente dentro de un harness disciplinado, producirán agentes frágiles que fallan exactamente donde más importa: en los flujos multi-paso, de largo horizonte, con restricciones de seguridad.

## La validación que importa es la de la trayectoria, no la del paso

La encuesta de Mirto et al., que sintetiza 257 artículos sobre validación de sistemas agénticos, establece un punto que la lectura que hacemos en IDO considera fundacional: el despliegue confiable de IA agéntica depende de **validar trayectorias en contexto** en lugar de evaluar componentes aislados [Fuente 1]. Esto no es una preferencia metodológica — es una consecuencia directa de que el comportamiento agéntico se despliega en trayectorias multi-paso que combinan planificación, uso de herramientas, memoria, interacción y adaptación. Testear la llamada a una herramienta individual dice poco sobre si el agente completará un flujo de trabajo de 40 pasos sin corromper estado intermedio.

Lo revelador de la taxonomía de cinco dimensiones propuesta — comportamental, seguridad, temporal, regulatoria, multi-agente — es el grado de asimetría en madurez. Solo la evaluación comportamental tiene cobertura razonable. La validez temporal, el mantenimiento de evidencia en tiempo de ejecución, la legibilidad regulatoria y el aseguramiento multi-agente permanecen subdesarrollados [Fuente 1]. Esto significa que la industria ha estado evaluando si el agente *hace lo correcto ahora*, pero no si lo sigue haciendo mañana, si puede demostrar por qué lo hizo, ni si dos agentes coordinados mantienen invariantes conjuntas.

Los casos de estudio en atención médica, operaciones industriales y movilidad inteligente de [Fuente 1] confirman que las cinco dimensiones recurren en entornos operacionales reales — no es una taxonomía académica sin anclaje.

Tres trabajos del cuerpo de conocimiento convergen en una misma tesis arquitectónica: el código determinista debe tomar las decisiones de control, y el LLM debe limitarse a generar contenido semántico dentro de los límites que ese código establece. Zhou et al. lo demuestran con contundencia cuantitativa en generación de texto restringida: el single-shot prompting cumplió el objetivo entre el 21,1% y el 31,6% de los casos, mientras que la arquitectura de bucle cerrado — donde código determinista evalúa, acepta o rechaza cada iteración — alcanzó entre el 92,5% y el 98,8% [Fuente 7]. El modelo solo escribe y edita; nunca decide si su propia salida es aceptable.

Yu et al. llevan esta lógica al dominio empresarial con SOPs compilados a pseudocódigo ejecutable y un runtime de máquina de pila guiada por programa. Su hallazgo clave: la guía de runtime es *capability-gated* — beneficia a modelos fuertes y perjudica a modelos débiles [Fuente 4]. No es que el harness compense la debilidad del modelo; es que un modelo con capacidad suficiente, al recibir restricciones explícitas, rinde dramáticamente mejor. En el dominio Bank, los tres brazos del estudio suben de 70,4 a 86,4 a 92,8, con 100% de corrección en rechazos [Fuente 4].

El estudio de Gaggar sobre context trimming aporta un dato que redefine la conversación: presupuestos de contexto retenido del 25% o menos multiplicaron las probabilidades de fallo por 10,92 veces [Fuente 8]. El recorte agresivo de contexto no es una estrategia de ahorro — es un vector de fallo. Las estrategias convencionales (recencia, relevancia, summarización) lograron aproximadamente un 60% de ahorro de tokens, pero la tasa de éxito de tareas cayó a 66,6%–77,3% y la adherencia al protocolo a 85,5%–88,6% [Fuente 8]. Solo las guardianes de presupuesto adaptativo alcanzaron un 96,0% de éxito de tareas con 96,3% de adherencia al protocolo y apenas 1,0% de fallos en cascada, manteniendo un 56,0% de ahorro [Fuente 8].

Borman et al. reportan que en transformación de diagramas BPMN a flujos ejecutables, el agente especialista superó a los baselines generalistas (Roo y Cline) en exactitud de uso de herramientas por 9-20 puntos porcentuales, con latencia 2-4× menor, 3× menos errores de llamada a herramientas, más del 95% de reducción en coste de tokens de generación y eliminación completa de iteraciones de reparación [Fuente 6]. Los autores son explícitos en no generalizar estos resultados a tareas de dominio abierto, pero la implicación para flujos de trabajo estructurados con semántica explícita es clara: la generalidad tiene un coste medible en fiabilidad, latencia y recursos.

Que los generalistas generen código "inconsistente tanto en funcionalidad como en calidad" [Fuente 6] no sorprende — sorprende que tantos equipos sigan desplegándolos en flujos donde la consistencia es un requisito duro.

El pipeline de Nguyen y Ghose ataca un problema que IDO considera estructuralmente anterior a la mejora de agentes: ¿cómo saber si tu eval es fiable? Su propuesta combina checklists estructurados, agregación aprendida de respuestas de jueces LLM, auto-consistencia, explicaciones e incertidumbre de predicción [Fuente 9]. El enfoque de WorkBuddy Bench complementa desde otro ángulo: resistencia a contaminación mediante ingeniería inversa de tareas a partir de commits y PRs reales, sin depender de la opacidad del dataset, y con la disciplina de no reportar ninguna media global entre subconjuntos porque las puntuaciones no son comparables [Fuente 3].

La decisión de WorkBuddy Bench de no producir un score único es más significativa de lo que parece. Creemos que la presión por rankings unidimensionales ha distorsionado la evaluación de agentes: un número que promedia rendimiento en código, web, oficina y seguridad oculta exactamente las debilidades de dominio que importan para decisiones de despliegue [Fuente 3].

- 92,5%–98,8% — Tasa de cumplimiento del objetivo bajo bucle cerrado determinista vs. 21,1%–31,6% en single-shot
- 10,92× — Multiplicador de probabilidad de fallo con contexto retenido ≤25%

## Memoria gestionada por el agente: el agente decide qué escribir y qué releer, un esquema que Saha identifica como insuficiente para agentes de larga duración porque depende de decisiones deliberadas que el agente puede omitir [Fuente 2].

**Memoria anclada en señales y evaluada por el harness**: las condiciones de activación (ruta, símbolo, semántica, evento, temporal) son evaluadas determinísticamente por el entorno de ejecución, no por el agente. La entrega es el producto, no el almacenamiento [Fuente 2].

La posición que defendemos es operativa: antes de escalar capacidades del modelo, los equipos de ingeniería necesitan invertir en tres capas de infraestructura que la evidencia revisada señala como determinantes. Primera, harnesses que restrinjan la autonomía del agente con lógica determinista y entreguen memoria sin requerir gestión activa del agente [Fuente 2] [Fuente 7] [Fuente 4]. Segunda, protocolos de evaluación que validen trayectorias completas a lo largo de las cinco dimensiones identificadas por Mirto et al., no solo comportamiento instantáneo [Fuente 1]. Tercera, estrategias de contexto que traten el presupuesto de tokens como una variable de fiabilidad con guardianes adaptativos, no como un parámetro de coste a minimizar [Fuente 8]. El modelo más capaz del mercado, sin estas tres capas, producirá agentes que impresionan en demos y fallan en producción.

## Fuentes consultadas

- Fabio Orazio Mirto, Luca D'Agati, Giuseppe Tricomi, Stefano Silvestri, Francesco Longo, Antonio Puliafito, and Giovanni Merlino. Beyond Component Testing: Validating Agentic AI Systems. [arXiv:2607.29405](https://arxiv.org/abs/2607.29405v1), 2026.

- Swapnanil Saha. Delivery, Not Storage: Cue-Anchored Working Memory as a Harness Property for Coding Agents. [arXiv:2607.20972](https://arxiv.org/abs/2607.20972v1), 2026.

- Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen, Xiang Fei, Yong Mao, Zihan Xu, Zhiheng Lyu, Zhijian Shao, Yuchen Shi, Shuwen Zhang, Chaofan Qiu, Linjie Che, Xiaoxi Zhao, Feng Wu, Kai Zhang, Chaofan Zhu, Yubin Qi, Xiaoyun Liang, Peijie Dong, Yunhao Zhang, Yuanjie Zhu, Ling Jiang, Xianjun Zhang, Zhehang Chu, Anyuan Sang, Zhen Feng, Sen Nie, Shi Wu, Yuanzhen Xu, Xin Li, Ning Yang, Zhiqiang Dong, Hande Dong, Qiang Lin, Yi Liu, Yunsheng Wu, Ke Li, and Xing Sun. Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction. [arXiv:2607.20911](https://arxiv.org/abs/2607.20911v1), 2026.

- Chenglin Yu, Li Yin, Qingxin Fan, Ying Yu, RunyangRay Zhong, and Ming Li. Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents. [arXiv:2607.11346](https://arxiv.org/abs/2607.11346v1), 2026.

- Tawatchai Salangsingha, Ashkan Sami, Md Zia Ullah, and Iain McGregor. AI Prototyper: A Figma Plugin for Decomposition-Based GUI Prototyping with LLMs. [arXiv:2607.14830](https://arxiv.org/abs/2607.14830v1), 2026.

- Harris Borman, Herman Wandabwa, Fusun Yu, Sandeepa Kannangara, Justin Liu, Anna Leontjeva, and Ritchie Ng. Beyond Generalist LLMs: Specialist Agentic Systems for Structured Code Workflow Execution. [arXiv:2607.14456](https://arxiv.org/abs/2607.14456v1), 2026.

- Quan Zhou, Shahbaz Siddeeq, Mika Saari, and Pekka Abrahamsson. A Closed-Loop Control Architecture for Reliable Constraint Satisfaction in LLM Text Generation. [arXiv:2609.19710](https://arxiv.org/abs/2609.19710v1), 2026.

- Harish Gaggar. Protocol-Preserving Context Trimming for Agentic Workflows: Benefits, Failure Regimes, and Budget Guardrails. [arXiv:2609.16461](https://arxiv.org/abs/2609.16461v1), 2026.

- Emma Thuong Nguyen and Abhishek Ghose. Towards a Reliable and Practical Eval Pipeline. [arXiv:2609.00805](https://arxiv.org/abs/2609.00805v1), 2026.
