MarketingHablemos
Edición · es

Insight

La memoria fiable de un agente de código es la que el agente nunca decide usar.

Creemos que el cuello de botella real de los agentes de código de larga duración no es la capacidad de razonamiento ni el acceso a herramientas, sino la memoria operacional — y que la arquitectura correcta para esa memoria es contraintuitiva: el agente no debería gestionarla. La propuesta de Saha de un modelo de memoria anclado en señales, donde el harness entrega recuerdos de forma determinista sin que el agente decida cuándo escribirlos ni cuándo releerlos, representa un cambio de paradigma que resuena con hallazgos convergentes sobre la fragilidad de los agentes cuando se les delega control sobre flujos estructurados.

Almacenamiento voluntario: el agente escribe documentos de memoria y decide cuándo consultarlos. Dos decisiones, dos oportunidades de fallo. El producto es un archivo que puede no ser releído jamás.

Entrega determinista: el harness captura memoria como efecto secundario e inyecta recuerdos cuando las condiciones de activación se cumplen. Cero decisiones del agente. El producto es la entrega, no el almacenamiento [1].

El problema de la doble decisión

La distinción entre delivery y storage que propone Saha está fundamentada en tres cuerpos de literatura cognitiva: descarga de memoria, codificación incidental y memoria prospectiva basada en eventos [1]. La lectura que hacemos es que cada uno de estos conceptos mapea directamente a un requisito arquitectónico que se puede implementar hoy: la codificación incidental significa que el harness observa las acciones del agente y extrae hechos sin intervención; la memoria prospectiva basada en eventos significa que esos hechos se disparan por señales contextuales (ruta, símbolo, evento), no por una búsqueda semántica que el agente inicie.

El modelo de memoria anclado en señales (cue-anchored memory) asigna a cada recuerdo condiciones de activación de primer orden sobre un vocabulario componible: ruta, símbolo, semántica, evento y temporal [1]. Estas condiciones se evalúan determinísticamente por el harness. Esto es lo que convierte la memoria en infraestructura en lugar de comportamiento emergente. No se le pregunta al agente "¿recuerdas algo relevante?"; el harness detecta que el agente está tocando src/payments/gateway.py y le entrega la nota de que ese módulo tiene un timeout hardcodeado que no debe modificarse.

La composición de señales (ruta + evento, por ejemplo) abre la puerta a memoria contextual de grano fino que ningún sistema de RAG sobre documentación estática puede replicar.

Convergencia con la tesis del control externo al agente

La propuesta de Saha no existe en el vacío. Yu et al. demuestran que compilar SOPs en pseudocódigo ejecutable y paginar el frame activo mediante una máquina de pila guiada por programa mejora radicalmente el rendimiento en modelos fuertes [3]. El patrón es el mismo: el control estructural no se delega al LLM, se externaliza al runtime. En SOPBench, el dominio Bank subió de 70,4 a 92,8 con la combinación de compilación y guía de runtime, alcanzando 100% de corrección en rechazos [3]. La guía de runtime resultó ser capability-gated: beneficia a modelos fuertes y perjudica a los débiles, lo que sugiere que la entrega determinista de contexto funciona cuando el modelo tiene capacidad suficiente para aprovecharlo.

70,4 → 86,4 → 92,8
Progresión de rendimiento en dominio Bank (SOPBench): texto plano → compilado → compilado + runtime PG
[3]
>95%
Reducción en coste de tokens del agente especialista vs. generalistas (Borman et al.)
[5]

El problema de evaluación que esto genera

Si la memoria es una propiedad del harness y no del agente, ¿cómo evaluamos agentes con memoria? Los benchmarks actuales, incluido WorkBuddy Bench de Tencent, evalúan capacidad de ejecución sobre tareas discretas con instrumentos de puntuación por subconjunto [2]. No reportan ninguna media global precisamente porque las facetas son incomparables entre sí. Pero ninguno de los cuatro dominios de WorkBuddy Bench (Code, Web, Office, Security) parece diseñado para medir persistencia de conocimiento operacional entre tareas [2]. Creemos que este es el gap más urgente: carecemos de un benchmark que mida si un agente de código que trabaja durante 50 sesiones en un repositorio acumula y aplica conocimiento tácito. Sin esa medición, la memoria anclada en señales queda como propuesta arquitectónica sin validación empírica estandarizada.

Implicación para el diseño de harnesses de agentes

La tesis de Saha redefine dónde debe invertir esfuerzo un equipo que construye infraestructura para agentes de código. El harness deja de ser un simple ejecutor de comandos con sandboxing y pasa a ser un sistema cognitivo complementario que observa, indexa y entrega. El vocabulario componible de señales (ruta, símbolo, semántica, evento, temporal) [1] funciona como un contrato de interfaz entre el harness y el agente: el harness garantiza entrega cuando las condiciones se cumplen; el agente no necesita saber que la memoria existe hasta que la recibe. Esto es análogo a cómo la máquina de pila de Yu et al. pagina el frame activo: el LLM ejecuta semántica sobre lo que se le presenta, no sobre lo que decide buscar [3].

Donde no tenemos evidencia es en la escalabilidad de este modelo a repositorios masivos con miles de señales potencialmente activas simultáneamente. Saha propone el vocabulario pero, con la información disponible, no documentamos resultados de implementación a escala. El riesgo de ruido — demasiadas memorias inyectadas saturando la ventana de contexto — es real y no está resuelto en el cuerpo de conocimiento que manejamos. Es un problema abierto que reconocemos.

La prueba definitiva será un harness de producción que implemente memoria anclada en señales y se evalúe contra uno con almacenamiento voluntario en un benchmark de sesiones prolongadas. Ese benchmark todavía no existe.

Fuentes consultadas

  1. Swapnanil Saha. Delivery, Not Storage: Cue-Anchored Working Memory as a Harness Property for Coding Agents. arXiv:2607.20972, 2026.
  2. Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen, Xiang Fei, Yong Mao, Zihan Xu, Zhiheng Lyu, Zhijian Shao, Yuchen Shi, Shuwen Zhang, Chaofan Qiu, Linjie Che, Xiaoxi Zhao, Feng Wu, Kai Zhang, Chaofan Zhu, Yubin Qi, Xiaoyun Liang, Peijie Dong, Yunhao Zhang, Yuanjie Zhu, Ling Jiang, Xianjun Zhang, Zhehang Chu, Anyuan Sang, Zhen Feng, Sen Nie, Shi Wu, Yuanzhen Xu, Xin Li, Ning Yang, Zhiqiang Dong, Hande Dong, Qiang Lin, Yi Liu, Yunsheng Wu, Ke Li, and Xing Sun. Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction. arXiv:2607.20911, 2026.
  3. Chenglin Yu, Li Yin, Qingxin Fan, Ying Yu, RunyangRay Zhong, and Ming Li. Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents. arXiv:2607.11346, 2026.
  4. Tawatchai Salangsingha, Ashkan Sami, Md Zia Ullah, and Iain McGregor. AI Prototyper: A Figma Plugin for Decomposition-Based GUI Prototyping with LLMs. arXiv:2607.14830, 2026.
  5. Harris Borman, Herman Wandabwa, Fusun Yu, Sandeepa Kannangara, Justin Liu, Anna Leontjeva, and Ritchie Ng. Beyond Generalist LLMs: Specialist Agentic Systems for Structured Code Workflow Execution. arXiv:2607.14456, 2026.

Seguir leyendo

Piezas del mismo hilo de trabajo.

  • El agente de código fiable no es el que más sabe, sino el que menos decideDesarrollo con IA

    Cada decisión delegada al LLM que podría resolverse de forma determinista reduce la fiabilidad del agente. Este análisis explica por qué y cómo corregirlo.

    Leer el artículo →
  • El agente de comercio que no protege su memoria no merece la confianza que pideEcommerce

    El agente de comercio que no protege su memoria no merece la confianza que pide. Seguridad y estado en el ecommerce con IA agéntica. Análisis técnico.

    Leer el artículo →
  • Estructura primero, LLM después: la tesis de que los agentes de código necesitan andamiaje deterministaDesarrollo con IA

    La evidencia muestra que el andamiaje determinista supera al agente generalista en tareas de dominio. El próximo salto no son modelos más grandes, sino…

    Leer el artículo →
  • Agentes de IA para agencias de marketing: lo que realmente importa no es la autonomía, sino la trazabilidad del juicioIA y marketing

    La automatización agéntica genera riesgo operativo cuando falta trazabilidad. Analizamos por qué el juicio auditable importa más que la autonomía en…

    Leer el artículo →
  • El comercio agéntico no tiene un problema de inteligencia: tiene un problema de arquitectura de controlEcommerce

    Los LLM ya razonan con sofisticación económica. El verdadero freno del comercio agéntico es no tener definido qué decisiones puede tomar el agente solo y…

    Leer el artículo →
  • El agente de comercio no necesita más datos: necesita mejor dinámica de decisiónEcommerce

    El comercio agéntico no mejora acumulando datos: mejora cuando cada recomendación, puja o explicación forma parte de una trayectoria dinámica con estado…

    Leer el artículo →