Separar el LLM de la recuperación: una decisión de ingeniería, no una concesión
El asistente conversacional de Kapetanovic et al. ilustra esta separación con nitidez: el LLM se emplea exclusivamente para clasificación de intención y elicitación de preferencias, mientras que recuperación, reranking y diversidad se ejecutan como funciones dedicadas fuera del modelo [1]. La decisión no es capricho minimalista. El componente central — un self-refreshing retriever que sincroniza catálogos vivos mediante hashes por ítem, procesando solo el delta — opera sobre un índice vectorial que cambia continuamente conforme se añaden, eliminan o modifican productos. Delegar esa sincronización al LLM sería inviable en latencia y coste. La lectura que hacemos es directa: en ecommerce real, el catálogo es un objetivo móvil, y el agente que no lo trate como tal produce recomendaciones fantasma sobre inventario inexistente.
Que el sistema de Kapetanovic et al. funcione sobre WhatsApp no es anecdótico: revela que el canal conversacional impone restricciones de latencia y formato que fuerzan la modularidad.
Memoria textual: el LLM reescribe narrativas de usuario en cada actualización. Coste acumulativo alto, pérdida de granularidad colaborativa.
Memoria vectorial (CoVeMem): estados de usuario/ítem como vectores entrenables. El historial completo se convierte en dato de entrenamiento, no en texto que el LLM debe releer.
CoVeMem aborda un problema que los demos de agentes conversacionales suelen ignorar: cómo persiste el conocimiento sobre el usuario entre sesiones. La memoria textual — narrativas reescritas por el propio LLM — presenta dos fallos documentados por Chen et al.: el coste de actualización crece de forma prohibitiva cuando se intenta explotar el historial completo de interacción, y la evidencia colaborativa graduada (qué tan similar es un usuario a miles de otros sobre todo un catálogo) simplemente no sobrevive a su traducción en oraciones [2]. CoVeMem resuelve esto vectorizando el núcleo colaborativo de la memoria mediante estados congelados de LightGCN, que entran al contexto del LLM como soft tokens. El resultado: iguala o supera al agente de memoria textual más fuerte en 19 de 20 celdas métricas, con cero llamadas adicionales al LLM para mantenimiento de memoria [2].
Recomendar como planificación secuencial, no como ranking estático
Trapeznikov y Utushkin reformulan la recuperación top-K como un proceso de decisión de Markov sobre el posterior implícito de ALS, donde cada ítem seleccionado modifica el estado del usuario y, por tanto, lo que debería recuperarse a continuación [12]. La transición se calcula como un fold-in de rango uno en forma cerrada — sin reentrenamiento. Lo revelador es que un solo paso de planificación (lookahead) captura la mayor parte de la ganancia sobre la recuperación estática [12]. Para comercio agéntico, esto tiene una implicación concreta: no necesitamos planificadores pesados tipo MCTS con horizontes largos; basta una capa ligera de decisión sobre embeddings de filtrado colaborativo existentes para que el agente deje de tratar cada recomendación como independiente del contexto de la sesión.
La condición metodológica que reportan Trapeznikov y Utushkin merece atención: las ganancias de planificación dependen de medir relevancia con similitud coseno en lugar de producto interno, porque el producto interno está entrelazado con la popularidad del ítem [12]. En un agente de comercio que prioriza conversión personalizada sobre volumen de impresiones, esta distinción métrica no es un detalle técnico — es una decisión de negocio.
El razonamiento explícito es un cuello de botella; el latente lo resuelve
WhisperRec confronta una tensión que cualquier agente de comercio en producción enfrentará: el razonamiento Chain-of-Thought explícito mejora la calidad de la recomendación, pero introduce sobrecarga sustancial de inferencia [6]. La solución — comprimir el CoT de un modelo docente en tokens de razonamiento latente — retiene la información relevante para la decisión sin generar texto verboso. Jiang et al. reportan mejoras de SID@64 del 17,44% sobre CoT explícito tipo Think y más de 10× mayor throughput de inferencia [6]. Para un agente que debe responder en tiempo real sobre un catálogo vivo, esa diferencia de throughput es la diferencia entre un prototipo y un sistema desplegable.
Zhu, Wang y Zhang aportan un principio arquitectónico que el comercio agéntico no puede ignorar: en ausencia de señal de corrección barata y legible por máquina, la asignación del juicio humano es la variable de diseño más informativa [11]. Su arquitectura pAI-Econ-claude distingue explícitamente entre decisiones reversibles (delegables a agentes) e irreversibles (reservadas al humano). En comercio, un error de recomendación es reversible; un cobro duplicado o un envío a dirección incorrecta no lo es. Las puertas especializadas que diagnostican modos de fallo específicos redujeron la severidad media de fallos de 1,58 a 1,16 y aumentaron la utilidad de 2,60 a 3,10 en sus evaluaciones [11].
Living-Harness complementa esta perspectiva desde el ángulo de la evolución autónoma: convierte cada trayectoria completada en evidencia para actualizar el harness del agente, escribiendo memoria episódica y grafos de estados que acumulan reparaciones procedurales entre ciclos [4]. Du et al. reportan mejoras de Pass@1 de 10,07 y 9,91 puntos porcentuales sobre baselines interactivos en ocho entornos derivados de τ²-Bench y MultiWOZ-2.4 [4]. La combinación de ambos enfoques — puertas humanas para decisiones irreversibles, auto-evolución para el resto — dibuja el esqueleto de un agente de comercio que mejora con el uso sin acumular riesgo.
La tesis que defendemos
El agente de comercio viable no es un LLM con acceso a un catálogo. Es una composición de memoria vectorial que aprende del historial completo sin reescrituras textuales [2], un recuperador que sincroniza inventario vivo procesando solo deltas [1], una capa de planificación secuencial que trata cada recomendación como dependiente de la anterior [12], razonamiento latente que opera a throughput de producción [6], y puertas de supervisión que reservan el juicio humano para decisiones de alto coste de reversibilidad [11]. Ninguno de estos componentes requiere que el LLM haga todo; cada uno requiere que el LLM haga exactamente lo que sabe hacer bien — y nada más.
Fuentes consultadas
Fuentes consultadas
- Ante Kapetanovic, Tomislav Duricic, Dionizije Fa, Andro Mercep, and Emanuel Lacic. Conversational Recommendation over Live E-Commerce Catalogues with Self-Refreshing Retrieval. arXiv:2608.27006, 2026.
- Hanchong Chen, Xing Tang, Lingjie Li, Xiongfeng Shan, and Xiuqiang He. When Memory Takes Gradients: Collaborative Vector Memory for Agentic Recommender Systems. arXiv:2608.26895, 2026.
- Finn Hertsch. Kairos: Numerically Robust News Recommendation under Item Cold-Start via Cholesky-based LinUCB. arXiv:2607.26832, 2026.
- Yuetian Du, Yucheng Wang, He Xu, Jiexu Xu, Shanwen Tan, Bing Zhao, Boyu Yang, Zhijie Xu, Ming Kong, Hu Wei, Jie Liu, and Qiang Zhu. Living-Harness Is an Interactive-Agent Evolver. arXiv:2607.26598, 2026.
- Ruiyu Liu, Xiaohao Liu, Miaomiao Cai, Yunshan Ma, and See-Kiong Ng. CaIRec: Calibrated Modality Imputation for Incomplete Multimodal Recommendation. arXiv:2607.26720, 2026.
- Hao Jiang, Peiru Du, Pengfei Yao, Mengting Li, Siyuan Lou, Kuo Cai, Sheng Yu, Qiang Luo, Jian Liang, Ruiming Tang, Fei Pan, Peng Jiang, and Wenwu Ou. WhisperRec: Latent Reasoning for Efficient Foundation Recommendation Models. arXiv:2607.26621, 2026.
- Zipeng Chen, Jiaer Zheng, Xiangyang Xu, Xinyu Lin, Zhaobin Wang, Zhaohui Liu, Qianjin Xiang, Xiaoyu Zhao, Zhuozhen Yu, Guangshuo Wang, Daxing Chen, Junwei Pan, Zhangbin Zhu, Chengguo Yin, Hao Chen, Tat-Seng Chua, Haijie Gu, and Jie Jiang. Beyond Action Imitation: Learning a Decision-Aware User Simulator for Online Advertising. arXiv:2607.26893, 2026.
- Tao Su, Jinjing Hu, Xiao Wang, Xingzhong Cao, and Hui Wang. ASARL: Autonomous Social-Aware Relevance Learning for QQ Search. arXiv:2607.26593, 2026.
- Alp Niksarli and Gopesh Baheti. A Graph-Native Bitemporal Memory Store for Conversational AI Agents. arXiv:2607.26520, 2026.
- Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, and Bo Zheng. Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding. arXiv:2607.24232, 2026.
- Chen Zhu, Xiaolu Wang, and Weilong Zhang. pAI-Econ-claude: A Gated Human-in-the-Loop Multi-Agent Architecture for AI-Assisted Economic Theory Development. arXiv:2607.21268, 2026.
- Mikhail Trapeznikov and Maksim Utushkin. Planning over Matrix-Factorization MDPs for Candidate Generation. arXiv:2607.02115, 2026.