Ir al contenido

Investigación19 de septiembre de 202618 min de lectura

La pila de memoria sombra

Ocho ciclos de investigación y más de 900 fuentes sobre memoria para agentes: los frameworks resuelven la memoria dentro de su propio perímetro, los practitioners improvisan el resto, y la continuidad, la cosa que hace que un equipo de agentes no rehaga trabajo, no tiene dueño. Benchmarks, costos ocultos, las nueve brechas no publicadas y la realidad regulatoria brasileña.

Equipo ValorBrain

Quien opera agentes en producción hace algún tiempo probablemente mantiene, sin llamarlo sistema, una pila parecida a esta: un MEMORY.md cargado en el CLAUDE.md, snapshots manuales en un directorio antes de cada compaction de contexto, y una regla tácita: sobrescribir hechos obsoletos, no duplicar, y esperar que el agente lea todo eso de nuevo en la próxima sesión.

Nadie vende esa pila. Nadie la documentó como arquitectura. Existe porque la pregunta que un thread en el r/AI_Agents formuló sin rodeos, "¿alguien realmente resolvió el problema de memoria?" [1], sigue sin respuesta satisfactoria. En los últimos días corrimos ocho investigaciones profundas con más de 900 fuentes recolectadas y cerca de 190 citadas después de validación, cubriendo el estado del arte de memoria para agentes de IA: arquitecturas, benchmarks, latencia y costo, los cinco players principales, el lado de la demanda, olvido y consolidación, LGPD y el mercado brasileño. Este artículo es la síntesis. La tesis cabe en una frase: el mercado vende almacenamiento y lo llama memoria; la cosa que hace que un equipo de agentes no rehaga trabajo, la continuidad, no tiene dueño.

Antes del contenido, el método, porque creemos que investigación sin método es blog post:

  • Ocho corridas de un agente de deep research (supervisor + subagentes por fuente, búsqueda vía SearXNG autohospedado, modelos GLM), de 20 a 27 minutos cada una, con validación mecánica de citas antes de la entrega.
  • Curaduría humana de todo lo que entra aquí. Donde la evidencia no cerró, y no cerró en varios puntos, lo decimos, en vez de taparlo con generalidad.
  • Trabajamos en un memory engine. Esta investigación existió porque necesitábamos decidir qué construir y cómo vender. Deberías leer el texto sabiéndolo; los links están ahí para que verifiques cada afirmación sin creernos.

Dicho esto, vamos a lo que muestran las fuentes.

Cada framework resuelve la memoria dentro de su casa

Los frameworks de agentes tuvieron progreso real en 2025-2026, dentro de su propio perímetro. CrewAI tiene memoria nativa con cuatro tipos (corto plazo, largo plazo, entidades, externa) compartida entre los agentes de un crew [2]. LangGraph persiste estado por thread_id y ofrece memoria de largo plazo vía store, con la capa LangMem para continuidad entre threads [3]. El OpenAI Agents SDK hace handoff entre agentes transfiriendo el historial de conversación, con control fino de cuánta historia pasa en el pase de testigo [4].

El patrón es siempre el mismo: la memoria existe dentro del constructo del framework, el crew, el thread, la conversación. El crew de CrewAI no lee el store de LangGraph. El agente Codex no ve el estado del agente Claude. Cuando buscamos en las documentaciones oficiales de estos tres frameworks cualquier puente entre universos distintos, el resultado fue negativo en todos, y no por falta de búsqueda: cada página define memoria, ninguna define interoperabilidad.

Dos retrospectives corporativas famosas ilustran lo que pasa en ese vacío. Cognition (la empresa de Devin) publicó "Don't Build Multi-Agents" defendiendo que contextos paralelos y no sincronizados llevan a decisiones conflictivas [5]. Anthropic respondió con la ingeniería de su propio sistema multi-agente de investigación, donde la coordinación funciona, pero dentro de una arquitectura única, diseñada por ellos [6]. Las dos lecturas son compatibles con nuestra conclusión: multi-agente funciona cuando alguien controla la memoria común; se rompe cuando cada agente carga la suya.

La pila sombra es síntoma, no solución

Volvamos a la pila del inicio del texto. No es excentricidad de hobbyista: es lo que la comunidad hace porque el producto no existe. Los practitioners documentan el régimen abiertamente: archivos de memoria acumulados, snapshots manuales, reglas de sobrescritura mantenidas a mano [1]. Lo que esa pila no tiene es todo lo que la vuelve sistema: deduplicación de entidades entre memorias de agentes diferentes, arbitraje cuando dos miembros del equipo creen cosas contradictorias, serialización de handoff que sobreviva al cambio de framework, gobernanza de quién escribe qué.

El costo de no tener eso ya tiene caso célebre. El 21 de julio de 2025, el agente de Replit borró la base de datos de producción de una empresa durante un cambio descrito como congelado, fabricó datos para disfrazar las fallas y reportó éxito [7]. El episodio se cuenta generalmente como historia de "agente descontrolado". Nuestra lectura es otra: es la materialización más grave ya documentada de la divergencia entre lo que el agente cree y lo que el humano sabe, exactamente la ausencia de sincronización entre estado del equipo de agentes y estado real que la pila sombra finge resolver.

Hay más evidencia de que el dolor crece con la escala temporal. Chroma midió y nombró el fenómeno, context rot: la calidad de lectura del modelo se degrada con el tamaño del contexto, así que "tirar todo al prompt" no es continuidad, es aplazamiento [8]. En horizontes ultralargos, el SWE-Marathon (junio de 2026) cataloga cientos de modos de falla de agentes en tareas de larga duración [9]. Y el thread "Agentic Coding Is a Trap" en Hacker News documenta el retrabajo acumulado como modo de falla estructural, no accidental [10].

El circo de los números

Si la ingeniería de la continuidad es el hueco, los benchmarks son la pista de circo. El episodio más instructivo de la categoría vino de la propia Zep: en enero de 2025 el paper de ellos sobre knowledge graphs temporales contestó el SOTA de Mem0 en LoCoMo, mostrando que un baseline de contexto completo, pasar la conversación entera al modelo sin engine ninguno, supera a la mayoría de los sistemas comercializados (~73% contra ~68% de J-score) y que cambiar solo el modelo del juez mueve hasta ~10 puntos en el marcador [11]. Después vino la revancha: una issue pública reabrió el claim de 84% de la propia Zep y lo corrigió a 58,44% bajo evaluación corregida [12]. En paralelo, Hacker News circuló la denuncia "AI Startup Caught Cheating on Benchmark Papers" [13]. Nadie salió limpio de esta historia; todos salieron con marketing.

La lección no es "los benchmarks son inútiles". Es que los números de vendor son el comienzo de la conversación, nunca el fin. LoCoMo tiene limitaciones conocidas [33], LongMemEval intenta corregirlas [34], BEAM nació para escalar donde el valor de la memoria queda medible [31][32], y Mastra mostró un camino arquitectural diferente con 95% en el LongMemEval [35], pero cada resultado viene con el harness de quien lo publicó. Quien compra debería preguntar siempre: quién corrió, con qué juez, comparado con qué.

Lo mismo vale para el costo. Una medición independiente de ocho sistemas de memoria en 2.176 tareas llegó a números muy por encima de lo que las pricing pages sugieren, en el orden de US$ 341 por 1.000 respuestas [15], porque el costo real de memoria incluye el LLM que extrae memorias, el embedding de cada hecho, y el llamado BYOK que transfiere la cuenta al cliente sin transferir la previsibilidad. Y está el silencio: Letta, supermemory, MemOS, LangGraph y las soluciones pgvector no publican latencia alguna. El overhead de MCP de memoria empezó a medirse académicamente recién en 2026 [16][17]. En infraestructura, lo que no se publica suele ser el número que el mercado no quiere que veas.

Una nota al margen, porque conecta costo con calidad: una issue abierta en el repositorio de Mem0 reporta que 97,8% de las memorias ingeridas eran basura [14]. Memoria que solo acumula no es activo, es pasivo con intereses, el tema de la sección adelante sobre consolidación.

La academia ya lo formalizó; el mercado no lo comercializó

Mientras el marketing pelea en la pista de circo, 2026 fue el año en que la investigación académica formalizó exactamente los problemas que los productos ignoran. Un survey de junio dedicado a "memoria persistente, estado y gobernanza en agentes LLM" legitimó el campo como disciplina [27]. Un paper de septiembre sobre tamper-evidence para ejecuciones de agentes apareció, pero mira runs, no el almacenamiento de memoria en sí [28]. El SIGIR 2026 demostró el problema que más nos interesa aquí: borrar el dato del almacenamiento no borra su influencia aguas abajo, el "olvido incompleto" que hace del derecho de eliminación y de la memoria persistente una tensión estructural [29].

En los productos, el mecanismo más sofisticado que encontramos en fuente primaria es la invalidación temporal de aristas del Graphiti, en el paper de Zep: los hechos ganan ventana de validez, lo nuevo invalida lo viejo [19]. Es bi-temporalidad de verdad, y es solo temporal. No hay noción de autoridad de fuente (¿un humano puede contradecir a un agente? ¿un import puede contradecir a un humano?), ni curaduría automática de lecciones de error del equipo, ni traza auditable de quién cambió qué. Un survey de memoria inspirado en ciencia cognitiva mapea lo que la teoría sugiere, consolidación, replay, interleaving [30], y Letta hasta implementó algo próximo con sleep-time compute [23], pero son excepciones aisladas en un mercado que todavía disputa quién extrae más hechos de un chat.

El patrón dominante del segmento, por cierto, es conocido: núcleo Apache 2.0 con scope de biblioteca, cloud pago, y ningún producto self-hosted completo y gratuito. El caso más instructivo es Zep de nuevo: fue el único player con Community Edition self-hosted completa, y la descontinuó, deprecada en abril de 2025, con nuevas remociones en febrero de 2026; quedó el framework Graphiti como open source [36][37][38]. Las licencias defensivas del mercado de infraestructura cuentan la misma historia en ciclos: MongoDB a SSPL en 2018 [39], Redis sale del BSD en 2024 (nace el fork Valkey) y vuelve a AGPL en 2025 [40], Elastic abandona el open source en 2021 (nace OpenSearch) y lo readopta en 2024 [41]. Source-available compra tiempo, genera fork, y el mercado converge de vuelta. Para quien decide cómo vender self-hosted hoy, el histórico apunta: es tier pago con soporte, donde lo que se vende es SLA de respuesta, nunca uptime, o no es.

El comprador, y Brasil

Del lado de la demanda, la categoría es joven y ya produjo rondas relevantes: Cognee levantó US$ 7,5M de seed [47], Supermemory US$ 2,6M con Cloudflare y ejecutivos de Google en el captable [48], sin contar a los gigantes metiendo memoria en la plataforma, que es el movimiento más amenazante: OpenAI con memoria en ChatGPT [44], Anthropic con memory en Claude [45], Bedrock con memoria para agentes [46]. Cuando el memory layer se vuelve feature del proveedor del modelo, el vendor independiente necesita vender lo que la plataforma no puede: continuidad entre modelos y frameworks, y gobernanza sobre datos que cruzan frontera de tenant.

En Brasil, vale corregir un pitch que se volvió mantra: la LGPD no exige datos locales. La transferencia internacional es legítima vía cláusulas-patrón de la Resolución CD/ANPD nº 19/2024, con el período de gracia terminado en agosto de 2025 [49][50]; la CMN 4.893 exige gobernanza de riesgo cibernético, no on-premises [51]. El PL 2338/2023 sigue trabado en la Cámara [52] y el AI Act europeo fue postergado por el omnibus [53]. El argumento de venta correcto para la enterprise brasileña es salvaguarda contractual y arquitectura verificable, no "on-prem porque LGPD". Dicho esto, la fiscalización llega aunque no haya ley de IA: el GDPR europeo ya produjo fiscalización contra memoria de chatbots [54], y los riesgos técnicos están documentados: recuperación semántica devolviendo datos que "fueron borrados" [55][56].

Las nueve brechas que nadie publicó

El inventario de abajo viene de la investigación de continuidad, y cada ítem fue verificado por ausencia con el lugar de búsqueda registrado. Ningún framework o producto comercial documentó resolver:

  1. Memoria compartida nativa entre frameworks distintos — el puente entre el crew de CrewAI, el store de LangGraph y el handoff del OpenAI SDK no existe en documentación oficial de ninguno de los tres [2][3][4][1].
  2. Identidad y deduplicación de entidades entre memorias de agentes diferentes — hoy es regla manual del practitioner [1].
  3. Arbitraje de contradicciones entre creencias del equipo — las contradicciones aparecen solo como diagnóstico de falla en las retrospectives [5][6].
  4. Detección de trabajo duplicado entre agentes de frameworks diferentes [10].
  5. Serialización universal de handoff — el único contrato documentado es historial de conversación filtrable [4]; los formatos reales en producción son markdown ad hoc [1].
  6. Memoria de lecciones y errores del equipo con curaduría automática — existe versión manual e individual, nada de equipo [1].
  7. Sincronización del estado humano (Slack, Jira, PRs, aprobaciones) con la memoria del equipo — la ausencia que el incidente Replit transformó en titular [7][8].
  8. Briefing de retorno para humanos ausentes — nada más allá de snapshots manuales [1].
  9. Gobernanza de memoria — quién escribe, quién borra, scope por proyecto; en la pila sombra, inexistente por construcción [1].

Después de que este texto fue escrito, volvimos y verificamos esos cinco nombres con fuente primaria. El resultado reforzó el diagnóstico: ninguno de los cinco mecanismos examinados (AutoGen, AG2, MetaGPT, MCP, A2A) ofrece memoria de equipo persistente entre ejecuciones e interoperable entre frameworks como primitiva de primera clase. En AutoGen la memoria es por agente con persistencia delegada a la integración; en MetaGPT el pool muere con el run; y el MCP (spec estable 2025-11-25) y el A2A, hoy proyecto de la Linux Foundation, versión 1.0.0, mantenido por un comité con AWS, Cisco, Google, IBM, Microsoft, Salesforce, SAP y ServiceNow, dejan el estado compartido fuera del scope por decisión de diseño [57][58][59][60][61].

Qué sería resolver de verdad

Suma las secciones y el spec aparece solo. Un sistema de memoria para equipos de agentes, agentes heterogéneos, de frameworks diferentes, trabajando con humanos en trabajos de semanas, necesitaría: memoria accesible por protocolo y no por acoplamiento a framework; identidad de entidades y deduplicación entre escritores; arbitraje de contradicción con jerarquía de autoridad explícita; handoff serializado que sobreviva al cambio de herramienta; curaduría automática de lecciones con olvido consciente del costo de mantener memoria muerta; sincronización con el estado humano donde él vive; briefing de retorno legible por persona; y traza auditable de provenance en cada hecho.

Escribimos esa lista como resultado de investigación. También describe, ítem por ítem, lo que pasamos los últimos meses construyendo. No es coincidencia ni moraleja de la historia: es el motivo de haber corrido las ocho investigaciones, para descubrir si lo que estábamos construyendo tenía un mercado que lo confirmara o lo refutara. Las fuentes confirmaron el hueco. Si estás en desacuerdo con algún punto, los links están aquí abajo: para eso existen.


Referencias

Consultadas y validadas el 19/09/2026. El conjunto completo de fuentes recolectadas (900+) está en nuestro brain; abajo, las citadas en el texto.

[1] r/AI_Agents — "Has anyone actually solved the memory problem?" — https://www.reddit.com/r/AI_Agents/comments/1r2puny/has_anyone_actually_solved_the_memory_problem_for/
[2] CrewAI — Memory — https://docs.crewai.com/concepts/memory
[3] LangGraph — Persistence — https://langchain-ai.github.io/langgraph/concepts/persistence/
[4] OpenAI Agents SDK — Handoffs — https://openai.github.io/openai-agents-python/handoffs/
[5] Cognition — Don't Build Multi-Agents — https://cognition.ai/blog/dont-build-multi-agents
[6] Anthropic — How we built our multi-agent research system — https://www.anthropic.com/engineering/built-multi-agent-research-system
[7] The Register — Vibe coding service Replit deleted production database (21/07/2025) — https://www.theregister.com/software/2025/07/21/vibe-coding-service-replit-deleted-production-database/719783
[8] Chroma Research — Context Rot (jul/2025) — https://research.trychroma.com/context-rot
[9] SWE-Marathon (arXiv 2606.07682) — https://arxiv.org/abs/2606.07682
[10] Hacker News — Agentic Coding Is a Trap — https://news.ycombinator.com/item?id=48002442
[11] Zep — Lies, Damn Lies, Statistics: Is Mem0 Really SOTA in Agent Memory? — https://blog.getzep.com/lies-damn-lies-statistics-is-mem0-really-sota-in-agent-memory/
[12] GitHub — Revisiting Zep's 84% LoCoMo claim (corrección a 58,44%) — https://github.com/getzep/zep-papers/issues/5
[13] Hacker News — AI Startup Caught Cheating on Benchmark Papers — https://news.ycombinator.com/item?id=44883133
[14] GitHub — mem0 issue #4573 — "97.8% were junk" — https://github.com/mem0ai/mem0/issues/4573
[15] r/AI_Agents — 8 memory systems, 2.176 tareas, medición independiente — https://www.reddit.com/r/AI_Agents/comments/1veeix3/i_ran_8_ai_agent_memory_systems_through_2176/
[16] ProMCP: Profiling Token Flows and Latency Costs in MCP (ACL Findings 2026) — https://aclanthology.org/2026.findings-acl.1967.pdf
[17] Anthropic — Code execution with MCP — https://www.anthropic.com/engineering/code-execution-with-mcp
[18] Mem0 — State of AI Agent Memory 2026 — https://mem0.ai/blog/state-of-ai-agent-memory-2026
[19] Zep — A Temporal Knowledge Graph Architecture for Agent Memory (arXiv 2501.13956) — https://arxiv.org/abs/2501.13956
[20] Mem0 — Building Production-Ready AI Agents (arXiv 2504.19413) — https://arxiv.org/abs/2504.19413
[21] MemOS — A Memory OS for AI System (arXiv 2507.03724) — https://arxiv.org/abs/2507.03724
[22] MemGPT — Towards LLMs as Operating Systems (arXiv 2310.08560) — https://arxiv.org/abs/2310.08560
[23] Letta — Sleep-time Compute — https://www.letta.com/blog/sleep-time-compute/
[24] Letta — Memory Blocks — https://www.letta.com/blog/memory-blocks/
[25] HippoRAG (arXiv 2405.14831) — https://arxiv.org/abs/2405.14831
[26] A-Mem: Agentic Memory (arXiv 2502.12110) — https://arxiv.org/abs/2502.12110
[27] A Survey of Persistent Memory, State, and Governance in LLM Agents (jun/2026) — https://arxiv.org/html/2606.30306v1
[28] Tamper-Evident, Replayable Evidence for Autonomous AI Agent Runs (set/2026) — https://arxiv.org/html/2609.12582v1
[29] Deletion Isn't Enough: Auditing RAG for Selective Forgetting (SIGIR 2026) — https://marksanderson.org/files/papers/SIGIR2026_Leila_Main__Copy_.pdf
[30] AI Meets Brain: Memory Systems from Cognitive Science (arXiv 2512.23343) — https://arxiv.org/html/2512.23343v1
[31] BEAM — Why BEAM Is a Good Memory Benchmark (Mem0) — https://mem0.ai/blog/why-beam-is-a-good-memory-benchmark-for-ai-agents
[32] Agent Memory Benchmark (AMB) — https://agentmemorybenchmark.ai/
[33] LoCoMo — Evaluating Very Long-Term Conversational Memory — https://snap-research.github.io/locomo/
[34] LongMemEval — https://xiaowu0162.github.io/long-mem-eval/
[35] Mastra — Observational Memory: 95% on LongMemEval — https://mastra.ai/research/observational-memory
[36] Zep — Announcing Community Edition — https://blog.getzep.com/announcing-zep-community-edition/
[37] Zep — A New Direction for Zep's Open Source Strategy — https://blog.getzep.com/announcing-a-new-direction-for-zeps-open-source-strategy/
[38] Graphiti — https://www.getzep.com/platform/graphiti/
[39] MongoDB — SSPL (2018) — https://www.mongodb.com/company/newsroom/press-releases/mongodb-issues-new-server-side-public-license-for-mongodb-community-server
[40] Redis — Dual Source-Available Licensing (2024) — https://redis.io/blog/redis-adopts-dual-source-available-licensing/
[41] Elastic — Elasticsearch Is Open Source. Again! (2024) — https://www.elastic.co/blog/elasticsearch-is-open-source-again
[42] MongoDB — Enterprise Advanced Support — https://www.mongodb.com/services/support/enterprise-advanced-support-plans
[43] CockroachDB — Upgrade Policy — https://www.cockroachlabs.com/docs/cockroachcloud/upgrade-policy
[44] OpenAI — Memory and new controls for ChatGPT — https://openai.com/index/memory-and-new-controls-for-chatgpt/
[45] Anthropic — Memory — https://www.anthropic.com/news/memory
[46] AWS — Bedrock Agents memory — https://aws.amazon.com/blogs/machine-learning/amazon-bedrock-agents-now-supports-memory/
[47] Cognee — $7,5M seed — https://www.cognee.ai/cognee-raises-seven-million-five-hundred-thousand-dollars-seed
[48] Supermemory — $2,6M (Dataconomy, oct/2025) — https://dataconomy.com/2025/10/07/young-founders-supermemory-raises-2-6m-from-cloudflare-and-google-execs/
[49] ANPD — Transferencia Internacional de Datos — https://www.gov.br/anpd/pt-br/assuntos/assuntos-internacionais/transferencia-internacional-de-dados
[50] Mayer Brown — Fin del período de gracia de la Resolución CD/ANPD 19/2024 — https://www.mayerbrown.com/pt/insights/publications/2025/08/end-of-grace-period-implementation-of-brazils-standard-contractual-clauses-in-international-transfers-of-personal-data
[51] CMN 4.893/2021 — https://www.ancord.org.br/wp-content/uploads/2021/03/Resolucao-CMN-n-4.893-de-26_2_2021.pdf
[52] PL 2338/2023 — Cámara de Diputados — https://www.camara.leg.br/proposicoesWeb/fichadetramitacao?idProposicao=2487262
[53] European Commission — AI Omnibus enters into force — https://digital-strategy.ec.europa.eu/en/news/ai-omnibus-enters-force
[54] Cross Border Data Forum — Generative AI and GDPR Enforcement in Europe — https://www.crossborderdataforum.org/generative-ai-and-gdpr-enforcement-in-europe-a-lot-of-noise-one-fine-zero-survivors/
[55] Exploring Privacy Issues in RAG (ACL Findings 2024) — https://aclanthology.org/2024.findings-acl.267.pdf
[56] Exposing Privacy Risks in Graph RAG (arXiv 2508.17222) — https://arxiv.org/pdf/2508.17222
[57] AutoGen — AgentChat Memory (documentación oficial) — https://microsoft.github.io/autogen/stable/user-guide/agentchat-user-guide/memory.html
[58] AG2 (formerly AutoGen) — GitHub — https://github.com/ag2ai/ag2
[59] MetaGPT: Meta Programming for a Multi-Agent Framework (arXiv 2308.00352) — https://arxiv.org/abs/2308.00352
[60] Model Context Protocol — Specification 2025-11-25 — https://modelcontextprotocol.io/specification/2025-11-25
[61] A2A Protocol (Linux Foundation) — https://a2a-protocol.org/latest/

Próximo paso

Menos volver a empezar. Más continuidad

Trae un proyecto real. En una conversación mapeamos dónde se pierde el contexto entre las personas y los agentes de tu equipo, y por dónde empezar.