Pular para o conteúdo

Pesquisa19 de setembro de 202618 min de leitura

A pilha de memória sombra

Oito ciclos de pesquisa e mais de 900 fontes sobre memória para agentes: frameworks resolvem memória dentro do próprio perímetro, practitioners improvisam o resto, e continuidade (a coisa que faz um time de agentes não refazer trabalho) não tem dono. Benchmarks, custos ocultos, as nove lacunas não publicadas e a realidade regulatória brasileira.

Equipe ValorBrain

Quem opera agentes em produção há algum tempo provavelmente mantém, sem chamar isso de sistema, uma pilha parecida com esta: um MEMORY.md carregado no CLAUDE.md, snapshots manuais em um diretório antes de cada compaction de contexto, e uma regra tácita: sobrescrever fatos obsoletos, não duplicar, torcer para o agente ler tudo isso de novo na próxima sessão.

Ninguém vende essa pilha. Ninguém a documentou como arquitetura. Ela existe porque a pergunta que um thread no r/AI_Agents formulou sem rodeios ("alguém realmente resolveu o problema de memória?" [1]) continua sem resposta satisfatória. Nos últimos dias, rodamos oito pesquisas profundas com mais de 900 fontes coletadas e cerca de 190 citadas após validação, cobrindo o estado da arte de memória para agentes de IA: arquiteturas, benchmarks, latência e custo, os cinco players principais, o lado da demanda, esquecimento e consolidação, LGPD e o mercado brasileiro. Este artigo é a síntese. A tese cabe numa frase: o mercado vende armazenamento e chama de memória; a continuidade, a coisa que faz um time de agentes não refazer trabalho, não tem dono.

Antes do conteúdo, o método, porque acreditamos que pesquisa sem método é blog post:

  • Oito corridas de um agente de deep research (supervisor + subagentes por fonte, busca via SearXNG auto-hospedado, modelos GLM), 20 a 27 minutos cada, com validação mecânica de citações antes da entrega.
  • Curadoria humana de tudo que entra aqui. Onde a evidência não fechou (e ela não fechou em vários pontos), nós dizemos, em vez de tapar com generalidade.
  • Trabalhamos num memory engine. Essa pesquisa existiu porque precisávamos decidir o que construir e como vender. Você deve ler o texto sabendo disso; os links estão aí para você conferir cada afirmação sem nos acreditar.

Cada framework resolve memória dentro de casa

Os frameworks de agentes tiveram progresso real em 2025-2026 — dentro do próprio perímetro. O CrewAI tem memória nativa com quatro tipos (curto prazo, longo prazo, entidades, externa) compartilhada entre os agentes de um crew [2]. O LangGraph persiste estado por thread_id e oferece memória de longo prazo via store, com a camada LangMem para continuidade entre threads [3]. O OpenAI Agents SDK faz handoff entre agentes transferindo o histórico de conversa, com controle fino de quanta história passa na passagem de bastão [4].

O padrão é sempre o mesmo: a memória existe dentro do constructo do framework (o crew, o thread, a conversa). O crew do CrewAI não lê o store do LangGraph. O agente Codex não vê o estado do agente Claude. Quando buscamos nas documentações oficiais desses três frameworks qualquer ponte entre universos distintos, o resultado foi negativo em todos, e não por falta de procura: cada página define memória, nenhuma define interoperabilidade.

Duas retrospectives corporativas famosas ilustram o que acontece nesse vazio. A Cognition (empresa do Devin) publicou "Don't Build Multi-Agents" defendendo que contextos paralelos e não sincronizados levam a decisões conflitantes [5]. A Anthropic respondeu com a engenharia do próprio sistema multi-agente de pesquisa, onde a coordenação funciona, mas dentro de uma arquitetura única, desenhada por eles [6]. As duas leituras são compatíveis com a nossa conclusão: multi-agente funciona quando alguém controla a memória comum; quebra quando cada agente carrega a sua.

A pilha sombra é sintoma, não solução

Voltemos à pilha do início do texto. Ela é o que a comunidade faz porque o produto não existe. Os practitioners documentam o regime abertamente: arquivos de memória acumulados, snapshots manuais, regras de sobrescrita mantidas a mão [1]. O que essa pilha não tem é tudo que a torna sistema: deduplicação de entidades entre memórias de agentes diferentes, arbitragem quando dois membros do time acreditam coisas contraditórias, serialização de handoff que sobreviva à troca de framework, governança de quem escreve o quê.

O custo de não ter isso já tem caso célebre. Em 21 de julho de 2025, o agente do Replit deletou o banco de produção de uma empresa durante uma mudança descrita como congelada, fabricou dados para disfarçar as falhas e reportou sucesso [7]. O episódio é geralmente contado como história de "agente descontrolado". Nossa leitura é outra: é a materialização mais grave já documentada da divergência entre o que o agente acredita e o que o humano sabe — exatamente a ausência de sincronização entre estado do time de agentes e estado real que a pilha sombra finge resolver.

Há mais evidência de que a dor cresce com a escala temporal. A Chroma mediu e nomeou o fenômeno, context rot: a qualidade de leitura do modelo degrada com o tamanho do contexto, então "jogar tudo no prompt" não é continuidade, é adiamento [8]. Em horizontes ultralongos, o SWE-Marathon (junho de 2026) cataloga centenas de modos de falha de agentes em tarefas de longa duração [9]. E o thread "Agentic Coding Is a Trap" no Hacker News documenta o retrabalho acumulado como modo de falha estrutural, não acidental [10].

O circo dos números

Se a engenharia da continuidade é o buraco, os benchmarks são o picadeiro. O episódio mais instrutivo da categoria veio da própria Zep: em janeiro de 2025 o paper deles sobre knowledge graphs temporais contestou o SOTA da Mem0 no LoCoMo, mostrando que um baseline de contexto completo (passar a conversa inteira pro modelo, sem engine nenhum) supera a maioria dos sistemas comercializados (~73% contra ~68% de J-score) e que trocar apenas o modelo do juiz move até ~10 pontos no placar [11]. Depois veio a revanche: uma issue pública reabriu o claim de 84% da própria Zep e o corrigiu para 58,44% sob avaliação corrigida [12]. Em paralelo, o Hacker News circulou a denúncia "AI Startup Caught Cheating on Benchmark Papers" [13]. Ninguém saiu limpo dessa história; todos saíram com marketing.

A lição não é "benchmarks são inúteis". É que os números de vendor são o começo da conversa, nunca o fim. O LoCoMo tem limitações conhecidas [33], o LongMemEval tenta corrigi-las [34], o BEAM nasceu para escalar onde o valor da memória fica mensurável [31][32], e a Mastra mostrou um caminho arquitetural diferente com 95% no LongMemEval [35], mas cada resultado vem com o harness de quem publicou. Quem compra deveria perguntar sempre: quem rodou, com qual juiz, comparado com o quê.

O mesmo vale para custo. Medição independente de oito sistemas de memória em 2.176 tarefas chegou a números muito acima do que as pricing pages sugerem (na casa de US$ 341 por 1.000 respostas [15]), porque o custo real de memória inclui o LLM que extrai memórias, o embedding de cada fato, e o chamado BYOK que transfere a conta para o cliente sem transferir a previsibilidade. E há o silêncio: Letta, supermemory, MemOS, LangGraph e as soluções pgvector não publicam latência alguma. O overhead de MCP de memória começou a ser medido academicamente apenas em 2026 [16][17]. Em infraestrutura, o que não é publicado costuma ser o número que o mercado não quer que você veja.

Uma nota à parte, porque ela conecta custo com qualidade: um issue aberto no repositório da Mem0 relata que 97,8% das memórias ingeridas eram lixo [14]. Memória que só acumula não é ativo, é passivo com juros (o tema da seção adiante sobre consolidação).

A academia já formalizou; o mercado não comercializou

Enquanto o marketing briga no picadeiro, 2026 foi o ano em que a pesquisa acadêmica formalizou exatamente os problemas que os produtos ignoram. Um survey de junho dedicado a "memória persistente, estado e governança em agentes LLM" legitimou o campo como disciplina [27]. Um paper de setembro sobre tamper-evidence para execuções de agentes apareceu, mas mira runs, não o armazenamento de memória em si [28]. O SIGIR 2026 demonstrou o problema que mais nos interessa aqui: apagar o dado do armazenamento não apaga sua influência a jusante — o "esquecimento incompleto" que torna direito de eliminação e memória persistente uma tensão estrutural [29].

Nos produtos, o mecanismo mais sofisticado que encontramos em fonte primária é a invalidação temporal de arestas do Graphiti, no paper da Zep: fatos ganham janela de validade, o novo invalida o antigo [19]. É bi-temporalidade de verdade, e é temporal apenas. Não há noção de autoridade de fonte (um humano pode contradizer um agente? um import pode contradizer um humano?), nem curadoria automática de lições de erro do time, nem trilha auditável de quem mudou o quê. Survey de memória inspirado em ciência cognitiva mapeia o que a teoria sugere (consolidação, replay, interleaving [30]) e a Letta até implementou algo próximo com sleep-time compute [23], mas são exceções isoladas num mercado que ainda disputa quem extrai mais fatos de um chat.

O padrão dominante do segmento, aliás, é conhecido: núcleo Apache 2.0 com escopo de biblioteca, cloud pago, e nenhum produto self-hosted completo e gratuito. O caso mais instrutivo é a Zep de novo: foi o único player com Community Edition self-hosted completa, e a descontinuou: deprecada em abril de 2025, com novas remoções em fevereiro de 2026; restou o framework Graphiti como open source [36][37][38]. As licenças defensivas do mercado de infraestrutura contam a mesma história em ciclos: MongoDB para SSPL em 2018 [39], Redis sai do BSD em 2024 (nasce o fork Valkey) e reverte para AGPL em 2025 [40], Elastic abandona o open source em 2021 (nasce o OpenSearch) e o re-adota em 2024 [41]. Source-available compra tempo, gera fork, e o mercado converge de volta. Para quem decide como vender self-hosted hoje, o histórico aponta: é tier pago com suporte (onde o que se vende é SLA de resposta, nunca uptime) ou não é.

O comprador, e o Brasil

Do lado da demanda, a categoria é jovem e já produziu rodadas relevantes: Cognee levantou US$ 7,5M de seed [47], Supermemory US$ 2,6M com Cloudflare e executivos do Google no captable [48]. Sem contar os gigantes embutindo memória na plataforma, que é o movimento mais ameaçador: OpenAI com memória no ChatGPT [44], Anthropic com memory no Claude [45], Bedrock com memória para agentes [46]. Quando o memory layer vira feature do provedor do modelo, o vendor independente precisa vender o que a plataforma não pode: continuidade entre modelos e frameworks, e governança sobre dados que atravessam fronteira de tenant.

No Brasil, vale corrigir um pitch que virou mantra: a LGPD não exige dados locais. A transferência internacional é legítima via cláusulas-padrão da Resolução CD/ANPD nº 19/2024, com o período de graça encerrado em agosto de 2025 [49][50]; a CMN 4.893 exige governança de risco cibernético, não on-premises [51]. O PL 2338/2023 segue travado na Câmara [52] e o AI Act europeu foi adiado pelo omnibus [53]. O argumento de venda correto para enterprise brasileira é salvaguarda contratual e arquitetura verificável, não "on-prem porque LGPD". O enforcement chega mesmo sem lei de IA: o GDPR europeu já produziu fiscalização contra memória de chatbots [54], e os riscos técnicos estão documentados (recuperação semântica devolvendo dados que "foram apagados" [55][56]).

As nove lacunas que ninguém publicou

O inventário abaixo vem da pesquisa de continuidade, e cada item foi verificado por ausência com o local de busca registrado. Nenhum framework ou produto comercial documentou resolver:

  1. Memória compartilhada nativa entre frameworks distintos — a ponte entre o crew do CrewAI, o store do LangGraph e o handoff do OpenAI SDK não existe em documentação oficial de nenhum dos três [2][3][4][1].
  2. Identidade e deduplicação de entidades entre memórias de agentes diferentes — hoje é regra manual do practitioner [1].
  3. Arbitragem de contradições entre crenças do time — contradições aparecem só como diagnóstico de falha nas retrospectives [5][6].
  4. Detecção de trabalho duplicado entre agentes de frameworks diferentes [10].
  5. Serialização universal de handoff — o único contrato documentado é histórico de conversa filtrável [4]; formatos reais em produção são markdown ad hoc [1].
  6. Memória de lições e erros do time com curadoria automática — existe versão manual e individual, nada de time [1].
  7. Sincronização do estado humano (Slack, Jira, PRs, aprovações) com a memória do time — a ausência que o incidente Replit transformou em manchete [7][8].
  8. Briefing de retorno para humanos ausentes — nada além de snapshots manuais [1].
  9. Governança de memória — quem escreve, quem apaga, escopo por projeto; na pilha sombra, inexistente por construção [1].

Depois que este texto foi escrito, voltamos e verificamos esses cinco nomes com fonte primária. O resultado reforçou o diagnóstico: nenhum dos cinco mecanismos examinados (AutoGen, AG2, MetaGPT, MCP, A2A) oferece memória de equipe persistente entre execuções e interoperável entre frameworks como primitiva de primeira classe: no AutoGen a memória é por agente com persistência delegada a integração; no MetaGPT o pool morre com o run; e o MCP (spec estável 2025-11-25) e o A2A (hoje projeto da Linux Foundation, versão 1.0.0, mantido por comitê com AWS, Cisco, Google, IBM, Microsoft, Salesforce, SAP e ServiceNow) deixam estado compartilhado fora do escopo por decisão de desenho [57][58][59][60][61].

O que seria resolver de verdade

Some as seções e o spec aparece sozinho. Um sistema de memória para times de agentes (agentes heterogêneos, de frameworks diferentes, trabalhando com humanos em trabalhos de semanas) precisaria de: memória acessível por protocolo e não por acoplamento a framework; identidade de entidades e deduplicação entre escritores; arbitragem de contradição com hierarquia de autoridade explícita; handoff serializado que sobreviva à troca de ferramenta; curadoria automática de lições com esquecimento consciente do custo de manter memória morta; sincronização com o estado humano onde ele vive; briefing de retorno legível por pessoa; e trilha auditável de provenance em cada fato.

Nós escrevemos essa lista como resultado de pesquisa. Ela também descreve, item por item, o que passamos os últimos meses construindo. Rodamos as oito pesquisas justamente para descobrir se o que estávamos construindo tinha mercado que o confirmasse ou refutasse. As fontes confirmaram o buraco. Se você discorda de algum ponto, os links estão aqui embaixo: é para isso que eles existem.


Referências

Acessadas e validadas em 19/09/2026. O conjunto completo de fontes coletadas (900+) está no nosso brain; abaixo, as citadas no texto.

[1] r/AI_Agents — "Has anyone actually solved the memory problem?" — https://www.reddit.com/r/AI_Agents/comments/1r2puny/has_anyone_actually_solved_the_memory_problem_for/
[2] CrewAI — Memory — https://docs.crewai.com/concepts/memory
[3] LangGraph — Persistence — https://langchain-ai.github.io/langgraph/concepts/persistence/
[4] OpenAI Agents SDK — Handoffs — https://openai.github.io/openai-agents-python/handoffs/
[5] Cognition — Don't Build Multi-Agents — https://cognition.ai/blog/dont-build-multi-agents
[6] Anthropic — How we built our multi-agent research system — https://www.anthropic.com/engineering/built-multi-agent-research-system
[7] The Register — Vibe coding service Replit deleted production database (21/07/2025) — https://www.theregister.com/software/2025/07/21/vibe-coding-service-replit-deleted-production-database/719783
[8] Chroma Research — Context Rot (jul/2025) — https://research.trychroma.com/context-rot
[9] SWE-Marathon (arXiv 2606.07682) — https://arxiv.org/abs/2606.07682
[10] Hacker News — Agentic Coding Is a Trap — https://news.ycombinator.com/item?id=48002442
[11] Zep — Lies, Damn Lies, Statistics: Is Mem0 Really SOTA in Agent Memory? — https://blog.getzep.com/lies-damn-lies-statistics-is-mem0-really-sota-in-agent-memory/
[12] GitHub — Revisiting Zep's 84% LoCoMo claim (correção para 58,44%) — https://github.com/getzep/zep-papers/issues/5
[13] Hacker News — AI Startup Caught Cheating on Benchmark Papers — https://news.ycombinator.com/item?id=44883133
[14] GitHub — mem0 issue #4573 — "97.8% were junk" — https://github.com/mem0ai/mem0/issues/4573
[15] r/AI_Agents — 8 memory systems, 2.176 tarefas, medição independente — https://www.reddit.com/r/AI_Agents/comments/1veeix3/i_ran_8_ai_agent_memory_systems_through_2176/
[16] ProMCP: Profiling Token Flows and Latency Costs in MCP (ACL Findings 2026) — https://aclanthology.org/2026.findings-acl.1967.pdf
[17] Anthropic — Code execution with MCP — https://www.anthropic.com/engineering/code-execution-with-mcp
[18] Mem0 — State of AI Agent Memory 2026 — https://mem0.ai/blog/state-of-ai-agent-memory-2026
[19] Zep — A Temporal Knowledge Graph Architecture for Agent Memory (arXiv 2501.13956) — https://arxiv.org/abs/2501.13956
[20] Mem0 — Building Production-Ready AI Agents (arXiv 2504.19413) — https://arxiv.org/abs/2504.19413
[21] MemOS — A Memory OS for AI System (arXiv 2507.03724) — https://arxiv.org/abs/2507.03724
[22] MemGPT — Towards LLMs as Operating Systems (arXiv 2310.08560) — https://arxiv.org/abs/2310.08560
[23] Letta — Sleep-time Compute — https://www.letta.com/blog/sleep-time-compute/
[24] Letta — Memory Blocks — https://www.letta.com/blog/memory-blocks/
[25] HippoRAG (arXiv 2405.14831) — https://arxiv.org/abs/2405.14831
[26] A-Mem: Agentic Memory (arXiv 2502.12110) — https://arxiv.org/abs/2502.12110
[27] A Survey of Persistent Memory, State, and Governance in LLM Agents (jun/2026) — https://arxiv.org/html/2606.30306v1
[28] Tamper-Evident, Replayable Evidence for Autonomous AI Agent Runs (set/2026) — https://arxiv.org/html/2609.12582v1
[29] Deletion Isn't Enough: Auditing RAG for Selective Forgetting (SIGIR 2026) — https://marksanderson.org/files/papers/SIGIR2026_Leila_Main__Copy_.pdf
[30] AI Meets Brain: Memory Systems from Cognitive Science (arXiv 2512.23343) — https://arxiv.org/html/2512.23343v1
[31] BEAM — Why BEAM Is a Good Memory Benchmark (Mem0) — https://mem0.ai/blog/why-beam-is-a-good-memory-benchmark-for-ai-agents
[32] Agent Memory Benchmark (AMB) — https://agentmemorybenchmark.ai/
[33] LoCoMo — Evaluating Very Long-Term Conversational Memory — https://snap-research.github.io/locomo/
[34] LongMemEval — https://xiaowu0162.github.io/long-mem-eval/
[35] Mastra — Observational Memory: 95% on LongMemEval — https://mastra.ai/research/observational-memory
[36] Zep — Announcing Community Edition — https://blog.getzep.com/announcing-zep-community-edition/
[37] Zep — A New Direction for Zep's Open Source Strategy — https://blog.getzep.com/announcing-a-new-direction-for-zeps-open-source-strategy/
[38] Graphiti — https://www.getzep.com/platform/graphiti/
[39] MongoDB — SSPL (2018) — https://www.mongodb.com/company/newsroom/press-releases/mongodb-issues-new-server-side-public-license-for-mongodb-community-server
[40] Redis — Dual Source-Available Licensing (2024) — https://redis.io/blog/redis-adopts-dual-source-available-licensing/
[41] Elastic — Elasticsearch Is Open Source. Again! (2024) — https://www.elastic.co/blog/elasticsearch-is-open-source-again
[42] MongoDB — Enterprise Advanced Support — https://www.mongodb.com/services/support/enterprise-advanced-support-plans
[43] CockroachDB — Upgrade Policy — https://www.cockroachlabs.com/docs/cockroachcloud/upgrade-policy
[44] OpenAI — Memory and new controls for ChatGPT — https://openai.com/index/memory-and-new-controls-for-chatgpt/
[45] Anthropic — Memory — https://www.anthropic.com/news/memory
[46] AWS — Bedrock Agents memory — https://aws.amazon.com/blogs/machine-learning/amazon-bedrock-agents-now-supports-memory/
[47] Cognee — $7,5M seed — https://www.cognee.ai/cognee-raises-seven-million-five-hundred-thousand-dollars-seed
[48] Supermemory — $2,6M (Dataconomy, out/2025) — https://dataconomy.com/2025/10/07/young-founders-supermemory-raises-2-6m-from-cloudflare-and-google-execs/
[49] ANPD — Transferência Internacional de Dados — https://www.gov.br/anpd/pt-br/assuntos/assuntos-internacionais/transferencia-internacional-de-dados
[50] Mayer Brown — Fim do período de graça da Resolução CD/ANPD 19/2024 — https://www.mayerbrown.com/pt/insights/publications/2025/08/end-of-grace-period-implementation-of-brazils-standard-contractual-clauses-in-international-transfers-of-personal-data
[51] CMN 4.893/2021 — https://www.ancord.org.br/wp-content/uploads/2021/03/Resolucao-CMN-n-4.893-de-26_2_2021.pdf
[52] PL 2338/2023 — Câmara dos Deputados — https://www.camara.leg.br/proposicoesWeb/fichadetramitacao?idProposicao=2487262
[53] European Commission — AI Omnibus enters into force — https://digital-strategy.ec.europa.eu/en/news/ai-omnibus-enters-force
[54] Cross Border Data Forum — Generative AI and GDPR Enforcement in Europe — https://www.crossborderdataforum.org/generative-ai-and-gdpr-enforcement-in-europe-a-lot-of-noise-one-fine-zero-survivors/
[55] Exploring Privacy Issues in RAG (ACL Findings 2024) — https://aclanthology.org/2024.findings-acl.267.pdf
[56] Exposing Privacy Risks in Graph RAG (arXiv 2508.17222) — https://arxiv.org/pdf/2508.17222
[57] AutoGen — AgentChat Memory (documentação oficial) — https://microsoft.github.io/autogen/stable/user-guide/agentchat-user-guide/memory.html
[58] AG2 (formerly AutoGen) — GitHub — https://github.com/ag2ai/ag2
[59] MetaGPT: Meta Programming for a Multi-Agent Framework (arXiv 2308.00352) — https://arxiv.org/abs/2308.00352
[60] Model Context Protocol — Specification 2025-11-25 — https://modelcontextprotocol.io/specification/2025-11-25
[61] A2A Protocol (Linux Foundation) — https://a2a-protocol.org/latest/

Próximo passo

Menos recomeço. Mais continuidade

Leve um projeto real. Em uma conversa, mapeamos onde o contexto se perde entre as pessoas e os agentes do seu time — e por onde começar.