Ir al contenido

Investigación4 de agosto de 20268 min de lectura

La Calidad de la Memoria Vale Más Que el Lector: Evidencia del BEAM-100K

Cómo la ingeniería de memoria reader-agnostic cerró una brecha de 22 puntos en el BEAM con GLM-5.2, un modelo open-weights que puntúa más alto en benchmarks de inteligencia agentic que el Gemini 3.1 Pro.

Equipo ValorBrain

ValorBrain puntúa 70,9% en BEAM-100K (20 conversaciones, 400 preguntas) usando GLM-5.2 como modelo de respuesta y Gemini 3.6 Flash como juez. Está a 2,5 puntos del Hindsight, que hace 73,4% (single-query, Gemini 3.1 Pro), y ValorBrain gana en 5 de las 10 categorías de habilidad de memoria, incluyendo una ventaja de 24 puntos en Extracción de Información.

58% de nuestra mejora total vino de ingeniería de memoria reader-agnostic. Consolidación, línea de tiempo y mejoras de entrega que benefician a cualquier LLM. El cambio de lector contribuyó con el 42%. Para sistemas de producción donde los usuarios traen su propio LLM, la calidad de memoria importa más que la calidad del lector.


Resultados

SistemaPuntuaciónPreguntasLLM de RespuestaLLM Juez
ValorBrain70,9%400 (20 conv)GLM-5.2Gemini 3.6 Flash
ValorBrain (inicial)55,9%100 (5 conv)deepseek-v4-flashdeepseek-v4-flash
Hindsight (single-query)73,4%400Gemini 3.1 ProGemini 2.5 Flash Lite
Hindsight (RAG)86,2%400Gemini 3.1 ProGemini 3.5 Flash

Por Categoría vs Hindsight

CategoríaValorBrainHindsight (sq)Diferencia
Extracción de Información88,9%64,9%+24,0
Razonamiento Temporal71,9%57,5%+14,4
Actualización de Conocimiento70,6%58,8%+11,8
Razonamiento Multi-sesión57,2%47,4%+9,8
Resolución de Contradicción67,2%61,6%+5,6
Seguir Preferencias91,0%95,0%-4,0
Seguir Instrucciones83,8%91,2%-7,5
Sumarización64,5%79,3%-14,8
Orden de Eventos46,4%80,5%-34,1
Abstención67,5%97,5%-30,0

ValorBrain gana en 5 de las 10 categorías. Las pérdidas están concentradas en Abstención (-30,0, una distinción semántica del lado del lector) y Orden de Eventos (-34,1, donde la estructura cronológica necesita más trabajo).


La Descomposición: Memoria vs Lector

MejoraTipoPuntosParticipación
Consolidación en delivered_documentsMemoria+10,145%
Consolidación rica (conteos, 4K tokens) + Línea de tiempoMemoria+3,616%
GLM-5.2 + max_tokens 8192Lector + infra+7,332%
Varianza de ejecución—+1,57%
Total+22,5

58% de la mejora es reader-agnostic. La ingeniería de memoria contribuye más que el cambio de lector.


Por Qué Funciona la Consolidación

La mayor mejora individual (+10,1 puntos) vino de incluir hechos pre-sintetizados de la conversación como un documento sintético en la salida de recuperación. En vez de forzar al LLM a extraer hechos específicos de ventanas de conversación dispersas, la consolidación los entrega pre-extraídos.

Esto es reader-agnostic por diseño. La consolidación se genera offline y se almacena. Cualquier LLM de respuesta recibe los mismos hechos pre-sintetizados. La mejora se transfiere entre lectores porque reduce el trabajo de extracción, no porque dependa de razonamiento específico del lector.

El impacto fue más visible en Sumarización (0,8% a 64,5%) y Razonamiento Multi-sesión (32,5% a 57,2%). Ambos exigen agregar hechos dispersos por muchos turnos. La consolidación hace ese trabajo por adelantado.


GLM-5.2 vs Gemini 3.1 Pro

GLM-5.2 puntúa más alto que Gemini 3.1 Pro en el Artificial Analysis Intelligence Index (51 vs 46), con fuerza particular en tareas agentic. GLM-5.2 cuesta la mitad ($0,86 vs $1,74 por 1M tokens), es más rápido (187 vs 131 tokens/s) y es open-weights.

GLM-5.2 no es un compromiso en calidad de lector. Puntúa más alto en inteligencia, cuesta la mitad y es open-weights.


Un Endpoint, Cualquier Consumidor

ValorBrain expone recuperación a través de un único endpoint /api/v1/memory/prepare que devuelve delivered_documents: chunks limpios y agnósticos al consumidor. El mismo endpoint sirve a nuestro agente de producción, al benchmark AMB y a cualquier cliente externo.

No existe modo benchmark versus modo producción. La calidad de memoria medida por el benchmark es la calidad de memoria entregada a los usuarios.


Limitaciones

  • Los resultados reflejan el conjunto completo de 20 conversaciones del BEAM-100K. Escalas mayores (1M, 10M) están pendientes.
  • Solo GLM-5.2 y deepseek-v4-flash fueron probados como LLMs de respuesta. Resultados con Claude o GPT-4o pueden diferir. Las mejoras reader-agnostic deberían transferir.
  • Abstención: la verificación léxica de disponibilidad que implementamos no cubre los casos sutiles de abstención del BEAM (el tópico existe, el detalle no). Eso necesita razonamiento semántico más allá de lo que un sistema de memoria puede proveer sin el lector.
  • Orden de Eventos: la entrega de la línea de tiempo mejoró los resultados pero todavía queda detrás del Hindsight. Un documento estructurado de secuencia de eventos (no solo hechos ordenados) puede cerrar la brecha.
  • Varianza del juez: el juez LLM del BEAM introduce varianza de puntuación. Las comparaciones entre implementaciones deben considerar modelos juez diferentes.

Conclusión

ValorBrain puntúa 70,9% en BEAM-100K usando GLM-5.2, competitivo con el 73,4% del Hindsight (Gemini 3.1 Pro), y gana en 5 de las 10 categorías de habilidad de memoria. La ingeniería de memoria reader-agnostic contribuyó con el 58% de la mejora total.

Para una plataforma de memoria multi-tenant donde los usuarios traen su propio LLM, la implicación es práctica. Invertir en ingeniería de memoria (consolidación, línea de tiempo, entrega estructurada) beneficia a todo usuario independientemente del LLM que elija. Invertir en un lector más fuerte beneficia solo a ese lector.


Reproduciendo

Los resultados son reproducibles vía el Agent Memory Benchmark con el provider ValorBrain. Crea una cuenta ValorBrain en valorbrain.valor.digital para obtener una clave de API.


Referencias

  1. Tavakoli et al. (2025). "Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs." ICLR 2026.
  2. Vectorize/Hindsight. "Agent Memory Benchmark (AMB)." https://github.com/vectorize-io/agent-memory-benchmark
  3. Artificial Analysis. "GLM-5.2 vs Gemini 3.1 Pro Preview." https://artificialanalysis.ai/models/comparisons/glm-5-2-vs-gemini-3-1-pro-preview

Próximo paso

Menos volver a empezar. Más continuidad

Trae un proyecto real. En una conversación mapeamos dónde se pierde el contexto entre las personas y los agentes de tu equipo, y por dónde empezar.