Ir al contenido

Prueba

Benchmarks, con las reservas en la misma página

Números de recuperación del motor, cada uno con su run y método declarados. Lo que los scores miden, y lo que no miden, está aquí arriba, no en el pie.

LoCoMo · recall@10 · pipeline completo

96,58%

1918/1986 preguntas · run 2026-07-29 ·0 llamadas de LLM en el ranking · ~0,84s por query en CPU

+2,1 pp sobre el líder open-source publicado (94,5% · PMB),medido en el mismo benchmark.

  • 96,58% evidence recall@10 en LoCoMo. +2,1 pp vs líder open-source publicado (94,5%)
  • 80,8% de exactitud binaria end-to-end en BEAM-100K (323/400 correctas en 20 conversaciones; reader GLM-5.3 Flash (Ox Alpha); juez GLM-5.2; effort=max; run 2026-08-23; ~44% más lenta que el effort estándar; el lector lo elige el cliente — los resultados varían con el modelo (lectores más fuertes pueden puntuar más). ValorBrain no vende llamadas de LLM: la capa de memoria es el producto)
  • Retrieval LoCoMo: ~0,84s por query en CPU · 0 llamadas de LLM en el ranking

Tabla completa por conversación

Run canónico con 1986 preguntas en 10 conversaciones. El total de la tabla es el headline de arriba; la misma cuenta, sin promedios elegidos a dedo.

Recall@10 por conversación en LoCoMo, run 2026-07-29
ConversaciónDocumentosAciertosPreguntasR@10
261919119996%
301910210597,1%
413218819397,4%
422925226096,9%
432923624297,5%
442815415897,5%
473118019094,7%
483023023996,2%
492518719695,4%
503019820497,1%
Total2721918198696,58%

BEAM-100K · respuestas end-to-end · exactitud binaria

80,8%

323/400 respuestas correctas en 20 conversaciones. A diferencia de LoCoMo: aquí el score es de la respuesta final entregada al usuario, no del fragmento recuperado.

Configuración del benchmark: reader GLM-5.3 Flash (Ox Alpha); juez GLM-5.2; effort=max; run 2026-08-23; ~44% más lenta que el effort estándar; el lector lo elige el cliente — los resultados varían con el modelo (lectores más fuertes pueden puntuar más). ValorBrain no vende llamadas de LLM: la capa de memoria es el producto

Lo que no medimos

LoCoMo mide retrieval; BEAM-100K mide respuestas end-to-end en conversaciones sintéticas. Permisos, origen y continuidad entre personas y agentes pertenecen a la capa de producto y quedan fuera de ambos scores.

Los scores cubren

  • Recuperación de evidencia en conversaciones largas (LoCoMo recall@10)
  • Respuestas end-to-end entre sesiones (exactitud binaria BEAM-100K)
  • Ranking sin llamadas de LLM en el camino de retrieval

Quedan fuera de los dos scores

  • Aislamiento multi-tenant o filtrado de permisos por rol
  • Handoffs de equipo, gaps de conocimiento o sellos de origen y veracidad
  • Fidelidad de las citas de Ask o latencia bajo carga real de tenants