Pular para o conteúdo

Prova

Benchmarks, com as ressalvas na mesma página

Números de recuperação do engine, cada um com run e método declarado. O que os scores medem — e o que não medem — está aqui em cima, não no rodapé.

LoCoMo · recall@10 · pipeline completo

96,58%

1918/1986 perguntas · run 2026-07-29 · 0 chamadas de LLM no ranking · ~0,84s por query em CPU

+2,1 pp sobre o líder open-source publicado (94,5% · PMB), medido no mesmo benchmark.

  • 96,58% evidence recall@10 no LoCoMo. +2,1 pp vs líder open-source publicado (94,5%)
  • 80,8% de acurácia binária end-to-end no BEAM-100K (323/400 corretas em 20 conversas; reader GLM-5.3 Flash (Ox Alpha); juiz GLM-5.2; effort=max; run 2026-08-23; ~44% mais lenta que o effort padrão; o leitor é do cliente — os resultados variam com o modelo (podem melhorar com leitores mais fortes). O ValorBrain não vende chamadas de LLM: a memória é o produto)
  • Retrieval LoCoMo: ~0,84s por query em CPU · 0 chamadas de LLM no ranking

Tabela completa por conversa

Run canônico com 1986 perguntas em 10 conversas. O total da tabela é o headline acima — mesma conta, sem escolha de média.

Recall@10 por conversa no LoCoMo, run 2026-07-29
ConversaDocumentosAcertosPerguntasR@10
261919119996,0%
301910210597,1%
413218819397,4%
422925226096,9%
432923624297,5%
442815415897,5%
473118019094,7%
483023023996,2%
492518719695,4%
503019820497,1%
Total2721918198696,58%

BEAM-100K · respostas end-to-end · acurácia binária

80,8%

323/400 perguntas corretas em 20 conversas. Diferente do LoCoMo: aqui o score é da resposta final entregue ao usuário, não do trecho recuperado.

Configuração do benchmark: reader GLM-5.3 Flash (Ox Alpha); juiz GLM-5.2; effort=max; run 2026-08-23; ~44% mais lenta que o effort padrão; o leitor é do cliente — os resultados variam com o modelo (podem melhorar com leitores mais fortes). O ValorBrain não vende chamadas de LLM: a memória é o produto

O que não medimos

LoCoMo mede retrieval; BEAM-100K mede respostas end-to-end em conversas sintéticas. Permissão, origem e continuidade entre pessoas e agentes pertencem à camada de produto e ficam fora dos dois scores.

Os scores cobrem

  • Recuperação de evidência em conversas longas (LoCoMo recall@10)
  • Respostas end-to-end entre sessões (acurácia binária BEAM-100K)
  • Ranking sem chamada de LLM no caminho de retrieval

Ficam fora dos dois scores

  • Isolamento multi-tenant ou filtragem de permissão por papel
  • Handoffs de equipe, gaps de conhecimento ou selos de origem e veracidade
  • Fidelidade das citações do Ask ou latência sob carga real de tenants