LoCoMo · recall@10 · pipeline completo
96,58%
1918/1986 perguntas · run 2026-07-29 · 0 chamadas de LLM no ranking · ~0,84s por query em CPU
+2,1 pp sobre o líder open-source publicado (94,5% · PMB), medido no mesmo benchmark.
- 96,58% evidence recall@10 no LoCoMo. +2,1 pp vs líder open-source publicado (94,5%)
- 80,8% de acurácia binária end-to-end no BEAM-100K (323/400 corretas em 20 conversas; reader GLM-5.3 Flash (Ox Alpha); juiz GLM-5.2; effort=max; run 2026-08-23; ~44% mais lenta que o effort padrão; o leitor é do cliente — os resultados variam com o modelo (podem melhorar com leitores mais fortes). O ValorBrain não vende chamadas de LLM: a memória é o produto)
- Retrieval LoCoMo: ~0,84s por query em CPU · 0 chamadas de LLM no ranking
Tabela completa por conversa
Run canônico com 1986 perguntas em 10 conversas. O total da tabela é o headline acima — mesma conta, sem escolha de média.
| Conversa | Documentos | Acertos | Perguntas | R@10 |
|---|---|---|---|---|
| 26 | 19 | 191 | 199 | 96,0% |
| 30 | 19 | 102 | 105 | 97,1% |
| 41 | 32 | 188 | 193 | 97,4% |
| 42 | 29 | 252 | 260 | 96,9% |
| 43 | 29 | 236 | 242 | 97,5% |
| 44 | 28 | 154 | 158 | 97,5% |
| 47 | 31 | 180 | 190 | 94,7% |
| 48 | 30 | 230 | 239 | 96,2% |
| 49 | 25 | 187 | 196 | 95,4% |
| 50 | 30 | 198 | 204 | 97,1% |
| Total | 272 | 1918 | 1986 | 96,58% |