Recuperação de memória de agente mais rápida e econômica
Moritz Kremb · @moritzkremb32,4 mil visualizações no X
Um sistema de memória próprio para agentes foi ajustado com o Jev na etapa de recuperação, decidindo quais lembranças são relevantes para o momento. Num teste rápido, o autor relatou queda grande no consumo de tokens e recuperação mais veloz, e vê no resultado espaço para outras aplicações.
O que o Jev decide aqui?
O Jev avalia quais memórias armazenadas são relevantes para a situação atual antes de enviá-las ao agente.
Qual foi o resultado?
94% menos tokens e recuperação de memória 2 a 3 vezes mais rápida, em teste rápido.
Por que isso importa?
Memória de agente tende a inchar o contexto: tudo parece potencialmente útil e acaba enviado ao modelo principal. Um filtro de relevância barato antes dessa etapa reduz custo e melhora o foco das respostas.
O padrão vale para assistentes de atendimento com histórico do cliente, copilotos internos e qualquer RAG com muitos documentos. Como o próprio autor chama de teste rápido, o cuidado é medir se a qualidade das respostas se mantém ao cortar tanto contexto.
Post original
Moritz Kremb
@moritzkremb
This is cool. I used Jev to improve my custom memory system. Results: → 94% fewer tokens used → 2–3× faster memory retrieval This was just a quick test, but I believe it opens up so many new opportunities.