Filtro de arquivos antes do coding agent
Reid Fletcher · @LxKus14,6 mil visualizações no X
Projeto que coloca o Jev antes do Claude para filtrar os arquivos candidatos que um coding agent vai ler. O modelo generativo passa a receber só o que é relevante, o que reduziu arquivos, tokens e custo sem perder nenhum arquivo importante. A tese do autor é que usar LLM generativo para roteamento é um erro.
O que o Jev decide aqui?
Para cada arquivo candidato, o Jev dá uma nota de relevância em relação à tarefa, e só os mais relevantes seguem para o Claude.
Qual foi o resultado?
-33% de arquivos enviados ao modelo, -25% de tokens, -23% de custo; $0.037 para pontuar 543 arquivos (0.38s por arquivo); 0 perda de recall.
Por que isso importa?
O contexto é o recurso mais caro de um coding agent. Mandar arquivo demais encarece a chamada e ainda dilui a atenção do modelo. Um filtro barato na frente resolve os dois problemas, e medir recall garante que a economia não veio às custas de esquecer um arquivo necessário.
A mesma ideia se aplica a RAG em base de conhecimento, busca em tickets de suporte ou seleção de documentos para análise jurídica. O cuidado é sempre comparar o recall com e sem o filtro num conjunto de tarefas reais antes de ligar em produção: ganho de custo com perda de qualidade não é ganho.
Post original
Reid Fletcher
@LxKus
Using generative LLMs for routing is a mistake. We put @typesafeai Jev in front of Claude to filter candidate files in @aitionapp: • -33% files to model • -25% tokens | -23% cost • $0.037 to score 543 files (0.38s/file) • 0 loss in recall