Uso de computador

Jev com Mercury resolve 100% de benchmark WebMCP a custo menor

Sasha Sheng · @hackgoofer71,4 mil visualizações no X

Este projeto combina o Jev com o modelo Mercury 2.5 usando WebMCP, em que o site expõe ferramentas estruturadas ao agent. Nessa configuração, o conjunto resolveu todas as tarefas de um benchmark por um custo de modelo muito menor que um modelo grande operando por uso de computador.

O que o Jev decide aqui?

O Jev escolhe qual ferramenta WebMCP o agent deve acionar a cada passo da tarefa.

Qual foi o resultado?

100% das tarefas resolvidas, com custo de modelo cerca de 112× menor que o GPT-6 Astra usando computer use.

Por que isso importa?

Quando o site expõe ações estruturadas, o agent não precisa interpretar pixels nem adivinhar onde clicar. A tarefa vira uma sequência de escolhas entre ferramentas conhecidas, que é exatamente o tipo de decisão em que um modelo de julgamento é rápido e barato.

Para quem constrói produto web, o recado é oferecer ferramentas para agents, como formulários de busca, checkout e cadastro. O cuidado é não generalizar um benchmark: resultados assim dependem de como as tarefas e as ferramentas foram definidas.

Post original

Ver post original no X

Casos parecidos

Ver todos os casos de uso