Triagem de documentos da SEC e critérios de ensaio clínico
Shaun Regenbaum · @RegenbaumShaun49,5 mil visualizações no X
Um teste do Jev em dois trabalhos reais de produção: classificar comunicados 8-K de empresas de biotecnologia e checar fatos de elegibilidade em ensaios clínicos. O modelo empatou com o sistema atual num conjunto curado, errou mais em volume real e pegou boa parte dos erros plantados, acabando mantido como filtro de primeira passagem.
O que o Jev decide aqui?
O Jev classifica cada documento 8-K e aponta se um fato de elegibilidade de ensaio clínico parece errado, servindo de peneira inicial.
Qual foi o resultado?
Em 120 casos de 8-K montados à mão, igualou a produção; em 30.582 documentos reais, errou 3,9% contra 0,9% do sistema atual; nos fatos de elegibilidade, detectou 75% dos erros plantados, com muitos falsos positivos.
Por que isso importa?
Esse caso é valioso justamente por mostrar limites: desempenho bom em amostra curada não garante o mesmo em volume real. Para quem constrói produto, a lição é testar com dados de produção antes de trocar um componente que já funciona.
Como filtro de primeira passagem, um modelo rápido pode reduzir o trabalho de revisão em compliance, jurídico ou saúde, desde que haja uma segunda camada para os casos marcados. Falsos positivos custam tempo humano, então o volume sinalizado precisa caber na capacidade de revisão.
Post original
Shaun Regenbaum
@RegenbaumShaun
First findings with Jev (@typesafeai's System One model) I put Jev through two real jobs from our pipeline, and found its strength's and weaknesses. Just as background for some: Jev is a different kind of model. You hand it a piece of text and a question with a fixed set of