Busca e dados

Triagem de documentos da SEC e critérios de ensaio clínico

Shaun Regenbaum · @RegenbaumShaun49,5 mil visualizações no X

Um teste do Jev em dois trabalhos reais de produção: classificar comunicados 8-K de empresas de biotecnologia e checar fatos de elegibilidade em ensaios clínicos. O modelo empatou com o sistema atual num conjunto curado, errou mais em volume real e pegou boa parte dos erros plantados, acabando mantido como filtro de primeira passagem.

O que o Jev decide aqui?

O Jev classifica cada documento 8-K e aponta se um fato de elegibilidade de ensaio clínico parece errado, servindo de peneira inicial.

Qual foi o resultado?

Em 120 casos de 8-K montados à mão, igualou a produção; em 30.582 documentos reais, errou 3,9% contra 0,9% do sistema atual; nos fatos de elegibilidade, detectou 75% dos erros plantados, com muitos falsos positivos.

Por que isso importa?

Esse caso é valioso justamente por mostrar limites: desempenho bom em amostra curada não garante o mesmo em volume real. Para quem constrói produto, a lição é testar com dados de produção antes de trocar um componente que já funciona.

Como filtro de primeira passagem, um modelo rápido pode reduzir o trabalho de revisão em compliance, jurídico ou saúde, desde que haja uma segunda camada para os casos marcados. Falsos positivos custam tempo humano, então o volume sinalizado precisa caber na capacidade de revisão.

Post original

Foto de perfil de Shaun Regenbaum

Shaun Regenbaum

@RegenbaumShaun

First findings with Jev (@typesafeai's System One model) I put Jev through two real jobs from our pipeline, and found its strength's and weaknesses. Just as background for some: Jev is a different kind of model. You hand it a piece of text and a question with a fixed set of
Ver post original no X

Casos parecidos

Ver todos os casos de uso