Guardrail contra prompt injection em decisões do Jev
Obie Fernandez · @obie5,3 mil visualizações no X
Dica de segurança para quem usa o Jev com entrada não confiável: adicionar às decisões uma pergunta do tipo Noul que verifica se o texto do evento tenta influenciar a própria classificação. Assim, a mesma chamada que classifica o conteúdo também sinaliza tentativas de manipulação embutidas nele, sem custo de uma etapa separada.
O que o Jev decide aqui?
O Jev responde, como Noul, se o texto recebido tenta influenciar a forma como será classificado.
Por que isso importa?
Sempre que o state inclui texto de usuários, e-mails ou páginas da web, alguém pode escrever instruções ali para manipular a decisão. Uma pergunta extra, feita na mesma chamada, custa pouco e dá um sinal explícito para o código tratar o caso.
O padrão vale para moderação, triagem de tickets, análise de currículos e qualquer fluxo que processe conteúdo externo. O cuidado é o que fazer com o sinal: em vez de apenas registrar, desvie os casos com probabilidade alta para revisão humana ou para um caminho mais conservador.