Workers AI permite chamar modelos de IA a partir de Workers sem administrar GPU, autoscaling ou endpoint próprio de inferência. Ele é útil quando a IA faz parte de uma etapa clara do produto: classificar uma conversa, sugerir resposta, gerar tags, criar embedding ou resumir um conteúdo. Ele não resolve sozinho qualidade de prompt, privacidade ou custo.
No nosso runtime, o binding AI atende triagem, sugestão de resposta, auto-tag e recursos de IA em rotas Meta. A arquitetura mantém o modelo perto do Worker, mas continua exigindo limite diário, validação do usuário e observabilidade do resultado.
Quando Workers AI faz sentido
| Necessidade | Workers AI encaixa? | Observação |
|---|---|---|
| classificar intenção ou sentimento | sim | comece com saída estruturada e avaliação |
| sugerir resposta para atendimento | sim | rascunho humano antes de enviar |
| gerar tags e resumo | sim | barato quando o contexto é limitado |
| RAG sobre base própria | parcialmente | combine embeddings, busca e fonte citável |
| agente que opera ferramentas críticas | não sozinho | precisa de política, aprovação e integração segura |
| modelo proprietário específico | depende | compare catálogo, API externa e AI Gateway |
Escolha o modelo pelo trabalho, não pelo tamanho
Um modelo grande pode ser desnecessário para classificar uma mensagem em cinco categorias. Um modelo menor pode errar uma resposta que exige contexto comercial e tom de marca. Defina primeiro um conjunto de exemplos e uma métrica: taxa de aceitação do rascunho, erro de classificação, custo por mil tarefas e latência percebida.
Para geração de texto, a documentação lista modelos como Llama, Mistral, Qwen e GPT-OSS no catálogo. Para embeddings, use um modelo compatível com o idioma e a dimensão da sua busca. Não copie nomes de modelo para produção sem verificar disponibilidade e preço atuais.
Custo: neurons e unidades por modelo
Workers AI inclui 10 mil neurons por dia em Free e Paid. Acima disso, Workers Paid cobra US$ 0,011 por mil neurons. A própria documentação também apresenta equivalentes por token e por modelo; por exemplo, a família Llama 3.3 70B tem custo por milhão de tokens muito maior que um modelo pequeno. A tabela muda com o catálogo, então o artigo e o produto devem apontar para a fonte oficial, não congelar uma estimativa em código.
O jeito saudável de controlar custo é colocar limite por usuário, caso de uso e período. No nosso caso, ferramentas públicas têm teto diário e o binding de IA não é exposto como uma API livre. Registre modelo, tokens/neurons quando disponíveis, latência, decisão humana e erro — sem guardar dado pessoal bruto desnecessariamente.
Exemplo: triagem de mensagens sem automatizar o atendimento
- Uma mensagem chega pelo canal oficial e é armazenada segundo a política do produto.
- O Worker envia apenas o texto necessário a um modelo de triagem.
- O resultado passa por Zod ou schema equivalente:
categoria,urgencia,confiancaemotivo curto. - A interface mostra sugestão para a pessoa responsável.
- Só uma ação humana ou uma regra aprovada envia mensagem externa.
Esse fluxo é mais útil que um “bot autônomo” abstrato: reduz trabalho repetitivo, preserva controle e gera dados para avaliar se a automação merece crescer.
Workers AI vs API externa vs modelo próprio
| Caminho | Vantagem | Trade-off |
|---|---|---|
| Workers AI | binding simples, operação serverless e catálogo integrado | catálogo e região dependem da plataforma |
| API de modelo externo | variedade e recursos específicos | outra credencial, egress lógico e observabilidade separada |
| modelo próprio em GPU | controle total | alto custo e operação complexa |
| AI Gateway | governança/caching entre provedores | não substitui o provedor de inferência |
[ CONTEÚDO_INTEGRAL_DISPONÍVEL ]
Continuar: entregue imagens e capas sem gerar múltiplas cópias CLIQUE PARA DESBLOQUEAR A LEITURA
Construindo aplicações robustas com arquitetura de alto nível e infraestrutura otimizada na edge do Cloudflare Workers com SurrealDB.
Segurança de dados e conformidade com privacidade desde o primeiro dia de código com tratamento de estados e sessões resilientes.
Métricas de performance para monitorar a experiência do usuário e otimizar custos operacionais em produção com dashboards estruturados.
Construindo aplicações robustas com arquitetura de alto nível e infraestrutura otimizada na edge do Cloudflare Workers com SurrealDB.
Segurança de dados e conformidade com privacidade desde o primeiro dia de código com tratamento de estados e sessões resilientes.
Métricas de performance para monitorar a experiência do usuário e otimizar custos operacionais em produção com dashboards estruturados.
Prós, riscos e LGPD
Workers AI reduz infraestrutura de inferência e integra bem com Workers. Em compensação, prompts ruins, entrada não confiável e ausência de avaliação continuam sendo falhas da aplicação. Para dados de clientes, minimize contexto, evite enviar identificadores desnecessários, documente finalidade e não use a resposta do modelo como única decisão de alto impacto.
Checklist de produção
- tarefa tem métrica e exemplos de avaliação;
- prompt recebe somente dados necessários;
- saída é validada com schema;
- usuário e uso têm limite de custo;
- falha do modelo tem fallback claro;
- ações externas exigem aprovação;
- modelo e preço são revisados antes de trocar versão.
Perguntas frequentes
Workers AI é gratuito?
Há 10 mil neurons por dia incluídos. Para exceder a franquia, é necessário Workers Paid e há cobrança por neurons consumidos.
Posso usar IA para responder WhatsApp automaticamente?
Tecnicamente, pode integrar etapas. Produto e segurança devem definir quem recebe a mensagem, qual canal é autorizado, quando há revisão e como a resposta respeita a política do provedor.
RAG é só chamar um modelo com um PDF?
Não. Um RAG confiável exige extração, embeddings, busca, filtros de permissão, fontes citáveis e avaliação de resposta.



