# Cloudflare Workers AI: como usar IA com custo, limite e controle
> Entenda quando Workers AI faz sentido, como escolher modelo, controlar neurons, proteger dados e transformar IA em uma etapa segura do produto.
**Autores:** Mauro Mequelussi
**Publicado:** 2026-07-27T12:00:00.000Z
**Atualizado:** 2026-07-27T12:00:29.863185219Z
**Tags:** agentes-de-ia, workers-ai, custos, ia, cloudflare
---
Workers AI permite chamar modelos de IA a partir de Workers sem administrar GPU, autoscaling ou endpoint próprio de inferência. Ele é útil quando a IA faz parte de uma etapa clara do produto: classificar uma conversa, sugerir resposta, gerar tags, criar embedding ou resumir um conteúdo. Ele não resolve sozinho qualidade de prompt, privacidade ou custo.

No nosso runtime, o binding `AI` atende triagem, sugestão de resposta, auto-tag e recursos de IA em rotas Meta. A arquitetura mantém o modelo perto do Worker, mas continua exigindo limite diário, validação do usuário e observabilidade do resultado.

## Quando Workers AI faz sentido

| Necessidade | Workers AI encaixa? | Observação |
| --- | --- | --- |
| classificar intenção ou sentimento | sim | comece com saída estruturada e avaliação |
| sugerir resposta para atendimento | sim | rascunho humano antes de enviar |
| gerar tags e resumo | sim | barato quando o contexto é limitado |
| RAG sobre base própria | parcialmente | combine embeddings, busca e fonte citável |
| agente que opera ferramentas críticas | não sozinho | precisa de política, aprovação e integração segura |
| modelo proprietário específico | depende | compare catálogo, API externa e AI Gateway |

## Escolha o modelo pelo trabalho, não pelo tamanho

Um modelo grande pode ser desnecessário para classificar uma mensagem em cinco categorias. Um modelo menor pode errar uma resposta que exige contexto comercial e tom de marca. Defina primeiro um conjunto de exemplos e uma métrica: taxa de aceitação do rascunho, erro de classificação, custo por mil tarefas e latência percebida.

Para geração de texto, a documentação lista modelos como Llama, Mistral, Qwen e GPT-OSS no catálogo. Para embeddings, use um modelo compatível com o idioma e a dimensão da sua busca. Não copie nomes de modelo para produção sem verificar disponibilidade e preço atuais.

::callout{type="info" title="Uma boa saída de IA é uma proposta verificável"}
Peça JSON com campos limitados, valide com schema e mantenha a fonte original. “Parece certo” não é critério para mover dinheiro, publicar conteúdo ou responder um cliente.
::

## Custo: neurons e unidades por modelo

Workers AI inclui 10 mil neurons por dia em Free e Paid. Acima disso, Workers Paid cobra US$ 0,011 por mil neurons. A própria documentação também apresenta equivalentes por token e por modelo; por exemplo, a família Llama 3.3 70B tem custo por milhão de tokens muito maior que um modelo pequeno. A tabela muda com o catálogo, então o artigo e o produto devem apontar para a fonte oficial, não congelar uma estimativa em código.

O jeito saudável de controlar custo é colocar limite por usuário, caso de uso e período. No nosso caso, ferramentas públicas têm teto diário e o binding de IA não é exposto como uma API livre. Registre modelo, tokens/neurons quando disponíveis, latência, decisão humana e erro — sem guardar dado pessoal bruto desnecessariamente.

## Exemplo: triagem de mensagens sem automatizar o atendimento

1. Uma mensagem chega pelo canal oficial e é armazenada segundo a política do produto.
2. O Worker envia apenas o texto necessário a um modelo de triagem.
3. O resultado passa por Zod ou schema equivalente: `categoria`, `urgencia`, `confianca` e `motivo curto`.
4. A interface mostra sugestão para a pessoa responsável.
5. Só uma ação humana ou uma regra aprovada envia mensagem externa.

Esse fluxo é mais útil que um “bot autônomo” abstrato: reduz trabalho repetitivo, preserva controle e gera dados para avaliar se a automação merece crescer.

## Workers AI vs API externa vs modelo próprio

| Caminho | Vantagem | Trade-off |
| --- | --- | --- |
| Workers AI | binding simples, operação serverless e catálogo integrado | catálogo e região dependem da plataforma |
| API de modelo externo | variedade e recursos específicos | outra credencial, egress lógico e observabilidade separada |
| modelo próprio em GPU | controle total | alto custo e operação complexa |
| AI Gateway | governança/caching entre provedores | não substitui o provedor de inferência |

::read-more{slug="cloudflare-images-r2-otimizacao" label="Continuar: entregue imagens e capas sem gerar múltiplas cópias" placement="mid_content"}
## Prós, riscos e LGPD

Workers AI reduz infraestrutura de inferência e integra bem com Workers. Em compensação, prompts ruins, entrada não confiável e ausência de avaliação continuam sendo falhas da aplicação. Para dados de clientes, minimize contexto, evite enviar identificadores desnecessários, documente finalidade e não use a resposta do modelo como única decisão de alto impacto.

## Checklist de produção

- [ ] tarefa tem métrica e exemplos de avaliação;
- [ ] prompt recebe somente dados necessários;
- [ ] saída é validada com schema;
- [ ] usuário e uso têm limite de custo;
- [ ] falha do modelo tem fallback claro;
- [ ] ações externas exigem aprovação;
- [ ] modelo e preço são revisados antes de trocar versão.

## Perguntas frequentes

### Workers AI é gratuito?

Há 10 mil neurons por dia incluídos. Para exceder a franquia, é necessário Workers Paid e há cobrança por neurons consumidos.

### Posso usar IA para responder WhatsApp automaticamente?

Tecnicamente, pode integrar etapas. Produto e segurança devem definir quem recebe a mensagem, qual canal é autorizado, quando há revisão e como a resposta respeita a política do provedor.

### RAG é só chamar um modelo com um PDF?

Não. Um RAG confiável exige extração, embeddings, busca, filtros de permissão, fontes citáveis e avaliação de resposta.

### Fontes e leitura recomendada

- [Cloudflare Workers AI](https://developers.cloudflare.com/workers-ai/)
- [Preços do Workers AI](https://developers.cloudflare.com/workers-ai/platform/pricing/)
- [Catálogo de modelos](https://developers.cloudflare.com/workers-ai/models/)