Voltar aos materiais
TUTORIALAGENTES-DE-IAWORKERS-AICUSTOS

Cloudflare Workers AI: como usar IA com custo, limite e controle

Entenda quando Workers AI faz sentido, como escolher modelo, controlar neurons, proteger dados e transformar IA em uma etapa segura do produto.

Por Mauro Mequelussi

5_MIN
Cloudflare Workers AI: como usar IA com custo, limite e controle
Em resumo

Entenda quando Workers AI faz sentido, como escolher modelo, controlar neurons, proteger dados e transformar IA em uma etapa segura do produto.

Workers AI permite chamar modelos de IA a partir de Workers sem administrar GPU, autoscaling ou endpoint próprio de inferência. Ele é útil quando a IA faz parte de uma etapa clara do produto: classificar uma conversa, sugerir resposta, gerar tags, criar embedding ou resumir um conteúdo. Ele não resolve sozinho qualidade de prompt, privacidade ou custo.

No nosso runtime, o binding AI atende triagem, sugestão de resposta, auto-tag e recursos de IA em rotas Meta. A arquitetura mantém o modelo perto do Worker, mas continua exigindo limite diário, validação do usuário e observabilidade do resultado.

Quando Workers AI faz sentido

NecessidadeWorkers AI encaixa?Observação
classificar intenção ou sentimentosimcomece com saída estruturada e avaliação
sugerir resposta para atendimentosimrascunho humano antes de enviar
gerar tags e resumosimbarato quando o contexto é limitado
RAG sobre base própriaparcialmentecombine embeddings, busca e fonte citável
agente que opera ferramentas críticasnão sozinhoprecisa de política, aprovação e integração segura
modelo proprietário específicodependecompare catálogo, API externa e AI Gateway

Escolha o modelo pelo trabalho, não pelo tamanho

Um modelo grande pode ser desnecessário para classificar uma mensagem em cinco categorias. Um modelo menor pode errar uma resposta que exige contexto comercial e tom de marca. Defina primeiro um conjunto de exemplos e uma métrica: taxa de aceitação do rascunho, erro de classificação, custo por mil tarefas e latência percebida.

Para geração de texto, a documentação lista modelos como Llama, Mistral, Qwen e GPT-OSS no catálogo. Para embeddings, use um modelo compatível com o idioma e a dimensão da sua busca. Não copie nomes de modelo para produção sem verificar disponibilidade e preço atuais.

Uma boa saída de IA é uma proposta verificável
Peça JSON com campos limitados, valide com schema e mantenha a fonte original. “Parece certo” não é critério para mover dinheiro, publicar conteúdo ou responder um cliente.

Custo: neurons e unidades por modelo

Workers AI inclui 10 mil neurons por dia em Free e Paid. Acima disso, Workers Paid cobra US$ 0,011 por mil neurons. A própria documentação também apresenta equivalentes por token e por modelo; por exemplo, a família Llama 3.3 70B tem custo por milhão de tokens muito maior que um modelo pequeno. A tabela muda com o catálogo, então o artigo e o produto devem apontar para a fonte oficial, não congelar uma estimativa em código.

O jeito saudável de controlar custo é colocar limite por usuário, caso de uso e período. No nosso caso, ferramentas públicas têm teto diário e o binding de IA não é exposto como uma API livre. Registre modelo, tokens/neurons quando disponíveis, latência, decisão humana e erro — sem guardar dado pessoal bruto desnecessariamente.

Exemplo: triagem de mensagens sem automatizar o atendimento

  1. Uma mensagem chega pelo canal oficial e é armazenada segundo a política do produto.
  2. O Worker envia apenas o texto necessário a um modelo de triagem.
  3. O resultado passa por Zod ou schema equivalente: categoria, urgencia, confianca e motivo curto.
  4. A interface mostra sugestão para a pessoa responsável.
  5. Só uma ação humana ou uma regra aprovada envia mensagem externa.

Esse fluxo é mais útil que um “bot autônomo” abstrato: reduz trabalho repetitivo, preserva controle e gera dados para avaliar se a automação merece crescer.

Workers AI vs API externa vs modelo próprio

CaminhoVantagemTrade-off
Workers AIbinding simples, operação serverless e catálogo integradocatálogo e região dependem da plataforma
API de modelo externovariedade e recursos específicosoutra credencial, egress lógico e observabilidade separada
modelo próprio em GPUcontrole totalalto custo e operação complexa
AI Gatewaygovernança/caching entre provedoresnão substitui o provedor de inferência

[ CONTEÚDO_INTEGRAL_DISPONÍVEL ]

Continuar: entregue imagens e capas sem gerar múltiplas cópias

CLIQUE PARA DESBLOQUEAR A LEITURA

Construindo aplicações robustas com arquitetura de alto nível e infraestrutura otimizada na edge do Cloudflare Workers com SurrealDB.

Segurança de dados e conformidade com privacidade desde o primeiro dia de código com tratamento de estados e sessões resilientes.

Métricas de performance para monitorar a experiência do usuário e otimizar custos operacionais em produção com dashboards estruturados.

Continuação liberada

Prós, riscos e LGPD

Workers AI reduz infraestrutura de inferência e integra bem com Workers. Em compensação, prompts ruins, entrada não confiável e ausência de avaliação continuam sendo falhas da aplicação. Para dados de clientes, minimize contexto, evite enviar identificadores desnecessários, documente finalidade e não use a resposta do modelo como única decisão de alto impacto.

Checklist de produção

  • tarefa tem métrica e exemplos de avaliação;
  • prompt recebe somente dados necessários;
  • saída é validada com schema;
  • usuário e uso têm limite de custo;
  • falha do modelo tem fallback claro;
  • ações externas exigem aprovação;
  • modelo e preço são revisados antes de trocar versão.

Perguntas frequentes

Workers AI é gratuito?

Há 10 mil neurons por dia incluídos. Para exceder a franquia, é necessário Workers Paid e há cobrança por neurons consumidos.

Posso usar IA para responder WhatsApp automaticamente?

Tecnicamente, pode integrar etapas. Produto e segurança devem definir quem recebe a mensagem, qual canal é autorizado, quando há revisão e como a resposta respeita a política do provedor.

RAG é só chamar um modelo com um PDF?

Não. Um RAG confiável exige extração, embeddings, busca, filtros de permissão, fontes citáveis e avaliação de resposta.

Fontes e leitura recomendada

Comece a construir

Quer transformar uma ideia em produto? O kit Sniper Apps reúne base, componentes e método para publicar com mais velocidade.

CONHECER_O_KIT →
Continue explorando
Ver todos os artigos →