WhatsWave LogoWhatsWave

Como funcionam os tokens no WhatsWave (e o que é o token excedente)

Guia rápido: o que são tokens de quota, quantas conversas cabem em cada plano e como funciona o excedente na fatura.

Como funcionam os tokens no WhatsWave (e o que é o token excedente)

Em resumo

Tokens de quota medem o uso da IA no seu plano. Cada mensagem consome tokens; modelos mais caros consomem mais quota por token bruto. Os limites e preços oficiais estão em /planos.

Como o modelo muda o consumo

O WhatsWave converte tokens brutos do provedor em tokens de quota. O baseline é o GPT-4o mini (openai/gpt-4o-mini): multiplicador 1× na entrada e na saída.

Para cada modelo, comparamos o preço por 1M de tokens (entrada e saída) com o baseline. Na prática:

  • Entrada e saída têm multiplicadores separados.
  • A coluna Médio* combina os dois com a proporção real de uso na plataforma: ~99% entrada · ~1% saída (média das últimas 1.000 sessões com chave da plataforma, out. de 2026). Em atendimento via WhatsApp, quase todo o volume é contexto enviado ao modelo (histórico, instruções, tools); a resposta da IA pesa bem menos.

Multiplicadores dos modelos disponíveis no app — lista curada por provedor, no mesmo espírito do Gemini (premium · equilibrado · econômico):

ModeloEntradaSaídaMédio*
groq/llama-3.1-8b-instant0.3×0.1×0.3×
openai/gpt-5-nano0.3×0.7×0.3×
groq/openai/gpt-oss-20b0.5×0.5×0.5×
groq/openai/gpt-oss-120b1×1×1×
openai/gpt-4o-mini (baseline)1×1×1×
openai/gpt-5-mini1.7×3.3×1.7×
google/gemini-2.5-flash2×4.2×2×
groq/llama-3.3-70b-versatile3.9×1.3×3.9×
openai/gpt-5.4-mini5×7.5×5×
anthropic/claude-haiku-4-56.7×8.3×6.7×
google/gemini-2.5-pro8.3×16.7×8.4×
google/gemini-3.5-flash10×15×10.1×
openai/gpt-4.113.3×13.3×13.3×
google/gemini-3.5-pro13.3×20×13.4×
openai/gpt-5.416.7×25×16.8×
anthropic/claude-sonnet-4-620×25×20.1×
anthropic/claude-sonnet-520×25×20.1×
openai/gpt-4o33.3×25×33.3×
anthropic/claude-opus-4-833.3×41.7×33.4×

*Médio = mult. entrada × 0,99 + mult. saída × 0,01, com pesos medidos em produção (últimas 1.000 sessões). Mesma lista exibida no seletor de modelos do app.

Quantas conversas cabem? (exemplos)

Premissa: conversa de 100 mil tokens brutos do provedor (histórico + respostas — não é a quota do plano). Use o Médio* da tabela: tokens de quota ≈ (tokens brutos × mult. médio) / 100.

ModeloTokens de quota por conversaPro (2M)Business (5M)Corporate (10M)Enterprise (30M)
GPT-4o mini~1 mil~2.000~5.000~10.000~30.000
Gemini 2.5 Flash~2 mil~990~2.475~4.950~14.851
GPT-4o~33 mil~60~150~301~902

Leitura rápida: no Pro, com Gemini 2.5 Flash você atende cerca de 990 conversas/mês nesse perfil; com GPT-4o mini, cerca de 2.000. A mediana real das sessões na plataforma fica perto de 174 tokens cobrados — ou seja, na prática você tende a ir além desses exemplos conservadores.

Planos e excedente

PlanoQuota/mêsExcedente (10 mil)
Pro2M/mêsR$ 150,00
Business5M/mêsR$ 130,00
Corporate10M/mêsR$ 110,00
Enterprise30M/mêsR$ 95,00

No Free, ao esgotar a quota a IA para (sem consumo flexível). Nos planos pagos, o consumo flexível vem ligado por padrão: a IA continua e o excedente entra na próxima fatura.

Exemplo (Pro): quota 2M, consumo 2,1M → 60K de excedente → ~R$ 900,00 extras (6 × R$ 150,00 por 10 mil).

O que fazer na prática

  • Acompanhe uso e estimativa em Cobrança no app.
  • Prefira modelos com mult. médio baixo no dia a dia; reserve modelos premium para casos complexos.
  • Se paga excedente com frequência, upgrade de plano quase sempre sai mais barato.

Valores atualizados em /planos.

Fontes e referências

  1. 1.WhatsApp Business API DocumentationMeta
  2. 2.WhatsApp Business PlatformWhatsApp

Compartilhe este artigo

Ajude outros a descobrirem este conteúdo