WhatsWave LogoWhatsWave

Como funcionam os tokens no WhatsWave (e o que é o token excedente)

Guia rápido: o que são tokens de quota, quantas conversas cabem em cada plano e como funciona o excedente na fatura.

Como funcionam os tokens no WhatsWave (e o que é o token excedente)

Em resumo

Tokens de quota medem o uso da IA no seu plano. Cada mensagem consome tokens; modelos mais caros consomem mais quota por token bruto. Os limites e preços oficiais estão em /planos.

Como o modelo muda o consumo

O WhatsWave converte tokens brutos do provedor em tokens de quota. O baseline é o GPT-4o mini (openai/gpt-4o-mini): multiplicador na entrada e na saída.

Para cada modelo, comparamos o preço por 1M de tokens (entrada e saída) com o baseline. Na prática:

  • Entrada e saída têm multiplicadores separados.
  • A coluna Médio* combina os dois com a proporção real de uso na plataforma: ~97,4% entrada · ~2,6% saída (média das últimas 1.000 sessões com chave da plataforma, ago. de 2026). Em atendimento via WhatsApp, quase todo o volume é contexto enviado ao modelo (histórico, instruções, tools); a resposta da IA pesa bem menos.

Multiplicadores dos modelos disponíveis no app — lista curada por provedor, no mesmo espírito do Gemini (premium · equilibrado · econômico):

ModeloEntradaSaídaMédio*
groq/llama-3.1-8b-instant0.3×0.1×0.3×
openai/gpt-5-nano0.3×0.7×0.3×
groq/openai/gpt-oss-20b0.5×0.5×0.5×
groq/openai/gpt-oss-120b
openai/gpt-4o-mini (baseline)
openai/gpt-5-mini1.7×3.3×1.7×
google/gemini-2.5-flash4.2×2.1×
groq/llama-3.3-70b-versatile3.9×1.3×3.9×
openai/gpt-5.4-mini7.5×5.1×
anthropic/claude-haiku-4-56.7×8.3×6.7×
google/gemini-2.5-pro8.3×16.7×8.6×
google/gemini-3.5-flash10×15×10.1×
openai/gpt-4.113.3×13.3×13.3×
google/gemini-3.5-pro13.3×20×13.5×
openai/gpt-5.416.7×25×16.9×
anthropic/claude-sonnet-4-620×25×20.1×
anthropic/claude-sonnet-520×25×20.1×
openai/gpt-4o33.3×25×33.1×
anthropic/claude-opus-4-833.3×41.7×33.6×

*Médio = mult. entrada × 0,97 + mult. saída × 0,03, com pesos medidos em produção (últimas 1.000 sessões). Mesma lista exibida no seletor de modelos do app.

Quantas conversas cabem? (exemplos)

Premissa: conversa de 100 mil tokens brutos (histórico + respostas). Use o Médio* da tabela: tokens de quota ≈ tokens brutos × mult. médio.

ModeloTokens de quota por conversaPro (200M)Business (500M)Corporate (1B)Enterprise (3B)
GPT-4o mini~100 mil~2.000~5.000~10.000~30.000
Gemini 2.5 Flash~206 mil~971~2.427~4.854~14.563
GPT-4o~3,3 milhões~60~151~302~906

Leitura rápida: no Pro, com Gemini 2.5 Flash você atende cerca de 971 conversas/mês nesse perfil; com GPT-4o mini, cerca de 2.000. A mediana real das sessões na plataforma fica perto de 63.188 tokens brutos — ou seja, na prática você tende a ir além desses exemplos conservadores.

Planos e excedente

PlanoQuota/mêsExcedente (1M)
Pro200M/mêsR$ 1,50
Business500M/mêsR$ 1,30
Corporate1B/mêsR$ 1,10
Enterprise3B/mêsR$ 0,95

No Free, ao esgotar a quota a IA para (sem consumo flexível). Nos planos pagos, o consumo flexível vem ligado por padrão: a IA continua e o excedente entra na próxima fatura.

Exemplo (Pro): quota 200M, consumo 206M → 6M de excedente → ~R$ 9,00 extras (6 × R$ 1,50).

O que fazer na prática

  • Acompanhe uso e estimativa em Cobrança no app.
  • Prefira modelos com mult. médio baixo no dia a dia; reserve modelos premium para casos complexos.
  • Se paga excedente com frequência, upgrade de plano quase sempre sai mais barato.

Valores atualizados em /planos.

Fontes e referências

  1. 1.WhatsApp Business API DocumentationMeta
  2. 2.WhatsApp Business PlatformWhatsApp

Compartilhe este artigo

Ajude outros a descobrirem este conteúdo