Em resumo
Tokens de quota medem o uso da IA no seu plano. Cada mensagem consome tokens; modelos mais caros consomem mais quota por token bruto. Os limites e preços oficiais estão em /planos.
Como o modelo muda o consumo
O WhatsWave converte tokens brutos do provedor em tokens de quota. O baseline é o GPT-4o mini (openai/gpt-4o-mini): multiplicador 1× na entrada e na saída.
Para cada modelo, comparamos o preço por 1M de tokens (entrada e saída) com o baseline. Na prática:
- Entrada e saída têm multiplicadores separados.
- A coluna Médio* combina os dois com a proporção real de uso na plataforma: ~97,4% entrada · ~2,6% saída (média das últimas 1.000 sessões com chave da plataforma, ago. de 2026). Em atendimento via WhatsApp, quase todo o volume é contexto enviado ao modelo (histórico, instruções, tools); a resposta da IA pesa bem menos.
Multiplicadores dos modelos disponíveis no app — lista curada por provedor, no mesmo espírito do Gemini (premium · equilibrado · econômico):
| Modelo | Entrada | Saída | Médio* |
|---|---|---|---|
groq/llama-3.1-8b-instant | 0.3× | 0.1× | 0.3× |
openai/gpt-5-nano | 0.3× | 0.7× | 0.3× |
groq/openai/gpt-oss-20b | 0.5× | 0.5× | 0.5× |
groq/openai/gpt-oss-120b | 1× | 1× | 1× |
openai/gpt-4o-mini (baseline) | 1× | 1× | 1× |
openai/gpt-5-mini | 1.7× | 3.3× | 1.7× |
google/gemini-2.5-flash | 2× | 4.2× | 2.1× |
groq/llama-3.3-70b-versatile | 3.9× | 1.3× | 3.9× |
openai/gpt-5.4-mini | 5× | 7.5× | 5.1× |
anthropic/claude-haiku-4-5 | 6.7× | 8.3× | 6.7× |
google/gemini-2.5-pro | 8.3× | 16.7× | 8.6× |
google/gemini-3.5-flash | 10× | 15× | 10.1× |
openai/gpt-4.1 | 13.3× | 13.3× | 13.3× |
google/gemini-3.5-pro | 13.3× | 20× | 13.5× |
openai/gpt-5.4 | 16.7× | 25× | 16.9× |
anthropic/claude-sonnet-4-6 | 20× | 25× | 20.1× |
anthropic/claude-sonnet-5 | 20× | 25× | 20.1× |
openai/gpt-4o | 33.3× | 25× | 33.1× |
anthropic/claude-opus-4-8 | 33.3× | 41.7× | 33.6× |
*Médio = mult. entrada × 0,97 + mult. saída × 0,03, com pesos medidos em produção (últimas 1.000 sessões). Mesma lista exibida no seletor de modelos do app.
Quantas conversas cabem? (exemplos)
Premissa: conversa de 100 mil tokens brutos (histórico + respostas). Use o Médio* da tabela: tokens de quota ≈ tokens brutos × mult. médio.
| Modelo | Tokens de quota por conversa | Pro (200M) | Business (500M) | Corporate (1B) | Enterprise (3B) |
|---|---|---|---|---|---|
| GPT-4o mini | ~100 mil | ~2.000 | ~5.000 | ~10.000 | ~30.000 |
| Gemini 2.5 Flash | ~206 mil | ~971 | ~2.427 | ~4.854 | ~14.563 |
| GPT-4o | ~3,3 milhões | ~60 | ~151 | ~302 | ~906 |
Leitura rápida: no Pro, com Gemini 2.5 Flash você atende cerca de 971 conversas/mês nesse perfil; com GPT-4o mini, cerca de 2.000. A mediana real das sessões na plataforma fica perto de 63.188 tokens brutos — ou seja, na prática você tende a ir além desses exemplos conservadores.
Planos e excedente
| Plano | Quota/mês | Excedente (1M) |
|---|---|---|
| Pro | 200M/mês | R$ 1,50 |
| Business | 500M/mês | R$ 1,30 |
| Corporate | 1B/mês | R$ 1,10 |
| Enterprise | 3B/mês | R$ 0,95 |
No Free, ao esgotar a quota a IA para (sem consumo flexível). Nos planos pagos, o consumo flexível vem ligado por padrão: a IA continua e o excedente entra na próxima fatura.
Exemplo (Pro): quota 200M, consumo 206M → 6M de excedente → ~R$ 9,00 extras (6 × R$ 1,50).
O que fazer na prática
- Acompanhe uso e estimativa em Cobrança no app.
- Prefira modelos com mult. médio baixo no dia a dia; reserve modelos premium para casos complexos.
- Se paga excedente com frequência, upgrade de plano quase sempre sai mais barato.
Valores atualizados em /planos.


