Como o simulador funciona
A ferramenta projeta o throughput de uma API de LLM em produção a partir de 3 variáveis:
- Modelo: GPT-4o, Claude Sonnet, Gemini Pro ou Llama 70B local
- Concorrência: quantas requests simultâneas o sistema envia
- Tokens por request , tamanho médio de prompt + resposta
O resultado mostra throughput em requests/min, latência p99 estimada e custo por hora em USD e BRL, com veredito se a configuração aguenta ou não o volume. Tudo roda no navegador.
A base matemática: throughput = (tokens/segundo do modelo × concorrência) ÷ tokens por request. Latência p99 cresce com a concorrência e o tamanho do request. Custo soma input + output por token.
Por que simular throughput antes de subir em produção
API de LLM parece infinita no teste e quebra no pico. Cada modelo tem limite de tokens/segundo e rate limit de requests/min próprios. Sem simular antes, a empresa descobre o gargalo na hora do pico: quando cliente está esperando resposta.
O simulador combina velocidade típica do modelo, concorrência da sua carga e rate limit conhecido pra mostrar onde o sistema quebra: na geração de tokens, no limite da API ou no custo.
Limites desta ferramenta
Os números são estimativas baseadas em velocidade típica de produção com streaming, sem incluir fila de rede, cold start ou caching. Rate limits seguem tabelas oficiais em julho de 2026. Produção real varia conforme região, hora do dia e otimização do provedor.
Quer ajuda pra escalar?
O simulador mostra o teto. A implementação chega lá. Diagnóstico gratuito, 30 minutos.