Como o simulador funciona
A ferramenta estima o tempo de resposta de um LLM em produção a partir de 3 entradas:
- Modelo — GPT-4o, GPT-4o-mini, Claude 3.5 Sonnet, Claude Haiku, Gemini Pro, Gemini Flash ou Llama 70B local
- Tokens de prompt — tamanho médio do texto enviado
- Tokens de resposta , tamanho médio da resposta esperada
O cálculo considera a velocidade de cada modelo em tokens por segundo (TPS) para input e output, mais o custo por 1.000 tokens. A saída traz latência estimada em segundos, throughput em requests/min e custo por 1.000 requests em USD e BRL. Tudo roda no navegador.
Por que simular latência antes de escolher o modelo
A maioria das empresas escolhe modelo só pelo preço e descobre depois que a resposta demora. Em chatbot de atendimento, cada segundo extra de latência derruba a satisfação do usuário. Em pipeline em lote, throughput baixo multiplica o custo de infra.
O simulador responde a pergunta que importa: esse modelo responde dentro do tempo que minha operação aguenta? E mostra quanto custa cada mil requests pra você comparar lado a lado.
Quer ajustar latência e custo da sua operação?
O simulador dá uma estimativa baseada em média. O diagnóstico gratuito (30 min, online) ajuda a escolher modelo, batch e caching pra sua carga real.