O que é um token?
📍 In One Sentence
Um token é a menor unidade de texto que um modelo processa — cerca de três a quatro caracteres, ou aproximadamente três quartos de uma palavra em inglês — e você é cobrado por cada token de entrada e de saída.
💬 In Plain Terms
Modelos não leem palavras, leem fragmentos. "ChatGPT" são dois tokens, não um. É por isso que a mesma frase custa mais em alemão ou japonês do que em inglês, e por que um prompt prolixo custa dinheiro de verdade antes de o modelo responder qualquer coisa.
Um token é a menor unidade de texto que um modelo de IA processa — aproximadamente 3–4 caracteres ou ¾ de uma palavra em inglês. Em texto inglês, "ChatGPT" conta como 2 tokens, e "Hello, how are you?" são aproximadamente 5–6 tokens. Outros idiomas tokenizam com menos eficiência — a mesma frase em alemão ou japonês pode consumir 20–40% mais tokens. Você é cobrado por cada token do seu prompt (entrada) e por cada token que o modelo produz.
Os modelos não "pensam" em palavras ou caracteres. Internamente, convertem seu texto em IDs de token e os processam numericamente.
Em uma frase: um token é a menor unidade de texto que um modelo de IA processa — aproximadamente 3–4 caracteres ou ¾ de uma palavra em inglês — e você é cobrado por cada token de entrada e cada token de saída.
Como funciona a contagem de tokens na prática
Cada elemento da sua chamada de API — system prompt, histórico da conversa, nova mensagem, arquivos e a própria saída do modelo — consome tokens da sua cota.
- System prompt: Contado uma vez por mensagem. Um system prompt de 200 palavras = ~250 tokens em cada chamada à API.
- Histórico completo da conversa: Incluído em cada solicitação, a menos que seja resumido ou descartado explicitamente.
- Sua mensagem de entrada: Contada como está.
- Arquivos ou imagens anexados: Imagens consomem 100–2.000 tokens dependendo do tamanho e resolução.
- Saída do modelo: A resposta gerada é contada integralmente nas taxas de tokens de saída (geralmente 2–5× mais altas que as taxas de entrada).
- Exemplo prático: System prompt (300) + Pergunta 1 (150) + Resposta 1 (200) + Pergunta 2 (200) + Resposta 2 (300) + Pergunta 3 (100) = 1.250 tokens. Quando você envia a Pergunta 3, paga por todo o histórico novamente mais a saída da Resposta 3.
Preços entre provedores de nuvem
Os preços variam drasticamente com base na capacidade do modelo. Todos os valores abaixo são preços públicos de abril de 2026.
Preços a partir de abril de 2026. Verifique as taxas atuais: Preços OpenAI · Preços Anthropic · Preços Google
| Modelo | Entrada (por 1M tokens) | Saída (por 1M tokens) |
|---|---|---|
| OpenAI GPT-5.6 | $5,00 | $30,00 |
| Anthropic Claude Opus 5 | $5,00 | $25,00 |
| Google Gemini 3.1 Pro | $2,00 | $12,00 |
| OpenAI GPT-5.6 Luna | $0,20 | $1,20 |
| Anthropic Claude Haiku 4.5 | $1,00 | $5,00 |
| Google Gemini 3.7 Flash | $0,75 | $3,75 |
| Google Gemini 3.5 Flash-Lite | $0,30 | $2,50 |
Limites de taxa
Limites de taxa são restrições sobre quantas solicitações você pode fazer por minuto (RPM), quantos tokens pode processar por minuto (TPM), ou quantos tokens por dia (TPD). Os provedores impõem limites para evitar abusos, garantir alocação justa de recursos entre usuários e criar faixas de preço.
- Solicitações por minuto (RPM): O número de chamadas de API que você pode fazer em uma janela de 60 segundos.
- Tokens por minuto (TPM): O rendimento total de tokens. Um único prompt grande pode consumir toda a sua cota de TPM em segundos.
- Cenários comuns em que você atinge os limites: Pipelines automatizados fazendo chamadas sequenciais rápidas (50+ por segundo), grandes trabalhos de processamento em lote, ou usuários do plano gratuito em situações de pico.
- Limites típicos: Plano gratuito: 3–15 RPM, 40k–100k TPM. Plano pago nível 1: 500 RPM, 200k–500k TPM. Empresarial: 3.000+ RPM, milhões de TPM.
- Estratégias alternativas: Agrupar tarefas pequenas em solicitações maiores, adicionar atrasos entre solicitações ou fazer upgrade para uma conta de nível superior.
Como o design do prompt controla os custos
Testado no PromptQuorum — 20 prompts idênticos de resumo de pesquisa executados no GPT-5.6, Claude Opus 5 e Gemini 3.1 Pro com níveis variados de verbosidade no system prompt: Com um system prompt de 500 tokens, a saída média foi de 450 tokens a um custo médio de $0,032 por chamada. Com as mesmas instruções em um prompt reduzido de 200 tokens, a saída média foi de 460 tokens a $0,025 por chamada — uma redução de custo de 18% com qualidade de saída idêntica. Isso se alinha com como fazer prompts para velocidade: a eficiência reduz tanto a latência quanto o custo.
Cada token desnecessário no seu prompt desperdiça dinheiro — e os custos acumulam mais rápido porque todo o seu prompt é reinserido em cada chamada de API em uma conversa. Reduzir um system prompt de 500 tokens para 300 tokens economiza $0,001 por chamada, mas em 1.000 chamadas por dia, isso é $1/dia ou $365/ano.
- Corte o contexto agressivamente: Não repita o que o modelo já sabe. Em vez de "O usuário perguntou X. Eu respondi Y. Agora ele pergunta Z", inclua apenas Z.
- Use restrições explícitas de comprimento: "Responda em 3 tópicos" ou "Máximo de 100 palavras" força a concisão e evita saídas prolixas, que custam mais.
- Evite preenchimento em system prompts: Cada palavra de preenchimento custa dinheiro. "Você é um assistente especialista que ajuda os usuários" são 10 tokens. "Você é um assistente especialista" são 6 tokens. Ambos transmitem o mesmo significado.
- Exemplo: system prompt inflado versus system prompt reduzido:
- Prompt Ruim "Você é um assistente de IA prestativo com amplo conhecimento em muitos domínios. Você ajuda os usuários fornecendo respostas detalhadas e abrangentes às perguntas deles. Seja sempre minucioso e explique seu raciocínio passo a passo. Evite ser conciso — os usuários apreciam explicações minuciosas."
- Bom Prompt "Você é um assistente especialista. Forneça respostas precisas e detalhadas. Explique seu raciocínio."
- Diferença de tokens: ruim = 55 tokens, bom = 13 tokens. Em 100 chamadas por dia: 42 × 100 × 30 dias × ($5,00 por 1M de tokens de entrada) ≈ $0,63/mês economizados com apenas um prompt reduzido.
Como reduzir custos de API de LLM em 5 passos
- 1Combine o modelo à complexidade da tarefa: use GPT-5.6 Luna ou Claude Haiku 4.5 para classificação simples e Q&A — o Luna é 25× mais barato que o GPT-5.6, o Haiku 4.5 é 5–6× mais barato
- 2Resuma o histórico da conversa a cada 5 turnos: evita refaturação do histórico completo em cada chamada
- 3Limite o comprimento da saída explicitamente: "Responda em 3 tópicos" ou "Máximo de 100 palavras" evita respostas longas com muitos tokens
- 4Corte os system prompts ao essencial: remova frases de preenchimento; cada palavra redundante é refaturada em cada chamada de API
- 5Teste LLMs locais via Ollama para fluxos de trabalho privados de alto volume: custo zero de API por token
Escolhendo o modelo certo para a tarefa certa
Nem toda tarefa requer OpenAI GPT-5.6 ou Anthropic Claude Opus. Classificação simples, Q&A factual e muitas tarefas automatizadas funcionam perfeitamente em modelos mais baratos.
| Tipo de tarefa | Modelo recomendado | Custo vs GPT-5.6 |
|---|---|---|
| Classificação simples / Sim-Não | GPT-5.6 Luna ou Gemini 3.5 Flash-Lite | 12–25× mais barato |
| Q&A factual curto | GPT-5.6 Luna ou Claude Haiku 4.5 | 5–25× mais barato |
| Análise complexa ou código | GPT-5.6 ou Claude Opus 5 | referência |
| Escrita criativa longa | Claude Opus 5 ou GPT-5.6 | referência |
| Fluxos de trabalho privados de alto volume | Modelo local via Ollama | custo de API zero |
LLMs Locais — Opção de Custo Zero
Modelos locais via Ollama ou LM Studio têm custo zero de API por token — você paga apenas pelo hardware (VRAM e eletricidade). Isso os torna ideais para fluxos de trabalho de alto volume, aplicações sensíveis à privacidade e pipelines com custo crítico. Para equipes brasileiras que processam dados pessoais de acordo com a LGPD, a inferência local elimina transferências de dados para APIs externas.
- Custos de hardware: Modelos Ollama como Llama 3.1 8B requerem ~8 GB de VRAM, modelos 13B precisam de ~16 GB, modelos 70B precisam de 40 GB+.
- Trade-off de capacidade: Modelos locais são excelentes em classificação, resumo e tarefas repetitivas. Têm dificuldades com raciocínio de múltiplos passos comparados ao GPT-5.6 ou Claude Opus 5.
- Trade-off de latência: Modelos cloud respondem em 500ms–2s. Modelos locais em hardware de consumo: 2–10s dependendo do tamanho do modelo.
- Quando usar local: Automação de alto volume (1.000+ chamadas/dia), dados sensíveis segundo a LGPD/ANPD, ou fluxos de trabalho com custo crítico.
- Quando usar cloud: Aplicações sensíveis à latência, tarefas que exigem raciocínio de múltiplos passos, ou análises pontuais em que o custo de API é irrelevante.
Contexto Regional
UE / GDPR Para organizações da UE que processam dados pessoais por meio de APIs de IA, os custos de tokens incluem um custo de conformidade não visível nas tabelas de preços: cada token enviado a uma API na nuvem é um dado pessoal processado por terceiros sob o Artigo 28 do GDPR, exigindo um Acordo de Processamento de Dados e um mecanismo de transferência sob o Artigo 46 para provedores fora da UE.
LLMs locais via Ollama eliminam isso completamente. Para equipes da UE que processam dados de clientes, tickets de suporte ou documentos internos: o custo real de uma chamada de API na nuvem inclui a sobrecarga de conformidade da transferência externa de dados. Em escala, isso pode tornar a inferência local economicamente competitiva mesmo considerando o investimento em hardware.
Organizações alemãs sob as diretrizes BSI IT-Grundschutz devem documentar custos de processamento de IA e fluxos de dados — logs de tokens de APIs na nuvem atendem a esse requisito se mantidos com controles de acesso adequados.
Japão (METI) O texto em japonês requer 20–40% mais tokens do que o texto equivalente em inglês devido à ineficiência do tokenizador em escritas CJK. Um documento japonês de 1.000 palavras custa aproximadamente $0,007 no GPT-5.6 contra $0,005 para o mesmo conteúdo em inglês. Para fluxos de trabalho de IA em japonês, os modelos Qwen3 via Ollama são significativamente mais eficientes em tokens — a tokenização nativa CJK reduz a contagem de tokens em japonês em 30–40%, reduzindo diretamente o custo por chamada.
China Sob a Lei de Segurança de Dados da China (数据安全法), o envio de dados empresariais para APIs de IA na nuvem estrangeiras requer uma revisão de conformidade de localização de dados. Para equipes empresariais chinesas, a inferência local via Qwen3 (Alibaba) elimina simultaneamente o custo de transferência de dados transfronteiriça e o risco de conformidade. Com 1.000+ chamadas de API por dia, o custo de amortização de hardware de um servidor de inferência local costuma ficar abaixo das tarifas de API em 6–12 meses. Para empresas brasileiras sujeitas à LGPD, a mesma lógica se aplica: a inferência local elimina a necessidade de transferência internacional de dados pessoais e simplifica a conformidade com a ANPD.
Como o PromptQuorum ajuda você a gerenciar custos de tokens
O PromptQuorum usa dois LLMs: um Backend LLM e um Frontend LLM (o modelo escolhido que responde sua pergunta). O Backend LLM otimiza seu prompt e executa análise de consenso Quorum em vários modelos Frontend. Diferente das interfaces de chat de modelo único, o PromptQuorum torna o uso de tokens visível e acionável.
Os tokens do Backend LLM são sempre visíveis. A visibilidade dos tokens do Frontend depende de como você acessa o modelo:
- Interfaces públicas (Copilot, chat web público do Claude): tokens do Frontend NÃO visíveis — apenas os tokens do Backend aparecem.
- Modelos locais (LM Studio, Ollama): tokens do Frontend SÃO visíveis — roda no seu hardware, e o PromptQuorum lê o uso de tokens diretamente.
- APIs (OpenAI, Anthropic): depende. Com integração direta de API, os tokens do Frontend ficam visíveis. Via endpoint de terceiros ou interface pública, NÃO ficam.
Testado no PromptQuorum — 20 prompts idênticos de resumo de pesquisa enviados ao GPT-5.6 e ao GPT-5.6 Luna: A qualidade da saída foi equivalente em 17 das 20 tarefas. Diferença de custo: $0,003 por prompt (GPT-5.6) contra $0,00007 por prompt (Luna) — uma redução de custo de 43×. Nas 3 tarefas em que o GPT-5.6 se saiu melhor, a complexidade envolvia raciocínio de múltiplos passos entre documentos.
Receitas de Custo de Tokens
Use estes templates como pontos de partida para otimizar custos em fluxos de trabalho específicos.
- "Consulta rápida / tarefa Sim-Não": Use GPT-5.6 Luna ou Gemini 3.5 Flash-Lite. System prompt mínimo (≤50 tokens). Sem histórico de conversa. Limite a saída a 1–2 frases. Custo total por tarefa: ~$0,00005–0,0005.
- "Tarefa longa de pesquisa (5–10 turnos)": Use Claude Opus 5. Após cada 5 turnos, resuma a conversa e substitua o histórico por um resumo (reduz tokens em 70%).
- "Pipeline automatizado / processamento em lote": Use GPT-5.6 Luna para filtragem ou classificação (25× mais barato). Escale para GPT-5.6 apenas para síntese final em casos limítrofes. Agrupe prompts semelhantes para reaproveitar o cache de contexto onde a API oferecer suporte.
- "Fluxo de trabalho sensível à privacidade": Direcione para Ollama ou LM Studio rodando localmente. Gerencie a janela de contexto: 4k–8k tokens para 8 GB de VRAM, 16k–32k para 16 GB. Custo zero de API. Aceite qualidade ligeiramente menor em troca de conformidade com a LGPD.
- "Comparar saídas entre modelos": Envie um único prompt bem estruturado para GPT-5.6, Claude Opus 5 e GPT-5.6 Luna simultaneamente. Compare qualidade e custo. Escolha o mais barato que atenda ao seu padrão de qualidade. Custo de descoberta: ~$0,001. Custo contínuo: até 25× de economia quando o Luna atende ao seu padrão.
Erros Comuns
Evite estes padrões que desperdiçam tokens.
- Enviar histórico completo da conversa em cada chamada: Solução: Resuma a cada 5 turnos ou use cache de prompt se a API suportar.
- Usar modelo de alta capacidade para tarefas simples: Não use GPT-5.6 para "extraia a data deste e-mail". Use GPT-5.6 Luna. Diferença de custo: 25× nesta tarefa.
- Não limitar o comprimento da saída: Um prompt vago pode retornar 500 tokens quando "resuma em 50 palavras" retorna 60 tokens.
- Repetir system prompts longos em cada chamada: Use templates de system prompt ou cache em nível de solicitação.
- Esquecer os tokens de imagem: Uma única imagem em alta resolução pode consumir 500–2.000 tokens dependendo da resolução. Reduza a escala ou recorte a região relevante antes de enviar.
- Rodar chamadas de teste manuais em vez de agrupá-las: Testar 20 variações de um prompt custa 20× o custo em tokens de uma chamada. Use APIs de lote ou a comparação multimodelo do PromptQuorum para testar todas de uma vez.
- Trocar de modelo no meio da conversa: APIs cloud (OpenAI, Anthropic) não transferem o contexto da conversa entre modelos. Reiniciar a conversa em outro modelo reenvia todas as mensagens anteriores. Fique com um modelo por conversa.
Perguntas Frequentes
O que é um token em IA?
Um token é a menor unidade de texto que um modelo de IA processa — aproximadamente 3–4 caracteres ou ¾ de uma palavra em inglês. Você é cobrado por cada token de entrada e cada token de saída, com tokens de saída geralmente custando 2–5× mais.
Quanto custa o GPT-5.6 por token?
GPT-5.6 (Sol) custa $5,00 por 1M tokens de entrada e $30,00 por 1M tokens de saída. GPT-5.6 Luna custa $0,20 por 1M de entrada e $1,20 por 1M de saída — ~25× mais barato para tarefas que não requerem capacidade completa do GPT-5.6 Sol.
Como funcionam os limites de taxa?
Limites de taxa restringem solicitações por minuto (RPM) e tokens por minuto (TPM). Plano gratuito: 3–15 RPM, 40k–100k TPM. Plano pago: 500 RPM, 200k–500k TPM. Empresarial: 3.000+ RPM.
Quantos tokens tem um artigo ou relatório típico?
Um artigo de 1.000 palavras ≈ 1.200–1.500 tokens. Um PDF de 10 páginas ≈ 4.000–6.000 tokens. Uma única imagem de alta resolução ≈ 500–2.000 tokens, dependendo da resolução e densidade de conteúdo.
Por que minha fatura de API é maior do que o esperado, mesmo com prompts curtos?
Três causas comuns: (1) Você está enviando o histórico completo da conversa em cada chamada — resuma após 5 turnos. (2) Seu system prompt é longo — corte ao essencial. (3) Você está usando um modelo poderoso para tarefas simples — mude para GPT-5.6 Luna ou Haiku para classificação ou Q&A curto.
Um system prompt mais longo sempre significa uma saída melhor?
Não. Um system prompt de 100 tokens bem elaborado frequentemente supera um prompt prolixo de 500 tokens. Qualidade vence quantidade. Especificidade vence prolixidade.
Quando devo usar um LLM local em vez de uma API cloud?
Use LLMs locais para: automação de alto volume (1.000+ chamadas/dia), dados sensíveis segundo a LGPD onde nenhum dado pessoal deve sair da sua infraestrutura, ou pipelines com custo crítico. Use APIs cloud para aplicações sensíveis à latência ou tarefas de raciocínio complexo.
Como posso reduzir meus custos de tokens de API de IA?
Sete estratégias: corte os system prompts, limite o comprimento da saída, resuma o histórico da conversa a cada 5 turnos, use modelos mais baratos para tarefas simples, evite enviar o histórico completo da conversa, reduza a resolução das imagens antes do upload, e agrupe chamadas de teste em vez de executá-las manualmente.
Quantos tokens um prompt de IA típico usa?
Um prompt típico usa 150–500 tokens dependendo da complexidade. Uma pergunta simples (5–20 tokens), um parágrafo médio (50–150 tokens), um prompt de pesquisa completo com exemplos (200–600 tokens). Os tokens por prompt variam de acordo com o idioma e a complexidade.
O que significa quando um prompt tem 3.000 tokens?
Um prompt de 3.000 tokens equivale aproximadamente a um artigo de 2.000 palavras ou mais de 10 páginas de texto. Isso indica um system prompt longo, histórico completo de conversa, ou contexto de documento grande. Para eficiência, considere resumir o histórico da conversa ou cortar contexto desnecessário.
Quanto custa cada prompt de IA em diferentes modelos?
Os custos variam por modelo: GPT-5.6 Luna = ~$0,0001–0,0005 por prompt. GPT-5.6 = ~$0,002–0,02. Claude Haiku 4.5 = ~$0,0005–0,002 por prompt. Claude Opus 5 = ~$0,005–0,02. Gemini 3.5 Flash-Lite = ~$0,0001–0,0005. Os custos dependem do comprimento do prompt e da saída.
Como os tokens de um prompt de IA são calculados?
Os tokens são calculados dividindo o texto em unidades de 3–4 caracteres (aproximadamente ¾ de palavras em inglês). System prompts, histórico de conversa, imagens, arquivos anexados e a saída contam. A maioria dos provedores de API mostra a contagem exata de tokens nas respostas. Prompts mais curtos e saída limitada reduzem o uso de tokens.
Quantos tokens tem um prompt de 1.000 palavras?
Um prompt de 1.000 palavras é aproximadamente 1.200–1.500 tokens em inglês. Outros idiomas tokenizam com menos eficiência e podem exigir 20–40% mais tokens. A contagem de tokens depende da escolha das palavras e do comprimento médio das palavras no idioma usado.
Os limites de tokens se baseiam em um único prompt ou na conversa inteira?
Os limites de tokens se aplicam a todo o histórico da conversa, incluindo todos os system prompts, mensagens anteriores, documentos recuperados e o prompt atual. Os limites de taxa (tokens por minuto) se acumulam em todas as suas chamadas de API nesse período, não apenas em um prompt.
Quantos prompts você consegue obter de 1 milhão de tokens?
Com 1 milhão de tokens: 2.000–6.667 prompts se cada prompt tiver em média 150–500 tokens. Prompts do GPT-5.6 Luna (~300 tokens) = ~3.333 prompts. Prompts do GPT-5.6 (~500 tokens) = ~2.000 prompts. A contagem real depende do tamanho do prompt e do comprimento da saída.
A otimização de prompts reduz significativamente os custos de API?
Sim. Reduzir um system prompt de 500 tokens para 300 tokens economiza ~$0,001 por chamada de API. A 1.000 chamadas/dia, isso é $365/ano economizados. Limitar o comprimento da saída e resumir o histórico da conversa a cada 5 turnos reduz os custos em 30–50%. A seleção de modelo é a maior alavanca — GPT-5.6 Luna custa 25× menos que GPT-5.6.
Leituras Relacionadas
- Como os LLMs realmente funcionam — tokenização, janelas de contexto e parâmetros de inferência que geram esses custos
- System prompt vs user prompt — como o comprimento do system prompt afeta diretamente o custo em tokens de cada chamada de API
- Janelas de contexto explicadas — o problema de se perder no meio e como o tamanho da janela de contexto afeta custo e qualidade
- Instalar o Ollama — configure inferência local sem custo por token para fluxos de alto volume ou sensíveis à privacidade
- Quantização de LLM explicada — requisitos de RAM dos modelos locais que substituem os custos de API na nuvem
- Melhores LLMs locais em 2026 — quais modelos locais podem substituir APIs na nuvem para cada tipo de tarefa
