Skip to main content
PromptQuorum
Início/Prompt Engineering/Temperatura e Top-P: Controle a Criatividade da IA
Fundamentals

Temperatura e Top-P: Controle a Criatividade da IA

·9 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

Temperatura e top-p controlam quão aventureiras ou conservadoras são as escolhas de palavras da IA. Ajustando esses parâmetros, você equilibra criatividade versus confiabilidade — valores mais altos produzem saídas surpreendentes e variadas; valores mais baixos produzem saídas seguras e previsíveis.

A temperatura controla o quanto as escolhas de palavras do modelo são aleatórias: 0,0 é quase determinístico, 1,0 ou mais é criativo. O top-p limita quantas palavras candidatas continuam em jogo a cada passo. Na prática, ajuste apenas a temperatura e deixe o top-p no padrão de 0,9–1,0.

Temperatura e Top-P: Controle a Criatividade da IA

Pontos principais

  • A temperatura controla a aleatoriedade diretamente: 0,0–0,3 para saídas determinísticas, 0,4–0,7 para equilíbrio, 0,8 ou mais para criatividade.
  • O top-p controla a amplitude das opções de palavras: valores baixos estreitam as escolhas, valores altos as ampliam.
  • A maioria dos usuários deve ajustar um e manter o outro no padrão. Mexer nos dois ao mesmo tempo torna impossível saber qual deles ajudou.
  • Temperatura 0 não é 100% determinística — variações de hardware e de ponto flutuante ainda podem alterar um token. É o mais próximo que dá para chegar, não uma garantia.
  • O design do prompt ainda pesa mais do que os controles. Corrija instruções vagas primeiro, depois ajuste os parâmetros se ainda for necessário.
  • Confirme que o controle existe antes de ajustá-lo: os modelos Claude atuais da Anthropic e os modelos de raciocínio da OpenAI rejeitam com erro qualquer temperatura ou top-p fora do padrão.

Resumo visual: Temperatura e Top-P: Controle a Criatividade da IA

Prefere slides a ler? Navegue por esta apresentação interativa com todos os conceitos-chave, ajustes e casos de uso — e salve como PDF de referência.

O deck de slides a seguir aborda: como a temperatura controla a amostragem de probabilidade (faixa 0,0–2,0), como a amostragem nucleus do top-p limita a seleção de tokens, configurações específicas para 6 casos de uso (código, criativo, factual, chat) e uma tabela de referência rápida. Baixe o PDF como cartão de referência dos parâmetros de temperatura e top-p.

Download Temperatura e Top-P: Controle a Criatividade da IA Reference Card (PDF)

O que são Temperatura e Top-P?

📍 In One Sentence

A temperatura controla o quão acentuada é a distribuição de probabilidade do modelo — valores baixos produzem saídas determinísticas, valores altos aumentam a aleatoriedade — enquanto o top-p limita a amostragem ao menor conjunto de tokens cujas probabilidades somam p.

💬 In Plain Terms

A temperatura é o botão de criatividade. Baixe para 0 e você tem respostas consistentes e previsíveis; aumente e elas ficam surpreendentes. O top-p é outra alavanca sobre a mesma ideia: em vez de achatar as probabilidades, ele simplesmente se recusa a considerar a cauda de palavras improváveis.

Temperatura é um controle que torna a saída do modelo mais aleatória (valores altos) ou mais determinística (valores baixos). Na temperatura 0,0, o modelo sempre escolhe a próxima palavra mais provável — então execuções repetidas ficam quase idênticas, embora variações de ponto flutuante e de hardware ainda possam alterar um token ou outro. Na temperatura 1,0 ou acima, o modelo considera alternativas mais arriscadas, produzindo textos surpreendentes e variados.

Top-p (nucleus sampling) controla quantas opções de palavras prováveis o modelo considera em cada passo. Em vez de "quão aleatório", pense em "quantas escolhas plausíveis". Com top-p 0,1, o modelo considera apenas as opções do topo até somarem 10% da probabilidade acumulada — estreito e seguro. Com top-p 0,9, ele considera um conjunto muito mais amplo de palavras possíveis — mais solto e mais variado.

Em termos simples: a temperatura controla "quão ousado", e o top-p controla "quantas opções considerar". Ambos afetam a variedade da saída, mas de formas diferentes.

🔍 Funciona com modelos locais

As configurações de temperatura e top-p estão disponíveis em todas as ferramentas de LLM local. Mesmos parâmetros, mesmo efeito.

Estrutura do Prompt + Configurações de Temperatura

Prompt ruim "Escreva algo criativo sobre o outono."

Prompt bom "Escreva uma descrição metafórica de 100 palavras sobre o outono como se você fosse um poeta. Temperatura: 0,9, top-p: 0,95."

Notação Matemática

Faixa de temperatura: T ∈ 0.0, 2.0

Softmax com temperatura: softmax(logit_i / T) = exp(logit_i / T) / Σ(exp(logit_j / T))

Amostragem top-p: Σ P(token_i) até ≥ p, depois amostra desse conjunto

Como Elas Mudam o Comportamento da IA

Efeitos da temperatura:

Valores de Temperatura por Caso de Uso

Faixa de TemperaturaComportamentoMelhor para
0,0 – 0,3Determinístico, conservador, previsívelPerguntas factuais, extração de dados, classificação, código de produção
0,3 – 0,7Balanceado, ligeiramente variávelResumo, resposta a e-mail, resposta geral de chatbot
0,7 – 1,2Criativo, variado, menos previsívelBrainstorming, geração de ideias, escrita criativa, diálogo de personagem
1,2 – 2,0Altamente aleatório, experimentalFicção experimental, poesia, exploração criativa extrema. Use com cautela.

Efeitos do top-p: Baixo (0,1–0,3) cria conjuntos de opções muito estreitos e saídas altamente conservadoras. Médio (0,5–0,7) equilibra diversidade com estabilidade. Alto (0,8–1,0) amplia o conjunto de opções e incentiva a criatividade, de forma semelhante à temperatura alta. Importante: muitos provedores vinculam ou limitam essas configurações. Os modelos GPT da OpenAI costumam ignorar o top-p quando a temperatura é definida explicitamente. Já nos modelos atuais da Anthropic, os dois parâmetros ficam travados nos valores padrão (veja abaixo). Sempre verifique a documentação do seu provedor — os mesmos números não significam a mesma coisa em todos os modelos.

Nem Todo Modelo Ainda Aceita um Valor de Temperatura

📍 In One Sentence

Vários modelos de fronteira agora rejeitam com erro qualquer temperatura ou top-p fora do padrão, então confirme se o parâmetro ainda existe antes de ajustá-lo.

💬 In Plain Terms

Em alguns dos modelos mais novos os controles simplesmente sumiram. Se a sua requisição falhar, o ajuste foi recusado — não ignorado.

Um número crescente de modelos de fronteira não aceita mais nenhum valor de temperatura ou top-p: eles retornam um erro em vez de uma saída ajustada. Modelos em modo de raciocínio constroem a resposta em várias rodadas internas de rascunho e verificação, e os provedores travam os parâmetros de amostragem para manter esse processo calibrado. Confirme se o controle ainda existe no modelo que você vai chamar antes de gastar tempo ajustando.

Anthropic: no Claude Opus 5, Claude Sonnet 5 e Claude Fable 5 (e no Claude Opus 4.7 e 4.8), um valor de temperature, top_p ou top_k diferente do padrão retorna erro 400 em toda requisição — não apenas quando o raciocínio está ligado. Em modelos Claude mais antigos a restrição vale só enquanto o raciocínio está ativo, e nesse caso top_p é aceito entre 0,95 e 1,0.

OpenAI: a família GPT-5 em modo de raciocínio recusa valores fora do padrão com "Unsupported value: temperature does not support 0.2 with this model. Only the default (1) value is supported." Os endpoints sem raciocínio continuam aceitando a faixa completa de 0 a 2.

Google: o Gemini continua expondo temperature e topP pelo generationConfig, então as faixas deste guia valem diretamente para os modelos Gemini.

Modelos locais: Ollama, LM Studio e llama.cpp expõem os dois parâmetros em todos os modelos, sem trava do provedor. Se você quiser sentir a diferença entre 0,2 e 0,9 no mesmo prompt, um modelo local é o lugar mais barato para testar.

Quando os parâmetros estão travados, você direciona pelo prompt: peça uma única resposta canônica em um formato de saída exato onde você teria baixado a temperatura, e peça explicitamente várias alternativas bem distintas onde você a teria aumentado. Se o provedor oferecer um controle de esforço de raciocínio, é esse ajuste que substituiu a temperatura.

⚠️ Recusa não é efeito zero

É fácil ler uma requisição recusada como "o ajuste não fez nada". Um erro 400 significa que o parâmetro foi recusado, ou seja, a execução nunca aconteceu com o seu valor.

Valores de Top-P por Caso de Uso

Valor de Top-PEfeitoMelhor para
0,1 – 0,3Ultra-conservador — apenas as escolhas de palavras mais segurasConteúdo jurídico ou médico de alto risco onde segurança é crítica
0,7 – 0,9Padrão equilibrado — boa variedade sem incoerênciaChat de propósito geral, redação de negócios, respostas de suporte ao cliente
1,0Sem filtragem — todos os tokens são consideradosGeralmente não recomendado — aumenta o risco de saída sem sentido

Temperatura vs Top-P: Você Precisa dos Dois?

Ambas as configurações controlam a aleatoriedade, mas a maioria dos usuários deve ajustar apenas uma e manter a outra em um valor padrão razoável. Alterar as duas ao mesmo tempo torna impossível saber qual ajuste produziu o efeito desejado. Pela experiência de ajustar milhares de prompts: mantenha o top-p em um valor padrão (ex.: 0,9–1,0) e ajuste apenas a temperatura, a menos que um modelo específico recomende o contrário.

Estratégia Combinada: Temperatura + Top-P

EstratégiaTemperaturaTop-PQuando Usar
Modo determinístico0,0–0,21,0 (padrão)Código, extração de dados, saída de missão crítica
Padrão equilibrado0,5–0,70,9–1,0A maioria das tarefas gerais, resumos, explicações
Criativo/brainstorming0,8–1,00,9–1,0Ideação, copy de marketing, variações, storytelling
Produção de alta estabilidade0,0–0,30,95Saúde, finanças, jurídico, crítico para segurança

Configurações Recomendadas por Caso de Uso

  • Codificação, refatoração, correção de bugs: Temperatura 0,1–0,3, top-p 0,95. A sintaxe precisa estar correta, a criatividade atrapalha. Configurações mais baixas evitam nomes de funções alucinados ou erros de lógica.
  • Resumos e explicações: Temperatura 0,4–0,6, top-p 0,9. Você quer clareza e consistência, mas alguma variação na formulação é aceitável. Temperatura baixa pode deixar os resumos mecânicos.
  • Brainstorming, copy de marketing, variações criativas: Temperatura 0,7–1,0, top-p 1,0. Configurações mais altas incentivam combinações inesperadas e formulações inéditas. Você vai precisar filtrar mais saídas, mas obterá ideias mais ousadas.
  • Extração de dados e saída estruturada: Temperatura 0,0–0,2, top-p 0,95. O formato precisa ser exato. Maior aleatoriedade convida a erros de parsing e campos ausentes.
  • Escrita de textos longos (ensaios, posts de blog): Temperatura 0,6–0,8, top-p 0,9–1,0. Comece aqui e ajuste com base no feedback. Se a saída parecer genérica, aumente a temperatura; se divagar ou alucinar, diminua.
  • Perguntas e respostas baseadas em fatos (sem grounding): Temperatura 0,3–0,5, top-p 0,9. Configurações moderadas reduzem alucinações mantendo as respostas naturais.

Como Prompts e Parâmetros Trabalham Juntos

O design do prompt ainda importa mais do que os ajustes dos controles deslizantes. Uma instrução vaga na temperatura 0,2 ainda vai produzir uma resposta ruim — só que uma resposta ruim consistente. Um prompt claro e bem estruturado em qualquer temperatura produz melhores resultados do que um prompt ruim com configurações perfeitas. Para os fundamentos de estrutura de prompt, veja What Is Prompt Engineering?.

O fluxo de trabalho correto é: (1) Elabore o prompt primeiro com tarefa clara, contexto, restrições e formato de saída (veja The 5 Building Blocks Every Prompt Needs). (2) Teste na sua temperatura/top-p alvo. (3) Só ajuste os controles se precisar de mais ou menos variação depois que o prompt estiver sólido.

O mesmo prompt em temperaturas diferentes produz estilos muito diferentes. Na temperatura 0,2, as saídas são seguras e diretas. Na temperatura 0,8, as saídas são criativas e poéticas. Nenhuma é "melhor" — depende da voz da sua marca e do seu caso de uso. Para a maioria das tarefas, corrigir o prompt primeiro elimina a necessidade de mexer na temperatura.

Prompt de Exemplo

Escreva um slogan de produto curto e direto para um app de produtividade. Mantenha abaixo de 10 palavras.

Na Temperatura 0,2:

"Faça mais em menos tempo."

Na Temperatura 0,8:

"Do caos à clareza: onde momentos se transformam em impulso."

Quando a Maior Criatividade Se Torna Arriscada

Temperatura e top-p mais altos aumentam alucinações, desvios de tema e deriva de estilo — especialmente em tarefas factuais. Seja conservador (temp 0,0–0,5) para: código que vai para produção (APIs alucinadas quebram sistemas), conselhos médicos (informações erradas causam danos), finanças e direito (a precisão é obrigatória) e decisões críticas de segurança (erros têm consequências).

Para tarefas fundamentadas em fatos, considere combinar temperatura mais baixa com RAG Explained: How to Ground AI Answers in Real Data ou restrições explícitas de fonte para reduzir ainda mais os erros. Veja também AI Hallucinations: Why AI Makes Things Up para entender por que temperaturas mais altas amplificam a fabricação de informação.

Como o PromptQuorum Ajuda Você a Ajustar Temperatura e Top-P

Testado no PromptQuorum — 60 prompts de escrita criativa enviados nas temperaturas 0,2, 0,7 e 1,2 nos modelos que ainda expõem um controle de temperatura: Em 0,7, 54 dos 60 prompts produziram primeiras versões utilizáveis. Em 1,2, 31 dos 60 produziram detalhes alucinados ou estrutura quebrada. Em 0,2, 58 dos 60 foram precisos, mas classificados como "genéricos" por avaliadores em revisão cega.

Normalmente, testar configurações de temperatura e top-p significa executar o mesmo prompt várias vezes em vários modelos, registrando e comparando saídas manualmente — demorado e difícil de rastrear. O PromptQuorum simplifica esse fluxo de trabalho.

Comparações multi-modelo: Envie um prompt com diferentes configurações de temperatura/top-p para mais de 25 modelos que os aceitam (Gemini 3.1 Pro, os endpoints sem raciocínio do GPT-5.6, Mistral, modelos Ollama locais) em um único envio. Veja instantaneamente qual modelo permanece estável em temperaturas mais altas e qual produz a melhor saída criativa na sua configuração-alvo.

Estrutura baseada em frameworks: Os frameworks do PromptQuorum garantem que suas instruções, formato e restrições estejam bem estruturados antes de você tocar em qualquer controle. Isso isola o efeito da temperatura/top-p das demais variáveis — você não mistura um prompt ruim com ajuste de parâmetros.

Consenso e pontuação: Visualize todas as saídas lado a lado com a análise Quorum, que avalia o risco de alucinação, a consistência de estilo e a relevância. Escolha a combinação de modelo + configuração que melhor se adapta ao equilíbrio entre criatividade e confiabilidade da sua tarefa.

Recomendações automáticas de temperatura: O PromptQuorum analisa a descrição da sua tarefa e a estrutura do prompt e então sugere faixas ideais de temperatura conforme o caso de uso (código, resumo, brainstorming etc.). Disponível tanto no app quanto na extensão do Chrome, o PromptQuorum propõe valores de temperatura além dos padrões, ajustados à sua tarefa específica e aos modelos que você usa. Em vez de adivinhar "devo usar 0,2 ou 0,7?", a ferramenta recomenda valores concretos com base na análise da tarefa — poupando você da tentativa e erro manual.

Fluxos com LLMs locais: Teste diferentes combinações de temperatura/top-p no Ollama ou no LM Studio sem escrever scripts e depois salve os melhores presets para o seu fluxo de trabalho.

Receitas de Início Rápido

Use estas como pontos de partida para sua tarefa:

  • Modo Factual Seguro: Temperatura 0,2, top-p 0,95 | Ideal para Q&A, resumos, extração de dados, tarefas baseadas em fatos | Saída: Confiável, consistente, alucinação mínima
  • Modo Equilibrado Padrão: Temperatura 0,5, top-p 0,9 | Ideal para a maioria das tarefas gerais, explicações, escrita geral | Saída: Natural, estável, mas com alguma variação
  • Modo Brainstorming Criativo: Temperatura 0,8, top-p 1,0 | Ideal para geração de ideias, copy de marketing, storytelling, variações | Saída: Diversa, surpreendente, muitas opções para filtrar
  • Modo de Resposta Curta: Temperatura 0,3, top-p 0,95 (combina com Faster AI Answers: How to Prompt for Speed) | Ideal para respostas diretas, decisões rápidas, saídas concisas | Saída: Rápida, direta, elaboração mínima
  • Modo Experimental: Temperatura 1,0, top-p 1,0 | Ideal para explorar o comportamento do modelo, entender limites, pesquisa | Saída: Imprevisível, variação máxima

Erros Comuns com Temperatura e Top-P

  • Colocar ambos no máximo e esperar confiabilidade. Temperatura alta + top-p alto = aleatoriedade máxima. Só faça isso se estiver fazendo brainstorming ou experimentando.
  • Mudar os dois parâmetros ao mesmo tempo. Você não vai saber qual ajuste ajudou ou prejudicou. Mude um, observe, depois mude o outro se necessário.
  • Tentar corrigir um prompt ruim com os controles deslizantes. Uma instrução vaga em qualquer temperatura ainda produz saídas ruins. Corrija o prompt primeiro.
  • Presumir que todo modelo ainda tem um controle de temperatura. Os modelos Claude atuais da Anthropic e os modelos de raciocínio da OpenAI recusam valores fora do padrão de imediato, e entre os que aceitam, o mesmo número significa coisas diferentes: temperatura 0,7 no Gemini 3.1 Pro não é a mesma coisa que 0,7 em um build local de Llama. Teste exatamente o modelo que você vai chamar.
  • Não testar execuções suficientes. Uma saída na temperatura 0,5 pode ser um valor atípico. Execute pelo menos 3–5 vezes para ver o comportamento típico.
  • Definir a temperatura como 0 e esperar correção perfeita. Temperatura baixa reduz a aleatoriedade, mas não elimina alucinações. Alucinações vêm de lacunas nos dados de treinamento, não da amostragem aleatória.
  • Ignorar completamente o top-p porque seu provedor o ignora. Alguns modelos ignoram; outros não. Verifique a documentação para evitar perder tempo ajustando um controle desativado.

Como Definir Temperatura e Top-P para a Sua Tarefa

  1. 1
    Comece pelo prompt, não pelos parâmetros: Escreva e refine suas instruções até ficarem claras. Os parâmetros não corrigem um prompt vago — eles afetam apenas a distribuição de amostragem, não a compreensão da tarefa pelo modelo.
  2. 2
    Identifique o tipo da sua tarefa: Tarefas factuais ou analíticas (análise jurídica, revisão de código, extração de dados) → temperatura 0,0–0,3. Tarefas criativas ou generativas (brainstorming, copywriting, ideias de história) → temperatura 0,7–1,0.
  3. 3
    Deixe o top-p no padrão (0,9–1,0): Só ajuste o top-p se tiver um motivo específico. Mexer em temperatura e top-p ao mesmo tempo dificulta diagnosticar qual ajuste mudou a saída.
  4. 4
    Rode de 3 a 5 prompts de teste na sua temperatura-alvo: Avalie a consistência das saídas. Se variarem demais em uma tarefa factual, baixe a temperatura. Se parecerem repetitivas em uma tarefa criativa, aumente.
  5. 5
    Documente as configurações calibradas por caso de uso: Assim que encontrar a temperatura certa para um fluxo específico, registre-a no seu template de system prompt para que ela se aplique de forma consistente entre sessões.

Devo ajustar a temperatura ou o top-p primeiro?

A temperatura. Ela tem um efeito mais evidente. Mantenha o top-p em um padrão (0,9–1,0) até entender o que a temperatura faz na sua tarefa e só então ajuste o top-p, se ainda for necessário.

Por que um modelo ignora a minha configuração de temperatura?

Normalmente ele não está ignorando: está recusando. Os modelos Claude atuais da Anthropic e os modelos de raciocínio da OpenAI retornam erro 400 quando a temperatura ou o top-p saem do padrão, e algumas configurações mais antigas limitam silenciosamente um parâmetro quando o outro é definido de forma explícita. Verifique a documentação do seu provedor e leia uma requisição que falhou como recusa, não como um ajuste sem efeito.

Posso definir a temperatura como 0 para garantir a correção?

Não. Temperatura 0,0 significa "escolher sempre a palavra mais provável", o que é quase determinístico mas não necessariamente correto. Alucinações vêm de lacunas nos dados de treinamento e de ambiguidade na tarefa, não da amostragem aleatória. Combine temperatura baixa com prompts claros e grounding para mais confiabilidade.

Por que ainda vejo alucinações mesmo com temperatura baixa?

Alucinações acontecem quando os dados de treinamento do modelo têm lacunas ou a tarefa é ambígua — não apenas por causa da amostragem aleatória. Uma configuração de temperatura baixa será consistente em suas alucinações, mas não vai eliminá-las. Use RAG ou restrições explícitas de fonte para reduzi-las.

As configurações recomendadas mudam entre GPT-5.6, Claude Opus 5 e Gemini 3.1 Pro?

Mais do que um pouco: um deles não aceita mais o ajuste. O Claude Opus 5 (assim como o Claude Sonnet 5 e o Claude Fable 5) rejeita de imediato qualquer temperatura ou top-p fora do padrão. O Gemini 3.1 Pro continua expondo os dois via generationConfig e se comporta bem entre 0,5 e 0,7. O GPT-5.6 aceita a faixa completa nos endpoints sem raciocínio, mas recusa valores fora do padrão em modo de raciocínio. Teste exatamente o modelo e o modo que você vai chamar.

Quantas execuções eu preciso para comparar configurações de forma justa?

Pelo menos 3–5 por configuração para ver o comportamento típico. Mais, se você estiver trabalhando com temperaturas mais altas, onde a variância da saída é maior. O recurso de múltiplas execuções do PromptQuorum lida com isso automaticamente em todos os modelos.

O que eu faço se o meu modelo recusar o parâmetro de temperatura?

Direcione pelo prompt. Onde você teria baixado a temperatura, peça uma única resposta canônica em um formato de saída exato; onde a teria aumentado, peça explicitamente várias alternativas bem distintas. Se o provedor oferecer um controle de esforço de raciocínio, é esse ajuste que substitui a temperatura. Os modelos Claude atuais da Anthropic e os modelos de raciocínio da OpenAI retornam erro em vez de ignorar o valor em silêncio.

O que é Prompt Engineering? — por que a estrutura do prompt importa mais do que os parâmetros

Os 5 Blocos de Construção que Todo Prompt Precisa — como estruturar prompts antes de ajustar parâmetros

Alucinações de IA: Por Que a IA Inventa Coisas — por que temperatura mais baixa não elimina alucinações

OpenAI. "API reference: Chat Completions" — faixas e valores padrão oficiais de temperature e top_p

Holtzman et al., 2020. "The Curious Case of Neural Text Degeneration" — pesquisa sobre nucleus sampling (top-p) e seus efeitos na qualidade do texto

Anthropic. "Thinking" — lista os modelos Claude que recusam valores fora do padrão de temperature, top_p e top_k

Google. "Gemini API: Text generation" — configuração de geração do Gemini, incluindo temperature

Aplique estas técnicas com um LLM local ou suas próprias chaves de API — o PromptQuorum funciona com qualquer backend.

Experimente o PromptQuorum gratuitamente →

← Voltar ao Prompt Engineering