Entendendo a IA Generativa

Temperatura e Configurações

Temperature, top_p, max_tokens — controlar criatividade, determinismo e tamanho da resposta.

Intermediário 25 min 20 pontos Leitura 0%

Nesta aula você vai

  • Configurar temperature e top_p para casos distintos
  • Usar max_tokens para limitar custo e resposta
  • Escolher parâmetros por tipo de tarefa

Temperatura e Configurações

Objetivos

  • Controlar comportamento do modelo sem trocar de LLM
  • Saber quando usar respostas determinísticas vs criativas
  • Comparar saídas alterando parâmetros (exercício mental)

O mesmo prompt, respostas diferentes

Você manda a mesma pergunta duas vezes e recebe textos parecidos, mas não idênticos. O cliente reclama: "O bot mudou a política de troca!" Na verdade, ninguém mudou regra nenhuma — mudou a aleatoriedade do modelo.

Parâmetros como temperature e max_tokens são os controles que separam um assistente de suporte confiável de um gerador de ideias criativas. Aprender a calibrá-los é como aprender a regular o volume e o tom de um instrumento — o músico é o mesmo, a performance muda.

Parâmetros principais

temperature (0.0 – 2.0)

Controla aleatoriedade na escolha do próximo token.

Valor Comportamento Uso típico
0 – 0.2 Quase determinístico, repetível Extração de JSON, classificação, FAQ factual
0.5 – 0.7 Equilíbrio Chat geral, suporte ao cliente
0.8 – 1.2 Mais criativo, variável Brainstorm, copy marketing
> 1.2 Imprevisível Raramente em produção

Exercício mental: mesmo prompt "Liste 3 benefícios de API REST":

  • Com temperature: 0 → lista estável, quase igual a cada execução
  • Com temperature: 1 → palavras e ordem mudam; tom pode variar

Diálogo de escolha no time:

Dev: "Bot de pedidos com temperature 0.9?"
Tech lead: "Só se você quiser status de entrega poético."
Dev: "0.2 então."
Tech lead: "E documenta no README."

top_p (nucleus sampling)

Alternativa ou complemento à temperature: considera apenas tokens cuja probabilidade acumulada ≤ top_p (ex: 0,9).

  • top_p: 1 = universo completo
  • top_p: 0,1 = só tokens muito prováveis

Boas práticas: altere temperature OU top_p, não os dois agressivamente ao mesmo tempo. Muitos times fixam top_p: 1 e só ajustam temperature — menos surpresas no debug.

max_tokens

Limite máximo de tokens na resposta (output).

  • Protege contra respostas infinitas e custo runaway
  • FAQ curta: max_tokens: 256
  • Explicação técnica: max_tokens: 1024

Se cortar no meio, o usuário vê texto truncado — combine com instrução no prompt: "Responda em no máximo 3 parágrafos".

Cenário comum:

Usuário: "Explique OAuth2 em detalhes."
Bot (max_tokens: 100): "OAuth2 é um protocolo de autorização que permite..." [corta no meio da frase]
Solução: aumentar max_tokens ou pedir resposta mais curta no system prompt.

Exemplo de payload (OpenAI-compatible)

{
  "model": "gpt-4o-mini",
  "messages": [{ "role": "user", "content": "Explique webhook em 2 frases." }],
  "temperature": 0.2,
  "max_tokens": 120
}

Note como prompt e parâmetros trabalham juntos: o prompt pede "2 frases"; max_tokens é a rede de segurança.

Presets por tipo de produto

Produto temperature max_tokens Notas
Agente de pedidos 0–0.3 300 Respostas curtas, dados exatos
Gerador de e-mail 0.6 800 Tom profissional, alguma variação
Classificador de intenção 0 50 Saída: label fixo ou JSON
Tutor técnico 0.5 1500 Explicações mais longas

Documente o preset escolhido no repositório. Daqui a seis meses, ninguém lembrará por que temperature está em 0.7 — o Git lembrará.

System prompt + parâmetros

Parâmetros numéricos não substituem instruções claras. Eles se complementam:

System: Responda sempre em português. Se não souber, diga "Não tenho essa informação".
temperature: 0.3
max_tokens: 400

Pense no system prompt como o manual de conduta e nos parâmetros como o estilo de improvisação permitido.

O que evitar

  • temperature: 1.5 em bot de suporte — respostas inconsistentes entre sessões
  • max_tokens gigante "por garantia" — paga output desnecessário
  • Ignorar seed (quando disponível) em testes A/B — dificulta reproduzir bugs

Resumo

  • Temperature = criatividade vs consistência
  • top_p = filtro probabilístico alternativo
  • max_tokens = teto de custo e tamanho
  • Escolha preset por caso de uso e documente no repositório

Com fundamentos, custo e parâmetros no lugar, partimos para a prática: chamar a API de verdade na próxima matéria. Lá você verá que integrar LLM é, no fundo, fazer um POST bem feito — com os cuidados que qualquer API externa exige.