Entendendo a IA Generativa
Temperatura e Configurações
Temperature, top_p, max_tokens — controlar criatividade, determinismo e tamanho da resposta.
Nesta aula você vai
- Configurar temperature e top_p para casos distintos
- Usar max_tokens para limitar custo e resposta
- Escolher parâmetros por tipo de tarefa
Temperatura e Configurações
Objetivos
- Controlar comportamento do modelo sem trocar de LLM
- Saber quando usar respostas determinísticas vs criativas
- Comparar saídas alterando parâmetros (exercício mental)
O mesmo prompt, respostas diferentes
Você manda a mesma pergunta duas vezes e recebe textos parecidos, mas não idênticos. O cliente reclama: "O bot mudou a política de troca!" Na verdade, ninguém mudou regra nenhuma — mudou a aleatoriedade do modelo.
Parâmetros como temperature e max_tokens são os controles que separam um assistente de suporte confiável de um gerador de ideias criativas. Aprender a calibrá-los é como aprender a regular o volume e o tom de um instrumento — o músico é o mesmo, a performance muda.
Parâmetros principais
temperature (0.0 – 2.0)
Controla aleatoriedade na escolha do próximo token.
| Valor | Comportamento | Uso típico |
|---|---|---|
| 0 – 0.2 | Quase determinístico, repetível | Extração de JSON, classificação, FAQ factual |
| 0.5 – 0.7 | Equilíbrio | Chat geral, suporte ao cliente |
| 0.8 – 1.2 | Mais criativo, variável | Brainstorm, copy marketing |
| > 1.2 | Imprevisível | Raramente em produção |
Exercício mental: mesmo prompt "Liste 3 benefícios de API REST":
- Com
temperature: 0→ lista estável, quase igual a cada execução - Com
temperature: 1→ palavras e ordem mudam; tom pode variar
Diálogo de escolha no time:
Dev: "Bot de pedidos com temperature 0.9?"
Tech lead: "Só se você quiser status de entrega poético."
Dev: "0.2 então."
Tech lead: "E documenta no README."
top_p (nucleus sampling)
Alternativa ou complemento à temperature: considera apenas tokens cuja probabilidade acumulada ≤ top_p (ex: 0,9).
top_p: 1= universo completotop_p: 0,1= só tokens muito prováveis
Boas práticas: altere temperature OU top_p, não os dois agressivamente ao mesmo tempo. Muitos times fixam top_p: 1 e só ajustam temperature — menos surpresas no debug.
max_tokens
Limite máximo de tokens na resposta (output).
- Protege contra respostas infinitas e custo runaway
- FAQ curta:
max_tokens: 256 - Explicação técnica:
max_tokens: 1024
Se cortar no meio, o usuário vê texto truncado — combine com instrução no prompt: "Responda em no máximo 3 parágrafos".
Cenário comum:
Usuário: "Explique OAuth2 em detalhes."
Bot (max_tokens: 100): "OAuth2 é um protocolo de autorização que permite..." [corta no meio da frase]
Solução: aumentarmax_tokensou pedir resposta mais curta no system prompt.
Exemplo de payload (OpenAI-compatible)
{
"model": "gpt-4o-mini",
"messages": [{ "role": "user", "content": "Explique webhook em 2 frases." }],
"temperature": 0.2,
"max_tokens": 120
}
Note como prompt e parâmetros trabalham juntos: o prompt pede "2 frases"; max_tokens é a rede de segurança.
Presets por tipo de produto
| Produto | temperature | max_tokens | Notas |
|---|---|---|---|
| Agente de pedidos | 0–0.3 | 300 | Respostas curtas, dados exatos |
| Gerador de e-mail | 0.6 | 800 | Tom profissional, alguma variação |
| Classificador de intenção | 0 | 50 | Saída: label fixo ou JSON |
| Tutor técnico | 0.5 | 1500 | Explicações mais longas |
Documente o preset escolhido no repositório. Daqui a seis meses, ninguém lembrará por que temperature está em 0.7 — o Git lembrará.
System prompt + parâmetros
Parâmetros numéricos não substituem instruções claras. Eles se complementam:
System: Responda sempre em português. Se não souber, diga "Não tenho essa informação".
temperature: 0.3
max_tokens: 400
Pense no system prompt como o manual de conduta e nos parâmetros como o estilo de improvisação permitido.
O que evitar
temperature: 1.5em bot de suporte — respostas inconsistentes entre sessõesmax_tokensgigante "por garantia" — paga output desnecessário- Ignorar
seed(quando disponível) em testes A/B — dificulta reproduzir bugs
Resumo
- Temperature = criatividade vs consistência
- top_p = filtro probabilístico alternativo
- max_tokens = teto de custo e tamanho
- Escolha preset por caso de uso e documente no repositório
Com fundamentos, custo e parâmetros no lugar, partimos para a prática: chamar a API de verdade na próxima matéria. Lá você verá que integrar LLM é, no fundo, fazer um POST bem feito — com os cuidados que qualquer API externa exige.