Skip to main content

Resposta curta

max_tokens limita quantos tokens o modelo pode gerar em uma resposta. APIs e modelos diferentes usam nomes de campos, requisitos e comportamentos padrão distintos. Para obter uma saída estável, defina um limite explícito em respostas longas, geração de código e tarefas de documentação. Em chamadas Claude / compatíveis com Anthropic, geralmente é necessário enviar max_tokens explicitamente.

Conceitos principais

Se o limite for pequeno demais, a resposta poderá ser cortada. Se for muito grande, o modelo não gerará necessariamente todos esses tokens, mas tarefas com saídas longas podem custar mais.

Nomes de parâmetros diferentes

Se você usa o Codex CLI ou outra ferramenta baseada na Responses API, use o campo aceito pela ferramenta ou pelo provedor. Não fixe o mesmo nome de parâmetro para todos os modelos.

O que acontece se você não definir o limite

O comportamento varia conforme o provedor e a API: O mesmo código pode produzir respostas de tamanhos diferentes após a troca de modelo. Para evitar surpresas em produção, defina um limite explícito.

Faixas recomendadas

Consulte o limite real na model plaza e na documentação upstream. Os limites de saída podem mudar entre versões.

O que fazer quando a saída é cortada

Se a resposta contiver finish_reason: "length", o modelo provavelmente atingiu o limite de saída. Verifique nesta ordem:
  1. Aumente o campo de limite aceito pela API atual.
  2. Confirme que usou o nome de parâmetro correto.
  3. Torne o prompt mais específico para reduzir conteúdo desnecessário.
  4. Use um modelo com uma janela de saída maior.
  5. Divida a tarefa em várias etapas.

Erros comuns

  • Achar que um valor maior de max_tokens sempre faz o modelo escrever mais.
  • Tentar novamente após um corte sem conferir finish_reason.
  • Usar um nome de campo antigo com um modelo de raciocínio.
  • Ignorar tokens ocultos de raciocínio ao estimar contexto e custo.
  • Ignorar o limite máximo de saída do próprio modelo.

Sobre a BetterToken

A BetterToken registra o uso por API Key e solicitação de modelo. Use o painel para acompanhar o consumo de tokens entre modelos e tarefas. O campo de limite ainda é determinado pelo formato da API e pelo modelo. Ao configurá-lo, verifique em conjunto o modelo, a Base URL, o formato da API e o nome do parâmetro.

Documentos relacionados