Skip to content

Raciocínio (modo de raciocínio)

Os modelos modernos podem “pensar” antes de responder – gerando uma cadeia interna de raciocínio (raciocínio). Isso melhora significativamente a qualidade em tarefas complexas (matemática, código, lógica de várias etapas), mas consome tokens adicionais. NordRouter ignora de forma transparente todos os parâmetros de controle de raciocínio padrão - nada precisa ser configurado especialmente.

Como isso afeta o faturamento?

Existe apenas uma regra: tokens de raciocínio são cobrados como tokens de saque regulares - ao preço da saída do modelo docatálogo.

  • Na resposta eles já estão incluídos em usage.completion_tokens.
  • Eles podem ser vistos separadamente em usage.completion_tokens_details.reasoning_tokens.
json
"usage": {
  "prompt_tokens": 179,
  "completion_tokens": 545,          // всего вывода — это и биллится
  "completion_tokens_details": {
    "reasoning_tokens": 445          // из них на рассуждения
  }
}

Modelos de raciocínio são mais caros do que parecem

DeepSeek R1, Grok, GLM e outros modelos de raciocínio pensam por padrão - a resposta a uma pergunta simples pode custar de 5 a 10 vezes mais tokens do que o texto visível. Compare não o preço por token, mas o consumo real em usage.

Como gerenciar

Através do objeto reasoning no corpo da solicitação (a opção clássica OpenAI reasoning_effort: "low" | "medium" | "high" também funciona):

bash
curl https://nordrouter.com/v1/chat/completions \
  -H "Authorization: Bearer sk-nr-ВАШ-КЛЮЧ" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "anthropic/claude-sonnet-5",
    "max_tokens": 4000,
    "reasoning": { "effort": "high" },
    "messages": [{ "role": "user", "content": "Сложная задача…" }]
  }'

| Parâmetro | O que | faz |---|---| | reasoning.effort | Profundidade de raciocínio: "low" / "medium" / "high". Menos esforço significa menos tokens de raciocínio e uma resposta mais barata | | reasoning.max_tokens | Orçamento para raciocínio em tokens (estilo Anthropic). Deve ser menor que max_tokens solicitação | | reasoning.enabled: false | Desligue o raciocínio (onde o modelo o suporta) | | reasoning.exclude: true | Oculte o texto do raciocínio da resposta. Não economiza dinheiro - a modelo ainda pensa, são cobrados tokens |

O texto do raciocínio (se não estiver oculto) é retornado para message.reasoning / message.reasoning_details.

Características dos modelos

Verificado por consultas ao vivo via NordRouter:

ModeloComportamento
anthropic/claude-sonnet-5Não raciocina por padrão. effort e max_tokens permitem o pensamento, enabled: false honestamente desativa
anthropic/claude-fable-5Pensa adaptativo - ela decide quanto. Os parâmetros reasoning.* não são suportados (serão 400); profundidade controlada output_config: { "effort": "low" | "medium" | "high" }
openai/gpt-5.4, gpt-5.5Motivo por padrão; reasoning_effort dimensiona a profundidade de
x-ai/grok-4.3Razões por padrão e voluntariamente (centenas de tokens); effort: "low" encurta visivelmente
deepseek/deepseek-r1, z-ai/glm-5.xEles sempre pensam: “desligar” só esconde o texto, tokens de raciocínio ainda são cobrados

Como economizar

  1. Coloque effort: "low" em tarefas simples para GPT/Grok - a qualidade não sofre, o consumo cai significativamente.
  2. Não pense em Claude desnecessariamente - o soneto-5 responde por padrão sem raciocinar e é mais barato.
  3. Limite max_tokens - este é um limite rígido para todas as saídas, incluindo o raciocínio.
  4. Não use exclude para economizar dinheiro - apenas oculta o texto e não devolve dinheiro.
  5. Para rotina, use modelos sem julgamento (deepseek-chat-v3.1, gemini-3.5-flash) - consulte o usage real, e não apenas a lista de preços.