Raciocínio (modo de raciocínio)
Os modelos modernos podem “pensar” antes de responder – gerando uma cadeia interna de raciocínio (raciocínio). Isso melhora significativamente a qualidade em tarefas complexas (matemática, código, lógica de várias etapas), mas consome tokens adicionais. NordRouter ignora de forma transparente todos os parâmetros de controle de raciocínio padrão - nada precisa ser configurado especialmente.
Como isso afeta o faturamento?
Existe apenas uma regra: tokens de raciocínio são cobrados como tokens de saque regulares - ao preço da saída do modelo docatálogo.
- Na resposta eles já estão incluídos em
usage.completion_tokens. - Eles podem ser vistos separadamente em
usage.completion_tokens_details.reasoning_tokens.
"usage": {
"prompt_tokens": 179,
"completion_tokens": 545, // всего вывода — это и биллится
"completion_tokens_details": {
"reasoning_tokens": 445 // из них на рассуждения
}
}Modelos de raciocínio são mais caros do que parecem
DeepSeek R1, Grok, GLM e outros modelos de raciocínio pensam por padrão - a resposta a uma pergunta simples pode custar de 5 a 10 vezes mais tokens do que o texto visível. Compare não o preço por token, mas o consumo real em usage.
Como gerenciar
Através do objeto reasoning no corpo da solicitação (a opção clássica OpenAI reasoning_effort: "low" | "medium" | "high" também funciona):
curl https://nordrouter.com/v1/chat/completions \
-H "Authorization: Bearer sk-nr-ВАШ-КЛЮЧ" \
-H "Content-Type: application/json" \
-d '{
"model": "anthropic/claude-sonnet-5",
"max_tokens": 4000,
"reasoning": { "effort": "high" },
"messages": [{ "role": "user", "content": "Сложная задача…" }]
}'| Parâmetro | O que | faz |---|---| | reasoning.effort | Profundidade de raciocínio: "low" / "medium" / "high". Menos esforço significa menos tokens de raciocínio e uma resposta mais barata | | reasoning.max_tokens | Orçamento para raciocínio em tokens (estilo Anthropic). Deve ser menor que max_tokens solicitação | | reasoning.enabled: false | Desligue o raciocínio (onde o modelo o suporta) | | reasoning.exclude: true | Oculte o texto do raciocínio da resposta. Não economiza dinheiro - a modelo ainda pensa, são cobrados tokens |
O texto do raciocínio (se não estiver oculto) é retornado para message.reasoning / message.reasoning_details.
Características dos modelos
Verificado por consultas ao vivo via NordRouter:
| Modelo | Comportamento |
|---|---|
anthropic/claude-sonnet-5 | Não raciocina por padrão. effort e max_tokens permitem o pensamento, enabled: false honestamente desativa |
anthropic/claude-fable-5 | Pensa adaptativo - ela decide quanto. Os parâmetros reasoning.* não são suportados (serão 400); profundidade controlada output_config: { "effort": "low" | "medium" | "high" } |
openai/gpt-5.4, gpt-5.5 | Motivo por padrão; reasoning_effort dimensiona a profundidade de |
x-ai/grok-4.3 | Razões por padrão e voluntariamente (centenas de tokens); effort: "low" encurta visivelmente |
deepseek/deepseek-r1, z-ai/glm-5.x | Eles sempre pensam: “desligar” só esconde o texto, tokens de raciocínio ainda são cobrados |
Como economizar
- Coloque
effort: "low"em tarefas simples para GPT/Grok - a qualidade não sofre, o consumo cai significativamente. - Não pense em Claude desnecessariamente - o soneto-5 responde por padrão sem raciocinar e é mais barato.
- Limite
max_tokens- este é um limite rígido para todas as saídas, incluindo o raciocínio. - Não use
excludepara economizar dinheiro - apenas oculta o texto e não devolve dinheiro. - Para rotina, use modelos sem julgamento (
deepseek-chat-v3.1,gemini-3.5-flash) - consulte ousagereal, e não apenas a lista de preços.