Skip to content

Rozumowanie (tryb rozumowania)

Nowoczesne modele potrafią „pomyśleć” przed udzieleniem odpowiedzi – tworząc wewnętrzny łańcuch rozumowania (rozumowanie). To znacznie poprawia jakość złożonych zadań (matematyka, kod, logika wieloetapowa), ale zużywa dodatkowe tokeny. NordRouter w przejrzysty sposób pomija wszystkie standardowe parametry kontroli rozumowania - nic nie musi być specjalnie konfigurowane.

Jak to wpływa na rozliczenia?

Jest tylko jedna zasada: żetony rozumowania są naliczane tak samo jak zwykłe żetony wypłaty – w cenie wyjścia modelu zkatalog.

  • W odpowiedzi są już uwzględnione w usage.completion_tokens.
  • Można je zobaczyć osobno pod adresem usage.completion_tokens_details.reasoning_tokens.
json
"usage": {
  "prompt_tokens": 179,
  "completion_tokens": 545,          // всего вывода — это и биллится
  "completion_tokens_details": {
    "reasoning_tokens": 445          // из них на рассуждения
  }
}

Modele rozumowania są droższe, niż się wydaje

DeepSeek R1, Grok, GLM i inne modele rozumowania myślą domyślnie – odpowiedź na proste pytanie może kosztować 5-10 razy więcej tokenów niż widoczny tekst. Porównaj nie cenę za token, ale rzeczywiste zużycie na usage.

Jak zarządzać

Poprzez obiekt reasoning w treści żądania (działa również klasyczna opcja OpenAI reasoning_effort: "low" | "medium" | "high"):

bash
curl https://nordrouter.com/v1/chat/completions \
  -H "Authorization: Bearer sk-nr-ВАШ-КЛЮЧ" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "anthropic/claude-sonnet-5",
    "max_tokens": 4000,
    "reasoning": { "effort": "high" },
    "messages": [{ "role": "user", "content": "Сложная задача…" }]
  }'
ParametrCo robi
reasoning.effortGłębokość rozumowania: "low" / "medium" / "high". Mniejszy wysiłek oznacza mniej żetonów rozumowania i tańszą odpowiedź
reasoning.max_tokensBudżet na rozumowanie w tokenach (styl Anthropic). Musi być mniejsza niż max_tokens żądanie
reasoning.enabled: falseWyłącz wnioskowanie (jeśli model je obsługuje)
reasoning.exclude: trueUkryj tekst uzasadnienia przed odpowiedzią. Nie oszczędza pieniędzy – modelka nadal myśli, tokeny są naliczane

Tekst uzasadnienia (jeśli nie jest ukryty) zwracany jest do message.reasoning / message.reasoning_details.

Cechy modeli

Zweryfikowano za pomocą zapytań na żywo za pośrednictwem NordRouter:

ModelZachowanie
anthropic/claude-sonnet-5Domyślnie nie rozumuje. effort i max_tokens umożliwiają myślenie, enabled: false szczerze wyłącza
anthropic/claude-fable-5Myśli adaptacyjne – ona decyduje ile. Parametry reasoning.* nie są obsługiwane (będzie 400); kontrolowana głębokość output_config: { "effort": "low" | "medium" | "high" }
openai/gpt-5.4, gpt-5.5Powód domyślny; reasoning_effort skaluje głębokość
x-ai/grok-4.3Powody domyślnie i dobrowolnie (setki tokenów); effort: "low" zauważalnie skraca
deepseek/deepseek-r1, z-ai/glm-5.xZawsze myślą: „wyłączenie” tylko ukrywa tekst, tokeny rozumowania są nadal naliczane

Jak oszczędzać

  1. Wstaw effort: "low" na prostych zadaniach dla GPT/Grok - jakość nie ucierpi, zużycie znacznie spada.
  2. Nie włączaj niepotrzebnego myślenia o Claude’u – Sonnet-5 domyślnie odpowiada bez uzasadnienia i jest tańszy.
  3. Limit max_tokens — jest to sztywny pułap wszystkich wyników, łącznie z rozumowaniem.
  4. Nie używaj exclude, aby zaoszczędzić pieniądze - powoduje to jedynie ukrycie tekstu i nie zwraca pieniędzy.
  5. Na rutynę weź nieoceniające modele (deepseek-chat-v3.1, gemini-3.5-flash) - zobacz aktualny usage, a nie tylko cennik.