Rozumowanie (tryb rozumowania)
Nowoczesne modele potrafią „pomyśleć” przed udzieleniem odpowiedzi – tworząc wewnętrzny łańcuch rozumowania (rozumowanie). To znacznie poprawia jakość złożonych zadań (matematyka, kod, logika wieloetapowa), ale zużywa dodatkowe tokeny. NordRouter w przejrzysty sposób pomija wszystkie standardowe parametry kontroli rozumowania - nic nie musi być specjalnie konfigurowane.
Jak to wpływa na rozliczenia?
Jest tylko jedna zasada: żetony rozumowania są naliczane tak samo jak zwykłe żetony wypłaty – w cenie wyjścia modelu zkatalog.
- W odpowiedzi są już uwzględnione w
usage.completion_tokens. - Można je zobaczyć osobno pod adresem
usage.completion_tokens_details.reasoning_tokens.
"usage": {
"prompt_tokens": 179,
"completion_tokens": 545, // всего вывода — это и биллится
"completion_tokens_details": {
"reasoning_tokens": 445 // из них на рассуждения
}
}Modele rozumowania są droższe, niż się wydaje
DeepSeek R1, Grok, GLM i inne modele rozumowania myślą domyślnie – odpowiedź na proste pytanie może kosztować 5-10 razy więcej tokenów niż widoczny tekst. Porównaj nie cenę za token, ale rzeczywiste zużycie na usage.
Jak zarządzać
Poprzez obiekt reasoning w treści żądania (działa również klasyczna opcja OpenAI reasoning_effort: "low" | "medium" | "high"):
curl https://nordrouter.com/v1/chat/completions \
-H "Authorization: Bearer sk-nr-ВАШ-КЛЮЧ" \
-H "Content-Type: application/json" \
-d '{
"model": "anthropic/claude-sonnet-5",
"max_tokens": 4000,
"reasoning": { "effort": "high" },
"messages": [{ "role": "user", "content": "Сложная задача…" }]
}'| Parametr | Co robi |
|---|---|
reasoning.effort | Głębokość rozumowania: "low" / "medium" / "high". Mniejszy wysiłek oznacza mniej żetonów rozumowania i tańszą odpowiedź |
reasoning.max_tokens | Budżet na rozumowanie w tokenach (styl Anthropic). Musi być mniejsza niż max_tokens żądanie |
reasoning.enabled: false | Wyłącz wnioskowanie (jeśli model je obsługuje) |
reasoning.exclude: true | Ukryj tekst uzasadnienia przed odpowiedzią. Nie oszczędza pieniędzy – modelka nadal myśli, tokeny są naliczane |
Tekst uzasadnienia (jeśli nie jest ukryty) zwracany jest do message.reasoning / message.reasoning_details.
Cechy modeli
Zweryfikowano za pomocą zapytań na żywo za pośrednictwem NordRouter:
| Model | Zachowanie |
|---|---|
anthropic/claude-sonnet-5 | Domyślnie nie rozumuje. effort i max_tokens umożliwiają myślenie, enabled: false szczerze wyłącza |
anthropic/claude-fable-5 | Myśli adaptacyjne – ona decyduje ile. Parametry reasoning.* nie są obsługiwane (będzie 400); kontrolowana głębokość output_config: { "effort": "low" | "medium" | "high" } |
openai/gpt-5.4, gpt-5.5 | Powód domyślny; reasoning_effort skaluje głębokość |
x-ai/grok-4.3 | Powody domyślnie i dobrowolnie (setki tokenów); effort: "low" zauważalnie skraca |
deepseek/deepseek-r1, z-ai/glm-5.x | Zawsze myślą: „wyłączenie” tylko ukrywa tekst, tokeny rozumowania są nadal naliczane |
Jak oszczędzać
- Wstaw
effort: "low"na prostych zadaniach dla GPT/Grok - jakość nie ucierpi, zużycie znacznie spada. - Nie włączaj niepotrzebnego myślenia o Claude’u – Sonnet-5 domyślnie odpowiada bez uzasadnienia i jest tańszy.
- Limit
max_tokens— jest to sztywny pułap wszystkich wyników, łącznie z rozumowaniem. - Nie używaj
exclude, aby zaoszczędzić pieniądze - powoduje to jedynie ukrycie tekstu i nie zwraca pieniędzy. - Na rutynę weź nieoceniające modele (
deepseek-chat-v3.1,gemini-3.5-flash) - zobacz aktualnyusage, a nie tylko cennik.