Зрозумілості (результування)
Сучасні моделі вміють думати перед відповідддю, створюючи внутрішню ланцюжку розсуджень, що значно підвищує якість складних завдань (математика, код, багатоступенчата логіка), але витрачає додаткові токи. NordRouter пропускає всі стандартні параметри управління розсудження, не потрібно нічого спеціально налаштувати.
Як це впливає на білінг?
Правило одне: развісно-токенів тарифірують як звичайні токенів виведення за ціною виходу моделі зкаталог каталогу.
- У відповідь вони вже включені в
usage.completion_tokens. - Особно їх можна побачити в
usage.completion_tokens_details.reasoning_tokens.
"usage": {
"prompt_tokens": 179,
"completion_tokens": 545, // всего вывода — это и биллится
"completion_tokens_details": {
"reasoning_tokens": 445 // из них на рассуждения
}
}Моделі розсуддя дорожчі, ніж здаються.
DeepSeek R1, Grok, GLM та інші моделі розсуддя думають за замовчуванням на простий запитання відповідь може коштувати в 510 разів більше токенів, ніж видимий текст. usage.
Як керувати
Через об'єкт reasoning в тілі запиту (працює і класичний OpenAI-вариант reasoning_effort: "low" | "medium" | "high"):
curl https://nordrouter.com/v1/chat/completions \
-H "Authorization: Bearer sk-nr-ВАШ-КЛЮЧ" \
-H "Content-Type: application/json" \
-d '{
"model": "anthropic/claude-sonnet-5",
"max_tokens": 4000,
"reasoning": { "effort": "high" },
"messages": [{ "role": "user", "content": "Сложная задача…" }]
}'| Параметр | Що робить |
|---|---|
reasoning.effort | Глубина роздумів: "low" / "medium" / "high". Менше зусиль менше роздумів-токенів і дешевше відповідь |
reasoning.max_tokens | Бюджет на розваги в токенах (стиль ) Anthropic) має бути менше max_tokens Запитання |
reasoning.enabled: false | Виключити розсуд (де модель це підтримує) |
reasoning.exclude: true | Сховати текст роздумів з відповіді. Не заощаджує грошей Модель все одно думає, токенів тарифірують |
Текст роздумів (якщо не прихований) повертається в message.reasoning / message.reasoning_details.
Особливості моделей
Проверене живими запитами через NordRouter::
| Модель | Поведіння |
|---|---|
anthropic/claude-sonnet-5 | По замовчуванням не розмовляє. effort і max_tokens включають мислення, enabled: false чесно виключає |
anthropic/claude-fable-5 | Дуже адаптивно сам вирішує, скільки. Параметри reasoning.* не підтримуються (буде 400); глибина управляється output_config: { "effort": "low" | "medium" | "high" } |
openai/gpt-5.4, gpt-5.5 | По замовчуванням розсуджуються; reasoning_effort масштабує глибину |
x-ai/grok-4.3 | Разумовляє за замовчуванням і охоче (стотин токенів); effort: "low" помітно скорочує |
deepseek/deepseek-r1, z-ai/glm-5.x | Думати завжди: включення тільки приховає текст, токенів розсуддя все одно тарифіруються |
Як заощадити?
- Поставте
effort: "low"на прості завдання для GPT/Grok якість не страждає, витрати падають в кілька разів. - Не включайте беззахисні думки на Клод сонет-5 замовчуванням відповідає без роздумів і дешевше.
- Ограничити
max_tokensце жорсткий потолок на весь висновок, включаючи розсуд. - Не використовуйте
excludeдля економії він лише приховує текст, гроші не повертаються. - Для рутинної виписки нерозсудливих моделей (
deepseek-chat-v3.1,gemini-3.5-flash) подивіться на фактичнийusage, а не тільки на ціну.