Skip to content

Зрозумілості (результування)

Сучасні моделі вміють думати перед відповідддю, створюючи внутрішню ланцюжку розсуджень, що значно підвищує якість складних завдань (математика, код, багатоступенчата логіка), але витрачає додаткові токи. NordRouter пропускає всі стандартні параметри управління розсудження, не потрібно нічого спеціально налаштувати.

Як це впливає на білінг?

Правило одне: развісно-токенів тарифірують як звичайні токенів виведення за ціною виходу моделі зкаталог каталогу.

  • У відповідь вони вже включені в usage.completion_tokens.
  • Особно їх можна побачити в usage.completion_tokens_details.reasoning_tokens.
json
"usage": {
  "prompt_tokens": 179,
  "completion_tokens": 545,          // всего вывода — это и биллится
  "completion_tokens_details": {
    "reasoning_tokens": 445          // из них на рассуждения
  }
}

Моделі розсуддя дорожчі, ніж здаються.

DeepSeek R1, Grok, GLM та інші моделі розсуддя думають за замовчуванням на простий запитання відповідь може коштувати в 510 разів більше токенів, ніж видимий текст. usage.

Як керувати

Через об'єкт reasoning в тілі запиту (працює і класичний OpenAI-вариант reasoning_effort: "low" | "medium" | "high"):

bash
curl https://nordrouter.com/v1/chat/completions \
  -H "Authorization: Bearer sk-nr-ВАШ-КЛЮЧ" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "anthropic/claude-sonnet-5",
    "max_tokens": 4000,
    "reasoning": { "effort": "high" },
    "messages": [{ "role": "user", "content": "Сложная задача…" }]
  }'
ПараметрЩо робить
reasoning.effortГлубина роздумів: "low" / "medium" / "high". Менше зусиль менше роздумів-токенів і дешевше відповідь
reasoning.max_tokensБюджет на розваги в токенах (стиль ) Anthropic) має бути менше max_tokens Запитання
reasoning.enabled: falseВиключити розсуд (де модель це підтримує)
reasoning.exclude: trueСховати текст роздумів з відповіді. Не заощаджує грошей Модель все одно думає, токенів тарифірують

Текст роздумів (якщо не прихований) повертається в message.reasoning / message.reasoning_details.

Особливості моделей

Проверене живими запитами через NordRouter::

МодельПоведіння
anthropic/claude-sonnet-5По замовчуванням не розмовляє. effort і max_tokens включають мислення, enabled: false чесно виключає
anthropic/claude-fable-5Дуже адаптивно сам вирішує, скільки. Параметри reasoning.* не підтримуються (буде 400); глибина управляється output_config: { "effort": "low" | "medium" | "high" }
openai/gpt-5.4, gpt-5.5По замовчуванням розсуджуються; reasoning_effort масштабує глибину
x-ai/grok-4.3Разумовляє за замовчуванням і охоче (стотин токенів); effort: "low" помітно скорочує
deepseek/deepseek-r1, z-ai/glm-5.xДумати завжди: включення тільки приховає текст, токенів розсуддя все одно тарифіруються

Як заощадити?

  1. Поставте effort: "low" на прості завдання для GPT/Grok якість не страждає, витрати падають в кілька разів.
  2. Не включайте беззахисні думки на Клод сонет-5 замовчуванням відповідає без роздумів і дешевше.
  3. Ограничити max_tokens це жорсткий потолок на весь висновок, включаючи розсуд.
  4. Не використовуйте exclude для економії він лише приховує текст, гроші не повертаються.
  5. Для рутинної виписки нерозсудливих моделей (deepseek-chat-v3.1, gemini-3.5-flash) подивіться на фактичний usage, а не тільки на ціну.