Skip to content

Penalaran (mode penalaran)

Model modern dapat “berpikir” sebelum menjawab—menghasilkan rantai penalaran internal (reasoning). Hal ini secara signifikan meningkatkan kualitas pada tugas-tugas kompleks (matematika, kode, logika multi-langkah), tetapi menggunakan token tambahan. NordRouter secara transparan melewatkan semua parameter kontrol penalaran standar - tidak ada yang perlu dikonfigurasi secara khusus.

Bagaimana pengaruhnya terhadap penagihan?

Hanya ada satu aturan: token penalaran dibebankan sebagai token penarikan reguler - dengan harga keluarnya model darikatalog.

  • Di jawabannya sudah disertakan di usage.completion_tokens.
  • Mereka dapat dilihat secara terpisah di usage.completion_tokens_details.reasoning_tokens.
json
"usage": {
  "prompt_tokens": 179,
  "completion_tokens": 545,          // всего вывода — это и биллится
  "completion_tokens_details": {
    "reasoning_tokens": 445          // из них на рассуждения
  }
}

Model penalaran lebih mahal dari yang terlihat

DeepSeek R1, Grok, GLM, dan model penalaran lainnya berpikir secara default - jawaban atas pertanyaan sederhana dapat menghabiskan biaya token 5-10 kali lebih banyak daripada teks yang terlihat. Bandingkan bukan harga per token, tetapi konsumsi aktual di usage.

Bagaimana cara mengelolanya

Melalui objek reasoning di badan permintaan (opsi klasik OpenAI reasoning_effort: "low" | "medium" | "high" juga berfungsi):

bash
curl https://nordrouter.com/v1/chat/completions \
  -H "Authorization: Bearer sk-nr-ВАШ-КЛЮЧ" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "anthropic/claude-sonnet-5",
    "max_tokens": 4000,
    "reasoning": { "effort": "high" },
    "messages": [{ "role": "user", "content": "Сложная задача…" }]
  }'
ParameterApa yang dilakukan
reasoning.effortKedalaman penalaran: "low" / "medium" / "high". Lebih sedikit usaha berarti lebih sedikit token penalaran dan respons yang lebih murah
reasoning.max_tokensAnggaran untuk penalaran dalam token (gaya Anthropic). Harus kurang dari max_tokens permintaan
reasoning.enabled: falseMatikan penalaran (jika model mendukungnya)
reasoning.exclude: trueSembunyikan teks alasan dari jawaban. Tidak menghemat uang - model masih berpikir, token dikenakan biaya

Teks alasannya (jika tidak disembunyikan) dikembalikan ke message.reasoning / message.reasoning_details.

Fitur model

Diverifikasi oleh pertanyaan langsung melalui NordRouter:

ModelPerilaku
anthropic/claude-sonnet-5Tidak beralasan secara default. effort dan max_tokens mengaktifkan pemikiran, enabled: false dengan jujur menonaktifkan
anthropic/claude-fable-5Berpikir adaptif - dia memutuskan berapa banyak. Parameter reasoning.* tidak didukung (akan menjadi 400); kedalaman terkontrol output_config: { "effort": "low" | "medium" | "high" }
openai/gpt-5.4, gpt-5.5Alasan secara default; reasoning_effort menskalakan kedalaman
x-ai/grok-4.3Alasan secara default dan sukarela (ratusan token); effort: "low" secara nyata memperpendek
deepseek/deepseek-r1, z-ai/glm-5.xMereka selalu berpikir: "mematikan" hanya menyembunyikan teks, token penalaran masih dikenakan biaya

Bagaimana cara menyimpan

  1. Gunakan effort: "low" pada tugas sederhana untuk GPT/Grok - kualitasnya tidak menurun, konsumsi turun secara signifikan.
  2. Jangan terlalu memikirkan Claude jika tidak perlu - soneta-5 merespons secara default tanpa alasan dan lebih murah.
  3. Batasi max_tokens - ini adalah batas maksimum pada semua keluaran, termasuk penalaran.
  4. Jangan gunakan exclude untuk menghemat uang - ini hanya menyembunyikan teks dan tidak mengembalikan uang.
  5. Untuk rutinitas, ambil model yang tidak menghakimi (deepseek-chat-v3.1, gemini-3.5-flash) - lihat usage yang sebenarnya, dan bukan hanya daftar harga.