Penalaran (mode penalaran)
Model modern dapat “berpikir” sebelum menjawab—menghasilkan rantai penalaran internal (reasoning). Hal ini secara signifikan meningkatkan kualitas pada tugas-tugas kompleks (matematika, kode, logika multi-langkah), tetapi menggunakan token tambahan. NordRouter secara transparan melewatkan semua parameter kontrol penalaran standar - tidak ada yang perlu dikonfigurasi secara khusus.
Bagaimana pengaruhnya terhadap penagihan?
Hanya ada satu aturan: token penalaran dibebankan sebagai token penarikan reguler - dengan harga keluarnya model darikatalog.
- Di jawabannya sudah disertakan di
usage.completion_tokens. - Mereka dapat dilihat secara terpisah di
usage.completion_tokens_details.reasoning_tokens.
"usage": {
"prompt_tokens": 179,
"completion_tokens": 545, // всего вывода — это и биллится
"completion_tokens_details": {
"reasoning_tokens": 445 // из них на рассуждения
}
}Model penalaran lebih mahal dari yang terlihat
DeepSeek R1, Grok, GLM, dan model penalaran lainnya berpikir secara default - jawaban atas pertanyaan sederhana dapat menghabiskan biaya token 5-10 kali lebih banyak daripada teks yang terlihat. Bandingkan bukan harga per token, tetapi konsumsi aktual di usage.
Bagaimana cara mengelolanya
Melalui objek reasoning di badan permintaan (opsi klasik OpenAI reasoning_effort: "low" | "medium" | "high" juga berfungsi):
curl https://nordrouter.com/v1/chat/completions \
-H "Authorization: Bearer sk-nr-ВАШ-КЛЮЧ" \
-H "Content-Type: application/json" \
-d '{
"model": "anthropic/claude-sonnet-5",
"max_tokens": 4000,
"reasoning": { "effort": "high" },
"messages": [{ "role": "user", "content": "Сложная задача…" }]
}'| Parameter | Apa yang dilakukan |
|---|---|
reasoning.effort | Kedalaman penalaran: "low" / "medium" / "high". Lebih sedikit usaha berarti lebih sedikit token penalaran dan respons yang lebih murah |
reasoning.max_tokens | Anggaran untuk penalaran dalam token (gaya Anthropic). Harus kurang dari max_tokens permintaan |
reasoning.enabled: false | Matikan penalaran (jika model mendukungnya) |
reasoning.exclude: true | Sembunyikan teks alasan dari jawaban. Tidak menghemat uang - model masih berpikir, token dikenakan biaya |
Teks alasannya (jika tidak disembunyikan) dikembalikan ke message.reasoning / message.reasoning_details.
Fitur model
Diverifikasi oleh pertanyaan langsung melalui NordRouter:
| Model | Perilaku |
|---|---|
anthropic/claude-sonnet-5 | Tidak beralasan secara default. effort dan max_tokens mengaktifkan pemikiran, enabled: false dengan jujur menonaktifkan |
anthropic/claude-fable-5 | Berpikir adaptif - dia memutuskan berapa banyak. Parameter reasoning.* tidak didukung (akan menjadi 400); kedalaman terkontrol output_config: { "effort": "low" | "medium" | "high" } |
openai/gpt-5.4, gpt-5.5 | Alasan secara default; reasoning_effort menskalakan kedalaman |
x-ai/grok-4.3 | Alasan secara default dan sukarela (ratusan token); effort: "low" secara nyata memperpendek |
deepseek/deepseek-r1, z-ai/glm-5.x | Mereka selalu berpikir: "mematikan" hanya menyembunyikan teks, token penalaran masih dikenakan biaya |
Bagaimana cara menyimpan
- Gunakan
effort: "low"pada tugas sederhana untuk GPT/Grok - kualitasnya tidak menurun, konsumsi turun secara signifikan. - Jangan terlalu memikirkan Claude jika tidak perlu - soneta-5 merespons secara default tanpa alasan dan lebih murah.
- Batasi
max_tokens- ini adalah batas maksimum pada semua keluaran, termasuk penalaran. - Jangan gunakan
excludeuntuk menghemat uang - ini hanya menyembunyikan teks dan tidak mengembalikan uang. - Untuk rutinitas, ambil model yang tidak menghakimi (
deepseek-chat-v3.1,gemini-3.5-flash) - lihatusageyang sebenarnya, dan bukan hanya daftar harga.